OpenAI
Esta página se tradujo automáticamente. Ver el artículo original en inglés.

Preguntas frecuentes sobre el Modo rápido

Preguntas frecuentes sobre el Modo rápido y el nivel de servicio Ultrafast.

Actualización: 3 days ago

Ofrecemos el Modo rápido a los clientes de la API que buscan un rendimiento más rápido y estable en determinados modelos. A continuación, respondemos a preguntas frecuentes sobre su funcionamiento, precios, disponibilidad de modelos, límites de solicitudes, fiabilidad, políticas y requisitos.

Nota: el 30 de julio de 2026, el procesamiento prioritario pasó a llamarse Modo rápido. Puedes usar tanto service_tier: priority como service_tier: fast en tus solicitudes a la API. 

Obtén más información aquí.

¿Está disponible el Modo rápido en todas las regiones?

La disponibilidad del Modo rápido depende de las leyes y normativas aplicables en cada jurisdicción. Si tienes alguna pregunta sobre la disponibilidad en tu región, ponte en contacto con tu director de cuenta.

Cómo funciona

Los clientes pueden dirigir el tráfico al Modo rápido en cada solicitud mediante el parámetro existente service_tier, con la opción service_tier = "fast".

Los tokens procesados por el Modo rápido se facturarán por token, a un precio superior al del procesamiento estándar.

Además de configurarlo en cada solicitud, también puedes establecer el Modo rápido como opción predeterminada de un proyecto en Configuración del proyecto > Nivel de servicio predeterminado: rápido. Podrás seguir cambiando esta opción en cada solicitud. Seleccionar Rápido en la configuración de tu proyecto equivale a seleccionar Prioritario.

¿Cómo se relaciona con el Nivel de capacidad?

El Nivel de capacidad seguirá siendo independiente del Modo rápido. Las solicitudes enviadas al Modo rápido se facturarán por separado y no consumirán los paquetes de TPM que hayas adquirido para el Nivel de capacidad.

¿Puedo enviar automáticamente al Modo rápido el tráfico que exceda mi cuota del Nivel de capacidad?

No. El tráfico enviado al Nivel de capacidad no se desviará automáticamente al Modo rápido si se supera la cuota.

¿Cómo se factura el Modo rápido?

Los tokens procesados por el Modo rápido se facturarán por token, a un precio superior al del procesamiento estándar.

¿Está vinculado mi compromiso anual a un modo de procesamiento específico?

No. Todos los modos de procesamiento cuentan para cumplir tu compromiso de gasto anual de Enterprise.

¿Sigo teniendo un descuento en los tokens de entrada en caché?

¡Sí! Las entradas en caché tienen el mismo descuento del 50-75 % que en el procesamiento estándar.

¿Cómo consulto mi uso y gasto del Modo rápido?

Para ver los tokens procesados por el Modo rápido (antes llamado procesamiento prioritario), ve al panel de uso, selecciona Chat Completions o Responses y agrupa por nivel de servicio.

Para ver el coste del Modo rápido, ve al panel de uso y selecciona Agrupar por partida.

En el panel de uso, las solicitudes que usen priority o fast como valor de service_tier seguirán apareciendo como priority. Esto se actualizará para los modelos futuros.

Modelos

¿Está disponible el Modo rápido para contextos largos, modelos ajustados, embeddings, etc.?

Por ahora, no. En el futuro evaluaremos si ofrecemos el Modo rápido en otros productos, además de nuestros modelos más recientes.

¿Cómo funcionan las otras modalidades con el Modo rápido?

El Modo rápido admite las mismas capacidades multimodales que el procesamiento estándar. En concreto, las imágenes se pueden usar como entradas en el procesamiento prioritario y se procesan con la misma baja latencia.

¿Se admitirán los modelos futuros?

Tenemos previsto ofrecer el Modo rápido en los nuevos modelos GPT, pero no garantizamos que todos los modelos sean compatibles.

Límites de solicitudes

¿Cuáles son los límites de solicitudes?

A efectos de los límites de solicitudes, el consumo del procesamiento prioritario se trata igual que el tráfico estándar de la API.

¿Cuáles son los límites de velocidad de aumento?

El Modo rápido tiene límites de velocidad de aumento para garantizar un alto rendimiento constante para todos los clientes, sin dejar de ofrecer precios flexibles bajo demanda. Si (a) el rendimiento del Modo rápido se degrada Y (b) el tráfico de un cliente aumenta demasiado rápido, en casos excepcionales algunas solicitudes pueden pasar al procesamiento estándar.

El límite actual de velocidad de aumento del Modo rápido se define aquí, en nuestra documentación principal.

Buenas prácticas para no superar tu límite de velocidad de aumento

Aumenta el tráfico gradualmente al cambiar de modelo. Por ejemplo, si tu aplicación está pasando de una versión anterior del modelo a una nueva, usa un indicador de funcionalidad para transferir el tráfico a lo largo de unas horas, en lugar de hacerlo todo de golpe.

Evita ejecutar tareas de procesamiento de grandes volúmenes de datos o tareas asíncronas en el Modo rápido. Estas tareas pueden aumentar el tráfico muy deprisa y a menudo no necesitan el rendimiento mejorado del Modo rápido.

Si alcanzas con frecuencia los límites de velocidad de aumento, considera adquirir una cuota del Nivel de capacidad como alternativa.

¿Se comparten los límites de velocidad de aumento entre mis proyectos u organizaciones?

Sí, todo tu tráfico cuenta para el mismo límite de velocidad de aumento.

Políticas

¿Qué ocurre si el Modo rápido no cumple el objetivo de latencia?

Ponte en contacto con tu director de cuentas si tienes alguna pregunta o inquietud. Los acuerdos de nivel de servicio (SLA) del Modo rápido se tratarán igual que los del Nivel de capacidad; si no cumplimos esos acuerdos durante un periodo determinado, ofreceremos créditos de servicio a los clientes con contratos Enterprise.

¿Es compatible el Modo rápido con la residencia de datos?

Sí.

¿Es compatible el Modo rápido con ZDR y el BAA?

Sí.

Ultrafast para GPT-6 Astra

Ultrafast es un nivel de servicio independiente para cargas de trabajo que necesitan respuestas de GPT-6 Astra con menor latencia, como las aplicaciones interactivas y los flujos de trabajo de programación.

Las indicaciones sobre precios, límites de solicitudes y políticas del Modo rápido se aplican a las solicitudes que usan service_tier="fast". Las solicitudes de Ultrafast usan el nivel independiente service_tier="ultrafast".

¿Cómo envío una solicitud de Ultrafast?

Si tu organización tiene acceso a Ultrafast, usa la API de Responses con estos parámetros:

  • Modelo: gpt-6-astra

  • Nivel de servicio: ultrafast

  • Cabecera de solicitud: OpenAI-Service-Tier: ultrafast

La cabecera de solicitud es obligatoria, además de la configuración del nivel de servicio.

En las aplicaciones que ejecutan llamadas a herramientas, el modo WebSocket te permite reutilizar una conexión en varios turnos y reducir la sobrecarga de conexión.

¿Puedo usar la misma cabecera de solicitud para otros niveles de servicio?

Durante la fase alfa de Ultrafast, la cabecera OpenAI-Service-Tier solo acepta ultrafast. Si envías otro valor, incluidos default, fast o flex, se devuelve un error HTTP 400. Omite esta cabecera cuando uses otro nivel.

¿Puedo usar Ultrafast en Work o Codex?

Ultrafast también está disponible en Work y Codex para los planes y espacios de trabajo que cumplan los requisitos. Los requisitos de acceso y las condiciones de uso de los planes de ChatGPT difieren de los de la API.

Consulta ChatGPT Work y Codex para obtener información sobre la disponibilidad y el uso.

¿Te ha resultado útil este artículo?