OpenAI
Esta página se tradujo automáticamente. Ver el artículo original en inglés.

Preguntas frecuentes sobre el Modo rápido

Preguntas frecuentes sobre el Modo rápido y el nivel de servicio Ultrafast.

Última actualización: 5 days ago

Ofrecemos el Modo rápido a los clientes de la API que buscan un rendimiento más veloz y uniforme en determinados modelos. A continuación, respondemos preguntas frecuentes sobre su funcionamiento, precios, disponibilidad de modelos, límites de solicitudes, confiabilidad, políticas y requisitos.

Nota: el procesamiento prioritario pasó a llamarse Modo rápido el 30 de julio de 2026. Puedes usar service_tier: priority o service_tier: fast en tus solicitudes a la API. 

Obtén más información aquí.

¿El Modo rápido está disponible en todas las regiones?

La disponibilidad del Modo rápido depende de las leyes y normativas aplicables en cada jurisdicción. Si tienes preguntas sobre la disponibilidad en tu región, comunícate con tu director de cuenta.

Cómo funciona

Los clientes pueden dirigir el tráfico al Modo rápido en cada solicitud mediante el parámetro existente service_tier, con la opción service_tier = "fast".

Los tokens procesados por el Modo rápido se facturarán por token, a una tarifa superior a la del procesamiento estándar.

Además de configurarlo para cada solicitud, también puedes establecer el Modo rápido como predeterminado para un proyecto en Configuración del proyecto > Nivel de servicio predeterminado: rápido. Aun así, puedes cambiar esta opción en cada solicitud. Seleccionar Rápido en la configuración de tu proyecto equivale a seleccionar Prioritario.

¿Cómo se relaciona esto con el Nivel de capacidad?

El Nivel de capacidad seguirá siendo independiente del Modo rápido. Las solicitudes enviadas al Modo rápido se facturarán por separado y no consumirán los paquetes de TPM que hayas adquirido en el Nivel de capacidad.

¿Puedo enviar automáticamente al Modo rápido el tráfico que exceda mi Nivel de capacidad?

No. El tráfico que exceda el Nivel de capacidad no se transferirá automáticamente al Modo rápido.

¿Cómo se factura el Modo rápido?

Los tokens procesados por el Modo rápido se facturarán por token, a una tarifa superior a la del procesamiento estándar.

¿Mi compromiso anual está vinculado a un modo de procesamiento específico?

No. Todos los modos de procesamiento cuentan para tu compromiso de gasto anual de Enterprise.

¿Sigo recibiendo un descuento en los tokens de entrada en caché?

¡Sí! Las entradas en caché reciben el mismo descuento del 50 al 75 % que en el procesamiento estándar.

¿Cómo consulto mi uso y gasto del Modo rápido?

Para ver los tokens procesados por el Modo rápido (antes llamado procesamiento prioritario), ve al panel de uso, selecciona Chat Completions o Responses y agrupa por nivel de servicio.

Para ver el costo del Modo rápido, ve al panel de uso y selecciona Agrupar por partida.

En el panel de uso, las solicitudes que usen priority o fast como valor de service_tier seguirán apareciendo como priority. Esto se actualizará para los modelos futuros.

Modelos

¿El Modo rápido está disponible para contextos largos, modelos con ajuste fino, embeddings, etc.?

Por el momento, no. En el futuro, evaluaremos si ofrecer el Modo rápido en otros productos, además de nuestros modelos más recientes.

¿Cómo funcionan otras modalidades con el Modo rápido?

El Modo rápido admite las mismas capacidades multimodales disponibles en el procesamiento estándar. En particular, las imágenes se pueden usar como entradas para el procesamiento prioritario y se procesan con la misma baja latencia.

¿Se admitirán modelos futuros?

Planeamos ofrecer el Modo rápido en los nuevos modelos GPT, pero no garantizamos que todos los modelos sean compatibles.

Límites de solicitudes

¿Cuáles son los límites de solicitudes?

Para los límites de solicitudes, el consumo del procesamiento prioritario se trata igual que el tráfico estándar de la API.

¿Cuáles son los límites de ramp rate?

El Modo rápido tiene límites de ramp rate para garantizar un rendimiento alto y constante para todos los clientes, sin dejar de ofrecer precios flexibles bajo demanda. Si (a) el rendimiento del Modo rápido se degrada Y (b) el tráfico de un cliente aumenta demasiado rápido, en casos excepcionales algunas solicitudes podrían pasar al procesamiento estándar.

El límite de ramp rate actual del Modo rápido se define aquí, en nuestra documentación principal.

Prácticas recomendadas para no superar tu límite de ramp rate

Aumenta el tráfico gradualmente cuando cambies de modelo. Por ejemplo, si tu aplicación está pasando de una versión anterior a una nueva, usa una bandera de función para transferir el tráfico a lo largo de unas horas, en lugar de hacerlo todo de una vez.

Evita ejecutar tareas de procesamiento de grandes volúmenes de datos o tareas asíncronas en el Modo rápido. Estas tareas pueden aumentar el tráfico muy rápido y, a menudo, no necesitan el rendimiento mejorado del Modo rápido.

Si alcanzas con frecuencia los límites de ramp rate, considera adquirir una cuota del Nivel de capacidad como alternativa.

¿Los límites de ramp rate se comparten entre mis proyectos u organizaciones?

Sí, todo tu tráfico se contabiliza para el mismo límite de ramp rate.

Políticas

¿Qué ocurre si el Modo rápido no cumple con el objetivo de latencia?

Ponte en contacto con tu AD si tienes alguna pregunta o inquietud. Los SLA del Modo rápido se tratarán igual que los del Nivel de capacidad; se ofrecerán créditos de servicio si no cumplimos esos SLA para los clientes con contratos Enterprise durante un período determinado.

¿El Modo rápido es compatible con la residencia de datos?

Sí.

¿El Modo rápido es compatible con ZDR y el BAA?

Sí.

Ultrafast para GPT-6 Astra

Ultrafast es un nivel de servicio independiente para cargas de trabajo que necesitan respuestas de GPT-6 Astra con menor latencia, como las aplicaciones interactivas y los flujos de trabajo de programación.

La información sobre precios, límites de solicitudes y políticas del Modo rápido se aplica a las solicitudes que usan service_tier="fast". Las solicitudes de Ultrafast usan el nivel independiente service_tier="ultrafast".

¿Cómo envío una solicitud de Ultrafast?

Para una organización con acceso a Ultrafast, usa la API de Responses con:

  • Modelo: gpt-6-astra

  • Nivel de servicio: ultrafast

  • Encabezado de solicitud: OpenAI-Service-Tier: ultrafast

El encabezado de solicitud es obligatorio, además de la configuración del nivel de servicio.

Para las aplicaciones que ejecutan llamadas a herramientas, el modo WebSocket te permite reutilizar una conexión entre turnos y reducir la sobrecarga de conexión.

¿Puedo usar el mismo encabezado de solicitud para otros niveles de servicio?

Durante la fase alfa de Ultrafast, el encabezado OpenAI-Service-Tier solo acepta ultrafast. Enviar otro valor, incluidos default, fast o flex, devuelve un error HTTP 400. Omite este encabezado cuando uses otro nivel.

¿Puedo usar Ultrafast en Work o Codex?

Ultrafast también está disponible en Work y Codex para los planes y espacios de trabajo que cumplen los requisitos. Los requisitos de los planes de ChatGPT y sus condiciones de uso difieren de los del acceso a la API.

Consulta ChatGPT Work y Codex para conocer los detalles de disponibilidad y uso.

¿Este artículo te fue útil?