OpenAI
Esta página se tradujo automáticamente. Ver el artículo original en inglés.

Preguntas frecuentes sobre el Modo rápido

Preguntas frecuentes sobre el Modo rápido

Última actualización: 3 days ago

Ofrecemos el Modo rápido a los clientes de la API que buscan un rendimiento más veloz y uniforme en determinados modelos. A continuación, respondemos preguntas frecuentes sobre su funcionamiento, precios, disponibilidad de modelos, límites de solicitudes, confiabilidad, políticas y requisitos.

Nota: el procesamiento prioritario pasó a llamarse Modo rápido el 30 de julio de 2026. Puedes usar service_tier: priority o service_tier: fast en tus solicitudes a la API. 

Obtén más información aquí.

¿El Modo rápido está disponible en todas las regiones?

La disponibilidad del Modo rápido depende de las leyes y normativas aplicables en cada jurisdicción. Si tienes preguntas sobre la disponibilidad en tu región, comunícate con tu director de cuenta.

Cómo funciona

Los clientes pueden dirigir el tráfico al Modo rápido en cada solicitud mediante el parámetro service_tier existente y la opción service_tier = "fast".

Los tokens procesados por el Modo rápido se facturarán por token, a un precio superior al de las tarifas del procesamiento estándar.

Además de configurarlo en cada solicitud, también puedes establecer el Modo rápido como opción predeterminada de un proyecto en Configuración del proyecto > Nivel de servicio predeterminado: Rápido. Aun así, puedes cambiar esta opción en cada solicitud. Seleccionar Rápido en la configuración del proyecto equivale a seleccionar Prioritario.

¿Cómo interactúa con el Nivel de capacidad?

El Nivel de capacidad seguirá siendo independiente del Modo rápido. Las solicitudes enviadas al Modo rápido se facturarán por separado y no se descontarán de los paquetes de TPM del Nivel de capacidad que hayas comprado.

¿Puedo enviar automáticamente al Modo rápido el tráfico que exceda mi Nivel de capacidad?

No. El tráfico enviado al Nivel de capacidad no se transferirá automáticamente al Modo rápido.

¿Cómo se factura el Modo rápido?

Los tokens procesados por el Modo rápido se facturarán por token, a un precio superior al de las tarifas del procesamiento estándar.

¿Mi compromiso anual está vinculado a un modo de procesamiento específico?

No. Todos los modos de procesamiento se contabilizan para tu compromiso anual de gasto de Enterprise.

¿Sigo recibiendo un descuento en los tokens de entrada almacenados en caché?

¡Sí! Las entradas almacenadas en caché reciben el mismo descuento del 50-75 % que con el procesamiento estándar.

¿Cómo consulto el uso y el gasto del Modo rápido?

Para consultar los tokens procesados por el Modo rápido (antes denominado Procesamiento prioritario), ve al panel Uso, selecciona Chat Completions o Responses y agrupa por Nivel de servicio.

Para consultar el costo del Modo rápido, ve al panel Uso y selecciona Agrupar por partida.

En el panel Uso, las solicitudes que usen priority o fast como service_tier seguirán apareciendo como priority. Esto se actualizará para modelos futuros.

Modelos

¿El Modo rápido está disponible para contextos largos, modelos con ajuste fino, embeddings y otros casos?

Por el momento, no. En el futuro, evaluaremos si ofrecemos el Modo rápido en otros productos además de nuestros modelos más recientes.

¿Cómo funcionan las demás modalidades con el Modo rápido?

El Modo rápido admite las mismas capacidades multimodales disponibles en el procesamiento estándar. En particular, las imágenes pueden usarse como entradas del Procesamiento prioritario y se procesan con la misma baja latencia.

¿Se admitirán modelos futuros?

Planeamos ofrecer el Modo rápido en nuevos modelos GPT, pero no garantizamos que sea compatible con todos los modelos.

Límites de solicitudes

¿Cuáles son los límites de solicitudes?

Para los límites de solicitudes, el consumo del Procesamiento prioritario se trata igual que el tráfico estándar de la API.

¿Cuáles son los límites de solicitudes durante aumentos de tráfico?

El Modo rápido aplica límites de solicitudes durante aumentos de tráfico para garantizar un rendimiento alto y uniforme a todos los clientes, sin dejar de ofrecer precios flexibles según la demanda. En casos excepcionales, si (a) disminuye el rendimiento del Modo rápido Y (b) el tráfico de un cliente aumenta demasiado rápido, algunas solicitudes podrían procesarse mediante el modo estándar.

El límite actual de solicitudes del Modo rápido durante aumentos de tráfico se define aquí, en nuestra documentación principal.

Prácticas recomendadas para respetar el límite de solicitudes durante aumentos de tráfico

Aumenta el tráfico gradualmente cuando cambies de modelo. Por ejemplo, si tu aplicación está migrando de una instantánea anterior a una nueva, usa una marca de función para transferir el tráfico a lo largo de varias horas, en lugar de hacerlo de una sola vez.

Evita ejecutar grandes tareas de procesamiento de datos o trabajos asincrónicos en el Modo rápido. Estas tareas pueden aumentar el tráfico muy rápido y, con frecuencia, no necesitan el rendimiento mejorado del Modo rápido.

Si alcanzas habitualmente los límites de solicitudes durante aumentos de tráfico, considera comprar una cuota del Nivel de capacidad.

¿Los límites de solicitudes durante aumentos de tráfico se comparten entre mis proyectos u organizaciones?

Sí, todo tu tráfico se contabiliza para el mismo límite de solicitudes durante aumentos de tráfico.

Políticas

¿Qué sucede si el Modo rápido no cumple el objetivo de latencia?

Si tienes alguna pregunta o inquietud, comunícate con tu director de cuenta. Los SLA del Modo rápido se tratarán igual que los SLA del Nivel de capacidad. Si no cumplimos esos SLA durante un período determinado, ofreceremos créditos de servicio a los clientes con contratos Enterprise.

¿El Modo rápido es compatible con la residencia de datos?

Sí.

¿El Modo rápido es compatible con ZDR y el BAA?

Sí.

¿Este artículo te fue útil?