OpenAI
页面内容为机器翻译。查看英文原文。

快速模式常见问题

关于快速模式和超快速服务层级的常见问题解答。

更新于:2 days ago

我们为希望在部分模型上获得更快、更稳定性能的 API 客户提供快速模式。以下是有关其工作方式、定价、模型可用性、速率限制、可靠性、政策和使用资格等常见问题的解答。

注意:Priority processing 已于 2026 年 7 月 30 日更名为快速模式。您可以在 API 请求中使用 service_tier: priority 或 service_tier: fast。 

点击此处了解详情。

快速模式是否在所有地区均可用?

快速模式的可用性取决于各司法管辖区适用的法律法规。如果您对所在地区的可用性有任何疑问,请联系您的客户总监。

运作方式

客户可使用现有的 service_tier 参数,将其设置为 service_tier = "fast",从而按请求将流量发送至快速模式。

快速模式处理的 Token 按 Token 数量计费,单价高于标准处理。

除了按请求配置,你还可以在“项目设置 > 默认服务层级:快速”中,将快速模式设为项目的默认模式。你仍可针对单个请求覆盖此设置。在项目设置中选择“快速”等同于选择“优先”。

快速模式与规模层级有什么关系?

规模层级将继续独立于快速模式。发送至快速模式的请求将单独计费,不会消耗你已购买的规模层级 TPM 套餐配额。

超出规模层级配额的流量能否自动转入快速模式?

不能。发送至规模层级的流量在超出配额后,不会自动转入快速模式。

快速模式如何计费?

快速模式处理的 Token 按 Token 数量计费,单价高于标准处理。

我的年度消费承诺是否与特定处理模式绑定?

不绑定。所有处理模式的费用都会计入企业协议约定的年度消费承诺。

缓存输入 Token 仍然享有折扣吗?

是的!与标准处理一样,缓存输入可享受 50%–75% 的费用减免。

如何查看快速模式的用量和费用?

要查看快速模式(原称优先处理)处理的 Token 数量,请前往用量仪表板,选择 Chat Completions 或 Responses,然后按服务层级分组。

要查看快速模式的费用,请前往用量仪表板,选择按费用明细项分组。

在用量仪表板上,service_tier 为 priority 或 fast 的请求仍会显示为 priority。未来推出新模型时,这一显示方式将会更新。

模型

快速模式是否支持长上下文、微调模型、嵌入等功能?

目前不支持。未来,我们将评估是否为最新模型以外的其他产品提供快速模式。

快速模式如何支持其他模态?

快速模式支持与标准处理相同的多模态功能。具体而言,图像可作为优先处理的输入,并享有同样低的处理延迟。

未来的模型会获得支持吗?

我们计划为新的 GPT 模型提供快速模式,但不保证每个模型都受支持。

速率限制

速率限制是什么?

在计算速率限制时,优先处理用量与标准 API 流量一视同仁。

用量速率限制是什么?

快速模式设有用量速率限制,以确保所有客户都能持续享有高性能服务,同时保持灵活的按需定价。如果同时出现以下两种情况:(a) 快速模式的性能下降,且 (b) 客户的流量增长过快,那么在极少数情况下,部分请求可能会降级为标准处理。

当前快速模式的用量速率限制详见此处的主要文档。

避免超出用量速率限制的最佳实践

更换模型时,逐步增加流量。例如,如果你的应用正在从旧快照切换到新快照,请使用功能标志,在几个小时内逐步切换流量,而不是一次性全部切换。

避免在快速模式下运行大规模数据处理任务或异步任务。这些任务可能导致流量快速增长,而且通常不需要快速模式带来的性能提升。

如果你经常触及用量速率限制,可以考虑改为购买规模层级配额。

我的各个项目或组织是否共用用量速率限制?

是的,你的所有流量都会计入同一个用量速率限制。

政策

如果快速模式未达到延迟目标,会怎样?

如有任何疑问或顾虑,请联系你的客户总监(AD)。快速模式的 SLA 与规模层级的 SLA 将按相同方式处理;如果在指定时间段内,我们未能为签订企业协议的客户达到这些 SLA 的要求,将提供服务抵扣额度。

快速模式是否兼容数据驻留?

是的。

快速模式是否兼容 ZDR 和 BAA?

是的。

GPT-6 Astra 的超快速层级

超快速是一个独立的服务层级,适用于需要 GPT-6 Astra 以更低延迟响应的工作负载,例如交互式应用和编程工作流。

快速模式的定价、速率限制和政策说明适用于使用 service_tier="fast" 的请求。超快速请求使用独立的 service_tier="ultrafast" 层级。

如何发送超快速请求?

如果组织已获超快速访问权限,请使用 Responses API,并按以下方式配置:

  • 模型:gpt-6-astra

  • 服务层级:ultrafast

  • 请求头:OpenAI-Service-Tier: ultrafast

除了设置服务层级,还必须添加此请求头。

对于执行工具调用的应用,WebSocket 模式可让你在多轮交互中复用连接,减少连接开销。

其他服务层级可以使用同一个请求头吗?

在超快速层级的 Alpha 测试期间,OpenAI-Service-Tier 请求头仅接受 ultrafast。发送其他值(包括 default、fast 或 flex)会返回 HTTP 400 错误。使用其他层级时,请勿添加此请求头。

我可以在工作模式或 Codex 中使用超快速吗?

符合条件的套餐和工作区也可在工作模式和 Codex 中使用超快速。ChatGPT 套餐的使用资格和用量规则与 API 访问有所不同。

有关可用范围和用量的详情,请参阅 ChatGPT 工作和 Codex。

这篇文章对你有帮助吗?