我们为希望在部分模型上获得更快、更稳定性能的 API 客户提供快速模式。以下是有关其工作方式、定价、模型可用性、速率限制、可靠性、政策和使用资格的常见问题解答。
注意:优先处理已于 2026 年 7 月 30 日更名为快速模式。您可以在 API 请求中使用 service_tier: priority 或 service_tier: fast。
点击此处了解详情。
快速模式是否在所有地区都可用?
快速模式是否可用取决于各司法管辖区的适用法律法规。如果对您所在地区的可用性有疑问,请联系您的客户总监。
工作方式
客户可以使用现有的 service_tier 参数,并将选项设为 service_tier = "fast",按请求将流量定向到快速模式。
快速模式处理的 Token 按 Token 计费,价格高于标准处理费率。
除了在请求级别配置之外,您还可以在“项目设置 > 默认服务层级:快速”中将项目的默认模式设为快速模式。您仍可针对单个请求覆盖此设置。在项目设置中选择“快速”等同于选择“优先”。
快速模式与规模层级如何配合使用?
规模层级仍将与快速模式相互独立。发送到快速模式的请求将单独计费,且不会计入您购买的规模层级 TPM 套餐。
能否将规模层级的溢出流量自动发送到快速模式?
不能。发送到规模层级的流量不会自动溢出到快速模式。
快速模式如何计费?
快速模式处理的 Token 按 Token 计费,价格高于标准处理费率。
我的年度承诺是否与特定处理模式绑定?
不是。所有处理模式的支出都会计入您的企业版年度支出承诺。
缓存输入 Token 仍有折扣吗?
有!缓存输入可享受与标准处理相同的 50%–75% 折扣。
如何查看快速模式的用量和支出?
要查看快速模式(原称优先处理)处理的 Token,请前往“用量”控制面板,选择“聊天补全”或“响应”,然后按“服务层级”分组。
要查看快速模式的费用,请前往“用量”控制面板,然后选择按“明细项”分组。
在“用量”控制面板中,service_tier 使用 priority 或 fast 的请求仍将显示为 priority。未来的模型将更新这一显示方式。
模型
快速模式是否支持长上下文、微调模型、嵌入等功能?
目前不支持。未来,我们将评估是否为最新模型以外的其他产品提供快速模式。
其他模态如何与快速模式配合使用?
快速模式支持与标准模式相同的多模态功能。特别是,图像可以作为优先处理的输入,并以同样的低延迟速度进行处理。
未来的模型会受到支持吗?
我们计划为新的 GPT 模型提供快速模式,但不保证支持所有模型。
速率限制
速率限制是多少?
在速率限制方面,优先处理用量与标准 API 流量采用相同的处理方式。
流量增长速率限制是多少?
快速模式设有流量增长速率限制,以确保所有客户都能获得持续的高性能,同时仍提供灵活的按需定价。在极少数情况下,如果 (a) 快速模式性能下降,并且 (b) 客户流量增长过快,部分请求可能会降级为标准处理。
当前快速模式的流量增长速率限制见此处的主要文档。
不超过流量增长速率限制的最佳实践
更换模型时,请逐步增加流量。例如,如果您的应用要从先前的快照迁移到新快照,请使用功能开关,在数小时内逐步迁移流量,而不要一次性完成。
避免在快速模式下运行大型数据处理任务或异步作业。这些作业可能导致流量快速增长,而且通常不需要快速模式带来的性能提升。
如果您经常遇到流量增长速率限制,请考虑改为购买规模层级配额。
我的项目或组织是否共用流量增长速率限制?
是的,您的所有流量都计入同一流量增长速率限制。
政策
如果快速模式未达到延迟目标,会怎样处理?
如有任何问题或疑虑,请联系您的客户总监。快速模式 SLA 将与规模层级 SLA 采用相同的处理方式;如果我们在特定时间窗口内未能达到这些 SLA,将向签订企业版协议的客户提供服务额度。
快速模式是否与数据驻留兼容?
是。
快速模式是否与 ZDR 和 BAA 兼容?
是。
