OpenAI
页面内容为机器翻译。查看英文原文

快速模式常见问题

快速模式常见问题解答

更新于:2 days ago

我们为希望在部分模型上获得更快、更稳定性能的 API 客户提供快速模式。以下是有关其工作方式、定价、模型可用性、速率限制、可靠性、政策和使用资格的常见问题解答。

注意:优先处理已于 2026 年 7 月 30 日更名为快速模式。您可以在 API 请求中使用 service_tier: priority 或 service_tier: fast。 

点击此处了解详情。

快速模式是否在所有地区都可用?

快速模式是否可用取决于各司法管辖区的适用法律法规。如果对您所在地区的可用性有疑问,请联系您的客户总监。

工作方式

客户可以使用现有的 service_tier 参数,并将选项设为 service_tier = "fast",按请求将流量定向到快速模式。

快速模式处理的 Token 按 Token 计费,价格高于标准处理费率。

除了在请求级别配置之外,您还可以在“项目设置 > 默认服务层级:快速”中将项目的默认模式设为快速模式。您仍可针对单个请求覆盖此设置。在项目设置中选择“快速”等同于选择“优先”。

快速模式与规模层级如何配合使用?

规模层级仍将与快速模式相互独立。发送到快速模式的请求将单独计费,且不会计入您购买的规模层级 TPM 套餐。

能否将规模层级的溢出流量自动发送到快速模式?

不能。发送到规模层级的流量不会自动溢出到快速模式。

快速模式如何计费?

快速模式处理的 Token 按 Token 计费,价格高于标准处理费率。

我的年度承诺是否与特定处理模式绑定?

不是。所有处理模式的支出都会计入您的企业版年度支出承诺。

缓存输入 Token 仍有折扣吗?

有!缓存输入可享受与标准处理相同的 50%–75% 折扣。

如何查看快速模式的用量和支出?

要查看快速模式(原称优先处理)处理的 Token,请前往“用量”控制面板,选择“聊天补全”或“响应”,然后按“服务层级”分组。

要查看快速模式的费用,请前往“用量”控制面板,然后选择按“明细项”分组。

在“用量”控制面板中,service_tier 使用 priority 或 fast 的请求仍将显示为 priority。未来的模型将更新这一显示方式。

模型

快速模式是否支持长上下文、微调模型、嵌入等功能?

目前不支持。未来,我们将评估是否为最新模型以外的其他产品提供快速模式。

其他模态如何与快速模式配合使用?

快速模式支持与标准模式相同的多模态功能。特别是,图像可以作为优先处理的输入,并以同样的低延迟速度进行处理。

未来的模型会受到支持吗?

我们计划为新的 GPT 模型提供快速模式,但不保证支持所有模型。

速率限制

速率限制是多少?

在速率限制方面,优先处理用量与标准 API 流量采用相同的处理方式。

流量增长速率限制是多少?

快速模式设有流量增长速率限制,以确保所有客户都能获得持续的高性能,同时仍提供灵活的按需定价。在极少数情况下,如果 (a) 快速模式性能下降,并且 (b) 客户流量增长过快,部分请求可能会降级为标准处理。

当前快速模式的流量增长速率限制见此处的主要文档。

不超过流量增长速率限制的最佳实践

更换模型时,请逐步增加流量。例如,如果您的应用要从先前的快照迁移到新快照,请使用功能开关,在数小时内逐步迁移流量,而不要一次性完成。

避免在快速模式下运行大型数据处理任务或异步作业。这些作业可能导致流量快速增长,而且通常不需要快速模式带来的性能提升。

如果您经常遇到流量增长速率限制,请考虑改为购买规模层级配额。

我的项目或组织是否共用流量增长速率限制?

是的,您的所有流量都计入同一流量增长速率限制。

政策

如果快速模式未达到延迟目标,会怎样处理?

如有任何问题或疑虑,请联系您的客户总监。快速模式 SLA 将与规模层级 SLA 采用相同的处理方式;如果我们在特定时间窗口内未能达到这些 SLA,将向签订企业版协议的客户提供服务额度。

快速模式是否与数据驻留兼容?

是。

快速模式是否与 ZDR 和 BAA 兼容?

是。

这篇文章对你有帮助吗?