OpenAI
此頁面由機器翻譯。查看原始英文文章

快速模式常見問題

快速模式常見問題

更新日期:2 days ago

我們為希望在特定模型上獲得更快速、更穩定效能的 API 客戶提供快速模式。以下針對其運作方式、定價、模型可用性、速率限制、可靠性、政策及使用資格等常見問題提供解答。

注意:優先處理已於 2026 年 7 月 30 日更名為快速模式。您可以在 API 要求中使用 service_tier: priority 或 service_tier: fast。 

請在此處深入瞭解。

所有地區都可以使用快速模式嗎?

快速模式的可用性取決於各司法管轄區適用的法律與法規。如果對您所在地區的可用性有任何疑問,請聯絡您的客戶總監。

運作方式

客戶可以使用現有的 service_tier 參數,並將選項設為 service_tier = "fast",逐一將要求的流量導向快速模式。

快速模式處理的 Token 會按 Token 計費,價格高於標準處理費率。

除了在要求層級進行設定,您也可以前往「專案設定 > 預設服務層級:快速」,將專案預設為快速模式。您仍可針對個別要求覆寫此設定。在專案設定中選取「快速」等同於選取「優先」。

這與規模層級如何搭配運作?

規模層級仍會與快速模式分開運作。傳送至快速模式的要求會另行計費,且不會計入您購買的規模層級 TPM 套裝額度。

可以將超出規模層級額度的流量自動傳送至快速模式嗎?

不可以。傳送至規模層級的流量不會在超出額度時自動轉至快速模式。

快速模式如何計費?

快速模式處理的 Token 會按 Token 計費,價格高於標準處理費率。

我的年度承諾是否綁定特定處理模式?

不是。所有處理模式的費用都會計入您的 Enterprise 年度消費承諾。

快取輸入 Token 仍有折扣嗎?

有!快取輸入享有與標準處理相同的 50–75% 折扣。

如何查看快速模式的用量與費用?

若要查看快速模式(前稱優先處理)所處理的 Token,請前往「用量」儀表板,選取 Chat Completions 或 Responses,再選擇「依服務層級分組」。

若要查看快速模式的費用,請前往「用量」儀表板,並選取「依明細項目分組」。

在「用量」儀表板中,service_tier 使用 priority 或 fast 的要求仍會顯示為 priority。未來的模型會更新這項顯示方式。

模型

快速模式是否支援長上下文、微調模型、嵌入等功能?

目前尚不支援。未來我們會評估是否要將快速模式擴展至最新模型以外的其他產品。

其他模態如何搭配快速模式運作?

快速模式支援與標準處理相同的多模態功能。特別是,優先處理可使用圖片作為輸入,並以同樣快速的延遲表現進行處理。

未來的模型也會受到支援嗎?

我們計畫在新的 GPT 模型上提供快速模式,但不保證每個模型都會受到支援。

速率限制

速率限制為何?

就速率限制而言,優先處理的用量與標準 API 流量採相同方式計算。

流量增長速率限制為何?

快速模式設有流量增長速率限制,以確保所有客戶持續享有高效能,同時仍提供靈活的隨用隨付定價。在少數情況下,如果 (a) 快速模式效能下降,而且 (b) 客戶流量增長過快,部分要求可能會改以標準處理。

目前的快速模式流量增長速率限制定義於此處的主要說明文件。

避免超出流量增長速率限制的最佳做法

切換模型時,請逐步增加流量。例如,若您的應用程式要從先前的快照轉換至新快照,請使用功能旗標,在數小時內逐步轉移流量,而不要一次全部切換。

請避免使用快速模式執行大型資料處理或非同步工作。這些工作可能會使流量迅速增加,而且通常不需要快速模式所提供的效能提升。

如果您經常遇到流量增長速率限制,請考慮改為購買規模層級配額。

我的各個專案或組織是否共用流量增長速率限制?

是,您的所有流量都會計入同一項流量增長速率限制。

政策

如果快速模式未達延遲目標,該怎麼辦?

如有任何問題或疑慮,請聯絡您的客戶總監。快速模式 SLA 的處理方式與規模層級 SLA 相同;如果我們未能在特定期間內達到這些 SLA,便會向簽訂 Enterprise 合約的客戶提供服務抵免額。

快速模式是否與資料駐留相容?

是。

快速模式是否與 ZDR 和 BAA 相容?

是。

這篇文章有幫助嗎?