我們為 API 客戶提供快速模式,讓他們在特定模型上享有更快、更穩定的效能。以下是有關運作方式、定價、模型可用性、速率限制、可靠性、政策及使用資格等常見問題的解答。
注意:Priority processing 已於 2026 年 7 月 30 日更名為快速模式。您可在 API 請求中使用 service_tier: priority 或 service_tier: fast。
請按此深入瞭解。
所有地區都能使用快速模式嗎?
快速模式是否可用,取決於各司法管轄區的適用法律與法規。如對您所在地區的可用性有任何疑問,請聯絡您的客戶總監。
運作方式
客戶可使用現有的 service_tier 參數,將個別請求設為 service_tier = "fast",把流量導向快速模式。
快速模式處理的 Token 將按 Token 數量計費,單價高於標準處理。
除了針對個別請求設定,你也可以在「專案設定 > 預設服務層級:快速」中,將專案預設為快速模式。你仍可在個別請求中覆寫此設定。在專案設定中選擇「快速」,等同於選擇「優先」。
快速模式與規模層級有何關係?
規模層級與快速模式將維持彼此獨立。傳送至快速模式的請求將另外計費,不會扣除你已購買的規模層級 TPM 套組配額。
我可以將超出規模層級配額的流量自動轉送至快速模式嗎?
不行。傳送至規模層級的流量,即使超出配額,也不會自動轉送至快速模式。
快速模式如何計費?
快速模式處理的 Token 將按 Token 數量計費,單價高於標準處理。
我的年度承諾支出是否綁定特定處理模式?
不會。所有處理模式的費用,都會計入企業合約的年度承諾支出。
快取輸入 Token 仍可享有折扣嗎?
可以!快取輸入可享有與標準處理相同的 50–75% 費用折減。
如何查看快速模式的用量與支出?
若要查看快速模式(原稱優先處理)處理的 Token 數量,請前往用量儀表板,選擇 Chat Completions 或 Responses,並依服務層級分組。
若要查看快速模式的費用,請前往用量儀表板,並選擇依明細項目分組。
在用量儀表板上,service_tier 設為 priority 或 fast 的請求,仍會顯示為 priority。未來推出模型時,將更新此顯示方式。
模型
快速模式是否適用於長上下文、微調模型、嵌入等功能?
目前尚不適用。未來我們會評估是否將快速模式擴展至最新模型以外的其他產品。
快速模式如何支援其他模態?
快速模式支援與標準處理相同的多模態功能。具體而言,圖片也能作為優先處理的輸入,並享有同樣的低延遲處理。
未來的模型也會支援嗎?
我們計畫為新的 GPT 模型提供快速模式,但不保證每個模型都會支援。
速率限制
速率限制是什麼?
計算速率限制時,優先處理的用量與標準 API 流量採相同方式計算。
提升速率限制是什麼?
快速模式設有提升速率限制,確保所有客戶都能持續享有高效能,同時維持彈性的隨用隨付計價方式。如果 (a) 快速模式的效能下降,且 (b) 客戶的流量增加過快,在極少數情況下,部分請求可能會降級為標準處理。
目前快速模式的提升速率限制,請參閱此處的主要文件。
避免超出提升速率限制的最佳做法
切換模型時,請逐步增加流量。例如,若應用程式正從舊快照切換至新快照,請使用功能旗標,在數小時內逐步轉移流量,而非一次全部切換。
避免以快速模式執行大量資料處理或非同步作業。這些作業可能使流量迅速增加,而且通常不需要快速模式提供的效能提升。
若你經常觸及提升速率限制,請考慮改為購買規模層級配額。
我的專案或組織之間是否共用提升速率限制?
是的,你的所有流量都會合併計入同一個提升速率限制。
政策
如果快速模式未達到延遲目標,會如何處理?
如有任何疑問或疑慮,請聯絡你的 AD。快速模式的 SLA 將比照規模層級的 SLA 處理;對於簽訂企業合約的客戶,若我們在指定時段內未達到這些 SLA,將提供服務抵用額。
快速模式是否支援資料駐留?
是的。
快速模式是否支援 ZDR 和 BAA?
是的。
GPT-6 Astra 的超快速服務
超快速是獨立的服務層級,適用於需要 GPT-6 Astra 以更低延遲回應的工作負載,例如互動式應用程式和程式開發工作流程。
快速模式的定價、速率限制及政策指引,適用於使用 service_tier="fast" 的請求。超快速請求則使用獨立的 service_tier="ultrafast" 層級。
如何傳送超快速請求?
若組織已取得超快速存取權,請使用 Responses API 並套用以下設定:
模型:
gpt-6-astra服務層級:
ultrafast請求標頭:
OpenAI-Service-Tier: ultrafast
除了設定服務層級,也必須提供此請求標頭。
對於會執行工具呼叫的應用程式,WebSocket 模式可讓你在多個回合間重複使用同一連線,減少建立連線的額外負擔。
我可以對其他服務層級使用相同的請求標頭嗎?
在超快速的 Alpha 測試期間,OpenAI-Service-Tier 標頭僅接受 ultrafast。傳送其他值,包括 default、fast 或 flex,都會傳回 HTTP 400 錯誤。使用其他層級時,請省略此標頭。
我可以在工作或 Codex 中使用超快速嗎?
符合資格的方案與工作區,也能在工作及 Codex 中使用超快速。ChatGPT 方案的適用資格及用量規則與 API 存取不同。
如需適用範圍與用量詳情,請參閱 ChatGPT 工作與 Codex。
