OpenAI
此頁面由機器翻譯。查看原文英文文章。

快速模式常見問題

有關快速模式及超快速服務層級的常見問題。

更新日期:2 days ago

我們為希望在指定模型上獲得更快速、更穩定效能的 API 客戶提供快速模式。以下解答有關運作方式、定價、模型供應情況、速率限制、可靠性、政策及資格的常見問題。

注意:優先處理已於 2026 年 7 月 30 日更名為快速模式。你可在 API 請求中使用 service_tier: priority 或 service_tier: fast。 

在此處了解詳情。

快速模式是否在所有地區均有提供?

快速模式的供應情況視各司法管轄區的適用法律及法規而定。如對你所在地區的供應情況有任何疑問,請聯絡你的客戶總監。

運作方式

客戶可使用現有的 service_tier 參數,將個別請求設為 service_tier = "fast",以將流量導向快速模式。

快速模式處理的 Token 按每個 Token 計費,單價高於標準處理。

除了為個別請求設定模式外,你也可以前往「專案設定」>「預設服務層級:快速」,將快速模式設為專案的預設模式。你仍可為個別請求覆寫此設定。在專案設定中選擇「快速」,等同於選擇「優先」。

快速模式與規模層級有何關係?

規模層級將繼續與快速模式分開運作。傳送至快速模式的請求會另行計費,不會扣減你已購買的規模層級 TPM 套裝配額。

我可以將超出規模層級配額的流量自動轉送至快速模式嗎?

不可以。傳送至規模層級的流量,即使超出配額,也不會自動轉送至快速模式。

快速模式如何計費?

快速模式處理的 Token 按每個 Token 計費,單價高於標準處理。

我的年度消費承諾是否只適用於特定處理模式?

不是。所有處理模式的費用均計入你的企業年度消費承諾。

快取輸入 Token 仍可享有折扣嗎?

可以!與標準處理一樣,快取輸入的費用可減免 50–75%。

如何查看快速模式的用量和費用?

如要查看快速模式(前稱優先處理)處理的 Token,請前往用量儀表板,選擇 Chat Completions 或 Responses,再按服務層級分組。

如要查看快速模式的費用,請前往用量儀表板,選擇按明細項目分組。

在用量儀表板上,service_tier 設為 priority 或 fast 的請求仍會顯示為 priority。未來模型的顯示方式將會更新。

模型

快速模式是否適用於長上下文、微調模型、嵌入等功能?

目前不適用。我們日後會評估是否將快速模式擴展至最新模型以外的其他產品。

快速模式如何處理其他模態?

快速模式支援與標準處理相同的多模態功能。具體而言,圖像可作為優先處理的輸入,並享有同樣的低延遲處理。

會支援未來的模型嗎?

我們計劃為新的 GPT 模型提供快速模式,但不保證會支援每個模型。

速率限制

有哪些速率限制?

在速率限制方面,優先處理的用量與標準 API 流量的計算方式相同。

增長速率有哪些限制?

快速模式設有增長速率限制,確保所有客戶均能持續享有高效能,同時仍提供靈活的按需定價。如果同時出現 (a) 快速模式效能下降及 (b) 客戶流量增長過快的情況,極少數情況下,部分請求可能會降級至標準處理。

快速模式目前的增長速率限制已在此處的主要文件中列明。

避免超出增長速率限制的最佳做法

更換模型時,請逐步增加流量。例如,如果你的應用程式正從舊快照轉用新快照,請使用功能旗標,在數小時內逐步轉移流量,而非一次過全部轉移。

避免在快速模式下執行大型資料處理或非同步作業。這些作業可能令流量急速增加,而且通常不需要快速模式提供的更高效能。

如果你經常觸及增長速率限制,可考慮改為購買規模層級配額。

我的各個專案或組織是否共用增長速率限制?

是的,你的所有流量都會合併計算,並受同一增長速率限制約束。

政策

如果快速模式未能達到延遲目標,會如何處理?

如有任何疑問或疑慮,請聯絡你的 AD。快速模式的服務水平協議(SLA)將採用與規模層級 SLA 相同的處理方式;如果我們在指定時段內未能為已簽訂企業協議的客戶達到 SLA 要求,將提供服務抵免額。

快速模式是否支援資料駐留?

是的。

快速模式是否與 ZDR 和 BAA 相容?

是的。

GPT-6 Astra 的超快速層級

超快速是獨立的服務層級,適用於需要 GPT-6 Astra 以更低延遲回應的工作負載,例如互動式應用程式和編程工作流程。

快速模式的定價、速率限制及政策指引適用於使用 service_tier="fast" 的請求。超快速請求使用獨立的 service_tier="ultrafast" 層級。

如何傳送超快速請求?

如果組織已獲得超快速層級的存取權限,請使用 Responses API,並採用以下設定:

  • 模型:gpt-6-astra

  • 服務層級:ultrafast

  • 請求標頭:OpenAI-Service-Tier: ultrafast

除了設定服務層級外,也必須提供此請求標頭。

對於會執行工具呼叫的應用程式,WebSocket 模式可讓你在多輪互動中重用同一連線,減少建立連線的額外開銷。

其他服務層級可以使用相同的請求標頭嗎?

在超快速層級的 Alpha 測試期間,OpenAI-Service-Tier 標頭只接受 ultrafast。傳送其他值,包括 default、fast 或 flex,均會傳回 HTTP 400 錯誤。使用其他層級時,請省略此標頭。

我可以在「工作」或 Codex 中使用超快速層級嗎?

符合資格的方案和工作空間也可在「工作」和 Codex 中使用超快速層級。ChatGPT 方案的使用資格及用量規定與 API 存取有所不同。

如需了解開放使用情況及用量詳情,請參閱 ChatGPT 工作和 Codex。

這篇文章對你有幫助嗎?