OpenAI
此頁面由機器翻譯。查看原文英文文章

快速模式常見問題

快速模式常見問題

更新日期:2 days ago

我們為希望在特定模型上獲得更快、更穩定效能的 API 客戶提供快速模式。以下解答有關運作方式、定價、模型供應情況、速率限制、可靠性、政策及使用資格的常見問題。

注意:優先處理已於 2026 年 7 月 30 日易名為快速模式。你可以在 API 請求中使用 service_tier: priority 或 service_tier: fast。 

請按此處了解詳情。

所有地區都提供快速模式嗎?

快速模式的供應情況取決於各司法管轄區的適用法律及規例。如對你所在地區的供應情況有疑問,請聯絡你的客戶總監。

運作方式

客戶可使用現有的 service_tier 參數,並設定選項 service_tier = "fast",逐項請求將流量導向快速模式。

快速模式處理的 Token 會按 Token 計費,價格高於標準處理費率。

除了在請求層級設定外,你亦可在「專案設定 > 預設服務層級:快速」中,將專案預設為使用快速模式。你仍可逐項請求覆寫此設定。在專案設定中選擇「快速」,等同選擇「優先」。

快速模式如何與規模層級配合?

規模層級將繼續與快速模式分開運作。傳送至快速模式的請求將另行計費,亦不會計入你已購買的規模層級 TPM 套餐。

我可以自動將規模層級的溢出流量傳送至快速模式嗎?

不可以。傳送至規模層級的流量不會自動溢出至快速模式。

快速模式如何計費?

快速模式處理的 Token 會按 Token 計費,價格高於標準處理費率。

我的年度承諾是否與特定處理模式綁定?

不是。所有處理模式的費用均會計入你的企業版年度消費承諾。

快取輸入 Token 仍可享有折扣嗎?

可以!快取輸入與標準處理一樣,可享有 50% 至 75% 折扣。

如何查看快速模式的用量及支出?

如要查看快速模式(前稱優先處理)所處理的 Token,請前往「用量」控制面板,選擇「Chat Completions」或「Responses」,再選擇「按服務層級分組」。

如要查看快速模式的費用,請前往「用量」控制面板,再選擇「按項目分組」。

在「用量」控制面板上,以 priority 或 fast 作為 service_tier 的請求仍會顯示為 priority。日後推出的模型將會更新這項設定。

模型

快速模式是否支援長上下文、微調模型、嵌入等功能?

目前尚未支援。我們日後將評估是否把快速模式擴展至最新模型以外的其他產品。

其他模態如何配合快速模式運作?

快速模式支援與標準處理相同的多模態功能。具體而言,優先處理可使用圖像作為輸入,並以同樣低延遲的速度處理。

日後推出的模型會獲支援嗎?

我們計劃在新的 GPT 模型上提供快速模式,但不保證支援每個模型。

速率限制

速率限制是多少?

在速率限制方面,優先處理的用量與標準 API 流量以相同方式計算。

流量增長速率限制是多少?

快速模式設有流量增長速率限制,既確保所有客戶持續獲得高效能,亦可提供靈活的按需定價。在極少數情況下,如 (a) 快速模式效能下降,而且 (b) 客戶流量增長過快,部分請求可能會改用標準處理。

目前的快速模式流量增長速率限制載於此處的主要文件。

維持在流量增長速率限制內的最佳做法

更換模型時,請逐步增加流量。例如,如你的應用程式正從舊快照轉移至新快照,請使用功能旗標,在數小時內逐步轉移流量,而非一次過完成。

避免以快速模式執行大型資料處理或非同步工作。這些工作可令流量迅速增長,而且通常不需要快速模式所提供的效能提升。

如你經常遇到流量增長速率限制,請考慮改為購買規模層級配額。

我的專案或機構是否共用流量增長速率限制?

是,你的所有流量均計入同一項流量增長速率限制。

政策

如果快速模式未能達到延遲目標,會怎樣處理?

如有任何疑問或疑慮,請聯絡你的客戶總監。快速模式的 SLA 將與規模層級 SLA 以相同方式處理;如我們在指定時段內未能履行與企業協議客戶訂立的 SLA,將提供服務抵免額。

快速模式是否與資料駐留相容?

是。

快速模式是否與 ZDR 及 BAA 相容?

是。

這篇文章對你有幫助嗎?