Für alle, die unsere API nutzen und bei bestimmten Modellen eine schnellere, konsistentere Leistung benötigen, bieten wir den Schnellmodus an. Im Folgenden beantworten wir häufige Fragen zur Funktionsweise, zu Preisen, verfügbaren Modellen, Ratenlimits, Zuverlässigkeit, Richtlinien und Voraussetzungen.
Hinweis: Die Prioritätsverarbeitung wurde am 30. Juli 2026 in Schnellmodus umbenannt. In deinen API-Anfragen kannst du entweder service_tier: priority oder service_tier: fast verwenden.
Mehr dazu erfährst du hier.
Ist der Schnellmodus in allen Regionen verfügbar?
Die Verfügbarkeit des Schnellmodus richtet sich nach den geltenden Gesetzen und Vorschriften des jeweiligen Landes oder Rechtsgebiets. Bitte wende dich bei Fragen zur Verfügbarkeit in deiner Region an deinen Account Director.
So funktioniert es
Du kannst einzelne Anfragen über den vorhandenen Parameter service_tier mit der Option service_tier = "fast" an den Schnellmodus senden.
Im Schnellmodus verarbeitete Token werden pro Token abgerechnet, mit einem Aufpreis gegenüber der Standard-Verarbeitung.
Neben der Konfiguration für einzelne Anfragen kannst du den Schnellmodus auch als Standard für ein Projekt festlegen: in den Projekteinstellungen > Standard-Servicestufe: Schnell. Du kannst diese Einstellung weiterhin für einzelne Anfragen überschreiben. Die Auswahl von „Schnell“ in deinen Projekteinstellungen entspricht der Auswahl von „Priorität“.
Wie verhält sich der Schnellmodus zu Scale Tier?
Scale Tier bleibt vom Schnellmodus getrennt. Anfragen an den Schnellmodus werden separat abgerechnet und nicht auf deine gekauften TPM-Pakete im Scale Tier angerechnet.
Kann ich Datenverkehr, der mein Scale-Tier-Kontingent überschreitet, automatisch an den Schnellmodus weiterleiten?
Nein. Datenverkehr an Scale Tier wird bei Überschreitung des Kontingents nicht automatisch an den Schnellmodus weitergeleitet.
Wie wird der Schnellmodus abgerechnet?
Im Schnellmodus verarbeitete Token werden pro Token abgerechnet, mit einem Aufpreis gegenüber der Standard-Verarbeitung.
Ist meine jährliche Ausgabenverpflichtung an einen bestimmten Verarbeitungsmodus gebunden?
Nein. Die Ausgaben für alle Verarbeitungsmodi werden auf deine jährliche Enterprise-Ausgabenverpflichtung angerechnet.
Erhalte ich weiterhin einen Rabatt auf zwischengespeicherte Eingabe-Token?
Ja! Für zwischengespeicherte Eingaben gilt derselbe Rabatt von 50–75 % wie bei der Standard-Verarbeitung.
Wie kann ich meine Nutzung und Ausgaben für den Schnellmodus einsehen?
Um die im Schnellmodus (früher Prioritätsverarbeitung) verarbeiteten Token einzusehen, öffne das Nutzungsdashboard, wähle „Chat Completions“ oder „Responses“ und gruppiere nach Servicestufe.
Um die Kosten des Schnellmodus einzusehen, öffne das Nutzungsdashboard und wähle „Nach Einzelposten gruppieren“.
Im Nutzungsdashboard werden Anfragen mit priority oder fast als service_tier weiterhin als priority angezeigt. Für künftige Modelle wird dies aktualisiert.
Modelle
Ist der Schnellmodus für lange Kontexte, feinabgestimmte Modelle, Embeddings usw. verfügbar?
Derzeit nicht. Wir werden künftig prüfen, ob wir den Schnellmodus neben unseren neuesten Modellen auch für weitere Produkte anbieten.
Wie funktionieren andere Modalitäten im Schnellmodus?
Der Schnellmodus unterstützt dieselben multimodalen Funktionen wie die Standard-Verarbeitung. Insbesondere lassen sich Bilder als Eingaben für die Prioritätsverarbeitung verwenden. Sie werden mit derselben niedrigen Latenz verarbeitet.
Werden künftige Modelle unterstützt?
Wir planen, den Schnellmodus für neue GPT-Modelle anzubieten, garantieren aber nicht, dass jedes Modell unterstützt wird.
Ratenlimits
Welche Ratenlimits gelten?
Bei den Ratenlimits wird die Nutzung der Prioritätsverarbeitung genauso behandelt wie der Standard-API-Datenverkehr.
Welche Grenzwerte gelten für die Anstiegsrate?
Im Schnellmodus gelten Grenzwerte für die Anstiegsrate, um eine gleichbleibend hohe Leistung für alle zu gewährleisten und zugleich eine flexible, bedarfsabhängige Abrechnung zu ermöglichen. Wenn (a) die Leistung des Schnellmodus beeinträchtigt ist UND (b) dein Datenverkehr zu schnell ansteigt, können in seltenen Fällen einige Anfragen stattdessen auf die Standard-Verarbeitung zurückgestuft werden.
Den aktuellen Grenzwert für die Anstiegsrate im Schnellmodus findest du hier in unserer Hauptdokumentation.
Empfehlungen zum Einhalten deines Grenzwerts für die Anstiegsrate
Erhöhe den Datenverkehr beim Modellwechsel schrittweise. Wenn deine Anwendung beispielsweise von einem bisherigen Snapshot auf einen neuen wechselt, nutze ein Feature-Flag, um den Datenverkehr über einige Stunden hinweg umzustellen statt auf einmal.
Vermeide es, umfangreiche Datenverarbeitungsaufgaben oder asynchrone Aufträge im Schnellmodus auszuführen. Solche Aufträge können den Datenverkehr sehr schnell ansteigen lassen und benötigen oft nicht die verbesserte Leistung des Schnellmodus.
Wenn du regelmäßig an die Grenzwerte für die Anstiegsrate stößt, erwäge stattdessen den Kauf eines Kontingents im Scale Tier.
Gelten die Grenzwerte für die Anstiegsrate übergreifend für meine Projekte oder Organisationen?
Ja, dein gesamter Datenverkehr zählt für denselben Grenzwert für die Anstiegsrate.
Richtlinien
Was passiert, wenn der Schnellmodus die Ziellatenz nicht einhält?
Wende dich bei Fragen oder Bedenken bitte an deine AD-Ansprechperson. Die SLAs für den Schnellmodus werden genauso behandelt wie die SLAs für Scale Tier. Sollten wir diese SLAs für Unternehmen mit Enterprise-Verträgen innerhalb eines bestimmten Zeitfensters nicht einhalten, bieten wir Servicegutschriften an.
Ist der Schnellmodus mit Datenresidenz kompatibel?
Ja.
Ist der Schnellmodus mit ZDR und dem BAA kompatibel?
Ja.
Ultrafast für GPT-6 Astra
Ultrafast ist eine separate Servicestufe für Workloads, die Antworten von GPT-6 Astra mit geringerer Latenz benötigen, etwa interaktive Anwendungen und Programmierabläufe.
Die Angaben zu Preisen, Ratenlimits und Richtlinien des Schnellmodus gelten für Anfragen mit service_tier="fast". Ultrafast-Anfragen nutzen die separate Servicestufe service_tier="ultrafast".
Wie sende ich eine Ultrafast-Anfrage?
Wenn deine Organisation Zugang zu Ultrafast hat, verwende die Responses API mit folgenden Angaben:
Modell:
gpt-6-astraServicestufe:
ultrafastAnfrage-Header:
OpenAI-Service-Tier: ultrafast
Der Anfrage-Header ist zusätzlich zur Einstellung der Servicestufe erforderlich.
Bei Anwendungen, die Tool-Aufrufe ausführen, kannst du mit dem WebSocket-Modus eine Verbindung über mehrere Interaktionen hinweg wiederverwenden und so den Verbindungsaufwand reduzieren.
Kann ich denselben Anfrage-Header für andere Servicestufen verwenden?
Während der Alpha-Phase von Ultrafast akzeptiert der Header OpenAI-Service-Tier nur ultrafast. Wenn du einen anderen Wert sendest, auch default, fast oder flex, wird ein HTTP-400-Fehler zurückgegeben. Lass diesen Header weg, wenn du eine andere Servicestufe verwendest.
Kann ich Ultrafast in Work oder Codex nutzen?
Ultrafast ist für berechtigte Tarife und Arbeitsbereiche auch in Work und Codex verfügbar. Die Zugangsberechtigung und Nutzung in ChatGPT-Tarifen unterscheiden sich vom API-Zugang.
Details zu Verfügbarkeit und Nutzung findest du im Artikel ChatGPT Work und Codex.
