Überblick
Die Länge einer Modellantwort zu steuern, ist aus mehreren Gründen sinnvoll: Es hilft, Kosten zu kontrollieren (da du pro Token zahlst), verbessert Latenz und Performance (kürzere Antworten werden schneller zurückgegeben) und sorgt für Relevanz, weil zu lange oder ausschweifende Ausgaben vermieden werden.
Das erreichst du mit Tokenobergrenzen, Reasoning- und Ausführlichkeitseinstellungen, klaren Anweisungen, Beispielen und Stoppsequenzen. Die aktuellsten und vollständigsten Informationen findest du immer in der offiziellen API-Referenz auf platform.openai.com.
Maximale Ausgabelänge festlegen
Responses API
Für GPT-5-Modelle und die meisten Modelle der o-Serie: Begrenze mit max_output_tokens die Anzahl der Token, die das Modell generiert. Lasse bei compaction_trigger-Anfragen max_output_tokens entweder weg oder lege einen Wert von mindestens 20000 fest. Niedrigere Werte werden abgelehnt. Die Responses API unterstützt nicht mehrere Vervollständigungen (n).
Chat Completions API
Wird für ältere GPT-3.5- und GPT-4o-Modelle sowie mitunter für Modelle der o-Serie verwendet.
Verwende für Reasoning-Modelle wie o3 und o4-mini max_completion_tokens (Alias von max_tokens).
Bei älteren Modellen und Modellen ohne Reasoning funktioniert max_tokens weiterhin.
Unterstützt stop und n (mehrere Vervollständigungen).
Hinweis: Es gibt keine Einstellung für „Mindestanzahl an Token“. Wenn du eine Mindestlänge brauchst, gib sie in deinem Prompt an.
Tokenlimits nach Modellgruppe
Aktuelle Tokenlimits, Kontextgrößen und Ausgabeobergrenzen findest du in der Dokumentation des jeweiligen Modells.
Kurze Beispiele
Responses API
{ "model": "gpt-5", "input": "Fasse die Ergebnisse in ca. 80 Wörtern zusammen.", "max_output_tokens": 120 }Chat Completions (Reasoning-Modell)
{ "model": "o3-mini", "messages": [{"role": "user", "content": "Schreibe fünf einzeilige Optionen."}], "max_completion_tokens": 100 }GPT-5-spezifische Parameter: verbosity und reasoning.effort
Diese Parameter sind nur für GPT-5-Modelle verfügbar (gpt-5.2, gpt-5.2-chat-latest, gpt-5.2 pro usw.). Modelle der o-Serie und ältere Modelle unterstützen sie nicht.
verbosity akzeptiert "low", "medium" (Standard) oder "high". Der Parameter beeinflusst den Detailgrad, aber keine festen Grenzwerte.
{ "model": "gpt-5", "input": "Erkläre PageRank in Grundzügen.", "text": { "verbosity": "low" }, "max_output_tokens": 200 }reasoning.effort steuert, wie viele Reasoning-Token generiert werden, bevor eine Antwort ausgegeben wird. GPT-5.2 unterstützt none, low, medium, high und xhigh. gpt-5.2-pro unterstützt nur medium, high und xhigh. Ältere Reasoning-Modelle unterstützen nur low, medium und high.
{ "model": "gpt-5", "input": "Wie viel Gold bräuchte man, um die Freiheitsstatue mit einer 1 mm dicken Schicht zu überziehen?", "reasoning": { "effort": "minimal" } }Du kannst reasoning.effort auf none setzen, damit sich das Modell bei latenzkritischen Anwendungsfällen wie ein Modell ohne Reasoning verhält.
Konkrete Anweisungen geben
Fordere die genaue Länge oder Form an, die du möchtest. Beispiele:
„Liste genau fünf Optionen auf.“
„Schreibe eine Zusammenfassung mit 50 Wörtern.“
„Nicht mehr als 100 Token. Wenn du mehr Platz brauchst, schreibe: ‚Ich brauche mehr Platz.‘“
Beispiele mit einheitlicher Länge verwenden
Few-Shot-Beispiele, die deiner gewünschten Länge entsprechen, helfen dem Modell, das Muster fortzusetzen.
Stoppsequenzen gezielt einsetzen
Verwende stop, um die Generierung anzuhalten, wenn das Modell ein Trennzeichen oder das Ende einer nummerierten Liste erreicht.
{ "stop": ["\n###", "6."] }Mehrere Ergebnisse
Chat Completions: n gibt mit einem Aufruf mehrere Vervollständigungen zurück.
Responses API: n wird nicht unterstützt. Führe mehrere Aufrufe aus, wenn du mehr als ein Ergebnis benötigst.
