Přehled
Řízení délky odpovědi modelu je užitečné z několika důvodů: pomáhá řídit náklady (protože platíte za token), zlepšuje latenci/výkon (kratší odpovědi se vracejí rychleji) a zajišťuje relevanci tím, že se vyhne příliš dlouhým nebo rozvláčným výstupům.
Toho můžete dosáhnout pomocí limitů tokenů, nastavení uvažování a výřečnosti, jasných pokynů, příkladů a stop sekvencí. Nejaktuálnější a úplné informace vždy najdete v oficiální referenci API na platform.openai.com.
Nastavte maximální délku výstupu
API Responses
Používá se pro modely GPT-5 a většinu modelů řady o: pomocí max_output_tokens omezte počet tokenů, které model vygeneruje. U požadavků compaction_trigger parametr max_output_tokens buď vynechte, nebo jej nastavte alespoň na 20000; nižší hodnoty budou odmítnuty. API Responses nepodporuje více dokončení (n).
API na dokončování chatu
Používá se pro starší modely GPT-3.5, GPT-4o a někdy i modely řady o.
U modelů s uvažováním, jako jsou o3 a o4-mini, použijte max_completion_tokens (alias parametru max_tokens)
U starších modelů a modelů bez uvažování stále funguje max_tokens
Podporuje parametry stop a n (více dokončení).
Poznámka: Nastavení „minimum tokenů“ neexistuje. Pokud potřebujete minimální délku, uveďte ji ve svém promptu.
Limity tokenů podle skupiny modelů
Aktuální limity tokenů, velikosti kontextu a výstupní limity najdete v dokumentaci konkrétního modelu.
Rychlé příklady
Responses API
{ "model": "gpt-5", "input": "Shrňte zjištění do ~80 slov.", "max_output_tokens": 120 }Dokončování chatu (model s uvažováním)
{ "model": "o3-mini", "messages": [{"role": "user", "content": "Write five one-line options."}], "max_completion_tokens": 100 }Specifická nastavení modelů GPT-5: verbosity a reasoning.effort
Tato nastavení jsou dostupná pouze u modelů GPT-5 (gpt-5.2, gpt-5.2-chat-latest, gpt-5.2 pro atd.). Modely řady o ani starší modely je nepodporují.
Parametr verbosity přijímá hodnoty "low", "medium" (výchozí) nebo "high". Ovlivňuje míru podrobnosti, nikoli pevné limity.
{ "model": "gpt-5", "input": "Vysvětlete PageRank na vysoké úrovni.", "text": { "verbosity": "low" }, "max_output_tokens": 200 }Parametr reasoning.effort určuje, kolik tokenů pro uvažování se vygeneruje před vytvořením odpovědi. GPT-5.2 podporuje hodnoty none, low, medium, high a xhigh. gpt-5.2-pro podporuje pouze hodnoty medium, high a xhigh. Starší modely s uvažováním podporují pouze hodnoty low, medium a high.
{ "model": "gpt-5", "input": "Kolik zlata by bylo potřeba k pokrytí Sochy svobody vrstvou o tloušťce 1 mm?", "reasoning": { "effort": "minimal" } }Nastavením parametru reasoning.effort na none se model může chovat jako model bez uvažování, což je vhodné tam, kde záleží na nízké latenci.
Zadejte konkrétní pokyny
Požádejte o přesnou délku nebo podobu, kterou chcete. Příklady:
„Uveď přesně pět možností.“
„Napiš shrnutí o 50 slovech.“
„Ne více než 100 tokenů. Pokud potřebuješ víc, napiš ‚Potřebuji více prostoru.‘“
Používejte příklady s konzistentní délkou
Příklady na několika příkladech, které odpovídají požadované délce, pomáhají modelu pokračovat ve vzoru.
Používejte strategické ukončovací sekvence
Pomocí parametru stop zastavte generování, když model dosáhne oddělovače nebo hranice číslovaného seznamu.
{ "stop": ["
###", "6."] }Více kandidátů
API na dokončování chatu: parametr n vrátí v jednom volání více dokončení.
API Responses: parametr n není podporován. Pokud potřebujete více než jeden výstup, proveďte více volání.
