OpenAI
Tato stránka byla přeložena strojově. Zobrazit původní článek v angličtině.

Řízení délky odpovědí modelů OpenAI

Zjistěte, jak u modelů OpenAI nastavit limity výstupu pomocí tokenů, jasných promptů, příkladů a sekvencí stop.

Aktualizováno: 6 days ago

Přehled

Řízení délky odpovědi modelu je užitečné z několika důvodů: pomáhá řídit náklady (protože platíte za token), zlepšuje latenci/výkon (kratší odpovědi se vracejí rychleji) a zajišťuje relevanci tím, že se vyhne příliš dlouhým nebo rozvláčným výstupům.

Toho můžete dosáhnout pomocí limitů tokenů, nastavení uvažování a výřečnosti, jasných pokynů, příkladů a stop sekvencí. Nejaktuálnější a úplné informace vždy najdete v oficiální referenci API na platform.openai.com.

Nastavte maximální délku výstupu

API Responses

Používá se pro modely GPT-5 a většinu modelů řady o: pomocí max_output_tokens omezte počet tokenů, které model vygeneruje. U požadavků compaction_trigger parametr max_output_tokens buď vynechte, nebo jej nastavte alespoň na 20000; nižší hodnoty budou odmítnuty. API Responses nepodporuje více dokončení (n).

API na dokončování chatu

Používá se pro starší modely GPT-3.5, GPT-4o a někdy i modely řady o.

  • U modelů s uvažováním, jako jsou o3 a o4-mini, použijte max_completion_tokens (alias parametru max_tokens)

  • U starších modelů a modelů bez uvažování stále funguje max_tokens

  • Podporuje parametry stop a n (více dokončení).

Poznámka: Nastavení „minimum tokenů“ neexistuje. Pokud potřebujete minimální délku, uveďte ji ve svém promptu.

Limity tokenů podle skupiny modelů

Aktuální limity tokenů, velikosti kontextu a výstupní limity najdete v dokumentaci konkrétního modelu.

Rychlé příklady

Responses API

{ "model": "gpt-5", "input": "Shrňte zjištění do ~80 slov.", "max_output_tokens": 120 }

Dokončování chatu (model s uvažováním)

{ "model": "o3-mini", "messages": [{"role": "user", "content": "Write five one-line options."}], "max_completion_tokens": 100 }

Specifická nastavení modelů GPT-5: verbosity a reasoning.effort

Tato nastavení jsou dostupná pouze u modelů GPT-5 (gpt-5.2, gpt-5.2-chat-latest, gpt-5.2 pro atd.). Modely řady o ani starší modely je nepodporují.

Parametr verbosity přijímá hodnoty "low", "medium" (výchozí) nebo "high". Ovlivňuje míru podrobnosti, nikoli pevné limity.

{ "model": "gpt-5", "input": "Vysvětlete PageRank na vysoké úrovni.", "text": { "verbosity": "low" }, "max_output_tokens": 200 }

Parametr reasoning.effort určuje, kolik tokenů pro uvažování se vygeneruje před vytvořením odpovědi. GPT-5.2 podporuje hodnoty none, low, medium, high a xhigh. gpt-5.2-pro podporuje pouze hodnoty medium, high a xhigh. Starší modely s uvažováním podporují pouze hodnoty low, medium a high.

{ "model": "gpt-5", "input": "Kolik zlata by bylo potřeba k pokrytí Sochy svobody vrstvou o tloušťce 1 mm?", "reasoning": { "effort": "minimal" } }

Nastavením parametru reasoning.effort na none se model může chovat jako model bez uvažování, což je vhodné tam, kde záleží na nízké latenci.

Zadejte konkrétní pokyny

Požádejte o přesnou délku nebo podobu, kterou chcete. Příklady:

  • „Uveď přesně pět možností.“

  • „Napiš shrnutí o 50 slovech.“

  • „Ne více než 100 tokenů. Pokud potřebuješ víc, napiš ‚Potřebuji více prostoru.‘“

Používejte příklady s konzistentní délkou

Příklady na několika příkladech, které odpovídají požadované délce, pomáhají modelu pokračovat ve vzoru.

Používejte strategické ukončovací sekvence

Pomocí parametru stop zastavte generování, když model dosáhne oddělovače nebo hranice číslovaného seznamu.

{ "stop": ["
###", "6."] }

Více kandidátů

  • API na dokončování chatu: parametr n vrátí v jednom volání více dokončení.

  • API Responses: parametr n není podporován. Pokud potřebujete více než jeden výstup, proveďte více volání.

Byl tento článek užitečný?