Pregled
Nadzor dolžine odgovora modela je koristen iz več razlogov: pomaga upravljati stroške (ker plačujete na žeton), zmanjša zakasnitev in izboljša zmogljivost (krajši odgovori se vrnejo hitreje) ter zagotavlja ustreznost, saj preprečuje predolge ali preveč razvlečene izhode.
To lahko dosežete z omejitvami žetonov, nastavitvami sklepanja in podrobnosti, jasnimi navodili, primeri ter zaporedji zaustavitve. Za najnovejše in najpopolnejše informacije vedno glejte uradno referenčno dokumentacijo API-ja na platform.openai.com.
Nastavite največjo dolžino izhoda
API Responses
Uporablja se za modele GPT-5 in večino modelov serije o: z max_output_tokens omejite število žetonov, ki jih bo ustvaril model. Pri zahtevah compaction_trigger izpustite max_output_tokens ali ga nastavite na najmanj 20000; nižje vrednosti so zavrnjene. API Responses ne podpira več dopolnitev (n).
API za dopolnitve klepeta
Uporablja se za starejše modele GPT-3.5 in GPT-4o ter včasih za modele serije o.
Za modele sklepanja, kot sta o3 in o4-mini, uporabite max_completion_tokens (drugo ime za max_tokens)
Pri starejših modelih oziroma modelih brez sklepanja še vedno deluje max_tokens
Podpira stop in n (več dopolnitev).
Opomba: Nastavitve za »najmanj žetonov« ni. Če potrebujete najmanjšo dolžino, jo navedite v pozivu.
Omejitve žetonov po skupinah modelov
Za najnovejše omejitve žetonov, velikosti konteksta in omejitve izhoda glejte dokumentacijo za posamezni model.
Hitri primeri
API Responses
{ "model": "gpt-5", "input": "Povzemi ugotovitve v približno 80 besedah.", "max_output_tokens": 120 }Dopolnitve klepeta (model sklepanja)
{ "model": "o3-mini", "messages": [{"role": "user", "content": "Write five one-line options."}], "max_completion_tokens": 100 }Kontrolnika, značilna za modele GPT-5: verbosity in reasoning.effort
Ta kontrolnika sta na voljo samo pri modelih GPT-5 (gpt-5.2, gpt-5.2-chat-latest, gpt-5.2 pro itd.). Modeli serije o in starejši modeli ju ne podpirajo.
verbosity sprejme vrednosti "low", "medium" (privzeto) ali "high". Vpliva na raven podrobnosti, ne pa na fiksne omejitve.
{ "model": "gpt-5", "input": "Na visoki ravni razloži PageRank.", "text": { "verbosity": "low" }, "max_output_tokens": 200 }reasoning.effort določa, koliko žetonov sklepanja se ustvari pred pripravo odgovora. GPT-5.2 podpira none, low, medium, high in xhigh. gpt-5.2-pro podpira samo medium, high in xhigh. Starejši modeli sklepanja podpirajo samo low, medium in high.
{ "model": "gpt-5", "input": "Koliko zlata bi potrebovali, da bi Kip svobode prekrili s plastjo debeline 1 mm?", "reasoning": { "effort": "minimal" } }reasoning.effort lahko nastavite na none, da se model pri primerih uporabe, občutljivih na zakasnitev, obnaša kot model brez sklepanja.
Podajte konkretna navodila
Zahtevajte točno želeno dolžino ali obliko. Primeri:
»Navedi točno pet možnosti.«
»Napiši 50-besedni povzetek.«
»Največ 100 žetonov. Če potrebuješ več prostora, reci: ‚Potrebujem več prostora.‘«
Uporabite primere s skladno dolžino
Primeri za učenje iz malo primerov, ki ustrezajo želeni dolžini, modelu pomagajo nadaljevati vzorec.
Premišljeno uporabite zaporedja za zaustavitev
Uporabite stop, da ustavite ustvarjanje, ko model doseže ločilo ali mejo oštevilčenega seznama.
{ "stop": ["
###", "6."] }Več možnih odgovorov
API za dopolnitve klepeta: n v enem klicu vrne več dopolnitev.
API Responses: n ni podprt; če potrebujete več kot en rezultat, izvedite več klicev.
