Pregled
Kontrolisanje dužine odgovora modela korisno je iz više razloga: pomaže u upravljanju troškovima (jer plaćate po tokenu), poboljšava latenciju/performanse (kraći odgovori se brže vraćaju) i osigurava relevantnost izbjegavanjem predugih ili preopširnih izlaza.
To možete postići pomoću ograničenja tokena, postavki rezonovanja i opširnosti, jasnih uputstava, primjera i stop sekvenci. Za najaktuelnije i potpune detalje uvijek pogledajte zvaničnu API referencu na platform.openai.com.
Postavite maksimalnu dužinu izlaza
API za odgovore
Koristi se za modele GPT-5 i većinu modela serije o: koristite max_output_tokens da ograničite broj tokena koje će model generisati. Kod zahtjeva compaction_trigger izostavite max_output_tokens ili ga postavite na najmanje 20000; manje vrijednosti se odbijaju. API za odgovore ne podržava višestruka dovršavanja (n).
API za dovršavanje razgovora
Koristi se za starije modele GPT-3.5 i GPT-4o, a ponekad i za modele serije o.
Za modele rezonovanja kao što su o3 i o4-mini koristite max_completion_tokens (pseudonim za max_tokens)
Za ranije modele i modele bez rezonovanja i dalje radi max_tokens
Podržava stop i n (višestruka dovršavanja).
Napomena: Ne postoji postavka za “minimalan broj tokena”. Ako vam treba minimalna dužina, navedite to u svom upitu.
Ograničenja tokena po grupi modela
Za najnovija ograničenja tokena, veličine konteksta i ograničenja izlaza pogledajte dokumentaciju za određeni model.
Brzi primjeri
Responses API
{ "model": "gpt-5", "input": "Sažmi nalaze u oko 80 riječi.", "max_output_tokens": 120 }Chat Completions (model rezonovanja)
{ "model": "o3-mini", "messages": [{"role": "user", "content": "Write five one-line options."}], "max_completion_tokens": 100 }Kontrole specifične za modele GPT-5: verbosity i reasoning.effort
Ove kontrole su dostupne samo na modelima GPT-5 (gpt-5.2, gpt-5.2-chat-latest, gpt-5.2 pro itd.). Modeli serije o i stariji modeli ih ne podržavaju.
verbosity prihvata vrijednosti „low“, „medium“ (zadana vrijednost) ili „high“. Utječe na nivo detalja, ali ne i na stroga ograničenja.
{ "model": "gpt-5", "input": "Objasni PageRank na visokom nivou.", "text": { "verbosity": "low" }, "max_output_tokens": 200 }reasoning.effort određuje koliko se tokena za rezonovanje generiše prije izrade odgovora. GPT-5.2 podržava none, low, medium, high i xhigh. gpt-5.2-pro podržava samo medium, high i xhigh. Raniji modeli rezonovanja podržavaju samo low, medium i high.
{ "model": "gpt-5", "input": "Koliko bi zlata bilo potrebno da se Kip slobode prekrije slojem od 1 mm?", "reasoning": { "effort": "minimal" } }Možete postaviti reasoning.effort na none kako bi se model ponašao kao model bez rezonovanja u slučajevima primjene osjetljivim na kašnjenje.
Navedite konkretna uputstva
Zatražite tačnu dužinu ili oblik koji želite. Primjeri:
„Navedite tačno pet opcija.”
„Napišite sažetak od 50 riječi.”
„Ne više od 100 tokena. Ako vam treba više, recite: ‘Treba mi više prostora.’”
Koristite primjere dosljedne dužine
Primjeri učenja s malim brojem primjera koji odgovaraju željenoj dužini pomažu modelu da nastavi obrazac.
Primijenite strateške sekvence zaustavljanja
Koristite stop da zaustavite generisanje kada model dođe do graničnika ili granice numerisane liste.
{ "stop": ["
###", "6."] }Više kandidata
Dovršavanje razgovora: n vraća više dovršavanja u jednom pozivu.
API za odgovore: n nije podržan; ako vam treba više od jednog izlaza, uputite više poziva.
