Pregled
Kontrolisanje dužine odgovora modela korisno je iz više razloga: pomaže u upravljanju troškovima (jer plaćate po tokenu), poboljšava latenciju/performanse (kraći odgovori se brže vraćaju) i osigurava relevantnost izbjegavanjem predugih ili preopširnih izlaza.
To možete postići pomoću ograničenja tokena, postavki rezonovanja i opširnosti, jasnih uputstava, primjera i stop sekvenci. Za najaktuelnije i potpune detalje uvijek pogledajte zvaničnu API referencu na platform.openai.com.
Postavite maksimalnu dužinu izlaza
Responses API
Koristi se za GPT-5 modele i većinu modela o-serije: koristite max_output_tokens za ograničavanje broja tokena koje će model generisati. Za zahtjeve compaction_trigger, izostavite max_output_tokens ili ga postavite na najmanje 20000; manje vrijednosti se odbijaju. Responses API ne podržava višestruka dovršavanja (n).
API za dovršavanje razgovora
Koristi se za naslijeđene GPT-3.5, GPT-4o i ponekad o-seriju.
Za modele rezonovanja kao što su o3 i o4-mini koristite
max_completion_tokens(alias zamax_tokens)Za ranije modele/modele bez rezonovanja,
max_tokensi dalje radiPodržava
stopin(višestruka dovršavanja).
Napomena: Ne postoji postavka za “minimalan broj tokena”. Ako vam treba minimalna dužina, navedite to u svom upitu.
Ograničenja tokena po grupi modela
Za najnovija ograničenja tokena, veličine konteksta i ograničenja izlaza pogledajte dokumentaciju za određeni model.
Brzi primjeri
Responses API
{ "model": "gpt-5", "input": "Sažmi nalaze u oko 80 riječi.", "max_output_tokens": 120 }Chat Completions (model rezonovanja)
{ "model": "o3-mini", "messages": [{"role": "user", "content": "Write five one-line options."}], "max_completion_tokens": 100 }Kontrole specifične za GPT-5 modele: verbosity i reasoning.effort
Ove kontrole su dostupne samo na GPT-5 modelima (gpt-5.2, gpt-5.2-chat-latest, gpt-5.2 pro itd.). O-series i naslijeđeni modeli ih ne podržavaju.
`verbosity` prihvata "low", "medium" (zadano) ili "high". Utiče na nivo detalja, ali ne i na stroga ograničenja.
{ "model": "gpt-5", "input": "Objasni PageRank na visokom nivou.", "text": { "verbosity": "low" }, "max_output_tokens": 200 }`reasoning.effort` kontroliše koliko se tokena rezonovanja generiše prije stvaranja odgovora. GPT-5.2 podržava none,low, medium, high,and xhigh. gpt-5.2-pro podržava samo medium, high,and xhigh. Raniji modeli rezonovanja podržavaju samo low, medium i high.
{ "model": "gpt-5", "input": "Koliko bi zlata bilo potrebno da se Kip slobode prekrije slojem od 1 mm?", "reasoning": { "effort": "minimal" } }Možete postaviti `reasoning.effort` na none kako bi se model ponašao kao model bez rezonovanja za slučajeve upotrebe osjetljive na latenciju.
Navedite konkretna uputstva
Zatražite tačnu dužinu ili oblik koji želite. Primjeri:
„Navedite tačno pet opcija.”
„Napišite sažetak od 50 riječi.”
„Ne više od 100 tokena. Ako vam treba više, recite: ‘Treba mi više prostora.’”
Koristite primjere dosljedne dužine
Primjeri učenja s malim brojem primjera koji odgovaraju željenoj dužini pomažu modelu da nastavi obrazac.
Primijenite strateške stop sekvence
Koristite stop za zaustavljanje generisanja kada model dosegne razdjelnik ili granicu numerisane liste.
{ "stop": ["
###", "6."] }Višestruki kandidati
Chat Completions:
nvraća višestruka dovršavanja u jednom pozivu.Responses API:
nnije podržan; napravite više poziva ako vam treba više od jednog izlaza.
