Pregled
Kontroliranje duljine odgovora modela korisno je iz nekoliko razloga: pomaže u upravljanju troškovima (jer plaćate po tokenu), poboljšava latenciju/performanse (kraći se odgovori vraćaju brže) i osigurava relevantnost izbjegavanjem predugih ili preopširnih izlaza.
To možete postići pomoću ograničenja tokena, postavki rasuđivanja i opširnosti, jasnih uputa, primjera i zaustavnih sekvenci. Za najnovije i potpune pojedinosti uvijek pogledajte službenu referencu API-ja na platform.openai.com.
Postavite maksimalnu duljinu izlaza
API Responses
Upotrebljava se za modele GPT-5 i većinu modela serije o: parametrom max_output_tokens ograničite broj tokena koje će model generirati. Za zahtjeve compaction_trigger izostavite max_output_tokens ili ga postavite na najmanje 20000; manje se vrijednosti odbijaju. API Responses ne podržava više dovršetaka (n).
API za dovršavanje razgovora
Upotrebljava se za naslijeđene modele GPT-3.5 i GPT-4o, a ponekad i za seriju o.
Za modele za rasuđivanje kao što su o3 i o4-mini upotrijebite max_completion_tokens (alias parametra max_tokens)
Za ranije modele i modele bez rasuđivanja i dalje radi max_tokens
Podržava stop i n (više dovršetaka).
Napomena: Ne postoji postavka za „minimalan broj tokena”. Ako vam je potrebna minimalna duljina, navedite to u upitu.
Ograničenja tokena prema skupini modela
Za ažurna ograničenja tokena, veličine konteksta i gornje granice izlaza pogledajte dokumentaciju za određeni model.
Brzi primjeri
Responses API
{ "model": "gpt-5", "input": "Sažmi nalaze u otprilike 80 riječi.", "max_output_tokens": 120 }Dovršavanja razgovora (model za rasuđivanje)
{ "model": "o3-mini", "messages": [{"role": "user", "content": "Write five one-line options."}], "max_completion_tokens": 100 }Kontrole specifične za modele GPT-5: verbosity i reasoning.effort
Te su kontrole dostupne samo na modelima GPT-5 (gpt-5.2, gpt-5.2-chat-latest, gpt-5.2 pro itd.). Modeli serije o i naslijeđeni modeli ne podržavaju ih.
verbosity prihvaća vrijednosti "low", "medium" (zadano) ili "high". Utječe na razinu detalja, ali ne i na čvrsta ograničenja.
{ "model": "gpt-5", "input": "Objasni PageRank na visokoj razini.", "text": { "verbosity": "low" }, "max_output_tokens": 200 }reasoning.effort određuje koliko će se tokena za rasuđivanje generirati prije izrade odgovora. GPT-5.2 podržava none, low, medium, high i xhigh. gpt-5.2-pro podržava samo medium, high i xhigh. Raniji modeli za rasuđivanje podržavaju samo low, medium i high.
{ "model": "gpt-5", "input": "Koliko bi zlata trebalo da se Kip slobode obloži slojem od 1 mm?", "reasoning": { "effort": "minimal" } }reasoning.effort možete postaviti na none kako bi se model ponašao kao model bez rasuđivanja u slučajevima upotrebe osjetljivima na latenciju.
Unesite konkretne upute
Zatražite točnu duljinu ili oblik koji želite. Primjeri:
„Navedite točno pet opcija.”
„Napišite sažetak od 50 riječi.”
„Ne više od 100 tokena. Ako vam treba više, recite: ‚Treba mi više prostora.’”
Upotrebljavajte primjere dosljedne duljine
Primjeri učenja s malim brojem primjera koji odgovaraju željenoj duljini pomažu modelu da nastavi obrazac.
Strateški primijenite sekvence za zaustavljanje
Upotrijebite stop kako biste zaustavili generiranje kada model dosegne graničnik ili granicu numeriranog popisa.
{ "stop": ["
###", "6."] }Više kandidata
Dovršavanje razgovora: n vraća više dovršetaka u jednom pozivu.
API Responses: n nije podržan; ako trebate više izlaznih rezultata, uputite više poziva.
