OpenAI
Ova stranica je mašinski prevedena. Pogledaj originalni članak na engleskom jeziku.

Kontrola dužine odgovora OpenAI modela

Saznajte kako postaviti ograničenja izlaza za OpenAI modele pomoću postavki tokena, jasnih upita, primjera i stop sekvenci.

Ažurirano: 2 days ago

Pregled

Kontrolisanje dužine odgovora modela korisno je iz više razloga: pomaže u upravljanju troškovima (jer plaćate po tokenu), poboljšava latenciju/performanse (kraći odgovori se brže vraćaju) i osigurava relevantnost izbjegavanjem predugih ili preopširnih izlaza.

To možete postići pomoću ograničenja tokena, postavki rezonovanja i opširnosti, jasnih uputstava, primjera i stop sekvenci. Za najaktuelnije i potpune detalje uvijek pogledajte zvaničnu API referencu na platform.openai.com.

Postavite maksimalnu dužinu izlaza

API za odgovore

Koristi se za modele GPT-5 i većinu modela serije o: koristite max_output_tokens da ograničite broj tokena koje će model generisati. Kod zahtjeva compaction_trigger izostavite max_output_tokens ili ga postavite na najmanje 20000; manje vrijednosti se odbijaju. API za odgovore ne podržava višestruka dovršavanja (n).

API za dovršavanje razgovora

Koristi se za starije modele GPT-3.5 i GPT-4o, a ponekad i za modele serije o.

  • Za modele rezonovanja kao što su o3 i o4-mini koristite max_completion_tokens (pseudonim za max_tokens)

  • Za ranije modele i modele bez rezonovanja i dalje radi max_tokens

  • Podržava stop i n (višestruka dovršavanja).

Napomena: Ne postoji postavka za “minimalan broj tokena”. Ako vam treba minimalna dužina, navedite to u svom upitu.

Ograničenja tokena po grupi modela

Za najnovija ograničenja tokena, veličine konteksta i ograničenja izlaza pogledajte dokumentaciju za određeni model.

Brzi primjeri

Responses API

{ "model": "gpt-5", "input": "Sažmi nalaze u oko 80 riječi.", "max_output_tokens": 120 }

Chat Completions (model rezonovanja)

{ "model": "o3-mini", "messages": [{"role": "user", "content": "Write five one-line options."}], "max_completion_tokens": 100 }

Kontrole specifične za modele GPT-5: verbosity i reasoning.effort

Ove kontrole su dostupne samo na modelima GPT-5 (gpt-5.2, gpt-5.2-chat-latest, gpt-5.2 pro itd.). Modeli serije o i stariji modeli ih ne podržavaju.


verbosity prihvata vrijednosti „low“, „medium“ (zadana vrijednost) ili „high“. Utječe na nivo detalja, ali ne i na stroga ograničenja.

{ "model": "gpt-5", "input": "Objasni PageRank na visokom nivou.", "text": { "verbosity": "low" }, "max_output_tokens": 200 }

reasoning.effort određuje koliko se tokena za rezonovanje generiše prije izrade odgovora. GPT-5.2 podržava none, low, medium, high i xhigh. gpt-5.2-pro podržava samo medium, high i xhigh. Raniji modeli rezonovanja podržavaju samo low, medium i high.

{ "model": "gpt-5", "input": "Koliko bi zlata bilo potrebno da se Kip slobode prekrije slojem od 1 mm?", "reasoning": { "effort": "minimal" } }

Možete postaviti reasoning.effort na none kako bi se model ponašao kao model bez rezonovanja u slučajevima primjene osjetljivim na kašnjenje.

Navedite konkretna uputstva

Zatražite tačnu dužinu ili oblik koji želite. Primjeri:

  • „Navedite tačno pet opcija.”

  • „Napišite sažetak od 50 riječi.”

  • „Ne više od 100 tokena. Ako vam treba više, recite: ‘Treba mi više prostora.’”

Koristite primjere dosljedne dužine

Primjeri učenja s malim brojem primjera koji odgovaraju željenoj dužini pomažu modelu da nastavi obrazac.

Primijenite strateške sekvence zaustavljanja

Koristite stop da zaustavite generisanje kada model dođe do graničnika ili granice numerisane liste.

{ "stop": ["
###", "6."] }

Više kandidata

  • Dovršavanje razgovora: n vraća više dovršavanja u jednom pozivu.

  • API za odgovore: n nije podržan; ako vam treba više od jednog izlaza, uputite više poziva.

Da li je ovaj članak bio koristan?