OpenAI
Ova stranica je mašinski prevedena. Pogledaj originalni članak na engleskom jeziku.

Kontrola dužine odgovora OpenAI modela

Saznajte kako postaviti ograničenja izlaza za OpenAI modele pomoću postavki tokena, jasnih upita, primjera i stop sekvenci.

Ažurirano: 8 days ago

Pregled

Kontrolisanje dužine odgovora modela korisno je iz više razloga: pomaže u upravljanju troškovima (jer plaćate po tokenu), poboljšava latenciju/performanse (kraći odgovori se brže vraćaju) i osigurava relevantnost izbjegavanjem predugih ili preopširnih izlaza.

To možete postići pomoću ograničenja tokena, postavki rezonovanja i opširnosti, jasnih uputstava, primjera i stop sekvenci. Za najaktuelnije i potpune detalje uvijek pogledajte zvaničnu API referencu na platform.openai.com.

Postavite maksimalnu dužinu izlaza

Responses API

Koristi se za GPT-5 modele i većinu modela o-serije: koristite max_output_tokens za ograničavanje broja tokena koje će model generisati. Za zahtjeve compaction_trigger, izostavite max_output_tokens ili ga postavite na najmanje 20000; manje vrijednosti se odbijaju. Responses API ne podržava višestruka dovršavanja (n).

API za dovršavanje razgovora

Koristi se za naslijeđene GPT-3.5, GPT-4o i ponekad o-seriju.

  • Za modele rezonovanja kao što su o3 i o4-mini koristite max_completion_tokens (alias za max_tokens)

  • Za ranije modele/modele bez rezonovanja, max_tokens i dalje radi

  • Podržava stop i n (višestruka dovršavanja).

Napomena: Ne postoji postavka za “minimalan broj tokena”. Ako vam treba minimalna dužina, navedite to u svom upitu.

Ograničenja tokena po grupi modela

Za najnovija ograničenja tokena, veličine konteksta i ograničenja izlaza pogledajte dokumentaciju za određeni model.

Brzi primjeri

Responses API

{ "model": "gpt-5", "input": "Sažmi nalaze u oko 80 riječi.", "max_output_tokens": 120 }

Chat Completions (model rezonovanja)

{ "model": "o3-mini", "messages": [{"role": "user", "content": "Write five one-line options."}], "max_completion_tokens": 100 }

Kontrole specifične za GPT-5 modele: verbosity i reasoning.effort

Ove kontrole su dostupne samo na GPT-5 modelima (gpt-5.2, gpt-5.2-chat-latest, gpt-5.2 pro itd.). O-series i naslijeđeni modeli ih ne podržavaju.

`verbosity` prihvata "low", "medium" (zadano) ili "high". Utiče na nivo detalja, ali ne i na stroga ograničenja.

{ "model": "gpt-5", "input": "Objasni PageRank na visokom nivou.", "text": { "verbosity": "low" }, "max_output_tokens": 200 }

`reasoning.effort` kontroliše koliko se tokena rezonovanja generiše prije stvaranja odgovora. GPT-5.2 podržava none,low, medium, high,and xhigh. gpt-5.2-pro podržava samo medium, high,and xhigh. Raniji modeli rezonovanja podržavaju samo low, medium i high.

{ "model": "gpt-5", "input": "Koliko bi zlata bilo potrebno da se Kip slobode prekrije slojem od 1 mm?", "reasoning": { "effort": "minimal" } }

Možete postaviti `reasoning.effort` na none kako bi se model ponašao kao model bez rezonovanja za slučajeve upotrebe osjetljive na latenciju.

Navedite konkretna uputstva

Zatražite tačnu dužinu ili oblik koji želite. Primjeri:

  • „Navedite tačno pet opcija.”

  • „Napišite sažetak od 50 riječi.”

  • „Ne više od 100 tokena. Ako vam treba više, recite: ‘Treba mi više prostora.’”

Koristite primjere dosljedne dužine

Primjeri učenja s malim brojem primjera koji odgovaraju željenoj dužini pomažu modelu da nastavi obrazac.

Primijenite strateške stop sekvence

Koristite stop za zaustavljanje generisanja kada model dosegne razdjelnik ili granicu numerisane liste.

{ "stop": ["
###", "6."] }

Višestruki kandidati

  • Chat Completions: n vraća višestruka dovršavanja u jednom pozivu.

  • Responses API: n nije podržan; napravite više poziva ako vam treba više od jednog izlaza.

Da li je ovaj članak bio koristan?