OpenAI
Ova je stranica strojno prevedena. Pogledajte izvorni članak na engleskom jeziku.

Kontroliranje duljine odgovora modela OpenAI-ja

Saznajte kako postaviti ograničenja izlaza za OpenAI modele pomoću postavki tokena, jasnih upita, primjera i stop-sekvenci.

Ažurirano: 12 days ago

Pregled

Kontroliranje duljine odgovora modela korisno je iz nekoliko razloga: pomaže u upravljanju troškovima (jer plaćate po tokenu), poboljšava latenciju/performanse (kraći se odgovori vraćaju brže) i osigurava relevantnost izbjegavanjem predugih ili preopširnih izlaza.

To možete postići pomoću ograničenja tokena, postavki rasuđivanja i opširnosti, jasnih uputa, primjera i zaustavnih sekvenci. Za najnovije i potpune pojedinosti uvijek pogledajte službenu referencu API-ja na platform.openai.com.

Postavite maksimalnu duljinu izlaza

API Responses

Upotrebljava se za modele GPT-5 i većinu modela serije o: parametrom max_output_tokens ograničite broj tokena koje će model generirati. Za zahtjeve compaction_trigger izostavite max_output_tokens ili ga postavite na najmanje 20000; manje se vrijednosti odbijaju. API Responses ne podržava više dovršetaka (n).

API za dovršavanje razgovora

Upotrebljava se za naslijeđene modele GPT-3.5 i GPT-4o, a ponekad i za seriju o.

  • Za modele za rasuđivanje kao što su o3 i o4-mini upotrijebite max_completion_tokens (alias parametra max_tokens)

  • Za ranije modele i modele bez rasuđivanja i dalje radi max_tokens

  • Podržava stop i n (više dovršetaka).

Napomena: Ne postoji postavka za „minimalan broj tokena”. Ako vam je potrebna minimalna duljina, navedite to u upitu.

Ograničenja tokena prema skupini modela

Za ažurna ograničenja tokena, veličine konteksta i gornje granice izlaza pogledajte dokumentaciju za određeni model.

Brzi primjeri

Responses API

{ "model": "gpt-5", "input": "Sažmi nalaze u otprilike 80 riječi.", "max_output_tokens": 120 }

Dovršavanja razgovora (model za rasuđivanje)

{ "model": "o3-mini", "messages": [{"role": "user", "content": "Write five one-line options."}], "max_completion_tokens": 100 }

Kontrole specifične za modele GPT-5: verbosity i reasoning.effort

Te su kontrole dostupne samo na modelima GPT-5 (gpt-5.2, gpt-5.2-chat-latest, gpt-5.2 pro itd.). Modeli serije o i naslijeđeni modeli ne podržavaju ih.


verbosity prihvaća vrijednosti "low", "medium" (zadano) ili "high". Utječe na razinu detalja, ali ne i na čvrsta ograničenja.

{ "model": "gpt-5", "input": "Objasni PageRank na visokoj razini.", "text": { "verbosity": "low" }, "max_output_tokens": 200 }

reasoning.effort određuje koliko će se tokena za rasuđivanje generirati prije izrade odgovora. GPT-5.2 podržava none, low, medium, high i xhigh. gpt-5.2-pro podržava samo medium, high i xhigh. Raniji modeli za rasuđivanje podržavaju samo low, medium i high.

{ "model": "gpt-5", "input": "Koliko bi zlata trebalo da se Kip slobode obloži slojem od 1 mm?", "reasoning": { "effort": "minimal" } }

reasoning.effort možete postaviti na none kako bi se model ponašao kao model bez rasuđivanja u slučajevima upotrebe osjetljivima na latenciju.

Unesite konkretne upute

Zatražite točnu duljinu ili oblik koji želite. Primjeri:

  • „Navedite točno pet opcija.”

  • „Napišite sažetak od 50 riječi.”

  • „Ne više od 100 tokena. Ako vam treba više, recite: ‚Treba mi više prostora.’”

Upotrebljavajte primjere dosljedne duljine

Primjeri učenja s malim brojem primjera koji odgovaraju željenoj duljini pomažu modelu da nastavi obrazac.

Strateški primijenite sekvence za zaustavljanje

Upotrijebite stop kako biste zaustavili generiranje kada model dosegne graničnik ili granicu numeriranog popisa.

{ "stop": ["
###", "6."] }

Više kandidata

  • Dovršavanje razgovora: n vraća više dovršetaka u jednom pozivu.

  • API Responses: n nije podržan; ako trebate više izlaznih rezultata, uputite više poziva.

Je li vam ovaj članak bio koristan?