OpenAI
Ta stran je bila strojno prevedena. Oglejte si izvirni članek v angleščini.

Nadzor dolžine odgovorov modelov OpenAI

Naučite se nastaviti omejitve izhoda za modele OpenAI z nastavitvami žetonov, jasnimi pozivi, primeri in zaporedji zaustavitve.

Posodobljeno: 8 days ago

Pregled

Nadzor dolžine odgovora modela je koristen iz več razlogov: pomaga upravljati stroške (ker plačujete na žeton), zmanjša zakasnitev in izboljša zmogljivost (krajši odgovori se vrnejo hitreje) ter zagotavlja ustreznost, saj preprečuje predolge ali preveč razvlečene izhode.

To lahko dosežete z omejitvami žetonov, nastavitvami sklepanja in podrobnosti, jasnimi navodili, primeri ter zaporedji zaustavitve. Za najnovejše in najpopolnejše informacije vedno glejte uradno referenčno dokumentacijo API-ja na platform.openai.com.

Nastavite največjo dolžino izhoda

API Responses

Uporablja se za modele GPT-5 in večino modelov serije o: uporabite max_output_tokens, da omejite število žetonov, ki jih bo model ustvaril. Pri zahtevah compaction_trigger izpustite max_output_tokens ali pa ga nastavite na najmanj 20000; manjše vrednosti so zavrnjene. API Responses ne podpira več dopolnitev (n).

API za dopolnitve klepeta

Uporablja se za starejši GPT-3.5, GPT-4o in včasih za modele serije o.

  • Za modele sklepanja, kot sta o3 in o4-mini, uporabite max_completion_tokens (vzdevek za max_tokens)

  • Pri starejših modelih oziroma modelih brez sklepanja max_tokens še vedno deluje

  • Podpira stop in n (več dopolnitev).

Opomba: Nastavitve za »najmanj žetonov« ni. Če potrebujete najmanjšo dolžino, jo navedite v pozivu.

Omejitve žetonov po skupinah modelov

Za najnovejše omejitve žetonov, velikosti konteksta in omejitve izhoda glejte dokumentacijo za posamezni model.

Hitri primeri

API Responses

{ "model": "gpt-5", "input": "Povzemi ugotovitve v približno 80 besedah.", "max_output_tokens": 120 }

Dopolnitve klepeta (model sklepanja)

{ "model": "o3-mini", "messages": [{"role": "user", "content": "Write five one-line options."}], "max_completion_tokens": 100 }

Kontrolniki, specifični za modele GPT-5: verbosity in reasoning.effort

Ti kontrolniki so na voljo samo pri modelih GPT-5 (gpt-5.2, gpt-5.2-chat-latest, gpt-5.2 pro itd.). Modeli serije O in starejši modeli jih ne podpirajo.

`verbosity` sprejema "low", "medium" (privzeto) ali "high". Vpliva na raven podrobnosti, ne pa na stroge omejitve.

{ "model": "gpt-5", "input": "Na visoki ravni razloži PageRank.", "text": { "verbosity": "low" }, "max_output_tokens": 200 }

`reasoning.effort` določa, koliko žetonov sklepanja se ustvari pred pripravo odgovora. GPT-5.2 podpira none,low, medium, high,and xhigh. gpt-5.2-pro podpira samo medium, high,and xhigh. Starejši modeli sklepanja podpirajo samo low, medium in high.

{ "model": "gpt-5", "input": "Koliko zlata bi potrebovali, da bi Kip svobode prekrili s plastjo debeline 1 mm?", "reasoning": { "effort": "minimal" } }

Za `reasoning.effort` lahko nastavite none, da se model v primerih, občutljivih na zakasnitev, obnaša kot model brez sklepanja.

Podajte konkretna navodila

Zahtevajte točno želeno dolžino ali obliko. Primeri:

  • »Navedi točno pet možnosti.«

  • »Napiši 50-besedni povzetek.«

  • »Največ 100 žetonov. Če potrebuješ več prostora, reci: ‚Potrebujem več prostora.‘«

Uporabite primere s skladno dolžino

Primeri za učenje iz malo primerov, ki ustrezajo želeni dolžini, modelu pomagajo nadaljevati vzorec.

Uporabite strateška zaporedja zaustavitve

Uporabite stop, da ustavite generiranje, ko model doseže ločilo ali mejo oštevilčenega seznama.

{ "stop": ["
###", "6."] }

Več kandidatov

  • Dopolnitve klepeta: n vrne več dopolnitev v enem klicu.

  • API Responses: n ni podprt; če potrebujete več kot en izhod, izvedite več klicev.

Ali vam je bil ta članek v pomoč?