Apžvalga
Valdyti modelio atsakymo ilgį naudinga dėl kelių priežasčių: tai padeda valdyti išlaidas (nes mokate už kiekvieną žetoną), gerina delsą ir našumą (trumpesni atsakymai grąžinami greičiau) ir užtikrina aktualumą, išvengiant pernelyg ilgų ar išsamių atsakymų.
Tai galite pasiekti naudodami žetonų apribojimus, protavimo ir išsamumo nustatymus, aiškias instrukcijas, pavyzdžius ir stabdymo sekas. Naujausią ir išsamiausią informaciją visada rasite oficialioje API nuorodoje platform.openai.com.
Nustatykite maksimalų išvesties ilgį
Atsakymų API
Naudojama GPT-5 ir daugumai o serijos modelių: modelio generuojamų žetonų skaičių apribokite naudodami max_output_tokens. Teikdami compaction_trigger užklausas, nenurodykite max_output_tokens arba nustatykite bent 20000; mažesnės reikšmės atmetamos. Atsakymų API nepalaiko kelių užbaigimų (n).
Pokalbių užbaigimo API
Naudojama ankstesniems GPT-3.5, GPT-4o, o kartais ir o serijos modeliams.
Protavimo modeliams, pvz., OpenAI o3 ir o4-mini, naudokite max_completion_tokens (alternatyvus max_tokens pavadinimas)
Ankstesniuose arba ne protavimo modeliuose vis dar veikia max_tokens
Palaiko stop ir n (kelis užbaigimus).
Pastaba: Nėra „minimalaus žetonų skaičiaus“ nustatymo. Jei jums reikia minimalaus ilgio, nurodykite tai savo užklausoje.
Žetonų limitai pagal modelių grupę
Naujausius žetonų limitus, konteksto dydžius ir išvesties apribojimus rasite konkretaus modelio dokumentacijoje.
Trumpi pavyzdžiai
Responses API
{ "model": "gpt-5", "input": "Apibendrinkite išvadas ~80 žodžių.", "max_output_tokens": 120 }Chat Completions (protavimo modelis)
{ "model": "o3-mini", "messages": [{"role": "user", "content": "Write five one-line options."}], "max_completion_tokens": 100 }GPT-5 modelių parametrai: verbosity ir reasoning.effort
Šie parametrai pasiekiami tik GPT-5 modeliuose (gpt-5.2, gpt-5.2-chat-latest, gpt-5.2 pro ir kt.). O serijos ir ankstesni modeliai jų nepalaiko.
verbosity galimos reikšmės: "low", "medium" (numatytoji) arba "high". Šis parametras lemia detalumą, tačiau nekeičia nustatytų ribų.
{ "model": "gpt-5", "input": "Aukštu lygiu paaiškinkite PageRank.", "text": { "verbosity": "low" }, "max_output_tokens": 200 }reasoning.effort nustato, kiek protavimo žetonų sugeneruojama prieš pateikiant atsakymą. GPT-5.2 palaiko none, low, medium, high ir xhigh. gpt-5.2-pro palaiko tik medium, high ir xhigh. Ankstesni protavimo modeliai palaiko tik low, medium ir high.
{ "model": "gpt-5", "input": "Kiek aukso reikėtų, kad Laisvės statulą padengtų 1 mm sluoksnis?", "reasoning": { "effort": "minimal" } }Galite nustatyti reasoning.effort reikšmę none, kad modelis veiktų kaip ne protavimo modelis tais atvejais, kai svarbu sumažinti delsą.
Pateikite konkrečias instrukcijas
Paprašykite tiksliai nurodydami norimą ilgį ar formą. Pavyzdžiai:
„Išvardykite lygiai penkias parinktis.“
„Parašykite 50 žodžių santrauką.“
„Ne daugiau kaip 100 žetonų. Jei reikia daugiau, parašykite „Reikia daugiau vietos.““
Naudokite vienodo ilgio pavyzdžius
Naudojant kelis pavyzdžius, jų ilgis turėtų atitikti pageidaujamą – taip modelis lengviau tęs šabloną.
Strategiškai taikykite stabdymo sekas
Naudokite stop, kad generavimas būtų sustabdytas modeliui pasiekus skirtuką arba numeruoto sąrašo ribą.
{ "stop": ["
###", "6."] }Keli variantai
Pokalbių užbaigimai: n vienu iškvietimu pateikia kelis užbaigimus.
Atsakymų API: n nepalaikomas; jei reikia daugiau nei vieno rezultato, atlikite kelis iškvietimus.
