Përmbledhje
Kontrollimi i gjatësisë së përgjigjes së një modeli është i dobishëm për disa arsye: ndihmon në menaxhimin e kostos (sepse paguani për token), përmirëson vonesën/performancën (përgjigjet më të shkurtra kthehen më shpejt) dhe siguron relevancën duke shmangur dalje tepër të gjata ose të stërholluara.
Këtë mund ta arrini duke përdorur kufij tokenësh, cilësime arsyetimi dhe hollësie, udhëzime të qarta, shembuj dhe sekuenca ndalimi. Për hollësitë më të fundit dhe më të plota, referojuni gjithmonë referencës zyrtare të API-së në platform.openai.com.
Vendosni një gjatësi maksimale të daljes
API-ja Responses
Përdoret për modelet GPT-5 dhe shumicën e modeleve të serisë o: përdorni max_output_tokens për të kufizuar numrin e tokenëve që do të gjenerojë modeli. Për kërkesat compaction_trigger, hiqeni max_output_tokens ose caktojeni në të paktën 20000; vlerat më të vogla refuzohen. API-ja Responses nuk mbështet përfundime të shumëfishta (n).
API i përfundimeve të bisedës
Përdoret për modelet e mëparshme GPT-3.5, GPT-4o dhe, ndonjëherë, për serinë o.
Për modelet e arsyetimit si o3 dhe o4-mini, përdorni max_completion_tokens (pseudonim i max_tokens)
Për modelet e mëparshme ose pa arsyetim, max_tokens vazhdon të funksionojë
Mbështet stop dhe n (përfundime të shumëfishta).
Shënim: Nuk ka cilësim për “minimum tokens”. Nëse ju duhet një gjatësi minimale, specifikojeni te kërkesa juaj.
Kufijtë e tokenëve sipas grupit të modeleve
Për kufijtë më të fundit të tokenëve, madhësitë e kontekstit dhe kufizimet e daljes, ju lutemi konsultoni dokumentacionin e modelit përkatës.
Shembuj të shpejtë
API e përgjigjeve
{ "model": "gpt-5", "input": "Përmblidh gjetjet në ~80 fjalë.", "max_output_tokens": 120 }Përfundimet e bisedës (model arsyetimi)
{ "model": "o3-mini", "messages": [{"role": "user", "content": "Write five one-line options."}], "max_completion_tokens": 100 }Kontrollet specifike për modelet GPT-5: verbosity dhe reasoning.effort
Këto kontrolle janë të disponueshme vetëm në modelet GPT-5 (gpt-5.2, gpt-5.2-chat-latest, gpt-5.2 pro etj.). Modelet e serisë o dhe modelet e mëparshme nuk i mbështesin ato.
verbosity pranon "low", "medium" (parazgjedhja) ose "high". Ndikon në nivelin e hollësive, por jo në kufijtë absolutë.
{ "model": "gpt-5", "input": "Shpjego PageRank në nivel të lartë.", "text": { "verbosity": "low" }, "max_output_tokens": 200 }reasoning.effort kontrollon numrin e tokenëve të arsyetimit që gjenerohen para se të jepet një përgjigje. GPT-5.2 mbështet none, low, medium, high dhe xhigh. gpt-5.2-pro mbështet vetëm medium, high dhe xhigh. Modelet e mëparshme të arsyetimit mbështesin vetëm low, medium dhe high.
{ "model": "gpt-5", "input": "Sa ar do të duhej për të veshur Statujën e Lirisë me një shtresë 1 mm?", "reasoning": { "effort": "minimal" } }Mund ta caktoni reasoning.effort në none që modeli të sillet si model pa arsyetim në rastet e përdorimit ku koha e përgjigjes është kritike.
Jepni udhëzime specifike
Kërkoni gjatësinë ose formën e saktë që dëshironi. Shembuj:
“Listo saktësisht pesë opsione.”
“Shkruaj një përmbledhje me 50 fjalë.”
“Jo më shumë se 100 tokenë. Nëse të duhet më shumë, thuaj ‘Më duhet më shumë hapësirë.’”
Përdorni shembuj me gjatësi të qëndrueshme
Shembujt me pak shembuj që përputhen me gjatësinë e dëshiruar e ndihmojnë modelin të vazhdojë modelin.
Përdorni në mënyrë strategjike sekuencat e ndalimit
Përdorni stop për ta ndalur gjenerimin kur modeli arrin te një kufizues ose te kufiri i një liste të numëruar.
{ "stop": ["
###", "6."] }Kandidatë të shumtë
API i përfundimeve të bisedës: n kthen disa përfundime me një thirrje të vetme.
API-ja Responses: n nuk mbështetet; kryeni disa thirrje nëse ju duhet më shumë se një rezultat.
