Përmbledhje
Kontrollimi i gjatësisë së përgjigjes së një modeli është i dobishëm për disa arsye: ndihmon në menaxhimin e kostos (sepse paguani për token), përmirëson vonesën/performancën (përgjigjet më të shkurtra kthehen më shpejt) dhe siguron relevancën duke shmangur dalje tepër të gjata ose të stërholluara.
Këtë mund ta arrini duke përdorur kufij tokenësh, cilësime arsyetimi dhe hollësie, udhëzime të qarta, shembuj dhe sekuenca ndalimi. Për hollësitë më të fundit dhe më të plota, referojuni gjithmonë referencës zyrtare të API-së në platform.openai.com.
Vendosni një gjatësi maksimale të daljes
API e përgjigjeve
Përdoret për modelet GPT-5 dhe shumicën e modeleve të serisë o: përdorni max_output_tokens për të kufizuar numrin e tokenëve që do të gjenerojë modeli. Për kërkesat compaction_trigger, ose hiqni max_output_tokens, ose vendoseni të paktën në 20000; vlerat më të vogla refuzohen. API e përgjigjeve nuk mbështet përfundime të shumëfishta (n).
API i përfundimeve të bisedës
Përdoret për GPT-3.5, GPT-4o të vjetra dhe ndonjëherë për serinë o.
Për modelet e arsyetimit si o3 dhe o4-mini, përdorni
max_completion_tokens(alias imax_tokens)Për modelet e mëparshme/jo të arsyetimit,
max_tokensfunksionon endeMbështet
stopdhen(përfundime të shumëfishta).
Shënim: Nuk ka cilësim për “minimum tokens”. Nëse ju duhet një gjatësi minimale, specifikojeni te kërkesa juaj.
Kufijtë e tokenëve sipas grupit të modeleve
Për kufijtë më të fundit të tokenëve, madhësitë e kontekstit dhe kufizimet e daljes, ju lutemi konsultoni dokumentacionin e modelit përkatës.
Shembuj të shpejtë
API e përgjigjeve
{ "model": "gpt-5", "input": "Përmblidh gjetjet në ~80 fjalë.", "max_output_tokens": 120 }Përfundimet e bisedës (model arsyetimi)
{ "model": "o3-mini", "messages": [{"role": "user", "content": "Write five one-line options."}], "max_completion_tokens": 100 }Kontrollet specifike të modeleve GPT-5: verbosity dhe reasoning.effort
Këto kontrolle janë të disponueshme vetëm në modelet GPT-5 (gpt-5.2, gpt-5.2-chat-latest, gpt-5.2 pro, etj.). Modelet e serisë O dhe modelet e vjetra nuk i mbështesin ato.
`verbosity` pranon "low", "medium" (parazgjedhje) ose "high". Ndikon në nivelin e detajeve, por jo në kufijtë e prerë.
{ "model": "gpt-5", "input": "Shpjego PageRank në nivel të lartë.", "text": { "verbosity": "low" }, "max_output_tokens": 200 }`reasoning.effort` kontrollon sa tokenë arsyetimi gjenerohen përpara se të prodhohet një përgjigje. GPT-5.2 mbështet none,low, medium, high,and xhigh. gpt-5.2-pro mbështet vetëm medium, high,and xhigh. Modelet e mëparshme të arsyetimit mbështesin vetëm low, medium dhe high.
{ "model": "gpt-5", "input": "Sa ar do të duhej për të veshur Statujën e Lirisë me një shtresë 1 mm?", "reasoning": { "effort": "minimal" } }Mund ta vendosni `reasoning.effort` në none që modeli të sillet si një model jo arsyetimi për raste përdorimi të ndjeshme ndaj vonesës.
Jepni udhëzime specifike
Kërkoni gjatësinë ose formën e saktë që dëshironi. Shembuj:
“Listo saktësisht pesë opsione.”
“Shkruaj një përmbledhje me 50 fjalë.”
“Jo më shumë se 100 tokenë. Nëse të duhet më shumë, thuaj ‘Më duhet më shumë hapësirë.’”
Përdorni shembuj me gjatësi të qëndrueshme
Shembujt me pak shembuj që përputhen me gjatësinë e dëshiruar e ndihmojnë modelin të vazhdojë modelin.
Zbatoni sekuenca strategjike ndalimi
Përdorni stop për të ndalur gjenerimin kur modeli arrin një ndarës ose kufirin e një liste të numëruar.
{ "stop": ["
###", "6."] }Kandidatë të shumëfishtë
Përfundimet e bisedës:
nkthen përfundime të shumëfishta në një thirrje të vetme.API e përgjigjeve:
nnuk mbështetet; bëni thirrje të shumta nëse ju duhet më shumë se një dalje.
