OpenAI
Kjo faqe u përkthye automatikisht. Shih artikullin origjinal në anglisht.

Kontrollimi i gjatësisë së përgjigjeve të modelit të OpenAI

Mësoni si të vendosni kufij të daljes për modelet e OpenAI duke përdorur cilësime tokenësh, kërkesa të qarta, shembuj dhe sekuenca ndalimi.

Përditësuar: last month

Përmbledhje

Kontrollimi i gjatësisë së përgjigjes së një modeli është i dobishëm për disa arsye: ndihmon në menaxhimin e kostos (sepse paguani për token), përmirëson vonesën/performancën (përgjigjet më të shkurtra kthehen më shpejt) dhe siguron relevancën duke shmangur dalje tepër të gjata ose të stërholluara.

Këtë mund ta arrini duke përdorur kufij tokenësh, cilësime arsyetimi dhe hollësie, udhëzime të qarta, shembuj dhe sekuenca ndalimi. Për hollësitë më të fundit dhe më të plota, referojuni gjithmonë referencës zyrtare të API-së në platform.openai.com.

Vendosni një gjatësi maksimale të daljes

API-ja Responses

Përdoret për modelet GPT-5 dhe shumicën e modeleve të serisë o: përdorni max_output_tokens për të kufizuar numrin e tokenëve që do të gjenerojë modeli. Për kërkesat compaction_trigger, hiqeni max_output_tokens ose caktojeni në të paktën 20000; vlerat më të vogla refuzohen. API-ja Responses nuk mbështet përfundime të shumëfishta (n).

API i përfundimeve të bisedës

Përdoret për modelet e mëparshme GPT-3.5, GPT-4o dhe, ndonjëherë, për serinë o.

  • Për modelet e arsyetimit si o3 dhe o4-mini, përdorni max_completion_tokens (pseudonim i max_tokens)

  • Për modelet e mëparshme ose pa arsyetim, max_tokens vazhdon të funksionojë

  • Mbështet stop dhe n (përfundime të shumëfishta).

Shënim: Nuk ka cilësim për “minimum tokens”. Nëse ju duhet një gjatësi minimale, specifikojeni te kërkesa juaj.

Kufijtë e tokenëve sipas grupit të modeleve

Për kufijtë më të fundit të tokenëve, madhësitë e kontekstit dhe kufizimet e daljes, ju lutemi konsultoni dokumentacionin e modelit përkatës.

Shembuj të shpejtë

API e përgjigjeve

{ "model": "gpt-5", "input": "Përmblidh gjetjet në ~80 fjalë.", "max_output_tokens": 120 }

Përfundimet e bisedës (model arsyetimi)

{ "model": "o3-mini", "messages": [{"role": "user", "content": "Write five one-line options."}], "max_completion_tokens": 100 }

Kontrollet specifike për modelet GPT-5: verbosity dhe reasoning.effort

Këto kontrolle janë të disponueshme vetëm në modelet GPT-5 (gpt-5.2, gpt-5.2-chat-latest, gpt-5.2 pro etj.). Modelet e serisë o dhe modelet e mëparshme nuk i mbështesin ato.


verbosity pranon "low", "medium" (parazgjedhja) ose "high". Ndikon në nivelin e hollësive, por jo në kufijtë absolutë.

{ "model": "gpt-5", "input": "Shpjego PageRank në nivel të lartë.", "text": { "verbosity": "low" }, "max_output_tokens": 200 }

reasoning.effort kontrollon numrin e tokenëve të arsyetimit që gjenerohen para se të jepet një përgjigje. GPT-5.2 mbështet none, low, medium, high dhe xhigh. gpt-5.2-pro mbështet vetëm medium, high dhe xhigh. Modelet e mëparshme të arsyetimit mbështesin vetëm low, medium dhe high.

{ "model": "gpt-5", "input": "Sa ar do të duhej për të veshur Statujën e Lirisë me një shtresë 1 mm?", "reasoning": { "effort": "minimal" } }

Mund ta caktoni reasoning.effortnone që modeli të sillet si model pa arsyetim në rastet e përdorimit ku koha e përgjigjes është kritike.

Jepni udhëzime specifike

Kërkoni gjatësinë ose formën e saktë që dëshironi. Shembuj:

  • “Listo saktësisht pesë opsione.”

  • “Shkruaj një përmbledhje me 50 fjalë.”

  • “Jo më shumë se 100 tokenë. Nëse të duhet më shumë, thuaj ‘Më duhet më shumë hapësirë.’”

Përdorni shembuj me gjatësi të qëndrueshme

Shembujt me pak shembuj që përputhen me gjatësinë e dëshiruar e ndihmojnë modelin të vazhdojë modelin.

Përdorni në mënyrë strategjike sekuencat e ndalimit

Përdorni stop për ta ndalur gjenerimin kur modeli arrin te një kufizues ose te kufiri i një liste të numëruar.

{ "stop": ["
###", "6."] }

Kandidatë të shumtë

  • API i përfundimeve të bisedës: n kthen disa përfundime me një thirrje të vetme.

  • API-ja Responses: n nuk mbështetet; kryeni disa thirrje nëse ju duhet më shumë se një rezultat.

A ishte i dobishëm ky artikull?