OpenAI
Kjo faqe u përkthye automatikisht. Shih artikullin origjinal në anglisht.

Kontrollimi i gjatësisë së përgjigjeve të modelit të OpenAI

Mësoni si të vendosni kufij të daljes për modelet e OpenAI duke përdorur cilësime tokenësh, kërkesa të qarta, shembuj dhe sekuenca ndalimi.

Përditësuar: 6 days ago

Përmbledhje

Kontrollimi i gjatësisë së përgjigjes së një modeli është i dobishëm për disa arsye: ndihmon në menaxhimin e kostos (sepse paguani për token), përmirëson vonesën/performancën (përgjigjet më të shkurtra kthehen më shpejt) dhe siguron relevancën duke shmangur dalje tepër të gjata ose të stërholluara.

Këtë mund ta arrini duke përdorur kufij tokenësh, cilësime arsyetimi dhe hollësie, udhëzime të qarta, shembuj dhe sekuenca ndalimi. Për hollësitë më të fundit dhe më të plota, referojuni gjithmonë referencës zyrtare të API-së në platform.openai.com.

Vendosni një gjatësi maksimale të daljes

API e përgjigjeve

Përdoret për modelet GPT-5 dhe shumicën e modeleve të serisë o: përdorni max_output_tokens për të kufizuar numrin e tokenëve që do të gjenerojë modeli. Për kërkesat compaction_trigger, ose hiqni max_output_tokens, ose vendoseni të paktën në 20000; vlerat më të vogla refuzohen. API e përgjigjeve nuk mbështet përfundime të shumëfishta (n).

API i përfundimeve të bisedës

Përdoret për GPT-3.5, GPT-4o të vjetra dhe ndonjëherë për serinë o.

  • Për modelet e arsyetimit si o3 dhe o4-mini, përdorni max_completion_tokens (alias i max_tokens)

  • Për modelet e mëparshme/jo të arsyetimit, max_tokens funksionon ende

  • Mbështet stop dhe n (përfundime të shumëfishta).

Shënim: Nuk ka cilësim për “minimum tokens”. Nëse ju duhet një gjatësi minimale, specifikojeni te kërkesa juaj.

Kufijtë e tokenëve sipas grupit të modeleve

Për kufijtë më të fundit të tokenëve, madhësitë e kontekstit dhe kufizimet e daljes, ju lutemi konsultoni dokumentacionin e modelit përkatës.

Shembuj të shpejtë

API e përgjigjeve

{ "model": "gpt-5", "input": "Përmblidh gjetjet në ~80 fjalë.", "max_output_tokens": 120 }

Përfundimet e bisedës (model arsyetimi)

{ "model": "o3-mini", "messages": [{"role": "user", "content": "Write five one-line options."}], "max_completion_tokens": 100 }

Kontrollet specifike të modeleve GPT-5: verbosity dhe reasoning.effort

Këto kontrolle janë të disponueshme vetëm në modelet GPT-5 (gpt-5.2, gpt-5.2-chat-latest, gpt-5.2 pro, etj.). Modelet e serisë O dhe modelet e vjetra nuk i mbështesin ato.

`verbosity` pranon "low", "medium" (parazgjedhje) ose "high". Ndikon në nivelin e detajeve, por jo në kufijtë e prerë.

{ "model": "gpt-5", "input": "Shpjego PageRank në nivel të lartë.", "text": { "verbosity": "low" }, "max_output_tokens": 200 }

`reasoning.effort` kontrollon sa tokenë arsyetimi gjenerohen përpara se të prodhohet një përgjigje. GPT-5.2 mbështet none,low, medium, high,and xhigh. gpt-5.2-pro mbështet vetëm medium, high,and xhigh. Modelet e mëparshme të arsyetimit mbështesin vetëm low, medium dhe high.

{ "model": "gpt-5", "input": "Sa ar do të duhej për të veshur Statujën e Lirisë me një shtresë 1 mm?", "reasoning": { "effort": "minimal" } }

Mund ta vendosni `reasoning.effort`none që modeli të sillet si një model jo arsyetimi për raste përdorimi të ndjeshme ndaj vonesës.

Jepni udhëzime specifike

Kërkoni gjatësinë ose formën e saktë që dëshironi. Shembuj:

  • “Listo saktësisht pesë opsione.”

  • “Shkruaj një përmbledhje me 50 fjalë.”

  • “Jo më shumë se 100 tokenë. Nëse të duhet më shumë, thuaj ‘Më duhet më shumë hapësirë.’”

Përdorni shembuj me gjatësi të qëndrueshme

Shembujt me pak shembuj që përputhen me gjatësinë e dëshiruar e ndihmojnë modelin të vazhdojë modelin.

Zbatoni sekuenca strategjike ndalimi

Përdorni stop për të ndalur gjenerimin kur modeli arrin një ndarës ose kufirin e një liste të numëruar.

{ "stop": ["
###", "6."] }

Kandidatë të shumëfishtë

  • Përfundimet e bisedës: n kthen përfundime të shumëfishta në një thirrje të vetme.

  • API e përgjigjeve: n nuk mbështetet; bëni thirrje të shumta nëse ju duhet më shumë se një dalje.

A ishte i dobishëm ky artikull?