Ringkesan
Ngatur dawane respons model migunani amarga sawetara sebab: mbantu ngatur biaya (amarga sampeyan mbayar saben token), ningkatake latensi/kinerja (respons luwih cekak bali luwih cepet), lan njaga relevansi kanthi ngindhari output sing kakehan dawa utawa kakehan rinci.
Iki bisa ditindakake nganggo wates token, setelan nalar lan verbosity, instruksi sing cetha, conto, lan urutan stop. Kanggo rincian sing paling anyar lan lengkap, tansah delengen referensi API resmi ing platform.openai.com.
Setel dawa output maksimal
Responses API
Digunakake kanggo model GPT-5 lan akeh-akehe model seri o: gunakna max_output_tokens kanggo matesi cacahing token sing bakal digawe model. Kanggo panyuwunan compaction_trigger, aja nyantumake max_output_tokens utawa setel paling sithik 20000; nilai sing luwih cilik bakal ditolak. Responses API ora ndhukung pirang-pirang completion (n).
chat completions API
Digunakake kanggo model lawas GPT-3.5 lan GPT-4o, sarta kadhang model seri o.
Kanggo model nalar kayata o3 lan o4-mini, gunakna max_completion_tokens (alias kanggo max_tokens)
Kanggo model versi sadurunge utawa model non-nalar, max_tokens isih bisa digunakake
Ndhukung stop lan n (pirang-pirang completion).
Cathetan: Ora ana setelan “token minimal”. Yen sampeyan butuh dawa minimal, jelasna ing prompt sampeyan.
Wates token miturut klompok model
Kanggo wates token, ukuran konteks, lan wates output paling anyar, delengen dokumentasi model tartamtu.
Tuladha cepet
Responses API
{ "model": "gpt-5", "input": "Ringkes temuan iki ing ~80 tembung.", "max_output_tokens": 120 }Chat Completions (model nalar)
{ "model": "o3-mini", "messages": [{"role": "user", "content": "Write five one-line options."}], "max_completion_tokens": 100 }Kontrol khusus model GPT-5: verbosity lan reasoning.effort
Kontrol iki mung kasedhiya ing model GPT-5 (gpt-5.2, gpt-5.2-chat-latest, gpt-5.2 pro, lan sapiturute). Model seri o lan model lawas ora ndhukung kontrol iki.
verbosity nampa "low", "medium" (gawan), utawa "high". Iki mengaruhi tingkat rincian, nanging ora watesan mutlak.
{ "model": "gpt-5", "input": "Jelasna PageRank ing tingkat dhuwur.", "text": { "verbosity": "low" }, "max_output_tokens": 200 }reasoning.effort ngatur cacahing token nalar sing digawe sadurunge ngasilake jawaban. GPT-5.2 ndhukung none, low, medium, high, lan xhigh. gpt-5.2-pro mung ndhukung medium, high, lan xhigh. Model nalar versi sadurunge mung ndhukung low, medium, lan high.
{ "model": "gpt-5", "input": "Pira emas sing dibutuhake kanggo nglapisi Patung Liberty nganggo lapisan 1mm?", "reasoning": { "effort": "minimal" } }Sampeyan bisa nyetel reasoning.effort dadi none supaya model tumindake kaya model non-nalar kanggo kasus panggunaan sing sensitif marang latensi.
Wenehana instruksi sing spesifik
Jaluk dawa utawa wujud persis sing dikarepake. Tuladha:
“Dhaptarna persis lima pilihan.”
“Tulisen ringkesan 50 tembung.”
“Ora luwih saka 100 token. Yen butuh luwih akeh, tulisen ‘Butuh ruang luwih akeh.’”
Gunakake conto kanthi dawa sing konsisten
Conto sithik sing dawane cocog karo sing dikarepake mbantu model nerusake pola.
Trapna urutan stop kanthi strategis
Gunakna stop kanggo mungkasi proses ngasilake output nalika model tekan delimiter utawa wates dhaptar mawa nomer.
{ "stop": ["
###", "6."] }Sawetara kandidat
Chat Completions: n ngasilake pirang-pirang completion sajrone sapisan panggilan.
Responses API: n ora didhukung; lakonana panggilan kaping pirang-pirang yen mbutuhake luwih saka siji output.
