نمای کلی
کنترل طول پاسخ مدل به چند دلیل مفید است: به مدیریت هزینه کمک میکند (چون بهازای هر توکن پرداخت میکنید)، تأخیر/عملکرد را بهبود میدهد (پاسخهای کوتاهتر سریعتر برگردانده میشوند)، و با جلوگیری از خروجیهای بیشازحد طولانی یا پرحرف، مرتبط بودن پاسخ را تضمین میکند.
میتوانید این کار را با استفاده از سقفهای توکن، تنظیمات استدلال و مفصلبودن، دستورالعملهای روشن، مثالها و توالیهای توقف انجام دهید. برای تازهترین و کاملترین جزئیات، همیشه به مرجع رسمی API در platform.openai.com مراجعه کنید.
حداکثر طول خروجی را تنظیم کنید
API پاسخها
برای مدلهای GPT-5 و بیشتر مدلهای سری o استفاده میشود: از max_output_tokens برای محدود کردن تعداد توکنهایی که مدل تولید خواهد کرد استفاده کنید. برای درخواستهای compaction_trigger، یا max_output_tokens را حذف کنید یا آن را حداقل روی 20000 تنظیم کنید؛ مقادیر کوچکتر رد میشوند. API پاسخها از تکمیلهای چندگانه (n) پشتیبانی نمیکند.
API های انتهای چت
برای GPT-3.5، GPT-4o و گاهی سری o قدیمی استفاده میشود.
برای مدلهای استدلال مانند o3 و o4-mini، از
max_completion_tokens(نام مستعارmax_tokens) استفاده کنیدبرای مدلهای قدیمیتر/غیراستدلالی،
max_tokensهمچنان کار میکنداز
stopوn(تکمیلهای چندگانه) پشتیبانی میکند.
نکته: تنظیمی برای «حداقل توکن» وجود ندارد. اگر به حداقل طول نیاز دارید، آن را در اعلان خود مشخص کنید.
محدودیتهای توکن بر اساس گروه مدل
برای محدودیتهای بهروز توکن، اندازههای زمینه و سقفهای خروجی، لطفاً به مستندات مدل مشخص مراجعه کنید.
مثالهای سریع
API پاسخها
{ "model": "gpt-5", "input": "یافتهها را در حدود ۸۰ کلمه خلاصه کن.", "max_output_tokens": 120 }تکمیلهای چت (مدل استدلال)
{ "model": "o3-mini", "messages": [{"role": "user", "content": "Write five one-line options."}], "max_completion_tokens": 100 }کنترلهای اختصاصی مدلهای GPT-5: verbosity و reasoning.effort
این کنترلها فقط در مدلهای GPT-5 در دسترس هستند (gpt-5.2، gpt-5.2-chat-latest، gpt-5.2 pro و غیره). مدلهای سری O و مدلهای قدیمی از آنها پشتیبانی نمیکنند.
`verbosity` مقدارهای "low"، "medium" (پیشفرض)، یا "high" را میپذیرد. بر سطح جزئیات اثر میگذارد، اما نه بر محدودیتهای سخت.
{ "model": "gpt-5", "input": "PageRank را در سطحی کلی توضیح بده.", "text": { "verbosity": "low" }, "max_output_tokens": 200 }`reasoning.effort` کنترل میکند پیش از تولید پاسخ، چند توکن استدلال تولید شود. GPT-5.2 از none,low، medium، high,and xhigh پشتیبانی میکند. gpt-5.2-pro فقط از medium، high,and xhigh پشتیبانی میکند. مدلهای استدلال قبلی فقط از low، medium و high پشتیبانی میکنند.
{ "model": "gpt-5", "input": "برای پوشاندن تندیس آزادی با یک لایهٔ ۱ میلیمتری، چه مقدار طلا لازم است؟", "reasoning": { "effort": "minimal" } }میتوانید `reasoning.effort` را روی none تنظیم کنید تا مدل برای موارد استفاده حساس به تأخیر، مانند یک مدل غیراستدلالی رفتار کند.
دستورالعملهای مشخص ارائه دهید
طول یا شکل دقیق موردنظرتان را درخواست کنید. مثالها:
«دقیقاً پنج گزینه فهرست کن.»
«یک خلاصه ۵۰ کلمهای بنویس.»
«بیش از ۱۰۰ توکن نباشد. اگر به فضای بیشتری نیاز داری، بگو «فضای بیشتری لازم است.»»
از مثالهایی با طول یکسان استفاده کنید
مثالهای چند نمونه که با طول دلخواه شما همخوانی دارند، به مدل کمک میکنند الگو را ادامه دهد.
توالیهای توقف راهبردی اعمال کنید
از stop استفاده کنید تا وقتی مدل به یک جداکننده یا مرز فهرست شمارهدار میرسد، تولید متوقف شود.
{ "stop": ["
###", "6."] }چند نامزد
تکمیلهای چت:
nچند تکمیل را در یک فراخوانی برمیگرداند.API پاسخها:
nپشتیبانی نمیشود؛ اگر به بیش از یک خروجی نیاز دارید، چندین فراخوانی انجام دهید.
