نمای کلی
کنترل طول پاسخ مدل به چند دلیل مفید است: به مدیریت هزینه کمک میکند (چون بهازای هر توکن پرداخت میکنید)، تأخیر/عملکرد را بهبود میدهد (پاسخهای کوتاهتر سریعتر برگردانده میشوند)، و با جلوگیری از خروجیهای بیشازحد طولانی یا پرحرف، مرتبط بودن پاسخ را تضمین میکند.
میتوانید این کار را با استفاده از سقفهای توکن، تنظیمات استدلال و مفصلبودن، دستورالعملهای روشن، مثالها و توالیهای توقف انجام دهید. برای تازهترین و کاملترین جزئیات، همیشه به مرجع رسمی API در platform.openai.com مراجعه کنید.
حداکثر طول خروجی را تنظیم کنید
API پاسخها
برای مدلهای GPT-5 و بیشتر مدلهای سری o استفاده میشود: برای محدود کردن تعداد توکنهای تولیدی مدل، از max_output_tokens استفاده کنید. در درخواستهای compaction_trigger، یا max_output_tokens را حذف کنید یا مقدار آن را دستکم روی 20000 بگذارید؛ مقادیر کمتر رد میشوند. API پاسخها از چند تکمیل همزمان (n) پشتیبانی نمیکند.
API های انتهای چت
برای GPT-3.5 و GPT-4o قدیمی و گاهی مدلهای سری o استفاده میشود.
برای مدلهای استدلال مانند o3 و o4-mini، از max_completion_tokens (نام مستعار max_tokens) استفاده کنید
برای مدلهای قدیمیتر یا غیراستدلالی، max_tokens همچنان کار میکند
از stop و n (چند تکمیل همزمان) پشتیبانی میکند.
نکته: تنظیمی برای «حداقل توکن» وجود ندارد. اگر به حداقل طول نیاز دارید، آن را در اعلان خود مشخص کنید.
محدودیتهای توکن بر اساس گروه مدل
برای محدودیتهای بهروز توکن، اندازههای زمینه و سقفهای خروجی، لطفاً به مستندات مدل مشخص مراجعه کنید.
مثالهای سریع
API پاسخها
{ "model": "gpt-5", "input": "یافتهها را در حدود ۸۰ کلمه خلاصه کن.", "max_output_tokens": 120 }تکمیلهای چت (مدل استدلال)
{ "model": "o3-mini", "messages": [{"role": "user", "content": "Write five one-line options."}], "max_completion_tokens": 100 }کنترلهای ویژه مدلهای GPT-5: verbosity و reasoning.effort
این کنترلها فقط در مدلهای GPT-5 در دسترساند (gpt-5.2، gpt-5.2-chat-latest، gpt-5.2 pro و غیره). مدلهای سری o و مدلهای قدیمی از آنها پشتیبانی نمیکنند.
verbosity مقادیر "low"، "medium" (پیشفرض) یا "high" را میپذیرد. این گزینه بر میزان جزئیات تأثیر میگذارد، اما محدودیتهای قطعی را تغییر نمیدهد.
{ "model": "gpt-5", "input": "PageRank را در سطحی کلی توضیح بده.", "text": { "verbosity": "low" }, "max_output_tokens": 200 }reasoning.effort تعداد توکنهای استدلالی را که پیش از تولید پاسخ ایجاد میشوند کنترل میکند. GPT-5.2 از none، low، medium، high و xhigh پشتیبانی میکند. gpt-5.2-pro فقط از medium، high و xhigh پشتیبانی میکند. مدلهای استدلال قدیمیتر فقط از low، medium و high پشتیبانی میکنند.
{ "model": "gpt-5", "input": "برای پوشاندن تندیس آزادی با یک لایهٔ ۱ میلیمتری، چه مقدار طلا لازم است؟", "reasoning": { "effort": "minimal" } }برای کاربردهای حساس به تأخیر، میتوانید reasoning.effort را روی none بگذارید تا مدل مانند یک مدل غیراستدلالی عمل کند.
دستورالعملهای مشخص ارائه دهید
طول یا شکل دقیق موردنظرتان را درخواست کنید. مثالها:
«دقیقاً پنج گزینه فهرست کن.»
«یک خلاصه ۵۰ کلمهای بنویس.»
«بیش از ۱۰۰ توکن نباشد. اگر به فضای بیشتری نیاز داری، بگو «فضای بیشتری لازم است.»»
از مثالهایی با طول یکسان استفاده کنید
مثالهای چند نمونه که با طول دلخواه شما همخوانی دارند، به مدل کمک میکنند الگو را ادامه دهد.
توالیهای توقف را بهصورت هدفمند بهکار ببرید
از stop استفاده کنید تا وقتی مدل به یک جداکننده یا مرز فهرست شمارهدار رسید، تولید متوقف شود.
{ "stop": ["
###", "6."] }چند گزینه
تکمیلهای چت: پارامتر n در یک فراخوانی چند تکمیل را برمیگرداند.
API پاسخها: پارامتر n پشتیبانی نمیشود؛ اگر به بیش از یک خروجی نیاز دارید، چند فراخوانی انجام دهید.
