OpenAI
این صفحه به‌صورت ماشینی ترجمه شده است. مقاله اصلی انگلیسی را مشاهده کنید.

کنترل طول پاسخ‌های مدل OpenAI

یاد بگیرید چگونه با تنظیمات توکن، اعلان‌های روشن، مثال‌ها و توالی‌های توقف، محدودیت خروجی را برای مدل‌های OpenAI تعیین کنید.

به‌روزرسانی: 4 days ago

نمای کلی

کنترل طول پاسخ مدل به چند دلیل مفید است: به مدیریت هزینه کمک می‌کند (چون به‌ازای هر توکن پرداخت می‌کنید)، تأخیر/عملکرد را بهبود می‌دهد (پاسخ‌های کوتاه‌تر سریع‌تر برگردانده می‌شوند)، و با جلوگیری از خروجی‌های بیش‌ازحد طولانی یا پرحرف، مرتبط بودن پاسخ را تضمین می‌کند.

می‌توانید این کار را با استفاده از سقف‌های توکن، تنظیمات استدلال و مفصل‌بودن، دستورالعمل‌های روشن، مثال‌ها و توالی‌های توقف انجام دهید. برای تازه‌ترین و کامل‌ترین جزئیات، همیشه به مرجع رسمی API در platform.openai.com مراجعه کنید.

حداکثر طول خروجی را تنظیم کنید

API پاسخ‌ها

برای مدل‌های GPT-5 و بیشتر مدل‌های سری o استفاده می‌شود: برای محدود کردن تعداد توکن‌های تولیدی مدل، از max_output_tokens استفاده کنید. در درخواست‌های compaction_trigger، یا max_output_tokens را حذف کنید یا مقدار آن را دست‌کم روی 20000 بگذارید؛ مقادیر کمتر رد می‌شوند. API پاسخ‌ها از چند تکمیل هم‌زمان (n) پشتیبانی نمی‌کند.

API های انتهای چت

برای GPT-3.5 و GPT-4o قدیمی و گاهی مدل‌های سری o استفاده می‌شود.

  • برای مدل‌های استدلال مانند o3 و o4-mini، از max_completion_tokens (نام مستعار max_tokens) استفاده کنید

  • برای مدل‌های قدیمی‌تر یا غیراستدلالی، max_tokens همچنان کار می‌کند

  • از stop و n (چند تکمیل هم‌زمان) پشتیبانی می‌کند.

نکته: تنظیمی برای «حداقل توکن» وجود ندارد. اگر به حداقل طول نیاز دارید، آن را در اعلان خود مشخص کنید.

محدودیت‌های توکن بر اساس گروه مدل

برای محدودیت‌های به‌روز توکن، اندازه‌های زمینه و سقف‌های خروجی، لطفاً به مستندات مدل مشخص مراجعه کنید.

مثال‌های سریع

API پاسخ‌ها

{ "model": "gpt-5", "input": "یافته‌ها را در حدود ۸۰ کلمه خلاصه کن.", "max_output_tokens": 120 }

تکمیل‌های چت (مدل استدلال)

{ "model": "o3-mini", "messages": [{"role": "user", "content": "Write five one-line options."}], "max_completion_tokens": 100 }

کنترل‌های ویژه مدل‌های GPT-5: verbosity و reasoning.effort

این کنترل‌ها فقط در مدل‌های GPT-5 در دسترس‌اند (gpt-5.2، gpt-5.2-chat-latest، gpt-5.2 pro و غیره). مدل‌های سری o و مدل‌های قدیمی از آن‌ها پشتیبانی نمی‌کنند.


verbosity مقادیر "low"، "medium" (پیش‌فرض) یا "high" را می‌پذیرد. این گزینه بر میزان جزئیات تأثیر می‌گذارد، اما محدودیت‌های قطعی را تغییر نمی‌دهد.

{ "model": "gpt-5", "input": "PageRank را در سطحی کلی توضیح بده.", "text": { "verbosity": "low" }, "max_output_tokens": 200 }

reasoning.effort تعداد توکن‌های استدلالی را که پیش از تولید پاسخ ایجاد می‌شوند کنترل می‌کند. GPT-5.2 از none، low، medium، high و xhigh پشتیبانی می‌کند. gpt-5.2-pro فقط از medium، high و xhigh پشتیبانی می‌کند. مدل‌های استدلال قدیمی‌تر فقط از low، medium و high پشتیبانی می‌کنند.

{ "model": "gpt-5", "input": "برای پوشاندن تندیس آزادی با یک لایهٔ ۱ میلی‌متری، چه مقدار طلا لازم است؟", "reasoning": { "effort": "minimal" } }

برای کاربردهای حساس به تأخیر، می‌توانید reasoning.effort را روی none بگذارید تا مدل مانند یک مدل غیراستدلالی عمل کند.

دستورالعمل‌های مشخص ارائه دهید

طول یا شکل دقیق موردنظرتان را درخواست کنید. مثال‌ها:

  • «دقیقاً پنج گزینه فهرست کن.»

  • «یک خلاصه ۵۰ کلمه‌ای بنویس.»

  • «بیش از ۱۰۰ توکن نباشد. اگر به فضای بیشتری نیاز داری، بگو «فضای بیشتری لازم است.»»

از مثال‌هایی با طول یکسان استفاده کنید

مثال‌های چند نمونه که با طول دلخواه شما هم‌خوانی دارند، به مدل کمک می‌کنند الگو را ادامه دهد.

توالی‌های توقف را به‌صورت هدفمند به‌کار ببرید

از stop استفاده کنید تا وقتی مدل به یک جداکننده یا مرز فهرست شماره‌دار رسید، تولید متوقف شود.

{ "stop": ["
###", "6."] }

چند گزینه

  • تکمیل‌های چت: پارامتر n در یک فراخوانی چند تکمیل را برمی‌گرداند.

  • API پاسخ‌ها: پارامتر n پشتیبانی نمی‌شود؛ اگر به بیش از یک خروجی نیاز دارید، چند فراخوانی انجام دهید.

آیا این مقاله مفید بود؟