OpenAI
این صفحه به‌صورت ماشینی ترجمه شده است. مقاله اصلی انگلیسی را مشاهده کنید.

کنترل طول پاسخ‌های مدل OpenAI

یاد بگیرید چگونه با تنظیمات توکن، اعلان‌های روشن، مثال‌ها و توالی‌های توقف، محدودیت خروجی را برای مدل‌های OpenAI تعیین کنید.

به‌روزرسانی: 12 days ago

نمای کلی

کنترل طول پاسخ مدل به چند دلیل مفید است: به مدیریت هزینه کمک می‌کند (چون به‌ازای هر توکن پرداخت می‌کنید)، تأخیر/عملکرد را بهبود می‌دهد (پاسخ‌های کوتاه‌تر سریع‌تر برگردانده می‌شوند)، و با جلوگیری از خروجی‌های بیش‌ازحد طولانی یا پرحرف، مرتبط بودن پاسخ را تضمین می‌کند.

می‌توانید این کار را با استفاده از سقف‌های توکن، تنظیمات استدلال و مفصل‌بودن، دستورالعمل‌های روشن، مثال‌ها و توالی‌های توقف انجام دهید. برای تازه‌ترین و کامل‌ترین جزئیات، همیشه به مرجع رسمی API در platform.openai.com مراجعه کنید.

حداکثر طول خروجی را تنظیم کنید

API پاسخ‌ها

برای مدل‌های GPT-5 و بیشتر مدل‌های سری o استفاده می‌شود: از max_output_tokens برای محدود کردن تعداد توکن‌هایی که مدل تولید خواهد کرد استفاده کنید. برای درخواست‌های compaction_trigger، یا max_output_tokens را حذف کنید یا آن را حداقل روی 20000 تنظیم کنید؛ مقادیر کوچک‌تر رد می‌شوند. API پاسخ‌ها از تکمیل‌های چندگانه (n) پشتیبانی نمی‌کند.

API های انتهای چت

برای GPT-3.5، GPT-4o و گاهی سری o قدیمی استفاده می‌شود.

  • برای مدل‌های استدلال مانند o3 و o4-mini، از max_completion_tokens (نام مستعار max_tokens) استفاده کنید

  • برای مدل‌های قدیمی‌تر/غیراستدلالی، max_tokens همچنان کار می‌کند

  • از stop و n (تکمیل‌های چندگانه) پشتیبانی می‌کند.

نکته: تنظیمی برای «حداقل توکن» وجود ندارد. اگر به حداقل طول نیاز دارید، آن را در اعلان خود مشخص کنید.

محدودیت‌های توکن بر اساس گروه مدل

برای محدودیت‌های به‌روز توکن، اندازه‌های زمینه و سقف‌های خروجی، لطفاً به مستندات مدل مشخص مراجعه کنید.

مثال‌های سریع

API پاسخ‌ها

{ "model": "gpt-5", "input": "یافته‌ها را در حدود ۸۰ کلمه خلاصه کن.", "max_output_tokens": 120 }

تکمیل‌های چت (مدل استدلال)

{ "model": "o3-mini", "messages": [{"role": "user", "content": "Write five one-line options."}], "max_completion_tokens": 100 }

کنترل‌های اختصاصی مدل‌های GPT-5: verbosity و reasoning.effort

این کنترل‌ها فقط در مدل‌های GPT-5 در دسترس هستند (gpt-5.2، gpt-5.2-chat-latest، gpt-5.2 pro و غیره). مدل‌های سری O و مدل‌های قدیمی از آن‌ها پشتیبانی نمی‌کنند.

`verbosity` مقدارهای "low"، "medium" (پیش‌فرض)، یا "high" را می‌پذیرد. بر سطح جزئیات اثر می‌گذارد، اما نه بر محدودیت‌های سخت.

{ "model": "gpt-5", "input": "PageRank را در سطحی کلی توضیح بده.", "text": { "verbosity": "low" }, "max_output_tokens": 200 }

`reasoning.effort` کنترل می‌کند پیش از تولید پاسخ، چند توکن استدلال تولید شود. GPT-5.2 از none,low، medium، high,and xhigh پشتیبانی می‌کند. gpt-5.2-pro فقط از medium، high,and xhigh پشتیبانی می‌کند. مدل‌های استدلال قبلی فقط از low، medium و high پشتیبانی می‌کنند.

{ "model": "gpt-5", "input": "برای پوشاندن تندیس آزادی با یک لایهٔ ۱ میلی‌متری، چه مقدار طلا لازم است؟", "reasoning": { "effort": "minimal" } }

می‌توانید `reasoning.effort` را روی none تنظیم کنید تا مدل برای موارد استفاده حساس به تأخیر، مانند یک مدل غیراستدلالی رفتار کند.

دستورالعمل‌های مشخص ارائه دهید

طول یا شکل دقیق موردنظرتان را درخواست کنید. مثال‌ها:

  • «دقیقاً پنج گزینه فهرست کن.»

  • «یک خلاصه ۵۰ کلمه‌ای بنویس.»

  • «بیش از ۱۰۰ توکن نباشد. اگر به فضای بیشتری نیاز داری، بگو «فضای بیشتری لازم است.»»

از مثال‌هایی با طول یکسان استفاده کنید

مثال‌های چند نمونه که با طول دلخواه شما هم‌خوانی دارند، به مدل کمک می‌کنند الگو را ادامه دهد.

توالی‌های توقف راهبردی اعمال کنید

از stop استفاده کنید تا وقتی مدل به یک جداکننده یا مرز فهرست شماره‌دار می‌رسد، تولید متوقف شود.

{ "stop": ["
###", "6."] }

چند نامزد

  • تکمیل‌های چت: n چند تکمیل را در یک فراخوانی برمی‌گرداند.

  • API پاسخ‌ها: n پشتیبانی نمی‌شود؛ اگر به بیش از یک خروجی نیاز دارید، چندین فراخوانی انجام دهید.

آیا این مقاله مفید بود؟