جائزہ
ماڈل کے جواب کی لمبائی کو کنٹرول کرنا کئی وجوہ سے مفید ہے: اس سے لاگت سنبھالنے میں مدد ملتی ہے (کیونکہ آپ فی ٹوکن ادائیگی کرتے ہیں)، تاخیر/کارکردگی بہتر ہوتی ہے (مختصر جوابات تیزی سے واپس آتے ہیں)، اور غیر ضروری طور پر طویل یا پُر لفظ نتائج سے بچ کر مطابقت برقرار رہتی ہے.
آپ یہ ٹوکن کی حدوں، ریزننگ اور وربوسٹی سیٹنگز، واضح ہدایات، مثالوں، اور اسٹاپ سیکوینسز کے ذریعے کر سکتے ہیں. سب سے تازہ اور مکمل تفصیلات کے لیے ہمیشہ platform.openai.com پر موجود سرکاری API حوالہ دیکھیں.
آؤٹ پٹ کی زیادہ سے زیادہ لمبائی مقرر کریں
ریسپانسز API
GPT-5 ماڈلز اور بیشتر o سیریز ماڈلز کے لیے: ماڈل کے جنریٹ کیے جانے والے ٹوکنز کی تعداد محدود کرنے کے لیے max_output_tokens استعمال کریں. compaction_trigger درخواستوں کے لیے یا تو max_output_tokens شامل نہ کریں یا اسے کم از کم 20000 پر سیٹ کریں؛ اس سے کم اقدار مسترد کر دی جاتی ہیں. ریسپانسز API متعدد کمپلیشنز (n) کو سپورٹ نہیں کرتا.
چیٹ کمپلیشنز API
پرانے GPT-3.5، GPT-4o اور کبھی کبھار o سیریز کے لیے استعمال ہوتا ہے.
o3 اور o4-mini جیسے ریزننگ ماڈلز کے لیے max_completion_tokens استعمال کریں، جو max_tokens کا متبادل نام ہے.
پرانے یا غیر ریزننگ ماڈلز کے لیے max_tokens اب بھی کام کرتا ہے.
یہ stop اور n (متعدد کمپلیشنز) کو سپورٹ کرتا ہے.
نوٹ: “کم از کم ٹوکن” کی کوئی سیٹنگ نہیں ہے. اگر آپ کو کم از کم لمبائی چاہیے، تو اسے اپنے پرومپٹ میں واضح کریں.
ماڈل گروپ کے لحاظ سے ٹوکن کی حدود
ٹوکن کی تازہ ترین حدود، کانٹیکسٹ سائزز، اور آؤٹ پٹ کی حدوں کے لیے، براہِ کرم مخصوص ماڈل دستاویزات دیکھیں.
فوری مثالیں
ریسپانسز API
{ "model": "gpt-5", "input": "نتائج کا خلاصہ تقریباً 80 الفاظ میں کریں.", "max_output_tokens": 120 }چیٹ کمپلیشنز (ریزننگ ماڈل)
{ "model": "o3-mini", "messages": [{"role": "user", "content": "Write five one-line options."}], "max_completion_tokens": 100 }GPT-5 ماڈلز کے مخصوص کنٹرولز: verbosity اور reasoning.effort
یہ کنٹرولز صرف GPT-5 ماڈلز پر دستیاب ہیں (gpt-5.2، gpt-5.2-chat-latest، gpt-5.2 pro وغیرہ). o سیریز اور پرانے ماڈلز ان کنٹرولز کو سپورٹ نہیں کرتے.
verbosity کے لیے "low"، "medium" (طے شدہ) یا "high" قابل قبول ہیں. یہ تفصیل کی سطح پر اثر انداز ہوتا ہے، لیکن قطعی حدود پر نہیں.
{ "model": "gpt-5", "input": "PageRank کو اعلیٰ سطح پر سمجھائیں.", "text": { "verbosity": "low" }, "max_output_tokens": 200 }reasoning.effort یہ طے کرتا ہے کہ جواب تیار کرنے سے پہلے کتنے ریزننگ ٹوکنز جنریٹ کیے جائیں گے. GPT-5.2 میں none، low، medium، high اور xhigh سپورٹ ہوتے ہیں. gpt-5.2-pro میں صرف medium، high اور xhigh سپورٹ ہوتے ہیں. پرانے ریزننگ ماڈلز میں صرف low، medium اور high سپورٹ ہوتے ہیں.
{ "model": "gpt-5", "input": "مجسمہ آزادی پر 1mm کی تہہ چڑھانے کے لیے کتنا سونا درکار ہوگا.", "reasoning": { "effort": "minimal" } }تاخیر کے لحاظ سے حساس استعمالات میں ماڈل کو غیر ریزننگ ماڈل کی طرح چلانے کے لیے reasoning.effort کو none پر سیٹ کیا جا سکتا ہے.
مخصوص ہدایات دیں
اپنی مطلوبہ درست لمبائی یا ساخت بتائیں. مثالیں:
“بالکل پانچ اختیارات کی فہرست بنائیں.”
“50 الفاظ کا خلاصہ لکھیں.”
“100 ٹوکن سے زیادہ نہیں. اگر مزید گنجائش چاہیے ہو تو کہیں: ‘مزید جگہ چاہیے.’”
یکساں لمبائی والی مثالیں استعمال کریں
آپ کی مطلوبہ لمبائی سے ملتی جلتی فیو-شاٹ مثالیں ماڈل کو اسی پیٹرن پر چلنے میں مدد دیتی ہیں.
توقف کی ترتیبیں حکمتِ عملی سے لاگو کریں
جب ماڈل کسی حد فاصل یا نمبر وار فہرست کے اختتام تک پہنچے تو جنریشن روکنے کے لیے stop استعمال کریں.
{ "stop": ["\n###", "6."] }متعدد متبادل نتائج
چیٹ کمپلیشنز: n ایک کال میں متعدد کمپلیشنز واپس کرتا ہے.
ریسپانسز API: n سپورٹ نہیں ہوتا؛ اگر ایک سے زیادہ آؤٹ پٹ درکار ہوں تو متعدد کالز کریں.
