OpenAI
اس صفحے کا مشینی ترجمہ کیا گیا تھا. اصل انگریزی مضمون دیکھیں.

OpenAI ماڈل کے جوابات کی لمبائی کو کنٹرول کرنا

ٹوکن سیٹنگز، واضح پرومپٹس، مثالوں، اور اسٹاپ سیکوینسز کے ذریعے OpenAI ماڈلز کے لیے آؤٹ پٹ کی حدود مقرر کرنا سیکھیں.

آخری اپ ڈیٹ: 8 days ago

جائزہ

ماڈل کے جواب کی لمبائی کو کنٹرول کرنا کئی وجوہ سے مفید ہے: اس سے لاگت سنبھالنے میں مدد ملتی ہے (کیونکہ آپ فی ٹوکن ادائیگی کرتے ہیں)، تاخیر/کارکردگی بہتر ہوتی ہے (مختصر جوابات تیزی سے واپس آتے ہیں)، اور غیر ضروری طور پر طویل یا پُر لفظ نتائج سے بچ کر مطابقت برقرار رہتی ہے.

آپ یہ ٹوکن کی حدوں، ریزننگ اور وربوسٹی سیٹنگز، واضح ہدایات، مثالوں، اور اسٹاپ سیکوینسز کے ذریعے کر سکتے ہیں. سب سے تازہ اور مکمل تفصیلات کے لیے ہمیشہ platform.openai.com پر موجود سرکاری API حوالہ دیکھیں.

آؤٹ پٹ کی زیادہ سے زیادہ لمبائی مقرر کریں

ریسپانسز API

GPT-5 ماڈلز اور زیادہ تر o-series ماڈلز کے لیے استعمال ہوتا ہے: ماڈل کتنے ٹوکن جنریٹ کرے گا، اس کی حد لگانے کے لیے max_output_tokens استعمال کریں. compaction_trigger درخواستوں کے لیے، یا تو max_output_tokens کو چھوڑ دیں یا اسے کم از کم 20000 پر سیٹ کریں؛ اس سے چھوٹی قدریں مسترد کر دی جاتی ہیں. ریسپانسز API متعدد کمپلیشنز (n) کی معاونت نہیں کرتا.

چیٹ کمپلیشنز API

پرانے GPT-3.5، GPT-4o، اور کبھی کبھی o-series کے لیے استعمال ہوتا ہے.

  • o3 اور o4-mini جیسے ریزننگ ماڈلز کے لیے max_completion_tokens استعمال کریں (max_tokens کا عرف).

  • پہلے کے/غیر ریزننگ ماڈلز کے لیے max_tokens اب بھی کام کرتا ہے.

  • stop اور n (متعدد کمپلیشنز) کی معاونت کرتا ہے.

نوٹ: “کم از کم ٹوکن” کی کوئی سیٹنگ نہیں ہے. اگر آپ کو کم از کم لمبائی چاہیے، تو اسے اپنے پرومپٹ میں واضح کریں.

ماڈل گروپ کے لحاظ سے ٹوکن کی حدود

ٹوکن کی تازہ ترین حدود، کانٹیکسٹ سائزز، اور آؤٹ پٹ کی حدوں کے لیے، براہِ کرم مخصوص ماڈل دستاویزات دیکھیں.

فوری مثالیں

ریسپانسز API

{ "model": "gpt-5", "input": "نتائج کا خلاصہ تقریباً 80 الفاظ میں کریں.", "max_output_tokens": 120 }

چیٹ کمپلیشنز (ریزننگ ماڈل)

{ "model": "o3-mini", "messages": [{"role": "user", "content": "Write five one-line options."}], "max_completion_tokens": 100 }

GPT-5 ماڈلز کے مخصوص کنٹرولز: verbosity اور reasoning.effort

یہ کنٹرولز صرف GPT-5 ماڈلز پر دستیاب ہیں (gpt-5.2، gpt-5.2-chat-latest، gpt-5.2 pro وغیرہ). O-series اور پرانے ماڈلز ان کی معاونت نہیں کرتے.

`verbosity` "low"، "medium" (ڈیفالٹ)، یا "high" قبول کرتا ہے. یہ تفصیل کی سطح کو متاثر کرتا ہے، مگر سخت حدود کو نہیں.

{ "model": "gpt-5", "input": "PageRank کو اعلیٰ سطح پر سمجھائیں.", "text": { "verbosity": "low" }, "max_output_tokens": 200 }

`reasoning.effort` جواب تیار کرنے سے پہلے بننے والے ریزننگ ٹوکن کی تعداد کو کنٹرول کرتا ہے. GPT-5.2 none,low، medium، اور high,and xhigh کی معاونت کرتا ہے. gpt-5.2-pro صرف medium اور high,and xhigh کی معاونت کرتا ہے. پہلے کے ریزننگ ماڈلز صرف low، medium، اور high کی معاونت کرتے ہیں.

{ "model": "gpt-5", "input": "مجسمہ آزادی پر 1mm کی تہہ چڑھانے کے لیے کتنا سونا درکار ہوگا.", "reasoning": { "effort": "minimal" } }

تاخیر کے لحاظ سے حساس استعمالات کے لیے آپ `reasoning.effort` کو none پر سیٹ کر سکتے ہیں تاکہ ماڈل غیر ریزننگ ماڈل کی طرح برتاؤ کرے.

مخصوص ہدایات دیں

اپنی مطلوبہ درست لمبائی یا ساخت بتائیں. مثالیں:

  • “بالکل پانچ اختیارات کی فہرست بنائیں.”

  • 50 الفاظ کا خلاصہ لکھیں.”

  • 100 ٹوکن سے زیادہ نہیں. اگر مزید گنجائش چاہیے ہو تو کہیں: ‘مزید جگہ چاہیے.’”

یکساں لمبائی والی مثالیں استعمال کریں

آپ کی مطلوبہ لمبائی سے ملتی جلتی فیو-شاٹ مثالیں ماڈل کو اسی پیٹرن پر چلنے میں مدد دیتی ہیں.

حکمتِ عملی کے ساتھ اسٹاپ سیکوینسز لگائیں

جب ماڈل کسی جداکار یا نمبر والی فہرست کی حد تک پہنچے تو جنریشن روکنے کے لیے stop استعمال کریں.

{ "stop": ["\n###", "6."] }

متعدد متبادل

  • چیٹ کمپلیشنز: n ایک ہی کال میں متعدد کمپلیشنز واپس کرتا ہے.

  • ریسپانسز API: n کی معاونت نہیں ہے؛ اگر آپ کو ایک سے زیادہ آؤٹ پٹ چاہیے تو متعدد کالز کریں.

کیا یہ آرٹیکل مددگار تھا؟