OpenAI
اس صفحے کا مشینی ترجمہ کیا گیا تھا. اصل انگریزی مضمون دیکھیں.

Reinforcement Fine Tuning API کے لیے بلنگ گائیڈ

RFT API کے لیے بلنگ کیسے کام کرتی ہے

آخری اپ ڈیٹ: 15 days ago

RFT کے لیے بلنگ کیسے کام کرتی ہے

ری اِنفورسمنٹ فائن ٹیوننگ (RFT) آپ کو ری اِنفورسمنٹ لرننگ کا استعمال کرتے ہوئے OpenAI کے ریزننگ ماڈلز کی کارکردگی بہتر بنانے کی سہولت دیتی ہے. ہماری سپروائزڈ یا ترجیحی فائن ٹیوننگ پیشکشوں کے برخلاف، جن کی بلنگ ٹریننگ ڈیٹا سیٹ میں ٹوکن کی تعداد کے حساب سے ہوتی ہے، RFT کی بلنگ اس وقت کی بنیاد پر ہوتی ہے جو آپ کا ٹریننگ رن بنیادی مشین لرننگ کام انجام دینے میں صرف کرتا ہے.

یہ گائیڈ بتاتی ہے کہ قابلِ بل ٹریننگ وقت میں کیا شامل ہوتا ہے، ہم توقف اور منسوخی کو کیسے ہینڈل کرتے ہیں، اور آپ کے کنفیگریشن کے انتخاب لاگت کو کیسے متاثر کر سکتے ہیں۔

قیمتوں کی تفصیل

  • حسابی عمل: o4-mini-2025-04-16 کے بنیادی تربیتی دور میں صرف ہونے والے حقیقی وقت کے ہر گھنٹے کے لیے $100۔ چارجز کا تناسب سیکنڈ کے حساب سے طے کیا جاتا ہے اور بل میں اسے دو اعشاری ہندسوں تک گول کیا جاتا ہے، مثلاً 2.55 گھنٹے۔

  • ماڈل جانچ کنندہ کا استعمال: اگر آپ تربیت کے دوران نتائج کو ”درجہ دینے“ کے لیے OpenAI ماڈل استعمال کرتے ہیں تو ان جانچ کالز میں صرف ہونے والے ٹوکن کا بل تربیت مکمل ہونے کے بعد ہماری معیاری API شرحوں پر الگ سے لیا جاتا ہے۔

ہم صرف اسی تربیتی کام کا معاوضہ لیتے ہیں جو حقیقتاً آپ کے ماڈل میں تبدیلی کرتا ہے، جسے ہم ”محفوظ شدہ پیش رفت“ کہتے ہیں۔

ہم کن چیزوں کا بل لیتے ہیں

ہم اس وقت کا بل لیتے ہیں جو آپ کا ٹریننگ ورکر آپ کے ماڈل کو فعال طور پر ٹرین کرنے میں صرف کرتا ہے، خاص طور پر:

  • فائن ٹیوننگ کے عمل کے دوران آپ کے ماڈل سے نمونے بنانا (جنہیں “رول آؤٹس” کہا جاتا ہے)

  • ان آؤٹ پٹس کا ایک یا زیادہ گریڈرز کے ذریعے جائزہ لینا جنہیں آپ نے جاب پر متعین کیا ہے (گریڈرز کے بارے میں مزید جانیں)

  • گریڈز کی بنیاد پر ویٹ اپ ڈیٹس کا حساب لگانا اور انہیں لاگو کرنا (بیک پروپیگیشن).

  • آپ کے کنفیگر کیے گئے کسی بھی ویلیڈیشن (ایویلیوایشن) مرحلے کو چلانا.

زیادہ تر گریڈرز چلانے کے لیے “مفت” ہوتے ہیں، یعنی ہم کور ٹریننگ لوپ میں ان کے شامل کردہ وقت کے علاوہ ان کے استعمال کا اضافی چارج نہیں لیتے. اس کی استثنا ماڈل گریڈرز ہیں، جہاں ہم اوپر کی سرگرمیوں کے دوران ان گریڈرز کے استعمال کردہ ٹوکن بھی گنتے ہیں. یہ ٹوکن آپ کے انوائس پر الگ لائن آئٹم کے طور پر ظاہر ہوتے ہیں. ماڈل گریڈرز کے استعمال کردہ ٹوکنز کا بل معمول کے اِنفرنس ریٹس پر لیا جاتا ہے (OpenAI قیمتیں).

ہم کن چیزوں کے لیے بل نہیں کرتے

ہم درج ذیل پر صرف ہونے والے وقت کے لیے چارج نہیں کرتے:

  • ٹریننگ شروع ہونے سے پہلے آپ کے ڈیٹا سیٹ کی توثیق یا جانچ۔

  • آپ کے ڈیٹا سیٹ پر حفاظتی چیکس۔

  • کمپیوٹ وسائل کے لیے قطار میں انتظار۔

  • ماڈل ویٹس یا ڈیٹا سیٹس ڈاؤن لوڈ کرنا۔

  • آپ کے ڈیٹا سیٹ کو ہمارے ٹریننگ فارمیٹ میں تیار (render) کرنا۔

  • آپ کے فائن-ٹیون کیے گئے ماڈل کی پوسٹ-ٹریننگ حفاظتی جانچ۔

اگر ہماری طرف کی کسی خرابی کی وجہ سے ٹریننگ کا کام ضائع ہو جائے (مثال کے طور پر، اگر کوئی ورکر کریش ہو جائے اور اسے پچھلے چیک پوائنٹ پر واپس جانا پڑے)، تو ضائع شدہ کمپیوٹ وقت یا گریڈر ٹوکنز کے لیے آپ سے چارج نہیں لیا جاتا۔ اس بارے میں مزید تفصیل اگلے حصے میں ہے۔

Captured forward progress اور بلنگ ایونٹس

ٹریننگ آپ کے ماڈل میں کئی چھوٹی اپڈیٹس پر مشتمل ہوتی ہے۔ ہم ٹریک کرتے ہیں کہ ان میں سے کتنی اپڈیٹس کامیابی سے مکمل ہوتی ہیں۔ چارجز ان کامیاب اپڈیٹس سے وابستہ کمپیوٹ وقت اور گریڈر ٹوکنز کی بنیاد پر ہوتے ہیں۔

ہم اس وقت چارج جاری کرتے ہیں جب درج ذیل میں سے کوئی ایک "بلنگ ایونٹ" پیش آتا ہے:

  • ٹریننگ کامیابی سے مکمل ہو جاتی ہے۔

  • آپ ٹریننگ کو موقوف کرتے ہیں۔

  • آپ ٹریننگ منسوخ کرتے ہیں۔

  • ٹریننگ ناکام ہو جاتی ہے۔

ہر چارج پچھلے چارج کے بعد کیے گئے اضافی کام کا احاطہ کرتا ہے۔ مثال کے طور پر:

  • اگر آپ کسی رن کو موقوف کرتے ہیں، تو ہم ایک چیک پوائنٹ محفوظ کرتے ہیں اور پچھلے چارج کے بعد استعمال ہوئے کمپیوٹ وقت اور گریڈر ٹوکنز کے لیے آپ سے چارج لیتے ہیں۔

  • جب آپ دوبارہ شروع کرتے ہیں، تو ٹریننگ چیک پوائنٹ سے جاری رہتی ہے۔ اگلا چارج (تکمیل، ایک اور توقف، منسوخی، یا ناکامی پر) صرف دوبارہ شروع کرنے کے بعد کیے گئے اضافی کام کا احاطہ کرے گا۔

  • اگر آپ کسی رن کو منسوخ کرتے ہیں، تو منسوخی تک کیے گئے کام کے لیے آپ سے چارج لیا جاتا ہے۔

  • اگر ٹریننگ ناکام ہو جائے اور پچھلے چارج کے بعد کا کام ضائع ہو جائے، تو ضائع شدہ حصے کی بلنگ نہیں کی جاتی۔

یہ "captured forward progress" طریقہ یقینی بناتا ہے کہ آپ صرف اسی کام کی ادائیگی کریں جو آپ کے ماڈل میں برقرار رکھا گیا ہو یا جسے آپ نے جان بوجھ کر ترک کیا ہو۔

کام کی پیش رفت دیکھنا

RFT کے کاموں میں usage_metrics نامی ایک خانہ ہوتا ہے، جس میں موجودہ مرحلے تک کام کے مجموعی استعمال کی تفصیل درج ہوتی ہے۔ اس میں تربیت پر صرف ہونے والا وقت اور کام کے تمام ماڈل جانچ کنندگان کے استعمال کردہ سبھی ٹوکن شامل ہیں۔ اس خانے کا معائنہ API (GET /v1/fine_tuning/jobs/{job_id}) یا فائن ٹیوننگ ڈیش بورڈ کے ذریعے کیا جا سکتا ہے۔

تربیت کے وقت پر اثر انداز ہونے والے عوامل

چونکہ بل وقت کی بنیاد پر بنتا ہے، اس لیے آپ کی ترتیبات کا انتخاب براہ راست لاگت کو متاثر کرتا ہے۔ اہم عوامل میں یہ شامل ہیں:

  • مسئلے کی دشواری: اگر آپ کے ڈیٹا سیٹ میں مشکل مسائل ہوں تو ماڈل غالباً ہر مسئلے پر ریزننگ میں زیادہ وقت صرف کرے گا، جس سے ہر نمونہ تیار کرنے کا وقت بڑھ جاتا ہے۔

  • حسابی عمل کی شدت: compute_multiplier ہائپرپیرامیٹر یہ طے کرتا ہے کہ آپ ہر تربیتی مرحلے میں کتنا حسابی عمل انجام دیتے ہیں۔ زیادہ قدریں ماڈل کو ہر ڈیٹا نکتے پر زیادہ تفصیلی ریزننگ کرنے کی ترغیب دیتی ہیں، جس سے ہر مرحلہ زیادہ آہستہ چلتا ہے۔

  • توثیق کی ترتیبات:

  • جانچ کنندہ کی کارکردگی:

  • بڑے یا زیادہ صلاحیت والے ماڈل جانچ کنندگان کو چھوٹے جانچ کنندگان کی نسبت درجہ دینے میں زیادہ وقت لگتا ہے۔ مثلاً، ریزننگ ماڈل سے جانچ میں غیر ریزننگ ماڈل کے مقابلے میں 10 گنا زیادہ وقت لگ سکتا ہے۔

  • Python کے پیچیدہ جانچ افعال کو سادہ افعال کی نسبت چلنے میں زیادہ وقت لگتا ہے۔

ان ترتیبات کی مدد سے آپ لاگت، رفتار اور ماڈل کے معیار میں توازن قائم کر سکتے ہیں۔ مثلاً، بار بار توثیق سے مسائل جلد پکڑے جا سکتے ہیں، لیکن اس سے لاگت بڑھتی ہے۔ زیادہ جدید ماڈل سے جانچ کرنے پر درجہ بندی کی درستگی بہت بہتر ہو سکتی ہے، لیکن اس سے جانچ کا ہر مرحلہ سست اور کام زیادہ مہنگے ہو جائیں گے۔

لاگت کا انتظام

اپنے اخراجات کو قابو میں رکھنے کے لیے:

  • یہ سمجھنے کے لیے مختصر دورانیے کے عمل سے آغاز کریں کہ آپ کی ترتیبات وقت کو کیسے متاثر کرتی ہیں۔

  • توثیقی مثالوں اور eval_samples کی مناسب تعداد استعمال کریں۔ ضرورت سے زیادہ بار توثیق کرنے سے گریز کریں۔

  • جانچ کرنے والا ایسا سب سے چھوٹا ماڈل منتخب کریں جو آپ کے معیار کے تقاضے پورے کرتا ہو۔

  • اپنے مخصوص Python جانچ کنندگان کو مؤثر رکھیں۔

  • ہمگرائی کی رفتار اور لاگت میں توازن کے لیے compute_multiplier کو ایڈجسٹ کریں۔

  • ڈیش بورڈ یا API کے ذریعے اپنے عمل کی نگرانی کریں۔ آپ کسی بھی وقت عمل کو موقوف یا منسوخ کر سکتے ہیں۔

مثالیں

کامیاب ٹریننگ رن

ٹریننگ کا وقتبل کیا گیا وقتاسٹیٹستفصیل
00:0000:00صارف API کے ذریعے RFT جاب بناتا ہے
00:1000:00VALIDATING_FILESڈیٹاسیٹ کی توثیق میں 10 منٹ لگے
00:3000:00VALIDATING_FILESڈیٹاسیٹ سیفٹی چیکس چلانے میں 20 منٹ لگے
01:0000:00QUEUEDدستیاب ورکر کا انتظار کرنے میں 30 منٹ لگے
01:3000:00RUNNINGٹریننگ سیٹ اپ کرنے میں 30 منٹ لگے (ویٹس ڈاؤن لوڈ کرنا، پری پروسیسنگ وغیرہ)
05:3004:00RUNNINGٹریننگ میں 4 گھنٹے لگے
06:0004:00RUNNINGنتیجے میں بننے والے ماڈل کی سیفٹی ایویلیوایشنز چلانے میں 30 منٹ لگے
06:0004:00SUCCEEDEDٹریننگ مکمل ہوتی ہے

اس صورت میں، کل وال کلاک وقت 6 گھنٹے ہے، لیکن صرف 4 گھنٹے بل کے قابل ہیں. لاگت 4 گھنٹے × $100/گھنٹہ = $400 ہوگی.

ناکام جاب کی مثال

اس مثال میں، رن 2 گھنٹے ٹرین کرتا ہے، ایک چیک پوائنٹ لکھتا ہے، 1 گھنٹہ مزید ٹرین کرتا ہے، لیکن پھر ناکام ہو جاتا ہے. چیک پوائنٹ تک کی صرف 2 گھنٹے کی ٹریننگ بل کے قابل ہے.

ٹریننگ کا وقتبل کیا گیا وقتاسٹیٹستفصیل
00:0000:00صارف API کے ذریعے RFT جاب بناتا ہے
00:1000:00VALIDATING_FILESڈیٹاسیٹ کی توثیق میں 10 منٹ لگے
00:3000:00VALIDATING_FILESڈیٹاسیٹ سیفٹی چیکس چلانے میں 20 منٹ لگے
01:0000:00QUEUEDدستیاب ورکر کا انتظار کرنے میں 30 منٹ لگے
01:3000:00RUNNINGٹریننگ سیٹ اپ کرنے میں 30 منٹ لگے (ویٹس ڈاؤن لوڈ کرنا، پری پروسیسنگ وغیرہ)
03:3002:00RUNNINGٹریننگ میں 2 گھنٹے لگے
03:3002:00RUNNINGمرحلہ 5 پر چیک پوائنٹ بنایا گیا
04:3002:00RUNNINGمرحلہ 8 پر اندرونی خرابی کی وجہ سے ٹریننگ ناکام ہو جاتی ہے (1 گھنٹہ مزید بعد)
04:3002:00RUNNINGچیک پوائنٹ کا جائزہ لینے اور توثیق کرنے میں 30 منٹ لگے
04:3002:00SUCCEEDEDجاب مکمل ہوتی ہے (تازہ ترین چیک پوائنٹ کے ساتھ)

اگرچہ مجموعی طور پر ٹریننگ میں 3 گھنٹے لگے، صرف 2 گھنٹے قابل استعمال چیک پوائنٹ میں “محفوظ” ہیں اور انہی کا بل لیا جاتا ہے. ناکامی کی وجہ سے ضائع ہونے والا ایک گھنٹے کا ٹریننگ کام آپ کی ذمہ داری نہیں ہے. لاگت 2 گھنٹے × $100/گھنٹہ = $200 ہوگی.

اکثر پوچھے جانے والے سوالات

مجھ سے رقم کب وصول کی جاتی ہے؟

جب آپ کا عمل مکمل، موقوف، منسوخ یا ناکام ہو جائے تو ہم بل جاری کرتے ہیں۔ ہر بل میں پچھلے بل کے بعد کیا گیا کام شامل ہوتا ہے۔

اگر رن ناکام ہو جائے تو کیا مجھے ادائیگی کرنی ہوگی؟

اگر کوئی رن ہماری غلطی کی وجہ سے ناکام ہو اور حالیہ ٹریننگ کا کام ضائع ہو جائے، تو ضائع شدہ حصے کے لیے آپ سے چارج نہیں لیا جاتا. اگر آپ کوئی رن منسوخ کرتے ہیں، تو منسوخی تک کیے گئے کام کا چارج لیا جاتا ہے.

گریڈر ماڈل ٹوکنز کا بل کیسے لیا جاتا ہے؟

ہم آپ کے کنفیگر کیے گئے کسی بھی ماڈل گریڈرز کے استعمال کردہ ٹوکن گنتے ہیں. ٹریننگ مکمل ہونے کے بعد، ہم ان ٹوکنز کا بل اپنے معیاری فی ٹوکن ریٹس پر لیتے ہیں.

کیا میں کسی رن کو روک کر دوبارہ شروع کر سکتا ہوں؟

ہاں. جب آپ روکتے ہیں، ہم ایک چیک پوائنٹ محفوظ کرتے ہیں اور اب تک کیے گئے کام کا چارج لیتے ہیں. جب آپ دوبارہ شروع کرتے ہیں، تو آپ سے صرف دوبارہ شروع کرنے کے بعد کیے گئے اضافی کام کا چارج لیا جائے گا.

اگر Reinforcement Fine‑Tuning بلنگ کے بارے میں آپ کے مزید سوالات ہیں، تو ہماری سپورٹ ٹیم سے رابطہ کریں.

کیا یہ آرٹیکل مددگار تھا؟