OpenAI
ဤစာမျက်နှာကို စက်ဖြင့် ဘာသာပြန်ထားပါသည်။ မူရင်း အင်္ဂလိပ်ဆောင်းပါးကို ကြည့်ရန်

Reinforcement Fine Tuning API အတွက် ငွေကောက်ခံမှု လမ်းညွှန်

RFT API အတွက် ငွေကောက်ခံပုံ

အပ်ဒိတ်လုပ်ထားသည်- yesterday

RFT အတွက် ဘီလ်ကောက်ခံမှု လုပ်ဆောင်ပုံ

Reinforcement Fine‑Tuning (RFT) သည် အားဖြည့် သင်ယူလေ့လာခြင်းကို အသုံးပြု၍ OpenAI ၏ ကျိုးကြောင်းသင့်လျော်စွာ စဉ်းစားပေးသော မော်ဒယ်များ၏ စွမ်းဆောင်ရည်ကို သင့်အနေဖြင့် ပိုမိုကောင်းမွန်အောင် ပြုလုပ်နိုင်စေသည်။ လေ့ကျင့်ရေးဒေတာဆက်ထဲရှိ တိုကင် အရေအတွက်အလိုက် ဘီလ်ကောက်ခံသည့် ကျွန်ုပ်တို့၏ supervised သို့မဟုတ် preference fine‑tuning ဝန်ဆောင်မှုများနှင့် မတူဘဲ၊ RFT ကို သင်၏ လေ့ကျင့်မှုလုပ်ဆောင်ချက်က အဓိက machine learning လုပ်ငန်းကို ဆောင်ရွက်ရန် သုံးစွဲသော အချိန်အပေါ် အခြေခံ၍ ဘီလ်ကောက်ခံသည်။

ဤလမ်းညွှန်တွင် ငွေကောက်ခံနိုင်သော လေ့ကျင့်ရေးအချိန်တွင် ဘာတွေ ပါဝင်သလဲ၊ ခေတ္တရပ်ခြင်းနှင့် ပယ်ဖျက်ခြင်းများကို ကျွန်ုပ်တို့ မည်သို့ ကိုင်တွယ်သလဲ၊ ထို့ပြင် သင်၏ configuration ရွေးချယ်မှုများက ကုန်ကျစရိတ်အပေါ် မည်သို့ သက်ရောက်နိုင်သလဲကို ရှင်းပြထားပါသည်။

စျေးနှုန်း

  • Compute: o4-mini-2025-04-16 အတွက် အဓိက training loop အတွင်း သုံးစွဲသော wall-clock time တစ်နာရီလျှင် $100။ ကောက်ခံမှုကို စက္ကန့်အထိ အချိုးကျတွက်ချက်ပြီး invoice တွင် ဒသမ နှစ်နေရာအထိ လုံးဝန်းထားသည် (ဥပမာ 2.55 နာရီ)။

  • Model grader အသုံးပြုမှု: သင်သည် လေ့ကျင့်ရေးအတွင်း output များကို "grade" လုပ်ရန် OpenAI မော်ဒယ်တစ်ခုကို အသုံးပြုပါက၊ ထို grading call များက သုံးစွဲသော တိုကင် များကို လေ့ကျင့်ရေးပြီးဆုံးပြီးနောက် ကျွန်ုပ်တို့၏ စံ API နှုန်းထားများအတိုင်း သီးခြား ငွေကောက်ခံပါသည်။

သင့်မော်ဒယ်ကို အမှန်တကယ် update လုပ်ပေးသော လေ့ကျင့်ရေးအလုပ်အတွက်သာ ကျွန်ုပ်တို့ ငွေကောက်ခံပါသည် (၎င်းကို "captured forward progress" ဟု ကျွန်ုပ်တို့ ခေါ်သည်)။

ကျွန်ုပ်တို့ ငွေကောက်ခံသောအရာများ

သင့် training worker က သင့်မော်ဒယ်ကို တက်ကြွစွာ လေ့ကျင့်ရာတွင် အသုံးပြုသည့် အချိန်အတွက် ကျွန်ုပ်တို့ ငွေကောက်ခံပါသည်၊ အထူးသဖြင့်—

  • fine-tuning လုပ်ငန်းစဉ်အတွင်း သင့်မော်ဒယ်မှ နမူနာများ ထုတ်လုပ်ခြင်း (“rollouts” ဟု ခေါ်သည်)

  • job ပေါ်တွင် သင်သတ်မှတ်ထားသော grader တစ်ခု သို့မဟုတ် တစ်ခုထက်ပိုသော grader များဖြင့် ထို output များကို အကဲဖြတ်ခြင်း (grader များအကြောင်း ပိုမိုလေ့လာရန်)

  • grade များအပေါ် အခြေခံ၍ weight update များကို တွက်ချက်ပြီး အသုံးပြုခြင်း (backpropagation)။

  • သင် configure လုပ်ထားသည့် validation (evaluation) အဆင့်များကို လုပ်ဆောင်ခြင်း။

grader အများစုကို run ရန် “အခမဲ့” ဖြစ်သည်၊ ဆိုလိုသည်မှာ core training loop သို့ ၎င်းတို့ ထည့်ဝင်သော အချိန်ပမာဏမှလွဲ၍ ၎င်းတို့အသုံးပြုမှုအတွက် ထပ်ဆောင်း ငွေမကောက်ခံပါ။ ဤအရာ၏ ခြွင်းချက်မှာ မော်ဒယ် grader များဖြစ်ပြီး အထက်ပါ လုပ်ဆောင်မှုများအတွင်း ထို grader များ သုံးစွဲသော တိုကင်များကိုလည်း ကျွန်ုပ်တို့ စုစုပေါင်းတွက်ချက်ပါသည်။ ဤတိုကင်များသည် သင့် invoice ပေါ်တွင် သီးခြား line item အဖြစ် ပေါ်လာပါသည်။ မော်ဒယ် grader များ သုံးစွဲသော တိုကင်များကို ပုံမှန် inference နှုန်းထားများဖြင့် ငွေကောက်ခံပါသည် (OpenAI စျေးနှုန်းများ)။

ငွေမကောက်ခံသည့်အရာများ

အောက်ပါအချိန်များအတွက် ကျွန်ုပ်တို့ ငွေမကောက်ခံပါ:

  • လေ့ကျင့်ရေး မစတင်မီ သင့် dataset ကို စစ်ဆေးအတည်ပြုခြင်း သို့မဟုတ် စိစစ်ခြင်း။

  • သင့် dataset အပေါ် လုံခြုံရေး စစ်ဆေးမှုများ။

  • compute resource များအတွက် queue ထဲတွင် စောင့်ဆိုင်းခြင်း။

  • မော်ဒယ် weights သို့မဟုတ် dataset များကို ဒေါင်းလုဒ်လုပ်ခြင်း။

  • သင့် dataset ကို ကျွန်ုပ်တို့၏ training format အဖြစ် ပြင်ဆင်ခြင်း (rendering)။

  • fine‑tune လုပ်ထားသော သင့်မော်ဒယ်အတွက် လေ့ကျင့်ရေးပြီးနောက် လုံခြုံရေး အကဲဖြတ်မှုများ။

လေ့ကျင့်ရေးအလုပ်သည် ကျွန်ုပ်တို့ဘက်မှ အမှားတစ်ခုကြောင့် ဆုံးရှုံးသွားပါက (ဥပမာ worker တစ်ခု crash ဖြစ်ပြီး ယခင် checkpoint သို့ roll back လုပ်ရပါက) ဆုံးရှုံးသွားသော compute time သို့မဟုတ် grader တိုကင် များအတွက် သင့်ကို ငွေမကောက်ခံပါ။ နောက်အပိုင်းတွင် ဤအကြောင်း အသေးစိတ် ဆက်လက်ဖော်ပြထားသည်။

Captured forward progress နှင့် billing event များ

လေ့ကျင့်ရေးတွင် သင့်မော်ဒယ်အတွက် သေးငယ်သော update အများအပြား ပါဝင်သည်။ ဤ update များအနက် ဘယ်နှခု အောင်မြင်စွာ ပြီးစီးသွားသည်ကို ကျွန်ုပ်တို့ ခြေရာခံပါသည်။ ကောက်ခံမှုများသည် အောင်မြင်သော update များနှင့် သက်ဆိုင်သည့် compute time နှင့် grader တိုကင် များအပေါ် အခြေခံပါသည်။

အောက်ပါ "billing event" များထဲမှ တစ်ခု ဖြစ်ပေါ်လာသည့်အခါ ကျွန်ုပ်တို့ ငွေကောက်ခံပါသည်:

  • လေ့ကျင့်ရေး အောင်မြင်စွာ ပြီးဆုံးသည်။

  • သင် လေ့ကျင့်ရေးကို ခေတ္တရပ်သည်။

  • သင် လေ့ကျင့်ရေးကို ပယ်ဖျက်သည်။

  • လေ့ကျင့်ရေး မအောင်မြင်ပါ။

ကောက်ခံမှုတစ်ခုစီတွင် နောက်ဆုံးကောက်ခံမှုနောက်ပိုင်း တိုးလာသော အလုပ်ပမာဏ ပါဝင်သည်။ ဥပမာ:

  • သင် run တစ်ခုကို ခေတ္တရပ်ပါက၊ ကျွန်ုပ်တို့ checkpoint တစ်ခု သိမ်းဆည်းပြီး နောက်ဆုံးကောက်ခံမှုနောက်ပိုင်း အသုံးပြုခဲ့သော compute time နှင့် grader တိုကင် များအတွက် ငွေကောက်ခံပါသည်။

  • သင် ပြန်စတင်သောအခါ လေ့ကျင့်ရေးသည် checkpoint မှ ဆက်လက်သွားမည်။ နောက်တစ်ကြိမ် ကောက်ခံမှုသည် (ပြီးဆုံးမှု၊ နောက်ထပ် ခေတ္တရပ်မှု၊ ပယ်ဖျက်မှု သို့မဟုတ် မအောင်မြင်မှုတွင်) ပြန်စတင်ပြီးနောက် ထပ်မံလုပ်ဆောင်ထားသော အလုပ်အတွက်သာ ဖြစ်မည်။

  • သင် run တစ်ခုကို ပယ်ဖျက်ပါက၊ ပယ်ဖျက်ချိန်အထိ ပြီးစီးထားသော အလုပ်အတွက် ငွေကောက်ခံပါသည်။

  • လေ့ကျင့်ရေး မအောင်မြင်ပြီး နောက်ဆုံးကောက်ခံမှုနောက်ပိုင်း အလုပ်များ ဆုံးရှုံးသွားပါက၊ ဆုံးရှုံးသွားသော အပိုင်းအတွက် ငွေမကောက်ခံပါ။

ဤ "captured forward progress" နည်းလမ်းကြောင့် သင့်မော်ဒယ်တွင် ထိန်းသိမ်းထားသော အလုပ်အတွက် သို့မဟုတ် သင် ရည်ရွယ်ချက်ရှိရှိ စွန့်လွှတ်သော အလုပ်အတွက်သာ သင် ငွေပေးချေရမည်ဖြစ်သည်။

job တိုးတက်မှုကို ကြည့်ရှုခြင်း

RFT job များတွင် လက်ရှိအဆင့်အထိ job ၏ စုစုပေါင်းအသုံးပြုမှုကို မှတ်တမ်းတင်ထားသည့် usage_metrics ဟုခေါ်သော field တစ်ခု ပါဝင်သည်။ ၎င်းတွင် လေ့ကျင့်ရန် အသုံးပြုခဲ့သော အချိန်နှင့် job ပေါ်ရှိ မော်ဒယ် grader အားလုံးတွင် အသုံးပြုခဲ့သော တိုကင်အားလုံး ပါဝင်သည်။ ဤ field ကို API (GET /v1/fine_tuning/jobs/{job_id}) မှတစ်ဆင့် သို့မဟုတ် fine-tuning ဒက်ရှ်ဘုတ် မှတစ်ဆင့် စစ်ဆေးကြည့်ရှုနိုင်သည်။

လေ့ကျင့်ရေးအချိန်ကို သက်ရောက်စေသော အချက်များ

ငွေကောက်ခံမှုသည် အချိန်အပေါ် အခြေခံသောကြောင့် သင်၏ configuration ရွေးချယ်မှုများက ကုန်ကျစရိတ်ကို တိုက်ရိုက် သက်ရောက်စေပါသည်။ အဓိက အချက်များမှာ:

  • ပြဿနာ၏ ခက်ခဲမှု: သင်၏ dataset တွင် ခက်ခဲသော ပြဿနာများ ပါဝင်နေပါက၊ မော်ဒယ်သည် ပြဿနာတစ်ခုစီအတွက် ကျိုးကြောင်းသင့်လျော်စွာ စဉ်းစားပေးသော အချိန် ပိုမိုကုန်နိုင်ပြီး sample တစ်ခုစီ ထုတ်လုပ်ရန် ကြာချိန်ကို တိုးစေသည်။

  • တွက်ချက်မှု ပြင်းအား: compute_multiplier hyperparameter သည် training step တစ်ခုလျှင် သင် ဘယ်လောက် တွက်ချက်မှု လုပ်မည်ကို ထိန်းချုပ်သည်။ တန်ဖိုးမြင့်လေလေ မော်ဒယ်က datapoint တစ်ခုစီအပေါ် ပိုရှည်လျားစွာ ကျိုးကြောင်းသင့်လျော်စွာ စဉ်းစားပေးရန် အားပေးပြီး step တစ်ခုစီကို ပိုနှေးစေသည်။

  • Validation ဆက်တင်များ:

    • Validation set ပိုကြီးလေလေ အကဲဖြတ်ရာတွင် ကုန်သည့်အချိန် ပိုများလာသည်။

    • eval_samples ကို တိုးမြှင့်ခြင်း (validation example တစ်ခုလျှင် အဆင့်သတ်မှတ်ရမည့် မော်ဒယ် output အရေအတွက်) သည် validation အချိန်ကို တိုးစေသည်။

    • Validation ကို ပိုမိုမကြာခဏ လုပ်ဆောင်ခြင်း (eval_interval နိမ့်ခြင်း) သည် validation အတွက် သုံးသည့်အချိန် အချိုးကို တိုးစေသည်။

  • Grader စွမ်းဆောင်ရည်:

    • ပိုကြီးသော သို့မဟုတ် ပိုစွမ်းရည်မြင့်သော grader မော်ဒယ်များသည် အသေးများထက် အမှတ်ပြန်ပေးရန် ပိုကြာသည်။ ဥပမာအားဖြင့်၊ ကျိုးကြောင်းသင့်လျော်စွာ စဉ်းစားပေးသော မော်ဒယ်ဖြင့် grading လုပ်ခြင်းသည် ထိုစွမ်းရည်မပါသော မော်ဒယ်ထက် 10 ဆ ပိုကြာနိုင်သည်။

    • ရှုပ်ထွေးသော Python grading function များသည် ရိုးရှင်းသော function များထက် run ရန် ပိုကြာသည်။

ဤဆက်တင်များက ကုန်ကျစရိတ်၊ မြန်နှုန်းနှင့် မော်ဒယ်အရည်အသွေးတို့အကြား ချိန်ညှိရွေးချယ်နိုင်စေပါသည်။ ဥပမာအားဖြင့်၊ validation ကို မကြာခဏ လုပ်ဆောင်ခြင်းက ပြဿနာများကို ပိုစောစီးစွာ ဖမ်းမိစေနိုင်သော်လည်း ကုန်ကျစရိတ် တိုးစေသည်။ ပိုအဆင့်မြင့်သော မော်ဒယ်ဖြင့် grading လုပ်ခြင်းသည် grading တိကျမှုကို များစွာ မြှင့်တင်နိုင်သော်လည်း grading step တစ်ခုစီကို နှေးစေပြီး အလုပ်ကို ပိုစျေးကြီးစေမည်ဖြစ်သည်။

ကုန်ကျစရိတ် စီမံခန့်ခွဲခြင်း

သင့်အသုံးစရိတ်ကို ထိန်းချုပ်ရန်:

  • သင်၏ configuration က အချိန်အပေါ် မည်သို့ သက်ရောက်သည်ကို နားလည်ရန် ပိုတိုသော run များဖြင့် စတင်ပါ။

  • သင့်တော်သော validation example အရေအတွက်နှင့် eval_samples ကို အသုံးပြုပါ။ လိုအပ်သည်ထက် ပိုမိုမကြာခဏ validation မလုပ်ပါနှင့်။

  • သင့်အရည်အသွေးလိုအပ်ချက်များနှင့် ကိုက်ညီသည့် အသေးဆုံး grader မော်ဒယ်ကို ရွေးချယ်ပါ။

  • စိတ်ကြိုက် Python grader များကို ထိရောက်စွာ ထားပါ။

  • convergence speed နှင့် ကုန်ကျစရိတ်ကို ချိန်ညှိရန် compute_multiplier ကို ပြင်ဆင်ပါ။

  • သင့် run ကို dashboard တွင် သို့မဟုတ် API မှတစ်ဆင့် စောင့်ကြည့်ပါ။ မည်သည့်အချိန်မဆို ခေတ္တရပ် သို့မဟုတ် ပယ်ဖျက်နိုင်သည်။

ဥပမာများ

အောင်မြင်သော လေ့ကျင့်ရေး run

လေ့ကျင့်ချိန်ငွေကောက်ခံချိန်အခြေအနေဖော်ပြချက်
00:0000:00အသုံးပြုသူက API မှတစ်ဆင့် RFT job ဖန်တီးသည်
00:1000:00VALIDATING_FILESdataset ကို စစ်ဆေးအတည်ပြုရန် 10 မိနစ် အသုံးပြုသည်
00:3000:00VALIDATING_FILESdataset ဘေးကင်းရေး စစ်ဆေးမှုများ လုပ်ဆောင်ရန် 20 မိနစ်
01:0000:00QUEUEDရနိုင်သော worker ကို စောင့်ရန် 30 မိနစ်
01:3000:00RUNNINGလေ့ကျင့်ရေးကို စီစဉ်ရန် 30 မိနစ် (weights ဒေါင်းလုဒ်လုပ်ခြင်း၊ preprocessing စသည်)
05:3004:00RUNNINGလေ့ကျင့်ရန် 4 နာရီ အသုံးပြုသည်
06:0004:00RUNNINGရလဒ် မော်ဒယ်၏ ဘေးကင်းရေး အကဲဖြတ်မှုများ လုပ်ဆောင်ရန် 30 မိနစ်
06:0004:00SUCCEEDEDလေ့ကျင့်ရေး ပြီးဆုံးသည်

ဤကိစ္စတွင် စုစုပေါင်း wall-clock အချိန်သည် 6 နာရီ ဖြစ်သော်လည်း ငွေကောက်ခံနိုင်သည်မှာ 4 နာရီသာ ဖြစ်သည်။ ကုန်ကျစရိတ်မှာ 4 နာရီ × $100/နာရီ = $400 ဖြစ်မည်။

မအောင်မြင်သော job ဥပမာ

ဤဥပမာတွင် run သည် 2 နာရီ လေ့ကျင့်ပြီး checkpoint တစ်ခု ရေးသိမ်းကာ နောက်ထပ် 1 နာရီ လေ့ကျင့်သော်လည်း ထို့နောက် မအောင်မြင်ပါ။ checkpoint အထိ လေ့ကျင့်ခဲ့သော 2 နာရီသာ ငွေကောက်ခံနိုင်သည်။

လေ့ကျင့်ချိန်ငွေကောက်ခံချိန်အခြေအနေဖော်ပြချက်
00:0000:00အသုံးပြုသူက API မှတစ်ဆင့် RFT job ဖန်တီးသည်
00:1000:00VALIDATING_FILESdataset ကို စစ်ဆေးအတည်ပြုရန် 10 မိနစ် အသုံးပြုသည်
00:3000:00VALIDATING_FILESdataset ဘေးကင်းရေး စစ်ဆေးမှုများ လုပ်ဆောင်ရန် 20 မိနစ်
01:0000:00QUEUEDရနိုင်သော worker ကို စောင့်ရန် 30 မိနစ်
01:3000:00RUNNINGလေ့ကျင့်ရေးကို စီစဉ်ရန် 30 မိနစ် (weights ဒေါင်းလုဒ်လုပ်ခြင်း၊ preprocessing စသည်)
03:3002:00RUNNINGလေ့ကျင့်ရန် 2 နာရီ အသုံးပြုသည်
03:3002:00RUNNINGအဆင့် 5 တွင် checkpoint ဖန်တီးသည်
04:3002:00RUNNINGအတွင်းပိုင်း အမှားကြောင့် အဆင့် 8 တွင် လေ့ကျင့်ရေး မအောင်မြင်ပါ (နောက်ထပ် 1 နာရီပြီးနောက်)
04:3002:00RUNNINGcheckpoint ကို အကဲဖြတ်ပြီး စစ်ဆေးအတည်ပြုရန် 30 မိနစ်
04:3002:00SUCCEEDEDjob ပြီးဆုံးသည် (နောက်ဆုံး checkpoint ဖြင့်)

စုစုပေါင်း လေ့ကျင့်ရာတွင် 3 နာရီ အသုံးပြုခဲ့သော်လည်း အသုံးပြုနိုင်သော checkpoint တွင် “ဖမ်းယူထား” ခံရသော 2 နာရီသာ ငွေကောက်ခံပါသည်။ မအောင်မြင်မှုကြောင့် ဆုံးရှုံးသွားသော လေ့ကျင့်ရေးအလုပ် 1 နာရီအတွက် သင့်တွင် တာဝန်မရှိပါ။ ကုန်ကျစရိတ်မှာ 2 နာရီ × $100/နာရီ = $200 ဖြစ်မည်။

မေးလေ့ရှိသော မေးခွန်းများ

ဘယ်အချိန်မှာ ငွေကောက်ခံပါသလဲ။

သင့် run ပြီးဆုံးသောအခါ၊ ခေတ္တရပ်ထားသောအခါ၊ ပယ်ဖျက်သောအခါ သို့မဟုတ် မအောင်မြင်သောအခါ ငွေကောက်ခံပါသည်။ ဘီလ်တစ်ခုစီသည် ယခင်ဘီလ်နောက်ပိုင်း လုပ်ဆောင်ပြီးစီးသည့် အလုပ်ကို ဖုံးလွှမ်းပါသည်။

run မအောင်မြင်ပါက ငွေပေးရမလား။

ကျွန်ုပ်တို့၏ အမှားကြောင့် run မအောင်မြင်ပြီး မကြာသေးမီက လေ့ကျင့်ရေးအလုပ် တစ်စုံတစ်ရာ ဆုံးရှုံးပါက ဆုံးရှုံးသွားသော အပိုင်းအတွက် သင့်ထံမှ ငွေမကောက်ခံပါ။ run တစ်ခုကို သင်ပယ်ဖျက်ပါက ပယ်ဖျက်ချိန်အထိ လုပ်ဆောင်ပြီးသော အလုပ်အတွက် ငွေကောက်ခံပါသည်။

grader မော်ဒယ် တိုကင်များကို မည်သို့ ငွေကောက်ခံပါသလဲ။

သင် configure လုပ်ထားသော မော်ဒယ် grader များ အသုံးပြုသည့် တိုကင်များကို ကျွန်ုပ်တို့ ရေတွက်ပါသည်။ လေ့ကျင့်ရေး ပြီးဆုံးပြီးနောက် ထိုတိုကင်များကို ကျွန်ုပ်တို့၏ စံ per-token နှုန်းထားများဖြင့် ငွေကောက်ခံပါသည်။

run တစ်ခုကို ခေတ္တရပ်ပြီး ပြန်လည်စတင်နိုင်ပါသလား။

ဟုတ်ကဲ့။ သင် ခေတ္တရပ်သောအခါ ကျွန်ုပ်တို့က checkpoint တစ်ခု သိမ်းပြီး ထိုအချိန်အထိ လုပ်ပြီးသော အလုပ်အတွက် ငွေကောက်ခံပါသည်။ သင် ပြန်လည်စတင်သောအခါ ပြန်လည်စတင်ပြီးနောက် ပြုလုပ်သော ထပ်ဆောင်းအလုပ်အတွက်သာ ငွေကောက်ခံပါမည်။

Reinforcement Fine‑Tuning ငွေကောက်ခံမှုနှင့် ပတ်သက်၍ အခြားမေးခွန်းများရှိပါက ကျွန်ုပ်တို့၏ support team ကို ဆက်သွယ်ပါ

ဤဆောင်းပါးသည် အထောက်အကူ ဖြစ်ပါသလား။