Jinsi utozaji wa RFT unavyofanya kazi
Reinforcement Fine‑Tuning (RFT) hukuwezesha kuboresha utendaji wa miundo ya uwazaji ya OpenAI kwa kutumia mafunzo ya uimarishaji. Tofauti na matoleo yetu ya urekebishaji mahususi unaosimamiwa au wa mapendeleo, ambayo hutozwa kulingana na idadi ya tokeni katika seti ya data ya mafunzo, RFT hutozwa kulingana na muda ambao mchakato wako wa mafunzo hutumia kufanya kazi kuu ya ujifunzaji wa mashine.
Mwongozo huu unaeleza kinachohesabiwa kama muda wa mafunzo unaotozwa, jinsi tunavyoshughulikia kusitisha na kughairi, na jinsi chaguo zako za usanidi zinavyoweza kuathiri gharama.
Bei
Ukokotoaji: $100 kwa saa ya muda wa ukutani unaotumika kwenye mzunguko mkuu wa mafunzo kwa
o4-mini-2025-04-16. Gharama huhesabiwa kwa uwiano hadi sekunde na kuzungushwa hadi nafasi mbili za desimali kwenye ankara (mf., saa 2.55).Matumizi ya mpimaji wa muundo: Ikiwa unatumia muundo wa OpenAI “kupima” matokeo wakati wa mafunzo, tokeni zinazotumiwa na miito hiyo ya upimaji hutozwa kando kwa viwango vyetu vya kawaida vya API baada ya mafunzo kukamilika.
Tunatoza tu kwa kazi ya mafunzo ambayo kwa kweli husasisha muundo wako (tunachoita “maendeleo ya mbele yaliyonaswa”).
Tunachotoza
Tunatoza muda ambao mfanyakazi wako wa mafunzo hutumia kufunza muundo wako kikamilifu, hasa:
Kuzalisha sampuli kutoka kwa muundo wako wakati wa mchakato wa urekebishaji wa kina (zinazojulikana kama “rollouts”)
Kutathmini matokeo hayo kwa mtathmini mmoja au zaidi uliowafafanua kwenye kazi (pata maelezo zaidi kuhusu watathmini)
Kukokotoa na kutumia masasisho ya uzani kulingana na madaraja (backpropagation).
Kuendesha hatua zozote za uthibitishaji (tathmini) ulizosanidi.
Watathmini wengi ni “bila malipo” kuendesha, kumaanisha hatutozi ada ya ziada kwa matumizi yao nje ya kiasi cha muda wanachochangia kwenye mzunguko mkuu wa mafunzo. Isipokuwa kwa hili ni kwa watathmini wa muundo, ambapo pia tunajumlisha tokeni ambazo watathmini hao hutumia wakati wa shughuli zilizo hapo juu. Tokeni hizi huonekana kama kipengee tofauti kwenye ankara yako. Tokeni zinazotumiwa na watathmini wa muundo hutozwa kwa viwango vya kawaida vya inferensi (bei za OpenAI).
Tusichotoza
Hatutozi kwa muda unaotumika:
Kuthibitisha au kukagua seti yako ya data kabla ya mafunzo kuanza.
Ukaguzi wa usalama wa seti yako ya data.
Kusubiri kwenye foleni kwa rasilimali za ukokotoaji.
Kupakua uzani wa muundo au seti za data.
Kuandaa (kurender) seti yako ya data katika fomati yetu ya mafunzo.
Tathmini za usalama za baada ya mafunzo za muundo wako uliorekebishwa vyema.
Ikiwa kazi ya mafunzo itapotea kwa sababu ya hitilafu upande wetu (kwa mfano, ikiwa mfanyakazi ataacha kufanya kazi na atalazimika kurudi kwenye checkpoint ya awali), hutatozwa kwa muda wa ukokotoaji uliopotea au tokeni za mpimaji. Maelezo zaidi kuhusu hili yako kwenye sehemu inayofuata.
Maendeleo ya mbele yaliyonaswa na matukio ya utozaji
Mafunzo yana masasisho mengi madogo kwa muundo wako. Tunafuatilia ni masasisho mangapi kati ya haya yanakamilika kwa mafanikio. Gharama hutegemea muda wa ukokotoaji na tokeni za mpimaji zinazohusishwa na masasisho haya yaliyofaulu.
Tunatoza wakati mojawapo ya “matukio ya utozaji” yafuatayo yanapotokea:
Mafunzo yanakamilika kwa mafanikio.
Unasitisha mafunzo.
Unaghairi mafunzo.
Mafunzo yanashindwa.
Kila tozo hufunika kazi ya ziada iliyofanywa tangu tozo ya mwisho. Kwa mfano:
Ukisitisha mchakato, tunahifadhi checkpoint na kukutoza kwa muda wa ukokotoaji na tokeni za mpimaji zilizotumiwa tangu tozo ya mwisho.
Unapoendelea tena, mafunzo yanaendelea kutoka checkpoint. Tozo inayofuata (baada ya kukamilika, kusitishwa tena, kughairi, au kushindwa) itafunika tu kazi ya ziada iliyofanywa baada ya kuendelea tena.
Ukighairi mchakato, tunakutoza kwa kazi iliyofanywa hadi wakati wa kughairi.
Ikiwa mafunzo yatashindwa na kazi tangu tozo ya mwisho ipotee, hutatozwa kwa sehemu iliyopotea.
Mbinu hii ya “maendeleo ya mbele yaliyonaswa” huhakikisha kuwa unalipia tu kazi inayohifadhiwa katika muundo wako au ambayo unaiacha kwa makusudi.
Kuangalia maendeleo ya kazi
Kazi za RFT zina sehemu inayoitwa usage_metrics ambayo huandika jumla ya matumizi ya kazi hadi hatua ya sasa. Hii inajumuisha muda uliotumika kufunza, na tokeni zote zilizotumiwa kwenye watathmini wote wa muundo katika kazi hiyo. Sehemu hii inaweza kukaguliwa kupitia API (GET /v1/fine_tuning/jobs/{job_id}) au kupitia dashibodi ya urekebishaji wa kina.
Mambo yanayoathiri muda wa mafunzo
Kwa kuwa utozaji unategemea muda, chaguo zako za usanidi huathiri gharama moja kwa moja. Mambo muhimu ni pamoja na:
Ugumu wa tatizo: ikiwa seti yako ya data ina matatizo magumu, muundo huenda ukatumia muda zaidi katika uwazaji kwa kila tatizo, jambo ambalo huongeza muda wa kutoa kila sampuli.
Uzito wa kompyuta: Hyperparameta ya
compute_multiplierhudhibiti kiasi cha ukokotoaji unaofanya kwa kila hatua ya mafunzo. Thamani za juu huhamasisha muundo kufanya uwazaji kwa ufafanuzi zaidi kwa kila kipengee cha data, jambo linalofanya kila hatua iendeshe polepole zaidi.Mipangilio ya uthibitishaji:
Seti kubwa ya uthibitishaji huongeza muda unaotumika kwenye tathmini.
Kuongeza
eval_samples(idadi ya matokeo ya muundo yanayopimwa kwa kila mfano wa uthibitishaji) huongeza muda wa uthibitishaji.Kuendesha uthibitishaji mara nyingi zaidi (
eval_intervalya chini) huongeza uwiano wa muda unaotumika kwenye uthibitishaji.
Utendaji wa mpimaji:
Wapimaji wa muundo wakubwa au wenye uwezo zaidi huchukua muda mrefu zaidi kurudisha daraja kuliko wadogo. Kwa mfano, kupima kwa muundo wa uwazaji kunaweza kuchukua muda mara 10 zaidi kuliko kupima kwa muundo usio wa uwazaji.
Vitendaji changamano vya kupima vya Python huchukua muda mrefu zaidi kuendesha kuliko vilivyo rahisi.
Mipangilio hii hukuruhusu kusawazisha gharama, kasi na ubora wa muundo. Kwa mfano, uthibitishaji wa mara kwa mara unaweza kugundua matatizo mapema lakini huongeza gharama. Kupima kwa muundo wa hali ya juu zaidi kunaweza kuboresha sana usahihi wa upimaji, lakini kutapunguza kasi ya kila hatua ya upimaji na kufanya kazi ziwe ghali zaidi.
Kudhibiti gharama
Ili kudhibiti matumizi yako:
Anza na michakato mifupi ili kuelewa jinsi usanidi wako unavyoathiri muda.
Tumia idadi inayofaa ya mifano ya uthibitishaji na
eval_samples. Epuka kuthibitisha mara nyingi kuliko unavyohitaji.Chagua muundo mdogo zaidi wa mpimaji unaokidhi mahitaji yako ya ubora.
Weka wapimaji maalum wa Python wawe na ufanisi.
Rekebisha
compute_multiplierili kusawazisha kasi ya kufikia mwafaka na gharama.Fuatilia mchakato wako kwenye dashibodi au kupitia API. Unaweza kusitisha au kughairi wakati wowote.
Mifano
Utekelezaji wa mafunzo uliofaulu
| Muda wa Mafunzo | Muda Uliotozwa | Hali | Maelezo |
|---|---|---|---|
| 00:00 | 00:00 | – | Mtumiaji huunda kazi ya RFT kupitia API |
| 00:10 | 00:00 | VALIDATING_FILES | Dakika 10 zilizotumika kuthibitisha mkusanyiko wa data |
| 00:30 | 00:00 | VALIDATING_FILES | Dakika 20 za kuendesha ukaguzi wa usalama wa mkusanyiko wa data |
| 01:00 | 00:00 | QUEUED | Dakika 30 za kusubiri mfanyakazi anayepatikana |
| 01:30 | 00:00 | RUNNING | Dakika 30 za kusanidi mafunzo (kupakua uzani, uchakataji wa awali, n.k.) |
| 05:30 | 04:00 | RUNNING | Saa 4 zilizotumika kufunza |
| 06:00 | 04:00 | RUNNING | Dakika 30 za kuendesha tathmini za usalama za muundo uliotokana |
| 06:00 | 04:00 | SUCCEEDED | Mafunzo yanakamilika |
Katika hali hii, jumla ya muda halisi wa saa ni saa 6, lakini ni saa 4 pekee zinazotozwa. Gharama ingekuwa saa 4 × $100/saa = $400.
Mfano wa kazi iliyoshindwa
Katika mfano huu, utekelezaji hufunza kwa saa 2, huandika checkpoint, hufunza kwa saa 1 zaidi, lakini kisha hushindwa. Ni saa 2 pekee za mafunzo hadi checkpoint ndizo zinazotozwa.
| Muda wa Mafunzo | Muda Uliotozwa | Hali | Maelezo |
|---|---|---|---|
| 00:00 | 00:00 | – | Mtumiaji huunda kazi ya RFT kupitia API |
| 00:10 | 00:00 | VALIDATING_FILES | Dakika 10 zilizotumika kuthibitisha mkusanyiko wa data |
| 00:30 | 00:00 | VALIDATING_FILES | Dakika 20 za kuendesha ukaguzi wa usalama wa mkusanyiko wa data |
| 01:00 | 00:00 | QUEUED | Dakika 30 za kusubiri mfanyakazi anayepatikana |
| 01:30 | 00:00 | RUNNING | Dakika 30 za kusanidi mafunzo (kupakua uzani, uchakataji wa awali, n.k.) |
| 03:30 | 02:00 | RUNNING | Saa 2 zilizotumika kufunza |
| 03:30 | 02:00 | RUNNING | Checkpoint iliundwa katika hatua ya 5 |
| 04:30 | 02:00 | RUNNING | Mafunzo hushindwa kwa sababu ya hitilafu ya ndani katika hatua ya 8 (baada ya saa 1 zaidi) |
| 04:30 | 02:00 | RUNNING | Dakika 30 za kutathmini na kuthibitisha checkpoint |
| 04:30 | 02:00 | SUCCEEDED | Kazi inakamilika (ikiwa na checkpoint ya hivi karibuni) |
Ingawa saa 3 zilitumika kufunza kwa jumla, ni saa 2 pekee “zilizonaswa” katika checkpoint inayoweza kutumika na ndizo zinazotozwa. Saa ya kazi ya mafunzo iliyopotea kutokana na kushindwa si wajibu wako. Gharama ingekuwa saa 2 × $100/saa = $200.
Maswali yanayoulizwa mara kwa mara
Ninatozwa lini?
Tunatoza utekelezaji wako unapokamilika, kusitishwa kwa muda, kughairiwa, au kushindwa. Kila bili hushughulikia kazi iliyofanywa tangu bili iliyotangulia.
Je, ninalipa ikiwa utekelezaji utashindwa?
Ikiwa utekelezaji utashindwa kwa sababu ya kosa letu na kazi yoyote ya hivi karibuni ya mafunzo ipotee, hutatozwa kwa sehemu iliyopotea. Ukighairi utekelezaji, utatozwa kwa kazi iliyofanywa hadi wakati wa kughairi.
Tokeni za muundo wa mtathmini hutozwa vipi?
Tunahesabu tokeni zinazotumiwa na watathmini wowote wa muundo unaowasanidi. Baada ya mafunzo kukamilika, tunatoza tokeni hizo kwa viwango vyetu vya kawaida kwa kila tokeni.
Je, ninaweza kusitisha kwa muda na kuendeleza utekelezaji?
Ndiyo. Unapositisha kwa muda, tunahifadhi checkpoint na kutoza kazi iliyofanywa kufikia hapo. Unapoendelea, utatozwa tu kwa kazi ya ziada iliyofanywa baada ya kuendelea.
Ikiwa una maswali mengine kuhusu bili za Reinforcement Fine‑Tuning, wasiliana na timu yetu ya usaidizi.
