Jinsi utozaji wa RFT unavyofanya kazi
Reinforcement Fine‑Tuning (RFT) hukuwezesha kuboresha utendaji wa miundo ya uwazaji ya OpenAI kwa kutumia mafunzo ya uimarishaji. Tofauti na matoleo yetu ya urekebishaji mahususi unaosimamiwa au wa mapendeleo, ambayo hutozwa kulingana na idadi ya tokeni katika seti ya data ya mafunzo, RFT hutozwa kulingana na muda ambao mchakato wako wa mafunzo hutumia kufanya kazi kuu ya ujifunzaji wa mashine.
Mwongozo huu unaeleza kinachohesabiwa kama muda wa mafunzo unaotozwa, jinsi tunavyoshughulikia kusitisha na kughairi, na jinsi chaguo zako za usanidi zinavyoweza kuathiri gharama.
Bei
Ukokotoaji: $100 kwa kila saa ya muda halisi unaotumika katika mzunguko mkuu wa mafunzo wa o4-mini-2025-04-16. Ada huhesabiwa kulingana na sekunde zilizotumika na huwekwa katika nafasi mbili za desimali kwenye ankara (k.m., saa 2.55).
Matumizi ya muundo wa kutathmini: Ukitumia muundo wa OpenAI "kutathmini" matokeo wakati wa mafunzo, tokeni zinazotumiwa na miito hiyo ya tathmini hutozwa kando kwa viwango vyetu vya kawaida vya API baada ya mafunzo kukamilika.
Tunatoza tu kazi ya mafunzo inayosasisha muundo wako (tunaiita "maendeleo halisi yaliyorekodiwa").
Tunachotoza
Tunatoza muda ambao mfanyakazi wako wa mafunzo hutumia kufunza muundo wako kikamilifu, hasa:
Kuzalisha sampuli kutoka kwa muundo wako wakati wa mchakato wa urekebishaji wa kina (zinazojulikana kama “rollouts”)
Kutathmini matokeo hayo kwa mtathmini mmoja au zaidi uliowafafanua kwenye kazi (pata maelezo zaidi kuhusu watathmini)
Kukokotoa na kutumia masasisho ya uzani kulingana na madaraja (backpropagation).
Kuendesha hatua zozote za uthibitishaji (tathmini) ulizosanidi.
Watathmini wengi ni “bila malipo” kuendesha, kumaanisha hatutozi ada ya ziada kwa matumizi yao nje ya kiasi cha muda wanachochangia kwenye mzunguko mkuu wa mafunzo. Isipokuwa kwa hili ni kwa watathmini wa muundo, ambapo pia tunajumlisha tokeni ambazo watathmini hao hutumia wakati wa shughuli zilizo hapo juu. Tokeni hizi huonekana kama kipengee tofauti kwenye ankara yako. Tokeni zinazotumiwa na watathmini wa muundo hutozwa kwa viwango vya kawaida vya inferensi (bei za OpenAI).
Tusichotoza
Hatutozi kwa muda unaotumika:
Kuthibitisha au kukagua seti yako ya data kabla ya mafunzo kuanza.
Ukaguzi wa usalama wa seti yako ya data.
Kusubiri kwenye foleni kwa rasilimali za ukokotoaji.
Kupakua uzani wa muundo au seti za data.
Kuandaa (kurender) seti yako ya data katika fomati yetu ya mafunzo.
Tathmini za usalama za baada ya mafunzo za muundo wako uliorekebishwa vyema.
Ikiwa kazi ya mafunzo itapotea kwa sababu ya hitilafu upande wetu (kwa mfano, ikiwa mfanyakazi ataacha kufanya kazi na atalazimika kurudi kwenye checkpoint ya awali), hutatozwa kwa muda wa ukokotoaji uliopotea au tokeni za mpimaji. Maelezo zaidi kuhusu hili yako kwenye sehemu inayofuata.
Maendeleo ya mbele yaliyonaswa na matukio ya utozaji
Mafunzo yana masasisho mengi madogo kwa muundo wako. Tunafuatilia ni masasisho mangapi kati ya haya yanakamilika kwa mafanikio. Gharama hutegemea muda wa ukokotoaji na tokeni za mpimaji zinazohusishwa na masasisho haya yaliyofaulu.
Tunatoza wakati mojawapo ya “matukio ya utozaji” yafuatayo yanapotokea:
Mafunzo yanakamilika kwa mafanikio.
Unasitisha mafunzo.
Unaghairi mafunzo.
Mafunzo yanashindwa.
Kila tozo hufunika kazi ya ziada iliyofanywa tangu tozo ya mwisho. Kwa mfano:
Ukisitisha mchakato, tunahifadhi checkpoint na kukutoza kwa muda wa ukokotoaji na tokeni za mpimaji zilizotumiwa tangu tozo ya mwisho.
Unapoendelea tena, mafunzo yanaendelea kutoka checkpoint. Tozo inayofuata (baada ya kukamilika, kusitishwa tena, kughairi, au kushindwa) itafunika tu kazi ya ziada iliyofanywa baada ya kuendelea tena.
Ukighairi mchakato, tunakutoza kwa kazi iliyofanywa hadi wakati wa kughairi.
Ikiwa mafunzo yatashindwa na kazi tangu tozo ya mwisho ipotee, hutatozwa kwa sehemu iliyopotea.
Mbinu hii ya “maendeleo ya mbele yaliyonaswa” huhakikisha kuwa unalipia tu kazi inayohifadhiwa katika muundo wako au ambayo unaiacha kwa makusudi.
Kuangalia maendeleo ya kazi
Kazi za RFT zina sehemu inayoitwa usage_metrics ambayo huonyesha jumla ya matumizi ya kazi hadi hatua ya sasa. Hii inajumuisha muda uliotumika kufunza na tokeni zote zilizotumiwa na miundo yote ya kutathmini katika kazi hiyo. Sehemu hii inaweza kukaguliwa kupitia API (GET /v1/fine_tuning/jobs/{job_id}) au kupitia dashibodi ya uboreshaji mahususi.
Mambo yanayoathiri muda wa mafunzo
Kwa kuwa malipo hutegemea muda, mipangilio unayochagua huathiri gharama moja kwa moja. Mambo muhimu ni pamoja na:
Ugumu wa tatizo: ikiwa seti yako ya data ina matatizo magumu, huenda muundo ukatumia muda zaidi kuwazia kila tatizo, hivyo kuongeza muda unaohitajika kutoa kila sampuli.
Kiasi cha ukokotoaji: Kigezo maalum cha compute_multiplier hudhibiti kiasi cha ukokotoaji unaofanywa katika kila hatua ya mafunzo. Thamani za juu huhimiza muundo kueleza uwazaji wake kwa kina zaidi kwa kila kipengee cha data, hivyo kila hatua huchukua muda mrefu zaidi.
Mipangilio ya uthibitishaji:
Utendaji wa kitathmini:
Miundo mikubwa au yenye uwezo zaidi ya kutathmini huchukua muda mrefu zaidi kutoa alama kuliko miundo midogo. Kwa mfano, kutathmini kwa muundo wa uwazaji kunaweza kuchukua muda mrefu mara 10 kuliko kutathmini kwa muundo usiotumia uwazaji.
Vitendakazi changamano vya Python vya kutathmini huchukua muda mrefu zaidi kuliko vitendakazi rahisi.
Mipangilio hii hukuruhusu kusawazisha gharama, kasi na ubora wa muundo. Kwa mfano, uthibitishaji wa mara kwa mara unaweza kugundua matatizo mapema, lakini huongeza gharama. Kutathmini kwa muundo wa hali ya juu zaidi kunaweza kuboresha sana usahihi wa tathmini, lakini kutapunguza kasi ya kila hatua ya tathmini na kuongeza gharama za kazi.
Kudhibiti gharama
Ili kudhibiti matumizi yako:
Anza na utekelezaji mfupi ili kuelewa jinsi mipangilio yako inavyoathiri muda.
Tumia idadi inayofaa ya mifano ya uthibitishaji na eval_samples. Epuka kufanya uthibitishaji mara nyingi kuliko inavyohitajika.
Chagua muundo mdogo zaidi wa kutathmini unaokidhi mahitaji yako ya ubora.
Hakikisha vitathmini maalum vya Python vina ufanisi.
Rekebisha compute_multiplier ili kusawazisha kasi ya kufikia uthabiti na gharama.
Fuatilia utekelezaji wako kwenye dashibodi au kupitia API. Unaweza kuusitisha kwa muda au kuughairi wakati wowote.
Mifano
Utekelezaji wa mafunzo uliofaulu
| Muda wa Mafunzo | Muda Uliotozwa | Hali | Maelezo |
|---|---|---|---|
| 00:00 | 00:00 | – | Mtumiaji huunda kazi ya RFT kupitia API |
| 00:10 | 00:00 | VALIDATING_FILES | Dakika 10 zilizotumika kuthibitisha mkusanyiko wa data |
| 00:30 | 00:00 | VALIDATING_FILES | Dakika 20 za kuendesha ukaguzi wa usalama wa mkusanyiko wa data |
| 01:00 | 00:00 | QUEUED | Dakika 30 za kusubiri mfanyakazi anayepatikana |
| 01:30 | 00:00 | RUNNING | Dakika 30 za kusanidi mafunzo (kupakua uzani, uchakataji wa awali, n.k.) |
| 05:30 | 04:00 | RUNNING | Saa 4 zilizotumika kufunza |
| 06:00 | 04:00 | RUNNING | Dakika 30 za kuendesha tathmini za usalama za muundo uliotokana |
| 06:00 | 04:00 | SUCCEEDED | Mafunzo yanakamilika |
Katika hali hii, jumla ya muda halisi wa saa ni saa 6, lakini ni saa 4 pekee zinazotozwa. Gharama ingekuwa saa 4 × $100/saa = $400.
Mfano wa kazi iliyoshindwa
Katika mfano huu, utekelezaji hufunza kwa saa 2, huandika checkpoint, hufunza kwa saa 1 zaidi, lakini kisha hushindwa. Ni saa 2 pekee za mafunzo hadi checkpoint ndizo zinazotozwa.
| Muda wa Mafunzo | Muda Uliotozwa | Hali | Maelezo |
|---|---|---|---|
| 00:00 | 00:00 | – | Mtumiaji huunda kazi ya RFT kupitia API |
| 00:10 | 00:00 | VALIDATING_FILES | Dakika 10 zilizotumika kuthibitisha mkusanyiko wa data |
| 00:30 | 00:00 | VALIDATING_FILES | Dakika 20 za kuendesha ukaguzi wa usalama wa mkusanyiko wa data |
| 01:00 | 00:00 | QUEUED | Dakika 30 za kusubiri mfanyakazi anayepatikana |
| 01:30 | 00:00 | RUNNING | Dakika 30 za kusanidi mafunzo (kupakua uzani, uchakataji wa awali, n.k.) |
| 03:30 | 02:00 | RUNNING | Saa 2 zilizotumika kufunza |
| 03:30 | 02:00 | RUNNING | Checkpoint iliundwa katika hatua ya 5 |
| 04:30 | 02:00 | RUNNING | Mafunzo hushindwa kwa sababu ya hitilafu ya ndani katika hatua ya 8 (baada ya saa 1 zaidi) |
| 04:30 | 02:00 | RUNNING | Dakika 30 za kutathmini na kuthibitisha checkpoint |
| 04:30 | 02:00 | SUCCEEDED | Kazi inakamilika (ikiwa na checkpoint ya hivi karibuni) |
Ingawa saa 3 zilitumika kufunza kwa jumla, ni saa 2 pekee “zilizonaswa” katika checkpoint inayoweza kutumika na ndizo zinazotozwa. Saa ya kazi ya mafunzo iliyopotea kutokana na kushindwa si wajibu wako. Gharama ingekuwa saa 2 × $100/saa = $200.
Maswali yanayoulizwa mara kwa mara
Nitatozwa lini?
Tunatoza utekelezaji wako unapokamilika, unapositishwa kwa muda, unapoghairiwa au unapofeli. Kila bili inajumuisha kazi iliyofanywa tangu bili iliyotangulia.
Je, ninalipa ikiwa utekelezaji utashindwa?
Ikiwa utekelezaji utashindwa kwa sababu ya kosa letu na kazi yoyote ya hivi karibuni ya mafunzo ipotee, hutatozwa kwa sehemu iliyopotea. Ukighairi utekelezaji, utatozwa kwa kazi iliyofanywa hadi wakati wa kughairi.
Tokeni za muundo wa mtathmini hutozwa vipi?
Tunahesabu tokeni zinazotumiwa na watathmini wowote wa muundo unaowasanidi. Baada ya mafunzo kukamilika, tunatoza tokeni hizo kwa viwango vyetu vya kawaida kwa kila tokeni.
Je, ninaweza kusitisha kwa muda na kuendeleza utekelezaji?
Ndiyo. Unapositisha kwa muda, tunahifadhi checkpoint na kutoza kazi iliyofanywa kufikia hapo. Unapoendelea, utatozwa tu kwa kazi ya ziada iliyofanywa baada ya kuendelea.
Ikiwa una maswali mengine kuhusu bili za Reinforcement Fine‑Tuning, wasiliana na timu yetu ya usaidizi.
