Cara kerja panagihan kanggo RFT
Reinforcement Fine‑Tuning (RFT) ngidini sampeyan ngoptimalake kinerja model nalar OpenAI nganggo sinau penguatan. Ora kaya tawaran fine‑tuning terawasi utawa adhedhasar preferensi saka kami, sing ditagih miturut jumlah token ing dataset latihan, RFT ditagih adhedhasar suwene wektu proses latihan sampeyan nindakake pakaryan inti sinau mesin.
Pandhuan iki nerangake apa wae sing diitung dadi wektu pelatihan sing ditagih, kepiye cara kami nangani jeda lan pembatalan, lan kepiye pilihan konfigurasi sampeyan bisa mengaruhi biaya.
Rega
Komputasi: $100 saben jam wektu nyata sing digunakake ing loop latihan inti kanggo o4-mini-2025-04-16. Biaya dietung prorata nganti satuan detik lan dibuletake dadi rong angka desimal ing invoice (contone, 2,55 jam).
Panggunaan model pambiji: Yen sampeyan nggunakake model OpenAI kanggo "menehi biji" output sajrone latihan, token sing digunakake dening panggilan pambiji kasebut ditagih kanthi kapisah miturut tarif API standar sawise latihan rampung.
Kita mung nagih pakaryan latihan sing tenan nganyari model sampeyan (sing diarani "kemajuan nyata sing kacathet").
Apa sing ditagih
Kita nagih wektu sing digunakake worker latihan sampeyan kanggo aktif nglatih model sampeyan, yaiku:
Ngasilake sampel saka model sampeyan sajrone proses fine-tuning (dikenal minangka “rollouts”)
Ngevaluasi output kasebut nganggo siji utawa luwih grader sing wis sampeyan tetepake ing job (sinau luwih akeh babagan grader)
Ngitung lan ngetrapake nganyari bobot adhedhasar biji (backpropagation).
Nglakokake langkah validasi (evaluasi) apa wae sing wis sampeyan konfigurasi.
Umume grader “gratis” kanggo dilakokake, tegese kita ora nagih ekstra kanggo panggunaane saliyane jumlah wektu sing disumbangake menyang loop latihan inti. Pengecualiane yaiku kanggo grader model, ing kono kita uga ngetung token sing dikonsumsi grader kasebut sajrone aktivitas ing ndhuwur. Token iki katon minangka item baris kapisah ing invoice sampeyan. Token sing dikonsumsi grader model ditagih nganggo tarif inferensi normal (rega OpenAI).
Apa wae sing ORA kami tagih
Kami ora nagih kanggo wektu sing digunakake kanggo:
Memvalidasi utawa mriksa dataset sampeyan sadurunge pelatihan diwiwiti.
Pemeriksaan keamanan ing dataset sampeyan.
Ngenteni ing antrean kanggo sumber daya compute.
Ngunduh bobot model utawa dataset.
Nyiyapake (rendering) dataset sampeyan menyang format pelatihan kami.
Evaluasi keamanan sawisé pelatihan kanggo model fine-tuned sampeyan.
Yen kerja pelatihan ilang amarga kesalahan saka pihak kami (contone, yen worker crash lan kudu bali menyang checkpoint sadurunge), sampeyan ora ditagih kanggo wektu compute utawa token grader sing ilang. Rincian luwih lanjut ana ing bagean sabanjure.
Captured forward progress lan peristiwa tagihan
Pelatihan kasusun saka akeh pembaruan cilik kanggo model sampeyan. Kami nglacak pira saka pembaruan iki sing rampung kanthi sukses. Biaya adhedhasar wektu compute lan token grader sing gegandhengan karo pembaruan sukses kasebut.
Kami ngetokake tagihan nalika salah siji saka “billing events” ing ngisor iki kedadeyan:
Pelatihan rampung kanthi sukses.
Sampeyan njeda pelatihan.
Sampeyan mbatalake pelatihan.
Pelatihan gagal.
Saben tagihan nyakup kerja tambahan sing ditindakake wiwit tagihan pungkasan. Contone:
Yen sampeyan njeda run, kami nyimpen checkpoint lan nagih sampeyan kanggo wektu compute lan token grader sing digunakake wiwit tagihan pungkasan.
Nalika sampeyan nerusake, pelatihan diterusake saka checkpoint. Tagihan sabanjure (nalika rampung, jeda maneh, pembatalan, utawa gagal) mung bakal nyakup kerja tambahan sing ditindakake sawisé diterusake.
Yen sampeyan mbatalake run, kami nagih sampeyan kanggo kerja sing ditindakake nganti wektu pembatalan.
Yen pelatihan gagal lan kerja wiwit tagihan pungkasan ilang, sampeyan ora ditagih kanggo bagean sing ilang.
Pendekatan “captured forward progress” iki njamin sampeyan mung mbayar kanggo kerja sing tetep ana ing model sampeyan utawa sing sengaja sampeyan tinggalake.
Ndeleng perkembangan tugas
Tugas RFT nduweni kolom sing diarani usage_metrics, sing nyathet total panggunaan tugas nganti langkah saiki. Iki kalebu wektu kanggo latihan lan kabeh token sing digunakake dening kabeh model pambiji ing tugas kasebut. Kolom iki bisa dipriksa liwat API (GET /v1/fine_tuning/jobs/{job_id}) utawa liwat dasbor fine-tuning.
Faktor sing mengaruhi wektu latihan
Amarga tagihan adhedhasar wektu, pilihan konfigurasi sampeyan langsung mengaruhi biaya. Faktor utama kalebu:
Kangelan masalah: yen set data sampeyan ngemot masalah sing angel, model bisa uga mbutuhake wektu luwih akeh kanggo nalar saben masalah, saéngga saben sampel luwih suwe digawe.
Intensitas komputasi: Hiperparameter compute_multiplier ngontrol akehe komputasi sing ditindakake saben langkah latihan. Nilai sing luwih dhuwur nyurung model supaya nalar kanthi luwih dawa lan rinci ing saben titik data, mula saben langkah mlaku luwih alon.
Setelan validasi:
Kinerja pambiji:
Model pambiji sing luwih gedhe utawa luwih mumpuni mbutuhake wektu luwih suwe kanggo menehi biji tinimbang model sing luwih cilik. Contone, pambiji nganggo model nalar bisa mbutuhake wektu 10 kaping luwih suwe tinimbang nganggo model non-nalar.
Fungsi pambiji Python sing rumit mbutuhake wektu luwih suwe tinimbang fungsi sing prasaja.
Setelan iki ngidini sampeyan ngimbangi biaya, kacepetan, lan kualitas model. Contone, validasi sing kerep bisa nemokake masalah luwih awal, nanging nambah biaya. Pambiji nganggo model sing luwih canggih bisa ningkatake akurasi pambiji kanthi drastis, nanging bakal ngalonake saben langkah pambiji lan nambah biaya tugas.
Ngatur biaya
Kanggo ngontrol pengeluaran sampeyan:
Wiwiti kanthi proses sing luwih cendhak kanggo mangerteni carane konfigurasi sampeyan mengaruhi wektu.
Gunakake cacah conto validasi lan eval_samples sing lumrah. Aja nindakake validasi luwih kerep tinimbang sing dibutuhake.
Pilih model pambiji paling cilik sing nyukupi syarat kualitas sampeyan.
Jaga supaya pambiji Python khusus tetep efisien.
Atur compute_multiplier kanggo ngimbangi kacepetan konvergensi lan biaya.
Pantau proses sampeyan ing dasbor utawa liwat API. Sampeyan bisa ngasoake utawa mbatalake kapan wae.
Conto
Run latihan sing kasil
| Wektu Latihan | Wektu Ditagih | Status | Katrangan |
|---|---|---|---|
| 00:00 | 00:00 | – | Pangguna nggawe job RFT liwat API |
| 00:10 | 00:00 | VALIDATING_FILES | 10 menit kanggo validasi dataset |
| 00:30 | 00:00 | VALIDATING_FILES | 20 menit nglakokake pemeriksaan keamanan dataset |
| 01:00 | 00:00 | QUEUED | 30 menit ngenteni worker sing kasedhiya |
| 01:30 | 00:00 | RUNNING | 30 menit nyiyapake latihan (ngundhuh bobot, praproses, lsp.) |
| 05:30 | 04:00 | RUNNING | 4 jam kanggo latihan |
| 06:00 | 04:00 | RUNNING | 30 menit nglakokake evaluasi keamanan kanggo model asil |
| 06:00 | 04:00 | SUCCEEDED | Latihan rampung |
Ing kasus iki, total wektu wall-clock yaiku 6 jam, nanging mung 4 jam sing bisa ditagih. Biayane dadi 4 jam × $100/jam = $400.
Conto job gagal
Ing conto iki, run latihan 2 jam, nulis checkpoint, latihan 1 jam maneh, nanging banjur gagal. Mung 2 jam latihan nganti checkpoint sing bisa ditagih.
| Wektu Latihan | Wektu Ditagih | Status | Katrangan |
|---|---|---|---|
| 00:00 | 00:00 | – | Pangguna nggawe job RFT liwat API |
| 00:10 | 00:00 | VALIDATING_FILES | 10 menit kanggo validasi dataset |
| 00:30 | 00:00 | VALIDATING_FILES | 20 menit nglakokake pemeriksaan keamanan dataset |
| 01:00 | 00:00 | QUEUED | 30 menit ngenteni worker sing kasedhiya |
| 01:30 | 00:00 | RUNNING | 30 menit nyiyapake latihan (ngundhuh bobot, praproses, lsp.) |
| 03:30 | 02:00 | RUNNING | 2 jam kanggo latihan |
| 03:30 | 02:00 | RUNNING | Checkpoint digawe ing langkah 5 |
| 04:30 | 02:00 | RUNNING | Latihan gagal amarga error internal ing langkah 8 (sawise 1 jam maneh) |
| 04:30 | 02:00 | RUNNING | 30 menit ngevaluasi lan validasi checkpoint |
| 04:30 | 02:00 | SUCCEEDED | Job rampung (karo checkpoint paling anyar) |
Sanajan total 3 jam digunakake kanggo latihan, mung 2 jam sing “kacathet” ing checkpoint sing bisa digunakake lan ditagih. Jam karya latihan sing ilang amarga kegagalan iku dudu tanggung jawab sampeyan. Biayane dadi 2 jam × $100/jam = $200.
Pitakonan sing asring ditakokake
Kapan aku ditagih?
Tagihan digawe nalika proses sampeyan rampung, diasoake, dibatalake, utawa gagal. Saben tagihan nyakup pakaryan sing ditindakake wiwit tagihan sadurunge.
Apa aku mbayar yen run gagal?
Yen run gagal amarga error saka pihak kita lan karya latihan paling anyar ilang, sampeyan ora dikenani biaya kanggo bagean sing ilang. Yen sampeyan mbatalake run, sampeyan dikenani biaya kanggo karya nganti wektu pambatalan.
Kepiye token model grader ditagih?
Kita ngetung token sing digunakake dening grader model apa wae sing sampeyan konfigurasi. Sawise latihan rampung, kita nagih token kasebut nganggo tarif standar saben token.
Apa aku bisa ngaso lan nerusake run?
Ya. Nalika sampeyan ngaso, kita nyimpen checkpoint lan nagih karya sing wis rampung nganti saiki. Nalika sampeyan nerusake, sampeyan mung bakal dikenani biaya kanggo karya tambahan sing rampung sawise diterusake.
Yen sampeyan duwe pitakon liyane babagan tagihan Reinforcement Fine‑Tuning, hubungi tim dhukungan kita.
