Cara pengebilan berfungsi untuk RFT
Reinforcement Fine‑Tuning (RFT) membolehkan anda mengoptimumkan prestasi model penaakulan OpenAI menggunakan pembelajaran pengukuhan. Berbeza daripada tawaran penalaan halus terselia atau berasaskan keutamaan kami, yang dibilkan mengikut bilangan token dalam set data latihan, RFT dibilkan berdasarkan masa yang digunakan oleh larian latihan anda untuk melaksanakan kerja pembelajaran mesin teras.
Panduan ini menerangkan perkara yang dikira sebagai masa latihan boleh dibilkan, cara kami mengendalikan jeda dan pembatalan, serta cara pilihan konfigurasi anda boleh mempengaruhi kos.
Harga
Pengiraan: $100 bagi setiap jam masa jam dinding yang digunakan dalam gelung latihan teras untuk
o4-mini-2025-04-16. Caj diproratakan hingga ke saat dan dibundarkan kepada dua tempat perpuluhan pada invois (cth., 2.55 jam).Penggunaan penggred model: Jika anda menggunakan model OpenAI untuk “menggred” output semasa latihan, token yang digunakan oleh panggilan penggredan tersebut dibilkan secara berasingan pada kadar API standard kami selepas latihan selesai.
Kami hanya mengenakan caj untuk kerja latihan yang benar-benar mengemas kini model anda (yang kami panggil “kemajuan ke hadapan yang dirakam”).
Perkara yang kami bilkan
Kami mengebil masa yang digunakan oleh pekerja latihan anda untuk melatih model anda secara aktif, khususnya:
Menjana sampel daripada model anda semasa proses penalaan halus (dikenali sebagai “rollouts”)
Menilai output tersebut dengan satu atau lebih penggred yang telah anda takrifkan pada kerja tersebut (ketahui lebih lanjut tentang penggred)
Mengira dan menggunakan kemas kini pemberat berdasarkan gred (perambatan balik).
Menjalankan sebarang langkah pengesahan (penilaian) yang telah anda konfigurasikan.
Kebanyakan penggred adalah “percuma” untuk dijalankan, iaitu kami tidak mengenakan caj tambahan untuk penggunaannya selain masa yang disumbangkannya kepada gelung latihan teras. Pengecualiannya ialah penggred model, kerana kami juga menjumlahkan token yang digunakan oleh penggred tersebut semasa aktiviti di atas. Token ini muncul sebagai item baris berasingan pada invois anda. Token yang digunakan oleh penggred model dibilkan pada kadar inferens biasa (harga OpenAI).
Perkara yang TIDAK kami bilkan
Kami tidak mengenakan caj untuk masa yang digunakan bagi:
Mengesahkan atau memeriksa set data anda sebelum latihan bermula.
Semakan keselamatan pada set data anda.
Menunggu dalam baris gilir untuk sumber pengiraan.
Memuat turun pemberat model atau set data.
Menyediakan (merender) set data anda ke dalam format latihan kami.
Penilaian keselamatan selepas latihan bagi model tertala halus anda.
Jika kerja latihan hilang akibat ralat di pihak kami (contohnya, jika pekerja ranap dan perlu berbalik kepada pusat semak sebelumnya), anda tidak dikenakan caj untuk masa pengiraan atau token penggred yang hilang. Butiran lanjut tentang perkara ini terdapat dalam bahagian seterusnya.
Kemajuan ke hadapan yang dirakam dan peristiwa pengebilan
Latihan terdiri daripada banyak kemas kini kecil pada model anda. Kami menjejaki bilangan kemas kini ini yang selesai dengan berjaya. Caj adalah berdasarkan masa pengiraan dan token penggred yang dikaitkan dengan kemas kini yang berjaya ini.
Kami mengenakan caj apabila salah satu “peristiwa pengebilan” berikut berlaku:
Latihan selesai dengan berjaya.
Anda menjeda latihan.
Anda membatalkan latihan.
Latihan gagal.
Setiap caj meliputi kerja tambahan yang dilakukan sejak caj terakhir. Contohnya:
Jika anda menjeda larian, kami menyimpan pusat semak dan mengenakan caj untuk masa pengiraan serta token penggred yang digunakan sejak caj terakhir.
Apabila anda menyambung semula, latihan diteruskan daripada pusat semak. Caj seterusnya (apabila selesai, dijeda lagi, dibatalkan atau gagal) hanya akan meliputi kerja tambahan yang dilakukan selepas penyambungan semula.
Jika anda membatalkan larian, kami mengenakan caj untuk kerja yang dilakukan sehingga pembatalan.
Jika latihan gagal dan kerja sejak caj terakhir hilang, anda tidak dibilkan untuk bahagian yang hilang itu.
Pendekatan “kemajuan ke hadapan yang dirakam” ini memastikan anda hanya membayar untuk kerja yang dikekalkan dalam model anda atau yang anda tinggalkan dengan sengaja.
Melihat kemajuan kerja
Kerja RFT mempunyai medan bernama usage_metrics yang mendokumenkan jumlah penggunaan kerja tersebut sehingga langkah semasa. Ini termasuk masa yang digunakan untuk latihan, serta semua token yang digunakan merentas semua penggred model dalam kerja tersebut. Medan ini boleh diperiksa melalui API (GET /v1/fine_tuning/jobs/{job_id}) atau melalui papan pemuka penalaan halus.
Faktor yang mempengaruhi masa latihan
Oleh sebab pengebilan adalah berdasarkan masa, pilihan konfigurasi anda secara langsung mempengaruhi kos. Faktor utama termasuk:
Kesukaran masalah: jika set data anda terdiri daripada masalah yang sukar, model berkemungkinan akan menghabiskan lebih banyak masa menaakul setiap masalah, lalu meningkatkan masa yang diperlukan untuk menghasilkan setiap sampel.
Keamatan pengiraan: Hiperparameter
compute_multipliermengawal jumlah pengiraan yang dilakukan bagi setiap langkah latihan. Nilai yang lebih tinggi menggalakkan model menaakul dengan lebih terperinci bagi setiap titik data, menyebabkan setiap langkah berjalan dengan lebih perlahan.Tetapan pengesahan:
Set pengesahan yang lebih besar meningkatkan masa yang digunakan untuk penilaian.
Meningkatkan
eval_samples(bilangan output model yang digredkan bagi setiap contoh pengesahan) meningkatkan masa pengesahan.Menjalankan pengesahan dengan lebih kerap (
eval_intervalyang lebih rendah) meningkatkan perkadaran masa yang digunakan untuk pengesahan.
Prestasi penggred:
Penggred model yang lebih besar atau lebih berkemampuan mengambil masa lebih lama untuk memberikan gred berbanding yang lebih kecil. Contohnya, penggredan dengan model penaakulan mungkin mengambil masa 10 kali lebih lama berbanding penggredan dengan model bukan penaakulan.
Fungsi penggredan Python yang kompleks mengambil masa lebih lama untuk dijalankan berbanding fungsi yang mudah.
Tetapan ini membolehkan anda mengimbangi kos, kelajuan dan kualiti model. Contohnya, pengesahan yang kerap boleh mengesan isu lebih awal tetapi meningkatkan kos. Penggredan dengan model yang lebih canggih boleh meningkatkan ketepatan penggredan dengan ketara, tetapi akan memperlahankan setiap langkah penggredan dan menjadikan kerja lebih mahal.
Mengurus kos
Untuk mengawal perbelanjaan anda:
Mulakan dengan larian yang lebih pendek untuk memahami cara konfigurasi anda mempengaruhi masa.
Gunakan bilangan contoh pengesahan dan
eval_samplesyang munasabah. Elakkan mengesahkan lebih kerap daripada yang diperlukan.Pilih model penggred terkecil yang memenuhi keperluan kualiti anda.
Pastikan penggred Python tersuai cekap.
Laraskan
compute_multiplieruntuk mengimbangi kelajuan penumpuan dan kos.Pantau larian anda dalam papan pemuka atau melalui API. Anda boleh menjeda atau membatalkan pada bila-bila masa.
Contoh
Larian latihan yang berjaya
| Masa Latihan | Masa Dibilkan | Status | Penerangan |
|---|---|---|---|
| 00:00 | 00:00 | – | Pengguna mencipta kerja RFT melalui API |
| 00:10 | 00:00 | VALIDATING_FILES | 10 minit digunakan untuk mengesahkan set data |
| 00:30 | 00:00 | VALIDATING_FILES | 20 minit menjalankan semakan keselamatan set data |
| 01:00 | 00:00 | QUEUED | 30 minit menunggu pekerja yang tersedia |
| 01:30 | 00:00 | RUNNING | 30 minit menyediakan latihan (memuat turun pemberat, prapemprosesan, dsb.) |
| 05:30 | 04:00 | RUNNING | 4 jam digunakan untuk latihan |
| 06:00 | 04:00 | RUNNING | 30 minit menjalankan penilaian keselamatan terhadap model yang terhasil |
| 06:00 | 04:00 | SUCCEEDED | Latihan selesai |
Dalam kes ini, jumlah masa jam dinding ialah 6 jam, tetapi hanya 4 jam boleh dibilkan. Kosnya ialah 4 jam × $100/jam = $400.
Contoh kerja yang gagal
Dalam contoh ini, larian berlatih selama 2 jam, menulis pusat semak, berlatih 1 jam lagi, tetapi kemudian gagal. Hanya 2 jam latihan sehingga pusat semak boleh dibilkan.
| Masa Latihan | Masa Dibilkan | Status | Penerangan |
|---|---|---|---|
| 00:00 | 00:00 | – | Pengguna mencipta kerja RFT melalui API |
| 00:10 | 00:00 | VALIDATING_FILES | 10 minit digunakan untuk mengesahkan set data |
| 00:30 | 00:00 | VALIDATING_FILES | 20 minit menjalankan semakan keselamatan set data |
| 01:00 | 00:00 | QUEUED | 30 minit menunggu pekerja yang tersedia |
| 01:30 | 00:00 | RUNNING | 30 minit menyediakan latihan (memuat turun pemberat, prapemprosesan, dsb.) |
| 03:30 | 02:00 | RUNNING | 2 jam digunakan untuk latihan |
| 03:30 | 02:00 | RUNNING | Pusat semak dicipta pada langkah 5 |
| 04:30 | 02:00 | RUNNING | Latihan gagal akibat ralat dalaman pada langkah 8 (selepas 1 jam lagi) |
| 04:30 | 02:00 | RUNNING | 30 minit menilai dan mengesahkan pusat semak |
| 04:30 | 02:00 | SUCCEEDED | Kerja selesai (dengan pusat semak terkini) |
Walaupun 3 jam digunakan untuk latihan secara keseluruhan, hanya 2 jam “dirakam” dalam pusat semak yang boleh digunakan dan dibilkan. Anda tidak bertanggungjawab atas satu jam kerja latihan yang hilang akibat kegagalan tersebut. Kosnya ialah 2 jam × $100/jam = $200.
Soalan lazim
Bilakah saya dikenakan caj?
Kami mengebil apabila larian anda selesai, dijeda, dibatalkan atau gagal. Setiap bil meliputi kerja yang dilakukan sejak bil sebelumnya.
Adakah saya perlu membayar jika larian gagal?
Jika larian gagal disebabkan ralat kami dan sebarang kerja latihan terkini hilang, anda tidak dikenakan caj untuk bahagian yang hilang itu. Jika anda membatalkan larian, anda dikenakan caj untuk kerja sehingga masa pembatalan.
Bagaimanakah token model penggred dibilkan?
Kami mengira token yang digunakan oleh mana-mana penggred model yang anda konfigurasikan. Selepas latihan selesai, kami mengebil token tersebut pada kadar per token standard kami.
Bolehkah saya menjeda dan menyambung semula larian?
Ya. Apabila anda menjeda, kami menyimpan pusat semak dan mengenakan caj untuk kerja yang telah dilakukan setakat itu. Apabila anda menyambung semula, anda hanya akan dikenakan caj untuk kerja tambahan yang dilakukan selepas penyambungan semula.
Jika anda mempunyai soalan lain tentang pengebilan Reinforcement Fine‑Tuning, hubungi pasukan sokongan kami.
