OpenAI
Halaman ini diterjemah oleh mesin. Lihat artikel asal dalam bahasa Inggeris.

Panduan pengebilan untuk API Reinforcement Fine Tuning

Cara pengebilan berfungsi untuk API RFT

Dikemas kini: 8 days ago

Cara pengebilan berfungsi untuk RFT

Reinforcement Fine‑Tuning (RFT) membolehkan anda mengoptimumkan prestasi model penaakulan OpenAI menggunakan pembelajaran pengukuhan. Berbeza daripada tawaran penalaan halus terselia atau berasaskan keutamaan kami, yang dibilkan mengikut bilangan token dalam set data latihan, RFT dibilkan berdasarkan masa yang digunakan oleh larian latihan anda untuk melaksanakan kerja pembelajaran mesin teras.

Panduan ini menerangkan perkara yang dikira sebagai masa latihan boleh dibilkan, cara kami mengendalikan jeda dan pembatalan, serta cara pilihan konfigurasi anda boleh mempengaruhi kos.

Harga

  • Pengiraan: $100 bagi setiap jam masa jam dinding yang digunakan dalam gelung latihan teras untuk o4-mini-2025-04-16. Caj diproratakan hingga ke saat dan dibundarkan kepada dua tempat perpuluhan pada invois (cth., 2.55 jam).

  • Penggunaan penggred model: Jika anda menggunakan model OpenAI untuk “menggred” output semasa latihan, token yang digunakan oleh panggilan penggredan tersebut dibilkan secara berasingan pada kadar API standard kami selepas latihan selesai.

Kami hanya mengenakan caj untuk kerja latihan yang benar-benar mengemas kini model anda (yang kami panggil “kemajuan ke hadapan yang dirakam”).

Perkara yang kami bilkan

Kami mengebil masa yang digunakan oleh pekerja latihan anda untuk melatih model anda secara aktif, khususnya:

  • Menjana sampel daripada model anda semasa proses penalaan halus (dikenali sebagai “rollouts”)

  • Menilai output tersebut dengan satu atau lebih penggred yang telah anda takrifkan pada kerja tersebut (ketahui lebih lanjut tentang penggred)

  • Mengira dan menggunakan kemas kini pemberat berdasarkan gred (perambatan balik).

  • Menjalankan sebarang langkah pengesahan (penilaian) yang telah anda konfigurasikan.

Kebanyakan penggred adalah “percuma” untuk dijalankan, iaitu kami tidak mengenakan caj tambahan untuk penggunaannya selain masa yang disumbangkannya kepada gelung latihan teras. Pengecualiannya ialah penggred model, kerana kami juga menjumlahkan token yang digunakan oleh penggred tersebut semasa aktiviti di atas. Token ini muncul sebagai item baris berasingan pada invois anda. Token yang digunakan oleh penggred model dibilkan pada kadar inferens biasa (harga OpenAI).

Perkara yang TIDAK kami bilkan

Kami tidak mengenakan caj untuk masa yang digunakan bagi:

  • Mengesahkan atau memeriksa set data anda sebelum latihan bermula.

  • Semakan keselamatan pada set data anda.

  • Menunggu dalam baris gilir untuk sumber pengiraan.

  • Memuat turun pemberat model atau set data.

  • Menyediakan (merender) set data anda ke dalam format latihan kami.

  • Penilaian keselamatan selepas latihan bagi model tertala halus anda.

Jika kerja latihan hilang akibat ralat di pihak kami (contohnya, jika pekerja ranap dan perlu berbalik kepada pusat semak sebelumnya), anda tidak dikenakan caj untuk masa pengiraan atau token penggred yang hilang. Butiran lanjut tentang perkara ini terdapat dalam bahagian seterusnya.

Kemajuan ke hadapan yang dirakam dan peristiwa pengebilan

Latihan terdiri daripada banyak kemas kini kecil pada model anda. Kami menjejaki bilangan kemas kini ini yang selesai dengan berjaya. Caj adalah berdasarkan masa pengiraan dan token penggred yang dikaitkan dengan kemas kini yang berjaya ini.

Kami mengenakan caj apabila salah satu “peristiwa pengebilan” berikut berlaku:

  • Latihan selesai dengan berjaya.

  • Anda menjeda latihan.

  • Anda membatalkan latihan.

  • Latihan gagal.

Setiap caj meliputi kerja tambahan yang dilakukan sejak caj terakhir. Contohnya:

  • Jika anda menjeda larian, kami menyimpan pusat semak dan mengenakan caj untuk masa pengiraan serta token penggred yang digunakan sejak caj terakhir.

  • Apabila anda menyambung semula, latihan diteruskan daripada pusat semak. Caj seterusnya (apabila selesai, dijeda lagi, dibatalkan atau gagal) hanya akan meliputi kerja tambahan yang dilakukan selepas penyambungan semula.

  • Jika anda membatalkan larian, kami mengenakan caj untuk kerja yang dilakukan sehingga pembatalan.

  • Jika latihan gagal dan kerja sejak caj terakhir hilang, anda tidak dibilkan untuk bahagian yang hilang itu.

Pendekatan “kemajuan ke hadapan yang dirakam” ini memastikan anda hanya membayar untuk kerja yang dikekalkan dalam model anda atau yang anda tinggalkan dengan sengaja.

Melihat kemajuan kerja

Kerja RFT mempunyai medan bernama usage_metrics yang mendokumenkan jumlah penggunaan kerja tersebut sehingga langkah semasa. Ini termasuk masa yang digunakan untuk latihan, serta semua token yang digunakan merentas semua penggred model dalam kerja tersebut. Medan ini boleh diperiksa melalui API (GET /v1/fine_tuning/jobs/{job_id}) atau melalui papan pemuka penalaan halus.

Faktor yang mempengaruhi masa latihan

Oleh sebab pengebilan adalah berdasarkan masa, pilihan konfigurasi anda secara langsung mempengaruhi kos. Faktor utama termasuk:

  • Kesukaran masalah: jika set data anda terdiri daripada masalah yang sukar, model berkemungkinan akan menghabiskan lebih banyak masa menaakul setiap masalah, lalu meningkatkan masa yang diperlukan untuk menghasilkan setiap sampel.

  • Keamatan pengiraan: Hiperparameter compute_multiplier mengawal jumlah pengiraan yang dilakukan bagi setiap langkah latihan. Nilai yang lebih tinggi menggalakkan model menaakul dengan lebih terperinci bagi setiap titik data, menyebabkan setiap langkah berjalan dengan lebih perlahan.

  • Tetapan pengesahan:

    • Set pengesahan yang lebih besar meningkatkan masa yang digunakan untuk penilaian.

    • Meningkatkan eval_samples (bilangan output model yang digredkan bagi setiap contoh pengesahan) meningkatkan masa pengesahan.

    • Menjalankan pengesahan dengan lebih kerap (eval_interval yang lebih rendah) meningkatkan perkadaran masa yang digunakan untuk pengesahan.

  • Prestasi penggred:

    • Penggred model yang lebih besar atau lebih berkemampuan mengambil masa lebih lama untuk memberikan gred berbanding yang lebih kecil. Contohnya, penggredan dengan model penaakulan mungkin mengambil masa 10 kali lebih lama berbanding penggredan dengan model bukan penaakulan.

    • Fungsi penggredan Python yang kompleks mengambil masa lebih lama untuk dijalankan berbanding fungsi yang mudah.

Tetapan ini membolehkan anda mengimbangi kos, kelajuan dan kualiti model. Contohnya, pengesahan yang kerap boleh mengesan isu lebih awal tetapi meningkatkan kos. Penggredan dengan model yang lebih canggih boleh meningkatkan ketepatan penggredan dengan ketara, tetapi akan memperlahankan setiap langkah penggredan dan menjadikan kerja lebih mahal.

Mengurus kos

Untuk mengawal perbelanjaan anda:

  • Mulakan dengan larian yang lebih pendek untuk memahami cara konfigurasi anda mempengaruhi masa.

  • Gunakan bilangan contoh pengesahan dan eval_samples yang munasabah. Elakkan mengesahkan lebih kerap daripada yang diperlukan.

  • Pilih model penggred terkecil yang memenuhi keperluan kualiti anda.

  • Pastikan penggred Python tersuai cekap.

  • Laraskan compute_multiplier untuk mengimbangi kelajuan penumpuan dan kos.

  • Pantau larian anda dalam papan pemuka atau melalui API. Anda boleh menjeda atau membatalkan pada bila-bila masa.

Contoh

Larian latihan yang berjaya

Masa LatihanMasa DibilkanStatusPenerangan
00:0000:00Pengguna mencipta kerja RFT melalui API
00:1000:00VALIDATING_FILES10 minit digunakan untuk mengesahkan set data
00:3000:00VALIDATING_FILES20 minit menjalankan semakan keselamatan set data
01:0000:00QUEUED30 minit menunggu pekerja yang tersedia
01:3000:00RUNNING30 minit menyediakan latihan (memuat turun pemberat, prapemprosesan, dsb.)
05:3004:00RUNNING4 jam digunakan untuk latihan
06:0004:00RUNNING30 minit menjalankan penilaian keselamatan terhadap model yang terhasil
06:0004:00SUCCEEDEDLatihan selesai

Dalam kes ini, jumlah masa jam dinding ialah 6 jam, tetapi hanya 4 jam boleh dibilkan. Kosnya ialah 4 jam × $100/jam = $400.

Contoh kerja yang gagal

Dalam contoh ini, larian berlatih selama 2 jam, menulis pusat semak, berlatih 1 jam lagi, tetapi kemudian gagal. Hanya 2 jam latihan sehingga pusat semak boleh dibilkan.

Masa LatihanMasa DibilkanStatusPenerangan
00:0000:00Pengguna mencipta kerja RFT melalui API
00:1000:00VALIDATING_FILES10 minit digunakan untuk mengesahkan set data
00:3000:00VALIDATING_FILES20 minit menjalankan semakan keselamatan set data
01:0000:00QUEUED30 minit menunggu pekerja yang tersedia
01:3000:00RUNNING30 minit menyediakan latihan (memuat turun pemberat, prapemprosesan, dsb.)
03:3002:00RUNNING2 jam digunakan untuk latihan
03:3002:00RUNNINGPusat semak dicipta pada langkah 5
04:3002:00RUNNINGLatihan gagal akibat ralat dalaman pada langkah 8 (selepas 1 jam lagi)
04:3002:00RUNNING30 minit menilai dan mengesahkan pusat semak
04:3002:00SUCCEEDEDKerja selesai (dengan pusat semak terkini)

Walaupun 3 jam digunakan untuk latihan secara keseluruhan, hanya 2 jam “dirakam” dalam pusat semak yang boleh digunakan dan dibilkan. Anda tidak bertanggungjawab atas satu jam kerja latihan yang hilang akibat kegagalan tersebut. Kosnya ialah 2 jam × $100/jam = $200.

Soalan lazim

Bilakah saya dikenakan caj?

Kami mengebil apabila larian anda selesai, dijeda, dibatalkan atau gagal. Setiap bil meliputi kerja yang dilakukan sejak bil sebelumnya.

Adakah saya perlu membayar jika larian gagal?

Jika larian gagal disebabkan ralat kami dan sebarang kerja latihan terkini hilang, anda tidak dikenakan caj untuk bahagian yang hilang itu. Jika anda membatalkan larian, anda dikenakan caj untuk kerja sehingga masa pembatalan.

Bagaimanakah token model penggred dibilkan?

Kami mengira token yang digunakan oleh mana-mana penggred model yang anda konfigurasikan. Selepas latihan selesai, kami mengebil token tersebut pada kadar per token standard kami.

Bolehkah saya menjeda dan menyambung semula larian?

Ya. Apabila anda menjeda, kami menyimpan pusat semak dan mengenakan caj untuk kerja yang telah dilakukan setakat itu. Apabila anda menyambung semula, anda hanya akan dikenakan caj untuk kerja tambahan yang dilakukan selepas penyambungan semula.

Jika anda mempunyai soalan lain tentang pengebilan Reinforcement Fine‑Tuning, hubungi pasukan sokongan kami.

Adakah artikel ini membantu?