OpenAI
Halaman ini diterjemah oleh mesin. Lihat artikel asal dalam bahasa Inggeris.

Panduan pengebilan untuk API Reinforcement Fine Tuning

Cara pengebilan berfungsi untuk API RFT

Dikemas kini: 6 days ago

Cara pengebilan berfungsi untuk RFT

Reinforcement Fine‑Tuning (RFT) membolehkan anda mengoptimumkan prestasi model penaakulan OpenAI menggunakan pembelajaran pengukuhan. Berbeza daripada tawaran penalaan halus terselia atau berasaskan keutamaan kami, yang dibilkan mengikut bilangan token dalam set data latihan, RFT dibilkan berdasarkan masa yang digunakan oleh larian latihan anda untuk melaksanakan kerja pembelajaran mesin teras.

Panduan ini menerangkan perkara yang dikira sebagai masa latihan boleh dibilkan, cara kami mengendalikan jeda dan pembatalan, serta cara pilihan konfigurasi anda boleh mempengaruhi kos.

Harga

  • Pengiraan: $100 bagi setiap jam masa sebenar yang digunakan dalam gelung latihan teras untuk o4-mini-2025-04-16. Caj dikira secara prorata hingga ke saat dan dibundarkan kepada dua tempat perpuluhan pada invois (cth., 2.55 jam).

  • Penggunaan model penilai: Jika anda menggunakan model OpenAI untuk "menilai" output semasa latihan, token yang digunakan oleh panggilan penilaian tersebut dicaj secara berasingan pada kadar API standard kami selepas latihan selesai.

Kami hanya mengenakan caj untuk kerja latihan yang benar-benar mengemas kini model anda (yang kami istilahkan sebagai "kemajuan sebenar yang direkodkan").

Perkara yang kami bilkan

Kami mengebil masa yang digunakan oleh pekerja latihan anda untuk melatih model anda secara aktif, khususnya:

  • Menjana sampel daripada model anda semasa proses penalaan halus (dikenali sebagai “rollouts”)

  • Menilai output tersebut dengan satu atau lebih penggred yang telah anda takrifkan pada kerja tersebut (ketahui lebih lanjut tentang penggred)

  • Mengira dan menggunakan kemas kini pemberat berdasarkan gred (perambatan balik).

  • Menjalankan sebarang langkah pengesahan (penilaian) yang telah anda konfigurasikan.

Kebanyakan penggred adalah “percuma” untuk dijalankan, iaitu kami tidak mengenakan caj tambahan untuk penggunaannya selain masa yang disumbangkannya kepada gelung latihan teras. Pengecualiannya ialah penggred model, kerana kami juga menjumlahkan token yang digunakan oleh penggred tersebut semasa aktiviti di atas. Token ini muncul sebagai item baris berasingan pada invois anda. Token yang digunakan oleh penggred model dibilkan pada kadar inferens biasa (harga OpenAI).

Perkara yang TIDAK kami bilkan

Kami tidak mengenakan caj untuk masa yang digunakan bagi:

  • Mengesahkan atau memeriksa set data anda sebelum latihan bermula.

  • Semakan keselamatan pada set data anda.

  • Menunggu dalam baris gilir untuk sumber pengiraan.

  • Memuat turun pemberat model atau set data.

  • Menyediakan (merender) set data anda ke dalam format latihan kami.

  • Penilaian keselamatan selepas latihan bagi model tertala halus anda.

Jika kerja latihan hilang akibat ralat di pihak kami (contohnya, jika pekerja ranap dan perlu berbalik kepada pusat semak sebelumnya), anda tidak dikenakan caj untuk masa pengiraan atau token penggred yang hilang. Butiran lanjut tentang perkara ini terdapat dalam bahagian seterusnya.

Kemajuan ke hadapan yang dirakam dan peristiwa pengebilan

Latihan terdiri daripada banyak kemas kini kecil pada model anda. Kami menjejaki bilangan kemas kini ini yang selesai dengan berjaya. Caj adalah berdasarkan masa pengiraan dan token penggred yang dikaitkan dengan kemas kini yang berjaya ini.

Kami mengenakan caj apabila salah satu “peristiwa pengebilan” berikut berlaku:

  • Latihan selesai dengan berjaya.

  • Anda menjeda latihan.

  • Anda membatalkan latihan.

  • Latihan gagal.

Setiap caj meliputi kerja tambahan yang dilakukan sejak caj terakhir. Contohnya:

  • Jika anda menjeda larian, kami menyimpan pusat semak dan mengenakan caj untuk masa pengiraan serta token penggred yang digunakan sejak caj terakhir.

  • Apabila anda menyambung semula, latihan diteruskan daripada pusat semak. Caj seterusnya (apabila selesai, dijeda lagi, dibatalkan atau gagal) hanya akan meliputi kerja tambahan yang dilakukan selepas penyambungan semula.

  • Jika anda membatalkan larian, kami mengenakan caj untuk kerja yang dilakukan sehingga pembatalan.

  • Jika latihan gagal dan kerja sejak caj terakhir hilang, anda tidak dibilkan untuk bahagian yang hilang itu.

Pendekatan “kemajuan ke hadapan yang dirakam” ini memastikan anda hanya membayar untuk kerja yang dikekalkan dalam model anda atau yang anda tinggalkan dengan sengaja.

Melihat kemajuan tugas

Tugas RFT mempunyai medan bernama usage_metrics yang merekodkan jumlah penggunaan tugas tersebut sehingga langkah semasa. Ini termasuk masa yang digunakan untuk latihan dan semua token yang digunakan oleh semua model penilai dalam tugas tersebut. Medan ini boleh diperiksa melalui API (GET /v1/fine_tuning/jobs/{job_id}) atau melalui papan pemuka penalaan halus.

Faktor yang mempengaruhi tempoh latihan

Oleh sebab caj dikenakan berdasarkan masa, pilihan konfigurasi anda mempengaruhi kos secara langsung. Faktor utama termasuk:

  • Kesukaran masalah: jika set data anda terdiri daripada masalah yang sukar, model mungkin mengambil lebih banyak masa untuk menaakul setiap masalah, sekali gus meningkatkan masa yang diperlukan untuk menghasilkan setiap sampel.

  • Keamatan pengiraan: Hiperparameter compute_multiplier mengawal jumlah pengiraan yang dilakukan bagi setiap langkah latihan. Nilai yang lebih tinggi menggalakkan model menaakul dengan lebih terperinci bagi setiap titik data, menyebabkan setiap langkah berjalan dengan lebih perlahan.

  • Tetapan pengesahan:

  • Prestasi penilai:

  • Model penilai yang lebih besar atau berkeupayaan tinggi mengambil masa lebih lama untuk memberikan penilaian berbanding model yang lebih kecil. Contohnya, penilaian menggunakan model penaakulan mungkin mengambil masa 10 kali lebih lama berbanding menggunakan model bukan penaakulan.

  • Fungsi penilaian Python yang kompleks mengambil masa lebih lama untuk dijalankan berbanding fungsi yang ringkas.

Tetapan ini membolehkan anda mengimbangi kos, kelajuan dan kualiti model. Contohnya, pengesahan yang kerap dapat mengesan masalah lebih awal tetapi meningkatkan kos. Penilaian menggunakan model yang lebih canggih boleh meningkatkan ketepatan penilaian secara ketara, tetapi akan melambatkan setiap langkah penilaian dan meningkatkan kos tugas.

Mengurus kos

Untuk mengawal perbelanjaan anda:

  • Mulakan dengan proses yang lebih singkat untuk memahami cara konfigurasi anda mempengaruhi tempoh.

  • Gunakan bilangan contoh pengesahan dan eval_samples yang munasabah. Elakkan melakukan pengesahan lebih kerap daripada yang diperlukan.

  • Pilih model penilai terkecil yang memenuhi keperluan kualiti anda.

  • Pastikan penilai Python tersuai kekal cekap.

  • Laraskan compute_multiplier untuk mengimbangi kelajuan penumpuan dan kos.

  • Pantau proses anda melalui papan pemuka atau API. Anda boleh menjeda atau membatalkannya pada bila-bila masa.

Contoh

Larian latihan yang berjaya

Masa LatihanMasa DibilkanStatusPenerangan
00:0000:00Pengguna mencipta kerja RFT melalui API
00:1000:00VALIDATING_FILES10 minit digunakan untuk mengesahkan set data
00:3000:00VALIDATING_FILES20 minit menjalankan semakan keselamatan set data
01:0000:00QUEUED30 minit menunggu pekerja yang tersedia
01:3000:00RUNNING30 minit menyediakan latihan (memuat turun pemberat, prapemprosesan, dsb.)
05:3004:00RUNNING4 jam digunakan untuk latihan
06:0004:00RUNNING30 minit menjalankan penilaian keselamatan terhadap model yang terhasil
06:0004:00SUCCEEDEDLatihan selesai

Dalam kes ini, jumlah masa jam dinding ialah 6 jam, tetapi hanya 4 jam boleh dibilkan. Kosnya ialah 4 jam × $100/jam = $400.

Contoh kerja yang gagal

Dalam contoh ini, larian berlatih selama 2 jam, menulis pusat semak, berlatih 1 jam lagi, tetapi kemudian gagal. Hanya 2 jam latihan sehingga pusat semak boleh dibilkan.

Masa LatihanMasa DibilkanStatusPenerangan
00:0000:00Pengguna mencipta kerja RFT melalui API
00:1000:00VALIDATING_FILES10 minit digunakan untuk mengesahkan set data
00:3000:00VALIDATING_FILES20 minit menjalankan semakan keselamatan set data
01:0000:00QUEUED30 minit menunggu pekerja yang tersedia
01:3000:00RUNNING30 minit menyediakan latihan (memuat turun pemberat, prapemprosesan, dsb.)
03:3002:00RUNNING2 jam digunakan untuk latihan
03:3002:00RUNNINGPusat semak dicipta pada langkah 5
04:3002:00RUNNINGLatihan gagal akibat ralat dalaman pada langkah 8 (selepas 1 jam lagi)
04:3002:00RUNNING30 minit menilai dan mengesahkan pusat semak
04:3002:00SUCCEEDEDKerja selesai (dengan pusat semak terkini)

Walaupun 3 jam digunakan untuk latihan secara keseluruhan, hanya 2 jam “dirakam” dalam pusat semak yang boleh digunakan dan dibilkan. Anda tidak bertanggungjawab atas satu jam kerja latihan yang hilang akibat kegagalan tersebut. Kosnya ialah 2 jam × $100/jam = $200.

Soalan lazim

Bilakah saya dikenakan caj?

Kami mengenakan caj apabila proses anda selesai, dijeda, dibatalkan atau gagal. Setiap bil meliputi kerja yang dilakukan sejak bil sebelumnya.

Adakah saya perlu membayar jika larian gagal?

Jika larian gagal disebabkan ralat kami dan sebarang kerja latihan terkini hilang, anda tidak dikenakan caj untuk bahagian yang hilang itu. Jika anda membatalkan larian, anda dikenakan caj untuk kerja sehingga masa pembatalan.

Bagaimanakah token model penggred dibilkan?

Kami mengira token yang digunakan oleh mana-mana penggred model yang anda konfigurasikan. Selepas latihan selesai, kami mengebil token tersebut pada kadar per token standard kami.

Bolehkah saya menjeda dan menyambung semula larian?

Ya. Apabila anda menjeda, kami menyimpan pusat semak dan mengenakan caj untuk kerja yang telah dilakukan setakat itu. Apabila anda menyambung semula, anda hanya akan dikenakan caj untuk kerja tambahan yang dilakukan selepas penyambungan semula.

Jika anda mempunyai soalan lain tentang pengebilan Reinforcement Fine‑Tuning, hubungi pasukan sokongan kami.

Adakah artikel ini membantu?