OpenAI
Tämä sivu on konekäännetty. Katso alkuperäinen englanninkielinen artikkeli.

Reinforcement Fine-Tuning API:n laskutusopas

Miten RFT API:n laskutus toimii

Päivitetty: 2 hours ago

Miten RFT:n laskutus toimii

Reinforcement Fine‑Tuning (RFT) mahdollistaa OpenAI:n päättelymallien suorituskyvyn optimoinnin vahvistusoppimisen avulla. Toisin kuin valvotun tai preferensseihin perustuvan hienosäädön tarjontamme, jotka laskutetaan koulutusaineiston tokenien määrän mukaan, RFT laskutetaan sen ajan perusteella, jonka koulutusajo käyttää varsinaiseen koneoppimistyöhön.

Tässä oppaassa kerrotaan, mikä lasketaan laskutettavaksi koulutusajaksi, miten käsittelemme tauotuksia ja peruutuksia sekä miten asetuksesi voivat vaikuttaa kustannuksiin.

Hinnoittelu

  • Laskenta: 100 $ ydinkoulutussilmukassa käytettyä todellista tuntia kohden mallille o4-mini-2025-04-16. Veloitukset lasketaan sekunnin tarkkuudella ja pyöristetään laskussa kahteen desimaaliin (esim. 2,55 tuntia).

  • Malliarvioijan käyttö: Jos käytät OpenAI-mallia tuotosten "arviointiin" koulutuksen aikana, näiden arviointikutsujen käyttämät tokenit laskutetaan erikseen API-vakiohintojemme mukaisesti koulutuksen päätyttyä.

Veloitamme vain koulutustyöstä, joka todella päivittää malliasi (kutsumme tätä "talteen otetuksi etenemiseksi").

Mistä veloitamme

Veloitamme ajasta, jonka koulutustyöntekijäsi käyttää aktiivisesti mallisi kouluttamiseen, tarkemmin sanottuna:

  • Näytteiden luominen mallistasi hienosäätöprosessin aikana (niin kutsutut ”rolloutit”)

  • Näiden tuotosten arviointi yhdellä tai useammalla arvioijalla, jotka olet määrittänyt työhön (lue lisää arvioijista)

  • Painopäivitysten laskeminen ja soveltaminen arvosanojen perusteella (vastavirta-algoritmi).

  • Määrittämiesi validointi- eli arviointivaiheiden suorittaminen.

Useimpien arvioijien suorittaminen on ”maksutonta”, eli emme veloita niiden käytöstä erikseen sen ajan lisäksi, jonka ne lisäävät varsinaiseen koulutussilmukkaan. Poikkeuksena ovat malliarvioijat, joiden osalta laskemme myös tokenit, joita ne kuluttavat edellä mainituissa toiminnoissa. Nämä tokenit näkyvät laskullasi erillisenä rivinä. Malliarvioijien kuluttamat tokenit laskutetaan normaaleilla päättelyhinnoilla (OpenAI:n hinnasto).

Mistä emme laskuta

Emme veloita ajasta, joka kuluu:

  • Datajoukkosi validointiin tai tarkastamiseen ennen koulutuksen alkua.

  • Datajoukkosi turvallisuustarkistuksiin.

  • Laskentaresurssien jonossa odottamiseen.

  • Mallipainojen tai datajoukkojen lataamiseen.

  • Datajoukkosi valmisteluun (renderöintiin) koulutusmuotoomme.

  • Hienosäädetyn mallisi koulutuksen jälkeisiin turvallisuusarviointeihin.

Jos koulutustyö menetetään meidän puolellamme tapahtuneen virheen vuoksi (esimerkiksi jos työntekijä kaatuu ja sen on palattava edelliseen tarkistuspisteeseen), sinua ei veloiteta menetetystä laskenta-ajasta tai arvioijatokeneista. Lisää tästä seuraavassa osiossa.

Tallentunut eteneminen ja laskutustapahtumat

Koulutus koostuu monista pienistä malliin tehtävistä päivityksistä. Seuraamme, kuinka moni näistä päivityksistä valmistuu onnistuneesti. Maksut perustuvat näihin onnistuneisiin päivityksiin liittyvään laskenta-aikaan ja arvioijatokeneihin.

Velotus syntyy, kun jokin seuraavista ”laskutustapahtumista” tapahtuu:

  • Koulutus valmistuu onnistuneesti.

  • Keskeytät koulutuksen.

  • Peruutat koulutuksen.

  • Koulutus epäonnistuu.

Kukin veloitus kattaa edellisen veloituksen jälkeen tehdyn lisätyön. Esimerkiksi:

  • Jos keskeytät ajon, tallennamme tarkistuspisteen ja veloitamme edellisen veloituksen jälkeen käytetyn laskenta-ajan ja arvioijatokenit.

  • Kun jatkat, koulutus jatkuu tarkistuspisteestä. Seuraava veloitus (valmistumisen, uuden keskeytyksen, peruutuksen tai epäonnistumisen yhteydessä) kattaa vain jatkamisen jälkeen tehdyn lisätyön.

  • Jos peruutat ajon, veloitamme peruutukseen asti tehdystä työstä.

  • Jos koulutus epäonnistuu ja edellisen veloituksen jälkeen tehty työ menetetään, sinua ei veloiteta menetetystä osuudesta.

Tämä ”captured forward progress” -lähestymistapa varmistaa, että maksat vain työstä, joka säilyy mallissasi tai jonka hylkäät tarkoituksella.

Työn etenemisen tarkastelu

RFT-töissä on usage_metrics-kenttä, joka sisältää työn kokonaiskäytön nykyiseen vaiheeseen asti. Tähän sisältyvät koulutukseen käytetty aika ja työn kaikkien malliarvioijien käyttämät tokenit. Kenttää voi tarkastella API:n kautta (GET /v1/fine_tuning/jobs/{job_id}) tai hienosäädön hallintapaneelissa.

Koulutusaikaan vaikuttavat tekijät

Koska laskutus perustuu aikaan, määritysvalintasi vaikuttavat suoraan kustannuksiin. Keskeisiä tekijöitä ovat:

  • Ongelman vaikeus: jos tietoaineistosi koostuu vaikeista ongelmista, malli käyttää todennäköisesti enemmän aikaa kunkin ongelman päättelyyn, jolloin jokaisen näytteen tuottaminen kestää kauemmin.

  • Laskennan määrä: compute_multiplier-hyperparametri määrittää, kuinka paljon laskentaa kussakin koulutusvaiheessa tehdään. Suuremmat arvot kannustavat mallia päättelemään kustakin datapisteestä perusteellisemmin, minkä vuoksi jokainen vaihe kestää kauemmin.

  • Validointiasetukset:

  • Arvioijan suorituskyky:

  • Suuremmilta tai kyvykkäämmiltä malliarvioijilta arvosanan saaminen kestää kauemmin kuin pienemmiltä. Esimerkiksi arviointi päättelymallilla voi kestää kymmenen kertaa kauemmin kuin muulla mallilla.

  • Monimutkaisten Python-arviointifunktioiden suorittaminen kestää kauemmin kuin yksinkertaisten.

Näillä asetuksilla voit tasapainottaa kustannuksia, nopeutta ja mallin laatua. Esimerkiksi tiheä validointi voi havaita ongelmat aiemmin, mutta se lisää kustannuksia. Edistyneemmällä mallilla arviointi voi parantaa arvioinnin tarkkuutta huomattavasti, mutta se hidastaa jokaista arviointivaihetta ja nostaa töiden kustannuksia.

Kustannusten hallinta

Näin hallitset kustannuksia:

  • Aloita lyhyemmillä ajoilla, jotta näet, miten määrityksesi vaikuttavat kestoon.

  • Käytä kohtuullista määrää validointiesimerkkejä ja eval_samples-näytteitä. Älä validoi useammin kuin on tarpeen.

  • Valitse pienin arvioijamalli, joka täyttää laatuvaatimuksesi.

  • Pidä mukautetut Python-arvioijat tehokkaina.

  • Säädä compute_multiplier-arvoa tasapainottaaksesi konvergenssinopeutta ja kustannuksia.

  • Seuraa ajoa hallintapaneelissa tai API:n kautta. Voit keskeyttää tai peruuttaa ajon milloin tahansa.

Esimerkit

Onnistunut koulutusajo

KoulutusaikaLaskutettava aikaTilaKuvaus
00:0000:00Käyttäjä luo RFT-työn API:n kautta
00:1000:00VALIDATING_FILES10 minuuttia tietojoukon validointiin
00:3000:00VALIDATING_FILES20 minuuttia tietojoukon turvallisuustarkistuksiin
01:0000:00QUEUED30 minuuttia vapaan työntekijäprosessin odottamiseen
01:3000:00RUNNING30 minuuttia koulutuksen valmisteluun (painojen lataus, esikäsittely jne.)
05:3004:00RUNNING4 tuntia koulutukseen
06:0004:00RUNNING30 minuuttia tuloksena syntyneen mallin turvallisuusarviointeihin
06:0004:00SUCCEEDEDKoulutus päättyy

Tässä tapauksessa kokonaiskesto on 6 tuntia, mutta vain 4 tuntia on laskutettavaa. Kustannus olisi 4 tuntia × $100/tunti = $400.

Esimerkki epäonnistuneesta työstä

Tässä esimerkissä ajo kouluttaa 2 tuntia, kirjoittaa tarkistuspisteen, kouluttaa vielä 1 tunnin, mutta epäonnistuu sitten. Vain tarkistuspisteeseen asti tehdyt 2 tuntia koulutusta ovat laskutettavia.

KoulutusaikaLaskutettava aikaTilaKuvaus
00:0000:00Käyttäjä luo RFT-työn API:n kautta
00:1000:00VALIDATING_FILES10 minuuttia tietojoukon validointiin
00:3000:00VALIDATING_FILES20 minuuttia tietojoukon turvallisuustarkistuksiin
01:0000:00QUEUED30 minuuttia vapaan työntekijäprosessin odottamiseen
01:3000:00RUNNING30 minuuttia koulutuksen valmisteluun (painojen lataus, esikäsittely jne.)
03:3002:00RUNNING2 tuntia koulutukseen
03:3002:00RUNNINGTarkistuspiste luotu vaiheessa 5
04:3002:00RUNNINGKoulutus epäonnistuu sisäisen virheen vuoksi vaiheessa 8 (vielä 1 tunnin jälkeen)
04:3002:00RUNNING30 minuuttia tarkistuspisteen arviointiin ja validointiin
04:3002:00SUCCEEDEDTyö päättyy (uusimmalla tarkistuspisteellä)

Vaikka koulutukseen käytettiin yhteensä 3 tuntia, vain 2 tuntia on ”tallessa” käyttökelpoisessa tarkistuspisteessä ja laskutetaan. Epäonnistumisen vuoksi menetetty koulutustunti ei ole sinun vastuullasi. Kustannus olisi 2 tuntia × $100/tunti = $200.

Usein kysytyt kysymykset

Milloin minua veloitetaan?

Veloitamme, kun ajo valmistuu, keskeytetään, peruutetaan tai epäonnistuu. Kukin veloitus kattaa edellisen veloituksen jälkeen tehdyn työn.

Maksanko, jos ajo epäonnistuu?

Jos ajo epäonnistuu meidän virheemme vuoksi ja viimeaikaista koulutustyötä menetetään, sinua ei veloiteta menetetystä osuudesta. Jos peruutat ajon, sinua veloitetaan peruutukseen asti tehdystä työstä.

Miten arvioijamallin tokenit laskutetaan?

Laskemme kaikkien määrittämiesi malliarvioijien käyttämät tokenit. Kun koulutus päättyy, laskutamme nämä tokenit vakiomuotoisten tokenikohtaisten hintojemme mukaan.

Voinko keskeyttää ajon ja jatkaa sitä?

Kyllä. Kun keskeytät ajon, tallennamme tarkistuspisteen ja veloitamme siihen mennessä tehdystä työstä. Kun jatkat ajoa, sinua veloitetaan vain jatkamisen jälkeen tehdystä lisätyöstä.

Jos sinulla on muita kysymyksiä Reinforcement Fine‑Tuningin laskutuksesta, ota yhteyttä tukitiimiimme.

Oliko tästä artikkelista apua?