OpenAI
Ta stran je bila strojno prevedena. Oglejte si izvirni članek v angleščini.

Vodnik za obračunavanje za API za prilagajanje z okrepljenim učenjem

Kako deluje obračunavanje za API RFT

Posodobljeno: 7 days ago

Kako deluje obračunavanje za prilagajanje z okrepljenim učenjem

Prilagajanje z okrepljenim učenjem (RFT) vam omogoča, da z okrepljenim učenjem optimizirate zmogljivost OpenAI-jevih modelov sklepanja. Za razliko od naših ponudb nadzorovanega prilagajanja ali prilagajanja po preferencah, ki se obračunavajo glede na število žetonov v naboru podatkov za učenje, se RFT obračunava glede na čas, ki ga vaš zagon učenja porabi za izvajanje osnovnega dela strojnega učenja.

Ta vodnik pojasnjuje, kaj se šteje kot zaračunljiv čas učenja, kako obravnavamo začasne zaustavitve in preklice ter kako lahko vaše izbire konfiguracije vplivajo na stroške.

Cene

  • Računanje: 100 USD na uro dejanskega časa, porabljenega v osnovni učni zanki za o4-mini-2025-04-16. Stroški se obračunajo sorazmerno po sekundah in na računu zaokrožijo na dve decimalni mesti (npr. 2,55 ure).

  • Uporaba modela ocenjevalnika: Če med učenjem za »ocenjevanje« izhodov uporabljate model OpenAI, se žetoni, porabljeni pri teh klicih za ocenjevanje, po koncu učenja zaračunajo ločeno po naših standardnih cenah API-ja.

Zaračunamo samo učno delo, ki vaš model dejansko posodobi (temu pravimo »zajeti napredek naprej«).

Za kaj zaračunavamo

Zaračunavamo čas, ki ga vaš delovni proces za učenje porabi za aktivno učenje vašega modela, in sicer:

  • Ustvarjanje vzorcev iz vašega modela med postopkom finega prilagajanja (znano kot »izvajanja«)

  • Ocenjevanje teh izhodov z enim ali več ocenjevalniki, ki ste jih določili v opravilu (več o ocenjevalnikih)

  • Računanje in uporaba posodobitev uteži na podlagi ocen (vzvratno razširjanje).

  • Izvajanje vseh korakov preverjanja (evalvacije), ki ste jih konfigurirali.

Večino ocenjevalnikov je mogoče izvajati »brezplačno«, kar pomeni, da njihove uporabe ne zaračunavamo dodatno zunaj časa, ki ga prispevajo k osnovni zanki učenja. Izjema so modelski ocenjevalniki, pri katerih štejemo tudi žetone, ki jih ti ocenjevalniki porabijo med zgornjimi dejavnostmi. Ti žetoni so na računu prikazani kot ločena postavka. Žetoni, ki jih porabijo modelski ocenjevalniki, se zaračunajo po običajnih cenah za sklepanje (cenik OpenAI).

Česa NE zaračunamo

Ne zaračunamo časa, porabljenega za:

  • Validacijo ali pregled vašega nabora podatkov pred začetkom učenja.

  • Varnostna preverjanja vašega nabora podatkov.

  • Čakanje v vrsti na računske vire.

  • Prenos uteži modela ali naborov podatkov.

  • Pripravo (upodabljanje) vašega nabora podatkov v naš učni format.

  • Varnostna vrednotenja vašega prilagojenega modela po učenju.

Če se učno delo izgubi zaradi napake na naši strani (na primer, če se delavec sesuje in se mora vrniti na prejšnjo kontrolno točko), vam izgubljeni čas računanja ali žetoni ocenjevalnika niso zaračunani. Več podrobnosti o tem v naslednjem razdelku.

Zajeti napredek naprej in obračunski dogodki

Učenje sestavlja veliko majhnih posodobitev vašega modela. Spremljamo, koliko teh posodobitev se uspešno dokonča. Stroški temeljijo na času računanja in žetonih ocenjevalnika, povezanih s temi uspešnimi posodobitvami.

Strošek obračunamo, ko nastopi eden od naslednjih »obračunskih dogodkov«:

  • Učenje se uspešno zaključi.

  • Učenje začasno zaustavite.

  • Učenje prekličete.

  • Učenje spodleti.

Vsak obračun pokriva dodatno delo, opravljeno od zadnjega obračuna. Na primer:

  • Če izvajanje začasno zaustavite, shranimo kontrolno točko in vam zaračunamo čas računanja ter žetone ocenjevalnika, porabljene od zadnjega obračuna.

  • Ko nadaljujete, se učenje nadaljuje iz kontrolne točke. Naslednji obračun (ob zaključku, novi začasni zaustavitvi, preklicu ali napaki) bo pokril le dodatno delo, opravljeno po nadaljevanju.

  • Če izvajanje prekličete, vam zaračunamo delo, opravljeno do preklica.

  • Če učenje spodleti in se delo od zadnjega obračuna izgubi, vam izgubljeni del ni zaračunan.

Ta pristop »zajetega napredka naprej« zagotavlja, da plačate le za delo, ki ostane v vašem modelu ali ga namerno opustite.

Ogled napredka opravila

Opravila prilagajanja z okrepljenim učenjem imajo polje usage_metrics, ki dokumentira skupno porabo opravila do trenutnega koraka. To vključuje čas, porabljen za učenje, in vse žetone, uporabljene pri vseh modelskih ocenjevalnikih v opravilu. To polje si lahko ogledate prek API-ja (GET /v1/fine_tuning/jobs/{job_id}) ali prek nadzorne plošče za fino prilagajanje.

Dejavniki, ki vplivajo na čas učenja

Ker obračun temelji na času, vaše izbire konfiguracije neposredno vplivajo na stroške. Ključni dejavniki vključujejo:

  • Težavnost problema: če je vaš nabor podatkov sestavljen iz zahtevnih problemov, bo model verjetno porabil več časa za sklepanje o vsakem problemu, kar podaljša čas za izdelavo vsakega vzorca.

  • Intenzivnost izračuna: Hiperparameter compute_multiplier nadzoruje, koliko računanja izvedete v vsakem koraku učenja. Višje vrednosti spodbujajo model, da o vsaki podatkovni točki sklepa bolj podrobno, zaradi česar se vsak korak izvaja počasneje.

  • Nastavitve validacije:

    • Večji validacijski nabor poveča čas, porabljen za vrednotenje.

    • Povečanje eval_samples (števila izhodov modela, ocenjenih za vsak validacijski primer) poveča čas validacije.

    • Pogostejše izvajanje validacije (nižji eval_interval) poveča delež časa, porabljenega za validacijo.

  • Zmogljivost ocenjevalnika:

    • Večji ali zmogljivejši modeli ocenjevalnikov potrebujejo več časa za vrnitev ocene kot manjši. Na primer, ocenjevanje z modelom sklepanja lahko traja 10-krat dlje kot ocenjevanje z modelom brez sklepanja.

    • Zapletene funkcije ocenjevanja v Pythonu se izvajajo dlje kot preproste.

Te nastavitve vam omogočajo ravnotežje med stroški, hitrostjo in kakovostjo modela. Pogosta validacija lahko na primer težave odkrije prej, vendar poveča stroške. Ocenjevanje z naprednejšim modelom lahko močno izboljša natančnost ocenjevanja, vendar bo upočasnilo vsak korak ocenjevanja in podražilo opravila.

Upravljanje stroškov

Za nadzor porabe:

  • Začnite s krajšimi izvajanji, da razumete, kako vaša konfiguracija vpliva na čas.

  • Uporabite razumno število validacijskih primerov in eval_samples. Izogibajte se pogostejši validaciji, kot jo potrebujete.

  • Izberite najmanjši model ocenjevalnika, ki še izpolnjuje vaše zahteve glede kakovosti.

  • Poskrbite, da bodo prilagojeni ocenjevalniki v Pythonu učinkoviti.

  • Prilagodite compute_multiplier, da uravnotežite hitrost konvergence in stroške.

  • Spremljajte izvajanje na nadzorni plošči ali prek API-ja. Kadar koli ga lahko začasno zaustavite ali prekličete.

Primeri

Uspešen zagon učenja

Čas učenjaZaračunani časStanjeOpis
00:0000:00Uporabnik prek API-ja ustvari opravilo RFT
00:1000:00VALIDATING_FILES10 minut, porabljenih za preverjanje nabora podatkov
00:3000:00VALIDATING_FILES20 minut izvajanja varnostnih preverjanj nabora podatkov
01:0000:00QUEUED30 minut čakanja na razpoložljivega delavca
01:3000:00RUNNING30 minut priprave učenja (prenos uteži, predobdelava itd.)
05:3004:00RUNNING4 ure učenja
06:0004:00RUNNING30 minut izvajanja varnostnih ocen nastalega modela
06:0004:00SUCCEEDEDUčenje se zaključi

V tem primeru je skupni dejanski čas 6 ur, zaračunljive pa so le 4 ure. Strošek bi bil 4 ure × $100/uro = $400.

Primer neuspelega opravila

V tem primeru učenje v zagonu poteka 2 uri, nato se zapiše kontrolna točka, učenje poteka še 1 uro, potem pa zagon ne uspe. Zaračunljivi sta samo 2 uri učenja do kontrolne točke.

Čas učenjaZaračunani časStanjeOpis
00:0000:00Uporabnik prek API-ja ustvari opravilo RFT
00:1000:00VALIDATING_FILES10 minut, porabljenih za preverjanje nabora podatkov
00:3000:00VALIDATING_FILES20 minut izvajanja varnostnih preverjanj nabora podatkov
01:0000:00QUEUED30 minut čakanja na razpoložljivega delavca
01:3000:00RUNNING30 minut priprave učenja (prenos uteži, predobdelava itd.)
03:3002:00RUNNING2 uri učenja
03:3002:00RUNNINGKontrolna točka ustvarjena pri koraku 5
04:3002:00RUNNINGUčenje ne uspe zaradi notranje napake pri koraku 8 (po še 1 uri)
04:3002:00RUNNING30 minut ocenjevanja in preverjanja kontrolne točke
04:3002:00SUCCEEDEDOpravilo se zaključi (z najnovejšo kontrolno točko)

Čeprav so bile za učenje skupaj porabljene 3 ure, sta v uporabni kontrolni točki »zajeti« in zaračunani le 2 uri. Za uro učnega dela, izgubljeno zaradi napake, niste odgovorni. Strošek bi bil 2 uri × $100/uro = $200.

Pogosta vprašanja

Kdaj mi zaračunate?

Račun izdamo, ko se vaš zagon dokonča, začasno ustavi, prekliče ali ne uspe. Vsak račun zajema delo, opravljeno od prejšnjega računa.

Ali plačam, če zagon ne uspe?

Če zagon ne uspe zaradi naše napake in je izgubljeno nedavno opravljeno učno delo, vam izgubljenega dela ne zaračunamo. Če zagon prekličete, vam zaračunamo delo do preklica.

Kako se zaračunavajo žetoni modelskih ocenjevalnikov?

Štejemo žetone, ki jih porabijo vsi modelski ocenjevalniki, ki jih nastavite. Po končanem učenju te žetone zaračunamo po naših standardnih cenah na žeton.

Ali lahko zagon začasno ustavim in nadaljujem?

Da. Ko zagon začasno ustavite, shranimo kontrolno točko in zaračunamo do takrat opravljeno delo. Ko ga nadaljujete, vam zaračunamo le dodatno delo, opravljeno po nadaljevanju.

Če imate druga vprašanja o zaračunavanju prilagajanja z okrepljenim učenjem, se obrnite na našo ekipo za podporo.

Ali vam je bil ta članek v pomoč?