OpenAI
See leht on masintõlgitud. Vaadake algset ingliskeelset artiklit.

Reinforcement Fine-Tuningu API arveldusjuhend

Kuidas RFT API arveldamine töötab

Värskendatud: 15 days ago

Kuidas RFT-i arveldus toimib

Kinnistav peenhäälestus (RFT) võimaldab teil optimeerida OpenAI arutlusmudelite jõudlust kinnistava õppimise abil. Erinevalt meie juhendatud või eelistustel põhineva peenhäälestuse teenustest, mille puhul arveldatakse treeningandmestikus olevate tokenite arvu järgi, arveldatakse RFT-i eest selle aja alusel, mille teie treeningprotsess kulutab põhilisele masinõppetööle.

See juhend selgitab, mida loetakse arveldatavaks treeningajaks, kuidas käsitleme pause ja tühistamisi ning kuidas teie konfiguratsioonivalikud võivad kulusid mõjutada.

Hinnakujundus

  • Arvutusressurss: $100 põhitreeningutsüklis kulunud tegeliku tunni eest mudelil o4-mini-2025-04-16. Tasu arvutatakse proportsionaalselt sekundi täpsusega ja ümardatakse arvel kahe kümnendkohani (nt 2,55 tundi).

  • Mudelhindaja kasutus: kui kasutate treenimise ajal väljundite "hindamiseks" OpenAI mudelit, esitatakse nende hindamispäringute kasutatud tokenite eest pärast treenimise lõppu eraldi arve meie tavapäraste API hindade alusel.

Võtame tasu ainult treenimistöö eest, mis teie mudelit tegelikult uuendab (nimetame seda "fikseeritud edasiminekuks").

Mille eest arve esitame

Esitame arve aja eest, mil teie treeningutöötleja treenib aktiivselt teie mudelit, täpsemalt:

  • Näidiste genereerimine teie mudelist peenhäälestuse käigus (nn „rollout’id“)

  • Nende väljundite hindamine ühe või mitme hindajaga, mille olete töö jaoks määratlenud (lisateave hindajate kohta)

  • Hinnete põhjal kaaluvärskenduste arvutamine ja rakendamine (tagasilevi).

  • Kõigi teie konfigureeritud valideerimis- ehk hindamisetappide käitamine.

Enamikku hindajaid saab käitada „tasuta“, mis tähendab, et me ei võta nende kasutamise eest lisatasu peale aja, mille nad lisavad põhitreeningutsüklile. Erandiks on mudeli hindajad, mille puhul arvestame ka tokeneid, mida need hindajad ülaltoodud tegevuste ajal kasutavad. Need tokenid kuvatakse teie arvel eraldi reana. Mudeli hindajate kasutatud tokenite eest esitatakse arve tavaliste inferentsihindade järgi (OpenAI hinnakiri).

Mille eest me EI arvelda

Me ei võta tasu aja eest, mis kulub järgmisele:

  • Teie andmestiku valideerimine või kontrollimine enne treeningu algust.

  • Teie andmestiku turvakontrollid.

  • Arvutusressursside järjekorras ootamine.

  • Mudeli kaalude või andmestike allalaadimine.

  • Teie andmestiku ettevalmistamine (renderdamine) meie treeningvormingusse.

  • Teie peenhäälestatud mudeli treeningujärgsed turvahindamised.

Kui treeningutöö läheb kaotsi meiepoolse vea tõttu (näiteks kui töötegija jookseb kokku ja peab naasma eelmise kontrollpunkti juurde), ei võeta teilt tasu kaotatud arvutusaja ega hindajate tokenite eest. Selle kohta on järgmises jaotises rohkem üksikasju.

Salvestatud edenemine ja arveldussündmused

Treenimine koosneb paljudest väikestest mudeli uuendustest. Jälgime, kui paljud neist uuendustest edukalt lõpule viiakse. Tasud põhinevad nende edukate uuendustega seotud arvutusajal ja hindajate tokenitel.

Esitame tasu, kui toimub üks järgmistest „arveldussündmustest“:

  • Treenimine lõpeb edukalt.

  • Te peatate treenimise.

  • Te tühistate treenimise.

  • Treenimine ebaõnnestub.

Iga tasu katab pärast viimast tasu tehtud lisatöö. Näiteks:

  • Kui peatate käivituse, salvestame kontrollpunkti ja võtame tasu viimase tasu järel kasutatud arvutusaja ning hindajate tokenite eest.

  • Kui jätkate, jätkub treenimine kontrollpunktist. Järgmine tasu (lõpetamisel, järgmisel peatamisel, tühistamisel või ebaõnnestumisel) katab ainult pärast jätkamist tehtud lisatöö.

  • Kui tühistate käivituse, võtame tasu kuni tühistamiseni tehtud töö eest.

  • Kui treenimine ebaõnnestub ja viimase tasu järel tehtud töö läheb kaotsi, ei esitata kaotatud osa eest arvet.

See „salvestatud edenemise“ lähenemine tagab, et maksate ainult töö eest, mis säilib teie mudelis või millest te teadlikult loobute.

Töö edenemise jälgimine

RFT-töödel on väli usage_metrics, mis kajastab töö kogukasutust kuni praeguse etapini. See hõlmab treenimisele kulunud aega ja kõiki töö mudelhindajate kasutatud tokeneid. Seda välja saab vaadata API kaudu (GET /v1/fine_tuning/jobs/{job_id}) või peenhäälestuse juhtpaneelil.

Treenimisaega mõjutavad tegurid

Kuna arveldamine põhineb ajal, mõjutavad konfiguratsioonivalikud otseselt kulu. Peamised tegurid on järgmised.

  • Probleemi keerukus: kui teie andmestik koosneb keerukatest probleemidest, kulutab mudel tõenäoliselt iga probleemi üle arutlemisele rohkem aega, mistõttu võtab iga näidise loomine kauem aega.

  • Arvutusmahukus: hüperparameeter compute_multiplier määrab, kui palju arvutusi igal treenimisetapil tehakse. Suuremad väärtused suunavad mudelit iga andmepunkti üle põhjalikumalt arutlema, mistõttu kestab iga etapp kauem.

  • Valideerimisseaded:

  • Hindaja jõudlus:

  • Suurematel või võimekamatel mudelhindajatel kulub hinde tagastamiseks rohkem aega kui väiksematel. Näiteks võib arutlusmudeliga hindamine võtta kümme korda kauem kui muu mudeliga hindamine.

  • Keerukate Pythoni hindamisfunktsioonide käitamine võtab kauem aega kui lihtsate funktsioonide puhul.

Nende seadete abil saate tasakaalustada kulu, kiirust ja mudeli kvaliteeti. Näiteks aitab sage valideerimine probleeme varem avastada, kuid suurendab kulu. Täiustatud mudeliga hindamine võib hindamistäpsust märkimisväärselt parandada, kuid aeglustab iga hindamisetappi ja muudab tööd kallimaks.

Kulude haldamine

Kulude kontrollimiseks tehke järgmist.

  • Alustage lühematest käitustest, et mõista, kuidas teie konfiguratsioon ajakulu mõjutab.

  • Kasutage mõistlikku arvu valideerimisnäiteid ja parameetri eval_samples väärtust. Ärge valideerige sagedamini kui vaja.

  • Valige väikseim hindamismudel, mis vastab teie kvaliteedinõuetele.

  • Hoidke kohandatud Pythoni hindajad tõhusana.

  • Kohandage parameetrit compute_multiplier, et tasakaalustada koondumiskiirust ja kulu.

  • Jälgige käitust juhtpaneelil või API kaudu. Saate käituse igal ajal peatada või tühistada.

Näited

Edukas treeningukäitus

TreeninguaegArveldatav aegOlekKirjeldus
00:0000:00Kasutaja loob API kaudu RFT töö
00:1000:00VALIDATING_FILES10 minutit kulub andmestiku valideerimisele
00:3000:00VALIDATING_FILES20 minutit andmestiku ohutuskontrolle
01:0000:00QUEUED30 minutit saadaoleva töötleja ootamist
01:3000:00RUNNING30 minutit treeningu seadistamist (kaalude allalaadimine, eeltöötlus jne)
05:3004:00RUNNING4 tundi treeningule
06:0004:00RUNNING30 minutit saadud mudeli ohutuse hindamist
06:0004:00SUCCEEDEDTreening lõpeb

Sel juhul on kogu tegelik aeg 6 tundi, kuid arveldatav on ainult 4 tundi. Kulu oleks 4 tundi × $100/tund = $400.

Nurjunud töö näide

Selles näites treenib käitus 2 tundi, kirjutab kontrollpunkti, treenib veel 1 tunni, kuid seejärel nurjub. Arveldatavad on ainult 2 tundi treeningut kuni kontrollpunktini.

TreeninguaegArveldatav aegOlekKirjeldus
00:0000:00Kasutaja loob API kaudu RFT töö
00:1000:00VALIDATING_FILES10 minutit kulub andmestiku valideerimisele
00:3000:00VALIDATING_FILES20 minutit andmestiku ohutuskontrolle
01:0000:00QUEUED30 minutit saadaoleva töötleja ootamist
01:3000:00RUNNING30 minutit treeningu seadistamist (kaalude allalaadimine, eeltöötlus jne)
03:3002:00RUNNING2 tundi treeningule
03:3002:00RUNNINGKontrollpunkt loodi etapis 5
04:3002:00RUNNINGTreening nurjub sisemise vea tõttu etapis 8 (pärast veel 1 tundi)
04:3002:00RUNNING30 minutit kontrollpunkti hindamist ja valideerimist
04:3002:00SUCCEEDEDTöö lõpeb (uusima kontrollpunktiga)

Kuigi treeningule kulus kokku 3 tundi, on kasutatavas kontrollpunktis „hõlmatud“ ja arveldatavad ainult 2 tundi. Te ei vastuta tõrke tõttu kaotsi läinud treeningutunni eest. Kulu oleks 2 tundi × $100/tund = $200.

Korduma kippuvad küsimused

Millal minult tasu võetakse?

Esitame arve, kui teie käitus lõpeb, peatatakse, tühistatakse või nurjub. Iga arve hõlmab pärast eelmist arvet tehtud tööd.

Kas maksan, kui käitus nurjub?

Kui käitus nurjub meie vea tõttu ja hiljutine treeningutöö läheb kaotsi, ei võeta teilt kaotsi läinud osa eest tasu. Kui tühistate käituse, võetakse teilt tasu kuni tühistamiseni tehtud töö eest.

Kuidas arveldatakse hindajamudeli tokeneid?

Loendame tokenid, mida kasutavad teie konfigureeritud mudeli hindajad. Pärast treeningu lõppu esitame nende tokenite eest arve meie standardsete tokenipõhiste hindade alusel.

Kas saan käituse peatada ja jätkata?

Jah. Peatamisel salvestame kontrollpunkti ja võtame tasu seni tehtud töö eest. Jätkamisel võetakse teilt tasu ainult pärast jätkamist tehtud lisatöö eest.

Kui teil on kinnistava peenhäälestuse arvelduse kohta muid küsimusi, võtke ühendust meie tugitiimiga.

Kas sellest artiklist oli abi?