Kuidas RFT-i arveldus toimib
Kinnistav peenhäälestus (RFT) võimaldab teil optimeerida OpenAI arutlusmudelite jõudlust kinnistava õppimise abil. Erinevalt meie juhendatud või eelistustel põhineva peenhäälestuse teenustest, mille puhul arveldatakse treeningandmestikus olevate tokenite arvu järgi, arveldatakse RFT-i eest selle aja alusel, mille teie treeningprotsess kulutab põhilisele masinõppetööle.
See juhend selgitab, mida loetakse arveldatavaks treeningajaks, kuidas käsitleme pause ja tühistamisi ning kuidas teie konfiguratsioonivalikud võivad kulusid mõjutada.
Hinnakujundus
Arvutusressurss: $100 põhitreeningutsüklis kulunud tegeliku tunni eest mudelil o4-mini-2025-04-16. Tasu arvutatakse proportsionaalselt sekundi täpsusega ja ümardatakse arvel kahe kümnendkohani (nt 2,55 tundi).
Mudelhindaja kasutus: kui kasutate treenimise ajal väljundite "hindamiseks" OpenAI mudelit, esitatakse nende hindamispäringute kasutatud tokenite eest pärast treenimise lõppu eraldi arve meie tavapäraste API hindade alusel.
Võtame tasu ainult treenimistöö eest, mis teie mudelit tegelikult uuendab (nimetame seda "fikseeritud edasiminekuks").
Mille eest arve esitame
Esitame arve aja eest, mil teie treeningutöötleja treenib aktiivselt teie mudelit, täpsemalt:
Näidiste genereerimine teie mudelist peenhäälestuse käigus (nn „rollout’id“)
Nende väljundite hindamine ühe või mitme hindajaga, mille olete töö jaoks määratlenud (lisateave hindajate kohta)
Hinnete põhjal kaaluvärskenduste arvutamine ja rakendamine (tagasilevi).
Kõigi teie konfigureeritud valideerimis- ehk hindamisetappide käitamine.
Enamikku hindajaid saab käitada „tasuta“, mis tähendab, et me ei võta nende kasutamise eest lisatasu peale aja, mille nad lisavad põhitreeningutsüklile. Erandiks on mudeli hindajad, mille puhul arvestame ka tokeneid, mida need hindajad ülaltoodud tegevuste ajal kasutavad. Need tokenid kuvatakse teie arvel eraldi reana. Mudeli hindajate kasutatud tokenite eest esitatakse arve tavaliste inferentsihindade järgi (OpenAI hinnakiri).
Mille eest me EI arvelda
Me ei võta tasu aja eest, mis kulub järgmisele:
Teie andmestiku valideerimine või kontrollimine enne treeningu algust.
Teie andmestiku turvakontrollid.
Arvutusressursside järjekorras ootamine.
Mudeli kaalude või andmestike allalaadimine.
Teie andmestiku ettevalmistamine (renderdamine) meie treeningvormingusse.
Teie peenhäälestatud mudeli treeningujärgsed turvahindamised.
Kui treeningutöö läheb kaotsi meiepoolse vea tõttu (näiteks kui töötegija jookseb kokku ja peab naasma eelmise kontrollpunkti juurde), ei võeta teilt tasu kaotatud arvutusaja ega hindajate tokenite eest. Selle kohta on järgmises jaotises rohkem üksikasju.
Salvestatud edenemine ja arveldussündmused
Treenimine koosneb paljudest väikestest mudeli uuendustest. Jälgime, kui paljud neist uuendustest edukalt lõpule viiakse. Tasud põhinevad nende edukate uuendustega seotud arvutusajal ja hindajate tokenitel.
Esitame tasu, kui toimub üks järgmistest „arveldussündmustest“:
Treenimine lõpeb edukalt.
Te peatate treenimise.
Te tühistate treenimise.
Treenimine ebaõnnestub.
Iga tasu katab pärast viimast tasu tehtud lisatöö. Näiteks:
Kui peatate käivituse, salvestame kontrollpunkti ja võtame tasu viimase tasu järel kasutatud arvutusaja ning hindajate tokenite eest.
Kui jätkate, jätkub treenimine kontrollpunktist. Järgmine tasu (lõpetamisel, järgmisel peatamisel, tühistamisel või ebaõnnestumisel) katab ainult pärast jätkamist tehtud lisatöö.
Kui tühistate käivituse, võtame tasu kuni tühistamiseni tehtud töö eest.
Kui treenimine ebaõnnestub ja viimase tasu järel tehtud töö läheb kaotsi, ei esitata kaotatud osa eest arvet.
See „salvestatud edenemise“ lähenemine tagab, et maksate ainult töö eest, mis säilib teie mudelis või millest te teadlikult loobute.
Töö edenemise jälgimine
RFT-töödel on väli usage_metrics, mis kajastab töö kogukasutust kuni praeguse etapini. See hõlmab treenimisele kulunud aega ja kõiki töö mudelhindajate kasutatud tokeneid. Seda välja saab vaadata API kaudu (GET /v1/fine_tuning/jobs/{job_id}) või peenhäälestuse juhtpaneelil.
Treenimisaega mõjutavad tegurid
Kuna arveldamine põhineb ajal, mõjutavad konfiguratsioonivalikud otseselt kulu. Peamised tegurid on järgmised.
Probleemi keerukus: kui teie andmestik koosneb keerukatest probleemidest, kulutab mudel tõenäoliselt iga probleemi üle arutlemisele rohkem aega, mistõttu võtab iga näidise loomine kauem aega.
Arvutusmahukus: hüperparameeter compute_multiplier määrab, kui palju arvutusi igal treenimisetapil tehakse. Suuremad väärtused suunavad mudelit iga andmepunkti üle põhjalikumalt arutlema, mistõttu kestab iga etapp kauem.
Valideerimisseaded:
Hindaja jõudlus:
Suurematel või võimekamatel mudelhindajatel kulub hinde tagastamiseks rohkem aega kui väiksematel. Näiteks võib arutlusmudeliga hindamine võtta kümme korda kauem kui muu mudeliga hindamine.
Keerukate Pythoni hindamisfunktsioonide käitamine võtab kauem aega kui lihtsate funktsioonide puhul.
Nende seadete abil saate tasakaalustada kulu, kiirust ja mudeli kvaliteeti. Näiteks aitab sage valideerimine probleeme varem avastada, kuid suurendab kulu. Täiustatud mudeliga hindamine võib hindamistäpsust märkimisväärselt parandada, kuid aeglustab iga hindamisetappi ja muudab tööd kallimaks.
Kulude haldamine
Kulude kontrollimiseks tehke järgmist.
Alustage lühematest käitustest, et mõista, kuidas teie konfiguratsioon ajakulu mõjutab.
Kasutage mõistlikku arvu valideerimisnäiteid ja parameetri eval_samples väärtust. Ärge valideerige sagedamini kui vaja.
Valige väikseim hindamismudel, mis vastab teie kvaliteedinõuetele.
Hoidke kohandatud Pythoni hindajad tõhusana.
Kohandage parameetrit compute_multiplier, et tasakaalustada koondumiskiirust ja kulu.
Jälgige käitust juhtpaneelil või API kaudu. Saate käituse igal ajal peatada või tühistada.
Näited
Edukas treeningukäitus
| Treeninguaeg | Arveldatav aeg | Olek | Kirjeldus |
|---|---|---|---|
| 00:00 | 00:00 | – | Kasutaja loob API kaudu RFT töö |
| 00:10 | 00:00 | VALIDATING_FILES | 10 minutit kulub andmestiku valideerimisele |
| 00:30 | 00:00 | VALIDATING_FILES | 20 minutit andmestiku ohutuskontrolle |
| 01:00 | 00:00 | QUEUED | 30 minutit saadaoleva töötleja ootamist |
| 01:30 | 00:00 | RUNNING | 30 minutit treeningu seadistamist (kaalude allalaadimine, eeltöötlus jne) |
| 05:30 | 04:00 | RUNNING | 4 tundi treeningule |
| 06:00 | 04:00 | RUNNING | 30 minutit saadud mudeli ohutuse hindamist |
| 06:00 | 04:00 | SUCCEEDED | Treening lõpeb |
Sel juhul on kogu tegelik aeg 6 tundi, kuid arveldatav on ainult 4 tundi. Kulu oleks 4 tundi × $100/tund = $400.
Nurjunud töö näide
Selles näites treenib käitus 2 tundi, kirjutab kontrollpunkti, treenib veel 1 tunni, kuid seejärel nurjub. Arveldatavad on ainult 2 tundi treeningut kuni kontrollpunktini.
| Treeninguaeg | Arveldatav aeg | Olek | Kirjeldus |
|---|---|---|---|
| 00:00 | 00:00 | – | Kasutaja loob API kaudu RFT töö |
| 00:10 | 00:00 | VALIDATING_FILES | 10 minutit kulub andmestiku valideerimisele |
| 00:30 | 00:00 | VALIDATING_FILES | 20 minutit andmestiku ohutuskontrolle |
| 01:00 | 00:00 | QUEUED | 30 minutit saadaoleva töötleja ootamist |
| 01:30 | 00:00 | RUNNING | 30 minutit treeningu seadistamist (kaalude allalaadimine, eeltöötlus jne) |
| 03:30 | 02:00 | RUNNING | 2 tundi treeningule |
| 03:30 | 02:00 | RUNNING | Kontrollpunkt loodi etapis 5 |
| 04:30 | 02:00 | RUNNING | Treening nurjub sisemise vea tõttu etapis 8 (pärast veel 1 tundi) |
| 04:30 | 02:00 | RUNNING | 30 minutit kontrollpunkti hindamist ja valideerimist |
| 04:30 | 02:00 | SUCCEEDED | Töö lõpeb (uusima kontrollpunktiga) |
Kuigi treeningule kulus kokku 3 tundi, on kasutatavas kontrollpunktis „hõlmatud“ ja arveldatavad ainult 2 tundi. Te ei vastuta tõrke tõttu kaotsi läinud treeningutunni eest. Kulu oleks 2 tundi × $100/tund = $200.
Korduma kippuvad küsimused
Millal minult tasu võetakse?
Esitame arve, kui teie käitus lõpeb, peatatakse, tühistatakse või nurjub. Iga arve hõlmab pärast eelmist arvet tehtud tööd.
Kas maksan, kui käitus nurjub?
Kui käitus nurjub meie vea tõttu ja hiljutine treeningutöö läheb kaotsi, ei võeta teilt kaotsi läinud osa eest tasu. Kui tühistate käituse, võetakse teilt tasu kuni tühistamiseni tehtud töö eest.
Kuidas arveldatakse hindajamudeli tokeneid?
Loendame tokenid, mida kasutavad teie konfigureeritud mudeli hindajad. Pärast treeningu lõppu esitame nende tokenite eest arve meie standardsete tokenipõhiste hindade alusel.
Kas saan käituse peatada ja jätkata?
Jah. Peatamisel salvestame kontrollpunkti ja võtame tasu seni tehtud töö eest. Jätkamisel võetakse teilt tasu ainult pärast jätkamist tehtud lisatöö eest.
Kui teil on kinnistava peenhäälestuse arvelduse kohta muid küsimusi, võtke ühendust meie tugitiimiga.
