Kako funkcioniše naplata za precizno podešavanje potkrepljivanjem
Precizno podešavanje potkrepljivanjem (RFT) omogućava vam da optimizirate performanse OpenAI modela rezonovanja pomoću učenja s potkrepljivanjem. Za razliku od naših ponuda nadziranog preciznog podešavanja ili preciznog podešavanja prema preferencijama, koje se naplaćuju prema broju tokena u skupu podataka za obuku, precizno podešavanje potkrepljivanjem naplaćuje se na osnovu vremena koje vaš proces obuke provede obavljajući osnovni rad mašinskog učenja.
Ovaj vodič objašnjava šta se računa kao naplativo vrijeme treniranja, kako postupamo s pauzama i otkazivanjima te kako vaši izbori konfiguracije mogu utjecati na trošak.
Cijene
Računanje: $100 po satu stvarno proteklog vremena provedenog u osnovnoj petlji treniranja za
o4-mini-2025-04-16. Troškovi se obračunavaju proporcionalno po sekundi i zaokružuju na dvije decimale na računu (npr. 2.55 sati).Upotreba ocjenjivačkog modela: Ako koristite OpenAI model za "ocjenjivanje" izlaza tokom treniranja, tokeni potrošeni tim pozivima za ocjenjivanje naplaćuju se zasebno po našim standardnim API stopama nakon završetka treniranja.
Naplatu vršimo samo za rad na treniranju koji zaista ažurira vaš model (ono što nazivamo "zabilježeni napredak unaprijed").
Šta naplaćujemo
Naplaćujemo vrijeme koje vaš radnik za obuku provede aktivno obučavajući vaš model, konkretno:
Generisanje uzoraka iz vašeg modela tokom procesa preciznog podešavanja (poznato kao „rollouts“)
Evaluiranje tih izlaza pomoću jednog ili više ocjenjivača koje ste definisali za posao (saznajte više o ocjenjivačima)
Izračunavanje i primjena ažuriranja težina na osnovu ocjena (povratna propagacija).
Pokretanje svih koraka validacije (evaluacije) koje ste konfigurisali.
Većina ocjenjivača je „besplatna“ za pokretanje, što znači da ne naplaćujemo dodatno za njihovu upotrebu izvan vremena koje doprinose osnovnoj petlji obuke. Izuzetak su modelski ocjenjivači, gdje također zbrajamo tokene koje ti ocjenjivači potroše tokom gore navedenih aktivnosti. Ti tokeni se na vašoj fakturi prikazuju kao posebna stavka. Tokeni koje potroše modelski ocjenjivači naplaćuju se po uobičajenim cijenama zaključivanja (OpenAI cijene).
Šta NE naplaćujemo
Ne naplaćujemo vrijeme provedeno na:
Validaciji ili pregledu vašeg skupa podataka prije početka treniranja.
Sigurnosnim provjerama vašeg skupa podataka.
Čekanju u redu za resurse računanja.
Preuzimanju težina modela ili skupova podataka.
Pripremi (renderovanju) vašeg skupa podataka u naš format za treniranje.
Sigurnosnim evaluacijama vašeg fino podešenog modela nakon treniranja.
Ako se rad na treniranju izgubi zbog greške s naše strane (naprimjer, ako se radnik sruši i mora se vratiti na prethodnu kontrolnu tačku), ne naplaćuju vam se izgubljeno vrijeme računanja ni tokeni ocjenjivača. Više detalja o tome nalazi se u sljedećem odjeljku.
Zabilježeni napredak unaprijed i događaji naplate
Treniranje se sastoji od mnogo malih ažuriranja vašeg modela. Pratimo koliko se tih ažuriranja uspješno završi. Naknade se zasnivaju na vremenu računanja i tokenima ocjenjivača povezanim s tim uspješnim ažuriranjima.
Izdajemo naplatu kada se dogodi jedan od sljedećih „događaja naplate”:
Treniranje se uspješno završi.
Pauzirate treniranje.
Otkažete treniranje.
Treniranje ne uspije.
Svaka naplata pokriva dodatni rad obavljen od posljednje naplate. Naprimjer:
Ako pauzirate pokretanje, spremamo kontrolnu tačku i naplaćujemo vam vrijeme računanja i tokene ocjenjivača korištene od posljednje naplate.
Kada nastavite, treniranje se nastavlja od kontrolne tačke. Sljedeća naplata (po završetku, novoj pauzi, otkazivanju ili neuspjehu) pokrivat će samo dodatni rad obavljen nakon nastavka.
Ako otkažete pokretanje, naplaćujemo vam rad obavljen do trenutka otkazivanja.
Ako treniranje ne uspije i rad od posljednje naplate bude izgubljen, taj izgubljeni dio vam se ne naplaćuje.
Ovaj pristup „zabilježenog napretka unaprijed” osigurava da plaćate samo za rad koji je zadržan u vašem modelu ili koji namjerno napustite.
Pregled napretka posla
Poslovi preciznog podešavanja potkrepljivanjem imaju polje usage_metrics koje dokumentuje ukupnu upotrebu posla do trenutnog koraka. To uključuje vrijeme provedeno u obuci i sve tokene korištene kod svih modelskih ocjenjivača u poslu. Ovo polje se može pregledati putem API-ja (GET /v1/fine_tuning/jobs/{job_id}) ili putem kontrolne table za precizno podešavanje.
Faktori koji utječu na vrijeme treniranja
Budući da se naplata zasniva na vremenu, vaši izbori konfiguracije direktno utječu na trošak. Ključni faktori uključuju:
Težina problema: ako se vaš skup podataka sastoji od teških problema, model će vjerovatno provoditi više vremena u rezonovanju o svakom problemu, što povećava vrijeme potrebno za izradu svakog uzorka.
Intenzitet računanja: Hiperparametar
compute_multiplierkontroliše koliko računanja obavljate po koraku treniranja. Više vrijednosti podstiču model da opširnije rezonuje o svakoj podatkovnoj tački, što uzrokuje sporije izvođenje svakog koraka.Postavke validacije:
Veći skup za validaciju povećava vrijeme provedeno u evaluaciji.
Povećanje
eval_samples(broja izlaza modela ocijenjenih po primjeru validacije) povećava vrijeme validacije.Češće pokretanje validacije (niži
eval_interval) povećava udio vremena provedenog na validaciji.
Performanse ocjenjivača:
Većim ili sposobnijim ocjenjivačkim modelima treba više vremena da vrate ocjenu nego manjim. Naprimjer, ocjenjivanje modelom rezonovanja može trajati 10x duže nego ocjenjivanje modelom bez rezonovanja.
Složene Python funkcije za ocjenjivanje rade sporije od jednostavnih.
Ove postavke vam omogućavaju da pravite kompromise između troška, brzine i kvaliteta modela. Naprimjer, česta validacija može ranije otkriti probleme, ali povećava trošak. Ocjenjivanje naprednijim modelom može drastično poboljšati tačnost ocjenjivanja, ali će usporiti svaki korak ocjenjivanja i učiniti zadatke skupljim.
Upravljanje troškovima
Da biste kontrolisali potrošnju:
Počnite s kraćim pokretanjima kako biste razumjeli kako vaša konfiguracija utječe na vrijeme.
Koristite razuman broj primjera za validaciju i
eval_samples. Izbjegavajte validaciju češće nego što vam je potrebno.Odaberite najmanji model ocjenjivača koji ispunjava vaše zahtjeve kvaliteta.
Prilagođene Python ocjenjivače održavajte efikasnim.
Podesite
compute_multiplierkako biste uravnotežili brzinu konvergencije i trošak.Pratite svoje pokretanje na kontrolnoj ploči ili putem API-ja. Možete pauzirati ili otkazati u bilo kojem trenutku.
Primjeri
Uspješno pokretanje obuke
| Vrijeme obuke | Naplaćeno vrijeme | Status | Opis |
|---|---|---|---|
| 00:00 | 00:00 | – | Korisnik kreira posao preciznog podešavanja potkrepljivanjem putem API-ja |
| 00:10 | 00:00 | VALIDATING_FILES | 10 minuta provedeno u validaciji skupa podataka |
| 00:30 | 00:00 | VALIDATING_FILES | 20 minuta izvođenja sigurnosnih provjera skupa podataka |
| 01:00 | 00:00 | QUEUED | 30 minuta čekanja na dostupnog radnika |
| 01:30 | 00:00 | RUNNING | 30 minuta postavljanja obuke (preuzimanje težina, predobrada itd.) |
| 05:30 | 04:00 | RUNNING | 4 sata provedena u obuci |
| 06:00 | 04:00 | RUNNING | 30 minuta izvođenja sigurnosnih evaluacija rezultirajućeg modela |
| 06:00 | 04:00 | SUCCEEDED | Obuka se završava |
U ovom slučaju ukupno stvarno proteklo vrijeme je 6 sati, ali naplaćuju se samo 4 sata. Trošak bi bio 4 sata × $100/sat = $400.
Primjer neuspjelog posla
U ovom primjeru, pokretanje se obučava 2 sata, zapisuje kontrolnu tačku, obučava se još 1 sat, ali zatim ne uspije. Naplaćuju se samo 2 sata obuke do kontrolne tačke.
| Vrijeme obuke | Naplaćeno vrijeme | Status | Opis |
|---|---|---|---|
| 00:00 | 00:00 | – | Korisnik kreira posao preciznog podešavanja potkrepljivanjem putem API-ja |
| 00:10 | 00:00 | VALIDATING_FILES | 10 minuta provedeno u validaciji skupa podataka |
| 00:30 | 00:00 | VALIDATING_FILES | 20 minuta izvođenja sigurnosnih provjera skupa podataka |
| 01:00 | 00:00 | QUEUED | 30 minuta čekanja na dostupnog radnika |
| 01:30 | 00:00 | RUNNING | 30 minuta postavljanja obuke (preuzimanje težina, predobrada itd.) |
| 03:30 | 02:00 | RUNNING | 2 sata provedena u obuci |
| 03:30 | 02:00 | RUNNING | Kontrolna tačka kreirana u koraku 5 |
| 04:30 | 02:00 | RUNNING | Obuka ne uspijeva zbog interne greške u koraku 8 (nakon još 1 sata) |
| 04:30 | 02:00 | RUNNING | 30 minuta evaluacije i validacije kontrolne tačke |
| 04:30 | 02:00 | SUCCEEDED | Posao se završava (s najnovijom kontrolnom tačkom) |
Iako je na obuku ukupno potrošeno 3 sata, samo su 2 sata „obuhvaćena“ u upotrebljivoj kontrolnoj tački i naplaćuju se. Sat rada na obuci izgubljen zbog neuspjeha nije vaša odgovornost. Trošak bi bio 2 sata × $100/sat = $200.
Često postavljana pitanja
Kada mi se naplaćuje?
Naplatu vršimo kada se vaše pokretanje završi, pauzira, otkaže ili ne uspije. Svaki račun pokriva rad obavljen od prethodnog računa.
Plaćam li ako pokretanje ne uspije?
Ako pokretanje ne uspije zbog naše greške i izgubi se nedavni rad na obuci, ne naplaćujemo vam izgubljeni dio. Ako otkažete pokretanje, naplaćuje vam se rad obavljen do otkazivanja.
Kako se naplaćuju tokeni modela ocjenjivača?
Brojimo tokene koje koriste svi modelski ocjenjivači koje konfigurišete. Nakon završetka obuke, te tokene naplaćujemo po našim standardnim cijenama po tokenu.
Mogu li pauzirati i nastaviti pokretanje?
Da. Kada pauzirate, spremamo kontrolnu tačku i naplaćujemo rad obavljen do tada. Kada nastavite, naplatit će vam se samo dodatni rad obavljen nakon nastavka.
Ako imate druga pitanja o naplati preciznog podešavanja potkrepljivanjem, kontaktirajte naš tim za podršku.
