Kako funkcioniše naplata za precizno podešavanje potkrepljivanjem
Precizno podešavanje potkrepljivanjem (RFT) omogućava vam da optimizirate performanse OpenAI modela rezonovanja pomoću učenja s potkrepljivanjem. Za razliku od naših ponuda nadziranog preciznog podešavanja ili preciznog podešavanja prema preferencijama, koje se naplaćuju prema broju tokena u skupu podataka za obuku, precizno podešavanje potkrepljivanjem naplaćuje se na osnovu vremena koje vaš proces obuke provede obavljajući osnovni rad mašinskog učenja.
Ovaj vodič objašnjava šta se računa kao naplativo vrijeme treniranja, kako postupamo s pauzama i otkazivanjima te kako vaši izbori konfiguracije mogu utjecati na trošak.
Cijene
Računanje: 100 USD po satu stvarnog vremena provedenog u glavnoj petlji obuke za o4-mini-2025-04-16. Troškovi se obračunavaju proporcionalno do nivoa sekunde, a na računu se zaokružuju na dvije decimale (npr. 2,55 sati).
Upotreba modela za ocjenjivanje: Ako tokom obuke koristite model kompanije OpenAI za „ocjenjivanje“ izlaznih rezultata, tokeni potrošeni tim pozivima za ocjenjivanje naplaćuju se zasebno po našim standardnim cijenama API-ja nakon završetka obuke.
Naplaćujemo samo obuku kojom se vaš model zaista ažurira (što nazivamo „zabilježenim napretkom“).
Šta naplaćujemo
Naplaćujemo vrijeme koje vaš radnik za obuku provede aktivno obučavajući vaš model, konkretno:
Generisanje uzoraka iz vašeg modela tokom procesa preciznog podešavanja (poznato kao „rollouts“)
Evaluiranje tih izlaza pomoću jednog ili više ocjenjivača koje ste definisali za posao (saznajte više o ocjenjivačima)
Izračunavanje i primjena ažuriranja težina na osnovu ocjena (povratna propagacija).
Pokretanje svih koraka validacije (evaluacije) koje ste konfigurisali.
Većina ocjenjivača je „besplatna“ za pokretanje, što znači da ne naplaćujemo dodatno za njihovu upotrebu izvan vremena koje doprinose osnovnoj petlji obuke. Izuzetak su modelski ocjenjivači, gdje također zbrajamo tokene koje ti ocjenjivači potroše tokom gore navedenih aktivnosti. Ti tokeni se na vašoj fakturi prikazuju kao posebna stavka. Tokeni koje potroše modelski ocjenjivači naplaćuju se po uobičajenim cijenama zaključivanja (OpenAI cijene).
Šta NE naplaćujemo
Ne naplaćujemo vrijeme provedeno na:
Validaciji ili pregledu vašeg skupa podataka prije početka treniranja.
Sigurnosnim provjerama vašeg skupa podataka.
Čekanju u redu za resurse računanja.
Preuzimanju težina modela ili skupova podataka.
Pripremi (renderovanju) vašeg skupa podataka u naš format za treniranje.
Sigurnosnim evaluacijama vašeg fino podešenog modela nakon treniranja.
Ako se rad na treniranju izgubi zbog greške s naše strane (naprimjer, ako se radnik sruši i mora se vratiti na prethodnu kontrolnu tačku), ne naplaćuju vam se izgubljeno vrijeme računanja ni tokeni ocjenjivača. Više detalja o tome nalazi se u sljedećem odjeljku.
Zabilježeni napredak unaprijed i događaji naplate
Treniranje se sastoji od mnogo malih ažuriranja vašeg modela. Pratimo koliko se tih ažuriranja uspješno završi. Naknade se zasnivaju na vremenu računanja i tokenima ocjenjivača povezanim s tim uspješnim ažuriranjima.
Izdajemo naplatu kada se dogodi jedan od sljedećih „događaja naplate”:
Treniranje se uspješno završi.
Pauzirate treniranje.
Otkažete treniranje.
Treniranje ne uspije.
Svaka naplata pokriva dodatni rad obavljen od posljednje naplate. Naprimjer:
Ako pauzirate pokretanje, spremamo kontrolnu tačku i naplaćujemo vam vrijeme računanja i tokene ocjenjivača korištene od posljednje naplate.
Kada nastavite, treniranje se nastavlja od kontrolne tačke. Sljedeća naplata (po završetku, novoj pauzi, otkazivanju ili neuspjehu) pokrivat će samo dodatni rad obavljen nakon nastavka.
Ako otkažete pokretanje, naplaćujemo vam rad obavljen do trenutka otkazivanja.
Ako treniranje ne uspije i rad od posljednje naplate bude izgubljen, taj izgubljeni dio vam se ne naplaćuje.
Ovaj pristup „zabilježenog napretka unaprijed” osigurava da plaćate samo za rad koji je zadržan u vašem modelu ili koji namjerno napustite.
Praćenje napretka zadatka
Zadaci preciznog podešavanja potkrepljivanjem imaju polje usage_metrics, u kojem je zabilježena ukupna potrošnja zadatka do trenutnog koraka. To obuhvata vrijeme utrošeno na obuku i sve tokene koje su upotrijebili svi modeli za ocjenjivanje u zadatku. Ovo polje možete pregledati putem API-ja (GET /v1/fine_tuning/jobs/{job_id}) ili na kontrolnoj tabli za precizno podešavanje.
Faktori koji utječu na trajanje obuke
Budući da se naplata zasniva na vremenu, odabrana konfiguracija direktno utječe na troškove. Ključni faktori su:
Težina problema: ako se vaš skup podataka sastoji od teških problema, model će vjerovatno trošiti više vremena na rezonovanje o svakom problemu, zbog čega će izrada svakog uzorka trajati duže.
Intenzitet računanja: hiperparametar compute_multiplier određuje količinu računanja po koraku obuke. Veće vrijednosti podstiču model da opširnije rezonuje o svakom podatku, zbog čega se svaki korak izvršava sporije.
Postavke validacije:
Performanse ocjenjivača:
Većim ili sposobnijim modelima za ocjenjivanje treba više vremena da vrate ocjenu nego manjim modelima. Naprimjer, ocjenjivanje modelom rezonovanja može trajati 10 puta duže nego ocjenjivanje modelom koji ne koristi rezonovanje.
Složene funkcije za ocjenjivanje u Pythonu izvršavaju se duže od jednostavnih.
Ove postavke omogućavaju vam da uskladite troškove, brzinu i kvalitet modela. Naprimjer, česta validacija može ranije otkriti probleme, ali povećava troškove. Ocjenjivanje naprednijim modelom može znatno povećati preciznost ocjenjivanja, ali će usporiti svaki korak ocjenjivanja i povećati troškove zadataka.
Upravljanje troškovima
Da biste kontrolisali potrošnju:
Počnite s kraćim izvršavanjima kako biste shvatili kako vaša konfiguracija utječe na trajanje.
Koristite razuman broj primjera za validaciju i vrijednost parametra eval_samples. Nemojte provoditi validaciju češće nego što je potrebno.
Odaberite najmanji model za ocjenjivanje koji ispunjava vaše zahtjeve kvaliteta.
Prilagođeni ocjenjivači u Pythonu trebaju biti efikasni.
Prilagodite compute_multiplier kako biste uskladili brzinu konvergencije i troškove.
Pratite izvršavanje na kontrolnoj tabli ili putem API-ja. Izvršavanje možete pauzirati ili otkazati u bilo kojem trenutku.
Primjeri
Uspješno pokretanje obuke
| Vrijeme obuke | Naplaćeno vrijeme | Status | Opis |
|---|---|---|---|
| 00:00 | 00:00 | – | Korisnik kreira posao preciznog podešavanja potkrepljivanjem putem API-ja |
| 00:10 | 00:00 | VALIDATING_FILES | 10 minuta provedeno u validaciji skupa podataka |
| 00:30 | 00:00 | VALIDATING_FILES | 20 minuta izvođenja sigurnosnih provjera skupa podataka |
| 01:00 | 00:00 | QUEUED | 30 minuta čekanja na dostupnog radnika |
| 01:30 | 00:00 | RUNNING | 30 minuta postavljanja obuke (preuzimanje težina, predobrada itd.) |
| 05:30 | 04:00 | RUNNING | 4 sata provedena u obuci |
| 06:00 | 04:00 | RUNNING | 30 minuta izvođenja sigurnosnih evaluacija rezultirajućeg modela |
| 06:00 | 04:00 | SUCCEEDED | Obuka se završava |
U ovom slučaju ukupno stvarno proteklo vrijeme je 6 sati, ali naplaćuju se samo 4 sata. Trošak bi bio 4 sata × $100/sat = $400.
Primjer neuspjelog posla
U ovom primjeru, pokretanje se obučava 2 sata, zapisuje kontrolnu tačku, obučava se još 1 sat, ali zatim ne uspije. Naplaćuju se samo 2 sata obuke do kontrolne tačke.
| Vrijeme obuke | Naplaćeno vrijeme | Status | Opis |
|---|---|---|---|
| 00:00 | 00:00 | – | Korisnik kreira posao preciznog podešavanja potkrepljivanjem putem API-ja |
| 00:10 | 00:00 | VALIDATING_FILES | 10 minuta provedeno u validaciji skupa podataka |
| 00:30 | 00:00 | VALIDATING_FILES | 20 minuta izvođenja sigurnosnih provjera skupa podataka |
| 01:00 | 00:00 | QUEUED | 30 minuta čekanja na dostupnog radnika |
| 01:30 | 00:00 | RUNNING | 30 minuta postavljanja obuke (preuzimanje težina, predobrada itd.) |
| 03:30 | 02:00 | RUNNING | 2 sata provedena u obuci |
| 03:30 | 02:00 | RUNNING | Kontrolna tačka kreirana u koraku 5 |
| 04:30 | 02:00 | RUNNING | Obuka ne uspijeva zbog interne greške u koraku 8 (nakon još 1 sata) |
| 04:30 | 02:00 | RUNNING | 30 minuta evaluacije i validacije kontrolne tačke |
| 04:30 | 02:00 | SUCCEEDED | Posao se završava (s najnovijom kontrolnom tačkom) |
Iako je na obuku ukupno potrošeno 3 sata, samo su 2 sata „obuhvaćena“ u upotrebljivoj kontrolnoj tački i naplaćuju se. Sat rada na obuci izgubljen zbog neuspjeha nije vaša odgovornost. Trošak bi bio 2 sata × $100/sat = $200.
Često postavljana pitanja
Kada mi se naplaćuje?
Naplatu vršimo kada se izvršavanje završi, pauzira, otkaže ili ne uspije. Svaki obračun obuhvata rad obavljen od prethodnog obračuna.
Plaćam li ako pokretanje ne uspije?
Ako pokretanje ne uspije zbog naše greške i izgubi se nedavni rad na obuci, ne naplaćujemo vam izgubljeni dio. Ako otkažete pokretanje, naplaćuje vam se rad obavljen do otkazivanja.
Kako se naplaćuju tokeni modela ocjenjivača?
Brojimo tokene koje koriste svi modelski ocjenjivači koje konfigurišete. Nakon završetka obuke, te tokene naplaćujemo po našim standardnim cijenama po tokenu.
Mogu li pauzirati i nastaviti pokretanje?
Da. Kada pauzirate, spremamo kontrolnu tačku i naplaćujemo rad obavljen do tada. Kada nastavite, naplatit će vam se samo dodatni rad obavljen nakon nastavka.
Ako imate druga pitanja o naplati preciznog podešavanja potkrepljivanjem, kontaktirajte naš tim za podršku.
