OpenAI
Ova stranica je mašinski prevedena. Pogledaj originalni članak na engleskom jeziku.

Vodič za naplatu za API za Reinforcement Fine Tuning

Kako funkcioniše naplata za RFT API

Ažurirano: 20 days ago

Kako funkcioniše naplata za precizno podešavanje potkrepljivanjem

Precizno podešavanje potkrepljivanjem (RFT) omogućava vam da optimizirate performanse OpenAI modela rezonovanja pomoću učenja s potkrepljivanjem. Za razliku od naših ponuda nadziranog preciznog podešavanja ili preciznog podešavanja prema preferencijama, koje se naplaćuju prema broju tokena u skupu podataka za obuku, precizno podešavanje potkrepljivanjem naplaćuje se na osnovu vremena koje vaš proces obuke provede obavljajući osnovni rad mašinskog učenja.

Ovaj vodič objašnjava šta se računa kao naplativo vrijeme treniranja, kako postupamo s pauzama i otkazivanjima te kako vaši izbori konfiguracije mogu utjecati na trošak.

Cijene

  • Računanje: 100 USD po satu stvarnog vremena provedenog u glavnoj petlji obuke za o4-mini-2025-04-16. Troškovi se obračunavaju proporcionalno do nivoa sekunde, a na računu se zaokružuju na dvije decimale (npr. 2,55 sati).

  • Upotreba modela za ocjenjivanje: Ako tokom obuke koristite model kompanije OpenAI za „ocjenjivanje“ izlaznih rezultata, tokeni potrošeni tim pozivima za ocjenjivanje naplaćuju se zasebno po našim standardnim cijenama API-ja nakon završetka obuke.

Naplaćujemo samo obuku kojom se vaš model zaista ažurira (što nazivamo „zabilježenim napretkom“).

Šta naplaćujemo

Naplaćujemo vrijeme koje vaš radnik za obuku provede aktivno obučavajući vaš model, konkretno:

  • Generisanje uzoraka iz vašeg modela tokom procesa preciznog podešavanja (poznato kao „rollouts“)

  • Evaluiranje tih izlaza pomoću jednog ili više ocjenjivača koje ste definisali za posao (saznajte više o ocjenjivačima)

  • Izračunavanje i primjena ažuriranja težina na osnovu ocjena (povratna propagacija).

  • Pokretanje svih koraka validacije (evaluacije) koje ste konfigurisali.

Većina ocjenjivača je „besplatna“ za pokretanje, što znači da ne naplaćujemo dodatno za njihovu upotrebu izvan vremena koje doprinose osnovnoj petlji obuke. Izuzetak su modelski ocjenjivači, gdje također zbrajamo tokene koje ti ocjenjivači potroše tokom gore navedenih aktivnosti. Ti tokeni se na vašoj fakturi prikazuju kao posebna stavka. Tokeni koje potroše modelski ocjenjivači naplaćuju se po uobičajenim cijenama zaključivanja (OpenAI cijene).

Šta NE naplaćujemo

Ne naplaćujemo vrijeme provedeno na:

  • Validaciji ili pregledu vašeg skupa podataka prije početka treniranja.

  • Sigurnosnim provjerama vašeg skupa podataka.

  • Čekanju u redu za resurse računanja.

  • Preuzimanju težina modela ili skupova podataka.

  • Pripremi (renderovanju) vašeg skupa podataka u naš format za treniranje.

  • Sigurnosnim evaluacijama vašeg fino podešenog modela nakon treniranja.

Ako se rad na treniranju izgubi zbog greške s naše strane (naprimjer, ako se radnik sruši i mora se vratiti na prethodnu kontrolnu tačku), ne naplaćuju vam se izgubljeno vrijeme računanja ni tokeni ocjenjivača. Više detalja o tome nalazi se u sljedećem odjeljku.

Zabilježeni napredak unaprijed i događaji naplate

Treniranje se sastoji od mnogo malih ažuriranja vašeg modela. Pratimo koliko se tih ažuriranja uspješno završi. Naknade se zasnivaju na vremenu računanja i tokenima ocjenjivača povezanim s tim uspješnim ažuriranjima.

Izdajemo naplatu kada se dogodi jedan od sljedećih „događaja naplate”:

  • Treniranje se uspješno završi.

  • Pauzirate treniranje.

  • Otkažete treniranje.

  • Treniranje ne uspije.

Svaka naplata pokriva dodatni rad obavljen od posljednje naplate. Naprimjer:

  • Ako pauzirate pokretanje, spremamo kontrolnu tačku i naplaćujemo vam vrijeme računanja i tokene ocjenjivača korištene od posljednje naplate.

  • Kada nastavite, treniranje se nastavlja od kontrolne tačke. Sljedeća naplata (po završetku, novoj pauzi, otkazivanju ili neuspjehu) pokrivat će samo dodatni rad obavljen nakon nastavka.

  • Ako otkažete pokretanje, naplaćujemo vam rad obavljen do trenutka otkazivanja.

  • Ako treniranje ne uspije i rad od posljednje naplate bude izgubljen, taj izgubljeni dio vam se ne naplaćuje.

Ovaj pristup „zabilježenog napretka unaprijed” osigurava da plaćate samo za rad koji je zadržan u vašem modelu ili koji namjerno napustite.

Praćenje napretka zadatka

Zadaci preciznog podešavanja potkrepljivanjem imaju polje usage_metrics, u kojem je zabilježena ukupna potrošnja zadatka do trenutnog koraka. To obuhvata vrijeme utrošeno na obuku i sve tokene koje su upotrijebili svi modeli za ocjenjivanje u zadatku. Ovo polje možete pregledati putem API-ja (GET /v1/fine_tuning/jobs/{job_id}) ili na kontrolnoj tabli za precizno podešavanje.

Faktori koji utječu na trajanje obuke

Budući da se naplata zasniva na vremenu, odabrana konfiguracija direktno utječe na troškove. Ključni faktori su:

  • Težina problema: ako se vaš skup podataka sastoji od teških problema, model će vjerovatno trošiti više vremena na rezonovanje o svakom problemu, zbog čega će izrada svakog uzorka trajati duže.

  • Intenzitet računanja: hiperparametar compute_multiplier određuje količinu računanja po koraku obuke. Veće vrijednosti podstiču model da opširnije rezonuje o svakom podatku, zbog čega se svaki korak izvršava sporije.

  • Postavke validacije:

  • Performanse ocjenjivača:

  • Većim ili sposobnijim modelima za ocjenjivanje treba više vremena da vrate ocjenu nego manjim modelima. Naprimjer, ocjenjivanje modelom rezonovanja može trajati 10 puta duže nego ocjenjivanje modelom koji ne koristi rezonovanje.

  • Složene funkcije za ocjenjivanje u Pythonu izvršavaju se duže od jednostavnih.

Ove postavke omogućavaju vam da uskladite troškove, brzinu i kvalitet modela. Naprimjer, česta validacija može ranije otkriti probleme, ali povećava troškove. Ocjenjivanje naprednijim modelom može znatno povećati preciznost ocjenjivanja, ali će usporiti svaki korak ocjenjivanja i povećati troškove zadataka.

Upravljanje troškovima

Da biste kontrolisali potrošnju:

  • Počnite s kraćim izvršavanjima kako biste shvatili kako vaša konfiguracija utječe na trajanje.

  • Koristite razuman broj primjera za validaciju i vrijednost parametra eval_samples. Nemojte provoditi validaciju češće nego što je potrebno.

  • Odaberite najmanji model za ocjenjivanje koji ispunjava vaše zahtjeve kvaliteta.

  • Prilagođeni ocjenjivači u Pythonu trebaju biti efikasni.

  • Prilagodite compute_multiplier kako biste uskladili brzinu konvergencije i troškove.

  • Pratite izvršavanje na kontrolnoj tabli ili putem API-ja. Izvršavanje možete pauzirati ili otkazati u bilo kojem trenutku.

Primjeri

Uspješno pokretanje obuke

Vrijeme obukeNaplaćeno vrijemeStatusOpis
00:0000:00Korisnik kreira posao preciznog podešavanja potkrepljivanjem putem API-ja
00:1000:00VALIDATING_FILES10 minuta provedeno u validaciji skupa podataka
00:3000:00VALIDATING_FILES20 minuta izvođenja sigurnosnih provjera skupa podataka
01:0000:00QUEUED30 minuta čekanja na dostupnog radnika
01:3000:00RUNNING30 minuta postavljanja obuke (preuzimanje težina, predobrada itd.)
05:3004:00RUNNING4 sata provedena u obuci
06:0004:00RUNNING30 minuta izvođenja sigurnosnih evaluacija rezultirajućeg modela
06:0004:00SUCCEEDEDObuka se završava

U ovom slučaju ukupno stvarno proteklo vrijeme je 6 sati, ali naplaćuju se samo 4 sata. Trošak bi bio 4 sata × $100/sat = $400.

Primjer neuspjelog posla

U ovom primjeru, pokretanje se obučava 2 sata, zapisuje kontrolnu tačku, obučava se još 1 sat, ali zatim ne uspije. Naplaćuju se samo 2 sata obuke do kontrolne tačke.

Vrijeme obukeNaplaćeno vrijemeStatusOpis
00:0000:00Korisnik kreira posao preciznog podešavanja potkrepljivanjem putem API-ja
00:1000:00VALIDATING_FILES10 minuta provedeno u validaciji skupa podataka
00:3000:00VALIDATING_FILES20 minuta izvođenja sigurnosnih provjera skupa podataka
01:0000:00QUEUED30 minuta čekanja na dostupnog radnika
01:3000:00RUNNING30 minuta postavljanja obuke (preuzimanje težina, predobrada itd.)
03:3002:00RUNNING2 sata provedena u obuci
03:3002:00RUNNINGKontrolna tačka kreirana u koraku 5
04:3002:00RUNNINGObuka ne uspijeva zbog interne greške u koraku 8 (nakon još 1 sata)
04:3002:00RUNNING30 minuta evaluacije i validacije kontrolne tačke
04:3002:00SUCCEEDEDPosao se završava (s najnovijom kontrolnom tačkom)

Iako je na obuku ukupno potrošeno 3 sata, samo su 2 sata „obuhvaćena“ u upotrebljivoj kontrolnoj tački i naplaćuju se. Sat rada na obuci izgubljen zbog neuspjeha nije vaša odgovornost. Trošak bi bio 2 sata × $100/sat = $200.

Često postavljana pitanja

Kada mi se naplaćuje?

Naplatu vršimo kada se izvršavanje završi, pauzira, otkaže ili ne uspije. Svaki obračun obuhvata rad obavljen od prethodnog obračuna.

Plaćam li ako pokretanje ne uspije?

Ako pokretanje ne uspije zbog naše greške i izgubi se nedavni rad na obuci, ne naplaćujemo vam izgubljeni dio. Ako otkažete pokretanje, naplaćuje vam se rad obavljen do otkazivanja.

Kako se naplaćuju tokeni modela ocjenjivača?

Brojimo tokene koje koriste svi modelski ocjenjivači koje konfigurišete. Nakon završetka obuke, te tokene naplaćujemo po našim standardnim cijenama po tokenu.

Mogu li pauzirati i nastaviti pokretanje?

Da. Kada pauzirate, spremamo kontrolnu tačku i naplaćujemo rad obavljen do tada. Kada nastavite, naplatit će vam se samo dodatni rad obavljen nakon nastavka.

Ako imate druga pitanja o naplati preciznog podešavanja potkrepljivanjem, kontaktirajte naš tim za podršku.

Da li je ovaj članak bio koristan?