OpenAI
Ova stranica je mašinski prevedena. Pogledaj originalni članak na engleskom jeziku.

Vodič za naplatu za API za Reinforcement Fine Tuning

Kako funkcioniše naplata za RFT API

Ažurirano: 7 days ago

Kako funkcioniše naplata za precizno podešavanje potkrepljivanjem

Precizno podešavanje potkrepljivanjem (RFT) omogućava vam da optimizirate performanse OpenAI modela rezonovanja pomoću učenja s potkrepljivanjem. Za razliku od naših ponuda nadziranog preciznog podešavanja ili preciznog podešavanja prema preferencijama, koje se naplaćuju prema broju tokena u skupu podataka za obuku, precizno podešavanje potkrepljivanjem naplaćuje se na osnovu vremena koje vaš proces obuke provede obavljajući osnovni rad mašinskog učenja.

Ovaj vodič objašnjava šta se računa kao naplativo vrijeme treniranja, kako postupamo s pauzama i otkazivanjima te kako vaši izbori konfiguracije mogu utjecati na trošak.

Cijene

  • Računanje: $100 po satu stvarno proteklog vremena provedenog u osnovnoj petlji treniranja za o4-mini-2025-04-16. Troškovi se obračunavaju proporcionalno po sekundi i zaokružuju na dvije decimale na računu (npr. 2.55 sati).

  • Upotreba ocjenjivačkog modela: Ako koristite OpenAI model za "ocjenjivanje" izlaza tokom treniranja, tokeni potrošeni tim pozivima za ocjenjivanje naplaćuju se zasebno po našim standardnim API stopama nakon završetka treniranja.

Naplatu vršimo samo za rad na treniranju koji zaista ažurira vaš model (ono što nazivamo "zabilježeni napredak unaprijed").

Šta naplaćujemo

Naplaćujemo vrijeme koje vaš radnik za obuku provede aktivno obučavajući vaš model, konkretno:

  • Generisanje uzoraka iz vašeg modela tokom procesa preciznog podešavanja (poznato kao „rollouts“)

  • Evaluiranje tih izlaza pomoću jednog ili više ocjenjivača koje ste definisali za posao (saznajte više o ocjenjivačima)

  • Izračunavanje i primjena ažuriranja težina na osnovu ocjena (povratna propagacija).

  • Pokretanje svih koraka validacije (evaluacije) koje ste konfigurisali.

Većina ocjenjivača je „besplatna“ za pokretanje, što znači da ne naplaćujemo dodatno za njihovu upotrebu izvan vremena koje doprinose osnovnoj petlji obuke. Izuzetak su modelski ocjenjivači, gdje također zbrajamo tokene koje ti ocjenjivači potroše tokom gore navedenih aktivnosti. Ti tokeni se na vašoj fakturi prikazuju kao posebna stavka. Tokeni koje potroše modelski ocjenjivači naplaćuju se po uobičajenim cijenama zaključivanja (OpenAI cijene).

Šta NE naplaćujemo

Ne naplaćujemo vrijeme provedeno na:

  • Validaciji ili pregledu vašeg skupa podataka prije početka treniranja.

  • Sigurnosnim provjerama vašeg skupa podataka.

  • Čekanju u redu za resurse računanja.

  • Preuzimanju težina modela ili skupova podataka.

  • Pripremi (renderovanju) vašeg skupa podataka u naš format za treniranje.

  • Sigurnosnim evaluacijama vašeg fino podešenog modela nakon treniranja.

Ako se rad na treniranju izgubi zbog greške s naše strane (naprimjer, ako se radnik sruši i mora se vratiti na prethodnu kontrolnu tačku), ne naplaćuju vam se izgubljeno vrijeme računanja ni tokeni ocjenjivača. Više detalja o tome nalazi se u sljedećem odjeljku.

Zabilježeni napredak unaprijed i događaji naplate

Treniranje se sastoji od mnogo malih ažuriranja vašeg modela. Pratimo koliko se tih ažuriranja uspješno završi. Naknade se zasnivaju na vremenu računanja i tokenima ocjenjivača povezanim s tim uspješnim ažuriranjima.

Izdajemo naplatu kada se dogodi jedan od sljedećih „događaja naplate”:

  • Treniranje se uspješno završi.

  • Pauzirate treniranje.

  • Otkažete treniranje.

  • Treniranje ne uspije.

Svaka naplata pokriva dodatni rad obavljen od posljednje naplate. Naprimjer:

  • Ako pauzirate pokretanje, spremamo kontrolnu tačku i naplaćujemo vam vrijeme računanja i tokene ocjenjivača korištene od posljednje naplate.

  • Kada nastavite, treniranje se nastavlja od kontrolne tačke. Sljedeća naplata (po završetku, novoj pauzi, otkazivanju ili neuspjehu) pokrivat će samo dodatni rad obavljen nakon nastavka.

  • Ako otkažete pokretanje, naplaćujemo vam rad obavljen do trenutka otkazivanja.

  • Ako treniranje ne uspije i rad od posljednje naplate bude izgubljen, taj izgubljeni dio vam se ne naplaćuje.

Ovaj pristup „zabilježenog napretka unaprijed” osigurava da plaćate samo za rad koji je zadržan u vašem modelu ili koji namjerno napustite.

Pregled napretka posla

Poslovi preciznog podešavanja potkrepljivanjem imaju polje usage_metrics koje dokumentuje ukupnu upotrebu posla do trenutnog koraka. To uključuje vrijeme provedeno u obuci i sve tokene korištene kod svih modelskih ocjenjivača u poslu. Ovo polje se može pregledati putem API-ja (GET /v1/fine_tuning/jobs/{job_id}) ili putem kontrolne table za precizno podešavanje.

Faktori koji utječu na vrijeme treniranja

Budući da se naplata zasniva na vremenu, vaši izbori konfiguracije direktno utječu na trošak. Ključni faktori uključuju:

  • Težina problema: ako se vaš skup podataka sastoji od teških problema, model će vjerovatno provoditi više vremena u rezonovanju o svakom problemu, što povećava vrijeme potrebno za izradu svakog uzorka.

  • Intenzitet računanja: Hiperparametar compute_multiplier kontroliše koliko računanja obavljate po koraku treniranja. Više vrijednosti podstiču model da opširnije rezonuje o svakoj podatkovnoj tački, što uzrokuje sporije izvođenje svakog koraka.

  • Postavke validacije:

    • Veći skup za validaciju povećava vrijeme provedeno u evaluaciji.

    • Povećanje eval_samples (broja izlaza modela ocijenjenih po primjeru validacije) povećava vrijeme validacije.

    • Češće pokretanje validacije (niži eval_interval) povećava udio vremena provedenog na validaciji.

  • Performanse ocjenjivača:

    • Većim ili sposobnijim ocjenjivačkim modelima treba više vremena da vrate ocjenu nego manjim. Naprimjer, ocjenjivanje modelom rezonovanja može trajati 10x duže nego ocjenjivanje modelom bez rezonovanja.

    • Složene Python funkcije za ocjenjivanje rade sporije od jednostavnih.

Ove postavke vam omogućavaju da pravite kompromise između troška, brzine i kvaliteta modela. Naprimjer, česta validacija može ranije otkriti probleme, ali povećava trošak. Ocjenjivanje naprednijim modelom može drastično poboljšati tačnost ocjenjivanja, ali će usporiti svaki korak ocjenjivanja i učiniti zadatke skupljim.

Upravljanje troškovima

Da biste kontrolisali potrošnju:

  • Počnite s kraćim pokretanjima kako biste razumjeli kako vaša konfiguracija utječe na vrijeme.

  • Koristite razuman broj primjera za validaciju i eval_samples. Izbjegavajte validaciju češće nego što vam je potrebno.

  • Odaberite najmanji model ocjenjivača koji ispunjava vaše zahtjeve kvaliteta.

  • Prilagođene Python ocjenjivače održavajte efikasnim.

  • Podesite compute_multiplier kako biste uravnotežili brzinu konvergencije i trošak.

  • Pratite svoje pokretanje na kontrolnoj ploči ili putem API-ja. Možete pauzirati ili otkazati u bilo kojem trenutku.

Primjeri

Uspješno pokretanje obuke

Vrijeme obukeNaplaćeno vrijemeStatusOpis
00:0000:00Korisnik kreira posao preciznog podešavanja potkrepljivanjem putem API-ja
00:1000:00VALIDATING_FILES10 minuta provedeno u validaciji skupa podataka
00:3000:00VALIDATING_FILES20 minuta izvođenja sigurnosnih provjera skupa podataka
01:0000:00QUEUED30 minuta čekanja na dostupnog radnika
01:3000:00RUNNING30 minuta postavljanja obuke (preuzimanje težina, predobrada itd.)
05:3004:00RUNNING4 sata provedena u obuci
06:0004:00RUNNING30 minuta izvođenja sigurnosnih evaluacija rezultirajućeg modela
06:0004:00SUCCEEDEDObuka se završava

U ovom slučaju ukupno stvarno proteklo vrijeme je 6 sati, ali naplaćuju se samo 4 sata. Trošak bi bio 4 sata × $100/sat = $400.

Primjer neuspjelog posla

U ovom primjeru, pokretanje se obučava 2 sata, zapisuje kontrolnu tačku, obučava se još 1 sat, ali zatim ne uspije. Naplaćuju se samo 2 sata obuke do kontrolne tačke.

Vrijeme obukeNaplaćeno vrijemeStatusOpis
00:0000:00Korisnik kreira posao preciznog podešavanja potkrepljivanjem putem API-ja
00:1000:00VALIDATING_FILES10 minuta provedeno u validaciji skupa podataka
00:3000:00VALIDATING_FILES20 minuta izvođenja sigurnosnih provjera skupa podataka
01:0000:00QUEUED30 minuta čekanja na dostupnog radnika
01:3000:00RUNNING30 minuta postavljanja obuke (preuzimanje težina, predobrada itd.)
03:3002:00RUNNING2 sata provedena u obuci
03:3002:00RUNNINGKontrolna tačka kreirana u koraku 5
04:3002:00RUNNINGObuka ne uspijeva zbog interne greške u koraku 8 (nakon još 1 sata)
04:3002:00RUNNING30 minuta evaluacije i validacije kontrolne tačke
04:3002:00SUCCEEDEDPosao se završava (s najnovijom kontrolnom tačkom)

Iako je na obuku ukupno potrošeno 3 sata, samo su 2 sata „obuhvaćena“ u upotrebljivoj kontrolnoj tački i naplaćuju se. Sat rada na obuci izgubljen zbog neuspjeha nije vaša odgovornost. Trošak bi bio 2 sata × $100/sat = $200.

Često postavljana pitanja

Kada mi se naplaćuje?

Naplatu vršimo kada se vaše pokretanje završi, pauzira, otkaže ili ne uspije. Svaki račun pokriva rad obavljen od prethodnog računa.

Plaćam li ako pokretanje ne uspije?

Ako pokretanje ne uspije zbog naše greške i izgubi se nedavni rad na obuci, ne naplaćujemo vam izgubljeni dio. Ako otkažete pokretanje, naplaćuje vam se rad obavljen do otkazivanja.

Kako se naplaćuju tokeni modela ocjenjivača?

Brojimo tokene koje koriste svi modelski ocjenjivači koje konfigurišete. Nakon završetka obuke, te tokene naplaćujemo po našim standardnim cijenama po tokenu.

Mogu li pauzirati i nastaviti pokretanje?

Da. Kada pauzirate, spremamo kontrolnu tačku i naplaćujemo rad obavljen do tada. Kada nastavite, naplatit će vam se samo dodatni rad obavljen nakon nastavka.

Ako imate druga pitanja o naplati preciznog podešavanja potkrepljivanjem, kontaktirajte naš tim za podršku.

Da li je ovaj članak bio koristan?