Slik fungerer fakturering for RFT
Reinforcement Fine‑Tuning (RFT) lar deg optimalisere ytelsen til OpenAIs resonneringsmodeller ved hjelp av forsterkende læring. I motsetning til våre tilbud for veiledet finjustering eller preferansefinjustering, som faktureres etter antall token i treningsdatasettet, faktureres RFT basert på tiden treningskjøringen bruker på det sentrale maskinlæringsarbeidet.
Denne veiledningen forklarer hva som regnes som fakturerbar treningstid, hvordan vi håndterer pauser og avbestillinger, og hvordan konfigurasjonsvalgene dine kan påvirke kostnaden.
Priser
Beregning: $100 per time med faktisk tid brukt i hovedløkken for trening av o4-mini-2025-04-16. Beløpene beregnes per sekund og avrundes til to desimaler på fakturaen (f.eks. 2,55 timer).
Bruk av modellevaluator: Hvis du bruker en OpenAI-modell til å «evaluere» resultater under treningen, faktureres tokenene som brukes av disse evalueringskallene, separat etter våre ordinære API-priser når treningen er fullført.
Vi tar bare betalt for treningsarbeid som faktisk oppdaterer modellen din (det vi kaller «registrert fremdrift»).
Hva vi fakturerer for
Vi fakturerer for tiden treningsarbeideren bruker på aktivt å trene modellen din, nærmere bestemt:
Generering av prøver fra modellen din under finjusteringsprosessen (kjent som «rollouts»)
Evaluering av disse utdataene med én eller flere gradere som du har definert i jobben (finn ut mer om gradere)
Beregning og bruk av vektoppdateringer basert på karakterene (tilbakepropagering).
Kjøring av eventuelle valideringstrinn (evaluering) du har konfigurert.
De fleste gradere er «gratis» å kjøre, noe som betyr at vi ikke tar ekstra betalt for bruken av dem utover tiden de bidrar med i kjernetreningsløkken. Unntaket fra dette er modellgradere, der vi også teller tokenene disse graderne bruker under aktivitetene ovenfor. Disse tokenene vises som en egen linjepost på fakturaen din. Token som brukes av modellgradere, faktureres til normale inferenssatser (OpenAI-priser).
Hva vi IKKE fakturerer for
Vi tar ikke betalt for tid brukt på:
Validering eller inspeksjon av datasettet ditt før treningen starter.
Sikkerhetssjekker av datasettet ditt.
Venting i kø på beregningsressurser.
Nedlasting av modellvekter eller datasett.
Klargjøring (rendring) av datasettet ditt til vårt treningsformat.
Sikkerhetsevalueringer av den finjusterte modellen etter trening.
Hvis treningsarbeid går tapt på grunn av en feil fra vår side (for eksempel hvis en arbeider krasjer og må rulle tilbake til et tidligere kontrollpunkt), blir du ikke belastet for den tapte beregningstiden eller bedømmer-tokenene. Flere detaljer om dette i neste avsnitt.
Fanget fremdrift og faktureringshendelser
Trening består av mange små oppdateringer av modellen din. Vi sporer hvor mange av disse oppdateringene som fullføres vellykket. Kostnader er basert på beregningstiden og bedømmer-tokenene knyttet til disse vellykkede oppdateringene.
Vi utsteder en belastning når en av følgende «faktureringshendelser» inntreffer:
Treningen fullføres vellykket.
Du setter treningen på pause.
Du avbryter treningen.
Treningen mislykkes.
Hver belastning dekker det inkrementelle arbeidet som er utført siden forrige belastning. For eksempel:
Hvis du setter en kjøring på pause, lagrer vi et kontrollpunkt og belaster deg for beregningstiden og bedømmer-tokenene som er brukt siden forrige belastning.
Når du gjenopptar, fortsetter treningen fra kontrollpunktet. Den neste belastningen (ved fullføring, en ny pause, avbrudd eller feil) vil bare dekke det ekstra arbeidet som er utført etter gjenopptakelsen.
Hvis du avbryter en kjøring, belaster vi deg for arbeidet som er utført frem til avbruddet.
Hvis treningen mislykkes og arbeid siden forrige belastning går tapt, blir du ikke fakturert for den tapte delen.
Denne tilnærmingen med «fanget fremdrift» sikrer at du bare betaler for arbeid som beholdes i modellen din eller som du bevisst forlater.
Se fremdriften for jobben
RFT-jobber har et felt kalt usage_metrics, som dokumenterer jobbens samlede bruk frem til og med gjeldende trinn. Dette omfatter tiden som brukes på trening, og alle tokener som brukes av samtlige modellevaluatorer i jobben. Dette feltet kan kontrolleres via API-et (GET /v1/fine_tuning/jobs/{job_id}) eller i kontrollpanelet for finjustering.
Faktorer som påvirker treningstiden
Fordi faktureringen er tidsbasert, påvirker konfigurasjonsvalgene dine kostnadene direkte. Viktige faktorer er:
Problemenes vanskelighetsgrad: Hvis datasettet består av vanskelige problemer, vil modellen sannsynligvis bruke mer tid på resonnering for hvert problem. Dermed tar det lengre tid å produsere hver eksempelrespons.
Beregningsintensitet: Hyperparameteren compute_multiplier styrer hvor mye beregning som utføres per treningstrinn. Høyere verdier oppmuntrer modellen til å resonnere mer utførlig over hvert datapunkt, slik at hvert trinn tar lengre tid.
Valideringsinnstillinger:
Evaluatorytelse:
Større eller mer avanserte modellevaluatorer bruker lengre tid på å returnere en vurdering enn mindre evaluatorer. Evaluering med en Resonneringsmodell kan for eksempel ta ti ganger så lang tid som evaluering med en modell uten resonnering.
Komplekse evalueringsfunksjoner i Python tar lengre tid å kjøre enn enkle funksjoner.
Med disse innstillingene kan du avveie kostnader, hastighet og modellkvalitet. Hyppig validering kan for eksempel avdekke problemer tidligere, men øker kostnadene. Evaluering med en mer avansert modell kan forbedre nøyaktigheten betraktelig, men gjør hvert evalueringstrinn langsommere og jobbene dyrere.
Administrere kostnader
Slik holder du kostnadene under kontroll:
Begynn med kortere kjøringer for å forstå hvordan konfigurasjonen påvirker tidsbruken.
Bruk et rimelig antall valideringseksempler og eval_samples. Ikke valider oftere enn nødvendig.
Velg den minste evaluatormodellen som oppfyller kvalitetskravene dine.
Sørg for at egendefinerte Python-evaluatorer er effektive.
Juster compute_multiplier for å balansere konvergenshastighet og kostnader.
Overvåk kjøringen i kontrollpanelet eller via API-et. Du kan når som helst sette kjøringen på pause eller avbryte den.
Eksempler
Vellykket treningskjøring
| Treningstid | Fakturert tid | Status | Beskrivelse |
|---|---|---|---|
| 00:00 | 00:00 | – | Brukeren oppretter RFT-jobb via API |
| 00:10 | 00:00 | VALIDATING_FILES | 10 minutter brukt på å validere datasettet |
| 00:30 | 00:00 | VALIDATING_FILES | 20 minutter brukt på sikkerhetskontroller av datasettet |
| 01:00 | 00:00 | QUEUED | 30 minutter venting på en tilgjengelig worker |
| 01:30 | 00:00 | RUNNING | 30 minutter på å sette opp trening (laste ned vekter, forhåndsbehandling osv.) |
| 05:30 | 04:00 | RUNNING | 4 timer brukt på trening |
| 06:00 | 04:00 | RUNNING | 30 minutter brukt på sikkerhetsevalueringer av den resulterende modellen |
| 06:00 | 04:00 | SUCCEEDED | Treningen fullføres |
I dette tilfellet er den totale faktiske tiden 6 timer, men bare 4 timer er fakturerbare. Kostnaden ville vært 4 timer × $100/time = $400.
Eksempel på mislykket jobb
I dette eksemplet trener kjøringen i 2 timer, skriver et kontrollpunkt, trener i 1 time til, men mislykkes deretter. Bare de 2 timene med trening frem til kontrollpunktet kan faktureres.
| Treningstid | Fakturert tid | Status | Beskrivelse |
|---|---|---|---|
| 00:00 | 00:00 | – | Brukeren oppretter RFT-jobb via API |
| 00:10 | 00:00 | VALIDATING_FILES | 10 minutter brukt på å validere datasettet |
| 00:30 | 00:00 | VALIDATING_FILES | 20 minutter brukt på sikkerhetskontroller av datasettet |
| 01:00 | 00:00 | QUEUED | 30 minutter venting på en tilgjengelig worker |
| 01:30 | 00:00 | RUNNING | 30 minutter på å sette opp trening (laste ned vekter, forhåndsbehandling osv.) |
| 03:30 | 02:00 | RUNNING | 2 timer brukt på trening |
| 03:30 | 02:00 | RUNNING | Kontrollpunkt opprettet ved trinn 5 |
| 04:30 | 02:00 | RUNNING | Treningen mislykkes på grunn av en intern feil ved trinn 8 (etter 1 time til) |
| 04:30 | 02:00 | RUNNING | 30 minutter brukt på å evaluere og validere kontrollpunktet |
| 04:30 | 02:00 | SUCCEEDED | Jobben fullføres (med siste kontrollpunkt) |
Selv om 3 timer ble brukt på trening totalt, er bare 2 timer «fanget opp» i et brukbart kontrollpunkt og faktureres. Timen med treningsarbeid som gikk tapt på grunn av feilen, er ikke ditt ansvar. Kostnaden ville vært 2 timer × $100/time = $200.
Ofte stilte spørsmål
Når blir jeg belastet?
Vi fakturerer når kjøringen fullføres, settes på pause, avbrytes eller mislykkes. Hver faktura dekker arbeid som er utført siden forrige faktura.
Betaler jeg hvis en kjøring mislykkes?
Hvis en kjøring mislykkes på grunn av vår feil og nylig treningsarbeid går tapt, blir du ikke belastet for den tapte delen. Hvis du avbryter en kjøring, blir du belastet for arbeidet frem til avbrytelsen.
Hvordan faktureres token for grader-modeller?
Vi teller tokenene som brukes av eventuelle modellgradere du konfigurerer. Etter at treningen er fullført, fakturerer vi disse tokenene til våre standard satser per token.
Kan jeg sette en kjøring på pause og gjenoppta den?
Ja. Når du setter på pause, lagrer vi et kontrollpunkt og belaster deg for arbeidet som er gjort så langt. Når du gjenopptar, belastes du bare for ekstra arbeid som gjøres etter gjenopptakelsen.
Hvis du har andre spørsmål om fakturering for Reinforcement Fine‑Tuning, kan du kontakte kundestøtteteamet vårt.
