OpenAI
Deze pagina is automatisch vertaald. Bekijk het oorspronkelijke Engelstalige artikel.

Facturatiehandleiding voor de Reinforcement Fine-Tuning API

Hoe facturatie werkt voor de RFT API

Bijgewerkt: 6 days ago

Hoe facturering voor RFT werkt

Met Reinforcement Fine‑Tuning (RFT) kun je de prestaties van de redenerende modellen van OpenAI optimaliseren met reinforcement learning. Anders dan bij onze supervised of preference fine‑tuning-aanbiedingen, die worden gefactureerd op basis van het aantal tokens in de trainingsdataset, wordt RFT gefactureerd op basis van de tijd die je trainingsrun besteedt aan het uitvoeren van de kernwerkzaamheden voor machine learning.

In deze handleiding wordt uitgelegd wat telt als factureerbare trainingstijd, hoe we omgaan met pauzes en annuleringen, en hoe je configuratiekeuzes de kosten kunnen beïnvloeden.

Prijzen

  • Rekenwerk: $ 100 per uur verstreken tijd in de kernlus van de training voor o4-mini-2025-04-16. De kosten worden per seconde naar rato berekend en op de factuur afgerond op twee decimalen (bijvoorbeeld 2,55 uur).

  • Gebruik door modelbeoordelaars: als je een OpenAI-model gebruikt om uitvoer tijdens de training te "beoordelen", worden de tokens die deze beoordelingsaanroepen verbruiken na afloop van de training afzonderlijk gefactureerd tegen onze standaard-API-tarieven.

We brengen alleen trainingswerk in rekening waarmee je model daadwerkelijk wordt bijgewerkt (wat we "vastgelegde voorwaartse voortgang" noemen).

Waarvoor we kosten in rekening brengen

We brengen kosten in rekening voor de tijd waarin je trainingsworker je model actief traint, specifiek:

  • Samples genereren vanuit je model tijdens het fine-tuningproces (bekend als ‘rollouts’)

  • Die uitvoer evalueren met een of meer beoordelaars die je voor de taak hebt gedefinieerd (meer informatie over beoordelaars)

  • Gewichtsupdates berekenen en toepassen op basis van de beoordelingen (backpropagation).

  • Alle validatie- of evaluatiestappen uitvoeren die je hebt geconfigureerd.

De meeste beoordelaars zijn ‘gratis’ om uit te voeren; dat betekent dat we geen extra kosten rekenen voor het gebruik ervan buiten de tijd die ze bijdragen aan de kerntrainingslus. De uitzondering hierop geldt voor modelbeoordelaars, waarbij we ook de tokens optellen die deze beoordelaars tijdens de bovenstaande activiteiten verbruiken. Deze tokens verschijnen als een afzonderlijke post op je factuur. Tokens die door modelbeoordelaars worden verbruikt, worden gefactureerd tegen normale inferentietarieven (OpenAI-prijzen).

Waarvoor we NIET factureren

We rekenen geen kosten voor tijd besteed aan:

  • Het valideren of inspecteren van je dataset voordat de training start.

  • Veiligheidscontroles van je dataset.

  • Wachten in een wachtrij op rekenresources.

  • Het downloaden van modelgewichten of datasets.

  • Het voorbereiden (renderen) van je dataset naar ons trainingsformaat.

  • Veiligheidsevaluaties na de training van je fine-tuned model.

Als trainingswerk verloren gaat door een fout aan onze kant (bijvoorbeeld als een worker crasht en moet terugvallen op een eerder checkpoint), worden er geen kosten in rekening gebracht voor de verloren rekentijd of grader-tokens. Meer details hierover in de volgende sectie.

Captured forward progress en facturatiegebeurtenissen

Training bestaat uit veel kleine updates van je model. We houden bij hoeveel van deze updates met succes worden voltooid. Kosten zijn gebaseerd op de rekentijd en grader-tokens die met deze succesvolle updates samenhangen.

We brengen kosten in rekening wanneer een van de volgende "facturatiegebeurtenissen" plaatsvindt:

  • Training wordt succesvol voltooid.

  • Je pauzeert de training.

  • Je annuleert de training.

  • Training mislukt.

Elke kostenpost dekt het incrementele werk dat sinds de vorige kostenpost is uitgevoerd. Bijvoorbeeld:

  • Als je een run pauzeert, slaan we een checkpoint op en brengen we de rekentijd en grader-tokens in rekening die sinds de vorige kostenpost zijn gebruikt.

  • Wanneer je hervat, gaat de training verder vanaf het checkpoint. De volgende kostenpost (bij voltooiing, een nieuwe pauze, annulering of mislukking) dekt alleen het extra werk dat na het hervatten is uitgevoerd.

  • Als je een run annuleert, brengen we het werk in rekening dat tot aan de annulering is uitgevoerd.

  • Als training mislukt en werk sinds de vorige kostenpost verloren gaat, wordt het verloren deel niet gefactureerd.

Deze aanpak van "captured forward progress" zorgt ervoor dat je alleen betaalt voor werk dat in je model behouden blijft of dat je bewust opgeeft.

De voortgang van een taak bekijken

RFT-taken hebben een veld met de naam usage_metrics, waarin het totale gebruik van de taak tot en met de huidige stap wordt vastgelegd. Dit omvat de tijd die aan training is besteed en alle tokens die door alle modelbeoordelaars voor de taak zijn gebruikt. Je kunt dit veld bekijken via de API (GET /v1/fine_tuning/jobs/{job_id}) of via het dashboard voor fine-tuning.

Factoren die de trainingsduur beïnvloeden

Omdat de facturering op tijd is gebaseerd, hebben je configuratiekeuzes rechtstreeks invloed op de kosten. Belangrijke factoren zijn:

  • Moeilijkheidsgraad van het probleem: als je dataset uit moeilijke problemen bestaat, zal het model waarschijnlijk meer tijd besteden aan de redenering over elk probleem. Daardoor kost het meer tijd om elk voorbeeld te produceren.

  • Rekenintensiteit: de hyperparameter compute_multiplier bepaalt hoeveel rekenwerk je per trainingsstap uitvoert. Hogere waarden stimuleren het model om uitgebreider over elk datapunt te redeneren, waardoor elke stap langzamer verloopt.

  • Validatie-instellingen:

  • Prestaties van de beoordelaar:

  • Grotere of geavanceerdere modelbeoordelaars doen er langer over om een beoordeling te geven dan kleinere. Beoordeling met een redenerend model kan bijvoorbeeld tien keer langer duren dan beoordeling met een niet-redenerend model.

  • Complexe beoordelingsfuncties in Python hebben meer uitvoeringstijd nodig dan eenvoudige functies.

Met deze instellingen kun je kosten, snelheid en modelkwaliteit tegen elkaar afwegen. Regelmatige validatie kan problemen bijvoorbeeld eerder opsporen, maar verhoogt de kosten. Beoordeling met een geavanceerder model kan de nauwkeurigheid aanzienlijk verbeteren, maar vertraagt elke beoordelingsstap en maakt taken duurder.

Kosten beheren

Zo houd je je uitgaven onder controle:

  • Begin met kortere runs om te begrijpen hoe je configuratie de duur beïnvloedt.

  • Gebruik een redelijk aantal validatievoorbeelden en eval_samples. Valideer niet vaker dan nodig.

  • Kies het kleinste beoordelaarsmodel dat aan je kwaliteitseisen voldoet.

  • Zorg dat aangepaste Python-beoordelaars efficiënt zijn.

  • Pas compute_multiplier aan om convergentiesnelheid en kosten in balans te brengen.

  • Volg je run in het dashboard of via de API. Je kunt de run op elk moment pauzeren of annuleren.

Voorbeelden

Geslaagde trainingsrun

TrainingstijdGefactureerde tijdStatusBeschrijving
00:0000:00Gebruiker maakt RFT-taak via API
00:1000:00VALIDATING_FILES10 minuten besteed aan het valideren van de dataset
00:3000:00VALIDATING_FILES20 minuten bezig met veiligheidscontroles van de dataset
01:0000:00QUEUED30 minuten wachten op een beschikbare worker
01:3000:00RUNNING30 minuten besteed aan het instellen van training (gewichten downloaden, preprocessing, enz.)
05:3004:00RUNNING4 uur besteed aan training
06:0004:00RUNNING30 minuten besteed aan veiligheidsevaluaties van het resulterende model
06:0004:00SUCCEEDEDTraining voltooid

In dit geval is de totale verstreken tijd 6 uur, maar zijn slechts 4 uur factureerbaar. De kosten zouden 4 uur × $100/uur = $400 zijn.

Voorbeeld van mislukte taak

In dit voorbeeld traint de run 2 uur, schrijft een checkpoint, traint nog 1 uur, maar mislukt daarna. Alleen de 2 uur training tot aan het checkpoint zijn factureerbaar.

TrainingstijdGefactureerde tijdStatusBeschrijving
00:0000:00Gebruiker maakt RFT-taak via API
00:1000:00VALIDATING_FILES10 minuten besteed aan het valideren van de dataset
00:3000:00VALIDATING_FILES20 minuten bezig met veiligheidscontroles van de dataset
01:0000:00QUEUED30 minuten wachten op een beschikbare worker
01:3000:00RUNNING30 minuten besteed aan het instellen van training (gewichten downloaden, preprocessing, enz.)
03:3002:00RUNNING2 uur besteed aan training
03:3002:00RUNNINGCheckpoint gemaakt bij stap 5
04:3002:00RUNNINGTraining mislukt door interne fout bij stap 8 (na nog 1 uur)
04:3002:00RUNNING30 minuten besteed aan het evalueren en valideren van het checkpoint
04:3002:00SUCCEEDEDTaak voltooid (met laatste checkpoint)

Hoewel er in totaal 3 uur aan training is besteed, zijn slechts 2 uur in een bruikbaar checkpoint "vastgelegd" en worden die gefactureerd. Het uur trainingswerk dat door de fout verloren is gegaan, is niet jouw verantwoordelijkheid. De kosten zouden 2 uur × $100/uur = $200 zijn.

Veelgestelde vragen

Wanneer worden er kosten in rekening gebracht?

We brengen kosten in rekening wanneer je run is voltooid, gepauzeerd of geannuleerd, of mislukt. Elke factuur omvat het werk dat sinds de vorige factuur is uitgevoerd.

Betaal ik als een run mislukt?

Als een run door onze fout mislukt en recent trainingswerk verloren gaat, brengen we voor het verloren deel geen kosten in rekening. Als je een run annuleert, brengen we kosten in rekening voor het werk tot aan de annulering.

Hoe worden tokens van beoordelingsmodellen gefactureerd?

We tellen de tokens die worden gebruikt door modelbeoordelaars die je configureert. Nadat de training is voltooid, factureren we die tokens tegen onze standaardtarieven per token.

Kan ik een run pauzeren en hervatten?

Ja. Wanneer je pauzeert, slaan we een checkpoint op en brengen we kosten in rekening voor het werk dat tot dan toe is gedaan. Wanneer je hervat, worden alleen kosten in rekening gebracht voor aanvullend werk dat na het hervatten wordt gedaan.

Als je andere vragen hebt over facturering voor Reinforcement Fine‑Tuning, neem dan contact op met ons supportteam.

Was dit artikel nuttig?