Ako funguje fakturácia za RFT
Reinforcement Fine‑Tuning (RFT) vám umožňuje optimalizovať výkon uvažovacích modelov OpenAI pomocou učenia posilňovaním. Na rozdiel od našich ponúk kontrolovaného alebo preferenčného dolaďovania, ktoré sa fakturujú podľa počtu tokenov v tréningovom súbore údajov, sa RFT fakturuje na základe času, ktorý váš tréningový beh strávi vykonávaním hlavnej práce strojového učenia.
Táto príručka vysvetľuje, čo sa počíta ako účtovateľný čas tréningu, ako riešime pozastavenia a zrušenia a ako môžu vaše voľby konfigurácie ovplyvniť cenu.
Ceny
Výpočty: 100 USD za hodinu reálneho času stráveného v hlavnej trénovacej slučke modelu o4-mini-2025-04-16. Poplatky sa pomerne vypočítavajú na sekundy a na faktúre sa zaokrúhľujú na dve desatinné miesta (napr. 2,55 hodiny).
Využitie hodnotiaceho modelu: Ak počas trénovania používate model OpenAI na „hodnotenie“ výstupov, tokeny spotrebované pri týchto hodnotiacich volaniach sa po dokončení trénovania účtujú samostatne podľa našich štandardných sadzieb API.
Účtujeme iba prácu pri trénovaní, ktorá váš model skutočne aktualizuje (nazývame ju „zaznamenaný pokrok“).
Čo fakturujeme
Fakturujeme čas, ktorý váš tréningový pracovník strávi aktívnym tréningom vášho modelu, konkrétne:
Generovanie vzoriek z vášho modelu počas procesu jemného dolaďovania (známe ako „rollouts“)
Vyhodnocovanie týchto výstupov jedným alebo viacerými hodnotiteľmi, ktorých ste definovali v úlohe (ďalšie informácie o hodnotiteľoch)
Výpočet a použitie aktualizácií váh na základe hodnotení (spätné šírenie).
Spúšťanie všetkých krokov overenia (vyhodnotenia), ktoré ste nakonfigurovali.
Spustenie väčšiny hodnotiteľov je „bezplatné“, čo znamená, že za ich použitie neúčtujeme nič navyše okrem času, ktorým prispievajú k základnej tréningovej slučke. Výnimkou sú modeloví hodnotitelia, pri ktorých započítavame aj tokeny, ktoré títo hodnotitelia spotrebujú počas vyššie uvedených aktivít. Tieto tokeny sa na vašej faktúre zobrazia ako samostatná položka. Tokeny spotrebované modelovými hodnotiteľmi sa fakturujú podľa bežných sadzieb za inferenciu (cenník OpenAI).
Za čo NEúčtujeme
Neúčtujeme čas strávený:
Validáciou alebo kontrolou vašej množiny údajov pred začiatkom tréningu.
Bezpečnostnými kontrolami vašej množiny údajov.
Čakaním v rade na výpočtové prostriedky.
Sťahovaním váh modelu alebo množín údajov.
Prípravou (renderovaním) vašej množiny údajov do nášho tréningového formátu.
Bezpečnostnými vyhodnoteniami vášho doladeného modelu po tréningu.
Ak sa tréningová práca stratí v dôsledku chyby na našej strane (napríklad ak worker spadne a musí sa vrátiť k predchádzajúcemu checkpointu), za stratený čas výpočtov ani tokeny hodnotiteľov sa vám nič neúčtuje. Viac podrobností nájdete v ďalšej časti.
Zachytený postup vpred a udalosti účtovania
Tréning pozostáva z mnohých malých aktualizácií vášho modelu. Sledujeme, koľko z týchto aktualizácií sa úspešne dokončí. Poplatky sú založené na čase výpočtov a tokenoch hodnotiteľov spojených s týmito úspešnými aktualizáciami.
Poplatok zaúčtujeme, keď nastane jedna z nasledujúcich „udalostí účtovania“:
Tréning sa úspešne dokončí.
Pozastavíte tréning.
Zrušíte tréning.
Tréning zlyhá.
Každý poplatok pokrýva prírastkovú prácu vykonanú od posledného účtovania. Napríklad:
Ak beh pozastavíte, uložíme checkpoint a naúčtujeme vám čas výpočtov a tokeny hodnotiteľov použité od posledného účtovania.
Keď obnovíte beh, tréning pokračuje od checkpointu. Ďalší poplatok (pri dokončení, ďalšom pozastavení, zrušení alebo zlyhaní) bude pokrývať len dodatočnú prácu vykonanú po obnovení.
Ak beh zrušíte, účtujeme vám prácu vykonanú do momentu zrušenia.
Ak tréning zlyhá a práca od posledného účtovania sa stratí, za stratenú časť sa vám nič neúčtuje.
Tento prístup „zachyteného postupu vpred“ zaisťuje, že platíte len za prácu, ktorá zostane vo vašom modeli alebo ktorej sa zámerne vzdáte.
Sledovanie priebehu úlohy
Úlohy RFT majú pole s názvom usage_metrics, ktoré zaznamenáva celkové využitie úlohy až po aktuálny krok. Zahŕňa čas strávený trénovaním aj všetky tokeny použité všetkými hodnotiacimi modelmi v rámci úlohy. Toto pole môžete skontrolovať cez API (GET /v1/fine_tuning/jobs/{job_id}) alebo na ovládacom paneli dolaďovania.
Faktory ovplyvňujúce čas trénovania
Keďže účtovanie vychádza z času, vaše nastavenia priamo ovplyvňujú náklady. Medzi hlavné faktory patria:
Náročnosť problémov: ak váš súbor údajov pozostáva z náročných problémov, model pravdepodobne strávi viac času uvažovaním nad každým z nich, čím sa predĺži čas potrebný na vytvorenie každej vzorky.
Výpočtová náročnosť: Hyperparameter compute_multiplier určuje množstvo výpočtov vykonaných v každom kroku trénovania. Vyššie hodnoty podnecujú model k podrobnejšiemu uvažovaniu nad každým dátovým bodom, takže jednotlivé kroky trvajú dlhšie.
Nastavenia validácie:
Výkon hodnotiaceho systému:
Väčším alebo výkonnejším hodnotiacim modelom trvá vrátenie hodnotenia dlhšie než menším modelom. Napríklad hodnotenie pomocou uvažovacieho modelu môže trvať desaťkrát dlhšie než hodnotenie pomocou modelu bez uvažovania.
Spustenie zložitých hodnotiacich funkcií v Pythone trvá dlhšie než spustenie jednoduchých funkcií.
Tieto nastavenia umožňujú vyvážiť náklady, rýchlosť a kvalitu modelu. Častá validácia môže napríklad odhaliť problémy skôr, zvyšuje však náklady. Hodnotenie pomocou pokročilejšieho modelu môže výrazne zvýšiť presnosť hodnotenia, zároveň však spomalí každý krok hodnotenia a zvýši náklady na úlohy.
Riadenie nákladov
Ako udržať výdavky pod kontrolou:
Začnite kratšími spusteniami, aby ste zistili, ako vaše nastavenia ovplyvňujú čas.
Použite primeraný počet validačných príkladov a parameter eval_samples. Nevykonávajte validáciu častejšie, než je potrebné.
Vyberte najmenší hodnotiaci model, ktorý spĺňa vaše požiadavky na kvalitu.
Dbajte na efektívnosť vlastných hodnotiacich systémov v Pythone.
Úpravou parametra compute_multiplier vyvážte rýchlosť konvergencie a náklady.
Sledujte spustenie na ovládacom paneli alebo cez API. Spustenie môžete kedykoľvek pozastaviť alebo zrušiť.
Príklady
Úspešné spustenie tréningu
| Čas tréningu | Fakturovaný čas | Stav | Opis |
|---|---|---|---|
| 00:00 | 00:00 | – | Používateľ vytvorí úlohu RFT cez API |
| 00:10 | 00:00 | VALIDATING_FILES | 10 minút strávených overovaním množiny údajov |
| 00:30 | 00:00 | VALIDATING_FILES | 20 minút vykonávania bezpečnostných kontrol množiny údajov |
| 01:00 | 00:00 | QUEUED | 30 minút čakania na dostupného pracovníka |
| 01:30 | 00:00 | RUNNING | 30 minút nastavovania tréningu (sťahovanie váh, predspracovanie atď.) |
| 05:30 | 04:00 | RUNNING | 4 hodiny strávené tréningom |
| 06:00 | 04:00 | RUNNING | 30 minút vykonávania bezpečnostných vyhodnotení výsledného modelu |
| 06:00 | 04:00 | SUCCEEDED | Tréning sa dokončí |
V tomto prípade je celkový reálny čas 6 hodín, ale fakturovateľné sú iba 4 hodiny. Cena by bola 4 hodiny × $100/hodinu = $400.
Príklad zlyhanej úlohy
V tomto príklade sa spustenie trénuje 2 hodiny, zapíše kontrolný bod, trénuje sa ešte 1 hodinu, ale potom zlyhá. Fakturovateľné sú iba 2 hodiny tréningu po kontrolný bod.
| Čas tréningu | Fakturovaný čas | Stav | Opis |
|---|---|---|---|
| 00:00 | 00:00 | – | Používateľ vytvorí úlohu RFT cez API |
| 00:10 | 00:00 | VALIDATING_FILES | 10 minút strávených overovaním množiny údajov |
| 00:30 | 00:00 | VALIDATING_FILES | 20 minút vykonávania bezpečnostných kontrol množiny údajov |
| 01:00 | 00:00 | QUEUED | 30 minút čakania na dostupného pracovníka |
| 01:30 | 00:00 | RUNNING | 30 minút nastavovania tréningu (sťahovanie váh, predspracovanie atď.) |
| 03:30 | 02:00 | RUNNING | 2 hodiny strávené tréningom |
| 03:30 | 02:00 | RUNNING | Kontrolný bod vytvorený v kroku 5 |
| 04:30 | 02:00 | RUNNING | Tréning zlyhá pre internú chybu v kroku 8 (po ďalšej 1 hodine) |
| 04:30 | 02:00 | RUNNING | 30 minút vyhodnocovania a overovania kontrolného bodu |
| 04:30 | 02:00 | SUCCEEDED | Úloha sa dokončí (s najnovším kontrolným bodom) |
Aj keď sa tréningom strávili celkovo 3 hodiny, iba 2 hodiny sú „zachytené“ v použiteľnom kontrolnom bode a fakturujú sa. Za hodinu tréningovej práce stratenú v dôsledku zlyhania nenesiete zodpovednosť. Cena by bola 2 hodiny × $100/hodinu = $200.
Často kladené otázky
Kedy mi bude účtovaný poplatok?
Poplatok účtujeme po dokončení, pozastavení, zrušení alebo zlyhaní spustenia. Každé vyúčtovanie zahŕňa prácu vykonanú od predchádzajúceho vyúčtovania.
Platím, ak spustenie zlyhá?
Ak spustenie zlyhá v dôsledku našej chyby a stratí sa akákoľvek nedávna tréningová práca, za stratenú časť vám neúčtujeme poplatok. Ak spustenie zrušíte, účtujeme vám prácu vykonanú do zrušenia.
Ako sa fakturujú tokeny modelov hodnotiteľov?
Počítame tokeny použité všetkými modelovými hodnotiteľmi, ktorých nakonfigurujete. Po dokončení tréningu tieto tokeny fakturujeme podľa našich štandardných sadzieb za token.
Môžem spustenie pozastaviť a obnoviť?
Áno. Keď spustenie pozastavíte, uložíme kontrolný bod a zaúčtujeme prácu vykonanú dovtedy. Keď spustenie obnovíte, účtovať sa vám bude iba dodatočná práca vykonaná po obnovení.
Ak máte ďalšie otázky o fakturácii Reinforcement Fine‑Tuning, kontaktujte náš tím podpory.
