OpenAI
Tato stránka byla přeložena strojově. Zobrazit původní článek v angličtině.

Příručka k účtování pro API Reinforcement Fine-Tuning

Jak funguje účtování pro API RFT

Aktualizováno: 3 days ago

Jak funguje fakturace za RFT

Reinforcement Fine‑Tuning (RFT) umožňuje optimalizovat výkon modelů OpenAI s uvažováním pomocí učení posilováním. Na rozdíl od našich nabídek supervised fine‑tuningu nebo preference fine‑tuningu, které se účtují podle počtu tokenů v trénovací datové sadě, se RFT účtuje podle času, který váš trénovací běh stráví prováděním hlavní práce strojového učení.

Tato příručka vysvětluje, co se započítává do zpoplatněného času trénování, jak řešíme pozastavení a zrušení a jak mohou vaše volby konfigurace ovlivnit cenu.

Ceny

  • Výpočetní výkon: 100 USD za hodinu skutečného času stráveného v hlavní trénovací smyčce modelu o4-mini-2025-04-16. Poplatky se poměrně počítají na sekundy a na faktuře se zaokrouhlují na dvě desetinná místa (např. 2,55 hodiny).

  • Využití hodnoticího modelu: Pokud během trénování používáte model OpenAI k „hodnocení“ výstupů, tokeny spotřebované při těchto voláních se po dokončení trénování účtují samostatně podle našich standardních sazeb za API.

Účtujeme pouze trénovací práci, která skutečně aktualizuje váš model (říkáme jí „zachycený skutečný pokrok“).

Za co účtujeme

Účtujeme za čas, který váš trénovací worker stráví aktivním trénováním vašeho modelu, konkrétně:

  • Generování vzorků z vašeho modelu během procesu doladění (tzv. „rollouty“)

  • Vyhodnocování těchto výstupů jedním nebo více hodnotiteli, které jste v úloze definovali (další informace o hodnotitelích)

  • Výpočet a použití aktualizací vah na základě hodnocení (zpětné šíření).

  • Spouštění všech kroků validace (evaluace), které jste nakonfigurovali.

Většinu hodnotitelů lze spouštět „zdarma“, což znamená, že za jejich použití neúčtujeme nic navíc mimo dobu, kterou přispívají k hlavní trénovací smyčce. Výjimkou jsou modeloví hodnotitelé, u kterých také sčítáme tokeny, které tito hodnotitelé během výše uvedených aktivit spotřebují. Tyto tokeny se na vaší faktuře zobrazí jako samostatná položka. Tokeny spotřebované modelovými hodnotiteli jsou účtovány podle běžných sazeb za inferenci (ceny OpenAI).

Za co NEúčtujeme

Neúčtujeme čas strávený:

  • Validací nebo kontrolou vaší datové sady před zahájením trénování.

  • Bezpečnostními kontrolami vaší datové sady.

  • Čekáním ve frontě na výpočetní prostředky.

  • Stahováním vah modelu nebo datových sad.

  • Přípravou (renderováním) vaší datové sady do našeho trénovacího formátu.

  • Bezpečnostním vyhodnocováním vašeho fine-tunovaného modelu po trénování.

Pokud se trénovací práce ztratí kvůli chybě na naší straně (například pokud pracovní proces havaruje a musí se vrátit k předchozímu checkpointu), za ztracený výpočetní čas ani tokeny hodnotitelů vám nic neúčtujeme. Více podrobností o tom najdete v další části.

Zachycený průběžný pokrok a fakturační události

Trénování se skládá z mnoha malých aktualizací modelu. Sledujeme, kolik z těchto aktualizací se úspěšně dokončí. Poplatky vycházejí z výpočetního času a tokenů hodnotitelů spojených s těmito úspěšnými aktualizacemi.

Poplatek účtujeme, když nastane jedna z následujících „fakturačních událostí“:

  • Trénování se úspěšně dokončí.

  • Trénování pozastavíte.

  • Trénování zrušíte.

  • Trénování selže.

Každý poplatek pokrývá přírůstkovou práci provedenou od posledního poplatku. Například:

  • Pokud běh pozastavíte, uložíme checkpoint a naúčtujeme vám výpočetní čas a tokeny hodnotitelů použité od posledního poplatku.

  • Když obnovíte běh, trénování pokračuje z checkpointu. Další poplatek (při dokončení, dalším pozastavení, zrušení nebo selhání) bude pokrývat jen dodatečnou práci provedenou po obnovení.

  • Pokud běh zrušíte, účtujeme vám práci provedenou do okamžiku zrušení.

  • Pokud trénování selže a práce od posledního poplatku se ztratí, za ztracenou část vám nic neúčtujeme.

Tento přístup „zachyceného průběžného pokroku“ zajišťuje, že platíte jen za práci, která ve vašem modelu zůstane nebo kterou záměrně opustíte.

Sledování průběhu úlohy

Úlohy RFT obsahují pole usage_metrics, které zaznamenává celkové využití úlohy až do aktuálního kroku. To zahrnuje čas strávený trénováním a všechny tokeny využité všemi hodnoticími modely v rámci úlohy. Toto pole si můžete prohlédnout prostřednictvím API (GET /v1/fine_tuning/jobs/{job_id}) nebo na řídicím panelu dolaďování.

Faktory ovlivňující dobu trénování

Protože se cena odvíjí od času, vaše nastavení přímo ovlivňuje náklady. Mezi hlavní faktory patří:

  • Obtížnost problémů: pokud datová sada obsahuje obtížné problémy, model bude nad každým z nich pravděpodobně déle uvažovat, takže vytvoření jednotlivých vzorků zabere více času.

  • Výpočetní náročnost: hyperparametr compute_multiplier určuje množství výpočtů prováděných v každém kroku trénování. Vyšší hodnoty vedou model k podrobnějšímu uvažování nad každým datovým bodem, takže jednotlivé kroky trvají déle.

  • Nastavení validace:

  • Výkon hodnoticího systému:

  • Větším nebo schopnějším hodnoticím modelům trvá vrácení hodnocení déle než menším modelům. Například hodnocení pomocí modelu s uvažováním může trvat desetkrát déle než hodnocení pomocí modelu bez uvažování.

  • Spuštění složitých hodnoticích funkcí v Pythonu trvá déle než spuštění jednoduchých funkcí.

Tato nastavení umožňují vyvažovat náklady, rychlost a kvalitu modelu. Častá validace může například odhalit problémy dříve, ale zvyšuje náklady. Hodnocení pomocí pokročilejšího modelu může výrazně zvýšit přesnost, ale zpomalí každý krok hodnocení a prodraží úlohy.

Řízení nákladů

Jak udržet výdaje pod kontrolou:

  • Začněte kratšími běhy, abyste zjistili, jak vaše nastavení ovlivňuje dobu trvání.

  • Používejte přiměřený počet validačních příkladů a hodnotu eval_samples. Neprovádějte validaci častěji, než je nutné.

  • Zvolte nejmenší hodnoticí model, který splňuje vaše požadavky na kvalitu.

  • Dbejte na efektivitu vlastních hodnoticích nástrojů v Pythonu.

  • Úpravou parametru compute_multiplier vyvažte rychlost konvergence a náklady.

  • Sledujte běh na řídicím panelu nebo prostřednictvím API. Běh můžete kdykoli pozastavit nebo zrušit.

Příklady

Úspěšný trénovací běh

Doba trénováníÚčtovaná dobaStavPopis
00:0000:00Uživatel vytvoří úlohu RFT přes API
00:1000:00VALIDATING_FILES10 minut strávených ověřováním datové sady
00:3000:00VALIDATING_FILES20 minut provádění bezpečnostních kontrol datové sady
01:0000:00QUEUED30 minut čekání na dostupného workera
01:3000:00RUNNING30 minut nastavování trénování (stahování vah, předzpracování atd.)
05:3004:00RUNNING4 hodiny strávené trénováním
06:0004:00RUNNING30 minut provádění bezpečnostních evaluací výsledného modelu
06:0004:00SUCCEEDEDTrénování se dokončí

V tomto případě je celkový uplynulý čas 6 hodin, ale účtovatelné jsou pouze 4 hodiny. Cena by byla 4 hodiny × $100/hodinu = $400.

Příklad neúspěšné úlohy

V tomto příkladu se běh trénuje 2 hodiny, zapíše kontrolní bod, trénuje se další 1 hodinu, ale poté selže. Účtovatelné jsou pouze 2 hodiny trénování do kontrolního bodu.

Doba trénováníÚčtovaná dobaStavPopis
00:0000:00Uživatel vytvoří úlohu RFT přes API
00:1000:00VALIDATING_FILES10 minut strávených ověřováním datové sady
00:3000:00VALIDATING_FILES20 minut provádění bezpečnostních kontrol datové sady
01:0000:00QUEUED30 minut čekání na dostupného workera
01:3000:00RUNNING30 minut nastavování trénování (stahování vah, předzpracování atd.)
03:3002:00RUNNING2 hodiny strávené trénováním
03:3002:00RUNNINGKontrolní bod vytvořen v kroku 5
04:3002:00RUNNINGTrénování selže kvůli interní chybě v kroku 8 (po další 1 hodině)
04:3002:00RUNNING30 minut evaluace a validace kontrolního bodu
04:3002:00SUCCEEDEDÚloha se dokončí (s nejnovějším kontrolním bodem)

I když trénování celkem trvalo 3 hodiny, v použitelném kontrolním bodu jsou „zachyceny“ a účtovány pouze 2 hodiny. Za hodinu trénovací práce ztracenou kvůli selhání nenesete odpovědnost. Cena by byla 2 hodiny × $100/hodinu = $200.

Často kladené otázky

Kdy mi bude částka naúčtována?

Částku účtujeme po dokončení, pozastavení, zrušení nebo selhání běhu. Každé vyúčtování zahrnuje práci provedenou od předchozího vyúčtování.

Platím, když běh selže?

Pokud běh selže kvůli naší chybě a ztratí se nedávná trénovací práce, ztracená část vám nebude účtována. Pokud běh zrušíte, bude vám účtována práce provedená do okamžiku zrušení.

Jak se účtují tokeny modelů hodnotitelů?

Počítáme tokeny použité všemi modelovými hodnotiteli, které nakonfigurujete. Po dokončení trénování tyto tokeny účtujeme podle našich standardních sazeb za token.

Mohu běh pozastavit a obnovit?

Ano. Při pozastavení uložíme kontrolní bod a naúčtujeme práci provedenou do té doby. Po obnovení vám bude účtována pouze další práce provedená po obnovení.

Pokud máte další otázky k fakturaci Reinforcement Fine‑Tuning, kontaktujte náš tým podpory.

Byl tento článek užitečný?