OpenAI
Šis puslapis buvo išverstas mašininiu būdu. Peržiūrėti originalų straipsnį anglų kalba.

Reinforcement Fine Tuning API atsiskaitymo vadovas

Kaip veikia RFT API atsiskaitymas

Atnaujinta: 16 days ago

Kaip veikia RFT atsiskaitymas

Reinforcement Fine‑Tuning (RFT) leidžia optimizuoti OpenAI protavimo modelių našumą naudojant skatinamąjį mokymąsi. Kitaip nei mūsų prižiūrimojo ar pagal nuostatas atliekamo tikslinimo pasiūlymai, už kuriuos apmokestinama pagal žetonų skaičių mokymo duomenų rinkinyje, RFT apmokestinamas pagal laiką, kurį jūsų mokymo vykdymas praleidžia atlikdamas pagrindinius mašininio mokymosi darbus.

Šiame vadove paaiškinama, kas laikoma apmokestinamu mokymo laiku, kaip tvarkome pristabdymus ir atšaukimus ir kaip jūsų konfigūracijos pasirinkimai gali paveikti kainą.

Kainodara

  • Skaičiavimai: 100 USD už kiekvieną faktinio laiko valandą, kurią o4-mini-2025-04-16 praleidžia pagrindiniame mokymo cikle. Mokesčiai proporcingai apskaičiuojami sekundės tikslumu, o sąskaitoje suapvalinami iki dviejų skaitmenų po kablelio (pvz., 2,55 val.).

  • Vertinimo modelio naudojimas: jei mokymo metu išvestims „vertinti“ naudojate OpenAI modelį, šių vertinimo užklausų sunaudoti žetonai, baigus mokymą, apmokestinami atskirai pagal standartinius mūsų API įkainius.

Mokestį imame tik už tuos mokymo darbus, kuriais iš tikrųjų atnaujinamas jūsų modelis (tai vadiname „užfiksuota realia pažanga“).

Už ką apmokestiname

Apmokestiname laiką, kurį jūsų mokymo darbuotojas praleidžia aktyviai mokydamas jūsų modelį, konkrečiai:

  • Pavyzdžių generavimas iš jūsų modelio tiksliojo derinimo proceso metu (vadinamieji „rollouts“)

  • Tų išvesčių vertinimas vienu ar daugiau vertintojų, kuriuos apibrėžėte užduotyje (sužinokite daugiau apie vertintojus)

  • Svorių atnaujinimų skaičiavimas ir taikymas pagal įvertinimus (atgalinis skleidimas).

  • Bet kokių jūsų sukonfigūruotų validavimo (vertinimo) veiksmų vykdymas.

Dauguma vertintojų veikia „nemokamai“, tai reiškia, kad už jų naudojimą papildomai neapmokestiname, išskyrus laiką, kuriuo jie prisideda prie pagrindinio mokymo ciklo. Išimtis taikoma modelio vertintojams: taip pat suskaičiuojame žetonus, kuriuos tie vertintojai sunaudoja per pirmiau nurodytas veiklas. Šie žetonai jūsų sąskaitoje pateikiami kaip atskira eilutė. Modelio vertintojų sunaudoti žetonai apmokestinami įprastais išvedimo tarifais (OpenAI kainodara).

Už ką mokesčio NESKAIČIUOJAME

Mokesčio neskaičiuojame už laiką, skirtą:

  • Jūsų duomenų rinkinio validavimui arba tikrinimui prieš pradedant mokymą.

  • Jūsų duomenų rinkinio saugos patikroms.

  • Laukimui eilėje skaičiavimo išteklių.

  • Modelio svorių arba duomenų rinkinių atsisiuntimui.

  • Jūsų duomenų rinkinio paruošimui (atvaizdavimui) į mūsų mokymo formatą.

  • Po mokymo atliekamiems jūsų tiksliai suderinto modelio saugos vertinimams.

Jei mokymo darbas prarandamas dėl klaidos mūsų pusėje (pavyzdžiui, jei vykdytojas sugenda ir turi grįžti prie ankstesnio kontrolinio taško), už prarastą skaičiavimo laiką ar vertintojo žetonus mokestis neskaičiuojamas. Daugiau informacijos apie tai pateikiama kitame skyriuje.

Užfiksuota pažanga pirmyn ir atsiskaitymo įvykiai

Mokymą sudaro daug mažų jūsų modelio atnaujinimų. Sekame, kiek šių atnaujinimų sėkmingai užbaigiama. Mokesčiai grindžiami skaičiavimo laiku ir vertintojo žetonais, susijusiais su šiais sėkmingais atnaujinimais.

Mokestį pritaikome, kai įvyksta vienas iš šių „atsiskaitymo įvykių“:

  • Mokymas sėkmingai užbaigiamas.

  • Jūs pristabdote mokymą.

  • Jūs atšaukiate mokymą.

  • Mokymas nepavyksta.

Kiekvienas mokestis apima prieauginį darbą, atliktą nuo paskutinio mokesčio pritaikymo. Pavyzdžiui:

  • Jei pristabdote vykdymą, išsaugome kontrolinį tašką ir apmokestiname skaičiavimo laiką bei vertintojo žetonus, panaudotus nuo paskutinio mokesčio pritaikymo.

  • Kai atnaujinate, mokymas tęsiamas nuo kontrolinio taško. Kitas mokestis (užbaigus, vėl pristabdžius, atšaukus arba įvykus nesėkmei) apims tik papildomą darbą, atliktą po atnaujinimo.

  • Jei atšaukiate vykdymą, apmokestiname už darbą, atliktą iki atšaukimo.

  • Jei mokymas nepavyksta ir nuo paskutinio mokesčio pritaikymo atliktas darbas prarandamas, už prarastą dalį mokestis neskaičiuojamas.

Šis „užfiksuotos pažangos pirmyn“ metodas užtikrina, kad mokate tik už darbą, kuris išlieka jūsų modelyje arba kurio sąmoningai atsisakote.

Užduoties eigos peržiūra

RFT užduotyse yra laukas usage_metrics, kuriame fiksuojamas bendras užduoties išteklių naudojimas iki dabartinio žingsnio. Tai apima mokymui skirtą laiką ir visus žetonus, kuriuos vykdant užduotį sunaudojo visi vertinimo modeliai. Šį lauką galima patikrinti per API (GET /v1/fine_tuning/jobs/{job_id}) arba tikslinimo valdymo skydelyje.

Mokymo trukmei įtakos turintys veiksniai

Kadangi mokestis priklauso nuo laiko, jūsų konfigūracijos pasirinkimai tiesiogiai veikia išlaidas. Pagrindiniai veiksniai:

  • Uždavinių sudėtingumas: jei jūsų duomenų rinkinį sudaro sudėtingi uždaviniai, modelis veikiausiai ilgiau protauja spręsdamas kiekvieną iš jų, todėl kiekvienam pavyzdžiui sugeneruoti reikia daugiau laiko.

  • Skaičiavimo intensyvumas: hipertechninis parametras compute_multiplier nustato, kiek skaičiavimų atliekama per kiekvieną mokymo žingsnį. Didesnės reikšmės skatina modelį išsamiau samprotauti apie kiekvieną duomenų įrašą, todėl kiekvienas žingsnis trunka ilgiau.

  • Validavimo nustatymai:

  • Vertintojų našumas:

  • Didesniems ar pajėgesniems vertinimo modeliams įverčiui pateikti reikia daugiau laiko nei mažesniems. Pavyzdžiui, vertinimas protavimo modeliu gali trukti 10 kartų ilgiau nei vertinimas ne protavimo modeliu.

  • Sudėtingos „Python“ vertinimo funkcijos vykdomos ilgiau nei paprastos.

Šie nustatymai leidžia pasirinkti tinkamą išlaidų, spartos ir modelio kokybės pusiausvyrą. Pavyzdžiui, dažnas validavimas padeda anksčiau aptikti problemas, tačiau padidina išlaidas. Pažangesnis vertinimo modelis gali gerokai padidinti vertinimo tikslumą, tačiau sulėtina kiekvieną vertinimo žingsnį ir padidina užduočių kainą.

Išlaidų valdymas

Kaip kontroliuoti išlaidas:

  • Pradėkite nuo trumpesnių vykdymų, kad suprastumėte, kaip konfigūracija veikia trukmę.

  • Naudokite pagrįstą validavimo pavyzdžių ir eval_samples skaičių. Neatlikite validavimo dažniau, nei būtina.

  • Rinkitės mažiausią jūsų kokybės reikalavimus atitinkantį vertinimo modelį.

  • Pasirūpinkite, kad pasirinktiniai „Python“ vertintojai veiktų efektyviai.

  • Koreguokite compute_multiplier, kad subalansuotumėte konvergencijos spartą ir išlaidas.

  • Stebėkite vykdymą valdymo skydelyje arba per API. Bet kada galite jį pristabdyti arba atšaukti.

Pavyzdžiai

Sėkmingas mokymo vykdymas

Mokymo laikasApmokestintas laikasBūsenaAprašas
00:0000:00Naudotojas sukuria RFT užduotį per API
00:1000:00VALIDATING_FILES10 minučių skirta duomenų rinkiniui tikrinti
00:3000:00VALIDATING_FILES20 minučių vykdyti duomenų rinkinio saugos patikrinimai
01:0000:00QUEUED30 minučių laukta laisvo darbuotojo
01:3000:00RUNNING30 minučių nustatytas mokymas (atsisiųsti svoriai, atliktas išankstinis apdorojimas ir kt.)
05:3004:00RUNNING4 valandos skirtos mokymui
06:0004:00RUNNING30 minučių vykdyti gauto modelio saugos vertinimai
06:0004:00SUCCEEDEDMokymas baigiamas

Šiuo atveju bendras faktinis laikas yra 6 valandos, bet apmokestinamos tik 4 valandos. Kaina būtų 4 valandos × 100 USD/val. = 400 USD.

Nepavykusios užduoties pavyzdys

Šiame pavyzdyje vykdymas mokomas 2 valandas, įrašo kontrolinį tašką, mokomas dar 1 valandą, bet tada nepavyksta. Apmokestinamos tik 2 mokymo valandos iki kontrolinio taško.

Mokymo laikasApmokestintas laikasBūsenaAprašas
00:0000:00Naudotojas sukuria RFT užduotį per API
00:1000:00VALIDATING_FILES10 minučių skirta duomenų rinkiniui tikrinti
00:3000:00VALIDATING_FILES20 minučių vykdyti duomenų rinkinio saugos patikrinimai
01:0000:00QUEUED30 minučių laukta laisvo darbuotojo
01:3000:00RUNNING30 minučių nustatytas mokymas (atsisiųsti svoriai, atliktas išankstinis apdorojimas ir kt.)
03:3002:00RUNNING2 valandos skirtos mokymui
03:3002:00RUNNINGKontrolinis taškas sukurtas 5 veiksme
04:3002:00RUNNINGMokymas nepavyksta dėl vidinės klaidos 8 veiksme (po dar 1 valandos)
04:3002:00RUNNING30 minučių vertintas ir validuotas kontrolinis taškas
04:3002:00SUCCEEDEDUžduotis baigiama (su naujausiu kontroliniu tašku)

Nors iš viso mokymui buvo skirtos 3 valandos, tik 2 valandos yra "užfiksuotos" naudojamame kontroliniame taške ir apmokestinamos. Už dėl gedimo prarastą mokymo darbo valandą jūs neatsakote. Kaina būtų 2 valandos × 100 USD/val. = 200 USD.

Dažnai užduodami klausimai

Kada turiu mokėti?

Sąskaitą išrašome, kai vykdymas baigiamas, pristabdomas, atšaukiamas arba nepavyksta. Kiekviena sąskaita apima nuo ankstesnės sąskaitos atliktus darbus.

Ar moku, jei vykdymas nepavyksta?

Jei vykdymas nepavyksta dėl mūsų klaidos ir prarandamas bet koks nesenas mokymo darbas, už prarastą dalį neapmokestiname. Jei atšaukiate vykdymą, apmokestiname už darbą iki atšaukimo.

Kaip apmokestinami vertintojų modelio žetonai?

Skaičiuojame žetonus, kuriuos naudoja visi jūsų sukonfigūruoti modelio vertintojai. Pasibaigus mokymui, šiuos žetonus apmokestiname standartiniais tarifais už žetoną.

Ar galiu pristabdyti ir tęsti vykdymą?

Taip. Kai pristabdote, išsaugome kontrolinį tašką ir apmokestiname už iki tol atliktą darbą. Kai tęsiate, būsite apmokestinti tik už papildomą darbą, atliktą po tęsimo.

Jei turite kitų klausimų apie Reinforcement Fine‑Tuning atsiskaitymą, susisiekite su mūsų pagalbos komanda.

Ar šis straipsnis buvo naudingas?