OpenAI
Šo lapu tulkoja mašīntulks. Skatīt oriģinālo rakstu angļu valodā.

Norēķinu ceļvedis Reinforcement Fine-Tuning API

Kā darbojas RFT API norēķini

Atjaunināts: 7 days ago

Kā darbojas norēķini par RFT

Reinforcement Fine‑Tuning (RFT) ļauj optimizēt OpenAI spriestspējas modeļu veiktspēju, izmantojot stimulēto mācīšanos. Atšķirībā no mūsu piedāvātās pārraudzītās vai preferenču smalkregulēšanas, par ko tiek iekasēta maksa pēc tekstvienību skaita apmācības datu kopā, RFT maksa tiek aprēķināta pēc laika, ko jūsu apmācības izpilde pavada, veicot galveno mašīnmācīšanās darbu.

Šajā ceļvedī ir skaidrots, kas tiek uzskatīts par apmaksājamu apmācības laiku, kā mēs apstrādājam pauzes un atcelšanu un kā jūsu konfigurācijas izvēles var ietekmēt izmaksas.

Cenas

  • Aprēķini: $100 par stundu kalendārā laika, kas pavadīts galvenajā apmācības ciklā modelim o4-mini-2025-04-16. Maksa tiek aprēķināta proporcionāli sekundēm un rēķinā noapaļota līdz divām zīmēm aiz komata (piem., 2,55 stundas).

  • Vērtētāju modeļu lietojums: ja apmācības laikā izvadu “vērtēšanai” izmantojat OpenAI modeli, šo vērtēšanas izsaukumu patērētās tekstvienības pēc apmācības pabeigšanas tiek izrakstītas atsevišķi pēc mūsu standarta API likmēm.

Mēs iekasējam maksu tikai par apmācības darbu, kas faktiski atjaunina jūsu modeli (to mēs saucam par “fiksētu tālāku progresu”).

Par ko mēs iekasējam maksu

Mēs iekasējam maksu par laiku, ko jūsu apmācības darba process pavada, aktīvi apmācot jūsu modeli, konkrēti:

  • Paraugu ģenerēšana no jūsu modeļa precizēšanas procesā (zināma kā “rollouts”)

  • Šo izvadu novērtēšana ar vienu vai vairākiem vērtētājiem, kurus esat definējis darbam (uzziniet vairāk par vērtētājiem)

  • Svara atjauninājumu aprēķināšana un piemērošana, balstoties uz vērtējumiem (atpakaļizplatīšana).

  • Jebkuru konfigurēto validācijas (novērtēšanas) darbību veikšana.

Lielāko daļu vērtētāju var darbināt “bez maksas”, kas nozīmē, ka mēs neiekasējam papildu maksu par to lietošanu ārpus laika, ko tie pievieno galvenajam apmācības ciklam. Izņēmums ir modeļu vērtētāji, kuriem mēs arī saskaitām tekstvienības, ko šie vērtētāji patērē iepriekš minēto darbību laikā. Šīs tekstvienības jūsu rēķinā tiek parādītas kā atsevišķa pozīcija. Tekstvienības, ko patērē modeļu vērtētāji, tiek rēķinātas pēc parastajām inferencēšanas likmēm (OpenAI cenas).

Par ko mēs NEizrakstām maksu

Mēs neiekasējam maksu par laiku, kas pavadīts:

  • validējot vai pārbaudot jūsu datukopu pirms apmācības sākuma.

  • veicot jūsu datukopas drošības pārbaudes.

  • gaidot rindā uz aprēķinu resursiem.

  • lejupielādējot modeļa svarus vai datukopas.

  • sagatavojot (renderējot) jūsu datukopu mūsu apmācības formātā.

  • veicot jūsu precīzi pielāgotā modeļa pēcapmācības drošības novērtējumus.

Ja apmācības darbs tiek zaudēts kļūdas dēļ mūsu pusē (piemēram, ja darba process avarē un tam jāatgriežas pie iepriekšēja kontrolpunkta), maksa par zaudēto aprēķinu laiku vai vērtētāju tekstvienībām netiek iekasēta. Plašāka informācija par to ir nākamajā sadaļā.

Fiksēts tālākais progress un norēķinu notikumi

Apmācība sastāv no daudziem maziem jūsu modeļa atjauninājumiem. Mēs izsekojam, cik daudzi no šiem atjauninājumiem tiek sekmīgi pabeigti. Maksa ir balstīta uz aprēķinu laiku un vērtētāju tekstvienībām, kas saistītas ar šiem sekmīgajiem atjauninājumiem.

Mēs piemērojam maksu, kad notiek viens no šiem “norēķinu notikumiem”:

  • Apmācība tiek sekmīgi pabeigta.

  • Jūs apturat apmācību.

  • Jūs atceļat apmācību.

  • Apmācība neizdodas.

Katra maksa sedz papildu darbu, kas veikts kopš pēdējās maksas piemērošanas. Piemēram:

  • Ja apturat izpildi, mēs saglabājam kontrolpunktu un iekasējam maksu par aprēķinu laiku un vērtētāju tekstvienībām, kas izmantotas kopš pēdējās maksas piemērošanas.

  • Kad atsākat, apmācība turpinās no kontrolpunkta. Nākamā maksa (pēc pabeigšanas, citas apturēšanas, atcelšanas vai kļūmes) segs tikai papildu darbu, kas veikts pēc atsākšanas.

  • Ja atceļat izpildi, mēs iekasējam maksu par darbu, kas veikts līdz atcelšanai.

  • Ja apmācība neizdodas un darbs kopš pēdējās maksas piemērošanas tiek zaudēts, maksa par zaudēto daļu netiek iekasēta.

Šī “fiksētā tālākā progresa” pieeja nodrošina, ka maksājat tikai par darbu, kas tiek saglabāts jūsu modelī vai ko jūs apzināti pametat.

Darba progresa skatīšana

RFT darbiem ir lauks usage_metrics, kas dokumentē darba kopējo lietojumu līdz pašreizējam solim. Tas ietver apmācībai pavadīto laiku un visas tekstvienības, ko izmantojuši visi darba modeļu vērtētāji. Šo lauku var pārbaudīt, izmantojot API (GET /v1/fine_tuning/jobs/{job_id}) vai precizēšanas informācijas paneli.

Faktori, kas ietekmē apmācības laiku

Tā kā maksa ir balstīta uz laiku, jūsu konfigurācijas izvēles tieši ietekmē izmaksas. Galvenie faktori ir:

  • Uzdevuma grūtība: ja jūsu datukopu veido sarežģīti uzdevumi, modelis, visticamāk, pavadīs vairāk laika, spriežot par katru uzdevumu, kas palielina laiku, kas nepieciešams katra parauga izveidei.

  • Aprēķinu intensitāte: hiperparametrs compute_multiplier nosaka, cik daudz aprēķinu veicat katrā apmācības solī. Lielākas vērtības mudina modeli izvērstāk spriest par katru datu punktu, tādēļ katrs solis tiek izpildīts lēnāk.

  • Validācijas iestatījumi:

    • Lielāka validācijas kopa palielina vērtēšanai patērēto laiku.

    • Palielinot eval_samples (vienam validācijas piemēram vērtēto modeļa izvadu skaitu), palielinās validācijas laiks.

    • Biežāka validācijas palaišana (mazāks eval_interval) palielina validācijai patērētā laika īpatsvaru.

  • Vērtētāja veiktspēja:

    • Lielākiem vai jaudīgākiem vērtētāju modeļiem atzīmes atgriešanai nepieciešams vairāk laika nekā mazākiem. Piemēram, vērtēšana ar spriestspējas modeli var aizņemt 10x ilgāk nekā vērtēšana ar modeli bez spriestspējas.

    • Sarežģītām Python vērtēšanas funkcijām izpilde aizņem vairāk laika nekā vienkāršām.

Šie iestatījumi ļauj līdzsvarot izmaksas, ātrumu un modeļa kvalitāti. Piemēram, bieža validācija var agrāk atklāt problēmas, taču palielina izmaksas. Vērtēšana ar modernāku modeli var ievērojami uzlabot vērtēšanas precizitāti, taču palēninās katru vērtēšanas soli un sadārdzinās darbus.

Izmaksu pārvaldība

Lai kontrolētu savus izdevumus:

  • Sāciet ar īsākām izpildēm, lai saprastu, kā jūsu konfigurācija ietekmē laiku.

  • Izmantojiet saprātīgu validācijas piemēru skaitu un eval_samples. Izvairieties validēt biežāk, nekā nepieciešams.

  • Izvēlieties mazāko vērtētāja modeli, kas atbilst jūsu kvalitātes prasībām.

  • Gādājiet, lai pielāgotie Python vērtētāji būtu efektīvi.

  • Pielāgojiet compute_multiplier, lai līdzsvarotu konverģences ātrumu un izmaksas.

  • Pārraugiet savu izpildi informācijas panelī vai ar API. Jūs jebkurā laikā varat to apturēt vai atcelt.

Piemēri

Veiksmīga apmācības izpilde

Apmācības laiksRēķinā iekļautais laiksStatussApraksts
00:0000:00Lietotājs izveido RFT darbu, izmantojot API
00:1000:00VALIDATING_FILES10 minūtes veltītas datu kopas validēšanai
00:3000:00VALIDATING_FILES20 minūtes tiek veiktas datu kopas drošības pārbaudes
01:0000:00QUEUED30 minūtes jāgaida pieejams darba process
01:3000:00RUNNING30 minūtes apmācības iestatīšanai (svaru lejupielāde, priekšapstrāde u. c.)
05:3004:00RUNNING4 stundas veltītas apmācībai
06:0004:00RUNNING30 minūtes tiek veikti iegūtā modeļa drošības novērtējumi
06:0004:00SUCCEEDEDApmācība tiek pabeigta

Šajā gadījumā kopējais reālais laiks ir 6 stundas, bet apmaksājamas ir tikai 4 stundas. Izmaksas būtu 4 stundas × $100/stundā = $400.

Neizdevušos darbu piemērs

Šajā piemērā izpilde apmāca 2 stundas, ieraksta kontrolpunktu, apmāca vēl 1 stundu, bet pēc tam neizdodas. Apmaksājamas ir tikai 2 apmācības stundas līdz kontrolpunktam.

Apmācības laiksRēķinā iekļautais laiksStatussApraksts
00:0000:00Lietotājs izveido RFT darbu, izmantojot API
00:1000:00VALIDATING_FILES10 minūtes veltītas datu kopas validēšanai
00:3000:00VALIDATING_FILES20 minūtes tiek veiktas datu kopas drošības pārbaudes
01:0000:00QUEUED30 minūtes jāgaida pieejams darba process
01:3000:00RUNNING30 minūtes apmācības iestatīšanai (svaru lejupielāde, priekšapstrāde u. c.)
03:3002:00RUNNING2 stundas veltītas apmācībai
03:3002:00RUNNINGKontrolpunkts izveidots 5. solī
04:3002:00RUNNINGApmācība neizdodas iekšējas kļūdas dēļ 8. solī (pēc vēl 1 stundas)
04:3002:00RUNNING30 minūtes kontrolpunkta novērtēšanai un validēšanai
04:3002:00SUCCEEDEDDarbs tiek pabeigts (ar jaunāko kontrolpunktu)

Lai gan apmācībai kopumā tika veltītas 3 stundas, tikai 2 stundas ir „ietvertas” izmantojamā kontrolpunktā un tiek iekļautas rēķinā. Par apmācības darba stundu, kas zaudēta kļūmes dēļ, jūs neesat atbildīgs. Izmaksas būtu 2 stundas × $100/stundā = $200.

Biežāk uzdotie jautājumi

Kad man tiek piemērota maksa?

Mēs izrakstām rēķinu, kad jūsu izpilde ir pabeigta, apturēta, atcelta vai neizdodas. Katrs rēķins sedz darbu, kas paveikts kopš iepriekšējā rēķina.

Vai man jāmaksā, ja izpilde neizdodas?

Ja izpilde neizdodas mūsu kļūdas dēļ un tiek zaudēts nesens apmācības darbs, par zaudēto daļu maksa netiek piemērota. Ja atceļat izpildi, no jums tiek iekasēta maksa par darbu līdz atcelšanai.

Kā tiek rēķinātas vērtētāju modeļu tekstvienības?

Mēs skaitām tekstvienības, ko izmanto jebkuri jūsu konfigurētie modeļu vērtētāji. Pēc apmācības pabeigšanas mēs rēķinām šīs tekstvienības pēc mūsu standarta likmēm par tekstvienību.

Vai varu apturēt un atsākt izpildi?

Jā. Kad apturat, mēs saglabājam kontrolpunktu un iekasējam maksu par līdz šim paveikto darbu. Kad atsākat, no jums tiks iekasēta maksa tikai par papildu darbu, kas paveikts pēc atsākšanas.

Ja jums ir citi jautājumi par Reinforcement Fine‑Tuning norēķiniem, sazinieties ar mūsu atbalsta komandu.

Vai šis raksts bija noderīgs?