Si funksionon faturimi për RFT
Përshtatja e imët përforcuese (RFT) ju lejon të optimizoni performancën e modeleve të arsyetimit të OpenAI duke përdorur trajnim përforcues. Ndryshe nga ofertat tona për përshtatje të imët të mbikëqyrur ose sipas preferencave, të cilat faturohen sipas numrit të tokenëve në grupin e të dhënave të trajnimit, RFT faturohet bazuar në kohën që procesi juaj i trajnimit kalon duke kryer punën kryesore të mësimit makinerik.
Ky udhëzues shpjegon se çfarë llogaritet si kohë e faturueshme trajnimi, si i trajtojmë pauzat dhe anulimet, dhe si zgjedhjet e konfigurimit tuaj mund të ndikojnë në kosto.
Çmimi
Llogaritja: $100 për orë të kohës reale të shpenzuar në ciklin bazë të trajnimit për
o4-mini-2025-04-16. Tarifimi proratohet në sekondë dhe rrumbullakoset në dy shifra dhjetore në faturë (p.sh., 2.55 orë).Përdorimi i vlerësuesit model: Nëse përdorni një model OpenAI për të "vlerësuar" daljet gjatë trajnimit, token-ët e konsumuar nga ato thirrje vlerësimi faturohen veçmas me tarifat tona standarde të API-së pasi të përfundojë trajnimi.
Ne tarifojmë vetëm për punën e trajnimit që realisht përditëson model-in tuaj (atë që ne e quajmë "progres i ruajtur përpara").
Për çfarë faturojmë
Ne faturojmë për kohën që punuesi juaj i trajnimit shpenzon duke trajnuar aktivisht modelin tuaj, konkretisht:
Gjenerimi i mostrave nga modeli juaj gjatë procesit të rregullimit të imët (të njohura si “rollout-e”)
Vlerësimi i atyre daljeve me një ose më shumë vlerësues që keni përcaktuar në punë (mësoni më shumë rreth vlerësuesve)
Llogaritja dhe aplikimi i përditësimeve të peshave bazuar te notat (përhapje prapa).
Kryerja e çdo hapi validimi (vlerësimi) që keni konfiguruar.
Shumica e vlerësuesve janë “falas” për t’u ekzekutuar, që do të thotë se nuk tarifojmë shtesë për përdorimin e tyre jashtë kohës që ata i shtojnë ciklit bazë të trajnimit. Përjashtim bëjnë vlerësuesit model, ku ne numërojmë edhe tokenët që këta vlerësues konsumojnë gjatë aktiviteteve të mësipërme. Këta tokenë shfaqen si një zë më vete në faturën tuaj. Tokenët e konsumuar nga vlerësuesit model faturohen me tarifat normale të inferencës (çmimet e OpenAI).
Për çfarë NUK faturojmë
Ne nuk tarifojmë për kohën e shpenzuar:
Duke validuar ose inspektuar dataset-in tuaj përpara se të fillojë trajnimi.
Në kontrolle sigurie për dataset-in tuaj.
Duke pritur në radhë për burime llogaritëse.
Duke shkarkuar peshat e model-it ose dataset-et.
Duke përgatitur (renderuar) dataset-in tuaj në formatin tonë të trajnimit.
Në vlerësime sigurie pas trajnimit të model-it tuaj të fine-tuning.
Nëse puna e trajnimit humbet për shkak të një gabimi nga ana jonë (për shembull, nëse një worker bie dhe duhet të rikthehet te një checkpoint i mëparshëm), nuk tarifoheni për kohën e humbur të llogaritjes ose token-ët e vlerësuesit. Më shumë hollësi për këtë në seksionin tjetër.
Progresi i ruajtur përpara dhe ngjarjet e faturimit
Trajnimi përbëhet nga shumë përditësime të vogla të model-it tuaj. Ne gjurmojmë sa prej këtyre përditësimeve përfundojnë me sukses. Tarifat bazohen në kohën e llogaritjes dhe token-ët e vlerësuesit të lidhur me këto përditësime të suksesshme.
Ne lëshojmë një tarifë kur ndodh një nga "ngjarjet e faturimit" të mëposhtme:
Trajnimi përfundon me sukses.
Ju ndaloni trajnimin.
Ju anuloni trajnimin.
Trajnimi dështon.
Çdo tarifë mbulon punën shtesë të bërë që nga tarifa e fundit. Për shembull:
Nëse ndaloni një ekzekutim, ne ruajmë një checkpoint dhe ju tarifojmë për kohën e llogaritjes dhe token-ët e vlerësuesit të përdorur që nga tarifa e fundit.
Kur rifilloni, trajnimi vazhdon nga checkpoint-i. Tarifa tjetër (në përfundim, në një ndalim tjetër, anulim ose dështim) do të mbulojë vetëm punën shtesë të bërë pas rifillimit.
Nëse anuloni një ekzekutim, ju tarifojmë për punën e bërë deri në anulim.
Nëse trajnimi dështon dhe puna që nga tarifa e fundit humbet, nuk faturoheni për pjesën e humbur.
Kjo qasje e "progresit të ruajtur përpara" siguron që të paguani vetëm për punën që ruhet në model-in tuaj ose që ju e braktisni qëllimisht.
Shikimi i progresit të punës
Punët RFT kanë një fushë të quajtur usage_metrics, e cila dokumenton përdorimin total të punës deri në hapin aktual. Kjo përfshin kohën e shpenzuar për trajnim dhe të gjithë tokenët e përdorur në të gjithë vlerësuesit model në punë. Kjo fushë mund të kontrollohet përmes API-së (GET /v1/fine_tuning/jobs/{job_id}) ose përmes panelit të rregullimit të imët.
Faktorët që ndikojnë në kohën e trajnimit
Meqenëse faturimi bazohet në kohë, zgjedhjet tuaja të konfigurimit ndikojnë drejtpërdrejt në kosto. Faktorët kryesorë përfshijnë:
Vështirësia e problemit: nëse dataset-i juaj përbëhet nga probleme të vështira, model do të shpenzojë me gjasë më shumë kohë duke arsyetuar për çdo problem, gjë që rrit kohën që duhet për të prodhuar çdo mostër.
Intensiteti i llogaritjes: Hiperparametri
compute_multiplierkontrollon sa shumë llogaritje bëni për çdo hap trajnimi. Vlerat më të larta e nxisin model të arsyetojë më gjerësisht për çdo datapoint, çka bën që çdo hap të ekzekutohet më ngadalë.Cilësimet e validimit:
Një grup validimi më i madh rrit kohën e shpenzuar për vlerësim.
Rritja e
eval_samples(numri i daljeve të model-it të vlerësuara për çdo shembull validimi) rrit kohën e validimit.Ekzekutimi më i shpeshtë i validimit (vlerë më e ulët e
eval_interval) rrit përqindjen e kohës së shpenzuar në validim.
Performanca e vlerësuesit:
Vlerësuesit model më të mëdhenj ose më të aftë kërkojnë më shumë kohë për të kthyer një vlerësim sesa ata më të vegjël. Për shembull, vlerësimi me një model arsyetimi mund të zgjasë 10x më shumë sesa vlerësimi me një model jo arsyetimi.
Funksionet komplekse të vlerësimit në Python kërkojnë më shumë kohë për t’u ekzekutuar sesa ato të thjeshtat.
Këto cilësime ju lejojnë të balanconi koston, shpejtësinë dhe cilësinë e model-it. Për shembull, validimi i shpeshtë mund të kapë problemet më herët, por rrit koston. Vlerësimi me një model më të avancuar mund të përmirësojë ndjeshëm saktësinë e vlerësimit, por do të ngadalësojë çdo hap vlerësimi dhe do t’i bëjë punët më të kushtueshme.
Menaxhimi i kostos
Për të kontrolluar shpenzimet tuaja:
Filloni me ekzekutime më të shkurtra për të kuptuar si ndikon konfigurimi juaj në kohë.
Përdorni një numër të arsyeshëm shembujsh validimi dhe
eval_samples. Shmangni validimin më shpesh sesa ju nevojitet.Zgjidhni model-in më të vogël vlerësues që plotëson kërkesat tuaja të cilësisë.
Mbajini efikas vlerësuesit e personalizuar Python.
Rregulloni
compute_multiplierpër të balancuar shpejtësinë e konvergjencës dhe koston.Monitoroni ekzekutimin tuaj në panel ose përmes API-së. Mund ta ndaloni ose anuloni në çdo kohë.
Shembuj
Ekzekutim trajnimi i suksesshëm
| Koha e trajnimit | Koha e faturuar | Statusi | Përshkrimi |
|---|---|---|---|
| 00:00 | 00:00 | – | Përdoruesi krijon punë RFT përmes API-së |
| 00:10 | 00:00 | VALIDATING_FILES | 10 minuta të shpenzuara për validimin e grupit të të dhënave |
| 00:30 | 00:00 | VALIDATING_FILES | 20 minuta duke kryer kontrolle sigurie të grupit të të dhënave |
| 01:00 | 00:00 | QUEUED | 30 minuta në pritje të një punuesi të disponueshëm |
| 01:30 | 00:00 | RUNNING | 30 minuta për konfigurimin e trajnimit (shkarkimi i peshave, parapërpunimi, etj.) |
| 05:30 | 04:00 | RUNNING | 4 orë të shpenzuara për trajnim |
| 06:00 | 04:00 | RUNNING | 30 minuta duke kryer vlerësime sigurie të modelit që rezulton |
| 06:00 | 04:00 | SUCCEEDED | Trajnimi përfundon |
Në këtë rast, koha totale sipas orës reale është 6 orë, por vetëm 4 orë janë të faturueshme. Kostoja do të ishte 4 orë × $100/orë = $400.
Shembull pune të dështuar
Në këtë shembull, ekzekutimi trajnohet për 2 orë, shkruan një pikë kontrolli, trajnohet edhe 1 orë tjetër, por më pas dështon. Vetëm 2 orët e trajnimit deri te pika e kontrollit janë të faturueshme.
| Koha e trajnimit | Koha e faturuar | Statusi | Përshkrimi |
|---|---|---|---|
| 00:00 | 00:00 | – | Përdoruesi krijon punë RFT përmes API-së |
| 00:10 | 00:00 | VALIDATING_FILES | 10 minuta të shpenzuara për validimin e grupit të të dhënave |
| 00:30 | 00:00 | VALIDATING_FILES | 20 minuta duke kryer kontrolle sigurie të grupit të të dhënave |
| 01:00 | 00:00 | QUEUED | 30 minuta në pritje të një punuesi të disponueshëm |
| 01:30 | 00:00 | RUNNING | 30 minuta për konfigurimin e trajnimit (shkarkimi i peshave, parapërpunimi, etj.) |
| 03:30 | 02:00 | RUNNING | 2 orë të shpenzuara për trajnim |
| 03:30 | 02:00 | RUNNING | Pika e kontrollit u krijua në hapin 5 |
| 04:30 | 02:00 | RUNNING | Trajnimi dështon për shkak të një gabimi të brendshëm në hapin 8 (pas edhe 1 ore tjetër) |
| 04:30 | 02:00 | RUNNING | 30 minuta për vlerësimin dhe validimin e pikës së kontrollit |
| 04:30 | 02:00 | SUCCEEDED | Puna përfundon (me pikën më të fundit të kontrollit) |
Edhe pse gjithsej u shpenzuan 3 orë për trajnim, vetëm 2 orë janë “kapur” në një pikë kontrolli të përdorshme dhe faturohen. Ora e punës së trajnimit e humbur për shkak të dështimit nuk është përgjegjësia juaj. Kostoja do të ishte 2 orë × $100/orë = $200.
Pyetje të bëra shpesh
Kur faturohem?
Ne faturojmë kur ekzekutimi juaj përfundon, vihet në pauzë, anulohet ose dështon. Çdo faturë mbulon punën e kryer që nga fatura e mëparshme.
A paguaj nëse një ekzekutim dështon?
Nëse një ekzekutim dështon për shkak të gabimit tonë dhe humbet ndonjë punë e fundit trajnimi, nuk tarifoheni për pjesën e humbur. Nëse anuloni një ekzekutim, tarifoheni për punën deri në momentin e anulimit.
Si faturohen tokenët e modelit vlerësues?
Ne numërojmë tokenët e përdorur nga çdo vlerësues model që konfiguroni. Pasi përfundon trajnimi, i faturojmë këta tokenë sipas tarifave tona standarde për token.
A mund ta vendos në pauzë dhe ta rifilloj një ekzekutim?
Po. Kur e vendosni në pauzë, ne ruajmë një pikë kontrolli dhe tarifojmë për punën e kryer deri atëherë. Kur e rifilloni, do të tarifoheni vetëm për punën shtesë të kryer pas rifillimit.
Nëse keni pyetje të tjera rreth faturimit të Reinforcement Fine‑Tuning, kontaktoni ekipin tonë të mbështetjes.
