OpenAI
Kjo faqe u përkthye automatikisht. Shih artikullin origjinal në anglisht.

Udhëzues faturimi për API-në e Reinforcement Fine-Tuning

Si funksionon faturimi për API-në RFT

Përditësuar: 6 days ago

Si funksionon faturimi për RFT

Përshtatja e imët përforcuese (RFT) ju lejon të optimizoni performancën e modeleve të arsyetimit të OpenAI duke përdorur trajnim përforcues. Ndryshe nga ofertat tona për përshtatje të imët të mbikëqyrur ose sipas preferencave, të cilat faturohen sipas numrit të tokenëve në grupin e të dhënave të trajnimit, RFT faturohet bazuar në kohën që procesi juaj i trajnimit kalon duke kryer punën kryesore të mësimit makinerik.

Ky udhëzues shpjegon se çfarë llogaritet si kohë e faturueshme trajnimi, si i trajtojmë pauzat dhe anulimet, dhe si zgjedhjet e konfigurimit tuaj mund të ndikojnë në kosto.

Çmimet

  • Përllogaritja: 100 $ për çdo orë reale të shpenzuar në ciklin bazë të trajnimit për o4-mini-2025-04-16. Tarifat llogariten proporcionalisht deri në sekondë dhe rrumbullakosen në faturë me dy shifra pas presjes (p.sh., 2,55 orë).

  • Përdorimi i modelit vlerësues: Nëse përdorni një model OpenAI për të «vlerësuar» rezultatet gjatë trajnimit, tokenët e konsumuar nga këto thirrje vlerësimi faturohen veçmas, sipas tarifave tona standarde të API-së, pasi të përfundojë trajnimi.

Tarifojmë vetëm punën e trajnimit që e përditëson realisht modelin tuaj (atë që e quajmë «përparim i realizuar»).

Për çfarë faturojmë

Ne faturojmë për kohën që punuesi juaj i trajnimit shpenzon duke trajnuar aktivisht modelin tuaj, konkretisht:

  • Gjenerimi i mostrave nga modeli juaj gjatë procesit të rregullimit të imët (të njohura si “rollout-e”)

  • Vlerësimi i atyre daljeve me një ose më shumë vlerësues që keni përcaktuar në punë (mësoni më shumë rreth vlerësuesve)

  • Llogaritja dhe aplikimi i përditësimeve të peshave bazuar te notat (përhapje prapa).

  • Kryerja e çdo hapi validimi (vlerësimi) që keni konfiguruar.

Shumica e vlerësuesve janë “falas” për t’u ekzekutuar, që do të thotë se nuk tarifojmë shtesë për përdorimin e tyre jashtë kohës që ata i shtojnë ciklit bazë të trajnimit. Përjashtim bëjnë vlerësuesit model, ku ne numërojmë edhe tokenët që këta vlerësues konsumojnë gjatë aktiviteteve të mësipërme. Këta tokenë shfaqen si një zë më vete në faturën tuaj. Tokenët e konsumuar nga vlerësuesit model faturohen me tarifat normale të inferencës (çmimet e OpenAI).

Për çfarë NUK faturojmë

Ne nuk tarifojmë për kohën e shpenzuar:

  • Duke validuar ose inspektuar dataset-in tuaj përpara se të fillojë trajnimi.

  • Në kontrolle sigurie për dataset-in tuaj.

  • Duke pritur në radhë për burime llogaritëse.

  • Duke shkarkuar peshat e model-it ose dataset-et.

  • Duke përgatitur (renderuar) dataset-in tuaj në formatin tonë të trajnimit.

  • Në vlerësime sigurie pas trajnimit të model-it tuaj të fine-tuning.

Nëse puna e trajnimit humbet për shkak të një gabimi nga ana jonë (për shembull, nëse një worker bie dhe duhet të rikthehet te një checkpoint i mëparshëm), nuk tarifoheni për kohën e humbur të llogaritjes ose token-ët e vlerësuesit. Më shumë hollësi për këtë në seksionin tjetër.

Progresi i ruajtur përpara dhe ngjarjet e faturimit

Trajnimi përbëhet nga shumë përditësime të vogla të model-it tuaj. Ne gjurmojmë sa prej këtyre përditësimeve përfundojnë me sukses. Tarifat bazohen në kohën e llogaritjes dhe token-ët e vlerësuesit të lidhur me këto përditësime të suksesshme.

Ne lëshojmë një tarifë kur ndodh një nga "ngjarjet e faturimit" të mëposhtme:

  • Trajnimi përfundon me sukses.

  • Ju ndaloni trajnimin.

  • Ju anuloni trajnimin.

  • Trajnimi dështon.

Çdo tarifë mbulon punën shtesë të bërë që nga tarifa e fundit. Për shembull:

  • Nëse ndaloni një ekzekutim, ne ruajmë një checkpoint dhe ju tarifojmë për kohën e llogaritjes dhe token-ët e vlerësuesit të përdorur që nga tarifa e fundit.

  • Kur rifilloni, trajnimi vazhdon nga checkpoint-i. Tarifa tjetër (në përfundim, në një ndalim tjetër, anulim ose dështim) do të mbulojë vetëm punën shtesë të bërë pas rifillimit.

  • Nëse anuloni një ekzekutim, ju tarifojmë për punën e bërë deri në anulim.

  • Nëse trajnimi dështon dhe puna që nga tarifa e fundit humbet, nuk faturoheni për pjesën e humbur.

Kjo qasje e "progresit të ruajtur përpara" siguron që të paguani vetëm për punën që ruhet në model-in tuaj ose që ju e braktisni qëllimisht.

Shikimi i ecurisë së detyrës

Detyrat RFT kanë një fushë të quajtur usage_metrics, e cila dokumenton përdorimin e përgjithshëm të detyrës deri në hapin aktual. Kjo përfshin kohën e shpenzuar për trajnim dhe të gjithë tokenët e përdorur nga të gjitha modelet vlerësuese të detyrës. Kjo fushë mund të kontrollohet përmes API-së (GET /v1/fine_tuning/jobs/{job_id}) ose përmes panelit të përshtatjes së imët.

Faktorët që ndikojnë në kohëzgjatjen e trajnimit

Meqë faturimi bazohet në kohë, zgjedhjet e konfigurimit ndikojnë drejtpërdrejt te kostoja. Faktorët kryesorë përfshijnë:

  • Vështirësia e problemit: nëse grupi juaj i të dhënave përbëhet nga probleme të vështira, modeli ka të ngjarë të shpenzojë më shumë kohë duke arsyetuar për secilin problem, çka zgjat kohën e nevojshme për krijimin e çdo kampioni.

  • Intensiteti llogaritës: Hiperparametri compute_multiplier përcakton sa përllogaritje kryhen në çdo hap trajnimi. Vlerat më të larta e nxitin modelin të arsyetojë më hollësisht për çdo pikë të dhënash, duke e ngadalësuar çdo hap.

  • Cilësimet e validimit:

  • Performanca e vlerësuesit:

  • Modeleve vlerësuese më të mëdha ose më të afta u duhet më shumë kohë për të dhënë një vlerësim sesa modeleve më të vogla. Për shembull, vlerësimi me një model arsyetimi mund të zgjasë 10 herë më shumë se vlerësimi me një model pa arsyetim.

  • Funksionet komplekse të vlerësimit në Python kërkojnë më shumë kohë për t’u ekzekutuar sesa funksionet e thjeshta.

Këto cilësime ju lejojnë të balanconi koston, shpejtësinë dhe cilësinë e modelit. Për shembull, validimi i shpeshtë mund t’i zbulojë problemet më herët, por rrit koston. Vlerësimi me një model më të avancuar mund ta përmirësojë ndjeshëm saktësinë e vlerësimit, por ngadalëson çdo hap të tij dhe i bën detyrat më të kushtueshme.

Menaxhimi i kostos

Për të kontrolluar shpenzimet:

  • Filloni me ekzekutime më të shkurtra për të kuptuar se si konfigurimi juaj ndikon te koha.

  • Përdorni një numër të arsyeshëm shembujsh validimi dhe eval_samples. Mos kryeni validim më shpesh nga sa ju nevojitet.

  • Zgjidhni modelin më të vogël vlerësues që përmbush kërkesat tuaja të cilësisë.

  • Mbajini efikasë vlerësuesit e personalizuar në Python.

  • Rregulloni compute_multiplier për të balancuar shpejtësinë e konvergjencës dhe koston.

  • Monitoroni ekzekutimin në panel ose përmes API-së. Mund ta vendosni në pauzë ose ta anuloni në çdo kohë.

Shembuj

Ekzekutim trajnimi i suksesshëm

Koha e trajnimitKoha e faturuarStatusiPërshkrimi
00:0000:00Përdoruesi krijon punë RFT përmes API-së
00:1000:00VALIDATING_FILES10 minuta të shpenzuara për validimin e grupit të të dhënave
00:3000:00VALIDATING_FILES20 minuta duke kryer kontrolle sigurie të grupit të të dhënave
01:0000:00QUEUED30 minuta në pritje të një punuesi të disponueshëm
01:3000:00RUNNING30 minuta për konfigurimin e trajnimit (shkarkimi i peshave, parapërpunimi, etj.)
05:3004:00RUNNING4 orë të shpenzuara për trajnim
06:0004:00RUNNING30 minuta duke kryer vlerësime sigurie të modelit që rezulton
06:0004:00SUCCEEDEDTrajnimi përfundon

Në këtë rast, koha totale sipas orës reale është 6 orë, por vetëm 4 orë janë të faturueshme. Kostoja do të ishte 4 orë × $100/orë = $400.

Shembull pune të dështuar

Në këtë shembull, ekzekutimi trajnohet për 2 orë, shkruan një pikë kontrolli, trajnohet edhe 1 orë tjetër, por më pas dështon. Vetëm 2 orët e trajnimit deri te pika e kontrollit janë të faturueshme.

Koha e trajnimitKoha e faturuarStatusiPërshkrimi
00:0000:00Përdoruesi krijon punë RFT përmes API-së
00:1000:00VALIDATING_FILES10 minuta të shpenzuara për validimin e grupit të të dhënave
00:3000:00VALIDATING_FILES20 minuta duke kryer kontrolle sigurie të grupit të të dhënave
01:0000:00QUEUED30 minuta në pritje të një punuesi të disponueshëm
01:3000:00RUNNING30 minuta për konfigurimin e trajnimit (shkarkimi i peshave, parapërpunimi, etj.)
03:3002:00RUNNING2 orë të shpenzuara për trajnim
03:3002:00RUNNINGPika e kontrollit u krijua në hapin 5
04:3002:00RUNNINGTrajnimi dështon për shkak të një gabimi të brendshëm në hapin 8 (pas edhe 1 ore tjetër)
04:3002:00RUNNING30 minuta për vlerësimin dhe validimin e pikës së kontrollit
04:3002:00SUCCEEDEDPuna përfundon (me pikën më të fundit të kontrollit)

Edhe pse gjithsej u shpenzuan 3 orë për trajnim, vetëm 2 orë janë “kapur” në një pikë kontrolli të përdorshme dhe faturohen. Ora e punës së trajnimit e humbur për shkak të dështimit nuk është përgjegjësia juaj. Kostoja do të ishte 2 orë × $100/orë = $200.

Pyetje të bëra shpesh

Kur faturohem?

Ju faturojmë kur ekzekutimi përfundon, vihet në pauzë, anulohet ose dështon. Çdo faturë mbulon punën e kryer që nga fatura e mëparshme.

A paguaj nëse një ekzekutim dështon?

Nëse një ekzekutim dështon për shkak të gabimit tonë dhe humbet ndonjë punë e fundit trajnimi, nuk tarifoheni për pjesën e humbur. Nëse anuloni një ekzekutim, tarifoheni për punën deri në momentin e anulimit.

Si faturohen tokenët e modelit vlerësues?

Ne numërojmë tokenët e përdorur nga çdo vlerësues model që konfiguroni. Pasi përfundon trajnimi, i faturojmë këta tokenë sipas tarifave tona standarde për token.

A mund ta vendos në pauzë dhe ta rifilloj një ekzekutim?

Po. Kur e vendosni në pauzë, ne ruajmë një pikë kontrolli dhe tarifojmë për punën e kryer deri atëherë. Kur e rifilloni, do të tarifoheni vetëm për punën shtesë të kryer pas rifillimit.

Nëse keni pyetje të tjera rreth faturimit të Reinforcement Fine‑Tuning, kontaktoni ekipin tonë të mbështetjes.

A ishte i dobishëm ky artikull?