RFT માટે બિલિંગ કેવી રીતે થાય છે
રીઇન્ફોર્સમેન્ટ ફાઇન-ટ્યુનિંગ (RFT) તમને રીઇન્ફોર્સમેન્ટ લર્નિંગનો ઉપયોગ કરીને OpenAIનાં রিজনিং মডেলનું પ્રદર્શન ઑપ્ટિમાઇઝ કરવાની સુવિધા આપે છે. અમારી નિરીક્ષિત અથવા પસંદગી-આધારિત ફાઇન-ટ્યુનિંગ સેવાઓથી અલગ, જેમાં બિલિંગ તાલીમ ડેટાસેટમાં રહેલા ટોકનની સંખ્યાના આધારે થાય છે, RFTનું બિલિંગ તમારા તાલીમ રન દ્વારા મુખ્ય મશીન લર્નિંગ કાર્ય કરવામાં લાગેલા સમયના આધારે થાય છે.
આ માર્ગદર્શિકા સમજાવે છે કે બિલ લાયક તાલીમ સમય તરીકે શું ગણાય છે, અમે pause અને cancellation કેવી રીતે સંભાળીએ છીએ, અને તમારી configuration પસંદગીઓ ખર્ચને કેવી રીતે અસર કરી શકે છે.
કિંમત નિર્ધારણ
ગણતરી: o4-mini-2025-04-16 માટે મુખ્ય તાલીમ ચક્રમાં વીતેલા વાસ્તવિક સમયના પ્રતિ કલાક $100. શુલ્કની ગણતરી સેકન્ડના પ્રમાણમાં થાય છે અને બિલમાં તેને બે દશાંશ સ્થાન સુધી ગોળ કરવામાં આવે છે, જેમ કે 2.55 કલાક.
મોડલ મૂલ્યાંકનકારનો વપરાશ: તાલીમ દરમિયાન પરિણામોનું “મૂલ્યાંકન” કરવા માટે તમે OpenAI મોડલ વાપરો, તો તે મૂલ્યાંકન વિનંતિઓમાં વપરાયેલા ટોકનનું બિલ તાલીમ પૂર્ણ થયા પછી અમારા માનક API દરે અલગથી બને છે.
અમે માત્ર એવા તાલીમ કાર્ય માટે શુલ્ક લઈએ છીએ જે ખરેખર તમારા મોડલને સુધારે છે, જેને અમે “નોંધાયેલી આગળની પ્રગતિ” કહીએ છીએ.
અમે શેના માટે બિલ કરીએ છીએ
તમારો ટ્રેનિંગ વર્કર તમારું મોડલ સક્રિય રીતે ટ્રેન કરવા જે સમય ખર્ચે છે તેનું અમે બિલ કરીએ છીએ, ખાસ કરીને:
ફાઇન-ટ્યુનિંગ પ્રક્રિયા દરમિયાન તમારા મોડલમાંથી નમૂનાઓ જનરેટ કરવા (“રોલઆઉટ્સ” તરીકે ઓળખાય છે)
તમે જોબ પર નિર્ધારિત કરેલા એક કે વધુ ગ્રેડર વડે તે આઉટપુટનું મૂલ્યાંકન કરવું (ગ્રેડર વિશે વધુ જાણો)
ગ્રેડના આધારે વેઇટ અપડેટની ગણતરી કરવી અને લાગુ કરવી (બૅકપ્રોપેગેશન).
તમે કૉન્ફિગર કરેલા કોઈપણ માન્યતા (મૂલ્યાંકન) પગલાં ચલાવવા.
મોટાભાગના ગ્રેડર ચલાવવા માટે “મફત” છે, એટલે કે કોર ટ્રેનિંગ લૂપમાં તેઓ ઉમેરે છે તે સમય સિવાય તેમના ઉપયોગ માટે અમે વધારું શુલ્ક લેતા નથી. આનો અપવાદ મોડલ ગ્રેડર માટે છે, જ્યાં ઉપરની પ્રવૃત્તિઓ દરમિયાન તે ગ્રેડર વાપરે છે તે ટોકન પણ અમે ગણીએ છીએ. આ ટોકન તમારા ઇનવૉઇસમાં અલગ લાઇન આઇટમ તરીકે દેખાય છે. મોડલ ગ્રેડર દ્વારા વપરાયેલા ટોકન સામાન્ય ઇન્ફરન્સ દરે બિલ કરવામાં આવે છે (OpenAI કિંમતો).
અમે શા માટે બિલ કરતા નથી
નીચેના સમયમાં અમે ચાર્જ કરતા નથી.
તાલીમ શરૂ થાય તે પહેલાં તમારા datasetને validate કરવા અથવા તપાસવા માટે.
તમારા dataset પર safety checks માટે.
compute resources માટે queueમાં રાહ જોવામાં.
model weights અથવા datasets download કરવામાં.
તમારા datasetને અમારા training formatમાં તૈયાર કરવા (render કરવા) માટે.
તમારા fine-tuned મોડલના post‑training safety evaluations માટે.
જો અમારી તરફની ભૂલને કારણે તાલીમ કાર્ય ગુમાય, જેમ કે worker crash થાય અને અગાઉના checkpoint પર rollback કરવું પડે, તો ગુમાયેલ compute time અથવા grader tokens માટે તમારી પાસેથી ચાર્જ લેવામાં આવતો નથી. તેની વધુ વિગતો આગળના વિભાગમાં છે.
Captured forward progress અને billing events
તાલીમમાં તમારા મોડલમાં થતા ઘણા નાના updatesનો સમાવેશ થાય છે. અમે આમાંથી કેટલા updates સફળતાપૂર્વક પૂર્ણ થાય છે તે ટ્રેક કરીએ છીએ. ચાર્જ આ સફળ updates સાથે જોડાયેલા compute time અને grader tokens પર આધારિત હોય છે.
નીચેના "billing events"માંથી એક બન્યા સમયે અમે ચાર્જ જારી કરીએ છીએ.
તાલીમ સફળતાપૂર્વક પૂર્ણ થાય છે.
તમે તાલીમ pause કરો છો.
તમે તાલીમ cancel કરો છો.
તાલીમ fail થાય છે.
દરેક ચાર્જ છેલ્લે થયેલા ચાર્જ પછી થયેલા વધારાના કાર્યને આવરી લે છે. ઉદાહરણ તરીકે.
જો તમે run pause કરો, તો અમે checkpoint સાચવીએ છીએ અને છેલ્લેના ચાર્જ પછી વપરાયેલા compute time અને grader tokens માટે ચાર્જ કરીએ છીએ.
તમે resume કરો ત્યારે તાલીમ checkpoint પરથી આગળ વધે છે. આગળનો ચાર્જ (completion, બીજા pause, cancellation અથવા failure સમયે) ફક્ત resume પછી થયેલા વધારાના કાર્યને જ આવરી લેશે.
જો તમે run cancel કરો, તો cancellation સુધી થયેલા કાર્ય માટે અમે ચાર્જ કરીએ છીએ.
જો તાલીમ fail થાય અને છેલ્લેના ચાર્જ પછીનું કાર્ય ગુમાય, તો ગુમાયેલા ભાગ માટે બિલ કરવામાં આવતું નથી.
આ "captured forward progress" અભિગમ ખાતરી કરે છે કે તમે ફક્ત એ જ કાર્ય માટે ચૂકવો છો જે તમારા મોડલમાં જળવાઈ રહે છે અથવા જેને તમે જાણબૂઝીને છોડો છો.
કાર્યની પ્રગતિ જોવી
RFT કાર્યોમાં usage_metrics નામનું ક્ષેત્ર હોય છે, જે વર્તમાન પગલા સુધી કાર્યના કુલ વપરાશની નોંધ રાખે છે. તેમાં તાલીમ પાછળ લાગેલો સમય અને કાર્યના તમામ મોડલ મૂલ્યાંકનકારોએ વાપરેલા બધા ટોકનનો સમાવેશ થાય છે. આ ક્ષેત્રની તપાસ API (GET /v1/fine_tuning/jobs/{job_id}) અથવા સૂક્ષ્મ-સમાયોજન નિયંત્રણપટ દ્વારા કરી શકાય છે.
તાલીમના સમયને અસર કરતા પરિબળો
બિલ સમયના આધારે બનતું હોવાથી, તમારી ગોઠવણીની પસંદગીઓ ખર્ચને સીધી અસર કરે છે. મુખ્ય પરિબળોમાં આનો સમાવેશ થાય છે:
સમસ્યાની મુશ્કેલી: જો તમારા ડેટાસેટમાં મુશ્કેલ સમસ્યાઓ હોય, તો મોડલ દરેક સમસ્યા પર વિચાર કરવામાં વધુ સમય લે તેવી શક્યતા છે, જેથી દરેક નમૂનો તૈયાર કરવામાં વધુ સમય લાગે છે.
ગણતરીની તીવ્રતા: compute_multiplier અતિપ્રાચલ દરેક તાલીમ પગલામાં કેટલી ગણતરી કરવામાં આવે છે તે નિયંત્રિત કરે છે. ઊંચા મૂલ્યો મોડલને દરેક ડેટા બિંદુ પર વધુ વિગતવાર વિચારવા પ્રેરે છે, જેના કારણે દરેક પગલું ધીમું ચાલે છે.
માન્યતાની ગોઠવણીઓ:
મૂલ્યાંકનકારનું પ્રદર્શન:
મોટા અથવા વધુ સક્ષમ મોડલ મૂલ્યાંકનકારોને નાના મૂલ્યાંકનકારોની સરખામણીમાં ગુણ આપવામાં વધુ સમય લાગે છે. ઉદાહરણ તરીકે, રিজનિંગ મডેલ વડે મૂલ્યાંકન કરવામાં રિઝનિંગ ન કરતા મોડલ કરતાં 10 ગણો વધુ સમય લાગી શકે છે.
જટિલ Python મૂલ્યાંકન વિધેયોને સરળ વિધેયો કરતાં ચાલવામાં વધુ સમય લાગે છે.
આ ગોઠવણીઓથી તમે ખર્ચ, ઝડપ અને મોડલની ગુણવત્તા વચ્ચે સંતુલન સાધી શકો છો. ઉદાહરણ તરીકે, વારંવાર માન્યતા ચકાસવાથી સમસ્યાઓ વહેલી શોધી શકાય છે, પરંતુ ખર્ચ વધે છે. વધુ અદ્યતન મોડલથી મૂલ્યાંકન કરવાથી તેની ચોકસાઈમાં ઘણો સુધારો થઈ શકે છે, પરંતુ દરેક મૂલ્યાંકન પગલું ધીમું પડશે અને કાર્યો વધુ ખર્ચાળ બનશે.
ખર્ચનું સંચાલન
તમારા ખર્ચને નિયંત્રિત કરવા માટે:
તમારી ગોઠવણી સમયને કેવી રીતે અસર કરે છે તે સમજવા માટે ટૂંકા સંચાલનથી શરૂઆત કરો.
માન્યતા ઉદાહરણો અને eval_samplesની વાજબી સંખ્યા વાપરો. જરૂર કરતાં વધુ વાર માન્યતા ચકાસવાનું ટાળો.
તમારી ગુણવત્તાની જરૂરિયાતો પૂરી કરતું સૌથી નાનું મૂલ્યાંકનકાર મોડલ પસંદ કરો.
વૈવિધ્યપૂર્ણ Python મૂલ્યાંકનકારોને કાર્યક્ષમ રાખો.
અભિસરણની ઝડપ અને ખર્ચ વચ્ચે સંતુલન સાધવા compute_multiplierને સમાયોજિત કરો.
નિયંત્રણપટ અથવા API દ્વારા તમારા સંચાલન પર નજર રાખો. તમે કોઈપણ સમયે તેને થોભાવી અથવા રદ કરી શકો છો.
ઉદાહરણો
સફળ ટ્રેનિંગ રન
| ટ્રેનિંગ સમય | બિલ કરેલો સમય | સ્થિતિ | વર્ણન |
|---|---|---|---|
| 00:00 | 00:00 | – | વપરાશકર્તા API મારફતે RFT જોબ બનાવે છે |
| 00:10 | 00:00 | VALIDATING_FILES | ડેટાસેટ માન્ય કરવામાં 10 મિનિટ લાગી |
| 00:30 | 00:00 | VALIDATING_FILES | ડેટાસેટ સલામતી ચકાસણીઓ ચલાવવામાં 20 મિનિટ લાગી |
| 01:00 | 00:00 | QUEUED | ઉપલબ્ધ વર્કરની રાહ જોવામાં 30 મિનિટ લાગી |
| 01:30 | 00:00 | RUNNING | ટ્રેનિંગ સેટઅપ કરવામાં 30 મિનિટ લાગી (વેઇટ્સ ડાઉનલોડ કરવા, પ્રીપ્રોસેસિંગ વગેરે) |
| 05:30 | 04:00 | RUNNING | ટ્રેનિંગમાં 4 કલાક લાગ્યા |
| 06:00 | 04:00 | RUNNING | પરિણામી મોડલના સલામતી મૂલ્યાંકન ચલાવવામાં 30 મિનિટ લાગી |
| 06:00 | 04:00 | SUCCEEDED | ટ્રેનિંગ પૂર્ણ થાય છે |
આ કિસ્સામાં, કુલ વોલ-ક્લોક સમય 6 કલાક છે, પરંતુ ફક્ત 4 કલાક બિલપાત્ર છે. ખર્ચ 4 કલાક × $100/કલાક = $400 થશે.
નિષ્ફળ જોબનું ઉદાહરણ
આ ઉદાહરણમાં, રન 2 કલાક ટ્રેન થાય છે, ચેકપોઇન્ટ લખે છે, વધુ 1 કલાક ટ્રેન થાય છે, પરંતુ પછી નિષ્ફળ જાય છે. ચેકપોઇન્ટ સુધીના ફક્ત 2 કલાકનું ટ્રેનિંગ બિલપાત્ર છે.
| ટ્રેનિંગ સમય | બિલ કરેલો સમય | સ્થિતિ | વર્ણન |
|---|---|---|---|
| 00:00 | 00:00 | – | વપરાશકર્તા API મારફતે RFT જોબ બનાવે છે |
| 00:10 | 00:00 | VALIDATING_FILES | ડેટાસેટ માન્ય કરવામાં 10 મિનિટ લાગી |
| 00:30 | 00:00 | VALIDATING_FILES | ડેટાસેટ સલામતી ચકાસણીઓ ચલાવવામાં 20 મિનિટ લાગી |
| 01:00 | 00:00 | QUEUED | ઉપલબ્ધ વર્કરની રાહ જોવામાં 30 મિનિટ લાગી |
| 01:30 | 00:00 | RUNNING | ટ્રેનિંગ સેટઅપ કરવામાં 30 મિનિટ લાગી (વેઇટ્સ ડાઉનલોડ કરવા, પ્રીપ્રોસેસિંગ વગેરે) |
| 03:30 | 02:00 | RUNNING | ટ્રેનિંગમાં 2 કલાક લાગ્યા |
| 03:30 | 02:00 | RUNNING | પગલું 5 પર ચેકપોઇન્ટ બનાવાયો |
| 04:30 | 02:00 | RUNNING | પગલું 8 પર આંતરિક ભૂલને કારણે ટ્રેનિંગ નિષ્ફળ જાય છે (વધુ 1 કલાક પછી) |
| 04:30 | 02:00 | RUNNING | ચેકપોઇન્ટનું મૂલ્યાંકન અને માન્યતા કરવામાં 30 મિનિટ લાગી |
| 04:30 | 02:00 | SUCCEEDED | જોબ પૂર્ણ થાય છે (નવીનતમ ચેકપોઇન્ટ સાથે) |
કુલ 3 કલાક ટ્રેનિંગમાં લાગ્યા હોવા છતાં, ફક્ત 2 કલાક ઉપયોગી ચેકપોઇન્ટમાં “કૅપ્ચર” થયા છે અને તેનું બિલ થાય છે. નિષ્ફળતાને કારણે ગુમાવાયેલ ટ્રેનિંગ કામનો 1 કલાક તમારી જવાબદારી નથી. ખર્ચ 2 કલાક × $100/કલાક = $200 થશે.
વારંવાર પૂછાતા પ્રશ્નો
મારી પાસેથી શુલ્ક ક્યારે લેવાય છે?
તમારું સંચાલન પૂર્ણ થાય, થોભાવવામાં આવે, રદ થાય અથવા નિષ્ફળ જાય ત્યારે અમે બિલ બનાવીએ છીએ. દરેક બિલમાં અગાઉના બિલ પછી થયેલા કાર્યનો સમાવેશ થાય છે.
જો રન નિષ્ફળ જાય તો શું મારે ચુકવવું પડે?
જો અમારી ભૂલને કારણે રન નિષ્ફળ જાય અને તાજેતરનું કોઈ ટ્રેનિંગ કામ ગુમાય, તો ગુમાયેલા ભાગ માટે તમારી પાસેથી શુલ્ક લેવામાં આવતું નથી. જો તમે રન રદ કરો છો, તો રદ કરવા સુધી થયેલા કામ માટે તમારી પાસેથી શુલ્ક લેવાય છે.
ગ્રેડર મોડલ ટોકનનું બિલ કેવી રીતે થાય છે?
તમે કૉન્ફિગર કરેલા કોઈપણ મોડલ ગ્રેડર દ્વારા વપરાયેલા ટોકન અમે ગણીએ છીએ. ટ્રેનિંગ પૂર્ણ થયા પછી, અમે તે ટોકનનું બિલ અમારા પ્રમાણભૂત પ્રતિ-ટોકન દરે કરીએ છીએ.
શું હું રનને વિરામમાં મૂકી ફરી શરૂ કરી શકું?
હા. તમે વિરામમાં મૂકો ત્યારે, અમે ચેકપોઇન્ટ સાચવીએ છીએ અને અત્યાર સુધી થયેલા કામ માટે શુલ્ક લઈએ છીએ. તમે ફરી શરૂ કરો ત્યારે, ફરી શરૂ કર્યા પછી થયેલા વધારાના કામ માટે જ તમારી પાસેથી શુલ્ક લેવાશે.
જો રીઇન્ફોર્સમેન્ટ ફાઇન-ટ્યુનિંગ બિલિંગ વિશે તમને અન્ય પ્રશ્નો હોય, તો અમારી સહાય ટીમનો સંપર્ક કરો.
