OpenAI
ይህ ገጽ በማሽን የተተረጎመ ነው። ዋናውን የእንግሊዝኛ ጽሑፍ ይመልከቱ

ለReinforcement Fine Tuning API የክፍያ መመሪያ

ለRFT API ክፍያ እንዴት እንደሚሰራ

የተዘመነው፦ 7 days ago

ለRFT ክፍያ እንዴት እንደሚሠራ

Reinforcement Fine‑Tuning (RFT) የማጠናከሪያ ትምህርትን በመጠቀም የOpenAI የማመዛዘን ሞዴሎችን አፈጻጸም እንዲያሻሽሉ ያስችልዎታል። በስልጠና ዳታሴቱ ውስጥ ባሉ token ብዛት ክፍያ ከሚታሰብባቸው የእኛ በቁጥጥር ወይም በምርጫ ላይ የተመሰረቱ የfine‑tuning አገልግሎቶች በተለየ፣ የRFT ክፍያ የስልጠና ሩጫዎ ዋናውን የማሽን መማር ሥራ ለመፈጸም በሚያጠፋው ጊዜ ላይ ተመስርቶ ይታሰባል።

ይህ መመሪያ ለክፍያ የሚቆጠር የስልጠና ጊዜ ምን እንደሆነ፣ ለአፍታ ማቆምና ስረዛን እንዴት እንደምንይዝ፣ እና የእርስዎ የቅንብር ምርጫዎች ወጪን እንዴት ሊነኩ እንደሚችሉ ያብራራል።

ዋጋ አሰጣጥ

  • ኮምፒውት፦ ለo4-mini-2025-04-16 በዋናው የስልጠና ዙር ውስጥ ለተወሰደ የwall-clock ጊዜ በሰዓት $100። ክፍያዎች እስከ ሰከንድ ድረስ በተመጣጣኝ ሁኔታ ይሰላሉ እና በደረሰኝ ላይ ወደ ሁለት የዴሲማል ቦታዎች ይዞራሉ (ለምሳሌ፣ 2.55 ሰዓት)።

  • የሞዴል ግሬደር አጠቃቀም፦ በስልጠና ወቅት ውጤቶችን "ለመመደብ" የOpenAI ሞዴል ከተጠቀሙ፣ እነዚያ የመመደብ ጥሪዎች የሚበሉት token ስልጠናው ከተጠናቀቀ በኋላ በእኛ መደበኛ የAPI ዋጋ በተለየ ይከፈላሉ።

እኛ ክፍያ የምናስከፍለው ሞዴልዎን በተግባር የሚያዘምን የስልጠና ሥራ ብቻ ነው (እኛ "captured forward progress" ብለን የምንጠራው)።

ለምን ነገር ክፍያ እናስከፍላለን

የስልጠና ወርከርዎ ሞዴልዎን በንቃት በሚያሰለጥንበት ጊዜ ክፍያ እናስከፍላለን፣ በተለይም፦

  • በfine-tuning ሂደት ወቅት ከሞዴልዎ ናሙናዎችን ማመንጨት (“rollouts” ተብሎ የሚታወቀው)

  • እነዚያን ውጤቶች በስራው ላይ በገለጿቸው አንድ ወይም ከዚያ በላይ ግሬደሮች መገምገም (ስለ ግሬደሮች ተጨማሪ ይወቁ)

  • በውጤቶቹ ላይ በመመርኮዝ የweight ዝማኔዎችን ማስላት እና መተግበር (backpropagation)።

  • ያዋቀሯቸውን ማንኛውንም የማረጋገጫ (evaluation) ደረጃዎች ማስኬድ።

አብዛኞቹ ግሬደሮች ለማስኬድ “ነፃ” ናቸው፤ ይህም ማለት ከዋናው የስልጠና ዑደት ጊዜ ውስጥ ከሚጨምሩት ጊዜ ውጭ ለአጠቃቀማቸው ተጨማሪ ክፍያ አናስከፍልም። ከዚህ የተለየው ለሞዴል ግሬደሮች ነው፤ በዚህ ጊዜ እነዚያ ግሬደሮች በላይ በተጠቀሱት እንቅስቃሴዎች የሚጠቀሙባቸውን tokenዎችም እንቆጥራለን። እነዚህ tokenዎች በኢንቮይስዎ ላይ እንደ የተለየ መስመር ንጥል ይታያሉ። በሞዴል ግሬደሮች የተጠቀሙ tokenዎች በመደበኛ የinference ተመኖች ይከፈላሉ (የOpenAI ዋጋ አሰጣጥ)።

ክፍያ የማናስከፍልበት ነገር

ለሚከተሉት በተወሰደ ጊዜ ክፍያ አናስከፍልም፦

  • ስልጠና ከመጀመሩ በፊት የእርስዎን ዳታ ስብስብ ማረጋገጥ ወይም መመርመር።

  • በዳታ ስብስብዎ ላይ የደህንነት ምርመራዎች።

  • የኮምፒውት ሀብቶችን ለማግኘት በወረፋ ውስጥ መጠበቅ።

  • የሞዴል weights ወይም የዳታ ስብስቦችን ማውረድ።

  • የእርስዎን ዳታ ስብስብ ወደ እኛ የስልጠና ቅርጽ ማዘጋጀት (rendering)።

  • ፋይን-ቱን የተደረገውን ሞዴልዎን ከስልጠና በኋላ የደህንነት ግምገማ ማካሄድ።

በእኛ በኩል ባለ ስህተት ምክንያት የስልጠና ሥራ ከጠፋ (ለምሳሌ፣ አንድ ሰራተኛ ከተሰናከለ እና ወደ ቀድሞ checkpoint መመለስ ካስፈለገው)፣ ለጠፋው የኮምፒውት ጊዜ ወይም የግሬደር token ክፍያ አይጣልብዎትም። በሚቀጥለው ክፍል ላይ ስለዚህ ተጨማሪ ዝርዝር አለ።

Captured forward progress እና የክፍያ ክስተቶች

ስልጠና ለሞዴልዎ ብዙ ትንንሽ ማሻሻያዎችን ያካትታል። ከእነዚህ ማሻሻያዎች ስንቶቹ በተሳካ ሁኔታ እንደሚጠናቀቁ እንከታተላለን። ክፍያዎች ከእነዚህ የተሳኩ ማሻሻያዎች ጋር ተያይዞ ባለው የኮምፒውት ጊዜ እና የግሬደር token ላይ የተመሠረቱ ናቸው።

ከሚከተሉት "የክፍያ ክስተቶች" አንዱ ሲከሰት ክፍያ እናወጣለን፦

  • ስልጠናው በተሳካ ሁኔታ ይጠናቀቃል።

  • ስልጠናውን ለአፍታ ያቆማሉ።

  • ስልጠናውን ይሰርዛሉ።

  • ስልጠናው ይከሽፋል።

እያንዳንዱ ክፍያ ከመጨረሻው ክፍያ ጀምሮ የተሠራውን ተጨማሪ ሥራ ይሸፍናል። ለምሳሌ፦

  • ሂደትን ለአፍታ ካቆሙ፣ checkpoint እናስቀምጣለን እና ከመጨረሻው ክፍያ ጀምሮ ለተጠቀሙት የኮምፒውት ጊዜ እና የግሬደር token ክፍያ እናስከፍላለን።

  • እንደገና ሲቀጥሉ፣ ስልጠናው ከcheckpoint ይቀጥላል። ቀጣዩ ክፍያ (ሲጠናቀቅ፣ እንደገና ለአፍታ ሲቆም፣ ሲሰረዝ ወይም ሲከሽፍ) ከመቀጠሉ በኋላ ለተሠራው ተጨማሪ ሥራ ብቻ ይሆናል።

  • ሂደትን ከሰረዙ፣ እስከ ስረዛው ድረስ ለተሠራው ሥራ ክፍያ እናስከፍላለን።

  • ስልጠናው ከከሸፈ እና ከመጨረሻው ክፍያ በኋላ የተሠራ ሥራ ከጠፋ፣ ለጠፋው ክፍል ክፍያ አይጣልም።

ይህ የ"captured forward progress" አቀራረብ በሞዴልዎ ውስጥ ለተጠበቀ ወይም በፈቃድዎ ለተዉት ሥራ ብቻ እንዲከፍሉ ያረጋግጣል።

የስራውን ሂደት መመልከት

የRFT ስራዎች እስከ አሁኑ ደረጃ ድረስ የስራውን ጠቅላላ አጠቃቀም የሚመዘግብ usage_metrics የሚባል መስክ አላቸው። ይህ በስልጠና ላይ የዋለውን ጊዜ እና በስራው ላይ ባሉ ሁሉም የሞዴል ግሬደሮች የተጠቀሙባቸውን ሁሉንም tokenዎች ያካትታል። ይህ መስክ በAPI (GET /v1/fine_tuning/jobs/{job_id}) ወይም በfine-tuning ዳሽቦርድ በኩል ሊመረመር ይችላል።

የስልጠና ጊዜን የሚነኩ ምክንያቶች

ክፍያው በጊዜ ላይ ስለሚመሠረት፣ የእርስዎ የቅንብር ምርጫዎች በቀጥታ ወጪን ይነካሉ። ዋና ምክንያቶች እነዚህን ያካትታሉ፦

  • የችግኝነት ደረጃ፦ የእርስዎ ዳታ ስብስብ አስቸጋሪ ችግኞችን ካካተተ፣ ሞዴሉ በእያንዳንዱ ችግኝ ላይ ለማመዛዘን ተጨማሪ ጊዜ ሊያጠፋ ይችላል፣ ይህም እያንዳንዱን ናሙና ለማመንጨት የሚፈለገውን ጊዜ ያሳድጋል።

  • የስሌት ክብደት፦ የcompute_multiplier ሃይፐርፓራሜተር በእያንዳንዱ የስልጠና ደረጃ ላይ ምን ያህል ስሌት እንደሚያደርጉ ይቆጣጠራል። ከፍ ያሉ እሴቶች ሞዴሉን በእያንዳንዱ የውሂብ ነጥብ ላይ የበለጠ በዝርዝር እንዲያመዛዝን ያበረታታሉ፣ ይህም እያንዳንዱ ደረጃ በዝግታ እንዲሄድ ያደርገዋል።

  • የማረጋገጫ ቅንብሮች

    • የበለጠ ትልቅ የማረጋገጫ ስብስብ ለግምገማ የሚወሰደውን ጊዜ ያሳድጋል።

    • eval_samples ን መጨመር (ለእያንዳንዱ የማረጋገጫ ምሳሌ የሚመደቡ የሞዴል ውጤቶች ብዛት) የማረጋገጫ ጊዜን ያሳድጋል።

    • ማረጋገጫን በተደጋጋሚ ማካሄድ (eval_interval ዝቅ ሲል) በማረጋገጫ ላይ የሚወሰደውን የጊዜ ክፍል ያሳድጋል።

  • የግሬደር አፈጻጸም

    • ትልልቅ ወይም የበለጠ ችሎታ ያላቸው የሞዴል ግሬደሮች ከትንንሾቹ ይልቅ ውጤት ለመመለስ የበለጠ ጊዜ ይወስዳሉ። ለምሳሌ፣ በየማመዛዘን ሞዴል መመደብ በማይመዛዘን ሞዴል ከመመደብ 10x ያህል ረዘም ሊል ይችላል።

    • ውስብስብ የPython የመመደብ ፋንክሽኖች ከቀላል ፋንክሽኖች ይልቅ ለመሄድ ብዙ ጊዜ ይወስዳሉ።

እነዚህ ቅንብሮች በወጪ፣ በፍጥነት እና በሞዴል ጥራት መካከል ሚዛን እንዲያደርጉ ያስችሉዎታል። ለምሳሌ፣ ተደጋጋሚ ማረጋገጫ ችግኞችን ቀድሞ ሊያገኝ ይችላል ነገር ግን ወጪን ያሳድጋል። የበለጠ የላቀ ሞዴል ተጠቅመው መመደብ የመመደብ ትክክለኛነትን በጣም ሊያሻሽል ይችላል፣ ግን እያንዳንዱን የመመደብ ደረጃ ያዘገየዋል እና ስራዎችን የበለጠ ውድ ያደርጋል።

ወጪን ማስተዳደር

የሚያወጡትን ወጪ ለመቆጣጠር፦

  • የእርስዎ ቅንብር ጊዜን እንዴት እንደሚነካ ለመረዳት በአጭር ሂደቶች ይጀምሩ።

  • ምክንያታዊ የሆነ የማረጋገጫ ምሳሌዎች ብዛት እና eval_samples ይጠቀሙ። ከሚያስፈልገው በላይ ተደጋጋሚ ማረጋገጫ አታድርጉ።

  • የጥራት ፍላጎቶችዎን የሚያሟላውን ትንሹን የግሬደር ሞዴል ይምረጡ።

  • ብጁ የPython ግሬደሮችን ቀልጣፋ ያድርጉ።

  • የመድረሻ ፍጥነትና ወጪን ለማመጣጠን compute_multiplier ን ያስተካክሉ።

  • ሂደትዎን በdashboard ወይም በAPI በኩል ይከታተሉ። በማንኛውም ጊዜ ለአፍታ ማቆም ወይም መሰረዝ ይችላሉ።

ምሳሌዎች

የተሳካ የስልጠና ሂደት

የስልጠና ጊዜየክፍያ ጊዜሁኔታመግለጫ
00:0000:00ተጠቃሚ API በመጠቀም የRFT ስራ ይፈጥራል
00:1000:00VALIDATING_FILES10 ደቂቃዎች ዳታሴትን በማረጋገጥ ላይ ዋሉ
00:3000:00VALIDATING_FILES20 ደቂቃዎች የዳታሴት ደህንነት ፍተሻዎችን በማስኬድ ላይ ዋሉ
01:0000:00QUEUED30 ደቂቃዎች የሚገኝ ወርከር በመጠበቅ ላይ ዋሉ
01:3000:00RUNNING30 ደቂቃዎች ስልጠናን በማዘጋጀት (weights ማውረድ፣ ቅድመ-ሂደት ወዘተ) ላይ ዋሉ
05:3004:00RUNNING4 ሰዓታት በስልጠና ላይ ዋሉ
06:0004:00RUNNING30 ደቂቃዎች የተገኘውን ሞዴል የደህንነት ግምገማዎች በማስኬድ ላይ ዋሉ
06:0004:00SUCCEEDEDስልጠናው ይጠናቀቃል

በዚህ ሁኔታ፣ ጠቅላላው የwall-clock ጊዜ 6 ሰዓታት ነው፣ ነገር ግን ክፍያ የሚከፈልባቸው 4 ሰዓታት ብቻ ናቸው። ወጪው 4 ሰዓታት × $100/ሰዓት = $400 ይሆናል።

የከሸፈ ስራ ምሳሌ

በዚህ ምሳሌ፣ runው ለ2 ሰዓታት ያሰለጥናል፣ checkpoint ይጽፋል፣ ለተጨማሪ 1 ሰዓት ያሰለጥናል፣ ነገር ግን ከዚያ ይከሽፋል። እስከ checkpoint ድረስ ያሉት 2 ሰዓታት የስልጠና ጊዜ ብቻ ክፍያ ይከፈልባቸዋል።

የስልጠና ጊዜየክፍያ ጊዜሁኔታመግለጫ
00:0000:00ተጠቃሚ API በመጠቀም የRFT ስራ ይፈጥራል
00:1000:00VALIDATING_FILES10 ደቂቃዎች ዳታሴትን በማረጋገጥ ላይ ዋሉ
00:3000:00VALIDATING_FILES20 ደቂቃዎች የዳታሴት ደህንነት ፍተሻዎችን በማስኬድ ላይ ዋሉ
01:0000:00QUEUED30 ደቂቃዎች የሚገኝ ወርከር በመጠበቅ ላይ ዋሉ
01:3000:00RUNNING30 ደቂቃዎች ስልጠናን በማዘጋጀት (weights ማውረድ፣ ቅድመ-ሂደት ወዘተ) ላይ ዋሉ
03:3002:00RUNNING2 ሰዓታት በስልጠና ላይ ዋሉ
03:3002:00RUNNINGበደረጃ 5 ላይ checkpoint ተፈጥሯል
04:3002:00RUNNINGበደረጃ 8 ላይ በውስጣዊ ስህተት ምክንያት ስልጠናው ይከሽፋል (ከተጨማሪ 1 ሰዓት በኋላ)
04:3002:00RUNNING30 ደቂቃዎች checkpointን በመገምገም እና በማረጋገጥ ላይ ዋሉ
04:3002:00SUCCEEDEDስራው ይጠናቀቃል (ከቅርብ ጊዜው checkpoint ጋር)

በአጠቃላይ 3 ሰዓታት በስልጠና ላይ ቢውሉም፣ በጥቅም ላይ ሊውል በሚችል checkpoint ውስጥ “የተያዙት” 2 ሰዓታት ብቻ ናቸው፣ እነሱም ክፍያ ይከፈልባቸዋል። በክሽፈቱ ምክንያት የጠፋው የአንድ ሰዓት የስልጠና ስራ የእርስዎ ኃላፊነት አይደለም። ወጪው 2 ሰዓታት × $100/ሰዓት = $200 ይሆናል።

ተደጋጋሚ ጥያቄዎች

መቼ ክፍያ ይከፈለኛል?

የእርስዎ run ሲጠናቀቅ፣ ሲቆም፣ ሲሰረዝ ወይም ሲከሽፍ ክፍያ እናስከፍላለን። እያንዳንዱ ሂሳብ ከቀድሞው ሂሳብ ጀምሮ የተሰራውን ስራ ይሸፍናል።

run ከከሸፈ እከፍላለሁ?

run በእኛ ስህተት ምክንያት ከከሸፈ እና ማንኛውም የቅርብ ጊዜ የስልጠና ስራ ከጠፋ፣ ለጠፋው ክፍል ክፍያ አይከፈልብዎትም። runን ከሰረዙ፣ እስከ መሰረዝ ድረስ ለተሰራው ስራ ክፍያ ይከፍላሉ።

የgrader ሞዴል tokenዎች እንዴት ክፍያ ይከፈልባቸዋል?

ያዋቀሯቸው ማንኛውም የሞዴል ግሬደሮች የሚጠቀሙባቸውን tokenዎች እንቆጥራለን። ስልጠናው ከተጠናቀቀ በኋላ፣ ለእነዚያ tokenዎች በመደበኛ የtoken-ተኮር ተመኖቻችን ክፍያ እናስከፍላለን።

runን ማቆም እና እንደገና መቀጠል እችላለሁ?

አዎ። ሲያቆሙ፣ checkpoint እናስቀምጣለን እና እስካሁን ለተሰራው ስራ ክፍያ እናስከፍላለን። እንደገና ሲቀጥሉ፣ ከቀጠሉ በኋላ ለተሰራ ተጨማሪ ስራ ብቻ ክፍያ ይከፍላሉ።

ስለ Reinforcement Fine‑Tuning ክፍያ ሌሎች ጥያቄዎች ካሉዎት፣ የድጋፍ ቡድናችንን ያግኙ

ይህ ጽሑፍ ጠቃሚ ነበር?