ለRFT ክፍያ እንዴት እንደሚሠራ
Reinforcement Fine‑Tuning (RFT) የማጠናከሪያ ትምህርትን በመጠቀም የOpenAI የማመዛዘን ሞዴሎችን አፈጻጸም እንዲያሻሽሉ ያስችልዎታል። በስልጠና ዳታሴቱ ውስጥ ባሉ token ብዛት ክፍያ ከሚታሰብባቸው የእኛ በቁጥጥር ወይም በምርጫ ላይ የተመሰረቱ የfine‑tuning አገልግሎቶች በተለየ፣ የRFT ክፍያ የስልጠና ሩጫዎ ዋናውን የማሽን መማር ሥራ ለመፈጸም በሚያጠፋው ጊዜ ላይ ተመስርቶ ይታሰባል።
ይህ መመሪያ ለክፍያ የሚቆጠር የስልጠና ጊዜ ምን እንደሆነ፣ ለአፍታ ማቆምና ስረዛን እንዴት እንደምንይዝ፣ እና የእርስዎ የቅንብር ምርጫዎች ወጪን እንዴት ሊነኩ እንደሚችሉ ያብራራል።
ዋጋ አወጣጥ
ስሌት፦ ለo4-mini-2025-04-16 በዋናው የሥልጠና ዙር ውስጥ ለሚያልፍ እያንዳንዱ የቀን መቁጠሪያ ሰዓት $100። ክፍያዎች እስከ ሰከንድ በተመጣጣኝ ሁኔታ ይሰላሉ፣ በደረሰኙም ላይ ወደ ሁለት የአስርዮሽ ቦታዎች ይጠጋጋሉ (ለምሳሌ፣ 2.55 ሰዓት)።
የሞዴል ገምጋሚ አጠቃቀም፦ በሥልጠና ወቅት ውጤቶችን "ደረጃ ለመስጠት" የOpenAI ሞዴል ከተጠቀሙ፣ በእነዚያ የግምገማ ጥሪዎች የተጠቀሙት token-ዎች ሥልጠናው ከተጠናቀቀ በኋላ በመደበኛው የAPI ተመናችን በተናጠል ክፍያ ይከፈልባቸዋል።
ክፍያ የምናስከፍለው ሞዴልዎን በተጨባጭ ለሚያዘምን የሥልጠና ሥራ ብቻ ነው (ይህንንም "የተመዘገበ የወደፊት እድገት" እንለዋለን)።
ለምን ነገር ክፍያ እናስከፍላለን
የስልጠና ወርከርዎ ሞዴልዎን በንቃት በሚያሰለጥንበት ጊዜ ክፍያ እናስከፍላለን፣ በተለይም፦
በfine-tuning ሂደት ወቅት ከሞዴልዎ ናሙናዎችን ማመንጨት (“rollouts” ተብሎ የሚታወቀው)
እነዚያን ውጤቶች በስራው ላይ በገለጿቸው አንድ ወይም ከዚያ በላይ ግሬደሮች መገምገም (ስለ ግሬደሮች ተጨማሪ ይወቁ)
በውጤቶቹ ላይ በመመርኮዝ የweight ዝማኔዎችን ማስላት እና መተግበር (backpropagation)።
ያዋቀሯቸውን ማንኛውንም የማረጋገጫ (evaluation) ደረጃዎች ማስኬድ።
አብዛኞቹ ግሬደሮች ለማስኬድ “ነፃ” ናቸው፤ ይህም ማለት ከዋናው የስልጠና ዑደት ጊዜ ውስጥ ከሚጨምሩት ጊዜ ውጭ ለአጠቃቀማቸው ተጨማሪ ክፍያ አናስከፍልም። ከዚህ የተለየው ለሞዴል ግሬደሮች ነው፤ በዚህ ጊዜ እነዚያ ግሬደሮች በላይ በተጠቀሱት እንቅስቃሴዎች የሚጠቀሙባቸውን tokenዎችም እንቆጥራለን። እነዚህ tokenዎች በኢንቮይስዎ ላይ እንደ የተለየ መስመር ንጥል ይታያሉ። በሞዴል ግሬደሮች የተጠቀሙ tokenዎች በመደበኛ የinference ተመኖች ይከፈላሉ (የOpenAI ዋጋ አሰጣጥ)።
ክፍያ የማናስከፍልበት ነገር
ለሚከተሉት በተወሰደ ጊዜ ክፍያ አናስከፍልም፦
ስልጠና ከመጀመሩ በፊት የእርስዎን ዳታ ስብስብ ማረጋገጥ ወይም መመርመር።
በዳታ ስብስብዎ ላይ የደህንነት ምርመራዎች።
የኮምፒውት ሀብቶችን ለማግኘት በወረፋ ውስጥ መጠበቅ።
የሞዴል weights ወይም የዳታ ስብስቦችን ማውረድ።
የእርስዎን ዳታ ስብስብ ወደ እኛ የስልጠና ቅርጽ ማዘጋጀት (rendering)።
ፋይን-ቱን የተደረገውን ሞዴልዎን ከስልጠና በኋላ የደህንነት ግምገማ ማካሄድ።
በእኛ በኩል ባለ ስህተት ምክንያት የስልጠና ሥራ ከጠፋ (ለምሳሌ፣ አንድ ሰራተኛ ከተሰናከለ እና ወደ ቀድሞ checkpoint መመለስ ካስፈለገው)፣ ለጠፋው የኮምፒውት ጊዜ ወይም የግሬደር token ክፍያ አይጣልብዎትም። በሚቀጥለው ክፍል ላይ ስለዚህ ተጨማሪ ዝርዝር አለ።
Captured forward progress እና የክፍያ ክስተቶች
ስልጠና ለሞዴልዎ ብዙ ትንንሽ ማሻሻያዎችን ያካትታል። ከእነዚህ ማሻሻያዎች ስንቶቹ በተሳካ ሁኔታ እንደሚጠናቀቁ እንከታተላለን። ክፍያዎች ከእነዚህ የተሳኩ ማሻሻያዎች ጋር ተያይዞ ባለው የኮምፒውት ጊዜ እና የግሬደር token ላይ የተመሠረቱ ናቸው።
ከሚከተሉት "የክፍያ ክስተቶች" አንዱ ሲከሰት ክፍያ እናወጣለን፦
ስልጠናው በተሳካ ሁኔታ ይጠናቀቃል።
ስልጠናውን ለአፍታ ያቆማሉ።
ስልጠናውን ይሰርዛሉ።
ስልጠናው ይከሽፋል።
እያንዳንዱ ክፍያ ከመጨረሻው ክፍያ ጀምሮ የተሠራውን ተጨማሪ ሥራ ይሸፍናል። ለምሳሌ፦
ሂደትን ለአፍታ ካቆሙ፣ checkpoint እናስቀምጣለን እና ከመጨረሻው ክፍያ ጀምሮ ለተጠቀሙት የኮምፒውት ጊዜ እና የግሬደር token ክፍያ እናስከፍላለን።
እንደገና ሲቀጥሉ፣ ስልጠናው ከcheckpoint ይቀጥላል። ቀጣዩ ክፍያ (ሲጠናቀቅ፣ እንደገና ለአፍታ ሲቆም፣ ሲሰረዝ ወይም ሲከሽፍ) ከመቀጠሉ በኋላ ለተሠራው ተጨማሪ ሥራ ብቻ ይሆናል።
ሂደትን ከሰረዙ፣ እስከ ስረዛው ድረስ ለተሠራው ሥራ ክፍያ እናስከፍላለን።
ስልጠናው ከከሸፈ እና ከመጨረሻው ክፍያ በኋላ የተሠራ ሥራ ከጠፋ፣ ለጠፋው ክፍል ክፍያ አይጣልም።
ይህ የ"captured forward progress" አቀራረብ በሞዴልዎ ውስጥ ለተጠበቀ ወይም በፈቃድዎ ለተዉት ሥራ ብቻ እንዲከፍሉ ያረጋግጣል።
የሥራውን ሂደት መመልከት
የRFT ሥራዎች እስከ አሁኑ ደረጃ ያለውን የሥራውን አጠቃላይ አጠቃቀም የሚመዘግብ usage_metrics የተባለ መስክ አላቸው። ይህም ለሥልጠና የዋለውን ጊዜ እና በሥራው ላይ ባሉ ሁሉም የሞዴል ገምጋሚዎች ጥቅም ላይ የዋሉትን token-ዎች በሙሉ ያካትታል። ይህን መስክ በAPI (GET /v1/fine_tuning/jobs/{job_id}) ወይም በየማስተካከያ ዳሽቦርድ በኩል መመርመር ይቻላል።
የሥልጠና ጊዜን የሚነኩ ምክንያቶች
ክፍያው በጊዜ ላይ የተመሠረተ ስለሆነ፣ የውቅር ምርጫዎችዎ ወጪውን በቀጥታ ይነካሉ። ዋና ዋናዎቹ ምክንያቶች፦
የችግሩ ክብደት፦ የውሂብ ስብስብዎ ከባድ ችግሮችን የያዘ ከሆነ፣ ሞዴሉ በእያንዳንዱ ችግር ላይ ለማመዛዘን ብዙ ጊዜ ሊወስድ ስለሚችል እያንዳንዱን ናሙና ለማዘጋጀት የሚወስደው ጊዜ ይጨምራል።
የስሌት ጥንካሬ፦ የcompute_multiplier ልዕለ-መለኪያ በእያንዳንዱ የሥልጠና ደረጃ ምን ያህል ስሌት እንደሚከናወን ይቆጣጠራል። ከፍተኛ እሴቶች ሞዴሉ በእያንዳንዱ የውሂብ ነጥብ ላይ በበለጠ ዝርዝር እንዲያመዛዝን ያደርጉታል፤ ይህም እያንዳንዱን ደረጃ ያዘገየዋል።
የማረጋገጫ ቅንብሮች፦
የገምጋሚው አፈጻጸም፦
ትላልቅ ወይም የበለጠ ብቃት ያላቸው የሞዴል ገምጋሚዎች ከትናንሾቹ ይልቅ ደረጃ ለመስጠት ረዘም ያለ ጊዜ ይወስዳሉ። ለምሳሌ፣ በማመዛዘን ሞዴል ደረጃ መስጠት ማመዛዘን በማይጠቀም ሞዴል ከመገምገም 10 እጥፍ ረዘም ያለ ጊዜ ሊወስድ ይችላል።
ውስብስብ የPython የደረጃ አሰጣጥ ተግባራት ከቀላል ተግባራት ይልቅ ለመሥራት ረዘም ያለ ጊዜ ይወስዳሉ።
እነዚህ ቅንብሮች ወጪን፣ ፍጥነትን እና የሞዴል ጥራትን እንደ ፍላጎትዎ ሚዛናዊ እንዲያደርጉ ያስችሉዎታል። ለምሳሌ፣ ተደጋጋሚ ማረጋገጥ ችግሮችን ቀደም ብሎ ሊያገኝ ይችላል፣ ነገር ግን ወጪውን ይጨምራል። የበለጠ የላቀ ሞዴል በመጠቀም ደረጃ መስጠት የግምገማውን ትክክለኛነት በእጅጉ ሊያሻሽል ይችላል፤ ሆኖም እያንዳንዱን የግምገማ ደረጃ ያዘገየዋል፣ የሥራዎቹንም ወጪ ይጨምራል።
ወጪን መቆጣጠር
ወጪዎን ለመቆጣጠር፦
ውቅርዎ በጊዜው ላይ የሚያሳድረውን ተጽዕኖ ለመረዳት አጭር ሂደቶችን በማስኬድ ይጀምሩ።
ተመጣጣኝ ብዛት ያላቸውን የማረጋገጫ ምሳሌዎች እና eval_samples ይጠቀሙ። ከሚያስፈልግዎ በላይ በተደጋጋሚ ከማረጋገጥ ይቆጠቡ።
የጥራት መስፈርቶችዎን የሚያሟላውን ትንሹን የገምጋሚ ሞዴል ይምረጡ።
ብጁ የPython ገምጋሚዎች ቀልጣፋ እንዲሆኑ ያድርጉ።
የመገጣጠም ፍጥነትንና ወጪን ለማመጣጠን compute_multiplierን ያስተካክሉ።
ሂደትዎን በዳሽቦርዱ ወይም በAPI በኩል ይከታተሉ። በማንኛውም ጊዜ ለጊዜው ማቆም ወይም መሰረዝ ይችላሉ።
ምሳሌዎች
የተሳካ የስልጠና ሂደት
| የስልጠና ጊዜ | የክፍያ ጊዜ | ሁኔታ | መግለጫ |
|---|---|---|---|
| 00:00 | 00:00 | – | ተጠቃሚ API በመጠቀም የRFT ስራ ይፈጥራል |
| 00:10 | 00:00 | VALIDATING_FILES | 10 ደቂቃዎች ዳታሴትን በማረጋገጥ ላይ ዋሉ |
| 00:30 | 00:00 | VALIDATING_FILES | 20 ደቂቃዎች የዳታሴት ደህንነት ፍተሻዎችን በማስኬድ ላይ ዋሉ |
| 01:00 | 00:00 | QUEUED | 30 ደቂቃዎች የሚገኝ ወርከር በመጠበቅ ላይ ዋሉ |
| 01:30 | 00:00 | RUNNING | 30 ደቂቃዎች ስልጠናን በማዘጋጀት (weights ማውረድ፣ ቅድመ-ሂደት ወዘተ) ላይ ዋሉ |
| 05:30 | 04:00 | RUNNING | 4 ሰዓታት በስልጠና ላይ ዋሉ |
| 06:00 | 04:00 | RUNNING | 30 ደቂቃዎች የተገኘውን ሞዴል የደህንነት ግምገማዎች በማስኬድ ላይ ዋሉ |
| 06:00 | 04:00 | SUCCEEDED | ስልጠናው ይጠናቀቃል |
በዚህ ሁኔታ፣ ጠቅላላው የwall-clock ጊዜ 6 ሰዓታት ነው፣ ነገር ግን ክፍያ የሚከፈልባቸው 4 ሰዓታት ብቻ ናቸው። ወጪው 4 ሰዓታት × $100/ሰዓት = $400 ይሆናል።
የከሸፈ ስራ ምሳሌ
በዚህ ምሳሌ፣ runው ለ2 ሰዓታት ያሰለጥናል፣ checkpoint ይጽፋል፣ ለተጨማሪ 1 ሰዓት ያሰለጥናል፣ ነገር ግን ከዚያ ይከሽፋል። እስከ checkpoint ድረስ ያሉት 2 ሰዓታት የስልጠና ጊዜ ብቻ ክፍያ ይከፈልባቸዋል።
| የስልጠና ጊዜ | የክፍያ ጊዜ | ሁኔታ | መግለጫ |
|---|---|---|---|
| 00:00 | 00:00 | – | ተጠቃሚ API በመጠቀም የRFT ስራ ይፈጥራል |
| 00:10 | 00:00 | VALIDATING_FILES | 10 ደቂቃዎች ዳታሴትን በማረጋገጥ ላይ ዋሉ |
| 00:30 | 00:00 | VALIDATING_FILES | 20 ደቂቃዎች የዳታሴት ደህንነት ፍተሻዎችን በማስኬድ ላይ ዋሉ |
| 01:00 | 00:00 | QUEUED | 30 ደቂቃዎች የሚገኝ ወርከር በመጠበቅ ላይ ዋሉ |
| 01:30 | 00:00 | RUNNING | 30 ደቂቃዎች ስልጠናን በማዘጋጀት (weights ማውረድ፣ ቅድመ-ሂደት ወዘተ) ላይ ዋሉ |
| 03:30 | 02:00 | RUNNING | 2 ሰዓታት በስልጠና ላይ ዋሉ |
| 03:30 | 02:00 | RUNNING | በደረጃ 5 ላይ checkpoint ተፈጥሯል |
| 04:30 | 02:00 | RUNNING | በደረጃ 8 ላይ በውስጣዊ ስህተት ምክንያት ስልጠናው ይከሽፋል (ከተጨማሪ 1 ሰዓት በኋላ) |
| 04:30 | 02:00 | RUNNING | 30 ደቂቃዎች checkpointን በመገምገም እና በማረጋገጥ ላይ ዋሉ |
| 04:30 | 02:00 | SUCCEEDED | ስራው ይጠናቀቃል (ከቅርብ ጊዜው checkpoint ጋር) |
በአጠቃላይ 3 ሰዓታት በስልጠና ላይ ቢውሉም፣ በጥቅም ላይ ሊውል በሚችል checkpoint ውስጥ “የተያዙት” 2 ሰዓታት ብቻ ናቸው፣ እነሱም ክፍያ ይከፈልባቸዋል። በክሽፈቱ ምክንያት የጠፋው የአንድ ሰዓት የስልጠና ስራ የእርስዎ ኃላፊነት አይደለም። ወጪው 2 ሰዓታት × $100/ሰዓት = $200 ይሆናል።
ተደጋጋሚ ጥያቄዎች
ክፍያ የሚከፍለኝ መቼ ነው?
ሂደትዎ ሲጠናቀቅ፣ ለጊዜው ሲቆም፣ ሲሰረዝ ወይም ሳይሳካ ሲቀር ክፍያ እናስከፍላለን። እያንዳንዱ ክፍያ ካለፈው ክፍያ በኋላ የተሠራውን ሥራ ይሸፍናል።
run ከከሸፈ እከፍላለሁ?
run በእኛ ስህተት ምክንያት ከከሸፈ እና ማንኛውም የቅርብ ጊዜ የስልጠና ስራ ከጠፋ፣ ለጠፋው ክፍል ክፍያ አይከፈልብዎትም። runን ከሰረዙ፣ እስከ መሰረዝ ድረስ ለተሰራው ስራ ክፍያ ይከፍላሉ።
የgrader ሞዴል tokenዎች እንዴት ክፍያ ይከፈልባቸዋል?
ያዋቀሯቸው ማንኛውም የሞዴል ግሬደሮች የሚጠቀሙባቸውን tokenዎች እንቆጥራለን። ስልጠናው ከተጠናቀቀ በኋላ፣ ለእነዚያ tokenዎች በመደበኛ የtoken-ተኮር ተመኖቻችን ክፍያ እናስከፍላለን።
runን ማቆም እና እንደገና መቀጠል እችላለሁ?
አዎ። ሲያቆሙ፣ checkpoint እናስቀምጣለን እና እስካሁን ለተሰራው ስራ ክፍያ እናስከፍላለን። እንደገና ሲቀጥሉ፣ ከቀጠሉ በኋላ ለተሰራ ተጨማሪ ስራ ብቻ ክፍያ ይከፍላሉ።
ስለ Reinforcement Fine‑Tuning ክፍያ ሌሎች ጥያቄዎች ካሉዎት፣ የድጋፍ ቡድናችንን ያግኙ።
