OpenAI
Бұл бет машиналық аударма арқылы жасалған. Түпнұсқа ағылшын мақаласын қараңыз.

Reinforcement Fine Tuning API үшін төлем нұсқаулығы

RFT API үшін төлем қалай жұмыс істейді

Жаңартылған: 15 days ago

RFT (күшейтпелі баптау) үшін төлем қалай есептеледі

Reinforcement Fine‑Tuning (RFT (күшейтпелі баптау)) OpenAI-дың ойлайтын модельдерінің өнімділігін күшейтпелі оқыту арқылы оңтайландыруға мүмкіндік береді. Оқыту деректер жинағындағы токен саны бойынша ақы алынатын бақылаулы немесе қалаулы нәтижеге қарай баптау ұсыныстарымыздан айырмашылығы, RFT (күшейтпелі баптау) үшін төлем оқыту іске қосылымының негізгі машиналық оқыту жұмысын орындауға жұмсаған уақытына қарай есептеледі.

Бұл нұсқаулықта қандай оқу уақыты төленетін болып есептелетіні, кідірістер мен тоқтатуларды қалай өңдейтініміз және баптау таңдауларыңыз құнға қалай әсер ететіні түсіндіріледі.

Баға белгілеу

  • Есептеу: o4-mini-2025-04-16 моделінің негізгі оқыту циклінде жұмсалған нақты уақыттың әр сағатына $100. Ақы секундқа дейін пропорционалды есептеліп, шотта екі ондық таңбаға дейін дөңгелектенеді (мысалы, 2,55 сағат).

  • Модель-бағалағышты пайдалану: оқыту кезінде нәтижелерді «бағалау» үшін OpenAI моделін пайдалансаңыз, осы бағалау сұраулары тұтынған токендер оқыту аяқталғаннан кейін стандартты API тарифтері бойынша бөлек есептеледі.

Біз тек моделіңізді іс жүзінде жаңартатын оқыту жұмысы үшін ақы аламыз (мұны «тіркелген ілгерілеу» деп атаймыз).

Не үшін шот шығарамыз

Біз оқыту орындаушысы модельді белсенді түрде оқытуға жұмсаған уақыт үшін шот шығарамыз, атап айтқанда:

  • Дәл баптау процесі кезінде модельден үлгілер жасау («rollouts» деп аталады)

  • Осы нәтижелерді тапсырмада сіз анықтаған бір немесе бірнеше бағалаушымен бағалау (бағалаушылар туралы толығырақ)

  • Бағаларға негізделген салмақ жаңартуларын есептеу және қолдану (кері таралу).

  • Сіз баптаған кез келген тексеру (бағалау) қадамдарын орындау.

Бағалаушылардың көпшілігін іске қосу «тегін», яғни олар негізгі оқыту цикліне қосатын уақыттан тыс пайдаланылғаны үшін қосымша ақы алмаймыз. Бұдан ерекшелік — модель бағалаушылары: біз жоғарыдағы әрекеттер кезінде сол бағалаушылар тұтынатын токендерді де есептейміз. Бұл токендер шотыңызда бөлек жол ретінде көрсетіледі. Модель бағалаушылары тұтынған токендер қалыпты инференс тарифтері бойынша есептеледі (OpenAI бағалары).

Біз не үшін ақы алмаймыз

Біз мына уақыт үшін ақы алмаймыз:

  • Оқыту басталғанға дейін деректер жинағын тексеру немесе қарау.

  • Деректер жинағындағы қауіпсіздік тексерулері.

  • Есептеу ресурстары кезегінде күту.

  • Модель салмақтарын немесе деректер жинақтарын жүктеп алу.

  • Деректер жинағын біздің оқыту пішімімізге дайындау (rendering).

  • fine-tuning жасалған модельді оқытудан кейінгі қауіпсіздік бағалаулары.

Егер оқу жұмысы біздің жақтағы қате салдарынан жоғалса (мысалы, worker істен шығып, алдыңғы checkpoint-ке қайтуға тура келсе), жоғалған есептеу уақыты немесе бағалаушы токендері үшін ақы алынбайды. Бұл туралы толығырақ келесі бөлімде.

Сақталған ілгерілеу және төлем оқиғалары

Оқыту модельге жасалатын көптеген шағын жаңартулардан тұрады. Біз осы жаңартулардың қаншасы сәтті аяқталғанын қадағалаймыз. Төлемдер осы сәтті жаңартуларға қатысты есептеу уақыты мен бағалаушы токендеріне негізделеді.

Төмендегі “төлем оқиғаларының” бірі болғанда біз ақы есептейміз:

  • Оқыту сәтті аяқталады.

  • Сіз оқытуды кідіртесіз.

  • Сіз оқытуды тоқтатасыз.

  • Оқыту сәтсіз аяқталады.

Әр төлем алдыңғы төлемнен бергі қосымша жұмысты қамтиды. Мысалы:

  • Егер іске қосылымды кідіртсеңіз, біз checkpoint сақтап, соңғы төлемнен бергі пайдаланылған есептеу уақыты мен бағалаушы токендері үшін ақы аламыз.

  • Қайта жалғастырғанда, оқыту checkpoint-тен жалғасады. Келесі төлем (аяқталу, тағы бір кідірту, тоқтату немесе сәтсіздік кезінде) тек қайта жалғастырғаннан кейінгі қосымша жұмысты ғана қамтиды.

  • Егер іске қосылымды тоқтатсаңыз, тоқтатылғанға дейінгі жұмыс үшін ақы аламыз.

  • Егер оқыту сәтсіз аяқталып, соңғы төлемнен бергі жұмыс жоғалса, жоғалған бөлік үшін ақы алынбайды.

Бұл “сақталған ілгерілеу” тәсілі модельде сақталатын немесе өзіңіз әдейі бас тартқан жұмыс үшін ғана төлеуіңізді қамтамасыз етеді.

Тапсырманың орындалу барысын көру

RFT (күшейтпелі баптау) тапсырмаларында ағымдағы қадамға дейінгі жалпы қолданыс көрсетілетін usage_metrics өрісі бар. Оған оқытуға жұмсалған уақыт пен тапсырмадағы барлық модель-бағалағыш пайдаланған токендердің барлығы кіреді. Бұл өрісті API арқылы (GET /v1/fine_tuning/jobs/{job_id}) немесе нақты баптау бақылау тақтасынан тексеруге болады.

Оқыту уақытына әсер ететін факторлар

Ақы уақытқа қарай есептелетіндіктен, конфигурация параметрлерін таңдауыңыз шығынға тікелей әсер етеді. Негізгі факторлар:

  • Есептердің күрделілігі: деректер жинағы күрделі есептерден тұрса, модель әр есепті ой қорытуға көбірек уақыт жұмсауы ықтимал, сондықтан әр үлгіні жасау ұзағырақ болады.

  • Есептеу қарқындылығы: compute_multiplier гиперпараметрі оқытудың әр қадамында қанша есептеу орындалатынын басқарады. Жоғары мәндер модельді әр дерек нүктесі бойынша ойын толығырақ қорытуға ынталандырады, сондықтан әр қадам баяуырақ орындалады.

  • Валидация параметрлері:

  • Бағалағыштың өнімділігі:

  • Ірі немесе мүмкіндігі жоғары модель-бағалағыштардың баға беруі шағын модельдерге қарағанда ұзағырақ уақыт алады. Мысалы, ойлайтын модельмен бағалау ой қорытуға арналмаған модельмен бағалаудан 10 есе ұзақ болуы мүмкін.

  • Күрделі Python бағалау функциялары қарапайым функцияларға қарағанда ұзағырақ орындалады.

Бұл параметрлер шығын, жылдамдық және модель сапасы арасында оңтайлы теңгерім таңдауға мүмкіндік береді. Мысалы, жиі валидациялау мәселелерді ертерек анықтауға көмектеседі, бірақ шығынды арттырады. Жетілдірілген модельмен бағалау дәлдікті айтарлықтай арттыруы мүмкін, бірақ әр бағалау қадамын баяулатып, тапсырмаларды қымбаттатады.

Шығынды басқару

Шығынды бақылау үшін:

  • Конфигурацияңыздың уақытқа қалай әсер ететінін түсіну үшін қысқа іске қосулардан бастаңыз.

  • Валидация мысалдары мен eval_samples санын орынды деңгейде ұстаңыз. Қажеттен жиі валидация жасамаңыз.

  • Сапа талаптарыңызға сай келетін ең шағын бағалағыш модельді таңдаңыз.

  • Арнаулы Python бағалағыштарының тиімді жұмыс істеуін қамтамасыз етіңіз.

  • Жинақталу жылдамдығы мен шығынды теңгеру үшін compute_multiplier мәнін реттеңіз.

  • Іске қосуды бақылау тақтасынан немесе API арқылы қадағалаңыз. Оны кез келген уақытта кідіртуге немесе тоқтатуға болады.

Мысалдар

Сәтті оқыту іске қосуы

Оқыту уақытыЕсептелетін уақытКүйіСипаттама
00:0000:00Пайдаланушы API арқылы RFT (күшейтпелі баптау) тапсырмасын жасайды
00:1000:00VALIDATING_FILESДеректер жиынын тексеруге 10 минут жұмсалды
00:3000:00VALIDATING_FILESДеректер жиынының қауіпсіздік тексерулеріне 20 минут жұмсалды
01:0000:00QUEUEDҚолжетімді орындаушыны күтуге 30 минут жұмсалды
01:3000:00RUNNINGОқытуды орнатуға 30 минут жұмсалды (салмақтарды жүктеп алу, алдын ала өңдеу және т.б.)
05:3004:00RUNNINGОқытуға 4 сағат жұмсалды
06:0004:00RUNNINGНәтижедегі модельдің қауіпсіздік бағалауларын орындауға 30 минут жұмсалды
06:0004:00SUCCEEDEDОқыту аяқталады

Бұл жағдайда жалпы нақты өткен уақыт 6 сағат, бірақ тек 4 сағатқа ғана төлем алынады. Құны 4 сағат × $100/сағат = $400 болады.

Сәтсіз тапсырма мысалы

Бұл мысалда іске қосу 2 сағат оқытады, бақылау нүктесін жазады, тағы 1 сағат оқытады, бірақ кейін сәтсіз аяқталады. Бақылау нүктесіне дейінгі 2 сағаттық оқыту ғана төленеді.

Оқыту уақытыЕсептелетін уақытКүйіСипаттама
00:0000:00Пайдаланушы API арқылы RFT (күшейтпелі баптау) тапсырмасын жасайды
00:1000:00VALIDATING_FILESДеректер жиынын тексеруге 10 минут жұмсалды
00:3000:00VALIDATING_FILESДеректер жиынының қауіпсіздік тексерулеріне 20 минут жұмсалды
01:0000:00QUEUEDҚолжетімді орындаушыны күтуге 30 минут жұмсалды
01:3000:00RUNNINGОқытуды орнатуға 30 минут жұмсалды (салмақтарды жүктеп алу, алдын ала өңдеу және т.б.)
03:3002:00RUNNINGОқытуға 2 сағат жұмсалды
03:3002:00RUNNING5-қадамда бақылау нүктесі жасалды
04:3002:00RUNNINGОқыту 8-қадамда ішкі қатеге байланысты сәтсіз аяқталады (тағы 1 сағаттан кейін)
04:3002:00RUNNINGБақылау нүктесін бағалауға және тексеруге 30 минут жұмсалды
04:3002:00SUCCEEDEDТапсырма аяқталады (соңғы бақылау нүктесімен)

Жалпы алғанда оқытуға 3 сағат жұмсалса да, пайдалануға болатын бақылау нүктесінде тек 2 сағат «қамтылған» және сол үшін шот шығарылады. Сәтсіздікке байланысты жоғалған бір сағаттық оқыту жұмысы үшін сіз жауапты емессіз. Құны 2 сағат × $100/сағат = $200 болады.

Жиі қойылатын сұрақтар

Ақша қашан алынады?

Іске қосу аяқталғанда, кідіртілгенде, тоқтатылғанда немесе сәтсіз аяқталғанда ақы есептейміз. Әр шотқа алдыңғы шоттан бері орындалған жұмыс кіреді.

Іске қосу сәтсіз болса, төлеймін бе?

Егер іске қосу біздің қатемізден сәтсіз аяқталып, жақындағы оқыту жұмысының бір бөлігі жоғалса, жоғалған бөлік үшін ақы алынбайды. Егер іске қосудан бас тартсаңыз, бас тартқанға дейін орындалған жұмыс үшін ақы алынады.

Бағалаушы модель токендері қалай есептеледі?

Сіз баптаған кез келген модель бағалаушылары пайдаланған токендерді есептейміз. Оқыту аяқталғаннан кейін сол токендер үшін стандартты токендік тарифтеріміз бойынша шот шығарамыз.

Іске қосуды кідіртіп, қайта жалғастыра аламын ба?

Иә. Кідірткен кезде бақылау нүктесін сақтаймыз және осы уақытқа дейін орындалған жұмыс үшін ақы аламыз. Қайта жалғастырған кезде тек жалғастырғаннан кейін орындалған қосымша жұмыс үшін ғана ақы алынады.

Reinforcement Fine‑Tuning бойынша шот выставление туралы басқа сұрақтарыңыз болса, қолдау көрсету тобымызға хабарласыңыз.

Бұл мақала пайдалы болды ма?