RFT (күшейтпелі баптау) үшін төлем қалай есептеледі
Reinforcement Fine‑Tuning (RFT (күшейтпелі баптау)) OpenAI-дың ойлайтын модельдерінің өнімділігін күшейтпелі оқыту арқылы оңтайландыруға мүмкіндік береді. Оқыту деректер жинағындағы токен саны бойынша ақы алынатын бақылаулы немесе қалаулы нәтижеге қарай баптау ұсыныстарымыздан айырмашылығы, RFT (күшейтпелі баптау) үшін төлем оқыту іске қосылымының негізгі машиналық оқыту жұмысын орындауға жұмсаған уақытына қарай есептеледі.
Бұл нұсқаулықта қандай оқу уақыты төленетін болып есептелетіні, кідірістер мен тоқтатуларды қалай өңдейтініміз және баптау таңдауларыңыз құнға қалай әсер ететіні түсіндіріледі.
Баға
Есептеу:
o4-mini-2025-04-16үшін негізгі оқыту цикліндегі нақты уақыттың әр сағатына $100. Төлемдер секундқа дейін пропорционалды есептеледі және шотта үтірден кейін екі таңбаға дейін дөңгелектенеді (мысалы, 2.55 сағат).Бағалаушы модельді пайдалану: Егер оқыту кезінде шығыстарды “бағалау” үшін OpenAI моделін пайдалансаңыз, сол бағалау шақырулары тұтынған токендер оқыту аяқталғаннан кейін біздің стандарт API тарифтерімен бөлек төленеді.
Біз тек модельді шын мәнінде жаңартатын оқыту жұмысы үшін ғана ақы аламыз (мұны біз "сақталған ілгерілеу" деп атаймыз).
Не үшін шот шығарамыз
Біз оқыту орындаушысы модельді белсенді түрде оқытуға жұмсаған уақыт үшін шот шығарамыз, атап айтқанда:
Дәл баптау процесі кезінде модельден үлгілер жасау («rollouts» деп аталады)
Осы нәтижелерді тапсырмада сіз анықтаған бір немесе бірнеше бағалаушымен бағалау (бағалаушылар туралы толығырақ)
Бағаларға негізделген салмақ жаңартуларын есептеу және қолдану (кері таралу).
Сіз баптаған кез келген тексеру (бағалау) қадамдарын орындау.
Бағалаушылардың көпшілігін іске қосу «тегін», яғни олар негізгі оқыту цикліне қосатын уақыттан тыс пайдаланылғаны үшін қосымша ақы алмаймыз. Бұдан ерекшелік — модель бағалаушылары: біз жоғарыдағы әрекеттер кезінде сол бағалаушылар тұтынатын токендерді де есептейміз. Бұл токендер шотыңызда бөлек жол ретінде көрсетіледі. Модель бағалаушылары тұтынған токендер қалыпты инференс тарифтері бойынша есептеледі (OpenAI бағалары).
Біз не үшін ақы алмаймыз
Біз мына уақыт үшін ақы алмаймыз:
Оқыту басталғанға дейін деректер жинағын тексеру немесе қарау.
Деректер жинағындағы қауіпсіздік тексерулері.
Есептеу ресурстары кезегінде күту.
Модель салмақтарын немесе деректер жинақтарын жүктеп алу.
Деректер жинағын біздің оқыту пішімімізге дайындау (rendering).
fine-tuning жасалған модельді оқытудан кейінгі қауіпсіздік бағалаулары.
Егер оқу жұмысы біздің жақтағы қате салдарынан жоғалса (мысалы, worker істен шығып, алдыңғы checkpoint-ке қайтуға тура келсе), жоғалған есептеу уақыты немесе бағалаушы токендері үшін ақы алынбайды. Бұл туралы толығырақ келесі бөлімде.
Сақталған ілгерілеу және төлем оқиғалары
Оқыту модельге жасалатын көптеген шағын жаңартулардан тұрады. Біз осы жаңартулардың қаншасы сәтті аяқталғанын қадағалаймыз. Төлемдер осы сәтті жаңартуларға қатысты есептеу уақыты мен бағалаушы токендеріне негізделеді.
Төмендегі “төлем оқиғаларының” бірі болғанда біз ақы есептейміз:
Оқыту сәтті аяқталады.
Сіз оқытуды кідіртесіз.
Сіз оқытуды тоқтатасыз.
Оқыту сәтсіз аяқталады.
Әр төлем алдыңғы төлемнен бергі қосымша жұмысты қамтиды. Мысалы:
Егер іске қосылымды кідіртсеңіз, біз checkpoint сақтап, соңғы төлемнен бергі пайдаланылған есептеу уақыты мен бағалаушы токендері үшін ақы аламыз.
Қайта жалғастырғанда, оқыту checkpoint-тен жалғасады. Келесі төлем (аяқталу, тағы бір кідірту, тоқтату немесе сәтсіздік кезінде) тек қайта жалғастырғаннан кейінгі қосымша жұмысты ғана қамтиды.
Егер іске қосылымды тоқтатсаңыз, тоқтатылғанға дейінгі жұмыс үшін ақы аламыз.
Егер оқыту сәтсіз аяқталып, соңғы төлемнен бергі жұмыс жоғалса, жоғалған бөлік үшін ақы алынбайды.
Бұл “сақталған ілгерілеу” тәсілі модельде сақталатын немесе өзіңіз әдейі бас тартқан жұмыс үшін ғана төлеуіңізді қамтамасыз етеді.
Тапсырма барысын көру
RFT (күшейтпелі баптау) тапсырмаларында ағымдағы қадамға дейінгі тапсырманың жалпы пайдаланылуын құжаттайтын usage_metrics атты өріс бар. Бұған оқытуға жұмсалған уақыт және тапсырмадағы барлық модель бағалаушылары пайдаланған барлық токен кіреді. Бұл өрісті API арқылы (GET /v1/fine_tuning/jobs/{job_id}) немесе дәл баптау бақылау тақтасы арқылы тексеруге болады.
Оқыту уақытына әсер ететін факторлар
Төлем уақытқа негізделгендіктен, сіздің баптау таңдауларыңыз құнға тікелей әсер етеді. Негізгі факторлар мыналар:
Мәселенің күрделілігі: егер деректер жинағыңыз күрделі есептерден тұрса, модель әр есеп бойынша ой қорытуға көбірек уақыт жұмсайды, бұл әр үлгіні жасауға кететін уақытты арттырады.
Есептеу қарқындылығы:
compute_multiplierгиперпараметрі әр оқу қадамына қанша есептеу орындайтыныңызды басқарады. Жоғары мәндер модельді әр дерек нүктесі бойынша толығырақ ой қорытуға ынталандырады, сондықтан әр қадам баяуырақ орындалады.Валидация баптаулары:
Үлкенірек валидация жиыны бағалауға кететін уақытты арттырады.
eval_samplesмәнін арттыру (әр валидация мысалына бағаланатын модель шығыстарының саны) валидация уақытын арттырады.Валидацияны жиірек іске қосу (
eval_intervalтөмен болғанда) валидацияға кететін уақыт үлесін арттырады.
Бағалаушы өнімділігі:
Ірірек не қабілеті жоғарырақ бағалаушы модельдер кішіректерге қарағанда бағаны қайтаруға ұзағырақ уақыт алады. Мысалы, ойлайтын модельмен бағалау ойламайтын модельмен бағалаудан 10 есе ұзағырақ болуы мүмкін.
Күрделі Python бағалау функциялары қарапайымдарына қарағанда ұзағырақ орындалады.
Бұл баптаулар құн, жылдамдық және модель сапасы арасында ымыра жасауға мүмкіндік береді. Мысалы, жиі валидация мәселелерді ертерек анықтауы мүмкін, бірақ құнды арттырады. Неғұрлым озық модельмен бағалау бағалау дәлдігін едәуір жақсарта алады, бірақ әр бағалау қадамын баяулатып, тапсырмаларды қымбаттатады.
Құнды басқару
Шығынды бақылау үшін:
Баптауларыңыз уақытқа қалай әсер ететінін түсіну үшін қысқарақ іске қосылымдардан бастаңыз.
Валидация мысалдарының және
eval_samplesсаны орынды болсын. Қажеттен жиі валидация жасамаңыз.Сапа талаптарыңызға сай келетін ең кіші бағалаушы модельді таңдаңыз.
Теңшелетін Python бағалаушыларын тиімді ұстаңыз.
Жинақталу жылдамдығы мен құн арасын теңгеру үшін
compute_multiplierмәнін реттеңіз.Іске қосылымды бақылау тақтасында не API арқылы қадағалаңыз. Кез келген уақытта кідіртуге не тоқтатуға болады.
Мысалдар
Сәтті оқыту іске қосуы
| Оқыту уақыты | Есептелетін уақыт | Күйі | Сипаттама |
|---|---|---|---|
| 00:00 | 00:00 | – | Пайдаланушы API арқылы RFT (күшейтпелі баптау) тапсырмасын жасайды |
| 00:10 | 00:00 | VALIDATING_FILES | Деректер жиынын тексеруге 10 минут жұмсалды |
| 00:30 | 00:00 | VALIDATING_FILES | Деректер жиынының қауіпсіздік тексерулеріне 20 минут жұмсалды |
| 01:00 | 00:00 | QUEUED | Қолжетімді орындаушыны күтуге 30 минут жұмсалды |
| 01:30 | 00:00 | RUNNING | Оқытуды орнатуға 30 минут жұмсалды (салмақтарды жүктеп алу, алдын ала өңдеу және т.б.) |
| 05:30 | 04:00 | RUNNING | Оқытуға 4 сағат жұмсалды |
| 06:00 | 04:00 | RUNNING | Нәтижедегі модельдің қауіпсіздік бағалауларын орындауға 30 минут жұмсалды |
| 06:00 | 04:00 | SUCCEEDED | Оқыту аяқталады |
Бұл жағдайда жалпы нақты өткен уақыт 6 сағат, бірақ тек 4 сағатқа ғана төлем алынады. Құны 4 сағат × $100/сағат = $400 болады.
Сәтсіз тапсырма мысалы
Бұл мысалда іске қосу 2 сағат оқытады, бақылау нүктесін жазады, тағы 1 сағат оқытады, бірақ кейін сәтсіз аяқталады. Бақылау нүктесіне дейінгі 2 сағаттық оқыту ғана төленеді.
| Оқыту уақыты | Есептелетін уақыт | Күйі | Сипаттама |
|---|---|---|---|
| 00:00 | 00:00 | – | Пайдаланушы API арқылы RFT (күшейтпелі баптау) тапсырмасын жасайды |
| 00:10 | 00:00 | VALIDATING_FILES | Деректер жиынын тексеруге 10 минут жұмсалды |
| 00:30 | 00:00 | VALIDATING_FILES | Деректер жиынының қауіпсіздік тексерулеріне 20 минут жұмсалды |
| 01:00 | 00:00 | QUEUED | Қолжетімді орындаушыны күтуге 30 минут жұмсалды |
| 01:30 | 00:00 | RUNNING | Оқытуды орнатуға 30 минут жұмсалды (салмақтарды жүктеп алу, алдын ала өңдеу және т.б.) |
| 03:30 | 02:00 | RUNNING | Оқытуға 2 сағат жұмсалды |
| 03:30 | 02:00 | RUNNING | 5-қадамда бақылау нүктесі жасалды |
| 04:30 | 02:00 | RUNNING | Оқыту 8-қадамда ішкі қатеге байланысты сәтсіз аяқталады (тағы 1 сағаттан кейін) |
| 04:30 | 02:00 | RUNNING | Бақылау нүктесін бағалауға және тексеруге 30 минут жұмсалды |
| 04:30 | 02:00 | SUCCEEDED | Тапсырма аяқталады (соңғы бақылау нүктесімен) |
Жалпы алғанда оқытуға 3 сағат жұмсалса да, пайдалануға болатын бақылау нүктесінде тек 2 сағат «қамтылған» және сол үшін шот шығарылады. Сәтсіздікке байланысты жоғалған бір сағаттық оқыту жұмысы үшін сіз жауапты емессіз. Құны 2 сағат × $100/сағат = $200 болады.
Жиі қойылатын сұрақтар
Төлем қашан алынады?
Іске қосу аяқталғанда, кідіртілгенде, бас тартылғанда немесе сәтсіз аяқталғанда шот шығарамыз. Әр шот алдыңғы шоттан бері орындалған жұмысты қамтиды.
Іске қосу сәтсіз болса, төлеймін бе?
Егер іске қосу біздің қатемізден сәтсіз аяқталып, жақындағы оқыту жұмысының бір бөлігі жоғалса, жоғалған бөлік үшін ақы алынбайды. Егер іске қосудан бас тартсаңыз, бас тартқанға дейін орындалған жұмыс үшін ақы алынады.
Бағалаушы модель токендері қалай есептеледі?
Сіз баптаған кез келген модель бағалаушылары пайдаланған токендерді есептейміз. Оқыту аяқталғаннан кейін сол токендер үшін стандартты токендік тарифтеріміз бойынша шот шығарамыз.
Іске қосуды кідіртіп, қайта жалғастыра аламын ба?
Иә. Кідірткен кезде бақылау нүктесін сақтаймыз және осы уақытқа дейін орындалған жұмыс үшін ақы аламыз. Қайта жалғастырған кезде тек жалғастырғаннан кейін орындалған қосымша жұмыс үшін ғана ақы алынады.
Reinforcement Fine‑Tuning бойынша шот выставление туралы басқа сұрақтарыңыз болса, қолдау көрсету тобымызға хабарласыңыз.
