OpenAI
Бұл бет машиналық аударма арқылы жасалған. Түпнұсқа ағылшын мақаласын қараңыз.

Reinforcement Fine Tuning API үшін төлем нұсқаулығы

RFT API үшін төлем қалай жұмыс істейді

Жаңартылған: 7 days ago

RFT (күшейтпелі баптау) үшін төлем қалай есептеледі

Reinforcement Fine‑Tuning (RFT (күшейтпелі баптау)) OpenAI-дың ойлайтын модельдерінің өнімділігін күшейтпелі оқыту арқылы оңтайландыруға мүмкіндік береді. Оқыту деректер жинағындағы токен саны бойынша ақы алынатын бақылаулы немесе қалаулы нәтижеге қарай баптау ұсыныстарымыздан айырмашылығы, RFT (күшейтпелі баптау) үшін төлем оқыту іске қосылымының негізгі машиналық оқыту жұмысын орындауға жұмсаған уақытына қарай есептеледі.

Бұл нұсқаулықта қандай оқу уақыты төленетін болып есептелетіні, кідірістер мен тоқтатуларды қалай өңдейтініміз және баптау таңдауларыңыз құнға қалай әсер ететіні түсіндіріледі.

Баға

  • Есептеу: o4-mini-2025-04-16 үшін негізгі оқыту цикліндегі нақты уақыттың әр сағатына $100. Төлемдер секундқа дейін пропорционалды есептеледі және шотта үтірден кейін екі таңбаға дейін дөңгелектенеді (мысалы, 2.55 сағат).

  • Бағалаушы модельді пайдалану: Егер оқыту кезінде шығыстарды “бағалау” үшін OpenAI моделін пайдалансаңыз, сол бағалау шақырулары тұтынған токендер оқыту аяқталғаннан кейін біздің стандарт API тарифтерімен бөлек төленеді.

Біз тек модельді шын мәнінде жаңартатын оқыту жұмысы үшін ғана ақы аламыз (мұны біз "сақталған ілгерілеу" деп атаймыз).

Не үшін шот шығарамыз

Біз оқыту орындаушысы модельді белсенді түрде оқытуға жұмсаған уақыт үшін шот шығарамыз, атап айтқанда:

  • Дәл баптау процесі кезінде модельден үлгілер жасау («rollouts» деп аталады)

  • Осы нәтижелерді тапсырмада сіз анықтаған бір немесе бірнеше бағалаушымен бағалау (бағалаушылар туралы толығырақ)

  • Бағаларға негізделген салмақ жаңартуларын есептеу және қолдану (кері таралу).

  • Сіз баптаған кез келген тексеру (бағалау) қадамдарын орындау.

Бағалаушылардың көпшілігін іске қосу «тегін», яғни олар негізгі оқыту цикліне қосатын уақыттан тыс пайдаланылғаны үшін қосымша ақы алмаймыз. Бұдан ерекшелік — модель бағалаушылары: біз жоғарыдағы әрекеттер кезінде сол бағалаушылар тұтынатын токендерді де есептейміз. Бұл токендер шотыңызда бөлек жол ретінде көрсетіледі. Модель бағалаушылары тұтынған токендер қалыпты инференс тарифтері бойынша есептеледі (OpenAI бағалары).

Біз не үшін ақы алмаймыз

Біз мына уақыт үшін ақы алмаймыз:

  • Оқыту басталғанға дейін деректер жинағын тексеру немесе қарау.

  • Деректер жинағындағы қауіпсіздік тексерулері.

  • Есептеу ресурстары кезегінде күту.

  • Модель салмақтарын немесе деректер жинақтарын жүктеп алу.

  • Деректер жинағын біздің оқыту пішімімізге дайындау (rendering).

  • fine-tuning жасалған модельді оқытудан кейінгі қауіпсіздік бағалаулары.

Егер оқу жұмысы біздің жақтағы қате салдарынан жоғалса (мысалы, worker істен шығып, алдыңғы checkpoint-ке қайтуға тура келсе), жоғалған есептеу уақыты немесе бағалаушы токендері үшін ақы алынбайды. Бұл туралы толығырақ келесі бөлімде.

Сақталған ілгерілеу және төлем оқиғалары

Оқыту модельге жасалатын көптеген шағын жаңартулардан тұрады. Біз осы жаңартулардың қаншасы сәтті аяқталғанын қадағалаймыз. Төлемдер осы сәтті жаңартуларға қатысты есептеу уақыты мен бағалаушы токендеріне негізделеді.

Төмендегі “төлем оқиғаларының” бірі болғанда біз ақы есептейміз:

  • Оқыту сәтті аяқталады.

  • Сіз оқытуды кідіртесіз.

  • Сіз оқытуды тоқтатасыз.

  • Оқыту сәтсіз аяқталады.

Әр төлем алдыңғы төлемнен бергі қосымша жұмысты қамтиды. Мысалы:

  • Егер іске қосылымды кідіртсеңіз, біз checkpoint сақтап, соңғы төлемнен бергі пайдаланылған есептеу уақыты мен бағалаушы токендері үшін ақы аламыз.

  • Қайта жалғастырғанда, оқыту checkpoint-тен жалғасады. Келесі төлем (аяқталу, тағы бір кідірту, тоқтату немесе сәтсіздік кезінде) тек қайта жалғастырғаннан кейінгі қосымша жұмысты ғана қамтиды.

  • Егер іске қосылымды тоқтатсаңыз, тоқтатылғанға дейінгі жұмыс үшін ақы аламыз.

  • Егер оқыту сәтсіз аяқталып, соңғы төлемнен бергі жұмыс жоғалса, жоғалған бөлік үшін ақы алынбайды.

Бұл “сақталған ілгерілеу” тәсілі модельде сақталатын немесе өзіңіз әдейі бас тартқан жұмыс үшін ғана төлеуіңізді қамтамасыз етеді.

Тапсырма барысын көру

RFT (күшейтпелі баптау) тапсырмаларында ағымдағы қадамға дейінгі тапсырманың жалпы пайдаланылуын құжаттайтын usage_metrics атты өріс бар. Бұған оқытуға жұмсалған уақыт және тапсырмадағы барлық модель бағалаушылары пайдаланған барлық токен кіреді. Бұл өрісті API арқылы (GET /v1/fine_tuning/jobs/{job_id}) немесе дәл баптау бақылау тақтасы арқылы тексеруге болады.

Оқыту уақытына әсер ететін факторлар

Төлем уақытқа негізделгендіктен, сіздің баптау таңдауларыңыз құнға тікелей әсер етеді. Негізгі факторлар мыналар:

  • Мәселенің күрделілігі: егер деректер жинағыңыз күрделі есептерден тұрса, модель әр есеп бойынша ой қорытуға көбірек уақыт жұмсайды, бұл әр үлгіні жасауға кететін уақытты арттырады.

  • Есептеу қарқындылығы: compute_multiplier гиперпараметрі әр оқу қадамына қанша есептеу орындайтыныңызды басқарады. Жоғары мәндер модельді әр дерек нүктесі бойынша толығырақ ой қорытуға ынталандырады, сондықтан әр қадам баяуырақ орындалады.

  • Валидация баптаулары:

    • Үлкенірек валидация жиыны бағалауға кететін уақытты арттырады.

    • eval_samples мәнін арттыру (әр валидация мысалына бағаланатын модель шығыстарының саны) валидация уақытын арттырады.

    • Валидацияны жиірек іске қосу (eval_interval төмен болғанда) валидацияға кететін уақыт үлесін арттырады.

  • Бағалаушы өнімділігі:

    • Ірірек не қабілеті жоғарырақ бағалаушы модельдер кішіректерге қарағанда бағаны қайтаруға ұзағырақ уақыт алады. Мысалы, ойлайтын модельмен бағалау ойламайтын модельмен бағалаудан 10 есе ұзағырақ болуы мүмкін.

    • Күрделі Python бағалау функциялары қарапайымдарына қарағанда ұзағырақ орындалады.

Бұл баптаулар құн, жылдамдық және модель сапасы арасында ымыра жасауға мүмкіндік береді. Мысалы, жиі валидация мәселелерді ертерек анықтауы мүмкін, бірақ құнды арттырады. Неғұрлым озық модельмен бағалау бағалау дәлдігін едәуір жақсарта алады, бірақ әр бағалау қадамын баяулатып, тапсырмаларды қымбаттатады.

Құнды басқару

Шығынды бақылау үшін:

  • Баптауларыңыз уақытқа қалай әсер ететінін түсіну үшін қысқарақ іске қосылымдардан бастаңыз.

  • Валидация мысалдарының және eval_samples саны орынды болсын. Қажеттен жиі валидация жасамаңыз.

  • Сапа талаптарыңызға сай келетін ең кіші бағалаушы модельді таңдаңыз.

  • Теңшелетін Python бағалаушыларын тиімді ұстаңыз.

  • Жинақталу жылдамдығы мен құн арасын теңгеру үшін compute_multiplier мәнін реттеңіз.

  • Іске қосылымды бақылау тақтасында не API арқылы қадағалаңыз. Кез келген уақытта кідіртуге не тоқтатуға болады.

Мысалдар

Сәтті оқыту іске қосуы

Оқыту уақытыЕсептелетін уақытКүйіСипаттама
00:0000:00Пайдаланушы API арқылы RFT (күшейтпелі баптау) тапсырмасын жасайды
00:1000:00VALIDATING_FILESДеректер жиынын тексеруге 10 минут жұмсалды
00:3000:00VALIDATING_FILESДеректер жиынының қауіпсіздік тексерулеріне 20 минут жұмсалды
01:0000:00QUEUEDҚолжетімді орындаушыны күтуге 30 минут жұмсалды
01:3000:00RUNNINGОқытуды орнатуға 30 минут жұмсалды (салмақтарды жүктеп алу, алдын ала өңдеу және т.б.)
05:3004:00RUNNINGОқытуға 4 сағат жұмсалды
06:0004:00RUNNINGНәтижедегі модельдің қауіпсіздік бағалауларын орындауға 30 минут жұмсалды
06:0004:00SUCCEEDEDОқыту аяқталады

Бұл жағдайда жалпы нақты өткен уақыт 6 сағат, бірақ тек 4 сағатқа ғана төлем алынады. Құны 4 сағат × $100/сағат = $400 болады.

Сәтсіз тапсырма мысалы

Бұл мысалда іске қосу 2 сағат оқытады, бақылау нүктесін жазады, тағы 1 сағат оқытады, бірақ кейін сәтсіз аяқталады. Бақылау нүктесіне дейінгі 2 сағаттық оқыту ғана төленеді.

Оқыту уақытыЕсептелетін уақытКүйіСипаттама
00:0000:00Пайдаланушы API арқылы RFT (күшейтпелі баптау) тапсырмасын жасайды
00:1000:00VALIDATING_FILESДеректер жиынын тексеруге 10 минут жұмсалды
00:3000:00VALIDATING_FILESДеректер жиынының қауіпсіздік тексерулеріне 20 минут жұмсалды
01:0000:00QUEUEDҚолжетімді орындаушыны күтуге 30 минут жұмсалды
01:3000:00RUNNINGОқытуды орнатуға 30 минут жұмсалды (салмақтарды жүктеп алу, алдын ала өңдеу және т.б.)
03:3002:00RUNNINGОқытуға 2 сағат жұмсалды
03:3002:00RUNNING5-қадамда бақылау нүктесі жасалды
04:3002:00RUNNINGОқыту 8-қадамда ішкі қатеге байланысты сәтсіз аяқталады (тағы 1 сағаттан кейін)
04:3002:00RUNNINGБақылау нүктесін бағалауға және тексеруге 30 минут жұмсалды
04:3002:00SUCCEEDEDТапсырма аяқталады (соңғы бақылау нүктесімен)

Жалпы алғанда оқытуға 3 сағат жұмсалса да, пайдалануға болатын бақылау нүктесінде тек 2 сағат «қамтылған» және сол үшін шот шығарылады. Сәтсіздікке байланысты жоғалған бір сағаттық оқыту жұмысы үшін сіз жауапты емессіз. Құны 2 сағат × $100/сағат = $200 болады.

Жиі қойылатын сұрақтар

Төлем қашан алынады?

Іске қосу аяқталғанда, кідіртілгенде, бас тартылғанда немесе сәтсіз аяқталғанда шот шығарамыз. Әр шот алдыңғы шоттан бері орындалған жұмысты қамтиды.

Іске қосу сәтсіз болса, төлеймін бе?

Егер іске қосу біздің қатемізден сәтсіз аяқталып, жақындағы оқыту жұмысының бір бөлігі жоғалса, жоғалған бөлік үшін ақы алынбайды. Егер іске қосудан бас тартсаңыз, бас тартқанға дейін орындалған жұмыс үшін ақы алынады.

Бағалаушы модель токендері қалай есептеледі?

Сіз баптаған кез келген модель бағалаушылары пайдаланған токендерді есептейміз. Оқыту аяқталғаннан кейін сол токендер үшін стандартты токендік тарифтеріміз бойынша шот шығарамыз.

Іске қосуды кідіртіп, қайта жалғастыра аламын ба?

Иә. Кідірткен кезде бақылау нүктесін сақтаймыз және осы уақытқа дейін орындалған жұмыс үшін ақы аламыз. Қайта жалғастырған кезде тек жалғастырғаннан кейін орындалған қосымша жұмыс үшін ғана ақы алынады.

Reinforcement Fine‑Tuning бойынша шот выставление туралы басқа сұрақтарыңыз болса, қолдау көрсету тобымызға хабарласыңыз.

Бұл мақала пайдалы болды ма?