Ինչպես է գործում RFT-ի վճարումը
Ամրապնդումով ճշգրտումը (RFT) թույլ է տալիս օպտիմալացնել OpenAI-ի հիմնավորման մոդելների արդյունավետությունը՝ ամրապնդումով ուսուցման միջոցով։ Ի տարբերություն վերահսկվող կամ նախապատվության վրա հիմնված ճշգրտման մեր առաջարկների, որոնց վճարումը հաշվարկվում է ուսուցման տվյալակազմում թոքենների քանակով, RFT-ի վճարումը հաշվարկվում է այն ժամանակի հիման վրա, որը ձեր ուսուցման գործարկումը ծախսում է մեքենայական ուսուցման հիմնական աշխատանքը կատարելու վրա։
Այս ուղեցույցը բացատրում է, թե ինչն է համարվում հաշվարկագրվող ուսուցման ժամանակ, ինչպես ենք մշակում դադարներն ու չեղարկումները, և ինչպես կարող են ձեր կազմաձևման ընտրությունները ազդել արժեքի վրա։
Սակագներ
Հաշվողական ռեսուրս․ $100 ժամում՝
o4-mini-2025-04-16-ի հիմնական ուսուցման ցիկլում ծախսված իրական ժամանակի յուրաքանչյուր ժամի համար։ Գանձումները հաշվարկվում են մինչև վայրկյան և հաշվում կլորացվում են մինչև երկու տասնորդական նիշ (օր.՝ 2.55 ժամ)։Մոդել-գնահատիչի օգտագործում․ եթե ուսուցման ընթացքում ելքերը «գնահատելու» համար օգտագործում եք OpenAI մոդել, այդ գնահատման կանչերի սպառած թոքենները ուսուցման ավարտից հետո հաշվարկագրվում են առանձին՝ մեր ստանդարտ API սակագներով։
Մենք գանձում ենք միայն այն ուսուցման աշխատանքի համար, որն իրականում թարմացնում է ձեր մոդելը (այն, ինչ մենք անվանում ենք «ամրագրված առաջընթաց»)։
Ինչի համար ենք գանձում
Մենք գանձում ենք այն ժամանակի համար, երբ ձեր ուսուցման աշխատողը ակտիվորեն ուսուցանում է ձեր մոդելը, մասնավորապես՝
Նուրբ կարգավորման ընթացքում ձեր մոդելից նմուշների գեներացում (հայտնի է որպես «rollouts»)
Այդ ելքերի գնահատում առաջադրանքի համար ձեր սահմանած մեկ կամ մի քանի գնահատիչներով (իմացեք ավելին գնահատիչների մասին)
Գնահատականների հիման վրա կշիռների թարմացումների հաշվարկում և կիրառում (հակադարձ տարածում)։
Ձեր կազմաձևած ցանկացած վավերացման (գնահատման) քայլերի կատարում։
Գնահատիչների մեծ մասը գործարկվում է «անվճար», ինչը նշանակում է, որ դրանց օգտագործման համար լրացուցիչ չենք գանձում՝ բացի այն ժամանակից, որը դրանք ավելացնում են հիմնական ուսուցման ցիկլին։ Բացառությունը մոդելային գնահատիչներն են, որոնց դեպքում մենք նաև հաշվարկում ենք այն թոքենները, որոնք այդ գնահատիչները սպառում են վերոնշյալ գործողությունների ընթացքում։ Այս թոքենները ձեր հաշիվ-ապրանքագրում երևում են որպես առանձին տողային հոդված։ Մոդելային գնահատիչների սպառած թոքենները գանձվում են սովորական inference սակագներով (OpenAI-ի գնագոյացում)։
Ինչի համար մենք ՉԵՆՔ հաշվարկագրում
Մենք վճար չենք գանձում հետևյալի վրա ծախսված ժամանակի համար՝
Տվյալաշարի վավերացում կամ ստուգում մինչև ուսուցման սկսվելը։
Ձեր տվյալաշարի անվտանգության ստուգումներ։
Հաշվողական ռեսուրսների հերթում սպասում։
Մոդելի կշիռների կամ տվյալաշարերի ներբեռնում։
Ձեր տվյալաշարի պատրաստում (rendering) մեր ուսուցման ձևաչափին։
Նուրբ կարգավորված մոդելի հետուսուցումային անվտանգության գնահատումներ։
Եթե ուսուցման աշխատանքը կորչում է մեր կողմից կատարված սխալի պատճառով (օրինակ՝ եթե աշխատողը խափանվում է և պետք է վերադառնա նախորդ checkpoint-ին), կորած հաշվարկային ժամանակի կամ գնահատիչների թոքենների համար ձեզանից վճար չի գանձվում։ Այս մասին ավելի մանրամասն՝ հաջորդ բաժնում։
Ամրագրված առաջընթաց և հաշվարկագրման իրադարձություններ
Ուսուցումը բաղկացած է ձեր մոդելի բազմաթիվ փոքր թարմացումներից։ Մենք հետևում ենք, թե այդ թարմացումներից քանիսն են հաջողությամբ ավարտվում։ Գանձումները հիմնված են այս հաջող թարմացումների հետ կապված հաշվարկային ժամանակի և գնահատիչների թոքենների վրա։
Մենք գանձում ենք, երբ տեղի է ունենում հետևյալ «հաշվարկագրման իրադարձություններից» մեկը՝
Ուսուցումը հաջողությամբ ավարտվում է։
Դուք դադարեցնում եք ուսուցումը։
Դուք չեղարկում եք ուսուցումը։
Ուսուցումը ձախողվում է։
Յուրաքանչյուր գանձում ներառում է վերջին գանձումից հետո կատարված հավելյալ աշխատանքը։ Օրինակ՝
Եթե դուք դադարեցնում եք գործարկումը, մենք պահպանում ենք checkpoint և ձեզանից գանձում ենք վերջին գանձումից հետո օգտագործված հաշվարկային ժամանակի և գնահատիչների թոքենների համար։
Երբ դուք վերսկսում եք, ուսուցումը շարունակվում է checkpoint-ից։ Հաջորդ գանձումը (ավարտի, նոր դադարի, չեղարկման կամ ձախողման դեպքում) կներառի միայն վերսկսումից հետո կատարված լրացուցիչ աշխատանքը։
Եթե դուք չեղարկում եք գործարկումը, ձեզանից գանձվում է մինչև չեղարկման պահը կատարված աշխատանքի համար։
Եթե ուսուցումը ձախողվում է և վերջին գանձումից հետո կատարված աշխատանքը կորում է, կորած մասի համար ձեզանից վճար չի գանձվում։
«Ամրագրված առաջընթացի» այս մոտեցումը ապահովում է, որ դուք վճարեք միայն այն աշխատանքի համար, որը պահպանվում է ձեր մոդելում կամ որը դուք գիտակցաբար հրաժարվում եք շարունակել։
Առաջադրանքի ընթացքի դիտում
RFT առաջադրանքներն ունեն usage_metrics կոչվող դաշտ, որը փաստագրում է առաջադրանքի ընդհանուր օգտագործումը մինչև ընթացիկ քայլը։ Սա ներառում է ուսուցման վրա ծախսված ժամանակը և առաջադրանքում բոլոր մոդելային գնահատիչների կողմից օգտագործված բոլոր թոքենները։ Այս դաշտը կարելի է ստուգել API-ի միջոցով (GET /v1/fine_tuning/jobs/{job_id}) կամ նուրբ կարգավորման վահանակի միջոցով։
Ուսուցման ժամանակի վրա ազդող գործոններ
Քանի որ հաշվարկագրումը հիմնված է ժամանակի վրա, ձեր կազմաձևման ընտրությունները անմիջապես ազդում են արժեքի վրա։ Հիմնական գործոններն են՝
Խնդրի բարդություն․ եթե ձեր տվյալաշարը բաղկացած է բարդ խնդիրներից, մոդելը, ամենայն հավանականությամբ, ավելի շատ ժամանակ կծախսի յուրաքանչյուր խնդրի վրա հիմնավորման համար, ինչն ավելացնում է յուրաքանչյուր նմուշի ստեղծման համար պահանջվող ժամանակը։
Հաշվողական ինտենսիվություն․
compute_multiplierհիպերպարամետրը վերահսկում է, թե որքան հաշվարկ եք կատարում յուրաքանչյուր ուսուցման քայլի համար։ Ավելի բարձր արժեքները խրախուսում են մոդելին ավելի մանրամասն հիմնավորել յուրաքանչյուր տվյալակետի շուրջ, ինչի հետևանքով յուրաքանչյուր քայլ ավելի դանդաղ է կատարվում։Վավերացման կարգավորումներ․
Ավելի մեծ վավերացման հավաքածուն ավելացնում է գնահատման վրա ծախսվող ժամանակը։
eval_samples-ի ավելացումը (յուրաքանչյուր վավերացման օրինակի համար գնահատվող մոդելի ելքերի քանակը) ավելացնում է վավերացման ժամանակը։Վավերացումն ավելի հաճախ գործարկելը (ավելի ցածր
eval_interval) մեծացնում է վավերացման վրա ծախսվող ժամանակի բաժինը։
Գնահատիչի արդյունավետություն․
Ավելի մեծ կամ ավելի հզոր մոդել-գնահատիչներին գնահատական վերադարձնելու համար ավելի շատ ժամանակ է պետք, քան փոքրերին։ Օրինակ՝ հիմնավորման մոդելով գնահատումը կարող է 10 անգամ ավելի երկար տևել, քան ոչ հիմնավորման մոդելով գնահատումը։
Բարդ Python գնահատման ֆունկցիաները ավելի երկար են աշխատում, քան պարզերը։
Այս կարգավորումները թույլ են տալիս հավասարակշռել արժեքը, արագությունը և մոդելի որակը։ Օրինակ՝ հաճախակի վավերացումը կարող է խնդիրներն ավելի շուտ բացահայտել, բայց մեծացնում է արժեքը։ Ավելի առաջադեմ մոդելով գնահատումը կարող է կտրուկ բարձրացնել գնահատման ճշգրտությունը, սակայն կդանդաղեցնի յուրաքանչյուր գնահատման քայլը և աշխատանքներն ավելի թանկ կդարձնի։
Ծախսերի կառավարում
Ձեր ծախսերը վերահսկելու համար՝
Սկսեք ավելի կարճ գործարկումներով՝ հասկանալու համար, թե ինչպես է ձեր կազմաձևումն ազդում ժամանակի վրա։
Օգտագործեք վավերացման օրինակների և
eval_samples-ի ողջամիտ քանակ։ Խուսափեք անհրաժեշտից ավելի հաճախ վավերացում կատարելուց։Ընտրեք ամենափոքր գնահատիչ մոդելը, որը բավարարում է ձեր որակի պահանջները։
Պահեք ձեր հատուկ Python գնահատիչները արդյունավետ։
Կարգավորեք
compute_multiplier-ը՝ հավասարակշռելու կոնվերգենցիայի արագությունն ու արժեքը։Հետևեք ձեր գործարկմանը վահանակում կամ API-ի միջոցով։ Դուք կարող եք ցանկացած պահին դադարեցնել կամ չեղարկել այն։
Օրինակներ
Հաջող ուսուցման գործարկում
| Ուսուցման ժամանակ | Գանձվող ժամանակ | Կարգավիճակ | Նկարագրություն |
|---|---|---|---|
| 00:00 | 00:00 | – | Օգտատերը API-ի միջոցով ստեղծում է RFT առաջադրանք |
| 00:10 | 00:00 | VALIDATING_FILES | 10 րոպե ծախսվել է տվյալակազմի վավերացման վրա |
| 00:30 | 00:00 | VALIDATING_FILES | 20 րոպե կատարվել են տվյալակազմի անվտանգության ստուգումներ |
| 01:00 | 00:00 | QUEUED | 30 րոպե սպասում հասանելի աշխատողին |
| 01:30 | 00:00 | RUNNING | 30 րոպե ուսուցման կարգավորում (կշիռների ներբեռնում, նախամշակում և այլն) |
| 05:30 | 04:00 | RUNNING | 4 ժամ ծախսվել է ուսուցման վրա |
| 06:00 | 04:00 | RUNNING | 30 րոպե կատարվել են ստացված մոդելի անվտանգության գնահատումներ |
| 06:00 | 04:00 | SUCCEEDED | Ուսուցումն ավարտվում է |
Այս դեպքում ընդհանուր իրական ժամանակը 6 ժամ է, բայց գանձման ենթակա է միայն 4 ժամը։ Արժեքը կլինի 4 ժամ × $100/ժամ = $400։
Ձախողված առաջադրանքի օրինակ
Այս օրինակում գործարկումը ուսուցանում է 2 ժամ, գրանցում է ստուգակետ, ուսուցանում է ևս 1 ժամ, բայց հետո ձախողվում է։ Գանձման ենթակա է միայն մինչև ստուգակետը կատարված 2 ժամ ուսուցումը։
| Ուսուցման ժամանակ | Գանձվող ժամանակ | Կարգավիճակ | Նկարագրություն |
|---|---|---|---|
| 00:00 | 00:00 | – | Օգտատերը API-ի միջոցով ստեղծում է RFT առաջադրանք |
| 00:10 | 00:00 | VALIDATING_FILES | 10 րոպե ծախսվել է տվյալակազմի վավերացման վրա |
| 00:30 | 00:00 | VALIDATING_FILES | 20 րոպե կատարվել են տվյալակազմի անվտանգության ստուգումներ |
| 01:00 | 00:00 | QUEUED | 30 րոպե սպասում հասանելի աշխատողին |
| 01:30 | 00:00 | RUNNING | 30 րոպե ուսուցման կարգավորում (կշիռների ներբեռնում, նախամշակում և այլն) |
| 03:30 | 02:00 | RUNNING | 2 ժամ ծախսվել է ուսուցման վրա |
| 03:30 | 02:00 | RUNNING | Ստուգակետը ստեղծվել է 5-րդ քայլին |
| 04:30 | 02:00 | RUNNING | Ուսուցումը ձախողվում է ներքին սխալի պատճառով 8-րդ քայլին (ևս 1 ժամ անց) |
| 04:30 | 02:00 | RUNNING | 30 րոպե ստուգակետի գնահատում և վավերացում |
| 04:30 | 02:00 | SUCCEEDED | Առաջադրանքն ավարտվում է (վերջին ստուգակետով) |
Թեև ընդհանուր առմամբ 3 ժամ է ծախսվել ուսուցման վրա, միայն 2 ժամն է «ներառված» օգտագործելի ստուգակետում և գանձվում է։ Ձախողման պատճառով կորած ուսուցման մեկ ժամվա աշխատանքի համար դուք պատասխանատու չեք։ Արժեքը կլինի 2 ժամ × $100/ժամ = $200։
Հաճախ տրվող հարցեր
Ե՞րբ է գանձվում վճարը։
Մենք հաշիվ ենք ներկայացնում, երբ ձեր գործարկումն ավարտվում է, դադարեցվում է, չեղարկվում է կամ ձախողվում է։ Յուրաքանչյուր հաշիվ ընդգրկում է նախորդ հաշվից հետո կատարված աշխատանքը։
Վճարո՞ւմ եմ, եթե գործարկումը ձախողվում է։
Եթե գործարկումը ձախողվում է մեր սխալի պատճառով, և վերջին ուսուցման որևէ աշխատանք կորում է, կորած մասի համար ձեզանից վճար չի գանձվում։ Եթե չեղարկեք գործարկումը, ձեզանից գանձվում է մինչև չեղարկումը կատարված աշխատանքի համար։
Ինչպե՞ս են գանձվում գնահատիչ մոդելների թոքենները։
Մենք հաշվում ենք ձեր կազմաձևած ցանկացած մոդելային գնահատիչի օգտագործած թոքենները։ Ուսուցման ավարտից հետո այդ թոքենները գանձում ենք մեր ստանդարտ մեկ թոքենի սակագներով։
Կարո՞ղ եմ դադարեցնել և վերսկսել գործարկումը։
Այո։ Երբ դադարեցնում եք, մենք պահպանում ենք ստուգակետ և գանձում մինչ այդ կատարված աշխատանքի համար։ Երբ վերսկսեք, ձեզանից կգանձվի միայն վերսկսումից հետո կատարված լրացուցիչ աշխատանքի համար։
Եթե Reinforcement Fine‑Tuning-ի հաշվարկման վերաբերյալ այլ հարցեր ունեք, կապվեք մեր աջակցության թիմի հետ։
