Ինչպես է գործում RFT-ի վճարումը
Ամրապնդումով ճշգրտումը (RFT) թույլ է տալիս օպտիմալացնել OpenAI-ի հիմնավորման մոդելների արդյունավետությունը՝ ամրապնդումով ուսուցման միջոցով։ Ի տարբերություն վերահսկվող կամ նախապատվության վրա հիմնված ճշգրտման մեր առաջարկների, որոնց վճարումը հաշվարկվում է ուսուցման տվյալակազմում թոքենների քանակով, RFT-ի վճարումը հաշվարկվում է այն ժամանակի հիման վրա, որը ձեր ուսուցման գործարկումը ծախսում է մեքենայական ուսուցման հիմնական աշխատանքը կատարելու վրա։
Այս ուղեցույցը բացատրում է, թե ինչն է համարվում հաշվարկագրվող ուսուցման ժամանակ, ինչպես ենք մշակում դադարներն ու չեղարկումները, և ինչպես կարող են ձեր կազմաձևման ընտրությունները ազդել արժեքի վրա։
Գնագոյացում
Հաշվարկներ․ 100 ԱՄՆ դոլար՝ o4-mini-2025-04-16-ի ուսուցման հիմնական ցիկլում ծախսված իրական ժամանակի յուրաքանչյուր ժամի համար։ Վճարը համամասնորեն հաշվարկվում է վայրկյանի ճշտությամբ և հաշիվ-ապրանքագրում կլորացվում մինչև տասնորդական երկու նիշ (օրինակ՝ 2,55 ժամ)։
Գնահատիչ մոդելի օգտագործում․ եթե ուսուցման ընթացքում արդյունքները «գնահատելու» համար օգտագործում եք OpenAI-ի մոդել, ապա գնահատման այդ կանչերի սպառած թոքենների վճարն ուսուցման ավարտից հետո առանձին է հաշվարկվում՝ API-ի մեր ստանդարտ սակագներով։
Մենք գումար ենք գանձում միայն այն ուսուցման աշխատանքի համար, որն իրականում թարմացնում է ձեր մոդելը (սա անվանում ենք «արձանագրված առաջընթաց»)։
Ինչի համար ենք գանձում
Մենք գանձում ենք այն ժամանակի համար, երբ ձեր ուսուցման աշխատողը ակտիվորեն ուսուցանում է ձեր մոդելը, մասնավորապես՝
Նուրբ կարգավորման ընթացքում ձեր մոդելից նմուշների գեներացում (հայտնի է որպես «rollouts»)
Այդ ելքերի գնահատում առաջադրանքի համար ձեր սահմանած մեկ կամ մի քանի գնահատիչներով (իմացեք ավելին գնահատիչների մասին)
Գնահատականների հիման վրա կշիռների թարմացումների հաշվարկում և կիրառում (հակադարձ տարածում)։
Ձեր կազմաձևած ցանկացած վավերացման (գնահատման) քայլերի կատարում։
Գնահատիչների մեծ մասը գործարկվում է «անվճար», ինչը նշանակում է, որ դրանց օգտագործման համար լրացուցիչ չենք գանձում՝ բացի այն ժամանակից, որը դրանք ավելացնում են հիմնական ուսուցման ցիկլին։ Բացառությունը մոդելային գնահատիչներն են, որոնց դեպքում մենք նաև հաշվարկում ենք այն թոքենները, որոնք այդ գնահատիչները սպառում են վերոնշյալ գործողությունների ընթացքում։ Այս թոքենները ձեր հաշիվ-ապրանքագրում երևում են որպես առանձին տողային հոդված։ Մոդելային գնահատիչների սպառած թոքենները գանձվում են սովորական inference սակագներով (OpenAI-ի գնագոյացում)։
Ինչի համար մենք ՉԵՆՔ հաշվարկագրում
Մենք վճար չենք գանձում հետևյալի վրա ծախսված ժամանակի համար՝
Տվյալաշարի վավերացում կամ ստուգում մինչև ուսուցման սկսվելը։
Ձեր տվյալաշարի անվտանգության ստուգումներ։
Հաշվողական ռեսուրսների հերթում սպասում։
Մոդելի կշիռների կամ տվյալաշարերի ներբեռնում։
Ձեր տվյալաշարի պատրաստում (rendering) մեր ուսուցման ձևաչափին։
Նուրբ կարգավորված մոդելի հետուսուցումային անվտանգության գնահատումներ։
Եթե ուսուցման աշխատանքը կորչում է մեր կողմից կատարված սխալի պատճառով (օրինակ՝ եթե աշխատողը խափանվում է և պետք է վերադառնա նախորդ checkpoint-ին), կորած հաշվարկային ժամանակի կամ գնահատիչների թոքենների համար ձեզանից վճար չի գանձվում։ Այս մասին ավելի մանրամասն՝ հաջորդ բաժնում։
Ամրագրված առաջընթաց և հաշվարկագրման իրադարձություններ
Ուսուցումը բաղկացած է ձեր մոդելի բազմաթիվ փոքր թարմացումներից։ Մենք հետևում ենք, թե այդ թարմացումներից քանիսն են հաջողությամբ ավարտվում։ Գանձումները հիմնված են այս հաջող թարմացումների հետ կապված հաշվարկային ժամանակի և գնահատիչների թոքենների վրա։
Մենք գանձում ենք, երբ տեղի է ունենում հետևյալ «հաշվարկագրման իրադարձություններից» մեկը՝
Ուսուցումը հաջողությամբ ավարտվում է։
Դուք դադարեցնում եք ուսուցումը։
Դուք չեղարկում եք ուսուցումը։
Ուսուցումը ձախողվում է։
Յուրաքանչյուր գանձում ներառում է վերջին գանձումից հետո կատարված հավելյալ աշխատանքը։ Օրինակ՝
Եթե դուք դադարեցնում եք գործարկումը, մենք պահպանում ենք checkpoint և ձեզանից գանձում ենք վերջին գանձումից հետո օգտագործված հաշվարկային ժամանակի և գնահատիչների թոքենների համար։
Երբ դուք վերսկսում եք, ուսուցումը շարունակվում է checkpoint-ից։ Հաջորդ գանձումը (ավարտի, նոր դադարի, չեղարկման կամ ձախողման դեպքում) կներառի միայն վերսկսումից հետո կատարված լրացուցիչ աշխատանքը։
Եթե դուք չեղարկում եք գործարկումը, ձեզանից գանձվում է մինչև չեղարկման պահը կատարված աշխատանքի համար։
Եթե ուսուցումը ձախողվում է և վերջին գանձումից հետո կատարված աշխատանքը կորում է, կորած մասի համար ձեզանից վճար չի գանձվում։
«Ամրագրված առաջընթացի» այս մոտեցումը ապահովում է, որ դուք վճարեք միայն այն աշխատանքի համար, որը պահպանվում է ձեր մոդելում կամ որը դուք գիտակցաբար հրաժարվում եք շարունակել։
Առաջադրանքի ընթացքի դիտում
RFT առաջադրանքներն ունեն usage_metrics դաշտ, որտեղ գրանցվում է առաջադրանքի ընդհանուր օգտագործումը մինչև ընթացիկ քայլը։ Այն ներառում է ուսուցման վրա ծախսված ժամանակը և առաջադրանքի բոլոր գնահատիչ մոդելների օգտագործած բոլոր թոքենները։ Այս դաշտը կարելի է ստուգել API-ի միջոցով (GET /v1/fine_tuning/jobs/{job_id}) կամ լրացուցիչ ուսուցման կառավարման վահանակում։
Ուսուցման տևողության վրա ազդող գործոններ
Քանի որ վճարը հաշվարկվում է ըստ ժամանակի, կազմաձևման ձեր ընտրություններն ուղղակիորեն ազդում են արժեքի վրա։ Հիմնական գործոններն են՝
Խնդրի բարդությունը․ եթե ձեր տվյալակազմը բաղկացած է բարդ խնդիրներից, մոդելը, հավանաբար, ավելի շատ ժամանակ կծախսի յուրաքանչյուր խնդրի շուրջ դատողություն անելու համար, ուստի յուրաքանչյուր նմուշի ստեղծումն ավելի երկար կտևի։
Հաշվարկների ինտենսիվությունը․ compute_multiplier հիպերպարամետրը վերահսկում է ուսուցման յուրաքանչյուր քայլում կատարվող հաշվարկների ծավալը։ Ավելի բարձր արժեքները մոդելին դրդում են յուրաքանչյուր տվյալակետի շուրջ ավելի ծավալուն դատողություն անել, ինչի պատճառով յուրաքանչյուր քայլ ավելի դանդաղ է կատարվում։
Վավերացման կարգավորումներ․
Գնահատիչների արդյունավետություն․
Ավելի խոշոր կամ ավելի ունակ գնահատիչ մոդելներն ավելի ուշ են վերադարձնում գնահատականը, քան փոքրերը։ Օրինակ՝ հիմնավորման մոդելով գնահատումը կարող է 10 անգամ ավելի երկար տևել, քան ոչ հիմնավորման մոդելով գնահատումը։
Python-ով գրված գնահատման բարդ գործառույթներն ավելի երկար են կատարվում, քան պարզերը։
Այս կարգավորումները թույլ են տալիս հավասարակշռել արժեքը, արագությունը և մոդելի որակը։ Օրինակ՝ հաճախակի վավերացումը կարող է ավելի շուտ հայտնաբերել խնդիրները, սակայն մեծացնում է արժեքը։ Ավելի առաջադեմ մոդելով գնահատումը կարող է կտրուկ բարձրացնել գնահատման ճշգրտությունը, սակայն կդանդաղեցնի գնահատման յուրաքանչյուր քայլը և կթանկացնի առաջադրանքները։
Ծախսերի կառավարում
Ծախսերը վերահսկելու համար՝
Սկսեք ավելի կարճ գործարկումներից՝ հասկանալու, թե ձեր կազմաձևումն ինչպես է ազդում տևողության վրա։
Օգտագործեք վավերացման օրինակների և eval_samples-ի ողջամիտ քանակ։ Մի կատարեք վավերացում անհրաժեշտից ավելի հաճախ։
Ընտրեք ձեր որակի պահանջներին համապատասխանող ամենափոքր գնահատիչ մոդելը։
Ապահովեք Python-ով գրված հատուկ գնահատիչների արդյունավետ աշխատանքը։
Կարգավորեք compute_multiplier-ը՝ զուգամիտման արագությունն ու արժեքը հավասարակշռելու համար։
Հետևեք ձեր գործարկմանը կառավարման վահանակում կամ API-ի միջոցով։ Կարող եք ցանկացած պահի կասեցնել կամ չեղարկել այն։
Օրինակներ
Հաջող ուսուցման գործարկում
| Ուսուցման ժամանակ | Գանձվող ժամանակ | Կարգավիճակ | Նկարագրություն |
|---|---|---|---|
| 00:00 | 00:00 | – | Օգտատերը API-ի միջոցով ստեղծում է RFT առաջադրանք |
| 00:10 | 00:00 | VALIDATING_FILES | 10 րոպե ծախսվել է տվյալակազմի վավերացման վրա |
| 00:30 | 00:00 | VALIDATING_FILES | 20 րոպե կատարվել են տվյալակազմի անվտանգության ստուգումներ |
| 01:00 | 00:00 | QUEUED | 30 րոպե սպասում հասանելի աշխատողին |
| 01:30 | 00:00 | RUNNING | 30 րոպե ուսուցման կարգավորում (կշիռների ներբեռնում, նախամշակում և այլն) |
| 05:30 | 04:00 | RUNNING | 4 ժամ ծախսվել է ուսուցման վրա |
| 06:00 | 04:00 | RUNNING | 30 րոպե կատարվել են ստացված մոդելի անվտանգության գնահատումներ |
| 06:00 | 04:00 | SUCCEEDED | Ուսուցումն ավարտվում է |
Այս դեպքում ընդհանուր իրական ժամանակը 6 ժամ է, բայց գանձման ենթակա է միայն 4 ժամը։ Արժեքը կլինի 4 ժամ × $100/ժամ = $400։
Ձախողված առաջադրանքի օրինակ
Այս օրինակում գործարկումը ուսուցանում է 2 ժամ, գրանցում է ստուգակետ, ուսուցանում է ևս 1 ժամ, բայց հետո ձախողվում է։ Գանձման ենթակա է միայն մինչև ստուգակետը կատարված 2 ժամ ուսուցումը։
| Ուսուցման ժամանակ | Գանձվող ժամանակ | Կարգավիճակ | Նկարագրություն |
|---|---|---|---|
| 00:00 | 00:00 | – | Օգտատերը API-ի միջոցով ստեղծում է RFT առաջադրանք |
| 00:10 | 00:00 | VALIDATING_FILES | 10 րոպե ծախսվել է տվյալակազմի վավերացման վրա |
| 00:30 | 00:00 | VALIDATING_FILES | 20 րոպե կատարվել են տվյալակազմի անվտանգության ստուգումներ |
| 01:00 | 00:00 | QUEUED | 30 րոպե սպասում հասանելի աշխատողին |
| 01:30 | 00:00 | RUNNING | 30 րոպե ուսուցման կարգավորում (կշիռների ներբեռնում, նախամշակում և այլն) |
| 03:30 | 02:00 | RUNNING | 2 ժամ ծախսվել է ուսուցման վրա |
| 03:30 | 02:00 | RUNNING | Ստուգակետը ստեղծվել է 5-րդ քայլին |
| 04:30 | 02:00 | RUNNING | Ուսուցումը ձախողվում է ներքին սխալի պատճառով 8-րդ քայլին (ևս 1 ժամ անց) |
| 04:30 | 02:00 | RUNNING | 30 րոպե ստուգակետի գնահատում և վավերացում |
| 04:30 | 02:00 | SUCCEEDED | Առաջադրանքն ավարտվում է (վերջին ստուգակետով) |
Թեև ընդհանուր առմամբ 3 ժամ է ծախսվել ուսուցման վրա, միայն 2 ժամն է «ներառված» օգտագործելի ստուգակետում և գանձվում է։ Ձախողման պատճառով կորած ուսուցման մեկ ժամվա աշխատանքի համար դուք պատասխանատու չեք։ Արժեքը կլինի 2 ժամ × $100/ժամ = $200։
Հաճախ տրվող հարցեր
Ե՞րբ է ինձանից գումար գանձվում։
Հաշիվը ներկայացնում ենք, երբ ձեր գործարկումն ավարտվում է, կասեցվում է, չեղարկվում է կամ ձախողվում։ Յուրաքանչյուր հաշիվ ներառում է նախորդ հաշվից հետո կատարված աշխատանքը։
Վճարո՞ւմ եմ, եթե գործարկումը ձախողվում է։
Եթե գործարկումը ձախողվում է մեր սխալի պատճառով, և վերջին ուսուցման որևէ աշխատանք կորում է, կորած մասի համար ձեզանից վճար չի գանձվում։ Եթե չեղարկեք գործարկումը, ձեզանից գանձվում է մինչև չեղարկումը կատարված աշխատանքի համար։
Ինչպե՞ս են գանձվում գնահատիչ մոդելների թոքենները։
Մենք հաշվում ենք ձեր կազմաձևած ցանկացած մոդելային գնահատիչի օգտագործած թոքենները։ Ուսուցման ավարտից հետո այդ թոքենները գանձում ենք մեր ստանդարտ մեկ թոքենի սակագներով։
Կարո՞ղ եմ դադարեցնել և վերսկսել գործարկումը։
Այո։ Երբ դադարեցնում եք, մենք պահպանում ենք ստուգակետ և գանձում մինչ այդ կատարված աշխատանքի համար։ Երբ վերսկսեք, ձեզանից կգանձվի միայն վերսկսումից հետո կատարված լրացուցիչ աշխատանքի համար։
Եթե Reinforcement Fine‑Tuning-ի հաշվարկման վերաբերյալ այլ հարցեր ունեք, կապվեք մեր աջակցության թիմի հետ։
