როგორ მუშაობს ბილინგი RFT-ისთვის
Reinforcement Fine‑Tuning (RFT) საშუალებას გაძლევთ, OpenAI-ის მსჯელობის მოდელების ეფექტიანობა განმამტკიცებელი სწავლებით გააუმჯობესოთ. ჩვენი ზედამხედველობითი ან პრეფერენციებზე დაფუძნებული დამატებითი სწავლების შეთავაზებებისგან განსხვავებით, რომლებშიც საფასური სასწავლო მონაცემთა ნაკრებში არსებული ტოკენების რაოდენობით ითვლება, RFT-ის საფასური ეფუძნება დროს, რომელსაც თქვენი სწავლების გაშვება ძირითადი მანქანური სწავლების სამუშაოს შესრულებაზე ხარჯავს.
ეს გზამკვლევი განმარტავს, რა ითვლება დასაბილინგებელ სასწავლო დროდ, როგორ ვამუშავებთ შეჩერებებსა და გაუქმებებს და როგორ შეიძლება თქვენმა კონფიგურაციის არჩევანმა გავლენა მოახდინოს ღირებულებაზე.
ფასები
გამოთვლა: o4-mini-2025-04-16-ის სწავლების ძირითად ციკლში გატარებული რეალური დროის თითოეული საათი — $100. საფასური წამების მიხედვით პროპორციულად გამოითვლება, ხოლო ანგარიშ-ფაქტურაში ორ ათწილადამდე მრგვალდება (მაგ., 2.55 საათი).
შემფასებელი მოდელის გამოყენება: თუ სწავლებისას შედეგების "შესაფასებლად" OpenAI-ის მოდელს იყენებთ, შეფასების ამ გამოძახებებზე დახარჯული ტოკენების საფასური სწავლების დასრულების შემდეგ, ჩვენი სტანდარტული API ტარიფებით, ცალკე დაგერიცხებათ.
საფასურს მხოლოდ სწავლების იმ სამუშაოზე ვაკისრებთ, რომელიც რეალურად განაახლებს თქვენს მოდელს (ამას "დაფიქსირებულ წინსვლას" ვუწოდებთ).
რისთვის ვრიცხავთ თანხას
თანხას ვრიცხავთ იმ დროზე, რომელსაც თქვენი ტრენინგის worker აქტიურად უთმობს თქვენი მოდელის ტრენინგს, კერძოდ:
თქვენი მოდელიდან ნიმუშების გენერირება fine-tuning-ის პროცესში (ცნობილია როგორც „rollouts“)
ამ შედეგების შეფასება ერთ ან რამდენიმე შემფასებლით, რომლებიც სამუშაოზე გაქვთ განსაზღვრული (შეიტყვეთ მეტი შემფასებლების შესახებ)
შეფასებებზე დაყრდნობით წონების განახლებების გამოთვლა და გამოყენება (უკუგავრცელება).
თქვენ მიერ კონფიგურირებული ნებისმიერი ვალიდაციის (შეფასების) ნაბიჯის გაშვება.
შემფასებლების უმეტესობის გაშვება „უფასოა“, რაც ნიშნავს, რომ მათი გამოყენებისთვის დამატებით თანხას არ ვრიცხავთ, გარდა იმ დროისა, რომელსაც ისინი ძირითადი ტრენინგის ციკლს უმატებენ. გამონაკლისია მოდელის შემფასებლები, სადაც ასევე ვითვლით token-ებს, რომლებსაც ეს შემფასებლები ზემოთ ჩამოთვლილი აქტივობების დროს მოიხმარენ. ეს token-ები თქვენს ინვოისზე ცალკე პუნქტად გამოჩნდება. მოდელის შემფასებლების მიერ მოხმარებული token-ები ირიცხება ჩვეულებრივი inference-ის ტარიფებით (OpenAI-ის ფასები).
რისთვის არ ვახორციელებთ ბილინგს
საფასურს არ გირიცხავთ შემდეგ დროზე:
თქვენი მონაცემთა ნაკრების ვალიდაცია ან შემოწმება სწავლების დაწყებამდე.
თქვენი მონაცემთა ნაკრების უსაფრთხოების შემოწმებები.
გამოთვლითი რესურსების რიგში ლოდინი.
მოდელის წონების ან მონაცემთა ნაკრების ჩამოტვირთვა.
თქვენი მონაცემთა ნაკრების ჩვენს სასწავლო ფორმატში მომზადება (რენდერინგი).
fine‑tuning გავლილი მოდელის სწავლების შემდგომი უსაფრთხოების შეფასებები.
თუ სასწავლო სამუშაო ჩვენი მხარის შეცდომის გამო დაიკარგება (მაგალითად, თუ მუშაკი ავარიულად გაითიშება და წინა checkpoint-ზე დაბრუნება მოუწევს), დაკარგულ გამოთვლით დროზე ან grader token-ებზე საფასური არ დაგერიცხებათ. ამის შესახებ მეტი დეტალი შემდეგ სექციაშია.
Captured forward progress და ბილინგის მოვლენები
სწავლება თქვენი მოდელის მრავალი მცირე განახლებისგან შედგება. ჩვენ ვაკვირდებით, ამ განახლებებიდან რამდენი სრულდება წარმატებით. გადასახადი ეფუძნება ამ წარმატებულ განახლებებთან დაკავშირებულ გამოთვლით დროსა და grader token-ებს.
გადასახადს ვაკისრებთ, როდესაც ხდება ერთ-ერთი შემდეგი "ბილინგის მოვლენა":
სწავლება წარმატებით სრულდება.
თქვენ აჩერებთ სწავლებას.
თქვენ აუქმებთ სწავლებას.
სწავლება ჩავარდება.
თითოეული გადასახადი ფარავს ბოლო გადასახადის შემდეგ შესრულებულ დამატებით სამუშაოს. მაგალითად:
თუ გაშვებას აჩერებთ, ჩვენ ვინახავთ checkpoint-ს და გირიცხავთ ბოლო გადასახადის შემდეგ გამოყენებულ გამოთვლით დროსა და grader token-ებს.
როდესაც განაახლებთ, სწავლება checkpoint-იდან გრძელდება. შემდეგი გადასახადი (დასრულების, სხვა შეჩერების, გაუქმების ან ჩავარდნისას) დაფარავს მხოლოდ განახლების შემდეგ შესრულებულ დამატებით სამუშაოს.
თუ გაშვებას გააუქმებთ, დაგერიცხებათ გაუქმებამდე შესრულებული სამუშაო.
თუ სწავლება ჩავარდება და ბოლო გადასახადის შემდეგ შესრულებული სამუშაო დაიკარგება, დაკარგულ ნაწილზე ბილინგი არ მოხდება.
ეს "captured forward progress" მიდგომა უზრუნველყოფს, რომ იხდით მხოლოდ იმ სამუშაოსთვის, რომელიც თქვენს მოდელში რჩება ან რომელსაც განზრახ ტოვებთ.
დავალების მიმდინარეობის ნახვა
RFT დავალებებს აქვს ველი usage_metrics, რომელშიც აღრიცხულია დავალების ჯამური მოხმარება მიმდინარე ეტაპის ჩათვლით. ეს მოიცავს სწავლებაზე დახარჯულ დროსა და დავალების ყველა შემფასებელი მოდელის მიერ გამოყენებულ ყველა ტოკენს. ამ ველის შემოწმება შესაძლებელია API-ით (GET /v1/fine_tuning/jobs/{job_id}) ან დამატებითი სწავლების მართვის პანელიდან.
სწავლების ხანგრძლივობაზე მოქმედი ფაქტორები
რადგან ანგარიშსწორება დროის მიხედვით ხდება, კონფიგურაციის არჩევანი პირდაპირ მოქმედებს ხარჯზე. ძირითადი ფაქტორებია:
ამოცანის სირთულე: თუ თქვენი მონაცემთა ნაკრები რთული ამოცანებისგან შედგება, მოდელი, სავარაუდოდ, თითოეულ მათგანზე მსჯელობას მეტ დროს დაუთმობს, რაც თითოეული ნიმუშის შექმნას გაახანგრძლივებს.
გამოთვლის ინტენსივობა: ჰიპერპარამეტრი compute_multiplier განსაზღვრავს, რამდენი გამოთვლა შესრულდება სწავლების თითოეულ ეტაპზე. უფრო მაღალი მნიშვნელობები მოდელს უბიძგებს, თითოეულ მონაცემზე უფრო ვრცლად იმსჯელოს, რის გამოც ყოველი ეტაპი ნელდება.
ვალიდაციის პარამეტრები:
შემფასებლის წარმადობა:
დიდ ან უფრო მძლავრ შემფასებელ მოდელებს შეფასების დასაბრუნებლად მცირე მოდელებზე მეტი დრო სჭირდებათ. მაგალითად, მსჯელობის მოდელით შეფასებას შეიძლება 10-ჯერ მეტი დრო დასჭირდეს, ვიდრე მსჯელობის არმქონე მოდელით შეფასებას.
Python-ზე დაწერილი შეფასების რთული ფუნქციების შესრულებას მარტივ ფუნქციებზე მეტი დრო სჭირდება.
ამ პარამეტრებით შეგიძლიათ ხარჯს, სიჩქარესა და მოდელის ხარისხს შორის სასურველი ბალანსი შეარჩიოთ. მაგალითად, ხშირი ვალიდაცია პრობლემებს უფრო ადრე გამოავლენს, თუმცა ხარჯს ზრდის. უფრო მოწინავე მოდელით შეფასებამ შეიძლება სიზუსტე მნიშვნელოვნად გააუმჯობესოს, თუმცა შეფასების თითოეულ ეტაპს შეანელებს და დავალებებს გააძვირებს.
ხარჯების მართვა
ხარჯების გასაკონტროლებლად:
დაიწყეთ მოკლე გაშვებებით, რათა გაიგოთ, როგორ მოქმედებს თქვენი კონფიგურაცია დროზე.
გამოიყენეთ ვალიდაციის მაგალითებისა და eval_samples-ის გონივრული რაოდენობა. ნუ ჩაატარებთ ვალიდაციას საჭიროზე ხშირად.
აირჩიეთ ყველაზე მცირე შემფასებელი მოდელი, რომელიც თქვენს ხარისხობრივ მოთხოვნებს აკმაყოფილებს.
უზრუნველყავით Python-ზე დაწერილი საკუთარი შემფასებლების ეფექტიანობა.
კონვერგენციის სიჩქარესა და ხარჯს შორის ბალანსისთვის დაარეგულირეთ compute_multiplier.
თვალი ადევნეთ გაშვებას მართვის პანელიდან ან API-ის მეშვეობით. მისი დაპაუზება ან გაუქმება ნებისმიერ დროს შეგიძლიათ.
მაგალითები
წარმატებული ტრენინგის გაშვება
| ტრენინგის დრო | დასარიცხი დრო | სტატუსი | აღწერა |
|---|---|---|---|
| 00:00 | 00:00 | – | მომხმარებელი API-ის მეშვეობით ქმნის RFT სამუშაოს |
| 00:10 | 00:00 | VALIDATING_FILES | 10 წუთი დაიხარჯა მონაცემთა ნაკრების ვალიდაციაზე |
| 00:30 | 00:00 | VALIDATING_FILES | 20 წუთი მიმდინარეობდა მონაცემთა ნაკრების უსაფრთხოების შემოწმებები |
| 01:00 | 00:00 | QUEUED | 30 წუთი ხელმისაწვდომი worker-ის მოლოდინში |
| 01:30 | 00:00 | RUNNING | 30 წუთი ტრენინგის მომზადებაზე (წონების ჩამოტვირთვა, წინასწარი დამუშავება და ა.შ.) |
| 05:30 | 04:00 | RUNNING | 4 საათი დაიხარჯა ტრენინგზე |
| 06:00 | 04:00 | RUNNING | 30 წუთი მიღებული მოდელის უსაფრთხოების შეფასებებზე |
| 06:00 | 04:00 | SUCCEEDED | ტრენინგი სრულდება |
ამ შემთხვევაში, სრული გასული დრო 6 საათია, მაგრამ მხოლოდ 4 საათია დასარიცხი. ღირებულება იქნება 4 საათი × $100/საათი = $400.
წარუმატებელი სამუშაოს მაგალითი
ამ მაგალითში გაშვება 2 საათი გადის ტრენინგს, წერს საკონტროლო წერტილს, კიდევ 1 საათი გადის ტრენინგს, მაგრამ შემდეგ ვერ სრულდება. დასარიცხია მხოლოდ საკონტროლო წერტილამდე შესრულებული 2 საათის ტრენინგი.
| ტრენინგის დრო | დასარიცხი დრო | სტატუსი | აღწერა |
|---|---|---|---|
| 00:00 | 00:00 | – | მომხმარებელი API-ის მეშვეობით ქმნის RFT სამუშაოს |
| 00:10 | 00:00 | VALIDATING_FILES | 10 წუთი დაიხარჯა მონაცემთა ნაკრების ვალიდაციაზე |
| 00:30 | 00:00 | VALIDATING_FILES | 20 წუთი მიმდინარეობდა მონაცემთა ნაკრების უსაფრთხოების შემოწმებები |
| 01:00 | 00:00 | QUEUED | 30 წუთი ხელმისაწვდომი worker-ის მოლოდინში |
| 01:30 | 00:00 | RUNNING | 30 წუთი ტრენინგის მომზადებაზე (წონების ჩამოტვირთვა, წინასწარი დამუშავება და ა.შ.) |
| 03:30 | 02:00 | RUNNING | 2 საათი დაიხარჯა ტრენინგზე |
| 03:30 | 02:00 | RUNNING | საკონტროლო წერტილი შეიქმნა მე-5 ნაბიჯზე |
| 04:30 | 02:00 | RUNNING | ტრენინგი ვერ სრულდება მე-8 ნაბიჯზე შიდა შეცდომის გამო (კიდევ 1 საათის შემდეგ) |
| 04:30 | 02:00 | RUNNING | 30 წუთი საკონტროლო წერტილის შეფასებასა და ვალიდაციაზე |
| 04:30 | 02:00 | SUCCEEDED | სამუშაო სრულდება (უახლესი საკონტროლო წერტილით) |
მიუხედავად იმისა, რომ ჯამში ტრენინგზე 3 საათი დაიხარჯა, გამოსადეგ საკონტროლო წერტილში მხოლოდ 2 საათია „ასახული“ და თანხაც მასზე ირიცხება. წარუმატებლობის გამო დაკარგულ ერთ საათიან ტრენინგზე თქვენ პასუხისმგებელი არ ხართ. ღირებულება იქნება 2 საათი × $100/საათი = $200.
ხშირად დასმული კითხვები
როდის ჩამომეჭრება თანხა?
ანგარიშს გაშვების დასრულების, დაპაუზების, გაუქმების ან წარუმატებლად დასრულებისას გიწერთ. თითოეული ანგარიში მოიცავს წინა ანგარიშის შემდეგ შესრულებულ სამუშაოს.
ვიხდი თუ გაშვება ვერ შესრულდა?
თუ გაშვება ჩვენი შეცდომის გამო ვერ შესრულდა და ბოლო ტრენინგის სამუშაოს ნაწილი დაიკარგა, დაკარგული ნაწილისთვის თანხა არ ჩამოგეჭრებათ. თუ გაშვებას გააუქმებთ, თანხა ჩამოგეჭრებათ გაუქმებამდე შესრულებული სამუშაოსთვის.
როგორ ირიცხება შემფასებელი მოდელის token-ების საფასური?
ვითვლით token-ებს, რომლებიც გამოიყენება თქვენ მიერ კონფიგურირებული ნებისმიერი მოდელის შემფასებლის მიერ. ტრენინგის დასრულების შემდეგ, ამ token-ებს ჩვენი სტანდარტული თითო-token-ის ტარიფებით ვრიცხავთ.
შემიძლია გაშვების დაპაუზება და განახლება?
დიახ. როცა აპაუზებთ, ვინახავთ საკონტროლო წერტილს და თანხას აქამდე შესრულებული სამუშაოსთვის ვრიცხავთ. როცა განაახლებთ, თანხა ჩამოგეჭრებათ მხოლოდ განახლების შემდეგ შესრულებული დამატებითი სამუშაოსთვის.
თუ Reinforcement Fine‑Tuning-ის ბილინგთან დაკავშირებით სხვა კითხვები გაქვთ, დაუკავშირდით ჩვენს მხარდაჭერის გუნდს.
