როგორ მუშაობს ბილინგი RFT-ისთვის
Reinforcement Fine‑Tuning (RFT) საშუალებას გაძლევთ, OpenAI-ის მსჯელობის მოდელების ეფექტიანობა განმამტკიცებელი სწავლებით გააუმჯობესოთ. ჩვენი ზედამხედველობითი ან პრეფერენციებზე დაფუძნებული დამატებითი სწავლების შეთავაზებებისგან განსხვავებით, რომლებშიც საფასური სასწავლო მონაცემთა ნაკრებში არსებული ტოკენების რაოდენობით ითვლება, RFT-ის საფასური ეფუძნება დროს, რომელსაც თქვენი სწავლების გაშვება ძირითადი მანქანური სწავლების სამუშაოს შესრულებაზე ხარჯავს.
ეს გზამკვლევი განმარტავს, რა ითვლება დასაბილინგებელ სასწავლო დროდ, როგორ ვამუშავებთ შეჩერებებსა და გაუქმებებს და როგორ შეიძლება თქვენმა კონფიგურაციის არჩევანმა გავლენა მოახდინოს ღირებულებაზე.
ფასები
გამოთვლები: $100 საათში იმ კალენდარული დროისთვის, რომელიც core training loop-ში იხარჯება
o4-mini-2025-04-16-ისთვის. გადასახადი პროპორციულად ითვლება წამამდე და ინვოისში მრგვალდება ორ ათწილადამდე (მაგ., 2.55 საათი).მოდელი grader-ის გამოყენება: თუ სწავლებისას გამოსავლების “შესაფასებლად” იყენებთ OpenAI მოდელს, ამ შეფასების გამოძახებების მიერ მოხმარებული token-ები სწავლების დასრულების შემდეგ ცალკე ბილინგდება ჩვენი სტანდარტული API ტარიფებით.
საფასურს მხოლოდ იმ სასწავლო სამუშაოზე გაკისრებთ, რომელიც რეალურად აახლებს თქვენს მოდელს (რასაც ჩვენ "captured forward progress"-ს ვუწოდებთ).
რისთვის ვრიცხავთ თანხას
თანხას ვრიცხავთ იმ დროზე, რომელსაც თქვენი ტრენინგის worker აქტიურად უთმობს თქვენი მოდელის ტრენინგს, კერძოდ:
თქვენი მოდელიდან ნიმუშების გენერირება fine-tuning-ის პროცესში (ცნობილია როგორც „rollouts“)
ამ შედეგების შეფასება ერთ ან რამდენიმე შემფასებლით, რომლებიც სამუშაოზე გაქვთ განსაზღვრული (შეიტყვეთ მეტი შემფასებლების შესახებ)
შეფასებებზე დაყრდნობით წონების განახლებების გამოთვლა და გამოყენება (უკუგავრცელება).
თქვენ მიერ კონფიგურირებული ნებისმიერი ვალიდაციის (შეფასების) ნაბიჯის გაშვება.
შემფასებლების უმეტესობის გაშვება „უფასოა“, რაც ნიშნავს, რომ მათი გამოყენებისთვის დამატებით თანხას არ ვრიცხავთ, გარდა იმ დროისა, რომელსაც ისინი ძირითადი ტრენინგის ციკლს უმატებენ. გამონაკლისია მოდელის შემფასებლები, სადაც ასევე ვითვლით token-ებს, რომლებსაც ეს შემფასებლები ზემოთ ჩამოთვლილი აქტივობების დროს მოიხმარენ. ეს token-ები თქვენს ინვოისზე ცალკე პუნქტად გამოჩნდება. მოდელის შემფასებლების მიერ მოხმარებული token-ები ირიცხება ჩვეულებრივი inference-ის ტარიფებით (OpenAI-ის ფასები).
რისთვის არ ვახორციელებთ ბილინგს
საფასურს არ გირიცხავთ შემდეგ დროზე:
თქვენი მონაცემთა ნაკრების ვალიდაცია ან შემოწმება სწავლების დაწყებამდე.
თქვენი მონაცემთა ნაკრების უსაფრთხოების შემოწმებები.
გამოთვლითი რესურსების რიგში ლოდინი.
მოდელის წონების ან მონაცემთა ნაკრების ჩამოტვირთვა.
თქვენი მონაცემთა ნაკრების ჩვენს სასწავლო ფორმატში მომზადება (რენდერინგი).
fine‑tuning გავლილი მოდელის სწავლების შემდგომი უსაფრთხოების შეფასებები.
თუ სასწავლო სამუშაო ჩვენი მხარის შეცდომის გამო დაიკარგება (მაგალითად, თუ მუშაკი ავარიულად გაითიშება და წინა checkpoint-ზე დაბრუნება მოუწევს), დაკარგულ გამოთვლით დროზე ან grader token-ებზე საფასური არ დაგერიცხებათ. ამის შესახებ მეტი დეტალი შემდეგ სექციაშია.
Captured forward progress და ბილინგის მოვლენები
სწავლება თქვენი მოდელის მრავალი მცირე განახლებისგან შედგება. ჩვენ ვაკვირდებით, ამ განახლებებიდან რამდენი სრულდება წარმატებით. გადასახადი ეფუძნება ამ წარმატებულ განახლებებთან დაკავშირებულ გამოთვლით დროსა და grader token-ებს.
გადასახადს ვაკისრებთ, როდესაც ხდება ერთ-ერთი შემდეგი "ბილინგის მოვლენა":
სწავლება წარმატებით სრულდება.
თქვენ აჩერებთ სწავლებას.
თქვენ აუქმებთ სწავლებას.
სწავლება ჩავარდება.
თითოეული გადასახადი ფარავს ბოლო გადასახადის შემდეგ შესრულებულ დამატებით სამუშაოს. მაგალითად:
თუ გაშვებას აჩერებთ, ჩვენ ვინახავთ checkpoint-ს და გირიცხავთ ბოლო გადასახადის შემდეგ გამოყენებულ გამოთვლით დროსა და grader token-ებს.
როდესაც განაახლებთ, სწავლება checkpoint-იდან გრძელდება. შემდეგი გადასახადი (დასრულების, სხვა შეჩერების, გაუქმების ან ჩავარდნისას) დაფარავს მხოლოდ განახლების შემდეგ შესრულებულ დამატებით სამუშაოს.
თუ გაშვებას გააუქმებთ, დაგერიცხებათ გაუქმებამდე შესრულებული სამუშაო.
თუ სწავლება ჩავარდება და ბოლო გადასახადის შემდეგ შესრულებული სამუშაო დაიკარგება, დაკარგულ ნაწილზე ბილინგი არ მოხდება.
ეს "captured forward progress" მიდგომა უზრუნველყოფს, რომ იხდით მხოლოდ იმ სამუშაოსთვის, რომელიც თქვენს მოდელში რჩება ან რომელსაც განზრახ ტოვებთ.
სამუშაოს პროგრესის ნახვა
RFT სამუშაოებს აქვთ ველი სახელად usage_metrics, რომელიც ასახავს სამუშაოს მთლიან გამოყენებას მიმდინარე ნაბიჯამდე. ეს მოიცავს ტრენინგზე დახარჯულ დროს და სამუშაოში ყველა მოდელის შემფასებლის მიერ გამოყენებულ ყველა token-ს. ამ ველის შემოწმება შესაძლებელია API-ის მეშვეობით (GET /v1/fine_tuning/jobs/{job_id}) ან fine-tuning-ის დაფის მეშვეობით.
ფაქტორები, რომლებიც გავლენას ახდენს სწავლების დროზე
რადგან ბილინგი დროზეა დაფუძნებული, თქვენი კონფიგურაციის არჩევანი პირდაპირ მოქმედებს ღირებულებაზე. ძირითადი ფაქტორებია:
პრობლემის სირთულე: თუ თქვენი მონაცემთა ნაკრები რთული პრობლემებისგან შედგება, მოდელი, სავარაუდოდ, თითოეულ პრობლემაზე მეტ დროს დახარჯავს მსჯელობაში, რაც თითოეული ნიმუშის შექმნის დროს ზრდის.
გამოთვლითი ინტენსივობა:
compute_multiplierჰიპერპარამეტრი აკონტროლებს, რამდენ გამოთვლას ასრულებთ თითო სასწავლო ნაბიჯზე. უფრო მაღალი მნიშვნელობები მოდელს უბიძგებს, თითოეულ მონაცემზე უფრო ვრცლად იმსჯელოს, რის გამოც თითოეული ნაბიჯი უფრო ნელა სრულდება.ვალიდაციის პარამეტრები:
უფრო დიდი ვალიდაციის ნაკრები ზრდის შეფასებაზე დახარჯულ დროს.
eval_samples-ის გაზრდა (თითო ვალიდაციის მაგალითზე შეფასებული მოდელის პასუხების რაოდენობა) ზრდის ვალიდაციის დროს.ვალიდაციის უფრო ხშირად გაშვება (უფრო დაბალი
eval_interval) ზრდის ვალიდაციაზე დახარჯული დროის წილს.
Grader-ის წარმადობა:
უფრო დიდი ან უფრო ძლიერი მოდელი grader-ები შეფასების დასაბრუნებლად უფრო მეტ დროს მოითხოვენ, ვიდრე პატარა grader-ები. მაგალითად, მსჯელობის მოდელით შეფასება შესაძლოა 10-ჯერ მეტხანს გაგრძელდეს, ვიდრე არამსჯელობის მოდელით.
რთულ Python შეფასების ფუნქციებს გაშვებისთვის უფრო მეტი დრო სჭირდება, ვიდრე მარტივებს.
ეს პარამეტრები გაძლევთ საშუალებას, დააბალანსოთ ღირებულება, სიჩქარე და მოდელის ხარისხი. მაგალითად, ხშირ ვალიდაციას შეუძლია პრობლემები უფრო ადრე გამოავლინოს, მაგრამ ზრდის ღირებულებას. უფრო მოწინავე მოდელით შეფასებამ შეიძლება მკვეთრად გააუმჯობესოს შეფასების სიზუსტე, მაგრამ შეანელებს შეფასების თითოეულ ნაბიჯს და ჯობს უფრო ძვირს გახდის.
ღირებულების მართვა
დანახარჯების გასაკონტროლებლად:
დაიწყეთ უფრო მოკლე გაშვებებით, რათა გაიგოთ, როგორ მოქმედებს თქვენი კონფიგურაცია დროზე.
გამოიყენეთ ვალიდაციის მაგალითების და
eval_samples-ის გონივრული რაოდენობა. მოერიდეთ საჭიროზე ხშირ ვალიდაციას.აირჩიეთ ყველაზე პატარა grader მოდელი, რომელიც თქვენს ხარისხის მოთხოვნებს აკმაყოფილებს.
შეინარჩუნეთ custom Python grader-ების ეფექტიანობა.
compute_multiplierისე დაარეგულირეთ, რომ კონვერგენციის სიჩქარესა და ღირებულებას შორის ბალანსი დაიცვათ.აკონტროლეთ თქვენი გაშვება dashboard-ში ან API-ის საშუალებით. ნებისმიერ დროს შეგიძლიათ შეჩერება ან გაუქმება.
მაგალითები
წარმატებული ტრენინგის გაშვება
| ტრენინგის დრო | დასარიცხი დრო | სტატუსი | აღწერა |
|---|---|---|---|
| 00:00 | 00:00 | – | მომხმარებელი API-ის მეშვეობით ქმნის RFT სამუშაოს |
| 00:10 | 00:00 | VALIDATING_FILES | 10 წუთი დაიხარჯა მონაცემთა ნაკრების ვალიდაციაზე |
| 00:30 | 00:00 | VALIDATING_FILES | 20 წუთი მიმდინარეობდა მონაცემთა ნაკრების უსაფრთხოების შემოწმებები |
| 01:00 | 00:00 | QUEUED | 30 წუთი ხელმისაწვდომი worker-ის მოლოდინში |
| 01:30 | 00:00 | RUNNING | 30 წუთი ტრენინგის მომზადებაზე (წონების ჩამოტვირთვა, წინასწარი დამუშავება და ა.შ.) |
| 05:30 | 04:00 | RUNNING | 4 საათი დაიხარჯა ტრენინგზე |
| 06:00 | 04:00 | RUNNING | 30 წუთი მიღებული მოდელის უსაფრთხოების შეფასებებზე |
| 06:00 | 04:00 | SUCCEEDED | ტრენინგი სრულდება |
ამ შემთხვევაში, სრული გასული დრო 6 საათია, მაგრამ მხოლოდ 4 საათია დასარიცხი. ღირებულება იქნება 4 საათი × $100/საათი = $400.
წარუმატებელი სამუშაოს მაგალითი
ამ მაგალითში გაშვება 2 საათი გადის ტრენინგს, წერს საკონტროლო წერტილს, კიდევ 1 საათი გადის ტრენინგს, მაგრამ შემდეგ ვერ სრულდება. დასარიცხია მხოლოდ საკონტროლო წერტილამდე შესრულებული 2 საათის ტრენინგი.
| ტრენინგის დრო | დასარიცხი დრო | სტატუსი | აღწერა |
|---|---|---|---|
| 00:00 | 00:00 | – | მომხმარებელი API-ის მეშვეობით ქმნის RFT სამუშაოს |
| 00:10 | 00:00 | VALIDATING_FILES | 10 წუთი დაიხარჯა მონაცემთა ნაკრების ვალიდაციაზე |
| 00:30 | 00:00 | VALIDATING_FILES | 20 წუთი მიმდინარეობდა მონაცემთა ნაკრების უსაფრთხოების შემოწმებები |
| 01:00 | 00:00 | QUEUED | 30 წუთი ხელმისაწვდომი worker-ის მოლოდინში |
| 01:30 | 00:00 | RUNNING | 30 წუთი ტრენინგის მომზადებაზე (წონების ჩამოტვირთვა, წინასწარი დამუშავება და ა.შ.) |
| 03:30 | 02:00 | RUNNING | 2 საათი დაიხარჯა ტრენინგზე |
| 03:30 | 02:00 | RUNNING | საკონტროლო წერტილი შეიქმნა მე-5 ნაბიჯზე |
| 04:30 | 02:00 | RUNNING | ტრენინგი ვერ სრულდება მე-8 ნაბიჯზე შიდა შეცდომის გამო (კიდევ 1 საათის შემდეგ) |
| 04:30 | 02:00 | RUNNING | 30 წუთი საკონტროლო წერტილის შეფასებასა და ვალიდაციაზე |
| 04:30 | 02:00 | SUCCEEDED | სამუშაო სრულდება (უახლესი საკონტროლო წერტილით) |
მიუხედავად იმისა, რომ ჯამში ტრენინგზე 3 საათი დაიხარჯა, გამოსადეგ საკონტროლო წერტილში მხოლოდ 2 საათია „ასახული“ და თანხაც მასზე ირიცხება. წარუმატებლობის გამო დაკარგულ ერთ საათიან ტრენინგზე თქვენ პასუხისმგებელი არ ხართ. ღირებულება იქნება 2 საათი × $100/საათი = $200.
ხშირად დასმული კითხვები
როდის ჩამომეჭრება თანხა?
ანგარიშსწორება ხდება, როცა თქვენი გაშვება სრულდება, პაუზდება, უქმდება ან ვერ სრულდება. თითოეული ანგარიში მოიცავს წინა ანგარიშის შემდეგ შესრულებულ სამუშაოს.
ვიხდი თუ გაშვება ვერ შესრულდა?
თუ გაშვება ჩვენი შეცდომის გამო ვერ შესრულდა და ბოლო ტრენინგის სამუშაოს ნაწილი დაიკარგა, დაკარგული ნაწილისთვის თანხა არ ჩამოგეჭრებათ. თუ გაშვებას გააუქმებთ, თანხა ჩამოგეჭრებათ გაუქმებამდე შესრულებული სამუშაოსთვის.
როგორ ირიცხება შემფასებელი მოდელის token-ების საფასური?
ვითვლით token-ებს, რომლებიც გამოიყენება თქვენ მიერ კონფიგურირებული ნებისმიერი მოდელის შემფასებლის მიერ. ტრენინგის დასრულების შემდეგ, ამ token-ებს ჩვენი სტანდარტული თითო-token-ის ტარიფებით ვრიცხავთ.
შემიძლია გაშვების დაპაუზება და განახლება?
დიახ. როცა აპაუზებთ, ვინახავთ საკონტროლო წერტილს და თანხას აქამდე შესრულებული სამუშაოსთვის ვრიცხავთ. როცა განაახლებთ, თანხა ჩამოგეჭრებათ მხოლოდ განახლების შემდეგ შესრულებული დამატებითი სამუშაოსთვის.
თუ Reinforcement Fine‑Tuning-ის ბილინგთან დაკავშირებით სხვა კითხვები გაქვთ, დაუკავშირდით ჩვენს მხარდაჭერის გუნდს.
