RFT साठी बिल कसे आकारले जाते
रीइन्फोर्समेंट फाइन-ट्यूनिंग (RFT) मुळे तुम्हाला रीइन्फोर्समेंट लर्निंग वापरून OpenAI च्या रीझनिंग मॉडेलचे कार्यप्रदर्शन सुधारता येते. आमच्या पर्यवेक्षित किंवा प्राधान्याधारित फाइन-ट्यूनिंग सेवांमध्ये प्रशिक्षण डेटासेटमधील टोकनच्या संख्येनुसार बिल आकारले जाते; त्याउलट, RFT चे बिल तुमचा प्रशिक्षण रन मुख्य मशीन लर्निंगचे काम करण्यात घालवलेल्या वेळेवर आधारित असते.
या मार्गदर्शकात बिल करण्यायोग्य प्रशिक्षण वेळेत काय मोजले जाते, pauses आणि cancellations आम्ही कसे हाताळतो, आणि तुमच्या कॉन्फिगरेशनच्या निवडी खर्चावर कशा परिणाम करू शकतात हे स्पष्ट केले आहे.
किंमत
Compute:
o4-mini-2025-04-16साठी core training loop मध्ये गेलेल्या wall-clock वेळेप्रमाणे प्रति तास $100. शुल्क सेकंदापर्यंत prorate केले जाते आणि invoice वर दोन दशांश स्थानेपर्यंत round केले जाते (उदा., 2.55 तास).Model grader usage: जर तुम्ही प्रशिक्षणादरम्यान outputs ला "grade" करण्यासाठी OpenAI मॉडेल वापरत असाल, तर त्या grading calls मध्ये वापरलेले टोकन्स प्रशिक्षण पूर्ण झाल्यानंतर आमच्या standard API दरांनुसार स्वतंत्रपणे बिल केले जातात.
आम्ही फक्त तुमचे मॉडेल प्रत्यक्षात अपडेट करणाऱ्या प्रशिक्षण कामासाठीच शुल्क आकारतो (याला आम्ही "captured forward progress" म्हणतो).
आम्ही कशासाठी बिल करतो
तुमचा प्रशिक्षण वर्कर तुमच्या मॉडेलला सक्रियपणे प्रशिक्षण देण्यात घालवतो त्या वेळेसाठी आम्ही बिल करतो, विशेषतः:
फाइन-ट्यूनिंग प्रक्रियेदरम्यान तुमच्या मॉडेलमधून नमुने तयार करणे (“रोलआउट्स” म्हणून ओळखले जाते)
जॉबवर तुम्ही परिभाषित केलेल्या एक किंवा अधिक ग्रेडर्सद्वारे त्या आउटपुटचे मूल्यांकन करणे (ग्रेडर्सबद्दल अधिक जाणून घ्या)
ग्रेड्सच्या आधारे वेट अपडेट्स मोजणे आणि लागू करणे (बॅकप्रोपेगेशन).
तुम्ही कॉन्फिगर केलेली कोणतीही सत्यापन (मूल्यांकन) पावले चालवणे.
बहुतेक ग्रेडर्स चालवण्यासाठी “मोफत” असतात, म्हणजे मुख्य प्रशिक्षण लूपमध्ये ते जितका वेळ योगदान देतात त्याव्यतिरिक्त त्यांच्या वापरासाठी आम्ही वेगळे शुल्क आकारत नाही. याला अपवाद म्हणजे मॉडेल ग्रेडर्स; वरील क्रियांदरम्यान हे ग्रेडर्स वापरतात त्या टोकनचीही आम्ही मोजणी करतो. ही टोकन तुमच्या इनव्हॉइसवर स्वतंत्र लाइन आयटम म्हणून दिसतात. मॉडेल ग्रेडर्सने वापरलेल्या टोकनसाठी सामान्य इन्फरन्स दरांनुसार बिल केले जाते (OpenAI किंमत).
आम्ही कशासाठी बिल करत नाही
खालील गोष्टींवर गेलेल्या वेळेसाठी आम्ही शुल्क आकारत नाही:
प्रशिक्षण सुरू होण्यापूर्वी तुमचा डेटासेट validate करणे किंवा तपासणे.
तुमच्या डेटासेटवरील safety checks.
compute resources साठी queue मध्ये प्रतीक्षा.
मॉडेल weights किंवा datasets डाउनलोड करणे.
आमच्या training format मध्ये तुमचा डेटासेट तयार करणे (rendering).
तुमच्या fine‑tuned मॉडेलचे post‑training safety evaluations.
आमच्या बाजूच्या त्रुटीमुळे प्रशिक्षणाचे काम गमावले गेले (उदाहरणार्थ, worker crash झाला आणि त्याला मागील checkpoint वर roll back करावे लागले), तर गमावलेल्या compute time किंवा grader tokens साठी तुमच्याकडून शुल्क आकारले जात नाही. याबद्दल पुढील विभागात अधिक तपशील आहे.
Captured forward progress आणि billing events
प्रशिक्षणामध्ये तुमच्या मॉडेलमधील अनेक लहान updates असतात. यापैकी किती updates यशस्वीपणे पूर्ण होतात याचा आम्ही मागोवा घेतो. शुल्क या यशस्वी updates शी संबंधित compute time आणि grader tokens यांवर आधारित असते.
खालीलपैकी एखादा "billing event" घडल्यावर आम्ही शुल्क आकारतो:
प्रशिक्षण यशस्वीरित्या पूर्ण होते.
तुम्ही प्रशिक्षण pause करता.
तुम्ही प्रशिक्षण cancel करता.
प्रशिक्षण अयशस्वी होते.
प्रत्येक शुल्कात मागील शुल्कानंतर केलेले incremental काम समाविष्ट असते. उदाहरणार्थ:
तुम्ही run pause केल्यास, आम्ही checkpoint जतन करतो आणि मागील शुल्कानंतर वापरलेल्या compute time आणि grader tokens साठी शुल्क आकारतो.
तुम्ही resume केल्यावर, प्रशिक्षण checkpoint पासून पुढे सुरू राहते. पुढील शुल्कात (पूर्णता, पुन्हा pause, cancellation किंवा failure वेळी) resume नंतर केलेले फक्त अतिरिक्त काम समाविष्ट असेल.
तुम्ही run cancel केल्यास, cancellation पर्यंत केलेल्या कामासाठी आम्ही शुल्क आकारतो.
प्रशिक्षण अयशस्वी झाले आणि मागील शुल्कानंतरचे काम गमावले गेले, तर गमावलेल्या भागासाठी तुमच्याकडून बिल घेतले जात नाही.
हा "captured forward progress" दृष्टिकोन हे सुनिश्चित करतो की तुमच्या मॉडेलमध्ये टिकून राहिलेल्या किंवा तुम्ही जाणीवपूर्वक सोडून दिलेल्या कामासाठीच तुम्ही पैसे देता.
जॉबची प्रगती पाहणे
RFT जॉबमध्ये usage_metrics नावाचे फील्ड असते, जे सध्याच्या टप्प्यापर्यंतच्या जॉबच्या एकूण वापराची नोंद करते. यात प्रशिक्षणासाठी लागलेला वेळ आणि जॉबवरील सर्व मॉडेल ग्रेडर्समध्ये वापरलेले सर्व टोकन समाविष्ट असतात. हे फील्ड API (GET /v1/fine_tuning/jobs/{job_id}) द्वारे किंवा फाइन-ट्यूनिंग डॅशबोर्ड द्वारे तपासता येते.
प्रशिक्षण वेळेवर परिणाम करणारे घटक
बिलिंग वेळेवर आधारित असल्यामुळे, तुमच्या कॉन्फिगरेशनच्या निवडी थेट खर्चावर परिणाम करतात. महत्त्वाचे घटक पुढीलप्रमाणे आहेत:
समस्येची कठीणता: तुमच्या डेटासेटमध्ये कठीण समस्या असतील, तर मॉडेल प्रत्येक समस्येवर रीझनिंग करण्यात अधिक वेळ घालवेल, ज्यामुळे प्रत्येक sample तयार करण्यासाठी लागणारा वेळ वाढतो.
Compute intensity:
compute_multiplierहा hyperparameter प्रत्येक training step साठी तुम्ही किती computation करता हे नियंत्रित करतो. जास्त मूल्ये मॉडेलला प्रत्येक datapoint वर अधिक तपशीलवार रीझनिंग करण्यास प्रोत्साहित करतात, त्यामुळे प्रत्येक step अधिक हळू चालते.Validation settings:
मोठा validation set असल्यास evaluation साठी लागणारा वेळ वाढतो.
eval_samplesवाढवल्यास (प्रत्येक validation उदाहरणासाठी grade केलेल्या मॉडेल outputs ची संख्या), validation वेळ वाढतो.Validation अधिक वारंवार चालवल्यास (कमी
eval_interval), validation वर जाणारा वेळाचा वाटा वाढतो.
Grader performance:
मोठे किंवा अधिक सक्षम मॉडेल graders छोटे graders पेक्षा grade परत देण्यासाठी जास्त वेळ घेतात. उदाहरणार्थ, रीझनिंग मॉडेलसह grading करण्यास non-reasoning मॉडेलपेक्षा 10x जास्त वेळ लागू शकतो.
जटिल Python grading functions साध्या functions पेक्षा चालण्यासाठी अधिक वेळ घेतात.
या settings मुळे तुम्ही खर्च, वेग आणि मॉडेल गुणवत्ता यांमध्ये समतोल साधू शकता. उदाहरणार्थ, वारंवार validation केल्याने समस्या लवकर सापडू शकतात, पण खर्च वाढतो. अधिक प्रगत मॉडेलसह grading केल्याने grading accuracy मोठ्या प्रमाणात सुधारू शकते, पण प्रत्येक grading step मंदावेल आणि jobs अधिक महाग होतील.
खर्च व्यवस्थापन
तुमचा खर्च नियंत्रित करण्यासाठी:
तुमच्या कॉन्फिगरेशनचा वेळेवर कसा परिणाम होतो हे समजण्यासाठी लहान runs पासून सुरुवात करा.
validation examples आणि
eval_samplesयांची वाजवी संख्या वापरा. गरजेपेक्षा जास्त वारंवार validation करणे टाळा.तुमच्या गुणवत्ता गरजा पूर्ण करणारे सर्वात छोटे grader मॉडेल निवडा.
custom Python graders कार्यक्षम ठेवा.
convergence speed आणि खर्च यांच्यात समतोल राखण्यासाठी
compute_multiplierसमायोजित करा.तुमचा run dashboard मध्ये किंवा API द्वारे मॉनिटर करा. तुम्ही कोणत्याही वेळी pause किंवा cancel करू शकता.
उदाहरणे
यशस्वी प्रशिक्षण रन
| प्रशिक्षण वेळ | बिल केलेला वेळ | स्थिती | वर्णन |
|---|---|---|---|
| 00:00 | 00:00 | – | वापरकर्ता API द्वारे RFT जॉब तयार करतो |
| 00:10 | 00:00 | VALIDATING_FILES | डेटासेटची पडताळणी करण्यात 10 मिनिटे खर्च झाली |
| 00:30 | 00:00 | VALIDATING_FILES | डेटासेट सुरक्षा तपासण्या चालवण्यात 20 मिनिटे खर्च झाली |
| 01:00 | 00:00 | QUEUED | उपलब्ध वर्करची प्रतीक्षा करण्यात 30 मिनिटे खर्च झाली |
| 01:30 | 00:00 | RUNNING | प्रशिक्षण सेट करण्यात 30 मिनिटे खर्च झाली (वेट्स डाउनलोड करणे, प्रीप्रोसेसिंग इ.) |
| 05:30 | 04:00 | RUNNING | प्रशिक्षणासाठी 4 तास खर्च झाले |
| 06:00 | 04:00 | RUNNING | परिणामी मॉडेलचे सुरक्षा मूल्यांकन चालवण्यात 30 मिनिटे खर्च झाली |
| 06:00 | 04:00 | SUCCEEDED | प्रशिक्षण पूर्ण होते |
या प्रकरणात, एकूण वॉल-क्लॉक वेळ 6 तास आहे, पण फक्त 4 तासांसाठी बिल लागू आहे. खर्च 4 तास × $100/तास = $400 असेल.
अयशस्वी जॉबचे उदाहरण
या उदाहरणात, रन 2 तास प्रशिक्षण घेतो, चेकपॉइंट लिहितो, आणखी 1 तास प्रशिक्षण घेतो, पण नंतर अयशस्वी होतो. चेकपॉइंटपर्यंतच्या फक्त 2 तासांच्या प्रशिक्षणासाठी बिल लागू आहे.
| प्रशिक्षण वेळ | बिल केलेला वेळ | स्थिती | वर्णन |
|---|---|---|---|
| 00:00 | 00:00 | – | वापरकर्ता API द्वारे RFT जॉब तयार करतो |
| 00:10 | 00:00 | VALIDATING_FILES | डेटासेटची पडताळणी करण्यात 10 मिनिटे खर्च झाली |
| 00:30 | 00:00 | VALIDATING_FILES | डेटासेट सुरक्षा तपासण्या चालवण्यात 20 मिनिटे खर्च झाली |
| 01:00 | 00:00 | QUEUED | उपलब्ध वर्करची प्रतीक्षा करण्यात 30 मिनिटे खर्च झाली |
| 01:30 | 00:00 | RUNNING | प्रशिक्षण सेट करण्यात 30 मिनिटे खर्च झाली (वेट्स डाउनलोड करणे, प्रीप्रोसेसिंग इ.) |
| 03:30 | 02:00 | RUNNING | प्रशिक्षणासाठी 2 तास खर्च झाले |
| 03:30 | 02:00 | RUNNING | स्टेप 5 वर चेकपॉइंट तयार झाला |
| 04:30 | 02:00 | RUNNING | स्टेप 8 वर अंतर्गत त्रुटीमुळे प्रशिक्षण अयशस्वी होते (आणखी 1 तासानंतर) |
| 04:30 | 02:00 | RUNNING | चेकपॉइंटचे मूल्यांकन आणि सत्यापन करण्यात 30 मिनिटे खर्च झाली |
| 04:30 | 02:00 | SUCCEEDED | जॉब पूर्ण होतो (नवीनतम चेकपॉइंटसह) |
एकूण 3 तास प्रशिक्षणात खर्च झाले असले, तरी फक्त 2 तास वापरण्यायोग्य चेकपॉइंटमध्ये “कॅप्चर” झाले आहेत आणि त्यांचे बिल केले जाते. अयशस्वी झाल्यामुळे गमावलेल्या प्रशिक्षण कामाच्या तासाची जबाबदारी तुमची नाही. खर्च 2 तास × $100/तास = $200 असेल.
नेहमी विचारले जाणारे प्रश्न
माझ्याकडून शुल्क कधी आकारले जाते?
तुमचा रन पूर्ण झाल्यावर, थांबवला गेल्यावर, रद्द झाल्यावर किंवा अयशस्वी झाल्यावर आम्ही बिल करतो. प्रत्येक बिल मागील बिलानंतर केलेल्या कामासाठी असते.
रन अयशस्वी झाल्यास मला पैसे द्यावे लागतात का?
आमच्या त्रुटीमुळे रन अयशस्वी झाला आणि अलीकडील कोणतेही प्रशिक्षण काम गमावले गेले, तर गमावलेल्या भागासाठी तुमच्याकडून शुल्क आकारले जात नाही. तुम्ही रन रद्द केल्यास, रद्द करेपर्यंत केलेल्या कामासाठी तुमच्याकडून शुल्क आकारले जाते.
ग्रेडर मॉडेल टोकनचे बिल कसे केले जाते?
तुम्ही कॉन्फिगर केलेले कोणतेही मॉडेल ग्रेडर्स वापरतात त्या टोकनची आम्ही मोजणी करतो. प्रशिक्षण पूर्ण झाल्यानंतर, आम्ही त्या टोकनसाठी आमच्या मानक प्रति-टोकन दरांनुसार बिल करतो.
मी रन थांबवून पुन्हा सुरू करू शकतो का?
होय. तुम्ही थांबवल्यावर, आम्ही चेकपॉइंट सेव्ह करतो आणि आतापर्यंत केलेल्या कामासाठी शुल्क आकारतो. तुम्ही पुन्हा सुरू केल्यावर, पुन्हा सुरू केल्यानंतर केलेल्या अतिरिक्त कामासाठीच तुमच्याकडून शुल्क आकारले जाईल.
रीइन्फोर्समेंट फाइन-ट्यूनिंग बिलिंगबद्दल तुमचे इतर प्रश्न असल्यास, आमच्या सपोर्ट टीमशी संपर्क साधा.
