RFT साठी बिल कसे आकारले जाते
रीइन्फोर्समेंट फाइन-ट्यूनिंग (RFT) मुळे तुम्हाला रीइन्फोर्समेंट लर्निंग वापरून OpenAI च्या रीझनिंग मॉडेलचे कार्यप्रदर्शन सुधारता येते. आमच्या पर्यवेक्षित किंवा प्राधान्याधारित फाइन-ट्यूनिंग सेवांमध्ये प्रशिक्षण डेटासेटमधील टोकनच्या संख्येनुसार बिल आकारले जाते; त्याउलट, RFT चे बिल तुमचा प्रशिक्षण रन मुख्य मशीन लर्निंगचे काम करण्यात घालवलेल्या वेळेवर आधारित असते.
या मार्गदर्शकात बिल करण्यायोग्य प्रशिक्षण वेळेत काय मोजले जाते, pauses आणि cancellations आम्ही कसे हाताळतो, आणि तुमच्या कॉन्फिगरेशनच्या निवडी खर्चावर कशा परिणाम करू शकतात हे स्पष्ट केले आहे.
दर
संगणन: o4-mini-2025-04-16 च्या मुख्य प्रशिक्षण चक्रात लागलेल्या प्रत्यक्ष वेळेसाठी प्रति तास $100. शुल्क सेकंदाच्या प्रमाणात आकारले जाते आणि देयकात दोन दशांश स्थानांपर्यंत पूर्णांकित केले जाते (उदा., 2.55 तास).
मॉडेल मूल्यांकनकर्त्याचा वापर: प्रशिक्षणादरम्यान निष्पत्तींचे "गुणांकन" करण्यासाठी तुम्ही OpenAI मॉडेल वापरल्यास, त्या गुणांकन विनंत्यांनी वापरलेल्या टोकनचे शुल्क प्रशिक्षण पूर्ण झाल्यानंतर आमच्या प्रमाणित API दरांनुसार स्वतंत्रपणे आकारले जाते.
तुमचे मॉडेल प्रत्यक्षात अद्ययावत करणाऱ्या प्रशिक्षण कार्यासाठीच आम्ही शुल्क आकारतो. याला आम्ही "नोंदवलेली प्रत्यक्ष प्रगती" म्हणतो.
आम्ही कशासाठी बिल करतो
तुमचा प्रशिक्षण वर्कर तुमच्या मॉडेलला सक्रियपणे प्रशिक्षण देण्यात घालवतो त्या वेळेसाठी आम्ही बिल करतो, विशेषतः:
फाइन-ट्यूनिंग प्रक्रियेदरम्यान तुमच्या मॉडेलमधून नमुने तयार करणे (“रोलआउट्स” म्हणून ओळखले जाते)
जॉबवर तुम्ही परिभाषित केलेल्या एक किंवा अधिक ग्रेडर्सद्वारे त्या आउटपुटचे मूल्यांकन करणे (ग्रेडर्सबद्दल अधिक जाणून घ्या)
ग्रेड्सच्या आधारे वेट अपडेट्स मोजणे आणि लागू करणे (बॅकप्रोपेगेशन).
तुम्ही कॉन्फिगर केलेली कोणतीही सत्यापन (मूल्यांकन) पावले चालवणे.
बहुतेक ग्रेडर्स चालवण्यासाठी “मोफत” असतात, म्हणजे मुख्य प्रशिक्षण लूपमध्ये ते जितका वेळ योगदान देतात त्याव्यतिरिक्त त्यांच्या वापरासाठी आम्ही वेगळे शुल्क आकारत नाही. याला अपवाद म्हणजे मॉडेल ग्रेडर्स; वरील क्रियांदरम्यान हे ग्रेडर्स वापरतात त्या टोकनचीही आम्ही मोजणी करतो. ही टोकन तुमच्या इनव्हॉइसवर स्वतंत्र लाइन आयटम म्हणून दिसतात. मॉडेल ग्रेडर्सने वापरलेल्या टोकनसाठी सामान्य इन्फरन्स दरांनुसार बिल केले जाते (OpenAI किंमत).
आम्ही कशासाठी बिल करत नाही
खालील गोष्टींवर गेलेल्या वेळेसाठी आम्ही शुल्क आकारत नाही:
प्रशिक्षण सुरू होण्यापूर्वी तुमचा डेटासेट validate करणे किंवा तपासणे.
तुमच्या डेटासेटवरील safety checks.
compute resources साठी queue मध्ये प्रतीक्षा.
मॉडेल weights किंवा datasets डाउनलोड करणे.
आमच्या training format मध्ये तुमचा डेटासेट तयार करणे (rendering).
तुमच्या fine‑tuned मॉडेलचे post‑training safety evaluations.
आमच्या बाजूच्या त्रुटीमुळे प्रशिक्षणाचे काम गमावले गेले (उदाहरणार्थ, worker crash झाला आणि त्याला मागील checkpoint वर roll back करावे लागले), तर गमावलेल्या compute time किंवा grader tokens साठी तुमच्याकडून शुल्क आकारले जात नाही. याबद्दल पुढील विभागात अधिक तपशील आहे.
Captured forward progress आणि billing events
प्रशिक्षणामध्ये तुमच्या मॉडेलमधील अनेक लहान updates असतात. यापैकी किती updates यशस्वीपणे पूर्ण होतात याचा आम्ही मागोवा घेतो. शुल्क या यशस्वी updates शी संबंधित compute time आणि grader tokens यांवर आधारित असते.
खालीलपैकी एखादा "billing event" घडल्यावर आम्ही शुल्क आकारतो:
प्रशिक्षण यशस्वीरित्या पूर्ण होते.
तुम्ही प्रशिक्षण pause करता.
तुम्ही प्रशिक्षण cancel करता.
प्रशिक्षण अयशस्वी होते.
प्रत्येक शुल्कात मागील शुल्कानंतर केलेले incremental काम समाविष्ट असते. उदाहरणार्थ:
तुम्ही run pause केल्यास, आम्ही checkpoint जतन करतो आणि मागील शुल्कानंतर वापरलेल्या compute time आणि grader tokens साठी शुल्क आकारतो.
तुम्ही resume केल्यावर, प्रशिक्षण checkpoint पासून पुढे सुरू राहते. पुढील शुल्कात (पूर्णता, पुन्हा pause, cancellation किंवा failure वेळी) resume नंतर केलेले फक्त अतिरिक्त काम समाविष्ट असेल.
तुम्ही run cancel केल्यास, cancellation पर्यंत केलेल्या कामासाठी आम्ही शुल्क आकारतो.
प्रशिक्षण अयशस्वी झाले आणि मागील शुल्कानंतरचे काम गमावले गेले, तर गमावलेल्या भागासाठी तुमच्याकडून बिल घेतले जात नाही.
हा "captured forward progress" दृष्टिकोन हे सुनिश्चित करतो की तुमच्या मॉडेलमध्ये टिकून राहिलेल्या किंवा तुम्ही जाणीवपूर्वक सोडून दिलेल्या कामासाठीच तुम्ही पैसे देता.
कार्याची प्रगती पाहणे
RFT कार्यांमध्ये usage_metrics नावाचे क्षेत्र असते, ज्यात सध्याच्या टप्प्यापर्यंतच्या कार्याच्या एकूण वापराची नोंद असते. यात प्रशिक्षणासाठी लागलेला वेळ आणि कार्यातील सर्व मॉडेल मूल्यांकनकर्त्यांनी वापरलेले सर्व टोकन समाविष्ट असतात. हे क्षेत्र API द्वारे (GET /v1/fine_tuning/jobs/{job_id}) किंवा सूक्ष्म-जुळवणी नियंत्रणफलकाद्वारे तपासता येते.
प्रशिक्षणाच्या वेळेवर परिणाम करणारे घटक
शुल्क वेळेनुसार आकारले जात असल्यामुळे, तुमच्या संरचनेच्या निवडींचा खर्चावर थेट परिणाम होतो. मुख्य घटक पुढीलप्रमाणे आहेत:
समस्येची अवघडपणा: तुमच्या डेटासंचात अवघड समस्या असल्यास, मॉडेल प्रत्येक समस्येवर रीझनिंग करण्यासाठी अधिक वेळ घेण्याची शक्यता असते. त्यामुळे प्रत्येक नमुना तयार करण्यासाठी अधिक वेळ लागतो.
संगणकीय तीव्रता: प्रत्येक प्रशिक्षण टप्प्यात किती संगणन केले जाते, हे compute_multiplier अतिमापदंड नियंत्रित करतो. उच्च मूल्यांमुळे मॉडेल प्रत्येक डेटाबिंदूवर अधिक विस्ताराने रीझनिंग करते, त्यामुळे प्रत्येक टप्पा अधिक हळू चालतो.
प्रमाणीकरणाची संरचना:
मूल्यांकनकर्त्याची कामगिरी:
लहान मॉडेल मूल्यांकनकर्त्यांच्या तुलनेत मोठ्या किंवा अधिक सक्षम मॉडेल मूल्यांकनकर्त्यांना गुणांकन देण्यासाठी अधिक वेळ लागतो. उदाहरणार्थ, रीझनिंग मॉडेलने गुणांकन करण्यास रीझनिंग नसलेल्या मॉडेलच्या तुलनेत 10 पट अधिक वेळ लागू शकतो.
सोप्या फलनांच्या तुलनेत क्लिष्ट Python गुणांकन फलने चालवण्यासाठी अधिक वेळ लागतो.
या संरचनांद्वारे तुम्ही खर्च, वेग आणि मॉडेलची गुणवत्ता यांचा योग्य समतोल साधू शकता. उदाहरणार्थ, वारंवार प्रमाणीकरण केल्याने समस्या लवकर सापडू शकतात, पण खर्च वाढतो. अधिक प्रगत मॉडेलने गुणांकन केल्यास अचूकता मोठ्या प्रमाणात सुधारू शकते, पण प्रत्येक गुणांकन टप्पा मंदावतो आणि कार्य अधिक खर्चिक होते.
खर्चाचे व्यवस्थापन
तुमचा खर्च नियंत्रित करण्यासाठी:
तुमच्या संरचनेचा वेळेवर कसा परिणाम होतो हे समजून घेण्यासाठी सुरुवातीला कमी कालावधीच्या प्रशिक्षण प्रक्रिया चालवा.
प्रमाणीकरण उदाहरणे आणि eval_samples यांची संख्या वाजवी ठेवा. गरजेपेक्षा अधिक वारंवार प्रमाणीकरण करणे टाळा.
तुमच्या गुणवत्तेच्या गरजा पूर्ण करणारे सर्वांत लहान मूल्यांकनकर्ता मॉडेल निवडा.
सानुकूल Python मूल्यांकनकर्ते कार्यक्षम ठेवा.
अभिसरणाचा वेग आणि खर्च यांचा समतोल साधण्यासाठी compute_multiplier समायोजित करा.
नियंत्रणफलकावर किंवा API द्वारे तुमच्या प्रशिक्षण प्रक्रियेचे निरीक्षण करा. तुम्ही ती कधीही थांबवू किंवा रद्द करू शकता.
उदाहरणे
यशस्वी प्रशिक्षण रन
| प्रशिक्षण वेळ | बिल केलेला वेळ | स्थिती | वर्णन |
|---|---|---|---|
| 00:00 | 00:00 | – | वापरकर्ता API द्वारे RFT जॉब तयार करतो |
| 00:10 | 00:00 | VALIDATING_FILES | डेटासेटची पडताळणी करण्यात 10 मिनिटे खर्च झाली |
| 00:30 | 00:00 | VALIDATING_FILES | डेटासेट सुरक्षा तपासण्या चालवण्यात 20 मिनिटे खर्च झाली |
| 01:00 | 00:00 | QUEUED | उपलब्ध वर्करची प्रतीक्षा करण्यात 30 मिनिटे खर्च झाली |
| 01:30 | 00:00 | RUNNING | प्रशिक्षण सेट करण्यात 30 मिनिटे खर्च झाली (वेट्स डाउनलोड करणे, प्रीप्रोसेसिंग इ.) |
| 05:30 | 04:00 | RUNNING | प्रशिक्षणासाठी 4 तास खर्च झाले |
| 06:00 | 04:00 | RUNNING | परिणामी मॉडेलचे सुरक्षा मूल्यांकन चालवण्यात 30 मिनिटे खर्च झाली |
| 06:00 | 04:00 | SUCCEEDED | प्रशिक्षण पूर्ण होते |
या प्रकरणात, एकूण वॉल-क्लॉक वेळ 6 तास आहे, पण फक्त 4 तासांसाठी बिल लागू आहे. खर्च 4 तास × $100/तास = $400 असेल.
अयशस्वी जॉबचे उदाहरण
या उदाहरणात, रन 2 तास प्रशिक्षण घेतो, चेकपॉइंट लिहितो, आणखी 1 तास प्रशिक्षण घेतो, पण नंतर अयशस्वी होतो. चेकपॉइंटपर्यंतच्या फक्त 2 तासांच्या प्रशिक्षणासाठी बिल लागू आहे.
| प्रशिक्षण वेळ | बिल केलेला वेळ | स्थिती | वर्णन |
|---|---|---|---|
| 00:00 | 00:00 | – | वापरकर्ता API द्वारे RFT जॉब तयार करतो |
| 00:10 | 00:00 | VALIDATING_FILES | डेटासेटची पडताळणी करण्यात 10 मिनिटे खर्च झाली |
| 00:30 | 00:00 | VALIDATING_FILES | डेटासेट सुरक्षा तपासण्या चालवण्यात 20 मिनिटे खर्च झाली |
| 01:00 | 00:00 | QUEUED | उपलब्ध वर्करची प्रतीक्षा करण्यात 30 मिनिटे खर्च झाली |
| 01:30 | 00:00 | RUNNING | प्रशिक्षण सेट करण्यात 30 मिनिटे खर्च झाली (वेट्स डाउनलोड करणे, प्रीप्रोसेसिंग इ.) |
| 03:30 | 02:00 | RUNNING | प्रशिक्षणासाठी 2 तास खर्च झाले |
| 03:30 | 02:00 | RUNNING | स्टेप 5 वर चेकपॉइंट तयार झाला |
| 04:30 | 02:00 | RUNNING | स्टेप 8 वर अंतर्गत त्रुटीमुळे प्रशिक्षण अयशस्वी होते (आणखी 1 तासानंतर) |
| 04:30 | 02:00 | RUNNING | चेकपॉइंटचे मूल्यांकन आणि सत्यापन करण्यात 30 मिनिटे खर्च झाली |
| 04:30 | 02:00 | SUCCEEDED | जॉब पूर्ण होतो (नवीनतम चेकपॉइंटसह) |
एकूण 3 तास प्रशिक्षणात खर्च झाले असले, तरी फक्त 2 तास वापरण्यायोग्य चेकपॉइंटमध्ये “कॅप्चर” झाले आहेत आणि त्यांचे बिल केले जाते. अयशस्वी झाल्यामुळे गमावलेल्या प्रशिक्षण कामाच्या तासाची जबाबदारी तुमची नाही. खर्च 2 तास × $100/तास = $200 असेल.
नेहमी विचारले जाणारे प्रश्न
माझ्याकडून शुल्क कधी आकारले जाते?
तुमची प्रशिक्षण प्रक्रिया पूर्ण झाल्यावर, थांबवल्यावर, रद्द केल्यावर किंवा अयशस्वी झाल्यावर आम्ही शुल्क आकारतो. प्रत्येक देयकात मागील देयकानंतर केलेल्या कामाचे शुल्क समाविष्ट असते.
रन अयशस्वी झाल्यास मला पैसे द्यावे लागतात का?
आमच्या त्रुटीमुळे रन अयशस्वी झाला आणि अलीकडील कोणतेही प्रशिक्षण काम गमावले गेले, तर गमावलेल्या भागासाठी तुमच्याकडून शुल्क आकारले जात नाही. तुम्ही रन रद्द केल्यास, रद्द करेपर्यंत केलेल्या कामासाठी तुमच्याकडून शुल्क आकारले जाते.
ग्रेडर मॉडेल टोकनचे बिल कसे केले जाते?
तुम्ही कॉन्फिगर केलेले कोणतेही मॉडेल ग्रेडर्स वापरतात त्या टोकनची आम्ही मोजणी करतो. प्रशिक्षण पूर्ण झाल्यानंतर, आम्ही त्या टोकनसाठी आमच्या मानक प्रति-टोकन दरांनुसार बिल करतो.
मी रन थांबवून पुन्हा सुरू करू शकतो का?
होय. तुम्ही थांबवल्यावर, आम्ही चेकपॉइंट सेव्ह करतो आणि आतापर्यंत केलेल्या कामासाठी शुल्क आकारतो. तुम्ही पुन्हा सुरू केल्यावर, पुन्हा सुरू केल्यानंतर केलेल्या अतिरिक्त कामासाठीच तुमच्याकडून शुल्क आकारले जाईल.
रीइन्फोर्समेंट फाइन-ट्यूनिंग बिलिंगबद्दल तुमचे इतर प्रश्न असल्यास, आमच्या सपोर्ट टीमशी संपर्क साधा.
