RFT-க்கான கட்டணக் கணக்கீடு எவ்வாறு செயல்படுகிறது
ரீஇன்ஃபோர்ஸ்மென்ட் ஃபைன்-டியூனிங் (RFT), ரீஇன்ஃபோர்ஸ்மென்ட் லெர்னிங்கைப் பயன்படுத்தி OpenAI-யின் ரீஸனிங் மாடல்களின் செயல்திறனை மேம்படுத்த உங்களை அனுமதிக்கிறது. பயிற்சி தரவுத்தொகுப்பில் உள்ள டோக்கன்களின் எண்ணிக்கையின் அடிப்படையில் கட்டணம் கணக்கிடப்படும் எங்களின் மேற்பார்வையிட்ட அல்லது முன்னுரிமை சார்ந்த ஃபைன்-டியூனிங் சேவைகளைப் போலல்லாமல், உங்கள் பயிற்சி இயக்கம் முக்கிய மெஷின் லெர்னிங் பணியைச் செய்வதற்குச் செலவிடும் நேரத்தின் அடிப்படையில் RFT-க்கான கட்டணம் கணக்கிடப்படுகிறது.
இந்த வழிகாட்டி, எந்த பயிற்சி நேரம் கட்டணத்திற்கு உட்படும், இடைநிறுத்தங்கள் மற்றும் ரத்துசெய்தல்களை நாங்கள் எப்படி கையாளுகிறோம், மேலும் உங்கள் கட்டமைப்பு தேர்வுகள் செலவை எப்படி பாதிக்கலாம் என்பதைக் விளக்குகிறது.
விலை நிர்ணயம்
கணக்கீடு: o4-mini-2025-04-16 மாடலின் மையப் பயிற்சிச் சுழற்சியில் செலவிடப்படும் கடிகார நேரத்திற்கு மணிக்கு $100. கட்டணங்கள் நொடி அடிப்படையில் விகிதாசாரமாகக் கணக்கிடப்பட்டு, விலைப்பட்டியலில் இரண்டு தசம இடங்களுக்கு முழுமையாக்கப்படும். எடுத்துக்காட்டாக, 2.55 மணிநேரம்.
மாடல் மதிப்பீட்டுக் கருவியின் பயன்பாடு: பயிற்சியின்போது வெளியீடுகளை "மதிப்பிட" OpenAI மாடலைப் பயன்படுத்தினால், அந்த மதிப்பீட்டு அழைப்புகள் பயன்படுத்தும் டோக்கன்களுக்குப் பயிற்சி முடிந்த பிறகு எங்கள் வழக்கமான API கட்டண விகிதங்களில் தனியாகக் கட்டணம் விதிக்கப்படும்.
உங்கள் மாடலை உண்மையில் புதுப்பிக்கும் பயிற்சிப் பணிக்காக மட்டுமே கட்டணம் வசூலிக்கிறோம். இதை நாங்கள் "பதிவுசெய்யப்பட்ட முன்னேற்றம்" என்கிறோம்.
நாங்கள் எதற்கு பில் செய்கிறோம்
உங்கள் பயிற்சி வொர்க்கர் உங்கள் மாடலைச் செயலில் பயிற்றுவிக்கச் செலவிடும் நேரத்திற்குப் பில் செய்கிறோம், குறிப்பாக:
ஃபைன்-ட்யூனிங் செயல்முறையின் போது உங்கள் மாடலிலிருந்து மாதிரிகளை உருவாக்குதல் (“ரோல்அவுட்கள்” என அழைக்கப்படும்)
பணியில் நீங்கள் வரையறுத்துள்ள ஒன்று அல்லது அதற்கு மேற்பட்ட கிரேடர்களைப் பயன்படுத்தி அந்த வெளியீடுகளை மதிப்பிடுதல் (கிரேடர்கள் பற்றி மேலும் அறிக)
மதிப்பெண்களின் அடிப்படையில் எடை புதுப்பிப்புகளைக் கணக்கிட்டு பயன்படுத்துதல் (பேக்பிரொப்பகேஷன்).
நீங்கள் கட்டமைத்துள்ள எந்தச் சரிபார்ப்பு (மதிப்பீடு) படிகளையும் இயக்குதல்.
பெரும்பாலான கிரேடர்களை இயக்குவது “இலவசம்”; அதாவது, அவை மையப் பயிற்சி லூப்பிற்கு பங்களிக்கும் நேரத்தைத் தவிர, அவற்றின் பயன்பாட்டிற்கு கூடுதல் கட்டணம் வசூலிக்க மாட்டோம். இதற்கு விதிவிலக்கு மாடல் கிரேடர்கள்; மேலுள்ள செயல்பாடுகளின்போது அந்த கிரேடர்கள் பயன்படுத்தும் டோக்கன்களையும் நாங்கள் கணக்கிடுகிறோம். இந்த டோக்கன்கள் உங்கள் இன்வாய்ஸில் தனி வரி உருப்படியாகத் தோன்றும். மாடல் கிரேடர்கள் பயன்படுத்தும் டோக்கன்களுக்கு சாதாரண இன்ஃபரன்ஸ் கட்டணங்களில் பில் செய்யப்படும் (OpenAI விலை நிர்ணயம்).
எதற்காக நாங்கள் கட்டணம் வசூலிக்கமாட்டோம்
பின்வருவனவற்றிற்காக செலவிடும் நேரத்திற்கு நாங்கள் கட்டணம் வசூலிக்கமாட்டோம்:
பயிற்சி தொடங்குவதற்கு முன் உங்கள் தரவுத்தொகுப்பைச் சரிபார்ப்பது அல்லது ஆய்வு செய்வது.
உங்கள் தரவுத்தொகுப்பின் பாதுகாப்பு சோதனைகள்.
கணக்கீட்டு வளங்களுக்காக வரிசையில் காத்திருப்பது.
மாடல் weights அல்லது தரவுத்தொகுப்புகளை பதிவிறக்கம் செய்வது.
எங்கள் பயிற்சி வடிவத்திற்கு உங்கள் தரவுத்தொகுப்பைத் தயாரிப்பது (rendering).
உங்கள் fine-tuned மாடலின் பயிற்சிக்குப் பிந்தைய பாதுகாப்பு மதிப்பீடுகள்.
எங்கள் தரப்பிலான பிழையால் பயிற்சி பணி இழந்தால் (உதாரணமாக, ஒரு worker செயலிழந்து முந்தைய checkpoint-க்கு மீண்டும் செல்ல வேண்டியிருந்தால்), இழந்த கணக்கீட்டு நேரத்திற்கோ grader டோக்கன்களுக்கோ உங்களிடம் கட்டணம் வசூலிக்கப்படாது. இதைப் பற்றிய கூடுதல் விவரங்கள் அடுத்த பகுதியில் உள்ளன.
Captured forward progress மற்றும் பில்லிங் நிகழ்வுகள்
பயிற்சி என்பது உங்கள் மாடலுக்கான பல சிறிய புதுப்பிப்புகளைக் கொண்டது. இவற்றில் எத்தனை புதுப்பிப்புகள் வெற்றிகரமாக முடிகின்றன என்பதை நாங்கள் கண்காணிக்கிறோம். கட்டணங்கள், இந்த வெற்றிகரமான புதுப்பிப்புகளுடன் தொடர்புடைய கணக்கீட்டு நேரம் மற்றும் grader டோக்கன்களை அடிப்படையாகக் கொண்டவை.
பின்வரும் "billing events" ஒன்றில் ஏதேனும் ஒன்று நடந்தால் நாங்கள் கட்டணம் விதிக்கிறோம்:
பயிற்சி வெற்றிகரமாக முடிகிறது.
நீங்கள் பயிற்சியை இடைநிறுத்துகிறீர்கள்.
நீங்கள் பயிற்சியை ரத்து செய்கிறீர்கள்.
பயிற்சி தோல்வியடைகிறது.
ஒவ்வொரு கட்டணமும், கடைசி கட்டணத்திற்குப் பின் செய்யப்பட்ட கூடுதல் பணியை உள்ளடக்கும். உதாரணமாக:
நீங்கள் ஒரு run-ஐ இடைநிறுத்தினால், நாங்கள் ஒரு checkpoint-ஐச் சேமித்து, கடைசி கட்டணத்திற்குப் பிறகு பயன்படுத்திய கணக்கீட்டு நேரம் மற்றும் grader டோக்கன்களுக்கு கட்டணம் வசூலிக்கிறோம்.
நீங்கள் மீண்டும் தொடங்கும்போது, பயிற்சி checkpoint-இலிருந்து தொடர்கிறது. அடுத்த கட்டணம் (முடிவு, மற்றொரு இடைநிறுத்தம், ரத்துசெய்தல் அல்லது தோல்வி நேரத்தில்) மீண்டும் தொடங்கிய பிறகு செய்யப்பட்ட கூடுதல் பணியை மட்டுமே உள்ளடக்கும்.
நீங்கள் ஒரு run-ஐ ரத்து செய்தால், ரத்துசெய்யும் வரை செய்யப்பட்ட பணிக்காக நாங்கள் கட்டணம் வசூலிக்கிறோம்.
பயிற்சி தோல்வியடைந்து, கடைசி கட்டணத்திற்குப் பிறகான பணி இழந்தால், இழந்த பகுதிக்கு உங்களிடம் கட்டணம் வசூலிக்கப்படாது.
இந்த "captured forward progress" அணுகுமுறை, உங்கள் மாடலில் நிலைத்திருக்கும் பணிக்கோ அல்லது நீங்கள் திட்டமிட்டு கைவிடும் பணிக்கோ மட்டுமே நீங்கள் பணம் செலுத்துவதை உறுதிப்படுத்துகிறது.
பணியின் முன்னேற்றத்தைப் பார்த்தல்
RFT பணிகளில் usage_metrics என்ற புலம் உள்ளது. தற்போதைய படிநிலை வரை பணியின் மொத்தப் பயன்பாட்டை அது பதிவு செய்கிறது. இதில் பயிற்சிக்கு எடுத்துக்கொண்ட நேரமும், பணியின் அனைத்து மாடல் மதிப்பீட்டுக் கருவிகளிலும் பயன்படுத்தப்பட்ட எல்லா டோக்கன்களும் அடங்கும். இந்தப் புலத்தை API வழியாக (GET /v1/fine_tuning/jobs/{job_id}) அல்லது நுண்சீரமைப்பு முகப்புப் பலகை வழியாகப் பார்க்கலாம்.
பயிற்சி நேரத்தைப் பாதிக்கும் காரணிகள்
கட்டணம் நேரத்தின் அடிப்படையில் விதிக்கப்படுவதால், உங்கள் உள்ளமைவுத் தேர்வுகள் செலவை நேரடியாகப் பாதிக்கும். முக்கியக் காரணிகள்:
சிக்கலின் கடினத்தன்மை: உங்கள் தரவுத்தொகுப்பில் கடினமான சிக்கல்கள் இருந்தால், ஒவ்வொரு சிக்கலையும் ஆராய்ந்து ரீஸனிங் செய்வதற்கு மாடல் அதிக நேரம் எடுத்துக்கொள்ளக்கூடும். இதனால் ஒவ்வொரு மாதிரியையும் உருவாக்கும் நேரம் அதிகரிக்கும்.
கணக்கீட்டுத் தீவிரம்: ஒவ்வொரு பயிற்சிப் படிநிலையிலும் எவ்வளவு கணக்கீடு செய்யப்படுகிறது என்பதை compute_multiplier மீஅளவுரு கட்டுப்படுத்துகிறது. அதிக மதிப்புகள் ஒவ்வொரு தரவுப் புள்ளியையும் மாடல் இன்னும் விரிவாக ஆராய்ந்து ரீஸனிங் செய்ய ஊக்குவிக்கின்றன. இதனால் ஒவ்வொரு படிநிலையும் மெதுவாக இயங்கும்.
சரிபார்ப்பு அமைப்புகள்:
மதிப்பீட்டுக் கருவியின் செயல்திறன்:
சிறிய மாடல் மதிப்பீட்டுக் கருவிகளைவிடப் பெரிய அல்லது அதிகத் திறனுள்ள மாடல் மதிப்பீட்டுக் கருவிகள் மதிப்பெண்ணை வழங்க அதிக நேரம் எடுத்துக்கொள்கின்றன. எடுத்துக்காட்டாக, ரீஸனிங் அல்லாத மாடலைக் கொண்டு மதிப்பிடுவதைவிட ரீஸனிங் மாடலைக் கொண்டு மதிப்பிட 10 மடங்கு அதிக நேரம் ஆகலாம்.
எளிய Python மதிப்பீட்டுச் செயல்பாடுகளைவிடச் சிக்கலான Python மதிப்பீட்டுச் செயல்பாடுகள் இயங்க அதிக நேரம் எடுத்துக்கொள்கின்றன.
இந்த அமைப்புகள் செலவு, வேகம், மாடலின் தரம் ஆகியவற்றுக்கு இடையே சமநிலையைத் தேர்வுசெய்ய உதவுகின்றன. எடுத்துக்காட்டாக, அடிக்கடி சரிபார்ப்பது சிக்கல்களை முன்கூட்டியே கண்டறிய உதவும்; ஆனால் செலவை அதிகரிக்கும். மேம்பட்ட மாடலைக் கொண்டு மதிப்பிடுவது மதிப்பீட்டுத் துல்லியத்தைப் பெரிதும் மேம்படுத்தலாம். ஆனால் ஒவ்வொரு மதிப்பீட்டுப் படிநிலையையும் மெதுவாக்கி, பணிகளின் செலவை அதிகரிக்கும்.
செலவை நிர்வகித்தல்
உங்கள் செலவைக் கட்டுப்படுத்த:
உங்கள் உள்ளமைவு நேரத்தை எவ்வாறு பாதிக்கிறது என்பதைப் புரிந்துகொள்ளக் குறுகிய இயக்கங்களுடன் தொடங்குங்கள்.
நியாயமான எண்ணிக்கையிலான சரிபார்ப்பு எடுத்துக்காட்டுகளையும் eval_samples மதிப்பையும் பயன்படுத்துங்கள். தேவைக்கு அதிகமாக அடிக்கடி சரிபார்ப்பதைத் தவிருங்கள்.
உங்கள் தரத் தேவைகளைப் பூர்த்திசெய்யும் மிகச் சிறிய மதிப்பீட்டு மாடலைத் தேர்வுசெய்யுங்கள்.
தனிப்பயன் Python மதிப்பீட்டுக் கருவிகளைத் திறன்மிக்கவையாக வைத்திருங்கள்.
ஒன்றிணையும் வேகத்தையும் செலவையும் சமநிலைப்படுத்த compute_multiplier மதிப்பைச் சரிசெய்யுங்கள்.
உங்கள் இயக்கத்தை முகப்புப் பலகையிலோ API வழியாகவோ கண்காணியுங்கள். எந்த நேரத்திலும் இடைநிறுத்தலாம் அல்லது ரத்துசெய்யலாம்.
எடுத்துக்காட்டுகள்
வெற்றிகரமான பயிற்சி ரன்
| பயிற்சி நேரம் | பில்லிடப்பட்ட நேரம் | நிலை | விளக்கம் |
|---|---|---|---|
| 00:00 | 00:00 | – | பயனர் API மூலம் RFT பணியை உருவாக்குகிறார் |
| 00:10 | 00:00 | VALIDATING_FILES | தரவுத்தொகுப்பைச் சரிபார்க்க 10 நிமிடங்கள் செலவானது |
| 00:30 | 00:00 | VALIDATING_FILES | தரவுத்தொகுப்பு பாதுகாப்புச் சோதனைகளை இயக்க 20 நிமிடங்கள் |
| 01:00 | 00:00 | QUEUED | கிடைக்கக்கூடிய வொர்க்கருக்காக 30 நிமிடங்கள் காத்திருந்தது |
| 01:30 | 00:00 | RUNNING | பயிற்சியை அமைக்க 30 நிமிடங்கள் (எடைகளைப் பதிவிறக்குதல், முன்செயலாக்கம் போன்றவை) |
| 05:30 | 04:00 | RUNNING | 4 மணிநேரம் பயிற்சிக்குச் செலவானது |
| 06:00 | 04:00 | RUNNING | உருவான மாடலின் பாதுகாப்பு மதிப்பீடுகளை இயக்க 30 நிமிடங்கள் |
| 06:00 | 04:00 | SUCCEEDED | பயிற்சி முடிகிறது |
இந்த நிலையில், மொத்த கடந்த நேரம் 6 மணிநேரம், ஆனால் 4 மணிநேரத்திற்கு மட்டுமே பில் செய்யப்படும். செலவு 4 மணிநேரம் × $100/மணிநேரம் = $400 ஆக இருக்கும்.
தோல்வியடைந்த பணி எடுத்துக்காட்டு
இந்த எடுத்துக்காட்டில், ரன் 2 மணிநேரம் பயிற்சி செய்கிறது, ஒரு செக்பாயிண்டை எழுதுகிறது, மேலும் 1 மணிநேரம் பயிற்சி செய்கிறது, ஆனால் பின்னர் தோல்வியடைகிறது. செக்பாயிண்ட் வரை நடந்த 2 மணிநேரப் பயிற்சிக்கே பில் செய்யப்படும்.
| பயிற்சி நேரம் | பில்லிடப்பட்ட நேரம் | நிலை | விளக்கம் |
|---|---|---|---|
| 00:00 | 00:00 | – | பயனர் API மூலம் RFT பணியை உருவாக்குகிறார் |
| 00:10 | 00:00 | VALIDATING_FILES | தரவுத்தொகுப்பைச் சரிபார்க்க 10 நிமிடங்கள் செலவானது |
| 00:30 | 00:00 | VALIDATING_FILES | தரவுத்தொகுப்பு பாதுகாப்புச் சோதனைகளை இயக்க 20 நிமிடங்கள் |
| 01:00 | 00:00 | QUEUED | கிடைக்கக்கூடிய வொர்க்கருக்காக 30 நிமிடங்கள் காத்திருந்தது |
| 01:30 | 00:00 | RUNNING | பயிற்சியை அமைக்க 30 நிமிடங்கள் (எடைகளைப் பதிவிறக்குதல், முன்செயலாக்கம் போன்றவை) |
| 03:30 | 02:00 | RUNNING | 2 மணிநேரம் பயிற்சிக்குச் செலவானது |
| 03:30 | 02:00 | RUNNING | படி 5-இல் செக்பாயிண்ட் உருவாக்கப்பட்டது |
| 04:30 | 02:00 | RUNNING | படி 8-இல் உள்ளகப் பிழை காரணமாகப் பயிற்சி தோல்வியடைகிறது (மேலும் 1 மணிநேரத்திற்குப் பிறகு) |
| 04:30 | 02:00 | RUNNING | செக்பாயிண்டை மதிப்பிட்டு சரிபார்க்க 30 நிமிடங்கள் |
| 04:30 | 02:00 | SUCCEEDED | பணி முடிகிறது (சமீபத்திய செக்பாயிண்டுடன்) |
மொத்தமாக 3 மணிநேரம் பயிற்சிக்குச் செலவானாலும், பயன்படுத்தக்கூடிய செக்பாயிண்டில் 2 மணிநேரம் மட்டுமே “பிடிக்கப்பட்டுள்ளது”, அதற்கே பில் செய்யப்படும். தோல்வியால் இழந்த ஒரு மணிநேரப் பயிற்சி பணிக்கு நீங்கள் பொறுப்பல்ல. செலவு 2 மணிநேரம் × $100/மணிநேரம் = $200 ஆக இருக்கும்.
அடிக்கடி கேட்கப்படும் கேள்விகள்
எப்போது என்னிடம் கட்டணம் வசூலிக்கப்படும்?
உங்கள் இயக்கம் நிறைவடையும்போது, இடைநிறுத்தப்படும்போது, ரத்துசெய்யப்படும்போது அல்லது தோல்வியடையும்போது கட்டணம் விதிக்கிறோம். ஒவ்வொரு கட்டணமும் முந்தைய கட்டணத்திற்குப் பிறகு செய்யப்பட்ட பணியை உள்ளடக்கும்.
ஒரு ரன் தோல்வியடைந்தால் நான் பணம் செலுத்த வேண்டுமா?
எங்கள் பிழை காரணமாக ஒரு ரன் தோல்வியடைந்து, சமீபத்திய பயிற்சி வேலை ஏதேனும் இழந்தால், இழந்த பகுதிக்காக உங்களிடம் கட்டணம் வசூலிக்கப்படாது. நீங்கள் ஒரு ரனை ரத்துசெய்தால், ரத்துசெய்யும் வரை செய்யப்பட்ட பணிக்காக உங்களிடம் கட்டணம் வசூலிக்கப்படும்.
கிரேடர் மாடல் டோக்கன்களுக்கு எப்படி பில் செய்யப்படுகிறது?
நீங்கள் கட்டமைக்கும் எந்த மாடல் கிரேடர்களும் பயன்படுத்தும் டோக்கன்களை நாங்கள் கணக்கிடுகிறோம். பயிற்சி முடிந்த பிறகு, அந்த டோக்கன்களுக்கு எங்கள் நிலையான ஒவ்வொரு டோக்கனுக்கான கட்டணங்களில் பில் செய்கிறோம்.
ஒரு ரனை இடைநிறுத்தி மீண்டும் தொடங்க முடியுமா?
ஆம். நீங்கள் இடைநிறுத்தும்போது, நாங்கள் ஒரு செக்பாயிண்டைச் சேமித்து, இதுவரை செய்யப்பட்ட பணிக்குக் கட்டணம் விதிக்கிறோம். நீங்கள் மீண்டும் தொடங்கும்போது, மீண்டும் தொடங்கிய பிறகு செய்யப்பட்ட கூடுதல் பணிக்கே உங்களிடம் கட்டணம் வசூலிக்கப்படும்.
Reinforcement Fine‑Tuning பில்லிங் குறித்து உங்களுக்கு வேறு கேள்விகள் இருந்தால், எங்கள் ஆதரவு குழுவைத் தொடர்புகொள்ளவும்.
