OpenAI
இந்தப் பக்கம் இயந்திரத்தால் மொழிபெயர்க்கப்பட்டுள்ளது. மூல ஆங்கிலக் கட்டுரையைப் பாருங்கள்.

ரீஇன்ஃபோர்ஸ்மென்ட் ஃபைன்-ட்யூனிங் API-க்கான பில்லிங் வழிகாட்டி

RFT API-க்கு பில்லிங் எப்படி செயல்படுகிறது

புதுப்பிக்கப்பட்டது: 7 days ago

RFT-க்கான கட்டணக் கணக்கீடு எவ்வாறு செயல்படுகிறது

ரீஇன்ஃபோர்ஸ்மென்ட் ஃபைன்-டியூனிங் (RFT), ரீஇன்ஃபோர்ஸ்மென்ட் லெர்னிங்கைப் பயன்படுத்தி OpenAI-யின் ரீஸனிங் மாடல்களின் செயல்திறனை மேம்படுத்த உங்களை அனுமதிக்கிறது. பயிற்சி தரவுத்தொகுப்பில் உள்ள டோக்கன்களின் எண்ணிக்கையின் அடிப்படையில் கட்டணம் கணக்கிடப்படும் எங்களின் மேற்பார்வையிட்ட அல்லது முன்னுரிமை சார்ந்த ஃபைன்-டியூனிங் சேவைகளைப் போலல்லாமல், உங்கள் பயிற்சி இயக்கம் முக்கிய மெஷின் லெர்னிங் பணியைச் செய்வதற்குச் செலவிடும் நேரத்தின் அடிப்படையில் RFT-க்கான கட்டணம் கணக்கிடப்படுகிறது.

இந்த வழிகாட்டி, எந்த பயிற்சி நேரம் கட்டணத்திற்கு உட்படும், இடைநிறுத்தங்கள் மற்றும் ரத்துசெய்தல்களை நாங்கள் எப்படி கையாளுகிறோம், மேலும் உங்கள் கட்டமைப்பு தேர்வுகள் செலவை எப்படி பாதிக்கலாம் என்பதைக் விளக்குகிறது.

விலை நிர்ணயம்

  • கணக்கீடு: o4-mini-2025-04-16 க்கான முக்கிய பயிற்சி சுழற்சியில் செலவிடும் wall-clock நேரத்திற்கு மணிநேரத்திற்கு $100. கட்டணங்கள் விநாடி அடிப்படையில் கணக்கிடப்பட்டு, விலைப்பட்டியலில் தசம புள்ளிக்கு பிறகு இரண்டு இலக்கங்கள் வரை வளைக்கப்படும் (எ.கா., 2.55 மணிநேரங்கள்).

  • மாடல் grader பயன்பாடு: பயிற்சியின் போது வெளியீடுகளை "grade" செய்ய நீங்கள் OpenAI மாடலைப் பயன்படுத்தினால், அந்த grading அழைப்புகள் பயன்படுத்தும் டோக்கன்களுக்கு, பயிற்சி முடிந்த பின் எங்கள் நிலையான API விகிதங்களின்படி தனியாக கட்டணம் வசூலிக்கப்படும்.

உங்கள் மாடலை உண்மையில் புதுப்பிக்கும் பயிற்சி பணிக்காக மட்டுமே நாங்கள் கட்டணம் வசூலிக்கிறோம் (இதையே நாங்கள் "captured forward progress" என்று அழைக்கிறோம்).

நாங்கள் எதற்கு பில் செய்கிறோம்

உங்கள் பயிற்சி வொர்க்கர் உங்கள் மாடலைச் செயலில் பயிற்றுவிக்கச் செலவிடும் நேரத்திற்குப் பில் செய்கிறோம், குறிப்பாக:

  • ஃபைன்-ட்யூனிங் செயல்முறையின் போது உங்கள் மாடலிலிருந்து மாதிரிகளை உருவாக்குதல் (“ரோல்அவுட்கள்” என அழைக்கப்படும்)

  • பணியில் நீங்கள் வரையறுத்துள்ள ஒன்று அல்லது அதற்கு மேற்பட்ட கிரேடர்களைப் பயன்படுத்தி அந்த வெளியீடுகளை மதிப்பிடுதல் (கிரேடர்கள் பற்றி மேலும் அறிக)

  • மதிப்பெண்களின் அடிப்படையில் எடை புதுப்பிப்புகளைக் கணக்கிட்டு பயன்படுத்துதல் (பேக்‌பிரொப்பகேஷன்).

  • நீங்கள் கட்டமைத்துள்ள எந்தச் சரிபார்ப்பு (மதிப்பீடு) படிகளையும் இயக்குதல்.

பெரும்பாலான கிரேடர்களை இயக்குவது “இலவசம்”; அதாவது, அவை மையப் பயிற்சி லூப்பிற்கு பங்களிக்கும் நேரத்தைத் தவிர, அவற்றின் பயன்பாட்டிற்கு கூடுதல் கட்டணம் வசூலிக்க மாட்டோம். இதற்கு விதிவிலக்கு மாடல் கிரேடர்கள்; மேலுள்ள செயல்பாடுகளின்போது அந்த கிரேடர்கள் பயன்படுத்தும் டோக்கன்களையும் நாங்கள் கணக்கிடுகிறோம். இந்த டோக்கன்கள் உங்கள் இன்வாய்ஸில் தனி வரி உருப்படியாகத் தோன்றும். மாடல் கிரேடர்கள் பயன்படுத்தும் டோக்கன்களுக்கு சாதாரண இன்ஃபரன்ஸ் கட்டணங்களில் பில் செய்யப்படும் (OpenAI விலை நிர்ணயம்).

எதற்காக நாங்கள் கட்டணம் வசூலிக்கமாட்டோம்

பின்வருவனவற்றிற்காக செலவிடும் நேரத்திற்கு நாங்கள் கட்டணம் வசூலிக்கமாட்டோம்:

  • பயிற்சி தொடங்குவதற்கு முன் உங்கள் தரவுத்தொகுப்பைச் சரிபார்ப்பது அல்லது ஆய்வு செய்வது.

  • உங்கள் தரவுத்தொகுப்பின் பாதுகாப்பு சோதனைகள்.

  • கணக்கீட்டு வளங்களுக்காக வரிசையில் காத்திருப்பது.

  • மாடல் weights அல்லது தரவுத்தொகுப்புகளை பதிவிறக்கம் செய்வது.

  • எங்கள் பயிற்சி வடிவத்திற்கு உங்கள் தரவுத்தொகுப்பைத் தயாரிப்பது (rendering).

  • உங்கள் fine-tuned மாடலின் பயிற்சிக்குப் பிந்தைய பாதுகாப்பு மதிப்பீடுகள்.

எங்கள் தரப்பிலான பிழையால் பயிற்சி பணி இழந்தால் (உதாரணமாக, ஒரு worker செயலிழந்து முந்தைய checkpoint-க்கு மீண்டும் செல்ல வேண்டியிருந்தால்), இழந்த கணக்கீட்டு நேரத்திற்கோ grader டோக்கன்களுக்கோ உங்களிடம் கட்டணம் வசூலிக்கப்படாது. இதைப் பற்றிய கூடுதல் விவரங்கள் அடுத்த பகுதியில் உள்ளன.

Captured forward progress மற்றும் பில்லிங் நிகழ்வுகள்

பயிற்சி என்பது உங்கள் மாடலுக்கான பல சிறிய புதுப்பிப்புகளைக் கொண்டது. இவற்றில் எத்தனை புதுப்பிப்புகள் வெற்றிகரமாக முடிகின்றன என்பதை நாங்கள் கண்காணிக்கிறோம். கட்டணங்கள், இந்த வெற்றிகரமான புதுப்பிப்புகளுடன் தொடர்புடைய கணக்கீட்டு நேரம் மற்றும் grader டோக்கன்களை அடிப்படையாகக் கொண்டவை.

பின்வரும் "billing events" ஒன்றில் ஏதேனும் ஒன்று நடந்தால் நாங்கள் கட்டணம் விதிக்கிறோம்:

  • பயிற்சி வெற்றிகரமாக முடிகிறது.

  • நீங்கள் பயிற்சியை இடைநிறுத்துகிறீர்கள்.

  • நீங்கள் பயிற்சியை ரத்து செய்கிறீர்கள்.

  • பயிற்சி தோல்வியடைகிறது.

ஒவ்வொரு கட்டணமும், கடைசி கட்டணத்திற்குப் பின் செய்யப்பட்ட கூடுதல் பணியை உள்ளடக்கும். உதாரணமாக:

  • நீங்கள் ஒரு run-ஐ இடைநிறுத்தினால், நாங்கள் ஒரு checkpoint-ஐச் சேமித்து, கடைசி கட்டணத்திற்குப் பிறகு பயன்படுத்திய கணக்கீட்டு நேரம் மற்றும் grader டோக்கன்களுக்கு கட்டணம் வசூலிக்கிறோம்.

  • நீங்கள் மீண்டும் தொடங்கும்போது, பயிற்சி checkpoint-இலிருந்து தொடர்கிறது. அடுத்த கட்டணம் (முடிவு, மற்றொரு இடைநிறுத்தம், ரத்துசெய்தல் அல்லது தோல்வி நேரத்தில்) மீண்டும் தொடங்கிய பிறகு செய்யப்பட்ட கூடுதல் பணியை மட்டுமே உள்ளடக்கும்.

  • நீங்கள் ஒரு run-ஐ ரத்து செய்தால், ரத்துசெய்யும் வரை செய்யப்பட்ட பணிக்காக நாங்கள் கட்டணம் வசூலிக்கிறோம்.

  • பயிற்சி தோல்வியடைந்து, கடைசி கட்டணத்திற்குப் பிறகான பணி இழந்தால், இழந்த பகுதிக்கு உங்களிடம் கட்டணம் வசூலிக்கப்படாது.

இந்த "captured forward progress" அணுகுமுறை, உங்கள் மாடலில் நிலைத்திருக்கும் பணிக்கோ அல்லது நீங்கள் திட்டமிட்டு கைவிடும் பணிக்கோ மட்டுமே நீங்கள் பணம் செலுத்துவதை உறுதிப்படுத்துகிறது.

பணியின் முன்னேற்றத்தைப் பார்ப்பது

RFT பணிகளில் usage_metrics என்ற புலம் உள்ளது; அது தற்போதைய படி வரை பணியின் மொத்த பயன்பாட்டை ஆவணப்படுத்துகிறது. இதில் பயிற்சிக்குச் செலவிட்ட நேரமும், பணியில் உள்ள அனைத்து மாடல் கிரேடர்களிலும் பயன்படுத்தப்பட்ட அனைத்து டோக்கன்களும் அடங்கும். இந்தப் புலத்தை API (GET /v1/fine_tuning/jobs/{job_id}) வழியாகவோ அல்லது ஃபைன்-ட்யூனிங் டாஷ்போர்டு வழியாகவோ ஆய்வு செய்யலாம்.

பயிற்சி நேரத்தை பாதிக்கும் காரணிகள்

பில்லிங் நேர அடிப்படையிலானதால், உங்கள் கட்டமைப்பு தேர்வுகள் செலவை நேரடியாக பாதிக்கும். முக்கிய காரணிகள்:

  • சிக்கலின் கடினத்தன்மை: உங்கள் தரவுத்தொகுப்பில் கடினமான பிரச்சினைகள் இருந்தால், மாடல் ஒவ்வொரு பிரச்சினையையும் குறித்து அதிக நேரம் ரீஸனிங் செய்யும் வாய்ப்பு உள்ளது. இதனால் ஒவ்வொரு மாதிரியும் உருவாக அதிக நேரம் ஆகும்.

  • கணக்கீட்டு தீவிரம்: compute_multiplier என்ற hyperparameter, ஒவ்வொரு பயிற்சி படியிலும் நீங்கள் எவ்வளவு கணக்கீடு செய்கிறீர்கள் என்பதை கட்டுப்படுத்துகிறது. அதிக மதிப்புகள், மாடல் ஒவ்வொரு தரவுப்புள்ளியையும் பற்றி மேலும் விரிவாக ரீஸனிங் செய்ய ஊக்குவிக்கும். இதனால் ஒவ்வொரு படியும் மெதுவாக இயங்கும்.

  • Validation அமைப்புகள்:

    • பெரிய validation தொகுப்பு, மதிப்பீட்டில் செலவிடும் நேரத்தை அதிகரிக்கும்.

    • eval_samples ஐ அதிகரிப்பது (ஒவ்வொரு validation உதாரணத்திற்கும் தரமிடப்படும் மாடல் வெளியீடுகளின் எண்ணிக்கை), validation நேரத்தை அதிகரிக்கும்.

    • Validation-ஐ அதிக அடிக்கடி இயக்குவது (குறைந்த eval_interval) validation-க்காக செலவிடும் நேர விகிதத்தை அதிகரிக்கும்.

  • Grader செயல்திறன்:

    • பெரிய அல்லது அதிக திறன் கொண்ட மாடல் grader-கள், சிறியவற்றை விட தரத்தைத் திருப்பித் தர அதிக நேரம் எடுத்துக்கொள்கின்றன. உதாரணமாக, ஒரு ரீஸனிங் மாடலுடன் grading செய்வது, non-reasoning மாடலுடன் grading செய்வதை விட 10 மடங்கு அதிக நேரம் எடுக்கலாம்.

    • சிக்கலான Python grading functions, எளியவற்றை விட இயங்க அதிக நேரம் எடுக்கும்.

இந்த அமைப்புகள் செலவு, வேகம் மற்றும் மாடல் தரம் ஆகியவற்றுக்கு இடையில் சமநிலையைத் தேர்ந்தெடுக்க உதவுகின்றன. உதாரணமாக, அடிக்கடி validation செய்வது சிக்கல்களை முன்கூட்டியே கண்டறிய உதவும், ஆனால் செலவை அதிகரிக்கும். மேலும் மேம்பட்ட மாடலை grading-க்கு பயன்படுத்துவது, grading துல்லியத்தை கணிசமாக உயர்த்தலாம், ஆனால் ஒவ்வொரு grading படியையும் மெதுவாக்கி, பணிகளை அதிக செலவானவையாக மாற்றும்.

செலவை நிர்வகித்தல்

உங்கள் செலவினத்தை கட்டுப்படுத்த:

  • உங்கள் கட்டமைப்பு நேரத்தை எப்படி பாதிக்கிறது என்பதைப் புரிந்துகொள்ள, குறுகிய run-களுடன் தொடங்குங்கள்.

  • நியாயமான எண்ணிக்கையிலான validation எடுத்துக்காட்டுகளையும் eval_samples ஐயும் பயன்படுத்துங்கள். தேவையானதை விட அதிகமாக validation செய்ய வேண்டாம்.

  • உங்கள் தரத் தேவைகளை பூர்த்தி செய்யும் மிகச் சிறிய grader மாடலைத் தேர்ந்தெடுக்கவும்.

  • தனிப்பயன் Python grader-களை திறமையாக வைத்திருங்கள்.

  • convergence வேகத்துக்கும் செலவுக்கும் இடையில் சமநிலை பெற compute_multiplier ஐச் சரிசெய்யுங்கள்.

  • dashboard-இல் அல்லது API மூலம் உங்கள் run-ஐ கண்காணிக்கவும். எந்த நேரத்திலும் நீங்கள் இடைநிறுத்தலாம் அல்லது ரத்து செய்யலாம்.

எடுத்துக்காட்டுகள்

வெற்றிகரமான பயிற்சி ரன்

பயிற்சி நேரம்பில்லிடப்பட்ட நேரம்நிலைவிளக்கம்
00:0000:00பயனர் API மூலம் RFT பணியை உருவாக்குகிறார்
00:1000:00VALIDATING_FILESதரவுத்தொகுப்பைச் சரிபார்க்க 10 நிமிடங்கள் செலவானது
00:3000:00VALIDATING_FILESதரவுத்தொகுப்பு பாதுகாப்புச் சோதனைகளை இயக்க 20 நிமிடங்கள்
01:0000:00QUEUEDகிடைக்கக்கூடிய வொர்க்கருக்காக 30 நிமிடங்கள் காத்திருந்தது
01:3000:00RUNNINGபயிற்சியை அமைக்க 30 நிமிடங்கள் (எடைகளைப் பதிவிறக்குதல், முன்செயலாக்கம் போன்றவை)
05:3004:00RUNNING4 மணிநேரம் பயிற்சிக்குச் செலவானது
06:0004:00RUNNINGஉருவான மாடலின் பாதுகாப்பு மதிப்பீடுகளை இயக்க 30 நிமிடங்கள்
06:0004:00SUCCEEDEDபயிற்சி முடிகிறது

இந்த நிலையில், மொத்த கடந்த நேரம் 6 மணிநேரம், ஆனால் 4 மணிநேரத்திற்கு மட்டுமே பில் செய்யப்படும். செலவு 4 மணிநேரம் × $100/மணிநேரம் = $400 ஆக இருக்கும்.

தோல்வியடைந்த பணி எடுத்துக்காட்டு

இந்த எடுத்துக்காட்டில், ரன் 2 மணிநேரம் பயிற்சி செய்கிறது, ஒரு செக்பாயிண்டை எழுதுகிறது, மேலும் 1 மணிநேரம் பயிற்சி செய்கிறது, ஆனால் பின்னர் தோல்வியடைகிறது. செக்பாயிண்ட் வரை நடந்த 2 மணிநேரப் பயிற்சிக்கே பில் செய்யப்படும்.

பயிற்சி நேரம்பில்லிடப்பட்ட நேரம்நிலைவிளக்கம்
00:0000:00பயனர் API மூலம் RFT பணியை உருவாக்குகிறார்
00:1000:00VALIDATING_FILESதரவுத்தொகுப்பைச் சரிபார்க்க 10 நிமிடங்கள் செலவானது
00:3000:00VALIDATING_FILESதரவுத்தொகுப்பு பாதுகாப்புச் சோதனைகளை இயக்க 20 நிமிடங்கள்
01:0000:00QUEUEDகிடைக்கக்கூடிய வொர்க்கருக்காக 30 நிமிடங்கள் காத்திருந்தது
01:3000:00RUNNINGபயிற்சியை அமைக்க 30 நிமிடங்கள் (எடைகளைப் பதிவிறக்குதல், முன்செயலாக்கம் போன்றவை)
03:3002:00RUNNING2 மணிநேரம் பயிற்சிக்குச் செலவானது
03:3002:00RUNNINGபடி 5-இல் செக்பாயிண்ட் உருவாக்கப்பட்டது
04:3002:00RUNNINGபடி 8-இல் உள்ளகப் பிழை காரணமாகப் பயிற்சி தோல்வியடைகிறது (மேலும் 1 மணிநேரத்திற்குப் பிறகு)
04:3002:00RUNNINGசெக்பாயிண்டை மதிப்பிட்டு சரிபார்க்க 30 நிமிடங்கள்
04:3002:00SUCCEEDEDபணி முடிகிறது (சமீபத்திய செக்பாயிண்டுடன்)

மொத்தமாக 3 மணிநேரம் பயிற்சிக்குச் செலவானாலும், பயன்படுத்தக்கூடிய செக்பாயிண்டில் 2 மணிநேரம் மட்டுமே “பிடிக்கப்பட்டுள்ளது”, அதற்கே பில் செய்யப்படும். தோல்வியால் இழந்த ஒரு மணிநேரப் பயிற்சி பணிக்கு நீங்கள் பொறுப்பல்ல. செலவு 2 மணிநேரம் × $100/மணிநேரம் = $200 ஆக இருக்கும்.

அடிக்கடி கேட்கப்படும் கேள்விகள்

எப்போது எனக்கு கட்டணம் விதிக்கப்படும்?

உங்கள் ரன் முடிந்தால், இடைநிறுத்தப்பட்டால், ரத்துசெய்யப்பட்டால் அல்லது தோல்வியடைந்தால் நாங்கள் பில் செய்கிறோம். ஒவ்வொரு பிலும் முந்தைய பிலுக்குப் பிறகு செய்யப்பட்ட பணியை உள்ளடக்கும்.

ஒரு ரன் தோல்வியடைந்தால் நான் பணம் செலுத்த வேண்டுமா?

எங்கள் பிழை காரணமாக ஒரு ரன் தோல்வியடைந்து, சமீபத்திய பயிற்சி வேலை ஏதேனும் இழந்தால், இழந்த பகுதிக்காக உங்களிடம் கட்டணம் வசூலிக்கப்படாது. நீங்கள் ஒரு ரனை ரத்துசெய்தால், ரத்துசெய்யும் வரை செய்யப்பட்ட பணிக்காக உங்களிடம் கட்டணம் வசூலிக்கப்படும்.

கிரேடர் மாடல் டோக்கன்களுக்கு எப்படி பில் செய்யப்படுகிறது?

நீங்கள் கட்டமைக்கும் எந்த மாடல் கிரேடர்களும் பயன்படுத்தும் டோக்கன்களை நாங்கள் கணக்கிடுகிறோம். பயிற்சி முடிந்த பிறகு, அந்த டோக்கன்களுக்கு எங்கள் நிலையான ஒவ்வொரு டோக்கனுக்கான கட்டணங்களில் பில் செய்கிறோம்.

ஒரு ரனை இடைநிறுத்தி மீண்டும் தொடங்க முடியுமா?

ஆம். நீங்கள் இடைநிறுத்தும்போது, நாங்கள் ஒரு செக்பாயிண்டைச் சேமித்து, இதுவரை செய்யப்பட்ட பணிக்குக் கட்டணம் விதிக்கிறோம். நீங்கள் மீண்டும் தொடங்கும்போது, மீண்டும் தொடங்கிய பிறகு செய்யப்பட்ட கூடுதல் பணிக்கே உங்களிடம் கட்டணம் வசூலிக்கப்படும்.

Reinforcement Fine‑Tuning பில்லிங் குறித்து உங்களுக்கு வேறு கேள்விகள் இருந்தால், எங்கள் ஆதரவு குழுவைத் தொடர்புகொள்ளவும்.

இந்தக் கட்டுரை உங்களுக்கு உதவியாக இருந்ததா?