OpenAI
ఈ పేజీ మెషిన్ ట్రాన్స్‌లేషన్‌తో అనువదించబడింది. అసలు ఇంగ్లీష్ ఆర్టికల్‌ను చూడండి.

రీఇన్‌ఫోర్స్‌మెంట్ ఫైన్ ట్యూనింగ్ API కోసం బిల్లింగ్ గైడ్

RFT API కోసం బిల్లింగ్ ఎలా పనిచేస్తుంది

అప్డేట్ చేయబడిన: 15 days ago

RFT కోసం బిల్లింగ్ ఎలా పనిచేస్తుంది

రీఇన్‌ఫోర్స్‌మెంట్ ఫైన్‑ట్యూనింగ్ (RFT) ద్వారా, రీఇన్‌ఫోర్స్‌మెంట్ లెర్నింగ్‌ను ఉపయోగించి OpenAI యొక్క రీజనింగ్ మోడళ్ల పనితీరును మెరుగుపరచవచ్చు. శిక్షణ డేటాసెట్‌లోని టోకెన్‌ల సంఖ్య ఆధారంగా బిల్లింగ్ జరిగే మా పర్యవేక్షిత లేదా ప్రాధాన్యత ఫైన్‑ట్యూనింగ్ సేవలకు భిన్నంగా, RFT బిల్లింగ్ మీ శిక్షణ రన్ ప్రధాన మెషిన్ లెర్నింగ్ పనిని నిర్వహించడానికి వెచ్చించే సమయం ఆధారంగా జరుగుతుంది.

ఈ గైడ్‌లో బిల్లు చేయదగిన శిక్షణ సమయంగా ఏమి లెక్కించబడుతుంది, విరామాలు మరియు రద్దులను మేము ఎలా నిర్వహిస్తాము, అలాగే మీ కాన్ఫిగరేషన్ ఎంపికలు ఖర్చుపై ఎలా ప్రభావం చూపుతాయో వివరించబడింది.

ధరలు

  • గణన: o4-mini-2025-04-16 ప్రధాన శిక్షణ చక్రంలో గడిపిన వాస్తవ సమయానికి గంటకు $100. ఛార్జీలు సెకను ప్రాతిపదికన దామాషా ప్రకారం లెక్కించబడతాయి. ఇన్‌వాయిస్‌లో రెండు దశాంశ స్థానాలకు చుట్టబడతాయి (ఉదా., 2.55 గంటలు).

  • మోడల్ మూల్యాంకనకర్త వినియోగం: శిక్షణ సమయంలో అవుట్‌పుట్‌లకు "మూల్యాంకనం" చేయడానికి OpenAI మోడల్‌ను ఉపయోగిస్తే, ఆ కాల్‌లు వినియోగించిన టోకెన్‌లకు శిక్షణ పూర్తయ్యాక మా ప్రామాణిక API ధరల ప్రకారం విడిగా బిల్లు చేస్తాము.

మీ మోడల్‌ను నిజంగా నవీకరించే శిక్షణ పనికే మేము ఛార్జీ విధిస్తాము. దీనిని మేము "నమోదైన ముందడుగు" అంటాము.

మేము దేనికి బిల్ చేస్తాము

మీ శిక్షణ వర్కర్ మీ మోడల్‌కు సక్రియంగా శిక్షణ ఇచ్చే సమయానికి మేము బిల్ చేస్తాము, ముఖ్యంగా:

  • ఫైన్-ట్యూనింగ్ ప్రక్రియలో మీ మోడల్ నుండి నమూనాలను రూపొందించడం (“రోల్‌ఔట్‌లు”గా పిలుస్తారు)

  • ఆ అవుట్‌పుట్‌లను జాబ్‌లో మీరు నిర్వచించిన ఒకటి లేదా ఎక్కువ గ్రేడర్‌లతో మూల్యాంకనం చేయడం (గ్రేడర్‌ల గురించి మరింత తెలుసుకోండి)

  • గ్రేడ్‌ల ఆధారంగా వెయిట్ అప్‌డేట్‌లను లెక్కించి వర్తింపజేయడం (బ్యాక్‌ప్రొపగేషన్).

  • మీరు కాన్ఫిగర్ చేసిన ఏవైనా ధృవీకరణ (మూల్యాంకనం) దశలను అమలు చేయడం.

చాలా గ్రేడర్‌లను అమలు చేయడం “ఉచితం”; అంటే, అవి కోర్ శిక్షణ లూప్‌కు దోహదం చేసే సమయానికి మించి వాటి వినియోగానికి మేము అదనంగా ఛార్జ్ చేయము. దీనికి మినహాయింపు మోడల్ గ్రేడర్‌లకు వర్తిస్తుంది; పై కార్యకలాపాల సమయంలో ఆ గ్రేడర్‌లు వినియోగించే టోకెన్‌లను కూడా మేము లెక్కిస్తాము. ఈ టోకెన్‌లు మీ ఇన్వాయిస్‌లో ప్రత్యేక లైన్ ఐటమ్‌గా కనిపిస్తాయి. మోడల్ గ్రేడర్‌లు వినియోగించిన టోకెన్‌లకు సాధారణ ఇన్‌ఫరెన్స్ రేట్లతో బిల్ చేస్తాము (OpenAI ధరలు).

మేము దేనికి బిల్లు చేయము

క్రింది పనులకు గడిచిన సమయానికి మేము ఛార్జ్ చేయము:

  • శిక్షణ ప్రారంభమయ్యే ముందు మీ డేటాసెట్‌ను ధృవీకరించడం లేదా పరిశీలించడం.

  • మీ డేటాసెట్‌పై భద్రతా తనిఖీలు.

  • కంప్యూట్ వనరుల కోసం క్యూలో వేచి ఉండటం.

  • మోడల్ వెయిట్‌లు లేదా డేటాసెట్‌లను డౌన్‌లోడ్ చేయడం.

  • మా శిక్షణ ఫార్మాట్‌లోకి మీ డేటాసెట్‌ను సిద్ధం చేయడం (రెండరింగ్).

  • మీ ఫైన్-ట్యూన్ చేసిన మోడల్‌పై శిక్షణ అనంతర భద్రతా మూల్యాంకనలు.

మా వైపు జరిగిన లోపం వల్ల శిక్షణ పని కోల్పోతే (ఉదాహరణకు, వర్కర్ క్రాష్ అయి, మునుపటి చెక్‌పాయింట్‌కి వెనక్కి వెళ్లాల్సి వస్తే), కోల్పోయిన కంప్యూట్ సమయం లేదా గ్రేడర్ టోకెన్‌లకు మీకు ఛార్జ్ చేయము. దీనిపై మరిన్ని వివరాలు తదుపరి విభాగంలో ఉన్నాయి.

Captured forward progress మరియు బిల్లింగ్ ఈవెంట్‌లు

శిక్షణలో మీ మోడల్‌కు అనేక చిన్న అప్‌డేట్‌లు ఉంటాయి. వీటిలో ఎన్ని అప్‌డేట్‌లు విజయవంతంగా పూర్తయ్యాయో మేము ట్రాక్ చేస్తాము. ఛార్జీలు ఈ విజయవంతమైన అప్‌డేట్‌లకు సంబంధించిన కంప్యూట్ సమయం మరియు గ్రేడర్ టోకెన్‌లపై ఆధారపడి ఉంటాయి.

కింది వాటిలో ఏదో ఒక "billing event" జరిగినప్పుడు మేము ఛార్జ్ జారీ చేస్తాము:

  • శిక్షణ విజయవంతంగా పూర్తవుతుంది.

  • మీరు శిక్షణను విరామంలో పెడతారు.

  • మీరు శిక్షణను రద్దు చేస్తారు.

  • శిక్షణ విఫలమవుతుంది.

ప్రతి ఛార్జ్ గత ఛార్జ్ తర్వాత చేసిన అదనపు పనిని కవర్ చేస్తుంది. ఉదాహరణకు:

  • మీరు ఒక రన్‌ను విరామంలో పెడితే, మేము ఒక చెక్‌పాయింట్ సేవ్ చేసి, గత ఛార్జ్ తర్వాత ఉపయోగించిన కంప్యూట్ సమయం మరియు గ్రేడర్ టోకెన్‌లకు మీకు ఛార్జ్ చేస్తాము.

  • మీరు మళ్లీ ప్రారంభించినప్పుడు, శిక్షణ చెక్‌పాయింట్ నుంచే కొనసాగుతుంది. తర్వాతి ఛార్జ్ (పూర్తి, మరో విరామం, రద్దు, లేదా విఫలత సమయంలో) పునఃప్రారంభం తర్వాత చేసిన అదనపు పనినే కవర్ చేస్తుంది.

  • మీరు రన్‌ను రద్దు చేస్తే, రద్దు చేసే వరకు చేసిన పనికి మేము మీకు ఛార్జ్ చేస్తాము.

  • శిక్షణ విఫలమై, గత ఛార్జ్ తర్వాత చేసిన పని కోల్పోతే, కోల్పోయిన భాగానికి మీకు బిల్లు చేయబడదు.

ఈ "captured forward progress" విధానం వల్ల మీ మోడల్‌లో నిల్వ అయ్యే పని లేదా మీరు ఉద్దేశపూర్వకంగా వదిలివేసిన పనికే మీరు చెల్లిస్తారని నిర్ధారిస్తుంది.

పని పురోగతిని చూడటం

RFT పనుల్లో usage_metrics అనే ఫీల్డ్ ఉంటుంది. ప్రస్తుత దశ వరకు పని యొక్క మొత్తం వినియోగాన్ని ఇది నమోదు చేస్తుంది. ఇందులో శిక్షణకు పట్టిన సమయం, అలాగే ఆ పనిలోని అన్ని మోడల్ మూల్యాంకనకర్తలు ఉపయోగించిన టోకెన్‌లు ఉంటాయి. ఈ ఫీల్డ్‌ను API ద్వారా (GET /v1/fine_tuning/jobs/{job_id}) లేదా ఫైన్-ట్యూనింగ్ డ్యాష్‌బోర్డ్ ద్వారా పరిశీలించవచ్చు.

శిక్షణ సమయాన్ని ప్రభావితం చేసే అంశాలు

బిల్లింగ్ సమయం ఆధారంగా జరుగుతుంది కాబట్టి, మీ కాన్ఫిగరేషన్ ఎంపికలు ఖర్చును నేరుగా ప్రభావితం చేస్తాయి. ముఖ్యమైన అంశాలు:

  • సమస్య క్లిష్టత: మీ డేటాసెట్‌లో క్లిష్టమైన సమస్యలు ఉంటే, ప్రతి సమస్యపై రీజనింగ్ చేయడానికి మోడల్ ఎక్కువ సమయం తీసుకునే అవకాశం ఉంది. దీనివల్ల ప్రతి నమూనాను రూపొందించడానికి పట్టే సమయం పెరుగుతుంది.

  • గణన తీవ్రత: ప్రతి శిక్షణ దశలో ఎంత గణన జరగాలో compute_multiplier హైపర్‌పారామీటర్ నియంత్రిస్తుంది. ఎక్కువ విలువలు ప్రతి డేటా అంశంపై మరింత విపులంగా రీజనింగ్ చేయడానికి మోడల్‌ను ప్రోత్సహిస్తాయి. దీనివల్ల ప్రతి దశ నెమ్మదిగా నడుస్తుంది.

  • ధ్రువీకరణ సెట్టింగ్‌లు:

  • మూల్యాంకనకర్త పనితీరు:

  • పెద్ద లేదా అధిక సామర్థ్యం గల మూల్యాంకన మోడల్‌లు చిన్న వాటితో పోలిస్తే ఫలితాన్ని ఇవ్వడానికి ఎక్కువ సమయం తీసుకుంటాయి. ఉదాహరణకు, రీజనింగ్ మోడల్‌తో మూల్యాంకనం చేయడానికి, రీజనింగ్ చేయని మోడల్‌తో చేసే మూల్యాంకనం కంటే 10 రెట్లు ఎక్కువ సమయం పట్టవచ్చు.

  • సరళమైన Python మూల్యాంకన ఫంక్షన్‌ల కంటే క్లిష్టమైనవి అమలవడానికి ఎక్కువ సమయం పడుతుంది.

ఈ సెట్టింగ్‌లతో ఖర్చు, వేగం, మోడల్ నాణ్యత మధ్య సమతుల్యతను ఎంచుకోవచ్చు. ఉదాహరణకు, తరచుగా ధ్రువీకరించడం వల్ల సమస్యలను ముందుగానే గుర్తించవచ్చు, కానీ ఖర్చు పెరుగుతుంది. మరింత అధునాతన మోడల్‌తో మూల్యాంకనం చేస్తే ఖచ్చితత్వం గణనీయంగా మెరుగుపడవచ్చు. అయితే ప్రతి మూల్యాంకన దశ నెమ్మదించి, పనుల ఖర్చు పెరుగుతుంది.

ఖర్చు నిర్వహణ

మీ ఖర్చును నియంత్రించడానికి:

  • మీ కాన్ఫిగరేషన్ సమయాన్ని ఎలా ప్రభావితం చేస్తుందో తెలుసుకోవడానికి తక్కువ వ్యవధి అమలులతో ప్రారంభించండి.

  • తగిన సంఖ్యలో ధ్రువీకరణ ఉదాహరణలు, eval_samples ఉపయోగించండి. అవసరమైన దానికంటే ఎక్కువసార్లు ధ్రువీకరించవద్దు.

  • మీ నాణ్యత అవసరాలను తీర్చగల అతి చిన్న మూల్యాంకన మోడల్‌ను ఎంచుకోండి.

  • అనుకూల Python మూల్యాంకనకర్తలను సమర్థంగా ఉంచండి.

  • అభిసరణ వేగం, ఖర్చు మధ్య సమతుల్యత కోసం compute_multiplierను సర్దుబాటు చేయండి.

  • డ్యాష్‌బోర్డ్‌లో లేదా API ద్వారా మీ అమలును పర్యవేక్షించండి. మీరు ఎప్పుడైనా పాజ్ చేయవచ్చు లేదా రద్దు చేయవచ్చు.

ఉదాహరణలు

విజయవంతమైన శిక్షణ రన్

శిక్షణ సమయంబిల్ చేసిన సమయంస్థితివివరణ
00:0000:00వినియోగదారు API ద్వారా RFT జాబ్‌ను సృష్టిస్తారు
00:1000:00VALIDATING_FILESడేటాసెట్ ధృవీకరణకు 10 నిమిషాలు ఖర్చయ్యాయి
00:3000:00VALIDATING_FILESడేటాసెట్ భద్రతా తనిఖీలు అమలు చేయడానికి 20 నిమిషాలు
01:0000:00QUEUEDఅందుబాటులో ఉన్న వర్కర్ కోసం 30 నిమిషాలు వేచి ఉండడం
01:3000:00RUNNINGశిక్షణను సెటప్ చేయడానికి 30 నిమిషాలు (వెయిట్లు డౌన్‌లోడ్ చేయడం, ప్రీప్రాసెసింగ్ మొదలైనవి)
05:3004:00RUNNINGశిక్షణకు 4 గంటలు ఖర్చయ్యాయి
06:0004:00RUNNINGఫలిత మోడల్‌పై భద్రతా మూల్యాంకనాలు అమలు చేయడానికి 30 నిమిషాలు
06:0004:00SUCCEEDEDశిక్షణ ముగుస్తుంది

ఈ సందర్భంలో, మొత్తం గడిచిన సమయం 6 గంటలు, కానీ 4 గంటలకే బిల్ వర్తిస్తుంది. ఖర్చు 4 గంటలు × $100/గంట = $400 అవుతుంది.

విఫలమైన జాబ్ ఉదాహరణ

ఈ ఉదాహరణలో, రన్ 2 గంటలు శిక్షణ పొందుతుంది, ఒక చెక్‌పాయింట్ రాస్తుంది, మరో 1 గంట శిక్షణ పొందుతుంది, కానీ తర్వాత విఫలమవుతుంది. చెక్‌పాయింట్ వరకు జరిగిన 2 గంటల శిక్షణకే బిల్ వర్తిస్తుంది.

శిక్షణ సమయంబిల్ చేసిన సమయంస్థితివివరణ
00:0000:00వినియోగదారు API ద్వారా RFT జాబ్‌ను సృష్టిస్తారు
00:1000:00VALIDATING_FILESడేటాసెట్ ధృవీకరణకు 10 నిమిషాలు ఖర్చయ్యాయి
00:3000:00VALIDATING_FILESడేటాసెట్ భద్రతా తనిఖీలు అమలు చేయడానికి 20 నిమిషాలు
01:0000:00QUEUEDఅందుబాటులో ఉన్న వర్కర్ కోసం 30 నిమిషాలు వేచి ఉండడం
01:3000:00RUNNINGశిక్షణను సెటప్ చేయడానికి 30 నిమిషాలు (వెయిట్లు డౌన్‌లోడ్ చేయడం, ప్రీప్రాసెసింగ్ మొదలైనవి)
03:3002:00RUNNINGశిక్షణకు 2 గంటలు ఖర్చయ్యాయి
03:3002:00RUNNINGదశ 5 వద్ద చెక్‌పాయింట్ సృష్టించబడింది
04:3002:00RUNNINGఅంతర్గత లోపం వల్ల దశ 8 వద్ద శిక్షణ విఫలమవుతుంది (మరో 1 గంట తర్వాత)
04:3002:00RUNNINGచెక్‌పాయింట్‌ను మూల్యాంకనం చేసి ధృవీకరించడానికి 30 నిమిషాలు
04:3002:00SUCCEEDEDజాబ్ ముగుస్తుంది (తాజా చెక్‌పాయింట్‌తో)

మొత్తం 3 గంటలు శిక్షణకు ఖర్చైనా, ఉపయోగించగల చెక్‌పాయింట్‌లో “క్యాప్చర్” అయిన 2 గంటలకే బిల్ చేయబడుతుంది. వైఫల్యం వల్ల కోల్పోయిన ఒక గంట శిక్షణ పనికి మీరు బాధ్యులు కారు. ఖర్చు 2 గంటలు × $100/గంట = $200 అవుతుంది.

తరచుగా అడిగే ప్రశ్నలు

నాకు ఎప్పుడు ఛార్జీ విధిస్తారు?

మీ అమలు పూర్తయినప్పుడు, పాజ్ చేసినప్పుడు, రద్దయినప్పుడు లేదా విఫలమైనప్పుడు మేము బిల్లు చేస్తాము. ప్రతి బిల్లులో మునుపటి బిల్లు తర్వాత జరిగిన పనికి ఛార్జీలు ఉంటాయి.

రన్ విఫలమైతే నేను చెల్లించాలా?

మా లోపం వల్ల రన్ విఫలమై, ఇటీవలి శిక్షణ పని ఏదైనా కోల్పోతే, కోల్పోయిన భాగానికి మీకు ఛార్జ్ చేయము. మీరు రన్‌ను రద్దు చేస్తే, రద్దు చేసే వరకు జరిగిన పనికి మీకు ఛార్జ్ చేస్తాము.

గ్రేడర్ మోడల్ టోకెన్‌లకు ఎలా బిల్ చేస్తారు?

మీరు కాన్ఫిగర్ చేసే ఏవైనా మోడల్ గ్రేడర్‌లు ఉపయోగించిన టోకెన్‌లను మేము లెక్కిస్తాము. శిక్షణ పూర్తయిన తర్వాత, మా ప్రామాణిక ప్రతి-టోకెన్ రేట్ల ప్రకారం ఆ టోకెన్‌లకు మేము బిల్ చేస్తాము.

నేను రన్‌ను పాజ్ చేసి తిరిగి ప్రారంభించవచ్చా?

అవును. మీరు పాజ్ చేసినప్పుడు, మేము ఒక చెక్‌పాయింట్‌ను సేవ్ చేసి, ఇప్పటివరకు చేసిన పనికి ఛార్జ్ చేస్తాము. మీరు తిరిగి ప్రారంభించినప్పుడు, తిరిగి ప్రారంభించిన తర్వాత చేసిన అదనపు పనికే మీకు ఛార్జ్ చేస్తాము.

రీఇన్‌ఫోర్స్‌మెంట్ ఫైన్-ట్యూనింగ్ బిల్లింగ్ గురించి మీకు ఇతర ప్రశ్నలు ఉంటే, మా సపోర్ట్ బృందాన్ని సంప్రదించండి.

ఈ వ్యాసం ఉపయోగకరంగా ఉందా?