OpenAI
ఈ పేజీ మెషిన్ ట్రాన్స్‌లేషన్‌తో అనువదించబడింది. అసలు ఇంగ్లీష్ ఆర్టికల్‌ను చూడండి.

రీఇన్‌ఫోర్స్‌మెంట్ ఫైన్ ట్యూనింగ్ API కోసం బిల్లింగ్ గైడ్

RFT API కోసం బిల్లింగ్ ఎలా పనిచేస్తుంది

అప్డేట్ చేయబడిన: 7 days ago

RFT కోసం బిల్లింగ్ ఎలా పనిచేస్తుంది

రీఇన్‌ఫోర్స్‌మెంట్ ఫైన్‑ట్యూనింగ్ (RFT) ద్వారా, రీఇన్‌ఫోర్స్‌మెంట్ లెర్నింగ్‌ను ఉపయోగించి OpenAI యొక్క రీజనింగ్ మోడళ్ల పనితీరును మెరుగుపరచవచ్చు. శిక్షణ డేటాసెట్‌లోని టోకెన్‌ల సంఖ్య ఆధారంగా బిల్లింగ్ జరిగే మా పర్యవేక్షిత లేదా ప్రాధాన్యత ఫైన్‑ట్యూనింగ్ సేవలకు భిన్నంగా, RFT బిల్లింగ్ మీ శిక్షణ రన్ ప్రధాన మెషిన్ లెర్నింగ్ పనిని నిర్వహించడానికి వెచ్చించే సమయం ఆధారంగా జరుగుతుంది.

ఈ గైడ్‌లో బిల్లు చేయదగిన శిక్షణ సమయంగా ఏమి లెక్కించబడుతుంది, విరామాలు మరియు రద్దులను మేము ఎలా నిర్వహిస్తాము, అలాగే మీ కాన్ఫిగరేషన్ ఎంపికలు ఖర్చుపై ఎలా ప్రభావం చూపుతాయో వివరించబడింది.

ధరలు

  • కంప్యూట్: o4-mini-2025-04-16 కోసం ప్రధాన శిక్షణ లూప్‌లో గడిపిన వాల్-క్లాక్ సమయానికి గంటకు $100. ఛార్జీలు సెకనువారీగా ప్రోరేట్ చేయబడతాయి మరియు ఇన్వాయిస్‌లో రెండు దశాంశ స్థానాలకు రౌండ్ చేయబడతాయి (ఉదా., 2.55 గంటలు).

  • మోడల్ గ్రేడర్ వినియోగం: శిక్షణ సమయంలో అవుట్‌పుట్‌లను "గ్రేడ్" చేయడానికి మీరు OpenAI మోడల్‌ను ఉపయోగిస్తే, ఆ గ్రేడింగ్ కాల్‌లు వినియోగించిన టోకెన్‌లకు శిక్షణ పూర్తయ్యాక మా ప్రామాణిక API రేట్ల ప్రకారం విడిగా బిల్లు చేస్తాము.

మీ మోడల్‌ను నిజంగా అప్‌డేట్ చేసే శిక్షణ పనికే మాత్రమే మేము ఛార్జ్ చేస్తాము (దీనిని మేము "captured forward progress" అని పిలుస్తాము).

మేము దేనికి బిల్ చేస్తాము

మీ శిక్షణ వర్కర్ మీ మోడల్‌కు సక్రియంగా శిక్షణ ఇచ్చే సమయానికి మేము బిల్ చేస్తాము, ముఖ్యంగా:

  • ఫైన్-ట్యూనింగ్ ప్రక్రియలో మీ మోడల్ నుండి నమూనాలను రూపొందించడం (“రోల్‌ఔట్‌లు”గా పిలుస్తారు)

  • ఆ అవుట్‌పుట్‌లను జాబ్‌లో మీరు నిర్వచించిన ఒకటి లేదా ఎక్కువ గ్రేడర్‌లతో మూల్యాంకనం చేయడం (గ్రేడర్‌ల గురించి మరింత తెలుసుకోండి)

  • గ్రేడ్‌ల ఆధారంగా వెయిట్ అప్‌డేట్‌లను లెక్కించి వర్తింపజేయడం (బ్యాక్‌ప్రొపగేషన్).

  • మీరు కాన్ఫిగర్ చేసిన ఏవైనా ధృవీకరణ (మూల్యాంకనం) దశలను అమలు చేయడం.

చాలా గ్రేడర్‌లను అమలు చేయడం “ఉచితం”; అంటే, అవి కోర్ శిక్షణ లూప్‌కు దోహదం చేసే సమయానికి మించి వాటి వినియోగానికి మేము అదనంగా ఛార్జ్ చేయము. దీనికి మినహాయింపు మోడల్ గ్రేడర్‌లకు వర్తిస్తుంది; పై కార్యకలాపాల సమయంలో ఆ గ్రేడర్‌లు వినియోగించే టోకెన్‌లను కూడా మేము లెక్కిస్తాము. ఈ టోకెన్‌లు మీ ఇన్వాయిస్‌లో ప్రత్యేక లైన్ ఐటమ్‌గా కనిపిస్తాయి. మోడల్ గ్రేడర్‌లు వినియోగించిన టోకెన్‌లకు సాధారణ ఇన్‌ఫరెన్స్ రేట్లతో బిల్ చేస్తాము (OpenAI ధరలు).

మేము దేనికి బిల్లు చేయము

క్రింది పనులకు గడిచిన సమయానికి మేము ఛార్జ్ చేయము:

  • శిక్షణ ప్రారంభమయ్యే ముందు మీ డేటాసెట్‌ను ధృవీకరించడం లేదా పరిశీలించడం.

  • మీ డేటాసెట్‌పై భద్రతా తనిఖీలు.

  • కంప్యూట్ వనరుల కోసం క్యూలో వేచి ఉండటం.

  • మోడల్ వెయిట్‌లు లేదా డేటాసెట్‌లను డౌన్‌లోడ్ చేయడం.

  • మా శిక్షణ ఫార్మాట్‌లోకి మీ డేటాసెట్‌ను సిద్ధం చేయడం (రెండరింగ్).

  • మీ ఫైన్-ట్యూన్ చేసిన మోడల్‌పై శిక్షణ అనంతర భద్రతా మూల్యాంకనలు.

మా వైపు జరిగిన లోపం వల్ల శిక్షణ పని కోల్పోతే (ఉదాహరణకు, వర్కర్ క్రాష్ అయి, మునుపటి చెక్‌పాయింట్‌కి వెనక్కి వెళ్లాల్సి వస్తే), కోల్పోయిన కంప్యూట్ సమయం లేదా గ్రేడర్ టోకెన్‌లకు మీకు ఛార్జ్ చేయము. దీనిపై మరిన్ని వివరాలు తదుపరి విభాగంలో ఉన్నాయి.

Captured forward progress మరియు బిల్లింగ్ ఈవెంట్‌లు

శిక్షణలో మీ మోడల్‌కు అనేక చిన్న అప్‌డేట్‌లు ఉంటాయి. వీటిలో ఎన్ని అప్‌డేట్‌లు విజయవంతంగా పూర్తయ్యాయో మేము ట్రాక్ చేస్తాము. ఛార్జీలు ఈ విజయవంతమైన అప్‌డేట్‌లకు సంబంధించిన కంప్యూట్ సమయం మరియు గ్రేడర్ టోకెన్‌లపై ఆధారపడి ఉంటాయి.

కింది వాటిలో ఏదో ఒక "billing event" జరిగినప్పుడు మేము ఛార్జ్ జారీ చేస్తాము:

  • శిక్షణ విజయవంతంగా పూర్తవుతుంది.

  • మీరు శిక్షణను విరామంలో పెడతారు.

  • మీరు శిక్షణను రద్దు చేస్తారు.

  • శిక్షణ విఫలమవుతుంది.

ప్రతి ఛార్జ్ గత ఛార్జ్ తర్వాత చేసిన అదనపు పనిని కవర్ చేస్తుంది. ఉదాహరణకు:

  • మీరు ఒక రన్‌ను విరామంలో పెడితే, మేము ఒక చెక్‌పాయింట్ సేవ్ చేసి, గత ఛార్జ్ తర్వాత ఉపయోగించిన కంప్యూట్ సమయం మరియు గ్రేడర్ టోకెన్‌లకు మీకు ఛార్జ్ చేస్తాము.

  • మీరు మళ్లీ ప్రారంభించినప్పుడు, శిక్షణ చెక్‌పాయింట్ నుంచే కొనసాగుతుంది. తర్వాతి ఛార్జ్ (పూర్తి, మరో విరామం, రద్దు, లేదా విఫలత సమయంలో) పునఃప్రారంభం తర్వాత చేసిన అదనపు పనినే కవర్ చేస్తుంది.

  • మీరు రన్‌ను రద్దు చేస్తే, రద్దు చేసే వరకు చేసిన పనికి మేము మీకు ఛార్జ్ చేస్తాము.

  • శిక్షణ విఫలమై, గత ఛార్జ్ తర్వాత చేసిన పని కోల్పోతే, కోల్పోయిన భాగానికి మీకు బిల్లు చేయబడదు.

ఈ "captured forward progress" విధానం వల్ల మీ మోడల్‌లో నిల్వ అయ్యే పని లేదా మీరు ఉద్దేశపూర్వకంగా వదిలివేసిన పనికే మీరు చెల్లిస్తారని నిర్ధారిస్తుంది.

జాబ్ పురోగతిని చూడడం

RFT జాబ్‌లలో usage_metrics అనే ఫీల్డ్ ఉంటుంది; ఇది ప్రస్తుత దశ వరకు జాబ్ యొక్క మొత్తం వినియోగాన్ని డాక్యుమెంట్ చేస్తుంది. ఇందులో శిక్షణకు ఖర్చైన సమయం, అలాగే జాబ్‌లోని అన్ని మోడల్ గ్రేడర్‌లలో ఉపయోగించిన అన్ని టోకెన్‌లు ఉంటాయి. ఈ ఫీల్డ్‌ను API (GET /v1/fine_tuning/jobs/{job_id}) ద్వారా లేదా ఫైన్-ట్యూనింగ్ డ్యాష్‌బోర్డ్ ద్వారా పరిశీలించవచ్చు.

శిక్షణ సమయాన్ని ప్రభావితం చేసే అంశాలు

బిల్లింగ్ సమయాధారంగా ఉండటంతో, మీ కాన్ఫిగరేషన్ ఎంపికలు ఖర్చును నేరుగా ప్రభావితం చేస్తాయి. ముఖ్య అంశాలు ఇవి:

  • సమస్య కష్టతరం: మీ డేటాసెట్ కఠినమైన సమస్యలతో ఉంటే, మోడల్ ప్రతి సమస్యపై రిజనింగ్ చేయడానికి ఎక్కువ సమయం తీసుకునే అవకాశం ఉంది. దీని వల్ల ప్రతి నమూనాను రూపొందించడానికి పట్టే సమయం పెరుగుతుంది.

  • కంప్యూట్ తీవ్రత: compute_multiplier హైపర్‌పారామీటర్ ప్రతి శిక్షణ దశకు మీరు ఎంత కంప్యూటేషన్ చేస్తారో నియంత్రిస్తుంది. ఎక్కువ విలువలు మోడల్‌ను ప్రతి డేటాపాయింట్‌పై మరింత విస్తృతంగా రిజనింగ్ చేయడానికి ప్రోత్సహిస్తాయి, దాంతో ప్రతి దశ నెమ్మదిగా నడుస్తుంది.

  • ధృవీకరణ సెట్టింగ్‌లు:

    • పెద్ద ధృవీకరణ సెట్ మూల్యాంకనానికి గడిపే సమయాన్ని పెంచుతుంది.

    • eval_samples పెంచడం (ప్రతి ధృవీకరణ ఉదాహరణకు గ్రేడ్ చేసే మోడల్ అవుట్‌పుట్‌ల సంఖ్య) ధృవీకరణ సమయాన్ని పెంచుతుంది.

    • ధృవీకరణను మరింత తరచుగా నడపడం (తక్కువ eval_interval) ధృవీకరణపై గడిచే సమయపు వాటాను పెంచుతుంది.

  • గ్రేడర్ పనితీరు:

    • పెద్దవి లేదా మరింత సామర్థ్యమున్న మోడల్ గ్రేడర్‌లు చిన్నవాటికంటే గ్రేడ్ ఇవ్వడానికి ఎక్కువ సమయం తీసుకుంటాయి. ఉదాహరణకు, రిజనింగ్ మోడల్‌తో గ్రేడింగ్ చేయడం, నాన్-రిజనింగ్ మోడల్‌తో గ్రేడింగ్ చేయడంకంటే 10 రెట్లు ఎక్కువ సమయం తీసుకోచ్చు.

    • సంక్లిష్టమైన Python గ్రేడింగ్ ఫంక్షన్‌లు సులభమైన వాటికంటే ఎక్కువ సమయం తీసుకుంటాయి.

ఈ సెట్టింగ్‌లు ఖర్చు, వేగం, మరియు మోడల్ నాణ్యత మధ్య సమతుల్యాన్ని ఎంచుకునే అవకాశం ఇస్తాయి. ఉదాహరణకు, తరచూ ధృవీకరణ చేయడం సమస్యలను ముందుగానే గుర్తించవచ్చు కానీ ఖర్చును పెంచుతుంది. మరింత అధునాతన మోడల్‌తో గ్రేడింగ్ చేయడం గ్రేడింగ్ ఖచ్చితత్వాన్ని గణనీయంగా మెరుగుపరచగలదు, కానీ ప్రతి గ్రేడింగ్ దశను నెమ్మదింపజేసి జాబ్‌లను మరింత ఖరీదైనవిగా చేస్తుంది.

ఖర్చు నిర్వహణ

మీ ఖర్చును నియంత్రించడానికి:

  • మీ కాన్ఫిగరేషన్ సమయంపై ఎలా ప్రభావం చూపుతుందో అర్థం చేసుకోవడానికి చిన్న రన్‌లతో ప్రారంభించండి.

  • సరైన సంఖ్యలో ధృవీకరణ ఉదాహరణలు మరియు eval_samples ఉపయోగించండి. అవసరానికి మించి తరచుగా ధృవీకరించవద్దు.

  • మీ నాణ్యత అవసరాలను తీర్చే అతి చిన్న గ్రేడర్ మోడల్‌ను ఎంచుకోండి.

  • కస్టమ్ Python గ్రేడర్‌లను సమర్థవంతంగా ఉంచండి.

  • కన్వర్జెన్స్ వేగం మరియు ఖర్చు మధ్య సమతుల్యం కోసం compute_multiplier ను సర్దుబాటు చేయండి.

  • డ్యాష్‌బోర్డ్‌లో లేదా API ద్వారా మీ రన్‌ను పర్యవేక్షించండి. మీరు ఎప్పుడైనా విరామంలో పెట్టవచ్చు లేదా రద్దు చేయవచ్చు.

ఉదాహరణలు

విజయవంతమైన శిక్షణ రన్

శిక్షణ సమయంబిల్ చేసిన సమయంస్థితివివరణ
00:0000:00వినియోగదారు API ద్వారా RFT జాబ్‌ను సృష్టిస్తారు
00:1000:00VALIDATING_FILESడేటాసెట్ ధృవీకరణకు 10 నిమిషాలు ఖర్చయ్యాయి
00:3000:00VALIDATING_FILESడేటాసెట్ భద్రతా తనిఖీలు అమలు చేయడానికి 20 నిమిషాలు
01:0000:00QUEUEDఅందుబాటులో ఉన్న వర్కర్ కోసం 30 నిమిషాలు వేచి ఉండడం
01:3000:00RUNNINGశిక్షణను సెటప్ చేయడానికి 30 నిమిషాలు (వెయిట్లు డౌన్‌లోడ్ చేయడం, ప్రీప్రాసెసింగ్ మొదలైనవి)
05:3004:00RUNNINGశిక్షణకు 4 గంటలు ఖర్చయ్యాయి
06:0004:00RUNNINGఫలిత మోడల్‌పై భద్రతా మూల్యాంకనాలు అమలు చేయడానికి 30 నిమిషాలు
06:0004:00SUCCEEDEDశిక్షణ ముగుస్తుంది

ఈ సందర్భంలో, మొత్తం గడిచిన సమయం 6 గంటలు, కానీ 4 గంటలకే బిల్ వర్తిస్తుంది. ఖర్చు 4 గంటలు × $100/గంట = $400 అవుతుంది.

విఫలమైన జాబ్ ఉదాహరణ

ఈ ఉదాహరణలో, రన్ 2 గంటలు శిక్షణ పొందుతుంది, ఒక చెక్‌పాయింట్ రాస్తుంది, మరో 1 గంట శిక్షణ పొందుతుంది, కానీ తర్వాత విఫలమవుతుంది. చెక్‌పాయింట్ వరకు జరిగిన 2 గంటల శిక్షణకే బిల్ వర్తిస్తుంది.

శిక్షణ సమయంబిల్ చేసిన సమయంస్థితివివరణ
00:0000:00వినియోగదారు API ద్వారా RFT జాబ్‌ను సృష్టిస్తారు
00:1000:00VALIDATING_FILESడేటాసెట్ ధృవీకరణకు 10 నిమిషాలు ఖర్చయ్యాయి
00:3000:00VALIDATING_FILESడేటాసెట్ భద్రతా తనిఖీలు అమలు చేయడానికి 20 నిమిషాలు
01:0000:00QUEUEDఅందుబాటులో ఉన్న వర్కర్ కోసం 30 నిమిషాలు వేచి ఉండడం
01:3000:00RUNNINGశిక్షణను సెటప్ చేయడానికి 30 నిమిషాలు (వెయిట్లు డౌన్‌లోడ్ చేయడం, ప్రీప్రాసెసింగ్ మొదలైనవి)
03:3002:00RUNNINGశిక్షణకు 2 గంటలు ఖర్చయ్యాయి
03:3002:00RUNNINGదశ 5 వద్ద చెక్‌పాయింట్ సృష్టించబడింది
04:3002:00RUNNINGఅంతర్గత లోపం వల్ల దశ 8 వద్ద శిక్షణ విఫలమవుతుంది (మరో 1 గంట తర్వాత)
04:3002:00RUNNINGచెక్‌పాయింట్‌ను మూల్యాంకనం చేసి ధృవీకరించడానికి 30 నిమిషాలు
04:3002:00SUCCEEDEDజాబ్ ముగుస్తుంది (తాజా చెక్‌పాయింట్‌తో)

మొత్తం 3 గంటలు శిక్షణకు ఖర్చైనా, ఉపయోగించగల చెక్‌పాయింట్‌లో “క్యాప్చర్” అయిన 2 గంటలకే బిల్ చేయబడుతుంది. వైఫల్యం వల్ల కోల్పోయిన ఒక గంట శిక్షణ పనికి మీరు బాధ్యులు కారు. ఖర్చు 2 గంటలు × $100/గంట = $200 అవుతుంది.

తరచుగా అడిగే ప్రశ్నలు

నాకు ఎప్పుడు ఛార్జ్ చేస్తారు?

మీ రన్ పూర్తయినప్పుడు, పాజ్ చేసినప్పుడు, రద్దు చేసినప్పుడు లేదా విఫలమైనప్పుడు మేము బిల్ చేస్తాము. ప్రతి బిల్, మునుపటి బిల్ తర్వాత చేసిన పనిని కవర్ చేస్తుంది.

రన్ విఫలమైతే నేను చెల్లించాలా?

మా లోపం వల్ల రన్ విఫలమై, ఇటీవలి శిక్షణ పని ఏదైనా కోల్పోతే, కోల్పోయిన భాగానికి మీకు ఛార్జ్ చేయము. మీరు రన్‌ను రద్దు చేస్తే, రద్దు చేసే వరకు జరిగిన పనికి మీకు ఛార్జ్ చేస్తాము.

గ్రేడర్ మోడల్ టోకెన్‌లకు ఎలా బిల్ చేస్తారు?

మీరు కాన్ఫిగర్ చేసే ఏవైనా మోడల్ గ్రేడర్‌లు ఉపయోగించిన టోకెన్‌లను మేము లెక్కిస్తాము. శిక్షణ పూర్తయిన తర్వాత, మా ప్రామాణిక ప్రతి-టోకెన్ రేట్ల ప్రకారం ఆ టోకెన్‌లకు మేము బిల్ చేస్తాము.

నేను రన్‌ను పాజ్ చేసి తిరిగి ప్రారంభించవచ్చా?

అవును. మీరు పాజ్ చేసినప్పుడు, మేము ఒక చెక్‌పాయింట్‌ను సేవ్ చేసి, ఇప్పటివరకు చేసిన పనికి ఛార్జ్ చేస్తాము. మీరు తిరిగి ప్రారంభించినప్పుడు, తిరిగి ప్రారంభించిన తర్వాత చేసిన అదనపు పనికే మీకు ఛార్జ్ చేస్తాము.

రీఇన్‌ఫోర్స్‌మెంట్ ఫైన్-ట్యూనింగ్ బిల్లింగ్ గురించి మీకు ఇతర ప్రశ్నలు ఉంటే, మా సపోర్ట్ బృందాన్ని సంప్రదించండి.

ఈ వ్యాసం ఉపయోగకరంగా ఉందా?