OpenAI
ఈ పేజీ మెషిన్ ట్రాన్స్‌లేషన్‌తో అనువదించబడింది. అసలు ఇంగ్లీష్ ఆర్టికల్‌ను చూడండి.

టోకెన్‌లు అంటే ఏమిటి మరియు వాటిని ఎలా లెక్కించాలి?

అప్డేట్ చేయబడిన: 8 days ago

టోకెన్లు అంటే ఏమిటి?

OpenAI మోడళ్లు ప్రాసెస్ చేసే పాఠ్యానికి టోకెన్లు ప్రాథమిక భాగాలు. భాష మరియు సందర్భాన్ని బట్టి, అవి ఒక్క అక్షరం అంత చిన్నవిగా లేదా పూర్తి పదం అంత పొడవుగా ఉండవచ్చు. స్పేస్‌లు, విరామ చిహ్నాలు, పాక్షిక పదాలు అన్నీ టోకెన్ లెక్కలకు తోడ్పడతాయి. ప్రతిస్పందనను రూపొందించే ముందు API మీ పాఠ్యాన్ని అంతర్గతంగా విభజించే విధానం ఇదే.

ఆంగ్లం కోసం ఉపయోగకరమైన సుమారు నియమాలు:

  • 1 టోకెన్ ≈ 4 అక్షరాలు

  • 1 టోకెన్ ≈ ఒక పదంలో ¾

  • 100 టోకెన్లు ≈ 75 పదాలు

  • 1–2 వాక్యాలు ≈ 30 టోకెన్లు

  • 1 పేరా ≈ 100 టోకెన్లు

  • ~1,500 పదాలు ≈ 2,048 టోకెన్లు

మోడల్ మరియు ఎన్‌కోడింగ్‌ను బట్టి టోకనైజేషన్ మారుతుంది. మీ లక్ష్య మోడల్ కోసం ఖచ్చితమైన లెక్కను పొందడానికి టోకనైజర్ సాధనం లేదా tiktoken.encoding_for_model(model) ఉపయోగించండి.

ఉదాహరణలు

సుమారు టోకెన్ లెక్కలతో కొన్ని వాస్తవ ప్రపంచ పాఠ్య నమూనాలు ఇవి:

  • Wayne Gretzky చెప్పిన “మీరు ప్రయత్నించని షాట్‌లలో 100% మిస్ అవుతారు” = 11 టోకెన్లు

  • OpenAI చార్టర్ = 476 టోకెన్లు

  • అమెరికా స్వాతంత్ర్య ప్రకటన = 1,695 టోకెన్లు

టోకెన్ లెక్కలు ఎలా లెక్కించబడతాయి

మీరు APIకి పాఠ్యాన్ని పంపినప్పుడు:

  1. పాఠ్యం టోకెన్లుగా విభజించబడుతుంది.

  2. మోడల్ ఈ టోకెన్లను ప్రాసెస్ చేస్తుంది.

  3. ప్రతిస్పందన టోకెన్ల వరుసగా రూపొందించబడి, ఆపై మళ్లీ పాఠ్యంగా మార్చబడుతుంది.

టోకెన్ వినియోగం అనేక వర్గాల్లో ట్రాక్ చేయబడుతుంది:

  • ఇన్‌పుట్ టోకెన్లు – మీ అభ్యర్థనలోని టోకెన్లు.

  • అవుట్‌పుట్ టోకెన్లు – ప్రతిస్పందనలో రూపొందించబడిన టోకెన్లు.

  • క్యాష్ చేసిన టోకెన్లు – సంభాషణ చరిత్రలో మళ్లీ ఉపయోగించిన టోకెన్లు (తరచుగా తక్కువ రేటుతో బిల్ చేయబడతాయి).

  • రిజనింగ్ టోకెన్లు – కొన్ని ఆధునిక మోడళ్లలో, తుది అవుట్‌పుట్ ఇవ్వడానికి ముందు అదనపు “ఆలోచనా దశలు” అంతర్గతంగా చేర్చబడతాయి.

ఈ లెక్కలు మీ API ప్రతిస్పందన మెటాడేటాలో కనిపిస్తాయి మరియు బిల్లింగ్, వినియోగ ట్రాకింగ్ కోసం ఉపయోగించబడతాయి.

టోకనైజేషన్‌ను మరింతగా అన్వేషించడానికి, మా ఇంటరాక్టివ్ టోకనైజర్ సాధనం ఉపయోగించవచ్చు; ఇది టోకెన్ల సంఖ్యను లెక్కించడానికి మరియు పాఠ్యం టోకెన్లుగా ఎలా విభజించబడుతుందో చూడడానికి మిమ్మల్ని అనుమతిస్తుంది.

ప్రత్యామ్నాయంగా, మీరు పాఠ్యాన్ని ప్రోగ్రామాటిక్‌గా టోకనైజ్ చేయాలనుకుంటే, OpenAI మోడళ్ల కోసం ప్రత్యేకంగా ఉపయోగించే వేగవంతమైన BPE టోకనైజర్‌గా Tiktokenను ఉపయోగించండి.

టోకెన్ పరిమితులు

ప్రతి మోడల్కు గరిష్ఠ సంయుక్త టోకెన్ పరిమితి (ఇన్‌పుట్ + అవుట్‌పుట్) ఉంటుంది. ప్రస్తుత అధిక సామర్థ్య మోడళ్లు సందర్భంలో లక్షల వరకు టోకెన్లకు మద్దతు ఇస్తాయి, అయితే మోడల్ వెర్షన్ మరియు మీ వినియోగ స్థాయిని బట్టి ప్రాయోగిక పరిమితులు మారవచ్చు.

మీరు పరిమితిని మించితే, మీరు ఇవి చేయవచ్చు:

  • ప్రాంప్ట్‌లను కుదించండి లేదా మళ్లీ వాక్యరచన చేయండి.

  • పెద్ద పాఠ్యాన్ని చిన్న భాగాలుగా విభజించండి.

  • ఇన్‌పుట్‌లను పంపే ముందు వాటిని సారాంశం చేయండి లేదా ముందుగా ప్రాసెస్ చేయండి.

టోకెన్ ధరలు

API వినియోగానికి టోకెన్‌కు అనుగుణంగా ధర నిర్ణయించబడుతుంది; ఇది మోడల్ మరియు టోకెన్లు ఇన్‌పుట్, అవుట్‌పుట్ లేదా క్యాష్ చేసినవా అన్నదాన్ని బట్టి మారుతుంది. ప్రస్తుత రేట్ల కోసం OpenAI యొక్క ధరల పేజీను చూడండి. కొన్ని రిజనింగ్ మోడళ్లు అంతర్గతంగా ఎక్కువ టోకెన్లను ఉపయోగించవచ్చు, కానీ పూర్తయిన ప్రతి పనికి అవసరమైన టోకెన్ల సంఖ్యను తగ్గించడం ద్వారా సామర్థ్యాన్ని మెరుగుపరచాలని లక్ష్యంగా పెట్టుకుంటాయి.

టోకెన్లను అన్వేషించడం

కార్పస్ డేటాలో పదాలను వాటి సందర్భానికి అనుగుణంగా API పరిగణిస్తుంది. మోడళ్లు ప్రాంప్ట్‌ను తీసుకుని, ఇన్‌పుట్‌ను టోకెన్ల జాబితాగా మార్చి, ప్రాంప్ట్‌ను ప్రాసెస్ చేసి, అంచనా వేసిన టోకెన్లను మళ్లీ మనం ప్రతిస్పందనలో చూసే పదాలుగా మారుస్తాయి.

మనకు ఒకేలా కనిపించే రెండు పదాలు, పాఠ్యంలో అవి ఎలా నిర్మాణం చేయబడ్డాయో బట్టి వేర్వేరు టోకెన్లుగా రూపొందించబడవచ్చు. పాఠ్యంలో ఉన్న సందర్భం ఆధారంగా ‘red’ అనే పదానికి API టోకెన్ విలువలను ఎలా రూపొందిస్తుందో పరిశీలించండి:

Sentence split into color-coded tokens with Text selected over Token IDs
Token ID output as a list of integers with the Token IDs tab selected

పై మొదటి ఉదాహరణలో ‘ red’ కోసం టోకెన్ “2266” చివరిలో స్పేస్‌ను కలిగి ఉంటుంది (గమనిక: ఇవి ప్రదర్శన ప్రయోజనాల కోసం ఉదాహరణ టోకెన్ IDలు).

Sentence split into color-coded token blocks: My favorite color is Red.
Tokenizer output with Token IDs selected and a list of numeric token IDs

‘ Red’ కోసం టోకెన్ “2296” (ముందు స్పేస్‌తో మరియు పెద్ద అక్షరంతో ప్రారంభమవుతుంది) చిన్న అక్షరంతో ఉన్న ‘ red’ కోసం టోకెన్ “2266” నుండి భిన్నంగా ఉంటుంది.

Tokenizer example splitting “Red is my favorite color.” into color-coded tokens
Tokenizer output with Token IDs selected and a list of token ID numbers

‘Red’ ఒక వాక్యం ప్రారంభంలో ఉపయోగించినప్పుడు, రూపొందించబడిన టోకెన్‌లో ముందు స్పేస్ ఉండదు. టోకెన్ “7738” ఆ పదానికి సంబంధించిన మునుపటి రెండు ఉదాహరణలకంటే భిన్నంగా ఉంటుంది.

పరిశీలనలు:

టోకెన్ సంభావ్యత/ఆవృతం ఎంత ఎక్కువగా ఉంటే, దానికి కేటాయించిన టోకెన్ సంఖ్య అంత తక్కువగా ఉంటుంది:

  • పూర్ణవిరామానికి రూపొందించబడిన టోకెన్ మొత్తం 3 వాక్యాల్లో ఒకేలా (“13”) ఉంటుంది. ఎందుకంటే, సందర్భపరంగా, కార్పస్ డేటా అంతటా పూర్ణవిరామం చాలా సమానంగా ఉపయోగించబడుతుంది.

  • వాక్యంలో ‘red’ స్థానాన్ని బట్టి దానికి రూపొందించబడిన టోకెన్ మారుతుంది:

    • వాక్యం మధ్యలో చిన్న అక్షరం: ‘ red’ - (టోకెన్: “2266”)

    • వాక్యం మధ్యలో పెద్ద అక్షరం: ‘ Red’ - (టోకెన్: “2297”)

    • వాక్యం ప్రారంభంలో పెద్ద అక్షరం: ‘Red’ - (టోకెన్: “7738”)

ఈ వ్యాసం ఉపయోగకరంగా ఉందా?