టోకెన్లు అంటే ఏమిటి?
OpenAI మోడళ్లు ప్రాసెస్ చేసే పాఠ్యానికి టోకెన్లు ప్రాథమిక భాగాలు. భాష మరియు సందర్భాన్ని బట్టి, అవి ఒక్క అక్షరం అంత చిన్నవిగా లేదా పూర్తి పదం అంత పొడవుగా ఉండవచ్చు. స్పేస్లు, విరామ చిహ్నాలు, పాక్షిక పదాలు అన్నీ టోకెన్ లెక్కలకు తోడ్పడతాయి. ప్రతిస్పందనను రూపొందించే ముందు API మీ పాఠ్యాన్ని అంతర్గతంగా విభజించే విధానం ఇదే.
ఆంగ్లం కోసం ఉపయోగకరమైన సుమారు నియమాలు:
1 టోకెన్ ≈ 4 అక్షరాలు
1 టోకెన్ ≈ ఒక పదంలో ¾
100 టోకెన్లు ≈ 75 పదాలు
1–2 వాక్యాలు ≈ 30 టోకెన్లు
1 పేరా ≈ 100 టోకెన్లు
~1,500 పదాలు ≈ 2,048 టోకెన్లు
మోడల్ మరియు ఎన్కోడింగ్ను బట్టి టోకనైజేషన్ మారుతుంది. మీ లక్ష్య మోడల్ కోసం ఖచ్చితమైన లెక్కను పొందడానికి టోకనైజర్ సాధనం లేదా tiktoken.encoding_for_model(model) ఉపయోగించండి.
ఉదాహరణలు
సుమారు టోకెన్ లెక్కలతో కొన్ని వాస్తవ ప్రపంచ పాఠ్య నమూనాలు ఇవి:
Wayne Gretzky చెప్పిన “మీరు ప్రయత్నించని షాట్లలో 100% మిస్ అవుతారు” = 11 టోకెన్లు
OpenAI చార్టర్ = 476 టోకెన్లు
అమెరికా స్వాతంత్ర్య ప్రకటన = 1,695 టోకెన్లు
టోకెన్ లెక్కలు ఎలా లెక్కించబడతాయి
మీరు APIకి పాఠ్యాన్ని పంపినప్పుడు:
పాఠ్యం టోకెన్లుగా విభజించబడుతుంది.
మోడల్ ఈ టోకెన్లను ప్రాసెస్ చేస్తుంది.
ప్రతిస్పందన టోకెన్ల వరుసగా రూపొందించబడి, ఆపై మళ్లీ పాఠ్యంగా మార్చబడుతుంది.
టోకెన్ వినియోగం అనేక వర్గాల్లో ట్రాక్ చేయబడుతుంది:
ఇన్పుట్ టోకెన్లు – మీ అభ్యర్థనలోని టోకెన్లు.
అవుట్పుట్ టోకెన్లు – ప్రతిస్పందనలో రూపొందించబడిన టోకెన్లు.
క్యాష్ చేసిన టోకెన్లు – సంభాషణ చరిత్రలో మళ్లీ ఉపయోగించిన టోకెన్లు (తరచుగా తక్కువ రేటుతో బిల్ చేయబడతాయి).
రిజనింగ్ టోకెన్లు – కొన్ని ఆధునిక మోడళ్లలో, తుది అవుట్పుట్ ఇవ్వడానికి ముందు అదనపు “ఆలోచనా దశలు” అంతర్గతంగా చేర్చబడతాయి.
ఈ లెక్కలు మీ API ప్రతిస్పందన మెటాడేటాలో కనిపిస్తాయి మరియు బిల్లింగ్, వినియోగ ట్రాకింగ్ కోసం ఉపయోగించబడతాయి.
టోకనైజేషన్ను మరింతగా అన్వేషించడానికి, మా ఇంటరాక్టివ్ టోకనైజర్ సాధనం ఉపయోగించవచ్చు; ఇది టోకెన్ల సంఖ్యను లెక్కించడానికి మరియు పాఠ్యం టోకెన్లుగా ఎలా విభజించబడుతుందో చూడడానికి మిమ్మల్ని అనుమతిస్తుంది.
ప్రత్యామ్నాయంగా, మీరు పాఠ్యాన్ని ప్రోగ్రామాటిక్గా టోకనైజ్ చేయాలనుకుంటే, OpenAI మోడళ్ల కోసం ప్రత్యేకంగా ఉపయోగించే వేగవంతమైన BPE టోకనైజర్గా Tiktokenను ఉపయోగించండి.
టోకెన్ పరిమితులు
ప్రతి మోడల్కు గరిష్ఠ సంయుక్త టోకెన్ పరిమితి (ఇన్పుట్ + అవుట్పుట్) ఉంటుంది. ప్రస్తుత అధిక సామర్థ్య మోడళ్లు సందర్భంలో లక్షల వరకు టోకెన్లకు మద్దతు ఇస్తాయి, అయితే మోడల్ వెర్షన్ మరియు మీ వినియోగ స్థాయిని బట్టి ప్రాయోగిక పరిమితులు మారవచ్చు.
మీరు పరిమితిని మించితే, మీరు ఇవి చేయవచ్చు:
ప్రాంప్ట్లను కుదించండి లేదా మళ్లీ వాక్యరచన చేయండి.
పెద్ద పాఠ్యాన్ని చిన్న భాగాలుగా విభజించండి.
ఇన్పుట్లను పంపే ముందు వాటిని సారాంశం చేయండి లేదా ముందుగా ప్రాసెస్ చేయండి.
టోకెన్ ధరలు
API వినియోగానికి టోకెన్కు అనుగుణంగా ధర నిర్ణయించబడుతుంది; ఇది మోడల్ మరియు టోకెన్లు ఇన్పుట్, అవుట్పుట్ లేదా క్యాష్ చేసినవా అన్నదాన్ని బట్టి మారుతుంది. ప్రస్తుత రేట్ల కోసం OpenAI యొక్క ధరల పేజీను చూడండి. కొన్ని రిజనింగ్ మోడళ్లు అంతర్గతంగా ఎక్కువ టోకెన్లను ఉపయోగించవచ్చు, కానీ పూర్తయిన ప్రతి పనికి అవసరమైన టోకెన్ల సంఖ్యను తగ్గించడం ద్వారా సామర్థ్యాన్ని మెరుగుపరచాలని లక్ష్యంగా పెట్టుకుంటాయి.
టోకెన్లను అన్వేషించడం
కార్పస్ డేటాలో పదాలను వాటి సందర్భానికి అనుగుణంగా API పరిగణిస్తుంది. మోడళ్లు ప్రాంప్ట్ను తీసుకుని, ఇన్పుట్ను టోకెన్ల జాబితాగా మార్చి, ప్రాంప్ట్ను ప్రాసెస్ చేసి, అంచనా వేసిన టోకెన్లను మళ్లీ మనం ప్రతిస్పందనలో చూసే పదాలుగా మారుస్తాయి.
మనకు ఒకేలా కనిపించే రెండు పదాలు, పాఠ్యంలో అవి ఎలా నిర్మాణం చేయబడ్డాయో బట్టి వేర్వేరు టోకెన్లుగా రూపొందించబడవచ్చు. పాఠ్యంలో ఉన్న సందర్భం ఆధారంగా ‘red’ అనే పదానికి API టోకెన్ విలువలను ఎలా రూపొందిస్తుందో పరిశీలించండి:
పై మొదటి ఉదాహరణలో ‘ red’ కోసం టోకెన్ “2266” చివరిలో స్పేస్ను కలిగి ఉంటుంది (గమనిక: ఇవి ప్రదర్శన ప్రయోజనాల కోసం ఉదాహరణ టోకెన్ IDలు).
‘ Red’ కోసం టోకెన్ “2296” (ముందు స్పేస్తో మరియు పెద్ద అక్షరంతో ప్రారంభమవుతుంది) చిన్న అక్షరంతో ఉన్న ‘ red’ కోసం టోకెన్ “2266” నుండి భిన్నంగా ఉంటుంది.
‘Red’ ఒక వాక్యం ప్రారంభంలో ఉపయోగించినప్పుడు, రూపొందించబడిన టోకెన్లో ముందు స్పేస్ ఉండదు. టోకెన్ “7738” ఆ పదానికి సంబంధించిన మునుపటి రెండు ఉదాహరణలకంటే భిన్నంగా ఉంటుంది.
పరిశీలనలు:
టోకెన్ సంభావ్యత/ఆవృతం ఎంత ఎక్కువగా ఉంటే, దానికి కేటాయించిన టోకెన్ సంఖ్య అంత తక్కువగా ఉంటుంది:
పూర్ణవిరామానికి రూపొందించబడిన టోకెన్ మొత్తం 3 వాక్యాల్లో ఒకేలా (“13”) ఉంటుంది. ఎందుకంటే, సందర్భపరంగా, కార్పస్ డేటా అంతటా పూర్ణవిరామం చాలా సమానంగా ఉపయోగించబడుతుంది.
వాక్యంలో ‘red’ స్థానాన్ని బట్టి దానికి రూపొందించబడిన టోకెన్ మారుతుంది:
వాక్యం మధ్యలో చిన్న అక్షరం: ‘ red’ - (టోకెన్: “2266”)
వాక్యం మధ్యలో పెద్ద అక్షరం: ‘ Red’ - (టోకెన్: “2297”)
వాక్యం ప్రారంభంలో పెద్ద అక్షరం: ‘Red’ - (టోకెన్: “7738”)
