ఎంబెడింగ్ కోసం స్ట్రింగ్ను పంపే ముందు, OpenAI యొక్క tiktoken టోకనైజర్ లైబ్రరీ ఉపయోగించి అది ఎన్ని టోకెన్లు ఉపయోగిస్తుందో అంచనా వేయవచ్చు.
ఇది ప్రత్యేకంగా ఉపయోగకరం, ఎందుకంటే text-embedding-3-small వంటి ఎంబెడింగ్ మోడల్లకు మీరు పాటించాల్సిన గరిష్ఠ టోకెన్ పరిమితులు ఉంటాయి.
---
Tiktoken ఉపయోగించి టోకెన్లను ఎలా లెక్కించాలి
ఒక స్ట్రింగ్ ఉత్పత్తి చేసే టోకెన్ల సంఖ్యను లెక్కించడానికి మీరు tiktoken Python ప్యాకేజీని ఉపయోగించవచ్చు.
ఇదిగో ఒక నమూనా కోడ్ స్నిపెట్:
import tiktoken
def num_tokens_from_string(string: str, encoding_name: str) -> int:
"""ఒక text string లోని టోకెన్ల సంఖ్యను తిరిగి ఇస్తుంది."""
encoding = tiktoken.get_encoding(encoding_name)
num_tokens = len(encoding.encode(string))
return num_tokens
# ఉదాహరణ వినియోగం
num_tokens = num_tokens_from_string("tiktoken is great!", "cl100k_base")
print(num_tokens)ముఖ్యమైనది:
మూడో తరం ఎంబెడింగ్ మోడల్ల కోసం (ఉదా.,
text-embedding-3-smallలేదాtext-embedding-3-large), మీరు"cl100k_base"ఎన్కోడింగ్ను ఉపయోగించాలి.వేర్వేరు మోడల్లకు వేర్వేరు ఎన్కోడింగ్లు అవసరం కావచ్చు — అనిశ్చితి ఉంటే ఎల్లప్పుడూ మోడల్ డాక్యుమెంటేషన్ను చూడండి.
---
టోకెన్ల లెక్కింపు ఎందుకు ముఖ్యం
మీ స్ట్రింగ్ మోడల్ యొక్క గరిష్ఠ ఇన్పుట్ పరిమాణాన్ని మించి ఉంటే, మీ API అభ్యర్థన విఫలమవుతుంది.
ముందుగానే టోకెన్లను ఖచ్చితంగా లెక్కించడం ఎంబెడింగ్ వర్క్ఫ్లోలు మరింత సజావుగా సాగడాన్ని నిర్ధారించి, ప్రాసెసింగ్ సమయంలో లోపాలను నివారిస్తుంది.
---
