OpenAI
ఈ పేజీ మెషిన్ ట్రాన్స్‌లేషన్‌తో అనువదించబడింది. అసలు ఇంగ్లీష్ ఆర్టికల్‌ను చూడండి.

నేను దాన్ని embed చేయడానికి ముందు ఒక string కి ఎన్ని టోకెన్‌లు ఉంటాయో ఎలా తెలుసుకోవాలి?

ఒక embedding కోసం టోకెన్‌లను లెక్కించడం/అంచనా వేయడం

అప్డేట్ చేయబడిన: 7 days ago

ఎంబెడింగ్ కోసం స్ట్రింగ్‌ను పంపే ముందు, OpenAI యొక్క tiktoken టోకనైజర్ లైబ్రరీ ఉపయోగించి అది ఎన్ని టోకెన్‌లు ఉపయోగిస్తుందో అంచనా వేయవచ్చు.

ఇది ప్రత్యేకంగా ఉపయోగకరం, ఎందుకంటే text-embedding-3-small వంటి ఎంబెడింగ్ మోడల్‌లకు మీరు పాటించాల్సిన గరిష్ఠ టోకెన్ పరిమితులు ఉంటాయి.

---

Tiktoken ఉపయోగించి టోకెన్‌లను ఎలా లెక్కించాలి

ఒక స్ట్రింగ్ ఉత్పత్తి చేసే టోకెన్‌ల సంఖ్యను లెక్కించడానికి మీరు tiktoken Python ప్యాకేజీని ఉపయోగించవచ్చు.

ఇదిగో ఒక నమూనా కోడ్ స్నిపెట్:

import tiktoken

def num_tokens_from_string(string: str, encoding_name: str) -> int:
"""ఒక text string లోని టోకెన్‌ల సంఖ్యను తిరిగి ఇస్తుంది."""
encoding = tiktoken.get_encoding(encoding_name)
num_tokens = len(encoding.encode(string))
return num_tokens

# ఉదాహరణ వినియోగం
num_tokens = num_tokens_from_string("tiktoken is great!", "cl100k_base")
print(num_tokens)

ముఖ్యమైనది:

  • మూడో తరం ఎంబెడింగ్ మోడల్‌ల కోసం (ఉదా., text-embedding-3-small లేదా text-embedding-3-large), మీరు "cl100k_base" ఎన్‌కోడింగ్‌ను ఉపయోగించాలి.

  • వేర్వేరు మోడల్‌లకు వేర్వేరు ఎన్‌కోడింగ్‌లు అవసరం కావచ్చు — అనిశ్చితి ఉంటే ఎల్లప్పుడూ మోడల్ డాక్యుమెంటేషన్‌ను చూడండి.

---

టోకెన్‌ల లెక్కింపు ఎందుకు ముఖ్యం

  • మీ స్ట్రింగ్ మోడల్ యొక్క గరిష్ఠ ఇన్‌పుట్ పరిమాణాన్ని మించి ఉంటే, మీ API అభ్యర్థన విఫలమవుతుంది.

  • ముందుగానే టోకెన్‌లను ఖచ్చితంగా లెక్కించడం ఎంబెడింగ్ వర్క్‌ఫ్లోలు మరింత సజావుగా సాగడాన్ని నిర్ధారించి, ప్రాసెసింగ్ సమయంలో లోపాలను నివారిస్తుంది.

---

ఈ వ్యాసం ఉపయోగకరంగా ఉందా?