OpenAI
આ પેજનો અનુવાદ મશીન દ્વારા કરવામાં આવ્યો હતો. મૂળ અંગ્રેજી લેખ જુઓ.

હું તેને embed કરવાનો પ્રયાસ કરું તે પહેલાં કોઈ stringમાં કેટલા ટોકન હશે તે કેવી રીતે જાણી શકું?

embedding માટે ટોકનની ગણતરી/અંદાજ લગાવવો

અપડેટ કર્યા તારીખ: 17 hours ago

એમ્બેડિંગ માટે સ્ટ્રિંગ મોકલતાં પહેલાં, OpenAIની tiktoken ટોકનાઇઝર લાઇબ્રેરીનો ઉપયોગ કરીને તમે અંદાજ લગાવી શકો છો કે તેમાં કેટલા ટોકન વપરાશે.

આ ખાસ કરીને ઉપયોગી છે, કારણ કે એમ્બેડિંગ મોડલ (જેમ કે text-embedding-3-small) માટે ટોકનની મહત્તમ મર્યાદા હોય છે, જેની અંદર તમારે રહેવું જરૂરી છે.

---

Tiktoken વડે ટોકન કેવી રીતે ગણવા

સ્ટ્રિંગ કેટલા ટોકન જનરેટ કરશે તેની ગણતરી કરવા માટે તમે tiktoken Python પૅકેજનો ઉપયોગ કરી શકો છો.

અહીં નમૂનાનો કોડ સ્નિપેટ છે:

import tiktoken

def num_tokens_from_string(string: str, encoding_name: str) -> int:
"""ટેક્સ્ટ string માંના ટોકનની સંખ્યા પરત કરે છે."""
encoding = tiktoken.get_encoding(encoding_name)
num_tokens = len(encoding.encode(string))
return num_tokens

# Example usage
num_tokens = num_tokens_from_string("tiktoken is great!", "cl100k_base")
print(num_tokens)

મહત્વપૂર્ણ:

  • ત્રીજી પેઢીના એમ્બેડિંગ મોડલ (દા.ત., text-embedding-3-small અથવા text-embedding-3-large) માટે તમારે "cl100k_base" એન્કોડિંગનો ઉપયોગ કરવો જોઈએ.

  • અલગ-અલગ મોડલ માટે અલગ એન્કોડિંગ જરૂરી હોઈ શકે છે. શંકા હોય તો હંમેશાં મોડલના દસ્તાવેજો જુઓ.

---

ટોકનની ગણતરી શા માટે મહત્વની છે

  • જો તમારી સ્ટ્રિંગ મોડલના મહત્તમ ઇનપુટ કદને વટાવે, તો તમારી API વિનંતી નિષ્ફળ જશે.

  • અગાઉથી ટોકનની ચોક્કસ ગણતરી કરવાથી એમ્બેડિંગ વર્કફ્લો વધુ સરળ રહે છે અને પ્રક્રિયા દરમિયાન ભૂલો અટકે છે.

---

શું આ લેખ મદદરૂપ હતો?