სტრიქონის ემბედინგისთვის გაგზავნამდე შეგიძლიათ შეაფასოთ, რამდენ ტოკენს გამოიყენებს იგი, OpenAI-ის tiktoken ტოკენიზატორის ბიბლიოთეკის გამოყენებით.
ეს განსაკუთრებით სასარგებლოა, რადგან ემბედინგის მოდელებს (როგორიცაა text-embedding-3-small) ტოკენების მაქსიმალური ლიმიტი აქვთ, რომელსაც არ უნდა გადააჭარბოთ.
---
როგორ დავთვალოთ token-ები Tiktoken-ით
შეგიძლიათ გამოიყენოთ Python-ის tiktoken პაკეტი, რათა გამოთვალოთ, რამდენ token-ს წარმოქმნის სტრიქონი.
ქვემოთ მოცემულია კოდის ნიმუშის ფრაგმენტი:
import tiktoken
def num_tokens_from_string(string: str, encoding_name: str) -> int:
"""აბრუნებს ტექსტურ სტრიქონში token-ების რაოდენობას."""
encoding = tiktoken.get_encoding(encoding_name)
num_tokens = len(encoding.encode(string))
return num_tokens
# გამოყენების მაგალითი
num_tokens = num_tokens_from_string("tiktoken is great!", "cl100k_base")
print(num_tokens)მნიშვნელოვანია:
მესამე თაობის ემბედინგის მოდელებისთვის (მაგ., text-embedding-3-small ან text-embedding-3-large) უნდა გამოიყენოთ "cl100k_base" კოდირება.
სხვადასხვა მოდელს შეიძლება სხვადასხვა კოდირება სჭირდებოდეს — თუ დარწმუნებული არ ხართ, ყოველთვის მოდელის დოკუმენტაციას მიმართეთ.
---
რატომ არის მნიშვნელოვანი token-ების დათვლა
თუ თქვენი სტრიქონი მოდელის მაქსიმალურ შეყვანის ზომას გადააჭარბებს, თქვენი API-მოთხოვნა ვერ შესრულდება.
token-ების წინასწარ ზუსტად დათვლა ემბედინგის სამუშაო პროცესებს უფრო შეუფერხებელს ხდის და დამუშავებისას შეცდომებს თავიდან აგაცილებთ.
---
