სტრიქონის ემბედინგისთვის გაგზავნამდე შეგიძლიათ შეაფასოთ, რამდენ token-ს გამოიყენებს იგი, OpenAI-ის tiktoken-ის ტოკენიზატორის ბიბლიოთეკის გამოყენებით.
ეს განსაკუთრებით სასარგებლოა, რადგან ემბედინგის მოდელებს (მაგალითად, text-embedding-3-small) აქვთ token-ების მაქსიმალური ლიმიტები, რომელთა ფარგლებშიც უნდა დარჩეთ.
---
როგორ დავთვალოთ token-ები Tiktoken-ით
შეგიძლიათ გამოიყენოთ Python-ის tiktoken პაკეტი, რათა გამოთვალოთ, რამდენ token-ს წარმოქმნის სტრიქონი.
ქვემოთ მოცემულია კოდის ნიმუშის ფრაგმენტი:
import tiktoken
def num_tokens_from_string(string: str, encoding_name: str) -> int:
"""აბრუნებს ტექსტურ სტრიქონში token-ების რაოდენობას."""
encoding = tiktoken.get_encoding(encoding_name)
num_tokens = len(encoding.encode(string))
return num_tokens
# გამოყენების მაგალითი
num_tokens = num_tokens_from_string("tiktoken is great!", "cl100k_base")
print(num_tokens)მნიშვნელოვანია:
ემბედინგის მესამე თაობის მოდელებისთვის (მაგ.,
text-embedding-3-smallანtext-embedding-3-large) უნდა გამოიყენოთ"cl100k_base"კოდირება.სხვადასხვა მოდელს შეიძლება სხვადასხვა კოდირება დასჭირდეს — თუ დარწმუნებული არ ხართ, ყოველთვის მიმართეთ მოდელის დოკუმენტაციას.
---
რატომ არის მნიშვნელოვანი token-ების დათვლა
თუ თქვენი სტრიქონი მოდელის მაქსიმალურ შეყვანის ზომას გადააჭარბებს, თქვენი API-მოთხოვნა ვერ შესრულდება.
token-ების წინასწარ ზუსტად დათვლა ემბედინგის სამუშაო პროცესებს უფრო შეუფერხებელს ხდის და დამუშავებისას შეცდომებს თავიდან აგაცილებთ.
---
