OpenAI
ეს გვერდი მანქანური თარგმანის მეშვეობით ითარგმნა. სტატიის ინგლისური დედნის ნახვა.

როგორ გავიგო, რამდენი token ექნება სტრიქონს, სანამ მის embedding-ს ვცდი?

embedding-ისთვის token-ების გამოთვლა/მიახლოებითი შეფასება

განახლებულია: 8 days ago

სტრიქონის ემბედინგისთვის გაგზავნამდე შეგიძლიათ შეაფასოთ, რამდენ token-ს გამოიყენებს იგი, OpenAI-ის tiktoken-ის ტოკენიზატორის ბიბლიოთეკის გამოყენებით.

ეს განსაკუთრებით სასარგებლოა, რადგან ემბედინგის მოდელებს (მაგალითად, text-embedding-3-small) აქვთ token-ების მაქსიმალური ლიმიტები, რომელთა ფარგლებშიც უნდა დარჩეთ.

---

როგორ დავთვალოთ token-ები Tiktoken-ით

შეგიძლიათ გამოიყენოთ Python-ის tiktoken პაკეტი, რათა გამოთვალოთ, რამდენ token-ს წარმოქმნის სტრიქონი.

ქვემოთ მოცემულია კოდის ნიმუშის ფრაგმენტი:

import tiktoken

def num_tokens_from_string(string: str, encoding_name: str) -> int:
"""აბრუნებს ტექსტურ სტრიქონში token-ების რაოდენობას."""
encoding = tiktoken.get_encoding(encoding_name)
num_tokens = len(encoding.encode(string))
return num_tokens

# გამოყენების მაგალითი
num_tokens = num_tokens_from_string("tiktoken is great!", "cl100k_base")
print(num_tokens)

მნიშვნელოვანია:

  • ემბედინგის მესამე თაობის მოდელებისთვის (მაგ., text-embedding-3-small ან text-embedding-3-large) უნდა გამოიყენოთ "cl100k_base" კოდირება.

  • სხვადასხვა მოდელს შეიძლება სხვადასხვა კოდირება დასჭირდეს — თუ დარწმუნებული არ ხართ, ყოველთვის მიმართეთ მოდელის დოკუმენტაციას.

---

რატომ არის მნიშვნელოვანი token-ების დათვლა

  • თუ თქვენი სტრიქონი მოდელის მაქსიმალურ შეყვანის ზომას გადააჭარბებს, თქვენი API-მოთხოვნა ვერ შესრულდება.

  • token-ების წინასწარ ზუსტად დათვლა ემბედინგის სამუშაო პროცესებს უფრო შეუფერხებელს ხდის და დამუშავებისას შეცდომებს თავიდან აგაცილებთ.

---

სასარგებლო იყო ეს სტატია?