Жолды embedding үшін жібермес бұрын, оның қанша токен пайдаланатынын OpenAI-дың tiktoken токенизатор кітапханасын қолдану арқылы шамалай аласыз.
Бұл әсіресе пайдалы, себебі embedding модельдерінің (text-embedding-3-small сияқты) асырмауыңыз қажет ең көп токен шектері бар.
---
Tiktoken көмегімен токендерді қалай санауға болады
Жол жасайтын токендер санын есептеу үшін Python-ның tiktoken пакетін пайдалана аласыз.
Міне, код үзіндісінің үлгісі:
import tiktoken
def num_tokens_from_string(string: str, encoding_name: str) -> int:
"""Мәтін жолындағы токендер санын қайтарады."""
encoding = tiktoken.get_encoding(encoding_name)
num_tokens = len(encoding.encode(string))
return num_tokens
# Қолдану мысалы
num_tokens = num_tokens_from_string("tiktoken is great!", "cl100k_base")
print(num_tokens)Маңызды:
Үшінші буын embedding модельдері үшін (мысалы,
text-embedding-3-smallнемесеtext-embedding-3-large)"cl100k_base"кодтауын пайдалану керек.Әртүрлі модельдер әртүрлі кодтауды қажет етуі мүмкін — сенімді болмасаңыз, әрдайым модель құжаттамасына жүгініңіз.
---
Токендерді санау неге маңызды
Егер жолыңыз модельдің ең үлкен кіріс өлшемінен асып кетсе, API сұрауыңыз орындалмайды.
Токендерді алдын ала дәл санау embedding жұмыс процестерін бірқалыпты етеді және өңдеу кезіндегі қателердің алдын алады.
---
