Նախքան տողն էմբեդինգի ուղարկելը կարող եք գնահատել, թե քանի թոքեն այն կօգտագործի՝ կիրառելով OpenAI-ի tiktoken թոքենիզատորի գրադարանը։
Սա հատկապես օգտակար է, քանի որ էմբեդինգի մոդելները (օրինակ՝ text-embedding-3-small) ունեն թոքենների առավելագույն սահմանաչափեր, որոնց մեջ պետք է տեղավորվեք։
---
Ինչպես հաշվել թոքենները Tiktoken-ով
Կարող եք օգտագործել Python-ի tiktoken փաթեթը՝ հաշվարկելու, թե քանի թոքեն կստեղծի տողը։
Ահա կոդի օրինակային հատված.
import tiktoken
def num_tokens_from_string(string: str, encoding_name: str) -> int:
"""Վերադարձնում է տեքստային տողի թոքենների քանակը։"""
encoding = tiktoken.get_encoding(encoding_name)
num_tokens = len(encoding.encode(string))
return num_tokens
# Օգտագործման օրինակ
num_tokens = num_tokens_from_string("tiktoken is great!", "cl100k_base")
print(num_tokens)Կարևոր է.
Երրորդ սերնդի էմբեդինգի մոդելների համար (օրինակ՝
text-embedding-3-smallկամtext-embedding-3-large) պետք է օգտագործեք"cl100k_base"կոդավորումը։Տարբեր մոդելներ կարող են պահանջել տարբեր կոդավորումներ. եթե վստահ չեք, միշտ դիմեք մոդելի փաստաթղթերին։
---
Ինչու է կարևոր թոքենների հաշվարկը
Եթե ձեր տողը գերազանցի մոդելի մուտքի առավելագույն չափը, ձեր API հարցումը կձախողվի։
Թոքենները նախապես ճշգրիտ հաշվելը ապահովում է էմբեդինգի ավելի սահուն աշխատանքային հոսքեր և կանխում է մշակման ընթացքում սխալները։
---
