Տողը ներկառուցման ուղարկելուց առաջ կարող եք OpenAI-ի tiktoken թոքենացնող գրադարանի միջոցով գնահատել, թե քանի թոքեն կօգտագործվի։
Սա հատկապես օգտակար է, քանի որ ներկառուցման մոդելները (օրինակ՝ text-embedding-3-small) ունեն թոքենների առավելագույն սահմանաչափեր, որոնք չպետք է գերազանցել։
---
Ինչպես հաշվել թոքենները Tiktoken-ով
Կարող եք օգտագործել Python-ի tiktoken փաթեթը՝ հաշվարկելու, թե քանի թոքեն կստեղծի տողը։
Ահա կոդի օրինակային հատված.
import tiktoken
def num_tokens_from_string(string: str, encoding_name: str) -> int:
"""Վերադարձնում է տեքստային տողի թոքենների քանակը։"""
encoding = tiktoken.get_encoding(encoding_name)
num_tokens = len(encoding.encode(string))
return num_tokens
# Օգտագործման օրինակ
num_tokens = num_tokens_from_string("tiktoken is great!", "cl100k_base")
print(num_tokens)Կարևոր է՝
Երրորդ սերնդի ներկառուցման մոդելների (օրինակ՝ text-embedding-3-small կամ text-embedding-3-large) համար պետք է օգտագործել "cl100k_base" կոդավորումը։
Տարբեր մոդելների համար կարող են տարբեր կոդավորումներ պահանջվել․ կասկածի դեպքում միշտ դիմեք մոդելի փաստաթղթերին։
---
Ինչու է կարևոր թոքենների հաշվարկը
Եթե ձեր տողը գերազանցի մոդելի մուտքի առավելագույն չափը, ձեր API հարցումը կձախողվի։
Թոքենները նախապես ճշգրիտ հաշվելը ապահովում է էմբեդինգի ավելի սահուն աշխատանքային հոսքեր և կանխում է մշակման ընթացքում սխալները։
---
