Pred odoslaním reťazca na vytvorenie embeddingu môžete pomocou knižnice tokenizátora tiktoken od OpenAI odhadnúť, koľko tokenov sa použije.
Je to užitočné najmä preto, že embeddingové modely (napríklad text-embedding-3-small) majú stanovený maximálny počet tokenov, ktorý nesmiete prekročiť.
---
Ako počítať tokeny pomocou Tiktoken
Na výpočet počtu tokenov, ktoré reťazec vygeneruje, môžete použiť balík Pythonu tiktoken.
Tu je ukážkový úryvok kódu:
import tiktoken
def num_tokens_from_string(string: str, encoding_name: str) -> int:
"""Vracia počet tokenov v textovom reťazci."""
encoding = tiktoken.get_encoding(encoding_name)
num_tokens = len(encoding.encode(string))
return num_tokens
# Príklad použitia
num_tokens = num_tokens_from_string("tiktoken is great!", "cl100k_base")
print(num_tokens)Dôležité:
Pre embeddingové modely tretej generácie (napr. text-embedding-3-small alebo text-embedding-3-large) by ste mali používať kódovanie "cl100k_base".
Rôzne modely môžu vyžadovať rôzne kódovania. Ak si nie ste istí, vždy si pozrite dokumentáciu k danému modelu.
---
Prečo je počítanie tokenov dôležité
Ak váš reťazec prekročí maximálnu veľkosť vstupu modelu, vaša požiadavka API zlyhá.
Presné počítanie tokenov vopred zabezpečuje plynulejšie pracovné postupy embeddings a predchádza chybám počas spracovania.
---
