Înainte de a trimite un șir pentru încorporare, puteți estima câte tokenuri va folosi utilizând biblioteca de tokenizare tiktoken de la OpenAI.
Acest lucru este deosebit de util deoarece modelele de încorporare (precum text-embedding-3-small) au limite maxime de tokenuri pe care trebuie să le respectați.
---
Cum să numeri tokenurile cu Tiktoken
Poți folosi pachetul Python tiktoken pentru a calcula numărul de tokenuri pe care îl va genera un șir.
Iată un fragment de cod exemplu:
import tiktoken
def num_tokens_from_string(string: str, encoding_name: str) -> int:
"""Returnează numărul de tokeni dintr-un șir text."""
encoding = tiktoken.get_encoding(encoding_name)
num_tokens = len(encoding.encode(string))
return num_tokens
# Exemplu de utilizare
num_tokens = num_tokens_from_string("tiktoken is great!", "cl100k_base")
print(num_tokens)Important:
Pentru modelele de încorporare de a treia generație (de exemplu, text-embedding-3-small sau text-embedding-3-large), trebuie să utilizați codificarea "cl100k_base".
Modelele diferite pot necesita codificări diferite — dacă aveți nelămuriri, consultați întotdeauna documentația modelului.
---
De ce contează numărarea tokenurilor
Dacă șirul tău depășește dimensiunea maximă de intrare a modelului, solicitarea API va eșua.
Numărarea exactă a tokenurilor din timp asigură fluxuri de lucru de embedding mai fluide și previne erorile în timpul procesării.
---
