OpenAI
Această pagină a fost tradusă automat. Vezi articolul original în limba engleză.

Cum pot afla câți tokeni va avea un șir înainte să încerc să-l transform în embedding?

Calcularea/aproximarea tokenilor pentru un embedding

Actualizat: 9 days ago

Înainte de a trimite un șir pentru încorporare, puteți estima câte tokenuri va folosi utilizând biblioteca de tokenizare tiktoken de la OpenAI.

Acest lucru este deosebit de util deoarece modelele de încorporare (precum text-embedding-3-small) au limite maxime de tokenuri pe care trebuie să le respectați.

---

Cum să numeri tokenurile cu Tiktoken

Poți folosi pachetul Python tiktoken pentru a calcula numărul de tokenuri pe care îl va genera un șir.

Iată un fragment de cod exemplu:

import tiktoken

def num_tokens_from_string(string: str, encoding_name: str) -> int:
"""Returnează numărul de tokeni dintr-un șir text."""
encoding = tiktoken.get_encoding(encoding_name)
num_tokens = len(encoding.encode(string))
return num_tokens

# Exemplu de utilizare
num_tokens = num_tokens_from_string("tiktoken is great!", "cl100k_base")
print(num_tokens)

Important:

  • Pentru modelele de încorporare de a treia generație (de exemplu, text-embedding-3-small sau text-embedding-3-large), trebuie să utilizați codificarea "cl100k_base".

  • Modelele diferite pot necesita codificări diferite — dacă aveți nelămuriri, consultați întotdeauna documentația modelului.

---

De ce contează numărarea tokenurilor

  • Dacă șirul tău depășește dimensiunea maximă de intrare a modelului, solicitarea API va eșua.

  • Numărarea exactă a tokenurilor din timp asigură fluxuri de lucru de embedding mai fluide și previne erorile în timpul procesării.

---

A fost util acest articol?