OpenAI
Kjo faqe u përkthye automatikisht. Shih artikullin origjinal në anglisht.

Si mund të di sa token do të ketë një varg para se të provoj ta vektorizoj?

Llogaritja/përafrimi i token për një embedding

Përditësuar: 6 days ago

Para se të dërgoni një varg për embedding, mund të vlerësoni sa tokenë do të përdorë duke aplikuar bibliotekën tokenizuese tiktoken të OpenAI.

Kjo është veçanërisht e dobishme sepse modelet embedding (si text-embedding-3-small) kanë kufij maksimalë tokenësh që duhet t’i respektoni.

---

Si të numëroni tokenët me Tiktoken

Mund të përdorni paketën Python tiktoken për të llogaritur numrin e tokenëve që do të gjenerojë një varg.

Ja një fragment kodi shembull:

import tiktoken

def num_tokens_from_string(string: str, encoding_name: str) -> int:
"""Kthen numrin e token në një varg teksti."""
encoding = tiktoken.get_encoding(encoding_name)
num_tokens = len(encoding.encode(string))
return num_tokens

# Shembull përdorimi
num_tokens = num_tokens_from_string("tiktoken is great!", "cl100k_base")
print(num_tokens)

E rëndësishme:

  • Për modelet e embedding të gjeneratës së tretë (p.sh., text-embedding-3-small ose text-embedding-3-large), duhet të përdorni kodimin "cl100k_base".

  • Modele të ndryshme mund të kërkojnë kodime të ndryshme — gjithmonë referojuni dokumentacionit të modelit nëse nuk jeni të sigurt.

---

Pse ka rëndësi numërimi i tokenëve

  • Nëse vargu juaj tejkalon madhësinë maksimale të hyrjes së modelit, kërkesa juaj API do të dështojë.

  • Numërimi i saktë i tokenëve paraprakisht siguron rrjedha pune më të qeta për embedding dhe parandalon gabime gjatë përpunimit.

---

A ishte i dobishëm ky artikull?