Prije slanja niza na embedding, možete procijeniti koliko će tokena koristiti primjenom OpenAI-jeve biblioteke tokenizatora tiktoken.
Ovo je posebno korisno jer embedding modeli (poput text-embedding-3-small) imaju maksimalna ograničenja tokena kojih se morate pridržavati.
---
Kako brojati tokene pomoću Tiktokena
Možete koristiti Python paket tiktoken za izračunavanje broja tokena koje će niz generisati.
Evo primjera isječka koda:
import tiktoken
def num_tokens_from_string(string: str, encoding_name: str) -> int:
"""Vraća broj tokena u tekstualnom nizu."""
encoding = tiktoken.get_encoding(encoding_name)
num_tokens = len(encoding.encode(string))
return num_tokens
# Primjer upotrebe
num_tokens = num_tokens_from_string("tiktoken is great!", "cl100k_base")
print(num_tokens)Važno:
Za embedding modele treće generacije (npr.
text-embedding-3-smallilitext-embedding-3-large) trebate koristiti kodiranje"cl100k_base".Različiti modeli mogu zahtijevati različita kodiranja — uvijek pogledajte dokumentaciju modela ako niste sigurni.
---
Zašto je brojanje tokena važno
Ako vaš niz premaši maksimalnu veličinu ulaza modela, vaš API zahtjev neće uspjeti.
Precizno brojanje tokena unaprijed osigurava jednostavnije radne tokove za embedding i sprječava greške tokom obrade.
---
