OpenAI
Ova stranica je mašinski prevedena. Pogledaj originalni članak na engleskom jeziku.

Kako mogu znati koliko će tokena niz imati prije nego što ga pokušam ugraditi?

Izračunavanje/procjena tokena za embedding

Ažurirano: 20 hours ago

Prije slanja niza znakova radi ugrađivanja možete procijeniti koliko će tokena koristiti pomoću OpenAI biblioteke za tokenizaciju tiktoken.

Ovo je posebno korisno jer modeli za ugrađivanje (kao što je text-embedding-3-small) imaju maksimalan broj tokena koji ne smijete prekoračiti.

---

Kako brojati tokene pomoću Tiktokena

Možete koristiti Python paket tiktoken za izračunavanje broja tokena koje će niz generisati.

Evo primjera isječka koda:

import tiktoken

def num_tokens_from_string(string: str, encoding_name: str) -> int:
"""Vraća broj tokena u tekstualnom nizu."""
encoding = tiktoken.get_encoding(encoding_name)
num_tokens = len(encoding.encode(string))
return num_tokens

# Primjer upotrebe
num_tokens = num_tokens_from_string("tiktoken is great!", "cl100k_base")
print(num_tokens)

Važno:

  • Za modele za ugrađivanje treće generacije (npr. text-embedding-3-small ili text-embedding-3-large) trebate koristiti kodiranje "cl100k_base".

  • Različiti modeli mogu zahtijevati različita kodiranja — ako niste sigurni, uvijek pogledajte dokumentaciju modela.

---

Zašto je brojanje tokena važno

  • Ako vaš niz premaši maksimalnu veličinu ulaza modela, vaš API zahtjev neće uspjeti.

  • Precizno brojanje tokena unaprijed osigurava jednostavnije radne tokove za embedding i sprječava greške tokom obrade.

---

Da li je ovaj članak bio koristan?