Enne stringi manustamiseks saatmist saate OpenAI tokeniseerimisteegi tiktoken abil hinnata, mitu tokenit selleks kulub.
See on eriti kasulik, sest manustusmudelitel (nt text-embedding-3-small) on tokenite ülempiir, mida ei tohi ületada.
---
Kuidas Tiktokeniga tokeneid loendada
Saate kasutada Pythoni paketti tiktoken, et arvutada, mitmeks tokeniks sõne jaotub.
Siin on näidiskoodilõik:
import tiktoken
def num_tokens_from_string(string: str, encoding_name: str) -> int:
"""Tagastab tokenite arvu tekstistringis."""
encoding = tiktoken.get_encoding(encoding_name)
num_tokens = len(encoding.encode(string))
return num_tokens
# Kasutusnäide
num_tokens = num_tokens_from_string("tiktoken is great!", "cl100k_base")
print(num_tokens)Oluline:
Kolmanda põlvkonna manustusmudelite (nt text-embedding-3-small või text-embedding-3-large) puhul tuleks kasutada kodeeringut "cl100k_base".
Eri mudelid võivad vajada eri kodeeringuid — kahtluse korral vaadake alati mudeli dokumentatsiooni.
---
Miks tokenite loendamine on oluline
Kui teie sõne ületab mudeli maksimaalse sisendi suuruse, nurjub teie API-päring.
Tokenite täpne eelnev loendamine tagab sujuvamad embeddingu töövood ja ennetab töötlemisel vigu.
---
