Bevor du eine Zeichenfolge zur Einbettung sendest, kannst du mit der Tokenizer-Bibliothek tiktoken von OpenAI abschätzen, wie viele Tokens sie benötigt.
Das ist besonders nützlich, weil Einbettungsmodelle (wie text-embedding-3-small) Höchstgrenzen für Tokens haben, die du einhalten musst.
---
Token mit Tiktoken zählen
Sie können das Python-Paket tiktoken verwenden, um die Anzahl der Token zu berechnen, die eine Zeichenkette erzeugt.
Hier ist ein Beispiel-Code-Snippet:
import tiktoken
def num_tokens_from_string(string: str, encoding_name: str) -> int:
"""Returns the number of tokens in a text string."""
encoding = tiktoken.get_encoding(encoding_name)
num_tokens = len(encoding.encode(string))
return num_tokens
# Example usage
num_tokens = num_tokens_from_string("tiktoken is great!", "cl100k_base")
print(num_tokens)Wichtig:
Für Einbettungsmodelle der dritten Generation (z. B. text-embedding-3-small oder text-embedding-3-large) solltest du die Codierung "cl100k_base" verwenden.
Verschiedene Modelle können unterschiedliche Codierungen erfordern. Sieh im Zweifelsfall immer in der Dokumentation des Modells nach.
---
Warum das Zählen von Token wichtig ist
Wenn Ihre Zeichenkette die maximale Eingabegröße des Modells überschreitet, schlägt Ihre API-Anfrage fehl.
Das genaue Zählen von Token im Voraus sorgt für reibungslosere Embedding-Workflows und verhindert Fehler bei der Verarbeitung.
---
