OpenAI
Diese Seite wurde maschinell übersetzt. Den Originalartikel auf Englisch ansehen.

Wie kann ich vor dem Einbetten erkennen, wie viele Token eine Zeichenkette haben wird?

Token für ein Embedding berechnen/abschätzen

Aktualisiert: 30 days ago

Bevor du eine Zeichenfolge zur Einbettung sendest, kannst du mit der Tokenizer-Bibliothek tiktoken von OpenAI abschätzen, wie viele Tokens sie benötigt.

Das ist besonders nützlich, weil Einbettungsmodelle (wie text-embedding-3-small) Höchstgrenzen für Tokens haben, die du einhalten musst.

---

Token mit Tiktoken zählen

Sie können das Python-Paket tiktoken verwenden, um die Anzahl der Token zu berechnen, die eine Zeichenkette erzeugt.

Hier ist ein Beispiel-Code-Snippet:

import tiktoken

def num_tokens_from_string(string: str, encoding_name: str) -> int:
"""Returns the number of tokens in a text string."""
encoding = tiktoken.get_encoding(encoding_name)
num_tokens = len(encoding.encode(string))
return num_tokens

# Example usage
num_tokens = num_tokens_from_string("tiktoken is great!", "cl100k_base")
print(num_tokens)

Wichtig:

  • Für Einbettungsmodelle der dritten Generation (z. B. text-embedding-3-small oder text-embedding-3-large) solltest du die Codierung "cl100k_base" verwenden.

  • Verschiedene Modelle können unterschiedliche Codierungen erfordern. Sieh im Zweifelsfall immer in der Dokumentation des Modells nach.

---

Warum das Zählen von Token wichtig ist

  • Wenn Ihre Zeichenkette die maximale Eingabegröße des Modells überschreitet, schlägt Ihre API-Anfrage fehl.

  • Das genaue Zählen von Token im Voraus sorgt für reibungslosere Embedding-Workflows und verhindert Fehler bei der Verarbeitung.

---

War dieser Artikel hilfreich?