Voordat je een tekenreeks verstuurt om er een embedding van te maken, kun je met de tiktoken-tokenizerbibliotheek van OpenAI schatten hoeveel tokens deze zal gebruiken.
Dit is vooral nuttig omdat embeddingmodellen (zoals text-embedding-3-small) een maximumaantal tokens hebben dat je niet mag overschrijden.
---
Tokens tellen met Tiktoken
Je kunt het Python-pakket tiktoken gebruiken om het aantal tokens te berekenen dat een string zal genereren.
Hier is een voorbeeld van een codefragment:
import tiktoken
def num_tokens_from_string(string: str, encoding_name: str) -> int:
"""Geeft het aantal tokens in een tekenreeks terug."""
encoding = tiktoken.get_encoding(encoding_name)
num_tokens = len(encoding.encode(string))
return num_tokens
# Voorbeeldgebruik
num_tokens = num_tokens_from_string("tiktoken is geweldig!", "cl100k_base")
print(num_tokens)Belangrijk:
Voor embeddingmodellen van de derde generatie (zoals text-embedding-3-small of text-embedding-3-large) moet je de codering "cl100k_base" gebruiken.
Voor verschillende modellen kunnen verschillende coderingen nodig zijn. Raadpleeg bij twijfel altijd de documentatie van het model.
---
Waarom token-telling belangrijk is
Als je string de maximale invoergrootte van het model overschrijdt, mislukt je API-aanvraag.
Door tokens vooraf nauwkeurig te tellen, verlopen embeddingworkflows soepeler en voorkom je fouten tijdens de verwerking.
---
