OpenAI
Deze pagina is automatisch vertaald. Bekijk het oorspronkelijke Engelstalige artikel.

Hoe kan ik zien hoeveel tokens een tekenreeks heeft voordat ik die probeer te embedden?

Tokens voor een embedding berekenen/schatten

Bijgewerkt: 9 days ago

Voordat je een tekenreeks verstuurt om er een embedding van te maken, kun je met de tiktoken-tokenizerbibliotheek van OpenAI schatten hoeveel tokens deze zal gebruiken.

Dit is vooral nuttig omdat embeddingmodellen (zoals text-embedding-3-small) een maximumaantal tokens hebben dat je niet mag overschrijden.

---

Tokens tellen met Tiktoken

Je kunt het Python-pakket tiktoken gebruiken om het aantal tokens te berekenen dat een string zal genereren.

Hier is een voorbeeld van een codefragment:

import tiktoken

def num_tokens_from_string(string: str, encoding_name: str) -> int:
"""Geeft het aantal tokens in een tekenreeks terug."""
encoding = tiktoken.get_encoding(encoding_name)
num_tokens = len(encoding.encode(string))
return num_tokens

# Voorbeeldgebruik
num_tokens = num_tokens_from_string("tiktoken is geweldig!", "cl100k_base")
print(num_tokens)

Belangrijk:

  • Voor embeddingmodellen van de derde generatie (zoals text-embedding-3-small of text-embedding-3-large) moet je de codering "cl100k_base" gebruiken.

  • Voor verschillende modellen kunnen verschillende coderingen nodig zijn. Raadpleeg bij twijfel altijd de documentatie van het model.

---

Waarom token-telling belangrijk is

  • Als je string de maximale invoergrootte van het model overschrijdt, mislukt je API-aanvraag.

  • Door tokens vooraf nauwkeurig te tellen, verlopen embeddingworkflows soepeler en voorkom je fouten tijdens de verwerking.

---

Was dit artikel nuttig?