Bir dizeyi gömme işlemi için göndermeden önce OpenAI’ın tiktoken tokenleştirici kitaplığını kullanarak kaç token tüketeceğini tahmin edebilirsiniz.
Bu özellikle önemlidir; çünkü gömme modellerinin (ör. text-embedding-3-small) aşmamanız gereken maksimum token sınırları vardır.
---
Tiktoken ile Token Sayma
Bir dizenin oluşturacağı token sayısını hesaplamak için tiktoken Python paketini kullanabilirsiniz.
Örnek bir kod parçacığı:
import tiktoken
def num_tokens_from_string(string: str, encoding_name: str) -> int:
"""Bir metin dizesindeki token sayısını döndürür."""
encoding = tiktoken.get_encoding(encoding_name)
num_tokens = len(encoding.encode(string))
return num_tokens
# Örnek kullanım
num_tokens = num_tokens_from_string("tiktoken harika!", "cl100k_base")
print(num_tokens)Önemli:
Üçüncü nesil gömme modelleri (ör. text-embedding-3-small veya text-embedding-3-large) için "cl100k_base" kodlamasını kullanmalısınız.
Farklı modeller farklı kodlamalar gerektirebilir. Emin değilseniz mutlaka model belgelerine bakın.
---
Token Sayımı Neden Önemlidir
Dizeniz modelin maksimum giriş boyutunu aşarsa API isteğiniz başarısız olur.
Tokenları önceden doğru şekilde saymak, embedding iş akışlarının daha sorunsuz ilerlemesini sağlar ve işleme sırasında hataları önler.
---
