Преди да изпратите низ за създаване на векторно представяне, можете да изчислите приблизително колко токена ще използва чрез библиотеката за токенизация tiktoken на OpenAI.
Това е особено полезно, тъй като моделите за векторни представяния (като text-embedding-3-small) имат максимални ограничения за броя токени, които трябва да спазвате.
---
Как да броите токени с Tiktoken
Можете да използвате Python пакета tiktoken, за да изчислите броя токени, които ще генерира даден низ.
Ето примерен откъс от код:
import tiktoken
def num_tokens_from_string(string: str, encoding_name: str) -> int:
"""Връща броя токени в текстов низ."""
encoding = tiktoken.get_encoding(encoding_name)
num_tokens = len(encoding.encode(string))
return num_tokens
# Пример за използване
num_tokens = num_tokens_from_string("tiktoken is great!", "cl100k_base")
print(num_tokens)Важно:
За модели за векторни представяния от трето поколение (напр. text-embedding-3-small или text-embedding-3-large) трябва да използвате кодирането „cl100k_base“.
Различните модели може да изискват различни кодирания — ако не сте сигурни, винаги проверявайте документацията на модела.
---
Защо броенето на токени е важно
Ако низът ви надвиши максималния размер на входа на модела, вашата API заявка ще се провали.
Точното предварително броене на токените осигурява по-гладки работни процеси с вграждания и предотвратява грешки по време на обработката.
---
