OpenAI
Оваа страница беше машински преведена. Погледнете ја оригиналната статија на англиски јазик.

Како да проверам колку токени ќе има низа пред да се обидам да ја вгнездам?

Пресметување/приближно одредување токени за embedding

Ажурирано: 17 days ago

Пред да испратите низа за вградување, може да процените колку токени ќе искористи со помош на библиотеката за токенизација tiktoken од OpenAI.

Ова е особено корисно бидејќи моделите за вградување (како text-embedding-3-small) имаат максимални ограничувања за бројот на токени што не смеете да ги надминете.

---

Како да броите токени со Tiktoken

Можете да го користите Python-пакетот tiktoken за да го пресметате бројот на токени што ќе ги генерира еден стринг.

Еве примерок од фрагмент од код:

import tiktoken

def num_tokens_from_string(string: str, encoding_name: str) -> int:
"""Го враќа бројот на токени во текстуална низа."""
encoding = tiktoken.get_encoding(encoding_name)
num_tokens = len(encoding.encode(string))
return num_tokens

# Пример за употреба
num_tokens = num_tokens_from_string("tiktoken is great!", "cl100k_base")
print(num_tokens)

Важно:

  • За моделите за вградување од трета генерација (на пр., text-embedding-3-small или text-embedding-3-large) треба да го користите кодирањето "cl100k_base".

  • За различни модели може да бидат потребни различни кодирања — ако не сте сигурни, секогаш погледнете ја документацијата за моделот.

---

Зошто е важно броењето токени

  • Ако вашиот стринг ја надмине максималната големина на влезот на моделот, вашето API-барање нема да успее.

  • Прецизното броење на токените однапред обезбедува помазни работни текови за вградување и спречува грешки при обработката.

---

Дали оваа статија ви беше корисна?