OpenAI
See leht on masintõlgitud. Vaadake algset ingliskeelset artiklit.

Kuidas saan enne manustamist teada, mitu tokenit string sisaldab?

Manuse tokenite arvutamine/hindamine

Värskendatud: 17 days ago

Enne stringi manustamiseks saatmist saate OpenAI tokeniseerimisteegi tiktoken abil hinnata, mitu tokenit selleks kulub.

See on eriti kasulik, sest manustusmudelitel (nt text-embedding-3-small) on tokenite ülempiir, mida ei tohi ületada.

---

Kuidas Tiktokeniga tokeneid loendada

Saate kasutada Pythoni paketti tiktoken, et arvutada, mitmeks tokeniks sõne jaotub.

Siin on näidiskoodilõik:

import tiktoken

def num_tokens_from_string(string: str, encoding_name: str) -> int:
"""Tagastab tokenite arvu tekstistringis."""
encoding = tiktoken.get_encoding(encoding_name)
num_tokens = len(encoding.encode(string))
return num_tokens

# Kasutusnäide
num_tokens = num_tokens_from_string("tiktoken is great!", "cl100k_base")
print(num_tokens)

Oluline:

  • Kolmanda põlvkonna manustusmudelite (nt text-embedding-3-small või text-embedding-3-large) puhul tuleks kasutada kodeeringut "cl100k_base".

  • Eri mudelid võivad vajada eri kodeeringuid — kahtluse korral vaadake alati mudeli dokumentatsiooni.

---

Miks tokenite loendamine on oluline

  • Kui teie sõne ületab mudeli maksimaalse sisendi suuruse, nurjub teie API-päring.

  • Tokenite täpne eelnev loendamine tagab sujuvamad embeddingu töövood ja ennetab töötlemisel vigu.

---

Kas sellest artiklist oli abi?