Áður en strengur er sendur til innfellingar má áætla hversu marga tóka hann notar með tókunarsafninu tiktoken frá OpenAI.
Þetta er sérlega gagnlegt þar sem innfellingarlíkön (eins og text-embedding-3-small) hafa hámarksfjölda tóka sem ekki má fara yfir.
---
Hvernig á að telja tóka með Tiktoken
Þú getur notað Python-pakkann tiktoken til að reikna fjölda tóka sem strengur mun mynda.
Hér er dæmi um kóðabút:
import tiktoken
def num_tokens_from_string(string: str, encoding_name: str) -> int:
"""Skilar fjölda tóka í textastreng."""
encoding = tiktoken.get_encoding(encoding_name)
num_tokens = len(encoding.encode(string))
return num_tokens
# Dæmi um notkun
num_tokens = num_tokens_from_string("tiktoken is great!", "cl100k_base")
print(num_tokens)Mikilvægt:
Fyrir þriðju kynslóðar innfellingarlíkön (t.d. text-embedding-3-small eða text-embedding-3-large) ætti að nota kóðunina „cl100k_base“.
Ólík líkön kunna að krefjast ólíkrar kóðunar — skoðaðu alltaf fylgiskjöl líkansins ef þú ert í vafa.
---
Af hverju talning tóka skiptir máli
Ef strengurinn þinn fer yfir hámarksinntaksstærð líkansins mun API-beiðnin þín mistakast.
Nákvæm talning tóka fyrirfram tryggir hnökralausari ígreypingarverkflæði og kemur í veg fyrir villur við vinnslu.
---
