Áður en strengur er sendur í ígreypingu geturðu áætlað hversu marga tóka hann mun nota með því að beita tókavæðingarsafni OpenAI, tiktoken.
Þetta er sérstaklega gagnlegt vegna þess að ígreypingarlíkön (eins og text-embedding-3-small) hafa hámark á fjölda tóka sem þú þarft að halda þig innan.
---
Hvernig á að telja tóka með Tiktoken
Þú getur notað Python-pakkann tiktoken til að reikna fjölda tóka sem strengur mun mynda.
Hér er dæmi um kóðabút:
import tiktoken
def num_tokens_from_string(string: str, encoding_name: str) -> int:
"""Skilar fjölda tóka í textastreng."""
encoding = tiktoken.get_encoding(encoding_name)
num_tokens = len(encoding.encode(string))
return num_tokens
# Dæmi um notkun
num_tokens = num_tokens_from_string("tiktoken is great!", "cl100k_base")
print(num_tokens)Mikilvægt:
Fyrir þriðju kynslóðar ígreypingarlíkön (t.d.
text-embedding-3-smalleðatext-embedding-3-large) ættirðu að nota"cl100k_base"kóðunina.Mismunandi líkön geta krafist mismunandi kóðana — skoðaðu alltaf skjöl líkansins ef þú ert í vafa.
---
Af hverju talning tóka skiptir máli
Ef strengurinn þinn fer yfir hámarksinntaksstærð líkansins mun API-beiðnin þín mistakast.
Nákvæm talning tóka fyrirfram tryggir hnökralausari ígreypingarverkflæði og kemur í veg fyrir villur við vinnslu.
---
