OpenAI
Þessi síða var vélþýdd. Skoða upprunalegu ensku greinina.

Hvernig get ég séð hversu marga tóka strengur mun hafa áður en ég reyni að fella hann inn?

Að reikna/áætla tóka fyrir innfellingu

Uppfært: 4 days ago

Áður en strengur er sendur til innfellingar má áætla hversu marga tóka hann notar með tókunarsafninu tiktoken frá OpenAI.

Þetta er sérlega gagnlegt þar sem innfellingarlíkön (eins og text-embedding-3-small) hafa hámarksfjölda tóka sem ekki má fara yfir.

---

Hvernig á að telja tóka með Tiktoken

Þú getur notað Python-pakkann tiktoken til að reikna fjölda tóka sem strengur mun mynda.

Hér er dæmi um kóðabút:

import tiktoken

def num_tokens_from_string(string: str, encoding_name: str) -> int:
"""Skilar fjölda tóka í textastreng."""
encoding = tiktoken.get_encoding(encoding_name)
num_tokens = len(encoding.encode(string))
return num_tokens

# Dæmi um notkun
num_tokens = num_tokens_from_string("tiktoken is great!", "cl100k_base")
print(num_tokens)

Mikilvægt:

  • Fyrir þriðju kynslóðar innfellingarlíkön (t.d. text-embedding-3-small eða text-embedding-3-large) ætti að nota kóðunina „cl100k_base“.

  • Ólík líkön kunna að krefjast ólíkrar kóðunar — skoðaðu alltaf fylgiskjöl líkansins ef þú ert í vafa.

---

Af hverju talning tóka skiptir máli

  • Ef strengurinn þinn fer yfir hámarksinntaksstærð líkansins mun API-beiðnin þín mistakast.

  • Nákvæm talning tóka fyrirfram tryggir hnökralausari ígreypingarverkflæði og kemur í veg fyrir villur við vinnslu.

---

Var þessi grein gagnleg?