OpenAI
Þessi síða var vélþýdd. Skoða upprunalegu ensku greinina.

Hvernig get ég séð hversu marga tóka strengur mun hafa áður en ég reyni að fella hann inn?

Að reikna/áætla tóka fyrir innfellingu

Uppfært: 8 days ago

Áður en strengur er sendur í ígreypingu geturðu áætlað hversu marga tóka hann mun nota með því að beita tókavæðingarsafni OpenAI, tiktoken.

Þetta er sérstaklega gagnlegt vegna þess að ígreypingarlíkön (eins og text-embedding-3-small) hafa hámark á fjölda tóka sem þú þarft að halda þig innan.

---

Hvernig á að telja tóka með Tiktoken

Þú getur notað Python-pakkann tiktoken til að reikna fjölda tóka sem strengur mun mynda.

Hér er dæmi um kóðabút:

import tiktoken

def num_tokens_from_string(string: str, encoding_name: str) -> int:
"""Skilar fjölda tóka í textastreng."""
encoding = tiktoken.get_encoding(encoding_name)
num_tokens = len(encoding.encode(string))
return num_tokens

# Dæmi um notkun
num_tokens = num_tokens_from_string("tiktoken is great!", "cl100k_base")
print(num_tokens)

Mikilvægt:

  • Fyrir þriðju kynslóðar ígreypingarlíkön (t.d. text-embedding-3-small eða text-embedding-3-large) ættirðu að nota "cl100k_base" kóðunina.

  • Mismunandi líkön geta krafist mismunandi kóðana — skoðaðu alltaf skjöl líkansins ef þú ert í vafa.

---

Af hverju talning tóka skiptir máli

  • Ef strengurinn þinn fer yfir hámarksinntaksstærð líkansins mun API-beiðnin þín mistakast.

  • Nákvæm talning tóka fyrirfram tryggir hnökralausari ígreypingarverkflæði og kemur í veg fyrir villur við vinnslu.

---

Var þessi grein gagnleg?