OpenAI
Ukurasa huu ulitafsiriwa na mashine. Tazama makala asili ya Kiingereza.

Ninawezaje kujua maandishi yatakuwa na tokeni ngapi kabla ya kujaribu kuya-embed?

Kukokotoa/kukadiria tokeni za embedding

Ilisasishwa: 14 days ago

Kabla ya kutuma stringi kwa embedding, unaweza kukadiria itatumia tokeni ngapi kwa kutumia maktaba ya OpenAI ya tiktoken ya kugawa tokeni.

Hili linafaa hasa kwa sababu miundo ya embedding (kama text-embedding-3-small) ina vikomo vya juu vya tokeni ambavyo utahitaji kuzingatia.

---

Jinsi ya Kuhesabu Tokeni kwa Tiktoken

Unaweza kutumia kifurushi cha Python cha tiktoken kukokotoa idadi ya tokeni ambazo stringi itazalisha.

Hiki hapa ni kipande cha msimbo wa mfano:

import tiktoken

def num_tokens_from_string(string: str, encoding_name: str) -> int:
"""Returns the number of tokens in a text string."""
encoding = tiktoken.get_encoding(encoding_name)
num_tokens = len(encoding.encode(string))
return num_tokens

# Example usage
num_tokens = num_tokens_from_string("tiktoken is great!", "cl100k_base")
print(num_tokens)

Muhimu:

  • Kwa miundo ya embedding ya kizazi cha tatu (k.m., text-embedding-3-small au text-embedding-3-large), unapaswa kutumia usimbaji wa "cl100k_base".

  • Miundo tofauti inaweza kuhitaji usimbaji tofauti — rejelea kila wakati nyaraka za muundo ikiwa huna uhakika.

---

Kwa Nini Kuhesabu Tokeni ni Muhimu

  • Ikiwa stringi yako itazidi ukubwa wa juu wa ingizo la muundo, ombi lako la API litashindikana.

  • Kuhesabu tokeni kwa usahihi mapema huhakikisha mtiririko laini zaidi wa embedding na kuzuia hitilafu wakati wa uchakataji.

---

Je, makala haya yamekusaidia?