OpenAI
Ukurasa huu ulitafsiriwa na mashine. Tazama makala asili ya Kiingereza.

Ninawezaje kujua maandishi yatakuwa na tokeni ngapi kabla ya kujaribu kuya-embed?

Kukokotoa/kukadiria tokeni za embedding

Ilisasishwa: 17 days ago

Kabla ya kutuma mfuatano kwa ajili ya upachikaji, unaweza kukadiria idadi ya tokeni utakazotumia kwa kutumia maktaba ya utenganishaji tokeni ya tiktoken ya OpenAI.

Hii ni muhimu hasa kwa sababu miundo ya upachikaji (kama text-embedding-3-small) ina vikomo vya juu vya tokeni ambavyo hupaswi kuvizidi.

---

Jinsi ya Kuhesabu Tokeni kwa Tiktoken

Unaweza kutumia kifurushi cha Python cha tiktoken kukokotoa idadi ya tokeni ambazo stringi itazalisha.

Hiki hapa ni kipande cha msimbo wa mfano:

import tiktoken

def num_tokens_from_string(string: str, encoding_name: str) -> int:
"""Returns the number of tokens in a text string."""
encoding = tiktoken.get_encoding(encoding_name)
num_tokens = len(encoding.encode(string))
return num_tokens

# Example usage
num_tokens = num_tokens_from_string("tiktoken is great!", "cl100k_base")
print(num_tokens)

Muhimu:

  • Kwa miundo ya upachikaji ya kizazi cha tatu (k.m., text-embedding-3-small au text-embedding-3-large), unapaswa kutumia usimbaji wa "cl100k_base".

  • Miundo tofauti inaweza kuhitaji usimbaji tofauti—ikiwa huna uhakika, rejelea hati za muundo kila wakati.

---

Kwa Nini Kuhesabu Tokeni ni Muhimu

  • Ikiwa stringi yako itazidi ukubwa wa juu wa ingizo la muundo, ombi lako la API litashindikana.

  • Kuhesabu tokeni kwa usahihi mapema huhakikisha mtiririko laini zaidi wa embedding na kuzuia hitilafu wakati wa uchakataji.

---

Je, makala haya yamekusaidia?