OpenAI
Այս էջը թարգմանվել է մեքենայական թարգմանությամբ։ Դիտել անգլերեն բնօրինակ հոդվածը.

Ինչպե՞ս կարող եմ իմանալ, թե տողը քանի թոքեն կունենա, նախքան այն embedding-ի ուղարկելը:

Embedding-ի համար թոքենների հաշվարկ/մոտարկում

Թարմացվել է՝ 8 days ago

Նախքան տողն էմբեդինգի ուղարկելը կարող եք գնահատել, թե քանի թոքեն այն կօգտագործի՝ կիրառելով OpenAI-ի tiktoken թոքենիզատորի գրադարանը։

Սա հատկապես օգտակար է, քանի որ էմբեդինգի մոդելները (օրինակ՝ text-embedding-3-small) ունեն թոքենների առավելագույն սահմանաչափեր, որոնց մեջ պետք է տեղավորվեք։

---

Ինչպես հաշվել թոքենները Tiktoken-ով

Կարող եք օգտագործել Python-ի tiktoken փաթեթը՝ հաշվարկելու, թե քանի թոքեն կստեղծի տողը։

Ահա կոդի օրինակային հատված.

import tiktoken

def num_tokens_from_string(string: str, encoding_name: str) -> int:
"""Վերադարձնում է տեքստային տողի թոքենների քանակը։"""
encoding = tiktoken.get_encoding(encoding_name)
num_tokens = len(encoding.encode(string))
return num_tokens

# Օգտագործման օրինակ
num_tokens = num_tokens_from_string("tiktoken is great!", "cl100k_base")
print(num_tokens)

Կարևոր է.

  • Երրորդ սերնդի էմբեդինգի մոդելների համար (օրինակ՝ text-embedding-3-small կամ text-embedding-3-large) պետք է օգտագործեք "cl100k_base" կոդավորումը։

  • Տարբեր մոդելներ կարող են պահանջել տարբեր կոդավորումներ. եթե վստահ չեք, միշտ դիմեք մոդելի փաստաթղթերին։

---

Ինչու է կարևոր թոքենների հաշվարկը

  • Եթե ձեր տողը գերազանցի մոդելի մուտքի առավելագույն չափը, ձեր API հարցումը կձախողվի։

  • Թոքենները նախապես ճշգրիտ հաշվելը ապահովում է էմբեդինգի ավելի սահուն աշխատանքային հոսքեր և կանխում է մշակման ընթացքում սխալները։

---

Այս հոդվածն օգտակա՞ր էր։