OpenAI
Այս էջը թարգմանվել է մեքենայական թարգմանությամբ։ Դիտել անգլերեն բնօրինակ հոդվածը.

Ինչպե՞ս կարող եմ իմանալ, թե տողը քանի թոքեն կունենա, նախքան այն embedding-ի ուղարկելը:

Embedding-ի համար թոքենների հաշվարկ/մոտարկում

Թարմացվել է՝ 3 hours ago

Տողը ներկառուցման ուղարկելուց առաջ կարող եք OpenAI-ի tiktoken թոքենացնող գրադարանի միջոցով գնահատել, թե քանի թոքեն կօգտագործվի։

Սա հատկապես օգտակար է, քանի որ ներկառուցման մոդելները (օրինակ՝ text-embedding-3-small) ունեն թոքենների առավելագույն սահմանաչափեր, որոնք չպետք է գերազանցել։

---

Ինչպես հաշվել թոքենները Tiktoken-ով

Կարող եք օգտագործել Python-ի tiktoken փաթեթը՝ հաշվարկելու, թե քանի թոքեն կստեղծի տողը։

Ահա կոդի օրինակային հատված.

import tiktoken

def num_tokens_from_string(string: str, encoding_name: str) -> int:
"""Վերադարձնում է տեքստային տողի թոքենների քանակը։"""
encoding = tiktoken.get_encoding(encoding_name)
num_tokens = len(encoding.encode(string))
return num_tokens

# Օգտագործման օրինակ
num_tokens = num_tokens_from_string("tiktoken is great!", "cl100k_base")
print(num_tokens)

Կարևոր է՝

  • Երրորդ սերնդի ներկառուցման մոդելների (օրինակ՝ text-embedding-3-small կամ text-embedding-3-large) համար պետք է օգտագործել "cl100k_base" կոդավորումը։

  • Տարբեր մոդելների համար կարող են տարբեր կոդավորումներ պահանջվել․ կասկածի դեպքում միշտ դիմեք մոդելի փաստաթղթերին։

---

Ինչու է կարևոր թոքենների հաշվարկը

  • Եթե ձեր տողը գերազանցի մոդելի մուտքի առավելագույն չափը, ձեր API հարցումը կձախողվի։

  • Թոքենները նախապես ճշգրիտ հաշվելը ապահովում է էմբեդինգի ավելի սահուն աշխատանքային հոսքեր և կանխում է մշակման ընթացքում սխալները։

---

Այս հոդվածն օգտակա՞ր էր։