OpenAI
Boggan si mashiin ah ayaa loo turjumay. Eeg maqaalka asalka ah ee Ingiriisiga ahaa.

Sideen ku ogaan karaa inta token ee xarig yeelanayo ka hor intaanan isku dayin inaan embed gareeyo?

Xisaabinta/qiyaasidda token-yada ee embedding

La cusboonaysiiyay: 22 days ago

Ka hor intaadan xaraf-taxane u dirin embedding, waxaad qiyaasi kartaa inta token ee uu isticmaali doono adigoo adeegsanaya maktabadda token-qaybiyaha tiktoken ee OpenAI.

Tani si gaar ah ayay waxtar u leedahay, sababtoo ah noocyada embedding-ka (sida text-embedding-3-small) waxay leeyihiin xad token oo ugu sarreeya, kaas oo ay tahay inaadan dhaafin.

---

Sida Token-nada loogu Tiriyo Tiktoken

Waxaad isticmaali kartaa xirmada Python ee tiktoken si aad u xisaabiso tirada token-nada uu xaraf-taxane dhalin doono.

Halkan waxaa ku yaal muunad kooban oo koodh ah:

import tiktoken

def num_tokens_from_string(string: str, encoding_name: str) -> int:
"""Waxay soo celineysaa tirada token ee ku jirta xarig qoraal ah."""
encoding = tiktoken.get_encoding(encoding_name)
num_tokens = len(encoding.encode(string))
return num_tokens

# Tusaale adeegsiga
num_tokens = num_tokens_from_string("tiktoken is great!", "cl100k_base")
print(num_tokens)

Muhiim:

  • Noocyada embedding-ka ee jiilka saddexaad (tusaale, text-embedding-3-small ama text-embedding-3-large), waa inaad isticmaashaa habka codaynta "cl100k_base".

  • Noocyo kala duwan ayaa u baahan kara habab codayneed oo kala duwan—haddii aadan hubin, mar walba tixraac dukumentiyada nooca.

---

Sababta Tirinta Token-nadu Muhiim u Tahay

  • Haddii xaraf-taxanahaagu dhaafo cabbirka gelinta ugu badan ee nooca, codsigaaga API-gu wuu fashilmi doonaa.

  • Tirinta token-nada si sax ah ka hor waxay hubisaa habraacyo embedding oo fudud, waxayna ka hortagtaa khaladaadka inta lagu jiro farsamaynta.

---

Maqaalkani faa'iido ma kuu lahaa?