OpenAI
Boggan si mashiin ah ayaa loo turjumay. Eeg maqaalka asalka ah ee Ingiriisiga ahaa.

Waa maxay token-yadu, sideese loo tiriyaa?

La cusboonaysiiyay: 8 days ago

Waa maxay token-yadu?

Token-yadu waa unugyada aasaasiga ah ee qoraalka ee noocyada OpenAI ay farsameeyaan. Waxay noqon karaan hal xaraf oo keliya ama eray dhan, iyadoo ku xiran luqadda iyo macnaha guud. Meelaha bannaan, calaamadaha xarakaynta, iyo qaybaha erayada dhammaantood waxay ka qayb qaataan tirinta token-yada. Sidan ayuu API-gu gudaha ugu kala qaybiyaa qoraalkaaga ka hor inta uusan jawaab soo saarin.

Xeerar guud oo waxtar leh oo Ingiriisiga ah:

  • 1 token ≈ 4 xaraf

  • 1 token ≈ ¾ eray

  • 100 token ≈ 75 eray

  • 1–2 jumladood ≈ 30 token

  • 1 faqradood ≈ 100 token

  • ~1,500 eray ≈ 2,048 token

Yaryareynta token-ka way ku kala duwan tahay nooca iyo encoding-ka. Adeegso qalabka Tokenizer ama tiktoken.encoding_for_model(model) si aad u hesho tirada saxda ah ee nooca aad bartilmaameedsanayso.

Tusaalooyin

Halkan waxaa ku yaal tusaalooyin qoraal oo nolosha dhabta ah ah iyo tiradooda token-yada ee qiyaasta ah:

  • Oraahda Wayne Gretzky ee “Waxaad seegtaa 100% rasaasta aadan tuurin” = 11 token

  • Axdiga OpenAI = 476 token

  • Bayaanka Madax-bannaanida Mareykanka = 1,695 token

Sida loo xisaabiyo tirada token-yada

Markaad qoraal u dirto API-ga:

  1. Qoraalka waxaa loo kala jebiyaa token-yo.

  2. Noocu wuxuu farsameeyaa token-yadan.

  3. Jawaabta waxaa loo soo saaraa taxane token-yo ah, ka dibna dib ayaa loogu beddelaa qoraal.

Isticmaalka token-yada waxaa lagu raacaa dhowr qaybood:

  • Token-yada gelinta – token-yada ku jira codsigaaga.

  • Token-yada soo-saarka – token-yada lagu soo saaro jawaabta.

  • Token-yada kaydsan – token-yo dib looga isticmaalo taariikhda wada-hadalka (badanaa lagu dallaco qiime dhimman).

  • Token-yada caqliyeynta – noocyada horumarsan qaarkood, “tallaabooyin fikir” dheeraad ah ayaa gudaha lagu daraa ka hor inta aan la soo saarin natiijada ugu dambeysa.

Tiradan waxay ka muuqataa metadata-ga jawaabtaada API-ga, waxaana loo adeegsadaa dallacaadda iyo dabagalka isticmaalka.

Si aad u sii sahamiso yaryareynta token-ka, waxaad adeegsan kartaa qalabkayaga Tokenizer ee is-dhexgalka leh, kaas oo kuu oggolaanaya inaad xisaabiso tirada token-yada oo aad aragto sida qoraalka loogu kala jebiyo token-yo.

Haddii kale, haddii aad rabto inaad qoraalka barnaamij ahaan u yaryareyso token-ka, adeegso Tiktoken oo ah tokenizer BPE degdeg ah oo si gaar ah loogu isticmaalo noocyada OpenAI.

Xaddidaadaha token-ka

Nooc kasta wuxuu leeyahay xadka ugu badan ee token-yada la isku daray (gelin + soo-saar). Noocyada hadda ee awoodda sare leh waxay taageeraan ilaa boqollaal kun oo token oo ku jira macnaha guud, inkastoo xaddidaadaha la adeegsan karo ay ku kala duwanaan karaan nooca iyo heerka isticmaalkaaga.

Haddii aad dhaafto xadka, waxaad:

  • Gaabin ama dib u qeex weydiimaha.

  • Qoraalka weyn u kala jebin qaybo yaryar.

  • Soo koob ama horay u farsamee gelinnada ka hor intaadan dirin.

Qiimaynta token-ka

Isticmaalka API-ga waxaa lagu qiimeeyaa token kasta, wuxuuna ku kala duwan yahay nooca iyo in token-yadu yihiin gelin, soo-saar, ama kaydsan. Ka eeg bogga qiimaha ee OpenAI qiimayaasha hadda jira. Noocyada caqliyeynta qaarkood waxay gudaha ku isticmaali karaan token-yo badan, balse waxay ujeedaan inay hagaajiyaan hufnaanta iyagoo yareynaya tirada token-yada loo baahan yahay hawl la dhammeeyay kasta.

Sahaminta token-yada

API-gu wuxuu erayada ula dhaqmaa iyadoo la eegayo macnahooda guud ee xogta corpus-ka. Noocyadu waxay qaataan weydiinta, gelinta u beddelaan liis token-yo ah, farsameeyaan weydiinta, kadibna token-yada la saadaaliyay dib ugu beddelaan erayada aan ku aragno jawaabta.

Wax noo muuqan kara laba eray oo isku mid ah waxaa laga yaabaa in loo soo saaro token-yo kala duwan iyadoo ku xiran sida ay ugu qaabaysan yihiin qoraalka. Tixgeli sida API-gu u soo saaro qiimayaasha token-ka ee erayga ‘red’ iyadoo lagu saleynayo macnihiisa guud ee qoraalka:

Sentence split into color-coded tokens with Text selected over Token IDs
Token ID output as a list of integers with the Token IDs tab selected

Tusaalaha koowaad ee kore, token-ka “2266” ee ‘ red’ wuxuu ka kooban yahay meel bannaan oo ka dambeysa (Xusuusnow, kuwani waa ID-yada token tusaale ah oo ujeeddooyin muujin ah).

Sentence split into color-coded token blocks: My favorite color is Red.
Tokenizer output with Token IDs selected and a list of numeric token IDs

Token-ka “2296” ee ‘ Red’ (oo leh meel bannaan oo ka horreysa kuna bilaabma xaraf weyn) wuu ka duwan yahay token-ka “2266” ee ‘ red’ oo leh xaraf yar.

Tokenizer example splitting “Red is my favorite color.” into color-coded tokens
Tokenizer output with Token IDs selected and a list of token ID numbers

Marka ‘Red’ loo isticmaalo bilowga jumlad, token-ka la soo saaray kuma jiro meel bannaan oo ka horreysa. Token-ka “7738” wuu ka duwan yahay labadii tusaale ee hore ee erayga.

Indha-indhayn:

Markasta oo token-ku u badan yahay/u soo noqnoqdo, lambarka token-ka ee loo qoondeeyo wuu hooseeyaa:

  • Token-ka loo soo saaray dhibicdu waa isku mid (“13”) dhammaan 3-da jumladood. Tani waa sababtoo ah, macne ahaan, dhibicda si aad isugu eg ayaa loogu adeegsadaa dhammaan xogta corpus-ka.

  • Token-ka loo soo saaray ‘red’ wuu kala duwanaadaa iyadoo ku xiran meesha uu kaga jiro jumladda:

    • Xaraf yar bartamaha jumlad: ‘ red’ - (token: “2266”)

    • Xaraf weyn bartamaha jumlad: ‘ Red’ - (token: “2297”)

    • Xaraf weyn bilowga jumlad: ‘Red’ - (token: “7738”)

Maqaalkani faa'iido ma kuu lahaa?