Apa kuwi token?
Token minangka unsur dhasar teks sing diolah model OpenAI. Dawané bisa mung sakarakter utawa nganti satembung wutuh, gumantung saka basa lan kontèks. Spasi, tandha wacan, lan pérangan tembung kabèh mèlu diétung ing cacah token. Kaya mangkéné carané API mérang teks sampeyan sacara internal sadurungé ngasilaké tanggapan.
Pathokan praktis kanggo basa Inggris:
1 token ≈ 4 karakter
1 token ≈ ¾ tembung
100 token ≈ 75 tembung
1–2 ukara ≈ 30 token
1 paragraf ≈ 100 token
~1.500 tembung ≈ 2.048 token
Tokenisasi béda-béda manut model lan enkoding. Gunakna piranti Tokenizer utawa tiktoken.encoding_for_model(model) kanggo éntuk cacah sing pas kanggo model sing dituju.
Conto
Iki sawetara conto teks saka donya nyata lan kira-kira cacah tokené:
Kutipané Wayne Gretzky, “Kowé bakal gagal ing 100% tembakan sing ora koklakoni” = 11 token
Piagam OpenAI = 476 token
Pranyatan Kamardikan AS = 1.695 token
Carané cacah token diétung
Nalika sampeyan ngirim teks menyang API:
Teks dipérang dadi token.
Model ngolah token-token iki.
Tanggapan diasilaké minangka urutan token, banjur diowahi bali dadi teks.
Panggunaan token dilacak ing sawetara kategori:
Token input – token ing panjaluk sampeyan.
Token output – token sing diasilaké ing tanggapan.
Token cache – token saka riwayat pacelathon sing digunakaké manèh (asring diregani luwih murah).
Token nalar – ing sawetara model canggih, “langkah mikir” tambahan dilebokaké sacara internal sadurungé ngasilaké output pungkasan.
Cacah iki katon ing metadata tanggapan API lan digunakaké kanggo tagihan lan pelacakan panggunaan.
Kanggo njajahi tokenisasi luwih jero, sampeyan bisa nganggo piranti Tokenizer interaktif kanggo ngétung cacah token lan ndeleng carané teks dipérang dadi token.
Utawa, yèn péngin ngowahi teks dadi token nganggo program, gunakna Tiktoken, yaiku tokenizer BPE sing cepet lan mligi digunakaké kanggo model OpenAI.
Wates Token
Saben model nduwèni wates maksimal gabungan token (input + output). Model kapasitas gedhé saiki ndhukung nganti atusan èwu token ing kontèks, sanajan wates praktisé bisa béda manut vèrsi model lan tataran panggunaan sampeyan.
Yèn ngluwihi wates, sampeyan bisa:
Nyepetaké utawa ngroncé ulang prompt.
Mérang teks gedhé dadi pérangan sing luwih cilik.
Ngringkes utawa ngolah input luwih dhisik sadurungé dikirim.
Rega Token
Panggunaan API diregani saben token, gumantung saka model lan apa token kasebut input, output, utawa cache. Delengen kaca rega OpenAI kanggo tarif saiki. Sawetara model nalar bisa nganggo luwih akèh token sacara internal, nanging ngupaya ningkataké efisiènsi kanthi nyuda cacah token sing dibutuhaké saben tugas rampung.
Token ora distandaraké ing kabèh model utawa panyedhiya AI. Model sing béda bisa ngolah utawa ngasilaké teks sing padha nganggo cacah token sing béda, mula rega saben yuta token sing diiklanaké luwih murah durung mesthi ateges total biayané luwih murah.
Dawané tanggapan sing katon uga ora nyritakaké kabèh. Sawetara model nganggo token nalar sacara internal sadurungé ngasilaké wangsulan, mula tanggapan sing katon luwih dawa durung mesthi ateges model nganggo total token luwih akèh.
Nalika mbandhingaké model, gatèkna total token sing dibutuhaké lan biaya saben asil sing kasil digayuh. Tolok ukur bisa dadi titik wiwitan sing migunani, nanging nguji model nganggo kasus panggunaan sampeyan dhéwé minangka cara paling apik kanggo mangertèni biaya lan kinerja nyatané.
Njajahi token
API ngolah tembung manut kontèksé ing data korpus. Model nampa prompt, ngowahi input dadi dhaptar token, ngolah prompt, banjur ngowahi token sing dipredhiksi bali dadi tembung sing katon ing tanggapan.
Rong tembung sing katon padha persis bisa diasilaké dadi token sing béda, gumantung saka susunané ing teks. Gatèkna carané API ngasilaké angka token kanggo tembung ‘red’ adhedhasar kontèksé ing teks:
Ing conto kapisan ing ndhuwur, token “2266” kanggo ‘ red’ ngemot spasi ing mburi (Cathetan: iki mung conto ID token kanggo tujuan demonstrasi).
Token “2296” kanggo ‘ Red’ (nganggo spasi ing ngarep lan diwiwiti aksara gedhé) béda karo token “2266” kanggo ‘ red’ sing nganggo aksara cilik.
Nalika ‘Red’ digunakaké ing wiwitan ukara, token sing diasilaké ora ngemot spasi ing ngarep. Token “7738” béda karo rong conto tembung sadurungé.
Asil pengamatan:
Saya gedhé kamungkinan utawa frekuènsi token, saya cilik nomer token sing diwènèhaké:
Token sing diasilaké kanggo tandha titik padha (“13”) ing kabèh 3 ukara. Sebabé, ing kontèks data korpus, tandha titik digunakaké kanthi cara sing mèh padha.
Token sing diasilaké kanggo ‘red’ béda-béda gumantung saka panggonané ing ukara:
Aksara cilik ing tengah ukara: ‘ red’ - (token: “2266”)
Aksara gedhé ing tengah ukara: ‘ Red’ - (token: “2297”)
Aksara gedhé ing wiwitan ukara: ‘Red’ - (token: “7738”)
