OpenAI
Kaca iki diterjemahake nganggo mesin. Deleng artikel asli basa Inggris.

Apa iku token lan carane ngetung?‍

Understand how OpenAI models count tokens and how token usage affects limits and API pricing.

Pembaruan: 23 hours ago

Apa kuwi token?

Token minangka unsur dhasar teks sing diolah model OpenAI. Dawané bisa mung sakarakter utawa nganti satembung wutuh, gumantung saka basa lan kontèks. Spasi, tandha wacan, lan pérangan tembung kabèh mèlu diétung ing cacah token. Kaya mangkéné carané API mérang teks sampeyan sacara internal sadurungé ngasilaké tanggapan.

Pathokan praktis kanggo basa Inggris:

  • 1 token ≈ 4 karakter

  • 1 token ≈ ¾ tembung

  • 100 token ≈ 75 tembung

  • 1–2 ukara ≈ 30 token

  • 1 paragraf ≈ 100 token

  • ~1.500 tembung ≈ 2.048 token

Tokenisasi béda-béda manut model lan enkoding. Gunakna piranti Tokenizer utawa tiktoken.encoding_for_model(model) kanggo éntuk cacah sing pas kanggo model sing dituju.

Conto

Iki sawetara conto teks saka donya nyata lan kira-kira cacah tokené:

  • Kutipané Wayne Gretzky, “Kowé bakal gagal ing 100% tembakan sing ora koklakoni” = 11 token

  • Piagam OpenAI = 476 token

  • Pranyatan Kamardikan AS = 1.695 token

Carané cacah token diétung

Nalika sampeyan ngirim teks menyang API:

  1. Teks dipérang dadi token.

  2. Model ngolah token-token iki.

  3. Tanggapan diasilaké minangka urutan token, banjur diowahi bali dadi teks.

Panggunaan token dilacak ing sawetara kategori:

  • Token input – token ing panjaluk sampeyan.

  • Token output – token sing diasilaké ing tanggapan.

  • Token cache – token saka riwayat pacelathon sing digunakaké manèh (asring diregani luwih murah).

  • Token nalar – ing sawetara model canggih, “langkah mikir” tambahan dilebokaké sacara internal sadurungé ngasilaké output pungkasan.

Cacah iki katon ing metadata tanggapan API lan digunakaké kanggo tagihan lan pelacakan panggunaan.

Kanggo njajahi tokenisasi luwih jero, sampeyan bisa nganggo piranti Tokenizer interaktif kanggo ngétung cacah token lan ndeleng carané teks dipérang dadi token.

Utawa, yèn péngin ngowahi teks dadi token nganggo program, gunakna Tiktoken, yaiku tokenizer BPE sing cepet lan mligi digunakaké kanggo model OpenAI.

Wates Token

Saben model nduwèni wates maksimal gabungan token (input + output). Model kapasitas gedhé saiki ndhukung nganti atusan èwu token ing kontèks, sanajan wates praktisé bisa béda manut vèrsi model lan tataran panggunaan sampeyan.

Yèn ngluwihi wates, sampeyan bisa:

  • Nyepetaké utawa ngroncé ulang prompt.

  • Mérang teks gedhé dadi pérangan sing luwih cilik.

  • Ngringkes utawa ngolah input luwih dhisik sadurungé dikirim.

Rega Token

Panggunaan API diregani saben token, gumantung saka model lan apa token kasebut input, output, utawa cache. Delengen kaca rega OpenAI kanggo tarif saiki. Sawetara model nalar bisa nganggo luwih akèh token sacara internal, nanging ngupaya ningkataké efisiènsi kanthi nyuda cacah token sing dibutuhaké saben tugas rampung.

Token ora distandaraké ing kabèh model utawa panyedhiya AI. Model sing béda bisa ngolah utawa ngasilaké teks sing padha nganggo cacah token sing béda, mula rega saben yuta token sing diiklanaké luwih murah durung mesthi ateges total biayané luwih murah.

Dawané tanggapan sing katon uga ora nyritakaké kabèh. Sawetara model nganggo token nalar sacara internal sadurungé ngasilaké wangsulan, mula tanggapan sing katon luwih dawa durung mesthi ateges model nganggo total token luwih akèh.

Nalika mbandhingaké model, gatèkna total token sing dibutuhaké lan biaya saben asil sing kasil digayuh. Tolok ukur bisa dadi titik wiwitan sing migunani, nanging nguji model nganggo kasus panggunaan sampeyan dhéwé minangka cara paling apik kanggo mangertèni biaya lan kinerja nyatané.

Njajahi token

API ngolah tembung manut kontèksé ing data korpus. Model nampa prompt, ngowahi input dadi dhaptar token, ngolah prompt, banjur ngowahi token sing dipredhiksi bali dadi tembung sing katon ing tanggapan.

Rong tembung sing katon padha persis bisa diasilaké dadi token sing béda, gumantung saka susunané ing teks. Gatèkna carané API ngasilaké angka token kanggo tembung ‘red’ adhedhasar kontèksé ing teks:

Sentence split into color-coded tokens with Text selected over Token IDs
Token ID output as a list of integers with the Token IDs tab selected

Ing conto kapisan ing ndhuwur, token “2266” kanggo ‘ red’ ngemot spasi ing mburi (Cathetan: iki mung conto ID token kanggo tujuan demonstrasi).

Sentence split into color-coded token blocks: My favorite color is Red.
Tokenizer output with Token IDs selected and a list of numeric token IDs

Token “2296” kanggo ‘ Red’ (nganggo spasi ing ngarep lan diwiwiti aksara gedhé) béda karo token “2266” kanggo ‘ red’ sing nganggo aksara cilik.

Tokenizer example splitting “Red is my favorite color.” into color-coded tokens
Tokenizer output with Token IDs selected and a list of token ID numbers

Nalika ‘Red’ digunakaké ing wiwitan ukara, token sing diasilaké ora ngemot spasi ing ngarep. Token “7738” béda karo rong conto tembung sadurungé.

Asil pengamatan:

Saya gedhé kamungkinan utawa frekuènsi token, saya cilik nomer token sing diwènèhaké:

  • Token sing diasilaké kanggo tandha titik padha (“13”) ing kabèh 3 ukara. Sebabé, ing kontèks data korpus, tandha titik digunakaké kanthi cara sing mèh padha.

  • Token sing diasilaké kanggo ‘red’ béda-béda gumantung saka panggonané ing ukara:

    • Aksara cilik ing tengah ukara: ‘ red’ - (token: “2266”)

    • Aksara gedhé ing tengah ukara: ‘ Red’ - (token: “2297”)

    • Aksara gedhé ing wiwitan ukara: ‘Red’ - (token: “7738”)

Apa artikel iki migunani kanggo sampeyan?