OpenAI
Ukurasa huu ulitafsiriwa na mashine. Tazama makala asili ya Kiingereza.

Tokeni ni nini na jinsi ya kuzihesabu?

Ilisasishwa: 14 days ago

Tokeni ni nini?

Tokeni ni vipande vya msingi vya maandishi ambavyo miundo ya OpenAI huchakata. Zinaweza kuwa fupi kama herufi moja au ndefu kama neno kamili, kulingana na lugha na muktadha. Nafasi, alama za uakifishaji na sehemu za maneno zote huchangia hesabu za tokeni. Hivi ndivyo API hugawanya maandishi yako ndani kwa ndani kabla ya kuzalisha jibu.

Kanuni muhimu za kukadiria kwa Kiingereza:

  • Tokeni 1 ≈ herufi 4

  • Tokeni 1 ≈ ¾ ya neno

  • Tokeni 100 ≈ maneno 75

  • Sentensi 1–2 ≈ tokeni 30

  • Aya 1 ≈ tokeni 100

  • Maneno ~1,500 ≈ tokeni 2,048

Ugawaji wa tokeni hutofautiana kulingana na muundo na usimbaji. Tumia zana ya Tokenizer au tiktoken.encoding_for_model(model) kupata hesabu sahihi kwa muundo unaolenga.

Mifano

Hapa kuna mifano halisi ya maandishi pamoja na makadirio ya hesabu zao za tokeni:

  • Nukuu ya Wayne Gretzky “You miss 100% of the shots you don’t take” = tokeni 11

  • Mkataba wa OpenAI = tokeni 476

  • Tamko la Uhuru la Marekani = tokeni 1,695

Jinsi hesabu za tokeni zinavyokokotolewa

Unapotuma maandishi kwa API:

  1. Maandishi hugawanywa kuwa tokeni.

  2. Muundo huchakata tokeni hizi.

  3. Jibu huzalishwa kama mfululizo wa tokeni, kisha hubadilishwa kurudi kuwa maandishi.

Matumizi ya tokeni hufuatiliwa katika kategoria kadhaa:

  • Tokeni za ingizo – tokeni zilizo katika ombi lako.

  • Tokeni za pato – tokeni zinazozalishwa katika jibu.

  • Tokeni zilizohifadhiwa akibani – tokeni zinazotumiwa tena katika historia ya mazungumzo (mara nyingi hutozwa kwa kiwango kilichopunguzwa).

  • Tokeni za uwazaji – katika baadhi ya miundo ya hali ya juu, “hatua za kufikiri” za ziada hujumuishwa ndani kwa ndani kabla ya kutoa pato la mwisho.

Hesabu hizi huonekana katika metadata ya jibu lako la API na hutumika kwa utozaji na ufuatiliaji wa matumizi.

Ili kuchunguza zaidi ugawaji wa tokeni, unaweza kutumia zana yetu shirikishi ya Tokenizer, inayokuruhusu kukokotoa idadi ya tokeni na kuona jinsi maandishi yanavyogawanywa kuwa tokeni.

Vinginevyo, ikiwa ungependa gawa tokeni za maandishi kwa kutumia programu, tumia Tiktoken kama kigawaji tokeni cha haraka cha BPE kinachotumiwa hasa kwa miundo ya OpenAI.

Vikomo vya Tokeni

Kila muundo una kikomo cha juu cha tokeni zilizojumuishwa (ingizo + pato). Miundo ya sasa yenye uwezo mkubwa inasaidia hadi mamia ya maelfu ya tokeni katika muktadha, ingawa vikomo vya vitendo vinaweza kutofautiana kulingana na toleo la muundo na kiwango chako cha matumizi.

Ukizidi kikomo, unaweza:

  • Kufupisha au kuandika upya vidokezo.

  • Kugawanya maandishi makubwa katika sehemu ndogo.

  • Kufupisha au kuchakata mapema maingizo kabla ya kuyatuma.

Bei ya Tokeni

Matumizi ya API hutozwa kwa kila tokeni, yakitofautiana kulingana na muundo na kama tokeni ni za ingizo, pato au zilizohifadhiwa akibani. Tazama ukurasa wa bei wa OpenAI kwa viwango vya sasa. Baadhi ya miundo ya uwazaji inaweza kutumia tokeni zaidi ndani kwa ndani, lakini inalenga kuboresha ufanisi kwa kupunguza idadi ya tokeni zinazohitajika kwa kila kazi iliyokamilishwa.

Kuchunguza tokeni

API huchukulia maneno kulingana na muktadha wake katika data ya mkusanyiko. Miundo huchukua dokeza, hubadilisha ingizo kuwa orodha ya tokeni, huchakata dokeza, na hubadilisha tokeni zilizotabiriwa kurudi kuwa maneno tunayoyaona katika jibu.

Kinachoonekana kwetu kama maneno mawili yanayofanana kinaweza kuzalishwa kuwa tokeni tofauti kulingana na jinsi yalivyopangwa ndani ya maandishi. Fikiria jinsi API huzalisha thamani za tokeni kwa neno ‘red’ kulingana na muktadha wake ndani ya maandishi:

Sentence split into color-coded tokens with Text selected over Token IDs
Token ID output as a list of integers with the Token IDs tab selected

Katika mfano wa kwanza hapo juu, tokeni “2266” ya ‘ red’ inajumuisha nafasi inayofuata (Kumbuka, hizi ni vitambulisho vya tokeni vya mfano kwa madhumuni ya maonyesho).

Sentence split into color-coded token blocks: My favorite color is Red.
Tokenizer output with Token IDs selected and a list of numeric token IDs

Tokeni “2296” ya ‘ Red’ (yenye nafasi ya mwanzo na inayoanza kwa herufi kubwa) ni tofauti na tokeni “2266” ya ‘ red’ yenye herufi ndogo.

Tokenizer example splitting “Red is my favorite color.” into color-coded tokens
Tokenizer output with Token IDs selected and a list of token ID numbers

‘Red’ inapotumiwa mwanzoni mwa sentensi, tokeni inayozalishwa haijumuishi nafasi ya mwanzo. Tokeni “7738” ni tofauti na mifano miwili iliyotangulia ya neno hilo.

Uchunguzi:

Kadiri tokeni inavyowezekana zaidi/kutokea mara nyingi zaidi, ndivyo nambari ya tokeni inayokabidhiwa kwake inavyokuwa ya chini:

  • Tokeni inayozalishwa kwa nukta ni ileile (“13”) katika sentensi zote 3. Hii ni kwa sababu, kimuktadha, nukta hutumiwa kwa namna inayofanana sana katika data yote ya mkusanyiko.

  • Tokeni inayozalishwa kwa ‘red’ hutofautiana kulingana na mahali ilipo ndani ya sentensi:

    • Herufi ndogo katikati ya sentensi: ‘ red’ - (tokeni: “2266”)

    • Herufi kubwa katikati ya sentensi: ‘ Red’ - (tokeni: “2297”)

    • Herufi kubwa mwanzoni mwa sentensi: ‘Red’ - (tokeni: “7738”)

Je, makala haya yamekusaidia?