OpenAI
Այս էջը թարգմանվել է մեքենայական թարգմանությամբ։ Դիտել անգլերեն բնօրինակ հոդվածը.

Ի՞նչ են թոքենները և ինչպես հաշվել դրանք:

Թարմացվել է՝ yesterday

Ի՞նչ են թոքենները։

Թոքենները տեքստի այն կառուցվածքային միավորներն են, որոնք մշակում են OpenAI-ի մոդելները։ Կախված լեզվից և համատեքստից՝ դրանք կարող են լինել մեկ նիշի չափ կարճ կամ ամբողջական բառի չափ երկար։ Բացատները, կետադրական նշանները և բառերի մասերը նույնպես ներառվում են թոքենների քանակում։ Այսպես է API-ն ներքին մակարդակում բաժանում ձեր տեքստը՝ նախքան պատասխան ստեղծելը։

Օգտակար մոտավոր կանոններ անգլերենի համար՝

  • 1 թոքեն ≈ 4 նիշ

  • 1 թոքեն ≈ բառի ¾-ը

  • 100 թոքեն ≈ 75 բառ

  • 1–2 նախադասություն ≈ 30 թոքեն

  • 1 պարբերություն ≈ 100 թոքեն

  • ~1,500 բառ ≈ 2,048 թոքեն

Թոքենիզացիան տարբերվում է՝ կախված մոդելից և կոդավորումից։ Ձեր նպատակային մոդելի համար ճշգրիտ քանակն ստանալու նպատակով օգտագործեք Թոքենիզատոր գործիքը կամ tiktoken.encoding_for_model(model)։

Օրինակներ

Ահա իրական տեքստերի մի քանի նմուշ՝ դրանց թոքենների մոտավոր քանակով․

  • Ուեյն Գրետցկիի «Դուք վրիպում եք այն հարվածների 100%-ը, որոնք չեք կատարում» մեջբերումը = 11 թոքեն

  • OpenAI-ի կանոնադրությունը = 476 թոքեն

  • ԱՄՆ Անկախության հռչակագիրը = 1,695 թոքեն

Ինչպես է հաշվարկվում թոքենների քանակը

Երբ տեքստ եք ուղարկում API-ին՝

  1. Տեքստը բաժանվում է թոքենների։

  2. Մոդելը մշակում է այդ թոքենները։

  3. Պատասխանը ստեղծվում է որպես թոքենների հաջորդականություն, ապա կրկին վերածվում տեքստի։

Թոքենների օգտագործումը հաշվառվում է մի քանի կատեգորիայով՝

  • Մուտքային թոքեններ — ձեր հարցման թոքենները։

  • Ելքային թոքեններ — պատասխանում ստեղծված թոքենները։

  • Քեշավորված թոքեններ — զրույցի պատմությունից կրկին օգտագործված թոքենները (հաճախ հաշվարկվում են նվազեցված սակագնով)։

  • Դատողության թոքեններ — որոշ առաջադեմ մոդելներում վերջնական արդյունքը ստեղծելուց առաջ ներքին մակարդակում ներառվող լրացուցիչ «մտածողության քայլերը»։

Այս քանակները նշվում են API-ի պատասխանի մետատվյալներում և օգտագործվում վճարների ու օգտագործման հաշվառման համար։

Թոքենիզացիան ավելի մանրամասն ուսումնասիրելու համար կարող եք օգտվել մեր ինտերակտիվ Թոքենիզատոր գործիքից, որը թույլ է տալիս հաշվել թոքենները և տեսնել, թե տեքստն ինչպես է բաժանվում դրանց։

Կամ, եթե ցանկանում եք տեքստը ծրագրային եղանակով թոքենիզացնել, օգտագործեք Tiktoken-ը՝ արագ BPE թոքենիզատոր, որը հատուկ կիրառվում է OpenAI-ի մոդելների համար։

Թոքենների սահմանաչափեր

Յուրաքանչյուր մոդել ունի մուտքային և ելքային թոքենների ընդհանուր առավելագույն սահմանաչափ։ Ներկայիս մեծ հզորությամբ մոդելները համատեքստում աջակցում են մինչև հարյուր հազարավոր թոքեններ, սակայն գործնական սահմանաչափերը կարող են տարբերվել՝ կախված մոդելի տարբերակից և ձեր օգտագործման մակարդակից։

Եթե գերազանցեք սահմանաչափը, կարող եք՝

  • Կրճատել կամ վերաձևակերպել հարցումները։

  • Մեծ տեքստը բաժանել փոքր հատվածների։

  • Մուտքային տվյալներն ուղարկելուց առաջ ամփոփել կամ նախապես մշակել։

Թոքենների գնագոյացում

API-ի օգտագործման գինը հաշվարկվում է ըստ թոքենների և տարբերվում՝ կախված մոդելից ու թոքենների տեսակից՝ մուտքային, ելքային կամ քեշավորված։ Ընթացիկ սակագները տեսեք OpenAI-ի գնագոյացման էջում։ Դատողության որոշ մոդելներ կարող են ներքին մակարդակում ավելի շատ թոքեններ օգտագործել, սակայն ձգտում են բարձրացնել արդյունավետությունը՝ նվազեցնելով յուրաքանչյուր ավարտված առաջադրանքի համար անհրաժեշտ թոքենների քանակը։

Թոքենների ուսումնասիրություն

API-ն բառերը մշակում է՝ հաշվի առնելով կորպուսի տվյալներում դրանց համատեքստը։ Մոդելները ստանում են հարցումը, մուտքային տվյալները վերածում թոքենների ցանկի, մշակում հարցումը և կանխատեսված թոքենները կրկին վերածում պատասխանում տեսանելի բառերի։

Մեզ միանման թվացող երկու բառերը կարող են ներկայացվել տարբեր թոքեններով՝ կախված տեքստում դրանց կառուցվածքից։ Դիտարկենք, թե API-ն ինչպես է ստեղծում «red» բառի թոքենային արժեքները՝ ըստ տեքստում դրա համատեքստի․

Sentence split into color-coded tokens with Text selected over Token IDs
Token ID output as a list of integers with the Token IDs tab selected

Վերևի առաջին օրինակում ‘ red’ գրության «2266» թոքենը ներառում է վերջում բացատ (նշված թոքենների ID-ները միայն ցուցադրական օրինակներ են)։

Sentence split into color-coded token blocks: My favorite color is Red.
Tokenizer output with Token IDs selected and a list of numeric token IDs

‘ Red’ գրության «2296» թոքենը (առջևում բացատով և սկզբում մեծատառով) տարբերվում է փոքրատառով ‘ red’ գրության «2266» թոքենից։

Tokenizer example splitting “Red is my favorite color.” into color-coded tokens
Tokenizer output with Token IDs selected and a list of token ID numbers

Երբ ‘Red’-ը գործածվում է նախադասության սկզբում, ստեղծված թոքենն առջևում բացատ չի ներառում։ «7738» թոքենը տարբերվում է բառի նախորդ երկու օրինակներից։

Դիտարկումներ՝

Որքան հավանական կամ հաճախակի է թոքենը, այնքան փոքր թիվ է նրան հատկացվում․

  • Վերջակետի համար ստեղծված թոքենը նույնն է («13») բոլոր 3 նախադասություններում։ Պատճառն այն է, որ կորպուսի տվյալներում վերջակետը համատեքստային առումով գրեթե նույն կերպ է գործածվում։

  • ‘red’-ի համար ստեղծված թոքենը տարբերվում է՝ կախված նախադասության մեջ դրա դիրքից․

    • Փոքրատառով՝ նախադասության մեջտեղում․ ‘ red’ — (թոքեն՝ «2266»)

    • Մեծատառով՝ նախադասության մեջտեղում․ ‘ Red’ — (թոքեն՝ «2297»)

    • Մեծատառով՝ նախադասության սկզբում․ ‘Red’ — (թոքեն՝ «7738»)

Այս հոդվածն օգտակա՞ր էր։