OpenAI
Այս էջը թարգմանվել է մեքենայական թարգմանությամբ։ Դիտել անգլերեն բնօրինակ հոդվածը.

Ի՞նչ են թոքենները և ինչպես հաշվել դրանք:

Թարմացվել է՝ 8 days ago

Ի՞նչ են թոքենները։

Թոքենները տեքստի այն հիմնական միավորներն են, որոնք մշակում են OpenAI-ի մոդելները։ Դրանք կարող են լինել մեկ նիշի չափ կարճ կամ ամբողջական բառի չափ երկար՝ կախված լեզվից և համատեքստից։ Բացատները, կետադրությունը և բառերի մասերը նույնպես ազդում են թոքենների քանակի վրա։ Այսպես է API-ն ներքին կերպով հատվածավորում ձեր տեքստը՝ նախքան պատասխան ստեղծելը։

Օգտակար մոտավոր կանոններ անգլերենի համար.

  • 1 թոքեն ≈ 4 նիշ

  • 1 թոքեն ≈ բառի ¾-ը

  • 100 թոքեն ≈ 75 բառ

  • 1–2 նախադասություն ≈ 30 թոքեն

  • 1 պարբերություն ≈ 100 թոքեն

  • ~1,500 բառ ≈ 2,048 թոքեն

Թոքենիզացիան տարբերվում է ըստ մոդելի և կոդավորման։ Օգտագործեք Tokenizer գործիքը կամ tiktoken.encoding_for_model(model)՝ ձեր թիրախային մոդելի ճշգրիտ քանակը ստանալու համար։

Օրինակներ

Ահա իրական տեքստերի մի քանի օրինակ՝ դրանց մոտավոր թոքենների քանակով.

  • Ուեյն Գրեցկու «You miss 100% of the shots you don’t take» մեջբերումը = 11 թոքեն

  • OpenAI-ի կանոնադրությունը = 476 թոքեն

  • ԱՄՆ Անկախության հռչակագիրը = 1,695 թոքեն

Ինչպես են հաշվարկվում թոքենների քանակները

Երբ տեքստ եք ուղարկում API-ին.

  1. Տեքստը բաժանվում է թոքենների։

  2. Մոդելը մշակում է այդ թոքենները։

  3. Պատասխանը ստեղծվում է որպես թոքենների հաջորդականություն, ապա կրկին վերածվում է տեքստի։

Թոքենների օգտագործումը հետևվում է մի քանի կատեգորիաներով.

  • Մուտքային թոքեններ – ձեր հարցման թոքենները։

  • Ելքային թոքեններ – պատասխանում ստեղծված թոքենները։

  • Քեշավորված թոքեններ – զրույցի պատմության մեջ կրկին օգտագործված թոքեններ (հաճախ հաշվարկվում են նվազեցված սակագնով)։

  • Հիմնավորման թոքեններ – որոշ առաջադեմ մոդելներում լրացուցիչ «մտածողության քայլեր» են ներքին կերպով ներառվում՝ նախքան վերջնական ելքը ստեղծելը։

Այս քանակները երևում են ձեր API պատասխանի մետատվյալներում և օգտագործվում են վճարարկման ու օգտագործման հետևման համար։

Թոքենիզացիան ավելի խորությամբ ուսումնասիրելու համար կարող եք օգտագործել մեր ինտերակտիվ Tokenizer գործիքը, որը թույլ է տալիս հաշվարկել թոքենների քանակը և տեսնել, թե ինչպես է տեքստը բաժանվում թոքենների։

Այլապես, եթե ցանկանում եք տեքստը թոքենիզացնել ծրագրային եղանակով, օգտագործեք Tiktoken-ը՝ որպես արագ BPE թոքենիզատոր, որը հատուկ օգտագործվում է OpenAI-ի մոդելների համար։

Թոքենների սահմանաչափեր

Յուրաքանչյուր մոդել ունի թոքենների առավելագույն համակցված սահմանաչափ (մուտք + ելք)։ Ներկայիս բարձր հզորության մոդելները համատեքստում աջակցում են մինչև հարյուր հազարավոր թոքեններ, թեև գործնական սահմանաչափերը կարող են տարբեր լինել՝ կախված մոդելի տարբերակից և ձեր օգտագործման մակարդակից։

Եթե գերազանցեք սահմանաչափը, կարող եք՝

  • Կրճատել կամ վերաձևակերպել հարցումները։

  • Մեծ տեքստը բաժանել ավելի փոքր հատվածների։

  • Ամփոփել կամ նախապես մշակել մուտքերը՝ դրանք ուղարկելուց առաջ։

Թոքենների գնագոյացում

API-ի օգտագործման գինը սահմանվում է մեկ թոքենի համար և տարբերվում է ըստ մոդելի, ինչպես նաև՝ թոքենները մուտքային, ելքային թե քեշավորված լինելուց։ Ընթացիկ սակագների համար տեսեք OpenAI-ի գնագոյացման էջը։ Որոշ հիմնավորման մոդելներ կարող են ներքին կերպով ավելի շատ թոքեններ օգտագործել, սակայն նպատակ ունեն բարելավել արդյունավետությունը՝ նվազեցնելով յուրաքանչյուր ավարտված առաջադրանքի համար անհրաժեշտ թոքենների քանակը։

Թոքենների ուսումնասիրություն

API-ն բառերը դիտարկում է ըստ կորպուսի տվյալներում դրանց համատեքստի։ Մոդելները վերցնում են հարցումը, մուտքը վերածում թոքենների ցանկի, մշակում հարցումը և կանխատեսված թոքենները կրկին վերածում այն բառերի, որոնք մենք տեսնում ենք պատասխանում։

Այն, ինչ մեզ կարող է թվալ որպես երկու նույնական բառ, կարող է ստեղծվել որպես տարբեր թոքեններ՝ կախված տեքստում դրանց կառուցվածքից։ Դիտարկեք, թե ինչպես է API-ն ստեղծում թոքենային արժեքներ «red» բառի համար՝ ելնելով տեքստում դրա համատեքստից.

Sentence split into color-coded tokens with Text selected over Token IDs
Token ID output as a list of integers with the Token IDs tab selected

Վերևի առաջին օրինակում « red»-ի համար «2266» թոքենը ներառում է վերջում բացատ (Նշում՝ սրանք օրինակային թոքենների ID-ներ են ցուցադրական նպատակներով)։

Sentence split into color-coded token blocks: My favorite color is Red.
Tokenizer output with Token IDs selected and a list of numeric token IDs

« Red»-ի համար «2296» թոքենը (սկզբում բացատով և մեծատառով սկսվող) տարբերվում է փոքրատառով « red»-ի համար «2266» թոքենից։

Tokenizer example splitting “Red is my favorite color.” into color-coded tokens
Tokenizer output with Token IDs selected and a list of token ID numbers

Երբ «Red»-ն օգտագործվում է նախադասության սկզբում, ստեղծված թոքենը սկզբում բացատ չի ներառում։ «7738» թոքենը տարբերվում է բառի նախորդ երկու օրինակներից։

Դիտարկումներ.

Որքան ավելի հավանական/հաճախակի է թոքենը, այնքան ավելի փոքր թոքենի համար է նրան վերագրվում.

  • Վերջակետի համար ստեղծված թոքենը նույնն է («13») բոլոր 3 նախադասություններում։ Դա այն պատճառով է, որ համատեքստային առումով վերջակետը կորպուսի տվյալներում բավականին նման ձևով է օգտագործվում։

  • «red»-ի համար ստեղծված թոքենը տարբերվում է՝ կախված նախադասության մեջ դրա դիրքից.

    • Փոքրատառ՝ նախադասության մեջտեղում. « red» - (թոքեն՝ «2266»)

    • Մեծատառ՝ նախադասության մեջտեղում. « Red» - (թոքեն՝ «2297»)

    • Մեծատառ՝ նախադասության սկզբում. «Red» - (թոքեն՝ «7738»)

Այս հոդվածն օգտակա՞ր էր։