Ի՞նչ են թոքենները։
Թոքենները տեքստի այն հիմնական միավորներն են, որոնք մշակում են OpenAI-ի մոդելները։ Դրանք կարող են լինել մեկ նիշի չափ կարճ կամ ամբողջական բառի չափ երկար՝ կախված լեզվից և համատեքստից։ Բացատները, կետադրությունը և բառերի մասերը նույնպես ազդում են թոքենների քանակի վրա։ Այսպես է API-ն ներքին կերպով հատվածավորում ձեր տեքստը՝ նախքան պատասխան ստեղծելը։
Օգտակար մոտավոր կանոններ անգլերենի համար.
1 թոքեն ≈ 4 նիշ
1 թոքեն ≈ բառի ¾-ը
100 թոքեն ≈ 75 բառ
1–2 նախադասություն ≈ 30 թոքեն
1 պարբերություն ≈ 100 թոքեն
~1,500 բառ ≈ 2,048 թոքեն
Թոքենիզացիան տարբերվում է ըստ մոդելի և կոդավորման։ Օգտագործեք Tokenizer գործիքը կամ tiktoken.encoding_for_model(model)՝ ձեր թիրախային մոդելի ճշգրիտ քանակը ստանալու համար։
Օրինակներ
Ահա իրական տեքստերի մի քանի օրինակ՝ դրանց մոտավոր թոքենների քանակով.
Ուեյն Գրեցկու «You miss 100% of the shots you don’t take» մեջբերումը = 11 թոքեն
OpenAI-ի կանոնադրությունը = 476 թոքեն
ԱՄՆ Անկախության հռչակագիրը = 1,695 թոքեն
Ինչպես են հաշվարկվում թոքենների քանակները
Երբ տեքստ եք ուղարկում API-ին.
Տեքստը բաժանվում է թոքենների։
Մոդելը մշակում է այդ թոքենները։
Պատասխանը ստեղծվում է որպես թոքենների հաջորդականություն, ապա կրկին վերածվում է տեքստի։
Թոքենների օգտագործումը հետևվում է մի քանի կատեգորիաներով.
Մուտքային թոքեններ – ձեր հարցման թոքենները։
Ելքային թոքեններ – պատասխանում ստեղծված թոքենները։
Քեշավորված թոքեններ – զրույցի պատմության մեջ կրկին օգտագործված թոքեններ (հաճախ հաշվարկվում են նվազեցված սակագնով)։
Հիմնավորման թոքեններ – որոշ առաջադեմ մոդելներում լրացուցիչ «մտածողության քայլեր» են ներքին կերպով ներառվում՝ նախքան վերջնական ելքը ստեղծելը։
Այս քանակները երևում են ձեր API պատասխանի մետատվյալներում և օգտագործվում են վճարարկման ու օգտագործման հետևման համար։
Թոքենիզացիան ավելի խորությամբ ուսումնասիրելու համար կարող եք օգտագործել մեր ինտերակտիվ Tokenizer գործիքը, որը թույլ է տալիս հաշվարկել թոքենների քանակը և տեսնել, թե ինչպես է տեքստը բաժանվում թոքենների։
Այլապես, եթե ցանկանում եք տեքստը թոքենիզացնել ծրագրային եղանակով, օգտագործեք Tiktoken-ը՝ որպես արագ BPE թոքենիզատոր, որը հատուկ օգտագործվում է OpenAI-ի մոդելների համար։
Թոքենների սահմանաչափեր
Յուրաքանչյուր մոդել ունի թոքենների առավելագույն համակցված սահմանաչափ (մուտք + ելք)։ Ներկայիս բարձր հզորության մոդելները համատեքստում աջակցում են մինչև հարյուր հազարավոր թոքեններ, թեև գործնական սահմանաչափերը կարող են տարբեր լինել՝ կախված մոդելի տարբերակից և ձեր օգտագործման մակարդակից։
Եթե գերազանցեք սահմանաչափը, կարող եք՝
Կրճատել կամ վերաձևակերպել հարցումները։
Մեծ տեքստը բաժանել ավելի փոքր հատվածների։
Ամփոփել կամ նախապես մշակել մուտքերը՝ դրանք ուղարկելուց առաջ։
Թոքենների գնագոյացում
API-ի օգտագործման գինը սահմանվում է մեկ թոքենի համար և տարբերվում է ըստ մոդելի, ինչպես նաև՝ թոքենները մուտքային, ելքային թե քեշավորված լինելուց։ Ընթացիկ սակագների համար տեսեք OpenAI-ի գնագոյացման էջը։ Որոշ հիմնավորման մոդելներ կարող են ներքին կերպով ավելի շատ թոքեններ օգտագործել, սակայն նպատակ ունեն բարելավել արդյունավետությունը՝ նվազեցնելով յուրաքանչյուր ավարտված առաջադրանքի համար անհրաժեշտ թոքենների քանակը։
Թոքենների ուսումնասիրություն
API-ն բառերը դիտարկում է ըստ կորպուսի տվյալներում դրանց համատեքստի։ Մոդելները վերցնում են հարցումը, մուտքը վերածում թոքենների ցանկի, մշակում հարցումը և կանխատեսված թոքենները կրկին վերածում այն բառերի, որոնք մենք տեսնում ենք պատասխանում։
Այն, ինչ մեզ կարող է թվալ որպես երկու նույնական բառ, կարող է ստեղծվել որպես տարբեր թոքեններ՝ կախված տեքստում դրանց կառուցվածքից։ Դիտարկեք, թե ինչպես է API-ն ստեղծում թոքենային արժեքներ «red» բառի համար՝ ելնելով տեքստում դրա համատեքստից.
Վերևի առաջին օրինակում « red»-ի համար «2266» թոքենը ներառում է վերջում բացատ (Նշում՝ սրանք օրինակային թոքենների ID-ներ են ցուցադրական նպատակներով)։
« Red»-ի համար «2296» թոքենը (սկզբում բացատով և մեծատառով սկսվող) տարբերվում է փոքրատառով « red»-ի համար «2266» թոքենից։
Երբ «Red»-ն օգտագործվում է նախադասության սկզբում, ստեղծված թոքենը սկզբում բացատ չի ներառում։ «7738» թոքենը տարբերվում է բառի նախորդ երկու օրինակներից։
Դիտարկումներ.
Որքան ավելի հավանական/հաճախակի է թոքենը, այնքան ավելի փոքր թոքենի համար է նրան վերագրվում.
Վերջակետի համար ստեղծված թոքենը նույնն է («13») բոլոր 3 նախադասություններում։ Դա այն պատճառով է, որ համատեքստային առումով վերջակետը կորպուսի տվյալներում բավականին նման ձևով է օգտագործվում։
«red»-ի համար ստեղծված թոքենը տարբերվում է՝ կախված նախադասության մեջ դրա դիրքից.
Փոքրատառ՝ նախադասության մեջտեղում. « red» - (թոքեն՝ «2266»)
Մեծատառ՝ նախադասության մեջտեղում. « Red» - (թոքեն՝ «2297»)
Մեծատառ՝ նախադասության սկզբում. «Red» - (թոքեն՝ «7738»)
