Ի՞նչ են թոքենները։
Թոքենները տեքստի այն կառուցվածքային միավորներն են, որոնք մշակում են OpenAI-ի մոդելները։ Կախված լեզվից և համատեքստից՝ դրանք կարող են լինել մեկ նիշի չափ կարճ կամ ամբողջական բառի չափ երկար։ Բացատները, կետադրական նշանները և բառերի մասերը նույնպես ներառվում են թոքենների քանակում։ Այսպես է API-ն ներքին մակարդակում բաժանում ձեր տեքստը՝ նախքան պատասխան ստեղծելը։
Օգտակար մոտավոր կանոններ անգլերենի համար՝
1 թոքեն ≈ 4 նիշ
1 թոքեն ≈ բառի ¾-ը
100 թոքեն ≈ 75 բառ
1–2 նախադասություն ≈ 30 թոքեն
1 պարբերություն ≈ 100 թոքեն
~1,500 բառ ≈ 2,048 թոքեն
Թոքենիզացիան տարբերվում է՝ կախված մոդելից և կոդավորումից։ Ձեր նպատակային մոդելի համար ճշգրիտ քանակն ստանալու նպատակով օգտագործեք Թոքենիզատոր գործիքը կամ tiktoken.encoding_for_model(model)։
Օրինակներ
Ահա իրական տեքստերի մի քանի նմուշ՝ դրանց թոքենների մոտավոր քանակով․
Ուեյն Գրետցկիի «Դուք վրիպում եք այն հարվածների 100%-ը, որոնք չեք կատարում» մեջբերումը = 11 թոքեն
OpenAI-ի կանոնադրությունը = 476 թոքեն
ԱՄՆ Անկախության հռչակագիրը = 1,695 թոքեն
Ինչպես է հաշվարկվում թոքենների քանակը
Երբ տեքստ եք ուղարկում API-ին՝
Տեքստը բաժանվում է թոքենների։
Մոդելը մշակում է այդ թոքենները։
Պատասխանը ստեղծվում է որպես թոքենների հաջորդականություն, ապա կրկին վերածվում տեքստի։
Թոքենների օգտագործումը հաշվառվում է մի քանի կատեգորիայով՝
Մուտքային թոքեններ — ձեր հարցման թոքենները։
Ելքային թոքեններ — պատասխանում ստեղծված թոքենները։
Քեշավորված թոքեններ — զրույցի պատմությունից կրկին օգտագործված թոքենները (հաճախ հաշվարկվում են նվազեցված սակագնով)։
Դատողության թոքեններ — որոշ առաջադեմ մոդելներում վերջնական արդյունքը ստեղծելուց առաջ ներքին մակարդակում ներառվող լրացուցիչ «մտածողության քայլերը»։
Այս քանակները նշվում են API-ի պատասխանի մետատվյալներում և օգտագործվում վճարների ու օգտագործման հաշվառման համար։
Թոքենիզացիան ավելի մանրամասն ուսումնասիրելու համար կարող եք օգտվել մեր ինտերակտիվ Թոքենիզատոր գործիքից, որը թույլ է տալիս հաշվել թոքենները և տեսնել, թե տեքստն ինչպես է բաժանվում դրանց։
Կամ, եթե ցանկանում եք տեքստը ծրագրային եղանակով թոքենիզացնել, օգտագործեք Tiktoken-ը՝ արագ BPE թոքենիզատոր, որը հատուկ կիրառվում է OpenAI-ի մոդելների համար։
Թոքենների սահմանաչափեր
Յուրաքանչյուր մոդել ունի մուտքային և ելքային թոքենների ընդհանուր առավելագույն սահմանաչափ։ Ներկայիս մեծ հզորությամբ մոդելները համատեքստում աջակցում են մինչև հարյուր հազարավոր թոքեններ, սակայն գործնական սահմանաչափերը կարող են տարբերվել՝ կախված մոդելի տարբերակից և ձեր օգտագործման մակարդակից։
Եթե գերազանցեք սահմանաչափը, կարող եք՝
Կրճատել կամ վերաձևակերպել հարցումները։
Մեծ տեքստը բաժանել փոքր հատվածների։
Մուտքային տվյալներն ուղարկելուց առաջ ամփոփել կամ նախապես մշակել։
Թոքենների գնագոյացում
API-ի օգտագործման գինը հաշվարկվում է ըստ թոքենների և տարբերվում՝ կախված մոդելից ու թոքենների տեսակից՝ մուտքային, ելքային կամ քեշավորված։ Ընթացիկ սակագները տեսեք OpenAI-ի գնագոյացման էջում։ Դատողության որոշ մոդելներ կարող են ներքին մակարդակում ավելի շատ թոքեններ օգտագործել, սակայն ձգտում են բարձրացնել արդյունավետությունը՝ նվազեցնելով յուրաքանչյուր ավարտված առաջադրանքի համար անհրաժեշտ թոքենների քանակը։
Թոքենների ուսումնասիրություն
API-ն բառերը մշակում է՝ հաշվի առնելով կորպուսի տվյալներում դրանց համատեքստը։ Մոդելները ստանում են հարցումը, մուտքային տվյալները վերածում թոքենների ցանկի, մշակում հարցումը և կանխատեսված թոքենները կրկին վերածում պատասխանում տեսանելի բառերի։
Մեզ միանման թվացող երկու բառերը կարող են ներկայացվել տարբեր թոքեններով՝ կախված տեքստում դրանց կառուցվածքից։ Դիտարկենք, թե API-ն ինչպես է ստեղծում «red» բառի թոքենային արժեքները՝ ըստ տեքստում դրա համատեքստի․
Վերևի առաջին օրինակում ‘ red’ գրության «2266» թոքենը ներառում է վերջում բացատ (նշված թոքենների ID-ները միայն ցուցադրական օրինակներ են)։
‘ Red’ գրության «2296» թոքենը (առջևում բացատով և սկզբում մեծատառով) տարբերվում է փոքրատառով ‘ red’ գրության «2266» թոքենից։
Երբ ‘Red’-ը գործածվում է նախադասության սկզբում, ստեղծված թոքենն առջևում բացատ չի ներառում։ «7738» թոքենը տարբերվում է բառի նախորդ երկու օրինակներից։
Դիտարկումներ՝
Որքան հավանական կամ հաճախակի է թոքենը, այնքան փոքր թիվ է նրան հատկացվում․
Վերջակետի համար ստեղծված թոքենը նույնն է («13») բոլոր 3 նախադասություններում։ Պատճառն այն է, որ կորպուսի տվյալներում վերջակետը համատեքստային առումով գրեթե նույն կերպ է գործածվում։
‘red’-ի համար ստեղծված թոքենը տարբերվում է՝ կախված նախադասության մեջ դրա դիրքից․
Փոքրատառով՝ նախադասության մեջտեղում․ ‘ red’ — (թոքեն՝ «2266»)
Մեծատառով՝ նախադասության մեջտեղում․ ‘ Red’ — (թոքեն՝ «2297»)
Մեծատառով՝ նախադասության սկզբում․ ‘Red’ — (թոքեն՝ «7738»)
