Hvað eru tókar?
Tókar eru grunneiningar textans sem líkön OpenAI vinna úr. Þeir geta verið allt frá einum staf upp í heilt orð, eftir tungumáli og samhengi. Bil, greinarmerki og orðhlutar teljast öll með í tókafjöldanum. Þannig skiptir API-viðmótið textanum í einingar áður en það býr til svar.
Gagnlegar þumalputtareglur fyrir ensku:
1 tókar ≈ 4 stafir
1 tókar ≈ ¾ úr orði
100 tókar ≈ 75 orð
1–2 setningar ≈ 30 tókar
1 málsgrein ≈ 100 tókar
Um 1.500 orð ≈ 2.048 tókar
Tókavæðing er mismunandi eftir líkani og kóðun. Notaðu Tokenizer-verkfærið eða tiktoken.encoding_for_model(model) til að fá nákvæman fjölda fyrir líkanið sem þú ætlar að nota.
Dæmi
Hér eru nokkur raunveruleg textadæmi ásamt áætluðum tókafjölda:
Tilvitnun Wayne Gretzky „Þú hittir ekki úr 100% skotanna sem þú tekur ekki“ = 11 tókar
Stofnskrá OpenAI = 476 tókar
Sjálfstæðisyfirlýsing Bandaríkjanna = 1.695 tókar
Hvernig tókafjöldi er reiknaður
Þegar þú sendir texta til API-viðmótsins:
Textanum er skipt í tóka.
Líkanið vinnur úr þessum tókum.
Svarið er búið til sem röð tóka og síðan breytt aftur í texta.
Notkun tóka er skráð í nokkrum flokkum:
Inntakstókar – tókar í beiðninni þinni.
Úttakstókar – tókar sem eru búnir til í svarinu.
Tókar úr skyndiminni – endurnýttir tókar úr samtalsferlinum (oft gjaldfærðir á lægra verði).
Tókar fyrir rök – í sumum háþróuðum líkönum fara fram viðbótar „hugsunarskref“ innanhúss áður en endanlegt úttak er búið til.
Þessi fjöldi birtist í lýsigögnum API-svarsins og er notaður við gjaldfærslu og skráningu notkunar.
Til að kanna tókavæðingu nánar geturðu notað gagnvirka Tokenizer-verkfærið okkar, þar sem hægt er að reikna tókafjölda og sjá hvernig texta er skipt í tóka.
Ef þú vilt frekar tókavæða texta með forritun skaltu nota Tiktoken, hraðvirkan BPE-tókavæðara sem er sérstaklega notaður fyrir líkön OpenAI.
Takmörk tóka
Hvert líkan hefur hámark fyrir samanlagðan tókafjölda (inntak + úttak). Núverandi afkastamikil líkön styðja allt að hundruð þúsunda tóka í samhengi, en raunhæf mörk geta verið mismunandi eftir útgáfu líkansins og notkunarþrepi þínu.
Ef þú ferð yfir mörkin geturðu:
Stytt eða umorðað kvaðningar.
Skipt löngum texta í smærri hluta.
Dregið saman eða forunnið inntak áður en þú sendir það.
Verð á tókum
Notkun API-viðmótsins er verðlögð á hvern tóka og fer verðið eftir líkani og því hvort um inntaks-, úttaks- eða skyndiminnistóka er að ræða. Núverandi verð má sjá á verðsíðu OpenAI. Sum röksemdalíkön kunna að nota fleiri tóka innanhúss en stefna að aukinni skilvirkni með því að fækka tókum sem þarf til að ljúka hverju verkefni.
Tókar eru ekki staðlaðir milli gervigreindarlíkana eða þjónustuveitenda. Mismunandi líkön geta unnið úr eða búið til sama textann með mismörgum tókum. Lægra auglýst verð á hverja milljón tóka þýðir því ekki endilega lægri heildarkostnað.
Sýnileg lengd svarsins segir heldur ekki alla söguna. Sum líkön nota tóka fyrir rök innanhúss áður en þau skila svari. Lengra sýnilegt svar þýðir því ekki endilega að líkanið hafi notað fleiri tóka í heild.
Þegar líkön eru borin saman skaltu hafa í huga heildarfjölda tóka sem þarf og kostnaðinn við hverja vel heppnaða niðurstöðu. Viðmiðunarpróf geta verið gagnlegur upphafspunktur, en besta leiðin til að átta sig á raunverulegum kostnaði og afköstum líkana er að prófa þau við eigin notkunartilvik.
Tókar kannaðir
API-viðmótið meðhöndlar orð eftir samhengi þeirra í málheildargögnunum. Líkön taka við kvaðningunni, breyta inntakinu í lista af tókum, vinna úr kvaðningunni og breyta spáðum tókum aftur í orðin sem við sjáum í svarinu.
Tvö orð sem virðast eins í okkar augum geta orðið að mismunandi tókum eftir því hvernig þau koma fyrir í textanum. Skoðum hvernig API-viðmótið býr til tókgildi fyrir orðið „red“ eftir samhengi þess í textanum:
Í fyrsta dæminu hér að ofan inniheldur tókarinn „2266“ fyrir „ red“ bil á eftir (athugið að þessi tókaauðkenni eru aðeins dæmi til útskýringar).
Tókarinn „2296“ fyrir „ Red“ (með bili á undan og stórum upphafsstaf) er annar en tókarinn „2266“ fyrir „ red“ með litlum staf.
Þegar „Red“ er notað í upphafi setningar inniheldur tókarinn sem verður til ekki bil á undan. Tókarinn „7738“ er frábrugðinn fyrri tveimur dæmum um orðið.
Athuganir:
Því líklegri eða algengari sem tókar er, því lægra númer fær hann:
Tókarinn fyrir punktinn er sá sami („13“) í öllum þremur setningunum. Ástæðan er sú að í samhengi er punkturinn notaður með mjög svipuðum hætti í öllum málheildargögnunum.
Tókarinn fyrir „red“ er mismunandi eftir staðsetningu orðsins í setningunni:
Lítill stafur í miðri setningu: „ red“ – (tókar: „2266“)
Stór stafur í miðri setningu: „ Red“ – (tókar: „2297“)
Stór stafur í upphafi setningar: „Red“ – (tókar: „7738“)
