Hvað eru tókar?
Tókar eru byggingareiningar texta sem OpenAI-líkön vinna úr. Þeir geta verið eins stuttir og einn stafur eða eins langir og heilt orð, allt eftir tungumáli og samhengi. Bil, greinarmerki og orðhlutar telja öll með í fjölda tóka. Svona skiptir API-ið textanum þínum innbyrðis áður en það býr til svar.
Gagnlegar þumalputtareglur fyrir ensku:
1 tóki ≈ 4 stafir
1 tóki ≈ ¾ úr orði
100 tókar ≈ 75 orð
1–2 setningar ≈ 30 tókar
1 málsgrein ≈ 100 tókar
~1.500 orð ≈ 2.048 tókar
Tókavæðing er breytileg eftir líkani og kóðun. Notaðu tókara-tólið eða tiktoken.encoding_for_model(model) til að fá nákvæman fjölda fyrir marklíkanið þitt.
Dæmi
Hér eru nokkur raunveruleg textadæmi með áætluðum tókafjölda:
Tilvitnun Wayne Gretzky „Þú hittir ekki úr 100% þeirra skota sem þú tekur ekki“ = 11 tókar
Stofnskrá OpenAI = 476 tókar
Sjálfstæðisyfirlýsing Bandaríkjanna = 1.695 tókar
Hvernig tókafjöldi er reiknaður
Þegar þú sendir texta til API-ins:
Textanum er skipt í tóka.
Líkanið vinnur úr þessum tókum.
Svarið er búið til sem röð tóka og síðan breytt aftur í texta.
Notkun tóka er rakin í nokkrum flokkum:
Inntakstókar – tókar í beiðninni þinni.
Úttakstókar – tókar sem eru búnir til í svarinu.
Tókar í skyndiminni – endurnýttir tókar í samtalssögu (oft gjaldfærðir á lægra verði).
Rakatókar – í sumum háþróuðum líkönum eru auka „hugsunarskref“ tekin með innbyrðis áður en endanlegt úttak er framleitt.
Þessi talning birtist í lýsigögnum API-svarsins þíns og er notuð fyrir gjaldfærslu og rakningu á notkun.
Til að kanna tókavæðingu nánar geturðu notað gagnvirka tókara-tólið okkar, sem gerir þér kleift að reikna fjölda tóka og sjá hvernig texti er brotinn niður í tóka.
Að öðrum kosti, ef þú vilt tókavæða texta með forritun, skaltu nota Tiktoken sem hraðan BPE-tókara sem er sérstaklega notaður fyrir OpenAI-líkön.
Tókamörk
Hvert líkan hefur hámarks samanlögð tókamörk (inntak + úttak). Núverandi afkastamikil líkön styðja allt að hundruð þúsunda tóka í samhengi, þó hagnýt mörk geti verið breytileg eftir útgáfu líkansins og notkunarþrepi þínu.
Ef þú ferð yfir mörkin geturðu:
Stytt eða umorðað kvaðningar.
Skipt stórum texta í smærri hluta.
Tekið saman eða forunnið inntök áður en þau eru send.
Verðlagning tóka
API-notkun er verðlögð á hvern tóka og fer eftir líkani og því hvort tókar eru inntak, úttak eða í skyndiminni. Sjá verðsíðu OpenAI fyrir núverandi gjöld. Sum rakalíkön kunna að nota fleiri tóka innbyrðis en miða að því að bæta skilvirkni með því að fækka tókum sem þarf fyrir hvert lokið verkefni.
Tókar kannaðir
API-ið meðhöndlar orð samkvæmt samhengi þeirra í málheildargögnum. Líkön taka kvaðninguna, breyta inntakinu í lista af tókum, vinna úr kvaðningunni og breyta spáðum tókum aftur í orðin sem við sjáum í svarinu.
Það sem okkur kann að sýnast vera tvö eins orð getur verið myndað sem mismunandi tókar eftir því hvernig þau eru uppbyggð í textanum. Skoðaðu hvernig API-ið býr til tókagildi fyrir orðið ‘red’ út frá samhengi þess í textanum:
Í fyrsta dæminu hér að ofan inniheldur tóki „2266“ fyrir ‘ red’ bil á undan (athugið að þetta eru dæmi um tókaauðkenni til sýningar).
Tókinn „2296“ fyrir ‘ Red’ (með bili á undan og stórum upphafsstaf) er frábrugðinn tókanum „2266“ fyrir ‘ red’ með litlum staf.
Þegar ‘Red’ er notað í upphafi setningar inniheldur myndaði tókinn ekki bil á undan. Tókinn „7738“ er frábrugðinn tveimur fyrri dæmunum um orðið.
Athuganir:
Því líklegri/algengari sem tóki er, því lægra tókanúmer er honum úthlutað:
Tókinn sem er myndaður fyrir punktinn er sá sami („13“) í öllum 3 setningunum. Þetta er vegna þess að punkturinn er, út frá samhengi, notaður nokkuð svipað í öllum málheildargögnunum.
Tókinn sem er myndaður fyrir ‘red’ er breytilegur eftir staðsetningu þess í setningunni:
Lítill stafur í miðri setningu: ‘ red’ - (tóki: „2266“)
Stór stafur í miðri setningu: ‘ Red’ - (tóki: „2297“)
Stór stafur í upphafi setningar: ‘Red’ - (tóki: „7738“)
