Përmbledhje
Tokenet janë njësitë që modelet e OpenAI përdorin për të përpunuar tekstin. Një token mund të përfaqësojë një karakter, pjesë të një fjale, një fjalë të plotë ose shenjë pikësimi. Edhe hapësirat ndikojnë në mënyrën se si ndahet teksti në tokene.
Numri i tokeneve nuk është i njëjtë me numrin e fjalëve. I njëjti tekst mund të prodhojë numër të ndryshëm tokenesh, në varësi të modelit, kodimit të tij dhe gjuhës.
Kuptoni si shndërrohet teksti në tokene
Kur i dërgoni tekst një modeli:
Teksti ndahet në tokene.
Modeli i përpunon këto tokene.
Modeli gjeneron tokene dalëse. Këto mund të përfshijnë tekstin që merrni dhe, për modelet e arsyetimit, tokene të arsyetimit të brendshëm që nuk shfaqen si tekst i përgjigjes.
Përdorni vlerësime të përafërta për tekstin në anglisht
Këto vlerësime mund t’ju ndihmojnë të përcaktoni madhësinë e tekstit në anglisht:
1 token është afërsisht 4 karaktere.
1 token është afërsisht tri të katërtat e një fjale.
100 tokene janë afërsisht 75 fjalë.
Këto janë vlerësime, jo numërime të sakta. Gjatësitë e fjalive dhe paragrafëve ndryshojnë, ndërsa gjuhët e tjera mund të kenë raporte të ndryshme ndërmjet karaktereve, fjalëve dhe tokeneve.
Merrni parasysh hapësirat dhe shkronjat e mëdha
Një fjalë mund të ndahet në tokene të ndryshme në varësi të drejtshkrimit, përdorimit të shkronjave të mëdha dhe tekstit përreth.
Për shembull, red, Red dhe red nuk përmbajnë tekst identik: shembulli i fundit përfshin një hapësirë në fillim. Një kodim mund t’i paraqesë ndryshe.
Edhe ID-të e tokeneve varen nga kodimi. Mos supozoni se një ID tokeni nga një shembull vlen për çdo model.
Dalloni tokenet hyrëse nga ato dalëse
| Kategoria | Çfarë përshkruan |
| Tokenet hyrëse | Tokenet që i jepen modelit në një kërkesë. Këto quhen edhe tokene të kërkesës. |
| Tokenet dalëse | Tokenet e gjeneruara nga modeli. Chat Completions i quan këto tokene plotësimi. |
| Tokenet hyrëse të ruajtura në memorien specifike | Tokenet hyrëse të ripërdorura përmes ruajtjes së promptit në memorien specifike. Çmimi i tyre mund të ndryshojë nga ai i tokeneve hyrëse që nuk janë ruajtur në memorien specifike. |
| Tokenet e arsyetimit | Tokenet që një model arsyetimi përdor brenda sistemit para se të prodhojë përgjigjen e dukshme. |
Tokenet e arsyetimit nuk duken si tekst i përgjigjes, por llogariten në përdorimin e daljes dhe faturohen si tokene dalëse.
Prandaj, një përgjigje e shkurtër e dukshme mund të përdorë më shumë tokene nga sa sugjeron teksti i shfaqur.
Numëroni tokenet para se të dërgoni një kërkesë
Numëroni tekstin e thjeshtë
Përdorni Tokenizer për të parë si ndahet teksti në tokene.
Për tokenizimin programatik të tekstit të thjeshtë, përdorni tiktoken. Zgjidhni kodimin për modelin e synuar, për shembull me tiktoken.encoding_for_model(model).
Numri i tokeneve në tekst të thjeshtë nuk përfshin domosdoshmërisht të gjitha tokenet e një kërkese API. Struktura e mesazheve, mjetet, skemat, imazhet dhe skedarët mund të ndikojnë në numrin e plotë të tokeneve hyrëse.
Numëroni një hyrje të plotë të Responses
Për një hyrje të plotë të API-së Responses, përdorni API-në e numërimit të tokeneve hyrëse.
Ajo pranon formatet hyrëse të Responses, përfshirë mesazhet, imazhet, skedarët, mjetet dhe bisedat. Numërimi i saj përfshin tokenet e formatimit të përdorura për strukturën e kërkesës, si rolet dhe kufijtë e mesazheve.
Numri i tokeneve hyrëse nuk parashikon sa tokene dalëse do të gjenerojë modeli.
Kontrolloni përdorimin real të tokeneve
Pas një kërkese, shqyrtoni informacionin e përdorimit të saj. Emrat e fushave ndryshojnë sipas pikës fundore:
Chat Completions raporton prompt_tokens, completion_tokens dhe total_tokens.
Responses raporton input_tokens, output_tokens dhe total_tokens.
Mund të shqyrtoni edhe aktivitetin përgjatë kohës te Usage Dashboard. Për udhëzime, përfshirë përdorimin gjatë transmetimit, shihni: Shqyrtimi i përdorimit dhe kostove të API-së.
Qëndroni brenda kufijve të modelit
Kontrolloni dokumentacionin e modelit për dritaren e kontekstit dhe daljen maksimale. Këta kufij mund të ndryshojnë ndërmjet modeleve.
Dritarja e kontekstit kufizon tokenet me të cilat mund të punojë një model në një kërkesë. Modelet kanë gjithashtu një kufi daljeje. Për modelet e arsyetimit, lini hapësirë si për tokenet e arsyetimit, ashtu edhe për përgjigjen e dukshme.
Nëse hyrja është tepër e madhe, mund:
Ta shkurtoni ose ta riformuloni kërkesën.
Të hiqni kontekstin e panevojshëm ose të përsëritur.
T’i ndani hyrjet e mëdha në pjesë më të vogla.
Ta përmblidhni ose përpunoni paraprakisht tekstin para se ta dërgoni.
Përdorni cilësimin e tokeneve dalëse që mbështetet nga pika fundore dhe modeli juaj. Chat Completions përdor max_completion_tokens; Responses përdor max_output_tokens.
Këta kufij të madhësisë së kërkesës janë të veçantë nga kufijtë e shpejtësisë së API-së dhe kufijtë mujorë të përdorimit ose shpenzimeve. Shqyrtoni dokumentacionin e modelit për modelin që përdorni.
Kuptoni çmimet e tokeneve
Për çmimet e API-së të bazuara në tokene, tarifa varet nga modeli dhe kategoria e tokenit. Tokenet hyrëse, hyrëse të ruajtura në memorien specifike dhe dalëse mund të kenë çmime të ndryshme. Funksione të tjera të API-së mund të përdorin njësi të ndryshme faturimi.
Kontrolloni faqen e çmimeve të API-së për tarifat aktuale.
Kur krahasoni modele, merrni parasysh numrin e përgjithshëm të tokeneve dhe koston e nevojshme për të përfunduar detyrën. Një çmim më i ulët për një milion tokene nuk sjell domosdoshmërisht kosto totale më të ulët: modelet mund ta tokenizojnë ndryshe të njëjtin tekst dhe të gjenerojnë sasi të ndryshme daljeje ose arsyetimi.
Testoni detyra përfaqësuese, në vend që të krahasoni vetëm gjatësinë e përgjigjes së dukshme.
Merrni parasysh plotësimet e shumëfishta
Kur një pikë fundore dhe një model mbështetin gjenerimin e disa plotësimeve, edhe ato plotësime shtesë përdorin tokene.
Për Chat Completions, caktimi i n mbi 1 gjeneron disa alternativa. Faturoheni për tokenet e gjeneruara në të gjitha këto alternativa.
Për API-në e vjetër Completions, best_of mund të gjenerojë kandidatë që nuk kthehen të gjithë. Për shembull, best_of = 3 mund të gjenerojë deri në 3 × max_tokens tokene plotësimi në të gjithë kandidatët.
Këta parametra janë specifikë për pikën fundore. Mos supozoni se n ose best_of mbështetet nga një API apo model tjetër.
