OpenAI
Оваа страница беше машински преведена. Погледнете ја оригиналната статија на англиски јазик.

Разбирање и броење токени

Дознајте како влезните, излезните, кешираните и токените за расудување влијаат врз користењето на API, ограничувањата на моделот и трошоците.

Ажурирано: 4 days ago

Преглед

Токените се единиците што моделите на OpenAI ги користат за обработка на текст. Еден токен може да претставува знак, дел од збор, цел збор или интерпункциски знак. И празните места влијаат врз тоа како текстот се дели на токени.

Бројот на токени не е ист со бројот на зборови. Истиот текст може да даде различен број токени зависно од моделот, неговото кодирање и јазикот.

Разберете како текстот станува токени

Кога испраќате текст до модел:

  1. Текстот се дели на токени.

  2. Моделот ги обработува тие токени.

  3. Моделот создава излезни токени. Тие може да го опфаќаат текстот што го добивате, а кај моделите со расудување и внатрешните токени за расудување што не се прикажуваат како текст на одговорот.

Користете приближни процени за текст на англиски јазик

Овие процени може да ви помогнат да ја одредите големината на текст на англиски јазик:

  • 1 токен е приближно 4 знаци.

  • 1 токен е приближно три четвртини од збор.

  • 100 токени се приближно 75 збора.

Ова се процени, а не точни вредности. Должината на речениците и пасусите варира, а другите јазици може да имаат поинакви односи меѓу знаците, зборовите и токените.

Земете ги предвид празните места и големината на буквите

Еден збор може да се подели на различни токени зависно од правописот, големината на буквите и околниот текст.

На пример, red, Red и red не содржат идентичен текст: последниот пример има празно место на почетокот. Едно кодирање може да ги претстави на различен начин.

Идентификаторите на токените зависат и од кодирањето. Не претпоставувајте дека идентификаторот на токен од некој пример важи за секој модел.

Разликувајте ги влезните и излезните токени

КатегоријаШто опишува
Влезни токениТокени доставени до моделот во едно барање. Тие се нарекуваат и токени на промптот.
Излезни токениТокени создадени од моделот. Chat Completions ги нарекува токени за довршување.
Кеширани влезни токениВлезни токени што повторно се користат преку кеширање промпт. Нивната цена може да се разликува од цената на некешираните влезни токени.
Токени за расудувањеТокени што моделот со расудување ги користи внатрешно пред да го создаде својот видлив одговор.

Токените за расудување не се видливи како текст на одговорот, но се вбројуваат во излезната употреба и се наплаќаат како излезни токени.

Затоа, краток видлив одговор може да користи повеќе токени отколку што покажува прикажаниот текст.

Избројте ги токените пред да испратите барање

Избројте ги токените во обичен текст

Користете го Токенизаторот за да видите како текстот се дели на токени.

За програмска токенизација на обичен текст, користете tiktoken. Изберете го кодирањето за целниот модел, на пример со tiktoken.encoding_for_model(model).

Бројот на токени во обичен текст не мора да ги опфаќа сите токени во едно барање до API. Структурата на пораките, алатките, шемите, сликите и датотеките може да влијаат врз вкупниот број влезни токени.

Избројте ги токените во целосен влез за Responses

За целосен влез во Responses API, користете го API за броење влезни токени.

Ги прифаќа влезните формати на Responses, вклучувајќи пораки, слики, датотеки, алатки и разговори. Неговиот број ги опфаќа токените за форматирање што се користат за структурата на барањето, како што се улогите и границите на пораките.

Бројот на влезни токени не предвидува колку излезни токени ќе создаде моделот.

Проверете ја реалната употреба на токени

По испраќањето барање, проверете ги информациите за неговата употреба. Имињата на полињата се разликуваат зависно од крајната точка:

  • Chat Completions ги прикажува prompt_tokens, completion_tokens и total_tokens.

  • Responses ги прикажува input_tokens, output_tokens и total_tokens.

Активноста низ времето може да ја прегледате и во контролната табла за употреба. За упатства, вклучително и за употребата при стримување, видете: Преглед на употребата и трошоците за API.

Почитувајте ги ограничувањата на моделот

Во документацијата за моделот проверете ги неговиот прозорец за контекст и максималниот излез. Овие ограничувања може да се разликуваат меѓу моделите.

Прозорецот за контекст го ограничува бројот на токени што моделот може да ги обработи во едно барање. Моделите имаат и ограничување на излезот. Кај моделите со расудување, оставете простор и за токените за расудување и за видливиот одговор.

Ако влезот е преголем, може да:

  • Го скратите или преформулирате промптот.

  • Го отстраните непотребниот или повторениот контекст.

  • Ги поделите големите влезови на помали делови.

  • Го резимирате или претходно го обработите текстот пред да го испратите.

Користете ја поставката за излезни токени што ја поддржуваат вашата крајна точка и модел. Chat Completions користи max_completion_tokens, а Responses користи max_output_tokens.

Овие ограничувања за големината на барањето се независни од ограничувањата на стапката на API и од месечните ограничувања за употреба или трошоци. Прегледајте ја документацијата за моделот што го користите.

Разберете ги цените на токените

Кај цените за API засновани на токени, тарифата зависи од моделот и категоријата на токенот. Влезните, кешираните влезни и излезните токени може да имаат различни цени. Другите можности на API може да користат различни пресметковни единици.

Проверете ги тековните тарифи на страницата со цени за API.

Кога споредувате модели, земете ги предвид вкупниот број токени и трошокот потребни за извршување на задачата. Пониската цена за милион токени не значи нужно и понизок вкупен трошок: моделите може различно да го токенизираат истиот текст и да создадат различно количество излез или расудување.

Тестирајте репрезентативни задачи наместо да ја споредувате само должината на видливиот одговор.

Земете ги предвид повеќекратните довршувања

Кога крајната точка и моделот поддржуваат создавање повеќе довршувања, и тие дополнителни довршувања користат токени.

Кај Chat Completions, поставувањето на n над 1 создава повеќе избори. Се наплаќаат токените создадени во сите тие избори.

Кај застарениот Completions API, best_of може да создаде кандидати што нема сите да бидат вратени. На пример, best_of = 3 може да создаде до 3 × max_tokens токени за довршување низ сите кандидати.

Овие параметри се специфични за крајната точка. Не претпоставувајте дека друг API или модел ги поддржува n или best_of.

Дали оваа статија ви беше корисна?