OpenAI
Cette page a été traduite automatiquement. Afficher l’article original en anglais.

Que sont les tokens et comment les compter?

Mise à jour : 2 days ago

Que sont les tokens?

Les tokens sont les éléments constitutifs du texte que les modèles OpenAI traitent. Ils peuvent être aussi courts qu’un seul caractère ou aussi longs qu’un mot entier, selon la langue et le contexte. Les espaces, la ponctuation et les parties de mots contribuent tous au nombre de tokens. Voici comment l’API segmente votre texte à l’interne avant de générer une réponse.

Règles approximatives utiles pour l’anglais :

  • 1 token ≈ 4 caractères

  • 1 token ≈ ¾ de mot

  • 100 tokens ≈ 75 mots

  • 1 ou 2 phrases ≈ 30 tokens

  • 1 paragraphe ≈ 100 tokens

  • Environ 1 500 mots ≈ 2 048 tokens

La tokenisation varie selon le modèle et l’encodage. Utilisez l’outil de tokenisation ou tiktoken.encoding_for_model(model) pour obtenir le nombre exact pour votre modèle cible.

Exemples

Voici quelques exemples de textes réels accompagnés de leur nombre approximatif de tokens :

  • La citation de Wayne Gretzky « Vous ratez 100 % des tirs que vous ne tentez pas » = 11 tokens

  • La Charte d’OpenAI = 476 tokens

  • La Déclaration d’indépendance des États-Unis = 1 695 tokens

Calcul du nombre de tokens

Lorsque vous envoyez du texte à l’API :

  1. Le texte est divisé en tokens.

  2. Le modèle traite ces tokens.

  3. La réponse est générée sous forme d’une séquence de tokens, puis reconvertie en texte.

L’utilisation des tokens est suivie dans plusieurs catégories :

  • Tokens d’entrée – tokens de votre requête.

  • Tokens de sortie – tokens générés dans la réponse.

  • Tokens mis en cache – tokens réutilisés dans l’historique de la conversation (souvent facturés à un tarif réduit).

  • Tokens de raisonnement – dans certains modèles avancés, des « étapes de réflexion » supplémentaires sont incluses à l’interne avant la production du résultat final.

Ces nombres figurent dans les métadonnées de la réponse de votre API et servent à la facturation et au suivi de l’utilisation.

Pour explorer davantage la tokenisation, vous pouvez utiliser notre outil de tokenisation interactif, qui permet de calculer le nombre de tokens et de voir comment le texte est divisé en tokens.

Vous pouvez aussi tokeniser du texte par programmation avec Tiktoken, un tokeniseur BPE rapide conçu spécialement pour les modèles OpenAI.

Limites de tokens

Chaque modèle comporte une limite maximale combinée de tokens (entrée + sortie). Les modèles actuels à haute capacité prennent en charge jusqu’à des centaines de milliers de tokens en contexte, bien que les limites pratiques puissent varier selon la version du modèle et votre niveau d’utilisation.

Si vous dépassez la limite, vous pouvez :

  • Raccourcir ou reformuler les invites.

  • Diviser les longs textes en blocs plus petits.

  • Résumer ou prétraiter les entrées avant de les envoyer.

Tarification des tokens

L’utilisation de l’API est tarifée par token, selon le modèle et selon qu’il s’agit de tokens d’entrée, de sortie ou mis en cache. Consultez la page de tarification d’OpenAI pour connaître les tarifs actuels. Certains modèles de raisonnement peuvent utiliser davantage de tokens à l’interne, mais visent à accroître l’efficacité en réduisant le nombre de tokens requis par tâche accomplie.

Explorer les tokens

L’API traite les mots selon leur contexte dans les données du corpus. Les modèles prennent l’invite, convertissent l’entrée en une liste de tokens, traitent l’invite, puis reconvertissent les tokens prédits en mots affichés dans la réponse.

Deux mots qui nous semblent identiques peuvent être convertis en tokens différents selon leur structure dans le texte. Voyez comment l’API génère les valeurs de token du mot « red » selon son contexte dans le texte :

Sentence split into color-coded tokens with Text selected over Token IDs
Token ID output as a list of integers with the Token IDs tab selected

Dans le premier exemple ci-dessus, le token « 2266 » pour «  red » comprend une espace finale (remarque : ces identifiants de token sont fournis à titre d’exemple).

Sentence split into color-coded token blocks: My favorite color is Red.
Tokenizer output with Token IDs selected and a list of numeric token IDs

Le token « 2296 » pour «  Red » (avec une espace initiale et une majuscule) diffère du token « 2266 » pour «  red » avec une minuscule.

Tokenizer example splitting “Red is my favorite color.” into color-coded tokens
Tokenizer output with Token IDs selected and a list of token ID numbers

Lorsque « Red » est utilisé au début d’une phrase, le token généré ne comprend aucune espace initiale. Le token « 7738 » diffère des deux exemples précédents du mot.

Observations :

Plus un token est probable ou fréquent, plus le numéro qui lui est attribué est bas :

  • Le token généré pour le point est le même (« 13 ») dans les trois phrases. C’est parce que, dans le contexte, le point est utilisé de façon assez semblable dans l’ensemble des données du corpus.

  • Le token généré pour « red » varie selon sa position dans la phrase :

    • Minuscule au milieu d’une phrase : «  red » – (token : « 2266 »)

    • Majuscule au milieu d’une phrase : «  Red » – (token : « 2297 »)

    • Majuscule au début d’une phrase : « Red » – (token : « 7738 »)

Cet article vous a-t-il été utile?