Tous les prix de ce site sont donnés par million de tokens, et la mémoire de chaque modèle se compte aussi en tokens. Pourtant, le mot est rarement expliqué. Un token est un morceau de texte : un mot entier quand le mot est courant, un bout de mot quand il est rare, une espace ou un signe de ponctuation. Les modèles ne voient jamais de lettres ni de mots, seulement ces morceaux, découpés par un outil appelé tokeniseur avant que le texte n’arrive au modèle. Un mot anglais courant comme « house » tient en général en un seul token ; un mot long ou rare est coupé en deux, trois morceaux ou plus.

Combien de mots dans un token ?

Nous l’avons compté sur les mêmes textes courts dans 15 langues, avec le tokeniseur de GPT-4o d’OpenAI, l’un des plus utilisés. En anglais, 100 mots ont pris 113 tokens. 1 000 tokens contiennent donc environ 890 mots, et un token fait en moyenne 5,2 caractères, espaces comprises. La règle souvent citée, 100 tokens pour 75 mots, est plus ancienne et plus prudente : les tokeniseurs actuels font un peu mieux sur l’anglais courant.

Les autres langues demandent plus de tokens

LangueMême texte, par rapport à l’anglaisTokens pour 100 motsCaractères par token
anglais—1135,2
chinois+11 %—1,4
portugais+15 %1274,8
espagnol+17 %1224,9
allemand+17 %1325,1
russe+19 %1604,4
français+25 %1374,8
indonésien+31 %1624,4
arabe+35 %1883,2
turc+35 %1993,7
coréen+39 %2191,8
vietnamien+45 %1213,6
italien+46 %1604,1
hindi+57 %1553,3
japonais+61 %—1,4

Les tokeniseurs apprennent sur leurs textes d’entraînement, surtout en anglais : les mots anglais restent donc plus souvent entiers, et les autres langues sont découpées en plus de morceaux. L’arabe prend 188 tokens pour 100 mots, le coréen 219. Mais les mots ne disent pas tout, car certaines langues disent la même chose en moins de mots, plus longs. Ce qui compte pour la facture, c’est le message entier, et c’est la première colonne : le même texte demande 61 % de tokens en plus en japonais, mais seulement 11 % en chinois. Le chinois et le japonais ne séparent pas les mots par des espaces : seuls les caractères ont un sens pour eux, environ 1,4 caractères par token en chinois.

Des modèles différents, des tokeniseurs différents

Chaque famille de modèles a son propre tokeniseur, et nous en avons mesuré 7. Pour l’anglais, ils sont presque identiques : entre 218 et 220 tokens pour le même texte. Pour les autres langues, ils peuvent beaucoup différer. Le cas extrême est le hindi : Gemma a besoin de 284 tokens pour notre texte, GLM de 1 123, soit 4× plus. Si vous travaillez dans une autre langue que l’anglais, le prix par token n’est que la moitié de la comparaison : l’outil la meilleure IA pour votre langue et l’analyse de la taxe linguistique font le reste.

Ce que cela change pour la facture

Quelques exemples courants en anglais, avec le même tokeniseur :

  • un e-mail de 200 mots : environ 230 tokens ;
  • un rapport de 10 pages, soit 5 000 mots : environ 5 600 tokens ;
  • un roman de 90 000 mots : environ 100 000 tokens. À 1 $ le million de tokens, le faire lire une fois à un modèle coûte environ 0,10 $US.

Trois choses rendent les vraies factures plus lourdes que ces chiffres. Ce que le modèle écrit est facturé aussi, en général plusieurs fois plus cher que ce qu’il lit. Les applications de discussion renvoient toute la conversation à chaque nouveau message. Et les modèles de raisonnement écrivent des tokens de « réflexion » cachés, facturés comme de la sortie : voir ce que coûte la réflexion. Le calculateur de coût fait les calculs pour vous, et le glossaire garde la définition courte.

Comment nous avons mesuré

Nous avons passé 4 textes courts de la vie courante, comme une brève d’actualité et un e-mail, traduits dans chaque langue, dans les tokeniseurs publics de 7 familles de modèles, le 25 septembre 2026. C’est un petit échantillon, environ 194 mots en anglais : prenez ces chiffres comme une bonne indication plutôt qu’un taux exact. Des textes plus longs, plus techniques ou plus familiers peuvent donner des chiffres un peu différents. Les mots sont comptés d’après les espaces qui les séparent.

Les chiffres de cet article sont recalculés à partir de nos données à chaque mise à jour (dernière : 25 sept. 2026). Notre méthode