Todos los precios de este sitio se dan por millón de tokens, y la memoria de cada modelo también se cuenta en tokens. Sin embargo, la palabra casi nunca se explica. Un token es un trozo de texto: una palabra entera cuando es común, una parte de la palabra cuando es rara, un espacio o un signo de puntuación. Los modelos nunca ven letras ni palabras, solo estos trozos, que corta una herramienta llamada tokenizador antes de que el texto llegue al modelo. Una palabra inglesa común como «house» suele ser un solo token; una palabra larga o rara se parte en dos, tres o más trozos.
¿Cuántas palabras hay en un token?
Lo contamos en los mismos textos cortos en 15 idiomas, con el tokenizador de GPT-4o de OpenAI, uno de los más usados. En inglés, 100 palabras ocuparon 113 tokens. Así que 1000 tokens equivalen a unas 890 palabras, y un token mide de media 5,2 caracteres, espacios incluidos. La regla que se suele citar, 100 tokens por 75 palabras, es más antigua y más prudente: los tokenizadores actuales lo hacen algo mejor con el inglés cotidiano.
Los demás idiomas necesitan más tokens
| Idioma | Mismo texto, frente al inglés | Tokens por cada 100 palabras | Caracteres por token |
|---|---|---|---|
| inglés | — | 113 | 5,2 |
| chino | +11 % | — | 1,4 |
| portugués | +15 % | 127 | 4,8 |
| español | +17 % | 122 | 4,9 |
| alemán | +17 % | 132 | 5,1 |
| ruso | +19 % | 160 | 4,4 |
| francés | +25 % | 137 | 4,8 |
| indonesio | +31 % | 162 | 4,4 |
| árabe | +35 % | 188 | 3,2 |
| turco | +35 % | 199 | 3,7 |
| coreano | +39 % | 219 | 1,8 |
| vietnamita | +45 % | 121 | 3,6 |
| italiano | +46 % | 160 | 4,1 |
| hindi | +57 % | 155 | 3,3 |
| japonés | +61 % | — | 1,4 |
Los tokenizadores aprenden de sus textos de entrenamiento, sobre todo en inglés, así que las palabras inglesas se mantienen enteras más a menudo y los demás idiomas se cortan en más trozos: el árabe necesita 188 tokens por cada 100 palabras, el coreano 219. Pero las palabras no lo son todo, porque algunos idiomas dicen lo mismo con menos palabras, más largas. Lo que cuenta para la factura es el mensaje completo, y esa es la primera columna: el mismo texto necesita un 61 % más de tokens en japonés, pero solo un 11 % más en chino. El chino y el japonés no separan las palabras con espacios, así que para ellos solo tienen sentido los caracteres: unos 1,4 caracteres por token en chino.
Modelos distintos, tokenizadores distintos
Cada familia de modelos tiene su propio tokenizador, y medimos 7. En inglés son casi idénticos: entre 218 y 220 tokens para el mismo texto. En otros idiomas pueden variar mucho. El caso extremo es el hindi: Gemma necesita 284 tokens para nuestro texto y GLM 1123, 4× más. Si trabajas en un idioma distinto del inglés, el precio por token es solo la mitad de la comparación: la herramienta la mejor IA para tu idioma y el análisis del impuesto lingüístico hacen el resto.
Qué significa para tu factura
Algunos ejemplos cotidianos en inglés, con el mismo tokenizador:
- un correo de 200 palabras: unos 230 tokens;
- un informe de 10 páginas, unas 5000 palabras: unos 5600 tokens;
- una novela de 90 000 palabras: unos 100.000 tokens. A 1 $ por millón de tokens, que un modelo la lea una vez cuesta unos 0,10 US$.
Tres cosas hacen que las facturas reales sean mayores de lo que sugieren estas cifras. Lo que escribe el modelo también se cobra, normalmente varias veces más caro que lo que lee. Las aplicaciones de chat reenvían toda la conversación con cada mensaje nuevo. Y los modelos de razonamiento escriben tokens de «pensamiento» ocultos, que se cobran como salida: consulta lo que cuesta pensar. La calculadora de costos hace las cuentas por ti, y el glosario guarda la definición breve.
Cómo lo medimos
Pasamos 4 textos cortos y cotidianos, como una noticia y un correo, traducidos a cada idioma, por los tokenizadores públicos de 7 familias de modelos, el 25 de septiembre de 2026. Es una muestra pequeña, unas 194 palabras en inglés, así que toma las cifras como una buena indicación más que como una tasa exacta: textos más largos, más técnicos o más informales pueden dar cifras algo distintas. Las palabras se cuentan por los espacios que las separan.
Las cifras de este artículo se recalculan a partir de nuestros datos con cada actualización (última: 25 sept 2026). Cómo trabajamos