Cada página de modelo de este sitio muestra dos precios, como «3 US$ / 15 US$». Esto es lo que significan y cómo convertirlos en un presupuesto mensual real.
Pagas por token
Los modelos leen y escriben texto en tokens: palabras o trozos de palabras. En inglés, 1000 tokens equivalen a unas 750 palabras, o página y media. El español necesita entre un 15 y un 45 % más de tokens que el inglés para el mismo texto, según el modelo; el francés, algo más, y el árabe, a menudo bastante más, porque históricamente los tokenizadores se entrenaron sobre todo con textos en inglés. Si tu aplicación funciona en español, tenlo en cuenta en tu presupuesto: nuestra página Mejor IA para español muestra el costo medido para cada familia de modelos.
La entrada y la salida tienen precios distintos
El primer precio es el de entrada: los tokens que envías (instrucciones, historial de la conversación, documentos). El segundo es el de salida: los tokens que escribe el modelo. La salida suele ser entre 3 y 8 veces más cara, porque cada token de salida requiere una pasada completa por el modelo. Los precios se expresan por millón de tokens.
Un ejemplo práctico
Imagina que gestionas un asistente de atención al cliente. Cada petición envía 1500 tokens (instrucciones, el mensaje del cliente y algo de historial) y recibe una respuesta de 300 tokens. Atiendes 2000 peticiones al día.
- Entrada al mes: 1500 × 2000 × 30 = 90 millones de tokens
- Salida al mes: 300 × 2000 × 30 = 18 millones de tokens
Con un modelo a 3 US$ de entrada y 15 US$ de salida: 90 × 3 + 18 × 15 = 540 US$ al mes. Con un modelo a 0,25 US$ / 1,50 US$: 90 × 0,25 + 18 × 1,50 = 49,50 US$ al mes. El mismo tráfico, once veces más barato. La calculadora de costos hace esta cuenta para todos los modelos a la vez.
Multiplicadores ocultos
- El historial de la conversación. En un chat, cada mensaje nuevo reenvía toda la conversación, así que la entrada crece con cada turno.
- Los tokens de razonamiento. Los modelos de razonamiento «piensan» antes de responder, y esos tokens de pensamiento se facturan como salida. Una respuesta visible corta puede esconder miles de tokens facturados.
- Imágenes y archivos. Una imagen o una página de PDF también se convierte en tokens, a menudo entre varios cientos y unos pocos miles cada una.
Cómo pagar menos
- Caché de prompts: si todas las peticiones empiezan con las mismas instrucciones o el mismo documento largo, la entrada en caché se factura a una fracción del precio normal (aparece como «Entrada en caché» en las páginas de modelos cuando está disponible).
- Procesamiento por lotes: la mayoría de los proveedores ofrecen alrededor de un 50 % de descuento para las peticiones que pueden esperar unas horas.
- Enrutar según la dificultad: envía las peticiones fáciles a un modelo pequeño y solo las difíciles a un modelo insignia.
- Prompts ligeros: recorta el historial y evita pegar documentos enteros cuando basta con un fragmento relevante.
Los precios cambian a menudo, normalmente a la baja. Nuestro registro de cambios recoge cada cambio de precio que detectamos.