La mayoría de las facturas de IA son más altas de lo necesario, y las soluciones rara vez son ingeniosas. Todo se reduce a unos pocos hábitos: enviar demasiado texto, usar un modelo de primer nivel para trabajo sencillo y pagar el precio completo por lo que se repite. Aquí tienes nueve formas de reducir la factura, más o menos en el orden en que yo las probaría.
1. Mide antes de recortar
Registra durante unos días los tokens de entrada y salida de cada solicitud, junto con la función que la envió. Normalmente una o dos funciones concentran casi todo el gasto, y los tokens de salida, que a menudo cuestan varias veces más que los de entrada, pesan más de lo que parece. La calculadora de costos convierte esas cifras en una factura mensual para cada modelo.
2. Envía las solicitudes sencillas a un modelo más barato
Clasificar mensajes, extraer datos de un documento o responder a partir de unas preguntas frecuentes rara vez necesita un modelo insignia. Envía esas solicitudes a un modelo barato y deja el caro para las difíciles. Con las diferencias de precio habituales, mover el 70 % del tráfico puede reducir la factura a menos de la mitad; el simulador de combinación de modelos lo muestra con los precios de hoy.
3. Guarda en caché lo que se repite
Las instrucciones largas, los ejemplos y los documentos de referencia suelen ser idénticos de una solicitud a otra. Los grandes proveedores cobran la entrada en caché a una fracción del precio normal, a menudo alrededor de una décima parte, y algunos cobran un pequeño extra la primera vez que se guarda un prompt. Pon primero la parte estable del prompt y al final la que cambia, para que la caché pueda reconocerla.
4. Usa el descuento por lotes para lo que puede esperar
Informes, etiquetado de archivos, resúmenes nocturnos: cuando la respuesta puede llegar en el mismo día, las interfaces por lotes de OpenAI, Anthropic y Google cuestan aproximadamente la mitad del precio normal. Comprueba las condiciones actuales de cada proveedor antes de contar con ello.
5. Envía menos historial
Las aplicaciones de chat vuelven a enviar toda la conversación con cada mensaje, así que el décimo mensaje paga por los nueve anteriores. Conserva literalmente los últimos turnos y sustituye los más antiguos por un resumen breve. Para preguntas sobre documentos, envía menos fragmentos y más pertinentes, en lugar de todo lo que parezca relacionado.
6. Limita la longitud de las respuestas
Fija una longitud máxima de salida y pide el formato que realmente necesitas: un sí o un no, un objeto JSON, tres viñetas. La salida es la parte cara de la factura, y los modelos escriben con gusto más de lo que se les pide.
7. Mantén el razonamiento bajo control
Los modelos de razonamiento escriben tokens de «pensamiento» ocultos que se cobran como salida, a veces miles por respuesta. Reduce o desactiva el razonamiento en las solicitudes sencillas y fija un presupuesto de razonamiento cuando el proveedor lo permita. El análisis sobre lo que cuesta pensar da las cifras.
8. Elige un modelo adecuado para tu idioma
Un mismo texto puede necesitar cantidades de tokens muy distintas según el modelo, sobre todo fuera del inglés. En algunos idiomas, la diferencia entre familias de modelos es mayor que la diferencia entre sus precios. Busca el tuyo en la herramienta la mejor IA para tu idioma.
9. Revisa cada pocos meses
Los precios cambian a menudo, normalmente a la baja, y el modelo de gama alta del año pasado puede ser barato hoy. Sigue el registro de cambios o las fuentes RSS, y rehaz tus cálculos cuando algo se mueva.
Nada de esto exige una arquitectura nueva. Los tres primeros pasos suelen ser rápidos de poner en marcha, y son los que más diferencia marcan.