Glosario de IA
¿Qué es un token, una ventana de contexto, un modelo de razonamiento, RAG o el fine-tuning? 36 términos de IA explicados en lenguaje sencillo.
- Gran modelo de lenguaje (LLM)
- Un modelo de IA entrenado con enormes cantidades de texto para predecir el siguiente fragmento de texto. Al hacerlo muy bien, aprende a responder preguntas, redactar, traducir, resumir y programar. Claude, GPT y Gemini son LLM.
- Token
- La unidad que un modelo lee y escribe. Un token es una palabra o un trozo de palabra: en inglés, 1000 tokens equivalen a unas 750 palabras. El texto en español o en francés, y sobre todo en árabe, suele necesitar más tokens para decir lo mismo. Los precios de las API se calculan en tokens.
- Ventana de contexto
- La cantidad máxima de texto, medida en tokens, que un modelo puede tener en cuenta a la vez: tus instrucciones, la conversación hasta el momento, los documentos que adjuntes y su propia respuesta. Una ventana de contexto de 200K equivale aproximadamente a un libro de 500 páginas.
- Precio de entrada y de salida
- Los proveedores de API cobran por separado los tokens que envías (entrada) y los que escribe el modelo (salida), normalmente por millón de tokens. La salida suele costar entre 3 y 8 veces más que la entrada, porque generar texto requiere más cálculo.
- Modelo de razonamiento
- Un modelo que puede resolver un problema paso a paso antes de dar su respuesta final, lo que a veces se llama «pensar». Es más lento y usa más tokens, pero rinde claramente mejor en matemáticas, lógica, planificación y tareas de programación difíciles.
- Multimodal
- Un modelo que trabaja con más de un tipo de datos: por ejemplo, puede leer imágenes, PDF, audio o video además de texto, o generar imágenes además de texto.
- Pesos abiertos
- Un modelo cuyos parámetros entrenados se publican para que cualquiera pueda descargarlo y ejecutarlo en su propio equipo o servidor. Llama, Gemma, Qwen, DeepSeek y muchos modelos de Mistral son de pesos abiertos. «Pesos abiertos» no siempre equivale a código abierto: los datos y el código de entrenamiento pueden seguir siendo privados, y las licencias varían.
- Parámetros
- Los valores internos que un modelo aprende durante el entrenamiento. El tamaño de los modelos suele expresarse en miles de millones de parámetros (por ejemplo, «70B»). Más parámetros suelen significar más capacidad, pero también más memoria y más costo de ejecución.
- Mezcla de expertos (MoE)
- Un diseño de modelo en el que solo se usa una parte de la red, unos pocos «expertos», para cada token. Un modelo puede tener cientos de miles de millones de parámetros en total y usar solo una fracción en cada paso, lo que lo hace más barato y rápido de ejecutar.
- Prompt
- El texto que le das a un modelo: tu pregunta, tus instrucciones y los ejemplos o documentos que añadas. Los prompts claros, con contexto y ejemplos, suelen obtener respuestas mucho mejores.
- Prompt de sistema
- Instrucciones que define el desarrollador de una aplicación y que se aplican a toda la conversación, como el papel del asistente, su tono y sus reglas. Normalmente el usuario no las ve.
- Alucinación
- Cuando un modelo afirma algo falso con total seguridad, como una cita, una referencia o una cifra inventadas. Los modelos recientes alucinan menos, pero conviene verificar los datos importantes, idealmente con una fuente.
- RAG (generación aumentada por recuperación)
- Una técnica en la que una aplicación busca primero pasajes relevantes en tus documentos o en la web y luego se los da al modelo junto con la pregunta. El modelo responde a partir de fuentes reales, lo que reduce las alucinaciones y le permite usar información privada o reciente.
- Embeddings
- Listas de números que representan el significado de un texto, de modo que textos parecidos obtienen números parecidos. Hacen posible la búsqueda semántica, las recomendaciones y el RAG.
- Fine-tuning (ajuste fino)
- Seguir entrenando un modelo existente con tus propios ejemplos para que adopte un estilo, un formato o una especialidad concretos. Hoy suele hacer menos falta: unos buenos prompts y el RAG resuelven la mayoría de los problemas de forma más barata.
- Agente de IA
- Un modelo que avanza hacia un objetivo en varios pasos por su cuenta: planifica, usa herramientas (búsqueda, código, un navegador, otras aplicaciones), comprueba los resultados y continúa hasta completar la tarea.
- Uso de herramientas (function calling)
- La capacidad de un modelo de pedir a una aplicación que ejecute una función, como buscar en la web, consultar una base de datos o enviar un correo, y luego usar el resultado en su respuesta. Es la pieza básica de los agentes de IA.
- MCP (Model Context Protocol)
- Un estándar abierto, presentado por Anthropic, para conectar asistentes de IA con herramientas y fuentes de datos de forma uniforme. Una aplicación compatible con MCP puede conectarse a cualquier servidor MCP, como un calendario, un repositorio de código o una base de datos.
- Caché de prompts
- Un descuento por volver a enviar el mismo comienzo de un prompt, como un documento largo o un prompt de sistema. El proveedor lo guarda y, las veces siguientes, cobra un precio de «entrada en caché» mucho más bajo, a menudo alrededor de una décima parte del precio normal.
- Benchmark
- Una prueba estándar para comparar modelos, como un conjunto de problemas de matemáticas, tareas de programación o preguntas de examen. Sirve como guía aproximada, pero los resultados se pueden manipular y no siempre reflejan el uso real: lo mejor es probar con tus propias tareas.
- Fecha de corte del conocimiento
- La fecha a partir de la cual un modelo no ha visto datos de entrenamiento. No sabrá nada de acontecimientos posteriores, salvo que la aplicación le dé acceso a búsquedas o documentos.
- Temperatura
- Un ajuste que controla cuán aleatorias son las respuestas de un modelo. Una temperatura baja da respuestas centradas y repetibles; una alta, respuestas más variadas y creativas.
- API
- Una forma de que un programa use un modelo directamente, sin interfaz de chat. Los desarrolladores envían una solicitud con el prompt, reciben la respuesta y pagan por los tokens usados.
- Destilación
- Entrenar un modelo más pequeño y barato para que imite a uno más grande. Muchos modelos «mini», «flash» o «lite» se crean así: conservan buena parte de la calidad por una fracción del precio.
- Cuantización
- Guardar los números de un modelo con menos precisión (por ejemplo, 4 bits en lugar de 16) para que necesite menos memoria y funcione en equipos más modestos, a cambio de una pequeña pérdida de calidad. Es habitual para ejecutar modelos abiertos en un equipo portátil.
- Salida máxima
- La respuesta más larga que un modelo puede escribir de una vez, medida en tokens. Un informe largo o mucho código necesita un límite alto; las respuestas cortas, no.
- Salida estructurada
- El modelo puede responder en un formato exacto que tú defines, como JSON con campos fijos, para que un programa lea la respuesta sin errores.
- Nivel gratuito
- Una versión gratuita del modelo disponible por API, normalmente con límites bajos de solicitudes. Sirve para probar, pero rara vez basta para un producto.
- Disponibilidad
- La proporción de solicitudes que un proveedor respondió sin error en las últimas 24 horas. Un 99 % significa aproximadamente una solicitud fallida de cada cien.
- Tokenizador
- La parte de un modelo que corta el texto en tokens antes de leerlo. Cada familia de modelos tiene el suyo, por eso un mismo texto no ocupa los mismos tokens en todos los modelos.
Pruebas y puntuaciones
Las pruebas independientes detrás de las puntuaciones de este sitio. Cada una comprueba una habilidad distinta; el índice general combina muchas de ellas.
- Índice general
- Epoch Capabilities Index: una sola puntuación que combina decenas de benchmarks, para poder comparar modelos evaluados con pruebas distintas. Cuanto más alto, mejor; es un índice, no un porcentaje.
- GPQA Diamond
- Preguntas de opción múltiple muy difíciles de biología, física y química, escritas por expertos con doctorado. Responder al azar da un 25 %.
- SWE-bench Verified
- ¿Puede el modelo corregir errores reales en proyectos reales de software de código abierto? Porcentaje de tareas resueltas.
- Matemáticas AIME
- Problemas de matemáticas de nivel de competición, al estilo del American Invitational Mathematics Examination. Porcentaje resuelto.
- FrontierMath
- Problemas de matemáticas originales e inéditos escritos por matemáticos profesionales, desde nivel avanzado hasta nivel de investigación. Porcentaje resuelto.
- SimpleQA Verified
- Preguntas factuales cortas. Mide con qué frecuencia el modelo acierta los datos en lugar de inventárselos.