Cómo ejecutar un modelo de IA en tu ordenador

Ejecuta una IA en casa, gratis y sin conexión, en un cuarto de hora: qué necesita tu ordenador, LM Studio u Ollama, y qué tamaño de modelo elegir.

Ejecutar un modelo de IA en tu propio ordenador suena técnico, pero hoy es casi tan fácil como instalar un juego. Es gratis, funciona sin conexión una vez descargado el modelo y nada de lo que escribes sale de tu equipo. Así se hace, paso a paso.

1. Comprueba qué tiene tu ordenador

Lo que más importa es la memoria. En un PC, es la memoria de la tarjeta gráfica (VRAM): en Windows, abre el Administrador de tareas, luego Rendimiento, luego GPU, y mira «Memoria de GPU dedicada». Con 8 GB bastan los modelos pequeños, con 12 a 16 GB los buenos modelos medianos, y con 24 GB los mejores que caben en casa. En un Mac con chip de Apple (M1 o posterior), la memoria es compartida y cerca del 70 % puede ir al modelo: 16 GB sirven para modelos pequeños, 32 GB o más abren los medianos. Sin tarjeta gráfica, los modelos pequeños funcionan igualmente en el procesador, aunque despacio.

La herramienta ¿Puede mi PC ejecutarlo? hace la comparación por ti: elige tu tarjeta gráfica o tu Mac y verás los modelos que caben.

2. Elige una aplicación

  • LM Studio es la más fácil: una aplicación normal para Windows, Mac y Linux, con una ventana de chat y un buscador de modelos integrado. Elígela si nunca has usado un terminal.
  • Ollama es un pequeño programa que se usa desde la línea de comandos o a través de otras aplicaciones construidas sobre él. Elígelo si más adelante quieres conectar el modelo a otras herramientas.

Las dos se descargan gratis y obtienen los modelos de las mismas fuentes públicas. Puedes instalar ambas y decidir después.

3. Descarga un modelo

En LM Studio, abre la pestaña Discover (la lupa), escribe el nombre de un modelo y elige una versión: la aplicación te avisa cuando un archivo probablemente sea demasiado grande para tu memoria. En Ollama basta una línea: ollama run seguido del nombre del modelo, por ejemplo ollama run qwen3, descarga el modelo y abre un chat en la misma ventana.

4. Elige el tamaño adecuado

La mayoría de los modelos existen en varios tamaños, contados en miles de millones de parámetros (la «B» de nombres como 8B o 27B), y en varios niveles de compresión. Una buena opción por defecto es la versión marcada Q4_K_M: comprimida a unos 4 bits, necesita aproximadamente 0,6 GB de memoria por cada mil millones de parámetros y pierde muy poca calidad. Con una conversación normal, un modelo 8B necesita entonces unos 6 GB y uno de 27B unos 18 GB. Si un modelo no cabe, elige un tamaño menor antes que una compresión más fuerte: por debajo de 4 bits, la calidad cae más rápido.

5. Empieza a chatear, conociendo los límites

Una vez cargado, el modelo funciona como cualquier asistente de chat. Cuenta con que sea más lento que los grandes servicios en línea, sobre todo con documentos largos, y algo menos capaz: la mejor IA según tu tarjeta gráfica muestra a qué distancia de los mejores quedan los modelos caseros. Un modelo local tampoco sabe nada de la actualidad reciente, salvo que le pegues el texto, y la mayoría de las instalaciones no buscan en la web.

6. Úsalo desde tus otras aplicaciones (opcional)

Las dos aplicaciones pueden lanzar un pequeño servidor local que responde en el mismo formato que la API de OpenAI. Actívalo desde la pestaña Developer de LM Studio; Ollama lo mantiene en marcha solo, en segundo plano. Cualquier herramienta que permita cambiar la dirección de la API puede entonces usar tu modelo local en lugar de un servicio de pago, sin coste por token.

Conviene saber

  • Los modelos son archivos grandes: de 2 a 5 GB los pequeños y 20 GB o más los grandes. Comprueba antes tu espacio libre en disco.
  • Descarga los modelos desde la aplicación o desde la página oficial del editor, no desde enlaces cualquiera.
  • Revisa la licencia antes de usar un modelo en el trabajo: la mayoría de los modelos abiertos permiten el uso comercial, algunos con condiciones.