Faire tourner un modèle d’IA sur son propre ordinateur a l’air technique, mais c’est devenu à peu près aussi simple qu’installer un jeu. C’est gratuit, cela fonctionne sans connexion une fois le modèle téléchargé, et rien de ce que vous tapez ne quitte votre machine. Voici comment faire, étape par étape.
1. Vérifiez ce que contient votre ordinateur
Le plus important est la mémoire. Sur un PC, c’est la mémoire de la carte graphique (VRAM) : sous Windows, ouvrez le Gestionnaire des tâches, puis Performance, puis GPU, et lisez « Mémoire GPU dédiée ». 8 Go suffisent pour les petits modèles, 12 à 16 Go pour de bons modèles moyens, 24 Go pour les meilleurs qui tiennent à la maison. Sur un Mac à puce Apple (M1 ou plus récent), la mémoire est partagée et environ 70 % peuvent servir au modèle : 16 Go conviennent aux petits modèles, 32 Go ou plus ouvrent les modèles moyens. Sans carte graphique, les petits modèles tournent quand même sur le processeur, mais lentement.
L’outil Mon PC peut-il le faire tourner ? fait la correspondance pour vous : choisissez votre carte graphique ou votre Mac, et il liste les modèles qui tiennent.
2. Choisissez une application
- LM Studio est la plus simple : une application classique pour Windows, Mac et Linux, avec une fenêtre de discussion et une recherche de modèles intégrée. À choisir si vous n’avez jamais utilisé de terminal.
- Ollama est un petit programme qui s’utilise en ligne de commande, ou à travers d’autres applications construites dessus. À choisir si vous voulez ensuite relier le modèle à d’autres outils.
Les deux se téléchargent gratuitement et récupèrent leurs modèles aux mêmes sources publiques. Vous pouvez installer les deux et décider plus tard.
3. Téléchargez un modèle
Dans LM Studio, ouvrez l’onglet Discover (la loupe), tapez le nom d’un modèle et choisissez une version : l’application vous prévient quand un fichier risque d’être trop gros pour votre mémoire. Dans Ollama, une ligne suffit : ollama run suivi du nom du modèle, par exemple ollama run qwen3, télécharge le modèle et ouvre une discussion dans la même fenêtre.
4. Choisissez la bonne taille
La plupart des modèles existent en plusieurs tailles, comptées en milliards de paramètres (le « B » de noms comme 8B ou 27B), et en plusieurs niveaux de compression. Un bon choix par défaut est la version marquée Q4_K_M : compressée à environ 4 bits, elle demande à peu près 0,6 Go de mémoire par milliard de paramètres et perd très peu en qualité. Avec une conversation normale, un modèle 8B demande alors environ 6 Go, et un modèle 27B environ 18 Go. Si un modèle ne tient pas, prenez une taille plus petite plutôt qu’une compression plus forte : en dessous de 4 bits, la qualité baisse plus vite.
5. Discutez, en connaissant les limites
Une fois chargé, le modèle fonctionne comme n’importe quel assistant de discussion. Attendez-vous à ce qu’il soit plus lent que les grands services en ligne, surtout avec de longs documents, et un peu moins capable : la meilleure IA selon votre carte graphique montre à quelle distance des meilleurs se trouvent les modèles maison. Un modèle local ne sait rien non plus de l’actualité récente, sauf si vous lui collez le texte, et la plupart des installations ne cherchent pas sur le web.
6. Utilisez-le depuis vos autres applications (facultatif)
Les deux applications peuvent lancer un petit serveur local qui répond dans le même format que l’API d’OpenAI. Démarrez-le depuis l’onglet Developer de LM Studio ; Ollama le fait tourner tout seul en arrière-plan. Tout outil qui permet de changer l’adresse de l’API peut alors utiliser votre modèle local à la place d’un service payant, sans coût par token.
Bon à savoir
- Les modèles sont de gros fichiers, de 2 à 5 Go pour les petits jusqu’à 20 Go ou plus. Vérifiez d’abord votre espace disque libre.
- Téléchargez les modèles depuis l’application ou la page officielle de l’éditeur, pas depuis des liens trouvés au hasard.
- Vérifiez la licence avant un usage professionnel : la plupart des modèles ouverts autorisent l’usage commercial, certains sous conditions.