Glossaire de l’IA
Qu’est-ce qu’un token, une fenêtre de contexte, un modèle de raisonnement, le RAG ou le fine-tuning ? 36 termes de l’IA expliqués simplement.
- Grand modèle de langage (LLM)
- Un modèle d’IA entraîné sur d’immenses quantités de texte pour prédire la suite d’un texte. En le faisant très bien, il apprend à répondre à des questions, rédiger, traduire, résumer et programmer. Claude, GPT et Gemini sont des LLM.
- Token (jeton)
- L’unité que le modèle lit et écrit. Un token est un mot ou un morceau de mot : en anglais, 1 000 tokens font environ 750 mots. Le français, et plus encore l’arabe, demandent en général davantage de tokens pour le même sens. Les prix des API sont calculés en tokens.
- Fenêtre de contexte
- La quantité maximale de texte, comptée en tokens, qu’un modèle peut prendre en compte en une fois : vos instructions, la conversation, les documents joints et sa propre réponse. Une fenêtre de 200K contient environ un livre de 500 pages.
- Prix d’entrée et de sortie
- Les fournisseurs d’API facturent séparément les tokens que vous envoyez (entrée) et ceux que le modèle écrit (sortie), en général par million de tokens. La sortie coûte souvent 3 à 8 fois plus cher, car générer du texte demande plus de calcul.
- Modèle de raisonnement
- Un modèle capable de résoudre un problème étape par étape avant de donner sa réponse finale, ce qu’on appelle parfois « réfléchir ». Il est plus lent et consomme plus de tokens, mais il est nettement meilleur en mathématiques, logique, planification et code difficile.
- Multimodal
- Un modèle qui traite plusieurs types de données : par exemple, il peut lire des images, des PDF, de l’audio ou de la vidéo en plus du texte, ou générer des images en plus du texte.
- Poids ouverts
- Un modèle dont les paramètres entraînés sont publiés, de sorte que chacun peut le télécharger et l’exécuter sur son propre ordinateur ou serveur. Llama, Gemma, Qwen, DeepSeek et de nombreux modèles Mistral sont à poids ouverts. Ce n’est pas toujours de l’open source : les données et le code d’entraînement peuvent rester privés, et les licences varient.
- Paramètres
- Les nombres internes qu’un modèle apprend pendant l’entraînement. La taille d’un modèle est souvent exprimée en milliards de paramètres (par exemple « 70B »). Plus de paramètres signifie en général plus de capacités, mais aussi plus de mémoire et de coût.
- Mélange d’experts (MoE)
- Une architecture où seule une partie du réseau, quelques « experts », est utilisée pour chaque token. Un modèle peut compter des centaines de milliards de paramètres au total tout en n’en utilisant qu’une fraction à chaque étape, ce qui le rend moins cher et plus rapide.
- Prompt (requête)
- Le texte que vous donnez au modèle : votre question, vos instructions et d’éventuels exemples ou documents. Un prompt clair, avec du contexte et des exemples, donne en général de bien meilleures réponses.
- Prompt système
- Des instructions définies par le développeur d’une application, valables pour toute la conversation : rôle de l’assistant, ton, règles. L’utilisateur ne les voit généralement pas.
- Hallucination
- Quand un modèle affirme avec assurance quelque chose de faux, comme une citation, une référence ou un chiffre inventés. Les modèles récents hallucinent moins, mais les faits importants doivent toujours être vérifiés, idéalement à la source.
- RAG (génération augmentée par récupération)
- Une technique où l’application cherche d’abord des passages pertinents dans vos documents ou sur le web, puis les donne au modèle avec la question. Le modèle répond à partir de vraies sources, ce qui réduit les hallucinations et lui permet d’utiliser des informations privées ou récentes.
- Embeddings (plongements)
- Des listes de nombres qui représentent le sens d’un texte, de sorte que des textes proches obtiennent des nombres proches. Ils servent à la recherche sémantique, aux recommandations et au RAG.
- Fine-tuning (ajustement fin)
- Entraîner davantage un modèle existant sur vos propres exemples pour qu’il adopte un style, un format ou une expertise précise. C’est moins souvent nécessaire aujourd’hui : de bons prompts et le RAG règlent la plupart des besoins pour moins cher.
- Agent IA
- Un modèle qui poursuit un objectif en plusieurs étapes de manière autonome : il planifie, utilise des outils (recherche, code, navigateur, autres applications), vérifie les résultats et continue jusqu’à ce que la tâche soit terminée.
- Appel d’outils (function calling)
- La capacité d’un modèle à demander à une application d’exécuter une fonction, comme chercher sur le web, interroger une base de données ou envoyer un e-mail, puis à utiliser le résultat dans sa réponse. C’est la brique de base des agents IA.
- MCP (Model Context Protocol)
- Un standard ouvert, lancé par Anthropic, pour connecter les assistants IA à des outils et des sources de données de façon uniforme. Une application compatible MCP peut se brancher sur n’importe quel serveur MCP : agenda, dépôt de code, base de données…
- Mise en cache du prompt
- Une réduction quand on renvoie le même début de prompt, comme un long document ou un prompt système. Le fournisseur le garde en mémoire et facture ensuite un prix « entrée en cache » bien plus bas, souvent autour d’un dixième du prix normal.
- Benchmark (banc d’essai)
- Un test standard pour comparer les modèles : problèmes de maths, tâches de code, questions d’examen… Utile comme repère, mais les résultats peuvent être optimisés artificiellement et ne reflètent pas toujours l’usage réel : le mieux est de tester sur vos propres tâches.
- Date limite des connaissances
- La date après laquelle le modèle n’a plus vu de données d’entraînement. Il ignore les événements ultérieurs, sauf si l’application lui donne accès à une recherche ou à des documents.
- Température
- Un réglage qui contrôle le degré d’aléatoire des réponses. Une température basse donne des réponses précises et reproductibles ; une température haute des réponses plus variées et créatives.
- API
- Un moyen pour un logiciel d’utiliser un modèle directement, sans interface de chat. Les développeurs envoient une requête avec le prompt, reçoivent la réponse et paient selon les tokens utilisés.
- Distillation
- Entraîner un modèle plus petit et moins cher à imiter un modèle plus grand. Beaucoup de modèles « mini », « flash » ou « lite » sont conçus ainsi : ils gardent une grande partie de la qualité pour une fraction du prix.
- Quantification
- Stocker les nombres d’un modèle avec moins de précision (par exemple 4 bits au lieu de 16) pour qu’il demande moins de mémoire et tourne sur du matériel plus modeste, au prix d’une légère baisse de qualité. Courant pour faire tourner des modèles ouverts sur un ordinateur portable.
- Sortie maximale
- La plus longue réponse qu’un modèle peut écrire d’un coup, comptée en tokens. Un long rapport ou beaucoup de code demande une limite élevée ; les réponses courtes, non.
- Sortie structurée
- Le modèle peut répondre dans un format exact que vous définissez, par exemple du JSON avec des champs fixes, pour qu’un programme lise la réponse sans erreur.
- Offre gratuite
- Une version gratuite du modèle proposée via l’API, en général avec des limites basses sur le nombre de requêtes. Utile pour essayer, rarement suffisante pour un produit.
- Disponibilité
- La part des requêtes auxquelles un fournisseur a répondu sans erreur au cours des dernières 24 heures. 99 % signifie environ une requête échouée sur cent.
- Tokeniseur
- La partie d’un modèle qui découpe le texte en tokens avant qu’il ne le lise. Chaque famille de modèles a le sien : c’est pourquoi un même texte ne compte pas le même nombre de tokens d’un modèle à l’autre.
Tests et scores
Les tests indépendants derrière les scores de ce site. Chacun vérifie une compétence différente ; l’indice général en combine beaucoup.
- Indice général
- Epoch Capabilities Index : un score unique qui combine des dizaines de benchmarks, pour comparer des modèles testés sur des épreuves différentes. Plus il est élevé, mieux c’est ; c’est un indice, pas un pourcentage.
- GPQA Diamond
- Questions à choix multiples très difficiles en biologie, physique et chimie, rédigées par des docteurs. Répondre au hasard donne 25 %.
- SWE-bench Verified
- Le modèle sait-il corriger de vrais bugs dans de vrais projets logiciels open source ? Part des tâches résolues.
- Maths AIME
- Problèmes de mathématiques de niveau concours, dans le style de l’AIME américain. Part des problèmes résolus.
- FrontierMath
- Problèmes de mathématiques inédits écrits par des mathématiciens professionnels, du niveau avancé au niveau recherche. Part résolue.
- SimpleQA Verified
- Questions factuelles courtes. Mesure à quelle fréquence le modèle donne le bon fait au lieu d’inventer.