« Combien ça va coûter ? » : c’est la première question avant de mettre un modèle d’IA face à des clients. La réponse honnête : cela dépend du modèle bien plus que de tout le reste. Avec les prix à jour de ce site, nous avons chiffré trois usages courants avec trois modèles :
- GPT-6 Astra (OpenAI), le modèle le mieux noté que nous suivons (indice général 166,6) ;
- GPT-5.6 Sol (OpenAI), le mieux noté parmi ceux qui coûtent au plus un cinquième de ce prix (162,0) ;
- DeepSeek V4 Flash 0731 (DeepSeek), le modèle le moins cher qui reste au-dessus de la médiane de tous les modèles notés (154,5, pour une médiane de 145,8).
Les trois usages
- Bot de support client : 1 000 conversations par jour, d’environ quatre messages. Chaque message renvoie les instructions et toute la conversation : une conversation lit donc environ 6 000 tokens et en écrit environ 800.
- Questions sur les documents de l’entreprise : 300 questions par jour, chacune traitée à partir d’environ 12 000 tokens de passages retrouvés, avec une réponse de 400 tokens.
- Assistant de code pour une équipe d’une dizaine de développeurs : 1 500 requêtes par jour, 8 000 tokens de code en entrée et 1 000 en sortie.
La facture mensuelle
| Usage | GPT-6 Astra (166,6) | GPT-5.6 Sol (162,0) | DeepSeek V4 Flash 0731 (154,5) |
|---|---|---|---|
| Bot de support client | 3 000 $US | 600 $US | 10,92 $US |
| Questions sur les documents de l’entreprise | 1 260 $US | 252 $US | 3,10 $US |
| Assistant de code (équipe de ~10) | 5 850 $US | 1 170 $US | 20,88 $US |
Coût mensuel en dollars américains (30 jours), avec l’indice général de chaque modèle entre parenthèses.
Le même bot de support coûte 3 000 $US par mois avec GPT-6 Astra, 600 $US avec GPT-5.6 Sol et 10,92 $US avec DeepSeek V4 Flash 0731 : 275× entre le premier et le dernier. Les prix par token diffèrent à ce point, et un produit très utilisé multiplie chaque écart par des millions de tokens.
Où part l’argent
Deux choses font la facture. D’abord ce que le modèle lit : les applications de chat renvoient les instructions et toute la conversation à chaque message, si bien qu’une longue conversation coûte bien plus que son dernier message ne le laisse penser, et les outils documentaires lisent des milliers de tokens de contexte pour chaque question. Ensuite ce que le modèle écrit : avec GPT-6 Astra, un token de sortie coûte 5× le prix d’un token d’entrée, et les modèles de raisonnement écrivent en plus des tokens de « réflexion » cachés, facturés comme de la sortie (voir ce que coûte la réflexion).
Trois façons de la réduire
- Le cache de prompt. Si 50 % de ce que lit chaque conversation de support vient du cache, la facture de GPT-6 Astra passe de 3 000 $US à 2 190 $US. Les instructions, exemples et documents qui se répètent sont les candidats évidents.
- Un mix de modèles. Envoyez les 70 % de conversations les plus simples à DeepSeek V4 Flash 0731 et gardez GPT-6 Astra pour le reste : 908 $US par mois au lieu de 3 000 $US. Testez votre propre répartition dans le simulateur de mix de modèles.
- Moins de contexte. Résumez les longues conversations au lieu de les renvoyer en entier, et récupérez moins de passages, mais plus pertinents, dans vos documents.
Alors, quel modèle choisir ?
Le prix n’est que la moitié de la question. Les modèles moins chers obtiennent des scores plus bas aux tests indépendants (154,5 contre 166,6 à l’indice général), et l’importance de cet écart dépend entièrement de votre tâche. Faites passer 30 de vos vraies conversations dans deux ou trois candidats avant de décider, et utilisez le calculateur de coût pour chiffrer vos propres volumes avec chaque modèle.
Les prix derrière ces chiffres se mettent à jour plusieurs fois par jour, et cette page est recalculée avec eux.
Les chiffres de cet article sont recalculés à partir de nos données à chaque mise à jour (dernière : 30 sept. 2026). Notre méthode