Les prix des API d’IA expliqués : tokens, entrée, sortie et cache

Comment fonctionne la tarification des modèles d’IA, pourquoi la sortie coûte plus cher que l’entrée, et comment estimer votre facture mensuelle avec un exemple chiffré.

Chaque fiche modèle de ce site affiche deux prix, par exemple « 3 $ / 15 $ ». Voici ce qu’ils signifient et comment les transformer en budget mensuel réel.

On paie au token

Les modèles lisent et écrivent en tokens : des mots ou morceaux de mots. En anglais, 1 000 tokens représentent environ 750 mots. Le français demande en général 20 à 30 % de tokens en plus pour le même texte, et l’arabe souvent davantage, car les tokeniseurs ont longtemps été entraînés surtout sur de l’anglais. Si votre application fonctionne en français ou en arabe, prévoyez-le dans votre budget.

Entrée et sortie sont facturées séparément

Le premier prix concerne l’entrée, les tokens envoyés : instructions, historique, documents. Le second concerne la sortie, les tokens écrits par le modèle. La sortie coûte généralement 3 à 8 fois plus cher, car chaque token produit demande un passage complet dans le modèle. Les prix sont exprimés par million de tokens.

Un exemple chiffré

Imaginons un assistant de support client. Chaque requête envoie 1 500 tokens (instructions, message du client, un peu d’historique) et reçoit une réponse de 300 tokens. Vous traitez 2 000 requêtes par jour.

  • Entrée par mois : 1 500 × 2 000 × 30 = 90 millions de tokens
  • Sortie par mois : 300 × 2 000 × 30 = 18 millions de tokens

Avec un modèle à 3 $ en entrée / 15 $ en sortie : 90 × 3 + 18 × 15 = 540 $ par mois. Avec un modèle à 0,25 $ / 1,50 $ : 90 × 0,25 + 18 × 1,50 = 49,50 $ par mois. Même trafic, onze fois moins cher. Le calculateur de coût fait ce calcul pour tous les modèles d’un coup.

Les multiplicateurs cachés

  • L’historique de conversation. Dans un chat, chaque nouveau message renvoie toute la conversation : l’entrée grossit à chaque tour.
  • Les tokens de raisonnement. Les modèles de raisonnement « réfléchissent » avant de répondre, et ces tokens sont facturés comme de la sortie. Une réponse courte peut cacher des milliers de tokens facturés.
  • Images et fichiers. Une image ou une page de PDF est aussi convertie en tokens, souvent plusieurs centaines à quelques milliers.

Comment payer moins

  • La mise en cache du prompt : si chaque requête commence par les mêmes longues instructions ou le même document, l’entrée en cache est facturée à une fraction du prix normal (indiquée « Entrée en cache » sur les fiches modèles quand elle existe).
  • Le traitement par lots : la plupart des fournisseurs offrent environ 50 % de réduction pour les requêtes qui peuvent attendre quelques heures.
  • Router selon la difficulté : envoyez les demandes simples à un petit modèle et seulement les difficiles à un modèle phare.
  • Des prompts sobres : raccourcissez l’historique et évitez de coller des documents entiers quand un extrait suffit.

Les prix changent souvent, en général à la baisse. Notre journal des changements enregistre chaque variation de prix détectée.