S'il ne fallait retenir que trois chiffres, ce serait « 70x, 180x, 2 % ». C'est à peu près l'écart de prix en entrée et en sortie entre le modèle le moins cher et le plus cher de ce comparatif, et le niveau auquel un cache hit peut faire chuter le tarif par rapport au prix sans cache. Ensemble, ces chiffres dessinent la réalité de la tarification des modèles d'IA en août 2026 : ce n'est plus un simple classement « plus cher = plus intelligent », mais un grand livre de comptes réellement complexe, construit à partir de remises de cache, de paliers de contexte long, de tarification de pointe selon l'heure, de curseurs d'effort de raisonnement, et de facturation à l'abonnement qui coexiste avec la facturation à l'usage. Et ce livre de comptes bouge plus vite qu'on ne l'imagine généralement : rien que sur la fenêtre de cette enquête, Claude Opus 5 a discrètement pris la relève d'Opus 4.8, Qwen3.8-Max est passé d'une préversion sans tarif à une sortie officielle tarifée du jour au lendemain, DeepSeek aurait mis en place le seul mécanisme de tarification selon l'heure de la journée de tout ce comparatif, et le très attendu Gemini 3.5 Pro de Google a glissé de juin à juillet puis, désormais, à « aucune date communiquée ». Cet article déroule ce livre de comptes dans son intégralité.
Cet article couvre les modèles phares actuels d'OpenAI, Anthropic, Google, DeepSeek, Moonshot (Kimi), Alibaba (Qwen), Zhipu (GLM), xAI et MiniMax. Notre méthode comporte deux niveaux : d'abord, nous réutilisons les chiffres déjà vérifiés dans nos propres tests publiés sur ce site (DeepSeek V4 Flash, rapport qualité-prix de Grok 4.5, GLM-5.2, Kimi K3 vs Qwen3.8-Max-Preview, l'annonce d'Astra chez OpenAI, MiniMax H3, entre autres) ; ensuite, nous avons mené une recherche indépendante et récente spécifiquement sur les évolutions les plus rapides de cette période, et nous signalons comme « non vérifié » tout ce sur quoi les sources divergent, plutôt que d'inventer un chiffre propre. Avant publication, nous avons aussi mené une vérification supplémentaire spécifiquement sur la rumeur de tarification de pointe chez DeepSeek et le tarif tout juste officialisé de Qwen3.8-Max — ce que cette vérification a révélé est signalé explicitement plus bas.
Sommaire
- 1. Le tableau complet des prix : la gamme actuelle des neuf laboratoires en un coup d'œil
- 2. OpenAI — les trois tiers de GPT-5.6 viennent de baisser, Astra reste une page blanche
- 3. Anthropic — Opus 5 arrive au même prix, Fable/Mythos 5 restent le plafond
- 4. Google — le vrai modèle en vente est 3.1 Pro ; 3.5 Pro n'est toujours pas sorti
- 5. DeepSeek — d'une baisse permanente de 75 % à la tarification de pointe (vérifié)
- 6. Moonshot/Kimi — le tarif de K3 ne bouge pas, mais le raisonnement est verrouillé au maximum
- 7. Alibaba/Qwen — Qwen3.8-Max vient tout juste de passer en disponibilité générale (vérifié)
- 8. Zhipu/GLM — le prix officiel n'est même pas l'endroit le moins cher pour l'acheter
- 9. xAI — Grok 4.5 est disponible, 4.6/4.7 n'existent que dans des tweets
- 10. MiniMax — M3 est le fleuron texte/agent, à ne pas confondre avec H3
- 11. Ce qui décide vraiment de votre facture : cache, tarification de pointe, effort de raisonnement, paliers de vitesse
- 12. Le point de vue des relais : poids ouverts et modèles fermés, deux économies différentes
- 13. Six enseignements
- 14. Fraîcheur des données et ce que nous avons revérifié avant publication
- 15. Conclusion : comment utiliser concrètement ce tableau
1. Le tableau complet des prix : la gamme actuelle des neuf laboratoires en un coup d'œil
Commençons par les chiffres eux-mêmes. Le tableau ci-dessous regroupe les modèles par fournisseur, à peu près triés par prix d'entrée, et couvre tout ce qui est actuellement disponible en général (GA) chez les neuf laboratoires début août 2026. Là où les sources divergent réellement, nous écrivons « non vérifié » plutôt que de forcer un chiffre unique.
| Fournisseur | Modèle | Statut | Entrée $/M | Sortie $/M | Contexte | Notes |
|---|---|---|---|---|---|---|
| DeepSeek | V4-Flash | GA (version du 31/07) | 0,14 $ (cache hit 0,0028 $) | 0,28 $ | 1M | Aucune surtaxe de pointe ; parmi les prix d'entrée les plus bas du marché |
| Alibaba/Qwen | Qwen3.6-35B-A3B | GA | 0,14 $ | 0,90 $ | — | Le modèle multimodal le moins cher de ce comparatif |
| DeepSeek | V4-Pro | GA | 0,435 $ (hors pointe) | 0,87 $ (hors pointe) | 1M | Une surtaxe de pointe x2 a été annoncée mais, au moment de la publication, n'est pas encore active — voir section 5 |
| MiniMax | M3 (modèle texte/agent) | GA (1er juin) | 0,30 $ (prix catalogue 0,60 $, « -50 % permanent ») | 1,20 $ | 1M (double au-delà de 512K) | MoE 428 Md au total / 23 Md actifs, multimodal natif + utilisation d'ordinateur |
| MiniMax | M2.1 (génération précédente) | GA | 0,30 $ | 1,20 $ | ~262K | Même prix que M3, qui vend surtout le contexte et la vitesse |
| Zhipu/GLM | GLM-5.2 | GA (13 juin, poids sous licence MIT) | 1,40 $ (cache hit 0,26 $) | 4,40 $ | 1M (128K sortie max) | Prix officiel vs médiane tierce ~0,55 $/1,85 $ — voir sections 8 et 12 |
| Qwen | Qwen3.8-Max | Vient de passer en GA le 3 août | 2,00 $ | 6,00 $ | 1M (65 536 sortie max) | MoE 2,4 T au total / ~95 Md actifs ; poids ouverts prévus « la semaine prochaine » ; revérifié ci-dessous |
| xAI | Grok 4.5 | GA (8 juillet) | 2,00 $ (cache hit 0,50 $) | 6,00 $ | 500K (en baisse par rapport au 1M de la génération précédente) | Meilleur rapport qualité-prix parmi les modèles fermés multimodaux haut de gamme, pas le moins cher dans l'absolu |
| OpenAI | GPT-5.6 Luna | GA (baisse de 80 % le 30 juillet) | 0,20 $ (écriture cache 0,25 $ / lecture 0,02 $) | 1,20 $ | 1,05M (palier au-delà de 272K) | Palier contexte long : 0,40 $/1,80 $ |
| Moonshot | Kimi K2.7 (génération précédente) | GA | 0,95 $ (cache hit 0,19 $) | 4,00 $ | 262 144 | Moins cher que K3 mais fenêtre de contexte bien plus petite |
| Anthropic | Claude Sonnet 5 | GA | 3,00 $ (promo 2,00 $ jusqu'au 31/08/2026) | 15,00 $ (promo 10,00 $) | 1M | Retour au prix standard après la promo ; vision haute définition 2576px |
| OpenAI | GPT-5.6 Terra | GA (baisse de 20 % le 30 juillet) | 2,00 $ (écriture cache 2,50 $ / lecture 0,20 $) | 12,00 $ | 1,05M | Palier contexte long : 4,00 $/18,00 $ |
| Anthropic | Claude Opus 5 (remplace Opus 4.8) | GA (24 juillet) | 5,00 $ | 25,00 $ | 1M (128K sortie max) | Même prix qu'Opus 4.8 ; ajoute un curseur d'« effort » bas/moyen/élevé |
| OpenAI | GPT-5.6 Sol | GA | 5,00 $ (écriture cache 6,25 $) | 30,00 $ | 1,05M | « Mode rapide » : prix x2 pour une vitesse x2,5 |
| Moonshot | Kimi K3 | GA (16 juillet) | 3,00 $ (cache hit 0,30 $) | 15,00 $ | 1M (tarif unique, aucun palier long) | Mode réflexion verrouillé au maximum, impossible à désactiver ; abonnements également disponibles |
| Anthropic | Claude Fable 5 | GA | 10,00 $ | 50,00 $ | 1M (le défaut est déjà le maximum) | Réflexion toujours active ; rétention des données sur 30 jours obligatoire |
| Anthropic | Claude Mythos 5 | GA mais accès restreint | 10,00 $ | 50,00 $ (en forte baisse depuis une préversion restreinte à 25 $/125 $) | Même base que Fable | Réservé aux partenaires validés « Project Glasswing » et à certains chercheurs en biosécurité, aucun accès en libre-service |
| Gemini 3.5 Flash-Lite | GA | 0,30 $ | 2,50 $ | — | Palier léger | |
| Gemini 3.6 Flash | GA | 1,50 $ | 7,50 $ | — | Annoncé comme réduisant jusqu'à 65 % le coût des tâches d'agent longue durée | |
| Gemini 3.5 Flash | GA | Chiffres tiers contradictoires (0,15 $–1,50 $) | ~9,00 $ (également non vérifié) | — | Nous n'adoptons pas un chiffre unique vu le désaccord des sources | |
| Gemini 3.1 Pro (le vrai haut de gamme en vente) | GA (Preview) | 2,00 $ (≤200K) / 4,00 $ (>200K) | 12,00 $ (≤200K) / 18,00 $ (>200K) | Palier 200K | Certaines sources évoquent une baisse récente à 1 $/6 $, non confirmée par la documentation officielle |
Quelques noms n'existent aujourd'hui que sous forme d'annonces ou de rumeurs, sans aucun tarif officiel. Nous les listons par souci d'exhaustivité, mais chaque colonne ci-dessous est réellement « non communiquée » :
| Fournisseur | Modèle | Statut | Tarif | Notes |
|---|---|---|---|---|
| Gemini 3.5 Pro | Non sorti (« en test avec des partenaires » ; date GA passée de juin à juillet puis « à déterminer ») | Non communiqué | Contexte de 2M tokens rumeuré, non confirmé | |
| Gemini 4 | En entraînement, non sorti | Non communiqué | Pichai a déclaré le 26 juillet qu'il serait « bien plus grand qu'avant » ; le rythme historique suggère nov.-déc. | |
| xAI | Grok 4.6 | Non sorti (Musk évoque le ~7 août) | Non communiqué | ~1,5 T paramètres, uniquement les propos de Musk, aucune confirmation officielle |
| xAI | Grok 4.7 | Non sorti (« quelques semaines » après 4.6) | Non communiqué | ~2,1 T paramètres, même réserve |
| OpenAI | Astra | Seulement teasé, non sorti | Non communiqué | L'estimation de « 2 000 $ » de coût utilise le tarif actuel de Sol comme référence, pas un tarif propre à Astra |
Une précision de vocabulaire : par token désigne une facturation à l'usage classique ; tarification selon l'heure signifie que le tarif varie au sein du même barème selon le moment de la journée ; abonnement + facturation à l'usage signifie qu'un forfait mensuel et une API payante à l'usage coexistent comme deux systèmes de facturation distincts qui ne se convertissent pas proprement l'un dans l'autre — un point détaillé dans notre précédent comparatif Kimi K3 vs Qwen3.8-Max-Preview. Passons maintenant fournisseur par fournisseur.
2. OpenAI — les trois tiers de GPT-5.6 viennent de baisser, Astra reste une page blanche
Sol, Terra et Luna forment la seule gamme actuelle d'OpenAI, et elle vient de connaître une forte baisse de prix le 30 juillet (Terra -20 %, Luna -80 %, Sol inchangé) — largement interprétée comme une réponse directe aux doutes des entreprises sur le retour sur investissement de l'IA et à la pression tarifaire des modèles chinois à poids ouverts, moins chers. Les trois tiers partagent une fenêtre de contexte de 1,05M tokens et une sortie max de 128K, mais tous les trois basculent dans un palier de contexte long au-delà de 272 000 tokens (environ un doublement) : les 0,20 $/1,20 $ de Luna deviennent 0,40 $/1,80 $, les 2 $/12 $ de Terra deviennent 4 $/18 $, et les 5 $/30 $ de Sol deviennent 10 $/45 $.
Sol dispose aussi d'un « mode rapide » unique : prix x2 pour une vitesse x2,5 — le seul cas de tout ce comparatif où un fournisseur affiche un tarif explicite sur la vitesse de réponse elle-même ; chez tous les autres, « plus rapide » est soit gratuit, soit tout simplement pas proposé en option. Quant au modèle de nouvelle génération Astra, nous l'avons déjà décrypté en détail sur ce site : c'est le nom de code révélé presque en passant dans un billet de blog de recherche du 1er août consacré à des résultats mathématiques, et à ce jour OpenAI n'a toujours pas communiqué de date de sortie, de taille de modèle, de fenêtre de contexte ni de tarification API — le chiffre largement cité de « 2 000 $ de calcul » utilise lui aussi le tarif actuel de Sol comme référence, pas un tarif propre à Astra. En clair : si vous cherchez à budgéter le prix d'Astra aujourd'hui, la réponse honnête est qu'il est encore trop tôt.
3. Anthropic — Opus 5 arrive au même prix, Fable/Mythos 5 restent le plafond
Un changement de cette période, facile à manquer mais qui mérite d'être signalé à part : Claude Opus 5 a été lancé le 24 juillet et a remplacé Opus 4.8 comme fleuron actuel, présenté officiellement comme approchant l'intelligence de pointe de Fable 5 « à moitié prix », tout en conservant exactement le même tarif qu'Opus 4.8 (5 $/25 $). Si vous avez encore un plan construit autour du nom de modèle « Claude Opus 4.8 », il faut désormais le lire comme « remplacé par un successeur au même prix », et non plus comme « toujours le dernier fleuron en date ». Opus 5 ajoute un curseur d'« effort » bas/moyen/élevé, mais ce n'est pas un palier tarifaire distinct — il ne change pas le tarif unitaire, il change la quantité de raisonnement (et donc de tokens) consommée par requête ; la grille tarifaire elle-même ne comporte toujours qu'un seul chiffre.
Sonnet 5 bénéficie actuellement d'un tarif promotionnel de 2 $/10 $ (jusqu'au 31/08/2026), avant de repasser à un tarif standard de 3 $/15 $ — si vous lisez ceci après cette date, vérifiez si le tarif standard est revenu. Fable 5 (10 $/50 $) se positionne délibérément en dehors de toute logique de rapport qualité-prix : la réflexion est toujours active et ne peut pas être désactivée, et les clients entreprise doivent accepter une rétention des données de 30 jours (pas d'option de rétention zéro). Mythos 5 (également 10 $/50 $, partageant la base de Fable mais avec des garde-fous de sécurité plus légers) a fortement baissé depuis son tarif de préversion restreinte d'avril dernier (25 $/125 $), mais reste indisponible via l'API publique, claude.ai ou tout canal en libre-service — réservé aux partenaires validés « Project Glasswing » et à certains chercheurs en biosécurité, ce qui signifie que les développeurs classiques n'y ont pas accès, quel que soit le prix.
4. Google — le vrai modèle en vente est 3.1 Pro ; 3.5 Pro n'est toujours pas sorti
Il faut d'abord clarifier un point de confusion fréquent : le Gemini 3.5 Pro teasé par Google lors de l'I/O de mai n'a toujours pas été lancé au 5 août — la date de disponibilité générale est passée de juin à juillet, et au 21 juillet, la position officielle restait « en test avec des partenaires », sans nouvelle date annoncée. Il n'y a actuellement aucun tarif officiel ni aucune fenêtre de contexte officielle (les 2 millions de tokens évoqués restent non confirmés). Si vous lisez quelque part que « Gemini 3.5 Pro est disponible et voici son prix », considérez que c'est faux.
Le véritable haut de gamme actuellement en vente est Gemini 3.1 Pro (Preview) : 2 $/12 $ jusqu'à 200K de contexte, 4 $/18 $ au-delà. Quelques sources évoquent une baisse récente à 1 $/6 $, mais ce n'est pas confirmé par la documentation officielle, donc nous ne considérons pas cela comme acquis. Côté modèles légers, Gemini 3.6 Flash (1,50 $/7,50 $) et Gemini 3.5 Flash-Lite (0,30 $/2,50 $) sont tous deux confirmés ; mais le tarif de Gemini 3.5 Flash reste impossible à vérifier de façon croisée cette fois-ci — les sources se contredisent fortement, avec un prix d'entrée annoncé entre 0,15 $ et 1,50 $ selon les cas, exactement le même problème déjà signalé dans notre test de DeepSeek V4 Flash, et nous refusons ici encore d'adopter un chiffre unique juste pour remplir une case. Gemini 4 reste en entraînement ; Pichai a déclaré lors d'une interview le 26 juillet qu'il serait « bien plus grand qu'avant », et le rythme historique de sortie suggère un lancement en novembre-décembre, sans aucun signal tarifaire. À noter également : l'API Batch de Google est à -50 % sur toute la gamme avec un délai de 24 heures, et l'entrée en cache tourne à environ 10 % du tarif sans cache.
5. DeepSeek — d'une baisse permanente de 75 % à la tarification de pointe (vérifié)
DeepSeek V4-Flash (0,14 $/0,28 $) est passé de la préversion à la version GA officielle « 0731 » le 31 juillet — même architecture, mais réentraînée suffisamment pour faire nettement progresser les scores sur les tâches d'agent. Le tarif n'a pas changé, et il n'y a aucune surtaxe de pointe, ce qui constitue en soi un argument de vente face à V4-Pro, dont la facturation est en théorie plus prévisible mais en réalité en train de le devenir moins. L'événement le plus marquant concerne V4-Pro : cette enquête a mis au jour un changement que notre couverture précédente n'avait pas repéré — plusieurs médias ont rapporté que, quelques semaines après « une baisse de prix permanente de 75 % », DeepSeek a annoncé une surtaxe de pointe x2 pour les tranches 9h-12h et 14h-18h, heure de Pékin, sur V4-Pro. Cela ferait de DeepSeek le seul fournisseur majeur de tout ce comparatif à pratiquer une tarification selon l'heure de la journée — un contraste frappant avec le tarif fixe de Kimi K3, quel que soit le moment.
Vérifié avant publication : la tarification de pointe de DeepSeek n'est toujours pas active, et elle s'appliquerait à l'entrée comme à la sortie
Comme l'enquête d'origine signalait ce point comme potentiellement obsolète, nous avons mené une vérification indépendante spécifiquement sur cette affirmation avant publication. Deux éléments ont été confirmés. D'abord : début août 2026, la page tarifaire officielle de DeepSeek affiche encore un tarif unique, et plusieurs outils de suivi tarifaire tiers, qui recoupent la documentation officielle, indiquent explicitement que « la surtaxe de pointe a été annoncée, mais aucune date d'entrée en vigueur n'a été donnée, et elle n'est pas encore active » — autrement dit, au moment de la rédaction, vous payez toujours le tarif hors pointe, pas besoin de craindre un doublement immédiat de la facture. Ensuite, et ceci affine ce que l'enquête d'origine avait pu confirmer : cette surtaxe x2 est décrite par plusieurs sources comme s'appliquant à tous les postes de facturation — entrée en cache hit, entrée cache miss et sortie confondues (par exemple, une sortie hors pointe à 6 ¥/M deviendrait 12 ¥/M en heure de pointe, l'entrée suivant la même logique) — plutôt qu'à la « sortie uniquement », comme le suggéraient les sources précédentes. Une fois ce mécanisme réellement activé, consultez directement la page tarifaire officielle de DeepSeek (api-docs.deepseek.com).
Côté remises de cache, DeepSeek joue dans une catégorie à part : le tarif cache hit de V4-Flash est de 0,0028 $ (environ -98 %), et celui de V4-Pro d'environ 0,0036 $ — la remise de cache la plus agressive de tout ce comparatif, un vrai gain pour quiconque retraite sans cesse le même document long ou la même base de code.
6. Moonshot/Kimi — le tarif de K3 ne bouge pas, mais le raisonnement est verrouillé au maximum
Kimi K3 (3 $/15 $, cache hit 0,30 $, -90 %) a été lancé le 16 juillet et a ouvert ses poids complets le 27 juillet (un MoE de 2,8 T de paramètres, fichiers de poids d'environ 1,4 To après quantification MXFP4 — l'une des plus grandes sorties à poids ouverts de l'histoire à l'époque), sous une licence MIT modifiée autorisant un usage commercial. Il applique un tarif unique sur toute sa fenêtre de contexte (jusqu'à 1M), contrairement aux paliers « plus cher au-delà de X tokens » d'OpenAI ou de Google — la prévisibilité de la facture fait partie de son argumentaire.
Un point mérite d'être signalé à part : le mode réflexion de K3 est verrouillé par défaut sur son intensité maximale et ne peut pas être désactivé. Le tarif unitaire ne change pas, mais la consommation réelle de tokens de sortie est intrinsèquement plus élevée, donc la facture réelle peut dépasser ce que le tarif affiché laisse penser — une majoration qui passe par une consommation cachée plutôt que par un prix affiché plus élevé, à surveiller de près si vous passez par un fournisseur relais. En raison d'une explosion de la demande, Moonshot a suspendu les nouvelles inscriptions le 19 juillet (réouverture par lots) ; il vaut la peine de vérifier directement si c'est totalement rétabli au moment de votre lecture. La génération précédente, Kimi K2.7 (variante Code, 0,95 $/4 $, cache hit 0,19 $, contexte de 262 144), reste disponible et constitue une option raisonnable si le budget est plus serré et que le contexte d'un million de tokens n'est pas nécessaire. Par ailleurs, un système d'abonnement (Moderato 19 $/mois, Allegretto 39 $/mois, Allegro 99 $/mois, Vivace 199 $/mois) coexiste avec l'API à l'usage comme un système de facturation entièrement distinct — les niveaux Allegro/Vivace débloquant les conversations étendues à un million de tokens de K3.
7. Alibaba/Qwen — Qwen3.8-Max vient tout juste de passer en disponibilité générale (vérifié)
Un changement de statut important est survenu pendant cette fenêtre d'enquête : Qwen3.8-Max est officiellement sorti le 3 août (il n'était auparavant qu'en « Preview », sans page tarifaire autonome — accessible uniquement via l'abonnement Token Plan ou les canaux Qoder/QoderWork, les tiers devant se contenter d'estimer un prix par rétro-ingénierie). Après son lancement, il affiche désormais un tarif officiel de 2,00 $/M en entrée, 6,00 $/M en sortie, un tarif unique sur toute sa fenêtre de contexte de 1M sans surtaxe pour les textes longs, et il s'agit d'un MoE de 2,4 billions de paramètres (environ 95 milliards actifs) — le fleuron le plus grand et le plus performant d'Alibaba à ce jour. Les poids ouverts sont prévus « la semaine prochaine » (dans la semaine suivant le lancement).
Vérifié avant publication : le tarif de Qwen3.8-Max n'a pas changé, et il se recoupe depuis un second angle
Comme il s'agissait d'un changement de statut survenu en plein milieu de l'enquête, nous avons mené une vérification séparée avant publication. Résultat : les chiffres de 2,00 $/6,00 $ restent exacts au moment de la publication, sans changement. Nous avons aussi trouvé un moyen indépendant de recouper ce chiffre — plusieurs sources décrivent le tarif international de référence de Qwen3.8-Max comme « environ 40 % du prix d'entrée de Claude Opus 5 et 24 % de son prix de sortie ». Opus 5 est à 5 $/25 $ ; 40 % et 24 % de ces montants donnent exactement 2,00 $ et 6,00 $ — deux chemins indépendants aboutissant à la même réponse, ce qui renforce notre confiance dans ce chiffre. Le plan « poids ouverts la semaine prochaine » a lui aussi obtenu des sources supplémentaires lors de cette vérification, sans changement de cap.
Cela signifie que la conclusion de notre précédent comparatif « Kimi K3 vs Qwen3.8-Max-Preview » — selon laquelle le calcul « ne pouvait tout simplement pas être fait » sur la base du prix — ne tient plus depuis le 3 août : les deux modèles disposent désormais d'un tarif officiel en $/M, ce qui rend une comparaison directe possible. Le prix d'entrée de Kimi K3 (3 $) représente 1,5 fois celui de Qwen3.8-Max (2 $) ; son prix de sortie (15 $) représente 2,5 fois celui de Qwen3.8-Max (6 $). Par ailleurs, Qwen3.6-35B-A3B (0,14 $/0,90 $), un modèle multimodal plus léger, reste disponible et conserve le titre de modèle multimodal le moins cher de ce comparatif.
8. Zhipu/GLM — le prix officiel n'est même pas l'endroit le moins cher pour l'acheter
GLM-5.2 (1,40 $/4,40 $, cache hit 0,26 $, avec un stockage de cache actuellement gratuit pour une durée limitée) a fait ses débuts en préversion le 13 juin, et ses poids ont été entièrement open-sourcés sous licence MIT trois jours plus tard — fenêtre de contexte de 1M, sortie max de 128K. C'est le cas le plus net de tout ce comparatif où « le prix officiel n'est pas le prix le plus bas » : les hébergeurs tiers (Together AI, Fireworks, DeepInfra, SiliconFlow, OpenRouter, entre autres) affichent une médiane d'environ 0,55 $/1,85 $, avec des tarifs sur OpenRouter descendant jusqu'à 0,29 $/M en entrée — soit environ 20 à 50 % du tarif officiel. Le mécanisme derrière cet écart est détaillé en section 12. Par ailleurs, l'abonnement GLM Coding Plan (positionné face à Claude Code) propose un niveau Lite à 18 $/mois officiellement (tarif promotionnel descendant jusqu'à environ 12,60 $/mois), Pro à 72 $/mois, et Max à 160 $/mois, avec un quota consommé à x3 en heure de pointe et x2 hors pointe.
9. xAI — Grok 4.5 est disponible, 4.6/4.7 n'existent que dans des tweets
Grok 4.5 (2 $/6 $, cache hit 0,50 $, -75 %) a été lancé le 8 juillet avec une fenêtre de contexte officielle de 500K tokens — notablement plus petite que le 1M de la génération précédente, le seul cas de ce comparatif où la fenêtre de contexte a effectivement rétréci d'une génération à l'autre. Il bascule dans un palier tarifaire supérieur au-delà de 200 000 tokens, bien que le montant exact de la majoration n'ait pas été communiqué de façon cohérente. C'est l'option offrant le meilleur rapport qualité-prix parmi les modèles fermés multimodaux haut de gamme, sans pour autant être la moins chère dans l'absolu. Grok 4.6 (~1,5 T paramètres) et Grok 4.7 (~2,1 T paramètres) sont tous deux non sortis — ils n'existent que sous forme de déclarations publiques de Musk sur X entre le 24 et le 28 juillet (4.6 vers le 7 août, 4.7 « quelques semaines » après), et non comme une confirmation officielle de xAI ; tarifs et fenêtres de contexte sont totalement inconnus. À noter en passant : le modèle vocal de xAI, Grok Voice Think Fast 2.0, a été mis à jour le 1er août, facturé 0,08 $ la minute d'audio — un système de facturation totalement distinct de la tarification par token de texte.
10. MiniMax — M3 est le fleuron texte/agent, à ne pas confondre avec H3
Il convient d'abord de bien délimiter le périmètre : MiniMax a également lancé, à peu près à la même période, un modèle de génération vidéo, H3 (0,13-0,14 $/seconde, résolution 2K), mais il s'agit d'un modèle vidéo, hors du périmètre « modèles texte/raisonnement haute performance » de cet article, mentionné uniquement pour éviter toute confusion. Le fleuron texte/agent est M3 (lancé le 1er juin) : un MoE de 428 Md au total / ~23 Md actifs utilisant MSA (MiniMax Sparse Attention), une fenêtre de contexte de 1M tokens, et une prise en charge native de l'entrée image/vidéo ainsi que de l'utilisation d'ordinateur en bureau. Il est facturé à 0,30 $/M en entrée, 1,20 $/M en sortie — le prix catalogue était initialement de 0,60 $/2,40 $, et la promotion « -50 % permanent » a effectivement fait de 0,30 $/1,20 $ le tarif standard, identique à celui de la génération précédente M2.1 ; toute requête unique dépassant 512K tokens est facturée au double tarif pour ce tour ; la lecture en cache coûte 0,06 $/M. Dans la gamme chinoise à poids ouverts, la série M de MiniMax se situe dans une fourchette de prix moyenne à basse, mais se distingue par la longueur de contexte et les capacités multimodales, et elle est déjà accessible via des plateformes d'inférence tierces comme SiliconFlow et WaveSpeed.
11. Ce qui décide vraiment de votre facture : cache, tarification de pointe, effort de raisonnement, paliers de vitesse
Au-delà des tarifs bruts par token affichés en tête, il existe une couche facile à négliger, mais qui peut peser plus lourd sur votre facture réelle : la façon dont chaque fournisseur gère les remises de cache, les surtaxes de contexte long, la tarification selon l'heure, l'effort de raisonnement et la vitesse de réponse varie énormément. Voici la synthèse :
| Mécanisme | Qui l'utilise | Détails |
|---|---|---|
| Remise sur cache hit | Quasi universelle, mais l'ampleur de la remise varie beaucoup | DeepSeek est le plus agressif : le tarif cache hit tombe à environ 2 % du tarif sans cache ; les paliers d'OpenAI tournent autour de 10 % du tarif sans cache ; l'entrée en cache de Google est à environ 10 % du tarif sans cache ; Kimi K3 est à environ 10 % (-90 %) ; GLM-5.2 est à environ 19 % (environ -81 %) ; Grok 4.5 est à 25 % (-75 %) ; Anthropic n'a pas communiqué de ratio de remise de cache officiel vérifiable de façon croisée, nous n'en inventons donc pas |
| Paliers de contexte long | OpenAI (seuil de 272 000 tokens sur les trois tiers), Gemini 3.1 Pro de Google (seuil de 200K), Grok 4.5 (seuil de 200K, majoration non communiquée) | Tous des barèmes « plus l'entrée est longue, plus le tarif est élevé », à l'opposé du tarif fixe de DeepSeek et Kimi K3 quelle que soit la longueur |
| Tarification selon l'heure (pointe/hors pointe) | DeepSeek V4-Pro uniquement (pas encore actif au moment de la publication) | Un multiplicateur x2 prévu sur tous les postes de facturation (entrée et sortie confondues) durant 9h-12h et 14h-18h heure de Pékin, échangeant la prévisibilité de la facture contre un lissage de la demande |
| Tarification par palier de vitesse | Le « mode rapide » de GPT-5.6 Sol chez OpenAI (unique) | Prix x2 pour une vitesse x2,5 — le seul fournisseur à afficher un tarif explicite sur la vitesse de réponse elle-même |
| Curseurs d'effort de raisonnement (ne changent pas le tarif, seulement la consommation) | L'« effort » bas/moyen/élevé d'Opus 5 chez Anthropic ; les modes Non-Think/Think High/Think Max de DeepSeek V4-Pro ; les niveaux High/Max de GLM-5.2 | Même tarif, mais un raisonnement plus poussé consomme davantage de tokens de sortie — la facture grimpe via la consommation, pas via le prix |
| Réflexion forcée en permanence, impossible à désactiver | Kimi K3 (verrouillé au maximum), Claude Fable 5 (réflexion toujours active) | Aucune option pour « désactiver la réflexion pour économiser » — le tarif ne change pas, mais la dépense réelle est intrinsèquement plus élevée |
En parcourant ce tableau, une conclusion s'impose : les deux seuls fournisseurs traitant réellement le « raisonnement » lui-même comme une dimension tarifaire indépendante, avec des prix distincts explicites, sont OpenAI (paliers de vitesse) et DeepSeek (paliers horaires) ; chez tous les autres, le curseur d'« intensité de raisonnement » laisse le tarif intact et agit via la consommation de tokens — la variable la plus susceptible d'être négligée dans une comparaison directe, et potentiellement celle qui a le plus d'impact réel sur la dépense. Autrement dit, juger uniquement sur la base du « prix par million de tokens » risque de sous-estimer votre facture réelle.
12. Le point de vue des relais : poids ouverts et modèles fermés, deux économies différentes
C'est l'angle qui intéresse le plus nos lecteurs principaux. Nous le divisons en deux cas, car les mécanismes de formation des prix sous-jacents sont réellement différents.
12.1 Modèles à poids ouverts : les hébergeurs tiers se font concurrence sur le prix, et le tarif officiel n'est pas le plancher
La gamme V4 de DeepSeek, GLM-5.2, Kimi K3, Qwen3.6/3.8-Max et MiniMax M3 sont tous à poids ouverts, ce qui signifie que n'importe quel tiers disposant de suffisamment de puissance de calcul peut auto-héberger le modèle et en revendre l'inférence — ce qui crée une dynamique qui n'existe tout simplement pas pour les modèles fermés : plusieurs hébergeurs se font concurrence sur le prix, au point que le tarif officiel cesse d'être le plancher du marché. L'exemple le plus clair cette fois-ci est GLM-5.2 : le tarif officiel (Z.ai/bigmodel.cn) est de 1,40 $/4,40 $, mais les hébergeurs tiers (Together AI, Fireworks, DeepInfra, SiliconFlow, OpenRouter, entre autres) se situent à une médiane d'environ 0,55 $/1,85 $, avec des tarifs sur OpenRouter descendant jusqu'à 0,29 $/M en entrée — soit environ 20 à 50 % du tarif officiel. DeepSeek V4 et Kimi K3 montrent une concurrence tarifaire similaire entre plusieurs hébergeurs (Together, Fireworks, Modal, SiliconFlow, OpenRouter, et d'autres), même si nous n'avons pas trouvé pour eux un écart de prix aussi précis et citable que celui de GLM-5.2. Ce phénomène de « relais/agrégateur moins cher que l'officiel » relève fondamentalement d'une concurrence sur le marché du calcul, rendue possible par les poids ouverts — un mécanisme qui n'existe tout simplement pas pour les modèles fermés.
12.2 Modèles fermés : les écarts de prix des relais viennent de l'arbitrage de change, des achats en gros et de l'accès détourné — pas d'une concurrence sur le calcul
GPT, Claude, Gemini et Grok sont tous fermés, donc aucun tiers ne peut les auto-héberger — un fournisseur relais ne peut que revendre un quota de compte officiel avec une marge, et cet écart provient d'une source complètement différente de celle des modèles à poids ouverts : quota acheté en gros à prix remisé puis revendu avec marge, taux de conversion « ¥ contre $ » personnalisé (une remise déguisée, en somme), découpage d'abonnements, redirection via des comptes cloud d'entreprise, et jusqu'à des canaux gris comme des protocoles web détournés ou des quotas gratuits d'IDE. Nos propres tests de fournisseurs publiés précédemment ont documenté de nombreux exemples concrets : TokenRiver applique un taux de « 1 ¥ = 1 $ » (soit environ 14 % du tarif officiel — un chiffre issu d'un contenu publié antérieurement, non revérifié cette fois-ci, à confirmer sur la page actuelle du fournisseur) ; AIGCBest applique un taux d'environ 1,5 ¥/USD ; le taux Claude d'AZAPI est d'environ 2,5 ¥/USD (environ 34 % du tarif officiel) ; et BLTCY applique 1 à 2,5 ¥/USD.
Une recherche indépendante et récente confirme cette fois-ci que le même phénomène perdure bel et bien : selon un test tiers d'avril 2026, le taux de règlement interne d'une plateforme était de 2,4 ¥/$ (soit une remise d'environ 67 % par rapport au taux de conversion standard), une autre était à 2 ¥/$ (environ -72 %), et une troisième proposait GPT-5.1-codex à un tarif limité dans le temps environ 15 % en dessous de l'officiel. L'écart de prix sur les modèles fermés, ce n'est pas du calcul moins cher — c'est un quota de compte moins cher, et l'ampleur, la stabilité et le risque de compte (rétrogradation silencieuse, disparition du fournisseur) sont nettement différents de la concurrence d'hébergement des modèles à poids ouverts, ce qui explique pourquoi les deux types de services relais ne devraient pas être évalués selon la même logique. Pour résumer en une phrase : comparer le « prix officiel » n'est qu'un point de départ pour les modèles à poids ouverts, mais presque un point d'arrivée pour les modèles fermés — car le prix officiel d'un modèle fermé en est le plafond ; un relais ne peut le revendre qu'avec une remise, jamais retarifer le calcul sous-jacent lui-même.
13. Six enseignements
En mettant bout à bout les prix, les mécanismes et l'écosystème des fournisseurs relais, quelques régularités comptent plus que n'importe quel chiffre isolé :
- Le camp ouvert/à poids ouverts domine sans partage les tarifs bruts par token : DeepSeek V4-Flash (0,14 $/0,28 $) et Qwen3.6-35B-A3B (0,14 $/0,90 $) occupent en permanence le bas de la fourchette des prix d'entrée, et face aux modèles fermés les plus chers (Claude Fable 5/Mythos 5 à 10 $/50 $), l'écart d'entrée atteint environ 70x et l'écart de sortie environ 180x — ce n'est pas une remise, c'est un ordre de grandeur.
- « Le plus cher » ne veut pas dire « le plus en retard » — les laboratoires fermés mènent eux aussi une guerre des prix : les fortes baisses d'OpenAI sur Terra/Luna le 30 juillet, et le positionnement d'Opus 5 par Anthropic comme « l'intelligence de Fable 5 à moitié prix », sont tous deux des réponses directes à la pression tarifaire des modèles ouverts — mais les baisses côté fermé touchent surtout les modèles de milieu de gamme. Les niveaux fleurons (Sol, Fable 5, Opus 5) n'ont pas bougé, ce qui signifie que les fournisseurs veulent encore réserver une prime au « modèle le plus puissant », et que la guerre des prix se concentre sur le milieu du marché.
- Ce que vous payez réellement pour un modèle à poids ouverts dépend d'où vous l'achetez, pas seulement du tarif catalogue : le tarif officiel de GLM-5.2 et la médiane de l'hébergement tiers diffèrent d'un facteur 2 à 5, un phénomène qui n'existe tout simplement pas pour les modèles fermés, où le tarif officiel est le plafond.
- L'intensité de raisonnement affecte surtout la facture via la consommation, pas via le tarif unitaire : en dehors des paliers de vitesse d'OpenAI et de la tarification de pointe de DeepSeek, le curseur d'effort de raisonnement de tous les autres fournisseurs laisse le tarif par token intact ; Kimi K3 et Claude Fable 5 forcent même la réflexion en permanence. Pour les utilisateurs de relais, cela signifie que le « prix par million de tokens » seul peut sous-estimer la dépense réelle — ce qui décide vraiment de la facture, c'est le nombre de tokens qu'un modèle consomme pour accomplir la même tâche.
- Les remises de cache sont un levier sous-estimé, et les fournisseurs varient énormément sur ce point : le tarif cache hit de DeepSeek est quasi nul (environ -98 %), OpenAI/Google/Kimi K3 se regroupent autour de -90 %, GLM-5.2 est à environ -81 %, et Grok 4.5 à -75 % — pour un flux de travail d'agent qui retraite sans cesse le même document long ou la même base de code, l'ampleur de la remise de cache peut peser davantage sur la facture réelle que le prix d'entrée sans cache lui-même.
- Le vide tarifaire entre « teasé » et « officiellement lancé » est l'endroit où la désinformation se propage le plus facilement : Astra (OpenAI), Gemini 3.5 Pro/Gemini 4 (Google) et Grok 4.6/4.7 (xAI) se trouvent tous à un stade où le nom ou les caractéristiques sont connus, mais où le tarif, le contexte et la date de sortie sont entièrement vides — toute affirmation selon laquelle « un fournisseur relais le prend déjà en charge », ou citant un prix précis, doit être considérée comme fausse, faute d'avoir trouvé une source officielle à l'appui. Le contre-exemple est Qwen3.8-Max, passé de « préversion sans tarif » à « GA avec tarif officiel en $/M » pendant cette fenêtre d'enquête même — un rappel que ce type de vide tarifaire ne dure généralement pas longtemps une fois qu'un modèle passe réellement en disponibilité générale.
Un dernier point à noter : la coexistence de la facturation par abonnement/crédits avec la tarification purement par token est plus fréquente chez les fournisseurs chinois — le GLM Coding Plan, les niveaux d'abonnement de Kimi et le Token Plan de Qwen font tous coexister un abonnement mensuel et une API à l'usage comme deux systèmes réellement distincts, et le tarif d'abonnement ne se convertit pas proprement en un tarif équivalent en $/M tokens. Les quatre acteurs américains (OpenAI/Anthropic/Google/xAI) restent encore, au niveau de l'API, principalement sur une tarification purement à l'usage ; leurs abonnements grand public (ChatGPT Plus/Pro, Claude Pro/Max, etc.) relèvent d'une couche produit grand public distincte, qui ne correspond pas directement à la tarification API pour développeurs, et les deux ne doivent pas être confondus.
14. Fraîcheur des données et ce que nous avons revérifié avant publication
Considérez ce tableau comme une photographie datée d'environ le 5 août 2026, pas comme une grille tarifaire permanente
Chaque prix ici résulte d'une recherche indépendante et récente, recoupée avec des chiffres déjà vérifiés sur ce site ; partout où figure « non communiqué/non vérifié » (l'intégralité d'Astra, l'intégralité de Gemini 3.5 Pro/Gemini 4, l'intégralité de Grok 4.6/4.7, le tarif précis de Gemini 3.5 Flash, les ratios précis de remise de cache d'Anthropic, et le statut d'activation officielle de la surtaxe de pointe de DeepSeek V4-Pro), cela reflète un véritable vide d'information ou un conflit de sources au moment de l'enquête — pas « il n'y aura jamais de chiffre », simplement « aucune source fiable n'en avait au moment de la publication ». Les tarifs promotionnels (la promo Claude Sonnet 5 à 2 $/10 $ jusqu'au 31/08/2026, la promo du niveau Lite du GLM Coding Plan) ont une date d'expiration précise ; si vous lisez ceci après cette date, vérifiez si le tarif standard a repris. Les chiffres de remise spécifiques aux relais cités en section 12 (le « 1 ¥ = 1 $ » de TokenRiver et similaires) proviennent des tests précédemment publiés sur ce site et n'ont pas été revérifiés individuellement cette fois-ci — la tarification des relais évolue généralement plus vite que celle des modèles sous-jacents, consultez donc directement notre comparatif de relais API IA ou la page actuelle du fournisseur.
Les prix évoluant vite, nous avons spécifiquement revérifié avant publication les deux affirmations les plus récentes et les plus volatiles de cette période : la tarification de pointe de DeepSeek V4-Pro — confirmée toujours inactive au moment de la publication, avec la page tarifaire officielle affichant encore un tarif unique, et la surtaxe prévue couvrant tous les postes de facturation (entrée et sortie confondues), pas seulement la sortie ; et le tarif GA de Qwen3.8-Max — confirmé que les chiffres de 2,00 $/6,00 $ sont exacts, avec une vérification croisée indépendante (« environ 40 %/24 % des tarifs de Claude Opus 5 ») aboutissant aux mêmes chiffres, ce qui renforce notre confiance. Ces deux résultats sont signalés dans les encadrés d'alerte des sections 5 et 7.
15. Conclusion : comment utiliser concrètement ce tableau
Après avoir passé en revue la tarification des neuf laboratoires, la conclusion honnête est que comparer uniquement le « prix par million de tokens » ne suffit plus à répondre à la question « quel modèle offre réellement le meilleur rapport qualité-prix ». Une vraie décision nécessite au moins trois niveaux : le prix brut lui-même, où le camp à poids ouverts a un avantage d'un ordre de grandeur ; la mécanique de facturation — remises de cache, paliers de contexte long, tarification de pointe, effort de raisonnement — qui peut rendre la facture réelle plusieurs fois plus élevée ou plus basse que le tarif affiché ne le suggère ; et, le niveau qui devrait intéresser le plus nos lecteurs, l'endroit où vous achetez réellement — le tarif officiel d'un modèle à poids ouverts n'est qu'un point de départ, puisque la concurrence des hébergeurs tiers peut le faire chuter à une fraction de ce montant ; le tarif officiel d'un modèle fermé est le plafond, et ce qu'un relais peut offrir, c'est un quota de compte moins cher, pas un calcul moins cher, ce qui explique pourquoi le calcul de risque des deux types de relais ne peut pas être appliqué de façon interchangeable.
Mis bout à bout, cela signifie
Si vous cherchez simplement quelque chose de bon marché et suffisant, DeepSeek V4-Flash et Qwen3.6-35B-A3B constituent actuellement le plancher tarifaire. Si vous avez besoin d'une intelligence de premier plan et que le budget est secondaire, Claude Opus 5, Fable 5 et GPT-5.6 Sol restent le plafond. Si vous optimisez pour des charges de travail d'agent longues et à fort volume, la profondeur de la remise de cache et la possibilité (ou non) de désactiver la « réflexion » peuvent compter davantage que le tarif affiché.
- Développeurs soucieux du budget et du rapport qualité-prix → commencez par le camp à poids ouverts (DeepSeek, Qwen, GLM, Kimi, MiniMax), et comparez réellement les prix officiels et les prix d'hébergement tiers — ne présumez pas que le tarif officiel est le plancher.
- Équipes ayant besoin d'une intelligence de premier plan avec plus de marge budgétaire → Claude Opus 5, Fable 5 et GPT-5.6 Sol restent le plafond de performance actuel, mais surveillez l'impact des curseurs d'effort/d'intensité de raisonnement sur la consommation réelle.
- Développeurs qui passent par un relais pour accéder aux modèles étrangers → déterminez d'abord si vous accédez à un modèle à poids ouverts ou à un modèle fermé — cela détermine s'il faut évaluer le fournisseur sur la concurrence des prix de calcul ou sur la remise et la stabilité du quota de compte. Voir notre comparatif de relais API IA pour des fournisseurs spécifiques.