Si vous ne retenez qu'un seul chiffre, retenez celui-ci : DeepSeek-V4-Flash-0731 obtient 54,4 sur le benchmark DeepSWE, contre 7,3 pour la version Preview trois mois plus tôt. Même architecture, même nombre de paramètres — le « squelette » du modèle n'a pas bougé d'un iota. DeepSeek a simplement refait un passage de post-entraînement, et le score a été multiplié par plus de 7. Ce n'est pas une mise à jour mineure de routine, mais un signal de plus en plus net pour le second semestre 2026 : les gains obtenus lors de la phase de post-entraînement peuvent désormais rivaliser avec ceux obtenus en ajoutant des paramètres, voire les dépasser.

Cet article détaille ce qu'est réellement DeepSeek V4 Flash, à quelle mise à jour précise correspond ce « dernier lancement », comment ses benchmarks se comparent à ceux de modèles très en vue comme Claude Opus 4.8, GPT-5.6, Kimi K3 et GLM-5.2, son coût réel, et — la question qui compte le plus pour nos lecteurs qui suivent l'écosystème des relais/proxys d'API IA — si et comment les relais d'API IA en Chine continentale le proposent déjà. Chaque benchmark et chaque tarif cité ci-dessous provient de la documentation et du journal des modifications officiels de DeepSeek, ou de tarifs déjà vérifiés et publiés par ce site dans des articles précédents. Lorsque des sources tierces se contredisaient sans possibilité de recoupement, nous le signalons explicitement plutôt que d'inventer un chiffre pour rendre un tableau comparatif plus complet.

1. Ce qu'est DeepSeek V4 Flash : ce que ce « lancement » désigne réellement

Remettons d'abord la chronologie en ordre, car ce « dernier lancement » se laisse facilement confondre avec l'arrivée d'un modèle entièrement nouveau. Le 24 avril 2026, DeepSeek a officiellement présenté la famille V4 en deux versions : le grand modèle phare DeepSeek-V4-Pro (1,6 billion de paramètres au total, 49 milliards actifs) et la version plus légère DeepSeek-V4-Flash (284 milliards au total, 13 milliards actifs). Les deux partagent une fenêtre de contexte de 1 million de tokens et jusqu'à 384 000 tokens en sortie, avec des poids publiés sous licence MIT sur Hugging Face. À l'époque, DeepSeek avait explicitement qualifié cette sortie de « Preview » — signe qu'une suite était prévue.

Ce qui a réellement fait passer V4 Flash à un état plus abouti, c'est le 31 juillet 2026 — le jour de publication de cet article. Le journal des modifications de l'API officielle de DeepSeek a annoncé que l'API DeepSeek-V4-Flash entrait en bêta publique, sous le nom de version interne DeepSeek-V4-Flash-0731. Cette mise à jour ne concerne que V4 Flash : l'API V4 Pro et les modèles de l'application/du site web restent inchangés, toujours en Preview. Autrement dit, DeepSeek a délibérément choisi de faire mûrir d'abord le plus petit modèle, plutôt que de faire évoluer toute la gamme en même temps.

Le détail le plus intéressant est ce que dit la note de version officielle : la version 0731 « conserve la même architecture et la même taille de modèle que DeepSeek-V4-Flash-Preview, et a simplement été réentraînée en post-entraînement ». L'API ne change pas — le nom du modèle reste deepseek-v4-flash, aucune modification de code n'est nécessaire ; DeepSeek a simplement remplacé les poids côté serveur. Cela signifie que toute application, tout script, tout relais qui appelait déjà l'ID de modèle deepseek-v4-flash dès avril reçoit, depuis aujourd'hui, automatiquement la version mise à niveau — sans configuration supplémentaire de son côté.

2. L'architecture : 284 Md au total / 13 Md actifs, et l'attention creuse hybride derrière l'efficacité

L'argument central de la famille V4 (Pro et Flash partagent la même philosophie de conception) n'est pas la taille brute en paramètres, mais la capacité à soutenir une fenêtre de contexte de 1 million de tokens sans faire exploser le calcul en proportion. D'après l'article technique et la documentation officielle de DeepSeek, V4 introduit trois innovations architecturales clés :

  • Attention creuse hybride (DSA) : une alternance entre Compressed Sparse Attention (CSA) et Heavily Compressed Attention (HCA) — dans V4-Pro, les deux premières des 61 couches Transformer utilisent HCA, les couches suivantes alternant CSA et HCA. Combinée à une compression au niveau du token, l'efficacité annoncée par DeepSeek est la suivante : sur un contexte de 1 million de tokens, V4-Pro ne nécessite que 27 % des FLOPs d'inférence par token et 10 % de l'empreinte du cache KV par rapport à DeepSeek-V3.2. C'est la base technique qui rend un contexte de 1 million de tokens viable à ce niveau de prix — pas simplement une question de matériel supplémentaire.
  • Manifold-Constrained Hyper-Connections (mHC) : une amélioration des connexions résiduelles classiques, destinée à faire circuler l'information plus stablement dans les réseaux profonds.
  • Optimiseur Muon : en remplacement des optimiseurs classiques de la famille AdamW, avec, selon DeepSeek, « une convergence plus rapide et une meilleure stabilité d'entraînement ».

Côté routage MoE, chaque couche MoE est composée d'un expert partagé et de 256 experts routés, chacun avec une dimension cachée intermédiaire de 2048, et 6 experts routés sont activés par token. Les 284 milliards de paramètres au total / 13 milliards actifs de V4-Flash constituent la version allégée compressée selon ce même schéma de routage — environ un sixième du total de paramètres de V4-Pro et un quart de ses paramètres actifs. Côté pré-entraînement, l'article de DeepSeek cite plus de 32 000 milliards de tokens de haute qualité.

Le positionnement officiel des deux versions mérite aussi d'être noté : V4-Pro est décrit comme « surpassant tous les modèles ouverts actuels en mathématiques/STEM/programmation », avec des performances en connaissances générales « juste derrière Gemini-3.1-Pro ». V4-Flash est positionné comme ayant des « capacités de raisonnement proches de V4-Pro » et des performances comparables sur les tâches d'agent basiques, en échange d'un temps de réponse plus rapide et d'un coût plus faible. C'est en partie pourquoi le fait que ce soit précisément V4-Flash qui reçoive ce passage de réentraînement, à cette échelle, mérite un article à part entière — ce n'est pas la solution de repli « suffisante », mais une gamme de produits dans laquelle DeepSeek investit visiblement des ressources réelles.

3. De la Preview d'avril à la version 0731 du 31 juillet : même modèle, un réentraînement

Les chiffres avant/après de cette mise à jour sont plus parlants que n'importe quel adjectif. Voici la comparaison publique avant/après issue du journal des modifications officiel de DeepSeek, sur le même ensemble de benchmarks de capacités d'agent :

BenchmarkV4-Flash-Preview (avril)V4-Flash-0731 (31 juillet)Évolution
Terminal-Bench 2.161,882,7+20,9
DeepSWE7,354,4+47,1 (≈×7,5)
Cybergym38,776,7+38,0
NL2Repo39,454,2+14,8
Toolathlon-Verified49,770,3+20,6

Au-delà de ces cinq benchmarks avec des chiffres avant/après clairs, la version 0731 publie aussi de nouveaux scores sur DSBench-FullStack (68,7), DSBench-Hard (59,6), Agent Last Exam (25,2) et Automation Bench Public (25,1) — mais DeepSeek n'a pas publié de scores comparables pour la version Preview sur ces items, donc aucun delta ne peut être calculé, et nous n'allons pas en inventer un à la place de l'éditeur.

Le bond sur DeepSWE mérite une mention à part : passer de 7,3 à 54,4 signifie que la version Preview était globalement inutilisable sur ce benchmark, tandis que la version 0731 affiche désormais un score tout à fait présentable. L'explication officielle de DeepSeek est que cette mise à jour n'a été « qu'un passage de réentraînement post-entraînement » — l'architecture et le nombre de paramètres n'ont pas changé. Cela en dit long sur le poids de la phase de post-entraînement/RL pour les tâches de type agent : exactement le même modèle de base peut, en ajustant uniquement les données et la méthode d'entraînement, gagner un ordre de grandeur sur un type de tâche précis. C'est une tendance de plus en plus visible dans la course aux modèles du second semestre 2026 — l'échelle du pré-entraînement comme seul axe de compétition perd de son importance relative, tandis que la façon dont on règle le post-entraînement devient tout aussi déterminante, sinon plus.

La note de version de DeepSeek avance aussi une affirmation assez directe : les capacités d'agent de la version 0731 « dépassent largement » (far exceed) celles de V4-Pro-Preview — le modèle frère, bien plus grand, de la même famille. Autrement dit, parmi les versions publiquement disponibles aujourd'hui, le modèle « plus petit » qui vient de subir un réentraînement, V4-Flash, surpasse en réalité le modèle « plus grand », V4-Pro (toujours bloqué en Preview, avec 6 fois plus de paramètres), sur les tâches liées aux agents. Cela explique pourquoi DeepSeek n'a pas fait évoluer les deux versions en même temps cette fois-ci — peaufiner d'abord la version Flash, moins chère et qui itère plus vite, avant de décider quand Pro suivra, est un rythme de produit qui se défend.

Deux autres détails techniques méritent d'être notés : la version 0731 prend en charge nativement le format Responses API (le nouveau paradigme d'API d'OpenAI, qui regroupe appels d'outils multi-tours et gestion d'état dans une seule interface, et remplace progressivement l'ancien Chat Completions), et elle a été spécifiquement adaptée pour Codex, l'outil d'agent de codage d'OpenAI. Ensemble, ces deux points montrent que cette mise à niveau vise clairement « l'intégration dans l'écosystème d'outils agentiques existant », pas seulement l'amélioration d'un score de capacité générique. Un modèle tiers qui ne prend en charge que l'ancien format Chat Completions nécessite généralement une couche de traduction supplémentaire pour fonctionner avec des outils comme Codex qui parlent nativement Responses API — et c'est précisément dans cette couche que les cas particuliers d'appels d'outils et de streaming ont tendance à casser. En prenant en charge le format nativement, DeepSeek supprime ce coût de traduction pour quiconque assemble une combinaison « backend DeepSeek + frontend Codex ». Notre guide de configuration de Codex via un relais explique comment Codex attend une URL OPENAI_BASE_URL et un point de terminaison personnalisé — le support natif de Responses API rend ce chemin plus fluide.

4. Benchmarks : face à Claude Opus 4.8, GPT-5.6, Kimi K3 et GLM-5.2

Une amélioration spectaculaire ne veut pas automatiquement dire qu'on a rattrapé les modèles fermés de pointe — ce sont deux affirmations distinctes. La donnée tête-à-tête la plus claire disponible : sur Terminal-Bench 2.1, Claude Opus 4.8 obtient 85,0, et les 82,7 de DeepSeek-V4-Flash-0731 accusent un retard d'environ 2,3 points — un écart réellement faible. Mais cet écart n'est pas uniforme selon les benchmarks : sur DSBench-FullStack, Opus 4.8 obtient 71,6 contre 68,7 pour V4-Flash-0731, un écart de 2,9 — également faible. Sur DSBench-Hard en revanche, Opus 4.8 obtient 71,7 contre 59,6 pour V4-Flash-0731, un écart de 12,1 points — nettement plus marqué. Autrement dit, l'idée d'être « au niveau du modèle phare » tient sur certains benchmarks, mais sur des tâches réellement difficiles (DSBench-Hard en particulier), un véritable écart subsiste entre V4-Flash et les meilleurs modèles fermés — on ne peut pas généraliser dans un sens ou dans l'autre.

En élargissant à V4-Pro, le grand modèle phare de la même famille : il obtient 80,6 % sur SWE-bench Verified, à égalité avec Gemini 3.1 Pro (80,6 %) et légèrement devant Kimi K2.6 (80,2 %). Mis ensemble, ces trois chiffres montrent que l'écart entre modèles de pointe sur ce benchmark de programmation particulier s'est réduit à moins d'un point de pourcentage — savoir qui est « premier » dépend beaucoup du lot de tests précis. Cette donnée concerne V4-Pro, pas V4-Flash, le véritable sujet de cet article, et il ne faut pas confondre les deux — nous les listons volontairement séparément pour éviter de mélanger des modèles et des benchmarks différents dans une impression trompeuse de « tout est à égalité ».

En élargissant encore, deux autres modèles de juillet 2026 déjà testés par ce site méritent d'être ajoutés en repère : Kimi K3 (Moonshot AI, 2,8 billions de paramètres, lancé le 16 juillet) obtient 57 sur l'Artificial Analysis Intelligence Index, se classant 4e parmi les 189 modèles suivis — derrière Claude Fable 5 et deux configurations de raisonnement de GPT-5.6 Sol, devant Claude Opus 4.8, GPT-5.5 (palier xhigh), Claude Sonnet 5 et GLM-5.2. Sur SWE-bench Verified, Kimi K3 obtient 76,8 %, en dessous des 80,6 % de DeepSeek-V4-Pro. Ces chiffres proviennent d'Artificial Analysis et de LMArena, des évaluateurs tiers à la méthodologie publique, que nous nous sentons donc à l'aise de citer. Quant aux tarifs de Gemini 3.5 Flash, les chiffres tiers que nous avons pu trouver se contredisent nettement — les prix d'entrée annoncés selon les sources vont de 0,15 $ à 1,50 $ par million de tokens, sans possibilité de recoupement — nous ne citerons donc pas de chiffre juste pour compléter un tableau « plus exhaustif » avec des données qui se contredisent.

Comment interpréter raisonnablement ces benchmarks

« Mêmes poids, un seul réentraînement, des scores multipliés par 7 » est un signal réel et notable — mais il porte sur la vitesse de progression des méthodes de post-entraînement, pas sur le fait que « V4-Flash aurait désormais entièrement rattrapé les modèles fermés de pointe ». Sur des benchmarks d'agent relativement matures comme Terminal-Bench 2.1, V4-Flash-0731 est déjà dans la même catégorie que Claude Opus 4.8 ; sur des tâches délibérément plus difficiles comme DSBench-Hard, l'écart reste réel. Pour votre propre cas d'usage, mieux vaut regarder le benchmark le plus proche de votre tâche réelle plutôt que de se laisser porter par une conclusion globale du type « à peu près équivalent ».

5. Tarifs : neuf modèles en vogue dans un seul tableau

Les tarifs ci-dessous sont tous des tarifs API officiels de premier niveau (pas des tarifs remisés via un relais). Certains proviennent de la documentation officielle de DeepSeek, d'autres de tarifs déjà vérifiés et publiés par ce site dans des tests précédents — regroupés ici pour une comparaison directe :

ModèleEntrée $/M tokensSortie $/M tokensRemarques
DeepSeek V4 Flash0,14 $ (cache 0,0028 $)0,28 $Texte seul, contexte 1M, 284 Md au total/13 Md actifs
DeepSeek V4 Pro0,43 $ (cache ≈0,0036 $)0,87 $Surtarification dynamique en heure de pointe depuis mi-juillet
Qwen3.6-35B-A3B0,14 $0,90 $Multimodal ; V4 Flash ne l'est pas
GLM-5.21,40 $4,40 $Poids ouverts sous licence MIT
GPT-5.6 Luna0,20 $1,20 $Après la baisse de 80 % du 30 juillet
GPT-5.6 Terra2,00 $12,00 $Après la baisse de 20 % du 30 juillet
Claude Sonnet 53,00 $15,00 $Modèle phare intermédiaire d'Anthropic
GPT-5.6 Sol5,00 $30,00 $Modèle phare d'OpenAI, prix inchangé le 30 juillet
Claude Opus 4.85,00 $25,00 $Deuxième palier le plus élevé d'Anthropic
Claude Fable 510,00 $50,00 $Modèle phare le plus cher d'Anthropic actuellement

Classé par prix d'entrée, plusieurs éléments sautent aux yeux : DeepSeek V4 Flash est à égalité avec le Qwen3.6-35B-A3B d'Alibaba pour le prix d'entrée le plus bas (0,14 $/M chacun), mais le prix de sortie de V4 Flash (0,28 $) est nettement plus avantageux — à condition de ne pas avoir besoin du multimodal. V4 Flash est actuellement un modèle texte seul ; il ne peut ni lire une image, ni une capture d'écran, ni traiter une tâche de reconstruction d'interface, ce que Qwen3.6 sait faire. Face au sommet de la pyramide, Claude Fable 5, le prix d'entrée de V4 Flash est environ 71 fois inférieur et son prix de sortie environ 178 fois inférieur — ce n'est pas une remise, c'est un écart d'ordre de grandeur.

Le mécanisme de « surtarification dynamique en heure de pointe » de DeepSeek V4 Pro mérite une mention à part : depuis la mi-juillet, le prix de V4 Pro augmente pendant les périodes de forte charge, un mécanisme que DeepSeek utilise pour gérer la capacité de calcul de son modèle populaire. V4 Flash n'a aujourd'hui aucun mécanisme de ce type — son tarif reste constant — ce qui est une autre raison concrète pour laquelle les usages sensibles au budget privilégient Flash plutôt que Pro : pas seulement parce que c'est moins cher, mais parce que la facture est prévisible.

Un appel réel — l'API officielle de DeepSeek est compatible avec le format OpenAI, et prend aussi en charge un chemin /anthropic pour une intégration directe avec Claude Code :

curl https://api.deepseek.com/v1/chat/completions \
  -H "Content-Type: application/json" \
  -H "Authorization: Bearer $DEEPSEEK_API_KEY" \
  -d '{
    "model": "deepseek-v4-flash",
    "messages": [{"role": "user", "content": "Hello!"}]
  }'

6. Pourquoi le 31 juillet précisément : guerre des prix et contexte des marchés financiers

Cette mise à jour devient plus intéressante replacée sur une chronologie. La veille de l'annonce de la version 0731 par DeepSeek (le 30 juillet), OpenAI venait de réduire drastiquement les prix de deux paliers moins coûteux de GPT-5.6 : le prix entrée/sortie de Luna est passé de 1 $/6 $ à 0,20 $/1,20 $, une baisse de 80 % ; Terra est passé de 2,50 $/15 $ à 2 $/12 $, une baisse de 20 % ; le prix du modèle phare Sol est resté inchangé. OpenAI a attribué ces baisses à des gains d'efficacité internes, mais les analystes y voient largement un effet des doutes des entreprises sur le retour sur investissement des dépenses IA, ainsi que de la pression concurrentielle croissante des modèles chinois à poids ouverts, moins chers. DeepSeek a enchaîné dès le lendemain avec une mise à niveau majeure des capacités de son modèle le moins cher — le prix affiché n'a pas bougé, mais cela revient à obtenir une capacité d'agent nettement plus forte pour le même argent, avec la même logique fonctionnelle qu'une baisse de prix.

En élargissant encore, la course aux dépenses d'investissement de tout le secteur s'accélère en parallèle : la même semaine, Microsoft a publié ses résultats du quatrième trimestre de l'exercice 2026, avec une croissance d'Azure accélérant à 43 %, et a fortement relevé ses prévisions de dépenses d'investissement pour l'exercice 2027 à 255-260 milliards de dollars. Les résultats du deuxième trimestre d'Amazon, publiés dans la même fenêtre, montraient une croissance d'AWS accélérant à 37 % — le rythme le plus rapide depuis près de 18 trimestres — le PDG Andy Jassy déclarant que les activités IA et puces de l'entreprise avaient « chacune dépassé un rythme annualisé de plus de 25 milliards de dollars ». Meta a relevé le bas de sa fourchette de prévisions de dépenses d'investissement annuelles à 130 milliards de dollars, mais a manqué les attentes de bénéfices en raison de dépenses en forte hausse, et son action a chuté de près de 8 % hors séance après la publication. Trois géants technologiques américains portent simultanément leurs dépenses d'investissement à des niveaux record tout en commençant à essuyer un vrai scepticisme du marché côté bénéfices — c'est précisément le moment où une approche axée sur l'efficacité comme celle de DeepSeek, faire plus avec moins de calcul, raconte l'histoire la plus convaincante : alors que le calcul lui-même coûte de plus en plus cher et que les investisseurs s'impatientent d'attendre un retour sur les dépenses IA, un modèle qui comprime le coût d'inférence sur un contexte de 1 million de tokens à ce niveau de prix se vend plus facilement qu'un « achetez encore plus de GPU ».

En allant encore plus loin du côté des marchés financiers : Reuters a rapporté le 20 juillet, citant des sources proches du dossier, que DeepSeek prépare un nouveau tour de financement visant une valorisation d'environ 500 milliards de yuans (~74 milliards de dollars), cherchant à lever jusqu'à 50 milliards de yuans, en vue d'un possible dépôt d'introduction en bourse en Chine continentale cette année — faisant suite au tour de 7,4 milliards de dollars bouclé par DeepSeek en juin 2026 à une valorisation d'environ 450 milliards de yuans. Sur la même période, l'indice Bloomberg des milliardaires montrait que la fortune du fondateur de DeepSeek, Liang Wenfeng, était passée d'environ 16,7 à 36 milliards de dollars en une seule semaine, dépassant le cofondateur d'Anthropic Dario Amodei et le cofondateur d'OpenAI Greg Brockman pour devenir le fondateur de modèle d'IA le plus riche au monde. Mis ensemble, ces chiffres disent quelque chose de clair : en 2026, DeepSeek n'est plus seulement « une alternative open source bon marché » — c'est un acteur de premier plan sérieusement valorisé par les marchés financiers et qui se prépare à une introduction en bourse. Cette mise à niveau de V4 Flash doit aussi se lire dans ce contexte : c'est à la fois une véritable itération technique et l'un des gestes par lesquels l'entreprise continue de démontrer la compétitivité de son produit avant une IPO.

7. Y accéder via les relais d'API IA en Chine continentale : ce qui intéresse vraiment nos lecteurs

Le détail technique le plus important d'abord : la mise à niveau 0731 n'a pas changé l'ID du modèle — les appels continuent de viser deepseek-v4-flash, et DeepSeek a simplement remplacé les poids côté serveur par une version réentraînée. Cela signifie que tout relais qui listait déjà deepseek-v4-flash dans son catalogue de modèles transmet, en principe, des requêtes qui atteignent automatiquement la nouvelle version dès aujourd'hui — sans aucune modification de configuration nécessaire de son côté. C'est la façon habituelle dont les fournisseurs de modèles réalisent des mises à niveau « sur place » (in-place) dans le cloud, un schéma déjà évoqué dans notre article sur la migration des ID de modèles DeepSeek (les anciens ID deepseek-chat/deepseek-reasoner ont été retirés le 24 juillet, unifiés vers deepseek-v4-pro[1m] et deepseek-v4-flash).

À noter : « récupère automatiquement la nouvelle version » ne vaut que si un relais donné transmet directement vers le point de terminaison officiel de DeepSeek. Si un relais télécharge plutôt les poids et les héberge lui-même sur son propre cluster d'inférence (plutôt que de se contenter de relayer l'API officielle), la mise à niveau dépend alors du suivi manuel de ce relais — vérifiez l'annonce spécifique de chaque fournisseur plutôt que de prendre ceci pour une garantie générale que nous ferions à sa place.

D'après les données déjà vérifiées par ce site, la plateforme officielle de DeepSeek (platform.deepseek.com) reste le moyen le plus direct d'accéder à la famille V4, avec une connectivité directe depuis la Chine continentale, sans VPN nécessaire. Plusieurs fournisseurs déjà référencés dans notre comparatif des relais d'API IA ont intégré la famille DeepSeek V4 à leur couverture de modèles, notamment SiliconFlow, LaoZhang API, YKH.AI, FlowBar et UiUiAPI — les tarifs exacts et les limites de concurrence varient et doivent être vérifiés auprès de l'annonce la plus récente de chaque fournisseur. Pour évaluer un relais, deux vérifications comptent le plus : s'il prend explicitement en charge l'ID de modèle deepseek-v4-flash (plutôt que de rester sur l'ancien deepseek-chat), et s'il prend en charge à la fois le format OpenAI et le format Anthropic (ce dernier déterminant s'il peut se brancher directement sur Claude Code). Sur l'agrégateur mondial bien connu OpenRouter, DeepSeek V4 Flash est également référencé, avec plusieurs fournisseurs d'inférence tiers derrière lui à des prix qui varient selon le fournisseur — certains sous le tarif officiel — un schéma courant chez les relais de type agrégateur à l'étranger, où plusieurs fournisseurs de calcul se font concurrence sur le prix et où l'utilisateur peut router selon le coût, la vitesse ou la fiabilité.

Si vous utilisez déjà une passerelle multi-modèles comme LiteLLM ou Claude Code Router, l'intégration reste identique — il suffit de pointer les tâches de sous-agent/faible complexité vers le deepseek-v4-flash mis à jour, sans autre changement :

model_list:
  - model_name: deepseek-v4-flash
    litellm_params:
      model: openai/deepseek-v4-flash
      api_base: https://api.deepseek.com
      api_key: os.environ/DEEPSEEK_API_KEY

Pour la configuration complète (obtenir une clé, variables d'environnement, liste de vérification pour la migration de Claude Code), consultez notre guide de migration de Claude Code vers DeepSeek et notre guide complet de LiteLLM — les deux utilisent déjà deepseek-v4-flash comme ID de modèle dans leurs exemples, cette mise à niveau ne nécessite donc de modifier aucune ligne de configuration.

8. Qui devrait l'utiliser, qui ne devrait pas

  • Tâches par lots, à haute fréquence et faible complexité (résumé, extraction de données, questions-réponses simples, complétion de code, tâches rapides/sous-agent de Claude Code) → le rapport qualité-prix de V4 Flash est difficile à battre actuellement dans sa catégorie — utilisez-le sans hésiter.
  • Flux de travail d'agent nécessitant de lire des images, captures d'écran ou maquettes → V4 Flash est un modèle texte seul et ne peut pas le faire ; envisagez Qwen3.6-35B-A3B ou un autre modèle capable de vision.
  • Usages sensibles au budget nécessitant tout de même la puissance de raisonnement de la gamme V4 → pesez le mécanisme de surtarification en heure de pointe de V4 Pro, appelez-le hors pointe, ou répartissez la charge — tâches difficiles vers Pro, tâches simples vers Flash.
  • Tâches difficiles où égaler un modèle phare fermé de pointe est une exigence stricte (scénarios type DSBench-Hard) → les données montrent qu'un véritable écart subsiste entre V4-Flash et Claude Opus 4.8 — ne le traitez pas comme un remplacement équivalent direct.
  • Équipes en Chine continentale déjà en train de router d'autres modèles via un relais → vérifiez d'abord si votre relais pointe déjà vers l'ID de modèle mis à jour, et s'il relaie purement l'API officielle ou héberge lui-même les poids — cela détermine si vous récupérez cette mise à niveau automatiquement.

9. Conclusion

Ce « dernier lancement » de DeepSeek V4 Flash n'est, au fond, pas les débuts d'un modèle entièrement nouveau — c'est le même modèle MoE à 284 milliards de paramètres au total / 13 milliards actifs, passé par un seul réentraînement, qui livre un gain d'un ordre de grandeur sur les benchmarks liés aux agents. DeepSWE est passé de 7,3 à 54,4, Terminal-Bench 2.1 de 61,8 à 82,7 — des progrès assez importants pour lui permettre d'égaler, sur certains benchmarks, son propre modèle phare V4-Pro (avec 6 fois plus de paramètres), et même de se rapprocher de Claude Opus 4.8. Côté tarifs, il reste à 0,14 $/0,28 $ par million de tokens officiellement — proche du bas de la fourchette de prix parmi tous les modèles grand public du moment — au prix d'une absence de support multimodal, et d'un écart encore visible face aux meilleurs modèles fermés sur les tâches réellement difficiles.

Mis bout à bout, cela signifie

Si votre usage est à haute fréquence, faible complexité et texte seul, le rapport qualité-prix de V4 Flash est aujourd'hui quasiment imbattable. Si votre usage nécessite du multimodal ou impose une exigence stricte de précision absolue sur des tâches difficiles, il ne peut pas encore remplacer un modèle phare fermé de pointe.

  • Sensible au budget, usage principalement par lots → basculez dès maintenant — l'ID de modèle n'a pas changé, et votre relais a probablement déjà été mis à niveau automatiquement.
  • Besoin de lire des images / multimodal → V4 Flash ne le permet pas aujourd'hui ; envisagez Qwen3.6-35B-A3B ou un modèle phare multimodal.
  • Développeurs en Chine continentale → retenez une phrase : l'ID de modèle n'a pas changé, et si votre relais relaie purement le point de terminaison officiel, vous avez probablement déjà récupéré la mise à niveau — vérifiez le comportement réel de votre relais spécifique pour en être sûr.