DeepSeek V4.1-Flash : le petit modèle qui remplace le flagship (benchmarks, prix, limites)
DeepSeek V4.1-Flash remplace le flagship V4-Pro avec 10 fois moins de paramètres actifs. Benchmarks, tarif API, mesure indépendante et limites : ce qu'il faut retenir.

Nouveau modèle · DeepSeek V4.1-Flash
Le 10 septembre 2026, DeepSeek a mis en ligne DeepSeek-V4.1-Flash, et la nouvelle a de quoi surprendre : ce n'est pas le modèle le plus gros de la maison, mais c'est lui qui vient remplacer le flagship V4-Pro dans le rôle de moteur principal. Un modèle de la gamme « Flash », donc petite et économique, qui passe devant le modèle haut de gamme sur les benchmarks d'agents, coûte bien moins cher et tourne beaucoup plus vite.
Nous l'utilisons au quotidien pour nos propres agents, donc l'annonce nous concerne directement. Voici ce qu'il faut retenir : ce qu'il y a vraiment sous le capot, les chiffres officiels et ce qu'ils ne disent pas, la première mesure indépendante, le nouveau tarif, et les limites à connaître avant de basculer votre production dessus.
DeepSeek V4.1-Flash est un modèle MoE de 552 milliards de paramètres qui n'active que 8 milliards de paramètres en entrée et 16 en sortie, avec 1 million de tokens de contexte, compréhension d'images native et poids ouverts sous licence MIT. Sur les benchmarks publiés par DeepSeek, il dépasse V4-Pro sur le code, les agents et la cybersécurité, tout en coûtant environ 70 % de moins au tarif public. La mesure indépendante d'Artificial Analysis confirme la hiérarchie sur son indice actuel (40 contre 36 pour V4-Pro 0813), et pointe deux réserves : le modèle est très bavard et V4-Pro reste devant sur certaines épreuves de connaissances.
Qu'est-ce que DeepSeek V4.1-Flash ?
Officiellement, c'est « le plus petit modèle de la nouvelle famille d'architecture DeepSeek ». Derrière cette formule, les caractéristiques sont les suivantes :
- 552 milliards de paramètres au total, en mélange d'experts (MoE).
- 8 milliards de paramètres actifs en entrée et 16 milliards en sortie, une asymétrie inédite dans la famille.
- 1 million de tokens de contexte et jusqu'à 384 000 tokens de sortie.
- Vision native : le modèle accepte texte et images en entrée, sans modèle annexe.
- Poids ouverts sous licence MIT, publiés sur Hugging Face avec un rapport technique d'une cinquantaine de pages.
- Effort de raisonnement réglable de 1 à 100, avec trois préréglages côté API : low, high et max.
Le nom du modèle change aussi : l'identifiant à utiliser sur l'API DeepSeek est désormais deepseek-flash. Les anciens noms deepseek-v4-flash et deepseek-v4-flash-vision-exp fonctionnent encore, mais ils pointent vers V4.1-Flash : les modèles correspondants ont été retirés. Un détail qui compte pour les intégrations existantes, on y revient plus bas.
L'innovation utile : le cache KV et l'architecture CED
Deux éléments techniques expliquent les gains annoncés.
Le Causal Encoder-Decoder. Là où un transformeur classique traite l'entrée et la sortie avec la même mécanique, cette architecture sépare les deux : la partie « encodeur » lit votre demande avec peu de paramètres actifs, la partie « décodeur » rédige la réponse avec davantage de capacité. D'où l'asymétrie 8B / 16B. DeepSeek présente le gain comme un plafond de capacité plus élevé, une inférence plus rapide et un débit supérieur, avec une architecture pensée pour se décliner vers des modèles plus gros.
Le cache KV compressé. C'est probablement le chiffre le plus important de la sortie, et le moins commenté. Pour tenir un contexte, un modèle conserve en mémoire une représentation de tout ce qu'il a lu : le cache KV. Plus il grandit, plus la facture d'inférence grimpe, particulièrement dans les boucles d'agents qui relisent le même contexte des dizaines de fois. DeepSeek annonce pour V4.1-Flash un cache divisé par rapport à la génération précédente : un quart de la mémoire HBM et un huitième du stockage SSD. Des analyses techniques tierces chiffrent le résultat à 890 octets par token, contre environ 3 500 pour V4-Flash.
Le rapport technique va jusqu'à proposer un chiffre spectaculaire, une réduction d'un facteur 437 par rapport à DeepSeek-V1 en trois ans. C'est un calcul de fournisseur sur des bases différentes : à prendre comme un ordre de grandeur, pas comme une mesure.
Concrètement, un contexte d'un million de tokens occupe de l'ordre de 0,9 Go de cache avec ces chiffres. Pour une équipe qui fait tourner des agents en continu, c'est bien plus qu'un détail d'ingénierie : c'est ce qui rend un long contexte soutenable financièrement.
Les benchmarks officiels, et leur statut
DeepSeek publie une batterie de résultats, mesurés à l'effort de raisonnement maximum. Les principaux :
| Benchmark | DeepSeek V4.1-Flash | DeepSeek V4-Pro | Lecture |
|---|---|---|---|
| Terminal-Bench 2.1 | 90,6 | 87,9 | Automatisation en terminal : avantage Flash |
| Terminal-Bench 3.0 / 4.0 | 30,0 / 31,2 | 11,8 / 12,4 | Écart net sur les tâches agents difficiles |
| DeepSWE v1.1 | 74,2 | 62,7 | Ingénierie logicielle multi-fichiers : le gain le plus marquant |
| CyberGym | 88,1 | 83,3 | Cybersécurité : avantage Flash |
| Automation-Bench | 54,8 | 43,2 | Enchaînements d'outils : avantage Flash |
| Codeforces (note) | 3471 | 3348 | Programmation compétitive : avantage Flash |
| GPQA Diamond | 90,9 | 92,4 | Raisonnement scientifique : avantage V4-Pro |
| HLE (sous-ensemble texte) | 39,1 | 42,7 | Connaissances expertes : avantage V4-Pro |
Ces chiffres sont fournis par DeepSeek, sans audit externe le jour de la sortie. Deux réserves doivent accompagner leur lecture.
D'abord, la variance de harnais. Le même modèle, évalué avec des environnements d'agents différents, obtient des scores sensiblement différents : sur DeepSWE v1.1, le rapport technique montre une plage de 65,5 à 74,2 selon le harnais utilisé (OpenCode, Claude Code, Codex, mini-SWE, DeepSeek Harness, etc.). Sept points d'écart produits par le cadre d'évaluation, pas par le modèle. Autrement dit : un score d'agent n'est jamais le score d'un modèle seul, c'est celui d'un système. Choisissez votre harnais avant de comparer.
Ensuite, la cohérence interne des tableaux. Un relevé tiers note une divergence entre deux documents officiels sur le même benchmark : 65,4 pour NL2Repo-Bench dans le journal des mises à jour de l'API, 64,0 sur la fiche Hugging Face. L'écart est faible et sans conséquence pratique, mais il rappelle qu'une table de benchmarks publiée n'est pas un procès-verbal.
Ce que dit la première mesure indépendante
Le jour du lancement, aucune évaluation tierce n'était disponible. Depuis, Artificial Analysis a publié sa fiche, et elle est instructive, parce qu'elle permet enfin une comparaison à périmètre égal, sur le même indice et la même version de méthode.
| Mesure indépendante (raisonnement, effort max) | V4.1-Flash | V4-Pro 0813 |
|---|---|---|
| Indice d'intelligence Artificial Analysis | 40 (6e sur 113 de sa classe) | 36 (8e sur 113) |
| Vitesse de génération | 199 tokens/seconde | 73 tokens/seconde |
| Prix entrée / sortie (heures pleines) | 0,30 $ / 1,20 $ | 1,32 $ / 3,96 $ |
| Coût pour passer l'indice complet | 476,89 $ | 1 122,27 $ |
| Verbosilé (tokens produits pour l'indice) | 250 M | 160 M |
| Entrée d'images | Oui | Non |
La hiérarchie annoncée par DeepSeek est donc confirmée par une source indépendante : sur cette version de l'indice, le petit modèle passe devant l'ancien flagship, tout en étant environ trois fois plus rapide et nettement moins cher à l'usage.
Trois précautions de méthode, tout de même. D'abord, l'indice d'Artificial Analysis est révisé régulièrement : des scores publiés à d'autres moments ne sont pas comparables entre eux, seule une lecture côte à côte sur la même version a du sens. Ensuite, la comparaison est faite « à classe égale » (modèles à poids ouverts de grande taille) : ces notes ne se transposent pas telles quelles face à des modèles propriétaires de frontière. Enfin, la même fiche signale une verbosité élevée : le modèle produit beaucoup de tokens pour arriver au résultat. À tarif égal, un modèle bavard coûte plus cher qu'un modèle concis. C'est une réserve de facture, pas de qualité.
Le prix : ce qui change vraiment
Le tarif public de l'API, par million de tokens, avec deux plages horaires : les heures pleines (de 01h00 à 04h00 et de 06h00 à 10h00 UTC, du lundi au vendredi) et les heures creuses, facturées moitié prix.
| Tarif API par million de tokens (USD) | V4.1-Flash heures creuses | V4.1-Flash heures pleines | V4-Pro heures pleines |
|---|---|---|---|
| Entrée, cache touché | 0,003 $ | 0,006 $ | 0,044 $ |
| Entrée, cache manqué | 0,15 $ | 0,30 $ | 1,32 $ |
| Sortie | 0,60 $ | 1,20 $ | 3,96 $ |
| Limite de requêtes simultanées | 2 500 | 500 | |
La ligne la plus intéressante est la première : l'entrée déjà en cache coûte cinquante fois moins que l'entrée non mise en cache. Or c'est précisément la ligne qui domine la facture des agents, qui relisent le même contexte de nombreuses fois. Un tarif de cache aussi bas, combiné à un cache quatre fois plus petit, produit un effet cumulé : moins de mémoire à payer, et une mémoire moins chère à relire.
Exemple simple, en heures creuses : une requête de 100 000 tokens d'entrée non cachée et 20 000 tokens de sortie coûte environ 0,027 $ sur V4.1-Flash, contre environ 0,106 $ sur V4-Pro au tarif d'avant. Environ 74 % de moins, à périmètre identique. C'est une arithmétique issue de la grille officielle, pas une mesure de votre charge réelle : les reprises, les appels d'outils et la longueur du raisonnement changent le total.
Deux points pratiques dans la foulée. La limite de simultanéité passe de 500 à 2 500 requêtes pour un compte, ce qui compte pour une flotte d'agents. Et comme les heures creuses sont deux fois moins chères, planifier les traitements par lots en dehors des fenêtres de pointe divise la facture par deux.
V4-Pro : promis au retrait, finalement conservé
Une partie du sujet a bougé en quelques heures, et il faut le dire clairement, parce que beaucoup d'articles ne l'ont pas corrigé.
Dans son annonce, DeepSeek indiquait que toutes les requêtes adressées à deepseek-v4-pro seraient redirigées vers V4.1-Flash à partir du 14 septembre 2026, avec facturation au tarif Flash, jusqu'à la sortie d'un futur V4.1-Pro. La conséquence pratique était nette : vous ne changiez rien à votre configuration, et le modèle derrière l'identifiant changeait quand même.
Puis DeepSeek a fait marche arrière. Sa page de tarifs, comme son journal de mises à jour, indique désormais que, face à la demande, le service API de V4-Pro continue d'être fourni après le 14 septembre 2026, avec une facturation inchangée. Les deux modèles coexistent donc aujourd'hui, V4.1-Flash par défaut et V4-Pro toujours disponible.
Ce qui reste vrai, en revanche : l'identifiant deepseek-flash est le nouveau chemin, et les anciens noms pointent dessus. Vérifiez la documentation officielle avant de figer une migration dans votre plan de production, l'annonce et la page de tarifs n'ayant pas été alignées.
Ce qu'un test en français relève
Les benchmarks anglo-saxons disent une chose ; l'usage réel en dit une autre. Un test francophone publié au lendemain de la sortie apporte un contrepoint utile, à prendre pour ce qu'il est : des épreuves maison, sur échantillons réduits.
Ce qui ressort côté points forts : un suivi de consignes quasi parfait (20 sur 20 sur son test), une bonne robustesse aux formulations perturbées (12 sur 12), de bons résultats en langue et traduction (7 sur 8), une logique et des mathématiques solides, et de bonnes performances sur les tâches de production longue sous contrainte (11 sur 12). Son auteur le classe au-dessus de V4-Pro, avec cette formule : la force de DeepSeek n'est pas l'interface, c'est ce qui ne se voit pas, logique, mathématiques, cybersécurité.
Ce qui coince, en revanche : la tenue de conversation est décrite comme le point faible du modèle, la fabrication (réponses inventées) échoue sur une partie des cas testés, et la complaisance est pointée du doigt, le modèle ayant tendance à aller dans le sens de l'utilisateur plutôt qu'à le contredire. Sur la génération d'interfaces, enfin, le constat est celui d'une forte répétition : mêmes bandeaux, mêmes filtres, mêmes dégradés bleus, tant que la charte graphique et les règles d'agencement ne sont pas fournies explicitement. Autrement dit, un modèle à qui il faut dire le design, pas un modèle qui le devine.
Deux réserves sur cette source : l'auteur annonce un tarif qui ne correspond pas à la grille officielle, et il mentionne des difficultés de routage chez certains fournisseurs au moment du lancement, alors que l'API DeepSeek servait déjà le modèle. Sur ces deux points, la documentation officielle fait foi.
La vidéo complète est disponible ici : DeepSeek V4.1 Flash est sorti (il est mystérieux).
Les limites à garder en tête
- Les benchmarks d'agents mesurent un système, pas un modèle. Sept points d'écart selon le harnais : testez avec le vôtre avant de généraliser un chiffre.
- La verbosité coûte. 250 millions de tokens pour passer l'indice, contre 160 pour V4-Pro chez le même évaluateur : plus de tokens pour un même résultat, c'est une facture plus lourde, même à tarif unitaire réduit.
- Le raisonnement maximal se paie aussi. Le rapport technique indique que passer d'un effort moyen au maximum fait grimper la consommation de tokens d'environ 2,5 fois, pour un gain de l'ordre de neuf points sur huit benchmarks. La zone utile se situerait plutôt entre 60 et 80 d'effort, où l'essentiel du gain est acquis pour moins de la moitié du budget en tokens.
- Tout n'est pas devant. Sur les connaissances factuelles, le multilinguisme et les documents longs, V4-Pro garde des avantages sur les tables publiées, y compris sur LongBench-V2 où il conserve une avance de plus de six points. Un cache plus efficient ne garantit pas une lecture plus fine.
- La complaisance et l'hallucination restent des angles morts de la famille, documentés par l'évaluateur indépendant comme par les tests francophones. Sur les tâches où une erreur coûte cher, la vérification humaine n'est pas optionnelle.
- L'auto-hébergement n'est pas un petit projet. Les poids sont ouverts, mais parlons d'ordinateurs : plusieurs centaines de gigaoctets sur disque, et des analyses de la communauté de l'inférence locale signalent que le modèle ne tient pas tel quel sur une petite grappe de cartes grand public. L'API reste, pour la plupart des PME, le chemin réaliste.
Faut-il basculer maintenant ?
La réponse dépend de ce que vous faites tourner.
Basculez sans hésiter si vos charges sont des agents qui tournent en boucle, du code, du terminal, de l'automatisation d'outils ou du traitement de documents avec images. C'est exactement le terrain où le modèle progresse le plus, et où le cache compressé se traduit en facture. Le passage de l'ancien identifiant à deepseek-flash est trivial.
Testez avant de basculer si votre usage repose sur la connaissance factuelle, le question-réponse documentaire long ou le raisonnement scientifique expert : V4-Pro garde des arguments sur ces terrains, et il reste disponible. Une heure de test avec vos propres prompts vaut mieux que dix tableaux comparatifs.
Réglez l'effort et les horaires. Les préréglages d'effort et la facturation heures creuses sont les deux leviers immédiats de votre facture, avant même de changer de modèle. Un modèle moins cher au token qui raisonne deux fois et demie plus longtemps n'est pas automatiquement moins cher à la tâche.
Vous voulez savoir quel modèle confier à quel agent, et à quel coût réel ? Diipulse teste et arbitre ces choix en conditions de production. Commencez par notre analyse de DeepSeek Harness et des frameworks d'agents, puis voyez ce que GLM-5.3 apporte sur le code et les agents et où se situe Claude Fable 5.1.
Questions fréquentes
Qu'est-ce que DeepSeek V4.1-Flash ?
Un modèle de langage multimodal en mélange d'experts, sorti le 10 septembre 2026 : 552 milliards de paramètres au total, 8 milliards actifs en entrée et 16 en sortie, un million de tokens de contexte, compréhension d'images native et poids ouverts sous licence MIT.
Quel est le nom du modèle sur l'API DeepSeek ?
deepseek-flash. Les identifiants deepseek-v4-flash et deepseek-v4-flash-vision-exp restent acceptés mais sont servis par V4.1-Flash, les modèles correspondants ayant été retirés.
Combien coûte DeepSeek V4.1-Flash ?
Par million de tokens, en heures pleines : 0,30 $ en entrée non mise en cache, 1,20 $ en sortie, et 0,006 $ en entrée déjà en cache. Les heures creuses sont facturées moitié prix, soit 0,15 $, 0,60 $ et 0,003 $.
V4.1-Flash est-il vraiment meilleur que V4-Pro ?
Sur les benchmarks d'agents, de code et de cybersécurité publiés par DeepSeek, oui. La mesure indépendante d'Artificial Analysis confirme la hiérarchie sur son indice actuel (40 contre 36 pour V4-Pro 0813). V4-Pro conserve toutefois des avantages sur certaines épreuves de connaissances et de raisonnement scientifique, et reste disponible.
Les poids sont-ils vraiment ouverts ?
Oui, sous licence MIT, avec le rapport technique sur Hugging Face. Cela ne signifie pas qu'il est facile à héberger : comptez plusieurs centaines de gigaoctets et un matériel sérieux pour une inférence locale utilisable.
DeepSeek V4.1-Flash est-il adapté au français ?
Il traite le français sans difficulté visible, et les tests francophones publiés au lancement le jugent bon en langue et traduction. Ses faiblesses connues sont ailleurs : la tenue de conversation longue, la tendance à la complaisance et l'invention de détails quand il ne sait pas.
Conclusion
Le geste de DeepSeek est intéressant moins pour le chiffre brut que pour la direction : un modèle « petit » et bon marché qui passe devant son propre flagship sur les tâches d'agents, avec une architecture taillée pour les longs contextes et un tarif qui divise la facture. Pour les équipes qui font tourner des agents, c'est une bonne nouvelle concrète.
La bonne lecture reste cependant celle d'un outil, pas d'un classement. Les scores d'agents dépendent du harnais, le modèle est bavard, il reste en retrait sur certaines connaissances, et les benchmarks sont fournis par l'éditeur, même si la première mesure indépendante va dans son sens. Testez avec vos prompts, réglez l'effort de raisonnement et les horaires, et gardez un œil sur ce que l'annonce et la page de tarifs racontent de V4-Pro : les deux documents ne disent pas encore la même chose.
Sources
- DeepSeek : annonce officielle de DeepSeek-V4.1-Flash (10 septembre 2026)
- DeepSeek API Docs : journal des mises à jour (sortie V4.1-Flash, changement d'identifiants, statut de V4-Pro)
- DeepSeek API Docs : page Models & Pricing (tarifs officiels, limites de simultanéité, contexte, sortie maximale)
- Hugging Face : fiche du modèle et rapport technique (architecture, benchmarks, effort de raisonnement)
- Artificial Analysis : fiche de mesure indépendante de DeepSeek V4.1 Flash (indice, vitesse, coût, verbosité)
- Test francophone publié au lancement : « DeepSeek V4.1 Flash est sorti (il est mystérieux) », Meydeey