DeepSeek V4.1-Flash : un cache 4 fois moins gourmand pour les agents IA

DeepSeek lance V4.1-Flash avec un cache quatre fois moins gourmand en mémoire et huit fois moins gourmand en stockage : ce que ça change pour le prix de vos agents IA.

Stéphane Larue
Par
Stéphane Larue — article rédigé avec l’IA
Stéphane Larue est journaliste et éditeur indépendant spécialisé dans l actualité des médias, du divertissement et de la culture numérique. Fondateur du site stephanelarue.com, il assure...
6 min de lecture

À retenir

  • DeepSeek a lancé V4.1-Flash le 10 septembre 2026, avec un cache quatre fois moins gourmand en mémoire
  • En entrée avec cache, le million de tokens tombe à 0,003 dollar hors heures de pointe
  • DeepSeek annule l’arrêt prévu de V4-Pro, finalement maintenu en service
  • Les heures creuses, UTC 1h-4h et 6h-10h exclues en semaine, divisent la facture par deux
Au sommaire
  1. Le cache passe de 0,66 à 0,003 dollar hors heures de pointe
  2. Le KV cache, un poste de coût central pour les agents IA
  3. DeepSeek maintient V4-Pro en service, contre son propre calendrier
  4. Une architecture à 552 milliards de paramètres, 8 activés en entrée
  5. DeepSeek revendique de meilleurs résultats que V4-Pro sur plusieurs benchmarks
  6. Programmer ses appels API en heures creuses, un vrai levier d’économie

DeepSeek a mis en service son modèle V4.1-Flash le 10 septembre 2026, avec une promesse chiffrée : un cache quatre fois moins gourmand en mémoire vive et huit fois moins gourmand en stockage que la génération précédente. L’entreprise chinoise en profite pour baisser ses tarifs API, un enjeu direct pour qui fait tourner des agents IA à grande échelle.

Publicite

Le laboratoire présente V4.1-Flash comme le plus compact de sa famille V4.1, pensé pour l’inférence rapide et les applications agentiques qui multiplient les allers-retours avec de longs contextes.

DeepSeek avait relevé ses tarifs jusqu’à 4,7 fois quelques mois plus tôt. Le nouveau modèle inverse la tendance, au moins sur le segment économique de sa gamme.

Le cache passe de 0,66 à 0,003 dollar hors heures de pointe

Sur l’API DeepSeek, un appel qui retrouve son contexte en cache coûte 0,003 dollar par million de tokens en entrée hors heures de pointe, contre 0,022 dollar pour V4-Pro sur le même segment.

Sans cache, l’écart reste net : 0,15 dollar contre 0,66 dollar. En sortie, V4.1-Flash facture 0,60 dollar contre 1,98 dollar pour V4-Pro.

Ces tarifs doublent aux heures de pointe, comme pour le reste de la gamme DeepSeek.

Le KV cache, un poste de coût central pour les agents IA

Le KV cache stocke les calculs déjà faits sur un contexte, pour éviter de les refaire à chaque nouveau message.

Un agent IA qui relit un long historique de conversation, un document ou un code source à chaque appel s’appuie fortement dessus. Plus le cache est lourd à maintenir, plus la facture d’infrastructure grimpe, indépendamment du prix affiché par token.

En réduisant ce cache d’un facteur 4 en mémoire HBM et 8 en stockage SSD, DeepSeek cible directement ce poste : moins de matériel nécessaire pour tenir le même volume de requêtes en parallèle.

DeepSeek maintient V4-Pro en service, contre son propre calendrier

L’entreprise prévoyait initialement d’arrêter V4-Pro à partir du 14 septembre 2026. Elle a finalement annulé cette mise hors service et garde son modèle phare disponible, au tarif inchangé.

Publicite

Les anciennes versions V4-Flash et V4-Flash-Vision-Exp, elles, disparaissent et redirigent automatiquement vers V4.1-Flash sous l’identifiant deepseek-flash.

Une architecture à 552 milliards de paramètres, 8 activés en entrée

V4.1-Flash repose sur une architecture Mixture-of-Experts de 552 milliards de paramètres au total. Une nouvelle architecture Causal Encoder-Decoder n’en active que 8 milliards pour traiter l’entrée et 16 milliards pour générer la sortie.

Le modèle intègre aussi une compréhension visuelle native, sans passer par un module séparé comme sur l’ancienne version V4-Flash-Vision-Exp de la gamme précédente.

DeepSeek revendique de meilleurs résultats que V4-Pro sur plusieurs benchmarks

Sur les tests publiés par l’entreprise, V4.1-Flash dépasserait son propre modèle phare V4-Pro sur plusieurs critères : qualité des réponses, vitesse d’inférence et temps d’exécution total d’une requête.

Plusieurs évaluations menées en dehors de DeepSeek iraient dans le même sens, toujours selon l’entreprise, en plaçant V4.1-Flash devant V4-Pro sur le rapport performance-coût. Aucun de ces résultats n’a pour l’instant été confirmé par un laboratoire indépendant.

Pour une équipe qui fait tourner un agent IA en production, ces chiffres pèsent autant que le tarif au token : une réponse plus rapide réduit aussi le temps de calcul facturé, donc la facture finale.

Programmer ses appels API en heures creuses, un vrai levier d’économie

Les heures de pointe DeepSeek courent de 1h à 4h puis de 6h à 10h UTC, du lundi au vendredi. Converti à Paris, cela correspond à 3h-6h et 8h-12h en période d’heure d’été.

Un traitement par lots (résumés, indexation, synthèse de documents) programmé l’après-midi ou le soir profite donc automatiquement du tarif réduit de moitié, sans changer une ligne de code métier.

DeepSeek dit vouloir travailler avec la communauté open source sur le support de l’inférence de V4.1-Flash, avec en ligne de mire des déploiements pouvant atteindre 2 000 GPU et un cluster de stockage dédié.

Pour comparer les modèles disponibles au quotidien, notre comparatif des assistants IA grand public détaille les usages de ChatGPT, Gemini et Claude.

Publicite

À la une

  1. Argent / FinanceFed : taux relevé à 4 %, première hausse depuis 2023 malgré Trump
  2. MédiasTBT9 : Hanouna dit payer « le prorata de la lumière », pas ses chroniqueurs
  3. TechStarship vise l’orbite le 22 septembre, décollage à 14h15 heure de Paris
  4. Notre quotidienLoto du mercredi 16 septembre : les numéros gagnants de ce soir
Publicité
Partager cet article
Suivre :
Stéphane Larue est journaliste et éditeur indépendant spécialisé dans l actualité des médias, du divertissement et de la culture numérique. Fondateur du site stephanelarue.com, il assure une veille quotidienne sur les sujets d information générale, en s appuyant sur les sources officielles et les communiqués de presse. Il publie également des analyses, des interviews et des sélections éditoriales à destination d un large public.