DeepSeek V4.1 Flash mise sur des « N-grammes » pour alléger la mémoire de son modèle
763 milliards de paramètres, dont 196 milliards de poids d'un nouveau genre : l'entreprise chinoise promet jusqu'à huit fois plus d'utilisateurs simultanés à mémoire égale
Photo : Growtika / Unsplash
DeepSeek a présenté jeudi une mise à jour de son modèle V4 Flash, baptisée V4.1 Flash, qui introduit une architecture inhabituelle : un « module de mémoire conditionnelle » censé réduire fortement l'empreinte mémoire nécessaire pour faire tourner un grand modèle de langage. L'entreprise chinoise revendique des gains d'efficience concrets, même si aucun benchmark de qualité indépendant n'accompagne l'annonce à ce stade.
763 milliards de paramètres, dont un quart d'un genre nouveau
V4.1 Flash compte 763 milliards de paramètres au total, soit plus de deux fois et demie la taille de V4 Flash, et davantage que V3 ou R1. Sur ce total, 196 milliards de paramètres sont ce que DeepSeek appelle des « N-grammes » : des groupes de tokens organisés en table de consultation plutôt qu'en poids classiques chargés en permanence en mémoire GPU. Selon l'entreprise, quelques dizaines de recherches par token suffisent à les exploiter, ce qui permet de les stocker sur un disque rapide plutôt que dans la mémoire vive du GPU.
Concrètement, DeepSeek annonce une réduction de 13 à 25 % de la consommation mémoire des caches clé-valeur par rapport à V4 Flash, ce qui se traduirait par 4 à 8 fois plus d'utilisateurs simultanés supportés à empreinte mémoire égale. Faire tourner l'intégralité du modèle en pleine précision nécessiterait théoriquement 763 Go de mémoire GPU, un chiffre réductible à environ 567 Go si les N-grammes sont délocalisés hors de la VRAM.
Une idée déjà explorée ailleurs, pas une invention isolée
L'approche n'est pas totalement inédite : Google a exploré une piste voisine avec les Per-Layer Embeddings de ses modèles Gemma, principalement sur des modèles de petite taille. Plus révélateur, Alibaba a présenté fin août Qwen 3.8-Flash-Next, doté de 180 milliards de paramètres dont 51 milliards de N-grammes, en indiquant explicitement s'inspirer des recherches publiées par DeepSeek en janvier — et prévoit d'en faire la base de son futur Qwen 4.
196 milliards des 763 milliards de paramètres sont des N-grammes, formant ce que DeepSeek appelle un « module de mémoire conditionnelle ».
— terminologie de DeepSeek, reprise par Clubic, 11 septembre 2026.
Les chiffres avancés proviennent de DeepSeek elle-même et n'ont pas été vérifiés par un tiers indépendant : ils décrivent une architecture, pas une mesure de performance validée en externe. Cela n'empêche pas la tendance de fond d'être réelle : entre Google, DeepSeek et désormais Alibaba, la réduction du coût mémoire des LLM devient un axe de recherche aussi disputé que la course aux benchmarks de raisonnement, à surveiller dans les mois qui viennent plutôt qu'à trancher dès aujourd'hui.
Source
D'après Clubic, qui cite The Register.
À lire ensuite
OpenAI suspend les nouveaux abonnements ChatGPT Pro, débordée par la demande pour GPT-6 Astra
OpenAI a suspendu les nouvelles souscriptions à ChatGPT Pro, invoquant une demande sans précédent pour GPT-6 Astra. Les abonnés déjà inscrits ne sont pas concernés. La mesure fait écho, sans lui être formellement liée, à des propos de Sam Altman sur un ralentissement possible du rythme de l'IA.
Kelvyn3 min de lecture
Universal Music lance une plateforme IA de remix musical avec ElevenLabs
Universal Music Group annonce un accord pluriannuel avec ElevenLabs pour une plateforme IA de remix et mashup musicaux. La participation des artistes est optionnelle et aucune date de lancement public n'a été fixée.
Kelvyn3 min de lecture
Visa, Mastercard et Ant International encadrent les paiements par agents IA
Visa, Mastercard et Ant International annoncent Know-Your-Agent, un cadre de vérification commun pour les agents IA effectuant des paiements. Un pas vers l'interopérabilité, mais qui ne protège pas contre les erreurs de raisonnement des agents eux-mêmes.
Kelvyn3 min de lecture