Aller au contenu
KLYNLABS

DeepSeek V4.1 Flash mise sur des « N-grammes » pour alléger la mémoire de son modèle

763 milliards de paramètres, dont 196 milliards de poids d'un nouveau genre : l'entreprise chinoise promet jusqu'à huit fois plus d'utilisateurs simultanés à mémoire égale

Kelvyn2 min de lecture

DeepSeek a présenté jeudi une mise à jour de son modèle V4 Flash, baptisée V4.1 Flash, qui introduit une architecture inhabituelle : un « module de mémoire conditionnelle » censé réduire fortement l'empreinte mémoire nécessaire pour faire tourner un grand modèle de langage. L'entreprise chinoise revendique des gains d'efficience concrets, même si aucun benchmark de qualité indépendant n'accompagne l'annonce à ce stade.

763 milliards de paramètres, dont un quart d'un genre nouveau

V4.1 Flash compte 763 milliards de paramètres au total, soit plus de deux fois et demie la taille de V4 Flash, et davantage que V3 ou R1. Sur ce total, 196 milliards de paramètres sont ce que DeepSeek appelle des « N-grammes » : des groupes de tokens organisés en table de consultation plutôt qu'en poids classiques chargés en permanence en mémoire GPU. Selon l'entreprise, quelques dizaines de recherches par token suffisent à les exploiter, ce qui permet de les stocker sur un disque rapide plutôt que dans la mémoire vive du GPU.

Concrètement, DeepSeek annonce une réduction de 13 à 25 % de la consommation mémoire des caches clé-valeur par rapport à V4 Flash, ce qui se traduirait par 4 à 8 fois plus d'utilisateurs simultanés supportés à empreinte mémoire égale. Faire tourner l'intégralité du modèle en pleine précision nécessiterait théoriquement 763 Go de mémoire GPU, un chiffre réductible à environ 567 Go si les N-grammes sont délocalisés hors de la VRAM.

Une idée déjà explorée ailleurs, pas une invention isolée

L'approche n'est pas totalement inédite : Google a exploré une piste voisine avec les Per-Layer Embeddings de ses modèles Gemma, principalement sur des modèles de petite taille. Plus révélateur, Alibaba a présenté fin août Qwen 3.8-Flash-Next, doté de 180 milliards de paramètres dont 51 milliards de N-grammes, en indiquant explicitement s'inspirer des recherches publiées par DeepSeek en janvier — et prévoit d'en faire la base de son futur Qwen 4.

196 milliards des 763 milliards de paramètres sont des N-grammes, formant ce que DeepSeek appelle un « module de mémoire conditionnelle ».

— terminologie de DeepSeek, reprise par Clubic, 11 septembre 2026.

Les chiffres avancés proviennent de DeepSeek elle-même et n'ont pas été vérifiés par un tiers indépendant : ils décrivent une architecture, pas une mesure de performance validée en externe. Cela n'empêche pas la tendance de fond d'être réelle : entre Google, DeepSeek et désormais Alibaba, la réduction du coût mémoire des LLM devient un axe de recherche aussi disputé que la course aux benchmarks de raisonnement, à surveiller dans les mois qui viennent plutôt qu'à trancher dès aujourd'hui.

Source

D'après Clubic, qui cite The Register.

À lire ensuite