Auteur : Gao Yunyi
Édition丨Cen Feng
Poser deux fois la même question à DeepSeek, en ajoutant seulement quelques espaces, et pourtant les réponses obtenues sont telles que l'une semble venir d'un « génie » et l'autre d'un « attardé ». Fin du mois 9, la dernière étude de l'équipe de ByteDance« Periodic Weak Spots: Phase Sensitivity from Chunked KV-Cache Compression », en nommant directement les modèles de la série DeepSeek V4« la dualité dieu-démon». Légende : lien vers l'article https://arxiv.org/pdf/2609.36322 Il s'agit en réalité d'une « amnésie périodique » causée par la paresse de l'algorithme sous-jacent :la technique de compression par blocs du KV Cachedécoupe le long contexte en blocs compressés traités séparément, ce qui pose un problème :« la position détermine le destin ». Si vos mots-clés tombent malheureusement dans la « zone d'ombre informationnelle » à la jonction des blocs, le modèle ne peut que délirer. Imaginez que l'on demande à un grand modèle de relire un contrat de plusieurs dizaines de pages et qu'une clause clé se trouve justement dans la « zone d'ombre informationnelle » : le modèle ignore carrément cette information et parvient à une conclusion opposée. Et cette erreur peut provenir d'un simple caractère d'espacement ajouté par inadvertance : le modèle s'effondre, sans que vous sachiez même d'où vient le problème. Et cette faiblesse congénitale de « dualité dieu-démon » est loin d'être propre à DeepSeek. À l'heure où l'on clame haut et fort « faire chuter le coût des longs textes », tous les modèles employant ce type de compression par blocs ou de techniques de creusement, comme la série open source Llama 3, présentent plus ou moins des problèmes similaires.
01
L'article de ByteDance attrape DeepSeek la main dans le sac
La découverte initiale de ByteDance est née de la complétion d'un morceau de code par DeepSeek-V4-Flash-Base. La tâche consistait à compléter le dernier Token d'une fonction de quantification FP8. Selon la logique du code, le résultat correct aurait dû être 8, mais parce que les chercheurs avaient ajouté au tout début du code une série de signes égal purement décoratifs, le modèle a sorti 32. Plus étrange encore, cette erreur n'était pas aléatoire, mais directement liée au nombre de signes égal :lorsque le nombre de signes égal est divisé par 4, si le reste est 0 ou 1, le modèle se trompe avec une forte probabilité, le taux d'erreur atteignant 71,3 % ; si le reste est 2 ou 3, le model répond correctement, avec un taux de réussite atteignant 91,5 %.L'équipe de ByteDance a remonté la piste et découvert qu'il s'agissait d'une faiblesse congénitale laissée par l'adoption par les grands modèles dela technique de compression par blocs du KV Cache. La compression par blocs du KV Cache est l'arme fatale de DeepSeek pour résoudre la pression mémoire des longs contextes : elle découpe les Tokens continus en segments de longueur fixe, et les Tokens de chaque segment peuvent être comprimés en « petits résumés » via une couche de portes (gating) apprenable, ce qui allège d'un coup la pression mémoire des longs contextes. Cela résout le problème de mémoire, mais en introduit un nouveau. L'attention du Transformer standard ne dépend que de la distance relative entre les Tokens, sans se soucier de la position absolue. Peu importe où une phrase est placée, tant que l'ordre des mots ne change pas, le sens reste le même.Mais après l'adoption par DeepSeek de la compression par blocs du KV Cache, la position de chaque Token dans le segment compressé devient importante ; cette position s'appelle la « phase ». La couche de portes attribue des poids différents aux Tokens selon leur position, et ce poids s'appelle le facteur de gain de slot.Les Tokens placés dans des slots forts sont pondérés et conservés, et le modèle répond avec précision ; les Tokens placés dans des slots points aveugles sont presque ignorés, et le modèle se trompe.Cette sensibilité au positionnement s'appelle la sensibilité de phase.En analysant plus avant l'intérieur du modèle, les chercheurs ont également découvert que les têtes d'attention formaient une division naturelle du travail. Certaines traitent spécifiquement les positions du début du segment, d'autres spécifiquement les positions de fin. Cette spécialisation de phase fait de certains positionnements des points faibles.Pour vérifier qu'il ne s'agissait pas d'une coïncidence, l'équipe de ByteDance a également réalisé un test du type « aiguille dans une botte de foin ». Les chercheurs ont construit un contexte d'une longueur de 128K Token, contenant environ 1,6 万 paires clé-valeur, chaque Key correspondant à un Value. En gardant inchangées les relations clé-valeur, la question, ainsi que la longueur totale du contexte, si l'on plaçait l'une des paires clé-valeur à des positions différentes, le modèle pourrait-il encore répondre correctement avec le Value correspondant ? Il s'est avéré que DeepSeek-V4-Flash-Base présentait un écart d'exactitude maximal de 40,2 % entre les différentes positions. Avec DeepSeek-V4-Pro-Base, l'écart atteignait 34,8 % ; même après une optimisation par post-entraînement, le problème persistait, avec des écarts de 19,1 % et de 14,8 %. Face à ce problème de zones aveugles périodiques, DeepSeek a essayé DeepSeek-V4.1-Flash, en réduisant de moitié le pas de compression. Lorsque le pas de compression est fixé à 4, chaque cycle de compression divise le contexte en 4 emplacements. Les poids d'information attribués aux différents emplacements varient considérablement, et les Token situés aux positions de bord sont facilement perdus lors de deux cycles consécutifs de compression par fenêtre. En abaissant le pas à 2, la compression devient plus fine, ne fusionnant à chaque fois que 2 Token. Au sein d'un cycle de compression, un Token n'a que deux positions relatives possibles. Ainsi, même si une information clé tombe sur une position impaire plus faible, comme les positions adjacentes ne sont distantes que d'1 Token, il est difficile que le contexte soit totalement perdu. DeepSeek-V4.1-Flash a effectivement ramené l'écart d'exactitude à 6,1 %, mais le problème n'a pas été complètement éliminé. L'équipe de ByteDance a donc entraîné de zéro un lot de modèles basés sur l'architecture Qwen3-0.6B, toutes les autres configurations étant rigoureusement identiques, seule la mécanique de compression étant modifiée. Les résultats ont montré :- tous les modèles employant la compression par blocs ont présenté des fluctuations périodiques de précision ; le modèle de base en pleine attention, sans compression, n'a pas présenté ce phénomène ;
- la période de fluctuation était strictement égale au pas de compression ;
- en supprimant l'encodage de position RoPE, la fluctuation persistait : ce n'est donc pas un biais lié à l'encodage de position ;
- en remplaçant les poids apprenables des portes par la répartition uniforme la plus simple, la fluctuation périodique subsistait : ce n'est donc pas un problème de mauvais réglage des paramètres.
02
Le « découpage dynamique » est-il l'antidote ?
Le cœur du découpage dynamique consiste à abandonner le mode consistant à tout couper au même endroit selon un nombre fixe de Tokens, pour s'ajuster de manière flexible selon la sémantique et l'importance.Cette approche technique constitue une refonte de haut en bas de l'ensemble de la pile technologique, des mathématiques des algorithmes à la gestion de la mémoire vidéo, jusqu'au matériel sous-jacent.▎Première couche : refonder les bases mathématiques de l'attention
Comment découper concrètement avec le découpage dynamique ? Le principe central : « la taille suit le contenu ». Les passages creux à faible densité d'information sont directement fusionnés en grands blocs ; face aux tournants cruciaux et aux informations à haute densité, on découpe suffisamment finement pour un calcul précis. Ainsi, quelle que soit la position de l'information clé, le modèle peut la capter avec acuité, ce qui reconstruit mathématiquement l'invariance par translation que le découpage fixe avait brisée. Plus loin encore, cela confère au modèle une capacité d'« anticipation » : d'abord jeter un coup d'œil à la densité d'information, puis décider de la taille du découpage. Le processus d'inférence ne suit plus un rythme unique du début à la fin : lecture rapide là où il faut aller vite, lecture attentive là où il faut prendre son temps — une intuition de « pensée rapide et lente » qui émerge au plus bas niveau de l'architecture.▎Deuxième couche : une évolution imposée à la gestion de la mémoire vidéo
Auparavant, pour accélérer les calculs matriciels, le KV Cache était géré par blocs de taille fixe. L'avantage de cette méthode était sa simplicité, sa régularité et sa facilité de manipulation, mais l'utilisation de la mémoire vidéo plafonnait et la puissance de calcul était facilement gaspillée. Avec le découpage dynamique, la traditionnelle « matrice statique continue » du niveau inférieur ne tient plus : elle doit inévitablement évoluer vers une « matrice topologiquement clairsemée », avec une couche d'indexation dynamique pour l'adressage. Plus remarquable encore, les chercheurs ont découvert que les frontières du découpage dynamique entre les différentes couches du Transformer sont très similaires et peuvent être directement réutilisées. Cela réduit considérablement le coût de l'adressage dynamique. Au final, le niveau supérieur découpe intelligemment, le niveau inférieur stocke de façon plus économe, et l'adressage intermédiaire reste rapide.▎Troisième couche : résoudre le casse-tête de l'alignement matériel
C'est la plus difficile des trois couches à franchir. Les GPU privilégient naturellement les opérations matricielles régulières, dont les dimensions sont divisibles par 8, 16, 32 — c'est la raison matérielle la plus concrète pour laquelle toute l'industrie a longtemps maintenu le découpage fixe. Si les tailles de blocs sont irrégulières, les unités d'accélération conçues pour le calcul matriciel (comme les Tensor Core) tournent massivement à vide. Face à ce problème, l'industrie a déjà exploré des solutions viables. Par exemple, l'algorithme de remplissage par zéros permet, au niveau de la mémoire vidéo physique, d'assembler étroitement des blocs sémantiques dynamiques de longueurs différentes sans gaspiller d'espace, tout en préservant logiquement les frontières de chaque bloc sémantique. Actuellement,les plus grands laboratoires d'IA mondiaux font progresser la technologie du découpage dynamique dans deux directions : la « continuité sémantique » et le « calcul clairsemé », et cette technologie est devenue le principal levier d'accélération et d'amélioration de la qualité des nouveaux grands modèles à contexte long.Le résultat le plus représentatif est ChunkKV, proposé par l'équipe de l'Université des sciences et technologies de Hong Kong (Guangzhou), qui suit la voie de la « continuité sémantique ». Auparavant, les principales méthodes de compression KV, qu'il s'agisse de H2O, SnapKV ou PyramidKV, reposaient toutes sur l'idée d'attribuer un score à chaque Token individuel, en conservant les importants et en écartant les non-importants. Ce type de filtrage dissocie facilement une phrase complète en sujet-verbe-complément. L'idée centrale de ChunkKV est de prendre comme unité de compression de base des blocs sémantiques continus : soit le bloc entier est conservé, soit il est rejeté en entier. Ce qui reste, ce sont des phrases et des expressions complètes. Dans le benchmark NIAH (needle in a haystack, chercher une aiguille dans une botte de foin), le plus exigeant pour la récupération sur longs textes, lorsque la taille du cache KV est limitée à 128, le ChunkKV basé sur LLaMA-3 atteint une précision de 73,8 %, contre seulement 58,9 % pour la méthode traditionnelle SnapKV. Cette technologie comble directement le point faible des grands modèles en contexte long — « ne pas comprendre, ne pas trouver » — et améliore considérablement l'utilisabilité réelle du modèle.Outre ChunkKV, l'équipe du Dr Xiao Han de Jina AI, axée sur l'optimisation de la recherche, a proposé un schéma de découpage différé qui résout le problème fatal de la recherche intelligente traditionnelle consistant à « découper d'abord le texte, puis analyser le contenu » : on laisse d'abord le modèle lire l'intégralité du texte, absorber le contenu global et la logique contextuelle, et ce n'est qu'avant de produire le résultat final que le texte est découpé selon les frontières naturelles de la sémantique, préservant ainsi au maximum l'information complète. Du côté du « calcul clairsemé », leframework MInference, développé par Microsoft Research Asia, est spécialement conçu pour l'inférence sur des textes ultra-longs de l'ordre du million de mots. L'équipe a découvert que, lorsqu'un grand modèle lit un long texte, tout le contenu ne nécessite pas un calcul fin : la matrice d'attention présente des régularités de parcimonie exploitables. Sur la base de cette caractéristique, ce framework attribue à chaque tête d'attention la méthode de calcul clairsemé la mieux adaptée. Sans aucune baisse de la précision de récupération, il atteint jusqu'à 10 fois d'accélération sur la phase de pré-remplissage (prefill) d'un contexte long d'un million de mots. Dans la première moitié de l'ère du contexte long, alors que tous se disputaient pour voir « qui peut traiter le plus long », les technologies de compression KV ont joué un rôle essentiel. Mais l'essence même du contexte long n'a jamais été la longueur pour la longueur. Lorsque les utilisateurs commencent à véritablement traiter des tâches réelles avec de longs contextes, l'efficacité, la convivialité et l'absence de perte d'information deviennent les nouveaux KPI. Références : https://arxiv.org/pdf/2609.36322https://www.zhihu.com/question/2091513666864682278
Montez à bord, 雷峰网 (compte public : 雷峰网) vous fait découvrir les points forts des plus grands sommets mondiaux sur l'IA
Accès exclusif à :
Les présentations PowerPoint des experts
Les textes intégraux des rapports du congrès
L'analyse des articles les plus populaires
Les interviews des nouvelles étoiles académiques
Scannez le QR code ci-dessus
ou cliquez sur « Lire l'article original » pour suivre la rubrique.
Article original de 雷峰网, reproduction interdite sans autorisation. Voir détails dans lesConditions de reproduction。