IT之家 Le 10/9, l'équipe Seed de ByteDance a soumis vers la fin du mois 9 de cette année sur la plateforme de prépublications arXiv un article évoquant la sensibilité de phase induite par la compression du cache KV par blocs,pointant directement la cause des « ratés » de DeepSeek。

Cette étude a évalué les versions de base et post-entraînées de DeepSeek-V4-Flash et DeepSeek-V4-Pro, ainsi que le DeepSeek-V4.1-Flash post-entraîné.
Grâce à la compression du cache KV par blocs, le modèle comprime, à pas fixe, des fenêtres de tokens consécutifs en un nombre réduit d'entrées de cache, ce qui permet de réduire les coûts de mémoire et d'attention de l'inférence en contexte long.
Cependant, cette compression introduit également une nouvelle coordonnée positionnelle :la phase du Token, c'est-à-dire sa position par rapport aux limites de la fenêtre de compression.

L'équipe a découvert une asymétrie systématique dans les modèles utilisant cette compression :la même information est facile à récupérer dans une phase, mais difficile à récupérer dans une autre. L'équipe nomme cette variation périodique de la performance de récupération la sensibilité de phase (phase sensitivity).
Dans les grands modèles à poids ouverts utilisant ce type de compression, la précision de récupération en contexte long peutvarier jusqu'à 40 points de pourcentage entre les phases, révélant ainsi une faiblesse périodique que les scores moyens des benchmarks peuvent masquer.

IT之家 fournit le lien de l'article :
https://arxiv.org/abs/2609.36322
Déclaration publicitaire : les liens de redirection externes contenus dans le texte (y compris mais sans s'y limiter les hyperliens, les codes QR, les mots de passe et autres formes) servent à transmettre davantage d'informations et à faire gagner du temps de tri ; les résultats sont fournis à titre indicatif uniquement. Tous les articles de IT之家 contenant des liens externes incluent cette déclaration.
