AIbaseMis à jour le

Pourquoi les longs textes de DeepSeek se « dérèglent-ils » soudainement ? L'équipe Seed de ByteDance lève le voile sur le mystère des…

L'équipe Seed de ByteDance révèle dans son dernier article que les fluctuations de performance des grands modèles de langage lors du traitement de textes très longs proviennent principalement de la « sensibilité de phase…

Pourquoi les longs textes de DeepSeek se « dérèglent-ils » soudainement ? L'équipe Seed de ByteDance lève le voile sur le mystère des fluctuations de performance de l'IA

Base AIbase

Publié leActualités IA · 1 minute de lecture · Oct 9, 20262

Dans son dernier article de recherche, l'équipe Seed de ByteDance révèle les raisons techniques des fluctuations de performance des grands modèles de langage lors du traitement de textes très longs. L'équipe de recherche indique que ce phénomène provient principalement de la « sensibilité de phase » induite par la technique de compression du cache KV par blocs.

Un mécanisme clé provoquant des biais de récupération

Afin de réduire la consommation mémoire lors de l'inférence à long contexte, cette technique compresse des fenêtres de jetons consécutifs en un nombre plus restreint d'entrées via une foulée fixe. Cependant, ce mécanisme de compression introduit une toute nouvelle coordonnée de position : la « phase » du Token par rapport aux limites de la fenêtre de compression.

Les expériences montrent que, face à des informations strictement identiques, des phases différentes entraînent des variations drastiques de la difficulté de récupération. Dans certains grands modèles open source, l'écart de précision de récupération sur longs textes causé par ces différences de phase peut atteindre 40 points de pourcentage.

Des faiblesses périodiques à optimiser en urgence

Cette découverte révèle les limites des tests de référence moyens traditionnels : sous des scores moyens apparemment excellents de certains modèles peuvent se cacher de graves faiblesses périodiques. Alors que les applications des grands modèles de langage pour textes longs se généralisent, ces résultats de recherche fournissent une base théorique importante pour l'optimisation future des architectures de modèles et l'amélioration de la stabilité de l'inférence à long contexte.


Grands modèles de langageCompression du cache KV par blocsSensibilité de phaseRécupération sur longs textes

Cet article provient du journal quotidien AIbase

Bienvenue dans la rubrique [Journal quotidien de l'IA] ! C'est votre guide quotidien pour explorer le monde de l'intelligence artificielle. Chaque jour, nous vous présentons les actualités phares du domaine de l'IA, avec un focus sur les développeurs, pour vous aider à comprendre les tendances technologiques et à découvrir les applications innovantes des produits IA.

—— Créé par l'équipe du journal quotidien AIbase © Tous droits réservés Base AIbase 2024, cliquez pour voir la source -
Source originale

AIbase

À propos du contenu

La publication originale et les droits appartiennent à la source.

Traduction automatique · Consultez l’original