DeepSeekの長文テキスト処理がなぜ突然「不調」に?バイトダンスSeedチームがAIの性能変動の謎を解明
AIbase基地
公開日AIニュース · 1 分で読める · Oct 9, 20262バイトダンス傘下のSeedチームは最新の研究論文で、大規模言語モデルが超長文テキストを処理する際に性能変動が生じる技術的原因を明らかにした。研究チームは、この現象が主にチャンク化KVキャッシュ圧縮技術がもたらす「位相感受性」に起因すると指摘している。
重要なメカニズムが検索の偏りを引き起こす
この技術は、長コンテキスト推論時のメモリ消費を削減するため、固定ストライドによって連続するトークンウィンドウをより少ないエントリに圧縮する。しかし、この圧縮メカニズムは、圧縮ウィンドウの境界に対するトークンの「位相」という全く新しい位置座標を導入することになった。
実験によれば、まったく同じ情報に対して、位相が異なるだけで検索の難易度が劇的に変化する。一部の大型オープンソースモデルでは、この位相の違いによる長文テキスト検索の正解率の落ち込みは最大40ポイントに達する。
周期的な弱点、最適化が急務
この発見は、従来の平均ベンチマークテストの限界を明らかにした。一部のモデルでは、優秀に見える平均高得点の裏に、深刻な周期的な弱点が隠れている可能性がある。長文テキスト大規模モデルの応用が広がるにつれ、この研究成果は、今後のモデルアーキテクチャの最適化と長コンテキスト推論の安定性向上に重要な理論的根拠を提供するものである。
本記事はAIbaseデイリーから
【AIデイリー】へようこそ!ここは毎日AIの世界を探索するためのガイドです。毎日AI分野のホットなコンテンツをお届けし、開発者に焦点を当て、技術トレンドの把握や革新的なAI製品・応用の理解をサポートします。
—— AIbase デイリー班による制作 © 著作権所有 AIbase基地 2024、出典を表示する -