AIbase更新日

DeepSeekの長文テキスト処理がなぜ突然「不調」に?バイトダンスSeedチームがAIの性能変動の謎を解明

バイトダンス(字節跳動)Seedチームは最新の論文で、大規模言語モデルが超長文テキストを処理する際の性能変動は、主にチャンク化KVキャッシュ圧縮技術の「位相感受性」に起因すると明らかにした。長コンテキスト推論のメモリ消費を削減するため、この技術は固定ストライドで連続するトークンウィンドウをより少ないエントリに圧縮するが、圧縮ウィンドウに対するトークンの新たな位置座標を導入することになり、検索の偏りを引き起こし、ひいては性能変動を招く。

DeepSeekの長文テキスト処理がなぜ突然「不調」に?バイトダンスSeedチームがAIの性能変動の謎を解明

AIbase基地

公開日AIニュース · 1 分で読める · Oct 9, 20262

バイトダンス傘下のSeedチームは最新の研究論文で、大規模言語モデルが超長文テキストを処理する際に性能変動が生じる技術的原因を明らかにした。研究チームは、この現象が主にチャンク化KVキャッシュ圧縮技術がもたらす「位相感受性」に起因すると指摘している。

重要なメカニズムが検索の偏りを引き起こす

この技術は、長コンテキスト推論時のメモリ消費を削減するため、固定ストライドによって連続するトークンウィンドウをより少ないエントリに圧縮する。しかし、この圧縮メカニズムは、圧縮ウィンドウの境界に対するトークンの「位相」という全く新しい位置座標を導入することになった。

実験によれば、まったく同じ情報に対して、位相が異なるだけで検索の難易度が劇的に変化する。一部の大型オープンソースモデルでは、この位相の違いによる長文テキスト検索の正解率の落ち込みは最大40ポイントに達する。

周期的な弱点、最適化が急務

この発見は、従来の平均ベンチマークテストの限界を明らかにした。一部のモデルでは、優秀に見える平均高得点の裏に、深刻な周期的な弱点が隠れている可能性がある。長文テキスト大規模モデルの応用が広がるにつれ、この研究成果は、今後のモデルアーキテクチャの最適化と長コンテキスト推論の安定性向上に重要な理論的根拠を提供するものである。


大規模言語モデルチャンク化KVキャッシュ圧縮位相感受性長文テキスト検索

本記事はAIbaseデイリーから

【AIデイリー】へようこそ!ここは毎日AIの世界を探索するためのガイドです。毎日AI分野のホットなコンテンツをお届けし、開発者に焦点を当て、技術トレンドの把握や革新的なAI製品・応用の理解をサポートします。

—— AIbase デイリー班による制作 © 著作権所有 AIbase基地 2024、出典を表示する -
原文の出典

AIbase

内容について

原文の公開と権利は出典元に帰属します。

機械翻訳 · 原文をご参照ください