雷峰网 AI

字节跳动、DeepSeekの隠れたバグを発見、空白を加えるだけでモデルが崩壊

DeepSeekの節約の切り札が、なぜ致命的な盲点になったのか? 著者丨高允毅 編集丨岑峰 同じ質問をDeepSeekに2回投げただけで、いくつかスペースを入力しただけで、返ってくる答えが一方は「天才」のようであり、もう一方は「知的障害者」のようになった。 9月末、ByteDance(字节跳动)チームの最新論文 《Periodic Weak Spots: Phase Sensitivity from Chunked KV-Cache…

DeepSeekの節約の切り札は、なぜ致命的な盲点となったのか?

    著者丨高允毅

編集丨岑 峰

                                                                                                       

同じ質問をDeepSeekに2回投げただけで、いくつかスペースを入力しただけで、返ってくる答えが一方は「天才」のようであり、もう一方は「知的障害者」のようになった。9月末、ByteDance(字节跳动)チームの最新論文《周期的な弱点:チャンク分割型KV-Cache圧縮による位相感受性》は、DeepSeek V4シリーズモデルの「神と鬼の二象性」問題を直接名指しした。図注:論文リンク https://arxiv.org/pdf/2609.36322 これは本質的に、低層アルゴリズムの手抜きによって引き起こされる「周期性の記憶喪失」であり、分块KV Cache圧縮技術は長いコンテキストをブロックに分割して圧縮処理するが、これによりある問題が生じる:「位置が運命を決める」ことだ。もし重要な単語が不運にもブロック境界の「情報の盲区」に落ちてしまうと、モデルはデタラメな回答しかできなくなる。想像してみてほしい。大規模モデルに数十ページの契約書をレビューさせたとき、重要な条項がちょうど「情報の盲区」に挟まってしまうと、モデルはその情報を完全に無視し、反対の結論を出してしまう。しかもこの誤りは、うっかり空白文字を加えてしまったことで起こりうるのに、どこに問題があるのか全く分からないのだ。そしてこの「神と鬼の二象性」という生まれつきの弱点は、決してDeepSeekだけのものではない。「長文テキストのコストを下げろ」と叫ばれるこの時代において、この種のチャンク圧縮やスパース化技術を採用しているモデルは、程度の差こそあれ似たような問題を抱えている。例えばオープンソースのLlama 3シリーズだ。

01


ByteDance論文がDeepSeekの弱点を突く

ByteDanceの最初の発見は、DeepSeek-V4-Flash-Baseにコードの補完をさせたことから生まれた。タスクは、FP8量子化関数の最後のトークンを補完することだった。コードのロジックに従えば、正しい結果は8のはずだったが、研究員がコードの先頭に純粋に装飾用のイコール記号を一列加えたところ、モデルは32と出力した。さらに奇妙なのは、この誤りがランダムではなく、イコール記号の数と直接結びついていたことだ:イコール記号の数を4で割り、余りが0または1の場合、モデルは高確率で間違え、誤答率は71.3%に達した。余りが2または3の場合、モデルは正解でき、正答率は91.5%に達した。ByteDanceチームは糸をたどるように調査を進め、これが大規模モデルが分块KV Cache圧縮技術を採用した後に残された、生まれつきの弱点であることを突き止めた。分块KV Cache圧縮技術は、長いコンテキストのVRAM圧力問題を解決するためのDeepSeekの切り札であり、連続するトークンを固定長で切り分け、各区間内のトークンは学習可能なゲート層を通じて「小さな要約」に圧縮できる。これにより、長いコンテキストのVRAM圧力は一気に軽減された。これでVRAMの問題は解決したが、新たな問題が持ち込まれた。標準的なTransformerの注意機構はトークン間の相対距離のみに依存し、絶対位置は気にしない。一文がどこに置かれても、語順が変わらなければ意味は変わらない。しかしDeepSeekが分块KV Cache圧縮を採用した後は、各トークンが圧縮区間内で占める位置が重要になった。この位置は「位相」と呼ばれる。ゲート層は異なる位置のトークンに異なる重みを割り当てるが、この重みはスロット利得因子と呼ばれる。強いスロットに並んだトークンは重み付けされて保持され、モデルは正確に答えられる;盲点スロットに並んだトークンはほぼ無視され、モデルは誤答する。この並び順に敏感な現象は、位相感度と呼ばれる。さらにモデル内部を解析したところ、研究員は注意ヘッドが自然な分業を形成していることを発見した。区間内の前方の位置を専門に処理するものもあれば、後方の位置を専門に処理するものもある。この位相の専門化により、特定の並び順が弱点となった。これが偶然でないことを検証するため、ByteDanceチームはさらに「大海で針を探す(ニードル・イン・ア・ヘイスタック)」テストを行った。研究員は128Kトークンにも及ぶコンテキストを構築し、その中に約1.6万個のキー・バリューペアを含め、各キーには対応するバリューがある。キー・バリューの関係を変えず、質問も変えず、コンテキストの総長も同じまま、あるキー・バリューペアを異なる位置に置いた場合、モデルは対応するバリューを正しく答えられるだろうか? その結果、DeepSeek-V4-Flash-Baseは位置間の正答率の最大差が40.2%に達した。DeepSeek-V4-Pro-Baseに替えると、差は34.8%に達し、ポストトレーニングによる最適化を行っても問題は残り、差は19.1%と14.8%だった。このような周期性の盲区問題に対し、DeepSeekはDeepSeek-V4.1-Flashで圧縮ステップ幅を半分に削減することを試みた。圧縮ステップ幅が4に設定されると、各圧縮ラウンドで4つのスロットが区切られる。異なるスロットに割り当てられる情報の重みには大きな差があり、端の位置にあるトークンは、連続する2回のウィンドウ圧縮で容易に失われてしまう。ステップ幅を2に下げると、圧縮はより細かくなり、毎回2つのトークンのみをマージする。1つの圧縮周期内で、トークンが占める相対位置は2種類しかない。こうすれば、仮に重要な情報が弱い奇数位置に落ちても、隣接位置との差はトークン1個しかないため、コンテキストが完全に失われることは起きにくい。DeepSeek-V4.1-Flashは確かに正答率の差をさらに6.1%まで引き下げたが、この問題は完全には解消されなかった。そこでByteDanceチームは、Qwen3-0.6Bアーキテクチャを使ってゼロから一連のモデルを訓練し、他のすべての設定は完全に同じまま、圧縮機構だけを変更した。その結果、次のことが分かった:
  • 分块圧縮を採用したすべてのモデルで、周期性の正答率変動が現れた;圧縮なしのフルアテンション基線モデルには、この現象が見られなかった;
  • 変動の周期は厳密に圧縮ステップ幅と等しかった;
  • RoPE位置エンコーディングを取り除いても変動は残り、位置エンコーディングに起因する偏りではなかった;
  • 学習可能なゲート重みを最も単純な平均配分に替えても、やはり周期的な変動が起こり、パラメータの調整不足ではなかった。
図注:圧縮ステップ幅をそれぞれ4、6、8、12に設定すると、正答率変動の周期も4、6、8、12となる。このことから、固定長で分块圧縮を行う限り、この問題は避けられないことが分かる。これはスキーム自体の構造的欠陥であり、パラメータ調整、位置エンコーディングの変更、ポストトレーニングで根絶できるものではない。ネット上のユーザーは、この問題を彻底的に解決するには、チャンク分割そのものを「生き」させ、内容の重要度に応じて境界を動的に決定させる必要があると指摘している。トークンが固定の位相を持たなければ、位相差も語りようがなくなる。これはAI分野で実際に関連研究があり、「動的チャンキング」。

02


「動的チャンキング」技術は特効薬となるのか?

動的チャンキングの核心は、固定トークン数による一律分割の方式を捨て、意味と重要度に応じて柔軟に調整することだ。この技術的アプローチは、アルゴリズムの数学からメモリ管理、さらには基盤ハードウェアに至る完全な技術スタックに対し、トップダウンでの再構築を行うものだ。

▎第一層:アテンションの数学的基礎の再構築

動的チャンキングは具体的にどう分割するのか?核心は「サイズが内容に従う」ことだ。情報密度の低い無駄話は、そのまま大きな塊として統合し、重要な転換点や高密度な情報に出会ったら、十分細かく分割して精密に計算する。こうすることで、重要な情報がどの位置に隠れていても、モデルは敏感に捉えられ、これは数学的に、固定チャンキングによって破壊された並進不変性を再構築するものである。さらに進んで、これはモデルに一種の「予判能力」を与える:まず情報密度を一瞥し、それからどれだけの大きさに切るかを決める。推論プロセスはもはや単一のリズムで読み進めるのではなく、速く読むべき場所は速く、じっくり味わうべき場所は遅くと、アーキテクチャの底層に「速い思考と遅い思考」の本能が育つのだ。

▎第二層:メモリ管理の進化を促す

以前は行列計算を速くするため、KV Cacheは固定サイズのブロックで管理されていた。この方法の利点はシンプルで整然として扱いやすいことだが、メモリ利用率が上がらず、計算資源が無駄になりがちだった。動的チャンキング以降、従来の底層の「静的な連続行列」では持ちこたえられず、必然的に「トポロジカル疎行列」へと進化し、動的インデックスの層によってアドレッシングを行うことになる。さらに興味深いことに、研究によれば、異なるTransformer層間の動的チャンク境界は高度に類似しており、直接再利用できるという。これにより動的アドレッシングのオーバーヘッドを大幅に薄められる。最終的に、上位層は賢く切り、下位層はより省スペースに保存し、中間のアドレッシングも遅くない、というわけだ。

▎第三層:ハードウェアアライメントの難問を解く

これは三層の中で最も突破が難しい層でもある。GPUはもともと、辺の長さが8、16、32で割り切れるような規則的な行列演算を好む。これこそが、業界全体が長年固定チャンキングを堅持してきた最も現実的なハードウェア上の理由である。チャンクサイズがまちまちだと、行列計算のために作られたアクセラレーションユニット(Tensor Coreなど)が大量に遊休状態となる。この問題に対し、業界ではすでに実行可能な解法が模索されている。たとえばゼロ埋め(ゼロパディング)アルゴリズムは、物理メモリのレベルで長短不同的な動的意味ブロックを隙間なく詰めて空間を無駄にしないと同時に、論理的には各意味ブロックの境界を保持できる。現在、世界のトップAIラボは「意味的連続性」と「疎計算」の二方向から動的チャンキング技術を推進しており、この技術はすでに新世代の長文テキスト大規模モデルの高速化・高品質化における核心的な突破口となっている。その中で最も代表的な成果は、香港科技大学(広州)のチームが提案したChunkKVであり、「意味的連続性」の道を進むものだ。従来、H2O、SnapKV、PyramidKVをはじめとする主流のKV圧縮手法の核心は、個々のトークンにスコアを付け、重要なものを保持し、重要でないものを捨てるというものだった。このようなフィルタリングは、完全な主語・述語・目的語の一文を粉々に分割してしまうことが容易に起きる。ChunkKVの核心は、連続的な意味ブロックを基本の圧縮単位とし、ブロック全体を保持するか、ブロック全体を捨てるかのいずれかにすることだ。残されるのは完全なフレーズと文である。長文テキスト検索能力を最も試すNIAH(大海撈針:針の山を干す)ベンチマークテストでは、KVキャッシュサイズを128に制限した場合、LLaMA-3ベースのChunkKVの正解率は73.8%に達したのに対し、従来手法のSnapKVはわずか58.9%だった。この技術は、大規模モデルが長文テキストシナリオで「読めない、探せない」という短板を直接埋め、モデルの実用性を大幅に向上させた。
ChunkKVのほか、Jina AIの肖涵博士チームは検索シナリオの最適化に注力し、遅延チャンキング方式を提案した。これは従来のインテリジェント検索における「先にテキストを分割し、それから内容を解析する」という致命的な問題を解決するもので、まずモデルに全文を完全に読ませ、全体の内容と文脈の論理を把握させ、最後に結果を出力する直前に、意味の自然な境界に沿ってテキストを分割することで、完全な情報を最大限保持する。「疎計算」の面では、マイクロソフトアジア研究院研究開発された MInference フレームワークは、百万字級の超長文テキスト推論シーンに特化して設計されています。チームの研究により、大規模モデルが長文テキストを読み取る際、すべての箇所で精緻な計算が必要なわけではなく、注意行列には利用可能な固定のスパース性のパターンが存在することが明らかになりました。この特徴をもとに、このフレームワークは異なる注意ヘッドごとに最適なスパース計算方式をマッチングします。検索精度をまったく低下させることなく、百万字の長いコンテキストにおける prefill(プリフィル)段階で最大 10 倍の高速化を実現しました。長いコンテキストの前半戦では、「誰がより長いテキストを処理できるか」を競う中で、KV 圧縮技術が大きな役割を果たしました。しかし、長いコンテキストの本質は、長さのための長さでは決してありません。ユーザーが長いコンテキストを実際のタスク処理に真に使い始めたとき、使える、使いやすい、情報を失わないということが新たな KPI となりました。参考リンク:https://arxiv.org/pdf/2609.36322https://www.zhihu.com/question/2091513666864682278

乗車してください。雷峰網(公式アカウント:雷峰網)が世界中のAIトップ会議の精華をご案内します

独占的にご覧いただけます:

専門家の講演PPT

大会報告全文

人気論文の解説

学術新星インタビュー

上のQRコードをスキャン

または「阅读原文」をクリックして専用ページをフォローしてください。

雷峰網のオリジナル記事です。許可なく転載することを禁じます。詳細は転載に関する注意事項。

原文の出典

雷峰网 AI

内容について

原文の公開と権利は出典元に帰属します。

機械翻訳 · 原文をご参照ください