AIbase更新于 原文 · 中文

DeepSeek 长文本为何突然“抽风”?字节 Seed 团队揭开 AI 性能波动谜团

字节跳动Seed团队论文指出,大模型处理超长文本时的性能波动源于分块KV缓存压缩引入的“相位”坐标:同一信息处于不同相位时检索难度剧烈变化,部分开源模型检索准确率落差最高达40个百分点。该发现揭示了平均基准测试的局限,为长上下文架构优化提供理论依据,但结论基于其实验设置。

DeepSeek 长文本为何突然“抽风”?字节 Seed 团队揭开 AI 性能波动谜团

AIbase基地

发布于AI新闻资讯 · 1 分钟阅读 · Oct 9, 20262

字节跳动旗下 Seed 团队在最新的研究论文中,揭示了大语言模型在处理超长文本时出现性能波动的技术原因。研究团队指出,这一现象主要源于分块 KV 缓存压缩技术所带来的“相位敏感性”。

关键机制引发检索偏差

该技术为了降低长上下文推理时的内存消耗,会通过固定步幅将连续标记窗口压缩为更少的条目。然而,这种压缩机制引入了一个全新的位置坐标,即 Token 相对于压缩窗口边界的“相位”。

实验表明,模型在面对完全相同的信息时,处于不同相位会导致检索难度发生剧烈变化。在部分大型开源模型中,这种相位差异造成的长文本检索准确率落差最高可达 40 个百分点。

周期性弱点亟待优化

这一发现揭示了传统平均基准测试的局限性,部分模型看似出色的平均高分下,可能隐藏着严重的周期性弱点。随着长文本大模型应用日益广泛,这一研究成果为未来的模型架构优化和长上下文推理稳定性提升提供了重要的理论依据。


大语言模型分块KV缓存压缩相位敏感性长文本检索

本文来自AIbase日报

欢迎来到【AI日报】栏目!这里是你每天探索人工智能世界的指南,每天我们为你呈现AI领域的热点内容,聚焦开发者,助你洞悉技术趋势、了解创新AI产品应用。

—— 由AIbase 日报组创作© 版权所有 AIbase基地 2024, 点击查看来源出处 -
原始出处

AIbase

内容说明

原始发布及相关权利归来源方。