AIbase수정일

DeepSeek 긴 텍스트 처리가 왜 갑자기 '먹통'이 됐을까? 바이트 Seed 팀이 밝힌 AI 성능 변동의 미스터리

바이트댄스 Seed 팀은 최신 논문에서 대형 언어 모델이 초장문 텍스트를 처리할 때 성능이 변동하는 주요 원인이 청크 KV 캐시 압축 기술의 '위상 민감성'에 있음을 밝혔다. 긴 컨텍스트 추론의 메모리 소비를 줄이기 위해 이 기술은 고정된 스트라이드로 연속 토큰 윈도우를 더 적은 엔트리로 압축하지만, 이 과정에서 압축 윈도우에 대한 토큰의 새로운 위치 좌표가 도입되어 검색 편차를 유발하고…

DeepSeek 긴 텍스트 처리가 왜 갑자기 '먹통'이 됐을까? 바이트 Seed 팀이 밝힌 AI 성능 변동의 미스터리

AIbase 베이스

게시일AI 뉴스 정보 · 1분 읽기 · Oct 9, 20262

바이트댄스 산하 Seed 팀은 최신 연구 논문에서 대형 언어 모델이 초장문 텍스트를 처리할 때 나타나는 성능 변동의 기술적 원인을 밝혔다. 연구진은 이 현상이 주로 청크 KV 캐시 압축 기술이 가져오는 '위상 민감성'에서 비롯된다고 지적했다.

핵심 메커니즘이 유발하는 검색 편차

이 기술은 긴 컨텍스트 추론 시 메모리 소비를 줄이기 위해 고정된 스트라이드로 연속 토큰 윈도우를 더 적은 엔트리로 압축한다. 그러나 이 압축 메커니즘은 압축 윈도우 경계에 대한 토큰의 '위상'이라는 전혀 새로운 위치 좌표를 도입한다.

실험 결과, 모델이 완전히 동일한 정보를 마주할 때 서로 다른 위상에 놓이면 검색 난이도가 격렬하게 달라지는 것으로 나타났다. 일부 대형 오픈소스 모델에서는 이러한 위상 차이로 인한 긴 텍스트 검색 정확도 격차가 최대 40 퍼센트포인트에 달했다.

주기적 약점, 최적화 시급

이번 발견은 기존 평균 벤치마크 테스트의 한계를 드러냈다. 일부 모델의 겉으로 보기에 뛰어난 평균 고득점 뒤에는 심각한 주기적 약점이 숨어 있을 수 있다. 긴 텍스트 대형 모델의 응용이 날로 확대되는 가운데, 이번 연구 성과는 향후 모델 아키텍처 최적화와 긴 컨텍스트 추론 안정성 향상에 중요한 이론적 근거를 제공한다.


대형 언어 모델청크 KV 캐시 압축위상 민감성긴 텍스트 검색

본문은 AIbase 데일리에서 제공

【AI 데일리】 코너에 오신 것을 환영합니다! 여기는 매일 AI 세계를 탐험하는 안내서입니다. 매일 AI 분야의 핫한 콘텐츠를 여러분께 소개하며, 개발자에 초점을 맞춰 기술 트렌드를 파악하고 혁신적인 AI 제품 활용을 이해하도록 돕습니다.

—— AIbase 데일리 팀 제작© Copyright AIbase 베이스 2024, 출처 보기 -
원문 출처

AIbase

내용 안내

원문 발행 및 권리는 출처에 있습니다.

기계 번역 · 원문을 참고하세요