DeepSeek 긴 텍스트 처리가 왜 갑자기 '먹통'이 됐을까? 바이트 Seed 팀이 밝힌 AI 성능 변동의 미스터리
AIbase 베이스
게시일AI 뉴스 정보 · 1분 읽기 · Oct 9, 20262바이트댄스 산하 Seed 팀은 최신 연구 논문에서 대형 언어 모델이 초장문 텍스트를 처리할 때 나타나는 성능 변동의 기술적 원인을 밝혔다. 연구진은 이 현상이 주로 청크 KV 캐시 압축 기술이 가져오는 '위상 민감성'에서 비롯된다고 지적했다.
핵심 메커니즘이 유발하는 검색 편차
이 기술은 긴 컨텍스트 추론 시 메모리 소비를 줄이기 위해 고정된 스트라이드로 연속 토큰 윈도우를 더 적은 엔트리로 압축한다. 그러나 이 압축 메커니즘은 압축 윈도우 경계에 대한 토큰의 '위상'이라는 전혀 새로운 위치 좌표를 도입한다.
실험 결과, 모델이 완전히 동일한 정보를 마주할 때 서로 다른 위상에 놓이면 검색 난이도가 격렬하게 달라지는 것으로 나타났다. 일부 대형 오픈소스 모델에서는 이러한 위상 차이로 인한 긴 텍스트 검색 정확도 격차가 최대 40 퍼센트포인트에 달했다.
주기적 약점, 최적화 시급
이번 발견은 기존 평균 벤치마크 테스트의 한계를 드러냈다. 일부 모델의 겉으로 보기에 뛰어난 평균 고득점 뒤에는 심각한 주기적 약점이 숨어 있을 수 있다. 긴 텍스트 대형 모델의 응용이 날로 확대되는 가운데, 이번 연구 성과는 향후 모델 아키텍처 최적화와 긴 컨텍스트 추론 안정성 향상에 중요한 이론적 근거를 제공한다.
본문은 AIbase 데일리에서 제공
【AI 데일리】 코너에 오신 것을 환영합니다! 여기는 매일 AI 세계를 탐험하는 안내서입니다. 매일 AI 분야의 핫한 콘텐츠를 여러분께 소개하며, 개발자에 초점을 맞춰 기술 트렌드를 파악하고 혁신적인 AI 제품 활용을 이해하도록 돕습니다.
—— AIbase 데일리 팀 제작© Copyright AIbase 베이스 2024, 출처 보기 -