저자丨가오윈이
편집丨천 펑
같은 질문을 DeepSeek에 두 번 했을 뿐, 공백 몇 개만 더 쳤을 뿐인데 나온 답이 하나는 “천재”처럼, 하나는 “멍청이”처럼 보였다. 9월 말, 바이트 팀의 최신 논문《Periodic Weak Spots: Chunked KV-Cache Compression에서의 위상 민감도》은 DeepSeek V4 시리즈 모델의“신귀 이상성(神鬼二象性)” 문제를 직접 지목했다. 그림 설명: 논문 링크 https://arxiv.org/pdf/2609.36322 이는 본질적으로 저수준 알고리즘의 게으름으로 인한 “주기적 기억상실”이다.분할 KV Cache 압축 기술은 긴 컨텍스트를 블록으로 나누어 압축 처리하는데, 여기서 문제가 하나 생긴다:“위치가 운명을 결정한다”. 핵심 단어가 불운하게도 블록 경계의 “정보 사각지대”에 놓이면 모델은 엉터리 소리만 할 수밖에 없다. 상상해 보라, 대형 모델이 수십 페이지짜리 계약서를 검토하는데 핵심 조항이 마침 “정보 사각지대”에 걸리면, 모델은 그 정보를 무시하고 정반대의 결론을 내놓는다. 그리고 이 오류는 당신이 무심코 공백 문자를 조금 추가했기 때문일 수 있는데, 모델은 그대로 사고를 내고 당신은 문제가 어디에 있는지조차 모른다. 이런 “신귀 이상성”의 타고난 약점은 결코 DeepSeek만의 것이 아니다. “긴 텍스트 비용을 낮추자”고 외치는 이 시대에, 이런 블록 압축이나 희소화 기술을 채택한 모델이라면 누구나 어느 정도 비슷한 문제가 있다. 예컨대 오픈소스인 Llama 3 시리즈가 그렇다.
01
바이트 논문이 붙잡은 DeepSeek의 약점
바이트의 최초 발견은 DeepSeek-V4-Flash-Base로 코드 한 구획을 완성시키는 데서 비롯됐다. 과제는 FP8 양자화 함수의 마지막 Token을 완성하는 것이었다. 코드 논리대로라면 정답은 8이어야 하는데, 연구자가 코드 맨 앞에 순수 장식용 등호 문자열을 추가하자 모델은 32를 출력했다. 더 이상한 것은 이런 오류가 무작위가 아니라 등호의 개수와 직접 연동된다는 점이다:등호 개수를 4로 나누었을 때 나머지가 0 또는 1이면 모델은 높은 확률로 틀리고, 오류율은 무려 71.3%에 달한다. 나머지가 2 또는 3이면 모델은 다시 정답을 맞히고, 정확도는 91.5%에 달한다.바이트 팀은 실마리를 좇아, 이것이 대형 모델이분할 KV Cache 압축 기술을 채택한 후남겨진 타고난 약점임을 발견했다. 분할 KV Cache 압축 기술은 DeepSeek이 긴 컨텍스트의 VRAM 부담 문제를 해결하기 위한 비장의 수로, 연속된 Token을 고정 길이로 잘라내고, 각 구간의 Token은 학습 가능한 게이팅 레이어를 통해 “작은 요약”으로 압축되어 긴 컨텍스트의 VRAM 부담이 한꺼번에 덜어진다. 이것으로 VRAM 문제는 해결됐지만 새로운 문제가 도입되었다. 표준 Transformer의 어텐션은 Token 간의 상대 거리에만 의존하고 절대 위치는 신경 쓰지 않는다. 문장이 어디에 놓이든 단어 순서만 변하지 않으면 의미도 변하지 않는다.그러나 DeepSeek이 분할 KV Cache 압축을 채택한 후에는 각 Token이 압축 구간 내에서 차지하는 위치가 중요해졌는데, 이 위치를 “위상”이라 부른다. 게이팅 레이어는 서로 다른 위치의 Token에 서로 다른 가중치를 부여하며, 이 가중치를 슬롯 이득 인자라 한다.강세 슬롯에 배정된 Token은 가중치가 부여되어 보존되어 모델이 정확히 답할 수 있고, 사각지대 슬롯에 배정된 Token은 거의 무시되어 모델이 오답을 내놓는다.이런 순위에 민감한 현상을 위상 민감성(phase sensitivity)이라 부른다.모델 내부를 더 깊이 분석한 연구자들은 어텐션 헤드가 자연스러운 분업을 형성한다는 것도 발견했다. 어떤 것들은 구간 내 앞쪽 위치를 전담 처리하고, 어떤 것들은 뒤쪽 위치를 전담 처리한다. 이런 위상 전문화 때문에 특정 순위가 취약 지점이 되었다.이것이 우연이 아님을 검증하기 위해 바이트 팀은 “바늘 건지기(needle in a haystack)” 테스트를 다시 수행했다. 연구자들은 약 128K Token 길이의 컨텍스트를 구성했으며, 그 안에 약 1.6만 개의 키-값 쌍이 포함되어 있고, 각 Key는 하나의 Value에 대응한다. 키-값 관계를 바꾸지 않고, 질문도 바꾸지 않고, 컨텍스트 총 길이도 동일하게 유지한 상태에서, 어떤 키-값 쌍을 다른 위치에 놓으면 모델이 여전히 대응하는 Value를 정확히 답할 수 있을까? 결과에 따르면, DeepSeek-V4-Flash-Base의 위치 간 정확도 최대 격차는 40.2 %에 달했다. DeepSeek-V4-Pro-Base로 바꾸자 격차는 34.8 %에 달했고, 포스트 트레이닝 최적화를 거쳐도 문제는 여전히 존재했으며 격차는 19.1%와 14.8%였다. 이런 주기적 사각지대 문제에 직면해 DeepSeek은 DeepSeek-V4.1-Flash로 압축 스텝 길이를 절반으로 줄였다. 압축 스텝이 4일 때 각 압축 라운드는 4개의 슬롯을 나눈다. 서로 다른 슬롯에 배정되는 정보 가중치의 격차가 매우 커서, 가장자리 위치에 놓인 Token은 연속 두 라운드의 윈도우 압축에서 쉽게 버려진다. 스텝을 2로 낮추면 압축이 더 정밀해져 한 번에 2개의 Token만 병합한다. 하나의 압축 주기 내에서 Token은 두 가지 상대 위치만 갖는다. 이렇게 하면 핵심 정보가 상대적으로 약한 홀수 위치에 놓이더라도 인접 위치와 1개의 Token만 차이 나기 때문에 컨텍스트가 완전히 잃기 어렵다. DeepSeek-V4.1-Flash는 확실히 정확도 격차를 6.1 %까지 더 낮췄지만, 이 문제는 완전히 해소되지 않았다. 이에 바이트 팀은 Qwen3-0.6B 아키텍처로 모델 일괄을 처음부터 학습시켰으며, 다른 모든 설정은 완전히 동일하고 압축 메커니즘만 바꿨다. 결과는 다음과 같다:- 분할 압축을 채택한 모든 모델에서 주기적 정확도 변동이 나타났다. 압축이 없는 전체 어텐션 베이스라인 모델에는 이런 현상이 없었다;
- 변동 주기는 엄격하게 압축 스텝 길이와 같았다;
- RoPE 위치 인코딩을 제거해도 변동은 여전히 존재했으며, 위치 인코딩에서 오는 편차가 아니었다;
- 학습 가능한 게이팅 가중치를 가장 단순한 균등 분배로 바꾸어도 여전히 주기적 변동이 있었으므로, 파라미터 튜닝 문제가 아니었다.
02
'동적 청킹' 기술이 해독제인가?
동적 청킹의 핵심은 고정된 토큰 수로 일괄 처리하는 방식을 버리고, 의미와 중요도에 따라 유연하게 조정하는 것입니다.이 기술적 사고방식은 알고리즘 수학부터 메모리 관리, 하드웨어에 이르는 전체 기술 스택에 대해 상향식이 아닌 하향식 재구조화를 수행했습니다.▎첫 번째 층: 어텐션 수학 기반의 재구축
동적 청킹은 대체 어떻게 잘라야 할까요? 핵심은 '크기가 내용을 따라가는 것'입니다. 정보 밀도가 낮은 군더더기는 큰 덩어리로 바로 병합하고, 핵심 전환점과 고밀도 정보를 만나면 충분히 잘게 나누어 정밀하게 계산합니다. 이렇게 하면 핵심 정보가 어느 위치에 숨어 있든 모델이 민감하게 포착할 수 있으며, 이는 수학적으로 고정 청킹으로 인해 깨진 평행 이동 불변성을 재구축한 것입니다. 나아가 이는 모델에 일종의 '예측 능력'을 부여합니다: 먼저 정보 밀도를 훑어본 뒤 얼마나 크게 자를지 결정하는 것입니다. 추론 과정이 더 이상 하나의 리듬으로 끝까지 읽는 것이 아니라, 빠르게 읽을 곳은 빠르게, 정독해야 할 곳은 느리게 처리하여, 아키텍처 하위 계층에서 '빠른-느린 사고'의 본능이 자라난 것입니다.▎두 번째 층: 메모리 관리의 진화를 촉진
이전에는 행렬 연산을 빠르게 하기 위해 KV 캐시를 고정 크기 블록 단위로 관리했습니다. 이 방식의 장점은 단순하고, 규칙적이며, 다루기 쉽다는 것이지만, 메모리 활용률이 올라가지 않고 연산 능력이 쉽게 낭비되었습니다. 동적 청킹 이후에는 하위 계층의 전통적인 '정적 연속 행렬'로는 감당할 수 없게 되어, 필연적으로 '토폴로지 희소 행렬'로 진화하여 동적 인덱스 한 층을 통해 주소 지정을 수행해야 합니다. 더 흥미로운 점은, 서로 다른 트랜스포머 층 간의 동적 청킹 경계가 매우 유사하여 그대로 재사용할 수 있다는 것이 연구를 통해 밝혀졌습니다. 이로써 동적 주소 지정의 오버헤드가 크게 분산되었습니다. 결과적으로 상위 계층은 영리하게 자르고, 하위 계층은 더 절약하여 저장하며, 중간의 주소 지정도 느리지 않습니다.▎세 번째 층: 하드웨어 정렬 문제 해결
이것은 세 층 중 가장 돌파하기 어려운 층입니다. GPU는 본질적으로 규칙적이고 변의 길이가 8, 16, 32로 나누어 떨어지는 행렬 연산을 선호하며, 이것이 업계 전체가 이전까지 오랫동안 고정 청킹을 고수했던 가장 현실적인 하드웨어적 이유입니다. 청크 크기가 들쭉날쭉하면 행렬 계산을 위해 특별히 설계된 가속 유닛(예: Tensor Core)이 대량으로 유휴 상태에 빠집니다. 이 문제에 대해 업계는 이미 실행 가능한 해법을 모색해 왔습니다. 예를 들어, 제로 패딩 알고리즘은 물리적 메모리 계층에서 길이가 제각각인 동적 의미 블록을 빈틈없이 붙여 공간을 낭비하지 않게 하는 동시에, 논리적으로는 각 의미 블록의 경계를 유지할 수 있습니다. 현재,글로벌 최상위 AI 연구실들이 '의미 연속성'과 '희소 계산' 두 방향에서 동적 청킹 기술을 추진하고 있으며이 기술은 이미 신세대 장문 대규모 모델의 속도 향상과 품질 향상의 핵심 돌파구가 되었습니다.그중 가장 대표적인 성과는 홍콩과기대학(광저우) 팀이 제안한 ChunkKV로, '의미 연속성'의 길을 걷습니다. 과거 주류 KV 압축 방법은 H2O, SnapKV, PyramidKV를 막론하고 핵심 아이디어가 개별 토큰에 점수를 매겨 중요한 것은 남기고 중요하지 않은 것은 버리는 것이었습니다. 이러한 필터링은 완전한 주어-서술어-목적어 문장을 조각내기 쉬웠습니다. ChunkKV의 핵심 아이디어는 연속적인 의미 블록을 기본 압축 단위로 삼아, 블록 전체를 남기거나 블록 전체를 버리는 것입니다. 남겨지는 것은 모두 완전한 구와 문장입니다. 장문 검색 능력을 가장 엄격하게 시험하는 NIAH(바늘 건더기 찾기) 벤치마크에서 KV 캐시 크기가 128로 제한되었을 때, LLaMA-3 기반 ChunkKV의 정확도는 73.8%에 달한 반면, 전통적인 방식인 SnapKV는 58.9%에 그쳤습니다. 이 기술은 대규모 모델이 장문 시나리오에서 '읽어도 이해 못 하고, 찾아도 못 찾는' 약점을 직접적으로 메워 모델의 실용성을 크게 향상시켰습니다.ChunkKV 외에도 Jina AI의 샤한(Xiao Han) 박사 팀은 검색 시나리오 최적화에 주목하여 제안한 지연 청킹(late chunking) 방식으로, 전통적인 지능형 검색의 '먼저 텍스트를 자르고 그다음 내용을 해석하는' 치명적 문제를 해결했습니다. 먼저 모델이 텍스트 전체를 끝까지 읽고 전체 내용과 문맥 논리를 완전히 파악한 뒤, 마지막으로 결과를 출력하기 직전에야 의미의 자연스러운 경계에 따라 텍스트를 나누어 완전한 정보를 최대한 보존합니다. '희소 계산' 분야에서는,마이크로소프트 아시아연구원이 개발한 MInference 프레임워크가 백만 자 급 초장문 추론 시나리오에 특화되어 있습니다. 팀의 연구에 따르면 대규모 모델이 장문을 읽을 때 모든 내용에 정밀한 계산이 필요한 것은 아니며, 어텐션 행렬에는 활용 가능한 고정된 희소 패턴이 존재합니다. 이 특성에 기반해 이 프레임워크는 서로 다른 어텐션 헤드에 가장 적합한 희소 계산 방식을 매칭합니다. 검색 정확도를 전혀 낮추지 않는 전제 하에, 백만 자 장문 컨텍스트의 prefill 사전 채움 단계에서 최대 10배의 가속을 달성했습니다. 장문 컨텍스트의 전반부에서는 '누가 더 긴 것을 처리할 수 있는가'를 겨루는 데 KV 압축 기술이 큰 공헌을 했습니다. 그러나 장문 컨텍스트의 본질은 애초에 길기 위한 길이가 아니었습니다. 사용자들이 장문 컨텍스트로 실제 과제를 진정으로 처리하기 시작하면서, 쓸 수 있고, 잘 쓸 수 있고, 정보를 잃지 않는 것이 새로운 KPI가 되었습니다. 참고 링크: https://arxiv.org/pdf/2609.36322https://www.zhihu.com/question/2091513666864682278
승차하세요, 레이펑왕(雷峰网, 공식 계정: 雷峰网)이 글로벌 AI 주요 학술대회의 핵심을 모두 보여드립니다
독점적으로 감상하실 수 있습니다:
전문가 강연 PPT
학술대회 보고서 전문
인기 논문 해설
학계 유망주 인터뷰
상단 QR코드를 스캔하거나
「阅读原文(원문 보기)」을 클릭하여 전용 코너를 팔로우하세요.
레이펑왕(雷峰网) 오리지널 기사이며, 무단 전재를 금지합니다. 자세한 내용은전재 안내를 참조하세요。