雷峰网 AI

Byte descubre un Bug oculto de DeepSeek: al añadir unos espacios, el modelo se estrella

El as bajo la manga de DeepSeek para ahorrar dinero, ¿por qué se convirtió en un punto ciego fatal? Autor丨Gao Yunyi Editor丨Cen Feng Si le haces la misma pregunta a DeepSeek dos veces, tan solo añadiendo unos cuantos…

El arma estrella de ahorro de DeepSeek, ¿por qué se convirtió en un punto ciego fatal?

    Autor丨Gao Yunyi

Editor丨Cen   Feng

                                                                                                       

Si le haces la misma pregunta a DeepSeek dos veces, tan solo añadiendo unos cuantos espacios, las respuestas resultan ser una como de «genio» y otra como de «deficiente». A finales del mes 9 (septiembre), el último artículo del equipo de Byte《Puntos débiles periódicos: sensibilidad de fase en la compresión del KV-Cache por bloques》 (Periodic Weak Spots: Phase Sensitivity from Chunked KV-Cache Compression)señala directamente a los modelos de la serie DeepSeek V4 por suproblema de «dualidad dios-demonio». Nota de figura: enlace del artículo https://arxiv.org/pdf/2609.36322 Esto es, en esencia, una «amnesia periódica» causada por la pereza del algoritmo subyacente:la tecnología de compresión por bloques del KV Cachecorta el contexto largo en bloques y los comprime, lo que plantea un problema:«la posición determina el destino». Si tus palabras clave caen, por desgracia, en la «zona ciega de información» de la frontera entre bloques, el modelo no puede más que delirar. Imagina que se le pide a un modelo grande revisar un contrato de decenas de páginas y que una cláusula clave cae justo en la «zona ciega de información»: el modelo ignora directamente esa información y da una conclusión opuesta. Y este error puede deberse a que accidentalmente añadiste unos caracteres de espacio en blanco; el modelo se estrella de plano, y ni siquiera sabes dónde está el problema. Además, esta deficiencia congénita de «dualidad dios-demonio» no es exclusiva de DeepSeek. En la actualidad, en esta era en la que se grita «reducir el costo de los textos largos», todos los modelos que empleen este tipo de tecnología de compresión por bloques o de dispersión tienen, en mayor o menor medida, problemas similares, como la serie de código abierto Llama 3.

01


El artículo de Byte atrapa a DeepSeek con las manos en la masa

El descubrimiento inicial de Byte surgió al pedir a DeepSeek-V4-Flash-Base que completara un fragmento de código. La tarea consistía en completar el último Token de una función de cuantización FP8. Según la lógica del código, el resultado correcto debería ser 8, pero como los investigadores añadieron al principio del código una serie de signos igual puramente decorativos, el modelo emitió 32. Lo más extraño es que este error no es aleatorio, sino que está directamente vinculado al número de signos igual:Al dividir el número de signos igual entre 4, si el resto es 0 o 1, el modelo casi seguro responde mal, con una tasa de error de hasta el 71.3 %; si el resto es 2 o 3, el modelo vuelve a responder bien, con una tasa de acierto de hasta el 91.5 %.El equipo de Byte siguió el rastro y descubrió que se trata de una deficiencia congénita dejada por el usode la tecnología de compresión por bloques del KV Cache. La tecnología de compresión por bloques del KV Cache es el arma estrella que DeepSeek emplea para resolver el problema de presión de memoria de los contextos largos: corta los Tokens consecutivos en segmentos de longitud fija, y los Tokens de cada segmento pueden comprimirse en «pequeños resúmenes» a través de una capa de compuerta aprendible, lo que aligera de golpe la presión de memoria del contexto largo. Esto resuelve el problema de memoria, pero introduce uno nuevo. La atención del Transformer estándar solo depende de la distancia relativa entre Tokens y no le importa la posición absoluta. Una frase, sin importar dónde se coloque, mientras el orden de las palabras no cambie, mantiene su significado.Pero tras adoptar DeepSeek la compresión por bloques del KV Cache, la posición de cada Token dentro del segmento comprimido se vuelve importante; esta posición se llama «fase». La capa de compuerta asigna pesos distintos a los Tokens según su posición, y este peso se llama factor de ganancia de ranura.Los Tokens asignados a ranuras fuertes se conservan ponderados y el modelo responde con precisión; los Tokens asignados a ranuras ciegas quedan casi ignorados y el modelo responde mal.Este fenómeno de sensibilidad a la posición se llama sensibilidad de fase.Al analizar más a fondo el interior del modelo, los investigadores también descubrieron que los cabezales de atención forman una división natural del trabajo: unos se especializan en procesar las posiciones del principio del segmento y otros las del final. Esta especialización de fase convierte ciertas posiciones en eslabones débiles.Para verificar que no se trataba de una coincidencia, el equipo de Byte realizó además una prueba de «aguja en un pajar». Los investigadores construyeron un contexto de 128K Tokens que contenía unos 1.6 万 (diez miles) pares de clave-valor, donde cada Key corresponde a un Value. Manteniendo sin cambios las relaciones clave-valor, la pregunta y la longitud total del contexto, si se colocaba uno de los pares clave-valor en una posición distinta, ¿podría el modelo seguir respondiendo correctamente con el Value correspondiente? Los resultados mostraron que DeepSeek-V4-Flash-Base presentaba una diferencia máxima de precisión entre posiciones de hasta 40.2 %. Con DeepSeek-V4-Pro-Base, la diferencia llegó a 34.8 %; incluso tras la optimización mediante post-entrenamiento, el problema persistía, con diferencias de 19.1 % y 14.8 %. Ante este problema de zonas ciegas periódicas, DeepSeek probó con DeepSeek-V4.1-Flash, reduciendo a la mitad el paso de compresión. Con un paso de compresión de 4, cada ronda de compresión divide en 4 ranuras. Las diferencias de peso de información asignadas a las distintas ranuras son grandes, y los Tokens en posiciones de borde se pierden con facilidad en dos rondas consecutivas de compresión de ventana. Al reducir el paso a 2, la compresión se vuelve más fina, fusionando solo 2 Tokens cada vez. Dentro de un ciclo de compresión, un Token tiene únicamente dos posiciones relativas. Así, aunque la información clave caiga en una posición impar más débil, como la posición adyacente difiere solo en 1 Token, es difícil que el contexto se pierda por completo. DeepSeek-V4.1-Flash efectivamente redujo aún más la diferencia de precisión hasta 6.1 %, pero el problema no se eliminó por completo. Entonces, el equipo de Byte entrenó desde cero un lote de modelos con la arquitectura Qwen3-0.6B, con todas las demás configuraciones completamente idénticas, cambiando únicamente el mecanismo de compresión. Los resultados mostraron:
  • Todos los modelos con compresión por bloques mostraron fluctuaciones periódicas de precisión; el modelo base de atención total sin compresión no presentó este fenómeno;
  • el período de fluctuación es exactamente igual al paso de compresión;
  • al eliminar la codificación posicional RoPE, la fluctuación persiste, por lo que no es un sesgo de la codificación posicional;
  • al sustituir los pesos aprendibles de la compuerta por la simple asignación equitativa, la fluctuación periódica continúa, por lo que no es un problema de ajuste de parámetros.
Nota de figura: al fijar el paso de compresión en 4, 6, 8 y 12, el período de la fluctuación de precisión es también 4, 6, 8 y 12. Se ve quemientras se realice compresión por bloques de longitud fija, este problema es inevitable.Este es un defecto estructural del propio esquema, algo que no se puede erradicar ajustando hiperparámetros, cambiando la codificación posicional o con postentrenamiento. Algunos internautas señalan que, para resolver este problema de raíz, habría que hacer que la segmentación misma "viva", decidiendo dinámicamente los límites según la importancia del contenido. Cuando los Token no tienen una fase fija, tampoco se puede hablar de diferencia de fase. En el campo de la IA efectivamente existe investigación al respecto, llamada"segmentación dinámica"。

02


¿Es la "segmentación dinámica" el antídoto?

El núcleo de la segmentación dinámica es abandonar el modo de cortar todo por igual según una cantidad fija de Token, ajustando con flexibilidad según la semántica y la importancia.Esta idea técnica realiza una reestructuración de arriba abajo de toda la pila tecnológica: desde las matemáticas del algoritmo, pasando por la gestión de la memoria de vídeo, hasta el hardware de nivel más bajo.

▎Primera capa: reestructurar la base matemática de la atención

¿Cómo se debe cortar exactamente en la segmentación dinámica? La clave es que "el tamaño siga al contenido". Las palabras superfluas de baja densidad informativa se fusionan directamente en bloques grandes; ante giros clave e información de alta densidad, se divide con suficiente finura para un cálculo preciso. Así, sin importar dónde se oculte la información clave, el modelo puede captarla con agudeza, lo que matemáticamente reconstituye la invariancia por traslación que la segmentación fija había roto. Más aún, esto dota al modelo de una capacidad de "anticipación": primero ojea la densidad de la información y luego decide cuán grande cortar. El proceso de inferencia ya no lee todo a un mismo ritmo, sino que va rápido donde debe leerse deprisa y lento donde debe saborearse, haciendo nacer en lo profundo de la arquitectura un instinto de "pensamiento rápido y lento".

▎Segunda capa: impulsar la evolución de la gestión de la memoria de vídeo

Antes, para que las matrices se calcularan rápido, el KV Cache se gestionaba en bloques de tamaño fijo. La ventaja de este método es que es simple, ordenado y fácil de operar, pero la utilización de la memoria de vídeo no mejora y la potencia de cómputo se desperdicia con facilidad. Tras la segmentación dinámica, las tradicionales "matrices estáticas continuas" de la capa inferior ya no dan abasto y necesariamente deben evolucionar hacia "matrices topológicamente dispersas", apoyándose en una capa de índices dinámicos para completar el direccionamiento. Aún mejor, la investigación descubrió que los límites de la segmentación dinámica entre las distintas capas del Transformer son muy similares y pueden reutilizarse directamente. Esto diluye enormemente el costo del direccionamiento dinámico. Al final, la capa superior corta con inteligencia, la inferior almacena con mayor ahorro, y el direccionamiento intermedio no se ralentiza.

▎Tercera capa: resolver el problema de la alineación del hardware

Esta es la capa más difícil de las tres. Las GPU prefieren naturalmente operaciones matriciales regulares, cuyas dimensiones sean divisibles entre 8, 16 y 32; esta es la razón de hardware más realista por la que toda la industria se había aferrado durante tanto tiempo a la segmentación fija. Si los tamaños de los bloques son desiguales, las unidades de aceleración diseñadas para el cálculo matricial (como los Tensor Core) se quedarán ociosas en gran medida. Frente a este problema, la industria ya ha explorado soluciones viables. Por ejemplo, el algoritmo de relleno con ceros puede, a nivel de la memoria de vídeo física, ensamblar estrechamente bloques semánticos dinámicos de longitudes variadas sin desperdiciar espacio. Y además, en lo lógico, conserva las fronteras de cada bloque semántico. Actualmente,los principales laboratorios de IA del mundo están impulsando la técnica de segmentación dinámica desde dos direcciones: la "continuidad semántica" y el "cálculo disperso", y esta técnica se ha convertido en la principal brecha de avance para acelerar y mejorar la calidad de la nueva generación de grandes modelos de texto largo.El resultado más representativo es ChunkKV, propuesto por el equipo de la Universidad de Ciencia y Tecnología de Hong Kong (Guangzhou), que sigue el camino de la "continuidad semántica". En el pasado, los métodos dominantes de compresión del KV, fueran H2O, SnapKV o PyramidKV, tenían como idea central puntuar los Token individuales, conservando los importantes y descartando los poco importantes. Este tipo de filtrado puede fácilmente despedazar una frase completa con sujeto, verbo y complemento. La idea central de ChunkKV es tomar bloques semánticos continuos como unidad básica de compresión: o se conserva el bloque entero, o se descarta entero. Lo que queda son frases y oraciones completas. En la prueba de referencia NIAH (aguja en un pajar), la que más pone a prueba la capacidad de recuperación en textos largos, cuando el tamaño del caché KV se limita a 128, ChunkKV basado en LLaMA-3 alcanza una precisión del 73.8%, mientras que el método tradicional SnapKV solo logra el 58.9%. Esta técnica corrige directamente la carencia de los grandes modelos en escenarios de texto largo de "no comprender bien y no encontrar con precisión", mejorando enormemente la usabilidad real del modelo.
Además de ChunkKV, el equipo del doctor Xiao Han de Jina AI, centrado en la optimización de escenarios de recuperación, propuso un esquema de segmentación diferida que resuelve el problema fatal de la recuperación inteligente tradicional de "primero segmentar el texto y luego analizar el contenido": primero deja que el modelo lea el texto completo y asimile el contenido global y la lógica del contexto, y solo justo antes de emitir el resultado final segmenta el texto según sus fronteras semánticas naturales, preservando al máximo la información completa. En cuanto al "cálculo disperso",el Instituto de Investigación de Microsoft Asiadesarrolló el marco MInference, diseñado específicamente para escenarios de inferencia con textos ultralargos de un millón de caracteres. El equipo descubrió que, cuando los grandes modelos leen textos largos, no todos los contenidos requieren un cálculo fino, y que la matriz de atención presenta patrones fijos de dispersión aprovechables. Basándose en esta característica, este marco asigna a cada cabeza de atención el método de cálculo disperso más adecuado. Sin reducir en absoluto la precisión de la recuperación, logra una aceleración de hasta 10 veces en la fase de prefill del contexto largo de un millón de caracteres. En la primera mitad de la carrera por el contexto largo, las técnicas de compresión del KV contribuyeron enormemente a la competencia de "quién puede procesar más largo". Pero la esencia del contexto largo nunca fue ser largo por ser largo. Cuando los usuarios empiezan a usar realmente el contexto largo para tareas reales, que sea utilizable, cómodo y no pierda información se convierte en el nuevo KPI. Enlaces de referencia: https://arxiv.org/pdf/2609.36322https://www.zhihu.com/question/2091513666864682278

Sube a bordo, Leifeng (cuenta oficial de Leifeng) te llevará a recorrer lo mejor de las principales conferencias mundiales de IA

Acceso exclusivo para explorar:

Presentaciones PPT de expertos

Textos completos de los informes de la conferencia

Análisis de artículos populares

Entrevistas con nuevas estrellas académicas

Escanea el código QR de arriba

o haz clic en «Leer el original» para seguir la sección especial.

Artículos originales de Leifeng; queda prohibida su reproducción sin autorización. Consulta los detalles enAviso de reproducción。

Fuente original

雷峰网 AI

Notas sobre el contenido

La publicación original y los derechos pertenecen a la fuente.

Traducción automática · Consulte el original