雷峰网 AI

Byte AIK entdeckt versteckten Bug in DeepSeek: Ein paar Leerzeichen hinzugefügt, und das Modell scheitert

DeepSeeks Geldspar-Königstrumpf – warum wurde er zum tödlichen blinden Fleck? Autor丨Gao Yunyi Redaktion丨Cen Feng Stellt man DeepSeek zweimal dieselbe Frage und tippt nur ein paar zusätzliche Leerzeichen ein, liefern die…

DeepSeek Geldspar-Königstrumpf – warum wurde er zum tödlichen blinden Fleck?

    Autor丨Gao Yunyi

Redaktion丨Cen Feng

                                                                                                       

Stellt man DeepSeek zweimal dieselbe Frage und tippt nur ein paar zusätzliche Leerzeichen ein, liefern die Antworten einmal ein Bild wie von einem „Genie“ und einmal wie von einem „Schwachkopf“. Ende des 9. Monats veröffentlichte das ByteDance-Team seine neueste Arbeit„Periodic Weak Spots: Phase Sensitivity from Chunked KV-Cache Compression“, die direkt das „Genie-und-Torheit“-Phänomen („神鬼二象性“) der DeepSeek V4 Modellreihe beim Namen nannte.„Genie-und-Torheit-Dichotomie“. Bildlegende: Link zur Arbeit https://arxiv.org/pdf/2609.36322 Im Kern handelt es sich um ein „periodisches Vergessen“, das durch die Trägheit des zugrunde liegenden Algorithmus entsteht.Die Chunked-KV-Cache-Kompressionstechnikzerlegt lange Kontexte in Blöcke und verarbeitet sie komprimiert – das wirft ein Problem auf:„Die Position bestimmt das Schicksal“. Wenn dein Kernbegriff unglücklicherweise im „blinden Fleck“ an einer Blockgrenze landet, kann das Modell nur Unsinn von sich geben. Stellen wir uns vor, ein großes Sprachmodell prüft einen Vertrag über Dutzende Seiten, und eine zentrale Klausel liegt genau in diesem „blinden Fleck“: Das Modell ignoriert diese Information einfach und kommt zu gegenteiligen Schlussfolgerungen. Und dieser Fehler kann daher rühren, dass du versehentlich ein paar Leerzeichen hinzugefügt hast – das Modell scheitert, und du weißt gar nicht, wo das Problem liegt. Und diese angeborene Schwäche der „Genie-und-Torheit“-Dichotomie ist keineswegs ein Alleinstellungsmerkmal von DeepSeek. In der heutigen Zeit, in der everyone ruft „drückt die Kosten für lange Texte“, haben alle Modelle, die solche Chunked-Kompressions- oder Sparsification-Techniken einsetzen, mehr oder weniger ähnliche Probleme, zum Beispiel die Open-Source-Reihe Llama 3.

01


Bytes Arbeit packt DeepSeek bei der Schwachstelle

Bytes ursprüngliche Entdeckung stammte davon, DeepSeek-V4-Flash-Base einen Codeabschnitt vervollständigen zu lassen. Die Aufgabe bestand darin, das letzte Token einer FP8-Quantisierungsfunktion zu ergänzen. Nach der Code-Logik hätte das korrekte Ergebnis 8 lauten müssen, doch weil die Forscher ganz am Anfang des Codes eine Reihe rein dekorativer Gleichheitszeichen eingefügt hatten, gab das Modell 32 aus. Noch seltsamer: Diese Fehler sind nicht zufällig, sondern direkt an die Anzahl der Gleichheitszeichen gekoppelt:Teilt man die Anzahl der Gleichheitszeichen durch 4, antwortet das Modell bei einem Rest von 0 oder 1 mit hoher Wahrscheinlichkeit falsch, mit einer Fehlerquote von bis zu 71.3 %; bei einem Rest von 2 oder 3 antwortet das Modell wieder richtig, mit einer Genauigkeit von bis zu 91.5 %.Das Byte-Team ging der Sache auf den Grund und fand heraus, dass dies eine angeborene Schwäche ist, die durch den Einsatz derChunked-KV-Cache-Kompressionstechnik bei großen Sprachmodellenentsteht. Die Chunked-KV-Cache-Kompression ist DeepSeek's Königstrumpf gegen den Speicherdruck bei langen Kontexten: Sie schneidet fortlaufende Token in fester Länge, und die Token jedes Abschnitts können über eine lernbare Gating-Schicht zu „Mini-Zusammenfassungen“ komprimiert werden – so wird der Speicherdruck langer Kontexte sofort deutlich reduziert. Das löst das Speicherproblem, führt aber ein neues ein. Die Standard-Transformer-Attention hängt nur von den relativen Abständen zwischen Token ab, nicht von absoluten Positionen. Ein Satz ändert seine Bedeutung nicht, egal wo er steht – solange die Wortreihenfolge gleich bleibt.Aber DeepSeek nutzt Chunked-KV-Cache-Kompression, wodurch die Position jedes Tokens innerhalb des komprimierten Abschnitts wichtig wird; diese Position heißt „Phase“. Die Gating-Schicht weist Token an verschiedenen Positionen unterschiedliche Gewichte zu; dieses Gewicht heißt Slot-Gain-Faktor.Token in starken Slots werden gewichtet erhalten, und das Modell antwortet präzise richtig; Token in schwachen Slots werden fast ignoriert, und das Modell antwortet falsch.Dieses positionsabhängige Phänomen heißt Phasensensitivität.Bei der weiteren Analyse des Modellinneren entdeckten die Forscher zudem, dass die Attention-Köpfe eine natürliche Arbeitsteilung ausbilden: manche verarbeiten bevorzugt Positionen am Anfang eines Abschnitts, andere bevorzugt Positionen am Ende. Diese Phasenspezialisierung macht bestimmte Slot-Positionen zu Schwachstellen.Um zu prüfen, dass dies kein Zufall war, führte das Byte-Team einen „Nadel-im-Heuhaufen“-Test durch. Die Forscher konstruierten einen Kontext mit einer Länge von 128K Token, der etwa 1.6 万 Schlüssel-Wert-Paare enthielt, wobei jedes Key einem Value entspricht. Bei unveränderten Schlüssel-Wert-Beziehungen, unveränderter Frage und insgesamt gleichbleibender Kontextlänge lautete die Frage: Kann das Modell den zugehörigen Value noch korrekt nennen, wenn man eines der Schlüssel-Wert-Paare an eine andere Position setzt? Das Ergebnis: Die Genauigkeitsdifferenz von DeepSeek-V4-Flash-Base zwischen verschiedenen Positionen erreichte maximal 40.2 %. Bei DeepSeek-V4-Pro-Base betrug die Differenz 34.8 %; selbst durch nachtrainingsoptimierung blieb das Problem bestehen, mit Differenzen von 19.1 % und 14.8 %. Angesichts dieses periodischen blinden-Flecken-Problems versuchte DeepSeek mit DeepSeek-V4.1-Flash, die Kompressionsschrittweite einfach zu halbieren. Bei einer Schrittweite von 4 entstehen pro Kompressionsdurchlauf 4 Slots. Die Informationsgewichte, die den verschiedenen Slots zugewiesen werden, unterscheiden sich stark; Token an Randpositionen gehen leicht in zwei aufeinanderfolgenden Fenster-Kompressionsdurchläufen verloren. Wird die Schrittweite auf 2 gesenkt, wird die Kompression feiner, und pro Durchlauf werden nur 2 Token zusammengefasst. Innerhalb eines Kompressionszyklus gibt es für ein Token nur noch zwei relative Positionen. Selbst wenn also eine kritische Information auf einer schwächeren ungeraden Position landet, kann sie kaum vollständig verloren gehen, weil die benachbarte Position nur 1 Token entfernt ist. DeepSeek-V4.1-Flash konnte die Genauigkeitsdifferenz tatsächlich auf 6.1 % weiter senken, doch das Problem wurde nicht vollständig beseitigt. Daraufhin trainierte das Byte-Team mit der Qwen3-0.6B-Architektur eine Reihe von Modellen von Grund auf neu, wobei alle anderen Konfigurationen völlig identisch waren und nur der Kompressionsmechanismus geändert wurde. Das Ergebnis:
  • Alle Modelle mit Chunked-Kompression zeigten periodische Genauigkeitsschwankungen; das Voll-Aufmerksamkeits-Basismodell ohne Kompression zeigte dieses Phänomen nicht;
  • die Schwankungsperiode entsprach exakt der Kompressionsschrittweite;
  • auch ohne RoPE-Positionscodierung blieben die Schwankungen bestehen – sie stammen nicht aus der Positionscodierung;
  • selbst wenn die lernbaren Gating-Gewichte durch die einfachste Gleichverteilung ersetzt wurden, traten weiterhin periodische Schwankungen auf – es liegt also nicht an schlecht abgestimmten Parametern.
Bildlegende: Setzt man die Kompressionsschrittweite auf 4, 6, 8 bzw. 12, beträgt die Periode der Genauigkeitsschwankung ebenfalls 4, 6, 8 bzw. 12. Offensichtlich gilt:Solange eine Chunked-Kompression in fester Länge eingesetzt wird, lässt sich dieses Problem nicht vermeiden.Dies ist ein struktureller Defekt des Ansatzes selbst, der sich nicht durch Parameter-Tuning, andere Positionskodierungen oder Post-Training beheben lässt. Ein Nutzer wies darauf hin, dass man, um dieses Problem vollständig zu lösen, die Segmenteierung selbst gewissermaßen „lebendig“ machen müsse, sodass die Grenzen dynamisch entsprechend der Bedeutung des Inhalts festgelegt werden. Wenn Token keine feste Phase haben, gibt es auch keinen Phasenunterschied. In der KI-Forschung gibt es dazu tatsächlich relevante Studien, genannt„dynamische Segmentierung“。

02


Ist die „dynamische Segmentierung“ das Gegenmittel?

Der Kern der dynamischen Segmentierung besteht darin, das starre Schema fester Token-Zahlen aufzugeben und die Aufteilung flexibel anhand von Semantik und Wichtigkeit anzupassen.Dieser technische Ansatz stellt eine umfassende Neukonstruktion des gesamten Technologie-Stacks von oben nach unten dar – von der Algorithmus-Mathematik über das Speichermanagement bis hin zur zugrunde liegenden Hardware.

▎Erste Ebene: Neugestaltung der mathematischen Grundlagen der Aufmerksamkeit

Wie genau soll die dynamische Segmentierung erfolgen? Der Kern lautet: „Die Größe folgt dem Inhalt“. inhaltsarme Füllwörter werden direkt zu großen Blöcken zusammengefasst; an entscheidenden Wendepunkten und bei hochdichten Informationen wird hingegen fein genug segmentiert, um präzise zu berechnen. So kann das Modell, egal wo die Schlüsselinformationen verborgen sind, diese scharf erfassen – mathematisch stellt dies die durch die feste Segmentierung zerstörte Translationsinvarianz wieder her. Darüber hinaus verleiht dies dem Modell eine Art „Antizipationsfähigkeit“: Zuerst wird die Informationsdichte überblickt, dann entschied man über die Segmentgröße. Der Inferenzprozess folgt nicht mehr einem einzigen Takt von Anfang bis Ende, sondern liest schnell, wo schnelles Lesen angebracht ist, und verweilt dort langsam und sorgfältig, wo genaueres Lesen nötig ist – im tiefsten Architekturlayer entsteht ein Instinkt für „schnelles und langsames Denken“.

▎Zweite Ebene: Fortschreibung des Speichermanagements

Bisher wurde der KV Cache, um schnelle Matrixberechnungen zu ermöglichen, in Blöcken fester Größe verwaltet. Der Vorteil dieser Methode liegt in ihrer Einfachheit, Regelmäßigkeit und leichten Handhabung, doch die Speicherauslastung blieb niedrig und Rechenleistung wurde leicht verschwendet. Mit der dynamischen Segmentierung stößt die traditionelle „statisch kontinuierliche Matrix“ auf der unteren Ebene an ihre Grenzen; eine Weiterentwicklung hin zur „topologisch sparsamen Matrix“ ist unausweichlich, wobei die Adressierung über eine dynamische Indexschicht erfolgt. Noch eleganter: Die Forschung zeigt, dass die Grenzen der dynamischen Segmente zwischen verschiedenen Transformer-Schichten stark ähnlich sind und direkt wiederverwendet werden können. Dadurch werden die Kosten der dynamischen Adressierung erheblich verteilt. Am Ende segmentiert die obere Schicht clever, die untere Ebene speichert sparsamer, und die Adressierung dazwischen bleibt dennoch schnell.

▎Dritte Ebene: Lösung des Problems der Hardware-Ausrichtung

Dies ist die schwierigste der drei Ebenen. GPUs bevorzugen naturgemäß regelmäßige Matrixoperationen mit Seitenlängen, die durch 8, 16 und 32 teilbar sind – dies ist der praktischste Hardware-Grund, warum die gesamte Branche bisher so lange an der festen Segmentierung festhielt. Sind die Segmentgrößen unregelmäßig, laufen die speziell für Matrixberechnungen konstruierten Beschleunigungseinheiten (wie Tensor Core) weitgehend leer. Für dieses Problem hat die Branche bereits tragfähige Lösungen erarbeitet. Zero-Padding-Algorithmen etwa können auf der physischen Speicherebene dynamische semantische Blöcke unterschiedlicher Länge eng aneinanderpacken, ohne Platz zu verschwenden. Gleichzeitig können sie auf logischer Ebene die Grenzen jedes semantischen Blocks bewahren. Derzeittreiben weltweit führende KI-Labore die dynamische Segmentierung in zwei Richtungen voran – „semantische Kontinuität“ und „sparsame Berechnung“, diese Technologie ist bereits zum zentralen Durchbruchsfeld für Geschwindigkeits- und Qualitätssteigerungen bei neuen Langtext-Modellen geworden.Das repräsentativste Ergebnis davon ist ChunkKV, vorgeschlagen vom Team der Hong Kong University of Science and Technology (Guangzhou). Es verfolgt den Weg der „semantischen Kontinuität“. Bisher basierten die gängigen KV-Kompressionsmethoden – ob H2O, SnapKV oder PyramidKV – alle auf dem Kernansatz, einzelne Token zu bewerten und die wichtigen zu behalten, die unwichtigen zu verwerfen. Eine solche Auswahl zerlegt leicht einen vollständigen Satz mit Subjekt, Prädikat und Objekt in Fragmente. Der Kernansatz von ChunkKV ist, kontinuierliche semantische Blöcke als grundlegende Kompressionseinheit zu nehmen: entweder den ganzen Block behalten oder den ganzen Block verwerfen. Zurückbleiben stets vollständige Phrasen und Sätze. Im NIAH-Benchmark (Needle in a Haystack), der die Langtext-Abruffähigkeit am stärksten prüft, erreichte das auf LLaMA-3 basierende ChunkKV bei einer KV-Cache-Größe von 128 eine Genauigkeit von 73.8 %, während die traditionelle Methode SnapKV nur 58.9 % erreichte. Diese Technologie gleicht die Schwäche von großen Modellen im Langtext-Kontext – „nicht verstehen, nicht finden“ – direkt aus und verbessert die praktische Nutzbarkeit der Modelle erheblich.
Neben ChunkKV hat etwa das Team von Dr. Xiao Han bei Jina AI, das sich auf die Optimierung von Retrieval-Szenarien konzentriert, einen Ansatz der verzögerten Segmentierung vorgeschlagen, der das fatale Problem traditioneller intelligenter Suche löst, bei der „der Text zuerst segmentiert und dann der Inhalt analysiert“ wird: Das Modell liest zunächst den gesamten Text vollständig, erfasst den globalen Inhalt und die Kontextlogik und segmentiert den Text erst kurz vor der Ausgabe des Ergebnisses entlang natürlicher semantischer Grenzen, um die vollständigen Informationen maximal zu erhalten. Im Bereich der „sparsamen Berechnung“ hat das von derMicrosoft Research Asiaentwickelte MInference-Framework eine Vielzahl von Anwendungen gefunden, das speziell für Inferenzszenarien mit extrem langen Texten von Millionen Zeichen optimiert ist. Das Team fand heraus, dass beim Lesen langer Texte durch große Modelle nicht jede Stelle eine präzise Berechnung erfordert und dass die Aufmerksamkeitsmatrix ausnutzbare feste Sparse-Muster aufweist. Auf dieser Grundlage ordnet das Framework verschiedenen Aufmerksamkeitsköpfen die jeweils am besten geeignete Methode der Sparse-Berechnung zu. Bei vollständig erhaltenen Abrufgenauigkeit wurde eine Beschleunigung von bis zum 10-fachen in der Prefill-Phase von Kontexten mit Millionen von Zeichen erreicht. In der ersten Phase des Langtext-Wettbewerbs waren die KV-Kompressionstechniken im Kampf um „wer kann mehr verarbeiten“ unverzichtbar. Doch der Kern des langen Kontexts war nie das Ziel, um des Längeren willen. Wenn Nutzer nun den langen Kontext tatsächlich für reale Aufgaben einsetzen, werden Nutzbarkeit, gute Bedienbarkeit und Informationsverlustfreiheit zur neuen KPI. Referenzlinks: https://arxiv.org/pdf/2609.36322https://www.zhihu.com/question/2091513666864682278

Steigen Sie ein – Leiphone (WeChat-Konto: Leiphone) zeigt Ihnen die Highlights der weltweit wichtigsten AI-Konferenzen

Sie erhalten exklusiven Zugang zu:

Präsentationsfolien der Experten

Vollständige Kongressberichte

Interpretationen populärer wissenschaftlicher Arbeiten

Interviews mit aufstrebenden akademischen Talenten

Scannen Sie den QR-Code oben

oder klicken Sie auf „Read Original“, um der Rubrik zu folgen.

Dieser Artikel ist ein Originalartikel von Leiphone und darf ohne Genehmigung nicht nachgedruckt werden. Details sieheHinweise zum Nachdruck。

Originalquelle

雷峰网 AI

Hinweise zum Inhalt

Originalveröffentlichung und Rechte liegen bei der Quelle.

Maschinelle Übersetzung · Original beachten