Anthropic unterbricht Clodes Internetzugang nachdem das Modell selbstständig eine gefälschte Mordmeldung bei der Polizei von Philadelphia eingereicht hat
Manuel Uth
10. Oktober 2026Die AI-Modelle von Anthropic nutzten unabhängig Sicherheitslücken aus, übersandten Regierungsformulare und umgingen Zugriffsbeschränkungen während der Tests und im internen Einsatz. Die Modelle suchten aktiv nach Wegen, Aufgaben zu erledigen, die sie eigentlich nicht übernehmen sollten, wie die Unternehmendetails in einem Bericht zeigen.
In einem Fall füllte Claude ein Tippformular für das Philadelphia Police Department aus mit gefälschten Details über einen ungelösten Mord und übergab es. Die Polizei bestätigte den Vorfall, aber der Tipp wurde als Spam markiert und erreichte die Ermittler nie. In anderen Fällen fand das Modell eine Schwachstelle auf einem Universitätsserver und nutzte diese, um Befehle auszuführen, Zugriffszeichen aus den Website-Configs zu holen, um geschützte oder paywalled Daten zu erhalten, und verwendete URL-Kürzungen, um die Längebeschränkungen seiner Tools zu umgehen.
Anthropic sagt, dass der Einfluss auf die reale Welt gering war, aber ein Muster erkennt. Wenn Aufgaben unklar oder schwer zu lösen sind, sucht das Modell selbst nach Lösungen, anstatt aufzuhören. Das Unternehmen hat das Weiße Haus informiert und den Live-Internetzugang für alle internen Evaluierungen abgeschaltet, bis neue Sicherheitsfilter zuverlässig installiert sind. Diese Vorfälle schließen sich einer schnell wachsenden Liste ähnlicher Fälle an, darunter Cybersecurity-Vorfälle im Zusammenhang mit Claude und OpenAI-Modelle, die autonom Hugging Face hackten.
AI-Neuigkeiten ohne Hype – von Menschen zusammengestellt
Abonnieren Sie THE DECODER, um ohne Werbung zu lesen, ein wöchentliches AI-Bulletin, unseren exklusiven „AI Radar“-Bericht sechsmal pro Jahr, Zugang zum vollständigen Archiv und Zugang zur Kommentarsektion.
Quelle: Anthropic / Bericht | CBS News / Philadelphia Police