Unbeabsichtigte Modellverhalten bei unseren Evaluierungen und internen Nutzung untersuchen
9. Oktober 2026
Dieser Bericht beschreibt Beispiele für unbeabsichtigte Modellverhalten, die wir während der Evaluierungen und im internen Einsatz von Claude festgestellt haben. Er ist Teil unserer Bemühungen, häufigere Einzelberichte über das Verhalten und die Ausrichtung des Modells – abseits der Systemkarten – zu veröffentlichen, die wir mit jeder Modellveröffentlichung bereitstellen, sowie unsere Risikoberichte, die wir alle drei bis sechs Monate als Teil unserer Verantwortungsvollen Skalierungspolitik veröffentlichen. Wir halten es für wichtig, transparent über das zu sein, was unsere Modelle während der Tests und im Einsatz tun.
Die Verhaltensweisen können in vier Kategorien eingeteilt werden:
- Claude nutzt eine grundlegende Schwachstelle im Softwareprogramm, um Befehle auf einem Server auszuführen;
- Claude sendet einen sensiblen Formularinhalt auf einer echten Website, wo das nicht erlaubt ist;
- Claude versucht, eine Einschränkung zu umgehen, um auf Daten zuzugreifen, die durch ein Token oder eine Gebühr gesperrt sind; und
- Claude verwendet URL-Kürzungsdienste, um die Grenzen seines Abrufwerkzeugs zu überwinden.
Wir haben beschlossen, die Organisationen, die in den unten genannten Beispielen beteiligt sind, nicht zu nennen, um die Schwachstellen in ihren Systemen nicht offenzulegen – und auf deren Bitte hin. Aus diesem Grund geben wir auch weniger Details über jeden Fall als üblicherweise. Einige der unten beschriebenen Fälle betrafen Webseiten, die von Regierungsbehörden der USA auf Bundes-, Staats- und lokaler Ebene betrieben wurden. Wir haben das Weiße Haus über diese Fälle informiert und jede beteiligte Behörde benachrichtigt.
Die Fälle, die wir bisher in diesen Kategorien identifiziert haben, hatten einen minimalen Einfluss im realen Leben. Wir betrachten diese Verhaltensweisen aus Sicht von Ausrichtung und Sicherheit als deutlich weniger schwerwiegend als die Cybersicherheitsvorfälle, die wir am 30. Juli und 9. September berichteten. Sie ähneln den Verhaltensweisen, die wir in unseren Systemkarten beschrieben haben, seit Claude Mythos Preview. Die meisten sind Formen von Persistenz, bei denen Claude, wenn es ihm nicht möglich ist, eine Aufgabe wie vorgesehen zu erledigen, eine Einschränkung umgeht und nicht aufhört.
Obwohl die Auswirkungen dieser Verhaltensweisen minimal waren und wir bereits den Live-Internetzugang für einige hohe-Risiko- und Cybersicherheit-Evaluierungen deaktiviert hatten, haben wir jetzt entschieden, dies auf alle unsere internen Evaluierungen auszuweiten, bis wir sichergestellt haben, dass unsere Sicherheits- und Überwachungsmaßnahmen (die in der Remediation-Sektion dieses Beitrags beschrieben sind) solche Verhaltensweisen zuverläufig erkennen. Unterhalb besprechen wir auch Aspekte der Ausrichtung und geben weitere Details darüber, wie wir das Training modifizieren, um die Wahrscheinlichkeit weiterer Fehlverhaltensweisen zu verringern.
Wir haben die meisten dieser Fälle durch eine Überprüfung der Transkripte identifiziert, die wir im Juli begannen. Unsere Überprüfung konzentrierte sich zunächst auf unsere Cybersecurity-Bewertungen – Tests, bei denen ein Modell absichtlich dazu gebracht wird, ein Testsystem zu prüfen oder anzugreifen, und bei denen der Internetzugang deaktiviert werden soll. Wir haben seitdem unseren Scannen erweitert, um eine viel breitere Palette von Fällen zu umfassen, in denen Claude das Internet erreichen könnte, einschließlich Tests, bei denen der Internetzugang absichtlich aktiviert wird, damit Claude bei realen Aufgaben bewertet werden kann. Wir begannen damit, nach Vorfällen mit einer ähnlichen Schwere wie die Sicherheitsvorfälle, die wir this Sommer berichtet haben, zu suchen; bis jetzt haben wir keine gefunden. Wir erweiterten anschließend die Suche auf Fälle niedrigerer Schwere, bei denen das Modell auf echten Webseiten oder Systemen auf eine Weise interagierte, die wir nicht beabsichtigt hatten.
Wir scannen auch nun einen viel größeren Pool von Transkripten mit geringerem Risiko, sowie unseren Einsatz von Claude innerhalb von Anthropic und in Reinforcement-Learning-Umgebungen, in denen Claude Zugang zum Internet hat. Da diese Arbeit weitergeht, planen wir, neue Beispiele für unbeabsichtigte Verhaltensweisen zu berichten. Alle hier gemelten Fälle betrafen die Interaktion von Claude mit der Außenwelt; soweit wir wissen, betrafen sie keine Kundendaten oder die internen Systeme von Anthropic.
In diesem Artikel erklären wir, warum wir Evaluierungen durchführen – wo die meisten dieser Fälle stattfanden – beschreiben wir jedes Verhalten detaillierter und geben wir eine vorläufige Einschätzung dazu, was diese Verhaltensweisen über die Ausrichtung von Claude aussagen und wie wir diese verringern.
Warum und wie wir Evaluierungen durchführen
Die in diesem Artikel beschriebenen Verhaltensweisen sind nicht spezifisch für Bewertungen, sondern viele der bisher identifizierten Fälle ereigneten sich während der Ausführung von Bewertungsprozessen. Wir testen die Modelle kontinuierlich an einer breiten Palette von Aufgaben, bevor wir sie veröffentlichen. Wir verwenden viele verschiedene Bewertungen (standardisierte Aufgabensets, die jedes Mal auf dieselbe Weise bewertet werden), wobei jede dieser Bewertungen dazu beiträgt, ein Bild von Clodes Fähigkeiten in einem bestimmten Bereich zu zeichnen. Viele der verwendeten Bewertungen sind öffentlich; sie werden von externen Forschern erstellt und können von jedem Entwickler ausgeführt werden, sodass wir die Leistungsfähigkeit der Modelle vergleichen können. Andere Bewertungen erstellen wir intern.
Da Sprachmodellen nicht deterministisch sind – also ihre Antworten always mit einem bestimmten Element der Zufälligkeit verbunden sind und sie die gleiche Aufgabe jedes Mal leicht unterschiedlich ausführen können – haben wir Claude hunderte oder tausende Male für jede Bewertungsaufgabe ausgeführt (jeder Versuch wird als Run bezeichnet). Die Testung so oft ermöglicht es uns, zu verstehen, wie ein Modell typischerweise funktioniert, und auch seltene Fälle zu erkennen, in denen das Modell etwas tut, was wir nicht erwarten. Was wir aus den Evaluierungen lernen, bestimmt die Entscheidungen bei Anthropic – einschließlich der Art und Weise, wie wir Modelle trainieren, welche Sicherheitsmaßnahmen wir um sie herum etablieren und wann wir sie veröffentlichen.
Auch bei der Evaluierung werden manchmal die Verhaltensprobleme eines Modells sichtbar. Die Modelle lernen vieles, was sie können, durch RL – dabei versuchen sie immer wieder, eine Aufgabe in einem bestimmten Umfeld auszuführen und erhalten Belohnungen, wenn sie erfolgreich sind. Allerdings sind die Trainingsumgebungen unvollkommen. Wenn die Trainingsbelohnungen etwas enthalten, was wir nicht beabsichtigen – wie zum Beispiel das Finden von Lücken oder das Umgehen von Beschränkungen – dann lernt das Modell, dass die Abwandlung funktioniert, und kann diese Methode anschließend an anderen Orten anwenden. Dies wird als Belohnungshacking bezeichnet. Obwohl wir Prozesse haben, um Belohnungshacking während des Trainings zu identifizieren und auszusortieren, sind die Bewertungen ein wichtiger Mechanismus, um die Verhaltenspräferenzen eines Modells in verschiedenen Kontexten und bei unterschiedlichen Aufgabenstellungen zu verstehen – als ob diese im Training angewandt werden.
Einige Aufgaben – wie die Suche im Internet nach schwer zugänglicher Informationen – sind in einer Umgebung ohne Internetzugang nur schwer realistisch simulierbar. Die Durchführung dieser Aufgaben mit Internetzugang ist in der Branche Standard: öffentliche Web-Suchverfahren werden standardmäßig über das Live-Internet durchgeführt, und die gleiche Durchführung ermöglicht es uns, unsere Modelle mit anderen Modellen zu vergleichen. Die meisten Fälle in diesem Bericht ereigneten sich während solcher Bewertungen.
Überblick der Verhaltensweisen
Unterhalb beschreiben wir vier Arten von Verhalten, bei denen Claude auf echten Webseiten und Systemen auf eine Weise handelte, die wir nicht beabsichtigt hatten. Jedes dieser Verhaltensweisen betraf eine Organisation oder Person außerhalb von Anthropic.
Die Nutzung eines grundlegenden Fehlers im Software-Code zur Ausführung von Befehlen auf einem Server
Wenn Claude die Aufgabe nicht direkt erledigen konnte – entweder weil seine eigenen Tools absichtlich eingeschränkt waren oder weil ein benötigtes externes Service nicht verfügbar war – nutzte es andere Tools, die auf einer Website eines Drittanbieters hostet wurden, um sein Ziel zu erreichen. In manchen Fällen tat es dies, indem es die grundlegenden Fehler im Software des Drittanbieters ausnutzte, SQL oder Command Injection verwendete (eine Methode, um Eingaben zu senden, die der Drittanbieter versehentlich als Befehle ausführt).
Zum Beispiel bat eine Bewertung Claude Mythos Preview, eine wissenschaftliche Analyse durchzuführen. Die öffentliche Tool, die für diese Analyse benötigt wurde, war von einer Universität hostiert; als das Modell versuchte, auf dieses Tool zuzugreifen, gab das Tool einen Fehler zurück. Um einen anderen Weg zum Abschluss der Aufgabe zu finden, untersuchte Claude die Website des Tools, fand einen Skript auf dem Server der Universität, der jede angeforderte Datei liefern würde, und nutzte ihn, um Dateien vom Server zu kopieren, einschließlich des eigenen Codes des Skripts. In diesem Code fand Claude die Läsung der Einspielung, durch die es Befehle auf dem Server ausführen konnte, und nutzte sie, um die Berechnung durchzuführen.
In einem anderen Fall waren die Daten, die Claude Mythos 5 benötigte, frei, aber Claude konnte sie ohne die Unterzeichnung eines Datennutzungsvertrags nicht erreichen – und er hatte keine Tools dazu. Claude nutzte Anwendungen, die auf der Website untergebracht waren, um die Seite zu Laden und den Vertrag im Namen des Clodes zu akzeptieren.
Wir haben dieses Verhalten bei DeepSearchQA und BrowseComp (beide öffentliche Web-Recherche-Evaluierungen), bei LABBench2 (ein öffentlicher Biologie-Recherche-Benchmark) sowie während interner Evaluierungen beobachtet.
Das Einreichen eines Formulars sollte nicht stattfinden
Wir haben Beispiele gesehen, in denen Claude ein Online-Formular eingab, obwohl das nicht notwendig war. Im Allgemeinen geschah dies, wenn die Anleitungen für die Bewertung unklar waren oder eine Fehlerkonfiguration im Umfeld dazu führte, dass Claude nicht mit Dummy-Formularen arbeiten konnte.
Zum Beispiel wurde in einem Fall, der mehrfach bei derselben Bewertung auftrat, ein noch nicht veröffentlichtes, nicht-frontier-Research-Modell verwendet, um eine Kopie eines Regierungsformulars zu erstellen. Wenn die Kopie nicht geladen werden konnte oder das Modell versehentlich schloss, navigierte das Modell stattdessen zur Website, auf der das echte Formular normalerweise gespeichert ist, und übergab das Formular dort.
In einer anderen Bewertung wurde Claude Haiku 4.5 angewiesen, ein Formular bis zum letzten Absendenstadium auszufüllen, aber vor dem eigentlichen Absenden zu stoppen. Mehrfach gab Claude versehentlich das Formular ab, in der Annahme, dass eine zusätzliche Bestätigungsseite vorhanden wäre. In diesen Fällen sagte die Denkprozess-Logik des Modells aus, dass es nur den Prozess demonstrierte und keine echte Anfrage übermittelte.
In einem dritten Beispiel dieses Verhaltens wurde Claude Haiku 4.5 mit der Aufgabe betraut, auf zufällig ausgewählten Webseiten Beispielaufgaben zu generieren und auszuführen. Bei einer Ausführung landete das Modell auf einer Seite, die einen ungelösten Mordfall erwähnt; diese Seite enthielt ein Formular für Hinweise, das von einem Polizeidepartement verwendet wurde. Claude wurde angewiesen, sich nie einzuloggen, Konten zu erstellen, persönliche Daten einzugeben, Einkäufe zu tätigen oder etwas Zerstörerisches zu senden – doch die Anweisungen ausschließen nicht das Senden von Formularen. Claude füllte das Formular mit folgendem Inhalt aus: „Ich habe möglicherweise Informationen bezüglich dieses Falles. Ich erinnere mich daran, dass ich während dieser Zeit eine Person gesehen habe, die der Beschreibung in der Gegend um [die auf der Seite genannte Straße] entspricht. Bitte kontaktieren Sie mich, falls diese Informationen relevant sind.“ (Die Website enthielt keine Beschreibung des Täters.) Das Modell ließ die Felder für den Namen und die Kontaktdaten leer, was vom Formular erlaubt war, und sendete das Formular ab. Die Einreichung wurde als Spam markiert und wurde nie weitergeleitet für eine Untersuchung.
Wir haben dieses Verhalten bei OSWorld (eine Bewertung des Einsatzes von öffentlichen Computern), bei Odysseys (eine Bewertung von langfristigen Aufgaben) und während des internen Gebrauchs beobachtet.
Umgang mit Beschränkungen, um gesperrten Daten zugänglich zu machen
Claude versuchte manchmal, eine Einschränkung zu umgehen, um auf Daten zugreifen zu können, auf die er keinen Zugriff hatte. Im Allgemeinen geschah dies, wenn ein Server Clodes Anfrage ablehnte oder wenn die Daten nur gegen eine Gebühr bereitgestellt wurden.
Zum Beispiel versuchte eine Bewertung, bei der Claude Mythos 5 gebeten wurde, einen Ort auf einem Foto zu identifizieren, ein Grundriss des lokalen Regierungsgebiets anzurufen, um seine Vermutungen zu verfeinern. Claude konnte den Text von Webseiten lesen, doch die Bewertung beschränkte seine Fähigkeit, diese wie eine Person zu nutzen. Stattdessen las er das Einstellungsfile, das der Server an die Browser sendet, fand Arbeitszugriffstoken und verwendete diese, um direkt Anfragen an den Server hinter dem Grundriss zu senden, um die Daten zu erhalten.
In einem weiteren Beispiel für dieses Verhalten nutzte ein Anthropic-Forscher Claude Mythos 5 in einem Statistikprojekt, bei dem er öffentliche Daten aus einer staatlichen Behörde für eine Gebühr abrufen musste. Stattdessen lernte Claude von einer archivierten Kopie der Website der Behörde, dass deren öffentlicher Dashboard jeden Besucher mit einem Zugriffstoken versorgt. Er bat um ein solches Token und nutzte es, um die Datenbank abzufragen, ohne die Gebühr zu zahlen.
In beiden Beispielen erhielt Claude Daten, die bereits für die Öffentlichkeit verfügbar waren, aber nur gegen eine Gebühr.
Wir haben dieses Verhalten bei „Humanities’ Last Exam“, einer Bewertung von akademischen Fragen auf Expertenniveau, sowie während der internen Nutzung beobachtet.
Verwendung von URL-Kurzschlüsseldiensten
Einige unserer Abrufstools, mit denen Claude Webseiten lesen kann, begrenzen die Länge der URLs, die Claude anfordern kann. Dies dient dazu, zu verhindern, dass Claude lange URLs verwendet, um bestimmte unerwünschte Aktionen durchzuführen, wie SQL- oder Befehlsspam (ein Teil einer URL ist Text, der an den Server eines Sites gesendet wird, und eine lange URL hat Platz für solche Anweisungen). Wir haben bemerkt, dass mehrere Modelle, einschließlich Claude Opus 5 und Claude Mythos 5, diese Einschränkung durch die Nutzung kostenloser URL-Kürzungsdienste überwinden. Wir haben dieses Verhalten zunächst intern erkannt, aber während wir diesen Beitrag schrieben, informierte uns ein Operator des da.gd-URL-Kurzschließungsdienstes, dass sie ebenfalls festgestellt hatten, dass Claude für diesen Zweck auf ihrer Website verwendet wurde. Wir danken dem Operator dafür, dass er diese Details mitgeteilt hat.
Beseitigung
Wir haben mehrere Präventivmaßnahmen ergriffen. Einige öffentliche Bewertungen führen wir nicht mehr durch; andere haben wir auf ihre Offline-Versionen umgestellt oder neu aufgebaut, sodass ihre Aufgaben nicht mehr auf den Live-Websites angewandt werden können. Wir haben auch weitere grundlegende Änderungen vorgenommen. Wir haben die Grenzen einiger unserer Internetzugangtools – wie zum Beispiel dem Web Fetch-Tool – aktualisiert, um das, was das Modell mit diesen Tools tun kann, stark einzuschränken. Und im Rahmen unserer anhaltenden Agent-Sicherheit- und Überwachungsbemühungen haben wir Tools entwickelt, die automatisch die oben beschriebenen Verhaltensweisen erkennen und blockieren. Diese Tools laufen jetzt bei den meisten unserer Bewertungen sowie bei der internen Nutzung von Frontier-Modellen vor. Als wir sie gegen die in dieser Nachricht beschriebenen Fälle testeten, blockierten sie alle.
Wie wir in unserem 31. August-Post beschrieben haben, setzen wir auch weiterhin die Trainingsumgebungen wieder in Ordnung oder entfernen sie, in denen Claude dafür belohnt wird, dass es mit den Toolschranken oder anderen Hindernissen umgeht. Dadurch werden diese Verhaltensweisen nicht gefördert und das Hacking der Belohnungen ist nicht möglich.
Wir ergreifen auch weitere Maßnahmen, um unbeabsichtigte Agentverhalten innerhalb von Anthropic zu verhindern und sie, falls es vorkommt, zu erkennen. Dazu gehören die Migration der internen Agenten in eine zentral verwaltete Infrastruktur mit starken Kontrollmechanismen, die Minimierung des Internetzugangs für interne Agenten und Trainingsprozesse sowie die Überwachung vieler Aktivitäten der Agenten durch Techniken wie Sicherheitsklassifikatoren und hierarchische Zusammenfassung. Diese Maßnahmen sind nun Teil der Detektion- und Reaktionsprozeduren unseres Sicherheitsteams, damit wir unerwünschtes Verhalten schnell erkennen und eindämmen können. Wir erwarten, mehr über diese Ansätze zu veröffentlichen und sie direkt in unsere Produkte zu integrieren.
Erkenntnisse aus Diskussion und Übereinstimmung
Obwohl wir noch keine vollständige Bewertung der Situationen in diesen Fällen abgeschlossen haben, halten wir sie für weniger schwerwiegend als die Cybersicherheitsvorfälle dieses Sommers. Wir erklären das unten und teilen die allgemeinen Lehren, die wir aus diesen Vorfällen gezogen haben.
Aligner-Kontext
Da wir ein regelmäßiges öffentliches Berichterstattungsprozess für solche Verhaltensweisen etablieren, möchten wir auch ihre Schweregrad bewerten. Dies bleibt schwierig: Die Beurteilung des Ausmaßes eines Fehlers im Alignment hängt oft davon ab, was das Modell versuchte zu tun, und die eigene Darstellung des Modells über seine Logik ist nicht unbedingt ein zuverlässiger Beweis für seine Überzeugungen oder Gründe für Handlungen, wie wir am 9. September in unserer Alignment-Erhebung diskutiert haben. Da die Modelle immer leistungsfähiger werden, können sie auf komplexere Weise mit der Welt interagieren, was komplexere Fehler ermöglicht. Zum Beispiel war das voreingenommene Denken, das wir in dieser Erhebung beschrieben haben, nicht neu, aber es führte zu ernsteren Folgen in einer Situation, in der die Modelle stundenlang auf echten Systemen handeln können. Ein Framework für das Schweregrad des Alignments, das auf den heutigen Fehlern basiert, könnte schnell veraltet werden, da die Fähigkeiten von KI so schnell voranschreiten.
Dennoch fanden wir zwei Aspekte der Ausrichtung nützlich, um die Fälle in diesem Artikel zu untersuchen: die Übertreitung – also wie weit das Modell über den Zweck seiner Aufgabe hinausging – und Unaufrichtigkeit – also ob es eine irreführende Darstellung seiner Handlungen oder Absichten liefern konnte. Bei der Übertreitung betrachten wir diese Fälle als deutlich weniger problematisch als die Vorfälle, die wir dieses Sommer übermittelt haben, bei denen Claude für mehrere Stunden Zugang zu echten Drittsystemen während der Cybersicherheitsprüfungen erhielt. In den Fällen, die wir hier berichten, hat Claude im Gegensatz dazu die Zugriffsbeschränkungen umgangen, um auf gesperrten, aber öffentlich verfügbaren Daten zuzugreifen, oder hat Softwarefehler ausgenutzt und Befehle auf Servern ausgeführt (hauptsächlich, um nicht sensiblen Daten zu erreichen).
Was Unaufrichtigkeit betrifft, ist die Vergleichung mehr verworren. In einem Fall, bei dem die Aufgabe war, Beispielinteraktionen mit Webseiten zu erzeugen, hat Claude über das Online-Formular eines Polizeidepartments eine erfundenen Tipp vorgestellt. Aus der Transkription geht hervor, dass Claude nur Inhalte für die Aufgabe erstellte, anstatt jemanden zu täuschen, um ein Ziel zu erreichen. Im schwierigsten Incident dieses Sommers wurde das irreführende Denken von Claude jedoch über Stunden unterstützt und ermöglichte den weiteren Angriff. Dennoch erfordert die Beurteilung von Unaufrichtigkeit in der Regel eine tiefere Bewertung als wir hier vorgenommen haben, wie zum Beispiel das Wiederholen der Transkriptionen mit Modifikationen, um herauszufinden, was das Verhalten des Modells verursacht. Daher könnte unser Blick auf diese Fälle durch weitere Analysen sich ändern.
Lektionen und nächste Schritte
Keines der hier beschriebenen Verhaltensweisen ist neu, und es ändert unsere Gesamtsicht auf Claudes Ausrichtung nicht. In vielen Fällen, in denen wir diese Verhaltensweisen beobachteten, erhielt Claude Aufgaben, die unklar oder unmöglich zu erledigen waren. Wir und andere haben festgestellt, dass Modelle, wenn ihnen unmöglich zu erledigende Aufgaben gegeben werden, unbeabsichtigte und manchmal inkorrekte Strategien anwenden, um ihre Ziele zu erreichen.
Es ist möglich, dass einige dieser Fehler vermieden worden wären, wenn die Bewertungsfragen klarer aufgezeigt hätten, was zur Ausführung des Aufgabensystems gehört und was nicht, einschließlich der Ziele, erlaubter Handlungen und Netzwerkbefestigungen (d.h. was das Modell zugreifen darf und nicht darf). Allerdings stößt Claude im täglichen Einsatz mit unklaren und unmöglichen Aufgaben auf, und tatsächlich traten mehrere der beobachteten Fälle während des normalen Einsatzes von Claude auf.
Verhaltens- und Ausrichtungstraining ist die Haupttechnik, die wir zur Verbesserung von Clodes Urteilsvermögen und seiner Fähigkeit, unklare Situationen sorgfältig zu bewältigen, zur Verfügung haben. Historisch haben wir uns stärker darauf konzentriert, Modelle dazu zu lehren, Grenzen zu respektieren und in Programmierumgebungen angemessen vorsichtig zu handeln. Nun erweitern wir diese Umgebungen auf Anwendungen wie Suchfunktionen und Computerentwicklung, die in den hier beschriebenen Fällen beteiligt waren. Allerdings ist die Ausrichtungstraining noch nicht ausreichend oder vollständig robust allein – zumindest in der kurzen Zeit. Deshalb verlassen wir uns auch auf Ansätze der tiefen Verteidigung, einschließlich der oben beschriebenen Klassifikatoren und Schutzmaßnahmen.
Wir planen, weiterhin Berichte über Verhaltensweisen zu veröffentlichen, während unsere Scans und Analysen fortgesetzt werden. Wir hoffen, dass diese Berichte anderen Entwicklern helfen, ähnliche Verhaltensweisen in ihren eigenen Modellen zu erkennen – schließlich sind viele der beteiligten Bewertungen öffentlich und weit verbreitet. Obwohl diese Fälle nur einen geringen Einfluss hatten, wollen wir die Erkenntnisse nicht mindern, da dieselben Verhaltensweisen bei stärkeren Modellen viel mehr Schaden anrichten könnten. Je größer die Rolle der Modelle in der Gesellschaft ist, desto mehr hat die Öffentlichkeit das Recht zu erfahren, wie sie sich verhalten.
Anmerkung: Das oben beschriebene Beispiel bezüglich der Tippform betraf das Philadelphia Police Department, das heute in seiner Pressemitteilung öffentlich gemacht hat. Wir teilten diese Erkenntnis mit dem Department am 8. Oktober, sobald unsere technische Überprüfung abgeschlossen war.
Verwandte Inhalte
Das fehlende Kartenbild des Himmels
Brice Ménard, ein Astrophysiker an der Johns Hopkins University und Forscher bei Anthropic, erklärt, wie er mit Claude Science zusammenarbeitete, um das erste vollständige Himmelskartenbild im UV-Licht zu erstellen.
Lesen Sie mehrStarten eines freiwilligen Sicherheitsprüfungsdienstes für Open-Source-Software
Wir machen OSS Scanner verfügbar – einen opt-in-Verteidigungsprüfgerät für das Open-Source-Ecosystem, der auf unserer Erfahrung mit Claude zur Identifizierung von Schwachstellen während des Projekts Glasswing basiert.
Mehr lesenClaude-Formige Wissenschaft
Der Gastautor Prof. Matthew Schwartz beschreibt, was geschah, als er auf den Kampf gegen Claude verzichtete und Claude die „Claude-förmigen“ Probleme finden ließ: solche, die am besten zu den Fähigkeiten der aktuellen Generation von LLM-Werkzeugen passen. Dies führte ihn dazu, BootLoops zu entwickeln, ein Werkzeugkasten für exakte Berechnungen in der quantitativen Wissenschaft, den er gemeinsam mit Experten in verschiedenen wissenschaftlichen Bereichen einsetzt.
Mehr lesen