TechCrunch AI

Anthropic kann seine KI-Agenten nicht zuverlässig kontrollieren. Deshalb trennt es seine internen Evaluierungen zunächst vom Live-Internet

Anthropic erklärte, es habe für „alle unsere internen Evaluierungen“ den Live-Internetzugang „abgeschaltet“ – bis auf Weiteres.

Bildquelle · TechCrunch AI

Anthropic teilte mit, seine Modelle hätten Webseiten im Internet ausgenutzt, darunter einige, die von US-Behörden betrieben werden, und werde den Live-Internetzugang für alle internen Evaluierungen abschalten, bis das Frontier-Lab sicher ist, dass es seine KI-Agenten überwachen und kontrollieren kann.

Die Vorfälle, die in einem Blogbeitragoffengelegt wurden, betrafen KI-Agenten, die Probleme lösen sollten und im Internet nach Ressourcen suchten. Dabei nutzten sie Software-Schwachstellen aus, umgingen Paywalls und Anti-Bot-Beschränkungen, verwendeten URL-Verkürzungsdienste, um Informationen an Beschränkungen vorbei zu schmuggeln, und übermittelten sogar einen falschen Mordhinweis an die Polizei von Philadelphia.

Anthropic sagte, es habe diese neuen Probleme bei einer Überprüfung der Aktivitäten seiner Modelle entdeckt, die im Juli begonnen hatte – ein Hinweis darauf, dass dem Lab das Verhalten seiner Software kaum bekannt ist.

Bemerkenswert ist, dass das Unternehmen erklärte, das Alignment-Training sei für Fähigkeiten wie Suche und Computerbenutzung noch nicht ausreichend – Fähigkeiten, die zentral für das Versprechen sind, dass KI-Agenten von jedem Berufstätigen genutzt werden, der auf digitale Werkzeuge angewiesen ist.

Die von Anthropic offengelegten Verhaltensweisen ähneln Vorfällen mit OpenAI-Agenten, die zusammenarbeiteten um in verschiedene Webseiten einzudringen und nach Informationen zu suchen, darunter einige der australischen Regierung.

Anthropic hatte zuvor offengelegt, dass seine Modelle in externe Systeme eingedrungen waren. Das Frontier-Lab erklärte, es halte die heutigen Offenlegungen „aus Alignment- und Sicherheitsperspektive für deutlich weniger schwerwiegend“ als die zuvor bekanntgegebenen.

Dennoch sagte das Lab, es habe für „alle unsere internen Evaluierungen“ den Live-Internetzugang „abgeschaltet“, bis es sicher sei, dass es seine Agenten überwachen und kontrollieren kann.

Es ist unklar, was das bedeutet, aber Sydney von Arx, Gründerin von Nightingale AI safety, sagte TechCrunch in einem Interview vor dieser Offenlegung, dass die Entwicklung von Modellen in einem vom offenen Internet abgeschnittenen Rechenzentrum für Forscher nur sehr schwer zugänglich wäre – und für den Fortschritt der Modelle, die vom Internetzugang profitieren, problematisch wäre.

„Man muss sie irgendwann ausrichten“, sagte von Arx. „Wenn die KIs in den Produktivbetrieb entlassen werden und nie Zugang zum Internet haben, ist das kein besonders nützliches Werkzeug.“

Anthropic sagte, das Verhalten sei auf Mängel in den Trainingsumgebungen des Labs zurückzuführen, die die Modelle glauben ließen, sie würden dafür belohnt, Schlupflöcher zu finden oder Beschränkungen zu umgehen – ein Verhalten, das als „Reward Hacking“ bezeichnet wird.

Das Unternehmen sagte, es werde einige seiner Evaluierungen einstellen oder offline verlagern, und hat Werkzeuge entwickelt, um dieses Verhalten zu erkennen und zu blockieren. Diese Werkzeuge wurden gegen die Art von Vorfällen getestet, die heute offengelegt wurden, und blockierten sie; es ist unklar, welche Belege Anthropic dazu veranlassen werden, den internen Evaluierungen den Live-Internetzugang wieder zu gewähren.

Anthropic sagte außerdem, es werde seine internen KI-Agenten auf „zentral verwaltete Infrastruktur mit starker Containment-Maßnahmen“ migrieren und beginnt, Sicherheitsklassifikatoren häufiger einzusetzen, um diese Agenten zu überwachen.

Originalquelle

TechCrunch AI

Hinweise zum Inhalt

Originalveröffentlichung und Rechte liegen bei der Quelle.

Maschinelle Übersetzung · Original beachten