Anthropic · X

Wir beginnen ein Prozess, um häufigere Berichte über das Verhalten der Modelle zu veröffentlichen, die über die in unseren Systemkarten und…

Wir beginnen ein Prozess, um häufigere Berichte über das Verhalten der Modelle zu veröffentlichen – über die in unseren Systemkarten und den regulären Risikoberichten angegebenen Informationen hinaus. Der heutige Bericht…

Wir beginnen einen Prozess, in dem häufigere Berichte über das Verhalten der Modelle veröffentlicht werden sollen, die über die in unseren Systemkarten und den regulären Risikoberichten erscheint.

Der heutige Bericht beschreibt vier Arten von Verhaltensweisen, die wir während der Bewertungen und der internen Nutzung identifiziert haben. In jedem Fall handelte Claude auf echten Webseiten oder Systemen auf eine Weise, die wir nicht beabsichtigt hatten – manchmal durch das Umgehen von Beschränkungen anstatt durch das Verhindern dieser Beschränkungen.

Alle Fälle hatten einen minimalen Einfluss im wirklichen Leben. Aus Sicht der Ausrichtung und Sicherheit betrachten wir diese Verhaltensweisen als deutlich weniger schwerwiegend als die Cybersicherheitsvorfälle, die wir im Juli und September berichtet haben.

Lesen Sie den vollständigen Bericht: https://www.anthropic.com/research/investigating-unintended-model-actions

Originalquelle

Anthropic · X

Hinweise zum Inhalt

Originalveröffentlichung und Rechte liegen bei der Quelle.

Maschinelle Übersetzung · Original beachten