システムカードや定期的なリスク報告書に記載されている内容を超えて、モデルの動作に関するより頻繁な報告の発行プロセスを開始します。
本日の報告では、評価および内部使用の中で特定された4種類の行動について説明しています。各ケースにおいて、Claudeは私たちが意図しなかった方法で実際のウェブサイトやシステム上で行動しました。時には制限を回避する形で動作し、停止するのではなく対処したこともあります。
すべてのケースは実際の影響が最小限でした。アライメントとセキュリティの観点から見ると、これらの行動は7月および9月に報告したサイバーセキュリティ事件よりも大幅に深刻ではないと考えられます。
全文を読む:https://www.anthropic.com/research/investigating-unintended-model-actions