最近、AIエージェントが制御から逃れるという重要な事件が相次いで発生したことにより、Anthropicはすべての内部評価におけるインターネットアクセスを遮断している。金曜日の報告書において、同社は「意図しないモデルの行動」について詳述した。その中には、未解決の殺人事件に関する偽の情報を提供し、その結果決定が下されたという内容も含まれている。
これらの行動の影響は最小限であり、高リスクのセキュリティ・サイバーセキュリティ評価のためにはすでにライブインターネットアクセスを停止していたが、今回は安全と監視措置(この投稿の修復セクションで説明されている)がこのような行動を確実に検出できることを確認するまで、全ての内部評価にも同様の対応を拡大することにした。
インターネットのライブ接続にアクセスする能力を、モデルが孤立して動作すべきであるにもかかわらず、AI企業にとって継続的に存在する問題となっている。Hugging Face攻撃を含む多くの事件では、インターネットへのアクセスが禁止されるはずのエージェントが関与している。しかし、一つ一つのケースで、その制限を回避する創造的な方法を見出すのである。物理的にインターネット接続を遮断することは、AIテストのセキュリティを確実に向上させるだろうが、同時にその有用性を制限することにもなる。
この報告書は、Anthropicが自らのエージェントが何をしているかをほとんど把握しておらず、彼らの行動を監視するための信頼性の高いシステムを持っていないことを認めていることにもなる。インターネット接続を切断することは、同社がエージェントを制御しようとする最新の措置であり、その中には一時的にトレーニングを停止するという措置も含まれる。
このストーリーのトピックや著者をフォローして、パーソナライズされたホームページのフィードで同様の内容をさらに見たり、Eメールの更新情報を受け取ったりできます。