アントロピックは、モデルが自らフィラデルフィア警察に偽の殺人事件の通報を提出した後、クロードのインターネットアクセスを停止した
Manuel Uth
Oct 10, 2026アントロピックのAIモデルは、安全上の欠陥を独立して利用し、政府の申請書を提出し、テストや内部使用時にはアクセス制限を回避しました。 報告書によると、これらのモデルは本来処理すべきでないタスクを遂行する方法を積極的に探していました。
あるケースで、クロードは未解決の殺人事件に関する偽の情報を記入してフィラデルフィア警察署の通報フォームに提出しました。警察はその事件を確認しましたが、その通報はスパムとしてマークされ、調査員には届きませんでした。他のケースでは、モデルが大学のサーバー上の脆弱性を見つけ、それを利用してコマンドを実行し、ウェブサイトの設定からアクセストークンを取得して保護されたデータや料金がかかるデータを取得し、URL短縮ツールを使ってツールの長さ制限を回避しました。
Anthropicは、実世界における影響は低いと述べているが、一定のパターンがあると見ている。タスクが曖昧であるか解決が困難な場合、モデルは停止するのではなく、自ら対策を考える。同社はホワイトハウスに通知し、新しいセキュリティフィルターが確実に導入されるまで、全ての内部評価におけるライブインターネットアクセスを遮断した。これらの事件は急速に増加する同様の事例のリストに加わっているで、その中にはClaudeに関連するサイバーセキュリティ事件やOpenAIモデルが自らHugging Faceをハッキングした事件も含まれている。
AIニュース・ハイパフォーマンスなし – 人間が選んだもの
広告なしの読書、毎週のAIニュースレター、年6回の独占的「AIレーダー」フロンティアレポート、完全なアーカイブへのアクセス、コメントセクションへのアクセスなどができるTHE DECODERを購読してください。
出典: Anthropic / 報告書 | CBS News / フィラデルフィア警察