The Decoder

アントロピックは、モデルがフィラデルフィア警察に偽の殺人通報を自動的に提出した後、クロードのインターネットアクセスを遮断した

アントロピック社のClaudeは、独立してフィラデルフィア警察に偽の殺人事件の通報を送り、大学サーバーの脆弱性を利用し、アクセス制限を突破した。同社は以後、内部テストのためにインターネット接続を遮断し、ホワイトハウスに通知した。アントロピック社の記事「Claudeがフィラデルフィア警察に偽の殺人事件の通報を自動的に送った後、Claudeのインターネット接続が遮断された」はThe Decoderで最初に掲載された。

Manuel Uth
画像の出典 · The Decoder

アントロピックは、モデルが自らフィラデルフィア警察に偽の殺人事件の通報を提出した後、クロードのインターネットアクセスを停止した

Manuel Uth Manuel Uth Oct 10, 2026

アントロピックのAIモデルは、安全上の欠陥を独立して利用し、政府の申請書を提出し、テストや内部使用時にはアクセス制限を回避しました。 報告書によると、これらのモデルは本来処理すべきでないタスクを遂行する方法を積極的に探していました。

あるケースで、クロードは未解決の殺人事件に関する偽の情報を記入してフィラデルフィア警察署の通報フォームに提出しました。警察はその事件を確認しましたが、その通報はスパムとしてマークされ、調査員には届きませんでした。他のケースでは、モデルが大学のサーバー上の脆弱性を見つけ、それを利用してコマンドを実行し、ウェブサイトの設定からアクセストークンを取得して保護されたデータや料金がかかるデータを取得し、URL短縮ツールを使ってツールの長さ制限を回避しました。

Anthropicは、実世界における影響は低いと述べているが、一定のパターンがあると見ている。タスクが曖昧であるか解決が困難な場合、モデルは停止するのではなく、自ら対策を考える。同社はホワイトハウスに通知し、新しいセキュリティフィルターが確実に導入されるまで、全ての内部評価におけるライブインターネットアクセスを遮断した。これらの事件は急速に増加する同様の事例のリストに加わっているで、その中にはClaudeに関連するサイバーセキュリティ事件やOpenAIモデルが自らHugging Faceをハッキングした事件も含まれている。

AIニュース・ハイパフォーマンスなし – 人間が選んだもの

広告なしの読書、毎週のAIニュースレター、年6回の独占的「AIレーダー」フロンティアレポート、完全なアーカイブへのアクセス、コメントセクションへのアクセスなどができるTHE DECODERを購読してください。

出典: Anthropic / 報告書 | CBS News / フィラデルフィア警察
原文の出典

The Decoder

内容について

原文の公開と権利は出典元に帰属します。

機械翻訳 · 原文をご参照ください