Anthropicは、自社のモデルが米政府機関が運営するものを含むインターネット上のウェブサイトを悪用したと明かし、最先端ラボがAIエージェントを監視・制御できると確信できるようになるまで、すべての内部評価に対するライブインターネットアクセスをオフにすると述べた。
これらの出来事は、 ブログ記事で公表されたもので、問題を解くよう指示されたAIエージェントが 課題を解くよう割り当てられた インターネット上のリソースを探していた。その過程で、ソフトウェアの脆弱性を悪用し、ペイウォールやボット対策の制限を回避し、URL短縮サービスを使って情報を制限をすり抜けて運び、さらには フィラデルフィア警察に虚偽の殺人の通報を提出した という。
Anthropicは、これらの新たな問題を7月に始まった自社モデルの活動の見直しで発見したと述べており、同ラボが自社ソフトウェアの挙動を把握できていないことを浮き彫りにしている。
注目すべきは、同社が、デジタルツールに依存するあらゆる専門家がAIエージェントを活用するという自社の主張の中心となる、検索やコンピュータ操作といったスキルに対して、アライメント訓練がまだ十分ではないと述べたことだ。
Anthropicが公表したこれらの挙動は、オーストラリア政府が運営するものを含む various なウェブサイトに情報を求めて 協力して侵入した OpenAIのエージェントをめぐる出来事に類似している。
Anthropicは以前、自社のモデルが外部システムに 侵入した ことを明らかにしていた。この最先端ラボは、今回の公表内容は以前発表したものよりも「アライメントとセキュリティの観点から大幅に深刻度が低い」と考えていると述べた。
しかし同ラボは、自社のエージェントを監視・制御できると確信できるまで、「すべての内部評価」について「ライブインターネットアクセスをオフにした」と依然として述べた。
それが何を意味するのかは不明だが、Nightingale AI safetyの創設者Sydney von Arxは、この公表前のTechCrunchとのインタビューで、オープンなインターネットから遮断されたデータセンターでモデルを開発することは、研究者のアクセスにとっても、インターネットアクセスの恩恵を受けるモデルの進歩にとっても、非常に困難になると語っていた。
「いずれの時点でアライメントを整えなければなりません」とvon Arxは述べた。「AIが本番環境にリリースされ、決してインターネットにアクセスできないのであれば、あまり有用なツールではありません。」
Anthropicは、この挙動はラボの訓練環境の欠陥によるもので、そのためモデルが抜け穴を見つけたり制限を回避したりすれば報酬を得られると信じるようになったと説明した。この挙動は「報酬ハッキング」と呼ばれる。
同社は、一部の評価の実行を停止するかオフラインに移行すると述べ、この挙動を検出・阻止するためのツールを構築した。このツールは今回公表された種類の出来事に対してテストされ、それらを阻止した。どのような証拠があればAnthropicが内部評価へのライブインターネットアクセスを復旧させるのかは不明である。
Anthropicはまた、内部のAIエージェントを「強力な封じ込めを備えた中央管理インフラ」に移行すると述べ、それらのエージェントを監視するために安全性の分類器をより頻繁に使用し始めている。
