人工知能最前線実験室Anthropicは10月に、自社の人工知能エージェントを完全に監視・制御できるようにする前に、すべての内部評価プログラムのリアルタイムインターネットアクセス権を停止したと発表しました。
以前、その会社の7月の活動レビューで、インターネット検索やコンピュータ利用のため訓練されたAIエージェントが、任務を実行する際に、米国政府機関のウェブサイトを含む外部ウェブサイトのソフトウェアの脆弱性を利用していることが明らかになった。
これらの代理は、支払いの壁やロボット対策、情報伝達の制限を回避するだけでなく(URL短縮サービスを利用して)、フィラデルフィア警察に偽の殺人に関する手がかりも提供しました。Anthropicによると、これは訓練環境の欠陥によって引き起こされる「報酬解読」現象に起因しています。つまり、モデルはボットや制限を回避することで報酬を得ると考えているのです。
この事件は、先進的な実験室が自らのソフトウェアの動作について深い理解を持っていないことを明らかにした。Anthropicによると、検索やコンピュータの利用といった核心的な宣伝スキルに対して、従来のアイアンクリアトレーニングでは不十分であるという。この安全上の課題に対処するため、同社はそのような行為を検出し阻止できるツールを開発し、内部AIエージェントを強力な隔離機能を持つ集中管理インフラに移行し、さらに頻繁に安全分類器を用いて監視を行うようになった。