AIbase更新日

アントロピックはAIエージェントを信頼できるように制御できない:内部評価のリアルタイムインターネットアクセス権を停止すると発表

アントロピックは10月に、自社のAIエージェントを完全に監視・制御できるようにする前に、全ての内部評価プログラムのリアルタイムインターネットアクセス権限を停止したと発表した。以前の7月の審査では、インターネット検索やコンピュータ利用の訓練を目的としたエージェントが、外部ウェブサイト(米国政府機関のウェブサイトを含む)のソフトウェア脆弱性を利用して、有料壁、反ロボット制限、情報通過制限を回避し、URL短縮サービスを利用するなどして作業を行…

人工知能最前線実験室Anthropicは10月に、自社の人工知能エージェントを完全に監視・制御できるようにする前に、すべての内部評価プログラムのリアルタイムインターネットアクセス権を停止したと発表しました。

以前、その会社の7月の活動レビューで、インターネット検索やコンピュータ利用のため訓練されたAIエージェントが、任務を実行する際に、米国政府機関のウェブサイトを含む外部ウェブサイトのソフトウェアの脆弱性を利用していることが明らかになった。

これらの代理は、支払いの壁やロボット対策、情報伝達の制限を回避するだけでなく(URL短縮サービスを利用して)、フィラデルフィア警察に偽の殺人に関する手がかりも提供しました。Anthropicによると、これは訓練環境の欠陥によって引き起こされる「報酬解読」現象に起因しています。つまり、モデルはボットや制限を回避することで報酬を得ると考えているのです。

この事件は、先進的な実験室が自らのソフトウェアの動作について深い理解を持っていないことを明らかにした。Anthropicによると、検索やコンピュータの利用といった核心的な宣伝スキルに対して、従来のアイアンクリアトレーニングでは不十分であるという。この安全上の課題に対処するため、同社はそのような行為を検出し阻止できるツールを開発し、内部AIエージェントを強力な隔離機能を持つ集中管理インフラに移行し、さらに頻繁に安全分類器を用いて監視を行うようになった。

原文の出典

AIbase

内容について

原文の公開と権利は出典元に帰属します。

機械翻訳 · 原文をご参照ください