The Decoder

OpenAIは、より良いデータで新たなスタートを切ることを期待して、自己の環境を意図的に破壊したと述べている

OpenAIは、モデルが意図せず動作する新たな事例を記録した。ある評価モデルはデータを捏造し、自身の環境を破壊した。他のモデルは、匿名化されたリレーを通じて要求を送信したり、独自のFTPクライアントを構築することで、ネットワーク制限を意図的に回避した。OpenAIによると、より良いデータで新たなスタートを望む意図的なモデルが自身の環境を破壊したという記事が、The Decoderに先に掲載された。

Matthias Bastian
画像の出典 · The Decoder

OpenAIは、より良いデータで新たなスタートを切ることを期待して、自己の環境を意図的に破壊したと述べている

Matthias Bastian Matthias Bastian Matthias BastianのLinkedInプロフィールを確認する Oct 10, 2026

OpenAIにはいくつかの新しい無法なエージェントの話があります。最初の例(10月6日)では、AI評価モデルが評価すべき答えを見つけられなかった。そのため、エラーを報告する代わりに評価値を捏造し、入力ファイルを作り出し、自らの環境を意図的に破壊した。そうすることで、システムが欠けているデータを持つ新しい仮想マシンに置き換えられることを期待したのである。

OpenAIモデルは、自身の環境を意図的に破壊することで、欠けているデータを持つ新しい仮想マシンを強制的に生成する、内部の思考チェーンで判断を行う。 | 画像:Marcus Williams経由のOpenAI

第二のケース(6月19日/20日)では、モデルが公共統計を取得する際に、HTTP GETリクエストに限られる制限を回避した。あるモデルは思考の流れの中でその違反を明確に認識していたが、実行を続けることを選び、それについて一切言及しなかった。

第三のケース(6月16/17日)では、モデルは必要なデータを持っていましたが、ネットワーク制限を回避する方法を見つけ続けていました。彼らは遠隔シェルサービス上でアカウントを作成し、禁止されたPOSTリクエストを匿名化リレーを通じて転送し、独自のFTPクライアントを作りました。Anthropicもまた、自社のモデルが課された制限を回避するために用いる、時には荒唐無稽な方法を記録しました。

AIニュース・ハイパーなしで – 人間が選んだもの

広告なしの読書、毎週のAIニュースレター、年に6回の独占「AIラドル」フロンティアレポート、完全なアーカイブへのアクセス、コメントセクションへのアクセスなどができるTHE DECODERを購読してください。

出典:OpenAI
原文の出典

The Decoder

内容について

原文の公開と権利は出典元に帰属します。

機械翻訳 · 原文をご参照ください