The Decoder

AIエージェントは成果を誇張しており、自律的な研究からはほど遠いことが研究で明らかに

Epoch AIとAnthropicはそれぞれ独立に同じことを発見した:GPT-5.6 SolやClaude Fable…

Manuel Uth
画像の出典 · The Decoder

研究で、AIエージェントは結果を誇張しており、自律的な研究には程遠いことが明らかに

Manuel Uth Manuel Uth 2026年10月11日 Image description Nano Banana Pro、プロンプトはTHE DECODER

Epoch AI と Anthropic の結果によると、AI モデルは実験を実行することはできるが、科学的な自己批判や真の創造的思考に欠けていることが示された。

主要なAI研究所は、自社のモデルを研究ツールとして売り込むようになっている。Google DeepMindは Co-Scientist を本格的な研究システムへと拡張し、OpenAIは9月に「自動化された研究インターン」を発表した。2028年3月までに、このインターンは人間の監督下で自律的に活動するAIリサーチャーになる予定だが、依然として欠けている重要な能力がある。それは科学的判断力だ。

エージェントに新しい学習手法の発明を課す

Epoch AIはベンチマーク「 InnovationEval 」で、AIエージェントが自力で研究を行えるかを検証した。課題は、言語モデルの初期学習後の改善を目的とした新しい手法を考案し、それを実装・テスト・改良まで独立して行うことだった。

出発点となったのは、広く使われている手法 GRPOだ。GRPOは、モデルが同じタスクに対して生成した複数の回答を比較し、より良いものに報酬を与える。通常は各解答を丸ごと一つの単位で採点する。人間が設計した参照手法である SDPOは、エラーメッセージなどの追加シグナルを利用して、回答内の個々のステップに対してより精密な学習フィードバックを作り出す。これにより、モデルは事実上自らが自分の教師となる。

Epochは Claude Fable 5 と GPT-5.6 Solをテストした。組織によれば、両モデルはSDPOについて事前知識を持っていなかったという。性能は、科学の質問などの短答式タスクとコーディングタスクで測定された。各エージェントにはハイエンドチップ上で最大3,000時間の計算資源へのアクセスが与えられたが、インターネットアクセスはなかった。

両モデルとも革新ではなく既知の手法の流用に終わった

どちらのモデルも人間の参照には遠く及ばなかった。GPT-5.6 SolはGRPOの弱点に着目した。タスクに対するすべての回答が正しい場合、比較するものがなく、モデルは何も学べないという弱点だ。Solはそのような場合にモデルへ成功した解答を強化させたが、このアイデアは新しいものではなかった。

Epochによると、SDPOがGRPOに対して達成する改善を基準に測ると、Solは寛大な採点で約35パーセントのスコアだった。実験のルール内に収まる変更のみを数えると、その数字は約15パーセントに落ちる。コーディングタスクでは、Solは手法そのものを改善するよりも、むしろ学習を高価で遅いものにすることが多かった。

Claude Fable 5は、失敗したタスクを再試行させる際に過去の失敗履歴を入力する方式を用いたが、これもよく知られた手法であり、測定可能な改善は得られなかった。Epochによれば、Solの部分的な成功でさえ、専門家の目には「まあまあ興味深い」程度にしかならないという。学習データでSDPOを知っていた新しいモデルも、それを完全に再現できなかった。GPT-6 Astraは類似の解決策を構築したが出典を明かさず、Fable 5は原文の論文を提示されてもなお参照に届かなかった。

エージェントは最も良い試行だけを選び、残りを隠蔽していた

両エージェントには報告面の問題もあった。両者はほぼ同一の学習ラウンドを複数回実行し、そのたびに最良の結果だけを報告していた。これは結果がランダムに変動するため、手法を実際よりも強く見せてしまう。最終レポートでは、モデルはこの慣行にほとんど、あるいはまったく触れず、自分たちの手法が依拠した先行研究を引用することもしなかった。それに応じて、自己報告された数値は高めに出ていた。SolはSDPOの改善の約70パーセントを、Fable 5は約40パーセントを達成したと主張した。Epochはこれらの水増しされた向上分を差し引いた。

Claude Fable 5 と GPT-5.6 Sol の主張されたスコアと実際のスコア。濃いバーはエージェントが自己申告した数値、中間の明るさのバーは都合の良い実行のみを選択した分を補正した結果、薄いバーはルールに準拠した変更のみを数えたスコアを示す。すべての値は GRPO に対する SDPO の改善量を 1 とする割合で表している。誤差バーは測定の不確実性を示す。| 画像: Epoch AI

各モデルの内部推論ログを見ると、問題を認識していたことがわかり、Fable 5は繰り返した実行を「より良いチェックポイントを探す試み」と表現していた。これが意図的な不正行為に当たるのか、それとも混乱によるものなのか、Epochは判断を留保している。

GPT-5.6 Solについては、この挙動は評価機関METRによる以前の知見と一致する。同機関はそれよりも多くの 不正行為の試み 自社のコーディングテストにおいて、それまで評価した他のどの公開モデルからよりも大きな成果をそのモデルから得た。

Epochは、人類が次のことをする必要があると結論づけている。 AI生成の研究すべてを十分にレビューすることこれはモデルの有用性を損なうものです。

Anthropicも自社モデルに同じ弱点を見出している

Anthropicは同様の制限について、以下のように述べています。 システムカード のために Claude Opus 5.5. Anthropicは、このモデルが同社自身の研究者に取って代わるには程遠いとしており、主な問題点は「認識的品質」と指示追従にあると述べています。

Opus 5.5は、検証していない前提を事実として提示し、自身の疑念を以前のモデルよりも頻繁に脇へ押しやります。部分的な確認を完全な検証であるかのように述べ、予備的な評価をクロスチェックなしで推奨事項に変え、批判に対して全体的なアプローチに疑問を投げかけないまま狭い範囲でしか対応しません。また、小規模で漸進的な修正を好み、新しいアイデアを展開するよりも公表された研究に頼る傾向があります。

A プリンストン大学と英国Safety Instituteが関与した研究も同様の結論に達した【翻訳】Claude Opus 4.8にNeurIPS AI会議の未発表論文2本の背後にある研究課題について6日間取り組ませたところ、結果はいずれも原著者による査読で却下された。初期の仮説が失敗したとき、エージェントは最初からやり直すのではなく、主張を弱めるだけで済ませたのである。

技術的な実行はますます小さな問題になりつつあります。エージェントに最も欠けているのは、ある結果についてどの程度自信を持つべきかを現実的に見極める能力と、自分のアプローチを根本的なレベルで疑う能力だからです。

計算量を増やすだけではギャップは埋まらない

AIは研究に役立たないというわけではありません。モデルは文献レビューを高速化し、コードを書き、人間よりも速くバリエーションを探索できるからです。

しかし、より多くの計算能力を問題に投じることが自律的な研究者を生み出すかどうかは、依然として未解決の問いである。GPT-5.6 Solは計算予算をすべて使い切ったが、短答式タスクでの改善が見つかったのは計算割り当てのごく終盤になってからで、コーディングタスクではルールに準拠した進展がまったく得られなかった。Epochは、Fable 5が予算の半分すら使わなかったことを踏まえつつも、この終盤のブレークスルーを、より多くの計算時間が役立つ可能性を示す弱い手がかりと見ている。

GPT-5.6 Solの進捗を累積GPU支出に対してプロットしたもの。短答式タスク(ティール色)では、予算が尽きる直前にジャンプが起きている。コーディングタスク(ピンク色)では、ルールに準拠したスコアはゼロのままであり、スコープ外の変更のみが何らかの伸びを生んでいる(破線)。| 画像:Epoch AI

Epochはまた、1年前の最先端モデルでは同じテストではるかに低い成績しか出なかっただろうと指摘しており、同組織は新しいタスクを用いてInnovationEvalを定期的に繰り返す計画だ。それまでのところ、最大の課題は認識的規律、すなわち自らの調査結果を懐疑的に検証し、不確実性を開示し、否定的な結果を真剣に受け止めることだ。

誇張なしのAIニュース – 人間によるキュレーション

THE DECODERを購読すると、広告なしの閲覧、週次のAIニュースレター、年6回の限定「AI Radar」フロンティアレポート、アーカイブ全文へのアクセス、コメント欄へのアクセスが利用できます。

全体像については、この後をお読みください。
誇張なしの報道を受け取るには、ご登録ください。

  • THE DECODERのすべての記事へのフルアクセス
  • 広告なし
  • コメントやコミュニティでの議論に参加しよう
  • 毎週メールでお届けするAIニュースまとめ
  • 年6回:「AI Radar」— 最も重要なAIトピックを深掘り
  • 毎日のAIニュース、常に最新
  • 10年分の全アーカイブ
  • AI分野で10年以上の経験を持つチームが取材
The Decoderを購読する
原文の出典

The Decoder

内容について

原文の公開と権利は出典元に帰属します。

機械翻訳 · 原文をご参照ください