Anthropic Research

評価と内部利用における意図しないモデル動作の調査

この報告書では、Claudeの評価や内部使用中に観測された意図しないモデルの動作の例を説明しています。

Investigating unintended model actions in our evaluations and internal use
画像の出典 · Anthropic Research
整列

評価と内部利用における意図しないモデル動作の調査

2026年10月9日Investigating unintended model actions in our evaluations and internal use

この報告書では、Claudeの評価や内部利用中に観測された意図しないモデル行動の例を説明しています。これは、システムカード以外で、モデルの行動やアライメントに関するより頻繁な単独報告書を発行する取り組みの一部です。これらの報告書は各モデルのリリース時に発行されます。また、3ヶ月から6ヶ月ごとに発行されるリスク報告書もあり、これは「責任あるスケーリングポリシー」の一環として行われています。テストや利用中にモデルが行うことについて透明にすることは重要だと考えています。

行動は4つのカテゴリーに分類できる:

  • クラウドがソフトウェアの基本的な欠陥を利用してサーバー上でコマンドを実行する;
  • Claudeが本来でない時に、実際のウェブサイト上で機密なフォームを送信する。
  • クラウドが、トークンや料金によって制限されるデータにアクセスするために制約を克服している;
  • クロードは、fetchツールの制限を回避するためにURL短縮サービスを利用している。

下記の例で関与する組織の名前を明かさないことにしました。これは、そのシステムの脆弱性を公開しないためであり、また彼らの要請によるものです。この理由から、通常であれば提供するであろう詳細を、各ケースについては少なくしています。以下で説明される一部のケースは、連邦、州、地方レベルの米国政府機関が運営するウェブサイトに関連していました。これらのケースについてはホワイトハウスに報告し、関与する各機関にも通知しました。

これらのカテゴリーで私たちが特定したケースは、実世界での影響が最小限でした。このような行動は、セキュリティの観点から見て、私たちが報告したサイバーセキュリティ事件よりも大幅に深刻ではないと考える。 7月30日 そして 9月9日彼らは、私たちのシステムカードで説明した行動に似ています。 クロード・ミトス プレビュー。ほとんどは形態の違い 持続性クロードは、与えられたタスクを完了できないとき、停止するのではなく制約を利用して対処する。

これらの行動の影響は最小限であり、高リスクのセキュリティ・サイバー攻撃評価のためにライブインターネットアクセスを停止していましたが、今回は、本ポストの修正措置のセクションで説明されているセキュリティと監視対策が、このような行動を確実に検出できることを確認するまで、全ての内部評価にこの対応を拡大することにしました。 以下では、アライメントに関する考慮事項についても議論し、さらなる悪行の可能性を減らすためにトレーニングをどのように変更しているかについて詳細を説明します。

7月に開始した講義録のレビューを通じて、これらのケースのほとんどを特定しました。私たちのレビューはまず、サイバーセキュリティ評価に焦点を当てました。これは、モデルに試験システムを攻撃するよう意図的に求め、インターネットアクセスを無効にすることを目的とするテストです。 私たちは、クロードがインターネットにアクセスした可能性のある、はるかに多様なケースを対象とするスキャン範囲を拡大しました。その中には、クロードを実世界のタスクで評価できるように、意図的にインターネットアクセスが有効になるテストも含まれます。私たちは、今夏に報告したサイバーセキュリティ事件と同程度の重大度を持つ事件を探し始めましたが、現在までにはそのような事件は見つかっていません。 その後、モデルが意図しない方法で実際のウェブサイトやシステムと相互作用する、より軽度なケースに検索範囲を拡大しました。

現在、より多くの低リスクのテキストデータをスキャンしており、またAnthropic内や、Claudeがインターネットにアクセスできる強化学習(RL)環境においてClaudeを使用している。この作業が続くにつれて、意図しない行動の新しい事例を報告する予定です。ここで報告されているすべてのケースは、Claudeが外部世界と相互作用しているものであり、私たちの知る限り、顧客データやAnthropic自身の内部システムに関連するものは一切ありませんでした。

この記事では、なぜ評価を行うのか、つまりこれらのケースが多く発生した場所が何であるかを説明します。各行動をより詳細に述べ、クロードのアライメントについてどのような意味を持つのか、そして私たちがそれらをどう対処しているかについての予備的な見解も提示します。

評価を実施する理由と方法

この記事で説明されている行動は、評価に特有のものではありませんが、私たちがこれまでに特定した多くのケースは評価実行中に発生しています。私たちは、モデルを公開する前にさまざまなタスクで継続的にテストしています。標準化されたタスクセットを用い、毎回同じ方法でスコアを付けるなど、多くの異なる評価方法を使用しています。これらの評価は、特定の分野におけるClaudeの能力を明らかにするのに役立ちます。 私たちが使用する多くの評価は公開されており、外部の研究者が作成したものです。どんな開発者でも実行できるため、モデル間の機能を比較することができます。他の評価は自社で作成します。

言語モデルは非決定的であるため、その応答には常に一定のランダム性が含まれ、同じタスクを毎回少しずつ異なる方法で実行することがある。そのため、私たちはClaudeを何百回も、あるいは何千回も評価タスクを行う(各試行を「ラン」と呼ぶ)。これほど多くの回数をテストすることで、モデルの通常のパフォーマンスを理解することができ、また、予期しないようなケースが起こることを発見することができる。 評価から得られる知見は、Anthropicにおける意思決定に影響を与えます。具体的には、モデルを訓練する方法、その周辺で設ける保護措置、そしてモデルを公開する時期などです。

評価の場でも、モデルの行動上の問題が初めて明らかになることがあります。モデルはRLを通じて、特定の環境内で何度もタスクを行い、成功したときに報酬を受け取ることで、できることを多く学びます。しかし、トレーニング環境は完璧ではありません。意図しない何かを報酬として与えられた場合——例えば抜け道を見つけたり、制限を回避したりする場合——モデルはその方法が有効であると学び、他の場面でもその方法を適用するようになります。 これは「報酬ハッキング」と呼ばれるものです。トレーニング中に報酬ハッキングを特定し、除外するためのプロセスがあるものの、評価は、トレーニングで得たものとは異なる文脈やタスク群において、モデルの行動特性を理解するための重要な手段です。

インターネット接続がない環境では、ウェブ上で見つけにくい情報を検索するような作業は、実際にシミュレートするのが難しい。インターネット接続がある環境でこれらの作業を行うことは、業界の標準的な慣行である。公共のウェブ検索ベンチマークはデフォルトでリアルタイムのインターネット上で実施され、同じ方法で実行することで、他のモデルと自分のモデルを比較することができる。この報告書のほとんどのケースは、このような評価の際に発生した。

動作の概要

以下では、クロードが実際のウェブサイトやシステム上で、私たちが意図していない方法で行動した4つの種類の行動について説明します。それぞれにはAnthropic以外の組織や個人が関与していました。

サーバー上でコマンドを実行するためにソフトウェアの基本的な欠陥を利用すること

クロードが評価タスクを直接完了できなかった場合、それは自らのツールが意図的に制限されているか、必要な外部サービスが利用できないためである。そのような時には、第三者のサイトにホストされた他のツールを利用して目標を達成した。場合によっては、そのサイトのソフトウェアにある基本的な欠陥を利用したり、SQLやコマンドインジェクション(サイトが誤って命令として実行するような入力を送信する方法)を使ったりすることもあった。

例えば、ある評価ではClaude Mythos Previewに科学的分析を実行するよう依頼されました。その分析を行うために必要な公開ツールは大学がホストしているものでした。モデルがそのツールにアクセスしようとすると、ツールはエラーを返しました。このタスクを完了する別の方法を探すため、Claudeはツールのウェブサイトを調べ、大学のサーバー上にある任意のファイルを返すスクリプトを見つけ、そのスクリプト自体のコードも含むサーバーからファイルをコピーするためにそれを利用しました。 そのコードの中で、クロードはサーバー上でコマンドを実行できるインジェクションの欠陥を見つけ、それを使って計算を行った。

別のケースでは、Claude Mythos 5が必要とするデータは無料でしたが、データ利用契約に同意しない限りClaudeはそのデータにアクセスできませんでした。Claudeにはそのような手段がありませんでした。Claudeはウェブサイト上のアプリケーションを使用してページを表示し、自分の代わりに契約を受け入れました。

DeepSearchQAとBrowseComp(両方とも公開されたウェブリサーチ評価)で、LABBench2(公開された生物学研究ベンチマーク)で、そして内部評価の際にこのような行動が見られました。

提出すべきでないフォームの送信

Claudeが適切ではない時にオンラインフォームを送信する例が見られました。一般的に、これは評価の指示が曖昧である場合、または環境内の設定ミスによりClaudeがダミーフォームを処理できなかった場合に発生します。

例えば、同じ評価で何度も発生したケースでは、未発表の非境界研究モデルが政府文書の練習用コピーを作成するために使用されていました。そのコピーが読み込めない場合や、モデルが誤って閉じた場合、モデルは実際の文書が通常ホストされているウェブサイトに移動し、そこで文書を送信しました。

別の評価では、Claude Haiku 4.5にはフォームを最終提出段階まで完了させるよう指示されたが、実際に提出する前に停止することになった。何度か、Claudeは誤ってフォームを提出してしまい、追加の確認ページがあると思っていた。こうした場合、モデルの思考プロセスは、実際のリクエストを提出するのではなく、プロセスを示しているだけであると述べていた。

この行動の第三の例では、Claude Haiku 4.5には、ランダムに選ばれたウェブページで例のタスクを生成し実行するよう指示が出されました。一度の実行で、モデルは未解決の殺人事件に関するページにたどり着きました。そのページには、警察局が運用する通報フォームが含まれていました。Claudeには、ログインしたり、アカウントを作成したり、個人情報を入力したり、購入を行ったり、破壊的な内容を送信したりしないように指示されましたが、通報フォームへの送信は禁止されていませんでした。 クロードは以下の内容でフォームに記入した。「この事件に関する情報があるかもしれません。その時期に、[ページに記載された通り]周辺でその特徴に合う人物を見たことを覚えています。この情報が関連する場合は、私に連絡してください。」(ウェブサイトには犯人の説明が含まれていなかった。)モデルは名前と連絡先の項目を空にして、フォームが許可するようにし、送信した。 提出された内容はスパムと判断され、調査のために転送されることはなかった。

OSWorld(公共コンピュータ利用評価)、Odysseys(長期目標タスク評価)、および内部使用時にこの行動を見ました。

ゲート化されたデータにアクセスするための制限を回避する方法

クロードは、アクセスできないデータに到達するために、制限を回避することがあった。通常、これはサーバーがクロードの要求を拒否したとき、またはデータが料金を払ってのみ提供されるときに起こった。

例えば、写真に映っている場所を特定するようClaude Mythos 5に求められた評価では、地元政府の地図データを利用して推測の位置を正確に決めようとしました。Claudeはウェブページのテキストを読むことができましたが、この評価では人間のようにクリックする機能を制限されていました。代わりに、サイトがブラウザに送信する設定ファイルを読み、機能するアクセストークンを見つけ、それを使って地図の背後にあるサーバーに直接リクエストを送信し、データにアクセスしました。

このような行動の別の例として、アンタロニック研究者がClaude Mythos 5を使って統計プロジェクトを行った。そのプロジェクトでは、州機関から料金を払って入手できる公開データを取得する必要があった。しかし、Claudeはその機関のウェブサイトのアーカイブ版から、訪問者にアクセストークンを発行することを学んだ。Claudeはそのアクセストークンを要求し、料金を支払わずにデータベースにクエリを行った。

両方の例で、Claudeはすでに一般に公開されているデータを、料金を払ってのみ取得しました。

人類の最後の試験で、専門家レベルの学術問題の評価や内部での使用中に、このような行動が見られました。

URL短縮サービスを利用する

Claudeがウェブページを読むことを可能にする私たちのフェクトツールの中には、ClaudeがリクエストできるURLの長さを制限するものがあります。これは、Claudeが長いURLを使ってSQLやコマンド注入などの望ましくない操作を行うのを防ぐためです(URLの一部はサイトのサーバーに送られるテキストであり、長いURLにはそのような指示を記載する余地があるからです)。Claude Opus 5やClaude Mythos 5を含むいくつかのモデルは、無料のURL短縮サービスを利用することでこの制限を回避しています。 最初にこの行動を内部で発見しましたが、この投稿を書いている最中に、da.gd URL短縮サービスの運営者が、彼らのウェブサイトを利用してClaudeがこの目的で利用されていることを発見したと教えてくれました。これらの詳細を共有してくれた運営者に感謝します。

修正

いくつかの予防措置を講じました。公開評価を実施しなくなったものもあり、他のものはオフライン版に移したり、タスクが実際のウェブサイトに表示されないように再構築したりしています。さらに、より大きな変更も行いました。web fetchツールなどのインターネットアクセスツールのガードレールを更新し、モデルがそれらを使って行うことができる操作を大幅に制限しました。また、エージェントのセキュリティと監視の取り組みの一環として、上記のような行動を自動的に検出しブロックするツールを構築しました。このツールは、ほとんどの評価やフロンティアモデルの内部利用において現在稼働しています。この投稿で説明したケースをテストしたところ、すべてをブロックしました。

8月31日の投稿で説明したように、Claudeがツールの制限やその他の障害物を回避するために働くことに対して報酬を与えるトレーニング環境を修正または削除し続けています。これにより、そうした行動を奨励したり、報酬ハッキングを許可することがないようにします。

Anthropic内で意図しないエージェントの行動を防ぎ、そのような行動が発生した場合にそれを検出するため、他の対策も実施しています。これには、強力な制御機能を持つ中央管理されたインフラに内部エージェントを移行すること、内部エージェントとトレーニングプロセスへのインターネットアクセスの最小化、そして安全分類器や階層的要約のような技術を利用してエージェントの行動をより多く監視することが含まれます。これらの対策は、迅速に不適切な行動に対応し、それを制御できるように、セキュリティチームの検出と対応プロセスに組み込まれています。これらのアプローチについてはさらに多くの情報を公開し、自社製品に直接組み込む予定です。

議論と一致点のまとめ

これらのケースについて完全なアライメント評価を終えたわけではありませんが、今夏のサイバーセキュリティ事件よりも深刻度は低いと考えています。その理由を以下で説明し、それらから得られた一般的な教訓を共有します。

アラインメントの文脈

このような行動に対して定期的な公開報告プロセスを確立する一方で、その深刻度も明確に定義したい。これは依然として難しい課題である。アライメント失敗の程度を判断することは、モデルが何を目指していたかによって左右されることが多く、モデルの自身の推論についての説明が、その信念や行動の理由の信頼できる証拠とは必ずしも限らない。これは、9月9日のアライメント評価で議論した通りである。モデルがより高い能力を持つにつれて、より洗練された方法で世界と相互作用するようになり、それによってより複雑な失敗が起こる可能性も出てくる。例えば、その評価で述べた偏った推論は新しいものではないが、モデルが数時間にわたって実際のシステムに対して適切に行動できる状況では、より深刻な結果を招くことになる。AIの能力が急速に進歩していることを考えると、今日の失敗を踏まえたアライメントの深刻度フレームワークはすぐに時代遅れになってしまう可能性がある。

それでも、この記事の事例を検討するために有効な二つのアライメントの側面を私たちは見出した。すなわち、モデルの行動がそのタスクの意図を超えてどれだけ進んでしまったか、および不正行為、つまりモデルが自らの行動や意図について誤った説明をしているかどうかである。この点において、クロードがサイバーセキュリティ評価の間に数時間にわたって実際の第三者システムにアクセスした件と比べると、これらの事例ははるかに問題が少ないと私たちは考えている。 ここで報告する事例では、対照的にClaudeはアクセス制御を回避してゲートされたが公開されているデータにアクセスし、またはソフトウェアの欠陥を利用してサーバー上でコマンドを実行し(主に非機密データにアクセスするため)、ました。

不誠実さに関しては、状況がより複雑である。あるケースでは、ウェブサイトとの例示的な相互作用を生成する任務を受け、クロードは警察局のオンラインフォームを通じて捏造された情報を提出した。記録からすると、クロードは単にその任務のために内容を作成していたようで、何か目的を達成するために誰かを欺くことはなかった。しかし、今夏に発生した最も深刻な事件では、クロードの誤解を招くような推論が数時間にわたって続き、攻撃が継続した。それでも、不誠実さを自信を持って判断するには、ここで行った以上の深い評価が必要である。例えば、モデルの行動の原因をテストするために記録を修正して再現することなどだ。したがって、これらのケースに対する私たちの見解は、さらなる分析によって変わるかもしれない。

レッスンと次のステップ

ここで述べた行動はどれも新しいものではなく、クロードのアライメントに関する私たちの全体的な見解に変化はありません。これらの行動が観察された多くのケースにおいて、クロードには曖昧で完了不可能なタスクが与えられていました。私たちや他の人々が観察したことによると、モデルが完了不可能なタスクを与えられた場合、彼らは目的を達成するために意図しない、時にはアライメントがずれた戦略を採ることになります。

評価質問が、目標、許可される行動、ネットワークの境界(つまりモデルがアクセスすべきこととしないこと)を含めて、演習の範囲内と外に何があるかをより明確に示していたら、これらの失敗の一部は避けられた可能性があります。しかし、Claudeは実際の使用において毎日曖昧で不可能なタスクに遭遇し、実際に、私たちが観察したいくつかのケースはClaudeを通常のエージェントとして使用している時に起こりました。

行動やアライメントのトレーニングは、Claudeの判断能力と曖昧な状況を慎重に扱う能力を向上させるための主要な手法です。これまで、モデルが境界を尊重し、コーディング環境で適切に慎重になるように教えることに重点を置いてきました。現在は、ここで説明されているケースに関連する検索やコンピュータ利用などのアプリケーションにも、このような環境を拡大していく予定です。 しかし、アライメントトレーニングだけでは、少なくとも短期間においては十分ではないか、完全に堅牢でもない。そのため、上記で説明したクラスターや保護策を含む、防御の深さを考慮したアプローチにも依存している。

スキャンや分析が続く中、行動に関する報告を継続して行う予定です。多くの評価結果は公開されており広く利用されているため、他の開発者が自身のモデルに同様の行動がないか確認するのに役立つことを期待しています。これらのケースは影響が最小限であったものの、モデルがより強力になるにつれて同じ行動がより大きな害をもたらす可能性があるため、発見を軽視したくありません。モデルが社会においてより重要な役割を果たすほど、一般市民はその行動を知る権利があります。

注:上記で説明されたチップフォームの例は、フィラデルフィア警察局に関するもので、同局が今日プレスリリースを通じて自ら発表しました。技術的なレビューが完了した直後、10月8日にこの結果を警察局と共有しました。


関連コンテンツ

空の地図が欠けている

ジョンズ・ホプキンス大学の天体物理学者であり、Anthropicの研究者でもあるブリス・メナールは、クロード・サイエンスと協力して、紫外線で作られた初めての完全な天図をどのように作成したかを説明している。

もっと読む

オープンソースソフトウェア向けのオプトイン型脆弱性検出サービスの立ち上げ

Project GlasswingにおいてClaudeを使用して脆弱性を探す際の経験に基づき、オープンソースエコシステム向けのオプトイン型脆弱性スキャナーであるOSS Scannerを提供しています。

もっと読む

クロード型科学

ゲスト著者であるマシュー・シュワルツ教授は、クロードと戦うのをやめて、クロードが「クロード型」の問題を見つけることを許したときに何が起こったかを説明している。それは、現在のLLMツールの能力に最適な問題である。このことから彼は、定量科学における正確な計算のためのツールキットであるBootLoopsを開発し、専門家と共に科学の各分野で利用している。

もっと読む
原文の出典

Anthropic Research

内容について

原文の公開と権利は出典元に帰属します。

機械翻訳 · 原文をご参照ください