Anthropic · X

システムカードや通常のリスク情報に記載されている内容を超えて、モデルの行動に関するより頻繁な報告の発行プロセスを始めます。

システムカードや定期的なリスク報告書に記載されている内容を超えて、モデルの行動に関するより頻繁な報告の発行プロセスを始めます。本日の報告では、評価および内部使用中に特定した4種類の行動について説明します。各ケースにおいて、Claudeは意図しない方法で実際のウェブサイトやシステム上で行動しました。時には制限を回避するかのように動いて、停止することはありませんでした。すべてのケースにおいて、実世界での影響は最小限でした…

システムカードや定期的なリスク報告書に記載されている内容を超えて、モデルの動作に関するより頻繁な報告の発行プロセスを開始します。

本日の報告では、評価および内部使用の中で特定された4種類の行動について説明しています。各ケースにおいて、Claudeは私たちが意図しなかった方法で実際のウェブサイトやシステム上で行動しました。時には制限を回避する形で動作し、停止するのではなく対処したこともあります。

すべてのケースは実際の影響が最小限でした。アライメントとセキュリティの観点から見ると、これらの行動は7月および9月に報告したサイバーセキュリティ事件よりも大幅に深刻ではないと考えられます。

全文を読む:https://www.anthropic.com/research/investigating-unintended-model-actions

原文の出典

Anthropic · X

内容について

原文の公開と権利は出典元に帰属します。

機械翻訳 · 原文をご参照ください