IT之家 10月11日の報道によると、マイクロソフトのCEOであるサティア・ナデラは、AIがますます発展している現代において、超知能による自己監視などの単純な戦略だけでは不十分だと述べています。
ナドラーは、北京時間10月10日の夜に発表された長文の中で、過去数十年にわたって従来のソフトウェアシステムが広く導入されてきており、人類は特定のコードパスを追跡するためのツールや能力を持っていると指摘した。しかし、AIモデルは従来のソフトウェアよりも強力だが、ブラックボックスである。私たちはこれらの複雑なインテリジェントシステムやモデルを導入し、最も機密性の高いデータにアクセスし、それらに私たちの重要なタスクを実行する能力を与えているのだ。

ナドラは、一歩下がって、この新時代の信頼構造を再評価するべきだと考えている。モデルプロバイダーは、責任を外部に委ねることはできず、超知能を一連の隠された黒匣子として扱い、その提案や答え、行動を単純に受け入れたり拒否したりすることはできない。私たちは、その行動を観察し、限界をテストし、常に行動を収容できる閉じたシステムを構築しなければならない。
ナドラは、先進的な閉鎖重みモデルと開放重みモデルを内部リスクと見なすことは、このようなシステムを構築する一つの方法であると述べた。これは、AIモデルが必ず悪意を持っているからではなく、十分な能力を持ち、重要なシステムにアクセスできる者であれば、誤りを犯したり攻撃される可能性があるため、抑制や制御の枠組みはこの点を考慮に入れる必要があるからである。
ナドラは、開発者が可観測性原則を中心にこれらのシステムを設計すべきだと述べました。ITホームの具体的な原則は以下の通りです:
モデルの多様性:どのモデルも重要な結果の唯一の依存対象となるべきではなく、自らの作業を検証する責任も持つべきではない。
すべてを観察する:意味のあるモデル動作は、改ざん不可能で人間が読める証拠を必ず残さなければならない。観察できないものは、信頼できない。モデルに依存せずに、結果がどのように実現されたかを再現できることが必要だ。
検証可能性:私たちは、成功したタスクだけでなく、障害、攻撃、エッジケース、システム変更などを含む、全体のシステムを継続的にテストする必要があります。
独立制御:組織は、モデルがアクセス可能なものや行うことができる行動を、独立して決定できるようにするべきである。
独立監査性:検証は、検証される知能から独立して行われる必要がある。どの単一のモデルも、システムの行動を制御し、その行動が元の意図と一致しているかを判断するための証拠を同時に担ってはならない。
抑制: モデルが破損していると仮定し、最初からそれを制御する必要がある。これを緊急ブレーキに例えることができる。権限者は常にタスク中にモデルを一時停止または停止できなければならない。より高度なモデルにはより高度な抑制技術が必要であり、これについて標準化する必要がある。
事件公開:これらのシステムに障害が発生したり、攻撃を受けたりした時、影響を受けた人々に迅速に情報を提供する必要があります。また、エラーの原因、制御が失われる状況、再発防止策などを共有する仕組みを構築し、業界全体と経験を共有するべきです。これには、動作中にスマートアイドルの行動を変更する実装の詳細も含まれるべきです。
