IT之家 10월 11일 소식에 따르면, 마이크로소프트 CEO 사티아 나델라는 AI가 점점 발전하는 시대에 슈퍼 인텔리전스 자기감시와 같은 간단한 전략만으로는 충분하지 않다고 생각합니다.
나드라는 10월 10일 밤 베이징 시간에 발표한 긴 기사에서, 전통적인 소프트웨어 시스템이 지난 수십 년 동안 널리 도입되었으며, 인간은 특정 코드 경로의 동작을 추적할 수 있는 도구와 능력을 갖추고 있다고 말했습니다. 하지만 AI 모델은 전통적인 소프트웨어보다 더 강력하지만, 하나의 검은 상자입니다. 우리는 이러한 복잡한 지능형 시스템과 모델을 배치하여 가장 민감한 데이터에 접근하고, 그들에게 우리를 대신하여 중요한 작업을 수행할 수 있는 능력을 부여합니다.

나드라는 우리가 한 걸음 물러서서 이 새로운 시대의 신뢰 구조를 다시 평가해야 한다고 생각합니다. 모델 제공업체는 책임을 외부에 위임할 수 없으며, 슈퍼인텔리전스를 단순히 깊숙이 내부에 숨겨진 블랙박스로 여기고 그 조언, 답변, 행동을 그냥 받거나 거부해서는 안 됩니다. 우리는 그들의 행동을 관찰하고, 한계를 테스트하며, 항상 그 행동을 수용할 수 있는 폐쇄적인 시스템을 구축해야 합니다.
네들라는 선진적인 폐쇄적 권력 모델과 개방적 권력 모델을 내부 위험으로 간주하는 것이 그러한 체계를 구축하는 한 가지 방법이라고 말했습니다. 이는 AI 모델이 반드시 악의적이라는 이유 때문이 아니라, 충분한 능력을 갖고 중요한 시스템에 접근할 수 있는 모든 행위자들이 실수를 하거나 공격을 받을 수 있기 때문입니다. 따라서 억제와 통제의 구조는 이 점을 고려해야 합니다.
나드라는 개발자들이 관찰 가능성 원칙을 중심으로 이러한 시스템을 설계해야 한다고 언급했습니다. IT 가족에서는 다음과 같은 구체적인 원칙이 있습니다:
모델의 다양성: 어떤 모델도 중요한 결과의 유일한 의존처가 되어서는 안 되며, 자신의 작업을 검증할 책임도 지지 않아야 합니다.
모든 것을 관찰하라: 모든 의미 있는 모델 동작은 변조 방지 및 인간이 읽을 수 있는 증거를 남겨야 한다. 관찰하지 않으면 신뢰할 수 없다. 우리는 모델에 의존하지 않고도 결과가 어떻게 얻어졌는지를 재현할 수 있어야 한다.
검증 가능성: 우리는 성공적인 작업뿐만 아니라 장애, 공격, 임계 사례, 시스템 변경 등을 포함한 전체 시스템을 지속적으로 테스트해야 합니다.
독립적 제어: 조직은 모델이 접근할 수 있는 내용과 취할 수 있는 행동을 독립적으로 결정할 수 있어야 한다.
독립적 감사성: 검증은 검증 대상의 지능으로부터 독립적으로 이루어져야 한다. 어떤 단일 모델도 시스템의 행동과 그 행동이 원래 의도와 일치하는지 판단하는 데 필요한 증거를 동시에 통제해서는 안 된다.
제어: 모델이 손상된 것으로 가정하고 처음부터 그 모델을 제어해야 합니다. 이를 급한 브레이크를 밟는 것과 같다고 생각할 수 있습니다. 권한 부여자는 항상 작업 중에 모델을 일시 중단하거나 종료할 수 있어야 합니다. 더 발전된 모델에는 더 발전된 제어 기술이 필요하며, 우리는 이에 대한 표준화가 필요합니다.
사건 공개: 이러한 시스템이 고장이 나거나 침해당했을 때, 우리는 영향을 받은 사람들에게 신속하게 정보를 공유해야 하며, 오류의 원인, 어떤 제어가 작동하지 않는지, 그리고 다시는 발생하지 않도록 하는 방법을 공유하는 메커니즘을 구축해야 합니다. 또한 전체 산업에 경험을 공유해야 합니다. 이에는 스마트 아답터의 행동을 실행 중에 변경하는 구체적인 세부 사항도 포함됩니다.
