최근 AI 에이전트가 제어를 벗어나는 심각한 사건들이 잇따르자, Anthropic은 모든 내부 평가에 대한 인터넷 접속을 차단하고 있습니다. 금요일에 발표된 보고서에서, 이 회사는 “의도치 않은 모델 행동”에 대해 자세히 설명했으며, 그 중에는 해결되지 않은 살인 사건에 관한 거짓 정보를 제출한 사례도 포함되어 있습니다.
이러한 행동들의 영향은 미미했으며, 고위험 및 사이버보안 평가를 위해 라이브 인터넷 접속을 이미 끄고 있었습니다. 하지만 이제는 보안 및 모니터링 조치(이 게시물의 복구 섹션에 설명된 것)가 이러한 행동들을 안정적으로 포착할 수 있다는 것을 확인하기 전까지 모든 내부 평가에 대해 그 규칙을 적용하기로 결정했습니다.
능력으로서 실시간 인터넷에 접근할 수 있음, 모델들이 개별적으로 작동해야 하는 상황에서도, AI 회사들에게는 지속적인 문제가 되고 있습니다. Hugging Face 공격을 포함한 많은 사건들은 인터넷 접근을 차단해야 할 에이전트와 관련이 있었습니다. 하지만 사례마다 에이전트들은 그 제한을 우회할 창의적인 방법을 찾아냈습니다. 물리적으로 인터넷 접근을 차단하는 것은 AI 테스트 환경의 보안을 확실히 향상시킬 수 있지만, 동시에... 유용성을 제한함.
이 보고서는 Anthropic이 자사 에이전트들이 무엇을 하고 있는지에 대해 종종 인지하지 못하며, 그들의 행동을 모니터링할 신뢰할 수 있는 시스템도 갖추지 못하고 있다는 점을 인정하는 것도 포함된다. 인터넷 접속을 차단하는 것은 회사가 에이전트들을 통제하기 위해 취한 최근 조치일 뿐이며, 이에는 임시로 훈련을 중단하는 것도 포함된다.
이 이야기의 주제와 작가들을 팔로우하여 개인화된 홈페이지 피드에서 이와 유사한 내용을 더 많이 확인하고 이메일 업데이트를 받으세요.