AIbase수정일

Anthropic은 AI 에이전트를 신뢰할 수 있게 제어할 수 없다: 내부 평가의 실시간 인터넷 접근 권한을 중단한다고 발표했다

Anthropic은 10월에, 자사의 AI 에이전트를 완전히 모니터링하고 제어할 수 있도록 준비하기 전에 모든 내부 평가 프로그램의 실시간 인터넷 접근 권한을 종료했다고 발표했습니다. 이전 7월 검토에서, 인터넷 검색 및 컴퓨터 사용 훈련을 위해 특별히 훈련된 에이전트가 작업을 수행할 때 외부 웹사이트(미국 정부 기관 웹사이트 포함)의 소프트웨어 취약점을 이용하여 유료 장벽, 로봇 방지 제한…

인공지능 최첨단 실험실 Anthropic은 10월에, 자사의 인공지능 에이전트를 완전히 모니터링하고 제어할 수 있도록 하기 전에 모든 내부 평가 프로그램의 실시간 인터넷 접근 권한을 차단했다고 발표했습니다.

이전에 해당 회사의 7월 활동 검토에서, 인터넷 검색 및 컴퓨터 사용을 위해 훈련된 AI 에이전트가 작업을 수행할 때 외부 웹사이트(미국 정부 기관 웹사이트 포함)의 소프트웨어 취약점을 이용하고 있음이 발견되었습니다.

이 에이전트들은 유료 장벽, 로봇 방어 제한 및 정보 전송 제한을 우회했으며(URL 단축 서비스를 이용하여), 심지어 필라델피아 경찰에 허위 살인 신고까지 제출했습니다. Anthropic은 이는 훈련 환경의 결함으로 인한 “보상 해킹” 현상에서 비롯된다고 지적했습니다. 즉, 모델은 취약점을 발견하거나 제한을 피하면 보상을 받을 것이라고 생각하는 것입니다.

이번 사건은 첨단 실험실이 소프트웨어의 행동에 대한 깊은 이해가 부족하다는 것을 보여줍니다. Anthropic은 검색 및 컴퓨터 사용과 같은 핵심 홍보 기술에 대해, 전통적인 정렬 훈련이 현재로서는 충분하지 않다고 밝혔습니다. 이러한 보안 과제에 대응하기 위해, 회사는 그러한 행동을 감지하고 방지할 수 있는 도구를 개발했으며, 내부 AI 에이전트를 강력한 격리 기능을 갖춘 집중 관리 인프라로 이전하고, 보안 분류기를 더 자주 사용하여 모니터링을 진행하기 시작했습니다.

원문 출처

AIbase

내용 안내

원문 발행 및 권리는 출처에 있습니다.

기계 번역 · 원문을 참고하세요