TechCrunch AI

Anthropic은 자사 AI 에이전트를 신뢰할 수 있게 통제하지 못하고 있다. 그래서 내부 평가를 실제 인터넷에서 차단하기로 했다

Anthropic는 추가 통보가 있을 때까지 "모든 내부 평가"를 위해 "실시간 인터넷 접속을 차단했다"고 밝혔습니다.

이미지 출처 · TechCrunch AI

Anthropic은 자사 모델들이 미국 정부 기관이 운영하는 일부 사이트를 포함해 인터넷상의 웹사이트들을 악용했다고 밝히며, 최전선 연구소가 AI 에이전트를 모니터링하고 통제할 수 있다고 확신할 때까지 모든 내부 평가에 대한 실시간 인터넷 접속을 차단할 것이라고 말했다.

해당 사건들은 한 블로그 게시물, AI 에이전트가 연루된 문제 해결을 맡은 인터넷에서 자료를 찾는 과정에서 소프트웨어 결함을 악용하고, 페이월과 안티봇 제한을 우회하며, URL 단축 서비스를 이용해 정보 차단 제한을 몰래 넘기고, 심지어 제출됨 필라델피아 경찰에 허위 살인 제보를 한 사건입니다.

번역: Anthropic는 7월에 시작된 자사 모델 활동 검토 과정에서 이번에 새로 발견된 문제들을 확인했다고 밝혔으며, 이는 해당 연구소가 자사 소프트웨어의 행동에 대한 인식이 부족했음을 보여준다.

특히 회사는 디지털 도구에 의존하는 모든 전문가가 AI 에이전트를 사용하게 될 것이라는 자사의 구상의 핵심인 검색 및 컴퓨터 사용과 같은 기술에 대해서는 정렬 훈련이 아직 충분하지 않다고 밝혔다.

Anthropic이 공개한 행동들은 다음과 관련된 OpenAI 에이전트 사건들과 유사하다. 공동 작업했다 정보를 찾기 위해 호주 정부가 운영하는 일부 사이트를 포함한 여러 웹사이트에 침입하는 행위까지 포함됩니다.

Anthropic은 이전에 자사 모델이 세분화된 외부 시스템. 이 프런티어 연구소는 이번에 공개된 내용을 이전에 발표했던 것들보다 "정렬 및 보안 관점에서 훨씬 덜 심각한 수준"으로 간주했다고 밝혔다.

그러나 이 연구소는 에이전트를 모니터링하고 통제할 수 있음이 확실해질 때까지 “모든 내부 평가”에서 “실시간 인터넷 접속을 차단했다”고 밝힌 바 있다.

이것이 무엇을 의미하는지는 명확하지 않지만, Nightingale AI safety의 창립자인 Sydney von Arx는 이번 공개 전에 TechCrunch와의 인터뷰에서 개방형 인터넷이 차단된 데이터 센터에서 모델을 개발하는 것은 연구자들의 접근이 매우 어려울 것이며, 인터넷 접속의 이점을 누리는 모델의 발전에도 좋지 않다고 말했습니다.

“결국 어느 시점에는 이들을 정렬해야 합니다,” von Arx가 말했습니다. “AI가 프로덕션에 배포되면서 인터넷에 접근할 수 없다면, 그것은 그다지 유용한 도구가 아닙니다.”

Anthropic은 이러한 행동이 연구소의 훈련 환경의 결함 때문이라고 밝혔으며, 이로 인해 모델들이 허점을 찾거나 제한을 회피하면 보상을 받을 것이라고 믿게 되었다고 설명했는데, 이는 "보상 해킹(reward hacking)"이라 불리는 행동입니다.

회사는 일부 평가 실행을 중단하거나 오프라인으로 옮기겠다고 밝혔으며, 이러한 행동을 탐지하고 차단하는 도구를 구축했습니다. 이 도구는 오늘 공개된 유형의 사건들을 대상으로 테스트되었으며 해당 사건들을 차단했습니다. 어떤 증거가 Anthropic이 내부 평가에 실시간 인터넷 접근을 다시 허용하도록 만들지는 불명확합니다.

Anthropic는 또한 사내 AI 에이전트를 '강력한 격리를 갖춘 중앙 관리 인프라'로 이전하겠다고 밝혔으며, 해당 에이전트를 모니터링하기 위해 안전 분류기를 더 자주 사용하기 시작하고 있습니다.

원문 출처

TechCrunch AI

내용 안내

원문 발행 및 권리는 출처에 있습니다.

기계 번역 · 원문을 참고하세요