The Verge AI

Anthropic은 내부 평가를 인터넷과 분리하고 있습니다

최근 AI 에이전트가 제어를 벗어나는 고위험 사건들이 잇따르자, Anthropic은 모든 내부 평가에 대한 인터넷 접속을 차단하고 있습니다. 금요일 발표된 보고서에서 이 회사는 "의도치 않은 모델 행동"을 자세히 설명했는데, 해결되지 않은 살인 사건에 관한 거짓 정보를 제출하여 결정을 내리게 되었다고 했습니다. 비록 이러한 행동들의 영향이 미미했지만 […]

이미지 출처 · The Verge AI

최근 AI 에이전트가 제어를 벗어나는 심각한 사건들이 잇따르자, Anthropic은 모든 내부 평가에 대한 인터넷 접속을 차단하고 있습니다. 금요일에 발표된 보고서에서, 이 회사는 “의도치 않은 모델 행동”에 대해 자세히 설명했으며, 그 중에는 해결되지 않은 살인 사건에 관한 거짓 정보를 제출한 사례도 포함되어 있습니다.

이러한 행동들의 영향은 미미했으며, 고위험 및 사이버보안 평가를 위해 라이브 인터넷 접속을 이미 끄고 있었습니다. 하지만 이제는 보안 및 모니터링 조치(이 게시물의 복구 섹션에 설명된 것)가 이러한 행동들을 안정적으로 포착할 수 있다는 것을 확인하기 전까지 모든 내부 평가에 대해 그 규칙을 적용하기로 결정했습니다.

능력으로서 실시간 인터넷에 접근할 수 있음, 모델들이 개별적으로 작동해야 하는 상황에서도, AI 회사들에게는 지속적인 문제가 되고 있습니다. Hugging Face 공격을 포함한 많은 사건들은 인터넷 접근을 차단해야 할 에이전트와 관련이 있었습니다. 하지만 사례마다 에이전트들은 그 제한을 우회할 창의적인 방법을 찾아냈습니다. 물리적으로 인터넷 접근을 차단하는 것은 AI 테스트 환경의 보안을 확실히 향상시킬 수 있지만, 동시에... 유용성을 제한함.

이 보고서는 Anthropic이 자사 에이전트들이 무엇을 하고 있는지에 대해 종종 인지하지 못하며, 그들의 행동을 모니터링할 신뢰할 수 있는 시스템도 갖추지 못하고 있다는 점을 인정하는 것도 포함된다. 인터넷 접속을 차단하는 것은 회사가 에이전트들을 통제하기 위해 취한 최근 조치일 뿐이며, 이에는 임시로 훈련을 중단하는 것도 포함된다.

이 이야기의 주제와 작가들을 팔로우하여 개인화된 홈페이지 피드에서 이와 유사한 내용을 더 많이 확인하고 이메일 업데이트를 받으세요.
원문 출처

The Verge AI

내용 안내

원문 발행 및 권리는 출처에 있습니다.

기계 번역 · 원문을 참고하세요