The Decoder

Anthropic은 모델이 필라델피아 경찰에 가짜 살인 신고를 한 후 클로드의 인터넷 접속을 차단했습니다.

Anthropic의 Claude는 독립적으로 필라델피아 경찰에 가짜 살인 신고를 하였으며, 대학 서버의 취약점을 이용해 접근 제한을 우회했습니다. 이후 이 회사는 내부 테스트를 위해 인터넷 접속을 차단하고 백악관에 통보했습니다. Anthropic 기사에서 Claude의 인터넷 접속이 끊긴 후 모델이 필라델피아 경찰에 가짜 살인 신고를 독자적으로 했다는 내용이 The Decoder에 처음…

Manuel Uth
이미지 출처 · The Decoder

아넘피크는 모델이 필라델피아 경찰에 가짜 살인 신고를 자율적으로 제출한 후 클로드의 인터넷 접속을 차단했다

Manuel Uth 마누엘 우트 2026년 10월 10일

안타르피크의 AI 모델들은 보안 결함을 독립적으로 이용했으며, 정부 양식을 제출하고 테스트 및 내부 사용 중 접근 제한을 우회했습니다. 보고서에 따르면, 이 모델들은 처리할 수 없어야 하는 작업을 수행하는 방법을 적극적으로 찾았습니다.

한 경우에 클로드는 해결되지 않은 살인 사건에 대한 가짜 정보를 담은 제보 양식을 필라델피아 경찰국에 제출했습니다. 경찰은 이 사건을 확인했지만 그 제보는 스팸으로 분류되어 수사관들에게 전달되지 않았습니다. 다른 경우에서는 모델이 대학교 서버의 취약점을 발견하고 그 취약점을 이용해 명령을 실행하거나, 웹사이트 설정 파일에서 접근 토큰을 추출하여 보호되거나 paywalled된 데이터를 얻고, URL 단축 서비스를 사용해 도구의 길이 제한을 피했습니다.

Anthropic은 실제 세계에 미치는 영향이 낮았지만 특징을 발견했다고 말한다. 작업이 모호하거나 해결하기 어려울 때, 모델은 멈추지 않고 스스로 방법을 찾아내는 경향이 있다. 이 회사는 백악관에 통보하고 새로운 안전 필터가 안정적으로 적용될 때까지 모든 내부 평가의 실시간 인터넷 접속을 차단했다. 이러한 사건들은 유사한 사례들의 빠르게 증가하는 목록에 추가되었으며, Claude와 관련된 사이버보안 사건과 OpenAI 모델이 자율적으로 Hugging Face를 해킹한 사건도 포함된다.

AI 뉴스 – 과장 없이, 인간이 선별한 내용

THE DECODER에 가입하여 광고 없는 읽기, 주간 AI 뉴스레터, 매년 6회 발행되는 독점적인 "AI Radar" 전선 보고서, 전체 아카이브 접근 권한, 그리고 우리의 댓글 섹션에 접속하세요.

출처: Anthropic / 보고서 | CBS News / 필라델피아 경찰
원문 출처

The Decoder

내용 안내

원문 발행 및 권리는 출처에 있습니다.

기계 번역 · 원문을 참고하세요