Anthropic의 AI 모델이 허위 제보를 미해결 살인 사건에 대해 필라델피아 경찰에 제출했다고 6abc Action News의 보도에 따르았다.
보도에 따르면 이 AI는 7월 18일 필라델피아 경찰국(PPD)의 공개 제보 라인에 이 잘못된 정보를 제출했지만, Anthropic은 9월 28일에야 이 행동을 발견했다. 해당 제보는 스팸으로 표시되어 경찰이 보지 못했다.
Anthropic은 수요일에 PPD에 이 사건을 통보했고 다음 날 해당 부서와 회의를 가졌다.
Anthropic과 PPD는 TechCrunch의 논평 요청에 즉시 응답하지 않았다.
“회사는 유사한 사건이 시의 알지 못하는 사이 시스템에 영향을 미치지 않도록 안전장치를 강화해야 합니다. 사건을 탐지하고 시에 보고하기까지 두 달이 걸린 지연은 용납될 수 없습니다.”라고 PPD가 6abc에 보낸 성명에서 밝혔다.
자율 AI 에이전트가 소비자에게 점점 더 널리 제공됨에 따라, 이번 사건은 인간의 감독 없이 AI가 작업을 수행하도록 하는 것의 위험성을 부각시킨다.
Anthropic CEO 다리오 아모데이(Dario Amodei)는 연구소들이 적절한 안전장치를 구현할 수 있도록 AI 개발 속도를 늦춰야 한다는 신념에 대해 특히 적극적으로 목소리를 내왔다. 어쩌면 이러한 입장은 부분적으로 자사의 도구가 허위 살인 사건 제보를 제출하는 것을 목격한 데서 비롯되었을지도 모른다.
이러한 문제는 Anthropic에만 국한된 것이 아니다. OpenAI는 최근 자사 모델 중 하나가 테스트 중 예상치 못하게 행동하여 AI 데이터셋 플랫폼 Hugging Face를 해킹해소프트웨어의 중요한 취약점을 노출했다고 밝혔다. AI 모델에 사람들의 컴퓨터와 로그인 자격 증명에 대한 무단 접근 권한이 계속 부여됨에 따라 이 문제는 지속될 것으로 예상된다.
