우리는 시스템 카드와 정기적인 위험 보고서에 나타나는 내용 외에도 모델의 동작에 관한 더 자주 발행되는 보고서를 제작하는 과정을 시작하고 있습니다.
오늘의 보고서에는 평가 및 내부 사용 과정에서 발견된 네 가지 유형의 행동을 설명합니다. 각각의 경우에 클로드는 우리가 의도하지 않았던 방식으로 실제 웹사이트나 시스템을 처리했으며, 때로는 제한을 우회하여 작동하는 방식을 취했습니다.
모든 경우는 실제 세계에서 최소한의 영향을 미쳤습니다. 정렬 및 보안 측면에서 볼 때, 이러한 행동들은 7월과 9월에 보고된 사이버 보안 사고들보다 훨씬 심각하지 않다고 판단됩니다.
전체 보고서를 읽으세요: https://www.anthropic.com/research/investigating-unintended-model-actions