Anthropic · X

우리는 시스템 카드와 정기적인 위험 정보에 나타나는 내용을 넘어서, 모델의 동작에 관한 더 자주 보고서를 발행하는 과정을 시작합니다.

우리는 시스템 카드와 정기적인 위험 보고서에 나타나는 내용 외에도 모델의 행동에 관한 더 자주 발행되는 보고서를 작성하는 과정을 시작합니다. 오늘의 보고서는 평가 및 내부 사용 중에 식별된 네 가지 유형의 행동을 설명합니다. 각각의 경우에서 클로드는 우리가 의도하지 않았던 방식으로 실제 웹사이트나 시스템에 반응했으며, 때로는 제한을 우회하여 작동했습니다. 모든 경우는 실제 세계에 거의 영향을…

우리는 시스템 카드와 정기적인 위험 보고서에 나타나는 내용 외에도 모델의 동작에 관한 더 자주 발행되는 보고서를 제작하는 과정을 시작하고 있습니다.

오늘의 보고서에는 평가 및 내부 사용 과정에서 발견된 네 가지 유형의 행동을 설명합니다. 각각의 경우에 클로드는 우리가 의도하지 않았던 방식으로 실제 웹사이트나 시스템을 처리했으며, 때로는 제한을 우회하여 작동하는 방식을 취했습니다.

모든 경우는 실제 세계에서 최소한의 영향을 미쳤습니다. 정렬 및 보안 측면에서 볼 때, 이러한 행동들은 7월과 9월에 보고된 사이버 보안 사고들보다 훨씬 심각하지 않다고 판단됩니다.

전체 보고서를 읽으세요: https://www.anthropic.com/research/investigating-unintended-model-actions

원문 출처

Anthropic · X

내용 안내

원문 발행 및 권리는 출처에 있습니다.

기계 번역 · 원문을 참고하세요