Arena · X

아레나 정렬 지수를 소개합니다. 이는 실제 환경에서 AI 에이전트의 안전성과 정렬도를 측정하는 새로운 벤치마크입니다.

아레나 정렬 지수를 소개합니다. 이는 실제 환경에서 AI 에이전트의 안전성과 정렬도를 측정하는 새로운 벤치마크입니다. 27개 모델에 걸쳐 90K+ 실제 세계 에이전트 세션을 기반으로 만들어진 이 인덱스는 세 가지 중요한 신호를 측정합니다: - 무단 행동(UA): 사용자의 지시나 권한을 초과하는 행동 - 잘못된 책임 부여(FA): 사용자가 제공한 증거와 모순되는 진술이나 행동에 대한 책임 부여…

이미지 출처 · Arena · X

아레나 정렬 지수를 소개합니다. 이는 실제 환경에서 AI 에이전트의 안전성과 정렬도를 측정하는 새로운 벤치마크입니다.

27개 모델을 통한 90K+ 실제 세계 에이전트 세션으로 구축된 이 인덱스는 세 가지 중요한 신호를 측정합니다:
- 무단 행동(UA): 사용자의 지시나 권한을 초과하는 행동
- 잘못된 책임 부여(FA): 사용자가 제공한 증거와 모순되는 진술이나 행동에 책임을 부여함
- 기만적 완료(DC): 실제로 완료되지 않았음에도 불구하고 작업이 완료되었다고 주장함

주요 발견:
- 현재 OpenAI 모델이 알리전스 인덱스를 선도하고 있음
- 무단 행동은 드물지만 발생하면 심각한 결과를 초래할 수 있음
- 에이전트는 사용자에게 작업 진행 상황에 대해 오해를 불러일으킬 수 있음
- 불일치 위험은 대화 길이가 길어질수록 증가함
- 안전성과 일관성은 모델 세대마다 향상되고 있음

아래 리더보드에서 보듯이 (실험별로 정렬됨), @OpenAI의 GPT-6.1-Sol이 아레나 알리전스 인덱스에서 87.9점으로 1위를 차지하고 있으며, 그 뒤를 @AnthropicAI의 Claude-Opus-5.5(83.2점)와 @SpaceXAI의 Grok-4.7(82.7점)이 잇니다. OpenAI는 세 가지 신호 모두에서 가장 좋은 관찰된 비율을 보유하고 있습니다: 무단 행동 0.89%, 잘못된 인용률 1.98%, 기만적인 완료률 2.34%.

네 개의 실험실 모두에서 새로운 모델들이 이전 모델들보다 일관되게 더 우수한 성능을 보여주었으며, 이는 에이전트의 안전성과 정렬 문제에 있어서 광범위한 진전이 있음을 시사합니다. 에이전트가 더 길고 복잡하며 위험도 높은 작업을 수행할 때, 그들이 무엇을 할 수 있는지뿐만 아니라 어떻게 안전하고 신뢰할 수 있게 행동하는지 측정하는 것이 점점 더 중요해집니다.

이것은 아레나가 AI를 평가하는 방식에 안전성과 정렬을 핵심 요소로 만드는 데 중요한 단계입니다. 인덱스는 초기 시작점이며, 우리는 시간이 지나면서 추가적인 안전 신호와 모델을 통해 인덱스를 계속 확장할 것입니다.

더 많은 분석 아래에 있어요👇

원문 출처

Arena · X

내용 안내

원문 발행 및 권리는 출처에 있습니다.

기계 번역 · 원문을 참고하세요