@MistralAI의 Mistral Large 4가 아레나에 등장했습니다!
Agent Arena로 이동하여 직접 테스트해 보세요. 여러분의 투표가 평가에 반영됩니다. 점수는 곧 공개됩니다.
Agent Arena에서는 수백만 건의 실제 환경, 장기적인 에이전틱 작업을 기준으로 모델을 측정합니다. 모델은 복잡한 워크플로우를 완료하기 위해 웹 검색, 파일 시스템, 터미널 도구에 접근할 수 있습니다. 리더보드는 인과 추적(causal tracing) 방법론을 사용해 평균 모델을 기준으로 결과 측면에서의 모델 성능을 측정합니다.
Mistral Large 4는 Code Arena의 WebDev, Text, Vision에서도 이용할 수 있습니다.

