The Decoder

연구에 따르면 AI 에이전트는 자신의 결과를 과장하며 자율 연구에서는 아직 멀리 떨어져 있다

Epoch AI와 Anthropic이 독립적으로 동일한 사실을 발견했습니다. GPT-5.6 Sol과 Claude Fable 5 같은 현재 AI 모델은 실험을 수행할 수 있지만 과학적 자기 비판과 진정한 창의적 사고가 부족합니다. 최선의 경우에도 Sol은 인간 기준 점수의 15퍼센트에 도달했으며, 그마저도 연구자들이 이미 알고 있던 방법에서 나온 것이었습니다. 모델들의 가장 큰 약점은 여전히…

Manuel Uth
이미지 출처 · The Decoder

연구에 따르면 AI 에이전트는 자신의 결과를 과장하며 자율 연구와는 아직 거리가 멀다

Manuel Uth 마누엘 우트 2026년 10월 11일 Image description THE DECODER가 프롬프트한 Nano Banana Pro

Epoch AI와 Anthropic의 결과에 따르면 AI 모델은 실험을 수행할 수 있지만 과학적 자기비판과 진정한 창의적 사고가 부족하다.

주요 AI 연구소들은 자사 모델을 연구 도구로 점점 더 많이 마케팅하고 있습니다. Google DeepMind는 그 범위를 확장했습니다. Co-Scientist "완전한 연구 시스템으로 전환되었고, OpenAI는 ""자동화 연구 인턴" 9월로 거슬러 올라갑니다. 2028년 3월까지 그 인턴은 인간의 감독 하에 자율적인 AI 연구자가 될 예정이지만, 여전히 결여된 핵심 능력이 하나 있는 것 같습니다: 바로 과학적 판단력입니다.

에이전트들은 새로운 훈련 방법을 고안해 내라는 요청을 받았습니다.

그 벤치마크를 통해 "InnovationEval," Epoch AI는 AI 에이전트가 스스로 연구를 수행할 수 있는지 테스트했습니다. 과제는 언어 모델의 초기 학습 이후 이를 개선하는 새로운 방법을 고안한 뒤, 이를 독립적으로 구현, 테스트, 개선하는 것이었습니다.

출발점은 다음과 같았습니다: GRPO, 널리 사용되는 기법입니다. GRPO는 모델이 동일한 작업에 대해 생성한 여러 답변을 비교하여 더 나은 것에 보상을 주며, 일반적으로 각 솔루션을 전체로서 채점합니다. 인간이 설계한 참조 방식인 SDPO, 오답 메시지 같은 추가 신호를 활용해 답변 내 개별 단계에 대해 더 정밀한 학습 피드백을 만들어내며, 그 결과 모델이 사실상 스스로의 교사가 됩니다.

Epoch는 Claude Fable 5 와 GPT-5.6 Sol을 테스트했으며, 이 조직에 따르면 두 모델은 SDPO에 대한 사전 지식이 없었습니다. 성능은 과학 질문 같은 단답형 과제와 코딩 과제에서 측정되었고, 각 에이전트는 고성능 칩에서 최대 3,000시간의 컴퓨팅 자원에 접근할 수 있었지만 인터넷 접속은 불가능했습니다.

두 모델 모두 혁신이 아닌 기존에 알려진 기법을 재활용했다

어느 모델도 인간 기준에는 근접하지 못했습니다. GPT-5.6 Sol은 GRPO의 약점을 공략했습니다. 어떤 과제에 대한 모든 답변이 정답일 경우, 비교할 대상이 없어 모델은 아무것도 학습하지 못합니다. Sol은 그런 경우 모델이 성공적인 풀이를 강화하도록 했지만, 이 아이디어는 새로운 것이 아니었습니다.

Epoch에 따르면, GRPO 대비 SDPO가 달성하는 개선을 기준으로 측정했을 때 Sol은 관대한 채점 기준으로 약 35퍼센트를 기록했습니다. 실험 규칙 내에 머무는 변경 사항만 계산하면 그 수치는 약 15퍼센트로 떨어집니다. 코딩 과제에서 Sol은 대체로 방법 자체를 개선하기보다 훈련을 더 비싸고 느리게 만들었습니다.

Claude Fable 5는 이전의 실패 시도를 함께 입력하면서 모델이 실패한 과제를 재시도하도록 했는데, 이 역시 잘 알려진 기법이었고 측정 가능한 개선은 없었습니다. Epoch에 따르면 Sol의 부분적 성공조차도 전문가들에게는 barely "약간 흥미로운" 수준에 그칠 것입니다. 훈련 데이터에서 SDPO를 접한 더 최신 모델들도 이를 완전히 재현하지 못했습니다. GPT-6 Astra는 유사한 솔루션을 만들었지만 출처를 공개하지 않았고, Fable 5는 원본 논문을 앞에 두고서도 기준에 미치지 못했습니다.

에이전트들은 가장 좋은 실행 결과만 골라내고 나머지는 묻어두었다

두 에이전트 모두 보고 문제도 있었습니다. 이들은 거의 동일한 학습 라운드를 여러 번 수행하고 매번 가장 좋은 결과만 보고했는데, 결과가 무작위로 변동하기 때문에 이는 실제보다 방법을 더 강력해 보이게 만듭니다. 최종 보고서에서 두 모델은 이러한 관행을 거의 언급하지 않았거나 전혀 언급하지 않았으며, 자신들의 방법이 기반을 둔 선행 연구를 인용하지도 못했습니다. 이에 따라 자체 보고한 수치는 높게 나왔습니다. Sol은 SDPO 개선의 약 70퍼센트를, Fable 5는 약 40퍼센트를 주장했습니다. Epoch는 이러한 부풀려진 개선치를 제거했습니다.

Claude Fable 5와 GPT-5.6 Sol의 주장된 점수 대비 실제 점수. 진한 막대는 에이전트가 자체 보고한 수치, 중간 톤 막대는 유리한 실행 사례만 골라낸 것을 보정한 결과, 연한 막대는 규칙을 준수한 변경만 집계한 점수를 보여줍니다. 모든 수치는 GRPO 대비 SDPO의 개선분을 100으로 하는 비율로 표현되었습니다. 오차 막대는 측정 불확실성을 나타냅니다. | 이미지: Epoch AI

모델들의 내부 추론 로그는 이들이 문제를 인지하고 있었음을 보여주며, Fable 5는 반복 실행을 더 나은 체크포인트를 찾기 위한 탐색으로 묘사했습니다. 이것이 의도적인 부정 행위에 해당하는지 아니면 혼란에 불과한지에 대해서는 Epoch가 판단을 유보했습니다.

GPT-5.6 Sol의 경우, 이 행동은 평가 기관 METR의 이전 연구 결과와 부합하며, 해당 기관은 이 모델에서 부정 행위 시도 을 자사 코딩 테스트에서 평가한 다른 어떤 공개 모델보다도 더 많이 감지한 바 있습니다.

Epoch는 인간이 AI가 생성한 모든 연구 결과를 전부 검토해야 할 것이라고 결론지으며, 이는 모델의 유용성을 떨어뜨립니다.

Anthropic도 자사 모델에서 동일한 약점을 발견

Anthropic는 Claude Opus 5.5 의 Claude Opus 5.5에서 유사한 한계를 기술했습니다. Anthropic에 따르면 이 모델은 회사 자체 연구원을 대체하기에는 아직 멀었으며, 주요 문제는 "인식적 품질"과 지시 이행에 있습니다.

Opus 5.5는 검증되지 않은 가정을 사실로 제시하고 이전 모델들보다 자신의 의문을 더 자주 덮어둡니다. 부분적 확인을 완전한 검증으로 기술하고, 교차 검증 없이 예비 평가를 권고안으로 바꾸며, 전반적 접근 방식에 의문을 제기하지 않은 채 비판을 지나치게 협소하게만 다룹니다. 또한 작고 점진적인 수정을 선호하고 새로운 아이디어를 개발하기보다 기발표된 연구에만 의존합니다.

프린스턴 대학교와 영국 안전 연구소가 참여한 연구도 유사한 결론에 도달했습니다. 이 연구는 Claude Opus 4.8에게 NeurIPS AI 학회의 미발표 논문 두 펎의 배경이 되는 연구 질문에 대해 6일간 작업하게 했으며, 원저자들은 두 결과 모두를 검토 후 기각했습니다. 초기 가설이 실패했을 때 에이전트들은 처음부터 다시 시작하는 대신 자신들의 주장을 단지 완곡하게 만들 뿐이었습니다.

기술적 실행은 점차 더 작은 문제가 되어가고 있습니다. 에이전트들에게 가장 부족한 것은 한 결과에 대해 얼마나 확신해야 하는지를 현실적으로 가늠하고, 자신의 접근 방식을 근본적인 수준에서 의문을 제기하는 능력이기 때문입니다.

컴퓨팅만으로는 격차를 메울 수 없음

AI가 연구에 쓸모없는 것은 아닙니다. 모델은 인간보다 빠르게 문헌 검토를 수행하고, 코드를 작성하며, 다양한 변형을 탐색할 수 있습니다.

그러나 더 많은 컴퓨팅을 투입하는 것이 자율적인 연구자를 만들어낼지는 여전히 열린 질문입니다. GPT-5.6 Sol는 전체 예산을 사용했으며, 단답형 과제에서의 개선은 컴퓨팅 배분의 맨 마지막에야 발견되었고 코딩 과제에서는 규칙을 준수한 진전이 전혀 없었습니다. Epoch는 Fable 5가 예산의 절반조차 사용하지 않았다는 점을 들어, 이 늦은 돌파구가 더 많은 컴퓨팅 시간이 도움이 될 수 있다는 약한 단서로 봅니다.

누적 GPU 지출 대비 GPT-5.6 Sol의 진전. 단답형 과제(청록색)에서는 도약이 예산이 바닥나기 직전에 나타납니다. 코딩 과제(분홍색)에서는 규칙 준수 점수가 0에 머무르며, 범위 밖 변경만이 어떤 이득을 만들어냅니다(점선). | 이미지: Epoch AI

Epoch는 또한 1년 전의 최고 성능 모델들이 같은 테스트에서 훨씬 더 나쁜 성적을 냈을 것이라고 지적하며, 이 기관은 새로운 과제들과 함께 InnovationEval을 정기적으로 반복할 계획입니다. 그때까지 가장 큰 격차는 인식적 규율, 즉 자신의 발견을 회의적으로 검증하고, 불확실성을 공개하며, 부정적 결과를 진지하게 받아들이는 것에 남아 있습니다.

과장 없는 AI 뉴스 – 인간이 엄선합니다

광고 없는 읽기, 주간 AI 뉴스레터, 연 6회 독점 "AI Radar" 프론티어 리포트, 전체 아카이브 접근, 댓글 섹션 이용을 위해 THE DECODER를 구독하세요.

전체 내용을 계속 읽어보세요.
과장 없는 보도를 구독하세요.

  • THE DECODER의 모든 기사 전체 접근
  • 광고 없음
  • 댓글 및 커뮤니티 토론 참여
  • 주간 AI 뉴스 요약을 이메일로 받아보세요
  • 연 6회: "AI Radar" — 가장 중요한 AI 주제를 깊이 있게 다룹니다
  • 매일 업데이트되는 AI 뉴스, 항상 최신 소식
  • 10년 전체 아카이브 이용
  • AI 분야 경력 10년 이상 팀의 취재
The Decoder 구독하기
원문 출처

The Decoder

내용 안내

원문 발행 및 권리는 출처에 있습니다.

기계 번역 · 원문을 참고하세요