量子位

ChatGPT가 철판을 차버렸어! 밀레니얼 수학 문제를 해결할 수 있지만, 논문 재현율이 13.98%에 불과하다고?

PaperBenchX를 대표하는 기준은 아마도 AI의 연구 역량을 더 잘 측정할 수 있을 것이다

이미지 출처 · 量子位

윤중, 압비사에서 발송됨
양자위 | 공식 계정 QbitAI

OpenAI는 최근에 수학계에 중요한 발전을 가져오는 혁신적인 연구를 여러 차례 발표하고 있습니다.

지난달, OpenAI는 자사의 AI 모델이 단 88시간 만에 인류가 백 년 동안 해결하지 못한 밀레니엄의 7대 수학 난제 중 하나인 N-S 방정식을 해결했다고 발표했습니다. 어제에는 722편의 수학 원고가 공개되었으며, 밀레니엄 난제는 또 다시 세 개가 추가되었습니다.

하지만 UniPat AI가 발표한 PaperBenchX 평가에서 93개의 실제 논문 재현 작업에 직면했을 때, 가장 뛰어난 성능을 보인 GPT-6 Astra의 완전 재현율은 13.98%에 불과했습니다.

△10개 그룹의 테스트 설정은 93개의 재현 작업에서 전체적으로 및 단계별로 좋은 성능을 보였습니다.

오렌지가 생각하길! 현재 모델은 밀레니엄 수학 난제와 같은 위대한 돌파구를 이루었지만, 신뢰할 수 있는 종합적인 과학적 재현을 하는 것은 거의 불가능합니다.

(진지한 표정) 이로 인해 몇 가지 고민이 생겼습니다: 광범위한 AI for Science 분야에서 '과학적으로 올바른 일'을 어떻게 판단할 것인가? 엄격하고 신중한 연구 태도로, AI 수학자나 General AI Scientist가 나아가야 할 첫걸음은 무엇인가? 그리고 우리는 어떻게 검증 가능하고 비교 가능한 기준을 만들어, 과학 연구에서 AI의 발전을 실제로 측정할 수 있을까?

과학 분야에서 AI의 발전을 어떠한 측정기로 평가해야 할까?

이 순간에, 탕자신, 덩유 등 25명의 필즈상 수상자의 공동 서한을 더 자세히 살펴보도록 하죠.

그들은 대언어 모델의 수학적 능력이 급격히 향상되어 수학 분야의 중대한 문제를 해결할 수 있게 되었다고 확신했지만, 더 중요한 문제도 제기했습니다: AI 회사들이 수학 문제 해결을 기준 테스트로 삼는 것은 수학이라는 과학과 수학 공동체에 해로운 것입니다.

그러므로 이는 AI에 반대하는 편지가 아닙니다. 이 글은 더 간단한 질문을 제기합니다: 과학 분야에서 AI의 발전을 어떻게 측정해야 할까?

편지에는 더욱 중요한 말도 있었습니다: 수학 문제를 해결하는 것을 기준 테스트의 오차 문제로 보는 것은, 더 넓은 오차 문제의 일부에 불과합니다. 이러한 오차는 다른 과학 및 창의적 직업, 심지어 전체 사회에도 영향을 미칩니다.

확실히, 위에서 제기된 문제들이 수학 분야에서 자연과학 및 사회 분야로 확장되면 답하기가 더욱 어려워진다.

수학은 최소한 마지막 방어선인 Lean을 가지고 있다. 증명이 맞는지 여부는 기계가 단계적으로 검토할 수 있으며, 답의 진위는 보장된다.

기타 과학 분야에도 적용될 수 있습니다. 전자기 시뮬레이션의 반사 계수, 에너지帯, 수렴된 간격도 모두 Lean이 없습니다. 논문에 나와 있는 숫자는, 잘못된 물리 모델, 수렴되지 않은 시뮬레이션, 또는 우연히 합리적인 값을 얻은 무의미한 후처리가 있을 수 있습니다.

그러므로, AI가 스스로 질문을 제기하고 실험을 설계하며 새로운 발견을 하는 일반적인 AI 과학자의 능력을 측정하기 전에, 더 기본적인 문제가 있습니다: 그 AI가 이미 발표된 과학 연구를 다시 수행하여 자신이 올바르게 했다는 것을 증명할 수 있을까?

이 문제의 논리는, 복귀가 유일한 정확한 답이 있기 때문에 정확하게 평가될 수 있다는 점에 있습니다.

UniPat AI가 최근 발표한 연구「PaperBenchX」도 바로 이 목적을 위해 만들어졌습니다. 이 연구는 93편의 연구 논문에서 93개의 재현 과제를 구축했으며, 전자기학, 광자학, 화학, 재료공학, 생명과학, 로봇공학 등 12개의 연구 분야와 10가지 산업 현장을 아우릅니다. 또한 3168개의 전문가 검수된 점수 항목도 포함되어 있습니다. 이는 국제적으로 최초로 다학제적 종합 논문 결과 재현을 위한 Benchmark입니다.

△PaperBenchX의 작업 분배, 출처 논문 및 평가 항목 구성

PaperBenchX의 시험 규칙은 매우 간단합니다:

엔티티는 실제 논문, 해당 과학 소프트웨어가 설치된 컨테이너 환경, 그리고 “어떤 부분을 재현할 것인지”에 대한 과제서를 받는다;

엔티티는 실행 가능한 재현된 워크플로우를 다시 제공해야 합니다;

평가 기준, 허용 오차, 정답모두 에이전트에 숨김.

특별히 주의해야 할 점은, 논문 자체가 공개되어 있기 때문에 에이전트는 논문에 나와 있는 수치를 볼 수 있지만, 이 시험은 '정답 추측'이 아니라 과학적으로 타당한 절차를 재구성하고 그 결론을 뒷받침하는 증거를 스스로 제시할 수 있는지 여부를 테스트한다는 점입니다.

그렇다면 PaperBenchX가 실제로 무엇을 측정하는 것일까?

답은: 예기치 않게 “얼마나 많은 숫자를 얻었는지”에 대해서는, 다시 생성된 증거만을 신뢰한다. 에이전트가 문제를 제출한 후, 시스템은 모든 출력 내용을 삭제하고 네트워크를 끊으며, 격리 환경에서 작업 흐름을 처음부터 다시 실행한다. 점수 산출기는 다시 생성된 결과만을 믿한다. 어떤 의미에서, 이것은 과학적 시뮬레이션을 위한 “Lean”을 만드는 것이다.

측정 결과는 어떠한가요?

결과는 다음과 같습니다: 93개의 논문 재현 과제에서 가장 우수한 GPT-6 Astra는 전체 재현율이 13.98%에 불과했습니다.

이는 모델이 많은 작업에서 합리적으로 보이는 결과를 생성할 수 있지만, 실제로 전체 작업 흐름을 제대로 수행하여 논문과 일치하고 검증 가능한 증거를 생성하는 성공률은 7분의 1도 되지 않는다는 것을 의미합니다.

이것이 바로 오늘날의 AI와 다양한 분야의 과학 경계를 넘나드는 일반 AI 과학자 사이의 간극입니다.

PaperBenchX의 의미는 이 거리를 처음으로 측정했다는 점에 있다.

현재 UniPat AI 팀은 각 연구 방향에서 1개의 대표적인 작업을 선정하여 총 12개의 테스트 작업을 오픈소스로 공개하고 있습니다. 이 작업들은 다양한 연구 방향과 과학 소프트웨어 스택을 포함하며, 에이전트를 평가하거나 워크플로우를 디버깅하고 실제 과학 환경에서 모델의 종단간 재현 능력을 연구하는 데 활용될 수 있습니다.

또한 81개의 폐쇄형 테스트 작업을 유지하여 PaperBenchX의 차별성과 장기적인 평가 효율성을 보장합니다.

13.98% 뒤에, 신뢰할 수 있는 재현이 어디에 있나?

다음으로, PaperBenchX가 93개의 작업으로 구성된 한 그룹에서 평가한 10개의 첨단 모델 및 Agent 프레임워크 설정들을 자세히 살펴보고, 평가 결과를 분석하여 신뢰할 수 있는 재현이 어디에 문제가 있는지 파악해 보겠습니다.

△(a) 테스트 구성 단계의 점수;(b) 상호작용 라운드 수와 점수의 관계;(c) 샘플 트랙의 작업 흐름 시간 할당

부분적으로 완료된 것은 전체적인 재현과 같지 않다

먼저 그림 a를 보면 테스트된 구성의 단계별 점수가 나와 있습니다. 모든 테스트된 구성에서 모델링과 실행의 평균 점수는 각각 62.70%와 61.84%였으며, 검증의 경우는 42.80%에 불과했습니다.

이는 에이전트가 일부 모델링 작업을 수행하고 해석기를 호출하여 결과 파일을 생성할 수 있지만, 그 결과가 반드시 정확하거나 논문 결론을 실제로 뒷받침한다는 것을 증명하지는 못한다는 것을 의미합니다. 전반적으로, 각 단계를 연결하여 완전하고 신뢰할 수 있는 재현을 이루는 것은 여전히 어렵습니다.

더 많은 상호작용이 더 나은 재현 결과를 의미하지 않는다

그림 b를 다시 보면, 인터랙션 라운드 수와 점수의 관계가 나타납니다. 궤적 분석에 따르면, 오랜 시간 동안 실행되는 것은 반복적인 시도나 장애 복구, 또는 잘못된 모델 설정 하에서 계산을 계속하는 것을 의미합니다. 이는 인터랙션 라운드 수가 많을수록 점수가 반드시 높아지는 것은 아니라는 것을 나타냅니다.

초기 결정이 후속 실행의 가치가 있는지 결정한다

그림 c를 다시 보면, 샘플링 트랙의 작업 흐름 시간 할당이 나타납니다. Fable 5를 예로 들면, 37.1%의 시간을 논문 재구성과 코드 구현에 사용했으며, 다섯 개의 모델 중 가장 높은 초기 투자 비율을 보였습니다. 하지만 상대적으로 적은 상호작용으로 최적에 가까운 점수를 얻을 수 있었습니다.

즉, 논문 이해, 과학적 모델링, 매개변수 선택 및 실험 조직 등의 전초적 결정이 적절한지 여부가 후속 계산이 자원 낭비가 되는지에 큰 영향을 미칩니다.

왜냐하면 기하학적 구조, 경계 조건, 패턴 정의 또는 주요 매개변수가 초기 단계에 잘못 설정된 경우, 해석기는 정상적으로 작동하더라도 오류가 있는 과학적 시스템에 불과하기 때문입니다. 초기 단계의 한 가지 실수는 이후 몇 시간 동안의 계산이 전부 무의미해질 수 있습니다.

결론적으로, 단순히 성공적으로 실행된 결과나 최종 출력만을 보면 다양한 실패 원인을 구분할 수 없습니다. 일부 에이전트는 실험이 성공적으로 실행되었지만 과학 모델이나 결과 분석에 오류가 있습니다; 다른 에이전트들은 신뢰할 수 있는 해결 과정이 부족하거나 코드에 오류가 있어 재실행이 불가능합니다.

UniPat AI 팀은 또한 '신뢰할 수 있는 재현'을 달성하기 위한 몇 가지 핵심 요소를 더욱 명확히 지적했습니다:

난제는 « 작동하는가 »에 있지 않고, « 작동하는 내용이 과학적으로 타당한가 »에 있다: 겉보기에는 맞아 보이는 숫자는 잘못된 모델, 부적절한 매개변수, 수렴하지 않는 시뮬레이션 또는 무효한 후처리로 인해 발생할 수 있다.

결과에 대한 평가는 에이전트의 자기 기술에 의존하는 것이 아니라, 재생성된 증거에 기반해야 합니다.: 출력 내용을 삭제하고, 네트워크 연결을 끊고, 다시 실행하고, 단지 재생된 결과만을 인정해야 합니다.

현재 일부 진행 상황은 사실이지만, 완전한 재현은 아직 드물다: 에이전트는 합리적인 시뮬레이션을 작성하고 실행에 성공했지만, 전체 과정과 최종 결과가 검증될 수 있도록 만드는 것은 여전히 어렵다.

PaperBenchX의 차별화된 설계

“전체 논문 재현”을 에이전트 평가 패러다임으로 확립한 것은 UniPat AI가 처음으로 한 것이 아니며, OpenAI의 PaperBench도 비슷한 작업입니다.

하지만 과거의 작업은 기계학습 논문 분야에 집중되어 있었으며, 물리학, 화학, 재료 등 과학 연구 분야에 진입한 후에는 논문을 재현하는 것이 '코드를 한 번 실행하는 것'처럼 간단하지 않았습니다. 세 가지 어려움이 발생했습니다.

과학 문제를 이해하기: 논문은 따르기만 하면 되는 설명서가 아닙니다. 실제 과학 문제에 직면했을 때, 에이전트는 연구 목표를 스스로 이해하고, 경계 조건을 어떻게 설정해야 하는지, 분산을 어떻게 처리해야 하는지, 어떤 매개변수가 결론에 실제로 영향을 미치는지를 판단해야 하며, 단순히 README를 참고하여 코드를 실행하는 것만으로는 안 됩니다.

과학 시뮬레이션을 올바르게 완료하기: 코드를 성공적으로 실행시키는 것은 첫 번째 단계에 불과합니다. 해상도, 해석기 허용 오차, 샘플링 시간 등의 매개변수가 잘 설정되지 않으면 완전히 잘못된 수치 결과가 발생할 수 있습니다. 에이전트는 진단 정보를 이해하고, 수치의 범위 확장과 같은 이상 현상을 식별하며, 언제 매개변수나 암호화 그리드를 조정해야 하는지 판단해야 합니다. 이 모든 것은 일반적인 코드 실행 능력이 아니라, 특정 학문 분야에 대한 지식에 크게 의존하는 판단입니다;

판단 결과가 실제로 신뢰할 수 있는지: 이는 가장 간과되기 쉽고 동시에 가장 치명적인 단계입니다. 논문과 일치하는 숫자를 도출한다고 해서 과학적으로 올바른 것이 되는 것은 아닙니다. 잘못된 물리 모델, 아직 수렴하지 않은 시뮬레이션, 심지어 부적절한 후처리까지도 '올바워 보이는' 결과를 만들 수 있습니다. 따라서 과학적 재현은 일반 코드 작업처럼 간단한 pass/fail 기준으로 이루어지지 않습니다. 에이전트는 결과 뒤에 있는 과학적 과정이 신뢰할 수 있는지 판단할 수 있어야 합니다.

진정한 과학 재현을 위해 에이전트는 완전한 연쇄 과정을 수행해야 합니다: 먼저 과학적 문제를 이해하고, 다음으로 과학적 계산을 수행하며, 마지막으로 과학적 결론을 검증합니다. 이 세 가지는 AI 과학자가 반드시 갖추어야 할 기본 능력입니다: 과학을 이해하고, 과학을 실행하며, 과학을 판단하는 것입니다.

따라서 PaperBenchX가 측정하는 것은 에이전트가 과학적 코드를 실행할 수 있는지가 아니라, 상대적으로 완전한 과학 작업 흐름을 수행할 수 있는지를 의미한다고 이해할 수 있습니다.

이는 PaperBenchX와 기존 유사한 벤치마크와의 핵심 차이점을 형성합니다. 이는 이 연구의 몇 가지 중요한 설계 요소에 기반한 것입니다.

첫째, 에이전트는 실제 과학 소프트웨어에서 작업해야 하며, 새로운 학문 데이터를 활용한 머신러닝 작업에는 참여해서는 안 됩니다.

PaperBenchX는 12개의 연구 분야와 10종의 시뮬레이션 플랫폼을 지원하며, 각 분야마다 고유한 매개변수 체계, 계산 프로세스 및 수렴 판단 기준을 가지고 있습니다. 기존의 기준(PaperBench, ScienceAgentBench 등)은 주로 ML/Python 스택에 국한되어 있지만, PaperBenchX는 다양한 학문 분야에서 에이전트가 Ansys HFSS, Ansys Lumerical, Meep, PySCF/GPU4PySCF, ABACUS와 같은 해당 분야의 천부적 해결법을 직접 사용할 수 있는 복제 기준으로 처음으로 활용됩니다.

두 번째로, 에이전트가 제출한 결과물은 완전히 재현될 수 있어야 합니다.

에이전트가 제출한 후, 시스템은 모든 출력 내용을 삭제하고 인터넷 연결을 끊은 뒤 격리 환경에서 전체 워크플로우를 다시 실행합니다. 이 과정에서 재생성된 과학적 결과물만이 후속 평가에 참여하게 되며, 각 평가 항목은 구체적인 과학적 요구사항을 나타내고, 프로그램 검사와 대모델 평가를 통해 결정됩니다.

셋째, 제한된 시간 예산으로 인해 에이전트는 과학 연구 과정에서의 선택과 배제를 스스로 해야 합니다.

단일 작업 예산4 – 24시간, 중앙값 7시간. 이 시간 범위 내에서 에이전트는 컴퓨팅 자원을 어떻게 분배할지 스스로 결정해야 합니다: 중간 결과를 언제 확인할 것인지, 계산에 실패했을 때 재실행이 필요한지, 어떤 매개변수를 조정할 가치가 있는지, 그리고 제한된 시간 내에 어느 부분에 에너지를 집중해야 하는지 등입니다. 이는 무한히 시도할 수 있는 코드 실행 작업과는 달리 실제 연구 작업의 방식에 더 가깝습니다.

네 번째, 검증 방식을 통해 속임수가 발생할 가능을 차단합니다.

일반적인 코드 기준에서는 단위 테스트를 한 번 실행해보면 맞는지 아닌지 알 수 있지만, 과학적 재현은 단순한 pass/fail 판단으로는 불가능합니다. 따라서 PaperBenchX는 검증을 세 개의 레벨로 나누어 각 레벨이 각각 다른 질문에 답하는 방식을 사용합니다.

다시 실행해도 되나요: 에이전트가 작업을 제출한 후, 시스템은 그로 생성된 모든 출력물을 삭제하고 외부 인터넷을 끊고 격리 환경에서 처음부터 워크플로우를 실행합니다. 실행되지 않는 경우는 직접 계산하지 않습니다. 이 단계를 통해 수동으로 결과를 조합하거나 캐시에 의존하거나 인터넷에서 답을 복사하는 가능성을 모두 걸러냅니다.

증거가 원산지로 추적될 수 있는가: 해당 계산 과정으로 거슬러 올라갈 수 있어야 한다. 예를 들어, 에이전트가 특정 시뮬레이션이 수렴했다고 주장한다면, 그에 상응하는 수렴 기록을 제공해야 하며; 특정 물리량이 보고된 경우에는 그 결과를 생성한 시뮬레이션 출력과 후속 분석 과정을 찾을 수 있어야 한다. 이렇게 하면 평가되는 것은 단순한 개별적인 숫자가 아니라, 그 숫자를 뒷받침하는 완전한 증거 체인이다.

과학적으로 타당한지 판단할 수 있는가: 마지막으로, 평가 시스템이 구체적인 과학적 요구사항을 충족하는지 여부를 판단합니다. 각 점수 기준은 명확한 과학적 요구사항 및 필요한 증거와 대응됩니다. 값의 일관성, 단위, 오차 허용 범위 등 명확하게 계산할 수 있는 문제는 프로그램에 의해 자동으로 검사되며; 분야 지식이 필요한 문제는 LLM에 맡겨져 평가됩니다.

또한, 에이전트가 직접 작성한 “재현 성공”과 같은 문구는 결코 증거로 받아들여지지 않으며, 심사위원에게 내린 지시로도 사용되지 않습니다. 이렇게 하면 에이전트가 겉보기에는 완전해 보이는 보고서를 작성함으로써 실제 과학적 계산을 제대로 수행하지 않고 “속여서” 통과하는 것을 방지할 수 있습니다.

그렇다면 문제는 더욱 복잡해진다: 논문에 포함된 과학적 결론을, 실제로 실행할 수 있고, 다시 계산할 수 있으며, 객관적으로 판단할 수 있는 요소들로 어떻게 분해할 수 있을까?

PaperBenchX는 단순히 논문을 에이전트에게 전달한 다음 최종 숫자를 비교하는 것이 아닙니다. 각 과제는 '후보 과제 구축'과 '검증 및 심사'의 두 단계를 거쳐 총 아홉 단계를 마친 후에야 공식적으로 평가에 들어갈 수 있습니다.

△PaperBenchX의 두 단계, 아홉 단계 작업 구축 및 검증 프로세스

즉, PaperBenchX은 논문에 포함된 과학적 결론을 새로운 객체로 컴파일합니다. 이 객체는 AI가 실행하고, 환경에서 재생되며, 원본 증거를 다시 계산하고, 마지막으로 평가기로 각 항목을 검증하는 과학적 작업 흐름입니다.

논문을 평가 가능한 과학적 재현 문제로 변환하는 방법에 대한 더 많은 세부 정보는 GitHub이나 공식 웹사이트 블로그에서 확인할 수 있습니다~

GitHub 오픈소스 링크:

https://github.com/UniPat-AI/PaperBenchX

공식 웹사이트 블로그 링크:

https://unipat.ai/blog/PaperBenchX

— 완 —

원문 출처

量子位

내용 안내

원문 발행 및 권리는 출처에 있습니다.

기계 번역 · 원문을 참고하세요