Hugging Face

하나의 모델 패밀리, 두 가지 골드 레벨 결과: IOI와 IMO를 위한 Nemotron fine-tuning

국제 정보학 올림피아드(IOI)와 국제 수학 올림피아드(IMO)는 서로 다른 기술을 요구합니다. IOI는 엄격한 시간 및 제출 제한 내에서 숨겨진 시험을 통과하는 알고리즘과 코드를 요구합니다. IMO는 엄밀한 자연어 증명을 요구합니다. 어느 대회에서든 성공하는 것은 어렵습니다. 두 대회 모두에서 성공하는 것은 더 큰 것을 의미합니다. 우리의 최근 결과에

fig_ioi_imo_gold_results_headline
이미지 출처 · Hugging Face

국제 정보학 올림피아드(IOI)와 국제 수학 올림피아드(IMO)는 서로 다른 기술을 요구합니다. IOI는 엄격한 시간 및 제출 제한 내에서 숨겨진 시험을 통과하는 알고리즘과 코드를 요구합니다. IMO는 엄밀한 자연어 증명을 요구합니다. 어느 대회에서든 성공하는 것은 어렵습니다. 두 대회 모두에서 성공하는 것은 더 큰 것을 의미합니다.

우리의 최근 결과에 따르면, Nemotron은 세계급 전문 모델을 구축하는 데 적합한 강력하고 유연한 기반이 됩니다. Nemotron 3부터 우리 팀은 감독된 미세조정(SFT), 강화학습(RL), 피드백 기반 인출을 활용하여, IMO 2026와 IOI 2026에서 금메달 수준의 성과를 거둔 시스템을 개발했습니다.

fig_ioi_imo_gold_results_headline

경쟁 네모트론 전문화 결과
IOI 2026 Nemotron-3-Ultra-CC는 SFT 및 GenCorrect 기능을 탑재됨 535.4/600, 361.12 금 가격 기준을 초과하며 498.27의 최고 인원 점수
내 생각에는 2026년 Nemotron 3 Ultra 일반, SFT 및 RL 체크포인트를 포함한 생성-검증-개선 시스템 30/42, 공식 금 비율 기준인 29보다 높음

IOI 결과는 인간 참가자들과 동일한 시간, 인터넷 접속 및 제출 조건 하에서 실시된 실제 테스트에서 얻어졌습니다. 이는 비공식적인 무관리형 벤치마크이며 공식 IOI 순위에 포함되지 않았습니다. IMO 시스템의 제출된 증명서는 공식 IMO 평가자에 의해 평가되었습니다.

재사용 가능한 전문화 레시피

“쉽게 조정 가능”이라는 말은 단순히 체크포인트를 학습 가능하게 만드는 것보다 더 많은 의미를 가져야 합니다. 이는 유능한 기반 모델이 명확하고 재사용 가능한 방법으로 요구가 높은 분야에 적용될 수 있다는 것을 의미합니다.

두 프로젝트 모두에서, 그 레시피는 네 가지 부분으로 구성되었습니다:

  1. 강력한 Nemotron 기반 모델로 시작하세요.
  2. 특정 도메인에 특화된 문제와 고품질의 추론 흔적을 선별합니다.
  3. SFT와 같은 표준 훈련 후 방법을 적용하고, 필요한 경우 RL을 사용한다.
  4. 전문가 모델을 후보 답변을 생성, 평가, 개선하는 추론 루프와 함께 사용하세요.

훈련 및 인출 과정은 상당했지만, 기반된 접근 방식은 익숙하고 재현 가능했습니다. 모든 문제에 대해 새로운 기반 모델을 구축할 필요가 없었습니다. 우리는 특정 작업에 맞게 Nemotron을 전문화시켰습니다.

일반 코딩 능력에서 IOI 금메달까지

경쟁 프로그래밍을 위해 우리는 22,000개의 문제를 선정하고 두 전문가를 훈련시키기 위한 합성 추론 트레일을 생성했습니다. 총 300억 개의 파라미터와 30억 개의 활성 파라미터를 가진 Nemotron-3-Nano-CC는 SFT와 RL을 받았습니다. 총 5500억 개의 파라미터와 550억 개의 활성 파라미터를 가진 Nemotron-3-Ultra-CC는 SFT를 받았습니다.

IOI 2025의 진행 상황을 보면 전문화된 능력의 수준을 쉽게 알 수 있습니다. Nano는 훈련 전 130점에서 SFT 이후 280점, RL 이후 291점으로 향했습니다. GenCorrect라는 반복적 생성-평가-정제 전략을 사용했을 때는 468점에 도달하여 438.3점이라는 금전 기준을 넘었습니다. Ultra-CC도 같은 테스트 시간 전략으로 502점에 도달했습니다.

fig_main_capability_progression_previous_style

이 실험들은 또한 적응이 모든 규모에서 동일한 모습을 보여야 하는 것은 아니라는 것을 보여주었습니다. SFT가 Nano의 성능 향상의 대부분을 제공했으며, RL은 더 작지만 일관된 개선 효과를 가져왔습니다. 더 강력한 Ultra 모델의 경우, 단 한 번의 SFT 에포크만으로도 IOI, ICPC, LiveCodeBench Pro에서 완전히 훈련된 Nano 모델을 능가하는 성능을 보였습니다. 이 발견은 2026년 IOI 대회에 사용되는 경기별 특화된 Ultra-CC 시스템을 개발하는 데 기초가 되었으며, 이 시스템은 600점 중 535.4점을 얻었습니다.

Nemotron을 증명하고, 검토하며 수정하는 방법을 가르치기

IMO 프로젝트는 올림피아드 수학에 같은 아이디어를 적용했습니다. Nemotron 3 Ultra부터 시작하여, 한 명의 전문가를 SFT로, 또 다른 한 명을 RL으로 훈련시켰습니다.

SFT 코퍼스에는 15,818개의 고유한 증명 문제에 걸쳐 414,890개의 품질이 필터링된 예시가 포함되어 있었습니다. 이 데이터는 최종 답변을 가르치는 것 이상의 역할을 했습니다. 데이터는 증명 생성, 정제, 검증, 메타-검증 등을 포함했기 때문에, 모델은 논증을 구성하고, 결함을 식별하며, 비판에 반응하고, 증명이 완전한지 판단하는 방법을 배웠습니다. RL 모델은 모델의 능력 경계 근처에서 선택된 9,597개의 증명 문제를 기반으로 훈련되었습니다.

두 번의 트레이닝 후 체크포인트 모두 개발 실험에서 일반적용 모델을 능가했습니다. SFT 체크포인트는 첫 번째 검색 라운드에서 가장 강했으며, RL 체크포인트는 전체 단일 체크포인트 결과에서 최고의 성능을 보였습니다. 이들의 강점은 상호보완적이었기 때문에, 최종 시스템에서는 전문 모델과 일반 모델을 함께 사용했습니다.

각 IMO 문제에 대해 모델은 후보 증명을 생성하고 점수를 매기며 비평을 제시하고 가장 유망한 시도를 다듬었습니다. 별도의 고비용 단계에서 최종 제출물이 선정되었습니다. 전체 시스템은 형식적인 증명 방법이나 외부 도구, 인터넷 접속 없이 자연어로 작동했습니다. 6개 문제 중 4개에 대한 완전한 점수를 포함하여 42점 중 30점을 얻었으며, 공식 금메달 기준을 초과했습니다.

image

피네팅과 테스트 시간 컴퓨팅이 함께 작동한다

우리의 이전 IOI 2025 Hugging Face 포스트에서는 테스트 시간에 수행되는 계산이 오픈-무게 모델을 골드 수준의 성능으로 끌어올리는 방법을 보여주었습니다. 새로운 결과는 중요한 역할을 합니다: 더 나은 전문화가 추론 시스템에 더 좋은 후보, 더 좋은 비판자, 그리고 더 좋은 개선점을 제공합니다.

IOI에서 GenCorrect은 미세 조정으로 얻은 성과를 여러 반복의 피드백 과정에서 더 큰 개선으로 전환했습니다. IMO에서는 보완적인 SFT와 RL 체크포인트를 사용하는 것이 단순히 한 체크포인트에서 더 많은 샘플을 생성하는 것보다 더 유용했습니다. 두 경우 모두, 유능한 전문가와 검색, 확인, 개선이 가능한 시스템을 결합함으로써 최상의 결과가 나왔습니다.

이 구분은 중요합니다. 메달들은 단순한 조정만으로 만들어지지 않았으며, 단순한 샘플링만으로도 만들어지지 않았습니다. 그것은 모델, 데이터, 그리고 추론 루프를 함께 설계함으로써 만들어졌습니다.

Hugging Face에서 오픈 모델, 데이터, 레시피를 확인하세요

우리는 이 결과들이 경시대회를 넘어서서 유용하게 사용될 수 있기를 원합니다. Nemotron Labs IMO 2026 컬렉션는 SFT와 RL 체크포인트, 두 가지 훈련 데이터셋, 그리고 200개의 올림픽 수준 문제로 구성된 새로운 벤치마크인 Nemotron-IMO-Bench를 포함합니다. IMO 논문은 훈련 접근법과 생성-검증-정제 시스템을 설명하며, NeMo-Skills 저장소에는 IMO 인출 파이프라인, 프롬프트, 제출된 증명서, 그리고 재현 가능한 빠른 시작 가이드가 포함되어 있습니다. 경쟁 프로그래밍을 위해 Nemotron-3-Ultra-CC 모델가 Hugging Face에서 제공되며, IOI 논문은 훈련 레시피와 GenCorrect 방법론을 제공합니다. IOI 평가 및 인출 파이프라인도 NeMo-Skills에서 이용할 수 있습니다.

함께, IMO와 IOI는 간단한 아이디어에 대해 매우 까다로운 증거를 제공합니다. Nemotron은 세계급 분야 전문가로 세팅될 수 있으며, 투명한 추론 워크플로우로 구성되어 인간 경쟁의 최전선에서 문제를 해결할 수 있습니다.

Hugging Face 커뮤니티가 다음에 무엇을 만들어낼지 보게 되어 기대됩니다.

원문 출처

Hugging Face

내용 안내

원문 발행 및 권리는 출처에 있습니다.

기계 번역 · 원문을 참고하세요