The Decoder

Reflection의 Beam, 중국 외부에서 구축된 가장 강력한 오픈 웨이트 모델로 부상

Reflection이 첫 번째 오픈 웨이트 모델인 Beam을 공개했습니다. 이 mixture-of-experts 시스템은 토큰당 5,010억 개의 파라미터 중 230억 개만 활성화하며, 3~4배 적은 컴퓨팅으로 코딩과 추론에서 GLM 5.2에 필적하는 것을 목표로 합니다. Deepseek와 Qwen 같은 중국 오픈 웨이트 경쟁 모델에 맞서는 전략은 순수 성능이 아닌 효율성입니다. 본 기사…

Jonathan Kemper
이미지 출처 · The Decoder

Reflection의 Beam, 중국 외부에서 구축된 가장 강력한 오픈 웨이트 모델로 부상

Jonathan Kemper Jonathan Kemper Jonathan Kemper의 LinkedIn 프로필 보기 2026년 10월 6일 Image description Reflection

핵심 요약

  • AI 스타트업 Reflection이 코딩과 추론을 위해 구축된 첫 번째 오픈 웨이트 모델인 Beam을 공개하며, 순수 성능보다 컴퓨팅 효율성에 중점을 두고 있습니다.
  • Reflection에 따르면, Beam은 토큰당 5,010억 개의 파라미터 중 230억 개만 활성화하며, 3~4배 적은 컴퓨팅을 사용하면서 주요 벤치마크에서 GLM 5.2에 필적합니다.
  • 이 모델은 10,500개의 Nvidia GPU로 4주간 강화 학습을 통해 훈련되었으며, "이번 달 말"에 Apache 2.0 라이선스로 출시될 예정입니다.

AI 기업 Reflection이 첫 번째 무료 공개 모델인 Beam을 발표했습니다. Beam은 최고 성능 추구 대신 최소한의 컴퓨팅으로 강력한 결과를 제공하는 것을 목표로 하며, Deepseek와 Qwen의 중국 오픈 웨이트 모델들과 직접 경쟁합니다.

Reflection은 Beam을 코딩, 논리적 추론, 에이전트 작업을 위해 구축했습니다. 이 mixture-of-experts 모델은 토큰당 총 5,010억 개의 파라미터 중 230억 개를 활성화하여 컴퓨팅 비용을 상대적으로 낮게 유지합니다.

Reflection에 따르면, 까다로운 추론 작업에서 Beam은 3~4배 적은 컴퓨팅을 사용하면서 GLM 5.2 에 필적합니다. 이 회사는 AI를 코딩과 자동화된 워크플로에 사용하면서도 운영 비용을 관리해야 하는 기업들을 목표로 하고 있습니다.

코딩 및 에이전트 벤치마크에서 Beam은 훨씬 더 큰 Qwen3.8-Max에 근접합니다. 이 회사에 따르면, Kimi K3 와 같은 더 강력한 오픈 모델들은 여전히 순수 성능에서 이를 앞섭니다. Reflection은 이미 상위 성능 오픈 모델과의 남은 격차를 해소하는 것을 목표로 하는 후속 모델을 훈련 중이라고 밝혔습니다.Ad

Three scatter plots for DeepSWE v1.1, HLE, and Terminal Bench 2.1 show benchmark scores for Beam, GLM-5.2, Qwen 3.8, Inkling, Nemotron 3 Ultra, and Muse Glimmer plotted against estimated compute cost in PFLOP per attempt.
Reflection에 따르면, 세 벤치마크 전체에서 Beam은 GLM-5.2 및 Qwen 3.8보다 훨씬 적은 컴퓨팅을 사용하면서 비슷한 점수를 기록합니다. | 이미지: Reflection
에이전트 코딩 벤치마크 Beam Inkling Nemotron 3 Ultra GLM 5.2 GLM 5.3 Kimi K3 Qwen 3.8 Max DeepSeek V4.1 Flash
DeepSWE v1.1 44.4 NR NR 44.0 61.0 68.0 51.0 74.2
SWE Bench Pro v2-Hard 77.2 56.9 NR NR 84.3 88.2 NR NR
SWE Bench Pro v1 65.5 54.3 46.4 62.1 NR NR 67.7 NR
Terminal Bench v2.1 80.1 63.8 56.4 81.0 88.2 88.3 86.6 90.6
SWE Atlas Codebase QnA 34.6 NR NR NR 61.0 68.0 NR NR
SWEBench Multilingual 78.0 NR 67.7 NR NR NR NR NR
SWEBench Verified 80.9 77.6 70.7 NR NR NR NR NR

대규모 강화 학습 실행이 Beam의 능력을 한층 끌어올렸습니다

Beam의 성능은 표준적인 대규모 사전 학습과 특히 연산량이 많은 강화 학습 단계의 결합에서 나옵니다. Reflection은 이 강화 학습 단계에서 10,500장의 Nvidia GB300 GPU를 4주 넘게 가동했으며, 이를 오픈 랩이 수행한 것 중 가장 큰 규모의 학습 실행 중 하나라고 밝혔습니다. 성능은 실행이 끝날 때까지 한계에 부딪히지 않고 계속 향상되었습니다.

Three line charts show Beam's scores on DeepSWE, HLE, and Terminal Bench 2.1 climbing steadily as the number of reinforcement learning rollouts increases to over 80 million.
강화 학습 내내 Beam의 벤치마크 점수는 계속 상승했으며, 8,000만 롤아웃을 넘겼을 때에도 정체 조짐은 보이지 않았습니다. | 이미지: Reflection

사용자는 Beam이 문제를 얼마나 깊이 추론할지도 조절할 수 있습니다. 조정 가능한 파라미터를 통해 모델이 빠르게 답할지, 아니면 더 어려운 작업에서 더 많은 시간을 들여 생각할지 선택할 수 있으며, 이는 연산 비용과 출력 품질 사이의 균형을 맞추는 절충안입니다.

Three scatter plots for DeepSWE v1.1, HLE, and Terminal Bench 2.1 show benchmark scores for Beam and competing models plotted against the average number of generated tokens.
생성된 토큰 수로 측정하면, Beam은 비슷한 성능 수준에서 GLM-5.2 및 Qwen 3.8보다 더 효율적으로 작동합니다. | 이미지: Reflection

Reflection은 학습 과정에서 이른바 "창발적 능력"을 관찰했습니다. 추론, 소프트웨어 엔지니어링, 터미널 작업을 혼합한 강화 학습을 진행하는 동안, 회사는 그 학습 혼합에 웹 브라우징 작업이 전혀 포함되지 않았음에도 Beam이 웹 브라우징을 더 잘하게 되는 것을 알아차렸습니다. 웹 접근이 가능해지자 모델은 독자적으로 다른 언어 모델에 질의하고 외부 서비스에서 문서를 가져오는 법을 학습했습니다.

Reflection은 실시간으로 업데이트되는 뉴욕 지하철 노선도, 작은 3D 게임, 다른 AI 모델을 파인튜닝하기 위한 노트북 등 여러 데모를 공유했습니다. Beam은 텍스트 전용이지만, Reflection에 따르면 다른 미디어 형식의 콘텐츠가 텍스트로 표현되기만 하면 처리할 수 있습니다.Ad

별도의 모델이 안전성과 정렬을 담당합니다

안전성과 정렬을 위해 Reflection은 두 번째 모델을 학습시킨 후 이를 Beam과 병합했습니다. 이 가이드라인은 모델이 절대 어겨서는 안 되는 강제 규칙부터 사실 정확성 및 불확실성 인정과 같은 품질 기준, 그리고 직접적이고 철저하며 능동적인 응답 스타일에 이르기까지 다양합니다. 이 회사는 기술 보고서에 안전성 테스트 결과를 게재하고 개발한 평가 방법을 오픈소스로 공개할 계획입니다.

회사에 따르면 기술 보고서, 개발자 문서, 그리고 오픈 Apache 2.0 라이선스로 공개되는 모델 가중치가 "이번 달 말"에 출시될 예정이다. Beam은 아직 최종 안전성 테스트를 진행 중이며, 현재로서는 일부 선정된 사용자에게 초기 버전이 제공되고 있다.

20억 달러의 투자를 받은 전 Deepmind 연구진

Reflection은 2024년 전 Google Deepmind 연구원인 Misha Laskin과 Ioannis Antonoglou가 설립했습니다. Laskin은 Gemini의 보상 모델링을 이끌었고, Antonoglou는 AlphaGo 개발에 기여했습니다. 이 스타트업은 2025년 3월에 출시했으며 130백만 달러의 시드 펀딩 그리고 자율 코딩을 통해 초지능을 구축한다는 목표입니다. 그 비전은 언어 모델이 컴퓨터에 대한 강화 학습을 통해 AlphaGo가 바둑을 두듯이 독립적으로 행동하는 법을 배울 수 있다는 것이었습니다.

2025년 여름, 이 회사는 출시했다 아시모프, 대규모 코드베이스를 분석하는 에이전트입니다. 이어서 Reflection은 80억 달러 기업 가치 평가로 20억 달러 2025년 10월에 Nvidia가 투자자로 참여했으며, 이후 Deepseek와 Qwen에 대응하는 서구의 대안으로 자리매김해 왔습니다. 이 회사는 모델 가중치는 공개하지만 학습 데이터와 파이프라인은 독점적으로 유지하고 있습니다. 최근 Reflection은 SpaceX 및 클라우드 제공업체 Nebius와 수십억 달러 규모의 컴퓨팅 계약을 체결했습니다. SpaceX 및 클라우드 제공업체 Nebius.

과장 없는 AI 뉴스 – 인간이 직접 선별

광고 없는 읽기, 매주 발행되는 AI 뉴스레터, 연 6회 독점 "AI Radar" 프론티어 리포트, 전체 아카이브 접근, 댓글 섹션 이용을 위해 THE DECODER를 구독하세요.

출처: Reflection
원문 출처

The Decoder

내용 안내

원문 발행 및 권리는 출처에 있습니다.

기계 번역 · 원문을 참고하세요