El Reflection’s Beam se convierte en el modelo de peso abierto más capaz construido fuera de China
Jonathan Kemper
Ver el perfil de LinkedIn de Jonathan Kemper
6 de octubre de 2026
ReflexiónPuntos clave
- La startup de IA Reflection está lanzando Beam, su primer modelo de peso abierto diseñado para codificación y razonamiento, con un enfoque en la eficiencia computacional más que en el rendimiento bruto.
- Según Reflection, Beam activa solo 23 mil millones de sus 501 mil millones de parámetros por token, y se compara con GLM 5.2 en los principales criterios de evaluación, utilizando tres a cuatro veces menos recursos computacionales.
- El modelo se entrenó con aprendizaje por refuerzo en 10,500 GPU Nvidia durante cuatro semanas. Se lanzará “más tarde este mes” bajo la licencia Apache 2.0.
La empresa de IA Reflection ha anunciado Beam, su primer modelo disponible libremente. En lugar de buscar un rendimiento máximo, Beam tiene como objetivo ofrecer resultados sólidos con un consumo mínimo de recursos computacionales, lo que lo coloca en competencia directa con los modelos chinos de peso abierto de Deepseek y Qwen.
La reflexión construye Beam para codificación, razonamiento lógico y tareas agenticas. El modelo de mezcla de expertos activa 23 mil millones de sus 501 mil millones de parámetros totales por token, manteniendo los costos de computación relativamente bajos.
En tareas de razonamiento exigentes, Beam comparte GLM 5.2 mientras utiliza tres a cuatro veces menos potencia computacional, según Reflection. La empresa apunta a empresas que utilizan IA para el código y los flujos de trabajo automatizados, pero necesitan controlar sus costos operativos.
En cuanto a los puntajes de codificación y agentes, Beam también se acerca al mucho más grande Qwen3.8-Max. Modelos abiertos más potentes como Kimi K3 todavía lo superan en rendimiento bruto, según la compañía. Reflection dice que ya está entrenando un sucesor cuyo objetivo es cerrar el espacio restante con los modelos abiertos de mayor rendimiento.

| Marcadores de referencia de codificación agentica | Línea de pago | Inkling | Nemotron 3 Ultra | GLM 5.2 | GLM 5.3 | Kimi K3 | Qwen 3.8 Max | DeepSeek V4.1 Flash |
|---|---|---|---|---|---|---|---|---|
| DeepSWE v1.1 | 44.4 | NR | NR | 44.0 | 61.0 | 68.0 | 51.0 | 74.2 |
| SWE Bench Pro v2-Hard | 77.2 | 56.9 | NR | NR | 84.3 | 88.2 | NR | NR |
| SWE Bench Pro v1 | 65.5 | 54.3 | 46.4 | 62.1 | NR | NR | 67.7 | NR |
| Terminal Bench v2.1 | 80.1 | 63.8 | 56.4 | 81.0 | 88.2 | 88.3 | 86.6 | 90.6 |
| SWE Atlas Codebase Preguntas y Respuestas | 34.6 | NR | NR | NR | 61.0 | 68.0 | NR | NR |
| SWEBench Multilingüe | 78.0 | NR | 67.7 | NR | NR | NR | NR | NR |
| SWEBench Verified | 80.9 | 77.6 | 70.7 | NR | NR | NR | NR | NR |
Reinforamiento masivo del aprendizaje automático que impulsa las habilidades de Beam
El Beam obtiene sus capacidades de una combinación de preentrenamiento a gran escala estándar y una fase de aprendizaje por refuerzo especialmente intensiva en computación. La reflexión indica que se utilizaron 10,500 GPU Nvidia GB300 durante más de cuatro semanas en esa fase de RL, considerándola una de las operaciones de entrenamiento más grandes que haya realizado cualquier laboratorio abierto. El rendimiento continuó mejorando hasta el final de la operación, sin alcanzar un límite.

Los usuarios también pueden controlar hasta qué punto Beam analiza un problema. Un parámetro ajustable les permite elegir si el modelo responde rápidamente o tarda más tiempo en pensar sobre tareas más complejas, equilibrando el costo de cálculo con la calidad del resultado.

La reflexión observó lo que llama "capacidades emergentes" durante el entrenamiento. Al ejecutar una combinación de razonamiento, ingeniería de software y tareas terminal basada en RL, la empresa notó que Beam mejoraba en la navegación web, aunque no había tareas de navegación incluidas en esa combinación de entrenamiento. Con acceso a internet, el modelo aprendió de forma independiente a consultar otros modelos de lenguaje y a obtener documentos de servicios externos.
Reflection compartió varias demostraciones, incluyendo un mapa del metro de Nueva York que se actualiza en tiempo real, un pequeño juego 3D y un cuaderno para ajustar otro modelo de IA. Beam es solo texto, pero Reflection dice que puede procesar contenido de otros formatos de medios, siempre y cuando estén representados como texto.
Un modelo separado se encarga de la seguridad y el alineamiento
Por motivos de seguridad y alineación, Reflection entrenó un segundo modelo y lo fusionó con Beam. Las directrices abarcan desde reglas estrictas que el modelo nunca debe romper hasta estándares de calidad como precisión factual y reconocimiento de la incertidumbre, además de un estilo de respuesta directo, exhaustivo y proactivo. La empresa planea publicar los resultados de sus pruebas de seguridad en un informe técnico y hacer accesibles de forma abierta los métodos de evaluación que desarrolló.
Un informe técnico, documentación para desarrolladores y pesos de modelo bajo la licencia abierta Apache 2.0 están programados para ser distribuidos “más tarde este mes”, según la empresa. Beam todavía está pasando por pruebas de seguridad finales, y una versión preliminar está disponible para usuarios selectos por ahora.
Ex investigadores de Deepmind respaldados por 2 mil millones de dólares
Reflection fue fundada en 2024 por Misha Laskin y Ioannis Antonoglou, ex investigadores de Google Deepmind. Laskin lideró el modelado de recompensas para Gemini, y Antonoglou ayudó a desarrollar AlphaGo. La startup se lanzó en marzo de 2025 con 130 millones de dólares en financiación inicial, y su objetivo era desarrollar una superinteligencia a través de codificación autónoma. La visión era que los modelos de lenguaje pudieran aprender a actuar de manera independiente, al igual que AlphaGo juega al Go, utilizando el aprendizaje por refuerzo en ordenadores.
En verano de 2025, la empresa lanzó Asimov, un agente para analizar grandes bases de código. Luego, en octubre de 2025, Reflection recaudó $2 mil millones con una valoración de $8 mil millones, y Nvidia fue uno de los inversores. Desde entonces, se ha posicionado como una alternativa occidental a Deepseek y Qwen. La empresa publica las pesas de sus modelos, pero mantiene los datos de entrenamiento y los pipelines como propiedad exclusiva. Recientemente, Reflection firmó acuerdos de computación por mil millones de dólares con SpaceX y el proveedor de cloud Nebius.
Noticias sobre IA Sin Eufemismos – Seleccionadas por humanos
Suscríbase a THE DECODER para leer sin anuncios, un boletín semanal sobre IA, nuestro informe exclusivo “AI Radar” seis veces al año, acceso completo al archivo y acceso a nuestra sección de comentarios.
Fuente: Reflection