The Decoder

يصبح Beam من Reflection النموذج الأكثر قدرة بين نماذج الأوزان المفتوحة المبنية خارج الصين

أطلقت Reflection نموذج Beam، أول نماذجها ذات الأوزان المفتوحة. يعمل نظام مزيج الخبراء بتنشيط 23 مليار فقط من أصل 501 مليار معامل لكل رمز، ويهدف إلى مجاراة GLM 5.2 في البرمجة والاستدلال مع استخدام قدر من الحوسبة أقل بثلاث…

Jonathan Kemper
مصدر الصورة · The Decoder

يصبح Beam من Reflection النموذج الأكثر قدرة بين نماذج الأوزان المفتوحة المبنية خارج الصين

Jonathan Kemper جوناثان كيمبر عرض ملف Jonathan Kemper على LinkedIn 6 أكتوبر 2026 Image description Reflection

النقاط الرئيسية

  • تطلق شركة الذكاء الاصطناعي الناشئة Reflection نموذج Beam، أول نماذجها ذات الأوزان المفتوحة المخصص للبرمجة والاستدلال، مع تركيز على كفاءة الحوسبة بدلاً من الأداء الخام.
  • ينشّط Beam 23 مليار فقط من أصل 501 مليار معامل لكل رمز، ويضاهي GLM 5.2 في المعايير المرجعية الرئيسية مع استخدام قدر من الحوسبة أقل بثلاث إلى أربع مرات، وفقًا لـ Reflection.
  • تم تدريب النموذج بالتعلم المعزز على 10,500 وحدة معالجة رسومية من Nvidia على مدى أربعة أسابيع. وسيصدر "في وقت لاحق من هذا الشهر" بموجب ترخيص Apache 2.0.

أعلنت شركة الذكاء الاصطناعي Reflection عن نموذج Beam، أول نماذجها المتاحة مجانًا. وبدلاً من ملاحقة الأداء الأقصى، يهدف Beam إلى تحقيق نتائج قوية بأقل قدر من الحوسبة، مما يضعه في منافسة مباشرة مع نماذج الأوزان المفتوحة الصينية من Deepseek وQwen.

بُني Beam من Reflection للبرمجة والاستدلال المنطقي والمهام الوكيلة. ينشّط نموذج مزيج الخبراء 23 مليار من أصل 501 مليار معامل إجمالي لكل رمز، مما يحافظ على انخفاض نسبي لتكاليف الحوسبة.

في مهام الاستدلال الصعبة، يضاهي Beam GLM 5.2 مع استخدام قدر من الحوسبة أقل بثلاث إلى أربع مرات، وفقًا لـ Reflection. وتستهدف الشركة الشركات التي تستخدم الذكاء الاصطناعي للبرمجة وسير العمل الآلي لكنها تحتاج إلى إبقاء التكاليف التشغيلية تحت السيطرة.

في معايير البرمجة والوكلاء المرجعية، يقترب Beam أيضًا من النموذج الأكبر بكثير Qwen3.8-Max. أما النماذج المفتوحة الأقوى مثل Kimi K3 فما تزال تتفوق عليه في الأداء الخام، بحسب الشركة. وتقول Reflection إنها تدرب بالفعل نموذجًا خلفًا يهدف إلى تقليص الفجوة المتبقية مع النماذج المفتوحة الأعلى أداءً.إعلان

Three scatter plots for DeepSWE v1.1, HLE, and Terminal Bench 2.1 show benchmark scores for Beam, GLM-5.2, Qwen 3.8, Inkling, Nemotron 3 Ultra, and Muse Glimmer plotted against estimated compute cost in PFLOP per attempt.
عبر المعايير المرجعية الثلاثة، يحقق Beam درجات مماثلة مع استخدام قدر أقل بكثير من الحوسبة مقارنة بـ GLM-5.2 وQwen 3.8، وفقًا لـ Reflection. | الصورة: Reflection
معايير البرمجة الوكيلة المرجعية Beam Inkling Nemotron 3 Ultra GLM 5.2 GLM 5.3 Kimi K3 Qwen 3.8 Max DeepSeek V4.1 Flash
DeepSWE v1.1 44.4 NR NR 44.0 61.0 68.0 51.0 74.2
SWE Bench Pro v2-Hard 77.2 56.9 NR NR 84.3 88.2 NR NR
SWE Bench Pro v1 65.5 54.3 46.4 62.1 NR NR 67.7 NR
Terminal Bench v2.1 80.1 63.8 56.4 81.0 88.2 88.3 86.6 90.6
SWE Atlas Codebase QnA 34.6 NR NR NR 61.0 68.0 NR NR
SWEBench Multilingual 78.0 NR 67.7 NR NR NR NR NR
SWEBench Verified 80.9 77.6 70.7 NR NR NR NR NR

جولة تعلم معزز ضخمة عززت قدرات Beam

تحصل Beam على قدراتها من مزيج من التدريب المسبق واسع النطاق القياسي ومرحلة تعلم معزز تستهلك قدراً كبيراً من الحوسبة بشكل خاص. تقول Reflection إنها شغّلت 10,500 من وحدات Nvidia GB300 لأكثر من أربعة أسابيع خلال مرحلة التعلم المعزز تلك، ووصفتها بأنها واحدة من أكبر جولات التدريب التي أنجزها أي مختبر مفتوح. ظل الأداء يتحسن حتى نهاية الجولة دون أن يصطدم بسقف.

Three line charts show Beam's scores on DeepSWE, HLE, and Terminal Bench 2.1 climbing steadily as the number of reinforcement learning rollouts increases to over 80 million.
استمرت درجات Beam في المعايير القياسية في الارتفاع طوال التعلم المعزز، دون أي علامات على الاستقرار حتى عند تجاوز 80 مليون محاولة. | الصورة: Reflection

يمكن للمستخدمين أيضاً التحكم في مدى عمق تفكير Beam في المسألة. تتيح لك معامل قابل للضبط اختيار ما إذا كان النموذج سيجيب بسرعة أم يأخذ وقتاً أطول للتفكير في المهام الأصعب، في موازنة بين تكلفة الحوسبة وجودة المخرجات.

Three scatter plots for DeepSWE v1.1, HLE, and Terminal Bench 2.1 show benchmark scores for Beam and competing models plotted against the average number of generated tokens.
إذا قِيس بعدد الرموز المولدة، تعمل Beam أيضاً بكفاءة أكبر من GLM-5.2 وQwen 3.8 عند مستويات أداء مماثلة. | الصورة: Reflection

لاحظت Reflection ما تسميه "قدرات ناشئة" أثناء التدريب. أثناء تشغيل مزيج تعلم معزز من مهام الاستدلال وهندسة البرمجيات والمهام الطرفية، لاحظت الشركة أن Beam تتحسن في تصفح الويب رغم أن مهام التصفح لم تكن جزءاً من ذلك المزيج التدريبي. ومع الوصول إلى الويب، تعلم النموذج من تلقاء نفسه كيفية الاستعلام عن نماذج لغوية أخرى وسحب المستندات من خدمات خارجية.

شاركت Reflection عدة عروض توضيحية، منها خريطة مترو أنفاق مدينة نيويورك تُحدَّث مباشرةً، ولعبة 3D صغيرة، ودفتر ملاحظات لضبط نموذج ذكاء اصطناعي آخر. تعمل Beam بالنصوص فقط، لكن Reflection تقول إنها تستطيع معالجة محتوى من صيغ وسائط أخرى ما دامت ممثلة كنصوص.Ad

يتولى نموذج منفصل أمور السلامة والمواءمة

من أجل السلامة والمواءمة، درّبت Reflection نموذجًا ثانيًا ودمجته مع Beam. تمتد الإرشادات من قواعد صارمة لا يجوز للنموذج خرقها أبدًا إلى معايير جودة مثل الدقة الوقائعية والاعتراف بعدم اليقين، إلى جانب أسلوب استجابة مباشر وشامل واستباقي. وتخطط الشركة لنشر نتائج اختبارات السلامة الخاصة بها في تقرير تقني وإتاحة طرق التقييم التي طوّرتها كمصدر مفتوح.

أفادت الشركة بأن تقريراً تقنياً ووثائق للمطورين وأوزان النموذج بموجب ترخيص Apache 2.0 المفتوح ستُتاح "في وقت لاحق من هذا الشهر". ما زال Beam يمرّ باختبارات السلامة النهائية، وتتوفر نسخة مبكرة منه حالياً لمجموعة مختارة من المستخدمين.

باحثون سابقون في Deepmind بدعم بقيمة 2 مليار دولار

تأسست Reflection عام 2024 على يد الباحثين السابقين في Google Deepmind ميشا لاسكين ويوانيس أنطونوغلو. قاد لاسكين عمل نمذجة المكافآت لـ Gemini، وساهم أنطونوغلو في بناء AlphaGo. أطلقت الشركة الناشئة نشاطها في مارس 2025 بـ 130 مليون دولار تمويلاً أولياً بهدف بناء الذكاء الفائق من خلال البرمجة المستقلة. كانت الرؤية هي أن تتعلم نماذج اللغة التصرف باستقلالية مثلما يلعب AlphaGo لعبة Go، باستخدام التعلم المعزز على أجهزة الكمبيوتر.

في صيف 2025، أطلقت الشركة Asimov، وهو وكيل لتحليل قواعد الشيفرة البرمجية الكبيرة. ثم جمعت Reflection 2 مليار دولار بتقييم قدره 8 مليارات دولار في أكتوبر 2025، مع وجود Nvidia بين المستثمرين، ومنذ ذلك الحين ترسّخت مكانتها كنظير غربي لـ Deepseek وQwen. تُصدر الشركة أوزان نماذجها لكنها تحتفظ ببيانات التدريب وخطوط المعالجة كملكية خاصة. وعلى نحو أحدث، وقّعت Reflection صفقات حوسبة بمليارات الدولارات مع SpaceX ومزوّد الخدمات السحابية Nebius.

أخبار الذكاء الاصطناعي بلا ضجيج – بانتقاء بشري

اشترك في THE DECODER للحصول على قراءة خالية من الإعلانات، ونشرة أسبوعية عن الذكاء الاصطناعي، وتقريرنا الحصري "AI Radar" عن أحدث التطورات ست مرات في السنة، ووصول كامل إلى الأرشيف، وإلى قسم التعليقات لدينا.

المصدر: Reflection
المصدر الأصلي

The Decoder

ملاحظات المحتوى

النشر الأصلي والحقوق تعود إلى المصدر.

ترجمة آلية · يُرجى الرجوع إلى الأصل