Cantina Security، بالتعاون مع Yeta Labs، أصدرت apex-flash-1، وهو نموذج بأوزان مفتوحة تم تدريبه خصيصًا لأبحاث الثغرات الأمنية. وهو ضبط دقيق بالتعلم المعزز لنموذج GLM-5.3-Flashمن Z.ai، تم إصداره على Hugging Face بموجب رخصة MIT.
هل يمكن نشره؟ نعم، تخدم أوزان MIT على vLLM أو SGLang أو Transformers، لكن BF16 يحتاج إلى حوالي 640 GB من ذاكرة GPU.
ما بنيته Cantina
يحتوي apex-flash-1 على 321.3B معامل إجمالي، وفقًا لبيانات safetensors الوصفية الخاصة به على Hugging Face. الأساس GLM-5.3-Flash هو نموذج Mixture-of-Experts مع 18B معامل نشط.
دربته Cantina باستخدام GRPO باستخدام رتبة 256 LoRA من رتبة 256 بالإضافة إلى تدريب انتقائي لكل المعاملات. تغطي البيانات 150 مهمة مبنية من 50 حالة ثغرة حقيقية.
تظهر كل حالة في 3 صيغ: whitebox موجّه، وwhitebox مركّز، وblackbox مركّز.
تشكل عيوب التخويل والهوية والنطاق 72% من الحالات. تضيف أخطاء المحاسبة والدقة العددية 18%. وتغطي التحقق الزمني وقواعد الأعمال وSSRF الباقي.
وفقًا لبطاقة النموذج على HF، جرت عمليات RL rollouts داخل هيكل وكيل Codex على بيئات برمجيات وبروتوكولات شبيهة بالإنتاج.
نتائج المعايير المرجعية
قيّمت Cantina 60 مهمة من 20 حالة ثغرة محتجزة. شغّل كل نموذج المجموعة مرة واحدة، مع تقدير التكاليف من أسعار المزودين.
- apex-flash-1: 40/60 محلولة (66.7% pass@1)، حوالي $2.38
- GLM-5.3-Flash (الأساس): 36/60 محلولة (60.0%)، حوالي $4.56
- Claude Opus 5 High: حلّ 43/60 مهمة (71.7%)، بتكلفة نحو 74.68 دولارًا
حلّ Opus 3 مهام إضافية لكنه كلّف نحو 31 ضعفًا أكثر لكل تشغيل. أي ما يعادل تقريبًا 0.06 دولار لكل مهمة محلولة لـ apex-flash-1 مقابل 1.74 دولار لـ Opus. وهذه أرقام أعلنتها الشركة على معيار قياس داخلي.
نموذج عامل، لا منسّق
تقدّم Cantina نموذج apex-flash-1 كعامل يُنسَّق بواسطة نموذج أكبر. وتدرج البطاقة قراءة الشيفرة، واستخدام الأدوات، وتطوير الاستغلالات، والتحقق كمهارات مستهدفة.
ويسوق نموذج تجريبي apex-flash-1-abliterated بسلوك رفض معدّل. ولم يُقيَّم بشكل منفصل.
وتبرير Cantina هو أن المدافعين يحتاجون إلى نماذج قادرة يمكنهم تشغيلها والتحكم بها محليًا.
شرح تفاعلي
كيف يقارن
| الميزة | apex-flash-1 | Aikido Altar-1 | Cisco Foundation-Sec-8B-Reasoning | GLM-5.3-Flash |
|---|---|---|---|---|
| المطوّر | Cantina Security + Yeta Labs | Aikido Security | Cisco Foundation AI | Z.ai |
| النموذج الأساسي | GLM-5.3-Flash | GLM-5.3 (مُقلَّص) | Llama 3.1 8B | تدريب مسبق خاص |
| الحجم | 321.3B إجمالي، BF16 | 328 GB، INT4 (W4A16) | 8B | 320B إجمالي، 18B نشِط |
| الترخيص | MIT | يرث ترخيص GLM-5.3 | مخصص (انظر NOTICE.md) | MIT |
| طريقة الأمان | GRPO RL على 50 حالة ثغرة حقيقية | تقليم الخبراء (REAP) + التكميم | ضبط التعليمات + RLHF على أسئلة أمنية | أساس متعدد الأغراض |
| الاستخدام الأساسي | وكيل بحث أجنتي عن الثغرات | اختبار اختراق ذاتي معزول عن الإنترنت | فرز SOC والدفاع ضد التهديدات | البرمجة العامة والوكلاء |
| العتاد | عقدة متعددة GPUs (~642 GB أوزان BF16) | 4x H200 مع vLLM | GPU واحد | عقدة متعددة GPUs |
| النتيجة الأمنية المنشورة | 66.7% pass@1، 60 مهمة | 60.4% استرجاع، مجموعة داخلية من 32 ثغرة CVE | معايير أمنية أبلغت عنها Cisco | 60.0% على مجموعة Cantina |
المصادر: Cantina, Aikido, Cisco، وبطاقات نماذج Hugging Face. © Marktechpost
أهم النقاط
- apex-flash-1 هو نموذج أمني مفتوح الأوزان بحجم 321.3B بموجب ترخيص MIT.
- تدريب GRPO على 50 حالة ثغرة حقيقية أنتج 150 مهمة.
- حقق 66.7% pass@1 مقارنة بـ 71.7% لـ Claude Opus 5 High.
- كلف تشغيله للمهام الـ 60 حوالي $2.38 مقابل $74.68 لـ Opus.
- يتطلب BF16 عقدة متعددة وحدات GPU؛ وهناك منافذ 4-bit من المجتمع.
اطلع على التفاصيل التقنية. كل الفضل يعود إلى الباحث في هذا المشروع. كما لا تتردد في متابعتنا على Twitter ولا تنسَ الانضمام إلى 150k+ML SubReddit والاشتراك في نشرتنا البريدية. مهلاً! هل أنت على تليجرام؟ يمكنك الآن الانضمام إلينا على تليجرام أيضًا.
هل تحتاج إلى الشراكة معنا للترويج لمستودع GitHub الخاص بك أو صفحتك على Hugging Face أو إطلاق منتج أو ندوة عبر الإنترنت وغيرها؟ تواصل معنا
ظهر المقال هل يمكن لنموذج مفتوح القيام بأبحاث أمنية؟ apex-flash-1 من Cantina يحل 40 من أصل 60 مهمة ثغرات محفوظة أول مرة على MarkTechPost.