MarkTechPost

开放模型能做安全研究吗?Cantina 的 apex-flash-1 解决了 60 个留出漏洞任务中的 40 个

Cantina Security 与 Yeta Labs 合作发布了 apex-flash-1,这是一个专为漏洞研究训练的开放权重模型。它是 Z.ai 的 GLM-5.3-Flash 的强化学习微调版本,以 MIT 许可证发布在 Hugging Face 上。它可以部署吗?可以,MIT 权重可在 vLLM、SGLang 或 Transformers 上运行,但 BF16 需要大约 640 GB 的 GPU 显存。[…]…

Cantina Security与 Yeta Labs 合作发布了 apex-flash-1,一个专为漏洞研究训练的开放权重模型。它是 Z.ai 的 GLM-5.3-Flash的强化学习微调版本,发布于 Hugging Face ,采用 MIT 许可证。

它可以部署吗? 可以,MIT 权重可在 vLLM、SGLang 或 Transformers 上运行,但 BF16 需要大约 640 GB 的 GPU 显存。

Cantina 构建了什么

根据其 Hugging Face safetensors 元数据,apex-flash-1 拥有 321.3B 总参数。GLM-5.3-Flash 基座是一个拥有 18B 活跃参数的混合专家(Mixture-of-Experts)模型。

Cantina 使用 GRPO 进行训练,采用 rank-256 的 LoRA 加上选择性全参数训练。数据涵盖基于 50 个真实漏洞案例构建的 150 个任务。

每个案例以 3 种变体出现: 引导式白盒、聚焦式白盒和聚焦式黑盒。

授权、身份和范围缺陷占案例的 72%。会计和数值精度漏洞占 18%。其余为时间验证、业务规则和 SSRF。

根据 HF 上的模型卡,RL rollout 在 Codex 代理框架内于类生产软件和协议环境中运行。

基准测试结果

Cantina 评估了来自 20 个留出漏洞案例的 60 个任务。每个模型运行该测试集一次,成本根据提供商定价估算。

  • apex-flash-1: 40/60 解决(66.7% pass@1),约 2.38 美元
  • GLM-5.3-Flash(基座): 36/60 解决(60.0%),约 4.56 美元
  • Claude Opus 5 High: 43/60 解决(71.7%),约 74.68 美元

Opus 多解决了 3 个任务,但每次运行的成本约高出 31 倍。也就是说,apex-flash-1 每解决一个任务约需 0.06 美元,而 Opus 约需 1.74 美元。这些是公司在内部基准测试上报告的数字。

一个执行型模型,而非编排者

Cantina 将 apex-flash-1 定位为由更大模型编排的执行型模型。模型卡列出了代码阅读、工具使用、漏洞利用开发与验证作为目标技能。

一个实验性的 apex-flash-1-abliterated 变体附带了修改后的拒绝行为。该变体未经过单独评估。

Cantina 的理由是,防御者需要能够在本地运行和控制的强大模型。

交互式讲解

对比情况

特性apex-flash-1Aikido Altar-1Cisco Foundation-Sec-8B-ReasoningGLM-5.3-Flash
开发者Cantina Security + Yeta LabsAikido SecurityCisco Foundation AIZ.ai
基础模型GLM-5.3-FlashGLM-5.3(剪枝版)Llama 3.1 8B自主预训练
规模总计321.3B参数,BF16328 GB,INT4(W4A16)8B总计320B参数,激活18B
许可证MIT继承GLM-5.3许可证自定义(见NOTICE.md)MIT
安全方法在50个真实漏洞案例上进行GRPO强化学习专家剪枝(REAP)+ 量化在安全问答上进行指令微调 + RLHF通用基础模型
主要用途智能体漏洞研究工作节点气隙环境下的自主渗透测试SOC分流与威胁防御通用编码与智能体任务
硬件多GPU节点(约642 GB BF16权重)4x H200 搭配 vLLM单GPU多GPU节点
已发表的安全研究成果66.7% pass@1,60项任务60.4% 召回率,32-CVE 内部测试集思科发布的安全基准在 Cantina 的测试集上为 60.0%

来源: Cantina, Aikido, Cisco, Hugging Face 模型卡。© Marktechpost

要点

  • apex-flash-1 是一个 321.3B 参数的开源权重安全模型,采用 MIT 许可证。
  • 在 50 个真实漏洞案例上进行 GRPO 训练,生成了 150 个任务。
  • 它取得了 66.7% 的 pass@1,而 Claude Opus 5 High 为 71.7%。
  • 其 60 个任务的运行成本约为 2.38美元,而 Opus 为 74.68美元。
  • BF16 需要多 GPU 节点;社区已有 4-bit 移植版本。


查看 技术细节。所有功劳归于该项目的研究者。同时,欢迎在 Twitter 上关注我们,别忘了加入我们的 150k+ML SubReddit 并订阅 我们的通讯。等等!你在用 telegram 吗? 现在你也可以在 telegram 上加入我们。

需要与我们合作推广你的 GitHub 仓库、Hugging Face 页面、产品发布或网络研讨会等吗? 与我们联系

文章 开放模型能做安全研究吗?Cantina 的 apex-flash-1 在 60 个保留漏洞任务中解决了 40 个 首发于 MarkTechPost.

原始出处

MarkTechPost

内容说明

原始发布及相关权利归来源方。

机器翻译 · 请以原文为准