Cantina Security与 Yeta Labs 合作发布了 apex-flash-1,一个专为漏洞研究训练的开放权重模型。它是 Z.ai 的 GLM-5.3-Flash的强化学习微调版本,发布于 Hugging Face ,采用 MIT 许可证。
它可以部署吗? 可以,MIT 权重可在 vLLM、SGLang 或 Transformers 上运行,但 BF16 需要大约 640 GB 的 GPU 显存。
Cantina 构建了什么
根据其 Hugging Face safetensors 元数据,apex-flash-1 拥有 321.3B 总参数。GLM-5.3-Flash 基座是一个拥有 18B 活跃参数的混合专家(Mixture-of-Experts)模型。
Cantina 使用 GRPO 进行训练,采用 rank-256 的 LoRA 加上选择性全参数训练。数据涵盖基于 50 个真实漏洞案例构建的 150 个任务。
每个案例以 3 种变体出现: 引导式白盒、聚焦式白盒和聚焦式黑盒。
授权、身份和范围缺陷占案例的 72%。会计和数值精度漏洞占 18%。其余为时间验证、业务规则和 SSRF。
根据 HF 上的模型卡,RL rollout 在 Codex 代理框架内于类生产软件和协议环境中运行。
基准测试结果
Cantina 评估了来自 20 个留出漏洞案例的 60 个任务。每个模型运行该测试集一次,成本根据提供商定价估算。
- apex-flash-1: 40/60 解决(66.7% pass@1),约 2.38 美元
- GLM-5.3-Flash(基座): 36/60 解决(60.0%),约 4.56 美元
- Claude Opus 5 High: 43/60 解决(71.7%),约 74.68 美元
Opus 多解决了 3 个任务,但每次运行的成本约高出 31 倍。也就是说,apex-flash-1 每解决一个任务约需 0.06 美元,而 Opus 约需 1.74 美元。这些是公司在内部基准测试上报告的数字。
一个执行型模型,而非编排者
Cantina 将 apex-flash-1 定位为由更大模型编排的执行型模型。模型卡列出了代码阅读、工具使用、漏洞利用开发与验证作为目标技能。
一个实验性的 apex-flash-1-abliterated 变体附带了修改后的拒绝行为。该变体未经过单独评估。
Cantina 的理由是,防御者需要能够在本地运行和控制的强大模型。
交互式讲解
对比情况
| 特性 | apex-flash-1 | Aikido Altar-1 | Cisco Foundation-Sec-8B-Reasoning | GLM-5.3-Flash |
|---|---|---|---|---|
| 开发者 | Cantina Security + Yeta Labs | Aikido Security | Cisco Foundation AI | Z.ai |
| 基础模型 | GLM-5.3-Flash | GLM-5.3(剪枝版) | Llama 3.1 8B | 自主预训练 |
| 规模 | 总计321.3B参数,BF16 | 328 GB,INT4(W4A16) | 8B | 总计320B参数,激活18B |
| 许可证 | MIT | 继承GLM-5.3许可证 | 自定义(见NOTICE.md) | MIT |
| 安全方法 | 在50个真实漏洞案例上进行GRPO强化学习 | 专家剪枝(REAP)+ 量化 | 在安全问答上进行指令微调 + RLHF | 通用基础模型 |
| 主要用途 | 智能体漏洞研究工作节点 | 气隙环境下的自主渗透测试 | SOC分流与威胁防御 | 通用编码与智能体任务 |
| 硬件 | 多GPU节点(约642 GB BF16权重) | 4x H200 搭配 vLLM | 单GPU | 多GPU节点 |
| 已发表的安全研究成果 | 66.7% pass@1,60项任务 | 60.4% 召回率,32-CVE 内部测试集 | 思科发布的安全基准 | 在 Cantina 的测试集上为 60.0% |
来源: Cantina, Aikido, Cisco, Hugging Face 模型卡。© Marktechpost
要点
- apex-flash-1 是一个 321.3B 参数的开源权重安全模型,采用 MIT 许可证。
- 在 50 个真实漏洞案例上进行 GRPO 训练,生成了 150 个任务。
- 它取得了 66.7% 的 pass@1,而 Claude Opus 5 High 为 71.7%。
- 其 60 个任务的运行成本约为 2.38美元,而 Opus 为 74.68美元。
- BF16 需要多 GPU 节点;社区已有 4-bit 移植版本。
查看 技术细节。所有功劳归于该项目的研究者。同时,欢迎在 Twitter 上关注我们,别忘了加入我们的 150k+ML SubReddit 并订阅 我们的通讯。等等!你在用 telegram 吗? 现在你也可以在 telegram 上加入我们。
需要与我们合作推广你的 GitHub 仓库、Hugging Face 页面、产品发布或网络研讨会等吗? 与我们联系
文章 开放模型能做安全研究吗?Cantina 的 apex-flash-1 在 60 个保留漏洞任务中解决了 40 个 首发于 MarkTechPost.