Cantina Security, en colaboración con Yeta Labs, ha lanzado apex-flash-1, un modelo de pesos abiertos entrenado específicamente para la investigación de vulnerabilidades. Se trata de una adaptación del aprendizaje refuerzado de GLM-5.3-Flash de Z.ai, publicado en Hugging Face bajo la licencia MIT.
¿Es despliable? Sí, los pesos de MIT funcionan en vLLM, SGLang o Transformers, pero BF16 requiere aproximadamente 640 GB de memoria de GPU.
Lo que Cantina construyó
apex-flash-1 tiene un total de 321.3B parámetros, según los metadatos de Hugging Face safetensors. La base GLM-5.3-Flash es un modelo Mixture-of-Experts con 18B parámetros activos.
La cantina lo entrenó con GRPO utilizando un LoRA de rango 256, además de entrenamiento selectivo de parámetros completos. Los datos abarcan 150 tareas construidas a partir de 50 casos reales de vulnerabilidad.
Cada caso aparece en 3 variantes: whitebox guiado, whitebox enfocado y blackbox enfocado.
Los defectos de autorización, identidad y alcance representan el 72% de los casos. Los errores en el cálculo y la precisión numérica suman el 18%. La validación del tiempo, las reglas de negocio y SSRF abarcan el resto.
De acuerdo con la tarjeta de modelo en HF, las pruebas de despliegue de RL se realizaron dentro del Codex agent harness en entornos de software y protocolo similares a la producción.
Resultados del benchmark
Cantina evaluó 60 tareas de 20 casos de vulnerabilidad excedentes. Cada modelo ejecutó el conjunto una vez, con los costos estimados a partir de los precios del proveedor.
- apex-flash-1: 40/60 resuelto (66.7% paso@1), aproximadamente $2.38
- GLM-5.3-Flash (base): 36/60 resuelto (60.0%), aproximadamente $4.56
- Claude Opus 5 High: 43/60 resuelto (71.7%), aproximadamente $74.68
Opus resolvió 3 tareas adicionales, pero cuesta aproximadamente 31 veces más por ejecución. Es decir, aproximadamente $0.06 por tarea resuelta para apex-flash-1, en comparación con $1.74 para Opus. Estos son números reportados por la empresa en un benchmark interno.
Un modelo de trabajador, no un orquestador
La posición de Cantina en apex-flash-1 es una tarea organizada por un modelo más grande. La tarjeta enumera la lectura de código, el uso de herramientas, el desarrollo y la verificación de exploits como habilidades objetivo.
Un variante experimental de apex-flash-1-abliterated se entrega con un comportamiento de rechazo modificado. No fue evaluada por separado.
La razón de Cantina es que los defensores necesitan modelos capaces que puedan ejecutarse y controlarse localmente.
Explicador interactivo
¿Cómo se compara?
| Característica | apex-flash-1 | Aikido Altar-1 | Cisco Foundation-Sec-8B-Reasoning | GLM-5.3-Flash |
|---|---|---|---|---|
| Desarrollador | Cantina Security + Yeta Labs | Aikido Security | AI de la Fundación Cisco | Z.ai |
| Modelo base | GLM-5.3-Flash | GLM-5.3 (reescurrido) | Llama 3.1 8B | Pre-entrenamiento propio |
| Tamaño | 321.3B en total, BF16 | 328 GB, INT4 (W4A16) | 8B | 320B en total, 18B activos |
| Licencia | MIT | Hereda la licencia GLM-5.3 | Personalizado (ver NOTICE.md) | MIT |
| Método de seguridad | GRPO RL en 50 casos reales de vulnerabilidad | Pruning experto (REAP) + cuantización | Instrucción de ajuste + RLHF en calidad de preguntas de seguridad | Base de uso general |
| Uso principal | Trabajador de investigación sobre vulnerabilidades agenticas | Pruebas de penetración autónomas sin conexión a internet | Triage de SOC y defensa contra amenazas | Codificación general y agentes |
| Hardware | Nodo Multi-GPU (~642 GB de pesos BF16) | 4x H200 con vLLM | Una GPU única | Nodo Multi-GPU |
| Resultado de seguridad publicado | 66.7% pasan@1, 60 tareas | 60.4% recuerda, 32-CVE conjunto interno | Benchmarks de seguridad reportados por Cisco | 60.0% en el set de Cantina |
Fuentes: Cantina, Aikido, Cisco, tarjetas de modelos de Hugging Face. © Marktechpost
Conceptos Clave
- apex-flash-1 es un modelo de seguridad de pesos abiertos de 321.3B bajo MIT.
- La capacitación GRPO en 50 casos de vulnerabilidad real generó 150 tareas.
- Obtuvo un 66.7% en pass@1, frente a un 71.7% para Claude Opus 5 High.
- El costo de ejecución de sus 60 tareas es de aproximadamente $2.38, en comparación con $74.68 para Opus.
- BF16 necesita un nodo multi-GPU; existen puertos de 4 bits para la comunidad.
Echa un vistazo a detalles técnicos. Todo el crédito pertenece al investigador de este proyecto. Además, no dudes en seguirnos en Twitter y no olvides unirte a nuestro subreddit de 150k+ ML y suscribirte a nuestro boletín informativo. ¡Espera! ¿Estás en Telegram? Ahora puedes unirte a nosotros en Telegram también.
¿Necesita asociarse con nosotros para promocionar su repositorio de GitHub, página de Hugging Face, lanzamiento de producto o webinario, etc.? Conéctese con nosotros
El artículo ¿Puede un modelo abierto realizar investigación de seguridad? Cantina’s apex-flash-1 resuelve 40 de 60 tareas de errores mantenidas apareció primero en MarkTechPost.