MarkTechPost

¿Puede un modelo abierto realizar investigación de seguridad? El apex-flash-1 de Cantina resuelve 40 de 60 tareas de errores mantenidas.

Cantina Security, en colaboración con Yeta Labs, ha lanzado apex-flash-1, un modelo de pesos abiertos entrenado específicamente para la investigación de vulnerabilidades. Se trata de una adaptación del aprendizaje…

Cantina Security, en colaboración con Yeta Labs, ha lanzado apex-flash-1, un modelo de pesos abiertos entrenado específicamente para la investigación de vulnerabilidades. Se trata de una adaptación del aprendizaje refuerzado de GLM-5.3-Flash de Z.ai, publicado en Hugging Face bajo la licencia MIT.

¿Es despliable? Sí, los pesos de MIT funcionan en vLLM, SGLang o Transformers, pero BF16 requiere aproximadamente 640 GB de memoria de GPU.

Lo que Cantina construyó

apex-flash-1 tiene un total de 321.3B parámetros, según los metadatos de Hugging Face safetensors. La base GLM-5.3-Flash es un modelo Mixture-of-Experts con 18B parámetros activos.

La cantina lo entrenó con GRPO utilizando un LoRA de rango 256, además de entrenamiento selectivo de parámetros completos. Los datos abarcan 150 tareas construidas a partir de 50 casos reales de vulnerabilidad.

Cada caso aparece en 3 variantes: whitebox guiado, whitebox enfocado y blackbox enfocado.

Los defectos de autorización, identidad y alcance representan el 72% de los casos. Los errores en el cálculo y la precisión numérica suman el 18%. La validación del tiempo, las reglas de negocio y SSRF abarcan el resto.

De acuerdo con la tarjeta de modelo en HF, las pruebas de despliegue de RL se realizaron dentro del Codex agent harness en entornos de software y protocolo similares a la producción.

Resultados del benchmark

Cantina evaluó 60 tareas de 20 casos de vulnerabilidad excedentes. Cada modelo ejecutó el conjunto una vez, con los costos estimados a partir de los precios del proveedor.

  • apex-flash-1: 40/60 resuelto (66.7% paso@1), aproximadamente $2.38
  • GLM-5.3-Flash (base): 36/60 resuelto (60.0%), aproximadamente $4.56
  • Claude Opus 5 High: 43/60 resuelto (71.7%), aproximadamente $74.68

Opus resolvió 3 tareas adicionales, pero cuesta aproximadamente 31 veces más por ejecución. Es decir, aproximadamente $0.06 por tarea resuelta para apex-flash-1, en comparación con $1.74 para Opus. Estos son números reportados por la empresa en un benchmark interno.

Un modelo de trabajador, no un orquestador

La posición de Cantina en apex-flash-1 es una tarea organizada por un modelo más grande. La tarjeta enumera la lectura de código, el uso de herramientas, el desarrollo y la verificación de exploits como habilidades objetivo.

Un variante experimental de apex-flash-1-abliterated se entrega con un comportamiento de rechazo modificado. No fue evaluada por separado.

La razón de Cantina es que los defensores necesitan modelos capaces que puedan ejecutarse y controlarse localmente.

Explicador interactivo

¿Cómo se compara?

Característicaapex-flash-1Aikido Altar-1Cisco Foundation-Sec-8B-ReasoningGLM-5.3-Flash
DesarrolladorCantina Security + Yeta LabsAikido SecurityAI de la Fundación CiscoZ.ai
Modelo baseGLM-5.3-FlashGLM-5.3 (reescurrido)Llama 3.1 8BPre-entrenamiento propio
Tamaño321.3B en total, BF16328 GB, INT4 (W4A16)8B320B en total, 18B activos
LicenciaMITHereda la licencia GLM-5.3Personalizado (ver NOTICE.md)MIT
Método de seguridadGRPO RL en 50 casos reales de vulnerabilidadPruning experto (REAP) + cuantizaciónInstrucción de ajuste + RLHF en calidad de preguntas de seguridadBase de uso general
Uso principalTrabajador de investigación sobre vulnerabilidades agenticasPruebas de penetración autónomas sin conexión a internetTriage de SOC y defensa contra amenazasCodificación general y agentes
HardwareNodo Multi-GPU (~642 GB de pesos BF16)4x H200 con vLLMUna GPU únicaNodo Multi-GPU
Resultado de seguridad publicado66.7% pasan@1, 60 tareas60.4% recuerda, 32-CVE conjunto internoBenchmarks de seguridad reportados por Cisco60.0% en el set de Cantina

Fuentes: Cantina, Aikido, Cisco, tarjetas de modelos de Hugging Face. © Marktechpost

Conceptos Clave

  • apex-flash-1 es un modelo de seguridad de pesos abiertos de 321.3B bajo MIT.
  • La capacitación GRPO en 50 casos de vulnerabilidad real generó 150 tareas.
  • Obtuvo un 66.7% en pass@1, frente a un 71.7% para Claude Opus 5 High.
  • El costo de ejecución de sus 60 tareas es de aproximadamente $2.38, en comparación con $74.68 para Opus.
  • BF16 necesita un nodo multi-GPU; existen puertos de 4 bits para la comunidad.


Echa un vistazo a detalles técnicos. Todo el crédito pertenece al investigador de este proyecto. Además, no dudes en seguirnos en Twitter y no olvides unirte a nuestro subreddit de 150k+ ML y suscribirte a nuestro boletín informativo. ¡Espera! ¿Estás en Telegram? Ahora puedes unirte a nosotros en Telegram también.

¿Necesita asociarse con nosotros para promocionar su repositorio de GitHub, página de Hugging Face, lanzamiento de producto o webinario, etc.? Conéctese con nosotros

El artículo ¿Puede un modelo abierto realizar investigación de seguridad? Cantina’s apex-flash-1 resuelve 40 de 60 tareas de errores mantenidas apareció primero en MarkTechPost.

Fuente original

MarkTechPost

Notas sobre el contenido

La publicación original y los derechos pertenecen a la fuente.

Traducción automática · Consulte el original