MarkTechPost

Un modèle ouvert peut-il faire de la recherche en sécurité ? apex-flash-1 de Cantina résout 40 des 60 tâches de bugs réservées

Cantina Security, avec Yeta Labs, a publié apex-flash-1, un modèle à poids ouverts entraîné spécifiquement pour la recherche de vulnérabilités. Il s’agit d’un fine-tuning par apprentissage par renforcement de…

Cantina Security, avec Yeta Labs, a publié apex-flash-1, un modèle à poids ouverts entraîné spécifiquement pour la recherche de vulnérabilités. Il s’agit d’un fine-tuning par apprentissage par renforcement de GLM-5.3-Flashde Z.ai, publié sur Hugging Face sous licence MIT.

Est-il déployable ? Oui, les poids MIT tournent sur vLLM, SGLang ou Transformers, mais le BF16 nécessite environ 640 Go de mémoire GPU.

Ce que Cantina a construit

apex-flash-1 compte 321,3 Md de paramètres au total, selon les métadonnées safetensors de son Hugging Face. La base GLM-5.3-Flash est un modèle Mixture-of-Experts avec 18 Md de paramètres actifs.

Cantina l’a entraîné avec GRPO en utilisant un rang-256 LoRA de rang 256 plus un entraînement sélectif de tous les paramètres. Les données couvrent 150 tâches construites à partir de 50 cas réels de vulnérabilités.

Chaque cas apparaît en 3 variantes : whitebox guidée, whitebox ciblée et blackbox ciblée.

Les failles d’autorisation, d’identité et de périmètre représentent 72 % des cas. Les bugs de comptabilité et de précision numérique ajoutent 18 %. La validation temporelle, les règles métier et le SSRF couvrent le reste.

Selon la fiche modèle sur HF, les rollouts RL se sont déroulés dans le harnais d’agent Codex sur des environnements logiciels et protocolaires de type production.

Résultats des benchmarks

Cantina a évalué 60 tâches issues de 20 cas de vulnérabilités réservés. Chaque modèle a exécuté l’ensemble une fois, avec des coûts estimés à partir des tarifs des fournisseurs.

  • apex-flash-1 : 40/60 résolues (66,7 % pass@1), environ 2,38 $
  • GLM-5.3-Flash (base) : 36/60 résolues (60,0 %), environ 4,56 $
  • Claude Opus 5 High : 43/60 résolues (71,7 %), environ 74,68 $

Opus a résolu 3 tâches de plus mais coûtait environ 31 fois plus cher par exécution. Cela représente environ 0,06 $ par tâche résolue pour apex-flash-1 contre 1,74 $ pour Opus. Ce sont des chiffres communiqués par l'entreprise sur un benchmark interne.

Un modèle de travail, pas un orchestrateur

Cantina positionne apex-flash-1 comme un modèle de travail orchestré par un modèle plus grand. La fiche liste la lecture de code, l'utilisation d'outils, le développement d'exploits et la vérification comme compétences cibles.

Une variante expérimentale apex-flash-1-abliterated est livrée avec un comportement de refus modifié. Elle n'a pas été évaluée séparément.

La justification de Cantina est que les défenseurs ont besoin de modèles capables qu'ils peuvent exécuter et contrôler localement.

Explication interactive

Comparaison

Caractéristiqueapex-flash-1Aikido Altar-1Cisco Foundation-Sec-8B-ReasoningGLM-5.3-Flash
DéveloppeurCantina Security + Yeta LabsAikido SecurityCisco Foundation AIZ.ai
Modèle de baseGLM-5.3-FlashGLM-5.3 (élagué)Llama 3.1 8BPré-entraînement propre
Taille321.3B total, BF16328 Go, INT4 (W4A16)8B320B total, 18B actifs
LicenceMITHérite de la licence GLM-5.3Personnalisée (voir NOTICE.md)MIT
Méthode de sécuritéRL GRPO sur 50 cas réels de vulnérabilitésÉlagage expert (REAP) + quantizationRéglage sur instructions + RLHF sur des QA de sécuritéBase à usage général
Usage principalAgent de recherche de vulnérabilités de type agenticPentest autonome en réseau isolé (air-gapped)Triage SOC et défense contre les menacesCodage général et agents
MatérielNœud multi-GPU (~642 Go de poids BF16)4x H200 avec vLLMGPU uniqueNœud multi-GPU
Résultat de sécurité publié66.7% pass@1, 60 tâches60.4% de rappel, ensemble interne de 32 CVEBenchmarks de sécurité rapportés par Cisco60.0% sur l'ensemble de Cantina

Sources : Cantina, Aikido, Cisco, cartes de modèles Hugging Face. © Marktechpost

Points clés

  • apex-flash-1 est un modèle de sécurité open-weights de 321.3B sous MIT.
  • L'entraînement GRPO sur 50 cas réels de vulnérabilités a produit 150 tâches.
  • Il a obtenu 66.7% pass@1 contre 71.7% pour Claude Opus 5 High.
  • Son exécution sur 60 tâches a coûté environ 2.38 $ contre 74.68 $ pour Opus.
  • BF16 nécessite un nœud multi-GPU ; des ports 4-bit communautaires existent.


Découvrez les Détails techniques. Tout le crédit revient au chercheur de ce projet. N'hésitez pas également à nous suivre sur Twitter et n'oubliez pas de rejoindre notre 150k+ML SubReddit et de vous abonner à notre Newsletter. Attendez ! êtes-vous sur telegram ? vous pouvez désormais nous rejoindre sur telegram également.

Besoin de vous associer à nous pour promouvoir votre dépôt GitHub OU votre page Hugging Face OU le lancement d'un produit OU un webinaire, etc. ? Contactez-nous

L'article Can an Open Model Do Security Research? Cantina's apex-flash-1 Solves 40 of 60 Held-Out Bug Tasks est apparu en premier sur MarkTechPost.

Source originale

MarkTechPost

À propos du contenu

La publication originale et les droits appartiennent à la source.

Traduction automatique · Consultez l’original