Cantina Security, avec Yeta Labs, a publié apex-flash-1, un modèle à poids ouverts entraîné spécifiquement pour la recherche de vulnérabilités. Il s’agit d’un fine-tuning par apprentissage par renforcement de GLM-5.3-Flashde Z.ai, publié sur Hugging Face sous licence MIT.
Est-il déployable ? Oui, les poids MIT tournent sur vLLM, SGLang ou Transformers, mais le BF16 nécessite environ 640 Go de mémoire GPU.
Ce que Cantina a construit
apex-flash-1 compte 321,3 Md de paramètres au total, selon les métadonnées safetensors de son Hugging Face. La base GLM-5.3-Flash est un modèle Mixture-of-Experts avec 18 Md de paramètres actifs.
Cantina l’a entraîné avec GRPO en utilisant un rang-256 LoRA de rang 256 plus un entraînement sélectif de tous les paramètres. Les données couvrent 150 tâches construites à partir de 50 cas réels de vulnérabilités.
Chaque cas apparaît en 3 variantes : whitebox guidée, whitebox ciblée et blackbox ciblée.
Les failles d’autorisation, d’identité et de périmètre représentent 72 % des cas. Les bugs de comptabilité et de précision numérique ajoutent 18 %. La validation temporelle, les règles métier et le SSRF couvrent le reste.
Selon la fiche modèle sur HF, les rollouts RL se sont déroulés dans le harnais d’agent Codex sur des environnements logiciels et protocolaires de type production.
Résultats des benchmarks
Cantina a évalué 60 tâches issues de 20 cas de vulnérabilités réservés. Chaque modèle a exécuté l’ensemble une fois, avec des coûts estimés à partir des tarifs des fournisseurs.
- apex-flash-1 : 40/60 résolues (66,7 % pass@1), environ 2,38 $
- GLM-5.3-Flash (base) : 36/60 résolues (60,0 %), environ 4,56 $
- Claude Opus 5 High : 43/60 résolues (71,7 %), environ 74,68 $
Opus a résolu 3 tâches de plus mais coûtait environ 31 fois plus cher par exécution. Cela représente environ 0,06 $ par tâche résolue pour apex-flash-1 contre 1,74 $ pour Opus. Ce sont des chiffres communiqués par l'entreprise sur un benchmark interne.
Un modèle de travail, pas un orchestrateur
Cantina positionne apex-flash-1 comme un modèle de travail orchestré par un modèle plus grand. La fiche liste la lecture de code, l'utilisation d'outils, le développement d'exploits et la vérification comme compétences cibles.
Une variante expérimentale apex-flash-1-abliterated est livrée avec un comportement de refus modifié. Elle n'a pas été évaluée séparément.
La justification de Cantina est que les défenseurs ont besoin de modèles capables qu'ils peuvent exécuter et contrôler localement.
Explication interactive
Comparaison
| Caractéristique | apex-flash-1 | Aikido Altar-1 | Cisco Foundation-Sec-8B-Reasoning | GLM-5.3-Flash |
|---|---|---|---|---|
| Développeur | Cantina Security + Yeta Labs | Aikido Security | Cisco Foundation AI | Z.ai |
| Modèle de base | GLM-5.3-Flash | GLM-5.3 (élagué) | Llama 3.1 8B | Pré-entraînement propre |
| Taille | 321.3B total, BF16 | 328 Go, INT4 (W4A16) | 8B | 320B total, 18B actifs |
| Licence | MIT | Hérite de la licence GLM-5.3 | Personnalisée (voir NOTICE.md) | MIT |
| Méthode de sécurité | RL GRPO sur 50 cas réels de vulnérabilités | Élagage expert (REAP) + quantization | Réglage sur instructions + RLHF sur des QA de sécurité | Base à usage général |
| Usage principal | Agent de recherche de vulnérabilités de type agentic | Pentest autonome en réseau isolé (air-gapped) | Triage SOC et défense contre les menaces | Codage général et agents |
| Matériel | Nœud multi-GPU (~642 Go de poids BF16) | 4x H200 avec vLLM | GPU unique | Nœud multi-GPU |
| Résultat de sécurité publié | 66.7% pass@1, 60 tâches | 60.4% de rappel, ensemble interne de 32 CVE | Benchmarks de sécurité rapportés par Cisco | 60.0% sur l'ensemble de Cantina |
Sources : Cantina, Aikido, Cisco, cartes de modèles Hugging Face. © Marktechpost
Points clés
- apex-flash-1 est un modèle de sécurité open-weights de 321.3B sous MIT.
- L'entraînement GRPO sur 50 cas réels de vulnérabilités a produit 150 tâches.
- Il a obtenu 66.7% pass@1 contre 71.7% pour Claude Opus 5 High.
- Son exécution sur 60 tâches a coûté environ 2.38 $ contre 74.68 $ pour Opus.
- BF16 nécessite un nœud multi-GPU ; des ports 4-bit communautaires existent.
Découvrez les Détails techniques. Tout le crédit revient au chercheur de ce projet. N'hésitez pas également à nous suivre sur Twitter et n'oubliez pas de rejoindre notre 150k+ML SubReddit et de vous abonner à notre Newsletter. Attendez ! êtes-vous sur telegram ? vous pouvez désormais nous rejoindre sur telegram également.
Besoin de vous associer à nous pour promouvoir votre dépôt GitHub OU votre page Hugging Face OU le lancement d'un produit OU un webinaire, etc. ? Contactez-nous
L'article Can an Open Model Do Security Research? Cantina's apex-flash-1 Solves 40 of 60 Held-Out Bug Tasks est apparu en premier sur MarkTechPost.