Cantina Securityhat zusammen mit Yeta Labs veröffentlicht: apex-flash-1, ein Open-Weights-Modell, das speziell für Vulnerability Research trainiert wurde. Es handelt sich um ein Reinforcement-Learning-Fine-Tune von Z.ai's GLM-5.3-Flash, veröffentlicht auf Hugging Face unter der MIT-Lizenz.
Ist es einsetzbar? Ja, die MIT-Gewichte laufen auf vLLM, SGLang oder Transformers, aber BF16 benötigt etwa 640 GB GPU-Speicher.
Was Cantina gebaut hat
apex-flash-1 hat insgesamt 321,3B Parameter, gemäß den Hugging Face safetensors-Metadaten. Die GLM-5.3-Flash-Basis ist ein Mixture-of-Experts-Modell mit 18B aktiven Parametern.
Cantina hat es trainiert mit GRPO unter Verwendung eines rank-256 LoRA plus selektivem Full-Parameter-Training. Die Daten umfassen 150 Aufgaben, die aus 50 echten Schwachstellenfällen erstellt wurden.
Jeder Fall erscheint in 3 Varianten: geführtes Whitebox, fokussiertes Whitebox und fokussiertes Blackbox.
Autorisierungs-, Identitäts- und Scope-Fehler machen 72 % der Fälle aus. Buchhaltungs- und numerische Präzisionsbugs kommen auf 18 %. Zeitvalidierung, Geschäftsregeln und SSRF decken den Rest ab.
Laut der Modellkarte auf HF liefen die RL-Rollouts innerhalb des Codex Agent-Harness in produktionsähnlichen Software- und Protokollumgebungen.
Benchmark-Ergebnisse
Cantina evaluierte 60 Aufgaben aus 20 zurückgehaltenen Schwachstellenfällen. Jedes Modell lief den Satz einmal durch, die Kosten wurden anhand der Providerpreise geschätzt.
- apex-flash-1: 40/60 gelöst (66,7 % pass@1), etwa $2.38
- GLM-5.3-Flash (Basis): 36/60 gelöst (60,0 %), etwa $4.56
- Claude Opus 5 High: 43/60 gelöst (71,7 %), etwa 74,68 $
Opus löste 3 weitere Aufgaben, kostete aber pro Lauf etwa 31x mehr. Das sind ungefähr 0,06 $ pro gelöster Aufgabe für apex-flash-1 gegenüber 1,74 $ für Opus. Dies sind von der Firma berichtete Zahlen zu einem internen Benchmark.
Ein Worker-Modell, kein Orchestrator
Cantina positioniert apex-flash-1 als Worker, der von einem größeren Modell orchestriert wird. Die Karte führt Code-Lesen, Werkzeugnutzung, Exploit-Entwicklung und Verifizierung als Ziel-Fähigkeiten auf.
Eine experimentelle apex-flash-1-abliterated Variante wird mit modifiziertem Refusal-Verhalten ausgeliefert. Sie wurde nicht separat evaluiert.
Cantinas Begründung ist, dass Verteidiger leistungsfähige Modelle brauchen, die sie lokal ausführen und kontrollieren können.
Interaktive Erklärung
Wie es im Vergleich abschneidet
| Merkmal | apex-flash-1 | Aikido Altar-1 | Cisco Foundation-Sec-8B-Reasoning | GLM-5.3-Flash |
|---|---|---|---|---|
| Entwickler | Cantina Security + Yeta Labs | Aikido Security | Cisco Foundation AI | Z.ai |
| Basismodell | GLM-5.3-Flash | GLM-5.3 (pruned) | Llama 3.1 8B | Eigenes Pretraining |
| Größe | 321.3B gesamt, BF16 | 328 GB, INT4 (W4A16) | 8B | 320B gesamt, 18B aktiv |
| Lizenz | MIT | Erbt die GLM-5.3-Lizenz | Custom (siehe NOTICE.md) | MIT |
| Sicherheitsmethode | GRPO-RL an 50 echten Schwachstellenfällen | Expert Pruning (REAP) + Quantisierung | Instruction Tuning + RLHF zu Security-Fragen und Antworten | Universeller Basismodell-Einsatz |
| Hauptverwendung | Agenter-Schwachstellenforschungs-Worker | Air-gapped autonomes Pentesting | SOC-Triage und Bedrohungsabwehr | Allgemeines Coding und Agenten |
| Hardware | Multi-GPU-Knoten (~642 GB BF16-Gewichte) | 4x H200 mit vLLM | Einzelne GPU | Multi-GPU-Knoten |
| Veröffentlichtes Sicherheitsergebnis | 66.7% pass@1, 60 Aufgaben | 60.4% Recall, 32-CVE-interner Satz | Von Cisco berichtete Sicherheits-Benchmarks | 60.0% auf Cantinas Satz |
Quellen: Cantina, Aikido, Cisco, Hugging Face Modellkarten. © Marktechpost
Kernpunkte
- apex-flash-1 ist ein 321.3B Open-Weights-Sicherheitsmodell unter MIT.
- GRPO-Training an 50 echten Schwachstellenfällen ergab 150 Aufgaben.
- Es erzielte 66.7% pass@1 gegenüber 71.7% für Claude Opus 5 High.
- Sein 60-Aufgaben-Durchlauf kostete etwa $2.38 gegenüber $74.68 für Opus.
- BF16 benötigt einen Multi-GPU-Knoten; Community-4-bit-Ports existieren.
Schauen Sie sich die Technischen Detailsan. Aller Dank geht an den Forscher dieses Projekts. Folgen Sie uns außerdem gerne auf Twitter und vergessen Sie nicht, unserem 150k+ML SubReddit beizutreten und unseren Newsletterzu abonnieren. Moment! Sind Sie auf Telegram? jetzt können Sie uns auch auf Telegram beitreten.
Müssen Sie mit uns zusammenarbeiten, um Ihr GitHub-Repo ODER Ihre Hugging-Face-Seite ODER Ihre Produktveröffentlichung ODER Ihr Webinar usw. zu bewerben? Verbinden Sie sich mit uns
Der Beitrag Kann ein offenes Modell Sicherheitsforschung betreiben? Cantinas apex-flash-1 löst 40 von 60 zurückgehaltenen Bug-Aufgaben erschien zuerst auf MarkTechPost.