MarkTechPost

Kann ein offenes Modell Sicherheitsforschung betreiben? Cantinas apex-flash-1 löst 40 von 60 zurückgehaltenen Bug-Aufgaben

Cantina Security hat zusammen mit Yeta Labs apex-flash-1 veröffentlicht, ein Open-Weights-Modell, das speziell für Vulnerability Research trainiert wurde. Es handelt sich um ein Reinforcement-Learning-Fine-Tune von…

Cantina Securityhat zusammen mit Yeta Labs veröffentlicht: apex-flash-1, ein Open-Weights-Modell, das speziell für Vulnerability Research trainiert wurde. Es handelt sich um ein Reinforcement-Learning-Fine-Tune von Z.ai's GLM-5.3-Flash, veröffentlicht auf Hugging Face unter der MIT-Lizenz.

Ist es einsetzbar? Ja, die MIT-Gewichte laufen auf vLLM, SGLang oder Transformers, aber BF16 benötigt etwa 640 GB GPU-Speicher.

Was Cantina gebaut hat

apex-flash-1 hat insgesamt 321,3B Parameter, gemäß den Hugging Face safetensors-Metadaten. Die GLM-5.3-Flash-Basis ist ein Mixture-of-Experts-Modell mit 18B aktiven Parametern.

Cantina hat es trainiert mit GRPO unter Verwendung eines rank-256 LoRA plus selektivem Full-Parameter-Training. Die Daten umfassen 150 Aufgaben, die aus 50 echten Schwachstellenfällen erstellt wurden.

Jeder Fall erscheint in 3 Varianten: geführtes Whitebox, fokussiertes Whitebox und fokussiertes Blackbox.

Autorisierungs-, Identitäts- und Scope-Fehler machen 72 % der Fälle aus. Buchhaltungs- und numerische Präzisionsbugs kommen auf 18 %. Zeitvalidierung, Geschäftsregeln und SSRF decken den Rest ab.

Laut der Modellkarte auf HF liefen die RL-Rollouts innerhalb des Codex Agent-Harness in produktionsähnlichen Software- und Protokollumgebungen.

Benchmark-Ergebnisse

Cantina evaluierte 60 Aufgaben aus 20 zurückgehaltenen Schwachstellenfällen. Jedes Modell lief den Satz einmal durch, die Kosten wurden anhand der Providerpreise geschätzt.

  • apex-flash-1: 40/60 gelöst (66,7 % pass@1), etwa $2.38
  • GLM-5.3-Flash (Basis): 36/60 gelöst (60,0 %), etwa $4.56
  • Claude Opus 5 High: 43/60 gelöst (71,7 %), etwa 74,68 $

Opus löste 3 weitere Aufgaben, kostete aber pro Lauf etwa 31x mehr. Das sind ungefähr 0,06 $ pro gelöster Aufgabe für apex-flash-1 gegenüber 1,74 $ für Opus. Dies sind von der Firma berichtete Zahlen zu einem internen Benchmark.

Ein Worker-Modell, kein Orchestrator

Cantina positioniert apex-flash-1 als Worker, der von einem größeren Modell orchestriert wird. Die Karte führt Code-Lesen, Werkzeugnutzung, Exploit-Entwicklung und Verifizierung als Ziel-Fähigkeiten auf.

Eine experimentelle apex-flash-1-abliterated Variante wird mit modifiziertem Refusal-Verhalten ausgeliefert. Sie wurde nicht separat evaluiert.

Cantinas Begründung ist, dass Verteidiger leistungsfähige Modelle brauchen, die sie lokal ausführen und kontrollieren können.

Interaktive Erklärung

Wie es im Vergleich abschneidet

Merkmalapex-flash-1Aikido Altar-1Cisco Foundation-Sec-8B-ReasoningGLM-5.3-Flash
EntwicklerCantina Security + Yeta LabsAikido SecurityCisco Foundation AIZ.ai
BasismodellGLM-5.3-FlashGLM-5.3 (pruned)Llama 3.1 8BEigenes Pretraining
Größe321.3B gesamt, BF16328 GB, INT4 (W4A16)8B320B gesamt, 18B aktiv
LizenzMITErbt die GLM-5.3-LizenzCustom (siehe NOTICE.md)MIT
SicherheitsmethodeGRPO-RL an 50 echten SchwachstellenfällenExpert Pruning (REAP) + QuantisierungInstruction Tuning + RLHF zu Security-Fragen und AntwortenUniverseller Basismodell-Einsatz
HauptverwendungAgenter-Schwachstellenforschungs-WorkerAir-gapped autonomes PentestingSOC-Triage und BedrohungsabwehrAllgemeines Coding und Agenten
HardwareMulti-GPU-Knoten (~642 GB BF16-Gewichte)4x H200 mit vLLMEinzelne GPUMulti-GPU-Knoten
Veröffentlichtes Sicherheitsergebnis66.7% pass@1, 60 Aufgaben60.4% Recall, 32-CVE-interner SatzVon Cisco berichtete Sicherheits-Benchmarks60.0% auf Cantinas Satz

Quellen: Cantina, Aikido, Cisco, Hugging Face Modellkarten. © Marktechpost

Kernpunkte

  • apex-flash-1 ist ein 321.3B Open-Weights-Sicherheitsmodell unter MIT.
  • GRPO-Training an 50 echten Schwachstellenfällen ergab 150 Aufgaben.
  • Es erzielte 66.7% pass@1 gegenüber 71.7% für Claude Opus 5 High.
  • Sein 60-Aufgaben-Durchlauf kostete etwa $2.38 gegenüber $74.68 für Opus.
  • BF16 benötigt einen Multi-GPU-Knoten; Community-4-bit-Ports existieren.


Schauen Sie sich die Technischen Detailsan. Aller Dank geht an den Forscher dieses Projekts. Folgen Sie uns außerdem gerne auf Twitter und vergessen Sie nicht, unserem 150k+ML SubReddit beizutreten und unseren Newsletterzu abonnieren. Moment! Sind Sie auf Telegram? jetzt können Sie uns auch auf Telegram beitreten.

Müssen Sie mit uns zusammenarbeiten, um Ihr GitHub-Repo ODER Ihre Hugging-Face-Seite ODER Ihre Produktveröffentlichung ODER Ihr Webinar usw. zu bewerben? Verbinden Sie sich mit uns

Der Beitrag Kann ein offenes Modell Sicherheitsforschung betreiben? Cantinas apex-flash-1 löst 40 von 60 zurückgehaltenen Bug-Aufgaben erschien zuerst auf MarkTechPost.

Originalquelle

MarkTechPost

Hinweise zum Inhalt

Originalveröffentlichung und Rechte liegen bei der Quelle.

Maschinelle Übersetzung · Original beachten