Cantina Security는 Yeta Labs와 함께 apex-flash-1라는 오픈웰트 모델을 출시했습니다. 이 모델은 취약점 연구를 위해 특별히 훈련된 것입니다. 이 모델은 Z.ai의 GLM-5.3-Flash를 강화학습으로 조정한 결과물이며, Hugging Face에서 MIT 라이선스 하에 배포됩니다.
배포 가능한가요? 네, MIT 가중치는 vLLM, SGLang 또는 Transformers에서 사용할 수 있지만, BF16는 약 640GB의 GPU 메모리가 필요합니다.
칸티나가 만들었다는 것
apex-flash-1은 Hugging Face safetensors 메타데이터에 따르면 총 321.3B개의 매개변수를 가지고 있습니다. GLM-5.3-Flash 기반 모델은 18B개의 활성 매개변수를 가진 전문가 혼합 모델입니다.
캔티나가 그것을 훈련시켰다 GRPO rank-256를 사용함 LoRA 선택적 전체 매개변수 훈련도 포함됩니다. 데이터는 50개의 실제 취약점 사례로 구성된 150개의 작업을 포함합니다.
각 경우는 3가지 변형으로 나타납니다: 가이드된 화이트박스, 집중된 화이트박스 및 집중된 블랙박스.
인증, 신원 및 범위 관련 결함이 72%를 차지합니다. 회계 및 수치 정확성 버그가 18%를 추가로 차지하며, 시간 검증, 비즈니스 규칙 및 SSRF가 나머지를 구성합니다.
HF 모델 카드에 따르면, RL 실험은 생산과 같은 소프트웨어 및 프로토콜 환경에서 Codex 에이전트 하브스 내에서 진행되었습니다.
벤치마크 결과
칸티나는 20개의 취약점 사례 중 60개의 작업을 평가했습니다. 각 모델은 이 세트를 한 번씩 실행했으며, 비용은 제공업체의 가격 정보를 바탕으로 추정되었습니다.
- apex-flash-1: 40/60 해결 (66.7% pass@1), 약 $2.38
- GLM-5.3-Flash (기본 모델): 36/60 문제 해결 (60.0%), 약 $4.56
- 클로드 오퍼스 5 하이: 43/60 문제 해결 (71.7%), 약 $74.68
Opus는 3개의 더 많은 작업을 해결했지만, 실행당 비용이 약 31배 더 높았다. 즉, apex-flash-1의 경우 해결된 작업당 약 $0.06이지만, Opus의 경우 $1.74이다. 이는 내부 벤치마크에서 회사가 보고한 수치이다.
작업자 모델, 오케스트레이터가 아니다
Cantina는 apex-flash-1을 더 큰 모델에 의해 조정되는 작업자로 위치시킵니다. 이 카드에는 코드 읽기, 도구 사용, 악용 개발 및 검증을 목표 기술로 나열됩니다.
실험적인 apex-flash-1-abliterated 변종은 수정된 거부 행동을 가지고 배포됩니다. 이는 별도로 평가된 것이 아닙니다.
칸티나의 논거는 수비수들이 현지에서 실행하고 제어할 수 있는 능력 있는 모델이 필요하다는 것입니다.
인터랙티브 설명기
비교 방법
| 특징 | apex-flash-1 | 아이키도 알타르-1 | Cisco Foundation-Sec-8B-Reasoning | GLM-5.3-Flash |
|---|---|---|---|---|
| 개발자 | 캔티나 시큐리티 + 예타 랩스 | 아이키도 보안 | 시스코 재단 AI | Z.ai |
| 기본 모델 | GLM-5.3-Flash | GLM-5.3 (줄기 잘린) | 라마 3.1 8B | 자신의 사전 학습 |
| 크기 | 321.3B 총합, BF16 | 328 GB, INT4 (W4A16) | 8B | 총 320B, 활성화된 18B |
| 라이선스 | MIT | GLM-5.3 라이선스를 상속받음 | 사용자 지정 (NOTICE.md 참조) | MIT |
| 보안 방법 | GRPO RL은 50개의 실제 취약점 사례에 대해 | 전문가 프린싱(REAP) + 양자화 | 지침 튜닝 + RLHF를 보안 QA에 적용함 | 일반용 기반 |
| 주요 용도 | 에이전트형 취약점 연구원 | 아이언게이트 자율적인pentesting | SOC 트리아지 및 위협 방어 | 일반 코딩 및 에이전트 |
| 하드웨어 | 멀티-GPU 노드 (~642 GB BF16 가중치) | 4x H200와 vLLM | 단일 GPU | 멀티-GPU 노드 |
| 발표된 보안 결과 | 66.7% pass@1, 60 작업 | 60.4%가 기억할 수 있으며, 32-CVE 내부 세트 | 시스코가 보고한 보안 기준 | 칸티나의 세트에서 60.0% |
출처: Cantina, Aikido, Cisco, Hugging Face 모델 카드. © Marktechpost
주요 요점
- apex-flash-1은 MIT 하의 321.3B 오픈웰스 보안 모델입니다.
- 50개의 실제 취약점 사례에 대한 GRPO 교육을 통해 150개의 과제가 생성되었습니다.
- pass@1에서 66.7%의 점수를 얻었으며, Claude Opus 5 High는 71.7%의 점수를 기록했습니다.
- 그것의 60개 작업 실행 비용은 2.38달러였으며, Opus의 경우는 74.68달러였습니다.
- BF16에는 멀티-GPU 노드가 필요합니다. 커뮤니티용 4비트 포트가 존재합니다.
기술적 세부 정보을 확인해 보세요. 이 프로젝트의 연구원에게 모든 공로가 돌아갑니다. 또한, Twitter에서 우리를 팔로우하시고, 150k+ML SubReddit에 가입하고 우리 뉴스레터을 구독하는 것을 잊지 마세요. 아, 텔레그램에 있나요? 이제 텔레그램에서도 우리와 함께할 수 있습니다.
GitHub 저장소, Hugging Face 페이지, 제품 출시, 웹 세미나 등을 홍보하기 위해 저희와 협력하고 싶으신가요? 저희와 연락하세요
개방형 모델이 보안 연구를 할 수 있을까? Cantina의 apex-flash-1은 60개의 테스트된 버그 작업 중 40개를 해결함라는 글이 MarkTechPost에 먼저 게재되었습니다.