Einführung von Trusted-Access-Modellen im Cyber Index für künstliche Analyse
GPT-6 Sol (Daybreak Blue) führt jetzt den Cyber Index an
Die Artificial Analysis Cyber Index Alliance vereint Industriepartner, um zu bewerten, wie AI-Modelle bei Unternehmenscyberverteidigungsaufgaben funktionieren. Der Index wurde mit nur öffentlich zugänglichen Modellen eingeführt und bietet den Benutzern eine bessere Einsicht in die verfügbaren Fähigkeiten im Bereich agentischer Cyberverteidigung. Nun erweitern wir die Rangliste, um Modelle mit weniger Sicherheitsbeschränkungen einzubeziehen, sodass eine breitere Sicht auf die cybertechnischen Fähigkeiten neuer Modelle möglich wird. Der erste davon ist GPT-6 Sol (Daybreak Blue, max), der nur über das Daybreak-Programm von OpenAI zugänglich ist.

GPT-6 Sol (Daybreak Blue, max) führt nun den Index an und steht auf der Pareto-Grenze zwischen Kosten und Leistung. Es erreicht keine Sicherheitsbarrieren im gesamten Index, und seine Gesamtbewertung verbessert sich um 32 Punkte gegenüber dem öffentlich verfügbaren GPT-6 Sol (max).
Bei einem Kosten pro Aufgabe von 1,77 $ ist es kosteneffizienter als andere führende Modelle, einschließlich Grok 4,7 (xhigh), das 11,67 $ pro Aufgabe kostet

Im Vergleich zum öffentlich verfügbaren GPT-6 Sol hat das Daybreak Blue-Modell die größten Vorteile bei CyberGym-E2E, dem Benchmark, an dem die meisten Sicherheitsablehnungen auftreten.

Wir werden den Artificial Analysis Cyber Index weiter ausbauen, um sowohl öffentlich verfügbare als auch vertrauenswürdige Modelle abzudecken.
Für die vollständigen Bewertungsergebnisse, siehe hier: https://artificialanalysis.ai/evaluations/artificial-analysis-cyber-index
