MarkTechPost

Nace AI open-sourced Drex 1.5: Ein 9B-Entscheidungsmodell, das Optionen bewertet, nicht Text

Nace.AI hat Drex 1.5 als Open Source veröffentlicht, ein 9B-Entscheidungsmodell, das für jede Option in 1 Forward Pass eine Wahrscheinlichkeit zurückgibt. Es erreicht 58.08 auf dem Decision Index 0.3.1 und liest bis zu…

Nace.AI hat Drex 1.5 als Open Source veröffentlicht, ein 9B-Entscheidungsmodell für Agenten und Backend-Workflows. Das Drex 1.5 Entscheidungsmodell schreibt keinen Text. Es liest einen Zustand und typisierte Fragen und gibt dann für jede Option eine Wahrscheinlichkeit zurück. Nace berichtet 58.08 auf dem öffentlichen Decision Index 0.3.1, die Bestpunktzahl unter 10B Parametern. Die Gewichte stehen auf Hugging Face, und eine gehostete Version ist live auf OpenRouter.

TL;DR

  • Größe: 8.95B Parameter (dicht), bf16-Gewichte etwa 18 GB. Der Kontext beträgt standardmäßig 16,384 Tokens, bis zu 131,072.
  • Läuft auf: 1 CUDA-GPU in bf16 (getestet auf einer 24 GB A10G). Eine Q8_0 GGUF (etwa 9.5 GB) läuft auf Apple Silicon und CPU.
  • Leistung: 58.08 auf dem Decision Index 0.3.1 (öffentlich), innerhalb des Unentschieden-Bereichs des Boards mit Jev 1.13.0 (57.96).
  • Bestes: 93.4% Genauigkeit bei 32K bis 128K Token Dokumenten.
  • Schlechtestes: 7.4% F1 pro Review bei ACOS Aspect Sentiment, gegenüber 29.5% bei Jev.
  • Fazit:
    • Bestens: offene Gewichte, die ein geschlossenes Modell auf 1 GPU erreichen.
    • Schlecht: schwach bei breitem Wissen und feingranularem Sentiment.

Was ist Drex 1.5?

Drex 1.5 ist ein Entscheidungsmodell von Nace.AI, das einen festen Satz von Optionen in 1 Forward Pass bewertet. Man sendet einen state (Text oder JSON) und benannte Fragen. Es unterstützt 3 Fragetypen: choice, noul (Ja/Nein) und ordinal score. Es werden keine Tokens gesampelt, daher gelten temperature und top_p nicht. Das Modell kann nur mit den von Ihnen bereitgestellten Optionen antworten.

Es bietet die POST /v1/systemone API an. Das ist dasselbe Anfrageformat, das von verwendet wird TypeSafes Jev, das geschlossene Modell, das diese Kategorie begründet hat. Nace sagt, bestehende Jev-Clients funktionieren nach dem Ändern einiger Umgebungsvariablen weiter.

Wie funktioniert Drex 1.5?

Das Rückgrat ist MiMo-V2.6-Distill-Qwen-9B, ein destilliertes Qwen-3.5-9B-Modell. Es hat 32 Schichten mit hybrider Aufmerksamkeit: 3 Linear-Attention-Schichten pro Full-Attention-Schicht. Ein separater Pointer-Kopf (head.pt) bewertet jede Option aus den Hidden States des Rückgrats.

Jede Frage läuft mit 1 Durchlauf über den Zustand plus diese Frage. In llama.cpp wird der Zustand einmal kodiert und über die Fragen hinweg geteilt. Naces Drex-Seite sagt, das Modell wurde auf den offiziellen Training-Splits der Index-Benchmarks trainiert. Es wurde ausschließlich auf held-out Splits evaluiert.

Wie schneidet Drex 1.5 bei Benchmarks ab?

Auf dem öffentlichen Decision Index 0.3.1 (37 Benchmarks, chance-korrigiert) meldet die Modellkarte :

  • Drex 1.5: 58.08
  • Jev 1.13.0: 57.96
  • Bespoke Nimble 9B v3: 57.19
  • Cloudflare clef-flash: 56.15

Drex 1.5, Jev und Nimble liegen innerhalb des 0,9-Punkte-Gleichstandband des Boards. Drex führt Jev bei 20 von 37 Benchmarks. Der Drex-Score stammt aus Naces eigenem Lauf des offiziellen Kits. Seine Bereichsscores sind am stärksten in Tools (75.0) und am schwächsten in Knowledge and Reasoning (44.6). Naces Launch-Chart verwendet den älteren Decision Index 0.2.1, bei dem Drex 58.28 gegen Jevs 57.91 erreichte.

Bei JevBench (231 öffentliche Items) erreicht Drex 86.2% gegenüber Jevs 87.0%. Beide erreichen 73.9% bei schweren Items. In einem Direktvergleich über 8 OpenSpiel-Spiele verzeichnete Drex 122 Siege, 47 Unentschieden und 87 Niederlagen gegen Jev (56.8%).

Lange Dokumente sind eine klare Stärke:

  • 8K bis 32K Tokens: 89.5% Genauigkeit, Median 0.65 s
  • 32K bis 128K Tokens: 93.4% Genauigkeit, Median 2.0 s

Beim Kürzen derselben Anfragen auf 8K Tokens sinkt die Genauigkeit auf 76.5% und 78%.

Wie können Entwickler Drex 1.5 ausführen?

Es gibt 4 Bereitstellungspfade, die alle dieselbe API bedienen:

  • Python (Kev-Laufzeitumgebung): inference.py und serve.py auf einer CUDA-GPU.
  • llama.cpp: ein Nace-Fork mit GGUF in bf16 oder Q8_0, auf CUDA, Metal oder CPU.
  • Ollama: ein Nace-Fork der eine decision Fähigkeit hinzufügt.
  • Gehostet: OpenRouter listet $0,04 pro 1M Eingabe-Tokens und $0 Ausgabe, bereitgestellt von DeepInfra. Nace betreibt auch seine eigene Console API.

Nace testete bf16 und Q8_0 auf einer AWS g5.2xlarge (A10G 24 GB) und erhielt identische Antworten. Der Q8_0-GGUF stimmte auch auf einem Apple M5 Pro sowohl auf Metal als auch auf CPU überein.

Ein Drex-Agent-Skill bindet das Modell in Claude Code, Codex, Cursor, OpenCode, Hermes Agent, Gemini CLI und GitHub Copilot ein. Naces Launch-Beitrag bietet außerdem einen $25-Anmeldebonus für Cloud-Nutzer.

Wie schneidet Drex 1.5 im Vergleich zu anderen Entscheidungsmodellen ab?

FunktionDrex 1.5Jev 1.13.0Bespoke Nimble 9B v3
EntwicklerNace.AITypeSafe AIBespoke Labs
Parameter8,95 Mrd.Nicht offengelegtLoRA auf Qwen3.5-9B
GewichteOffenGeschlossen (nur API)Offen (Adapter)
LizenzNace.AI Open RAIL-MProprietärCC BY-NC 4.0
Kontext16.384 standardmäßig, bis zu 131.07264K pro Anfrage, 32K Zustand plus längste FrageNicht offengelegt
Decision Index 0.3.1 (öffentlich)58.0857.9657.19
Decision Index 0.2.158.2857.9156.88
JevBench (231 Elemente)86.2%87.0%Nicht offengelegt
Lokale Hardware1 CUDA-GPU (bf16), Apple Silicon oder CPU (Q8_0)Nicht zutreffendQwen3.5-9B Base plus Adapter
API-Preis (Eingabe / Ausgabe pro 1 Mio.)$0.04 / $0 (OpenRouter)$0.042 / $0Nicht offengelegt

Die Zeilen für Decision Index 0.3.1 stammen aus der Drex-1.5-Modellkarte, die auf das öffentliche Leaderboard für Jev und Nimble verweist. Der 0.2.1-Wert von Nimble stammt aus dessen eigener Modellkarte.

Was sind die Einschränkungen?

Drex 1.5 ist eine Entscheidungsschicht, kein allgemeines Modell. Es kann keinen Text, Code oder Erklärungen generieren. Wissensintensive Tests sind seine Schwachstelle: 45.4% bei GPQA Diamond gegenüber Jevs 78.6% und 58.7% bei MMLU-Pro gegenüber 82.7%.

Das Training auf den Trainingssplits der Index-Benchmarks hilft ihm bei vertrauten Entscheidungstypen. Ergebnisse in neuen Domänen können abweichen. Die lokale Bereitstellung über Ollama und llama.cpp benötigt Naces Forks, keine Mainline-Builds. Die Gewichte verwenden eine RAIL-M-Lizenz mit Nutzungsbeschränkungen, daher sollten Sie die Bedingungen vor einer kommerziellen Nutzung prüfen.

Die wichtigsten Punkte

  • Drex 1.5 ist ein offenes Entscheidungsmodell mit 9B, das Optionen in 1 Durchlauf bewertet.
  • Es erzielt 58.08 auf dem Decision Index 0.3.1 und liegt damit gleichauf mit dem geschlossenen Jev 1.13.0.
  • Die Genauigkeit bei langen Dokumenten erreicht 93.4 % bei 32K bis 128K Token.
  • Es läuft auf 1 GPU oder als 9.5 GB Q8_0 GGUF auf einem Mac.
  • Schwachstellen: GPQA Diamond (45,4 %) und ACOS-Sentiment (7,4 %).


Schauen Sie sich die Modellgewichte auf Hugging Face, die GitHub-Repository und die Drex-Produktseite. Alles Lob gebührt dem Forscher dieses Projekts. Folgen Sie uns gerne auch auf Twitter und vergessen Sie nicht, unserem 150k+ML SubReddit beizutreten und zu abonnieren unseren Newsletter. Warten Sie! Sind Sie auf Telegram? jetzt können Sie uns auch auf Telegram beitreten.

Der Beitrag Nace AI开源了Drex 1.5:一个对选项而非文本进行评分的9B决策模型 erschien zuerst auf MarkTechPost.

Originalquelle

MarkTechPost

Hinweise zum Inhalt

Originalveröffentlichung und Rechte liegen bei der Quelle.

Maschinelle Übersetzung · Original beachten