Nace.AI a open-sourcé Drex 1.5, un modèle de décision 9B pour les agents et les workflows backend. Le modèle de décision Drex 1.5 n'écrit pas de texte. Il lit un état et des questions typées, puis renvoie une probabilité pour chaque option. Nace rapporte 58.08 sur le Decision Index 0.3.1public, le meilleur score sous 10B de paramètres. Les poids sont sur Hugging Face, et une version hébergée est en ligne sur OpenRouter.
TL;DR
- Taille : 8.95B paramètres (dense), poids bf16 d'environ 18 GB. Le contexte est de 16,384 tokens par défaut, jusqu'à 131,072.
- Tourne sur : 1 GPU CUDA en bf16 (testé sur un A10G de 24 GB). Un GGUF Q8_0 (environ 9.5 GB) tourne sur Apple silicon et CPU.
- Performances : 58.08 sur Decision Index 0.3.1 (public), dans la bande d'égalité du classement avec Jev 1.13.0 (57.96).
- Meilleur : 93.4% de précision sur des documents de 32K à 128K tokens.
- Pire : 7.4% de F1 par revue sur l'analyse de sentiment par aspects ACOS, contre 29.5% pour Jev.
- En résumé :
- Meilleur : des poids ouverts qui égalent un modèle fermé sur 1 GPU.
- Pire : faible sur les connaissances générales et le sentiment à grain fin.
Qu'est-ce que Drex 1.5 ?
Drex 1.5 est un modèle de décision de Nace.AI qui note un ensemble fixe d'options en 1 passe forward. Vous envoyez un state (texte ou JSON) et des questions nommées. Il prend en charge 3 types de questions : choice, noul (oui/non) et ordinal score. Aucun token n'est échantillonné, donc temperature et top_p ne s'appliquent pas. Le modèle ne peut répondre qu'avec les options que vous avez fournies.
Il expose l'API POST /v1/systemone . C'est le même format de requête que celui utilisé par Jev de TypeSafe, le modèle fermé qui a lancé cette catégorie. Nace dit que les clients Jev existants fonctionnent après avoir modifié quelques variables d'environnement.
Comment fonctionne Drex 1.5 ?
L'épine dorsale est MiMo-V2.6-Distill-Qwen-9B, un modèle distillé Qwen 3.5 9B. Il compte 32 couches avec une attention hybride : 3 couches d'attention linéaire par couche d'attention complète. Une tête de pointage distincte (head.pt) note chaque option à partir des états cachés du backbone.
Chaque question s'exécute en 1 passe sur l'état plus cette question. Dans llama.cpp, l'état est encodé une seule fois et partagé entre les questions. La page Drex de Nace indique que le modèle a été entraîné sur les ensembles d'entraînement officiels des benchmarks d'index. Il a été évalué uniquement sur des ensembles de test réservés.
Comment Drex 1.5 se comporte-t-il sur les benchmarks ?
Sur le Decision Index 0.3.1 public (37 benchmarks, corrigés pour le hasard), la fiche du modèle indique :
- Drex 1.5 : 58.08
- Jev 1.13.0 : 57.96
- Bespoke Nimble 9B v3 : 57.19
- Cloudflare clef-flash : 56.15
Drex 1.5, Jev et Nimble se situent dans la bande d'égalité de 0,9 point du tableau. Drex devance Jev sur 20 des 37 benchmarks. Le score de Drex provient de l'exécution par Nace du kit officiel. Ses scores par domaine sont les plus forts en Outils (75.0) et les plus faibles en Connaissances et Raisonnement (44.6). Le graphique de lancement de Nace utilise l'ancien Decision Index 0.2.1, où Drex a obtenu 58.28 contre 57.91 pour Jev.
Sur JevBench (231 éléments publics), Drex obtient 86.2% contre 87.0% pour Jev. Les deux atteignent 73.9% sur les éléments difficiles. Dans un affrontement direct sur 8 jeux OpenSpiel, Drex a enregistré 122 victoires, 47 nuls et 87 défaites contre Jev (56.8%).
Les documents longs sont une force évidente :
- 8K à 32K tokens : précision de 89.5%, médiane de 0,65 s
- 32K à 128K tokens : précision de 93.4%, médiane de 2,0 s
En tronquant les mêmes requêtes à 8K tokens, la précision chute à 76.5% et 78%.
Comment les développeurs peuvent-ils exécuter Drex 1.5 ?
Il existe 4 chemins de déploiement, tous desservant la même API :
- Python (runtime Kev) :
inference.pyetserve.pysur un GPU CUDA. - llama.cpp : un fork Nace avec GGUF en bf16 ou Q8_0, sur CUDA, Metal ou CPU.
- Ollama : un fork Nace qui ajoute une capacité
decision. - Hébergé : OpenRouter affiche 0,04 $ par 1M de jetons d'entrée et 0 $ en sortie, servi par DeepInfra. Nace exploite également son propre Console API.
Nace a testé bf16 et Q8_0 sur une instance AWS g5.2xlarge (A10G 24 GB) et a obtenu des réponses identiques. Le GGUF Q8_0 a également donné les mêmes résultats sur un Apple M5 Pro, aussi bien sur Metal que sur CPU.
Une compétence d'agent Drex branche le modèle dans Claude Code, Codex, Cursor, OpenCode, Hermes Agent, Gemini CLI et GitHub Copilot. Le billet de lancement de Nace offre également un bonus d'inscription de 25 $ pour les utilisateurs du cloud.
Comment Drex 1.5 se compare-t-il aux autres modèles de décision ?
| Caractéristique | Drex 1.5 | Jev 1.13.0 | Bespoke Nimble 9B v3 |
|---|---|---|---|
| Développeur | Nace.AI | TypeSafe AI | Bespoke Labs |
| Paramètres | 8.95B | Non divulgué | LoRA sur Qwen3.5-9B |
| Poids | Ouverts | Fermés (API uniquement) | Ouverts (adaptateur) |
| Licence | Nace.AI Open RAIL-M | Propriétaire | CC BY-NC 4.0 |
| Contexte | 16,384 par défaut, jusqu'à 131,072 | 64K par requête, 32K d'état plus la question la plus longue | Non divulgué |
| Decision Index 0.3.1 (public) | 58.08 | 57.96 | 57.19 |
| Decision Index 0.2.1 | 58.28 | 57.91 | 56.88 |
| JevBench (231 éléments) | 86.2% | 87.0% | Non divulgué |
| Matériel local | 1 GPU CUDA (bf16), puce Apple silicon ou CPU (Q8_0) | Non applicable | Qwen3.5-9B base plus adaptateur |
| Prix API (entrée / sortie par 1M) | $0.04 / $0 (OpenRouter) | $0.042 / $0 | Non divulgué |
Les lignes du Decision Index 0.3.1 proviennent de la carte modèle de Drex 1.5, qui cite le classement public pour Jev et Nimble. Le score 0.2.1 de Nimble provient de sa propre carte modèle.
Quelles sont les limites ?
Drex 1.5 est une couche de décision, pas un modèle général. Il ne peut pas générer de texte, de code ni d'explications. Les tests axés sur les connaissances sont son point faible : 45.4% sur GPQA Diamond contre 78.6% pour Jev, et 58.7% sur MMLU-Pro contre 82.7%.
L'entraînement sur les ensembles d'entraînement des benchmarks de l'indice l'aide sur les types de décisions familiers. Les résultats sur de nouveaux domaines peuvent différer. Le déploiement local via Ollama et llama.cpp nécessite les forks de Nace, pas les versions mainline. Les poids utilisent une licence RAIL-M avec restrictions d'usage, donc vérifiez les conditions avant toute utilisation commerciale.
Points clés à retenir
- Drex 1.5 est un modèle de décision ouvert de 9B qui évalue les options en 1 passe.
- Il obtient 58.08 sur le Decision Index 0.3.1, à égalité avec le modèle fermé Jev 1.13.0.
- La précision sur documents longs atteint 93.4% entre 32K et 128K tokens.
- Il fonctionne sur 1 GPU ou sous forme de GGUF Q8_0 de 9.5 Go sur un Mac.
- Points faibles : GPQA Diamond (45.4%) et sentiment ACOS (7.4%).
Découvrez les poids du modèle sur Hugging Face, le dépôt GitHub et la page produit de Drex. Tout le mérite revient au chercheur de ce projet. Aussi, n'hésitez pas à nous suivre sur Twitter et n'oubliez pas de rejoindre notre 150k+ML SubReddit et de vous abonner à notre Newsletter. Attendez ! êtes-vous sur Telegram ? vous pouvez maintenant nous rejoindre également sur Telegram.
L'article Nace AI Open-Sources Drex 1.5 : Un Modèle de Décision 9B Qui Évalue des Options, Pas du Texte est apparu en premier sur MarkTechPost.