MarkTechPost

Nace AI、Drex 1.5をオープンソース化:テキストではなく選択肢をスコアリングする9Bのディシジョンモデル

Nace.AIは、1回のフォワードパスですべての選択肢の確率を返す9Bの決定モデル「Drex 1.5」をオープンソース化しました。Decision Index 0.3.1で58.08を記録し、最大128Kトークンを読み込めます。本記事「Nace AI Open-Sources Drex 1.5: A 9B Decision Model That Scores Options, Not…

Nace.AIは Drex 1.5をオープンソース化した、エージェントおよびバックエンドワークフロー向けの9Bの意思決定モデルです。Drex 1.5 意思決定モデルはテキストを書きません。状態と型付きの質問を読み取り、すべての選択肢について確率を返します。Naceは公開ベンチマークで58.08を報告しています Decision Index 0.3.1、10Bパラメータ未満でトップスコアを記録しています。重みはHugging Faceで公開されており、ホスト版も以下で稼働しています OpenRouter.

要点

  • サイズ: 8.95Bパラメータ(dense)、bf16の重みは約18 GB。コンテキストはデフォルトで16,384トークン、最大131,072まで。
  • 動作環境: 1基のCUDA GPU、bf16相当(24 GBのA10Gでテスト済み)。Q8_0のGGUF(約9.5 GB)はAppleシリコンおよびCPUで動作します。
  • パフォーマンス: Decision Index 0.3.1(公開版)で58.08、ボードのJev 1.13.0の同点バンド(57.96)の範囲内です。
  • 最良の選択: 93.4%の精度を32Kから128Kトークンの文書で達成。
  • 最悪: ACOSアスペクト感情分析においてレビュー単位のF1スコア7.4%を達成し、Jevの29.5%と比較された。
  • 結論:
    • 最高:1 GPUでクローズドモデルに匹敵するオープンウェイト。
    • 最悪:広範な知識ときめ細かな感情分析が苦手。

Drex 1.5とは何か?

Drex 1.5は、Nace.AIの意思決定モデルで、1回のフォワードパスで固定された選択肢セットをスコアリングします。以下の state (テキストまたはJSON)と名前付きの質問に対応しています。3つの質問タイプをサポートしています: choice, noul (はい/いいえ) および順序 score。トークンは一切サンプリングされないため、 temperature および top_p 適用されません。モデルは提供された選択肢のみで回答することができます。

それは POST /v1/systemone API。これは、以下で使用されているものと同じリクエスト形式です。 TypeSafeのJev、このカテゴリーを切り開いたクローズドモデルです。Naceによれば、既存のJevクライアントはいくつかの環境変数を変更すれば動作します。

Drex 1.5はどのように動作するのか?

その基盤は MiMo-V2.6-Distill-Qwen-9Bで、Qwen 3.5 9Bを蒸留したモデルです。32層のハイブリッド注意機構を備え、全注意層1層に対して線形注意層が3層あります。別個のポインターヘッド(head.pt)がバックボーンの隠れ状態から各選択肢をスコアリングします。

各質問は、状態に対してその質問分の1パスを実行します。llama.cppでは、状態は1回エンコードされ、質問間で共有されます。Naceの Drexページ によると、このモデルはindex benchmarksの公式トレーニング分割で学習され、評価はヘルドアウト分割のみで行われたとのことです。

Drex 1.5はベンチマークでどのような性能を示すのか?

公開されているDecision Index 0.3.1(37ベンチマーク、チャンス補正あり)では、 モデルカード が以下を報告しています:

  • Drex 1.5: 58.08
  • Jev 1.13.0: 57.96
  • Bespoke Nimble 9B v3: 57.19
  • Cloudflare clef-flash: 56.15

Drex 1.5、Jev、Nimbleはボードの0.9ポイントの同点帯の中にあります。Drexは37ベンチマーク中20でJevを上回っています。DrexのスコアはNace自身による公式キットの実行によるものです。エリア別スコアはTools(75.0)が最も強く、Knowledge and Reasoning(44.6)が最も弱くなっています。Naceの公開チャートでは古いDecision Index 0.2.1が使われており、そこではDrexが58.28、Jevが57.91でした。

JevBench(公開231項目)では、Drexは86.2%、Jevは87.0%をスコアしています。両者とも難易度の高い項目では73.9%に達します。8つのOpenSpielゲームによる対戦では、DrexはJevに対して122勝、47引き分け、87敗(56.8%)を記録しました。

長文ドキュメントは明確な強みです:

  • 8K~32Kトークン: 精度89.5%、中央値0.65秒
  • 32K~128Kトークン: 精度93.4%、中央値2.0秒

同じリクエストを8Kトークンに切り詰めると、精度は76.5%と78%に低下します。

開発者はどうすればDrex 1.5を実行できるのか?

デプロイパスは4つあり、すべて同じAPIを提供します:

  • Python(Kev ランタイム): inference.py および serve.py CUDA GPU上。
  • llama.cpp: a Nace fork bf16またはQ8_0のGGUFで、CUDA、MetalまたはCPU上で動作。
  • Ollama: a Nace fork これにより decision capability.
  • Hosted: OpenRouter 1Mの入力トークンあたり$0.04、出力は$0で、DeepInfraが提供しています。Naceは独自の Console API.

NaceはAWS g5.2xlarge(A10G 24 GB)でbf16とQ8_0をテストし、同一の回答を得ました。Q8_0 GGUFはApple M5 ProでもMetalとCPUの両方で一致しました。

A Drex agent skill このモデルをClaude Code、Codex、Cursor、OpenCode、Hermes Agent、Gemini CLI、GitHub Copilotに接続します。Naceの launch post では、クラウドユーザー向けに$25のサインアップボーナスも提供しています。

Drex 1.5は他の意思決定モデルとどう比較されるか?

機能Drex 1.5Jev 1.13.0Bespoke Nimble 9B v3
開発元Nace.AITypeSafe AIBespoke Labs
パラメータ数8.95B非公開Qwen3.5-9B上のLoRA
重みオープンクローズド(APIのみ)オープン(アダプタ)
ライセンスNace.AI Open RAIL-MプロプライエタリCC BY-NC 4.0
コンテキストデフォルトで16,384、最大131,072リクエストあたり64K、32Kの状態+最長の質問非公開
Decision Index 0.3.1(公開)58.0857.9657.19
Decision Index 0.2.158.2857.9156.88
JevBench(231項目)86.2%87.0%非公開
ローカルハードウェアCUDA GPU 1基(bf16)、AppleシリコンまたはCPU(Q8_0)該当なしQwen3.5-9Bベースにアダプターを追加
API価格(1Mあたりの入力/出力)$0.04 / $0(OpenRouter)$0.042 / $0非公開

Decision Index 0.3.1の行はDrex 1.5のモデルカードによるもので、JevとNimbleについては公開リーダーボードを引用しています。Nimbleの0.2.1のスコアは独自のモデルカードによるものです。

限界は何か?

Drex 1.5は汎用モデルではなく、意思決定レイヤーです。テキスト、コード、説明文の生成はできません。知識重視のテストが弱点で、GPQA DiamondではJevの78.6%に対して45.4%、MMLU-Proでは82.7%に対して58.7%にとどまります。

インデックスベンチマークのトレーニング分割データで学習しているため、慣れた意思決定タイプには有利です。新しいドメインでの結果は異なる可能性があります。Ollamaとllama.cppでのローカル展開には、メインライン版ではなくNaceのフォーク版が必要です。重みは利用制限付きのRAIL-Mライセンスで、商用利用の前に規約を確認してください。

主なポイント

  • Drex 1.5は、1パスで選択肢をスコアリングする9Bのオープンな意思決定モデルです。
  • Decision Index 0.3.1で58.08を記録し、クローズドなJev 1.13.0と同水準です。
  • 長文ドキュメントの精度は、32Kから128Kトークンで93.4%に達します。
  • GPU 1基、またはMac上の9.5 GBのQ8_0 GGUFとして動作します。
  • 弱点:GPQA Diamond(45.4%)とACOSセンチメント(7.4%)。


ぜひチェックしてください: Hugging Faceのモデル重み、 GitHubリポジトリ 、そして Drexの製品ページ。本プロジェクトの研究者に全ての功績があります。また、ぜひ Twitter でフォローし、 150k+ML SubReddit への参加と、こちらへの登録もお忘れなく: ニュースレターです。待ってください!Telegram を使っていますか? 現在、Telegram でもご参加いただけるようになりました。

本記事 Nace AI、オプションをテキストではなくスコアリングする9Bの意思決定モデル「Drex 1.5」をオープンソース化 は最初に MarkTechPost.

原文の出典

MarkTechPost

内容について

原文の公開と権利は出典元に帰属します。

機械翻訳 · 原文をご参照ください