MarkTechPost更新日

Liquid AI、オープンウェイトのd1-3Bおよびd1-omni-600Mをリリース: 出力トークンゼロのマルチモーダル意思決定モデル

Liquid AIは、d1ディシジョンモデルファミリーに属する2つのオープンウェイトのマルチモーダルモデル「Open d1」をリリースしました。d1-3Bはテキストと画像を読み取ります。d1omni-600Mはテキスト+画像、またはテキスト+音声を読み取ります。どちらのモデルもテキストを書き出しません。各モデルは、出力トークンゼロで1回のフォワードパスで較正済みの型付き回答を返します。ターゲットはリアルタイムの意思決定で[…]…

Liquid AIがOpen d1をリリースしました, d1意思決定モデルファミリーに属する2つのオープンウェイトのマルチモーダルモデル。 d1-3B テキストと画像を読み取ります。 d1-omni-600M 画像とテキスト、あるいはテキストと音声を入力として読み取ります。どちらのモデルもテキストを書き出しません。それぞれ、出力トークンをゼロにしたまま1回のフォワードパスで較正済みの型付き回答を返します。狙いは、DGXサーバー、RTXワークステーション、JetsonエッジボードといったNVIDIAスタック上でのリアルタイムの意思決定です。

デプロイ可能ですか? はい。両方のチェックポイントはHugging Face上にあり、Transformers経由でロードでき、初日からllama.cppをサポートしています。The LFM Open License v1.0 年間収益が1000万ドル未満の場合、商用利用を無料で許可します。d1-omni-600Mは初期の研究リリースであり、公表されたレイテンシの数値はありません。

決定モデルとは何か?

生成型LLMは答えをトークンごとに書き出し、あなたのコードがそれを解析します。一方、決定モデルは状態と名前付きの質問の集合を受け取ります。それらを一度読み、許可されたすべての答えに対して確率を返します。 The Liquid AI 3 つの質問タイプを定義します:

  • noul: 「はい/いいえ」の質問に対して、P(yes) として返されます。
  • 選択: 名前付き選択肢から1つのラベルと、完全な確率分布。
  • スコア: 2から10段階の順序付きルーブリック上で確率加重された評価。

1 回の呼び出しで、複数の質問が 1 つの状態を共有できます。すべての応答には以下が報告されます output_tokens: 0. Liquid AIは、ルーティング、モデレーション、インテント分類、リランキング、LLM-as-a-judgeスコアリング、エージェントのガードレール、外観検査にd1を推奨しています。いずれのチェックポイントもチャットモデルではありません。

d1-3Bとd1-omni-600Mはどのように構築されているのか?

d1-3B 3.12Bのパラメータを持ち、以下から開始します。 LFM2.5-VL-3B, デコーダーのみの視覚言語モデルです。Liquid AIはLFM2.5-2.6Bの重みと、そのモデルのテキストバックボーンを平均しました。次に、異なるシードとデータ混合を使った複数のチェックポイントをファインチューニングし、再度マージしました。400MのSigLIP2 NaFlex視覚エンコーダーと32,768トークンのコンテキストを使用しています。長い入力、シャッフルされた選択肢、データショートカットの修正は、高度なテクニックよりも重要でした。

d1-omni-600M 「は587Mのパラメータを持ち、次から始まります:」 LFM2.5-Encoder-350M、双方向エンコーダーです。これは381Mの共有トランクと決定ヘッド、94Mのビジョンエンコーダー、112Mのオーディオエンコーダーで構成されます。オーディオエンコーダーは17層のFastConformerです。コンテキストは16,384トークンです。オーディオクリップは最大30秒に制限されます。リクエストには画像またはオーディオのどちらか一方のみを含めることができ、両方は含められません。オーディオの学習は英語話者からアシスタントへのリクエストのみを対象としました。

Open d1が最も適しているのはどこか?

  • サポートとチケットのトリアージ: d1-3Bを1回呼び出すだけで、返金可否のyes/no判定、担当チームの選定、そして同じメッセージに対する緊急度の評価が可能で、出力トークンの解析は一切不要です。
  • エッジでのリアルタイム画像検査とモデレーション: d1-3BはJetson AGX Thor上で384pxの画像を35 msで読み取り、Liquid AIの Open d1 Arcade がライブカメラ入力をフレームごとに処理し、コンテンツモデレーションとジェスチャーコントロールを行います。
  • 小型デバイスでの音声コマンドルーティング: d1-omni-600M は最大30秒の音声をテキストとともに受け取り、話者の意図やトピックを直接返します。モデルカードには、推奨用途として音声コマンドルーティングとエージェントガードレールが挙げられています。

d1はベンチマークでどのくらいの性能か?

において、 Decision Index v0.2.1では、d1-3Bは48.57を獲得しました。これは10B未満のすべてのモデルを上回り、Decider 35B-A3B(47.11)をわずかに凌駕します。Winnow-12Bのみが50.02でそれを上回ります。Liquid AIが公式スコアラーを自ら実行したため、d1のスコアはリーダーボードへの提出ではありません。d1-3BはTools(74.5)とArts(36.3)カテゴリーで首位に立つ一方、Knowledge(23.8)では後れを取っています。

7つの公開テキストベンチマークを通じて、d1-3Bは平均82.9で、81.1のDecider 4Bを上回ります。d1-omni-600Mは平均78.4で、Civil Comments(95.8)とPAWS-X(79.5)で最高スコアを記録しています。11の画像ベンチマークでは、d1-3Bはベースモデルの73.9に対して平均74.1です。Liquid AIは、オーディオ決定ベンチマークを未解決の課題としています。

NVIDIAハードウェア上でのd1-3Bの速度は?

Liquid AIはエンドツーエンドのレイテンシを、ウォーム状態のリクエストを1件ずつ処理して測定した。1つの質問の処理にはRTX 4090で8 ms、AMD MI325Xで9 msかかる。Jetsonでは、AGX Thorが16 ms、AGX Orinが26 ms、Orin Nanoが50 msかかる。Jetson AGX Thorでは、1つのステートに対して3つの質問を処理すると20 ms、1つなら16 msである。RTX 4090の数値は model.compile(mode="reduce-overhead")を使用したものである。これがない場合、1つの質問に16 msかかる。NVIDIAの Jetson AI Lab でもd1-3Bのガイドが公開されている。

Open d1は他のオープンな意思決定モデルと比べてどうなのか?

特徴d1-3Bd1-omni-600MDecider 4BDecider 35B-A3BWinnow-12B
開発元Liquid AILiquid AIMapika(独立系)Mapika(独立系)EldanRing(独立系)
パラメータ数3.12B587M4.2B合計34.7B、アクティブ3B12B
ベースモデルLFM2.5-VL-3BLFM2.5-Encoder-350MQwen3.5-4B-BaseQwen3.5-35B-A3B-BaseGemma 4 12B IT
入力テキスト、画像テキスト+画像、またはテキスト+音声テキストテキストテキスト、画像
コンテキスト32,76816,38432Kトークンの状態32Kトークンの状態65,536(Q8でテスト済み)
Decision Index v0.2.148.5715.9540.7047.1150.02
ライセンスLFM Open v1.0LFM Open v1.0Apache 2.0Apache 2.0Apache 2.0
公開されているレイテンシ質問あたり8 ms、RTX 4090非公開3質問のリクエストあたり5.2 ms、B3003質問のリクエストあたり47 ms、B30064Kコンテキスト付近でのキャッシュ済み4質問リクエストあたり143 ms、RTX 5070 Ti

出典: d1-3B, d1-omni-600M, Decider 4B, Decider 35B-A3B, Winnow-12B モデルカード。インデックスのスコアはd1カードに記載の通り。レイテンシはハードウェアとワークロードが異なるため、直接比較はできません。

d1をローカルで実行するには?

d1-3Bには transformers>=5.14 と trust_remote_code=Trueが必要です。d1-omni-600Mには transformers>=5.15が必要です。どちらも1つの状態に対して system_one(state, questions) を、パックされたリクエストに対して system_one_batch を公開しています。Liquid AIは、GPU上のd1-omni-600Mにはfloat16を推奨しています。bfloat16では一部の上位回答が変化したためです。カメラ駆動のd1-3Bデモ10本を Open d1 Arcade space. NVIDIAとの連携で、Liquid AIはJetson上でIsaac Simを動かすd1-3Bのデモも披露した。

重要ポイント

  • d1モデルは1回のパスで固定された選択肢に対する確率を出力するものであり、トークンを生成することは決してありません。
  • d1-3BはDecision Index v0.2.1で48.57を記録し、10B未満では最高の結果となりました。
  • d1-3BはRTX 4090上で1つの質問に8ミリ秒で回答します。
  • d1-omni-600Mは587Mパラメータで、テキストと画像または音声を処理します。
  • このライセンスは、年間収益が$10M未満の場合、商用利用が無料です。


以下をチェックしてみてください d1-3B, d1-omni-600M および 技術的詳細「。本プロジェクトの研究者に全ての功績が帰属します。また、ぜひ当方をフォローしてください:」 Twitter そして、私たちの 150k+ ML SubReddit および Subscribe to 当社のニュースレター。待ってください!あなたはTelegramを使っていますか? Telegramでもご参加いただけるようになりました。

[スポンサード] ウェブは、ほとんどのエージェントに欠けている唯一のAPIです。データベース、カレンダー、リポジトリにはAPIがあります。オープンウェブにはほとんどありません。The TinyFish MCPサーバー どんなMCPクライアントにでも4つのツールを提供します。TinySearch、TinyFetch(JavaScriptを含むページ全体をmarkdownで取得)、ログインやフォーム処理用のTinyBrowser、複数ステップのタスク用のTinyAgentです。Search と Fetch は無料です。

投稿 Liquid AI、オープンウェイトのd1-3Bおよびd1-omni-600Mをリリース:出力トークンゼロのマルチモーダル決定モデル 最初に掲載されたのは MarkTechPost.

原文の出典

MarkTechPost

内容について

原文の公開と権利は出典元に帰属します。

機械翻訳 · 原文をご参照ください