IT之家 AI

Liquid AIのオープンソースd1シリーズ意思決定モデル:一度の判断にわずか8ミリ秒、画像入力に対応

IT之家 10月9日のニュースによると、Liquid AIは10月7日にブログを公開し、d1シリーズの2つのオープンウェイト決定モデルを発表した。d1-3Bは31.2億パラメータでテキストと画像の判断をサポートし、d1-omni-600Mは5.87億パラメータでテキスト、画像、音声の入力をサポートする…

画像の出典 · IT之家 AI

IT之家 10月9日の報道によると、Liquid AIは10月7日にブログを公開し、d1シリーズの2つのオープンウェイト決定モデルを発表した。d1-3Bは31.2億パラメータを使用してテキストと画像の判断が可能であり、d1-omni-600Mは5.87億パラメータを使用してテキスト、画像、音声の入力が可能である。

IT之家がボウェンの発言を引用して述べているところによると、Jevモデルが9月に大ヒットした後、OpenAIなどの企業も同様の意思決定モデルを相次いで公開している。そしてLiquid AIはこの戦場に新たに加わったメンバーであり、今回公開されたd1-3Bとd1-omni-600MはHugging Faceで公開されており、ユーザーはそれらをダウンロードし、微調整してデプロイすることができる。

d1-3Bは31.2億個のパラメータを持ち、視覚言語モデルLFM2.5-VL-3Bを基に訓練されており、テキストと画像の入力をサポートします。このモデルはDecision Index v0.2.1の公開テストセットで48.57点を獲得し、Liquid AIはこれが10B以下のすべてのモデルよりも優れていると述べています。

d1-omni-600Mは5.87億個のパラメータを持ち、双方向エンコーダLFM2.5-Encoder-350Mを基に訓練されました。このモデルはテキストと画像、またはテキストと音声の組み合わせ入力をサポートし、Liquid AIの最初の多モーダル決定モデルチェックポイントに属します。

推論速度に関しては、d1-3Bは NVIDIA RTX 4090上で単一の問題に対する回答に8ミリ秒、384ピクセルの画像を処理するには102ミリ秒かかります。Jetson AGX Thor上では1つの質問に16ミリ秒、Jetson Orin Nanoでは50ミリ秒かかります。

ユーザーテストによると、d1-3Bは12GBのグラフィックメモリを備えたGeForce RTX 3060で、1回の判断に25ミリ秒かかり、640×480ピクセルの画像を処理するのに146ミリ秒かかり、ピーク時のグラフィックメモリ使用量は約6GBです。また、別のユーザーは、このモデルがRTX 3090で1回の判断に8ミリ秒かかると報告しています。

原文の出典

IT之家 AI

内容について

原文の公開と権利は出典元に帰属します。

機械翻訳 · 原文をご参照ください