MarkTechPost更新于

Liquid AI发布开放权重的d1-3B和d1-omni-600M:零输出 token 的多模态决策模型

Liquid AI开源d1决策模型:d1-3B读文本图像,d1-omni-600M另支持音频,均不生成文本,单次前向返回概率答案。d1-3B在Decision Index v0.2.1得48.57分,RTX 4090单问8毫秒,权重已上架Hugging Face。

Liquid AI 发布了 Open d1,即其 d1 决策模型系列中的两个开放权重多模态模型。 d1-3B 读取文本和图像。 d1-omni-600M 读取带图像的文本,或带音频的文本。两个模型都不生成文本。它们各自在单次前向传播中返回经过校准的类型化答案,且零输出token。目标是NVIDIA技术栈上的实时决策:DGX服务器、RTX工作站和Jetson边缘板。

它可部署吗? 是的。两个检查点都在 Hugging Face 上,可通过 Transformers 加载,并且从第一天起就获得 llama.cpp 支持。 LFM 开放许可证 v1.0 允许年收入低于1000万美元的情况下免费商用。d1-omni-600M是一个早期研究版本,尚未公布延迟数据。

什么是决策模型?

生成式大语言模型逐个 token 地写出答案,而你的代码对其进行解析。决策模型则接收一个状态和一组命名问题。它只需读取一次,就会为每个允许的答案返回一个概率。 该 Liquid AI 定义三种问题类型:

  • noul: 一个是非问题,以 P(yes) 的形式返回。
  • 选择: 一个来自命名选项的标签,并附带完整的概率分布。
  • 得分: 在一个由2到10个等级组成的有序评分标准上的概率加权立场。

在一次通话中,多个问题可以共享一个状态。每个响应都会报告 output_tokens: 0. Liquid AI 推荐 d1 用于路由、审核、意图分类、重排序、LLM-as-a-judge 打分、智能体护栏以及视觉检查。两个检查点都不是聊天模型。

d1-3B 和 d1-omni-600M 是如何构建的?

d1-3B 拥有3.12B参数,并从 LFM2.5-VL-3B开始,这是一个仅解码器的视觉语言模型。Liquid AI 将 LFM2.5-2.6B 的权重与该模型的文本主干进行了平均。随后,它使用不同的种子和数据配比对若干检查点进行了微调,并再次将它们合并。该模型采用 400M 的 SigLIP2 NaFlex 视觉编码器和 32,768 个 token 的上下文。长输入、打乱的答案选项以及修复数据捷径,比先进技术更为重要。

d1-omni-600M 具有587M参数,起点是 LFM2.5-Encoder-350M,一个双向编码器。这包括一个381M的共享主干和决策头、一个94M的视觉编码器以及一个112M的音频编码器。音频编码器是一个17层的FastConformer。上下文长度为16,384个token。音频片段最长限制为30秒。一个请求要么携带图像,要么携带音频,绝不同时携带。音频训练仅覆盖英语的说话者对助手请求。

Open d1最适合哪些场景?

  • 支持和工单分类: 一次d1-3B调用可以针对同一条消息回答退款检查的是/否问题、选择负责团队并评定紧急程度,且无需解析任何输出token。
  • 边缘端的实时视觉检测与审核:d1-3B在Jetson AGX Thor上读取一张384px图像仅需35 ms,而Liquid AI的 Open d1 Arcade 可以在实时摄像头输入上逐帧运行它,用于内容审核和手势控制。
  • 小型设备上的语音指令路由: d1-omni-600M 最多可接收30秒的语音并同时接收文本,直接返回说话者的意图或主题。其模型卡将语音指令路由和智能体防护栏列为其推荐用途。

d1在基准测试中表现如何?

在 Decision Index v0.2.1上,d1-3B得分为48.57。这超过了所有10B以下的模型,并略胜Decider 35B-A3B(47.11)。只有Winnow-12B得分更高,为50.02。Liquid AI自己运行了官方评分器,因此d1的分数并非排行榜提交成绩。d1-3B在工具(74.5)和艺术(36.3)类别中领先,但在知识(23.8)上落后。

在七个公开文本基准测试中,d1-3B平均得分为82.9,领先于平均81.1的Decider 4B。d1-omni-600M平均得分为78.4,并取得了Civil Comments(95.8)和PAWS-X(79.5)的最高分。在11个图像基准测试中,d1-3B平均得分为74.1,而其基础模型为73.9。Liquid AI称音频决策基准测试是一个开放性问题。

d1-3B在NVIDIA硬件上速度有多快?

Liquid AI 逐个测量了端到端延迟(暖请求)。一个问题在 RTX 4090 上需要 8 ms,在 AMD MI325X 上需要 9 ms。在 Jetson 上,AGX Thor 需要 16 ms,AGX Orin 需要 26 ms,Orin Nano 需要 50 ms。在 Jetson AGX Thor 上,一个状态下的三个问题需要 20 ms,而一个问题为 16 ms。RTX 4090 的数据使用了 model.compile(mode="reduce-overhead")。没有它,一个问题需要 16 ms。NVIDIA 的 Jetson AI Lab 也提供 d1-3B 指南。

Open d1 与其他开放决策模型相比如何?

特性d1-3Bd1-omni-600MDecider 4BDecider 35B-A3BWinnow-12B
开发者Liquid AILiquid AIMapika(独立)Mapika(独立)EldanRing(独立)
参数量3.12B587M4.2B34.7B 总参数,3B 激活12B
基础模型LFM2.5-VL-3BLFM2.5-Encoder-350MQwen3.5-4B-BaseQwen3.5-35B-A3B-BaseGemma 4 12B IT
输入文本、图像文本 + 图像,或文本 + 音频文本文本文本、图片
背景32,76816,38432K令牌状态32K-token 状态65,536(测试了Q8)
Decision Index v0.2.148.5715.9540.7047.1150.02
许可证LFM Open v1.0LFM Open v1.0Apache 2.0Apache 2.0Apache 2.0
发布延迟每个问题8毫秒,RTX 4090未发布每个包含3道题的请求耗时5.2 ms,B300每次3个问题的请求耗时47毫秒,B300在接近64K上下文的情况下,缓存4个问题的请求耗时143毫秒,RTX 5070 Ti

来源: d1-3B, d1-omni-600M, Decider 4B, Decider 35B-A3B, Winnow-12B 模型卡片。d1卡片上列出的索引分数。延迟使用不同的硬件和工作负载,因此不能直接比较。

如何在本地运行 d1?

d1-3B 需要 transformers>=5.14 和 trust_remote_code=True. d1-omni-600M 需要 transformers>=5.15。两者都暴露 system_one(state, questions) 针对一个州,并且 system_one_batch 用于打包请求。Liquid AI 建议在 GPU 上对 d1-omni-600M 使用 float16,因为 bfloat16 改变了一些排名靠前的答案。你可以在其中尝试十个由摄像头驱动的 d1-3B 演示,位于 Open d1 Arcade 中试用十个由摄像头驱动的 d1-3B 演示。 空间。借助 NVIDIA,Liquid AI 还展示了 d1-3B 在 Jetson 上操控 Isaac Sim。

要点

  • d1 模型在一次前向传播中输出固定选项上的概率,从不生成 token。
  • d1-3B 在 Decision Index v0.2.1 上得分 48.57,是 10B 以下模型的最佳结果。
  • d1-3B 在 RTX 4090 上回答一个问题只需 8 毫秒。
  • d1-omni-600M 以 587M 参数处理文本结合图像或音频。
  • 该许可证在年收入低于10M美元时可免费商用。


欢迎查看 d1-3B, d1-omni-600M 以及 Technical details。所有功劳归于该项目的研究者。另外,欢迎在 Twitter 上关注我们,别忘了加入我们的 150k+ML SubReddit 并订阅 our Newsletter。等等!你用 Telegram 吗? 现在你也可以在 Telegram 上加入我们了。

[赞助内容] Web 是大多数智能体缺失的那个 API。数据库、日历和代码仓库都有 API,而开放 Web 基本没有。 TinyFish MCP server 为任何 MCP 客户端提供四个工具:TinySearch、TinyFetch(以 markdown 输出完整页面,包括 JavaScript)、用于登录和表单的 TinyBrowser,以及用于多步骤任务的 TinyAgent。Search 和 Fetch 免费。

本文《 Liquid AI 发布开放权重的 d1-3B 和 d1-omni-600M:零输出 token 的多模态决策模型 》首发于 MarkTechPost.

原始出处

MarkTechPost

内容说明

原始发布及相关权利归来源方。

机器翻译 · 请以原文为准