Hugging Face

Modelos de decisión multimodales y abiertos d1 para el edge

Hoy lanzamos dos modelos de decisión abiertos en nuestra familia de modelos de decisión d1: d1-3B y d1-omni-600M (experimental). El mejor modelo de decisión por debajo de 10B en el Decision Index 0.2

Fuente de la imagen · Hugging Face

Hoy lanzamos dos modelos de decisión abiertos en nuestra familia de modelos de decisión d1: d1-3B y d1-omni-600M (experimental).

  • El mejor modelo de decisión por debajo de 10B en el Decision Index 0.2.1: d1-3B obtiene 48.57, por delante de todos los modelos de 4B y 9B y de Decider 35B-A3B (47.11).
  • Multimodal: d1-3B admite texto e imágenes, mientras que d1-omni-600M admite texto e imágenes o texto y audio
  • Rápido: d1-3B responde una pregunta en 16 ms en un NVIDIA Jetson AGX Thor, 26 ms en un Jetson AGX Orin y 50 ms en un Jetson Orin Nano

Cómo construimos modelos de decisión para el edge

Estos modelos de decisión d1 abiertos están construidos sobre nuestros Liquid Foundation Models (LFMs). A diferencia de nuestros modelos generativos, los modelos de decisión no producen tokens, sino que responden en una sola pasada hacia adelante.

d1-3B y d1-omni-600M se entrenan a partir de dos backbones muy diferentes:

  • d1-3B se entrena a partir de LFM2.5-VL-3B, nuestro último VLM, que es decoder-only. Acepta texto e imágenes como entradas.
  • d1-omni-600M se entrena a partir de LFM2.5-Encoder-350M, un codificador bidireccional. Añade codificadores de visión y audio para manejar las tres modalidades. Acepta como entradas texto e imagen, o texto y audio. Este modelo se encuentra actualmente en una versión inicial de investigación y sigue en desarrollo.

Resultados de benchmarks

Hicimos benchmark de d1-3B y d1-omni-600M en siete conjuntos de datos públicos que abarcan comprensión lectora, detección de toxicidad, clasificación de intenciones, preguntas y respuestas médicas y comprensión multilingüe. d1-3B logra una puntuación media de 82.9, la más alta de la tabla y por encima de Decider 4B. d1-omni-600M obtiene 78.4, superando a Decider 2B (77.1) con solo una cuarta parte de los parámetros.

Benchmark d1-omni-600M d1-3B Decider 2B Decider 4B
SQuAD 2.0 74.0 83.3 67.7 76.0
Civil Comments 95.8 93.3 93.6 92.8
MASSIVE intent 86.1 86.9 81.1 88.3
PubMedQA 61.3 68.3 65.7 63.3
BoolQ 77.7 86.3 87.3 89.0
XNLI 74.7 85.6 85.0 88.6
PAWS-X 79.5 76.4 59.5 69.8
Media 78.4 82.9 77.1 81.1

Validamos que d1-3B conserva las capacidades de visión de su backbone LFM2.5-VL-3B en benchmarks de visión estándar, y que d1-omni-600M maneja las tres modalidades. No reportamos ningún benchmark de visión o audio, ya que el Decision Index v0.3 incluye solo una partición privada de visión y los benchmarks de decisión de audio son actualmente un problema abierto.

Velocidad

En colaboración con NVIDIA, evaluamos d1-3B en el stack de NVIDIA a través de NVIDIA GeForce RTX 4090, NVIDIA Jetson AGX Thor, Jetson AGX Orin 64 GB y Jetson Orin Nano. Dado que d1-omni-600M es un lanzamiento temprano de investigación, no reportamos ninguna cifra de velocidad para él en este lanzamiento.

Inferencia en el borde. d1-3B responde una sola pregunta en menos de 50 ms en cada dispositivo medido. Tres preguntas toman solo 1.3x el tiempo de una, con el AGX Thor pasando de 16 ms a 20 ms.

Una pregunta 3 preguntas Estado de 3.4K tokens imagen de 384px 64 estados, empaquetados
Apple M5 Pro 30 ms 41 ms 640 ms 62 ms 78 / s
Jetson AGX Thor 16 ms 20 ms 220 ms 35 ms 262 / s
Jetson AGX Orin 64 GB 26 ms 35 ms 560 ms 83 ms 110 / s
Jetson Orin Nano 50 ms 73 ms 1,640 ms 202 ms 38 / s

Inferencia en GPU. En GPU, d1-3B responde una pregunta en menos de 10 ms y procesa una imagen de 384px en menos de 18 ms en ambas plataformas.

Una pregunta 3 preguntas Estado de 3.4K tokens Imagen de 384px 64 estados, empaquetados
NVIDIA RTX 4090 8 ms 21 ms 102 ms 17 ms 475 / s
AMD MI325X 9 ms 14 ms 44 ms 18 ms 1,106 / s

Cómo usar los modelos de decisión d1 abiertos

Acuda a los modelos de decisión d1 cuando necesite decisiones rápidas y estructuradas, incluidas entradas multimodales. d1-3B ofrece la mayor calidad de decisión en su tamaño, mientras que d1-omni-600M encaja donde la huella importa.

Instale las dependencias (requiere transformers>=5.14):

pip install "transformers>=5.14" torch torchvision pillow

Estos modelos incluyen su propio código, así que cárguelo con trust_remote_code=True:

import io
import urllib.request

import torch
from PIL import Image
from transformers import AutoModel

device = "cuda" if torch.cuda.is_available() else "mps" if torch.backends.mps.is_available() else "cpu"
model = AutoModel.from_pretrained("LiquidAI/d1-3B", trust_remote_code=True,
                                  dtype=torch.float32 if device == "cpu" else torch.bfloat16).to(device)

# Several named questions over one text state, answered in one pass
questions = {
    "refund": {"type": "noul", "instructions": "Is the customer asking for a refund?"},
    "team": {"type": "choice", "instructions": "Which team should handle this?",
             "criteria": {"billing": "Charges, refunds, invoices", "technical": "App or site faults",
                          "fraud": "Suspected unauthorised use"}},
    "urgency": {"type": "score", "instructions": "How urgent is this?",
                "criteria": ["Can wait", "Today", "Blocking the customer now"]},
}
print(model.system_one("I was charged twice this month, please refund one of them.", questions))

# An image as the whole state
url = "http://images.cocodataset.org/val2017/000000039769.jpg"  # two cats on a sofa
photo = Image.open(io.BytesIO(urllib.request.urlopen(url).read()))
print(model.system_one(None, {"cats": {"type": "choice", "instructions": "How many cats are there?",
                                       "criteria": {"one": "One", "two": "Two", "more": "Three or more"}}},
                       images=[photo]))

# Many requests, packed together with no padding
tickets = ["Where is my parcel? It was due Monday.", "The app crashes when I open settings."]
print(model.system_one_batch([(t, {"team": questions["team"]}) for t in tickets]))

Por brevedad, solo incluimos el ejemplo de d1-3B. Consulte la ficha del modelo d1-omni-600M para obtener instrucciones sobre cómo ejecutarlo.

Comience con los modelos de decisión d1 abiertos

Ambos modelos de decisión son de pesos abiertos y están disponibles en Hugging Face hoy:

Estamos deseando ver lo que construya.

Citación

Si utiliza este trabajo, por favor cite la entrada del blog de la versión:

@article{liquidAI2026opend1,
  author  = {Liquid AI},
  title   = {Open d1: Edge decision models for text, vision, and audio},
  journal = {Liquid AI Blog},
  year    = {2026},
  note    = {www.liquid.ai/blog/open-d1},
}
Fuente original

Hugging Face

Notas sobre el contenido

La publicación original y los derechos pertenecen a la fuente.

Traducción automática · Consulte el original