Liquid AI ha lanzado Open d1, dos modelos multimodales de pesos abiertos de su familia de modelos de decisión d1. d1-3B lee texto e imágenes. d1-omni-600M lee texto con una imagen, o texto con audio. Ninguno de los dos modelos escribe texto. Cada uno devuelve respuestas calibradas y tipadas en una sola pasada hacia adelante con cero tokens de salida. El objetivo son decisiones en tiempo real en el stack de NVIDIA: servidores DGX, estaciones de trabajo RTX y placas edge Jetson.
¿Es desplegable? Sí. Ambos checkpoints están en Hugging Face, se cargan a través de Transformers y tienen soporte de llama.cpp desde el primer día. La LFM Open License v1.0 permite el uso comercial gratuito por debajo de 10 millones de dólares de ingresos anuales. d1-omni-600M es un lanzamiento temprano de investigación sin cifras de latencia publicadas.
¿Qué es un modelo de decisión?
Un LLM generativo escribe su respuesta token por token, y tu código la analiza. Un modelo de decisión recibe un estado y un conjunto de preguntas con nombre. Los lee una vez y devuelve una probabilidad para cada respuesta permitida. El Liquid AI define tres tipos de preguntas:
- noul: una pregunta de sí o no, devuelta como P(yes).
- choice: una etiqueta de opciones con nombre, con una distribución de probabilidad completa.
- score: una posición ponderada por probabilidad en una rúbrica ordenada de 2 a 10 niveles.
Varias preguntas pueden compartir un estado en una sola llamada. Cada respuesta informa output_tokens: 0. Liquid AI recomienda d1 para enrutamiento, moderación, clasificación de intenciones, reranking, puntuación LLM-as-a-judge, barreras de seguridad para agentes e inspección visual. Ninguno de los checkpoints es un modelo de chat.
¿Cómo se construyen d1-3B y d1-omni-600M?
d1-3B tiene 3.12B de parámetros y parte de LFM2.5-VL-3B, un modelo de visión-lenguaje decoder-only. Liquid AI promedió los pesos de LFM2.5-2.6B con el backbone de texto de ese modelo. Luego ajustó varios checkpoints con diferentes semillas y mezclas de datos, y los fusionó de nuevo. Utiliza un codificador de visión SigLIP2 NaFlex de 400M y un contexto de 32,768 tokens. Las entradas largas, las opciones de respuesta mezcladas y corregir los atajos de datos importaron más que las técnicas avanzadas.
d1-omni-600M tiene 587M de parámetros y parte de LFM2.5-Encoder-350M, un codificador bidireccional. Eso cubre un tronco compartido y una cabeza de decisión de 381M, un codificador de visión de 94M y un codificador de audio de 112M. El codificador de audio es un FastConformer de 17 capas. El contexto es de 16,384 tokens. Los clips de audio están limitados a 30 segundos. Una solicitud lleva imágenes o audio, nunca ambos. El entrenamiento de audio cubrió solo solicitudes de hablante a asistente en inglés.
¿Dónde encaja mejor Open d1?
- Clasificación de soporte y tickets: Una llamada a d1-3B puede responder a una verificación de reembolso sí o no, elegir el equipo responsable y calificar la urgencia sobre el mismo mensaje, con cero tokens de salida que analizar.
- Inspección visual y moderación en tiempo real en el borde: d1-3B lee una imagen de 384px en 35 ms en Jetson AGX Thor, y Open d1 Arcade lo ejecuta fotograma a fotograma sobre la entrada de una cámara en vivo para moderación de contenido y control por gestos.
- Enrutamiento de comandos de voz en dispositivos pequeños: d1-omni-600M acepta hasta 30 segundos de voz junto con texto y devuelve directamente la intención o el tema del hablante. Su ficha enumera el enrutamiento de comandos de voz y los guardarraíles de agentes entre sus usos recomendados.
¿Cómo rinde d1 en los benchmarks?
En Decision Index v0.2.1, d1-3B obtiene 48.57. Eso supera a todos los modelos de menos de 10B y supera por poco a Decider 35B-A3B (47.11). Solo Winnow-12B puntúa más alto, con 50.02. Liquid AI ejecutó él mismo el scorers oficial, por lo que las puntuaciones de d1 no son envíos al leaderboard. d1-3B lidera las categorías Tools (74.5) y Arts (36.3), pero se queda atrás en Knowledge (23.8).
En siete benchmarks públicos de texto, d1-3B promedia 82.9, por delante de Decider 4B con 81.1. d1-omni-600M promedia 78.4 y registra las mejores puntuaciones en Civil Comments (95.8) y PAWS-X (79.5). En 11 benchmarks de imagen, d1-3B promedia 74.1 frente a 73.9 de su modelo base. Liquid AI considera los benchmarks de decisiones de audio un problema abierto.
¿Qué tan rápido es d1-3B en hardware NVIDIA?
Liquid AI midió la latencia de extremo a extremo, una solicitud en caliente a la vez. Una pregunta toma 8 ms en una RTX 4090 y 9 ms en una AMD MI325X. En Jetson, la AGX Thor toma 16 ms, la AGX Orin toma 26 ms y la Orin Nano toma 50 ms. En Jetson AGX Thor, tres preguntas sobre un mismo estado toman 20 ms frente a 16 ms para una. La cifra de la RTX 4090 usa model.compile(mode="reduce-overhead"). Sin él, una pregunta toma 16 ms. El Jetson AI Lab de NVIDIA también aloja guías de d1-3B.
¿Cómo se compara Open d1 con otros modelos de decisión abiertos?
| Característica | d1-3B | d1-omni-600M | Decider 4B | Decider 35B-A3B | Winnow-12B |
|---|---|---|---|---|---|
| Fabricante | Liquid AI | Liquid AI | Mapika (independiente) | Mapika (independiente) | EldanRing (independiente) |
| Parámetros | 3.12B | 587M | 4.2B | 34.7B en total, 3B activos | 12B |
| Modelo base | LFM2.5-VL-3B | LFM2.5-Encoder-350M | Qwen3.5-4B-Base | Qwen3.5-35B-A3B-Base | Gemma 4 12B IT |
| Entradas | Texto, imágenes | Texto + imagen, o texto + audio | Texto | Texto | Texto, imágenes |
| Contexto | 32,768 | 16,384 | Estado de 32K tokens | Estado de 32K tokens | 65,536 (probado en Q8) |
| Decision Index v0.2.1 | 48.57 | 15.95 | 40.70 | 47.11 | 50.02 |
| Licencia | LFM Open v1.0 | LFM Open v1.0 | Apache 2.0 | Apache 2.0 | Apache 2.0 |
| Latencia publicada | 8 ms por pregunta, RTX 4090 | No publicada | 5.2 ms por solicitud de 3 preguntas, B300 | 47 ms por solicitud de 3 preguntas, B300 | 143 ms en solicitud de 4 preguntas en caché cerca de 64K de contexto, RTX 5070 Ti |
Fuentes: d1-3B, d1-omni-600M, Decider 4B, Decider 35B-A3B, Winnow-12B model cards. Puntuaciones del índice tal como aparecen en las fichas de d1. Las latencias usan hardware y cargas de trabajo diferentes, por lo que no son directamente comparables.
¿Cómo ejecutas d1 localmente?
d1-3B necesita transformers>=5.14 y trust_remote_code=True. d1-omni-600M necesita transformers>=5.15. Ambos exponen system_one(state, questions) para un estado y system_one_batch para solicitudes empaquetadas. Liquid AI recomienda float16 para d1-omni-600M en GPU, ya que bfloat16 alteró algunas respuestas principales. Puedes probar diez demos de d1-3B basadas en cámara en el Open d1 Arcade espacio. Con NVIDIA, Liquid AI también mostró d1-3B navegando Isaac Sim desde un Jetson.
Conclusiones clave
- Los modelos d1 generan probabilidades sobre opciones fijas en una sola pasada, nunca generan tokens.
- d1-3B obtiene 48.57 en Decision Index v0.2.1, el mejor resultado por debajo de 10B.
- d1-3B responde una pregunta en 8 ms en una RTX 4090.
- d1-omni-600M procesa texto con imágenes o audio con 587M de parámetros.
- La licencia es gratuita para uso comercial con ingresos anuales inferiores a $10M.
Consulta los d1-3B, d1-omni-600M y detalles técnicos. Todo el crédito corresponde al investigador de este proyecto. Además, no dude en seguirnos en Twitter y no olvide unirse a nuestro 150k+ML SubReddit y suscribirse a nuestro Newsletter. ¡Espere! ¿está en telegram? ahora también puede unirse a nosotros en telegram.
La entrada Liquid AI lanza d1-3B y d1-omni-600M de pesos abiertos: modelos de decisión multimodales con cero tokens de salida apareció primero en MarkTechPost.