MarkTechPostActualizado el

Liquid AI lanza los modelos de pesos abiertos d1-3B y d1-omni-600M: modelos de decisión multimodales con cero tokens de salida

Liquid AI ha lanzado Open d1, dos modelos multimodales de pesos abiertos de su familia de modelos de decisión d1. d1-3B lee texto e imágenes. d1-omni-600M lee texto con una imagen, o texto con audio. Ninguno de los dos…

Liquid AI ha lanzado Open d1, dos modelos multimodales de pesos abiertos de su familia de modelos de decisión d1. d1-3B lee texto e imágenes. d1-omni-600M lee texto con una imagen, o texto con audio. Ninguno de los dos modelos escribe texto. Cada uno devuelve respuestas calibradas y tipadas en una sola pasada hacia adelante con cero tokens de salida. El objetivo son decisiones en tiempo real en el stack de NVIDIA: servidores DGX, estaciones de trabajo RTX y placas edge Jetson.

¿Es desplegable? Sí. Ambos checkpoints están en Hugging Face, se cargan a través de Transformers y tienen soporte de llama.cpp desde el primer día. La LFM Open License v1.0 permite el uso comercial gratuito por debajo de 10 millones de dólares de ingresos anuales. d1-omni-600M es un lanzamiento temprano de investigación sin cifras de latencia publicadas.

¿Qué es un modelo de decisión?

Un LLM generativo escribe su respuesta token por token, y tu código la analiza. Un modelo de decisión recibe un estado y un conjunto de preguntas con nombre. Los lee una vez y devuelve una probabilidad para cada respuesta permitida. El Liquid AI define tres tipos de preguntas:

  • noul: una pregunta de sí o no, devuelta como P(yes).
  • choice: una etiqueta de opciones con nombre, con una distribución de probabilidad completa.
  • score: una posición ponderada por probabilidad en una rúbrica ordenada de 2 a 10 niveles.

Varias preguntas pueden compartir un estado en una sola llamada. Cada respuesta informa output_tokens: 0. Liquid AI recomienda d1 para enrutamiento, moderación, clasificación de intenciones, reranking, puntuación LLM-as-a-judge, barreras de seguridad para agentes e inspección visual. Ninguno de los checkpoints es un modelo de chat.

¿Cómo se construyen d1-3B y d1-omni-600M?

d1-3B tiene 3.12B de parámetros y parte de LFM2.5-VL-3B, un modelo de visión-lenguaje decoder-only. Liquid AI promedió los pesos de LFM2.5-2.6B con el backbone de texto de ese modelo. Luego ajustó varios checkpoints con diferentes semillas y mezclas de datos, y los fusionó de nuevo. Utiliza un codificador de visión SigLIP2 NaFlex de 400M y un contexto de 32,768 tokens. Las entradas largas, las opciones de respuesta mezcladas y corregir los atajos de datos importaron más que las técnicas avanzadas.

d1-omni-600M tiene 587M de parámetros y parte de LFM2.5-Encoder-350M, un codificador bidireccional. Eso cubre un tronco compartido y una cabeza de decisión de 381M, un codificador de visión de 94M y un codificador de audio de 112M. El codificador de audio es un FastConformer de 17 capas. El contexto es de 16,384 tokens. Los clips de audio están limitados a 30 segundos. Una solicitud lleva imágenes o audio, nunca ambos. El entrenamiento de audio cubrió solo solicitudes de hablante a asistente en inglés.

¿Dónde encaja mejor Open d1?

  • Clasificación de soporte y tickets: Una llamada a d1-3B puede responder a una verificación de reembolso sí o no, elegir el equipo responsable y calificar la urgencia sobre el mismo mensaje, con cero tokens de salida que analizar.
  • Inspección visual y moderación en tiempo real en el borde: d1-3B lee una imagen de 384px en 35 ms en Jetson AGX Thor, y Open d1 Arcade lo ejecuta fotograma a fotograma sobre la entrada de una cámara en vivo para moderación de contenido y control por gestos.
  • Enrutamiento de comandos de voz en dispositivos pequeños: d1-omni-600M acepta hasta 30 segundos de voz junto con texto y devuelve directamente la intención o el tema del hablante. Su ficha enumera el enrutamiento de comandos de voz y los guardarraíles de agentes entre sus usos recomendados.

¿Cómo rinde d1 en los benchmarks?

En Decision Index v0.2.1, d1-3B obtiene 48.57. Eso supera a todos los modelos de menos de 10B y supera por poco a Decider 35B-A3B (47.11). Solo Winnow-12B puntúa más alto, con 50.02. Liquid AI ejecutó él mismo el scorers oficial, por lo que las puntuaciones de d1 no son envíos al leaderboard. d1-3B lidera las categorías Tools (74.5) y Arts (36.3), pero se queda atrás en Knowledge (23.8).

En siete benchmarks públicos de texto, d1-3B promedia 82.9, por delante de Decider 4B con 81.1. d1-omni-600M promedia 78.4 y registra las mejores puntuaciones en Civil Comments (95.8) y PAWS-X (79.5). En 11 benchmarks de imagen, d1-3B promedia 74.1 frente a 73.9 de su modelo base. Liquid AI considera los benchmarks de decisiones de audio un problema abierto.

¿Qué tan rápido es d1-3B en hardware NVIDIA?

Liquid AI midió la latencia de extremo a extremo, una solicitud en caliente a la vez. Una pregunta toma 8 ms en una RTX 4090 y 9 ms en una AMD MI325X. En Jetson, la AGX Thor toma 16 ms, la AGX Orin toma 26 ms y la Orin Nano toma 50 ms. En Jetson AGX Thor, tres preguntas sobre un mismo estado toman 20 ms frente a 16 ms para una. La cifra de la RTX 4090 usa model.compile(mode="reduce-overhead"). Sin él, una pregunta toma 16 ms. El Jetson AI Lab de NVIDIA también aloja guías de d1-3B.

¿Cómo se compara Open d1 con otros modelos de decisión abiertos?

Característicad1-3Bd1-omni-600MDecider 4BDecider 35B-A3BWinnow-12B
FabricanteLiquid AILiquid AIMapika (independiente)Mapika (independiente)EldanRing (independiente)
Parámetros3.12B587M4.2B34.7B en total, 3B activos12B
Modelo baseLFM2.5-VL-3BLFM2.5-Encoder-350MQwen3.5-4B-BaseQwen3.5-35B-A3B-BaseGemma 4 12B IT
EntradasTexto, imágenesTexto + imagen, o texto + audioTextoTextoTexto, imágenes
Contexto32,76816,384Estado de 32K tokensEstado de 32K tokens65,536 (probado en Q8)
Decision Index v0.2.148.5715.9540.7047.1150.02
LicenciaLFM Open v1.0LFM Open v1.0Apache 2.0Apache 2.0Apache 2.0
Latencia publicada8 ms por pregunta, RTX 4090No publicada5.2 ms por solicitud de 3 preguntas, B30047 ms por solicitud de 3 preguntas, B300143 ms en solicitud de 4 preguntas en caché cerca de 64K de contexto, RTX 5070 Ti

Fuentes: d1-3B, d1-omni-600M, Decider 4B, Decider 35B-A3B, Winnow-12B model cards. Puntuaciones del índice tal como aparecen en las fichas de d1. Las latencias usan hardware y cargas de trabajo diferentes, por lo que no son directamente comparables.

¿Cómo ejecutas d1 localmente?

d1-3B necesita transformers>=5.14 y trust_remote_code=True. d1-omni-600M necesita transformers>=5.15. Ambos exponen system_one(state, questions) para un estado y system_one_batch para solicitudes empaquetadas. Liquid AI recomienda float16 para d1-omni-600M en GPU, ya que bfloat16 alteró algunas respuestas principales. Puedes probar diez demos de d1-3B basadas en cámara en el Open d1 Arcade espacio. Con NVIDIA, Liquid AI también mostró d1-3B navegando Isaac Sim desde un Jetson.

Conclusiones clave

  • Los modelos d1 generan probabilidades sobre opciones fijas en una sola pasada, nunca generan tokens.
  • d1-3B obtiene 48.57 en Decision Index v0.2.1, el mejor resultado por debajo de 10B.
  • d1-3B responde una pregunta en 8 ms en una RTX 4090.
  • d1-omni-600M procesa texto con imágenes o audio con 587M de parámetros.
  • La licencia es gratuita para uso comercial con ingresos anuales inferiores a $10M.


Consulta los d1-3B, d1-omni-600M y detalles técnicos. Todo el crédito corresponde al investigador de este proyecto. Además, no dude en seguirnos en Twitter y no olvide unirse a nuestro 150k+ML SubReddit y suscribirse a nuestro Newsletter. ¡Espere! ¿está en telegram? ahora también puede unirse a nosotros en telegram.

[Patrocinado] La web es la única API que falta a la mayoría de los agentes. Las bases de datos, los calendarios y los repositorios tienen APIs. La web abierta, en su mayoría, no. El servidor MCP de TinyFish ofrece a cualquier cliente MCP cuatro herramientas: TinySearch, TinyFetch (páginas completas en markdown, con JavaScript incluido), TinyBrowser para inicios de sesión y formularios, y TinyAgent para tareas de varios pasos. Search y Fetch son gratuitos.

La entrada Liquid AI lanza d1-3B y d1-omni-600M de pesos abiertos: modelos de decisión multimodales con cero tokens de salida apareció primero en MarkTechPost.

Fuente original

MarkTechPost

Notas sobre el contenido

La publicación original y los derechos pertenecen a la fuente.

Traducción automática · Consulte el original