MarkTechPostMis à jour le

Liquid AI publie d1-3B et d1-omni-600M en poids ouverts : des modèles de décision multimodaux avec zéro token de sortie

Liquid AI a publié Open d1, deux modèles multimodaux en poids ouverts de sa famille de modèles de décision d1. d1-3B lit le texte et les images. d1-omni-600M lit du texte avec une image, ou du texte avec de l'audio.…

Liquid AI a publié Open d1, deux modèles multimodaux en poids ouverts de sa famille de modèles de décision d1. d1-3B lit le texte et les images. d1-omni-600M lit du texte avec une image, ou du texte avec de l'audio. Aucun des deux modèles n'écrit de texte. Chacun renvoie des réponses calibrées et typées en une seule passe avant avec zéro token de sortie. La cible est la décision en temps réel sur la pile NVIDIA : serveurs DGX, stations de travail RTX et cartes embarquées Jetson.

Est-il déployable ? Oui. Les deux checkpoints sont sur Hugging Face, se chargent via Transformers et bénéficient d'un support llama.cpp dès le premier jour. La LFM Open License v1.0 autorise un usage commercial gratuit en dessous de 10 millions de dollars de chiffre d'affaires annuel. d1-omni-600M est une version de recherche précoce sans chiffres de latence publiés.

Qu'est-ce qu'un modèle de décision ?

Un LLM génératif écrit sa réponse token par token, et votre code l'analyse. Un modèle de décision prend un état et un ensemble de questions nommées. Il les lit une fois et renvoie une probabilité pour chaque réponse autorisée. Le Liquid AI définit trois types de questions :

  • noul : une question par oui ou par non, renvoyée sous forme de P(yes).
  • choice : une étiquette parmi des options nommées, avec une distribution complète des probabilités.
  • score : une position pondérée par probabilité sur une échelle ordonnée de 2 à 10 niveaux.

Plusieurs questions peuvent partager un même état en un seul appel. Chaque réponse rapporte output_tokens: 0. Liquid AI recommande d1 pour le routage, la modération, la classification d'intention, le re-classement, la notation LLM-as-a-judge, les garde-fous d'agents et l'inspection visuelle. Aucun des deux checkpoints n'est un modèle de chat.

Comment d1-3B et d1-omni-600M sont-ils construits ?

d1-3B compte 3.12B de paramètres et part de LFM2.5-VL-3B, un modèle vision-langage de type decoder-only. Liquid AI a moyenné les poids de LFM2.5-2.6B avec le backbone textuel de ce modèle. Il a ensuite affiné plusieurs checkpoints avec différentes graines et mélanges de données, puis les a fusionnés à nouveau. Il utilise un encodeur visuel SigLIP2 NaFlex de 400M et un contexte de 32,768 tokens. Les entrées longues, le brassage des options de réponse et la correction des raccourcis dans les données ont compté davantage que les techniques avancées.

d1-omni-600M compte 587M de paramètres et part de LFM2.5-Encoder-350M, un encodeur bidirectionnel. Cela couvre un tronc partagé de 381M et une tête de décision, un encodeur vision de 94M et un encodeur audio de 112M. L'encodeur audio est un FastConformer à 17 couches. Le contexte est de 16,384 tokens. Les clips audio sont limités à 30 secondes. Une requête transporte des images ou de l'audio, jamais les deux. L'entraînement audio n'a porté que sur des requêtes locuteur-vers-assistant en anglais.

Où Open d1 s'intègre-t-il le mieux ?

  • Tri du support et des tickets : Un seul appel à d1-3B peut répondre à une vérification de remboursement par oui ou par non, choisir l'équipe responsable et évaluer l'urgence sur le même message, sans aucun token de sortie à analyser.
  • Inspection visuelle et modération en temps réel à la périphérie: d1-3B lit une image de 384px en 35 ms sur Jetson AGX Thor, et Open d1 Arcade l'exécute image par image sur une entrée caméra en direct pour la modération de contenu et le contrôle gestuel.
  • Routage des commandes vocales sur de petits appareils: d1-omni-600M prend jusqu'à 30 secondes de parole avec du texte et renvoie directement l'intention ou le sujet du locuteur. Sa fiche liste le routage des commandes vocales et les garde-fous d'agent parmi ses usages recommandés.

Comment d1 se comporte-t-il sur les benchmarks ?

Sur Decision Index v0.2.1, d1-3B obtient 48.57. Cela bat tous les modèles de moins de 10B et dépasse Decider 35B-A3B (47.11). Seul Winnow-12B fait mieux avec 50.02. Liquid AI a lui-même exécuté le scoreur officiel, donc les scores de d1 ne sont pas des soumissions de classement. d1-3B mène dans les catégories Tools (74.5) et Arts (36.3) mais est en retrait sur Knowledge (23.8).

Sur sept benchmarks textuels publics, d1-3B obtient une moyenne de 82.9, devant Decider 4B à 81.1. d1-omni-600M affiche une moyenne de 78.4 et enregistre les meilleurs scores Civil Comments (95.8) et PAWS-X (79.5). Sur 11 benchmarks d'images, d1-3B obtient une moyenne de 74.1 contre 73.9 pour son modèle de base. Liquid AI qualifie les benchmarks de décision audio de problème ouvert.

Quelle est la vitesse de d1-3B sur le matériel NVIDIA ?

Liquid AI a mesuré la latence de bout en bout, une requête à chaud à la fois. Une question prend 8 ms sur une RTX 4090 et 9 ms sur une AMD MI325X. Sur Jetson, l'AGX Thor prend 16 ms, l'AGX Orin prend 26 ms, et l'Orin Nano prend 50 ms. Sur Jetson AGX Thor, trois questions sur un même état prennent 20 ms contre 16 ms pour une seule. Le chiffre de la RTX 4090 utilise model.compile(mode="reduce-overhead"). Sans cela, une question prend 16 ms. Le Jetson AI Lab de NVIDIA héberge également des guides d1-3B.

Comment Open d1 se compare-t-il aux autres modèles de décision ouverts ?

Caractéristiqued1-3Bd1-omni-600MDecider 4BDecider 35B-A3BWinnow-12B
FabricantLiquid AILiquid AIMapika (indépendant)Mapika (indépendant)EldanRing (indépendant)
Paramètres3.12B587M4.2B34.7B au total, 3B actifs12B
Modèle de baseLFM2.5-VL-3BLFM2.5-Encoder-350MQwen3.5-4B-BaseQwen3.5-35B-A3B-BaseGemma 4 12B IT
EntréesTexte, imagesTexte + image, ou texte + audioTexteTexteTexte, images
Contexte32,76816,384état de 32K tokensétat de 32K tokens65,536 (testé en Q8)
Decision Index v0.2.148.5715.9540.7047.1150.02
LicenceLFM Open v1.0LFM Open v1.0Apache 2.0Apache 2.0Apache 2.0
Latence publiée8 ms par question, RTX 4090Non publiée5.2 ms par requête à 3 questions, B30047 ms par requête à 3 questions, B300143 ms pour une requête à 4 questions en cache proche de 64K de contexte, RTX 5070 Ti

Sources : d1-3B, d1-omni-600M, Decider 4B, Decider 35B-A3B, Winnow-12B fiches de modèles. Scores d'index tels qu'indiqués sur les fiches d1. Les latences utilisent du matériel et des charges de travail différents, elles ne sont donc pas directement comparables.

Comment exécuter d1 en local ?

d1-3B nécessite transformers>=5.14 et trust_remote_code=True. d1-omni-600M nécessite transformers>=5.15. Les deux exposent system_one(state, questions) pour un seul état et system_one_batch pour les requêtes groupées. Liquid AI recommande float16 pour d1-omni-600M sur GPU, car bfloat16 a modifié certaines réponses principales. Vous pouvez essayer dix démos d1-3B pilotées par caméra dans l' Open d1 Arcade space. Avec NVIDIA, Liquid AI a également montré d1-3B naviguant dans Isaac Sim depuis un Jetson.

Points clés

  • Les modèles d1 produisent des probabilités sur des options fixes en une seule passe, sans jamais générer de tokens.
  • d1-3B obtient 48.57 sur Decision Index v0.2.1, le meilleur résultat en dessous de 10B.
  • d1-3B répond à une question en 8 ms sur une RTX 4090.
  • d1-omni-600M traite du texte avec des images ou de l'audio avec 587M de paramètres.
  • La licence est gratuite pour un usage commercial en dessous de 10 M$ de revenus annuels.


Découvrez les d1-3B, d1-omni-600M et les détails techniques. Tout le crédit revient au chercheur de ce projet. N'hésitez pas non plus à nous suivre sur Twitter et n'oubliez pas de rejoindre notre 150k+ML SubReddit et de vous abonner à notre Newsletter. Attendez ! êtes-vous sur telegram ? vous pouvez désormais également nous rejoindre sur telegram.

[Sponsorisé] Le web est la seule API qui manque à la plupart des agents. Les bases de données, les calendriers et les dépôts ont des API. Le web ouvert, pour l'essentiel, non. Le serveur MCP TinyFish offre à tout client MCP quatre outils : TinySearch, TinyFetch (pages complètes en markdown, JavaScript inclus), TinyBrowser pour les connexions et les formulaires, et TinyAgent pour les tâches en plusieurs étapes. Search et Fetch sont gratuits.

L'article Liquid AI publie les modèles à poids ouverts d1-3B et d1-omni-600M : des modèles de décision multimodaux sans aucun token de sortie est apparu en premier sur MarkTechPost.

Source originale

MarkTechPost

À propos du contenu

La publication originale et les droits appartiennent à la source.

Traduction automatique · Consultez l’original