Liquid AI hat Open d1 veröffentlicht, zwei Open-Weight-multimodale Modelle aus seiner d1-Entscheidungsmodellfamilie. d1-3B liest Text und Bilder. d1-omni-600M liest Text mit einem Bild oder Text mit Audio. Keines der Modelle schreibt Text. Jedes liefert kalibrierte, typisierte Antworten in einem einzigen Forward-Pass mit null Output-Tokens. Das Ziel sind Echtzeitentscheidungen auf dem NVIDIA-Stack: DGX-Server, RTX-Workstations und Jetson-Edge-Boards.
Ist es einsetzbar? Ja. Beide Checkpoints sind auf Hugging Face verfügbar, lassen sich über Transformers laden und haben ab Tag eins llama.cpp-Unterstützung. Die LFM Open License v1.0 erlaubt kostenlose kommerzielle Nutzung unterhalb von 10 Millionen US-Dollar Jahresumsatz. d1-omni-600M ist eine frühe Forschungsveröffentlichung ohne veröffentlichte Latenzwerte.
Was ist ein Entscheidungsmodell?
Ein generatives LLM schreibt seine Antwort Token für Token, und Ihr Code parst sie. Ein Entscheidungsmodell nimmt einen Zustand und eine Reihe benannter Fragen. Es liest sie einmal und gibt für jede erlaubte Antwort eine Wahrscheinlichkeit zurück. Die Liquid AI definieren drei Fragetypen:
- noul: eine Ja-oder-Nein-Frage, zurückgegeben als P(yes).
- choice: ein Label aus benannten Optionen, mit einer vollständigen Wahrscheinlichkeitsverteilung.
- score: eine wahrscheinlichkeitsgewichtete Position auf einer geordneten Rubrik von 2 bis 10 Stufen.
Mehrere Fragen können sich einen Zustand in einem einzigen Aufruf teilen. Jede Antwort meldet output_tokens: 0. Liquid AI empfiehlt d1 für Routing, Moderation, Intent-Klassifikation, Reranking, LLM-as-a-judge-Bewertung, Agent-Guardrails und visuelle Inspektion. Keiner der Checkpoints ist ein Chat-Modell.
Wie sind d1-3B und d1-omni-600M aufgebaut?
d1-3B hat 3.12B Parameter und basiert auf LFM2.5-VL-3B, einem Decoder-only Vision-Language-Modell. Liquid AI hat die Gewichte von LFM2.5-2.6B mit dem Text-Backbone dieses Modells gemittelt. Anschließend wurden mehrere Checkpoints mit unterschiedlichen Seeds und Datenmischungen feinabgestimmt und erneut zusammengeführt. Es verwendet einen 400M SigLIP2 NaFlex Vision-Encoder und einen Kontext von 32,768 Tokens. Lange Eingaben, gemischte Antwortoptionen und das Beseitigen von Datenshortcuts waren wichtiger als fortgeschrittene Techniken.
d1-omni-600M hat 587M Parameter und geht hervor aus LFM2.5-Encoder-350M, einem bidirektionalen Encoder. Dieser umfasst einen 381M gemeinsamen Rumpf und Entscheidungskopf, einen 94M Vision-Encoder und einen 112M Audio-Encoder. Der Audio-Encoder ist ein 17-schichtiger FastConformer. Der Kontext beträgt 16,384 Token. Audioclips sind auf 30 Sekunden begrenzt. Eine Anfrage enthält Bilder oder Audio, nie beides. Das Audio-Training umfasste nur englische Sprecher-zu-Assistent-Anfragen.
Wo passt Open d1 am besten?
- Support- und Ticket-Triage: Ein einziger d1-3B-Aufruf kann anhand derselben Nachricht eine Ja-oder-Nein-Erstattungsprüfung beantworten, das zuständige Team auswählen und die Dringlichkeit einstufen – mit null Ausgabe-Tokens zum Parsen.
- Echtzeit-visuelle Inspektion und Moderation am Edge: d1-3B liest ein 384px-Bild in 35 ms auf Jetson AGX Thor, und Liquid AI’s Open d1 Arcade führt es Frame für Frame bei Live-Kamera-Eingabe für Inhaltsmoderation und Gestensteuerung aus.
- Sprachbefehls-Routing auf kleinen Geräten: d1-omni-600M nimmt bis zu 30 Sekunden Sprache zusammen mit Text entgegen und gibt die Absicht oder das Thema des Sprechers direkt zurück. Seine Karte führt Sprachbefehls-Routing und Agent-Guardrails unter den empfohlenen Verwendungszwecken auf.
Wie schneidet d1 bei Benchmarks ab?
Beim Decision Index v0.2.1erreicht d1-3B 48.57. Das schlägt jedes Modell unter 10B und liegt knapp vor Decider 35B-A3B (47.11). Nur Winnow-12B ist mit 50.02 höher. Liquid AI hat den offiziellen Scorer selbst ausgeführt, daher sind d1-Werte keine Leaderboard-Einreichungen. d1-3B führt die Kategorien Tools (74.5) und Arts (36.3) an, liegt aber bei Knowledge zurück (23.8).
Über sieben öffentliche Text-Benchmarks hinweg erreicht d1-3B im Durchschnitt 82.9, vor Decider 4B mit 81.1. d1-omni-600M erreicht im Schnitt 78.4 und stellt die Top-Werte bei Civil Comments (95.8) und PAWS-X (79.5) auf. Bei 11 Bild-Benchmarks kommt d1-3B auf 74.1 gegenüber 73.9 für sein Basismodell. Liquid AI bezeichnet Audio-Entscheidungs-Benchmarks als offenes Problem.
Wie schnell ist d1-3B auf NVIDIA-Hardware?
Liquid AI hat die End-to-End-Latenz gemessen, jeweils eine warme Anfrage. Eine Frage dauert 8 ms auf einer RTX 4090 und 9 ms auf einer AMD MI325X. Auf Jetson dauert AGX Thor 16 ms, AGX Orin 26 ms und Orin Nano 50 ms. Auf Jetson AGX Thor dauern drei Fragen über einen Zustand 20 ms gegenüber 16 ms für eine Frage. Die RTX-4090-Angabe verwendet model.compile(mode="reduce-overhead"). Ohne diese dauert eine Frage 16 ms. NVIDIAs Jetson AI Lab hostet ebenfalls d1-3B-Anleitungen.
Wie schneidet Open d1 im Vergleich zu anderen offenen Entscheidungsmodellen ab?
| Feature | d1-3B | d1-omni-600M | Decider 4B | Decider 35B-A3B | Winnow-12B |
|---|---|---|---|---|---|
| Hersteller | Liquid AI | Liquid AI | Mapika (unabhängig) | Mapika (unabhängig) | EldanRing (unabhängig) |
| Parameter | 3.12B | 587M | 4.2B | 34.7B insgesamt, 3B aktiv | 12B |
| Basismodell | LFM2.5-VL-3B | LFM2.5-Encoder-350M | Qwen3.5-4B-Base | Qwen3.5-35B-A3B-Base | Gemma 4 12B IT |
| Eingaben | Text, Bilder | Text + Bild oder Text + Audio | Text | Text | Text, Bilder |
| Kontext | 32,768 | 16,384 | 32K-Token-Zustand | 32K-Token-Zustand | 65,536 (Q8 getestet) |
| Decision Index v0.2.1 | 48.57 | 15.95 | 40.70 | 47.11 | 50.02 |
| Lizenz | LFM Open v1.0 | LFM Open v1.0 | Apache 2.0 | Apache 2.0 | Apache 2.0 |
| Veröffentlichte Latenz | 8 ms pro Frage, RTX 4090 | Nicht veröffentlicht | 5.2 ms pro 3-Fragen-Anfrage, B300 | 47 ms pro 3-Fragen-Anfrage, B300 | 143 ms gecachte 4-Fragen-Anfrage nahe 64K Kontext, RTX 5070 Ti |
Quellen: d1-3B, d1-omni-600M, Decider 4B, Decider 35B-A3B, Winnow-12B Modellkarten. Indexwerte wie auf den d1-Karten angegeben. Die Latenzen verwenden unterschiedliche Hardware und Workloads und sind daher nicht direkt vergleichbar.
Wie führt man d1 lokal aus?
d1-3B benötigt transformers>=5.14 und trust_remote_code=True. d1-omni-600M benötigt transformers>=5.15. Beide bieten system_one(state, questions) für einen Zustand und system_one_batch für gepackte Anfragen. Liquid AI empfiehlt float16 für d1-omni-600M auf der GPU, da bfloat16 einige Top-Antworten verändert hat. Sie können zehn kamerabasierte d1-3B-Demos im Open d1 Arcade ausprobieren space. Mit NVIDIA zeigte Liquid AI außerdem d1-3B, das Isaac Sim von einem Jetson aus steuert.
Wichtigste Erkenntnisse
- d1-Modelle geben Wahrscheinlichkeiten über feste Optionen in einem Durchgang aus und generieren nie Tokens.
- d1-3B erreicht 48.57 auf dem Decision Index v0.2.1, das beste Ergebnis unter 10B.
- d1-3B beantwortet eine Frage in 8 ms auf einer RTX 4090.
- d1-omni-600M verarbeitet Text mit Bildern oder Audio bei 587M Parametern.
- Die Lizenz ist für kommerzielle Nutzung bei einem Jahresumsatz unter $10M kostenlos.
Schauen Sie sich die d1-3B, d1-omni-600M und Technischen Detailsan. Der gesamte Dank gilt dem Forscher dieses Projekts. Folgen Sie uns gerne auch auf Twitter und vergessen Sie nicht, unserem 150k+ML SubReddit beizutreten und unseren Newsletterzu abonnieren. Moment! Sind Sie auf Telegram? jetzt können Sie uns auch auf Telegram beitreten.
Der Beitrag Liquid AI veröffentlicht Open-Weight-Modelle d1-3B und d1-omni-600M: Multimodale Entscheidungsmodelle mit null Output-Tokens erschien zuerst auf MarkTechPost.