Hugging Face

نماذج قرار مفتوحة متعددة الوسائط d1 للأنظمة الطرفية

اليوم، نطلق نموذجي قرار مفتوحين في عائلة نماذج قرار d1: d1-3B و d1-omni-600M (تجريبي). أفضل نموذج قرار تحت 10B على مؤشر القرار Decision Index 0.2.1: تسجل d1-3B نتيجة 48.57، متقدمة على كل نماذج 4B و9B

مصدر الصورة · Hugging Face

اليوم، نطلق نموذجي قرار مفتوحين في عائلة نماذج قرار d1: d1-3B و d1-omni-600M (تجريبي).

  • أفضل نموذج قرار تحت 10B على مؤشر القرار Decision Index 0.2.1: تسجل d1-3B نتيجة 48.57، متقدمة على كل نماذج 4B و9B وعلى Decider 35B-A3B (47.11).
  • متعددة الوسائط: تدعم d1-3B النصوص والصور، بينما تدعم d1-omni-600M النصوص والصور أو النصوص والصوت
  • سريعة: تجيب d1-3B على سؤال في 16 ms على NVIDIA Jetson AGX Thor، وفي 26 ms على Jetson AGX Orin، وفي 50ms على Jetson Orin Nano

كيف بنينا نماذج قرار للأنظمة الطرفية

هذه النماذج المفتوحة d1 مبنية على نماذجنا Liquid Foundation Models (LFMs). وعلى عكس نماذجنا التوليدية، لا تنتج نماذج القرار رموزاً بل تجيب في تمريرة أمامية واحدة.

تم تدريب d1-3B وd1-omni-600M من هيكلين أساسيين مختلفين تماماً:

  • d1-3B مدرَّب من LFM2.5-VL-3B، أحدث نماذج VLM لدينا، وهو من نوع decoder-only. يقبل النصوص والصور كمدخلات.
  • d1-omni-600M مدرَّب من LFM2.5-Encoder-350M، وهو مشفّر ثنائي الاتجاه. يضيف مشفّرات رؤية وصوت للتعامل مع الوسائط الثلاث جميعها. يقبل إما نصاً وصورة، أو نصاً وصوتاً كمدخلات. هذا النموذج حالياً في إصدار بحثي مبكر وهو قيد مزيد من التطوير.

نتائج المقارنة المرجعية

أجرينا مقارنة مرجعية لـ d1-3B وd1-omni-600M على سبع مجموعات بيانات عامة تشمل فهم المقروء، وكشف السمية، وتصنيف النوايا، والأسئلة الطبية، والفهم عبر اللغات. تحقق d1-3B متوسط نتيجة 82.9، وهو الأعلى في الجدول وفوق Decider 4B. تسجل d1-omni-600M نتيجة 78.4، متجاوزةً Decider 2B (77.1) بربع المعاملات فقط.

المقارنة المرجعية d1-omni-600M d1-3B Decider 2B Decider 4B
SQuAD 2.0 74.0 83.3 67.7 76.0
Civil Comments 95.8 93.3 93.6 92.8
MASSIVE intent 86.1 86.9 81.1 88.3
PubMedQA 61.3 68.3 65.7 63.3
BoolQ 77.7 86.3 87.3 89.0
XNLI 74.7 85.6 85.0 88.6
PAWS-X 79.5 76.4 59.5 69.8
المتوسط 78.4 82.9 77.1 81.1

تحققنا من أن d1-3B يحتفظ بقدرات الرؤية الخاصة بنموذج LFM2.5-VL-3B الأساسي على معايير الرؤية القياسية، وأن d1-omni-600M يتعامل مع الأنماط الثلاثة جميعها. لا نُبلّغ عن أي معايير للرؤية أو الصوت، نظرًا لأن Decision Index v0.3 يتضمن فقط شريحة رؤية خاصة، ومعايير القرار الصوتي لا تزال مشكلة مفتوحة حاليًا.

السرعة

بالتعاون مع NVIDIA، قيّمنا d1-3B على منظومة NVIDIA عبر NVIDIA GeForce RTX 4090 وNVIDIA Jetson AGX Thor وJetson AGX Orin 64 GB وJetson Orin Nano. وبما أن d1-omni-600M هو إصدار بحثي مبكر، فلا نُبلّغ عن أي أرقام سرعة له في هذا الإصدار.

الاستدلال على الأجهزة الطرفية. يجيب d1-3B على سؤال واحد في أقل من 50 ms على كل جهاز تم قياسه. ثلاثة أسئلة تستغرق 1.3x فقط من زمن السؤال الواحد، حيث ينتقل AGX Thor من 16 ms إلى 20 ms.

سؤال واحد 3 أسئلة حالة بحجم 3.4K توكن صورة بدقة 384px 64 حالة، مضغوطة
Apple M5 Pro 30 ms 41 ms 640 ms 62 ms 78 / s
Jetson AGX Thor 16 ms 20 ms 220 ms 35 ms 262 / s
Jetson AGX Orin بسعة 64 GB 26 ms 35 ms 560 ms 83 ms 110 / s
Jetson Orin Nano 50 ms 73 ms 1,640 ms 202 ms 38 / s

استدلال على وحدة معالجة الرسومات. على وحدة معالجة الرسومات، يجيب d1-3B على سؤال في أقل من 10 ms ويعالج صورة بدقة 384px في أقل من 18 ms على المنصتين معًا.

سؤال واحد 3 أسئلة حالة بحجم 3.4K توكن صورة بحجم 384px 64 حالة، مكدسة
NVIDIA RTX 4090 8 ms 21 ms 102 ms 17 ms 475 / s
AMD MI325X 9 ms 14 ms 44 ms 18 ms 1,106 / s

كيفية استخدام نماذج القرار d1 المفتوحة

استخدم نماذج القرار d1 عندما تحتاج إلى قرارات سريعة ومنظمة، بما في ذلك المدخلات متعددة الوسائط. يقدم d1-3B أعلى جودة قرار في حجمه، بينما يناسب d1-omni-600M الحالات التي تهم فيها المساحة.

ثبّت التبعيات (يتطلب transformers>=5.14):

pip install "transformers>=5.14" torch torchvision pillow

هذه النماذج تأتي مع شيفرتها البرمجية الخاصة، لذا حمّلها باستخدام trust_remote_code=True:

import io
import urllib.request

import torch
from PIL import Image
from transformers import AutoModel

device = "cuda" if torch.cuda.is_available() else "mps" if torch.backends.mps.is_available() else "cpu"
model = AutoModel.from_pretrained("LiquidAI/d1-3B", trust_remote_code=True,
                                  dtype=torch.float32 if device == "cpu" else torch.bfloat16).to(device)

# Several named questions over one text state, answered in one pass
questions = {
    "refund": {"type": "noul", "instructions": "Is the customer asking for a refund?"},
    "team": {"type": "choice", "instructions": "Which team should handle this?",
             "criteria": {"billing": "Charges, refunds, invoices", "technical": "App or site faults",
                          "fraud": "Suspected unauthorised use"}},
    "urgency": {"type": "score", "instructions": "How urgent is this?",
                "criteria": ["Can wait", "Today", "Blocking the customer now"]},
}
print(model.system_one("I was charged twice this month, please refund one of them.", questions))

# An image as the whole state
url = "http://images.cocodataset.org/val2017/000000039769.jpg"  # two cats on a sofa
photo = Image.open(io.BytesIO(urllib.request.urlopen(url).read()))
print(model.system_one(None, {"cats": {"type": "choice", "instructions": "How many cats are there?",
                                       "criteria": {"one": "One", "two": "Two", "more": "Three or more"}}},
                       images=[photo]))

# Many requests, packed together with no padding
tickets = ["Where is my parcel? It was due Monday.", "The app crashes when I open settings."]
print(model.system_one_batch([(t, {"team": questions["team"]}) for t in tickets]))

للاختصار، ندرج فقط المثال الخاص بـ d1-3B. راجع بطاقة نموذج d1-omni-600M للحصول على تعليمات حول كيفية تشغيله.

ابدأ مع نماذج القرار d1 المفتوحة

كلا نموذجي القرار مفتوحا الأوزان ومتاحان اليوم على Hugging Face:

  • التنزيل: d1-3B و d1-omni-600M على Hugging Face.
  • الجرّب: شغّل العروض التوضيحية في System One Arcade مساحة Hugging Face الخاصة بنا.

لا نطيق الصبر لنرى ما ستبنيه.

اقتباس

إذا استخدمت هذا العمل، يُرجى الاستشهاد بمدونة الإصدار:

@article{liquidAI2026opend1,
  author  = {Liquid AI},
  title   = {Open d1: Edge decision models for text, vision, and audio},
  journal = {Liquid AI Blog},
  year    = {2026},
  note    = {www.liquid.ai/blog/open-d1},
}
المصدر الأصلي

Hugging Face

ملاحظات المحتوى

النشر الأصلي والحقوق تعود إلى المصدر.

ترجمة آلية · يُرجى الرجوع إلى الأصل