IT之家 10월 9일 소식, Liquid AI는 10월 7일 블로그 글을 발표하고 d1 시리즈 오픈 웨이트 의사결정 모델 두 종을 선보였다고 밝혔다: d1-3B는 31.2억 파라미터로 텍스트 및 이미지 판단을 지원하며,d1-omni-600M은 5.87억 파라미터로 텍스트, 이미지 및 음성 입력을 지원한다.
IT之家는 블로그 글을 인용해 소개하기를,Jev 모델이 9월에 출시되어 큰 인기를 끈 이후,OpenAI 등 회사들도 잇달아 유사한 의사결정 모델을 출시했으며, Liquid AI는 이 전쟁에 합류한 새 멤버로, 이번에 공개된 d1-3B와 d1-omni-600M은 Hugging Face에 공개되어 사용자가 다운로드, 파인튜닝 및 배포할 수 있다.
d1-3B는 31.2억 파라미터를 보유하고 있으며, 시각 언어 모델 LFM2.5-VL-3B를 기반으로 학습되었고, 텍스트 및 이미지 입력을 지원한다. 이 모델은 Decision Index v0.2.1 공개 테스트 세트에서 48.57점을 획득했으며, Liquid AI는 10B 미만 모델 전체를 앞선다고 밝혔다.

d1-omni-600M은 5.87억 파라미터를 보유하고 있으며, 양방향 인코더 LFM2.5-Encoder-350M을 기반으로 학습되었다. 이 모델은 텍스트와 이미지, 또는 텍스트와 음성의 조합 입력을 지원하며, Liquid AI의 첫 실험적 멀티모달 의사결정 모델 체크포인트에 속한다.

추론 속도 측면에서, d1-3B는 NVIDIA RTX 4090에서 단일 질문에 답하는 데 8 밀리초가 걸리며, 384 픽셀 이미지 처리에는 102 밀리초가 걸린다. Jetson AGX Thor에서는 단일 질문에 16 밀리초, Jetson Orin Nano에서는 50 밀리초가 걸린다.

사용자 테스트에 따르면, d1-3B는 12GB VRAM을 갖춘 GeForce RTX 3060에서 단일 판단에 25 밀리초, 640×480 픽셀 이미지 처리에 146 밀리초가 걸리며, 최대 VRAM 사용량은 약 6GB였다. 또한 일부 사용자는 이 모델이 RTX 3090에서 단일 판단에 8 밀리초가 걸린다고 보고했다.

