Liquid AI가 Open d1을 공개했습니다, 자사 d1 의사결정 모델 계열에 속한 두 개의 오픈 웨이트 멀티모달 모델입니다. d1-3B 텍스트와 이미지를 읽습니다. d1-omni-600M 이미지와 텍스트, 또는 텍스트와 오디오를 함께 읽어들입니다. 어느 쪽 모델도 텍스트를 생성하지 않습니다. 두 모델 모두 출력 토큰 없이 단 한 번의 포워드 패스로 보정된 타입화된 답변을 반환합니다. 목표는 NVIDIA 스택, 즉 DGX 서버, RTX 워크스테이션, Jetson 엣지 보드에서의 실시간 의사결정입니다.
배포 가능한가요? 네. 두 체크포인트 모두 Hugging Face에 있으며, Transformers를 통해 로드할 수 있고, 첫날부터 llama.cpp를 지원합니다. 그 LFM 오픈 라이선스 v1.0 연 매출 10 million 달러 미만의 상업적 이용을 무료로 허용합니다. d1-omni-600M은 공개된 지연 시간 수치가 없는 초기 연구 릴리스입니다.
결정 모델이란 무엇인가?
생성형 LLM은 답변을 토큰 단위로 하나씩 작성하며, 여러분의 코드가 이를 파싱합니다. 반면 의사결정 모델(decision model)은 상태와 이름이 붙은 질문들의 집합을 입력받아, 이를 한 번 읽고 허용된 모든 답변 각각에 대한 확률을 반환합니다. 그 Liquid AI 세 가지 질문 유형을 정의합니다:
- noul: 예/아니오 질문으로, P(yes)로 반환됩니다.
- 선택: 이름이 지정된 선택지 중 하나의 레이블과 함께, 전체 확률 분포를 제공합니다.
- score: 2~10개 수준의 순서형 루브릭에서 확률 가중치가 적용된 위치를 제공합니다.
하나의 호출에서 여러 질문이 하나의 상태를 공유할 수 있습니다. 모든 응답은 output_tokens: 0을(를) 보고합니다. Liquid AI는 라우팅, 조정(moderation), 의도 분류, 재순위화, LLM-as-a-judge 채점, 에이전트 가드레일, 시각 검사에 d1을 권장합니다. 어느 체크포인트도 채팅 모델이 아닙니다.
d1-3B와 d1-omni-600M은 어떻게 만들어졌나요?
d1-3B 는 3.12B 파라미터를 가지며, LFM2.5-VL-3B라는 디코더 전용(decode-only) 비전-언어 모델에서 출발합니다. Liquid AI는 LFM2.5-2.6B의 가중치를 해당 모델의 텍스트 백본과 평균했습니다. 그런 다음 서로 다른 시드와 데이터 조합으로 여러 체크포인트를 파인튜닝하고 다시 병합했습니다. 이 모델은 400M SigLIP2 NaFlex 비전 인코더와 32,768토큰 컨텍스트를 사용합니다. 긴 입력, 셔플된 답변 선택지, 데이터 단축 경로(data shortcut) 제거가 고급 기법보다 더 중요했습니다.
d1-omni-600M 587M개의 파라미터를 가지며 다음에서 시작합니다 LFM2.5-Encoder-350M, 양방향 인코더입니다. 여기에는 381M 공유 트렁크 및 결정 헤드, 94M 비전 인코더, 112M 오디오 인코더가 포함됩니다. 오디오 인코더는 17계층 FastConformer입니다. 컨텍스트는 16,384 토큰입니다. 오디오 클립은 최대 30초로 제한됩니다. 요청에는 이미지 또는 오디오 중 하나만 포함되며 둘 다 포함될 수는 없습니다. 오디오 학습은 영어 화면자-어시스턴트 요청만 다루었습니다.
Open d1은 어디에 가장 잘 어울릴까요?
- 지원 및 티켓 분류: d1-3B 모델의 단 한 번의 호출로 같은 메시지에서 환불 여부(예/아니오) 확인, 담당 팀 선정, 긴급도 평가를 수행할 수 있으며, 파싱에 필요한 출력 토큰은 전혀 들지 않습니다.
- 엣지에서의 실시간 시각 검사 및 모더레이션: d1-3B는 Jetson AGX Thor에서 384px 이미지를 35 ms 만에 읽어들이며, Liquid AI의 Open d1 아케이드 실시간 카메라 입력을 프레임 단위로 처리하여 콘텐츠 조정 및 제스처 제어에 활용합니다.
- 소형 기기에서의 음성 명령 라우팅: d1-omni-600M 최대 30초 분량의 음성과 텍스트를 함께 입력받아 화자의 의도나 주제를 직접 반환합니다. 이 모델의 카드에는 권장 사용 사례로 음성 명령 라우팅과 에이전트 가드레일이 나열되어 있습니다.
d1은 벤치마크에서 어떤 성능을 보이나요?
에서 Decision Index v0.2.1, d1-3B는 48.57점을 기록했습니다. 이는 10B 미만의 모든 모델을 제치고 Decider 35B-A3B(47.11)를 근소하게 앞섭니다. Winnow-12B만이 50.02점으로 더 높은 점수를 기록했습니다. Liquid AI가 공식 스코어러를 직접 실행했기 때문에 d1 점수는 리더보드 제출 점수가 아닙니다. d1-3B는 Tools(74.5) 및 Arts(36.3) 카테고리에서 선두를 차지했지만 Knowledge(23.8)에서는 뒤처졌습니다.
7개 공개 텍스트 벤치마크에서 d1-3B는 평균 82.9를 기록하며 81.1의 Decider 4B를 앞섰습니다. d1-omni-600M은 평균 78.4를 기록했고, Civil Comments(95.8)와 PAWS-X(79.5)에서 최고 점수를 달성했습니다. 11개 이미지 벤치마크에서 d1-3B는 기반 모델의 73.9 대비 평균 74.1을 기록했습니다. Liquid AI는 오디오 판단 벤치마크를 미해결 과제로 언급했습니다.
d1-3B는 NVIDIA 하드웨어에서 얼마나 빠른가요?
Liquid AI는 엔드투엔드 지연 시간을 한 번에 따뜻한 요청(warm request) 하나씩 측정했습니다. 질문 하나는 RTX 4090에서 8 ms, AMD MI325X에서 9 ms가 걸립니다. Jetson에서는 AGX Thor가 16 ms, AGX Orin이 26 ms, Orin Nano가 50 ms가 걸립니다. Jetson AGX Thor에서 하나의 상태에 대해 질문 세 개는 20 ms인 반면 하나는 16 ms입니다. RTX 4090 수치는 다음을 사용합니다: model.compile(mode="reduce-overhead")이것이 없으면 질문 하나에 16 ms가 걸립니다. NVIDIA의 Jetson AI Lab 에도 d1-3B 가이드가 있습니다.
Open d1은 다른 오픈 의사결정 모델들과 어떻게 비교됩니까?
| 기능 | d1-3B | d1-omni-600M | Decider 4B | Decider 35B-A3B | Winnow-12B |
|---|---|---|---|---|---|
| 제작사 | Liquid AI | Liquid AI | Mapika (독립) | Mapika (독립) | EldanRing (독립) |
| 파라미터 | 3.12B | 587M | 4.2B | 총 34.7B, 활성 3B | 12B |
| 베이스 모델 | LFM2.5-VL-3B | LFM2.5-Encoder-350M | Qwen3.5-4B-Base | Qwen3.5-35B-A3B-Base | Gemma 4 12B IT |
| 입력 | 텍스트, 이미지 | 텍스트 + 이미지, 또는 텍스트 + 오디오 | 텍스트 | 텍스트 | 텍스트, 이미지 |
| 맥락 | 32,768 | 16,384 | 32K 토큰 상태 | 32K 토큰 상태 | 65,536(Q8은 8개 테스트됨) |
| Decision Index v0.2.1 | 48.57 | 15.95 | 40.70 | 47.11 | 50.02 |
| 라이선스 | LFM Open v1.0 | LFM Open v1.0 | Apache 2.0 | Apache 2.0 | Apache 2.0 |
| 게시 지연 시간 | 질문당 8 ms, RTX 4090 | 게시되지 않음 | 3개 질문 요청당 5.2 ms, B300 | 3개 질문 요청당 47 ms, B300 | 64K 컨텍스트 근처에서 캐시된 4개 질문 요청을 143 ms에 처리, RTX 5070 Ti |
출처: d1-3B, d1-omni-600M, Decider 4B, Decider 35B-A3B, Winnow-12B 모델 카드. d1 카드에 표시된 인덱스 점수. 지연 시간은 서로 다른 하드웨어와 워크로드를 사용하므로 직접 비교할 수 없습니다.
d1을 로컬에서 어떻게 실행하나요?
d1-3B는 필요로 한다 transformers>=5.14 그리고 trust_remote_code=True. d1-omni-600M은 필요 transformers>=5.15. 둘 다 노출합니다 system_one(state, questions) 한 주를 위한 system_one_batch 패킹된 요청을 위한 것입니다. Liquid AI는 GPU에서 d1-omni-600M에 대해 float16을 권장하는데, bfloat16으로는 일부 상위 답변이 달라졌기 때문입니다. 카메라 기반 d1-3B 데모 10개를 다음에서 직접 체험해볼 수 있습니다. 오픈 d1 아케이드 공간. NVIDIA와 함께 Liquid AI는 Jetson에서 Isaac Sim을 탐색하는 d1-3B도 시연했습니다.
핵심 요약
- d1 모델은 한 번의 패스로 고정된 선택지에 대한 확률을 출력하며, 토큰을 생성하지 않습니다.
- d1-3B는 Decision Index v0.2.1에서 48.57점을 기록하며, 10B 미만 중 최고 결과를 달성했습니다.
- d1-3B는 RTX 4090에서 한 질문에 8 ms 만에 답변합니다.
- d1-omni-600M은 587M 파라미터로 이미지 또는 오디오가 포함된 텍스트를 처리합니다.
- 연간 매출 $10M 미만의 상업적 사용을 위한 무료 라이선스입니다.
다음을 확인해 보세요: d1-3B, d1-omni-600M 그리고 기술 세부 정보. 모든 크레딧은 이 프로젝트의 연구원에게 돌아갑니다. 또한 저희를 Twitter 에서 팔로우하고 150k+ML SubReddit 에 가입하시며 저희 뉴스레터를 구독하는 것도 잊지 마세요. 잠깐! 텔레그램을 사용하시나요? 이제 텔레그램에서도 저희와 함께하실 수 있습니다.
이 글 Liquid AI, 오픈 웨이트 d1-3B 및 d1-omni-600M 공개: 출력 토큰 없는 멀티모달 의사결정 모델 은 다음에서 처음 게시되었습니다: MarkTechPost.