MarkTechPost수정일

Liquid AI, 오픈 웨이트 d1-3B 및 d1-omni-600M 공개: 출력 토큰 없는 멀티모달 의사결정 모델

Liquid AI가 d1 의사결정 모델 계열에 속한 오픈 웨이트 멀티모달 모델 2개를 포함하는 Open d1을 공개했습니다. d1-3B는 텍스트와 이미지를 읽습니다. d1-omni-600M은 이미지가 있는 텍스트 또는 오디오가 있는 텍스트를 읽습니다. 두 모델 모두 텍스트를 생성하지는 않습니다. 각 모델은 출력 토큰 0개로 단일 포워드 패스에서 보정된 타입화된 답변을 반환합니다. 목표는…

Liquid AI가 Open d1을 공개했습니다, 자사 d1 의사결정 모델 계열에 속한 두 개의 오픈 웨이트 멀티모달 모델입니다. d1-3B 텍스트와 이미지를 읽습니다. d1-omni-600M 이미지와 텍스트, 또는 텍스트와 오디오를 함께 읽어들입니다. 어느 쪽 모델도 텍스트를 생성하지 않습니다. 두 모델 모두 출력 토큰 없이 단 한 번의 포워드 패스로 보정된 타입화된 답변을 반환합니다. 목표는 NVIDIA 스택, 즉 DGX 서버, RTX 워크스테이션, Jetson 엣지 보드에서의 실시간 의사결정입니다.

배포 가능한가요? 네. 두 체크포인트 모두 Hugging Face에 있으며, Transformers를 통해 로드할 수 있고, 첫날부터 llama.cpp를 지원합니다. 그 LFM 오픈 라이선스 v1.0 연 매출 10 million 달러 미만의 상업적 이용을 무료로 허용합니다. d1-omni-600M은 공개된 지연 시간 수치가 없는 초기 연구 릴리스입니다.

결정 모델이란 무엇인가?

생성형 LLM은 답변을 토큰 단위로 하나씩 작성하며, 여러분의 코드가 이를 파싱합니다. 반면 의사결정 모델(decision model)은 상태와 이름이 붙은 질문들의 집합을 입력받아, 이를 한 번 읽고 허용된 모든 답변 각각에 대한 확률을 반환합니다. 그 Liquid AI 세 가지 질문 유형을 정의합니다:

  • noul: 예/아니오 질문으로, P(yes)로 반환됩니다.
  • 선택: 이름이 지정된 선택지 중 하나의 레이블과 함께, 전체 확률 분포를 제공합니다.
  • score: 2~10개 수준의 순서형 루브릭에서 확률 가중치가 적용된 위치를 제공합니다.

하나의 호출에서 여러 질문이 하나의 상태를 공유할 수 있습니다. 모든 응답은 output_tokens: 0을(를) 보고합니다. Liquid AI는 라우팅, 조정(moderation), 의도 분류, 재순위화, LLM-as-a-judge 채점, 에이전트 가드레일, 시각 검사에 d1을 권장합니다. 어느 체크포인트도 채팅 모델이 아닙니다.

d1-3B와 d1-omni-600M은 어떻게 만들어졌나요?

d1-3B 는 3.12B 파라미터를 가지며, LFM2.5-VL-3B라는 디코더 전용(decode-only) 비전-언어 모델에서 출발합니다. Liquid AI는 LFM2.5-2.6B의 가중치를 해당 모델의 텍스트 백본과 평균했습니다. 그런 다음 서로 다른 시드와 데이터 조합으로 여러 체크포인트를 파인튜닝하고 다시 병합했습니다. 이 모델은 400M SigLIP2 NaFlex 비전 인코더와 32,768토큰 컨텍스트를 사용합니다. 긴 입력, 셔플된 답변 선택지, 데이터 단축 경로(data shortcut) 제거가 고급 기법보다 더 중요했습니다.

d1-omni-600M 587M개의 파라미터를 가지며 다음에서 시작합니다 LFM2.5-Encoder-350M, 양방향 인코더입니다. 여기에는 381M 공유 트렁크 및 결정 헤드, 94M 비전 인코더, 112M 오디오 인코더가 포함됩니다. 오디오 인코더는 17계층 FastConformer입니다. 컨텍스트는 16,384 토큰입니다. 오디오 클립은 최대 30초로 제한됩니다. 요청에는 이미지 또는 오디오 중 하나만 포함되며 둘 다 포함될 수는 없습니다. 오디오 학습은 영어 화면자-어시스턴트 요청만 다루었습니다.

Open d1은 어디에 가장 잘 어울릴까요?

  • 지원 및 티켓 분류: d1-3B 모델의 단 한 번의 호출로 같은 메시지에서 환불 여부(예/아니오) 확인, 담당 팀 선정, 긴급도 평가를 수행할 수 있으며, 파싱에 필요한 출력 토큰은 전혀 들지 않습니다.
  • 엣지에서의 실시간 시각 검사 및 모더레이션: d1-3B는 Jetson AGX Thor에서 384px 이미지를 35 ms 만에 읽어들이며, Liquid AI의 Open d1 아케이드 실시간 카메라 입력을 프레임 단위로 처리하여 콘텐츠 조정 및 제스처 제어에 활용합니다.
  • 소형 기기에서의 음성 명령 라우팅: d1-omni-600M 최대 30초 분량의 음성과 텍스트를 함께 입력받아 화자의 의도나 주제를 직접 반환합니다. 이 모델의 카드에는 권장 사용 사례로 음성 명령 라우팅과 에이전트 가드레일이 나열되어 있습니다.

d1은 벤치마크에서 어떤 성능을 보이나요?

에서 Decision Index v0.2.1, d1-3B는 48.57점을 기록했습니다. 이는 10B 미만의 모든 모델을 제치고 Decider 35B-A3B(47.11)를 근소하게 앞섭니다. Winnow-12B만이 50.02점으로 더 높은 점수를 기록했습니다. Liquid AI가 공식 스코어러를 직접 실행했기 때문에 d1 점수는 리더보드 제출 점수가 아닙니다. d1-3B는 Tools(74.5) 및 Arts(36.3) 카테고리에서 선두를 차지했지만 Knowledge(23.8)에서는 뒤처졌습니다.

7개 공개 텍스트 벤치마크에서 d1-3B는 평균 82.9를 기록하며 81.1의 Decider 4B를 앞섰습니다. d1-omni-600M은 평균 78.4를 기록했고, Civil Comments(95.8)와 PAWS-X(79.5)에서 최고 점수를 달성했습니다. 11개 이미지 벤치마크에서 d1-3B는 기반 모델의 73.9 대비 평균 74.1을 기록했습니다. Liquid AI는 오디오 판단 벤치마크를 미해결 과제로 언급했습니다.

d1-3B는 NVIDIA 하드웨어에서 얼마나 빠른가요?

Liquid AI는 엔드투엔드 지연 시간을 한 번에 따뜻한 요청(warm request) 하나씩 측정했습니다. 질문 하나는 RTX 4090에서 8 ms, AMD MI325X에서 9 ms가 걸립니다. Jetson에서는 AGX Thor가 16 ms, AGX Orin이 26 ms, Orin Nano가 50 ms가 걸립니다. Jetson AGX Thor에서 하나의 상태에 대해 질문 세 개는 20 ms인 반면 하나는 16 ms입니다. RTX 4090 수치는 다음을 사용합니다: model.compile(mode="reduce-overhead")이것이 없으면 질문 하나에 16 ms가 걸립니다. NVIDIA의 Jetson AI Lab 에도 d1-3B 가이드가 있습니다.

Open d1은 다른 오픈 의사결정 모델들과 어떻게 비교됩니까?

기능d1-3Bd1-omni-600MDecider 4BDecider 35B-A3BWinnow-12B
제작사Liquid AILiquid AIMapika (독립)Mapika (독립)EldanRing (독립)
파라미터3.12B587M4.2B총 34.7B, 활성 3B12B
베이스 모델LFM2.5-VL-3BLFM2.5-Encoder-350MQwen3.5-4B-BaseQwen3.5-35B-A3B-BaseGemma 4 12B IT
입력텍스트, 이미지텍스트 + 이미지, 또는 텍스트 + 오디오텍스트텍스트텍스트, 이미지
맥락32,76816,38432K 토큰 상태32K 토큰 상태65,536(Q8은 8개 테스트됨)
Decision Index v0.2.148.5715.9540.7047.1150.02
라이선스LFM Open v1.0LFM Open v1.0Apache 2.0Apache 2.0Apache 2.0
게시 지연 시간질문당 8 ms, RTX 4090게시되지 않음3개 질문 요청당 5.2 ms, B3003개 질문 요청당 47 ms, B30064K 컨텍스트 근처에서 캐시된 4개 질문 요청을 143 ms에 처리, RTX 5070 Ti

출처: d1-3B, d1-omni-600M, Decider 4B, Decider 35B-A3B, Winnow-12B 모델 카드. d1 카드에 표시된 인덱스 점수. 지연 시간은 서로 다른 하드웨어와 워크로드를 사용하므로 직접 비교할 수 없습니다.

d1을 로컬에서 어떻게 실행하나요?

d1-3B는 필요로 한다 transformers>=5.14 그리고 trust_remote_code=True. d1-omni-600M은 필요 transformers>=5.15. 둘 다 노출합니다 system_one(state, questions) 한 주를 위한 system_one_batch 패킹된 요청을 위한 것입니다. Liquid AI는 GPU에서 d1-omni-600M에 대해 float16을 권장하는데, bfloat16으로는 일부 상위 답변이 달라졌기 때문입니다. 카메라 기반 d1-3B 데모 10개를 다음에서 직접 체험해볼 수 있습니다. 오픈 d1 아케이드 공간. NVIDIA와 함께 Liquid AI는 Jetson에서 Isaac Sim을 탐색하는 d1-3B도 시연했습니다.

핵심 요약

  • d1 모델은 한 번의 패스로 고정된 선택지에 대한 확률을 출력하며, 토큰을 생성하지 않습니다.
  • d1-3B는 Decision Index v0.2.1에서 48.57점을 기록하며, 10B 미만 중 최고 결과를 달성했습니다.
  • d1-3B는 RTX 4090에서 한 질문에 8 ms 만에 답변합니다.
  • d1-omni-600M은 587M 파라미터로 이미지 또는 오디오가 포함된 텍스트를 처리합니다.
  • 연간 매출 $10M 미만의 상업적 사용을 위한 무료 라이선스입니다.


다음을 확인해 보세요: d1-3B, d1-omni-600M 그리고 기술 세부 정보. 모든 크레딧은 이 프로젝트의 연구원에게 돌아갑니다. 또한 저희를 Twitter 에서 팔로우하고 150k+ML SubReddit 에 가입하시며 저희 뉴스레터를 구독하는 것도 잊지 마세요. 잠깐! 텔레그램을 사용하시나요? 이제 텔레그램에서도 저희와 함께하실 수 있습니다.

[후원] 웹은 대부분의 에이전트가 빠뜨리고 있는 유일한 API입니다. 데이터베이스, 캘린더, 저장소에는 API가 있습니다. 하지만 개방된 웹은 대부분 그렇지 않습니다. TinyFish MCP 서버 는 모든 MCP 클라이언트에 네 가지 도구를 제공합니다: TinySearch, TinyFetch(JavaScript를 포함한 전체 페이지를 마크다운으로 제공), 로그인과 폼을 위한 TinyBrowser, 다단계 작업을 위한 TinyAgent. Search와 Fetch는 무료입니다.

이 글 Liquid AI, 오픈 웨이트 d1-3B 및 d1-omni-600M 공개: 출력 토큰 없는 멀티모달 의사결정 모델 은 다음에서 처음 게시되었습니다: MarkTechPost.

원문 출처

MarkTechPost

내용 안내

원문 발행 및 권리는 출처에 있습니다.

기계 번역 · 원문을 참고하세요