
Liquid AI d1-omni-600M vs Liquid AI d1-3B: d1 패밀리의 어느 쪽이 실제로 필요할까?
- openaiNEWOpenAI: GPT-6.1 Sol2026-09-2952지능
- anthropicNEWAnthropic: Claude Sonnet 5.52026-09-2856지능
- typesafeTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 100만 토큰당 · 128 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238지능
- OpenAIOpenAI: GPT-6 Sol2026-09-2248지능
- AnthropicAnthropic: Claude Opus 5.52026-09-2258지능
- xAIGrok 4.72026-09-2146지능
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 100만 토큰당 · 56 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 100만 토큰당 · 320 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040지능
- OpenAIOpenAI: GPT-6 Astra2026-09-0453지능77코딩
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241지능76코딩
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245지능76코딩
- AnthropicAnthropic: Claude Fable 5.12026-09-0153지능82코딩
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 100만 토큰당 · 56 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 100만 토큰당 · 346 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642지능72코딩
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 100만 토큰당 · 230 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845지능75코딩
- obsidianQwen3.8 27B2026-08-1534지능68코딩
Liquid AI d1-omni-600M과 Liquid AI d1-3B는 2026년 10월 5일 서로 8시간 이내에 Hugging Face에 업로드되었고, 10월 7일 같은 발표에서 함께 공개되었습니다. 그래서 흔히 던지는 질문, 즉 어느 쪽이 더 최신이고 어느 쪽이 더 나은가라는 질문은 잘못된 질문입니다. 이 둘은 의도된 맞교환의 양 끝입니다. Liquid AI d1-3B는 완성품입니다. 3.12B 파라미터, 벤더 채점 기준 Decision Index 0.2.1에서 48.57, 벤치마크 표, Jetson Orin Nano에서 측정한 지연 시간, 그리고 해당 크기에서 최고의 의사결정 품질이라는 발표문의 평가까지 갖추고 있습니다. Liquid AI d1-omni-600M은 실험작입니다. 587M 파라미터, 15라는 지수, 3B에는 없는 오디오 입력, 그리고 아직 활발히 개발 중이어서 추론 기능이 없다는 초기 연구 릴리스라는 설명이 담긴 모델 카드를 가지고 있습니다. 이 둘 중 하나를 고르는 것은 품질에 관한 결정이 아닙니다. 그것은 이 패밀리의 아래쪽에서 추가 모달리티가 필요한지, 위쪽에서 추가 정확도가 필요한지에 관한 결정이며, 여러 지표는 이 구분을 흐리기보다는 그 뒤를 받쳐 줍니다.
아래의 모든 내용은 두 모델 카드와 10월 7일 릴리스 게시물에서 가져온 것이며, 릴리스 게시물 자체의 표기를 존중했습니다: Decision Index의 d1 행은 공개 리더보드에 제출되지 않고 Liquid AI가 공식 스코어러로 채점했으며, 여기 있는 어떤 것도 독립적으로 재현되지 않았습니다.
결코 하나로 수렴할 수 없었던 두 개의 백본
d1 패밀리는 하나의 레시피를 그대로 축소해 만든 것이 아니다. 두 체크포인트는 Liquid의 모델 카탈로그 양 극단에서 출발해 중간에서 만난다.
Liquid AI d1-3B는 LFM2.5-VL-3B 위에 구축되었으며, 이는 해당 공급업체의 2026년 8월자 디코더 전용 비전-언어 모델입니다. 그 기반은 LFM2.5-2.6B의 가중치를 LFM2.5-VL-3B의 텍스트 백본과 평균한 다음, 서로 다른 랜덤 시드와 데이터 혼합 아래에서 체크포인트를 미세 조정한 뒤 다시 병합하여 만들어졌습니다. 여기에는 SigLIP2 NaFlex 형태 최적화 400M 비전 인코더, 32,768토큰 컨텍스트, 128,000토큰 어휘, 그리고 16개의 문서화된 언어가 탑재되어 있습니다.
Liquid AI d1-omni-600M은 다른 방향에서 나옵니다. 이 모델의 트렁크는 LFM2.5-Encoder-350M으로, 양방향 인코더이며, 의사 결정 작업에 대해 먼저 미세 조정된 후 단계적으로 확장되었습니다 — 오디오를 위한 17계층 FastConformer 인코더와 어댑터로, 이후 오디오 인코더는 고정된 텍스트 백본에 대해 미세 조정되었고, 그다음 LFM2.5-VL-450M에서 가져온 SigLIP2 타워가 어댑터와 함께, 그리고 비전을 위한 백본에 LoRA 업데이트가 적용되었습니다. 최종 모델은 LoRA 업데이트에서 병합되었고 이전 체크포인트와 평균화되었습니다. 총 587M 파라미터로 끝납니다: 381M의 공유 트렁크와 의사 결정 헤드, 94M의 비전 인코더, 112M의 오디오 인코더.
디코더 전용과 양방향의 차이가 기억해 둬야 할 부분이다. 3B는 상태를 읽고, 언어 모델이 한 번에 한 방향으로 토큰 시퀀스를 생성하는 방식으로 결정을 내린다. 600M은 전체 상태를 한 번에 읽고 결정하는데, 이는 생성하도록 만들어진 적이 없는 인코더에서 기대할 수 있는 방식이다. 둘 다 출력 토큰을 하나도 내지 않고 모델의 분포에서 답을 보고하도록 훈련되었지만, 그 바탕에 있는 메커니즘은 같은 부류의 모델이 아니며, 아래의 정확도 격차는 더 작은 인코더 형태 설계가 치르는 눈에 보이는 대가다.
Decision Index의 격차가 크고, 하위 점수들이 총점보다 더 흥미롭습니다.
Decision Index 0.2.1에서 Liquid는 Liquid AI d1-3B에 대해 48.57, Liquid AI d1-omni-600M에 대해 15.95를 보고했는데, 이는 Winnow-12B의 50.02와 대비됩니다. 이는 같은 연구소가 같은 날 공개한 두 체크포인트 사이의 32점 격차이며, 다섯 개의 하위 점수를 읽어 보면 그 격차가 어디서 비롯되는지 알 수 있습니다.
• 지식 — Liquid AI d1-3B의 23.8 대 Liquid AI d1-omni-600M의 8.3
• 언어 — 56.4 대 12.9
• 검색 — 52.8 대 35.0
• 도구 — 74.5 대 15.1
• 예술 — 36.3 대 6.8
검색은 작은 모델이 버티는 유일한 영역으로, 다른 네 범주에서는 60~80퍼센트를 잃지만 여기서는 3B 점수의 3분의 1 미만을 잃는다. 그 패턴은 600M의 정체와 일치한다. 즉 상태를 콘텐츠와 매칭하는 실질적 표현 능력을 갖춘 훈련된 인코더이며, 훨씬 더 많은 언어로 사전학습된 디코더로부터 3B가 물려받는 계층적 능력은 훨씬 덜 지닌 모델이다. 워크로드가 검색 형태의 결정 — 이 구절이 이 질문에 답하는가, 이 문서들 중 어느 것이 관련이 있는가 — 이라면, 600M의 프로필은 총점이 시사하는 것보다 덜 나쁘다. 워크로드가 도구 라우팅 결정이라면, 그 열의 51점 격차가 눈여겨봐야 할 숫자다.
텍스트 벤치마크 표는 인덱스보다 더 온건한 이야기를 들려주는데, 어느 숫자든 근거로 삼기 전에 알아둘 가치가 있습니다. 7개의 공개 벤치마크에서 3B는 평균 82.9로 앞서고 600M은 78.4에 도달합니다. 600M은 실제로 SQuAD 2.0(74.0 대 85.3), PubMedQA(61.3 대 66.0), BoolQ(77.7 대 86.7), XNLI(74.7 대 85.0)에서 근소하게 뒤지지만, Civil Comments 독성 감지(95.8 대 93.0)와 PAWS-X 바꿔쓰기 식별(79.5 대 76.9)에서는 승리합니다. Liquid의 자체 설명에 따르면 600M은 파라미터의 4분의 1로 Decider 2B의 평균 77.1을 능가합니다. 두 개의 벤치마크 제품군, 두 개의 서로 다른 표면적 평결, 둘 다 공급업체 보고 — 이것이 증거가 뒷받침하는 전부이며 그 이상은 아닙니다.

600M에는 있지만 3B에는 없는 것
32포인트 지수 격차를 감수하는 이유는 Liquid AI d1-omni-600M이 Liquid AI d1-3B가 할 수 없는 한 가지를 해내기 때문이며, 그것은 충실도 차이가 아니다.
• 오디오 — Liquid AI d1-omni-600M은 자체 FastConformer 인코더를 통해 요청당 최대 30초 분량의 음성을 처리합니다; Liquid AI d1-3B는 음성을 전혀 처리하지 않습니다.
• 모달리티 혼합 — 600M은 텍스트와 이미지 또는 텍스트와 오디오를 받아들이며, 둘 다 함께 들어오면 ValueError를 발생시킵니다; 3B는 텍스트와 이미지를 받습니다
• 컨텍스트 윈도우 — 600M의 경우 텍스트, 이미지, 오디오 위치 전반에 걸쳐 16,384개 토큰이며, 이미지가 있을 때 텍스트는 896개 토큰으로 트리밍됩니다. 3B의 경우 32,768개 토큰.
• 어휘 — 600M은 65,536, 3B는 128,000
• 정밀도 — 600M 카드는 GPU에서 float16을 권장하며, bfloat16이 일부 행에서 최상위 답변을 바꿨다고 경고합니다. 3B는 w8a8 빌드를 포함해 15가지 양자화를 제공합니다
• 언어 — 600M은 16개 언어를 나열하는데, 그 구성은 3B의 16개와 다르며, 그 오디오는 영어 화자와 어시스턴트 간의 대화로 학습된 것으로 설명되는데, 이는 프로덕션 오디오 피드가 담는 내용의 좁은 일부에 불과하다
오디오 학습 관련 주석은 대충 넘기기 쉽지만, 그래서는 안 된다. 영어 화자-어시스턴트 교환 데이터로 학습된 모델은 하나의 화자 기하 구조, 하나의 턴 구조, 하나의 억양 분포만 접한 셈이다. 이를 콜센터 오디오나 현장 녹음에 배포하는 것은 모델 카드가 주장하지 않는 동작을 요구하는 것이며, 릴리스 포스트는 이를 검증할 오디오 의사결정 벤치마크가 존재하지 않는다는 점을 솔직히 인정한다 — Liquid는 이를 "현재 열린 문제"라고 부르며 커뮤니티에 그러한 벤치마크를 만들어 달라고 요청한다.

레이턴시: 한쪽 형제는 표를 갖고 있고, 다른 쪽 형제는 각주를 갖고 있다
의사결정 모델의 경우 흥미로운 수치는 종단 간 지연 시간입니다. 시간을 잴 디코딩이 없기 때문입니다. Liquid는 3B에 대해서는 전체 세트를 공개하지만 600M에 대해서는 아무것도 공개하지 않습니다.
• 질문 하나 — RTX 4090에서 8 ms, MI325X에서 9 ms, Jetson AGX Thor에서 16 ms, Jetson AGX Orin 64 GB에서 26 ms, Orin Nano에서 50 ms, Apple M5 Pro에서 30 ms
• 하나의 상태에 대한 세 가지 질문 — RTX 4090에서 21ms, AGX Thor에서 20ms, 3배가 아닌 단일 질문 비용의 약 1.3배
• 3.4K 토큰 상태 — 4090에서 102ms, Thor에서 220ms, Orin Nano에서 1,640ms
• 패킹된 처리량 — RTX 4090에서는 초당 475건의 결정, MI325X에서는 초당 1,106건
• 384px 이미지 — 4090에서는 17ms, MI325X에서는 18ms
그 수치들은 Liquid AI d1-3B에만 해당한다. Liquid AI d1-omni-600M의 경우 모델 카드에는 모델이 활발히 개발 중인 초기 연구 릴리스이기 때문에 추론 수치가 보고되지 않는다고 명시되어 있다. 그것은 작은 모델이 더 느리다는 뜻이 아니다 — 매개변수가 5분의 1인 모델이 같은 정밀도에서 더 느려지지는 않으므로 반대가 거의 확실하다 — 바로 아무 수치도 존재하지 않는다는 점이며, 3B의 밀리초를 600M에 인용하는 것은 그럴듯한 모양새를 갖춘 날조가 될 것이다. 아무것도 꾸며내지 않고 말할 수 있는 것은, 카드가 권장하는 float16 정밀도에서 587M 매개변수가 활성화 이전에 약 1.2GB의 가중치 규모에 해당한다는 점인데, 이는 측정값이라기보다 공개된 매개변수 수를 바탕으로 한 산술이다.
대부분의 워크로드에서 캐스케이드가 진정한 답이다
두 체크포인트가 함께 공개되었고 같은 종류의 객체 — 확률, 신뢰도가 붙은 레이블, 또는 순서가 있는 점수 — 를 반환하기 때문에, 이 둘은 임의의 두 모델이라면 불가능한 방식으로 서로 조합됩니다. 600M은 선별할 수 있고 3B는 판정할 수 있습니다. 들어오는 항목을 Liquid AI d1-omni-600M으로 점수화하고, 이 모델이 자체 척도의 중간 근처에 놓은 항목은 더 정밀한 판단을 위해 Liquid AI d1-3B로 에스컬레이션하세요. 에스컬레이션 규칙은 600M이 이미 반환하는 신뢰도와 분포이므로, 라우팅 로직에는 별도 모델이 필요하지 않습니다. 쉬운 항목이 압도적 다수를 차지하는 워크로드에서는 대부분의 트래픽이 3B에 도달하지 않고 대부분의 비용도 지출되지 않습니다.
그 패턴은 또한 두 모델을 라우터 뒤에서 실행할 가치가 있는 이유이기도 합니다. OrcaRouter를 통해 두 모델 모두 하나의 API 키 뒤에 있게 되며 각 제공업체의 정가가 0% 마크업으로 그대로 전달됩니다, 따라서 캐스케이드는 두 번째 통합이 아니라 라우팅 규칙이 되고, 제공자 계층에서 실패한 에스컬레이션은 요청을 실패시키는 대신 폴백에서 재시도됩니다. 자동 페일오버는 안정된 모델의 경우보다 여기서 더 중요합니다. 왜냐하면 이 쌍의 절반은 벤더 스스로가 그 동작이 아직 활발히 개발 중이라고 설명하는 체크포인트이기 때문입니다.
그중 어느 것도 가용성 주장이 아니며, 이 구분은 분명히 짚고 넘어갈 가치가 있습니다: 오픈 d1 체크포인트는 우리 카탈로그에 없습니다. 공급업체의 경로는 가중치를 다운로드해 로컬에서 실행하는 것 — llama.cpp 지원은 Apple, AMD, Qualcomm, NVIDIA 하드웨어 전반에서 첫날부터 제공되었습니다 — 또는 공급업체 자체 API와 서드파티 플랫폼을 통해 접근하는 것입니다.
한 번에 선택하기
텍스트와 이미지가 필요하고 답이 정확해야 한다면 Liquid AI d1-3B를 선택하세요. 벤치마크, 지연 시간 표, 더 넓은 컨텍스트, 더 큰 어휘, 양자화를 갖추고 있으며, Liquid가 해당 크기에서 품질 리더로 내세우는 두 모델 중 하나입니다.
의사결정 경로에 음성이 필요하다면 Liquid AI d1-omni-600M을 선택하세요. 이 계열에서 오디오를 아예 받아들이는 유일한 오픈 웨이트 옵션이기 때문입니다. 그리고 누군가 오디오 의사결정 벤치마크나 공개되지 않은 비전 분할을 발표할 때까지는, 감과 데모에 의존해 이를 채택하고 있다는 점을 받아들이세요.
그중 어떤 것이 당신의 워크로드를 설명하는지 아직 모른다면, 3B로 시작해 그것이 반환하는 신뢰도를 계측하세요. 하위 점수가 단서입니다: Tools 또는 Language 열에 속하는 작업은 600M이 제대로 감당하기 어려운 반면, 검색 형태의 작업은 작은 체크포인트가 전체 점수가 시사하는 것보다 더 근접하는 유일한 영역입니다. 이 제품군이 존재하는 이유는 정확도를 풋프린트와 맞바꿀 수 있게 하기 위함이며, 그 교환은 당신의 작업이 어느 열에 속하는지 알 때에만 안전합니다.

OrcaRouter를 통해 두 모델 모두 하나의 API 키 뒤에 있습니다. 이는 두 번째 통합이 아니라 하나의 라우팅 규칙을 통해서입니다. 그리고 제공자 계층에서 실패하는 에스컬레이션은 요청을 실패시키는 대신 폴백에서 재시도됩니다.
