
Liquid AI d1-3B 및 d1-omni-600M: 단 한 단어도 쓰지 않는 모델을 위한 오픈 웨이트
- openaiNEWOpenAI: GPT-6.1 Sol2026-09-2952지능
- anthropicNEWAnthropic: Claude Sonnet 5.52026-09-2856지능
- typesafeNEWTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 100만 토큰당 · 128 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238지능
- OpenAIOpenAI: GPT-6 Sol2026-09-2248지능
- AnthropicAnthropic: Claude Opus 5.52026-09-2258지능
- xAIGrok 4.72026-09-2146지능
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 100만 토큰당 · 62 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 100만 토큰당 · 320 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040지능
- OpenAIOpenAI: GPT-6 Astra2026-09-0453지능77코딩
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241지능76코딩
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245지능76코딩
- AnthropicAnthropic: Claude Fable 5.12026-09-0153지능82코딩
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 100만 토큰당 · 54 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 100만 토큰당 · 358 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642지능72코딩
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 100만 토큰당 · 232 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845지능75코딩
- obsidianQwen3.8 27B2026-08-1534지능68코딩
Liquid AI d1-3B와 Liquid AI d1-omni-600M은 2026년 10월 7일 Hugging Face에 올라왔고, 이 두 체크포인트에는 올해 당신이 읽은 모든 비교 표를 잘못된 형태로 만드는 속성이 있다. 둘 다 텍스트를 생성하지 않는다. Liquid AI d1-3B에 상태 — 지원 티켓, JSON 페이로드, 사진, 또는 이 세 가지 전부 — 와 이름이 붙은 질문 세트를 건네면, 선택지들에 대한 모델의 분포에서 곧바로 뽑아낸 답을 돌려준다. 예/아니오는 확률로. 신뢰도와 전체 확률 벡터를 함께 갖춘 레이블 중 하나의 선택으로. 순서형 척도 위의 위치로. 샘플링 단계도 없고, 구문 분석할 JSON도 없고, 폭주하는 생성도 없으며, 공급업체 자체의 사용량 카운터가 그것을 명확히 보고한다: output_tokens: 0. 3B 모델이 헤드라인이다 — 공급업체가 채점한 Decision Index 0.2.1에서 48.57을 기록하며, 10B 미만의 모든 것을 앞서고 크기가 12배인 의사결정 모델도 앞선다. 600M 형제 모델이 주목할 만하다: 동일한 트렁크 가중치를 통해 이미지와 최대 30초의 음성을 읽으며, 초기 연구 릴리스로 표시되어 있다.
의사결정 모델이란 무엇인지, 한 단락으로.
이 범주는 시스템 1 모델, 분류기가 아닌 분류기 같은 이름들 아래에서 1년째 형성되어 왔으며, d1 쌍은 지금까지 그중 가장 명확한 진술이다. 생성 모델은 질문을 받고 답을 쓴다. 그 답은 파싱되어야 하고, 파싱은 실패할 수 있으며, 모델이 쓰는 모든 토큰은 비용과 시간을 소모한다. 결정 모델은 질문을 받고 이미 알고 있는 것을 보고한다. Liquid의 질문은 세 가지 유형으로 나뉜다. noul은 예/아니오 질문으로, 0과 1 사이의 P(예)로 답한다. choice는 이름이 지정된 집합에서 레이블 하나를 골라 레이블, 신뢰도, 각 옵션의 확률을 반환한다. score는 상태를 2~10개 수준의 순서 척도에 놓고 기대 수준을 그 분포 및 범례와 함께 반환한다. 하나의 상태는 여러 질문을 동시에 담을 수 있으며, 상태와 그 이미지는 그 모든 질문에 대해 한 번만 읽힌다.
그 마지막 속성이 바로 비즈니스 케이스의 전부입니다. 티켓 하나에 대한 세 가지 질문은 질문 하나에 드는 시간의 1.3배가 걸립니다. 3배가 아니라요. 모델이 입력에 대해 한 번의 순전파를 수행하고 그로부터 여러 답을 읽어내기 때문입니다. 작성할 것이 없으니, 잘못 작성할 것도 없습니다.
3B와 600M은 반대 방향에서 구축되었다
바로 여기서 이번 릴리스가 기술적으로 흥미로워지는데, 이는 출시 관련 보도가 대부분 건너뛴 부분이기도 하다. 두 모델은 계보를 공유하지 않는다.
Liquid AI d1-3B는 업체의 디코더 전용 비전-언어 모델인 LFM2.5-VL-3B에서 파생되었습니다. 이 모델은 3.12B 파라미터, SigLIP2 NaFlex 형태 최적화 400M 비전 인코더, 32,768토큰 컨텍스트 창, 128,000토큰 어휘, 그리고 문서화된 16개 언어를 갖추고 있습니다. 이를 구축하기 위해 Liquid는 LFM2.5-2.6B의 가중치와 LFM2.5-VL-3B의 텍스트 백본을 평균한 뒤, 여러 무작위 시드와 데이터 혼합으로 체크포인트를 미세 조정하고, 그 결과를 다시 병합했습니다. 무엇이 중요했는지에 대한 업체 자체의 요약은 신선할 정도로 소박합니다: 긴 입력에 대한 학습, 답안 선택지 순서 섞기, 훈련 데이터에서 지름길을 찾아내는 것이 어떤 고급 기법보다 최종 수치에 더 큰 기여를 했습니다.
Liquid AI d1-omni-600MLFM2.5-Encoder-350M에서 파생되었는데, 이는 양방향 인코더로, 완전히 다른 종류의 네트워크다. 총 587M개의 파라미터로 구성되며, 381M의 공유 트렁크와 결정 헤드, LFM2.5-VL-450M에서 가져온 94M의 비전 인코더, 17층 FastConformer로 구축된 112M의 오디오 인코더로 나뉜다. 모든 모달리티는 동일한 트렁크 가중치를 통과한다. 컨텍스트는 16,384 토큰으로 텍스트, 이미지, 오디오 위치를 함께 아우르며, 이미지가 첨부되면 상태와 질문 텍스트가 896 토큰으로 잘리는데, 이는 그것이 학습된 방식이기 때문이다. 오디오에는 카드가 완곡한 표현 없이 명시한 한 가지 경고가 있다: 이 기능은 영어 화자와 어시스턴트 사이의 요청으로 학습되었으며, 클립은 30초에서 잘린다.
그러니까 이 패밀리는 하나의 모델을 두 가지 크기로 낸 것이 아니다. 그것은 디코더와 인코더로, 완전히 다른 두 메커니즘으로 같은 일을 하도록 사후 학습되었으며, 그중 하나는 보고 다른 하나는 듣는다.

숫자들, 그리고 그것들이 누구의 것인지
이 섹션의 모든 수치는 Liquid 자체의 것입니다. d1 모델의 Decision Index 행은 벤더가 공식 스코어러를 사용해 채점한 것이며 — 리더보드에 제출된 것은 아닙니다 — 반면 모든 경쟁 행은 v0.2.1의 공개 리더보드에서 가져온 것입니다. 아직 어떤 독립 연구소도 이를 재현하지 못했으며, 이 글을 쓰는 시점에서 모델들은 나온 지 이틀밖에 되지 않았습니다.
• Decision Index 0.2.1 — Liquid AI d1-3B는 48.57점을 기록했으며, 하위 점수는 지식 23.8, 언어 56.4, 검색 52.8, 도구 74.5, 예술 36.3입니다. Liquid AI d1-omni-600M은 15.95점을 기록했으며, 도구는 15.1입니다.
• 48.57이 차지하는 위치 — 벤더가 공개한 표에서 10B 미만 모든 항목 중 1위이며, 47.11의 Decider 35B-A3B보다 앞선다. 전체 2위로, 50.02의 Winnow-12B 뒤에 있는데, 크기는 네 배다.
• 텍스트 벤치마크, 벤더 보고 기준 — d1-3B는 7개 공개 벤치마크에서 평균 82.9로 Decider 4B의 81.1보다 앞선다. d1-omni-600M은 평균 78.4로, 약 4분의 1의 파라미터 수로 Decider 2B의 77.1을 능가한다. 600M은 표에서 최고 독성 점수(Civil Comments 95.8)와 최고 패러프레이즈 점수(PAWS-X 79.5)를 기록한다.
• 비전, 공급업체 보고 기준 — d1-3B는 11개 공개 이미지 벤치마크에서 각 벤치마크의 선택지에 대한 결정으로 평가했을 때 평균 74.1을 기록했으며, 자사의 LFM2.5-VL-3B 백본은 73.9를 기록했습니다. 이미지를 제거하면 동일한 질문의 점수가 45.1로 떨어지는데, 이는 공급업체가 답이 픽셀에서 나온다는 점을 보여주는 방식입니다.
• 지연 시간, 공급업체 측정 기준 — 질문 하나는 RTX 4090에서 8ms, AMD MI325X에서 9ms가 걸립니다. Jetson AGX Thor에서는 16ms, Jetson AGX Orin 64GB에서는 26ms, 가장 작은 Jetson Orin Nano에서는 50ms, Apple M5 Pro에서는 30ms입니다. 단일 패스에 64개 상태를 담아 실행하는 경우 4090에서 초당 475회 실행됩니다.
• 빠진 것 — d1-omni-600M에는 추론 표가 전혀 없습니다. Liquid는 이것이 활발히 개발 중이라고 말하며, 이에 대한 지연 시간은 그냥 보고하지 않습니다. 또한 이 릴리스 어디에도 오디오 의사 결정 벤치마크가 없는데, 벤더의 표현에 따르면 전용 오디오 의사 결정 벤치마크는 현재 미해결 문제이기 때문입니다.
그 발표가 실제로 제기하는 주장
가중치가 공개되기 이틀 전, Liquid는 이 모델의 호스팅 버전을 공개하고 여섯 개 애플리케이션에서 GPT-6.1 Sol 및 Claude Opus 5.5와 비교 실행했다. 요약은 이렇다: d1은 여섯 개 중 네 개에서 GPT-6.1 Sol과 동등하거나 앞서고, 비용은 19배에서 200배 더 적게 들며, 모든 작업에서 더 빠르게 답한다. 공개된 방법론은 그 내용을 그대로 반복하기 전에 읽어볼 가치가 있다 — 각 애플리케이션은 2026년 10월 5일에 모델당 한 번씩 실행되었고, 채팅 모델들은 기본 추론 설정에서 JSON으로 답변했으며, d1의 비용은 백만 입력 토큰당 $0.04로 계산되었다.
데모가 더 설득력 있는 쪽이다. 네 개의 생산 라인 — 회로 기판, 양초, 캐슈넛, 껌 — 에서 양품과 불량품을 85~97%의 정확도로 분류하는 것, 이는 해당 작업을 위해 훈련된 적이 없고 짧은 설명만으로 작업을 이해한 모델에서 나온 결과다. 150개의 지원 티켓 각각에 대해 예 또는 아니오로 답하는 SQL 프레디킷. 코딩 에이전트의 세션에서 각 도구 출력을 읽고 이를 유지, 축소 또는 삭제하여, 작업에 필요한 모든 출력을 유지하면서 토큰의 52%를 제거하는 컨텍스트 압축 루프. 테트리스에서, 완전히 텍스트로 설명 가능한 게임에 화면을 추가한 것은 점수를 70줄에서 81줄로 올렸다 — 이는 텍스트 전용 분류기로는 아무리 좋아도 얻을 수 없는 비전 결과다.
그것들은 벤더가 직접 수행하고 벤더가 과제를 고른 시연이며, 방법론 섹션에도 그렇게 밝히고 있다. 그럼에도 그것들은 의사결정 모델이 무엇을 위한 것인지에 관해 누구든 지금까지 공개한 것 중 가장 명확한 그림이다.

실행되는 위치와 호출 시 드는 비용
오픈 웨이트는 로컬 실행을 위해 만들어졌고, 벤더가 통합 작업을 미리 처리했습니다: llama.cpp에 대한 출시 첫날 지원, DGX부터 Jetson까지 아우르는 전체 NVIDIA 스택, NVFP4 양자화, 그리고 기본 체크포인트와 함께 공개된 8비트 웨이트/활성화 변형입니다. GGUF 변환본은 이미 Hugging Face에 올라와 있습니다. 직접 호스팅하고 싶지 않다면 Liquid가 호스팅하는 d1을 자체 API에서 제공합니다 — 입력 토큰만 과금되고 출력 토큰은 없으며, 이미지는 32×32픽셀 패치당 1.5토큰의 입력으로 청구되어 1024×1024 이미지가 1,536토큰이 됩니다. 텍스트 전용 접근도 서드파티 플랫폼을 통해 이용할 수 있습니다.
솔직한 라우팅 노트: Liquid AI d1-3B도, Liquid AI d1-omni-600M도 우리 카탈로그에 없으며, 이 글은 둘 중 어느 것에 대한 가용성 주장도 아닙니다. d1 두 모델이 라우터에 대해 바꾸는 것은 그 주변 파이프라인의 형태입니다. 밀리초 단위로 응답하고 출력 토큰 비용이 전혀 들지 않는 결정 모델은 대체재가 아니라 필터입니다 — 양품과 불량품 분류, 티켓 트리아지는 생성 호출 앞에서 이루어지고, 생성 호출은 200개 이상의 모델을 아우르는 단일 엔드포인트, 0% 마크업으로 그대로 전달되는 정가, 그리고 자동 페일오버가 실제로 제값을 하는 곳입니다. 레이어는 다르지만 파이프라인은 같습니다.
무엇이면 그 논쟁이 해결될까
세 가지가 아직 미해결이고, 그 세 가지 모두 시간만이 끝낼 수 있는 종류다.
첫 번째는 독립적 재현입니다. Decision Index 수치는 공급업체가 공식 스코어러를 사용해 산출했고, 모든 경쟁사 행은 공개 리더보드에서 그대로 가져왔습니다. 이는 방어 가능한 방법이며, 제3자가 여러분의 모델을 실행하는 것과는 같지 않습니다. 두 번째는 오디오입니다. 한 번의 포워드 패스로 음성 명령을 라우팅하는 600M 체크포인트는 진정으로 새로운 능력이며, 그것이 그 일을 얼마나 잘하는지 측정하는 벤치마크는 현존하지 않습니다. 세 번째는 범주 자체입니다. 답이 작성되는 대신 분포에서 읽어내는 경우, 소형 모델의 흔한 실패 모드—반복, 이탈, 거부, 형식 환각—는 아예 발생할 수 없으며, 그것들을 대체하는 것이 무엇인지에 관해 좋은 설명을 발표한 사람은 아무도 없습니다. 캘리브레이션 오차가 확실한 후보이며, 이는 모든 답변의 신뢰도 필드가 여러분 스스로 측정해 보도록 권하는 바로 그 대상입니다.
10개의 데모가 공개 Hugging Face space에서 라이브 카메라 입력을 반복 처리하며 Liquid AI d1-3B를 실행합니다. 이는 자신만의 의견을 형성하는 가장 저렴한 방법입니다. 가중치는 무료이고 질문은 구체적입니다. 이는 올해 대부분의 릴리스가 제공하는 것보다 더 나은 출발점입니다.

이 글에서 비교한 모델1
이 글에서 자동 인식 · 벤치마크: Artificial Analysis · 매일 업데이트
