
Liquid AI d1-3B vs Gemma 4 12B: 범용 모델에 맞선 의사결정 모델
- openaiNEWOpenAI: GPT-6.1 Sol2026-09-2952지능
- anthropicNEWAnthropic: Claude Sonnet 5.52026-09-2856지능
- typesafeNEWTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 100만 토큰당 · 128 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238지능
- OpenAIOpenAI: GPT-6 Sol2026-09-2248지능
- AnthropicAnthropic: Claude Opus 5.52026-09-2258지능
- xAIGrok 4.72026-09-2146지능
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 100만 토큰당 · 62 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 100만 토큰당 · 320 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040지능
- OpenAIOpenAI: GPT-6 Astra2026-09-0453지능77코딩
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241지능76코딩
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245지능76코딩
- AnthropicAnthropic: Claude Fable 5.12026-09-0153지능82코딩
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 100만 토큰당 · 54 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 100만 토큰당 · 358 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642지능72코딩
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 100만 토큰당 · 232 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845지능75코딩
- obsidianQwen3.8 27B2026-08-1534지능68코딩
Liquid AI d1-3B와 Gemma 4 12B를 같은 벤치마크에 올려놓고 승자를 기다리는 것이 이 비교를 가장 빠르게 잘못 만드는 방법이다. 이 둘은 같은 질문에 답하지 않는다. Liquid AI d1-3B는 2026년 10월 7일 오픈 웨이트로 공개된 3.12B 결정 모델이다. 상태 하나와 이름이 붙은 질문 묶음을 주면 확률, 선택된 레이블, 신뢰도를 반환하며, 출력 토큰이 0개이고 생성 단계가 없다. Gemma 4 12B는 Google의 인코더 없는 any-to-any 범용 모델로, 텍스트·이미지·오디오·비디오를 입력받아 256,000토큰 창에 걸쳐 140개 이상의 언어로 답을 써 내는 11.96B 체크포인트다. 하나는 회로 기판이 네 가지 중 무엇인지 알려주고, 다른 하나는 그 이유를 알려준다. 품질만 놓고 비교하면 아무것도 배울 수 없다. 출력이 같은 기준으로 잴 수 있는 것이 아니기 때문이며, 두 벤더는 이 둘을 서로 견주어 벤치마킹한 적이 없다. 호출이 실제로 무엇을 반환하는지, 비용이 얼마인지, 그리고 각각이 어디서 한계에 부딪히는지를 기준으로 비교하면, 이 짝은 진정으로 유용한 경계 테스트가 된다.
두 가지 서로 다른 출력 계약
여기서 실질적인 역할을 하는 구분은 바로 회선을 타고 돌아오는 것입니다.
Liquid AI d1-3B는 구조화된 답변 객체를 반환합니다. 요청의 모든 질문은 유형을 선언합니다 — noul은 예/아니오와 P(yes)를 위한 것이고, choice는 이름이 지정된 옵션 세트 중 하나에 대해 각 옵션별 신뢰도와 확률을 제공하는 것이며, 또는 score는 순서가 있는 2~10단계 척도에서 예상 수준과 그 분포를 나타내는 위치를 위한 것입니다. 모델은 보고합니다: output_tokens: 0 왜냐하면 아무것도 작성되지 않기 때문입니다. 하나의 상태에 대한 여러 질문은 단일 순방향 패스에서 읽히며, 상태와 그 이미지는 모든 질문에 대해 한 번만 인코딩됩니다.
Gemma 4 12B는 산문을 반환합니다. 때로는 요청한 JSON을 반환하고, 때로는 정확히 요청하지 않은 JSON을 반환하며, 답변하기 전에 추론할 수 있습니다. 이는 무엇보다도 언어 모델입니다. 분류할 줄 아는 것은 무엇이든 텍스트로 표현합니다. 이는 답을 사람에게 설명해야 하거나 언어를 기대하는 다운스트림 단계에 입력해야 할 때는 강점이고, 필요한 것이 확률 하나뿐일 때는 비용입니다.
그로부터 이후의 모든 것이 따라온다. d1-3B 응답은 파싱에 실패할 수 없다. 또한 스스로를 설명할 수도 없으며, 모델 카드에도 그렇게 직접 나와 있다: 그것은 채팅 모델이 아니며 텍스트를 작성하지 않는다.
증거 흔적의 현주소
두 숫자 집합의 출처는 서로 동등하지 않으며, 여기서는 숫자 자체보다 그 점이 더 중요하다.
• Decision Index 0.2.1 — Liquid AI d1-3B는 48.57점을 기록했으며, 벤더가 공식 스코어러로 채점했고, 10B 미만 모델 중 1위이며 47.11점의 Decider 35B-A3B보다 앞서 있습니다. Gemma 4 12B는 Decision Index에서 전혀 채점되지 않으므로 이 행에는 대응 항목이 없습니다.
• 추론 벤치마크 — Gemma 4 12B는 AIME 2026에서 77.5, GPQA Diamond에서 78.8, Codeforces ELO 1,659를 기록하며, 추론 모드에서 Artificial Analysis Intelligence Index 22, 추론 기능을 끈 상태에서 13을 나타냅니다. Liquid AI d1-3B는 추론 벤치마크가 없는데, 이는 의사결정 모델이 점수를 매길 추론 흔적을 생성하지 않기 때문입니다.
• 긴 컨텍스트 — Gemma 4 12B는 256,000개 토큰을 지원하며, Google 자체 카드에서 128k 기준 MRv2 8-needle에서 43.4%를 기록합니다. Divergence d1-3B는 32,768개 토큰을 지원합니다. 당신의 "상태"가 40페이지 문서에 스캔본까지 더한 것이라면, 그 격차가 곧 결정의 전부이며 결코 근소하지 않습니다.
• 비전 — Liquid AI d1-3B는 11개 공개 이미지 벤치마크에서 각 벤치마크의 선택지 집합에 대한 결정으로 해석했을 때 평균 74.1을 기록했으며, 이 모델이 기반으로 삼은 LFM2.5-VL-3B 백본의 73.9와 비교됩니다. 또한 공급업체는 이미지를 제거하면 동일한 문항이 45.1로 떨어진다고 보고합니다. Gemma 4 12B의 비전은 더 강력하고 더 폭넓지만, 이는 명명된 선택지에 대한 결정 정확도가 아니라 생성 품질로 보고됩니다.
• 언어 — Liquid AI d1-3B의 경우 16개가 문서화되어 있음; Gemma 4 12B의 경우 140개 이상.
• 속도 — Liquid AI d1-3B는 RTX 4090에서 한 질문에 8ms, Jetson AGX Thor에서 16ms, Jetson AGX Orin 64GB에서 26ms, Jetson Orin Nano에서 50ms 만에 답하며, 4090에서는 초당 475회로 64개의 상태를 단일 패스에 담아낸다. Gemma 4 12B는 생성 방식이므로, 지연 시간은 출력하는 토큰 수에 따라 달라진다.
• 증거 품질 — Gemma 4 12B의 결과는 Google의 것이며, 2026년 6월에 발표된 뒤 대규모 커뮤니티가 뜯어보고, 양자화하고, 재실행해 왔다. Liquid AI d1-3B의 결과는 Liquid의 것이며, 이틀 전에 발표되었고, 연구소 밖에서는 아무도 재현하지 못했다. 두 번째 열은 그에 맞게 읽어야 한다.

그들이 진정으로 경쟁하는 유일한 곳
실제로 겹치는 부분이 있으며, 그것은 리더보드에 있지 않습니다. 그것은 LLM-as-a-judge 호출입니다.
많은 프로덕션 파이프라인은 이미 중간 규모 범용 모델을 평가 계층으로 사용한다. 이 티켓의 긴급도를 점수화하고, 이 출력이 루브릭을 통과하는지 판단하고, 에이전트가 다음에 호출할 도구를 고르고, 검색된 구절이 질문에 답하는지 확인하는 식이다. 오늘날 이런 호출 대부분은 숫자나 레이블을 텍스트로 내놓도록 요청받는 생성 모델로 가며, 그 모델이 내놓는 숫자는 옵션 집합에 대한 소프트맥스가 아니라 샘플러가 만들어낸 값이다. Liquid AI d1-3B가 대체하도록 후속 학습된 워크플로가 바로 이것이며, 공개된 데모들은 모두 이 워크플로의 변형이다 — 150개 지원 티켓에 예/아니요로 답하는 SQL 조건자, 각 도구 출력을 유지하거나 다듬거나 버리면서 토큰의 52%를 제거하는 에이전트 컨텍스트 압축 루프, 한 번도 학습한 적 없는 작업에서 4개 생산 라인의 양품과 불량품을 85~97% 정확도로 분류한 시각 검사 앱.
Gemma 4 12B는 이러한 모든 작업을 수행하며, 그보다 더 많은 일도 해냅니다. 또한 요약을 작성하고, 256K 문서를 컨텍스트에 유지하며, 녹음된 전화 통화를 입력으로 받아 140개 이상의 언어 중 하나로 답변할 수 있습니다. 파이프라인에 평가와 내레이션이 필요하다면, 12B는 한 번의 호출로 두 가지 작업을 수행하고, 3B 의사 결정 모델은 그중 하나를 수행하는 것입니다.
경계는 컨텍스트 길이와 출력 형태입니다. 긴 상태, 음성 입력, 많은 언어, 또는 독자가 기대하는 설명 — Gemma 4 12B, 두말할 필요 없습니다. 짧은 상태, 고정된 옵션 세트, 한 자릿수 밀리초의 요청당 지연 시간 예산, 또는 답변이 파싱될 것이라는 확실한 보장 — 그것이 d1-3B 열이며, 범용 모델은 당신이 사용하지 않을 기능에 비용을 지불하고 있는 것입니다.
각각 통화하는 데 드는 비용
두 모델 모두 우리 카탈로그에 없으므로, 어느 쪽도 라우팅 가격을 제시할 수 없습니다 — Gemma 4 12B는 우리가 서비스하는 Gemma 크기 중 하나가 아니며, Liquid AI d1-3B는 직접 호스팅하거나 공급업체 자체 API 및 타사 플랫폼을 통해 접근하는 오픈 웨이트입니다. 해당 제품군에서 Gemini에 인접한 쪽에 대한 참고로, 우리가 실제로 라우팅하는 두 가지 Gemma 4 크기는 Gemma 4 26B A4B의 경우 백만 입력당 $0.06, 백만 출력당 $0.33으로, Gemma 4 31B의 경우 $0.13 및 $0.38로 책정되어 있으며, 둘 다 262,144토큰 컨텍스트와 텍스트, 이미지 및 비디오 입력을 지원합니다. 다른 곳에서 Gemma 4 12B에 대해 제시된 제공업체 가격의 중앙값은 약 $0.10 및 $0.30입니다.
Liquid의 호스팅형 d1은 입력 토큰에만 과금하며, 백만 개당 $0.04이고, 이미지는 32×32픽셀 패치당 1.5토큰의 입력으로 계산됩니다. 따라서 의사 결정 요청에는 출력 토큰 항목이 전혀 없는데, 이는 훨씬 더 큰 모델들과 비교한 공급업체 자체의 비용 비교가 그러한 결과에 도달하는 구조적 이유입니다. 오픈 웨이트에는 호출당 가격이 없으며, 비용은 하드웨어로 지불합니다. 둘 다 여러분이 호출하는 다른 모든 것과 동일한 파이프라인에 있어야 하며, 이것이 바로 라우터가 존재하는 계층입니다 — 200개 이상의 모델에 걸친 단일 API, 공급업체 정가를 0% 마크업으로 전달, 그리고 자동 장애 조치를 통해 단일 업스트림의 일시적 문제가 여러분의 서비스 중단으로 이어지지 않도록 합니다. 그것은 비교를 둘러싼 배관이지, 비교 자체가 아닙니다.

솔직히, 어떻게 결정해야 할까
모델이 아니라 답변 형식에서 시작하라. 하위 시스템이 확률, 레이블, 신뢰도를 소비할 수 있고 답변 집합이 작고 알려져 있다면, Liquid AI d1-3B는 12B에서의 다운그레이드가 아니다 — 그것은 다른 도구이며, 지연 시간 수치는 그것을 범주적으로 다른 배포로 만든다: Jetson Orin Nano에서의 50ms는 12B를 돌릴 처지가 전혀 아닌 기기다.
만약 답변이 문장이어야 하거나, 상태가 3만 2천 토큰보다 길거나, 누군가 그것을 소리 내어 말하려 하거나, 출력 언어가 벵골어라면, Gemma 4 12B는 둘 중 이 작업을 할 수 있는 유일한 모델이며, 비교는 시작하기도 전에 끝난다.
대부분의 팀에게 진정으로 유용한 위치는 둘 다이며, 서로 다른 자리에 있습니다. 값비싼 호출 앞에는 결정 모델을 두어 언어가 필요 없는 분류, 라우팅, 가드레일 검사를 수행하게 하고, 그 뒤에는 범용 모델을 두어 언어가 필요한 작업을 맡깁니다. 이들은 같은 파이프라인이며, 하나는 필터이고 하나는 페이로드입니다 — 그리고 d1 릴리스에서 가장 많은 것을 얻을 팀은 이미 예/아니오를 답하기 위해 12B를 지불하고 있는 팀들입니다.

