
Ember-1 vs Gemma 4 12B: 하나는 더 적은 토큰을 임대해 주고, 다른 하나는 가중치를 건네준다
- openaiNEWOpenAI: GPT-6 Luna2026-09-2237지능
- openaiNEWOpenAI: GPT-6 Sol2026-09-2248지능
- anthropicNEWAnthropic: Claude Opus 5.52026-09-2258지능
- grokNEWGrok 4.72026-09-2146지능
- OrcaNEWOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 100만 토큰당 · 177 tok/s
- orcaNEWOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 100만 토큰당 · 1323 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040지능
- openaiOpenAI: GPT-6 Astra2026-09-0453지능77코딩
- googleGoogle: Gemini 3.8 Flash2026-09-0241지능76코딩
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245지능76코딩
- anthropicAnthropic: Claude Fable 5.12026-09-0153지능82코딩
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 100만 토큰당 · 108 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642지능72코딩
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 100만 토큰당 · 220 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845지능75코딩
- obsidianQwen3.8 27B2026-08-1534지능68코딩
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236지능69코딩
- grokSpaceXAI: Grok 4.62026-08-1244지능77코딩
- metaMeta: Muse Spark 1.22026-08-0540지능72코딩
- qwenQwen: Qwen3.8 Max2026-08-0345지능76코딩
Ember-1과 Gemma 4 12B는 발주서에서 같은 줄을 두고 경쟁하는 모델이 아니며, 그 이유를 가장 빠르게 확인하는 방법은 매달 말에 당신이 무엇을 소유하게 되는지 자문해 보는 것이다. Gemma 4 12B는 2026년 6월 3일 Apache 2.0으로 공개된 Google의 11.95B 매개변수 덴스 멀티모달 모델이다. 내려받으면 그 체크포인트는 당신 것이다. Ember-1은 Moonshot AI의 Kimi K3를 Fireworks Research가 특화 파생시킨 모델로, 2026년 9월 23일 해당 벤더 자체의 서버리스 플랫폼에서 연구 프리뷰로 공개되었다. 호출하면 청구서 외에는 아무것도 소유하지 못한다. 하나는 토큰에 관한 렌트 후 소유 논리이고, 다른 하나는 자본 구매다. 둘을 나란히 놓으면 유용한 비교는 어느 모델이 더 나은가가 아니다. 공개된 어떤 자료로도 그것을 결론지을 수 없기 때문이다. 유용한 비교는 두 조달 형태 중 어느 쪽이 당신이 만들고 있는 것에 맞는가이다.
두 계약을, 쉽게 말하면
Gemma 4 12B는 완성된 오픈 웨이트 릴리스입니다. Google은 가중치와 아키텍처, 벤치마크 시트, 라이선스를 공개하며, llama.cpp, vLLM, MLX, SGLang, Transformers 같은 런타임 커뮤니티가 여러분이 직접 통제하는 하드웨어에서 이를 구동합니다. 구매 후 토큰 비용은 벤더가 청구하는 항목이 아니라 전기료와 감가상각비입니다. 포기하게 되는 것은 오픈 웨이트가 언제나 요구해 온 것들입니다. 바로 용량 계획을 직접 책임져야 한다는 점, 그리고 품질 상한이 11.95B 파라미터로 고정된다는 점입니다.
Ember-1은 정반대다. 다운로드할 가중치가 없고 — 벤더 자체 플랫폼의 서빙 옵션으로 존재하며 — 공개된 가격도 없다. 대신 내세우는 것은 훨씬 더 큰 모델 위에서 실행되는, 더 좁은 범위의 주장이다: Kimi K3의 정확도를, 거기에 도달하는 데 약 40% 더 적은 토큰으로 달성한다는 것이다. Fireworks Research는 답변을 바꾸지 않고 추론 트레이스를 단축하도록 이를 특별히 훈련시켰으며, 7개 벤치마크와 2건의 고객 프로덕션 A/B 테스트 전반에서 정확도 손실 없이 추론 길이를 35–50% 줄일 수 있다고 보고한다. 그곳의 모든 수치는 벤더가 보고한 것이며 재현되지 않았다.

토큰 논쟁의 가치는 전적으로 누가 토큰 비용을 지불하느냐에 달려 있다
Ember-1에 대한 피치는 토큰당 청구를 전제로 합니다. 그 가정은 그것이 설계된 대상, 즉 호스팅된 프론티어 모델을 대상으로 긴 에이전트 루프를 실행하는 팀에게는 정확합니다. Fireworks Research는 Kimi K3가 생성된 토큰의 90% 이상을 내부 추론에 사용할 수 있다고 지적하며, 각 턴이 이전 턴을 재생하여 이전 추론이 다시 읽히고 다시 청구됩니다. 그런 환경에서 트레이스 길이를 줄이는 것은 월별 청구서를 직접적으로 줄이는 것이며, K3의 49.3K와 비교한 29.9K 출력 토큰의 A/B 결과가 중요한 숫자입니다.
Gemma 4 12B의 조건으로 같은 모델을 돌려보면 그 논증은 와해된다. Apache-2.0 체크포인트를 자체 호스팅할 때 추가 추론 토큰은 백만 개당 달러가 아니라 실제 경과 시간과 GPU 점유율을 소비한다. 자신의 16GB 노트북에서 장황한 추론 추적은 더 큰 청구서가 아니라 더 느린 답변이다. 그렇다고 비효율이 무해해지는 것은 아니다 — 에이전트 루프에서는 여전히 누적되고, 여전히 지연 시간으로 나타난다 — 하지만 환율은 다르며, 자체 호스팅 하드웨어에서 40% 토큰 감소를 40% 절감으로 취급하는 것은 범주 오류다.
사양서, 치수당 한 줄
• 무엇인가 — Ember-1: Kimi K3의 연구 미리보기 파생 모델로, 더 짧은 추론을 위해 재훈련되었습니다. Gemma 4 12B: Google의 Gemma 4 제품군에서 나온 11.95B 규모의 밀집형 오픈 웨이트 멀티모달 모델입니다.
• 가중치 — Ember-1: 공개된 것 없음; 벤더 플랫폼을 통해서만 제공됨. Gemma 4 12B: Apache 2.0, 다운로드 가능, 게이트 없음.
• 크기 — Ember-1: 미공개; Kimi K3 아키텍처에서 계승됨. Gemma 4 12B: 11.95B dense, 48개 레이어, BF16 기준 약 18GB의 가중치.
• 컨텍스트 윈도우 — Ember-1: 프리뷰용으로 공개되지 않음; 기본 모델은 1,048,576 토큰을 보유. Gemma 4 12B: 256K 토큰.
• 입력 — Ember-1: 텍스트. Gemma 4 12B: 인코더 없는 통합 설계를 통해 텍스트, 이미지, 오디오를 제공하며, 일부 출처에서는 비디오도 언급됩니다.
• 가격 — Ember-1: 공개된 가격 없음; 벤치마크 시트의 달러 금액은 Kimi K3의 요금표를 기준으로 계산됩니다. Gemma 4 12B: 무료로 다운로드 가능; 하드웨어 비용은 별도입니다.
• 하드웨어 최소 사양 — Ember-1: 벤더가 정하는 대로. Gemma 4 12B: 구글의 포지셔닝에 따르면 16GB의 VRAM 또는 통합 메모리.
• 근거 — Ember-1: 공급업체 벤치마크와 공급업체가 수행한 A/B 테스트 2건, 재현되지 않음. Gemma 4 12B: Google이 보고한 평가에 더해 독립적인 로컬 실행 생태계.
Gemma 4 12B가 게시하는 것, 그리고 그것을 읽는 방식
Google의 자체 수치에 따르면 Gemma 4 12B는 엣지급 Gemma 4 E4B와 더 큰 26B MoE 사이에 있습니다: GPQA Diamond 78.8%, MMLU Pro 77.2%, 도구 없이 AIME 2026 77.5%, LiveCodeBench v6 72.0, Codeforces ELO 1659, τ-2 평균 69.0%, MMMU Pro 69.1%, DocVQA 94.9, BigBench Extra Hard 53.0%. 이 수치들 역시 공급업체가 보고한 것입니다 — Google이 자체 모델을 평가해 그 시트를 공개했으니까요 — 하지만 누구나 다운로드해 다시 실행할 수 있는 체크포인트를 설명한다는 장점이 있습니다. 그래서 오픈 가중치 주장은 제3자 확인을 빠르게 얻는 경향이 있고, 비공개 프리뷰 주장은 그렇지 않습니다.
이 모델의 실제 차별점은 수치적이라기보다 구조적입니다. Gemma 4 12B에는 별도의 비전 또는 오디오 인코더가 없습니다. 이미지 패치와 오디오 파형이 토큰 공간으로 직접 투영되며, 이것이 바로 12B 모델이 스크린샷이나 녹음 파일을 입력으로 받을 수 있게 해줍니다. 또한 추측 디코딩을 위한 다중 토큰 예측 드래프터를 제공하는데, 이는 품질보다는 지연 시간을 위한 기능입니다 — 모델을 직접 실행하면서 프리필의 매 밀리초를 직접 부담해야 할 때 중요한 종류의 것입니다.
두 가지가 실제로 충돌하는 곳
두 모델 모두 에이전트형 코딩과 도구 사용을 겨냥해 판매되고 있으며, 이 영역이 실질적인 선택이 존재하는 유일한 영역이다. Ember-1의 Terminal Bench 2.1 수치는 82.0%로 Kimi K3 Max의 80.9%를 앞서며, 토큰은 51.9% 더 적게 사용한다. SWE-bench Verified 결과는 92.2%로 K3 Max의 93.2%에 미치지 못한다. Gemma 4 12B는 Google이 공개한 자료에 Terminal Bench나 SWE-bench 수치가 아예 없으며, 에이전트 관련 근거라고는 τ-2의 69.0%뿐이다. 따라서 두 모델을 공통된 벤치마크 위에 나란히 놓을 수 없으며, 그렇게 하는 기사는 어느 것이든 비교를 지어내는 셈이다.
말할 수 있는 것은 두 제품이 비용 곡선상 서로 다른 지점에 위치한다는 점이다. 에이전트 워크로드가 호스팅된 프런티어 모델에서 실행되고 청구서의 대부분이 추론 토큰에서 나온다면, Ember-1은 바로 그 항목을 공략한다. 그 대가로 2주간의 액세스 기간과 공개되지 않은 요금이라는 조건이 따른다. 워크로드가 직접 통제하는 하드웨어에서 실행되어야 하거나, 스크린샷을 처리해야 하거나, 공급업체가 프리뷰를 계속하지 않기로 결정해도 견뎌야 한다면, Gemma 4 12B는 두 제품 중 그 질문에 조금이라도 답하는 유일한 제품이다.

중간 경로, 그리고 그것을 찾을 수 있는 곳
두 모델의 자체 마케팅이 기반으로 삼고 있지 않은 세 번째 선택지가 있습니다: 더 큰 Gemma 4 등급을 하이브리드의 호스팅되는 절반으로 사용하는 것입니다. OrcaRouter는 Google의 Gemma 4 26B-A4B와 Gemma 4 31B를 200개 이상의 다른 모델과 함께하나의 API 뒤에서 제공업체 정가로 0% 마크업으로 라우팅하므로, 중간 규모 Gemma에 접근하는 바로 그 키가 그렇지 않으면 두 번째 계약이 필요했을 프런티어 모델에도 접근할 수 있습니다. Gemma 4 12B 자체는 우리 플랫폼에 없고 Ember-1도 없습니다 — 12B를 로컬에서 필요로 한다면 다운로드하세요; 더 큰 Gemma가 먼저 그 격차를 좁혀 주는지 시험해 보고 싶다면, 그 테스트에는 엔드포인트 하나만 들면 됩니다.
그러한 구성은 연구 프리뷰를 평가하는 정직한 방식이기도 합니다. 공급자 전반의 자동 장애 조치는 프리뷰 창에서 사라지는 모델이 여러분의 애플리케이션까지 함께 끌고 가지 않는다는 뜻이며, 이는 Ember-1의 출시 상태가 초래하는 특정 위험이자 그 벤치마크 표 어디에서도 다루지 않는 특정 위험입니다.
여러분의 로드맵에는 어느 것이 포함되어야 할까요?
소유권이 필수 조건이라면 — 프라이버시, 오프라인 운영, 고정된 비용 하한, 또는 공급업체가 마음을 바꿔도 계속 작동해야 하는 제품 — Gemma 4 12B를 선택하세요. Gemma 4 12B의 공개된 성능 상한은 프런티어 파생 모델보다 낮고, 멀티모달 입력은 진정으로 차별화되는 요소이며, 이 두 사실 중 어느 것도 다른 누구의 로드맵에 달려 있지 않습니다.
긴 에이전트 실행에서 토큰당 청구 비용이 문제이고 프리뷰 위험을 감수할 수 있다면 Ember-1을 선택하세요. 가지고 있는 2주 동안 기존 시스템과 섀도우로 실행하고, 자체 트래픽에서 완료된 작업당 토큰을 측정하며, 40%는 비율이 아니라 가설로 취급하세요. 품질을 기준으로 둘 중 하나를 선택해서는 안 됩니다. Ember-1을 만든 연구소를 포함해 누구도 여러분이 그렇게 할 수 있게 해주는 비교를 공개하지 않았기 때문입니다.

더 큰 요점은 이 두 릴리스가 2026년 말에 역량이 판매되는 두 가지 방식을 대표한다는 것이다. 한 연구소는 체크포인트를 공개하고 생태계가 자기 수준을 찾도록 내버려 둔다; 다른 곳은 누군가가 훈련한 모델을 가져다가 그 행동의 한 축을 개선하고, 그 개선을 서비스로 판다. 둘 다 정당하며, 서로 다른 방식으로 실패한다: 오픈 웨이트는 천천히 그리고 공개적으로 실패하고, 프리뷰는 갑자기 그리고 발표를 통해 실패한다.
이 글에서 비교한 모델1
이 글에서 자동 인식 · 벤치마크: Artificial Analysis · 매일 업데이트
