Microsoft-Decision-1 대 Gemma 4 12B를 위한 생성된 타이틀 카드로, 부제는 '출력 토큰이 없는 채점자 대 닫힌 집합이 없는 작성자'이며, 칩에는 확률 대 산문, 32,768-토큰 컨텍스트 대 256,000, 텍스트 전용 대 텍스트·이미지·오디오·비디오, 호스팅 API 대 오픈 웨이트가 적혀 있다.
Guides & Insights

Microsoft-Decision-1 vs Gemma 4 12B: 하나는 당신의 목록에서 고르고, 다른 하나는 새로 하나를 써준다

작성자

Gideon Frost

게시일

최신 모델 · 20모든 모델 보기 →
벤치마크: Artificial Analysis · 매일 업데이트
모든 게시물로 돌아가기

를 나란히 놓고 보면, Microsoft-Decision-1과 Gemma 4 12B모든 것을 결정하는 차이는 크기나 정확도, 라이선스가 아니라 — 모델이 당신의 입력을 읽은 뒤에 일어나는 일이다. Gemma 4 12B는 2026년 6월 3일 Apache 2.0에 따라 공개된 DeepMind의 119.6억 매개변수 인코더 없는 멀티모달 모델로, 텍스트, 이미지, 오디오 또는 비디오를 읽고 나서 256,000토큰 창과 140개 이상의 언어에 걸쳐 답변을 토큰 단위로 써 줍니다. Microsoft-Decision-1은 Microsoft Foundry에서 2026년 10월 8일에 일반 제공되었으며 Qwen3.5-9B로 사후 학습된 텍스트 전용 스코어러입니다: 상태와 이미 답을 열거해 둔 질문을 주면, 최대 32,768토큰에 걸친 단일 패스에서 각 옵션에 대해 보정된 확률을 반환하고 아무것도 생성하지 않습니다. 한 모델은 당신의 옵션 중 무엇이 맞는지 알려 줍니다. 다른 모델은 그 옵션이 무엇이었어야 하는지 알려 주고 — 그 모든 단어에 대해 요금을 청구합니다.

이것을 경연으로 규정하는 것은 범주 오류일 터이며, 그 점은 명세 문구들 뒤가 아니라 앞에서 말할 가치가 있다. 이 둘은 대체물이 아니다. 이들은 하나의 워크플로 양 끝에 자리한다. 유용한 질문은 당신이 실제로 어느 쪽 끝을 만들고 있느냐이다. 그 답이 당신이 심사자를 사는지 작가를 사는지를 결정하기 때문이다.

청구서는 그 차이가 더 이상 철학적인 문제가 아니게 되는 지점이다.

Gemma 4 12B는 모든 생성형 모델과 같은 방식으로 과금된다. 입력 토큰과 출력 토큰, 둘 다 말이다. 구조화된 JSON을 요청하면 그 JSON의 모든 문자가 생성되고 샘플링되고 과금된다. 그리고 스키마가 더 많이 중첩될수록 답변은 더 길어지고 그 청구 항목은 더 커진다. 이것은 모델의 결함이 아니다. 이것은 디코더가 하는 일이며, 의사결정 헤드가 삭제하기 위해 존재하는 바로 그 청구 항목이다.

Microsoft-Decision-1에는 청구할 출력 측이 없습니다. 이는 상태, 질문, 선택지 집합에 대해 단일 순전파를 실행하고, 각 후보의 점수를 읽고, 반환합니다. 그 결과는 프롬프트 크기가 아니라 볼륨에 따라 누적됩니다: Gemma 4 12B로 1만 개의 레코드에 라벨을 붙이는 파이프라인은 1만 개의 JSON 문서를 생성하는 반면, 동일한 파이프라인을 결정 스코어러에 적용하면 1만 개의 프롬프트만 생성하고 그 외에는 아무것도 생성하지 않습니다. 절대적인 절감액이 큰지는 전적으로 볼륨과 스키마의 비대함에 달려 있으며, 토큰당 예산을 가진 사람이라면 누구나 스프레드시트에서 이를 판가름할 수 있습니다. 방향성은 논란의 여지가 없습니다.

두 번째로 더 작은 비대칭성이 있습니다: Microsoft는 Microsoft-Decision-1 모델 페이지에 요금을 표시하지 않습니다. 가격 책정은 Microsoft 자체의 가격 책정 페이지로 연결되므로, 결정당 비용은 카드가 아니라 Azure에서 확인하는 것입니다. 이 페이지가 확실히 밝히는 것은 호출의 0%가 출력 토큰이라는 점과 배치 추론이 비활성화되어 있다는 점입니다 — 생성 모델에서처럼 배치 채널을 통해 대량 스코어링 실행을 상각할 수는 없습니다.

A two-column generated scoreboard titled Microsoft-Decision-1 vs Gemma 4 12B. Left column Microsoft-Decision-1 rows read: parameters 9B Qwen3.5 base post-trained; context 32,768 tokens; output probabilities with zero output tokens; modalities in text only; weights hosted, not distributed. Right column Gemma 4 12B rows read: parameters 11.96B encoder-free multimodal; context 256,000 tokens; output generated text billed per token; modalities in text, image, audio, video; weights Apache 2.0 and self-serve. A footer line reads that the Gemma 4 12B figures are Google-reported and Microsoft-Decision-1 has published no benchmark figures.

같은 입력, 두 가지 다른 답변

두 모델 모두에게 고객 지원 티켓과 질문을 주세요. Microsoft-Decision-1은 "billing"에 대해 0.83, "technical"에 대해 0.11, "cancellation"에 대해 0.04, "cannot tell"에 대해 0.02 같은 값을 반환합니다. 당신에게는 이름 붙일 수 있는 레이블, 임계값을 적용할 수 있는 숫자, 그리고 보류 경로가 있습니다 — Microsoft는 제공된 증거가 불충분할 때 "cannot tell" 스타일 옵션이 지원된다고 문서화하며, 이것이 에스컬레이션 로직을 작동하게 만듭니다. 당신이 얻지 못하는 것은 이유입니다.

티켓을 Gemma 4 12B에게 주면 한 문단이 나온다. 구성 가능한 사고로 요청을 추론하고, 함수를 호출하고, 티켓에 첨부된 스캔한 청구서를 읽고, 티켓에 붙어 있는 음성 메시지를 전사하고, 고객의 언어로 답변할 수 있다. 이 모든 것은 Decision-1이 어떤 정확도로도 할 수 없는 일이다. 입력 수단은 텍스트뿐이며, 개방형 질문 응답, 대화, 번역 또는 요약을 위해 명시적으로 설계되지 않았다.

Gemma 4 12B의 출력 중 확률인 것은 없습니다. 라우팅 결정을 신뢰도와 함께 내놓으라고 요청하면 숫자가 들어간 산문이 나오는데, 그 숫자는 당신이 제공한 옵션 집합에 대한 소프트맥스가 아니라 샘플러가 만들어낸 값일 뿐입니다. 다운스트림 임계값이 그 숫자가 무언가를 의미한다는 데 의존한다면, 당신 손에 있는 것은 스코어러가 아니라 캘리브레이션 프로젝트입니다.

당신의 질문에 닫힌 집합이 있는지 여부가 결정의 전부입니다.

이것은 무엇보다도 먼저 적용해야 하는 테스트이며, 화이트보드만 있으면 약 10분이 걸립니다.

• 답이 미리 열거할 수 있는 목록 — 레이블, 평점, 예/아니요, 루브릭 점수, 경로 — 에서 나오는 것이라면, Microsoft-Decision-1이 올바른 도구이며, Gemma 4 12B는 그 목록에서 고르는 데 있어 낭비적이고 덜 신뢰할 수 있는 방식입니다. 이미 범위를 정해 둔 숫자를 추측하도록 디코더에 비용을 지불하는 셈이니까요.

• 답이 닫힌 집합이 아니라면 — 이것을 요약하고, 저것을 설명하고, 답장을 쓰고, 차트를 묘사하는 것 — Microsoft-Decision-1은 어떤 대가를 치러도 도울 수 없습니다. 그것은 산문으로 나아갈 경로도, 근거 필드도, 당신이 옵션으로 열거하지 않은 그 무엇이든 산출할 메커니즘도 없습니다.

• 둘 다라면, 그것은 선택이 아니라 두 개의 모델로 구성된 파이프라인이며, 흥미로운 설계 질문은 어느 쪽이 에스컬레이션 임계값을 소유하느냐가 된다. 스코어러가 그 값을 설정하고, 라이터가 그 위와 아래에서 벌어지는 일을 채워 넣는다.

Gemma 4 12B가 그저 다른 종목인 곳

의사결정 프레이밍을 벗어나면, Gemma 4 12B는 한 라인에서 앞서 있는 게 아니다 — 그것은 다른 게임을 하고 있으며, 그렇지 않은 척하는 것은 정직하지 못할 것이다.

A screenshot of the google/gemma-4-12B-it model card on Hugging Face, showing the Gemma 4 banner, the Hugging Face, GitHub, launch blog, documentation and technical report links, an Apache 2.0 licence, the note that the card covers the Gemma 4 12B Unified model, and the opening paragraphs describing a multimodal family handling text, image, video and audio with a context window of up to 256K tokens and multilingual support in over 140 languages.

• 모달리티 — Microsoft-Decision-1은 텍스트를 입력받아 숫자를 출력하는 텍스트 전용 모델입니다. Gemma 4 12B는 인코더 없는 설계를 통해 텍스트, 이미지, 오디오, 비디오를 네이티브로 처리하며, 원시 패치와 파형을 임베딩 공간에 바로 투영하고, 어떤 순서로든 입력을 인터리빙할 수 있습니다.

• 컨텍스트 — Microsoft-Decision-1의 32,768토큰 대비 Gemma 4 12B는 256,000토큰이며, Gemma 4 12B는 Google 자체 카드에서 128k에서 MRCR v2 eight-needle에서 43.4%를 기록합니다.

• 언어 — Microsoft-Decision-1의 경우 25개 지원 언어이며, Microsoft는 지원 범위, 품질 및 캘리브레이션이 "언어별로 다를 수 있다"고 경고하고 저자원 비영어를 약점으로 지목합니다. Gemma 4 12B의 경우 140개 이상이며, 이 크기에서 평가된 MMMLU 수치는 83.4입니다.

• 공개된 성능 — Microsoft-Decision-1의 Benchmarks 탭에는 방법론만 있고 수치는 없습니다; Google은 Gemma 4 12B에 대해 77.2% MMLU Pro, 도구 없이 77.5% AIME 2026, 72.0% LiveCodeBench v6, 78.8% GPQA Diamond, 69.1% MMMU Pro, 79.7% MATH-Vision을 공개합니다.

• 배포 — Microsoft-Decision-1은 가중치도, 다운로드도, 파인튜닝 경로도 없는 Foundry 전용 호스팅 API입니다. Gemma 4 12B는 Apache 2.0 가중치로, 출시 첫날부터 LM Studio, Ollama, llama.cpp, MLX, vLLM, SGLang, Unsloth 생태계에 배포되었습니다.

• 런타임 — 의사 결정 스코어링은 디코딩 루프 없이 단일 패스로 수행되므로 지연 시간은 답변 길이가 아니라 프롬프트 길이에 따라 늘어납니다. Gemma 4 12B는 토큰 단위로 생성하며, Google의 출시 자료에서는 이를 16 GB VRAM 또는 통합 메모리로 명시합니다.

벤치마크 항목은 마이크로소프트에 가장 덜 유리한 방향으로, 잠시 짚고 넘어갈 만한 대목이다. Gemma 4 12B의 수치도 공급업체가 보고한 것이지만, 그 수치에는 수개월간의 제3자 사용이 뒷받침한다. 공개 하네스에서, 다른 사람들이 소유한 하드웨어에서 말이다. 이 범주에서 마이크로소프트의 출품작은 더 큰 회사에서 나왔음에도 불구하고 둘 중 가장 최신이며 가장 검증하기 어렵다.

각각을 실제로 호출할 때 드는 비용

Gemma 4 12B는 12B 형태로는 저희 카탈로그에 없습니다 — 그 크기를 원하신다면 BF16 파라미터 119억 6천만 개를 직접 가져와 직접 서빙하셔야 합니다. 저희 카탈로그가 제공하는 것은 나머지 Gemma 4 라인업이며, 저렴합니다: Gemma 4 26B A4B는 백만 입력 토큰당 $0.06, 백만 출력 토큰당 $0.33, 그리고 Gemma 4 31B는 $0.13 및 $0.38, 둘 다 262,144 토큰 컨텍스트로 기재되어 있습니다. 그것들은 공급업체 정가로, 저희 쪽에서 마크업을 추가하지 않고 그대로 전달된 가격이며, 200개가 넘는 다른 모델과 함께 하나의 OpenAI 호환 키 뒤에 있습니다. 문제가 폐쇄형 결정이 아니라 일반 추론으로 판명된다면, 그 두 크기 중 하나가 자체 운영 스코어러와 비교해 측정할 저렴한 대상입니다 — 그리고 단일 작성자에게 고정하고 싶지 않다면, 자동 장애 조치는 한 공급자가 성능 저하될 때 스코어링 루프의 생성 부분을 계속 살려 둡니다.

A screenshot of OrcaRouter's own model page for google/gemma-4-31b-it, showing the Google breadcrumb, the model name Gemma 4 31B, a release date of 2026-04-02, the description of it as a 30.78B dense multimodal model with text and image input, a 256K token context window and configurable thinking mode, list pricing of $0.13 per million input tokens and $0.38 per million output tokens, and a P50 time to first token figure.

Microsoft-Decision-4는 직접 프로비전하는 Foundry 배포이며, 저희를 통해 제공되지 않습니다. 이 문서의 그 어떤 내용도 호출의 어느 쪽에서든 이 모델에 대한 가용성 주장이 아닙니다.

결론

Microsoft-Decision-1은 2026년 10월 8일 Microsoft Foundry에서 일반 제공되었습니다: Qwen3.5-9B 기반의 텍스트 전용 32,768토큰 스코어러로, 사용자가 열거한 선택지에 대해 보정된 확률을 반환하며, 출력 토큰이 0개이고, 가중치도 공개된 벤치마크 수치도 없습니다. Gemma 4 12B는 2026년 6월 3일 Apache 2.0에 따라 공개된 11.96B 인코더 없는 멀티모달 범용 모델로, 256,000토큰에 걸쳐 추론하고 이미지와 오디오를 읽고 답을 작성합니다. 파라미터 수가 아니라 답변의 형태로 선택하세요: 닫힌 집합은 스코어러의 몫이고, 열린 집합은 작성자의 몫이며, 이미 작성한 목록에서 선택하도록 디코더에 비용을 지불하는 것은 팀이 결정에 드는 비용의 열 배를 지출하는 가장 흔한 방식입니다.

저희 카탈로그에 실제로 갖춰져 있는 것은 Gemma 4 라인의 나머지 제품이며, 가격도 저렴합니다: Gemma 4 26B A4B는 백만 입력 토큰당 $0.06, 백만 출력 토큰당 $0.33 , Gemma 4 31B는 $0.13과 $0.38입니다.