Một thẻ tiêu đề được tạo cho Microsoft-Decision-1 vs Gemma 4 12B với phụ đề 'một bộ chấm điểm không có token đầu ra đối đầu với một bộ viết không có tập đóng', cùng các chip hiển thị xác suất so với văn xuôi, ngữ cảnh 32.768 token so với 256.000, chỉ văn bản so với văn bản, hình ảnh, âm thanh và video, và API được lưu trữ so với trọng số mở.
Guides & Insights

Microsoft-Decision-1 vs Gemma 4 12B: Một bên chọn từ danh sách của bạn, một bên viết cho bạn một danh sách mới

Tác giả

Gideon Frost

Ngày đăng

Mô hình mới nhất · 20Xem tất cả mô hình →
Benchmark: Artificial Analysis · cập nhật hằng ngày
Quay lại tất cả bài viết

Đặt Microsoft-Decision-1 và Gemma 4 12Bcạnh nhau, và điều quyết định tất cả khác biệt không phải là kích thước, độ chính xác hay giấy phép — mà là những gì diễn ra sau khi mô hình đã đọc đầu vào của bạn. Gemma 4 12B, mô hình đa phương thức không dùng encoder với 11,96 tỷ tham số của DeepMind, ra mắt ngày 3 tháng 6 năm 2026 theo giấy phép Apache 2.0, đọc văn bản, hình ảnh, âm thanh hoặc video rồi viết cho bạn câu trả lời, từng token một, trong cửa sổ 256.000 token và hơn 140 ngôn ngữ. Microsoft-Decision-1 được phát hành chính thức trên Microsoft Foundry vào ngày 8 tháng 10 năm 2026 dưới dạng một mô hình chấm điểm chỉ dùng văn bản, được huấn luyện hậu kỳ trên Qwen3.5-9B: bạn đưa cho nó một trạng thái và một câu hỏi mà bạn đã liệt kê sẵn các câu trả lời, và nó trả về một xác suất đã hiệu chỉnh cho từng lựa chọn chỉ trong một lượt chạy duy nhất trên tối đa 32.768 token, mà không sinh ra gì cả. Một mô hình cho bạn biết lựa chọn nào của bạn là đúng. Mô hình kia cho bạn biết lẽ ra các lựa chọn phải là gì — và tính tiền cho bạn từng chữ một.

Việc đóng khung đây như một cuộc thi sẽ là một lỗi phạm trù, và đáng nói điều đó trước các dòng đặc tả hơn là sau chúng. Hai thứ này không phải là vật thay thế cho nhau; chúng nằm ở hai đầu đối lập của một quy trình làm việc. Câu hỏi hữu ích là bạn thực sự đang xây dựng đầu nào, vì câu trả lời quyết định việc bạn đang mua một giám khảo hay một người viết.

Hóa đơn là nơi sự khác biệt không còn mang tính triết lý nữa.

Gemma 4 12B được tính phí theo cách mọi mô hình tạo sinh đều được tính: token đầu vào và token đầu ra, cả hai. Khi bạn yêu cầu nó tạo JSON có cấu trúc, mọi ký tự của JSON đó đều được sinh ra, lấy mẫu và phải trả tiền — và schema của bạn càng lồng sâu bao nhiêu, câu trả lời càng dài và khoản mục đó càng lớn bấy nhiêu. Đó không phải là lỗi của mô hình. Đó là điều mà một bộ giải mã làm, và chính xác là khoản mục mà những người ra quyết định tồn tại để xóa bỏ.

Microsoft-Decision-1 không có phía đầu ra để tính phí. Nó chạy một lượt truyền xuôi duy nhất qua trạng thái, câu hỏi và tập lựa chọn của bạn, đọc điểm số cho từng ứng viên, rồi trả về. Hệ quả tích tụ theo khối lượng chứ không theo kích thước prompt: một pipeline dán nhãn mười nghìn bản ghi bằng Gemma 4 12B tạo ra mười nghìn tài liệu JSON, còn cùng pipeline đó chạy trên một bộ chấm điểm quyết định thì tạo ra mười nghìn prompt và không gì khác. Khoản tiết kiệm tuyệt đối có lớn hay không phụ thuộc hoàn toàn vào khối lượng của bạn và độ cồng kềnh của schema, và bất kỳ ai có ngân sách theo token đều có thể giải quyết điều đó bằng một bảng tính. Chiều hướng thì không có gì phải tranh cãi.

Có một sự bất đối xứng thứ hai, nhỏ hơn: Microsoft không công bố mức giá trên trang mô hình Microsoft-Decision-1. Liên kết định giá dẫn đến trang định giá của chính Microsoft, vì vậy chi phí cho mỗi quyết định là thứ bạn đọc từ Azure chứ không phải từ thẻ. Điều mà trang này xác lập là 0% của lệnh gọi là token đầu ra, và suy luận theo lô bị vô hiệu hóa — bạn không thể phân bổ chi phí cho một lần chấm điểm hàng loạt thông qua kênh hàng loạt như bạn làm với mô hình sinh.

A two-column generated scoreboard titled Microsoft-Decision-1 vs Gemma 4 12B. Left column Microsoft-Decision-1 rows read: parameters 9B Qwen3.5 base post-trained; context 32,768 tokens; output probabilities with zero output tokens; modalities in text only; weights hosted, not distributed. Right column Gemma 4 12B rows read: parameters 11.96B encoder-free multimodal; context 256,000 tokens; output generated text billed per token; modalities in text, image, audio, video; weights Apache 2.0 and self-serve. A footer line reads that the Gemma 4 12B figures are Google-reported and Microsoft-Decision-1 has published no benchmark figures.

Cùng một đầu vào, hai kết quả khác nhau

Đưa cho cả hai mô hình một phiếu hỗ trợ khách hàng và một câu hỏi. Microsoft-Decision-1 trả về đại loại như 0,83 cho “thanh toán”, 0,11 cho “kỹ thuật”, 0,04 cho “hủy dịch vụ”, 0,02 cho “không thể xác định”. Bạn có một nhãn có thể đặt tên, một con số để đối chiếu ngưỡng, và một lối thoát để không đưa ra quyết định — Microsoft ghi rằng một tùy chọn kiểu “không thể xác định” được hỗ trợ khi bằng chứng được cung cấp không đủ, và chính điều đó khiến logic chuyển cấp hoạt động. Điều bạn không nhận được là lý do.

Giao ticket cho Gemma 4 12B và bạn nhận được một đoạn văn. Nó có thể suy luận về yêu cầu với khả năng tư duy có thể cấu hình, gọi hàm, đọc hóa đơn quét được đính kèm vào ticket, chuyển thư thoại được ghim kèm theo đó thành văn bản, và trả lời bằng chính ngôn ngữ của khách hàng. Mỗi một trong những việc đó đều là điều mà Decision-1 không thể làm ở bất kỳ mức độ chính xác nào: bề mặt đầu vào của nó chỉ là văn bản và không gì khác, và nó rõ ràng không được thiết kế cho việc hỏi đáp mở, hội thoại, dịch thuật hay tóm tắt.

Không có đầu ra nào của Gemma 4 12B là một xác suất. Hãy yêu cầu nó đưa ra quyết định định tuyến kèm độ tin cậy, và bạn sẽ nhận được văn xuôi chứa một con số, và con số đó là bất cứ thứ gì bộ lấy mẫu tạo ra, chứ không phải một softmax trên tập lựa chọn mà bạn đã cung cấp. Nếu một ngưỡng ở hạ nguồn phụ thuộc vào việc con số đó có ý nghĩa gì, thì bạn đang phải xử lý một dự án hiệu chỉnh, chứ không phải một bộ chấm điểm.

Việc câu hỏi của bạn có một tập đóng hay không chính là toàn bộ quyết định.

Đây là bài kiểm tra cần áp dụng trước tiên, và nó mất khoảng mười phút với một chiếc bảng trắng.

• Nếu câu trả lời của bạn được lấy từ một danh sách mà bạn có thể liệt kê trước — một nhãn, một xếp hạng, một có/không, một điểm theo rubric, một tuyến đường — thì Microsoft-Decision-1 là công cụ đúng đắn, còn Gemma 4 12B là một cách lãng phí và kém đáng tin cậy hơn để chọn từ danh sách đó. Bạn sẽ đang trả tiền để một bộ giải mã đoán một con số mà bạn đã giới hạn sẵn.

• Nếu câu trả lời của bạn không phải là một tập hợp đóng — tóm tắt cái này, giải thích cái kia, viết câu trả lời, mô tả biểu đồ — thì Microsoft-Decision-1 không thể giúp được dù với bất kỳ giá nào. Nó không có đường dẫn tới văn xuôi, không có trường lý do, và không có cơ chế nào để tạo ra bất cứ thứ gì mà bạn không liệt kê như một tùy chọn.

• Nếu nó là cả hai, bạn có một pipeline hai mô hình thay vì một lựa chọn, và câu hỏi thiết kế thú vị trở thành mô hình nào sở hữu ngưỡng leo thang. Bộ chấm điểm đặt ra ngưỡng đó; bộ viết điền vào những gì xảy ra ở trên và dưới ngưỡng ấy.

Nơi Gemma 4 12B đơn thuần là một môn thể thao khác

Ngoài cách đóng khung quyết định, Gemma 4 12B không dẫn trước ở một dòng nào — nó đang chơi một trò chơi khác, và giả vờ ngược lại sẽ là không trung thực.

A screenshot of the google/gemma-4-12B-it model card on Hugging Face, showing the Gemma 4 banner, the Hugging Face, GitHub, launch blog, documentation and technical report links, an Apache 2.0 licence, the note that the card covers the Gemma 4 12B Unified model, and the opening paragraphs describing a multimodal family handling text, image, video and audio with a context window of up to 256K tokens and multilingual support in over 140 languages.

• Các phương thức — Microsoft-Decision-1 chỉ nhận đầu vào văn bản và xuất ra số. Gemma 4 12B tiếp nhận văn bản, hình ảnh, âm thanh và video một cách native thông qua thiết kế không dùng encoder, chiếu trực tiếp các patch thô và dạng sóng vào không gian embedding, với đầu vào xen kẽ theo bất kỳ thứ tự nào.

• Ngữ cảnh — 32.768 token cho Microsoft-Decision-1 so với 256.000 cho Gemma 4 12B, vốn đạt 43,4% trên MRCR v2 eight-needle ở 128k trên card của chính Google.

• Ngôn ngữ — 25 ngôn ngữ được hỗ trợ cho Microsoft-Decision-1, với cảnh báo của Microsoft rằng độ bao phủ, chất lượng và độ hiệu chuẩn “có thể thay đổi tùy theo ngôn ngữ” và việc xác định các ngôn ngữ không phải tiếng Anh ít tài nguyên là một điểm yếu; 140+ cho Gemma 4 12B, với chỉ số MMMLU được đánh giá là 83,4 cho kích thước này.

• Hiệu năng đã công bố — tab Benchmarks của Microsoft-Dec-1 có phương pháp luận và không có số liệu; Google có 77,2% MMLU Pro, 77,2% A 2026 không dùng công cụ, 78,8% LiveCodeBench v6, 78,8% GPQA Diamond, 69,1% MMM Pro và 79,7% MATH-Vision cho Gemma 4 12B.

• Cách phân phối — Microsoft-Decision-1 là API được lưu trữ chỉ có trên Foundry, không có trọng số, không thể tải xuống và không có lộ trình tinh chỉnh. Gemma 4 12B là trọng số Apache 2.0 đã ra mắt ngay ngày đầu trong hệ sinh thái gồm LM Studio, Ollama, llama.cpp, MLX, vLLM, SGLang và Unsloth.

• Thời gian chạy — việc chấm điểm quyết định chỉ diễn ra trong một lượt, không có vòng lặp giải mã, nên độ trễ tỉ lệ với prompt chứ không phải với độ dài câu trả lời; Gemma 4 12B sinh từng token một, và tài liệu ra mắt của Google xếp nó ở mức 16 GB VRAM hoặc bộ nhớ hợp nhất.

Dòng benchmark là dòng đáng để dừng lại, theo hướng ít tôn vinh Microsoft nhất. Số liệu của Gemma 4 12B cũng do nhà cung cấp báo cáo — nhưng chúng đã có nhiều tháng được bên thứ ba sử dụng phía sau, trong các bộ đánh giá công khai, trên phần cứng do người khác sở hữu. Sản phẩm tham gia hạng mục này của Microsoft là mới nhất và ít có thể kiểm chứng nhất trong hai, dù đến từ công ty lớn hơn.

Chi phí thực tế để bạn gọi từng cái là bao nhiêu

Gemma 4 12B ở dạng 12B không có trong danh mục của chúng tôi — nếu đó là kích thước bạn muốn, bạn phải tự tải về 11,96 tỷ tham số BF16 và tự vận hành. Điều danh mục của chúng tôi thực sự có là phần còn lại của dòng Gemma 4, và nó không đắt: Gemma 4 26B A4B với $0.06 mỗi triệu token đầu vào và $0.33 mỗi triệu token đầu ra, và Gemma 4 31B với $0.13 và $0.38, cả hai đều được niêm yết với ngữ cảnh 262.144 token. Đó là giá niêm yết của nhà cung cấp được chuyển thẳng qua, không thêm phụ phí từ phía chúng tôi, nằm sau một khóa tương thích OpenAI cùng với hơn 200 mô hình khác. Nếu vấn đề của bạn hóa ra là suy luận tổng quát thay vì một quyết định trong tập đóng, thì một trong hai kích thước đó là lựa chọn rẻ để đo đối chiếu với một bộ tính điểm tự vận hành — và nếu bạn không muốn cam kết với một nhà văn duy nhất, tính năng chuyển đổi dự phòng tự động sẽ giữ cho chặng sinh văn bản của vòng lặp tính điểm tiếp tục hoạt động khi một nhà cung cấp bị suy giảm.

A screenshot of OrcaRouter's own model page for google/gemma-4-31b-it, showing the Google breadcrumb, the model name Gemma 4 31B, a release date of 2026-04-02, the description of it as a 30.78B dense multimodal model with text and image input, a 256K token context window and configurable thinking mode, list pricing of $0.13 per million input tokens and $0.38 per million output tokens, and a P50 time to first token figure.

Microsoft-Decision-1 là một triển khai Foundry do bạn tự thiết lập và nó không khả dụng thông qua chúng tôi. Không có nội dung nào trong bài viết này là tuyên bố về tính khả dụng dành cho nó, ở cả hai phía của lệnh gọi.

Điểm mấu chốt

Microsoft-Decision-1 đã chính thức khả dụng rộng rãi trên Microsoft Foundry vào ngày 8 tháng 10 năm 2026: một bộ chấm điểm chỉ xử lý văn bản, 32.768 token, trên nền Qwen3.5-9B, trả về xác suất đã hiệu chỉnh trên các lựa chọn bạn liệt kê, với không token đầu ra nào, không trọng số và không có số liệu đánh giá chuẩn nào được công bố. Gemma 4 12B là một mô hình đa phương thức đa dụng không dùng bộ mã hóa, 11,96 tỷ tham số, phát hành ngày 3 tháng 6 năm 2026 theo Apache 2.0, có khả năng suy luận, đọc hình ảnh và âm thanh cùng viết câu trả lời trong phạm vi 256.000 token. Hãy chọn theo hình dạng câu trả lời của bạn, không phải theo số lượng tham số: một tập hợp đóng thuộc về bộ chấm điểm, một tập hợp mở thuộc về bộ viết, và việc trả tiền cho một bộ giải mã để chọn từ một danh sách bạn đã viết sẵn là cách phổ biến nhất khiến các nhóm chi gấp mười lần chi phí của một quyết định.

Điều mà danh mục của chúng tôi thực sự cung cấp là phần còn lại của dòng Gemma 4, và nó không đắt: Gemma 4 26B A4B với $0.06 mỗi triệu token đầu vào và $0.33 mỗi triệu token đầu ra, và Gemma 4 31B với $0.13 và $0.38.