
Microsoft-Decision-1 vs Gemma 4 12B: Một bên chọn từ danh sách của bạn, một bên viết cho bạn một danh sách mới
- OrcaMỚIOrca: OrcaCyber Zero 1.52026-10-10$3.00 / $7.50 trên 1 triệu token · 69 tok/s
- openaiMỚIOpenAI: GPT-6.1 Sol2026-09-2952Trí tuệ
- anthropicMỚIAnthropic: Claude Sonnet 5.52026-09-2856Trí tuệ
- typesafeTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 trên 1 triệu token · 120 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238Trí tuệ
- OpenAIOpenAI: GPT-6 Sol2026-09-2248Trí tuệ
- AnthropicAnthropic: Claude Opus 5.52026-09-2258Trí tuệ
- xAIGrok 4.72026-09-2146Trí tuệ
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 trên 1 triệu token · 52 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 trên 1 triệu token · 423 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Trí tuệ
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Trí tuệ77Lập trình
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Trí tuệ76Lập trình
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Trí tuệ76Lập trình
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Trí tuệ82Lập trình
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 trên 1 triệu token · 60 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 trên 1 triệu token · 367 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Trí tuệ72Lập trình
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 trên 1 triệu token · 231 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Trí tuệ75Lập trình
Đặt Microsoft-Decision-1 và Gemma 4 12Bcạnh nhau, và điều quyết định tất cả khác biệt không phải là kích thước, độ chính xác hay giấy phép — mà là những gì diễn ra sau khi mô hình đã đọc đầu vào của bạn. Gemma 4 12B, mô hình đa phương thức không dùng encoder với 11,96 tỷ tham số của DeepMind, ra mắt ngày 3 tháng 6 năm 2026 theo giấy phép Apache 2.0, đọc văn bản, hình ảnh, âm thanh hoặc video rồi viết cho bạn câu trả lời, từng token một, trong cửa sổ 256.000 token và hơn 140 ngôn ngữ. Microsoft-Decision-1 được phát hành chính thức trên Microsoft Foundry vào ngày 8 tháng 10 năm 2026 dưới dạng một mô hình chấm điểm chỉ dùng văn bản, được huấn luyện hậu kỳ trên Qwen3.5-9B: bạn đưa cho nó một trạng thái và một câu hỏi mà bạn đã liệt kê sẵn các câu trả lời, và nó trả về một xác suất đã hiệu chỉnh cho từng lựa chọn chỉ trong một lượt chạy duy nhất trên tối đa 32.768 token, mà không sinh ra gì cả. Một mô hình cho bạn biết lựa chọn nào của bạn là đúng. Mô hình kia cho bạn biết lẽ ra các lựa chọn phải là gì — và tính tiền cho bạn từng chữ một.
Việc đóng khung đây như một cuộc thi sẽ là một lỗi phạm trù, và đáng nói điều đó trước các dòng đặc tả hơn là sau chúng. Hai thứ này không phải là vật thay thế cho nhau; chúng nằm ở hai đầu đối lập của một quy trình làm việc. Câu hỏi hữu ích là bạn thực sự đang xây dựng đầu nào, vì câu trả lời quyết định việc bạn đang mua một giám khảo hay một người viết.
Hóa đơn là nơi sự khác biệt không còn mang tính triết lý nữa.
Gemma 4 12B được tính phí theo cách mọi mô hình tạo sinh đều được tính: token đầu vào và token đầu ra, cả hai. Khi bạn yêu cầu nó tạo JSON có cấu trúc, mọi ký tự của JSON đó đều được sinh ra, lấy mẫu và phải trả tiền — và schema của bạn càng lồng sâu bao nhiêu, câu trả lời càng dài và khoản mục đó càng lớn bấy nhiêu. Đó không phải là lỗi của mô hình. Đó là điều mà một bộ giải mã làm, và chính xác là khoản mục mà những người ra quyết định tồn tại để xóa bỏ.
Microsoft-Decision-1 không có phía đầu ra để tính phí. Nó chạy một lượt truyền xuôi duy nhất qua trạng thái, câu hỏi và tập lựa chọn của bạn, đọc điểm số cho từng ứng viên, rồi trả về. Hệ quả tích tụ theo khối lượng chứ không theo kích thước prompt: một pipeline dán nhãn mười nghìn bản ghi bằng Gemma 4 12B tạo ra mười nghìn tài liệu JSON, còn cùng pipeline đó chạy trên một bộ chấm điểm quyết định thì tạo ra mười nghìn prompt và không gì khác. Khoản tiết kiệm tuyệt đối có lớn hay không phụ thuộc hoàn toàn vào khối lượng của bạn và độ cồng kềnh của schema, và bất kỳ ai có ngân sách theo token đều có thể giải quyết điều đó bằng một bảng tính. Chiều hướng thì không có gì phải tranh cãi.
Có một sự bất đối xứng thứ hai, nhỏ hơn: Microsoft không công bố mức giá trên trang mô hình Microsoft-Decision-1. Liên kết định giá dẫn đến trang định giá của chính Microsoft, vì vậy chi phí cho mỗi quyết định là thứ bạn đọc từ Azure chứ không phải từ thẻ. Điều mà trang này xác lập là 0% của lệnh gọi là token đầu ra, và suy luận theo lô bị vô hiệu hóa — bạn không thể phân bổ chi phí cho một lần chấm điểm hàng loạt thông qua kênh hàng loạt như bạn làm với mô hình sinh.

Cùng một đầu vào, hai kết quả khác nhau
Đưa cho cả hai mô hình một phiếu hỗ trợ khách hàng và một câu hỏi. Microsoft-Decision-1 trả về đại loại như 0,83 cho “thanh toán”, 0,11 cho “kỹ thuật”, 0,04 cho “hủy dịch vụ”, 0,02 cho “không thể xác định”. Bạn có một nhãn có thể đặt tên, một con số để đối chiếu ngưỡng, và một lối thoát để không đưa ra quyết định — Microsoft ghi rằng một tùy chọn kiểu “không thể xác định” được hỗ trợ khi bằng chứng được cung cấp không đủ, và chính điều đó khiến logic chuyển cấp hoạt động. Điều bạn không nhận được là lý do.
Giao ticket cho Gemma 4 12B và bạn nhận được một đoạn văn. Nó có thể suy luận về yêu cầu với khả năng tư duy có thể cấu hình, gọi hàm, đọc hóa đơn quét được đính kèm vào ticket, chuyển thư thoại được ghim kèm theo đó thành văn bản, và trả lời bằng chính ngôn ngữ của khách hàng. Mỗi một trong những việc đó đều là điều mà Decision-1 không thể làm ở bất kỳ mức độ chính xác nào: bề mặt đầu vào của nó chỉ là văn bản và không gì khác, và nó rõ ràng không được thiết kế cho việc hỏi đáp mở, hội thoại, dịch thuật hay tóm tắt.
Không có đầu ra nào của Gemma 4 12B là một xác suất. Hãy yêu cầu nó đưa ra quyết định định tuyến kèm độ tin cậy, và bạn sẽ nhận được văn xuôi chứa một con số, và con số đó là bất cứ thứ gì bộ lấy mẫu tạo ra, chứ không phải một softmax trên tập lựa chọn mà bạn đã cung cấp. Nếu một ngưỡng ở hạ nguồn phụ thuộc vào việc con số đó có ý nghĩa gì, thì bạn đang phải xử lý một dự án hiệu chỉnh, chứ không phải một bộ chấm điểm.
Việc câu hỏi của bạn có một tập đóng hay không chính là toàn bộ quyết định.
Đây là bài kiểm tra cần áp dụng trước tiên, và nó mất khoảng mười phút với một chiếc bảng trắng.
• Nếu câu trả lời của bạn được lấy từ một danh sách mà bạn có thể liệt kê trước — một nhãn, một xếp hạng, một có/không, một điểm theo rubric, một tuyến đường — thì Microsoft-Decision-1 là công cụ đúng đắn, còn Gemma 4 12B là một cách lãng phí và kém đáng tin cậy hơn để chọn từ danh sách đó. Bạn sẽ đang trả tiền để một bộ giải mã đoán một con số mà bạn đã giới hạn sẵn.
• Nếu câu trả lời của bạn không phải là một tập hợp đóng — tóm tắt cái này, giải thích cái kia, viết câu trả lời, mô tả biểu đồ — thì Microsoft-Decision-1 không thể giúp được dù với bất kỳ giá nào. Nó không có đường dẫn tới văn xuôi, không có trường lý do, và không có cơ chế nào để tạo ra bất cứ thứ gì mà bạn không liệt kê như một tùy chọn.
• Nếu nó là cả hai, bạn có một pipeline hai mô hình thay vì một lựa chọn, và câu hỏi thiết kế thú vị trở thành mô hình nào sở hữu ngưỡng leo thang. Bộ chấm điểm đặt ra ngưỡng đó; bộ viết điền vào những gì xảy ra ở trên và dưới ngưỡng ấy.
Nơi Gemma 4 12B đơn thuần là một môn thể thao khác
Ngoài cách đóng khung quyết định, Gemma 4 12B không dẫn trước ở một dòng nào — nó đang chơi một trò chơi khác, và giả vờ ngược lại sẽ là không trung thực.

• Các phương thức — Microsoft-Decision-1 chỉ nhận đầu vào văn bản và xuất ra số. Gemma 4 12B tiếp nhận văn bản, hình ảnh, âm thanh và video một cách native thông qua thiết kế không dùng encoder, chiếu trực tiếp các patch thô và dạng sóng vào không gian embedding, với đầu vào xen kẽ theo bất kỳ thứ tự nào.
• Ngữ cảnh — 32.768 token cho Microsoft-Decision-1 so với 256.000 cho Gemma 4 12B, vốn đạt 43,4% trên MRCR v2 eight-needle ở 128k trên card của chính Google.
• Ngôn ngữ — 25 ngôn ngữ được hỗ trợ cho Microsoft-Decision-1, với cảnh báo của Microsoft rằng độ bao phủ, chất lượng và độ hiệu chuẩn “có thể thay đổi tùy theo ngôn ngữ” và việc xác định các ngôn ngữ không phải tiếng Anh ít tài nguyên là một điểm yếu; 140+ cho Gemma 4 12B, với chỉ số MMMLU được đánh giá là 83,4 cho kích thước này.
• Hiệu năng đã công bố — tab Benchmarks của Microsoft-Dec-1 có phương pháp luận và không có số liệu; Google có 77,2% MMLU Pro, 77,2% A 2026 không dùng công cụ, 78,8% LiveCodeBench v6, 78,8% GPQA Diamond, 69,1% MMM Pro và 79,7% MATH-Vision cho Gemma 4 12B.
• Cách phân phối — Microsoft-Decision-1 là API được lưu trữ chỉ có trên Foundry, không có trọng số, không thể tải xuống và không có lộ trình tinh chỉnh. Gemma 4 12B là trọng số Apache 2.0 đã ra mắt ngay ngày đầu trong hệ sinh thái gồm LM Studio, Ollama, llama.cpp, MLX, vLLM, SGLang và Unsloth.
• Thời gian chạy — việc chấm điểm quyết định chỉ diễn ra trong một lượt, không có vòng lặp giải mã, nên độ trễ tỉ lệ với prompt chứ không phải với độ dài câu trả lời; Gemma 4 12B sinh từng token một, và tài liệu ra mắt của Google xếp nó ở mức 16 GB VRAM hoặc bộ nhớ hợp nhất.
Dòng benchmark là dòng đáng để dừng lại, theo hướng ít tôn vinh Microsoft nhất. Số liệu của Gemma 4 12B cũng do nhà cung cấp báo cáo — nhưng chúng đã có nhiều tháng được bên thứ ba sử dụng phía sau, trong các bộ đánh giá công khai, trên phần cứng do người khác sở hữu. Sản phẩm tham gia hạng mục này của Microsoft là mới nhất và ít có thể kiểm chứng nhất trong hai, dù đến từ công ty lớn hơn.
Chi phí thực tế để bạn gọi từng cái là bao nhiêu
Gemma 4 12B ở dạng 12B không có trong danh mục của chúng tôi — nếu đó là kích thước bạn muốn, bạn phải tự tải về 11,96 tỷ tham số BF16 và tự vận hành. Điều danh mục của chúng tôi thực sự có là phần còn lại của dòng Gemma 4, và nó không đắt: Gemma 4 26B A4B với $0.06 mỗi triệu token đầu vào và $0.33 mỗi triệu token đầu ra, và Gemma 4 31B với $0.13 và $0.38, cả hai đều được niêm yết với ngữ cảnh 262.144 token. Đó là giá niêm yết của nhà cung cấp được chuyển thẳng qua, không thêm phụ phí từ phía chúng tôi, nằm sau một khóa tương thích OpenAI cùng với hơn 200 mô hình khác. Nếu vấn đề của bạn hóa ra là suy luận tổng quát thay vì một quyết định trong tập đóng, thì một trong hai kích thước đó là lựa chọn rẻ để đo đối chiếu với một bộ tính điểm tự vận hành — và nếu bạn không muốn cam kết với một nhà văn duy nhất, tính năng chuyển đổi dự phòng tự động sẽ giữ cho chặng sinh văn bản của vòng lặp tính điểm tiếp tục hoạt động khi một nhà cung cấp bị suy giảm.

Microsoft-Decision-1 là một triển khai Foundry do bạn tự thiết lập và nó không khả dụng thông qua chúng tôi. Không có nội dung nào trong bài viết này là tuyên bố về tính khả dụng dành cho nó, ở cả hai phía của lệnh gọi.
Điểm mấu chốt
Microsoft-Decision-1 đã chính thức khả dụng rộng rãi trên Microsoft Foundry vào ngày 8 tháng 10 năm 2026: một bộ chấm điểm chỉ xử lý văn bản, 32.768 token, trên nền Qwen3.5-9B, trả về xác suất đã hiệu chỉnh trên các lựa chọn bạn liệt kê, với không token đầu ra nào, không trọng số và không có số liệu đánh giá chuẩn nào được công bố. Gemma 4 12B là một mô hình đa phương thức đa dụng không dùng bộ mã hóa, 11,96 tỷ tham số, phát hành ngày 3 tháng 6 năm 2026 theo Apache 2.0, có khả năng suy luận, đọc hình ảnh và âm thanh cùng viết câu trả lời trong phạm vi 256.000 token. Hãy chọn theo hình dạng câu trả lời của bạn, không phải theo số lượng tham số: một tập hợp đóng thuộc về bộ chấm điểm, một tập hợp mở thuộc về bộ viết, và việc trả tiền cho một bộ giải mã để chọn từ một danh sách bạn đã viết sẵn là cách phổ biến nhất khiến các nhóm chi gấp mười lần chi phí của một quyết định.
Điều mà danh mục của chúng tôi thực sự cung cấp là phần còn lại của dòng Gemma 4, và nó không đắt: Gemma 4 26B A4B với $0.06 mỗi triệu token đầu vào và $0.33 mỗi triệu token đầu ra, và Gemma 4 31B với $0.13 và $0.38.
