Thẻ tiêu đề hero ghi 'Intern-Decision-0.8B vs Gemma 4 12B' với phụ đề 'Một bên viết ra câu trả lời, bên kia chấm điểm nó', mang các huy hiệu 'Đầu chấm điểm 0.8B, không có token đầu ra' và 'Mô hình đa phương thức tổng quát 11.95B', với logo OrcaRouter được ghép ở góc.
Guides & Insights

Intern-Decision-0.8B so với Gemma 4 12B: Một đầu chấm điểm đối đầu với một mô hình đa phương thức tổng quát

Tác giả

Gideon Frost

Ngày đăng

Mô hình mới nhất · 20Xem tất cả mô hình →
Benchmark: Artificial Analysis · cập nhật hằng ngày
Quay lại tất cả bài viết

Cách rẻ nhất để thấy Intern-Decision-0.8B là gì — và không phải là gì — là đặt nó cạnh Gemma 4 12B, rồi nhận ra rằng sự so sánh gần như hoàn toàn xoay quanh việc mỗi mô hình làm gì với lớp đầu ra của nó. Gemma 4 12B, mô hình đa phương thức không dùng encoder 11,95 tỷ tham số của DeepMind được phát hành ngày 3 tháng 6 năm 2026 theo Apache 2.0, là một mô hình tổng quát sinh tạo: bạn đưa cho nó văn bản, hình ảnh, âm thanh hoặc video, và nó viết ra câu trả lời. Intern-Decision-0.8B, được InternLM âm thầm tải lên Hugging Face vào ngày 26 tháng 9 năm 2026 mà không có thông báo, là một bản fine-tune của Qwen3.5-0.8B nhỏ hơn nhiều, và nó không tạo ra văn bản nào cả — nó nhận một trạng thái, một schema gồm các câu hỏi có tên và tối đa tám hình ảnh, rồi trả về một phân phối xác suất đã hiệu chỉnh cho mỗi câu hỏi sau một lượt lan truyền xuôi. Một cái viết. Cái kia cho điểm. Mọi thứ dưới đây đều suy ra từ đó.

Điều đó khiến đây là một cặp đấu kỳ lạ để đặt vào khung một cuộc thi, và đáng nói thẳng trước các hàng thông số kỹ thuật: hai mô hình này không phải là phương án thay thế cho nhau, và bất kỳ ai lựa chọn giữa chúng đều đã đặt vấn đề sai ngay từ đầu. Gemma 4 12B trả lời câu hỏi "phản hồi nên là gì." Intern-Decision-0.8B trả lời câu hỏi "đây là lựa chọn nào trong mười sáu lựa chọn này, và bạn tự tin đến mức nào" — và trả lời mà không cần vòng lặp bộ giải mã, đó là nguồn gốc của những khác biệt về độ trễ và chi phí. Vì vậy, so sánh hữu ích là về cách bạn sẽ ghép từng mô hình vào một quy trình làm việc, chứ không phải về việc mô hình nào thắng.

Sự khác biệt lớn nhất duy nhất nằm ở phía đầu ra của hóa đơn.

Gemma 4 12B được tính phí như bất kỳ mô hình sinh nào: cả token đầu vào lẫn token đầu ra. Khi bạn yêu cầu nó tạo JSON có cấu trúc, mỗi một token trong số đó đều được sinh ra, lấy mẫu và tính phí, và lược đồ của bạn càng dài, càng lồng nhau thì càng có nhiều token như vậy. Đó không phải là lời chỉ trích mô hình — đó là những gì bộ giải mã làm — mà là khoản mục chi phí mà các decision head tồn tại để loại bỏ. Intern-Decision-0.8B không có token đầu ra. Thẻ mô hình của nó nói rõ lý do: đường suy luận không bao giờ gọi generate(), đọc logits tại các vị trí ngay trước mỗi <decision> placeholder trong một bộ khung được kết xuất trước và lấy softmax chỉ trên các ký hiệu ứng viên được phép cho trường đó. Bộ đếm sử dụng được gọi là output_tokens đếm các trường được tính điểm, không phải văn bản.

Hệ quả cộng dồn theo quy mô. Một pipeline gán nhãn mười nghìn bản ghi bằng Gemma 4 12B phải trả chi phí cho mười nghìn tài liệu JSON; cùng pipeline đó chạy trên Intern-Decision-0.8B chỉ trả chi phí cho các prompt và không gì khác. Việc con số tuyệt đối có lớn hay không phụ thuộc hoàn toàn vào khối lượng và schema của bạn, và bất cứ ai có ngân sách tính theo token đều có thể tính ra bằng một bảng tính trong mười phút. Nhưng hướng đi thì không gây tranh cãi, và đó chính là lý do một nhóm mô hình quyết định nhỏ đã xuất hiện ngay từ đầu.

Độ trễ, và tại sao khoảng cách tham số lại gây hiểu lầm

• Mô hình thông lượng — Intern-Decision-0.8B: một lượt truyền xuôi, không có vòng lặp giải mã. Gemma 4 12B: sinh tự hồi quy, mỗi lần một token.

• Độ trễ đo được — Intern-Decision-0.8B: trung bình 33.98 ms / p95 37.50 ms trên một RTX 4090 duy nhất thông qua đường dẫn Hugging Face cục bộ, theo đo lường của chính InternLM. Gemma 4 12B: không tồn tại con số single-pass tương đương, vì không có single-pass nào để đo.

• Mức chiếm dụng — Intern-Decision-0.8B: khoảng 1,73 GB dung lượng lưu trữ kho, 852.985.920 tham số trải trên một phân đoạn ngôn ngữ 1,50 GB, một phân đoạn thị giác 176 MB và một projector 25 MB. Gemma 4 12B: tài liệu ra mắt của Google cho biết mô hình này cần 16 GB VRAM hoặc bộ nhớ hợp nhất.

• Tính xác định của đầu ra — Intern-Decision-0.8B: argmax trên logits của các ứng viên, nên cùng một đầu vào luôn cho ra cùng một nhãn mỗi lần. Gemma 4 12B: lấy mẫu trừ khi bạn cố định nhiệt độ ở 0, và ngay cả khi đó nhãn vẫn đến dưới dạng văn bản mà bạn phải phân tích.

Khoảng cách tham số 14 lần giữa hai mô hình này không hề chuyển thành khoảng cách thời gian chạy 14 lần trên một tác vụ ra quyết định, bởi vì công việc khác nhau về bản chất. Intern-Decision-0.8B dành lượt chạy duy nhất của mình để đọc prompt — trạng thái, schema, các mô tả lựa chọn — rồi dừng lại. Gemma 4 12B cũng dành lượt đọc prompt đó, nhưng sau đó còn cộng thêm từng token của câu trả lời vào. Với một schema mười sáu trường cùng các nhãn lựa chọn mang tính mô tả, chặng sinh văn bản không phải là một sai số nhỏ; nó chiếm phần lớn thời gian thực tế. Bảng của chính InternLM vô tình cho thấy rõ điều này: phiên bản 2B cùng dòng đạt trung bình 33,28 ms, nhanh hơn một chút so với 33,98 ms của bản 0.8B. Khi việc xử lý prompt chiếm ưu thế, số lượng tham số không còn là đòn bẩy nữa. img src="2.png">

A two-column scoreboard comparing Intern-Decision-0.8B with Gemma 4 12B on six shared rows: parameters 852,985,920 against 11.95B, output tokens none because logits are read rather than generated against every token generated and billed, latency 33.98 ms mean and 37.50 ms p95 against no comparable single-pass figure, input surface text plus up to eight images under an 8,192-token ceiling against text, image, audio and video with a 256K context, published evidence a vendor table unreproduced against Google's own evaluation card, and licence Apache 2.0 plus LICENSE-QWEN against Apache 2.0 under Gemma 4 terms.

Khi mà Gemma 4 12B đơn giản nằm ở một hạng mục khác

Sẽ là không trung thực nếu để bảng thông số kỹ thuật dừng lại ở cách định khung theo tác vụ ra quyết định, bởi vì ngoài cách định khung đó, Gemma 4 12B không chỉ dẫn trước — nó còn đang chơi một môn thể thao khác.

Intern-Decision-0.8B chấp nhận văn bản cùng tối đa tám hình ảnh, và đó là toàn bộ bề mặt đầu vào của nó. Giới hạn đầu vào mặc định của nó là 8.192 token, bị từ chối thay vì bị cắt ngắn, vốn thấp hơn hẳn mức embedding vị trí tối đa 262.144 mà cấu hình của nó quảng cáo — chính giới hạn, chứ không phải kiến trúc, mới là cửa sổ thực tế. Gemma 4 12B tiếp nhận văn bản, hình ảnh, âm thanh và video một cách gốc rễ thông qua thiết kế không dùng encoder, chiếu thẳng các patch thô và dạng sóng vào không gian embedding, giữ cửa sổ ngữ cảnh 256K, và trả về văn bản. Thẻ công bố của Google chấm nó đạt 77,2% trên MMLU Pro, 77,5% trên AIME 2026 không dùng công cụ, 72,0% trên LiveCodeBench v6, 78,8% trên GPQA Diamond, 69,1% trên MMMU Pro và 79,7% trên MATH-Vision. Đó là những số liệu của nhà cung cấp từ chính thẻ đánh giá của Google, và khác với bảng của Intern-Decision-0.8B, chúng đã có một năm sử dụng bởi bên thứ ba đằng sau, bởi vì Gemma 4 ra mắt vào một hệ sinh thái — LM Studio, Ollama, llama.cpp, MLX, vLLM, SGLang, Unsloth — ngay từ ngày đầu tiên.

Các bản phát hành cũng trông chẳng giống nhau chút nào, và sự tương phản này thật đáng chú ý. Gemma 4 12B có một blog ra mắt, một báo cáo kỹ thuật trên arXiv, một trang giới thiệu dòng năm mô hình, một thẻ đánh giá và một liên kết tải xuống ngay ngày nó xuất hiện. Intern-Decision-0.8B chỉ có một thẻ mô hình với URL GitHub trả về 404 và một Space demo trả về 401, và nó xuất hiện trong vòng bốn mươi giây kể từ khi hai mô hình anh em lớn hơn ra mắt, những mô hình cũng không có tài liệu tương tự. Một trong số này là một sản phẩm. Cái còn lại là một checkpoint mà ai đó quyết định đưa lên internet.

Cả hai đều là Apache 2.0, và đó không phải là một điểm chung tầm thường.

Khía cạnh duy nhất mà cả hai thực sự gặp nhau là vấn đề giấy phép, và nó đáng để dành một đoạn văn bởi vì đây chính là nơi quyết định thay đổi đối với người dùng thương mại. Cả hai đều là Apache 2.0. Gemma 4 12B được phát hành theo các điều khoản giấy phép Gemma 4 do Google lưu trữ, mà thẻ mô hình xác định là Apache 2.0; Intern-Decision-0.8B mang Apache-2.0 cùng với một tệp LICENSE-QWEN/ thứ hai, đây là cách xử lý đúng đắn cho một mô hình bắt nguồn từ trọng số Qwen và là dấu hiệu cho thấy InternLM đã làm thủ tục giấy tờ ngay cả cho một bản phát hành mà họ không công bố.

Điều đó phân biệt cả hai với dòng LFM2.5 của Liquid AI, mà LFM Open License v1.0 của họ đặt điều kiện cho các quyền thương mại dựa trên việc pháp nhân của bạn duy trì dưới ngưỡng doanh thu hằng năm 10 triệu USD — một ràng buộc thực sự mà người mua mô hình ra quyết định đang so sánh các lựa chọn nên đọc trước khi cho rằng "trọng số mở" có nghĩa giống nhau ở mọi nơi. Nếu trường hợp sử dụng của bạn là thương mại và doanh thu của bạn vượt qua ranh giới đó, thì Apache 2.0 và giấy phép LFM không thể hoán đổi cho nhau, và cả Gemma 4 12B lẫn Intern-Decision-0.8B đều không mang ràng buộc này.

Bản tổng kết trung thực về số liệu của Intern-Decision-0.8B

Mọi con số hiệu năng của Intern-Decision-0.8B đều do nhà cung cấp tự báo cáo và chưa được tái lập. Đó không phải là chuyện hình thức — mà chính là tình trạng bằng chứng hiện tại, và nó phải quyết định xem bảng số liệu này đáng được đặt bao nhiêu trọng lượng. InternLM tự chọn các benchmark, tự chọn đối thủ để so sánh, tự chạy đánh giá rồi công bố kết quả, và không hề có một lần chạy độc lập nào trên bất kỳ bảng xếp hạng công khai nào. Tra cứu mô hình này trên Artificial Analysis không trả về kết quả nào cả. img src="3.png">

A screenshot of the Hugging Face model card for internlm/Intern-Decision-0.8B, showing the tags image-text-to-text, Transformers, Safetensors, qwen3_5, decision-making, multimodal and conversational, an Apache-2.0 licence, a model size of 0.9B params in F32-BF16, a seven-file repository, and a model tree naming Qwen/Qwen3.5-0.8B-Base as the base model. The card text reads that Intern-Decision-0.8B is 'a multimodal structured decision model fine-tuned from Qwen3.5-0.8B' which 'accepts a shared state, a schema of named questions, and optional images, and returns an answer distribution for every question in one model forward pass', followed by a three-step 'How inference works' list.

Với nhãn đó được gắn vào, hình dạng của kết quả vẫn mang tính thông tin. Mô hình 0.8B đạt 77,35 trên benchmark Typed Decision của TypeSafe, so với 73,35 của Jev 1.13 — mô hình mà benchmark được đặt tên theo — và 94,52 trên ToolACE so với 91,29. Nó đạt trung bình 79,38 trên toàn bộ bộ kiểm thử, với các phiên bản anh em 2B và 4B của chính nó lần lượt ở mức 84,68 và 90,02. Cột đáng khiến người mua phải dừng lại là WildJailBreak, nơi nó đạt 64,48 so với 96,29 của Jev: một khoảng cách về độ bền từ chối lớn đến vậy là một đặc tính của quá trình fine-tune, và liệu nó đến từ nền tảng Qwen3.5-0.8B, từ mục tiêu tinh chỉnh quyết định hay từ số lượng tham số thì không được ghi lại ở bất kỳ đâu. Hồ sơ hiệu chuẩn của nó mới là phần đáng đọc hơn — Brier 0,530 và sai số hiệu chuẩn kỳ vọng 0,066, so với 0,358 và 0,095 của Jev — nghĩa là nó kém chính xác hơn về tổng thể nhưng các mức độ tự tin mà nó đưa ra bám sát độ chính xác của nó hơn. Với một quy trình dựa trên ngưỡng, sự khác biệt đó quan trọng hơn độ chính xác thô, và đó là kiểu điều mà InternLM không có động lực nào để công bố.

Đối lại, thẻ đánh giá của Gemma 4 12B cũng do nhà cung cấp báo cáo — Google cũng đã chạy những benchmark đó — nhưng nó đã có mặt từ tháng Sáu, đã được triển khai qua mọi runtime cục bộ lớn, và bất kỳ sai lệch nào cũng hẳn đã lộ ra. Khoảng cách về bằng chứng giữa “không được tái tạo trong một tuần” và “không được tái tạo trong bốn tháng và không ai phản bác nó” mới là khác biệt thực sự giữa hai cột này.

Bạn thực sự sẽ kết hợp chúng như thế nào

Mô hình hợp lý không phải là một lựa chọn. Một đầu quyết định xử lý các lệnh gọi có cấu trúc — định tuyến, sàng lọc, phân loại, chấm điểm theo rubric — nơi tập đáp án đóng, độ trễ quan trọng và token đầu ra hoàn toàn là chi phí phụ trội. Một mô hình tổng quát xử lý mọi thứ cần văn xuôi, mã, tổng hợp hoặc ngữ cảnh dài: bản tóm tắt leo thang, lời giải thích vì sao ticket được chuyển đến bộ phận thanh toán, bản nháp để con người chỉnh sửa.

Nếu bạn đang cân nhắc ranh giới nằm ở đâu, thí nghiệm rẻ nhất là đặt cả hai nửa phía sau một endpoint. OrcaRouter định tuyến hơn 200 mô hình qua một API tương thích OpenAI duy nhất, với chuyển đổi dự phòng tự động và giá niêm yết của nhà cung cấp được chuyển nguyên không thêm phụ phí, nghĩa là việc thử một mô hình quyết định chạy trên dịch vụ lẫn một mô hình tổng quát chạy trên dịch vụ trong cùng một script chỉ tốn một khóa API và một buổi chiều. Đáng để nói chính xác về một ranh giới ở đây: Intern-Decision-0.8B không phải là mô hình của chúng tôi — đó là một checkpoint Apache-2.0 mà bạn tự tải về và chạy, và lý do toàn bộ để chọn một mô hình 1,73 GB là nó nằm ngay nơi dữ liệu của bạn đã ở đó. Nửa sinh tạo của mẫu này là phần chỉ cách một dòng lệnh. Còn riêng Gemma 4 12B, nó cũng không có trong danh mục của chúng tôi; các kích thước Gemma 4 mà chúng tôi định tuyến là 31B và 26B A4B, còn bản 12B là tải về cục bộ. img src="4.png">

A screenshot of the OrcaRouter model page for typesafe/jev-1.13, dated 2026-09-24, showing a 65K token context, text input and text output, a P95 time to first token of 170 ms, and list pricing of $0.042 per million input tokens with no output rate. The description reads that Jev is TypeSafe's structured decision and evaluation model, taking a state and a set of named questions (noul, choice, score) and returning a structured answer for each, served non-streaming via POST /v1/systemone. A performance panel lower down reports a P50 time to first token of 178 ms and an output speed of 569 tokens per second.

Vậy thì, phán quyết không phải là một người thắng cuộc. Intern-Decision-0.8B là một đầu tính điểm rẻ, nhanh, mang tính tất định từ một phòng thí nghiệm vẫn chưa giải thích về nó, với một bảng điểm chuẩn mà không ai có và một cột độ bền vững trước từ chối cần được kiểm tra trước khi nó tiếp cận đầu vào không đáng tin cậy. Gemma 4 12B là một mô hình tổng quát đa phương thức trọng số mở trưởng thành với một thẻ đã công bố, một báo cáo kỹ thuật và số tham số gấp mười bốn lần, và nó là công cụ sai cho một cuộc gọi phân loại mười sáu trường — không phải vì nó tệ hơn, mà vì việc tạo ra câu trả lời cho một câu hỏi mà tập câu trả lời bạn đã viết sẵn là một cách tốn kém để có được một nhãn.

So sánh trong bài viết này1

Phát hiện từ bài viết này · Benchmark: Artificial Analysis · cập nhật hằng ngày