
Intern-Decision-2B so với Gemma 4 12B: Giới hạn 8.192 token đối đầu với cửa sổ 256K
- typesafeMỚITypeSafe: Jev 1.132026-09-24$0.04 / $0.00 trên 1 triệu token · 584 tok/s
- openaiMỚIOpenAI: GPT-6 Luna2026-09-2237Trí tuệ
- openaiMỚIOpenAI: GPT-6 Sol2026-09-2248Trí tuệ
- anthropicMỚIAnthropic: Claude Opus 5.52026-09-2258Trí tuệ
- grokMỚIGrok 4.72026-09-2146Trí tuệ
- OrcaMỚIOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 trên 1 triệu token · 187 tok/s
- orcaMỚIOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 trên 1 triệu token · 1306 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Trí tuệ
- openaiOpenAI: GPT-6 Astra2026-09-0453Trí tuệ77Lập trình
- googleGoogle: Gemini 3.8 Flash2026-09-0241Trí tuệ76Lập trình
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Trí tuệ76Lập trình
- anthropicAnthropic: Claude Fable 5.12026-09-0153Trí tuệ82Lập trình
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 trên 1 triệu token · 113 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Trí tuệ72Lập trình
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 trên 1 triệu token · 224 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Trí tuệ75Lập trình
- obsidianQwen3.8 27B2026-08-1534Trí tuệ68Lập trình
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Trí tuệ69Lập trình
- grokSpaceXAI: Grok 4.62026-08-1244Trí tuệ77Lập trình
- metaMeta: Muse Spark 1.22026-08-0540Trí tuệ72Lập trình
Giả sử thứ bạn cần được đánh giá là một hồ sơ yêu cầu bảo hiểm dài bốn mươi trang. internlm/Intern-Decision-2Bsẽ từ chối nó. Không phải cắt bớt, không phải tóm tắt — mà từ chối thẳng, bởi vì công cụ suy luận đi kèm khai báo DecisionEngine(max_length=8192) và thẻ mô hình nói rõ ràng rằng các đầu vào quá khổ sẽ "bị loại bỏ mà không cắt bớt". google/gemma-4-12B-it— Gemma 4 12B Unified — sẽ nhận cùng tài liệu đó, cộng thêm những bức ảnh quét được ghim kèm, cộng thêm bản ghi âm cuộc gọi, rồi viết cho bạn một câu trả lời. Sự tương phản đó chính là toàn bộ phép so sánh, và nó gần như chẳng liên quan gì đến số lượng tham số — 2.213.241.664 so với 11.959.730.224 — con số mà cách đọc bảng thông số kỹ thuật sẽ đặt lên hàng đầu.
Intern-Decision-2B là checkpoint quyết định ở giữa trong ba checkpoint mà InternLM đã tải lên Hugging Face vào ngày 26 tháng 9 năm 2026 mà không có thông báo, được tinh chỉnh từ Qwen/Qwen3.5-2B và được cấp phép theo Apache-2.0 với các điều khoản Qwen được giữ nguyên song song. Gemma 4 12B Unified là mô hình đa phương thức không dùng encoder của Google DeepMind từ tháng 5 năm 2026, một hệ thống any-to-any nhận văn bản, hình ảnh, âm thanh và video rồi tạo văn bản trong cửa sổ 256.000 token bằng hơn 140 ngôn ngữ. Một trong số này là một mô hình chấm điểm. Cái còn lại là một mô hình tổng quát mà tình cờ có thể chấm điểm kém nếu bạn nhắc nó thật cẩn thận. Việc quyết định chọn giữa chúng không hẳn là một câu hỏi về benchmark mà là câu hỏi về hình dạng mà câu trả lời của bạn vốn đã có.
Khi mà hai đối tượng này thực sự không thể so sánh với nhau
Điều này đáng được nói thẳng trước khi bàn đến các con số, bởi vì cuộc đối đầu này gợi ra một sự đối xứng giả tạo.
Intern-Decision-2B không tạo ra token nào. Nó nhận một trạng thái, từ một đến mười sáu câu hỏi được đặt tên với tối đa 62 lựa chọn mỗi câu, và tùy chọn tối đa tám hình ảnh; dựng một khung JSON trợ lý với một placeholder <decision> cho mỗi trường; chạy một lượt truyền xuôi nhân quả duy nhất; đọc logits tại vị trí ngay trước mỗi placeholder; áp dụng softmax chỉ trên các ký hiệu hợp lệ của trường đó; và áp dụng nhiệt độ đã hiệu chỉnh là 2.100509348278. Đầu ra là một phân phối đã hiệu chỉnh và một argmax cho mỗi trường. Thẻ mô hình nêu thẳng điều phủ định: "API này thực hiện chấm điểm ứng viên có cấu trúc. Nó không gọi generate() hay lấy mẫu văn bản tự do."
Gemma 4 12B sinh văn bản. Mọi thứ nó làm — suy luận với chế độ thinking có thể cấu hình, gọi hàm, OCR, hiểu biểu đồ, nhận dạng giọng nói, hỗ trợ 140 ngôn ngữ — đều chạy qua một vòng lặp giải mã trên bộ từ vựng gồm 262.144 mục. Hãy yêu cầu nó đưa ra một quyết định định tuyến kèm xác suất, bạn sẽ nhận được văn xuôi có chứa một con số, và con số đó sẽ là bất cứ thứ gì mà bộ lấy mẫu tạo ra, chứ không phải một softmax trên tập lựa chọn của bạn.
Vậy nên câu hỏi thực tế không phải là "cái nào chính xác hơn." Mà là "câu trả lời của tôi đã là một tập đóng chưa?" Nếu rồi, thì 12B là một cách lãng phí để chọn từ một danh sách. Nếu chưa, Intern-Decision-2B hoàn toàn không thể giúp bạn ở bất kỳ mức độ chính xác nào.
Trần đầu vào là ranh giới sắc nét nhất giữa chúng.
Đây là khía cạnh cần được cân nhắc trên hết mọi khía cạnh khác, vì nó tạo ra những lỗi cứng thay vì những lỗi suy giảm.
• Độ dài đầu vào — Intern-Decision-2B chấp nhận 8,192 token và từ chối mọi thứ dài hơn, một cách ồn ào; Gemma 4 12B chấp nhận 256,000 token và, trên chính thẻ thông số của Google, đạt 43.4% trên MRCR v2 eight-needle ở 128k.
• Hình ảnh — tối đa tám ảnh đối với Intern-Decision-2B, và chúng được tính vào cùng ngân sách 8.192 token; tỷ lệ khung hình và độ phân giải thay đổi đối với Gemma 4 12B, với đầu vào văn bản và hình ảnh xen kẽ theo bất kỳ thứ tự nào.
• Các phương thức đầu vào — văn bản và hình ảnh ở một bên; văn bản, hình ảnh, âm thanh và video ở bên kia.
• Ngôn ngữ — không có tuyên bố đa ngôn ngữ nào được đưa ra ở bất kỳ đâu trong tài liệu Intern-Decision; Gemma 4 hỗ trợ hơn 140 ngôn ngữ được huấn luyện trước với điểm đa ngôn ngữ được đánh giá là 83.4 trên MMMLU đối với bản 12B.
• Đầu ra — phân phối câu trả lời JSON được định kiểu cho một cái; văn bản được tạo cho cái còn lại.
Giới hạn 8,192 không phải là tùy tiện, và chính điều đó khiến nó khó lách qua. Mục tiêu quyết định đọc một logit tại một vị trí cố định cho mỗi trường, nên prompt phải chứa trạng thái, schema và toàn bộ khung xương trong một lượt; không có chiến lược chia nhỏ nào giữ được hợp đồng. Một ticket, một email, một trạng thái JSON ngắn, một hai ảnh chụp màn hình — đó là tâm điểm thiết kế. Một tài liệu cần truy xuất là tài liệu mà mô hình này không dành cho.
Mỗi thứ khiến bạn tốn bao nhiêu, thành thật mà tính.
Intern-Decision-2B không có endpoint được host và không có nhà cung cấp. Trang model của OrcaRouter dành cho nó trả về lỗi 404, và không có nội dung nào trong bài viết này là tuyên bố về tính khả dụng. Gọi nó đồng nghĩa với việc tải xuống khoảng 4,46 GB repository — một shard ngôn ngữ 3,76 GB, một vision tower 612,5 MB, một projector 50,3 MB — và chạy inference.py bên cạnh các trọng số trong môi trường Python 3.12 với torch 2.9.1 và transformers 5.14.1, trên một GPU mà bạn đang trả tiền dù nó có đang chấm điểm các quyết định hay không.
Đó không phải là một bất lợi trong mọi trường hợp, và phép tính này đáng để làm hơn là chỉ giả định. Với trung bình 33,28 ms mỗi yêu cầu trên một RTX 4090 duy nhất, theo đo lường của chính InternLM, một Intern-Decision-2B chạy cục bộ không tính phí gì cho mỗi quyết định. Một mô hình tổng quát chạy trên dịch vụ lưu trữ tính phí theo token, kể cả những token nó dùng để suy nghĩ trước khi trả lời. Ở quy mô lớn, một bộ chấm điểm bạn đã sở hữu là công cụ rẻ hơn — chi phí nằm ở GPU và công sức kỹ thuật, không phải ở lệnh gọi.
Gemma 4 12B Unified cũng không có trong danh mục của chúng tôi; nếu bạn muốn nó, bạn tải 11,96 tỷ tham số BF16 về và tự vận hành. Chỗ mà danh mục của chúng tôi thực sự có các tuyến Gemma 4 là hai kích thước còn lại, và chúng rẻ: Gemma 4 26B A4B ở mức $0,06 mỗi triệu token đầu vào và $0,33 mỗi triệu token đầu ra, còn Gemma 4 31B ở mức $0,13 và $0,38, cả hai đều được niêm yết với ngữ cảnh 262.144 token và thời gian tới token đầu tiên P50 mà danh mục hiển thị là 1,73 giây. Nếu vấn đề của bạn hóa ra là suy luận tổng quát thay vì một quyết định trong tập đóng, thì đó là thứ để so sánh với một bộ chấm điểm vận hành cục bộ — thêm hai mô hình nữa chỉ với một khóa, giá niêm yết của nhà cung cấp được chuyển tiếp nguyên vẹn, không cộng thêm, và tự động chuyển đổi dự phòng để một mô hình mà bạn vẫn đang đánh giá không bao giờ trở thành điểm lỗi duy nhất trong một đường dẫn production.

Bảng điểm, kèm theo những lưu ý
• Tham số — Intern-Decision-2B 2.213.241.664 ở BF16 cùng với một tháp thị giác và bộ chiếu; Gemma 4 12B Unified 11.959.730.224 ở BF16.
• Ngữ cảnh — 8.192 token, bị từ chối ở trên, so với 256.000 token.
• Đầu ra — xác suất đã hiệu chỉnh và một argmax, không có văn bản; văn bản được sinh, từng token một.
• Phương thức — văn bản cộng tối đa tám hình ảnh, so với đầu vào gồm văn bản, hình ảnh, âm thanh và video, đầu ra là văn bản.
• Bằng chứng đã công bố — một bảng nhà cung cấp gồm bảy bộ kiểm thử đạt trung bình 84,68 với điểm Brier 0,437 và ECE 0,100, không được bất kỳ ai bên ngoài phòng thí nghiệm tái tạo; một thẻ đánh giá của Google với MMLU Pro 77,2%, GPQA Diamond 78,8%, AIME 2026 không dùng công cụ 77,5% và LiveCodeBench v6 72,0, cùng một danh sách độc lập trên Artificial Analysis Intelligence Index ở mức 14,2.
• Mức độ chấp nhận — một lượt thích và không có lượt tải xuống nào trên checkpoint 2B, so với một dòng mô hình đã lưu hành từ tháng 5 với các bản lượng tử hóa, tinh chỉnh và phái sinh có số lượng lên tới hàng trăm.
Hãy đọc các dòng bằng chứng một cách bất đối xứng, vì chúng vốn là như vậy. Các con số của Google đã được bên thứ ba lập chỉ mục và tái lập một cách độc lập; còn các con số của InternLM thì chưa từng được bất kỳ ai ngoài phòng thí nghiệm chạy lại, và đặc biệt con số hiệu chuẩn nên được coi là một ý định đã được ghi chép đầy đủ cho tới khi nó gặp một tập kiểm thử từ bên ngoài. Tóm tắt trung thực không phải là bảng của nhà cung cấp sai. Mà là hai cột đó không mang cùng trọng lượng bằng chứng, và một so sánh in 84.68 bên cạnh 77.2 mà không nói rõ điều đó đang gây hiểu lầm cho người đọc.

Làm gì với cái này
Chọn Intern-Decision-2B khi quyết định đã thực sự ngã ngũ, trạng thái nằm gọn gàng thoải mái trong tám nghìn token, bạn muốn một xác suất có thể đặt ngưỡng thay vì một đoạn văn phải phân tích, và bạn có phần cứng lẫn sự sẵn lòng để vận hành một checkpoint chưa được ai hỗ trợ. Kích cỡ trung bình đặc biệt mang mức hiệu chuẩn được công bố yếu nhất trong ba mô hình mà InternLM phát hành — ECE 0.100 so với 0.066 ở mô hình có kích cỡ bằng một nửa nó và 0.065 ở mô hình gần gấp đôi nó — nên nếu bạn đang chọn trong họ này, 2B chính là mô hình để bạn tự khớp temperature cho riêng mình, chứ không phải mô hình để tin dùng ngay từ đầu.
Chọn Gemma 4 12B — hay thực tế hơn, một trong hai kích cỡ Gemma 4 mà chúng tôi thực sự định tuyến — khi đầu vào dài hơn một trang, khi có liên quan đến âm thanh hoặc video hoặc một ngôn ngữ không phải tiếng Anh, khi câu trả lời phải được giải thích thay vì chỉ được chọn, hoặc khi bạn không muốn tự vận hành ngăn xếp suy luận. 12B là mô hình nhỏ nhất trong các mô hình Gemma 4 có âm thanh gốc; 26B A4B kích hoạt khoảng bốn tỷ tham số mỗi token và là cách rẻ nhất để bước vào dòng mô hình này.
Và nếu thứ bạn thực sự có là một vấn đề chấm điểm gắn liền với một tài liệu dài, thì cả hai công cụ này đều không phải là lựa chọn đúng: đó là một vấn đề truy xuất đội lốt một bài viết so sánh.

