
Intern-Decision-2B vs Qwen 3.8: Một Backbone, Hai Công Việc Rất Khác Nhau
- typesafeMỚITypeSafe: Jev 1.132026-09-24$0.04 / $0.00 trên 1 triệu token · 584 tok/s
- openaiMỚIOpenAI: GPT-6 Luna2026-09-2237Trí tuệ
- openaiMỚIOpenAI: GPT-6 Sol2026-09-2248Trí tuệ
- anthropicMỚIAnthropic: Claude Opus 5.52026-09-2258Trí tuệ
- grokMỚIGrok 4.72026-09-2146Trí tuệ
- OrcaMỚIOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 trên 1 triệu token · 187 tok/s
- orcaMỚIOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 trên 1 triệu token · 1306 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Trí tuệ
- openaiOpenAI: GPT-6 Astra2026-09-0453Trí tuệ77Lập trình
- googleGoogle: Gemini 3.8 Flash2026-09-0241Trí tuệ76Lập trình
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Trí tuệ76Lập trình
- anthropicAnthropic: Claude Fable 5.12026-09-0153Trí tuệ82Lập trình
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 trên 1 triệu token · 113 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Trí tuệ72Lập trình
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 trên 1 triệu token · 224 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Trí tuệ75Lập trình
- obsidianQwen3.8 27B2026-08-1534Trí tuệ68Lập trình
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Trí tuệ69Lập trình
- grokSpaceXAI: Grok 4.62026-08-1244Trí tuệ77Lập trình
- metaMeta: Muse Spark 1.22026-08-0540Trí tuệ72Lập trình
Mở cấu hình cho internlm/Intern-Decision-2B và cấu hình cho Qwen/Qwen3.5-2B đặt cạnh nhau và gần như không có gì khác biệt. Cùng 24 lớp, cùng kích thước ẩn 2.048, cùng 8 đầu truy vấn so với 2 đầu khóa-giá trị, cùng kích thước head là 256, cùng giới hạn embedding 262.144 vị trí, cùng từ vựng 248.320 token, cùng tỉ lệ lặp lại ba lớp attention tuyến tính trên một lớp attention đầy đủ. Intern-Decision-2B không phải là một kiến trúc mới. Nó là chính xương sống đó với khả năng tạo văn bản đã bị gỡ bỏ và độ tin cậy đã được hiệu chỉnh — và chính phép trừ đơn lẻ đó là thứ khiến việc so sánh với Qwen3.8-Max, mẫu flagship 2,4 nghìn tỷ tham số mà cả tên họ "Qwen 3.8" nhắc đến ở phân khúc cao nhất, trở nên đáng giá hơn một cuộc đếm ngược tham số.
Hai cái này không phải là đối thủ cạnh tranh và màn so tài này không phải là một cuộc thi. Intern-Decision-2B là một bản fine-tune 2.213.241.664 tham số của Qwen3.5-2B, được tải lên Hugging Face lúc 05:36 UTC ngày 26 tháng 9 năm 2026 cùng với ba phiên bản anh em chưa được công bố, và nó không phát ra token nào: nó nhận một trạng thái cùng các câu hỏi có kiểu, chạy một lượt truyền xuôi nhân quả, đọc logits tại các vị trí giữ chỗ cố định, rồi trả về một phân phối đã hiệu chỉnh cho mỗi trường. Qwen3.8-Max là mô hình chủ lực được lưu trữ của Alibaba, một mô hình hỗn hợp chuyên gia thưa với khoảng 95 tỷ tham số hoạt động trên mỗi token, cửa sổ ngữ cảnh đa phương thức 1 triệu token và giá niêm yết 2,00 USD mỗi triệu token đầu vào và 6,00 USD mỗi triệu token đầu ra. Một cái là một thành phần. Cái còn lại là một dịch vụ. Câu hỏi hữu ích là ranh giới giữa chúng nên nằm ở đâu trong một pipeline mà bạn đang phải trả tiền.
Phép trừ, một cách chính xác
Điều mà tinh chỉnh quyết định đã thay đổi thì đáng được nói chính xác, bởi vì nó làm rõ những gì mô hình cơ sở đã vốn mang sẵn.
Nhiệm vụ được đặt tên trong repository là mô hình hóa ngôn ngữ có mặt nạ tự hồi quy. Đầu vào của trợ lý chứa một bộ khung JSON hoàn chỉnh với một token <decision> cho mỗi trường; các ký hiệu đáp án đúng chỉ xuất hiện trong nhãn, không bao giờ xuất hiện trong đầu vào. Huấn luyện sử dụng căn chỉnh token kế tiếp nhân quả thông thường, trong đó logit ngay trước một dấu đánh dấu dự đoán đáp án của trường đó, và tất cả các trường chia sẻ một lượt truyền xuôi. Khi suy luận, các logit được giới hạn vào các ký hiệu đáp án một token hợp lệ — A–Z, a–z, 0–9, đây là nguồn gốc của mức trần 62 lựa chọn — sau đó được softmax hóa và ánh xạ trở lại nhãn của bạn.
Vậy nên bộ máy token kế tiếp của mô hình cơ sở vẫn nguyên vẹn và không bị sửa đổi. Điều được huấn luyện vào là thiên hướng chiếm một trong số ít vị trí đáp án thay vì tiếp tục một câu, cộng với nhiệt độ riêng cho từng checkpoint là 2.100509348278, được khớp bằng log-likelihood âm trên 1,728 trường hợp hiệu chuẩn được chỉ định, với 1,693 trường hợp được giữ riêng. Thẻ nói rõ rằng việc sinh văn bản không nằm trong phương án: API "thực hiện chấm điểm ứng viên có cấu trúc. Nó không gọi generate() hay lấy mẫu văn bản tự do."
Kho lưu trữ cũng ghi lại những gì mà quá trình tinh chỉnh không đụng tới: nó "tinh chỉnh phần xương sống ngôn ngữ của Qwen3.5 trong khi đóng băng tháp thị giác và bộ chiếu." Phân đoạn thị giác 612,517,440 byte trên bản 2B có cùng số byte như trên checkpoint quyết định 4B, điều này khớp với các thành phần được kế thừa thay vì được huấn luyện. Đường dẫn hình ảnh vẫn hoạt động; đơn giản là nó không phải là thứ mà lượt quyết định đã dành ngân sách cho.

Điều mà 2,2 tỷ tham số không thể làm, và điều mà 2,4 nghìn tỷ tham số làm thay vào đó
Mọi thứ đều được phân chia theo một trục duy nhất: liệu câu trả lời của bạn đã tồn tại sẵn dưới dạng một danh sách hay chưa.
Intern-Decision-2B trả lời một tập đóng. Từ một đến mười sáu câu hỏi, tối đa 62 lựa chọn mỗi câu, tối đa tám hình ảnh, tất cả nằm trong ngân sách 8.192 token mà engine từ chối thay vì cắt bớt. Được trả về dưới dạng xác suất. Với trung bình 33,28 ms mỗi yêu cầu trên một RTX 4090 duy nhất với P95 là 33,55 ms, và không tính phí cho mỗi lần gọi vì không có đầu ra nào để tính phí.
Qwen3.8-Max viết. Ngữ cảnh 1 triệu token, đầu vào văn bản, hình ảnh và video, suy luận với chế độ thinking, gọi công cụ gốc, đầu ra có cấu trúc, tối đa 131.000 token đầu ra trên bản dựng 0902 được ghi ngày. Về nguyên tắc, nó cũng có thể đưa ra quyết định định tuyến giống như Intern-Decision-2B — bạn có thể yêu cầu nó chọn trong số các tùy chọn và trả về JSON. Ba điều sẽ hỏng khi bạn làm vậy. Bạn phải trả tiền cho số token mà nó dùng để quyết định. Bạn nhận được một chuỗi mà việc phân tích cú pháp có thể thành công hoặc không. Và con số bên trong chuỗi đó là bất cứ thứ gì bộ lấy mẫu tạo ra, không phải một softmax mà bạn có thể đặt ngưỡng ở 0,8 rồi hành động dựa trên đó.
Cả hai cách lý giải đều đúng và không cái nào phủ định cái kia. Mô hình chủ lực 2,4 nghìn tỷ tham số tồn tại vì hầu hết các bài toán không phải là tập đóng. Mô hình chấm điểm 2,2 tỷ tham số tồn tại vì tập con vốn là tập đóng xứng đáng có một công cụ rẻ hơn.
Bảng điểm

• Tham số — Intern-Decision-2B 2.213.241.664 ở BF16 cùng với một tháp thị giác và bộ chiếu, khoảng 4,46 GB trên đĩa; Qwen3.8-Max tổng khoảng 2,4 nghìn tỷ với khoảng 95 tỷ tham số hoạt động trên mỗi token, được cung cấp dưới dạng dịch vụ chứ không tải xuống.
• Ngữ cảnh — 8.192 token, bị từ chối ở trên; 1.000.000 token với đầu ra tối đa 131.000 trên bản dựng 0902.
• Đầu ra — xác suất đã hiệu chỉnh và một argmax, không có văn bản được tạo; văn bản được tạo bao gồm dấu vết suy luận.
• Các phương thức đầu vào — văn bản cộng với tối đa tám hình ảnh; văn bản, hình ảnh và video.
• Chi phí — không tính phí theo từng lần gọi, và bạn sở hữu GPU; $2.00 cho mỗi triệu token đầu vào, $6.00 cho mỗi triệu token đầu ra, với lượt đọc bộ nhớ đệm ở mức $0.25 và lượt ghi bộ nhớ đệm ở mức $2.50.
• Bằng chứng đã công bố — một bảng nhà cung cấp gồm bảy bộ kiểm thử, đạt trung bình 84,68, Brier 0,437 và ECE 0,100 trên 10.751 dòng kiểm thử, chưa được bất kỳ ai ngoài InternLM tái lập, trên một checkpoint chỉ có một lượt thích và không có lượt tải xuống; Artificial Analysis Intelligence Index là 45,4 ở hạng 15/145 và AA Coding index là 76,2 ở hạng 9/138, cả hai đều được đo lường độc lập.
• Độ trễ — trung bình 33,28 ms mỗi yêu cầu trên một RTX 4090, giảm dần khi thêm xử lý theo lô; 2,655 giây P50 đến token đầu tiên như danh mục báo cáo, tăng dần khi tải tăng.
Các dòng bằng chứng không tương đương với nhau và không nên được in ra như thể chúng tương đương. Mô hình chủ lực của Alibaba có một điểm chỉ số độc lập làm cơ sở. Checkpoint của InternLM có một bảng do chính các tác giả của nó tạo ra, và đặc biệt, con số hiệu chuẩn nên được hiểu là một ý định đã được tài liệu hóa đầy đủ cho đến khi nó gặp dữ liệu của người khác — càng phải như vậy ở đây, vì kích cỡ cụ thể này có mức lỗi hiệu chuẩn kỳ vọng tệ nhất trong ba phiên bản InternLM đã phát hành, 0,100 so với 0,066 của mô hình có kích cỡ bằng một nửa nó và 0,065 của mô hình có kích cỡ gần gấp đôi nó.
Đường nối, và cách chạy nó
Quy trình hợp lý không phải là lựa chọn giữa hai thứ này mà là sự tách vai: bộ chấm điểm xử lý các quyết định đã được liệt kê, còn mô hình tiên tiến xử lý mọi thứ có câu trả lời không phải là một danh sách. Một quy trình phân loại hỗ trợ định tuyến đến một trong sáu nhóm và đánh giá mức độ khẩn cấp trên thang ba mức không cần 95 tỷ tham số hoạt động; nó cần một xác suất và một ngưỡng. Còn luồng leo thang mà cuối cùng sẽ viết phản hồi cho khách hàng thì cần.
Sự tách bạch đó có một hình thức vận hành. Intern-Decision-2B không có trên OrcaRouter — trang mô hình của chúng tôi dành cho nó trả về 404 và không có route được host nào ở bất cứ đâu chúng tôi có thể tìm thấy — nên nó chạy trên phần cứng của chính bạn, nghĩa là nó là một thành phần do bạn vận hành và giám sát. Qwen3.8-Max là một route: một khóa cho hơn 200 mô hình, giá niêm yết của nhà cung cấp được chuyển tiếp nguyên vẹn, không có markup, nghĩa là khi giá từ nhà cung cấp đối với mô hình flagship thay đổi, thay đổi đó sẽ vào hóa đơn của bạn ngay trong ngày nó được áp dụng. Đặt chặng được host của pipeline phía sau bề mặt duy nhất đó chính là điều giữ cho chặng rẻ hơn được rẻ: bộ chấm điểm giữ lưu lượng cuộc gọi ở mức thấp, và mô hình tiên phong chỉ được dùng đến cho những trường hợp thực sự cần nó.

Nếu bạn vẫn đang cân nhắc xem bộ chấm điểm nào thuộc về vị trí đó — cái này không có đánh giá độc lập, và độ hiệu chuẩn của nó là yếu nhất trong chính họ của nó —chuyển đổi dự phòng tự động xuyên các nhà cung cấp chính là cách để thử nó trong một luồng vốn đã có sẵn một phương án thay thế đang hoạt động phía sau, thay vì thay thế hẳn phương án đó.
Phán quyết trung thực
Nếu vấn đề của bạn là một quyết định trên một tập câu trả lời mà bạn có thể liệt kê, và trạng thái nằm gọn trong tám nghìn token, thì Intern-Decision-2B sẽ làm việc đó trong ba mươi ba mili giây mà không tốn gì cho mỗi lần gọi, và không mô hình tiên tiến nào đánh bại được nó trên trục đó cho dù bạn thuê bao nhiêu tham số. Hãy đưa phép hiệu chỉnh của riêng bạn lên nó trước khi bạn phụ thuộc vào độ tin cậy mà nó báo cáo.
Nếu vấn đề của bạn là bất kỳ điều gì khác — lập luận, ngữ cảnh dài, sử dụng công cụ, video, một tài liệu hàng triệu token, hay đơn giản là một câu trả lời chưa được viết ra — thì Qwen3.8-Max không chỉ tốt hơn. Nó là phương án duy nhất trong hai có thể làm nổi công việc đó.
Và nếu bạn vẫn chưa thể nói được mình đang có cái nào trong hai cái đó, thì câu trả lời có lẽ là bạn có cả hai, trong cùng một pipeline, đó chính là kiến trúc mà số lượng tham số đã âm thầm nói với bạn từ đầu.
