
Intern-Decision-0.8B so với Qwen 3.8: 853 triệu tham số và một tập câu trả lời đóng
- typesafeMỚITypeSafe: Jev 1.132026-09-24$0.04 / $0.00 trên 1 triệu token · 592 tok/s
- openaiMỚIOpenAI: GPT-6 Luna2026-09-2237Trí tuệ
- openaiMỚIOpenAI: GPT-6 Sol2026-09-2248Trí tuệ
- anthropicMỚIAnthropic: Claude Opus 5.52026-09-2258Trí tuệ
- grokMỚIGrok 4.72026-09-2146Trí tuệ
- OrcaMỚIOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 trên 1 triệu token · 187 tok/s
- orcaMỚIOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 trên 1 triệu token · 1306 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Trí tuệ
- openaiOpenAI: GPT-6 Astra2026-09-0453Trí tuệ77Lập trình
- googleGoogle: Gemini 3.8 Flash2026-09-0241Trí tuệ76Lập trình
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Trí tuệ76Lập trình
- anthropicAnthropic: Claude Fable 5.12026-09-0153Trí tuệ82Lập trình
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 trên 1 triệu token · 113 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Trí tuệ72Lập trình
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 trên 1 triệu token · 224 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Trí tuệ75Lập trình
- obsidianQwen3.8 27B2026-08-1534Trí tuệ68Lập trình
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Trí tuệ69Lập trình
- grokSpaceXAI: Grok 4.62026-08-1244Trí tuệ77Lập trình
- metaMeta: Muse Spark 1.22026-08-0540Trí tuệ72Lập trình
Intern-Decision-0.8B là mô hình nhỏ nhất trong ba mô hình quyết định mà InternLM đã đưa lên Hugging Face vào sáng ngày 26 tháng 9 năm 2026, và nó không phải là mô hình nhanh nhất trong số đó. Đó là điều đầu tiên đáng biết. Theo chính các phép đo của phòng thí nghiệm, người anh em 2B chạy nhanh hơn một chút — 33,28 ms so với 33,98 ms — và đạt điểm cao hơn sáu điểm trên cùng mức trung bình bảy bộ kiểm thử, vì vậy lý do thông thường để tìm đến một checkpoint dưới một tỷ tham số, tức tốc độ thô, không áp dụng ở đây. Điều áp dụng là kích thước: 852.985.920 tham số, 1,71 GB trọng số bf16, đủ nhỏ để thường trú trong phần lề của một cỗ máy đang có việc khác để làm. Đặt điều đó bên cạnh Qwen3.8-Max — bản được cung cấp dưới dạng dịch vụ hosted của lõi mixture-of-experts thưa 2,4 nghìn tỷ tham số mà nhà cung cấp đã công bố hồi tháng 8, với giá 2,00 USD và 6,00 USD mỗi triệu token — và cả hai không cạnh tranh cho cùng một công việc. Một mô hình trả về phân phối xác suất trên các lựa chọn bạn đã cung cấp trước. Mô hình kia viết.
Câu trả lời ngắn gọn: Intern-Decision-0.8B đáng để sở hữu nếu bạn cần một quyết định tập đóng được chấm điểm trên phần cứng bạn đã có, và nếu 1,71 GB thay vì 4,43 GB là khác biệt giữa việc phát hành và không phát hành. Nó không đáng để sở hữu nếu bạn muốn bộ chấm điểm nhỏ chính xác nhất mà InternLM phát hành trong tuần này — đó là bản 4B — hoặc nếu câu trả lời của bạn chưa được liệt kê sẵn trong prompt, trong trường hợp đó cả hai cái này đều không phải công cụ phù hợp và Qwen 3.8 là cái duy nhất trong cặp có thể làm được việc đó.
Những gì kho lưu trữ nói, và những gì không gì khác làm được
Hãy bắt đầu với bằng chứng, vì có rất ít bằng chứng. InternLM không đưa ra thông báo nào cho mô hình này. Không có bài đăng ra mắt, không có bài báo, không có mô tả kho lưu trữ. Thẻ Hugging Face liên kết tới một Space demo và một kho lưu trữ GitHub, và tại thời điểm viết bài, Space trả về 401 còn liên kết GitHub trả về 404 — hai nơi mà thẻ chỉ bạn đến để biết thêm thông tin đều đã đóng. Ba checkpoint xuất hiện cách nhau trong vòng bốn mươi giây vào khoảng 05:36 UTC ngày 26 tháng 9: Intern-Decision-0.8B, Intern-Decision-2B và Intern-Decision-4B, tất cả đều mang cùng các tag — ra quyết định, đa phương thức, dự đoán có cấu trúc — và tất cả đều là bản fine-tune của các checkpoint Qwen, trong trường hợp này là Qwen3.5-0.8B.
Những gì có thể biết được từ kho mã là chính xác đến mức bất thường đối với một bản phát hành chưa được công bố, bởi vì phòng thí nghiệm đã phát hành mô-đun suy luận của riêng mình song song với các trọng số. Mô hình 0.8B tải thông qua một tệp 16 KB inference.py trong thư mục mô hình, yêu cầu Python 3.12 trở lên và torch 2.9.1 cùng transformers 5.14.1, và cung cấp một lớp DecisionEngine mà bạn khởi tạo một lần rồi tái sử dụng. Một dict Python vào, một dict phản hồi ra. Những gì không thể biết được: liệu đây là một bản phát hành hoàn chỉnh hay một đợt đẩy sớm, liệu một endpoint được lưu trữ có sắp ra mắt hay không, và liệu hai checkpoint mà nó nằm giữa có phải là cùng một sản phẩm ở các kích cỡ khác nhau hay là ba sản phẩm khác nhau tình cờ dùng chung một cái tên. Không ai bên ngoài InternLM đã chạy bất kỳ cái nào trong số chúng.

Vấn đề anh chị em: 2B nhanh hơn và tốt hơn
Đây là phần trong bảng do chính InternLM công bố khiến 0.8B khó được xếp loại. Đọc ba kích cỡ theo cùng bảy bộ kiểm thử:
• Tốc độ — 0.8B: trung bình 33.98 ms, trung vị 33.44 ms, 37.50 ms tại p95. 2B: 33.28 ms, 33.15 ms, 33.55 ms. 4B: 44.16 ms, 44.03 ms, 44.60 ms. Tất cả đều được đo cho mỗi truy vấn trên một RTX 4090 duy nhất thông qua đường dẫn Hugging Face cục bộ.
• Trung bình trên bảy bộ — 0,8B: 79,38. 2B: 84,68. 4B: 90,02.
• Hiệu chuẩn — 0.8B: Brier 0.530, ECE 0.066. 2B: Brier 0.437, ECE 0.100. 4B: Brier 0.347, ECE 0.065.
• Dung lượng chiếm trên đĩa ở bf16 — 0.8B: 1.71 GB. 2B: 4.43 GB. 4B: 9.08 GB.
2B nhanh hơn ở mức trung bình, siết chặt hơn đáng kể ở phần đuôi, và chính xác hơn, tất cả cùng lúc. Vậy nên “nhỏ hơn tức là nhanh hơn” là sai trong cả dòng này — sai theo hai nghĩa, vì 4B còn chậm hơn cả hai. Trục duy nhất mà 0.8B thắng tuyệt đối là trục không ai benchmark: 1.71 GB so với 4.43 GB của 2B và 9.08 GB của 4B. Nếu bạn đang đặt một scorer trong ngân sách bộ nhớ cố định — một chiếc máy nhỏ luôn bật, một GPU dùng chung, một node biên với một mô hình ngôn ngữ đã chiếm phần lớn card — thì đó là toàn bộ lý lẽ, và đó là một lý lẽ thực sự.
Phần còn lại của bảng là một nghiên cứu về việc các mô hình nhỏ suy giảm không đồng đều ở những điểm nào. Điểm Typed Decision của mô hình 0.8B là 77.35 so với 80.55 của mô hình 4B — cách nhau ba điểm dù chỉ bằng một phần năm số lượng tham số. Nhưng Jevbench-Original tụt từ 98.61 xuống 80.56 và WildJailBreak sụp từ 89.86 xuống 64.48. Bất kể hai bộ đánh giá đó đang đo lường điều gì — thẻ mô hình không nói, và thẻ cũng không đưa ra định nghĩa nào về các bộ đánh giá — thì chúng chính là những bộ trừng phạt checkpoint nhỏ nhất nặng nề nhất. Một mô hình trụ vững trên một trục và rơi xuống vực trên hai trục khác không phải là một mô hình yếu đi một cách đồng đều. Đó là một mô hình có ranh giới năng lực cụ thể, và bạn sẽ muốn biết khối lượng công việc của mình nằm ở đâu trước khi cam kết đưa cả đội hình vào dùng nó.
Một lưu ý nữa về hàng hiệu chuẩn. ECE 0,066 của 0.8B là con số tốt nhất của nó — tốt hơn 0,095 của Jev trên cùng bộ đánh giá — trong khi điểm Brier 0,530 của nó lại tệ hơn 0,358 của Jev. Lỗi đã hiệu chuẩn và sai số bình phương trung bình của xác suất không phải cùng một phép đo, và một bảng cho thấy cái này có vẻ mạnh còn cái kia có vẻ yếu đang nói với bạn rằng phân phối có dạng tốt gần các đỉnh độ tin cậy và dày hơn mức nên có ở khoảng giữa. Nếu hệ thống của bạn đặt ngưỡng theo độ tin cậy, sự khác biệt đó quan trọng hơn mức trung bình.
1.71 GB thực sự mua được gì
Đường suy luận trong mô hình này là một bộ chấm điểm, không phải một bộ sinh, và sự khác biệt về chi phí mang tính cấu trúc chứ không phải gia tăng. Bạn đưa cho nó một trạng thái chia sẻ, một lược đồ các câu hỏi có tên, và tùy chọn tối đa tám hình ảnh. Mỗi câu hỏi thuộc một trong ba loại: lựa chọn (một trong một tập tùy chọn có thứ tự), điểm (một thang đo thứ bậc, được trả về dưới dạng giá trị kỳ vọng có trọng số xác suất), hoặc noul (nhị phân không/có). Trạng thái, lược đồ và một bộ khung JSON trợ lý hoàn chỉnh được kết xuất với một placeholder cho mỗi trường, mô hình chạy một lượt truyền xuôi nhân quả duy nhất, và các logit được đọc tại vị trí ngay trước mỗi placeholder. Phép softmax chỉ được thực hiện trên các ký hiệu ứng viên được phép của trường đó, hiệu chuẩn đã khớp của checkpoint được áp dụng, các ký hiệu ánh xạ trở lại các giá trị tùy chọn của bạn.
Ba hệ quả rút ra từ đó. Không có token đầu ra và do đó không có giá đầu ra — một triệu quyết định không tốn gì về token. Không có vòng lặp giải mã và không có dấu ngoặc nhọn nào để quên, nên JSON sai định dạng không phải là một dạng lỗi. Và vì không gian câu trả lời của mỗi trường được tập hợp theo từng yêu cầu, một lược đồ bạn nghĩ ra chiều nay không cần huấn luyện lại: thêm một câu hỏi và các lựa chọn của nó trở thành ký hiệu ứng viên cho trường đó.
Các giới hạn cũng được nêu rõ ràng y như vậy. Từ một đến mười sáu câu hỏi, tối đa 62 lựa chọn mỗi câu, tối đa tám hình ảnh, và mức trần mặc định 8.192 token — với đầu vào vượt quá ngưỡng đó bị từ chối thay vì bị cắt ngắn. Mệnh đề cuối cùng đó là một quyết định thiết kế đáng để suy ngẫm, bởi vì việc cắt ngắn âm thầm chính là cách một bộ phân loại lặng lẽ bắt đầu trả lời một câu hỏi khác với câu hỏi bạn đã đặt ra. Thay vào đó, InternLM thất bại một cách ồn ào, điều này là đúng đắn nhưng cũng là một cái bẫy vận hành: một chuỗi ticket dài cộng với một schema cộng với hình ảnh sẽ vượt qua 8.192 nhanh hơn bạn tưởng, và không có lối thoát êm ái nào khi điều đó xảy ra.
Và 1,71 GB mang lại bài toán kinh tế thời gian chạy mà bạn có thể nhân ra. Với 33,98 ms mỗi quyết định, một triệu quyết định tương đương 9,44 giờ trên một chiếc RTX 4090. Bản 4B cần 12,3 giờ cho cùng một triệu, và đánh đổi mười điểm rưỡi độ chính xác để lấy 7,37 GB mà bạn không có. Không con số nào bao gồm chi phí của chiếc máy, và không con số nào bao gồm phần mà người ta hay quên: bạn đang vận hành một dịch vụ, và không có máy chủ nào trong kho chứa.

Qwen 3.8 không phải là một mô hình duy nhất, và điểm đáng chú ý chính là phân khúc giá rẻ
Qwen 3.8, xét riêng như một cái tên, chính là Qwen3.8-2.4T-A95B: lõi sparse mixture-of-experts 2,4 nghìn tỷ tham số mà Alibaba công bố dưới dạng trọng số mở vào ngày 12 tháng 8 năm 2026, với khoảng 95 tỷ tham số hoạt động trên mỗi token và một giấy phép tùy chỉnh thay vì Apache 2.0. Bản phân phối qua dịch vụ của chính lõi đó là Qwen3.8-Max, được cung cấp rộng rãi trên một API tính phí kể từ ngày 3 tháng 8 và được làm mới thành bản snapshot gắn ngày 2 tháng 9. Chúng là một bộ não được bán theo hai cách, và bản phân phối thứ hai chính là bản mà hầu hết mọi người sẽ thực sự gọi tới.
Dựa trên các số liệu độc lập, Artificial Analysis đo bản snapshot tháng Chín của Qwen3.8-Max ở Chỉ số Trí tuệ 45.4 — đứng thứ mười lăm trong số 145 mô hình được xếp hạng — với điểm AA Coding là 76.2, xếp thứ chín trong số 138, GPQA Diamond đạt 92.8, Humanity's Last Exam đạt 43.1 và điểm nhớ ngữ cảnh dài là 80.3. Checkpoint mở kém hơn API mà nó được chưng cất từ đó ở mức 39.9. Trên cửa sổ playground bảy ngày của riêng chúng tôi, Qwen3.8-Max nằm ở p50 là 2,578 ms và p95 là 9,539 ms ở tốc độ 55.5 token đầu ra mỗi giây, với tỷ lệ lỗi 1.57%. Qwen3.8-Max có thể gọi trên OrcaRouter tại giá niêm yết của nhà cung cấp với 0% markup được cộng thêm, vì vậy thay đổi giá của Alibaba sẽ có hiệu lực ở phía chúng tôi ngay trong cùng ngày thay vì vào kỳ thanh toán tiếp theo.
Phiên bản dense cùng dòng mới là thứ đáng để cân đo với một checkpoint cục bộ 1,71 GB, bởi vì đó là cách rẻ nhất để mua năng lực tổng quát trong dòng họ này. Qwen3.8-27B dùng Apache 2.0, mang ngữ cảnh gốc 262.144 token, và Qwen3.8-27B có giá $0,33 và $2,40 mỗi triệu token trên danh mục của chúng tôi. Chỉ số Trí tuệ Artificial Analysis của nó là 33,7. Nó có số lượng tham số gấp khoảng ba mươi hai lần Intern-Decision-0.8B, vẫn mang tính tạo sinh, và vẫn là công cụ sai lầm cho một quyết định tập đóng ở quy mô lớn — nhưng nó là lựa chọn trung dung trung thực, và là thành viên duy nhất trong so sánh này vừa thực sự rẻ vừa thực sự tổng quát cùng một lúc.
Bộ chấm điểm đối đầu với bộ sinh, nói một cách đơn giản
• Ngữ cảnh — Qwen3.8-Max có cửa sổ 1,000,000 token. Intern-Decision-0.8B từ chối mọi thứ vượt quá 8,192. Hệ số 122, được thực thi thay vì bị cắt ngắn.
• Đầu vào — Qwen3.8-Max nhận văn bản, hình ảnh và video. Intern-Decision-0.8B nhận văn bản và tối đa tám hình ảnh, và các token hình ảnh được tính vào cùng ngân sách 8.192.
• Đầu ra — Qwen3.8-Max viết, suy luận, gọi công cụ và phát JSON theo yêu cầu. Intern-Decision-0.8B không thể tạo ra một đoạn văn, một lý lẽ hay một kế hoạch. Nó chỉ có thể chấm điểm những lựa chọn mà bạn đã nghĩ ra để liệt kê.
• Chi phí mỗi cuộc gọi — một cuộc gọi phân loại thực tế với 800 token đầu vào và 150 token đầu ra tốn khoảng 0,0025 USD trên Qwen3.8-Max, trước cả token suy luận, và phần đầu ra của nó được ước tính lạc quan là nhỏ vì đây là một mô hình suy luận. Một triệu cuộc gọi như vậy tốn khoảng 2.500 USD. Intern-Decision-0.8B hoàn toàn không có giá token: một triệu quyết định tương đương 9,44 giờ chạy một chiếc 4090 mà bạn sở hữu hoặc thuê.
• Độ trễ — 2.578 ms trên Qwen3.8-Max trong bảy ngày qua, bao gồm cả mạng và xếp hàng. 33,98 ms của Intern-Decision-0.8B là một lượt forward pass thuần trên card cục bộ và không phải cùng một phép đo; so sánh trung thực là một bậc độ lớn, không phải gấp tám mươi lần.
• Bằng chứng — mọi con số của Intern-Decision-0.8B ở đây đều do nhà cung cấp tự báo cáo trên chính các harness của InternLM và không được ai tái lập, kể cả độ trễ. Mọi con số của Qwen 3.8 hoặc là do chính Alibaba công bố, hoặc là kết quả đo của Artificial Analysis, và chúng được dán nhãn riêng ở phía trên.
• Điểm số độc lập — Qwen3.8-Max có một điểm như vậy. Intern-Decision-0.8B không có bất kỳ loại nào, và không có nhà cung cấp suy luận nào triển khai nó.

Hai cách để chạy pipeline này
Ngã rẽ vận hành gay gắt hơn ngã rẽ benchmark. Intern-Decision-0.8B là một mô-đun, không phải một dịch vụ. Không có endpoint tương thích OpenAI, không có máy chủ xử lý theo lô, không có kiểm tra tình trạng, không có chính sách thử lại và không có bản sao thứ hai trừ khi bạn tự xây dựng. Nó tải trong một tiến trình và trả lời từng dict một, và nếu bạn cần chuyển đổi dự phòng thì bạn chính là cơ chế chuyển đổi dự phòng. Đó là một mô tả công bằng về một checkpoint nghiên cứu 853 triệu tham số được xuất bản mà không có ghi chú ra mắt, và nó cần được tính vào quyết định một cách tương xứng.
Nửa tạo sinh của cùng pipeline đó là một lời gọi mạng, và lời gọi mạng chính là việc mà bộ định tuyến sinh ra để xử lý. Cả {{1}}Qwen3.8-Max{{/1}} và {{2}}Qwen3.8-27B{{/2}} đều có thể truy cập được phía sau một khóa tương thích OpenAI, và cơ chế chuyển đổi dự phòng tự động nghĩa là một upstream bị suy giảm sẽ không trở thành sự cố của bạn — điều này đáng để nhắc ở đây vì tỷ lệ lỗi trực tiếp trong bảy ngày của Qwen3.8-Max ở phía chúng tôi là 1,57%, con số này thấp cho đến khi nó rơi đúng vào yêu cầu của bạn. Mô hình hợp lý là mô hình mà sự kết hợp này đã âm thầm mô tả: chạy bộ chấm điểm tập đóng rẻ tiền ngay tại chỗ vì nó nhanh và không tốn gì cho mỗi lời gọi, còn định tuyến bước suy luận vì đó mới là nơi giá cả cắt giảm, mô hình thay đổi và các sự cố ngừng dịch vụ thực sự xảy ra.
Hai điều chúng tôi sẽ không tuyên bố. Intern-Decision-0.8B không phải là một trong các tuyến của chúng tôi và sẽ không phải như vậy cho đến khi InternLM lưu trữ nó ở đâu đó — chúng tôi sẽ không ám chỉ điều ngược lại. Và hiện nay chúng tôi không lưu trữ mô hình InternLM nào cả, nên không có gì trong bài viết này là lời chào mời chạy đối tượng đó qua chúng tôi.
Điều gì sẽ làm thay đổi câu trả lời
Ba câu hỏi mở, tất cả đều có thể được trả lời trong vài ngày. Liệu InternLM có công bố kho GitHub mà thẻ mô hình của chính nó liên kết tới, và kèm theo đó là mô tả về cách các trọng số này được tinh chỉnh không? Liệu một bài đăng ra mắt có theo sau các checkpoint, biến một lần đẩy âm thầm thành một bản phát hành được ghi chép đầy đủ với một câu chuyện triển khai được nêu rõ không? Và liệu có ai độc lập tái tạo được mức trung bình 79.38 hay sai số hiệu chuẩn 0.066 trên phần cứng không phải của InternLM không?
Cho đến khi một trong những điều đó thành hiện thực, cách hiểu trung thực về Intern-Decision-0.8B là hẹp và cụ thể: nó là bộ chấm điểm closed-set rẻ nhất trong một họ gồm ba mô hình, với dung lượng vừa vặn ở nơi mà người anh em nhanh hơn và chính xác hơn của chính nó không phù hợp, được công bố không kèm thông báo và không có tài liệu duy nhất có thể cho bạn biết nó được tinh chỉnh để làm gì. Nếu quyết định của bạn là closed-set, các câu trả lời của bạn có thể liệt kê được trong một prompt, và 1,71 GB là con số mà triển khai của bạn thực sự phụ thuộc vào, thì nó là lựa chọn đúng đắn và không có gì khác giống nó ở kích thước đó. Nếu câu trả lời của bạn không thể liệt kê trước, hoặc trạng thái của bạn vượt quá 8.192 token, hoặc bạn cần một lý giải có thể cho con người xem, thì cuộc so sánh chưa bao giờ sát nút — và mô hình bạn muốn chưa bao giờ là mô hình 853 triệu tham số.
So sánh trong bài viết này1
Phát hiện từ bài viết này · Benchmark: Artificial Analysis · cập nhật hằng ngày
