Một thẻ tiêu đề cho bài viết so sánh có nội dung Intern-Decision-4B so với Qwen 3.8, với phụ đề Một lượt truyền xuôi 44 mili-giây đối đầu với 2,4 nghìn tỷ tham số, cùng ba biểu tượng đường nét phẳng gợi ý một bộ chấm điểm nhỏ nhanh, một mô hình suy luận lớn và một so sánh chi phí.
Engineering & Research

Intern-Decision-4B vs Qwen 3.8: Một lượt truyền xuôi 44 mili giây đối đầu với 2,4 nghìn tỷ tham số

Tác giả

Alistair Wren

Ngày đăng

Mô hình mới nhất · 20Xem tất cả mô hình →
Benchmark: Artificial Analysis · cập nhật hằng ngày
Quay lại tất cả bài viết

InternLM đã công bố Intern-Decision-4B trên Hugging Face vào sáng ngày 26 tháng 9 năm 2026 — không có bài đăng ra mắt, không có mục blog, một liên kết GitHub trên chính model card của nó trả về 404 và một demo Space trả về 401. Các trọng số là thật và có thể tải xuống; còn thông báo thì không có ở đó. Và mô hình bên dưới chúng là một bản fine-tune của Qwen3.5-4B, chính điều đó khiến việc so sánh với mô hình flagship được host trở nên đáng giá hơn cả một bảng thông số. Hai mô hình này không phải đối thủ. Chúng là hai đầu của một pipeline, và toàn bộ câu hỏi là ranh giới giữa chúng nằm ở đâu. Lõi nền tảng là mô hình 2,4 nghìn tỷ tham số mà nhà cung cấp đã công bố vào tháng 8 và hiện được phục vụ dưới tên Qwen3.8-Max, với giá 2,00 đô la và 6,00 đô la mỗi triệu token; Intern-Decision-4B là bản tái dựng 4,54 tỷ tham số của mô hình nền tảng bảy tháng tuổi đó, không phát ra token nào cả, trả lời tối đa mười sáu câu hỏi có kiểu trong một lượt lan truyền xuôi, và không tốn phí mỗi lần gọi vì không có đầu ra để tính tiền.

Câu trả lời một dòng: nếu tác vụ của bạn là một quyết định với tập câu trả lời đóng, Intern-Decision-4B nhanh hơn khoảng năm mươi lần cho mỗi quyết định và rẻ hơn về mặt cấu trúc, và không mô hình tiên tiến nhất nào sẽ đánh bại được nó trên trục hẹp đó. Nếu tác vụ của bạn là bất cứ thứ gì khác — suy luận, ngữ cảnh dài, sử dụng công cụ, bất cứ thứ gì mà câu trả lời chưa được liệt kê sẵn trong lời nhắc của bạn — thì Qwen 3.8 không chỉ tốt hơn, mà còn là mô hình duy nhất trong hai mô hình có thể làm được việc đó. Mọi thứ dưới đây là về việc tìm chính xác ranh giới đó.

Điều gì thực sự được xác nhận, và điều gì không

Hãy bắt đầu với bằng chứng, vì cách đặt vấn đề rất quan trọng. Không có thông báo nào từ nhà cung cấp cho Intern-Decision-4B. Không có thông cáo báo chí, không có bài báo, không có mô tả kho lưu trữ nào để đọc. Thứ tồn tại hôm nay là một kho Hugging Face được công bố vào sáng nay, nằm dưới tổ chức internlm — Intern Large Models, nhóm của Phòng thí nghiệm AI Thượng Hải — mang giấy phép Apache 2.0 cùng giấy phép Qwen thượng nguồn được giữ nguyên bên cạnh với tên LICENSE-QWEN. Hai checkpoint anh em xuất hiện cách nhau trong vòng bốn mươi giây: Intern-Decision-0.8B với 853 triệu tham số và Intern-Decision-2B với 2,21 tỷ. Cả ba đều mang cùng các thẻ — ra quyết định, đa phương thức, dự đoán có cấu trúc — và cả ba đều nằm trong một bộ sưu tập mô hình vẫn chưa thể truy cập công khai.

Điều chưa được xác nhận: liệu đây là bản phát hành hoàn chỉnh hay một đợt push sớm. Kho lưu trữ được tạo lúc 05:36 UTC và được sửa đổi lần nữa trước 08:00 UTC cùng ngày, và hoạt động công khai tiếp theo trên các checkpoint anh em vẫn tiếp diễn sau 09:00. InternLM chưa nói câu chuyện triển khai dự kiến là gì, chưa công bố kho lưu trữ mà nó liên kết tới, và chưa cho biết liệu có một endpoint được host sắp ra mắt hay không. Hãy coi mọi số liệu benchmark trong bài viết này là do nhà cung cấp báo cáo và chưa được tái lập — bởi vì tính đến thời điểm viết bài này, thực sự chưa có bất kỳ nội dung nào khác được viết về mô hình này ở bất cứ đâu. Ba hướng tìm kiếm riêng biệt đều không trả về kết quả nào về cái tên này.

Screenshot of the Hugging Face model card for internlm/Intern-Decision-4B, showing the internlm organization, the image-text-to-text and transformers tags, 5B params, and the model card opening line describing a multimodal structured decision model fine-tuned from Qwen3.5-4B.

Can cược kiến trúc: một bộ chấm điểm, chứ không phải một bộ sinh

Câu quan trọng nhất trong tài liệu của chính Intern-Decision-4B là một điều phủ định: đường suy luận "không gọi generate() hoặc lấy mẫu văn bản tự do." Đó không phải là một chi tiết triển khai, mà là toàn bộ thiết kế, và chính nó là điều tách biệt thứ này khỏi việc gọi Qwen3.8-Max với một lược đồ JSON và hy vọng dấu ngoặc nhọn đóng lại.

Đây là cơ chế, như thẻ mô tả. Bạn đưa cho mô hình một trạng thái chia sẻ, một lược đồ các câu hỏi có tên, và tùy chọn tối đa tám hình ảnh. Mỗi câu hỏi thuộc một trong ba loại: lựa chọn (chọn một trong một tập tùy chọn có thứ tự), điểm (đánh giá trên thang thứ bậc, được trả về dưới dạng giá trị kỳ vọng có trọng số xác suất), hoặc noul (nhị phân không/có). Lời nhắc hệ thống, trạng thái, lược đồ và một khung JSON trợ lý hoàn chỉnh được kết xuất với một placeholder cho mỗi trường. Sau đó — và đây là mẹo — mô hình chạy một lượt truyền xuôi nhân quả, và các logit được đọc tại vị trí ngay trước mỗi placeholder. Một softmax được thực hiện chỉ trên các ký hiệu ứng viên được phép của trường đó, hiệu chuẩn của checkpoint được áp dụng, và các ký hiệu được ánh xạ trở lại các giá trị tùy chọn ban đầu của bạn.

Hậu quả rất cụ thể. Bởi vì không gian trả lời của mỗi trường được lắp ghép theo từng yêu cầu thay vì được gắn cứng vào một đầu từ vựng, một lược đồ bạn nghĩ ra vào chiều nay không cần huấn luyện lại — thêm một câu hỏi, các lựa chọn trở thành ký hiệu ứng viên cho trường đó. Bởi vì không có vòng lặp giải mã, nên không có token đầu ra, không có dấu ngoặc nào để quên, và không có logic thử lại quanh JSON hỏng định dạng. Và bởi vì tất cả câu hỏi đều được tính điểm từ cùng một lần đọc trạng thái, mười sáu câu hỏi chỉ tốn một lượt lan truyền xuôi, không phải mười sáu.

Các giới hạn cũng cụ thể không kém, và thẻ này nêu rõ chúng mà không hề úp mở. Từ một đến mười sáu câu hỏi, tối đa 62 lựa chọn mỗi câu hỏi, tối đa tám hình ảnh. Mặc định tối đa 8.192 token — và những đầu vào vượt quá ngưỡng đó sẽ bị từ chối mà không cắt bớt. Mệnh đề cuối cùng ấy là một quyết định thiết kế đáng để suy ngẫm: cắt bớt âm thầm chính là cách một bộ phân loại lặng lẽ bắt đầu trả lời một câu hỏi khác với câu hỏi bạn đã đặt, và InternLM đã chọn cách thất bại thật ồn ào thay vì như vậy. Đó là lựa chọn đúng đắn, nhưng nó cũng là một cái bẫy vận hành, bởi vì một chuỗi ticket dài cộng với một schema cộng với hình ảnh sẽ vượt qua mốc 8.192 nhanh hơn bạn tưởng và không có đường thoát êm ái nào — bạn sẽ nhận được lỗi.

Ở những điểm mà Intern-Decision-4B giành chiến thắng, và không hề sát nút

Hai trục, và cả hai đều mang tính cấu trúc chứ không phải chỉ là gia tăng.

• Độ trễ cho mỗi quyết định — trung bình 44,16 ms, trung vị 44,03 ms, 44,60 ms ở p95, được đo trên một RTX 4090 duy nhất thông qua đường dẫn Hugging Face cục bộ. So với Qwen3.8-Max, với cửa sổ bảy ngày trực tiếp trên playground của chính chúng tôi cho thấy p50 là 2.474 ms và p95 là 9.789 ms ở tốc độ 55,4 token đầu ra mỗi giây. Đó là khoảng 56× ở trung vị, và đây không hẳn là một phép so sánh bất công bằng mà đúng hơn là so sánh giữa hai thao tác khác nhau: một mô hình phân loại, mô hình kia suy luận rồi mới viết. Khoảng cách đó là thật, và lý do dẫn đến nó cũng vậy.

• Chi phí cho mỗi quyết định — và đây là phép toán, không phải ý kiến. Lấy một lượt gọi phân loại hỗ trợ thực tế: 800 token đầu vào gồm trạng thái và schema, và 150 token đầu ra gồm JSON có cấu trúc. Trên Qwen3.8-Max, con số đó là 800 × $2.00/M cộng 150 × $6.00/M, tức khoảng $0.0025 mỗi quyết định, trước cả một token suy luận nào — và Qwen3.8-Max là một mô hình suy luận, nên phía đầu ra được ước tính lạc quan là nhỏ. Một triệu quyết định tốn khoảng $2,500. Cùng một triệu quyết định đó trên Intern-Decision-4B tốn 0 token và khoảng 12.3 giờ thời gian RTX 4090. Intern-Decision-4B không có giá đầu ra vì nó không có đầu ra.

Sự đánh đổi này thẳng thắn và hiển nhiên: mô hình 4B cần một GPU mà bạn sở hữu hoặc thuê, nó chiếm dụng GPU đó, và nó chỉ có thể làm đúng một việc. Nhưng nếu một việc đó là việc mà sản phẩm của bạn thực hiện hàng triệu lần mỗi ngày, thì phép tính ở trên chính là toàn bộ luận cứ kinh doanh, và không mức năng lực nào của mô hình tiên phong có thể thay đổi điều đó.

Con số mà Qwen 3.8 không công bố: hiệu chuẩn

Đây là yếu tố khác biệt thầm lặng, và là điều mà hầu hết các so sánh sẽ bỏ sót vì nó không giống một phép đánh giá chuẩn.

Intern-Decision-4B trả về một phân phối trên các giá trị lựa chọn của bạn, không chỉ một nhãn — mà còn kèm độ tin cậy, và đối với noul câu hỏi thì xác suất đã hiệu chuẩn của câu trả lời "có". InternLM báo cáo điểm Brier là 0.347 và sai số hiệu chuẩn kỳ vọng là 0.065 trên bộ dữ liệu riêng của mình, đồng thời cung cấp nhiệt độ đã khớp trong checkpoint: 1.99241824, được khớp riêng cho kích thước này bằng cách tối thiểu hóa log-likelihood âm trên 1,728 trường hợp hiệu chuẩn được chỉ định với 1,693 trường hợp xác thực được giữ lại. Nhãn của bộ kiểm thử không được dùng để chọn nó. Có một chẩn đoán thứ hai, độc lập gồm 96 trường hợp trong thẻ sử dụng các phân phối tham chiếu chính xác thay vì nhãn được lấy mẫu, và nó cho thấy Brier/ECE tổng thể chuyển từ 0.628 / 0.213 trước hiệu chuẩn thành 0.550 / 0.089 sau hiệu chuẩn — bước hiệu chuẩn giúp giảm sai số kỳ vọng đi hơn hẳn một nửa.

Giờ hãy tìm cùng con số đó ở phía Qwen 3.8. Nó không có ở đó. Alibaba công bố điểm Artificial Analysis Index, GPQA Diamond, terminal-bench, SciCode, tau-banking và long-context recall — tất cả đều là các thước đo năng lực. Họ không công bố chỉ số hiệu chuẩn nào cho bất kỳ thành viên nào thuộc dòng Qwen 3.8, bởi vì độ tin cậy của một mô hình sinh không phải là một đại lượng mà nhà cung cấp phát hành. Nếu hệ thống của bạn cần một xác suất để đặt ngưỡng hoặc định tuyến dựa trên đó, thay vì một câu trả lời mà nó buộc phải tin, thì sự khác biệt đó không phải là vấn đề về mức độ. Một mô hình cho bạn một con số với tỷ lệ lỗi được ghi nhận; mô hình kia cho bạn văn bản, và bạn tự xây dựng ước lượng độ tin cậy của riêng mình quanh nó.

Nơi Qwen 3.8 giành chiến thắng, và cũng không hề sát nút chút nào.

Đặt hai thứ cạnh nhau về những gì chúng có thể được yêu cầu làm, và ranh giới không còn tinh tế nữa.

• Ngữ cảnh — Qwen3.8-Max sở hữu cửa sổ 1.000.000 token. Intern-Decision-4B từ chối mọi thứ vượt quá 8.192. Đó là hệ số 122, và không có cách nào lách được, bởi vì giới hạn đầu vào được thực thi chứ không phải bị cắt bớt.

• Phương thức đầu vào — Qwen3.8-Max nhận văn bản, hình ảnh và video. Intern-Decision-4B nhận văn bản và hình ảnh, tối đa tám, và các token hình ảnh được tính vào cùng ngân sách 8.192.

• Suy luận và công cụ — Qwen3.8-Max có khả năng sử dụng công cụ, chế độ JSON và suy luận trong số các năng lực được công bố của mình, đồng thời đạt mức 45,4 trên Artificial Analysis Intelligence Index, đứng thứ mười lăm trong số 145 mô hình được lập chỉ mục, với điểm AA Coding là 76,2, đứng thứ chín trong số 138. Đây là những số liệu độc lập do Artificial Analysis công bố, không phải tuyên bố của nhà cung cấp. Intern-Decision-4B không có mục nào trên Artificial Analysis, không có bất kỳ điểm số độc lập nào, và không có khả năng suy luận, lập kế hoạch hay gọi bất cứ thứ gì.

• Đầu ra mở — Qwen3.8-Max viết. Intern-Decision-4B không thể tạo ra một đoạn văn, một lý lẽ, hay một kế hoạch. Nó chỉ có thể chấm điểm những phương án mà bạn đã nghĩ ra để liệt kê.

Về phía open-weights cũng đáng lưu ý: nếu bạn muốn chính lõi Qwen 3.8 chứ không phải dùng qua dịch vụ được host, thì Qwen3.8-27B là phiên bản dense cùng dòng — 27,8 tỷ tham số, Apache 2.0, ngữ cảnh 262.144 token, và khoảng 0,33 USD / 2,40 USD mỗi triệu token tại nơi nó được phục vụ. Nó đạt 33,7 trên AA Intelligence Index. Nó vẫn lớn hơn Intern-Decision-4B một bậc độ lớn, vẫn là mô hình sinh, và vẫn là công cụ sai cho một quyết định tập đóng ở quy mô lớn — nhưng nó là lựa chọn trung gian trung thực, và là lựa chọn duy nhất trong ba lựa chọn vừa thực sự rẻ vừa thực sự có năng lực cùng một lúc.

Screenshot of the OrcaRouter model page for Qwen3.8 Max, showing the on-page navigation for code samples, pricing, performance, public benchmarks, community buzz, how it compares and FAQ, with the model name and vendor breadcrumb at the top.

Đọc bảng benchmark của chính InternLM một cách trung thực

Thẻ của Intern-Decision-4B có một bảng so sánh, và điều vắng mặt khỏi bảng đó lại mang nhiều thông tin hơn cả những gì có trong bảng. Các hàng gồm Jev, Laya, SemIf, Kev, JevK5, cùng 0.8B và 2B của chính InternLM. Mỗi mục trong số đó đều là một System One hoặc một mô hình ra quyết định khác — Jev đến từ TypeSafe AI, Laya từ Convai Innovations, và ba mục khác nữa. Mọi con số đều do nhà cung cấp tự báo cáo trên chính các harness của InternLM. Không hề có mô hình tiên phong nào trong bảng.

Đó không phải là một sơ suất. Đó là phạm vi trung thực của tuyên bố. Mức trung bình nổi bật 90,02 của Intern-Decision-4B trên bảy bộ đánh giá — Jevbench-Easy 100,00, Jevbench-Original 98,61, Jevbench-Hard 73,87, Typed Decision 80,55, ToolACE 96,45, AG News 90,82, WildJailBreak 89,86 — là tuyên bố dẫn đầu danh mục mô hình ra quyết định, điều mà nó làm được trên bảng này, vượt qua 88,74 của Jev và 57,77 của Laya. Đây không phải là tuyên bố cạnh tranh với Qwen 3.8, và InternLM không đưa ra tuyên bố đó ở bất cứ đâu. Thẻ mô hình được giới hạn trong danh mục của chính nó, và việc đọc một chiến thắng ở danh mục như một chiến thắng về năng lực chính là sai lầm mà phần này tồn tại để ngăn chặn.

Thêm hai lưu ý nữa. Các con số về độ trễ — trung bình 44 ms trên một chiếc 4090 — là do nhà cung cấp tự đo, phụ thuộc vào khối lượng công việc và phần cứng, và một lượt lan truyền xuôi (forward pass) trên một GPU đơn không phải là phép đo tương đương với một lệnh gọi API được lưu trữ, vốn bao gồm cả vòng khứ hồi qua mạng lẫn việc xếp hàng. Còn thí điểm hiệu chuẩn chỉ có 96 trường hợp: đó là một phép chẩn đoán, không phải một phép đánh giá chuẩn, và thẻ cũng ghi rõ như vậy.

Câu hỏi về triển khai, đó mới là ngã rẽ thực sự.

Hãy tạm quên các benchmark đi, và tự hỏi mỗi thứ đòi hỏi gì ở bạn về mặt vận hành.

Intern-Decision-4B nặng khoảng 9,1 GB trên đĩa ở dạng bf16 — hai phân mảnh ngôn ngữ ở 4,26 GB và 4,15 GB, một tháp thị giác 612 MB và một bộ chiếu 54 MB. Nó tải qua một tệp 16 KB inference.py đi kèm trong chính kho lưu trữ, với một lớp DecisionEngine mà bạn khởi tạo một lần rồi tái sử dụng. Đầu vào là một dict Python, đầu ra là một dict phản hồi, với yêu cầu Python 3.12+. Nó chạy trong 44 ms trên 4090, và mô hình anh em 0,8B đủ nhỏ để có thể suy luận trên phần cứng yếu hơn nhiều. Nhưng mô-đun chính là giao diện — không có máy chủ, không có endpoint tương thích OpenAI, và không có API được host sẵn. Bạn đang xây dựng dịch vụ xung quanh nó, và nếu bạn cần hai cái để chuyển đổi dự phòng thì bạn cũng đang xây dựng luôn phần đó.

Phía sinh của cùng một pipeline lại là một quyết định hoàn toàn khác, và đó chính là việc mà một router thực sự được tạo ra để làm. Qwen3.8-Max và Qwen3.8-27B đều có thể gọi được trên OrcaRouter bằng cùng một key tương thích OpenAI, ở mức giá niêm yết của nhà cung cấp với 0% markup được chuyển nguyên — nên khi Alibaba thay đổi giá Qwen, bên chúng tôi cập nhật ngay trong cùng ngày chứ không phải chờ đến kỳ thanh toán tiếp theo. Intern-Decision-4B không nằm trong các route của chúng tôi và sẽ không như vậy cho đến khi InternLM tự host nó ở đâu đó; chúng tôi sẽ không giả vờ điều ngược lại. Điều chúng tôi bao phủ là nửa còn lại của pipeline này — phần vốn là một lệnh gọi mạng: một key cho hơn 200 model, tự động failover nếu Qwen3.8-Max suy giảm — tỷ lệ lỗi bảy ngày trực tiếp của nó là 1,78% — và khả năng A/B hai tier Qwen 3.8 với nhau ngay trong cùng một đường request trước khi bạn quyết định chọn bên nào.

Đó chính là mô hình đáng để rút ra. Hãy chạy bộ chấm điểm ngay tại máy cục bộ, vì nó rẻ, nhanh và chỉ làm tốt một việc hẹp. Còn bước suy luận thì hãy định tuyến ra ngoài, vì đó mới là nơi thực sự diễn ra chuyện thay đổi nhà cung cấp, cắt giảm giá và dịch vụ ngừng hoạt động.

A two-column comparison scoreboard titled Intern-Decision-4B vs Qwen 3.8 — the scoreboard, contrasting 44 ms per decision, about $0 in tokens per million decisions, an 8,192-token context, text plus 8 images, a published Brier of 0.347 and no open-ended output on the left against 2,474 ms p50 hosted, about $2,500 per million, a 1,000,000-token context, text, image and video, no published calibration and open-ended reasoning on the right.

Bạn thực sự nên chọn cái nào

Chọn Intern-Decision-4B nếu quyết định của bạn thuộc dạng tập đóng, câu trả lời có thể liệt kê được trong một prompt, bạn chạy cùng quyết định đó với khối lượng lớn, và bạn quan tâm đến xác suất ngang với nhãn. Định tuyến ticket, kiểm duyệt nội dung theo một taxonomy cố định, trích xuất có cấu trúc vào một schema do bạn kiểm soát, thang chấm điểm, cổng nhị phân — bất cứ thứ gì mà con người có thể đã viết sẵn danh sách lựa chọn từ trước. 4,54 tỷ tham số trung thực về mức trần: chính card cho thấy 4B đạt 73.87 trên Jevbench-Hard so với 100.00 trên Easy, nên dạng quyết định càng khó thì mô hình nhỏ càng mất nhiều.

Chọn Qwen 3.8 — nghĩa là Qwen3.8-Max nếu bạn muốn lõi được host, Qwen3.8-27B nếu bạn muốn trọng số mà bạn có thể nắm giữ — nếu câu trả lời không thể liệt kê trước, nếu đầu vào dài hơn 8.192 token, nếu bạn cần một lý giải có thể đưa cho con người xem, nếu bạn cần gọi công cụ, hoặc nếu bạn cần video. Cũng hãy chọn nó nếu bạn đơn giản là không muốn vận hành GPU: 12,3 giờ thời gian 4090 cho mỗi triệu quyết định là rẻ chỉ khi bạn đã có 4090 và có việc khác để làm với nó trong 363 ngày còn lại.

Chọn cả hai nếu pipeline của bạn có hình dạng giống như hầu hết các pipeline thực tế — một bộ phân loại tập đóng rẻ tiền ở phía trước, một mô hình tiên phong ở phía sau cho những trường hợp mà bộ phân loại không chắc chắn. Đó chính là cấu hình mà độ tin cậy đã hiệu chuẩn của Intern-Decision-4B được xây dựng để phục vụ, và đó là lý do chỉ số ECE ở trên quan trọng hơn mức trung bình tiêu đề.

Xem gì

Ba câu hỏi mở, tất cả đều có thể được trả lời trong vài ngày. Liệu InternLM có công bố kho GitHub mà thẻ của chính nó liên kết tới — hiện đang là 404 — và cùng với đó là mô tả huấn luyện không? Liệu một thông báo có theo sau các trọng số, biến một lần push âm thầm thành một bản phát hành có tài liệu không? Và liệu có bất cứ thứ gì độc lập tái tạo được mức trung bình 90.02, hay chỉ số Brier 0.347, trên phần cứng không phải của InternLM không?

Có một điểm mâu thuẫn nhỏ cần lưu ý trong lúc bạn chờ, vì đó là kiểu điều quan trọng khi bạn đang ước lượng quy mô một đợt triển khai. Mô hình có tên là 4B. Số lượng tham số là 4.539.265.536 — 4,54 tỷ. Bản cùng dòng 0.8B có 853 triệu tham số và bản cùng dòng 2B có 2,21 tỷ, cả hai đều chỉ làm tròn lên hoặc xuống một chút xíu. Chỉ riêng 4B là làm tròn xuống hơn nửa tỷ. Đó không phải là vấn đề. Đó là lời nhắc rằng trong một bản phát hành chưa được công bố, tài liệu là đặc tả duy nhất bạn có, và ngay cả tài liệu đó vẫn đang được chỉnh sửa.