
Intern-Decision-4B: InternLM đã ra mắt một mô hình quyết định trả lời mà không cần viết ra một token nào
- typesafeMỚITypeSafe: Jev 1.132026-09-24$0.04 / $0.00 trên 1 triệu token · 592 tok/s
- openaiMỚIOpenAI: GPT-6 Luna2026-09-2237Trí tuệ
- openaiMỚIOpenAI: GPT-6 Sol2026-09-2248Trí tuệ
- anthropicMỚIAnthropic: Claude Opus 5.52026-09-2258Trí tuệ
- grokMỚIGrok 4.72026-09-2146Trí tuệ
- OrcaMỚIOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 trên 1 triệu token · 187 tok/s
- orcaMỚIOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 trên 1 triệu token · 1306 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Trí tuệ
- openaiOpenAI: GPT-6 Astra2026-09-0453Trí tuệ77Lập trình
- googleGoogle: Gemini 3.8 Flash2026-09-0241Trí tuệ76Lập trình
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Trí tuệ76Lập trình
- anthropicAnthropic: Claude Fable 5.12026-09-0153Trí tuệ82Lập trình
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 trên 1 triệu token · 113 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Trí tuệ72Lập trình
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 trên 1 triệu token · 224 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Trí tuệ75Lập trình
- obsidianQwen3.8 27B2026-08-1534Trí tuệ68Lập trình
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Trí tuệ69Lập trình
- grokSpaceXAI: Grok 4.62026-08-1244Trí tuệ77Lập trình
- metaMeta: Muse Spark 1.22026-08-0540Trí tuệ72Lập trình
Ba kho mô hình đã xuất hiện trên trang Hugging Face của InternLM trong vòng bốn mươi giây vào ngày 26 tháng 9 năm 2026: Intern-Decision-0.8B lúc 05:35:57 UTC, Intern-Decision-2B lúc 05:36:19, và internlm/Intern-Decision-4B lúc 05:36:37. Bản 4B mới là cái đáng chú ý. Nó là một bản tinh chỉnh của Qwen3.5-4B được huấn luyện thêm, chấp nhận một trạng thái chia sẻ, một lược đồ gồm các câu hỏi có tên, và các hình ảnh tùy chọn, rồi trả về một phân phối câu trả lời đã hiệu chỉnh cho mọi câu hỏi chỉ trong một lượt lan truyền xuôi duy nhất. Nó không bao giờ sinh ra văn bản. Ghi chú phát hành của chính nó nói thẳng ra điều đó: "API này thực hiện việc chấm điểm có cấu trúc cho các ứng viên. Nó không gọi generate() hay lấy mẫu văn bản tự do." Bốn mươi giây tải lên mà không có lấy một dòng thông báo ở bất cứ đâu — không bài đăng blog, không tweet, không changelog, không trang ra mắt. Thứ tồn tại chỉ là một thẻ mô hình, một tệp inference.py, và bốn phân đoạn safetensors.

Những gì đã phát hành, và những gì chưa
Gia đình này là thứ đầu tiên cần làm cho đúng, bởi vì thẻ của 4B lặng lẽ mang nó. Bảng benchmark của nó công bố các hàng cho Intern-Decision-0.8B và Intern-Decision-2B bên cạnh hàng của chính nó, và cả ba checkpoint đều đã lên hub trong cùng một phút. Kho lưu trữ 2B không bao giờ được liên kết từ thẻ của 4B — bạn phải tìm nó thông qua nguồn tải lên của tổ chức.
Những gì đã không được phát hành gần như là mọi thứ mà một bản phát hành thường mang lại:
• Không có thông báo nào — không hề có tin tức nào trên web, không có tuyên bố nào từ nhà cung cấp bằng bất kỳ ngôn ngữ nào mà chúng tôi có thể tìm thấy.
• Không có bản demo — thẻ liên kết tới một Space tại huggingface.co/spaces/internlm/intern-decision; điểm cuối đó trả về HTTP 401, nghĩa là nó không công khai, chứ không phải là nó bị hỏng.
• Không có bộ sưu tập — bộ sưu tập model được quảng cáo tại huggingface.co/collections/internlm/intern-decision cũng trả về 401.
• Không có kho mã nguồn — liên kết GitHub của thẻ, github.com/internlm/Intern-Decision, bị lỗi 404, và danh sách kho lưu trữ của tổ chức InternLM không có dự án nào như vậy.
• Chưa được đón nhận — tính đến thời điểm viết bài, 4B chỉ có một lượt thích và không có lượt tải xuống nào.
Đó là toàn bộ phần có thể biết được. Hãy coi mọi con số dưới đây là của chính nhà cung cấp, vì chưa có ai khác chạy thử thứ này.

Hợp đồng suy luận chính là sản phẩm.
Phần lớn thẻ được dành cho một quy trình năm bước, cho bạn biết phần kỹ thuật nằm ở đâu. Các câu hỏi và lựa chọn giữ nguyên thứ tự. Các lựa chọn của mỗi câu hỏi được ánh xạ thành các ký hiệu đơn-token — A đến Z, rồi a đến z, rồi 0 đến 9. Đó là 62 ký hiệu, và chính vì thế mà thẻ giới hạn một câu hỏi ở 62 lựa chọn. Prompt được kết xuất từ system prompt gốc, state, decision schema và một khung JSON trợ lý hoàn chỉnh với một <decision> placeholder cho mỗi trường, giữ nguyên chat template của checkpoint và một khối suy nghĩ trống. Sau đó là một lượt lan truyền xuôi nhân quả. Logits được đọc tại vị trí ngay trước mỗi placeholder, một softmax chỉ chạy trên các logits ký hiệu ứng viên được phép của trường đó, hiệu chuẩn được áp dụng, và các ký hiệu được ánh xạ ngược về các giá trị lựa chọn của bạn.
Hệ quả là một dạng cố định: không có vòng lặp giải mã, không lấy mẫu, không có bộ phân tích cú pháp, không có bề mặt ảo giác, và mức trần cứng là một quyết định cho mỗi câu hỏi mỗi lượt. Có ba loại câu hỏi được hỗ trợ — lựa chọn với một ánh xạ tiêu chí có thứ tự, điểm với danh sách hoặc ánh xạ khóa số, và noul, dạng nhị phân không/có.
Chi tiết quan trọng nhất trên bảng thông số kỹ thuật
Thẻ mô hình nói rõ rằng các đầu vào "bị từ chối mà không cắt ngắn" khi vượt quá DecisionEngine(max_length=8192). Đọc điều đó bên cạnh cấu hình và một điều kỳ lạ hiện ra: tháp văn bản bên dưới khai báo max_position_embeddings là 262.144. Xương sống có thể xử lý một phần tư triệu token; lớp bao bọc được phát hành từ chối mọi thứ vượt quá 8.192. Đây không phải là một mô hình ngữ cảnh dài với mặc định thận trọng — mà là một mô hình chấm điểm quyết định mà chính harness của nó giới hạn bằng chứng bạn có thể đưa cho nó. Nếu câu hỏi định tuyến của bạn phụ thuộc vào hơn khoảng tám nghìn token trạng thái, checkpoint này ở bản phát hành sẽ không trả lời được, và nó sẽ từ chối thay vì cắt ngắn đầu vào của bạn.
Tối đa tám trang, thẻ lưu ý rằng các token được tính vào cùng giới hạn 8 đó.

Bên trong các trọng số
Bốn shard, 4,54 tỷ tham số BF16, và một cấu hình giải thích tên kích thước: có một tháp văn bản, một tháp thị giác với khoảng hai tá lớp và kích thước patch 16 pixel, cùng một projector ở giữa chúng. Phía văn bản có 32 lớp với kích thước ẩn 2.560, với 16 đầu chú ý so với 4 đầu khóa/giá trị, từ vựng 248.320 token và embedding ràng buộc. Các loại lớp xen kẽ theo một khoảng cố định — ba lớp chú ý tuyến tính, rồi một lớp chú ý đầy đủ, lặp lại. Chỉ các lớp chú ý đầy đủ mang chú ý toàn cục, và embedding quay là một phần với hệ số 0,25. Việc tải nó yêu cầu Python 3.12 trở lên, PyTorch 2.9.1 và Transformers 5.14.1, và danh sách tệp vẫn mang tokenizer, merges và các tệp từ vựng thay vì dựa vào tokenizer phía hub.
Những con số, và ai đã tạo ra chúng
Mọi thứ trong phần này đều do InternLM đo lường và công bố trên thẻ mô hình. Không có nội dung nào trong đó được bên thứ ba tái lập, và không hề có mục Artificial Analysis, xếp hạng arena hay dòng nào trên bảng xếp hạng cho mô hình này ở bất kỳ đâu.
Trên bảy bộ đánh giá, mô hình 4B đạt trung bình 90,02, với điểm Brier là 0,347 và sai số hiệu chuẩn kỳ vọng là 0,065. Cùng bảng đó liệt kê Intern-Decision-0.8B ở mức 79,38 và Intern-Decision-2B ở mức 84,68, nên họ mô hình này đi lên theo quy mô — 4,7 điểm từ 0,8B lên 2B, rồi thêm 5,3 điểm nữa lên 4B. Bảng cũng có năm hàng mà nhà cung cấp không huấn luyện: Jev ở 88,74, JevK5 ở 85,16, SemIf ở 84,23, Kev ở 79,56, và Laya ở 57,77. Những mục đó do InternLM chạy trên harness của InternLM với checkpoint của InternLM. Chúng không phải là các con số của chính những dự án đó, và đọc chúng như thể là vậy chính là sai lầm dễ mắc nhất ở đây.
Độ trễ được đo trên một RTX 4090 duy nhất thông qua đường dẫn Hugging Face cục bộ, và card ghi chú rằng các giá trị này phụ thuộc vào khối lượng công việc cũng như phần cứng. Mô hình 4B chạy ở mức trung bình 44,16 ms, trung vị 44,03 ms và 44,60 ms ở P95 — độ chênh lệch giữa trung vị và đuôi thấp hơn một mili giây rõ rệt, đúng như những gì một lượt lan truyền xuôi với hình dạng cố định thể hiện. Hai checkpoint nhỏ hơn đều ở khoảng 33 ms, trong đó 2B nhỉnh hơn 0.8B một chút ở cả trung bình lẫn trung vị, điều này đáng để lưu ý thay vì lờ đi cho mượt: hai mô hình này đủ gần nhau để nằm trong phạm vi nhiễu đo lường của nhau.
Hiệu chuẩn, và những lưu ý trung thực trong đó
Checkpoint này đi kèm nhiệt độ mặc định là 1.99241824, được khớp riêng cho mô hình này bằng cách tối thiểu hóa log-likelihood âm trên 1.728 trường hợp hiệu chuẩn được chỉ định, với 1.693 trường hợp được giữ riêng để xác thực. Thẻ model card nêu rằng nhãn của bộ kiểm thử đã không được dùng để chọn giá trị này. Cách triển khai là hiệu chuẩn xác suất ứng viên, không phải nhiệt độ lấy mẫu: nó thay đổi độ tin cậy, xác suất nhị phân và điểm kỳ vọng trong khi vẫn giữ nguyên quyết định argmax.
Một chẩn đoán riêng gồm 96 trường hợp sau đó báo cáo hiệu ứng. Trên chính các cột trước-và-sau của InternLM, Brier và ECE tổng thể của 4B dịch chuyển từ 0,628 / 0,213 thành 0,550 / 0,089, so với 0,595 / 0,130 của Jev. Hai cách đọc trung thực về bảng đó: việc hiệu chỉnh rõ ràng có tác dụng, và cột “trước” không phải là thứ mà bất kỳ người dùng nào sẽ từng thấy, vì mặc định được phát hành là nhiệt độ đã khớp. Cũng đáng lưu ý — hai trong số sáu hạng mục chẩn đoán có kết quả tệ hơn đối với 4B so với Jev, và hạng mục tệ nhất trong số đó, bằng chứng hằng ngày và thiên lệch quan sát, cải thiện lên 0,575 / 0,210 nhưng vẫn còn thua Jev với 0,603 / 0,114. Trên lát cắt đó, việc hiệu chỉnh thu hẹp khoảng cách nhưng không khép nó lại.
Nơi router phù hợp, và nơi nó chưa phù hợp
Trở ngại thực tế khi dùng mô hình này không nằm ở độ chính xác, mà ở khâu đóng gói. Bản phát hành cung cấp một lớp Python để bạn import sau khi tải bốn shard, chứ không phải một endpoint HTTP mà bạn có thể gọi. Đó chính xác là khoảng trống mà một lớp định tuyến tồn tại để lấp đầy — một khóa dùng cho hơn 200 mô hình, giá niêm yết của nhà cung cấp được chuyển nguyên với mức markup 0%, và tự động chuyển đổi dự phòng khi một nhà cung cấp gặp trục trặc — nhưng cần nói thẳng rằng OrcaRouter hiện chưa cung cấp Intern-Decision-4B hay bất kỳ mô hình nào cùng loại. Danh mục của chúng tôi không liệt kê nó, và không có gì ở đây nên được hiểu như một tuyên bố về tính khả dụng. Điều chúng tôi có thể mang đến là lựa chọn tiết kiệm hơn: nếu bạn muốn thử một bộ chấm điểm quyết định 4,5 tỷ tham số đặt trước một luồng production, bạn có thể tích hợp nó vào một router với phương án dự phòng sang một mô hình tổng quát, để một ngày hiệu chuẩn lệch chỉ khiến bạn phải thử lại thay vì gây gián đoạn dịch vụ.
Điều gì sẽ thay đổi cục diện
Ba điều, theo thứ tự quan trọng. Một người nào đó bên ngoài InternLM cần tái lập mức trung bình 90.02 và sai số hiệu chuẩn kỳ vọng 0.065 — những tuyên bố hiệu chuẩn chưa từng gặp một tập kiểm thử ngoại lai là những con số khó chuyển giao nhất trong học máy. Dấu vết của chính thẻ cần xuất hiện: Space, collection, kho GitHub. Và nhà cung cấp cần nói rõ đây là một sản phẩm hay một artefact của bài báo, bởi vì giấy phép chỉ dành cho nghiên cứu và giấy phép Apache-2.0 không phải là cùng một cam kết, và mô hình 4B đã chọn Apache-2.0 cùng với giấy phép Qwen được giữ nguyên song song. Cho đến lúc đó, cách định khung đúng là cách mà chính lần tải lên gợi ý: đây là một checkpoint thật với một hợp đồng suy luận thật và một bảng điểm hoàn toàn chưa được xác minh, được công bố mà không ai được thông báo.
Hiện tại, bản tóm tắt trung thực thì hẹp và hữu ích. Nếu bài toán của bạn là “chọn một trong năm nhãn định tuyến và cho tôi biết bạn chắc chắn đến mức nào”, thì một mô hình 4,5B chỉ phát ra 62 logit và không có văn xuôi là một dạng có thể biện minh để đánh giá. Nếu bài toán của bạn liên quan đến một tài liệu dài, hơn tám hình ảnh, hoặc bất kỳ nhu cầu nào phải giải thích câu trả lời bằng lời, thì checkpoint này ở trạng thái xuất xưởng là sai công cụ, và mọi mức độ trau chuốt benchmark của nhà cung cấp cũng không thay đổi được điều đó.
