
Intern-Decision-2B đã âm thầm được phát hành lên Hugging Face. Liên kết GitHub trên thẻ của nó vừa không còn báo lỗi 404 nữa.
- typesafeMỚITypeSafe: Jev 1.132026-09-24$0.04 / $0.00 trên 1 triệu token · 584 tok/s
- openaiMỚIOpenAI: GPT-6 Luna2026-09-2237Trí tuệ
- openaiMỚIOpenAI: GPT-6 Sol2026-09-2248Trí tuệ
- anthropicMỚIAnthropic: Claude Opus 5.52026-09-2258Trí tuệ
- grokMỚIGrok 4.72026-09-2146Trí tuệ
- OrcaMỚIOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 trên 1 triệu token · 187 tok/s
- orcaMỚIOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 trên 1 triệu token · 1306 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Trí tuệ
- openaiOpenAI: GPT-6 Astra2026-09-0453Trí tuệ77Lập trình
- googleGoogle: Gemini 3.8 Flash2026-09-0241Trí tuệ76Lập trình
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Trí tuệ76Lập trình
- anthropicAnthropic: Claude Fable 5.12026-09-0153Trí tuệ82Lập trình
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 trên 1 triệu token · 113 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Trí tuệ72Lập trình
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 trên 1 triệu token · 224 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Trí tuệ75Lập trình
- obsidianQwen3.8 27B2026-08-1534Trí tuệ68Lập trình
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Trí tuệ69Lập trình
- grokSpaceXAI: Grok 4.62026-08-1244Trí tuệ77Lập trình
- metaMeta: Muse Spark 1.22026-08-0540Trí tuệ72Lập trình
Đầu ngày hôm nay, thẻ mô hình của internlm/Intern-Decision-2B đã trỏ đến ba nơi để biết thêm thông tin, và hai trong số đó đã hỏng: Space demo trả về HTTP 401, và github.com/internlm/Intern-Decision trả về 404 cho bất kỳ ai nhấp vào nó. Tính đến 08:58 UTC, kho lưu trữ đằng sau liên kết thứ hai đó đã tồn tại — công khai, với ba commit, mang mã huấn luyện, hai backend, một gói đánh giá với 10,751 bài kiểm tra, một benchmark hiệu chuẩn gồm 96 trường hợp và hướng dẫn tái tạo. Đó là điều đã thay đổi ở mô hình này kể từ khi nó xuất hiện trên Hugging Face lúc 05:36 UTC ngày 26 tháng 9 năm 2026, và nó đủ để đưa Intern-Decision-2B từ "một checkpoint với một README" đến "một checkpoint mà bạn thực sự có thể kiểm tra, tái tạo dựa trên, tranh luận với".
Bản thân các trọng số không thay đổi và không hề mơ hồ. Intern-Decision-2B là một mô hình quyết định có cấu trúc đa phương thức với 2.213.241.664 tham số, được tinh chỉnh từ Qwen/Qwen3.5-2B — mô hình cơ sở của Alibaba từ ngày 28 tháng 2 năm 2026 — phát hành theo Apache-2.0, với giấy phép Qwen thượng nguồn được giữ nguyên bên cạnh nó dưới tên LICENSE-QWEN. Đây là kích thước ở giữa trong ba kích thước mà InternLM đã đẩy lên trong vòng bốn mươi giây: Intern-Decision-0.8B lúc 05:35:57, mô hình này lúc 05:36:19, và Intern-Decision-4B lúc 05:36:37. Vẫn không có bất kỳ thông báo nào ở đằng sau bất kỳ mô hình nào trong số đó.
Điều khiến kích cỡ trung bình đáng được dành một bài riêng là ở đây dòng này không còn hành xử theo cách có thể đoán trước. Theo chính các con số của InternLM, nó là nhanh nhất trong ba và cũng là kém hiệu chỉnh nhất trong ba, và cả hai sự thật này đều đáng để hiểu rõ trước khi bạn tải về bốn gigabyte rưỡi bất cứ thứ gì.
Điều gì đã được xác nhận, và điều gì chỉ là lời từ phía nhà cung cấp
Hai phạm trù, và chúng cần được giữ tách biệt.
Đã xác nhận, bởi vì đó là một danh sách tệp hoặc một phản hồi HTTP: số lượng tham số (2.592 F32 cộng với 2.213.239.072 trọng số BF16); bản đồ phân mảnh (một phân mảnh ngôn ngữ 3,76 GB, một tháp thị giác 612,5 MB, một bộ chiếu 50,3 MB, khoảng 4,43 GB tensor và khoảng 4,46 GB kho lưu trữ); cặp giấy phép; mô hình cơ sở; kiến trúc bên dưới (một Qwen3_5ForConditionalGeneration với 24 lớp, kích thước ẩn 2.048, 8 đầu truy vấn so với 2 đầu khóa-giá trị, kích thước đầu 256, một mẫu lặp lại gồm ba lớp chú ý tuyến tính trên một lớp chú ý đầy đủ, một lớp dự đoán đa token được giữ lại, và giới hạn nhúng 262.144 vị trí); sự tồn tại của kho lưu trữ; và việc bộ sưu tập mô hình tại huggingface.co/collections/internlm/intern-decision hiện đã phân giải và liệt kê cả ba checkpoint.
Do nhà cung cấp tự báo cáo và không thể tái lập: mọi con số độ chính xác, mọi chỉ số độ trễ và nhiệt độ hiệu chuẩn. Không có bài báo, không có mục arXiv, không có bài đăng ra mắt, không có changelog, không có đánh giá độc lập — tìm kiếm chuỗi "Intern-Decision" không trả về kết quả nào nói về mô hình này. Demo Space vẫn trả về 401, nghĩa là nó không công khai, chứ không phải là nó bị hỏng. Checkpoint 2B có một lượt thích và không có lượt tải xuống nào. Chưa ai ngoài InternLM chạy thử nó.

Hợp đồng suy luận, theo thứ tự nó diễn ra
Tệp giàu thông tin nhất trong kho lưu trữ không phải là tấm thẻ. Đó là src/inference/engine.py và inference.py đi kèm trên Hub, bởi vì giữa chúng, chúng ghi lại một hợp đồng thay vì một câu lệnh gợi ý.
• Bạn cung cấp state — nội dung được đánh giá — một schema questions, và tùy chọn tối đa tám hình ảnh. Từ một đến mười sáu câu hỏi, mỗi câu tối đa 62 lựa chọn.
• Các phương án của mỗi câu hỏi được ánh xạ lên các ký hiệu một token: A–Z, sau đó a–z, sau đó 0–9. Mức trần 62 phương án không phải là một sở thích thiết kế, mà chính xác là số ký hiệu một token mà hợp đồng có thể xử lý.
• Lời nhắc hệ thống, trạng thái, lược đồ và một khung JSON trợ lý hoàn chỉnh được kết xuất với một phần giữ chỗ <decision> cho mỗi trường. Mẫu trò chuyện của checkpoint và khối suy nghĩ trống được giữ nguyên như vậy.
• Một lượt lan truyền xuôi nhân quả được chạy. Logits được đọc tại vị trí ngay trước mỗi placeholder — không phải sau vị trí đó, và cũng không phải tại một token được sinh ra.
• Softmax chỉ được lấy trên các ký hiệu ứng viên hợp lệ của trường đó, hiệu chuẩn của checkpoint được áp dụng, và các ký hiệu được ánh xạ trở lại các giá trị tùy chọn ban đầu của bạn.
Thẻ mô tả thẳng thắn về việc đây là gì: "API này thực hiện chấm điểm ứng viên có cấu trúc. Nó không gọi generate() hay lấy mẫu văn bản tự do." Một DecisionEngine(max_length=8192) sẽ từ chối đầu vào quá cỡ thay vì cắt bớt, nên một yêu cầu không vừa sẽ báo lỗi rõ ràng chứ không âm thầm đánh mất đoạn văn cuối cùng. Danh sách backend cũng trung thực không kém — backend="hf" là mặc định và là backend duy nhất được triển khai trong kho Hugging Face, điều này đáng để biết vì bản phát hành trên GitHub cũng cung cấp một backend XTuner, và hai backend này không giống nhau về mặt số học. Hướng dẫn đánh giá của chính InternLM cũng nói vậy: "Khác biệt về kernel và BF16 có thể làm thay đổi xác suất và đôi khi cả nhãn."
Sự bất thường ở giữa
Đặt ba checkpoint cạnh nhau trên bảng của chính InternLM, và hình dạng thu được lạ lùng đến mức tự nó đã là câu chuyện đáng nói.
• Trung bình trên bảy bộ kiểm thử — Intern-Decision-0.8B 79.38, Intern-Decision-2B 84.68, Intern-Decision-4B 90.02. Đúng thứ tự tăng dần, như bạn sẽ kỳ vọng khi tăng kích thước trọng số.
• Độ trễ trên một RTX 4090 — trung bình 33.98 ms cho 0.8B, 33.28 ms cho 2B, 44.16 ms cho 4B. Kích thước ở giữa là nhanh nhất trong ba kích thước, với mức chênh lệch đủ nhỏ để có thể chỉ là nhiễu trên một GPU đơn lẻ nhưng nhất quán across trung bình, trung vị (33.15 ms) và P95 (33.55 ms).
• Điểm Brier, càng thấp càng tốt — 0.530, 0.437, 0.347. Đơn điệu theo kích thước, như một quy tắc tính điểm thích hợp thường vậy.
• Sai số hiệu chuẩn kỳ vọng, càng thấp càng tốt — 0,066 đối với 0.8B, 0,100 đối với 2B này, 0,065 đối với 4B. Kích thước ở giữa là tệ nhất, và nó còn tệ hơn cả mô hình chỉ bằng một nửa kích thước của nó.
Dòng cuối cùng đó mới là dòng thú vị, và các nhiệt độ được khớp củng cố chứ không giải thích nó. Mỗi checkpoint mang nhiệt độ được khớp theo NLL riêng: 2.747760550703 cho 0.8B, 2.100509348278 cho 2B, 1.992418 cho 4B. Mỗi giá trị đều được khớp trên 1,728 ca hiệu chuẩn được chỉ định, với 1,693 ca được giữ ngoài, bằng cách tối thiểu hoá log-likelihood âm qua tìm kiếm nhiệt độ nghịch đảo trong [0.01, 100], đồng thời nhãn của bộ kiểm thử được cố ý giữ ngoài quá trình khớp. Nhiệt độ của 2B nằm giữa hai người anh em của nó, đúng như điều bạn sẽ kỳ vọng nếu bất thường này là một tạo tác của việc khớp. Không phải vậy: giá trị được khớp là đơn điệu theo kích thước, còn lỗi sau hiệu chuẩn thì không. Theo đo lường của chính InternLM, checkpoint 2.2 tỷ tham số là cái kém đáng tin cậy nhất trong ba khi nó cho bạn biết nó tự tin đến mức nào.
Hai lưu ý trước khi điều đó trở thành kết luận. ECE với mười bin có độ rộng bằng nhau và độ tin cậy xác suất tối đa là một thống kê nhiễu trên bộ nhỏ mà bảng này sử dụng — Jevbench-Hard, 111 mục, nên toàn bộ cột ECE chỉ dựa trên hơn một trăm câu hỏi và một lựa chọn chia bin. Và internlm/Intern-Decision-2B là chiếc card duy nhất trong ba chiếc mà không mang phần hiệu chỉnh bổ sung mà card 4B có, nên ở đây có ít tài liệu hơn, chứ không phải nhiều hơn. Hãy coi 0,100 như một lý do để tự fit temperature của riêng bạn hơn là như một phán quyết về các trọng số.

Kho lưu trữ bổ sung những gì và vẫn giữ kín những gì
Bản phát hành trên GitHub đầy đủ hơn so với thẻ mô hình, mà bản thân thẻ mô hình cũng đã giàu thông tin — một phòng thí nghiệm vốn chỉ định làm ra một sản phẩm phụ kèm bài báo thì thường không tung ra kèm một trình tạo hiệu chuẩn tất định và một gói đánh giá xác minh bằng hash bên cạnh trình khởi chạy huấn luyện.
Những gì nay đã công khai: mã huấn luyện và mục tiêu masked-next-token (các ký hiệu đáp án ground-truth chỉ xuất hiện trong nhãn, không bao giờ có trong đầu vào; đáp án của mỗi trường được dự đoán bằng logit ngay trước dấu đánh dấu của trường đó, và tất cả các trường dùng chung một lượt lan truyền xuôi); bảy bộ kiểm thử độ chính xác với mã băm được xác minh bằng SHA-256 và số lượng hàng; mã tính điểm; các script hiệu chỉnh nhiệt độ và phát lại, trong đó phát lại được khẳng định là thay đổi không quyết định nào; benchmark hiệu chuẩn phân phối 96 trường hợp cùng trình tạo và bộ chấm điểm ngoại tuyến của nó; và một bản demo trên trình duyệt được phục vụ trên loopback với POST /v1/decisions (bí danh /v1/jev).
"Những gì được loại trừ một cách rõ ràng, theo chính lời của kho lưu trữ: Dữ liệu huấn luyện, hồ sơ hiệu chuẩn/xác thực riêng tư, hình ảnh, các pipeline chuẩn bị, và trọng số mô hình đều không được bao gồm." Kho lưu trữ hoàn toàn không có tệp giấy phép nào, nên các điều khoản của mã không được nêu rõ dù trọng số là Apache-2.0. Và thành phần của tập phân chia hiệu chuẩn — gồm 1.728 trường hợp nào, từ đâu — vẫn không được tiết lộ, và đây là thiếu sót duy nhất hạn chế mức độ có thể kiểm tra các con số ECE.
Các kích cỡ chúng tôi thực sự định tuyến, và kích cỡ mà chúng tôi không định tuyến
Intern-Decision-2B không có trên OrcaRouter. Trang mô hình của chúng tôi cho nó trả về 404, không có endpoint được lưu trữ nào ở bất cứ đâu mà chúng tôi có thể tìm thấy, và không có gì ở đây nên được hiểu là tuyên bố về tính khả dụng. Cách duy nhất để gọi nó ngày hôm nay là tải checkpoint và chạy inference.py bên cạnh các trọng số.
Điều đó quan trọng đối với quyết định mà bài viết này thực sự bàn tới, bởi vì một bộ chấm điểm không ai phục vụ là một bộ chấm điểm bạn phải tự vận hành. Nếu quyết định tập đóng mà bạn đang cố đưa ra có hình dạng gần với những gì dòng mô hình này làm — một trạng thái, các câu hỏi có kiểu, xác suất đã hiệu chỉnh — thì phương án hosted để so sánh là Jev 1.13 của TypeSafe, đây là mô hình mà InternLM cố ý lấy làm đối chuẩn và mô hình này có trên OrcaRouter với mức $0.042 cho mỗi triệu token đầu vào, ngữ cảnh 65K và thời gian tới token đầu tiên ở P50 là 178 ms.

Chạy cục bộ một checkpoint 2,2 tỷ tham số và gọi một bộ phân loại được host không phải là cùng một giao dịch mua, nhưng chúng là cùng một vấn đề, và việc có cả hai trên cùng một khóa với giá niêm yết của nhà cung cấp được chuyển tiếp với mức markup 0% là lý do để giữ việc so sánh luôn mở thay vì đặt cược kiến trúc vào một trong hai.
Điều gì sẽ thay đổi bức tranh này
Ba điều, theo thứ tự.
Một người nào đó bên ngoài InternLM cần tái tạo mức trung bình 84,68 và ECE 0,100, và kho lưu trữ giờ đây chính là thứ khiến điều đó trở nên khả thi — đó mới là tin thực sự ở đây. Bài kiểm tra là công khai và được xác minh bằng hash; chỉ còn thiếu bảng đáp án, và bảng đáp án chính là checkpoint mà bất kỳ ai cũng có thể tải xuống ngay bây giờ.
Nhà cung cấp cần nói rõ thứ này dùng để làm gì. Một mô hình với một ngăn xếp huấn luyện hoạt động được, một gói đánh giá đã công bố, và không có thông báo, không có giấy phép trên mã nguồn của nó cùng không có endpoint được lưu trữ, khiến ta hiểu đây là một bản phát hành nghiên cứu vẫn chưa được quyết định thành sản phẩm. Các trọng số Apache-2.0 lập luận theo một hướng; giấy phép mã nguồn còn thiếu và 401 Space lập luận theo hướng ngược lại.
Và kích thước ở giữa cần một lý do để tồn tại. Nếu lợi thế tốc độ của 2B so với 0.8B là thật nhưng chỉ ở mức khiêm tốn, và độ hiệu chuẩn của nó là yếu nhất trong ba mô hình ở mọi thước đo mà InternLM công bố, thì khuyến nghị trung thực cho hầu hết người đọc là chịu trả thêm 2.6× dung lượng đĩa để dùng 4B, hoặc chấp nhận độ chính xác yếu hơn của mô hình nhỏ hơn. Lý lẽ dành cho 2B là nó tình cờ là mô hình nhanh nhất trong nhóm nhanh — và đó là một lý lẽ mỏng manh hơn so với cách định khung mang hơi hướng tiếp thị của dòng mô hình này.
