Một thẻ tiêu đề hero ghi 'In-Decision-0.8B' với phụ đề 'Phát hành âm thầm, không công bố', mang các huy hiệu 'không có bài báo, không có kho lưu trữ, không có bài đăng ra mắt' và '852.985.920 tham số, 1,73 GB trên đĩa', với logo OrcaRouter được ghép ở góc.
Guides & Insights

Intern-Decision-0.8B đã xuất hiện mà không có thông báo: InternLM đã âm thầm đưa gì lên Hugging Face

Tác giả

Gideon Frost

Ngày đăng

Mô hình mới nhất · 20Xem tất cả mô hình →
Benchmark: Artificial Analysis · cập nhật hằng ngày
Quay lại tất cả bài viết

Liên kết GitHub trên thẻ mô hình trả về 404. Space demo trả về 401. Không có bộ sưu tập, không có bài blog, không có báo cáo kỹ thuật và không có kết quả tìm kiếm nào ở bất cứ đâu cho chuỗi "Intern-Decision" mà không phải là tin tuyển dụng thực tập — vậy mà Intern-Decision-0.8B hiện đang nằm trên Hugging Face như một checkpoint hoàn chỉnh, có thể tải xuống, theo giấy phép Apache-2.0, được tinh chỉnh từ Qwen3.5-0.8B, tải lên vào rạng sáng ngày 26 tháng 9 năm 2026 cùng với hai phiên bản anh em lớn hơn xuất hiện trong cùng ba phút đó: Intern-Decision-2B và Intern-Decision-4B. InternLM đã từng phát hành theo cách này trước đây, và đó là lý do mọi thứ dưới đây được tổng hợp từ chính kho lưu trữ thay vì từ một bài đăng ra mắt. Sự khác biệt này ở đây quan trọng hơn thường lệ: một repo cho bạn biết cái gì tồn tại, và chỉ nhà cung cấp mới có thể cho bạn biết nó dùng để làm gì.

Điều mà repo thực sự nói, một cách chi tiết, thì đủ bất thường để đáng đọc. Đây không phải là các mô hình trò chuyện và cũng không phải các mô hình ngôn ngữ nhỏ theo nghĩa thông thường. Intern-Decision-0.8B nhận một mẩu trạng thái, một lược đồ gồm các câu hỏi có tên mà bạn viết trước, và tùy chọn tối đa tám hình ảnh, rồi trả về phân phối câu trả lời cho mọi câu hỏi trong một lượt lan truyền xuôi. Nó không bao giờ gọi generate(). Nó không bao giờ lấy mẫu. Không có đầu ra văn bản để phân tích cú pháp, không có JSON để sửa, không có vòng lặp thử lại quanh một dấu ngoặc nhọn chưa bao giờ đóng. Độ hẹp chính là toàn bộ kiến trúc, và nó đặt mô hình này vào cùng một nhóm nhỏ với Jev 1.13 của TypeSafe và Laya của Convai — một nhóm mà InternLM rõ ràng đã cố ý đánh giá đối chiếu, bởi vì Jevbench là bộ đánh giá của chính TypeSafe và nó là cột đầu tiên của bảng.

Đây là những gì có thể biết được từ checkpoint, những gì chỉ được checkpoint khẳng định, và những gì mà hiện tại không ai bên ngoài InternLM có thể nói được gì cả.

Thực sự có gì trong kho lưu trữ?

Thẻ này ngắn gọn và thẳng thắn về nguồn gốc. Intern-Decision-0.8B được mô tả là "một mô hình quyết định có cấu trúc đa phương thức được tinh chỉnh từ Qwen3.5-0.8B" — bản nền Qwen phát hành ngày 28 tháng 2 năm 2026 — và kho lưu trữ có thêm một tệp giấy phép thứ hai, LICENSE-QWEN, bên cạnh các điều khoản Apache-2.0, đúng như một mô hình phái sinh nên làm, và tự nó đã là một tín hiệu trung thực nhỏ. Chỉ mục của Hugging Face báo cáo 852.985.920 tham số trải qua ba shard: một shard ngôn ngữ 1,50 GB, một shard thị giác 176 MB và một projector 25 MB. Tổng dung lượng lưu trữ của kho vào khoảng 1,73 GB, bao gồm cả các tệp tokenizer, nhờ đó toàn bộ mô hình nằm gọn thoải mái trên một GPU tiêu dùng duy nhất hoặc một laptop được trang bị đầy đủ.

Phần config cho thấy đây là một kiến trúc mà Qwen đã phát hành xuyên suốt thế hệ 3.5 chứ không phải một mạng quyết định riêng. Đó là một Qwen3_5ForConditionalGeneration với 24 lớp được sắp xếp theo mô hình lặp lại cứ ba lớp attention tuyến tính thì đến một lớp attention đầy đủ, kích thước ẩn 1.024, 8 đầu attention so với 2 đầu key-value, số chiều mỗi đầu là 256, và embedding vị trí tối đa 262.144 token. Một lớp dự đoán đa token duy nhất được giữ lại. Nhánh thị giác là thật: phần mô tả trên model card có nói về việc xử lý hình ảnh, bộ xử lý nhận hình ảnh, và checkpoint đi kèm một tháp thị giác cùng projector để phục vụ việc đó — vì vậy thẻ đa phương thức trên repo được trọng số hậu thuẫn, chứ không chỉ bởi các thẻ.

Bức tranh về dòng mô hình này đáng chú ý vì nó định hình cách đọc mọi thứ khác. InternLM đã tải lên ba kích cỡ trong 40 giây: 0.8B, rồi 2B, rồi 4B. Số lượng tham số lần lượt là 852,985,920, 2,213,241,664 và 4,539,265,536. Thẻ của mô hình 4B có thêm một mục — một thí điểm hiệu chuẩn phân phối đã biết gồm 96 trường hợp với điểm số trước và sau — mà thẻ 0.8B không có. Sự bất đối xứng đó không phải là bằng chứng cho thấy mô hình nhỏ có khiếm khuyết; nó là bằng chứng rằng tài liệu của mô hình nhỏ được viết trong một ngân sách ngắn hơn, và đó chính là kiểu điều mà một bản phát hành âm thầm trông giống như vậy.

Đường dẫn suy luận thực sự hoạt động như thế nào

Tệp inference.py đi kèm là tệp giàu thông tin nhất trong repo, vì nó ghi lại một hợp đồng chứ không phải một prompt. Trình tự diễn ra như sau:

• Bạn cung cấp một yêu cầu với trạng thái (thứ đang được đánh giá), các câu hỏi (một lược đồ), và tùy chọn hình ảnh.

• Các tùy chọn của mỗi câu hỏi được ánh xạ thành các ký hiệu đơn token — A đến Z, rồi chữ thường, rồi chữ số, tối đa 62 tùy chọn cho mỗi câu hỏi.

• Lời nhắc hệ thống, trạng thái, lược đồ và một khung JSON trợ lý hoàn chỉnh được kết xuất với một placeholder <decision> cho mỗi trường.

• Một lượt lan truyền xuôi nhân quả được chạy. Logits được đọc tại vị trí ngay trước mỗi placeholder.

• Softmax chỉ được lấy trên các ký hiệu ứng viên được phép của trường đó, hiệu chuẩn của checkpoint được áp dụng, và các ký hiệu được ánh xạ trở lại các giá trị tùy chọn ban đầu của bạn.

Engine cung cấp ba loại câu hỏi. choice nhận một đối tượng có thứ tự ánh xạ các giá trị tùy chọn tới mô tả. score nhận một danh sách — sẽ trở thành các giá trị chuỗi "0", "1", "2", v.v. — hoặc một đối tượng có thứ tự với các khóa chuỗi số hữu hạn, cho phép mô hình trả về giá trị kỳ vọng có trọng số xác suất chứ không chỉ một hạng mục. noul là một quyết định nhị phân với no trước yes. Phản hồi trả về, theo từng trường, phân phối xác suất đã hiệu chỉnh, độ tin cậy bằng xác suất ứng viên tối đa, quyết định argmax với việc phá vỡ hòa theo thứ tự từ vựng, và đối với câu hỏi score là giá trị số kỳ vọng cùng một chú giải. Các giới hạn được nêu rõ: từ một đến mười sáu câu hỏi mỗi yêu cầu, tối đa 62 tùy chọn mỗi câu, mức trần đầu vào mặc định là 8.192 token sẽ bị từ chối thay vì bị cắt bớt, và tối đa tám hình ảnh mà token của chúng được tính vào mức trần đó.

Hai chi tiết trong danh sách đó đáng được chú ý vì chúng quyết định liệu bạn có thể tin tưởng vào đầu ra hay không. Thứ nhất là không có đáp án vàng nào được chèn vào prompt — mô hình đang chấm điểm các ứng viên mà nó chưa được cho biết đáp án. Thứ hai là usage.output_tokens không phải là số lượng token văn bản; nó đếm các trường được chấm điểm. Bất kỳ ai gắn cái này vào một phép tính ngân sách token hiện có sẽ bị bất ngờ vì điều đó, và thẻ nói rõ như vậy thay vì để người ta tự phát hiện.

A single-column scoreboard headed 'Intern-Decision-0.8B — the scoreboard' listing parameters of 852,985,920 across three shards, a repository of about 1.73 GB under Apache 2.0 plus LICENSE-QWEN, an inference path of one causal forward pass with no generate() and no sampling, RTX 4090 latency of 33.98 ms mean and 37.50 ms p95, calibration at Brier 0.530 and ECE 0.066 with a fitted temperature of 2.747760550703, a suite average of 79.38 across seven benchmarks, and WildJailBreak at 64.48 against Jev's 96.29, with a footer noting every figure is vendor-reported and unreproduced.

Bảng benchmark, và nên tin nó đến mức nào

Độc giả hãy lưu ý ở phần này: mọi con số bên dưới đều do nhà cung cấp báo cáo và chưa được tái lập. InternLM đã tự chọn các bộ đánh giá, chọn các mô hình so sánh, chạy các đánh giá và công bố bảng. Không có bất kỳ lần chạy độc lập nào của Intern-Decision-0.8B trên bất kỳ bảng xếp hạng công khai nào, và việc tìm kiếm trên Artificial Analysis không trả về kết quả nào cho mô hình này. Điều đó không làm cho bảng trở thành sai. Nó khiến bảng chưa được kiểm toán, và có nghĩa là các cột hữu ích nhất để đọc hình dạng của kết quả hơn là mức độ của nó.

A screenshot of the Hugging Face model card for internlm/Intern-Decision-0.8B, showing the tags image-text-to-text, Transformers, Safetensors, qwen3_5, decision-making, multimodal and conversational, an Apache-2.0 licence, a model size of 0.9B params in F32-BF16, a seven-file repository, and a model tree naming Qwen/Qwen3.5-0.8B-Base as the base model. The card text reads that Intern-Decision-0.8B is 'a multimodal structured decision model fine-tuned from Qwen3.5-0.8B' which 'accepts a shared state, a schema of named questions, and optional images, and returns an answer distribution for every question in one model forward pass', followed by a three-step 'How inference works' list.

• Jevbench, ba phần chia — Intern-Decision-0.8B đạt 97.92 trên Easy, 80.56 trên Original và 52.25 trên Hard. Jev của TypeSafe đạt 100.00, 98.61 và 72.07 trên cùng các phần chia.

• Typed Decision — mô hình 0.8B đạt 77.35 so với 73.35 của Jev. Đây là cột duy nhất mà mô hình nhỏ nhất trong nhóm đánh bại mô hình mà benchmark được đặt tên theo.

• ToolACE — 94,52 đối với 0.8B so với 91,29 của Jev. ToolACE là một benchmark gọi hàm, và một đầu quyết định vượt trội Jev về lựa chọn công cụ là tuyên bố có tính thực chất nhất trong bảng.

• AG News — 88,61 so với 89,57 của Jev. Thực tế ngang bằng với mức tiên tiến nhất của hạng mục này trong phân loại chủ đề bốn lớp.

• WildJailBreak — 64,48 so với 96,29 của Jev. Đây là sự sụp đổ. Có thể nói rằng đây là cột quan trọng nhất đối với một mô hình mà bạn sẽ hướng vào đầu vào không đáng tin cậy, và cũng là cột mà 0.8B xa mốc tham chiếu nhất.

• Trung bình — 79,38 cho bản 0.8B, 84,68 cho người anh em 2B cùng dòng của nó, 90,02 cho bản 4B. Cả dòng tăng vọt, đúng như bạn kỳ vọng, và bản thân điều đó là một lập luận nhẹ rằng bảng số liệu này không bị thiết kế ngược để tô vẽ cho mẫu flagship.

• Hiệu chuẩn — Brier 0.530 và sai số hiệu chuẩn kỳ vọng 0.066 đối với mô hình 0.8B. Jev báo cáo 0.358 và 0.095. Đọc hai con số đó cùng nhau sẽ hiện ra một bức tranh rõ ràng hơn so với khi đọc riêng từng con số: xét theo nghĩa ECE, mô hình 0.8B được hiệu chuẩn tốt hơn Jev — các mức độ tự tin mà nó nêu ra bám sát độ chính xác của nó hơn — trong khi nhìn tổng thể lại kém chính xác hơn một cách đáng kể. Đó là một hồ sơ khả dĩ cho một mô hình nhỏ với nhiệt độ được khớp một cách có chủ đích, và đây không phải là một sự kết hợp tôn lên hình ảnh nếu bị công bố do vô tình.

Bộ so sánh có một đặc điểm dễ thấy: nó bị chi phối bởi các mô hình quyết định. Jev, Laya, SemIf, Kev và JevK5 đều xuất hiện; benchmark của chính bảng này là của TypeSafe. InternLM đã chọn được đo lường trên sân nhà của đối thủ, dùng khung đánh giá của đối thủ, rồi công bố những cột mà mô hình nhỏ nhất của mình thua. Đó là kiểu quyết định mà một đội ngũ đưa ra khi họ không có kế hoạch biến việc phát hành thành một chiến dịch tiếp thị — điều này nhất quán với mọi thứ khác về cách nó được tung ra.

Nhiệt độ hiệu chuẩn là con số thú vị nhất

Intern-Decision-0.8B khớp với nhiệt độ mặc định là 2.747760550703, thông qua việc tối thiểu hóa NLL trên 1.728 trường hợp hiệu chuẩn được chỉ định cùng với 1.693 trường hợp kiểm định riêng biệt. Thẻ nêu rõ rằng nhãn của bộ kiểm thử đã không được dùng để chọn giá trị này. Phép biến đổi được áp dụng là p = softmax(candidate_logits.float()) tiếp theo là calibrated_p = softmax(log(p) / T).

Đó là hiệu chuẩn xác suất ứng viên, không phải là nhiệt độ lấy mẫu, và sự khác biệt này không phải là chuyện bắt bẻ. Bởi vì phép biến đổi được áp dụng sau softmax và bảo toàn thứ tự, nó hoàn toàn không thể thay đổi quyết định argmax. Nó dịch chuyển độ tin cậy, xác suất 'có' noul, và giá trị kỳ vọng của một câu hỏi điểm — đồng thời giữ nguyên quyết định chính. Nếu quy trình của bạn đọc nhãn, thì nhiệt độ chẳng có tác dụng gì. Nếu quy trình của bạn đọc xác suất — đặt ngưỡng cho nó, xếp hạng theo nó, hoặc đưa nó vào một phép tính giá trị kỳ vọng ở hạ nguồn — thì nhiệt độ là sự khác biệt giữa một con số có ý nghĩa và một con số không có ý nghĩa. Truyền temperature=1 trả về phân phối chưa hiệu chuẩn, đây là một lối thoát hữu ích cho bất kỳ ai muốn áp dụng hiệu chuẩn của riêng họ lên trên.

Nhiệt độ được hiệu chỉnh theo từng checkpoint thay vì dùng chung. Mô hình 4B sử dụng một giá trị khác, 1.99241824, và thẻ hướng dẫn bạn dùng mô-đun suy luận đi kèm với kích thước bạn đã tải xuống để hiệu chuẩn mặc định của nó khớp. Bất kỳ ai sao chép một trình bao suy luận từ mô hình anh em này sang mô hình anh em khác sẽ âm thầm áp dụng sai nhiệt độ.

Ba mươi bốn mili giây, và một kết quả lẽ ra không thể có

InternLM đã đo độ trễ đầu-cuối cho mỗi truy vấn trên một RTX 4090 bằng đường dẫn Hugging Face cục bộ — một phép đo thực, nhưng cũng là cấu hình phục vụ chậm nhất có thể, vì một triển khai production sẽ dùng runtime đã biên dịch hoặc có xử lý theo lô. Jev được ghi nhận ở mức trung bình 109,70 ms và trung vị 106,30 ms với p95 là 146,70 ms. Intern-Decision-0.8B đạt 33,98 / 33,44 / 37,50 ms.

Con số đáng để dừng lại là con số của phiên bản 2B cùng dòng: trung bình 33,28 ms, trung vị 33,15 ms. Phiên bản 2B nhanh hơn so với bản 0,8B, với mức chênh nhỏ đến mức có thể chỉ là nhiễu, nhưng lại không theo hướng mà số lượng tham số dự đoán. Đó không phải là lỗi trong bảng và cũng không thực sự liên quan đến các mô hình. Một mô hình ra quyết định chỉ thực hiện đúng một lượt truyền xuôi trên một prompt có độ dài được quyết định bởi trạng thái, schema và các mô tả tùy chọn — chứ không phải bởi bất cứ thứ gì mô hình viết ra, vì nó không viết gì cả. Với những prompt thuộc dạng đó, việc xử lý prompt chiếm ưu thế còn số lượng tham số chỉ là một khoản chi phí bậc hai. Hệ quả thực tế là lý do thường thấy để tìm đến checkpoint nhỏ nhất — bạn đang trả tiền theo token — không áp dụng ở đây. Lý do thực sự để chọn bản 0,8B thay vì bản 2B là dung lượng bộ nhớ và việc toàn bộ kho lưu trữ của nó chỉ vừa trong 1,73 GB, chứ không phải thông lượng.

Những gì chưa thể được xác lập

Đây chính là phần mà một bài đăng ra mắt lẽ ra phải trả lời được, còn một kho lưu trữ thì không.

Không có ngày phát hành nào được nêu, không có thông báo nào, và không có gì trên các kênh công khai của InternLM mô tả dòng mô hình này. URL GitHub in trên thẻ mô hình không phân giải được. Space demo được nhắc đến trong thẻ không thể đọc công khai. Không có bộ sưu tập nào tập hợp ba checkpoint, nghĩa là cách duy nhất để tìm 2B hoặc 4B là xem danh sách mô hình của tổ chức. Không có bài báo, nên dữ liệu huấn luyện, công thức tinh chỉnh, số bước huấn luyện, và những gì "decision tuning" đã sửa đổi trong các trọng số đều không được nêu. Không có đánh giá độc lập, không có bên thứ ba tái lập độ trễ, và chưa có bằng chứng rằng bất kỳ ai ngoài InternLM đã chạy checkpoint.

Thẻ này cũng đặt ra hai câu hỏi mà không trả lời. Câu hỏi thứ nhất là khoảng cách WildJailBreak thực sự có nghĩa gì trên thực tế: mức thiếu hụt về độ bền từ chối lớn đến vậy là một thuộc tính của bước tinh chỉnh, và liệu nó phản ánh mô hình nền, mục tiêu tinh chỉnh quyết định, hay số lượng tham số nhỏ bé thì kho lưu trữ không cho bạn biết. Câu hỏi thứ hai là điều gì xảy ra ở ngưỡng đầu vào tối đa. Các yêu cầu vượt quá 8.192 token sẽ bị từ chối thay vì bị cắt bớt, đây là hành vi đúng đắn đối với một mô hình chấm điểm, nhưng điều đó có nghĩa là cửa sổ ngữ cảnh thực tế không phải là 262.144 như cấu hình quảng cáo — mà là bất cứ thứ gì vừa với 8.192 token gồm trạng thái, lược đồ, tùy chọn và các mảng ảnh. Với những tài liệu dài có lược đồ phong phú, ngưỡng đó đến sớm hơn so với những gì sơ đồ kiến trúc gợi ý.

Nó nằm ở đâu và cách dùng thử mà không phải đặt cược vào nó

Cách diễn đạt trung thực là: Intern-Decision-0.8B là một checkpoint đã phát hành với những tuyên bố chưa được kiểm chứng và không có tài liệu hỗ trợ. Tổ hợp đó không phải là lý do để bỏ qua nó — một bản phát hành trọng số theo Apache-2.0 mà bạn có thể tải về và đo đạc trong một buổi chiều thì vẫn là tình huống tốt hơn so với một API phải xếp hàng chờ — nhưng điều đó cũng có nghĩa là gánh nặng xác minh nằm ở phía bạn. Engine tải từ một thư mục cục bộ, chạy trên GPU tầm 4090 hoặc yếu hơn, và thẻ mô hình cung cấp một yêu cầu mẫu đã hoàn chỉnh để bạn dán vào. Một ngày đánh giá dựa trên chính các ca có nhãn của bạn sẽ cho bạn biết nhiều hơn về cột WildJailBreak so với bảng của nhà cung cấp.

Nếu lớp quyết định là phần bạn đang đánh giá, thì đối tượng so sánh hữu ích là một dịch vụ được host. Jev 1.13 của TypeSafe là mô hình mà InternLM đã lấy làm mốc so sánh, và hiện nay có thể gọi nó thông qua một endpoint tương thích OpenAI duy nhất với mức $0,042 cho mỗi triệu token đầu vào, còn đầu ra được tính phí bằng 0 — đúng mức giá mà nhà cung cấp công bố, bởi vì OrcaRouter chuyển tiếp nguyên giá niêm yết của nhà cung cấp mà không thêm phụ phí thay vì cộng thêm biên lợi nhuận lên trên. Việc đặt một đầu quyết định 0.8B tự host và một API quyết định được host trên cùng một key, trong cùng một buổi chiều, là một thử nghiệm rẻ hơn đáng kể so với việc thiết lập hai hợp đồng riêng để trả lời cùng một câu hỏi.

A screenshot of the OrcaRouter model page for typesafe/jev-1.13, dated 2026-09-24, showing a 65K token context, text input and text output, a P95 time to first token of 170 ms, and list pricing of $0.042 per million input tokens with no output rate. The description reads that Jev is TypeSafe's structured decision and evaluation model, taking a state and a set of named questions (noul, choice, score) and returning a structured answer for each, served non-streaming via POST /v1/systemone. A performance panel lower down reports a P50 time to first token of 178 ms and an output speed of 569 tokens per second.

Điều có thể thay đổi cục diện này không phải là một benchmark. Mà là kho GitHub xuất hiện, hoặc InternLM công bố công thức tinh chỉnh, hoặc lần chạy độc lập đầu tiên của checkpoint được đưa lên bảng xếp hạng. Cho đến khi một trong những điều đó xảy ra, mô tả chính xác về Intern-Decision-0.8B là hạn hẹp và không mấy hay ho, và hoàn toàn có lợi cho nó: các trọng số là thật, hợp đồng suy luận được ghi tài liệu tốt hơn hầu hết mô hình đã ra mắt làm được, và hoạt động tiếp thị vẫn chưa bắt đầu.