Thẻ tiêu đề được tạo cho việc so sánh Decision 3.0 và Intern-Decision-4B, với phụ đề 'cùng nền tảng Qwen3.5-4B, hai câu trả lời khác nhau', cùng các chip ghi '26 thg 9 so với 10 thg 10', 'video so với chỉ hình ảnh', 'Brier được công bố so với không', và phần chân trang ghi 'Các số liệu của Decision 3.0 là của chính vLLM-SR; các số liệu của Intern-Decision-4B là của chính InternLM; không có số liệu nào được tái lập độc lập.' Logo OrcaRouter được ghép ở góc dưới bên phải.
Engineering & Research

Decision 3.0 vs Intern-Decision-4B: Hai đội đã tinh chỉnh cùng một mô hình và bất đồng về mọi thứ khác

Tác giả

Alistair Wren

Ngày đăng

Mô hình mới nhất · 20Xem tất cả mô hình →
Benchmark: Artificial Analysis · cập nhật hằng ngày
Quay lại tất cả bài viết

Đặt d3-mini, thành viên 4B của Decision 3.0, bên cạnh Intern-Decision-4B và điều đầu tiên bạn nhận ra không phải là sự khác biệt. Cả hai đều là bản tinh chỉnh của cùng một checkpoint cơ sở, Qwen3.5-4B. Cả hai đều được liệt kê ở 4,54 tỷ tham số. Cả hai đều nhận một trạng thái, một lược đồ gồm các câu hỏi được đặt tên và một tập câu trả lời ứng viên, rồi trả về một xác suất đã hiệu chỉnh cho mỗi ứng viên mà không sinh ra token nào. Cả hai đều theo Apache-2.0. Cả hai đều được phát hành mà không có thông báo — InternLM đã tải lên ba checkpoint trong bốn mươi giây vào ngày 26 tháng 9 năm 2026, còn nhóm Decision 3.0 của vLLM-SR đã lên Hugging Face vào ngày 10 tháng 10 năm 2026 với tin tức chỉ được đưa bởi tài khoản X của dự án vLLM.

Mọi thứ sau đó đều là bất đồng. Họ bất đồng về cách đọc ra một xác suất từ mô hình, về việc video có được tính là đầu vào hay không, về việc một yêu cầu có thể dài đến mức nào, và — gay gắt nhất — về việc liệu nhóm có sẵn sàng công bố con số nói rằng độ tin cậy của chính nó là đáng tin cậy hay không. Bài viết này nói về bốn bất đồng đó và cái giá mà mỗi bất đồng khiến bạn phải trả, chứ không phải về việc mô hình nào "tốt hơn", bởi vì hai mô hình không được đo trên cùng một thang đo và không thể được xếp hạng với nhau nếu không làm công việc mà cả hai nhà cung cấp đều chưa làm.

Sự trùng hợp đáng để hiểu trước tiên

Việc hai phòng thí nghiệm chọn cùng một backbone 4B trong vòng hai tuần không hẳn là điều đáng ngạc nhiên — Qwen3.5-4B là một nền tảng hợp lý cho một mô hình đầu ra có cấu trúc, và cả hai nhóm rõ ràng đã tìm đến nó vì nó đủ nhỏ để chạy rẻ và đủ mạnh để đọc hiểu chỉ dẫn. Điều đáng ngạc nhiên là họ đạt cùng số lượng tham số đến bốn chữ số có nghĩa. Điều đó cho bạn thấy rằng quá trình tinh chỉnh đã giữ nguyên kiến trúc, và không bên nào thêm một tháp thị giác riêng đủ lớn để làm thay đổi tổng số. Cả hai đều gộp khả năng đa phương thức của mình vào cùng một bộ trọng số.

Phần thú vị nằm ở khâu đọc kết quả. Về nguyên tắc, cả hai mô hình đều trả lời câu hỏi theo cùng một cách — chấm điểm các câu trả lời ứng viên thay vì sinh ra chúng — nhưng cơ chế thì hoàn toàn khác nhau:

• Intern-Decision-4B — ánh xạ mọi tùy chọn thành một ký hiệu token duy nhất (A–Z, sau đó a–z, sau đó 0–9), kết xuất một bộ khung JSON vào prompt với một placeholder cho mỗi trường, và chạy một lượt lan truyền xuôi nhân quả, đọc logits tại vị trí ngay trước mỗi placeholder. Cơ chế này được tài liệu hóa từng bước trên model card của nó, bao gồm cả bước softmax và temperature chính xác.

• d3-mini — cung cấp một kiến trúc tùy chỉnh trong modeling_d3.py với một đầu đọc riêng trong readout.safetensors của riêng nó, một decision_config.json khai báo noncausal_full_attention và pooling token cuối, và một ánh xạ token sang mã được định nghĩa trong cấu hình thay vì được mô tả bằng văn xuôi.

Không có cách tiếp cận nào rõ ràng là tốt hơn. Hướng InternLM có lợi thế là nó chạy trên một lớp mô hình Hugging Face tiêu chuẩn với một chuỗi số đã được tài liệu hóa — bạn có thể kiểm tra lại công việc của nó. Hướng vLLM-SR có lợi thế là phần đọc ra là một head đã được huấn luyện chứ không phải là phép chiếu của một embedding token hiện có, vốn là một cách khớp tự do hơn, và cái giá phải trả là bạn phải trust_remote_code=True và chạy mã của họ để làm được bất cứ điều gì.

Các giới hạn mà mỗi bên công bố

Đây là lúc một sở thích thực sự bắt đầu hình thành, vì một thẻ cụ thể hơn hẳn thẻ còn lại về việc nó ngừng hoạt động ở đâu.

• Mức trần đầu vào — Intern-Decision-4B: mặc định là 8.192 token và các yêu cầu vượt quá mức đó bị từ chối thẳng, không bao giờ bị cắt ngắn, với mức trần được đặt bằng một đối số constructor. d3-mini: max_length là null trong cấu hình phát hành và không có ngân sách token nào xuất hiện ở bất cứ đâu trên card.

• Câu hỏi mỗi yêu cầu — Intern-Decision-4B: từ 1 đến 16, với mức tối đa được nêu là 62 lựa chọn trong bất kỳ một câu hỏi nào. d3-mini: không nêu giới hạn; thẻ chỉ nói rằng các câu hỏi được trả lời cùng nhau, mỗi câu từ lượt truyền xuôi riêng của nó.

• Hình ảnh — Intern-Decision-4B: tối đa tám ảnh mỗi yêu cầu, được sắp xếp theo một danh sách do bạn cung cấp, với bộ xử lý checkpoint đảm nhiệm việc thay đổi kích thước và mở rộng token. d3-mini: nhiều ảnh mỗi yêu cầu dưới dạng đường dẫn, URL, ảnh PIL hoặc URL dữ liệu base64, mỗi ảnh được đọc ở độ phân giải tối đa 1,6 megapixel, mọi câu hỏi đều thấy mọi hình ảnh.

• Video — Intern-Decision-4B: không có. d3-mini: nhiều video, đọc ở tốc độ 2 khung hình mỗi giây, giới hạn tối đa 32 khung hình trải khắp clip và 0,2 megapixel mỗi khung hình.

Trần đầu vào là ranh giới sẽ quyết định điều này đối với hầu hết mọi người. Ngân sách 8.192 token được chia sẻ giữa trạng thái, hướng dẫn câu hỏi và mô tả ứng viên là một ràng buộc thực sự đối với công việc chấm điểm tài liệu và định tuyến ngữ cảnh dài mà những mô hình này được bán để đảm nhiệm, và InternLM đáng được ghi nhận vì đã nói rõ điều đó thay vì để nó bị phát hiện. Việc vLLM-SR không nêu điều đó thì ngược lại: không phải một giới hạn ẩn, mà là một giới hạn chưa biết, và đọc kho lưu trữ bao nhiêu cũng không giải quyết được điều đó.

Hiệu chuẩn mới là sự phân chia thực sự

Mọi mô hình ra quyết định đều đưa ra cùng một lời hứa: con số mà nó trả về là một xác suất, và các ngưỡng được đặt dựa trên con số đó có ý nghĩa. Gần như không mô hình nào trong số đó chứng minh được điều này. Đây là chỗ hai bản phát hành khác biệt rõ nhất, và sự khác biệt đó đi theo hướng ngược lại với hướng mà bạn sẽ đoán từ ngày phát hành.

Intern-Decision-4B công bố, trên card của chính nó, điểm Brier 0.347 và lỗi hiệu chuẩn kỳ vọng 0.065 trên trung bình bảy benchmark, một temperature đã fit là 1.99241824 thu được bằng tối thiểu hóa NLL trên 1,728 ca hiệu chuẩn được chỉ định cùng 1,693 ca kiểm định riêng biệt, một tuyên bố rõ ràng rằng nhãn của bộ kiểm thử đã không được dùng để chọn temperature đó, và một chẩn đoán 96 ca cho thấy hiệu chuẩn của nó chuyển từ 0.628 Brier / 0.213 ECE trước temperature scaling sang 0.550 / 0.089 sau đó. Nó cũng nêu mặc định và nói rằng hiệu chuẩn là theo từng checkpoint, nên dùng một kích thước khác với mô-đun này sẽ không khớp.

Decision 3.0 công bố một chỉ số độ chính xác và một tuyên bố về độ phủ — cả 140.178 yêu cầu công khai đều được trả lời, không có yêu cầu nào không được hỗ trợ — và hoàn toàn không có con số hiệu chuẩn nào. Không có điểm Brier, không có ECE, không có temperature nào được nêu, trên bất kỳ điểm kiểm tra nào trong số sáu điểm kiểm tra.temperaturetrong bản phát hành của d3 decision_config.jsonlà 1.0, tức là giá trị identity và có thể là hoặc không phải là giá trị được khớp; tập tin không nói rõ.

Đọc hai tiêu đề chỉ mục cạnh nhau và sự bất đối xứng càng trở nên tệ hơn. Thẻ của d3-mini báo cáo điểm public-suite 54,90 trên Jev Decision Index 0.3, được mô tả là đo bằng bộ công cụ chính thức trên các trọng số đã phát hành, trong khi các hàng so sánh trên cùng bảng đó được mô tả là dữ liệu bảng trực tiếp. Intern-Decision-4B báo cáo mức trung bình 90,02 trên bảy benchmark của chính nó. Hai con số đó không cùng thang đo, chúng không dùng cùng các tác vụ, và đặt chúng vào một câu như một phép so sánh sẽ là không trung thực. Điều có thể so sánh được là việc công bố thông tin: một thẻ cho bạn biết các độ tin cậy của nó sai đến mức nào, còn thẻ kia thì không biết hoặc sẽ không nói.

A generated two-column scoreboard headed 'Decision 3.0 d3-mini vs Intern-Decision-4B - the scoreboard'. The left column for d3-mini reads: base model Qwen3.5-4B fine-tuned, 4.54B parameters; input ceiling not stated on the card; video input yes, up to 32 frames at 2 fps; calibration figures none published; reported score Jev Decision Index 0.3 public suite 54.90; latency median 17.5 ms text and 96.2 ms image. The right column for Intern-Decision-4B reads: base model Qwen3.5-4B fine-tuned, 4.54B parameters; input ceiling 8,192 tokens, rejected not truncated; video input none, images only up to eight; calibration Brier 0.347, ECE 0.065 and temperature 1.99241824; reported score 90.02 seven-benchmark average; latency mean 44.16 ms and median 44.03 ms on one RTX 4090. A footer reads 'd3-mini figures are vLLM-SR's own; Intern-Decision-4B figures are InternLM's own; neither is independently reproduced.'

Độ trễ, và tại sao hai tập hợp mili giây cũng không thể so sánh với nhau.

Cả hai thẻ đều công bố độ trễ trên mỗi yêu cầu, và việc coi chúng đúng như những gì được công bố sẽ là một sai lầm vì cùng lý do các số liệu độ chính xác không thể so sánh được.

• Intern-Decision-4B — trung bình 44,16 ms, trung vị 44,03 ms, p95 44,60 ms, được đo trên một RTX 4090 duy nhất thông qua đường dẫn Hugging Face cục bộ, được mô tả là phụ thuộc vào khối lượng công việc và phần cứng.

• d3-mini — trung vị 17,5 ms cho văn bản, 96,2 ms với một hình ảnh, 371,5 ms với video mười giây, trên một AMD Instinct MI325X, mỗi lần một yêu cầu.

Hai điều khiến chúng không thể so sánh được với nhau. Thứ nhất là phần cứng và đường đi phần mềm: một chiếc 4090 so với một chiếc MI325X, một lượt forward pass nguyên bản của Hugging Face so với một cách triển khai attention tùy chỉnh với các kernel masked-layer có sẵn thông qua flash-linear-attention. Thứ hai là khối lượng công việc: con số của InternLM được mô tả là end-to-end theo từng truy vấn trên một hỗn hợp không được nêu rõ, còn con số của vLLM-SR được tách riêng theo phương thức đầu vào, nên phép so sánh chỉ dùng văn bản là dòng duy nhất thực sự cùng loại, và ngay cả nó cũng trải qua hai nhà cung cấp GPU khác nhau.

Con số cần rút ra từ cả hai thẻ không phải là thứ hạng, mà là hình dạng. Một mô hình ra quyết định được gọi lặp đi lặp lại bên trong một quy trình công việc — một bản ghi hỗ trợ có thể cần điểm đến, kiểm tra hoàn tiền, quyết định leo thang và điểm ưu tiên, tức bốn câu hỏi, và một lô 128 bản ghi biến nó thành 512 quyết định. Ở khối lượng đó, cả 17 ms lẫn 44 ms đều biến mất so với chi phí của mô hình sinh ở hạ nguồn. Những con số phụ thuộc phương thức mới là thứ cần để ý, vì một yêu cầu hình ảnh hoặc video có chi phí gấp từ năm đến hai mươi lần một yêu cầu văn bản theo chính số liệu của d3-mini, và nếu quyết định của bạn đang được đưa ra trên một ảnh chụp màn hình thì bạn đã mang vào một cấu hình chi phí mà hầu hết các triển khai mô hình ra quyết định không có.

Thực sự nên chọn cái nào

Nếu quyết định bạn cần đưa ra phụ thuộc vào video, thì không có gì phải bàn cãi và không cần phân tích: Decision 3.0 đọc được video còn Intern-Decision-4B thì không. Đó là toàn bộ câu trả lời cho bất cứ điều gì liên quan đến bản ghi màn hình, clip từ camera hoặc chuỗi khung hình, và chính khoảng cách về năng lực này tự nó đã đủ để biện minh cho sự tồn tại của dòng sản phẩm mới hơn.

Nếu đầu vào của bạn là văn bản và thỉnh thoảng có hình ảnh, thì sự lựa chọn phụ thuộc vào hai điều và không điều nào trong số đó là bảng xếp hạng.

Hãy dùng Intern-Decision-4B khi bạn cần suy luận về các ngưỡng. Nó là mô hình duy nhất trong hai mô hình cho bạn biết liệu 0.9 có nghĩa là chín lần trên mười, nó nêu rõ temperature của mình, nó cho biết những trường hợp nào mà temperature đó được fit trên đó, và nó ghi lại suy luận của mình dưới dạng một quy trình ngắn có đánh số mà bạn có thể tái triển khai trên một lớp mô hình dựng sẵn. Với một bộ chấm điểm đứng trước một hành động tự động, đó chính là thuộc tính quan trọng, và nó hiếm hơn cả những điểm accuracy.

Hãy chọn Decision 3.0 khi bạn cần phạm vi hoặc các phương thức. Sáu checkpoint từ 0.59B đến 26.09B có nghĩa là cùng một định dạng yêu cầu có thể được phục vụ bởi một mô hình edge 6.7 ms và một mô hình 27B, và cả họ mô hình chia sẻ một giao diện, nên việc di chuyển giữa các tầng chỉ là thay đổi cấu hình chứ không phải viết lại. Vấn đề là bạn đang tin vào một hạn mức đầu vào không được công bố và một tuyên bố hiệu chuẩn chưa được kiểm toán, và mô hình lớn nhất trong họ lại là mô hình mà nhà cung cấp đo chỉ số của nó trên bộ kiểm thử riêng của họ.

Hiện nay, cả hai đều không phải là mặc định an toàn. Checkpoint được tải xuống nhiều nhất của d3 đã có mặt trên Hugging Face được khoảng một ngày; Intern-Decision-4B đã xuất hiện được hai tuần và thu hút khoảng 3.200 lượt tải xuống cùng 83 lượt thích, đó là sự chú ý nhưng không phải lưu lượng production. Cả hai đều đủ rẻ để thử nghiệm và cả hai đều không có đánh giá của bên thứ ba đằng sau. Nếu bạn đang đặt một bộ chấm điểm trước một thứ tiêu tốn tiền, động thái đúng đắn là chạy cả hai trên các trường hợp đã được gán nhãn của riêng bạn và so sánh các đường cong hiệu chuẩn, chứ không phải các hàng chỉ mục.

A screenshot of the Intern-Decision-4B model card on Hugging Face. The header shows 83 likes, 1.34k followers and tags for Image-Text-to-Text, Transformers, Safetensors, qwen3_5, decision-making, multimodal, structured-prediction and conversational under an Apache-2.0 licence, with the model size listed as 5B parameters in F32 or BF16 and the base model pinned to Qwen/Qwen3.5-4B. A section titled 'How inference works' lists five numbered steps: map each question's options to single-token symbols A to Z then a to z then 0 to 9; render the state, decision schema and a JSON skeleton with one decision placeholder per field; run one causal forward pass and read logits immediately before each placeholder; take a softmax over the allowed candidate-symbol logits and apply the checkpoint's probability calibration; and map symbols back to the original option values. It states that the API never calls generate() and samples no free-form text. A benchmark results table below carries Jevbench Easy, Jevbench Original, Jevbench Hard, Typed Decision, ToolACE, AG News and WildJailBreak columns for the Jev, Laya, Semif and Kev rows. The sidebar reports 3,179 downloads last month.

Router phù hợp ở đâu, thành thật mà nói

OrcaRouter không cung cấp cả hai mô hình này. Các checkpoint của Decision 3.0 là một đường suy luận Python cục bộ trong một kho lưu trữ Hugging Face không công bố endpoint HTTP nào, và Intern-Decision-4B được phát hành dưới dạng một DecisionEngine class mà bạn tự khởi tạo. Cả hai đều không phải là thứ chúng tôi có thể định tuyến tại thời điểm này, và không phần nào của bài viết này nên được hiểu như một tuyên bố về tính khả dụng.

Những gì chúng tôi cung cấp là phiên bản hosted của cùng dòng sản phẩm đó. typesafe/jev-1.13 nằm trong danh mục của chúng tôi, được phục vụ qua POST /v1/systemone — cùng hợp đồng state-and-named-questions mà cả hai mô hình mở ở trên đều triển khai — với mức $0.042 mỗi triệu token đầu vào và không tính phí completion, vì nó không bao giờ tạo ra token completion nào. Nó nằm cạnh hơn 200 mô hình khác, và đó chính là điểm thực tiễn cho bất kỳ ai đang so sánh hai mô hình này: mô hình chấm điểm là phần rẻ trong vòng lặp, còn mô hình hành động dựa trên quyết định mới là phần tốn kém. Định tuyến cả hai qua một khóa duy nhất, với tính năng chuyển đổi dự phòng tự động khi một nhà cung cấp gặp trục trặc và giá niêm yết của nhà cung cấp được chuyển nguyên với mức markup 0%, nghĩa là việc đánh giá một mô hình ra quyết định không đòi hỏi phải ký thêm hợp đồng thứ hai hay viết lại call site khi bạn chuyển đổi backend. Nếu bạn đang trong quá trình đánh giá — và cả hai mô hình này hiện nay đều đang ở giai đoạn đó — thì đó là phần đáng để thiết lập trước khi bạn cam kết với bất kỳ mô hình nào.

A screenshot of the OrcaRouter model page for Jev 1.13. The header reads 'Jev 1.13', by TypeSafe, dated 2026-09-24, tagged NEW, with a specification panel reading 65K tokens of context, text input, text output and a p50 time-to-first-token of 176 ms, and the endpoint listed as /v1/systemone. The description says it is TypeSafe's structured decision and evaluation model, given a state and a set of named questions (noul / choice / score), returning a structured answer for each, served via POST /v1/systemone, non-streaming, up to about 64K input tokens, text in and structured JSON out. The metric strip reads input /bin/bash.04 per 1M tokens, no output price, p50 TTFT 176 ms, p95 TTFT 423 ms and 59.3M tokens of traffic over 7 days. Buttons read 'Get the Jev 1.13 API' and 'Try in playground', and a code sample shows a POST to https://api.orcarouter.ai/v1/systemone with the model typesafe/jev-1.13 and a state plus noul, choice and score questions.

Câu hỏi mở

Hai model card bất đồng về việc một tác giả mô hình nợ người đọc điều gì, và sự bất đồng đó thú vị hơn chính các mô hình. InternLM đã công bố một temperature cùng những trường hợp mà nó được fit trên đó, rồi công bố bản chẩn đoán cho thấy calibration đã cải thiện đến mức nào. vLLM-SR đã công bố hash tệp, ghim các bản sửa đổi cơ sở, một mục tiêu phần cứng được nêu rõ, một tuyên bố về độ bao phủ — công việc truy xuất nguồn gốc thực sự — và hoàn toàn không có một con số calibration nào.

Phép thử xem bản phát hành nào chín muồi không phải là bản nào thắng một bảng xếp hạng. Mà là liệu checkpoint Decision tiếp theo có được phát hành kèm điểm Brier hay không, và liệu bản tải lên tiếp theo của InternLM có đạt tới video hay không. Cả hai đều có thể thấy từ bên ngoài, cả hai đều dễ kiểm chứng với chi phí thấp, và cả hai đều chưa xảy ra.