
Decision 3.0 vs Intern-Decision-4B: Hai đội đã tinh chỉnh cùng một mô hình và bất đồng về mọi thứ khác
- OrcaMỚIOrca: OrcaCyber Zero 1.52026-10-10$3.00 / $7.50 trên 1 triệu token · 71 tok/s
- openaiMỚIOpenAI: GPT-6.1 Sol2026-09-2952Trí tuệ
- anthropicMỚIAnthropic: Claude Sonnet 5.52026-09-2856Trí tuệ
- typesafeTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 trên 1 triệu token · 116 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238Trí tuệ
- OpenAIOpenAI: GPT-6 Sol2026-09-2248Trí tuệ
- AnthropicAnthropic: Claude Opus 5.52026-09-2258Trí tuệ
- xAIGrok 4.72026-09-2146Trí tuệ
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 trên 1 triệu token · 48 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 trên 1 triệu token · 478 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Trí tuệ
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Trí tuệ77Lập trình
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Trí tuệ76Lập trình
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Trí tuệ76Lập trình
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Trí tuệ82Lập trình
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 trên 1 triệu token · 59 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 trên 1 triệu token · 389 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Trí tuệ72Lập trình
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 trên 1 triệu token · 231 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Trí tuệ75Lập trình
Đặt d3-mini, thành viên 4B của Decision 3.0, bên cạnh Intern-Decision-4B và điều đầu tiên bạn nhận ra không phải là sự khác biệt. Cả hai đều là bản tinh chỉnh của cùng một checkpoint cơ sở, Qwen3.5-4B. Cả hai đều được liệt kê ở 4,54 tỷ tham số. Cả hai đều nhận một trạng thái, một lược đồ gồm các câu hỏi được đặt tên và một tập câu trả lời ứng viên, rồi trả về một xác suất đã hiệu chỉnh cho mỗi ứng viên mà không sinh ra token nào. Cả hai đều theo Apache-2.0. Cả hai đều được phát hành mà không có thông báo — InternLM đã tải lên ba checkpoint trong bốn mươi giây vào ngày 26 tháng 9 năm 2026, còn nhóm Decision 3.0 của vLLM-SR đã lên Hugging Face vào ngày 10 tháng 10 năm 2026 với tin tức chỉ được đưa bởi tài khoản X của dự án vLLM.
Mọi thứ sau đó đều là bất đồng. Họ bất đồng về cách đọc ra một xác suất từ mô hình, về việc video có được tính là đầu vào hay không, về việc một yêu cầu có thể dài đến mức nào, và — gay gắt nhất — về việc liệu nhóm có sẵn sàng công bố con số nói rằng độ tin cậy của chính nó là đáng tin cậy hay không. Bài viết này nói về bốn bất đồng đó và cái giá mà mỗi bất đồng khiến bạn phải trả, chứ không phải về việc mô hình nào "tốt hơn", bởi vì hai mô hình không được đo trên cùng một thang đo và không thể được xếp hạng với nhau nếu không làm công việc mà cả hai nhà cung cấp đều chưa làm.
Sự trùng hợp đáng để hiểu trước tiên
Việc hai phòng thí nghiệm chọn cùng một backbone 4B trong vòng hai tuần không hẳn là điều đáng ngạc nhiên — Qwen3.5-4B là một nền tảng hợp lý cho một mô hình đầu ra có cấu trúc, và cả hai nhóm rõ ràng đã tìm đến nó vì nó đủ nhỏ để chạy rẻ và đủ mạnh để đọc hiểu chỉ dẫn. Điều đáng ngạc nhiên là họ đạt cùng số lượng tham số đến bốn chữ số có nghĩa. Điều đó cho bạn thấy rằng quá trình tinh chỉnh đã giữ nguyên kiến trúc, và không bên nào thêm một tháp thị giác riêng đủ lớn để làm thay đổi tổng số. Cả hai đều gộp khả năng đa phương thức của mình vào cùng một bộ trọng số.
Phần thú vị nằm ở khâu đọc kết quả. Về nguyên tắc, cả hai mô hình đều trả lời câu hỏi theo cùng một cách — chấm điểm các câu trả lời ứng viên thay vì sinh ra chúng — nhưng cơ chế thì hoàn toàn khác nhau:
• Intern-Decision-4B — ánh xạ mọi tùy chọn thành một ký hiệu token duy nhất (A–Z, sau đó a–z, sau đó 0–9), kết xuất một bộ khung JSON vào prompt với một placeholder cho mỗi trường, và chạy một lượt lan truyền xuôi nhân quả, đọc logits tại vị trí ngay trước mỗi placeholder. Cơ chế này được tài liệu hóa từng bước trên model card của nó, bao gồm cả bước softmax và temperature chính xác.
• d3-mini — cung cấp một kiến trúc tùy chỉnh trong modeling_d3.py với một đầu đọc riêng trong readout.safetensors của riêng nó, một decision_config.json khai báo noncausal_full_attention và pooling token cuối, và một ánh xạ token sang mã được định nghĩa trong cấu hình thay vì được mô tả bằng văn xuôi.
Không có cách tiếp cận nào rõ ràng là tốt hơn. Hướng InternLM có lợi thế là nó chạy trên một lớp mô hình Hugging Face tiêu chuẩn với một chuỗi số đã được tài liệu hóa — bạn có thể kiểm tra lại công việc của nó. Hướng vLLM-SR có lợi thế là phần đọc ra là một head đã được huấn luyện chứ không phải là phép chiếu của một embedding token hiện có, vốn là một cách khớp tự do hơn, và cái giá phải trả là bạn phải trust_remote_code=True và chạy mã của họ để làm được bất cứ điều gì.
Các giới hạn mà mỗi bên công bố
Đây là lúc một sở thích thực sự bắt đầu hình thành, vì một thẻ cụ thể hơn hẳn thẻ còn lại về việc nó ngừng hoạt động ở đâu.
• Mức trần đầu vào — Intern-Decision-4B: mặc định là 8.192 token và các yêu cầu vượt quá mức đó bị từ chối thẳng, không bao giờ bị cắt ngắn, với mức trần được đặt bằng một đối số constructor. d3-mini: max_length là null trong cấu hình phát hành và không có ngân sách token nào xuất hiện ở bất cứ đâu trên card.
• Câu hỏi mỗi yêu cầu — Intern-Decision-4B: từ 1 đến 16, với mức tối đa được nêu là 62 lựa chọn trong bất kỳ một câu hỏi nào. d3-mini: không nêu giới hạn; thẻ chỉ nói rằng các câu hỏi được trả lời cùng nhau, mỗi câu từ lượt truyền xuôi riêng của nó.
• Hình ảnh — Intern-Decision-4B: tối đa tám ảnh mỗi yêu cầu, được sắp xếp theo một danh sách do bạn cung cấp, với bộ xử lý checkpoint đảm nhiệm việc thay đổi kích thước và mở rộng token. d3-mini: nhiều ảnh mỗi yêu cầu dưới dạng đường dẫn, URL, ảnh PIL hoặc URL dữ liệu base64, mỗi ảnh được đọc ở độ phân giải tối đa 1,6 megapixel, mọi câu hỏi đều thấy mọi hình ảnh.
• Video — Intern-Decision-4B: không có. d3-mini: nhiều video, đọc ở tốc độ 2 khung hình mỗi giây, giới hạn tối đa 32 khung hình trải khắp clip và 0,2 megapixel mỗi khung hình.
Trần đầu vào là ranh giới sẽ quyết định điều này đối với hầu hết mọi người. Ngân sách 8.192 token được chia sẻ giữa trạng thái, hướng dẫn câu hỏi và mô tả ứng viên là một ràng buộc thực sự đối với công việc chấm điểm tài liệu và định tuyến ngữ cảnh dài mà những mô hình này được bán để đảm nhiệm, và InternLM đáng được ghi nhận vì đã nói rõ điều đó thay vì để nó bị phát hiện. Việc vLLM-SR không nêu điều đó thì ngược lại: không phải một giới hạn ẩn, mà là một giới hạn chưa biết, và đọc kho lưu trữ bao nhiêu cũng không giải quyết được điều đó.
Hiệu chuẩn mới là sự phân chia thực sự
Mọi mô hình ra quyết định đều đưa ra cùng một lời hứa: con số mà nó trả về là một xác suất, và các ngưỡng được đặt dựa trên con số đó có ý nghĩa. Gần như không mô hình nào trong số đó chứng minh được điều này. Đây là chỗ hai bản phát hành khác biệt rõ nhất, và sự khác biệt đó đi theo hướng ngược lại với hướng mà bạn sẽ đoán từ ngày phát hành.
Intern-Decision-4B công bố, trên card của chính nó, điểm Brier 0.347 và lỗi hiệu chuẩn kỳ vọng 0.065 trên trung bình bảy benchmark, một temperature đã fit là 1.99241824 thu được bằng tối thiểu hóa NLL trên 1,728 ca hiệu chuẩn được chỉ định cùng 1,693 ca kiểm định riêng biệt, một tuyên bố rõ ràng rằng nhãn của bộ kiểm thử đã không được dùng để chọn temperature đó, và một chẩn đoán 96 ca cho thấy hiệu chuẩn của nó chuyển từ 0.628 Brier / 0.213 ECE trước temperature scaling sang 0.550 / 0.089 sau đó. Nó cũng nêu mặc định và nói rằng hiệu chuẩn là theo từng checkpoint, nên dùng một kích thước khác với mô-đun này sẽ không khớp.
Decision 3.0 công bố một chỉ số độ chính xác và một tuyên bố về độ phủ — cả 140.178 yêu cầu công khai đều được trả lời, không có yêu cầu nào không được hỗ trợ — và hoàn toàn không có con số hiệu chuẩn nào. Không có điểm Brier, không có ECE, không có temperature nào được nêu, trên bất kỳ điểm kiểm tra nào trong số sáu điểm kiểm tra.temperaturetrong bản phát hành của d3 decision_config.jsonlà 1.0, tức là giá trị identity và có thể là hoặc không phải là giá trị được khớp; tập tin không nói rõ.
Đọc hai tiêu đề chỉ mục cạnh nhau và sự bất đối xứng càng trở nên tệ hơn. Thẻ của d3-mini báo cáo điểm public-suite 54,90 trên Jev Decision Index 0.3, được mô tả là đo bằng bộ công cụ chính thức trên các trọng số đã phát hành, trong khi các hàng so sánh trên cùng bảng đó được mô tả là dữ liệu bảng trực tiếp. Intern-Decision-4B báo cáo mức trung bình 90,02 trên bảy benchmark của chính nó. Hai con số đó không cùng thang đo, chúng không dùng cùng các tác vụ, và đặt chúng vào một câu như một phép so sánh sẽ là không trung thực. Điều có thể so sánh được là việc công bố thông tin: một thẻ cho bạn biết các độ tin cậy của nó sai đến mức nào, còn thẻ kia thì không biết hoặc sẽ không nói.

Độ trễ, và tại sao hai tập hợp mili giây cũng không thể so sánh với nhau.
Cả hai thẻ đều công bố độ trễ trên mỗi yêu cầu, và việc coi chúng đúng như những gì được công bố sẽ là một sai lầm vì cùng lý do các số liệu độ chính xác không thể so sánh được.
• Intern-Decision-4B — trung bình 44,16 ms, trung vị 44,03 ms, p95 44,60 ms, được đo trên một RTX 4090 duy nhất thông qua đường dẫn Hugging Face cục bộ, được mô tả là phụ thuộc vào khối lượng công việc và phần cứng.
• d3-mini — trung vị 17,5 ms cho văn bản, 96,2 ms với một hình ảnh, 371,5 ms với video mười giây, trên một AMD Instinct MI325X, mỗi lần một yêu cầu.
Hai điều khiến chúng không thể so sánh được với nhau. Thứ nhất là phần cứng và đường đi phần mềm: một chiếc 4090 so với một chiếc MI325X, một lượt forward pass nguyên bản của Hugging Face so với một cách triển khai attention tùy chỉnh với các kernel masked-layer có sẵn thông qua flash-linear-attention. Thứ hai là khối lượng công việc: con số của InternLM được mô tả là end-to-end theo từng truy vấn trên một hỗn hợp không được nêu rõ, còn con số của vLLM-SR được tách riêng theo phương thức đầu vào, nên phép so sánh chỉ dùng văn bản là dòng duy nhất thực sự cùng loại, và ngay cả nó cũng trải qua hai nhà cung cấp GPU khác nhau.
Con số cần rút ra từ cả hai thẻ không phải là thứ hạng, mà là hình dạng. Một mô hình ra quyết định được gọi lặp đi lặp lại bên trong một quy trình công việc — một bản ghi hỗ trợ có thể cần điểm đến, kiểm tra hoàn tiền, quyết định leo thang và điểm ưu tiên, tức bốn câu hỏi, và một lô 128 bản ghi biến nó thành 512 quyết định. Ở khối lượng đó, cả 17 ms lẫn 44 ms đều biến mất so với chi phí của mô hình sinh ở hạ nguồn. Những con số phụ thuộc phương thức mới là thứ cần để ý, vì một yêu cầu hình ảnh hoặc video có chi phí gấp từ năm đến hai mươi lần một yêu cầu văn bản theo chính số liệu của d3-mini, và nếu quyết định của bạn đang được đưa ra trên một ảnh chụp màn hình thì bạn đã mang vào một cấu hình chi phí mà hầu hết các triển khai mô hình ra quyết định không có.
Thực sự nên chọn cái nào
Nếu quyết định bạn cần đưa ra phụ thuộc vào video, thì không có gì phải bàn cãi và không cần phân tích: Decision 3.0 đọc được video còn Intern-Decision-4B thì không. Đó là toàn bộ câu trả lời cho bất cứ điều gì liên quan đến bản ghi màn hình, clip từ camera hoặc chuỗi khung hình, và chính khoảng cách về năng lực này tự nó đã đủ để biện minh cho sự tồn tại của dòng sản phẩm mới hơn.
Nếu đầu vào của bạn là văn bản và thỉnh thoảng có hình ảnh, thì sự lựa chọn phụ thuộc vào hai điều và không điều nào trong số đó là bảng xếp hạng.
Hãy dùng Intern-Decision-4B khi bạn cần suy luận về các ngưỡng. Nó là mô hình duy nhất trong hai mô hình cho bạn biết liệu 0.9 có nghĩa là chín lần trên mười, nó nêu rõ temperature của mình, nó cho biết những trường hợp nào mà temperature đó được fit trên đó, và nó ghi lại suy luận của mình dưới dạng một quy trình ngắn có đánh số mà bạn có thể tái triển khai trên một lớp mô hình dựng sẵn. Với một bộ chấm điểm đứng trước một hành động tự động, đó chính là thuộc tính quan trọng, và nó hiếm hơn cả những điểm accuracy.
Hãy chọn Decision 3.0 khi bạn cần phạm vi hoặc các phương thức. Sáu checkpoint từ 0.59B đến 26.09B có nghĩa là cùng một định dạng yêu cầu có thể được phục vụ bởi một mô hình edge 6.7 ms và một mô hình 27B, và cả họ mô hình chia sẻ một giao diện, nên việc di chuyển giữa các tầng chỉ là thay đổi cấu hình chứ không phải viết lại. Vấn đề là bạn đang tin vào một hạn mức đầu vào không được công bố và một tuyên bố hiệu chuẩn chưa được kiểm toán, và mô hình lớn nhất trong họ lại là mô hình mà nhà cung cấp đo chỉ số của nó trên bộ kiểm thử riêng của họ.
Hiện nay, cả hai đều không phải là mặc định an toàn. Checkpoint được tải xuống nhiều nhất của d3 đã có mặt trên Hugging Face được khoảng một ngày; Intern-Decision-4B đã xuất hiện được hai tuần và thu hút khoảng 3.200 lượt tải xuống cùng 83 lượt thích, đó là sự chú ý nhưng không phải lưu lượng production. Cả hai đều đủ rẻ để thử nghiệm và cả hai đều không có đánh giá của bên thứ ba đằng sau. Nếu bạn đang đặt một bộ chấm điểm trước một thứ tiêu tốn tiền, động thái đúng đắn là chạy cả hai trên các trường hợp đã được gán nhãn của riêng bạn và so sánh các đường cong hiệu chuẩn, chứ không phải các hàng chỉ mục.

Router phù hợp ở đâu, thành thật mà nói
OrcaRouter không cung cấp cả hai mô hình này. Các checkpoint của Decision 3.0 là một đường suy luận Python cục bộ trong một kho lưu trữ Hugging Face không công bố endpoint HTTP nào, và Intern-Decision-4B được phát hành dưới dạng một DecisionEngine class mà bạn tự khởi tạo. Cả hai đều không phải là thứ chúng tôi có thể định tuyến tại thời điểm này, và không phần nào của bài viết này nên được hiểu như một tuyên bố về tính khả dụng.
Những gì chúng tôi cung cấp là phiên bản hosted của cùng dòng sản phẩm đó. typesafe/jev-1.13 nằm trong danh mục của chúng tôi, được phục vụ qua POST /v1/systemone — cùng hợp đồng state-and-named-questions mà cả hai mô hình mở ở trên đều triển khai — với mức $0.042 mỗi triệu token đầu vào và không tính phí completion, vì nó không bao giờ tạo ra token completion nào. Nó nằm cạnh hơn 200 mô hình khác, và đó chính là điểm thực tiễn cho bất kỳ ai đang so sánh hai mô hình này: mô hình chấm điểm là phần rẻ trong vòng lặp, còn mô hình hành động dựa trên quyết định mới là phần tốn kém. Định tuyến cả hai qua một khóa duy nhất, với tính năng chuyển đổi dự phòng tự động khi một nhà cung cấp gặp trục trặc và giá niêm yết của nhà cung cấp được chuyển nguyên với mức markup 0%, nghĩa là việc đánh giá một mô hình ra quyết định không đòi hỏi phải ký thêm hợp đồng thứ hai hay viết lại call site khi bạn chuyển đổi backend. Nếu bạn đang trong quá trình đánh giá — và cả hai mô hình này hiện nay đều đang ở giai đoạn đó — thì đó là phần đáng để thiết lập trước khi bạn cam kết với bất kỳ mô hình nào.

Câu hỏi mở
Hai model card bất đồng về việc một tác giả mô hình nợ người đọc điều gì, và sự bất đồng đó thú vị hơn chính các mô hình. InternLM đã công bố một temperature cùng những trường hợp mà nó được fit trên đó, rồi công bố bản chẩn đoán cho thấy calibration đã cải thiện đến mức nào. vLLM-SR đã công bố hash tệp, ghim các bản sửa đổi cơ sở, một mục tiêu phần cứng được nêu rõ, một tuyên bố về độ bao phủ — công việc truy xuất nguồn gốc thực sự — và hoàn toàn không có một con số calibration nào.
Phép thử xem bản phát hành nào chín muồi không phải là bản nào thắng một bảng xếp hạng. Mà là liệu checkpoint Decision tiếp theo có được phát hành kèm điểm Brier hay không, và liệu bản tải lên tiếp theo của InternLM có đạt tới video hay không. Cả hai đều có thể thấy từ bên ngoài, cả hai đều dễ kiểm chứng với chi phí thấp, và cả hai đều chưa xảy ra.
