
Intern-Decision-4B vs ContextPilot-8B: Một mô hình thu gọn ngữ cảnh đối đầu với một mô hình quản lý ngữ cảnh
- typesafeMỚITypeSafe: Jev 1.132026-09-24$0.04 / $0.00 trên 1 triệu token · 592 tok/s
- openaiMỚIOpenAI: GPT-6 Luna2026-09-2237Trí tuệ
- openaiMỚIOpenAI: GPT-6 Sol2026-09-2248Trí tuệ
- anthropicMỚIAnthropic: Claude Opus 5.52026-09-2258Trí tuệ
- grokMỚIGrok 4.72026-09-2146Trí tuệ
- OrcaMỚIOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 trên 1 triệu token · 187 tok/s
- orcaMỚIOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 trên 1 triệu token · 1306 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Trí tuệ
- openaiOpenAI: GPT-6 Astra2026-09-0453Trí tuệ77Lập trình
- googleGoogle: Gemini 3.8 Flash2026-09-0241Trí tuệ76Lập trình
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Trí tuệ76Lập trình
- anthropicAnthropic: Claude Fable 5.12026-09-0153Trí tuệ82Lập trình
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 trên 1 triệu token · 113 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Trí tuệ72Lập trình
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 trên 1 triệu token · 224 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Trí tuệ75Lập trình
- obsidianQwen3.8 27B2026-08-1534Trí tuệ68Lập trình
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Trí tuệ69Lập trình
- grokSpaceXAI: Grok 4.62026-08-1244Trí tuệ77Lập trình
- metaMeta: Muse Spark 1.22026-08-0540Trí tuệ72Lập trình
Chọn lấy “liều độc” của bạn: internlm/Intern-Decision-4B từ chối đọc quá 8.192 token, và tencent/ContextPilot-8B tồn tại cụ thể để sống sót qua những ngữ cảnh phình to không giới hạn. Chúng cùng một lớp kích thước, đều là bản fine-tune của một mô hình nền Qwen, và cả hai đều xuất hiện trên Hub mà không có thông báo từ nhà cung cấp và không có bất kỳ đánh giá độc lập nào — ContextPilot-8B vào ngày 27 tháng 8 năm 2026, Intern-Decision-4B vào ngày 26 tháng 9 năm 2026 — và chúng giải quyết những bài toán trái ngược nhau. Intern-Decision-4B là một mô hình ra quyết định có cấu trúc 4,5 tỷ tham số, chạy một lượt truyền xuôi, đọc logits, rồi trả về một xác suất đã hiệu chỉnh cho mọi câu hỏi bạn đặt ra; nó không bao giờ viết ra một token nào. ContextPilot-8B là một mô hình sinh văn bản 8,19 tỷ tham số, được huấn luyện để lập kế hoạch, ghi nhớ và offload ngữ cảnh làm việc của chính nó trong suốt một phiên chạy agent dài. So sánh chúng thật ra không phải là câu hỏi benchmark. Đó là câu hỏi về việc bạn thà để mô hình nuốt nửa nào trong bài toán của bạn.
Đầu tiên, điều mà họ thực sự chia sẻ
Cả hai mô hình đều không có một con số nào được bất kỳ ai bên ngoài phòng thí nghiệm riêng của nó xác minh. Điều đó đủ bất thường để phải nói ra trước mọi thứ khác, bởi vì hầu hết các so sánh trên blog này ít nhất có thể dựa vào một bảng xếp hạng độc lập cho một phía.
Intern-Decision-4B công bố một bảng đánh giá đầy đủ trên thẻ của nó — mức trung bình 90.02 trên bảy bộ, điểm Brier 0.347 và lỗi hiệu chuẩn kỳ vọng 0.065 — tất cả đều được đo bởi InternLM trên harness của InternLM. ContextPilot-8B không công bố bảng nào cả. Thẻ của nó nói rằng framework "liên tục vượt trội hơn các baseline hiện có trên nhiều mô hình cơ sở và benchmark khác nhau" và chỉ đến một bài báo và một pipeline đánh giá để biết chi tiết. Vì vậy, đối với cặp đấu này, dòng nguồn gốc trung thực ngắn gọn: một bên là do nhà cung cấp báo cáo và không được tái lập, bên kia là do nhà cung cấp tuyên bố và chưa được công bố, và không có gì trên trang này là độc lập.

Hai canh bạc, được nói rõ ràng
Intern-Decision-4B đặt cược rằng phần khó của một quyết định không phải là lý luận, mà là việc cam kết. Đưa cho nó một trạng thái, một lược đồ gồm các câu hỏi được đặt tên và tối đa tám hình ảnh, và nó trả về một phân phối trên chính các chuỗi lựa chọn của bạn. Quy trình suy luận là tất định và cố định về hình dạng: ánh xạ các lựa chọn lên các ký hiệu đơn-token, kết xuất một bộ khung JSON của trợ lý với một phần giữ chỗ cho mỗi trường, chạy một lượt truyền xuôi nhân quả, đọc logits ngay trước mỗi phần giữ chỗ, softmax chỉ trên các ứng viên của trường đó, áp dụng nhiệt độ đã khớp. Không có vòng lặp giải mã, nên không có bộ phân tích cú pháp và không có bề mặt ảo giác văn bản tự do. Cái giá phải trả cho đặt cược đó là một mức trần đầu vào cứng — thẻ nói rằng các đầu vào trên DecisionEngine(max_length=8192) đều "bị từ chối mà không cắt ngắn".
Canh bạc của ContextPilot-8B là hình ảnh phản chiếu: giữ cho tác nhân viết token, nhưng dạy nó chỉnh sửa những gì nó đang mang theo. Nó bổ sung lập kế hoạch, bộ nhớ dài hạn có cấu trúc, truy xuất và dỡ tải ngữ cảnh mềm vào bộ công cụ của tác nhân, rồi huấn luyện checkpoint bằng một công thức RL lấy mẫu các nhánh xung quanh những quyết định chỉnh sửa ngữ cảnh quan trọng và gán tín dụng ở cấp hành động thay vì cấp quỹ đạo. Tấm card thẳng thắn về hệ quả đóng gói: tải checkpoint không đem lại cho bạn khả năng quản lý ngữ cảnh. Các định nghĩa công cụ, môi trường chạy tác nhân và pipeline đánh giá nằm ở nơi khác và phải được mang theo cùng.
Bảng điểm, từng chiều một
• Đầu ra — Intern-Decision-4B không phát ra văn bản nào cả, chỉ có xác suất trên các giá trị tùy chọn của bạn; ContextPilot-8B tạo ra bình thường và câu trả lời của nó là văn xuôi và các lệnh gọi công cụ mà bạn phải phân tích cú pháp.
• Giới hạn đầu vào — Intern-Decision-4B từ chối mọi thứ vượt quá 8.192 token; ContextPilot-8B kế thừa giới hạn vị trí 40.960 token của Qwen3-8B và được xây dựng để tiếp tục hoạt động khi ngữ cảnh hiệu dụng tăng lên.
• Tham số — 4,54B BF16 cho Intern-Decision-4B, trải khắp một tháp văn bản, một tháp thị giác và một bộ chiếu; 8,19B BF16 cho ContextPilot-8B, một mô hình ngôn ngữ nhân quả Qwen3 dày đặc thuần túy.
• Độ trễ — Intern-Decision-4B chạy 44,16 ms trung bình và 44,60 ms ở P95 trên một RTX 4090 duy nhất, theo model card của chính nó; ContextPilot-8B không công bố số liệu độ trễ nào, và chi phí của nó khác biệt về bản chất vì nó sinh token thay vì chấm điểm chúng.
• Hình ảnh — Intern-Decision-4B tiếp nhận tối đa tám ảnh, và token hình ảnh được tính vào giới hạn trần 8.192; thẻ của ContextPilot-8B mô tả một checkpoint tạo văn bản không có luồng đa phương thức.
• Giấy phép — Intern-Decision-4B dùng Apache-2.0 với giấy phép Qwen thượng nguồn được giữ nguyên bên cạnh; giấy phép của ContextPilot-8B mở đầu bằng Mục 0, "chỉ được cung cấp nhằm mục đích nghiên cứu và phát triển khoa học. Bạn không được sử dụng nó cho bất kỳ mục đích nào khác."
• Bằng chứng đã công bố — một bảng bảy tập với chẩn đoán hiệu chuẩn ở một bên; một tóm tắt bài báo và một liên kết đến kho đánh giá ở bên kia.
• Thành tích — cả hai đều im ắng. Intern-Decision-4B chỉ có một lượt thích và không có lượt tải xuống nào kể từ ngày 26 tháng 9 năm 2026; ContextPilot-8B có 11 lượt thích và khoảng một nghìn lượt tải xuống kể từ ngày 27 tháng 8 năm 2026, tức là được chú ý hơn nhưng vẫn chưa có đánh giá của bên thứ ba.

Nơi mỗi cái thực sự bị hỏng
Kiểu thất bại của Intern-Decision-4B mang tính cấu trúc, và đáng để nói cụ thể về điều đó. Nếu bằng chứng cho một quyết định không vừa trong 8,192 token, mô hình không suy giảm một cách êm ái — nó từ chối yêu cầu. Đó là một lựa chọn kỹ thuật có thể biện minh và cực kỳ không phù hợp với đúng khối lượng công việc mà ContextPilot-8B được xây dựng để phục vụ. Cấu hình của chính model card khiến sự căng thẳng càng rõ nét hơn: tháp văn bản bên dưới wrapper công bố giới hạn vị trí 262,144 token. Backbone có thể xử lý một phần tư triệu token và wrapper được phát hành sẽ không chấp nhận quá tám nghìn.
Điểm thất bại của ContextPilot-8B nằm ở chỗ nó không phải là thứ có thể cắm là chạy thay thế cho bất kỳ thứ gì. Nó là một checkpoint bên trong một framework, và framework mới là nơi hành vi thực sự tồn tại. Nếu tách trọng số ra mà không có các định nghĩa công cụ và runtime agent, thì bạn chỉ còn một bản fine-tune Qwen3-8B có năng lực khác biệt trở nên vô dụng. Thêm vào đó là Mục 0 của giấy phép, và câu trả lời thực tế cho một triển khai thương mại là bạn hoàn toàn không thể dùng nó như được phát hành — điều này cũng có nghĩa nó không phải là một hướng ứng viên cho chúng ta, dù hiện tại hay sắp tới.
Triển khai từng cái, nếu bạn định làm vậy
Intern-Decision-4B muốn một GPU nhỏ và không cần một serving stack nào ra hồn: cài PyTorch 2.9.1 và Transformers 5.14.1 trên Python 3.12, nạp bốn shard một lần, giữ engine thường trú, rồi chấm điểm. Vì forward pass có hình dạng cố định, P50 và P95 chỉ lệch nhau trong khoảng sáu phần mười mili-giây, nên quy hoạch năng lực là chuyện khả năng đồng thời chứ không phải độ trễ đuôi. Phần khó xử là nó được phát hành dưới dạng một lớp Python có thể import chứ không phải một dịch vụ HTTP, nên để đưa nó ra trước một caller production, bạn phải tự bọc nó lại.
ContextPilot-8B muốn cách xử lý ngược lại: một đường phục vụ thực sự, một trình thực thi công cụ, các kho bộ nhớ, và một môi trường rollout có khả năng phân nhánh nếu bạn từng định huấn luyện lại hoặc đánh giá nó đúng như thiết kế. Đây không phải là một mô hình để bạn dùng thử trong một buổi chiều; đó là một khung nghiên cứu mà bạn áp dụng.
Router có giúp ích gì ở đây không?
Một phần, và phiên bản trung thực thì hẹp hơn mức thông thường. OrcaRouter không liệt kê Intern-Decision-4B, ContextPilot-8B hay bất kỳ checkpoint chấm điểm quyết định nào tương đương trong danh mục của mình — trang model của cả hai đều trả về 404, và không có gì trong bài này nên được hiểu là một tuyên bố về tính khả dụng. Điều mà một endpoint hợp nhất thực sự mang lại cho bạn là khả năng đặt một thử nghiệm thất bại phía sau một fallback: một khóa duy nhất cho hơn 200 model, giá niêm yết của nhà cung cấp được chuyển nguyên với 0% markup, và tự động chuyển đổi dự phòng để một scorer mà bạn vẫn đang đánh giá không bao giờ trở thành điểm lỗi đơn lẻ. Đó là một lợi ích thực sự cho phía Intern-Decision trong so sánh này, nơi model thực sự chạy rẻ và ngay tại máy. Với ContextPilot-8B thì điều đó không còn ý nghĩa, vì giấy phép chỉ dành cho nghiên cứu và phát triển loại bỏ con đường thương mại bất kể router nào có hỗ trợ hay không.
Vậy thì cái nào?
Nếu câu hỏi của bạn có một tập câu trả lời đóng, đến cùng với bằng chứng đi kèm, và cần một xác suất thay vì một lời giải thích, thì Intern-Decision-4B là đối tượng thú vị hơn — rẻ, có dạng cố định, được hiệu chỉnh ngay từ khâu xây dựng, và trung thực về đầu vào mà nó sẽ không chấp nhận. Nếu vấn đề của bạn là bằng chứng cứ đến mãi không ngừng, thì chẳng có bộ chấm điểm quyết định nào giúp được bạn, và ContextPilot-8B đang nhắm đúng mục tiêu, kèm theo lưu ý rằng bạn đang áp dụng một khuôn khổ và một giấy phép nghiên cứu chứ không phải một mô hình.
Điều có thể giải quyết chuyện này là một bài kiểm tra mà cả hai nhà cung cấp đều chưa chạy: đưa cho cả hai cùng một quyết định ngắn gọn, có cấu trúc, với đáp án có thể tính được từ trạng thái, và xem liệu mức trung bình 90,02 của bộ chấm điểm có đứng vững bên ngoài khung thử nghiệm của chính nó hay không. Cho đến khi ai đó làm điều đó, cách diễn giải đúng về màn đối đầu này là hai mô hình hoàn toàn không cạnh tranh cho cùng một vị trí.

