
NV-Reason-CT so với Kimi K3: 210 lượt tải xuống và 588 triệu token
- typesafeMỚITypeSafe: Jev 1.132026-09-24$0.04 / $0.00 trên 1 triệu token · 45 tok/s
- openaiMỚIOpenAI: GPT-6 Luna2026-09-2237Trí tuệ
- openaiMỚIOpenAI: GPT-6 Sol2026-09-2248Trí tuệ
- anthropicMỚIAnthropic: Claude Opus 5.52026-09-2258Trí tuệ
- grokMỚIGrok 4.72026-09-2146Trí tuệ
- OrcaMỚIOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 trên 1 triệu token · 182 tok/s
- orcaMỚIOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 trên 1 triệu token · 1285 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Trí tuệ
- openaiOpenAI: GPT-6 Astra2026-09-0453Trí tuệ77Lập trình
- googleGoogle: Gemini 3.8 Flash2026-09-0241Trí tuệ76Lập trình
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Trí tuệ76Lập trình
- anthropicAnthropic: Claude Fable 5.12026-09-0153Trí tuệ82Lập trình
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 trên 1 triệu token · 119 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Trí tuệ72Lập trình
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 trên 1 triệu token · 224 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Trí tuệ75Lập trình
- obsidianQwen3.8 27B2026-08-1534Trí tuệ68Lập trình
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Trí tuệ69Lập trình
- grokSpaceXAI: Grok 4.62026-08-1244Trí tuệ77Lập trình
- metaMeta: Muse Spark 1.22026-08-0540Trí tuệ72Lập trình
Một trong những mô hình này đã được tải xuống 210 lần từ Hugging Face. Mô hình kia đã xử lý 588 triệu token thông qua playground của riêng chúng tôi trong bảy ngày qua. Cả hai đều có trọng số mở, cả hai đều có thể tải xuống ngay bây giờ, và khoảng cách giữa hai con số đó là điều hữu ích nhất trong so sánh này. NV-Reason-CT là mô hình thị giác-ngôn ngữ 3D 4,69 tỷ tham số của NVIDIA dành cho CT ngực và bụng, được đăng lên Hugging Face vào ngày 8 tháng 9 năm 2026 mà không có thông báo nào. Kimi K3 là mô hình chủ lực 1.048.576 token của MoonshotAI, ra mắt ngày 15 tháng 7 năm 2026 và hiện là một trong những mô hình hoạt động nhiều nhất trên mạng lưới của chúng tôi. Cả hai đều "mở" theo nghĩa quan trọng đối với một biểu mẫu mua sắm. Chúng hoàn toàn không mở theo cùng một cách.
Hai nghĩa của “bạn có thể tải nó xuống”
Hãy bắt đầu với những gì mỗi lượt tải về thực sự ghi xuống ổ đĩa của bạn, vì đây chính là chỗ mà hầu hết các so sánh open-weights trở nên mơ hồ.
NV-Reason-CT cung cấp cho bạn model.safetensors ở khoảng 10,6 GB trong BF16, cùng với một model.py và một processor.py đáng kể — 26 KB mã xử lý tùy chỉnh triển khai việc cắt nhận biết giải phẫu, lấy mẫu lại 2 mm và phân chia thành các miếng 3D. Bạn tải nó bằng trust_remote_code=True, nghĩa là bạn đang thực thi mã trong kho của NVIDIA ngay trong tiến trình của mình. Suy luận cần CUDA PyTorch, và thẻ mô hình liệt kê Ampere, Hopper và Lovelace, đã kiểm thử trên H100 và L40S. Đầu vào là một khối NIfTI mỗi lần. Không có thông tin về xử lý theo lô nào được công bố, không có số liệu thông lượng, và không có cấu hình phục vụ nào trong kho ngoài một inference.py mẫu.
Kimi K3 mang đến cho bạn một mô hình suy luận đa dụng với cửa sổ ngữ cảnh 1.048.576 token, đầu vào văn bản và hình ảnh, khả năng gọi công cụ gốc, đầu ra có cấu trúc và mức nỗ lực suy luận có thể cấu hình. Đây là mô hình mà bạn sẽ tìm đến để đọc một trăm hướng dẫn lâm sàng trong một yêu cầu, hoặc các báo cáo trong cả thập kỷ của một phòng ban. Điểm nhớ lại ngữ cảnh dài của Artificial Analysis của nó là 88,7 — cao nhất trong số các mô hình thuộc dòng này và cao hơn hẳn 8,4 điểm so với mức 80,3 của Grok 4.6.
Nói thẳng ra: NV-Reason-CT là một checkpoint chuyên biệt với bề mặt đầu vào hẹp và mã tùy chỉnh mà bạn phải tin cậy và duy trì. Kimi K3 là một mô hình tổng quát với bề mặt đầu vào rộng, hoạt động như cơ sở hạ tầng. Cả hai đều có thể tải xuống. Chỉ một trong số chúng là loại cắm là chạy.
Bằng chứng CT, đầy đủ, và nó ngắn gọn
Mọi thông tin được biết công khai về chất lượng của NV-Reason-CT chỉ dựa trên một bảng duy nhất trong thẻ mô hình của chính nó: tác vụ phân loại 18 nhãn của CT-RATE ở một ngưỡng đồng nhất cố định, lời nhắc trực tiếp Yes/No, không có đầu phân loại, không có thích ứng theo tác vụ cụ thể. Macro-F1 0.614, Macro-AUROC 0.871.
Các hàng so sánh là VoxelFM ở 0.581/0.870, Pillar-0 ở 0.544/0.861, ClinFusion-8B ở 0.442, CT-CLIP ở 0.398/0.733, Merlin ở 0.358/0.662 và MedGemma 1.5 ở 0.303. Mỗi một con số trong đó đều là số liệu do nhà cung cấp báo cáo từ card của NVIDIA và chưa có con số nào được tái lập độc lập — bài báo mới ra được hai ngày.
Điều mà bảng này xác lập thì hẹp và đáng được nói chính xác: một mô hình tạo sinh 3D không có head chuyên biệt cho tác vụ đánh bại các baseline tiền huấn luyện tương phản 3D và một mô hình tiên tiến dựa trên lát cắt trong phân loại CT 18 nhãn. Điều nó không xác lập là bất cứ điều gì về suy luận tổng quát, bất cứ điều gì về các phương thức hình ảnh khác ngoài CT ngực và bụng, và bất cứ điều gì về lợi thế AUROC — 0,871 so với 0,870 là một thế hòa khoác lên mình dấu thập phân.
Những con số của Kimi K3, và lưu ý về bảng xếp hạng open-weights
Artificial Analysis đo Kimi K3 ở mức Chỉ số Thông minh 43,6, đưa nó lên vị trí thứ 19 trong số 145 mô hình trên bảng xếp hạng đó trong bản chụp bảng xếp hạng của API mô hình của chúng tôi. Điểm GPQA Diamond của nó là 93,5, Humanity's Last Exam là 46,9, SciCode là 59,5, Terminal-Bench 2.1 là 85,0, AA Coding là 76,2 ở vị trí thứ 9, và 𝜏²-banking là 46,0.
Một khẳng định về xếp hạng cần được chú ý, vì rất dễ hiểu sai và trước đây từng bị hiểu sai. Chỉ số AA Intelligence của Kimi K3 là 44 đứng thứ ba trong số các mô hình open-weights trên bảng open-weights, sau MiMo-V2.6-Pro với 46 và GLM-5.3 với 45. Nó không dẫn đầu trên bảng đó, và nó không cạnh tranh trên cùng bảng với Grok 4.6 — Artificial Analysis ghi nhận Grok 4.6 là độc quyền, vì vậy chỉ số 44 của nó thuộc bảng xếp hạng chung, không phải bảng open-weights. Hai chỉ số trông giống hệt nhau nhưng không phải vậy.
Những gì người vận hành thực sự thấy
Đây là nguồn gốc của con số 588 triệu, và điều đó đáng được nói rõ vì đây là mảnh bằng chứng duy nhất trong bài viết này thuộc về chúng ta chứ không phải là tiếp thị của bất kỳ ai.
Trong bảy ngày qua, Kimi K3 đã xử lý 587,8 triệu token qua playground của OrcaRouter. Thời gian trung vị đến token đầu tiên của nó là 7,8 giây, nó tạo ra 42,9 token đầu ra mỗi giây, và tỷ lệ lỗi của nó trong khoảng thời gian đó là 0,21% — một lỗi trong khoảng 480 yêu cầu. Tỷ lệ lỗi được đo đó chính là thứ bạn không thể lấy được từ model card, và đó là con số quyết định liệu một mô hình có an toàn để đưa vào một batch job hay không.
Đối với NV-Reason-CT thì không có tương đương, vì nó không phải là một endpoint được host ở bất cứ đâu — nó là một checkpoint bạn tự chạy. Không có p50, không có tỷ lệ lỗi, không có thời gian hoạt động, và không có ai để chuyển đổi dự phòng. Đó không phải là một lời chê; đó là một thực tế mang tính cấu trúc về self-hosting, và đó là lý do một nhóm nghiên cứu có thể áp dụng NV-Reason-CT vào một ngày thứ Ba còn một nhóm sản xuất nói chung thì không thể.
Nếu bạn đang chạy cả hai nửa của hệ thống này — Kimi K3 làm lớp tổng quát được host và NV-Reason-CT trên máy GPU của riêng bạn — thì phía định tuyến chính là nơi nửa được host có được khả năng phục hồi. Kimi K3 được cung cấp ở đúng mức giá niêm yết của chính Moonshot là 3,00 USD mỗi triệu token đầu vào và 15,00 USD mỗi triệu token đầu ra mà không đánh thêm phụ phí, mức giá đọc bộ nhớ đệm 0,30 USD mỗi triệu chỉ bằng một phần mười giá đầu vào, và vì giá được chuyển tiếp nguyên vẹn nên một đợt giảm giá từ nhà cung cấp sẽ đến hóa đơn của bạn ngay trong ngày. Tự động chuyển đổi dự phòng giữa các nhà cung cấp là thứ giữ cho một tác vụ theo lô tiếp tục hoạt động khi một endpoint thượng nguồn gặp trục trặc — và với tỷ lệ lỗi 0,21%, những lần chập chờn hiếm đến mức bạn dễ quên chúng đi cho đến khi chúng không còn hiếm nữa.
Các hình dạng chi phí không giống nhau
• Giá — chi phí đầu tư GPU NV-Reason-CT cộng với hệ thống phục vụ của riêng bạn so với Kimi K3 $3.00 / $15.00 mỗi triệu, $0.30 cho lượt đọc từ bộ nhớ đệm
• Chi tiêu tối thiểu khả thi — NV-Reason-CT một GPU Ampere trở lên được giữ vô thời hạn so với Kimi K3 một yêu cầu
• Ngữ cảnh — NV-Reason-CT một khối, 13.824 token cố định so với Kimi K3 1.048.576 token
• Chi phí biên của yêu cầu thứ một nghìn — NV-Reason-CT hầu như bằng không khi GPU đã được trả tiền, so với Kimi K3 tuyến tính theo token
• Điểm vỡ đầu tiên — thông lượng chưa được kiểm chứng của NV-Reason-CT và không có phương án xử lý theo lô, so với chi phí ngữ cảnh dài của Kimi K3 ở mức 1 triệu token mỗi yêu cầu
• Phương thức — NV-Reason-CT 3D NIfTI, ngực hoặc bụng so với Kimi K3 văn bản và hình ảnh, bất kỳ thứ gì

Bài toán kinh tế đảo chiều tùy theo khối lượng. Kimi K3 không tốn gì để bắt đầu và mở rộng theo tuyến tính. NV-Reason-CT tốn một GPU để bắt đầu rồi sau đó gần như mở rộng đi ngang — đó là lý do 210 lượt tải xuống không phải là tín hiệu thất bại. Đó là con số chính xác cho một checkpoint mà đối tượng của nó là các tổ chức đã sở hữu phần cứng, và những tổ chức này sẽ không bao giờ xuất hiện trong thống kê thông lượng token nào cả.

Bạn thực sự đang chọn cái nào?
Nếu công việc là đọc một thể tích CT và tạo ra một phát hiện có cấu trúc cùng dấu vết suy luận, Kimi K3 không thể làm được và NV-Reason-CT có thể. Không phải "làm kém hơn" — mà là không thể, bởi vì không có bộ mã hóa thể tích nào ở bất cứ đâu trong nó, và việc làm phẳng một bản quét thành các hình ảnh trước tiên sẽ loại bỏ các mối quan hệ không gian mà đường dẫn 3D tồn tại để bảo toàn.
Nếu công việc là đọc 400 trang ghi chú chuyển tuyến, đối chiếu chúng với một tài liệu phác đồ, rồi xuất ra đầu ra có cấu trúc, thì NV-Reason-CT không nằm trong số được cân nhắc, và Kimi K3 là một trong những lựa chọn tốt hơn hiện có, với tỷ lệ lỗi đo được dưới 0,25% trên mạng của chúng tôi.

Quyết định thực sự không nằm giữa hai lựa chọn đó. Mà là liệu vấn đề của bạn là vấn đề khối lượng hay vấn đề văn bản, và khoảng cách 210 triệu so với 588 triệu chỉ đơn giản là hình hài của sự phân biệt đó khi nhìn từ bên ngoài. Một mô hình là một bài báo kèm trọng số. Cái còn lại là một phần của hạ tầng. Cả hai đều đáng có; không cái nào thay thế được cái kia.
So sánh trong bài viết này1
Phát hiện từ bài viết này · Benchmark: Artificial Analysis · cập nhật hằng ngày
