Một thẻ hero được tạo tự động có tiêu đề 'NV-Reason-CT vs Kimi K3' với phụ đề '210 lượt tải xuống và 588 triệu token'. Ba chip chạy dọc theo cạnh dưới: '210 lượt tải HF so với 587.8M token / 7 ngày', 'sai số đo được 0.21% trên mạng lưới của chúng tôi', và 'Một volume so với 1,048,576 token'. Logo OrcaRouter được ghép ở góc dưới cùng bên phải.
Guides & Insights

NV-Reason-CT so với Kimi K3: 210 lượt tải xuống và 588 triệu token

Tác giả

Elias Hawthorne

Ngày đăng

Mô hình mới nhất · 20Xem tất cả mô hình →
Benchmark: Artificial Analysis · cập nhật hằng ngày
Quay lại tất cả bài viết

Một trong những mô hình này đã được tải xuống 210 lần từ Hugging Face. Mô hình kia đã xử lý 588 triệu token thông qua playground của riêng chúng tôi trong bảy ngày qua. Cả hai đều có trọng số mở, cả hai đều có thể tải xuống ngay bây giờ, và khoảng cách giữa hai con số đó là điều hữu ích nhất trong so sánh này. NV-Reason-CT là mô hình thị giác-ngôn ngữ 3D 4,69 tỷ tham số của NVIDIA dành cho CT ngực và bụng, được đăng lên Hugging Face vào ngày 8 tháng 9 năm 2026 mà không có thông báo nào. Kimi K3 là mô hình chủ lực 1.048.576 token của MoonshotAI, ra mắt ngày 15 tháng 7 năm 2026 và hiện là một trong những mô hình hoạt động nhiều nhất trên mạng lưới của chúng tôi. Cả hai đều "mở" theo nghĩa quan trọng đối với một biểu mẫu mua sắm. Chúng hoàn toàn không mở theo cùng một cách.

Hai nghĩa của “bạn có thể tải nó xuống”

Hãy bắt đầu với những gì mỗi lượt tải về thực sự ghi xuống ổ đĩa của bạn, vì đây chính là chỗ mà hầu hết các so sánh open-weights trở nên mơ hồ.

NV-Reason-CT cung cấp cho bạn model.safetensors ở khoảng 10,6 GB trong BF16, cùng với một model.py và một processor.py đáng kể — 26 KB mã xử lý tùy chỉnh triển khai việc cắt nhận biết giải phẫu, lấy mẫu lại 2 mm và phân chia thành các miếng 3D. Bạn tải nó bằng trust_remote_code=True, nghĩa là bạn đang thực thi mã trong kho của NVIDIA ngay trong tiến trình của mình. Suy luận cần CUDA PyTorch, và thẻ mô hình liệt kê Ampere, Hopper và Lovelace, đã kiểm thử trên H100 và L40S. Đầu vào là một khối NIfTI mỗi lần. Không có thông tin về xử lý theo lô nào được công bố, không có số liệu thông lượng, và không có cấu hình phục vụ nào trong kho ngoài một inference.py mẫu.

Kimi K3 mang đến cho bạn một mô hình suy luận đa dụng với cửa sổ ngữ cảnh 1.048.576 token, đầu vào văn bản và hình ảnh, khả năng gọi công cụ gốc, đầu ra có cấu trúc và mức nỗ lực suy luận có thể cấu hình. Đây là mô hình mà bạn sẽ tìm đến để đọc một trăm hướng dẫn lâm sàng trong một yêu cầu, hoặc các báo cáo trong cả thập kỷ của một phòng ban. Điểm nhớ lại ngữ cảnh dài của Artificial Analysis của nó là 88,7 — cao nhất trong số các mô hình thuộc dòng này và cao hơn hẳn 8,4 điểm so với mức 80,3 của Grok 4.6.

Nói thẳng ra: NV-Reason-CT là một checkpoint chuyên biệt với bề mặt đầu vào hẹp và mã tùy chỉnh mà bạn phải tin cậy và duy trì. Kimi K3 là một mô hình tổng quát với bề mặt đầu vào rộng, hoạt động như cơ sở hạ tầng. Cả hai đều có thể tải xuống. Chỉ một trong số chúng là loại cắm là chạy.

Bằng chứng CT, đầy đủ, và nó ngắn gọn

Mọi thông tin được biết công khai về chất lượng của NV-Reason-CT chỉ dựa trên một bảng duy nhất trong thẻ mô hình của chính nó: tác vụ phân loại 18 nhãn của CT-RATE ở một ngưỡng đồng nhất cố định, lời nhắc trực tiếp Yes/No, không có đầu phân loại, không có thích ứng theo tác vụ cụ thể. Macro-F1 0.614, Macro-AUROC 0.871.

Các hàng so sánh là VoxelFM ở 0.581/0.870, Pillar-0 ở 0.544/0.861, ClinFusion-8B ở 0.442, CT-CLIP ở 0.398/0.733, Merlin ở 0.358/0.662 và MedGemma 1.5 ở 0.303. Mỗi một con số trong đó đều là số liệu do nhà cung cấp báo cáo từ card của NVIDIA và chưa có con số nào được tái lập độc lập — bài báo mới ra được hai ngày.

Điều mà bảng này xác lập thì hẹp và đáng được nói chính xác: một mô hình tạo sinh 3D không có head chuyên biệt cho tác vụ đánh bại các baseline tiền huấn luyện tương phản 3D và một mô hình tiên tiến dựa trên lát cắt trong phân loại CT 18 nhãn. Điều nó không xác lập là bất cứ điều gì về suy luận tổng quát, bất cứ điều gì về các phương thức hình ảnh khác ngoài CT ngực và bụng, và bất cứ điều gì về lợi thế AUROC — 0,871 so với 0,870 là một thế hòa khoác lên mình dấu thập phân.

Những con số của Kimi K3, và lưu ý về bảng xếp hạng open-weights

Artificial Analysis đo Kimi K3 ở mức Chỉ số Thông minh 43,6, đưa nó lên vị trí thứ 19 trong số 145 mô hình trên bảng xếp hạng đó trong bản chụp bảng xếp hạng của API mô hình của chúng tôi. Điểm GPQA Diamond của nó là 93,5, Humanity's Last Exam là 46,9, SciCode là 59,5, Terminal-Bench 2.1 là 85,0, AA Coding là 76,2 ở vị trí thứ 9, và 𝜏²-banking là 46,0.

Một khẳng định về xếp hạng cần được chú ý, vì rất dễ hiểu sai và trước đây từng bị hiểu sai. Chỉ số AA Intelligence của Kimi K3 là 44 đứng thứ ba trong số các mô hình open-weights trên bảng open-weights, sau MiMo-V2.6-Pro với 46 và GLM-5.3 với 45. Nó không dẫn đầu trên bảng đó, và nó không cạnh tranh trên cùng bảng với Grok 4.6 — Artificial Analysis ghi nhận Grok 4.6 là độc quyền, vì vậy chỉ số 44 của nó thuộc bảng xếp hạng chung, không phải bảng open-weights. Hai chỉ số trông giống hệt nhau nhưng không phải vậy.

Những gì người vận hành thực sự thấy

Đây là nguồn gốc của con số 588 triệu, và điều đó đáng được nói rõ vì đây là mảnh bằng chứng duy nhất trong bài viết này thuộc về chúng ta chứ không phải là tiếp thị của bất kỳ ai.

Trong bảy ngày qua, Kimi K3 đã xử lý 587,8 triệu token qua playground của OrcaRouter. Thời gian trung vị đến token đầu tiên của nó là 7,8 giây, nó tạo ra 42,9 token đầu ra mỗi giây, và tỷ lệ lỗi của nó trong khoảng thời gian đó là 0,21% — một lỗi trong khoảng 480 yêu cầu. Tỷ lệ lỗi được đo đó chính là thứ bạn không thể lấy được từ model card, và đó là con số quyết định liệu một mô hình có an toàn để đưa vào một batch job hay không.

Đối với NV-Reason-CT thì không có tương đương, vì nó không phải là một endpoint được host ở bất cứ đâu — nó là một checkpoint bạn tự chạy. Không có p50, không có tỷ lệ lỗi, không có thời gian hoạt động, và không có ai để chuyển đổi dự phòng. Đó không phải là một lời chê; đó là một thực tế mang tính cấu trúc về self-hosting, và đó là lý do một nhóm nghiên cứu có thể áp dụng NV-Reason-CT vào một ngày thứ Ba còn một nhóm sản xuất nói chung thì không thể.

Nếu bạn đang chạy cả hai nửa của hệ thống này — Kimi K3 làm lớp tổng quát được host và NV-Reason-CT trên máy GPU của riêng bạn — thì phía định tuyến chính là nơi nửa được host có được khả năng phục hồi. Kimi K3 được cung cấp ở đúng mức giá niêm yết của chính Moonshot là 3,00 USD mỗi triệu token đầu vào và 15,00 USD mỗi triệu token đầu ra mà không đánh thêm phụ phí, mức giá đọc bộ nhớ đệm 0,30 USD mỗi triệu chỉ bằng một phần mười giá đầu vào, và vì giá được chuyển tiếp nguyên vẹn nên một đợt giảm giá từ nhà cung cấp sẽ đến hóa đơn của bạn ngay trong ngày. Tự động chuyển đổi dự phòng giữa các nhà cung cấp là thứ giữ cho một tác vụ theo lô tiếp tục hoạt động khi một endpoint thượng nguồn gặp trục trặc — và với tỷ lệ lỗi 0,21%, những lần chập chờn hiếm đến mức bạn dễ quên chúng đi cho đến khi chúng không còn hiếm nữa.

Các hình dạng chi phí không giống nhau

• Giá — chi phí đầu tư GPU NV-Reason-CT cộng với hệ thống phục vụ của riêng bạn so với Kimi K3 $3.00 / $15.00 mỗi triệu, $0.30 cho lượt đọc từ bộ nhớ đệm

• Chi tiêu tối thiểu khả thi — NV-Reason-CT một GPU Ampere trở lên được giữ vô thời hạn so với Kimi K3 một yêu cầu

• Ngữ cảnh — NV-Reason-CT một khối, 13.824 token cố định so với Kimi K3 1.048.576 token

• Chi phí biên của yêu cầu thứ một nghìn — NV-Reason-CT hầu như bằng không khi GPU đã được trả tiền, so với Kimi K3 tuyến tính theo token

• Điểm vỡ đầu tiên — thông lượng chưa được kiểm chứng của NV-Reason-CT và không có phương án xử lý theo lô, so với chi phí ngữ cảnh dài của Kimi K3 ở mức 1 triệu token mỗi yêu cầu

• Phương thức — NV-Reason-CT 3D NIfTI, ngực hoặc bụng so với Kimi K3 văn bản và hình ảnh, bất kỳ thứ gì

A generated scoreboard titled 'NV-Reason-CT vs Kimi K3 - the scoreboard'. Left column 'NV-Reason-CT': Price GPU capex plus your serving stack; Minimum viable spend one Ampere-or-newer GPU; Context one volume, 13,824 tokens; Marginal cost of request #1000 effectively zero; Breaks first at unverified throughput, no batching; Modalities 3D NIfTI, chest or abdomen. Right column 'Kimi K3': Price $3.00 / $15.00 per M, $0.30 cached read; Minimum viable spend one request; Context 1,048,576 tokens; Marginal cost of request #1000 linear in tokens; Breaks first at long-context cost at 1M per request; Modalities text and image, anything. A footer reads 'Kimi K3 traffic and error rate measured on OrcaRouter's playground over seven days; NV-Reason-CT has no hosted endpoint to measure.'

Bài toán kinh tế đảo chiều tùy theo khối lượng. Kimi K3 không tốn gì để bắt đầu và mở rộng theo tuyến tính. NV-Reason-CT tốn một GPU để bắt đầu rồi sau đó gần như mở rộng đi ngang — đó là lý do 210 lượt tải xuống không phải là tín hiệu thất bại. Đó là con số chính xác cho một checkpoint mà đối tượng của nó là các tổ chức đã sở hữu phần cứng, và những tổ chức này sẽ không bao giờ xuất hiện trong thống kê thông lượng token nào cả.

A screenshot of NVIDIA's Hugging Face model page for NV-Reason-CT, showing the model card header with Like 1 and 0 followers, the Image-Text-to-Text and Transformers and Safetensors tags, the qwen3_5, medical-imaging, ct, 3d-vlm and custom_code tags, 'Downloads last month 210', the 5B-parameter BF16 size row, the model description describing the 384x384x384-mm volume becoming a 24x24x24 grid of 13,824 visual tokens with no spatial downsampling, the training paragraph citing roughly 550,000 structured QA examples from 70,111 unique CT volumes, a side panel showing Base model Qwen/Qwen3.5-4B and the CT-RATE and CancerVerse datasets, and the arXiv 2609.27511 paper link.

Bạn thực sự đang chọn cái nào?

Nếu công việc là đọc một thể tích CT và tạo ra một phát hiện có cấu trúc cùng dấu vết suy luận, Kimi K3 không thể làm được và NV-Reason-CT có thể. Không phải "làm kém hơn" — mà là không thể, bởi vì không có bộ mã hóa thể tích nào ở bất cứ đâu trong nó, và việc làm phẳng một bản quét thành các hình ảnh trước tiên sẽ loại bỏ các mối quan hệ không gian mà đường dẫn 3D tồn tại để bảo toàn.

Nếu công việc là đọc 400 trang ghi chú chuyển tuyến, đối chiếu chúng với một tài liệu phác đồ, rồi xuất ra đầu ra có cấu trúc, thì NV-Reason-CT không nằm trong số được cân nhắc, và Kimi K3 là một trong những lựa chọn tốt hơn hiện có, với tỷ lệ lỗi đo được dưới 0,25% trên mạng của chúng tôi.

A screenshot of the OrcaRouter model page for Kimi K3, showing the identifier kimi/kimi-k3, input text + image, output text, the Vision, Tools, JSON and Reasoning badges, a 1M-token context window with a p50 time to first token of 7.77 seconds, the description of it as MoonshotAI's 2.8-trillion-parameter Mixture-of-Experts flagship built for long-horizon coding, OpenAI-compatible code samples pointing at https://api.orcarouter.ai/v1, and a stat strip reading $3.00 per million input tokens, $15.00 per million output tokens and 591.2M tokens of seven-day traffic.

Quyết định thực sự không nằm giữa hai lựa chọn đó. Mà là liệu vấn đề của bạn là vấn đề khối lượng hay vấn đề văn bản, và khoảng cách 210 triệu so với 588 triệu chỉ đơn giản là hình hài của sự phân biệt đó khi nhìn từ bên ngoài. Một mô hình là một bài báo kèm trọng số. Cái còn lại là một phần của hạ tầng. Cả hai đều đáng có; không cái nào thay thế được cái kia.

So sánh trong bài viết này1

Phát hiện từ bài viết này · Benchmark: Artificial Analysis · cập nhật hằng ngày