
NV-Reason-CT so với Nemotron 3 Ultra: Một logo, hai triết lý phát hành
- typesafeMỚITypeSafe: Jev 1.132026-09-24$0.04 / $0.00 trên 1 triệu token · 45 tok/s
- openaiMỚIOpenAI: GPT-6 Luna2026-09-2237Trí tuệ
- openaiMỚIOpenAI: GPT-6 Sol2026-09-2248Trí tuệ
- anthropicMỚIAnthropic: Claude Opus 5.52026-09-2258Trí tuệ
- grokMỚIGrok 4.72026-09-2146Trí tuệ
- OrcaMỚIOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 trên 1 triệu token · 182 tok/s
- orcaMỚIOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 trên 1 triệu token · 1285 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Trí tuệ
- openaiOpenAI: GPT-6 Astra2026-09-0453Trí tuệ77Lập trình
- googleGoogle: Gemini 3.8 Flash2026-09-0241Trí tuệ76Lập trình
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Trí tuệ76Lập trình
- anthropicAnthropic: Claude Fable 5.12026-09-0153Trí tuệ82Lập trình
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 trên 1 triệu token · 119 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Trí tuệ72Lập trình
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 trên 1 triệu token · 224 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Trí tuệ75Lập trình
- obsidianQwen3.8 27B2026-08-1534Trí tuệ68Lập trình
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Trí tuệ69Lập trình
- grokSpaceXAI: Grok 4.62026-08-1244Trí tuệ77Lập trình
- metaMeta: Muse Spark 1.22026-08-0540Trí tuệ72Lập trình
NVIDIA đã phát hành hai mô hình trọng số mở trong năm nay và không thông báo với ai về một trong số chúng. Nemotron 3 Ultrađã xuất hiện trên Hugging Face vào ngày 4 tháng 6 năm 2026 với tư cách là mô hình chủ lực tổng 550B, kích hoạt 55B, đi kèm một báo cáo kỹ thuật, một cơ chế giấy phép OpenMDW-1.1 và đằng sau nó là toàn bộ một đợt phát hành tập dữ liệu tiền huấn luyện và hậu huấn luyện mở. NV-Reason-CTđã xuất hiện vào ngày 8 tháng 9 năm 2026 với tư cách là một chuyên gia CT 4,69 tỷ tham số, cùng một kho lưu trữ, một Space demo và một bản thảo arXiv hai tuần sau đó có nhắc đến bản phát hành trong một khối trích dẫn. Không hề có thông báo nào cho mô hình thứ hai. So sánh chúng và bạn không thực sự đang so sánh năng lực — một mô hình chủ lực đa dụng 550B và một chuyên gia y tế 4,69 tỷ không hề trùng lặp. Bạn đang so sánh hai lý thuyết khác nhau về cách phát hành một mô hình, cả hai đều do cùng một công ty vận hành, cách nhau ba tháng.
Mỗi kho lưu trữ thực sự chứa những gì
Bản phát hành Nemotron 3 Ultra là một pipeline mở hoàn chỉnh. Checkpoint NVFP4 trên Hugging Face đã thu hút 249.746 lượt tải xuống và 338 lượt thích; phiên bản anh em BF16, checkpoint cơ sở và các tập dữ liệu hậu huấn luyện đều được công bố cùng với nó. Mô hình hỗ trợ mười hai ngôn ngữ, chỉ dành cho văn bản, được xây dựng trên kiến trúc lai Mamba2-Transformer mixture-of-experts tiềm ẩn với dự đoán nhiều token, và mang giấy phép openmdw-1.1. Artificial Analysis xếp nó ở Chỉ số Trí tuệ 47,7 ở độ chính xác NVFP4 được phát hành và 48,2 ở độ chính xác đầy đủ — cao nhất trong số bất kỳ mô hình trọng số mở nào của Mỹ, theo bảng xếp hạng đó. Bài đưa tin trước đó của chúng tôi về các mô hình giáo viên Nemotron ghi nhận mức giá trung vị của nhà cung cấp vào khoảng 0,60 USD cho mỗi triệu token đầu vào và 2,60 USD cho mỗi triệu token đầu ra, cùng con số thông lượng 183 token đầu ra mỗi giây của NVIDIA trong đo lường của bên thứ ba.
NV-Reason-CT là một artifact nhỏ hơn nhiều và khép kín hơn nhiều. Mười phẩy sáu gigabyte trọng số BF16, 10 KB model.py, 26 KB processor.py, một chat template, và một inference.py. Một demo Space. Một bài báo. Hai trăm mười lượt tải xuống tính đến tuần này. Không có phát hành dataset. Không có báo cáo kỹ thuật. Không có cấu hình phục vụ ngoài một ví dụ single-volume.
Sự tương phản không nằm ở quy mô — mà nằm ở việc một kỹ sư hạ nguồn có thể làm gì với sản phẩm đó. Bản phát hành của Ultra được thiết kế để người khác có thể tái tạo quá trình huấn luyện. Bản phát hành của NV-Reason-CT được thiết kế để người khác có thể chạy suy luận. Đó là những lời hứa khác nhau.
Chỉ có một trong số chúng được xây dựng trên stack riêng của NVIDIA.
Đây là chi tiết khiến người ta ngạc nhiên, và nó có thể được xác minh từ frontmatter của model card: mô hình cơ sở của NV-Reason-CT là Qwen/Qwen3.5-4B, với quan hệ fine-tune, không phải một checkpoint Nemotron. NVIDIA đã gắn một Primus 3D vision transformer — được khởi tạo từ trọng số COLIPRI — vào một mô hình ngôn ngữ Qwen và huấn luyện cặp này từ đầu đến cuối bằng supervised fine-tuning, tiếp theo là Group Relative Policy Optimization.
Đó không phải là một lời chỉ trích và cũng không phải là một vụ bê bối. Đó là chuẩn mực của ngành đối với công việc thị giác - ngôn ngữ, và NVIDIA công bố rõ ràng điều đó trong siêu dữ liệu của kho lưu trữ. Nhưng điều đó có nghĩa là giả định tự nhiên nhất về cặp so sánh này — rằng NV-Reason-CT là một dẫn xuất của Nemotron — là sai. Hai mô hình trên trang này chia sẻ một logo và một họ giấy phép, và hầu như không chia sẻ gì khác. Không chung kiến trúc, không chung tokenizer, không chung dữ liệu huấn luyện, không chung đường phục vụ.
Kích thước, tính theo những con số quyết định nơi nó chạy
• Thông số — NV-Reason-CT 4.69B tổng / 4.35B hoạt động trong nhánh CT so với Nemotron 3 Ultra 550B tổng / 55B hoạt động LatentMoE thưa • Checkpoint trên đĩa — NV-Reason-CT ~10.6 GB BF16 so với Nemotron 3 Ultra hàng trăm gigabyte ở BF16, còn được công bố thêm ở NVFP4 • Đầu vào — NV-Reason-CT thể tích CT NIfTI 3D theo đơn vị Hounsfield, chỉ ngực hoặc bụng, một tiền tố thể tích 13,824 token so với văn bản Nemotron 3 Ultra, tối đa 1M token ngữ cảnh với giới hạn đầu ra 65K • Ngữ cảnh — NV-Reason-CT không áp dụng theo nghĩa thông thường so với Nemotron 3 Ultra 1,000,000 token • Giấy phép — cả hai đều theo OpenMDW-1.1 • Phần cứng — NV-Reason-CT Ampere / Hopper / Lovelace, đã kiểm thử trên H100 và L40S so với Nemotron 3 Ultra phục vụ đa GPU ở mức 55B hoạt động • Điểm độc lập — NV-Reason-CT không công bố điểm nào so với Nemotron 3 Ultra AA Intelligence Index 47.7 NVFP4 / 48.2 độ chính xác đầy đủ

Ranh giới thực tế chính là ranh giới về bộ nhớ. Một mô hình 4,69B với bộ mã hóa 3D vừa trên một card và một nhóm nghiên cứu có thể biện minh cho việc đó. Một mô hình tổng 550B với 55B tham số hoạt động cần hạ tầng phục vụ thực sự ngay cả khi đã lượng tử hóa. Cả hai đều không phải là thí nghiệm trong một cuối tuần, nhưng chúng nằm ở những bậc độ lớn khác nhau của vấn đề đó.
Hai chế độ đánh giá không thể lấy trung bình
Bằng chứng của Ultra là năng lực tổng quát: một Artificial Analysis Intelligence Index ở mức cao trong khoảng 40, độ bao phủ benchmark trên các tác vụ suy luận, lập trình và agentic, cùng các số liệu do nhà cung cấp báo cáo cho họ mô hình bao gồm SWE-Bench Verified 71,9, MMLU-Pro 86,8 và LiveCodeBench v6 89,0 — ba số cuối cùng là số liệu của chính NVIDIA và được ghi nhãn như vậy.
Bằng chứng của NV-Reason-CT chỉ là một bảng. Macro-F1 0.614 và Macro-AUROC 0.871 trên tác vụ phân loại 18 nhãn của CT-RATE, ở một ngưỡng đồng nhất cố định, sử dụng prompt trực tiếp dạng Yes/No không có đầu phân loại, so với VoxelFM ở 0.581/0.870, Pillar-0 ở 0.544/0.861, ClinFusion-8B ở 0.442, CT-CLIP ở 0.398/0.733, Merlin ở 0.358/0.662 và MedGemma 1.5 ở 0.303. Lại là các con số của NVIDIA, trên model card, vẫn chưa có tái lập độc lập nào.

Một AA Intelligence Index là 47.7 và một CT-RATE Macro-F1 là 0.614 không phải là hai phép đo của cùng một thứ. Chúng là các phép đo của hai thứ. Không có cách nào có thể biện hộ được để nói Ultra "tốt hơn" NV-Reason-CT, và lý do không phải là sở thích chấm điểm — mà là các công cụ đo lường này hoàn toàn không trùng nhau. So sánh trung thực duy nhất trong cặp này là về việc mỗi mô hình được công nhận cho ai, theo đúng nghĩa đen của việc có bằng chứng nào cho thấy nó làm được công việc của mình.
Vì sao bản phát hành âm thầm lại là lựa chọn hợp lý
Hãy đặt mình vào vị trí của nhóm hình ảnh y khoa. Bạn có một mô hình CT 3D đang hoạt động. Bạn muốn các bác sĩ X quang, sinh viên y khoa và các nhà nghiên cứu sử dụng nó. Vậy một bài keynote mang lại cho bạn điều gì?
Một sự kiện ra mắt tạo ra những kỳ vọng về hỗ trợ, lộ trình phát triển và độ bền vững mà một nhóm nghiên cứu không thể đáp ứng. Nó mời gọi việc đánh giá đa mục đích trên các benchmark nơi một mô hình 4,69B bị khóa theo phương thức sẽ trông kém ấn tượng vì những lý do mang tính cấu trúc, không liên quan. Và nó đặt một mô hình mà rõ ràng "không được dùng để thay thế cho phán đoán lâm sàng chuyên môn" trước một khán giả không đọc các điều khoản giấy phép. Một kho mã nguồn, một bài báo và một Space demo tiếp cận đúng nhóm khán giả đọc cả ba, và chúng để cho sản phẩm tự lên tiếng theo nhịp độ của chính nó. Chuỗi phiên bản là "0.1". Thẻ mô hình ghi rõ chỉ dành cho nghiên cứu và giáo dục. Đó là một bản phát hành được thiết kế để được trích dẫn, chứ không phải để mua.
Việc ra mắt Ultra thì ngược lại và cũng hợp lý không kém — một sản phẩm chủ lực cần sự phân phối, một biểu phí và sự hỗ trợ từ hệ sinh thái, đó là lý do nó đi kèm với các bộ dữ liệu và một báo cáo.
Bộ định tuyến phù hợp ở đâu và ở đâu thì không
Cả hai mô hình này đều không có trên OrcaRouter, và tôi sẽ không gợi ý điều ngược lại: NV-Reason-CT là một checkpoint 10,6 GB với mã mô hình tùy chỉnh do bạn tự lưu trữ, còn Nemotron 3 Ultra với 55B tham số hoạt động được cung cấp qua API riêng của NVIDIA và một số nền tảng bên thứ ba.

Điều mà một lớp định tuyến làm được cho một nhóm làm việc với cả hai thì hẹp hơn nhưng vẫn hữu ích. Một pipeline nghiên cứu lâm sàng dùng NV-Reason-CT cho khối lượng lớn và một mô hình tổng quát cho phần văn bản xung quanh cần một nơi để thay mô hình tổng quát đó mà không cần hợp đồng thứ hai, và một endpoint tương thích OpenAI bao phủ hơn 200 mô hình với khả năng chuyển đổi dự phòng tự động giữa các nhà cung cấp chính là nơi đó. Nó giữ chuyên gia tự vận hành và mô hình tổng quát chạy trên dịch vụ lưu trữ dưới cùng một khóa thay vì hai tích hợp riêng biệt.
Cần rút ra điều gì từ sự kết hợp
Nếu đọc như những đối thủ cạnh tranh, hai mô hình này là một lỗi phạm trù. Nếu đọc như một nghiên cứu điển hình, chúng lại rõ ràng một cách bất thường. Cùng nhà cung cấp, cùng họ giấy phép, cùng năm — và hai chiến lược phát hành được chọn để khớp với hai mục đích sử dụng ở hạ nguồn hoàn toàn khác nhau. Một mô hình là cơ sở hạ tầng gắn liền với một hệ sinh thái. Mô hình còn lại là một bài báo gắn kèm trọng số, được phát hành để một nhóm nhỏ đối tượng cụ thể có thể chạy nó và trích dẫn nó.
Nếu bạn đang tìm một mô hình open-weights tổng quát, NV-Reason-CT không phải là ứng viên và chưa bao giờ được tạo ra để trở thành như vậy. Nếu bạn đọc khối CT ngực và bụng bằng lập trình, Nemotron 3 Ultra không thể giúp bạn và chưa bao giờ được tạo ra để làm điều đó. Điểm trùng lặp thực sự duy nhất giữa chúng là logo, và bài học thực sự duy nhất là NVIDIA sẵn sàng âm thầm phát hành khi đối tượng đủ nhỏ và đủ kỹ thuật để họ tự tìm ra kho lưu trữ mà không cần hỗ trợ.
