
NV-Reason-CT vs Claude Opus 5: Một lỗi phạm trù đáng được coi trọng
- typesafeMỚITypeSafe: Jev 1.132026-09-24$0.04 / $0.00 trên 1 triệu token · 506 tok/s
- openaiMỚIOpenAI: GPT-6 Luna2026-09-2237Trí tuệ
- openaiMỚIOpenAI: GPT-6 Sol2026-09-2248Trí tuệ
- anthropicMỚIAnthropic: Claude Opus 5.52026-09-2258Trí tuệ
- grokMỚIGrok 4.72026-09-2146Trí tuệ
- OrcaMỚIOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 trên 1 triệu token · 183 tok/s
- orcaMỚIOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 trên 1 triệu token · 1285 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Trí tuệ
- openaiOpenAI: GPT-6 Astra2026-09-0453Trí tuệ77Lập trình
- googleGoogle: Gemini 3.8 Flash2026-09-0241Trí tuệ76Lập trình
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Trí tuệ76Lập trình
- anthropicAnthropic: Claude Fable 5.12026-09-0153Trí tuệ82Lập trình
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 trên 1 triệu token · 119 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Trí tuệ72Lập trình
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 trên 1 triệu token · 224 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Trí tuệ75Lập trình
- obsidianQwen3.8 27B2026-08-1534Trí tuệ68Lập trình
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Trí tuệ69Lập trình
- grokSpaceXAI: Grok 4.62026-08-1244Trí tuệ77Lập trình
- metaMeta: Muse Spark 1.22026-08-0540Trí tuệ72Lập trình
Việc đặt NV-Reason-CT và Claude Opus 5 vào cùng một câu là một lỗi phạm trù, và dù vậy vẫn đáng làm, bởi vì lỗi ấy mang tính gợi mở. NV-Reason-CT là mô hình thị giác-ngôn ngữ 3D gốc của NVIDIA với 4,69 tỷ tham số, nhận đầu vào là khối CT ngực hoặc bụng tính bằng đơn vị Hounsfield và tạo ra bản báo cáo có cấu trúc theo từng phát hiện. Đây không phải là thiết bị y tế và thẻ mô hình của chính nó cũng nói như vậy. Claude Opus 5 là mô hình văn bản và thị giác tiên tiến đa dụng của nhà cung cấp, phát hành ngày 24 tháng 7 năm 2026, với cửa sổ ngữ cảnh một triệu token, giới hạn đầu ra 128.000 token, và mức giá công bố là năm đô la cho mỗi triệu token đầu vào và hai mươi lăm đô la cho mỗi triệu token đầu ra. Một trong hai mô hình này đọc CT. Mô hình còn lại đọc mọi thứ khác.
Lý do việc so sánh này cứ tiếp tục được đưa ra — và nó sẽ còn tiếp tục như vậy, mỗi khi ai đó nhìn thấy một VLM y tế mới và với tay tìm một thước đo quen thuộc — là ở chỗ cả hai đều tạo ra văn xuôi về một hình ảnh. Sự tương đồng bề ngoài đó đang gây tổn hại thực sự đến cách người ta suy luận về hai thứ ấy, nên nó đáng được mổ xẻ chi tiết.
Trục thực sự mà họ chia sẻ, và trục mà họ không chia sẻ.
Chúng trùng nhau ở đúng một điểm, và điểm đó hẹp hơn vẻ bề ngoài của nó.
• Dạng dữ liệu đầu vào trong — NV-Reason-CT nhận các khối thể tích NIfTI một kênh theo đơn vị Hounsfield thông qua một bộ xử lý ba chiều chuyên dụng; Claude Opus 5 nhận văn bản, hình ảnh và tệp, đây là giao diện thế hệ thứ hai dành cho hình ảnh và không thể tiếp nhận trực tiếp một nghiên cứu CT thể tích
• Kết quả trả về — danh sách phát hiện được tổ chức theo vùng giải phẫu từ NV-Reason-CT, so với văn xuôi thông thường, JSON có cấu trúc hoặc các lệnh gọi công cụ từ Claude Opus 5
• Đơn vị công việc — một khối CT, được lấy mẫu lại về 2 mm đẳng hướng, cắt theo giải phẫu, chia thành các mảng 8 x 8 x 8; so với bất cứ thứ gì bạn đưa vào ngân sách token
• Ngữ cảnh — NV-Reason-CT hoàn toàn không có cửa sổ trò chuyện; một tập dữ liệu duy nhất trở thành 13,824 token hình ảnh mà không hề giảm mẫu. Claude Opus 5 chứa được 1.000.000 token đầu vào và phát ra tối đa 128.000
• Giấy phép — OpenMDW-1.1, một mô hình có thể tải xuống mà bạn chạy trên phần cứng của riêng mình; so với một API được lưu trữ
• Mục đích sử dụng được nêu — chỉ dành cho nghiên cứu và giáo dục, nêu rõ không phải là thiết bị y tế, dành cho NV-Reason-CT; không dùng cho mục đích hỗ trợ tổng quát đối với Claude Opus 5
• Giá — không có giá niêm yết, vì không có gì để mua, chỉ có trọng số để chạy; so với $5 và $25 mỗi triệu token, với lượt đọc được cache ở mức $0.50
Hàng "modality in" là nơi lỗi phạm trù nảy sinh. Cả hai đều nhận một hình ảnh, nên cả hai trông giống như mô hình hình ảnh, và người đọc sẽ đặt câu hỏi một cách hợp lý rằng cái nào xử lý hình ảnh tốt hơn. Nhưng một ca chụp CT không phải là một hình ảnh. Nó là một mảng thể tích với thang đo vật lý tính bằng milimét, một đơn vị mật độ đã được hiệu chuẩn, và giải phẫu chỉ có ý nghĩa trong không gian ba chiều. Khả năng thị giác của Claude Opus 5 thực sự tốt và nó sẽ thảo luận hợp lý về một phim X-quang hoặc một tiêu bản bệnh học. Đó là một nhiệm vụ khác với việc tích hợp một khối lập phương 384 milimét gồm các giá trị Hounsfield ở độ phân giải 2 mm và báo cáo về sự phân thùy của một nốt.
Các con số ở mỗi bên thực sự đo lường điều gì
Hai mô hình có những hồ sơ đánh giá không bao giờ chạm nhau, và đọc chúng cạnh nhau mà không nhận ra điều đó chính là cách những quyết định mua sắm tồi tệ được đưa ra.
NV-Reason-CT báo cáo kết quả của nó trên bộ đánh giá CT-RATE công khai về CT ngực, với mười tám nhãn, sử dụng ngưỡng đồng nhất cố định và lời nhắc yes/no trực tiếp mà không có đầu phân loại và không có thích ứng theo tác vụ cụ thể. Nó đạt 0.614 F1 và 0.871 AUROC, vượt qua VoxelFM ở 0.581 và 0.870, Pillar-0 ở 0.544 và 0.861, ClinFusion-8B ở 0.442 F1, CT-CLIP ở 0.398 và 0.733, Merlin ở 0.358 và 0.662, và MedGemma 1.5 ở 0.303 F1 khi được cung cấp tối đa 85 lát cắt trục. Cũng có một macro-F1 dẫn xuất từ báo cáo là 0.592. Mỗi một trong những số liệu đó đều đến từ bài báo của chính NVIDIA. Không có số liệu nào được tái tạo bởi bất kỳ ai khác, và mô hình đã có thể tải xuống trong vài tuần.
Thành tích của Claude Opus 5 là thành tích đa dụng và phần lớn độc lập. Artificial Analysis đo nó ở mức 50.8 trên Intelligence Index, 78 trên Coding Index, 93.2 trên GPQA Diamond và 54.9 trên Humanity's Last Exam, với điểm nhớ lại ngữ cảnh dài là 79.33. Đó là số liệu của bên thứ ba về các tác vụ suy luận tổng quát, lập trình và kiến thức. Không có benchmark hình ảnh lâm sàng nào trong bộ đó, và không có dòng CT-RATE nào ở bất cứ đâu trong hồ sơ đã công bố của Claude Opus 5.
Vậy nên phát biểu trung thực không phải là một cái đang dẫn trước. Mà là hai mô hình chưa từng được bất kỳ ai đo lường trên cùng một tác vụ. Bất kỳ câu nào có dạng "NV-Reason-CT tốt hơn Claude Opus 5 trong chẩn đoán hình ảnh y tế" đều không thể phản chứng như đã viết, bởi vì chưa ai chạy thí nghiệm đó. Bảng so sánh của chính NVIDIA không chứa mô hình tiên tiến tổng quát nào.

Mọi người hiểu sai câu hỏi về giao diện ở đâu
Điểm giao thoa kỹ thuật thực sự thú vị duy nhất lại chính là điểm mà không ai tranh cãi: giao diện giữa một mô hình CT và một mô hình văn bản nên trông như thế nào.
Một bản năng hợp lý là đưa cho Claude Opus 5 một tập ảnh CT hoặc một khối thể tích đã được giảm mẫu rồi yêu cầu nó suy luận. Ở mức 1.000.000 token ngữ cảnh, điều đó nghe có vẻ hào phóng, và so với một ca chụp chỉ có 13.824 token thị giác thì nghe như thừa chỗ. Khoảng trống không phải là vấn đề. Quy trình thị giác của Claude Opus 5 coi một ảnh như một hình hai chiều với thang đo pixel. Một ảnh CT ngực được trình bày theo cách đó sẽ đánh mất khoảng cách giữa các lát cắt — thứ khiến một tổn thương có thể đo được — và đánh mất việc hiệu chuẩn mật độ — thứ khiến "mờ kính" trở thành một ngưỡng thay vì một mô tả. Bạn có thể đưa cho nó một ảnh ghép các lát cắt trục và nhận lại một đoạn văn nghe có vẻ mạch lạc. Thứ bạn không thể nhận được là một phép đo.
Đó chính xác là điều mà thiết kế của NV-Reason-CT dành năng lực tính toán của mình cho. Lưới 24 x 24 x 24 từ một khối 384 milimét được đưa cho mô hình ngôn ngữ ở độ phân giải đầy đủ, không có giảm mẫu không gian và không có lớp hợp nhất, đó là lý do tại sao đường dẫn hoạt động có 4,35 tỷ tham số thay vì một con số nhỏ hơn nhiều. Kiến trúc này là một canh bạc rằng việc giữ chi tiết không gian đáng giá so với chi phí token. Đó là canh bạc về biểu diễn, không phải về khả năng ngôn ngữ, và Claude Opus 5 không phải là một bên tham gia trong đó.
Mô hình hiệu quả lại chính là mô hình nhàm chán: dùng mô hình CT cho phần đọc thể tích, và dùng mô hình văn bản cho mọi thứ xung quanh nó. Tạo và chuẩn hoá báo cáo, tóm tắt thuần tập, khung đánh giá, chuyển đổi kho lưu trữ DICOM sang NIfTI ở quy mô lớn, phân loại ưu tiên những ca khảo sát mà con người nên xem trước. Đó là công việc với tài liệu dài và mã, và đó là nơi một mô hình ngữ cảnh 1M xứng đáng với mức giá của nó.
Chi phí, ở hai đơn vị không thể chuyển đổi
Claude Opus 5 được tính phí theo lượng dùng. Năm đô la mỗi triệu token đầu vào và hai mươi lăm đô la mỗi triệu token đầu ra, đọc cache tốn năm mươi xu, ghi cache tốn mười đô la. Đối với một pipeline chuẩn hóa một tập báo cáo hoặc viết và viết lại mã đánh giá, điều đó tạo ra một dự báo bạn có thể lập: token vào, token ra, các lượt đọc cache, và một hóa đơn rẻ hơn nhiều nếu bạn làm đúng phần cache.
NV-Reason-CT không có giá. Bạn tải xuống 4,69 tỷ tham số và trả tiền bằng điện năng, giờ GPU và thời gian kỹ thuật. Không có con số thông lượng nào được công bố cho một nghiên cứu đầy đủ 13.824 token, và không có biến thể lượng tử hóa nào được chào bán, nên chi phí cho mỗi nghiên cứu khi chạy nó là một con số bạn sẽ phải tự đo lấy. Điều đó là bình thường đối với trọng số nghiên cứu, và đó cũng là khác biệt thực tế lớn nhất giữa hai bên: một bên có bảng giá dịch vụ, bên kia có một hóa đơn bạn không thể nhìn thấy cho đến khi đã trả xong.
Phép so sánh thực sự quan trọng là theo từng ca chụp, không phải theo token. Một lần đọc CT là một đơn vị công việc. Một lượt chuẩn hóa báo cáo trên cùng ca đó là một tác vụ văn bản được đo bằng hàng nghìn token. Gán một con số đô la cho việc thứ nhất nghĩa là phải biết phần cứng của bạn; gán cho việc thứ hai chỉ là số học.
Cái bẫy ở giữa sự so sánh
Có một lỗi cụ thể đáng gọi tên, bởi vì đó chính là lỗi mà cuộc đối đầu này mời gọi. Đó là việc coi NV-Reason-CT như một bản tinh chỉnh chuyên biệt của một mô hình tổng quát, và do đó giả định rằng mô hình tổng quát sẽ đủ gần trong hầu hết các trường hợp và linh hoạt hơn nhiều.
Đây không phải là một fine-tune. Đó là một vision transformer 3D tên là Primus, được khởi tạo từ COLIPRI, gắn vào một xương sống ngôn ngữ Qwen3.5-4B với 3D multi-axis rotary position embedding, được huấn luyện trên khoảng 550.000 ví dụ hỏi–đáp có cấu trúc lấy từ 70.111 thể tích CT thuộc CT-RATE, CancerVerse và một bộ sưu tập nội bộ của NIH, rồi sau đó được tinh chỉnh bằng GRPO theo một hàm thưởng đặt trọng số 2,0 cho F1 của tập bất thường, 0,5 cho điểm cấu trúc báo cáo theo vùng cụ thể và 1,0 cho hình phạt độ dài mềm. Bộ mã hóa ba chiều mới chính là điểm cốt lõi của mô hình. Một front end hai chiều hay dựa trên lát cắt là một công cụ khác, và chính phần so sánh trong bài báo cho thấy sự khác biệt đó đáng giá bao nhiêu: MedGemma 1.5 đạt 0,303 F1 khi được đưa vào tối đa 85 lát cắt trục, so với 0,614 của mô hình thể tích thuần.
Sai lầm ngược lại cũng phổ biến không kém và tốn kém y hệt: cho rằng vì NV-Reason-CT chuyên biệt nên bạn nên dùng nó cho mọi việc lâm sàng. Nó chỉ hỗ trợ ngực và bụng, không gì khác; cách gọi nó là một tệp NIfTI chứ không phải tin nhắn trò chuyện, và điều khoản giấy phép của nó ghi rõ chỉ dành cho nghiên cứu và giáo dục. Nó sẽ không đọc tiêu bản giải phẫu bệnh, trả lời câu hỏi về hướng dẫn, hay viết mã để chạy hàng loạt chuyển đổi DICOM của bạn. Dùng một mô hình CT để làm việc văn bản cũng là cùng loại lỗi phạm trù như dùng một mô hình văn bản để đo thể tích, chỉ là hướng ngược lại mà thôi.

Cách hai nửa khớp với nhau trong một hệ thống
Không mô hình nào thay thế mô hình kia, và kiến trúc hợp lý chứa cả hai — điều này đặt ra câu hỏi thực tế về cách bạn gọi chúng.
Claude Opus 5 được cung cấp qua OrcaRouter dưới dạng anthropic/claude-opus-5 với mức giá theo danh sách nhà cung cấp của Anthropic, không phụ phí, nằm trong một API duy nhất bao phủ hơn 200 mô hình. Điều đó ít quan trọng đối với một lệnh gọi đơn lẻ hơn là đối với toàn bộ đường ống xung quanh: khi phần văn bản của một bản dựng lâm sàng chỉ là một mô hình trong số nhiều ứng viên, việc tất cả chúng nằm sau một khóa duy nhất nghĩa là bạn có thể so sánh chúng trên chính kho ngữ liệu của mình mà không cần hợp đồng thứ hai hay thay đổi mã nguồn, và DSL định tuyến cho phép bạn gửi từng yêu cầu riêng lẻ đến mô hình phù hợp để xử lý chúng, trong khi chuyển đổi dự phòng tự động sẽ bảo vệ bạn khi nhà cung cấp gặp sự cố.
NV-Reason-CT không có trên nền tảng của chúng tôi, và không có mô hình NVIDIA nào cả. Nó là các trọng số mà bạn tải về và chạy trên phần cứng của riêng bạn, đó chính xác là điều mà giấy phép cho phép bạn làm và, xét rằng đầu vào là dữ liệu thể tích có nguồn gốc từ bệnh nhân, có lẽ đó cũng là điều bạn muốn dù sao đi nữa. Chúng tôi sẽ không ngụ ý rằng chúng tôi định tuyến một mô hình mà chúng tôi không lưu trữ. Phần văn bản của bản dựng là nơi chúng tôi hữu ích; phần thể tích là nơi bạn tự xoay xở với một mô hình 4.69B và một GPU.

Phán quyết trụ vững trước sự soi xét
Nếu bạn cần đọc một thể tích CT thành các phát hiện có cấu trúc, có một mô hình cho việc đó, nó xuất phát từ nhóm nghiên cứu của NVIDIA, và đó là bản tải về chứ không phải một lệnh gọi API. Nếu bạn cần chuẩn hoá một kho báo cáo, viết một bộ khung đánh giá, viết script cho một tác vụ chuyển đổi DICOM, hoặc tóm tắt một đoàn hệ, thì cũng có một mô hình cho việc đó, và nó có bảng giá.
Điều cần giữ vững là chưa bên nào được chứng minh là tốt hơn bên kia ở bất cứ điểm nào, vì thí nghiệm đó vẫn chưa được thực hiện. Điều đã được chứng minh là một giao diện ba chiều native đánh bại một giao diện dựa trên lát cắt trên một benchmark CT lồng ngực công khai với khoảng cách mà các tác giả ước tính vào khoảng ba điểm F1, và rằng một mô hình tiên phong tổng quát được đo lường độc lập ở vị trí dẫn đầu lĩnh vực về suy luận, lập trình và các tác vụ ngữ cảnh dài. Đó là hai phát biểu về hai công việc khác nhau. Đọc chúng như một bảng xếp hạng chính là lỗi phạm trù, và lỗi đó vẫn tồn tại cho đến tận khi có ai đó công bố cuộc đối đầu trực tiếp mà chưa ai công bố.
