Một thẻ hero được tạo tự động có tiêu đề 'NV-Reason-CT vs Claude Opus 5' với phụ đề 'Một lỗi phân loại đáng để xem xét nghiêm túc'. Hai thẻ đối diện nhau được ngăn cách bởi một cặp mũi tên xanh: thẻ bên trái được dán nhãn 'NV-Reason-CT' với biểu tượng quét cơ thể và dòng '4,69 tỷ tham số - 13.824 token mỗi thể tích CT - không phải thiết bị y tế'; thẻ bên phải được dán nhãn 'Claude Opus 5' với biểu tượng chip và dòng 'ngữ cảnh 1M - đầu ra 128K - 5 USD / 25 USD mỗi triệu token'. Logo OrcaRouter được ghép vào góc dưới bên phải.
Guides & Insights

NV-Reason-CT vs Claude Opus 5: Một lỗi phạm trù đáng được coi trọng

Tác giả

Rowan Sterling

Ngày đăng

Mô hình mới nhất · 20Xem tất cả mô hình →
Benchmark: Artificial Analysis · cập nhật hằng ngày
Quay lại tất cả bài viết

Việc đặt NV-Reason-CT và Claude Opus 5 vào cùng một câu là một lỗi phạm trù, và dù vậy vẫn đáng làm, bởi vì lỗi ấy mang tính gợi mở. NV-Reason-CT là mô hình thị giác-ngôn ngữ 3D gốc của NVIDIA với 4,69 tỷ tham số, nhận đầu vào là khối CT ngực hoặc bụng tính bằng đơn vị Hounsfield và tạo ra bản báo cáo có cấu trúc theo từng phát hiện. Đây không phải là thiết bị y tế và thẻ mô hình của chính nó cũng nói như vậy. Claude Opus 5 là mô hình văn bản và thị giác tiên tiến đa dụng của nhà cung cấp, phát hành ngày 24 tháng 7 năm 2026, với cửa sổ ngữ cảnh một triệu token, giới hạn đầu ra 128.000 token, và mức giá công bố là năm đô la cho mỗi triệu token đầu vào và hai mươi lăm đô la cho mỗi triệu token đầu ra. Một trong hai mô hình này đọc CT. Mô hình còn lại đọc mọi thứ khác.

Lý do việc so sánh này cứ tiếp tục được đưa ra — và nó sẽ còn tiếp tục như vậy, mỗi khi ai đó nhìn thấy một VLM y tế mới và với tay tìm một thước đo quen thuộc — là ở chỗ cả hai đều tạo ra văn xuôi về một hình ảnh. Sự tương đồng bề ngoài đó đang gây tổn hại thực sự đến cách người ta suy luận về hai thứ ấy, nên nó đáng được mổ xẻ chi tiết.

Trục thực sự mà họ chia sẻ, và trục mà họ không chia sẻ.

Chúng trùng nhau ở đúng một điểm, và điểm đó hẹp hơn vẻ bề ngoài của nó.

• Dạng dữ liệu đầu vào trong — NV-Reason-CT nhận các khối thể tích NIfTI một kênh theo đơn vị Hounsfield thông qua một bộ xử lý ba chiều chuyên dụng; Claude Opus 5 nhận văn bản, hình ảnh và tệp, đây là giao diện thế hệ thứ hai dành cho hình ảnh và không thể tiếp nhận trực tiếp một nghiên cứu CT thể tích

• Kết quả trả về — danh sách phát hiện được tổ chức theo vùng giải phẫu từ NV-Reason-CT, so với văn xuôi thông thường, JSON có cấu trúc hoặc các lệnh gọi công cụ từ Claude Opus 5

• Đơn vị công việc — một khối CT, được lấy mẫu lại về 2 mm đẳng hướng, cắt theo giải phẫu, chia thành các mảng 8 x 8 x 8; so với bất cứ thứ gì bạn đưa vào ngân sách token

• Ngữ cảnh — NV-Reason-CT hoàn toàn không có cửa sổ trò chuyện; một tập dữ liệu duy nhất trở thành 13,824 token hình ảnh mà không hề giảm mẫu. Claude Opus 5 chứa được 1.000.000 token đầu vào và phát ra tối đa 128.000

• Giấy phép — OpenMDW-1.1, một mô hình có thể tải xuống mà bạn chạy trên phần cứng của riêng mình; so với một API được lưu trữ

• Mục đích sử dụng được nêu — chỉ dành cho nghiên cứu và giáo dục, nêu rõ không phải là thiết bị y tế, dành cho NV-Reason-CT; không dùng cho mục đích hỗ trợ tổng quát đối với Claude Opus 5

• Giá — không có giá niêm yết, vì không có gì để mua, chỉ có trọng số để chạy; so với $5 và $25 mỗi triệu token, với lượt đọc được cache ở mức $0.50

Hàng "modality in" là nơi lỗi phạm trù nảy sinh. Cả hai đều nhận một hình ảnh, nên cả hai trông giống như mô hình hình ảnh, và người đọc sẽ đặt câu hỏi một cách hợp lý rằng cái nào xử lý hình ảnh tốt hơn. Nhưng một ca chụp CT không phải là một hình ảnh. Nó là một mảng thể tích với thang đo vật lý tính bằng milimét, một đơn vị mật độ đã được hiệu chuẩn, và giải phẫu chỉ có ý nghĩa trong không gian ba chiều. Khả năng thị giác của Claude Opus 5 thực sự tốt và nó sẽ thảo luận hợp lý về một phim X-quang hoặc một tiêu bản bệnh học. Đó là một nhiệm vụ khác với việc tích hợp một khối lập phương 384 milimét gồm các giá trị Hounsfield ở độ phân giải 2 mm và báo cáo về sự phân thùy của một nốt.

Các con số ở mỗi bên thực sự đo lường điều gì

Hai mô hình có những hồ sơ đánh giá không bao giờ chạm nhau, và đọc chúng cạnh nhau mà không nhận ra điều đó chính là cách những quyết định mua sắm tồi tệ được đưa ra.

NV-Reason-CT báo cáo kết quả của nó trên bộ đánh giá CT-RATE công khai về CT ngực, với mười tám nhãn, sử dụng ngưỡng đồng nhất cố định và lời nhắc yes/no trực tiếp mà không có đầu phân loại và không có thích ứng theo tác vụ cụ thể. Nó đạt 0.614 F1 và 0.871 AUROC, vượt qua VoxelFM ở 0.581 và 0.870, Pillar-0 ở 0.544 và 0.861, ClinFusion-8B ở 0.442 F1, CT-CLIP ở 0.398 và 0.733, Merlin ở 0.358 và 0.662, và MedGemma 1.5 ở 0.303 F1 khi được cung cấp tối đa 85 lát cắt trục. Cũng có một macro-F1 dẫn xuất từ báo cáo là 0.592. Mỗi một trong những số liệu đó đều đến từ bài báo của chính NVIDIA. Không có số liệu nào được tái tạo bởi bất kỳ ai khác, và mô hình đã có thể tải xuống trong vài tuần.

Thành tích của Claude Opus 5 là thành tích đa dụng và phần lớn độc lập. Artificial Analysis đo nó ở mức 50.8 trên Intelligence Index, 78 trên Coding Index, 93.2 trên GPQA Diamond và 54.9 trên Humanity's Last Exam, với điểm nhớ lại ngữ cảnh dài là 79.33. Đó là số liệu của bên thứ ba về các tác vụ suy luận tổng quát, lập trình và kiến thức. Không có benchmark hình ảnh lâm sàng nào trong bộ đó, và không có dòng CT-RATE nào ở bất cứ đâu trong hồ sơ đã công bố của Claude Opus 5.

Vậy nên phát biểu trung thực không phải là một cái đang dẫn trước. Mà là hai mô hình chưa từng được bất kỳ ai đo lường trên cùng một tác vụ. Bất kỳ câu nào có dạng "NV-Reason-CT tốt hơn Claude Opus 5 trong chẩn đoán hình ảnh y tế" đều không thể phản chứng như đã viết, bởi vì chưa ai chạy thí nghiệm đó. Bảng so sánh của chính NVIDIA không chứa mô hình tiên tiến tổng quát nào.

A generated scoreboard titled 'NV-Reason-CT vs Claude Opus 5 - what each number measures' with two columns. The left column, headed 'NV-Reason-CT', lists six rows: input, one-channel NIfTI volumes in Hounsfield units; output, structured findings by anatomical region; benchmark, CT-RATE 0.614 F1 and 0.871 AUROC over 18 labels; provenance, authors' own paper, unreproduced; licence, OpenMDW-1.1, self-hosted; use, research and education, not a medical device. The right column, headed 'Claude Opus 5', lists six rows: input, text, images, files; output, general prose, JSON, tool calls; benchmark, AA Intelligence 50.8, GPQA Diamond 93.2, HLE 54.9; provenance, independent, Artificial Analysis; licence, hosted API; use, general purpose. A footer reads 'The two benchmark sets share no task, so neither column can be subtracted from the other.'

Mọi người hiểu sai câu hỏi về giao diện ở đâu

Điểm giao thoa kỹ thuật thực sự thú vị duy nhất lại chính là điểm mà không ai tranh cãi: giao diện giữa một mô hình CT và một mô hình văn bản nên trông như thế nào.

Một bản năng hợp lý là đưa cho Claude Opus 5 một tập ảnh CT hoặc một khối thể tích đã được giảm mẫu rồi yêu cầu nó suy luận. Ở mức 1.000.000 token ngữ cảnh, điều đó nghe có vẻ hào phóng, và so với một ca chụp chỉ có 13.824 token thị giác thì nghe như thừa chỗ. Khoảng trống không phải là vấn đề. Quy trình thị giác của Claude Opus 5 coi một ảnh như một hình hai chiều với thang đo pixel. Một ảnh CT ngực được trình bày theo cách đó sẽ đánh mất khoảng cách giữa các lát cắt — thứ khiến một tổn thương có thể đo được — và đánh mất việc hiệu chuẩn mật độ — thứ khiến "mờ kính" trở thành một ngưỡng thay vì một mô tả. Bạn có thể đưa cho nó một ảnh ghép các lát cắt trục và nhận lại một đoạn văn nghe có vẻ mạch lạc. Thứ bạn không thể nhận được là một phép đo.

Đó chính xác là điều mà thiết kế của NV-Reason-CT dành năng lực tính toán của mình cho. Lưới 24 x 24 x 24 từ một khối 384 milimét được đưa cho mô hình ngôn ngữ ở độ phân giải đầy đủ, không có giảm mẫu không gian và không có lớp hợp nhất, đó là lý do tại sao đường dẫn hoạt động có 4,35 tỷ tham số thay vì một con số nhỏ hơn nhiều. Kiến trúc này là một canh bạc rằng việc giữ chi tiết không gian đáng giá so với chi phí token. Đó là canh bạc về biểu diễn, không phải về khả năng ngôn ngữ, và Claude Opus 5 không phải là một bên tham gia trong đó.

Mô hình hiệu quả lại chính là mô hình nhàm chán: dùng mô hình CT cho phần đọc thể tích, và dùng mô hình văn bản cho mọi thứ xung quanh nó. Tạo và chuẩn hoá báo cáo, tóm tắt thuần tập, khung đánh giá, chuyển đổi kho lưu trữ DICOM sang NIfTI ở quy mô lớn, phân loại ưu tiên những ca khảo sát mà con người nên xem trước. Đó là công việc với tài liệu dài và mã, và đó là nơi một mô hình ngữ cảnh 1M xứng đáng với mức giá của nó.

Chi phí, ở hai đơn vị không thể chuyển đổi

Claude Opus 5 được tính phí theo lượng dùng. Năm đô la mỗi triệu token đầu vào và hai mươi lăm đô la mỗi triệu token đầu ra, đọc cache tốn năm mươi xu, ghi cache tốn mười đô la. Đối với một pipeline chuẩn hóa một tập báo cáo hoặc viết và viết lại mã đánh giá, điều đó tạo ra một dự báo bạn có thể lập: token vào, token ra, các lượt đọc cache, và một hóa đơn rẻ hơn nhiều nếu bạn làm đúng phần cache.

NV-Reason-CT không có giá. Bạn tải xuống 4,69 tỷ tham số và trả tiền bằng điện năng, giờ GPU và thời gian kỹ thuật. Không có con số thông lượng nào được công bố cho một nghiên cứu đầy đủ 13.824 token, và không có biến thể lượng tử hóa nào được chào bán, nên chi phí cho mỗi nghiên cứu khi chạy nó là một con số bạn sẽ phải tự đo lấy. Điều đó là bình thường đối với trọng số nghiên cứu, và đó cũng là khác biệt thực tế lớn nhất giữa hai bên: một bên có bảng giá dịch vụ, bên kia có một hóa đơn bạn không thể nhìn thấy cho đến khi đã trả xong.

Phép so sánh thực sự quan trọng là theo từng ca chụp, không phải theo token. Một lần đọc CT là một đơn vị công việc. Một lượt chuẩn hóa báo cáo trên cùng ca đó là một tác vụ văn bản được đo bằng hàng nghìn token. Gán một con số đô la cho việc thứ nhất nghĩa là phải biết phần cứng của bạn; gán cho việc thứ hai chỉ là số học.

Cái bẫy ở giữa sự so sánh

Có một lỗi cụ thể đáng gọi tên, bởi vì đó chính là lỗi mà cuộc đối đầu này mời gọi. Đó là việc coi NV-Reason-CT như một bản tinh chỉnh chuyên biệt của một mô hình tổng quát, và do đó giả định rằng mô hình tổng quát sẽ đủ gần trong hầu hết các trường hợp và linh hoạt hơn nhiều.

Đây không phải là một fine-tune. Đó là một vision transformer 3D tên là Primus, được khởi tạo từ COLIPRI, gắn vào một xương sống ngôn ngữ Qwen3.5-4B với 3D multi-axis rotary position embedding, được huấn luyện trên khoảng 550.000 ví dụ hỏi–đáp có cấu trúc lấy từ 70.111 thể tích CT thuộc CT-RATE, CancerVerse và một bộ sưu tập nội bộ của NIH, rồi sau đó được tinh chỉnh bằng GRPO theo một hàm thưởng đặt trọng số 2,0 cho F1 của tập bất thường, 0,5 cho điểm cấu trúc báo cáo theo vùng cụ thể và 1,0 cho hình phạt độ dài mềm. Bộ mã hóa ba chiều mới chính là điểm cốt lõi của mô hình. Một front end hai chiều hay dựa trên lát cắt là một công cụ khác, và chính phần so sánh trong bài báo cho thấy sự khác biệt đó đáng giá bao nhiêu: MedGemma 1.5 đạt 0,303 F1 khi được đưa vào tối đa 85 lát cắt trục, so với 0,614 của mô hình thể tích thuần.

Sai lầm ngược lại cũng phổ biến không kém và tốn kém y hệt: cho rằng vì NV-Reason-CT chuyên biệt nên bạn nên dùng nó cho mọi việc lâm sàng. Nó chỉ hỗ trợ ngực và bụng, không gì khác; cách gọi nó là một tệp NIfTI chứ không phải tin nhắn trò chuyện, và điều khoản giấy phép của nó ghi rõ chỉ dành cho nghiên cứu và giáo dục. Nó sẽ không đọc tiêu bản giải phẫu bệnh, trả lời câu hỏi về hướng dẫn, hay viết mã để chạy hàng loạt chuyển đổi DICOM của bạn. Dùng một mô hình CT để làm việc văn bản cũng là cùng loại lỗi phạm trù như dùng một mô hình văn bản để đo thể tích, chỉ là hướng ngược lại mà thôi.

A generated scoreboard titled 'The two models, at a glance' listing six paired rows. Row one: parameters, 4.69B total and 4.35B active, against undisclosed. Row two: context, 13,824 visual tokens per volume against 1,000,000 input and 128,000 output tokens. Row three: input, one-channel NIfTI in Hounsfield units against text, images and files. Row four: availability, weights downloadable on Hugging Face against hosted API. Row five: price, self-hosted with no rate card against $5 and $25 per million tokens. Row six: status, unannounced research release against generally available. A footer reads 'NV-Reason-CT figures per the authors paper and model card; Claude Opus 5 figures per the provider rate card and Artificial Analysis.'

Cách hai nửa khớp với nhau trong một hệ thống

Không mô hình nào thay thế mô hình kia, và kiến trúc hợp lý chứa cả hai — điều này đặt ra câu hỏi thực tế về cách bạn gọi chúng.

Claude Opus 5 được cung cấp qua OrcaRouter dưới dạng anthropic/claude-opus-5 với mức giá theo danh sách nhà cung cấp của Anthropic, không phụ phí, nằm trong một API duy nhất bao phủ hơn 200 mô hình. Điều đó ít quan trọng đối với một lệnh gọi đơn lẻ hơn là đối với toàn bộ đường ống xung quanh: khi phần văn bản của một bản dựng lâm sàng chỉ là một mô hình trong số nhiều ứng viên, việc tất cả chúng nằm sau một khóa duy nhất nghĩa là bạn có thể so sánh chúng trên chính kho ngữ liệu của mình mà không cần hợp đồng thứ hai hay thay đổi mã nguồn, và DSL định tuyến cho phép bạn gửi từng yêu cầu riêng lẻ đến mô hình phù hợp để xử lý chúng, trong khi chuyển đổi dự phòng tự động sẽ bảo vệ bạn khi nhà cung cấp gặp sự cố.

NV-Reason-CT không có trên nền tảng của chúng tôi, và không có mô hình NVIDIA nào cả. Nó là các trọng số mà bạn tải về và chạy trên phần cứng của riêng bạn, đó chính xác là điều mà giấy phép cho phép bạn làm và, xét rằng đầu vào là dữ liệu thể tích có nguồn gốc từ bệnh nhân, có lẽ đó cũng là điều bạn muốn dù sao đi nữa. Chúng tôi sẽ không ngụ ý rằng chúng tôi định tuyến một mô hình mà chúng tôi không lưu trữ. Phần văn bản của bản dựng là nơi chúng tôi hữu ích; phần thể tích là nơi bạn tự xoay xở với một mô hình 4.69B và một GPU.

A screenshot of the OrcaRouter model page for Claude Opus 5, showing the identifier anthropic/claude-opus-5, the description of it as Anthropic's most capable model for complex reasoning and long-horizon agentic work, a side panel listing a 1,000,000-token context window and 128,000 maximum output tokens with text, image and file input and text output, and a stat strip reading $5.00 per million input tokens, $25.00 per million output tokens, and a p50 time to first token under four seconds.

Phán quyết trụ vững trước sự soi xét

Nếu bạn cần đọc một thể tích CT thành các phát hiện có cấu trúc, có một mô hình cho việc đó, nó xuất phát từ nhóm nghiên cứu của NVIDIA, và đó là bản tải về chứ không phải một lệnh gọi API. Nếu bạn cần chuẩn hoá một kho báo cáo, viết một bộ khung đánh giá, viết script cho một tác vụ chuyển đổi DICOM, hoặc tóm tắt một đoàn hệ, thì cũng có một mô hình cho việc đó, và nó có bảng giá.

Điều cần giữ vững là chưa bên nào được chứng minh là tốt hơn bên kia ở bất cứ điểm nào, vì thí nghiệm đó vẫn chưa được thực hiện. Điều đã được chứng minh là một giao diện ba chiều native đánh bại một giao diện dựa trên lát cắt trên một benchmark CT lồng ngực công khai với khoảng cách mà các tác giả ước tính vào khoảng ba điểm F1, và rằng một mô hình tiên phong tổng quát được đo lường độc lập ở vị trí dẫn đầu lĩnh vực về suy luận, lập trình và các tác vụ ngữ cảnh dài. Đó là hai phát biểu về hai công việc khác nhau. Đọc chúng như một bảng xếp hạng chính là lỗi phạm trù, và lỗi đó vẫn tồn tại cho đến tận khi có ai đó công bố cuộc đối đầu trực tiếp mà chưa ai công bố.