Một thẻ hero được tạo tự động có tiêu đề 'NV-Reason-CT vs Grok 4.6' cùng phụ đề 'Ai đọc bản chụp, và ai đọc báo cáo'. Ba chip chạy dọc theo phía dưới: 'Một khối CT so với 500.000 token', '0.871 so với 0.870 là hòa', và 'Grok 4.6: $2.00 / $6.00 mỗi M'. Logo OrcaRouter được ghép ở góc dưới bên phải.
Guides & Insights

NV-Reason-CT vs Grok 4.6: Ai đọc phim chụp, và ai đọc báo cáo?

Tác giả

Gideon Frost

Ngày đăng

Mô hình mới nhất · 20Xem tất cả mô hình →
Benchmark: Artificial Analysis · cập nhật hằng ngày
Quay lại tất cả bài viết

Có hai cách để đưa một AI vào một quy trình CT và chỉ một trong số đó liên quan đến hình ảnh. NV-Reason-CT là cách thứ nhất: một mô hình ngôn ngữ-thị giác 3D 4,69 tỷ tham số đọc trực tiếp các khối NIfTI và đã được công bố lên Hugging Face vào ngày 8 tháng 9 năm 2026 mà không có bài đăng ra mắt nào từ NVIDIA. Grok 4.6 là cách thứ hai: một mô hình văn bản và hình ảnh 500.000 token ra mắt vào ngày 12 tháng 8 năm 2026, có giá 2,00 USD cho mỗi triệu token đầu vào, và rất giỏi ở phần công việc diễn ra sau khi ai đó đã ghi lại phát hiện. Đặt chúng vào một phép so sánh và câu hỏi thường gặp — cái nào tốt hơn — hóa ra lại là câu hỏi sai. Chúng không cạnh tranh cho cùng một vị trí trong quy trình. Chúng đang cạnh tranh cho cùng một dòng ngân sách.

Những gì thực sự đã được phát hành ở mỗi bên

NV-Reason-CT xuất hiện dưới dạng một kho lưu trữ, một bài báo và một Space demo, chứ không phải là một sản phẩm. Kho lưu trữ GitHub thuộc NVIDIA-Medtech được tạo ngày 2 tháng 9 năm 2026; các trọng số trên Hugging Face xuất hiện sau đó vào ngày 8 tháng 9; bản preprint trên arXiv, NV-Reason-CT: Mô hình ngôn ngữ thị giác 3D cho phân tích CT, được công bố vào ngày 23 tháng 9 với mười sáu tác giả đến từ NVIDIA, NIH và Đại học Zurich. Phòng tin tức của NVIDIA không đăng tải thông tin nào về nó. Thẻ mô hình mô tả phiên bản 0.1 và giới hạn việc sử dụng cho nghiên cứu và giáo dục.

Grok 4.6 là kiểu phát hành trái ngược. Nó là một endpoint thương mại hạng nhất, được liệt kê là "Latest" trong tài liệu dành cho nhà phát triển của nhà cung cấp, được định giá trên bảng giá đã công bố và có sẵn dưới dạng mô hình tương thích OpenAI mà các tích hợp hiện có có thể áp dụng bằng cách thay đổi URL cơ sở. Nó kế nhiệm Grok 4.5 với cùng cửa sổ ngữ cảnh, cùng bề mặt đầu vào và cùng mức giá cơ bản.

Sự bất đối xứng đó chính là toàn bộ câu chuyện của phép so sánh này. Một bên là một sản phẩm nghiên cứu mà tình cờ lại có thể tải xuống được. Bên kia là hạ tầng. Đọc chúng đối chiếu với nhau sẽ cho bạn biết ranh giới giữa "sản phẩm nghiên cứu" và "hạ tầng" hiện đang nằm ở đâu trong lĩnh vực hình ảnh y tế — và nó không nằm ở chỗ mà bạn đoán đâu.

Sự phân công lao động, trong đầu vào và đầu ra

• Đầu vào thể tích — NV-Reason-CT đọc các thể tích NIfTI .nii/.nii.gz theo đơn vị Hounsfield, chỉ ngực hoặc bụng, so với Grok 4.6 đọc văn bản, hình ảnh và tệp, không có luồng thể tích • Xử lý không gian — NV-Reason-CT chuyển một thể tích 384×384×384 mm thành lưới 24×24×24 gồm 13.824 token với 3D MRoPE, không hạ mẫu, so với Grok 4.6 coi một hình ảnh như ảnh 2D • Ngữ cảnh — NV-Reason-CT một thể tích là một tiền tố cố định, không có cửa sổ ngữ cảnh theo nghĩa thông thường, so với Grok 4.6 500.000 token • Đầu ra — NV-Reason-CT báo cáo có cấu trúc, câu trả lời hoặc dấu vết suy luận với khả năng tắt thinking, so với Grok 4.6 văn bản với đầu ra có cấu trúc và gọi công cụ • Giấy phép — NV-Reason-CT OpenMDW-1.1, trọng số BF16 10,6 GB so với Grok 4.6 độc quyền, chỉ API • Giá — NV-Reason-CT chi phí đầu tư GPU, không có mức giá theo token, so với Grok 4.6 $2.00 / $6.00 mỗi triệu, tăng gấp đôi khi đầu vào trên 200K

A generated scoreboard titled 'NV-Reason-CT vs Grok 4.6 - the scoreboard'. Left column 'NV-Reason-CT': Volumetric input NIfTI, Hounsfield, chest or abdomen; Spatial handling 24x24x24 grid, no downsampling; Context one volume, a fixed prefix; Output report, answer or reasoning trace; Licence OpenMDW-1.1, 10.6 GB BF16; Price GPU capex, no per-token rate. Right column 'Grok 4.6': Volumetric input none - 2D images, text, files; Spatial handling an image is a picture; Context 500,000 tokens; Output text, structured outputs, tools; Licence proprietary, API only; Price $2.00 / $6.00, doubled above 200K. A footer reads 'NV-Reason-CT figures from NVIDIA's model card and paper; Grok 4.6 pricing per the vendor rate card.'

Cặp đôi này trông như một sự bàn giao tự nhiên. NV-Reason-CT tạo ra phát hiện từ khối dữ liệu; Grok 4.6 là mô hình mà bạn sẽ giao cho một nghìn phát hiện như thế, trong một cửa sổ ngữ cảnh, để tìm kiếm các quy luật xuyên suốt một nhóm thuần tập. Chưa ai công bố pipeline đó. Đó là kiến trúc hiển nhiên, và cần nói thẳng rằng nó chưa được kiểm chứng.

Các con số của Grok 4.6, và chúng thuộc về ai

Hai con số dành cho Grok 4.6 được lưu truyền cùng nhau và chúng không cùng loại. Điểm GPQA Diamond là 94,9 được Artificial Analysis đo, không phải do nhà cung cấp báo cáo — đây là loại đáng tin cậy hơn trong hai loại chính xác vì một bên thứ ba đã thực hiện nó. Điểm Artificial Analysis Intelligence Index là 44, trên bản sửa đổi chỉ số v4.3.2, đặt Grok 4.6 ở vị trí thứ 28 trong số 211 trong lớp của nó. Artificial Analysis cũng ghi nhận mô hình này là độc quyền: các trọng số không được công bố công khai.

Trên cùng bảng đánh giá, AA đo Terminal-Bench 2.1 ở mức 88.4, SciCode ở mức 56.5, Humanity's Last Exam ở mức 42.9, 𝜏²-banking ở mức 50.7, và khả năng nhớ ngữ cảnh dài ở mức 80.3. Đó là những công cụ đo lường suy luận tổng quát. Không một công cụ nào trong số đó có thể chạy trên một khối CT 3D, và đó không phải là lời chê Grok 4.6 — mà là một nhận định về những gì bộ benchmark này đo lường.

Phía CT chỉ có đúng một bảng, và đó là bảng của các tác giả.

Toàn bộ cơ sở bằng chứng công khai của NV-Reason-CT chỉ là một bảng phân loại trên 18 nhãn của CT-RATE, ở một ngưỡng đồng nhất cố định, sử dụng lời nhắc Yes/No trực tiếp mà không có đầu phân loại. Nó báo cáo Macro-F1 0.614 và Macro-AUROC 0.871, so với VoxelFM ở 0.581/0.870, Pillar-0 ở 0.544/0.861, ClinFusion-8B ở 0.442, CT-CLIP ở 0.398/0.733, Merlin ở 0.358/0.662, và MedGemma 1.5 ở 0.303.

Đây là những số liệu do nhà cung cấp báo cáo, từ model card, và tôi đang ghi nhãn chúng như vậy vì chưa có bên độc lập nào tái tạo được chúng. Có hai điều đáng chú ý trong bảng. Mức chênh lệch F1 so với VoxelFM là 0,033, một khoảng cách thực sự trên 18 nhãn với ngưỡng cố định. Mức chênh lệch AUROC so với cùng mô hình đó là 0,001, tức là hòa nhau. Cả hai con số đều xuất hiện trong cùng một hàng của cùng một bảng, và chỉ một trong số đó mang theo một tuyên bố.

Điều còn lại mà bảng cho bạn biết là về cách chính bài báo tự định khung. Các mô hình so sánh là những hệ thống tiền huấn luyện tương phản 3D, một MLLM sinh tích hợp 2D/3D, và một mô hình tiên tiến dựa trên lát cắt. Các tác giả đã chọn đối chuẩn với những hệ thống nạp thể tích, bởi vì tuyên bố có ý nghĩa duy nhất ở đây là một mô hình 3D sinh có thể đánh bại các mô hình 3D phân biệt trong phân loại mà không cần đầu phân loại. Nó không nói gì về việc NV-Reason-CT so với một mô hình tiên tiến tổng quát ở bất cứ điều gì, vì sự so sánh đó không tồn tại trên trục này.

A screenshot of NVIDIA's Hugging Face model page for NV-Reason-CT, showing the model card header with Like 1 and 0 followers, the Image-Text-to-Text and Transformers and Safetensors tags, the qwen3_5, medical-imaging, ct, 3d-vlm and custom_code tags, 'Downloads last month 210', the 5B-parameter BF16 size row, the model description describing the 384x384x384-mm volume becoming a 24x24x24 grid of 13,824 visual tokens with no spatial downsampling, the training paragraph citing roughly 550,000 structured QA examples from 70,111 unique CT volumes, a side panel showing Base model Qwen/Qwen3.5-4B and the CT-RATE and CancerVerse datasets, and the arXiv 2609.27511 paper link.

Tiền chảy về đâu, và vì sao ranh giới hạng lại quan trọng

Bảng giá của Grok 4.6 có một chi tiết âm thầm quyết định rất nhiều thứ về kiến trúc: các prompt vượt 200K token đầu vào bị tính gấp đôi mức giá cơ bản — $4.00 cho đầu vào, $12.00 cho đầu ra, với mức giá đọc bộ nhớ đệm tăng từ $0.50 lên $1.00. Một tác vụ đánh giá theo nhóm tích lũy các phát hiện trong một ngữ cảnh dài đúng chính là dạng khối lượng công việc vượt qua ranh giới đó. Dưới ngưỡng ấy, mức giá đọc bộ nhớ đệm $0.50 mỗi triệu chỉ bằng một phần tư giá đầu vào, và chính điều đó khiến việc lặp một tiền tố cố định lớn qua hàng nghìn báo cáo trở nên hợp lý về chi phí chứ không chỉ đơn thuần là khả thi.

Thông qua OrcaRouter, Grok 4.6 được cung cấp đúng theo giá niêm yết của nhà cung cấp đó với mức chênh lệch bằng không, vì vậy phép tính theo bậc ở trên chính là phép tính bạn thực sự phải trả, và mọi điều chỉnh trong tương lai đối với nó sẽ đến hóa đơn của bạn ngay trong cùng ngày thay vì vào kỳ gia hạn tiếp theo. Lý do để định tuyến một tác vụ như thế này thay vì mã hóa cứng một endpoint duy nhất là nửa phần đánh giá theo nhóm thuần tập của một pipeline lâm sàng chính là nơi bạn sẽ muốn thử ba mô hình khác nhau trước khi chốt — và trên một khóa tương thích OpenAI với khả năng tự động chuyển đổi dự phòng giữa các nhà cung cấp, thử nghiệm đó chỉ tốn một thay đổi về tên mô hình.

Nửa CT của pipeline không có tùy chọn như vậy. NV-Reason-CT không được lưu trữ trên OrcaRouter — nó là một checkpoint 10,6 GB với mã mô hình tùy chỉnh mà bạn tự chạy, trên silicon Ampere, Hopper hoặc Lovelace, với trust_remote_code=True. Chúng tôi sẽ không ngụ ý điều gì khác. Nếu bạn đang xây dựng pipeline này, bạn đang mua GPU cho một nửa và token cho nửa còn lại, và việc cả hai nửa ít nhất có thể được quản lý từ một bảng điều khiển là tuyên bố tích hợp duy nhất đáng để đưa ra.

A screenshot of the OrcaRouter model page for Grok 4.6, showing the identifier grok/grok-4.6, input text + image + file, output text, the Vision, Tools, JSON and Reasoning badges, a 500,000-token context window, the description of it as SpaceXAI's smartest model to date and the current flagship listed as Latest in the vendor's own developer docs, OpenAI-compatible code samples pointing at https://api.orcarouter.ai/v1, and a pricing strip reading $2.00 per million input tokens and $6.00 per million output tokens.

Giá trị thực sự của một người đọc thứ hai

Bài báo NV-Reason-CT bao gồm một nghiên cứu sơ bộ với bác sĩ chuyên khoa X-quang chuyên gia, báo cáo "mức đánh giá độ tin cậy thuận lợi đối với việc đọc có AI hỗ trợ" và mức giảm 50% thời gian diễn giải và báo cáo trung bình được báo cáo. Đó là những con số mạnh mẽ và chúng đi kèm với một lưu ý mà chính bài báo nêu rõ: sơ bộ, và thiết kế nghiên cứu của chính các tác giả. Không có nghiên cứu tái lập độc lập nào được công bố, và mức giảm 50% thời gian trong một nghiên cứu đọc có kiểm soát đúng là kiểu kết quả sẽ co lại khi được tái lập. Đáng để theo dõi. Không đáng để trích dẫn như một điều đã được thiết lập.

Đối chiếu với điều đó, đóng góp của Grok 4.6 cho quy trình làm việc X quang hoàn toàn không phải là chẩn đoán. Nó là lớp đọc các báo cáo — hàng đợi phân loại, thư theo dõi, mã hóa, hồ sơ xin chấp thuận trước. Công việc đó là văn bản, khối lượng lớn, rẻ trên mỗi đơn vị, và kiểu thất bại khi làm sai mang tính hành chính chứ không phải lâm sàng. Đây cũng là nơi cửa sổ ngữ cảnh 500K và lượt đọc bộ nhớ đệm $0.50 thực sự khẳng định được giá trị của chúng.

Vậy nên sự phân chia mà so sánh này dẫn tới khá thẳng thừng: NV-Reason-CT có một lộ trình 3D thực sự nhưng không có kênh phân phối, không có giá, và không có xác minh độc lập. Grok 4.6 có kênh phân phối, có giá, được các đánh giá chuẩn độc lập bao phủ, nhưng hoàn toàn không có lộ trình thể tích. Nếu bạn cần đọc bản quét, chỉ một trong hai có thể làm được. Nếu bạn cần xử lý giấy tờ xung quanh bản quét, chỉ cái còn lại mới là một sản phẩm.

So sánh trong bài viết này1

Phát hiện từ bài viết này · Benchmark: Artificial Analysis · cập nhật hằng ngày