Một thẻ hero được tạo tự động có tiêu đề 'NV-Reason-CT vs GPT-5.6 Sol' với phụ đề '13.824 visual token trước khi bạn gõ một từ nào'. Ba chip chạy dọc theo cạnh dưới: '4,69B chuyên gia CT so với không tiết lộ', 'NIfTI 3D vào, kết quả ra', và 'Sol: 1.050.000 vào / 128.000 ra'. Logo OrcaRouter được ghép ở góc dưới bên phải.
Guides & Insights

NV-Reason-CT so với GPT-5.6 Sol: 13.824 token hình ảnh trước khi bạn gõ một từ nào

Tác giả

Gideon Frost

Ngày đăng

Mô hình mới nhất · 20Xem tất cả mô hình →
Benchmark: Artificial Analysis · cập nhật hằng ngày
Quay lại tất cả bài viết

Mỗi một hình chụp CT lồng ngực bạn gửi tới NV-Reason-CT đều tốn 13.824 token thị giác trước khi prompt bắt đầu. Đó không phải là một điểm dị thường hay một lựa chọn tinh chỉnh — mà chính là toàn bộ thiết kế. Bộ mã hóa thị giác 3D gốc của mô hình nhận một thể tích 384×384×384 mm và biến nó thành một lưới 24×24×24, và thẻ mô hình nói rõ rằng toàn bộ 13.824 token cùng tọa độ ba chiều của chúng đều đi tới mô hình ngôn ngữ "mà không hề qua giảm mẫu không gian." Hãy so sánh điều đó với thứ mà bạn có lẽ đang phải trả tiền cho. GPT-5.6 Sol chấp nhận văn bản, hình ảnh và tệp, và một hình ảnh gửi tới nó là một bức ảnh 2D — một lát cắt, một ảnh chụp màn hình trình xem DICOM, một hình ảnh X-quang được dán ra từ một tệp PDF. Một trong hai mô hình này có một lối đi thể tích. Mô hình còn lại có một cửa sổ ngữ cảnh. Hầu hết các so sánh giữa chúng đều sụp đổ ngay tại sự khác biệt đó, và chính chỗ sụp đổ ấy mới là phần thú vị.

Bản phát hành mà không ai công bố

NVIDIA chưa công bố một lời nào về NV-Reason-CT trên newsroom của mình. Không có bài đăng ra mắt, không có slide keynote, không có thông cáo báo chí. Những gì tồn tại là một repository Hugging Face được tạo vào ngày 8 tháng 9 năm 2026, một repository GitHub thuộc tổ chức NVIDIA-Medtech được tạo ngày 2 tháng 9, một Space demo Gradio, và một bản preprint arXiv — NV-Reason-CT: Mô hình ngôn ngữ thị giác 3D cho phân tích CT — được gửi vào ngày 23 tháng 9 năm 2026 bởi một nhóm mười sáu tác giả từ NVIDIA cùng với các đồng tác giả tại NIH và Đại học Zurich.

Đó là một quy luật có thật, và đáng được gọi tên chính xác thay vì coi đó là một điều bí ẩn. Nhóm hình ảnh y tế của NVIDIA âm thầm phát hành trọng số và để bài báo cùng kho lưu trữ thực hiện việc công bố. Phiên bản tiền nhiệm, NV-Reason-CXR-3B, được phát hành vào tháng 10 năm 2025 theo cùng cách đó. Điểm khác biệt ở đây nằm ở quy mô: đây là lần đầu tiên nhóm đó mở rộng công thức từ X-quang 2D sang các thể tích 3D gốc, và bài báo mới chỉ hai ngày tuổi.

Những gì có thể biết được từ kho lưu trữ: kiến trúc, giấy phép, dữ liệu huấn luyện, bảng benchmark. Những gì chưa được xác nhận: liệu NVIDIA có ý định coi đây là một dòng sản phẩm được hỗ trợ hay không, liệu có thêm các checkpoint nào nữa không, và nó đứng vững ra sao dưới sự đánh giá của bất kỳ ai không phải các tác giả. Kho lưu trữ đang ở phiên bản 0.1 và tự mô tả là chỉ dành cho nghiên cứu và giáo dục.

Mỗi mô hình thực sự chấp nhận những gì

Đây là lúc một cuộc so kè trực tiếp nhanh chóng trở nên minh bạch. Hai mô hình không dùng chung một bề mặt đầu vào.

NV-Reason-CT đọc các volume NIfTI — .nii hoặc .nii.gz — với cường độ voxel tính bằng đơn vị Hounsfield. Nó tự động cắt (crop) vùng ngực hoặc vùng bụng bằng cách dùng đơn vị Hounsfield của phổi và một phương pháp suy luận hình thái học 3D, lấy mẫu lại về độ phân giải đẳng hướng 2 mm, và chỉ chấp nhận "chest" hoặc "abdomen" làm giá trị giải phẫu. Nó xuất ra văn bản: một báo cáo có cấu trúc, một câu trả lời, hoặc một chuỗi lập luận từng bước, kèm một công tắc để tắt phần lập luận cho các câu trả lời ngắn.

GPT-5.6 Sol đọc văn bản, hình ảnh và tệp, với cửa sổ ngữ cảnh 1.050.000 token và tối đa 128.000 token đầu ra trong một phản hồi duy nhất. Nó không có bộ mã hóa thể tích. Đưa cho nó một CT và trước tiên bạn phải quyết định cách làm phẳng khoảng ba trăm lát cắt thành thứ mà bộ mã hóa ảnh 2D có thể chấp nhận — một ảnh ghép, một vài lát cắt chính, một phép chiếu cường độ tối đa được kết xuất. Mỗi lựa chọn trong số đó đều vứt bỏ các mối quan hệ không gian mà đường dẫn 3D được xây dựng để bảo toàn.

Vậy nên cách diễn đạt trung thực không phải là “mô hình nào thông minh hơn”. Mà là đường dẫn hình ảnh của Sol và đường dẫn 3D của NV-Reason-CT đang trả lời những câu hỏi khác nhau. Sol có thể suy luận về mô tả của một bác sĩ X quang về một bản chụp. NV-Reason-CT có thể suy luận về chính bản chụp đó.

Có một benchmark tồn tại, và chỉ một trong số chúng có một con số trên đó

NV-Reason-CT báo cáo Macro-F1 0.614 và Macro-AUROC 0.871 trên tác vụ phân loại 18 nhãn của CT-RATE, sử dụng prompt Yes/No trực tiếp không có đầu phân loại và không có thích ứng theo tác vụ cụ thể. Đó là những con số của chính các tác giả từ model card, và hàng so sánh là phần hữu ích: VoxelFM ở 0.581 Macro-F1, Pillar-0 ở 0.544, ClinFusion-8B ở 0.442, CT-CLIP ở 0.398, Merlin ở 0.358, MedGemma 1.5 ở 0.303. Trên cùng một ngưỡng đồng nhất cố định, một mô hình 3D sinh tạo đánh bại các baseline tiền huấn luyện tương phản 3D và mô hình tiên tiến dựa trên lát cắt.

Một con số trong bảng đó đáng bị hoài nghi hơn là được lặp lại: khoảng cách AUROC. NV-Reason-CT báo cáo 0.871 so với 0.870 của VoxelFM. Một phần nghìn điểm, trong một đánh giá do nhà cung cấp tự thực hiện, không phải là một thắng lợi — đó là một thế hòa nằm trong bất kể mức nhiễu nào mà đánh giá mang theo. Khoảng cách Macro-F1 0.033 mới là tuyên bố có bằng chứng xác thực.

GPT-5.6 Sol không có số CT-RATE vì CT-RATE không phải là một benchmark mà nó có thể được chạy trên đó. Nó có Chỉ số Trí tuệ Artificial Analysis là 47, điểm GPQA Diamond do AA đo được là 94,1, và điểm Humanity's Last Exam là 49,5 — tất cả đều là những công cụ đánh giá lý luận tổng quát. Đặt 0,614 Macro-F1 bên cạnh 47 trên Chỉ số AA sẽ là làm phép toán trên hai chiếc thước khác nhau. Tôi sẽ không làm điều đó, và bạn nên hoài nghi bất kỳ ai làm vậy.

Dấu vết suy luận, hai sản phẩm khác nhau

Cả hai mô hình đều đưa ra suy luận. Đó là điểm giao thoa triết học thực sự duy nhất, và sự khác biệt này rất đáng suy ngẫm.

GPT-5.6 Sol cung cấp mức nỗ lực suy luận có thể cấu hình, nên bạn đánh đổi độ trễ và chi phí lấy độ sâu cho mỗi yêu cầu, và bạn có thể yêu cầu trả lại phần suy luận thông qua include_reasoning. Đây là một năng lực tổng quát được áp dụng cho bất cứ thứ gì bạn gửi tới nó.

Suy luận của NV-Reason-CT hẹp một cách có chủ đích. Kho ngữ liệu huấn luyện gồm khoảng 550.000 ví dụ QA có cấu trúc được rút ra từ 70.111 thể tích CT riêng biệt, và một phần của nó là suy luận do bác sĩ chẩn đoán hình ảnh biên soạn, được thu thập từ các diễn giải chuyên gia đã được ghi âm và chuyển thành văn bản. Giai đoạn GRPO tiếp sau SFT sử dụng các phần thưởng có thể kiểm chứng trên các tập bất thường ở ngực và bụng — nghĩa là tín hiệu phần thưởng được neo vào việc một phát hiện được nêu có thật sự hiện diện trong thể tích hay không, chứ không phải vào việc văn xuôi có đọc trôi chảy hay không. Thẻ mô hình mô tả đầu ra là "các quan sát có thể xem xét lại, các chẩn đoán phân biệt và độ bất định", và nó mang một cảnh báo rõ ràng rằng suy luận được tạo ra "không được đảm bảo đại diện cho tính toán nội bộ của mô hình". Cảnh báo đó đang thực sự có tác dụng. Nó là sự khác biệt giữa một dấu vết mà bạn có thể đối chiếu với dữ liệu và một dấu vết mà bạn chỉ có thể chiêm ngưỡng.

Kích thước và giấy phép, chỉ trong một lần.

• Tham số — NV-Reason-CT 4,69B tổng / 4,35B hoạt động trong đường dẫn CT, từ backbone Qwen3.5-4B cộng với Primus 3D ViT so với GPT-5.6 Sol không được tiết lộ • Kích thước checkpoint — NV-Reason-CT ~10,6 GB BF16 safetensors, chạy trên Ampere/Hopper/Lovelace so với GPT-5.6 Sol chỉ API • Đầu vào — thể tích CT NIfTI 3D theo đơn vị Hounsfield so với văn bản, hình ảnh, tệp • Ngữ cảnh — NV-Reason-CT không áp dụng, một thể tích là một tiền tố 13.824 token cố định so với Sol 1.050.000 token vào, 128.000 ra • Giấy phép — OpenMDW-1.1, trọng số có thể tải xuống so với độc quyền, chỉ truy cập API • Tính khả dụng — kho lưu trữ của nhà cung cấp và trọng số riêng của nó so với định tuyến trên OrcaRouter với giá $4.00 / $20.00 mỗi triệu, với mức giá của Sol trên 272K token đầu vào tăng gấp đôi lên $8.00 / $30.00

A generated scoreboard titled 'NV-Reason-CT vs GPT-5.6 Sol - the scoreboard'. Left column 'NV-Reason-CT': Input 3D NIfTI CT, chest or abdomen; Volume prefix 13,824 tokens, fixed; Parameters 4.69B total / 4.35B active; CT-RATE Macro-F1 0.614 (vendor-reported); Licence OpenMDW-1.1, weights published; Price GPU capex, no per-token rate. Right column 'GPT-5.6 Sol': Input text, image, file; Context / output 1,050,000 in / 128,000 out; Parameters undisclosed; CT-RATE Macro-F1 not applicable; Licence proprietary, API only; Price $4.00 / $20.00 per M. A footer reads 'NV-Reason-CT figures are the authors' own and unreproduced; GPT-5.6 Sol pricing per OpenAI's rate card as routed by OrcaRouter.'

Sự chia tách thực sự khiến bạn phải trả giá những gì

So sánh chi phí chỉ có ý nghĩa khi bạn chấp nhận rằng các khối lượng công việc là khác nhau, vì vậy đây là phiên bản thực sự có ý nghĩa.

Sol được tính phí theo token và giá của nó có một bậc nhảy vọt: $4.00 cho mỗi triệu token đầu vào và $20.00 cho mỗi triệu token đầu ra tính đến 272K token prompt, sau đó là $8.00 và $30.00. Trên OrcaRouter, nó được cung cấp đúng theo giá niêm yết của chính OpenAI với mức chênh lệch bằng không, điều này quan trọng hơn vẻ ngoài của nó — mức giá bạn thấy chính là mức giá OpenAI công bố, vì vậy mọi thay đổi giá đều đến hóa đơn của bạn ngay trong cùng ngày thay vì vào kỳ gia hạn hợp đồng tiếp theo. Mức giá đọc bộ nhớ đệm của nó là $0.40 mỗi triệu token, bằng một phần mười giá đầu vào, và đó chính là điều khiến các vòng lặp agentic dài với tiền tố cố định lớn trở nên khả thi về mặt tính toán.

NV-Reason-CT hoàn toàn không có giá trên mỗi token. Bạn tải xuống 10.6 GB và trả tiền cho GPU. Đó là một câu hỏi giữa capex và opex, và nó chỉ có một câu trả lời: ở khối lượng đủ lớn, tự vận hành một mô hình 4.35B tham số hoạt động sẽ thắng về chi phí. Dưới khối lượng đó thì không, và điểm giao nhau phụ thuộc hoàn toàn vào mức sử dụng GPU của bạn. Chưa có ai ngoài NVIDIA công bố con số thông lượng cho checkpoint này, vì vậy bất kỳ ai đưa cho bạn một điểm giao nhau đều chỉ đang đoán.

A screenshot of NVIDIA's Hugging Face model page for NV-Reason-CT, showing the model card header with Like 1 and 0 followers, the Image-Text-to-Text and Transformers and Safetensors tags, the qwen3_5, medical-imaging, ct, 3d-vlm and custom_code tags, 'Downloads last month 210', the 5B-parameter BF16 size row, the model description describing the 384x384x384-mm volume becoming a 24x24x24 grid of 13,824 visual tokens with no spatial downsampling, the training paragraph citing roughly 550,000 structured QA examples from 70,111 unique CT volumes, a side panel showing Base model Qwen/Qwen3.5-4B and the CT-RATE and CancerVerse datasets, and the arXiv 2609.27511 paper link.

Điều mà một router giúp ích ở đây là phần của quy trình không phải là bước quét. Một pipeline nghiên cứu lâm sàng trong sản xuất hiếm khi chỉ là một mô hình — nó gồm trích xuất, một bước suy luận, một bước tóm tắt, đôi khi là một ý kiến thứ hai. OrcaRouter cung cấp hơn 200 mô hình sau một endpoint tương thích OpenAI với tự động chuyển đổi dự phòng giữa các nhà cung cấp, vì vậy một nửa đa dụng của pipeline đó có thể được hoán đổi hoặc định tuyến lại mà không cần hợp đồng thứ hai. NV-Reason-CT không phải là một trong những mô hình chúng tôi định tuyến; nó là một checkpoint bạn tự chạy. Hai nửa của pipeline vẫn có thể nằm sau một khóa.

A screenshot of the OrcaRouter model page for GPT-5.6 Sol, showing the identifier openai/gpt-5.6-sol, input text + image + file, output text, the Vision, Tools, JSON and Reasoning badges, a 1,050,000-token context window with 128K maximum output, the description of it as the flagship of OpenAI's GPT-5.6 series, OpenAI-compatible code samples pointing at https://api.orcarouter.ai/v1, and a pricing strip reading $4.00 per million input tokens and $20.00 per million output tokens with a p50 time to first token of 10.00 s.

Câu hỏi mở

NV-Reason-CT mới ra đời được hai ngày với tư cách là một bài báo và mười bảy ngày với tư cách là một kho mã, và lĩnh vực mà nó thuộc về đủ nhỏ để điểm dữ liệu tiếp theo sẽ mang tính thông tin. Hãy để ý ba điều: một bản tái lập CT-RATE độc lập, một checkpoint thứ hai trong cùng dòng, và bất kỳ dấu hiệu nào cho thấy nhóm y tế của NVIDIA đang coi đây là một dòng sản phẩm thay vì một bài báo. Cho đến lúc đó, lập trường có thể bảo vệ được là hẹp và rõ ràng — đây là checkpoint suy luận CT 3D gốc mạnh nhất hiện có thể tải xuống, xét theo chính bảng của các tác giả, và nó không phải là vật thay thế cho một mô hình tiên phong tổng quát ở bất cứ việc gì ngoại trừ đọc CT.