Một thẻ hero được tạo có tiêu đề 'NV-Reason-CT vs Gemini 3.1 Pro' với phụ đề 'Bề mặt đầu vào rộng nhất, mà vẫn không phải là trình đọc CT'. Hai thẻ đối diện nhau được ngăn cách bởi một cặp mũi tên xanh dương: thẻ bên trái được dán nhãn 'NV-Reason-CT' với biểu tượng quét cơ thể và 'chỉ ngực và bụng - 13.824 token thị giác mỗi thể tích - OpenMDW-1.1'; thẻ bên phải được dán nhãn 'Gemini 3.1 Pro' với biểu tượng chip và 'âm thanh, video, hình ảnh, tệp, văn bản - ngữ cảnh 1M - bậc xem trước'. Logo OrcaRouter được ghép ở góc dưới bên phải.
Guides & Insights

NV-Reason-CT vs Gemini 3.1 Pro: Bề mặt đầu vào rộng nhất, nhưng vẫn không phải là một trình đọc CT

Tác giả

Magnus Corvin

Ngày đăng

Mô hình mới nhất · 20Xem tất cả mô hình →
Benchmark: Artificial Analysis · cập nhật hằng ngày
Quay lại tất cả bài viết

Chín mươi tư phần trăm. Đó là tỷ lệ lỗi mà danh mục của chính chúng tôi hiện ghi nhận cho một tuyến phục vụ Gemini 3.1 Pro — 93,93%, cùng với thời gian trung vị đến token đầu tiên được ghi nhận như một mức trần mười giây và con số thông lượng 978 token mỗi giây. Nếu đọc đó như một phát biểu về mô hình, bạn sẽ rút ra đúng cái kết luận sai. Còn nếu đọc nó như một phát biểu về một tầng bản xem trước đang chịu tải, nó trở thành thứ hữu ích nhất trên trang, bởi vì đó chính là điều mà một pipeline lâm sàng thực sự trải qua khi phụ thuộc vào một tuyến chưa được cấp phát cho lưu lượng sản xuất.

Mô hình ở phía bên kia của so sánh này không gặp vấn đề như vậy và cũng không có phép đo như vậy. NV-Reason-CT là bộ suy luận CT 3D gốc của NVIDIA với 4,69 tỷ tham số, có thể tải xuống theo OpenMDW-1.1, hoàn toàn không có số liệu thông lượng nào được công bố và không được lưu trữ ở bất kỳ đâu. Vậy nên một bên trong cuộc đối đầu này mang đến cho bạn bề mặt đầu vào rộng nhất trong ngành cùng một hồ sơ khả dụng mà bạn phải thiết kế xoay quanh; bên kia mang đến cho bạn một năng lực hẹp với độ trễ mà bạn phải tự đo lấy. Cả hai đều không có bảng điều khiển giám sát nào mà bạn có thể tin tưởng ngay từ ngày đầu tiên, và vì những lý do trái ngược nhau.

Hai mô hình, hai định nghĩa về “đa phương thức”

Từ này đang gánh vác rất nhiều trọng trách trong cả hai phần mô tả sản phẩm, và gần như không có chút nào trong số đó được dùng chung.

• Đầu vào được chấp nhận — Gemini 3.1 Pro nhận văn bản, hình ảnh, âm thanh, video và tệp; NV-Reason-CT chỉ nhận một khối NIfTI đơn kênh theo đơn vị Hounsfield, và không nhận gì khác

• Ý nghĩa của "3D" — NV-Reason-CT tái lấy mẫu thành 2 mm đẳng hướng trên một khối lập phương 384 milimét và cắt nó thành các miếng 8 x 8 x 8 cho một lưới 24 x 24 x 24; đầu vào video của Gemini 3.1 Pro là một chuỗi các khung hình hai chiều với một dòng thời gian

• Ngữ cảnh — 1.048.576 token đầu vào và 65.536 token đầu ra cho Gemini 3.1 Pro; một tập là 13.824 token thị giác đối với NV-Reason-CT, không hạ mẫu và không có lớp hợp nhất, và không có cửa sổ trò chuyện nào bao quanh nó

Phát hành — 19 tháng 2 năm 2026 dành cho Gemini 3.1 Pro, trên một slug xem trước; một đợt phát hành nghiên cứu chưa được công bố cho NV-Reason-CT, với hoạt động kho lưu trữ được ghi ngày từ 2 đến 25 tháng 9 năm 2026

• Giá — 2 USD và 12 USD mỗi triệu token cho đến 200.000 token, sau đó là 4 USD và 18 USD, với đọc bộ nhớ đệm ở mức 0,20 USD và ghi bộ nhớ đệm ở mức 0,375 USD; so với trọng số tự lưu trữ không có bảng giá

• Khả năng — thị giác, âm thanh, sử dụng công cụ, đầu ra JSON và suy luận cho Gemini 3.1 Pro; phát hiện có cấu trúc theo vùng giải phẫu cho NV-Reason-CT, không sử dụng công cụ

• Giấy phép và trạng thái — một API xem trước được lưu trữ; dựa trên các trọng số OpenMDW-1.1 mà thẻ mô hình ghi rõ chỉ dành cho nghiên cứu và giáo dục, đồng thời nêu rõ rằng đây không phải là thiết bị y tế

Đầu vào video và đầu vào CT thể tích trông có vẻ gần nhau khi nhìn từ xa, nhưng khi nhìn gần thì khác biệt một trời một vực. Video là các khung hình theo thời gian. Một nghiên cứu CT là một thể tích tĩnh duy nhất với ba trục không gian, thang đo vật lý tính bằng milimét và một đơn vị mật độ đã hiệu chuẩn, trong đó thứ được đo là mật độ của một cấu trúc mà kích thước của nó quan trọng. Gemini 3.1 Pro sẽ xem một bản ghi phẫu thuật và mô tả những gì đã diễn ra. Nó sẽ không đo một nốt. Đó không phải là một hạn chế mà Google đã thất bại trong việc giải quyết; đó là một bài toán khác mà chưa ai giải được bằng một mô hình tổng quát.

Những gì hai bản ghi benchmark bao gồm và những gì chúng bỏ sót

Gemini 3.1 Pro có một thành tích độc lập và đó là một thành tích tốt trên các trục mà nó đo lường.

• GPQA Diamond — 94,1, con số cao nhất trong toàn bộ loạt bài viết này

• Humanity's Last Exam — 47, với điểm ghi nhớ ngữ cảnh dài là 82, một lần nữa là cao nhất trong so sánh này

• IFBench và SciCode — 77.14 và 58.7

• τ²-Bench — 95,61, với tau_banking đạt 21,44 và Terminal-Bench Hard đạt 53,79

• Trí tuệ và Lập trình của Artificial Analysis — 29.7 và 68.8

• Độ trễ đo được — trung vị mười giây đến token đầu tiên, có vẻ là mức giới hạn trần chứ không phải trung vị thực sự, ở tốc độ 978 token mỗi giây và tỷ lệ lỗi 93,93%

Hãy để ý hình dạng của điều đó: một hồ sơ kiến thức và ngữ cảnh dài ở đầu so sánh, một chỉ số trí tuệ ở khoảng giữa dưới, và một phép đo tính sẵn sàng không thể dùng được. Cả ba đều mô tả cùng một mô hình trên cùng một tuyến. GPQA Diamond cao nghĩa là nó biết rất nhiều. Điểm tổng hợp 29.7 nghĩa là nó không dẫn đầu về mọi thứ. Tỷ lệ lỗi 93.93% nghĩa là, trên đường dẫn cụ thể này, hầu hết các yêu cầu của bạn sẽ không hoàn thành — và đó gần như chắc chắn là một thực tế về dung lượng và cung cấp đối với một endpoint xem trước chứ không phải là thuộc tính của trọng số. Chúng ta không thể chứng minh điều nào từ bên ngoài. Điều chúng ta có thể nói là không có số nào trong ba số đó là lỗi đánh máy và bất kỳ kiến trúc nào chỉ đọc số đầu tiên sẽ có một tuần tồi tệ.

Thành tích của NV-Reason-CT thì hẹp hơn và đi kèm một lưu ý khác. Chỉ số 0.614 F1 và 0.871 AUROC của nó trên CT-RATE, trên mười tám nhãn với một ngưỡng đồng nhất cố định cùng một prompt yes/no trực tiếp và không có classification head hay sự thích ứng dành riêng cho tác vụ, là những con số của chính NVIDIA từ bài báo của chính NVIDIA. Tập so sánh đằng sau chúng — VoxelFM ở 0.581, Pillar-0 ở 0.544, ClinFusion-8B ở 0.442, CT-CLIP ở 0.398, Merlin ở 0.358, MedGemma 1.5 ở 0.303 — chỉ gồm các mô hình hình ảnh. Không có mô hình đa phương thức tổng quát nào xuất hiện, nghĩa là câu hỏi “Gemini 3.1 Pro sẽ thể hiện thế nào trên CT-RATE” thậm chí chưa được đặt ra, chứ chưa nói đến việc được trả lời.

A generated scoreboard titled 'Breadth on one side, depth on the other' with two columns. The left column, headed 'Gemini 3.1 Pro', lists six rows: inputs, text, image, audio, video, file; context, 1,048,576 in and 65,536 out; GPQA Diamond 94.1; AA Intelligence 29.7; route reliability, 93.93% measured error rate; price, $2 and $12 per million tokens, doubling past 200k. The right column, headed 'NV-Reason-CT', lists six rows: input, one-channel NIfTI in Hounsfield units; context, 13,824 visual tokens per volume, no chat window; CT-RATE F1 0.614 and AUROC 0.871; provenance, the authors paper only; route reliability, not applicable, self-hosted; price, no rate card, no published throughput. A footer reads 'The 93.93% error rate describes a preview route under load, not the quality of the weights.'

Vấn đề ở tầng xem trước, được phát biểu cho đúng

Đây là phần của sự so sánh không liên quan gì đến CT mà hoàn toàn liên quan đến việc vận hành bất cứ thứ gì mang tính lâm sàng.

Tỷ lệ lỗi 93,93% không phải là sự suy giảm nhẹ. Đó là một tuyến mà phần lớn áp đảo các cuộc gọi đều thất bại. Phản ứng tự nhiên là tuyên bố mô hình không dùng được, và phản ứng đó sai vì hai lý do. Thứ nhất, tỷ lệ lỗi đo trên một điểm cuối xem trước phản ánh công suất, hạn mức và định tuyến khu vực, chứ không phản ánh năng lực của mô hình. Các tầng xem trước của Google nổi tiếng là được cấp phát cho việc đánh giá hơn là cho vận hành thực tế, và một slug được đặt tên cho bản xem trước là một slug có thể bị giới hạn tốc độ mà không có thông báo. Thứ hai, phép đo này là ảnh chụp nhanh của một đường dẫn tại một thời điểm. Nó sẽ thay đổi. Điều sẽ không thay đổi là bài học: phụ thuộc vào một tuyến xem trước là phụ thuộc vào một quyết định về công suất do người khác đưa ra.

Các biện pháp giảm thiểu thì không hào nhoáng, và chính vì chúng mà định tuyến tồn tại như một chuyên ngành chứ không chỉ là một tiện ích.

• Không bao giờ hard-code một slug xem trước vào đường dẫn production — hãy đặt khả năng đó sau một interface để có thể hoán đổi model đằng sau nó mà không cần triển khai

• Thử lại và chuyển sang nhà cung cấp khác hoặc mô hình khác — đối với một tác vụ trích xuất theo lô, tỷ lệ thất bại 94% vẫn có thể chấp nhận được nếu các lỗi đó được chuyển hướng đi nơi khác, và sẽ là chí mạng nếu không

• Hãy tự đo tỷ lệ lỗi của riêng bạn thay vì kế thừa con số có sẵn — con số 93,93% là số liệu trong danh mục của chúng tôi cho một lộ trình, còn con số của bạn sẽ phụ thuộc vào khu vực, khối lượng và đặc điểm khối lượng công việc của bạn

• Giữ một mô hình thứ hai luôn sẵn sàng cho bất cứ thứ gì nằm trên dòng thời gian lâm sàng — chế độ thất bại mà bạn đang phòng ngừa không phải là một câu trả lời tồi, mà là không có câu trả lời nào

Nguyên tắc tương tự cũng áp dụng theo hướng ngược lại ở phía CT, nơi hoàn toàn không có tuyến nào cả. Một mô hình tự vận hành không có tỷ lệ lỗi của nhà cung cấp; nó có tỷ lệ lỗi phần cứng, gánh nặng bảo trì, và mức trần năng lực được đặt bởi số lượng GPU bạn đã mua. Chế độ hỏng hóc là hàng đợi, và biện pháp giảm thiểu là lập lịch thay vì chuyển đổi dự phòng. Vấn đề khác, quy tắc vẫn vậy: hãy biết mình thực sự đang phụ thuộc vào con số nào.

Những trường hợp ngữ cảnh dài thực sự hữu ích, và những trường hợp nó không.

Cửa sổ 1.048.576 token của Gemini 3.1 Pro và điểm khả năng ghi nhớ ngữ cảnh dài 82 điểm là những lợi thế thực sự và đáng để sử dụng một cách có chủ đích thay vì vô tình.

Nơi chúng phát huy tác dụng trong một chương trình CT không phải là ca chụp. Mà là mọi thứ xung quanh nó. Một lượt trích xuất duy nhất trên một ghi chú phẫu thuật dài cùng các báo cáo liên quan, giữ toàn bộ tài liệu trong ngữ cảnh để các trường nhất quán với nhau. Một bản tóm tắt thuần tập phải chứa hàng trăm câu chuyện bệnh nhân cùng lúc để tìm ra mẫu hình chung giữa chúng. Một tác vụ chuyển đổi, nơi lược đồ, một trăm bản ghi ví dụ và nhật ký lỗi đều cần hiển thị trong cùng một lệnh gọi. Đó là những công việc mà một cửa sổ dài thay đổi câu trả lời, chứ không chỉ là sự tiện lợi.

Chỗ nó không giúp ích chính là bản quét, và lý do đáng được nói chính xác bởi vì đó chính là sai lầm mà sự so ghép này dễ khơi ra. Một CT ngực được biểu diễn theo cách NV-Reason-CT biểu diễn nó tốn 13.824 token. Gemini 3.1 Pro có thể chứa bảy mươi nghiên cứu như vậy trong cửa sổ của nó mà vẫn còn thừa chỗ. Ràng buộc không nằm ở chỗ. Mà là đường thị giác của Gemini 3.1 Pro coi một hình ảnh như một bức hình với tỉ lệ điểm ảnh, nên một nghiên cứu được trình bày theo cách đó đã mất khoảng cách giữa các lát cắt và việc hiệu chuẩn mật độ trước khi token đầu tiên được phát ra. Bạn có thể tiêu cả triệu token cho một khối thể tích mà vẫn không có được một khối thể tích. So sánh của chính bài báo khiến cái giá của điều đó trở nên cụ thể: MedGemma 1.5 đạt 0,303 F1 khi được nạp tối đa 85 lát cắt trục, so với 0,614 của mô hình thể tích gốc, tức là một khoảng cách gần gấp đôi.

Nơi chúng ta phù hợp, và điều duy nhất chúng ta sẽ không nói

Gemini 3.1 Pro được phục vụ thông qua OrcaRouter dưới dạng google/gemini-3.1-pro-preview theo mức giá niêm yết của nhà cung cấp với mức chênh lệch bằng không, nằm trong một API duy nhất bao phủ hơn 200 mô hình. Với một mô hình hiện đang ở bậc xem trước, sự kết hợp đó hữu ích hơn vẻ ngoài của nó. Không chênh lệch giá nghĩa là thay đổi giá từ nhà cung cấp sẽ đến phía chúng ta ngay trong cùng ngày, thay vì bị một lớp trung gian giữ số cũ hấp thụ. Chuyển đổi dự phòng tự động nghĩa là một tuyến bắt đầu lỗi sẽ không kéo cả lô xuống theo — điều mà, với tỷ lệ lỗi đo được ở mức chín mươi mấy trên một đường dẫn, không phải là giả định. Và một DSL định tuyến để gửi từng yêu cầu riêng lẻ đến mô hình nên xử lý chúng cho phép bạn đặt công việc ngữ cảnh dài lên một mô hình và công việc khối lượng lớn, chi phí thấp lên một mô hình khác mà không cần duy trì hai tích hợp.

NV-Reason-CT không có trên nền tảng của chúng tôi. Không có mô hình NVIDIA nào cả. Nó là các trọng số mà bạn tự tải về và chạy, và cách diễn đạt trung thực là hai nửa của kiến trúc này nằm ở những nơi hoàn toàn khác nhau: một nửa nằm sau một API với bảng giá và rủi ro bản xem trước, nửa kia nằm trên phần cứng của chính bạn với giấy phép OpenMDW-1.1 và một con số thông lượng mà bạn phải tự tạo ra.

A generated scoreboard titled 'What each side gives you, and what it costs' listing five paired rows. Row one: widest input surface, audio, video, image and file against text only, one modality at a time. Row two: longest context, 1,048,576 tokens in against 13,824 tokens per volume. Row three: highest benchmark, GPQA Diamond 94.1 against CT-RATE F1 0.614. Row four: weakest measured figure, a 93.93% route error rate against no published throughput at all. Row five: dependency, a hosted preview tier against your own GPUs. A footer reads 'Both sides carry a number nobody should build on without measuring it themselves.'A screenshot of the OrcaRouter model page for Gemini 3.1 Pro, showing the identifier google/gemini-3.1-pro-preview with tags for Vision, Audio, Video, Tools, JSON and Reasoning, the description of it as a multimodal model accepting text, image, audio, video and file input, and a side panel listing a 1,048,576-token context window with up to 65,536 output tokens. A stat strip reads $2.00 per million input tokens, $12.00 per million output tokens, a median time to first token, and an error rate of 93.93 percent.

Quyết định trụ vững khi tiếp xúc với production

Nếu vấn đề của bạn là hiểu văn bản, âm thanh, video hoặc tài liệu trong ngữ cảnh dài, thì Gemini 3.1 Pro được đo lường độc lập ở vị trí dẫn đầu lĩnh vực về kiến thức và khả năng hồi tưởng, và thứ duy nhất đứng giữa nó và một pipeline production chính là độ tin cậy của route — một vấn đề kỹ thuật có thể giải quyết được, không phải vấn đề của mô hình. Hãy đặt nó phía sau cơ chế failover, đừng hard-code slug bản xem trước, và hãy tự đo tỷ lệ lỗi của chính bạn thay vì tin tưởng tỷ lệ của bất kỳ ai, kể cả của chúng tôi.

Nếu vấn đề của bạn là một thể tích CT ngực hoặc bụng, thì trong so sánh này chỉ có đúng một mô hình mở có thể giải quyết được nó, đó không phải là mô hình có cửa sổ một triệu token, và con số nên chi phối kế hoạch của bạn không phải là điểm F1 của nó. Đó chính là độ trễ trên mỗi ca mà chưa ai công bố. Hãy đo nó trước khi bạn hứa với bất kỳ ai một con số thông lượng.

Việc so sánh này đáng để thực hiện vì nó tách bạch hai thứ vốn liên tục bị gộp lẫn vào nhau: độ rộng của đầu vào và độ sâu của biểu diễn. Gemini 3.1 Pro có bề mặt đầu vào rộng nhất mà bất kỳ ai từng tung ra cùng khả năng truy hồi ngữ cảnh dài tốt nhất trong nhóm này, vậy mà nó vẫn không thể đọc một ca chụp CT như một ca chụp CT. NV-Reason-CT có thể đọc được một ca, và không gì khác. Một pipeline cần cả hai, cần chúng trên những hạ tầng khác nhau, và cần biết con số nào trong hai con số ở mỗi bên là con số sẽ gọi bạn dậy lúc ba giờ sáng.