Một thẻ hero được tạo có tiêu đề 'NV-Reason-CT vs DeepSeek V4 Pro' với phụ đề 'Chi phí để đọc một bản chụp, và khi nào nên chạy theo lô'. Hai thẻ đối diện nhau được phân tách bằng một cặp mũi tên xanh: thẻ bên trái được dán nhãn 'NV-Reason-CT' với biểu tượng quét cơ thể và 'một khối CT - 13.824 token hình ảnh - không có thông lượng được công bố'; thẻ bên phải được dán nhãn 'DeepSeek V4 Pro' với biểu tượng chip và '1,6T tổng / 49B MoE hoạt động - ngữ cảnh 1M - 0,66 đô la / 1,98 đô la mỗi M, tăng gấp đôi trong hai khung giờ UTC'. Logo OrcaRouter được ghép ở góc dưới bên phải.
Guides & Insights

NV-Reason-CT so với DeepSeek V4 Pro: Chi phí đọc một bản quét, và khi nào nên chạy theo lô

Tác giả

Magnus Corvin

Ngày đăng

Mô hình mới nhất · 20Xem tất cả mô hình →
Benchmark: Artificial Analysis · cập nhật hằng ngày
Quay lại tất cả bài viết

Đây là một thực tế vận hành định hình ngân sách pipeline lâm sàng nhiều hơn bất kỳ chuẩn đối sánh nào: DeepSeek V4 Pro có giá 0,66 USD cho mỗi triệu token đầu vào và 1,98 USD cho mỗi triệu token đầu ra, và các mức giá đó tăng gấp đôi trong hai khung giờ mỗi ngày, từ 01:00 đến 04:00 và từ 06:00 đến 10:00 UTC. Công việc theo lô chạy ngoài những khung giờ đó chỉ tốn một nửa so với khi chạy trong khung giờ đó. Trong khi đó NV-Reason-CT, bộ suy luận CT 3D 4,69 tỷ tham số của NVIDIA, hoàn toàn không có bảng giá — đây là một tập trọng số bạn tải về và chạy, không có số liệu thông lượng được công bố cho một nghiên cứu 13.824 token. Một trong những mô hình này bạn lên lịch. Mô hình còn lại bạn phải đo trước khi có thể lập ngân sách cho nó.

Sự bất đối xứng đó là cách hữu ích để đi vào so sánh này, bởi vì hai mô hình nằm ở hai đầu đối lập của pipeline và thất bại theo những cách đối lập về mặt tài chính. NV-Reason-CT là một công cụ chi phí cố định: nghiên cứu cận biên gần như miễn phí một khi phần cứng đã được mua, nhưng quyết định phần cứng thì lớn và độ trễ trên mỗi nghiên cứu không được ghi lại. DeepSeek V4 Pro là một động cơ chi phí biến đổi: không cần mua gì, mọi thứ đều được đo đếm, và đồng hồ đo có một lịch trình bạn có thể đọc từ lịch.

Mỗi thứ là gì, mỗi thứ một dòng

• Công việc — NV-Reason-CT đọc một thể tích CT ngực hoặc bụng và đưa ra các phát hiện có cấu trúc; DeepSeek V4 Pro đọc và viết văn bản

• Kiến trúc — một vision transformer 3D tên là Primus được khởi tạo từ COLIPRI, với xương sống ngôn ngữ Qwen3.5-4B và embedding vị trí quay đa trục 3D, ở 4,69B tham số trong đó 4,35B là hoạt động; so với một hỗn hợp chuyên gia 1,6 nghìn tỷ tham số với 49 tỷ hoạt động mỗi token

• Đầu vào — các khối thể tích NIfTI một kênh (.nii, .nii.gz) theo đơn vị Hounsfield, định hướng LPS, được lấy mẫu lại về 2 mm đẳng hướng và cắt theo giải phẫu; đối chiếu với văn bản

• Bối cảnh — một khối đơn lẻ trở thành 13,824 token thị giác trong lưới 24 x 24 x 24, không có giảm mẫu không gian và không có lớp hợp nhất; so với 1,048,576 token đầu vào và 384,000 token đầu ra

• Các vùng giải phẫu được hỗ trợ — ngực và bụng, và không gì khác; so với mọi thứ mà văn bản có thể mô tả

• Giá — không có giá niêm yết, tự vận hành, không có thông lượng công bố trên mỗi nghiên cứu; so với 0,66 USD / 1,98 USD mỗi triệu token, tăng gấp đôi trong hai khung giờ UTC nêu trên, với chi phí đọc bộ nhớ đệm ở mức 0,022 USD

• Độ trễ đo được — không được công bố; so với thời gian trung vị 3.483 mili-giây để tạo token đầu tiên ở tốc độ 96,01 token đầu ra mỗi giây, với tỷ lệ lỗi 0,75%

Hai hàng ở đó đáng giá hơn một dòng mỗi hàng. Hàng ngữ cảnh là hàng rõ ràng nhất — một triệu token so với 13,824 — nhưng các đơn vị không thể so sánh với nhau và thật sai lầm nếu đọc chúng như một khoảng cách năng lực theo bất kỳ hướng nào. 13,824 token là chi phí để biểu diễn trung thực một nghiên cứu CT. Một triệu token là lượng văn bản xung quanh bạn có thể giữ. Con số đầu tiên là một phát biểu về độ phân giải; con số thứ hai là một phát biểu về bộ nhớ.

Hàng độ trễ là hàng bị bỏ qua. Con số trung vị 3,48 giây để tới token đầu tiên và 96 token mỗi giây của DeepSeek V4 Pro là những số liệu đã được đo đạc và công bố, và chúng cho phép bạn ước lượng quy mô một tác vụ văn bản trên giấy. Việc NV-Reason-CT không có bất kỳ con số tương đương nào không phải là lời chỉ trích mô hình; đó chính là lý do không thể tính được chi phí cho một pipeline CT trước khi có ai đó chạy thử nó. Một mô hình 4,69B xử lý 13.824 token thị giác không phải là một phép tính nhỏ, và cho đến khi bạn tự bấm giờ nó trên phần cứng của mình, bạn chỉ đang đoán mà thôi.

Đọc hai bản ghi benchmark mà không tự lừa dối chính mình

Thành tích của DeepSeek V4 Pro là sự pha trộn giữa đo lường độc lập và báo cáo từ nhà cung cấp, và sự pha trộn này mang tính chỉ dẫn vì nó chứa một con số trông đáng báo động nhưng thực tế thì không.

• Artificial Analysis Intelligence Index — 36, nằm ở phân vị thứ 72,4 của các mô hình được đo lường

• GPQA Diamond — 92,8, mức gần đứng đầu trong lĩnh vực

• Humanity's Last Exam — 41, và 41 trên MMLU-Pro, 62.51 trên chỉ số toán học

• τ²-Bench — 96,20, với IFBench đạt 76,46 và tau_banking đạt 39,59

• Khả năng nhớ lại ngữ cảnh dài — 80.33

• SciCode và Terminal-Bench — 51 và 78,65 ở phiên bản thứ hai của Terminal-Bench

Một chỉ số tổng hợp ở mức 36 nằm cạnh GPQA Diamond ở mức 92,8 nghe như một mâu thuẫn cho đến khi bạn nhận ra chỉ số là gì. Nó là một tổng hợp từ nhiều bài đánh giá, và một mô hình xuất sắc ở một vài bài trong số đó nhưng chỉ ở mức tạm được ở những bài khác sẽ xếp giữa bảng khi tính tổng trong khi đứng đầu ở từng bảng riêng lẻ. Bất kỳ ai chỉ trích dẫn con số 36 để lập luận rằng DeepSeek V4 Pro thuộc tầm trung là đang trích dẫn một giá trị trung bình như thể đó là giá trị tối đa. Bất kỳ ai chỉ trích dẫn con số 92,8 để lập luận rằng nó dẫn đầu lĩnh vực là đang trích dẫn một giá trị tối đa như thể đó là giá trị trung bình. Cả hai con số đều đến từ Artificial Analysis, và cả hai đều đúng.

Hồ sơ của NV-Reason-CT không có sự pha trộn như vậy, và đó chính là vấn đề trung thực của nó. Các con số CT-RATE của nó — F1 0,614 và AUROC 0,871 trên mười tám nhãn, sử dụng một ngưỡng đồng nhất cố định cùng prompt yes/no trực tiếp, không có classification head và không có tinh chỉnh riêng cho tác vụ — chỉ đến từ bài báo của chính NVIDIA và không từ đâu khác. Bộ so sánh trong bài báo đó (VoxelFM ở 0,581, Pillar-0 ở 0,544, ClinFusion-8B ở 0,442, CT-CLIP ở 0,398, Merlin ở 0,358, MedGemma 1.5 ở 0,303) hoàn toàn là các mô hình hình ảnh khác. Không có một mô hình văn bản tổng quát nào xuất hiện trong đó, và chưa có bên thứ ba nào tái lập được bất kỳ con số nào.

A generated scoreboard titled 'Two records, two kinds of provenance' with two columns. The left column, headed 'NV-Reason-CT', lists five rows: CT-RATE F1 0.614 and AUROC 0.871; provenance, the authors paper only; reproduced, no; throughput, not published; price, self-hosted, no rate card. The right column, headed 'DeepSeek V4 Pro', lists five rows: AA Intelligence 36, GPQA Diamond 92.8, tau-squared Bench 96.20; provenance, Artificial Analysis plus vendor; reproduced, yes, independently measured; throughput, 3,483 ms to first token at 96 tokens per second; price, $0.66 and $1.98 per million tokens. A footer reads 'An index of 36 beside a benchmark of 92.8 is an average beside a maximum, not a contradiction.'

Câu hỏi về lập lịch, được giải quyết từng bước

Định giá theo thời điểm trên DeepSeek V4 Pro là yếu tố mang tính hành động cao nhất về mặt vận hành ở cả hai mô hình, nên nó xứng đáng có một phân tích cụ thể từng bước.

Khối lượng công việc văn bản thực tế cho một chương trình CT không hề hào nhoáng. Đó là trích xuất các trường có cấu trúc từ một kho báo cáo lịch sử để bạn có nhãn để huấn luyện, chuyển đổi cây thư mục DICOM sang NIfTI ở quy mô lớn, viết và viết lại bộ khung đánh giá, chuẩn hóa đơn vị và thuật ngữ trên bốn bộ dữ liệu, và tóm tắt các nhóm thuần tập. Cứ cho là một trăm triệu token đầu vào và mười triệu token đầu ra cho một chương trình cỡ trung bình, một con số được làm tròn có chủ đích để thay cho “rất nhiều công việc văn bản”.

• Bên trong một cửa sổ gấp đôi — 1,32 USD và 3,96 USD mỗi triệu, vậy là 132 USD cộng 39,60 USD trên những khối lượng đó

• Ngoài những khung đó — $0.66 và $1.98 mỗi triệu, tức $66 cộng $19.80

• Sự khác biệt — khoảng 86 USD, tương đương 49% hóa đơn ngoài giờ cao điểm, cho việc chuyển một tác vụ vốn có thể xử lý theo lô

• Lượt đọc từ bộ nhớ đệm — $0,022 mỗi triệu, bằng một phần sáu mươi mức giá đầu vào, nên bất kỳ tiền tố prompt nào bạn dùng lại trong toàn bộ kho ngữ liệu đều gần như miễn phí

Đó không phải là một sai số làm tròn, và nó khả dụng vì công việc mang tính bất đồng bộ. Việc trích xuất báo cáo không cần phải diễn ra lúc 14:00. Một tác vụ chuyển đổi DICOM chẳng hề quan tâm hiện tại là mấy giờ. Cấu trúc giá là một lời mời trực tiếp để lên lịch, và một pipeline bỏ qua điều đó đang trả mức phụ trội 49% để có đặc quyền chạy khi nó muốn. Việc đọc bộ nhớ đệm cũng quan trọng vì cùng lý do: một system prompt dùng chung hoặc một schema trích xuất cố định, được tái sử dụng qua hàng nghìn báo cáo, chỉ nằm ở mức một phần sáu mươi của giá đầu vào.

NV-Reason-CT không có đòn bẩy tương đương, vì nó không có đồng hồ đo. Chi phí đọc một bản quét là chi phí GPU của bạn mỗi giờ chia cho số bản quét mỗi giờ mà bạn có thể đẩy qua nó, và con số thứ hai là con số chưa ai công bố. Nếu một ca chụp mất hai giây, một chiếc L40S xử lý thoải mái một chương trình lớn. Nếu mất hai mươi giây, bài toán phần cứng thay đổi hoàn toàn. NVIDIA đã thử nghiệm trên H100 và L40S, điều đó cho bạn biết hạng card, chứ không phải tốc độ.

Cái bẫy của việc cho rằng chúng có thể được thay thế

Sai lầm mà phép so ghép này mời gọi thì tinh vi hơn lỗi phạm trù thường thấy, bởi vì có một phiên bản của nó trông có vẻ hợp lý trên một slide.

DeepSeek V4 Pro có cửa sổ 1.048.576 token và xuất ra tối đa 384.000 token. Một khối CT, theo cách tính của mô hình đọc nó đúng cách, chỉ có 13.824 token. Vậy nên một mô hình văn bản với cửa sổ một triệu token có đủ chỗ cho bảy mươi mấy ca chụp CT ở số token đó. Phép toán là đúng, và kết luận — rằng bạn có thể nạp CT vào một mô hình văn bản và tiết kiệm được hạ tầng chẩn đoán hình ảnh — là sai, vì chính lý do khiến con số 13.824 tồn tại ngay từ đầu.

Con số đó không phải là một bản tóm tắt nén của một lần quét. Nó chính là bản quét, ở độ phân giải đẳng hướng 2 mm trên một khối lập phương 384 milimét, được cắt thành các miếng 8 x 8 x 8, rồi đưa cho mô hình ngôn ngữ mà không hề giảm mẫu không gian và không có lớp hợp nhất. Số lượng token cao chính xác là vì không có gì bị vứt bỏ: khoảng cách giữa các lát cắt khiến một nốt có thể đo được, các giá trị mật độ khiến một kết cấu trở thành một ngưỡng chứ không phải một ngưỡng. Một mô hình văn bản không thể nạp những token đó dưới dạng khối, cũng như một tài liệu không thể. Nó có ngân sách. Nó không có giao diện.

So sánh nội bộ của chính bài báo đưa ra một con số cho sự khác biệt. MedGemma 1.5, khi được cung cấp tối đa 85 lát cắt trục — mức tốt nhất mà một đầu vào hai chiều hoặc xếp chồng theo lát cắt có thể làm một cách hợp lý — đạt 0,303 F1 so với 0,614 của mô hình thể tích gốc. Khoảng cách đó chính là giá trị của bộ mã hóa ba chiều, và không lượng cửa sổ ngữ cảnh nào có thể thu hẹp được nó.

Phép thay thế ngược thất bại vì những lý do rõ ràng hơn. NV-Reason-CT hỗ trợ lồng ngực và bụng, nhận tệp NIfTI thay vì một prompt, không có khả năng sử dụng công cụ, và thẻ mô hình của nó giới hạn nó trong nghiên cứu và giáo dục, đồng thời nêu rõ rằng nó không phải là thiết bị y tế và đầu ra có thể không chính xác. Nó không thể trích xuất các trường từ một báo cáo, và nó không thể viết script để xây dựng kho ngữ liệu của bạn.

A generated scoreboard titled 'Where the money actually goes' listing five rows for a worked example of 100 million input and 10 million output tokens on DeepSeek V4 Pro. Row one: inside the doubled UTC windows, $132 input and $39.60 output. Row two: outside those windows, $66 input and $19.80 output. Row three: difference, about $86, or 49% of the off-peak bill. Row four: cached reads, $0.022 per million, a sixtieth of the input rate. Row five: the CT side, self-hosted with no published per-study throughput, so the cost per scan has to be measured. A footer reads 'Pricing per the provider rate card; the CT column has no rate card to quote.'

Nơi chúng tôi phù hợp, và nơi chúng tôi cố ý không phù hợp

DeepSeek V4 Pro được cung cấp thông qua OrcaRouter dưới dạng deepseek/deepseek-v4-pro, với mức giá niêm yết của nhà cung cấp và không có phụ phí, nằm trong một API duy nhất bao gồm hơn 200 mô hình. Việc chuyển tiếp trực tiếp có ý nghĩa quan trọng hơn mức thông thường đối với một mô hình có giá thay đổi theo thời điểm trong ngày: khi nhà cung cấp thay đổi mức giá hoặc khung thời gian, mức giá ở phía chúng tôi sẽ thay đổi ngay trong ngày hôm đó, bởi vì không có lớp phụ phí nào ở giữa giữ lại con số cũ. Tự động chuyển đổi dự phòng bao gồm trường hợp nhà cung cấp bị suy giảm giữa lô, mà đối với một tác vụ trích xuất dài không cần giám sát, đó chính là kiểu lỗi khiến bạn mất cả một đêm, và DSL định tuyến cho phép bạn gửi từng yêu cầu riêng lẻ đến mô hình phù hợp để xử lý chúng thay vì chạy mọi thứ qua một điểm cuối.

NV-Reason-CT không nằm trên nền tảng của chúng tôi. Không có mô hình NVIDIA nào nằm trên đó. Phần CT của kiến trúc này là phần cứng của chính bạn cùng các trọng số do chính bạn tải xuống, và chúng tôi sẽ không viết một câu nào khiến người đọc nghĩ khác. Xét rằng đầu vào là dữ liệu thể tích có nguồn gốc từ bệnh nhân và giấy phép là OpenMDW-1.1 không kèm bất kỳ dịch vụ được host nào, thì dù thế nào, thực thi cục bộ vẫn là nơi mô hình đó thuộc về.

Việc ghép cặp thực sự cho bạn biết điều gì

Hai mô hình không cạnh tranh với nhau, và mục đích của việc so sánh chúng nằm ở chỗ chúng thất bại theo những cách khác nhau. NV-Reason-CT mang đến cho bạn một năng lực mà không gì khác trong cộng đồng mở làm được — suy luận CT ba chiều native ở độ phân giải đầy đủ của ca chụp — và yêu cầu bạn chấp nhận một chi phí chưa được dự toán cho mỗi ca chụp, một thông lượng chưa được công bố, và một giấy phép cấm triển khai lâm sàng. DeepSeek V4 Pro mang đến cho bạn một engine được tính phí theo mức dùng với độ trễ được công bố, tỷ lệ lỗi được công bố, các phép đo độc lập và một mức giá mà bạn có thể giảm một nửa bằng cách nhìn vào đồng hồ, và nó hoàn toàn không thể nhìn thấy bản chụp nào.

Nếu bạn tự xây dựng thứ đó thay vì mua nó, thì hình hài trụ lại sau va chạm thực tế chính là hình hài nhàm chán. Hãy chạy lượt đọc CT cục bộ, lập ngân sách cho nó bằng cách đo lường thay vì bằng cách báo giá, và đưa mọi thứ dạng văn bản xung quanh nó vào một điểm hẹn với khung giờ thấp điểm. Lịch trình duy nhất không ai nên sao chép là lịch trình chạy một trăm triệu token trích xuất lúc 02:00 UTC chỉ vì đó là lúc lô dữ liệu tình cờ sẵn sàng.

A screenshot of the OrcaRouter model page for DeepSeek V4 Pro, showing the identifier deepseek/deepseek-v4-pro, the description of it as a large mixture-of-experts model with a one-million-token context window, and a side panel listing a 1,048,576-token context window with up to 384,000 output tokens and text input with text output. A stat strip reads $0.66 per million input tokens, $1.98 per million output tokens, a 3.5-second p50 time to first token, and traffic measured in the billions of tokens over seven days.