
NV-Reason-CT vs Qwen3.8 Max: Bản tinh chỉnh và dòng mô hình mà nó xuất thân từ đó
- typesafeMỚITypeSafe: Jev 1.132026-09-24$0.04 / $0.00 trên 1 triệu token · 45 tok/s
- openaiMỚIOpenAI: GPT-6 Luna2026-09-2237Trí tuệ
- openaiMỚIOpenAI: GPT-6 Sol2026-09-2248Trí tuệ
- anthropicMỚIAnthropic: Claude Opus 5.52026-09-2258Trí tuệ
- grokMỚIGrok 4.72026-09-2146Trí tuệ
- OrcaMỚIOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 trên 1 triệu token · 182 tok/s
- orcaMỚIOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 trên 1 triệu token · 1285 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Trí tuệ
- openaiOpenAI: GPT-6 Astra2026-09-0453Trí tuệ77Lập trình
- googleGoogle: Gemini 3.8 Flash2026-09-0241Trí tuệ76Lập trình
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Trí tuệ76Lập trình
- anthropicAnthropic: Claude Fable 5.12026-09-0153Trí tuệ82Lập trình
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 trên 1 triệu token · 119 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Trí tuệ72Lập trình
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 trên 1 triệu token · 224 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Trí tuệ75Lập trình
- obsidianQwen3.8 27B2026-08-1534Trí tuệ68Lập trình
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Trí tuệ69Lập trình
- grokSpaceXAI: Grok 4.62026-08-1244Trí tuệ77Lập trình
- metaMeta: Muse Spark 1.22026-08-0540Trí tuệ72Lập trình
Dòng đầu tiên của NV-Reason-CT — thẻ mô hình — nói với bạn một điều mà hầu hết mọi người lướt qua. Mô hình cơ sở là Qwen/Qwen3.5-4B, được liệt kê trong siêu dữ liệu của kho lưu trữ như một quan hệ tinh chỉnh. Vậy nên khi NVIDIA cần một mô hình ngôn ngữ để gắn một Primus 3D vision transformer vào, họ đã lấy một Qwen. So sánh checkpoint đó với Qwen3.8 Max — mô hình hàng đầu 1.000.000 token của chính Alibaba, ra mắt ngày 3 tháng 8 năm 2026 — và bạn đang nhìn vào một bản tinh chỉnh và cả cơ nghiệp gia đình. Một cái là chuyên gia 4,69B đọc các khối CT ngực và bụng, được công bố lên Hugging Face vào ngày 8 tháng 9 năm 2026 mà không có thông báo. Cái còn lại là một mô hình hàng đầu đa dụng với đầu vào văn bản, hình ảnh và video, một bảng giá được công bố, và 37,2 triệu token lưu lượng đo được trên mạng của chúng tôi trong tuần qua. Câu hỏi thú vị không phải là cái nào thắng. Mà là một bản tinh chỉnh 4B có thể làm được điều gì mà mô hình hàng đầu cùng nhà của nó không thể, và tại sao câu trả lời lại cụ thể hơn bạn tưởng.
Cụ thể thì việc fine-tune đã mang lại được những gì
Cách chính NVIDIA định hình khoảng cách này chính xác đến lạ thường, và đó là câu hữu ích nhất trong kho lưu trữ: hầu hết các hệ thống thị giác-ngôn ngữ "hoặc hoạt động trên ảnh 2D hoặc nén các đặc trưng thể tích trước khi giải mã ngôn ngữ." Đó là một mô tả về toàn bộ một lớp mô hình, và nó bao gồm mọi mô hình chủ lực đa phương thức tổng quát trên thị trường.
Cách khắc phục nằm ở kiến trúc chứ không phải là vấn đề về quy mô. Một khối đầu vào 384×384×384 mm trở thành một lưới 24×24×24 gồm 13.824 token thị giác. Những token đó cùng tọa độ ba chiều của chúng đi vào mô hình ngôn ngữ mà không qua bất kỳ bước giảm mẫu không gian nào, và 3D MRoPE bảo toàn các mối quan hệ không gian bên trong bộ giải mã. Các khối đầu vào được cắt có nhận biết giải phẫu về ngực hoặc bụng bằng đơn vị Hounsfield của phổi, sau đó được lấy mẫu lại về độ phân giải đẳng hướng 2 mm.
Đọc điều đó đối chiếu với những gì Qwen3.8 Max chấp nhận. Văn bản, hình ảnh và video — và video là thứ gần nhất trong dòng này với một đầu vào thể tích, khiến nó trở thành điểm so sánh trung thực thay vì một điểm so sánh mang tính tu từ. Một video là một chồng các khung hình 2D được sắp xếp theo thời gian. Một khối CT là một chồng các lát cắt 2D được sắp xếp theo vị trí vật lý dọc trục z, tính bằng đơn vị Hounsfield, với khoảng cách milimét đã biết. Cả hai đều là mảng ba chiều. Chỉ một trong số chúng có hệ tọa độ vật lý mà phát hiện của bác sĩ chẩn đoán hình ảnh có thể được định vị theo, và chỉ một trong số chúng được đo bằng đơn vị có ý nghĩa bên ngoài một cảm biến hình ảnh. Một mô hình được huấn luyện trên video học tính liên tục theo thời gian. Một mô hình được huấn luyện trên các khối CT học được rằng một khối trong một lát cắt cũng chính là khối đó trong lát cắt tiếp theo thấp hơn tám milimét.
Kho ngữ liệu huấn luyện chính là sự khác biệt thực sự.
Đây là điểm mà hai mô hình hoàn toàn không còn so sánh được với nhau nữa, và đó chính là phần mà bảng thông số kỹ thuật che giấu.
NV-Reason-CT được huấn luyện end-to-end bằng tinh chỉnh có giám sát, sau đó là Tối ưu hóa Chính sách Tương đối Nhóm trên khoảng 550.000 ví dụ hỏi đáp có cấu trúc được lấy từ 70.111 thể tích CT duy nhất. Các nguồn dữ liệu là CT-RATE — 47.149 ca từ Bệnh viện Mega Đại học Medipol Istanbul với các báo cáo X quang đi kèm — một tập nội bộ của NIH gồm 15.991 ca, và 22.720 ca của CancerVerse trải qua bốn pha tương phản và mười ba loại u ác tính. Kho ngữ liệu bao gồm các báo cáo chuẩn hóa, hỏi đáp tập trung vào bất thường, hội thoại nhiều lượt, và lý luận do bác sĩ X quang biên soạn được ghi lại từ các diễn giải của chuyên gia. Giai đoạn GRPO sử dụng phần thưởng có thể xác minh trên các tập bất thường ngực và bụng, nghĩa là tín hiệu phần thưởng kiểm tra xem một phát hiện được nêu có hiện diện trong thể tích hay không, thay vì liệu văn phong có vẻ mang tính lâm sàng hay không.
Tập dữ liệu huấn luyện của Qwen3.8 Max không được công bố chi tiết đến mức như vậy, và kể cả có công bố thì cũng chẳng ích gì, vì năng lực mục tiêu mang tính tổng quát. Thay vào đó, các số liệu của Artificial Analysis mới là bằng chứng liên quan: chỉ số Intelligence Index là 45.4, đưa nó lên vị trí thứ 15 trong số 145 mô hình trong bản snapshot API của chúng tôi, AA Coding 76.2 ở vị trí thứ 9, Terminal-Bench 2.1 đạt 88.8, GPQA Diamond 92.8, Humanity's Last Exam 43.1, SciCode 52.1 và khả năng nhớ lại ngữ cảnh dài 80.3. Đó là các đo lường của bên thứ ba, không phải tuyên bố của nhà cung cấp, khiến chúng trở thành những con số đáng tin cậy nhất ở cả hai phía của trang này.
Đầu ra suy luận, hai hợp đồng khác nhau
Cả hai mô hình đều phát ra dấu vết suy luận và cả hai đều cho phép bạn tắt chúng. Điểm tương đồng chỉ dừng lại ở giao diện.
Qwen3.8 Max cung cấp enable_thinking và reasoning_effort, cùng toàn bộ dải tham số lấy mẫu — temperature, top_p, seed, các tham số phạt, đầu ra có cấu trúc, gọi công cụ. Đây là một năng lực suy luận tổng quát mà bạn hướng vào bất cứ thứ gì bạn có. Khả năng suy nghĩ của nó chỉ tốt ngang với vấn đề bạn giao cho nó, và nó không có cách nào xác minh một khẳng định dựa trên bất cứ thứ gì ngoài văn bản mà nó được cung cấp.
Suy luận của NV-Reason-CT có một giao kèo hẹp hơn với người đọc, và thẻ mô hình nêu rõ giới hạn một cách tường minh: suy luận được tạo ra là "đầu ra mô hình có thể xem xét lại và không được đảm bảo đại diện cho tính toán nội bộ của mô hình." Lời cảnh báo đó đang thực sự phát huy tác dụng, và đó là kiểu câu chỉ xuất hiện khi một nhóm đã suy nghĩ về việc một bác sĩ lâm sàng sẽ làm gì với một dấu vết nghe có vẻ hợp lý. Thẻ mô hình mô tả đầu ra là các quan sát có thể xem xét lại, chẩn đoán phân biệt và sự không chắc chắn. Nói cách khác, một dấu vết mà bạn có thể đối chiếu với khối hình ảnh, thay vì một dấu vết mà bạn chỉ có thể đọc.
Thông lượng, từ nơi duy nhất chúng ta có thể đo được nó
Qwen3.8 Max đã đưa 37,2 triệu token qua playground của chính OrcaRouter trong bảy ngày qua. Thời gian trung vị để có token đầu tiên là 1,96 giây — nhanh nhất một cách thoải mái trong số các mô hình thuộc loạt này — với 53,3 token đầu ra mỗi giây. Tỷ lệ lỗi trong khoảng thời gian đó là 3,5%.
Hai con số đó kéo về hai hướng ngược nhau và cả hai đều quan trọng. Độ trễ rất tuyệt vời và khiến việc liên tục thử nghiệm với mô hình trở nên dễ chịu. Tỷ lệ lỗi cao hơn khoảng mười bảy lần so với mức 0,21% của Kimi K3 trong cùng khoảng thời gian, và đó chính là con số quyết định việc bạn đặt nó phía sau một lệnh gọi đồng bộ hướng tới người dùng hay một tác vụ hàng loạt có thử lại. Đây là hành vi được đo đạc trên mạng của chúng tôi, không phải một phép đánh giá chuẩn, và đó là kiểu thông tin mà một bảng giá dịch vụ không bao giờ cho bạn biết.
NV-Reason-CT không có phép đo tương đương nào ở bất kỳ đâu. Đây là một checkpoint BF16 10,6 GB với mã mô hình tùy chỉnh, được nạp bằng trust_remote_code=True trên phần cứng Ampere, Hopper hoặc Lovelace, được NVIDIA kiểm thử trên H100 và L40S. Không có p50, không có tỷ lệ lỗi và không có số liệu thông lượng nào được công bố. Bất kỳ ai nói với bạn ngưỡng khối lượng mà tại đó việc tự vận hành mô hình này rẻ hơn so với trả tiền theo token đều đang đoán mò.
Giá cả và kiểu dáng, cạnh nhau
• Giá — chi phí đầu tư GPU NV-Reason-CT, không có mức giá theo token so với Qwen3.8 Max $2.00 / $6.00 mỗi triệu token, $0.25 cho lượt đọc từ bộ nhớ đệm, $2.50 cho lượt ghi vào bộ nhớ đệm
• Đầu vào — Thể tích CT NIfTI 3D của NV-Reason-CT tính bằng đơn vị Hounsfield, chỉ ngực hoặc bụng so với văn bản, hình ảnh và video của Qwen3.8 Max
• Ngữ cảnh — NV-Reason-CT một tập, tiền tố cố định 13.824 token so với Qwen3.8 Max 1.000.000 token
• Tham số — NV-Reason-CT tổng 4,69B / 4,35B hoạt động trong nhánh CT so với Qwen3.8 Max không được tiết lộ
• Giấy phép — NV-Reason-CT OpenMDW-1.1, trọng số được công bố so với Qwen3.8 Max độc quyền, chỉ truy cập qua API
• Điểm số độc lập — NV-Reason-CT: không có, so với Qwen3.8 Max AA Intelligence Index 45.4, GPQA Diamond 92.8

Kinh tế học bộ nhớ đệm của Qwen3.8 Max ưu đãi một dạng cụ thể: một lần đọc từ bộ nhớ đệm với giá $0.25 so với đầu vào mới với giá $2.00 là mức chiết khấu gấp tám lần, và chi phí ghi bộ nhớ đệm $2.50 nghĩa là một tiền tố dài có thể tái sử dụng sẽ nhanh chóng hoàn vốn. Đó là khối lượng công việc của một lời nhắc hệ thống cộng với một tài liệu giao thức được tái sử dụng qua hàng nghìn yêu cầu. NV-Reason-CT có hồ sơ chi phí ngược lại — chi phí cận biên gần như bằng không cho mỗi lần quét sau khi đã mua GPU, và mức sàn cứng là một GPU được giữ vô thời hạn.

Cùng nhau quán xuyến gia đình
Kiến trúc tự nhiên ở đây, và đáng nói rằng chưa ai công bố nó, là bản tinh chỉnh cho khối lượng lớn và mô hình hàng đầu cho mọi thứ xung quanh. NV-Reason-CT tạo ra phát hiện có cấu trúc; Qwen3.8 Max xử lý văn bản chuyển tuyến, khớp phác đồ, mã hóa, thư theo dõi — công việc văn bản khối lượng lớn, nơi cửa sổ một triệu token và mức chiết khấu bộ nhớ đệm gấp tám lần thực sự xứng đáng có chỗ đứng.
Nếu đó là pipeline của bạn, thì một nửa trong đó là checkpoint bạn tự host và một nửa là token bạn mua, và nửa thứ hai là nơi một router làm được điều mà một endpoint của một nhà cung cấp duy nhất không thể. Qwen3.8 Max được cung cấp thông qua OrcaRouter ở mức giá niêm yết của Alibaba với mức markup bằng không, vì vậy mức $2.00 / $6.00 ở trên là số tiền bạn trả và mọi thay đổi giá trong tương lai sẽ được tính vào hóa đơn của bạn ngay trong cùng ngày thay vì khi gia hạn. Tự động chuyển đổi dự phòng giữa các nhà cung cấp quan trọng hơn mức thông thường khi tỷ lệ lỗi đo được của chính mô hình là 3,5% — một lần thử lại chuyển sang một endpoint lành mạnh khác chính là sự khác biệt giữa một trục trặc tạm thời và một lô bị lỗi. Và vì nửa tổng quát của pipeline chỉ là một tên mô hình đằng sau một endpoint tương thích OpenAI bao phủ hơn 200 mô hình, việc thay sang một thứ khác cho thử nghiệm một tuần chỉ tốn một thay đổi chuỗi, không phải một tích hợp.
NV-Reason-CT, nói cho rõ, không nằm trên OrcaRouter và sẽ không nằm trên đó — đó là suy luận 3D bằng mã tùy chỉnh mà bạn tự chạy. Phiên bản trung thực của câu chuyện tích hợp là: mô hình chuyên biệt tự vận hành và mô hình tổng quát được định tuyến có thể cùng nằm dưới một khóa, và đó là toàn bộ tuyên bố.

Phán quyết thực sự có hiệu lực
Cặp so sánh này bị xếp vào mục “cái nào tốt hơn”, nhưng đáng lẽ không nên như vậy. Qwen3.8 Max được bên thứ ba đánh giá trên khả năng suy luận tổng quát và vượt qua phần lớn các đối thủ; NV-Reason-CT chỉ có một bảng số liệu của riêng nó trên một benchmark CT, cùng số tham số 4,69B mà sẽ chẳng có gì đáng chú ý trong bất kỳ so sánh tổng quát nào. Trên bất kỳ benchmark tổng quát nào, mẫu flagship đều thắng, và lý do là benchmark tổng quát chính là thứ mà nó được tạo ra để dành cho.
Với nhiệm vụ duy nhất mà NV-Reason-CT được tạo ra để làm — đọc một khối CT ngực hoặc bụng và nói trong đó có gì, kèm một dấu vết mà ai đó có thể kiểm tra — Qwen3.8 Max không phải là một đối thủ yếu hơn. Nó không có bộ mã hóa thể tích, nên hoàn toàn không thể chạy trên đầu vào nếu không có ai đó trước tiên quyết định cách làm phẳng một bản chụp thành các hình ảnh. Chính quyết định đó là nơi thông tin không gian bị mất đi. Đó chính là toàn bộ mục đích của một bản tinh chỉnh 4B với đường dẫn 3D nguyên bản và tiền tố cố định 13.824 token, và đó là lý do điều đáng chú ý ở mô hình này là độ nhỏ của xương sống chứ không phải kích thước của nó.
