一张生成的英雄卡片,标题为“NV-Reason-CT vs Qwen3.8 Max”,副标题为“微调模型及其所属系列”。底部横向排列着三个标签:“主干模型:Qwen/Qwen3.5-4B”、“13,824 tokens 对比 1,000,000”,以及“实测误差 3.5% 对比 0.21%”。OrcaRouter 徽标合成在右下角。
Guides & Insights

NV-Reason-CT vs Qwen3.8 Max:微调版本及其所属家族

作者

Alistair Wren

发布日期

最新模型 · 20查看全部模型 →
基准测试:Artificial Analysis · 每日更新
返回全部文章

第一行NV-Reason-CT会告诉你一件大多数人都会略过的事。基础模型是 Qwen/Qwen3.5-4B,在仓库元数据中列为微调关系。因此,当 NVIDIA 需要一款语言模型来把 Primus 3D 视觉 Transformer 接上去时,它选了一个 Qwe​n。把那个检查点与 Qwen3.8 Max —— Aliba​ba 自家、拥有 1,000,000 token 的旗舰模型,于 2026 年 8 月 3 日发布 —— 相比,你看到的是一个微调模型和家族主业。一个是 4.69B 的专用模型,可读取胸部和腹部 CT 体数据,并于 2026 年 9 月 8 日发布到 Hugging Face,没有任何公告。另一个是通用旗舰,支持文本、图像和视频输入,有公开的价目表,并且在过去一周里于我们的网络上产生了 3720 万 token 的实测流量。有趣的问题不是哪个胜出,而是 4B 微调模型能做到其家族旗舰做不到的什么,以及为什么答案比你预想的更具体。

微调具体带来了什么

NVIDIA 自己对这一差距的表述异常精准,这也是整个仓库中最有用的一句话:大多数视觉-语言系统“要么基于 2D 图像运行,要么在语言解码之前压缩体素特征”。这是对整整一类模型的描述,而且涵盖了市场上所有通用多模态旗舰模型。

这一修复是架构层面的,而不是规模问题。一个 384×384×384 毫米的输入体数据会变成 24×24×24 的网格,包含 13,824 个视觉 token。这些 token 及其三维坐标会在不进行空间下采样的情况下进入语言模型,而 3D MRoPE 会在解码器内部保留空间关系。输入体数据会借助肺部 Hounsfield 单位进行解剖感知裁剪,裁成胸部或腹部,然后再重采样为 2 毫米各向同性分辨率。

把这段话和 Qwen3.8 Max 所接受的内容对照着读。文本、图像和视频——而视频是这个系列中最接近体数据输入的东西,这使它成为一个诚实的比较对象,而非修辞上的比较对象。视频是一叠按时间排序的二维帧。CT 体数据是一叠按 z 轴物理位置排序的二维切片,以亨斯菲尔德单位计,层间距以毫米为单位且已知。两者都是三维数组。但只有其中一个拥有物理坐标系,放射科医生的发现可以定位到该坐标系中;也只有其中一个所用的计量单位,在图像传感器之外还有意义。在视频上训练的模型学到的是时间上的连续性。在 CT 体数据上训练的模型学到的是:一个切片中的肿块,与低八毫米的下一张切片中的肿块是同一个肿块。

训练语料才是真正的区别所在

这正是两个型号完全不再具备可比性的地方,而这恰恰是规格表所掩盖的部分。

NV-Reason-CT 通过端到端训练完成,先进行监督微调,随后对约 550,000 个结构化 QA 样本应用组相对策略优化(GRPO),这些样本取自 70,111 个独特的 CT 体数据。数据来源包括 CT-RATE——来自伊斯坦布尔 Medipol 大学 Mega 医院的 47,149 例病例,配有配对的放射学报告——一个包含 15,991 例病例的内部 NIH 数据集,以及 CancerVerse 的 22,720 例病例,涵盖四个对比期相和十三种恶性肿瘤类型。该语料库包括标准化报告、以异常为重点的 QA、多轮对话,以及从录制的专家解读中转录的放射科医生撰写的推理。GRPO 阶段对胸部与腹部异常集使用可验证奖励,这意味着奖励信号检查的是所陈述的发现是否存在于体数据中,而不是文本听起来是否像临床描述。

Qwen3.8 Max 的训练语料并未以那种详细程度公布,就算公布了也无济于事,因为目标能力是通用性的。相反,其 Artificial Analysis 数据才是相关证据:智能指数 45.4,在我们 API 快照的 145 个模型中位列第 15;AA Coding 76.2,排名第 9;Terminal-Bench 2.1 为 88.8;GPQA Diamond 92.8;Humanity's Last Exam 43.1;SciCode 52.1,长上下文召回率 80.3。这些是第三方测量结果,而非厂商宣称,因此它们是本页双方最可信的数字。

推理输出,两个不同的契约

两个模型都会输出推理轨迹,也都允许你将其关闭。相似之处也就到此为止了。

Qwen3.8 Max 对外暴露了enable_thinking和reasoning_effort,以及完整的采样参数面——temperature、top_p、seed、各类惩罚项、结构化输出、工具调用。它是一种通用推理能力,你可以把它指向手头的任何东西。它的思考好坏取决于你交给它的问题,而除了给它的那段文本之外,它没有任何办法去验证某项论断。

NV-Reason-CT 的推理与读者之间的约定更为狭窄,而模型卡也明确说明了这一局限:生成的推理是“可供审阅的模型输出,并不保证代表模型的内部计算过程”。这句告诫是实打实起作用的,而这类句子,只有在团队认真思考过临床医生会如何对待一段看似合理的推理轨迹之后,才会出现。模型卡将该输出描述为可供审阅的观察结果、鉴别诊断和不确定性。换言之,这是一条可以与影像体数据对照核查的轨迹,而不是一条只能读一读的轨迹。

吞吐量,来自我们能测量它的唯一地方

Qwen3.8 Max 在过去七天内通过 OrcaRouter 自有的 playground 处理了 3720 万个 token。其中位首 token 时间为 1.96 秒——在本系列模型中轻松位居最快——输出速度为每秒 53.3 个 token。该时间段内的错误率为 3.5%。

这两个数字方向相反,但都同样重要。延迟表现极佳,让模型迭代起来很顺手。而在同一时间窗口内,错误率大约是同窗口下 Kimi K3 的 0.21% 的十七倍,而正是这个数字决定了你是把它放在面向用户的同步调用后面,还是用于带重试的批处理任务。这是在我们网络上实测出的行为,而非基准测试成绩,而这类信息正是价目表永远不会告诉你的。

NV-Reason-CT 在任何地方都找不到与之相当的测量数据。它是一个 10.6 GB 的 BF16 checkpoint,带有自定义模型代码,可在 Ampere、Hopper 或 Lovelace 硬件上以 trust_remote_code=True 加载,并由 NVIDIA 在 H100 和 L40S 上进行测试。目前没有公布任何 p50、错误率或吞吐量数字。任何告诉你自托管该模型在达到某个交叉用量后就比按 token 付费更划算的人,都是在猜。

价格和形状,并排显示

• 价格 — NV-Reason-CT 的 GPU 资本支出(capex),无按 token 计费;对比 Qwen3.8 Max 每百万 tokens $2.00 / $6.00,缓存读取 $0.25,缓存写入 $2.50

• 输入 — NV-Reason-CT 3D NIfTI CT 体数据(以亨斯菲尔德单位表示,仅限胸部或腹部)对比 Qwen3.8 Max 文本、图像和视频

• 上下文 — NV-Reason-CT 单卷,固定 13,824-token 前缀,对比 Qwen3.8 Max 的 1,000,000 tokens

• 参数 — NV-Reason-CT 总计 4.69B / 在 CT 通路中激活 4.35B,对比 Qwen3.8 Max 未披露

• 许可 — NV-Reason-CT OpenMDW-1.1,权重已发布;而 Qwen3.8 Max 为专有,仅限 API 访问

• 独立评分 — NV-Reason-CT 无 vs Qwen3.8 Max AA 智能指数 45.4,GPQA Diamond 92.8

A generated scoreboard titled 'NV-Reason-CT vs Qwen3.8 Max - the scoreboard'. Left column 'NV-Reason-CT': Price GPU capex, no per-token rate; Input 3D NIfTI CT, chest or abdomen; Context one volume, 13,824-token prefix; Parameters 4.69B total / 4.35B active; Licence OpenMDW-1.1, weights published; Independent score none published. Right column 'Qwen3.8 Max': Price $2.00 / $6.00, $0.25 cached read; Input text, image and video; Context 1,000,000 tokens; Parameters undisclosed; Licence proprietary, API only; Independent score AA Index 45.4, GPQA Diamond 92.8. A footer reads 'Qwen3.8 Max scores per Artificial Analysis; NV-Reason-CT figures are the authors' own, from the model card.'

Qwen3.8 Max 的缓存经济性奖励一种特定的形态:0.25 美元的缓存读取对上 2.00 美元的全新输入,相当于八折优惠;而 2.50 美元的缓存写入则意味着一个可复用的长前缀很快就能收回成本。这正是那种系统提示词加协议文档、在数千次请求中反复复用的工作负载。NV-Reason-CT 的成本结构恰恰相反——一旦买下 GPU,每次扫描的边际成本近乎为零,但代价是一块 GPU 被永久占用这一硬性底线。

A screenshot of NVIDIA's Hugging Face model page for NV-Reason-CT, showing the model card header with Like 1 and 0 followers, the Image-Text-to-Text and Transformers and Safetensors tags, the qwen3_5, medical-imaging, ct, 3d-vlm and custom_code tags, 'Downloads last month 210', the 5B-parameter BF16 size row, the model description describing the 384x384x384-mm volume becoming a 24x24x24 grid of 13,824 visual tokens with no spatial downsampling, the training paragraph citing roughly 550,000 structured QA examples from 70,111 unique CT volumes, a side panel showing Base model Qwen/Qwen3.5-4B and the CT-RATE and CancerVerse datasets, and the arXiv 2609.27511 paper link.

共同经营家庭

这里顺理成章的架构——值得一提的是,还没有人公开发表过它——就是用微调模型承担海量工作,用旗舰模型处理其周边的一切。NV-Reason-CT 产出结构化的结论;Qwen3.8 Max 负责转诊文本、方案匹配、编码、随访信函——这些大批量的文本工作,正是百万 token 窗口和八倍缓存折扣真正物有所值的地方。

如果这就是你的流水线,那么其中一半是你自托管的检查点,另一半是你购买的 token,而后一半正是路由器能做一些单一供应商端点做不到的事的地方。Qwen3.8 Max 通过 OrcaRouter 按阿里巴巴的标价提供服务,零加价,所以上面的 $2.00 / $6.00 就是你实际支付的价格,未来任何价格变动都会当天反映到你的账单上,而不是等到续约时。跨供应商的自动故障转移比平时更重要,因为该模型自身实测的错误率是 3.5%——一次重试转到另一个健康的端点,就是短暂抖动与整批失败之间的区别。而且由于流水线中通用的一半只是一个兼容 OpenAI 的端点后面的一个模型名称、覆盖 200+ 个模型,换用别的东西做一周实验只需改一个字符串,而不是做一次集成。

NV-Reason-CT,需要明确的是,它不在 OrcaRouter 上,也不会出现在上面——它是你自己运行的自定义代码 3D 推理。关于集成情况,诚实的说法是,自托管专家模型和路由通用模型可以置于同一个密钥之下,而这就是该说法的全部内容。

A screenshot of the OrcaRouter model page for Qwen3.8 Max, showing the identifier qwen/qwen3.8-max, input text + image + video, output text, the Vision, Tools, JSON and Reasoning badges, a 1,000,000-token context window with a p50 time to first token of 1.96 seconds, the description of it as Alibaba's newest flagship positioned against GPT-5.5, Claude Opus 4.7 and Gemini 3.1 Pro, OpenAI-compatible code samples pointing at https://api.orcarouter.ai/v1, and a stat strip reading $2.00 per million input tokens, $6.00 per million output tokens and 37.2M tokens of seven-day traffic.

真正站得住脚的裁决

这种配对会被归到“哪个更好”之下,但它不该如此。Qwen3.8 Max 由第三方在通用推理上进行测评,并胜过该领域大多数模型;NV-Reason-CT 在一个 CT 基准测试上只有一张自家数字构成的表格,以及 4.69B 的参数规模,在任何通用比较中都毫不起眼。在任何通用基准测试上,旗舰模型都会胜出,原因在于通用基准测试正是它被打造出来要应对的。

在 NV-Reason-CT 专为执行的那一项任务上——读取胸部或腹部 CT 体数据,说出其中有什么,并给出可供人核查的轨迹——Qwen3.8 Max 并不是一个更弱的竞争者。它没有体数据编码器,因此除非有人先决定如何把一次扫描展平成图片,否则根本无法在该输入上运行。空间信息正是在这个决定中被丢掉的。这正是带有原生 3D 通路和 13,824 token 固定前缀的 4B 微调的全部意义所在,也正是为什么这个模型有意思的地方在于其骨干网络之小,而不在于其规模之大。