タイトルが「NV-Reason-CT vs GLM-5.2」、サブタイトルが「このうち片方は非推奨です。しかも、あなたが思っている方ではありません」の生成されたヒーローカード。向かい合う2枚のカードは、1対の青い矢印で区切られている。左のカードには「NV-Reason-CT」というラベルと身体スキャンのアイコン、そして「2026年9月リリース - 現行 - 胸部および腹部CTのみ」と記されている。右のカードには「GLM-5.2」というラベルとチップのアイコン、そして「2026年6月リリース - GLM-5.3に置き換え - Artificial Analysisにて非推奨」と記されている。OrcaRouterのロゴは右下隅に合成されている。
Guides & Insights

NV-Reason-CT vs GLM-5.2:このうち1つは非推奨であり、それはあなたが思っているものではない

著者

Magnus Corvin

公開日

最新モデル · 20すべてのモデルを見る →
ベンチマーク:Artificial Analysis · 毎日更新
すべての記事に戻る

この比較でより古いほうのモデルが、廃止される側である。GLM-5.2は2026年6月16日にリリースされた。NV-Reason-CTには、2026年9月2日から25日の間に日付を持つリポジトリ活動がある。9月のもののほうが不確かな存在で、6月のもののほうが固まった選択肢だと期待するだろう。テキストパイプラインにとって重要な軸では、逆が真である。GLM-5.2は2026年8月18日に出荷されたGLM-5.3に取って代わられ、その数値が公開されている独立系リーダーボードでは現在、非推奨マーカーが付いている。NV-Reason-CTは、それについて他に何が未解決であれ、それが行う唯一の事柄の現行リリースである。

ですから、この記事で最初に役立つ一文は、読者が最も持ちにくいものです。今日テキストのビルドを始めていて、習慣でGLM-5.2に手を伸ばしているなら、いったん止めて、まずGLM-5.3を見てください。そのコストは100万入力トークンあたり$1.26、100万出力トークンあたり$3.96で、GLM-5.2の$1.40と$4.40に対して——より新しく、かつ安いのです——そしてその独立した知能指数は33.7に対して44.8で、これは横ばいではなく同じ尺度での一段の向上です。それはCTに関わることとは別の決定であり、別個に行われるに値します。

2つのモデル、そして2種類の異なる古さ

古いモデルと取って代わられたモデルの間には確かな違いがあり、この組み合わせがそれを具体的に示している。

• できること — NV-Reason-CTは胸部または腹部のCTボリュームを読み取り、解剖学的領域ごとに構造化された所見を出力します。GLM-5.2は、推論、コード、長文ドキュメント作業のためのテキスト専用言語モデルです

• 公開済み — NV-Reason-CTの成果物は2026年9月2日から25日のもの。GLM-5.2は2026年6月16日、GLM-5.3は2026年8月18日に続きます

• 世代ステータス — NV-Reason-CTはバージョン0.1で、未発表の初回リリースです。GLM-5.2は、出荷中の製品ラインの前世代です

• 独立した位置づけ — NV-Reason-CTの独立した測定値は存在しない。GLM-5.2はArtificial Analysis Intelligence Indexで33.7と測定されており、非推奨マーカー付きで、GLM-5.3の44.8と対比される

• ライセンスとアクセス — ダウンロードするOpenMDW-1.1ウェイト。100万トークンあたり$1.40と$4.40で提供され、キャッシュ読み取りは$0.26のオープンウェイトモデルに対して

• コンテキスト — チャットウィンドウなしで1巻あたり13,824ビジュアルトークン。一方、入力1,000,000トークン、出力128,000トークン

• 記載された用途 — 研究および教育専用であり、医療機器ではありません。汎用目的での配備には反対です

「deprecated」という語はここで正確な役割を果たしており、過剰に読み込まない方がよい。リーダーボード上の非推奨マーカーは、評価者がそのモデルを現行として扱うのをやめたことを意味し、通常は後継モデルがその座を引き継いだためだ。それは、重みが撤回されたとか、APIが停止されたとか、モデルが動作しなくなったという意味ではない。GLM-5.2 に合わせて調整したパイプラインを持つチームは困ってはいない。これが意味するのは、その数値が GLM-5.3 が存在する前のスナップショットであり、それを他のモデルの現在の数値と混ぜることは、6月の測定値と9月のフィールドを比較するようなものだということだ。

各サイドが持つ数字と、それらにどれだけの価値があるか

GLM-5.2の記録は異例なほど充実しており、それは示唆に富む形で食い違う2つの情報源からもたらされている。

Z.ai自身の報告によると、このモデルはτ²-Benchで99.12、SWE-bench Proで62.1、ツール使用時のHumanity's Last Examで54.7、Terminal-Bench 2.1で報告上の最高値82.7を記録している。独立系では、Artificial Analysisが同じモデルをTerminal-Bench 2.1で77.9、Intelligence Indexで33.7、GPQA Diamondで89.5、Humanity's Last Examで41.1と測定している。他にもベンダー公表値がある——AIME 2026で99.2、HMMT February 2026で92.5、IMOAnswerBenchで91、FrontierSWEで74.4、ProgramBenchで63.7、MCP-Atlasで76.8——そしてこれらはすべてZ.aiのものである。

そのリストについて、名指しする価値のある点が2つある。第一に、Terminal-Bench 2.1における、ベンダーの最良報告値82.7と独立測定値77.9の間の4.8ポイント差は矛盾ではない。ベンダーの最良報告値は通常、複数のハーネスの中の最良値であり、同じベンチマークについてZ.ai自身のTerminus-2の数値は81だ — 独立測定はベンダー自身の範囲内に収まっている。第二に、Humanity's Last Examの差はもっと大きい。独立測定では41.1で、ベンダー値はツールなしで40.5、ツールありで54.7だ。つまり、見出しの54.7はツール支援の数値であり、41.1はツールなしのほうだ。54.7を別のモデルのツールなしスコアと並べて引用するのは、実際の誤りになる。

NV-Reason-CTの実績にはそのような二つの情報源からなる構造がなく、まさにそこが弱い点である。そのCT-RATEの結果——18ラベルにわたる0.614 F1と0.871 AUROCで、固定の一律閾値と直接的なyes/noプロンプトを用い、分類ヘッドもタスク固有の適応も伴わない——はNVIDIA自身によるものである。その論文で比較対象となっているモデル(VoxelFM 0.581、Pillar-0 0.544、ClinFusion-8B 0.442、CT-CLIP 0.398、Merlin 0.358、MedGemma 1.5 0.303)はいずれも画像モデルである。独立した再現は一切行われておらず、モデルは数週間前からダウンロード可能である。また、レポート由来のマクロF1 0.592と、支援レビューを報告された平均読影時間の50%短縮に結び付ける予備的な専門放射線科医研究も報告しているが、著者ら自身がこれを深刻な小標本問題と指摘している。

つまり、来歴の比較は新しいモデルに軍配を上げるものではなく、ここがじっくり向き合う価値のある点だ。GLM-5.2は旧式で後継に取って代わられたモデルだが、その数値はNV-Reason-CTのものよりも信頼できる。社外の誰かがそのハーネスを実行したからだ。最新であることは、検証済みであることと同じではない。

A generated scoreboard titled 'Provenance, not recency, decides what to trust' with two columns. The left column, headed 'NV-Reason-CT', lists five rows: CT-RATE F1 0.614 and AUROC 0.871; provenance, the authors paper only; independent checks, none; model status, version 0.1, unannounced, current; licence, OpenMDW-1.1, research and education only. The right column, headed 'GLM-5.2', lists five rows: AA Intelligence 33.7, GPQA Diamond 89.5; provenance, vendor and Artificial Analysis; independent checks, yes, with a 4.8-point vendor-versus-independent gap on Terminal-Bench 2.1; model status, superseded by GLM-5.3 and deprecated by the evaluator; licence, open weights at $1.40 and $4.40 per million. A footer reads 'The superseded model is the better-verified one. Recency is not the same as evidence.'

なぜ非推奨化はその響き以上に重要なのか

この比較が防ぐように設計されている特定の失敗があり、それはCTとはまったく関係ありません。

臨床テキストパイプラインを構築しているチームが、データが機微であるため、自分たちのハードウェア上で動かせるオープンウェイトモデルを探している。彼らはGLM-5.2を見つける。MITライセンスで7430億パラメータ、うち約400億がアクティブで、条件に合い、ベンチマークの記録も十分に文書化されている。彼らはそれを基準にチューニングする。半年後、彼らは知る——現行世代はGLM-5.3であり、100万コンテキストで128Kの出力上限を持ち、価格は$1.26と$3.96でより安いこと、そして自分たちが下していると思っていた決定——どのオープンウェイトモデルに標準化するか——は、実際にはどの世代にするかという決定であり、それを偶然に下してしまったのだと。

それは後から気づくと高くつく事故で、一度の検索で回避できます。具体的なガイダンスは次のとおりです:

• これから標準として採用しようとしているモデルが現行世代かどうかを確認する — リーダーボードの非推奨マーカーが最速のシグナルであり、ベンダー自身のモデル一覧が権威ある情報源です

• 6月のスナップショットと9月の数値を混同しないこと — GLM-5.2の指数33.7はGLM-5.3が存在する前に測定されたものであり、それを現行モデルの指数と並べることは、動き続ける分野における異なる2つの時点を比較することになる

• 名称には注意してください — 「GLM-5.3 Prime」という表記は、同じ重みをほぼ2倍の定価で提供するサービング層であり、別個のモデルではありません。割増料金を支払う前に、そのSKUの裏にある重みを確認してください

• より低い表示価格は答えではなく問いとして捉える — GLM-5.3が前世代より安いのは異例であり、思い込むのではなく自身のワークロードで検証する価値がある

だからといって、それが GLM-5.2 を悪い選択にするわけではない。チームがすでにそれに合わせてチューニングを済ませている、$1.40 と $4.40 の MIT ライセンス 743B モデルなら、動かし続けるのはまったく合理的だ。また、実績が確立した中間世代のモデルは、規制されたワークフローがまさに求めているものであることもある。要は、7月時点で最新だったリストから受け継いだ既定値ではなく、意図的に選ばれる選択であるべきだということだ。

テキストモデルとCTモデルを比較する際の罠

この組み合わせがそもそももっともらしく見えるのは、どちらも2026年にリリースされたオープンウェイトモデルであり、カタログをざっと見る読者には比較可能な2つの項目として映るからだ。しかし両者は比較可能ではなく、その不一致には特定の形がある。

GLM-5.2は1,000,000トークンを保持できる。NV-Reason-CTの単一CTボリュームは13,824個の視覚トークンを消費する。その計算では、GLM-5.2は70件のCT検査を収めてもなお余地があることになり、十分に長いコンテキストを持つテキストモデルがあれば画像モデルは不要になる、という結論を招きかねない。その結論は導かれない。理由は予算ではなくインターフェースにある。

それら13,824トークンは要約ではない。それらは384ミリメートルの立方体を2 mm等方にリサンプリングし、24 x 24 x 24グリッド上で8 x 8 x 8パッチに切り分け、空間ダウンサンプリングもマージ層も持たない言語バックボーンに渡したものだ——だからこそ、アクティブ経路は総計4.69Bパラメータのうち4.35Bパラメータであり、計算は解像度を圧縮して捨てるのではなく維持することに費やされる。GLM-5.2はテキスト専用だ。視覚経路をまったく持たないので、スキャンをどう扱うかという問いはそもそも生じない。答えは、どのような形であれスキャンを与えることはできない、というものだ。2つのモデルカードは、比較とは何の関係もない600倍のトークン予算の違いを述べている。なぜなら、一方には入力を受け取る手段がまったくないからだ。

逆の誤りも同じように起こり得る。NV-Reason-CT は胸部と腹部に対応し、プロンプトではなく NIfTI ファイルを受け取り、ツール使用はなく、そのモデルカードは研究および教育用途に限定しており、医療機器ではないこと、出力が不正確になり得ることを明記している。レポートコーパスを正規化したり、評価ハーネスを書いたり、ガイドライン文書を推論したりすることはできない。4.7B の画像モデルは、743B のテキストモデルの代わりにはならない。逆の場合も同様である。

A generated scoreboard titled 'Two open-weight models, two different jobs' listing six paired rows. Row one: what it reads, one-channel NIfTI volumes in Hounsfield units against text only. Row two: context, 13,824 visual tokens per volume against 1,000,000 tokens in and 128,000 out. Row three: parameters, 4.69B total and 4.35B active against 743B total and about 40B active. Row four: generation status, version 0.1 current, unannounced against superseded by GLM-5.3. Row five: price, self-hosted with no rate card against $1.40 and $4.40 per million, or $1.26 and $3.96 for the successor. Row six: stated use, research and education, not a medical device against general purpose. A footer reads 'GLM-5.2 figures per the provider and Artificial Analysis; NV-Reason-CT figures per the authors paper.'

テキストの半分を1つのキーに配置する

パイプラインの作業をどのテキストモデルで動かすかという話なら、今日の答えはおそらく GLM-5.2 ではなく GLM-5.3 です。しかも両方とも、ひとつのキーの下で当社のカタログに載っています。z-ai/glm-5.2は Z.ai のプロバイダーリストレートでマークアップゼロで提供され、GLM-5.3 もそれに並んで、200 を超えるモデルをカバーする単一の API の中で提供されます。世代交代の時期には、両方を利用可能にしておくことがいつも以上に重要です。本番採用する前に後継モデルを自社のコーパスで評価でき、その間は現行モデルをフォールバックとして維持でき、2つ目の契約やコード変更なしに切り替えられます。

パススルー料金が一言に値するのは、ベンダーが再価格設定を行うあらゆるモデルでそれが重要なのと同じ理由です。間にマークアップ層がなければ、ベンダーの料金変更はその日のうちにこちら側に反映されます。 自動フェイルオーバーは、バッチ処理の途中でプロバイダーが性能低下するケースをカバーします。長時間の抽出ジョブにとって、これこそが実際に一晩を無駄にする障害であり、ルーティングDSLを使えば、すべてを1つのエンドポイントに向けるのではなく、個々のリクエストを処理すべきモデルに送ることができます。

NV-Reason-CTは当社のプラットフォーム上にはなく、NVIDIAのモデルも同様です。これは推測に委ねるのではなく、はっきりと述べておく価値があります。このアーキテクチャのCT側は、それを許諾するライセンスと臨床使用を禁じるモデルカードの下で、お客様自身のハードウェア上にダウンロードされた重みです。当社はそれをホストしておらず、そうでないことを示唆する一文を書くつもりもありません。

これらの決定を下す順序

臨床ビルドにおける正しい順序は、この比較が示唆する順序ではありません。

まずテキスト生成の検討から始め、その最初に、価格と実測能力の面でどの世代が現行かを確認する — 現状にとどまる理由がない限り、GLM-5.2ではなくGLM-5.3を。次に、CTモデルのスタディあたりのレイテンシを自社ハードウェア上で計測する。その数値は非公開であり、残りの予算を左右するからだ。次に、パイプラインを、二つの半分を独立して差し替え可能になるよう設計する。一方はプレビューに近いライフサイクルにあり、他方はバージョン0.1にあるからだ。

唯一やってはいけないのは、この二つを二者択一として扱うことだ。取って代わられた743Bテキストモデルと現行の4.69B CTモデルには、共通するタスクなど何もない。この比較に意味があるのは、それが露わにする点のためだけだ。すなわち、より新しい成果物のほうがその背後にある証拠は弱いということ、古いほうは静かに世代から外れているということ、そしてそのどちらの事実も、まるで選択肢であるかのように両者を並べて記載したカタログの一行を読む者には見えないということだ。

A screenshot of the OrcaRouter model page for GLM 5.2, showing the identifier z-ai/glm-5.2 with a Featured badge and tags for Tools, JSON and Reasoning, the description of it as Z.ai's flagship model for long-horizon tasks with a 1M-token context window and up to 128K output tokens, a side panel listing a 1M-token context window and 128K maximum output with text input and text output, and a stat strip reading $1.40 per million input tokens, $4.40 per million output tokens, and a p50 time to first token under five seconds.

この記事で比較したモデル1

この記事から検出 · ベンチマーク:Artificial Analysis · 毎日更新