GPT-Rosalind vs GLM-5.2のヒーロータイトルカード。OpenAIのライフサイエンス特化モデルと、Zhipuのオープンウェイト753B/40B汎用モデルを、100万トークンあたり$1.40/$4.40で対比する。
Guides & Insights

GPT-Rosalind対GLM-5.2:特化型ライフサイエンス推論 対 Zhipuのオープンな100万コンテキスト汎用モデル

著者

Magnus Corvin

公開日

最新モデル · 20すべてのモデルを見る
ベンチマーク:Artificial Analysis · 毎日更新
すべての記事に戻る

OpenAIが2026年9月11日にGPT-Rosalindをリサーチプレビューから外し、10月5日発効で100万トークンあたり$5.00/$25.00の価格を設定したとき、それはこの専門特化モデルを、まったく異なる種類の競合、すなわちGLM-5.2に真っ向から対抗させた。GLM-5.2はZ.aiのオープンウェイトの旗艦モデルで、753Bパラメータ、アクティブパラメータ40B、実用的に使える100万トークンのコンテキストウィンドウを備え、2026年6月16日から100万トークンあたり$1.40/$4.40で利用可能だ。RosalindはOpenAIが目的特化で作ったライフサイエンス推論モデルで、創薬、ゲノミクス、実験計画向けに調整されている。一方GLM-5.2は長期にわたるエンジニアリングタスク向けに作られた汎用モデルで、その重みは寛容なライセンスの下でHugging Faceに公開されている。この対決は、科学的AIの未来に対する非常に異なる2つの賭けを如実に示す事例である。

二つの賭け

2026年4月16日に発表され、ロザリンド・フランクリンにちなんで名付けられたGPT-Rosalindは、ライフサイエンスには専用に設計されたフロンティアモデルがふさわしいというOpenAIの賭けです。それは分子、タンパク質、遺伝子、経路、そして疾患に関連する生物学について推論するよう訓練されており、50を超える科学ツールやデータベースに接続するライフサイエンス研究プラグインを備えています。米国のトラステッドアクセスパートナー(Amgen、Moderna、アレン研究所、Thermo Fisher Scientific)向けに提供が開始され、6月にはGPT-5.5クラスのエージェント型コーディングで拡張され、そして今、プレビューを終えて、100万トークンあたり$5.00/$25.00、キャッシュ入力$0.50のグローバルなトラステッドアクセスプログラムへと移行します。課金は2026年10月5日に開始されます。

GLM-5.2は、長期的タスクの時代に向けたZ.ai(Zhipu AI)のフラッグシップモデルだ。テキスト入力/テキスト出力モデルであり、実用的な100万トークンのコンテキストと最大128Kの出力トークンを組み合わせ、reasoning_effort(high/max)で制御されるハイブリッド推論を備え、同クラスにおいて最強のオープンウェイトの地位を占めている。総パラメータ数は753B、トークンあたり40Bがアクティブで、その重みはHugging Faceで公開されている。2026年6月16日以降、OrcaRouterにて100万トークンあたり$1.40/$4.40で利用可能だ。

スコアボード

価格 — GPT-Rosalind 100万トークンあたり$5.00 / $25.00(キャッシュ済み入力 $0.50)、10月5日より適用。GLM-5.2 100万トークンあたり$1.40 / $4.40(キャッシュ読み取り $0.26)。

パラメータ — GLM-5.2:総パラメータ753B/アクティブ40B、Hugging Faceにてオープンウェイトを公開。GPT-Rosalind:非公開、フロンティア規模。

AA Intelligence Index — GLM-5.2:34.0、113モデルの同クラス内で平均以上。GPT-Rosalind:一般インデックスでは追跡対象外。

コンテキストウィンドウ — 両方とも100万トークン。GLM-5.2の最大出力は128K、GPT-Rosalindの出力は非公開。

アクセス — GLM-5.2:オープンAPI、オープンウェイト、OrcaRouterで定価にて提供。GPT-Rosalind:トラステッドアクセスの資格が必要で、サードパーティのルーターでは利用できません。

ドメイン評価 — GPT-Rosalind:BixBenchで首位、LABBench2ではGPT-5.4に対して6/11勝、GeneBench +53.7%、MedChemBench +18.0%、LabWorkBench +19.6%(ベンダー報告)。GLM-5.2:AIME 2026 99.2、ライフサイエンス系スイートの公表なし。

ツールエコシステム — GPT-Rosalind:ライフサイエンス研究プラグイン、50以上のツール。GLM-5.2:汎用的なツール利用、科学特化のスタックなし。

Comparison scoreboard for GPT-Rosalind and GLM-5.2: Rosalind $5/$25 cached input $0.50, AA not tracked, BixBench leading vendor-reported, closed API, trusted access; GLM-5.2 $1.40/$4.40 cache read $0.26, AA Intelligence 34.0 above average class of 113, open weights on Hugging Face 753B/40B, open API.

GLM-5.2がラボにもたらすもの

Screenshot of the Artificial Analysis models leaderboard showing GLM-5.2 at 34.0 and DeepSeek V4 Pro at 36.3 on the Intelligence Index.

GLM-5.2の最も強い論拠は、検証可能性と制御性にある。その34.0のAA Intelligence IndexとAIME 2026での99.2は独立に測定されており、753B/40Bアーキテクチャは文書化されており、そして——この対決の競合の中では唯一——その重みは寛容なライセンスの下でHugging Faceに公開されている。研究チームはGLM-5.2を自社インフラ上で実行し、検査し、ファインチューニングし、独自データを正確にどう扱うかを監査できる。規制対象のライフサイエンス業務にとって、その制御性は、APIに縛られた専門特化モデルには到底まねできない特長だ。1Mトークンのコンテキストと128Kの出力トークンにより、あらゆるフロンティア汎用モデルと同じ長い実験文書や多段階のエージェントセッションを、$1.40/$4.40で処理できる——入力ではRosalindの価格の約4分の1、出力では5分の1未満だ。

GLM-5.2 の汎用トレーニングが、ドメイン業務に十分な生物学をカバーしているかどうかには、真剣な疑問がある。その独立系ベンチマークは広範な推論スコア(AIME 99.2、DeepSWE 46.2、FrontierSWE 74.x)であり、公表された BixBench、LABBench2、GeneBench 相当の結果はない。科学テキストをたまたま扱える強力な汎用モデルを求め、しかも重みを手元に置いておきたい研究室にとって、GLM-5.2 は合理的で、独立に検証された選択肢だ。

ロザリンドがラボにもたらすもの

Rosalindの主張は、分子レベルでの深さにある。そのベンダー報告の結果——BixBenchで首位、LABBench2の11タスク中6つでGPT-5.4を上回り、GeneBenchでトークンあたり53.7%、MedChemBenchで18.0%の向上——は、GLM-5.2が決して特化して訓練されてこなかった推論をまさに狙っている:クローニングプロトコル、RNA機能予測、標的の優先順位付け、実験設計。Dyno TherapeuticsのRNA配列結果(人間の専門家の95パーセンタイル、10回中最良)は上限事例だ。OpenAIも、一般モデルと比べてハルシネーションを40%削減すると主張している——ベンダー測定であり、独立には検証されていないが、生物学では誤った答えの代償が十分に大きいため、この主張には意味がある。

Rosalind がもたらさないものは、GLM-5.2 が持っているものだ。オープンウェイト、ゲートなし、そして高スループットのパイプラインが償却できる価格。信頼済みアクセスの資格審査は現実の高いハードルだ — O​penAI は有益な用途、ガバナンス、管理されたアクセスに基づいて適格性を評価しており、すべての研究組織がそれを通過できるわけではない。そして出力 $25/M では、トークン消費の大部分を占める大量スクリーニング作業にとって Rosalind は高価だ。

実践における経済学

典型的な創薬パイプラインで計算してみよう。大量の文献と配列をスクリーニングする1回の処理は、GLM-5.2では$1.40/$4.40でおよそ$100、Rosalindでは$5.00/$25.00でおよそ$500かかる——両モデルの出力が同程度になる可能性が高いタスクなのに。専門特化プレミアムは、意思決定ポイント——標的選択、プロトコル設計、バリアント解釈——では正当化できる。そこではドメインにチューニングされたモデルが本当に誤りを犯す頻度を減らせるからだ。大量処理では無駄だ。合理的な配備は階層型だ:大量処理にはGLM-5.2(または別のコスト効率の良い汎用モデル)、意思決定にはRosalindを。

ハイブリッドラボスタックのルーティング

Screenshot of the OrcaRouter model page for GLM-5.2 showing the $1.40/$4.40 per 1M tokens list price and 1M-token context.

ここが、ルーティングレイヤーが二者択一をパイプラインに変える場所です。GLM-5.2 はOrcaRouter 上でリスト価格 $1.40/$4.40、マークアップ 0%、自動フェイルオーバー、そしてルーティング DSL を備えています。つまり高ボリュームの部分は 1 回の API 呼び出しで済み、2 つ目の契約は不要で、価格はベンダーのものをそのままパススルーします。Rosalind は直接の信頼済みアクセス申請が必要で、まだサードパーティのルーターには搭載されていません。ルーティングされたプロバイダー経由で利用可能になれば、同日にリスト価格で登場します。それまでの間でも、大量スクリーニングを GLM-5.2 に、重要な生物学的推論を専門エンドポイントに振り分け、両者の間でフェイルオーバーするルーティングルールをすでに書くことができます。1 つのキーで両方のティア、そしてすべてのベンダー価格の値下げがその日から反映されます。

結論

GPT-Rosalind と GLM-5.2 は異なる問いに答えます。Rosalind はフロンティアの専門特化モデルです。この対決において公表されている生物学的推論の証拠として最も強力であり、専用設計のツールエコシステムを備え、その価格とアクセス制限は「すべてにではなく、意思決定の場面で使うもの」と語りかけています。GLM-5.2 はオープンで検証可能な独立した代替です。公開重み、1M コンテキスト、寛容なライセンスを備えた 753B/40B の汎用モデルで、$1.40/$4.40 — 大量処理や、自社でモデルを所有する必要があるあらゆるチームにとって合理的なデフォルトです。本格的な研究スタックは両方を使います — 大量の処理にはルーティング API 経由で定価の GLM-5.2 を、間違えるコストが割増価格を上回る場面には Rosalind を。

この記事で比較したモデル1

この記事から検出 · ベンチマーク:Artificial Analysis · 毎日更新