GPT-Rosalind 對上 Claude Opus 5 的主視覺標題卡,在相同每百萬 token $5/$25 的定價下,比較 OpenAI 的生命科學專門模型與 Anthropic 的通用型旗艦。
Guides & Insights

GPT-Rosalind 對決 Claude Opus 5:生命科學專才對上通用旗艦

作者

Elias Hawthorne

發佈日期

最新模型 · 20查看全部模型
基準測試:Artificial Analysis · 每日更新
返回全部文章

2026 年 9 月 11 日決定將 GPT-Rosalind——OpenAI 專為生命科學推理打造的模型——帶出研究預覽階段,這是首次真正有機會將它與通用型前沿模型正面對比,而最自然的對手是 Claude Opus 5Anthropic 針對高要求推理、程式編寫與長時程代理式工作的旗艦模型。GPT-Rosalind 透過 OpenAI 的可信存取計畫提供,並公布自 2026 年 10 月 5 日起生效的定價;Claude Opus 5 則自 2026 年 7 月 24 日起全面開放,價格為每 100 萬個 token 5.00 美元/25.00 美元。兩者都是前沿模型,但為不同任務而打造:Rosalind 用於藥物探索、基因體學與實驗規劃;Opus 5 則涵蓋企業推理的全方位需求。問題在於,專家模型在生物學上的優勢,是否值得放棄通用模型的廣度。

為什麼現在會出現這個對戰組合

五個月來,GPT-Rosalind 只存在於一道僅限美國的受信任存取閘門之後,僅開放給少數具名合作夥伴——安進(Amgen)、莫德納(Moderna)、艾倫研究所(Allen Institute)、賽默飛世爾科技(Thermo Fisher Scientific)。2026 年 9 月 11 日,O​penAI 宣布該模型將結束研究預覽階段,透過受信任存取計畫向全球符合資格的組織開放,並自 10 月 5 日起開始計費:每 100 萬個輸入 token 收費 5.00 美元、快取輸入 0.50 美元、每 100 萬個輸出 token 收費 25.00 美元。這一定價實際上與 Claude Opus 5 的 5.00/25.00 美元相同,使得比較格外單純:兩個前沿模型的 token 價格完全相同,一個專精特定領域,一個通用。

Rosalind 是以 Rosalind Franklin 命名,她的 X 射線繞射研究揭示了 DNA 的結構。根據 OpenAI,該模型本身是為了針對分子、蛋白質、基因、途徑與疾病相關生物學進行推理而打造,也適用於多步驟工作流程,例如文獻回顧、序列到功能的解讀、實驗規劃與資料分析。這是生命科學模型系列的首個發布版本,並隨附一個開源的 Life Sciences Research Plugin for Codex,可將其連接至超過 50 種科學工具與資料來源。

計分板

最誠實的第一個觀察是,目前沒有能對這兩款模型進行同基準比較的公開評測。GPT-Rosalind 的亮眼數字是廠商與合作夥伴回報的領域任務評測;Claude Opus 5 則有來自 Artificial Analysis 的獨立分數,但沒有這種深度的已發布生物學領域評測。因此,下方的計分板明確區分了這兩類證據。

價格 — GPT-Rosalind 每 100 萬個詞元 $5.00 / $25.00(快取輸入 $0.50),自 2026 年 10 月 5 日起生效。Claude Opus 5 每 100 萬個詞元 $5.00 / $25.00(快取讀取 $0.50,快取寫入 $10.00)。兩者的主要費率完全相同。

使用權 — GPT-Rosalind:受信任存取申請、資格審核,最初僅限美國,現已擴及全球符合資格的組織。Claude Opus 5:任何帳戶皆可開放 API 存取。

AA Intelligence Index — Claude Opus 5:50.7,在 141 個中排名第 4。GPT-Rosalind:未列入追蹤(專門化模型不會出現在一般排行榜上)。

AA Coding — Claude Opus 5:78.0,138 個中排名第 2。GPT-Rosalind:不適用 — 其領域是濕實驗室規劃,而非軟體工程。

領域評估 — GPT-Rosalind:在 BixBench 領先(供應商回報),11 項 LABBench2 任務中有 6 項超越 GPT-5.4(供應商回報),在 GeneBench 上每符元效能提升 53.7%(供應商),在 MedChemBench 上提升 18.0%,在 LabWorkBench 上提升 19.6%,在 LifeSci Bench 上提升 4.42%(以上皆為 OpenAI 回報)。Claude Opus 5:未發布可相比擬的生命科學評測套件。

上下文視窗 — 兩者皆為 100 萬個 token。Claude Opus 5 支援文字、圖片與檔案輸入,並以文字輸出;GPT-Rosalind 則透過 ChatGPT、Codex 與 API 處理科學檔案輸入。

推理模式 — Claude Opus 5 提供自適應推理(自動、低至高等級)。GPT-Rosalind 是以工具使用為核心的推理模型,並在 API 中提供 reasoning_effort 風格的控制選項。

Comparison scoreboard for GPT-Rosalind and Claude Opus 5: Rosalind $5/$25 cached input $0.50, AA Intelligence not tracked, BixBench leading vendor-reported, trusted access, 50+ tool stack; Opus 5 $5/$25, AA Intelligence 50.7 #4 of 141, no life-sciences suite, open API.

Rosalind 的數字實際上代表什麼意思

最常被引用的 Rosalind 結果來自 Dyno Therapeutics:在一項未發表的 RNA 序列預測任務中,十次生成中取最佳者在預測方面超越了 57 位人類 AI 生物專家的第 95 百分位,而在序列生成方面則約為第 84 百分位。那是在專有任務上進行的合作夥伴評估,採用會提高成本與延遲的十取最佳取樣——它告訴你的是大量取樣模型的上限,而非典型的單次呼叫體驗。Open​AI 自家在公開基準測試上的評估包括在 BixBench 上表現領先,以及在 LABBench2 上於 11 項中贏過 GPT-5.4 六項,但同樣帶有廠商自行報告的但書。幻覺率主張——透過批判性思考調校而比一般模型低 40%——是 Open​AI 自家的量測,尚未經獨立重現。

這些數據確實能證明的是,Rosalind 是專門針對生物學研究的運作機制進行調校:選殖流程設計、RNA 功能預測、標靶優先排序。而這正是 Claude Opus 5 沒有公開發表證據的地方,因為它並非為此而打造。因此,這項比較的關鍵在於:你究竟是專為生物學工作挑選模型,還是為了涵蓋全方位的推理任務而挑選模型。

Claude Opus 5 的勝出之處

Screenshot of the Artificial Analysis models leaderboard showing the Intelligence Index rankings where Claude Opus 5 scores 50.7 and GPT-5.6 family and DeepSeek V4 Pro appear.

Claude Opus 5 的獨立評測紀錄既廣且深:在 Artificial Analysis Intelligence Index 上拿下 50.7(141 個模型中排名第 4),AA Coding 78.0(138 個模型中排名第 2),GPQA Diamond 93.2,Humanity's Last Exam 54.9,以及 79.3 的長上下文回憶(Long-Context Recall)。它是 Anthropic 迄今能力最強的模型,適用於端到端軟體工程、程式碼審查與錯誤查找,以及視覺分析,並且在大量使用工具、橫跨極長的多步驟代理式工作階段時仍能保持連貫一致。對於主要工作負載是軟體、分析流程或一般企業推理的團隊而言,就證據來看,Opus 5 是更穩妥的選擇,而且今天只要擁有 API 金鑰就能使用——無需資格審查。

GPT-Rosalind 在哪裡勝出

GPT-Rosalind 的優勢在於領域深度:其訓練與調校鎖定 OpenAI 所列出的 50 種生物學工作流程——證據綜合、序列到功能、實驗設計、分子候選物比較。在與 Opus 5 相同的每 token 價格下,它提供的模型看過遠更多分子生物學、基因體學與化學專業資料,再加上生命科學外掛讓它開箱即用就具備 50 多種工具與資料庫。對藥物化學家或基因體學研究人員而言,這就是同樣 token 成本下,卓越通才與領域專家之間的差別。

路由問題

Screenshot of the OrcaRouter model page for Claude Opus 5, showing the $5.00/$25.00 per 1M tokens list price, p50 TTFT 4.73s, and 1M-token context.

這場對決有個實際的棘手之處:GPT-Rosalind 目前尚未上架於任何第三方路由平台。存取必須直接透過 OpenAI 的受信任存取計畫。相較之下,Claude Opus 5 在 OrcaRouter 上以定價提供——每 100 萬個 token 為 $5.00/$25.00,與供應商費率完全相同、0% 加價——透過單一 API 與 200 多個其他模型並列,並具備自動容錯移轉,以及用於組合模型的路由 DSL。通過資格審查並取得 Rosalind 金鑰的團隊,仍可透過 OrcaRouter 將其他所有事項繞道處理,或使用容錯移轉,如此一來,若 Rosalind 的長時間領域呼叫停滯,請求便會改由可用的通用模型接手。這才是誠實的分工:生物學問題交給 Rosalind,其餘流程交給路由層。

你應該選擇哪一個?

如果你的工作是生命科學研究——標靶探索、蛋白質工程、基因體學、實驗規劃——GPT-Rosalind 是唯一為此專門打造的前沿模型,而且在與通用模型相同的 token 價格下,只要你的組織通過信任存取資格審核,它在這項特定任務上就是更划算的選擇。如果你的工作屬於其他任何領域——即使在生技實驗室裡,大部分的 token 支出仍是用在程式碼、資料管線和一般推理上——Claude Opus 5 擁有獨立評測的實績、開放的 API 存取,以及路由生態系統。專家的優勢確實存在,但範圍狹窄;通用模型的涵蓋範圍則廣泛且可驗證。對大多數團隊而言,答案並非二選一:把 Rosalind 留給它受訓時所針對的探索性問題,其餘的則透過像 Claude Opus 5 這樣的通用模型來處理——單一 API、零加成、故障轉移,讓同時運行兩者變得切實可行。

本文中的比較1

根據本文內容識別 · 基準測試:Artificial Analysis · 每日更新