GPT-Rosalind 对阵 Claude Opus 5 的主视觉标题卡,在每百万 token 同为 5 美元/25 美元的定价下,将 OpenAI 的生命科学专用模型与 Anthropic 的通用旗舰模型进行对比。
Guides & Insights

GPT-Rosalind 对比 Claude Opus 5:生命科学专才迎战通用旗舰

作者

Elias Hawthorne

发布日期

最新模型 · 20查看全部模型
基准测试:Artificial Analysis · 每日更新
返回全部文章

2026年9月11日决定让 GPT-Rosalind——OpenAI 专为生命科学打造的推理模型——结束研究预览,这是首次真正有机会将它与通用型前沿模型正面较量,而天然的对手是 Claude Opus 5,即 Anthropic 面向高难度推理、编程与长周期智能体工作的旗舰模型。GPT-Rosalind 通过 OpenAI 的可信访问计划发布,其定价已公布,自 2026 年 10 月 5 日起生效;而 Claude Opus 5 自 2026 年 7 月 24 日起已全面可用,价格为每 100 万 tokens 5.00 美元/25.00 美元。两者都是前沿模型,但为不同的任务而生:Rosalind 面向药物发现、基因组学与实验规划;Opus 5 则面向企业级推理的整个谱系。问题在于,专家模型在生物学上的优势,是否值得让人放弃通用模型的广度。

为什么现在会有这场对决

五个月来,GPT-Rosalind 仅存在于面向少数具名合作伙伴的美国专属可信访问门禁之后——Amgen、Moderna、Allen Institute、Thermo Fisher Scientific。2026 年 9 月 11 日,OpenAI 宣布该模型将结束研究预览,并通过可信访问计划向全球符合条件的企业开放;自 10 月 5 日起,按每 100 万输入 token 5.00 美元、缓存输入 0.50 美元和每 100 万输出 token 25.00 美元计费。这一定价实际上与 Claude Opus 5 的 5.00 美元/25.00 美元一致,使得比较异常清晰:两个前沿模型以相同的 token 价格,一个专用,一个通用。

Rosalind 以罗莎琳德·富兰克林命名,她的 X 射线衍射工作揭示了 DNA 的结构。据 OpenAI 称,该模型本身旨在对分子、蛋白质、基因、通路以及与疾病相关的生物学进行推理,并支持文献综述、序列到功能解读、实验规划和数据分析等多步骤工作流。它是生命科学模型系列中的首个发布版本,并配有面向 Codex 的开源 Life Sciences Research Plugin,可将其连接到 50 多种科学工具和数据源。

记分牌

诚实的第一个观察是,目前没有可对等比较这两个模型的公开基准。GPT-Rosalind 的亮眼数字是由供应商和合作伙伴报告的领域任务评估;Claude Opus 5 有来自 Artificial Analysis 的独立评分,但没有如此深入的已发布生物学领域评估。因此,下面的记分牌明确区分了这两类证据。

价格 — GPT-Rosalind 每 100 万 token 5.00 美元 / 25.00 美元(缓存输入 0.50 美元),自 2026 年 10 月 5 日起生效。Claude Opus 5 每 100 万 token 5.00 美元 / 25.00 美元(缓存读取 0.50 美元,缓存写入 10.00 美元)。标价费率完全相同。

访问权限 — GPT-Rosalind:可信访问申请、资质审核,最初仅限美国,现已面向符合条件的组织全球开放。Claude Opus 5:向任何账户开放 API 访问权限。

AA Intelligence Index —— Claude Opus 5:50.7,在 141 个中位列第 4。GPT-Rosalind:未被收录(专业模型不会出现在通用排行榜上)。

AA Coding — Claude Opus 5:78.0,138 个中排名第 2。GPT-Rosalind:不适用——其领域是湿实验室规划,而非软件工程。

领域评估 — GPT-Rosalind:BixBench 领先(厂商报告),在 11 项 LABBench2 任务中有 6 项优于 GPT-5.4(厂商报告),GeneBench 上每 token 性能提升 53.7%(厂商),MedChemBench 上提升 18.0%,LabWorkBench 上提升 19.6%,LifeSci Bench 上提升 4.42%(均为 OpenAI 报告)。Claude Opus 5:无同类已发布的生命科学评测套件。

上下文窗口 — 两者均为 100 万 tokens。Claude Opus 5 支持文本、图像和文件输入,并输出文本;GPT-Rosalind 则通过 ChatGPT、Codex 和 API 处理科学文件输入。

推理模式 — Claude Opus 5 提供自适应推理(自动、从低到高)。GPT-Rosalind 是一款以工具使用为核心的推理模型,并在 API 中提供类似 reasoning_effort 的控制项。

Comparison scoreboard for GPT-Rosalind and Claude Opus 5: Rosalind $5/$25 cached input $0.50, AA Intelligence not tracked, BixBench leading vendor-reported, trusted access, 50+ tool stack; Opus 5 $5/$25, AA Intelligence 50.7 #4 of 141, no life-sciences suite, open API.

Rosalind的数字实际上意味着什么

被引用最多的 Rosalind 结果来自 Dyno Therapeutics:在一项未公开的 RNA 序列预测任务中,best-of-ten 生成在预测上超越了 57 位人类 AI 生物学专家的第 95 百分位水平,在序列生成上则大致达到第 84 百分位。这是一项针对专有任务的合作方评估,采用 best-of-ten 采样,会提高成本与延迟——它展示的是一个经过大量采样的模型所能达到的上限,而非典型的单次调用体验。OpenAI 自己在公开基准上的评估包括在 BixBench 上取得领先表现,以及在 LABBench2 上以 11 项中胜出 6 项的成绩击败 GPT-5.4,同样带有供应商自报的这一说明。关于幻觉率的说法——通过批判性思维微调,比通用模型低 40%——是 OpenAI 自己的测量结果,尚未被独立复现。

这些数字确实表明,Rosalind 是专门针对生物学研究的运作机制进行调优的:克隆方案设计、RNA 功能预测、靶点优先级排序。而这恰恰是 Claude Opus 5 没有已发表证据的地方,因为它并非为此而构建。因此,这一比较取决于你是在专门为生物学工作选择模型,还是为全方位的推理任务选择模型。

Claude Opus 5 的胜出之处

Screenshot of the Artificial Analysis models leaderboard showing the Intelligence Index rankings where Claude Opus 5 scores 50.7 and GPT-5.6 family and DeepSeek V4 Pro appear.

Claude Opus 5 的独立评测记录全面而深入:在 Artificial Analysis Intelligence Index 上得分 50.7(141 个中第 4),AA Coding 得分 78.0(138 个中第 2),GPQA Diamond 93.2,Humanity's Last Exam 54.9,以及 Long-Context Recall 79.3。它是 Anthropic 能力最强的模型,适用于端到端软件工程、代码审查与缺陷发现,以及视觉分析,专为在涉及大量工具使用的超长、多步骤智能体会话中保持连贯而构建。对于主要工作负载是软件、分析流水线或通用企业推理的团队,基于证据,Opus 5 是更稳妥的选择,而且如今任何拥有 API 密钥的人都可以使用——无需资格审核。

GPT-Rosalind 在哪里胜出

GPT-Rosalind 的优势在于领域深度:其训练与调优针对的是 OpenAI 列出的 50 种生物工作流——证据综合、序列到功能、实验设计、分子候选物比较。在与 Opus 5 相同的每 token 价格下,它提供的模型见识过远为丰富的分子生物学、基因组学和化学专用材料,还配有开箱即用的 Life Sciences 插件,提供 50 多种工具和数据库。对药物化学家或基因组学研究者而言,这就是在相同 token 成本下,才华横溢的通才与领域专家之间的差别。

路由问题

Screenshot of the OrcaRouter model page for Claude Opus 5, showing the $5.00/$25.00 per 1M tokens list price, p50 TTFT 4.73s, and 1M-token context.

这场对比中有一个实际问题:GPT-Rosalind 尚未登陆任何第三方路由平台。访问需直接通过 OpenAI 的可信访问计划。相比之下,Claude Opus 5 则可在 OrcaRouter 上按标价获取——每 100 万 tokens 5.00 美元/25.00 美元,与提供商费率完全一致,0% 加价——通过一个 API 与 200 多个其他模型并列,并具备自动故障转移和用于组合模型的路由 DSL。通过资格审核并获得 Rosalind 密钥的团队,对于其他所有任务,仍可使用 OrcaRouter 绕开它,或使用故障转移,这样如果 Rosalind 的长时间领域调用停滞,请求就会改由一个可用的通用模型处理。这就是坦诚的分工:生物学问题交给 Rosalind,流水线的其余部分交给路由层。

你该选哪个?

如果你的工作是生命科学研究——靶点发现、蛋白质工程、基因组学、实验规划——GPT-Rosalind 是唯一专为此打造的前沿模型,而且在与通用模型相同的 token 价格下,对于这项特定任务它是更优的选择,前提是你的组织通过了可信访问资格审核。如果你的工作是其他任何领域——即便在生物技术实验室里,大部分 token 开销仍然花在代码、数据管线和通用推理上——Claude Opus 5 拥有独立基准记录、开放的 API 访问以及路由生态。专家的优势真实但有限;通用模型的覆盖广泛且可验证。对大多数团队而言,答案不是二选一:把 Rosalind 留给它受过训练的那些发现类问题,其余的都通过像 Claude Opus 5 这样的通用模型来路由——单一 API、零加价和故障转移让同时运行两者变得切实可行。

本文中的对比1

根据本文内容识别 · 基准测试:Artificial Analysis · 每日更新