一个融合得分,固定公开权重
每个模型的综合得分来自四类独立证据:盲测人类偏好 40%、独立基准测试 30%、OrcaRouter 生产环境证据 20%、生态采用度 10%。权重固定且公开——没有人为调整、没有付费排位、不接受厂商提交。
基于 OrcaRouter 真实生产流量与社区 Battle Mode 投票排名 —— 而非厂商自报的基准测试。
每个模型一个综合排名——LMArena 投票、独立基准测试、生态采用度与 OrcaRouter 生产环境证据,按固定公开权重融合。新模型上线首日即基于外部证据入榜。
| 排名按本分类综合分排序的位置。 | 模型点击进入完整模型页:价格、规格、供应商路由。 | 综合分0–100 融合分:人类偏好 40%、独立基准 30%、OrcaRouter 生产证据 20%、生态采用 10%。 | 可靠性OrcaRouter 网关流量测得的 7 天成功率与中位(p50)延迟。 | $/1M 混合每百万令牌输入/输出价格的平均值;悬停查看精确的输入→输出拆分。 | 速度输出吞吐量(每秒 token 数),基于 OrcaRouter 网关流量(7 天窗口)——总输出 token 数除以总生成时间。条形长度相对于最快的模型。 | 动量社区热度与评分变化——仅供参考,绝不计入排名。 | 证据融合背后的原始信号——悬停任一标签查看其含义。 |
|---|---|---|---|---|---|---|---|
| #1 | OpenAI: GPT-5.4 Pro | 81.1 | 99.46% · 10000ms | $165.00$60 → $270 per 1M tokens | 每秒 132 个 token | — | AA 66.0Artificial Analysis 智能指数——独立综合基准(0–100)。Win 58.7%OrcaRouter 盲测对战胜率——我们自己社区的盲测两两投票。 |
| #2 | DeepSeek: DeepSeek V4.1 Flash | 78.6 | 99.90% · 2532ms | $0.38$0.15 → $0.6 per 1M tokens | 每秒 184 个 token | — | AA 39.5Artificial Analysis 智能指数——独立综合基准(0–100)。OR 13.5%OpenRouter 令牌份额——真实生态采用度。 |
| #3 | OpenAI: GPT-6 Astra | 75.8 | 99.16% · 10000ms | $30.00$10 → $50 per 1M tokens | 每秒 56 个 token | — | AA 52.7Artificial Analysis 智能指数——独立综合基准(0–100)。OR 1.4%OpenRouter 令牌份额——真实生态采用度。 |
| #4 | Anthropic: Claude Opus 5.5 | 73.4 | 100.00% · 10000ms | $12.00$4 → $20 per 1M tokens | 每秒 1784 个 token | — | AA 57.6Artificial Analysis 智能指数——独立综合基准(0–100)。OR 0.0%OpenRouter 令牌份额——真实生态采用度。 |
| #5 | Anthropic: Claude Opus 5 | 72.6 | 99.17% · 6222ms | $15.00$5 → $25 per 1M tokens | 每秒 84 个 token | — | AA 50.8Artificial Analysis 智能指数——独立综合基准(0–100)。OR 0.9%OpenRouter 令牌份额——真实生态采用度。 |
| #6 | Anthropic: Claude Fable 5.1 | 72.3 | 99.26% · 8014ms | $30.00$10 → $50 per 1M tokens | 每秒 61 个 token | — | AA 53.4Artificial Analysis 智能指数——独立综合基准(0–100)。OR 0.4%OpenRouter 令牌份额——真实生态采用度。 |
| #7 | Z.ai: GLM 5.3 | 72.1 | 99.86% · 3910ms | $2.61$1.26 → $3.96 per 1M tokens | 每秒 74 个 token | — | AA 44.8Artificial Analysis 智能指数——独立综合基准(0–100)。OR 2.4%OpenRouter 令牌份额——真实生态采用度。 |
| #8 | OpenAI: GPT-5.6 Luna | 72.1 | 99.88% · 1631ms | $0.70$0.2 → $1.2 per 1M tokens | 每秒 110 个 token | — | AA 37.3Artificial Analysis 智能指数——独立综合基准(0–100)。OR 6.6%OpenRouter 令牌份额——真实生态采用度。 |
| #9 | Z.ai: GLM 5.3 Flash | 71.5 | 99.55% · 6861ms | $0.16$0.075 → $0.25 per 1M tokens | 每秒 93 个 token | — | Arena 1472LMArena 社区 Elo——文本竞技场盲测人类投票(CC-BY-4.0)。AA 41.8Artificial Analysis 智能指数——独立综合基准(0–100)。OR 13.9%OpenRouter 令牌份额——真实生态采用度。 |
| #10 | OpenAI: GPT-5.6 Sol | 71.4 | 99.14% · 10000ms | $12.00$4 → $20 per 1M tokens | 每秒 1625 个 token | — | AA 47.0Artificial Analysis 智能指数——独立综合基准(0–100)。OR 1.4%OpenRouter 令牌份额——真实生态采用度。 |
LMArena leaderboard dataset (CC-BY-4.0) — lmarena.ai · Source: OpenRouter (openrouter.ai/rankings) · SWE-bench Verified — swebench.com · Artificial Analysis — artificialanalysis.ai
Battle Mode 两两对战胜率——每个模型与各个对手正面交锋的获胜频率。
将独立的智能评分与输入价格作图。虚线为价格/智能的帕累托前沿。
两个匿名回答,一次投票。你的对战计入综合排名中 20% 的生产证据权重。
两个匿名模型回答同一个提示词。读完两边再投票,然后揭晓各自是谁——你的投票会计入上方榜单。
本页每个数字都来自实测,绝无厂商自报。以下是综合排名背后的完整方法——对每个模型、每一天都执行同样的规则。
每个模型的综合得分来自四类独立证据:盲测人类偏好 40%、独立基准测试 30%、OrcaRouter 生产环境证据 20%、生态采用度 10%。权重固定且公开——没有人为调整、没有付费排位、不接受厂商提交。
人类偏好来自 LMArena 社区 Elo——文本与视觉竞技场的盲测两两投票(CC-BY-4.0)。独立基准结合 Artificial Analysis(智能指数以及编程、数学、GPQA Diamond 与 τ²-Bench)和 SWE-bench Verified(模型解决真实 GitHub issue 的比例)。生产环境证据来自 OrcaRouter 自身的盲测对战胜率。采用度使用 OpenRouter 公布的 Token 份额。成功率、延迟与吞吐量仅作为参考显示在每个模型旁,从不参与排名。
各来源的量纲不同(Elo、0–100 指数、解决率百分比),因此每个信号都会针对当前榜单标准化并映射到 0–100:50 为榜单平均值,每 15 分代表一个标准差,两端截断。模型至少需要两类独立证据才能入榜,榜单按综合得分列出前 25 名。
文本、编程、视觉、数学、推理与智能体榜单在各自适配的信号上重跑同一套融合——编程分区换用编程基准与 SWE-bench Verified,视觉分区使用 LMArena 视觉竞技场——且盲测对战只在同一分区内配对。
外部数据源每日刷新,第一方遥测实时更新;新模型在发布后 48 小时内基于外部证据入榜。全程不使用任何厂商自报数据,社区热度仅作参考、绝不参与排名,且所有外部来源都在榜单下方注明出处。
每个模型的融合得分来自四类证据——盲测人类偏好(LMArena)、独立基准(Artificial Analysis、SWE-bench)、OrcaRouter 生产可靠性、生态采用度(OpenRouter),按固定公开权重 40 / 30 / 20 / 10 加权。
新模型在发布后 48 小时内即基于外部证据入榜。随着社区对战和生产流量的积累,排名会逐步稳固。
外部数据源每日刷新,OrcaRouter 遥测实时更新;榜单顶部显示最近更新日期。
模型需要至少两个独立证据来源才能上榜,榜单展示综合得分前 25 名——证据不足的模型将保持未上榜,直到有新的来源覆盖它。
是的——综合表格上方的分区按钮可切换文本、编程、视觉、数学、推理与智能体榜单,且对战只在同类模型间配对。
当模型积累了包括 OrcaRouter 自有对战与流量数据在内的三类证据后,其排名将基于完整融合得分,而不再只依赖外部证据。
LMArena(CC-BY-4.0)、Artificial Analysis、SWE-bench、OpenRouter 排名,以及 OrcaRouter 生产遥测——均在榜单下方注明。
很难:权重公开,不采用厂商自报数据,盲测对战与真实流量为每个分数提供锚点。
可以——JSON/CSV 导出、可嵌入的模型排名徽章、排名变动 RSS 均可免费使用(需注明来源),链接见页面底部。