AI 模型排行榜

基于 OrcaRouter 真实生产流量与社区 Battle Mode 投票排名 —— 而非厂商自报的基准测试。

更新于 2026-08-255 个证据来源新模型 48 小时内上榜
基于真实流量测量
0.0%
最高成功率(7 天)
暂无数据
0 ms
最快 p50 延迟
暂无数据
80.1%
最高社区胜率
Qwen3.7 Max (2026-05-20)

综合排名

每个模型一个综合排名——LMArena 投票、独立基准测试、生态采用度与 OrcaRouter 生产环境证据,按固定公开权重融合。新模型上线首日即基于外部证据入榜。

排名模型综合分可靠性$/1M 混合用量动量证据
#1DeepSeek: DeepSeek V4 Flash80.2$0.22$0.147 → $0.295 per 1M tokens19%GPQA 90.8GPQA Diamond——研究生级推理题,来自 Artificial Analysis。OR 16.5%OpenRouter 令牌份额——真实生态采用度。
#2Tencent: Hy372.7$0.39$0.18 → $0.59 per 1M tokens7%GPQA 89.7GPQA Diamond——研究生级推理题,来自 Artificial Analysis。OR 6.9%OpenRouter 令牌份额——真实生态采用度。
#3OpenAI: GPT-5.6 Luna69.8$0.70$0.2 → $1.2 per 1M tokens17%GPQA 91.1GPQA Diamond——研究生级推理题,来自 Artificial Analysis。OR 4.0%OpenRouter 令牌份额——真实生态采用度。
#4DeepSeek: DeepSeek V4 Pro68.4$0.66$0.442 → $0.884 per 1M tokens5%GPQA 92.8GPQA Diamond——研究生级推理题,来自 Artificial Analysis。OR 2.7%OpenRouter 令牌份额——真实生态采用度。
#5Z.ai: GLM 5.267.1$2.90$1.4 → $4.4 per 1M tokens1%GPQA 89.5GPQA Diamond——研究生级推理题,来自 Artificial Analysis。OR 3.1%OpenRouter 令牌份额——真实生态采用度。
#6OpenAI: GPT-5.6 Sol65.7$12.00$4 → $20 per 1M tokens<1%GPQA 94.1GPQA Diamond——研究生级推理题,来自 Artificial Analysis。OR 1.4%OpenRouter 令牌份额——真实生态采用度。
#7MiniMax: MiniMax M365.3$0.75$0.3 → $1.2 per 1M tokens<1%GPQA 92.9GPQA Diamond——研究生级推理题,来自 Artificial Analysis。OR 1.6%OpenRouter 令牌份额——真实生态采用度。
#8Anthropic: Claude Opus 565.2$15.00$5 → $25 per 1M tokens<1%GPQA 93.2GPQA Diamond——研究生级推理题,来自 Artificial Analysis。OR 1.5%OpenRouter 令牌份额——真实生态采用度。
#9MoonshotAI: Kimi K365.0$9.90$3.3 → $16.5 per 1M tokens3%GPQA 93.5GPQA Diamond——研究生级推理题,来自 Artificial Analysis。OR 1.4%OpenRouter 令牌份额——真实生态采用度。
#10Anthropic: Claude Sonnet 562.3$6.00$2 → $10 per 1M tokens<1%GPQA 91.1GPQA Diamond——研究生级推理题,来自 Artificial Analysis。OR 1.1%OpenRouter 令牌份额——真实生态采用度。

LMArena leaderboard dataset (CC-BY-4.0) — lmarena.ai · Source: OpenRouter (openrouter.ai/rankings) · SWE-bench Verified — swebench.com · Artificial Analysis — artificialanalysis.ai

各厂商路由令牌份额
deepseek 52.0%openai 24.3%tencent 7.2%obsidian 7.1%其他 9.3%
40%
人类偏好
LMArena · Bradley–Terry
30%
独立基准测试
Artificial Analysis · SWE-bench
20%
生产环境证据
OrcaRouter battles & traffic
10%
生态采用度
OpenRouter token share

正面对战

Battle Mode 两两对战胜率——每个模型与各个对手正面交锋的获胜频率。

基准评测——智能水平与价格

将独立的智能评分与输入价格作图。虚线为价格/智能的帕累托前沿。

盲测对战

两个匿名回答,一次投票。你的对战计入综合排名中 20% 的生产证据权重。

⚔️ 盲测对战

两个匿名模型回答同一个提示词。读完两边再投票,然后揭晓各自是谁——你的投票会计入上方榜单。

方法论——这个排行榜如何运作

本页每个数字都来自实测,绝无厂商自报。以下是综合排名背后的完整方法——对每个模型、每一天都执行同样的规则。

一个融合得分,固定公开权重

每个模型的综合得分来自四类独立证据:盲测人类偏好 40%、独立基准测试 30%、OrcaRouter 生产环境证据 20%、生态采用度 10%。权重固定且公开——没有人为调整、没有付费排位、不接受厂商提交。

各类证据的来源

人类偏好来自 LMArena 社区 Elo——文本与视觉竞技场的盲测两两投票(CC-BY-4.0)。独立基准结合 Artificial Analysis(智能指数以及编程、数学、GPQA Diamond 与 τ²-Bench)和 SWE-bench Verified(模型解决真实 GitHub issue 的比例)。生产环境证据来自 OrcaRouter 自身:盲测对战胜率加实时网关遥测——成功率、延迟与路由 Token 用量。采用度使用 OpenRouter 公布的 Token 份额。

如何让得分可比

各来源的量纲不同(Elo、0–100 指数、解决率百分比),因此每个信号都会针对当前榜单标准化并映射到 0–100:50 为榜单平均值,每 15 分代表一个标准差,两端截断。模型至少需要两类独立证据才能入榜,榜单按综合得分列出前 25 名。

按用例分区的榜单

文本、编程、视觉、数学、推理与智能体榜单在各自适配的信号上重跑同一套融合——编程分区换用编程基准与 SWE-bench Verified,视觉分区使用 LMArena 视觉竞技场——且盲测对战只在同一分区内配对。

新鲜度与公平性

外部数据源每日刷新,第一方遥测实时更新;新模型在发布后 48 小时内基于外部证据入榜。全程不使用任何厂商自报数据,社区热度仅作参考、绝不参与排名,且所有外部来源都在榜单下方注明出处。

常见问题

AI 模型排行榜如何排名?

每个模型的融合得分来自四类证据——盲测人类偏好(LMArena)、独立基准(Artificial Analysis、SWE-bench)、OrcaRouter 生产可靠性、生态采用度(OpenRouter),按固定公开权重 40 / 30 / 20 / 10 加权。

为什么新发布的模型已经有排名?

新模型在发布后 48 小时内即基于外部证据入榜。随着社区对战和生产流量的积累,排名会逐步稳固。

排行榜多久更新一次?

外部数据源每日刷新,OrcaRouter 遥测实时更新;榜单顶部显示最近更新日期。

为什么某个模型不在榜上?

模型需要至少两个独立证据来源才能上榜,榜单展示综合得分前 25 名——证据不足的模型将保持未上榜,直到有新的来源覆盖它。

不同使用场景会分开排名吗?

是的——综合表格上方的分区按钮可切换文本、编程、视觉、数学、推理与智能体榜单,且对战只在同类模型间配对。

新模型的排名何时稳固?

当模型积累了包括 OrcaRouter 自有对战与流量数据在内的三类证据后,其排名将基于完整融合得分,而不再只依赖外部证据。

数据来自哪里?

LMArena(CC-BY-4.0)、Artificial Analysis、SWE-bench、OpenRouter 排名,以及 OrcaRouter 生产遥测——均在榜单下方注明。

厂商能刷榜吗?

很难:权重公开,不采用厂商自报数据,盲测对战与真实流量为每个分数提供锚点。

可以导出或嵌入这些数据吗?

可以——JSON/CSV 导出、可嵌入的模型排名徽章、排名变动 RSS 均可免费使用(需注明来源),链接见页面底部。

新模型、排名变动与首发——欢迎关注:X · @OrcaRouterDiscord