AI-modellrankning

Rankad efter verklig OrcaRouter-produktionstrafik och röster från gemenskapens Battle Mode — inte leverantörsrapporterade riktmärken.

Uppdaterad 2026-07-245 evidenskällorNya modeller listas inom 48 h
Uppmätt på verklig trafik
100.0%
Högsta lyckandegrad (7 d)
MiniMax M2.7 highspeed
361 ms
Snabbaste p50-latens
OpenAI: GPT-5.1-Codex
80.1%
Högsta vinstfrekvens i gemenskapen
Qwen3.7 Max (2026-05-20)

Sammanslagen ranking

En blandad ranking per modell — LMArena-röster, oberoende benchmarks, ekosystemadoption och OrcaRouters produktionsdata, med fasta publika vikter. Nya modeller kommer in från extern evidens från dag ett.

RankModellSammansattTillförlitlighet$/1M blandatVolymMomentumEvidens
#1Qwen3.7 Max (2026-05-20)75.0100.00% · 3808ms$2.50$1.25 → $3.75 per 1M tokens<1%AA 46.0Artificial Analysis Intelligence Index — oberoende sammansatt benchmark (0–100).Win 80.1%OrcaRouter Blind Battle-vinstfrekvens — vår egen community, blinda parvisa röster.
#2OpenAI: GPT-5.4 Pro73.5100.00% · 1046ms$165.00$60 → $270 per 1M tokens<1%AA 66.0Artificial Analysis Intelligence Index — oberoende sammansatt benchmark (0–100).Win 58.7%OrcaRouter Blind Battle-vinstfrekvens — vår egen community, blinda parvisa röster.
#3Z.ai: GLM 5.267.999.21% · 6587ms$2.90$1.4 → $4.4 per 1M tokens6%AA 51.1Artificial Analysis Intelligence Index — oberoende sammansatt benchmark (0–100).Win 63.4%OrcaRouter Blind Battle-vinstfrekvens — vår egen community, blinda parvisa röster.
#4DeepSeek: DeepSeek V4 Pro66.899.67% · 894ms$0.66$0.442 → $0.884 per 1M tokens26%AA 44.3Artificial Analysis Intelligence Index — oberoende sammansatt benchmark (0–100).Win 67.9%OrcaRouter Blind Battle-vinstfrekvens — vår egen community, blinda parvisa röster.
#5Google: Nano Banana 2 (Gemini 3.1 Flash Image Preview)65.199.48%<1%AA 53.8Artificial Analysis Intelligence Index — oberoende sammansatt benchmark (0–100).Win 56.1%OrcaRouter Blind Battle-vinstfrekvens — vår egen community, blinda parvisa röster.
#6Anthropic: Claude Opus 4.862.599.97% · 7426ms$15.00$5 → $25 per 1M tokens1%AA 55.7Artificial Analysis Intelligence Index — oberoende sammansatt benchmark (0–100).Win 50.0%OrcaRouter Blind Battle-vinstfrekvens — vår egen community, blinda parvisa röster.
#7OpenAI: GPT-5.4 Nano62.3100.00% · 1458ms$0.72$0.2 → $1.25 per 1M tokens<1%AA 38.2Artificial Analysis Intelligence Index — oberoende sammansatt benchmark (0–100).Win 66.2%OrcaRouter Blind Battle-vinstfrekvens — vår egen community, blinda parvisa röster.
#8OpenAI: GPT-5.562.099.88% · 7726ms$17.50$5 → $30 per 1M tokens1%AA 54.8Artificial Analysis Intelligence Index — oberoende sammansatt benchmark (0–100).Win 50.0%OrcaRouter Blind Battle-vinstfrekvens — vår egen community, blinda parvisa röster.
#9Anthropic: Claude Opus 4.761.3100.00% · 7256ms$15.00$5 → $25 per 1M tokens1%AA 53.5Artificial Analysis Intelligence Index — oberoende sammansatt benchmark (0–100).Win 50.0%OrcaRouter Blind Battle-vinstfrekvens — vår egen community, blinda parvisa röster.
#10OpenAI: GPT-5.460.2100.00% · 6666ms$13.75$5 → $22.5 per 1M tokens<1%AA 51.4Artificial Analysis Intelligence Index — oberoende sammansatt benchmark (0–100).Win 50.2%OrcaRouter Blind Battle-vinstfrekvens — vår egen community, blinda parvisa röster.

LMArena leaderboard dataset (CC-BY-4.0) — lmarena.ai · Source: OpenRouter (openrouter.ai/rankings) · SWE-bench Verified — swebench.com · Artificial Analysis — artificialanalysis.ai

Andel dirigerade tokens per labb
deepseek 53.3%openai 19.3%kimi 9.2%z-ai 6.1%Övriga 12.1%
40%
Mänsklig preferens
LMArena · Bradley–Terry
30%
Oberoende benchmarks
Artificial Analysis · SWE-bench
20%
Produktionsdata
OrcaRouter battles & traffic
10%
Ekosystemadoption
OpenRouter token share

Direkt duell

Vinstfrekvenser parvis från Battle Mode — hur ofta varje modell besegrar varje rival i en direkt duell.

Benchmarks — intelligens vs pris

Oberoende intelligenspoäng plottade mot inputpris. Den streckade linjen är Pareto-fronten för pris/intelligens.

Blind Battle

Två anonyma svar, en röst. Dina dueller bidrar till de 20 % produktionsevidens-vikten i den sammanslagna rankningen.

⚔️ Blind Battle

Två anonyma modeller svarar på samma prompt. Läs båda, rösta på vinnaren och se sedan vem som skrev vad — din röst påverkar rankningen ovan.

Metodik — hur den här topplistan fungerar

Varje siffra på den här sidan är uppmätt, aldrig självrapporterad. Det här är den fullständiga metoden bakom den sammanslagna rankningen — samma regler för varje modell, varje dag.

En blandad poäng, fasta publika vikter

Varje modell får en sammansatt poäng från fyra oberoende evidensfamiljer: blind mänsklig preferens 40 %, oberoende benchmarks 30 %, OrcaRouters produktionsdata 20 % och ekosystemadoption 10 %. Vikterna är fasta och publika — inga redaktionella justeringar, ingen betald placering, inga leverantörsinlämningar.

Vad som föder varje familj

Mänsklig preferens kommer från LMArenas community Elo — blinda parvisa röster i text- och vision-arenorna (CC-BY-4.0). Oberoende benchmarks kombinerar Artificial Analysis (Intelligence Index plus kodning, matematik, GPQA Diamond och τ²-Bench) med SWE-bench Verified, andelen verkliga GitHub-ärenden en modell löser. Produktionsdata är OrcaRouters egen: Blind Battle-vinstfrekvenser plus levande gateway-telemetri — framgångsfrekvens, latens och volym dirigerade tokens. Adoption använder OpenRouters publicerade tokenandel.

Hur poäng blir jämförbara

Källor har poäng på olika skalor (Elo, 0–100-index, löst-%), så varje signal standardiseras mot den aktuella topplistan och mappas till 0–100: 50 är topplistans genomsnitt och varje 15 poäng är en standardavvikelse, klämd vid ytterligheterna. En modell behöver minst två oberoende evidensfamiljer för att rankas alls, och topplistan listar de 25 bästa efter sammansatt poäng.

Topplistor per användningsområde

Topplistorna för text, kodning, syn, matematik, resonemang och agentiskt arbete kör om samma blandning över segmentanpassade signaler — kodning byter till kodningsbenchmarksen och SWE-bench Verified, syn använder LMArenas vision-arena — och Blind Battles parar bara ihop modeller inom samma segment.

Aktualitet och rent spel

Externa flöden uppdateras dagligen och förstapartstelemetrin är live; nya modeller kommer in från extern evidens inom 48 timmar efter release. Inga självrapporterade leverantörssiffror används någonstans, community-uppmärksamhet visas som kontext men matas aldrig in i en ranking, och varje extern källa källhänvisas under topplistan.

Vanliga frågor

Hur rankas AI-modell-topplistan?

Varje modell får en blandad poäng från fyra evidensfamiljer — blind mänsklig preferens (LMArena), oberoende benchmarks (Artificial Analysis, SWE-bench), OrcaRouters produktionstillförlitlighet och ekosystemadoption (OpenRouter) — kombinerade med fasta publika vikter på 40 / 30 / 20 / 10.

Varför har en helt ny modell redan en ranking?

Nya modeller kommer in på topplistan från extern evidens inom 48 timmar efter release. Rankningen befästs allt eftersom community-dueller och produktionstrafik ackumuleras.

Hur ofta uppdateras topplistan?

Externa flöden uppdateras dagligen och OrcaRouters telemetri är live; topplistan visar sitt senast uppdaterade datum i sidhuvudet.

Varför saknas en modell på topplistan?

En modell behöver minst två oberoende evidenskällor för att rankas, och topplistan listar de 25 bästa efter sammansatt poäng — modeller med tunnare evidens förblir olistade tills en annan källa plockar upp dem.

Rankas olika användningsområden separat?

Ja — knapparna ovanför den sammanslagna tabellen växlar mellan topplistor för text, kodning, syn, matematik, resonemang och agentiskt arbete, och dueller parar bara ihop liknande modeller.

När befästs en ny modells ranking?

När en modell har tre evidensfamiljer, inklusive OrcaRouters egna dueller och trafikdata, vilar dess ranking på hela blandningen snarare än enbart extern evidens.

Var kommer datan ifrån?

LMArena (CC-BY-4.0), Artificial Analysis, SWE-bench och OpenRouter-rankningar, plus OrcaRouters produktionstelemetri — allt källhänvisat under topplistan.

Kan leverantörer manipulera den här rankningen?

Svårt: vikterna är publika, inga självrapporterade siffror används, och blinda community-dueller plus levande trafik förankrar varje poäng.

Kan jag exportera eller bädda in den här datan?

Ja — JSON- och CSV-export, en inbäddningsbar rankningsbadge per modell och ett RSS-flöde med rankningsändringar är gratis med källhänvisning. Länkar finns i sidfoten nedan.

Nya modeller, rankningsändringar och avhopp — följ med:X · @OrcaRouterDiscord