AI-modelranglijst

Gerangschikt op basis van echt productieverkeer van OrcaRouter en communitystemmen in Battle Mode — niet op door leveranciers gerapporteerde benchmarks.

Bijgewerkt op 2026-08-095 bewijsbronnenNieuwe modellen binnen 48 u gelist
Gemeten op echt verkeer
100.0%
Hoogste succespercentage (7 d)
openai/gpt-4-turbo-2024-04-09
450 ms
Snelste p50-latentie
OpenAI: GPT-4o (2024-08-06)
80.1%
Hoogste community-winratio
Qwen3.7 Max (2026-05-20)

Geconsolideerde ranglijst

Eén samengevoegde ranglijst per model — LMArena-stemmen, onafhankelijke benchmarks, ecosysteem-adoptie en productiegegevens van OrcaRouter, met vaste openbare gewichten. Nieuwe modellen komen vanaf dag één binnen op basis van extern bewijs.

RangModelSamengestelde scoreBetrouwbaarheid$/1M gemengdVolumeMomentumBewijs
#1Anthropic: Claude Opus 574.299.77% · 3883ms$15.00$5 → $25 per 1M tokens<1%AA 63.1Artificial Analysis-intelligentie-index — onafhankelijke samengestelde benchmark (0–100).OR 1.9%OpenRouter-tokenaandeel — echte ecosysteemadoptie.
#2OpenAI: GPT-5.6 Luna73.899.44% · 3256ms$0.70$0.2 → $1.2 per 1M tokens12%AA 52.3Artificial Analysis-intelligentie-index — onafhankelijke samengestelde benchmark (0–100).OR 6.7%OpenRouter-tokenaandeel — echte ecosysteemadoptie.
#3OpenAI: GPT-5.4 Pro72.299.25% · 9000ms$165.00$60 → $270 per 1M tokens<1%AA 66.0Artificial Analysis-intelligentie-index — onafhankelijke samengestelde benchmark (0–100).Win 58.7%OrcaRouter Blind-Battle-winratio — blinde stemmen van onze community.
#4MoonshotAI: Kimi K372.299.40% · 7738ms$9.00$3 → $15 per 1M tokens8%AA 59.7Artificial Analysis-intelligentie-index — onafhankelijke samengestelde benchmark (0–100).OR 2.0%OpenRouter-tokenaandeel — echte ecosysteemadoptie.
#5Z.ai: GLM 5.271.699.62% · 5211ms$2.90$1.4 → $4.4 per 1M tokens3%AA 52.6Artificial Analysis-intelligentie-index — onafhankelijke samengestelde benchmark (0–100).OR 4.9%OpenRouter-tokenaandeel — echte ecosysteemadoptie.Win 63.6%OrcaRouter Blind-Battle-winratio — blinde stemmen van onze community.
#6OpenAI: GPT-5.6 Sol69.899.34% · 6136ms$17.50$5 → $30 per 1M tokens<1%AA 60.9Artificial Analysis-intelligentie-index — onafhankelijke samengestelde benchmark (0–100).OR 0.9%OpenRouter-tokenaandeel — echte ecosysteemadoptie.
#7Qwen3.7 Max (2026-05-20)69.299.14% · 10000ms$2.50$1.25 → $3.75 per 1M tokens<1%AA 46.7Artificial Analysis-intelligentie-index — onafhankelijke samengestelde benchmark (0–100).OR 0.1%OpenRouter-tokenaandeel — echte ecosysteemadoptie.Win 80.1%OrcaRouter Blind-Battle-winratio — blinde stemmen van onze community.
#8OpenAI: GPT-5.6 Terra68.099.94% · 2586ms$7.00$2 → $12 per 1M tokens16%AA 56.6Artificial Analysis-intelligentie-index — onafhankelijke samengestelde benchmark (0–100).OR 1.2%OpenRouter-tokenaandeel — echte ecosysteemadoptie.
#9Anthropic: Claude Fable 567.399.41% · 4144ms$30.00$10 → $50 per 1M tokens<1%Arena 1494LMArena-community-Elo — blinde stemmen in de tekstarena (CC-BY-4.0).AA 62.1Artificial Analysis-intelligentie-index — onafhankelijke samengestelde benchmark (0–100).OR 0.3%OpenRouter-tokenaandeel — echte ecosysteemadoptie.
#10Google: Gemini 3.6 Flash66.699.35% · 3928ms$4.50$1.5 → $7.5 per 1M tokens<1%Arena 1480LMArena-community-Elo — blinde stemmen in de tekstarena (CC-BY-4.0).AA 51.6Artificial Analysis-intelligentie-index — onafhankelijke samengestelde benchmark (0–100).OR 3.5%OpenRouter-tokenaandeel — echte ecosysteemadoptie.

LMArena leaderboard dataset (CC-BY-4.0) — lmarena.ai · Source: OpenRouter (openrouter.ai/rankings) · SWE-bench Verified — swebench.com · Artificial Analysis — artificialanalysis.ai

Tokenaandeel per lab
deepseek 44.8%openai 29.5%tencent 11.0%kimi 7.9%Overig 6.8%
40%
Menselijke voorkeur
LMArena · Bradley–Terry
30%
Onafhankelijke benchmarks
Artificial Analysis · SWE-bench
20%
Productiebewijs
OrcaRouter battles & traffic
10%
Ecosysteem-adoptie
OpenRouter token share

Directe duels

Paarsgewijze winstpercentages in Battle Mode — hoe vaak elk model elke rivaal in een direct duel verslaat.

Benchmarks — intelligentie versus prijs

Onafhankelijke intelligentiescores uitgezet tegen de invoerprijs. De stippellijn is de Pareto-grens van prijs/intelligentie.

Blind duel

Twee anonieme antwoorden, één stem. Jouw battles voeden de 20% productiebewijs in de geconsolideerde rang.

⚔️ Blind duel

Twee anonieme modellen beantwoorden dezelfde prompt. Lees beide, stem op de winnaar en zie dan wie wat schreef — je stem telt mee voor de ranglijst hierboven.

Methodologie — hoe dit leaderboard werkt

Elk getal op deze pagina is gemeten, nooit zelfgerapporteerd. Dit is de volledige methode achter de samengevoegde rang — dezelfde regels voor elk model, elke dag.

Eén gecombineerde score, vaste openbare gewichten

Elk model krijgt een compositescore uit vier onafhankelijke bewijsfamilies: blinde menselijke voorkeur 40%, onafhankelijke benchmarks 30%, productiebewijs van OrcaRouter 20% en ecosysteem-adoptie 10%. De gewichten zijn vast en openbaar — geen redactionele aanpassingen, geen betaalde plaatsing, geen inzendingen van leveranciers.

Wat elke familie voedt

Menselijke voorkeur komt van LMArena’s community-Elo — blinde paarsgewijze stemmen in de tekst- en visionarena’s (CC-BY-4.0). Onafhankelijke benchmarks combineren Artificial Analysis (Intelligence Index plus coderen, wiskunde, GPQA Diamond en τ²-Bench) met SWE-bench Verified, het aandeel echte GitHub-issues dat een model oplost. Productiebewijs is van OrcaRouter zelf: Blind Battle-winstpercentages plus live gateway-telemetrie — succesratio, latentie en gerouteerd tokenvolume. Adoptie gebruikt het door OpenRouter gepubliceerde tokenaandeel.

Hoe scores vergelijkbaar worden

Bronnen scoren op verschillende schalen (Elo, 0–100-indexen, opgelost-%), dus elk signaal wordt gestandaardiseerd tegen het huidige bord en afgebeeld op 0–100: 50 is het bordgemiddelde en elke 15 punten is één standaardafwijking, begrensd aan de uiteinden. Een model heeft minstens twee onafhankelijke bewijsfamilies nodig om überhaupt te ranken, en het bord toont de top 25 op compositescore.

Borden per gebruikssituatie

De borden voor tekst, coderen, vision, wiskunde, redeneren en agents draaien dezelfde mix opnieuw op segmentgeschikte signalen — coderen wisselt naar de codeerbenchmarks en SWE-bench Verified, vision gebruikt LMArena’s visionarena — en Blind Battles koppelen uitsluitend modellen binnen hetzelfde segment.

Versheid en fair play

Externe feeds verversen dagelijks en eigen telemetrie is live; nieuwe modellen komen binnen 48 uur na release binnen op extern bewijs. Nergens worden zelfgerapporteerde leverancierscijfers gebruikt, community-buzz wordt alleen als context getoond en voedt nooit een rang, en elke externe bron wordt onder het bord vermeld.

Veelgestelde vragen

Hoe wordt de AI-modellenranglijst berekend?

Elk model krijgt één gecombineerde score uit vier bewijsfamilies — blinde menselijke voorkeur (LMArena), onafhankelijke benchmarks (Artificial Analysis, SWE-bench), productiebetrouwbaarheid van OrcaRouter en ecosysteem-adoptie (OpenRouter) — met vaste openbare gewichten 40 / 30 / 20 / 10.

Waarom heeft een gloednieuw model al een rang?

Nieuwe modellen komen binnen 48 uur na release op het bord op basis van extern bewijs. De rang wordt steviger naarmate communitybattles en productieverkeer zich opstapelen.

Hoe vaak wordt de ranglijst bijgewerkt?

Externe feeds verversen dagelijks en OrcaRouter-telemetrie is live; de bijwerkdatum staat bovenaan.

Waarom ontbreekt een model?

Een model heeft minstens twee onafhankelijke bewijsbronnen nodig om gerangschikt te worden, en het bord toont de top 25 op samengestelde score — modellen met te weinig bewijs blijven ongelist tot een extra bron ze dekt.

Worden use-cases apart gerangschikt?

Ja — de knoppen boven de samengevoegde tabel wisselen tussen tekst-, coding-, vision-, wiskunde-, redeneer- en agent-borden, en battles koppelen alleen vergelijkbare modellen.

Wanneer wordt de rang van een nieuw model stevig?

Zodra een model drie bewijsfamilies heeft, waaronder OrcaRouters eigen battle- en verkeersgegevens, rust zijn rang op de volledige mix in plaats van alleen op extern bewijs.

Waar komen de data vandaan?

LMArena (CC-BY-4.0), Artificial Analysis, SWE-bench en OpenRouter-rankings, plus OrcaRouter-productietelemetrie — alles geattribueerd onder het bord.

Kunnen leveranciers de ranglijst manipuleren?

Lastig: de gewichten zijn openbaar, er worden geen zelfgerapporteerde cijfers gebruikt, en blinde battles plus echt verkeer verankeren elke score.

Kan ik deze data exporteren of insluiten?

Ja — JSON/CSV-export, een insluitbare rangbadge en een RSS-feed van rangwijzigingen zijn gratis met bronvermelding. Links staan in de footer.

Nieuwe modellen, rangwijzigingen en releases — volg ons:X · @OrcaRouterDiscord