Gerangschikt op basis van echt productieverkeer van OrcaRouter en communitystemmen in Battle Mode — niet op door leveranciers gerapporteerde benchmarks.
Bijgewerkt op 2026-08-095 bewijsbronnenNieuwe modellen binnen 48 u gelist
Gemeten op echt verkeer
100.0%
Hoogste succespercentage (7 d)
openai/gpt-4-turbo-2024-04-09
450 ms
Snelste p50-latentie
OpenAI: GPT-4o (2024-08-06)
80.1%
Hoogste community-winratio
Qwen3.7 Max (2026-05-20)
Geconsolideerde ranglijst
Eén samengevoegde ranglijst per model — LMArena-stemmen, onafhankelijke benchmarks, ecosysteem-adoptie en productiegegevens van OrcaRouter, met vaste openbare gewichten. Nieuwe modellen komen vanaf dag één binnen op basis van extern bewijs.
Paarsgewijze winstpercentages in Battle Mode — hoe vaak elk model elke rivaal in een direct duel verslaat.
Benchmarks — intelligentie versus prijs
Onafhankelijke intelligentiescores uitgezet tegen de invoerprijs. De stippellijn is de Pareto-grens van prijs/intelligentie.
Blind duel
Twee anonieme antwoorden, één stem. Jouw battles voeden de 20% productiebewijs in de geconsolideerde rang.
⚔️ Blind duel
Twee anonieme modellen beantwoorden dezelfde prompt. Lees beide, stem op de winnaar en zie dan wie wat schreef — je stem telt mee voor de ranglijst hierboven.
Methodologie — hoe dit leaderboard werkt
Elk getal op deze pagina is gemeten, nooit zelfgerapporteerd. Dit is de volledige methode achter de samengevoegde rang — dezelfde regels voor elk model, elke dag.
Eén gecombineerde score, vaste openbare gewichten
Elk model krijgt een compositescore uit vier onafhankelijke bewijsfamilies: blinde menselijke voorkeur 40%, onafhankelijke benchmarks 30%, productiebewijs van OrcaRouter 20% en ecosysteem-adoptie 10%. De gewichten zijn vast en openbaar — geen redactionele aanpassingen, geen betaalde plaatsing, geen inzendingen van leveranciers.
Wat elke familie voedt
Menselijke voorkeur komt van LMArena’s community-Elo — blinde paarsgewijze stemmen in de tekst- en visionarena’s (CC-BY-4.0). Onafhankelijke benchmarks combineren Artificial Analysis (Intelligence Index plus coderen, wiskunde, GPQA Diamond en τ²-Bench) met SWE-bench Verified, het aandeel echte GitHub-issues dat een model oplost. Productiebewijs is van OrcaRouter zelf: Blind Battle-winstpercentages plus live gateway-telemetrie — succesratio, latentie en gerouteerd tokenvolume. Adoptie gebruikt het door OpenRouter gepubliceerde tokenaandeel.
Hoe scores vergelijkbaar worden
Bronnen scoren op verschillende schalen (Elo, 0–100-indexen, opgelost-%), dus elk signaal wordt gestandaardiseerd tegen het huidige bord en afgebeeld op 0–100: 50 is het bordgemiddelde en elke 15 punten is één standaardafwijking, begrensd aan de uiteinden. Een model heeft minstens twee onafhankelijke bewijsfamilies nodig om überhaupt te ranken, en het bord toont de top 25 op compositescore.
Borden per gebruikssituatie
De borden voor tekst, coderen, vision, wiskunde, redeneren en agents draaien dezelfde mix opnieuw op segmentgeschikte signalen — coderen wisselt naar de codeerbenchmarks en SWE-bench Verified, vision gebruikt LMArena’s visionarena — en Blind Battles koppelen uitsluitend modellen binnen hetzelfde segment.
Versheid en fair play
Externe feeds verversen dagelijks en eigen telemetrie is live; nieuwe modellen komen binnen 48 uur na release binnen op extern bewijs. Nergens worden zelfgerapporteerde leverancierscijfers gebruikt, community-buzz wordt alleen als context getoond en voedt nooit een rang, en elke externe bron wordt onder het bord vermeld.
Veelgestelde vragen
Hoe wordt de AI-modellenranglijst berekend?
Elk model krijgt één gecombineerde score uit vier bewijsfamilies — blinde menselijke voorkeur (LMArena), onafhankelijke benchmarks (Artificial Analysis, SWE-bench), productiebetrouwbaarheid van OrcaRouter en ecosysteem-adoptie (OpenRouter) — met vaste openbare gewichten 40 / 30 / 20 / 10.
Waarom heeft een gloednieuw model al een rang?
Nieuwe modellen komen binnen 48 uur na release op het bord op basis van extern bewijs. De rang wordt steviger naarmate communitybattles en productieverkeer zich opstapelen.
Hoe vaak wordt de ranglijst bijgewerkt?
Externe feeds verversen dagelijks en OrcaRouter-telemetrie is live; de bijwerkdatum staat bovenaan.
Waarom ontbreekt een model?
Een model heeft minstens twee onafhankelijke bewijsbronnen nodig om gerangschikt te worden, en het bord toont de top 25 op samengestelde score — modellen met te weinig bewijs blijven ongelist tot een extra bron ze dekt.
Worden use-cases apart gerangschikt?
Ja — de knoppen boven de samengevoegde tabel wisselen tussen tekst-, coding-, vision-, wiskunde-, redeneer- en agent-borden, en battles koppelen alleen vergelijkbare modellen.
Wanneer wordt de rang van een nieuw model stevig?
Zodra een model drie bewijsfamilies heeft, waaronder OrcaRouters eigen battle- en verkeersgegevens, rust zijn rang op de volledige mix in plaats van alleen op extern bewijs.
Waar komen de data vandaan?
LMArena (CC-BY-4.0), Artificial Analysis, SWE-bench en OpenRouter-rankings, plus OrcaRouter-productietelemetrie — alles geattribueerd onder het bord.
Kunnen leveranciers de ranglijst manipuleren?
Lastig: de gewichten zijn openbaar, er worden geen zelfgerapporteerde cijfers gebruikt, en blinde battles plus echt verkeer verankeren elke score.
Kan ik deze data exporteren of insluiten?
Ja — JSON/CSV-export, een insluitbare rangbadge en een RSS-feed van rangwijzigingen zijn gratis met bronvermelding. Links staan in de footer.