Classement des modèles d’IA

Classé selon le trafic de production réel d’OrcaRouter et les votes communautaires du Battle Mode — et non sur des benchmarks fournis par les éditeurs.

Mis à jour le 2026-08-095 sources de preuvesNouveaux modèles listés sous 48 h
Mesuré sur du trafic réel
100.0%
Meilleur taux de réussite (7 j)
openai/gpt-4-turbo-2024-04-09
450 ms
Latence p50 la plus rapide
OpenAI: GPT-4o (2024-08-06)
80.1%
Meilleur taux de victoire communautaire
Qwen3.7 Max (2026-05-20)

Classement consolidé

Un classement fusionné par modèle — votes LMArena, benchmarks indépendants, adoption de l'écosystème et données de production OrcaRouter, avec des pondérations publiques fixes. Les nouveaux modèles entrent dès le premier jour sur la base de preuves externes.

RangModèleScore compositeFiabilité$/1M mixteVolumeMomentumPreuves
#1Anthropic: Claude Opus 574.299.77% · 3883ms$15.00$5 → $25 per 1M tokens<1%AA 63.1Indice d'intelligence Artificial Analysis — benchmark composite indépendant (0–100).OR 1.9%Part de tokens OpenRouter — adoption réelle de l'écosystème.
#2OpenAI: GPT-5.6 Luna73.899.44% · 3256ms$0.70$0.2 → $1.2 per 1M tokens12%AA 52.3Indice d'intelligence Artificial Analysis — benchmark composite indépendant (0–100).OR 6.7%Part de tokens OpenRouter — adoption réelle de l'écosystème.
#3OpenAI: GPT-5.4 Pro72.299.25% · 9000ms$165.00$60 → $270 per 1M tokens<1%AA 66.0Indice d'intelligence Artificial Analysis — benchmark composite indépendant (0–100).Win 58.7%Taux de victoire Blind Battle OrcaRouter — votes à l'aveugle de notre communauté.
#4MoonshotAI: Kimi K372.299.40% · 7738ms$9.00$3 → $15 per 1M tokens8%AA 59.7Indice d'intelligence Artificial Analysis — benchmark composite indépendant (0–100).OR 2.0%Part de tokens OpenRouter — adoption réelle de l'écosystème.
#5Z.ai: GLM 5.271.699.62% · 5211ms$2.90$1.4 → $4.4 per 1M tokens3%AA 52.6Indice d'intelligence Artificial Analysis — benchmark composite indépendant (0–100).OR 4.9%Part de tokens OpenRouter — adoption réelle de l'écosystème.Win 63.6%Taux de victoire Blind Battle OrcaRouter — votes à l'aveugle de notre communauté.
#6OpenAI: GPT-5.6 Sol69.899.34% · 6136ms$17.50$5 → $30 per 1M tokens<1%AA 60.9Indice d'intelligence Artificial Analysis — benchmark composite indépendant (0–100).OR 0.9%Part de tokens OpenRouter — adoption réelle de l'écosystème.
#7Qwen3.7 Max (2026-05-20)69.299.14% · 10000ms$2.50$1.25 → $3.75 per 1M tokens<1%AA 46.7Indice d'intelligence Artificial Analysis — benchmark composite indépendant (0–100).OR 0.1%Part de tokens OpenRouter — adoption réelle de l'écosystème.Win 80.1%Taux de victoire Blind Battle OrcaRouter — votes à l'aveugle de notre communauté.
#8OpenAI: GPT-5.6 Terra68.099.94% · 2586ms$7.00$2 → $12 per 1M tokens16%AA 56.6Indice d'intelligence Artificial Analysis — benchmark composite indépendant (0–100).OR 1.2%Part de tokens OpenRouter — adoption réelle de l'écosystème.
#9Anthropic: Claude Fable 567.399.41% · 4144ms$30.00$10 → $50 per 1M tokens<1%Arena 1494Elo communautaire LMArena — votes humains à l'aveugle, arène texte (CC-BY-4.0).AA 62.1Indice d'intelligence Artificial Analysis — benchmark composite indépendant (0–100).OR 0.3%Part de tokens OpenRouter — adoption réelle de l'écosystème.
#10Google: Gemini 3.6 Flash66.699.35% · 3928ms$4.50$1.5 → $7.5 per 1M tokens<1%Arena 1480Elo communautaire LMArena — votes humains à l'aveugle, arène texte (CC-BY-4.0).AA 51.6Indice d'intelligence Artificial Analysis — benchmark composite indépendant (0–100).OR 3.5%Part de tokens OpenRouter — adoption réelle de l'écosystème.

LMArena leaderboard dataset (CC-BY-4.0) — lmarena.ai · Source: OpenRouter (openrouter.ai/rankings) · SWE-bench Verified — swebench.com · Artificial Analysis — artificialanalysis.ai

Part des tokens routés par labo
deepseek 44.8%openai 29.5%tencent 11.0%kimi 7.9%Autres 6.8%
40%
Préférence humaine
LMArena · Bradley–Terry
30%
Benchmarks indépendants
Artificial Analysis · SWE-bench
20%
Preuves de production
OrcaRouter battles & traffic
10%
Adoption de l'écosystème
OpenRouter token share

Duels directs

Taux de victoire en duel du Battle Mode — à quelle fréquence chaque modèle bat chaque rival en face-à-face.

Benchmarks — intelligence et prix

Scores d’intelligence indépendants tracés par rapport au prix d’entrée. La ligne en pointillés est la frontière de Pareto prix/intelligence.

Duel à l’aveugle

Deux réponses anonymes, un vote. Vos batailles alimentent les 20 % de preuves de production du classement consolidé.

⚔️ Duel à l’aveugle

Deux modèles anonymes répondent à la même requête. Lisez les deux, votez pour le gagnant, puis découvrez qui a écrit quoi — votre vote alimente le classement ci-dessus.

Méthodologie — comment fonctionne ce classement

Chaque chiffre de cette page est mesuré, jamais auto-déclaré. Voici la méthode complète derrière le classement fusionné — les mêmes règles pour chaque modèle, chaque jour.

Un score fusionné, des pondérations publiques fixes

Chaque modèle reçoit un score composite issu de quatre familles de preuves indépendantes : préférence humaine en aveugle 40 %, benchmarks indépendants 30 %, preuves de production OrcaRouter 20 % et adoption de l’écosystème 10 %. Les pondérations sont fixes et publiques — aucun ajustement éditorial, aucun placement payant, aucune soumission d’éditeur.

Ce qui alimente chaque famille

La préférence humaine vient de l’Elo communautaire de LMArena — votes par paires en aveugle sur les arènes texte et vision (CC-BY-4.0). Les benchmarks indépendants combinent Artificial Analysis (Intelligence Index plus code, maths, GPQA Diamond et τ²-Bench) avec SWE-bench Verified, la part de vrais tickets GitHub résolus. Les preuves de production sont propres à OrcaRouter : taux de victoire en Blind Battle plus télémétrie en direct de la passerelle — taux de succès, latence et volume de tokens routés. L’adoption utilise la part de tokens publiée par OpenRouter.

Comment les scores deviennent comparables

Les sources notent sur des échelles différentes (Elo, indices 0–100, % résolus) ; chaque signal est donc standardisé par rapport au tableau actuel et projeté sur 0–100 : 50 est la moyenne du tableau et chaque tranche de 15 points vaut un écart-type, borné aux extrêmes. Un modèle doit réunir au moins deux familles de preuves indépendantes pour être classé, et le tableau liste le top 25 par score composite.

Des classements par cas d’usage

Les tableaux texte, code, vision, maths, raisonnement et agents relancent la même fusion sur des signaux adaptés au segment — le code substitue les benchmarks de code et SWE-bench Verified, la vision utilise l’arène vision de LMArena — et les Blind Battles n’opposent que des modèles du même segment.

Fraîcheur et fair-play

Les flux externes se rafraîchissent chaque jour et la télémétrie interne est en direct ; les nouveaux modèles entrent sur preuves externes sous 48 heures. Aucun chiffre auto-déclaré n’est utilisé, le buzz communautaire est affiché comme contexte mais n’alimente jamais un rang, et chaque source externe est créditée sous le tableau.

Questions fréquentes

Comment le classement des modèles IA est-il établi ?

Chaque modèle reçoit un score fusionné issu de quatre familles de preuves — préférence humaine en aveugle (LMArena), benchmarks indépendants (Artificial Analysis, SWE-bench), fiabilité de production OrcaRouter et adoption de l'écosystème (OpenRouter) — pondérées 40 / 30 / 20 / 10.

Pourquoi un tout nouveau modèle a-t-il déjà un rang ?

Les nouveaux modèles entrent au classement à partir de preuves externes dans les 48 heures suivant leur sortie. Le rang se consolide à mesure que les batailles communautaires et le trafic de production s'accumulent.

À quelle fréquence le classement est-il mis à jour ?

Les flux externes se rafraîchissent chaque jour et la télémétrie OrcaRouter est en direct ; la date de mise à jour figure en tête de page.

Pourquoi un modèle est-il absent ?

Un modèle doit disposer d'au moins deux sources de preuves indépendantes pour être classé, et le tableau affiche le top 25 au score composite — les modèles aux preuves insuffisantes restent non listés jusqu'à ce qu'une nouvelle source les couvre.

Les cas d'usage sont-ils classés séparément ?

Oui — les boutons au-dessus du tableau consolidé basculent entre les classements texte, code, vision, mathématiques, raisonnement et agents, et les batailles n'opposent que des modèles comparables.

Quand le rang d'un nouveau modèle se consolide-t-il ?

Dès qu'un modèle réunit trois familles de preuves, dont les données de bataille et de trafic propres à OrcaRouter, son rang repose sur la fusion complète et non plus sur les seules preuves externes.

D'où viennent les données ?

LMArena (CC-BY-4.0), Artificial Analysis, SWE-bench et OpenRouter, plus la télémétrie de production OrcaRouter — tout est attribué sous le tableau.

Les éditeurs peuvent-ils truquer le classement ?

Difficile : poids publics, aucune donnée auto-déclarée, et les batailles à l'aveugle plus le trafic réel ancrent chaque score.

Puis-je exporter ou intégrer ces données ?

Oui — export JSON/CSV, badge de rang intégrable et flux RSS des changements de rang, gratuits avec attribution. Liens en pied de page.

Nouveaux modèles, changements de rang et sorties — suivez-nous :X · @OrcaRouterDiscord