Classé selon le trafic de production réel d’OrcaRouter et les votes communautaires du Battle Mode — et non sur des benchmarks fournis par les éditeurs.
Mis à jour le 2026-08-095 sources de preuvesNouveaux modèles listés sous 48 h
Mesuré sur du trafic réel
100.0%
Meilleur taux de réussite (7 j)
openai/gpt-4-turbo-2024-04-09
450 ms
Latence p50 la plus rapide
OpenAI: GPT-4o (2024-08-06)
80.1%
Meilleur taux de victoire communautaire
Qwen3.7 Max (2026-05-20)
Classement consolidé
Un classement fusionné par modèle — votes LMArena, benchmarks indépendants, adoption de l'écosystème et données de production OrcaRouter, avec des pondérations publiques fixes. Les nouveaux modèles entrent dès le premier jour sur la base de preuves externes.
Taux de victoire en duel du Battle Mode — à quelle fréquence chaque modèle bat chaque rival en face-à-face.
Benchmarks — intelligence et prix
Scores d’intelligence indépendants tracés par rapport au prix d’entrée. La ligne en pointillés est la frontière de Pareto prix/intelligence.
Duel à l’aveugle
Deux réponses anonymes, un vote. Vos batailles alimentent les 20 % de preuves de production du classement consolidé.
⚔️ Duel à l’aveugle
Deux modèles anonymes répondent à la même requête. Lisez les deux, votez pour le gagnant, puis découvrez qui a écrit quoi — votre vote alimente le classement ci-dessus.
Méthodologie — comment fonctionne ce classement
Chaque chiffre de cette page est mesuré, jamais auto-déclaré. Voici la méthode complète derrière le classement fusionné — les mêmes règles pour chaque modèle, chaque jour.
Un score fusionné, des pondérations publiques fixes
Chaque modèle reçoit un score composite issu de quatre familles de preuves indépendantes : préférence humaine en aveugle 40 %, benchmarks indépendants 30 %, preuves de production OrcaRouter 20 % et adoption de l’écosystème 10 %. Les pondérations sont fixes et publiques — aucun ajustement éditorial, aucun placement payant, aucune soumission d’éditeur.
Ce qui alimente chaque famille
La préférence humaine vient de l’Elo communautaire de LMArena — votes par paires en aveugle sur les arènes texte et vision (CC-BY-4.0). Les benchmarks indépendants combinent Artificial Analysis (Intelligence Index plus code, maths, GPQA Diamond et τ²-Bench) avec SWE-bench Verified, la part de vrais tickets GitHub résolus. Les preuves de production sont propres à OrcaRouter : taux de victoire en Blind Battle plus télémétrie en direct de la passerelle — taux de succès, latence et volume de tokens routés. L’adoption utilise la part de tokens publiée par OpenRouter.
Comment les scores deviennent comparables
Les sources notent sur des échelles différentes (Elo, indices 0–100, % résolus) ; chaque signal est donc standardisé par rapport au tableau actuel et projeté sur 0–100 : 50 est la moyenne du tableau et chaque tranche de 15 points vaut un écart-type, borné aux extrêmes. Un modèle doit réunir au moins deux familles de preuves indépendantes pour être classé, et le tableau liste le top 25 par score composite.
Des classements par cas d’usage
Les tableaux texte, code, vision, maths, raisonnement et agents relancent la même fusion sur des signaux adaptés au segment — le code substitue les benchmarks de code et SWE-bench Verified, la vision utilise l’arène vision de LMArena — et les Blind Battles n’opposent que des modèles du même segment.
Fraîcheur et fair-play
Les flux externes se rafraîchissent chaque jour et la télémétrie interne est en direct ; les nouveaux modèles entrent sur preuves externes sous 48 heures. Aucun chiffre auto-déclaré n’est utilisé, le buzz communautaire est affiché comme contexte mais n’alimente jamais un rang, et chaque source externe est créditée sous le tableau.
Questions fréquentes
Comment le classement des modèles IA est-il établi ?
Chaque modèle reçoit un score fusionné issu de quatre familles de preuves — préférence humaine en aveugle (LMArena), benchmarks indépendants (Artificial Analysis, SWE-bench), fiabilité de production OrcaRouter et adoption de l'écosystème (OpenRouter) — pondérées 40 / 30 / 20 / 10.
Pourquoi un tout nouveau modèle a-t-il déjà un rang ?
Les nouveaux modèles entrent au classement à partir de preuves externes dans les 48 heures suivant leur sortie. Le rang se consolide à mesure que les batailles communautaires et le trafic de production s'accumulent.
À quelle fréquence le classement est-il mis à jour ?
Les flux externes se rafraîchissent chaque jour et la télémétrie OrcaRouter est en direct ; la date de mise à jour figure en tête de page.
Pourquoi un modèle est-il absent ?
Un modèle doit disposer d'au moins deux sources de preuves indépendantes pour être classé, et le tableau affiche le top 25 au score composite — les modèles aux preuves insuffisantes restent non listés jusqu'à ce qu'une nouvelle source les couvre.
Les cas d'usage sont-ils classés séparément ?
Oui — les boutons au-dessus du tableau consolidé basculent entre les classements texte, code, vision, mathématiques, raisonnement et agents, et les batailles n'opposent que des modèles comparables.
Quand le rang d'un nouveau modèle se consolide-t-il ?
Dès qu'un modèle réunit trois familles de preuves, dont les données de bataille et de trafic propres à OrcaRouter, son rang repose sur la fusion complète et non plus sur les seules preuves externes.
D'où viennent les données ?
LMArena (CC-BY-4.0), Artificial Analysis, SWE-bench et OpenRouter, plus la télémétrie de production OrcaRouter — tout est attribué sous le tableau.
Les éditeurs peuvent-ils truquer le classement ?
Difficile : poids publics, aucune donnée auto-déclarée, et les batailles à l'aveugle plus le trafic réel ancrent chaque score.
Puis-je exporter ou intégrer ces données ?
Oui — export JSON/CSV, badge de rang intégrable et flux RSS des changements de rang, gratuits avec attribution. Liens en pied de page.