Eingestuft nach echtem Produktionsverkehr von OrcaRouter und Community-Abstimmungen im Battle Mode — nicht nach herstellereigenen Benchmarks.
Aktualisiert am 2026-08-095 EvidenzquellenNeue Modelle binnen 48 h gelistet
Mit echtem Datenverkehr gemessen
100.0%
Höchste Erfolgsquote (7 Tage)
openai/gpt-4-turbo-2024-04-09
450 ms
Schnellste p50-Latenz
OpenAI: GPT-4o (2024-08-06)
80.1%
Höchste Community-Siegquote
Qwen3.7 Max (2026-05-20)
Konsolidiertes Ranking
Ein zusammengeführtes Ranking pro Modell — LMArena-Stimmen, unabhängige Benchmarks, Ökosystem-Adoption und OrcaRouter-Produktionsdaten mit festen öffentlichen Gewichten. Neue Modelle steigen ab Tag eins auf Basis externer Belege ein.
Paarweise Battle-Mode-Siegquoten – wie oft jedes Modell jeden Rivalen im direkten Vergleich schlägt.
Benchmarks – Intelligenz vs. Preis
Unabhängige Intelligenz-Scores gegen den Eingabepreis aufgetragen. Die gestrichelte Linie ist die Pareto-Front aus Preis und Intelligenz.
Blind-Duell
Zwei anonyme Antworten, eine Stimme. Ihre Battles speisen die 20 % Produktionsevidenz im konsolidierten Rang.
⚔️ Blind-Duell
Zwei anonyme Modelle beantworten denselben Prompt. Lies beide, stimme für den Sieger ab und sieh dann, wer was geschrieben hat — deine Stimme fließt in die Rangliste oben ein.
Methodik — wie dieses Leaderboard funktioniert
Jede Zahl auf dieser Seite ist gemessen, nie selbst gemeldet. Dies ist die vollständige Methode hinter dem zusammengeführten Rang — dieselben Regeln für jedes Modell, jeden Tag.
Ein kombinierter Score, feste öffentliche Gewichte
Jedes Modell erhält einen Composite-Score aus vier unabhängigen Evidenzfamilien: blinde menschliche Präferenz 40 %, unabhängige Benchmarks 30 %, OrcaRouter-Produktionsdaten 20 % und Ökosystem-Adoption 10 %. Die Gewichte sind fest und öffentlich — keine redaktionellen Eingriffe, keine bezahlte Platzierung, keine Hersteller-Einreichungen.
Was jede Familie speist
Die menschliche Präferenz stammt aus LMArenas Community-Elo — blinde Paarvergleiche in der Text- und Vision-Arena (CC-BY-4.0). Unabhängige Benchmarks kombinieren Artificial Analysis (Intelligence Index plus Coding, Mathematik, GPQA Diamond und τ²-Bench) mit SWE-bench Verified, dem Anteil gelöster echter GitHub-Issues. Produktionsdaten sind OrcaRouters eigene: Blind-Battle-Siegquoten plus Live-Gateway-Telemetrie — Erfolgsrate, Latenz und geroutetes Token-Volumen. Adoption nutzt den von OpenRouter veröffentlichten Token-Anteil.
Wie Scores vergleichbar werden
Die Quellen messen auf verschiedenen Skalen (Elo, 0–100-Indizes, Gelöst-%), daher wird jedes Signal am aktuellen Board standardisiert und auf 0–100 abgebildet: 50 ist der Board-Durchschnitt, je 15 Punkte entsprechen einer Standardabweichung, an den Rändern begrenzt. Ein Modell braucht mindestens zwei unabhängige Evidenzfamilien, um überhaupt zu ranken; das Board listet die Top 25 nach Composite.
Boards je Anwendungsfall
Die Boards für Text, Coding, Vision, Mathematik, Reasoning und Agenten berechnen dieselbe Mischung auf segmentgerechten Signalen neu — Coding tauscht die Coding-Benchmarks und SWE-bench Verified ein, Vision nutzt LMArenas Vision-Arena — und Blind Battles paaren ausschließlich Modelle desselben Segments.
Frische und Fair Play
Externe Feeds aktualisieren täglich, die eigene Telemetrie ist live; neue Modelle steigen binnen 48 Stunden nach Release auf Basis externer Belege ein. Nirgends werden selbst gemeldete Herstellerzahlen verwendet, Community-Buzz wird nur als Kontext gezeigt und fließt nie in einen Rang ein, und jede externe Quelle ist unter dem Board attribuiert.
Häufige Fragen
Wie wird das KI-Modell-Ranking berechnet?
Jedes Modell erhält einen kombinierten Score aus vier Evidenzfamilien — blinde menschliche Präferenz (LMArena), unabhängige Benchmarks (Artificial Analysis, SWE-bench), OrcaRouter-Produktionszuverlässigkeit und Ökosystem-Adoption (OpenRouter) — mit festen öffentlichen Gewichten 40 / 30 / 20 / 10.
Warum hat ein brandneues Modell bereits einen Rang?
Neue Modelle steigen innerhalb von 48 Stunden nach Release auf Basis externer Belege ins Board ein. Der Rang festigt sich, je mehr Community-Battles und Produktionstraffic sich ansammeln.
Wie oft wird das Ranking aktualisiert?
Externe Feeds täglich, OrcaRouter-Telemetrie live; das Aktualisierungsdatum steht im Kopf der Seite.
Warum fehlt ein Modell?
Ein Modell braucht mindestens zwei unabhängige Evidenzquellen für ein Ranking, und das Board zeigt die Top 25 nach Composite-Score — Modelle mit dünnerer Evidenz bleiben ungelistet, bis eine weitere Quelle sie abdeckt.
Werden Anwendungsfälle getrennt gerankt?
Ja — die Buttons über der konsolidierten Tabelle wechseln zwischen Text-, Coding-, Vision-, Mathematik-, Reasoning- und Agenten-Boards, und Battles paaren nur Vergleichbares.
Wann festigt sich der Rang eines neuen Modells?
Sobald ein Modell drei Beleg-Familien vereint, darunter OrcaRouters eigene Battle- und Traffic-Daten, stützt sich sein Rang auf die vollständige Mischung statt nur auf externe Belege.
Woher stammen die Daten?
LMArena (CC-BY-4.0), Artificial Analysis, SWE-bench und OpenRouter-Rankings plus OrcaRouter-Produktionstelemetrie — alles unter dem Board attribuiert.
Können Anbieter das Ranking manipulieren?
Schwer: öffentliche Gewichte, keine Selbstauskünfte, und blinde Battles plus echter Traffic verankern jeden Score.
Kann ich diese Daten exportieren oder einbetten?
Ja — JSON/CSV-Export, einbettbares Rang-Badge und ein RSS-Feed der Rangänderungen sind mit Quellenangabe kostenlos. Links im Footer.