KI-Modell-Bestenliste

Eingestuft nach echtem Produktionsverkehr von OrcaRouter und Community-Abstimmungen im Battle Mode — nicht nach herstellereigenen Benchmarks.

Aktualisiert am 2026-08-095 EvidenzquellenNeue Modelle binnen 48 h gelistet
Mit echtem Datenverkehr gemessen
100.0%
Höchste Erfolgsquote (7 Tage)
openai/gpt-4-turbo-2024-04-09
450 ms
Schnellste p50-Latenz
OpenAI: GPT-4o (2024-08-06)
80.1%
Höchste Community-Siegquote
Qwen3.7 Max (2026-05-20)

Konsolidiertes Ranking

Ein zusammengeführtes Ranking pro Modell — LMArena-Stimmen, unabhängige Benchmarks, Ökosystem-Adoption und OrcaRouter-Produktionsdaten mit festen öffentlichen Gewichten. Neue Modelle steigen ab Tag eins auf Basis externer Belege ein.

RangModellGesamtwertZuverlässigkeit$/1M gemischtVolumenMomentumBelege
#1Anthropic: Claude Opus 574.299.77% · 3883ms$15.00$5 → $25 per 1M tokens<1%AA 63.1Artificial-Analysis-Intelligenzindex — unabhängiger Kompositbenchmark (0–100).OR 1.9%OpenRouter-Token-Anteil — reale Ökosystem-Adoption.
#2OpenAI: GPT-5.6 Luna73.899.44% · 3256ms$0.70$0.2 → $1.2 per 1M tokens12%AA 52.3Artificial-Analysis-Intelligenzindex — unabhängiger Kompositbenchmark (0–100).OR 6.7%OpenRouter-Token-Anteil — reale Ökosystem-Adoption.
#3OpenAI: GPT-5.4 Pro72.299.25% · 9000ms$165.00$60 → $270 per 1M tokens<1%AA 66.0Artificial-Analysis-Intelligenzindex — unabhängiger Kompositbenchmark (0–100).Win 58.7%OrcaRouter-Blind-Battle-Siegquote — blinde Paarvoten unserer Community.
#4MoonshotAI: Kimi K372.299.40% · 7738ms$9.00$3 → $15 per 1M tokens8%AA 59.7Artificial-Analysis-Intelligenzindex — unabhängiger Kompositbenchmark (0–100).OR 2.0%OpenRouter-Token-Anteil — reale Ökosystem-Adoption.
#5Z.ai: GLM 5.271.699.62% · 5211ms$2.90$1.4 → $4.4 per 1M tokens3%AA 52.6Artificial-Analysis-Intelligenzindex — unabhängiger Kompositbenchmark (0–100).OR 4.9%OpenRouter-Token-Anteil — reale Ökosystem-Adoption.Win 63.6%OrcaRouter-Blind-Battle-Siegquote — blinde Paarvoten unserer Community.
#6OpenAI: GPT-5.6 Sol69.899.34% · 6136ms$17.50$5 → $30 per 1M tokens<1%AA 60.9Artificial-Analysis-Intelligenzindex — unabhängiger Kompositbenchmark (0–100).OR 0.9%OpenRouter-Token-Anteil — reale Ökosystem-Adoption.
#7Qwen3.7 Max (2026-05-20)69.299.14% · 10000ms$2.50$1.25 → $3.75 per 1M tokens<1%AA 46.7Artificial-Analysis-Intelligenzindex — unabhängiger Kompositbenchmark (0–100).OR 0.1%OpenRouter-Token-Anteil — reale Ökosystem-Adoption.Win 80.1%OrcaRouter-Blind-Battle-Siegquote — blinde Paarvoten unserer Community.
#8OpenAI: GPT-5.6 Terra68.099.94% · 2586ms$7.00$2 → $12 per 1M tokens16%AA 56.6Artificial-Analysis-Intelligenzindex — unabhängiger Kompositbenchmark (0–100).OR 1.2%OpenRouter-Token-Anteil — reale Ökosystem-Adoption.
#9Anthropic: Claude Fable 567.399.41% · 4144ms$30.00$10 → $50 per 1M tokens<1%Arena 1494LMArena-Community-Elo — blinde Stimmen der Text-Arena (CC-BY-4.0).AA 62.1Artificial-Analysis-Intelligenzindex — unabhängiger Kompositbenchmark (0–100).OR 0.3%OpenRouter-Token-Anteil — reale Ökosystem-Adoption.
#10Google: Gemini 3.6 Flash66.699.35% · 3928ms$4.50$1.5 → $7.5 per 1M tokens<1%Arena 1480LMArena-Community-Elo — blinde Stimmen der Text-Arena (CC-BY-4.0).AA 51.6Artificial-Analysis-Intelligenzindex — unabhängiger Kompositbenchmark (0–100).OR 3.5%OpenRouter-Token-Anteil — reale Ökosystem-Adoption.

LMArena leaderboard dataset (CC-BY-4.0) — lmarena.ai · Source: OpenRouter (openrouter.ai/rankings) · SWE-bench Verified — swebench.com · Artificial Analysis — artificialanalysis.ai

Token-Anteil je Lab
deepseek 44.8%openai 29.5%tencent 11.0%kimi 7.9%Andere 6.8%
40%
Menschliche Präferenz
LMArena · Bradley–Terry
30%
Unabhängige Benchmarks
Artificial Analysis · SWE-bench
20%
Produktionsdaten
OrcaRouter battles & traffic
10%
Ökosystem-Adoption
OpenRouter token share

Direkte Duelle

Paarweise Battle-Mode-Siegquoten – wie oft jedes Modell jeden Rivalen im direkten Vergleich schlägt.

Benchmarks – Intelligenz vs. Preis

Unabhängige Intelligenz-Scores gegen den Eingabepreis aufgetragen. Die gestrichelte Linie ist die Pareto-Front aus Preis und Intelligenz.

Blind-Duell

Zwei anonyme Antworten, eine Stimme. Ihre Battles speisen die 20 % Produktionsevidenz im konsolidierten Rang.

⚔️ Blind-Duell

Zwei anonyme Modelle beantworten denselben Prompt. Lies beide, stimme für den Sieger ab und sieh dann, wer was geschrieben hat — deine Stimme fließt in die Rangliste oben ein.

Methodik — wie dieses Leaderboard funktioniert

Jede Zahl auf dieser Seite ist gemessen, nie selbst gemeldet. Dies ist die vollständige Methode hinter dem zusammengeführten Rang — dieselben Regeln für jedes Modell, jeden Tag.

Ein kombinierter Score, feste öffentliche Gewichte

Jedes Modell erhält einen Composite-Score aus vier unabhängigen Evidenzfamilien: blinde menschliche Präferenz 40 %, unabhängige Benchmarks 30 %, OrcaRouter-Produktionsdaten 20 % und Ökosystem-Adoption 10 %. Die Gewichte sind fest und öffentlich — keine redaktionellen Eingriffe, keine bezahlte Platzierung, keine Hersteller-Einreichungen.

Was jede Familie speist

Die menschliche Präferenz stammt aus LMArenas Community-Elo — blinde Paarvergleiche in der Text- und Vision-Arena (CC-BY-4.0). Unabhängige Benchmarks kombinieren Artificial Analysis (Intelligence Index plus Coding, Mathematik, GPQA Diamond und τ²-Bench) mit SWE-bench Verified, dem Anteil gelöster echter GitHub-Issues. Produktionsdaten sind OrcaRouters eigene: Blind-Battle-Siegquoten plus Live-Gateway-Telemetrie — Erfolgsrate, Latenz und geroutetes Token-Volumen. Adoption nutzt den von OpenRouter veröffentlichten Token-Anteil.

Wie Scores vergleichbar werden

Die Quellen messen auf verschiedenen Skalen (Elo, 0–100-Indizes, Gelöst-%), daher wird jedes Signal am aktuellen Board standardisiert und auf 0–100 abgebildet: 50 ist der Board-Durchschnitt, je 15 Punkte entsprechen einer Standardabweichung, an den Rändern begrenzt. Ein Modell braucht mindestens zwei unabhängige Evidenzfamilien, um überhaupt zu ranken; das Board listet die Top 25 nach Composite.

Boards je Anwendungsfall

Die Boards für Text, Coding, Vision, Mathematik, Reasoning und Agenten berechnen dieselbe Mischung auf segmentgerechten Signalen neu — Coding tauscht die Coding-Benchmarks und SWE-bench Verified ein, Vision nutzt LMArenas Vision-Arena — und Blind Battles paaren ausschließlich Modelle desselben Segments.

Frische und Fair Play

Externe Feeds aktualisieren täglich, die eigene Telemetrie ist live; neue Modelle steigen binnen 48 Stunden nach Release auf Basis externer Belege ein. Nirgends werden selbst gemeldete Herstellerzahlen verwendet, Community-Buzz wird nur als Kontext gezeigt und fließt nie in einen Rang ein, und jede externe Quelle ist unter dem Board attribuiert.

Häufige Fragen

Wie wird das KI-Modell-Ranking berechnet?

Jedes Modell erhält einen kombinierten Score aus vier Evidenzfamilien — blinde menschliche Präferenz (LMArena), unabhängige Benchmarks (Artificial Analysis, SWE-bench), OrcaRouter-Produktionszuverlässigkeit und Ökosystem-Adoption (OpenRouter) — mit festen öffentlichen Gewichten 40 / 30 / 20 / 10.

Warum hat ein brandneues Modell bereits einen Rang?

Neue Modelle steigen innerhalb von 48 Stunden nach Release auf Basis externer Belege ins Board ein. Der Rang festigt sich, je mehr Community-Battles und Produktionstraffic sich ansammeln.

Wie oft wird das Ranking aktualisiert?

Externe Feeds täglich, OrcaRouter-Telemetrie live; das Aktualisierungsdatum steht im Kopf der Seite.

Warum fehlt ein Modell?

Ein Modell braucht mindestens zwei unabhängige Evidenzquellen für ein Ranking, und das Board zeigt die Top 25 nach Composite-Score — Modelle mit dünnerer Evidenz bleiben ungelistet, bis eine weitere Quelle sie abdeckt.

Werden Anwendungsfälle getrennt gerankt?

Ja — die Buttons über der konsolidierten Tabelle wechseln zwischen Text-, Coding-, Vision-, Mathematik-, Reasoning- und Agenten-Boards, und Battles paaren nur Vergleichbares.

Wann festigt sich der Rang eines neuen Modells?

Sobald ein Modell drei Beleg-Familien vereint, darunter OrcaRouters eigene Battle- und Traffic-Daten, stützt sich sein Rang auf die vollständige Mischung statt nur auf externe Belege.

Woher stammen die Daten?

LMArena (CC-BY-4.0), Artificial Analysis, SWE-bench und OpenRouter-Rankings plus OrcaRouter-Produktionstelemetrie — alles unter dem Board attribuiert.

Können Anbieter das Ranking manipulieren?

Schwer: öffentliche Gewichte, keine Selbstauskünfte, und blinde Battles plus echter Traffic verankern jeden Score.

Kann ich diese Daten exportieren oder einbetten?

Ja — JSON/CSV-Export, einbettbares Rang-Badge und ein RSS-Feed der Rangänderungen sind mit Quellenangabe kostenlos. Links im Footer.

Neue Modelle, Rangänderungen und Releases — folgen Sie uns:X · @OrcaRouterDiscord