Ranking modeli AI

Klasyfikacja na podstawie rzeczywistego ruchu produkcyjnego OrcaRouter i głosów społeczności w Battle Mode — a nie benchmarków podawanych przez dostawców.

Zaktualizowano 2026-08-095 źródeł danychNowe modele na liście w 48 h
Zmierzono na rzeczywistym ruchu
100.0%
Najwyższy wskaźnik sukcesu (7 dni)
openai/gpt-4-turbo-2024-04-09
450 ms
Najniższe opóźnienie p50
OpenAI: GPT-4o (2024-08-06)
80.1%
Najwyższy współczynnik zwycięstw społeczności
Qwen3.7 Max (2026-05-20)

Ranking skonsolidowany

Jeden łączony ranking dla każdego modelu — głosy LMArena, niezależne benchmarki, adopcja w ekosystemie i dane produkcyjne OrcaRouter, ze stałymi publicznymi wagami. Nowe modele wchodzą od pierwszego dnia na podstawie zewnętrznych dowodów.

PozycjaModelWynik łącznyNiezawodność$/1M łączoneWolumenImpetDowody
#1Anthropic: Claude Opus 574.299.77% · 3883ms$15.00$5 → $25 per 1M tokens<1%AA 63.1Indeks inteligencji Artificial Analysis — niezależny benchmark złożony (0–100).OR 1.9%Udział tokenów OpenRouter — realna adopcja ekosystemu.
#2OpenAI: GPT-5.6 Luna73.899.44% · 3256ms$0.70$0.2 → $1.2 per 1M tokens12%AA 52.3Indeks inteligencji Artificial Analysis — niezależny benchmark złożony (0–100).OR 6.7%Udział tokenów OpenRouter — realna adopcja ekosystemu.
#3OpenAI: GPT-5.4 Pro72.299.25% · 9000ms$165.00$60 → $270 per 1M tokens<1%AA 66.0Indeks inteligencji Artificial Analysis — niezależny benchmark złożony (0–100).Win 58.7%Odsetek zwycięstw Blind Battle OrcaRouter — ślepe głosy naszej społeczności.
#4MoonshotAI: Kimi K372.299.40% · 7738ms$9.00$3 → $15 per 1M tokens8%AA 59.7Indeks inteligencji Artificial Analysis — niezależny benchmark złożony (0–100).OR 2.0%Udział tokenów OpenRouter — realna adopcja ekosystemu.
#5Z.ai: GLM 5.271.699.62% · 5211ms$2.90$1.4 → $4.4 per 1M tokens3%AA 52.6Indeks inteligencji Artificial Analysis — niezależny benchmark złożony (0–100).OR 4.9%Udział tokenów OpenRouter — realna adopcja ekosystemu.Win 63.6%Odsetek zwycięstw Blind Battle OrcaRouter — ślepe głosy naszej społeczności.
#6OpenAI: GPT-5.6 Sol69.899.34% · 6136ms$17.50$5 → $30 per 1M tokens<1%AA 60.9Indeks inteligencji Artificial Analysis — niezależny benchmark złożony (0–100).OR 0.9%Udział tokenów OpenRouter — realna adopcja ekosystemu.
#7Qwen3.7 Max (2026-05-20)69.299.14% · 10000ms$2.50$1.25 → $3.75 per 1M tokens<1%AA 46.7Indeks inteligencji Artificial Analysis — niezależny benchmark złożony (0–100).OR 0.1%Udział tokenów OpenRouter — realna adopcja ekosystemu.Win 80.1%Odsetek zwycięstw Blind Battle OrcaRouter — ślepe głosy naszej społeczności.
#8OpenAI: GPT-5.6 Terra68.099.94% · 2586ms$7.00$2 → $12 per 1M tokens16%AA 56.6Indeks inteligencji Artificial Analysis — niezależny benchmark złożony (0–100).OR 1.2%Udział tokenów OpenRouter — realna adopcja ekosystemu.
#9Anthropic: Claude Fable 567.399.41% · 4144ms$30.00$10 → $50 per 1M tokens<1%Arena 1494Elo społeczności LMArena — ślepe głosy w arenie tekstowej (CC-BY-4.0).AA 62.1Indeks inteligencji Artificial Analysis — niezależny benchmark złożony (0–100).OR 0.3%Udział tokenów OpenRouter — realna adopcja ekosystemu.
#10Google: Gemini 3.6 Flash66.699.35% · 3928ms$4.50$1.5 → $7.5 per 1M tokens<1%Arena 1480Elo społeczności LMArena — ślepe głosy w arenie tekstowej (CC-BY-4.0).AA 51.6Indeks inteligencji Artificial Analysis — niezależny benchmark złożony (0–100).OR 3.5%Udział tokenów OpenRouter — realna adopcja ekosystemu.

LMArena leaderboard dataset (CC-BY-4.0) — lmarena.ai · Source: OpenRouter (openrouter.ai/rankings) · SWE-bench Verified — swebench.com · Artificial Analysis — artificialanalysis.ai

Udział tokenów wg labu
deepseek 44.8%openai 29.5%tencent 11.0%kimi 7.9%Inne 6.8%
40%
Preferencje ludzi
LMArena · Bradley–Terry
30%
Niezależne benchmarki
Artificial Analysis · SWE-bench
20%
Dane produkcyjne
OrcaRouter battles & traffic
10%
Adopcja ekosystemu
OpenRouter token share

Bezpośrednie pojedynki

Parami liczone wskaźniki zwycięstw w Battle Mode — jak często każdy model pokonuje danego rywala w bezpośrednim starciu.

Benchmarki — inteligencja a cena

Niezależne wyniki inteligencji naniesione względem ceny wejścia. Linia przerywana to granica Pareto cena/inteligencja.

Ślepy pojedynek

Dwie anonimowe odpowiedzi, jeden głos. Twoje bitwy zasilają 20% wagi dowodów produkcyjnych w rankingu skonsolidowanym.

⚔️ Ślepy pojedynek

Dwa anonimowe modele odpowiadają na ten sam prompt. Przeczytaj oba, zagłosuj na zwycięzcę, a potem zobacz, kto co napisał — Twój głos zasila ranking powyżej.

Metodologia — jak działa ten ranking

Każda liczba na tej stronie jest zmierzona, nigdy deklarowana przez dostawcę. Oto pełna metoda stojąca za łączonym rankingiem — te same zasady dla każdego modelu, każdego dnia.

Jeden łączony wynik, stałe publiczne wagi

Każdy model otrzymuje wynik złożony z czterech niezależnych rodzin dowodów: ślepe preferencje ludzi 40%, niezależne benchmarki 30%, dane produkcyjne OrcaRouter 20% i adopcja w ekosystemie 10%. Wagi są stałe i publiczne — bez redakcyjnych korekt, bez płatnych miejsc, bez zgłoszeń od dostawców.

Co zasila każdą rodzinę

Preferencje ludzi pochodzą ze społecznościowego Elo LMArena — ślepe głosowania parami na arenie tekstowej i wizyjnej (CC-BY-4.0). Niezależne benchmarki łączą Artificial Analysis (Intelligence Index oraz programowanie, matematykę, GPQA Diamond i τ²-Bench) z SWE-bench Verified — odsetkiem rozwiązanych prawdziwych issue z GitHuba. Dane produkcyjne są własne OrcaRouter: wyniki Blind Battle plus telemetria bramki na żywo — skuteczność, opóźnienie i wolumen routowanych tokenów. Adopcja korzysta z publikowanego przez OpenRouter udziału tokenów.

Jak wyniki stają się porównywalne

Źródła oceniają w różnych skalach (Elo, indeksy 0–100, % rozwiązanych), więc każdy sygnał jest standaryzowany względem bieżącej tabeli i mapowany na 0–100: 50 to średnia tabeli, a każde 15 punktów to jedno odchylenie standardowe, z ograniczeniem na krańcach. Model potrzebuje co najmniej dwóch niezależnych rodzin dowodów, by w ogóle być sklasyfikowanym, a tabela pokazuje top 25 według wyniku złożonego.

Rankingi według zastosowań

Tabele tekst, programowanie, wizja, matematyka, rozumowanie i agenci przeliczają tę samą mieszankę na sygnałach właściwych segmentowi — programowanie podmienia benchmarki kodu i SWE-bench Verified, wizja używa areny wizyjnej LMArena — a Blind Battle łączy wyłącznie modele z tego samego segmentu.

Świeżość i fair play

Zewnętrzne źródła odświeżają się codziennie, a własna telemetria działa na żywo; nowe modele wchodzą na podstawie zewnętrznych dowodów w ciągu 48 godzin od premiery. Nigdzie nie używa się liczb deklarowanych przez dostawców, szum społeczności jest pokazywany tylko jako kontekst i nigdy nie wpływa na pozycję, a każde zewnętrzne źródło jest podpisane pod tabelą.

Częste pytania

Jak liczony jest ranking modeli AI?

Każdy model otrzymuje łączny wynik z czterech rodzin dowodów — ślepych preferencji ludzi (LMArena), niezależnych benchmarków (Artificial Analysis, SWE-bench), niezawodności produkcyjnej OrcaRouter i adopcji w ekosystemie (OpenRouter) — z ustalonymi publicznymi wagami 40 / 30 / 20 / 10.

Dlaczego zupełnie nowy model ma już pozycję?

Nowe modele trafiają do rankingu na podstawie zewnętrznych dowodów w ciągu 48 godzin od premiery. Pozycja umacnia się w miarę gromadzenia bitew społeczności i ruchu produkcyjnego.

Jak często ranking jest aktualizowany?

Źródła zewnętrzne odświeżają się codziennie, telemetria OrcaRouter działa na żywo; data aktualizacji jest w nagłówku.

Dlaczego modelu nie ma na liście?

Model potrzebuje co najmniej dwóch niezależnych źródeł dowodów, aby znaleźć się w rankingu, a tablica pokazuje top 25 według łącznego wyniku — modele o zbyt skąpych danych pozostają nieuwzględnione, dopóki nie obejmie ich kolejne źródło.

Czy przypadki użycia są rankingowane osobno?

Tak — przyciski nad skonsolidowaną tabelą przełączają rankingi: tekst, programowanie, wizja, matematyka, rozumowanie i agenci, a bitwy łączą tylko porównywalne modele.

Kiedy pozycja nowego modelu się umacnia?

Gdy model zgromadzi trzy rodziny dowodów, w tym własne dane OrcaRouter o bitwach i ruchu, jego pozycja opiera się na pełnym połączeniu, a nie tylko na zewnętrznych dowodach.

Skąd pochodzą dane?

LMArena (CC-BY-4.0), Artificial Analysis, SWE-bench i rankingi OpenRouter oraz telemetria produkcyjna OrcaRouter — wszystko opisane pod tabelą.

Czy dostawcy mogą oszukać ranking?

Trudno: wagi są publiczne, nie używamy danych deklarowanych, a ślepe bitwy i realny ruch kotwiczą każdy wynik.

Czy mogę eksportować lub osadzać te dane?

Tak — eksport JSON/CSV, osadzany znaczek pozycji i kanał RSS zmian są darmowe z podaniem źródła. Linki w stopce.

Nowe modele, zmiany rankingu i premiery — obserwuj nas:X · @OrcaRouterDiscord