Klasyfikacja na podstawie rzeczywistego ruchu produkcyjnego OrcaRouter i głosów społeczności w Battle Mode — a nie benchmarków podawanych przez dostawców.
Zaktualizowano 2026-08-095 źródeł danychNowe modele na liście w 48 h
Zmierzono na rzeczywistym ruchu
100.0%
Najwyższy wskaźnik sukcesu (7 dni)
openai/gpt-4-turbo-2024-04-09
450 ms
Najniższe opóźnienie p50
OpenAI: GPT-4o (2024-08-06)
80.1%
Najwyższy współczynnik zwycięstw społeczności
Qwen3.7 Max (2026-05-20)
Ranking skonsolidowany
Jeden łączony ranking dla każdego modelu — głosy LMArena, niezależne benchmarki, adopcja w ekosystemie i dane produkcyjne OrcaRouter, ze stałymi publicznymi wagami. Nowe modele wchodzą od pierwszego dnia na podstawie zewnętrznych dowodów.
Parami liczone wskaźniki zwycięstw w Battle Mode — jak często każdy model pokonuje danego rywala w bezpośrednim starciu.
Benchmarki — inteligencja a cena
Niezależne wyniki inteligencji naniesione względem ceny wejścia. Linia przerywana to granica Pareto cena/inteligencja.
Ślepy pojedynek
Dwie anonimowe odpowiedzi, jeden głos. Twoje bitwy zasilają 20% wagi dowodów produkcyjnych w rankingu skonsolidowanym.
⚔️ Ślepy pojedynek
Dwa anonimowe modele odpowiadają na ten sam prompt. Przeczytaj oba, zagłosuj na zwycięzcę, a potem zobacz, kto co napisał — Twój głos zasila ranking powyżej.
Metodologia — jak działa ten ranking
Każda liczba na tej stronie jest zmierzona, nigdy deklarowana przez dostawcę. Oto pełna metoda stojąca za łączonym rankingiem — te same zasady dla każdego modelu, każdego dnia.
Jeden łączony wynik, stałe publiczne wagi
Każdy model otrzymuje wynik złożony z czterech niezależnych rodzin dowodów: ślepe preferencje ludzi 40%, niezależne benchmarki 30%, dane produkcyjne OrcaRouter 20% i adopcja w ekosystemie 10%. Wagi są stałe i publiczne — bez redakcyjnych korekt, bez płatnych miejsc, bez zgłoszeń od dostawców.
Co zasila każdą rodzinę
Preferencje ludzi pochodzą ze społecznościowego Elo LMArena — ślepe głosowania parami na arenie tekstowej i wizyjnej (CC-BY-4.0). Niezależne benchmarki łączą Artificial Analysis (Intelligence Index oraz programowanie, matematykę, GPQA Diamond i τ²-Bench) z SWE-bench Verified — odsetkiem rozwiązanych prawdziwych issue z GitHuba. Dane produkcyjne są własne OrcaRouter: wyniki Blind Battle plus telemetria bramki na żywo — skuteczność, opóźnienie i wolumen routowanych tokenów. Adopcja korzysta z publikowanego przez OpenRouter udziału tokenów.
Jak wyniki stają się porównywalne
Źródła oceniają w różnych skalach (Elo, indeksy 0–100, % rozwiązanych), więc każdy sygnał jest standaryzowany względem bieżącej tabeli i mapowany na 0–100: 50 to średnia tabeli, a każde 15 punktów to jedno odchylenie standardowe, z ograniczeniem na krańcach. Model potrzebuje co najmniej dwóch niezależnych rodzin dowodów, by w ogóle być sklasyfikowanym, a tabela pokazuje top 25 według wyniku złożonego.
Rankingi według zastosowań
Tabele tekst, programowanie, wizja, matematyka, rozumowanie i agenci przeliczają tę samą mieszankę na sygnałach właściwych segmentowi — programowanie podmienia benchmarki kodu i SWE-bench Verified, wizja używa areny wizyjnej LMArena — a Blind Battle łączy wyłącznie modele z tego samego segmentu.
Świeżość i fair play
Zewnętrzne źródła odświeżają się codziennie, a własna telemetria działa na żywo; nowe modele wchodzą na podstawie zewnętrznych dowodów w ciągu 48 godzin od premiery. Nigdzie nie używa się liczb deklarowanych przez dostawców, szum społeczności jest pokazywany tylko jako kontekst i nigdy nie wpływa na pozycję, a każde zewnętrzne źródło jest podpisane pod tabelą.
Częste pytania
Jak liczony jest ranking modeli AI?
Każdy model otrzymuje łączny wynik z czterech rodzin dowodów — ślepych preferencji ludzi (LMArena), niezależnych benchmarków (Artificial Analysis, SWE-bench), niezawodności produkcyjnej OrcaRouter i adopcji w ekosystemie (OpenRouter) — z ustalonymi publicznymi wagami 40 / 30 / 20 / 10.
Dlaczego zupełnie nowy model ma już pozycję?
Nowe modele trafiają do rankingu na podstawie zewnętrznych dowodów w ciągu 48 godzin od premiery. Pozycja umacnia się w miarę gromadzenia bitew społeczności i ruchu produkcyjnego.
Jak często ranking jest aktualizowany?
Źródła zewnętrzne odświeżają się codziennie, telemetria OrcaRouter działa na żywo; data aktualizacji jest w nagłówku.
Dlaczego modelu nie ma na liście?
Model potrzebuje co najmniej dwóch niezależnych źródeł dowodów, aby znaleźć się w rankingu, a tablica pokazuje top 25 według łącznego wyniku — modele o zbyt skąpych danych pozostają nieuwzględnione, dopóki nie obejmie ich kolejne źródło.
Czy przypadki użycia są rankingowane osobno?
Tak — przyciski nad skonsolidowaną tabelą przełączają rankingi: tekst, programowanie, wizja, matematyka, rozumowanie i agenci, a bitwy łączą tylko porównywalne modele.
Kiedy pozycja nowego modelu się umacnia?
Gdy model zgromadzi trzy rodziny dowodów, w tym własne dane OrcaRouter o bitwach i ruchu, jego pozycja opiera się na pełnym połączeniu, a nie tylko na zewnętrznych dowodach.
Skąd pochodzą dane?
LMArena (CC-BY-4.0), Artificial Analysis, SWE-bench i rankingi OpenRouter oraz telemetria produkcyjna OrcaRouter — wszystko opisane pod tabelą.
Czy dostawcy mogą oszukać ranking?
Trudno: wagi są publiczne, nie używamy danych deklarowanych, a ślepe bitwy i realny ruch kotwiczą każdy wynik.
Czy mogę eksportować lub osadzać te dane?
Tak — eksport JSON/CSV, osadzany znaczek pozycji i kanał RSS zmian są darmowe z podaniem źródła. Linki w stopce.