Ранжирование по реальному рабочему трафику OrcaRouter и голосам сообщества в Battle Mode — а не по бенчмаркам от производителей.
Обновлено 2026-09-235 источников данныхНовые модели — в течение 48 ч
Измерено на реальном трафике
100.0%
Лучшая доля успеха (7 дн.)
MiniMax: MiniMax M2.5
156 ms
Самая низкая задержка p50
Orca: OrcaVerify Text 1.0 (Free)
80.1%
Лучшая доля побед в сообществе
Qwen3.7 Max (2026-05-20)
Сводный рейтинг
Один сводный рейтинг для каждой модели — голоса LMArena, независимые бенчмарки, распространённость в экосистеме и производственные данные OrcaRouter с фиксированными публичными весами. Новые модели попадают в рейтинг с первого дня на основе внешних данных.
КомпозитСводный балл 0–100: предпочтения людей 40%, независимые бенчмарки 30%, производственные данные OrcaRouter 20%, распространённость 10%.
НадёжностьУспешность за 7 дней и медианная (p50) задержка на шлюзе OrcaRouter.
$/1M смеш.Среднее цен входа/выхода за 1M токенов; наведите для точного разбиения вход → выход.
СкоростьСкорость вывода в токенах в секунду по трафику шлюза OrcaRouter (окно 7 дней) — общее число сгенерированных токенов, делённое на общее время генерации. Полосы показаны относительно самой быстрой модели.
ДинамикаОбсуждаемость и движение рейтинга — только контекст, никогда не влияет на ранг.
ДоказательстваСырые сигналы за сводным баллом — наведите на чип, чтобы узнать, что он измеряет.
Попарные показатели побед в Battle Mode — как часто каждая модель побеждает каждого соперника в очном сравнении.
Бенчмарки — интеллект против цены
Независимые оценки интеллекта в зависимости от цены ввода. Пунктирная линия — граница Парето по цене и интеллекту.
Слепая дуэль
Два анонимных ответа, один голос. Ваши битвы формируют 20% веса производственных данных в сводном рейтинге.
⚔️ Слепая дуэль
Две анонимные модели отвечают на один и тот же запрос. Прочитайте оба ответа, проголосуйте за победителя, а затем узнайте, кто что написал — ваш голос идёт в рейтинг выше.
Методология — как устроен этот рейтинг
Каждая цифра на этой странице измерена, а не заявлена вендором. Ниже — полный метод сводного рейтинга: одни и те же правила для каждой модели, каждый день.
Один сводный балл, фиксированные публичные веса
Каждая модель получает композитный балл из четырёх независимых семейств данных: слепые человеческие предпочтения 40%, независимые бенчмарки 30%, производственные данные OrcaRouter 20% и распространённость в экосистеме 10%. Веса фиксированы и публичны — без редакторских правок, платных мест и заявок вендоров.
Что питает каждое семейство
Человеческие предпочтения — это командный Elo LMArena: слепые парные голосования на текстовой и визуальной аренах (CC-BY-4.0). Независимые бенчмарки объединяют Artificial Analysis (Intelligence Index плюс программирование, математика, GPQA Diamond и τ²-Bench) и SWE-bench Verified — долю решённых реальных задач GitHub. Производственные данные — это собственные результаты OrcaRouter в Blind Battle. Распространённость берётся из публикуемой OpenRouter доли токенов. Успешность, задержка и пропускная способность показаны рядом с каждой моделью как контекст и никогда не влияют на ранг.
Как баллы становятся сопоставимыми
Источники используют разные шкалы (Elo, индексы 0–100, процент решённых задач), поэтому каждый сигнал стандартизируется относительно текущего рейтинга и переводится в шкалу 0–100: 50 — среднее по таблице, каждые 15 пунктов — одно стандартное отклонение, с ограничением на краях. Для попадания в рейтинг модели нужно минимум два независимых семейства данных; таблица показывает топ-25 по сводному баллу.
Рейтинги по сценариям использования
Таблицы для текста, программирования, зрения, математики, рассуждений и агентов пересчитывают то же смешение на сигналах своего сегмента — программирование берёт кодовые бенчмарки и SWE-bench Verified, зрение использует визуальную арену LMArena — а Blind Battle сводит только модели одного сегмента.
Свежесть и честная игра
Внешние источники обновляются ежедневно, собственная телеметрия — в реальном времени; новые модели попадают в рейтинг по внешним данным в течение 48 часов после релиза. Самоотчётные цифры вендоров не используются нигде, обсуждаемость в сообществе показывается только как контекст и никогда не влияет на место, а все внешние источники указаны под таблицей.
Частые вопросы
Как формируется рейтинг моделей ИИ?
Каждая модель получает объединённую оценку из четырёх семейств данных — слепые человеческие предпочтения (LMArena), независимые бенчмарки (Artificial Analysis, SWE-bench), производственная надёжность OrcaRouter и распространённость в экосистеме (OpenRouter) — с фиксированными публичными весами 40 / 30 / 20 / 10.
Почему у новой модели уже есть место в рейтинге?
Новые модели попадают в таблицу на основе внешних данных в течение 48 часов после релиза. Рейтинг укрепляется по мере накопления пользовательских баттлов и рабочего трафика.
Как часто обновляется рейтинг?
Внешние источники обновляются ежедневно, телеметрия OrcaRouter — в реальном времени; дата обновления показана вверху.
Почему модели нет в списке?
Для попадания в рейтинг модели нужны минимум два независимых источника данных; таблица показывает топ-25 по составному баллу — модели с недостаточными данными не отображаются, пока их не охватит новый источник.
Ранжируются ли сценарии отдельно?
Да — кнопки над сводной таблицей переключают рейтинги: текст, программирование, зрение, математика, рассуждения и агенты, а баттлы сводят только сопоставимые модели.
Когда рейтинг новой модели становится устойчивым?
Как только модель набирает три семейства данных, включая собственные баттлы и трафик OrcaRouter, её рейтинг опирается на полное смешение, а не только на внешние данные.
Откуда данные?
LMArena (CC-BY-4.0), Artificial Analysis, SWE-bench, рейтинги OpenRouter и производственная телеметрия OrcaRouter — все источники указаны под таблицей.
Могут ли вендоры накрутить рейтинг?
Сложно: веса публичны, самоотчётные данные не используются, а слепые битвы и живой трафик заякоривают каждый балл.
Можно ли экспортировать или встроить эти данные?
Да — экспорт в JSON/CSV, встраиваемый бейдж ранга и RSS-лента изменений доступны бесплатно с указанием источника. Ссылки внизу страницы.