Ранжирование по реальному рабочему трафику OrcaRouter и голосам сообщества в Battle Mode — а не по бенчмаркам от производителей.
Обновлено 2026-08-095 источников данныхНовые модели — в течение 48 ч
Измерено на реальном трафике
100.0%
Лучшая доля успеха (7 дн.)
openai/gpt-4-turbo-2024-04-09
450 ms
Самая низкая задержка p50
OpenAI: GPT-4o (2024-08-06)
80.1%
Лучшая доля побед в сообществе
Qwen3.7 Max (2026-05-20)
Сводный рейтинг
Один сводный рейтинг для каждой модели — голоса LMArena, независимые бенчмарки, распространённость в экосистеме и производственные данные OrcaRouter с фиксированными публичными весами. Новые модели попадают в рейтинг с первого дня на основе внешних данных.
Попарные показатели побед в Battle Mode — как часто каждая модель побеждает каждого соперника в очном сравнении.
Бенчмарки — интеллект против цены
Независимые оценки интеллекта в зависимости от цены ввода. Пунктирная линия — граница Парето по цене и интеллекту.
Слепая дуэль
Два анонимных ответа, один голос. Ваши битвы формируют 20% веса производственных данных в сводном рейтинге.
⚔️ Слепая дуэль
Две анонимные модели отвечают на один и тот же запрос. Прочитайте оба ответа, проголосуйте за победителя, а затем узнайте, кто что написал — ваш голос идёт в рейтинг выше.
Методология — как устроен этот рейтинг
Каждая цифра на этой странице измерена, а не заявлена вендором. Ниже — полный метод сводного рейтинга: одни и те же правила для каждой модели, каждый день.
Один сводный балл, фиксированные публичные веса
Каждая модель получает композитный балл из четырёх независимых семейств данных: слепые человеческие предпочтения 40%, независимые бенчмарки 30%, производственные данные OrcaRouter 20% и распространённость в экосистеме 10%. Веса фиксированы и публичны — без редакторских правок, платных мест и заявок вендоров.
Что питает каждое семейство
Человеческие предпочтения — это командный Elo LMArena: слепые парные голосования на текстовой и визуальной аренах (CC-BY-4.0). Независимые бенчмарки объединяют Artificial Analysis (Intelligence Index плюс программирование, математика, GPQA Diamond и τ²-Bench) и SWE-bench Verified — долю решённых реальных задач GitHub. Производственные данные — собственные данные OrcaRouter: результаты Blind Battle плюс живая телеметрия шлюза — успешность, задержка и объём маршрутизированных токенов. Распространённость берётся из публикуемой OpenRouter доли токенов.
Как баллы становятся сопоставимыми
Источники используют разные шкалы (Elo, индексы 0–100, процент решённых задач), поэтому каждый сигнал стандартизируется относительно текущего рейтинга и переводится в шкалу 0–100: 50 — среднее по таблице, каждые 15 пунктов — одно стандартное отклонение, с ограничением на краях. Для попадания в рейтинг модели нужно минимум два независимых семейства данных; таблица показывает топ-25 по сводному баллу.
Рейтинги по сценариям использования
Таблицы для текста, программирования, зрения, математики, рассуждений и агентов пересчитывают то же смешение на сигналах своего сегмента — программирование берёт кодовые бенчмарки и SWE-bench Verified, зрение использует визуальную арену LMArena — а Blind Battle сводит только модели одного сегмента.
Свежесть и честная игра
Внешние источники обновляются ежедневно, собственная телеметрия — в реальном времени; новые модели попадают в рейтинг по внешним данным в течение 48 часов после релиза. Самоотчётные цифры вендоров не используются нигде, обсуждаемость в сообществе показывается только как контекст и никогда не влияет на место, а все внешние источники указаны под таблицей.
Частые вопросы
Как формируется рейтинг моделей ИИ?
Каждая модель получает объединённую оценку из четырёх семейств данных — слепые человеческие предпочтения (LMArena), независимые бенчмарки (Artificial Analysis, SWE-bench), производственная надёжность OrcaRouter и распространённость в экосистеме (OpenRouter) — с фиксированными публичными весами 40 / 30 / 20 / 10.
Почему у новой модели уже есть место в рейтинге?
Новые модели попадают в таблицу на основе внешних данных в течение 48 часов после релиза. Рейтинг укрепляется по мере накопления пользовательских баттлов и рабочего трафика.
Как часто обновляется рейтинг?
Внешние источники обновляются ежедневно, телеметрия OrcaRouter — в реальном времени; дата обновления показана вверху.
Почему модели нет в списке?
Для попадания в рейтинг модели нужны минимум два независимых источника данных; таблица показывает топ-25 по составному баллу — модели с недостаточными данными не отображаются, пока их не охватит новый источник.
Ранжируются ли сценарии отдельно?
Да — кнопки над сводной таблицей переключают рейтинги: текст, программирование, зрение, математика, рассуждения и агенты, а баттлы сводят только сопоставимые модели.
Когда рейтинг новой модели становится устойчивым?
Как только модель набирает три семейства данных, включая собственные баттлы и трафик OrcaRouter, её рейтинг опирается на полное смешение, а не только на внешние данные.
Откуда данные?
LMArena (CC-BY-4.0), Artificial Analysis, SWE-bench, рейтинги OpenRouter и производственная телеметрия OrcaRouter — все источники указаны под таблицей.
Могут ли вендоры накрутить рейтинг?
Сложно: веса публичны, самоотчётные данные не используются, а слепые битвы и живой трафик заякоривают каждый балл.
Можно ли экспортировать или встроить эти данные?
Да — экспорт в JSON/CSV, встраиваемый бейдж ранга и RSS-лента изменений доступны бесплатно с указанием источника. Ссылки внизу страницы.