Рейтинг моделей ИИ

Ранжирование по реальному рабочему трафику OrcaRouter и голосам сообщества в Battle Mode — а не по бенчмаркам от производителей.

Обновлено 2026-09-235 источников данныхНовые модели — в течение 48 ч
Измерено на реальном трафике
100.0%
Лучшая доля успеха (7 дн.)
MiniMax: MiniMax M2.5
156 ms
Самая низкая задержка p50
Orca: OrcaVerify Text 1.0 (Free)
80.1%
Лучшая доля побед в сообществе
Qwen3.7 Max (2026-05-20)

Сводный рейтинг

Один сводный рейтинг для каждой модели — голоса LMArena, независимые бенчмарки, распространённость в экосистеме и производственные данные OrcaRouter с фиксированными публичными весами. Новые модели попадают в рейтинг с первого дня на основе внешних данных.

РангМодельКомпозитНадёжность$/1M смеш.СкоростьДинамикаДоказательства
#1OpenAI: GPT-5.4 Pro81.199.46% · 10000ms$165.00$60 → $270 per 1M tokens132 токенов в секундуAA 66.0Индекс интеллекта Artificial Analysis — независимый составной бенчмарк (0–100).Win 58.7%Процент побед в Blind Battle OrcaRouter — слепые парные голоса нашего сообщества.
#2DeepSeek: DeepSeek V4.1 Flash78.699.90% · 2532ms$0.38$0.15 → $0.6 per 1M tokens184 токенов в секундуAA 39.5Индекс интеллекта Artificial Analysis — независимый составной бенчмарк (0–100).OR 13.5%Доля токенов OpenRouter — реальная распространённость.
#3OpenAI: GPT-6 Astra75.899.16% · 10000ms$30.00$10 → $50 per 1M tokens56 токенов в секундуAA 52.7Индекс интеллекта Artificial Analysis — независимый составной бенчмарк (0–100).OR 1.4%Доля токенов OpenRouter — реальная распространённость.
#4Anthropic: Claude Opus 5.573.4100.00% · 10000ms$12.00$4 → $20 per 1M tokens1784 токенов в секундуAA 57.6Индекс интеллекта Artificial Analysis — независимый составной бенчмарк (0–100).OR 0.0%Доля токенов OpenRouter — реальная распространённость.
#5Anthropic: Claude Opus 572.699.17% · 6222ms$15.00$5 → $25 per 1M tokens84 токенов в секундуAA 50.8Индекс интеллекта Artificial Analysis — независимый составной бенчмарк (0–100).OR 0.9%Доля токенов OpenRouter — реальная распространённость.
#6Anthropic: Claude Fable 5.172.399.26% · 8014ms$30.00$10 → $50 per 1M tokens61 токенов в секундуAA 53.4Индекс интеллекта Artificial Analysis — независимый составной бенчмарк (0–100).OR 0.4%Доля токенов OpenRouter — реальная распространённость.
#7Z.ai: GLM 5.372.199.86% · 3910ms$2.61$1.26 → $3.96 per 1M tokens74 токенов в секундуAA 44.8Индекс интеллекта Artificial Analysis — независимый составной бенчмарк (0–100).OR 2.4%Доля токенов OpenRouter — реальная распространённость.
#8OpenAI: GPT-5.6 Luna72.199.88% · 1631ms$0.70$0.2 → $1.2 per 1M tokens110 токенов в секундуAA 37.3Индекс интеллекта Artificial Analysis — независимый составной бенчмарк (0–100).OR 6.6%Доля токенов OpenRouter — реальная распространённость.
#9Z.ai: GLM 5.3 Flash71.599.55% · 6861ms$0.16$0.075 → $0.25 per 1M tokens93 токенов в секундуArena 1472Elo сообщества LMArena — слепые голоса на текстовой арене (CC-BY-4.0).AA 41.8Индекс интеллекта Artificial Analysis — независимый составной бенчмарк (0–100).OR 13.9%Доля токенов OpenRouter — реальная распространённость.
#10OpenAI: GPT-5.6 Sol71.499.14% · 10000ms$12.00$4 → $20 per 1M tokens1625 токенов в секундуAA 47.0Индекс интеллекта Artificial Analysis — независимый составной бенчмарк (0–100).OR 1.4%Доля токенов OpenRouter — реальная распространённость.

LMArena leaderboard dataset (CC-BY-4.0) — lmarena.ai · Source: OpenRouter (openrouter.ai/rankings) · SWE-bench Verified — swebench.com · Artificial Analysis — artificialanalysis.ai

Доля лабораторий в топ-20
openai 25.0%anthropic 20.0%z-ai 15.0%google 10.0%Прочие 30.0%
40%
Человеческие предпочтения
LMArena · Bradley–Terry
30%
Независимые бенчмарки
Artificial Analysis · SWE-bench
20%
Производственные данные
OrcaRouter Blind Battle win rate
10%
Распространённость
OpenRouter token share

Очные дуэли

Попарные показатели побед в Battle Mode — как часто каждая модель побеждает каждого соперника в очном сравнении.

Бенчмарки — интеллект против цены

Независимые оценки интеллекта в зависимости от цены ввода. Пунктирная линия — граница Парето по цене и интеллекту.

Слепая дуэль

Два анонимных ответа, один голос. Ваши битвы формируют 20% веса производственных данных в сводном рейтинге.

⚔️ Слепая дуэль

Две анонимные модели отвечают на один и тот же запрос. Прочитайте оба ответа, проголосуйте за победителя, а затем узнайте, кто что написал — ваш голос идёт в рейтинг выше.

Методология — как устроен этот рейтинг

Каждая цифра на этой странице измерена, а не заявлена вендором. Ниже — полный метод сводного рейтинга: одни и те же правила для каждой модели, каждый день.

Один сводный балл, фиксированные публичные веса

Каждая модель получает композитный балл из четырёх независимых семейств данных: слепые человеческие предпочтения 40%, независимые бенчмарки 30%, производственные данные OrcaRouter 20% и распространённость в экосистеме 10%. Веса фиксированы и публичны — без редакторских правок, платных мест и заявок вендоров.

Что питает каждое семейство

Человеческие предпочтения — это командный Elo LMArena: слепые парные голосования на текстовой и визуальной аренах (CC-BY-4.0). Независимые бенчмарки объединяют Artificial Analysis (Intelligence Index плюс программирование, математика, GPQA Diamond и τ²-Bench) и SWE-bench Verified — долю решённых реальных задач GitHub. Производственные данные — это собственные результаты OrcaRouter в Blind Battle. Распространённость берётся из публикуемой OpenRouter доли токенов. Успешность, задержка и пропускная способность показаны рядом с каждой моделью как контекст и никогда не влияют на ранг.

Как баллы становятся сопоставимыми

Источники используют разные шкалы (Elo, индексы 0–100, процент решённых задач), поэтому каждый сигнал стандартизируется относительно текущего рейтинга и переводится в шкалу 0–100: 50 — среднее по таблице, каждые 15 пунктов — одно стандартное отклонение, с ограничением на краях. Для попадания в рейтинг модели нужно минимум два независимых семейства данных; таблица показывает топ-25 по сводному баллу.

Рейтинги по сценариям использования

Таблицы для текста, программирования, зрения, математики, рассуждений и агентов пересчитывают то же смешение на сигналах своего сегмента — программирование берёт кодовые бенчмарки и SWE-bench Verified, зрение использует визуальную арену LMArena — а Blind Battle сводит только модели одного сегмента.

Свежесть и честная игра

Внешние источники обновляются ежедневно, собственная телеметрия — в реальном времени; новые модели попадают в рейтинг по внешним данным в течение 48 часов после релиза. Самоотчётные цифры вендоров не используются нигде, обсуждаемость в сообществе показывается только как контекст и никогда не влияет на место, а все внешние источники указаны под таблицей.

Частые вопросы

Как формируется рейтинг моделей ИИ?

Каждая модель получает объединённую оценку из четырёх семейств данных — слепые человеческие предпочтения (LMArena), независимые бенчмарки (Artificial Analysis, SWE-bench), производственная надёжность OrcaRouter и распространённость в экосистеме (OpenRouter) — с фиксированными публичными весами 40 / 30 / 20 / 10.

Почему у новой модели уже есть место в рейтинге?

Новые модели попадают в таблицу на основе внешних данных в течение 48 часов после релиза. Рейтинг укрепляется по мере накопления пользовательских баттлов и рабочего трафика.

Как часто обновляется рейтинг?

Внешние источники обновляются ежедневно, телеметрия OrcaRouter — в реальном времени; дата обновления показана вверху.

Почему модели нет в списке?

Для попадания в рейтинг модели нужны минимум два независимых источника данных; таблица показывает топ-25 по составному баллу — модели с недостаточными данными не отображаются, пока их не охватит новый источник.

Ранжируются ли сценарии отдельно?

Да — кнопки над сводной таблицей переключают рейтинги: текст, программирование, зрение, математика, рассуждения и агенты, а баттлы сводят только сопоставимые модели.

Когда рейтинг новой модели становится устойчивым?

Как только модель набирает три семейства данных, включая собственные баттлы и трафик OrcaRouter, её рейтинг опирается на полное смешение, а не только на внешние данные.

Откуда данные?

LMArena (CC-BY-4.0), Artificial Analysis, SWE-bench, рейтинги OpenRouter и производственная телеметрия OrcaRouter — все источники указаны под таблицей.

Могут ли вендоры накрутить рейтинг?

Сложно: веса публичны, самоотчётные данные не используются, а слепые битвы и живой трафик заякоривают каждый балл.

Можно ли экспортировать или встроить эти данные?

Да — экспорт в JSON/CSV, встраиваемый бейдж ранга и RSS-лента изменений доступны бесплатно с указанием источника. Ссылки внизу страницы.

Новые модели, изменения рангов и релизы — следите:X · @OrcaRouterDiscord