Рейтинг моделей ИИ

Ранжирование по реальному рабочему трафику OrcaRouter и голосам сообщества в Battle Mode — а не по бенчмаркам от производителей.

Обновлено 2026-08-095 источников данныхНовые модели — в течение 48 ч
Измерено на реальном трафике
100.0%
Лучшая доля успеха (7 дн.)
openai/gpt-4-turbo-2024-04-09
450 ms
Самая низкая задержка p50
OpenAI: GPT-4o (2024-08-06)
80.1%
Лучшая доля побед в сообществе
Qwen3.7 Max (2026-05-20)

Сводный рейтинг

Один сводный рейтинг для каждой модели — голоса LMArena, независимые бенчмарки, распространённость в экосистеме и производственные данные OrcaRouter с фиксированными публичными весами. Новые модели попадают в рейтинг с первого дня на основе внешних данных.

РангМодельКомпозитНадёжность$/1M смеш.ОбъёмДинамикаДоказательства
#1Anthropic: Claude Opus 574.299.77% · 3883ms$15.00$5 → $25 per 1M tokens<1%AA 63.1Индекс интеллекта Artificial Analysis — независимый составной бенчмарк (0–100).OR 1.9%Доля токенов OpenRouter — реальная распространённость.
#2OpenAI: GPT-5.6 Luna73.899.44% · 3256ms$0.70$0.2 → $1.2 per 1M tokens12%AA 52.3Индекс интеллекта Artificial Analysis — независимый составной бенчмарк (0–100).OR 6.7%Доля токенов OpenRouter — реальная распространённость.
#3OpenAI: GPT-5.4 Pro72.299.25% · 9000ms$165.00$60 → $270 per 1M tokens<1%AA 66.0Индекс интеллекта Artificial Analysis — независимый составной бенчмарк (0–100).Win 58.7%Процент побед в Blind Battle OrcaRouter — слепые парные голоса нашего сообщества.
#4MoonshotAI: Kimi K372.299.40% · 7738ms$9.00$3 → $15 per 1M tokens8%AA 59.7Индекс интеллекта Artificial Analysis — независимый составной бенчмарк (0–100).OR 2.0%Доля токенов OpenRouter — реальная распространённость.
#5Z.ai: GLM 5.271.699.62% · 5211ms$2.90$1.4 → $4.4 per 1M tokens3%AA 52.6Индекс интеллекта Artificial Analysis — независимый составной бенчмарк (0–100).OR 4.9%Доля токенов OpenRouter — реальная распространённость.Win 63.6%Процент побед в Blind Battle OrcaRouter — слепые парные голоса нашего сообщества.
#6OpenAI: GPT-5.6 Sol69.899.34% · 6136ms$17.50$5 → $30 per 1M tokens<1%AA 60.9Индекс интеллекта Artificial Analysis — независимый составной бенчмарк (0–100).OR 0.9%Доля токенов OpenRouter — реальная распространённость.
#7Qwen3.7 Max (2026-05-20)69.299.14% · 10000ms$2.50$1.25 → $3.75 per 1M tokens<1%AA 46.7Индекс интеллекта Artificial Analysis — независимый составной бенчмарк (0–100).OR 0.1%Доля токенов OpenRouter — реальная распространённость.Win 80.1%Процент побед в Blind Battle OrcaRouter — слепые парные голоса нашего сообщества.
#8OpenAI: GPT-5.6 Terra68.099.94% · 2586ms$7.00$2 → $12 per 1M tokens16%AA 56.6Индекс интеллекта Artificial Analysis — независимый составной бенчмарк (0–100).OR 1.2%Доля токенов OpenRouter — реальная распространённость.
#9Anthropic: Claude Fable 567.399.41% · 4144ms$30.00$10 → $50 per 1M tokens<1%Arena 1494Elo сообщества LMArena — слепые голоса на текстовой арене (CC-BY-4.0).AA 62.1Индекс интеллекта Artificial Analysis — независимый составной бенчмарк (0–100).OR 0.3%Доля токенов OpenRouter — реальная распространённость.
#10Google: Gemini 3.6 Flash66.699.35% · 3928ms$4.50$1.5 → $7.5 per 1M tokens<1%Arena 1480Elo сообщества LMArena — слепые голоса на текстовой арене (CC-BY-4.0).AA 51.6Индекс интеллекта Artificial Analysis — независимый составной бенчмарк (0–100).OR 3.5%Доля токенов OpenRouter — реальная распространённость.

LMArena leaderboard dataset (CC-BY-4.0) — lmarena.ai · Source: OpenRouter (openrouter.ai/rankings) · SWE-bench Verified — swebench.com · Artificial Analysis — artificialanalysis.ai

Доля токенов по лабораториям
deepseek 44.8%openai 29.5%tencent 11.0%kimi 7.9%Прочие 6.8%
40%
Человеческие предпочтения
LMArena · Bradley–Terry
30%
Независимые бенчмарки
Artificial Analysis · SWE-bench
20%
Производственные данные
OrcaRouter battles & traffic
10%
Распространённость
OpenRouter token share

Очные дуэли

Попарные показатели побед в Battle Mode — как часто каждая модель побеждает каждого соперника в очном сравнении.

Бенчмарки — интеллект против цены

Независимые оценки интеллекта в зависимости от цены ввода. Пунктирная линия — граница Парето по цене и интеллекту.

Слепая дуэль

Два анонимных ответа, один голос. Ваши битвы формируют 20% веса производственных данных в сводном рейтинге.

⚔️ Слепая дуэль

Две анонимные модели отвечают на один и тот же запрос. Прочитайте оба ответа, проголосуйте за победителя, а затем узнайте, кто что написал — ваш голос идёт в рейтинг выше.

Методология — как устроен этот рейтинг

Каждая цифра на этой странице измерена, а не заявлена вендором. Ниже — полный метод сводного рейтинга: одни и те же правила для каждой модели, каждый день.

Один сводный балл, фиксированные публичные веса

Каждая модель получает композитный балл из четырёх независимых семейств данных: слепые человеческие предпочтения 40%, независимые бенчмарки 30%, производственные данные OrcaRouter 20% и распространённость в экосистеме 10%. Веса фиксированы и публичны — без редакторских правок, платных мест и заявок вендоров.

Что питает каждое семейство

Человеческие предпочтения — это командный Elo LMArena: слепые парные голосования на текстовой и визуальной аренах (CC-BY-4.0). Независимые бенчмарки объединяют Artificial Analysis (Intelligence Index плюс программирование, математика, GPQA Diamond и τ²-Bench) и SWE-bench Verified — долю решённых реальных задач GitHub. Производственные данные — собственные данные OrcaRouter: результаты Blind Battle плюс живая телеметрия шлюза — успешность, задержка и объём маршрутизированных токенов. Распространённость берётся из публикуемой OpenRouter доли токенов.

Как баллы становятся сопоставимыми

Источники используют разные шкалы (Elo, индексы 0–100, процент решённых задач), поэтому каждый сигнал стандартизируется относительно текущего рейтинга и переводится в шкалу 0–100: 50 — среднее по таблице, каждые 15 пунктов — одно стандартное отклонение, с ограничением на краях. Для попадания в рейтинг модели нужно минимум два независимых семейства данных; таблица показывает топ-25 по сводному баллу.

Рейтинги по сценариям использования

Таблицы для текста, программирования, зрения, математики, рассуждений и агентов пересчитывают то же смешение на сигналах своего сегмента — программирование берёт кодовые бенчмарки и SWE-bench Verified, зрение использует визуальную арену LMArena — а Blind Battle сводит только модели одного сегмента.

Свежесть и честная игра

Внешние источники обновляются ежедневно, собственная телеметрия — в реальном времени; новые модели попадают в рейтинг по внешним данным в течение 48 часов после релиза. Самоотчётные цифры вендоров не используются нигде, обсуждаемость в сообществе показывается только как контекст и никогда не влияет на место, а все внешние источники указаны под таблицей.

Частые вопросы

Как формируется рейтинг моделей ИИ?

Каждая модель получает объединённую оценку из четырёх семейств данных — слепые человеческие предпочтения (LMArena), независимые бенчмарки (Artificial Analysis, SWE-bench), производственная надёжность OrcaRouter и распространённость в экосистеме (OpenRouter) — с фиксированными публичными весами 40 / 30 / 20 / 10.

Почему у новой модели уже есть место в рейтинге?

Новые модели попадают в таблицу на основе внешних данных в течение 48 часов после релиза. Рейтинг укрепляется по мере накопления пользовательских баттлов и рабочего трафика.

Как часто обновляется рейтинг?

Внешние источники обновляются ежедневно, телеметрия OrcaRouter — в реальном времени; дата обновления показана вверху.

Почему модели нет в списке?

Для попадания в рейтинг модели нужны минимум два независимых источника данных; таблица показывает топ-25 по составному баллу — модели с недостаточными данными не отображаются, пока их не охватит новый источник.

Ранжируются ли сценарии отдельно?

Да — кнопки над сводной таблицей переключают рейтинги: текст, программирование, зрение, математика, рассуждения и агенты, а баттлы сводят только сопоставимые модели.

Когда рейтинг новой модели становится устойчивым?

Как только модель набирает три семейства данных, включая собственные баттлы и трафик OrcaRouter, её рейтинг опирается на полное смешение, а не только на внешние данные.

Откуда данные?

LMArena (CC-BY-4.0), Artificial Analysis, SWE-bench, рейтинги OpenRouter и производственная телеметрия OrcaRouter — все источники указаны под таблицей.

Могут ли вендоры накрутить рейтинг?

Сложно: веса публичны, самоотчётные данные не используются, а слепые битвы и живой трафик заякоривают каждый балл.

Можно ли экспортировать или встроить эти данные?

Да — экспорт в JSON/CSV, встраиваемый бейдж ранга и RSS-лента изменений доступны бесплатно с указанием источника. Ссылки внизу страницы.

Новые модели, изменения рангов и релизы — следите:X · @OrcaRouterDiscord