Сгенерированная hero-карточка под названием «Reflection Beam vs Kimi K3» с подзаголовком «Одно и то же название бенчмарка, две разные системы тестирования.» и тремя чипами со статистикой: «Terminal-Bench 2.1: 80.1 vs 88.3», «независимый запуск: 85.0» и «цена: не опубликована vs $3 / $15». Под ними расположены три плоские линейные иконки: клипборд с галочкой, линейка, измеряющая столбец, и лупа над столбчатой диаграммой. Логотип OrcaRouter совмещён в правом нижнем углу.
Guides & Insights

Reflection Beam против Kimi K3: одно и то же название бенчмарка, два разных испытательных стенда.

Автор

Rowan Sterling

Дата публикации

Новые модели · 20Все модели →
Бенчмарки: Artificial Analysis · обновляется ежедневно
Назад ко всем статьям

Reflection Beam набирает 80,1 в Terminal-Bench 2.1. Kimi K3 набирает 88,3. Поставьте эти две цифры рядом, как это сделало большинство материалов на этой неделе, и вы придёте к выводу, что Beam отстаёт примерно на восемь пунктов от лучшей открытой модели в этой области. Но эти два числа — не из одной и той же комнаты. 80,1 у Beam заявлено вендором и взято из таблицы в собственном посте Reflection о запуске. 88,3 у Kimi K3 тоже заявлено вендором, на этот раз из собственной таблицы Moonshot — а таблица вендора публикует оценку конкурента только тогда, когда она была получена на собственном стенде вендора, с его собственным набором промптов и его собственным значением параметра усилий. Третья сторона, Artificial Analysis, с тех пор запустила Kimi K3 на бенчмарке с тем же названием и опубликовала 85,0. Это разрыв в 4,9 пункта, а не 8,2 — и направление этой поправки абсолютно предсказуемо, потому что число, которое подтачивается, — это всегда то, что пришло из лаборатории, которой есть что доказывать.

В этом и заключается вся проблема сравнения, которое обещает заголовок этой статьи, и именно поэтому первая половина этого материала посвящена происхождению, а не оценкам. Reflection Beam — это разреженная модель смеси экспертов на 501 миллиард параметров, из которых 23 миллиарда активны на каждый токен, анонсированная 5 октября 2026 года компанией Reflection AI; бета-эндпоинт, совместимый с OpenAI, заработал в тот же день. Kimi K3 — это флагманская открытая модель Moonshot AI, указанная в нашем собственном каталоге с датой выпуска 15 июля 2026 года и независимо оценённая Artificial Analysis. Одна из них — готовый продукт с тарифной сеткой и прогоном в сторонней испытательной системе; другая — бета-версия в листе ожидания, чьи веса, технический отчёт и цена пока не существуют. Сравнивать их — не симметричное упражнение, и если делать вид, что это не так, получится страница, которая выглядит точной, но является ошибочной.

Тридцатисекундная версия

• Beam на бумаге быстрее в расчёте на FLOP, на практике цена не определена, а результаты не воспроизведены. Kimi K3 оценивается третьей стороной, стоит $3.00 за входные и $15.00 за выходные данные за миллион токенов и общедоступна.

• На единственном бенчмарке, на котором прогоняли оба — Terminal-Bench 2.1, — честный разрыв составляет около пяти пунктов, а не восьми, если показатели каждой из сторон получены с помощью нейтрального испытательного стенда.

• Настоящие преимущества Beam носят структурный, а не числовой характер: профиль обслуживания с 23 млрд активных параметров и обещанная лицензия Apache 2.0. Ни то, ни другое нельзя использовать сегодня.

• Если модель нужна вам уже на этой неделе, это не подбрасывание монеты. Это одна готовая модель и один список ожидания.

Что Reflection на самом деле опубликовал и против кого

В посте Reflection о запуске приводится одна таблица с оценками против семи других моделей: Inkling, Nemotron 3 Ultra, GLM 5.2, GLM 5.3, Kimi K3, Qwen 3.8 Max и DeepSeek V4.1 Flash. Каждая цифра в таблице заявлена производителем, ни одна не была независимо воспроизведена, а страницы Artificial Analysis для Reflection Beam не существует — страница модели на их сайте выдаёт 404 по состоянию на 6 октября 2026 года. Несколько ячеек в оригинале помечены NR, потому что модель не тестировали.

Вот весь срез той таблицы, посвящённый сравнению Beam и K3, по одной строке на каждое измерение:

• Terminal-Bench 2.1 — Beam 80,1 против Kimi K3 88,3

• SWE-Bench Pro v2-Hard — Beam 77,2 против Kimi K3 88,2

• DeepSWE v1.1 — Beam 44.4 против Kimi K3 68.0

• SWE Atlas: вопросы и ответы по кодовой базе — Beam 34,6 против Kimi K3 68,0

• HLE, без инструментов — Beam 36.2 против Kimi K3 46.9

• GPQA Diamond — Beam 90,5 против Kimi K3 93,5

• SciCode — Beam 49,7 против Kimi K3 58,7

• MCP Atlas — Beam 78.7 против Kimi K3 82.3

• BrowseComp с управлением контекстом — Beam 77.4 против Kimi K3 91.2

• DeepSearchQA с управлением контекстом — Beam 80.1 vs Kimi K3 95.0

Прочитайте этот список честно — и форма запуска проявится. Reflection нигде не заявляет о победе над K3. Он претендует на то, чтобы оказаться почти на вершине эшелона, тратя в три-четыре раза меньше вычислительных ресурсов на инференс, чем GLM 5.2, при сопоставимых показателях рассуждения, — а единственная строка, где две модели близки, Terminal-Bench 2.1, — это строка, в которой сравнение наименее заслуживает доверия.

Почему тестовый стенд важнее оценки

Название бенчмарка — это ярлык, а не спецификация. Terminal-Bench 2.1 означает определённый набор задач, выполняемых в рамках определённого агентного скаффолда, с определённой политикой повторных попыток, определённым бюджетом токенов и определённой настройкой усилия рассуждения. Две лаборатории могут обе честно сообщить показатель «Terminal-Bench 2.1» и получить числа, которые не сопоставимы, потому что скаффолд и настройка усилия — это то, где заключена большая часть разброса. Artificial Analysis существует как организация именно из-за этого: она запускает один харнесс, в одной конфигурации, для множества моделей, чтобы её числа можно было вычитать друг из друга.

Итак, 80,1, которое Reflection выводит для Beam, — это вендорское число на вендорском стенде, а 88,3, которое она выводит для K3, — также вендорское число, где вендор — сама Reflection, измеряющая собственного конкурента. Вторая цифра — самое ненадёжное число в строке: лаборатория, прогоняющая веса конкурента на собственной обвязке, не имеет ни стимула прогонять их в наилучшей конфигурации конкурента, ни обязательства раскрывать ту, которую выбрала. В этом нет ничего нечестного; это просто число, чьё происхождение не оправдывает того веса, который придало ему освещение.

Собственный прогон Artificial Analysis показывает Kimi K3 с результатом 85.02 на Terminal-Bench 2.1, а также 12.6 на Terminal-Bench v4.0 — другом, более сложном тесте, — индексом AA Coding Index 76.2 (9-е место среди моделей в таблице), Intelligence Index 43.6, GPQA Diamond 93.5, HLE 46.9, SciCode 59.5, tau-banking 45.98 и Long-Context Recall 88.7. Эти цифры считаны с карточки K3 в каталоге в нашей собственной системе, источник — artificialanalysis.ai, а снимок оценки датирован 15 июля 2026 года. У Beam в этой вселенной из чисел есть только одно, и оно взято из Reflection. Это отсутствие должно быть временным, а не постоянным: Artificial Analysis заявила, что Reflection предоставила ей доступ и что она проводит бенчмаркинг модели, а её собственная ранняя формулировка — что Beam «станет одной из самых токен-эффективных открытых моделей, которые мы видели при таком уровне интеллекта» — это сигнал ожидания от бенчмарк-организации, а не сообщение о результате. Пока этот результат не опубликован, числа из этой статьи нельзя вычитать, и мы не собираемся делать вид, что это не так.

A two-column infographic titled 'Reflection Beam vs Kimi K3 - the scoreboard'. The left column 'Reflection Beam' reads 'Terminal-Bench 2.1: 80.1 vendor', 'Context window: 256K beta', 'Input modality: text only', 'Price per 1M tokens: not published', 'Cache reads: none documented', 'AA Intelligence Index: none'. The right column 'Kimi K3' reads 'Terminal-Bench 2.1: 88.3 vendor, 85.0 independent', 'Context window: 1.05M', 'Input modality: text + image', 'Price per 1M tokens: 3.00 / 15.00', 'Cache reads: 0.30', 'AA Intelligence Index: 43.6'. A footer reads 'Beam figures vendor-reported and unreproduced; K3 figures per Artificial Analysis and MoonshotAI's published rate card.' The OrcaRouter logo is composited in the bottom-right corner.

Сколько стоит каждый из них и что каждый из них собой представляет

Сравнение затрат не близко, и это вообще не сравнение, потому что одна его сторона пуста.

• Цена — Kimi K3: $3.00 за вход / $15.00 за выход за миллион токенов, при этом чтение из кэша — $0.30, против Reflection Beam: цена нигде не опубликована — ни в блоге Reflection, ни в документации, ни в списке моделей, а консоль платформы скрыта за регистрацией.

• Контекст — 1 048 576 токенов в Kimi K3 против 256 000 в бета-версии Beam, со сноской в собственной документации Beam, которая гласит: «окно контекста может меняться во время бета-тестирования».

• Модальность — Kimi K3 принимает текст и изображения; Reflection Beam работает по схеме «текст на входе — текст на выходе», без поддержки изображений или аудио на момент запуска.

• Доступность — Kimi K3 уже общедоступна сегодня; Reflection Beam — бета-версия с листом ожидания, веса обещаны позднее в октябре под лицензией Apache 2.0.

• Независимые оценки — у K3 есть полная строка Artificial Analysis; у Beam её нет.

• Профиль сервинга — Kimi K3 — это крупная почти плотная фронтирная модель со скоростью 46,8 выходных токенов в секунду по нашим собственным измерениям в плейграунде за прошедшую неделю; 23 млрд активных параметров Beam — это настоящий архитектурный аргумент в пользу более низкой задержки и более низкой стоимости за токен, но нет публично доступного эндпоинта, на котором это можно было бы измерить.

Утверждение об эффективности заслуживает ещё одного предложения осторожности, ведь это главный заголовок запуска, и оно делает больше работы, чем способно выдержать. «В 3–4 раза меньше вычислений на инференс» у Reflection взято из графика, который приближённо оценивает FLOPs как удвоенное число активных параметров, умноженное на среднее число сгенерированных токенов. Эта формула намеренно исключает префилл промпта, затраты на внимание и накладные расходы на обслуживание — те части счёта, которые доминируют в агентной работе с длинным контекстом. Это грубая прикидка вычислительного соотношения, а не измерение, не цифра в долларах, и она была построена самим вендором. Воспринимайте это как гипотезу, которую веса позволят проверить кому-то другому.

Где располагается OrcaRouter в этом

Kimi K3 — один из наших маршрутов. Он указан по цене $3.00 за вход и $15.00 за выход за миллион токенов, а чтение из кэша — $0.30, и это тариф провайдера Moonshot, переданный как есть, без каких-либо надбавок, так что если Moonshot изменит свой прайс-лист, цифра на нашей странице изменится в тот же день, а не когда-нибудь, когда обновится реселлер. Вызвать его можно с одного ключа, совместимого с OpenAI, наравне с более чем 200 другими моделями, и здесь это важно по конкретной причине: честный ответ на вопрос «Beam или K3?» — команде, которая хеджирует риски, выбирать не стоит. Потому что автоматическое переключение при сбое — это часть маршрутизации, а не то, что вы строите сами, и такая модель, как Beam — бета-версия, без цены, без оценок от третьих сторон, — именно то, что вы пускаете на долю трафика, а не на свой критический путь. По умолчанию вы направляете работу в K3, отправляете Beam небольшую долю, когда приходит приглашение из листа ожидания, и позволяете маршрутизации вернуться к K3 при ошибке. Это решение, которое можно принять о непроверенной модели. Ставить на неё производственный путь — нет.

A screenshot of the OrcaRouter model page for kimi/kimi-k3, showing the model name, a 1,048,576-token context, text and image input, tool and reasoning support, and pricing of $3.00 input and $15.00 output per million tokens with an 8.63 s median time to first token.

Что могло бы изменить этот вердикт?

Три вещи, в порядке убывания их значимости.

Цена. Если Beam окажется ниже уровня K3, аргумент об эффективности станет конкретным, а не теоретическим. Во-вторых, веса. Apache 2.0 вместе с техническим отчётом позволили бы любому, у кого есть пара узлов, измерить количество токенов в секунду на GPU при фиксированной планке качества — тест, который действительно позволяет проверить утверждение о вычислениях. В-третьих, прогон на стороннем испытательном стенде. Reflection предоставила Artificial Analysis доступ, и по результатам этого ожидается оценка; пока эта цифра не опубликована, любая фигурирующая в обращении цифра сравнения Beam с K3 восходит к документу, написанному одним из двух вендоров.

Два вопроса, на которые стоит ответить напрямую

Reflection Beam лучше, чем Kimi K3?

Судя по доступным на сегодня данным — нет, и никто не публиковал доказательств того, что это так. В собственной таблице Reflection K3 опережает по всем десяти общим строкам, приведённым выше, причём по нескольким из них — с разрывами (SWE Atlas 34,6 против 68,0, DeepSearchQA 80,1 против 95,0), которые нельзя назвать близкими. Довод Beam — это стоимость за единицу возможностей, но этот довод остаётся нарисованным вендором графиком, пока не появятся веса и цена.

Стоит ли мне дождаться весов Beam, прежде чем строить на K3?

Только если самохостинг — это требование, а не предпочтение, потому что это единственная ось, по которой эти двое не являются взаимозаменяемыми — K3 доступен только через API, тогда как Beam обещает веса под Apache 2.0. Если вы вызываете API, K3 доступен, имеет оценки и цену, а Beam — только лист ожидания. Не существует такого варианта этого решения, ради которого стоило бы задерживать проект.

A screenshot of the OrcaRouter models index page, showing the filter rail for input modality, context length, input price, status and series alongside a model grid headed '207 models, 16 providers, one API key, one bill' and a three-step panel explaining how to call any model through the OpenAI-compatible endpoint.

Reflection дал нам дату и график, а дата — это не модель. Единственное, что запуск действительно устанавливает, — это то, что модель с 501B параметрами, активирующая 23B параметров, может быть обучена так, чтобы находиться в пределах нескольких пунктов от открытого фронтира — что, если веса появятся и цифры подтвердятся, является значимым результатом об эффективности. Это пока не причина отказываться от модели, которую фактически измерила третья сторона.

© 2026 OrcaRouter

Провайдерам

Управляете инференс-платформой? Разместите свои модели на OrcaRouter.

providers@orcarouter.ai

Присоединяйтесь к сообществу

Discordsupport@orcarouter.aiXGitHubYouTube