
Reflection Beam против Kimi K3: одно и то же название бенчмарка, два разных испытательных стенда.
- openaiНОВИНКАOpenAI: GPT-6.1 Sol2026-09-2952Интеллект
- anthropicНОВИНКАAnthropic: Claude Sonnet 5.52026-09-2856Интеллект
- typesafeНОВИНКАTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 за 1 млн токенов · 150 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238Интеллект
- OpenAIOpenAI: GPT-6 Sol2026-09-2248Интеллект
- AnthropicAnthropic: Claude Opus 5.52026-09-2258Интеллект
- xAIGrok 4.72026-09-2146Интеллект
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 за 1 млн токенов · 98 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 за 1 млн токенов · 1202 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Интеллект
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Интеллект77Кодинг
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Интеллект76Кодинг
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Интеллект76Кодинг
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Интеллект82Кодинг
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 за 1 млн токенов · 52 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 за 1 млн токенов · 248 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Интеллект72Кодинг
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 за 1 млн токенов · 232 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Интеллект75Кодинг
- obsidianQwen3.8 27B2026-08-1534Интеллект68Кодинг
Reflection Beam набирает 80,1 в Terminal-Bench 2.1. Kimi K3 набирает 88,3. Поставьте эти две цифры рядом, как это сделало большинство материалов на этой неделе, и вы придёте к выводу, что Beam отстаёт примерно на восемь пунктов от лучшей открытой модели в этой области. Но эти два числа — не из одной и той же комнаты. 80,1 у Beam заявлено вендором и взято из таблицы в собственном посте Reflection о запуске. 88,3 у Kimi K3 тоже заявлено вендором, на этот раз из собственной таблицы Moonshot — а таблица вендора публикует оценку конкурента только тогда, когда она была получена на собственном стенде вендора, с его собственным набором промптов и его собственным значением параметра усилий. Третья сторона, Artificial Analysis, с тех пор запустила Kimi K3 на бенчмарке с тем же названием и опубликовала 85,0. Это разрыв в 4,9 пункта, а не 8,2 — и направление этой поправки абсолютно предсказуемо, потому что число, которое подтачивается, — это всегда то, что пришло из лаборатории, которой есть что доказывать.
В этом и заключается вся проблема сравнения, которое обещает заголовок этой статьи, и именно поэтому первая половина этого материала посвящена происхождению, а не оценкам. Reflection Beam — это разреженная модель смеси экспертов на 501 миллиард параметров, из которых 23 миллиарда активны на каждый токен, анонсированная 5 октября 2026 года компанией Reflection AI; бета-эндпоинт, совместимый с OpenAI, заработал в тот же день. Kimi K3 — это флагманская открытая модель Moonshot AI, указанная в нашем собственном каталоге с датой выпуска 15 июля 2026 года и независимо оценённая Artificial Analysis. Одна из них — готовый продукт с тарифной сеткой и прогоном в сторонней испытательной системе; другая — бета-версия в листе ожидания, чьи веса, технический отчёт и цена пока не существуют. Сравнивать их — не симметричное упражнение, и если делать вид, что это не так, получится страница, которая выглядит точной, но является ошибочной.
Тридцатисекундная версия
• Beam на бумаге быстрее в расчёте на FLOP, на практике цена не определена, а результаты не воспроизведены. Kimi K3 оценивается третьей стороной, стоит $3.00 за входные и $15.00 за выходные данные за миллион токенов и общедоступна.
• На единственном бенчмарке, на котором прогоняли оба — Terminal-Bench 2.1, — честный разрыв составляет около пяти пунктов, а не восьми, если показатели каждой из сторон получены с помощью нейтрального испытательного стенда.
• Настоящие преимущества Beam носят структурный, а не числовой характер: профиль обслуживания с 23 млрд активных параметров и обещанная лицензия Apache 2.0. Ни то, ни другое нельзя использовать сегодня.
• Если модель нужна вам уже на этой неделе, это не подбрасывание монеты. Это одна готовая модель и один список ожидания.
Что Reflection на самом деле опубликовал и против кого
В посте Reflection о запуске приводится одна таблица с оценками против семи других моделей: Inkling, Nemotron 3 Ultra, GLM 5.2, GLM 5.3, Kimi K3, Qwen 3.8 Max и DeepSeek V4.1 Flash. Каждая цифра в таблице заявлена производителем, ни одна не была независимо воспроизведена, а страницы Artificial Analysis для Reflection Beam не существует — страница модели на их сайте выдаёт 404 по состоянию на 6 октября 2026 года. Несколько ячеек в оригинале помечены NR, потому что модель не тестировали.
Вот весь срез той таблицы, посвящённый сравнению Beam и K3, по одной строке на каждое измерение:
• Terminal-Bench 2.1 — Beam 80,1 против Kimi K3 88,3
• SWE-Bench Pro v2-Hard — Beam 77,2 против Kimi K3 88,2
• DeepSWE v1.1 — Beam 44.4 против Kimi K3 68.0
• SWE Atlas: вопросы и ответы по кодовой базе — Beam 34,6 против Kimi K3 68,0
• HLE, без инструментов — Beam 36.2 против Kimi K3 46.9
• GPQA Diamond — Beam 90,5 против Kimi K3 93,5
• SciCode — Beam 49,7 против Kimi K3 58,7
• MCP Atlas — Beam 78.7 против Kimi K3 82.3
• BrowseComp с управлением контекстом — Beam 77.4 против Kimi K3 91.2
• DeepSearchQA с управлением контекстом — Beam 80.1 vs Kimi K3 95.0
Прочитайте этот список честно — и форма запуска проявится. Reflection нигде не заявляет о победе над K3. Он претендует на то, чтобы оказаться почти на вершине эшелона, тратя в три-четыре раза меньше вычислительных ресурсов на инференс, чем GLM 5.2, при сопоставимых показателях рассуждения, — а единственная строка, где две модели близки, Terminal-Bench 2.1, — это строка, в которой сравнение наименее заслуживает доверия.
Почему тестовый стенд важнее оценки
Название бенчмарка — это ярлык, а не спецификация. Terminal-Bench 2.1 означает определённый набор задач, выполняемых в рамках определённого агентного скаффолда, с определённой политикой повторных попыток, определённым бюджетом токенов и определённой настройкой усилия рассуждения. Две лаборатории могут обе честно сообщить показатель «Terminal-Bench 2.1» и получить числа, которые не сопоставимы, потому что скаффолд и настройка усилия — это то, где заключена большая часть разброса. Artificial Analysis существует как организация именно из-за этого: она запускает один харнесс, в одной конфигурации, для множества моделей, чтобы её числа можно было вычитать друг из друга.
Итак, 80,1, которое Reflection выводит для Beam, — это вендорское число на вендорском стенде, а 88,3, которое она выводит для K3, — также вендорское число, где вендор — сама Reflection, измеряющая собственного конкурента. Вторая цифра — самое ненадёжное число в строке: лаборатория, прогоняющая веса конкурента на собственной обвязке, не имеет ни стимула прогонять их в наилучшей конфигурации конкурента, ни обязательства раскрывать ту, которую выбрала. В этом нет ничего нечестного; это просто число, чьё происхождение не оправдывает того веса, который придало ему освещение.
Собственный прогон Artificial Analysis показывает Kimi K3 с результатом 85.02 на Terminal-Bench 2.1, а также 12.6 на Terminal-Bench v4.0 — другом, более сложном тесте, — индексом AA Coding Index 76.2 (9-е место среди моделей в таблице), Intelligence Index 43.6, GPQA Diamond 93.5, HLE 46.9, SciCode 59.5, tau-banking 45.98 и Long-Context Recall 88.7. Эти цифры считаны с карточки K3 в каталоге в нашей собственной системе, источник — artificialanalysis.ai, а снимок оценки датирован 15 июля 2026 года. У Beam в этой вселенной из чисел есть только одно, и оно взято из Reflection. Это отсутствие должно быть временным, а не постоянным: Artificial Analysis заявила, что Reflection предоставила ей доступ и что она проводит бенчмаркинг модели, а её собственная ранняя формулировка — что Beam «станет одной из самых токен-эффективных открытых моделей, которые мы видели при таком уровне интеллекта» — это сигнал ожидания от бенчмарк-организации, а не сообщение о результате. Пока этот результат не опубликован, числа из этой статьи нельзя вычитать, и мы не собираемся делать вид, что это не так.

Сколько стоит каждый из них и что каждый из них собой представляет
Сравнение затрат не близко, и это вообще не сравнение, потому что одна его сторона пуста.
• Цена — Kimi K3: $3.00 за вход / $15.00 за выход за миллион токенов, при этом чтение из кэша — $0.30, против Reflection Beam: цена нигде не опубликована — ни в блоге Reflection, ни в документации, ни в списке моделей, а консоль платформы скрыта за регистрацией.
• Контекст — 1 048 576 токенов в Kimi K3 против 256 000 в бета-версии Beam, со сноской в собственной документации Beam, которая гласит: «окно контекста может меняться во время бета-тестирования».
• Модальность — Kimi K3 принимает текст и изображения; Reflection Beam работает по схеме «текст на входе — текст на выходе», без поддержки изображений или аудио на момент запуска.
• Доступность — Kimi K3 уже общедоступна сегодня; Reflection Beam — бета-версия с листом ожидания, веса обещаны позднее в октябре под лицензией Apache 2.0.
• Независимые оценки — у K3 есть полная строка Artificial Analysis; у Beam её нет.
• Профиль сервинга — Kimi K3 — это крупная почти плотная фронтирная модель со скоростью 46,8 выходных токенов в секунду по нашим собственным измерениям в плейграунде за прошедшую неделю; 23 млрд активных параметров Beam — это настоящий архитектурный аргумент в пользу более низкой задержки и более низкой стоимости за токен, но нет публично доступного эндпоинта, на котором это можно было бы измерить.
Утверждение об эффективности заслуживает ещё одного предложения осторожности, ведь это главный заголовок запуска, и оно делает больше работы, чем способно выдержать. «В 3–4 раза меньше вычислений на инференс» у Reflection взято из графика, который приближённо оценивает FLOPs как удвоенное число активных параметров, умноженное на среднее число сгенерированных токенов. Эта формула намеренно исключает префилл промпта, затраты на внимание и накладные расходы на обслуживание — те части счёта, которые доминируют в агентной работе с длинным контекстом. Это грубая прикидка вычислительного соотношения, а не измерение, не цифра в долларах, и она была построена самим вендором. Воспринимайте это как гипотезу, которую веса позволят проверить кому-то другому.
Где располагается OrcaRouter в этом
Kimi K3 — один из наших маршрутов. Он указан по цене $3.00 за вход и $15.00 за выход за миллион токенов, а чтение из кэша — $0.30, и это тариф провайдера Moonshot, переданный как есть, без каких-либо надбавок, так что если Moonshot изменит свой прайс-лист, цифра на нашей странице изменится в тот же день, а не когда-нибудь, когда обновится реселлер. Вызвать его можно с одного ключа, совместимого с OpenAI, наравне с более чем 200 другими моделями, и здесь это важно по конкретной причине: честный ответ на вопрос «Beam или K3?» — команде, которая хеджирует риски, выбирать не стоит. Потому что автоматическое переключение при сбое — это часть маршрутизации, а не то, что вы строите сами, и такая модель, как Beam — бета-версия, без цены, без оценок от третьих сторон, — именно то, что вы пускаете на долю трафика, а не на свой критический путь. По умолчанию вы направляете работу в K3, отправляете Beam небольшую долю, когда приходит приглашение из листа ожидания, и позволяете маршрутизации вернуться к K3 при ошибке. Это решение, которое можно принять о непроверенной модели. Ставить на неё производственный путь — нет.

Что могло бы изменить этот вердикт?
Три вещи, в порядке убывания их значимости.
Цена. Если Beam окажется ниже уровня K3, аргумент об эффективности станет конкретным, а не теоретическим. Во-вторых, веса. Apache 2.0 вместе с техническим отчётом позволили бы любому, у кого есть пара узлов, измерить количество токенов в секунду на GPU при фиксированной планке качества — тест, который действительно позволяет проверить утверждение о вычислениях. В-третьих, прогон на стороннем испытательном стенде. Reflection предоставила Artificial Analysis доступ, и по результатам этого ожидается оценка; пока эта цифра не опубликована, любая фигурирующая в обращении цифра сравнения Beam с K3 восходит к документу, написанному одним из двух вендоров.
Два вопроса, на которые стоит ответить напрямую
Reflection Beam лучше, чем Kimi K3?
Судя по доступным на сегодня данным — нет, и никто не публиковал доказательств того, что это так. В собственной таблице Reflection K3 опережает по всем десяти общим строкам, приведённым выше, причём по нескольким из них — с разрывами (SWE Atlas 34,6 против 68,0, DeepSearchQA 80,1 против 95,0), которые нельзя назвать близкими. Довод Beam — это стоимость за единицу возможностей, но этот довод остаётся нарисованным вендором графиком, пока не появятся веса и цена.
Стоит ли мне дождаться весов Beam, прежде чем строить на K3?
Только если самохостинг — это требование, а не предпочтение, потому что это единственная ось, по которой эти двое не являются взаимозаменяемыми — K3 доступен только через API, тогда как Beam обещает веса под Apache 2.0. Если вы вызываете API, K3 доступен, имеет оценки и цену, а Beam — только лист ожидания. Не существует такого варианта этого решения, ради которого стоило бы задерживать проект.

Reflection дал нам дату и график, а дата — это не модель. Единственное, что запуск действительно устанавливает, — это то, что модель с 501B параметрами, активирующая 23B параметров, может быть обучена так, чтобы находиться в пределах нескольких пунктов от открытого фронтира — что, если веса появятся и цифры подтвердятся, является значимым результатом об эффективности. Это пока не причина отказываться от модели, которую фактически измерила третья сторона.
