Сгенерированная hero-карточка с заголовком «Reflection Beam: 501 млрд параметров, 23 млрд активных» и подзаголовком «Разреженный MoE / 23,8 трлн токенов предобучения / контекст API на 256K токенов / веса обещаны в этом месяце / каждый показатель — со слов вендора». Под текстом расположены три плоские линейные иконки: послойная диаграмма, на которой большинство слоёв затемнены, а один выделен; стойка из девяти серверных блоков; контур документа с маленьким навесным замком. Логотип OrcaRouter наложен в правом нижнем углу.
Guides & Insights

Reflection Beam, объяснение: 501B параметров, 23B активных и веса, которые ещё не выпущены

Автор

Alistair Wren

Дата публикации

Новые модели · 20Все модели →
Бенчмарки: Artificial Analysis · обновляется ежедневно
Назад ко всем статьям

5 октября 2026 года Reflection объявила о выпуске Reflection Beam — разреженной языковой модели на основе смеси экспертов с 501 миллиардом общих параметров, из которых на каждый токен активируются 23 миллиарда, — и в тот же день открыла к ней бета-эндпоинт, совместимый с OpenAI. Это 4,6 процента модели, бодрствующих в любой момент времени, — агрессивное соотношение даже по меркам нынешней области открытых весов, и именно на этом числе держится весь запуск. Reflection говорит, что полные веса, технический отчёт и карточка модели появятся позже в этом месяце под лицензией Apache 2.0. На сегодня их нет, цена не опубликована нигде на собственных ресурсах Reflection, а у Artificial Analysis нет строки для этой модели. Так что честное резюме запуска таково: весьма конкретное утверждение об эффективности, сделанное лабораторией, обучившей модель, причём все подкрепляющие цифры предоставлены этой же лабораторией.

Собственные сравнительные таблицы Reflection сравнивают Reflection Beam с Inkling, Nemotron 3 Ultra, GLM 5.2, GLM 5.3, Kimi K3, Qwen3.8 Max и DeepSeek V4.1 Flash, что является справедливой картиной уровня, на который он нацелен: сильные, но не передовые открытые и полуоткрытые модели, некоторые из них — лишь малая часть размера Beam. Beam не превосходит это поле по сырым возможностям, и мы покажем вам точно, где он проигрывает. Он утверждает, что попадает в верхнюю часть этого списка, затрачивая при этом примерно в три-четыре раза меньше вычислительных ресурсов на инференс, чем GLM 5.2, при сопоставимых показателях рассуждений. В этом утверждении и заключается суть статьи.

Что на самом деле существует сегодня

Всё в этом разделе — из собственной документации Reflection, прочитанной 6 октября 2026 года. API работает в бета-режиме и доступен по списку ожидания; веса ещё не выпущены.

• Идентификатор модели — Beam-501B-A23B, создана 5 октября 2026 г.

• Интерфейс — совместимая с OpenAI поверхность по адресу api.reflection.ai/openai/v1, предоставляющая Chat Completions и список Models, и ничего больше. Никаких Completions, никаких эмбеддингов, никаких батчей.

• Контекст — 256 000 токенов, со сноской, прикреплённой к самой цифре: «Окно контекста может измениться во время бета-тестирования». Максимальный объём вывода — 128 000 токенов.

• Рассуждения — параметр reasoning_effort с пятью значениями: low, medium, high, xhigh и max. По умолчанию используется medium, и модель всегда рассуждает независимо от настройки — отключить это нельзя.

• Модальность — текст на входе, текст на выходе. На момент запуска нет ввода изображений или аудио, что действительно отличает её от Inkling — модели, ориентированной в первую очередь на мультимодальность, которую Thinking Machines Миры Мурати выпустила в июле.

• Отсечка знаний — 30 июня 2026 г.

• Цена — не опубликована. Ни в блог-посте Reflection, ни в его документации, ни в листинге модели она не указана, а консоль платформы скрыта за стеной регистрации.

Эта последняя строка значит больше, чем кажется. У каждой другой модели в сравнительном наборе Beam есть публичная цена по прайс-листу, которую уже сегодня можно вставить в электронную таблицу. У Beam её нет, а значит, любой спор о затратах на неё прямо сейчас — это спор о вычислительных ресурсах, а не о долларах.

A single-column infographic titled 'Reflection Beam - the scoreboard' with six rows reading 'Total / active parameters: 501B / 23B', 'Pre-training: 23.8T tokens on 6,144 GB300', 'API context: 256,000 tokens (beta footnote)', 'Reasoning effort: five levels, default medium', 'Price: not published anywhere' and 'Independent scores: none - no Artificial Analysis row'. A footer reads 'Vendor-reported; no independent reproduction. Weight release promised for later this month.' The OrcaRouter logo is composited in the bottom-right corner.

Соотношение 501 к 23 — это и есть аргумент.

Разреженность — не новость; вопрос в том, насколько далеко лаборатория готова её продвинуть. GLM 5.2 задействует примерно 40 миллиардов активных параметров из общего числа, которое, как сообщается, составляет порядка 744 миллиардов — около 5,4 процента. У Reflection Beam этот показатель составляет 4,6 процента из 501 миллиарда. На бумаге это скромный следующий шаг, и Reflection осторожна в своих заявлениях на этот счёт.

Показатель эффективности в посте о запуске взят из графика, построенного на данных Artificial Analysis и DataCurve, где оценка reasoning сопоставляется с оценочными inference FLOPs, причём FLOPs приблизительно равны удвоенному числу активных параметров, умноженному на среднее количество сгенерированных токенов. Эта формула намеренно исключает prefill промпта, затраты на attention и накладные расходы на обслуживание. Это прикидочная модель, а не измерение, и Reflection не подаёт её как измерение — но это ещё и единственное количественное подкрепление заявления «в 3–4 раза дешевле при том же результате», и написано оно самим вендором. Относитесь к этому как к гипотезе, которую, когда появятся веса, сможет проверить кто-то другой.

Что архитектура даёт на практике — это профиль обслуживания. Двадцать три миллиарда активных параметров — это модель, которую можно запускать на сравнительно небольшом числе GPU с интерактивной задержкой, и это другой продукт, нежели плотная модель на 501 миллиард параметров, даже если количество параметров на карте одинаковое. Именно поэтому Reflection может говорить о рассуждениях, близких к передовому уровню, не говоря о развёртывании масштаба дата-центра.

Меньше четырёх недель на предварительное обучение, и раскрытие информации необычно конкретно.

Отчёт об обучении — это та часть релиза, которая читается как действительно информативная, потому что Reflection опубликовала цифры, которые большинство лабораторий оставляют внутренними.

Предварительное обучение — 23,8 триллиона токенов на 6 144 чипах GB300 в стойках NVL72, завершено менее чем за четыре недели при заявленном показателе полезной производительности (goodput) 92,3 процента, с девятью откатами к контрольным точкам по пути.

• Обучение с подкреплением — 10 500 чипов GB300 в течение четырёх недель, более 100 миллионов роллаутов, максимальный контекст роллаута — 256 000 токенов, примерно 1,3 млрд песочниц и около миллиона различных сред, при этом в среднем одновременно выполнялось 110 000 роллаутов.

• Промежуточное обучение — расширяет эффективный контекст модели до 1 миллиона токенов.

• Стабильность — асинхронные градиенты политики, остающиеся стабильными при устаревании в масштабе дней, а также управляемый штраф за длину, позволяющий настраивать длину рассуждений без переобучения.

Прочитайте строки о предобучении и RL вместе — и форма утверждения проявится. История об эффективности не только об активных параметрах при инференсе; она также о том, как быстро обучалась модель и какая доля вычислений ушла на привязанное к средам RL, а не на дополнительные токены. Миллион сред и 1,3 миллиарда песочниц — это заявление об инфраструктуре для использования инструментов и агентного обучения, и оно согласуется с бенчмарками, с которых Reflection решила начать.

Одно число заслуживает пометки. В блоге говорится, что мидтрейнинг расширяет эффективный контекст до 1 миллиона токенов; в документации API указан лимит обслуживания в 256 000 токенов со сноской о бета-версии. Это возможность на стороне обучения и ограничение на стороне обслуживания, а не противоречие — но этот разрыв — как раз то, что становится заголовком «контекст 1M», если никто не читает второй документ, а тот, кто на следующей неделе будет писать о Beam, должен прочитать второй документ.

A screenshot of the Artificial Analysis language-model leaderboard, showing the ranked Intelligence Index table with per-model scores. No Reflection Beam row is present - the model is absent from the board, which is the point of the capture.

Бенчмарки: где Reflection Beam выигрывает, а где нет

Все приведённые ниже цифры заявлены вендором, взяты из таблиц в посте Reflection о запуске, и ни одна из них не была независимо воспроизведена. В столбцах сравнения — те же цифры, которые Reflection опубликовала для других моделей; там, где в оригинале в ячейке стоит «NR», модель не запускали. В Artificial Analysis нет строки для Beam, поэтому ничто из этого не проходило через сторонний испытательный стенд.

Агентное программирование

• Terminal-Bench v2.1 — Beam 80,1 против GLM 5.2 81,0, GLM 5.3 88,2, Kimi K3 88,3, Qwen3.8 Max 86,6, DeepSeek V4.1 Flash 90,6, Inkling 63,8, Nemotron 3 Ultra 56,4.

• SWE-Bench Pro v1 — Beam 65.5 против Qwen3.8 Max 67.7, GLM 5.2 62.1, Inkling 54.3, Nemotron 3 Ultra 46.4.

• SWE-Bench Pro v2-Hard — Beam 77,2 против Kimi K3 88,2, GLM 5.3 84,3, Inkling 56,9.

• SWE-Bench Verified — Beam 80,9 против Inkling 77,6, Nemotron 3 Ultra 70,7.

• SWE-Bench Multilingual — Beam 78,0 против Nemotron 3 Ultra 67,7.

• DeepSWE v1.1 — Beam 44,4 против DeepSeek V4.1 Flash 74,2, Kimi K3 68,0, GLM 5.3 61,0, Qwen3.8 Max 51,0, GLM 5.2 44,0.

• SWE Atlas Codebase QnA — Beam 34.6 против Kimi K3 68.0, GLM 5.3 61.0.

Вот на последней строке и стоит остановиться. Ответы на вопросы по репозиторию с длинным горизонтом — это случай, когда модель должна удерживать кодовую базу в голове на протяжении долгого взаимодействия, и 34,6 против 68,0 — это не разница из-за округления. DeepSWE рассказывает похожую историю: 44,4 ставит Beam на один уровень с GLM 5.2 и далеко позади DeepSeek V4.1 Flash.

Рассуждение

• AIME 2026 — Beam 97.8 против GLM 5.2 99.2, Inkling 97.1.

• HLE, без инструментов — Beam 36,2 против Kimi K3 46,9, Qwen3.8 Max 43,6, GLM 5.3 42,3, GLM 5.2 40,5, DeepSeek V4.1 Flash 39,1, Inkling 29,7, Nemotron 3 Ultra 26,7.

• GPQA Diamond — Beam 90.5 против Kimi K3 93.5, Qwen3.8 Max 92.6, GLM 5.3 91.7, GLM 5.2 91.2, DeepSeek V4.1 Flash 90.9, Inkling 87.2, Nemotron 3 Ultra 87.

• SciCode — Beam 49,7 против GLM 5.3 59,0, Kimi K3 58,7, Qwen3.8 Max 52,1, DeepSeek V4.1 Flash 52,0, Inkling 46,1, Nemotron 3 Ultra 44,6.

• CriPT AA — Beam 16.3 против Kimi K3 23.4, GLM 5.2 20.9, Qwen3.8 Max 20.0, GLM 5.3 19.1, DeepSeek V4.1 Flash 14.3, Inkling 5.4, Nemotron 3 Ultra 3.1.

Профиль рассуждений Beam находится на среднем уровне, и закономерность устойчива: он уверенно опережает две модели предыдущего поколения из списка Reflection, но уступает текущей. GPQA Diamond на 90,5 — солидный результат, который обходят четыре другие модели.

• MCP Atlas — Beam 78,7 против Qwen3.8 Max 84,5, GLM 5.3 84,2, Kimi K3 82,3, GLM 5.2 77,8, Inkling 76,0, Nemotron 3 Ultra 63,1.

• AutomationBench, публичная часть — Beam 37.0 против DeepSeek V4.1 Flash 54.8, GLM 5.3 48.2, Kimi K3 46.7, Qwen3.8 Max 39.8, GLM 5.2 26.2.

• tau3 banking — Beam 38.0 против Qwen3.8 Max 55.2, GLM 5.2 37.1, Kimi K3 37.1, Inkling 25.0, Nemotron 3 Ultra 22.6.

• BrowseComp с управлением контекстом — Beam 77,4 против Kimi K3 91,2, Inkling 77,1, Nemotron 3 Ultra 44,4.

• DeepSearchQA с управлением контекстом — Beam 80.1 против Kimi K3 95.0.

Reflection также показала в посте два демо возможностей: 95,5 процента решённых задач в головоломке «Land or Water» — сетка 180 на 90 с 16 200 точками, требующая удержания большого состояния доски, — цифра, которая располагается между 92,5 и 97,8 процента, которые Reflection приписывает Opus 5 и Fable 5 на той же задаче, — и дообучение Text2SQL для самой маленькой Gemma-4, поднявшее точность на отложенной выборке до 66,5 процента. Демо тщательно отобраны; они показывают, что модель способна на что-то, а не как часто.

Что вы можете сделать с этим сегодня и на что не стоит рассчитывать

Сегодня в целом возможно ровно одно: запросить бета-доступ и вызывать Beam-501B-A23B через собственный эндпоинт Reflection с клиентом, совместимым с OpenAI. Опубликованной цены нет, поэтому невозможно смоделировать стоимость рабочей нагрузки на нём. Весов нет, поэтому нет ни самостоятельного развёртывания, ни квантования, ни тонкой настройки, ни воспроизводимости силами третьих сторон. Нет независимой строки в бенчмарке, поэтому вся приведённая выше картина производительности опирается на таблицы одной лаборатории.

Reflection Beam — не один из наших маршрутов. Мы не собираемся намекать на обратное и не станем отправлять вас к реселлеру, у которого он, возможно, есть. Что мы можем сказать — так это сколько стоит сравнительный набор, потому что четыре из этих моделей мы маршрутизируем, и цифры ниже сняты живьём из нашего собственного каталога сегодня утром: GLM 5.2 — $1,40 на входе и $4,40 на выходе за миллион токенов, GLM 5.3 — $1,26 и $3,96, Qwen3.8 Max — $2,00 и $6,00, а DeepSeek V4.1 Flash — $0,15 и $0,60. Это настоящий разброс — DeepSeek V4.1 Flash почти в десять раз дешевле на входе, чем GLM 5.2, — и именно поэтому бета-модель без цены трудно вписать в процесс принятия решения. OrcaRouter работает через один ключ, совместимый с OpenAI, который даёт доступ к этим и ещё более 200 другим моделям, при этом прайс-лист провайдера передаётся как есть, без надбавок, — а значит, изменение цены у вендора вступает в силу у нас в тот же день, а не тогда, когда реселлер обновит свои данные. И поскольку автоматический переход при отказе — это часть маршрутизации, а не то, что вы строите сами, новая и непроверенная модель — как раз то, что можно пустить на часть трафика, а не на критический путь, — и это единственный ответственный способ использовать нечто, чьи бенчмарки ещё никто не воспроизвёл.

A screenshot of the OrcaRouter model page for z-ai/glm-5.2, showing the model name, the pass-through list price of $1.40 per million input tokens and $4.40 per million output tokens, the 1,000,000-token context window and the release date 2026-06-16.

На что обратить внимание, прежде чем воспринимать заявление об эффективности всерьёз

Три вещи решат этот вопрос, и две из них обещаны в течение месяца.

Первое — это веса. Apache 2.0 и технический отчёт позволили бы любому, у кого есть пара узлов, измерить то, что действительно важно, — токенов в секунду на GPU при фиксированной планке качества, и действительно ли 23 миллиарда активных параметров обеспечивают показатель «очков на FLOP», который подразумевает график. А до тех пор аргумент об эффективности — это арифметика на салфетке.

Второе — это цена. Модель без прейскурантной цены не может участвовать в сравнении затрат, и если Beam окажется выше уровня GLM и DeepSeek, то история с вычислениями перестанет иметь значение для всех, у кого есть бюджет. Если же она окажется ниже, картина быстро меняется.

Третье — это третья сторона, запускающая этот набор тестов. Каждое число выше взято из одного и того же документа, и таблица, представленная поставщиком, в которой его собственная модель отстаёт в семи из шестнадцати строк, — хороший признак честности лаборатории, но это всё ещё одна лаборатория, один тестовый стенд, один набор промптов.

Если вам сегодня нужен способный агентный кодер и вам нужно знать, сколько это стоит, ответ — пока не Reflection Beam. Возможно, через три недели. Модель, на заявление об эффективности которой стоит ставить, — это та, чьи веса можно скачать, а FLOPs — посчитать самому. И по этому критерию от Reflection мы получили дату, а не модель.

Сравнение в этой статье4

Определено по этой статье · Бенчмарки: Artificial Analysis · обновляется ежедневно

© 2026 OrcaRouter

Провайдерам

Управляете инференс-платформой? Разместите свои модели на OrcaRouter.

providers@orcarouter.ai

Присоединяйтесь к сообществу

Discordsupport@orcarouter.aiXGitHubYouTube