
Reflection Beam выпускает API в бета-версии, а до весов ещё две недели
- openaiНОВИНКАOpenAI: GPT-6.1 Sol2026-09-2952Интеллект
- anthropicНОВИНКАAnthropic: Claude Sonnet 5.52026-09-2856Интеллект
- typesafeНОВИНКАTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 за 1 млн токенов · 150 tok/s
- OpenAIНОВИНКАOpenAI: GPT-6 Luna2026-09-2238Интеллект
- OpenAIНОВИНКАOpenAI: GPT-6 Sol2026-09-2248Интеллект
- AnthropicНОВИНКАAnthropic: Claude Opus 5.52026-09-2258Интеллект
- xAIGrok 4.72026-09-2146Интеллект
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 за 1 млн токенов · 127 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 за 1 млн токенов · 1202 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Интеллект
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Интеллект77Кодинг
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Интеллект76Кодинг
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Интеллект76Кодинг
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Интеллект82Кодинг
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 за 1 млн токенов · 53 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 за 1 млн токенов · 222 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Интеллект72Кодинг
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 за 1 млн токенов · 229 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Интеллект75Кодинг
- obsidianQwen3.8 27B2026-08-1534Интеллект68Кодинг
Первая модель Reflection называется Reflection Beam, и интересное в ней этим утром не то, что она существует, — а то, что существует лишь половина её. Компания анонсировала Beam 5 октября 2026 года как разреженную модель на основе смеси экспертов с 501 млрд общих параметров и 23 млрд активных на токен и в тот же день открыла перед ней бета-эндпоинт, совместимый с OpenAI. Веса обещают опубликовать позже в этом месяце под Apache 2.0, вместе с техническим отчётом, карточкой модели и стеком обслуживания. Пока они не появятся, запускать Beam-501B-A23B смогут только те, кому Reflection выдаст ключ из списка ожидания, и все циркулирующие показатели производительности происходят из собственных таблиц одной лаборатории.
Это странное место для остановки запуска, и стоит точно понимать, какая половина у нас есть. Reflection выпустила предварительную версию, на которую можно записаться, и набор таблиц с бенчмарками, которые никто не воспроизвёл. Она не выпустила то, к чему относится «open-weight» в заголовке.
Что сегодня утром на самом деле идёт в прямом эфире?
Всё в этом разделе взято из собственного поста Reflection в блоге и документации, прочитанных 6 октября 2026 года.
• Идентификатор модели — Beam-501B-A23B, создана 5 октября 2026 года, обслуживается по адресу api.reflection.ai/openai/v1 с Chat Completions и списком Models, и больше ничего.
• Структура — 501 млрд общих параметров, 23 млрд активных на токен, что даёт коэффициент активации около 4,6 %. Для сравнения, у GLM 5.2 он близок к 5,4 %.
• Контекст — 256 000 токенов в API, причём к самой цифре прикреплена сноска с предупреждением, что окно может измениться во время бета-тестирования. Максимальный объём вывода — 128 000 токенов.
• Рассуждение — параметр reasoning_effort с пятью настройками: low, medium, high, xhigh и max. По умолчанию используется medium, и модель всегда рассуждает. Выключателя нет, как и режима без рассуждений.
• Модальность — текст на входе, текст на выходе. На старте нет ввода изображений, аудио или видео.
• Цена — не опубликована. Ни в записи блога, ни в документации её нет, а консоль платформы скрыта за стеной регистрации.
• Доступ — лист ожидания. Нет возможности самостоятельного подключения, и нет весов, поэтому нет ни скачивания, ни квантования, ни дообучения.
Именно строка цены меняет то, как вы читаете всё остальное. Четыре из семи моделей, с которыми Beam сравнивается в собственных таблицах Reflection, имеют публичные прейскурантные цены, которые уже сегодня можно внести в электронную таблицу. У Beam их нет, поэтому любое утверждение о его стоимости прямо сейчас — это утверждение о вычислениях, а не о долларах.

Число, от которого зависит запуск
Питч Reflection — это эффективность инференса, и он необычно конкретен в том, что это значит: на продвинутых бенчмарках рассуждений Beam показывает результаты, сопоставимые с GLM 5.2, используя при этом в 3–4 раза меньше вычислительных ресурсов на инференс. Утверждается, что выигрыш ещё больше по сравнению с моделями семейства с 2 трлн параметров, к которому относится Qwen 3.8-Max.
График, стоящий за этим утверждением, стоит внимательно изучить, потому что это несущая опора доказательств во всём посте. На нём отложена оценка рассуждений против оценочных FLOP инференса по DeepSWE, Humanity's Last Exam и Terminal-Bench 2.1, а FLOP оцениваются как примерно удвоенное число активных параметров, умноженное на среднее число сгенерированных токенов за попытку. Эта формула намеренно исключает префилл промпта, зависящие от контекста операции внимания и накладные расходы на обслуживание — Reflection говорит об этом в подписи к графику. Это последовательное сравнение между моделями, а не измерение чьего-либо счёта, и это также единственная количественная поддержка заявления об эффективности, написанная лабораторией, создавшей модель. Рассматривайте это как гипотезу, которую веса позволят проверить кому-то другому.
Что архитектура действительно даёт на практике — так это профиль обслуживания. Двадцать три миллиарда активных параметров — это модель, которую вполне реально запустить на сравнительно небольшом числе GPU с интерактивной задержкой; это другой продукт, нежели плотная модель на 501 миллиард параметров, хотя цифра на карточке та же. Именно поэтому Reflection может говорить о рассуждениях, близких к передовому уровню, не говоря о развёртывании масштаба дата-центра, — и поэтому же будущий выпуск весов — это событие, которое значит больше, чем бета-ключ.
Куда Beam попадает в собственных таблицах Reflection
Все показатели ниже приведены по данным вендора, из таблиц в посте Reflection о запуске, и ни один из них не был независимо воспроизведён. Там, где Reflection не приводит число для модели, в оригинале в ячейке указано NR. Столбцы сравнения — от Reflection, а не от нас и не от третьей стороны.
Программирование и работа в терминале
• Terminal-Bench v2.1 — Reflection Beam 80,1 против GLM 5.2 81,0, GLM 5.3 88,2, Kimi K3 88,3, Qwen 3.8-Max 86,6 и DeepSeek V4.1 Flash 90,6. Beam уступает каждому из них.
• SWE-Bench Verified — Reflection Beam 80.9 против Inkling 77.6 и Nemotron 3 Ultra 70.7. Именно здесь Beam выглядит сильнее всего, но учтите, что на нём тестировались только две самые слабые модели из списка.
• SWE-Bench Pro v1 — Reflection Beam 65,5 против Qwen 3.8-Max 67,7, GLM 5.2 62,1, Inkling 54,3, Nemotron 3 Ultra 46,4.
• SWE-Bench Pro v2-Hard — Reflection Beam 77.2 против Kimi K3 88.2, GLM 5.3 84.3, Inkling 56.9. Разрыв в десять пунктов до вершины таблицы.
• DeepSWE v1.1 — Reflection Beam 44,4 против DeepSeek V4.1 Flash 74,2, Kimi K3 68,0, GLM 5.3 61,0, Qwen 3.8-Max 51,0, GLM 5.2 44,0. Beam идёт вровень с предыдущим поколением и отстаёт от лидера на тридцать баллов.
• SWE Atlas Codebase QnA — Reflection Beam 34,6 против Kimi K3 68,0 и GLM 5.3 61,0. Удерживать в уме большой репозиторий на протяжении длительного взаимодействия — самое сложное в этом списке, и 34,6 у Beam — это не погрешность округления.
Рассуждение и наука
• AIME 2026 — Reflection Beam 97,8 против GLM 5.2 99,2 и Inkling 97,1.
• HLE без инструментов — Reflection Beam 36,2 против Kimi K3 46,9, Qwen 3.8-Max 43,6, GLM 5.3 42,3, GLM 5.2 40,5, DeepSeek V4.1 Flash 39,1, Inkling 29,7, Nemotron 3 Ultra 26,7. В середине списка и опережает только две модели предыдущего поколения.
• GPQA Diamond — Reflection Beam 90.5 против Kimi K3 93.5, Qwen 3.8-Max 92.6, GLM 5.3 91.7, GLM 5.2 91.2, DeepSeek V4.1 Flash 90.9.
• SciCode — Reflection Beam 49,7 против GLM 5.3 59,0, Kimi K3 58,7, Qwen 3.8-Max 52,1, DeepSeek V4.1 Flash 52,0.
• CriPT AA — Reflection Beam 16.3 против Kimi K3 23.4, GLM 5.2 20.9, Qwen 3.8-Max 20.0, GLM 5.3 19.1, DeepSeek V4.1 Flash 14.3, Inkling 5.4, Nemotron 3 Ultra 3.1.
Инструменты, поиск и длинный контекст
• MCP Atlas — Reflection Beam 78,7 против Qwen 3.8-Max 84,5, GLM 5.3 84,2, Kimi K3 82,3, GLM 5.2 77,8.
• AutomationBench, публичный сплит — Reflection Beam 37,0 против DeepSeek V4.1 Flash 54,8, GLM 5.3 48,2, Kimi K3 46,7, Qwen 3.8-Max 39,8, GLM 5.2 26,2.
• Банкинг tau3 — Reflection Beam 38,0 против Qwen 3.8-Max 55,2, GLM 5.2 37,1, Kimi K3 37,1.
• BrowseComp с управлением контекстом — Reflection Beam 77,4 против Kimi K3 91,2, Inkling 77,1, Nemotron 3 Ultra 44,4.
• DeepSearchQA с управлением контекстом — Reflection Beam 80,1 против Kimi K3 95,0.
• AA-LCR — Reflection Beam 79.3 против Kimi K3 88.7, DeepSeek V4.1 Flash 84.0, Qwen 3.8-Max 80.3, GLM 5.3 79.7, Nemotron 3 Ultra 79.3, GLM 5.2 78.3, Inkling 77.3. Воспроизведение длинного контекста — это единственная строка общих возможностей, где Beam действительно конкурентоспособен, а не середнячок.
Прочитайте четыре таблицы вместе — и проявится устойчивая картина: почти в каждой строке списка Reflection модель Beam обыгрывает две модели предыдущего поколения и проигрывает текущей, причём с отрывом от небольшого до дисквалифицирующего. То, что вендор публикует таблицы, в которых его собственная модель отстаёт в таком количестве строк, — хороший признак честности лаборатории. Это не признак того, что модель находится на переднем крае.

Единственный независимый голос на данный момент — и то, о чём он не говорит
Единственная официально зафиксированная сторонняя оценка исходит от Artificial Analysis, которая 5 октября сообщила, что Reflection предоставила ей доступ и что она независимо тестирует Beam, добавив, что ранние признаки указывают на то, что Beam при своём уровне интеллекта станет одной из самых эффективных по использованию токенов открытых моделей, которые она когда-либо видела.
Это значимое заявление от организации, чей индекс действительно читает большинство покупателей, и в то же время это заявление, в котором нет ни одной цифры. По состоянию на сегодняшнее утро в таблице лидеров Artificial Analysis нет строки Beam — страницы модели возвращают 404, а в полезной нагрузке таблицы лидеров отсутствует запись Beam — так что утверждение об эффективности использования токенов пока что остаётся обещанием третьей стороны опубликовать что-то. В индексе пока ничего не было пересчитано на Beam.
Раскрытие информации об обучении, которое является самой сильной частью релиза
В инженерном разделе поста Reflection приводятся цифры, которые большинство лабораторий держат при себе, и их стоит зафиксировать, потому что это та часть релиза, которая будет интересна и через месяц.
• Предварительное обучение — 23,8 триллиона отобранных токенов на 6 144 чипах NVIDIA GB300 в стойках NVL72, завершено от начала до конца менее чем за четыре недели, при заявленной полезной пропускной способности 92,3 процента, с девятью полуавтоматическими откатами по ходу, связанными со скачками нормы градиента или предполагаемым тихим повреждением данных.
• Обучение с подкреплением — 10 500 чипов GB300 на протяжении четырёх недель, более 100 миллионов роллаутов, максимальный контекст роллаута — 256 000 токенов, примерно 1,3 миллиарда песочниц и около миллиона различных сред, собранных для задач программирования, агентных задач и STEM.
• Сервинг — медианное время доставки новых весов до инференс-парка составляло около 12 секунд; иерархическое распределение сокращало межстоечный трафик на 75 % и делало развёртывание по всему парку в 2,2 раза быстрее, чем когда каждая реплика подтягивала веса сама.
• Стабильность — полностью асинхронные градиенты политики, которые остаются численно устойчивыми при обучении на взаимодействиях суточной давности, а также управляемый штраф за длину для балансировки длины рассуждений и оценки без повторного обучения.
• Данные — около 95 процентов необработанных интернет-токенов было исключено с помощью парсинга, дедупликации и курирования; при этом утверждается, что обычные фильтры пропустили бы примерно 1,8 триллиона токенов из числа сохранённых Reflection, включая 87 процентов её курированных токенов веб-кода.
Две строки заслуживают пометки. В посте говорится, что мидтренинг расширяет эффективный контекст Beam до 1 миллиона токенов, тогда как в документации API указан лимит обслуживания в 256 000 токенов со сноской о бете. Это возможность на стороне обучения и ограничение на стороне обслуживания, а не противоречие, но именно этот разрыв и превращается в заголовок про «контекст 1M», если никто не читает второй документ. А показатель RL — более 100 миллионов роллаутов — подаётся как один из крупнейших подобных запусков среди всех открытых лабораторий, но это утверждение о масштабе, а не о том, что этот масштаб дал, — кривая зависимости оценки от количества роллаутов принадлежит самому вендору и заканчивается там, где вендор перестал её строить.

Что вы можете сделать с Reflection Beam сегодня
И ещё одно: присоединитесь к списку ожидания и, если получите ключ, обращайтесь к Beam-501B-A23B через собственный эндпоинт Reflection с помощью клиента в стиле OpenAI. Опубликованной цены нет, поэтому смоделировать стоимость рабочей нагрузки на нём невозможно. Весов нет, поэтому нет ни самостоятельного хостинга, ни квантования, ни воспроизведения третьими сторонами. Нет независимой строки в бенчмарке, поэтому вся приведённая выше картина производительности опирается на таблицы одной лаборатории.
Reflection Beam — не один из наших маршрутов, и мы не собираемся намекать, что это так. Что мы можем вам дать — это цену области, в которую он пытается войти, считанную в реальном времени из нашего собственного каталога сегодня утром: GLM 5.2 — $1.40 за вход и $4.40 за выход за миллион токенов, GLM 5.3 — $1.26 и $3.96, Qwen 3.8-Max — $2.00 и $6.00, а DeepSeek V4.1 Flash — $0.15 и $0.60. Это разброс более чем в девять раз между самым дешёвым и самым дорогим уже только по входу — и именно поэтому бета-модель без прейскурантной цены действительно трудно встроить в решение, как бы хорошо ни выглядел её график эффективности.
OrcaRouter работает с одним ключом, совместимым с OpenAI, для этих четырёх и ещё более 200 других моделей, передавая прайс-листовую цену провайдера без каких-либо наценок, так что изменение цены вендором становится актуальным у нас в тот же день, а не когда перепродавец обновит свой список. Автоматическое переключение при сбое — часть маршрутизации, а не то, что вы выстраиваете вокруг каждого провайдера, а значит, непроверенная модель — без воспроизведения, без независимой оценки и без цены — это ровно то, что вы отправляете на долю трафика, а не на критический путь.
Когда утверждение становится проверяемым
Это решают три вещи, и две из них Reflection поместила в этот месяц.
Первое — это веса. Apache 2.0 вместе с техническим отчётом позволяет любому, у кого есть пара узлов, измерить то, что действительно важно, — токенов в секунду на GPU при фиксированной планке качества, а также действительно ли 23 миллиарда активных параметров обеспечивают тот показатель «баллов на FLOP», который подразумевает график. До тех пор аргумент об эффективности — это арифметика на салфетке, и все, кто его повторяет, повторяют подпись Reflection.
Второй фактор — цена. Модель без цены по прайс-листу не может участвовать в сравнении затрат. Если Beam окажется в сегменте выше GLM и DeepSeek, вопрос вычислений перестанет иметь значение для всех, у кого есть бюджет; если ниже — картина быстро изменится.
Третий — это индекс. Artificial Analysis заявила, что проводит бенчмаркинг Beam, и не опубликовала ни одной цифры. Когда эта строка появится, она станет первой цифрой в этой истории, которую Reflection не вычислила.
Если вам нужен дееспособный агентный программист уже сегодня и нужно знать, сколько это стоит, ответ — пока не Reflection Beam. Возможно, через три недели. Модель, на заявление об эффективности которой стоит ставить, — это та, чьи веса можно скачать и чьи FLOPs можно посчитать самому, — и по этому критерию Reflection дал нам дату и лист ожидания, а не модель.
Сравнение в этой статье3
Определено по этой статье · Бенчмарки: Artificial Analysis · обновляется ежедневно
