
Reflection Beam против Claude Opus 5.5: один можно вызвать уже сегодня, другого придётся подождать
- openaiНОВИНКАOpenAI: GPT-6.1 Sol2026-09-2952Интеллект
- anthropicНОВИНКАAnthropic: Claude Sonnet 5.52026-09-2856Интеллект
- typesafeНОВИНКАTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 за 1 млн токенов · 150 tok/s
- OpenAIНОВИНКАOpenAI: GPT-6 Luna2026-09-2238Интеллект
- OpenAIНОВИНКАOpenAI: GPT-6 Sol2026-09-2248Интеллект
- AnthropicНОВИНКАAnthropic: Claude Opus 5.52026-09-2258Интеллект
- xAIGrok 4.72026-09-2146Интеллект
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 за 1 млн токенов · 127 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 за 1 млн токенов · 1202 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Интеллект
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Интеллект77Кодинг
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Интеллект76Кодинг
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Интеллект76Кодинг
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Интеллект82Кодинг
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 за 1 млн токенов · 53 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 за 1 млн токенов · 202 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Интеллект72Кодинг
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 за 1 млн токенов · 229 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Интеллект75Кодинг
- obsidianQwen3.8 27B2026-08-1534Интеллект68Кодинг
Reflection Beam и Claude Opus 5.5пока не являются настоящими соперниками, и причина этого скорее административная, чем техническая. Beam, первая модель Reflection, была анонсирована 5 октября 2026 года и представляет собой разреженную модель смеси экспертов с 501 миллиардом параметров, активирующую 23 миллиарда параметров на токен, — но получить к ней доступ можно только через лист ожидания, её веса обещаны позднее в этом месяце под лицензией Apache 2.0, а цена нигде не опубликована. Opus 5.5 вышел 22 сентября 2026 года как флагман Anthropic: окно в 1 миллион токенов, ввод текста, изображений и файлов, а также прейскурантная цена $4.00 за миллион входных токенов и $20.00 за миллион выходных. Так что честная версия этого сравнения такова: одну из этих моделей вы можете запустить в продакшене уже сегодня днём с известной стоимостью, а другую — нет, и всё остальное здесь — это прогноз о том, что произойдёт, когда появятся веса.
Короткий ответ
Если вопрос в том, на какой модели строить на этой неделе, то это Opus 5.5, и почти без споров: она общедоступна, независимо оценена, мультимодальна, имеет цену и предоставляется через API, который можно вызвать за пять минут. Аргумент в пользу Beam не основывается на превосходстве над Opus 5.5 — ничто в собственных материалах Reflection не утверждает, что это так. Он основывается на гораздо более узком тезисе: при заданном показателе рассуждений Beam расходует примерно четверть вычислительных ресурсов на инференс. Если это подтвердится, когда кто-то вне Reflection это измерит, Beam становится интересным для больших объёмов работы, где ответ должен быть хорошим, но не лучшим. Если нет, Beam — это открытая модель среднего уровня с листом ожидания.
То, что следует далее, отделяет те части этого противостояния, которые сегодня являются фактами, от тех частей, которые являются ставками.
Что именно представляет собой каждая модель
Opus 5.5 — это закрытый хостируемый преемник Claude Opus 5, позиционируемый Anthropic для многошаговых изменений в крупных кодовых базах, проверки кода и длительных автономных сессий. Он принимает текст, изображения и файлы, возвращает текст, обслуживает контекстное окно на 1 000 000 токенов с выводом до 128 000 токенов и предоставляет расширенное мышление с настраиваемым уровнем рассуждений. У него нет открытых весов, а его знания ограничены датой отсечки обучения Anthropic, а не чем-либо, что контролируете вы.
Reflection Beam — это противоположная конструкция. Это 501 миллиард общих параметров при 23 миллиардах активных — около 4,6 % модели активны на токен, агрессивная доля даже по сравнению с примерно 5,4 % у GLM 5.2 — создана, чтобы быть дешёвой в обслуживании, а не в обучении. Она работает только с текстом. Её контекст API составляет 256 000 токенов со сноской, предупреждающей, что это значение может измениться во время беты, а максимальный вывод — 128 000 токенов. Конечная точка совместима с OpenAI по адресу api.reflection.ai/openai/v1 и предоставляет Chat Completions, а также список Models, и ничего больше. Её параметр reasoning_effort принимает пять значений, по умолчанию — medium, и не может быть отключён.
• Цена — Claude Opus 5.5: $4,00 за вход и $20,00 за выход за миллион токенов, при этом чтение из кэша стоит $0,20, а запись в кэш — $5,00, против Reflection Beam: не опубликовано ни в посте блога, ни в документации, ни в списке моделей.
• Доступность — Opus 5.5 общедоступен уже сегодня; Beam — это лист ожидания для бета-версии, при этом веса, технический отчёт и карточка модели обещаны позднее в этом месяце.
• Модальность — Opus 5.5 принимает текст, изображения и файлы; Beam принимает только текст.
• Контекст — 1 000 000 токенов против 256 000, при этом показатель Beam сопровождается оговоркой о бета-версии.
• Открытые веса — нет для Opus 5.5, обещаны под Apache 2.0 для Beam, ещё не выпущены.
• Независимая оценка — у Opus 5.5 она есть; у Beam — нет.

Цена — это то, что не поддаётся сравнению
4,00 $ и 20,00 $ за Opus 5.5 — это прайс-листовая ставка провайдера, и в нашем каталоге они передаются без изменений, ничего не добавляется. Чтение из кэша по 0,20 $ и запись в кэш по 5,00 $ имеют огромное значение для рабочих нагрузок, под которые продаётся Opus 5.5 — долгая агентная сессия, которая снова и снова перечитывает одну и ту же кодовую базу на 200 000 токенов, платит по ставке кэша почти за весь её объём, а не по ставке ввода. Это реальный и часто недооцениваемый рычаг, и его стоит смоделировать, прежде чем делать вывод, что фронтирная модель выходит за рамки бюджета.
У Beam нет сопоставимого числа. Нет прейскурантной цены, с которой можно было бы сравнивать, нет ценового уровня кэша, который можно было бы смоделировать, и нет опубликованного тарифа для бета-версии. Reflection не сообщила, будет ли Beam продаваться за токены, тарифицироваться по числу мест или отдаваться вместе с весами. Любой, кто сегодня называет стоимость за миллион для Beam, её выдумывает.
Практическое следствие: сравнение цен — это не «Opus 5.5 дорогой, а Beam дешевле». Это «у одного из них есть цена, а у другого — дата». Для команды, принимающей решение сегодня, эта асимметрия решает больше, чем бенчмарки.
Бенчмарки: два пересекающихся числа и почему они всё равно не сравнимы
В таблицах запуска Reflection нет Opus 5.5 или какой-либо передовой закрытой модели. Набор для сравнения Reflection целиком состоит из открытых или Onichin, Nemotron 3 Ultra, GLM 5.2, GLM 5.3, Kimi K3, Qwen 3.8-Max и DeepSeek V4.1 Flash. Поэтому любую таблицу Beam против Opus приходится собирать вручную, а честная сборка означает называть различия в харнесах, а не сглаживать их.
Существует ровно два бенчмарка, где у обеих моделей есть опубликованный показатель, и ни одно из этих сопоставлений не является контролируемым.
• Humanity's Last Exam — в Reflection сообщается, что Beam без инструментов набирает 36,2; Artificial Analysis фиксирует у Opus 5.5 результат 61,4. Два разных испытательных стенда, две разные конфигурации — показатель Opus 5.5 не помечен как «без инструментов» — и разрыв в двадцать пять пунктов, который говорит меньше о моделях, чем об условиях тестирования.
• SciCode — Reflection сообщает для Beam 49,7; Artificial Analysis фиксирует 66,9 для Opus 5.5. Один и тот же бенчмарк, одна и та же проблема: одно число — собственный запуск вендора, другое — сторонний тестовый стенд.
Всё остальное вообще не пересекается. Таблица Beam построена на Terminal-Bench v2.1, тогда как текущий индекс Artificial Analysis работает на Terminal-Bench 4.0 — другой версии того же набора, поэтому 80.1 у Beam и 59.6 у Opus 5.5 в этой таблице не являются сопоставлением и их никогда не следует печатать рядом друг с другом. В самом индексе Artificial Analysis ставит Opus 5.5 на 57.6 в конфигурации Max / Default Fallback, что даёт ему четвёртое место среди 147 моделей в этом прогоне. У Beam нет строки в индексе: страницы модели возвращают 404, и по состоянию на сегодняшнее утро в таблице лидеров нет записи Beam.
Единственное по-настоящему независимое публично зафиксированное заявление о Beam — это сказанное Artificial Analysis 5 октября: Reflection предоставила ей доступ, и она независимо тестировала модель, а ранние индикаторы позволяют предположить, что Beam станет одной из самых токен-эффективных открытых моделей, которые она видела для своего уровня интеллекта. Это сильное утверждение из правильного источника, и всё же это утверждение без числа. Именно число решит исход этого противостояния.

Где утверждение об эффективности действительно имеет вес
Аргумент Reflection не в том, что Beam умнее передовой модели. Он в том, что Beam показывает сравнимые с GLM 5.2 результаты, используя в 3–4 раза меньше вычислительных ресурсов на инференс, и что разрыв увеличивается по сравнению с моделями семейства на 2 триллиона параметров, к которому относится Qwen 3.8-Max. График, лежащий в основе, оценивает сгенерированные FLOPs как удвоенное количество активных параметров, умноженное на среднее число сгенерированных токенов за попытку, и его собственная подпись признаёт, что это не учитывает предзаполнение промпта, внимание и накладные расходы на обслуживание.
Если принять это за чистую монету, интересная цель — вовсе не Opus 5.5, а середина рынка. Opus 5.5 конкурирует способностями в расчёте на задачу и выигрывает на задачах, требующих суждения: многошаговые рефакторинги, проверка кода, работа, где неверный ответ стоит дороже токенов. Модель, у которой на каждый токен задействовано лишь 4,6 процента, конкурирует стоимостью в расчёте на задачу и выигрывает там, где доминирует объём, а планка качества — «достаточно хорошо, а проверка идёт дальше по цепочке». Это разные продукты, и сравнение, сталкивающее Beam с Opus 5.5 на одном табло, измеряет не то.
Есть эффект второго порядка, который стоит назвать. Если утверждение Beam об эффективности верно, его естественная ниша — это такие рабочие нагрузки, где иначе вы бы тратили токены передовой модели на задачу, для которой она слишком квалифицирована. Это решение о маршрутизации, а не выбор модели, и именно поэтому здесь вопрос цены важнее вопроса бенчмарков: нельзя маршрутизировать по стоимости к модели, у которой нет стоимости.
Запуская их параллельно, когда Beam доступен для вызова
Opus 5.5 сегодня в нашем каталоге по цене $4.00 и $20.00 за миллион токенов, цена из прайс-листа передаётся как есть, без каких-либо надбавок, и он стоит в одном ряду с более чем 200 другими моделями за одним ключом, совместимым с OpenAI, на api.orcarouter.ai/v1. Если вы хотели провести A/B-тестирование рабочей нагрузки между передовой моделью и дешёвой открытой, вот как выглядит такая схема: два идентификатора моделей, один ключ, никакого второго контракта и никаких изменений в коде — а автоматическое переключение при сбое в маршрутизации означает, что неудачный день у провайдера не утащит за собой ваш пайплайн.
Beam пока не может быть частью этого, и мы не собираемся делать вид, что это не так. Reflection Beam не входит в число наших маршрутов, и мы не станем указывать вам на тех, кто мог бы его перепродавать. Когда веса выйдут под Apache 2.0, вы сможете разместить их у себя и направлять запросы на собственную конечную точку; до тех пор единственный путь — лист ожидания Reflection.
Для рабочей нагрузки, где действительно необходима фронтирная модель, сравнивать нужно не с Beam. А со всем остальным в каталоге: GLM 5.3 по $1.96 и $3.96, Qwen 3.8-Max по $2.00 и $6.00 и DeepSeek V4.1 Flash по $0.15 и $0.60 — все цены считаны вживую сегодня утром. Именно в этот сегмент попадёт Beam, если установит конкурентоспособные цены, и это гораздо более жёсткая конкурентная среда, чем следует из графика запуска.

Что могло бы изменить этот вердикт?
Три вещи, в порядке того, насколько они были бы важны.
Строка Beam в Artificial Analysis. Не анонс о том, что она скоро появится, — а сама строка. Если индекс окажется близко к 57,6 у Opus 5.5, а заявление об эффективности по токенам выдержит проверку сторонним тестовым стендом, середина рынка почувствует себя по-настоящему неуютно, и Beam станет выбором по умолчанию для множества задач с большим объёмом. Если же он приземлится ближе к кластеру открытых весов, в районе сорока с небольшим, то Beam — просто крепкая дешёвая модель, и не более того.
Цена. Модель без ставки в прайс-листе не может выиграть спор о стоимости, потому что сравнивать не с чем. Если Beam окажется ниже уровня GLM 5.3, история об эффективности очень быстро превратится в историю о бюджете. Если она окажется выше $0.15 и $0.60 у DeepSeek V4.1 Flash без преимущества в возможностях, ей будет трудно справиться с объёмной работой, для которой она была создана.
Веса. Пока их не существует, «open-weight» — это заявление о лицензии, которая не была предоставлена, и никто не может проверить арифметику FLOPs-per-score на модели, которую они действительно могут запустить. Это та проверка, к которой Reflection призвал, но которую ещё не сделал возможной.
Пока хотя бы один из них не появится, практический выбор не так уж и близок. Opus 5.5 — это модель, о которой можно рассуждать, которую можно оценить по стоимости и на которой можно выпускать продукт. Beam — это модель, за которой только наблюдают.
Сравнение в этой статье3
Определено по этой статье · Бенчмарки: Artificial Analysis · обновляется ежедневно
