
Reflection Beam vs Gemini 3.1 Pro Preview: один читает видео, другой — текст
- openaiНОВИНКАOpenAI: GPT-6.1 Sol2026-09-2952Интеллект
- anthropicНОВИНКАAnthropic: Claude Sonnet 5.52026-09-2856Интеллект
- typesafeНОВИНКАTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 за 1 млн токенов · 150 tok/s
- OpenAIНОВИНКАOpenAI: GPT-6 Luna2026-09-2238Интеллект
- OpenAIНОВИНКАOpenAI: GPT-6 Sol2026-09-2248Интеллект
- AnthropicНОВИНКАAnthropic: Claude Opus 5.52026-09-2258Интеллект
- xAIGrok 4.72026-09-2146Интеллект
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 за 1 млн токенов · 127 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 за 1 млн токенов · 1202 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Интеллект
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Интеллект77Кодинг
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Интеллект76Кодинг
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Интеллект76Кодинг
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Интеллект82Кодинг
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 за 1 млн токенов · 53 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 за 1 млн токенов · 202 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Интеллект72Кодинг
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 за 1 млн токенов · 229 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Интеллект75Кодинг
- obsidianQwen3.8 27B2026-08-1534Интеллект68Кодинг
Начнём с асимметрии, которую не упоминает ни одна таблица бенчмарков в этом сравнении. Reflection Beam, анонсированная 5 октября 2026 года, — это разреженная модель mixture-of-experts с 501 миллиардом параметров, из которых 23 миллиарда активны на каждый токен, и она принимает текст на входе и возвращает текст на выходе. И ничего больше. Gemini 3.1 Pro Preview, передовая мультимодальная модель вендора с 19 февраля 2026 года, принимает текст, изображения, видео, аудио и файлы, и это единственная модель в этом сравнении, где на вопрос «видит ли она то, о чём я хочу спросить» для каждой из сторон есть свой ответ. Всё остальное — коэффициенты разреженности, размеры контекстного окна, ценовые уровни — это предмет спора. А вот это — характеристика.
Это также означает, что это наименее симметричная пара в наборе — и самая полезная, потому что она показывает, для чего на самом деле нужно сравнение моделей. Если ваша рабочая нагрузка — текст, Beam и Gemini 3.1 Pro — это два варианта на спектре, который простирается от дешёвого и неизмеренного до дорогого и тщательно оценённого. Если в вашей рабочей нагрузке есть видеокадр, сравнивать нечего.
Что представляет собой каждая модель
Gemini 3.1 Pro Preview — флагман Google уровня preview: 1 048 576 токенов контекста, максимальный вывод 65 536 токенов, пять входных модальностей и окно на 1 миллион токенов, доступ к которому открывается через ступенчатую ценовую шкалу, а не по единому тарифу. Google позиционирует его для усовершенствованной разработки ПО, повышенной надёжности агентных систем и более эффективного использования токенов в сложных рабочих процессах. Это не открытые веса. В его названии по-прежнему сохраняется «Preview» — статус, который Google удерживает для этой модели с февраля.
Reflection Beam — первая модель Reflection и начало серии моделей с открытыми весами. Пятьсот один миллиард общих параметров, 23 миллиарда активных — около 4,6% модели активно на каждый токен. 23,8 триллиона токенов предобучения на 6 144 чипах GB300 менее чем за четыре недели, затем кампания по обучению с подкреплением на 10 500 чипах GB300 в течение четырёх недель с более чем 100 миллионами прогонов примерно в одном миллионе сред. Его API совместим с OpenAI по адресу api.reflection.ai/openai/v1 с Chat Completions и списком моделей, его контекст — 256 000 токенов со сноской о бета-версии, его параметр reasoning_effort имеет пять уровней и не имеет отключения, а его веса обещаны на конец этого месяца под лицензией Apache 2.0.
• Модальность — Gemini 3.1 Pro Preview принимает текст, изображения, видео, аудио и файлы; Reflection Beam принимает только текст.
• Контекст и вывод — 1 048 576 токенов на входе и 65 536 на выходе для Gemini, против 256 000 на входе и 128 000 на выходе для Beam.
• Цена — Gemini 3.1 Pro Preview: $2.00 за ввод и $12.00 за вывод за миллион токенов до 200 000 токенов, а свыше — $4.00 и $18.00 соответственно; чтение из кэша — $0.20; у Reflection Beam опубликованной цены нет.
• Инструментальная поверхность — нативный вызов инструментов, структурированные выходные данные и поисковая привязка на стороне Google; вызов инструментов и структурированные выходные данные на стороне Beam, при этом эндпоинт ограничен Chat Completions.
• Веса — проприетарные для Gemini; для Beam обещана Apache 2.0, но пока не выпущены.
• Независимая оценка — Gemini 3.1 Pro Preview имеет индекс Artificial Analysis; Beam отсутствует в таблице.
Модальный разрыв — вот и весь аргумент
Стоит быть конкретным, а не ограничиваться намёками на «мультимодальность», потому что практические последствия вполне определённы.
Рабочую нагрузку, которая принимает запись экрана, фотографию продукта, отсканированный договор или аудиофайл колл-центра, невозможно обслужить с помощью Beam ни за какую цену, ни с каким промптом, ни на каком тарифном плане. На уровне приложения обходного пути нет: документация Beam описывает одну входную модальность и одну выходную модальность, и ни один путь для изображений или аудио не указан. Gemini 3.1 Pro Preview обрабатывает все пять, а значит, это единственная модель здесь, которую можно встроить в рабочий процесс, где входные данные ещё не являются текстом.
Об обратном случае тоже стоит сказать, потому что именно в нём люди ошибаются. Если ваш вход — текст и останется текстом, пять модальностей Gemini не дают вам ничего, и вы платите цену мультимодальной модели за выполнение текстовой нагрузки. Это не аргумент в пользу Beam — это аргумент за то, что вопрос о модальности следует решать до вопроса о бенчмарке, потому что это отсекает варианты дешевле и надёжнее, чем любое сравнение оценок.
Два предпросмотра — два разных смысла.
Оба названия моделей содержат оговорку, и эти оговорки не одинаковы — это самое интересное в этой паре.
«Preview» у Gemini 3.1 Pro — это условное обозначение модели, которая с февраля в целом доступна для вызова, имеет независимую оценку, опубликованный тарифный план, включающий документированный уровень для длинного контекста, и полный набор инструментов. На практике «preview» здесь означает, что Google оставляет за собой право заменить её, а не то, что её трудно получить или что она не имеет оценки.
Бета-версия Beam — это настоящий барьер. Доступ осуществляется через лист ожидания, идентификатор модели был создан 5 октября 2026 года, тарифной сетки нет, оценок от третьих сторон нет, а артефакты, которые позволили бы кому угодно проверить центральное утверждение — веса, технический отчёт, карточка модели, — лишь обещаны, но не представлены. Показатель контекста сопровождается сноской с предупреждением, что он может измениться в ходе беты, — а это оговорка, в которой не нуждается ни одна общедоступная модель.
Последствие асимметрично — и это имеет значение для закупок. Команда, внедряющая Gemini 3.1 Pro Preview, принимает риск, связанный с частой сменой моделей. Команда, внедряющая Beam сегодня, принимает неизвестную цену, неизвестную независимую оценку и невозможность самостоятельно запускать модель. Это разные категории риска, и чаще всего решает именно цена.

Бенчмарки и проблема цитирования
Стартовые таблицы Reflection не включают Gemini 3.1 Pro Preview или какую-либо модель Google. Его набор для сравнения состоит только из открытых и полуоткрытых моделей: Inkling, Nemotron 3 Ultra, GLM 5.2, GLM 5.3, Kimi K3, Qwen 3.8-Max и DeepSeek V4.1 Flash. Таким образом, эти две модели никогда не запускались друг против друга в опубликованной таблице, и приведённые ниже показатели получены с использованием разных испытательных стендов с обеих сторон.
• Индекс Artificial Analysis — Gemini 3.1 Pro занимает 58-е место из 147 в нём. Строки индекса нет вообще.
• GPQA Diamond — Gemini 3.1 Pro Preview с 94,1 по данным Artificial Analysis против 90,5, заявленных производителем Beam.
• SciCode — 58,7 у Gemini против заявленных Beam 49,7.
• Humanity's Last Exam — 47,0 у Gemini против заявленных вендором Beam 36,2, причём последний показатель — явно без инструментов.
• Terminal-Bench v2.1 — 73,8 для Gemini по данным Artificial Analysis против 80,1, заявленных Beam. Это самая сильная позиция Beam в этом сравнении, и это лёгкая добыча против модели, которая находится на рынке с февраля.
• Воспроизведение длинного контекста — 82.0 у Gemini против заявленных производителем 79.3 у Beam на AA-LCR.
• tau-squared Bench — 95,6 у Gemini против 78,7 у Beam на MCP Atlas и 38,0 на tau3 banking. Это родственные, но не одни и те же оценки агентного использования инструментов, и разница в названиях имеет значение.
Отдельная проблема честности, связанная со стороной Gemini в этой таблице, заслуживает отдельного предложения. Независимые оценки индекса для Gemini 3.1 Pro Preview приводились как 30, 46, 47,7 и 57 в разных источниках, а Artificial Analysis в один и тот же момент выдаёт разные редакции индекса на разных страницах моделей. Цифра 29,7 выше — это та, что была на странице, которую мы читали 6 октября 2026 года, и это единственная, которую мы будем цитировать, — но любая статья, которая ставит одно число индекса Gemini рядом с конкурентом, не указывая, из какого снимка оно взято, выдаёт плавающее число за фиксированное. Та же осторожность применима в обратном смысле к Beam, где снимка нет вообще.
Цена, и уровень, который никто не планирует
Gemini 3.1 Pro Preview стоит $2,00 за вход и $12,00 за выход за миллион токенов до 200 000 токенов, а свыше этого — $4,00 и $18,00. Чтение из кеша — $0,20 за миллион, запись в кеш — $0,375. Граница уровня — это то, что стоит учитывать при планировании: главное преимущество модели — окно размером 1 048 576 токенов, и как только запрос превышает 200 000 токенов, тариф на вход удваивается, а тариф на выход увеличивается в полтора раза. Поэтому рабочая нагрузка, рассчитанная на окно в миллион токенов, — это нагрузка, тарифицируемая по второму уровню для большей части своего трафика, а не по первому.
У Beam нет прайс-листа, поэтому нет тарифа для моделирования и не с чем сравнивать. Это отсутствие не нейтрально: оно означает, что самое дешёвое защитимое утверждение о стоимости Beam — что она неизвестна, а единственная количественная поддержка его позиционирования по эффективности — это собственная диаграмма Reflection, которая оценивает сгенерированные FLOPs как удвоенное количество активных параметров, умноженное на среднее количество сгенерированных токенов за попытку по DeepSWE, HLE и Terminal-Bench 2.1, — с подписью, признающей, что предзаполнение промпта, внимание и накладные расходы на обслуживание исключены. На рабочих нагрузках, где контекст в миллион токенов имеет значение, предзаполнение не является погрешностью округления, и именно этот член формула опускает.

Использование инструментов, поиск и то, в чём различаются эти два дизайна
Заявленные сильные стороны Gemini 3.1 Pro Preview — это разработка ПО, надёжность агентных систем и эффективность использования токенов, а опубликованный набор инструментов включает вызов функций, структурированные выходные данные и поисковую привязку. Последний пункт стоит отметить всем, кто сравнивает агентные стеки: поиск с привязкой — это собственная возможность на стороне Google, и он меняет то, что может делать агент, использующий инструменты, без подключения внешнего сервиса извлечения данных.
История с инструментами Beam интереснее, чем предполагает строка спецификации, и её сложнее оценить. Reflection сообщает MCP Atlas на 78,7, AutomationBench public на 37,0, tau3 banking на 38,0, BrowseComp с управлением контекстом на 77,4 и DeepSearchQA с управлением контекстом на 80,1 — и отмечает, что во время обучения с подкреплением модель органично научилась запрашивать другие языковые модели и вызывать OCR API, когда ей давали доступ к вебу, несмотря на то, что задачи просмотра веб-страниц отсутствовали в обучающей смеси. Если это обобщение подтвердится, это реальный сигнал об агентном переносе. Это также, на данный момент, наблюдение вендора из обучающего прогона, без независимой проверки.
В строках по использованию инструментов, где у обеих сторон есть числовые данные, картина скорее смешанная, чем односторонняя. Таблица вендора Beam ставит его выше GLM 5.2 в MCP Atlas и на один уровень с GLM 5.2 и Kimi K3 в tau3 banking, тогда как показатель Gemini в tau-squared Bench, равный 95,6, — это самый высокий агентный показатель, опубликованный любой из сторон. Разные наборы тестов, разные испытательные стенды и отсутствие общей оценки — вот повторяющаяся проблема в этом сравнении.
Выбор и как хеджировать
Правило принятия решения, вытекающее из вышесказанного, достаточно просто сформулировать в одной строке: если хотя бы один входной сигнал не является текстом, Beam не вариант, и сравнение завершено. Если все входные сигналы являются текстом, вопрос сводится к тому, оправдывает ли неподтверждённое заявление Beam об эффективности неизвестную цену и отсутствие независимой оценки по сравнению с моделью, которая стоит $2.00 и $12.00, с документированной шкалой и полноценным инструментом.
Gemini 3.1 Pro Preview есть в нашем каталоге, с тарифом провайдера по прайс-листу, переданным как есть и без наценки; доступ — через один OpenAI-совместимый ключ на api.orcarouter.ai/v1 вместе с более чем 200 другими моделями — и тот же ключ обслуживает модели, с которыми Beam конкурирует по цене, от GLM 5.3 за $1.26 и $3.96 до DeepSeek V4.1 Flash за $0.15 и $0.60, проверено в реальном времени сегодня утром. Поскольку граница уровня в 200 000 токенов — это проблема маршрутизации, а не проблема модели, DSL маршрутизации позволяет выразить её напрямую: оставлять короткие запросы на дешёвом уровне, а действительно длинные закреплять там, где окно — причина, по которой вы выбрали модель, в одном вызове, а не в коде приложения.
Reflection Beam не входит в число наших маршрутов, и мы не станем направлять вас к кому-либо, кто утверждает, что он у него есть. Если веса Apache 2.0 появятся в этом месяце, как обещано, самостоятельный хостинг станет третьим вариантом для работы только с текстом, и заявление об эффективности можно будет проверить на вашем собственном оборудовании.

Что изменило бы ответ?
Аргументы Beam против Gemini опираются на те же два пункта, на которых строится любое сравнение Beam, а это противостояние добавляет третий.
Цена. Без неё аргумент об эффективности невозможно преобразовать в бюджетное решение, и модель конкурирует с помощью диаграммы, а не прайс-листа.
Независимая оценка. Artificial Analysis 5 октября сообщила, что Reflection предоставила ей доступ и что она проводит бенчмаркинг Beam, описывая ранние индикаторы как указывающие на то, что Beam станет одной из самых токен-эффективных открытых моделей из всех, что она видела для своего уровня интеллекта. Это тот самый источник, говорящий то, что нужно, и при этом на табло до сих пор нет строки Beam — страницы модели возвращают 404, а в таблице лидеров по состоянию на сегодняшнее утро нет записи о Beam.
А то, что не меняется: Beam работает только с текстом. Ни выпуск весов, ни снижение цены, ни оценка в индексе этого не меняют, а значит, для целого класса рабочих нагрузок это сравнение вообще никогда не станет сравнением. Если в вашем конвейере есть видео, ответом был Gemini 3.1 Pro Preview ещё до загрузки первого бенчмарка.
Сравнение в этой статье1
Определено по этой статье · Бенчмарки: Artificial Analysis · обновляется ежедневно
