Сгенерированная hero-карточка для статьи «Reflection Beam vs Gemini 3.1 Pro Preview: Один читает видео, другой читает текст», с заголовком «Reflection Beam vs Gemini 3.1 Pro Preview», подзаголовком «Один читает видео, другой читает текст» и тремя чипами: «Только текст против пяти модальностей», «256K против 1M контекста» и «Нет цены против тарифной сетки».
Guides & Insights

Reflection Beam vs Gemini 3.1 Pro Preview: один читает видео, другой — текст

Автор

Rowan Sterling

Дата публикации

Новые модели · 20Все модели →
Бенчмарки: Artificial Analysis · обновляется ежедневно
Назад ко всем статьям

Начнём с асимметрии, которую не упоминает ни одна таблица бенчмарков в этом сравнении. Reflection Beam, анонсированная 5 октября 2026 года, — это разреженная модель mixture-of-experts с 501 миллиардом параметров, из которых 23 миллиарда активны на каждый токен, и она принимает текст на входе и возвращает текст на выходе. И ничего больше. Gemini 3.1 Pro Preview, передовая мультимодальная модель вендора с 19 февраля 2026 года, принимает текст, изображения, видео, аудио и файлы, и это единственная модель в этом сравнении, где на вопрос «видит ли она то, о чём я хочу спросить» для каждой из сторон есть свой ответ. Всё остальное — коэффициенты разреженности, размеры контекстного окна, ценовые уровни — это предмет спора. А вот это — характеристика.

Это также означает, что это наименее симметричная пара в наборе — и самая полезная, потому что она показывает, для чего на самом деле нужно сравнение моделей. Если ваша рабочая нагрузка — текст, Beam и Gemini 3.1 Pro — это два варианта на спектре, который простирается от дешёвого и неизмеренного до дорогого и тщательно оценённого. Если в вашей рабочей нагрузке есть видеокадр, сравнивать нечего.

Что представляет собой каждая модель

Gemini 3.1 Pro Preview — флагман Google уровня preview: 1 048 576 токенов контекста, максимальный вывод 65 536 токенов, пять входных модальностей и окно на 1 миллион токенов, доступ к которому открывается через ступенчатую ценовую шкалу, а не по единому тарифу. Google позиционирует его для усовершенствованной разработки ПО, повышенной надёжности агентных систем и более эффективного использования токенов в сложных рабочих процессах. Это не открытые веса. В его названии по-прежнему сохраняется «Preview» — статус, который Google удерживает для этой модели с февраля.

Reflection Beam — первая модель Reflection и начало серии моделей с открытыми весами. Пятьсот один миллиард общих параметров, 23 миллиарда активных — около 4,6% модели активно на каждый токен. 23,8 триллиона токенов предобучения на 6 144 чипах GB300 менее чем за четыре недели, затем кампания по обучению с подкреплением на 10 500 чипах GB300 в течение четырёх недель с более чем 100 миллионами прогонов примерно в одном миллионе сред. Его API совместим с OpenAI по адресу api.reflection.ai/openai/v1 с Chat Completions и списком моделей, его контекст — 256 000 токенов со сноской о бета-версии, его параметр reasoning_effort имеет пять уровней и не имеет отключения, а его веса обещаны на конец этого месяца под лицензией Apache 2.0.

• Модальность — Gemini 3.1 Pro Preview принимает текст, изображения, видео, аудио и файлы; Reflection Beam принимает только текст.

• Контекст и вывод — 1 048 576 токенов на входе и 65 536 на выходе для Gemini, против 256 000 на входе и 128 000 на выходе для Beam.

• Цена — Gemini 3.1 Pro Preview: $2.00 за ввод и $12.00 за вывод за миллион токенов до 200 000 токенов, а свыше — $4.00 и $18.00 соответственно; чтение из кэша — $0.20; у Reflection Beam опубликованной цены нет.

• Инструментальная поверхность — нативный вызов инструментов, структурированные выходные данные и поисковая привязка на стороне Google; вызов инструментов и структурированные выходные данные на стороне Beam, при этом эндпоинт ограничен Chat Completions.

• Веса — проприетарные для Gemini; для Beam обещана Apache 2.0, но пока не выпущены.

• Независимая оценка — Gemini 3.1 Pro Preview имеет индекс Artificial Analysis; Beam отсутствует в таблице.

Модальный разрыв — вот и весь аргумент

Стоит быть конкретным, а не ограничиваться намёками на «мультимодальность», потому что практические последствия вполне определённы.

Рабочую нагрузку, которая принимает запись экрана, фотографию продукта, отсканированный договор или аудиофайл колл-центра, невозможно обслужить с помощью Beam ни за какую цену, ни с каким промптом, ни на каком тарифном плане. На уровне приложения обходного пути нет: документация Beam описывает одну входную модальность и одну выходную модальность, и ни один путь для изображений или аудио не указан. Gemini 3.1 Pro Preview обрабатывает все пять, а значит, это единственная модель здесь, которую можно встроить в рабочий процесс, где входные данные ещё не являются текстом.

Об обратном случае тоже стоит сказать, потому что именно в нём люди ошибаются. Если ваш вход — текст и останется текстом, пять модальностей Gemini не дают вам ничего, и вы платите цену мультимодальной модели за выполнение текстовой нагрузки. Это не аргумент в пользу Beam — это аргумент за то, что вопрос о модальности следует решать до вопроса о бенчмарке, потому что это отсекает варианты дешевле и надёжнее, чем любое сравнение оценок.

Два предпросмотра — два разных смысла.

Оба названия моделей содержат оговорку, и эти оговорки не одинаковы — это самое интересное в этой паре.

«Preview» у Gemini 3.1 Pro — это условное обозначение модели, которая с февраля в целом доступна для вызова, имеет независимую оценку, опубликованный тарифный план, включающий документированный уровень для длинного контекста, и полный набор инструментов. На практике «preview» здесь означает, что Google оставляет за собой право заменить её, а не то, что её трудно получить или что она не имеет оценки.

Бета-версия Beam — это настоящий барьер. Доступ осуществляется через лист ожидания, идентификатор модели был создан 5 октября 2026 года, тарифной сетки нет, оценок от третьих сторон нет, а артефакты, которые позволили бы кому угодно проверить центральное утверждение — веса, технический отчёт, карточка модели, — лишь обещаны, но не представлены. Показатель контекста сопровождается сноской с предупреждением, что он может измениться в ходе беты, — а это оговорка, в которой не нуждается ни одна общедоступная модель.

Последствие асимметрично — и это имеет значение для закупок. Команда, внедряющая Gemini 3.1 Pro Preview, принимает риск, связанный с частой сменой моделей. Команда, внедряющая Beam сегодня, принимает неизвестную цену, неизвестную независимую оценку и невозможность самостоятельно запускать модель. Это разные категории риска, и чаще всего решает именно цена.

A generated two-column scoreboard titled 'Reflection Beam vs Gemini 3.1 Pro Preview — the scoreboard'. Left column 'Reflection Beam': Input modalities text only; Context 256,000 tokens (beta); Max output 128,000 tokens; Price not published; Availability waitlisted beta; Independent score none yet. Right column 'Gemini 3.1 Pro Preview': Input modalities text, image, video, audio, file; Context 1,048,576 tokens; Max output 65,536 tokens; Price $2.00 / $12.00 to 200K, then $4.00 / $18.00; Availability preview, callable since February 2026; Independent score AA index 29.7. Footer reads 'Beam figures vendor-reported and unaudited. Gemini price is the provider list rate; its index is Artificial Analysis, read 6 October 2026.'

Бенчмарки и проблема цитирования

Стартовые таблицы Reflection не включают Gemini 3.1 Pro Preview или какую-либо модель Google. Его набор для сравнения состоит только из открытых и полуоткрытых моделей: Inkling, Nemotron 3 Ultra, GLM 5.2, GLM 5.3, Kimi K3, Qwen 3.8-Max и DeepSeek V4.1 Flash. Таким образом, эти две модели никогда не запускались друг против друга в опубликованной таблице, и приведённые ниже показатели получены с использованием разных испытательных стендов с обеих сторон.

• Индекс Artificial Analysis — Gemini 3.1 Pro занимает 58-е место из 147 в нём. Строки индекса нет вообще.

• GPQA Diamond — Gemini 3.1 Pro Preview с 94,1 по данным Artificial Analysis против 90,5, заявленных производителем Beam.

• SciCode — 58,7 у Gemini против заявленных Beam 49,7.

• Humanity's Last Exam — 47,0 у Gemini против заявленных вендором Beam 36,2, причём последний показатель — явно без инструментов.

• Terminal-Bench v2.1 — 73,8 для Gemini по данным Artificial Analysis против 80,1, заявленных Beam. Это самая сильная позиция Beam в этом сравнении, и это лёгкая добыча против модели, которая находится на рынке с февраля.

• Воспроизведение длинного контекста — 82.0 у Gemini против заявленных производителем 79.3 у Beam на AA-LCR.

• tau-squared Bench — 95,6 у Gemini против 78,7 у Beam на MCP Atlas и 38,0 на tau3 banking. Это родственные, но не одни и те же оценки агентного использования инструментов, и разница в названиях имеет значение.

Отдельная проблема честности, связанная со стороной Gemini в этой таблице, заслуживает отдельного предложения. Независимые оценки индекса для Gemini 3.1 Pro Preview приводились как 30, 46, 47,7 и 57 в разных источниках, а Artificial Analysis в один и тот же момент выдаёт разные редакции индекса на разных страницах моделей. Цифра 29,7 выше — это та, что была на странице, которую мы читали 6 октября 2026 года, и это единственная, которую мы будем цитировать, — но любая статья, которая ставит одно число индекса Gemini рядом с конкурентом, не указывая, из какого снимка оно взято, выдаёт плавающее число за фиксированное. Та же осторожность применима в обратном смысле к Beam, где снимка нет вообще.

Цена, и уровень, который никто не планирует

Gemini 3.1 Pro Preview стоит $2,00 за вход и $12,00 за выход за миллион токенов до 200 000 токенов, а свыше этого — $4,00 и $18,00. Чтение из кеша — $0,20 за миллион, запись в кеш — $0,375. Граница уровня — это то, что стоит учитывать при планировании: главное преимущество модели — окно размером 1 048 576 токенов, и как только запрос превышает 200 000 токенов, тариф на вход удваивается, а тариф на выход увеличивается в полтора раза. Поэтому рабочая нагрузка, рассчитанная на окно в миллион токенов, — это нагрузка, тарифицируемая по второму уровню для большей части своего трафика, а не по первому.

У Beam нет прайс-листа, поэтому нет тарифа для моделирования и не с чем сравнивать. Это отсутствие не нейтрально: оно означает, что самое дешёвое защитимое утверждение о стоимости Beam — что она неизвестна, а единственная количественная поддержка его позиционирования по эффективности — это собственная диаграмма Reflection, которая оценивает сгенерированные FLOPs как удвоенное количество активных параметров, умноженное на среднее количество сгенерированных токенов за попытку по DeepSWE, HLE и Terminal-Bench 2.1, — с подписью, признающей, что предзаполнение промпта, внимание и накладные расходы на обслуживание исключены. На рабочих нагрузках, где контекст в миллион токенов имеет значение, предзаполнение не является погрешностью округления, и именно этот член формула опускает.

A screenshot of the OrcaRouter model page for Gemini 3.1 Pro Preview (google/gemini-3.1-pro-preview), captured 6 October 2026, showing the model name and id, the INPUT $2.00 and OUTPUT $12.00 pricing tiles, p50 TTFT 10.00 s, p95 TTFT 10.00 s, 13.9M tokens of 7-day traffic, the provenance lines 'Public benchmarks by Google - 2026-02-19' and 'AI Analysis', the summary describing a frontier reasoning model with improved agentic reliability, and a code sample using base_url https://api.orcarouter.ai/v1.

Использование инструментов, поиск и то, в чём различаются эти два дизайна

Заявленные сильные стороны Gemini 3.1 Pro Preview — это разработка ПО, надёжность агентных систем и эффективность использования токенов, а опубликованный набор инструментов включает вызов функций, структурированные выходные данные и поисковую привязку. Последний пункт стоит отметить всем, кто сравнивает агентные стеки: поиск с привязкой — это собственная возможность на стороне Google, и он меняет то, что может делать агент, использующий инструменты, без подключения внешнего сервиса извлечения данных.

История с инструментами Beam интереснее, чем предполагает строка спецификации, и её сложнее оценить. Reflection сообщает MCP Atlas на 78,7, AutomationBench public на 37,0, tau3 banking на 38,0, BrowseComp с управлением контекстом на 77,4 и DeepSearchQA с управлением контекстом на 80,1 — и отмечает, что во время обучения с подкреплением модель органично научилась запрашивать другие языковые модели и вызывать OCR API, когда ей давали доступ к вебу, несмотря на то, что задачи просмотра веб-страниц отсутствовали в обучающей смеси. Если это обобщение подтвердится, это реальный сигнал об агентном переносе. Это также, на данный момент, наблюдение вендора из обучающего прогона, без независимой проверки.

В строках по использованию инструментов, где у обеих сторон есть числовые данные, картина скорее смешанная, чем односторонняя. Таблица вендора Beam ставит его выше GLM 5.2 в MCP Atlas и на один уровень с GLM 5.2 и Kimi K3 в tau3 banking, тогда как показатель Gemini в tau-squared Bench, равный 95,6, — это самый высокий агентный показатель, опубликованный любой из сторон. Разные наборы тестов, разные испытательные стенды и отсутствие общей оценки — вот повторяющаяся проблема в этом сравнении.

Выбор и как хеджировать

Правило принятия решения, вытекающее из вышесказанного, достаточно просто сформулировать в одной строке: если хотя бы один входной сигнал не является текстом, Beam не вариант, и сравнение завершено. Если все входные сигналы являются текстом, вопрос сводится к тому, оправдывает ли неподтверждённое заявление Beam об эффективности неизвестную цену и отсутствие независимой оценки по сравнению с моделью, которая стоит $2.00 и $12.00, с документированной шкалой и полноценным инструментом.

Gemini 3.1 Pro Preview есть в нашем каталоге, с тарифом провайдера по прайс-листу, переданным как есть и без наценки; доступ — через один OpenAI-совместимый ключ на api.orcarouter.ai/v1 вместе с более чем 200 другими моделями — и тот же ключ обслуживает модели, с которыми Beam конкурирует по цене, от GLM 5.3 за $1.26 и $3.96 до DeepSeek V4.1 Flash за $0.15 и $0.60, проверено в реальном времени сегодня утром. Поскольку граница уровня в 200 000 токенов — это проблема маршрутизации, а не проблема модели, DSL маршрутизации позволяет выразить её напрямую: оставлять короткие запросы на дешёвом уровне, а действительно длинные закреплять там, где окно — причина, по которой вы выбрали модель, в одном вызове, а не в коде приложения.

Reflection Beam не входит в число наших маршрутов, и мы не станем направлять вас к кому-либо, кто утверждает, что он у него есть. Если веса Apache 2.0 появятся в этом месяце, как обещано, самостоятельный хостинг станет третьим вариантом для работы только с текстом, и заявление об эффективности можно будет проверить на вашем собственном оборудовании.

A generated single-column card titled 'Reflection Beam — the state of play, 6 October 2026', used as the article's closing fact sheet. Rows read 'Total / active parameters: 501B / 23B', 'Pre-training: 23.8T tokens on 6,144 GB300, under four weeks', 'RL campaign: 10.5K GB300, 4 weeks, 100M+ rollouts', 'API context: 256,000 tokens, beta footnote', 'Reasoning effort: five levels, default medium, no off switch', 'Price: not published anywhere' and 'Independent score: none yet - no Artificial Analysis row'. The footer reads 'Vendor-reported; nothing independently reproduced. Weights, tech report and model card promised later this month.'

Что изменило бы ответ?

Аргументы Beam против Gemini опираются на те же два пункта, на которых строится любое сравнение Beam, а это противостояние добавляет третий.

Цена. Без неё аргумент об эффективности невозможно преобразовать в бюджетное решение, и модель конкурирует с помощью диаграммы, а не прайс-листа.

Независимая оценка. Artificial Analysis 5 октября сообщила, что Reflection предоставила ей доступ и что она проводит бенчмаркинг Beam, описывая ранние индикаторы как указывающие на то, что Beam станет одной из самых токен-эффективных открытых моделей из всех, что она видела для своего уровня интеллекта. Это тот самый источник, говорящий то, что нужно, и при этом на табло до сих пор нет строки Beam — страницы модели возвращают 404, а в таблице лидеров по состоянию на сегодняшнее утро нет записи о Beam.

А то, что не меняется: Beam работает только с текстом. Ни выпуск весов, ни снижение цены, ни оценка в индексе этого не меняют, а значит, для целого класса рабочих нагрузок это сравнение вообще никогда не станет сравнением. Если в вашем конвейере есть видео, ответом был Gemini 3.1 Pro Preview ещё до загрузки первого бенчмарка.

Сравнение в этой статье1

Определено по этой статье · Бенчмарки: Artificial Analysis · обновляется ежедневно