Сгенерированная главная титульная карточка с надписью «Deep Think Mathematica» и подзаголовком «Утёкшая математическая модель Google — объяснение», над четырьмя скруглёнными статусными чипами с надписями «Не выпущено», «Внутренняя тестовая сборка», «Контекст ~1M, по сообщениям» и «Бенчмарки не опубликованы», и строкой внизу «Утечка, а не запуск. Google не подтвердила существование этой модели».
Guides & Insights

Deep Think Mathematica: внутри утёкшей математической модели Google и крик в её трассировке рассуждений

Автор

Rowan Sterling

Дата публикации

Новые модели · 20Все модели
Бенчмарки: Artificial Analysis · обновляется ежедневно
Назад ко всем статьям

Самое показательное в Deep Think Mathematica — математической модели Goo​gle, всплывшей на внутренних тестах на этой неделе, — это то, что она, судя по всему, кричит. Аккаунт в X под именем «Lyra» 16 сентября 2026 года выложил в сеть скриншоты внутренних логов рассуждений, и эти трассировки читаются скорее как записи человека, у которого случилось озарение у доски, чем как работа ассистента для доказательства теорем: «Погоди-ка». «О боже мой». А после успешного упрощения уравнения — строка СВЯТАЯ МАТЬ МАТЕМАТИКИ!!!!!!!!!!!!!!!!!!!!!!!! Реакция была мгновенной и тёплой — Goo​gle, судя по всему, создал ИИ, который искренне любит математику. И это ещё и самое бесполезное, что можно вынести из утечки. Ничего из этого Goo​gle не подтвердил. Нет ни карточки модели, ни ID модели в каком-либо опубликованном списке, ни цены, ни даты выпуска. Что есть: строка сборки, две внутренние метки, бюджет токенов, набор скриншотов и лучшая точка сравнения среди уже выпущенных моделей того же семейства, Gem​ini 3.1 Deep Think — модель, которой действительно можно пользоваться уже сегодня, и та мерка, по которой эту утечку в итоге будут оценивать.

Итак, относитесь ко всему ниже как к тому, чем оно является: список утверждений, к каждому пункту которого прикреплён источник, отсортированный по тому, какую нагрузку ему предстоит выдержать.

Что на самом деле говорит сигнал — и подсказка, находящаяся над ним

Сам сигнал пришёл от @testingcatalog, аккаунта с приличной репутацией именно по Google: он обнародовал планы Gemini по использованию компьютера на десктопе и заметил раннюю карточку предварительного просмотра Nano Banana 2 под внутренним названием "GEMPIX2" до того, как Google что-либо сказал. Его пост от 16 сентября содержит два утверждения очень разного качества.

Второе утверждение — это модель. Новую «Deep Think Mathematica» заметили во внутреннем тестировании; её описывают как идейного преемника модели Deep Think IMO, которую Goo​gle предоставила избранным учреждениям в прошлом году.

Первое утверждение — это сигнал, и именно его стоит понять: «Когда Gemini собирается сменить фон, затевается нечто большое». Это не факт о модели. Это эвристика сообщества о хореографии релизов Google — наблюдение, что заметное обновление интерфейса приложения Gemini предшествовало нескольким более крупным анонсам Google. У подобных эвристик есть реальная история подтверждений и нулевая предсказательная сила. Обновление интерфейса — не модель.

Оба утверждения не подтверждены. Ни одно из них не является релизом, и этот материал не рассматривает его как таковой.

Декодирование строки сборки, потому что это самый конкретный артефакт здесь.

Единственное самое весомое доказательство, имеющееся в обращении, — это идентификатор сборки, приписываемый утёкшим логам:

Путь сборки — models/deepthink-mathematica-tf-raw-thoughts, о котором AI Sight сообщил 16 сентября 2026 года, вместе со скриншотами.

Эта строка вознаграждает за внимательное чтение, и именно на этом заканчивается большинство разборов. Три её части несут информацию.

«deepthink» — относит модель к линейке Deep Think, а не к основной линейке Gem​ini. Это важно, потому что Deep Think — это режим в выпускаемых продуктах Goo​gle, а не отдельное семейство: это путь параллельных рассуждений, который одновременно прорабатывает несколько вариантов решений.

"tf" —в контексте это сокращение от «Teamfood», второй из двух внутренних меток, упомянутых вместе со сборкой. Во внутреннем словаре Google это обозначение ранней стадии «dogfooding»: им пользуются сотрудники, а не клиенты.

«raw-thoughts» — самая интересная часть и ключ к крику. Это обозначает нефильтрованную конфигурацию цепочки рассуждений — рассуждения модели, выдаваемые без настройки на вежливость, стилевых ограничений или фильтрации вывода. Сборка «raw thoughts» — это не продукт. Это то, на что смотрят инженеры, когда хотят увидеть, что делает модель, прежде чем кто-либо приведёт это в презентабельный вид.

Второй упомянутый ярлык — UNSTABLE_EXPERIMENTAL, что почти самоочевидно и указывает в том же направлении, что и «Teamfood»: ранний, внутренний, не для клиентов.

Ещё две цифры приписываются тем же логам и имеют единственный источник, поэтому относитесь к ним с осторожностью:

Окно контекста —примерно 1 000 000 токенов, что соответствует окну в 1 млн токенов, которое Goo​gle уже предлагает в своих передовых моделях Gem​ini.

Лимит вывода — 65 536 токенов, что для модели рассуждений означает очень долгое размышление перед ответом.

Вот и вся техническая поверхность утечки. Путь сборки, две метки этапов, контекстное окно и ограничение вывода. Этого достаточно, чтобы сказать, что нечто существует в тестовом стенде. Недостаточно, чтобы сказать, сколько оно набирает.

A generated two-column scoreboard titled 'Deep Think Mathematica vs Gemini 3.1 Deep Think — the scoreboard'. Left column 'Deep Think Mathematica (leaked)' reads Status: internal test build; Base model: Gemini 3.1 Pro, reported; Context window: ~1M tokens, reported; Output limit: 65,536 tokens, reported; Benchmarks: none published; Access: no endpoint. Right column 'Gemini 3.1 Deep Think' reads Status: shipping now; Base model: Gemini 3.1 Pro; Context window: 1M tokens; Output limit: not published; Benchmarks: ARC-AGI-2 84.6%, vendor; Access: top tier plus invited API. Footer reads 'Mathematica figures are single-source and unconfirmed; Google has not acknowledged the model. Gemini 3.1 Deep Think figures are Google's own, unreproduced.'

Почему кричащая цепочка рассуждений — более слабое доказательство, чем кажется

Восклицательные знаки — причина того, что эта утечка разлетелась, и они же — причина, по которой с ней нужно обращаться осторожно.

Представленное объяснение заурядно и точно соответствует строке сборки: нефильтрованная конфигурация рассуждений, запущенная при высокой температуре генерации, со снятыми слоями вежливости и форматирования. Когда вы убираете настройку, из-за которой модель звучит спокойно, вы не раскрываете её душу — вы раскрываете её сэмплер. Вывод с обилием восклицательных знаков — так выглядит высокотемпературная выборка возбуждённого продолжения. Эмоциональная интерпретация — артефакт конфигурации, а не вывод о модели.

Более глубокий смысл в том, чем цепочка рассуждений является. Трасса рассуждений — это сгенерированный текст, который случайно оказывается полезным для решения задач. Чтение её стенограммы и вывод о внутреннем состоянии — воодушевлении, разочаровании, восторге — это та же категориальная ошибка, что и вывод о том, что калькулятор доволен, когда выдаёт целое число. Об этом стоит сказать прямо, потому что освещение этой утечки на китайском языке обыгрывало шутку («等等», «我的天»), а некоторые англоязычные материалы позволили шутке закрепиться в качестве описания характера модели.

Ничто из этого не делает трейс бесполезным. Раскрытие сборки с необработанными мыслями — это подлинное свидетельство о реальной инженерной практике: вы логируете нефильтрованные рассуждения только тогда, когда отлаживаете сами рассуждения, а именно это и делают с моделью, чья вся ценность в том, насколько хорошо она продумывает сложные задачи. И не подтверждено, появились ли эти трейсы в результате намеренной отладки или непреднамеренного логирования.

Честный итог: восклицательные знаки говорят лишь о том, что существует некая исходная конфигурация рассуждений. Они ничего не говорят вам о математических способностях.

Millennium Bench — это не задачи тысячелетия

Несколько публикаций об этой утечке, включая сводки агрегаторов, циркулировавшие 16 сентября, утверждают, что модель «нацелена на Millennium Bench», и на этом останавливаются. Это название невольно делает своё дело, потому что оно находится всего в одном слове от чего-то гораздо более известного и гораздо более нагруженного — семи Проблем тысячелетия Института математики Клэя, каждая из которых оценивается в 1 миллион долларов, и предмета отдельного и полностью неподтверждённого заявления в этом месяце об OpenAI и доказательстве Навье–Стокса. В одном сообщении из той ветки говорится, что Google создал ИИ, который «решил» проблему за 88 часов. Институт Клэя по-прежнему указывает её как открытую.

Это разные вещи, и их смешение значительно раздувает эту утечку.

MILLENNIUM-BENCH, представленный в статье ICLR 2026 года "Где дедукция терпит крах: диагностика сбоев рассуждений в математике исследовательского уровня", — это набор задач исследовательского уровня, отобранных экспертами, охватывающий девять областей, включая математическую физику, топологию и теоретико-мерную теорию вероятностей. Он был создан, чтобы требовать продолжительной многошаговой дедукции, выходящей далеко за пределы олимпиадной математики.

Его главный результат — это то, что важно для чтения этой утечки. На пяти передовых моделях, прогнанных по 100 раз на каждую задачу, самая сильная достигла не более 24% pass@1 и 39% pass@3. Диагностика того, как модели терпят неудачу, в статье полезнее, чем оценки: галлюцинация фреймворка, когда модель изобретает неприменимую теорию и затем рассуждает последовательно внутри неё, и сфабрикованные теоремы, когда она ссылается на несуществующие результаты, включая выдуманные имена авторов и номера теорем.

Удерживайте оба этих факта в голове одновременно. Бенчмарк, на котором лучшая модель вытягивает лишь около четверти задач, а её характерный провал — уверенное выдумывание, — это именно тот бенчмарк, где утёкшие скриншоты меньше всего способны что-либо продемонстрировать. Модель, которая кричит во время работы, — это модель, результаты которой вы предпочли бы отдать на оценку кому-то другому, а не её автору.

Что Goo​gle на самом деле выпустила в этой линейке

Утечка становится понятной только на фоне уже выпущенного, ведь математическая история Google — это задокументированная последовательность, и утёкшее название заимствует её достоверность.

Июль 2025 — усовершенствованная версия Gemini Deep Think достигла уровня золотой медали на Международной математической олимпиаде, решив пять из шести задач и набрав 35 из 42 баллов; работу оценивали официальные представители IMO по тем же стандартам, что применяются к учащимся. Демис Хассабис отметил, что она работала от начала до конца на естественном языке, без перевода в формальный синтаксис.

1 августа 2025 г. — Goo​gle выпустила Gem​ini 2.5 Deep Thinkпублично, но не золотую модель. Выпущенная версия была описана Goo​gle как более быстрая, более оптимизированная вариация, достигающая бронзового уровня результатов в бенчмарке IMO 2025 согласно внутренней оценке Goo​gle. Доступ к ней был ограничен высшим потребительским тарифом. Одновременно Goo​gle предоставила полную золотую модель избранной группе математиков и академиков — тем самым «избранным учреждениям», к которым отсылает утёкший сигнал.

Декабрь 2025 г. — Gem​ini 3 Deep Think, с большим скачком между поколениями, о котором Goo​gle сообщила как о 45,1% на ARC-AGI-2 с исполнением кода и 41,0% на Humanity's Last Exam без инструментов.

Теперь — Gemini 3.1 Deep Think, построенная на Gemini 3.1 Pro и распространяемая через высший потребительский уровень подписки и API-программу только по приглашениям. Опубликованные самим Goo​gle цифры, которые сообщены вендором и не были независимо воспроизведены, показывают для неё: ARC-AGI-2 — 84,6%, Humanity's Last Exam — 48,4% без инструментов и 53,4% с поиском и кодом, IMO 2025 — 81,5%, а также рейтинг Elo на Codeforces — 3455.

Важны и два смежных направления работы. Aletheia — агент для математических исследований, построенный на Gem​ini Deep Think: по сообщениям третьих сторон, он показывает примерно 95,1% на IMO-ProofBench Advanced, и примечателен не столько этим числом, сколько тем, что спроектирован говорить «решение не найдено», а не изобретать его; в февральском испытании FirstProof 2026 года он решил 6 задач из 10, а от остальных отказался. А конфигурация AI Co-Mathematician, работающая на Gem​ini 3.1 Pro, по сообщениям, подняла результат FrontierMath Tier 4 с 19% до 47,9%.

A screenshot of Google DeepMind's official Gemini 3.1 Deep Think model page at deepmind.google/models/gemini/deep-think, captured September 16 2026 in English, showing the title 'Gemini 3.1 Deep Think', the subtitle 'Best for modern challenges across science, research and engineering', a 'Try in Gemini' button, the blue DeepMind model illustration, and the opening line 'Our most specialized reasoning mode is built on top of Gemini 3.1 Pro'.

На этой последней цифре стоит задержаться, потому что она — сильнейший аргумент против того, чтобы интерпретировать эту утечку так, как её описали. Прыжок с 19% до 47,9% в математике исследовательского уровня, достигнутый с помощью скаффолда, обёрнутого вокруг общей модели Gemini, а не нового чекпоинта, говорит о том, что крупнейшие недавние улучшения в математических результатах Google связаны с обвязкой вокруг модели, а не со специализированной моделью под ней. Это не значит, что Mathematica — это скаффолд. Это значит, что бремя доказывания для утверждения «это новая специализированная математическая модель» выше, чем предполагало освещение.

Ещё один фрагмент контекста довлеет над всем этим: в августе 2026 года DeepMind провела реструктуризацию, а Демис Хассабис перешёл на роль председателя. Утечки изнутри реорганизующейся лаборатории не надёжнее утечек из стабильной, и в публикациях этот момент не рассматривался как значимый. А он может быть значимым.

Модель или каркас? Вопрос, который эта утечка не разрешает.

В публикациях идёт оживлённый спор о том, является ли Mathematica вообще новой моделью. Один лагерь указывает на префикс «deepthink» в строке сборки и трактует его как отдельный чекпойнт. Другой лагерь — в который попал наш собственный более ранний материал о слухе про Deep Think V3 — считает, что специализированные математические результаты Goo​gle получаются с помощью агентных скаффолдов, обёрнутых вокруг общих моделей Gem​ini, и что отдельная математическая модель не нужна, чтобы эти числа были реальными.

Строка сборки — скромный довод в пользу первого лагеря: models/deepthink-mathematica-tf-raw-thoughts называет модель, а «raw-thoughts» описывает конфигурацию модели, а не слой обвязки. Каркасу для отладки не нужно было бы, чтобы его рассуждения были неотфильтрованными; а модели, чьё мышление и есть продукт, — нужно было бы. Это настоящий сигнал.

Это не решающее доказательство. У испытательных стендов тоже есть конфигурация, и строку внутреннего пути пишет тот, кто настраивал логирование, а не схема. Что решило бы вопрос — так это то, чего ни у кого нет: карточка модели, или эндпоинт, или бенчмарк, проведённый кем-то без личной заинтересованности в ответе.

Что вы можете назвать сегодня

Ничто из этого не меняет того, что вы можете запустить в продакшен уже на этой неделе, и стоит прямо сказать о разрыве. Математика Deep Think не доступна ни в одном API. Gemini 3.1 Deep Think тоже не продаётся по токенам — доступ к нему открывается только на верхнем тарифе потребительской подписки, который указан в диапазоне от $99,99 до $199,99 в месяц в зависимости от тарифа, плюс API-программа только по приглашениям. Опубликованной цены за миллион токенов для него нет.

Базовая модель, на которой он, как сообщается, построен, — это совсем другая история. Цена Gemini 3.1 Pro составляет $2.00 за миллион входных токенов, $0.20 за кэшированные и $12.00 за миллион выходных токенов для контекстов объёмом менее 200 000 токенов; при превышении этого значения цены возрастают до $4.00 / $0.40 / $18.00 — это собственные опубликованные тарифы Goo​gle.

Эта деталь с ценами — как раз то место, где и принимается практическое решение, потому что разрыв в стоимости между режимами рассуждений немаленький. На ARC-AGI-2 Deep Think, по сообщениям, показывает примерно 85% при цене около $13,62 за задачу, тогда как Gemini 3.1 Pro — 77% при цене около $0,96 за задачу. Вы платите примерно в четырнадцать раз больше за восемь пунктов. Это оправданный компромисс для сложной исследовательской задачи и неоправданный для производственного сценария, который в основном выполняет обычную работу, — и правильный ответ обычно таков: вам нужно, чтобы и то и другое было доступно из одного места, а не чтобы решение о подписке принималось заранее.

A screenshot of the OrcaRouter models catalogue at www.orcarouter.ai/models, captured September 16 2026 in English, showing the header 'Models — 198 models · 15 providers · one API key, one bill', a 'How to call any model' card with an OpenAI-compatible curl example, and model cards including Google: Gemini 3.8 Flash at $0.750 per million input tokens, $0.075 cache read and $3.75 output, alongside Qwen3.8 Max, GPT-6 Astra and Claude Fable 5.1.

Вот аргумент в пользу маршрутизации по одному ключу. Модели Gem​ini, доступные для вызова сегодня, — Gemini 3.1 Pro Preview, Gemini 3.8 Flash по цене $0,750 за миллион входных токенов при $0,075 за чтение из кэша, а также остальное семейство — находятся в каталоге OrcaRouter из 198 моделей у 15 провайдеров, за одной конечной точкой, совместимой с OpenAI. На прайс-листы провайдеров наценки нет, поэтому изменение цены у Goo​gle вступает в силу на нашей стороне в тот же день, а не ждёт перезаключения договора. Автоматическое переключение при сбое означает, что непроверенная или предварительная модель может присутствовать в маршруте, не неся в одиночку производственный путь, — и это именно та позиция, которой заслуживает утёкшая модель: попробуйте её, сохраните резервный вариант, больше ничего не меняйте. DSL маршрутизации объединяет несколько моделей в один вызов, а слияние моделей запускает панель и комбинирует ответы — и то, и другое полезно, когда вопрос сложный и честная позиция состоит в том, что вам нужно мнение более чем одной модели.

Чтобы чётко обозначить границу: OrcaRouter не размещает Deep Think mathematica и не размещает Gem​ini 3.1 Deep Think. Их нет в нашем каталоге, и ничто здесь не должно наводить на мысль об обратном. В каталоге есть слой Gem​ini, лежащий в их основе.

Что превратило бы это из утечки в новость?

Четыре вещи, примерно в порядке того, насколько сильно они продвинули бы сюжет.

Карточка модели. Релизы Google Deep Think сопровождались опубликованными оценками. Карточка с цифрами по MILLENNIUM-BENCH или IMO-ProofBench Advanced, полученными в заявленных условиях, превратила бы это из строки сборки в модель.

Эндпоинт. Самым явным сигналом было бы появление Mathematica в Gemini API или в списке моделей Google под любым названием. Пока этого не произойдёт, никто не сможет его вызвать, и не существует цены для сравнения.

Институциональный путь. Схема Goo​gle в 2025 году заключалась в том, чтобы сначала дать самую мощную математическую модель отобранным математикам, а публике — более быстрый вариант позже. Тихое развёртывание для исследователей вписывалось бы в этот прецедент и, вероятно, стало бы известно до любого анонса продукта.

Запуск третьей стороной. Учитывая, что рассматриваемый бенчмарк достигает максимума около 24% pass@1 у лучших доступных моделей, а его характерный режим отказа — уверенная фабрикация, независимая оценка остаётся единственным доказательством, которое устоит. Каждая цифра в этом материале, несущая числовое значение, либо принадлежит Google, либо сообщена третьей стороной, либо явно помечена как непроверенная — и ни одна из них не получена от модели, которую запускал кто-либо за пределами DeepMind.

Единственное, что стоит сделать сейчас, — не ждать. Разрыв между математическим режимом Goo​gle и её базовой моделью составляет четырнадцатикратную разницу в стоимости и восемь пунктов в точности, и этот компромисс уже действует; вы можете сделать это сегодня с Gemini 3.1 Pro Preview на одном ключе и с резервным вариантом за ним. Когда у Mathematica появится карточка модели, вам захочется уже решить, как вы маршрутизируете сложные задачи, — и ответ на это не будет зависеть от того, какой окажется утёкшая модель.

Сравнение в этой статье1

Определено по этой статье · Бенчмарки: Artificial Analysis · обновляется ежедневно