
Deep Think Mathematica: внутри утёкшей математической модели Google и крик в её трассировке рассуждений
- orcaНОВИНКАOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 за 1 млн токенов
- deepseekНОВИНКАDeepSeek: DeepSeek V4.1 Flash2026-09-1040Интеллект
- openaiНОВИНКАOpenAI: GPT-6 Astra2026-09-0453Интеллект77Кодинг
- googleGoogle: Gemini 3.8 Flash2026-09-0241Интеллект76Кодинг
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Интеллект76Кодинг
- anthropicAnthropic: Claude Fable 5.12026-09-0153Интеллект82Кодинг
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 за 1 млн токенов
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Интеллект72Кодинг
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 за 1 млн токенов
- z-aiZ.ai: GLM 5.32026-08-1845Интеллект75Кодинг
- obsidianQwen3.8 27B2026-08-1534Интеллект68Кодинг
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Интеллект69Кодинг
- grokSpaceXAI: Grok 4.62026-08-1244Интеллект77Кодинг
- metaMeta: Muse Spark 1.22026-08-0540Интеллект72Кодинг
- qwenQwen: Qwen3.8 Max2026-08-0345Интеллект76Кодинг
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135Интеллект69Кодинг
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 за 1 млн токенов
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2451Интеллект78Кодинг
Самое показательное в Deep Think Mathematica — математической модели Google, всплывшей на внутренних тестах на этой неделе, — это то, что она, судя по всему, кричит. Аккаунт в X под именем «Lyra» 16 сентября 2026 года выложил в сеть скриншоты внутренних логов рассуждений, и эти трассировки читаются скорее как записи человека, у которого случилось озарение у доски, чем как работа ассистента для доказательства теорем: «Погоди-ка». «О боже мой». А после успешного упрощения уравнения — строка СВЯТАЯ МАТЬ МАТЕМАТИКИ!!!!!!!!!!!!!!!!!!!!!!!! Реакция была мгновенной и тёплой — Google, судя по всему, создал ИИ, который искренне любит математику. И это ещё и самое бесполезное, что можно вынести из утечки. Ничего из этого Google не подтвердил. Нет ни карточки модели, ни ID модели в каком-либо опубликованном списке, ни цены, ни даты выпуска. Что есть: строка сборки, две внутренние метки, бюджет токенов, набор скриншотов и лучшая точка сравнения среди уже выпущенных моделей того же семейства, Gemini 3.1 Deep Think — модель, которой действительно можно пользоваться уже сегодня, и та мерка, по которой эту утечку в итоге будут оценивать.
Итак, относитесь ко всему ниже как к тому, чем оно является: список утверждений, к каждому пункту которого прикреплён источник, отсортированный по тому, какую нагрузку ему предстоит выдержать.
Что на самом деле говорит сигнал — и подсказка, находящаяся над ним
Сам сигнал пришёл от @testingcatalog, аккаунта с приличной репутацией именно по Google: он обнародовал планы Gemini по использованию компьютера на десктопе и заметил раннюю карточку предварительного просмотра Nano Banana 2 под внутренним названием "GEMPIX2" до того, как Google что-либо сказал. Его пост от 16 сентября содержит два утверждения очень разного качества.
Второе утверждение — это модель. Новую «Deep Think Mathematica» заметили во внутреннем тестировании; её описывают как идейного преемника модели Deep Think IMO, которую Google предоставила избранным учреждениям в прошлом году.
Первое утверждение — это сигнал, и именно его стоит понять: «Когда Gemini собирается сменить фон, затевается нечто большое». Это не факт о модели. Это эвристика сообщества о хореографии релизов Google — наблюдение, что заметное обновление интерфейса приложения Gemini предшествовало нескольким более крупным анонсам Google. У подобных эвристик есть реальная история подтверждений и нулевая предсказательная сила. Обновление интерфейса — не модель.
Оба утверждения не подтверждены. Ни одно из них не является релизом, и этот материал не рассматривает его как таковой.
Декодирование строки сборки, потому что это самый конкретный артефакт здесь.
Единственное самое весомое доказательство, имеющееся в обращении, — это идентификатор сборки, приписываемый утёкшим логам:
• Путь сборки — models/deepthink-mathematica-tf-raw-thoughts, о котором AI Sight сообщил 16 сентября 2026 года, вместе со скриншотами.
Эта строка вознаграждает за внимательное чтение, и именно на этом заканчивается большинство разборов. Три её части несут информацию.
• «deepthink» — относит модель к линейке Deep Think, а не к основной линейке Gemini. Это важно, потому что Deep Think — это режим в выпускаемых продуктах Google, а не отдельное семейство: это путь параллельных рассуждений, который одновременно прорабатывает несколько вариантов решений.
• "tf" —в контексте это сокращение от «Teamfood», второй из двух внутренних меток, упомянутых вместе со сборкой. Во внутреннем словаре Google это обозначение ранней стадии «dogfooding»: им пользуются сотрудники, а не клиенты.
• «raw-thoughts» — самая интересная часть и ключ к крику. Это обозначает нефильтрованную конфигурацию цепочки рассуждений — рассуждения модели, выдаваемые без настройки на вежливость, стилевых ограничений или фильтрации вывода. Сборка «raw thoughts» — это не продукт. Это то, на что смотрят инженеры, когда хотят увидеть, что делает модель, прежде чем кто-либо приведёт это в презентабельный вид.
Второй упомянутый ярлык — UNSTABLE_EXPERIMENTAL, что почти самоочевидно и указывает в том же направлении, что и «Teamfood»: ранний, внутренний, не для клиентов.
Ещё две цифры приписываются тем же логам и имеют единственный источник, поэтому относитесь к ним с осторожностью:
• Окно контекста —примерно 1 000 000 токенов, что соответствует окну в 1 млн токенов, которое Google уже предлагает в своих передовых моделях Gemini.
• Лимит вывода — 65 536 токенов, что для модели рассуждений означает очень долгое размышление перед ответом.
Вот и вся техническая поверхность утечки. Путь сборки, две метки этапов, контекстное окно и ограничение вывода. Этого достаточно, чтобы сказать, что нечто существует в тестовом стенде. Недостаточно, чтобы сказать, сколько оно набирает.

Почему кричащая цепочка рассуждений — более слабое доказательство, чем кажется
Восклицательные знаки — причина того, что эта утечка разлетелась, и они же — причина, по которой с ней нужно обращаться осторожно.
Представленное объяснение заурядно и точно соответствует строке сборки: нефильтрованная конфигурация рассуждений, запущенная при высокой температуре генерации, со снятыми слоями вежливости и форматирования. Когда вы убираете настройку, из-за которой модель звучит спокойно, вы не раскрываете её душу — вы раскрываете её сэмплер. Вывод с обилием восклицательных знаков — так выглядит высокотемпературная выборка возбуждённого продолжения. Эмоциональная интерпретация — артефакт конфигурации, а не вывод о модели.
Более глубокий смысл в том, чем цепочка рассуждений является. Трасса рассуждений — это сгенерированный текст, который случайно оказывается полезным для решения задач. Чтение её стенограммы и вывод о внутреннем состоянии — воодушевлении, разочаровании, восторге — это та же категориальная ошибка, что и вывод о том, что калькулятор доволен, когда выдаёт целое число. Об этом стоит сказать прямо, потому что освещение этой утечки на китайском языке обыгрывало шутку («等等», «我的天»), а некоторые англоязычные материалы позволили шутке закрепиться в качестве описания характера модели.
Ничто из этого не делает трейс бесполезным. Раскрытие сборки с необработанными мыслями — это подлинное свидетельство о реальной инженерной практике: вы логируете нефильтрованные рассуждения только тогда, когда отлаживаете сами рассуждения, а именно это и делают с моделью, чья вся ценность в том, насколько хорошо она продумывает сложные задачи. И не подтверждено, появились ли эти трейсы в результате намеренной отладки или непреднамеренного логирования.
Честный итог: восклицательные знаки говорят лишь о том, что существует некая исходная конфигурация рассуждений. Они ничего не говорят вам о математических способностях.
Millennium Bench — это не задачи тысячелетия
Несколько публикаций об этой утечке, включая сводки агрегаторов, циркулировавшие 16 сентября, утверждают, что модель «нацелена на Millennium Bench», и на этом останавливаются. Это название невольно делает своё дело, потому что оно находится всего в одном слове от чего-то гораздо более известного и гораздо более нагруженного — семи Проблем тысячелетия Института математики Клэя, каждая из которых оценивается в 1 миллион долларов, и предмета отдельного и полностью неподтверждённого заявления в этом месяце об OpenAI и доказательстве Навье–Стокса. В одном сообщении из той ветки говорится, что Google создал ИИ, который «решил» проблему за 88 часов. Институт Клэя по-прежнему указывает её как открытую.
Это разные вещи, и их смешение значительно раздувает эту утечку.
MILLENNIUM-BENCH, представленный в статье ICLR 2026 года "Где дедукция терпит крах: диагностика сбоев рассуждений в математике исследовательского уровня", — это набор задач исследовательского уровня, отобранных экспертами, охватывающий девять областей, включая математическую физику, топологию и теоретико-мерную теорию вероятностей. Он был создан, чтобы требовать продолжительной многошаговой дедукции, выходящей далеко за пределы олимпиадной математики.
Его главный результат — это то, что важно для чтения этой утечки. На пяти передовых моделях, прогнанных по 100 раз на каждую задачу, самая сильная достигла не более 24% pass@1 и 39% pass@3. Диагностика того, как модели терпят неудачу, в статье полезнее, чем оценки: галлюцинация фреймворка, когда модель изобретает неприменимую теорию и затем рассуждает последовательно внутри неё, и сфабрикованные теоремы, когда она ссылается на несуществующие результаты, включая выдуманные имена авторов и номера теорем.
Удерживайте оба этих факта в голове одновременно. Бенчмарк, на котором лучшая модель вытягивает лишь около четверти задач, а её характерный провал — уверенное выдумывание, — это именно тот бенчмарк, где утёкшие скриншоты меньше всего способны что-либо продемонстрировать. Модель, которая кричит во время работы, — это модель, результаты которой вы предпочли бы отдать на оценку кому-то другому, а не её автору.
Что Google на самом деле выпустила в этой линейке
Утечка становится понятной только на фоне уже выпущенного, ведь математическая история Google — это задокументированная последовательность, и утёкшее название заимствует её достоверность.
• Июль 2025 — усовершенствованная версия Gemini Deep Think достигла уровня золотой медали на Международной математической олимпиаде, решив пять из шести задач и набрав 35 из 42 баллов; работу оценивали официальные представители IMO по тем же стандартам, что применяются к учащимся. Демис Хассабис отметил, что она работала от начала до конца на естественном языке, без перевода в формальный синтаксис.
• 1 августа 2025 г. — Google выпустила Gemini 2.5 Deep Thinkпублично, но не золотую модель. Выпущенная версия была описана Google как более быстрая, более оптимизированная вариация, достигающая бронзового уровня результатов в бенчмарке IMO 2025 согласно внутренней оценке Google. Доступ к ней был ограничен высшим потребительским тарифом. Одновременно Google предоставила полную золотую модель избранной группе математиков и академиков — тем самым «избранным учреждениям», к которым отсылает утёкший сигнал.
• Декабрь 2025 г. — Gemini 3 Deep Think, с большим скачком между поколениями, о котором Google сообщила как о 45,1% на ARC-AGI-2 с исполнением кода и 41,0% на Humanity's Last Exam без инструментов.
• Теперь — Gemini 3.1 Deep Think, построенная на Gemini 3.1 Pro и распространяемая через высший потребительский уровень подписки и API-программу только по приглашениям. Опубликованные самим Google цифры, которые сообщены вендором и не были независимо воспроизведены, показывают для неё: ARC-AGI-2 — 84,6%, Humanity's Last Exam — 48,4% без инструментов и 53,4% с поиском и кодом, IMO 2025 — 81,5%, а также рейтинг Elo на Codeforces — 3455.
Важны и два смежных направления работы. Aletheia — агент для математических исследований, построенный на Gemini Deep Think: по сообщениям третьих сторон, он показывает примерно 95,1% на IMO-ProofBench Advanced, и примечателен не столько этим числом, сколько тем, что спроектирован говорить «решение не найдено», а не изобретать его; в февральском испытании FirstProof 2026 года он решил 6 задач из 10, а от остальных отказался. А конфигурация AI Co-Mathematician, работающая на Gemini 3.1 Pro, по сообщениям, подняла результат FrontierMath Tier 4 с 19% до 47,9%.

На этой последней цифре стоит задержаться, потому что она — сильнейший аргумент против того, чтобы интерпретировать эту утечку так, как её описали. Прыжок с 19% до 47,9% в математике исследовательского уровня, достигнутый с помощью скаффолда, обёрнутого вокруг общей модели Gemini, а не нового чекпоинта, говорит о том, что крупнейшие недавние улучшения в математических результатах Google связаны с обвязкой вокруг модели, а не со специализированной моделью под ней. Это не значит, что Mathematica — это скаффолд. Это значит, что бремя доказывания для утверждения «это новая специализированная математическая модель» выше, чем предполагало освещение.
Ещё один фрагмент контекста довлеет над всем этим: в августе 2026 года DeepMind провела реструктуризацию, а Демис Хассабис перешёл на роль председателя. Утечки изнутри реорганизующейся лаборатории не надёжнее утечек из стабильной, и в публикациях этот момент не рассматривался как значимый. А он может быть значимым.
Модель или каркас? Вопрос, который эта утечка не разрешает.
В публикациях идёт оживлённый спор о том, является ли Mathematica вообще новой моделью. Один лагерь указывает на префикс «deepthink» в строке сборки и трактует его как отдельный чекпойнт. Другой лагерь — в который попал наш собственный более ранний материал о слухе про Deep Think V3 — считает, что специализированные математические результаты Google получаются с помощью агентных скаффолдов, обёрнутых вокруг общих моделей Gemini, и что отдельная математическая модель не нужна, чтобы эти числа были реальными.
Строка сборки — скромный довод в пользу первого лагеря: models/deepthink-mathematica-tf-raw-thoughts называет модель, а «raw-thoughts» описывает конфигурацию модели, а не слой обвязки. Каркасу для отладки не нужно было бы, чтобы его рассуждения были неотфильтрованными; а модели, чьё мышление и есть продукт, — нужно было бы. Это настоящий сигнал.
Это не решающее доказательство. У испытательных стендов тоже есть конфигурация, и строку внутреннего пути пишет тот, кто настраивал логирование, а не схема. Что решило бы вопрос — так это то, чего ни у кого нет: карточка модели, или эндпоинт, или бенчмарк, проведённый кем-то без личной заинтересованности в ответе.
Что вы можете назвать сегодня
Ничто из этого не меняет того, что вы можете запустить в продакшен уже на этой неделе, и стоит прямо сказать о разрыве. Математика Deep Think не доступна ни в одном API. Gemini 3.1 Deep Think тоже не продаётся по токенам — доступ к нему открывается только на верхнем тарифе потребительской подписки, который указан в диапазоне от $99,99 до $199,99 в месяц в зависимости от тарифа, плюс API-программа только по приглашениям. Опубликованной цены за миллион токенов для него нет.
Базовая модель, на которой он, как сообщается, построен, — это совсем другая история. Цена Gemini 3.1 Pro составляет $2.00 за миллион входных токенов, $0.20 за кэшированные и $12.00 за миллион выходных токенов для контекстов объёмом менее 200 000 токенов; при превышении этого значения цены возрастают до $4.00 / $0.40 / $18.00 — это собственные опубликованные тарифы Google.
Эта деталь с ценами — как раз то место, где и принимается практическое решение, потому что разрыв в стоимости между режимами рассуждений немаленький. На ARC-AGI-2 Deep Think, по сообщениям, показывает примерно 85% при цене около $13,62 за задачу, тогда как Gemini 3.1 Pro — 77% при цене около $0,96 за задачу. Вы платите примерно в четырнадцать раз больше за восемь пунктов. Это оправданный компромисс для сложной исследовательской задачи и неоправданный для производственного сценария, который в основном выполняет обычную работу, — и правильный ответ обычно таков: вам нужно, чтобы и то и другое было доступно из одного места, а не чтобы решение о подписке принималось заранее.

Вот аргумент в пользу маршрутизации по одному ключу. Модели Gemini, доступные для вызова сегодня, — Gemini 3.1 Pro Preview, Gemini 3.8 Flash по цене $0,750 за миллион входных токенов при $0,075 за чтение из кэша, а также остальное семейство — находятся в каталоге OrcaRouter из 198 моделей у 15 провайдеров, за одной конечной точкой, совместимой с OpenAI. На прайс-листы провайдеров наценки нет, поэтому изменение цены у Google вступает в силу на нашей стороне в тот же день, а не ждёт перезаключения договора. Автоматическое переключение при сбое означает, что непроверенная или предварительная модель может присутствовать в маршруте, не неся в одиночку производственный путь, — и это именно та позиция, которой заслуживает утёкшая модель: попробуйте её, сохраните резервный вариант, больше ничего не меняйте. DSL маршрутизации объединяет несколько моделей в один вызов, а слияние моделей запускает панель и комбинирует ответы — и то, и другое полезно, когда вопрос сложный и честная позиция состоит в том, что вам нужно мнение более чем одной модели.
Чтобы чётко обозначить границу: OrcaRouter не размещает Deep Think mathematica и не размещает Gemini 3.1 Deep Think. Их нет в нашем каталоге, и ничто здесь не должно наводить на мысль об обратном. В каталоге есть слой Gemini, лежащий в их основе.
Что превратило бы это из утечки в новость?
Четыре вещи, примерно в порядке того, насколько сильно они продвинули бы сюжет.
• Карточка модели. Релизы Google Deep Think сопровождались опубликованными оценками. Карточка с цифрами по MILLENNIUM-BENCH или IMO-ProofBench Advanced, полученными в заявленных условиях, превратила бы это из строки сборки в модель.
• Эндпоинт. Самым явным сигналом было бы появление Mathematica в Gemini API или в списке моделей Google под любым названием. Пока этого не произойдёт, никто не сможет его вызвать, и не существует цены для сравнения.
• Институциональный путь. Схема Google в 2025 году заключалась в том, чтобы сначала дать самую мощную математическую модель отобранным математикам, а публике — более быстрый вариант позже. Тихое развёртывание для исследователей вписывалось бы в этот прецедент и, вероятно, стало бы известно до любого анонса продукта.
• Запуск третьей стороной. Учитывая, что рассматриваемый бенчмарк достигает максимума около 24% pass@1 у лучших доступных моделей, а его характерный режим отказа — уверенная фабрикация, независимая оценка остаётся единственным доказательством, которое устоит. Каждая цифра в этом материале, несущая числовое значение, либо принадлежит Google, либо сообщена третьей стороной, либо явно помечена как непроверенная — и ни одна из них не получена от модели, которую запускал кто-либо за пределами DeepMind.
Единственное, что стоит сделать сейчас, — не ждать. Разрыв между математическим режимом Google и её базовой моделью составляет четырнадцатикратную разницу в стоимости и восемь пунктов в точности, и этот компромисс уже действует; вы можете сделать это сегодня с Gemini 3.1 Pro Preview на одном ключе и с резервным вариантом за ним. Когда у Mathematica появится карточка модели, вам захочется уже решить, как вы маршрутизируете сложные задачи, — и ответ на это не будет зависеть от того, какой окажется утёкшая модель.
Сравнение в этой статье1
Определено по этой статье · Бенчмарки: Artificial Analysis · обновляется ежедневно
