
Deep Think Mathematica: dentro del modelo matemático filtrado de Google, y el grito en su traza de razonamiento
- orcaNUEVOOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 por 1M de tokens
- deepseekNUEVODeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligencia
- openaiNUEVOOpenAI: GPT-6 Astra2026-09-0453Inteligencia77Código
- googleGoogle: Gemini 3.8 Flash2026-09-0241Inteligencia76Código
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Inteligencia76Código
- anthropicAnthropic: Claude Fable 5.12026-09-0153Inteligencia82Código
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 por 1M de tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligencia72Código
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 por 1M de tokens
- z-aiZ.ai: GLM 5.32026-08-1845Inteligencia75Código
- obsidianQwen3.8 27B2026-08-1534Inteligencia68Código
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Inteligencia69Código
- grokSpaceXAI: Grok 4.62026-08-1244Inteligencia77Código
- metaMeta: Muse Spark 1.22026-08-0540Inteligencia72Código
- qwenQwen: Qwen3.8 Max2026-08-0345Inteligencia76Código
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135Inteligencia69Código
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 por 1M de tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2451Inteligencia78Código
Lo más revelador de Deep Think Mathematica — el modelo matemático de Google que apareció en pruebas internas esta semana — es que parece gritar. Una cuenta de X que publica bajo el nombre "Lyra" puso capturas de pantalla de registros de razonamiento internos en línea el 16 de septiembre de 2026, y los rastros se leen menos como un asistente de demostraciones que como una persona teniendo un momento de inspiración en una pizarra: "Espera". "Oh, Dios mío". Y, tras simplificar una ecuación con éxito, la cadena ¡¡¡MADRE DE LAS MATEMÁTICAS!!!!!!!!!!!!!!!!!!!!!!!! La reacción fue inmediata y cariñosa — Google aparentemente había construido una IA que realmente ama las matemáticas. Esa reacción es también lo menos útil que se puede extraer de la filtración. Nada de esto ha sido confirmado por Google. No hay una ficha de modelo, ni un ID de modelo en ninguna lista publicada, ni un precio, ni una fecha de lanzamiento. Lo que existe es una cadena de compilación, dos etiquetas internas, un presupuesto de tokens, un conjunto de capturas de pantalla, y el mejor punto de comparación ya lanzado en la misma familia, Gemini 3.1 Deep Think — un modelo que puedes usar hoy mismo, y la vara de medir con la que eventualmente se juzgará esta filtración.
Así que trata todo lo que aparece a continuación como lo que es: una lista de afirmaciones con una fuente adjunta a cada elemento, ordenada según cuánto peso soportará.
Lo que la señal dice en realidad — y el indicio que se encuentra encima
La señal en sí provino de @testingcatalog, una cuenta con un historial bastante bueno específicamente en Google: reveló los planes de uso de computadora de escritorio de Gemini y captó la tarjeta de vista previa temprana de Nano Banana 2 bajo el nombre interno "GEMPIX2" antes de que Google dijera nada. Su publicación del 16 de septiembre contiene dos afirmaciones de calidad muy diferente.
La segunda afirmación es el modelo. Un nuevo "Deep Think Mathematica" ha sido detectado en pruebas internas, descrito como un sucesor en espíritu del modelo Deep Think IMO que Google envió a instituciones seleccionadas el año pasado.
La primera afirmación es la que delata, y es la que merece la pena entender: "Cuando Gemini está a punto de cambiar su fondo, algo grande se está gestando." Eso no es un hecho sobre un modelo. Es una heurística de la comunidad sobre la coreografía de lanzamientos de Google — la observación de que una renovación visible de la superficie de la aplicación Gemini ha precedido a varios de los anuncios más importantes de Google. Heurísticas como esta tienen un historial real y cero fuerza predictiva. Una renovación de la interfaz de usuario no es un modelo.
Ambas afirmaciones no están verificadas. Ninguna es un comunicado, y este artículo no lo trata como tal.
Decodificando la cadena de compilación, porque es el artefacto más concreto que hay aquí.
La pieza de evidencia más difícil de rebatir en circulación es un identificador de compilación atribuido a los registros filtrados:
• Ruta de compilación — models/deepthink-mathematica-tf-raw-thoughts, reportado por AI Sight el 16 de septiembre de 2026, junto con las capturas de pantalla.
Esa cadena recompensa una lectura atenta, y es donde se detiene la mayoría de los análisis. Tres partes de ella contienen información.
• "deepthink" — sitúa el modelo en la línea Deep Think en lugar de la línea principal de Gemini. Eso importa porque Deep Think es un modo en los productos lanzados por Google, no una familia aparte: es la ruta de razonamiento en paralelo que ejecuta múltiples soluciones candidatas a la vez.
• "tf" — en contexto, abreviatura de "Teamfood", la segunda de las dos etiquetas internas reportadas junto con el build. En el vocabulario interno de Gooogle, es una designación temprana, propia de la fase de dogfooding: empleados que lo usan, no clientes.
• "pensamientos sin procesar" — la parte más interesante, y la clave de los gritos. Esto denota la configuración de cadena de pensamiento sin filtro — el razonamiento del modelo emitido sin ajuste de cortesía, restricciones de estilo ni filtrado de salida. Una compilación de "pensamientos sin procesar" no es el producto. Es lo que los ingenieros miran cuando quieren ver qué está haciendo el modelo antes de que alguien lo haga presentable.
La segunda etiqueta reportada es UNSTABLE_EXPERIMENTAL, que es casi autoexplicativa y apunta en la misma dirección que "Teamfood": temprana, interna, no para clientes.
Otras dos cifras se atribuyen a los mismos registros y provienen de una sola fuente, así que tómalas con reservas:
• Ventana de contexto — aproximadamente 1,000,000 tokens, a la par de la ventana de 1M que Gooogle ya ofrece en sus modelos Gemini de frontera.
• Límite de salida — 65,536 tokens, lo que en un modelo de razonamiento significa una deliberación muy larga antes de dar una respuesta.
Esa es toda la superficie técnica de la filtración. Una ruta de compilación, dos etiquetas de etapa, una ventana de contexto y un límite de salida. Es suficiente para decir que algo existe en un arnés de pruebas. No es suficiente para decir qué puntuación obtiene.

Por qué un rastro de razonamiento que grita es evidencia más débil de lo que parece
Los signos de exclamación son la razón por la que esta filtración se difundió, y son la razón para tener cuidado con ella.
La explicación reportada es anodina y encaja exactamente con la cadena de compilación: una configuración de razonamiento sin filtrar, ejecutada a una temperatura de generación alta, con las capas de cortesía y formato eliminadas. Cuando se elimina el ajuste que hace que un modelo suene calmado, no se revela su alma: se revela su muestreador. La salida cargada de exclamaciones es lo que parece una muestra de alta temperatura de una continuación excitada. La lectura emocional es un artefacto de la configuración, no un hallazgo sobre el modelo.
El punto más profundo tiene que ver con lo que una cadena de pensamiento es. Una traza de razonamiento es texto generado que, por casualidad, resulta útil para resolver problemas. Leer una transcripción de ella e inferir un estado interno —entusiasmo, frustración, deleite— es el mismo error de categoría que inferir que una calculadora se alegra cuando produce un número entero limpio. Vale la pena decirlo claramente porque la cobertura en chino de esta filtración se apoyó en la broma ("等等", "我的天") y alguna cobertura en inglés dejó que la broma se endureciera hasta convertirse en una descripción del carácter del modelo.
Nada de eso hace que la traza carezca de valor. Exponer una build de pensamientos sin procesar es evidencia genuina de una práctica de ingeniería real: solo registras el razonamiento sin filtrar cuando estás depurando el razonamiento en sí, que es lo que haces con un modelo cuya propuesta de valor entera es lo bien que piensa a través de problemas difíciles. Y no está verificado si las trazas provinieron de una depuración deliberada o de un registro no intencionado.
El resumen honesto: las exclamaciones te dicen que existe una configuración de razonamiento básica. No te dicen nada sobre la capacidad matemática.
Millennium Bench no son los Problemas del Milenio
Varios artículos sobre esta filtración, incluidos los resúmenes de agregadores que circularon el 16 de septiembre, presentan al modelo «apuntando a Millennium Bench» y lo dejan ahí. El nombre está haciendo un trabajo accidental, porque queda a una sola palabra de algo mucho más famoso y mucho más cargado de significado: los siete Problemas del Premio del Milenio del Clay Mathematics Institute, cada uno con una recompensa de 1 millón de dólares, y objeto de una afirmación aparte y totalmente sin confirmar este mes sobre OpenAI y una demostración de Navier–Stokes. Un informe de ese hilo dice que Google construyó una IA que «resolvió» el problema en 88 horas. Clay todavía lo lista como abierto.
Son cosas distintas, y confundirlas infla considerablemente esta filtración.
MILLENNIUM-BENCH, tal como se presenta en el artículo de ICLR 2026 "Donde la deducción se desmorona: Diagnóstico de fallos de razonamiento en matemáticas de nivel de investigación," es un benchmark de problemas a nivel de investigación curados por expertos que abarcan nueve dominios, incluidos física matemática, topología y probabilidad de teoría de la medida. Fue creado para exigir una deducción sostenida de múltiples pasos mucho más allá de las matemáticas de competición.
Su resultado principal es la parte que importa para leer esta filtración. En cinco modelos de frontera, ejecutados 100 veces por problema, el más fuerte logró como máximo 24 % de pass@1 y 39 % de pass@3. El diagnóstico del artículo sobre cómo fallan los modelos es más útil que las puntuaciones: alucinación de marco, en la que un modelo inventa una teoría inaplicable y luego razona de forma coherente dentro de ella, y teoremas fabricados, en la que cita resultados que no existen, con nombres de autores y números de teoremas inventados.
Ten ambas cosas en mente a la vez. Un benchmark en el que el mejor modelo apenas alcanza cerca de una cuarta parte de los problemas, cuya falla característica es la invención con confianza, es exactamente el benchmark en el que unas capturas filtradas son menos capaces de demostrar nada. Un modelo que grita mientras trabaja es un modelo cuyos resultados querrías que fueran evaluados por alguien distinto de su autor.
Lo que Google realmente ha lanzado en esta línea
La filtración solo cobra sentido a la luz del historial ya publicado, porque el relato matemático de Google es una progresión documentada y el nombre filtrado toma prestada su credibilidad.
• julio de 2025 — una versión avanzada de Gemini Deep Think alcanzó el estándar de medalla de oro en la Olimpiada Internacional de Matemáticas, resolviendo cinco de seis problemas para obtener 35 de 42 puntos, calificada por funcionarios de la IMO bajo los mismos estándares aplicados a los estudiantes. Demis Hassabis señaló que funcionó de principio a fin en lenguaje natural sin traducción a sintaxis formal.
• 1 de agosto de 2025 — Google lanzó Gemini 2.5 Deep Think públicamente, pero no el modelo oro. La versión publicada fue descrita por Google como una variación más rápida y optimizada, que alcanzaba un rendimiento de nivel Bronce en el benchmark de la IMO de 2025 según la evaluación interna de Google. Estaba restringida al nivel de consumidor más alto. Simultáneamente, Google entregó el modelo oro completo a un grupo selecto de matemáticos y académicos: las "instituciones seleccionadas" a las que se refiere la señal filtrada.
• Diciembre de 2025 — Gemini 3 Deep Think, con un gran salto generacional que Google reportó como del 45,1 % en ARC-AGI-2 con ejecución de código y del 41,0 % en Humanity's Last Exam sin herramientas.
• Ahora — Gemini 3.1 Deep Think, construido sobre Gemini 3.1 Pro y vendido a través del máximo nivel de suscripción para consumidores y de un programa de API solo por invitación. Las cifras publicadas por el propio Google, que son reportadas por el proveedor y no han sido reproducidas de forma independiente, lo sitúan en ARC-AGI-2 84,6 %, Humanity's Last Exam 48,4 % sin herramientas y 53,4 % con búsqueda y código, IMO 2025 81,5 % y un Elo de Codeforces de 3455.
Dos esfuerzos adyacentes también importan. Aletheia, un agente de investigación matemática construido sobre Gemini Deep Think, según informes de terceros, alcanza aproximadamente el 95.1% en IMO-ProofBench Advanced — y destaca menos por la cifra que por estar diseñado para decir "no se encontró solución" en lugar de inventar una; en el desafío FirstProof de febrero de 2026 resolvió 6 de 10 y rechazó el resto. Y una configuración de Co-Matemático con IA que se ejecuta en Gemini 3.1 Pro, según se informa, elevó el rendimiento del Nivel 4 de FrontierMath del 19% al 47.9%.

Vale la pena detenerse en esa última cifra, porque es el argumento más fuerte en contra de leer esta filtración tal como se redactó. Un salto del 19 % al 47,9 % en matemáticas de nivel de investigación, logrado por un andamiaje construido alrededor de un modelo Gemini general en lugar de un nuevo checkpoint, sugiere que las mayores ganancias recientes en el rendimiento matemático de Google han venido del arnés que rodea al modelo, no de un modelo especializado por debajo de él. No significa que Mathematica sea un andamiaje. Sí significa que la carga de la prueba para «esto es un nuevo modelo matemático dedicado» es mayor de lo que suponía la cobertura.
Hay un elemento de contexto más que se cierne sobre todo lo demás: DeepMind se reestructuró en agosto de 2026, con Demis Hassabis pasando a ocupar un puesto de presidente. Las filtraciones desde dentro de un laboratorio en reorganización no son más fiables que las filtraciones desde uno estable, y la cobertura no ha considerado relevante el momento. Podría serlo.
¿Modelo o andamiaje? La pregunta que esta filtración no resuelve
Hay un debate abierto en la cobertura sobre si Mathematica es siquiera un modelo nuevo. Un bando señala el prefijo "deepthink" de la cadena de build y lo interpreta como un checkpoint separado. Otro bando —en el que quedó encuadrado nuestro propio artículo anterior sobre el rumor de Deep Think V3— sostiene que los resultados matemáticos especializados de Google provienen de andamiajes de agentes que envuelven modelos Gemini generales, y que no hace falta que exista un modelo matemático separado para que los números sean reales.
La cadena de compilación es un punto modesto a favor del primer bando: models/deepthink-mathematica-tf-raw-thoughts nombra un modelo, y "raw-thoughts" describe una configuración de modelo más que una capa de arnés. Un andamiaje no necesitaría su razonamiento sin filtrar para poder depurarse; un modelo cuyo pensamiento es el producto sí lo necesitaría. Eso es una señal real.
No es algo decisivo. Los arneses también tienen configuración, y una cadena de ruta interna la escribe quien haya configurado el registro, no un esquema. Lo que lo resolvería es lo que nadie tiene: una tarjeta de modelo, o un punto de conexión, o una prueba comparativa ejecutada por alguien sin un interés personal en la respuesta.
Lo que realmente puedes llamar hoy
Nada de esto cambia algo que puedas poner en producción esta semana, y vale la pena ser franco sobre la brecha. Deep Think mathematica no está en ninguna API. Gemini 3.1 Deep Think tampoco se vende por token — está restringido al nivel de suscripción de consumidor más alto, listado entre $99.99 y $199.99 al mes según el nivel, además de un programa de API solo por invitación. No hay un precio publicado por millón de tokens para él.
El modelo base en el que, según se informa, se basa es otra historia. Gemini 3.1 Pro tiene un precio de $2.00 por millón de tokens de entrada, $0.20 en caché, y $12.00 por millón de tokens de salida para contextos de menos de 200,000 tokens, y sube a $4.00 / $0.40 / $18.00 por encima de eso — las tarifas publicadas por el propio Google.
Ese detalle de precios es donde reside la decisión práctica, porque la diferencia de costo entre los modos de razonamiento no es pequeña. En ARC-AGI-2, se reporta que Deep Think alcanza aproximadamente el 85 % por unos $13.62 por tarea, frente a Gemini 3.1 Pro con el 77 % por unos $0.96 por tarea. Estás pagando aproximadamente catorce veces más por ocho puntos. Eso es un intercambio defendible para un problema de investigación difícil y uno indefendible para una ruta de producción que en su mayoría se ocupa de trabajo ordinario — y la respuesta correcta suele ser que quieres que ambos sean accesibles desde el mismo lugar, en lugar de una decisión de suscripción tomada de antemano.

Ese es el argumento a favor de enrutar con una sola clave. Los modelos Gemini que se pueden invocar hoy — Gemini 3.1 Pro Preview, Gemini 3.8 Flash a $0.750 por millón de tokens de entrada con una lectura de caché de $0.075, y el resto de la familia — están en el catálogo de OrcaRouter de 198 modelos de 15 proveedores, detrás de un único endpoint compatible con OpenAI. No hay recargo sobre los precios de lista de los proveedores, así que un cambio de precio de Google se refleja en nuestro lado el mismo día en lugar de esperar a renegociar un contrato. La conmutación automática por error hace que un modelo no probado o en vista previa pueda formar parte de una ruta sin cargar por sí solo con una ruta de producción, que es exactamente la postura que merece un modelo filtrado: pruébalo, mantén un respaldo, no cambies nada más. El DSL de enrutamiento compone varios modelos en una sola llamada, y la fusión de modelos ejecuta un panel y combina las respuestas — ambas cosas resultan útiles cuando la pregunta es difícil y la postura honesta es que quieres la opinión de más de un modelo.
Para ser explícitos sobre el límite: OrcaRouter no aloja Deep Think mathematica, y no aloja Gemini 3.1 Deep Think. Esos no están en nuestro catálogo y nada aquí debería sugerir lo contrario. Lo que sí está en el catálogo es la capa de Gemini que hay debajo de ellos.
¿Qué haría que esto pasara de ser una filtración a ser noticia?
Cuatro cosas, en orden aproximado de cuánto harían avanzar la historia.
• Una ficha de modelo. Los lanzamientos de Deep Think de Google han venido acompañados de evaluaciones publicadas. Una ficha con números en MILLENNIUM-BENCH o IMO-ProofBench Advanced, ejecutados bajo las condiciones indicadas, convertiría esto de una cadena de compilación en un modelo.
• Un endpoint. La señal más clara sería que Mathematica apareciera en la API de Gemini o en la lista de modelos de Google bajo cualquier nombre. Hasta que eso ocurra, nadie puede llamarlo y no existe un precio para comparar.
• La vía institucional. El patrón de Google en 2025 fue dar el modelo matemático más potente primero a matemáticos selectos y al público una variante más rápida después. Un despliegue silencioso entre investigadores encajaría con ese precedente y probablemente saldría a la luz antes que cualquier anuncio de producto.
• Una ejecución de terceros. Dado que el benchmark en cuestión alcanza como máximo cerca del 24% de pass@1 con los mejores modelos disponibles, y que su modo de fallo característico es la fabricación con total seguridad, una evaluación independiente es la única evidencia que se mantendrá en pie. Todas las cifras de este artículo que llevan un número son o bien de Google, o reportadas por terceros, o señaladas explícitamente como no verificadas — y ninguna de ellas provino de un modelo que alguien fuera de DeepMind haya ejecutado.
Lo único que vale la pena hacer ahora es no esperar. La brecha entre el modo matemático de Google y su modelo base es de catorce veces en costo y ocho puntos en precisión, y esa disyuntiva ya está activa; puedes hacerlo hoy con Gemini 3.1 Pro Preview con una sola clave y un respaldo detrás de ella. Cuando Mathematica tenga una tarjeta de modelo, querrás haber decidido ya cómo enrutar los problemas difíciles —y la respuesta a eso no dependerá de lo que resulte ser el modelo filtrado.
Comparados en este artículo2
Detectado en este artículo · Benchmarks: Artificial Analysis · actualizado a diario
