
Deep Think Mathematica: Di Dalam Model Matematika Google yang Bocor, dan Jeritan dalam Jejak Penalaran-Nya
- orcaBARUOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1 juta token
- deepseekBARUDeepSeek: DeepSeek V4.1 Flash2026-09-1040Kecerdasan
- openaiBARUOpenAI: GPT-6 Astra2026-09-0453Kecerdasan77Koding
- googleGoogle: Gemini 3.8 Flash2026-09-0241Kecerdasan76Koding
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Kecerdasan76Koding
- anthropicAnthropic: Claude Fable 5.12026-09-0153Kecerdasan82Koding
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1 juta token
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Kecerdasan72Koding
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1 juta token
- z-aiZ.ai: GLM 5.32026-08-1845Kecerdasan75Koding
- obsidianQwen3.8 27B2026-08-1534Kecerdasan68Koding
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Kecerdasan69Koding
- grokSpaceXAI: Grok 4.62026-08-1244Kecerdasan77Koding
- metaMeta: Muse Spark 1.22026-08-0540Kecerdasan72Koding
- qwenQwen: Qwen3.8 Max2026-08-0345Kecerdasan76Koding
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135Kecerdasan69Koding
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 per 1 juta token
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2451Kecerdasan78Koding
Hal yang paling mengungkap tentang Deep Think Mathematica — model matematika Google yang muncul dalam pengujian internal pekan ini — adalah bahwa ia tampaknya berteriak. Sebuah akun X yang memposting dengan nama "Lyra" mengunggah tangkapan layar log penalaran internal ke internet pada 16 September 2026, dan jejaknya tidak begitu terbaca seperti asisten pembuktian, melainkan seperti seseorang yang sedang mendapatkan terobosan di papan tulis: "Tunggu." "Ya Tuhan." Dan, setelah berhasil menyederhanakan sebuah persamaan, string YA TUHAN, MATEMATIKA!!!!!!!!!!!!!!!!!!!!!!!! Reaksinya langsung dan penuh kasih sayang — Google tampaknya telah membangun AI yang benar-benar mencintai matematika. Reaksi itu juga merupakan hal yang paling tidak berguna untuk diambil dari kebocoran ini. Tidak ada apa pun di sini yang telah dikonfirmasi oleh Google. Tidak ada kartu model, tidak ada ID model dalam daftar apa pun yang dipublikasikan, tidak ada harga, dan tidak ada tanggal rilis. Yang ada hanyalah string build, dua label internal, anggaran token, sekumpulan tangkapan layar, dan titik pembanding terbaik yang sudah dirilis dalam keluarga yang sama, Gemini 3.1 Deep Think — model yang benar-benar dapat Anda gunakan hari ini, dan tolok ukur yang pada akhirnya akan dipakai untuk menilai kebocoran ini.
Jadi perlakukan semua yang ada di bawah ini sebagaimana adanya: daftar klaim dengan sumber yang dilampirkan pada setiap item, diurutkan berdasarkan seberapa besar bobot yang akan ditanggungnya.
Apa yang sebenarnya disampaikan sinyal itu — dan petunjuk yang berada di atasnya
Sinyalnya sendiri datang dari @testingcatalog, sebuah akun dengan rekam jejak yang cukup baik khususnya soal Google: akun itu mengungkap rencana penggunaan komputer desktop Gemini, dan menangkap kartu pratinjau awal Nano Banana 2 dengan nama internal "GEMPIX2" sebelum Google mengatakan apa pun. Postingannya pada 16 September membawa dua klaim dengan kualitas yang sangat berbeda.
Klaim kedua adalah model tersebut. "Deep Think Mathematica" baru telah terlihat dalam pengujian internal, digambarkan sebagai penerus secara gagasan bagi model Deep Think IMO yang dikirim Google ke institusi terpilih tahun lalu.
Klaim pertama adalah petunjuknya, dan itulah yang layak dipahami: "Saat Gemini hendak mengganti latar belakangnya, sesuatu yang besar sedang dipersiapkan." Itu bukan fakta tentang sebuah model. Itu adalah heuristik komunitas tentang koreografi peluncuran Google — pengamatan bahwa penyegaran yang terlihat pada tampilan aplikasi Gemini telah mendahului beberapa pengumuman Google yang lebih besar. Heuristik seperti ini memiliki rekam jejak nyata dan nol daya prediksi. Penyegaran UI bukanlah sebuah model.
Kedua klaim tersebut belum diverifikasi. Tidak satu pun merupakan rilis, dan tulisan ini tidak memperlakukannya sebagai rilis.
Mendekode string build, karena ini adalah artefak paling konkret di sini
Bukti tunggal yang paling kuat yang beredar adalah pengenal build yang dikaitkan dengan log yang bocor:
• Jalur build — models/deepthink-mathematica-tf-raw-thoughts, dilaporkan oleh AI Sight pada 16 September 2026, bersama tangkapan layar.
String itu membuahkan hasil bila dibaca dengan cermat, dan di situlah sebagian besar liputan berhenti. Tiga bagian darinya membawa informasi.
• "deepthink" —menempatkan model tersebut di jalur Deep Think, bukan di jalur utama Gemini. Hal itu penting karena Deep Think adalah mode dalam produk-produk Google yang sudah dirilis, bukan keluarga tersendiri: ia adalah jalur penalaran paralel yang menjalankan beberapa kandidat solusi sekaligus.
• "tf" — dalam konteks, singkatan dari "Teamfood," label internal kedua dari dua label yang dilaporkan bersama build tersebut. Dalam kosakata internal Google, itu adalah sebutan tahap dogfooding awal: karyawan yang menggunakannya, bukan pelanggan.
• "raw-thoughts" — bagian yang paling menarik, dan kunci dari teriakan itu. Ini merujuk pada konfigurasi chain-of-thought tanpa filter — penalaran model yang dihasilkan tanpa penyetelan kesopanan, batasan gaya, atau pemfilteran keluaran. Build "raw thoughts" bukanlah produknya. Itu adalah hal yang dilihat para engineer ketika mereka ingin melihat apa yang sedang dilakukan model sebelum ada yang membuatnya layak dipresentasikan.
Label kedua yang dilaporkan adalah UNSTABLE_EXPERIMENTAL, yang hampir dapat menjelaskan sendiri dan mengarah ke arah yang sama dengan "Teamfood": tahap awal, internal, bukan untuk pelanggan.
Dua angka tambahan dikaitkan dengan log yang sama dan bersumber tunggal, jadi jangan terlalu berpegang pada angka-angka itu:
• Jendela konteks —sekitar 1.000.000 token, setara dengan jendela 1M yang sudah disediakan Google pada model Gemini terdepannya.
• Batas output — 65.536 token, yang bagi model penalaran berarti pertimbangan yang sangat panjang sebelum memberikan jawaban.
Itulah keseluruhan permukaan teknis dari kebocoran tersebut. Sebuah jalur build, dua label tahap, jendela konteks, dan batas keluaran. Cukup untuk mengatakan bahwa sesuatu ada di dalam test harness. Tidak cukup untuk mengatakan berapa skornya.

Mengapa jejak penalaran yang berteriak adalah bukti yang lebih lemah daripada yang terlihat
Tanda seru adalah alasan kebocoran ini menyebar, dan itu pula alasan untuk berhati-hati dengannya.
Penjelasan yang dilaporkan itu biasa saja dan cocok persis dengan build string: konfigurasi penalaran tanpa filter, dijalankan pada suhu generasi tinggi, dengan lapisan kesopanan dan pemformatan yang dilucuti. Ketika Anda menghapus penyetelan yang membuat model terdengar tenang, Anda tidak mengungkap jiwanya — Anda mengungkap sampler-nya. Output yang penuh tanda seru adalah seperti apa sampel bersuhu tinggi dari kelanjutan yang bersemangat. Pembacaan emosional adalah artefak dari konfigurasi, bukan temuan tentang model.
Poin yang lebih mendalam adalah tentang apa rantai pemikiran itu. Jejak penalaran adalah teks yang dihasilkan yang kebetulan berguna untuk memecahkan masalah. Membaca transkripnya dan menyimpulkan keadaan internal — antusiasme, frustrasi, kegembiraan — adalah kesalahan kategori yang sama seperti menyimpulkan bahwa kalkulator senang ketika menghasilkan bilangan bulat yang rapi. Perlu dinyatakan secara gamblang karena liputan berbahasa Tionghoa tentang kebocoran ini condong ke lelucon ("等等", "我的天") dan sebagian liputan berbahasa Inggris membiarkan lelucon itu mengeras menjadi deskripsi karakter model.
Tidak ada satu pun dari itu yang membuat jejak tersebut tidak berguna. Mengungkap build pemikiran mentah adalah bukti autentik tentang praktik rekayasa yang nyata — Anda hanya mencatat penalaran tanpa filter ketika sedang men-debug penalaran itu sendiri, dan itulah yang Anda lakukan pada model yang seluruh proposisi nilainya terletak pada seberapa baik model itu memikirkan masalah-masalah sulit. Dan belum terverifikasi apakah jejak itu berasal dari debugging yang disengaja atau pencatatan yang tidak disengaja.
Ringkasan yang jujur: seruan-seruan itu memberi tahu Anda bahwa ada konfigurasi penalaran mentah. Itu tidak memberi tahu Anda apa pun tentang kemampuan matematika.
Millennium Bench bukanlah Millennium Prize Problems.
Beberapa tulisan tentang kebocoran ini, termasuk ringkasan agregator yang beredar pada 16 September, menyebut model tersebut "menargetkan Millennium Bench" dan berhenti di situ. Nama itu secara tidak sengaja menjalankan fungsinya, karena hanya berjarak satu kata dari sesuatu yang jauh lebih terkenal dan jauh lebih sarat makna — tujuh Millennium Prize Problems milik Clay Mathematics Institute, yang masing-masing berhadiah $1 juta, dan menjadi subjek klaim terpisah sekaligus sepenuhnya belum terkonfirmasi bulan ini tentang OpenAI dan pembuktian Navier–Stokes. Satu laporan dari utas itu mengatakan Google membangun AI yang "memecahkan" masalah tersebut dalam 88 jam. Clay masih mencantumkannya sebagai terbuka.
Ini adalah hal-hal yang berbeda, dan mencampuradukkan keduanya akan memperbesar kebocoran ini secara signifikan.
MILLENNIUM-BENCH, seperti yang diperkenalkan dalam makalah ICLR 2026 "Di Mana Deduksi Gagal: Mendiagnosis Kegagalan Penalaran dalam Matematika Tingkat Riset," adalah tolok ukur masalah tingkat riset yang dikurasi oleh pakar yang mencakup sembilan domain, termasuk fisika matematika, topologi, dan probabilitas teori ukur. Tolok ukur ini dibangun untuk menuntut deduksi multi-langkah yang berkelanjutan jauh melampaui matematika kompetisi.
Hasil utamanya adalah bagian yang penting untuk membaca kebocoran ini. Pada lima model terdepan, dijalankan 100 kali per masalah, model terkuat mencapai paling banyak 24% pass@1 dan 39% pass@3. Diagnosis makalah tentang bagaimana model gagal lebih berguna daripada skornya: halusinasi kerangka, ketika sebuah model menciptakan teori yang tidak dapat diterapkan lalu bernalar secara koheren di dalamnya, dan teorema yang dibuat-buat, ketika model mengutip hasil yang tidak ada, lengkap dengan nama penulis dan nomor teorema yang diciptakan.
Ingatlah keduanya secara bersamaan. Tolok ukur di mana model terbaik hanya mencapai sekitar seperempat soal, yang kegagalan khasnya adalah mengarang dengan penuh keyakinan, justru merupakan tolok ukur di mana tangkapan layar yang bocor paling tidak mampu membuktikan apa pun. Model yang berkoar-koar saat bekerja adalah model yang hasilnya sebaiknya dinilai oleh orang lain, bukan oleh pembuatnya.
Apa yang sebenarnya telah dirilis Google di lini ini
Kebocoran itu hanya bisa dipahami jika disandingkan dengan catatan yang telah dirilis, karena kisah matematika Google adalah perkembangan yang terdokumentasi dan nama yang bocor itu meminjam kredibilitasnya.
• Juli 2025 — versi canggih dari Gemini Deep Think mencapai standar medali emas di Olimpiade Matematika Internasional, memecahkan lima dari enam soal dengan perolehan 35 dari 42 poin, dinilai oleh pejabat IMO berdasarkan standar yang sama yang diterapkan kepada siswa. Demis Hassabis mencatat bahwa sistem ini bekerja secara end-to-end dalam bahasa alami tanpa penerjemahan ke sintaks formal.
• 1 Agustus 2025 — Google merilis Gemini 2.5 Deep Think secara publik, tetapi bukan model emasnya. Versi yang dirilis digambarkan oleh Google sebagai variasi yang lebih cepat dan lebih optimal, mencapai performa tingkat Perunggu pada tolok ukur IMO 2025 menurut evaluasi internal Google. Model itu dibatasi hanya untuk tingkat konsumen teratas. Pada saat yang sama, Google memberikan model emas lengkap kepada sekelompok matematikawan dan akademisi terpilih — "institusi terpilih" yang dirujuk kembali oleh sinyal yang bocor itu.
• Desember 2025 — Gemini 3 Deep Think, dengan lompatan generasional besar yang dilaporkan Google sebesar 45,1% pada ARC-AGI-2 dengan eksekusi kode dan 41,0% pada Humanity's Last Exam tanpa alat.
• Sekarang — Gemini 3.1 Deep Think, dibangun di atas Gemini 3.1 Pro, dijual melalui tingkat langganan konsumen tertinggi dan program API khusus undangan. Angka yang diterbitkan Google sendiri, yang dilaporkan vendor dan belum direproduksi secara independen, menempatkannya pada ARC-AGI-2 84,6%, Humanity's Last Exam 48,4% tanpa alat dan 53,4% dengan pencarian dan kode, IMO 2025 81,5%, serta Elo Codeforces 3455.
Dua upaya terkait juga penting. Aletheia, agen riset matematika yang dibangun di atas Gemini Deep Think, dilaporkan oleh pihak ketiga mencetak sekitar 95,1% pada IMO-ProofBench Advanced — dan lebih menonjol bukan karena angkanya, melainkan karena dirancang untuk mengatakan "solusi tidak ditemukan" alih-alih mengarang solusi; pada tantangan FirstProof Februari 2026, ia menyelesaikan 6 dari 10 dan menolak sisanya. Dan sebuah sistem AI Co-Mathematician yang berjalan di Gemini 3.1 Pro dilaporkan meningkatkan performa FrontierMath Tier 4 dari 19% menjadi 47,9%.

Angka terakhir itu patut direnungkan sejenak, karena itulah argumen terkuat yang menentang pembacaan kebocoran ini seperti cara penulisannya. Lompatan dari 19% ke 47,9% pada matematika tingkat riset, yang dicapai oleh scaffold yang membungkus model Gemini umum alih-alih checkpoint baru, menunjukkan bahwa peningkatan terbesar terkini dalam performa matematika Google berasal dari harness di sekitar model, bukan dari model spesialis di bawahnya. Ini tidak berarti Mathematica adalah scaffold. Ini berarti beban pembuktian untuk "ini adalah model matematika khusus yang baru" lebih tinggi daripada yang diasumsikan oleh liputan.
Satu bagian konteks lagi menyelimuti semua itu: DeepMind melakukan restrukturisasi pada Agustus 2026, dengan Demis Hassabis beralih ke peran ketua. Kebocoran dari dalam lab yang sedang direorganisasi tidak lebih andal daripada kebocoran dari lab yang stabil, dan liputan belum menganggap waktu kejadian itu relevan. Bisa jadi memang relevan.
Model atau perancah? Pertanyaan yang tidak dijawab oleh kebocoran ini
Ada perdebatan yang masih berlangsung dalam liputan tentang apakah Mathematica benar-benar model baru. Satu kubu menunjuk pada awalan "deepthink" dalam string build dan menafsirkannya sebagai checkpoint terpisah. Kubu lain — yang menjadi tempat tulisan awal kami tentang rumor Deep Think V3 — berpendapat bahwa hasil matematika spesialis Google berasal dari perancah agen yang membungkus model Gemini umum, dan bahwa tidak perlu ada model matematika terpisah agar angka-angkanya nyata.
String build adalah poin kecil yang mendukung kubu pertama: models/deepthink-mathematica-tf-raw-thoughts menamai sebuah model, dan "raw-thoughts" mendeskripsikan konfigurasi model, bukan lapisan harness. Sebuah scaffold tidak perlu penalarannya yang tidak difilter untuk di-debug; model yang pemikirannya adalah produknya justru memerlukannya. Itu sinyal nyata.
Itu bukan bukti yang menentukan. Harness juga punya konfigurasi, dan string jalur internal ditulis oleh siapa pun yang menyiapkan logging, bukan oleh skema. Yang bisa menyelesaikannya adalah hal yang tidak dimiliki siapa pun: kartu model, atau endpoint, atau benchmark yang dijalankan oleh seseorang yang tidak berkepentingan dengan jawabannya.
Apa yang sebenarnya bisa Anda hubungi hari ini
Tidak ada dari semua ini yang mengubah apa pun yang dapat Anda terapkan di produksi minggu ini, dan ada baiknya bersikap terus terang tentang kesenjangan tersebut. Deep Think mathematica tidak tersedia di API mana pun. Gemini 3.1 Deep Think juga tidak dijual per token — ia terkunci di balik tingkat langganan konsumen teratas, dengan harga antara $99,99 dan $199,99 per bulan tergantung tingkatnya, ditambah program API hanya dengan undangan. Tidak ada harga per juta token yang dipublikasikan untuknya.
Model dasar yang kabarnya menjadi landasannya adalah cerita yang berbeda. Gemini 3.1 Pro dibanderol $2.00 per juta token input, $0.20 untuk yang di-cache, dan $12.00 per juta token output untuk konteks di bawah 200.000 token, naik menjadi $4.00 / $0.40 / $18.00 di atas itu — tarif resmi yang dipublikasikan Google sendiri.
Detail harga itulah tempat keputusan praktis berada, karena selisih biaya antara mode penalaran tidak kecil. Pada ARC-AGI-2, Deep Think dilaporkan berada di sekitar 85% dengan biaya sekitar $13,62 per tugas, dibandingkan Gemini 3.1 Pro pada 77% dengan sekitar $0,96 per tugas. Anda membayar sekitar empat belas kali lebih banyak untuk delapan poin. Itu pertukaran yang dapat dipertahankan untuk masalah riset yang sulit dan tidak dapat dipertahankan untuk jalur produksi yang sebagian besar menangani pekerjaan biasa — dan jawaban yang benar biasanya adalah Anda menginginkan keduanya dapat dijangkau dari tempat yang sama, bukan keputusan langganan yang dibuat sebelumnya.

Itulah argumen untuk melakukan routing pada satu kunci. Model Gemini yang dapat dipanggil saat ini — Gemini 3.1 Pro Preview, Gemini 3.8 Flash dengan $0,750 per juta token input dengan pembacaan cache $0,075, dan sisa keluarganya — berada di katalog OrcaRouter yang berisi 198 model di 15 penyedia, di balik satu endpoint yang kompatibel dengan OpenAI. Tidak ada markup pada harga daftar penyedia, jadi perubahan harga Google langsung berlaku di sisi kami pada hari yang sama alih-alih menunggu kontrak ulang. Failover otomatis berarti model yang belum terbukti atau model pratinjau dapat berada dalam sebuah rute tanpa harus menanggung jalur produksi sendiri, yang justru merupakan sikap yang pantas bagi model yang bocor: cobalah, pertahankan fallback, tidak perlu mengubah apa pun yang lain. DSL routing menyusun beberapa model menjadi satu panggilan, dan fusi model menjalankan sebuah panel lalu menggabungkan jawabannya — keduanya berguna ketika pertanyaannya sulit dan posisi yang jujur adalah bahwa Anda menginginkan pendapat dari lebih dari satu model.
Untuk memperjelas batasnya: OrcaRouter tidak menghosting Deep Think mathematica, dan tidak menghosting Gemini 3.1 Deep Think. Itu tidak ada dalam katalog kami dan tidak ada apa pun di sini yang seharusnya menyiratkan sebaliknya. Yang ada dalam katalog adalah lapisan Gemini di bawahnya.
Apa yang akan mengubah ini dari kebocoran menjadi berita?
Empat hal, dalam urutan kasar berdasarkan seberapa besar pengaruhnya terhadap cerita.
• Kartu model.Rilis Deep Think milik Google selalu disertai evaluasi yang dipublikasikan. Kartu yang memuat angka pada MILLENNIUM-BENCH atau IMO-ProofBench Advanced, yang dijalankan dalam kondisi yang dinyatakan, akan mengubah ini dari sekadar string build menjadi sebuah model.
• Sebuah endpoint. Sinyal paling jelas adalah Mathematica muncul di API Gemini atau di daftar model Google dengan nama apa pun. Sampai itu terjadi, tidak ada yang bisa memanggilnya dan tidak ada harga untuk dibandingkan.
• Jalur institusi.Pola Google pada 2025 adalah memberikan model matematika terkuat kepada para matematikawan terpilih terlebih dahulu, lalu varian yang lebih cepat kepada publik belakangan. Peluncuran secara diam-diam kepada para peneliti akan sejalan dengan preseden itu dan kemungkinan besar akan muncul sebelum pengumuman produk apa pun.
• Uji coba pihak ketiga. Mengingat tolok ukur yang dimaksud mencapai puncak sekitar 24% pass@1 untuk model terbaik yang tersedia, dan mode kegagalan khasnya adalah fabrikasi yang penuh keyakinan, evaluasi independen adalah satu-satunya bukti yang akan bertahan. Setiap angka dalam tulisan ini adalah entah milik Google sendiri, dilaporkan pihak ketiga, atau secara eksplisit ditandai sebagai belum terverifikasi — dan tidak satu pun berasal dari model yang dijalankan oleh siapa pun di luar DeepMind.
Satu hal yang layak dilakukan sekarang adalah tidak menunggu. Kesenjangan antara mode matematika Google dan model dasarnya adalah empat belas kali lipat dalam biaya dan delapan poin dalam akurasi, dan pertukaran itu sudah berjalan; Anda bisa melakukannya hari ini dengan Gemini 3.1 Pro Preview pada satu kunci dan fallback di belakangnya. Ketika Mathematica mendapatkan kartu model, Anda akan ingin sudah memutuskan bagaimana Anda merutekan masalah-masalah sulit — dan jawabannya tidak akan bergantung pada seperti apa model yang bocor itu nantinya.
Dibandingkan dalam artikel ini1
Terdeteksi dari artikel ini · Benchmark: Artificial Analysis · diperbarui setiap hari
