
Deep Think Mathematica: Wewnątrz przeciekłego modelu matematycznego Google'a i krzyk w jego śladzie rozumowania
- orcaNOWOŚĆOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 za 1 mln tokenów
- deepseekNOWOŚĆDeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligencja
- openaiNOWOŚĆOpenAI: GPT-6 Astra2026-09-0453Inteligencja77Kod
- googleGoogle: Gemini 3.8 Flash2026-09-0241Inteligencja76Kod
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Inteligencja76Kod
- anthropicAnthropic: Claude Fable 5.12026-09-0153Inteligencja82Kod
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 za 1 mln tokenów
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligencja72Kod
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 za 1 mln tokenów
- z-aiZ.ai: GLM 5.32026-08-1845Inteligencja75Kod
- obsidianQwen3.8 27B2026-08-1534Inteligencja68Kod
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Inteligencja69Kod
- grokSpaceXAI: Grok 4.62026-08-1244Inteligencja77Kod
- metaMeta: Muse Spark 1.22026-08-0540Inteligencja72Kod
- qwenQwen: Qwen3.8 Max2026-08-0345Inteligencja76Kod
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135Inteligencja69Kod
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 za 1 mln tokenów
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2451Inteligencja78Kod
Najbardziej wymowne w Deep Think Mathematica — modelu matematycznym Google, który pojawił się w wewnętrznych testach w tym tygodniu — jest to, że najwyraźniej krzyczy. Konto na X, publikujące pod nazwą „Lyra”, umieściło 16 września 2026 r. zrzuty ekranu z wewnętrznych dzienników rozumowania, a zapisy wyglądają mniej jak asystent dowodzenia, a bardziej jak osoba, która przeżywa olśnienie przy tablicy: „Czekaj”. „O mój Boże”. A po pomyślnym uproszczeniu równania ciąg ŚWIĘTA MATKO MATEMATYKI!!!!!!!!!!!!!!!!!!!!!!!! Reakcja była natychmiastowa i serdeczna — Google najwyraźniej zbudowało AI, które naprawdę kocha matematykę. Ta reakcja jest też najmniej użyteczną rzeczą, jaką można wynieść z przecieku. Nic tutaj nie zostało potwierdzone przez Google. Nie ma karty modelu, identyfikatora modelu na żadnej opublikowanej liście, ceny ani daty premiery. Istnieje ciąg kompilacji, dwie wewnętrzne etykiety, budżet tokenów, zestaw zrzutów ekranu oraz najlepszy dostępny punkt odniesienia w tej samej rodzinie, Gemini 3.1 Deep Think — model, którego można dziś naprawdę użyć, i wzorzec, według którego ten przeciek ostatecznie zostanie oceniony.
A więc traktuj wszystko poniżej jako to, czym jest: listę twierdzeń ze źródłem przypisanym do każdego elementu, posortowaną według tego, jak duży ciężar będzie w stanie udźwignąć.
Co ten sygnał tak naprawdę mówi — i zdradzający znak znajdujący się tuż nad nim
Sam sygnał pochodził od @testingcatalog, konta z całkiem niezłym dorobkiem konkretnie w przypadku Google: ujawniło plany Gemini dotyczące korzystania z komputera na pulpicie i wychwyciło wczesną kartę podglądu Nano Banana 2 pod wewnętrzną nazwą „GEMPIX2”, zanim Google cokolwiek powiedział. Jego post z 16 września zawiera dwa twierdzenia o bardzo różnej jakości.
Drugie twierdzenie dotyczy modelu. Nowy „Deep Think Mathematica” został zauważony w testach wewnętrznych i opisano go jako duchowego następcę modelu Deep Think IMO, który Google udostępnił wybranym instytucjom w zeszłym roku.
Pierwsze twierdzenie to znak, i to ten, który warto zrozumieć: „Kiedy Gemini ma zmienić tło, coś dużego się szykuje”. To nie jest fakt o modelu. To społecznościowa heurystyka dotycząca choreografii premier Google — obserwacja, że widoczna odświeżka interfejsu aplikacji Gemini poprzedzała kilka większych ogłoszeń Google. Takie heurystyki mają realny dorobek i zerową moc predykcyjną. Odświeżenie UI to nie model.
Oba twierdzenia są niezweryfikowane. Żadne z nich nie jest wydaniem, a ten tekst nie traktuje tego jako wydania.
Dekodowanie ciągu kompilacji, ponieważ jest to najbardziej konkretny artefakt tutaj
Najtrudniejszym pojedynczym dowodem w obiegu jest identyfikator kompilacji przypisywany ujawnionym logom:
• Ścieżka kompilacji — models/deepthink-mathematica-tf-raw-thoughts, zgłoszone przez AI Sight 16 września 2026 r., wraz ze zrzutami ekranu.
Ten ciąg znaków wart jest uważnej lektury, a właśnie na tym kończy się większość omówień. Trzy jego fragmenty niosą informację.
• „deepthink” — umieszcza model w linii Deep Think, a nie w głównej linii Gemini. To ma znaczenie, ponieważ Deep Think jest trybem w produktach Google, które trafiły na rynek, a nie osobną rodziną: to ścieżka równoległego rozumowania, która jednocześnie uruchamia wiele rozwiązań kandydujących.
• „tf” — w kontekście skrót od „Teamfood”, drugiej z dwóch wewnętrznych etykiet podawanych wraz z kompilacją. W wewnętrznym słownictwie Google to wczesne oznaczenie etapu dogfoodingu: używają go pracownicy, a nie klienci.
• "raw-thoughts" — najciekawsza część i klucz do krzyczenia. Oznacza to niesfiltrowaną konfigurację łańcucha myśli — rozumowanie modelu emitowane bez dostrajania uprzejmości, ograniczeń stylistycznych ani filtrowania wyjścia. Wersja "raw thoughts" nie jest produktem. To rzecz, na którą patrzą inżynierowie, gdy chcą zobaczyć, co robi model, zanim ktokolwiek uczyni go prezentowalnym.
Drugą zgłoszoną etykietą jest UNSTABLE_EXPERIMENTAL, co jest niemal samoobjaśniające i wskazuje ten sam kierunek co „Teamfood”: wczesna, wewnętrzna, nieprzeznaczona dla klientów.
Dwie kolejne wartości są przypisane do tych samych logów i mają jedno źródło, więc traktuj je z rezerwą:
• Okno kontekstowe —około 1 000 000 tokenów, co odpowiada oknu 1 mln, które Google już oferuje w swoich flagowych modelach Gemini.
• Limit wyjściowy — 65,536 tokenów, co w przypadku modelu rozumującego oznacza bardzo długie rozważania przed udzieleniem odpowiedzi.
To cała techniczna strona tego wycieku. Ścieżka kompilacji, dwie etykiety etapów, okno kontekstu i limit wyjścia. To wystarczy, by stwierdzić, że coś istnieje w środowisku testowym. Nie wystarczy, by powiedzieć, jaki osiąga wynik.

Dlaczego ślad rozumowania, który krzyczy, jest słabszym dowodem, niż wygląda
Wykrzykniki sprawiły, że ten przeciek się rozniósł, i to one są powodem, by obchodzić się z nim ostrożnie.
Podane wyjaśnienie jest przyziemne i pasuje dokładnie do ciągu kompilacji: niesfiltrowana konfiguracja rozumowania, uruchomiona przy wysokiej temperaturze generowania, z usuniętymi warstwami uprzejmości i formatowania. Kiedy usuniesz dostrajanie, które sprawia, że model brzmi spokojnie, nie ujawniasz jego duszy — ujawniasz jego sampler. Wynik obfitujący w wykrzykniki to właśnie to, jak wygląda wysokotemperaturowa próbka podekscytowanej kontynuacji. Emocjonalna interpretacja jest artefaktem konfiguracji, a nie ustaleniem dotyczącym modelu.
Głębsza kwestia dotyczy tego, czym łańcuch myśli jest. Ślad rozumowania to wygenerowany tekst, który przypadkiem okazuje się przydatny do rozwiązywania problemów. Czytanie jego zapisu i wnioskowanie o stanie wewnętrznym — entuzjazmie, frustracji, zachwycie — to ten sam błąd kategorii co wnioskowanie, że kalkulator jest zadowolony, gdy daje czystą liczbę całkowitą. Warto powiedzieć to wprost, ponieważ chińskojęzyczne omówienie tego wycieku podchwyciło żart („等等”, „我的天”), a część anglojęzycznych omówień pozwoliła, by żart zastygł w opis charakteru modelu.
Nic z tego nie czyni śladu bezwartościowym. Upublicznienie wersji z surowymi myślami to autentyczny dowód rzeczywistej praktyki inżynierskiej — nieprzefiltrowane rozumowanie rejestrujesz tylko wtedy, gdy debugujesz samo rozumowanie, co robisz w przypadku modelu, którego cała propozycja wartości polega na tym, jak dobrze radzi sobie z trudnymi problemami. A nie jest zweryfikowane, czy ślady pochodziły z celowego debugowania, czy z niezamierzonego rejestrowania.
Szczere podsumowanie: wykrzykniki mówią ci, że istnieje surowa konfiguracja rozumowania. Nie mówią ci nic o zdolnościach matematycznych.
Millennium Bench to nie Problemy milenijne
Kilka opracowań tego wycieku, w tym krążące 16 września streszczenia agregatorów, określa model jako „celujący w Millennium Bench” i na tym poprzestaje. Ta nazwa odgrywa przypadkową rolę, ponieważ dzieli ją jedno słowo od czegoś znacznie słynniejszego i znacznie bardziej obciążonego — siedmiu Problemów Milenijnych Clay Mathematics Institute, z których każdy wiąże się z nagrodą 1 miliona dolarów, i które są przedmiotem osobnego, całkowicie niepotwierdzonego twierdzenia z tego miesiąca o OpenAI i dowodzie równań Naviera–Stokesa. Jeden z raportów z tego wątku mówi, że Google zbudowało AI, które „rozwiązało” problem w ciągu 88 godzin. Clay nadal uznaje go za otwarty.
To są różne rzeczy, a mieszanie ich ze sobą znacznie wyolbrzymia ten wyciek.
MILLENNIUM-BENCH, przedstawiony w artykule z ICLR 2026„Gdzie dedukcja zawodzi: diagnozowanie błędów rozumowania w matematyce na poziomie badawczym”, to benchmark składający się z problemów na poziomie badawczym, wyselekcjonowanych przez ekspertów, obejmujących dziewięć dziedzin, w tym fizykę matematyczną, topologię i probabilistykę miarową. Został stworzony tak, aby wymagać długotrwałej, wieloetapowej dedukcji znacznie wykraczającej poza matematykę konkursową.
Jej główny wynik to ta część, która ma znaczenie dla odczytania tego wycieku. W przypadku pięciu modeli frontier, uruchamianych 100 razy na problem, najsilniejszy osiągnął co najwyżej 24% pass@1 i 39% pass@3. Diagnoza pracy dotycząca tego, jak modele zawodzą, jest bardziej użyteczna niż wyniki: halucynacja frameworkowa, gdzie model wymyśla nieodpowiednią teorię, a następnie prowadzi spójne rozumowanie w jej ramach, i sfabrykowane twierdzenia, gdzie cytuje wyniki, które nie istnieją, wraz z wymyślonymi nazwiskami autorów i numerami twierdzeń.
Miej oba te fakty jednocześnie w pamięci. Benchmark, w którym najlepszy model osiąga maksymalnie około jednej czwartej problemów, a jego charakterystyczną porażką jest pewne siebie konfabulowanie, to dokładnie ten benchmark, w którym wyciekłe zrzuty ekranu najmniej mogą cokolwiek wykazać. Model, który krzyczy podczas pracy, to model, którego wyniki chciałoby się oddać do oceny komuś innemu niż jego autor.
Co Google faktycznie wypuścił w tej linii
Ten przeciek można właściwie odczytać tylko w zestawieniu z oficjalnym zapisem, ponieważ matematyczna narracja Google to udokumentowana progresja, a ujawniona nazwa pożycza sobie jej wiarygodność.
• Lipiec 2025 — zaawansowana wersja Gemini Deep Think osiągnęła poziom złotego medalu na Międzynarodowej Olimpiadzie Matematycznej, rozwiązując pięć z sześciu zadań i uzyskując 35 z 42 punktów; jej rozwiązania ocenili przedstawiciele IMO według tych samych standardów, jakie stosuje się wobec uczniów. Demis Hassabis zauważył, że działała od początku do końca w języku naturalnym, bez tłumaczenia na formalną składnię.
• 1 sierpnia 2025 — Google wypuścił Gemini 2.5 Deep Think publicznie, ale nie złoty model. Wydana wersja została opisana przez Google jako szybszy, bardziej zoptymalizowany wariant, osiągający wyniki na poziomie brązowym w benchmarku IMO 2025 według wewnętrznej oceny Google. Dostęp do niej ograniczono do najwyższego poziomu konsumenckiego. Jednocześnie Google przekazał pełny złoty model wybranej grupie matematyków i pracowników akademickich — „wybranym instytucjom”, do których odnosi się sygnał z przecieku.
• grudzień 2025 — Gemini 3 Deep Think, z dużym skokiem międzypokoleniowym Google podało 45,1% w ARC-AGI-2 z wykonywaniem kodu i 41,0% w Humanity's Last Exam bez narzędzi.
• Teraz — Gemini 3.1 Deep Think, zbudowany na Gemini 3.1 Pro, sprzedawany w ramach najwyższego poziomu subskrypcji konsumenckiej oraz programu API dostępnego wyłącznie na zaproszenie. Własne opublikowane dane Google, które zostały podane przez dostawcę i nie zostały niezależnie odtworzone, wskazują na ARC-AGI-2 84,6%, Humanity's Last Exam 48,4% bez narzędzi i 53,4% z wyszukiwaniem i kodem, IMO 2025 81,5% oraz Codeforces Elo 3455.
Znaczenie mają też dwa sąsiadujące przedsięwzięcia. Aletheia, agent badawczy do matematyki zbudowany na Gemini Deep Think, jest według relacji stron trzecich oceniany na około 95,1% w IMO-ProofBench Advanced — i zwraca uwagę nie tyle samą liczbą, ile tym, że zaprojektowano go tak, by mówił „nie znaleziono rozwiązania”, zamiast wymyślać rozwiązanie; w wyzwaniu FirstProof z lutego 2026 r. rozwiązał 6 z 10 zadań, a pozostałych odmówił rozwiązania. A konfiguracja AI Co-Mathematician działająca na Gemini 3.1 Pro według doniesień podniosła wyniki FrontierMath Tier 4 z 19% do 47,9%.

Ta ostatnia liczba zasługuje na chwilę zatrzymania, ponieważ jest najsilniejszym argumentem przeciwko odczytywaniu tego wycieku tak, jak został opisany. Skok z 19% do 47,9% w matematyce na poziomie badawczym, osiągnięty przez rusztowanie wokół ogólnego modelu Gemini, a nie przez nowy checkpoint, sugeruje, że największe ostatnie postępy w wynikach Google w matematyce pochodzą z otoczki wokół modelu, a nie z wyspecjalizowanego modelu pod spodem. Nie oznacza to, że Mathematica jest rusztowaniem. Oznacza to, że ciężar dowodu dla tezy „to nowy, dedykowany model matematyczny” jest wyższy, niż zakładały doniesienia.
Jeszcze jeden element kontekstu wisi nad tym wszystkim: DeepMind przeszło restrukturyzację w sierpniu 2026 roku, a Demis Hassabis przeszedł na stanowisko przewodniczącego. Przecieki z wnętrza reorganizującego się laboratorium nie są bardziej wiarygodne niż przecieki z stabilnego, a w doniesieniach nie uznano tego momentu za istotny. Może tak być.
Model czy rusztowanie? Pytanie, którego ten przeciek nie rozstrzyga
W doniesieniach trwa żywa dyskusja o to, czy Mathematica jest w ogóle nowym modelem. Jeden obóz wskazuje na prefiks „deepthink” w ciągu kompilacji i odczytuje go jako osobny checkpoint. Inny obóz — w którym znalazł się nasz własny wcześniejszy artykuł o pogłosce Deep Think V3 — utrzymuje, że specjalistyczne wyniki matematyczne Google'a pochodzą ze szkieletów agentowych otaczających ogólne modele Gemini, i że nie musi istnieć żaden osobny model matematyczny, aby te liczby były prawdziwe.
Ciąg budowania to skromny argument na korzyść pierwszego obozu: models/deepthink-mathematica-tf-raw-thoughts nazywa model, a „raw-thoughts” opisuje konfigurację modelu, a nie warstwę uprzęży. Rusztowanie nie potrzebowałoby niefiltrowanego rozumowania, aby je debugować; model, którego myślenie jest produktem, musiałby. To prawdziwy sygnał.
To nie jest rozstrzygające. Harnessy też mają konfigurację, a wewnętrzny ciąg ścieżki zapisuje ten, kto skonfigurował logowanie, a nie schemat. Rozstrzygnęłoby to coś, czego nikt nie ma: karta modelu, endpoint albo benchmark uruchomiony przez kogoś, kto nie ma interesu w odpowiedzi.
Co można dziś faktycznie nazwać
Nic z tego nie zmienia niczego, co możesz wdrożyć do produkcji w tym tygodniu, a warto powiedzieć wprost o tej luce. Deep Think mathematica nie jest dostępny w żadnym API. Gemini 3.1 Deep Think również nie jest sprzedawany za token — jest dostępny dopiero w najwyższym konsumenckim poziomie subskrypcji, w cenie od 99,99 do 199,99 USD miesięcznie w zależności od poziomu, oraz w programie API dostępnym wyłącznie na zaproszenie. Nie ma dla niego publikowanej ceny za milion tokenów.
Model bazowy, na którym rzekomo się opiera, to zupełnie inna historia. Gemini 3.1 Pro kosztuje 2,00 USD za milion tokenów wejściowych, 0,20 USD za tokeny z pamięci podręcznej i 12,00 USD za milion tokenów wyjściowych w kontekstach poniżej 200 000 tokenów, a powyżej tej granicy stawki rosną do 4,00 / 0,40 / 18,00 USD — zgodnie z własnymi opublikowanymi cennikami Google.
Ten szczegół cenowy jest tym, od czego zależy praktyczna decyzja, ponieważ różnica kosztów między trybami rozumowania nie jest mała. W ARC-AGI-2 Deep Think według doniesień osiąga około 85% przy koszcie około 13,62 USD za zadanie, w zestawieniu z Gemini 3.1 Pro na poziomie 77% za około 0,96 USD za zadanie. Płacisz około czternaście razy więcej za osiem punktów. To kompromis, który da się obronić w przypadku trudnego problemu badawczego, i taki, którego nie da się obronić w przypadku ścieżki produkcyjnej, która w większości obsługuje zwykłą pracę — a prawidłowa odpowiedź zwykle brzmi, że chcesz mieć oba tryby osiągalne z tego samego miejsca, a nie podejmować decyzję o subskrypcji z góry.

Tak jest w przypadku routingu na jednym kluczu. Modele Gemini, które można wywołać już dziś — Gemini 3.1 Pro Preview, Gemini 3.8 Flash w cenie 0,750 USD za milion tokenów wejściowych przy odczycie z pamięci podręcznej za 0,075 USD, oraz reszta rodziny — znajdują się w katalogu OrcaRouter obejmującym 198 modeli od 15 dostawców, za jednym punktem końcowym zgodnym z OpenAI. Nie ma marży na ceny katalogowe dostawców, więc zmiana ceny Google jest u nas widoczna tego samego dnia, a nie czeka na ponowne podpisanie umowy. Automatyczne przełączanie awaryjne sprawia, że nieprzetestowany lub przedpremierowy model może znajdować się w trasie, nie będąc samodzielnie ścieżką produkcyjną — a dokładnie na takie traktowanie zasługuje model, który wyciekł: wypróbuj go, zachowaj rozwiązanie zapasowe, nie zmieniaj niczego więcej. DSL routingu łączy kilka modeli w jedno wywołanie, a fuzja modeli uruchamia panel i łączy odpowiedzi — jedno i drugie przydaje się, gdy pytanie jest trudne, a uczciwym stanowiskiem jest to, że chcesz poznać opinię więcej niż jednego modelu.
Żeby jasno określić granicę: OrcaRouter nie hostuje Deep Think mathematica i nie hostuje Gemini 3.1 Deep Think. Nie ma ich w naszym katalogu i nic tutaj nie powinno sugerować inaczej. W katalogu jest natomiast warstwa Gemini znajdująca się pod nimi.
Co sprawiłoby, że ten przeciek stałby się wiadomością?
Cztery rzeczy, w przybliżonej kolejności według tego, jak bardzo posunęłyby historię do przodu.
• Karta modelu. Wydania Deep Think Google'a pojawiały się wraz z opublikowanymi ewaluacjami. Karta z liczbami na MILLENNIUM-BENCH lub IMO-ProofBench Advanced, uzyskanymi w podanych warunkach, przekształciłaby to z ciągu kompilacji w model.
• Punkt końcowy. Najwyraźniejszym sygnałem byłoby pojawienie się Mathematici w Gemini API lub na liście modeli Google pod dowolną nazwą. Dopóki to nie nastąpi, nikt nie może jej wywołać i nie istnieje cena, którą można by porównać.
• Ścieżka instytucjonalna. Wzorzec Google'a w 2025 r. polegał na tym, że najpierw udostępniano najsilniejszy model matematyczny wybranym matematykom, a później opinii publicznej szybszy wariant. Ciche wdrożenie wśród badaczy pasowałoby do tego precedensu i prawdopodobnie pojawiłoby się przed jakąkolwiek zapowiedzią produktu.
• Uruchomienie przez stronę trzecią. Biorąc pod uwagę, że omawiany benchmark osiąga maksymalnie około 24% pass@1 w przypadku najlepszych dostępnych modeli, a jego charakterystycznym trybem awarii jest pewne siebie konfabulowanie, niezależna ocena to jedyny dowód, który się ostanie. Każda liczba w tym tekście, która zawiera wartość liczbową, pochodzi albo od samego Google'a, została podana przez strony trzecie, albo jest wyraźnie oznaczona jako niezweryfikowana — i żadna z nich nie pochodziła z modelu, którego uruchomił ktokolwiek spoza DeepMind.
Jedyne, co warto teraz zrobić, to nie czekać. Luka między trybem matematycznym Google a jego modelem bazowym to czternastokrotna różnica w koszcie i osiem punktów w dokładności, a ten kompromis już działa; możesz go zastosować już dziś, mając Gemini 3.1 Pro Preview na jednym kluczu i fallback za nim. Gdy Mathematica otrzyma kartę modelu, będziesz chciał mieć już ustalone, jak kierować trudne problemy — a odpowiedź na to nie będzie zależeć od tego, czym okaże się przeciekły model.
Porównane w tym artykule1
Wykryto na podstawie tego artykułu · Benchmarki: Artificial Analysis · aktualizowane codziennie
