
Deep Think Mathematica: מבט מבפנים על המודל המתמטי שהודלף של גוגל, והצעקה בתוך עקבות החשיבה שלו
- orcaחדשOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 לכל 1M טוקנים
- deepseekחדשDeepSeek: DeepSeek V4.1 Flash2026-09-1040אינטליגנציה
- openaiחדשOpenAI: GPT-6 Astra2026-09-0453אינטליגנציה77כתיבת קוד
- googleGoogle: Gemini 3.8 Flash2026-09-0241אינטליגנציה76כתיבת קוד
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245אינטליגנציה76כתיבת קוד
- anthropicAnthropic: Claude Fable 5.12026-09-0153אינטליגנציה82כתיבת קוד
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 לכל 1M טוקנים
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642אינטליגנציה72כתיבת קוד
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 לכל 1M טוקנים
- z-aiZ.ai: GLM 5.32026-08-1845אינטליגנציה75כתיבת קוד
- obsidianQwen3.8 27B2026-08-1534אינטליגנציה68כתיבת קוד
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236אינטליגנציה69כתיבת קוד
- grokSpaceXAI: Grok 4.62026-08-1244אינטליגנציה77כתיבת קוד
- metaMeta: Muse Spark 1.22026-08-0540אינטליגנציה72כתיבת קוד
- qwenQwen: Qwen3.8 Max2026-08-0345אינטליגנציה76כתיבת קוד
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135אינטליגנציה69כתיבת קוד
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 לכל 1M טוקנים
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2451אינטליגנציה78כתיבת קוד
הדבר החושפני ביותר בנוגע לDeep Think Mathematica — מודל המתמטיקה של Google שצץ בבדיקות פנימיות השבוע — הוא שנראה שהוא צועק. חשבון X שפרסם תחת השם "Lyra" העלה צילומי מסך של יומני חשיבה פנימיים לרשת ב-16 בספטמבר 2026, והעקבות נקראות פחות כמו עוזר הוכחות ויותר כמו אדם שחווה פריצת דרך מול הלוח: "רגע." "אלוהים אדירים." ואחרי שפישט משוואה בהצלחה, המחרוזת אמא קדושה של המתמטיקה!!!!!!!!!!!!!!!!!!!!!!!! התגובה הייתה מיידית ואוהדת — Google כנראה בנתה בינה מלאכותית שבאמת אוהבת מתמטיקה. התגובה הזו היא גם הדבר הכי פחות שימושי לקחת מההדלפה. שום דבר כאן לא אושר על ידי Google. אין כרטיס מודל, אין מזהה מודל בשום רשימה מפורסמת, אין מחיר, ואין תאריך שחרור. מה שקיים הוא מחרוזת build, שתי תוויות פנימיות, תקציב טוקנים, סט צילומי מסך, ונקודת ההשוואה הטובה ביותר ששוחררה באותה משפחה, Gemini 3.1 Deep Think — מודל שאפשר ממש להשתמש בו היום, ואמת המידה שלפיה ההדלפה הזו תישפט בסופו של דבר.
אז התייחסו לכל מה שלמטה כפי שהוא: רשימת טענות שכל פריט בה מצורף לו מקור, ממוינת לפי כמה משקל היא תוכל לשאת.
מה שהאות בעצם אומר — והסימן המסגיר שיושב מעליו
האות עצמה הגיעה מ-@testingcatalog, חשבון עם רקורד לא רע בכל הנוגע ל-Google ספציפית: הוא חשף את תוכניות השימוש במחשב בדסקטופ של Gemini, והוא תפס את כרטיס התצוגה המוקדמת של Nano Banana 2 תחת השם הפנימי "GEMPIX2" לפני ש-Google אמרה משהו. הפוסט שלו מ-16 בספטמבר נושא שתי טענות באיכות שונה מאוד.
הטענה השנייה היא המודל. "Deep Think Mathematica" חדש זוהה בבדיקות פנימיות, ותואר כממשיך ברוחו של מודל Deep Think IMO ש-Google שלחה למוסדות נבחרים בשנה שעברה.
הטענה הראשונה היא הסימן המסגיר, והיא זו ששווה להבין: "כאשר Gemini עומדת לשנות את הרקע שלה, משהו גדול מתבשל." זו אינה עובדה על מודל. זו היוריסטיקה קהילתית לגבי כוריאוגרפיית ההשקות של Google — התצפית שרענון גלוי של פני האפליקציה Gemini קדם לכמה מההכרזות הגדולות יותר של Google. להיוריסטיקות כאלה יש רקורד אמיתי ואפס כוח ניבוי. רענון ממשק משתמש אינו מודל.
שתי הטענות אינן מאומתות. אף אחת מהן אינה מהדורה, וקטע זה אינו מתייחס אליה ככזו.
לפענח את מחרוזת הבנייה, כי זה הארטיפקט המוחשי ביותר כאן.
פיסת הראיות החזקה ביותר בתפוצה היא מזהה build המיוחס ליומנים שהודלפו:
• נתיב בנייה — models/deepthink-mathematica-tf-raw-thoughts, כפי שדווח על ידי AI Sight ב-16 בספטמבר 2026, לצד צילומי המסך.
המחרוזת הזו משתלמת בקריאה מדוקדקת, והיא הנקודה שבה רוב הסיקור נעצר. שלושה חלקים בה נושאים מידע.
• "deepthink" —מציב את המודל בקו Deep Think ולא בקו הראשי של Gemini. זה חשוב כי Deep Think הוא מצב במוצרים המושקים של Google, ולא משפחה נפרדת: זהו מסלול החשיבה המקביל שמריץ כמה פתרונות מועמדים בו-זמנית.
• "tf" —בהקשר זה, קיצור של "Teamfood", השני מבין שתי התוויות הפנימיות שדווחו לצד הבילד. באוצר המילים הפנימי של Google זהו כינוי לשלב מוקדם של dogfooding: עובדים שמשתמשים בו, לא לקוחות.
• "raw-thoughts" — החלק המעניין ביותר, והמפתח לצעקות. זה מציין את תצורת שרשרת-המחשבה הבלתי מסוננת — ההיסק של המודל, הנפלט ללא כיוונון נימוס, אילוצי סגנון או סינון פלט. בנייה של "raw thoughts" אינה המוצר. זה הדבר שמהנדסים מסתכלים עליו כשהם רוצים לראות מה המודל עושה לפני שמישהו הופך אותו לראוי להצגה.
התווית השנייה שדווחה היא UNSTABLE_EXPERIMENTAL, שקרובה להיות מובנת מאליה ומצביעה באותו כיוון כמו "Teamfood": מוקדם, פנימי, לא ללקוחות.
שני נתונים נוספים מיוחסים לאותם לוגים והם ממקור יחיד, לכן התייחס אליהם בזהירות:
• חלון הקשר —בערך 1,000,000 טוקנים, בהתאמה לחלון של 1M ש-Google כבר מספקת בדגמי ה-Gemini המובילים שלה.
• מגבלת פלט — 65,536 טוקנים, שאצל מודל הסקה פירושם התלבטות ארוכה מאוד לפני תשובה.
זה כל המשטח הטכני של ההדלפה. נתיב בנייה, שתי תוויות שלבים, חלון הקשר ותקרת פלט. זה מספיק כדי לומר שדבר קיים בתשתית בדיקה. זה לא מספיק כדי לומר מה הציון שהוא משיג.

מדוע מסלול חשיבה שצורח הוא ראיה חלשה מכפי שהוא נראה
סימני הקריאה הם הסיבה שההדלפה הזו התפשטה, והם הסיבה להיזהר בה.
ההסבר המדווח הוא שגרתי ומתאים בדיוק למחרוזת הבנייה: תצורת חשיבה בלתי מסוננת, שמופעלת בטמפרטורת יצירה גבוהה, כאשר שכבות הנימוס והעיצוב הוסרו. כשמסירים את הכיול שגורם למודל להישמע רגוע, אינך חושף את נשמתו — אתה חושף את הדוגם שלו. פלט עתיר סימני קריאה הוא איך שנראית דגימה בטמפרטורה גבוהה של המשך נרגש. הקריאה הרגשית היא תוצר לוואי של התצורה, לא ממצא לגבי המודל.
הנקודה העמוקה יותר היא על מה ששרשרת חשיבה היא. מסלול נימוק הוא טקסט מיוצר שבמקרה מועיל לפתרון בעיות. לקרוא תמלול שלו ולהסיק ממנו מצב פנימי — התלהבות, תסכול, עונג — היא אותה שגיאת קטגוריה כמו להסיק שמחשבון מרוצה כשהוא מפיק מספר שלם נקי. כדאי לומר זאת בפשטות, משום שהסיקור בשפה הסינית של ההדלפה הזאת התמסר לבדיחה ("等等", "我的天") וחלק מהסיקור באנגלית הניח לבדיחה להתקבע לתיאור של אופי המודל.
שום דבר מזה לא הופך את המעקב לחסר ערך. חשיפת בילד של מחשבות גולמיות היא עדות אמיתית לפרקטיקה הנדסית אמיתית — אתה מתעד חשיבה לא מסוננת רק כשאתה מדבג את החשיבה עצמה, וזה מה שאתה עושה עם מודל שכל הצעת הערך שלו היא עד כמה הוא חושב לעומק על בעיות קשות. וזה לא מאומת אם העקבות נבעו מדיבוג מכוון או מתיעוד לא מכוון.
סיכום כן: סימני הקריאה אומרים לך שקיימת תצורת חשיבה גולמית. הם לא אומרים לך דבר על יכולת מתמטית.
Millennium Bench אינו בעיות פרס המילניום
כמה כתבות על ההדלפה הזו, כולל סיכומי האגרגטורים שהופצו ב-16 בספטמבר, מתארות את המודל כ"מכוון ל-Millennium Bench" ומסתפקות בכך. השם עושה עבודה מקרית, מפני שהוא נמצא במרחק מילה אחת ממשהו הרבה יותר מפורסם והרבה יותר טעון — שבע בעיות פרס המילניום של Clay Mathematics Institute, שכל אחת מהן מזכה בפרס של מיליון דולר, ושהיו הנושא של טענה נפרדת ובלתי מאומתת לחלוטין החודש בנוגע ל-OpenAI ולהוכחה של Navier–Stokes. דיווח אחד מאותו שרשור אומר ש-Google בנתה בינה מלאכותית ש"פתרה" את הבעיה בתוך 88 שעות. Clay עדיין מציג אותה כפתוחה.
אלה דברים שונים, וערבוב ביניהם מנפח את ההדלפה הזו באופן ניכר.
MILLENNIUM-BENCH, כפי שהוצג במאמר ICLR 2026 "כאשר הדדוקציה נשברת: אבחון כשלי הסקה במתמטיקה ברמת מחקר," הוא בנצ'מרק של בעיות ברמת מחקר שנערכו בידי מומחים, המשתרעות על פני תשעה תחומים, כולל פיזיקה מתמטית, טופולוגיה והסתברות במובן תורת המידה. הוא נבנה כדי לדרוש הסקה רב-שלבית מתמשכת הרבה מעבר למתמטיקת תחרויות.
התוצאה המרכזית שלו היא החלק שחשוב לקריאת ההדלפה הזאת. בקרב חמישה מודלי חזית, שהורצו 100 פעמים לכל בעיה, החזק ביותר השיג לכל היותר 24% pass@1 ו-39% pass@3. האבחנה של המאמר לגבי האופן שבו מודלים נכשלים מועילה יותר מהציונים: הזיית מסגרת, שבה מודל ממציא תאוריה בלתי ישימה ואז מנמק באופן קוהרנטי בתוכה, ומשפטים מומצאים, שבו הוא מצטט תוצאות שאינן קיימות, כולל שמות מחברים ומספרי משפטים מומצאים.
זכור את שני הדברים האלה יחד. מבחן שבו המודל הטוב ביותר מגיע בשיאו לכדי רבע מהבעיות, שכשלו המזוהה עמו הוא המצאה בביטחון, הוא בדיוק המבחן שבו צילומי מסך שהודלפו הם הכי פחות מסוגלים להוכיח משהו. מודל שצועק בזמן שהוא עובד הוא מודל שהיית רוצה שמישהו אחר מלבד מחברו ייתן ציון לפלט שלו.
מה Google בעצם השיקה בקו הזה
ההדלפה ניתנת לקריאה רק אל מול התיעוד ששוחרר, מפני שהסיפור המתמטי של Google הוא התקדמות מתועדת, והשם שהודלף שואל את אמינותו.
• יולי 2025 — גרסה מתקדמת של Gemini Deep Think הגיעה לרמת מדליית זהב באולימפיאדה הבינלאומית למתמטיקה, כשפתרה חמישה מתוך שישה תרגילים וצברה 35 מתוך 42 נקודות; היא הוערכה על ידי גורמים רשמיים של IMO לפי אותם סטנדרטים החלים על תלמידים. דמיס האסאביס ציין שהיא פעלה מקצה לקצה בשפה טבעית ללא תרגום לתחביר פורמלי.
• 1 באוגוסט 2025 — Google השיקה את Gemini 2.5 Deep Think באופן פומבי, אך לא את מודל הזהב. הגרסה ששוחררה תוארה על ידי Google כווריאציה מהירה יותר ומאופטמת יותר, המגיעה לביצועים ברמת ארד בבנצ'מרק IMO 2025 לפי ההערכה הפנימית של Google. היא הוגבלה לשכבת הצרכנים העליונה. במקביל, Google נתנה את מודל הזהב המלא לקבוצה נבחרת של מתמטיקאים ואנשי אקדמיה — "המוסדות הנבחרים" שאליהם מתייחס האות המודלף.
• דצמבר 2025 — Gemini 3 Deep Think, עם קפיצת דור גדולה ש-Google דיווחה עליה: 45.1% ב-ARC-AGI-2 עם הרצת קוד ו-41.0% ב-Humanity's Last Exam ללא כלים.
• ועכשיו — Gemini 3.1 Deep Think, המבוסס על Gemini 3.1 Pro, נמכר דרך שכבת המנוי הצרכני הבכירה ותוכנית API בהזמנה בלבד. הנתונים שפרסמה Google בעצמה, שהם דיווח ספק ולא שוחזרו באופן עצמאי, מציבים אותו על ARC-AGI-2 84.6%, Humanity's Last Exam 48.4% ללא כלים ו-53.4% עם חיפוש וקוד, IMO 2025 81.5%, ודירוג Elo של 3455 ב-Codeforces.
שני מאמצים סמוכים חשובים גם הם. Aletheia, סוכן מחקר מתמטי הבנוי על Gemini Deep Think, מדווח על ידי צדדים שלישיים כעומד על כ-95.1% ב-IMO-ProofBench Advanced — והוא בולט פחות בזכות המספר ויותר בזכות כך שתוכנן לומר "לא נמצא פתרון" במקום להמציא אחד; באתגר FirstProof של פברואר 2026 הוא פתר 6 מתוך 10 ונמנע מלפתור את השאר. ומערך של AI Co-Mathematician שרץ על Gemini 3.1 Pro העלה, על פי הדיווחים, את הביצועים ב-FrontierMath Tier 4 מ-19% ל-47.9%.

הנתון האחרון הזה ראוי לעצור עליו, מפני שהוא הטיעון החזק ביותר נגד פירוש ההדלפה הזו כפי שהיא נכתבה. זינוק מ־19% ל־47.9% במתמטיקה ברמת מחקר, שהושג באמצעות פיגום שעוטף מודל Gemini כללי ולא צ׳קפוינט חדש, מרמז שהרווחים הגדולים ביותר לאחרונה בביצועי המתמטיקה של Google באו מהרתמה שסביב המודל, ולא ממודל מומחה שמתחתיו. זה לא אומר ש-Mathematica הוא פיגום. זה כן אומר שנטל ההוכחה ל„זהו מודל מתמטי ייעודי חדש” גבוה מכפי שהסיקור הניח.
עוד פיסת הקשר אחת מרחפת מעל כל זה: DeepMind עברה ארגון מחדש באוגוסט 2026, כאשר דמיס האסאביס עבר לתפקיד יו"ר. הדלפות מתוך מעבדה שנמצאת בתהליך ארגון מחדש אינן אמינות יותר מהדלפות ממעבדה יציבה, והסיקור לא התייחס לתזמון כאל רלוונטי. ייתכן שהוא כן.
מודל או פיגום? השאלה שההדלפה הזו לא מכריעה
יש ויכוח חי בסיקור בשאלה אם Mathematica הוא בכלל מודל חדש. מחנה אחד מצביע על הקידומת "deepthink" במחרוזת הבנייה ומפרש אותה כצ'קפוינט נפרד. מחנה אחר — שאליו הגיע הכתוב המוקדם שלנו על השמועה של Deep Think V3 — גורס שתוצאות המתמטיקה המומחית של Google מגיעות מתשתיות סוכנים העוטפות מודלים כלליים של Gemini, ושאין צורך במודל מתמטי נפרד כדי שהמספרים יהיו אמיתיים.
מחרוזת הבנייה היא נקודה צנועה לזכות המחנה הראשון: models/deepthink-mathematica-tf-raw-thoughts מציין מודל, ו„raw-thoughts” מתאר תצורת מודל ולא שכבת רתמה. פיגום לא היה צריך שהחשיבה שלו תהיה בלתי מסוננת כדי לדבג אותו; מודל שהחשיבה שלו היא המוצר היה זקוק לכך. זה אות אמיתי.
זה לא גורם מכריע. גם להרנסים יש תצורה, ומחרוזת נתיב פנימית נכתבת בידי מי שהגדיר את הלוגינג, לא בידי סכימה. מה שכן יכריע הוא הדבר שאין לאף אחד: כרטיס מודל, או נקודת קצה, או בנצ׳מרק שהורץ בידי מישהו בלי אינטרס בתשובה.
מה שאתה יכול למעשה לקרוא היום
שום דבר מזה לא משנה את מה שאפשר להעלות לפרודקשן השבוע, וכדאי להיות בוטים לגבי הפער. Deep Think mathematica אינו נמצא באף API. גם Gemini 3.1 Deep Think לא נמכר לפי טוקן — הוא חסום מאחורי שכבת המנוי הצרכני הבכירה, ורשום בין $99.99 ל-$199.99 לחודש בהתאם לשכבה, בתוספת תוכנית API בהזמנה בלבד. אין מחיר מפורסם למיליון טוקנים עבורו.
מודל הבסיס שעליו הוא מבוסס לכאורה הוא סיפור אחר. Gemini 3.1 Pro מתומחר ב-$2.00 למיליון טוקני קלט, $0.20 במטמון, ו-$12.00 למיליון טוקני פלט עבור הקשרים מתחת ל-200,000 טוקנים, ועולה ל-$4.00 / $0.40 / $18.00 מעל לכך — התעריפים המפורסמים של Google עצמה.
בפרט התמחור הזה טמונה ההחלטה המעשית, מפני שפער העלויות בין מצבי החשיבה אינו קטן. ב-ARC-AGI-2, Deep Think מדווח בכ-85% תמורת כ-13.62 דולר למשימה, לעומת Gemini 3.1 Pro עם 77% תמורת כ-0.96 דולר למשימה. אתם משלמים בערך פי ארבעה עשר עבור שמונה נקודות. זהו חילוף מוצדק לבעיית מחקר קשה, וחילוף בלתי מוצדק למסלול ייצור שעוסק בעיקר בעבודה שגרתית — והתשובה הנכונה היא בדרך כלל שאתם רוצים ששניהם יהיו נגישים מאותו מקום, ולא החלטת מנוי שמתקבלת מראש.

זה הטיעון בעד ניתוב דרך מפתח אחד. מודלי Gemini שאפשר לקרוא להם היום — Gemini 3.1 Pro Preview, Gemini 3.8 Flash במחיר 0.750 דולר למיליון טוקני קלט עם קריאת מטמון ב-0.075 דולר, ושאר המשפחה — יושבים על הקטלוג של OrcaRouter הכולל 198 מודלים מ-15 ספקים, מאחורי נקודת קצה אחת תואמת OpenAI. אין תוספת מחיר על מחירי המחירון של הספקים, כך ששינוי מחיר של Google נכנס לתוקף אצלנו באותו יום במקום להמתין לחוזה מחודש. מעבר אוטומטי בין ספקים (failover) פירושו שמודל לא מוכח או בגרסת תצוגה מקדימה יכול לשבת בנתיב בלי לשאת לבדו על נתיב ייצור, וזו בדיוק התנוחה שמגיעה למודל שהודלף: לנסות אותו, לשמור על חלופה, לא לשנות שום דבר אחר. ה-DSL של הניתוב מרכיב כמה מודלים לקריאה אחת, ומיזוג מודלים מריץ פאנל ומאחד את התשובות — שניהם שימושיים כשהשאלה קשה והעמדה הכנה היא שרוצים את דעתו של יותר ממודל אחד.
כדי להבהיר את הגבול: OrcaRouter לא מארח את Deep Think mathematica, והוא לא מארח את Gemini 3.1 Deep Think. אלה לא נמצאים בקטלוג שלנו, ושום דבר כאן לא אמור לרמוז אחרת. מה שכן נמצא בקטלוג הוא שכבת ה-Gemini שמתחתיהם.
מה יהפוך את זה מהדלפה לחדשות?
ארבעה דברים, לפי סדר גס של המידה שבה הם יקדמו את הסיפור.
• כרטיס דגם.השחרורים של Deep Think מבית גוגל הגיעו עם הערכות שפורסמו. כרטיס עם מספרים על MILLENNIUM-BENCH או IMO-ProofBench Advanced, שהורץ בתנאים מוצהרים, יהפוך את זה ממחרוזת בנייה לדגם.
• נקודת קצה. הסימן הברור ביותר יהיה ש-Mathematica תופיע ב-Gemini API או ברשימת המודלים של Google תחת כל שם. עד שזה יקרה, אף אחד לא יכול לקרוא לה ואין מחיר להשוואה.
• המסלול המוסדי.הדפוס של Google ב-2025 היה לתת את מודל המתמטיקה החזק ביותר למתמטיקאים נבחרים תחילה, ולציבור גרסה מהירה יותר מאוחר יותר. השקה שקטה לחוקרים תתאים לתקדים הזה, וסביר להניח שהיא תיחשף לפני כל הכרזה על מוצר.
• הרצה של צד שלישי. בהינתן שהבנצ'מרק המדובר מגיע לשיא של כ-24% pass@1 עבור המודלים הטובים ביותר הזמינים, ושמצב הכשל המזוהה עמו הוא המצאה בביטחון עצמי, הערכה בלתי תלויה היא הראיה היחידה שתחזיק מעמד. כל נתון בכתבה הזו שנושא מספר הוא או של Google עצמה, או מדווח על ידי צד שלישי, או מסומן במפורש כלא מאומת — ואף אחד מהם לא הגיע ממודל שמישהו מחוץ ל-DeepMind הריץ.
הדבר היחיד ששווה לעשות עכשיו הוא לא לחכות. הפער בין מצב המתמטיקה של Google למודל הבסיסי שלו הוא פי ארבעה עשר בעלות ושמונה נקודות בדיוק, והחילוף הזה כבר פעיל; אפשר לבצע אותו כבר היום עם Gemini 3.1 Pro Preview על מפתח אחד ומנגנון גיבוי מאחוריו. כאשר Mathematica תקבל כרטיס מודל, תרצה שכבר החלטת כיצד לנתב בעיות קשות — והתשובה לכך לא תהיה תלויה במה שהמודל שהודלף יתברר להיות.
השוואות במאמר הזה1
זוהה מתוך המאמר הזה · בנצ'מרקים: Artificial Analysis · מתעדכן יומית
