بطاقة عنوان رئيسية مُولّدة تحمل «Deep Think Mathematica» مع عنوان فرعي «نموذج Google الرياضي المسرّب، مشروحًا»، فوق أربع شرائح حالة مستديرة تحمل «غير مُصدَر»، و«إصدار اختباري داخلي»، و«سياق ~1M، وفق ما ذُكر» و«لم يُنشر أي اختبار أداء»، وسطر تذييل يحمل «تسريب، وليس إطلاقًا. لم تؤكد Google وجود هذا النموذج.»
Guides & Insights

Deep Think Mathematica: داخل نموذج جوجل الرياضي المُسرَّب، والصرخة في أثر استدلاله

الكاتب

Rowan Sterling

تاريخ النشر

أحدث النماذج · 20عرض جميع النماذج
المعايير: Artificial Analysis · يُحدَّث يوميًا
العودة إلى جميع المقالات

أكثر ما يكشف عنه Deep Think Mathematica — نموذج Goo​gle الرياضي الذي ظهر في اختبارات داخلية هذا الأسبوع — هو أنه يبدو وكأنه يصرخ. نشر حساب على X باسم "Lyra" لقطات شاشة لسجلات الاستدلال الداخلية على الإنترنت في 16 سبتمبر 2026، وكانت المسارات توحي أكثر بشخص يمر بلحظة اكتشاف أمام سبورة منها بمساعد برهان: "انتظر." "يا إلهي." وبعد تبسيط معادلة بنجاح، جاءت السلسلة يا أم الرياضيات!!!!!!!!!!!!!!!!!!!!!!!! كان رد الفعل فوريًا وحنونًا — يبدو أن Goo​gle بنت ذكاءً اصطناعيًا يعشق الرياضيات حقًا. كما أن رد الفعل هذا هو أقل شيء مفيد يمكن أخذه من التسريب. لم يؤكد Goo​gle أيًا من هذا. لا توجد بطاقة نموذج، ولا معرّف نموذج في أي قائمة منشورة، ولا سعر، ولا تاريخ إصدار. الموجود هو سلسلة بناء، وتسميتان داخليتان، وميزانية رموز، ومجموعة لقطات شاشة، وأفضل نقطة مقارنة مطروحة في العائلة نفسها، Gem​ini 3.1 Deep Think — نموذج يمكنك استخدامه فعلاً اليوم، والمعيار الذي سيُحكم على هذا التسريب في نهاية المطاف مقارنةً به.

إذن، تعامل مع كل ما يلي على أنه ما هو عليه: قائمة ادعاءات مرفق بكل بند منها مصدر، ومرتبة حسب مقدار الوزن الذي ستحمله.

ما تقوله الإشارة فعليًا — والعلامة الدالة الجالسة فوقها

جاءت الإشارة نفسها من @testingcatalog، حساب لديه سجل جيد على Goo​gle تحديدًا: كشف خطط استخدام الكمبيوتر لسطح المكتب من Gem​ini، والتقط بطاقة المعاينة المبكرة لـ Nano Banana 2 تحت الاسم الداخلي "GEMPIX2" قبل أن تقول Goo​gle أي شيء. منشوره في 16 سبتمبر يحمل ادعاءين بجودة مختلفة جدًا.

الادعاء الثاني هو النموذج. رُصد نموذج "Deep Think Mathematica" جديد في اختبارات داخلية، ووُصف بأنه خليفة من حيث الروح لنموذج Deep Think IMO الذي أرسلته Google إلى مؤسسات مختارة العام الماضي.

الادّعاء الأول هو الدليل الكاشف، وهو الجدير بأن يُفهم: "عندما يكون Gemini على وشك تغيير خلفيته، فهناك شيء كبير يُحاك." هذا ليس حقيقة عن نموذج. بل هو قاعدة إرشادية مجتمعية حول كوريغرافيا إصدارات Google — الملاحظة القائلة إن تحديثًا مرئيًا لواجهة تطبيق Gemini قد سبق عدة من إعلانات Google الأكبر. قواعد إرشادية كهذه لها سجل حقيقي وقوة تنبؤية صفرية. تحديث واجهة المستخدم ليس نموذجًا.

كلا الادعاءين غير مُتحقَّق منهما. ولا يُعد أيٌّ منهما إصدارًا، ولا يتعامل هذا المقال معه كإصدار.

فكّ تشفير سلسلة البناء، لأنها أكثر مُخرَج ملموس هنا

أصعب دليل منفرد متداول هو معرّف بناء يُنسب إلى السجلات المسرّبة:

مسار البناء — models/deepthink-mathematica-tf-raw-thoughts، حسب ما أبلغت به AI Sight في 16 سبتمبر 2026، إلى جانب لقطات الشاشة.

تلك السلسلة تستحق قراءة متأنية، وهي النقطة التي تتوقف عندها معظم التغطية. ثلاثة أجزاء منها تحمل معلومات.

"deepthink" —يضع النموذج في خط Deep Think بدلاً من خط Gemini الرئيسي. وهذا مهم لأن Deep Think هو وضع في منتجات Google المطروحة، وليس عائلة منفصلة: فهو مسار التفكير المتوازي الذي يشغّل عدة حلول مرشحة في آنٍ واحد.

"tf" —في السياق، اختصار لـ "Teamfood"، وهي التسمية الثانية من التسميتين الداخليتين المذكورتين إلى جانب البناء. وفي مصطلحات Google الداخلية، يُعد ذلك تصنيفًا مبكرًا في مرحلة التجربة الداخلية (dogfooding): يستخدمه الموظفون، لا العملاء.

"raw-thoughts" —الجزء الأكثر إثارة للاهتمام، والمفتاح لفهم الصراخ. يشير هذا إلى إعداد سلسلة التفكير غير المفلترة — استدلال النموذج الصادر دون ضبط اللباقة أو قيود الأسلوب أو تصفية المخرجات. إن بناء "raw thoughts" ليس المنتج. بل هو الشيء الذي ينظر إليه المهندسون عندما يريدون رؤية ما يفعله النموذج قبل أن يجعله أي شخص قابلاً للعرض.

التسمية الثانية المُبلَّغ عنها هي UNSTABLE_EXPERIMENTAL، وهي شبه واضحة بذاتها وتشير في الاتجاه نفسه الذي تشير إليه "Teamfood": مبكرة، داخلية، وليست للعملاء.

يُنسب رقمان إضافيان إلى السجلات نفسها، وهما من مصدر واحد، لذا خذهما على نحو غير قاطع:

نافذة السياق —نحو 1,000,000 رمز، بما يطابق نافذة 1M التي تطرحها Goo​gle بالفعل في نماذج Gem​ini الرائدة.

حد الإخراج — 65,536 رمزًا، وهو ما يعني بالنسبة لنموذج استدلالي تفكيرًا مطوّلًا جدًا قبل تقديم الإجابة.

ذلك هو كامل السطح التقني للتسريب. مسار بناء، وتسميتا مرحلتين، ونافذة سياق، وحد أقصى للمخرجات. يكفي أن تقول إن شيئًا ما موجود في بيئة اختبار. ولا يكفي أن تقول ما النتيجة التي يحققها.

A generated two-column scoreboard titled 'Deep Think Mathematica vs Gemini 3.1 Deep Think — the scoreboard'. Left column 'Deep Think Mathematica (leaked)' reads Status: internal test build; Base model: Gemini 3.1 Pro, reported; Context window: ~1M tokens, reported; Output limit: 65,536 tokens, reported; Benchmarks: none published; Access: no endpoint. Right column 'Gemini 3.1 Deep Think' reads Status: shipping now; Base model: Gemini 3.1 Pro; Context window: 1M tokens; Output limit: not published; Benchmarks: ARC-AGI-2 84.6%, vendor; Access: top tier plus invited API. Footer reads 'Mathematica figures are single-source and unconfirmed; Google has not acknowledged the model. Gemini 3.1 Deep Think figures are Google's own, unreproduced.'

لماذا يُعدّ أثر الاستدلال الذي يصرخ دليلًا أضعف مما يبدو عليه

علامات التعجب هي سبب انتشار هذا التسريب، وهي سبب توخي الحذر بشأنه.

التفسير المذكور عادي تمامًا ويتطابق مع سلسلة البناء بدقة: تهيئة استدلال غير مفلترة، تُشغَّل عند درجة حرارة توليد عالية، مع نزع طبقات التأدب والتنسيق. وعندما تُزيل الضبط الذي يجعل النموذج يبدو هادئًا، فأنت لا تكشف عن روحه — بل تكشف عن أداة أخذ العينات الخاصة به. الإخراج المثقل بعلامات التعجب هو ما تبدو عليه عيّنة عالية الحرارة من استمرار متحمس. أما القراءة العاطفية فهي نتاج عارض للتهيئة، وليست اكتشافًا يخص النموذج.

النقطة الأعمق تتعلق بما سلسلة الأفكار تكون عليه. أثر الاستدلال هو نص مُولَّد يصادف أنه مفيد في حلّ المشكلات. إن قراءة سجل نصي منه واستنتاج حالة داخلية — حماس، إحباط، بهجة — هو خطأ التصنيف نفسه الذي نقع فيه عند استنتاج أن الآلة الحاسبة مسرورة حين تنتج عددًا صحيحًا نظيفًا. يجدر قول ذلك صراحةً لأن التغطية الصينية لهذا التسريب انجرّت إلى النكتة ("等等"، "我的天")، وسمحت بعض التغطية الإنجليزية للنكتة بأن تتصلب إلى وصف لشخصية النموذج.

لا شيء من ذلك يجعل التتبعات عديمة القيمة. فالكشف عن إصدار يعمل بأفكار خام دليل حقيقي على ممارسة هندسية فعلية — فأنت لا تسجل الاستدلال غير المفلتر إلا عندما تكون بصدد تنقيح الاستدلال نفسه، وهذا ما تفعله مع نموذج يتمثل عرض قيمته بالكامل في مدى جودة تفكيره في المشكلات الصعبة. كما أنه لم يتم التحقق مما إذا كانت التتبعات قد جاءت من تنقيح متعمد أم من تسجيل غير مقصود.

الخلاصة الصادقة: علامات التعجب تخبرك بوجود إعداد استدلالي خام. وهي لا تخبرك شيئًا عن القدرة الرياضية.

Millennium Bench ليست مسائل جائزة الألفية

عدة تقارير مكتوبة عن هذا التسريب، بما في ذلك ملخصات المُجمِّعات المتداولة في 16 سبتمبر، تجعل النموذج «يستهدف Millennium Bench» وتتوقف عند ذلك. إن الاسم يؤدي عملًا غير مقصود، لأنه يقع على مسافة كلمة واحدة من شيء أكثر شهرة بكثير وأكثر شحنًا بالدلالات — مسائل جائزة الألفية السبع التابعة لمعهد كلاي للرياضيات، التي تحمل كل واحدة منها مكافأة قدرها مليون دولار، وهي موضوع ادعاء منفصل وغير مؤكَّد بالكامل هذا الشهر بشأن OpenAI وبرهان نافييه–ستوكس. يقول أحد التقارير من ذلك النقاش إن Google طوّرت ذكاءً اصطناعيًا «حلّ» المسألة في 88 ساعة. ولا يزال كلاي يدرجها مفتوحة.

هذه أمور مختلفة، والخلط بينها يضخّم هذا التسريب بشكل كبير.

MILLENNIUM-BENCH، كما قُدّم في ورقة ICLR 2026"حيث ينهار الاستنباط: تشخيص إخفاقات الاستدلال في الرياضيات بمستوى البحث،" هو معيار من مسائل بمستوى البحث منسّقة بواسطة خبراء، تمتد عبر تسعة مجالات، تشمل الفيزياء الرياضية، والطوبولوجيا، والاحتمالات المعتمدة على نظرية القياس. وقد بُني ليتطلب استنباطًا متعدد الخطوات مستدامًا يتجاوز بكثير رياضيات المسابقات.

نتيجته الرئيسية هي الجزء المهم لقراءة هذا التسريب. عبر خمسة نماذج حدودية، شُغّلت 100 مرة لكل مسألة، حقق أقواها على الأكثر 24% في pass@1 و39% في pass@3. تشخيص الورقة لكيفية فشل النماذج أنفع من الدرجات: هلوسة الإطار، حيث يخترع النموذج نظرية غير قابلة للتطبيق ثم يستنتج بشكل متماسك داخلها، ومبرهنات ملفقة، حيث يستشهد بنتائج غير موجودة، مع أسماء مؤلفين وأرقام مبرهنات مختلقة.

خذ هذين الأمرين في اعتبارك معًا. إنّ اختبارًا معياريًا يبلغ فيه أفضل نموذج ذروته عند نحو ربع المسائل، ويكون فشله المميز هو الاختلاق الواثق، هو بالضبط الاختبار المعياري الذي تكون فيه لقطات الشاشة المسرّبة أقل قدرة على إثبات أي شيء. النموذج الذي يصرخ أثناء عمله هو نموذج تريد أن يقيّم نتاجه شخص آخر غير مؤلفه.

ما الذي طرحته Google فعليًا في هذا الخط؟

لا يُقرأ التسريب إلا على ضوء السجل المُصدَر، لأن قصة Google الرياضية مسارٌ موثّق، والاسم المسرّب يستعير مصداقيتها.

يوليو 2025 —بلغت نسخة متقدمة من Gem​ini Deep Think مستوى الميدالية الذهبية في الأولمبياد الدولي للرياضيات، إذ حلّت خمسًا من ست مسائل بمجموع 35 نقطة من 42، وقيّمها مسؤولو IMO وفق المعايير نفسها المطبقة على الطلاب. وأشار ديميس هاسابيس إلى أنها عملت من البداية إلى النهاية باللغة الطبيعية دون ترجمة إلى صياغة شكلية.

1 أغسطس 2025 — أطلقت Goo​gle Gem​ini 2.5 Deep Think علنًا، لكن ليس النموذج الذهبي. وُصفت النسخة المطروحة من Goo​gle بأنها نسخة أسرع وأكثر تحسينًا، إذ وصلت إلى أداء بمستوى برونزي في معيار IMO لعام 2025 وفقًا للتقييم الداخلي لـ Goo​gle. وكانت مقصورة على أعلى فئة للمستهلكين. وفي الوقت نفسه، منحت Goo​gle النموذج الذهبي الكامل لمجموعة مختارة من علماء الرياضيات والأكاديميين — «المؤسسات المختارة» التي تشير إليها الإشارة المسرّبة.

ديسمبر 2025 — Gemini 3 Deep Think، مع قفزة جيلية كبيرة أعلنت عنها Google بنسبة 45.1% على ARC-AGI-2 مع تنفيذ الكود و41.0% على Humanity's Last Exam بدون أدوات.

الآن — Gem​ini 3.1 Deep Think، المبنية على Gemini 3.1 Pro، وتُباع عبر أعلى طبقة اشتراك للمستهلكين وبرنامج API بالدعوة فقط. الأرقام التي نشرتها Goo​gle بنفسها، وهي مُبلَّغ عنها من المورّد ولم يُعَد إنتاجها بشكل مستقل، تضعها عند ARC-AGI-2 بنسبة 84.6%، وHumanity's Last Exam بنسبة 48.4% بدون أدوات و53.4% مع البحث والكود، وIMO 2025 بنسبة 81.5%، وتصنيف Elo في Codeforces قدره 3455.

هناك أيضًا جهدان متجاوران لهما أهمية. Aletheia، وهو وكيل بحث رياضي مبني على Gem​ini Deep Think، تُفيد جهات خارجية بأنه يحقق نحو 95.1% على IMO-ProofBench Advanced — واللافت فيه ليس الرقم بقدر ما هو كونه مصممًا ليقول "لا يوجد حل" بدلًا من اختلاق حل؛ وفي تحدّي FirstProof في فبراير 2026، حلّ 6 من 10 ورفض الباقي. كما أن منظومة AI Co-Mathematician العاملة على Gemini 3.1 Pro رفعت، وفقًا لما ذُكر، أداء FrontierMath Tier 4 من 19% إلى 47.9%.

A screenshot of Google DeepMind's official Gemini 3.1 Deep Think model page at deepmind.google/models/gemini/deep-think, captured September 16 2026 in English, showing the title 'Gemini 3.1 Deep Think', the subtitle 'Best for modern challenges across science, research and engineering', a 'Try in Gemini' button, the blue DeepMind model illustration, and the opening line 'Our most specialized reasoning mode is built on top of Gemini 3.1 Pro'.

ذلك الرقم الأخير يستحق التوقف عنده، لأنه أقوى حجة ضد قراءة هذا التسريب بالطريقة التي كُتب بها. فقفزة من 19% إلى 47.9% في الرياضيات بمستوى البحث، تحققت بواسطة سقالة ملفوفة حول نموذج Gem​ini عام بدلاً من نقطة تفتيش جديدة، تشير إلى أن أكبر المكاسب الحديثة في أداء Goo​gle الرياضي قد جاءت من الإطار التشغيلي المحيط بالنموذج، لا من نموذج متخصص تحته. هذا لا يعني أن Mathematica سقالة. لكنه يعني أن عبء الإثبات على «هذا نموذج رياضيات مخصص جديد» أعلى مما افترضته التغطية.

ثمة سياق إضافي يعلو فوق كل ذلك: أعادت DeepMind هيكلة نفسها في أغسطس 2026، مع انتقال ديميس هاسابيس إلى منصب رئيس مجلس الإدارة. التسريبات من داخل مختبر يعيد تنظيم صفوفه ليست أكثر موثوقية من التسريبات من مختبر مستقر، ولم تتعامل التغطية مع التوقيت باعتباره ذا صلة. وربما يكون ذا صلة.

نموذج أم سقالة؟ السؤال الذي لا يحسمه هذا التسريب

هناك جدل دائر في التغطية حول ما إذا كانت Mathematica نموذجًا جديدًا على الإطلاق. فريق يشير إلى بادئة "deepthink" في سلسلة البناء ويقرؤها على أنها نقطة تحقق منفصلة. وفريق آخر — وهو الفريق الذي وقع فيه مقالنا السابق عن شائعة Deep Think V3 — يرى أن نتائج Google المتخصصة في الرياضيات تأتي من هياكل وكلاء (agent scaffolds) ملفوفة حول نماذج Gemini العامة، وأنه لا حاجة لوجود نموذج رياضيات منفصل لكي تكون الأرقام حقيقية.

سلسلة البناء نقطة متواضعة لصالح المعسكر الأول: يشير models/deepthink-mathematica-tf-raw-thoughts إلى نموذج، وتصف «raw-thoughts» تهيئة نموذج لا طبقة تسخير. لن يحتاج الهيكل إلى أن يكون استدلاله غير مُفلتر لكي يُنقّح؛ أما النموذج الذي تفكيره هو المنتج فسيحتاج ذلك. هذه إشارة حقيقية.

إنها ليست حاسمة. فأدوات الاختبار لها إعداداتها أيضًا، وسلسلة المسار الداخلي يكتبها من أعدّ التسجيل، لا مخطط. وما يحسم الأمر هو الشيء الذي لا يملكه أحد: بطاقة نموذج، أو نقطة نهاية، أو اختبار معياري يشغّله شخص ليس له مصلحة في الإجابة.

ما يمكنك الاتصال به فعليًا اليوم

لا شيء من هذا يغيّر أي شيء يمكنك وضعه في الإنتاج هذا الأسبوع، ويجدر بنا أن نكون صريحين بشأن الفجوة. Deep Think mathematica ليس على أي API. Gem​ini 3.1 Deep Think لا يُباع لكل رمز أيضًا — فهو مقيّد خلف أعلى فئة اشتراك للمستهلكين، ويُذكر بين ‎$99.99 و‎$199.99 شهريًا حسب الفئة، إضافة إلى برنامج API بالدعوة فقط. لا يوجد سعر منشور لكل مليون رمز له.

أما النموذج الأساسي الذي يُقال إنه مبني عليه فأمره مختلف. يُسعَّر Gemini 3.1 Pro عند 2.00 دولار لكل مليون رمز إدخال، و0.20 دولار للمخزّن مؤقتًا، و12.00 دولارًا لكل مليون رمز إخراج للسياقات التي تقل عن 200,000 رمز، ويرتفع إلى 4.00 / 0.40 / 18.00 دولار فوق ذلك — وهي أسعار Google المنشورة بنفسها.

تفصيل التسعير هذا هو حيث يكمن القرار العملي، لأن فجوة التكلفة بين أوضاع الاستدلال ليست صغيرة. على ARC-AGI-2، يُبلَّغ عن Deep Think بنحو 85% مقابل حوالي 13.62 دولارًا للمهمة، في مقابل Gemini 3.1 Pro عند 77% مقابل حوالي 0.96 دولار للمهمة. أنت تدفع نحو أربعة عشر ضعفًا مقابل ثماني نقاط. هذه مقايضة يمكن الدفاع عنها لمشكلة بحثية صعبة، ومقايضة لا يمكن الدفاع عنها لمسار إنتاجي يتعامل في الغالب مع أعمال عادية — والجواب الصحيح عادةً هو أنك تريد إمكانية الوصول إلى كليهما من المكان نفسه، بدلًا من قرار اشتراك يُتخذ مسبقًا.

A screenshot of the OrcaRouter models catalogue at www.orcarouter.ai/models, captured September 16 2026 in English, showing the header 'Models — 198 models · 15 providers · one API key, one bill', a 'How to call any model' card with an OpenAI-compatible curl example, and model cards including Google: Gemini 3.8 Flash at $0.750 per million input tokens, $0.075 cache read and $3.75 output, alongside Qwen3.8 Max, GPT-6 Astra and Claude Fable 5.1.

هذا هو الحال بالنسبة للتوجيه عبر مفتاح واحد. نماذج Gemini القابلة للاستدعاء اليوم — Gemini 3.1 Pro Preview، Gemini 3.8 Flash بسعر 0.750 دولار لكل مليون رمز إدخال مع قراءة من الذاكرة المخبئية بتكلفة 0.075 دولار، وبقية العائلة — توجد على كتالوج OrcaRouter الذي يضم 198 نموذجًا عبر 15 مزوّدًا، خلف نقطة نهاية واحدة متوافقة مع OpenAI. لا توجد أي زيادة على أسعار قوائم المزوّدين، لذا يصبح أي تغيير في سعر Google ساريًا من جانبنا في اليوم نفسه بدلًا من انتظار إعادة التعاقد. يعني التحويل التلقائي عند الفشل أن نموذجًا غير مُثبت أو في المعاينة يمكن أن يبقى ضمن مسار دون أن يحمل مسار إنتاج بمفرده، وهو بالضبط الوضع الذي يستحقه نموذج مسرّب: جرّبه، واحتفظ ببديل، ولا تغيّر أي شيء آخر. تُركّب لغة التوجيه DSL عدة نماذج في استدعاء واحد، ويشغّل دمج النماذج لجنة ويجمع الإجابات — وكلاهما مفيد عندما يكون السؤال صعبًا ويكون الموقف الصادق هو أنك تريد رأي أكثر من نموذج واحد.

لأكون صريحًا بشأن الحد الفاصل: لا تستضيف OrcaRouter نظام Deep Think mathematica، ولا تستضيف Gem​ini 3.1 Deep Think. هذه ليست ضمن كتالوجنا، ولا ينبغي أن يوحي أي شيء هنا بخلاف ذلك. ما هو موجود في الكتالوج هو طبقة Gem​ini الواقعة تحتهما.

ما الذي سيحوّل هذا من تسريب إلى خبر؟

أربعة أشياء، بترتيب تقريبي حسب مدى قدرتها على تحريك القصة.

بطاقة نموذج. جاءت إصدارات Deep Think من Google مصحوبة بتقييمات منشورة. وبطاقة تحمل أرقامًا على MILLENNIUM-BENCH أو IMO-ProofBench Advanced، مُنفَّذة في ظروف محدَّدة، ستحوِّل هذا من مجرد سلسلة بناء إلى نموذج.

نقطة نهاية. ستكون الإشارة الأوضح هي ظهور Mathematica في Gem​ini API أو في قائمة نماذج Goo​gle تحت أي اسم. وإلى أن يحدث ذلك، لا يستطيع أحد استدعاءه ولا يوجد سعر للمقارنة.

المسار المؤسسي.كان نمط Goo​gle في عام 2025 هو منح أقوى نموذج رياضيات لعلماء رياضيات مختارين أولاً، ثم تقديم نسخة أسرع للجمهور لاحقاً. ومن شأن طرح هادئ على الباحثين أن يتوافق مع هذا السابق، ويُرجَّح أن يظهر قبل أي إعلان عن منتج.

تشغيل من طرف ثالث. بالنظر إلى أن المعيار المعني يبلغ ذروته عند نحو 24% في pass@1 لأفضل النماذج المتاحة، وأن نمط فشله المميز هو الاختلاق الواثق، فإن التقييم المستقل هو الدليل الوحيد الذي سيصمد. وكل رقم في هذا المقال هو إما من Google نفسها، أو منقول عن طرف ثالث، أو مُشار إليه صراحةً على أنه غير مُتحقق منه — ولم يأتِ أي منها من نموذج شغّله أحد من خارج DeepMind.

الشيء الوحيد الذي يستحق أن تفعله الآن هو ألّا تنتظر. الفجوة بين وضع الرياضيات في Goo​gle ونموذجه الأساسي تبلغ أربعة عشر ضعفًا في التكلفة وثماني نقاط في الدقة، وهذه المقايضة قائمة بالفعل؛ يمكنك أن تعقدها اليوم مع Gemini 3.1 Pro Preview على مفتاح واحد ونموذج احتياطي من خلفه. وعندما تصدر بطاقة تعريف لنموذج Mathematica، ستريد أن تكون قد قرّرت سلفًا كيف توجّه المشكلات الصعبة — ولن تعتمد إجابة ذلك على ما يتبيّن أن النموذج المسرَّب عليه.

مقارنات في هذه المقالة1

مستخرج من هذه المقالة · المعايير: Artificial Analysis · يُحدَّث يوميًا