การ์ดชื่อเรื่องแบบฮีโร่ที่สร้างขึ้นซึ่งมีข้อความว่า 'Deep Think Mathematica' พร้อมคำบรรยายใต้ชื่อว่า 'โมเดลคณิตศาสตร์ที่หลุดของ Google ฉบับอธิบายให้เข้าใจ' เหนือชิปสถานะทรงมนสี่ชิปที่ระบุว่า 'ยังไม่เปิดตัว' 'บิลด์ทดสอบภายใน' 'บริบท ~1M ตามรายงาน' และ 'ยังไม่เผยแพร่เบนช์มาร์ก' และบรรทัดส่วนท้ายที่ระบุว่า 'หลุด ไม่ใช่เปิดตัว Google ยังไม่ได้ยืนยันว่าโมเดลนี้มีอยู่จริง'
Guides & Insights

Deep Think Mathematica: เจาะลึกโมเดลคณิตศาสตร์ที่รั่วไหลของ Google และเสียงกรีดร้องในร่องรอยการให้เหตุผลของมัน

ผู้เขียน

Rowan Sterling

วันที่เผยแพร่

โมเดลล่าสุด · 20ดูโมเดลทั้งหมด
เบนช์มาร์ก: Artificial Analysis · อัปเดตทุกวัน
กลับไปยังโพสต์ทั้งหมด

สิ่งที่เผยได้มากที่สุดเกี่ยวกับDeep Think Mathematica — โมเดลคณิตศาสตร์ของ Goo​gle ที่โผล่ขึ้นมาในการทดสอบภายในเมื่อสัปดาห์นี้ — ก็คือดูเหมือนว่ามันจะตะโกน บัญชี X บัญชีหนึ่งที่โพสต์ในชื่อ "Lyra" ได้นำภาพหน้าจอบันทึกการให้เหตุผลภายในขึ้นออนไลน์เมื่อวันที่ 16 กันยายน 2026 และร่องรอยเหล่านั้นอ่านแล้วไม่เหมือนผู้ช่วยพิสูจน์ทฤษฎีเท่าไรนัก แต่เหมือนคนที่เกิดความกระจ่างขึ้นมาที่กระดานไวท์บอร์ดเสียมากกว่า: "เดี๋ยวนะ" "โอ้พระเจ้า" และหลังจากลดรูปสมการได้สำเร็จ สตริงพระแม่เจ้าแห่งคณิตศาสตร์!!!!!!!!!!!!!!!!!!!!!!!!ปฏิกิริยาที่ตามมาเกิดขึ้นทันทีและเปี่ยมความเอ็นดู — ดูเหมือนว่า Goo​gle ได้สร้าง AI ที่รักคณิตศาสตร์อย่างแท้จริง ปฏิกิริยานั้นยังเป็นสิ่งที่มีประโยชน์น้อยที่สุดที่จะได้จากการรั่วไหลนี้ด้วย ไม่มีสิ่งใดในนี้ที่ Goo​gle ยืนยันแล้ว ไม่มีโมเดลการ์ด ไม่มี ID โมเดลในรายการที่เผยแพร่ใด ๆ ไม่มีราคา และไม่มีวันเปิดตัว สิ่งที่มีอยู่คือสตริงบิลด์ ป้ายกำกับภายในสองป้าย งบโทเคน ชุดภาพหน้าจอ และจุดเปรียบเทียบที่วางจำหน่ายจริงที่ดีที่สุดในตระกูลเดียวกัน Gem​ini 3.1 Deep Think — โมเดลที่คุณใช้งานได้จริงในวันนี้ และเป็นไม้บรรทัดที่การรั่วไหลนี้จะถูกนำมาเปรียบเทียบในที่สุด

ดังนั้น จงมองทุกอย่างด้านล่างตามที่มันเป็น: รายการข้อกล่าวอ้างที่มีแหล่งที่มาแนบอยู่กับแต่ละรายการ เรียงลำดับตามว่ามันจะรับน้ำหนักได้มากน้อยเพียงใด

สิ่งที่สัญญาณสื่อจริง ๆ — และสิ่งบอกใบ้ที่อยู่เหนือมัน

สัญญาณเองมาจาก @testingcatalog, ซึ่งเป็นบัญชีที่มีประวัติความน่าเชื่อถือพอสมควร โดยเฉพาะในเรื่องของ Goo​gle: มันเปิดเผยแผนการใช้คอมพิวเตอร์บนเดสก์ท็อปของ Gem​ini และมันพบการ์ดพรีวิวช่วงแรกของ Nano Banana 2 ภายใต้ชื่อภายใน "GEMPIX2" ก่อนที่ Goo​gle จะพูดอะไร โพสต์วันที่ 16 กันยายนของมันมีสองคำกล่าวอ้างที่มีคุณภาพแตกต่างกันอย่างมาก

ข้อกล่าวอ้างที่สองคือตัวโมเดล มีการพบ "Deep Think Mathematica" ใหม่ระหว่างการทดสอบภายใน โดยได้รับการอธิบายว่าเป็นผู้สืบทอดทางจิตวิญญาณของโมเดล Deep Think IMO ที่ Goo​gle ส่งมอบให้สถาบันที่ได้รับการคัดเลือกเมื่อปีที่แล้ว

คำกล่าวอ้างแรกคือสัญญาณบอกใบ้ และเป็นข้อที่ควรค่าแก่การทำความเข้าใจ: "เมื่อ Gemini กำลังจะเปลี่ยนพื้นหลังของมัน แสดงว่ามีเรื่องใหญ่กำลังก่อตัว" นั่นไม่ใช่ข้อเท็จจริงเกี่ยวกับโมเดล มันเป็นฮิวริสติกของชุมชนเกี่ยวกับจังหวะการเปิดตัวของ Google — ข้อสังเกตที่ว่าการรีเฟรชที่มองเห็นได้ของหน้าตาแอป Gemini ได้เกิดขึ้นก่อนการประกาศครั้งใหญ่กว่าของ Google หลายครั้ง ฮิวริสติกแบบนี้มีประวัติผลงานจริงและไม่มีพลังในการทำนายเลย การรีเฟรช UI ไม่ใช่โมเดล

ข้อกล่าวอ้างทั้งสองยังไม่ได้รับการยืนยัน ทั้งสองไม่ใช่การเปิดตัว และบทความนี้ไม่ได้ถือว่ามันเป็นการเปิดตัว

การถอดรหัสสตริงบิลด์ เพราะมันเป็นอาร์ติแฟกต์ที่จับต้องได้ชัดเจนที่สุดตรงนี้

หลักฐานชิ้นเดียวที่หนักแน่นที่สุดที่กำลังแพร่หลายอยู่ในขณะนี้ คือตัวระบุบิลด์ที่ถูกอ้างว่าเกี่ยวข้องกับบันทึกที่รั่วไหล:

เส้นทางการสร้าง —โมเดล models/deepthink-mathematica-tf-raw-thoughts ซึ่งรายงานโดย AI Sight เมื่อวันที่ 16 กันยายน 2026 พร้อมกับภาพหน้าจอ

สตริงนั้นคุ้มค่าที่จะอ่านอย่างละเอียด และนั่นคือจุดที่การรายงานส่วนใหญ่หยุดลง สามส่วนของมันให้ข้อมูล

"deepthink" — ทำให้โมเดลอยู่ในสาย Deep Think แทนที่จะเป็นสายหลัก Gemini เรื่องนี้สำคัญเพราะ Deep Think เป็นโหมดในผลิตภัณฑ์ที่วางจำหน่ายของ Google ไม่ใช่ตระกูลแยกต่างหาก: มันเป็นเส้นทางการใช้เหตุผลแบบขนานที่รันโซลูชันตัวเลือกหลายตัวพร้อมกัน

"tf" —ในบริบทนี้ เป็นคำย่อของ "Teamfood" ซึ่งเป็นป้ายชื่อภายในอันดับที่สองจากสองป้ายที่ถูกรายงานควบคู่ไปกับบิลด์ ในคำศัพท์ภายในของ Google นั่นคือการกำหนดชื่อสำหรับระยะเริ่มต้นในขั้นตอน dogfooding นั่นคือพนักงานเป็นผู้ใช้งาน ไม่ใช่ลูกค้า

"raw-thoughts" —ส่วนที่น่าสนใจที่สุด และเป็นกุญแจสำคัญของการตะโกน นี่หมายถึงการตั้งค่าแบบ chain-of-thought ที่ไม่ผ่านการกรอง — การให้เหตุผลของโมเดลที่ถูกปล่อยออกมาโดยไม่ปรับแต่งความสุภาพ ไม่มีข้อจำกัดด้านสไตล์ หรือการกรองเอาต์พุต บิลด์ "raw thoughts" ไม่ใช่ตัวผลิตภัณฑ์ มันคือสิ่งที่วิศวกรดูเมื่อต้องการเห็นว่าโมเดลกำลังทำอะไรอยู่ ก่อนที่ใครจะทำให้มันดูดีพร้อมนำเสนอ

ป้ายที่รายงานเป็นอันดับที่สองคือ UNSTABLE_EXPERIMENTALซึ่งเกือบจะอธิบายได้ด้วยตัวเองและชี้ไปในทิศทางเดียวกันกับ "Teamfood": ช่วงแรกเริ่ม, ภายใน, ไม่ใช่สำหรับลูกค้า

ตัวเลขอีกสองค่าถูกระบุว่ามาจากบันทึกเดียวกัน และมีแหล่งที่มาเพียงแหล่งเดียว ดังนั้นโปรดถือไว้อย่างหลวม ๆ:

หน้าต่างบริบท —ประมาณ 1,000,000 โทเค็น ซึ่งตรงกับหน้าต่างขนาด 1M ที่ Goo​gle เปิดให้ใช้งานแล้วในโมเดล Gem​ini รุ่นแนวหน้าของบริษัท

ขีดจำกัดผลลัพธ์ — 65,536 โทเคน ซึ่งสำหรับโมเดลแบบใช้เหตุผลแล้ว หมายความว่าจะมีการครุ่นคิดอย่างยาวนานมากก่อนจะได้คำตอบ

นั่นคือพื้นผิวทางเทคนิคทั้งหมดของการรั่วไหลนี้ พาธบิลด์ ป้ายกำกับสองสเตจ หน้าต่างบริบท และเพดานเอาต์พุต มันเพียงพอที่จะบอกว่าสิ่งหนึ่งมีอยู่ในฮาร์เนสทดสอบ แต่มันไม่เพียงพอที่จะบอกว่ามันได้คะแนนเท่าไร

A generated two-column scoreboard titled 'Deep Think Mathematica vs Gemini 3.1 Deep Think — the scoreboard'. Left column 'Deep Think Mathematica (leaked)' reads Status: internal test build; Base model: Gemini 3.1 Pro, reported; Context window: ~1M tokens, reported; Output limit: 65,536 tokens, reported; Benchmarks: none published; Access: no endpoint. Right column 'Gemini 3.1 Deep Think' reads Status: shipping now; Base model: Gemini 3.1 Pro; Context window: 1M tokens; Output limit: not published; Benchmarks: ARC-AGI-2 84.6%, vendor; Access: top tier plus invited API. Footer reads 'Mathematica figures are single-source and unconfirmed; Google has not acknowledged the model. Gemini 3.1 Deep Think figures are Google's own, unreproduced.'

ทำไมร่องรอยการให้เหตุผลที่ตะโกนจึงเป็นหลักฐานที่อ่อนแอกว่าที่มันดูเหมือน

เครื่องหมายอัศเจรีย์คือเหตุผลที่การรั่วไหลนี้แพร่กระจายออกไป และก็เป็นเหตุผลที่ต้องระมัดระวังกับมัน

คำอธิบายที่ถูกรายงานนั้นธรรมดาและตรงกับ build string อย่างแม่นยำ: การกำหนดค่าการให้เหตุผลแบบไม่กรอง ทำงานที่อุณหภูมิการสร้างสูง โดยที่ชั้นความสุภาพและการจัดรูปแบบถูกถอดออก เมื่อคุณลบการปรับแต่งที่ทำให้โมเดลดูสงบ คุณไม่ได้เปิดเผยจิตวิญญาณของมัน — คุณเปิดเผยตัวสุ่มตัวอย่างของมัน เอาต์พุตที่เต็มไปด้วยเครื่องหมายอัศเจรีย์คือสิ่งที่ตัวอย่างอุณหภูมิสูงของการต่อเนื่องที่ตื่นเต้นดูเหมือน การตีความทางอารมณ์เป็นอาร์ติแฟกต์ของการกำหนดค่า ไม่ใช่การค้นพบเกี่ยวกับโมเดล

ประเด็นที่ลึกซึ้งกว่านั้นอยู่ที่สิ่งที่ห่วงโซ่ความคิดเป็น ร่องรอยการให้เหตุผลเป็นข้อความที่ถูกสร้างขึ้นซึ่งบังเอิญมีประโยชน์ต่อการแก้ปัญหา การอ่านบันทึกถอดความของมันแล้วอนุมานสภาวะภายใน — ความกระตือรือร้น ความคับข้องใจ ความปิติยินดี — เป็นความผิดพลาดเชิงหมวดหมู่แบบเดียวกับการอนุมานว่าเครื่องคิดเลขพอใจเมื่อมันให้ผลลัพธ์เป็นจำนวนเต็มลงตัว เป็นเรื่องที่ควรพูดให้ตรง ๆ เพราะการรายงานข่าวภาษาจีนเกี่ยวกับการรั่วไหลนี้โน้มไปทางการเล่นมุก ("等等", "我的天") และการรายงานข่าวภาษาอังกฤษบางส่วนปล่อยให้มุกนั้นแข็งตัวกลายเป็นคำอธิบายลักษณะนิสัยของโมเดล

ทั้งหมดนั้นไม่ได้ทำให้เทรซไร้ค่า การเปิดเผยบิลด์ที่ปล่อยความคิดดิบออกมาเป็นหลักฐานแท้จริงเกี่ยวกับแนวปฏิบัติทางวิศวกรรมจริง — คุณจะบันทึกกระบวนการให้เหตุผลแบบไม่กรองก็ต่อเมื่อคุณกำลังดีบักกระบวนการให้เหตุผลนั้นเอง ซึ่งเป็นสิ่งที่คุณทำกับโมเดลที่ข้อเสนอคุณค่าทั้งหมดของมันอยู่ที่ว่ามันคิดผ่านปัญหายาก ๆ ได้ดีเพียงใด และยังไม่ได้รับการยืนยันว่าเทรซเหล่านั้นมาจากการดีบักโดยเจตนาหรือการบันทึกโดยไม่ได้ตั้งใจ

ข้อสรุปที่ตรงไปตรงมาคือ: คำอุทานเหล่านั้นบอกคุณว่ามีโครงแบบการให้เหตุผลแบบดิบอยู่เท่านั้น พวกมันไม่ได้บอกอะไรคุณเลยเกี่ยวกับความสามารถทางคณิตศาสตร์

Millennium Bench ไม่ใช่ Millennium Prize Problems

บทความหลายชิ้นเกี่ยวกับการรั่วไหลนี้ รวมถึงสรุปจากผู้รวบรวมที่แพร่กระจายเมื่อวันที่ 16 กันยายน ระบุว่าโมเดลนี้ "มุ่งเป้าไปที่ Millennium Bench" และจบแค่นั้น ชื่อนี้กำลังทำงานโดยบังเอิญ เพราะมันอยู่ห่างเพียงคำเดียวจากบางสิ่งที่มีชื่อเสียงมากกว่าและมีนัยหนักหนามากกว่า — ปัญหารางวัลสหัสวรรษทั้งเจ็ดของ Clay Mathematics Institute ซึ่งแต่ละข้อมีรางวัลมูลค่า 1 ล้านดอลลาร์ และเป็นหัวข้อของข้อกล่าวอ้างแยกต่างหากที่ยังไม่ได้รับการยืนยันโดยสิ้นเชิงในเดือนนี้เกี่ยวกับ OpenAI และการพิสูจน์ Navier–Stokes รายงานฉบับหนึ่งจากกระทู้นั้นกล่าวว่า Google สร้าง AI ที่ "แก้" ปัญหาได้ใน 88 ชั่วโมง Clay ยังคงระบุว่ามันยังเปิดอยู่

สิ่งเหล่านี้เป็นคนละเรื่อง และการนำมาปนรวมกันทำให้การรั่วไหลนี้ดูใหญ่ขึ้นอย่างมาก

MILLENNIUM-BENCH ซึ่งนำเสนอในบทความ ICLR 2026 "เมื่อการอนุมานล้มเหลว: การวินิจฉัยความล้มเหลวในการให้เหตุผลในคณิตศาสตร์ระดับงานวิจัย" เป็นชุดเกณฑ์มาตรฐานของปัญหาคณิตศาสตร์ระดับงานวิจัยที่คัดสรรโดยผู้เชี่ยวชาญ ครอบคลุมเก้าสาขา รวมถึงฟิสิกส์คณิตศาสตร์ ทอพอโลยี และความน่าจะเป็นเชิงทฤษฎีเมเชอร์ มันถูกสร้างขึ้นเพื่อให้ต้องใช้การอนุมานหลายขั้นตอนอย่างต่อเนื่อง ซึ่งเกินกว่าระดับคณิตศาสตร์เพื่อการแข่งขันไปมาก

ผลลัพธ์เด่นของมันคือส่วนที่สำคัญสำหรับการอ่านข้อมูลที่รั่วไหลนี้ จากการทดสอบโมเดลระดับแนวหน้าห้าโมเดล โดยรัน 100 ครั้งต่อปัญหา โมเดลที่แข็งแกร่งที่สุดทำได้มากที่สุดเพียง 24% ใน pass@1 และ 39% ใน pass@3 การวินิจฉัยของบทความว่าโมเดลล้มเหลวอย่างไรนั้นมีประโยชน์กว่าคะแนนเสียอีก: การหลอนกรอบทฤษฎี ซึ่งเป็นกรณีที่โมเดลสร้างทฤษฎีที่ใช้ไม่ได้ขึ้นมา แล้วให้เหตุผลอย่างสอดคล้องกันภายในทฤษฎีนั้น และ ทฤษฎีบทที่กุขึ้น ซึ่งเป็นกรณีที่มันอ้างผลลัพธ์ที่ไม่มีอยู่จริง พร้อมด้วยชื่อผู้แต่งและหมายเลขทฤษฎีบทที่กุขึ้น

ให้ทั้งสองเรื่องนั้นอยู่ในใจพร้อมกัน เกณฑ์มาตรฐานที่โมเดลที่ดีที่สุดทำได้สูงสุดเพียงประมาณหนึ่งในสี่ของโจทย์ และจุดล้มเหลวอันเป็นเอกลักษณ์ของมันคือการกุเรื่องขึ้นมาอย่างมั่นใจ คือเกณฑ์มาตรฐานที่ภาพหน้าจอที่รั่วไหลออกมานั้นพิสูจน์อะไรได้น้อยที่สุดพอดี โมเดลที่ตะโกนเสียงดังขณะทำงาน คือโมเดลที่คุณอยากให้ผลลัพธ์ของมันถูกให้คะแนนโดยคนอื่นที่ไม่ใช่ผู้สร้างมัน

สิ่งที่ Goo​gle เปิดตัวจริงๆ ในไลน์นี้

การรั่วไหลนี้จะอ่านออกได้ก็ต่อเมื่อวางเทียบกับบันทึกที่เผยแพร่แล้วเท่านั้น เพราะเรื่องราวทางคณิตศาสตร์ของ Goo​gle เป็นพัฒนาการที่มีเอกสารบันทึกไว้ และชื่อที่รั่วไหลออกมากำลังยืมความน่าเชื่อถือของสิ่งนั้นมาใช้

กรกฎาคม 2025 —เวอร์ชันขั้นสูงของ Gemini Deep Think บรรลุมาตรฐานเหรียญทองในการแข่งขันคณิตศาสตร์โอลิมปิกระหว่างประเทศ โดยแก้โจทย์ได้ห้าจากหกข้อ คิดเป็น 35 จาก 42 คะแนน ซึ่งเจ้าหน้าที่ IMO เป็นผู้ตรวจให้คะแนนตามมาตรฐานเดียวกับที่ใช้กับนักเรียน Demis Hassabis ตั้งข้อสังเกตว่ามันทำงานแบบครบวงจรด้วยภาษาธรรมชาติ โดยไม่ต้องแปลเป็นรูปแบบไวยากรณ์ที่เป็นทางการ

1 สิงหาคม 2025 — Goo​gle เปิดตัว Gem​ini 2.5 Deep Thinkสู่สาธารณะแล้ว แต่ไม่ใช่รุ่นโกลด์ เวอร์ชันที่เผยแพร่ได้รับการอธิบายจาก Goo​gle ว่าเป็นเวอร์ชันที่เร็วขึ้นและปรับแต่งให้เหมาะสมมากกว่า โดยทำผลงานได้ถึงระดับบรอนซ์จากการทดสอบมาตรฐาน IMO 2025 ตามการประเมินภายในของ Goo​gle และถูกจำกัดสิทธิ์ไว้เฉพาะกลุ่มผู้ใช้ระดับสูงสุดเท่านั้น ในขณะเดียวกัน Goo​gle ก็มอบรุ่นโกลด์แบบเต็มรูปแบบให้กับกลุ่มนักคณิตศาสตร์และนักวิชาการที่ได้รับการคัดเลือก — "สถาบันที่ได้รับการคัดเลือก" ซึ่งเป็นสิ่งที่สัญญาณที่รั่วไหลออกมากำลังอ้างถึง

ธันวาคม 2025 — Gemini 3 Deep Think ด้วยการก้าวกระโดดครั้งใหญ่ข้ามรุ่น ซึ่ง Google รายงานว่าได้ 45.1% บน ARC-AGI-2 เมื่อใช้การรันโค้ด และ 41.0% บน Humanity's Last Exam โดยไม่ใช้เครื่องมือ

ตอนนี้ — Gem​ini 3.1 Deep Think สร้างขึ้นบน Gemini 3.1 Pro จำหน่ายผ่านแพ็กเกจการสมัครสมาชิกสำหรับผู้บริโภคระดับสูงสุด และโครงการ API แบบเชิญเท่านั้น ตัวเลขที่ Goo​gle เปิดเผยเอง ซึ่งเป็นข้อมูลที่ผู้จำหน่ายรายงานและยังไม่ได้รับการทำซ้ำอย่างเป็นอิสระ ระบุว่าอยู่ที่ ARC-AGI-2 84.6% Humanity's Last Exam 48.4% เมื่อไม่ใช้เครื่องมือ และ 53.4% เมื่อใช้การค้นหาและโค้ด IMO 2025 81.5% และ Codeforces Elo 3455

ความพยายามสองเรื่องที่อยู่ใกล้เคียงกันก็สำคัญเช่นกัน Aletheiaซึ่งเป็นเอเจนต์วิจัยคณิตศาสตร์ที่สร้างขึ้นบน Gem​ini Deep Think มีรายงานจากบุคคลที่สามว่าทำได้ประมาณ 95.1% ใน IMO-ProofBench Advanced — และความน่าสนใจไม่ได้อยู่ที่ตัวเลขนั้นเท่ากับการที่มันถูกออกแบบให้พูดว่า "ไม่พบวิธีแก้" แทนที่จะประดิษฐ์วิธีแก้ขึ้นมาเอง ในความท้าทาย FirstProof ประจำเดือนกุมภาพันธ์ 2026 มันแก้ได้ 6 จาก 10 ข้อ และปฏิเสธข้อที่เหลือ และการตั้งค่า AI Co-Mathematician ที่ทำงานบน Gemini 3.1 Pro มีรายงานว่ายกระดับประสิทธิภาพของ FrontierMath Tier 4 จาก 19% เป็น 47.9%

A screenshot of Google DeepMind's official Gemini 3.1 Deep Think model page at deepmind.google/models/gemini/deep-think, captured September 16 2026 in English, showing the title 'Gemini 3.1 Deep Think', the subtitle 'Best for modern challenges across science, research and engineering', a 'Try in Gemini' button, the blue DeepMind model illustration, and the opening line 'Our most specialized reasoning mode is built on top of Gemini 3.1 Pro'.

ตัวเลขสุดท้ายนั้นน่าหยุดคิด เพราะมันเป็นข้อโต้แย้งที่หนักแน่นที่สุดต่อการตีความข้อมูลรั่วไหลนี้ตามแบบที่ถูกเขียนขึ้น การกระโดดจาก 19% เป็น 47.9% ในคณิตศาสตร์ระดับวิจัย ซึ่งทำได้ด้วยสแคฟโฟลด์ที่ห่อหุ้มโมเดล Gem​ini ทั่วไป แทนที่จะเป็นเช็กพอยต์ใหม่ บ่งชี้ว่าการเพิ่มขึ้นมากที่สุดในช่วงหลังของประสิทธิภาพด้านคณิตศาสตร์ของ Goo​gle มาจากฮาร์เนสที่อยู่รอบโมเดล ไม่ได้มาจากโมเดลผู้เชี่ยวชาญที่อยู่ข้างใต้ มันไม่ได้หมายความว่า Mathematica เป็นสแคฟโฟลด์ แต่มันหมายความว่าภาระการพิสูจน์สำหรับ "นี่คือโมเดลคณิตศาสตร์เฉพาะทางใหม่" สูงกว่าที่การรายงานข่าวสันนิษฐานไว้

มีบริบทอีกชิ้นหนึ่งที่ครอบอยู่เหนือทั้งหมดนี้: DeepMind ปรับโครงสร้างใหม่ในเดือนสิงหาคม 2026 โดย Demis Hassabis ย้ายไปดำรงตำแหน่งประธาน การรั่วไหลจากภายในห้องแล็บที่กำลังปรับโครงสร้างใหม่ไม่ได้น่าเชื่อถือไปกว่าการรั่วไหลจากห้องแล็บที่มั่นคง และการรายงานข่าวไม่ได้มองว่าจังหวะเวลานี้มีความเกี่ยวข้อง แต่มันอาจเกี่ยวข้องก็ได้

โมเดลหรือสแคฟโฟลด์? คำถามที่การรั่วไหลครั้งนี้ยังไม่คลี่คลาย

มีการถกเถียงที่ยังดำเนินอยู่ในการรายงานข่าวว่า Mathematica เป็นโมเดลใหม่เลยหรือไม่ ฝ่ายหนึ่งชี้ไปที่คำนำหน้า "deepthink" ในสตริงบิลด์ และตีความว่ามันเป็นเช็กพอยต์แยกต่างหาก อีกฝ่าย — ซึ่งบทความก่อนหน้าของเราเองเกี่ยวกับข่าวลือ Deep Think V3 ตกอยู่ในฝ่ายนี้ — เชื่อว่าผลลัพธ์คณิตศาสตร์เฉพาะทางของ Google มาจากโครงสร้างเอเจนต์ที่ห่อหุ้มโมเดล Gemini ทั่วไป และไม่จำเป็นต้องมีโมเดลคณิตศาสตร์แยกต่างหากเพื่อให้ตัวเลขเหล่านั้นเป็นเรื่องจริง

สตริงบิลด์เป็นข้อสนับสนุนเล็ก ๆ ให้ฝ่ายแรก: models/deepthink-mathematica-tf-raw-thoughts ระบุชื่อโมเดล และ "raw-thoughts" อธิบายการกำหนดค่าโมเดลมากกว่าที่จะเป็นชั้นฮาร์เนส สแคฟโฟลด์ไม่จำเป็นต้องมีการให้เหตุผลของมันแบบไม่ถูกกรองเพื่อทำการดีบัก; ส่วนโมเดลที่ความคิดของมันเป็นตัวผลิตภัณฑ์นั่นเองก็คงต้องเป็นเช่นนั้น นั่นคือสัญญาณที่แท้จริง

มันไม่ใช่หลักฐานที่ชี้ขาด ฮาร์เนสก็มีการตั้งค่าเช่นกัน และสตริงพาธภายในถูกเขียนโดยผู้ที่ตั้งค่าการบันทึก log ไม่ใช่โดยสคีมา สิ่งที่จะชี้ขาดได้คือสิ่งที่ไม่มีใครมี: การ์ดโมเดล หรือเอนด์พอยต์ หรือเบนช์มาร์กที่รันโดยคนที่ไม่มีส่วนได้ส่วนเสียกับคำตอบ

สิ่งที่คุณสามารถโทรหาได้จริงในวันนี้

ไม่มีสิ่งใดในนี้เปลี่ยนแปลงอะไรก็ตามที่คุณสามารถนำไปใช้ในโปรดักชันได้ภายในสัปดาห์นี้ และก็น่าจะพูดกันตรง ๆ เกี่ยวกับช่องว่างนี้ Deep Think mathematica ไม่ได้อยู่บน API ใด ๆ Gem​ini 3.1 Deep Think ก็ไม่ได้ขายเป็นรายโทเคนเช่นกัน — มันถูกกั้นไว้หลังระดับแพ็กเกจการสมัครสมาชิกสำหรับผู้บริโภคระดับสูงสุด โดยมีราคาระบุไว้ระหว่าง $99.99 ถึง $199.99 ต่อเดือน ขึ้นอยู่กับระดับแพ็กเกจ บวกกับโปรแกรม API ที่เข้าถึงได้โดยการเชิญเท่านั้น ไม่มีราคาต่อล้านโทเคนที่เผยแพร่สำหรับมัน

ส่วนโมเดลฐานที่รายงานว่ามันใช้เป็นฐานต่อยอดนั้นเป็นอีกเรื่องหนึ่ง Gemini 3.1 Pro มีราคาอยู่ที่ $2.00 ต่อโทเคนอินพุตหนึ่งล้านโทเคน, $0.20 สำหรับแบบแคช และ $12.00 ต่อโทเคนเอาต์พุตหนึ่งล้านโทเคน สำหรับบริบทที่ต่ำกว่า 200,000 โทเคน และเพิ่มขึ้นเป็น $4.00 / $0.40 / $18.00 เมื่อเกินกว่านั้น — อัตราที่ Goo​gle เผยแพร่เอง

รายละเอียดเรื่องราคานี้คือจุดที่การตัดสินใจในทางปฏิบัติเกิดขึ้น เพราะช่องว่างของต้นทุนระหว่างโหมดการให้เหตุผลนั้นไม่น้อยเลย บน ARC-AGI-2 มีรายงานว่า Deep Think ทำได้ประมาณ 85% ด้วยต้นทุนประมาณ $13.62 ต่องาน เทียบกับ Gemini 3.1 Pro ที่ 77% ด้วยต้นทุนประมาณ $0.96 ต่องาน คุณกำลังจ่ายแพงขึ้นราวสิบสี่เท่าเพื่อแลกกับแปดคะแนน นั่นเป็นข้อแลกเปลี่ยนที่สมเหตุสมผลสำหรับปัญหาวิจัยยาก แต่ไม่สมเหตุสมผลสำหรับเส้นทางโปรดักชันที่ส่วนใหญ่จัดการงานทั่วไป — และคำตอบที่ถูกต้องมักคือคุณต้องการให้ทั้งสองเข้าถึงได้จากที่เดียวกัน มากกว่าจะเป็นการตัดสินใจเรื่องการสมัครสมาชิกที่ทำไว้ล่วงหน้า

A screenshot of the OrcaRouter models catalogue at www.orcarouter.ai/models, captured September 16 2026 in English, showing the header 'Models — 198 models · 15 providers · one API key, one bill', a 'How to call any model' card with an OpenAI-compatible curl example, and model cards including Google: Gemini 3.8 Flash at $0.750 per million input tokens, $0.075 cache read and $3.75 output, alongside Qwen3.8 Max, GPT-6 Astra and Claude Fable 5.1.

นั่นคือเหตุผลที่สนับสนุนการ Routing ด้วยคีย์เดียว โมเดล Gemini ที่เรียกใช้งานได้ในวันนี้ — Gemini 3.1 Pro Preview, Gemini 3.8 Flash ในราคา $0.750 ต่อล้านโทเคนอินพุต พร้อมการอ่านแคชที่ $0.075 รวมถึงโมเดลอื่น ๆ ในตระกูลเดียวกัน — ล้วนอยู่ในแค็ตตาล็อกของ OrcaRouter ที่มี 198 โมเดลจาก 15 ผู้ให้บริการ ซึ่งอยู่เบื้องหลังปลายทางเดียวที่เข้ากันได้กับ OpenAI เราไม่บวกราคาเพิ่มจากราคาที่ผู้ให้บริการประกาศไว้ ดังนั้นหาก Google เปลี่ยนราคา ฝั่งเราก็อัปเดตให้ทันทีในวันเดียวกัน แทนที่จะต้องรอเจรจาสัญญาใหม่ การ Failover อัตโนมัติทำให้โมเดลที่ยังไม่ผ่านการพิสูจน์หรือเป็นพรีวิวสามารถอยู่ในเส้นทาง Routing ได้โดยไม่ต้องแบกรับเส้นทางการใช้งานจริงไว้ลำพัง ซึ่งเป็นท่าทีที่เหมาะสมพอดีกับโมเดลที่หลุดออกมา: ลองใช้งาน เก็บทางเลือกสำรองไว้ และไม่ต้องเปลี่ยนแปลงอย่างอื่น ส่วน DSL สำหรับ Routing ช่วยประกอบหลายโมเดลเข้าเป็นการเรียกครั้งเดียว และ Model Fusion จะรันเป็นคณะผู้ตัดสินแล้วรวมคำตอบเข้าด้วยกัน ทั้งสองอย่างมีประโยชน์เมื่อคำถามเป็นเรื่องยาก และจุดยืนที่ซื่อตรงคือคุณต้องการความเห็นจากมากกว่าหนึ่งโมเดล

เพื่อให้ชัดเจนเกี่ยวกับขอบเขต: OrcaRouter ไม่ได้โฮสต์ Deep Think mathematica และไม่ได้โฮสต์ Gemini 3.1 Deep Think สิ่งเหล่านี้ไม่ได้อยู่ในแค็ตตาล็อกของเรา และไม่มีสิ่งใดตรงนี้ที่ควรบ่งชี้เป็นอย่างอื่น สิ่งที่อยู่ในแค็ตตาล็อกคือเลเยอร์ Gemini ที่อยู่ใต้สิ่งเหล่านั้น

อะไรจะทำให้เรื่องนี้เปลี่ยนจากแค่การรั่วไหลไปเป็นข่าว

สี่สิ่งนี้ เรียงตามลำดับคร่าว ๆ ว่ามันจะขับเคลื่อนเรื่องราวได้มากแค่ไหน

การ์ดโมเดล การเปิดตัว Deep Think ของ Goo​gle มาพร้อมกับการประเมินที่เผยแพร่ การ์ดที่มีตัวเลขบน MILLENNIUM-BENCH หรือ IMO-ProofBench Advanced ซึ่งรันภายใต้เงื่อนไขที่ระบุไว้ จะเปลี่ยนสิ่งนี้จากสตริงบิลด์ให้กลายเป็นโมเดล

จุดปลายทาง สัญญาณที่ชัดเจนที่สุดคือการที่ Mathematica ปรากฏอยู่ใน Gemini API หรือในรายการโมเดลของ Google ไม่ว่าจะใช้ชื่อใดก็ตาม จนกว่าสิ่งนั้นจะเกิดขึ้น ก็ยังไม่มีใครเรียกใช้งานมันได้ และก็ยังไม่มีราคาใดให้เปรียบเทียบ

เส้นทางผ่านสถาบัน แนวปฏิบัติของ Google ในปี 2025 คือการมอบโมเดลคณิตศาสตร์ที่แข็งแกร่งที่สุดให้แก่นักคณิตศาสตร์กลุ่มที่คัดเลือกไว้ก่อน แล้วจึงปล่อยเวอร์ชันที่เร็วกว่าให้สาธารณชนในภายหลัง การเปิดตัวแบบเงียบ ๆ แก่นักวิจัยจะสอดคล้องกับแนวปฏิบัติดังกล่าว และมีแนวโน้มว่าจะปรากฏให้เห็นก่อนการประกาศเปิดตัวผลิตภัณฑ์ใด ๆ

การทดสอบโดยบุคคลที่สาม เมื่อพิจารณาว่าเกณฑ์วัดที่กล่าวถึงนี้ทำคะแนนได้สูงสุดเพียงราว 24% pass@1 สำหรับโมเดลที่ดีที่สุดที่มีอยู่ในปัจจุบัน และรูปแบบความล้มเหลวอันเป็นเอกลักษณ์ของมันคือการปั้นข้อมูลขึ้นมาอย่างมั่นใจ การประเมินโดยอิสระจึงเป็นหลักฐานเดียวที่เชื่อถือได้ ทุกตัวเลขในบทความนี้ที่แสดงเป็นตัวเลขนั้น ไม่ว่าจะเป็นของ Google เอง มีรายงานจากบุคคลที่สาม หรือถูกระบุไว้อย่างชัดเจนว่ายังไม่ได้รับการยืนยัน — และไม่มีตัวเลขใดเลยที่มาจากโมเดลที่ใครก็ตามนอก DeepMind เคยรัน

สิ่งเดียวที่คุ้มค่าที่จะทำตอนนี้คือไม่รอ ช่องว่างระหว่างโหมดคณิตศาสตร์ของ Google กับโมเดลพื้นฐานของมันคือต้นทุนต่างกัน 14 เท่า และความแม่นยำต่างกัน 8 จุด และการแลกเปลี่ยนนี้ก็พร้อมใช้งานจริงแล้ว; คุณทำได้วันนี้ด้วย Gemini 3.1 Pro Preview บนคีย์เดียว และมี fallback รองรับอยู่ข้างหลัง เมื่อ Mathematica มี model card คุณจะอยากตัดสินใจไว้ก่อนแล้วว่าจะจัดเส้นทางปัญหายากอย่างไร — และคำตอบของเรื่องนั้นจะไม่ขึ้นอยู่กับว่าโมเดลที่รั่วไหลออกมานั้นกลายเป็นอย่างไรในท้ายที่สุด

การเปรียบเทียบในบทความนี้2

ตรวจพบจากบทความนี้ · เบนช์มาร์ก: Artificial Analysis · อัปเดตทุกวัน

© 2026 OrcaRouter

สำหรับผู้ให้บริการ

ให้บริการแพลตฟอร์มการอนุมานอยู่หรือไม่ นำโมเดลของคุณขึ้น OrcaRouter

providers@orcarouter.ai

เข้าร่วมคอมมูนิตี้ของเรา

Discordsupport@orcarouter.aiXGitHubYouTube