Một thẻ tiêu đề hero được tạo ghi 'Deep Think Mathematica' với phụ đề 'Mô hình toán học bị rò rỉ của Google, được giải thích', phía trên bốn chip trạng thái bo tròn ghi 'Chưa phát hành', 'Bản dựng thử nghiệm nội bộ', 'Ngữ cảnh ~1M, theo báo cáo' và 'Chưa công bố benchmark', và một dòng chân trang ghi 'Rò rỉ, không phải ra mắt. Google chưa xác nhận mô hình này tồn tại.'
Guides & Insights

Deep Think Mathematica: Bên trong mô hình toán học bị rò rỉ của Google, và tiếng thét trong dấu vết suy luận của nó

Tác giả

Rowan Sterling

Ngày đăng

Mô hình mới nhất · 20Xem tất cả mô hình
Benchmark: Artificial Analysis · cập nhật hằng ngày
Quay lại tất cả bài viết

Điều tiết lộ nhiều nhất về Deep Think Mathematica — mô hình toán học của Goo​gle vừa lộ diện trong đợt thử nghiệm nội bộ tuần này — là ở chỗ nó có vẻ hay hét lên. Một tài khoản X đăng bài dưới tên "Lyra" đã đưa ảnh chụp màn hình nhật ký suy luận nội bộ lên mạng vào ngày 16 tháng 9 năm 2026, và những dấu vết này khi đọc lên giống một người đang có bước đột phá bên bảng trắng hơn là một trợ lý chứng minh: "Khoan đã." "Ôi trời ơi." Và, sau khi rút gọn thành công một phương trình, chuỗi ÔI MẸ ƠI TOÁN HỌC!!!!!!!!!!!!!!!!!!!!!!!! Phản ứng đến ngay lập tức và đầy trìu mến — Goo​gle dường như đã tạo ra một AI thực sự yêu toán học. Phản ứng đó cũng là điều ít hữu ích nhất để rút ra từ vụ rò rỉ. Chưa có gì ở đây được Goo​gle xác nhận. Không có thẻ mô hình, không có ID mô hình trong bất kỳ danh sách đã công bố nào, không có giá, và không có ngày phát hành. Những gì tồn tại là một chuỗi build, hai nhãn nội bộ, một ngân sách token, một bộ ảnh chụp màn hình, và điểm so sánh đã phát hành tốt nhất trong cùng dòng, Gem​ini 3.1 Deep Think — một mô hình bạn thực sự có thể dùng ngay hôm nay, và là thước đo mà vụ rò rỉ này cuối cùng sẽ được đánh giá dựa theo.

Vậy nên hãy coi mọi thứ dưới đây đúng như bản chất của nó: một danh sách luận điểm có kèm nguồn cho từng mục, được sắp xếp theo mức độ sức nặng mà nó sẽ phải chịu.

Điều mà tín hiệu thực sự nói — và dấu hiệu nằm ngay phía trên nó

Bản thân tín hiệu đến từ @testingcatalog, một tài khoản có thành tích khá tốt về Goo​gle nói riêng: nó đã hé lộ các kế hoạch sử dụng máy tính trên máy tính để bàn của Gem​ini, và nó đã phát hiện thẻ xem trước sớm của Nano Banana 2 dưới tên nội bộ "GEMPIX2" trước khi Goo​gle nói bất cứ điều gì. Bài đăng ngày 16 tháng 9 của nó mang hai tuyên bố có chất lượng rất khác nhau.

Tuyên bố thứ hai chính là mô hình. Một "Deep Think Mathematica" mới đã được phát hiện trong quá trình thử nghiệm nội bộ, được mô tả là bản kế thừa về tinh thần của mô hình Deep Think IMO mà Google đã gửi đến các tổ chức được chọn vào năm ngoái.

Tuyên bố đầu tiên chính là dấu hiệu tiết lộ, và đó là điều đáng để hiểu: "Khi Gem​ini sắp thay đổi nền của nó, có chuyện lớn đang được chuẩn bị." Đó không phải là sự thật về một mô hình. Đó là một quy tắc kinh nghiệm của cộng đồng về cách Goo​gle dàn dựng các đợt phát hành — quan sát rằng một lần làm mới rõ thấy trên bề mặt ứng dụng Gem​ini đã diễn ra trước một số thông báo lớn hơn của Goo​gle. Những quy tắc kinh nghiệm như vậy có thành tích thực tế và không có sức mạnh dự đoán. Một lần làm mới giao diện người dùng không phải là một mô hình.

Cả hai tuyên bố đều chưa được xác minh. Không cái nào là một công bố, và bài viết này không coi đó là một công bố.

Giải mã chuỗi build, vì đó là thứ cụ thể nhất ở đây

Mảnh bằng chứng khó chối cãi nhất đang được lan truyền là một mã định danh bản dựng được cho là thuộc về các bản log bị rò rỉ:

Đường dẫn build —models/deepthink-mathematica-tf-raw-thoughts, được AI Sight báo cáo vào ngày 16 tháng 9 năm 2026, cùng với các ảnh chụp màn hình.

Chuỗi đó đáng để đọc kỹ, và đó là chỗ mà hầu hết các bài viết dừng lại. Ba phần của nó mang thông tin.

"deepthink" — đặt model vào dòng Deep Think thay vì dòng Gem​ini chủ lực. Điều đó quan trọng vì Deep Think là một chế độ trong các sản phẩm mà Goo​gle đã phát hành, chứ không phải một họ riêng biệt: đó là nhánh suy luận song song, chạy nhiều lời giải ứng viên cùng một lúc.

"tf" —trong ngữ cảnh, là từ viết tắt của "Teamfood", nhãn thứ hai trong hai nhãn nội bộ được báo cáo cùng với bản dựng. Trong từ vựng nội bộ của Goo​gle, đó là một tên gọi ở giai đoạn đầu, giai đoạn dogfooding: do nhân viên sử dụng, chứ không phải khách hàng.

"raw-thoughts" — phần thú vị nhất, và là chìa khóa dẫn đến sự ồn ào. Điều này biểu thị cấu hình chuỗi suy nghĩ chưa được lọc — lập luận của mô hình được phát ra mà không qua tinh chỉnh phép lịch sự, ràng buộc phong cách hay lọc đầu ra. Một bản dựng "raw thoughts" không phải là sản phẩm. Đó là thứ các kỹ sư nhìn vào khi họ muốn xem mô hình đang làm gì trước khi bất kỳ ai làm cho nó trở nên chỉn chu để trình bày.

Nhãn thứ hai được báo cáo là UNSTABLE_EXPERIMENTAL, gần như đã tự giải thích và chỉ về cùng một hướng như "Teamfood": còn sớm, nội bộ, không dành cho khách hàng.

Hai số liệu nữa được gán cho cùng các bản ghi nhật ký đó và chỉ có một nguồn duy nhất, nên hãy xem chúng một cách dè dặt:

Cửa sổ ngữ cảnh — khoảng 1.000.000 token, tương ứng với cửa sổ 1M mà Goo​gle đã cung cấp trên các mô hình Gem​ini tiên phong của mình.

Giới hạn đầu ra — 65,536 token, mà đối với một mô hình suy luận thì có nghĩa là một quá trình cân nhắc rất dài trước khi đưa ra câu trả lời.

Đó là toàn bộ bề mặt kỹ thuật của vụ rò rỉ. Một đường dẫn build, hai nhãn giai đoạn, một cửa sổ ngữ cảnh và một giới hạn đầu ra. Nó đủ để nói rằng một thứ tồn tại trong một giàn kiểm thử. Nó không đủ để nói nó đạt điểm bao nhiêu.

A generated two-column scoreboard titled 'Deep Think Mathematica vs Gemini 3.1 Deep Think — the scoreboard'. Left column 'Deep Think Mathematica (leaked)' reads Status: internal test build; Base model: Gemini 3.1 Pro, reported; Context window: ~1M tokens, reported; Output limit: 65,536 tokens, reported; Benchmarks: none published; Access: no endpoint. Right column 'Gemini 3.1 Deep Think' reads Status: shipping now; Base model: Gemini 3.1 Pro; Context window: 1M tokens; Output limit: not published; Benchmarks: ARC-AGI-2 84.6%, vendor; Access: top tier plus invited API. Footer reads 'Mathematica figures are single-source and unconfirmed; Google has not acknowledged the model. Gemini 3.1 Deep Think figures are Google's own, unreproduced.'

Tại sao một dấu vết suy luận gào thét lại là bằng chứng yếu hơn vẻ ngoài của nó

Dấu chấm than là lý do khiến tin rò rỉ này lan truyền, và cũng là lý do phải cẩn thận với nó.

Lời giải thích được báo cáo là tầm thường và khớp chính xác với chuỗi build: một cấu hình suy luận không được lọc, chạy ở nhiệt độ sinh cao, với các lớp lịch sự và định dạng bị loại bỏ. Khi bạn loại bỏ tinh chỉnh khiến một mô hình nghe có vẻ điềm tĩnh, bạn không tiết lộ linh hồn của nó — mà tiết lộ bộ lấy mẫu của nó. Đầu ra đầy dấu chấm than chính là hình dạng của một mẫu nhiệt độ cao từ một phần tiếp nối đầy phấn khích. Cách đọc cảm xúc là một tạo tác của cấu hình, không phải là một phát hiện về mô hình.

Điểm sâu xa hơn nằm ở chỗ chuỗi suy nghĩ gì. Một dấu vết suy luận là văn bản được tạo ra mà tình cờ hữu ích cho việc giải quyết vấn đề. Đọc một bản ghi của nó và suy ra một trạng thái nội tại — sự nhiệt tình, thất vọng, vui sướng — là cùng một lỗi phạm trù như suy ra rằng một chiếc máy tính thấy hài lòng khi nó tạo ra một số nguyên gọn gàng. Điều này đáng được nói thẳng ra vì các bài đưa tin bằng tiếng Trung về vụ rò rỉ này nghiêng hẳn vào trò đùa (“等等”, “我的天”) và một số bài tiếng Anh để trò đùa đó cứng lại thành một mô tả tính cách của mô hình.

Không điều nào trong số đó khiến dấu vết trở nên vô giá trị. Việc phơi bày một bản dựng tư duy thô là bằng chứng thực sự về một thực hành kỹ thuật có thật — bạn chỉ ghi lại lý luận chưa được lọc khi đang gỡ lỗi chính lý luận đó, và đó chính là điều bạn làm với một mô hình mà toàn bộ tuyên bố giá trị của nó nằm ở việc nó suy nghĩ xuyên suốt các vấn đề khó tốt đến mức nào. Và vẫn chưa được kiểm chứng liệu các dấu vết đó đến từ việc gỡ lỗi có chủ đích hay việc ghi nhật ký ngoài ý muốn.

Tóm tắt trung thực: những câu cảm thán cho bạn biết rằng có tồn tại một cấu hình suy luận thô. Chúng không nói cho bạn biết gì về năng lực toán học.

Millennium Bench không phải là Millennium Prize Problems

Nhiều bài viết về vụ rò rỉ này, bao gồm các bản tóm tắt tổng hợp lan truyền ngày 16 tháng 9, đều nói mô hình đang "nhắm đến Millennium Bench" và chỉ dừng ở đó. Cái tên này đang vô tình tạo ra tác dụng, bởi nó chỉ cách một từ khỏi một thứ nổi tiếng hơn nhiều và cũng đầy hàm ý hơn nhiều — bảy Bài toán Thiên niên kỷ của Viện Toán học Clay, mỗi bài có tiền thưởng 1 triệu đô la, và là chủ đề của một tuyên bố riêng, hoàn toàn chưa được xác nhận trong tháng này về OpenAI và một chứng minh Navier–Stokes. Một báo cáo từ luồng đó nói rằng Google đã xây dựng một AI "giải" được bài toán trong 88 giờ. Clay vẫn liệt kê nó là bài toán mở.

Đây là những thứ khác nhau, và việc gộp chúng lại với nhau sẽ làm phóng đại mức độ rò rỉ này lên đáng kể.

MILLENNIUM-BENCH, như được giới thiệu trong bài báo ICLR 2026 "Nơi suy diễn đổ vỡ: Chẩn đoán những thất bại trong lý luận ở toán học cấp độ nghiên cứu", là một bộ đánh giá gồm các bài toán cấp độ nghiên cứu do chuyên gia tuyển chọn, trải rộng trên chín lĩnh vực, bao gồm vật lý toán học, tô-pô và xác suất lý thuyết độ đo. Nó được xây dựng để đòi hỏi suy diễn nhiều bước liên tục vượt xa toán học thi đấu.

Kết quả nổi bật của nó là phần quan trọng để đọc bản rò rỉ này. Trên năm mô hình tiên tiến, chạy 100 lần cho mỗi bài toán, mô hình mạnh nhất đạt tối đa 24% pass@1 và 39% pass@3. Chẩn đoán của bài báo về cách các mô hình thất bại hữu ích hơn các điểm số: ảo giác khung lý thuyết, trong đó mô hình bịa ra một lý thuyết không thể áp dụng rồi lập luận mạch lạc bên trong nó, và các định lý ngụy tạo, trong đó nó trích dẫn những kết quả không tồn tại, kèm cả tên tác giả và số hiệu định lý được ngụy tạo.

Hãy cùng lúc ghi nhớ cả hai điều đó. Một benchmark mà ở đó mô hình tốt nhất chỉ đạt tới gần một phần tư số bài toán, với kiểu thất bại đặc trưng là sự bịa đặt đầy tự tin, lại chính là loại benchmark mà ảnh chụp màn hình bị rò rỉ ít có khả năng chứng minh được điều gì nhất. Một mô hình ầm ĩ trong khi làm việc là mô hình mà bạn sẽ muốn kết quả của nó được chấm bởi ai đó không phải là tác giả của nó.

Những gì Goo​gle thực sự đã tung ra trong dòng này

Rò rỉ chỉ có thể được hiểu khi đối chiếu với hồ sơ đã công bố, bởi câu chuyện toán học của Google là một tiến trình đã được ghi chép lại, và cái tên bị rò rỉ đang vay mượn uy tín từ đó.

Tháng 7 năm 2025 —một phiên bản tiên tiến của Gemini Deep Think đã đạt chuẩn huy chương vàng tại Olympic Toán học Quốc tế, giải được năm trong sáu bài toán, đạt 35 trên 42 điểm, được các quan chức IMO chấm theo đúng tiêu chuẩn áp dụng cho học sinh. Demis Hassabis lưu ý rằng hệ thống này hoạt động xuyên suốt bằng ngôn ngữ tự nhiên mà không cần chuyển đổi sang cú pháp hình thức.

Ngày 1 tháng 8 năm 2025 — Goo​gle đã phát hành Gem​ini 2.5 Deep Think công khai, nhưng không phải mô hình vàng. Phiên bản được phát hành được Goo​gle mô tả là một biến thể nhanh hơn, tối ưu hóa hơn, đạt hiệu suất cấp Đồng trên chuẩn đánh giá IMO 2025 theo đánh giá nội bộ của Goo​gle. Nó được giới hạn cho hạng người dùng cao cấp nhất. Đồng thời, Goo​gle đã trao mô hình vàng đầy đủ cho một nhóm chuyên gia toán học và học giả được chọn lọc — những "tổ chức được chọn" mà tín hiệu bị rò rỉ đang nhắc tới.

Tháng 12 năm 2025 — Gemini 3 Deep Think, với một bước nhảy vọt lớn giữa các thế hệ, Google báo cáo đạt 45,1% trên ARC-AGI-2 khi có thực thi mã và 41,0% trên Humanity's Last Exam mà không dùng công cụ.

Và giờ đây — Gemini 3.1 Deep Think, được xây dựng trên nền Gemini 3.1 Pro, được bán qua gói đăng ký tiêu dùng cao cấp nhất và một chương trình API chỉ dành cho khách được mời. Những con số do chính Goo​gle công bố — vốn do nhà cung cấp tự báo cáo và chưa được tái lập một cách độc lập — đặt nó ở mức 84,6% trên ARC-AGI-2, 48,4% trên Humanity's Last Exam khi không dùng công cụ và 53,4% khi có tìm kiếm cùng mã, 81,5% tại IMO 2025, và Elo Codeforces là 3455.

Hai nỗ lực liền kề cũng quan trọng. Aletheia, một tác nhân nghiên cứu toán học được xây dựng trên Gemini Deep Think, được các bên thứ ba báo cáo đạt khoảng 95,1% trên IMO-ProofBench Advanced — và đáng chú ý không phải vì con số đó mà vì được thiết kế để nói "không tìm thấy lời giải" thay vì bịa ra một lời giải; trong thử thách FirstProof tháng 2 năm 2026, nó đã giải được 6 trong 10 và từ chối phần còn lại. Và một thiết lập AI Co-Mathematician chạy trên Gemini 3.1 Pro được cho là đã nâng hiệu suất FrontierMath Tier 4 từ 19% lên 47,9%.

A screenshot of Google DeepMind's official Gemini 3.1 Deep Think model page at deepmind.google/models/gemini/deep-think, captured September 16 2026 in English, showing the title 'Gemini 3.1 Deep Think', the subtitle 'Best for modern challenges across science, research and engineering', a 'Try in Gemini' button, the blue DeepMind model illustration, and the opening line 'Our most specialized reasoning mode is built on top of Gemini 3.1 Pro'.

Con số cuối cùng đó đáng để dừng lại suy ngẫm, vì nó là lập luận mạnh nhất chống lại việc đọc rò rỉ này theo cách nó đã được viết lên. Mức tăng từ 19% lên 47.9% ở toán học cấp nghiên cứu, đạt được nhờ một scaffold bao quanh một mô hình Gemini tổng quát thay vì một checkpoint mới, cho thấy những cải thiện lớn nhất gần đây trong hiệu năng toán học của Google đến từ harness bao quanh mô hình, chứ không phải từ một mô hình chuyên biệt bên dưới nó. Điều đó không có nghĩa Mathematica là một scaffold. Điều đó có nghĩa là gánh nặng chứng minh cho “đây là một mô hình toán học chuyên dụng mới” cao hơn mức mà các bài đưa tin đã giả định.

Một mẩu bối cảnh nữa nằm bao trùm lên tất cả: DeepMind tái cấu trúc vào tháng 8 năm 2026, với việc Demis Hassabis chuyển sang vai trò chủ tịch. Những rò rỉ từ bên trong một phòng thí nghiệm đang tái tổ chức không đáng tin cậy hơn rò rỉ từ một phòng thí nghiệm ổn định, và các bài đưa tin đã không coi thời điểm đó là có liên quan. Có thể nó có liên quan.

Mô hình hay giàn giáo? Câu hỏi mà vụ rò rỉ này không giải đáp.

Đang có một cuộc tranh luận sôi nổi trong các bài đưa tin về việc liệu Mathematica có phải là một mô hình mới hay không. Một phe chỉ vào tiền tố "deepthink" trong chuỗi build và coi đó là một checkpoint riêng. Phe còn lại — mà bài viết trước đây của chính chúng tôi về tin đồn Deep Think V3 cũng thuộc về — cho rằng các kết quả toán chuyên biệt của Google đến từ những khung tác nhân bao quanh các mô hình Gemini tổng quát, và rằng không cần có một mô hình toán riêng để những con số đó là thật.

Chuỗi build là một điểm nhỏ có lợi cho phe thứ nhất: models/deepthink-mathematica-tf-raw-thoughts đặt tên cho một mô hình, và "raw-thoughts" mô tả một cấu hình mô hình chứ không phải một lớp harness. Một scaffold sẽ không cần phần suy luận của nó ở dạng chưa lọc để gỡ lỗi; một mô hình mà suy nghĩ chính là sản phẩm thì sẽ cần. Đó là một tín hiệu thực sự.

Đó không phải là một căn cứ mang tính quyết định. Các harness cũng có cấu hình, và một chuỗi đường dẫn nội bộ được viết bởi người thiết lập logging, chứ không phải bởi một lược đồ. Điều có thể giải quyết dứt điểm lại là thứ mà không ai có: một thẻ mô hình, một endpoint, hoặc một đánh giá chuẩn được thực hiện bởi người không có lợi ích liên quan đến câu trả lời.

Những gì bạn thực sự có thể gọi hôm nay

Không điều nào trong số này thay đổi bất cứ thứ gì bạn có thể đưa vào production trong tuần này, và cần phải thẳng thắn về khoảng cách đó. Deep Think mathematica không có trên bất kỳ API nào. Gem​ini 3.1 Deep Think cũng không được bán theo token — nó bị khóa sau gói đăng ký tiêu dùng cao cấp nhất, được niêm yết từ $99.99 đến $199.99 một tháng tùy theo gói, cộng thêm một chương trình API chỉ dành cho người được mời. Không có mức giá công bố trên mỗi triệu token cho nó.

Mô hình cơ sở mà nó được cho là xây dựng dựa trên lại là một câu chuyện khác. Gemini 3.1 Pro có giá 2,00 USD cho mỗi triệu token đầu vào, 0,20 USD cho token đã lưu trong bộ nhớ đệm, và 12,00 USD cho mỗi triệu token đầu ra đối với ngữ cảnh dưới 200.000 token, tăng lên 4,00 / 0,40 / 18,00 USD khi vượt ngưỡng đó — mức giá do chính Goo​gle công bố.

Chi tiết về giá đó chính là nơi quyết định thực tiễn được đưa ra, bởi khoảng cách chi phí giữa các chế độ suy luận không hề nhỏ. Trên ARC-AGI-2, Deep Think được báo cáo đạt khoảng 85% với chi phí khoảng 13,62 USD cho mỗi tác vụ, so với Gemini 3.1 Pro đạt 77% với khoảng 0,96 USD cho mỗi tác vụ. Bạn đang trả khoảng gấp mười bốn lần để đổi lấy tám điểm. Đó là một sự đánh đổi có thể biện minh cho một bài toán nghiên cứu khó, và là một sự đánh đổi không thể biện minh cho một lộ trình sản xuất chủ yếu xử lý công việc thông thường — và câu trả lời đúng thường là bạn muốn cả hai đều có thể tiếp cận từ cùng một nơi, thay vì đưa ra quyết định đăng ký thuê bao từ trước.

A screenshot of the OrcaRouter models catalogue at www.orcarouter.ai/models, captured September 16 2026 in English, showing the header 'Models — 198 models · 15 providers · one API key, one bill', a 'How to call any model' card with an OpenAI-compatible curl example, and model cards including Google: Gemini 3.8 Flash at $0.750 per million input tokens, $0.075 cache read and $3.75 output, alongside Qwen3.8 Max, GPT-6 Astra and Claude Fable 5.1.

Đó chính là trường hợp định tuyến trên một khóa. Các mô hình Gem​ini có thể gọi được ngay lúc này — Gemini 3.1 Pro Preview, Gemini 3.8 Flash ở mức $0.750 cho mỗi triệu token đầu vào cùng $0.075 cho mỗi lượt đọc từ cache, và phần còn lại của dòng sản phẩm — đều nằm trong danh mục 198 mô hình đến từ 15 nhà cung cấp của OrcaRouter, phía sau một endpoint tương thích với OpenAI. Không có phụ phí trên giá niêm yết của nhà cung cấp, nên khi Google đổi giá thì phía chúng tôi cập nhật ngay trong cùng ngày, thay vì phải chờ đàm phán lại hợp đồng. Cơ chế chuyển đổi dự phòng tự động nghĩa là một mô hình chưa được kiểm chứng hoặc bản xem trước có thể nằm trong một tuyến mà không phải tự mình gánh vác đường đi production, đúng tư thế mà một mô hình bị rò rỉ xứng đáng có: cứ thử, giữ một phương án dự phòng, không thay đổi gì khác. DSL định tuyến kết hợp nhiều mô hình vào một lệnh gọi, còn tính năng hợp nhất mô hình thì chạy một hội đồng và tổng hợp các câu trả lời — cả hai đều hữu ích khi câu hỏi khó và vị thế trung thực là bạn muốn có ý kiến của nhiều hơn một mô hình.

Để nói rõ về ranh giới: OrcaRouter không lưu trữ Deep Think mathematica, và nó không lưu trữ Gem​ini 3.1 Deep Think. Những thứ đó không nằm trong danh mục của chúng tôi và không có gì ở đây nên gợi ý điều ngược lại. Thứ có trong danh mục là lớp Gem​ini bên dưới chúng.

Điều gì sẽ biến chuyện này từ một vụ rò rỉ thành tin tức?

Bốn điều, theo thứ tự tương đối về mức độ chúng sẽ tác động đến câu chuyện.

Thẻ mô hình. Các bản phát hành Deep Think của Goo​gle luôn đi kèm với những đánh giá đã được công bố. Một thẻ mô hình với các con số trên MILLENNIUM-BENCH hoặc IMO-ProofBench Advanced, được chạy trong những điều kiện đã nêu rõ, sẽ biến thứ này từ một chuỗi bản dựng thành một mô hình.

Một endpoint. Tín hiệu rõ ràng nhất sẽ là việc Mathematica xuất hiện trong API Gemini hoặc trong danh sách mô hình của Google dưới bất kỳ tên nào. Cho đến khi điều đó xảy ra, không ai có thể gọi nó và không có mức giá nào để so sánh.

Con đường thể chế.Cách làm của Goo​gle trong năm 2025 là trao mô hình toán học mạnh nhất cho một số nhà toán học được chọn trước, rồi sau đó mới cung cấp cho công chúng một biến thể nhanh hơn. Một đợt triển khai âm thầm dành cho các nhà nghiên cứu sẽ phù hợp với tiền lệ đó và nhiều khả năng sẽ lộ diện trước bất kỳ thông báo sản phẩm nào.

Một lượt chạy của bên thứ ba.Xét việc bộ đánh giá đang được bàn tới chỉ đạt tối đa khoảng 24% pass@1 ở những mô hình tốt nhất hiện có, và kiểu thất bại đặc trưng của nó là bịa đặt một cách đầy tự tin, thì một đánh giá độc lập chính là bằng chứng duy nhất có thể đứng vững. Mọi số liệu trong bài viết này, hễ có kèm con số, đều hoặc là của chính Goo​gle, hoặc do bên thứ ba báo cáo, hoặc được ghi chú rõ ràng là chưa được kiểm chứng — và không con số nào trong đó đến từ một mô hình mà bất kỳ ai ngoài DeepMind đã chạy.

Điều duy nhất đáng làm lúc này không phải là chờ đợi. Khoảng cách giữa chế độ toán học của Google và mô hình cơ sở của nó là gấp mười bốn lần về chi phí và tám điểm về độ chính xác, và sự đánh đổi đó đã hiện hữu; bạn có thể thực hiện ngay hôm nay với Gemini 3.1 Pro Preview trên một khóa và một phương án dự phòng phía sau. Khi Mathematica có thẻ mô hình, bạn sẽ muốn đã quyết định cách định tuyến các bài toán khó — và câu trả lời cho điều đó sẽ không phụ thuộc vào việc mô hình bị rò rỉ hóa ra là gì.

So sánh trong bài viết này1

Phát hiện từ bài viết này · Benchmark: Artificial Analysis · cập nhật hằng ngày