Thẻ tiêu đề hero ghi "722 bản thảo toán học của OpenAI" với tiêu đề phụ "Mô hình đằng sau chúng không có tên, không có giá và không có API", một huy hiệu màu hổ phách ghi "MÔ HÌNH CHƯA PHÁT HÀNH - CHỈ CÓ KẾT QUẢ", và ba thẻ: "Những gì đã phát hành: 722 bản thảo, 372 nhóm", "Những gì chưa phát hành: không có model card, không có mã định danh, không có ngày", và "OpenAI nói gì: đang nỗ lực phát hành mô hình".
Guides & Insights

722 bản thảo toán học của OpenAI: Mô hình đằng sau chúng không có tên, không có giá và không có API

Tác giả

Magnus Corvin

Ngày đăng

Mô hình mới nhất · 20Xem tất cả mô hình →
Benchmark: Artificial Analysis · cập nhật hằng ngày
Quay lại tất cả bài viết

Vào 21:47 UTC ngày 6 tháng 10 năm 2026, một kho lưu trữ có tên openai/math xuất hiện trên GitHub mà không có mô tả và chỉ với một commit khởi tạo. Mười bốn phút sau, Open​AI đăng nó lên X và tạo một trang đồng hành, "Chia sẻ tiến bộ AI trong toán học." Cùng nhau, hai điều đó mô tả một sự kiện chưa từng có tiền lệ: 722 bản thảo toán học, được nhóm thành 372 họ, do một mô hình biên nội bộ tạo ra mà Open​AI chưa đặt tên, chưa định giá và không thể gọi từ bất kỳ API nào. Những mô hình mà nó đứng trên là những mô hình bạn thực sự có thể tiếp cận ngày nay — GPT-6 Astra với giá 10 / 50 USD mỗi triệu token và GPT-6.1 Sol với giá 2 / 10 USD — và cả hai đều không viết nên những bài báo này. Open​AI nói rằng mô hình đã làm được điều đó vẫn đang được huấn luyện, và rằng họ đang nỗ lực "phát hành một cách có trách nhiệm" nó. Đây là những gì đã được xác minh cho đến nay, những gì chưa, và một câu hỏi mà người đọc nên rút ra từ đó.

Bắt đầu với những gì bản phát hành này không phải. Đây không phải là một đợt ra mắt mô hình: không có model card, không có mã định danh, không có cửa sổ ngữ cảnh, không có bảng đánh giá chuẩn, không có ngày tháng. Đây không phải là một bài báo: không có gì ở đây đã được bình duyệt, và OpenAI nói thẳng rằng các kết quả không có hình thức hóa bằng Lean “có thể có vấn đề”. Và đây không phải là một vụ rò rỉ — lý do bài viết này được viết theo cách đóng khung “những gì chúng ta biết đến nay” không phải vì tài liệu là bí mật, mà vì bản thân đối tượng, tức mô hình, chưa được phát hành. Mọi thứ khác bên dưới đều có thể đối chiếu với kho lưu trữ, bài đăng của chính OpenAI, và nhóm cố vấn mà OpenAI nói đã tham vấn.

Điều gì thực sự đã hạ cánh vào ngày 6 tháng 10

Kho lưu trữ này là công khai, được cấp phép theo Apache-2.0 và được viết bằng Lean. README của nó nêu rằng danh mục “chứa 722 bản thảo được tổ chức thành 372 họ”, trong đó một họ nhóm một kết quả chính cùng với các lập luận đi kèm, hệ quả hoặc chứng minh thay thế. Bản đồ bản thảo đủ chi tiết để kiểm tra: 372 họ, mỗi họ có một kết quả chính, được liệt kê cùng các bài báo cấu thành và, nếu có, một liên kết hình thức hóa bằng Lean.

Bài đăng của OpenAI bổ sung thêm các số liệu về nguồn gốc, vốn là số liệu của chính họ và không được kiểm toán độc lập:

• Các bài toán được đặt ra — khoảng 4.000, từ đó các họ đề được công bố đã được tuyển chọn

• Tính toán cho mỗi kết quả — trung bình tương đương khoảng ba giờ suy luận của ChatGPT Pro

• Tóm tắt lập luận — 10 đã được công bố, bao gồm các họ như số mũ vô tỉ của π, các giả thuyết Mahler đối xứng và tổng quát, giả thuyết hữu hạn trực tiếp của Kaplansky trong đặc số hai, công thức Mézard–Parisi cho thủy tinh spin pha loãng và hệ Vlasov–Maxwell tương đối tính ba chiều

• Chính sách sửa đổi — các phiên bản mới được đăng để đính chính, với các phiên bản trước đó vẫn được giữ để có thể truy cập

Các chủ đề trải rộng khắp bản đồ: lý thuyết số, hình học đại số và hình học phức, tổ hợp, khoa học máy tính lý thuyết, đại số toán tử, xác suất và vật lý toán học. Một số tiêu đề trong họ này thoạt nhìn là những tuyên bố cực kỳ lớn — một phản ví dụ cho giả thuyết phủ Ryser, phép nhân số nguyên dưới n log n, phép nhân ma trận với số mũ tối đa 9/4, các giả thuyết Mahler, các phản ví dụ cho Baum–Connes và Kadison–Kaplansky. Liệu một tuyên bố cụ thể có đúng hay không chính là câu hỏi mà bản phát hành này không giải đáp thay cho bạn.

Screenshot of the GitHub repository page for openai/math, created October 6, 2026, showing the README statement that the repository contains mathematical manuscripts and supporting proof artifacts produced by an internal OpenAI model, the description of 722 manuscripts organized into 372 families, and the list of ten released reasoning summaries.

Mô hình này chưa có tên, chưa được phát hành và OpenAI nói rằng nó sắp ra mắt.

README không hề mơ hồ về tác giả: “các bản thảo toán học và các tài liệu chứng minh hỗ trợ do một mô hình OpenAI nội bộ tạo ra”, với phần lớn trong số đó thu được “bằng cách sử dụng một mô hình OpenAI nội bộ chưa phát hành”. Không có tên, không có mật danh, không có kích thước. Những cái tên đang lan truyền trong các bài đưa tin khác chưa được OpenAI xác nhận, và chúng tôi sẽ không cung cấp tên nào.

Điều có thể xác định được ngày tháng là dòng thời gian quanh nó. Vào ngày 28 tháng 8 năm 2026, theo trang của OpenAI về nhóm cố vấn toán học của mình, công ty "bắt đầu huấn luyện một mô hình nội bộ mới" mà kể từ đó đã giải quyết bài toán Navier–Stokes thuộc Giải thưởng Thiên niên kỷ và, theo con số của chính OpenAI, hơn 100 bài toán mở lâu đời. Kết quả Navier–Stokes được công bố riêng vào ngày 8 tháng 9 năm 2026, khi OpenAI mô tả mô hình đằng sau nó là "có năng lực vượt trội đáng kể so với GPT-6 Astra" và cho biết quá trình huấn luyện vẫn đang diễn ra. Hai trong số các bản thảo trong tuyển tập tuần này phá vỡ quy trình chuẩn, điều đáng lưu ý vì nó có nghĩa là bản phát hành không phải một quy trình đồng nhất: công trình về miền không chứa không điểm cho hàm zeta Riemann và một chứng minh cho Giả thuyết Hodge đối với các đa tạp abel CM đã được xử lý theo cách khác, và OpenAI cho biết bài viết về zeta đã được con người biên tập để dễ đọc hơn.

Vậy thì câu quan trọng đối với bất kỳ ai đang lập kế hoạch dựa trên điều này: OpenAI viết rằng họ đang "nỗ lực phát hành một cách có trách nhiệm mô hình đã tạo ra những kết quả này." Đó là một tuyên bố về ý định, không phải một ngày cụ thể. Cho đến khi nó được phát hành, những mô hình OpenAI duy nhất mà nhà phát triển có thể gọi là những mô hình đã có trong bảng giá.

“Xác minh” có nghĩa gì ở đây — và nó dừng lại ở đâu

Đây là phần mà việc đưa tin về bản công bố nén lại thành một cụm từ, và chính nó quyết định mức độ coi trọng dành cho bất kỳ bài báo đơn lẻ nào.

OpenAI nói rõ rằng "bộ sưu tập này bao gồm các kết quả ở những giai đoạn xác minh khác nhau." Hình thức bằng chứng mạnh nhất trong gói là một bản hình thức hóa bằng Lean, cho phép máy tính kiểm tra chứng minh thay vì con người. Bản kê hình thức hóa của chính kho lưu trữ — danh mục các bài báo có kết quả chính đã được hình thức hóa — liệt kê 162 mục, vì vậy khoảng một phần năm trong số 722 bản thảo được hỗ trợ bởi một chứng minh có thể kiểm tra bằng máy trong cây công khai. OpenAI cho biết sẽ bổ sung thêm "khi chúng tôi có được chúng."

Phần lớn còn lại không được xác minh theo nghĩa đó, và OpenAI không giả vờ điều ngược lại trên toàn bộ tuyển tập: "Một số kết quả chưa được hình thức hóa có thể có vấn đề. Chúng tôi sẽ nỗ lực sửa chữa nhanh chóng mọi vấn đề như vậy." Hai chi tiết mang tính cấu trúc củng cố rằng đây là một bản phát hành được quản lý chứ không phải một bản phát hành mở — issues bị tắt trên kho lưu trữ, và pull request bị giới hạn cho cộng tác viên. Không có con đường công khai nào để phản biện một chứng minh hiện hữu.

Vậy nên, cách đọc trung thực thì hẹp hơn so với con số nổi bật mà tiêu đề gợi ra:

• Được máy kiểm chứng — 162 bản thảo với kết quả chính đã được hình thức hóa trong cây Lean công khai

• Không được máy kiểm tra — phần còn lại, mà chính OpenAI đánh dấu là có thể chứa lỗi

• Trách nhiệm của con người — không ai được nêu tên; cách diễn đạt của chính OpenAI là không một người nào hiểu được những lập luận đằng sau phần lớn những gì đã được tạo ra

• Đánh giá độc lập — không có đánh giá nào được công bố; việc lựa chọn những kết quả nào đủ “đáng kể” để đưa vào là do OpenAI thực hiện

Không có điều nào trong số đó có nghĩa là công trình sai. Điều đó có nghĩa là hiện tại, "OpenAI đã công bố 722 chứng minh" và "722 chứng minh đã được kiểm tra" là hai phát biểu khác nhau, và chỉ phát biểu đầu tiên là đúng vào thời điểm này.

Three-column infographic titled "How much of the 722 is actually checked", contrasting "Machine-checked: 162 manuscripts, formalized main result, in the public Lean tree", "Not machine-checked: the remaining majority, no Lean formalization, OpenAI says could contain issues", and "Human or independent review: none named, none published, selection made by OpenAI", with a footer reading "Figures per OpenAI's repository and post, October 6 2026".

Nhóm cố vấn đã kèm theo một điều kiện, và điều đó đã được ghi nhận

Bài đăng của OpenAI cho biết họ đã tham khảo ý kiến của Nhóm Cố vấn độc lập về Toán học và Trí tuệ nhân tạo tại Institute for Advanced Study và dựa vào “lời khuyên và khuyến nghị công khai của họ”. Những khuyến nghị đó được công bố vào ngày 29 tháng 9 năm 2026, sau khi nhóm nhận được hơn 600 phản hồi từ cộng đồng toán học, và chúng đáng được đọc trực tiếp vì nhóm này không phải là một tổ chức chỉ đóng dấu phê duyệt.

Cùng tài liệu đó mở đầu bằng việc tuyên bố rằng nhóm hoàn toàn không ủng hộ thực hành này: "một số phòng thí nghiệm AI tiên phong đang thử nghiệm các bài toán toán học nâng cao trên những mô hình độc quyền vẫn không thể tiếp cận được đối với cộng đồng khoa học rộng lớn hơn... chúng tôi không ủng hộ thực hành này, và chúng tôi yêu cầu họ dừng lại." Nhóm cũng tự mô tả mình là hoạt động độc lập, với các thành viên không được trả lương và không có quyền ra quyết định đối với OpenAI — một mô tả về mối quan hệ mà bài đăng của chính OpenAI cũng nhắc lại.

Nơi các khuyến nghị của nhóm và bản phát hành này khớp với nhau là ở quy trình: một bản đánh giá tài liệu kỹ lưỡng với các trích dẫn đến công trình đã giới thiệu những ý tưởng, các bản viết chứng minh được tạo theo phong cách chuẩn thay vì đầu ra thô của mô hình, và việc quản lý phiên bản bảo toàn các bản phát hành trước đó. Nơi chúng không khớp với nhau là ở phần mà nhóm gọi là trọng tâm — rằng một phòng thí nghiệm phát hành kết quả mà không ai hiểu nên tài trợ cho việc hiểu biết của con người phải theo sau, thông qua hội thảo, hội nghị và chương trình, và rằng công việc này vẫn do cộng đồng dẫn dắt thay vì do phòng thí nghiệm chỉ đạo. OpenAI đã cam kết tài trợ "một loạt hội thảo, hội nghị và chương trình đặc biệt xoay quanh việc hiểu các kết quả quan trọng do AI tạo ra" và nói rằng chi tiết sẽ được công bố sau. Đó là hạng mục còn bỏ ngỏ, và đó là điều cần buộc họ phải thực hiện.

Những gì bạn có thể gọi hôm nay, và định tuyến thực sự dùng để làm gì ở đây

Không có cách nào gửi yêu cầu đến mô hình đã tạo ra những bản thảo này và không nền tảng bên thứ ba nào có thể định tuyến nó — bất kỳ danh mục nào tuyên bố ngược lại đều đang mô tả một mô hình không tồn tại trong danh mục của bất kỳ ai. Các mô hình OpenAI đang được vận hành là dòng GPT-6 đang hoạt động và các con số của chúng nằm trên bảng giá chứ không phải được suy đoán:

• GPT-6 Astra — 10 USD / 50 USD mỗi triệu token, 1 USD đọc cache; hạng ngữ cảnh dài trên 272K token lời nhắc ở mức 20 USD / 75 USD; ngữ cảnh 1,05M token, đầu ra tối đa 128K

• GPT-6.1 Sol — $2 / $10 mỗi triệu token, $0.10 cho mỗi lần đọc bộ đệm; phân tầng ngữ cảnh dài tương tự ở mức $4 / $15; ngữ cảnh 1.05M token, đầu ra tối đa 128K

Cả hai đều nằm trong danh mục OrcaRouter, và đây chính là điểm thực tế đối với bất kỳ ai đọc bản công bố này như một tín hiệu về năng lực: những mô hình bạn được phép sử dụng ngày hôm nay cũng chính là những mô hình mà các prompt của bạn đã được định hình xoay quanh, và khoảng cách giữa chúng với mô hình nội bộ chính xác là khoảng cách mà OpenAI đang đề nghị các nhà toán học giúp mình thu hẹp.

Khoảng trống đó cũng là lý do để tách riêng chi phí thử nghiệm khỏi luồng production. Khi OpenAI thực sự đặt tên và mức giá cho mô hình này, tuần đầu tiên sẽ là một cơn lũ các tuyên bố benchmark chưa được kiểm chứng và rất nhiều công việc tái tích hợp trong hoảng loạn — lập luận về định tuyến cho một nền tảng như của chúng tôi là việc thử một mô hình chưa được kiểm chứng khi đó chỉ tốn một chuỗi model, chứ không phải một cuộc migration. GPT-6 Astra có giá $10 / $50 và GPT-6.1 Sol là $2 / $10 mỗi triệu token, được chuyển tiếp đúng giá niêm yết với 0% markup, nên khi nhà cung cấp thay đổi giá thì giá mới có hiệu lực ngay trong cùng ngày giá đó được áp dụng. Failover tự động nghĩa là một mô hình mới có thể gánh một phần lưu lượng và bị loại bỏ mà không kéo sập đường đi của request theo, và DSL định tuyến cho phép bạn ghép nhiều mô hình vào một lời gọi nếu bạn muốn có ý kiến thứ hai cho một phép suy dẫn dài thay vì chỉ một câu trả lời duy nhất. Không điều nào trong số đó áp dụng cho một mô hình chưa được phát hành — nhưng đó chính xác là hạ tầng bạn muốn có sẵn trước khi mô hình tiếp theo ra mắt.

Screenshot of the OrcaRouter model page for OpenAI GPT-6.1 Sol, showing a 1.05M-token context window, 128K max output, a base pricing tier of $2.00 per million input tokens and $10.00 per million output tokens with a $0.100 cache read and $2.50 cache write, a long-context tier above 272K prompt tokens at $4.00 / $15.00 with $0.200 cache read and $5.00 cache write, plus live performance and benchmark panels.

Xem gì tiếp theo

Bốn điều, theo thứ tự mà chúng có khả năng trở nên quan trọng. Số lượng hình thức hóa, vì đó là con số duy nhất trong bản phát hành này có thể chuyển từ "OpenAI nói" sang "một cỗ máy đã kiểm tra nó", và nó công khai. Đánh giá độc lập thực sự đầu tiên về một kết quả được nêu tên — một nhà toán học bên ngoài OpenAI làm việc xuyên suốt một bài báo cụ thể một cách công khai, chứ không phải một bản tóm tắt của cả tuyển tập. Kho lưu trữ do cộng đồng vận hành mà OpenAI nói vẫn đang khám phá, điều này sẽ đưa sản phẩm ra khỏi tài khoản của chính OpenAI và vào tay giới chuyên môn. Và việc phát hành chính mô hình, thứ OpenAI đã cam kết nhưng chưa ấn định lịch.

Có phải 722 bản thảo nghĩa là AI đã giải quyết được những vấn đề này?

Đối với một tập con, nếu phần toán học đứng vững: bộ sưu tập tuyên bố có các phản ví dụ và chứng minh cho những bài toán mở nổi tiếng, và 162 trong số các bài báo có một bản hình thức hóa có thể kiểm tra bằng máy đằng sau kết quả chính của chúng. Đối với phần còn lại, tuyên bố là một mô hình đã tạo ra một bản thảo về bài toán, vốn là một phát biểu yếu hơn so với một lời giải đã được xác minh, và chính OpenAI cảnh báo rằng các kết quả chưa được hình thức hóa có thể chứa lỗi. Sự khác biệt giữa “đã tạo ra một chứng minh” và “có một chứng minh” chính là toàn bộ câu chuyện của bản phát hành này.

Có phần nào trong số này dùng được trong một sản phẩm ngày hôm nay không?

Không. Các bản thảo là PDF, mã nguồn Lean và tóm tắt lập luận — sản phẩm nghiên cứu, không phải một dịch vụ. Không có ID mô hình, không có endpoint, không có giá và không có mẫu đơn yêu cầu truy cập. Phần thực sự hữu ích của đợt phát hành đối với một nhà phát triển là xác nhận rằng OpenAI đang huấn luyện một mô hình vượt trội đáng kể so với GPT-6 Astra, điều này là tín hiệu lập kế hoạch cho mười hai tháng tới chứ không phải thứ bạn có thể gọi trong tuần này.

Tại sao OpenAI lại công bố kết quả thay vì công bố mô hình?

Bởi vì hai việc này có hồ sơ rủi ro khác nhau. Công bố các bản thảo là có thể đảo ngược — OpenAI giữ lại các phiên bản trước đó và nói rằng sẽ khắc phục các vấn đề — trong khi phát hành mô hình thì không. OpenAI tuyên bố đang nỗ lực phát hành nó một cách có trách nhiệm, và các khuyến nghị của nhóm cố vấn, mà công ty nói đã dựa vào, được xây dựng xoay quanh đúng trình tự này: đưa kết quả đến tay giới chuyên môn kèm trích dẫn và phiên bản hóa, rồi tài trợ cho sự hiểu biết của con người vốn phải theo sau.

Phiên bản một dòng cho những ai đọc lướt: một khối lượng toán học do AI tạo ra thực sự chưa từng có đã được công bố công khai vào ngày 6 tháng 10, khoảng một phần năm trong đó đã được kiểm tra bằng máy, không phần nào được bình duyệt, tất cả đều gắn với một mô hình mà bạn không thể sử dụng. Câu hỏi thú vị không phải là liệu mô hình có đủ năng lực hay không — ba giờ tính toán suy luận tiên tiến cho mỗi kết quả trên 4.000 bài toán trả lời cho điều đó, và OpenAI nói rằng mô hình có năng lực vượt trội đáng kể so với GPT-6 Astra — mà là liệu việc xác minh và sự hiểu biết của con người có bắt kịp trước khi bản phát hành tiếp theo khiến bản này trở nên lỗi thời hay không.

So sánh trong bài viết này1

Phát hiện từ bài viết này · Benchmark: Artificial Analysis · cập nhật hằng ngày