
OpenAI Astra: Mọi điều chúng ta biết về mô hình không phải là GPT-6
- qwenMỚIQwen: Qwen3.8 Max2026-08-03$2.00 / $6.00 trên 1 triệu token · 56 tok/s
- deepseekMỚIDeepSeek: DeepSeek V4 Flash 07312026-07-3150Trí tuệ69Lập trình
- qwenMỚIQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 trên 1 triệu token · 200 tok/s
- orcaMỚIOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicMỚIAnthropic: Claude Opus 52026-07-2461Trí tuệ78Lập trình
- googleGoogle: Gemini 3.6 Flash2026-07-2150Trí tuệ69Lập trình
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137Trí tuệ49Lập trình
- metaMeta: Muse Spark 1.12026-07-1651Trí tuệ71Lập trình
- kimiMoonshotAI: Kimi K32026-07-1557Trí tuệ76Lập trình
- openaiOpenAI: GPT-5.6 Luna2026-07-0951Trí tuệ71Lập trình
- openaiOpenAI: GPT-5.6 Terra2026-07-0955Trí tuệ77Lập trình
- openaiOpenAI: GPT-5.6 Sol2026-07-0959Trí tuệ77Lập trình
- grokxAI: Grok 4.52026-07-0854Trí tuệ72Lập trình
- tencentTencent: Hy32026-07-0641Trí tuệ59Lập trình
- obsidianQwen3.6 35B A3B Uncensored (Aggressive)2026-07-0232Trí tuệ42Lập trình
- obsidianGemma4 26B A4B Uncensored (Balanced)2026-07-0226Trí tuệ39Lập trình
- anthropicAnthropic: Claude Sonnet 52026-06-3053Trí tuệ72Lập trình
- klingKling: Kling 3.0 Turbo2026-06-1757Trí tuệ52Lập trình57Toán
- z-aiZ.ai: GLM 5.22026-06-1651Trí tuệ69Lập trình60Toán
- kimiMoonshotAI: Kimi K2.7 Code2026-06-1242Trí tuệ61Lập trình61Toán
Thứ bạn có thể tải về hôm nay không phải là một mô hình. Đó là mười tệp mã Lean. Vào ngày 1 tháng 8 năm 2026, OpenAI đã đăng một bài nghiên cứu về toán học, và ẩn trong đó là xác nhận đầu tiên về tên của hệ thống biên giới tiếp theo của họ: Astra. Không có thẻ mô hình, không có trang giá, không có endpoint API và không có ngày phát hành. Flagship hiện tại bạn thực sự có thể gọi vẫn là GPT-5.6 Sol, với giá 5 đô la cho mỗi triệu token đầu vào và 30 đô la cho mỗi triệu token đầu ra, chính xác như đã được duy trì kể từ ngày 9 tháng 7.
Nếu bạn tìm kiếm GPT-6, đây là phiên bản ngắn gọn: OpenAI chưa bao giờ công bố một mô hình mang tên đó, và tính đến hôm nay, họ vẫn chưa quyết định liệu Astra sẽ ra mắt với tên gọi GPT-6, như một bản phát hành điểm của GPT-5 như GPT-5.7, hay như một tầng thứ tư song song với Sol, Terra và Luna. Sự mơ hồ về tên gọi đó không phải do e ngại báo chí. Đó là một câu hỏi nội bộ vẫn còn bỏ ngỏ, được đưa tin bởi The Information vào ngày 31 tháng 7 và chưa được giải quyết kể từ đó.
Điều sau đây tách biệt ba thứ mà hầu hết các bài đưa tin về câu chuyện này thường gộp chung lại với nhau: những gì {{1}}chính OpenAI{{/1}} tự tuyên bố, những gì {{2}}báo chí đáng tin cậy{{/2}} bổ sung thêm, và những gì đang lan truyền mà không có nguồn gốc rõ ràng. Các bằng chứng là những tạo phẩm thực sự mà bạn có thể biên dịch được. Con số {{3}}10 nghìn tỷ tham số{{/3}} chỉ là một con số mà ai đó gõ trên mạng. Những điều đó {{4}}xứng đáng được đánh giá với mức độ tin cậy rất khác nhau.{{/4}}
Những gì OpenAI thực sự nói — và danh sách dài hơn nhiều về những gì họ không nói
Thông báo không đến dưới dạng ra mắt sản phẩm. Nó đến dưới dạng một bài nghiên cứu. Bài đăng của OpenAI mô tả kết quả được tạo ra bởi "phiên bản nội bộ của Astra, mô hình lớn tiếp theo của chúng tôi," trên các bài toán mà theo cách trình bày của họ, đã không có tiến triển nào về kết quả chính trong ít nhất một thập kỷ. Astra được mô tả là một hệ thống được xây dựng cho các tác vụ chạy dài: nhiều agent phối hợp trên các phần khác nhau của một bài toán lớn trong khoảng thời gian dài thay vì trả lời trong một lượt duy nhất.
Điều đó gần như là toàn bộ mô tả kỹ thuật chính thức. Đối chiếu với nó, danh sách những thiếu sót thật nổi bật:
• Được OpenAI xác nhận — cái tên Astra; rằng đó là "mô hình lớn tiếp theo"; rằng một phiên bản nội bộ đã tạo ra mười kết quả; ý định thiết kế đa tác nhân, tầm nhìn dài hạn; một bản thảo dài 249 trang; chứng chỉ Lean 4 trên một kho lưu trữ công khai; ước tính chi phí token được báo giá theo mức GPT-5.6 Sol.
• Không được OpenAI công bố — ngày phát hành; giá; cửa sổ ngữ cảnh; số lượng tham số; điểm benchmark bất kỳ; thẻ mô hình; liệu nó có mặt trên ChatGPT hay chỉ trên API; bao nhiêu agent đã chạy, trong bao lâu, trên phần cứng nào; các prompt; tỷ lệ thành công; tên sản phẩm cuối cùng.
Báo cáo đáng tin cậy làm sáng tỏ thêm một chút. The Information đưa tin rằng Sam Altman đã trình diễn Astra cho các nhà hoạch định chính sách tại Washington vào cuối tháng Bảy — một buổi họp báo cáo, theo đó, có sự tham dự của các Thượng nghị sĩ Raphael Warnock, Bernie Moreno và Mark Warner, cùng với Bộ trưởng Tài chính Scott Bessent và Bộ trưởng Thương mại Howard Lutnick. Dòng mô hình này được mô tả là đã trong quá trình thử nghiệm, với "Astra" vẫn là một nhãn tạm thời.
Không ai bên ngoài OpenAI đã chạy mô hình này trên bất cứ thứ gì. Mọi tuyên bố về khả năng đang được lưu hành đều bắt nguồn từ mười bằng chứng đã công bố hoặc từ một bản demo mà công chúng không được thấy.
Mười chứng minh: dễ kiểm chứng một cách lạ thường, và vẫn chưa ngã ngũ

Đây là điểm mà thông báo thực sự mạnh hơn một đợt công bố benchmark thông thường, và cần phải nói rõ lý do vì sao. OpenAI không đăng một con số điểm rồi yêu cầu người ta tin. Họ đã công bố các tạo phẩm có thể kiểm tra bằng máy theo giấy phép Apache 2.0 trong kho lưu trữ openai/ten-proofs — mỗi kết quả một tệp Lean, được ghim ở Lean 4.32.0 với phụ thuộc mathlib, cùng với thư mục ComparatorChallenges để kiểm tra độc lập. Kho lưu trữ được đưa lên chỉ với một commit duy nhất vào ngày 1 tháng 8 và từ đó đã nhận được vài trăm sao và hàng chục fork.
Mười kết quả, như cách kho lưu trữ gọi tên chúng, trải dài trên một loạt lĩnh vực rộng bất thường:
• Lý thuyết nhóm — xây dựng một nhóm không sofic, đưa ra câu trả lời phủ định cho một câu hỏi mở từ năm 1999. Tính sofic là một thuộc tính mà gần như mọi nhóm được các nhà toán học nghiên cứu đều thỏa mãn; câu hỏi liệu mọi nhóm rời rạc đếm được có nhất thiết phải thỏa mãn thuộc tính đó hay không đã bỏ ngỏ suốt 27 năm.
• Đại số toán tử — một phản ví dụ liên quan đến giả thuyết rigidity của Connes, do Alain Connes, nhà toán học đoạt Huy chương Fields, đề xuất vào năm 1980.
• Hình học đa chiều — một cải tiến đối với phương pháp xếp khối cầu, được ghi nhận là cải tiến đầu tiên thuộc loại này kể từ năm 1978 — cùng với một dạng chặt của bất đẳng thức thể tích Ehrhart.
• Lý thuyết mã hóa — các chặn mới cho mã nhị phân và mã cầu.
• Độ phức tạp — một chặn dưới mạch số học cho permanent, và một kết quả lặp song song mũ cho các trò chơi vướng víu lượng tử.
• Mật mã học lưới — độ khó đa thức cố định cho bài toán vectơ gần nhất.
• Tổ hợp cực trị — mức tăng trưởng của các số Ramsey tam giác đa màu, và các phản ví dụ trong lý thuyết đồ thị cực trị, bao gồm công trình về một số bài toán Erdős đã được lập danh mục.
Các nhà toán học phản ứng với sự quan tâm hơn là bác bỏ. Thomas Bloom, người duy trì cơ sở dữ liệu về các bài toán Erdős, gọi các kết quả này là tin lớn và đánh giá chúng cao hơn phản ví dụ cho giả thuyết khoảng cách đơn vị hồi tháng Năm. Noam Brown của OpenAI đưa ra lời giảm nhiệt hữu ích từ bên trong: "Đáng tiếc, vẫn chưa có bài toán Millennium Prize Problems nào."
Điều mà chứng chỉ Lean xác nhận, và điều nó bỏ ngỏ
Một chứng minh Lean vượt qua kiểm tra kiểu là hợp lệ ngay từ cách xây dựng. Bạn không cần phải tin vào phương pháp đánh giá của OpenAI, lựa chọn đường cơ sở của họ, hay cách họ diễn giải kết quả của chính mình — bạn có thể tự biên dịch các tệp. Đối với một ngành mà "chúng tôi đạt 94,1%" là đơn vị bằng chứng tiêu chuẩn, thì đó là một nâng cấp có ý nghĩa về khả năng bác bỏ.
Nó cũng hẹp hơn so với những gì các tiêu đề ngụ ý, theo bốn cách cụ thể. {{1}}Lean kiểm tra rằng chứng minh của một phát biểu hình thức là đúng đắn. Nó không kiểm tra rằng phát biểu hình thức đó có phải là định lý mà bài viết khẳng định hay không. Nó không kiểm tra rằng các định nghĩa được mã hóa có khớp với ý nghĩa mà giới chuyên môn dùng cho những từ đó hay không. Nó không kiểm tra các phép quy giản phi hình thức kết nối các điểm đầu cuối hình thức với kết quả trong tiêu đề. Và nó không nói gì về tính mới — liệu một kết quả có phải là mới hay đã được biết đến dưới một tên khác.{{/1}}
Cả bốn điều đó đều là những câu hỏi thuộc về phán đoán của con người, và tính đến thời điểm công bố, chưa có điều nào vượt qua được quy trình bình duyệt phản biện. Bản thảo ghi nhận việc tham vấn các chuyên gia; nhưng lời ghi nhận không phải là sự tán thành đối với từng khẳng định. Một bản biên dịch một phần của kho lưu trữ đã được công bố, biên dịch thành công 8.820 trong số 9.007 tác vụ — đó là diện mạo của một công trình hình thức hóa lớn ngoài thực tế khi đang trong quá trình kiểm chứng, chứ không phải là một cuộc kiểm toán đã hoàn tất. Tình trạng trung thực hiện nay là: mười tuyên bố nghiên cứu nghiêm túc, được mã hóa theo hình thức — chứ không phải là mười mục đã được xác lập trong quy điển toán học.
Có một giới hạn thứ hai, âm thầm hơn: quy trình khám phá không thể được tái lập bởi bất kỳ ai bên ngoài OpenAI. Các bằng chứng thì công khai; hệ thống tìm kiếm, lời nhắc, điểm kiểm tra và môi trường thực thi thì không. Bạn có thể xác minh điểm đến. Bạn không thể chạy lại hành trình.
Con số 2.000 đô la, và tại sao nó mua được ít hơn so với những gì con số đó thể hiện

Con số lan truyền xa nhất là chi phí. OpenAI đặt mức chi tiêu token cho mười giải pháp vào khoảng 2.000 đô la, theo mức giá GPT-5.6 Sol — khoảng 200 đô la cho mỗi bài toán mở đã tồn tại hàng thập kỷ, theo cách hiểu phổ biến nhất về cách diễn đạt của nó. Một số bài viết đọc cùng câu đó là dưới 2.000 đô la mỗi bài toán, một sự khác biệt gấp mười; bài đăng của OpenAI đủ ngắn gọn đến mức cả hai cách đọc đều tồn tại trên báo chí, và chúng tôi vẫn chưa thấy công ty làm rõ điều đó.
Hãy lấy tổng số liệu và tính toán ra. Sol tính phí $5 cho mỗi triệu token đầu vào và $30 cho mỗi triệu token đầu ra, với token suy luận được tính phí như token đầu ra. Nếu toàn bộ chi phí đều là token đầu ra, $2.000 mua được tối đa khoảng 67 triệu token đầu ra — tức khoảng 6,7 triệu cho mỗi bài toán. Đó là một khối lượng suy luận rất lớn, và không phải là mức suy luận phi lý. Đó là loại ngân sách mà một nhóm nghiên cứu được tài trợ tốt hoàn toàn có thể chi cho một câu hỏi khó duy nhất.
Ba lưu ý quan trọng hơn tiêu đề:
• Đây là một mức giá giả định, không phải một mức giá. Astra chưa được phát hành và chưa có giá. Mức $2,000 mô tả những token đó sẽ tốn bao nhiêu theo biểu giá của một mô hình khác. Một hệ thống tiên phong được xây dựng cho các phiên chạy đa tác tử kéo dài hàng giờ không có lý do rõ ràng nào để được định giá giống Sol, và có mọi lý do để được định giá cao hơn nó.
• Nó chỉ tính những lần thành công. Không có tỷ lệ thành công nào được công bố. Chúng ta không biết Astra đã được đưa vào bao nhiêu bài toán mà không giải được, hoặc những lần thử đó tốn bao nhiêu chi phí. Một mức chi phí-mỗi-lần-thành-công được công bố mà không kèm tỷ lệ thành công thì không phải là chi phí-mỗi-kết-quả, và sự chênh lệch có thể lên tới một bậc độ lớn theo cả hai chiều.
• Token là phần rẻ. Con người đã đặt ra các vấn đề, chuẩn bị các bản thảo và thúc đẩy việc hình thức hóa. Công sức đó không nằm trong 2.000 đô la.
Phần duy nhất trong đó bạn có thể định giá hôm nay là mức cơ sở. Vì OrcaRouter chuyển thẳng giá niêm yết của nhà cung cấp với mức cộng thêm 0%, GPT-5.6 Sol có giá $5/$30 trên API của chúng tôi giống hệt như trên API của OpenAI — vậy nên nếu bạn muốn kiểm chứng lại phép tính với khối lượng công việc của riêng mình, mức giá trong thông báo chính là mức giá bạn sẽ thực sự phải trả. Điều chưa ai định giá được là chính Astra, và bất kỳ nhà cung cấp nào nói ngược lại thì chỉ đang đoán mò.
Ngày phát hành được chi phối bởi đồng hồ đếm ngược 30 ngày, không phải bởi rò rỉ.

Hầu hết các bài viết về "khi nào có GPT-6" chỉ là những phép tính dựa trên tin đồn. Có một ràng buộc cụ thể hơn đang nằm ngay trước mắt, và nó gần như chưa được liên hệ với câu hỏi này.
Một sắc lệnh hành pháp được ký vào ngày 2 tháng 6 năm 2026 đã chỉ đạo các cơ quan liên bang thiết lập một quy trình rà soát tự nguyện, theo đó các nhà phát triển tiên phong nộp mô hình để chính phủ rà soát tối đa 30 ngày trước khi phát hành công khai. Khuôn khổ này dự kiến chính thức có hiệu lực vào ngày 1 tháng 8 — cùng ngày bài đăng về Astra được đăng tải. Theo báo cáo, Astra dự kiến sẽ là mô hình đầu tiên được thông qua quy trình này.
"Tự nguyện" đang đóng một vai trò nào đó trong câu đó. Trên thực tế, chính quyền đã từng tác động đến thời điểm phát hành trước đây, và hành vi gần đây của chính OpenAI trông giống như một buổi diễn tập: GPT-5.6 đã được giới hạn cho khoảng hai mươi tổ chức được thẩm định từ ngày 26 tháng 6 trước khi truy cập rộng rãi đến vào ngày 9 tháng 7 — một quá trình triển khai theo giai đoạn kéo dài khoảng hai tuần.
Chồng hai sự thật đó lên nhau, bạn sẽ có một mức sàn thô thay vì một dự đoán. Nếu Astra trải qua quá trình xem xét trước khi phát hành kéo dài 30 ngày và sau đó lặp lại mô hình GPT-5.6, tính sẵn sàng rộng rãi sẽ rơi vào khoảng sáu tuần sau khi nộp. Và ngày nộp chính là điều chúng ta không biết. Đây là lý do tại sao những ngày tháng Tám đầy tự tin nên bị đánh giá thấp: bước chặn là một quy trình có thời gian đã công bố, và đồng hồ vẫn chưa bắt đầu chạy một cách rõ ràng.
Thị trường dự đoán đã dịch chuyển đúng theo hướng đó. Tính đến ngày 5 tháng 8 năm 2026, bậc thang "GPT-6 được phát hành trước ngày" của Polymarket đứng ở mức 1% cho ngày 7 tháng 8, 3% cho ngày 14 tháng 8, 13% cho ngày 21 tháng 8, 25% cho ngày 31 tháng 8, 68% cho ngày 30 tháng 9 và 89% cho ngày 31 tháng 12, với khối lượng giao dịch gần một triệu đô la. Hãy coi đó là dự đoán tổng hợp của đám đông, không phải là nguồn thông tin — nhưng lưu ý rằng đám đông đã dồn trọng số sang quý 4.
Cũng nên nhớ lại thành tích trước đây. Mọi tuyên bố "GPT-6 ra mắt vào tuần tới" trong mười hai tháng qua đều đã sai. Một rò rỉ chưa được xác minh đã ấn định ngày 14 tháng 4 năm 2026 là ngày ra mắt; thứ thực sự được phát hành chín ngày sau đó là GPT-5.5.
Tin đồn, được đánh giá
Được sắp xếp theo mức độ ảnh hưởng thực tế mà mỗi cái mang lại:
• Tên gọi chưa được chốt (GPT-6 / GPT-5.7 / một lớp riêng biệt). Theo nguồn tin từ The Information. Tuyên bố đáng tin cậy nhất không phải từ OpenAI trong câu chuyện này, đồng thời là tuyên bố nên khiến chúng ta điều chỉnh lại kỳ vọng — một hệ thống được công bố thông qua một bài báo toán học có thể sẽ hoàn toàn không được gắn nhãn là bước nhảy vọt về thế hệ.
• Tên mã "Zinc" và "Magnesium" được phát hiện tại Design Arena. Cộng đồng phát hiện, các mục được báo cáo là đã bị vô hiệu hóa, chưa được OpenAI xác nhận. Có thể hiểu là: một bản phát hành điểm GPT-5.x có thể sẽ ra mắt trước Astra, điều này sẽ không thỏa mãn kỳ vọng GPT-6 của bất kỳ ai trong khi chiếm lĩnh chu kỳ tin tức.
• Quy mô gấp khoảng 2 lần GPT-5.6 Sol; giá bán xấp xỉ mức của GPT-5.6. Tin đồn đang lan truyền. Người rò rỉ đứng sau tin này thừa nhận đã không thử nghiệm mô hình. Nghe có vẻ hợp lý nhưng hoàn toàn không có cơ sở.
• Cửa sổ ngữ cảnh 1,5 triệu token. Xuất hiện trong các bản tổng hợp rò rỉ mà không có nguồn được nêu tên. Đáng chú ý là Sol đã cung cấp 1.050.000 token, vì vậy đây sẽ là một mức tăng, không phải một bước nhảy vọt — đó là lý do để nghi ngờ nó như một vụ "rò rỉ" đình đám.
• Khoảng 10 nghìn tỷ tham số. Không có nguồn ghi nhận nào mà chúng tôi có thể truy ra được. Con số được nhắc đến nhiều nhất nhưng ít được xác thực nhất trong toàn bộ câu chuyện.
• Bộ nhớ và cá nhân hóa là định hướng chủ đạo. Dựa trên phát biểu công khai của chính Altman trong một cuộc phỏng vấn tháng 8 năm 2025 — có thật, nhưng đã một năm rồi và nói về định hướng sau GPT-5 nói chung, không phải cụ thể về Astra.
Việc thực sự cần làm từ bây giờ đến khi nó được phát hành
Sai lầm là thiết kế lại kiến trúc cho một mô hình không có thẻ mô hình. Hành động đúng đắn là nhận ra vấn đề nào của bạn mà một hệ thống đa tác tử có tầm nhìn dài hạn sẽ thay đổi, vì đó là những phần trong hệ thống của bạn đang bị xây dựng thiếu hụt ngay hôm nay, bất kể OpenAI phát hành điều gì.
Ba trong số đó đáng để xây dựng chống lại GPT-5.6 Sol ngay bây giờ:
• Trần chi phí theo tác vụ, không phải theo lần gọi. Nếu một công việc duy nhất có thể chạy hàng giờ và tiêu tốn sáu hoặc bảy triệu token đầu ra, các giới hạn theo từng yêu cầu không còn bảo vệ bạn nữa. Bạn cần một ngân sách mà toàn bộ tác vụ kế thừa, và một điểm dừng cứng.
• Checkpointing và khả năng tiếp tục. Một lệnh gọi một lần hoặc là trả về kết quả hoặc là thất bại. Một phiên chạy agent kéo dài hàng giờ bị chết ở phút thứ 90 mà không có gì được ghi lại bền vững là một loại lỗi tốn kém mà hầu hết các codebase chưa bao giờ phải xử lý.
• Đánh giá bạn tin cậy trên các bài toán không có đáp án tham chiếu. Mười chứng minh này thú vị một phần vì Lean cung cấp một oracle. Gần như không có gì trong sản xuất làm được điều đó. Nếu bạn không thể phân biệt một lần chạy sáu giờ tốt với một lần chạy tồi trông có vẻ hợp lý, thêm sức mạnh tính toán sẽ không giúp ích gì cho bạn.
Về câu hỏi chuyển đổi: Astra không khả dụng trên OrcaRouter, vì nó không khả dụng ở bất kỳ đâu. Điều chúng tôi có thể nói là {{1}}vấn đề xoay vòng phiên bản về cơ bản đã được giải quyết ở phía chúng tôi{{/1}}. Một API key truy cập được hơn 200 mô hình, vì vậy dù bản này được phát hành với tên GPT-6, GPT-5.7 hay một hạng GPT-5.6 thứ tư, việc áp dụng nó chỉ là thay đổi model-string chứ không phải di chuyển — {{2}}không hợp đồng thứ hai, không SDK mới{{/2}}. Và đối với một mô hình tiên phong chưa được kiểm chứng, {{3}}tự động chuyển đổi dự phòng là sự khác biệt giữa việc đánh giá nó trong một tải trọng thực tế và đặt cược cả một lộ trình sản xuất vào một hệ thống chưa từng được ai ngoài phòng thí nghiệm thử nghiệm chịu tải{{/3}}. {{4}}Bạn chỉ cần chuyển một phần lưu lượng đến nó, giữ Sol bên dưới làm dự phòng, rồi sẽ biết được kết quả.{{/4}}
Những câu hỏi đáng trả lời
Astra có phải là GPT-6 không?
Không hẳn, và đó là ẩn số quan trọng nhất trong câu chuyện này. OpenAI đã xác nhận Astra là mô hình lớn tiếp theo nhưng vẫn chưa quyết định tên phát hành; các báo cáo cho thấy GPT-6, GPT-5.7 và một lớp riêng biệt cùng với Sol, Terra và Luna đều đang được cân nhắc. Hoàn toàn có khả năng một mô hình tên GPT-6 sẽ không bao giờ xuất hiện, và bước nhảy vọt về năng lực mà mọi người chờ đợi sẽ đến dưới một cái tên mà không ai đang theo dõi.
Hôm nay tôi có thể truy cập Astra dưới bất kỳ hình thức nào không?
Không — không phải trong ChatGPT, không phải qua API, không phải qua bất kỳ router hay bên bán lại nào. Những gì tồn tại công khai là bài báo khoa học, các bản trình bày suy luận từng bước và kho lưu trữ Lean. Nếu một dịch vụ nào đó tuyên bố cung cấp quyền truy cập Astra, thì hoặc họ đang bán lại thứ gì đó khác, hoặc họ đang nói dối. Điều thực sự hữu ích duy nhất bạn có thể làm với bản phát hành này lúc này là tự biên dịch các chứng minh.
Astra có thực sự giải được những bài toán mà các nhà toán học con người không giải được không?
Nó đã tạo ra các chứng minh được xác minh chính thức cho những phát biểu đã bỏ ngỏ ít nhất một thập kỷ — một kết quả thực sự và khác thường — và việc xác minh này vượt trên chuẩn mực ngành một bậc. Nhưng "được kiểm tra bằng Lean" không phải là "được bình duyệt đồng cấp", và câu hỏi cốt lõi về việc liệu mỗi phát biểu chính thức có thực sự phản ánh vấn đề chính hay không chính là phần mà Lean không thể trả lời. Các chuyên gia đọc bản thảo đã có phản hồi tích cực; nhưng chưa có phần nào trong số đó trải qua quá trình bình duyệt chính thức. Hãy kỳ vọng đánh giá sẽ trở nên rõ ràng hơn trong nhiều tháng tới, theo cả hai hướng.
Con số 2.000 đô la có nghĩa là nghiên cứu tiên phong giờ đã rẻ không?
Điều đó nghĩa là các lượt chạy token thắng cuộc rất rẻ, theo mức giá của một mô hình khác, không tính các lần thất bại và không tính con người. Mỗi một trong ba sự loại trừ đó có thể rất lớn. Cách đọc trung thực là chi phí biên của một cuộc tìm kiếm chứng minh tự động thành công đã giảm đủ sâu để đáng được quan tâm, chứ không phải là mười bài toán mở giờ đây có giá bằng một chiếc laptop.
Điều gì thực sự sẽ giải quyết được vấn đề này
Ba điều cụ thể, không điều nào trong số đó là tin đồn, và tất cả đều có thể kiểm chứng khi chúng xảy ra.
Một thẻ mô hình và một trang giá. Đó là thời điểm Astra không còn là một sản phẩm nghiên cứu mà trở thành thứ bạn có thể lên kế hoạch dựa vào — và cũng là lúc câu hỏi về tên gọi tự giải quyết.
Một bản xây dựng lại độc lập của kho lưu trữ Lean bởi các chuyên gia, những người kiểm toán các định nghĩa và các phép rút gọn không chính thức, không chỉ việc kiểm tra kiểu. Thư mục ComparatorChallenges cho thấy OpenAI mong đợi điều này. Nếu các phát biểu hình thức chịu được sự soi xét đó, kết quả sẽ trở nên khó bị bác bỏ hơn nhiều; nếu một sự không khớp xuất hiện dù chỉ trong một trong mười trường hợp, mọi tuyên bố trong tập hợp sẽ được đọc lại.
Bằng chứng cho thấy đồng hồ xem xét liên bang đã bắt đầu chạy. Trong khung thời gian 30 ngày trước khi phát hành, việc đệ trình đó là tín hiệu đáng tin cậy sớm nhất về ngày ra mắt — có nhiều thông tin hơn đáng kể so với ảnh chụp màn hình tiếp theo của một mục bị vô hiệu hóa trong bảng xếp hạng đấu trường.
Cho đến lúc đó, phát biểu chính xác rất hẹp và đáng để giữ vững: mô hình chủ lực tiếp theo của OpenAI có một cái tên, mười bằng chứng kiểm chứng được bằng máy, một buổi demo tại Washington, và không có gì khác. Bất kỳ ai đưa ra cho bạn một ngày cụ thể đều đang phỏng đoán, và bất kỳ ai đưa ra con số tham số đều đang bịa đặt.
So sánh trong bài viết này1
Phát hiện từ bài viết này · Benchmark: Artificial Analysis · cập nhật hằng ngày
