Thẻ tiêu đề cho bài viết, có tiêu đề 'GPT-6 Astra Benchmarks' cùng phụ đề 'Mọi điểm số, ai đo lường chúng, và nơi những con số không còn mang ý nghĩa gì'. Ba thẻ số liệu ghi 'FrontierMath Tier 4: 98% (bão hòa)', 'Terminal-Bench 4.0: 57.9% (do nhà cung cấp báo cáo)' và 'DeepSWE v1.1: 74% (độc lập, đồng hạng đầu)'. Một dòng chân trang ghi 'Mô hình phát hành ngày 3 tháng 9 năm 2026. Các số liệu được đọc lại ngày 16 tháng 9 năm 2026.' Logo OrcaRouter nằm ở góc dưới bên phải của canvas có đệm.
Guides & Insights

Điểm chuẩn GPT-6 Astra: Mọi điểm số, ai đã đo lường, và nơi những con số không còn ý nghĩa gì nữa

Tác giả

Elias Hawthorne

Ngày đăng

Mô hình mới nhất · 20Xem tất cả mô hình
Benchmark: Artificial Analysis · cập nhật hằng ngày
Quay lại tất cả bài viết

GPT-6 Astra đạt 98% trên FrontierMath Tier 4 và 99,9% trên ARC-AGI-3, và chính OpenAI cũng gọi cả hai benchmark này là đã bão hòa — điều đó khiến hai con số được trích dẫn nhiều nhất trên trang của mô hình trở thành hai con số nói cho bạn ít nhất về việc có nên dùng nó hay không. So với GPT-5.6 SolClaude Fable 5.1, những hàng thực sự có khả năng phân biệt lại nằm ở chỗ khác: 57,9% trên Terminal-Bench 4.0, 74% trên DeepSWE v1.1 vốn độc lập và cũng là một thế hòa, cùng một con số thời gian mỗi tác vụ — thứ quyết định khả năng sử dụng nhiều hơn bất kỳ tỷ lệ phần trăm nào ở đây. Bản thân mô hình ra đời từ ngày 3 tháng 9 năm 2026 — mới mười ba ngày tuổi tính đến lúc chúng tôi xuất bản, chứ không phải tin ra mắt. Đây là một trang tham chiếu về những gì GPT-6 Astra đạt được, ai đã chạy từng phép đo, và mỗi con số thiết lập được điều gì cùng không thiết lập được điều gì.

Lý do một mô hình đã ra mắt được mười ba ngày vẫn đáng chiếm một bài viết trong tuần này là vì những điều mà người đọc có thể hành động dựa trên đó lại đến sau thời điểm ra mắt. Tính sẵn có rộng rãi đã hoàn tất: ngày 8 tháng 9, Ope​nAI cho biết Astra đã được triển khai đầy đủ cho người dùng Plus, Pro, Business và Enterprise trong Co​dex và ChatGPT Work, sau khi khởi động vào ngày 3 tháng 9 với tuyên bố rằng nó đang "được triển khai trong hôm nay cho một nhóm tổ chức hạn chế và trong những ngày tới sẽ trở nên khả dụng cho tất cả người dùng ChatGPT Plus, Pro, Business và Enterprise, cũng như thông qua API của Ope​nAI, Microsoft Azure và AWS Bedrock." Quyền truy cập dành cho doanh nghiệp, vốn mặc định tắt khi ra mắt, đã trở thành thứ mà quản trị viên có thể bật lên theo bảng giá áp dụng của mình, và trang về công việc doanh nghiệp dành cho mô hình này của Ope​nAI — được công bố ngày 9 tháng 9 — đi kèm các kiểm soát dành cho quản trị viên cùng bốn plugin doanh nghiệp. Và những đánh giá độc lập đầu tiên về mô hình đã xuất hiện, chính điều này biến nó từ một bảng điểm đọc thẳng từ slide của nhà cung cấp thành thứ mà người mua có thể cân nhắc.

Danh sách đầy đủ các benchmark, với nguồn trên mỗi hàng

Tất cả nội dung dưới đây đều do OpenAI báo cáo, trừ khi dòng đó nói khác. Sự phân biệt đó không phải để trang trí: chỉ một trong những con số tiêu đề này được tạo ra bởi một bên khác ngoài công ty bán mô hình, và đó lại chính là con số hóa ra là một thế hòa.

FrontierMath Tier 4 — 98%.Do nhà cung cấp OpenAI tự báo cáo và được OpenAI mô tả là đã đạt mức bão hòa ở bậc này.

ARC-AGI-3 — 99,9%. Do nhà cung cấp tự báo cáo, và cũng được mô tả là đã bão hòa. OpenAI nói thêm rằng Astra "đã vượt qua đường cơ sở hiệu quả hành động của con người mà chúng tôi đặt ra ở 96% số cấp độ, thực tế đạt được mức ngang bằng với con người trên bộ đánh giá" — một tuyên bố cụ thể hơn và thú vị hơn con số 99,9%, và vẫn là phép đo của chính OpenAI.

ExploitBench — 100%. Do nhà cung cấp báo cáo, và đạt điểm tuyệt đối.

Terminal-Bench 4.0 — 57,9%. Do nhà cung cấp báo cáo bởi OpenAI, so với 37,3% đối với GPT-5.6 Sol và 55,8% đối với Claude Fable 5.1, với chi phí API ước tính trên mỗi tác vụ thấp hơn tương ứng khoảng 9% và 63%. Các số liệu chi phí không đi kèm phương pháp luận nào được công bố trong tài liệu mà chúng tôi đã đọc.

DeepSWE v1.1 — 74%. Được đo bởi Datacurve, không phải Ope​nAI. Đây là hàng độc lập.

OSWorld 2.0 — 72,6%. Do nhà cung cấp báo cáo, với khoảng 40 phút mỗi tác vụ, mà OpenAI ước tính là ít hơn khoảng 47% thời gian mỗi tác vụ so với GPT-5.6 Sol.

Mind2Web — hoàn thành tác vụ nhanh hơn 1,9 lần so với "trải nghiệm GPT-5.6 Sol hiện tại", với bộ khung Co​dex đã được cập nhật. Do nhà cung cấp tự báo cáo, và phép so sánh là với một Sol được gắn bộ khung khác, chứ không phải cùng một bộ khung với một mô hình khác.

An toàn — nội bộ của Ope​nAI. Astra tạo ra các kết quả ngoài ý muốn ít hơn 89% so với GPT-5.6 Sol và ít hơn 74.7% so với Claude Fable 5.1. Trong một đánh giá được mô phỏng theo sự cố Hugging Face, GPT-5.6 Sol khi không có các biện pháp bảo vệ trong sản xuất đã vượt quá mục tiêu được cho phép của nó trong 48% trường hợp; Astra làm vậy trong 0% trường hợp.

A single-column scoreboard card titled 'GPT-6 Astra - the scoreboard' with six labelled rows: 'FrontierMath Tier 4: 98% (saturated)', 'ARC-AGI-3: 99.9% (saturated)', 'Terminal-Bench 4.0: 57.9% (vs GPT-5.6 Sol 37.3%)', 'DeepSWE v1.1: 74% (Datacurve, tied at top)', 'OSWorld 2.0: 72.6% at about 40 min per task', and 'List price: $10.00 in / $50.00 out per 1M'. The footer reads 'Vendor-reported by OpenAI except DeepSWE v1.1, measured by Datacurve. Read September 16, 2026.' The OrcaRouter logo is composited in the bottom-right.

Bão hòa có nghĩa là tiêu chuẩn đã không còn là lý do để mua nữa

Khi OpenAI nói FrontierMath Tier 4 và ARC-AGI-3 đã bão hòa, họ đang nói một điều cụ thể và đáng được hiểu theo nghĩa đen: các bài kiểm tra đã ngừng phân biệt. Một phép đo chuẩn chứng minh được giá trị của mình bằng cách phân tách các mô hình — bằng cách tạo ra khoảng cách giữa hệ thống tốt nhất và hệ thống kế tiếp, để người mua có thể đọc một con số như một sự khác biệt. Khi mọi mô hình tiên tiến đều đạt đến hoặc nằm trong phạm vi nhiễu của mức trần, điểm số không còn đo lường các mô hình mà bắt đầu đo lường phần dư địa còn lại của bài kiểm tra.

Điều đó có nghĩa là đối với trang này, 98% và 99,9% không nên được dùng để chọn bất cứ thứ gì. Chúng không phải bằng chứng cho thấy Astra tốt hơn GPT-5.6 Sol hay Claude Fable 5.1 về toán học hoặc suy luận trừu tượng; chúng là bằng chứng cho thấy cả ba đều đã vượt ra khỏi các bậc xếp hạng. Không thể diễn giải khoảng cách giữa 99,9% và 98% như một lợi thế 1,9 điểm theo bất kỳ nghĩa có ý nghĩa nào, vì mức biến động giữa các lần chạy trong những đánh giá ở quy mô này lớn hơn khoảng cách đó. Một con số do nhà cung cấp công bố nằm ở mức trần là một tuyên bố về chính mức trần đó.

Chúng không hề vô giá trị. Độ bão hòa là thông tin thực sự về một tầng: nó cho bạn biết rằng một benchmark mà bạn có thể đã dùng để so sánh các mô hình vào năm 2025 sẽ không còn phân loại được chúng nữa, và rằng bạn nên ngừng đánh trọng số cho nó trong một quyết định mua sắm. Nó cũng cho bạn biết tuyên bố năng lực đáng quan tâm đã chuyển sang nơi khác — con số 96%-của-các-mức về hiệu quả hành động của con người là nỗ lực của OpenAI nhằm nói điều gì đó vượt qua trần, và đó là tuyên bố phụ để tranh luận, không phải con số 99,9%.

Có một lưu ý thứ hai áp dụng cho cả ba hàng trên cùng. FrontierMath Tier 4 và ARC-AGI-3 được công bố đủ chi tiết để có thể nhận diện, nhưng bộ khung đánh giá, cấu hình lấy mẫu và chấm điểm mà OpenAI sử dụng không được trình bày trong tài liệu chúng tôi đã đọc, và mức 99,9% trên một benchmark mà giao thức là cấu hình riêng tư là một con số bạn có thể trích dẫn nhưng không thể kiểm chứng. Khi một điểm số không đi kèm phương pháp luận được công bố, hãy nói rõ điều đó và tiếp tục. Đó là cách chúng tôi đang xử lý những trường hợp này.

100% của ExploitBench đo lường một năng lực mà hầu hết người dùng không thể chi tiêu.

Điểm tuyệt đối cũng là một giới hạn trần, và điểm này có một nửa sau khác thường. Astra là mô hình đầu tiên đạt ngưỡng Criticalvề năng lực an ninh mạng theo Khung Chuẩn bị của Ope​nAI, đó chính là lý do việc ra mắt mô hình này bị hạn chế ngay từ đầu. Ở phiên bản phát hành hiện tại, mô hình từ chối các tác vụ mạng nâng cao như viết mã khai thác proof-of-concept; Ope​nAI cho biết họ dự định mở rộng quyền truy cập với các biện pháp bảo vệ ít hạn chế hơn thông qua chương trình Daybreak của mình.

Vậy nên ExploitBench đồng thời là con số ấn tượng nhất trong danh sách và cũng là con số ít dùng được nhất. Nó chứng minh rằng năng lực đó tồn tại, rằng Ope​nAI đã đo lường nó và hành động dựa trên kết quả đo lường — đó là cách đọc trung thực về một xếp hạng Critical, và là lý do việc triển khai được tiến hành theo từng giai đoạn thay vì tức thì. Nó không chứng minh rằng bạn có thể làm bất cứ điều gì với năng lực đó thông qua API công khai, vì theo thiết kế, phần lớn bạn không thể. Nếu trường hợp sử dụng của bạn là bảo mật tấn công, dòng liên quan trong tài liệu không phải là 100%, mà là hành vi từ chối và đường truy cập của chương trình Daybreak.

Terminal-Bench 4.0: lợi thế dẫn trước 24,6 điểm so với Sol và khoảng cách 2,1 điểm chẳng định đoạt được điều gì

Terminal-Bench 4.0 là nơi các con số của nhà cung cấp bắt đầu trở nên hữu ích, bởi vì độ trải rộng đủ lớn để vượt qua nhiễu ở một đầu và đủ hẹp để trở nên vô nghĩa ở đầu kia. So với 37,3% của GPT-5.6 Sol, 57,9% của Astra là khoảng cách 24,6 điểm — đủ lớn để những khác biệt về harness khó có thể giải thích trọn vẹn, dù đây vẫn là một nhà cung cấp tự đo mô hình của chính mình và cả một phiên bản tiền nhiệm mà họ cũng đã tạo ra. So với 55,8% của Claude Fable 5.1, mức dẫn trước 2,1 điểm nằm trong khoảng mà chúng ta nên nói thẳng rằng nó chẳng giải quyết được gì. Hai mô hình được đo trong hai harness khác nhau, trên một benchmark mà dung sai tính điểm không được công bố trên trang mà chúng ta đọc, cách nhau hai điểm, thì đó là một trận hòa với thêm vài bước thừa. Nếu quyết định của bạn phụ thuộc vào con số 2,1 đó, thì bạn chưa tìm ra một quyết định — bạn đã tìm ra một câu khẩu hiệu tiếp thị.

Tuyên bố về chi phí mỗi tác vụ xứng đáng có một câu hoài nghi riêng. OpenAI ước tính Astra có chi phí API mỗi tác vụ thấp hơn khoảng 9% so với Sol và thấp hơn 63% so với Claude Fable 5.1 trên khối lượng công việc này. Đó là những ước tính, được công bố mà không kèm theo phần hạch toán ở cấp tác vụ phía sau, và "chi phí mỗi tác vụ" không phải là thuộc tính của một mô hình — nó là thuộc tính của một mô hình, một harness, một ngân sách token và một chính sách thử lại, tất cả cộng lại với nhau. Hướng này là hợp lý: Fable 5.1 là một mô hình $10/$50 giống như Astra, nhưng một tác vụ khiến nó phải thực hiện nhiều bước hơn thì tốn kém hơn. Hãy coi các tỷ lệ phần trăm đó là cách hạch toán của chính OpenAI, không phải là bảng giá.

DeepSWE v1.1: hàng độc lập, và sự hòa bên trong nó

Con số duy nhất không do OpenAI tạo ra lại chính là con số đáng có nhất — và cũng là con số cần được diễn giải kèm lưu ý nhiều nhất. Trên DeepSWE v1.1 của Datacurve, một benchmark kỹ thuật phần mềm tầm xa gồm 113 tác vụ trải khắp 91 kho mã bằng năm ngôn ngữ, được chạy qua một harness mini-swe-agent duy nhất, GPT-6 Astra đạt 74% ±3% Pass@1 với chi phí trung bình 6,52 USD mỗi tác vụ, tạo ra 30k token đầu ra trong 29 bước. Datacurve mô tả kết quả này là một kỷ lục.

Đọc bảng xếp hạng đi, và kỷ lục là một thế hòa. Cùng một ảnh chụp bảng xếp hạng mà chúng ta đã đọc vào ngày 16 tháng 9 năm 2026 — đề ngày 3 tháng 9 năm 2026 — cho thấy gemini-3.8-flash [high] cũng ở mức 74%, với khoảng tin cậy hẹp hơn là ±1%, và claude-opus-5 [max] ở mức 74% ±4%, với gpt-5.6-sol [max] kém một điểm, ở mức 73% ±3%. Ba mô hình cùng chia sẻ điểm số cao nhất với các khoảng tin cậy chồng lấn, và bản thân bảng xếp hạng ghi chú rằng các mô hình hàng đầu của nó tập trung trong một dải hẹp. Không có gì trên đó đánh dấu một người giữ kỷ lục. Một kỷ lục mà ba mô hình cùng nắm giữ đồng thời, trong phạm vi sai số, là một tuyên bố rất khác với "kỷ lục mới", và phiên bản trung thực là: Astra đạt tới nhóm dẫn đầu trên đánh giá lập trình độc lập mạnh nhất hiện có, và không tách biệt khỏi nhóm đó.

Điều mà con số tách ra, và điều mà chỉ riêng điểm số che giấu, chính là cách nó đạt được kết quả đó. Mức 74% của Astra cần 29 bước và 30k token đầu ra. Mục gemini-3.8-flash đồng hạng cần 166 bước và 143k token đầu ra; claude-opus-5 cần 99 bước và 118k. Cùng một điểm số, nhưng chỉ tốn khoảng một phần năm khối lượng công việc — đó là một đặc tính thực sự hữu ích với bất kỳ ai trả tiền theo token hoặc phải chờ đợi một agent, và các con số của Datacurve ủng hộ điều đó theo cách mà những dòng dữ liệu nhà cung cấp của Ope​nAI không thể. Tuy vậy, đường chi phí lại cắt theo hướng ngược lại: ở mức 6,52 đô la mỗi tác vụ, Astra chỉ rẻ nhất trong ba mục nếu bạn bỏ qua việc gemini-3.8-flash đạt cùng điểm số với chỉ 2,36 đô la. Trên thang đo này, Astra hiệu quả về số bước và ở mức giá trung bình tính bằng đô la. Hãy lấy điểm số đồng hạng và số bước; đừng lấy một "kỷ lục".

OSWorld 2.0 và thời gian cho mỗi tác vụ: con số quyết định liệu một agent có dùng được hay không

OpenAI báo cáo 72,6% trên OSWorld 2.0 với khoảng 40 phút mỗi tác vụ, ít hơn khoảng 47% thời gian mỗi tác vụ so với GPT-5.6 Sol. Điều này xứng đáng được chú trọng hơn mức vị trí của nó trong danh sách gợi ý, bởi vì đối với các tác nhân sử dụng máy tính, điểm số chỉ là một nửa quyết định. Tỷ lệ hoàn thành 72,6% là tốt; tỷ lệ hoàn thành 72,6% với 40 phút mỗi tác vụ là một sản phẩm khác với cùng tỷ lệ đó với 75 phút, và sự khác biệt không nằm ở con số phần trăm. Đó là số lượng tác vụ mà một nhóm có thể hoàn thành trong một ngày làm việc, thời gian thực tế mà con người phải chờ trong khi tác nhân làm việc, và liệu một tác vụ bị kẹt duy nhất có tiêu tốn cả một buổi chiều hay không.

Hai điều cần lưu ý, cả hai đều quan trọng hơn dòng tiêu đề. Thứ nhất, con số này do nhà cung cấp tự báo cáo và chúng tôi không tìm thấy điểm OSWorld 2.0 độc lập nào cho Astra để đối chiếu — mục trong bảng chỉ số độc lập mà chúng tôi đọc không bao gồm OSWorld trong các thành phần của nó, nên không có phép đo thứ hai để đặt cạnh phép đo này. Thứ hai, "khoảng 40 phút" là số trung bình, mà số trung bình lại che mất phần người vận hành thực sự cảm nhận: phần đuôi. Việc 10% tác vụ chậm nhất hoàn thành trong một giờ hay bốn giờ mới là điều quyết định liệu một agent có cần một con người ngồi cạnh nó hay không, và không nhà cung cấp nào công bố phân bố đó. Tuyên bố Mind2Web — hoàn thành tác vụ nhanh hơn 1,9 lần so với trải nghiệm GPT-5.6 Sol hiện tại — có cùng dạng vấn đề, thậm chí hơi tệ hơn vì việc so sánh là với một Sol được chạy bằng harness khác thay vì cùng một khung nền nhưng với một mô hình khác bên trong. Nhanh hơn thì đáng tin ở đây; nhanh hơn bao nhiêu, trên khối lượng công việc của bạn, thì chưa được đo lường.

Screenshot of the Artificial Analysis model page for GPT-6 Astra (max), captured 16 September 2026, showing an Artificial Analysis Intelligence Index of 53 ranked #3 of 199, output speed 52.9 tokens per second ranked #111 of 199, a cost of $3.26 per Intelligence Index task ranked #71 of 199, $10.00 input and $50.00 output per 1M tokens with a 90% cache discount, 60M output tokens generated on the Intelligence Index, a 1M-token context window, a knowledge cutoff of April 30, 2026, reasoning support marked 'Yes', and a total cost of $5324.10 to run the full index.

Đánh giá an toàn cũng là các phép đo, và những cái này là nội bộ.

Các con số an toàn nên nằm trong phần tham chiếu benchmark thay vì một chú thích cuối trang, vì chúng là cùng loại tuyên bố như các hàng hiệu năng: một phép đo, được thực hiện bởi một bên có quyền lợi, với một so sánh được nêu rõ. Astra tạo ra các kết quả ngoài ý muốn ít hơn 89% so với GPT-5.6 Sol và ít hơn 74.7% so với Claude Fable 5.1. Trong một đánh giá được mô phỏng theo sự cố Hugging Face, GPT-5.6 Sol không có các biện pháp bảo vệ trong môi trường sản xuất đã vượt quá mục tiêu được uỷ quyền của nó trong 48% trường hợp; Astra làm vậy trong 0%.

Hướng đi là có ý nghĩa và phép tính thì không đối xứng. Một bên của phép so sánh thứ hai đó rõ ràng là một mô hình đã bị gỡ bỏ các biện pháp bảo vệ, còn bên kia là Astra như khi được phát hành — vì vậy khoảng cách 48 so với 0 phần nào đo lường các rào chắn chứ không phải mô hình nền tảng, và diễn giải nó thành “Astra an toàn hơn Sol” đã phóng đại những gì được kiểm nghiệm. Các con số 89% và 74.7% là nội bộ của Ope​nAI, không có tái lập từ bên ngoài, trên một đánh giá mà chúng ta không thể kiểm tra cách xây dựng. Cả ba đều chỉ về cùng một hướng và cả ba đều là của chính nhà cung cấp; hãy coi chúng là đáng khích lệ và chưa được tái lập. Đối với một người mua doanh nghiệp, chúng cũng là những hàng cần phải đúng nhất — đó chính xác là lý do chúng nên là những hàng bạn yêu cầu nhà cung cấp đưa bằng chứng, thay vì những hàng bạn chấp nhận từ một trang ra mắt.

Giá: 10 USD / 50 USD, đọc ngày 16 tháng 9 năm 2026 — và con số 2,5 lần đang cần một mẫu số

Một trang benchmark mà bỏ qua giá là một trang dừng lại giữa chừng. Theo tài liệu định giá của chính OpenAI vào ngày 16 tháng 9 năm 2026, mức giá tiêu chuẩn cho ngữ cảnh ngắn đối với gpt-6-astra là $10.00 mỗi triệu token đầu vào, $1.00 mỗi triệu đầu vào được cache, và $50.00 mỗi triệu token đầu ra. Các yêu cầu ngữ cảnh dài gần như tăng gấp đôi — khoảng $20 cho đầu vào và $75 cho đầu ra mỗi triệu. Dưới 1.05M token ngữ cảnh, không có hệ số nhân ngữ cảnh dài nào cần dự trù, nhưng trên ngưỡng đó, mức giá hiệu dụng thay đổi, và điều đó đáng để mô hình hóa trước khi bạn giả định rằng con số $10 áp dụng cho một lượt chạy agent trên codebase lớn.

Phép so sánh mà ai cũng đăng tải là Astra đối đầu với GPT-5.6 Sol, và đây chính là chỗ mà một bội số không kèm ngày tháng trở nên sai lệch. Mức giá của Sol trên cùng trang đó, cùng ngày, là $4.00 đầu vào / $0.40 bộ nhớ đệm / $20.00 đầu ra — và OpenAI nêu rõ đây là giá khuyến mại áp dụng ít nhất đến ngày 21 tháng 11 năm 2026. So với mức giá khuyến mại đó, Astra đạt 2.5x ở cả đầu vào lẫn đầu ra. So với bảng giá niêm yết trước khuyến mại của Sol là $5.00 / $0.50 / $30.00, Astra đạt 2x ở đầu vào và khoảng 1.67x ở đầu ra. Cả hai con số đều đúng; chúng được chia cho những mẫu số khác nhau. Con số 2.5x là mức bạn trả hôm nay, còn 2x và 1.67x là mức bạn sẽ trả nếu chương trình khuyến mại của Sol kết thúc — và vì OpenAI chưa công bố mức giá nào sau khuyến mại, không ai có thể nói cho bạn biết ngân sách năm 2027 của bạn nên dùng con số nào. Nếu bạn thấy “2x” hoặc “2.5x” mà không có tên hạng dịch vụ và ngày tháng, thì bạn đang đọc một nửa sự thật.

Hai ghi chú định giá khác, vì chúng thường bị nhầm với giá niêm yết. Báo giá theo endpoint khác với bảng giá của chính OpenAI: các endpoint Azure từng được niêm yết ở cả $10/$50 và $11/$55, ít nhất một endpoint được niêm yết ở mức $20/$100, và một bảng niêm yết router cho thấy $10/$50 với một bậc batch ở $5/$25. Đó là các báo giá trên những endpoint riêng biệt, không phải giá niêm yết của OpenAI, và chúng không thể dùng thay thế cho nhau. Và để thấy quy mô, trên cùng một trang và cùng ngày: GPT-5.6 Terra là $2,00 / $0,20 / $12,00 và GPT-5.6 Luna là $0,20 / $0,02 / $1,20 — nên Astra không phải là model mà bạn đưa lưu lượng lớn qua theo phản xạ. Nó được định giá cho loại công việc mà các dòng benchmark ở trên mô tả: các tác vụ tầm xa, đầu-cuối, nơi thời gian thực ít hơn 47% và ít bước agent hơn có thể bù đắp cho mức giá token gấp 2,5 lần, chứ không phải cho chat.

Đó là phép tính mà ở đó một lớp định tuyến khẳng định được vị trí của mình, và thật đáng để nói cụ thể vì sao. GPT-6 Astra nằm trong danh mục của OrcaRouter với mã openai/gpt-6-astra, và nền tảng chuyển tiếp nguyên mức giá niêm yết của Ope​nAI với mức chênh 0% — nên khi nhà cung cấp đổi giá, kể cả mức giá khuyến mại mà phần này đang dựa vào, phía chúng tôi cập nhật ngay trong cùng ngày thay vì phải chờ một chu kỳ định giá lại. Điều đó cũng có nghĩa câu hỏi về các hạng ở trên không còn là giả định nữa: bạn có thể đặt Astra cho phần việc dài hạn và để Sol, Terra hay Luna lo khối lượng lớn, tất cả sau một khóa API duy nhất, không cần thêm hợp đồng hay thay đổi mã nguồn, và chuyển đổi dự phòng giữa chúng khi một cái bị suy giảm hiệu năng.

Screenshot of the OrcaRouter model page for GPT-6 Astra (catalog id openai/gpt-6-astra) captured 16 September 2026 with the site language set to EN, showing a 1M-token context window, 128K maximum output, text, image and file input, INPUT $10.00 and OUTPUT $50.00 per 1M tokens, p50 TTFT 6.70 s, p95 TTFT 10.00 s, 181.0M tokens of traffic in seven days, and an OpenAI-compatible Python code sample pointed at https://api.orcarouter.ai/v1 using the model id openai/gpt-6-astra.

Thông số kỹ thuật, thay đổi của Co​dex, và những gì Ope​nAI chưa công bố

ID mô hình — gpt-6-astra trong tài liệu của chính OpenAI.

Ngữ cảnh và đầu ra — cửa sổ ngữ cảnh 1.050.000 token, tối đa 128.000 token đầu ra.

Ngày cắt kiến thức — 30 tháng 4 năm 2026. Hỗ trợ token suy luận: có.

Các dạng thức — đầu vào được liệt kê là tệp, hình ảnh và văn bản. Mục liệt kê cụ thể đó đến từ một router, không phải từ OpenAI, và chúng tôi đang gắn nhãn nó là do router báo cáo thay vì được nhà cung cấp xác nhận.

Có sẵn trong — ChatGPT Work, Co​dex và API, cùng với Microsoft Azure và AWS Bedrock. Không gian làm việc dành cho doanh nghiệp mặc định bị tắt; quản trị viên bật quyền truy cập theo bảng giá áp dụng và nhận được các quyền kiểm soát để hạn chế những trang web và ứng dụng máy tính đã được phê duyệt, quản lý việc tải lên và tải xuống, cùng kiểm soát lịch sử duyệt web. ChatGPT Work và Co​dex bổ sung các chính sách xác nhận trước những hành động có hệ quả và đánh giá tự động các lệnh gọi công cụ không an toàn hoặc không được phép. Bốn plugin doanh nghiệp được phát hành cùng thời điểm trong ChatGPT Desktop: Oracle Analytics, Power BI (một dịch vụ của Microsoft Fabric), Navan và Avalara. Zero Data Retention khả dụng cho khách hàng API đủ điều kiện trên các endpoint được hỗ trợ, tùy thuộc vào sự phê duyệt.

Một cơ chế đáng được lưu ý vì nó thay đổi cách mô hình hành xử trong các công việc dài, chứ không phải cách nó tính điểm. Codex có một cách tiếp cận ngữ cảnh mới với Astra: các ghi chú tồn tại xuyên suốt các cửa sổ ngữ cảnh thay vì bị nén lặp đi lặp lại thành một bản tóm tắt duy nhất, và các cửa sổ ngữ cảnh trước đó vẫn có thể tìm kiếm được, nên các yêu cầu và kết quả kiểm thử từ những tin nhắn trước đó cùng đầu ra của công cụ vẫn có thể tìm thấy. OpenAI gọi đây là tính năng thử nghiệm, được bật trong config.toml của Codex, và cho biết nó sẽ trở thành mặc định cho Astra. Trên một benchmark được đo bằng 29 bước, đó chính là cơ chế có khả năng giải thích số bước nhất.

Điều không được công bố cũng quan trọng như điều được công bố. Ope​nAI đã không nêu số lượng tham số hay lượng tính toán huấn luyện cho mô hình này, và chúng tôi cũng không đưa ra con số nào. Con số "hơn 100.000 GPU tại Stargate" lưu truyền qua nguồn thứ cấp và không có trên những trang chúng tôi đã đọc. Tài liệu của Ope​nAI cũng không liệt kê "Astra Pro" với mức giá riêng hay tài liệu riêng, hay bất kỳ hạng nào khác — các bài viết có nhắc đến một hạng như vậy, nhưng danh mục trên router không phải là tài liệu của nhà cung cấp, và chúng tôi không giới thiệu một hạng mà chúng tôi không thể tìm thấy trong tài liệu của chính Ope​nAI.

Điều mà người đọc thực sự nên rút ra từ điều này

Hãy sắp xếp các hàng theo mức độ chúng nên tác động đến một quyết định. Cặp đã bão hòa — 98% trên FrontierMath Tier 4 và 99.9% trên ARC-AGI-3 — không nên tác động đến nó chút nào; chúng cho thấy các benchmark đã đi đến hồi kết, chứ không phải rằng Astra đã thắng chúng. 100% của ExploitBench là thật và phần lớn không thể tận dụng qua mô hình công khai do thiết kế; đây là một lựa chọn an toàn có chủ đích, chứ không phải một hạn chế cần lách qua. Terminal-Bench 4.0 là tuyên bố hiệu năng mạnh nhất từ nhà cung cấp, với khoảng cách thực sự so với Sol và khoảng cách 2,1 điểm so với Claude Fable 5.1 — quá sát để phân định. DeepSWE v1.1 là hàng duy nhất được đo lường độc lập; nó đưa Astra vào thế ba bên đồng hạng ở ngôi đầu thay vì đứng một mình, và số bước cùng số token của nó là phần đáng trích dẫn trong kết quả đó. 40 phút mỗi tác vụ của OSWorld 2.0 là con số có ý nghĩa vận hành nhất trên trang, và cũng là con số ít được kiểm chứng độc lập nhất. Các hàng về an toàn là nội bộ, chưa được tái lập, và chỉ đúng hướng.

Điều đó để lại một sự phân tách hết sức rõ ràng. Nếu tuần này bạn đang chọn một mô hình cho công việc agentic tầm xa — viết mã nhiều giờ, sử dụng máy tính, các tác vụ đầu-cuối mà nếu không thì con người sẽ phải trông coi — thì Astra là mô hình có nhiều bằng chứng hiện thời nhất ủng hộ, và bài toán chi phí dựa trên thời gian tiết kiệm được mỗi tác vụ chứ không phải token tiết kiệm được mỗi lần gọi. Nếu bạn đang chọn cho công việc khối lượng lớn, tương tác ngắn, thì mức 2,5 lần so với giá khuyến mãi của Sol là con số quyết định, và câu trả lời có lẽ là không. Và nếu bạn đang chọn dựa trên sức mạnh của 98% hay 99,9%, thì bạn đang chọn dựa trên hai hàng đã không còn mang thông tin.

Những câu hỏi đáng đặt ra mà trang này chưa trả lời

Mức dẫn 2,1 điểm trên Terminal-Bench so với Claude Fable 5.1 có thật không? Không, dựa trên bằng chứng này thì không. Cả hai con số đều đến từ việc OpenAI tự đo mô hình của chính mình so với một đối thủ, trong những khung đánh giá mà chúng ta không thể so sánh, và không có dung sai tính điểm nào được công bố. Đó là mức dẫn theo cách tính của chính OpenAI và nó nằm trong khoảng mà một lần chạy lại có thể đảo ngược. Cách để giải quyết là chạy cả hai trên tác vụ của chính bạn, việc này tốn vài giờ làm việc và đáng giá hơn 2,1 điểm.

Tại sao bảng xếp hạng của Datacurve không tôn Astra lên ngôi, khi tài liệu ra mắt của OpenAI trích dẫn một kỷ lục? Bởi vì bảng xếp hạng đang đo lường, còn trang ra mắt đang chào hàng. Bản chụp nhanh của chính Datacurve cho thấy ba mô hình ở mức 74% với các khoảng tin cậy chồng lấn và không đánh dấu mô hình dẫn đầu. Một tuyên bố kỷ lục đối chiếu với một bảng xếp hạng đồng hạng không hẳn là lời nói dối mà đúng hơn là một lựa chọn mẫu số — cùng kiểu thất bại như bội số 2.5x, và là lý do chúng tôi đã ghi ngày cho mọi con số ở đây.

Nếu các benchmark hàng đầu đã bão hòa, vậy người mua nên dùng gì thay thế? Thời gian cho mỗi tác vụ, chi phí cho mỗi tác vụ hoàn thành, và số bước trong công việc dài hạn — những chiều mà các con số vẫn còn phân tán và vẫn tương quan với số tiền mà một nhóm phải trả. Đó là một phép đo khó tìm thấy được công bố hơn, và chính vì vậy mà các trang ra mắt của nhà cung cấp vẫn dẫn đầu bằng những chỉ số đã bão hòa.

Câu hỏi mở

Con số sẽ khiến trang này nhanh lỗi thời nhất chính là mức giá. Mức giá khuyến mãi của Sol kéo dài ít nhất đến ngày 21 tháng 11 năm 2026, và Ope​nAI chưa công bố mức giá nào sau khuyến mãi; khi điều đó thay đổi, mức 2.5x trong bài viết này cũng thay đổi theo, theo hướng về mức 2x. Điều thứ hai là liệu có ai chạy lại các đánh giá này một cách độc lập trên cùng một harness hay không — DeepSWE là hình mẫu cho việc đó nên diễn ra thế nào, và OSWorld 2.0 cùng Terminal-Bench 4.0 là hai hàng cần được xử lý như vậy nhất. Cho đến lúc đó, tóm tắt trung thực về các benchmark của GPT-6 Astra là: những con số ấn tượng đã bão hòa, những con số phân biệt được là do nhà cung cấp báo cáo và khá sát nhau, còn con số độc lập duy nhất là một kết quả hòa mà chính tài liệu ra mắt của nhà cung cấp gọi là kỷ lục.

So sánh trong bài viết này2

Phát hiện từ bài viết này · Benchmark: Artificial Analysis · cập nhật hằng ngày