
GPT-6 Astra trong Codex: Ghi chú xuyên cửa sổ, Các mức độ nỗ lực và Hóa đơn thực sự
- orcaMỚIOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 trên 1 triệu token
- deepseekMỚIDeepSeek: DeepSeek V4.1 Flash2026-09-1040Trí tuệ
- openaiMỚIOpenAI: GPT-6 Astra2026-09-0453Trí tuệ77Lập trình
- googleGoogle: Gemini 3.8 Flash2026-09-0241Trí tuệ76Lập trình
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Trí tuệ76Lập trình
- anthropicAnthropic: Claude Fable 5.12026-09-0153Trí tuệ82Lập trình
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 trên 1 triệu token
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Trí tuệ72Lập trình
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 trên 1 triệu token
- z-aiZ.ai: GLM 5.32026-08-1845Trí tuệ75Lập trình
- obsidianQwen3.8 27B2026-08-1534Trí tuệ68Lập trình
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Trí tuệ69Lập trình
- grokSpaceXAI: Grok 4.62026-08-1244Trí tuệ77Lập trình
- metaMeta: Muse Spark 1.22026-08-0540Trí tuệ72Lập trình
- qwenQwen: Qwen3.8 Max2026-08-0345Trí tuệ76Lập trình
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135Trí tuệ69Lập trình
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 trên 1 triệu token
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2451Trí tuệ78Lập trình
GPT-6 Astra là một mô hình ngày 2026-09-03, và trang này không phải bài đưa tin ra mắt — đây là tài liệu tham chiếu để trỏ coding agent của bạn vào nó khi nó đã được cung cấp rộng rãi. Lý do một nhà phát triển sẽ chuyển sang dùng nó là một cơ chế cụ thể, và đáng để hiểu trước khi bạn chi bất cứ thứ gì cho nó: thay vì nén một phiên dài thành một bản tóm tắt hao hụt duy nhất mỗi khi cửa sổ đầy, Codex với GPT-6 Astra lưu ghi chú xuyên các cửa sổ ngữ cảnh và giữ các cửa sổ ngữ cảnh trước đó vẫn có thể tìm kiếm được, nên một yêu cầu bạn đã nêu bốn mươi lượt trước và đầu ra kiểm thử đã thất bại mười lượt trước đều vẫn truy xuất được thay vì bị tóm tắt mất đi. OpenAI gọi tính năng này là thử nghiệm, bật nó bằng một dòng trong Codex config.toml của bạn, và nói rằng nó sẽ trở thành mặc định cho Astra. Mọi thứ dưới đây — cấu hình chính xác, các mức nỗ lực, kết quả đo được, và một hóa đơn phiên làm việc đã tính cụ thể có nêu dòng đầu vào được cache — đều được đọc từ chính các trang của OpenAI vào ngày 2026-09-16, và mọi số liệu của bên thứ ba đều được ghi nhãn như vậy.
Hai điều đã xảy ra trong tuần này làm thay đổi cách tính chuyện áp dụng nó. Vào ngày 12-09-2026, trưởng nhóm Codex của OpenAI đã công bố một bài phân tích sau sự cố xác nhận rằng bản thân thí nghiệm quản lý ngữ cảnh có lỗi — nó gây ra việc dừng sớm và trả lời các tin nhắn cũ, và đã bị tắt đối với khoảng 4.000–5.000 người dùng đang dùng nó — và OpenAI đã phát hành đợt đặt lại toàn bộ mức sử dụng cho người dùng Codex và Astra vào nửa đêm ngày 09-12 sang 09-13. Cùng tuần đó, các không gian làm việc doanh nghiệp vốn tắt Astra theo mặc định khi ra mắt đã trở nên có thể quản trị theo bảng giá riêng của họ. Vậy nên quan điểm trung thực là: cơ chế này đáng để áp dụng, bản dựng vẫn đang thay đổi ngay dưới chân bạn, và bạn nên thử nó trên một nhánh thay vì một hạn chót.
Điều gì thực sự mới trong Codex với GPT-6 Astra
Hãy bảo bất kỳ agent lập trình nào làm việc trong sáu giờ, và bạn sẽ đụng phải cùng một bức tường. Cửa sổ ngữ cảnh đầy lên, harness tóm tắt bản ghi hội thoại thành một khối đặc duy nhất để tạo chỗ trống, và bản tóm tắt bị mất mát thông tin đúng theo cái cách gây đau — lý do một bản sửa lỗi trước đó thất bại, hình dạng chính xác của một bài kiểm thử đang hỏng, một ràng buộc mà người dùng nhắc thoáng qua ở lượt thứ ba. Chi tiết được truy xuất, chứ không phải chi tiết được tóm tắt, mới là thứ bạn thực sự muốn.
Sự tích hợp Codex của Astra làm thay đổi hình thái của điều đó. Tài liệu Codex của OpenAI nói rõ điều đó: "Astra lưu ghi chú xuyên các cửa sổ ngữ cảnh và có thể tìm kiếm các tin nhắn trước đó và kết quả công cụ từ cùng một tác vụ." Ghi chú có độ bền và có thể ghi; lịch sử phía sau chúng vẫn có thể đọc được, nên một cửa sổ trước đó vẫn có thể được tìm kiếm để tìm bằng chứng gốc ngay cả sau khi ghi chú về nó đã được viết. Các yêu cầu và kết quả kiểm thử từ các tin nhắn trước đó và đầu ra công cụ vẫn có thể tìm thấy được.
OpenAI nói rõ rằng đây không phải là công việc đã hoàn thiện. Tài liệu tham chiếu cấu hình của họ mô tả cờ này là “Bật quản lý ngữ cảnh thử nghiệm (mặc định tắt)” và nói rằng tính năng này “sử dụng ghi chú và lịch sử có thể tìm kiếm để lưu giữ các chi tiết tích lũy”. Tài liệu cũng nêu rằng tính năng này “không khả dụng với đăng nhập bằng Business, Enterprise hoặc khóa API khi ra mắt”. Đây cũng không phải là ngữ cảnh vô hạn — mô hình vẫn suy luận trong một cửa sổ hữu hạn, và mỗi lần đọc lại một ghi chú trước đó sẽ tiêu tốn ngân sách đầu vào của lượt đó. Cửa sổ là 1.050.000 token với tối đa 922.000 token đầu vào, theo tài liệu mô hình của OpenAI; cơ chế ghi chú nằm trên nền tảng đó, chứ không thay thế nó.
Cấu hình đó, đúng chính xác như những gì OpenAI ghi trong tài liệu
Cài đặt này là một mục con của bảng [features] trong config.toml Codex của bạn — tệp nằm trong ~/.codex/ trừ khi bạn đã ghi đè CODEX_HOME. Đường dẫn khóa được ghi trong tài liệu là features.context_management.experimental_mode, một boolean, và giá trị là true:
[features.context_management]
experimental_mode = true
Nếu bạn đã có một bảng [features] trong tệp, hãy thêm khóa tương ứng vào bên trong bảng đó thay vì khai báo bảng hai lần:
[features]
context_management.experimental_mode = true
Hãy dùng một dạng hoặc dạng kia. Các bài viết của cộng đồng về cờ này cho biết rằng việc khai báo đường dẫn có dấu chấm ở gốc rồi sau đó mở một bảng [features] ở phần sau trong cùng tệp có thể bị lỗi phân tích cú pháp với lý do bảng được khai báo lại, đây là quy tắc của TOML chứ không phải của OpenAI — nhưng nó khiến người ta vấp phải, vì vậy hãy chọn một dạng và giữ nguyên dạng đó. Sau khi chỉnh sửa, hãy bắt đầu một mới tác vụ: cài đặt không tự động áp dụng trở lại cho một phiên đang chạy.
Phần model của cùng tệp đó thì không có gì đáng chú ý, và tài liệu tham chiếu của OpenAI ghi rõ trực tiếp các khóa này — model là "Model to use", model_provider mặc định là openai:
model = "gpt-6-astra"
model_provider = "openai"
model_reasoning_effort = "high"
Một lưu ý khi đọc các phiên bản tài liệu. Tài liệu tham chiếu cấu hình Codex liệt kê model_reasoning_effort chấp nhận các giá trị minimal, low, medium, high và xhigh, đồng thời lưu ý rằng xhigh phụ thuộc vào từng mô hình — trong khi trang mô hình API của OpenAI dành cho gpt-6-astra ghi reasoning.effort là low, medium, high, xhigh và max. Thanh trượt trên client và API không mô tả cùng một tập giá trị, vì vậy hãy đặt effort một cách tường minh và xác nhận giá trị mà client của bạn đã chấp nhận thay vì phỏng đoán.
Chọn mô hình — và quy tắc truy cập khiến nhiều người mắc bẫy
Tài liệu về mô hình Codex của OpenAI đưa ra trực tiếp dạng CLI: codex -m gpt-6-astra. Trong một phiên tương tác, /model chuyển đổi mô hình và điều chỉnh mức độ suy luận; khi chạy một lần, codex exec -m gpt-6-astra "Review the current changes" cũng hoạt động theo cách tương tự. Trong ứng dụng desktop và tiện ích mở rộng IDE, phần điều khiển mô hình nằm bên dưới khung soạn thảo.
Quy tắc truy cập là chỗ mọi người hay làm sai, và đáng để đọc lại hai lần vì hai tính năng này có những cổng khác nhau:
• Mô hình này — hiện có mặt trên ChatGPT Work, Codex và API, đồng thời cũng được cung cấp trên Microsoft Azure và AWS Bedrock. Trang ra mắt của OpenAI cho biết Astra đang “được triển khai từ hôm nay cho một nhóm tổ chức hạn chế và trong những ngày tới sẽ trở nên khả dụng cho tất cả người dùng ChatGPT Plus, Pro, Business và Enterprise”.
• Tính năng quản lý ngữ cảnh thử nghiệm — hẹp hơn. Tài liệu của OpenAI nêu rõ rằng nó "Yêu cầu đăng nhập ChatGPT trên Plus, Pro hoặc Pro Lite" và rằng nó "không khả dụng với đăng nhập Business, Enterprise hoặc API-key khi ra mắt".
Dòng thứ hai là dòng bạn cần ghi nhớ. Bạn có thể gọi gpt-6-astra bằng khóa API và có thể trả tiền cho nó trên gói Business — nhưng tính năng ghi chú xuyên cửa sổ sẽ không có ở đó. Nếu cơ chế ghi chú là lý do bạn chuyển đổi, bạn cần đăng nhập ChatGPT Plus, Pro hoặc Pro Lite trong ứng dụng Codex, chứ không phải khóa API. OpenAI diễn đạt nó là sự khả dụng phụ thuộc vào "việc triển khai, phương thức đăng nhập của bạn và ứng dụng khách của bạn", đây là cách nói lịch sự của cùng một điều.

Hai lưu ý bổ sung nữa, được ghi nhãn là thông tin được báo cáo chứ không phải do nhà cung cấp ghi trong tài liệu. Các bài đưa tin về đợt triển khai nói rằng cần Codex CLI phiên bản 0.153.0 trở lên đối với Astra; chúng tôi không thể xác nhận ngưỡng phiên bản đó trên các trang của chính OpenAI. Và tài liệu Codex mô tả các preset trong trình chọn mô hình — Astra Light, Astra Medium, Astra Extra High, được cung cấp cho các tài khoản Pro, Business ($100) và Enterprise đủ điều kiện cùng với thanh trượt suy luận. Đó là các vị trí trong trình chọn, không phải sản phẩm riêng biệt: OpenAI ghi trong tài liệu một ID mô hình duy nhất, gpt-6-astra, với một bộ thông số kỹ thuật và một mức giá, và không công bố thông số kỹ thuật hay mức giá riêng cho bất kỳ cấu hình "Astra Pro" hay "Astra Medium" nào. Hãy coi mọi con số được trích dẫn cho một hạng Astra có tên là chưa được xác minh.
Nếu bạn muốn dùng thử model trước khi cam kết đưa nó vào lộ trình sản xuất, thì việc định tuyến nó qua một endpoint cùng với model hiện tại của bạn là cách rẻ nhất để tìm ra câu trả lời — GPT-6 Astra có trong danh mục của OrcaRouter, nên một lần chạy so sánh chỉ tốn của bạn một chuỗi model thay vì một hợp đồng thứ hai và một SDK thứ hai.
Nỗ lực suy luận: năm cấp độ, và mỗi cấp độ tốn bao nhiêu
Tài liệu API của OpenAI cho gpt-6-astra liệt kê năm mức nỗ lực — low, medium, high, xhigh và max — và hướng dẫn của Codex nói thẳng về cách dùng chúng: “Hãy dùng mức nỗ lực suy luận thấp nhất tạo ra kết quả bạn cần,” và hãy bắt đầu ở mức mặc định, tăng lên khi một tác vụ cần lập kế hoạch sâu hơn.
Lý do lời khuyên đó đắt đỏ nếu bỏ qua trên riêng mô hình này nằm ở chỗ các token suy luận rơi vào đâu trên hóa đơn. Token suy luận là token đầu ra, và đầu ra trên Astra là $50.00 mỗi triệu — gấp mười lần mức giá đầu vào và gấp năm mươi lần mức giá đầu vào được lưu đệm. Vậy nên sự đánh đổi này không hề trừu tượng:
• Mỗi 1.000 token suy luận bổ sung mỗi lượt tốn $0.05 theo mức giá đầu ra.
• Trong một phiên gồm 150 lượt, việc giữ thêm 1.000 token suy luận mỗi lượt tốn khoảng $7.50; giữ thêm 5.000 tốn khoảng $37.50.
• Trong phiên làm việc được trình bày chi tiết dưới đây, output vốn đã là dòng đơn lớn nhất với $0.200 mỗi lượt, so với $0.090 của cache reads — tăng trưởng reasoning chính là yếu tố khiến tổng thay đổi nhanh nhất.
Việc OpenAI khôngcông bố là một bảng theo từng mức effort: không có con số nào từ nhà cung cấp về việc xhigh hay max phát ra bao nhiêu token suy luận trong một tác vụ lập trình so với medium, và cũng không có benchmark nào của nhà cung cấp được tách riêng theo mức effort. Bất cứ ai trích dẫn cho bạn một tỷ lệ chính xác kiểu "max tốn gấp 2 lần" đều đang trích dẫn phép đo của chính họ, chứ không phải của OpenAI. Cách làm trung thực là chạy một tác vụ đại diện ở hai mức effort rồi đọc khối usage trong phản hồi — con số đó, nhân với 50 USD mỗi triệu, chính là phần phụ trội effort thực sự của bạn.
Các kết quả đo được, mỗi kết quả đều có nguồn riêng
Công việc lập trình và terminal, tất cả đều do nhà cung cấp OpenAI báo cáo trừ khi có ghi chú khác. Terminal-Bench 4.0: GPT-6 Astra đạt 57,9%, so với 37,3% của GPT-5.6 Sol và 55,8% của Claude Fable 5.1 — với việc OpenAI ước tính chi phí API trên mỗi tác vụ thấp hơn khoảng 9% so với GPT-5.6 Sol và thấp hơn 63% so với Claude Fable 5.1. DeepSWE v1.1 của Datacurve đưa Astra lên 74,1% trên chuẩn đánh giá của chính Datacurve, một con số được Datacurve mô tả là kỷ lục mới và được một số bài đưa tin làm tròn thành 74%. Trên tập tác vụ agentic rộng hơn, OpenAI báo cáo OSWorld 2.0 đạt 72,6% với khoảng 40 phút mỗi tác vụ — thời gian mỗi tác vụ ít hơn khoảng 47% so với GPT-5.6 Sol — cùng với FrontierMath Tier 4 đạt 98%, ARC-AGI-3 đạt 99,9% và ExploitBench đạt 100%, tất cả đều được OpenAI mô tả là các mức đã bão hòa hoặc bão hòa trên thực tế. Đó là các con số của nhà cung cấp; chúng tôi chưa tái lập chúng, và việc xem xét độc lập của ARC Prize đối với con số ARC-AGI-3 cho thấy nó được đo trong một môi trường adapter đặc biệt của nhà cung cấp và giảm trong các điều kiện tiêu chuẩn.
Phần không phải là con số do nhà cung cấp đưa ra mới là phần mà một quy trình đánh giá mã nên quan tâm nhất. CodeRabbit đã công bố đánh giá của riêng mình về Astra vào ngày 2026-09-04, và kết quả hẹp hơn tiêu đề. Trên các pull request xuyên tệp — những đánh giá khó đòi hỏi phải kết nối một thay đổi với những hệ quả ở nơi khác trong cơ sở mã — Astra bắt được nhiều hơn khoảng 20% lỗi so với GPT-5.6 Sol, với mức bao phủ lỗi có thể xử lý là 57,1% so với 47,6%. Trong các đánh giá tổng thể, mức tăng gần như tan biến: 61,3% so với 59,0%, nhiều hơn khoảng 4%. CodeRabbit mô tả cả hai là "kết quả ban đầu, mang tính định hướng", không thiết lập nên một thứ hạng, và lưu ý rằng phương pháp của mình không tách biệt được nguyên nhân của sự cải thiện. Trang ra mắt của OpenAI mô tả cùng công việc đó là "hơn gấp đôi trên các pull request xuyên tệp"; bài viết của chính CodeRabbit đưa ra con số 20% và các tỷ lệ bao phủ ở trên. Hãy đọc các tỷ lệ phần trăm, không phải phần tóm tắt.

Sự bất đối xứng đó là con số hữu ích nhất trên trang này để quyết định cách triển khai mô hình, và nó cùng hướng với mức giá: lợi ích tập trung vào suy luận xuyên tệp, vì vậy đó chính là nơi bạn nên dùng mô hình.
Việc sử dụng máy tính trong Codex thay đổi điều gì cho quy trình làm việc của bạn?
OpenAI cho biết harness Codex cập nhật giúp GPT-6 Astra hoàn thành tác vụ nhanh hơn 1,9 lần trên Mind2Web so với trải nghiệm GPT-5.6 Sol hiện tại. Mind2Web là tự động hóa tác vụ web, nên hãy hiểu điều đó là: công việc tác nhân phải chạm đến trình duyệt hoặc GUI sẽ hoàn thành nhanh hơn đáng kể, và chính harness cập nhật đó là thứ bạn đang chạy khi bạn điều khiển Codex nói chung. Con số đi kèm là kết quả OSWorld 2.0 ở trên — 72,6% với khoảng 40 phút mỗi tác vụ, ít hơn khoảng 47% thời gian mỗi tác vụ so với Sol.
Đối với một nhà phát triển, hệ quả thực tế là sự thay đổi về những gì đáng để giao phó. Những quy trình trước đây quá chậm để tự động hóa từ đầu đến cuối — điều khiển bảng điều khiển staging không có API, tái hiện lỗi qua giao diện người dùng, đi qua biểu mẫu nhiều bước để tạo fixture — nay nằm trong phạm vi mà một lượt chạy agent rẻ hơn làm thủ công. Nó cũng nâng cao giá trị của các biện pháp kiểm soát phía doanh nghiệp mà OpenAI phát hành kèm theo: ChatGPT Work và Codex bổ sung các chính sách xác nhận, nghĩa là phê duyệt trước những hành động quan trọng, và đánh giá tự động các lệnh gọi công cụ không an toàn hoặc không được phép. Nếu bạn để một agent nhấp qua một giao diện thật, lớp đánh giá đó chính là thứ đứng giữa một lượt chạy tồi và một buổi chiều tồi tệ — và đó là lý do việc quyền truy cập cấp doanh nghiệp mặc định bị tắt, với việc quản trị viên bật nó theo bảng giá áp dụng, là một tính năng quản trị chứ không phải một trở ngại.
Định giá theo quy trình, không phải theo token
Đây là mức giá, kèm tên và ngày cụ thể. Trên trang định giá của OpenAI, đọc ngày 2026-09-16, gpt-6-astra standard là 10,00 USD mỗi triệu token đầu vào, 1,00 USD mỗi triệu token đầu vào được lưu đệm, 12,50 USD mỗi triệu lần ghi bộ đệm và 50,00 USD mỗi triệu token đầu ra. Batch và Flex chạy ở mức bằng một nửa các mức đó; chế độ Fast tăng gấp đôi chúng. Dòng đầu vào được lưu đệm đó chính là thứ quyết định hóa đơn của bạn trong vòng lặp agentic, bởi vì một agent lập trình gửi lại một ngữ cảnh lớn, gần như không đổi ở mỗi lượt, và đầu vào được lưu đệm chỉ tốn một phần mười so với đầu vào mới.
Có hai ngưỡng cần lưu ý trước khi làm phép tính. Tài liệu mô hình của OpenAI nêu rằng các prompt trên 272.000 token đầu vào được tính giá gấp 2 lần mức đầu vào và mức cache, cùng gấp 1,5 lần mức đầu ra cho toàn bộ yêu cầu — không chỉ phần vượt — và trang định giá có dòng ngữ cảnh dài ở mức $20.00 đầu vào, $2.00 đầu vào được cache và $75.00 đầu ra. Và mọi token suy luận đều được tính theo mức giá đầu ra, như đã nêu ở trên.
Hãy lấy một ví dụ tái cấu trúc qua đêm thực tế: 150 lượt mô hình, trung bình 100.000 token đầu vào mỗi lượt, trong đó 90.000 là đọc cache và 10.000 là mới, cùng 4.000 token đầu ra mỗi lượt bao gồm cả suy luận. Dưới ngưỡng 272K, ở mức giá tiêu chuẩn:
• Đầu vào đã lưu trong bộ nhớ đệm — 90.000 token × 1,00 USD mỗi triệu = 0,090 USD mỗi lượt
• Đầu vào mới — 10.000 token × 10,00 USD mỗi triệu = 0,100 USD mỗi lượt
• Đầu ra — 4.000 token × $50,00 mỗi triệu = $0,200 mỗi lượt
• Tổng — $0.390 mỗi lượt, vậy 150 lượt khoảng $58.50 cho phiên
Bây giờ hãy đưa cùng phiên đó vượt qua ngưỡng. Ở 300.000 token đầu vào mỗi lượt — 270.000 được lưu trong bộ nhớ đệm, 30.000 mới — toàn bộ yêu cầu được tính giá lại, do đó đầu vào được lưu trong bộ nhớ đệm tăng gấp đôi lên $2.00, đầu vào mới tăng gấp đôi lên $20.00 và đầu ra tăng lên $75.00:
• Đầu vào được lưu trong bộ nhớ đệm — 270.000 × $2,00 mỗi triệu = $0,540 mỗi lượt
• Đầu vào mới — 30.000 × $20,00 mỗi triệu = $0,600 mỗi lượt
• Đầu ra — 4.000 × $75,00 mỗi triệu = $0,300 mỗi lượt
• Tổng cộng — $1,44 mỗi lượt, hoặc khoảng $216,00 cho 150 lượt
Cùng một dạng tác vụ, hóa đơn cao hơn khoảng 3,7 lần, và toàn bộ khác biệt nằm ở việc bản ghi của bạn rơi vào bên nào của 272.000 token. Đó là lập luận cho cơ chế ghi chú trong một câu: nếu các ghi chú bền vững và lịch sử có thể tìm kiếm cho phép bạn giữ ngữ cảnh làm việc gọn gàng hơn thay vì kéo toàn bộ bản ghi về phía trước, thì tính năng này tự hoàn vốn bằng token đầu vào trước khi nó kịp giúp cải thiện chất lượng. Đó cũng là lập luận cho việc không để một lượt chạy không giám sát làm bản ghi phình to mà không có giới hạn.

Để dễ hình dung quy mô, cùng một phiên 150 lượt với cùng cấu hình token trên các bậc giá rẻ hơn: GPT-5.6 Terra ở mức giá công bố $2.00 đầu vào / $0.20 lưu đệm / $12.00 đầu ra tính ra khoảng $12.90, còn GPT-5.6 Luna ở mức $0.20 / $0.02 / $1.20 tính ra khoảng $1.29. Đó là phép tính dựa trên mức giá công bố của OpenAI, không phải là khẳng định rằng chúng sẽ hoàn thành cùng một nhiệm vụ — và đó chính là toàn bộ ý chính của hai phần tiếp theo.
Nếu bạn đang so sánh tất cả những điều này giữa các nhà cung cấp, thì đáng để biết rằng OrcaRouter chuyển nguyên mức giá niêm yết của nhà cung cấp với mức chênh lệch 0%, nên khi nhà cung cấp thay đổi giá, endpoint định tuyến sẽ cập nhật ngay trong cùng ngày thay vì đợi đến hóa đơn tiếp theo.
Các chế độ lỗi cần thiết kế để phòng tránh
Astra là một mô hình tầm xa (long-horizon) dựa trên thiết kế ngữ cảnh dài (long-context), và cả hai vế của mô tả đó chính là nơi các vấn đề nằm ở đó. Đây là những phát hiện từ cộng đồng và báo cáo hậu kiểm của nhà cung cấp, không phải các phép đo của chúng tôi.
• Thử nghiệm quản lý ngữ cảnh đã gặp lỗi trong tuần này. Bản phân tích sau sự cố ngày 2026-09-12 của OpenAI xác nhận thử nghiệm tự nguyện tham gia "gây ra việc dừng sớm và trả lời các tin nhắn cũ", ảnh hưởng đến khoảng 4.000–5.000 người dùng và nó đã bị vô hiệu hóa. Cùng bản phân tích này nêu tên hai nguyên nhân khác dẫn đến các phàn nàn về chất lượng trong tuần ra mắt: các kỹ năng được viết cho các mô hình trước đó bị kích hoạt sai và khiến Astra không thể tự kiểm tra công việc của mình, và các công cụ phục vụ bị cấu hình sai làm suy giảm một phần lưu lượng truy cập. Một lần đặt lại mức sử dụng đã diễn ra sau đó vào nửa đêm ngày 09-12 sang 09-13.
• Suy nghĩ quá mức và kiểm thử tràn lan. Một luồng thảo luận r/codex được chia sẻ rộng rãi mô tả việc Astra phản hồi một yêu cầu tính năng nhỏ bằng cách trước tiên dựng nên các lớp xác minh, kiểm thử smoke và kiểm tra hash, chạy chúng theo nhiều thứ tự khác nhau, và báo cáo rằng đồng hồ đo mức sử dụng đã gần cạn kiệt từ lâu trước khi tính năng đó tồn tại. Các báo cáo này là lời kể cá nhân chứ không phải các phép đo có kiểm soát, và những phàn nàn tương tự đã lan truyền về các mô hình tiên phong khác vào tháng trước — vì vậy hãy coi đó là một mô thức thực tế để đối chiếu khi xác định phạm vi, chứ không phải một tỷ lệ mà bạn có thể dựa vào để lập kế hoạch.
• Những lượt chạy không kết thúc. Armin Ronacher, người tạo ra Flask, đã kể lại việc để Astra chạy không giám sát trong 35 giờ, đến cuối thời gian đó nó đã tạo ra khoảng 75.000 dòng ròng trên 79 commit, khoảng 1.400 tin nhắn giữa các agent và khoảng 1.200 USD phí API — khoảng 15,50 USD mỗi commit — và theo đánh giá của ông, không có gì giá trị được tạo ra. Các báo cáo về số lượng token có khác nhau, nên hãy xem con số đó một cách tương đối. Ông cho rằng điều kiện dừng còn thiếu vừa là vấn đề của harness vừa là vấn đề của mô hình, và đó là cách hiểu có thể hành động: hãy xác định sự hoàn thành trước khi bạn bắt đầu.
• Kiểu thất bại ngược lại cũng tồn tại. Các báo cáo từ cộng đồng mô tả Astra dừng lại trước khi hoàn thành một tác vụ và chờ một prompt để tiếp tục, đây cũng chính là nguyên nhân gốc đó nhìn từ phía ngược lại — một khái niệm "done" chưa được đặc tả đầy đủ. Việc định nghĩa rõ ràng "done" chính là dòng có giá trị cao nhất trong prompt tác vụ của bạn.
• Các phiên dài có thể trở nên không thể khôi phục. Các vấn đề mở của Codex báo cáo một tình huống tiến thoái lưỡng nan khi cửa sổ ngữ cảnh đầy, tính năng nén tự động kích hoạt, tác vụ nén tự nó hết ngữ cảnh, và chuỗi hội thoại không thể khôi phục — và riêng biệt, rằng các tuyến ghi chú và lịch sử gốc trả về 404 trên Pro với Astra trong một số cấu hình, trong khi việc hoán đổi cửa sổ có thể làm mất trạng thái tác vụ. Cả hai đều là báo cáo mở chứ không phải tuyên bố từ nhà cung cấp, nhưng chúng lập luận cho việc giữ các lần chạy được đánh dấu kiểm tra trong git thay vì tin tưởng rằng phiên sẽ tồn tại.
• Ghi chú lỗi thời là một đặc tính thiết kế, không phải lỗi. Không có gì đảm bảo rằng một ghi chú phản ánh trạng thái hiện tại của tệp mà nó mô tả, và tìm kiếm là khớp chuỗi con theo nghĩa đen chứ không theo ngữ nghĩa. Hãy lưu đường dẫn nguồn cùng với ghi chú, xác minh lại mỗi khi có thay đổi, và coi ghi chú từ một lần chạy không có người giám sát là bằng chứng cần kiểm tra chứ không phải chân lý để tin cậy.
• Giới hạn sử dụng là khiếu nại đang được phản ánh. Các báo cáo từ tuần 2026-09-14 bao gồm mức giới hạn chặt hơn tới bốn lần so với tuần ra mắt, cùng một khiếu nại chưa được giải quyết rằng mức nỗ lực xhigh tiêu tốn ít hạn mức hơn mức medium — nếu đúng, điều này nghĩa là mức nỗ lực và hạn ngạch không đi đôi với nhau. OpenAI chưa công bố giới hạn số theo từng gói cho Astra.
Khi một mô hình rẻ hơn là lựa chọn đúng đắn
Kết quả đo lường ở trên tự đưa ra quyết định định tuyến cho bạn. Lợi thế của Astra tập trung vào những công việc trải dài qua nhiều tệp hoặc kéo dài hàng giờ: đánh giá xuyên tệp, tác vụ agent tầm xa, luồng sử dụng máy tính. Đối với các chỉnh sửa một tệp thông thường, tái cấu trúc máy móc, dàn dựng kiểm thử và định dạng, mức chênh lệch đánh giá tổng thể ~4% so với GPT-5.6 Sol không biện minh cho mức giá trên mỗi token hiện tại cao gấp khoảng 2,5 lần — và kết luận của chính CodeRabbit cũng chỉ về cùng hướng, đề xuất định tuyến tác vụ thông minh thay vì thay thế toàn bộ. Hãy dành mô hình đắt tiền cho những tác vụ mà lợi thế của nó thể hiện rõ, và định tuyến phần còn lại xuống.
Cụ thể, một cách phân chia hiệu quả: GPT-6 Astra cho các thay đổi xuyên nhiều tệp, các codebase lạ, các lượt chạy agent kéo dài nhiều giờ và mọi thứ liên quan đến trình duyệt; GPT-5.6 Terra cho các chỉnh sửa có phạm vi giới hạn, boilerplate và tạo bài kiểm thử; GPT-5.6 Luna cho phân loại, trích xuất và các lượt xử lý cơ học khối lượng lớn. Dựa trên phép tính phiên ở trên, sự khác biệt giữa việc chạy mọi thứ trên Astra và chạy một phần ba trong số đó trên Astra chính là sự khác biệt giữa khoảng $58.50 và khoảng $28 cho cùng 150 lượt.
Việc phân chia đó cho đúng chính là mục đích của một lớp định tuyến. OrcaRouter đưa hơn 200 mô hình về sau một API duy nhất, nên sự phân chia ở trên chỉ là một thay đổi cấu hình thay vì ba tích hợp — và cơ chế chuyển đổi dự phòng tự động có nghĩa là một tính năng thử nghiệm gặp một tuần tồi tệ, như trường hợp này, sẽ chỉ làm suy giảm lượt chạy của bạn thay vì kết thúc nó. Với một mô hình mà chính OpenAI vẫn còn dán nhãn cơ chế ngữ cảnh của nó là thử nghiệm và đã từng tạm thời vô hiệu hóa, việc cấu hình sẵn một đường dẫn thứ hai không phải là hoang tưởng; đó là mức độ thận trọng đúng mức.
Những điều cần theo dõi từ đây
Bốn điều có thể thay đổi trang này, và cả bốn đều đang bỏ ngỏ. Liệu thử nghiệm quản lý ngữ cảnh có được bật trở lại hay không và dưới hình thức nào — OpenAI nói rằng nó sẽ trở thành mặc định cho Astra, nghĩa là dòng cấu hình ở trên cuối cùng sẽ không còn là thứ bạn tự đặt nữa. Liệu các báo cáo lỗi 404 về ghi chú và lịch sử trên Pro có được đóng lại hay không, vì đó là khác biệt giữa việc cơ chế hoạt động như tài liệu mô tả và việc nó hoạt động trên một số tuyến. Liệu OpenAI có công bố bất kỳ dữ liệu token hay chi phí theo từng mức nỗ lực nào không, đây là con số còn thiếu trong mọi quyết định về mức nỗ lực hiện nay. Và liệu các giới hạn sử dụng đã bị siết chặt trong tuần ra mắt có được nới lỏng sau khi nhu cầu khiến các đăng ký Pro $200 mới bị tạm dừng vào 2026-09-10 được hấp thụ.
Cho đến lúc đó, cẩm nang rất ngắn gọn. Ghim mô hình bằng codex -m gpt-6-astra, chỉ bật thử nghiệm nếu bạn có đăng nhập Plus, Pro hoặc Pro Lite trong ứng dụng khách, đặt mức nỗ lực một cách rõ ràng thay vì tin vào nhãn thanh trượt, giữ ngữ cảnh làm việc của bạn dưới 272.000 token vì đó là mức mà hóa đơn tăng gấp đôi, xác định hoàn thành trước khi bạn rời đi, và định tuyến công việc dễ dàng đến nơi rẻ hơn. Mô hình có từ ngày 2026-09-03 và nó sẽ không đi đâu cả; các công cụ xung quanh nó mới là thứ vẫn đang ổn định.
Những câu hỏi nảy sinh
Tính năng ghi chú xuyên cửa sổ có đáng bật cho các tác vụ quy mô thông thường không?Nói chung là không. Nó tồn tại để giải quyết việc mất mát qua ranh giới cửa sổ ngữ cảnh, nên với một tác vụ vừa vặn trong một cửa sổ, nó chỉ thêm các thành phần phải xử lý — bao gồm một đường mã thử nghiệm đã bị vô hiệu hóa vì một lỗi vào ngày 2026-09-12 — mà không loại bỏ bất kỳ khó khăn nào. Hãy bật nó cho công việc dài hạn và tắt nó cho một chỉnh sửa có phạm vi giới hạn.
Cửa sổ 1,050,000 token có thể thay thế truy xuất trong thiết lập của tôi không? Không phải vì lý do chi phí. Đọc lại một ngữ cảnh lớn ở mỗi lượt sẽ bị tính phí mỗi lượt, và trên 272,000 token đầu vào, toàn bộ yêu cầu sẽ được định giá lại thành $20.00 cho đầu vào và $75.00 cho đầu ra. Một bước truy xuất giữ ngữ cảnh làm việc nhỏ hơn thường là thiết kế rẻ hơn, đó là lý do cơ chế ghi chú thú vị: nó là truy xuất được tích hợp sẵn vào khung.
Điều gì xảy ra với các ghi chú khi một tác vụ kết thúc? Tài liệu của OpenAI giới hạn cơ chế này trong cùng một tác vụ, và các bài viết từ cộng đồng mô tả rằng các ghi chú được lưu gắn với chính tác vụ đó chứ không được tự động mang sang tác vụ tiếp theo. Đừng giả định rằng một tác vụ mới sẽ kế thừa ghi chú của tác vụ trước; bất cứ điều gì cần tồn tại lâu dài thì nên nằm trong kho lưu trữ của bạn, chứ không phải trong bộ nhớ của agent.
So sánh trong bài viết này1
Phát hiện từ bài viết này · Benchmark: Artificial Analysis · cập nhật hằng ngày
