Thẻ tiêu đề hero cho GPT-6 Astra với dòng chữ 'Cách gọi GPT-6 Astra', phụ đề 'Model id, endpoint, và chi phí của một lượt chạy tầm xa', kèm dòng ngày tháng ghi 'Model phát hành ngày 3 tháng 9, 2026 — Chi tiết API được xác minh ngày 16 tháng 9, 2026', và ba thẻ bên dưới: 'Model id: gpt-6-astra', 'Context: 1,050,000 token' và 'Standard: $10.00 vào / $50.00 ra', với logo OrcaRouter được ghép ở góc dưới bên phải.
Guides & Insights

GPT-6 Astra API: ID mô hình, điểm cuối và một tác vụ tầm xa thực sự tốn bao nhiêu

Tác giả

Alistair Wren

Ngày đăng

Mô hình mới nhất · 20Xem tất cả mô hình
Benchmark: Artificial Analysis · cập nhật hằng ngày
Quay lại tất cả bài viết

The short version: GPT-6 Astra is callable today at https://api.openai.com/v1 under a single model id, gpt-6-astra, at $10.00 per million input tokens, $1.00 cached input and $50.00 output — the figures Ope​nAI's own pricing page carried on September 16, 2026. The model itself is from September 3, 2026, thirteen days before this page was written, so nothing here is launch coverage and nothing here is framed as an announcement. This is the reference page for the developer question that comes after availability: what string to pass, which endpoint takes it, what the 1,050,000-token window really buys, what the account has to look like first, and what one genuine long-horizon agent run costs on a rate card that quietly reprices itself above 272,000 input tokens. GPT-5.6 Sol appears throughout only as the price baseline it is sold above, never as the subject.

Lý do một mô hình mới mười ba ngày tuổi lại xứng đáng có một trang trong tuần này là vì các con đường dẫn tới nó đã thay đổi sau khi bản ra mắt diễn ra, và con đường API giờ đây đã trở thành con đường thông thường. Khi Ope​nAI phát hành Astra vào ngày 3 tháng 9, họ mô tả đó là một đợt triển khai dần chứ không phải là tình trạng sẵn có; đến ngày 8 tháng 9, họ nói rằng mô hình đã được triển khai đầy đủ cho người dùng Plus, Pro, Business và Enterprise trong Co​dex và ChatGPT Work, và đến tuần lễ ngày 14 tháng 9, AWS đã niêm yết nó trên Bedrock còn Microsoft Foundry thì cung cấp nó ở trạng thái sẵn có rộng rãi. Đối với người gọi API, trình tự đó ít quan trọng hơn vẻ bề ngoài của nó — điểm cuối đã hoạt động và được ghi tài liệu suốt thời gian qua — nhưng nó thực sự có nghĩa rằng những câu hỏi về mua sắm xoay quanh nó giờ đã có câu trả lời mà vào ngày ra mắt chúng chưa hề có. Mọi thứ dưới đây đều được đọc từ tài liệu mô hình, trang giá và trang kiểm soát dữ liệu của chính Ope​nAI vào ngày 16 tháng 9 năm 2026, và bất cứ điều gì đến từ nguồn khác đều nói rõ điều đó ngay trong câu chứa nó.

ID mô hình, và câu hỏi snapshot được trả lời trung thực

Chuỗi cần truyền là gpt-6-astra — chữ thường, có dấu gạch nối, không có tiền tố nhà cung cấp. Đó là id duy nhất mà Ope​nAI ghi trong tài liệu cho mô hình này.

Nếu bạn đang tìm một bản chụp theo ngày để ghim, thì không có bản nào để tìm, và chúng tôi sẽ không bịa ra một hậu tố trông có vẻ hợp lý. Trang mô hình GPT-6 Astra của Ope​nAI chỉ liệt kê đúng một mục trong Snapshots, và đó là gpt-6-astra trần. Không có dạng có ngày kiểu -2026-09-03 và không có bí danh -latest ở phía nhà cung cấp. Trong quá trình nghiên cứu, chúng tôi đã thấy một bí danh động có dạng ~openai/gpt-astra-latest trên một danh sách router; đó là cấu trúc gateway được xây dựng bên trên id của nhà cung cấp, không phải thứ mà Ope​nAI công bố, và không nên đưa nó vào cấu hình của bạn như thể nó là vậy.

Hệ quả thực tế là nhỏ nhưng đáng để nói rõ. Bạn có thể truy xuất đối tượng mô hình để xác nhận bạn đang trò chuyện với thứ gì:

curl https://api.openai.com/v1/models/gpt-6-astra -H "Authorization: Bearer $OPENAI_API_KEY"

Hãy ghim id trần vào một giá trị cấu hình thay vì gõ nó vào hàng tá điểm gọi. Nếu OpenAI sau này thêm các snapshot có ghi ngày, id trần sẽ trở thành mục tiêu di động và giá trị được ghim của bạn bắt đầu thay đổi ngay dưới chân bạn — một nơi để sửa chính là sự khác biệt giữa một thay đổi hai phút và cả một buổi chiều ngồi grep.

Endpoint: URL cơ sở, khả năng tương thích và một request chạy được

The base URL is https://api.openai.com/v1. Per Ope​nAI's model documentation, GPT-6 Astra is supported on Responses (/v1/responses), Chat Completions (/v1/chat/completions) and Batch (/v1/batch). It is explicitly not supported on Realtime, Assistants, Fine-tuning, Embeddings, image generation and editing, video, audio, moderation, or the legacy Completions endpoint — and those absences matter as much as the presence list, because a team that planned around the Assistants API or a fine-tuned variant has to replan rather than rewrite.

Về khả năng tương thích: đây là API gốc chính chủ của OpenAI, tức định dạng truyền tải mà mọi SDK và client tương thích với OpenAI đều được viết dựa trên đó. Bất cứ thứ gì nói được định dạng đó đều sẽ giao tiếp với gpt-6-astra mà không cần lớp shim — bạn chỉ đổi chuỗi model và, nếu đang di trú từ một model OpenAI cũ hơn, thì đổi tên tham số bên dưới. Công việc mới nên dùng Responses API: đây là bề mặt mà OpenAI dùng để tài liệu hóa khả năng điều khiển suy luận của model này, là nơi các công cụ tích hợp sẵn nằm, và hỗ trợ Chat Completions cho các model mới nhất xưa nay vẫn là bề mặt nông hơn trong hai.

Một cuộc gọi streaming tối giản, với mức nỗ lực suy luận được đặt:

curl https://api.openai.com/v1/responses \

-H "Authorization: Bearer $OPENAI_API_KEY" \

-H "Content-Type: application/json" \

-d '{"model": "gpt-6-astra", "input": "Liệt kê những tệp bạn sẽ thay đổi để chuyển dịch vụ này sang khỏi API xác thực cũ.", "reasoning": {"effort": "high"}, "max_output_tokens": 16000, "stream": true}'

Và điều tương tự trong Python, nơi mà hầu hết độc giả thực sự sẽ làm việc:

from openai import OpenAI

client = OpenAI()

stream = client.responses.create(model="gpt-6-astra", input="Liệt kê các tệp bạn sẽ thay đổi để chuyển dịch vụ này khỏi API xác thực cũ.", reasoning={"effort": "high"}, max_output_tokens=16000, stream=True)

for event in stream:

if event.type == "response.output_text.delta": print(event.delta, end="")

Ba điểm trong yêu cầu đó là đặc thù của mô hình này chứ không phải được sao chép từ một bản hướng dẫn nhanh chung chung.

Mức độ suy luận là một núm điều chỉnh chi phí, không chỉ là một núm điều chỉnh chất lượng. Trang mô hình của OpenAI liệt kê các giá trị được hỗ trợ là low, medium, high, xhigh và max. Hãy để ý danh sách đó bắt đầu từ đâu: không có none hay minimal cho GPT-6 Astra, nên mức sàn đã được nâng lên. Token suy luận được tính phí như token đầu ra với giá $50.00 mỗi triệu, nghĩa là việc chuyển mức effort từ high sang max là một quyết định gắn kèm chi phí, chứ không phải một lần nâng cấp chất lượng miễn phí.

Truyền phát được hỗ trợ, và đó chính là cách trung thực để chạy những lượt dài. Một yêu cầu duy nhất trên mô hình này có thể phát ra tới 128.000 token đầu ra. Chờ đợi ngần ấy đổ về trong một thân phản hồi duy nhất, mà không có cách nào biết liệu nó có đang tiến triển hay không, chính là cách bạn đi đến chỗ phải đoán mò về thời gian chờ.

Bộ nhớ đệm prompt ở đây là tường minh. Responses API ghi nhận một prompt_cache_breakpoint trên nội dung văn bản, hình ảnh và tệp, với chế độ explicit, đánh dấu "điểm kết thúc chính xác của một tiền tố prompt có thể tái sử dụng" và kế thừa TTL từ prompt_cache_options.ttl của yêu cầu. Trên một mô hình có mức giá đầu vào đã lưu đệm chỉ bằng một phần mười mức giá chưa lưu đệm, vị trí bạn đặt ranh giới đó chính là dòng đòn bẩy cao nhất trong yêu cầu của bạn.

Screenshot of OpenAI's developer documentation page for GPT-6 Astra, captured 16 September 2026, showing the model id gpt-6-astra described as the company's most capable model, a 1,050,000-token context window, 128,000 maximum output tokens, an Apr 30, 2026 knowledge cutoff, reasoning token support with reasoning.effort values of low, medium, high, xhigh and max, input modalities of text and image with text output and audio and video marked not supported, Standard pricing of $10.00 input, $1.00 cached input, $12.50 cache writes and $50.00 output per million tokens, the note that prompts with more than 272K input tokens are priced at 2x input and cache rates and 1.5x output for the full request, and supported endpoints of Responses, Chat Completions and Batch with Fine-tuning, Assistants, Embeddings and Images marked unsupported.

Cửa sổ 1.050.000 token thực sự có ý nghĩa gì

Các con số được ghi nhận là cửa sổ ngữ cảnh 1.050.000 token, đầu vào tối đa 922.000 token, đầu ra tối đa 128.000 token, và thời điểm cắt kiến thức là ngày 30 tháng 4 năm 2026.

Hãy bắt đầu với phép tính mà nhiều người bỏ qua: 922.000 cộng 128.000 bằng 1.050.000. Cửa sổ này được chia sẻ giữa phần bạn gửi và phần mô hình có thể trả về, và giới hạn đầu ra được dành riêng ra từ đó. Bạn không thể gửi 1.050.000 token đầu vào; giới hạn thực tế cho một yêu cầu là 922.000, và còn ít hơn nếu bạn muốn có chỗ cho một câu trả lời thực sự.

Một triệu token mua được gì trong những đơn vị mà bạn thực sự làm việc? Việc quy đổi từ token sang văn bản chỉ là gần đúng, và đây là con số của chúng tôi chứ không phải của OpenAI, nhưng chúng đúng về bậc độ lớn: với khoảng bốn ký tự mỗi token, 1.050.000 token vào cỡ 750.000 từ, hay đại khái một trăm nghìn dòng mã. Đó là một kho mã cỡ trung bình, nguyên vẹn, vẫn còn chỗ cho đầu ra công cụ mà một agent tạo ra trong lúc làm việc. Trường hợp tầm xa mà mô hình được bán để giải quyết chính là điều này: một agent đã đọc một tệp cách đây một giờ và vẫn có thể thấy nó đã ghi gì, thay vì một agent đã nén cả buổi sáng thành một đoạn tóm tắt.

Rồi đến phần thuộc về một trang chi phí hơn là một trang thông số kỹ thuật. Tài liệu về mô hình của Ope​nAI nêu rõ rằng các prompt có hơn 272.000 token đầu vào sẽ được tính giá theo mức 2x cho đầu vào và tỷ lệ cache, cùng 1,5x cho đầu ra trên toàn bộ yêu cầu. Trang bảng giá thể hiện điều này thành một hàng thứ hai: long context trên GPT-6 Astra là 20,00 đô-la cho đầu vào, 2,00 đô-la cho đầu vào được cache và 75,00 đô-la cho đầu ra. Vậy ba phần tư trên cùng của cửa sổ đó là một dải giá, chứ không chỉ là khoảng dư. Một lượt chạy có bản ghi hội thoại vượt quá 272.000 token sẽ trả gấp đôi cho mọi token đầu vào — kể cả những token đã được cache — cho toàn bộ yêu cầu, và đó chính là mức biến động lớn nhất trong kinh tế của mô hình này. Nội dung này được trình bày đầy đủ ở phần dưới.

Một cơ chế nữa đáng để biết, bởi vì đó là sự thừa nhận của chính nhà cung cấp rằng một cửa sổ không phải là toàn bộ câu trả lời. Đối với Co​dex, Ope​nAI mô tả một cách tiếp cận ngữ cảnh thử nghiệm đi kèm với Astra, trong đó các ghi chú tồn tại xuyên suốt các cửa sổ ngữ cảnh thay vì liên tục bị nén thành một bản tóm tắt duy nhất, với các cửa sổ trước đó vẫn có thể tìm kiếm được để các yêu cầu và kết quả kiểm thử từ những tin nhắn trước đó và đầu ra của công cụ vẫn có thể tìm thấy. Ope​nAI gọi nó là thử nghiệm, nói rằng nó được bật trong config.toml của Co​dex, và nói rằng nó sẽ trở thành mặc định cho Astra. Nếu bạn đang tự xây dựng phiên bản tương đương trên API, thì đó chính là hình mẫu cần sao chép: ghi chú bền vững cùng lịch sử có thể truy xuất, thay vì một prompt anh hùng duy nhất.

Và giới hạn của chính con số đó: một cửa sổ lớn là một năng lực, chứ không phải sự bảo đảm cho việc chú ý xuyên suốt nó. Các con số tầm xa do nhà cung cấp báo cáo là chỉ dẫn tốt hơn về hành vi so với số token — Ope​nAI báo cáo OSWorld 2.0 đạt 72,6% ở khoảng 40 phút mỗi tác vụ, và Terminal-Bench 4.0 đạt 57,9% so với 37,3% của GPT-5.6 Sol. Đó là những con số của chính Ope​nAI, chưa được chúng tôi tái lập, và bức tranh độc lập thì gần giống nhưng không hoàn toàn trùng khớp: Artificial Analysis đo Astra đạt 59,1% trên Terminal-Bench v4.0 so với 52,0% của Claude Fable 5.1 và 39,9% của GPT-5.6 Sol. Cả hai đều đồng ý rằng khoảng cách tầm xa so với thế hệ trước là có thật; không cái nào thay thế được việc bạn tự chạy tác vụ của chính mình.

Các phương thức đầu vào, và câu hỏi về tệp được để ngỏ một cách trung thực

Trang mô hình của Ope​nAI liệt kê các phương thức đầu vào gồm văn bản và hình ảnh, với đầu ra là văn bản. Không có âm thanh, không có video, không tạo hình ảnh trên mô hình này.

Đầu vào hình ảnh được đưa vào dưới dạng một phần nội dung bên trong tin nhắn của người dùng. Loại phần là input_image, và hình ảnh được cung cấp dưới dạng URL đầy đủ hoặc URL dữ liệu base64 trên image_url, hoặc dưới dạng file_id từ Files API. Có một tùy chọn detail là auto, low, high hoặc original, mặc định là auto. Cấu trúc là:

{"model": "gpt-6-astra", "input": [{"role": "user", "content": [{"type": "input_text", "text": "Có gì đã thay đổi trong ảnh chụp màn hình này?"}, {"type": "input_image", "image_url": "data:image/png;base64,...", "detail": "high"}]}]}

Tài liệu về thị giác của OpenAI liệt kê PNG, JPEG, WEBP và GIF không động là các định dạng được chấp nhận, với tổng payload tối đa 512 MB mỗi yêu cầu và tối đa 1.500 ảnh mỗi yêu cầu; các ảnh vượt quá 30.000 patch sẽ bị từ chối thay vì được thu nhỏ xuống. Đó là các giới hạn thị giác chung của nền tảng chứ không phải giới hạn riêng cho Astra, và ảnh được tính phí dưới dạng token giống như mọi đầu vào khác.

Giờ đến câu hỏi mà người đọc thực sự mang theo khi ghé vào, và câu trả lời trung thực. Bạn có thể gửi tệp hay PDF không? Chúng tôi không thể xác nhận khả năng nhập tài liệu cho mô hình này trên tài liệu của Ope​nAI, và chúng tôi sẽ không ngụ ý rằng nó hoạt động được. Responses API có định nghĩa một phần nội dung input_file, nên về mặt hạ tầng kỹ thuật thì API nói chung có hỗ trợ; nhưng trang của Ope​nAI về GPT-6 Astra liệt kê văn bản và hình ảnh là các phương thức đầu vào và không liệt kê tệp, và chúng tôi không tìm thấy tuyên bố nào của Ope​nAI ghi nhận đầu vào PDF cho endpoint này. Một danh mục niêm yết của router cho cùng mô hình thì có hiển thị tệp bên cạnh văn bản và hình ảnh — hãy coi đó là thông tin do router báo cáo, tức là những gì một router ghi nhận về một tuyến chứ không phải điều nhà cung cấp bảo đảm. Nếu việc nạp tài liệu là yếu tố then chốt đối với khối lượng công việc của bạn, hãy kiểm thử nó với endpoint thật trước khi xây dựng dựa trên nó, và chuẩn bị sẵn phương án dự phòng OCR sang văn bản. Đó chính là khác biệt giữa một buổi chiều kiểm thử và một lần viết lại từ đầu.

Toàn bộ đường giá, và một lần chạy dài hạn đã được định giá xong

Mọi số liệu trong phần này đều được lấy từ chính trang định giá của Ope​nAI vào ngày 16 tháng 9 năm 2026, và tất cả đều tính theo mỗi triệu token ở gói Standard trừ khi dòng đó có ghi khác.

Ngữ cảnh ngắn, tối đa 272K đầu vào — $10.00 đầu vào, $1.00 đầu vào đã lưu trong bộ nhớ đệm, $12.50 ghi bộ nhớ đệm, $50.00 đầu ra.

Ngữ cảnh dài, trên 272K đầu vào — $20.00 đầu vào, $2.00 đầu vào đã lưu đệm, $25.00 ghi bộ đệm, $75.00 đầu ra, áp dụng cho toàn bộ yêu cầu.

Batch và Flex — một nửa so với gói Standard: $5.00 / $0.50 / $6.25 / $25.00 cho ngữ cảnh ngắn, $10.00 / $1.00 / $12.50 / $37.50 cho ngữ cảnh dài.

Chế độ Nhanh — gấp đôi Standard: $20.00 / $2.00 / $25.00 / $100.00 ngữ cảnh ngắn, $40.00 / $4.00 / $50.00 / $150.00 ngữ cảnh dài. OpenAI lưu ý Chế độ Nhanh không khả dụng đối với GPT-6 Astra có lưu trú dữ liệu tại EU.

Lưu trú dữ liệu — các endpoint sử dụng tính năng này chịu mức tăng 10% đối với các mô hình phát hành từ ngày 5 tháng 3 năm 2026 trở đi. GPT-6 Astra đủ điều kiện, vì vậy một triển khai lưu trú dữ liệu sẽ cao hơn 10% so với mọi con số nêu trên.

Điều cần ghi nhớ là mức giá đầu vào được cache. $1,00 so với $10,00 là mức giảm giá 90% cho phần prompt bạn gửi lại — và trong khối lượng công việc của một agent, đó gần như là toàn bộ prompt. Việc ghi cache được tính phí ở mức $12,50, tức gấp 1,25 lần mức giá đầu vào không cache, nên điểm hòa vốn rất đơn giản: 100.000 token gửi không cache hai lần tốn $2,00, trong khi ghi tiền tố đó một lần rồi đọc lại một lần tốn $1,35. Cache bắt đầu sinh lời từ lần tái sử dụng thứ hai trở đi, và một agent làm việc với cùng một bản ghi trong một trăm lượt sẽ tái sử dụng nó một trăm lần.

Điều này đưa chúng ta đến phép tính thực sự quyết định liệu mô hình này có chi phí phải chăng hay không, bởi mức giá được nêu ở tiêu đề không phải con số xuất hiện trên hóa đơn. Đây là một lần chạy mô phỏng — của chúng tôi, dựa trên mức giá đã công bố của OpenAI, không phải một hóa đơn thực đo — cho kiểu tác vụ mà mô hình này được bán để thực hiện: một tác nhân lập trình tự trị thực hiện một cuộc di chuyển quy mô repo trong vài giờ, 120 lần gọi mô hình, một bản ghi làm việc đạt trung bình khoảng 500.000 token đầu vào mỗi lần gọi khi nó tích lũy dần, 80% lượng đầu vào đó được phục vụ từ cache, và 400.000 token đầu ra trong toàn bộ lần chạy, bao gồm cả suy luận.

Với mức giá Standard cho ngữ cảnh ngắn:

• Đầu vào chưa được lưu vào bộ nhớ đệm — 12M token × $10.00 = $120.00

• Đầu vào đã cache — 48M token × $1.00 = $48.00

• Đầu ra — 0,4M token × 50,00 $ = 20,00 $

Tổng ≈ $188.00 cho lần chạy

Cùng một lần chạy ở dải ngữ cảnh dài, đây là những gì mà một bản ghi nằm trên 272.000 token mỗi lần gọi thực sự nhận được:

• Đầu vào không được lưu trong bộ nhớ đệm — 12M token × $20,00 = $240,00

• Đầu vào đã lưu trong bộ đệm — 48M token × $2.00 = $96.00

• Đầu ra — 0.4M token × $75.00 = $30.00

Tổng cộng ≈ $366.00 cho lần chạy

Hai kết luận rút ra từ đó, và không kết luận nào có thể nhìn thấy được từ mức giá nổi bật. Thứ nhất, nơi bản ghi của bạn được lưu trữ quan trọng ngang với việc bạn chọn mô hình nào — cùng một tác vụ sẽ tốn gần gấp đôi tùy thuộc vào việc nó có vượt ngưỡng 272K hay không, điều này khiến việc kỷ luật ngữ cảnh (truy xuất đúng 100K thay vì mang theo 600K) trở thành một kỹ thuật kiểm soát chi phí trên mô hình này, chứ không chỉ là một kỹ thuật tối ưu hiệu năng. Thứ hai, cache đáng giá hơn mức chiết khấu mà nó gợi ý: khi hoàn toàn không có cache hit, kịch bản đầu tiên mang theo $600.00 chi phí đầu vào thay vì $168.00, và lượt chạy tốn khoảng $620 thay vì $188. Hãy bật cache trước khi bạn tăng mức độ suy luận lên.

Để làm mốc chuẩn, cùng tổ hợp token đó trên GPT-5.6 Sol theo mức giá mà trang định giá của OpenAI hiển thị ngày 16 tháng 9 — $4.00 cho đầu vào, $0.40 cho đầu vào đã cache, $20.00 cho đầu ra ở ngữ cảnh ngắn — tương đương khoảng $75.20, và ở dòng ngữ cảnh dài của Sol ($8.00 / $0.80 / $30.00) thì khoảng $146.40. Điều đó khiến lần chạy này tốn gấp khoảng 2,5 lần ở cả hai mức giá. Có hai lưu ý về hệ số đó, vì nó đã gây nhầm lẫn ở những nơi khác: con số của Sol là mức giá khuyến mại — OpenAI nói chương trình khuyến mại có hiệu lực ít nhất đến hết ngày 21 tháng 11 năm 2026 — còn của Astra là giá niêm yết, nên hệ số này phản ánh hai bảng giá của thời điểm hiện tại chứ không phải một đặc điểm ổn định của các mô hình, và nó sẽ thu hẹp lại nếu khuyến mại hết hạn. Và con số "2,5x" cũ hơn vẫn được lưu truyền cho Astra đôi khi được tính dựa trên bảng giá niêm yết trước khuyến mại của Sol là $5.00/$30.00, cho kết quả 2x ở đầu vào và khoảng 1,67x ở đầu ra. Hãy nói rõ bạn đang dùng mức giá nào của Sol, nếu không thì con số đó vô nghĩa.

Thêm một dòng nữa: gói Batch chia đôi tất cả, đưa lần chạy đầu tiên xuống còn khoảng $94. Việc bạn có thể dùng nó hay không phụ thuộc vào phần tiếp theo.

Single-column scoreboard titled 'GPT-6 Astra API — the scoreboard' with six rows reading 'Model id: gpt-6-astra', 'Context window: 1,050,000 tokens', 'Max output: 128,000 tokens', 'Price (Standard): $10.00 in / $50.00 out', 'Cached input: $1.00, a 90% discount' and 'Above 272K input: 2x input, 1.5x output', above a footer reading 'All figures per OpenAI's model and pricing pages, read September 16, 2026.', with the OrcaRouter logo composited in the bottom-right corner.

Không lưu giữ dữ liệu, và khoản giảm giá tự vô hiệu hóa chính nó

OpenAI tuyên bố rằng Zero Data Retention khả dụng cho các khách hàng API đủ điều kiện trên các endpoint được hỗ trợ, tùy thuộc vào phê duyệt — và cả hai vế của câu đó đều thực sự đóng vai trò quan trọng. Đây không phải là một tùy chọn bật/tắt tự phục vụ: tính đủ điều kiện phụ thuộc vào sự phê duyệt trước của OpenAI và việc bạn chấp nhận các yêu cầu bổ sung, và bạn bắt đầu quá trình này bằng cách liên hệ với bộ phận kinh doanh. Sau khi được phê duyệt, tính năng này được cấu hình ở cấp tổ chức hoặc dự án trong Settings → Organization → Data controls, trên tab Data Retention, tại đó một dự án có thể kế thừa mặc định của tổ chức, đặt ZDR một cách rõ ràng, chọn Modified Abuse Monitoring hoặc tắt cả hai.

Những gì nó thay đổi trên thực tế: ZDR loại trừ nội dung của khách hàng khỏi nhật ký giám sát lạm dụng, thay thế thời gian lưu giữ mặc định tối đa 30 ngày, và tham số store trên /v1/responses và /v1/chat/completions được coi là false ngay cả khi một yêu cầu cố đặt nó thành true.

Chi tiết quan trọng nhất trên một trang về chi phí: /v1/batches không nằm trong danh sách endpoint đủ điều kiện ZDR. Trang kiểm soát dữ liệu của OpenAI liệt kê nó là không đủ điều kiện, với trạng thái ứng dụng được lưu giữ cho đến khi bị xóa. Vì vậy, trên GPT-6 Astra, mức giảm giá 50% của gói Batch và Zero Data Retention loại trừ lẫn nhau — một khối lượng công việc ràng buộc bởi tuân thủ cần ZDR nên dự trù theo mức giá Standard, chứ không phải mức giá batch, và con số $94 ở trên không khả dụng cho nó.

Ba lưu ý bổ sung nữa, được nói thẳng ra vì một trang thổi phồng ZDR còn tệ hơn một trang bỏ sót nó. ZDR không phải là tuyệt đối: theo "Eyes Off", Ope​nAI bảo lưu quyền làm cho các mô hình không đủ điều kiện áp dụng ZDR đối với những khách hàng cụ thể, với thông báo trước bằng văn bản, và theo "Safety Retention", nội dung có thể được lưu giữ và được con người xem xét khi các bộ phân loại gắn cờ rủi ro nghiêm trọng. Đầu vào hình ảnh và tệp bị gắn cờ vì có khả năng chứa CSAM vẫn được giữ lại để xem xét thủ công ngay cả dưới ZDR. Và ZDR dừng lại ở ranh giới của Ope​nAI — nếu tác nhân của bạn gọi một máy chủ MCP từ xa hoặc API của một nhà cung cấp khác, lưu lượng đó do chính sách lưu giữ của bên đó điều chỉnh, không phải chính sách này. Còn về vị trí lưu trú dữ liệu, đây là một kiểm soát khác với ZDR, đòi hỏi phê duyệt riêng và một phụ lục Modified Retention bên ngoài Hoa Kỳ, đồng thời đi kèm mức tăng 10% đã nêu ở trên. Nếu bạn đang dựa vào việc lưu đệm theo ZDR, hãy đọc trang kiểm soát dữ liệu của Ope​nAI để biết việc lưu đệm giữ lại những gì; chúng tôi sẽ không in ra một con số lưu giữ cho nó mà chính chúng tôi không thể đọc được ở đó.

Giới hạn tần suất như tài liệu ghi, và cái ập đến trước tiên

Trang mô hình của OpenAI công bố các giới hạn theo từng cấp này cho GPT-6 Astra — số yêu cầu và token mỗi phút, sau đó là giới hạn hàng đợi theo lô:

Cấp 1 — 500 RPM, 500.000 TPM, hàng đợi lô 1.500.000

Cấp 2 — 5,000 RPM, 1,000,000 TPM, hàng đợi theo lô 3,000,000

Cấp 3 — 5,000 RPM, 2,000,000 TPM, hàng đợi lô 100,000,000

Tier 4 — 10,000 RPM, 4,000,000 TPM, hàng đợi batch 200,000,000

Cấp 5 — 15.000 RPM, 40.000.000 TPM, hàng đợi lô 15.000.000.000

Hai giới hạn mà chúng tôi sẽ gọi là không được ghi trong tài liệu thay vì tự điền vào: không có giới hạn nào được công bố cho gói miễn phí, bởi vì GPT-6 Astra hoàn toàn không thuộc gói miễn phí; và chúng tôi không tìm thấy mức trần nào được công bố trên Tier 5 cũng như không có bảng giới hạn riêng cho chế độ Fast. Nếu một nhà cung cấp chưa công bố giới hạn nào, hãy coi sự thiếu vắng đó là chưa được giải quyết — đừng mặc định rằng nó không có giới hạn.

Con số đầu tiên cắn vào khối lượng công việc của agent là 500.000 TPM của Tier 1. Một lần gọi trên model này có thể mang theo bản ghi 500.000 token, nghĩa là một yêu cầu có thể ngốn trọn một phút ngân sách token của bạn ở bậc khởi điểm. Cửa sổ ngữ cảnh một triệu token cũng chẳng ích gì mấy với một agent chiếm dụng cùng một bản ghi suốt 120 lượt nếu bậc đó không thể đẩy đủ token. Hãy chọn kích cỡ bậc theo khối lượng token từ ví dụ đã trình bày ở trên, chứ không phải theo số lượng yêu cầu — và lưu ý rằng việc thăng bậc phụ thuộc vào mức chi tiêu cùng lịch sử tài khoản, nên nên thiết lập trước hạn chót thay vì làm ngay trong lúc chạy hạn.

Azure và AWS Bedrock, mỗi cái một dòng

Microsoft Azure — GPT-6 Astra có thể được triển khai trong Microsoft Foundry dưới cùng id gpt-6-astra, với thông tin từ Foundry ấn định thời điểm khả dụng chung vào đầu tháng 9 năm 2026 và báo cáo các triển khai Global Standard và US Data Zone, không có EU Data Zone khi ra mắt, cùng mức giá bằng hoặc gần bằng giá niêm yết của OpenAI với một dòng ngữ cảnh dài. Chúng tôi đọc được điều đó từ thông tin về Foundry chứ không phải từ trang danh mục của chính Microsoft, trang mà hôm nay chúng tôi không thể truy cập — hãy xác minh danh sách triển khai, tập hợp khu vực và mức giá hiện tại trên tài liệu của chính Microsoft trước khi lập kế hoạch triển khai dựa trên đó.

AWS Bedrock — được liệt kê là openai.gpt-6-astra, khả dụng thông qua các API Bedrock được hỗ trợ và được xác nhận trong bản tổng hợp hàng tuần của AWS đề ngày 15 tháng 9 năm 2026, với vành đai quản trị của chính Bedrock (cô lập endpoint VPC, mã hóa KMS, Guardrails) và tuyên bố của AWS rằng dữ liệu suy luận không được sử dụng để huấn luyện mô hình. Theo báo cáo, suy luận trong cùng khu vực và suy luận xuyên khu vực theo địa lý trên Bedrock được tính phí cao hơn 10% so với mức giá cơ bản; con số đó là thông tin gián tiếp theo nguồn chúng tôi đọc, nên hãy kiểm tra trang định giá của chính AWS.

Không hướng nào trong hai hướng thay đổi mô hình. Cả hai đều thay đổi khâu mua sắm, và với người đọc doanh nghiệp thì đó chính là mấu chốt: một triển khai Foundry hay Bedrock có thể nằm gọn trong một cam kết đám mây sẵn có, kế thừa IAM, khả năng ghi log và ranh giới mạng của cam kết đó, rồi xuất hiện trên hóa đơn mà bộ phận tài chính đã phê duyệt từ trước — thường chính là khác biệt giữa một dự án thử nghiệm và một thứ thực sự được đưa ra vận hành. Cái giá phải đánh đổi là bạn chấp nhận vòng đời mô hình của đám mây và mức giá của đám mây, và cả hai nền tảng đám mây đều được báo cáo ở mức ngang hoặc cao hơn giá niêm yết của Ope​nAI chứ không thấp hơn.

Router phù hợp ở đâu, kể cả những phần lập luận chống lại nó

GPT-6 Astra có trong danh mục của OrcaRouter với mã openai/gpt-6-astra, và OrcaRouter chuyển nguyên giá niêm yết của nhà cung cấp tới bạn với mức cộng thêm 0% — giá của nhà cung cấp chính là giá của chúng tôi, và khi nhà cung cấp thay đổi giá, hóa đơn của bạn sẽ thay đổi ngay trong cùng ngày thay vì đợi đến kỳ gia hạn. Với một mô hình ở mức giá này, đó không phải là một tuyên bố về sai số làm tròn nhỏ: phép tính ở trên cũng chính là phép tính bạn sẽ phải trả nếu mua trực tiếp.

Screenshot of the OrcaRouter catalogue page for GPT-6 Astra, captured 16 September 2026, showing the listing openai/gpt-6-astra from provider OpenAI, a 1M-token context, 128K maximum output, input of text, image and file with text output, a p50 time to first token of 6.70 s and p95 of 10.00 s, $10.00 input and $50.00 output per million tokens, 181.0M tokens of routed traffic over seven days, and an OpenAI-compatible Python sample using base_url https://api.orcarouter.ai/v1.

Lý lẽ thuyết phục nhất cho việc định tuyến ở đây không phải là giá, mà là khả năng đảo ngược. Astra có giá cao gấp khoảng 2,5 lần mô hình xếp dưới nó, và chi phí của nó dao động theo một ngưỡng do chính kiến trúc của bạn kiểm soát, nên hầu hết các đội ngũ muốn thử nó trên một phần lưu lượng thật trước khi cam kết đưa vào đường chạy production. Chỉ với một khóa, bạn có thể đặt nó sau cùng một endpoint như các mô hình bạn đang chạy, gửi cho nó một phần lưu lượng, và tự động chuyển sang phương án rẻ hơn khi nó không xứng đáng với khoản chênh lệch — một thay đổi cấu hình chứ không phải một cuộc di trú, với một API duy nhất bao phủ hơn 200 mô hình, một DSL định tuyến cho phép kết hợp nhiều mô hình vào một lời gọi duy nhất, và tính năng hợp nhất mô hình khi bạn muốn cả một hội đồng cùng trả lời.

Những điểm phản đối điều đó, được nói thẳng ra. Một router là thêm một chặng nữa trong đường đi của yêu cầu và thêm một bên nữa trong luồng dữ liệu — và với mô hình này, điều đó không phải là giả định, bởi vì ZDR được phê duyệt theo từng tổ chức tại Ope​nAI và một yêu cầu được định tuyến không tự động được bao phủ bởi phê duyệt ZDR của bạn. Nếu bạn đang gửi dữ liệu chịu quy định, hãy xác nhận điều khoản dữ liệu của tuyến đường trước khi gửi và sẵn sàng gọi trực tiếp nhà cung cấp cho khối lượng công việc đó. Định tuyến cũng thêm một thành phần có thể gặp lỗi hoặc tăng độ trễ, và nó khiến việc hoán đổi mô hình trở nên dễ dàng đến mức có thể thay đổi thứ đang trả lời người dùng của bạn mà không cần xem xét. Không điều nào trong số đó vượt qua được lý lẽ về dùng thử và khả năng đảo ngược đối với hầu hết các nhóm; tất cả đều đáng biết trước khi bạn quyết định rằng router là miễn phí. Chúng tôi đặt các nền tảng định tuyến đối đầu với nhau trong một bài viết riêng thay vì nhắc lại so sánh đó ở đây.

Ba câu hỏi mà câu trả lời không phải là một mệnh đề duy nhất

Tôi có thể tinh chỉnh GPT-6 Astra hoặc dùng nó với Assistants API không?Không, ở cả hai phương diện, và đây là một ranh giới thiết kế chứ không phải một cấu hình mà bạn đã bỏ sót. Trang mô hình của Ope​nAI liệt kê Chat Completions, Responses và Batch là các endpoint được hỗ trợ và nêu rõ Fine-tuning và Assistants là không được hỗ trợ, đồng thời không có dòng GPT-6 Astra nào trong bảng giá fine-tuning của Ope​nAI. Nếu kiến trúc của bạn phụ thuộc vào một mô hình flagship đã được tinh chỉnh, Astra phải được nhắc lệnh thay vào đó, điều này chuyển chi phí từ huấn luyện sang token đầu vào — và ở mức $10,00 mỗi triệu token trên một system prompt lớn, đó là một khoản ngân sách thực sự chứ không phải chú thích nhỏ.

Mô hình có từ chối công việc bảo mật mà tôi được phép thực hiện không? Đôi khi là có, và điều đó đáng để biết trước khi bạn xây dựng. GPT-6 Astra là mô hình Ope​nAI đầu tiên đạt ngưỡng năng lực an ninh mạng Critical theo Khung Sẵn sàng của công ty, và ở phiên bản phát hành, nó từ chối các nhiệm vụ mạng nâng cao như viết mã khai thác proof-of-concept. Ope​nAI cho biết họ dự định mở rộng quyền truy cập bằng các biện pháp bảo vệ ít hạn chế hơn thông qua chương trình Daybreak của mình. Đối với người phòng thủ, điều này xuất hiện như một sự từ chối không phải là giới hạn tốc độ và không phải là lỗi — hãy dự trù cho nó trong phần xử lý lỗi của bạn thay vì cứ thử lại vào nó.

Tôi có cần phê duyệt đặc biệt để gọi mô hình này không? Không phải cho endpoint tiêu chuẩn — không có danh sách chờ và không có bước phê duyệt nào để gọi gpt-6-astra, chỉ cần một tài khoản có thanh toán. Thứ bạn có thể cần phê duyệt là mọi thứ xung quanh nó: Zero Data Retention, vốn phải đăng ký mới được dùng; lưu trú dữ liệu bên ngoài Hoa Kỳ, cần một phụ lục sửa đổi riêng; và nâng bậc, nếu bạn định đẩy khối lượng token ở quy mô agent qua một tài khoản Tier 1. Mô hình là phần dễ nhất của việc mua sắm.

Điều gì cần theo dõi và ai nên hành động ngay bây giờ

Nếu bạn đang xây dựng trên mô hình này, bốn thứ đáng theo dõi đều nằm về phía nhà cung cấp và đều gắn với mốc thời gian. Liệu OpenAI có công bố một snapshot ghi ngày cho gpt-6-astra hay không — điều đó sẽ biến id trần thành một mục tiêu di động và khiến việc ghim phiên bản trở nên có ý nghĩa. Liệu ngưỡng 272.000 token có thay đổi hay không, vì dòng đó ảnh hưởng đến hóa đơn của bạn nhiều hơn bất kỳ benchmark nào trên trang. Liệu mức giá của Bedrock và Foundry có hội tụ về hoặc vẫn cao hơn mức niêm yết của OpenAI hay không, vì điều đó quyết định tuyến mua sắm không kém gì bản thân mô hình. Và liệu chương trình Daybreak có thay đổi những gì endpoint sẽ từ chối hay không, điều mà với các đội bảo mật chính là sự khác biệt giữa một công cụ dùng được và một bản demo.

Về việc ai nên hành động, ranh giới rất rõ ràng. Nếu bạn đã trả tiền cho GPT-5.6 Sol ở mức giá khuyến mãi cho công việc agent tầm dài hạn, mức 2.5x là có thật và câu hỏi rất hẹp: liệu tỷ lệ hoàn thành tác vụ trên chính khối lượng công việc của bạn có vượt qua mức chênh lệch giá không? Hãy chạy thử nó trên một lát cắt lưu lượng thật và xem kết quả — ví dụ đã trình bày ở trên cho bạn biết lát cắt đó tốn bao nhiêu trước khi bạn bắt đầu. Nếu công việc của bạn là trò chuyện ngữ cảnh ngắn hoặc phân loại khối lượng lớn, đây không phải mô hình dành cho bạn; việc tái định giá cho ngữ cảnh dài và mức giá đầu ra $50.00 biến nó thành một cách tốn kém để làm điều mà GPT-5.6 Luna làm với chi phí chỉ bằng một phần nhỏ. Và nếu bạn là doanh nghiệp có yêu cầu tuân thủ, hãy bắt đầu cuộc trao đổi về ZDR trước, vì nó quyết định ưu đãi Batch, khoản tăng do yêu cầu lưu trú dữ liệu và lựa chọn hướng triển khai của bạn — và không điều nào trong số đó là quyết định bạn có thể đưa ra ngay vào ngày bạn cần.

So sánh trong bài viết này2

Phát hiện từ bài viết này · Benchmark: Artificial Analysis · cập nhật hằng ngày