Thẻ tiêu đề được tạo cho gói Ultrafast với dòng tiêu đề 'GPT-6 Astra Ultrafast', phụ đề 'Sáu lần tốc độ, trên mọi dòng' và hai huy hiệu ghi 'đã có giá và sẵn có rộng rãi' và 'làn nhanh không phải là một mô hình thứ hai'.
Guides & Insights

GPT-6 Astra Ultrafast ở tốc độ 6x: Bảng giá công bố thực sự khiến bạn tốn bao nhiêu

Tác giả

Gideon Frost

Ngày đăng

Mô hình mới nhất · 20Xem tất cả mô hình →
Benchmark: Artificial Analysis · cập nhật hằng ngày
Quay lại tất cả bài viết

GPT-6 Astra Ultrafast đã không còn là danh sách chờ kể từ ngày 29 tháng 9 năm 2026. Giờ đây nó là một bậc dịch vụ có thể mua được với mức giá đã được công bố, và mức giá đó đúng bằng sáu lần mức tiêu chuẩn ở mọi dòng. Mô hình bên dưới — GPT-6 Astra, sản phẩm chủ lực của công ty, ra mắt ngày 3 tháng 9 năm 2026 — không hề thay đổi; điều thay đổi tại DevDay là làn đường nhanh chạy trên nó đã trở nên khả dụng rộng rãi, và tài liệu API của công ty giờ ghi rõ rằng Ultrafast "hiện có sẵn rộng rãi cho GPT-6 Astra, cùng quyền truy cập xem trước cho GPT-5.6 Sol." Lần đầu tiên, bạn có thể đưa bậc dịch vụ này vào một dòng ngân sách, và con số cần điền vào đó là $60.00 cho mỗi triệu token đầu vào và $300.00 cho mỗi triệu token đầu ra, theo chính trang giá của công ty vào ngày 30 tháng 9 năm 2026.

Điều đó khiến đây trở thành một câu hỏi khác với câu hỏi mà các bài đưa tin về buổi ra mắt đã trả lời. Sự thật thú vị trong tuần này không phải là việc bậc dịch vụ đó tồn tại — bản xem trước đã được công bố vào ngày 13 tháng 8 năm 2026, và được đưa tin đến phát ngấy. Sự thật thú vị là một bậc dịch vụ không có giá giờ đã có giá, và phép tính kéo theo sau đó thì không mấy đẹp đẽ theo một cách cụ thể, có thể định lượng được. Gấp sáu lần không phải là mức phụ trội mà bạn nhún vai rồi cho qua; đó là mức phụ trội mà bạn phải thu hồi lại trong ít lượt hơn, và việc bạn có làm được hay không là đặc tính của khối lượng công việc chứ không phải của mô hình.

Việc có nhiều điểm giữ trên mỗi dòng, và đó là điều đầu tiên cần hiểu.

Đọc trang định giá của OpenAI vào ngày 30 tháng 9 năm 2026, cột Ultrafast cho GPT-6 Astra là mức cố định gấp 6 lần cột Standard, chứ không phải là mức tăng giá áp dụng cho một số dòng và không áp dụng cho những dòng khác. Điều đó quan trọng, vì nó có nghĩa là bạn không thể tối ưu hóa để thoát khỏi nó bằng cách thay đổi hình dạng các yêu cầu của mình.

• GPT-6 Astra, dịch vụ Tiêu chuẩn, yêu cầu tối đa 272.000 token đầu vào — 10,00 USD cho đầu vào, 1,00 USD cho đầu vào được lưu đệm, 12,50 USD cho ghi bộ nhớ đệm, 50,00 USD cho đầu ra, trên mỗi 1 triệu token.

• GPT-6 Astra Ultrafast, cùng ngưỡng — 60,00 USD đầu vào, 6,00 USD đầu vào cache, 75,00 USD ghi cache, 300,00 USD đầu ra, trên mỗi 1 triệu token. Đúng 6 lần trên cả bốn dòng.

• Trên 272.000 token đầu vào, toàn bộ yêu cầu sẽ được tính giá lại — Standard chuyển sang $20.00 / $2.00 / $25.00 / $75.00, Ultrafast thành $120.00 / $12.00 / $150.00 / $450.00. Vẫn là 6x. Quy tắc ngữ cảnh dài mà OpenAI ghi rõ cho GPT-6 Astra là tỷ lệ đầu vào và cache gấp 2 lần với đầu ra gấp 1,5 lần trên toàn bộ yêu cầu một khi bạn vượt ngưỡng, và nó áp dụng giống hệt cho cả hai hạng.

• Các bậc khác trên cùng một card — Batch và Flex bằng 50% của Standard, còn chế độ Fast gấp 2 lần Standard. Vậy thang hệ số nhân cho riêng mô hình này là 0,5x, 1x, 2x, 6x, không có nấc nào ở giữa hai mức cuối.

Không có phiên bản Ultrafast tương đương với Batch. Batch và Flex là những khoản giảm giá mà bạn đổi lấy bằng lịch trình nới lỏng hơn trên làn tiêu chuẩn; không có phiên bản chậm-rẻ nào của làn nhanh. Nếu bạn muốn tốc độ, bạn phải trả mức 6x cho mọi token bạn gửi đi và mọi token bạn nhận về, và không có sự kết hợp nào giữa đầu vào được lưu đệm và đầu vào mới có thể cải thiện tỷ lệ đó.

A screenshot of OpenAI's API pricing page with the Ultrafast tab selected, showing gpt-6-astra at $60.00 input, $6.00 cached input, $75.00 cache writes and $300.00 output per 1M tokens for short-context requests, stepping to $120.00 / $12.00 / $150.00 / $450.00 above 272,000 input tokens, alongside gpt-5.6-sol at $4.00 / $0.40 / $5.00 / $20.00 short-context and $8.00 / $0.80 / $10.00 long-context, with the page's notes that data-residency endpoints carry a 10% uplift for models released on or after March 5, 2026, that FedRAMP carries a further 10%, that Priority processing was renamed Fast mode on July 30, 2026, and that GPT-5.6 Sol's promotional pricing is available at least through November 21, 2026.

Một cuộc gọi thực sự tốn bao nhiêu

Việc trừu tượng hóa trở nên dễ suy luận hơn với hai yêu cầu cụ thể. Cả hai đều sử dụng mức giá trên mỗi triệu do OpenAI công bố; phần tính toán là của chúng tôi.

Một lệnh gọi một lần với 20.000 token đầu vào và câu trả lời 2.000 token tính phí $0,30 trên Standard — 20.000 token ở mức $10 mỗi triệu là $0,20, cộng 2.000 token ở mức $50 mỗi triệu là $0,10. Cùng lệnh gọi đó trên Ultrafast tính phí $1,80. Đúng sáu lần, như quảng cáo.

Giờ đến trường hợp thực sự mô tả một vòng lặp agent: một cuộc hội thoại 200.000 token, trong đó 190.000 token là tiền tố được cache và chỉ 10.000 token là mới, tạo ra một bước 1.000 token. Standard tính $0,19 cho lượt đọc từ cache, $0,10 cho đầu vào mới và $0,05 cho đầu ra — $0,34 mỗi bước. Ultrafast tính $1,14, $0,60 và $0,30 — $2,04 mỗi bước. Lại là gấp 6 lần, nhưng hãy nhìn vào điều mà tỷ lệ thành phần này đã làm: cache là đòn bẩy chi phí hiệu quả nhất trên mô hình này và nó vẫn rẻ hơn đúng 6 lần trên làn Standard, vì vậy một agent được cache nhiều sẽ không nhận được lợi ích tương xứng nào từ hạng nhanh và nó cũng không làm giảm nhẹ khoản phụ trội.

Hệ quả là phần đáng để khắc sâu vào nhận thức. Vì mức bội số là cố định, điểm hòa vốn không liên quan gì đến cơ cấu token của bạn. Nó hoàn toàn xoay quanh số lượt. Ultrafast chỉ hoàn vốn trong một khối lượng công việc khi việc chạy nó giảm số lượt bị tính phí đi khoảng sáu lần — hoặc bằng cách gộp một vòng lặp thử lại thành một lượt chạy duy nhất, hoặc bằng cách thay thế một chuỗi cuộc gọi làm rõ ngắn bằng một phiên tương tác nhanh hơn. Nếu khối lượng công việc của bạn tạo ra cùng số lượt như trước, chỉ sớm hơn, thì bạn đang mua độ trễ với đúng mức 6x và không gì khác.

Giới hạn tần suất và vị trí địa lý là những mức trần không hề được công bố

Hai ràng buộc nằm ngoài mức giá và rất dễ bị bỏ sót khi bạn đọc bảng giá.

Đầu tiên là thông lượng. Ultrafast cho GPT-6 Astra có sẵn cho tất cả người dùng API, nhưng ban đầu ở giới hạn tốc độ thấp: OpenAI ghi rõ 500.000 token mỗi phút cho các hạng 1 đến 3, 1.000.000 cho hạng 4 và 5.000.000 cho hạng 5. Với một hạng được bán dựa trên tốc độ, đó là một mức trần thực sự — ngữ cảnh agent 200.000 token ở mức nửa triệu token mỗi phút là hai phẩy năm yêu cầu mỗi phút trên một hạng thấp. Hướng dẫn của chính OpenAI chỉ ra cùng vấn đề từ phía bên kia, khuyến nghị mạnh mẽ dùng WebSockets chính vì chi phí mạng trên mỗi yêu cầu có thể ngốn mất độ trễ mà hạng đó đang trả tiền để có được.

Điều thứ hai là vấn đề lưu trú dữ liệu. Ultrafast chỉ hỗ trợ lưu trú dữ liệu tại Hoa Kỳ và xử lý toàn cầu. Nó không hỗ trợ endpoint xử lý theo khu vực tại EU hoặc các khu vực khác ngoài Hoa Kỳ. Nếu triển khai của bạn phụ thuộc vào endpoint lưu trú dữ liệu tại EU cho GPT-6 Astra, thì tier này không khả dụng với bạn dù ở bất kỳ mức giá nào, và đó là giới hạn cứng chứ không phải lựa chọn cấu hình. Cũng lưu ý rằng các endpoint lưu trú dữ liệu có mức tăng 10% đối với các mô hình được phát hành từ ngày 5 tháng 3 năm 2026 trở đi, và GPT-6 Astra nằm trong số đó.

Tiêu đề về tốc độ đã giảm từ 14x xuống 8x

Điều này đáng được nói một cách cẩn thận, vì con số đang lan truyền trong hầu hết các bài đưa tin đã cũ. Trang tài liệu Ultrafast của OpenAI, như được công bố hôm nay, có dòng: “bậc dịch vụ API nhanh nhất của chúng tôi, với tốc độ nhanh hơn tới 8 lần so với chế độ Standard”. Thông báo xem trước ngày 13 tháng 8 năm 2026 về GPT-5.6 Sol đã hứa hẹn “nhanh hơn tới 14 lần so với xử lý Standard” và tối đa 750 token đầu ra mỗi giây trên phần cứng Cerebras.

Đó không phải là cùng một tuyên bố, và sự khác biệt không hẳn là một sự rút lại mà đúng hơn là một sự thay đổi chủ đề. Con số 14x được đo trên GPT-5.6 Sol trong một bản xem trước giới hạn; con số 8x là con số OpenAI công bố cho hạng dịch vụ ở thời điểm hiện tại, với GPT-6 Astra là mô hình được cung cấp rộng rãi của hạng đó. Bất kỳ ai lập ngân sách dựa trên 14x cho Astra đều đang lập ngân sách dựa trên một con số mà OpenAI chưa từng công bố cho Astra. Cách hiểu trung thực là cả hai con số đều là mức trần về thông lượng đầu ra do nhà cung cấp tự báo cáo, rằng không con số nào là bảo đảm về độ trễ cho khối lượng công việc của bạn, và rằng thời gian đầu-cuối vẫn bao gồm xử lý đầu vào, các lệnh gọi công cụ và chính phần điều phối của bạn. Hãy coi 8x là con số để lập kế hoạch và coi bất cứ mức nào tốt hơn như một phần thưởng mà bạn tự kiểm chứng trên lưu lượng của chính mình thay vì mặc định rằng nó có.

Làm gì với cái này vào thứ Hai

Quy tắc quyết định rút ra từ phép tính này hẹp hơn những gì mà hoạt động tiếp thị ngụ ý, và đáng để ghi lại trước khi có ai đó đề xuất bật Ultrafast trên toàn bộ hệ thống.

Bật nó lên ở nơi khối lượng công việc bị ràng buộc bởi độ trễ và mang tính tương tác, và ở nơi có một con người đang chờ. Phân loại sự cố, một cuộc leo thang hỗ trợ trực tiếp, một vòng nghiên cứu nơi một nhà phân tích đang lặp đi lặp lại trong cùng một lần ngồi làm — đây là những trường hợp mà giá trị của việc câu trả lời đến ngay bây giờ thay vì trong bốn phút không tương xứng với giá token, và nơi hóa đơn gấp 6 lần cho một số ít lượt là nhỏ không đáng kể so với chi phí của người đang chờ. Các ví dụ của chính OpenAI trong thông báo xem trước có đúng hình dạng này: đọc log trong khi một sự cố đang diễn ra, thu gọn một vòng nghiên cứu qua đêm thành một phiên làm việc.

Hãy tắt nó đi ở những nơi khối lượng công việc bị ràng buộc bởi thông lượng hoặc có dạng lô. Một lần đánh chỉ mục lại hằng đêm, một lượt phân loại hàng loạt, một báo cáo theo lịch, một lần backfill — không cái nào trong số này quan tâm đến độ trễ đồng hồ thực, tất cả đều bị chi phối bởi số lượng token, và tất cả đều có một tùy chọn 0.5x nằm ngay đó trên cùng bảng giá trong Batch và Flex. Trả 12x mức giá theo lô để hoàn thành sớm hơn là cách rõ ràng nhất để lãng phí tiền trong bảng này.

Khoảng giữa khó xử chính là vòng lặp lập trình kiểu tác tử, và đó là nơi phép tính đếm số lượt quyết định điều đó. Nếu tốc độ thực sự loại bỏ được các lần thử lại — nếu lần chạy đầu tiên của mô hình cho một thay đổi nhiều tệp thành công thường xuyên hơn vì nó không phải vật lộn với giới hạn thời gian — thì Ultrafast có thể rẻ hơn trên mỗi tác vụ hoàn thành dù đắt gấp 6 lần trên mỗi token. Đó là một tuyên bố có thể đo lường được về chính các dấu vết của bạn, không phải một tuyên bố chung, và phép đo rất rẻ: hãy đếm số lượt bị tính phí trên mỗi tác vụ hoàn thành ở cả hai hạng và nhân với đơn giá. Nếu tỷ lệ không ở gần mức sáu, hạng nhanh là một khoản mua độ trễ và nên được biện minh như một khoản mua độ trễ.

Gói này đã được định giá; các tuyến đường xung quanh nó không phải là cùng một câu hỏi.

Một lưu ý thực tế về cách xử lý điều này. GPT-6 Astra ở mức dịch vụ tiêu chuẩn đang hoạt động trên OrcaRouter dưới dạng openai/gpt-6-astra theo đúng mức giá của nhà cung cấp — 10,00 USD cho đầu vào và 50,00 USD cho đầu ra trên mỗi triệu token, với bậc ngữ cảnh dài 272K lên tới 20,00 / 75,00 USD — được phục vụ với mức chênh lệch 0%, nghĩa là giá niêm yết của nhà cung cấp được chuyển thẳng và mọi thay đổi giá từ nhà cung cấp sẽ vào hóa đơn của bạn ngay trong ngày nó xuất hiện trên bảng giá của OpenAI, thay vì phải chờ đến kỳ gia hạn hợp đồng tiếp theo của bạn. Cùng một khóa API có thể truy cập hơn 200 mô hình, vì vậy gói tiêu chuẩn có thể nằm sau cùng một client như gói giá rẻ hoặc mô hình của đối thủ mà không cần tích hợp thêm lần thứ hai.

Điều chúng tôi không làm là cung cấp bậc Ultrafast. Đó là một cờ service-tier trên tài khoản OpenAI chứ không phải một model có thể định tuyến riêng — bạn đặt service_tier: "ultrafast" trong một yêu cầu gửi tới gpt-6-astra — và OpenAI sẽ tính phí vào chính tài khoản của bạn theo mức giá ở trên. Nếu bạn bật nó, nó nằm trong tích hợp OpenAI trực tiếp của bạn, và OrcaRouter là nơi phù hợp cho lưu lượng bậc tiêu chuẩn mà bạn định tuyến song song. Nói thẳng điều đó hữu ích hơn là ngụ ý về một năng lực mà chúng tôi không có.

A screenshot of the OrcaRouter model page for GPT-6 Astra, model id openai/gpt-6-astra, showing a 1M-token context window, 128K maximum output, text, image and file input, text output, public benchmarks attributed to OpenAI dated 2026-09-04, input price $10.00 and output price $50.00 per 1M tokens, p50 time to first token 4.69 s, a 10.00 s figure, and 155.1M tokens of traffic, with the page's code sample and EN language toggle visible in the header.

Quy tắc quyết định, trong một đoạn văn.

Gấp sáu lần là cái giá của một hạng dịch vụ, không phải giá của một mô hình: trọng số, cửa sổ ngữ cảnh 1.050.000 token, giới hạn đầu ra 128.000 token và các câu trả lời đều giống hệt GPT-6 Astra tiêu chuẩn. Thứ bạn đang mua là thông lượng đầu ra nhanh hơn tới 8 lần, trên một bảng giá cao gấp 6 lần ở mọi dòng, kèm theo các giới hạn tốc độ ban đầu ở mức thấp và một ràng buộc lưu trú tại Hoa Kỳ loại trừ hoàn toàn EU. Sự đánh đổi đó rõ ràng là đúng với một con người đang chờ câu trả lời, rõ ràng là sai với một tác vụ theo lô được lên lịch mà lại có sẵn làn giá bằng một nửa, và thực sự chưa ngã ngũ với các vòng lặp agentic, nơi câu trả lời phụ thuộc vào việc tốc độ có cắt bớt được số lượt hay không. Hãy đo số lượt trên chính các trace của bạn trước khi cam kết, và định tuyến phần còn lại theo giá niêm yết.

A screenshot of OpenAI's Ultrafast documentation page, showing the sentence 'Our fastest API service tier, with up to 8x faster speeds than Standard mode.', the sentence 'It is broadly available for GPT-6 Astra, with preview access for GPT-5.6 Sol.', the recommendation to use WebSockets because per-request network overhead can reduce the latency gains, the note that Ultrafast for GPT-6 Astra is available to all API users at low rate limits with higher limits or Sol preview access available through an OpenAI account team, and a Python code sample setting service_tier to 'ultrafast' with model 'gpt-6-astra'.

So sánh trong bài viết này1

Phát hiện từ bài viết này · Benchmark: Artificial Analysis · cập nhật hằng ngày