Một thẻ tiêu đề được tạo với tiêu đề chính 'GPT-6 Astra Ultrafast chạy trên Blackwell', tiêu đề phụ 'NVIDIA nêu tên phần cứng đằng sau mức 8x', và ba thẻ ghi 'Phần cứng: GPU Blackwell', 'Bội số giá: 6,00x so với mức tiêu chuẩn' và 'Tốc độ công bố: tối đa 8x', với chân trang ghi 'Bài đăng của NVIDIA, ngày 1 tháng 10 năm 2026 - số liệu do nhà cung cấp báo cáo'.
Guides & Insights

GPT-6 Astra Ultrafast chạy trên Blackwell: NVIDIA nêu tên phần cứng đằng sau 8x

Tác giả

Gideon Frost

Ngày đăng

Mô hình mới nhất · 20Xem tất cả mô hình →
Benchmark: Artificial Analysis · cập nhật hằng ngày
Quay lại tất cả bài viết

Ngày 1 tháng 10 năm 2026, NVIDIA đã đăng một bài viết của Dion Harris có tiêu đề "Cách GPU NVIDIA giúp tăng tốc GPT-6 Astra Ultrafast của OpenAI", và câu ở trung tâm bài viết là lần đầu tiên một trong hai công ty cho biết hạng dịch vụ này chạy trên nền tảng nào: "GPT-6 Astra Ultrafast, chạy trên GPU NVIDIA Blackwell, hiện đã có trong API OpenAI và dành cho người dùng ChatGPT Work và Codex đủ điều kiện." Đó là tin tức, và nó hẹp hơn những gì tiêu đề gợi ý. GPT-6 Astra, mô hình này, đã được phát hành vào ngày 3 tháng 9 năm 2026. Hạng dịch vụ Ultrafast chạy trên mô hình đó đã được cung cấp rộng rãi vào ngày 29 tháng 9 năm 2026. Tuyên bố về tốc độ — nhanh hơn tối đa 8 lần khi tạo token so với chế độ tiêu chuẩn của Astra — đã có từ hai ngày trước khi NVIDIA lặp lại nó.

Điều này làm nảy sinh câu hỏi mà bài viết thực sự đang trả lời: không phải “nó nhanh đến mức nào” mà là “silicon đó là của ai”.

A screenshot of OpenAI's Ultrafast mode documentation page, showing the sentence 'Our fastest API service tier, with up to 8x faster speeds than Standard mode.', the sentence 'It is broadly available for GPT-6 Astra, with preview access for GPT-5.6 Sol.', the note that Ultrafast for GPT-6 Astra is currently available to all API users at low rate limits with higher limits or Sol preview access requestable through an OpenAI account team, the recommendation to use WebSockets because without a persistent connection network overhead can reduce the latency gains, and a Python code sample setting service_tier to 'ultrafast' with model 'gpt-6-astra'.

Ba điều mà bài viết thực sự bổ sung

Gạt bỏ phần nhắc lại, bài đăng ngày 1 tháng 10 đóng góp ba sự thật.

• Phần cứng — Blackwell. Tài liệu Ultrafast của chính OpenAI, công bố ngày 30 tháng 9, mô tả tốc độ của hạng này, cấu hình và các giới hạn tần suất của nó, và không hề nêu tên bất kỳ GPU nào. Vậy nên việc quy kết về chip chỉ có một nguồn duy nhất là nhà cung cấp phần cứng. Điều đó không khiến nó trở thành sai; nó khiến đây thành một tuyên bố của nhà cung cấp về thiết bị của chính họ, và đáng được dán nhãn đúng như vậy.

• Hai kỹ sư được nêu tên — Philippe Tillet, trưởng bộ phận suy luận của OpenAI, và Uday Ruddarraju, giám đốc công nghệ mảng tính toán của OpenAI, cả hai đều được trích dẫn công khai về nguồn gốc của sự tăng tốc này.

• Đối tượng — "người dùng ChatGPT Work và Codex đủ điều kiện", vốn rộng hơn cách định vị chỉ dành cho API mà gói này đã ra mắt cùng. Tài liệu của chính OpenAI vẫn nói Ultrafast cho GPT-6 Astra "có sẵn cho tất cả người dùng API với giới hạn tần suất thấp", và lưu ý về giới hạn thấp đó vẫn chưa được rút lại một cách chính thức.

Hai câu trích dẫn, và lý do vì sao chúng là phần thú vị

Đóng góp của Tillet là một vòng lặp chứ không phải một benchmark. Khoản đầu tư của NVIDIA vào công cụ và tài liệu, theo ông, "đã cho phép chúng tôi làm cho các mô hình của mình đặc biệt giỏi lập trình", và Astra sau đó có thể "biến kiến thức đó thành các kernel hiệu năng cao khiến phần cứng NVIDIA trở nên hấp dẫn." Ruddarraju thẳng thắn hơn về hướng đi của công việc: "Chúng tôi đã sử dụng các mô hình nội bộ của mình để tối ưu hóa suy luận trên GPU NVIDIA."

Khi đọc cùng nhau, đó là một tuyên bố về triển khai chứ không phải về năng lực: các mô hình tiên tiến của OpenAI giờ đây đã đủ giỏi trong việc viết kernel GPU đến mức OpenAI dùng chúng để tối ưu hóa ngăn xếp phục vụ của chính mình. Điều này cũng nhất quán với một phần duy nhất trong bài đăng của NVIDIA hoàn toàn không nói về tuần ra mắt — một tiêu đề ghi "Continually Improving Performance", lập luận rằng suy luận được triển khai trở nên nhanh hơn theo thời gian vì OpenAI liên tục hướng các mô hình của chính mình vào phần mềm NVIDIA mà nó chạy trên đó.

Không có gì trong số này là một phép đo. Đó là hai kỹ sư mô tả một quy trình, được công bố bởi chính công ty đã bán những chiếc GPU đó. Cách hiểu trung thực là quy trình này có vẻ hợp lý, dễ tin, và không thể phản bác từ bên ngoài — điều này cũng đúng với mọi con số tốc độ trong câu chuyện này.

Blackwell ở đây, Cerebras ở đó

Điều hữu ích nhất mà bài đăng này làm là phơi bày một sự chia tách mà chưa ai giải thích. Vào ngày 13 tháng 8 năm 2026, OpenAI đã công bố bản xem trước của một tier nhanh trên một mô hình khác — GPT-5.6 Sol chạy nhanh "tới 14×" — và nêu tên Cerebras là đối tác đứng sau nó, mô tả phần cứng quy mô wafer tạo ra tới 750 token đầu ra mỗi giây. Bảy tuần sau, tier nhanh trên Astra chạy trên Blackwell, và con số là 8x.

Hai hạng nhanh, hai câu trả lời phần cứng, một là đối tác chuyên biệt và cái còn lại là nhà cung cấp lớn nhất của chính công ty. Cả hai nhà cung cấp đều chưa công bố so sánh giữa hai đường phục vụ, và chưa có đơn vị đánh giá độc lập nào đo lường một trong hai. Cũng cần lưu ý cách bài đăng của NVIDIA xử lý cái tên thứ hai: “Rubin” xuất hiện một lần, bên trong trích dẫn của Tillet về các mô hình viết kernel cho “GPU Blackwell và Rubin”. Đó là phát biểu về việc các mô hình của OpenAI có thể lập trình được gì, không phải phát biểu rằng hiện nay có thứ gì đó đang phục vụ trên Rubin.

Con số mà NVIDIA không công bố

Có một con số trong câu chuyện này mà cả hai công ty đều chưa đặt bên cạnh 8x, và đó chính là con số quyết định liệu một nhóm có bật hạng đó hay không. Bảng giá Ultrafast do OpenAI công bố liệt kê gpt-6-astra ở mức 60,00 USD cho mỗi triệu token đầu vào, 6,00 USD cho đầu vào được cache, 75,00 USD cho ghi cache và 300,00 USD cho đầu ra. Cùng mô hình đó ở hạng tiêu chuẩn là 10,00 USD và 50,00 USD, với đầu vào được cache ở mức 1,00 USD và ghi cache ở mức 12,50 USD. Mỗi cột đều đúng bằng sáu lần mức giá tiêu chuẩn.

• Hệ số nhân — 6.00x cho đầu vào, đầu ra, đầu vào đã lưu đệm và ghi đệm. Không phải "lên đến." Mà là sáu.

• Mức trần — 8x, con số mà cả hai nhà cung cấp đều trích dẫn kèm theo cụm "lên đến" và không nêu điều kiện cụ thể nào.

• Điều đó có nghĩa là — bội số giá nằm dưới mức tốt nhất mà chính gói này tuyên bố. Ở mức trần, giao dịch là có lợi; ở bất kỳ mức nào dưới 6x trên lưu lượng của bạn, bạn đang trả nhiều hơn cho mỗi đơn vị thời gian tiết kiệm so với những gì marketing ngụ ý. Đó là lý do vì sao phép thử có ý nghĩa duy nhất đối với gói này là đo lường trên chính các yêu cầu của bạn.

• Bậc ngữ cảnh dài — trên 272.000 token đầu vào, mức giá Ultrafast trở thành $120.00 cho đầu vào và $450.00 cho đầu ra, gấp sáu lần mức giá theo bậc của chính gói tiêu chuẩn.

• Những điều khoản vận hành chi tiết — OpenAI ghi rõ thang tokens mỗi phút của Ultrafast là 500.000 cho các bậc sử dụng từ 1 đến 3, 1.000.000 cho bậc 4 và 5.000.000 cho bậc 5; Ultrafast chỉ hỗ trợ lưu trú dữ liệu tại Hoa Kỳ và xử lý toàn cầu, không có endpoint xử lý theo khu vực cho EU hay bất kỳ khu vực nào khác ngoài Hoa Kỳ; và tài liệu khuyến nghị dùng WebSockets cho Ultrafast "đặc biệt đối với các ứng dụng agentic thực hiện nhiều lệnh gọi công cụ liên tiếp nhanh," đồng thời cảnh báo rằng "nếu không có kết nối liên tục, chi phí mạng có thể làm giảm mức cải thiện độ trễ."

A screenshot of OpenAI's API pricing page with the Ultrafast tab selected, showing the gpt-6-astra row at $60.00 input, $6.00 cached input, $75.00 cache writes and $300.00 output per 1M tokens for short-context requests, stepping to $120.00 / $12.00 / $150.00 / $450.00 above 272,000 input tokens, alongside gpt-5.6-sol at $4.00 / $0.40 / $5.00 / $20.00 short-context and $8.00 / $0.80 / $10.00 long-context, with the page's notes that regional processing endpoints carry a 10% uplift for models released on or after March 5, 2026, that FedRAMP endpoints carry a further 10%, that Priority processing was renamed Fast mode on July 30, 2026, and that GPT-5.6 Sol's promotional pricing is available at least through November 21, 2026.

Điểm cuối cùng ấy chính là điểm cần hành động. Một nhóm bật tier đó lên nhưng vẫn để HTTP theo từng yêu cầu ở bên dưới nó thì đã trả gấp sáu lần mức giá chỉ để trao lại một phần tốc độ tăng thêm cho khâu thiết lập — một kiểu lãng phí tiền đã được ghi nhận rõ ràng và hoàn toàn có thể tránh khỏi.

Điều này trông như thế nào từ một endpoint duy nhất

GPT-6 Astra đã có mặt trên OrcaRouter dưới dạng openai/gpt-6-astra: cửa sổ ngữ cảnh 1.050.000 token, tối đa 128.000 token đầu ra, đầu vào văn bản, hình ảnh và tệp, cùng mức giá niêm yết của OpenAI được chuyển thẳng ở 10,00 USD cho đầu vào và 50,00 USD cho đầu ra mỗi triệu token, tăng lên 20,00 USD và 75,00 USD khi vượt quá 272.000 token đầu vào. Điểm chuẩn nổi bật trong danh mục của nó là 96,1 trên GPQA Diamond.

Gói Ultrafast không có trên OrcaRouter, và không thể có: nó là một thuộc tính được kiểm soát quyền truy cập của một tài khoản OpenAI chứ không phải một model id, đó là lý do openai/gpt-6-astra-ultrafast trả về model-not-found. Nếu bạn bật gói này lên, nó nằm trong tích hợp OpenAI trực tiếp của bạn. Điều mà một endpoint hơn 200 model với 0% markup mang lại cho bạn trong tình huống này không phải làn đường nhanh — mà là quyền kiểm soát. Bởi vì giá niêm yết của nhà cung cấp được chuyển thẳng qua thay vì bị cộng thêm, một thay đổi giá của OpenAI sẽ đến phía chúng ta ngay cùng ngày nó đến phía họ, và bởi vì làn Astra tiêu chuẩn vốn đã có sẵn, thử nghiệm để giải quyết quyết định này chỉ là một dòng cấu hình: cùng prompt, gói tiêu chuẩn, và một model rẻ hơn bên cạnh, trên cùng một key. Đó là thứ gần nhất với một bài đo độ trễ mà hầu hết các đội sẽ từng chạy, và việc thiết lập chẳng tốn gì cả.

A screenshot of the OrcaRouter model page for GPT-6 Astra, model id openai/gpt-6-astra, showing a 1,050,000-token context window, 128k maximum output, text, image and file input, public benchmarks attributed to OpenAI dated 2026-09-04, input price $10.00 and output price $50.00 per 1M tokens, p50 time to first token 4.69 s, a 10.00 s figure and 155.1M tokens of traffic, with an OpenAI-compatible Python code sample and the EN language toggle in the header.

Điều gì vẫn chưa được đo lường

Ba điều có thể kiểm chứng ngay hôm nay. Hạng này tồn tại, nó nằm trên bảng giá với đúng sáu lần mức giá tiêu chuẩn, và kể từ ngày 1 tháng 10, nó được công khai quy cho GPU NVIDIA Blackwell.

Một điều thì không: hệ số nhân trên lưu lượng của bạn. Không nhà cung cấp nào đã công bố phân phối độ trễ cho hạng đó ở một mức đồng thời được nêu, và không bên thứ ba nào đã tái lập được con số 8x. Cũng không có benchmark nào so sánh Astra trên Ultrafast với Astra ở chế độ tiêu chuẩn, và lẽ ra không nên có một benchmark tâng bốc — đó là cùng một checkpoint trên một đường dẫn nhanh hơn, nên các thiết lập giống hệt nhau phải cho ra những câu trả lời giống hệt nhau ở các tốc độ khác nhau. Nếu hai làn của bạn phân kỳ trên cùng những prompt, bạn có một báo cáo lỗi, chứ không phải một tính năng.

Vậy nên bản tóm tắt hữu ích về ngày 1 tháng 10 nhỏ hơn những gì thông báo thể hiện. Đó vẫn là cùng một bậc với cùng một mức giá, với cùng mức trần tốc độ chưa được kiểm chứng, giờ khoác thêm một nhãn phần cứng. Nhãn đó quan trọng — nó cho bạn biết OpenAI đang mở rộng quy mô trên dòng tăng tốc nào, và nó cho bạn biết câu chuyện về bậc nhanh đã chuyển từ một đối tác chuyên biệt sang nhà cung cấp GPU lớn nhất ngành chỉ trong vòng chưa đầy hai tháng. Nó chỉ không cho bạn biết bất cứ điều gì về ngân sách độ trễ của chính bạn, và không có bài đăng nào sẽ làm được điều đó.