
GPT-6 Astra Ultrafast chạy trên Blackwell: NVIDIA nêu tên phần cứng đằng sau 8x
- openaiMỚIOpenAI: GPT-6.1 Sol2026-09-2952Trí tuệ
- anthropicMỚIAnthropic: Claude Sonnet 5.52026-09-2856Trí tuệ
- typesafeMỚITypeSafe: Jev 1.132026-09-24$0.04 / $0.00 trên 1 triệu token · 223 tok/s
- OpenAIMỚIOpenAI: GPT-6 Luna2026-09-2238Trí tuệ
- OpenAIMỚIOpenAI: GPT-6 Sol2026-09-2248Trí tuệ
- AnthropicMỚIAnthropic: Claude Opus 5.52026-09-2258Trí tuệ
- xAIMỚIGrok 4.72026-09-2146Trí tuệ
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 trên 1 triệu token · 125 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 trên 1 triệu token · 1148 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Trí tuệ
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Trí tuệ77Lập trình
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Trí tuệ76Lập trình
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Trí tuệ76Lập trình
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Trí tuệ82Lập trình
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 trên 1 triệu token · 48 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 trên 1 triệu token · 103 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Trí tuệ72Lập trình
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 trên 1 triệu token · 212 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Trí tuệ75Lập trình
- obsidianQwen3.8 27B2026-08-1534Trí tuệ68Lập trình
Ngày 1 tháng 10 năm 2026, NVIDIA đã đăng một bài viết của Dion Harris có tiêu đề "Cách GPU NVIDIA giúp tăng tốc GPT-6 Astra Ultrafast của OpenAI", và câu ở trung tâm bài viết là lần đầu tiên một trong hai công ty cho biết hạng dịch vụ này chạy trên nền tảng nào: "GPT-6 Astra Ultrafast, chạy trên GPU NVIDIA Blackwell, hiện đã có trong API OpenAI và dành cho người dùng ChatGPT Work và Codex đủ điều kiện." Đó là tin tức, và nó hẹp hơn những gì tiêu đề gợi ý. GPT-6 Astra, mô hình này, đã được phát hành vào ngày 3 tháng 9 năm 2026. Hạng dịch vụ Ultrafast chạy trên mô hình đó đã được cung cấp rộng rãi vào ngày 29 tháng 9 năm 2026. Tuyên bố về tốc độ — nhanh hơn tối đa 8 lần khi tạo token so với chế độ tiêu chuẩn của Astra — đã có từ hai ngày trước khi NVIDIA lặp lại nó.
Điều này làm nảy sinh câu hỏi mà bài viết thực sự đang trả lời: không phải “nó nhanh đến mức nào” mà là “silicon đó là của ai”.

Ba điều mà bài viết thực sự bổ sung
Gạt bỏ phần nhắc lại, bài đăng ngày 1 tháng 10 đóng góp ba sự thật.
• Phần cứng — Blackwell. Tài liệu Ultrafast của chính OpenAI, công bố ngày 30 tháng 9, mô tả tốc độ của hạng này, cấu hình và các giới hạn tần suất của nó, và không hề nêu tên bất kỳ GPU nào. Vậy nên việc quy kết về chip chỉ có một nguồn duy nhất là nhà cung cấp phần cứng. Điều đó không khiến nó trở thành sai; nó khiến đây thành một tuyên bố của nhà cung cấp về thiết bị của chính họ, và đáng được dán nhãn đúng như vậy.
• Hai kỹ sư được nêu tên — Philippe Tillet, trưởng bộ phận suy luận của OpenAI, và Uday Ruddarraju, giám đốc công nghệ mảng tính toán của OpenAI, cả hai đều được trích dẫn công khai về nguồn gốc của sự tăng tốc này.
• Đối tượng — "người dùng ChatGPT Work và Codex đủ điều kiện", vốn rộng hơn cách định vị chỉ dành cho API mà gói này đã ra mắt cùng. Tài liệu của chính OpenAI vẫn nói Ultrafast cho GPT-6 Astra "có sẵn cho tất cả người dùng API với giới hạn tần suất thấp", và lưu ý về giới hạn thấp đó vẫn chưa được rút lại một cách chính thức.
Hai câu trích dẫn, và lý do vì sao chúng là phần thú vị
Đóng góp của Tillet là một vòng lặp chứ không phải một benchmark. Khoản đầu tư của NVIDIA vào công cụ và tài liệu, theo ông, "đã cho phép chúng tôi làm cho các mô hình của mình đặc biệt giỏi lập trình", và Astra sau đó có thể "biến kiến thức đó thành các kernel hiệu năng cao khiến phần cứng NVIDIA trở nên hấp dẫn." Ruddarraju thẳng thắn hơn về hướng đi của công việc: "Chúng tôi đã sử dụng các mô hình nội bộ của mình để tối ưu hóa suy luận trên GPU NVIDIA."
Khi đọc cùng nhau, đó là một tuyên bố về triển khai chứ không phải về năng lực: các mô hình tiên tiến của OpenAI giờ đây đã đủ giỏi trong việc viết kernel GPU đến mức OpenAI dùng chúng để tối ưu hóa ngăn xếp phục vụ của chính mình. Điều này cũng nhất quán với một phần duy nhất trong bài đăng của NVIDIA hoàn toàn không nói về tuần ra mắt — một tiêu đề ghi "Continually Improving Performance", lập luận rằng suy luận được triển khai trở nên nhanh hơn theo thời gian vì OpenAI liên tục hướng các mô hình của chính mình vào phần mềm NVIDIA mà nó chạy trên đó.
Không có gì trong số này là một phép đo. Đó là hai kỹ sư mô tả một quy trình, được công bố bởi chính công ty đã bán những chiếc GPU đó. Cách hiểu trung thực là quy trình này có vẻ hợp lý, dễ tin, và không thể phản bác từ bên ngoài — điều này cũng đúng với mọi con số tốc độ trong câu chuyện này.
Blackwell ở đây, Cerebras ở đó
Điều hữu ích nhất mà bài đăng này làm là phơi bày một sự chia tách mà chưa ai giải thích. Vào ngày 13 tháng 8 năm 2026, OpenAI đã công bố bản xem trước của một tier nhanh trên một mô hình khác — GPT-5.6 Sol chạy nhanh "tới 14×" — và nêu tên Cerebras là đối tác đứng sau nó, mô tả phần cứng quy mô wafer tạo ra tới 750 token đầu ra mỗi giây. Bảy tuần sau, tier nhanh trên Astra chạy trên Blackwell, và con số là 8x.
Hai hạng nhanh, hai câu trả lời phần cứng, một là đối tác chuyên biệt và cái còn lại là nhà cung cấp lớn nhất của chính công ty. Cả hai nhà cung cấp đều chưa công bố so sánh giữa hai đường phục vụ, và chưa có đơn vị đánh giá độc lập nào đo lường một trong hai. Cũng cần lưu ý cách bài đăng của NVIDIA xử lý cái tên thứ hai: “Rubin” xuất hiện một lần, bên trong trích dẫn của Tillet về các mô hình viết kernel cho “GPU Blackwell và Rubin”. Đó là phát biểu về việc các mô hình của OpenAI có thể lập trình được gì, không phải phát biểu rằng hiện nay có thứ gì đó đang phục vụ trên Rubin.
Con số mà NVIDIA không công bố
Có một con số trong câu chuyện này mà cả hai công ty đều chưa đặt bên cạnh 8x, và đó chính là con số quyết định liệu một nhóm có bật hạng đó hay không. Bảng giá Ultrafast do OpenAI công bố liệt kê gpt-6-astra ở mức 60,00 USD cho mỗi triệu token đầu vào, 6,00 USD cho đầu vào được cache, 75,00 USD cho ghi cache và 300,00 USD cho đầu ra. Cùng mô hình đó ở hạng tiêu chuẩn là 10,00 USD và 50,00 USD, với đầu vào được cache ở mức 1,00 USD và ghi cache ở mức 12,50 USD. Mỗi cột đều đúng bằng sáu lần mức giá tiêu chuẩn.
• Hệ số nhân — 6.00x cho đầu vào, đầu ra, đầu vào đã lưu đệm và ghi đệm. Không phải "lên đến." Mà là sáu.
• Mức trần — 8x, con số mà cả hai nhà cung cấp đều trích dẫn kèm theo cụm "lên đến" và không nêu điều kiện cụ thể nào.
• Điều đó có nghĩa là — bội số giá nằm dưới mức tốt nhất mà chính gói này tuyên bố. Ở mức trần, giao dịch là có lợi; ở bất kỳ mức nào dưới 6x trên lưu lượng của bạn, bạn đang trả nhiều hơn cho mỗi đơn vị thời gian tiết kiệm so với những gì marketing ngụ ý. Đó là lý do vì sao phép thử có ý nghĩa duy nhất đối với gói này là đo lường trên chính các yêu cầu của bạn.
• Bậc ngữ cảnh dài — trên 272.000 token đầu vào, mức giá Ultrafast trở thành $120.00 cho đầu vào và $450.00 cho đầu ra, gấp sáu lần mức giá theo bậc của chính gói tiêu chuẩn.
• Những điều khoản vận hành chi tiết — OpenAI ghi rõ thang tokens mỗi phút của Ultrafast là 500.000 cho các bậc sử dụng từ 1 đến 3, 1.000.000 cho bậc 4 và 5.000.000 cho bậc 5; Ultrafast chỉ hỗ trợ lưu trú dữ liệu tại Hoa Kỳ và xử lý toàn cầu, không có endpoint xử lý theo khu vực cho EU hay bất kỳ khu vực nào khác ngoài Hoa Kỳ; và tài liệu khuyến nghị dùng WebSockets cho Ultrafast "đặc biệt đối với các ứng dụng agentic thực hiện nhiều lệnh gọi công cụ liên tiếp nhanh," đồng thời cảnh báo rằng "nếu không có kết nối liên tục, chi phí mạng có thể làm giảm mức cải thiện độ trễ."

Điểm cuối cùng ấy chính là điểm cần hành động. Một nhóm bật tier đó lên nhưng vẫn để HTTP theo từng yêu cầu ở bên dưới nó thì đã trả gấp sáu lần mức giá chỉ để trao lại một phần tốc độ tăng thêm cho khâu thiết lập — một kiểu lãng phí tiền đã được ghi nhận rõ ràng và hoàn toàn có thể tránh khỏi.
Điều này trông như thế nào từ một endpoint duy nhất
GPT-6 Astra đã có mặt trên OrcaRouter dưới dạng openai/gpt-6-astra: cửa sổ ngữ cảnh 1.050.000 token, tối đa 128.000 token đầu ra, đầu vào văn bản, hình ảnh và tệp, cùng mức giá niêm yết của OpenAI được chuyển thẳng ở 10,00 USD cho đầu vào và 50,00 USD cho đầu ra mỗi triệu token, tăng lên 20,00 USD và 75,00 USD khi vượt quá 272.000 token đầu vào. Điểm chuẩn nổi bật trong danh mục của nó là 96,1 trên GPQA Diamond.
Gói Ultrafast không có trên OrcaRouter, và không thể có: nó là một thuộc tính được kiểm soát quyền truy cập của một tài khoản OpenAI chứ không phải một model id, đó là lý do openai/gpt-6-astra-ultrafast trả về model-not-found. Nếu bạn bật gói này lên, nó nằm trong tích hợp OpenAI trực tiếp của bạn. Điều mà một endpoint hơn 200 model với 0% markup mang lại cho bạn trong tình huống này không phải làn đường nhanh — mà là quyền kiểm soát. Bởi vì giá niêm yết của nhà cung cấp được chuyển thẳng qua thay vì bị cộng thêm, một thay đổi giá của OpenAI sẽ đến phía chúng ta ngay cùng ngày nó đến phía họ, và bởi vì làn Astra tiêu chuẩn vốn đã có sẵn, thử nghiệm để giải quyết quyết định này chỉ là một dòng cấu hình: cùng prompt, gói tiêu chuẩn, và một model rẻ hơn bên cạnh, trên cùng một key. Đó là thứ gần nhất với một bài đo độ trễ mà hầu hết các đội sẽ từng chạy, và việc thiết lập chẳng tốn gì cả.

Điều gì vẫn chưa được đo lường
Ba điều có thể kiểm chứng ngay hôm nay. Hạng này tồn tại, nó nằm trên bảng giá với đúng sáu lần mức giá tiêu chuẩn, và kể từ ngày 1 tháng 10, nó được công khai quy cho GPU NVIDIA Blackwell.
Một điều thì không: hệ số nhân trên lưu lượng của bạn. Không nhà cung cấp nào đã công bố phân phối độ trễ cho hạng đó ở một mức đồng thời được nêu, và không bên thứ ba nào đã tái lập được con số 8x. Cũng không có benchmark nào so sánh Astra trên Ultrafast với Astra ở chế độ tiêu chuẩn, và lẽ ra không nên có một benchmark tâng bốc — đó là cùng một checkpoint trên một đường dẫn nhanh hơn, nên các thiết lập giống hệt nhau phải cho ra những câu trả lời giống hệt nhau ở các tốc độ khác nhau. Nếu hai làn của bạn phân kỳ trên cùng những prompt, bạn có một báo cáo lỗi, chứ không phải một tính năng.
Vậy nên bản tóm tắt hữu ích về ngày 1 tháng 10 nhỏ hơn những gì thông báo thể hiện. Đó vẫn là cùng một bậc với cùng một mức giá, với cùng mức trần tốc độ chưa được kiểm chứng, giờ khoác thêm một nhãn phần cứng. Nhãn đó quan trọng — nó cho bạn biết OpenAI đang mở rộng quy mô trên dòng tăng tốc nào, và nó cho bạn biết câu chuyện về bậc nhanh đã chuyển từ một đối tác chuyên biệt sang nhà cung cấp GPU lớn nhất ngành chỉ trong vòng chưa đầy hai tháng. Nó chỉ không cho bạn biết bất cứ điều gì về ngân sách độ trễ của chính bạn, và không có bài đăng nào sẽ làm được điều đó.
