{{1}}Minh họa vector phẳng mang phong cách editorial cho phần hero của blog công nghệ về suy luận AI siêu nhanh{{/1}}: {{2}}một chip mô hình lớn bo tròn màu xanh lam đậm với ánh sáng cyan dịu trên nền sáng{{/2}}, {{3}}một tia sét cách điệu và một đồng hồ tốc độ với kim chỉ ở mức tối đa bên cạnh{{/3}}, {{4}}các luồng token nhanh chạy dọc theo một đường tốc độ ngang với các vạch chuyển động{{/4}}, {{5}}và một chiếc đồng hồ bấm giờ nhỏ{{/5}}. {{6}}Nền trắng với các điểm nhấn chuyển sắc xanh lam và cyan mềm mại cùng một điểm sáng ấm tinh tế{{/6}}; {{7}}các biểu tượng đường nét phẳng tối giản{{/7}}; {{8}}kiểu chữ sans-serif hình học hiện đại gọn gàng{{/8}}; {{9}}không có văn bản đọc được, không chữ cái, không từ ngữ, không hình mờ, không logo của bên thứ ba{{/9}}; {{10}}bố cục 16:9{{/10}}.
Guides & Insights

GPT-5.6 Sol Ultrafast: Tốc độ 14×, 750 Tok/s — CS-4 Được báo cáo là ~1.300, Chưa có giá

Tác giả

Gideon Frost

Ngày đăng

Mô hình mới nhất · 20Xem tất cả mô hình
Benchmark: Artificial Analysis · cập nhật hằng ngày
Quay lại tất cả bài viết

GPT-5.6 Sol Ultrafast modelà hạng phục vụ được tăng tốc phần cứng dành cho mô hình chủ lực — cùng một mô hình GPT-5.6 Sol đầy đủ chạy trên chip quy mô wafer của Cerebras thay vì cụm GPU, mang lại tốc độ nhanh hơn tới 14 lần so với xử lý tiêu chuẩn và lên tới 750 token đầu ra mỗi giây trên hạng mà OpenAI công bố vào tháng 8. Vào ngày 2026-08-18, Cerebras đã ra mắt hệ thống CS-4 thế hệ tiếp theo mà hạng này mở rộng lên, và một báo cáo sớm chưa được xác minh cho biết GPT-5.6 Sol trên CS-4 đã phục vụ khoảng 1.300 token mỗi giây. Đây không phải là mô hình nhỏ hơn và không phải là bản chưng cất: chỉ có phần cứng và lập lịch thay đổi, còn trí thông minh được bảo toàn. Điều chưa có là mức giá — tính đến ngày 2026-08-19, Ultrafast là bản xem trước API giới hạn với bảng giá chưa được công bố, vì vậy con số thực sự bạn có thể dựa vào để dự toán hôm nay là hạng tiêu chuẩn trên trang mô hình GPT-5.6 Sol hiện hành: 5 USD cho mỗi triệu token đầu vào và 30 USD cho mỗi triệu token đầu ra, được chuyển thẳng mà không cộng thêm phí. Bài viết này đề cập đến chế độ này là gì, tốc độ thực tế nhanh đến mức nào — bao gồm phần cứng CS-4 mới và những gì vẫn chưa được xác minh — chi phí ra sao (bao gồm cả câu trả lời trung thực "chưa có giá"), và nên làm gì cho đến khi nó được phát hành rộng rãi.

Thực chất chế độ Ultrafast là gì

Ultrafast là một tầng phục vụ, không phải là một mô hình mới. OpenAI đã công bố nó vào ngày 13 tháng 8 năm 2026 như là sản phẩm đầu tiên của quan hệ đối tác điện toán tháng 1 năm 2026 với nhà sản xuất chip Cerebras — một thỏa thuận được báo cáo trị giá khoảng 10 tỷ đô la trong ba năm. Trong khi suy luận GPT-5.6 Sol tiêu chuẩn chạy trên các cụm GPU và dành phần lớn thời gian để di chuyển trọng số giữa bộ nhớ và bộ tính toán, Ultrafast tải trọng số của mô hình vào 44 GB SRAM trên chip trong các chip quy mô wafer của Cerebras; một mô hình có kích thước như Sol trải rộng qua nhiều wafer thành các lớp, vì vậy các trọng số nằm ngay tại nơi có bộ tính toán. Kết quả là trần thông lượng được thiết lập bởi silicon thay vì bởi băng thông bộ nhớ.

Câu chuyện phần cứng đã có bước tiến mới vào ngày 18/08/2026. Tại sự kiện Supernova, Cerebras đã trình làng CS-4, hệ thống quy mô rack thế hệ tiếp theo được xây dựng trên nền tảng Nexus — gồm ba chip Wafer-Scale Engine mỗi rack, tốc độ tạo token nhanh gấp 2 lần so với CS-3 trước đó, và theo Cerebras, hơn 1.000 token mỗi giây trên các mô hình có trên 10 nghìn tỷ tham số. Đó là những tuyên bố của Cerebras về một hệ thống đang trong giai đoạn truy cập sớm, chưa được phát hành rộng rãi. Kể từ khi trình làng, một bài đăng duy nhất trên X tuyên bố CS-4 đã phục vụ GPT-5.6 Sol với tốc độ khoảng 1.300 token mỗi giây — nhất quán về hướng với số liệu của chính Cerebras, nhưng cho đến nay chưa được ai xác nhận. Hãy coi đây là một tín hiệu ban đầu: hợp lý, chưa được kiểm chứng, và đáng để kiểm tra lại trước khi bạn lên kế hoạch công suất dựa trên nó.

Phần quan trọng đối với mã của bạn: ID mô hình, trọng số, hành vi suy luận và đầu ra đều giống hệt GPT-5.6 Sol tiêu chuẩn. OpenAI định vị Ultrafast là "nhiều công việc hữu ích hơn mỗi giây" thay vì một bậc chất lượng, và bản xem trước chạy toàn bộ flagship — tốc độ không đến từ việc thay bằng một mô hình rẻ hơn. Điều thay đổi là tốc độ tạo token.

Đừng nhầm lẫn Ultrafast với chế độ nhanh hiện có. Chế độ nhanh là một gói trả phí riêng biệt trên phần cứng tiêu chuẩn: tốc độ đầu ra lên tới khoảng 2,5× với mức phí gấp 2× cho mỗi token (10 USD đầu vào / 60 USD đầu ra cho mỗi 1M), không thay đổi chất lượng. Ultrafast là một thứ hoàn toàn khác — phần cứng Cerebras, tốc độ lên tới 14×, và hiện tại hoàn toàn miễn phí.

Nhanh đến mức nào — những con số quan trọng

Speed card titled 'GPT-5.6 Sol Ultrafast — how fast', sourced to the OpenAI announcement of 2026-08-13 with all speed figures vendor-reported. Three highlight cells read Up to 14x max speedup vs standard, 750 output tokens per second max, and 11h 11m for 2,500 HLE questions. Rows list standard GPT-5.6 Sol as the 1x baseline, fast mode up to ~2.5x at 2x price, Claude Fable 5 on the same HLE set at 78h 27m, GDP-Val end-to-end at 5.6x faster, and 'same model, same quality — hardware only'. Footer: 14x is a maximum, not a guarantee, and none of the speed figures are independently verified yet.

Con số tiêu đề là 14×, và nó cần được định nghĩa. OpenAI cho biết Ultrafast tạo ra tối đa 750 token đầu ra mỗi giây so với xử lý GPT-5.6 Sol tiêu chuẩn. Đó là con số thông lượng cho token đầu ra, không phải tuyên bố chung chung "mọi thứ nhanh hơn 14×" — thời gian yêu cầu từ đầu đến cuối cũng bao gồm xử lý đầu vào và lý luận của chính mô hình, đó là lý do 14× được gắn nhãn là mức tối đa.

Thông lượng đầu ra tối đa — lên đến 750 token đầu ra mỗi giây, theo công bố của OpenAI (2026-08-13).

So với xử lý tiêu chuẩn — nhanh hơn tới 14 lần, theo cùng thông báo đó; mức tăng tốc thực tế thay đổi tùy theo độ dài đầu vào và loại tác vụ.

Humanity's Last Exam, 2,500 câu hỏi — OpenAI/Cerebras báo cáo GPT-5.6 Sol Ultrafast hoàn thành trong 11 giờ 11 phút so với 78 giờ 27 phút của Claude Fable 5, với độ chính xác tương đương. Do nhà cung cấp báo cáo, và sự so sánh này trải dài trên các hệ thống phần cứng của hai nhà cung cấp — hãy đọc nó như một thông tin định hướng, không phải một phán quyết.

GDP-Val, end-to-end — Cerebras báo cáo nhanh hơn 5,6 lần về tổng thể mà không có tổn thất chất lượng đáng kể. Cũng do nhà cung cấp báo cáo.

Chế độ nhanh cơ bản — bậc tốc độ hiện có thể mua được đạt tối đa khoảng 2,5× tốc độ đầu ra với mức giá cao hơn 2×.

• {{1}}CS-4, phần cứng thế hệ tiếp theo{{/1}} — {{2}}Cerebras tuyên bố rack CS-4 cung cấp hơn 1.000 token mỗi giây cho các mô hình trên 10 nghìn tỷ tham số, gấp tới 2 lần tốc độ tạo token của CS-3{{/2}}. {{3}}Một báo cáo cộng đồng chưa được xác minh cho thấy GPT-5.6 Sol trên CS-4 đạt ~1.300 token mỗi giây{{/3}} — {{4}}cùng xu hướng, chưa được OpenAI hoặc Cerebras xác nhận{{/4}}.

Một lưu ý trước khi bạn trích dẫn con số 14×: các bài đưa tin độc lập về sự kiện ra mắt đề cập đến so sánh tốc độ thế hệ ~11× với Claude Fable 5, trong khi số liệu của chính Cerebras ngụ ý ~7× cho tổng thời gian kiểm thử trong cùng một lần chạy — sự khác biệt nằm ở phần khối lượng công việc mà bạn đo. Nguyên tắc tương tự cũng áp dụng cho tín hiệu tốc độ của CS-4: con số ~1.300 token/giây ban đầu chỉ là một bài đăng X, và cả OpenAI lẫn Cerebras đều chưa xác nhận. Tất cả đều là số liệu của nhà cung cấp hoặc cộng đồng được công bố trong tuần này, và chưa có số liệu nào được xác minh độc lập. Hãy coi chúng là những tuyên bố, không phải là phán quyết điểm chuẩn.

Chi phí là bao nhiêu — và khoảng cách thật lòng

Price card titled 'What GPT-5.6 Sol costs today — 2026-08-18', listing published input/output rates per 1M tokens. Three highlight cells read Standard $5.00 / $30.00, Fast mode $10.00 / $60.00, and Ultrafast price TBD in preview. Rows list prompt cache read $0.50, cache write $6.25, long-context over ~272K $10.00 / $45.00, batch API $2.50 / $15.00, and context window ~1.05M with 128K max output. Footer: Ultrafast has no published price as of 2026-08-18 — standard and fast mode are what you can buy today.

Đây là tình hình về vấn đề giá vào ngày 2026-08-19, nói một cách thẳng thắn: Ultrafast không có mức giá công bố. OpenAI chưa công bố mức giá nào, và bản xem trước không xuất hiện trên bất kỳ bảng giá công khai nào. Các báo cáo cho rằng các suất truy cập sớm được đi kèm hoặc miễn phí chỉ là suy đoán, không phải chính sách — và cho đến khi OpenAI định giá cho bậc này, bất kỳ con số "chi phí GPT-5.6 Sol Ultrafast" nào bạn tìm thấy ở nơi khác cũng chỉ là một sự phỏng đoán.

Thứ bạn có thể định giá hôm nay là phần còn lại của dòng GPT-5.6 Sol, được xác minh dựa trên mức giá công bố của OpenAI vào ngày 2026-08-18:

Standard GPT-5.6 Sol — $5.00 đầu vào / $30.00 đầu ra cho mỗi 1 triệu token. Mức cơ bản bạn có thể gọi ngay bây giờ.

Chế độ nhanh — $10.00 / $60.00, một khoản phí cao gấp 2× cho tốc độ đầu ra nhanh hơn khoảng 2.5×. Đây là thứ gần nhất với một hạng tốc độ mà bạn thực sự có thể mua.

Đọc bộ nhớ đệm lời nhắc — $0.50 mỗi 1M (giảm 90% so với đầu vào mới); ghi bộ nhớ đệm được tính phí $6.25 mỗi 1M.

Tier ngữ cảnh dài — các đầu vào vượt quá khoảng 272K token sẽ được tính phí $10.00 / $45.00.

Batch API — $2.50 / $15.00, giảm 50% cố định với thời gian xử lý khoảng 24 giờ.

Để có bối cảnh về mức phí cao hơn cần kỳ vọng: fast mode đã thiết lập tiền lệ ở mức 2× giá tiêu chuẩn cho tốc độ 2.5×. Nếu Ultrafast đi theo đường cong tương tự, giá sẽ nằm cao hơn hẳn mức tiêu chuẩn $5 / $30 — và các bình luận xung quanh bản xem trước dự đoán chính xác điều đó, vì công suất wafer của Cerebras khan hiếm và đắt đỏ. Nhưng mức phí dự kiến không phải là giá chính thức. Hãy lập kế hoạch theo Sol tiêu chuẩn hoặc fast mode cho đến khi có bảng giá.

Cách sử dụng — thực tế của bản xem trước

Access là khoảng trống trung thực thứ hai. Ultrafast có sẵn thông qua OpenAI API cho một nhóm khách hàng chọn lọc theo danh sách chờ, được công bố vào ngày 13/08/2026, với OpenAI cho biết quyền truy cập sẽ được mở rộng "khi năng lực tăng lên". Không có ngày phát hành rộng rãi cụ thể. Các nhóm xem trước được công bố bao gồm lập trình, thương mại, nghiên cứu tài chính, hỗ trợ và các khối lượng công việc tương tác khác — các nhóm có agent thực hiện nhiều cuộc gọi trong mỗi yêu cầu và nơi độ trễ phản hồi là điểm nghẽn. Jane Street, Rogo và Podium nằm trong số những người thử nghiệm sớm được nêu tên.

Mẫu sử dụng mà nó được thiết kế cho: ứng phó sự cố (đọc log, trace và diff trong khi sự cố đang diễn ra), nghiên cứu tài chính và phát hiện gian lận trên dữ liệu đang biến động, hỗ trợ khách hàng và thoại theo thời gian thực (nơi mà nửa giây im lặng bị coi là trục trặc), thanh toán thương mại điện tử, và nén các đợt nghiên cứu qua đêm thành các phiên tương tác. Nếu khối lượng công việc của bạn là một cuộc trò chuyện một lượt, yếu tố 14× ít quan trọng hơn nhiều so với một vòng lặp agent 40 lần gọi.

Những gì bạn có thể làm hôm nay — câu trả lời thực tế

The OrcaRouter model page for openai/gpt-5.6-sol, showing the $5.00 per million input and $30.00 per million output pricing, the ~1.05M-token context window, 128K max output, and the vision, tools and JSON badges.

Trong khi Ultrafast đang trong giai đoạn xem trước, phiên bản đầy đủ GPT-5.6 Sol hiện đã có mặt — và trên OrcaRouter, gói tiêu chuẩn được phục vụ ở mức giá của nhà cung cấp, mức phụ phí $0 cho mỗi token, với mã mô hình openai/gpt-5.6-sol thông qua điểm cuối tương thích OpenAI tại api.orcarouter.ai/v1. Nếu bạn đã có sẵn một ứng dụng khách OpenAI, việc di chuyển chỉ là thay đổi URL gốc và mã mô hình; không gì khác. Cùng một khóa và điểm cuối hỗ trợ hơn 200 mô hình, vì vậy Sol nằm bên cạnh GPT-5.6 Terra, GPT-5.6 Luna, Claude Opus 5, và các mô hình open-weight mà bạn muốn so sánh — và bạn có thể định tuyến theo độ khó thay vì tích hợp lại từng mô hình.

Hai điểm cụ thể của OrcaRouter đáng nêu trên trang tốc độ. BYOK: tự mang khóa OpenAI của bạn và OpenAI tính phí trực tiếp cho bạn theo biểu giá riêng của họ — OrcaRouter thêm $0 cho mỗi token và giữ nguyên hạn mức và tín dụng của bạn với nhà cung cấp. Guardrails: PII Shield và chính sách nội dung chạy trước khi tính phí, vì vậy yêu cầu bị chặn sẽ trả về mã 400 sạch và không bao giờ bị tính phí, và Agent Firewall đánh giá các lệnh gọi công cụ và MCP trước khi chúng thực thi. Khi — và nếu — Ultrafast đạt trạng thái khả dụng chung với mức giá hợp lý để định tuyến, việc kết nối nó vào cùng một endpoint chỉ là thay đổi model-id; cấu hình bạn xây dựng hôm nay sẽ được duy trì.

Ranh giới trung thực — khi Ultrafast không phải là câu trả lời

Bốn nơi mà câu chuyện 14× không đứng vững, vì vậy bạn không nên thiết kế hoặc lập ngân sách dựa trên một con số chưa được chốt:

14× là mức tối đa, không phải là sự đảm bảo. Đây là trần thông lượng đầu ra trên phần cứng Cerebras; độ trễ đầu cuối vẫn bao gồm xử lý đầu vào, thời gian suy luận của mô hình và mạng của bạn. Một prompt nặng về suy luận có thể dành phần lớn thời gian thực tế để suy nghĩ, khiến mức tăng tốc nổi bật bị thu hẹp.

Nó không có giá và không có ngày GA. Kể từ ngày 2026-08-19, bạn không thể mua Ultrafast — chỉ có thể yêu cầu quyền truy cập xem trước, và phần cứng CS-4 đằng sau nó đang ở giai đoạn truy cập sớm chứ chưa được phát hành rộng rãi. Hãy dự trù ngân sách theo Sol tiêu chuẩn ($5 / $30) hoặc chế độ nhanh ($10 / $60), và coi mọi mức giá Ultrafast bạn thấy trên mạng là chưa được xác minh.

Các điểm chuẩn do nhà cung cấp báo cáo. Số liệu chạy HLE 11 giờ và chỉ số 5,6× GDP-Val là số liệu của OpenAI/Cerebras từ thông báo; các ước tính độc lập dao động từ khoảng 7× đến 11× tùy theo đối tượng được đo. Thêm tín hiệu tốc độ CS-4 vào danh sách đó: con số khoảng 1.300 token/s cho GPT-5.6 Sol trên CS-4 đến từ một bài đăng X duy nhất và không có xác nhận độc lập nào. Chưa có số liệu nào trong số này được xác minh độc lập.

Nó sẽ không khắc phục được điểm nghẽn mà bạn không có.Nếu các tác nhân của bạn chậm vì sự điều phối của chính bạn, độ trễ của công cụ hoặc các prompt yêu cầu nhiều đầu vào, thì đường dẫn đầu ra nhanh hơn chỉ làm dịch chuyển phần đuôi một chút. Quyết định khớp phân khúc — GPT-5.6 Sol giá $5 / $30 so với GPT-5.6 Terra giá $2 / $12 so với GPT-5.6 Luna giá $0.20 / $1.20 — vẫn làm thay đổi hóa đơn của bạn nhiều hơn bất kỳ mức tốc độ nào.

Tóm lại. GPT-5.6 Sol Ultrafast là tầng phục vụ nhanh nhất mà OpenAI từng tung ra cho mô hình chủ lực của mình — cùng trọng số trên phần cứng Cerebras, thông lượng cao gấp 14 lần và 750 token đầu ra mỗi giây ở tầng đã công bố. CS-4 mới của Cerebras (ra mắt ngày 2026-08-18) được cho là đẩy GPT-5.6 Sol lên khoảng 1.300 token mỗi giây, nhưng con số đó chỉ từ một bài đăng X duy nhất chưa được xác minh. Tính đến ngày 2026-08-19, Ultrafast mới chỉ là bản xem trước theo danh sách chờ, chưa có giá công khai. Nếu bạn đang tìm một con số để dự trù ngân sách, câu trả lời thành thật là vẫn chưa có con số nào. GPT-5.6 Sol tiêu chuẩn ở mức $5 / $30 là thứ bạn có thể gọi hôm nay, chế độ nhanh ở mức $10 / $60 là tầng tốc độ có thể mua, còn OrcaRouter truyền cả hai qua với phụ giá $0 trên key của chính bạn. Hãy xây dựng định tuyến ngay bây giờ — và khi Ultrafast có giá và có ngày ra mắt, bạn chỉ cách một lần đổi model-id.

Cho đến khi Ultrafast có giá, bản đầy đủ của GPT-5.6 Sol đã hoạt động trên GPT-5.6 Sol trên OrcaRouter với mức giá $5 / $30 mỗi triệu token, không cộng thêm phí, sẵn sàng dùng với key của bạn.

So sánh trong bài viết này1

Phát hiện từ bài viết này · Benchmark: Artificial Analysis · cập nhật hằng ngày

© 2026 OrcaRouter

Dành cho nhà cung cấp

Bạn vận hành nền tảng suy luận? Đưa mô hình của bạn lên OrcaRouter.

providers@orcarouter.ai

Tham gia cộng đồng

Discordsupport@orcarouter.aiXGitHubYouTube