Thẻ tiêu đề hero được tạo cho 'GPT-5.6 Sol Ultrafast vs GPT-5.6 Sol' với dòng chữ trên 'Cùng trọng số. Khác bậc dịch vụ.' và hai thẻ: bên trái 'GPT-5.6 Sol Ultrafast' liệt kê Phần cứng: wafer Cerebras, Tốc độ: tối đa 750 tok/s, Giá: chưa công bố; bên phải 'GPT-5.6 Sol' liệt kê Phần cứng: cụm GPU, Tốc độ: tiêu chuẩn, Giá: $4.00 / $20.00; chân trang 'Cả hai đều chạy trên cùng một checkpoint GPT-5.6 Sol.' Logo OrcaRouter ở góc dưới bên phải.
Guides & Insights

GPT-5.6 Sol Ultrafast so với GPT-5.6 Sol: Cùng trọng số, khác hạng dịch vụ

Tác giả

Alistair Wren

Ngày đăng

Mô hình mới nhất · 20Xem tất cả mô hình →
Benchmark: Artificial Analysis · cập nhật hằng ngày
Quay lại tất cả bài viết

GPT-5.6 Sol Ultrafast không phải là một mô hình mới, và đây không phải là một câu chuyện ra mắt. Nhà cung cấp đã công bố chế độ này vào ngày 13 tháng 8 năm 2026, và cùng ngày hôm đó giá trị ultrafast xuất hiện trong lược đồ OpenAPI công khai của công ty, bên trong phần mô tả ServiceTierResponses của đặc tả — phần này tự giới hạn phạm vi của tier theo cách diễn đạt của chính nó cho endpoint gpt-5.6-sol và đánh dấu nó là bị kiểm soát truy cập. Điều khiến trang này quay lại hàng đợi của chúng tôi thì nhỏ hơn và cụ thể hơn: vào ngày 25 tháng 9 năm 2026, commit fe4f7a1 đã mở rộng giá trị đó vào hai kiểu liệt kê nữa, tham số service-tier ở cấp yêu cầu và trường chính sách service-tier của agent. Sáu tuần sau thông báo, tier này vẫn nằm trong danh sách chờ, vẫn chưa có giá được công bố, và giờ đây đã được nối vào nhiều bề mặt API hơn mức nó thực sự có thể phục vụ. GPT-5.6 Sol Ultrafast và GPT-5.6 Sol là cùng một mô hình; điều duy nhất mà so sánh này có thể quyết định là ai kiểm soát con trỏ và ai đã cho bạn biết chi phí.

Vậy cuộc đối đầu trong tiêu đề là một cuộc đối đầu khá bất thường. GPT-5.6 Sol Ultrafast và GPT-5.6 Sol là cùng một mô hình. Cùng trọng số, cùng checkpoint, cùng hành vi suy luận, cùng cửa sổ ngữ cảnh 1,05 triệu token, cùng giới hạn đầu ra tối đa 128K, cùng câu trả lời. Cách diễn đạt của chính OpenAI là "nhiều công việc hữu ích hơn mỗi giây", chứ không phải một mô hình thông minh hơn. Điều duy nhất khác biệt giữa hai cột trong so sánh này là cách các token được tạo ra và hạng dịch vụ được gọi tên như thế nào trong phần thân yêu cầu của bạn — điều đó khiến nó trở thành thí nghiệm đối chứng sạch sẽ nhất trong đội hình hiện tại, và cũng là thứ khó chọn mua nhất, bởi vì một trong hai hạng hoàn toàn không có giá được công bố.

Điều gì thực sự đã thay đổi trong tuần này

Bằng chứng cho thay đổi tháng 9 là một commit, không phải một bài đăng blog. OpenAI duy trì openai-openapi, kho lưu trữ công bố lược đồ mà máy có thể đọc cho API của mình, và commit fe4f7a1 — ngày 2026-09-25 — bổ sung ultrafast vào hai kiểu liệt kê: chính sách bậc dịch vụ gắn với các agent, và trường ở cấp yêu cầu mà đặc tả mô tả là "bậc dịch vụ được dùng cho các yêu cầu mô hình." Đó là một phần mở rộng, không phải màn ra mắt: trước commit này, hai danh sách đó ghi auto, default, flex, priority, fast, và bậc này đã có trong lược đồ từ ngày 13 tháng 8. Commit này đáng chú ý vì nó chạm tới trường nào — trường chính sách mà một agent được cấu hình theo, vốn là một bề mặt khác với ghi đè theo từng yêu cầu.

Mô tả quan trọng bắt nguồn từ commit ngày 13 tháng 8, không phải commit này, và đây là tuyên bố cụ thể nhất mà OpenAI đã công bố về bậc dịch vụ này ở bất cứ đâu. Cùng với giá trị mới, đặc tả viết: “Nếu được đặt thành 'ultrafast', thì yêu cầu sẽ được xử lý bằng bậc dịch vụ Ultrafast Processing được kiểm soát truy cập. Bậc này hiện có sẵn cho gpt-5.6-sol; một phản hồi được phục vụ thông qua đó sẽ hiển thị service_tier=ultrafast.”

Hãy đọc câu đó hai lần, vì nó giải quyết hai câu hỏi mà nếu không thì trang so sánh này sẽ phải nói vòng vo. Bậc này chỉ được giới hạn cho một mô hình — flagship GPT-5.6 Sol và không có gì khác trong danh mục — và nó được kiểm soát quyền truy cập thay vì mở, điều này khớp với cách OpenAI mô tả về một bản xem trước nằm trong danh sách chờ. Nó cũng cho bạn biết bạn sẽ nhận ra mình đã có được nó bằng cách nào: phản hồi sẽ trả ngược lại thông tin về việc bậc nào thực sự đã phục vụ yêu cầu, nhờ đó việc chuyển sang xử lý tiêu chuẩn hiện rõ trong phần thân phản hồi thay vì là điều bạn phải suy ra từ độ trễ. Mô tả tương tự cũng xuất hiện trong cả hai schema Responses tiêu chuẩn và Beta, và đã như vậy kể từ ngày 13 tháng 8.

A screenshot of the GitHub commit page for openai/openai-openapi commit fe4f7a1 by openai-openapi-publisher[bot], titled "Add 'ultrafast' service tier option to improve request speed", showing the diff adding "ultrafast" to the enum lists after "fast" and a new x-enumDescription reading "Uses the ultrafast service tier."

Một tín hiệu thứ hai, yếu hơn, xuất hiện vào ngày hôm sau. Bản báo cáo ngày 26 tháng 9 mô tả một bộ chọn Speed mới — Fast, Standard và Ultrafast — sắp ra mắt trong Responses API Playground, với khả năng cung cấp Ultrafast rộng rãi hơn được dự kiến sau hội nghị dành cho nhà phát triển DevDay của OpenAI. Chúng tôi chưa tự mình thấy bộ chọn này và OpenAI chưa công bố ghi chú triển khai, nên hãy coi đây là báo cáo từ một nguồn duy nhất thay vì một tính năng đã phát hành. Những phần có thể kiểm chứng được ở thời điểm hiện tại là hai chỗ trong schema công khai và việc chưa có bảng giá nào xuất hiện cho hạng này.

Những gì đã không thay đổi cũng quan trọng không kém. Vẫn chưa có mức giá Ultrafast. Trang định giá của OpenAI, đọc ngày 27 tháng 9, vẫn chứa bốn tab như trước — Standard, Batch, Flex và Fast — và chuỗi "ultrafast" không xuất hiện ở bất kỳ đâu trên đó. Quyền truy cập vẫn được mô tả là bản xem trước giới hạn cho một số khách hàng chọn lọc, sẽ mở rộng khi năng lực tăng lên. Hạng này vừa nằm trong hợp đồng vừa không nằm trong bảng giá cùng một lúc, và đó là thực trạng trung thực của nó.

Hai tầng, cạnh nhau

Vì không có khả năng nào phân tách hai bên này, nên sự so sánh gần như thu hẹp hoàn toàn vào phần phục vụ và thanh toán. Mỗi dòng dưới đây đều mang cả hai bên trên cùng một hàng.

• Mô hình — GPT-5.6 Sol Ultrafast chạy trên cùng một checkpoint GPT-5.6 Sol như GPT-5.6 Sol xử lý tiêu chuẩn, cùng checkpoint, không chưng cất, không giảm kích thước.

• Thông lượng đầu ra — lên tới 750 token đầu ra mỗi giây, tối đa gấp 14× mức tiêu chuẩn, theo thông báo ngày 13 tháng 8 của OpenAI, so với xử lý tiêu chuẩn của GPT-5.6 Sol trên các cụm GPU, vốn là con số làm mốc đo mức 14×.

• Phần cứng — chip quy mô tấm wafer của Cerebras, trọng số thường trú trong SRAM trên chip, sản phẩm đầu tiên của quan hệ đối tác tính toán tháng 1 năm 2026 giữa OpenAI với Cerebras, được cho là trị giá khoảng 10 tỷ USD trong ba năm, so với suy luận GPU thông thường, nơi phần lớn thời gian dành cho việc di chuyển trọng số giữa bộ nhớ và tính toán.

• Giá — chưa được công bố tính đến ngày 27 tháng 9 năm 2026, so với 4,00 USD cho đầu vào / 20,00 USD cho đầu ra trên mỗi triệu token, mức giá khuyến mãi hiện tại của OpenAI, cộng thêm 0,40 USD trên mỗi triệu cho đầu vào được lưu trong bộ nhớ đệm.

• Khả năng truy cập — bản xem trước giới hạn trong danh sách chờ dành cho một số khách hàng được chọn, so với luồng mặc định mà bất kỳ ai có khóa API đều có thể gọi.

• Những câu trả lời bạn nhận được — về nguyên tắc thì giống hệt nhau so với về nguyên tắc thì giống hệt nhau; nếu chúng khác nhau trên cùng một prompt, thì đó là một phát hiện, chứ không phải một tính năng.

A generated two-column scoreboard titled 'GPT-5.6 Sol Ultrafast vs GPT-5.6 Sol — the scoreboard'. Left column 'GPT-5.6 Sol Ultrafast': Checkpoint same as Sol, Serving hardware Cerebras wafers, Output speed up to 750 tok/s, Speed vs standard up to 14x, Price not published, Access waitlisted preview. Right column 'GPT-5.6 Sol': Checkpoint same as Sol, Serving hardware GPU clusters, Output speed standard processing, Speed vs standard 1x baseline, Price $4.00 / $20.00, Access open to any API key. Footer sourcing line; OrcaRouter logo bottom-right.

Tuyên bố về tốc độ, và giới hạn trên của nó

Con số được nhấn mạnh là 14× và nó xứng đáng nhận được sự cẩn trọng như phần còn lại của trang này. OpenAI nêu con số lên tới 750 token đầu ra mỗi giây so với xử lý tiêu chuẩn — một con số thông lượng cho token đầu ra, chứ không phải là tuyên bố rằng mọi yêu cầu đều hoàn tất nhanh hơn 14 lần. Thời gian đầu-cuối còn bao gồm cả xử lý đầu vào và quá trình suy luận của chính mô hình, những phần mà phần cứng quy mô tấm wafer không thể nén ở cùng tỷ lệ. Đó là lý do công ty gọi 14× là mức tối đa chứ không phải một phép đo.

Các so sánh đã công bố đều do nhà cung cấp báo cáo ở cả hai phía của bảng, và một trong số đó trải dài trên các stack của hai nhà cung cấp. Một lượt chạy Humanity's Last Exam gồm 2.500 câu hỏi được báo cáo là hoàn thành trong 11 giờ 11 phút trên Ultrafast, so với 78 giờ 27 phút đối với Claude Fable 5, với độ chính xác tương đương — tức là OpenAI và Cerebras đang cho chúng ta biết về một benchmark có bao gồm mô hình của một đối thủ, và các bài đưa tin độc lập về buổi ra mắt đã trích dẫn một so sánh tốc độ sinh hẹp hơn, khoảng 11×, trên cùng lượt chạy, trong khi các số liệu của chính Cerebras hàm ý khoảng 7× cho tổng thời gian kiểm thử. Khoảng cách giữa 14×, 11× và 7× không phải là mâu thuẫn; đó là điều xảy ra khi ba bên đo các phần khác nhau của cùng một khối lượng công việc. Cerebras cũng báo cáo riêng mức 5,6× end-to-end trên GDP-Val mà không có suy giảm chất lượng có thể đo được. Không có phần nào trong đó được một bên thứ ba tái lập.

Bảng giá có một lỗ hổng.

Đây là điểm mà hai hạng không còn đối xứng nữa. GPT-5.6 Sol có bốn bảng giá được công bố và Ultrafast không nằm trong số đó.

• GPT-5.6 Sol Tiêu chuẩn — $4.00 / $20.00 mỗi triệu token, với đầu vào được lưu đệm ở mức $0.40 và một mức ngữ cảnh dài ở $8.00 / $30.00 khi đầu vào vượt qua khoảng 272K token.

• Chế độ Fast — $8.00 / $40.00, đúng gấp đôi mức giá tiêu chuẩn. Đây là gói đã được đổi tên từ Priority processing vào ngày 30 tháng 7 năm 2026, và API chấp nhận cả service_tier: "priority" lẫn service_tier: "fast". Gói này mang lại tốc độ đầu ra nhanh hơn tới khoảng 2,5×.

• Batch và Flex — $2.00 / $10.00, giảm thẳng 50% so với mức tiêu chuẩn để đổi lấy lịch trình linh hoạt hơn.

• Ultrafast — không có bảng giá. Không phải khoảng trống mà chúng tôi lấp bằng phỏng đoán; mà là khoảng trống OpenAI đã để lại.

Dòng Fast-mode đó là tiền lệ thực sự duy nhất mà bất kỳ ai có thể dùng để định giá Ultrafast, và đó là một tiền lệ đáng suy ngẫm cho bất cứ ai đang lập ngân sách: hạng tốc độ duy nhất mà OpenAI thực sự đã đưa ra con số có mức giá đúng gấp đôi mức giá tiêu chuẩn để đổi lấy tốc độ gấp hai lần rưỡi. Ultrafast là một tuyên bố tốc độ lớn hơn dựa trên phần cứng khan hiếm hơn — năng lực wafer của Cerebras không phải là hàng hóa phổ thông — nên hướng đi của khoản phụ trội cuối cùng thì không còn nghi ngờ gì. Còn quy mô của nó thì có. Cho đến khi có bảng giá, bất kỳ con số "giá GPT-5.6 Sol Ultrafast" nào bạn thấy được trích dẫn ở đâu đó đều là suy luận của ai đó, kể cả bất kỳ suy luận nào của chúng tôi.

Cách bạn thực sự sẽ gọi nó

Thay đổi schema cho bạn biết hình dạng của lệnh gọi cuối cùng. Nếu tier đi theo mô hình của những cái khác, nó sẽ đến dưới dạng một trường bổ sung trên yêu cầu mà bạn đã đang thực hiện: bạn giữ nguyên model gpt-5.6-sol, giữ nguyên prompt, và thêm bộ chọn tier — giống như cách chế độ Fast được chọn ngày nay bằng việc hoán đổi priority thành fast. Không có gì thay đổi trong việc phân tích phản hồi của bạn, vì không có gì về model thay đổi. Đó chính là toàn bộ sức hấp dẫn của một serving tier so với việc hoán đổi model, và là lý do một trang so sánh như trang này có rất ít thứ để so sánh.

Điều bạn không thể làm hôm nay là gọi nó. Giá trị enum tồn tại; nhưng năng lực đằng sau nó thì không, đối với hầu hết tài khoản. Vậy nên câu hỏi thực tế trong vài tuần tới không phải là chọn tầng nào trong hai tầng — mà là chạy cái gì trong lúc lựa chọn ấy chưa khả dụng.

Đó là câu hỏi mà một gateway trả lời tốt hơn một danh sách chờ. Bậc tiêu chuẩn của mô hình hiện đã hoạt động trên OrcaRouter với tên openai/gpt-5.6-sol, được phục vụ theo đúng mức giá của nhà cung cấp với không cộng thêm phí trên token, thông qua endpoint tương thích OpenAI tại api.orcarouter.ai/v1 — nên mức khuyến mãi $4 / $20 của OpenAI và bậc $8 / $30 cho ngữ cảnh dài được chuyển thẳng qua thay vì chúng tôi định giá lại, và thay đổi đối với chúng sẽ đến phía chúng tôi cùng ngày mà nó đến với OpenAI. Cùng một key đó mang hơn 200 mô hình, điều này ở đây quan trọng hơn mức bình thường: bởi vì bạn không thể đặt service_tier: "ultrafast" rồi nhận được câu trả lời, cách để mua độ trễ ngày nay là định tuyến công việc theo cách khác — gửi các cuộc gọi tương tác đến bất kỳ mô hình nào trong danh mục vượt qua mức chất lượng của bạn một cách nhanh nhất, và giữ các lô chạy qua đêm trên làn rẻ nhất đáp ứng được yêu cầu. Khi bậc đó thực sự mở, router chính là nơi bạn gạt công tắc, và cho đến lúc đó, nó là sự khác biệt giữa một danh sách chờ và một kế hoạch.

A screenshot of OrcaRouter's own model page for OpenAI GPT-5.6 Sol at /models/openai/gpt-5.6-sol, showing the live catalogue entry with the openai/gpt-5.6-sol identifier, Vision, Tools, JSON and Reasoning capabilities, the byline 'by OpenAI - 2026-07-09', code samples, pricing, performance and public benchmark sections listed on-page.

Cái nào thuộc về môi trường sản xuất?

Tạm gác lại từ “versus”, vì ở đây không có quyết định chất lượng nào cần đưa ra. Nếu bạn đang tối ưu chi phí trên mỗi token, GPT-5.6 Sol tiêu chuẩn là câu trả lời, và làn Batch giảm 50% là câu trả lời cho bất cứ thứ gì có thể chờ. Nếu bạn đang tối ưu thời gian một con người ngồi trước vòng xoay chờ, Ultrafast là câu trả lời ngay khi bạn có thể có được nó — và các khối lượng công việc mà OpenAI đang nêu tên cho bản xem trước cho thấy chính xác vì sao: phản ứng sự cố với log và diff mở trên một sự cố đang diễn ra, kiểm tra gian lận dựa trên dữ liệu đang thay đổi, các cuộc trò chuyện hỗ trợ nơi nửa giây im lặng bị hiểu là sản phẩm bị hỏng, và các vòng lặp nghiên cứu từng chạy qua đêm được nén vào một phiên làm việc.

Dấu hiệu nhận biết nằm ở hình dạng đồ thị yêu cầu của bạn, không phải ở kích thước prompt. Một lần sinh dài duy nhất đạt 14× trên lý thuyết và ít hơn hẳn trên thực tế, vì việc xử lý đầu vào và suy luận không nén theo tỷ lệ đó. Bốn mươi lệnh gọi công cụ tuần tự đằng sau một hành động mà người dùng nhìn thấy sẽ đạt được mức gần với hệ số nhân đầy đủ hơn nhiều, bởi vì mỗi vòng khứ hồi trong số đó đều là độ trễ mà người dùng đang phải chờ đợi. Nếu khối lượng công việc của bạn giống trường hợp thứ hai, hạng này chính là dành cho bạn; nếu giống trường hợp thứ nhất, làn tiêu chuẩn vốn dĩ đã luôn ổn.

Hai điều cần để mắt, và cả hai đều không phải là tin đồn mà chúng ta có thể xác định được từ đây. Thứ nhất, bảng giá: một gói cao cấp không có giá thì không thể lập ngân sách, và tiền lệ Fast-mode cho thấy nó sẽ không nhỏ. Thứ hai, liệu danh sách chờ có thực sự được gỡ quanh DevDay như đã đưa tin hay không — vì một giá trị service_tier mà hầu hết tài khoản không thể dùng chỉ là tài liệu, không phải khả năng sẵn có, và sự khác biệt giữa hai điều đó là sự khác biệt giữa một kế hoạch và một lời hứa.