
GPT-6.1 Sol Ultrafast được triển khai tới API, Codex và ChatGPT Work
- openaiMỚIOpenAI: GPT-6.1 Sol2026-09-2952Trí tuệ
- anthropicMỚIAnthropic: Claude Sonnet 5.52026-09-2856Trí tuệ
- typesafeTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 trên 1 triệu token · 111 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238Trí tuệ
- OpenAIOpenAI: GPT-6 Sol2026-09-2248Trí tuệ
- AnthropicAnthropic: Claude Opus 5.52026-09-2258Trí tuệ
- xAIGrok 4.72026-09-2146Trí tuệ
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 trên 1 triệu token · 55 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 trên 1 triệu token · 347 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Trí tuệ
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Trí tuệ77Lập trình
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Trí tuệ76Lập trình
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Trí tuệ76Lập trình
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Trí tuệ82Lập trình
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 trên 1 triệu token · 60 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 trên 1 triệu token · 377 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Trí tuệ72Lập trình
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 trên 1 triệu token · 231 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Trí tuệ75Lập trình
- obsidianQwen3.8 27B2026-08-1534Trí tuệ68Lập trình
OpenAI đang triển khai chế độ Ultrafast cho GPT-6.1 Sol — gói dịch vụ nhanh nhất mà họ bán, và là lần đầu tiên gói Sol gần-Astra có một gói như vậy. Động thái này đưa GPT-6.1 Sol vào cùng nhóm với GPT-6 Astra Ultrafast trong API, trong Codex và trong ChatGPT Work, và nó ra mắt với bảng giá được công bố thay vì danh sách chờ: $12.00 mỗi triệu token đầu vào và $60.00 mỗi triệu token đầu ra, đúng sáu lần mức giá tiêu chuẩn của GPT-6.1 Sol phải trả. Tuyên bố về tốc độ trên nhãn là "nhanh gấp 8 lần". Phần thú vị nằm ở chỗ cụm từ đó đang đo cái gì, và câu trả lời không phải là mô hình mà bạn sắp trả tiền để dùng.
Nhật ký thay đổi dành cho nhà phát triển có mục ngày 8 tháng 10: "Đã thêm chế độ Ultrafast cho GPT-6.1 Sol trong Responses API. Dùng gpt-6.1-sol với service_tier: "ultrafast" để giảm thời gian giữa các token đầu ra được tạo. Chế độ này khả dụng cho mọi người dùng API, tùy thuộc vào giới hạn tốc độ, với xử lý toàn cầu và lưu trữ dữ liệu tại Hoa Kỳ và EU." Trang tài liệu về Ultrafast hiện ghi "khả dụng rộng rãi cho GPT-6 Astra và GPT-6.1 Sol, với quyền truy cập xem trước cho GPT-5.6 Sol", và trang về tốc độ phía ChatGPT xác nhận phần thuộc gói đăng ký: Ultrafast khả dụng trong Codex và ChatGPT Work trên gói Pro $500 và trên các gói Enterprise và Edu đủ điều kiện.
Ultrafast là một tầng dịch vụ, không phải là một mô hình thứ hai
Không có gì về trọng số thay đổi. Cùng checkpoint, cùng cửa sổ ngữ cảnh 1.050.000 token, cùng mức đầu vào tối đa 922.000 token, cùng giới hạn đầu ra 128.000 token, cùng mốc kiến thức ngày 30 tháng 4 năm 2026, cùng câu trả lời. Điều bạn đang mua là mức ưu tiên lập lịch: mô hình tạo token nhanh hơn, và cách OpenAI tự diễn đạt là cố ý thu hẹp — gói này "giảm thời gian giữa các token đầu ra được tạo". Nó không làm mô hình thông minh hơn, và nó không làm giai đoạn suy nghĩ ngắn hơn.
Sự khác biệt đó chính là toàn bộ quyết định. Đối với một vòng lặp tác nhân thực hiện bốn mươi lần gọi công cụ liên tiếp, lợi ích sẽ cộng dồn bởi vì đầu ra của mỗi lượt đến sớm hơn. Đối với một yêu cầu suy luận khó duy nhất dành phần lớn thời gian thực tế để cân nhắc, bạn có thể trả gấp sáu lần và vẫn nhìn cùng một vòng xoay.
Thang bậc xếp hạng, một lần, nói một cách đơn giản:
• Batch and Flex — bằng một nửa Standard, làn giá rẻ dành cho công việc không ai đang chờ đợi
• Tiêu chuẩn — $2.00 đầu vào / $0.10 đã lưu cache / $2.50 ghi cache / $10.00 đầu ra mỗi triệu token
• Fast — gấp đôi Standard, hoặc $4,00 / $0,20 / $5,00 / $20,00; OpenAI đã đổi tên Priority processing thành Fast mode vào ngày 30 tháng 7 năm 2026
• Siêu nhanh — gấp sáu lần Standard, hoặc $12.00 / $0.60 / $15.00 / $60.00
• Trên 272K token đầu vào — toàn bộ yêu cầu được tính lại giá theo mức 2 lần đối với đầu vào và bộ nhớ đệm, và 1,5 lần đối với đầu ra; Ultrafast long-context là $24.00 / $1.20 / $30.00 / $90.00
Phép toán mà không ai đưa lên trang tiếp thị
Giá gấp sáu lần để đổi lấy tốc độ gấp tám lần không phải là một giao dịch thua lỗ, và cũng không phải là một bữa trưa miễn phí. Ultrafast được tính phí theo token, vì thế một tác vụ tốn $1.00 ở Standard sẽ tốn $6.00 ở Ultrafast — và hoàn thành trong khoảng một phần tám thời gian. Khoản tiết kiệm không nằm trên hóa đơn, mà nằm ở thời gian thực tế. Bạn đang trả thêm năm đô-la để loại bỏ bảy phần tám thời gian xếp hàng của tác vụ đó, và việc đó là rẻ hay vô lý hoàn toàn phụ thuộc vào việc người hoặc pipeline đang chờ ở đầu bên kia đáng giá bao nhiêu mỗi phút.
Có hai hàm ý kéo theo, và chúng chính là những điều bị bỏ sót:
• Công việc tương tác là câu trả lời "có" dễ dàng. Một lập trình viên đang theo dõi một diff được áp dụng, một agent không thể tiếp tục cho đến khi nó đã đọc kết quả — đó là những trường hợp mà độ trễ chính là sản phẩm. Đầu ra nhanh hơn tám lần trong một vòng lặp bốn mươi lượt không phải là một cải thiện nhỏ đối với cảm nhận của con người; đó là sự khác biệt giữa một công cụ bạn dùng và một công cụ bạn cho chạy nền.
• Công việc theo lịch và theo lô là kiểu dễ nói không. Nếu một tác vụ dù sao cũng có đến sáng mai để hoàn thành, Ultrafast là hóa đơn gấp 6 lần mà chẳng được gì, và làn Batch giảm nửa giá đang ở ngay đó.
Đầu vào được lưu đệm đáng để xem xét kỹ hơn, vì nó cũng biến động: 0,60 USD mỗi triệu token trên Ultrafast so với 0,10 USD trên Standard, vẫn bằng 5% mức giá đầu vào không lưu đệm. Những agent dùng prompt caching, khi gửi lại một system prompt lớn ở mỗi lượt, sẽ nhận ra rằng mức chiết khấu từ cache thay đổi theo tier chứ không hề che chắn chúng khỏi điều đó.

Con số “lên đến 8x” đến từ đâu
Đây là phần cần đọc kỹ, vì đây chính là chỗ mà tiêu đề của đợt triển khai và tài liệu của đợt triển khai lại lặng lẽ mô tả những điều khác nhau.
Phép đo tốc độ dành riêng cho mô hình duy nhất mà OpenAI công bố là câu này: "GPT-6 Astra Ultrafast tạo token nhanh hơn tới 8 lần so với GPT-6 Astra ở chế độ Standard trong Codex." Đó là số liệu của Astra, được đo trong Codex. Không có bội số tương đương nào được công bố cho GPT-6.1 Sol. Tài liệu nói về Ultrafast cho mô hình này cho biết nó làm giảm thời gian giữa các token đầu ra được tạo và trỏ đến một bảng giá; tài liệu không đưa ra con số cụ thể cho điều đó. Trang tốc độ phía ChatGPT lặp lại câu về Astra và dừng ở đó.
Vậy nên cách hiểu trung thực về “nhanh hơn tới 8 lần” là: đây là tiêu đề nổi bật của hạng, bắt nguồn từ mô hình anh em đã có mặt trên Ultrafast kể từ ngày 29 tháng 9, và đây là tuyên bố của nhà cung cấp mà chưa bên độc lập nào tái lập được cho bất kỳ mô hình nào trong hai. Điều đó hoàn toàn có thể đúng với GPT-6.1 Sol — cả hai chạy trên cùng một ngăn xếp phục vụ và cơ chế của hạng là như nhau — nhưng chưa ai ngoài OpenAI công bố phép đo token mỗi giây cho biến thể Sol, và cụm “tới” đang có sức nặng thực sự trong câu đó.
Cũng nên giữ các hạng được tách riêng theo mô hình, vì cái cũ hơn vẫn còn là việc dang dở. Ultrafast được công bố vào ngày 13 tháng 8 năm 2026 cho GPT-5.6 Sol với "nhanh hơn tối đa 14 lần so với xử lý Standard", trong bản xem trước giới hạn dành cho một số khách hàng được chọn. Ba tháng sau, tài liệu vẫn ghi GPT-5.6 Sol có "quyền truy cập xem trước" và bảng giá Ultrafast chỉ chứa đúng hai dòng — GPT-6 Astra và GPT-6.1 Sol. Con số 14 lần chưa từng đạt được mức sẵn có chung và không có mức giá nào được công bố là một tuyên bố, không phải một sản phẩm.

Ai thực sự có thể bật nó lên
Mảng API thì rộng; mảng đăng ký thì hẹp, và sự khác biệt đó khiến nhiều người bị bất ngờ.
• API — khả dụng cho tất cả người dùng API trên gpt-6.1-sol, chịu các giới hạn tốc độ riêng so với Standard và Fast. Điều đó có nghĩa là có thêm một ngân sách cần theo dõi, chứ không chỉ là một mức giá thứ hai.
• Giới hạn tốc độ siêu nhanh cho GPT-6.1 Sol — 1.000.000 token mỗi phút ở gói Build, 4.000.000 ở Launch, 40.000.000 ở Grow. OpenAI đã đơn giản hóa các bậc sử dụng từ năm xuống còn ba vào ngày 6 tháng 10, vì vậy ba cái tên đó chính là thang bậc hiện hành, chứ không phải thang bậc cũ.
• Lưu trú dữ liệu — GPT-6.1 Sol hỗ trợ lưu trú dữ liệu tại Hoa Kỳ và EU cùng xử lý toàn cầu, kể cả trong chế độ Fast và Ultrafast. Ultrafast của Astra không được lưu trú tại EU, vì vậy nếu khối lượng công việc của bạn được ghim ở EU thì đây là cấu hình Ultrafast đầu tiên mà bạn có thể mua.
• Codex và ChatGPT Work — Ultrafast có sẵn trên gói Pro $500 và trên các gói Enterprise và Edu đủ điều kiện. Quản trị viên Enterprise mặc định sẽ thấy nó bị tắt và phải bật cho từng người dùng hoặc từng workspace.
• Chat — không bao gồm. Bản thân GPT-6.1 Sol nằm trong Work và Codex; bề mặt Chat dành cho người tiêu dùng không thuộc phạm vi này.
• Cách tính phí trên gói đăng ký — mức sử dụng được bao gồm bị tính ở mức gấp 8 lần so với mức Chuẩn, còn tín dụng đã mua hoặc hình thức trả theo mức sử dụng của Enterprise được tính ở mức gấp 6 lần so với mức Chuẩn. Cả hai con số này đều đáng để bạn biết trước khi quyết định giữ nó ở trạng thái bật.
Một chi tiết triển khai quyết định liệu bạn có thấy được chút tốc độ nào hay không. Hướng dẫn của OpenAI rất thẳng thắn về điều này: hãy dùng WebSockets, "đặc biệt là đối với các ứng dụng agentic thực hiện nhiều lệnh gọi công cụ liên tiếp nhanh chóng", vì "nếu không có kết nối thường trực, chi phí mạng có thể làm giảm mức cải thiện độ trễ". Nếu client của bạn mở một kết nối HTTP mới cho mỗi lệnh gọi, chi phí trên mỗi yêu cầu có thể ăn hết toàn bộ lợi thế của gói mà bạn vừa trả gấp 6 lần. HTTP vẫn hoạt động. Chỉ là nó có thể không đáng với gói đó.
Những gì chúng tôi định tuyến và những gì chúng tôi không.
GPT-6.1 Sol bậc Standard hiện có trên OrcaRouter với mã openai/gpt-6.1-sol theo đúng mức giá của nhà cung cấp là $2.00 cho đầu vào và $10.00 cho đầu ra trên mỗi triệu token, phục vụ ở mức markup 0% — giá niêm yết của nhà cung cấp được chuyển nguyên vẹn, nên khi OpenAI điều chỉnh mức giá thì thay đổi đó vào hóa đơn của bạn ngay trong ngày nó lên bảng giá, chứ không phải đợi đến kỳ gia hạn hợp đồng tiếp theo. Cùng một key và endpoint đảm nhiệm hơn 200 mô hình, nên một lệnh gọi GPT-6.1 Sol và một lệnh gọi Claude hay Qwen nằm sau cùng một tích hợp với khả năng chuyển đổi dự phòng tự động và không cần hợp đồng thứ hai, còn DSL định tuyến sẽ kết hợp các mô hình thành một lệnh gọi duy nhất khi một tác vụ cần nhiều hơn một ý kiến.
Ultrafast không phải là một trong những model đó, và sẽ là gây hiểu nhầm nếu ngụ ý điều ngược lại. Nó là một cờ service-tier trên tài khoản OpenAI — bạn gửi service_tier: "ultrafast" đến gpt-6.1-sol và OpenAI tính phí vào chính tài khoản của bạn theo mức giá ở trên — vì vậy nó nằm bên trong tích hợp OpenAI trực tiếp của bạn. Nếu bạn bật nó lên, hãy giữ lưu lượng theo tier trên key nhà cung cấp của bạn và định tuyến lưu lượng khối lượng tiêu chuẩn qua chúng tôi. Đó là cách phân chia trung thực, và cũng là cách rẻ hơn cho bất cứ thứ gì không phải chờ đợi con người.

Hôm nay làm gì với nó đây
Nếu bạn có một ghế Codex hoặc ChatGPT Work trên Pro $500, công tắc đã có sẵn và bản dùng thử không tốn gì ngoài hệ số sử dụng — hãy chạy cùng một tác vụ theo cả hai cách và xem liệu vòng lặp bạn thực sự chạy có đủ lượt để mức gấp tám xuất hiện hay không. Nếu bạn đang dùng API, thí nghiệm đáng chạy thì hẹp hơn những gì thông báo gợi ý: hãy đo xem bao nhiêu độ trễ của bạn là do sinh token và bao nhiêu là do mô hình suy nghĩ, rồi hướng Ultrafast vào phần mà nó thực sự có thể nén.
Và nếu bạn có lựa chọn giữa Fast ở 2x và Ultrafast ở 6x cho cùng một yêu cầu, Fast là hạng đã có mặt ở đây trước tiên và là hạng mà bạn có thể suy luận hành vi của nó chỉ từ một bảng giá cước. Ultrafast là mới cho mô hình này, chưa được định giá bởi bất kỳ phép đo độc lập nào, và đáng giá đúng bằng những gì đồng hồ bấm giây của chính bạn nói.
So sánh trong bài viết này2
Phát hiện từ bài viết này · Benchmark: Artificial Analysis · cập nhật hằng ngày
