
GPT-6.1 Ultrafast vs GPT-6.1 Sol: Ba công việc, một phán quyết
- openaiMỚIOpenAI: GPT-6.1 Sol2026-09-2952Trí tuệ
- anthropicMỚIAnthropic: Claude Sonnet 5.52026-09-2856Trí tuệ
- typesafeTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 trên 1 triệu token · 111 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238Trí tuệ
- OpenAIOpenAI: GPT-6 Sol2026-09-2248Trí tuệ
- AnthropicAnthropic: Claude Opus 5.52026-09-2258Trí tuệ
- xAIGrok 4.72026-09-2146Trí tuệ
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 trên 1 triệu token · 55 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 trên 1 triệu token · 347 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Trí tuệ
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Trí tuệ77Lập trình
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Trí tuệ76Lập trình
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Trí tuệ76Lập trình
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Trí tuệ82Lập trình
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 trên 1 triệu token · 60 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 trên 1 triệu token · 377 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Trí tuệ72Lập trình
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 trên 1 triệu token · 231 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Trí tuệ75Lập trình
- obsidianQwen3.8 27B2026-08-1534Trí tuệ68Lập trình
Hãy thử hỏi xem GPT-6.1 Ultrafast có đáng với mức giá gấp sáu lần GPT-6.1 Sol hay không, và câu trả lời trung thực là hai trong số ba khối lượng công việc của bạn nên ở nguyên chỗ cũ. Tác nhân lập trình tương tác thì nên chuyển sang. Còn đợt quét đánh giá chạy qua đêm thì không, và trình tóm tắt theo lô cũng vậy, và lý do không phải là gói này bị định giá quá cao — mà là họ chưa từng mua thứ mà nó bán. GPT-6.1 Sol ra mắt ngày 29 tháng 9 năm 2026 và Ultrafast xuất hiện như một chế độ chạy trên nó vào ngày 8 tháng 10 năm 2026: cùng checkpoint, cùng cửa sổ ngữ cảnh 1.050.000 token, cùng giới hạn đầu ra 128.000 token, cùng mốc kiến thức ngày 30 tháng 4 năm 2026, cùng câu trả lời, với mức giá 12,00 USD mỗi triệu token đầu vào và 60,00 USD mỗi triệu token đầu ra, so với 2,00 và 10,00 USD. Một gói tốc độ là việc mua thời gian đồng hồ, và thời gian đồng hồ chỉ đáng tiền đối với một công việc mà có người đang chờ đợi.
Việc đóng khung lại đó chính là toàn bộ bài viết. Phần còn lại là phép tính cho bạn biết công việc nào của bạn thuộc kiểu chờ đợi, và hai khoản chi phí xuất hiện cùng với bội số dù bạn có lên kế hoạch cho chúng hay không.
Điều thực sự khác biệt: một trường yêu cầu và một hóa đơn
Không có checkpoint Ultrafast, không có giới hạn ngữ cảnh riêng, không có mốc kiến thức thay thế, và không có gì để ghim. Bạn gửi cùng một mã định danh mô hình với trường service-tier được đặt, và OpenAI lập lịch yêu cầu theo cách khác; gửi nó mà không có trường đó thì bạn đang ở Standard. Mọi thứ mà một nhà phát triển viết mã dựa vào đều giống hệt nhau, và việc xử lý danh sách một cách máy móc là đáng làm, bởi vì độ dài của danh sách chính là lập luận.
• Model id — cùng một định danh trên cả hai, một bản chụp mặc định, không có gì mang mốc ngày để ghim cố định.
• Ngữ cảnh — cửa sổ 1.050.000 token, đầu vào tối đa 922.000 token và đầu ra tối đa 128.000 token ở cả hai.
• Thang bậc suy luận — low, medium (mặc định), high, xhigh và max trên cả hai, với none và minimal không được hỗ trợ trên cả hai.
• Bề mặt công cụ — tìm kiếm web, tìm kiếm tệp, tạo hình ảnh, trình thông dịch mã, shell được lưu trữ, áp dụng bản vá, kỹ năng, sử dụng máy tính, MCP và tìm kiếm công cụ, thông qua Responses API, trên cả hai.
• Giá — $2.00 đầu vào / $0.10 đã lưu vào bộ nhớ đệm / $2.50 ghi vào bộ nhớ đệm / $10.00 đầu ra trên mỗi triệu token trên Standard, so với $12.00 / $0.60 / $15.00 / $60.00 trên Ultrafast.
• Trên 272.000 token đầu vào — toàn bộ yêu cầu được tính lại giá ở mức gấp 2 lần đối với giá đầu vào và giá bộ nhớ đệm, và gấp 1,5 lần đối với giá đầu ra trên cả hai, đưa Ultrafast long-context lên mức $24.00 / $1.20 / $30.00 / $90.00.
• Tốc độ — Theo định nghĩa, Standard là mức cơ sở; Ultrafast là nấc cao nhất, và bội số riêng theo mô hình duy nhất mà OpenAI công bố thuộc về GPT-6 Astra, chứ không phải mô hình này.
Dòng cuối đó là lưu ý nằm bên dưới mọi thứ khác, và nó có một mục riêng ở phía dưới. Trước tiên, là các công việc.
Nhiệm vụ số một: tác nhân tương tác. Đây là thứ tạo nên chuyển động
Một vòng lặp agent thực hiện bốn mươi lời gọi công cụ liên tiếp chính là kiểu khách hàng mà hạng này được tạo ra để phục vụ, bởi vì thời gian sinh của mỗi lượt sẽ quyết định lượt kế tiếp, và người dùng đang theo dõi. Lấy một phiên gửi 30.000 token đầu vào và nhận 1.500 token đầu ra mỗi lượt trong 40 lượt — tổng cộng 1.200.000 token đầu vào và 60.000 token đầu ra, mỗi yêu cầu đều nằm dưới ngưỡng định giá lại 272.000 token.
• Standard — 1,2 triệu token đầu vào ở mức $2,00 tốn $2,40; 60.000 token đầu ra ở mức $10,00 tốn $0,60. Ba đô la cho lần chạy.
• Ultrafast — 1,2 triệu token đầu vào ở mức $12,00 là $14,40; 60.000 token đầu ra ở mức $60,00 là $3,60. Mười tám đô-la cho lượt chạy.
• Phần chênh lệch — $15.00 để loại bỏ phần lớn độ trễ tạo sinh của một tác vụ mà nếu không thì kết quả đầu ra vẫn hoàn toàn giống hệt.
Việc $15.00 có rẻ hay không là câu hỏi về số phút, không phải token. Nếu phiên làm việc mất hai mươi phút trên Standard và bốn phút trên Ultrafast, bạn đã mua mười sáu phút với giá mười lăm đô la — khoảng $0.94 một phút — và phép so sánh đáng quan tâm là so với chi phí mà mười sáu phút đó gây ra cho bạn. Một lập trình viên với mức chi phí nhân sự đầy đủ có giá trị hơn một đô la một phút, nên với trường hợp có con người trong vòng lặp, câu trả lời là quá rõ ràng. Một agent đang chờ trong hàng đợi đánh giá của con người thì chẳng đáng gì mỗi phút, và ở đó, mười sáu phút tương tự là mười sáu phút miễn phí, còn bậc đó là lãng phí.
Đó là phép thử cần áp dụng, và nó chẳng liên quan gì đến mô hình. Thời gian tạo nằm trên đồng hồ của ai, và chiếc đồng hồ đó đáng giá bao nhiêu? Nếu câu trả lời là "của một con người, và rất nhiều", thì Ultrafast là thứ rẻ nhất trên hóa đơn của bạn. Nếu câu trả lời là "của một bộ lập lịch, và không đáng gì", thì nó là thứ đắt nhất.

Công việc thứ hai: đợt đánh giá qua đêm. Đây là một lời từ chối.
Một đợt đánh giá chạy vài nghìn prompt qua mô hình, ghi kết quả vào lưu trữ đối tượng, và đến sáng hôm sau thì có người đọc bảng kết quả. Ngân sách độ trễ của nó không phải vài phút; mà là cả một đêm. Không có gì trong pipeline phải chờ mô hình ngoại trừ yêu cầu kế tiếp trong hàng đợi.
Ultrafast không loại bỏ chi phí thời gian thực của lượt quét, vì chi phí thời gian thực của lượt quét là một quyết định lập lịch bạn đã đưa ra, không phải một vấn đề độ trễ bạn đang gặp. Điều nó làm là nhân hóa đơn lên sáu lần và chuyển công việc sang một ngân sách có giới hạn tốc độ theo từng tổ chức riêng — một rủi ro thực sự trong một lô chạy không giám sát, bởi vì trần giới hạn tốc độ chính xác là kiểu lỗi mà một lượt quét lớn gặp phải, và trang gói dịch vụ không công bố con số đó.
Và có một làn trên cùng một bảng giá được định giá cho công việc này và được định giá theo hướng ngược lại. Batch và Flex chạy bằng một nửa của Standard, và xử lý Batch của API được thiết kế chính xác cho loại hình này: khối lượng lớn, không có thời hạn tương tác, kết quả được trả về không đồng bộ. Dựa trên các con số ở trên, cùng một tổng token cho 40 lượt tốn $1.50 trên Batch so với $18.00 trên Ultrafast. Đó là mức chênh lệch gấp 12 lần cho một công việc không thể phân biệt được sự khác biệt.
Sai lầm cần tránh là coi Ultrafast như bản nâng cấp đa dụng. Nó là nấc trên cùng của một chiếc thang — Batch và Flex ở mức một nửa, Standard ở mức một, Fast ở mức hai, Ultrafast ở mức sáu — và một chiếc thang không phải là thực đơn các phiên bản tốt hơn. Chọn nhầm nấc thang tốn tiền hơn là chọn nhầm mô hình.
Công việc thứ ba: công cụ tóm tắt theo lô. Cũng là không, vì một lý do khác.
Giả sử khối lượng công việc là một lượt chạy hằng đêm trên một kho tài liệu: đầu vào dài, đầu ra ngắn, không có con người trong vòng lặp, và SLA được đo bằng giờ. Đây chính là lúc cơ cấu token quay ra chống lại Ultrafast thay vì ủng hộ nó.
Ngưỡng 272.000 token chính là lý do. Ở cả hai hạng, một yêu cầu duy nhất vượt qua ngưỡng đó sẽ định giá lại toàn bộ yêu cầu — mọi token đầu vào, mọi lần đọc từ bộ nhớ đệm, mọi token đầu ra — theo mức gấp đôi giá đầu vào và giá bộ nhớ đệm, và gấp 1,5 lần giá đầu ra. Do đó, Long-context Ultrafast có mức giá 24,00 USD cho mỗi triệu token đầu vào và 90,00 USD cho mỗi triệu token đầu ra, và việc định giá lại được kích hoạt bởi yêu cầu, chứ không phải bởi phần vượt quá ngưỡng. Một công cụ tóm tắt tài liệu thỉnh thoảng gửi một yêu cầu với 300.000 token đầu vào sẽ phải trả mức giá ngữ cảnh dài cho toàn bộ 300.000 token đó.
Hành vi bộ đệm làm trầm trọng thêm điều đó. Các lượt đọc từ bộ đệm là những token rẻ nhất trên mô hình này và là đòn bẩy chi phí hiệu quả nhất, và chúng tăng theo bậc dịch vụ thay vì hấp thụ bậc đó — $0,10 cho mỗi triệu đầu vào được lưu trong bộ đệm trên Standard, $0,60 trên Ultrafast, cả hai đều ở mức 5% của giá đầu vào chưa được lưu trong bộ đệm. Không có cách kết hợp token từ bộ đệm và token mới nào làm dịu bớt bội số đó, vì vậy một pipeline được tối ưu hóa triệt để bằng bộ đệm không được hưởng chiết khấu từ làn nhanh. Nó chỉ trả gấp sáu lần một con số nhỏ hơn.
Ghép hai điều đó lại, và bộ tóm tắt chính là trường hợp mà mức phụ phí của Ultrafast là lớn nhất tính theo giá trị tuyệt đối, còn lợi ích của nó là nhỏ nhất. Nếu tài liệu thực sự dài và hạn chót thực sự là vài giờ, thì cấu hình đúng là Batch hoặc Standard tiêu chuẩn, và cách dùng đúng của Ultrafast là vòng lặp giữa giai đoạn phát triển, nơi bạn đang tinh chỉnh prompt và có một người đang chờ từng bản sửa.
Hai chi phí đi kèm với bội số
Tỷ lệ gấp sáu lần là phần hữu hình của mức giá. Hai phần vô hình quan trọng hơn trong sản xuất.
Đầu tiên là hạn mức giới hạn tần suất. Ultrafast chạy trên các giới hạn riêng, tách biệt với hạn mức của Standard và Fast, và OpenAI đặt chúng theo từng tổ chức thay vì công bố trên trang về bậc; hướng dẫn là hãy kiểm tra giới hạn của tổ chức bạn trước khi tăng lưu lượng và liên hệ nhóm phụ trách tài khoản nếu cần nâng chúng. Vì vậy, chuyển một khối lượng công việc sang Ultrafast làm hai việc cùng lúc: nó nhân hóa đơn lên và đưa khối lượng công việc đó lên một mức trần mà bạn có thể không đọc được. Với một agent không có người giám sát, mức trần sẽ ràng buộc trước tiên.
Điều thứ hai là hình dạng của khoản tiết kiệm. Ultrafast giảm thời gian giữa các token, không phải thời gian đến token đầu tiên và không phải giai đoạn cân nhắc. Một yêu cầu dành phần lớn thời gian thực để suy nghĩ trước khi phát ra bất cứ thứ gì có thể được chuyển sang Ultrafast và vẫn cảm thấy chậm, bởi vì gói này tăng tốc phần của yêu cầu mà chưa bao giờ là nút thắt cổ chai. Đây là kiểu thất bại tạo ra các báo cáo "chúng tôi đã trả gấp sáu lần và tốc độ vẫn như vậy": nó đang đo một ứng dụng có độ trễ nằm ở nơi mà gói không với tới. Trước khi cam kết, hãy đo xem số giây thực sự đi đâu — thời gian đến token đầu tiên so với thời gian giữa các token — bởi vì gói chỉ sở hữu một trong số đó.
Vì sao “nhanh hơn” vẫn chưa phải là một con số mà bạn có thể bắt OpenAI cam kết.
Ultrafast được bán với lời quảng cáo “tối đa 8x”, và phép đo đằng sau cụm từ đó thuộc về một mô hình khác. Câu được công bố nói về việc GPT-6 Astra Ultrafast tạo token nhanh hơn tới 8 lần so với GPT-6 Astra ở chế độ Standard trong Codex. Không có bội số tương đương nào được công bố cho GPT-6.1 Sol, và cũng không có bên độc lập nào công bố con số token mỗi giây cho biến thể Sol. Tài liệu cho hạng này mô tả nó là làm giảm thời gian giữa các token đầu ra được tạo ra và trỏ đến một bảng giá.
Việc cho rằng các hệ số nhân đều được giữ nguyên là một tiên nghiệm hợp lý — cả hai model cùng nằm trên một serving stack và cơ chế của tier là như nhau — nhưng cụm "tối đa" đang thực sự gánh một vai trò quan trọng trong câu đó, và mức trần mà nhà cung cấp đo được trên một model anh em trong một client khác không phải là con số mà workload của bạn sẽ thấy. Điều tương tự cũng đúng với bậc cũ hơn: Ultrafast trên GPT-5.6 Sol được công bố vào tháng 8 năm 2026 với "nhanh hơn tối đa 14 lần so với xử lý Standard" trong bản xem trước giới hạn, và tài liệu vẫn ghi là quyền truy cập dạng xem trước với bảng giá Ultrafast chỉ có đúng hai dòng.
Điều bạn có thể bắt OpenAI chịu trách nhiệm là giá, vì giá được công bố và áp dụng cho mọi token. Nghĩa là quyết định mà trang này bàn tới là quyết định về ngân sách độ trễ của chính bạn, không phải về tuyên bố tốc độ của nhà cung cấp.

Thử nghiệm mà không commit, và chuyển trở lại
Hạng này khả dụng cho tất cả người dùng API, nên cách rẻ nhất để trả lời câu hỏi về thời gian thực là chạy cùng một bộ prompt hai lần với trường này bật và tắt, rồi so sánh số lượng token và thời gian. Có hai điều cần lưu ý trong thử nghiệm đó: liệu các yêu cầu của bạn có vượt qua mốc 272.000 token hay không, và liệu thời gian đến token đầu tiên có chiếm ưu thế so với thời gian giữa các token hay không. Bất kỳ điều nào trong hai điều đó cũng có thể khiến thử nghiệm trông như một kết quả null ngay cả khi hạng đang hoạt động đúng như quảng cáo.
Chuyển trở lại là một trường trong yêu cầu, không phải một cuộc di trú, và làn tiêu chuẩn được phục vụ theo đúng mức giá niêm yết của chính nhà cung cấp thông qua OrcaRouter dưới dạng openai/gpt-6.1-sol — 2,00 USD cho mỗi triệu token đầu vào và 10,00 USD cho mỗi triệu token đầu ra, không cộng thêm phí, giá của nhà cung cấp được chuyển thẳng qua, nên việc nhà cung cấp đổi giá sẽ có hiệu lực ngay bên phía chúng tôi trong cùng ngày. Bản thân Ultrafast không phải là thứ chúng tôi bán; đó là một cờ cấp dịch vụ được tính phí trên chính tài khoản OpenAI của bạn, và nói rõ điều đó hữu ích hơn là ngụ ý ngược lại. Điều mà một khóa duy nhất thực sự mua được là làn tiêu chuẩn cùng phần còn lại của danh mục đằng sau một endpoint tương thích với OpenAI, và chuyển đổi dự phòng tự động giữa các nhà cung cấp, điều này rất đáng có nếu bạn sắp đặt một tầng đắt đỏ trước một agent đang chạy production và muốn làn tiêu chuẩn trở thành một quyết định định tuyến thay vì một thay đổi mã nguồn.

Một lưu ý thực tế về gói nhanh mà không áp dụng cho gói rẻ: WebSockets. OpenAI khuyến nghị kết nối WebSocket liên tục cho Ultrafast, đúng kiểu cho một agent thực hiện nhiều lệnh gọi tuần tự và sai kiểu cho một script chạy theo lô kiểu mỗi tiến trình một yêu cầu. Nếu client của bạn thuộc loại thứ hai, thì phương thức truyền tải được chính gói đó khuyến nghị là một lý do nữa khiến tác vụ ban đêm nên nằm ở nơi khác.
Khi phán quyết
Ba bước phát triển sẽ đưa các công việc ra khỏi danh sách "stay". Một giới hạn tốc độ Ultrafast được công bố cho GPT-6.1 Sol sẽ loại bỏ rủi ro trần khỏi trường hợp batch. Một phép đo tốc độ được công bố hoặc tái tạo độc lập cho gói Sol sẽ cho phép bạn dự trù khoản tiết kiệm thời gian thực thay vì giả định nó. Và một bậc giảm giá trên làn nhanh — tương đương Ultrafast của Batch, nơi gói vẫn nhanh nhưng không đắt gấp sáu lần — sẽ thay đổi kinh tế của mọi công việc ở giữa thang.
Hiện nay không có cái nào trong số đó tồn tại. Thứ tồn tại là một hạng đúng như tên gọi của nó: vẫn cùng GPT-6.1 Sol, được lên lịch theo cách khác, với mức giá gấp sáu lần trên mọi dòng. Hãy chuyển tác nhân tương tác, để yên hai cái còn lại, và đo xem số giây của bạn thực sự đi đâu trước khi bạn quyết định cái nào là của mình.
So sánh trong bài viết này1
Phát hiện từ bài viết này · Benchmark: Artificial Analysis · cập nhật hằng ngày
