Một thẻ tiêu đề được tạo với dòng tiêu đề 'Siêu nhanh so với Tiêu chuẩn' và phụ đề 'Một checkpoint GPT-6.1 Sol, hai bảng giá', với các chip ghi '$2.00 / $10.00 Tiêu chuẩn' và '$12.00 / $60.00 Siêu nhanh', một huy hiệu '6x' và dòng 'cùng token, hóa đơn gấp sáu lần', phía trên một chân trang ghi chú rằng các mức giá là giá niêm yết của chính OpenAI cho các yêu cầu ngữ cảnh ngắn.
Engineering & Research

GPT-6 Sol Ultrafast so với GPT-6 Sol: Mô hình Nhanh

Tác giả

Magnus Corvin

Ngày đăng

Mô hình mới nhất · 20Xem tất cả mô hình →
Benchmark: Artificial Analysis · cập nhật hằng ngày
Quay lại tất cả bài viết

Bật GPT-6.1 Sol Ultrafastkhiến GPT-6.1 Sol trở thành cách đắt đỏ nhất trong dòng GPT-6 để tạo ra một token không phải do GPT-6 Astra tạo ra. Đó là toàn bộ so sánh gói gọn trong một câu, và nó ngược lại với điều mà "lựa chọn nhanh trên mô hình rẻ hơn" nghe có vẻ nên có nghĩa. Ultrafast có giá gấp sáu lần Standard — 12,00 USD mỗi triệu token đầu vào và 60,00 USD mỗi triệu token đầu ra, so với 2,00 USD và 10,00 USD — điều này đưa một lệnh gọi GPT-6.1 Sol nhanh lên trên GPT-6 Astra ở tốc độ thông thường, trên GPT-5.6 Sol ở tốc độ thông thường, và không gần với bất kỳ mức nào khác trên bảng giá ngoài sai số làm tròn.

Không điều nào trong số đó khiến hạng đó trở thành một sai lầm. Nó khiến nó trở thành một khoản mua độ trễ, và câu hỏi mà trang này trả lời là khi nào độ trễ đáng giá với mức giá đó và khi nào thì không. Hai sản phẩm đang được so sánh là cùng một checkpoint và cùng những câu trả lời; toàn bộ khác biệt chỉ là một cờ hạng dịch vụ và một hóa đơn.

Cùng một mô hình, và thật đáng để nói rõ chính xác là giống nhau đến mức nào.

Không có checkpoint Ultrafast nào để tải xuống, không có giới hạn ngữ cảnh riêng, không có mốc cắt kiến thức khác. Bạn gửi model: "gpt-6.1-sol" với service_tier: "ultrafast" và O​penAI lập lịch yêu cầu theo cách khác; hãy gửi nó mà không có cờ đó và bạn sẽ nhận được Standard. Mọi thứ mà một nhà phát triển thực sự viết mã dựa trên đều giống hệt nhau:

• ID mô hình — gpt-6.1-sol cho cả hai, một bản chụp mặc định, không có gì gắn ngày để ghim

• Ngữ cảnh — cửa sổ 1.050.000 token, đầu vào tối đa 922.000 token, đầu ra tối đa 128.000 token, cho cả hai

• Thời điểm cắt kiến thức — 30 tháng 4 năm 2026, cho cả hai

• Thang suy luận — thấp, trung bình (mặc định), cao, xhigh, tối đa cho cả hai; none và minimal không được hỗ trợ trên cả hai

• Phương thức — đầu vào là văn bản và hình ảnh, đầu ra là văn bản, cho cả hai

• Bề mặt công cụ — cùng các công cụ tìm kiếm web, tìm kiếm tệp, tạo hình ảnh, trình thông dịch mã, shell được host, áp dụng bản vá, kỹ năng, sử dụng máy tính, MCP và tìm kiếm công cụ, thông qua API Responses, cho cả hai

• Giá — $2.00 / $0.10 đã lưu đệm / $2.50 ghi bộ nhớ đệm / $10.00 đầu ra mỗi triệu token so với $12.00 / $0.60 / $15.00 / $60.00

• Prompt dài trên 272K token đầu vào — toàn bộ yêu cầu sẽ được tính lại giá ở mức 2x đối với giá đầu vào và giá cache, cùng 1.5x đối với đầu ra trên cả hai, vì vậy long-context của Ultrafast có giá $24.00 / $1.20 / $30.00 / $90.00

• Tốc độ — Standard vẫn là Standard; Ultrafast nằm ở đỉnh của thang bậc, và bội số riêng theo từng mô hình duy nhất được công bố trong tài liệu của OpenAI thuộc về GPT-6 Astra, chứ không phải mô hình này

Dòng cuối cùng đó chính là lưu ý trung thực cho toàn bộ bài viết. Tài liệu của OpenAI nói GPT-6 Astra Ultrafast “tạo token nhanh hơn tới 8 lần so với GPT-6 Astra ở chế độ Standard trong Codex”. Tài liệu của GPT-6.1 Sol mô tả hạng này, liệt kê các giới hạn tần suất của nó và nói rằng nó hỗ trợ lưu trú dữ liệu tại Hoa Kỳ và EU — nhưng không công bố bội số nào. Nếu bạn mua thứ này vì kỳ vọng tốc độ gấp tám lần, thì bạn đang ngoại suy từ một mô hình cùng họ, và không có phép đo độc lập nào tồn tại cho cả hai.

A screenshot of OpenAI's API pricing page with the Ultrafast tab selected, showing two rows: gpt-6-astra at $60.00 input, $6.00 cached input, $75.00 cache writes and $300.00 output per 1M tokens short-context stepping to $120.00 / $12.00 / $150.00 / $450.00 in long context, and gpt-6.1-sol at $12.00 / $0.60 / $15.00 / $60.00 short-context stepping to $24.00 / $1.20 / $30.00 / $90.00, with the page's note that short context means up to 272K input tokens.

Ví dụ minh họa: một lượt agent tốn bao nhiêu trên mỗi làn

Hãy đưa một tác nhân lập trình vào một vòng lặp thực tế, không hào nhoáng: mỗi lượt đọc lại 40.000 token ngữ cảnh kho mã và xuất ra 6.000 token lý luận cùng bản vá, và tác vụ mất mười hai lượt. Giả sử không có gì được lưu vào bộ nhớ đệm, đây là trường hợp bi quan và là trường hợp khiến bậc này trông tệ nhất về đầu vào; sau đó làm lại với ngữ cảnh được lưu vào bộ nhớ đệm, vì đó chính là điều một tác nhân có prompt được lưu đệm thực sự làm.

• Tiêu chuẩn, không lưu đệm — 40.000 token đầu vào tốn $0,08 và 6.000 token đầu ra tốn $0,06, tức $0,14 mỗi lượt và $1,68 cho tác vụ

• Siêu nhanh, không dùng bộ nhớ đệm — 0,48 đô la cho đầu vào và 0,36 đô la cho đầu ra mỗi lượt, 0,84 đô la một lượt, $10.08 cho tác vụ

• Tiêu chuẩn, ngữ cảnh được lưu trong bộ nhớ đệm — 40.000 token giảm xuống còn $0.10 mỗi triệu, vì vậy lượt này là $0.064 và tác vụ là $0.77

• Siêu nhanh, ngữ cảnh được lưu đệm — đầu vào được lưu đệm có giá $0.60 mỗi triệu token ở hạng này, nên lượt này tốn $0.384 và tác vụ tốn $4.61

Hệ số nhân là sáu trong mọi hàng, và đó chính là điểm mấu chốt: bộ nhớ đệm không bảo vệ bạn khỏi bậc đó, mà nó tăng theo bậc đó. Điều mà những con số này mang lại là một tác vụ hoàn thành trong khoảng một phần tám thời gian đồng hồ thực tế, và toàn bộ phán đoán nằm ở chỗ liệu việc loại bỏ khoảng chờ đó có đáng 2,40 đến 8,40 đô-la Mỹ mỗi tác vụ hay không.

Tuy nhiên, đây là phép so sánh lẽ ra phải là yếu tố quyết định đối với hầu hết các đội ngũ. Tính giá cho cùng số lượng token trên G​PT-6 Astra ở mức Standard — 0,40 đô-la cho đầu vào và 0,30 đô-la cho đầu ra mỗi lượt, 8,40 đô-la cho cả tác vụ. Ultrafast trên GPT-6.1 Sol có giá mỗi token đắt hơn so với mô hình tiên phong ở tốc độ thông thường. Đó không phải là lập luận chống lại gói này; đó là lập luận về việc bạn đang tối ưu hóa chiều hướng nào. Nếu vấn đề của bạn là chất lượng câu trả lời, thì Astra ở mức Standard là cách dùng tiền hợp lý hơn. Nếu vấn đề của bạn là có một người đang ngồi nhìn vòng quay chờ, thì cả Astra lẫn Sol đều không giúp được gì, còn gói này thì có.

Một lưu ý trước khi bất kỳ ai lập ngân sách dựa trên những con số này: số lượng token không cố định giữa các mô hình đối với cùng một tác vụ. Đây là các so sánh theo từng token trên cùng số lượng token giả định, đây là phép so sánh duy nhất mà bảng giá hỗ trợ. Hãy đo các trace của chính bạn.

A generated cost card headed 'One agent turn, four ways', comparing GPT-6.1 Sol Standard at $0.14 per turn and $1.68 over twelve turns uncached and $0.064 and $0.77 with prompt caching, GPT-6.1 Sol Ultrafast at $0.84 and $10.08 uncached and $0.384 and $4.61 cached, and GPT-6 Astra Standard at $0.70 and $8.40 on the same token counts, over a footer reading that these are OpenAI list rates per 1M tokens for short-context requests and that the per-turn and per-task figures are the article's arithmetic on those rates rather than vendor benchmarks.

Gói mà bạn có lẽ thực sự muốn là Fast

Giữa Standard và Ultrafast có một làn trung gian, và trên GPT-6.1 Sol, đó là mức mà hầu hết các đội nên cân nhắc chi phí đầu tiên. Chế độ Fast chạy ở mức gấp đôi Standard — $4.00 đầu vào và $20.00 đầu ra mỗi triệu token — cho cùng một checkpoint, và OpenAI đã đổi tên Priority processing thành Fast mode vào ngày 30 tháng 7 năm 2026, nên nó đã ổn định trong nhiều tháng. Nó bằng một phần ba mức giá của Ultrafast cho mức tăng tốc mà tài liệu về hạng coi là trường hợp được hỗ trợ thông thường.

Ultrafast là câu trả lời đúng khi độ trễ chính là sản phẩm và lượng token nhỏ: một tác nhân tương tác không thể thực hiện bước tiếp theo cho đến khi đầu ra trước đó xuất hiện, một vòng lặp của nhà phát triển nơi bốn mươi lượt ngắn cộng dồn, một bản demo nơi sự tạm dừng chính là dạng thất bại. Fast là câu trả lời đúng khi bạn muốn một mô hình nhanh hơn một cách tổng thể và chưa sẵn sàng trả gấp ba cho mức gia tăng cuối cùng. Batch và Flex vẫn là câu trả lời đúng cho bất cứ thứ gì có thời hạn tính bằng giờ — chúng chỉ bằng một nửa Standard, chứ không phải gấp đôi.

Tốc độ cũng không phải là đòn bẩy duy nhất. Nếu độ trễ bạn đang cố loại bỏ đến từ việc mô hình suy nghĩ chứ không phải mô hình gõ, thì gói đó không giúp gì cho bạn: Ultrafast nén việc sinh token, và mô tả của chính OpenAI là nó “rút ngắn thời gian giữa các token đầu ra được sinh ra”. Một yêu cầu dành phần lớn thời gian thực tế cho suy luận sẽ đến sớm hơn chỉ bằng một phần nhỏ so với mức mà giá gợi ý. Hãy giảm mức nỗ lực suy luận xuống một nấc và xem điều đó tác động thế nào đến hóa đơn trước khi bạn nâng gói lên sáu nấc.

Nơi luồng tiêu chuẩn nằm

GPT-6.1 Sol tiêu chuẩn có trên OrcaRouter dưới dạng openai/gpt-6.1-solvới mức giá của chính nhà cung cấp là 2,00 USD cho đầu vào và 10,00 USD cho đầu ra trên mỗi triệu token, phục vụ với mức chênh lệch 0% — giá niêm yết của nhà cung cấp được chuyển nguyên, nên khi O​penAI thay đổi giá, mức sử dụng của bạn sẽ phản ánh ngay trong cùng ngày thay vì đợi đến kỳ gia hạn tiếp theo. Cùng một khóa có thể truy cập hơn 200 mô hình, nhờ đó lưu lượng ở làn tiêu chuẩn mà bạn giữ lại sau thử nghiệm Ultrafast có thể nằm sau một tích hợp duy nhất, bên cạnh bất cứ thứ gì khác mà tác vụ cần, với tính năng chuyển đổi dự phòng tự động nếu một nhà cung cấp bị suy giảm và một DSL định tuyến để kết hợp các mô hình vào một lệnh gọi duy nhất.

Bản thân Ultrafast không phải là thứ chúng tôi có thể bán cho bạn, và sẽ là không trung thực nếu diễn đạt theo bất kỳ cách nào khác. Đó là một cờ phân hạng dịch vụ do OpenAI tính phí vào tài khoản của chính bạn, không phải một mô hình có thể định tuyến riêng — chúng tôi lưu trữ checkpoint, không phải hạng dịch vụ đó. Hãy chạy lưu lượng theo hạng trên khóa nhà cung cấp của bạn; định tuyến khối lượng đó qua chúng tôi.

A screenshot of the OrcaRouter model page for GPT-6.1 Sol, model id openai/gpt-6.1-sol, showing a 1M-token context window, 128K maximum output, text, image and file input with text output, vision, tools, JSON and reasoning capabilities, public benchmarks attributed to OpenAI dated 2026-09-29, input price $2.00 and output price $10.00 per 1M tokens, p50 time to first token 6.14 s and 313.9M tokens of traffic, with the page's code snippet and EN language toggle visible in the header.

Ai nên bật/tắt nó

Hãy để nó bật nếu một người hoặc một consumer tự động bị chặn ở mọi phản hồi và lượng token mỗi tác vụ đủ nhỏ để hóa đơn tuyệt đối vẫn chỉ ở mức vài đô la — phép tính ở trên đặt một tác vụ agent mười hai lượt vào khoảng $10, một cách khắc phục rẻ nếu nó thay thế hai phút chờ đợi của con người và đắt nếu nó chẳng thay thế được gì cả.

Hãy để nó tắt nếu khối lượng công việc của bạn được lên lịch, chạy theo lô, đánh giá hàng loạt hoặc chạy lại mỗi đêm. Tắt cũng là lựa chọn đúng nếu thứ bạn đang theo đuổi là chất lượng: chi phí gấp sáu lần không mua thêm chút năng lực nào trên mô hình này, và cùng số tiền đó nếu dồn vào G​PT-6 Astra ở gói Standard là một nâng cấp thực sự chứ không phải một thứ chỉ nhanh hơn. Ultrafast bán thời gian, và thời gian chỉ đáng 60 USD một triệu token đối với những quy trình thực sự đang chờ đợi nó.

So sánh trong bài viết này1

Phát hiện từ bài viết này · Benchmark: Artificial Analysis · cập nhật hằng ngày