Một thẻ tiêu đề được tạo hiển thị 'GPT-6.1 Sol Context Window' với phụ đề '1.050.000 token, mốc 922.000, và vách đá 272.000'. Ba bảng bo tròn nằm bên dưới: 1.050.000 được dán nhãn 'cửa sổ ngữ cảnh, trên trang nhà cung cấp', 922.000 được dán nhãn 'đầu vào tối đa, trong biểu mẫu tài liệu', và 272.000 được dán nhãn 'mốc đầu vào khiến toàn bộ yêu cầu bị định giá lại'. Logo OrcaRouter xuất hiện ở góc dưới cùng bên phải.
Guides & Insights

Cửa sổ ngữ cảnh của GPT-6.1 Sol: 1.050.000 token, ranh giới 922.000 và vách 272.000

Tác giả

Elias Hawthorne

Ngày đăng

Mô hình mới nhất · 20Xem tất cả mô hình →
Benchmark: Artificial Analysis · cập nhật hằng ngày
Quay lại tất cả bài viết

Trang mô hình của nhà cung cấp cho GPT-6.1 Sol, đọc ngày 7 tháng 10 năm 2026, nêu cửa sổ ngữ cảnh 1.050.000 token và đầu ra tối đa 128.000 token. Cùng trang đó, ở dạng máy đọc được mà bạn có được bằng cách thêm .md vào URL của nó, mang một con số thứ ba mà trang hiển thị không bao giờ in ra: tối đa 922.000 token đầu vào. GPT-6 Sol, mô hình mà phiên bản 6.1 được phát hành để kế nhiệm vào ngày 29-09-2026, công bố cặp con số trần giống hệt trên trang riêng của nó, và cùng dòng 922.000 trong dạng markdown của chính nó. Thẻ mô hình của chúng tôi cho openai/gpt-6-sol báo cáo cửa sổ là 1.050.000 token và giới hạn đầu ra là 128.000, hiển thị con số đầu tiên trong đó là "1M" trong dải thông số của nó, và in "1.1M" cho cùng mô hình đó trong một bảng so sánh ở phần dưới cùng của trang.

Vậy là các trang quả thực không thống nhất với nhau, và đáng để nói chính xác về việc chúng không thống nhất như thế nào. dải thông số được hiển thị của nhà cung cấp đưa ra một cửa sổ và một mức trần đầu ra, và không có mức trần đầu vào. tài liệu markdown của nhà cung cấp cho cùng mô hình đưa ra cả ba. Bất kỳ ai ước lượng một yêu cầu dựa trên trang được hiển thị đều đang làm việc với ít hơn một ràng buộc so với những gì nhà cung cấp đã công bố, và ràng buộc còn thiếu chính là con số quyết định liệu một yêu cầu có vừa hay không.

Ba con số, ba nguồn, và một phép trừ mà không ai viết ra.

Đây là từng số cùng với tài liệu mà nó đến từ, tất cả được đọc vào ngày 7 tháng 10 năm 2026.

• 1,050,000 cửa sổ ngữ cảnh — trang mô hình của nhà cung cấp cho gpt-6.1-sol, trong dải thông số kỹ thuật được hiển thị và ở dạng markdown của trang đó, và cùng con số đó trên trang dành cho gpt-6-sol. Đây cũng là giá trị mà danh mục của chúng tôi trả về cho openai/gpt-6-sol và openai/gpt-6-luna, trong đó trường này được ghi là 1,050,000 thay vì được làm tròn.

• Tối đa 128,000 token đầu ra — vẫn cùng một trang, cùng hai dạng thức, cho cả hai thế hệ. Trường trên card của chúng tôi ghi 128,000; phần hiển thị của nó được làm tròn thành "128K".

• 922,000 token đầu vào tối đa — dạng markdown của trang model gpt-6-sol của nhà cung cấp và của trang gpt-6.1-sol của họ. Nó không nằm trong dải nội dung hiển thị của cả hai trang, và cũng không nằm trong trường danh mục của chúng tôi dành cho model này, vốn chỉ dừng ở cửa sổ ngữ cảnh và giới hạn đầu ra.

Ba con số này nhất quán với nhau về mặt số học: 922.000 cộng 128.000 đúng bằng 1.050.000. Hướng dẫn lập luận của chính nhà cung cấp mô tả cơ chế khiến đẳng thức này trở nên có ý nghĩa mà không hề thực hiện phép cộng trên trang mô hình — các token lập luận, theo tài liệu, "vẫn chiếm chỗ trong cửa sổ ngữ cảnh của mô hình", và nếu các token được tạo "đạt tới giới hạn cửa sổ ngữ cảnh hoặc giá trị max_output_tokens bạn đã đặt", thì phản hồi trả về sẽ được đánh dấu là chưa hoàn chỉnh. Một cửa sổ được chia sẻ giữa phần đi vào và phần đi ra là một cửa sổ trong đó mức trần đầu vào chính là cửa sổ trừ đi phần dành riêng cho đầu ra.

Đọc hiểu đó đã được củng cố, chứ không phải được chứng minh, và đáng để tách biệt hai điều ấy. Điều được ghi nhận là một cửa sổ 1,050,000, một giới hạn đầu ra 128,000, và đầu vào tối đa 922,000. Điều được suy ra là cái nào trong số đó là ràng buộc kích hoạt trước. Suy luận này đúng với mọi yêu cầu dự trữ toàn bộ hạn mức đầu ra của nó và sai với mọi yêu cầu không làm vậy — đặt max_output_tokens thành 4,000 và 1,046,000 token đầu vào thì không rõ ràng là bị từ chối. Cho đến khi nhà cung cấp viết phép trừ vào trang mà những con số này nằm trên đó, hãy coi cặp đôi đó là hình dạng của ngân sách thay vì là một quy tắc chấp nhận cứng, và xác thực dựa trên endpoint đếm thay vì dựa trên một bài blog.

Ngữ cảnh không phải là một cái giá: bước 272.000 token

Cửa sổ lớn hơn là một tuyên bố về năng lực. Đó không phải là tuyên bố về chi phí, và trên dòng sản phẩm này, hai điều đó tách rời nhau tại một ranh giới được ghi rõ. Trang định giá của nhà cung cấp nêu quy tắc trong một câu: các prompt có hơn 272K token đầu vào được tính giá gấp 2 lần mức giá đầu vào và cache, và gấp 1,5 lần mức giá đầu ra cho toàn bộ yêu cầu. Định nghĩa của chính trang đó về hai cột của nó là "Ngữ cảnh ngắn: ≤272K token đầu vào. Ngữ cảnh dài: >272K token đầu vào."

Hãy đọc từ full một cách cẩn thận. Bậc này không chỉ đánh thuế các token vượt mốc — nó định giá lại mọi thứ, kể cả token đầu tiên. Và đây không phải là thay đổi của 6.1: quy tắc y hệt, với ngưỡng y hệt, cũng áp dụng cho GPT-6 Sol, đó là lý do vì sao cú nhảy vực phải được quy cho bậc chứ không phải cho bản phát hành.

Hãy xử lý một tác vụ long-context qua cả hai phía, theo mức giá đã công bố của GPT-6.1 Sol, với tiền tố đã thường trú trong cache để chi phí ghi cache không làm nhiễu việc so sánh:

• 240.000 token đầu vào (200.000 được lưu trong bộ nhớ đệm, 40.000 mới), 6.000 token đầu ra — đầu vào mới 40.000 ở mức 2,00 đô la mỗi triệu là 0,080 đô la; đầu vào được lưu trong bộ nhớ đệm 200.000 ở mức 0,10 đô la là 0,020 đô la; đầu ra 6.000 ở mức 10,00 đô la là 0,060 đô la. Tổng cộng, 0,160 đô la.

• 300.000 token đầu vào (260.000 đã lưu trong bộ nhớ đệm, 40.000 mới), 6.000 đầu ra — yêu cầu hiện đã vượt ngưỡng, nên mọi mức giá đều thay đổi: đầu vào mới 40.000 với $4,00 là $0,160; đầu vào đã lưu trong bộ nhớ đệm 260.000 với $0,20 là $0,052; đầu ra 6.000 với $15,00 là $0,090. Tổng cộng, $0,302.

Hai mươi lăm phần trăm token đầu vào nhiều hơn đổi lấy một hóa đơn lớn hơn 89 phần trăm. Chạy cùng cặp đó trên GPT-6 Sol và hình dạng vẫn giữ nguyên với độ dốc lớn hơn — $0.180 ở dưới đường so với $0.354 ở trên đường, vì mức giá đã cache $0.20 của card cũ nằm ở cùng vị trí mà mức giá đã cache theo ngữ cảnh dài của 6.1 nằm. Việc vượt ngưỡng là một bậc nhảy, không phải một độ dốc, và cách rẻ nhất để thấy điều đó là vượt qua nó trong gang tấc. Một yêu cầu 271.000 token hoàn toàn không dùng cache với 1.000 token đầu ra tốn $0.552; ở 273.000 token, tốn $1.107. Thêm bảy phần mười phần trăm token đầu vào, gấp 2,01 lần số tiền. Cắt bớt 2.000 token khỏi yêu cầu đó và hóa đơn giảm từ $1.107 xuống $0.552 — dưới một phần trăm đầu vào để đổi lấy một nửa chi phí.

Không có gì trong phần này nói về việc cửa sổ của GPT-6.1 Sol lớn. Điều đó nói về việc cửa sổ đủ lớn để chạm tới một ranh giới mà chi phí để đạt tới đó nhiều hơn những gì kích thước của cửa sổ mua được.

A generated two-column scoreboard titled 'GPT-6.1 Sol vs GPT-6 Sol - the scoreboard'. Both columns carry the same six rows. GPT-6.1 Sol reads: context window 1,050,000 tokens; max input 922,000 tokens (docs form); max output 128,000 tokens; input price $2.00 / $4.00 per M; cached input $0.10 / $0.20 per M; output price $10.00 / $15.00 per M. GPT-6 Sol reads the same on every row except cached input, which is $0.20 / $0.20 per M. A footer line credits OpenAI's model and pricing docs read Oct 7 2026 and explains that the second figure in each price row is the long-context rate above 272,000 input tokens. The OrcaRouter logo appears in the bottom-right corner.

Điều gì thực sự chiếm 1.050.000 token

Ngân sách ngữ cảnh được tạo thành từ sáu thứ, và chúng không thể được lưu đệm như nhau. Đây là tỷ trọng xấp xỉ của một yêu cầu agentic minh họa gồm 240.000 token; các tỷ lệ này là của riêng chúng tôi, còn các quy tắc về khả năng lưu đệm là của nhà cung cấp, lấy từ hướng dẫn lưu đệm prompt của họ được đọc cùng ngày.

• Nội dung hệ thống do nhà cung cấp chèn vào và định dạng yêu cầu — được kết xuất trước các tin nhắn của bạn, được tính là đầu vào, và được loại trừ một cách rõ ràng khỏi độ dài có thể lưu vào bộ nhớ đệm tối thiểu. Không thuộc quyền kiểm soát của bạn, và cũng không phải việc của bạn để cắt bớt.

• Hướng dẫn dành cho nhà phát triển và hệ thống của bạn, khoảng 6.000 token. Có thể lưu vào bộ nhớ đệm. Đây là phần đầu của tiền tố, nên thay đổi ở đây sẽ làm vô hiệu hóa mọi thứ phía sau nó.

• Định nghĩa và lược đồ công cụ, khoảng 14.000 token cho bề mặt công cụ được lưu trữ cùng với các hàm của bạn. Có thể cache, và là phần dễ vỡ nhất của tiền tố: hướng dẫn liệt kê tên công cụ, mô tả, lược đồ, thứ tự và các chỉ dẫn riêng cho từng công cụ như là những thứ làm dịch chuyển ranh giới tiền tố.

• Kho ngữ liệu được truy xuất, khoảng 180.000 token. Có thể lưu vào bộ đệm, và cho đến nay là dòng lớn nhất. Chỉ đáng lưu đệm nếu nó ổn định từng byte giữa các lần gọi — một kho ngữ liệu được lắp ghép lại theo mỗi yêu cầu là một kho ngữ liệu phải trả giá đầy đủ.

• Bản ghi tích lũy — các lượt trước đó và kết quả công cụ — khoảng 30.000 token và đang tăng lên. Có thể được lưu vào bộ nhớ đệm tính đến thay đổi mới nhất; kết quả công cụ đến trong lượt này là dữ liệu đầu vào mới, được tính ở mức đầy đủ.

• Token suy luận — được sinh ra, không bao giờ được lưu đệm, tính phí như output. Chúng chiếm cửa sổ ngữ cảnh và không hề xuất hiện trong phần thân phản hồi.

Hai lưu ý vận hành rút ra trực tiếp từ danh sách đó. Thứ nhất, các mục bộ nhớ đệm được lưu giữ trên từng máy riêng lẻ: hướng dẫn nói rằng một yêu cầu chỉ có thể tái sử dụng một tiền tố "chỉ khi nó đến được một máy đang giữ một mục khớp chưa hết hạn", và rằng định tuyến tràn bắt đầu khi vượt khoảng 15 yêu cầu mỗi phút. Một tiền tố ổn định trong mã của bạn vẫn có thể không trúng trong môi trường sản xuất. Thứ hai, tiền tố tối thiểu có thể lưu đệm là 1.024 token đầu vào hiển thị, và các token hệ thống ẩn không được tính vào đó — vì vậy một prompt hệ thống nhỏ không phải là tiền tố có thể lưu đệm, cho dù yêu cầu xung quanh nó lớn đến đâu.

Mức trần đầu ra là một ngân sách riêng, không phải một suất ăn thêm.

128.000 token đầu ra tối đa không có nghĩa là 128.000 token câu trả lời. Hướng dẫn về suy luận nói rõ rằng max_output_tokens giới hạn tổng số token mà mô hình tạo ra, “bao gồm token suy luận, token đầu ra hiển thị và token định dạng không hiển thị”, và rằng token suy luận được tính phí như đầu ra trong khi vẫn chiếm chỗ trong cửa sổ ngữ cảnh.

Điều đó biến việc cắt ngắn thành một quyết định thiết kế thay vì một trường hợp biên, vì cách nó thất bại. Khi quá trình sinh đạt đến giới hạn, phản hồi trả về với trạng thái incomplete và lý do max_output_tokens — và hướng dẫn cảnh báo điều này "có thể xảy ra trước khi bất kỳ token đầu ra hiển thị nào được tạo ra, nghĩa là bạn có thể phát sinh chi phí cho token đầu vào và token suy luận mà không nhận được phản hồi hiển thị." Một ngân sách dùng toàn bộ cửa sổ cho đầu vào và để việc dành chỗ cho đầu ra cho may rủi là một ngân sách có thể tính phí một yêu cầu ngữ cảnh dài đầy đủ và trả về không gì mà người gọi có thể phân tích được. khuyến nghị khởi đầu của chính nhà cung cấp là dành ít nhất 25.000 token cho suy luận và đầu ra trong khi bạn vẫn đang đo lường xem một prompt thực sự cần gì.

GPT-6.1 Sol làm rõ nét hơn điều này, và đây là một trong số ít những điểm thực sự đặc trưng cho 6.1 trong bản phát hành. Thang mức nỗ lực suy luận của nó gồm low, medium, high, xhigh và max, còn các cài đặt none và minimal không được hỗ trợ. GPT-6 Sol chấp nhận cả sáu. Do đó, không có cài đặt nào trên 6.1 có thể tắt phần tiêu tốn cho suy luận, mặc định là medium, và phần đầu ra của ngân sách thì không bao giờ miễn phí.

Mức giảm một nửa đầu vào được lưu đệm, đọc ở nơi cửa sổ rộng nhất

Mức giá duy nhất trên thẻ GPT-6.1 Sol thay đổi ngược chiều so với GPT-6 Sol là đầu vào đã lưu đệm: từ $0.20 giảm xuống $0.10 mỗi triệu token, mức này được trang mô hình thể hiện là 5% mức giá đầu vào chưa lưu đệm, và được hướng dẫn lưu đệm của nhà cung cấp nêu rõ ràng là trường hợp 0.05x so với mức 0.1x mà hầu hết các mô hình GPT-5.6 trở lên được tính. Đầu vào, ghi bộ nhớ đệm và đầu ra đều giống hệt nhau trên cả hai thẻ, và hệ số nhân ngữ cảnh dài cũng giống hệt nhau.

Đối với chính xác khối lượng công việc mà trang này nói đến, đó là chỉ số đúng đắn cần được thay đổi, và lý do nằm ở thành phần của một yêu cầu dài chứ không phải kích thước của nó. Trong tác vụ 300.000 token ở trên, 260.000 token đầu vào là tiền tố được lưu trong bộ đệm — 87 phần trăm trong mọi thứ mà yêu cầu gửi đi. Do đó, dòng được lưu trong bộ đệm là chỉ số đầu vào đơn lẻ lớn nhất trong hóa đơn, đây là đặc tính chung của công việc ngữ cảnh dài: cửa sổ bạn dùng càng dài thì càng nhiều phần trong đó là tiền tố bạn đã gửi trước đó. Giảm một nửa chỉ số đó đáng giá 0,052 USD cho yêu cầu đó.

Và vách giá lấy lại nhiều hơn phần mà việc giảm một nửa mang lại, trong cùng một yêu cầu. Nếu tính theo mức giá ngữ cảnh ngắn, tức mức mà nó lẽ ra phải trả khi ở dưới ranh giới, thì cùng một tác vụ 300.000 token trên GPT-6.1 Sol sẽ tốn $0,166 thay vì $0,302 — chi phí vượt ranh giới là $0,136, tức khoảng 2,6 lần giá trị của một đồng hồ tính phí đã thay đổi trong bản phát hành. Ở trên ranh giới, mức giá cache ghi là $0,20, đây không phải là một con số mới trong dòng này: nó gấp đôi mức giá niêm yết trên thẻ 6.1 và đúng bằng mức GPT-6 Sol đã tính cho một lượt đọc từ cache ở dưới ranh giới trước bản phát hành này. Một khối lượng công việc có cache ở ngữ cảnh dài nhận thay đổi giá niêm yết rồi trả lại nó tại ranh giới, và chính ranh giới — không phải mô hình — mới là nguyên nhân.

A screenshot of the machine-readable markdown form of OpenAI's GPT-6.1 Sol model documentation, captured October 7 2026, showing the Model details block with the three figures on consecutive lines — 1,050,000 context window, Maximum input tokens: 922,000, and 128,000 max output tokens — above the Text tokens pricing table listing Input $2, Cached input $0.1, Cache writes $2.5 and Output $10 per 1M tokens, the note that cached input tokens are priced at 5% of the uncached input rate, and the sentence 'Prompts with more than 272K input tokens are priced at 2x input and cache rates and 1.5x output for the full request.'

Cách xác định kích thước ngân sách ngữ cảnh

Như một quy trình, theo thứ tự các ràng buộc có hiệu lực:

• Hãy đếm yêu cầu, đừng ước lượng nó.POST payload chính xác — công cụ, hình ảnh, tệp và mọi thứ — đến endpoint đếm token đầu vào trên Responses API. Hướng dẫn nói thẳng lý do: số đếm bao gồm các token định dạng cho vai trò tin nhắn và ranh giới vốn không bao giờ xuất hiện trong văn bản mà bạn có thể token hóa cục bộ, và các ước lượng cục bộ như lấy số ký tự chia cho bốn là không chính xác đối với hình ảnh, tệp và lược đồ.

• Hãy dành riêng ngân sách cho đầu ra trước. Chọn max_output_tokens với lưu ý rằng con số này bao gồm cả suy luận, đầu ra hiển thị và phần còn lại, và hãy bắt đầu từ vùng đệm 25.000 token của nhà cung cấp thay vì từ số không. Ngân sách đầu vào của bạn là kích thước cửa sổ trừ đi phần đã dành riêng đó, và con số chín trăm hai mươi hai chính là cách nhà cung cấp diễn đạt phép trừ tương tự.

• Hãy định giá yêu cầu ở cả hai phía của mốc 272.000 trước khi bạn gửi nó. Bước này đủ lớn đến mức một yêu cầu được thiết kế để rơi ngay dưới mốc và một yêu cầu được thiết kế để rơi ngay trên mốc là những sản phẩm khác nhau.

• Sắp xếp tiền tố theo tính ổn định. Hướng dẫn, rồi đến các schema công cụ, rồi đến corpus, rồi đến bản ghi hội thoại. Bất cứ thứ gì thay đổi giữa các lần gọi đều nên nằm ở cuối, nơi nó chỉ làm mất một khớp tiền tố thay vì mất toàn bộ cache.

• Cần vượt qua 1.024 token đầu vào hiển thị thì mới có thể mong đợi bộ nhớ đệm. Dưới ngưỡng tối thiểu đó, không có gì được lưu vào bộ nhớ đệm, và các token ẩn của nhà cung cấp không được tính vào ngưỡng này.

• Kiểm tra xem việc tái sử dụng có hợp lý không. Một tiền tố phải được tái sử dụng trong thời gian sống 30 phút của bộ đệm và phải rơi vào đúng máy đang giữ mục đó; cả hai điều này đều được mô tả trong hướng dẫn và không điều nào là thuộc tính của mã của bạn.

• Đo lại sau bất kỳ thay đổi mô hình hoặc cài đặt nào.Việc chuyển sang GPT-6.1 Sol loại bỏ vị trí tắt suy luận, điều này làm thay đổi số lượng token suy luận và do đó thay đổi phần đầu ra của ngân sách — và việc thay đổi mức nỗ lực suy luận, công cụ, lược đồ đầu ra có cấu trúc hoặc quản lý ngữ cảnh cũng có thể dịch chuyển ranh giới tiền tố và khiến bạn mất hoàn toàn mức giá đã lưu trong bộ nhớ đệm.

• Quyết định điều gì sẽ xảy ra khi tác vụ không thể thu gọn lại. Nén (compaction) là lối thoát đã được ghi nhận trong tài liệu: một yêu cầu Responses có thể đặt context_management với một ngưỡng nén, và máy chủ sẽ thay thế nội dung hội thoại trước đó bằng một mục nén opaque mang trạng thái quan trọng tiến lên phía trước với ít token hơn. Đây là một quyết định về ngân sách chứ không phải một lần cắt tỉa miễn phí, bởi vì hướng dẫn lưu ý rằng nén "có thể ngăn việc tái sử dụng kể từ token bị thay đổi đầu tiên trở đi" — một lượt nén sẽ vô hiệu hóa tiền tố nằm phía sau nó.

A screenshot of the OrcaRouter model page at www.orcarouter.ai/models/openai/gpt-6-sol, captured October 7 2026, showing the OrcaRouter nav bar, the breadcrumb Home -> Models -> OpenAI, the model identifier openai/gpt-6-sol attributed to OpenAI with the date 2026-09-22, the Vision, Tools, JSON and Reasoning capability badges, the spec tiles reading Max output 128K, input text + image + file, output text and a p50 TTFT of 1.44 s, the description stating a 1.05M-token context, and the /v1/chat/completions rate row of $2.00 in and $10.00 out per 1M tokens.

Phép tính trên trang này bắt đầu từ thế hệ mà GPT-6.1 Sol thay thế, và bậc đó chính là bậc có thể gọi được ngay hôm nay: thẻ của chúng tôi cho openai/gpt-6-sol báo cáo cửa sổ ngữ cảnh 1.050.000 token với 128.000 token đầu ra tối đa theo mức giá niêm yết của OpenAI với 0% phụ trội — giá của nhà cung cấp chính là giá trên trang, và một thay đổi từ nhà cung cấp sẽ được cập nhật ở đó ngay trong cùng ngày thay vì phải chờ đến kỳ gia hạn. Thẻ của chúng tôi không có trường đầu vào tối đa riêng, nên con số 922.000 token cho mô hình đó phải lấy từ tài liệu của chính nhà cung cấp, và đó là nguồn mà trang này đã dùng xuyên suốt. Điều mà thẻ này hữu ích là để ước lượng kích thước: cửa sổ và mức trần đầu ra mà nó công bố chính là hai con số mà quy trình lập ngân sách ở trên lấy trừ cho nhau, và bậc bên dưới chính là bậc mà bạn thực sự có thể áp dụng quy trình đó trong khi 6.1 vẫn còn mới. Nó nằm tại https://www.orcarouter.ai/models/openai/gpt-6-sol.

So sánh trong bài viết này1

Phát hiện từ bài viết này · Benchmark: Artificial Analysis · cập nhật hằng ngày