
GPT-6.1 Sol so với GPT-5.6 Sol: Bốn điểm rưỡi chỉ số, một nửa hóa đơn, hai hồi quy
- openaiMỚIOpenAI: GPT-6.1 Sol2026-09-2952Trí tuệ
- anthropicMỚIAnthropic: Claude Sonnet 5.52026-09-2856Trí tuệ
- typesafeMỚITypeSafe: Jev 1.132026-09-24$0.04 / $0.00 trên 1 triệu token · 161 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238Trí tuệ
- OpenAIOpenAI: GPT-6 Sol2026-09-2248Trí tuệ
- AnthropicAnthropic: Claude Opus 5.52026-09-2258Trí tuệ
- xAIGrok 4.72026-09-2146Trí tuệ
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 trên 1 triệu token · 79 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 trên 1 triệu token · 320 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Trí tuệ
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Trí tuệ77Lập trình
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Trí tuệ76Lập trình
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Trí tuệ76Lập trình
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Trí tuệ82Lập trình
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 trên 1 triệu token · 53 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 trên 1 triệu token · 301 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Trí tuệ72Lập trình
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 trên 1 triệu token · 232 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Trí tuệ75Lập trình
- obsidianQwen3.8 27B2026-08-1534Trí tuệ68Lập trình
OpenAI released GPT-6.1 Sol on 29 September 2026, eleven weeks after GPT-5.6 Sol, which shipped on 9 July 2026 as the flagship of the previous generation. Both are still on sale, both are still callable, and the difference between them on the neutral board is 4.8 points — 51.8 against 47.0 on Artificial Analysis's Intelligence Index, both measured at maximum reasoning effort on the same ten-evaluation suite. The price difference is much larger than the score difference: $0.72 per completed index task against $1.99, and $2.00/$10.00 per million tokens against $4.00/$20.00. That is the short version. The long version is that the upgrade is not uniform, and two of the evaluations moved backwards.
Mỗi mô hình là gì, và cái gì đã thay thế cái gì
GPT-5.6 Sol was the top of the 5.6 line — a closed, API-only model with a 1,050,000-token context window, a 128,000-token output ceiling, text, image and file input, and a reasoning ladder running from none through max. It was described by OpenAI as the tier built for the hardest work: long-horizon agentic workflows, multi-file software engineering, deep reasoning, and it was priced accordingly at $4.00 and $20.00 per million tokens with cached input at $0.40 and cache writes at $5.00. Above 272,000 input tokens it repriced to $8.00 and $30.00, and it carried a Batch tier at $2.50 and $15.00.
GPT-6.1 Sol is the mid-tier of the generation that came after: below GPT-6 Astra, above GPT-6 Luna, and now the model OpenAI points cost-sensitive developers at. It keeps the 1,050,000-token window and the 128,000-token output cap, extends the knowledge cutoff from April 20 to April 30, 2026, and cuts the effort ladder from six rungs to five — low, medium (default), high, xhigh, max. The none value that GPT-5.6 Sol accepted now returns an error, and OpenAI's migration guidance is explicit that the substitution is low, not a silent upgrade.
Điều này đáng để dừng lại suy nghĩ, vì đây là thay đổi duy nhất trong bản phát hành khiến bạn tốn tiền thay vì tiết kiệm tiền. Một pipeline vốn dựa vào none để có một lệnh gọi rẻ, nhanh, không suy luận thì nay không còn cấu hình đó nữa, trên cả hai dòng mô hình. Nấc rẻ nhất trên GPT-6.1 Sol là một nấc suy luận, và các token suy luận được tính phí như token đầu ra dù bạn có nhìn thấy chúng hay không.
Cái thang, từng bậc một
Bảng đánh giá độc lập công bố điểm số và chi phí chạy cho mọi thiết lập mức nỗ lực trên cả hai mô hình, điều này biến cuộc đối đầu trực tiếp thành thứ hữu ích hơn một phép so sánh đơn lẻ. Xếp cạnh nhau ở các thiết lập tương đương:
• Thang nỗ lực, GPT-6.1 Sol — tối đa 51,8 với $0,72 cho mỗi tác vụ chỉ mục; xhigh 51,0 với $0,39; high 50,2 với $0,32; medium (mặc định) 47,8 với $0,21 • Tốc độ đầu ra — 59,7 token mỗi giây đối với GPT-6.1 Sol so với 87,8 đối với GPT-5.6 Sol
• Thời gian đến chunk đầu tiên — 332 giây đối với GPT-6.1 Sol so với một con số nhanh hơn đối với GPT-5.6 Sol, so với trung vị của bảng gần 4 giây
• Số token đầu ra trong lần chạy chỉ mục — 67,2 triệu đối với GPT-6.1 Sol so với 90,0 triệu đối với GPT-5.6 Sol
• Giá đầu vào / đầu ra — $2,00 / $10,00 so với $4,00 / $20,00
• Đầu vào đã cache — $0,10 so với $0,40; ghi cache $2,50 so với $5,00
• Giá theo lô — không được công bố cho GPT-6.1 Sol so với $2,50 / $15,00 cho GPT-5.6 Sol
• Bậc ngữ cảnh dài — trên 272.000 token đầu vào, GPT-6.1 Sol đổi giá thành $4,00 / $15,00 cho toàn bộ yêu cầu so với $8,00 / $30,00 của GPT-5.6 Sol
• Mức nỗ lực tối thiểu — low so với none
Có hai điều rút ra từ danh sách đó. Thứ nhất là việc giảm giá mang tính cấu trúc chứ không phải khuyến mãi: mức giá tiêu chuẩn $2.00 và $10.00 của GPT-6.1 Sol thấp hơn mức giá theo lô $2.50 và $15.00 của GPT-5.6 Sol, nên ngay cả gói chiết khấu của mô hình cũ cũng đắt hơn giá niêm yết của mô hình mới. Thứ hai là bản nâng cấp không phải là một đường thẳng về độ trễ. GPT-6.1 Sol tạo đầu ra chậm hơn khoảng một phần ba và mất 332 giây để có chunk đầu tiên trong các bài kiểm tra prompt dài của bảng xếp hạng — cùng bậc độ lớn với 107 giây của GPT-6 Sol và gấp khoảng tám mươi lần trung vị của bảng xếp hạng. Nếu bạn đã xây dựng một sản phẩm tương tác trên GPT-5.6 Sol, đây là một hồi quy chức năng độc lập với mọi benchmark, và cách khắc phục mang tính kiến trúc, không phải tham số.

Hai đánh giá đã đi sai hướng
Mức tăng tổng hợp là 4,8 điểm. Các cấu phần không đồng đều tích cực, và điểm số theo từng đánh giá của hội đồng cũng cho thấy điều đó:
• SciCode — GPT-6.1 Sol 0,542 so với GPT-5.6 Sol 0,571. Mức giảm 2,9 điểm về lập trình khoa học.
• GDPval-AA v2.1 — GPT-6.1 Sol Elo 1575,1 so với GPT-5.6 Sol Elo 1611,3. Mức giảm 36 điểm Elo trong công việc tri thức có giá trị kinh tế.
• Humanity's Last Exam — GPT-6.1 Sol 0,529 so với GPT-5.6 Sol 0,495. Mức tăng 3,4 điểm.
• Terminal-Bench 4.0 — GPT-6.1 Sol 0,561 so với GPT-5.6 Sol 0,399. Mức tăng 16 điểm, mức thay đổi đơn lẻ lớn nhất trong cặp so sánh này.
• AA-Omniscience — GPT-6.1 Sol 41,5 so với GPT-5.6 Sol 22,0, vốn liên quan đến độ tin cậy của kiến thức và ảo giác hơn là khả năng ghi nhớ thô.
• AA-Briefcase v1.1, AutomationBench-AA, AA-LCR v1.1, GDP.pdf, CritPt — năm chỉ số còn lại, những chỉ số bổ sung vào điểm tổng hợp và là nơi tạo ra phần còn lại của mức tăng 4,8 điểm.
A model that is meaningfully better on terminal work, substantially better on factual reliability, and measurably worse on scientific coding and on professional-work Elo is not a strictly better model. It is a different point on the frontier, and it was placed there deliberately: OpenAI's own launch framing for GPT-6.1 Sol is cost per completed task at near-flagship quality, not maximum score. If your workload is SciCode-shaped or GDPval-shaped, the composite number is not the one that applies to you, and the regression is.
GPT-5.6 Sol vẫn có kết quả ngữ cảnh dài đã được công bố
Điểm duy nhất mà mô hình cũ hơn có một con số còn mô hình mới hơn không có là độ chính xác truy xuất trong dải ngữ cảnh nơi bảng giá của GPT-6.1 Sol thay đổi. GPT-5.6 Sol có kết quả MRCR v2 eight-needle được công bố đạt 91,5% trong phạm vi 256.000 đến 512.000 token. GPT-6.1 Sol không có kết quả đối chiếu nào được công bố, và trên 272.000 token đầu vào, toàn bộ yêu cầu của nó được định giá lại ở mức 2× đối với đầu vào và cache, cùng 1,5× đối với đầu ra.
Ghép hai sự kiện đó lại, và phân khúc mà tính kinh tế của mô hình mới yếu nhất lại đúng là phân khúc mà mô hình cũ có lợi thế duy nhất được ghi nhận. Khoản tiết kiệm không biến mất — $4.00 và $15.00 ở bậc giá đã điều chỉnh so với $8.00 và $30.00 ở bậc ngữ cảnh dài của chính GPT-5.6 Sol vẫn là mức giảm một nửa — nhưng câu chuyện giảm một nửa giá là câu chuyện dành cho khối lượng công việc tổng quát, còn một pipeline truy xuất ngữ cảnh dài thì không phải vậy. Nếu đó là khối lượng công việc của bạn, GPT-5.6 Sol ở mức $4.00 và $20.00 với 91,5% được công bố là một lựa chọn có thể biện minh để tiếp tục ở lại.
GPT-5.6 Sol's other published results remain intact and are the reason some teams will not move: BrowseComp 90.4 for web-research agents, Terminal-Bench 2.1 at 88.8 and 88.0, SWE-Bench Pro 64.6, Agents' Last Exam 53.6, OSWorld 2.0 at 62.6. Those are OpenAI-reported, on OpenAI's harness, and they were reported in July. What has changed since is that the board now scores both models on one suite at one set of settings, and the older model loses on the composite and on cost.
Bản thân quá trình di trú chỉ là một thay đổi chuỗi, với một ngoại lệ.
Cùng nhà cung cấp, cùng bề mặt API, liền kề trong bảng xếp hạng, cùng cửa sổ và giới hạn đầu ra — vậy nên với hầu hết các stack, đây là một mã định danh mô hình và một mức giá giảm một nửa. Các ngoại lệ thì cụ thể và đáng được nêu tên trước khi bạn bật công tắc.
Nếu mã của bạn đặt reasoning.effort thành none hoặc minimal, nó sẽ thất bại thay vì suy giảm, và low là giá trị thay thế đã được tài liệu hóa. Nếu lưu lượng của bạn chạy trên 272.000 token đầu vào, hãy kiểm tra bậc đã được định giá lại trước khi bạn tính toán mức tiết kiệm. Nếu sản phẩm của bạn phụ thuộc vào thời gian đến token đầu tiên, hãy đo trước khi phát hành, vì con số 332 giây của bảng không phải là lỗi làm tròn. Và nếu các đánh giá của bạn có một phần dạng SciCode hoặc dạng GDPval, hãy chạy phần đó trên cả hai mô hình thay vì tin vào điểm tổng hợp.
Both models are on OrcaRouter at OpenAI's own list prices — GPT-6.1 Sol at $2.00 and $10.00 with cached input at $0.10, GPT-5.6 Sol at $4.00 and $20.00 with cached input at $0.40 — under a pass-through model that puts an OpenAI price change on our side the same day it lands rather than after a reseller renegotiates. Because the price list is passed through unchanged rather than marked up, the arithmetic in this article is the arithmetic you get: the same $0.72-per-task model, the same halving, no platform premium layered on either side.

Việc sử dụng thực tiễn của một endpoint chung cho cả hai là ở chỗ phép so sánh luôn được cập nhật trực tiếp. Hãy gửi lưu lượng mới đến GPT-6.1 Sol, giữ GPT-5.6 Sol chỉ cách một thay đổi cấu hình để làm phương án dự phòng và làm đường dẫn ngữ cảnh dài, đồng thời để cơ chế chuyển đổi dự phòng tự động bao phủ khoảng thời gian mà tính sẵn sàng cùng khả năng kích hoạt Enterprise của một mẫu flagship hai tháng tuổi vẫn đang dần ổn định. Một cuộc di trú giúp giảm một nửa hóa đơn và khiến hai tiểu benchmark đi lùi không phải là quyết định đưa ra một lần rồi quên đi; đó là quyết định phải đưa ra theo từng route, và một lớp định tuyến chính là thứ khiến việc đó trở nên rẻ.

Nơi mỗi người thuộc về
• Công việc tác nhân tổng quát và công việc trên terminal — GPT-6.1 Sol. Mười sáu điểm trên Terminal-Bench 4.0 và mức giá bằng một nửa thì không phải là một cuộc so kè sát nút.
• Độ tin cậy về dữ kiện, các sản phẩm trả lời dựa trên truy xuất — GPT-6.1 Sol, với khoảng cách gần hai mươi điểm trên AA-Omniscience.
• Lập trình khoa học — hãy kiểm tra đánh giá của chính bạn trước. Bảng xếp hạng cho thấy mức giảm 2,9 điểm, còn điểm tổng hợp thì sẽ không.
• Công việc tri thức có giá trị kinh tế — cũng cần thận trọng như vậy. Mức giảm Elo trên GDPval-AA là 36 điểm.
• Truy xuất ngữ cảnh dài trên 272.000 token — GPT-5.6 Sol, cho đến khi GPT-6.1 Sol có con số được công bố trong dải đó.
• Các bề mặt tương tác, nhạy cảm với độ trễ — hãy đo trước khi chuyển đổi. Đầu ra nhanh hơn, nhưng token đầu tiên chậm hơn nhiều.
• Lệnh gọi không suy luận rẻ nhất — không bên nào cả. Cấu hình đó không còn tồn tại trên dòng này nữa.
So sánh trong bài viết này1
Phát hiện từ bài viết này · Benchmark: Artificial Analysis · cập nhật hằng ngày
