
GPT-6 Sol so với GPT-5.6 Sol: Một điểm chỉ số, giá chỉ bằng một nửa, và một bước thụt lùi không ai loan báo
- typesafeMỚITypeSafe: Jev 1.132026-09-24$0.04 / $0.00 trên 1 triệu token · 610 tok/s
- openaiMỚIOpenAI: GPT-6 Luna2026-09-2237Trí tuệ
- openaiMỚIOpenAI: GPT-6 Sol2026-09-2248Trí tuệ
- anthropicMỚIAnthropic: Claude Opus 5.52026-09-2258Trí tuệ
- grokMỚIGrok 4.72026-09-2146Trí tuệ
- OrcaMỚIOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 trên 1 triệu token · 189 tok/s
- orcaMỚIOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 trên 1 triệu token · 1306 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Trí tuệ
- openaiOpenAI: GPT-6 Astra2026-09-0453Trí tuệ77Lập trình
- googleGoogle: Gemini 3.8 Flash2026-09-0241Trí tuệ76Lập trình
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Trí tuệ76Lập trình
- anthropicAnthropic: Claude Fable 5.12026-09-0153Trí tuệ82Lập trình
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 trên 1 triệu token · 111 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Trí tuệ72Lập trình
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 trên 1 triệu token · 225 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Trí tuệ75Lập trình
- obsidianQwen3.8 27B2026-08-1534Trí tuệ68Lập trình
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Trí tuệ69Lập trình
- grokSpaceXAI: Grok 4.62026-08-1244Trí tuệ77Lập trình
- metaMeta: Muse Spark 1.22026-08-0540Trí tuệ72Lập trình
Vâng, hãy nâng cấp — nhưng hãy đọc đoạn thứ hai trước khi bạn làm điều đó. GPT-6 Sol, phát hành ngày 22 tháng 9 năm 2026, đạt 48 điểm trên Intelligence Index của Artificial Analysis. GPT-5.6 Sol, phát hành ngày 9 tháng 7 năm 2026, đạt 47 điểm. Một điểm. Mô hình thay thế nó có giá chỉ bằng một nửa: 2,00 đô la cho mỗi triệu đầu vào và 10,00 đô la cho mỗi triệu đầu ra, so với 4,00 đô la và 20,00 đô la. Xét trên những con số nổi bật, đây là quyết định nâng cấp dễ dàng nhất trong dòng sản phẩm hiện tại, và việc giảm giá là thật, vĩnh viễn, và là mức giảm đơn lẻ lớn nhất mà nhà cung cấp từng thực hiện cho một mẫu flagship.
Điều phức tạp là đánh giá của chính Artificial Analysis về GPT-6 Sol cho thấy sự pha trộn giữa cải thiện và thoái bộ, chứ không phải một bước tiến rõ ràng. Có những thoái bộ trên GDPval-AA v2.1. Ngoài ra còn có một bậc định giá lại cho ngữ cảnh dài trên 272.000 token đầu vào, gần như tăng gấp đôi đơn giá đầu vào và tăng một nửa giá đầu ra — và 272K chính xác là dải mà GPT-5.6 Sol có một thế mạnh đã được công bố. Một cuộc chuyển đổi trông như thể giảm thẳng một nửa hóa đơn của bạn, trên lưu lượng ngữ cảnh dài, có thể hóa ra gần như hòa tiền nhưng kèm theo một đánh đổi về năng lực.
Mức tăng một điểm của Index thực sự có ý nghĩa gì
Cả hai mô hình đều được đo trên cùng một bảng đánh giá, phiên bản 4.3.2, khiến đây trở thành phép so sánh sạch nhất trong toàn bộ dòng GPT-6 Sol — không có khác biệt về bộ khung đánh giá, không có sự không khớp giữa nhà cung cấp và bên độc lập, một phòng thí nghiệm đo hai mô hình từ cùng một nhà cung cấp.
• AA Intelligence Index — GPT-6 Sol 48, xếp hạng 18/212 so với GPT-5.6 Sol 47, xếp hạng 19/212
• Chi phí mỗi tác vụ Index — GPT-6 Sol chỉ khoảng một nửa so với GPT-5.6 Sol
• Tốc độ xuất — GPT-6 Sol 104,4 token/giây so với GPT-5.6 Sol 72,6 token/giây
• Thời gian đến token đầu tiên — GPT-6 Sol 107,18 giây so với GPT-5.6 Sol nhanh hơn, cả hai đều so với mức trung vị của bảng là 3,87 giây
• Giá đầu vào — GPT-6 Sol $2.00 mỗi 1M so với GPT-5.6 Sol $4.00 mỗi 1M
• Giá đầu ra — GPT-6 Sol $10.00 mỗi 1M so với GPT-5.6 Sol $20.00 mỗi 1M
• Đầu vào được lưu trong bộ nhớ đệm — GPT-6 Sol giảm khoảng 90% so với GPT-5.6 Sol $0.40 mỗi 1M
• Giá theo lô — GPT-6 Sol chưa công bố so với GPT-5.6 Sol $2.50 / $15.00
• Bậc ngữ cảnh dài — GPT-6 Sol đổi giá khi đầu vào vượt 272K, còn GPT-5.6 Sol không có bậc tương đương
• Cửa sổ ngữ cảnh — GPT-6 Sol 872K theo AA, 1,05M được công bố so với GPT-5.6 Sol khoảng 1,05M đến 1,1M
• Đầu ra tối đa — 128K trên cả hai
• Đã phát hành — GPT-6 Sol 2026-09-22 so với GPT-5.6 Sol 2026-07-09

Hãy nhìn cả hai đường tốc độ cùng lúc. GPT-6 Sol tạo đầu ra nhanh hơn khoảng 44% so với phiên bản tiền nhiệm, và nó chậm hơn đáng kể khi tạo token đầu tiên — 107,18 giây so với mức trung vị của bảng xếp hạng là 3,87. GPT-5.6 Sol cũng không phải là một mô hình nhanh theo tiêu chuẩn của bảng xếp hạng, nhưng nó không nằm trong vùng đó. Nếu bạn đã chuyển sang GPT-5.6 Sol cho một sản phẩm tương tác, thì GPT-6 Sol không phải là bản thay thế trực tiếp, và đó là một sự thoái bộ chức năng độc lập với bất kỳ bài kiểm chuẩn nào.
Một điểm có lợi một cách kín đáo: mức giá tiêu chuẩn 2 USD/10 USD của GPT-6 Sol thấp hơn mức giá theo lô 2,50 USD/15 USD của GPT-5.6 Sol. Ngay cả bậc được chiết khấu của mẫu cũ cũng đắt hơn giá niêm yết của mẫu mới. Đó là bằng chứng mạnh mẽ nhất cho thấy việc cắt giảm mang tính cấu trúc chứ không phải chỉ mang tính khuyến mãi.
Hồi quy mới là phần thú vị.
Artificial Analysis nhận thấy GPT-6 Sol giảm chi phí mỗi tác vụ xuống khoảng một nửa, đồng thời tạo ra cả những cải thiện lẫn thoái bộ. GDPval-AA v2.1 là chỉ số thoái bộ được nêu tên. Ở một diễn biến khác, GPT-5.6 Luna của OpenAI cũng thoái bộ trên Coding Agent Index — điều này gợi ý một xu hướng chung của thế hệ này chứ không phải một sai sót đơn lẻ ở một mô hình.
Điều này đáng được xem trọng chính vì đây là phát hiện độc lập. Tài liệu ra mắt của OpenAI được xây dựng xoay quanh chi phí trên mỗi tác vụ và quanh các dòng điểm chuẩn mà họ đã chọn; Artificial Analysis không có sản phẩm nào để bán và báo cáo những gì bộ khung đánh giá của mình tạo ra. Một mô hình rẻ hơn và gần như tương đương trên chỉ số tổng hợp, nhưng kém hơn một cách có thể đo lường được ở các tác vụ con cụ thể, không phải là một mô hình tốt hơn một cách tuyệt đối. Nó là một điểm khác trên đường biên.
Phiên bản thực tế của điều đó: nếu khối lượng công việc của bạn mang đậm dạng GDPval-AA — công việc tri thức có giá trị kinh tế, kiểu nhiệm vụ mà benchmark đó được xây dựng để định giá — thì mức tăng điểm tổng hợp một điểm không bao quát được bạn, và mức suy giảm mới là con số đáng quan tâm. Nếu khối lượng công việc của bạn mang tính tổng quát, việc giảm một nửa chi phí cho mỗi nhiệm vụ mới là con số đáng quan tâm và điểm tổng hợp cho thấy bạn không đánh đổi điều gì có thể đo lường được.
Nơi GPT-5.6 Sol vẫn chiếm ưu thế
GPT-5.6 Sol có một kết quả truy xuất ngữ cảnh dài đã được công bố mà GPT-6 Sol không đạt được mức tương đương nào: MRCR v2, 8-needle, 91,5% trong dải 256K đến 512K. Đó là một con số về độ chính xác truy xuất nằm trong dải mà bảng giá của GPT-6 Sol thay đổi.
Đặt hai dữ kiện cạnh nhau. Trên 272.000 token đầu vào, toàn bộ yêu cầu của GPT-6 Sol được tính lại giá thành khoảng $4 cho đầu vào và $15 cho đầu ra. Đó đại khái là mức giá cũ của GPT-5.6 Sol cho đầu vào và bằng ba phần tư mức đó cho đầu ra — vì vậy khoản tiết kiệm 50% mà bạn chuyển sang để có được thu hẹp còn khoảng 0% ở đầu vào và 25% ở đầu ra, đúng trong phạm vi ngữ cảnh nơi GPT-5.6 Sol có một thế mạnh đã được ghi nhận và GPT-6 Sol không có đối ứng nào được công bố.
Các kết quả công bố khác của GPT-5.6 Sol vẫn ở mức đáng nể và chính là lý do một số nhóm sẽ không chuyển sang:
• Bài kiểm tra cuối cùng của Agents — GPT-5.6 Sol 53.6
• Terminal-Bench 2.1 — GPT-5.6 Sol 88.8 / 88.0
• SWE-Bench Pro — GPT-5.6 Sol 64,6
• OSWorld 2.0 — GPT-5.6 Sol 62.6
• BrowseComp — GPT-5.6 Sol 90.4
• GDPval-AA v2 — GPT-5.6 Sol 1747.8 Elo
• HLE — GPT-5.6 Sol 49.5
• MRCR v2, 8-needle — GPT-5.6 Sol 91,5% ở 256K đến 512K
Đây là những con số do OpenAI báo cáo. Lưu ý rằng BrowseComp ở mức 90,4 và con số MRCR là hai chỉ số khó thay thế nhất: các tác nhân nghiên cứu web và truy xuất ngữ cảnh dài là những tác vụ mà một mô hình đã hai tháng tuổi với con số đã công bố là lựa chọn an toàn hơn so với một mô hình mới không có phép đo tương ứng.
GPT-6 Sol mang lại những gì không có trên bảng giá
Giá cả mới là câu chuyện, nhưng ba điều khác đã thay đổi.
Đầu tiên, trần ngữ cảnh. GPT-6 Sol được Artificial Analysis ghi nhận ở mức 872.000 token, trong khi một tuyên bố khác trong tài liệu của OpenAI là 1,05M, với đầu vào tối đa 922K. GPT-5.6 Sol nằm trong khoảng 1,05M đến 1,1M tùy theo nguồn. Về mặt lý thuyết, đó là một bước lùi nhỏ về cửa sổ khả dụng — kèm theo lưu ý rằng ranh giới bậc 272K, chứ không phải trần, mới là yếu tố chi phối chi phí.
Thứ hai, tính khả dụng. GPT-6 Sol có trong API và trong ChatGPT Work và Codex trên Plus, Pro, Business, Enterprise và Edu — và quản trị viên Enterprise phải bật nó trước khi người dùng thấy nó. Nó không có trong ChatGPT Chat. GPT-5.6 Sol là một đợt triển khai rộng hơn. Nếu đường truy cập của nhóm bạn đi qua quản trị viên doanh nghiệp, thì việc di trú không chỉ là một thay đổi mã.
Thứ ba, việc ra mắt một mẫu flagship mới thường có nghĩa là mẫu cũ trở thành phương án dự phòng rẻ hơn thay vì bị ngừng sử dụng. GPT-5.6 Sol ở mức $4/$20 vẫn là một mô hình xuất sắc với 47 trên Index, và đối với công việc truy xuất ngữ cảnh dài, nó có một con số được công bố mà GPT-6 Sol không có.
Một cuộc di trú có chi phí thấp hơn vẻ ngoài của nó
Lý do việc nâng cấp cụ thể này dễ dàng là vì hai mô hình cùng nhà cung cấp, cùng dạng API và nằm liền kề trong bảng xếp hạng — nghĩa là việc di chuyển chỉ là thay đổi chuỗi mô hình chứ không phải tái kiến trúc, và đường dự phòng đã có sẵn trong mã của bạn. GPT-5.6 Sol có trên OrcaRouter với mức giá niêm yết của OpenAI, theo mô hình chuyển tiếp giúp thay đổi giá của OpenAI được cập nhật ngay phía chúng tôi trong cùng ngày thay vì sau khi nhà bán lại đàm phán lại.
GPT-6 Sol hiện chưa có trong danh mục của chúng tôi tại thời điểm viết bài này — nó có thể được truy cập thông qua API riêng của OpenAI. Vậy nên hình hài trung thực của một cuộc di trú là một tuyến đường với GPT-5.6 Sol đứng phía sau trên cùng một key: đẩy lưu lượng mới sang GPT-6 Sol, giữ mô hình trước đó chỉ cách một thay đổi cấu hình, và để cơ chế chuyển đổi dự phòng tự động bao phủ khoảng thời gian mà độ sẵn sàng của một flagship mới vẫn còn đang ổn định dần. Với một mô hình mới ra đời được hai ngày, lại có một công tắc bật tính năng Enterprise chắn trước nó cùng một hạng ngữ cảnh dài làm thay đổi bài toán kinh tế khi vượt quá 272K token, việc vẫn giữ thế hệ trước được nối vào hệ thống không phải là sự thận trọng — đó là khác biệt giữa một buổi chiều tồi tệ và một tuần tồi tệ.

Danh sách kiểm tra di chuyển
Hãy đo phân bố ngữ cảnh thực tế của bạn trước mọi thứ khác. Nếu phân vị thứ 95 trong các yêu cầu của bạn nằm dưới 272.000 token đầu vào, hãy chuyển đổi — khoản tiết kiệm thực sự là 50% ở cả hai đầu hóa đơn, chi phí cho mỗi tác vụ giảm một nửa, và chỉ số tổng hợp cho thấy bạn chẳng đánh mất gì cả. Nếu một phần đáng kể lưu lượng nằm trên ngưỡng đó, hãy cân nhắc kỹ hạng bậc này: ở mức khoảng $4/$15, lợi thế so với mức $4/$20 của GPT-5.6 Sol là 25% ở đầu ra và không có gì ở đầu vào, và bạn đang phải trả giá cho điều đó bằng việc mất đi một kết quả truy xuất ngữ cảnh dài đã được ghi nhận.
Kiểm tra xem có ai phải chờ ở token đầu tiên không. 107 giây xấp xỉ gấp hai mươi tám lần trung vị của bảng và đây là kiểu lỗi sẽ xuất hiện đầu tiên trong môi trường production. Bất cứ thứ gì có con người ở đầu bên kia nên vẫn dùng GPT-5.6 Sol hoặc định tuyến sang nơi khác.
Sau đó, hãy kiểm tra quy trình bật tính năng. Các gói Enterprise cần quản trị viên bật GPT-6 Sol, và nó hoàn toàn không có trong ChatGPT Chat. Hãy xác nhận rằng người dùng của bạn thực sự có thể truy cập được nó trước khi bạn thông báo nội bộ về việc di chuyển.
Cuối cùng, hãy theo dõi GDPval-AA v2.1 trên các bộ đánh giá của riêng bạn trong tháng đầu tiên. Phòng thí nghiệm độc lập đã phát hiện một hồi quy ở đó, và mức tăng tổng hợp một điểm không cho bạn biết liệu tập tác vụ cụ thể của bạn đã tăng hay giảm. Hãy chạy các đánh giá của bạn trên cả hai mô hình trước khi chuyển đổi, chứ không phải sau đó.

So sánh trong bài viết này1
Phát hiện từ bài viết này · Benchmark: Artificial Analysis · cập nhật hằng ngày
