
GPT-6 vs Claude Opus 5.5: Mô hình mà ai cũng vừa có được, đối đầu với mô hình vẫn đang dẫn đầu
- openaiMỚIOpenAI: GPT-6.1 Sol2026-09-2952Trí tuệ
- anthropicMỚIAnthropic: Claude Sonnet 5.52026-09-2856Trí tuệ
- typesafeMỚITypeSafe: Jev 1.132026-09-24$0.04 / $0.00 trên 1 triệu token · 128 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238Trí tuệ
- OpenAIOpenAI: GPT-6 Sol2026-09-2248Trí tuệ
- AnthropicAnthropic: Claude Opus 5.52026-09-2258Trí tuệ
- xAIGrok 4.72026-09-2146Trí tuệ
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 trên 1 triệu token · 65 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 trên 1 triệu token · 320 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Trí tuệ
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Trí tuệ77Lập trình
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Trí tuệ76Lập trình
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Trí tuệ76Lập trình
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Trí tuệ82Lập trình
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 trên 1 triệu token · 54 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 trên 1 triệu token · 360 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Trí tuệ72Lập trình
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 trên 1 triệu token · 232 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Trí tuệ75Lập trình
- obsidianQwen3.8 27B2026-08-1534Trí tuệ68Lập trình
Vào ngày 7 tháng 10 năm 2026, GPT-6 đã trở thành mô hình mà hơn 1,2 tỷ người dùng ChatGPT hằng tuần trò chuyện cùng, và nó vẫn chưa phải là mô hình đạt điểm cao nhất trên bảng xếp hạng độc lập. GPT-6 Sol — phiên bản mà OpenAI đã bật cho ChatGPT Plus, Pro, Business và Enterprise — đạt 47,6 điểm trên Chỉ số Trí tuệ v4.3.2 của Artificial Analysis. Claude Opus 5.5, được Anthropic phát hành vào ngày 22 tháng 9 năm 2026 với giá 4,00 USD cho mỗi triệu token đầu vào và 20,00 USD cho mỗi triệu token đầu ra, đạt 57,6 điểm trên cùng phiên bản đó. Mười điểm, trên phép đo duy nhất mà cả đội ngũ tiếp thị của hai nhà cung cấp đều sẵn sàng được chấm điểm.
Khoảng cách đó là thật và tôi sẽ không nói giảm nó đi. Nhưng đó cũng là sự thật ít thú vị nhất về cặp đôi này trong tháng Mười, bởi thứ đã thay đổi trong tuần này không phải là một phép đo hiệu năng. GPT-6 đã có mặt trên ChatGPT cho tất cả mọi người với một năng lực mà OpenAI gọi là Intelligent UI, và mô hình vận hành các gói trả phí trong đợt triển khai đó là GPT-6 Sol. Vậy nên phép so sánh hữu ích giờ đây không còn là "API nào tốt hơn" — mà là "1,2 tỷ người vừa được dùng GPT-6 thực sự nhận được gì, và liệu điều đó có đủ để một người xây dựng sản phẩm hay một đội ngũ ngừng trả tiền cho Claude Opus 5.5 hay không". Hai câu trả lời khác nhau, và khác biệt không nằm ở mười điểm đó.
Điều gì thực sự đã thay đổi vào ngày 7 tháng 10
Nói chính xác về ngày tháng, bởi đây không phải là một đợt ra mắt: GPT-6 Sol và GPT-6 Luna đã được phát hành vào ngày 22 tháng 9 năm 2026 với tư cách là các mô hình API. GPT-6 Astra, mô hình chủ lực, ra đời trước đó — OpenAI đã phát hành nó vào ngày 3 tháng 9 năm 2026. Điều xảy ra vào ngày 7 tháng 10 là GPT-6 đã có mặt trên toàn cầu tại tab Chat của ChatGPT dành cho Plus, Pro, Business và Enterprise, với các gói Free và Go tiếp nối từ ngày 8 tháng 10; quyền truy cập dành cho doanh nghiệp vẫn phụ thuộc vào cài đặt của quản trị viên tại nơi làm việc. Đây là một sự kiện phân phối, không phải một đợt phát hành, và sự phân biệt này rất quan trọng với bất kỳ ai đọc những bài viết cũ hơn.
Khả năng gắn với nó mới là phần thực sự mới. Intelligent UI cho phép GPT-6 tổng hợp câu trả lời từ văn bản, đồ họa, nút bấm được, biểu mẫu và biểu đồ, được chọn theo từng câu hỏi, và truyền phát giao diện ngay khi mô hình tạo ra nó. Cách OpenAI tự diễn đạt là một so sánh có thể trả về ở dạng đặt cạnh nhau, một lời giải thích dưới dạng sơ đồ tương tác, và một câu trả lời văn bản thuần khi văn bản là câu trả lời phù hợp. Kèm theo đó là hai kết quả nội bộ do nhà cung cấp báo cáo: trên các tác vụ agentic hằng ngày có giá trị cao, GPT-6 ở mức Extra High bắt đầu trả lời trong cùng khoảng thời gian như GPT-5.6 ở mức Medium trong khi đạt điểm tổng thể tốt hơn GPT-5.6 ở mức Extra High, và với các câu hỏi cần tìm kiếm web, GPT-6 Instant bắt đầu trả lời sớm hơn trung bình 44% so với GPT-5.6 Instant. Cả hai đều là số liệu của OpenAI, được lấy lại từ thông báo của chính họ, và chưa có tái lập độc lập nào.
Hai bảng giá, và nơi mười điểm được mua
Không mô hình nào thay đổi giá trong tuần này. Claude Opus 5.5 đã ở mức 4,00 USD đầu vào và 20,00 USD đầu ra kể từ ngày 22 tháng 9. GPT-6 Sol đã ở mức 2,00 USD và 10,00 USD kể từ cùng ngày. Mỗi chiều một dòng, cả hai phía trên mỗi dòng:
• Giá đầu vào nổi bật — GPT-6 Sol $2.00 mỗi 1M so với Claude Opus 5.5 $4.00; Sol chỉ bằng một nửa giá
• Giá đầu ra nổi bật — GPT-6 Sol $10.00 mỗi 1M so với Claude Opus 5.5 $20.00; vẫn chỉ bằng một nửa
• Điều khoản ngữ cảnh dài — GPT-6 Sol tính lại giá cho toàn bộ yêu cầu ở mức $4.00 đầu vào và $15.00 đầu ra khi vượt 272.000 token đầu vào; Claude Opus 5.5 không có bậc tương đương ở cửa sổ 1M của nó
• Đầu vào lưu đệm — GPT-6 Sol $0.20 mỗi 1M so với Claude Opus 5.5 $0.20; ngang nhau
• Chi phí chạy toàn bộ bộ Intelligence Index — Claude Opus 5.5 $5.98 mỗi tác vụ so với GPT-6 Sol $1.04, một khoảng chênh 5,7× đổi lấy mười điểm đó
• Cửa sổ ngữ cảnh — GPT-6 Sol 1.050.000 token so với Claude Opus 5.5 1.000.000, với giới hạn đầu ra 128.000 token ở cả hai

Dòng thứ tư mới là dòng quyết định phần lớn các triển khai thực tế, và nó không phải dòng trên trang tiếp thị. Phụ phí ngữ cảnh dài của GPT-6 Sol khá mạnh tay so với chính mức giá tiêu đề của nó: khi đẩy một yêu cầu vượt quá 272.000 token đầu vào, toàn bộ yêu cầu sẽ bị tính ở mức $4,00 và $15,00, chứ không chỉ phần vượt. Đối với một agent duy trì một phiên dài với một tài liệu lớn trong ngữ cảnh, điều đó âm thầm loại bỏ phần lớn lợi thế nửa giá. Claude Opus 5.5 không có bước tương đương, nên một yêu cầu 400.000 token có cùng mức giá trên mỗi token như một yêu cầu 4.000 token.
Nơi mười điểm nằm ở, bởi vì chúng không được phân bố đều
Một chỉ số tổng hợp che giấu các thành phần của chính nó, và cái này che giấu một hồ sơ gồ ghề bất thường. Hãy lấy ra các đánh giá riêng lẻ mà số liệu của cả hai nhà cung cấp có thể được đối chiếu với:
• Humanity's Last Exam — Claude Opus 5.5 đạt 61,4% so với GPT-6 Sol 47,9%, chênh lệch 13,5 điểm về suy luận trừu tượng
• SciCode — Claude Opus 5.5 đạt 66,9% so với GPT-6 Sol 57,6%, chênh lệch 9,3 điểm về mã ở cấp độ nghiên cứu
• Terminal-Bench 4.0 — Claude Opus 5.5 đạt 59,6% so với GPT-6 Sol 43,9%
• Khả năng ghi nhớ ngữ cảnh dài — Claude Opus 5.5 đạt 84,7% so với GPT-6 Sol 83,7%, chênh lệch 1,0 điểm, mức hẹp nhất trên trang này
• Sử dụng công cụ tác tử qua nhiều lượt — hai mô hình chỉ cách nhau vài điểm trong họ τ²-Bench, nơi cả hai đều mạnh

Phân bố mới là toàn bộ câu chuyện. Về suy luận trừu tượng — một câu hỏi thi hóc búa, một bài toán nghiên cứu không có đáp án sẵn để sao chép — Claude Opus 5.5 dẫn trước một cách dứt khoát, và khoảng cách quá rộng để chỉ là nhiễu. Về việc rút một dữ kiện ra khỏi một đầu vào rất dài, cả hai về cơ bản ngang nhau, và GPT-6 Sol có cửa sổ ngữ cảnh lớn hơn một chút. Nếu khối lượng công việc của bạn là truy xuất tài liệu dài và công việc tác nhân trong phiên dài, thì mười điểm đó phần lớn là vấn đề của người khác. Nếu đó là suy luận mới lạ, thì mười điểm đó là vấn đề của bạn, và để tránh chúng, bạn phải trả gấp 5,7× cho mỗi tác vụ.
Việc triển khai ChatGPT cho bạn biết điều gì và không cho bạn biết điều gì
Có một sự cám dỗ là đọc “1,2 tỷ người dùng hằng tuần giờ đã có GPT-6” như bằng chứng về năng lực. Không phải vậy. Đó là bằng chứng về phân phối, và OpenAI nói rõ rằng đợt triển khai ChatGPT được vận hành bởi GPT-6 Sol cho các gói trả phí và GPT-6 Luna cho Free và Go, cả hai đều “được tinh chỉnh cho hội thoại hằng ngày” — một mục tiêu tối ưu hóa khác với sản phẩm API. Các mô hình đằng sau Work và Codex không thay đổi trong bản phát hành này, và đây là tín hiệu rõ ràng nhất trong thông báo rằng đây là một sự kiện ở bề mặt người tiêu dùng chứ không phải một bản phát hành về năng lực. Bất kỳ ai chạy benchmark “GPT-6 mà 1,2 tỷ người dùng sử dụng” nên biết rằng họ đang đo một bản triển khai được tinh chỉnh cho chat, chứ không phải điểm cuối API.
Điều mà việc triển khai rộng rãi thay đổi chính là giá trị mặc định. Một mô hình đơn thuần hiện diện cho tất cả mọi người sẽ xuất hiện trong nhiều nguyên mẫu, công cụ nội bộ và dự án phụ dang dở hơn hẳn so với một mô hình mà bạn phải chủ động lựa chọn. Nếu bạn đang chọn một API cho một thứ gì đó bền lâu, sự quen thuộc phổ biến ấy có giá trị nhất định — nhưng nó không đáng giá mười điểm chỉ số, và cũng không đáng giá bằng 5,7× chi phí mỗi tác vụ trên một pipeline nặng về suy luận.
Chạy cả hai mà không chọn
Câu trả lời thật lòng cho câu hỏi "tôi có nên chuyển đổi không" ở đây là hai mô hình này nhắm đến những công việc khác nhau, và câu hỏi chuyển đổi chủ yếu là câu hỏi về định tuyến. Cả hai đều nằm trong danh mục của OrcaRouter — GPT-6 Sol với mức giá $2.00/$10.00 của nhà cung cấp, trong đó bậc ngữ cảnh dài $4.00/$15.00 được giữ nguyên không đổi, và Claude Opus 5.5 ở mức $4.00/$20.00 — phía sau một khóa duy nhất và một endpoint tương thích OpenAI, với mức chênh 0% so với giá niêm yết của nhà cung cấp. Điều đó càng quan trọng hơn mức bình thường trong một tuần mà một nhà cung cấp thay đổi đợt triển khai dành cho người dùng phổ thông, bởi vì đường giá của chúng tôi là giá của nhà cung cấp, không phải của chúng tôi.
Mô hình phù hợp với cặp này là tách luồng: gửi lưu lượng tài liệu dài và phiên dài đến bên nào rẻ hơn ở số token đó — mà khi vượt qua 272.000 token thì bên rẻ hơn không còn là GPT-6 Sol nữa — và gửi lưu lượng suy luận mới lạ đến Claude Opus 5.5, với GPT-6 Sol được giữ như một phương án dự phòng tự động để việc bị giới hạn tốc độ trên một tuyến không trở thành sự cố ngừng dịch vụ ở phía bạn. Bạn không cần phải giải quyết xong cuộc tranh luận mười điểm mới có thể triển khai; bạn chỉ cần biết những yêu cầu nào của mình nằm ở phần của phân bố mà điều đó áp dụng.

Phán quyết, dù sao đi nữa
Claude Opus 5.5 là mô hình tốt hơn trên phép đo mà cả hai phòng thí nghiệm đều công bố đối chiếu, và nó không hề sát nút trong hai bài đánh giá quan trọng nhất đối với suy luận khó. GPT-6 Sol có giá bằng một nửa ở mức giá niêm yết, bằng một phần năm chi phí mỗi tác vụ trên bộ kiểm thử độc lập, và hiện là mô hình mặc định trong ứng dụng mà phần lớn đồng nghiệp của bạn đã mở sẵn. Không điều nào trong hai sự thật đó thay đổi trong tuần này; điều thay đổi là GPT-6 đã không còn là thứ bạn phải chọn mà trở thành thứ bạn đã có.
Điều đáng để mắt tới là liệu nước đi tiếp theo của OpenAI là một bước tiến về năng lực hay thêm một bước về phân phối. Chính thông báo của họ đã đặt kỳ vọng đó một cách rõ ràng — công ty nói họ muốn ChatGPT xây dựng thêm nhiều giao diện mà mọi người cần theo thời gian — và đó là một lộ trình về các bề mặt sản phẩm, không phải về các điểm chỉ số. Nếu quyết định của bạn phụ thuộc vào chỉ số, Claude Opus 5.5 vẫn thắng ở đó. Nếu nó phụ thuộc vào chi phí ở quy mô lớn và việc mô hình là thứ ai cũng đã biết, GPT-6 Sol là lựa chọn mặc định an toàn hơn trong hôm nay, với điều khoản ngữ cảnh dài là dòng duy nhất trong bảng giá của nó mà bạn phải dự trù ngân sách.
So sánh trong bài viết này2
Phát hiện từ bài viết này · Benchmark: Artificial Analysis · cập nhật hằng ngày
