
Claude Opus 5.5 vs GPT-5.6 Sol: Hai bảng ra mắt gần như không chồng lấn
- openaiMỚIOpenAI: GPT-6 Luna2026-09-2237Trí tuệ
- openaiMỚIOpenAI: GPT-6 Sol2026-09-2248Trí tuệ
- anthropicMỚIAnthropic: Claude Opus 5.52026-09-2258Trí tuệ
- grokMỚIGrok 4.72026-09-2146Trí tuệ
- OrcaMỚIOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 trên 1 triệu token
- orcaMỚIOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 trên 1 triệu token
- deepseekMỚIDeepSeek: DeepSeek V4.1 Flash2026-09-1040Trí tuệ
- openaiOpenAI: GPT-6 Astra2026-09-0453Trí tuệ77Lập trình
- googleGoogle: Gemini 3.8 Flash2026-09-0241Trí tuệ76Lập trình
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Trí tuệ76Lập trình
- anthropicAnthropic: Claude Fable 5.12026-09-0153Trí tuệ82Lập trình
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 trên 1 triệu token
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Trí tuệ72Lập trình
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 trên 1 triệu token
- z-aiZ.ai: GLM 5.32026-08-1845Trí tuệ75Lập trình
- obsidianQwen3.8 27B2026-08-1534Trí tuệ68Lập trình
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Trí tuệ69Lập trình
- grokSpaceXAI: Grok 4.62026-08-1244Trí tuệ77Lập trình
- metaMeta: Muse Spark 1.22026-08-0540Trí tuệ72Lập trình
- qwenQwen: Qwen3.8 Max2026-08-0345Trí tuệ76Lập trình
Đặt Claude Opus 5.5 và GPT-5.6 Sol cạnh nhau trong tuần này, và điều đầu tiên bạn nhận ra không phải là một người thắng cuộc. Mà là việc hai nhà cung cấp đã công bố những bảng điểm chuẩn gần như không có chung một dòng nào. Tài liệu ra mắt của Claude Opus 5.5, phát hành ngày 22 tháng 9 năm 2026, đặt nó dẫn trước GPT-5.6 Sol 29 điểm trên Terminal-Bench 4.0. Tài liệu ra mắt của Sol, được cung cấp rộng rãi từ ngày 9 tháng 7 năm 2026, lại dẫn đầu bằng Terminal-Bench 2.1, nơi Sol Ultra đạt 91,9%, và Artificial Analysis Coding Agent Index, nơi nó chiếm vị trí số một với 80. Cả hai bảng đều là thật. Cả hai đều được chạy bởi chính nhà cung cấp giành chiến thắng trong đó. Câu hỏi hữu ích không phải là mô hình nào tốt hơn một cách trừu tượng — mà là bài đánh giá chuẩn nào, chạy dưới bộ khung của ai, mới cho bạn biết điều gì đó về khối lượng công việc của bạn. Đó là một câu hỏi khó hơn cả hai bài đăng ra mắt muốn bạn đặt ra, và đó chính là câu hỏi mà phép so sánh này xoay quanh.
Hai mô hình, đặt cạnh nhau

• Nhà cung cấp — Anthropic so với OpenAI
• Đã phát hành — Claude Opus 5.5 vào ngày 22 tháng 9 năm 2026 so với GPT-5.6 Sol vào ngày 9 tháng 7 năm 2026
• Giá mỗi triệu token — 4,00 USD đầu vào / 20,00 USD đầu ra so với 5,00 USD đầu vào / 30,00 USD đầu ra
• Đọc bộ đệm — 0,20 USD mỗi triệu trên Opus 5.5; mức cache của Sol được đặt riêng theo từng nền tảng và không được công bố ở một con số duy nhất có thể so sánh
• Cửa sổ ngữ cảnh — 1M token trên cả hai
• Đầu ra tối đa — 128K token trên cả hai, với 300K trên Batch API của Anthropic yêu cầu một beta header
• Ngày chốt kiến thức — tháng 6 năm 2026 đối với Opus 5.5 so với ngày 16 tháng 2 năm 2026 đối với Sol
• Kiểm soát suy luận — tư duy thích ứng luôn bật, mặc định trung bình mức nỗ lực, thang điều chỉnh chạy từ thấp đến tối đa so với cài đặt nỗ lực suy luận tối đa cùng chế độ Ultra phối hợp các tác nhân con song song
• Đội hình — Opus 5.5 là thành viên đầu tiên của gia đình 5.5, với Sonnet 5.5 và Haiku 5.5 được hứa hẹn sẽ ra mắt trong những tuần tới, so với Sol là sản phẩm chủ lực của một gia đình ba tầng cùng với Terra và Luna
Hai trong số những hàng đó đảm nhiệm nhiều việc hơn phần còn lại. Khoảng cách về thời điểm cắt kiến thức rộng bốn tháng, điều này quan trọng nếu các câu lệnh của bạn chạm đến bất cứ điều gì đã xảy ra vào mùa xuân này. Và Opus 5.5 giờ đây có giá thấp hơn Sol ở cả giá đầu vào lẫn đầu ra — một sự đảo ngược so với ba tháng trước, khi Sol là cách rẻ hơn để đạt được đầu ra đẳng cấp tiên phong và Claude Opus 5 ở mức $5/$25.
Những hàng duy nhất mà cả hai mô hình thực sự xuất hiện
Chỉ có đúng một bảng được công bố chứa cả hai mô hình, và đó là bảng của Anthropic. Mọi số liệu trong đó đều do nhà cung cấp báo cáo, được đưa ra bởi công ty đang bán một trong hai mô hình:
• Terminal-Bench 4.0 — Claude Opus 5.5 66.4% so với GPT-5.6 Sol 37.3%
• Terminal-Bench-Science 0.1 — 58.7% so với 22.4%
• FrontierCode v1.1 (Chính) — 54,4% so với 47,5%
• CursorBench 4.0 — 57,8% so với 41,7%
• AutomationBench — 40,0% so với 28,8%
• GDPval-AA v2.1 — 1846 Elo so với 1588
Đó là một màn thắng trọn, và các mức chênh lệch ở hai hàng Terminal-Bench đủ lớn để chúng đáng bị soi xét hơn là được chấp nhận ngay. Chú thích của chính Anthropic làm thay bạn một phần việc đó: lần chạy Terminal-Bench của Opus 5.5 đã dùng mức effort xhigh thay vì mặc định, và ở mức effort medium mặc định, lợi thế của FrontierCode thu hẹp còn 54.6% so với 47.5% — một khoảng cách bảy điểm thay vì những con số nổi bật trên tiêu đề. Anthropic cũng gắn một lưu ý chung vào toàn bộ bảng, nói rằng ở mức năng lực này, các chênh lệch trên benchmark là "một chỉ dẫn kém tin cậy hơn cho những khác biệt trong thế giới thực" và rằng khoảng cách nội bộ của hãng với Claude Fable 5.1 hẹp hơn những gì các điểm số gợi ý. Một nhà cung cấp tự đánh giá thấp bảng của chính mình là câu đáng tin cậy nhất trong đó.
Cũng hãy lưu ý những gì bị thiếu khỏi bảng đó: bất kỳ benchmark nào mà mô hình của OpenAI giành chiến thắng. Một bảng của nhà cung cấp chỉ chứa toàn các hàng có lợi không phải là bằng chứng về một sự thắng áp đảo; đó là bằng chứng về việc chọn lọc hàng.
Những con số của chính OpenAI nói lên điều gì
Tài liệu ra mắt của Sol lại kể một câu chuyện khác, trên những benchmark khác, ở một harness khác. Được báo cáo tại buổi ra mắt hồi tháng Bảy của nó:
• Terminal-Bench 2.1 — 91,9% cho Sol Ultra và 88,8% cho Sol tiêu chuẩn, so với Claude Mythos 5 đạt 88,0% và Claude Fable 5 đạt 84,3%
• Artificial Analysis Coding Agent Index — 80, vào thời điểm đó được mô tả là tiên tiến nhất, cao hơn Claude Fable 5 2,8 điểm
• Agents' Last Exam, các quy trình công việc chuyên môn dài hạn — 53.6, mức điểm mà OpenAI báo cáo là cao hơn Claude Fable 5 tới 13.1 điểm
• BrowseComp — 92,2%; OSWorld 2.0 — 62,6%; SWE-Bench Pro — 64,6%
Không hàng nào trong số đó bao gồm Claude Opus 5.5, bởi vì nó chưa tồn tại vào tháng Bảy. Bảng của Sol được xây dựng để đánh bại Fable 5 và Mythos 5, và nó đã làm được điều đó. Việc liệu nó có đánh bại Opus 5.5 hay không đơn giản là không được tài liệu của bên nào trả lời — hai bảng được lập cách nhau hai tháng, nhắm vào những đối thủ khác nhau.
Hàng SWE-Bench Pro đáng được lưu ý riêng, vì đây là chỗ duy nhất trong tài liệu ra mắt của OpenAI cho thấy mô hình của họ thua: 64,6% cho Sol so với 80% cho Claude Fable 5. OpenAI đã phản hồi bằng cách đặt dấu hỏi về tính hợp lệ của benchmark, ước tính rằng khoảng 30% tác vụ của nó bị hỏng. Điều đó rất có thể đúng. Đó cũng là một lời nhắc hữu ích rằng “benchmark này có sai sót” là tuyên bố mà cả hai phòng thí nghiệm đều đưa ra, và luôn là về benchmark nơi họ thua.
Bài toán harness, thứ mà không bảng của ai giải quyết được.

Lý do hai bảng không khớp với nhau không phải là một nhà cung cấp đang nói dối. Mà là các benchmark lập trình tác tử đo một mô hình cộng với một scaffold, và các scaffold thì khác nhau. Terminal-Bench 4.0 và Terminal-Bench 2.1 là những bản sửa đổi khác nhau của cùng một ý tưởng, được chạy bởi những người khác nhau, với ngân sách công cụ khác nhau và quy tắc thử lại khác nhau. Các con số Opus 5.5 của Anthropic được tạo ra trong harness của Anthropic; các con số Sol của OpenAI trong bộ công cụ kiểu Codex. Chuyển một trong hai mô hình sang harness của bên kia và điểm số sẽ thay đổi.
Dữ liệu độc lập, ở những nơi nó tồn tại, cho thấy một cuộc đua sát nút hơn so với cả hai bảng. Một benchmark tác nhân của bên thứ ba từ tháng 8 năm 2026, được chạy trên nhiều mô hình với công việc ứng dụng thực tế, đã xướng tên GPT-5.6 Sol là sự kết hợp tốt nhất giữa độ chính xác, chi phí và tốc độ — khoảng 0,52 USD và năm phút mỗi lần chạy — trong khi Claude Opus 5, không phải 5.5, là mô hình chính xác nhất với 92% số lần chạy. Một bảng xếp hạng riêng bao gồm các tác vụ lập trình doanh nghiệp đã đặt Claude Opus 5 ở vị trí đầu tiên với 96,4%, còn GPT-5.6 Sol đứng thứ ba với 86,5%, một lần nữa so sánh Sol với Opus trước đó thay vì phiên bản mới. Cả hai đều không phải là so sánh đối đầu trực tiếp với Opus 5.5, và cả hai đều không giải quyết được điều gì. Chúng chỉ xác lập rằng khi một bên nào đó không phải nhà cung cấp thực hiện so sánh, thì khoảng cách trở nên nhỏ.
Điểm mấu chốt thực tế là đừng đọc các bảng đó như một bảng xếp hạng nữa, mà hãy đọc chúng như một danh sách các giả thuyết. Nếu công việc của bạn là tự động hóa terminal trong dài hạn, thì khoảng cách của Anthropic trên Terminal-Bench là một giả thuyết đáng để kiểm chứng trên chính các tác vụ của bạn. Nếu đó là nghiên cứu chuyên nghiệp gồm nhiều bước, thì kết quả Agents' Last Exam của Sol cũng là một giả thuyết cùng loại. Không con số nào trong hai con số đó áp dụng được cho khối lượng công việc của bạn nếu không chạy thử.
Chi phí cho mỗi nhiệm vụ đã hoàn thành, đây là chi phí duy nhất thực sự quan trọng
Trên bảng giá, Claude Opus 5.5 giờ đây rẻ hơn ở cả hai chiều: 4,00 USD so với 5,00 USD ở đầu vào, 20,00 USD so với 30,00 USD ở đầu ra, và mức giá đọc bộ nhớ đệm 0,20 USD, thấp hơn 60% so với mức mà Claude Opus 5 tính. Đối với một tác nhân gửi lại một lời nhắc hệ thống dài ở mỗi lượt, dòng chi phí bộ nhớ đệm đó chính là khoản chi phối và là lý do một phiên chạy dài có thể trở nên rẻ hơn đáng kể mà không cần thay đổi lời nhắc nào.
Nhưng giá trên mỗi token chưa bao giờ quyết định hóa đơn của một agent. Lập luận của OpenAI dành cho Sol khi ra mắt dựa trên hiệu quả token chứ không phải giá niêm yết — họ báo cáo mức cải thiện 54% về hiệu quả token khi lập trình, với token đầu ra và thời gian trôi qua chưa bằng một nửa của Claude Fable 5, cùng chi phí thấp hơn khoảng một phần ba. Anthropic đưa ra lập luận ngược lại cho Opus 5.5: chi phí chạy trên các khối lượng công việc điển hình thấp hơn khoảng 40% so với Claude Opus 5, trong khi bảng giá chỉ giảm 20%, với các phát biểu của khách hàng từ Box, Kiro, Factory và GitHub đều dẫn ra mức giảm lớn về token hoặc số bước. Cả hai tuyên bố đều chỉ về cùng một hướng — mô hình hoàn thành trong ít lượt hơn sẽ thắng — và cả hai đều không được kiểm toán độc lập.
Ở những nơi tồn tại phép tính chi phí độc lập trên mỗi tác vụ, nó hiện đang nghiêng về Sol: một phân tích công bố hồi tháng 9 cho thấy GPT-5.6 Sol tốn 1,56 USD cho mỗi issue được giải quyết trên SWE-bench Verified với tỷ lệ thành công 96,2%, so với Claude Opus 4.8 ở mức 88,6%. Đó là Sol được đo với một mô hình Anthropic cũ hơn, không phải với Opus 5.5, nên đây là điểm khởi đầu chứ không phải phán quyết — nhưng nó là lời nhắc rằng một mô hình giải quyết được issue ngay lần thử đầu tiên sẽ rẻ hơn một mô hình rẻ hơn nhưng cần ba lần chạy. Phép đo duy nhất giải quyết được điều này cho bạn chính là tác vụ của bạn, chạy theo cả hai cách, với số token hiển thị trước mặt bạn.
Đó là vấn đề định tuyến nhiều hơn là vấn đề thu mua, và đáng để xác định cho chính xác phần nào của nó đã có thể giải quyết được. GPT-5.6 Sol đã có mặt trên OrcaRouter ngay hôm nay ở đúng mức giá niêm yết của chính OpenAI với 0% phụ phí — giá niêm yết của nhà cung cấp được chuyển thẳng qua, nên khi nhà cung cấp thay đổi mức giá thì phía chúng tôi đã cập nhật ngay trong cùng ngày thay vì phải chờ một lần đồng bộ. Claude Opus 5.5 vẫn chưa phải là một trong các tuyến của chúng tôi; nó hiện có sẵn thông qua API riêng của Anthropic và các đám mây lớn. Khi nó xuất hiện, cùng một khóa sẽ phục vụ cả hai, và đó chính là điều biến thử nghiệm này thành một quy tắc định tuyến thay vì phải có thêm hợp đồng thứ hai và SDK thứ hai: hãy gửi khối lượng công việc đến mô hình mà những con số của chính bạn ủng hộ, giữ chuyển đổi dự phòng tự động hướng vào mô hình còn lại, và để một dòng DSL định tuyến quyết định theo từng yêu cầu thay vì theo từng quý. Việc giảm giá ở bất kỳ bên nào cũng chỉ là một thay đổi cấu hình, chứ không phải một cuộc di trú.

Nơi hai bên thực sự khác nhau
Loại bỏ các tiêu chuẩn so sánh đi, thì còn lại bốn điểm khác biệt, tất cả đều có thể kiểm chứng:
• Thời điểm chốt kiến thức. Tháng 6 năm 2026 đối với Opus 5.5 so với ngày 16 tháng 2 năm 2026 đối với Sol. Bốn tháng là một khoảng cách thực sự đối với bất cứ thứ gì liên quan đến các thư viện gần đây, sự kiện gần đây hoặc các API vừa thay đổi, và không có benchmark nào nắm bắt được điều đó.
• Định tuyến biện pháp bảo vệ. Opus 5.5 được trang bị các biện pháp bảo vệ cùng cấp với Fable 5.1: hầu hết các yêu cầu về an ninh mạng đều được định tuyến lại sang Claude Opus 4.8 và các công việc về sinh học sẽ được chuyển sang Claude Opus 5 trừ khi tài khoản đã được xác minh. Nếu sản phẩm của bạn nằm trong một trong hai lĩnh vực này, một phần lưu lượng của bạn đang được trả lời bởi một mô hình nhỏ hơn. Sol không có định tuyến tương đương nào được ghi nhận, mặc dù OpenAI có đề cập đến các đánh giá an toàn liên quan đến mạng của riêng mình.
• Điều phối. Sol cung cấp chế độ Ultra có khả năng điều phối nhiều tác nhân phụ chạy song song, mặc định là bốn, cùng một thiết lập mức nỗ lực suy luận tối đa. Opus 5.5 không có cả hai như một tính năng nền tảng; đòn bẩy của nó là tham số effort, và việc kết hợp đa mô hình là thứ bạn tự xây dựng hoặc định tuyến chứ không phải thứ nhà cung cấp trao sẵn cho bạn.
• Kinh tế học dòng sản phẩm. Sol là một trong ba bậc, với Terra và Luna ở dưới — và giá của Luna đã bị cắt giảm 80%, còn Terra là 20% trong bản cập nhật ngày 30 tháng 7. Những mô hình anh em rẻ hơn của Anthropic, Sonnet 5.5 và Haiku 5.5, đã được công bố nhưng chưa phát hành. Nếu khối lượng công việc của bạn là hỗn hợp, OpenAI hiện đang cung cấp các bậc rẻ hơn ngay hôm nay.
Lựa chọn giữa chúng
Hãy chọn Claude Opus 5.5 nếu công việc của bạn là coding agentic chạy dài hạn hoặc công việc tri thức, nếu giá trên mỗi token quan trọng, nếu prompt của bạn chạm đến bất cứ thứ gì trong bốn tháng gần đây, hoặc nếu ngữ cảnh 1M token với mức $0.20 cho mỗi triệu token được cache là thứ giúp kiến trúc của bạn có chi phí khả thi. Hãy bắt đầu ở mức medium effort, chứ không phải thiết lập high được kế thừa, và đo xem liệu low có trụ vững không.
Hãy chọn GPT-5.6 Sol nếu bạn muốn một chế độ điều phối được nhà cung cấp đóng gói sẵn, nếu bạn cần một tầng rẻ hơn nằm dưới mẫu flagship ngay hôm nay thay vì phải chờ vài tuần nữa, hoặc nếu khối lượng công việc của bạn thuộc kiểu mà chính bằng chứng ra mắt của Sol bao quát tốt nhất — những quy trình làm việc chuyên nghiệp tầm xa và việc sử dụng máy tính, nơi nó báo cáo những kết quả mạnh nhất.
Nếu bạn đang dùng Claude Opus 5, hãy lưu ý rằng Opus 5.5 không phải là bản thay thế trực tiếp: không thể tắt tính năng thinking nữa, việc buộc sử dụng công cụ sẽ trả về lỗi, các khối thinking bị ràng buộc với mô hình và cuộc hội thoại, và công cụ computer-use cũ hơn computer_20251124 không được chấp nhận trên Claude API hay Google Cloud. Ba điểm đầu tiên cũng áp dụng cho Claude Fable 5.1. Còn chuyển sang Sol là một kiểu tích hợp hoàn toàn khác.
Điều thực sự có thể giải quyết dứt điểm so sánh này là một lần chạy độc lập duy nhất cho cả hai mô hình ở mức nỗ lực tương đương, trong cùng một harness, trên cùng một bộ nhiệm vụ. Tính đến tuần này, chưa ai công bố một kết quả như vậy. Cho đến khi có ai đó làm được, lập trường trung thực là lập trường mà bằng chứng ủng hộ: bảng của Anthropic nghiêng về Opus 5.5 và do Anthropic tạo ra; bảng của OpenAI nghiêng về Sol và do OpenAI tạo ra; các kết quả độc lập hiện có so sánh Sol với Opus thế hệ trước và mô tả một cuộc đua sát nút hơn nhiều; và hai hàng sẽ quyết định hóa đơn của bạn — token trên mỗi nhiệm vụ hoàn thành và khối lượng đọc cache — lại là hai hàng mà cả hai nhà cung cấp đều không công bố.
So sánh trong bài viết này4
Phát hiện từ bài viết này · Benchmark: Artificial Analysis · cập nhật hằng ngày
