
GPT-6.1 Sol vs Claude Opus 5.5: Một khoảng cách thực sự, phân bố không đồng đều
- openaiMỚIOpenAI: GPT-6.1 Sol2026-09-2952Trí tuệ
- anthropicMỚIAnthropic: Claude Sonnet 5.52026-09-2856Trí tuệ
- typesafeMỚITypeSafe: Jev 1.132026-09-24$0.04 / $0.00 trên 1 triệu token · 141 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238Trí tuệ
- OpenAIOpenAI: GPT-6 Sol2026-09-2248Trí tuệ
- AnthropicAnthropic: Claude Opus 5.52026-09-2258Trí tuệ
- xAIGrok 4.72026-09-2146Trí tuệ
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 trên 1 triệu token · 79 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 trên 1 triệu token · 320 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Trí tuệ
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Trí tuệ77Lập trình
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Trí tuệ76Lập trình
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Trí tuệ76Lập trình
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Trí tuệ82Lập trình
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 trên 1 triệu token · 54 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 trên 1 triệu token · 294 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Trí tuệ72Lập trình
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 trên 1 triệu token · 231 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Trí tuệ75Lập trình
- obsidianQwen3.8 27B2026-08-1534Trí tuệ68Lập trình
Khoảng cách 5,8 điểm giữa Claude Opus 5.5 và GPT-6.1 Sol trên Artificial Analysis Intelligence Index là khoảng cách lớn nhất trong bất kỳ cặp nào thuộc nhóm này, và khác với hầu hết các cặp khác, nó sẽ không thu hẹp lại chỉ bằng một thay đổi cài đặt. Claude Opus 5.5, ra mắt ngày 22 tháng 9 năm 2026 và có giá 4,00 USD cho mỗi triệu token đầu vào và 20,00 USD cho mỗi triệu token đầu ra, đạt 57,6 điểm. GPT-6.1 Sol, ra mắt ngày 29 tháng 9 năm 2026 với giá 2,00 và 10,00 USD, đạt 51,8 điểm. Claude Opus 5.5 là mô hình đạt điểm cao hơn với mức chênh lệch lớn hơn mức chênh lệch phân tách phần lớn các mô hình tiên tiến với nhau, và chi phí cho mỗi tác vụ để đạt được điều đó cao hơn 8,3 lần — 5,98 USD so với 0,72 USD. Cho đến nay, mô hình đắt tiền đơn giản là đang thắng, đây là phiên bản kém thú vị nhất của so sánh này. Điều khiến nó đáng đọc là 5,8 điểm không được trải đều khắp bộ đánh giá: trên trục duy nhất quyết định phần lớn công việc với tài liệu dài và phiên làm việc dài, hai mô hình chỉ cách nhau trong vòng hai điểm.
Cả hai đều là những mô hình chủ lực trong cùng phân khúc thị trường: cửa sổ ngữ cảnh cấp 1M, giới hạn đầu ra 128K, đầu vào văn bản, hình ảnh và tệp, suy nghĩ mở rộng ở một bên và thang nỗ lực năm cấp độ ở bên kia. Claude Opus 5.5 kế nhiệm Claude Opus 5 và được định vị cho các tác vụ suy luận, lập trình và công việc agentic dài hạn đòi hỏi cao; GPT-6.1 Sol nằm ở một bậc dưới GPT-6 Astra và được định vị cho lập trình agentic, sử dụng máy tính và công việc chuyên môn nặng về tài liệu. Chúng nhắm đến cùng những công việc. Kết quả đo lường cho thấy chúng không giỏi như nhau ở tất cả những công việc đó.
5.8 điểm thực sự nằm ở đâu
Một chỉ số tổng hợp sẽ che giấu các thành phần của nó. Kéo riêng các đánh giá thành phần ra, khoảng cách sẽ không còn trông như một khoảng cách nữa mà bắt đầu trông như một hồ sơ.
• Humanity's Last Exam — Claude Opus 5.5 61,4% so với GPT-6.1 Sol 52,9%, chênh lệch 8,5 điểm về suy luận trừu tượng
• SciCode — Claude Opus 5.5 đạt 66,9% so với GPT-6.1 Sol đạt 54,2%, mức chênh lệch 12,7 điểm trên mã đạt chuẩn nghiên cứu
• Khả năng ghi nhớ ngữ cảnh dài — Claude Opus 5.5 đạt 84,7% so với 83,0% của GPT-6.1 Sol, chênh lệch 1,7 điểm khi truy xuất thông tin từ một đầu vào dài
• Terminal-Bench 4.0 — Claude Opus 5.5 59,6% so với con số của Sol không được công bố ở cùng phiên bản
• Cửa sổ ngữ cảnh — GPT-6.1 Sol 1.050.000 token so với Claude Opus 5.5 1.000.000 token, với giới hạn đầu ra 128.000 token ở cả hai
• Chi phí cho mỗi tác vụ lập chỉ mục — Claude Opus 5.5 $5.98 so với GPT-6.1 Sol $0.72
Điều đáng nói nằm ở phân bố. Khi nhiệm vụ là suy luận trừu tượng — một câu hỏi thi khó, một bài toán lập trình cấp nghiên cứu không có đáp án sẵn để chép — Claude Opus 5.5 vượt trội một cách dứt khoát, và khoảng cách 12,7 điểm trên SciCode không phải là nhiễu. Còn khi nhiệm vụ là tìm đúng đoạn trong một đầu vào rất dài và sử dụng nó, hai mô hình thực tế ngang bằng nhau, và GPT-6.1 Sol đang giữ vị trí đó với dung lượng lớn hơn 50.000 token. Một phần lớn công việc LLM trong sản xuất là loại thứ hai: trả lời tăng cường truy xuất, rà soát hợp đồng và hồ sơ, phân tích log và bản ghi, đánh giá mã trên một kho mã lớn. Công việc đó được đo bằng gạch đầu dòng thứ ba, không phải hai gạch đầu dòng đầu tiên, và ở gạch đầu dòng đó, gói cao cấp chỉ mang lại 1,7 điểm.
Đọc trung thực các hàng chỉ mục
Hai lưu ý nên được đặt ngay cạnh những con số đó thay vì ở cuối trang.
Các cấu hình khác nhau. Artificial Analysis đưa Claude Opus 5.5 lên biểu đồ ở cấu hình "Max, Default Fallback" và GPT-6.1 Sol ở mức nỗ lực tối đa. Cả hai đều là những thiết lập mạnh nhất mà mỗi mô hình được công bố với, điều này khiến việc so sánh trở nên công bằng, nhưng đó là so sánh giữa hai mức trần chứ không phải hai mặc định khi phát hành. Mặc định của chính Claude Opus 5.5 trong một API được host có thể khác với lần chạy được đưa lên biểu đồ, còn mức nỗ lực mặc định của GPT-6.1 Sol là medium.
Hàng Terminal-Bench được cố ý để trống ở một bên. Con số 59,6% của Claude Opus 5.5 đến từ bản sửa đổi Artificial Analysis mà trong đó nó được công bố; con số tương đương dành cho GPT-6.1 Sol không có sẵn ở một bản sửa đổi khớp tương ứng. Trích dẫn một con số từ một lần chạy khác của cùng một benchmark sẽ là một so sánh sai lệch, và cách làm trung thực là để ô đó trống thay vì lấp đầy nó bằng một thứ gì đó gần đúng.
Độ dài dòng ở đây cũng tác động theo cùng một hướng như khi so với các mô hình anh em rẻ hơn: Claude Opus 5.5 phát ra 260M token đầu ra trên index suite, so với 67M của GPT-6.1 Sol — chênh lệch 3,9× ở mức giá vốn đã cao gấp đôi. Đó là nguồn gốc của tỷ lệ 8,3× trên mỗi tác vụ khi bảng giá cho thấy 2× ở đầu vào và 2× ở đầu ra. Mức phụ trội không phải là 8,3× vì mô hình tốn 8,3× — mà là 8,3× vì nó tốn 2× và suy nghĩ lâu gấp 3,9 lần.
Lập luận ủng hộ việc trả nó
Nếu công việc của bạn giống với hai gạch đầu dòng đầu tiên, phép tính rất đơn giản và nó nghiêng về Claude Opus 5.5. Khoảng cách 12,7 điểm trên mã khoa học cấp nghiên cứu, hoặc 8,5 điểm trong lập luận trừu tượng khó, là sự khác biệt giữa một tác nhân có thể đóng một ticket mà không cần người giám sát và một tác nhân cần con người can thiệp ở mỗi bước thứ ba. Lập trình tác nhân trên một cơ sở mã lớn là khối lượng công việc mà cả hai nhà cung cấp đều kể đến đầu tiên, và đó là khối lượng công việc có mức chênh lệch rộng nhất. Việc trả $5,98 thay vì $0,72 mỗi tác vụ để tránh một lần chạy thất bại khiến một kỹ sư tốn hai mươi phút không phải là một lựa chọn sít sao.
Có một lập luận thứ hai hoàn toàn không liên quan đến điểm số. Claude Opus 5.5 mới ra đời được mười lăm ngày và đã tạo ra một khối lượng đánh giá, phản hồi và kinh nghiệm triển khai từ bên thứ ba mà một mô hình mới tám ngày tuổi không thể có được. Đối với con đường đưa vào sản xuất, độ chín muồi của nền kiến thức xung quanh có một giá trị mà chỉ số không định giá được.
Lập luận chống lại, và con số định đoạt điều đó
Phản biện nằm ở hàng ngữ cảnh dài. Nếu hình dạng chủ đạo của lưu lượng truy cập của bạn là “đầu vào lớn, câu trả lời ngắn” — và với rất nhiều nhóm, đúng là như vậy — thì trục mà bạn đang bị tính phí không phải là trục mà bạn tiêu thụ. Ở bài toán truy hồi ngữ cảnh dài, hai mô hình cách nhau 1,7 điểm với tỷ lệ giá 8,3×, và mô hình rẻ hơn lại có cửa sổ lớn hơn. Đó là trường hợp mà khoản phụ trội là có thật, được đo lường, và được chi cho năng lực mà khối lượng công việc chưa bao giờ dùng đến.
Vậy thì con số quyết định không phải là chỉ số. Mà là tỷ lệ các tác vụ của bạn trông giống SciCode hơn là giống recall. Những nhóm có thể trả lời câu hỏi đó từ log của chính mình thì nên trả lời nó từ log của chính mình; một bộ benchmark chỉ là đại diện thay thế cho một tổ hợp công việc, và chính tổ hợp đó mới là biến số.
Cả hai đều trên một phím, đó là điều khiến câu hỏi có thể trả lời được.


Claude Opus 5.5 có trên OrcaRouter với mức giá riêng $4.00 / $20.00, đọc cache ở mức $0.20. GPT-6.1 Sol có trên OrcaRouter ở mức $2.00 / $10.00, tăng lên $4.00 / $15.00 khi vượt quá 272.000 token prompt, với đọc cache ở mức $0.10. Cả hai đều theo giá niêm yết của nhà cung cấp, không cộng thêm gì, trên một key và một hóa đơn.
Điều đó quan trọng hơn mức thông thường đối với cặp mô hình này, bởi vì hai mô hình không phải là thứ thay thế cho nhau — chúng là một quyết định định tuyến. Hãy gửi công việc tài liệu dài và khối lượng lớn đến GPT-6.1 Sol, giữ công việc suy luận khó và sửa đổi mã trên Claude Opus 5.5, và cả hai cùng nằm sau một endpoint với cùng thông tin xác thực. Nếu một tuyến bị suy giảm, cơ chế chuyển đổi dự phòng tự động sẽ chuyển cuộc gọi thay vì làm nó thất bại, và vì định tuyến mang tính khai báo, nó có thể được biểu đạt theo từng lớp tác vụ thay vì theo từng ứng dụng. Việc kiểm thử cách phân tách này là một thay đổi cấu hình, không phải một cuộc di trú.
Điều cuối cùng đáng nói là về thời hạn sử dụng của so sánh này. Cả hai mô hình mới chỉ vài ngày hoặc vài tuần tuổi. GPT-6.1 Sol có một cấu hình độc lập được công bố; Claude Opus 5.5 cũng có một. Một lần chạy duy nhất cho mỗi mô hình chỉ là một ảnh chụp nhanh, và kiểu thất bại đáng chú ý không phải là một trong những con số này sai — mà là một cấu hình nỗ lực trung bình, hoặc một bên đánh giá thứ hai, vẽ lại hồ sơ. Cho đến lúc đó, cách lý giải có thể biện minh được là cách mà các thành phần đưa ra: một khoảng cách quyết định ở suy luận khó và mã nghiên cứu, một khoảng cách nhỏ ở công việc ngữ cảnh dài, và một hóa đơn gấp 8,3× phải được biện minh bằng phần khối lượng công việc của bạn giống với phần trước.

So sánh trong bài viết này1
Phát hiện từ bài viết này · Benchmark: Artificial Analysis · cập nhật hằng ngày
