
Claude Opus 5.5 dẫn đầu Epoch Capabilities Index với cách biệt 0,84 điểm
- openaiMỚIOpenAI: GPT-6.1 Sol2026-09-2952Trí tuệ
- anthropicMỚIAnthropic: Claude Sonnet 5.52026-09-2856Trí tuệ
- typesafeMỚITypeSafe: Jev 1.132026-09-24$0.04 / $0.00 trên 1 triệu token · 221 tok/s
- OpenAIMỚIOpenAI: GPT-6 Luna2026-09-2238Trí tuệ
- OpenAIMỚIOpenAI: GPT-6 Sol2026-09-2248Trí tuệ
- AnthropicMỚIAnthropic: Claude Opus 5.52026-09-2258Trí tuệ
- xAIMỚIGrok 4.72026-09-2146Trí tuệ
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 trên 1 triệu token · 106 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 trên 1 triệu token · 1148 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Trí tuệ
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Trí tuệ77Lập trình
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Trí tuệ76Lập trình
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Trí tuệ76Lập trình
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Trí tuệ82Lập trình
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 trên 1 triệu token · 48 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 trên 1 triệu token · 104 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Trí tuệ72Lập trình
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 trên 1 triệu token · 214 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Trí tuệ75Lập trình
- obsidianQwen3.8 27B2026-08-1534Trí tuệ68Lập trình
Con số là 0.84. Claude Opus 5.5đứng ở mức 167.35 trên Epoch Capabilities Index tính đến tệp mà chúng tôi đọc ngày 2 tháng 10 năm 2026, với GPT-6 Astraở mức 166.51 — khoảng cách chưa đầy một điểm trên thang đo mà các khoảng tin cậy 95% đã công bố của hai mô hình gần như trùng khớp hoàn toàn, 164.0 đến 172.0 đối với Opus 5.5 so với 163.14 đến 171.05 đối với Astra. Bên dưới chúng, Claude Sonnet 5.5đạt 165.2 và Claude Fable 5.1đạt 164.82, nên bốn mục đứng đầu trên một tổ hợp độc lập gồm hơn năm mươi phép đánh giá chỉ cách nhau 2.53 điểm và ba trong số đó mang tên cùng một nhà cung cấp. Thứ tự này là thật theo nghĩa các ước lượng điểm được sắp xếp theo thứ tự. Nó không thật theo nghĩa một lợi thế 0.84 điểm vẫn trụ được qua chính các thanh sai số của nó, và mọi điều đáng nói về bảng xếp hạng này đều suy ra từ việc cùng lúc nắm giữ cả hai sự thật đó.
Chỉ số là gì, và 0,84 điểm không phải là gì
Epoch Capabilities Index không phải là bảng điểm của nhà cung cấp. Nó được Epoch AI, một tổ chức nghiên cứu độc lập, xây dựng như một chỉ số tổng hợp, kết nối điểm số từ hơn năm mươi benchmark riêng biệt thành một thang đo năng lực tổng quát, suy ra độ khó tương đối của từng benchmark từ những mô hình tình cờ xuất hiện trên nhiều benchmark trong số đó cùng lúc. Phương pháp luận được trình bày trong một bài báo viết cùng các nhà nghiên cứu từ nhóm AGI Safety & Alignment của Google DeepMind và do DeepMind tài trợ, nhưng Epoch nói rõ rằng chỉ số này là sản phẩm của chính mình và mình nắm toàn quyền đối với nó — một khác biệt đáng lưu giữ khi nguồn tài trợ và đơn vị công bố một điểm số không phải cùng một bên. Mã nguồn là công khai.
Hai thuộc tính của thang đo quan trọng hơn tiêu đề. Thứ nhất, ECI được neo một cách có chủ đích thay vì mang tính tuyệt đối: điểm thô được đổi thang để Claude 3.5 Sonnet nằm ở 130 và GPT-5 ở 150, nghĩa là một con số trên chỉ số này chỉ có ý nghĩa khi đặt cạnh một con số khác từ cùng tệp, chứ không bao giờ đứng một mình. Thứ hai, chỉ số này không có mức trần. Không có mốc 100 để tiến tới, nên "đứng đầu chỉ số" là một phát biểu về một thời điểm, không phải về một giới hạn mà bất kỳ ai đã đạt tới.
Đó là lý do vì sao cách đọc trung thực của 167.35 so với 166.51 không phải là "Claude Opus 5.5 là mô hình có năng lực nhất trên thế giới." Nó hẹp hơn và ít dễ trích dẫn hơn: theo cách mô hình hóa của Epoch đối với bằng chứng sẵn có vào ngày 2 tháng 10 năm 2026, hai mô hình không thể phân biệt được ở vị trí dẫn đầu, và thứ tự giữa chúng là một yếu tố phân định hơn thua chứ không phải một phép đo. Các khoảng được công bố nói điều đó một cách trực tiếp — 164.0 đến 172.0 và 163.14 đến 171.05 trùng nhau ở phần lớn phạm vi của chúng. Bất kỳ ai trích dẫn 0.84 như một phán quyết đều đang trích dẫn một hệ quả của việc làm tròn.
Khối Anthropic, và kích thước của một bản phát hành
Điểm đáng chú ý mang tính thông tin hơn trong bảng không phải là ai đứng đầu. Mà là hàng thứ ba và thứ tư. Claude Sonnet 5.5, ra mắt ngày 28 tháng 9 và đạt 165,2 điểm, nằm cao hơn Claude Fable 5.1, ra mắt ngày 1 tháng 9 với 164,82 điểm, 0,38 điểm — đủ gần để trên thực tế hai mô hình ở cùng một vị trí, và đủ gần để cặp đôi này chỉ nằm dưới đỉnh bảng 2,15 điểm. Sonnet là sản phẩm tầm trung trong dòng sản phẩm của Anthropic và Fable là mô hình mà công ty từ trước đến nay vẫn hướng tới cho các công việc suy luận tổng quát; việc cả hai giờ đây cùng kẹp lấy đường biên tiên phong từ ngay bên dưới chính là thay đổi thực chất trong lần cập nhật này, hơn là danh tính của người dẫn đầu.
Bước tiến thế hệ của chính Anthropic cũng đã hiện rõ. Claude Opus 5.5 là phiên bản kế nhiệm Claude Opus 5, mẫu mà Epoch chấm 162,94 điểm với khoảng từ 160,2 đến 166,7. Đó là mức cải thiện 4,41 điểm trong khoảng hai tháng, từ bản phát hành ngày 24 tháng 7 đến bản ngày 22 tháng 9 — một bước dịch chuyển lớn hơn mức 0,84 điểm đang chia tách vị trí thứ nhất và thứ hai hiện nay. Hiểu theo cách đó, đại lượng đáng chú ý trong bảng này là độ dốc bên trong đường của một nhà cung cấp duy nhất, chứ không phải khoảng cách giữa hai nhà cung cấp ở vị trí dẫn đầu.
Nơi ranh giới open-weights được vạch ra
Epoch phân tách các mô hình theo khả năng truy cập, giúp ranh giới trọng số mở trở nên rõ ràng mà không cần phải đoán. Mục trọng số mở tốt nhất là Kimi K3 với 157,61, ngày 16 tháng 7 và được dán nhãn phi thương mại. Phía sau là DeepSeek V4 Pro 0813 với 155,38 và DeepSeek V4.1 Flash với 155,0, cả hai đều không bị hạn chế, rồi GLM-5.3-Flash với 151,94 và GLM-5.2 với 151,78. Do đó, mô hình mở gần nhất với vị trí đầu bảng kém 9,74 điểm — một khoảng cách rộng gấp mười tám lần khoảng cách giữa vị trí thứ nhất và thứ hai, và đủ rộng để các khoảng không hề tiệm cận nhau.
Sự bất đối xứng đó là phát hiện bền vững duy nhất trong bảng. Biên giới đóng là một cuộc chen chúc trong vòng ba điểm; khoảng cách từ biên giới đóng đến các trọng số tốt nhất có thể tải xuống lớn hơn một bậc độ lớn. Một chỉ số tổng hợp cho phép bạn so sánh qua các thế hệ benchmark chính là công cụ để nhận ra điều đó, bởi vì nó có thể nói cùng một điều vào tháng Bảy và tháng Chín thay vì báo cáo rằng một benchmark đang bão hòa đã trở nên im ắng.
Một số hàng gần đó đáng được ghim lại để làm ngữ cảnh, vì chúng là những mô hình mà độc giả thực sự cân nhắc so với Opus 5.5:
• Claude Sonnet 5 — 156.34, phát hành ngày 30 tháng 6, khoảng 153.61 đến 158.81
• Grok 4.6 — 156,61, phát hành ngày 12 tháng 8, khoảng tin cậy từ 154,66 đến 158,93
• Gemini 3.8 Flash — 156.93, phát hành ngày 2 tháng 9, khoảng tin cậy từ 154.64 đến 160.42
• Muse Spark 1.3 — 156,86, phát hành ngày 2 tháng 9, khoảng từ 154,73 đến 159,56
• GPT-5.6 Sol — 161,8, phát hành ngày 9 tháng 7, khoảng từ 159,26 đến 165,26
Vị trí chỉ mục không phải là hóa đơn

Ở đây, bảng xếp hạng không còn kể hết toàn bộ câu chuyện, bởi vì hai mô hình đứng đầu không hề có mức giá gần giống nhau. Từ danh mục của chính chúng tôi, nơi cung cấp cả hai theo giá niêm yết của nhà cung cấp mà không cộng thêm, Claude Opus 5.5 ở mức $4.00/$20.00 với $0.20 cho mỗi lần đọc cache và GPT-6 Astra ở mức $10.00/$50.00 với $1.00 cho mỗi lần đọc cache chênh nhau 2,5 lần ở cả hai chiều của bảng giá. Astra còn tăng bậc khi vượt 272.000 token gợi ý, khi đó đầu vào lên $20.00 và đầu ra lên $75.00; Opus 5.5 giữ mức $4.00/$20.00 cố định trong toàn bộ cửa sổ 1 triệu token. Cả hai đều phục vụ 128.000 token đầu ra.
Hãy thử làm phép tính mà một khối lượng công việc ngữ cảnh dài thực sự phát sinh — tiền tố 180.000 token được phục vụ từ bộ nhớ đệm, 5.000 token được tạo ra. Trên Opus 5.5, đó là 180.000 token với 0,20 đô-la mỗi triệu token, tức khoảng 3,6 xu, cộng thêm 5.000 token với 20 đô-la mỗi triệu, tức 10 xu: tổng khoảng 13,6 xu. Trên GPT-6 Astra, đó là 180.000 token với 1,00 đô-la, tức 18 xu, cộng thêm 5.000 token với 50 đô-la, tức 25 xu: tổng khoảng 43 xu. Một lợi thế 0,84 điểm và một khoảng cách chi phí gấp 3,2 lần không phải là cùng một loại sự thật, và một quyết định mua sắm chỉ cân nhắc yếu tố đầu tiên là đã cân nhắc con số nhỏ hơn.
Fable 5.1 làm rõ điều đó từ phía bên kia của bảng giá cùng một nhà cung cấp: ở mức $10.00/$50.00, nó được định giá đúng như Astra, và đạt 164,82 — thấp hơn Opus 5.5 2,53 điểm với cùng số tiền. Chỉ số này đặt ba mô hình tiên phong của Anthropic cách nhau trong vòng 2,53 điểm, còn bảng giá của hãng đặt chúng cách xa nhau 2,5 lần; đó là cách mô tả lựa chọn trước mặt người mua tốt hơn nhiều so với bất kỳ bảng xếp hạng đơn lẻ nào.
Nếu bạn định tranh cãi về một con số, hãy tranh cãi trên traffic của chính bạn.

Lý do chỉ số này đáng đọc đến vậy là nó được đo bởi một bên nào đó không phải các nhà cung cấp — nhưng chính cấu trúc của chỉ số tổng hợp lại đặt ra các điều khoản của cuộc tranh luận. Việc hiệu chỉnh của Epoch, các ước tính độ khó và cách nó xử lý những mô hình bỏ qua các benchmark đều nằm ở thượng nguồn của con số trong bảng, và không điều nào trong số đó là thứ mà người đọc có thể tự suy ra lại từ một ảnh chụp màn hình. Điều tương tự cũng đúng với benchmark tiêu đề của mọi nhà cung cấp, đó là lý do vì sao động thái hữu ích không phải là chọn phe giữa chúng mà là so sánh chúng trên lưu lượng mà bạn kiểm soát.
Cả hai mô hình này đều có thể truy cập được từ một API key duy nhất trên OrcaRouter, dịch vụ chuyển tiếp nguyên giá niêm yết của nhà cung cấp với mức phụ phí 0%: Claude Opus 5.5 ở mức $4.00/$20.00 với $0.20 cho mỗi lần đọc cache và GPT-6 Astra ở mức $10.00/$50.00 với bậc trên 272K của nó được áp dụng đúng như nhà cung cấp quy định. Gửi cùng một bộ prompt đến cả hai chỉ là thay đổi cấu hình chứ không phải một hợp đồng thứ hai, và ở những nơi cả hai đều được định tuyến, chuyển đổi dự phòng tự động nằm bên dưới, điều này quan trọng đối với một quyết định sát mức nhiễu nền đến vậy. Bảng xếp hạng có thể cho bạn biết hai mô hình là không thể phân biệt được. Chỉ có eval của riêng bạn mới có thể cho bạn biết mô hình nào là không thể phân biệt được trong công việc của bạn.

Điều gì sẽ khiến con số này thay đổi vào tháng tới?
Hồ sơ của Epoch là một hồ sơ sống, và ba điều sẽ nhanh chóng thay đổi cách diễn giải. Đầu tiên là bất kỳ đánh giá mới nào về một mô hình tiên phong lọt vào top 4, vì một quan sát benchmark bổ sung duy nhất sẽ làm thay đổi điểm tổng hợp nhiều hơn khi cụm này chặt đến vậy so với khi có một mô hình dẫn đầu rõ ràng. Điều thứ hai là sự dịch chuyển của các khoảng tin cậy — những mục gần đây nhất mang các khoảng rộng nhất, vì chúng được đánh giá trên ít benchmark trùng lặp nhất, nên các bản phát hành tháng Chín là những hàng dễ thay đổi nhất còn tháng Bảy là ít nhất. Điều thứ ba là một benchmark đạt đến độ bão hòa, đây chính là kiểu thất bại cụ thể mà chỉ số được xây dựng để chống chịu: khi một thành phần ngừng phân biệt, Epoch tái cân trọng số thành phần thay vì để lợi thế của một mô hình tan biến theo bài kiểm tra.
Hiện tại, bản tóm tắt có thể biện minh được là bản hẹp. Claude Opus 5.5 giữ vị trí dẫn đầu trên Epoch Capabilities Index ở mức 167,35 nhờ mức chênh lệch 0,84 điểm mà khoảng tin cậy của chính nó không hậu thuẫn, Claude Sonnet 5.5 đã vươn lên đến trong vòng 2,15 điểm so với ngôi đầu từ tầng trung của cùng dòng, và nhóm open-weights đang kém tất cả họ hơn chín điểm. Vị trí dẫn đầu là một canh bạc 50/50 giữa hai nhà cung cấp. Còn khoảng cách bốn điểm về giá giữa họ thì không phải thế.
So sánh trong bài viết này4
Phát hiện từ bài viết này · Benchmark: Artificial Analysis · cập nhật hằng ngày
