Một thẻ tiêu đề được tạo có tiêu đề 'mức 165', với phụ đề 'Epoch Capabilities Index, tệp ngày 1 tháng 10 năm 2026', ba thẻ số liệu hiển thị 165 (Claude Sonnet 5.5), 165 (Claude Fable 5.1) và 11 so với 20 (các đánh giá chuẩn đằng sau mỗi con số), và logo OrcaRouter ở góc dưới cùng bên phải.
Guides & Insights

Claude Sonnet 5.5 ngang bằng với Claude Fable 5.1 trên Epoch Capabilities Index

Tác giả

Magnus Corvin

Ngày đăng

Mô hình mới nhất · 20Xem tất cả mô hình →
Benchmark: Artificial Analysis · cập nhật hằng ngày
Quay lại tất cả bài viết

Đồng hạng ở vị trí dẫn đầu một bảng xếp hạng thường là điều kém thú vị nhất trên đó. Lần này là ngoại lệ, bởi hai mô hình cùng đứng đầu không có cùng mức giá. Trong tệp Epoch Capabilities Index cập nhật ngày 1 tháng 10 năm 2026, Claude Sonnet 5.5 và Claude Fable 5.1 đều đạt 165 — hàng thứ ba và thứ tư trong số 253 mô hình được theo dõi — kém hai điểm so với Claude Opus 5.5 và GPT-6 Astra, hai mô hình này cũng đồng hạng ở mức 167, và hơn hai điểm so với Claude Opus 5 ở mức 163. Claude Sonnet 5.5 ra mắt ngày 28 tháng 9 năm 2026 với giá 2 đô-la mỗi triệu token đầu vào và 10 đô-la mỗi triệu token đầu ra. Claude Fable 5.1 ra mắt ngày 1 tháng 9 với giá 10 và 50 đô-la. Một con số duy nhất cho thấy hai mô hình có thể thay thế cho nhau về năng lực tổng quát. Mức giá đầu ra gấp năm lần cho thấy chúng thì không. Cả hai đều đứng vững, và lý do chúng cùng đứng vững nằm ở phần của bảng mà chẳng ai nhắc tới.

Chỉ số thực sự là gì, và ai là người đo lường

ECI không phải là bảng điểm của nhà cung cấp. Nó được xây dựng bởi Epoch AI, một tổ chức nghiên cứu độc lập, dưới dạng một chỉ số tổng hợp, khâu nối điểm số từ hơn năm mươi bộ đánh giá riêng biệt thành một thang đo năng lực tổng quát, suy ra độ khó tương đối của từng bộ đánh giá từ những mô hình tình cờ xuất hiện trên nhiều bộ trong số đó cùng lúc. Phương pháp luận được trình bày trong một bài báo, “A Rosetta Stone for AI Benchmarks”, do Go​ogle DeepMind tài trợ và được viết cùng các nhà nghiên cứu thuộc nhóm An toàn & Căn chỉnh AGI của họ — nhưng Epoch nói rõ rằng chỉ số này là sản phẩm của riêng mình và mình nắm toàn quyền đối với nó, còn mã fitting thì công khai. Sự phân biệt đó có ý nghĩa khi bên tài trợ cho nghiên cứu và bên công bố điểm số không phải là cùng một bên.

Hai đặc tính của thang đo quyết định cách đọc một con số trên đó. Thứ nhất là ECI được neo lại chứ không tuyệt đối: các giá trị thô được đổi tỷ lệ sao cho Claude 3.5 Sonnet nằm ở 130 và GPT-5 ở 150, nghĩa là một con số chỉ có ý nghĩa khi đặt cạnh một con số khác từ cùng tệp. Thứ hai là không có trần. Không có mốc 100 để tiến tới, nên “đỉnh của chỉ số” là phát biểu về một thời điểm chứ không phải về giới hạn mà bất kỳ ai đã đạt tới.

Thuộc tính thứ ba chính là thuộc tính biến một thế hòa thành một câu chuyện. Các khoảng được công bố bên cạnh mỗi điểm số — khoảng bootstrap 90%, được xây dựng bằng cách lấy mẫu lại kết quả benchmark quan sát được của chính mỗi mô hình năm trăm lần — là giống hệt nhau đối với hai mô hình ở mức 165: 162 đến 169 đối với Claude Sonnet 5.5 và 162 đến 169 đối với Claude Fable 5.1. Nhưng số lượng mẫu tạo ra chúng thì không. Con số 165 của Claude Sonnet 5.5 được ước lượng từ 11 đánh giá benchmark. Còn con số của Claude Fable 5.1 được ước lượng từ 20.

Vì sao cùng một khoảng không có nghĩa là cùng một bằng chứng

ECI cần tối thiểu bốn đánh giá chuẩn trước khi một mô hình được cho điểm, vì vậy cả hai con số đều vượt ngưỡng tối thiểu một cách thoải mái. Nhưng khoảng tin cậy là một phát biểu về mức độ phân tán của chính kết quả của một mô hình, không phải về số lượng kết quả — đó là lý do hai mô hình có thể in cùng một dải quanh cùng một ước lượng điểm trong khi một trong hai chỉ đang dựa trên lượng bằng chứng bằng khoảng một nửa. Hãy coi hai con số 165 là chắc chắn như nhau, và bạn đã đọc khoảng tin cậy như thể nó là một hiệu chỉnh theo cỡ mẫu, trong khi thực tế không phải vậy.

Sự bất đối xứng này có một hệ quả thực tiễn về thời điểm. Epoch tái khớp toàn bộ mô hình một cách đồng thời trên tất cả dữ liệu mỗi khi có đánh giá mới, nên con số của một mô hình có thể thay đổi dù bản thân mô hình đó không có gì thay đổi. Mô hình mang 11 quan sát có nhiều dư địa để thay đổi hơn mô hình mang 20 quan sát, khiến Claude Sonnet 5.5 trở thành cái có khả năng dịch chuyển cao hơn trong lần cập nhật tiếp theo — theo cả hai chiều.

Cách Epoch tự diễn giải kết quả đánh giá hiện tại thì hẹp hơn so với những tiêu đề mà nó tạo ra. Bản tóm tắt của tổ chức về bản cập nhật mở đầu bằng việc Claude Opus 5.5 chiếm vị trí dẫn đầu với 167 điểm, chỉ nhỉnh hơn GPT-6 Astra một chút, và dành câu thứ hai cho việc Claude Sonnet 5.5 đã “gần như ngang bằng” Claude Fable 5.1 ở mức 165. “Gần như ngang bằng” là cụm từ mấu chốt, và các khoảng được công bố chính là lý do khiến đây là cách diễn đạt đúng.

Nơi {{1}}hai điều đó phân kỳ{{/1}}

A two-column comparison scoreboard titled 'Claude Sonnet 5.5 vs Claude Fable 5.1 - the scoreboard'. Left column 'Claude Sonnet 5.5': rows reading 'ECI: 165', 'Interval: 162-169', 'Benchmarks: 11', 'Mystery Game Puzzles: 65%', 'Furniture Assembly: 75%', 'Price: $2 / $10'. Right column 'Claude Fable 5.1': rows reading 'ECI: 165', 'Interval: 162-169', 'Benchmarks: 20', 'Mystery Game Puzzles: 58%', 'Furniture Assembly: 70%', 'Price: $10 / $50'. A footer line reads 'Epoch Capabilities Index, file updated 1 October 2026; prices per the vendors' own rate cards.'

Điểm ở mức tổng hợp không có nghĩa là điểm ở mức từng phần. Epoch công bố một bảng riêng theo từng benchmark trên mỗi trang model, và có sáu benchmark xuất hiện trên cả trang Claude Sonnet 5.5 lẫn trang Claude Fable 5.1 — khiến đó trở thành sáu benchmark duy nhất có thể so sánh ngang hàng ngay từ chính chỉ mục.

• Câu đố trò chơi bí ẩn — Claude Sonnet 5.5 65% so với Claude Fable 5.1 58%

• FrontierMath Bậc 1–3 (v2) — Claude Sonnet 5.5 89% so với Claude Fable 5.1 90%

• FrontierMath Tier 4 (v2) — Claude Sonnet 5.5 80% so với Claude Fable 5.1 88%

• OTIS Mock AIME 2024–2025 — Claude Sonnet 5.5 100% so với Claude Fable 5.1 100%

• Điểm chuẩn Lắp ráp Đồ nội thất — Claude Sonnet 5.5 75% so với Claude Fable 5.1 70%

• SimpleQA Verified — Claude Sonnet 5.5 47% so với Claude Fable 5.1 71%

Bốn điểm xê dịch theo cả hai hướng trên một chỉ số tổng hợp chật chội như thế này, và sự phân tách bên dưới không hề gần với đối xứng. Claude Sonnet 5.5 dẫn trước ở những công việc mang tính trò chơi và đa phương thức — giải đố, lắp ráp vật lý — và ngang bằng ở toán thi đấu. Claude Fable 5.1 dẫn trước 8 điểm ở tầng khó nhất của FrontierMath và 24 điểm trên SimpleQA Verified, bộ kiến thức thế giới nơi mức 47% so với 71% là khoảng cách đơn lẻ lớn nhất trong bảng chung. Người mua lựa chọn giữa hai mô hình này không phải đang chọn giữa hai cách diễn giải về cùng một năng lực; họ đang chọn giữa một mô hình rẻ hơn mạnh hơn ở một số công việc và một mô hình đắt hơn mạnh hơn ở những công việc khác, với một chỉ số năng lực tổng quát không chịu tách biệt hai mô hình.

Chỉ số của Epoch cũng nói rõ rằng dẫn đầu ở từng benchmark không nhất thiết phải thể hiện trong chỉ số tổng hợp. Các benchmark không được đánh trọng số theo độ chính xác, và một mô hình chuyên biệt hóa có thể đạt điểm thấp hơn một đối thủ có cấu trúc khác ngay cả khi đang dẫn đầu các bài kiểm tra riêng lẻ — tài liệu của nó nói thẳng như vậy. Đó không phải là một khiếm khuyết đang được bào chữa; đó chính là mục đích của một chỉ số tổng hợp trên hơn năm mươi bài kiểm tra.

Hai dụng cụ độc lập chỉ về hai hướng trái ngược nhau

A capture of the Epoch AI model page for Claude Sonnet 5.5, headed ECI #3, Anthropic, Sep. 28, 2026, Closed weights, and the line that it has an ECI score of 165 and ranks 3rd of 253 tracked models. Beneath it a comparison table headed 'Claude Sonnet 5.5 vs select alternatives' carries four columns - Claude Sonnet 5.5, Claude Opus 5.5, GPT-6 Astra and Kimi K3 - with an ECI score row reading 165, 167, 167 and 158, a ranking row reading #3, #1 - Best, #2 and #13, and per-benchmark rows for Mystery Game Puzzles, FrontierMath Tiers 1-3 (v2), FrontierMath Tier 4 (v2), OTIS Mock AIME 2024-2025, Furniture Assembly Benchmark, SciCode, GPQA Diamond, Text Arena (Coding) and SimpleQA Verified.

Có một phép đo độc lập thứ hai đang lưu hành, và nó không đồng tình với phép đo đầu tiên về việc mô hình nào trong hai mô hình này đang dẫn trước. Trên Artificial Analysis Intelligence Index, các con số mà danh mục của chính chúng tôi mang cho hai mô hình ghi là 56 đối với Claude Sonnet 5.5 và 53.4 đối với Claude Fable 5.1, được lấy từ cùng một bản sửa đổi của chỉ số đó và do đó mang cùng một mẫu các mô hình được đánh giá. Chênh nhau ba điểm, nghiêng về mô hình rẻ hơn — trong khi Epoch đọc chúng là giống hệt nhau.

Cả hai cách đọc đều không sai, và cách dùng chúng là để ý xem chúng bất đồng ở điểm nào. Hai chỉ số bao quát những bộ benchmark khác nhau và cân trọng số chúng theo cách khác nhau; chỉ số tổng hợp Epoch được xây dựng để vẫn đứng vững khi các benchmark bão hòa, trong khi chỉ số Artificial Analysis là một tổng hợp trực tiếp từ một rổ khác. Khi một cặp mô hình gần nhau đến thế, việc chọn công cụ đo còn quan trọng hơn khoảng cách đang được đo. Người đọc muốn biết con số nào mạnh hơn trong hai con số liền kề nên xem bảng các benchmark riêng lẻ dùng chung ở phía trên, thay vì nhìn vào một trong hai con số tiêu đề, vì đó là nơi duy nhất hai mô hình được so sánh trực tiếp với nhau trên cùng một bài kiểm tra.

Có thêm một mẩu ngữ cảnh nữa mà chỉ số tổng hợp không mang theo, còn Epoch thì có: ngày phát hành. Hôm nay, Claude Fable 5.1 xếp thứ tư trong số 253 mô hình được theo dõi. Vào thời điểm nó được phát hành, ngày 1 tháng 9 năm 2026, nó xếp thứ nhất trong số 247 mô hình được theo dõi khi đó. Trọng số của nó không hề thay đổi. Đường biên tiên phong chỉ đơn giản vượt qua nó sáu bậc trong vòng một tháng — đó là hình dạng của toàn bộ bảng xếp hạng, và là lý do một lần đọc chỉ số hằng tháng là một ảnh chụp nhanh chứ không phải một phán quyết.

Cái giá của sự khác biệt là gì, và đâu là phía rẻ hơn

A capture of the OrcaRouter model page for Claude Sonnet 5.5, listed under anthropic/claude-sonnet-5.5, showing a 1M-token context window with up to 128K output tokens, input pricing at $2.00 per million tokens and output at $10.00 per million tokens, and the catalogue's capability tags for the model.

Ngang nhau về năng lực tổng quát, chênh nhau 2,5 lần ở giá đầu vào và 5 lần ở giá đầu ra — đó chính là toàn bộ nội dung thực tiễn của bài đọc này. Cả hai mô hình đều nằm trong danh mục của chính chúng tôi — anthropic/claude-sonnet-5.5 ở mức 2,00 USD cho mỗi triệu token đầu vào và 10,00 USD cho mỗi triệu token đầu ra, với 0,20 USD cho lượt đọc từ cache, cùng anthropic/claude-fable-5.1 ở mức 10,00 USD và 50,00 USD với 0,25 USD cho lượt đọc từ cache — và cả hai đều được chuyển tiếp đúng theo giá niêm yết của nhà cung cấp, không cộng thêm bất kỳ khoản chênh lệch nào, nên khi nhà cung cấp thay đổi mức giá thì phía chúng tôi cũng áp dụng ngay trong cùng ngày.

Tính lặp lại quan trọng hơn con số gây chú ý. Hãy lấy một tác vụ gửi tiền tố 120.000 token từ bộ đệm và tạo ra 8.000 token đầu ra, chạy mỗi ngày một lần trong một tháng. Trên Claude Sonnet 5.5, tiền tố đó tốn 120.000 token với mức $0,20 mỗi triệu token, tức khoảng 2,4 xu, cộng thêm 8.000 token với mức $10 mỗi triệu token, tức 8 xu — khoảng 10,4 xu mỗi lần chạy, hay khoảng $3,12 trong ba mươi ngày. Trên Claude Fable 5.1, cùng tiền tố đó là 120.000 token với mức $0,25, tức 3 xu, cộng thêm 8.000 token với mức $50, tức 40 xu — khoảng 43 xu mỗi lần chạy, hay $12,90 trong cả tháng. Cả hai mô hình đều phục vụ cùng cửa sổ 1M token với đầu ra tối đa 128K, nên sự khác biệt nằm ở bảng giá chứ không phải ở giới hạn trần.

Đối lập với điều đó, sáu benchmark dùng chung cho thấy khoản tiền tăng thêm mua được thứ gì theo hướng nào. Một nhóm mà công việc trông giống FrontierMath Tier 4 hay việc nhớ lại dữ kiện mở đang mua một khoảng cách thực sự 8–24 điểm trên các bài kiểm tra đó bằng cách trả gấp bốn lần; một nhóm mà công việc trông giống giải đố hoặc lắp ghép đa phương thức đang mua 5–7 điểm theo hướng ngược lại trong khi trả con số nhỏ hơn. Trên một nền tảng duy nhất, đây không phải là hai quyết định mua sắm. Cả hai mô hình đều nằm sau một khóa API trong số hơn 200 mô hình, nên so sánh chúng trên lưu lượng của chính bạn là một thay đổi cấu hình chứ không phải một hợp đồng thứ hai, và ở nơi cả hai đều được định tuyến, cơ chế chuyển đổi dự phòng tự động nằm bên dưới — điều này rất quan trọng khi hai công cụ độc lập bất đồng về việc mô hình nào đang dẫn trước.

Điều gì sẽ khiến chỉ số này thay đổi

Ba điều sẽ thay đổi điều đó, và chỉ một trong số chúng liên quan đến một trong hai mô hình.

Đầu tiên là thêm nhiều đánh giá benchmark hơn. Claude Sonnet 5.5 đã gia nhập chỉ mục cách đây bốn ngày với 11 đánh giá phía sau; mỗi đánh giá bổ sung sẽ thu hẹp khoảng tin cậy của nó và có thể làm thay đổi ước lượng điểm, và việc tái khớp đồng thời có nghĩa là sự thay đổi không chỉ giới hạn ở hàng mới.

Điểm thứ hai là sự xuất hiện của một mô hình tiên phong khác. Bốn dòng đầu trải dài trên bốn điểm, với hai trường hợp đồng hạng nằm trong khoảng đó, nên chỉ một người mới được đánh giá kỹ lưỡng cũng sẽ nằm trong cụm thay vì ở dưới cụm — và các khoảng được công bố, vốn chồng lấn ở cả bốn, khiến thứ tự giữa chúng chỉ là một tiêu chí phá thế đồng hạng chứ không phải một phép đo.

Điều thứ ba là giá của chính các mô hình, thứ mà không chỉ số nào theo dõi. Khoảng cách mà bài viết này xoay quanh là khoảng cách bảng giá: $2 và $10 so với $10 và $50 hiện nay. Một thay đổi trên một trong hai bảng giá sẽ thay đổi quyết định mà không làm thay đổi một điểm năng lực nào.

Bản tóm tắt có thể bảo vệ được là bản hẹp. Trên chỉ số tổng hợp của Epoch AI, trong một tệp được cập nhật ngày 1 tháng 10 năm 2026, Claude Sonnet 5.5 và Claude Fable 5.1 có cùng một con số — 165, đồng hạng ba, với các khoảng công bố giống hệt nhau dựa trên lượng bằng chứng khác nhau. Trên công cụ đo riêng của Artificial Analysis, hai mô hình đó cách nhau ba điểm. Trên sáu bài đánh giá mà chỉ số này so sánh trực tiếp chúng, chúng thay nhau dẫn đầu theo lĩnh vực chứ không ngang bằng nhau. Và trên bảng giá, chúng chẳng gần nhau chút nào. Điều duy nhất mà cách đọc này sẽ không ủng hộ là câu mà nó dễ bị trích dẫn nhất: rằng các mô hình tương đương nhau.

So sánh trong bài viết này1

Phát hiện từ bài viết này · Benchmark: Artificial Analysis · cập nhật hằng ngày