Thẻ tiêu đề được tạo cho Claude Opus 5.5 vs Claude Fable 5.1, với phụ đề "Mô hình rẻ hơn đã thắng chỉ số độc lập", cùng logo OrcaRouter thật được ghép ở góc dưới bên phải và một dòng chân trang ghi "Chỉ số theo Artificial Analysis ở mức nỗ lực tối đa; giá theo Anthropic."
Guides & Insights

Claude Opus 5.5 vs Claude Fable 5.1: Mô hình rẻ hơn đã thắng Chỉ số Độc lập

Tác giả

Magnus Corvin

Ngày đăng

Mô hình mới nhất · 20Xem tất cả mô hình
Benchmark: Artificial Analysis · cập nhật hằng ngày
Quay lại tất cả bài viết

Anthropic hiện bán hai mô hình ở vị trí đầu trong dòng sản phẩm của mình, và mô hình có giá đắt gấp hai lần rưỡi không phải là mô hình đứng đầu bảng. Claude Opus 5.5, ra mắt ngày 22 tháng 9 năm 2026 với giá 4 đô la mỗi triệu token đầu vào và 20 đô la mỗi triệu token đầu ra, đạt 58 điểm trên Artificial Analysis Intelligence Index. Claude Fable 5.1, đã giữ vị trí hàng đầu kể từ ngày 1 tháng 9 với giá 10 đô la đầu vào và 50 đô la đầu ra, đạt 53 điểm. Cả hai con số đều đến từ cùng một đơn vị đánh giá, cả hai đều được đo trong cùng một nhóm cấu hình, và khoảng cách đi ngược lại so với mức giá. Đó là sự thật mà so sánh này phải bắt đầu từ, bởi vì gần như mọi bài viết ra mắt trong tuần qua đều mô tả Opus 5.5 là phiên bản giảm giá của Fable 5.1 — một mô hình rẻ hơn "ngang bằng" với mô hình đắt tiền trong hầu hết công việc. Con số độc lập cho thấy mô hình giảm giá đang dẫn trước.

Việc điều đó có nên thay đổi thứ bạn triển khai hay không lại là một câu hỏi khác, và câu trả lời phụ thuộc ít vào khoảng cách năm điểm hơn là vào hai cài đặt mà không ai đưa lên tiêu đề: mỗi mô hình mặc định ở mức nỗ lực nào, và mô hình nào có thể được làm cho nhanh.

Những con số độc lập, và một điều duy nhất chúng chia sẻ

A two-column scoreboard comparing Claude Opus 5.5 and Claude Fable 5.1 across six shared rows: Intelligence Index (58, ranked #1 of 210, against 53, ranked #4), price in and out ($4.00 / $20.00 per million against $10.00 / $50.00), context window (1M tokens on both), default effort (medium against high), knowledge cutoff (Jun 2026 on both) and fast mode (supported at $8.00 / $40.00 against not supported). The footer reads 'Index figures per Artificial Analysis at max effort; prices, effort defaults and fast-mode support per Anthropic.'

Artificial Analysis công bố một cấu hình cho mỗi mô hình, và với cả hai mô hình này, cấu hình đó đều được gắn nhãn "Adaptive Reasoning, Max Effort, Default Fallback". Cùng nhãn, cùng trình đánh giá, cùng lượt chạy — điều này khiến đây trở thành cuộc đối đầu trực diện sạch sẽ nhất mà mỗi mô hình từng có:

• Intelligence Index — Claude Opus 5.5 58, xếp hạng #1 trong số 210 so với Claude Fable 5.1 53, xếp hạng #4

• Tốc độ đầu ra — Claude Fable 5.1 65,8 token/giây, thấp hơn mức trung vị 71,0 của bảng xếp hạng, so với Claude Opus 5.5 chưa được công bố trên bảng

• Thời gian đến token đầu tiên — Claude Fable 5.1 274,43 giây so với trung vị của bảng là 3,83 giây; Claude Opus 5.5 chưa được công bố

• Độ dài dòng trên Chỉ số — Claude Opus 5.5 đã tạo ra 260M token đầu ra, so với mức trung vị 88M trên toàn bộ các mô hình

• Giá — Claude Opus 5.5 $4,00 / $20,00 mỗi triệu so với Claude Fable 5.1 $10,00 / $50,00

Hai trong số những hàng đó cần được đọc chứ không phải trích dẫn. Hàng đầu tiên là nhãn "Max Effort": điểm của cả hai mô hình đều không phản ánh mặc định khi phát hành của chúng, và hai mặc định này không giống nhau — sẽ nói thêm ở dưới. Hàng thứ hai là hàng độ dài dòng, vốn đi ngược lại cách Opus 5.5 đã được quảng bá. Câu chuyện về hiệu quả của Anthropic là mô hình đạt cùng câu trả lời với ít token hơn, và tài liệu ra mắt trích dẫn các đối tác báo cáo ít hơn một phần ba đến một nửa token đầu ra. Trên Index, được đo chứ không phải được trích dẫn, Opus 5.5 phát ra 260M token so với trung vị của bảng là 88M — dài dòng hơn khoảng ba lần so với mô hình điển hình mà nó được đem so sánh. Cả hai điều đều có thể đúng: nó có thể dùng ít token hơn Claude Opus 5 nhưng vẫn là một mô hình dài dòng về mặt tuyệt đối. Nhưng nếu bạn lập ngân sách dựa trên câu "ít token hơn" chứ không phải từ hóa đơn của chính bạn, thì phép đo độc lập mới là thứ cần kiểm tra.

6 đô la mỗi triệu thêm mua được gì

A screenshot of Anthropic's Claude Platform Docs page for Claude Opus 5.5 showing its 'How it compares' table: Claude Fable 5.1 and Claude Opus 5.5 both at 1M context and 128K max output with a Jun 2026 cutoff, Fable 5.1 at $10 / $50 with high default effort and slower latency against Opus 5.5 at $4 / $20 with medium default effort and moderate latency, with Claude Sonnet 5 at $2 / $10 and a Jan 2026 cutoff and Claude Haiku 4.5 below them. The Opus 5.5 pricing panel underneath lists $4 input, $20 output, $5 and $8 cache writes, $0.20 cache read and a 50% batch discount.

Bỏ các chỉ số đánh giá ra thì phần còn lại chính là bảng giá. Mọi thứ ở đây đều lấy từ trang giá đã công bố của Anthropic, có thể kiểm chứng ngay hôm nay:

• Đầu vào — $4.00 mỗi triệu trên Opus 5.5 so với $10.00 trên Fable 5.1

• Đầu ra — $20.00 mỗi triệu so với $50.00

• Đọc cache — 0,20 USD mỗi triệu trên Opus 5.5 so với 0,25 USD trên Fable 5.1

• Hệ số nhân bộ nhớ đệm — Opus 5.5 tính phí các lượt trúng bộ nhớ đệm ở mức 0,05x đầu vào cơ sở; Fable 5.1 tính chúng ở mức 0,025x, một hệ số nhân tốt hơn trên mức cơ sở cao hơn

• Ghi bộ nhớ đệm — $5 mỗi triệu cho cửa sổ 5 phút và $8 cho một giờ trên Opus 5.5, so với $12.50 và $20 trên Fable 5.1

• Batch API — Opus 5.5 giảm một nửa xuống $2.00 / $10.00; Fable 5.1 giảm một nửa xuống $5.00 / $25.00

• Chế độ nhanh — Opus 5.5 hỗ trợ chế độ này với mức $8.00 / $40.00 cho tốc độ đầu ra nhanh hơn tối đa khoảng 2,5 lần; Fable 5.1 hoàn toàn không hỗ trợ chế độ nhanh

Dòng cache là thứ đáng để nhìn kỹ hai lần, bởi vì hai mô hình đảo ngược mô thức thông thường. Fable 5.1 có hệ số nhân mạnh tay hơn — 2,5% của input cơ sở so với 5% của Opus 5.5 — nhưng vì giá cơ sở của nó là 10 đô la thay vì 4 đô la, nên chi phí đọc cache của nó vẫn đắt hơn trong hai mô hình khi tính theo số tiền tuyệt đối. Không có cấu hình nào mà mô hình cao cấp lại có lợi thế trên một token ngữ cảnh đã cache. Và hệ số nhân không phải là thứ bạn có thể chuyển nguyên sang: một vòng lặp agent được tinh chỉnh theo hành vi cache của Fable 5.1 sẽ trả nhiều hơn cho mỗi lần cache hit trên Opus 5.5 theo tỷ lệ, ngay cả khi nó trả ít hơn cho mỗi token mới.

Fast mode là sự bất đối xứng rõ nét hơn. Tài liệu của Anthropic liệt kê fast mode cho Claude Opus 5.5, Claude Opus 5 và Claude Opus 4.8 — Fable 5.1 không có trong danh sách đó. Vậy nên mô hình rẻ hơn có một đòn bẩy độ trễ mà mô hình đắt hơn đơn giản là không có, ở mức $8/$40, vốn vẫn thấp hơn mức giá đầu ra tiêu chuẩn $10/$50 của Fable 5.1. Nếu khối lượng công việc của bạn đủ tính tương tác đến mức token đầu tiên chậm là một vấn đề về sản phẩm, hãy lưu ý rằng thời gian đo được đến token đầu tiên của Fable 5.1 là 274 giây. Con số đó là hệ quả của suy luận ở mức nỗ lực tối đa, không phải khiếm khuyết, nhưng nó là con số mà một người đánh giá đã ghi lại.

Các giá trị mặc định không giống nhau, và đó chính là cái bẫy

Tài liệu mô hình của chính Anthropic đặt hai mô hình cạnh nhau, và hàng quyết định phần lớn các so sánh thực tế không phải là giá. Đó là mức nỗ lực mặc định: medium cho Claude Opus 5.5, high cho Claude Fable 5.1. Cả hai đều chạy cơ chế suy luận thích ứng không thể tắt; độ sâu chỉ được điều khiển thông qua tham số effort, trên một thang gồm low, medium, high, xhigh, max.

Đây là lý do vì sao câu công bố khi ra mắt "Opus 5.5 ngang bằng Fable 5.1 trong hầu hết công việc" và các bảng benchmark bên dưới nó trông như mâu thuẫn với nhau. Các hàng so sánh trực tiếp của Anthropic dành cho Opus 5.5 thường được gắn nhãn với một thiết lập effort cao hơn mặc định — con số 66,4% của Terminal-Bench 4.0 so với 55,8% của Fable 5.1 được chạy ở effort xhigh, không phải medium. Trong khi đó, các con số của chính Fable 5.1 được tạo ra ở mức mặc định cao hơn của nó. Hai mô hình được so sánh ở các thiết lập effort khác nhau thì không thực sự được so sánh với nhau, và Anthropic cũng nói đúng như vậy trong tài liệu ra mắt của chính mình khi cảnh báo rằng các khoảng cách điểm benchmark ở mức năng lực này là một chỉ dẫn kém đáng tin cậy hơn về khác biệt trong thực tế so với điều mà các điểm số ngụ ý.

Trên thực tế, điều đó biến quyết định này thành một bài tập tinh chỉnh thay vì một sự lựa chọn. Nếu bạn chuyển từ Fable 5.1 sang Opus 5.5 và giữ nguyên cài đặt effortcủa mình, thì bạn đã âm thầm thay đổi mức độ suy nghĩ mà mô hình thực hiện, và mọi con số về chất lượng lẫn chi phí mà bạn tạo ra sau đó đều bị nhiễu. Hướng dẫn của Anthropic là nên thử nhiều mức effort khác nhau thay vì bê nguyên cài đặt của mô hình cũ. Việc đó tốn rất ít công sức nhưng gần như chẳng ai làm, bởi vì nó đồng nghĩa với việc bạn phải tự chạy đánh giá của mình hai lần.

Nơi duy nhất mà sự kết hợp này chứng tỏ được giá trị của nó.

Mô hình biện minh cho việc giữ cả hai là vòng lặp cố vấn: Opus 5.5 làm việc, Fable 5.1 được tham vấn cho những quyết định khó. Anthropic đã đo lường điều đó, và nó thực sự giúp tăng độ chính xác — với chi phí cao hơn và độ trễ cao hơn, đúng như sự đánh đổi mà bạn sẽ kỳ vọng khi đưa mô hình chậm hơn vào vòng lặp. Điều đã thay đổi là phép tính đằng sau nó. Khi khoảng cách năng lực còn rộng hơn, việc trả $10/$50 để giám sát một mô hình làm việc $5/$25 rõ ràng là đáng giá. Giờ đây khi mô hình làm việc đạt điểm cao hơn mô hình cố vấn trên chỉ số độc lập, đóng góp của mô hình cố vấn thu hẹp lại vào những tác vụ cụ thể mà các đánh giá của chính nó vượt qua Opus 5.5, và đó là những tác vụ mà bạn phải tự mình xác định. Vòng lặp vẫn hợp lý đối với một tập con khó; nó không còn hợp lý như một cấu hình áp dụng tràn lan.

Cả hai đều chỉ cách một phím

Chi tiết về việc di chuyển khiến các đội bị bất ngờ ở đây không phải là bề mặt API — mà là việc đây là các mô hình của cùng một nhà cung cấp với các thang mức nỗ lực khác nhau, hệ số bộ đệm khác nhau và cài đặt mặc định khác nhau, và so sánh chúng một cách trung thực có nghĩa là chạy cả hai với chính các prompt của bạn ở cấu hình tương đương. Claude Opus 5.5 có trên OrcaRouter với mức giá của chính Anthropic là $4.00 / $20.00, và Claude Fable 5.1 có trên OrcaRouter ở mức $10.00 / $50.00 — giá niêm yết của nhà cung cấp được chuyển nguyên với mức đánh dấu 0%, vì vậy cả hai con số sẽ thay đổi ngay khi Anthropic thay đổi và không bên nào phải gánh thêm hợp đồng thứ hai hay SDK thứ hai.

A screenshot of OrcaRouter's own model page for anthropic/claude-fable-5.1, headed 'Claude Fable 5.1' and credited to Anthropic, showing $10.00 input and $50.00 output per 1M tokens and a PERFORMANCE panel with 65.8 output tokens per second, a 274.43s time to first token, 88M output tokens over 7 days and a 0.00% error rate.

Đó là điều khiến việc tách này mang tính thực tiễn thay vì lý thuyết. Việc gửi phần lớn lưu lượng của bạn đến Opus 5.5 và ghim một quy tắc định tuyến chuyển những trường hợp thực sự khó lên Fable 5.1 là một cấu hình trên một endpoint, chứ không phải hai tích hợp — và việc tổ chức một lệnh gọi để một mô hình soạn thảo trong khi mô hình kia xác minh chỉ là một dòng routing-DSL, chứ không phải một pipeline mà bạn phải xây dựng và bảo trì. Nếu đường dẫn chuyển cấp hóa ra không phù hợp với khối lượng công việc của bạn, chuyển đổi dự phòng tự động sẽ giữ cho yêu cầu đáp xuống một mô hình mà bạn đã nắm rõ đặc tính, thay vì thất bại hoàn toàn.

Điều gì sẽ giải quyết được nó?

Thực trạng trung thực của phép so sánh này là Anthropic đã công bố một bảng trong đó mô hình rẻ hơn thắng phần lớn các dòng, Artificial Analysis công bố một bảng khác trong đó nó thắng áp đảo, và cả hai đều được chạy ở những thiết lập effort mà bạn không hề dùng khi triển khai. Không bảng nào là so sánh đối đầu có kiểm soát ở cùng thiết lập mặc định, và chưa có bên thứ ba nào thực hiện điều đó. Khoảng cách còn trụ lại sau tất cả những điều đó — rằng Claude Opus 5.5 rẻ hơn đáng kể ở mọi dòng của bảng giá, hỗ trợ fast mode mà Fable 5.1 không có, và không hề thua kém ở điểm số độc lập duy nhất mà cả hai mô hình đều có — đủ lớn để nghĩa vụ chứng minh đã chuyển sang phía bên kia. Nếu bạn mặc định dùng Fable 5.1, câu hỏi không còn là liệu Opus 5.5 có đủ tốt hay không; mà là những tác vụ cụ thể nào trong khối lượng công việc của bạn thất bại ở medium effort, vì đó là những tác vụ duy nhất mà bạn đang phải trả giá cao hơn.

So sánh trong bài viết này2

Phát hiện từ bài viết này · Benchmark: Artificial Analysis · cập nhật hằng ngày