
Claude Fable 5.1 so với GPT-5.6 Sol: #1 mới so với cú phá giá
- openaiMỚIOpenAI: GPT-6 Astra2026-09-0453Trí tuệ77Lập trình
- googleMỚIGoogle: Gemini 3.8 Flash2026-09-0241Trí tuệ76Lập trình
- qwenMỚIQwen: Qwen3.8 Max (0902)2026-09-0240Trí tuệ72Lập trình
- anthropicMỚIAnthropic: Claude Fable 5.12026-09-0153Trí tuệ82Lập trình
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 trên 1 triệu token
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Trí tuệ72Lập trình
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.24 / $0.73 trên 1 triệu token
- z-aiZ.ai: GLM 5.32026-08-1845Trí tuệ75Lập trình
- obsidianQwen3.8 27B2026-08-1534Trí tuệ68Lập trình
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Trí tuệ69Lập trình
- grokSpaceXAI: Grok 4.62026-08-1244Trí tuệ77Lập trình
- metaMeta: Muse Spark 1.22026-08-0540Trí tuệ72Lập trình
- qwenQwen: Qwen3.8 Max2026-08-0340Trí tuệ72Lập trình
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135Trí tuệ69Lập trình
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 trên 1 triệu token
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2451Trí tuệ78Lập trình
- googleGoogle: Gemini 3.6 Flash2026-07-2134Trí tuệ69Lập trình
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2123Trí tuệ49Lập trình
Hãy đọc bất kỳ bài viết nào về Claude Fable 5.1 và GPT-5.6 Sol từ tuần đầu tháng 9, bạn sẽ gặp cùng một câu: mẫu flagship mới nhất của Anthropic, phát hành ngày 1 tháng 9 năm 2026, đã đánh bại GPT-5.6 Sol của OpenAI trên thực chất mọi điểm chuẩn mà Anthropic chạy. Câu đó là sự thật, nhưng đó mới chỉ là phần nhỏ của câu chuyện. Phần lớn hơn là GPT-5.6 Sol, mẫu flagship của OpenAI đã được đưa vào sản xuất từ ngày 9 tháng 7 năm 2026, có giá niêm yết rẻ hơn khoảng 2,5 lần, được đo lường là dùng ít hơn khoảng một phần ba số token cho cùng một công việc, và — theo phân tích định giá lại của Epoch AI vào ngày 8 tháng 9 — chỉ càng trở nên hấp dẫn hơn khi prompt của bạn càng ngắn. Claude Fable 5.1 là số #1 mới trên chỉ số độc lập, với 66 điểm so với 61 điểm của GPT-5.6 Sol. Liệu khoảng cách năm điểm đó có đáng với cái giá phải trả hay không chính là toàn bộ luận điểm của trang này.
Bảng điểm và người báo cáo từng con số
Hãy bắt đầu với con số duy nhất mà không nhà cung cấp nào kiểm soát. Trên Artificial Analysis Intelligence Index ở mức nỗ lực tối đa, Claude Fable 5.1 đạt 66 điểm — mức cao nhất mà AA từng ghi nhận — so với 61 của GPT-5.6 Sol, mặc dù trang mô hình của AA cho cấu hình dự phòng mặc định mà Anthropic thực sự phục vụ liệt kê 53 điểm, vẫn đứng #1 trong số 201. Đó là tuyên bố độc lập rõ ràng nhất về cuộc đối đầu này: sản phẩm chủ lực của Anthropic là trần hiện tại, và khoảng cách với sản phẩm của OpenAI là thực sự nhưng không quá lớn.
Bên dưới đó, các benchmark thành phần được phân chia theo người chạy chúng, và điều đó đáng để phân biệt cho rõ ràng. Anthropic báo cáo Claude Fable 5.1 đạt 52,6% trên Terminal-Bench-Science 0.1 so với 22,4% của GPT-5.6 Sol, đạt 55,8% trên Terminal-Bench 4.0 so với 37,3%, đạt 73,4% trên CursorBench 3.2.0 so với 67,2%, và đạt 1.853 trên GDPval-AA v2 so với 1.711. Về phần mình, OpenAI báo cáo GPT-5.6 Sol đạt khoảng 96% trên SWE-bench Verified — một chỉ số về kỹ thuật phần mềm cao hơn bất kỳ con số nào Anthropic công bố cho Fable 5.1, bởi vì Anthropic không hề báo cáo benchmark đó. Hãy nhìn nhận mô hình này một cách trung thực: mỗi nhà cung cấp đều dẫn đầu ở các chỉ số họ chọn để công bố, hai công ty gần như không dùng chung benchmark nào, và các con số thành phần nên được coi là dữ liệu định hướng do nhà cung cấp tự báo cáo, chứ không phải sự thật so sánh giữa các nhà cung cấp. Chỉ số tổng hợp và các bản đánh giá của riêng bạn mới là những tín hiệu so sánh cùng tiêu chuẩn duy nhất.
Bảng thông số kỹ thuật, đặt cạnh nhau
• Giá — Claude Fable 5.1 $10.00 / $50.00 mỗi 1M, cố định ở mọi độ dài so với GPT-5.6 Sol $4.00 / $20.00 mỗi 1M cho đến 272K đầu vào, sau đó toàn bộ yêu cầu được định giá lại ở mức $8.00 / $30.00 (theo phân tích ngày 8 tháng 9 của Epoch AI). Đọc cache $0.25 so với $0.40.
• Ngữ cảnh / đầu ra tối đa — Claude Fable 5.1: 1M vào / 128K ra. GPT-5.6 Sol: ~1.05M vào / 128K ra.
• Đầu vào — cả hai đều nhận văn bản và hình ảnh.
• Điểm đánh giá độc lập — Claude Fable 5.1 đạt 66 trên chỉ số AA Intelligence (tối đa) so với GPT-5.6 Sol đạt 61.
• Tokenizer — OpenAI báo cáo rằng tokenizer của GPT-5.6 Sol sử dụng ít hơn khoảng 34% token trên văn bản thông thường, đây là một khoản giảm giá không bao giờ xuất hiện trên bảng giá.
• Trạng thái — Claude Fable 5.1 GA 2026-09-01; GPT-5.6 Sol GA 2026-07-09 với tỷ lệ đầu vào/đầu ra khuyến mãi có hiệu lực đến cuối năm 2026.


Khoảng cách giá, khoảng cách token và vách đá
Phép tính bắt đầu từ giá niêm yết và trở nên thú vị hơn từ đó. Với mức $4 / $20 so với $10 / $50, GPT-5.6 Sol rẻ hơn 2.5 lần mỗi token. Thêm hiệu suất tokenizer được OpenAI công bố — giảm khoảng 34% số token trên cùng một văn bản — thì cùng một tác vụ logic có chi phí thấp hơn đáng kể trên Sol so với cả tỷ lệ trên bảng giá cho thấy. Đây là lý do vì sao bài truyền thông ra mắt của Anthropic lại dựa vào cache reads: mức giá đọc cache $0.25 của Claude Fable 5.1 thực sự rẻ, và đó chính là thứ cứu các phiên agent đọc lại nhiều lần kéo dài khỏi con số $10 / $50 trên tiêu đề. Một ngữ cảnh 100K token được đọc lại năm mươi lần tốn $1.25 trên Claude Fable 5.1 so với $2.00 trên GPT-5.6 Sol ở mức giá cache $0.40 của nó.
Rồi lại có vách đá, chạy theo hướng ngược lại. Gói $4 / $20 của GPT-5.6 Sol chỉ áp dụng cho tối đa 272K token đầu vào; vượt mức đó, phân tích ngày 8 tháng 9 của Epoch AI cho thấy toàn bộ yêu cầu được định giá lại ở $8 vào / $30 ra. Claude Fable 5.1 không có vách đá như vậy — mức $10 / $50 của nó là bằng phẳng ở mọi độ dài, và với đầu vào rất dài, mức giá bằng phẳng có thể đánh bại trực tiếp mức giá đã định lại của Sol. Với các đội nhóm có prompt thường vượt quá một phần tư triệu token, cách định danh "mô hình OpenAI rẻ" sụp đổ; với mọi người khác, lợi thế về giá và tokenizer của Sol là điểm nhấn chính.
Năm điểm chỉ số mua được gì
Chênh lệch 5 điểm trên chỉ số tập trung đúng vào những công việc mà một mô hình bỏ cuộc sớm sẽ làm hỏng cả quá trình. Mức chênh lệch mà Anthropic báo cáo trên Terminal-Bench-Science (52,6% so với 22,4%) và AutomationBench là lớn nhất giữa hai flagship hiện tại bất kỳ, và chính trang mô hình của Artificial Analysis cho thấy điều đó tốn kém thế nào trong thực tế: 7,63 USD chi phí sử dụng mô hình và 190 triệu token đầu ra để chạy chỉ số, so với mức trung vị 92 triệu token, vì mô hình mạnh hơn viết nhiều hơn hẳn trước khi dừng. Nếu công việc của bạn là nghiên cứu tự động, agent tầm xa, hoặc các tác vụ mà một quyết định sai từ sớm càng tích lũy hậu quả, thì khoản phí đắt hơn đó mua được mức trần năng lực hiện tại. Nếu công việc của bạn là kỹ thuật phần mềm mà GPT-5.6 Sol đã vượt qua bài đánh giá của bạn, thì 5 điểm đó chỉ là một khoản thuế.
Cách trung thực để lựa chọn
Ở đây không có người chiến thắng ổn định, và giả vờ điều ngược lại chính là cách các đội trả giá quá cao. Lập trường vững chắc là coi Claude Fable 5.1 như trần năng lực và GPT-5.6 Sol như tiêu chuẩn giá trị, sau đó đo khối lượng công việc của bạn so với cả hai — điều này rất rẻ để thực hiện vì Claude Fable 5.1 và GPT-5.6 Sol đều có trên OrcaRouter với giá niêm yết của nhà cung cấp với mức tăng giá bằng không, đằng sau một endpoint tương thích OpenAI. Hướng lưu lượng dài hạn và tác nhân đến Claude Fable 5.1, giữ lưu lượng kỹ thuật phần mềm lớn trên GPT-5.6 Sol, và để DSL định tuyến di chuyển mô hình lên hoặc xuống ngay khi các bài đánh giá của bạn — hoặc thẻ giá — thay đổi. Tỷ lệ khuyến mãi của OpenAI hết hạn, các bản phát hành điểm của Anthropic ra mắt, và lợi thế tokenizer thể hiện khác nhau trên mỗi kho ngữ liệu; các mô hình sẽ tiếp tục đổi chỗ, và thiết lập có thể điều chỉnh theo chúng có giá trị hơn bất kỳ mô hình hàng đầu nào đơn lẻ.

So sánh trong bài viết này1
Phát hiện từ bài viết này · Benchmark: Artificial Analysis · cập nhật hằng ngày
