
Claude Opus 5.5 vs Claude Opus 5: Các mức nỗ lực không mang cùng ý nghĩa
- openaiMỚIOpenAI: GPT-6 Luna2026-09-2237Trí tuệ
- openaiMỚIOpenAI: GPT-6 Sol2026-09-2248Trí tuệ
- anthropicMỚIAnthropic: Claude Opus 5.52026-09-2258Trí tuệ
- grokMỚIGrok 4.72026-09-2146Trí tuệ
- OrcaMỚIOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 trên 1 triệu token
- orcaMỚIOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 trên 1 triệu token
- deepseekMỚIDeepSeek: DeepSeek V4.1 Flash2026-09-1040Trí tuệ
- openaiOpenAI: GPT-6 Astra2026-09-0453Trí tuệ77Lập trình
- googleGoogle: Gemini 3.8 Flash2026-09-0241Trí tuệ76Lập trình
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Trí tuệ76Lập trình
- anthropicAnthropic: Claude Fable 5.12026-09-0153Trí tuệ82Lập trình
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 trên 1 triệu token
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Trí tuệ72Lập trình
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 trên 1 triệu token
- z-aiZ.ai: GLM 5.32026-08-1845Trí tuệ75Lập trình
- obsidianQwen3.8 27B2026-08-1534Trí tuệ68Lập trình
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Trí tuệ69Lập trình
- grokSpaceXAI: Grok 4.62026-08-1244Trí tuệ77Lập trình
- metaMeta: Muse Spark 1.22026-08-0540Trí tuệ72Lập trình
- qwenQwen: Qwen3.8 Max2026-08-0345Trí tuệ76Lập trình
Điều đầu tiên cần biết trước khi so sánh Claude Opus 5.5 với Claude Opus 5 là hai mô hình này không dùng chung một thang mức nỗ lực, và gần như mọi bài so sánh trực tiếp mà bạn đọc trong tuần này đều bỏ qua điều đó. Opus 5 mặc định đặt mức nỗ lực ở cao. Opus 5.5 mặc định đặt mức nỗ lực ở trung bình, và ở cùng một mức tên gọi, nó suy nghĩ nhiều hơn mỗi lượt so với phiên bản tiền nhiệm. Vậy nên "Opus 5.5 ở mặc định so với Opus 5 ở mặc định" không phải là một thí nghiệm có đối chứng — đó là so sánh giữa hai lượng suy nghĩ khác nhau. Chính nhà cung cấp cũng nói như vậy trong hướng dẫn chuyển đổi của mình: hãy thử nhiều mức nỗ lực khác nhau, và đừng dùng lại cài đặt của Opus 5, vì những mức cùng tên không ánh xạ tới cùng một ngân sách suy nghĩ. Sau khi đã kiểm soát được điều đó, khoảng cách giữa hai mô hình thu hẹp ở một số chỗ, nới rộng ở những chỗ khác, và quyết định nâng cấp phụ thuộc vào một thứ khác chứ không phải năng lực thuần túy — chi phí cho mỗi tác vụ hoàn thành, và bốn thay đổi API sẽ làm hỏng những đoạn mã đang chạy trên Opus 5 ngày nay.
Thực sự khác nhau ở điểm nào, xét từng thông số kỹ thuật

Hai mô hình trên lý thuyết gần nhau hơn so với những gì các số phiên bản gợi ý:
• Giá — Claude Opus 5.5 ở mức $4.00 cho đầu vào / $20.00 cho đầu ra trên mỗi triệu token so với Claude Opus 5 ở mức $5.00 / $25.00
• Đọc bộ nhớ đệm — $0,20 mỗi triệu so với $0,50 mỗi triệu, mức giảm 60% cho khoản mục chiếm phần lớn trong các lượt chạy agentic
• Ghi cache — 5 USD mỗi triệu cho cửa sổ 5 phút và 8 USD cho cửa sổ 1 giờ trên 5.5, so với 6,25 USD trên Opus 5
• Ngữ cảnh và đầu ra — 1M token ngữ cảnh và 128K đầu ra trên cả hai; cả hai đều đạt 300K đầu ra trên Batch API đằng sau output-300k-2026-03-24 header beta
• Mức nỗ lực mặc định — trung bình trên Opus 5.5 so với cao trên Opus 5
• Thinking — thích ứng và luôn bật ở cả hai, nhưng trên Opus 5.5 thì hoàn toàn không thể tắt được nữa.
• Thời điểm chốt kiến thức — tháng 6 năm 2026 so với tháng 5 năm 2026
• Độ trễ — Anthropic đánh giá Opus 5.5 ở mức "trung bình" so với dòng sản phẩm hiện tại, và cho biết nó tạo ra đầu ra nhanh hơn Opus 5 hơn 30%
• Ngừng cung cấp — không sớm hơn ngày 22 tháng 9 năm 2027 đối với Opus 5.5 và không sớm hơn ngày 24 tháng 7 năm 2027 đối với Opus 5
Lưu ý điều không khác biệt: cửa sổ ngữ cảnh, giới hạn đầu ra, chiết khấu theo lô, và mô hình tư duy thích ứng luôn bật. Opus 5.5 không phải là mô hình có ngữ cảnh lớn hơn hay đầu ra dài hơn. Nó là một mô hình rẻ hơn, nhanh hơn, tiết kiệm token hơn trong cùng một khuôn khổ.
Các chỉ số chuẩn, và dấu hoa thị về nỗ lực trên mỗi một trong số chúng

Những con số này đến từ tài liệu ra mắt của Anthropic — do nhà cung cấp báo cáo, được chạy trên các mô hình của chính họ — và thiết lập mức nỗ lực ở đây quan trọng hơn tên mô hình:
• Terminal-Bench 4.0 — 66,4% so với 52,3%, với lần chạy Opus 5.5 ở mức nỗ lực xhigh thay vì mặc định
• FrontierCode v1.1 (Main) — 54,4% so với 48,0%, và 54,6% cho Opus 5.5 ở mức nỗ lực trung bình mặc định
• CursorBench 4.0 — 57,8% so với 46,6%, và 52,5% ở mức trung bình
• GDPval-AA v2.1 — 1846 Elo so với 1708
• AutomationBench — 40,0% so với 26,9%
• Humanity's Last Exam, khi có công cụ — 67,7% so với 63,6%
• Terminal-Bench-Science 0.1 — 58,7% so với 29,0%, khoảng cách lớn nhất trong bộ này
• OSWorld 2.0 — 81,8% một phần so với 74,0%
• Chartography, với công cụ — 89.0% so với 83.4%
Kết quả FrontierCode là thứ đáng để nghiên cứu. Opus 5.5 đạt 54,4% ở xhigh và 54,6% ở medium — về mặt thống kê là cùng một con số, nhưng chỉ với một phần nhỏ ngân sách suy nghĩ. Dù Anthropic đã tạo ra cải tiến gì, trên benchmark đó, nó không đến từ việc suy nghĩ nhiều hơn. CursorBench lại đi theo hướng ngược lại: 57,8% ở xhigh so với 52,5% ở medium, mức chênh lệch năm điểm cho thấy nỗ lực vẫn đem lại độ chính xác thực sự trên một số tác vụ. Bài học không phải là "dùng medium" hay "dùng xhigh"; mà là mức nỗ lực phù hợp giờ đây là một phép đo theo từng loại khối lượng công việc, và thói quen cũ là để Opus 5 ở mức mặc định cao không còn cho bạn biết bất cứ điều gì về mô hình mới.
Anthropic bổ sung một lưu ý đáng nhắc lại: ở mức năng lực này, các mức chênh lệch trên benchmark là “một chỉ dẫn kém đáng tin cậy hơn về những khác biệt trong thế giới thực”, và công ty nói rằng khoảng cách nội bộ của mình với Claude Fable 5.1 hẹp hơn so với hàm ý của các điểm số đã công bố. Đó là một nhà cung cấp đang nói với bạn rằng đừng đọc quá mức bảng số liệu của chính họ.
Chi phí cho mỗi nhiệm vụ đã hoàn thành là phép so sánh quyết định điều đó.
Giá trên mỗi token là đơn vị sai để đánh giá một agent, và cuộc đối chiếu này chính là nơi điều đó thể hiện rõ. Ví dụ cụ thể của chính Anthropic: một phân tích sáp nhập mà Opus 5.5 thực hiện trong 63 phút và tốn ít hơn 50% so với cùng tác vụ trên Opus 5, vốn mất 93 phút. Bảng giá giải thích một phần điều đó — giảm 20% ở đầu vào và đầu ra, 60% ở lượt đọc cache — nhưng không phải toàn bộ. Phần còn lại là việc mô hình dùng ít token hơn và ít lượt hơn để đi đến cùng một đích. Những trích dẫn khách hàng công bố cùng đợt ra mắt cũng chỉ về cùng một hướng: Box báo cáo chỉ dùng một phần ba số token và câu trả lời ít dài dòng hơn khoảng 40%, Kiro dùng khoảng một nửa số token với 40% số lần gọi ít hơn, Factory ít hơn 20–25% token đầu ra, GitHub nằm trong số ít token và số bước nhất mà họ từng đo được.
Những tuyên bố đó là của khách hàng do nhà cung cấp công bố, không phải kết quả đã được kiểm toán, và con số tổng hợp “rẻ hơn khoảng 40% trên các khối lượng công việc điển hình” là cách Anthropic mô tả mức trung bình trên các khối lượng công việc mà họ đã chọn. Cách nói trung thực để bạn lập kế hoạch: hãy giả định mức giảm giá niêm yết 20% là thật và có thể tính vào kế hoạch, còn 20% dư ra hãy coi là một giả thuyết bạn có thể kiểm chứng trong một buổi chiều bằng cách chạy cùng một tác vụ trên cả hai mô hình và đếm token.
Một lưu ý mang tính cấu trúc về lý do vì sao việc giảm giá cache lại có tác động vượt xa mức đóng góp của nó. Một agent gửi lại một prompt hệ thống dài và cây tệp ở mỗi lượt sẽ trả mức phí đọc cache cho phần lớn đầu vào, chứ không phải mức phí đầu vào mới. Việc giảm mức đó từ 0,50 USD xuống 0,20 USD mỗi triệu token thay đổi bài toán kinh tế của các phiên chạy dài nhiều hơn hẳn so với mức giá nêu trên tiêu đề — và đó là lý do một khối lượng công việc vốn chỉ vừa đủ khả thi trên Opus 5 có thể trở nên khả thi rõ ràng trên Opus 5.5 mà không cần thay đổi gì trong prompt của bạn.
Bốn thay đổi phá vỡ tương thích, dưới dạng danh sách kiểm tra di trú
Opus 5.5 là một mô hình mới, không phải Opus 5 được đổi tên, và ghi chú di trú của Anthropic liệt kê bốn thay đổi sẽ làm hỏng mã đang chạy trong môi trường production:
• Không thể tắt Thinking. Mọi luồng mã từng tắt Thinking sẽ báo lỗi hoặc thay đổi hành vi, và độ sâu giờ đây chỉ được điều khiển thông qua tham số effort.
• Sử dụng công cụ bắt buộc sẽ trả về lỗi. Một tool_choice buộc một công cụ có tên không được hỗ trợ.
• Các khối suy nghĩ gắn liền với mô hình đã tạo ra chúng và với cuộc hội thoại, vì vậy chúng không thể được phát lại giữa các mô hình theo cách mà một số pipeline vẫn giả định.
• Trước đó, computer_20251124 công cụ sử dụng máy tính không được chấp nhận trên Claude API hoặc trên Google Cloud.
Có một thay đổi thứ năm không làm hỏng thứ gì và do đó còn nguy hiểm hơn. Văn bản giữa các lần gọi công cụ giờ đây được trả về bên trong các khối suy nghĩ mà văn bản trống ở cài đặt hiển thị mặc định. Nếu ứng dụng của bạn truyền phát văn bản đó cho người dùng dưới dạng cập nhật tiến độ, nó sẽ im lặng giữa các lần gọi công cụ cho đến khi bạn đặt một giá trị hiển thị trả về văn bản đó. Mọi bài kiểm tra đều đạt; giao diện chỉ ngừng tường thuật.
Ba mục đầu tiên cũng áp dụng cho Claude Fable 5.1, vì vậy một nhóm đã chuyển sang mô hình đó đã làm được một phần công việc này. Một nhóm vẫn còn dùng Opus 5 thì chưa.
Khi nào Opus 5 vẫn là lựa chọn đúng đắn
Việc nâng cấp không tự động và có bốn lý do thực sự để ở lại:
• Tính dự đoán được của chi phí. Opus 5 là một mô hình mà bạn đã nắm rõ đặc điểm. Nếu ngân sách của bạn được xây dựng dựa trên mức tiêu thụ token của nó, thì việc chuyển sang một mô hình suy nghĩ với lượng khác ở cùng mức nỗ lực được đặt tên sẽ khiến mô hình đó mất hiệu lực cho đến khi bạn đo đạc lại.
• Khả năng tương thích. Nếu bất kỳ phần nào trong stack của bạn phụ thuộc vào việc tắt tính năng suy nghĩ, ép buộc dùng một công cụ, hoặc công cụ sử dụng máy tính đời cũ, thì việc di chuyển là công việc lập trình, chứ không phải chỉ thay đổi chuỗi ký tự.
• Định tuyến bảo vệ. Opus 5.5 được trang bị các biện pháp bảo vệ cấp Fable 5.1, nghĩa là hầu hết các yêu cầu về an ninh mạng đều được định tuyến lại đến Claude Opus 4.8 và công việc sinh học sẽ chuyển về Claude Opus 5 trừ khi tài khoản của bạn được xác minh. Nếu sản phẩm của bạn thuộc một trong hai lĩnh vực này, "nâng cấp" có thể đồng nghĩa với việc người dùng của bạn nhận được câu trả lời từ một mô hình nhỏ hơn. Opus 5 không có cơ chế định tuyến đó.
• Tuổi thọ. Opus 5 sẽ không sớm biến mất — Anthropic ấn định thời điểm ngừng hoạt động không sớm hơn ngày 24 tháng 7 năm 2027, tức là còn mười tháng nữa.
Đối với tất cả những người khác, phép tính rất đơn giản: nhiều năng lực hơn, giá thấp hơn, ít token hơn và một danh sách kiểm tra di chuyển mà một kỹ sư duy nhất có thể xử lý trong một ngày.
Chạy cả hai trong quá trình chuyển đổi

Phần khó xử của bất kỳ cuộc di trú flagship nào cũng nằm ở khúc giữa: bạn muốn Opus 5.5 chạy trên lưu lượng mới mà không đặt cược đường đi production vào một model bạn chưa đặc trưng hoá ở các thiết lập effort của riêng mình, và bạn muốn giữ Opus 5 tiếp tục phục vụ trong lúc tìm hiểu. Đó là một bài toán routing chứ không phải tái nền tảng, và đáng để nói chính xác cái gì nằm ở đâu. Claude Opus 5 đã có mặt trên OrcaRouter ngay hôm nay với đúng giá niêm yết của Anthropic, markup 0% — giá niêm yết của nhà cung cấp được chuyển thẳng qua, nên thay đổi giá từ vendor sẽ có hiệu lực phía chúng tôi ngay trong ngày thay vì phải chờ một lần đồng bộ. Claude Opus 5.5 chưa phải là một trong các route của chúng tôi; nó hiện có qua API riêng của Anthropic và các cloud lớn. Khi nó xuất hiện, nó trở thành thêm một route trên cùng một key thay vì một hợp đồng thứ hai và một SDK thứ hai, đó chính là điều cho phép bạn đặt một tỷ lệ phần trăm lưu lượng lên model mới trong khi failover tự động giữ phần còn lại trên model bạn đã đặc trưng hoá. Ghép một lời gọi xuyên qua cả hai — bản nháp từ cái này và lượt kiểm chứng từ cái kia — chỉ là một dòng routing-DSL.
Hãy chính xác về việc điều đó mang lại cho bạn những gì. Nó không cho bạn một benchmark độc lập về Opus 5.5; hiện chưa có gì làm được điều đó, vì những so sánh đối đầu được công bố duy nhất là của chính Anthropic, còn các đơn vị theo dõi độc lập vẫn đang chốt các cấu hình mức nỗ lực. Điều nó mang lại cho bạn là phép đo duy nhất thực sự dự báo được hóa đơn của bạn, trên các prompt của bạn, ở mức nỗ lực mà bạn sẽ triển khai.
Quy tắc quyết định
Nếu bạn đang bắt đầu một việc gì đó mới, hãy dùng Claude Opus 5.5 và bắt đầu ở mức nỗ lực trung bình, rồi đo xem liệu thấp có đáp ứng được với tác vụ của bạn không — Anthropic báo cáo rằng mức thấp tiệm cận các thiết lập cao hơn của nó trong một số đánh giá lập trình với chi phí thấp hơn nhiều, và các con số FrontierCode ở trên cho thấy thiết lập mặc định không bỏ sót nhiều lợi ích.
Nếu bạn đang chạy Claude Opus 5 trong môi trường production, thì yếu tố thúc đẩy bạn chuyển đổi không phải là bảng benchmark. Mà là liệu bạn có thể hấp thụ nổi bốn thay đổi API hay không, và liệu khối lượng công việc của bạn có nằm trong lĩnh vực an ninh mạng hay sinh học hay không — nơi mà cơ chế định tuyến bảo vệ sẽ âm thầm đẩy một phần lưu lượng của bạn sang một mô hình nhỏ hơn. Mọi thứ còn lại của bản nâng cấp này thực chất chỉ là một đợt giảm giá khoác lên mình tấm áo của một bản phát hành mô hình, và những đợt giảm giá như thế thì đáng để nắm bắt.
So sánh trong bài viết này2
Phát hiện từ bài viết này · Benchmark: Artificial Analysis · cập nhật hằng ngày
