Đã tạo thẻ tiêu đề hero cho Claude Opus 5.5 so với Grok 4.6, được chia bởi một dải phân cách dọc: 'Claude Opus 5.5' với '$4.00 / $20.00' ở bên trái, 'Grok 4.6' với '$2.00 / $6.00' ở bên phải, và dòng tagline 'MỘT MÔ HÌNH ĐỌC, MÔ HÌNH KIA HÀNH ĐỘNG' ở phía dưới cùng, với logo OrcaRouter ở góc dưới cùng bên phải.
Guides & Insights

Claude Opus 5.5 vs Grok 4.6: Một mô hình đọc, mô hình kia hành động

Tác giả

Alistair Wren

Ngày đăng

Mô hình mới nhất · 20Xem tất cả mô hình →
Benchmark: Artificial Analysis · cập nhật hằng ngày
Quay lại tất cả bài viết

Claude Opus 5.5 và Grok 4.6 là hai cách rẻ nhất để mua một mô hình đẳng cấp tiên phong có thể chứa nửa triệu token ngữ cảnh — và chúng không phải là cùng một sản phẩm. Ở một phép đo, Grok 4.6 chỉ kém mức trần tuyệt đối ba điểm: 94,9 trên GPQA Diamond, một bộ câu hỏi khoa học trình độ sau đại học mà mô hình chủ lực của Anthropic cũng nằm trong cùng dải điểm. Ở phép đo kế tiếp, nó lại kém tới ba mươi tám điểm. Trên Terminal-Bench 4.0, bài kiểm chuẩn terminal dạng tác nhân yêu cầu mô hình hoàn thành công việc thực tế trong shell, Artificial Analysis chấm Grok 4.6 được 21,21% và Claude Opus 5.5 được 59,60%. Đó không phải là lỗi in theo hướng nào cả, và toàn bộ hình thái của cặp đôi này nằm ở việc giải thích vì sao cả hai con số đều đúng cùng lúc.

Hai bản phát hành, cùng một khung giá, cách nhau bốn tháng

SpaceXAI phát hành Grok 4.6 vào ngày 12 tháng 8 năm 2026 với tư cách là sản phẩm chủ lực hiện tại của dòng Grok, ở mức $2.00 mỗi triệu token đầu vào và $6.00 đầu ra, với cửa sổ ngữ cảnh 500.000 token và bề mặt đầu vào văn bản, hình ảnh và tệp. Anthropic phát hành Claude Opus 5.5 vào ngày 22 tháng 9 năm 2026, khoảng sáu tuần sau đó, ở mức $4.00/$20.00 với cửa sổ ngữ cảnh 1.000.000 token và 128.000 token đầu ra. Cả hai đều hỗ trợ nỗ lực suy luận có thể cấu hình, gọi công cụ và đầu ra có cấu trúc; cả hai đều hỗ trợ bề mặt trò chuyện tương thích OpenAI cũng như định dạng riêng của nhà cung cấp.

Vậy nên cách đọc ngây thơ là một sự đánh đổi rõ ràng: Grok 4.6 có giá đầu vào bằng một nửa và giá đầu ra khoảng một phần ba, còn Claude Opus 5.5 đáp lại với cửa sổ ngữ cảnh gấp đôi. Sự đánh đổi đó là thật, và với công việc tài liệu dài, nó có thể là điều duy nhất đáng bận tâm. Đó cũng không phải nơi có sự phân kỳ thú vị, bởi vì hai mô hình đã được đo trên cùng một harness độc lập và không nằm ở cùng một vị trí trên các trục quan trọng đối với công việc agentic.

Những gì danh mục nói về các trục mà cả hai đều được đo theo

Danh mục của OrcaRouter mang thông tin nguồn gốc đánh giá chuẩn theo từng dòng — mỗi số liệu đều ghi rõ đơn vị đánh giá mà nó đến từ — vì vậy các cặp bên dưới đều đến từ cùng một nguồn cho cả hai mô hình, Artificial Analysis, thay vì một bên là số liệu của nhà cung cấp và bên kia là của bên thứ ba:

• GPQA Diamond — Claude Opus 5.5 không được liệt kê trên trục này trong danh mục của chúng tôi; Grok 4.6 đạt 94,9%

• Bài kiểm tra cuối cùng của nhân loại — 61,4% cho Claude Opus 5.5 so với 42,9% cho Grok 4.6

• SciCode — 66.9% so với 56.5%

• Khả năng ghi nhớ ngữ cảnh dài — 84,7% so với 80,3%

• Terminal-Bench 4.0 — 59,60% so với 21,21%

• AA Intelligence Index — 57,6 so với 44,3

Hàng GPQA được cố ý để trống ở phía Anthropic thay vì điền từ bộ tài liệu của nhà cung cấp. Con số 94,9 của Grok 4.6 ở đó là con số mạnh nhất trên thẻ điểm của nó và là con số thật — một phép đo độc lập, không phải tuyên bố của SpaceXAI — và nó nói lên điều gì đó thực sự về mô hình: khi nhiệm vụ là một câu hỏi được đặt đúng dạng với một đáp án có thể bảo vệ được, Grok 4.6 thể hiện ở mức tiên phong. Đọc nó bên cạnh con số 21,21% của Terminal-Bench 4.0 và hình dạng trở nên rõ ràng. Việc đưa ra một câu trả lời đúng về khoa học và việc thực thi một tác vụ năm bước trong shell trên một hệ thống tệp thực là những năng lực khác nhau, và Grok 4.6 tiến xa hơn nhiều ở năng lực thứ nhất so với năng lực thứ hai.

Một lưu ý về cặp so sánh đó trước khi nó được dùng như một phán quyết: các số liệu Artificial Analysis của hai mô hình được ghi nhận ở những ngày đánh giá khác nhau, và bộ số của Grok 4.6 là bộ cũ hơn. Phép so sánh là giữa một mô hình được đánh giá vào tháng Tám và một mô hình được đánh giá vào tháng Chín trên một harness mà bản thân nó đã được chỉnh sửa trong suốt khoảng thời gian đó. Hướng của khoảng cách nhất quán trên năm trục riêng biệt, đó là lý do chúng tôi coi đó là tín hiệu, nhưng các giá trị điểm chính xác nên được đọc như một so sánh tháng Tám với tháng Chín, chứ không phải so sánh trong cùng một ngày.

Một chỉ mục được xây dựng bởi một người cũng không bán cái nào trong hai thứ đó.

Có một thước đo độc lập thứ hai, và nó đồng thuận về hướng, trong khi lại ít sẵn lòng hơn nhiều trong việc đưa ra những phân biệt tinh tế. Chỉ số Năng lực Epoch, do Epoch AI xây dựng như một tổ hợp của hơn năm mươi benchmark và được định thang lại sao cho Claude 3.5 Sonnet nằm ở 130 và GPT-5 ở 150, đặt Claude Opus 5.5 ở mức 167,35 trong tệp chúng tôi đọc ngày 2 tháng 10 năm 2026. Grok 4.6 ở mức 156,61, từ một đánh giá ngày 12 tháng 8. Đó là khoảng cách 10,74 điểm trên một thang đo mà, khi chỉ số này ra mắt, người ta đã quan sát thấy khoảng năm điểm tương ứng với mức gấp đôi trong thước đo chân trời thời gian của METR — một khoảng cách rộng, và nằm thoải mái bên ngoài các khoảng đã công bố của hai mô hình là 164,0 đến 172,0 và 154,66 đến 158,93, vốn hoàn toàn không chồng lấn.

Đáng lưu ý là những gì chỉ số này không giải quyết. Nó xếp Claude Sonnet 5.5 ở mức 165.2 và Claude Fable 5.1 ở mức 164.82, cả hai đều cao hơn Grok 4.6, và cả hai đều rẻ hơn trên mỗi triệu token đầu ra so với mức giá bậc hai của Grok 4.6. Bất kỳ ai chỉ chọn dựa trên năng lực trên mỗi đô-la đều có lựa chọn thứ ba và thứ tư trong cùng một họ nhà cung cấp, còn sự ghép cặp trong bài viết này nói về một điều khác: mỗi mô hình giỏi ở điểm gì.

Các bảng giá, và hàng chỉ xuất hiện trên một trong số chúng

A two-column scoreboard comparing Claude Opus 5.5 and Grok 4.6 across six rows. Left column Claude Opus 5.5: input $4.00, output $20.00, cache read $0.20, context 1M tokens with 128K max output, AA Intelligence Index 57.6, Epoch Capabilities Index 167.35. Right column Grok 4.6: input $2.00 doubling to $4.00 above 200K tokens, output $6.00 doubling to $12.00, cache read $0.50, context 500K tokens, AA Intelligence Index 44.3, Epoch Capabilities Index 156.61. A footer line reads 'Prices and catalogue figures per the OrcaRouter catalogue; Index figures per Artificial Analysis and the Epoch Capabilities Index.'

Bảng giá của Grok 4.6 có một bậc mà bảng giá của Claude Opus 5.5 không có: các yêu cầu trên 200.000 token lời nhắc bị tính phí gấp đôi mức cơ bản, vì vậy đầu vào tăng từ $2.00 lên $4.00 và đầu ra từ $6.00 lên $12.00, với mức đọc bộ nhớ đệm chuyển từ $0.50 lên $1.00. Claude Opus 5.5 tính $4.00/$20.00 với mức đọc bộ nhớ đệm $0.20 cố định trong toàn bộ cửa sổ 1.000.000 token. Sự đảo ngược đó là hệ quả thực tế của việc mua ngữ cảnh dài từ một trong hai mô hình, và nó đảo ngược so sánh giá niêm yết khi khối lượng công việc thực sự tăng lên:

• Giá tại 30.000 token đầu vào — Claude Opus 5.5 là mẫu đắt đỏ, với khoảng 28 xu cho 30.000 đầu vào và 8.000 đầu ra, so với khoảng 11 xu cho Grok 4.6

• Giá ở mức 250.000 token đầu vào — thứ tự đảo ngược, vì Grok 4.6 đã chuyển sang bậc gấp đôi của nó trong khi Claude Opus 5.5 thì chưa

• Đọc bộ nhớ đệm — $0,20 mỗi triệu cho Claude Opus 5.5 so với $0,50, tăng lên $1,00 khi vượt ngưỡng, cho Grok 4.6

• Đầu ra tối đa — 128.000 token đối với Claude Opus 5.5; giới hạn đầu ra của Grok 4.6 không được công bố trong hồ sơ danh mục

Grok 4.6 cũng có một khoảng trống đáng nói thẳng ra thay vì để sau này mới phát hiện. Hồ sơ của nó không liệt kê bất kỳ con số đầu ra tối đa nào — trường đó chưa được đo, không phải bằng không — nên một khối lượng công việc phụ thuộc vào các phản hồi đơn lẻ rất dài không có con số nào được công bố để lập kế hoạch dựa trên đó ở phía bên kia của so sánh.

Cột hiệu suất không nên được đọc

Danh mục của chúng tôi cũng có một bảng hiệu suất phục vụ cho mỗi mô hình, và trên Grok 4.6, đó là thứ gây hiểu nhầm nhất trên trang. Thẻ hiển thị độ trễ p50 là 10.000 mili giây và tỷ lệ lỗi 97,58% trong cửa sổ bảy ngày, với 26.184 token được phục vụ trong khoảng thời gian đó. Những trường đó không mô tả một mô hình chậm. Chúng mô tả một mô hình hầu như không được gọi đến: ở mức lưu lượng đó, mẫu quá mỏng để một phân phối độ trễ có ý nghĩa gì, và tỷ lệ lỗi phản ánh một số ít lần thử chứ không phải chất lượng dịch vụ. Coi khối đó là bằng chứng rằng Grok 4.6 chậm chính là đọc một hiện tượng giả tạo do đo lường như thể đó là một phép đo.

Ngược lại, bảng của Claude Opus 5.5 có một tổng thể đằng sau nó — p50 ở mức 4,4 giây trong cửa sổ bảy ngày với các mẫu hằng ngày, và 156 triệu token được phục vụ trong cùng giai đoạn đó. Ngay cả con số đó cũng nên được hiểu đúng như bản chất của nó: lưu lượng từ playground của chính chúng tôi, vốn là một mẫu người dùng của chúng tôi chứ không phải là một thuộc tính của mô hình.

Cái nào cần định tuyến, và làm thế nào để tự mình tìm ra trong công việc của bạn

Sự phân tách mà các con số mô tả đủ ổn định để hành động dựa trên đó. Claude Opus 5.5 là lựa chọn cho công việc agentic và tầm xa — khoảng cách Terminal-Bench 4.0 59,60% so với 21,21% là mức chênh lệch lớn nhất trên bất kỳ trục nào mà cả hai mô hình được đo, và đó là trục dự báo liệu một mô hình có thể được giao một nhiệm vụ thay vì một câu hỏi hay không. Đây cũng là lựa chọn khi prompt thực sự dài, vì biểu giá không tăng theo bậc và cửa sổ có kích thước gấp đôi. Grok 4.6 là lựa chọn cho công việc dạng câu hỏi với khối lượng lớn: điểm GPQA Diamond 94,9% ở mức $2,00/$6,00 trong 200.000 token đầu tiên là một món hời rất tốt cho các tác vụ truy xuất và trả lời mà không bao giờ tăng lên bậc gấp đôi.

Cả hai đều có trên OrcaRouter với đúng giá niêm yết của nhà cung cấp, chênh lệch 0% — Claude Opus 5.5 ở mức $4.00/$20.00 với $0.20 cho mỗi lần đọc cache, Grok 4.6 ở mức $2.00/$6.00 với mức giá cho phần trên 200K được áp dụng đúng như SpaceXAI quy định — tất cả sau một khóa duy nhất, để cách phân chia ở trên có thể được kiểm chứng trên chính bộ prompt của bạn thay vì phải tranh cãi. Ở những nơi cả hai đều được định tuyến, chuyển đổi dự phòng tự động nằm ở bên dưới, điều này rất đáng có khi mô hình rẻ hơn lại chính là mô hình đang nắm giữ luồng agentic.

Phán quyết mà cặp đôi này mang lại: Grok 4.6 là người đọc tốt hơn còn Claude Opus 5.5 là người làm việc tốt hơn. Con số 94,9 trên GPQA Diamond và 21,21 trên Terminal-Bench là cùng một mô hình được đo hai lần, và việc biết được khối lượng công việc của bạn trông giống con số nào trong hai con số đó chính là toàn bộ quyết định.

Screenshot of the OrcaRouter model page for Claude Opus 5.5 (anthropic/claude-opus-5.5), showing the model header, a 1M-token context window with up to 128K output, the Vision, Tools, JSON and Reasoning capability tags, and the input and output price figures per million tokens.Screenshot of the OrcaRouter model page for Grok 4.6 (grok/grok-4.6), showing the model header, the context window of 500,000 tokens, the text, image and file input surface, the capability tags, and the input and output price figures per million tokens.

So sánh trong bài viết này1

Phát hiện từ bài viết này · Benchmark: Artificial Analysis · cập nhật hằng ngày