Một thẻ tiêu đề cho phần so sánh Grok 4.6 với Claude Opus 5, cho thấy hai bục đều đạt 61 điểm, với một hóa đơn nhỏ và một hóa đơn lớn treo bên dưới để gợi ý rằng điểm số giống nhau nhưng chi phí lại rất khác nhau.
Guides & Insights

Grok 4.6 vs Claude Opus 5: Cùng 61, Hai Nền Kinh Tế Khác Nhau

Tác giả

Rowan Sterling

Ngày đăng

Mô hình mới nhất · 20Xem tất cả mô hình
Benchmark: Artificial Analysis · cập nhật hằng ngày
Quay lại tất cả bài viết

Artificial Analysis cho từng mô hình tiên phong trải qua cùng chín bài đánh giá và công bố hóa đơn. Trên chỉ số Intelligence Index của mình, Grok 4.6Claude Opus 5 đều đạt cùng một con số — 61 — điều này khiến đây là cuộc so tài hiếm hoi mà điểm tổng hợp không thể chỉ ra bạn nên dùng cái nào. Điều có thể chỉ ra lại là một con số ít nổi tiếng hơn từ cùng một nguồn: trên bộ công cụ làm việc tri thức AA-Briefcase, Grok 4.6 hoàn thành một nhiệm vụ trong khoảng 53 lượt và khoảng nửa tỷ token đầu vào, trong khi Claude Opus 5 với nỗ lực tối đa cần khoảng 103 lượt và hai tỷ token cho cùng công việc đó. Đó là khoảng cách gấp bốn lần về mức tiêu thụ token giữa hai mô hình có điểm số nổi bật giống hệt nhau, và nó chỉ lộ ra khi bạn ngừng so sánh thông số mô hình và bắt đầu so sánh hóa đơn.

Cả hai mô hình đều là những bản flagship mới ra mắt hiện tại, giúp việc so sánh trở nên công bằng thay vì chênh lệch thế hệ. {{1}}Grok 4.6 được SpaceXAI phát hành vào ngày 12 tháng 8 năm 2026 như một bản tinh chỉnh của nền tảng Grok 4.5 — cùng cơ sở mixture-of-experts 1,5 nghìn tỷ tham số, được đào tạo lại với các chuỗi giám sát dài hơn và các đợt học tăng cường nhắm vào các tác nhân hoạt động lâu dài.{{/1}} {{2}}Claude Opus 5 được Anthropic phát hành vào ngày 24 tháng 7 năm 2026 như một flagship có mốc thời gian cố định với tư duy thích ứng, cửa sổ ngữ cảnh 1 triệu token, và hỗ trợ nhập hình ảnh và tệp tin.{{/2}} Cả hai đứng ở cùng một vị trí trên bảng xếp hạng độc lập nhưng ở hai đầu đối lập trên bảng giá: {{3}}$2 / $6 mỗi triệu token cho Grok 4.6 so với $5 / $25 cho Claude Opus 5.{{/3}} Điều thú vị là phải tìm ra nửa nào của câu đó quyết định lựa chọn sản xuất của bạn.

Con số 61 ẩn chứa khoảng cách hiệu quả gấp bốn lần

Chỉ số Trí tuệ (Intelligence Index) là tổng hợp của chín bài đánh giá, đó vừa là thế mạnh vừa là điểm mù của nó. Một con số duy nhất lấy trung bình điểm số về lý luận, toán học, lập trình và công việc tri thức sẽ che giấu cách một mô hình đạt được kết quả — và hai mô hình này đạt được theo những cách trái ngược nhau. Bộ công cụ công việc tri thức chuyên nghiệp dạng cặp hồ sơ của Artificial Analysis chính là cửa sổ nhìn rõ nhất vào điều đó: nó đo lường các tác vụ dài hạn thực tế, và ghi nhận Grok 4.6 ở khoảng 53 lượt và 0,5 tỷ token đầu vào mỗi tác vụ, so với Claude Opus 5 Max ở xấp xỉ 103 lượt và 2 tỷ token đầu vào. Xét về chi phí mỗi tác vụ, đó là khác biệt giữa một mô hình hoàn thành công việc nghiên cứu-sản xuất chỉ với một phần tư số token và một mô hình đốt sạch chúng.

Nguyên nhân là một lựa chọn thiết kế, không phải lỗi. {{1}}Grok 4.6 được huấn luyện cụ thể để tự xác minh công việc của mình trong quá trình thực hiện và dừng lại khi một tác vụ con thực sự hoàn thành — xAI mô tả các chuỗi tác vụ dài kèm tự kiểm tra là mục tiêu huấn luyện.{{/1}} {{2}}Claude Opus 5 được huấn luyện để suy luận sâu và có kiến thức rộng, và hành vi mặc định của nó là suy nghĩ kỹ hơn và tham khảo nhiều hơn mức thực sự cần thiết.{{/2}} {{3}}Cả hai đều là "mô hình suy luận"; chúng phân bổ nỗ lực khác nhau, và sự phân bổ đó chính là đặc tả quan trọng đối với khối lượng công việc của agent.{{/3}}

The OrcaRouter model page for grok/grok-4.6, showing the New and Featured badges, the $2.00 per million input and $6.00 per million output pricing, a 500K token context window, and the released August 12, 2026 label.

Khoảng cách này quan trọng nhất đối với các tác nhân gọi mô hình trong một vòng lặp — các tác nhân nghiên cứu, các tác nhân lập trình chạy hàng chục lượt, các quy trình xử lý tài liệu theo lô qua đêm. Mỗi lượt đều được tính phí, và mọi token đầu vào là ngữ cảnh phải được gửi lại ở lượt gọi tiếp theo. Một mô hình hoàn thành trong 53 lượt với 0.5B token không chỉ rẻ hơn trên mỗi token; nó rẻ hơn trên mỗi nhiệm vụ khoảng một bậc độ lớn so với mô hình mất 103 lượt với 2B token, trước cả khi bạn nhân với giá niêm yết.

Bảng thông số kỹ thuật, cả hai mặt

Nơi chúng khác nhau trên giấy tờ, mỗi điểm một dòng:

Intelligence Index — Grok 4.6 đạt 61 điểm, xếp hạng #6 trong 184; Claude Opus 5 cũng đạt 61 điểm, được xếp cùng nhau ở vị trí dẫn đầu bảng. Một sự hòa nhau, theo Artificial Analysis.

Giá niêm yết cho mỗi 1 triệu token — Grok 4.6 với $2 đầu vào / $6 đầu ra (tăng gấp đôi lên $4 / $12 cho các lời nhắc từ 200K token đầu vào trở lên); Claude Opus 5 với $5 đầu vào / $25 đầu ra, với giảm giá hàng loạt 50% xuống còn $2.50 / $12.50.

Cửa sổ ngữ cảnh — 500K token cho Grok 4.6 so với 1.000.000 cho Claude Opus 5, đây là lợi thế thông số rõ ràng nhất mà một trong hai mô hình sở hữu.

Đầu ra tối đa — Claude Opus 5 cho phép tối đa 128K token đầu ra (300K qua batch API); trần đầu ra của Grok 4.6 thấp hơn, ở mức của một câu trả lời dài điển hình.

Đầu vào — cả hai đều chấp nhận văn bản và hình ảnh; Claude Opus 5 cũng chấp nhận tệp, và phiên bản đầu vào đa phương thức của Anthropic tiếp cận tài liệu trực tiếp hơn.

GDPVal-AA v2 (knowledge work) — Grok 4.6 đạt 1.753 Elo so với Claude Opus 5 đạt 1.852 Elo. Opus 5 giành ngôi vương về chất lượng công việc tri thức ở thước đo mà hiệu quả briefcase nghiêng về Grok. [Artificial Analysis]

CursorBench v3.2 — 69,9% cho Grok 4.6 so với 70,0% cho Claude Opus 5, gần như ngang bằng trên điểm chuẩn tác tử lập trình mà cả hai đều được đánh giá trên đó. [Artificial Analysis]

Kiểm soát suy luận — Claude Opus 5 hiển thị núm điều chỉnh mức nỗ lực từ thấp đến tối đa và bật tư duy thích ứng theo mặc định; Grok 4.6 hiển thị mức độ suy luận nhưng được tinh chỉnh theo mặc định ưu tiên các chuỗi tác vụ dài.

Điểm của việc đặt chúng cạnh nhau là không mô hình nào chiếm ưu thế hoàn toàn. Claude Opus 5 là mô hình đa năng tốt hơn trên lý thuyết: ngữ cảnh dài hơn, trần đầu ra cao hơn, hỗ trợ tệp đầu vào, chất lượng công việc tri thức cao hơn. Grok 4.6 đáng giá hơn và là tác nhân hiệu quả hơn. Câu hỏi duy nhất còn lại là điều nào trong số đó mô tả đúng công việc bạn thực sự đang có.

A comparison scoreboard for Grok 4.6 and Claude Opus 5: both score 61 on the AA Intelligence Index; Grok 4.6 lists at $2/$6 with 500K context, GDPVal-AA v2 of 1,753, an AA-Briefcase spend of 0.5B tokens and CursorBench v3.2 of 69.9%, versus Claude Opus 5 at $5/$25 with 1M context, GDPVal-AA v2 of 1,852, an AA-Briefcase spend of 2B tokens and CursorBench v3.2 of 70.0%.

Nơi Claude Opus 5 xứng đáng với mức giá cao cấp của mình

{{1}}Các con số ra mắt của Anthropic — do hãng tự công bố, chưa được kiểm chứng độc lập — đưa Claude Opus 5 lên mức 96,0% trên SWE-bench Verified và 79,2% trên SWE-bench Pro, cùng điểm OSWorld 70,6% cho khả năng sử dụng máy tính.{{/1}} Trên chỉ số tổng hợp toàn diện, điểm 61 của nó ngang bằng với Grok 4.6, và trên GDPVal-AA, nó vượt trội rõ rệt. {{2}}Điều đó thể hiện trong thực tế là một mô hình đứng vững suốt trọn một ngày làm việc của nhân viên tri thức: soạn thảo, phân tích, suy luận tài liệu dài, tác vụ hình ảnh kết hợp văn bản, và lập trình — tất cả trong một nơi duy nhất với một triệu token dung lượng ngữ cảnh.{{/2}}

Cửa sổ ngữ cảnh chính là lý do thực sự để chọn nó. Giới hạn 500K token là lớn, nhưng vẫn không đủ để chứa cả một kho mã nguồn cộng với một kho tài liệu nghiên cứu cộng với kết quả trung gian của một phiên agent dài. Các đội ngũ thực hiện phân tích sâu một lượt trên các kho dữ liệu rất lớn — một kho lưu trữ hoàn chỉnh, một năm hồ sơ tài chính, một chồng PDF dày — sẽ đụng trần của Grok 4.6 và không bao giờ chạm tới trần của Claude Opus 5. Với những khối lượng công việc đó, ngữ cảnh bổ sung không phải là thứ xa xỉ; nó là sự khác biệt giữa việc chứa trọn công việc và việc phải điều phối quanh giới hạn.

Nơi Grok 4.6 là lựa chọn mua tốt hơn

Đảo ngược các dữ kiện tương tự và Grok 4.6 là lựa chọn đáng mua hơn cho các pipeline agent, và không chỉ là một chút. Nó rẻ hơn 2.5× ở chi phí đầu vào và 4.2× rẻ hơn ở chi phí đầu ra so với giá niêm yết của Opus 5, và hiệu quả token mỗi tác vụ càng nhân đôi lợi thế đó: các số liệu AA-Briefcase cho thấy khoảng 4× ít token hơn và 2× ít lượt thực hiện hơn để đạt cùng kết quả công việc tri thức. Nhân 4× với 2.5× và một tác vụ có giá $1.00 theo kinh tế học của Opus 5 sẽ có chi phí vào khoảng $0.10 theo kinh tế học của Grok 4.6 — trước khi chiết khấu theo lô từ phía Opus thu hẹp phần nào khoảng cách đó.

Trong lĩnh vực mã hóa tác tử cụ thể, kết quả DeepSWE 1.1 của Grok 4.6 đã cải thiện từ 54% lên 65,9% giữa bản 4.5 và 4.6, đồng thời điểm CursorBench của nó chỉ kém Opus 5 nửa điểm trong khi vẫn tự xác minh công việc của chính mình trong suốt quá trình. Đối với một đội ngũ chạy hàng nghìn lượt gọi tác tử mỗi ngày, nơi mỗi lượt gọi là một vòng lặp nhiều bước, thì kinh tế học trên mỗi tác vụ và quỹ đạo ngắn hơn chính là ranh giới giữa một sản phẩm khả thi và tốc độ đốt tiền. Đó là lập luận mà xAI đang đưa ra, và dữ liệu hiệu quả độc lập ủng hộ hướng đi đó.

Quyết định định tuyến

Đây là trận đấu mà một bộ định tuyến xứng đáng với giá trị của nó, vì câu trả lời đúng là "cả hai, với sự phân chia được xác định bởi hình dạng khối lượng công việc." Grok 4.6 và Claude Opus 5 đều hoạt động trên OrcaRouter với giá niêm yết của từng nhà cung cấp — $2 / $6 cho grok/grok-4.6, $5 / $25 cho anthropic/claude-opus-5 — với mức chênh lệch 0%, do đó con số trong mô hình chi phí của bạn là con số thực tế được tính phí. Cơ chế giúp việc phân chia này trở nên thực tế: một khóa API cho cả hai mô hình, tự động chuyển đổi dự phòng nếu điểm cuối của một nhà cung cấp bị suy giảm giữa một phiên chạy agent dài, và một DSL định tuyến có thể gửi các lượt ngắn, tần suất cao đến Grok 4.6 và chuyển công việc tầm xa, cần nhiều ngữ cảnh lên Claude Opus 5 trong một lần gọi duy nhất. Bạn không cần hợp đồng thứ hai để chạy kiến trúc hai tầng, và bạn có thể điều chỉnh lại sự phân chia khi dữ liệu lưu lượng thực tế đến thay vì đoán từ các thẻ mô hình.

The OrcaRouter model page for anthropic/claude-opus-5, showing the $5.00 per million input and $25.00 per million output pricing, the 1M token context window, and the 128K max output tokens.

Cái nhìn trung thực

Sự hòa nhau trên chỉ số tổng hợp là có thật và nó là một cái bẫy. Các mô hình có cùng điểm số không thể hoán đổi cho nhau; chúng khác biệt chính xác ở nơi mà điểm số bị mù. Claude Opus 5 là lựa chọn mặc định an toàn hơn cho các công việc tri thức rộng, nặng về ngữ cảnh, xử lý tài liệu và hình ảnh, nơi cửa sổ 1 triệu token và suy luận sâu quan trọng hơn chi phí. Grok 4.6 là lựa chọn mặc định tốt hơn cho các vòng lặp tác nhân khối lượng lớn, nơi hiệu quả token trên mỗi tác vụ và lợi thế giá 2,5 lần cộng dồn thành sự chênh lệch hóa đơn một bậc độ lớn. Nếu khối lượng công việc của bạn thuộc loại thứ nhất, hãy trả tiền cho Opus 5 và đừng lo lắng về giá nữa. Nếu thuộc loại thứ hai, sự ngang bằng 61 điểm trên giấy tờ là lý do tốt nhất bạn từng có để thử Grok 4.6 trước — điểm chuẩn nói rằng chúng bằng nhau, còn hóa đơn thì nói rằng không phải.

So sánh trong bài viết này1

Phát hiện từ bài viết này · Benchmark: Artificial Analysis · cập nhật hằng ngày

© 2026 OrcaRouter

Dành cho nhà cung cấp

Bạn vận hành nền tảng suy luận? Đưa mô hình của bạn lên OrcaRouter.

providers@orcarouter.ai

Tham gia cộng đồng

Discordsupport@orcarouter.aiXGitHubYouTube