Thẻ tiêu đề ghi “Grok 4.7 vs Claude Opus 5” với tiêu đề phụ “Khoảng cách giá là thật; sự ngang bằng thì không”, và ba thẻ: AA Index v4.3.2 46 vs 51, Giá mỗi 1M $2/$6 vs $5/$25, và Terminal-Bench 4.0 26 vs 49.
Guides & Insights

Grok 4.7 vs Claude Opus 5: Khoảng cách về giá là có thật, còn sự ngang bằng thì không

Tác giả

Rowan Sterling

Ngày đăng

Mô hình mới nhất · 20Xem tất cả mô hình
Benchmark: Artificial Analysis · cập nhật hằng ngày
Quay lại tất cả bài viết

Bạn có thể gọi Grok 4.7 với giá $2.00 cho mỗi triệu token đầu vào và $6.00 cho mỗi triệu token đầu ra. Bạn có thể gọi Claude Opus 5 với giá $5.00 và $25.00. Đó là mức chênh lệch 4.2 lần ở đầu ra — kiểu khoảng cách thường đủ để ngã ngũ một so sánh trước cả khi các benchmark được mở ra. Nhưng nó không định đoạt được trường hợp này. Trên phiên bản Artificial Analysis Intelligence Index mà cả hai mô hình hiện đang được chấm điểm — v4.3.2, bản sửa đổi được công bố vào ngày 19 tháng 9 năm 2026 — Claude Opus 5 đứng ở mức 51 và Grok 4.7, được nhà cung cấp phát hành vào ngày 21 tháng 9 năm 2026, đứng ở mức 46. Năm điểm không phải là một cách biệt áp đảo, nhưng hình dạng của năm điểm ấy thì đúng là như vậy: Opus 5 thắng tám trong mười đánh giá trong chỉ số đó. Lập luận của mô hình rẻ hơn nằm ở giá, ngữ cảnh thì hòa nhau, và nơi duy nhất mà lợi thế giá của Grok 4.7 lẽ ra phải quan trọng nhất lại đúng là nơi nó biến mất.

Hai flagship, hai bảng giá rất khác biệt

Claude Opus 5 đã có mặt trên thị trường kể từ ngày 24 tháng 7 năm 2026 và là mẫu flagship thuộc phân khúc Opus của Anthropic, nằm dưới Claude Fable 5.1 trong đội hình sản phẩm của chính công ty. Nó sở hữu cửa sổ ngữ cảnh 1M token với mức giá cố định — Anthropic nói rõ rằng một yêu cầu 900k token được tính cùng mức giá trên mỗi token như một yêu cầu 9k token, hoàn toàn không có phụ phí ngữ cảnh dài — và đầu ra tối đa 128K, có thể mở rộng lên 300K trên Message Batches API. Khả năng suy luận mang tính thích ứng và được bật mặc định, với thang mức nỗ lực gồm low, medium, high, xhigh và max, mặc định là high. Trọng số ở dạng đóng.

Grok 4.7 mới ra đời được một ngày. Nó có ngữ cảnh 500k token, nhận văn bản và hình ảnh đầu vào rồi trả về văn bản, và có núm điều chỉnh nỗ lực suy luận của riêng mình. Giá niêm yết của nó là 2,00 USD cho đầu vào và 6,00 USD cho đầu ra trên mỗi triệu token khi dưới 200k token lời nhắc, tăng lên 4,00 USD và 12,00 USD khi đạt hoặc vượt ngưỡng đó; lượt đọc từ bộ nhớ đệm có giá 0,50 USD và 1,00 USD trong cùng hai khung đó. xAI cũng niêm yết một biến thể nhanh hơn chạy với tốc độ đầu ra gần gấp đôi với mức giá gần gấp đôi, mặc dù cấu hình đó đã được tung ra mà không kèm theo phép đo tốc độ nào được công bố. Trọng số ở đây cũng đóng, điều này loại bỏ lối thoát "tự chạy nó" khỏi cả hai phía của so sánh này.

Hội đồng độc lập không thân thiết, và điều đó không có gì đáng tâng bốc.

Cả hai mô hình này đều được chấm điểm trên chỉ số v4.3.2 của Artificial Analysis, chỉ số này bao gồm mười bài đánh giá bao quát tác nhân, lập trình, kiến thức tổng quát và suy luận khoa học. Đặt hai cột cạnh nhau khiến mức chênh lệch nổi bật năm điểm trông có vẻ hào phóng đối với mô hình rẻ hơn — một khoảng cách năm điểm duy nhất trong một chỉ số tổng hợp có thể che giấu rất nhiều điều, và ở đây nó che giấu một kết quả gần như toàn thắng.

Trí tuệ tổng hợp — Grok 4.7 (xhigh): 46 trên Artificial Analysis Intelligence Index v4.3.2. Claude Opus 5 (suy luận thích ứng, nỗ lực tối đa): 51 trên cùng phiên bản.

Suy luận khó — Grok 4.7: Humanity's Last Exam 43, CritPt 18. Claude Opus 5: HLE 55, CritPt 29. Khoảng cách lần lượt là mười hai điểm và mười một điểm, đều nghiêng về phía Opus 5.

Terminal tác tử — Grok 4.7: Terminal-Bench 4.0 26. Claude Opus 5: 49. Đây là khoảng cách đơn lẻ lớn nhất trên bảng, và nó nằm ở bộ đánh giá gần nhất với công việc tự trị thực tế.

Tự động hóa nơi làm việc — Grok 4.7: AutomationBench-AA 66%. Claude Opus 5: 57%. Đây là chiến thắng rõ ràng duy nhất của Grok 4.7, và là một chiến thắng thực sự — chín điểm trên bài đánh giá chấm điểm liệu một tác nhân có hoàn thành trọn vẹn một quy trình công việc mà không vấp phải rào chắn bảo vệ hay không.

Kiến thức và tính trung thực — Grok 4.7: AA-Omniscience 32. Claude Opus 5: 37. Cả hai mô hình đều gặp ảo giác; Opus 5 ít hơn ở chỉ số này.

Ngữ cảnh dài — Grok 4.7: AA-LCR v1.1 77%, cửa sổ 500k token. Claude Opus 5: 79%, cửa sổ 1M token.

Chi phí chạy chỉ số — Grok 4.7: 240 triệu token đầu ra trong toàn bộ quá trình đánh giá, bị Artificial Analysis đánh dấu là dài dòng bất thường. Claude Opus 5: 140 triệu. Grok 4.7 tiêu tốn gấp 1,7 lần số token để đạt điểm thấp hơn.

OrcaRouter model page for Claude Opus 5 showing the anthropic/claude-opus-5 identifier, a 1M-token context window, 128K maximum output, text, image and file input with text output, list rates of $5.00 per 1M input and $25.00 per 1M output, and 69.9M tokens of traffic over seven days.

Nơi lợi thế về giá của Grok 4.7 tiêu tan

Đây là phép tính mà bảng giá che giấu. Lấy một yêu cầu agentic thực tế: 30k token đầu vào, 8k đầu ra. Grok 4.7 tính $0.06 cho đầu vào và $0.048 cho đầu ra — khoảng mười một xu. Claude Opus 5 tính $0.15 cho đầu vào và $0.20 cho đầu ra — khoảng ba mươi lăm xu. Đó là mức chênh gấp 3 lần thực sự, và ở quy mô này, Grok 4.7 rõ ràng là lựa chọn hiển nhiên nếu chỉ xét về chi phí.

Giờ hãy lấy đúng kiểu yêu cầu mà chính hoạt động marketing của Grok 4.7 được xây dựng xoay quanh: một phiên tác tử (agentic) với ngữ cảnh dài. Đẩy prompt vượt mốc 200k token và mức giá của Grok 4.7 tăng gấp đôi lên 4,00 USD cho đầu vào và 12,00 USD cho đầu ra. Claude Opus 5 thì không hề nhúc nhích — cửa sổ 1M của nó vẫn tính giá phẳng 5,00 USD và 25,00 USD. Với 250k token đầu vào và 8k token đầu ra, Grok 4.7 tốn 1,00 USD cho đầu vào và 0,096 USD cho đầu ra, tức khoảng 1,10 USD. Opus 5 tốn 1,25 USD cho đầu vào và 0,20 USD cho đầu ra, tức khoảng 1,45 USD. Khoảng cách đã thu hẹp từ 3 lần xuống còn khoảng 1,3 lần. Đẩy xa hơn nữa — 400k, 500k, tới tận đỉnh cửa sổ của Grok 4.7 — và mức giá phẳng của Opus 5 tiếp tục thu hẹp khoảng cách trong khi cửa sổ của nó vẫn kéo dài tới một triệu token. Grok 4.7 là mô hình rẻ khi prompt ngắn và gần như ngang giá ở những prompt dài, điều này đảo ngược trực giác mà trang báo giá được thiết kế để tạo ra.

Hai lưu ý giữ cho điều này vẫn trung thực. Thứ nhất, bậc ngữ cảnh dài là một cấu trúc giá niêm yết được ghi nhận từ tài liệu mô hình của chính xAI, không phải một phép đo — hóa đơn thực tế phụ thuộc vào caching, và mức giá đọc từ bộ nhớ đệm $0.50 của Grok 4.7 thật sự rẻ. Thứ hai, Artificial Analysis vẫn chưa công bố phép đo tốc độ nào cho Grok 4.7, nên vế “nó nhanh hơn” trong lập luận rẻ-và-nhanh hiện vẫn chưa được kiểm chứng. Điều được đo là Opus 5 đạt 59 token mỗi giây với thời gian đến token đầu tiên là 49 giây — chậm, đắt, và dẫn đầu trên gần như mọi trục chất lượng.

Những gì bạn thực sự sẽ định tuyến

Đây là một so sánh mà câu trả lời trung thực khác nhau tùy theo khối lượng công việc, và một router là cách rẻ nhất để hành động dựa trên điều đó. Claude Opus 5 có sẵn trên OrcaRouter, được liệt kê trên trang mô hình riêng của nó với mức giá của nhà cung cấp được chuyển nguyên ở mức 0% markup — vì vậy mức $5.00 và $25.00 của Opus 5 trên danh mục của chúng tôi là giá niêm yết của Anthropic, không phải bản sao bị đánh dấu giá, và nếu Anthropic thay đổi thì con số thay đổi trên cùng một key trong cùng ngày. Grok 4.7 không có trong danh mục OrcaRouter tại thời điểm viết bài này; để gọi nó ngày hôm nay bạn phải đi qua API riêng của xAI và các nền tảng bên thứ ba có cung cấp nó. Sự bất đối xứng đó đáng để biết trước khi bạn thiết kế kiến trúc xoay quanh nó.

Two-column scoreboard titled “Grok 4.7 vs Claude Opus 5 - the scoreboard”: AA Index 46 vs 51, Terminal-Bench 4.0 26 vs 49, AutomationBench 66% vs 57%, context 500k vs 1M, price per 1M $2/$6 vs $5/$25, and open weights “no” on both sides.

Mô hình định tuyến rút ra từ các con số rất đơn giản. Hãy gửi các tác vụ ngữ cảnh dài, nặng về suy luận và tác nhân terminal tới Opus 5 — nó thắng Terminal-Bench 4.0 với cách biệt 23 điểm và sở hữu cửa sổ ngữ cảnh gấp đôi với mức giá cố định, đúng chuẩn mực của một tác vụ khó và dài. Hãy gửi các tác vụ tự động hóa và quy trình khối lượng lớn tới Grok 4.7: nó thắng AutomationBench-AA với cách biệt chín điểm và chỉ tốn một phần ba chi phí với prompt ngắn. Vì cả hai đều được truy cập qua một endpoint khi có mặt trong danh mục, sự phân chia đó là một quy tắc định tuyến chứ không phải một hợp đồng nhà cung cấp thứ hai, và chuyển đổi dự phòng tự động nghĩa là giới hạn tốc độ trên một đường trở thành một sự kiện định tuyến thay vì một sự cố ngừng dịch vụ. Khi một khối lượng công việc thực sự cần cả hai — một lượt chạy đầu rẻ và một lượt xác minh đắt — DSL định tuyến kết hợp chúng thành một lệnh gọi duy nhất thay vì hai tích hợp.

Bản án

Nếu bạn chọn dựa trên bằng chứng, Claude Opus 5 thắng trong màn đối đầu này và không hề sát nút: thắng tám trong mười bài đánh giá, hai khoảng cách rộng nhất, gấp đôi ngữ cảnh với mức giá không đổi, và ngân sách token thấp hơn hẳn hai phần ba kích thước mà vẫn đạt điểm cao hơn. Điểm tổng hợp năm điểm đánh giá thấp mức độ dẫn đầu triệt để của nó. Lập luận dành cho Grok 4.7 hẹp hơn so với bảng giá của nó gợi ra, nhưng không phải là rỗng — nó thực sự rẻ hơn ở các kích thước prompt mà hầu hết ứng dụng thực tế sử dụng, nó là mô hình tự động hóa tốt hơn, và nó mới ra đời được một ngày với bộ benchmark của nhà cung cấp vẫn đang được tái lập độc lập. Hãy mua nó cho tự động hóa nhạy cảm về chi phí, theo dõi các con số tốc độ của nó khi Artificial Analysis công bố, và coi mức giá dành cho ngữ cảnh dài là yếu tố quyết định liệu mô hình rẻ có tiếp tục rẻ hay không.

Artificial Analysis page for Grok 4.7 at xhigh reasoning effort: an Artificial Analysis Intelligence Index score of 46, ranked #16 of 655; Speed and Cost both reported as N/A; 240M output tokens from the Intelligence Index run, ranked #140 of 655; a 500k-token context window with text and image input and text output; and comparison charts for intelligence, speed and cost per task.

So sánh trong bài viết này1

Phát hiện từ bài viết này · Benchmark: Artificial Analysis · cập nhật hằng ngày