Thẻ tiêu đề hero được tạo cho một bài viết có tiêu đề 'Grok 4.7 vs Grok 4.6 — cùng giá, khác mô hình', với phụ đề 'Bản phát hành ngày 21 tháng 9 thực sự đã thay đổi điều gì' và các chip số liệu ghi Terminal-Bench 4.0 38,0% so với 20,3%, AA Index 46 so với 44, và $2/$6 ở cả hai.
Guides & Insights

Grok 4.7 vs Grok 4.6: Cùng mức giá $2/$6, nhưng là một mô hình khác bên dưới

Tác giả

Alistair Wren

Ngày đăng

Mô hình mới nhất · 20Xem tất cả mô hình →
Benchmark: Artificial Analysis · cập nhật hằng ngày
Quay lại tất cả bài viết

SpaceXAI đã phát hành Grok 4.7 vào ngày 21 tháng 9 năm 2026, và điều đầu tiên đáng chú ý về nó là thứ đã không thay đổi: giá. Grok 4.7 có giá 2 đô la cho mỗi triệu token đầu vào và 6 đô la cho mỗi triệu token đầu ra, đúng bằng mức mà Grok 4.6 đã có kể từ khi ra mắt vào ngày 12 tháng 8 năm 2026. Cùng bảng giá, cùng cửa sổ ngữ cảnh 500.000 token, cùng đầu vào văn bản và hình ảnh — vậy mà hai mô hình không hề gần nhau trên các đánh giá quan trọng đối với công việc dạng tác nhân. Theo chính các số liệu đã công bố của SpaceXAI, Grok 4.7 gần như gấp đôi Grok 4.6 trên Terminal-Bench 4.0, 38,0% so với 20,3%. Đó chính là toàn bộ cục diện của so sánh này: một cuộc hoán đổi thế hệ cùng mức giá, nơi gần như toàn bộ lợi ích đều dồn vào một chỗ, và những phần của Grok 4.6 từng khiến các đội ngũ vận hành khó chịu vẫn còn nguyên.

Điều gì thực sự đã thay đổi giữa hai mô hình

Mô tả của chính SpaceXAI về bản phát hành này rất hạn hẹp, và đáng để trích dẫn hình dạng của nó hơn là những tính từ. Grok 4.7 được xây dựng trên một mô hình cơ sở lớn hơn so với Grok 4.6, và nó đã trải qua một quá trình học tăng cường dài hơn nhắm đến các tác vụ "có thể mất hàng giờ để hoàn thành." Công ty nói rằng quá trình đó đã mài giũa ba thứ: khả năng tự xác minh, xử lý ngữ cảnh dài, và hành vi trong môi trường Grok Bot. Không có tuyên bố nào về một kiến trúc mới, một phương thức mới, hay một ngăn xếp phục vụ khác.

Cách đóng khung đó quan trọng vì nó dự đoán được những cải thiện trên benchmark sẽ xuất hiện ở đâu, và chúng xuất hiện đúng ở đó. Một lượt RL dài hơn trên các tác vụ khó kéo dài nhiều giờ sẽ cải thiện công việc trên terminal và repository nhiều hơn hẳn so với việc cải thiện một bài kiểm tra kiến thức. Nếu bạn hy vọng Grok 4.7 sẽ là một mô hình rộng hơn Grok 4.6, thì ghi chú phát hành nói ngược lại — nó vẫn cùng hình dạng mô hình, được huấn luyện sâu hơn vào phần khó nhất của công việc agentic.

Câu chuyện về tham số là phần duy nhất trong số này không phải là công bố của nhà cung cấp. Musk nói vào đầu tháng 9 rằng Grok 4.7 có khoảng 2,1 nghìn tỷ tham số so với 1,5 nghìn tỷ của Grok 4.6, tức tăng 40%, và con số đó đã được lặp lại khắp nơi kể từ đó. Nó chưa từng xuất hiện trên bảng thông số kỹ thuật của SpaceXAI. Hãy coi đó là một tuyên bố được lan truyền rộng rãi về mô hình cơ sở, không phải một thông số kỹ thuật đã được xác nhận — và lưu ý rằng số lượng tham số nói rất ít về chi phí phục vụ hoặc năng lực khi kiến trúc là thưa, mà dòng Grok thì đúng là như vậy.

Khoảng cách điểm chuẩn, với nhãn nguồn được đính kèm

Mọi số liệu trong phần này đều đến từ tài liệu phóng của {{1}}SpaceXAI{{/1}}. Không có số liệu nào trong đó đã được tái lập một cách độc lập vào thời điểm viết bài, và cách đọc trung thực là coi nó như một tập hợp tuyên bố tình cờ có độ cụ thể bất thường — điều này khiến nó có thể kiểm chứng về sau, nhưng không làm cho nó được xác minh ở hiện tại.

• Terminal-Bench 4.0 — Grok 4.7 38,0% (theo báo cáo của nhà cung cấp) so với Grok 4.6 20,3%. Đây là mức chênh lệch lớn nhất trong bản phát hành, và cũng là mức khớp với tuyên bố "RL lâu hơn trên các tác vụ khó hơn".

• CursorBench 4.0 — Grok 4.7 46,3% (do nhà cung cấp báo cáo) so với Grok 4.6 40,4%. Một mức tăng thực sự, nhưng còn khiêm tốn — dưới sáu điểm, trên một phép đánh giá gần với công việc chỉnh sửa hằng ngày hơn là các phiên terminal tự động.

• DeepSWE v1.1 — Grok 4.7 đạt 71,0% ở mức nỗ lực suy luận cao (do nhà cung cấp báo cáo) so với Grok 4.6 65,2%. Lại một cải thiện vững chắc nhưng không mấy ấn tượng.

• EEBench — Grok 4.7 64,0% (nhà cung cấp tự báo cáo). Không có số liệu Grok 4.6 nào được công bố kèm theo, nên con số này không cho bạn biết gì về bản nâng cấp.

• AA-Briefcase v1.1 — Grok 4.7 đạt 1.657 Elo (do nhà cung cấp báo cáo), trên bài đánh giá công việc tri thức chuyên môn.

Hãy đọc danh sách như một tổng thể và quy luật là nhất quán: Grok 4.7 tốt hơn đáng kể ở những tác vụ dài và mang tính agentic, và chỉ tốt hơn chút ít ở những tác vụ ngắn. Bước nhảy trên Terminal-Bench gần như là tăng gấp đôi; mức cải thiện ở công việc trên trình soạn thảo chỉ ở mức phần trăm một chữ số. Nếu khối lượng công việc của bạn có dạng autocomplete, bạn vẫn đang trả cùng mức $2/$6 để đổi lấy một cải thiện nhỏ. Nếu khối lượng công việc của bạn là kiểu "chạy trong hai giờ rồi quay lại", thì bản phát hành này nhắm thẳng vào bạn.

Đo lường độc lập cho đến nay nói gì

Có một con số độc lập tồn tại, và đáng để nêu ra một cách cẩn thận vì rất dễ bị hiểu sai. Artificial Analysis cho Grok 4.7 điểm 46 trên Chỉ số Thông minh của mình, phiên bản v4.3.2, xếp nó thứ 16 trong số 655 mô hình trên bảng xếp hạng. Grok 4.6 ở mức 44 trên cùng thang điểm. Khoảng cách hai điểm trên một chỉ số tổng hợp không phải là mức tăng gấp đôi mà Terminal-Bench thể hiện, và sự khác biệt đó mang tính thông tin chứ không mâu thuẫn: chỉ số này pha trộn lý luận, kiến thức, toán học và lập trình, nên một mức tăng lớn trong một lát cắt tác tử sẽ bị pha loãng bởi mọi thứ mà mô hình không thay đổi.

Hai chi tiết khác từ cùng trang đó hữu ích hơn điểm số tổng quan. Thứ nhất, Grok 4.7 đã tạo ra 240 triệu token đầu ra trong khi chạy chỉ số, so với mức trung vị là 92 triệu — đây là một mô hình suy luận dài dòng, và với mức giá 6 đô-la cho mỗi triệu token đầu ra, sự dài dòng đó là một khoản mục chi phí. Thứ hai, điểm tổng hợp của chỉ số xếp nó vào nhóm những mô hình mạnh nhất trong phân khúc giá của mình, và đó mới là so sánh thực sự quan trọng đối với người mua. Artificial Analysis chưa công bố mức giá đầy đủ cho Grok 4.7 trên trang mô hình, nên đừng lấy con số chi phí cho mỗi tác vụ từ đó; hãy dùng mức 2/6 đô-la của nhà cung cấp.

A generated two-column comparison scoreboard for Grok 4.7 and Grok 4.6 with six rows: Terminal-Bench 4.0 38.0% vs 20.3%, CursorBench 4.0 46.3% vs 40.4%, DeepSWE v1.1 71.0% vs 65.2%, AA Intelligence Index 46 vs 44, context 500K on both, and price $2/$6 on both, with a footer noting all benchmark figures are vendor-reported and the index scores are per Artificial Analysis v4.3.2.

Vực giá mà cả hai mô hình đều không khắc phục được

Đây là phần trong bảng giá Grok 4.6 mà các đội ngũ production đã học được cách căm ghét, và Grok 4.7 đã không thay đổi nó. Dưới 200.000 token đầu vào, mức giá là 2 USD đầu vào và 6 USD đầu ra. Trên ngưỡng đó, toàn bộ yêu cầu được định giá lại thành 4 USD đầu vào và 12 USD đầu ra. Không phải phần token vượt mức — mà là toàn bộ yêu cầu. Một lần gọi 210.000 token tốn gấp đôi một lần gọi 199.000 token, dù chỉ hơn 11.000 token.

Với cửa sổ ngữ cảnh 500.000 token trên cả hai mô hình, rất dễ sẩy chân rơi khỏi vách đá đó. Các phiên chạy tác tử ngữ cảnh dài và những câu lệnh bao trùm cả kho mã chính là đúng những khối lượng công việc mà Grok 4.7 được tinh chỉnh để xử lý, nghĩa là trường hợp sử dụng tốt nhất của mô hình cũng chính là trường hợp dễ kích hoạt mức tăng gấp đôi nhất. Nếu bạn đang chuyển công việc sang Grok 4.7 vì nó xử lý các phiên tác tử dài tốt hơn, hãy dự trù kinh phí cho việc điều chỉnh giá trước khi chuyển, chứ không phải sau đó.

Cũng cần tính đến một bậc tốc độ. SpaceXAI cung cấp một biến thể nhanh của Grok 4.7, giúp tăng gấp đôi tốc độ đầu ra và tăng gấp đôi mức giá niêm yết. Đó là một đánh đổi hợp lý cho việc lập trình tương tác, nhưng là một đánh đổi tồi cho công việc theo lô — cùng một tác vụ với cùng chất lượng lại tốn gấp đôi để tiết kiệm thời gian thực mà chẳng ai để ý.

Chuyển đổi từ Grok 4.6 mà không cần viết lại

Tin tốt thực tế là đây chỉ là hoán đổi mô hình, không phải di trú nền tảng. Cả hai mô hình đều nhận văn bản và hình ảnh đầu vào rồi trả về văn bản, cả hai đều dùng cùng các mức reasoning-effort từ low đến xhigh, và cấu trúc yêu cầu chính là cấu trúc mà SpaceXAI đã phục vụ kể từ Grok 4.5. Mã gọi Grok 4.6 với tham số effort không cần tái cấu trúc để gọi Grok 4.7.

Điểm không miễn phí của việc chuyển đổi nằm ở khâu đánh giá. Những cải thiện của Grok 4.7 tập trung vào các phiên chạy tác tử dài, nên một bộ kiểm thử được xây từ các prompt ngắn một lượt sẽ gần như chẳng cho bạn thấy gì — bạn sẽ chỉ thấy mức cải thiện cỡ CursorBench và kết luận rằng việc nâng cấp không đáng công, trong khi lý do để nâng cấp lại nằm ở những tác vụ mà bộ kiểm thử của bạn không bao giờ chạm tới. Phép đo thực sự có thể phân xử chuyện này là tỷ lệ hoàn thành tác vụ trong công việc nhiều bước: các bản vá được chấp nhận, các lỗi hồi quy được đưa vào, số lần gọi công cụ trên mỗi tác vụ hoàn thành, và tần suất một phiên chạy cần con người can thiệp. Đó là những trục mà chính các con số của nhà cung cấp đang chỉ vào, và cũng là những trục mà không có chuẩn đánh giá nào đã công bố bao phủ cho cơ sở mã của bạn.

Độ dài dòng là điều thứ hai cần đo lường. Một mô hình phát ra 240 triệu token trên một chỉ số chuẩn sẽ phát ra nhiều token hơn trên khối lượng công việc của bạn so với phiên bản tiền nhiệm, và với mức 6 đô-la cho mỗi triệu token đầu ra, điều đó có thể âm thầm xóa sạch giá trị của một bản nâng cấp cùng giá. Hãy theo dõi số token đầu ra trên mỗi tác vụ hoàn thành trong một tuần trước khi bạn cam kết.

Screenshot of the Artificial Analysis model page for Grok 4.7 (xhigh), showing an Intelligence Index of 46 on index version v4.3.2, a 500k token context window, text and image input with text output, and a verbosity figure of 240M output tokens generated on the index.

Gọi cái nào

Quyết định này thực sự đơn giản, điều hiếm thấy trong việc so sánh mô hình. Grok 4.6 vẫn là lựa chọn đúng cho lưu lượng ngắn lượt, nhạy cảm về chi phí: trò chuyện, phân loại, tóm tắt và hỗ trợ mã ở quy mô trình soạn thảo, nơi mức cải thiện của Grok 4.7 là nhỏ và sự dài dòng của nó là một gánh nặng. Grok 4.7 là lựa chọn đúng cho khối lượng công việc mà nó được tạo ra — lập trình tác tử tầm xa và công việc trên terminal, nơi một tác vụ chạy hàng giờ liền và khả năng tự kiểm chứng là khác biệt giữa một công việc hoàn thành và một công việc bị kẹt.

Chạy cả hai không phải là một giải pháp thỏa hiệp ở đây, mà chính là câu trả lời đúng, và chi phí để làm điều đó rất thấp. Grok 4.6 có trong danh mục của OrcaRouter ở mức giá niêm yết của SpaceXAI với 0% phụ phí được chuyển thẳng qua, nên bảng giá $2/$6 ở trên chính là mức bạn phải trả — và vì chúng tôi chuyển thẳng giá niêm yết của nhà cung cấp thay vì cộng thêm phụ phí, mọi thay đổi giá từ nhà cung cấp đều được cập nhật trực tiếp bên chúng tôi ngay trong ngày giá mới có hiệu lực. Một khóa API duy nhất bao gồm Grok 4.6 và hơn 200 mô hình khác, nên việc chuyển lưu lượng giữa chúng theo từng tác vụ chỉ là một thay đổi cấu hình chứ không phải thêm một hợp đồng thứ hai. Nếu bạn muốn dùng thử Grok 4.7 trên một luồng production trước khi thực sự tin tưởng nó, cách an toàn hơn là giữ phương án dự phòng ở Grok 4.6 — mô hình bạn có thể định tuyến ngay hôm nay — và để cơ chế tự động chuyển đổi dự phòng giữa các nhà cung cấp đưa yêu cầu trở lại khi mô hình mới hoạt động không ổn định.

Screenshot of the OrcaRouter model page for Grok 4.6 (model ID grok/grok-4.6), showing SpaceXAI's list pricing of $2.00 per million input tokens and $6.00 per million output tokens, a 500K token context window, and the reasoning and vision capability tags.

Xem gì tiếp theo

Hai điều sẽ định đoạt phép so sánh này, và cả hai đều chưa xảy ra. Điều thứ nhất là một lần tái lập độc lập con số Terminal-Bench 4.0 — 38% là mức nhảy đủ lớn để ai đó sẽ chạy lại nó, và nếu nó vẫn giữ, luận điểm ủng hộ Grok 4.7 trong các pipeline tác tử là mạnh mẽ dựa trên thực lực thay vì tiếp thị. Điều thứ hai là phần còn lại của lộ trình Grok: SpaceXAI đã công khai sắp xếp Grok 4.8, Grok 4.9 và Grok 5 nối tiếp sau bản phát hành này, và vòng đời của chính Grok 4.6 chỉ khoảng năm tuần. Việc đặt cược vào Grok 4.7 như một giả định nền tảng dài hạn sẽ lặp lại sai lầm mà các đội ngũ từng mắc với Grok 4.5.

Hiện tại, bản nâng cấp cùng giá là có thật và hướng đi đã rõ. Con số cần ghi nhớ là $2/$6 đã mang lại cho bạn một mô hình tăng gần gấp đôi hiệu suất ở các công việc terminal tầm xa và hầu như không nhúc nhích ở bất kỳ chỗ nào khác — và đó là một tuyên bố cụ thể, hữu ích, có thể kiểm chứng, chứ không phải một bước nhảy vọt thế hệ.

So sánh trong bài viết này1

Phát hiện từ bài viết này · Benchmark: Artificial Analysis · cập nhật hằng ngày