Một thẻ tiêu đề hero được tạo cho bài viết có tiêu đề 'Grok 4.7 vs Qwen 3.8 Max — một cuộc tung đồng xu trên giấy', với phụ đề 'Cùng mức giá, cách nhau một điểm chỉ số, hình dạng trái ngược' và các chip số liệu ghi AA Index 46 so với 45, giá $2/$6 ở cả hai, cùng ngữ cảnh 500K so với 984K.
Guides & Insights

Grok 4.7 vs Qwen 3.8 Max: Cùng mức giá, cách nhau một điểm, hình dạng trái ngược

Tác giả

Elias Hawthorne

Ngày đăng

Mô hình mới nhất · 20Xem tất cả mô hình
Benchmark: Artificial Analysis · cập nhật hằng ngày
Quay lại tất cả bài viết

Hai mô hình flagship đóng, cùng ở mức 2 đô la cho mỗi triệu token đầu vào và 6 đô la cho mỗi triệu token đầu ra, cùng đạt điểm số chỉ cách nhau đúng một điểm trên cùng một bài kiểm chuẩn độc lập, được phát hành cách nhau mười chín ngày. Grok 4.7 ra mắt vào ngày 21 tháng 9 năm 2026 từ SpaceXAI; Qwen 3.8 Max được nhà cung cấp phát hành vào ngày 3 tháng 8 năm 2026 và làm mới vào ngày 2 tháng 9 năm 2026. Trên Chỉ số Trí tuệ Artificial Analysis hiện hành, phiên bản v4.3.2, Grok 4.7 đạt 46 điểm và Qwen 3.8 Max đạt 45 điểm. Về giá và về năng lực đo lường được, hai mô hình này là cùng một món hàng. Ở mọi khía cạnh khác — ngữ cảnh, phương thức, tốc độ phục vụ, độ mở, và điều mà mỗi nhà cung cấp chọn để tối ưu — chúng khác nhau đến mức không thể khác hơn, và đó chính là điều khiến việc so sánh này đáng để thực hiện thay vì bỏ qua.

Trước tiên là dòng thời gian, vì Qwen 3.8 Max có hai ngày

Điều này khiến nhiều bài đưa tin bị nhầm lẫn, nên đáng để làm rõ ngay từ đầu. Qwen 3.8 Max ra mắt vào ngày 3 tháng 8 năm 2026 với tư cách là mô hình lớn nhất và mạnh nhất của Alibaba, được xây dựng từ kiến trúc thị giác - ngôn ngữ Qwen 3.5 trên thiết kế mixture-of-experts thưa được báo cáo với tổng cộng 2,4 nghìn tỷ tham số và 95 tỷ tham số hoạt động trên mỗi token. Vào ngày 2 tháng 9 năm 2026, Alibaba phát hành một bản dựng được làm mới — bản sửa đổi 0902, đây là phiên bản mang các ID mô hình hiện hành và là phiên bản mà Artificial Analysis dùng để định ngày cho trang của mình. Nếu bạn đã thấy cả ngày tháng 8 lẫn tháng 9 cho Qwen 3.8 Max, thì đó là lý do: một ngày là ngày ra mắt, ngày còn lại là bản sửa đổi mà hầu hết mọi người thực sự đang nhắc đến ngày nay.

Grok 4.7 có một lịch sử sạch sẽ hơn và một lịch sử lộn xộn hơn phía sau. SpaceXAI đã phát hành nó vào ngày 21 tháng 9 năm 2026 sau một đợt ra mắt liên tục trượt lịch — Musk đã nhắm đến các khung thời gian vào cuối tháng 8, đầu tháng 9 và giữa tháng 9 trước khi mô hình thực sự được tung ra. Bản thân bản phát hành khá hẹp: một mô hình cơ sở lớn hơn Grok 4.6, một quá trình huấn luyện học tăng cường dài hơn nhắm đến các tác vụ kéo dài nhiều giờ, và không có thay đổi nào đối với bảng giá $2/$6 mà Grok 4.6 đã duy trì từ ngày 12 tháng 8.

Mỗi nhà cung cấp đã tối ưu hóa cho điều gì

Đọc hai thông báo ra mắt như một cặp thì thấy những đặt cược về thiết kế gần như đối lập hoàn toàn.

SpaceXAI tối ưu hóa cho việc thực thi theo tác tử. Các con số do nhà cung cấp báo cáo của Grok 4.7 tập trung vào công việc trên terminal và kho mã: Terminal-Bench 4.0 đạt 38,0% so với 20,3% của Grok 4.6, CursorBench 4.0 đạt 46,3%, DeepSWE v1.1 đạt 71,0% ở mức nỗ lực suy luận cao, EEBench đạt 64,0%. Mô tả của chính công ty về bản phát hành nêu việc tự xác minh và xử lý ngữ cảnh dài trong môi trường Grok Bot là các mục tiêu. Grok 4.7 phục vụ cửa sổ 500.000 token, nhận văn bản và hình ảnh đầu vào, trả về văn bản, và cho phép điều chỉnh mức nỗ lực suy luận từ low đến xhigh. Đây là một mô hình được xây dựng để hoàn thành công việc.

Alibaba tối ưu hóa cho độ phủ. Qwen 3.8 Max phục vụ cửa sổ ngữ cảnh khoảng 984.000 token — hiệu quả là một triệu — và những điểm mạnh được công bố của nó là độ rộng chứ không phải độ sâu trong một lĩnh vực: điểm Terminal Bench 2.1 là 86,6, SWE-bench Pro đạt 67,7, PaperBench đạt 93,0, GPQA Diamond đạt 92,6, MMMU-Pro đạt 82,3, OSWorld-Verified đạt 86,1. Nó chấp nhận đầu vào văn bản, hình ảnh và video và trả về văn bản, hỗ trợ các mức độ nỗ lực suy luận với xhigh là mặc định, và điểm yếu hơn được công bố của nó là Humanity's Last Exam ở mức 43,6. Đây là một mô hình được xây dựng để xử lý bất cứ thứ gì bạn giao cho nó.

Mọi con số trong đoạn đó đều do nhà cung cấp tự báo cáo. Cả hai bộ đều chưa được tái lập một cách độc lập, và dù sao thì hai bộ này cũng không thể so sánh trực tiếp với nhau — Terminal-Bench 2.1 và Terminal-Bench 4.0 là những benchmark khác nhau, nên tuyệt đối không được đặt 86.6 của Qwen và 38.0 của Grok cạnh nhau.

• Tổng hợp độc lập — Grok 4.7 đạt 46 điểm trên AA Intelligence Index v4.3.2 so với Qwen 3.8 Max đạt 45 điểm trên cùng phiên bản. Một sự ngang bằng về mặt thống kê.

• Giá trên mỗi triệu token — 2,00 USD đầu vào / 6,00 USD đầu ra đối với cả hai. Mức chiết khấu bộ nhớ đệm của Qwen được niêm yết ở mức 88%, cho ra mức giá hỗn hợp là 1,18 USD mỗi triệu; các điều khoản về bộ nhớ đệm của Grok 4.7 không được công bố trên cùng một cơ sở.

• Cửa sổ ngữ cảnh — Grok 4.7 500.000 token so với Qwen 3.8 Max khoảng 984.000. Qwen thắng gần gấp đôi, và đây là khác biệt thông số lớn nhất giữa chúng.

• Các phương thức đầu vào — Grok 4.7 văn bản và hình ảnh so với Qwen 3.8 Max văn bản, hình ảnh và video.

• Trọng số — cả hai đều độc quyền. Không thể tải xuống mô hình nào, điều này loại bỏ hoàn toàn lập luận về trọng số mở thông thường khỏi so sánh này.

• Tham số — Grok 4.7 không được tiết lộ trên bất kỳ bảng thông số kỹ thuật nào của SpaceXAI (con số ~2,1T là tuyên bố của Musk) so với Qwen 3.8 Max được báo cáo ở mức tổng 2,4T với 95B hoạt động, mà Alibaba cũng chưa xác nhận trên bảng thông số kỹ thuật.

• Tốc độ phục vụ — Qwen 3.8 Max đạt 38,8 token đầu ra mỗi giây với 3,08 giây đến token đầu tiên, theo Artificial Analysis; Grok 4.7 được SpaceXAI định vị là nhanh gần gấp đôi so với các mô hình tương đương, theo báo cáo của nhà cung cấp, với chưa có số liệu thông lượng độc lập nào được công bố.

A generated two-column comparison scoreboard for Grok 4.7 and Qwen 3.8 Max with six rows: AA Intelligence Index 46 vs 45, price $2.00/$6.00 on both, context 500K vs 984K tokens, modalities text and image vs text, image and video, weights proprietary on both, and speed vendor-claimed twice as fast vs 38.8 tokens per second measured, with a footer noting index scores are per Artificial Analysis v4.3.2 and all benchmark figures are vendor-reported.

Sự khác biệt về ngữ cảnh mới là quyết định thực sự

Khi giá và năng lực giống hệt nhau, quyết định sẽ phụ thuộc vào bất cứ điều gì khác biệt, và ở đây điều đó là ngữ cảnh. Tăng gấp đôi cửa sổ từ 500.000 lên khoảng 984.000 token không phải là một điểm nhấn đẹp trên bảng thông số — đó là sự khác biệt giữa việc chia nhỏ một kho lưu trữ và giữ trọn nó.

Cửa sổ dài hơn của Qwen 3.8 Max đi kèm một lưu ý đã được ghi nhận trong tài liệu, có ý nghĩa quan trọng đối với người mua: phiên bản trọng số mở mà Alibaba công bố cho tuần lễ ngày 10 tháng 8 năm 2026 chỉ hỗ trợ văn bản và không bao gồm toàn bộ ngữ cảnh một triệu token. Điều đó không ảnh hưởng đến endpoint được lưu trữ mà so sánh này đang đề cập, nhưng cũng đáng để biết nếu bạn đang lên kế hoạch dựa trên bản phát hành mở.

Có một cân nhắc thứ hai ở phía Grok. Dòng Grok trước đây đã áp dụng một ngưỡng giá tại 200.000 token đầu vào, nơi một yêu cầu vượt ngưỡng sẽ được định giá lại toàn bộ yêu cầu ở mức gấp đôi — 4 đô-la đầu vào và 12 đô-la đầu ra. Với cửa sổ 500.000 token, ngưỡng đó nằm lọt hẳn trong phạm vi hoạt động của mô hình. Trước khi định tuyến công việc ngữ cảnh dài đến Grok 4.7, hãy xác nhận bảng giá hiện hành cho mô hình được triển khai, vì sự tương tác giữa một cửa sổ lớn và một ngưỡng tái định giá chính là nơi hóa đơn ngữ cảnh dài dễ sai sót.

Một tháng làm việc tốn bao nhiêu cho mỗi cái

Vì mức giá niêm yết là giống hệt nhau, việc so sánh chi phí phải được xây dựng từ hành vi token thay vì từ bảng giá, và ở đó hai mô hình khác biệt theo một cách có thể đo lường được.

Artificial Analysis đo được Grok 4.7 tạo ra 240 triệu token đầu ra trong khi chạy Chỉ số Thông minh của mình, so với mức trung vị là 92 triệu trên các mô hình trong bảng xếp hạng — đây là một mô hình suy luận dài dòng. Qwen 3.8 Max tạo ra 190 triệu token đầu ra trên cùng chỉ số đó, với tổng chi phí đánh giá là $4,934.79 và tốc độ đo được là 38,8 token mỗi giây. Cả hai đều cao hơn hẳn mức độ dài dòng trung vị, và Grok 4.7 là mô hình dài dòng hơn trong hai mô hình này.

Vậy nên, với cùng mức 6 đô-la cho mỗi triệu token đầu ra, mô hình phát ra nhiều token hơn cho mỗi tác vụ sẽ tốn nhiều hơn cho mỗi tác vụ. Các số liệu về độ dài dòng đã công bố cho thấy Grok 4.7 sẽ tiêu thụ nhiều token đầu ra hơn cho công việc lập chỉ mục tương đương, nghĩa là việc hòa nhau về giá thực chất là một thắng lợi nhỏ cho Qwen 3.8 Max về chi phí trên mỗi tác vụ — được bù trừ bởi lợi thế tốc độ được tuyên bố của Grok 4.7, vốn rút ngắn thời gian thực và do đó giảm chi phí con người phải chờ đợi một lượt chạy tác nhân. Không có yếu tố bù trừ nào trong hai yếu tố đó hiển thị trên bảng giá, và cả hai đều đáng để đo lường trên lưu lượng của chính bạn thay vì giả định.

Điểm bất đối xứng duy nhất không gây tranh cãi là cache. Qwen 3.8 Max công bố mức chiết khấu cache 88% và mức giá tổng hợp $1,18 theo tỷ lệ 7:2:1 giữa cache hit/đầu vào/đầu ra. Với các khối lượng công việc có tiền tố ổn định lớn — lời nhắc hệ thống, tiêu đề cơ sở mã, một bộ tài liệu — khoản chiết khấu đó chính là nơi tạo ra khoản tiết kiệm thực sự, và đáng để kiểm tra xem các điều khoản cache của Grok 4.7 so sánh thế nào trước khi bạn cam kết khối lượng.

Screenshot of the Artificial Analysis model page for Qwen3.8 Max showing an Intelligence Index of 45 on index version v4.3.2, a context window of approximately 984k tokens, text and image input, listed pricing of $2.00 input and $6.00 output per million tokens, and an output speed of 38.8 tokens per second.

Lựa chọn, khi những con số từ chối lựa chọn thay bạn

Điểm 46 và 45 trên cùng một chỉ số, ở cùng một mức giá, là mức gần với một kết quả hòa thực sự nhất mà blog này có khả năng công bố. Điều đó có nghĩa là quyết định nên được đưa ra dựa trên những khía cạnh mà hai mẫu thực sự khác nhau, và có bốn khía cạnh như vậy.

Chọn Grok 4.7 nếu công việc của bạn là lập trình agentic và thực thi trên terminal, nếu tốc độ thời gian thực trên các lượt chạy dài quan trọng hơn dư địa ngữ cảnh, và nếu bạn muốn một nút điều chỉnh suy luận theo từng yêu cầu để giữ cho lưu lượng dễ xử lý ở mức rẻ. Chọn Qwen 3.8 Max nếu bạn thường xuyên xử lý đầu vào lớn hơn nửa triệu token, nếu đầu vào video nằm trong lộ trình của bạn, nếu bạn muốn mức chiết khấu bộ nhớ đệm 88% cho các khối lượng công việc nặng về tiền tố, hoặc nếu bạn muốn một mô hình mà nhà cung cấp công bố một ma trận đánh giá rộng khắp thay vì chỉ tập trung vào một làn duy nhất.

Nếu câu trả lời trung thực là "cả hai, mỗi thứ một chút", thì đó là câu trả lời bình thường, và đây chính là trường hợp mà cặp đôi này được tạo ra để đáp ứng. Qwen 3.8 Max có mặt trên OrcaRouter ở mức giá niêm yết của Alibaba, và OrcaRouter chuyển tiếp nguyên mức giá niêm yết của nhà cung cấp với 0% phụ phí, nên mức $2/$6 ở trên chính là số tiền bạn thực sự phải trả, và khi nhà cung cấp thay đổi biểu phí thì ở đây sẽ được cập nhật ngay trong cùng ngày thay vì đợi đến kỳ gia hạn. Một API key duy nhất bao phủ Qwen 3.8 Max cùng hơn 200 mô hình khác, nghĩa là quyết định về ngữ cảnh trở thành một quy tắc định tuyến theo từng yêu cầu thay vì một cam kết ở cấp nền tảng: gửi những đầu vào quá khổ đến cửa sổ 984k và giữ mọi thứ còn lại trên endpoint nào nhanh nhất và rẻ nhất cho tác vụ đó, với cơ chế chuyển đổi dự phòng tự động nếu một nhà cung cấp bị suy giảm. Khi một tác vụ thực sự cần cả hai dạng — một lượt đọc ngữ cảnh dài tiếp nối bằng một lượt thực thi tác tử — thì routing DSL kết hợp các mô hình vào một lời gọi duy nhất thay vì buộc bạn phải chọn một bên.

Một điều cần nói rõ, vì cả hai mô hình đều không mở: không có nội dung nào trong so sánh này liên quan đến trọng số có thể tải xuống. Cả hai đều là endpoint được lưu trữ, và tự lưu trữ không phải là lựa chọn cho cả hai.

Con số duy nhất cần ghi nhớ

Bốn mươi sáu so với bốn mươi lăm không phải là lý do để chọn một mô hình, và cũng không nên là vậy. Điều quyết định sự so sánh này là cửa sổ ngữ cảnh — 500.000 token so với khoảng 984.000 — và cách định hình mà mỗi nhà cung cấp đã chọn: Grok 4.7 tối ưu để hoàn thành nhanh các tác vụ agentic khó, Qwen 3.8 Max tối ưu để xử lý bất cứ thứ gì bạn giao cho nó. Cùng mức giá, cùng năng lực đo lường, nhưng khác loại công việc. Đó là một quyết định định tuyến, và là kiểu quyết định nên chỉ tốn một buổi chiều để kiểm thử thay vì một quý để thu mua.

Screenshot of the OrcaRouter model page for Qwen3.8 Max (model ID qwen/qwen3.8-max), showing Alibaba's list pricing of $2.00 per million input tokens and $6.00 per million output tokens, a 1M token context window, and the vision, tools, JSON and reasoning capability tags.

So sánh trong bài viết này3

Phát hiện từ bài viết này · Benchmark: Artificial Analysis · cập nhật hằng ngày