Thẻ tiêu đề ghi “Grok 4.7 vs Gemini 3.1 Pro” với phụ đề “Bảng xếp hạng đã dịch chuyển; mô hình thì không”, cùng ba thẻ: Chỉ số AA v4.3.2 46 vs 30, Giá tiêu chuẩn mỗi 1M $2/$6 vs $2/$12, và Trạng thái GA vs bản xem trước.
Guides & Insights

Grok 4.7 vs Gemini 3.1 Pro: Bảng xếp hạng đã thay đổi, còn mô hình thì không

Tác giả

Gideon Frost

Ngày đăng

Mô hình mới nhất · 20Xem tất cả mô hình
Benchmark: Artificial Analysis · cập nhật hằng ngày
Quay lại tất cả bài viết

Vào ngày 19 tháng 2 năm 2026, Artificial Analysis đã công bố một bài viết với tiêu đề "Gemini 3.1 Pro Preview: Người dẫn đầu mới trong lĩnh vực AI." Nó đứng đầu sáu trong mười bài đánh giá và hơn Claude Opus 4.6 bốn điểm. Đọc trang của chính mô hình đó hôm nay thì con số là 30, xếp thứ sáu mươi chín trong số 200. Nhà cung cấp không thay đổi bất cứ thứ gì. Thứ đã thay đổi là thước đo: Artificial Analysis đã sửa đổi Intelligence Index của mình lên v4.3.2 vào ngày 19 tháng 9 năm 2026, chấm lại điểm cho mọi mô hình trong danh mục theo một bộ đánh giá khác, và một mô hình dẫn đầu hồi tháng Hai trở thành mô hình tầm trung hồi tháng Chín, trong khi bản thân mô hình vẫn nguyên vẹn ở trạng thái preview. Đó là bối cảnh cho một so sánh với Grok 4.7 — được nhà cung cấp phát hành vào ngày 21 tháng 9 năm 2026 — và đó là lý do cuộc đối đầu này ít nói về việc mô hình nào thông minh hơn mà nói về việc bạn vẫn có thể tin rằng mô hình nào trong hai mô hình này sẽ vẫn là chính nó vào tháng tới.

Mỗi thứ trong số này thực sự là gì

Gemini 3.1 Pro là mô hình hạng Pro mới nhất của Google và chưa từng đạt trạng thái phát hành rộng rãi. Nó được phát hành dưới tên gemini-3.1-pro-preview vào ngày 19 tháng 2 năm 2026, và bảng ngừng hỗ trợ của Google vẫn liệt kê nó với ghi chú "chưa công bố ngày ngừng hoạt động" — một bản xem trước giờ đã nằm trong trạng thái xem trước suốt bảy tháng trong khi Google tung ra cả một thang Flash bên dưới nó: 3.5 Flash vào tháng 5, 3.6 vào tháng 7, 3.7 vào tháng 8, 3.8 vào tháng 9. Không có mô hình Pro GA nào mới hơn Gemini 3 Pro. Nó có cửa sổ đầu vào 1,048,576 token và giới hạn đầu ra 65,536 token, nhận văn bản, hình ảnh, video, âm thanh và PDF vào với đầu ra là văn bản, đồng thời cung cấp điều khiển mức độ suy luận ở mức thấp, trung bình và cao, không có tham số ngân sách và không có thiết lập tối thiểu. Trọng số được đóng kín.

Grok 4.7 mới ra mắt được một ngày và cũng đóng trọng số. Nó có ngữ cảnh 500k token — bằng một nửa của Gemini — và nhận đầu vào là văn bản và hình ảnh, nên hoàn toàn không thể nạp video hay âm thanh, đây là khác biệt về năng lực rõ nét nhất trong so sánh này. Nó được niêm yết ở mức 2,00 USD cho mỗi triệu token đầu vào và 6,00 USD cho mỗi triệu token đầu ra khi dưới 200k token prompt, tăng lên 4,00 USD và 12,00 USD khi vượt ngưỡng đó, với lượt đọc từ bộ nhớ đệm ở mức 0,50 USD và 1,00 USD; xAI cũng niêm yết một biến thể nhanh hơn với tốc độ đầu ra gần gấp đôi và mức giá gấp đôi. Không có con số đầu ra tối đa nào được công bố cho nó trong tài liệu được kiểm tra ở đây.

Cây thước đã nhích. Đó là câu chuyện.

Cả hai mô hình hiện đang được chấm điểm trên Artificial Analysis Intelligence Index v4.3.2, chỉ số này đã thay thế Terminal-Bench 2.1 bằng Terminal-Bench 4.0 và tau3-Banking bằng AutomationBench-AA, đồng thời neo lại thang điểm Elo GDPval-AA. Số điểm của mọi mô hình đều thay đổi khi chỉ số này ra mắt. Điểm của Gemini 3.1 Pro thay đổi nhiều hơn phần lớn, vì các thế mạnh hồi tháng Hai của nó tập trung vào những đánh giá mà chỉ số mới hoặc đã loại bỏ hoặc đã điều chỉnh lại trọng số. Đọc hai cột cạnh nhau hôm nay:

Tổng hợp — Grok 4.7 (xhigh): 46 trên Chỉ số Trí tuệ Artificial Analysis v4.3.2. Gemini 3.1 Pro Preview: 30 trên cùng phiên bản đó, xếp hạng #69 trong số 200.

Ngữ cảnh dài — Grok 4.7: cửa sổ 500k, AA-LCR v1.1 77%. Gemini 3.1 Pro: cửa sổ 1M — lớn gấp đôi — và mức trần đầu ra 65K chỉ bằng khoảng một nửa mức mà một phiên agentic ngữ cảnh dài thường cần.

Phương thức đầu vào — Grok 4.7: văn bản và hình ảnh. Gemini 3.1 Pro: văn bản, hình ảnh, video, âm thanh và PDF. Không hề gần nhau, và đây không phải là khoảng cách về điểm chuẩn — mà là khoảng cách về năng lực.

Tốc độ — Grok 4.7: chưa có số đo nào được công bố. Gemini 3.1 Pro: 124,4 token đầu ra mỗi giây, xếp thứ 39 trong số 200, với thời gian đến token đầu tiên là 63,62 giây thông qua Google AI Studio.

Giá, gói tiêu chuẩn — Grok 4.7: $2.00 vào / $6.00 ra mỗi 1M. Gemini 3.1 Pro: $2.00 vào / $12.00 ra. Đầu vào giống hệt, đầu ra gấp đôi.

Giá, bậc ngữ cảnh dài — Grok 4.7: tăng gấp đôi lên $4.00 / $12.00 ở 200k token prompt. Gemini 3.1 Pro: tăng lên $4.00 / $18.00 tại cùng ngưỡng 200k. Cùng đầu vào, đầu ra nhiều hơn 50%.

Mức độ trưởng thành — Grok 4.7: mới ra mắt được một ngày, các benchmark từ nhà cung cấp phần lớn chưa được kiểm chứng độc lập. Gemini 3.1 Pro: đã có mặt trên thị trường bảy tháng, nhưng vẫn là bản preview, chưa cam kết GA và chưa có ngày dừng.

OrcaRouter model page for Gemini 3.1 Pro Preview showing the google/gemini-3.1-pro-preview identifier, a 1M-token context window, a 65K maximum output, audio, file, image, text and video input with text output, and list rates of $2.00 per 1M input and $12.00 per 1M output.

Vấn đề xem trước giờ đã thực sự là một vấn đề rồi

Bản xem trước kéo dài bảy tháng sẽ là một điều kỳ lạ hơn là một rủi ro nếu không có gì trục trặc với nó. Nhưng có gì đó đã trục trặc. Từ ngày 18 tháng 9 năm 2026, người dùng bắt đầu báo cáo rằng Gemini 3.1 Pro đã biến mất khỏi bộ chọn mô hình của AI Studio, và tính đến thời điểm viết bài này, vẫn chưa có phản hồi nào từ nhân viên Google, không có thông báo ngừng hỗ trợ và không có nguyên nhân được nêu rõ — một sự cố về tính khả dụng chưa được giải quyết chứ không phải một sự khai tử đã được xác nhận. Đặt điều đó bên cạnh lịch sử công bố: Google đã nói tại I/O vào tháng 5 năm 2026 rằng Gemini 3.5 Pro sẽ "được triển khai vào tháng sau", và các báo cáo báo chí vào cuối tháng 8 cho biết mô hình đó đã bị hủy bỏ vì các ứng viên nội bộ "không đủ tốt hơn so với dòng Flash". Trang Pro của chính Google vẫn quảng cáo "3.5 Pro sắp ra mắt", đó là mâu thuẫn trong chỉ một màn hình. Dù kết quả ra sao, cách hiểu thực tế là Gemini 3.1 Pro là một endpoint bản xem trước không có ngày GA, không có mô hình kế nhiệm nào được nêu tên, và hiện đang có dấu hỏi về tính khả dụng.

Rủi ro của Grok 4.7 là hình ảnh phản chiếu và nhỏ hơn về bản chất. Nó mới một ngày tuổi, nên các con số còn mỏng — Artificial Analysis chưa công bố phép đo tốc độ hay độ trễ, và bộ đánh giá chuẩn của chính xAI dành cho nó vẫn chưa được tái lập độc lập. Điều không còn nghi ngờ là mô hình này đã được phát hành rộng rãi, có giá, có tài liệu và ổn định về danh tính. Một mô hình có danh tính ổn định và các con số chưa được chứng minh là thứ dễ xây dựng dựa trên hơn nhiều so với một mô hình có các con số được công bố và tính khả dụng thì không.

Trên thực tế, việc chia tách tốn kém những gì

Giả sử bạn đang chọn cho một pipeline xử lý tài liệu. Với 100k token đầu vào và 8k đầu ra, Grok 4.7 tốn $0.20 cho đầu vào và $0.048 cho đầu ra — khoảng một phần tư đô-la. Gemini 3.1 Pro tốn $0.20 cho đầu vào và $0.096 cho đầu ra — khoảng ba mươi xu. Hai mô hình chỉ chênh nhau trong vòng hai mươi phần trăm, và nếu tài liệu của bạn là bản quét, PDF, âm thanh hay video, thì Gemini là mô hình duy nhất trong hai mô hình có thể đọc được chúng. Đó không phải là một lập luận dựa trên benchmark; nó kết thúc sự so sánh cho khối lượng công việc đó.

Giờ hãy giả sử bạn đang chọn cho một agent ngữ cảnh dài. Với đầu vào 300k và đầu ra 8k, Grok 4.7 tốn 1,20 USD cho đầu vào và 0,096 USD cho đầu ra, tức khoảng 1,30 USD. Gemini 3.1 Pro tốn 1,20 USD cho đầu vào và 0,144 USD cho đầu ra, tức khoảng 1,35 USD. Về cơ bản là giống hệt nhau — và ở đây, cửa sổ 1M và trần đầu ra 65K của Gemini trở thành ràng buộc quyết định, vì mức giới hạn 65K chính là nơi các lượt chạy agentic dài bị sụp đổ. Không mô hình nào là lựa chọn rẻ trong cuộc so tài này, và cũng không mô hình nào đắt theo tiêu chuẩn frontier.

Two-column scoreboard titled “Grok 4.7 vs Gemini 3.1 Pro - the scoreboard”: AA Index 46 vs 30, context 500k vs 1M, input modality “text + image” vs “text + image + video + audio + PDF”, max output “not stated” vs 65k, price per 1M $2/$6 vs $2/$12, and status GA vs preview.

Định tuyến vòng qua một mục tiêu di động

OrcaRouter cung cấp Gemini 3.1 Pro, được liệt kê trên trang mô hình riêng của nó theo mức giá của nhà cung cấp — $2.00 vào và $12.00 ra, với cửa sổ 1M và đầu ra tối đa 65k — vì chúng tôi chuyển tiếp giá niêm yết của nhà cung cấp ở mức markup 0%. Đó không phải là một câu nói marketing trong trường hợp như thế này: Google có một bản dựng preview không có giá niêm yết và không rõ thời hạn, với tính khả dụng dao động trong tháng 9, và điều hữu ích mà một router làm là giữ cho tích hợp ổn định trong khi thứ phía sau nó thay đổi. Chuyển đổi dự phòng tự động có nghĩa là một endpoint preview ngừng phản hồi sẽ trở thành một sự kiện định tuyến thay vì một sự cố gián đoạn, và DSL định tuyến cho phép bạn kết hợp một mô hình đa phương thức với một mô hình chỉ văn bản trong một lệnh gọi duy nhất — đúng hình dạng mà cặp này gợi ý, Gemini đọc video và Grok thực hiện suy luận trên bản ghi của nó. Grok 4.7 hiện không có trong danh mục OrcaRouter tại thời điểm viết bài; gọi nó hôm nay nghĩa là phải đi qua API riêng của xAI và các nền tảng bên thứ ba cung cấp nó.

Khuôn mẫu đáng để xây dựng: giữ Gemini 3.1 Pro cho bất cứ việc gì phải nạp video, âm thanh hoặc PDF, và coi trạng thái preview của nó là một rủi ro vận hành cần lách qua, chứ không phải lý do để né tránh nó. Đặt Grok 4.7 vào các công việc văn bản và hình ảnh, nơi mức giá đầu ra thấp hơn và điểm tổng hợp cao hơn của nó phù hợp, và nơi mô hình bạn tích hợp hôm nay cũng là mô hình mà sáu tháng nữa bạn vẫn sẽ gọi tới. Điều duy nhất không nên làm là đọc thứ hạng ở vị trí thứ sáu mươi chín như một phán quyết về mô hình — đó là phán quyết về một lần sửa đổi benchmark, và chính lần sửa đổi đã giáng cấp Gemini 3.1 Pro cũng giáng cấp hàng chục mô hình mà Google chưa từng đụng tới.

Cuộc gọi

Trên chỉ số hiện tại, Grok 4.7 dẫn trước Gemini 3.1 Pro mười sáu điểm, và về giá đầu ra, nó chỉ bằng một nửa chi phí ở gói tiêu chuẩn và rẻ hơn một phần ba ở gói ngữ cảnh dài. Nếu khối lượng công việc của bạn là văn bản và hình ảnh, thế là đủ để quyết định. Nếu khối lượng công việc của bạn là video, âm thanh hoặc tài liệu quét, Gemini 3.1 Pro là ứng viên duy nhất trong hai, và sự so sánh kết thúc ở đó — bạn đang mua một năng lực, không phải một điểm số. Lưu ý cần đi kèm với cả hai không phải về hiệu năng mà là về nguồn gốc: một cái là bản xem trước bảy tháng tuổi, không có ngày GA và từng có sự cố khả dụng hồi tháng Chín; cái còn lại mới một ngày tuổi với một con số tiêu đề và không có tái lập độc lập cho bất cứ thứ gì khác. Không cái nào là lựa chọn đã ngã ngũ. Cả hai đều đáng để định tuyến hơn là cam kết.

Artificial Analysis page for Grok 4.7 at xhigh reasoning effort: an Artificial Analysis Intelligence Index score of 46, ranked #16 of 655; Speed and Cost both reported as N/A; 240M output tokens from the Intelligence Index run, ranked #140 of 655; a 500k-token context window with text and image input and text output; and comparison charts for intelligence, speed and cost per task.

So sánh trong bài viết này2

Phát hiện từ bài viết này · Benchmark: Artificial Analysis · cập nhật hằng ngày