
Gemini 3.7 Flash vs Grok 4.6: Cuộc chiến giá của Google vs Tác nhân tự kiểm tra của SpaceXAI
- googleMỚIGoogle: Gemini 3.8 Flash2026-09-0259Trí tuệ76Lập trình
- qwenMỚIQwen: Qwen3.8 Max (0902)2026-09-0258Trí tuệ72Lập trình
- anthropicMỚIAnthropic: Claude Fable 5.12026-09-0166Trí tuệ82Lập trình
- AlibabaMỚIQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 trên 1 triệu token
- z-aiMỚIZ.ai: GLM 5.3 Flash2026-08-2658Trí tuệ72Lập trình
- DeepSeekMỚIDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.15 / $0.29 trên 1 triệu token
- z-aiZ.ai: GLM 5.32026-08-1860Trí tuệ75Lập trình
- obsidianQwen3.8 27B2026-08-1552Trí tuệ68Lập trình
- qwenQwen: Qwen3.8 27B (free)2026-08-13qwen/qwen3.8-27b-free
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1253Trí tuệ69Lập trình
- grokSpaceXAI: Grok 4.62026-08-1261Trí tuệ77Lập trình
- metaMeta: Muse Spark 1.22026-08-0557Trí tuệ72Lập trình
- qwenQwen: Qwen3.8 Max2026-08-0358Trí tuệ72Lập trình
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3152Trí tuệ69Lập trình
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 trên 1 triệu token
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463Trí tuệ78Lập trình
- googleGoogle: Gemini 3.6 Flash2026-07-2152Trí tuệ69Lập trình
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137Trí tuệ49Lập trình
Ba tuần sau khi Gemini 3.6 Flash phần lớn thất bại, Google đã giảm một nửa giá và phát hành Gemini 3.7 Flash — một động thái mà hầu hết các bài viết coi là nhắm thẳng vào Grok 4.6, chiếc flagship được tinh chỉnh cho tác nhân mà SpaceXAI đã phát hành một ngày trước với giá 2 đô la và 6 đô la. Thời điểm mới là điều đáng nói: hai mô hình gần tiên phong, cách nhau một ngày, đều nhắm đến cùng một người mua — một đội ngũ muốn lập trình tác nhân mà không phải trả mức giá tiên phong — và được định giá theo các triết lý đối lập. Google đang mua phản hồi bằng chương trình khuyến mãi kéo dài 5 tháng. SpaceXAI đang bán sự tin tưởng theo từng tác vụ với giá niêm yết cố định.
Grok 4.6, phát hành ngày 12 tháng 8 năm 2026, là bản tinh chỉnh của SpaceXAI đối với nền tảng Grok 4.5 có 1,5 nghìn tỷ tham số, được xây dựng cho các tác nhân chạy lâu dài có khả năng tự xác minh hoàn thành tác vụ con, với ngữ cảnh 500K, đầu vào văn bản và hình ảnh, và mức giá 2/6 đô la, tăng gấp đôi khi vượt 200K token đầu vào. Gemini 3.7 Flash, phát hành ngày 13 tháng 8 năm 2026, là bản tinh chỉnh thuật toán của Google đối với Gemini 3.6 Flash — ngữ cảnh 1M, đầu vào đa phương thức bao gồm video và âm thanh, và mức giá khuyến mãi 0,75/3,75 đô la, tăng gấp đôi lên 1,50/7,50 đô la vào ngày 1 tháng 1 năm 2027. Trên Chỉ số Trí tuệ Artificial Analysis độc lập, Grok 4.6 đạt 61, rõ ràng vượt trên mức khoảng 56 ghi nhận ban đầu của Gemini 3.7 Flash.
Cuộc chiến giá cả, mỗi chiều một dòng
• Giá cho mỗi 1M đầu vào — Gemini 3.7 Flash $0,75 (giá giới thiệu) so với Grok 4.6 $2,00. Google rẻ hơn trên 60%.
• Giá mỗi 1M đầu ra — Gemini 3.7 Flash $3.75 (giá giới thiệu) so với Grok 4.6 $6.00.
• Sau ngày 1 tháng 1 năm 2027 — Gemini tăng gấp đôi lên $1.50/$7.50 so với Grok không đổi ở mức $2/$6.
• Cửa sổ ngữ cảnh — Gemini 3.7 Flash 1M so với Grok 4.6 500K.
• Tính phí đầu vào dài — Gemini tính phí cố định trên toàn bộ cửa sổ ngữ cảnh; Grok tăng gấp đôi lên $4/$12 khi đầu vào từ 200K trở lên.
• Token tư duy — Gemini tính phí chúng như đầu ra; chi phí của Grok được đo lường độc lập ở mức ~$0,84 cho mỗi tác vụ.
Tóm tắt trong một dòng: Gemini 3.7 Flash rẻ hơn ở mọi dòng trên bảng giá hôm nay, và phần lớn lợi thế đó sẽ tan biến vào ngày 1 tháng 1. Grok 4.6 có mức giá vào tháng 8 giống như giá sẽ có vào tháng 3.

Tiền của Gemini 3.7 Flash đã đi đâu
Số liệu của chính Google báo cáo mức tăng lớn cho Gemini 3.7 Flash so với 3.6 Flash: 65,3% trên DeepSWE v1.1 (tăng từ 49,0%), 43,6% trên FrontierCode 1.1 Main (tăng từ 34,4%), 85,8% trên Terminal-bench 2.1 (tăng từ 78,0%), và Elo WebDev Arena là 1588 (tăng từ 1538). Đây là những con số do nhà cung cấp tự báo cáo, chưa được kiểm chứng lại — loại con số đo lường quỹ đạo phát triển, không phải phán quyết so sánh giữa các nhà cung cấp. Nhưng quỹ đạo mới là điểm mấu chốt: các bản sửa lỗi được tung ra ba tuần sau khi ra mắt mà các nhà đánh giá đã gần như gạt bỏ, điều đó cho thấy Google coi phân khúc Flash là chiến trường, không phải dòng sản phẩm chủ lực.
Một điều khác mà chương trình khuyến mãi của Google làm là nén khoảng thời gian mua hàng. Ở mức $0.75/$3.75, mô hình đủ rẻ để thử nghiệm với số lượng lớn; ở mức $1.50/$7.50, nó vẫn cạnh tranh nhưng không còn là vũ khí trong cuộc chiến giá cả. Bất kỳ đội ngũ sản xuất nào áp dụng nó trong giai đoạn giới thiệu nên đánh giá lại tính kinh tế của mô hình vào tháng 12, thay vì giả định rằng con số đó sẽ đi cùng họ.
Tiền của Grok 4.6 đã đi về đâu
Điểm nhấn của Grok 4.6 khác biệt: không phải token rẻ hơn, mà là ít token bị lãng phí hơn. Nó được huấn luyện để tự xác minh — kiểm tra xem một tác vụ con đã thực sự hoàn thành chưa trước khi tiếp tục — và các phép đo độc lập xác nhận hiệu quả này: Artificial Analysis định giá chi phí của nó vào khoảng 0,84 USD mỗi tác vụ, với GDPVal-AA v2 là 1.753 và Intelligence Index là 61. Đó là những con số từ bên thứ ba, và chúng là con số mạnh nhất trong cuộc đọ sức này, vì chúng nắm bắt được điều mà giá mỗi token bỏ sót: một mô hình cần ít lượt xử lý hơn để hoàn thành công việc sẽ rẻ hơn trên mỗi công việc hoàn thành, ngay cả khi giá token cao hơn.
Sự đánh đổi nằm ở chỗ mẫu rẻ hơn có dư địa cạnh tranh. Ngữ cảnh 500K của Grok 4.6 chỉ bằng một nửa mức 1M của Gemini 3.7 Flash, và mức giá $2/$6 của nó tăng gấp đôi khi đầu vào vượt 200K — vì vậy, các khối lượng công việc có ngữ cảnh dài, đầu vào lớn chính là nơi giá niêm yết của Grok 4.6 không còn cạnh tranh được với mức giá khuyến mãi của Gemini.
Kinh tế của từng tác vụ
Với mức giá giới thiệu, mức giá kết hợp của Gemini 3.7 Flash với tỷ lệ phân chia đầu vào/đầu ra 80/20 là khoảng 1,35 đô la mỗi triệu token; mức giá niêm yết của Grok 4.6 ở cùng tỷ lệ là 2,80 đô la mỗi triệu trước khi tính phí phạt cho đầu vào dài. Trên lý thuyết, mô hình Google trông có vẻ thắng vượt trội về khối lượng. Điểm phức tạp là token suy nghĩ của Gemini được tính phí như đầu ra, các tuyên bố điểm chuẩn của nó đã cũ một tuần, và hiệu quả trên mỗi tác vụ của nó vẫn chưa được đo lường độc lập — trong khi của Grok 4.6 thì đã được. Token rẻ cộng với các lượt lãng phí có thể tốn kém hơn token đắt tiền mà hoàn thành công việc, và đây là cuộc đối đầu mà một bên có dữ liệu về vấn đề đó còn bên kia thì không.
Đặt cược vào mô hình mới mà không đặt cược vào đường ống.
Grok 4.6 có trên OrcaRouter với giá niêm yết $2/$6 của SpaceXAI, chênh lệch 0%, bao gồm cả mức nhân 2x cho phần vượt trên 200K — thông tin mà trang mô hình lấy trực tiếp từ lớp định tuyến. Gemini 3.7 Flash mới ra mắt được một ngày và chạy trên API của chính Google; phiên bản tiền nhiệm Gemini 3.6 Flash của nó có trên OrcaRouter với giá niêm yết của Google.


Nếu câu hỏi thực sự mà phép so sánh này đang đặt ra là "tôi có nên đặt cược pipeline tác nhân của mình vào mô hình rẻ mới không," thì lớp định tuyến chính là hàng rào phòng thủ: một quy tắc dự phòng chạy tác nhân trên Grok 4.6 hôm nay và chuyển sang Gemini 3.7 Flash ngay khi nó ra mắt, hoặc một bảng hợp nhất nơi cả hai cùng trả lời và một trọng tài dung hòa chúng — loại thiết lập mà DSL định tuyến tồn tại để phục vụ, và một thiết lập không đòi hỏi phải chọn phe trước khi bằng chứng được đưa ra.
Cái nhìn trung thực
Nếu bạn muốn token rẻ nhất hôm nay và tin tưởng vào thời gian xử lý ba tuần, Gemini 3.7 Flash là lựa chọn mạo hiểm — cuộc chiến giá là có thật, mức tăng điểm chuẩn đã được báo cáo, và giai đoạn giới thiệu là một mức chiết khấu thực sự. Nếu bạn muốn một mô hình có hiệu suất tác nhân được đo lường độc lập, giá không thay đổi vào tháng Một, và vòng lặp tự xác minh được thiết kế cho các tác vụ chạy dài, Grok 4.6 là lựa chọn bảo thủ, và dữ liệu AA tạo cho nó lợi thế về chi phí cho mỗi tác vụ hoàn thành. Một bên là một đợt giảm giá với đồng hồ đếm ngược; bên kia là một mức giá có thành tích. Cả hai đều có thể bảo vệ được — đó là điều khiến đây là một sự so sánh thực sự chứ không chỉ là hình thức.
So sánh trong bài viết này2
Phát hiện từ bài viết này · Benchmark: Artificial Analysis · cập nhật hằng ngày
