
Gemini 3.7 Flash vs Gemini 3.1 Pro: Liệu phân khúc Flash của Google có khiến sản phẩm chủ lực của chính mình trở nên lỗi thời?
- AlibabaMỚIQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 trên 1 triệu token
- z-aiMỚIZ.ai: GLM 5.3 Flash2026-08-2658Trí tuệ72Lập trình
- DeepSeekMỚIDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.15 / $0.29 trên 1 triệu token
- z-aiZ.ai: GLM 5.32026-08-1860Trí tuệ75Lập trình
- obsidianQwen3.8 27B2026-08-1552Trí tuệ68Lập trình
- qwenQwen: Qwen3.8 27B (free)2026-08-13qwen/qwen3.8-27b-free
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1253Trí tuệ69Lập trình
- grokSpaceXAI: Grok 4.62026-08-1261Trí tuệ77Lập trình
- metaMeta: Muse Spark 1.22026-08-0557Trí tuệ72Lập trình
- qwenQwen: Qwen3.8 Max2026-08-0358Trí tuệ72Lập trình
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3152Trí tuệ69Lập trình
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 trên 1 triệu token
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463Trí tuệ78Lập trình
- googleGoogle: Gemini 3.6 Flash2026-07-2152Trí tuệ69Lập trình
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137Trí tuệ49Lập trình
- metaMeta: Muse Spark 1.12026-07-1653Trí tuệ71Lập trình
- kimiMoonshotAI: Kimi K32026-07-1560Trí tuệ76Lập trình
- openaiOpenAI: GPT-5.6 Luna2026-07-0952Trí tuệ71Lập trình
Có một câu hỏi khó chịu đang nằm ngay trong dòng sản phẩm mô hình năm 2026 của Google, và nó nhắm thẳng vào mọi đội ngũ hiện đang trả phí cho Gemini 3.1 Pro: tại sao mô hình Flash giá rẻ lại ghi điểm cao hơn cả mô hình hàng đầu trên chỉ số độc lập? Gemini 3.7 Flash, phát hành ngày 13 tháng 8 năm 2026 với giá 0,75 USD mỗi triệu token đầu vào và 3,75 USD mỗi triệu token đầu ra, đạt 56 điểm trên Artificial Analysis Intelligence Index ở mức suy luận cao. Gemini 3.1 Pro, bản xem trước Google phát hành ngày 19 tháng 2 năm 2026 với giá 2,00 / 12,00 USD — và 4,00 / 18,00 USD cho ngữ cảnh trên 200K — hiện đo được ở mức gần 50 trên cùng chỉ số này. Mô hình hàng đầu từng đứng đầu bảng xếp hạng khi ra mắt đã bị chính phân khúc mô hình làm việc cật lực của mình vượt qua, và bài viết này nói về ý nghĩa của điều đó đối với hai mô hình, cũng như đối với các đội ngũ đang phải lựa chọn giữa chúng.
Tiền đề: gói cao cấp nhất của Google vẫn bị kẹt ở bản xem trước.
Bối cảnh quan trọng hơn những con số. Gemini 3.1 Pro đã ở chế độ xem trước từ tháng 2 năm 2026 — bảy tháng tính đến thời điểm viết bài — và phiên bản kế nhiệm của nó, Gemini 3.5 Pro, đã được công bố tại Google I/O vào tháng 5 với tuyên bố "sẽ ra mắt vào tháng tới," nhưng rồi lỡ hẹn cả tháng 6, tháng 7 và tháng 8. Tính đến đầu tháng 9, phân khúc cao cấp nhất vẫn chưa có bản kế nhiệm được phát hành, chưa có ngày ra mắt, cùng với những tin đồn về khả năng bị hủy bỏ. Trong khi đó, phân khúc Flash đã cho ra mắt ba thế hệ trong cùng khoảng thời gian: Gemini 3.6 Flashvào ngày 21 tháng 7, Gemini 3.7 Flash vào ngày 13 tháng 8, và khả năng hiểu video tác tử trên cả hai vào ngày 1 tháng 9. So sánh này thực chất không phải là "Pro so với Flash," mà là "phân khúc mà Google đang phát hành" so với "phân khúc mà Google đã ngừng phát hành."
So sánh thông số kỹ thuật
• Giá — Gemini 3.7 Flash $0,75 / $3,75 mỗi 1 triệu token (khuyến mãi đến hết ngày 31/12/2026, sau đó là $1,50 / $7,50) so với Gemini 3.1 Pro $2,00 / $12,00 ở ngữ cảnh dưới 200K, tăng lên $4,00 / $18,00 khi trên 200K. Rẻ hơn từ ba đến bốn lần theo giá niêm yết, trước khi áp dụng các tầng kiểm soát suy luận.
• Ngữ cảnh / đầu ra tối đa — 1M / 64K so với 1M / 64K. Giới hạn tối đa giống hệt nhau.
• Đầu vào — cả văn bản, hình ảnh, âm thanh, video, PDF. Bề mặt đa phương thức là giống nhau; khác biệt là ở những gì mô hình làm với video (bên dưới).
• Kiểm soát suy luận — Gemini 3.7 Flash: suy luận thấp / trung bình / cao. Gemini 3.1 Pro: suy luận thấp / trung bình / cao, với chế độ suy luận động được bật theo mặc định.
• Điểm số độc lập — Gemini 3.7 Flash đạt 56 trên Artificial Analysis Intelligence Index so với Gemini 3.1 Pro ở mức trên 40 trong phiên bản chỉ số hiện tại (nó đạt 57 khi ra mắt theo phiên bản trước).
• Tốc độ xuất ra — Gemini 3.7 Flash khoảng 285 token/giây ở mức suy luận cao so với Gemini 3.1 Pro khoảng 112–125 token/giây — nhanh hơn khoảng hai lần rưỡi.
• Trạng thái — Gemini 3.7 Flash ổn định, GA. Gemini 3.1 Pro bản xem trước, với thời gian ngừng hỗ trợ ngắn của bản xem trước.
Chỉ số, và mớ hỗn độn điểm chuẩn bên dưới nó
Mấu chốt nằm ở chỉ số: Artificial Analysis, đơn vị đánh giá độc lập đa nhà cung cấp, hiện xếp Gemini 3.7 Flash đạt 56 điểm còn Gemini 3.1 Pro đạt khoảng 45–49 điểm — con ngựa thồ vượt lên trước bản đầu bảng, đảo ngược vị trí so với thời Gemini 3.1 Pro ra mắt, khi mức 57 của nó dẫn đầu bảng chỉ số. Đó là sự thật quan trọng nhất trong cuộc so tài này, và nó đến từ nguồn đánh giá độc lập chứ không phải từ số liệu do nhà cung cấp tự báo cáo.
Dưới chỉ số tổng hợp, sổ cái điểm chuẩn là một mớ hỗn độn các bộ khung đo lường không thể so sánh được, và đọc nó một cách hời hợt sẽ cho ra câu trả lời sai. Thành tích công bố của Gemini 3.1 Pro — 80,6% trên SWE-bench Verified, 77,1% trên ARC-AGI-2, 94,3% trên GPQA Diamond, 2887 Elo trên LiveCodeBench Pro — được Google báo cáo tại sự kiện ra mắt tháng Hai, sử dụng các phiên bản điểm chuẩn khác với số liệu của Flash, và chưa bao giờ được tái lập một cách đồng nhất. Các con số 43,6% trên FrontierCode 1.1, 65,3% trên DeepSWE v1.1 và 1588 Elo trên đấu trường phát triển web của Gemini 3.7 Flash cũng tương tự là do nhà cung cấp tự báo cáo trên các bộ khung mới hơn. Ở nơi hai mô hình trùng nhau trên một chỉ số tổng hợp độc lập — AA Index — thì Flash thắng. Bất kỳ ai nói với bạn rằng "Pro đánh bại Flash trên SWE-bench" đang so sánh hai phiên bản của hai bài kiểm tra khác nhau mà không nói rõ điều đó.


Khoảng cách về khả năng video
Khả năng khiến cuộc so sánh trở nên chênh lệch hẳn chính là video. Chế độ hiểu video tác tử (agentic) mới của Google — được công bố vào ngày 1 tháng 9 năm 2026 — áp dụng cho Gemini 3.7 Flash, Gemini 3.6 Flash và Gemini 3.5 Flash-Lite. Gemini 3.1 Pro không có tên trong danh sách này. Mô hình Flash đọc video đúng theo cách chế độ mới định nghĩa "đọc video": mô hình tự quyết định xem gì, ở tốc độ nào, và thông qua khung hình, âm thanh hay bản ghi thoại, chỉ tải các phân đoạn liên quan, với mức tiết kiệm được nhà cung cấp công bố lên tới 66% chi phí và 88% token. Về mặt kỹ thuật, Gemini 3.1 Pro chấp nhận đầu vào video, nhưng nó sử dụng đường dẫn lấy mẫu tĩnh cũ hơn và không nhận được bất kỳ công cụ mới nào. Đối với người dùng của dòng flagship, khả năng video mới nhất trong gia đình Gemini đang được phát hành trên mẫu rẻ hơn trước, còn phân khúc Pro vẫn chưa có ngày được công bố để nhận tính năng này.
Tốc độ, và vấn đề rủi ro xem trước
Tốc độ làm tăng khoảng cách giá theo cách giống hệt như trong mọi cuộc so tài Gemini 3.7 Flash: tốc độ xuất ra gấp khoảng ba lần trên một mô hình vốn đã có giá chỉ bằng một phần ba. Nhưng khác biệt thứ hai mới là điều mà các đội ngũ quên tính vào chi phí: trạng thái phát hành. Gemini 3.1 Pro là bản xem trước (preview), và bản preview luôn đi kèm một khoảng thời gian thông báo ngừng hỗ trợ ngắn khi phiên bản kế nhiệm ra mắt. Một khối lượng công việc production chạy trên mô hình preview là rủi ro thường trực rằng ID mô hình sẽ thay đổi, giá cả sẽ thay đổi, hoặc năng lực bị dịch chuyển mà gần như không có cảnh báo trước. Gemini 3.7 Flash đã GA — ổn định, có tài liệu đầy đủ, và không nằm trong kế hoạch bị thay thế một cách tùy tiện, dù nhịp phát hành Flash gần như hàng tháng của Google có nghĩa là một bản Flash 3.8 có thể ra sau đó rất nhanh. Rủi ro ngừng hỗ trợ của bản preview 3.1 Pro không phải là giả thuyết; nó chính là trạng thái hiện tại của một tầng mà phiên bản kế nhiệm đã bị trì hoãn suốt ba tháng.
Nơi Gemini 3.1 Pro vẫn chiến thắng
Trường hợp trung thực cho 3.1 Pro có ba trụ cột, và không trụ cột nào là năng lực thô. Thứ nhất, endpoint công cụ tùy chỉnh: Gemini 3.1 Pro được phục vụ với bề mặt API bash/công cụ tùy chỉnh chuyên dụng mà Flash không sánh được, và các nhóm đã xây dựng công cụ agent dựa trên nó có một hệ thống đang hoạt động ngay hôm nay. Thứ hai, khối lượng công việc đã tinh chỉnh: một pipeline đã được tinh chỉnh theo các mặc định dynamic-thinking, mẫu cache và điểm eval của 3.1 Pro là một mục tiêu di động, và việc chuyển đổi tốn thời gian kỹ thuật thực sự ngay cả khi điểm đến nhanh hơn và rẻ hơn. Thứ ba, các tác vụ cụ thể mà thành tích sản xuất lâu dài hơn của Pro vẫn chưa có đối thủ Flash — các benchmark ra mắt như GPQA và ARC-AGI-2 mà Flash chưa từng được đo trên đó. Nếu khối lượng công việc của bạn là một trong số đó, "Flash xếp trên Pro trên chỉ số" không giải quyết được câu hỏi của bạn; chỉ có một bài kiểm tra trên eval của riêng bạn mới giải quyết được.
Nhận định: ý nghĩa của việc tiếp quản Flash-tier
Hướng đi đã rõ ràng. Ngày nay, với một workload mới, {{1}}Gemini 3.7 Flash{{/1}} là Gemini mặc định tốt hơn: rẻ hơn, nhanh hơn, ổn định GA, xếp hạng cao hơn trên chỉ số độc lập và là phiên bản đầu tiên có tính năng video mới. {{2}}Gemini 3.1 Pro{{/2}} vẫn giữ được một nhóm người dùng thực sự nhưng hạn hẹp — người dùng các công cụ tùy chỉnh, các pipeline được tinh chỉnh và các tác vụ mà thành tích benchmark cũ của nó vẫn còn phù hợp. Câu chuyện lớn hơn là phân khúc flagship của Google đang trì trệ, trong khi phân khúc ngựa thồ mới là nơi công ty đang thực sự cạnh tranh — và các đội ngũ vẫn trả giá flagship cho {{3}}3.1 Pro{{/3}} đang trả cho một vị thế mà chính công ty đã ngừng bảo vệ.

Đối với các nhóm muốn chuyển đổi mà không cần một dự án, việc di chuyển giữa các mô hình Gemini chỉ là đổi tên mô hình chứ không phải tích hợp. Gemini 3.1 Pro được phục vụ trên OrcaRouter với giá niêm yết $2.00 / $12.00, chuyển thẳng với 0% phụ phí, cùng với Gemini 3.6 Flash và phần còn lại của tầng Gemini có thể định tuyến, tất cả chỉ cần một khóa — nhờ đó, một workload có thể đưa một phần lưu lượng sang một mô hình Flash, giữ 3.1 Pro làm phương án dự phòng cho các tác vụ mà nó vẫn vượt trội, và để cơ chế failover tự động hấp thụ rủi ro khi một trong hai mô hình Google thay đổi. Bản thân Gemini 3.7 Flash hiện có sẵn qua API của chính Google và một số nền tảng bên thứ ba. DSL định tuyến và hợp nhất mô hình chính là cách bạn chạy một phép so sánh tương đương giữa hai mô hình Gemini trên bộ eval của riêng mình trước khi đổi. Lựa chọn mà dòng sản phẩm này đang hướng bạn tới rất rõ ràng: mặc định dùng tầng Flash, và chỉ giữ Pro cho những trường hợp hẹp mà nó chứng minh được là xứng đáng với mức phí cao hơn.
So sánh trong bài viết này1
Phát hiện từ bài viết này · Benchmark: Artificial Analysis · cập nhật hằng ngày
