
Gemini 3.7 Flash vs DeepSeek V4 Flash: Hai mô hình "Flash", Câu trả lời trái ngược cho cùng một câu hỏi
- OrcaMỚIOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 trên 1 triệu token
- orcaMỚIOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 trên 1 triệu token
- deepseekMỚIDeepSeek: DeepSeek V4.1 Flash2026-09-1040Trí tuệ
- openaiOpenAI: GPT-6 Astra2026-09-0453Trí tuệ77Lập trình
- googleGoogle: Gemini 3.8 Flash2026-09-0241Trí tuệ76Lập trình
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Trí tuệ76Lập trình
- anthropicAnthropic: Claude Fable 5.12026-09-0153Trí tuệ82Lập trình
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 trên 1 triệu token
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Trí tuệ72Lập trình
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 trên 1 triệu token
- z-aiZ.ai: GLM 5.32026-08-1845Trí tuệ75Lập trình
- obsidianQwen3.8 27B2026-08-1534Trí tuệ68Lập trình
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Trí tuệ69Lập trình
- grokSpaceXAI: Grok 4.62026-08-1244Trí tuệ77Lập trình
- metaMeta: Muse Spark 1.22026-08-0540Trí tuệ72Lập trình
- qwenQwen: Qwen3.8 Max2026-08-0345Trí tuệ76Lập trình
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135Trí tuệ69Lập trình
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 trên 1 triệu token
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
Hai mô hình có tên gây nhầm lẫn nhất năm 2026 đều được gọi là Flash, và chúng không thể trả lời cùng một câu hỏi theo cách nào khác biệt hơn nữa. Gemini 3.7 Flash, phát hành ngày 13 tháng 8 năm 2026, là mô hình mã đóng chủ lực của Google: khoảng 340 token đầu ra mỗi giây, chỉ số trí tuệ là 56, và mức giá khuyến mãi là 0,75 đô la cho mỗi triệu token đầu vào và 3,75 đô la cho mỗi triệu token đầu ra. DeepSeek V4 Flash là bản trọng số mở trong gia đình V4 của DeepSeek, phát hành vào tháng 4 và cập nhật vào cuối tháng 7: được cấp phép MIT, có thể tải xuống, và được định giá ở mức 0,14 đô la cho mỗi triệu token đầu vào và 0,28 đô la cho mỗi triệu token đầu ra trên API của chính DeepSeek — khoảng một phần năm giá đầu vào khuyến mãi của Google và một phần mười ba giá đầu ra. Cả hai đều là các mô hình "flash", được xây dựng để nhanh và rẻ cho các khối lượng công việc lớn. Sự giống nhau chỉ nằm ở cái tên.
Câu hỏi mà họ trả lời khác nhau chính là {{1}}câu hỏi định hình của thế hệ này{{/1}}: {{2}}bạn đang thuê trí thông minh hay sở hữu nó?{{/2}} {{3}}DeepSeek V4 Flash là mô hình mixture-of-experts với 284 tỷ tham số, khoảng 13B tham số hoạt động trên mỗi token, cửa sổ ngữ cảnh 1M token và giới hạn đầu ra 384K, được phát hành theo giấy phép MIT — các trọng số có dung lượng tải xuống khoảng 160GB, và bản cập nhật ngày 31 tháng 7 (V4-Flash-0731) đã bổ sung khả năng tác tử mạnh hơn đáng kể.{{/3}} {{4}}Gemini 3.7 Flash là mô hình độc quyền được xây dựng trên Gemini 3.6 Flash với ngữ cảnh 1M, giới hạn đầu ra 64K, đầu vào đa phương thức và không có đường dẫn để tự lưu trữ.{{/4}} {{5}}Một trong hai mô hình này có thể được cách ly mạng, tinh chỉnh và chạy trên phần cứng của riêng bạn. Mô hình còn lại chỉ chạy được ở nơi Google vận hành nó.{{/5}}

Hai Flash, sát cánh bên nhau
Cả hai mô hình đều nhắm đến cùng một đối tượng người mua — khối lượng công việc sản xuất lớn không thể chi trả cho một flagship tính theo token — nhưng chúng đạt được điều đó thông qua các kiến trúc đối lập. Sự chú ý lai của DeepSeek V4 Flash (sparse nén cộng với attention nén mạnh) là thứ làm cho ngữ cảnh 1M trở nên kinh tế đủ để bán ở mức giá này; đây là mô hình mà các endpoint `deepseek-chat` và `deepseek-reasoner` legacy của DeepSeek trỏ tới, đã ngừng hoạt động vào tháng 7. Gemini 3.7 Flash là sự tinh chỉnh thuật toán của Google đối với dòng Flash của chính họ, và lợi thế của nó là thông lượng phục vụ: đo lường độc lập đặt nó ở khoảng 340 token/s so với khoảng 113 của DeepSeek V4 Flash, và nó đạt được điều đó trong khi nhận đầu vào âm thanh và video mà DeepSeek V4 Flash không có.
• Intelligence Index — 56 cho Gemini 3.7 Flash so với 50 cho DeepSeek V4 Flash, theo Artificial Analysis.
• Tốc độ đầu ra — ~340 token/giây so với ~113 token/giây, cả hai theo Artificial Analysis.
• Cửa sổ ngữ cảnh — 1M token cho cả hai; DeepSeek V4 Flash xuất ra tối đa 384K so với 64K của Gemini 3.7 Flash.
• Giá đầu vào — $0,75 (khuyến mãi, đến năm 2026) so với $0,14 trên API riêng của DeepSeek.
• Giá đầu ra — $3.75 (khuyến mãi) so với $0.28.
• Trọng số — độc quyền so với cấp phép MIT và có thể tải xuống.

Những gì sáu điểm chỉ số thực sự mua được
Khoảng cách 6 điểm trên Index là đáng chú ý nhưng không phải là vực thẳm, và nó nằm chủ yếu ở những lĩnh vực mà DeepSeek V4 Flash không được tối ưu hóa. Các con số lập trình tác tử được công bố của Gemini 3.7 Flash (65.3 trên DeepSWE v1.1, 43.6 trên FrontierCode 1.1 Main, do nhà cung cấp báo cáo) vượt trội rõ rệt, và Elo phát triển web của nó (1588, cũng do nhà cung cấp báo cáo) phản ánh những cải thiện thực sự trong việc tạo giao diện người dùng. Các con số được công bố của chính DeepSeek V4 Flash — 79.0 trên SWE-bench Verified, 91.6 trên LiveCodeBench, điểm τ²-Bench là 95.0 được các bên theo dõi độc lập xác nhận — cho thấy sức mạnh vững chắc trong lập trình có ràng buộc và sử dụng công cụ, và khả năng truy xuất ngữ cảnh 1M (78.7 trên MRCR, 60.5 trên CorpusQA) có tính cạnh tranh với bất cứ thứ gì trong cùng phân khúc giá. Mô hình chung: Gemini 3.7 Flash dẫn đầu về chiều sâu tác tử và công việc web; DeepSeek V4 Flash đánh đổi những điểm đó để lấy kinh tế token thô và trần ngữ cảnh dài mà không một mô hình đóng nào sánh kịp.
Trọng số mở thay đổi quy trình mua sắm, không chỉ giá cả
{{1}}Giấy phép MIT là phần của phép so sánh này mà không một bảng benchmark nào phản ánh được{{/1}}. DeepSeek V4 Flash có thể được tải về và chạy trên phần cứng của riêng bạn, tinh chỉnh trên dữ liệu riêng của bạn, và sử dụng trong các môi trường không cho phép gọi API — và giấy phép này không có giới hạn theo quy mô, nên sự phát triển của bạn sẽ không làm thay đổi các điều khoản. {{2}}Chi phí thực tế nằm ở vận hành: phục vụ mô hình MoE 284B với tốc độ mà một nhóm sản xuất mong muốn đòi hỏi nguồn GPU thực sự, và với hầu hết các nhóm, lựa chọn trung thực là API được lưu trữ{{/2}}. {{3}}Đó là nơi chênh lệch giá thực sự phát huy tác dụng: ngay cả với đường lối lưu trữ, ở mức $0.14 / $0.28, cũng đủ rẻ để trở thành lựa chọn mặc định cho phần đuôi dài của lưu lượng truy cập{{/3}}. {{4}}Gemini 3.7 Flash không mang lại con đường sở hữu nào — thứ bạn mua là một dịch vụ được quản lý đáng tin cậy, nhanh chóng, đa phương thức với mức giá khuyến mãi và một vách đá giá vào tháng Một{{/4}}.
Hóa đơn dung lượng
Chạy cùng một ngày trên cả hai: 20 triệu token đầu vào và 4 triệu token đầu ra. Trên API riêng của DeepSeek V4 Flash, chi phí đó là $2.80 + $1.12, khoảng $3.92. Trên Gemini 3.7 Flash với mức giá khuyến mãi, chi phí là $15 + $15, khoảng $30 — chênh lệch 7,6 lần ngay cả khi Google đang giảm giá. Sau ngày 1 tháng 1 năm 2027, khi Gemini 3.7 Flash quay lại mức $1.50 / $7.50, cùng một ngày sẽ tốn khoảng $58, gấp mười lăm lần con số của DeepSeek. Lợi thế tốc độ bù đắp một phần điều này trên các khối lượng công việc tương tác — token nhanh hơn đồng nghĩa với ít yêu cầu đồng thời hơn — nhưng đối với công việc xử lý theo lô và nền, mô hình mở thắng về hóa đơn mà không cần bàn cãi. Hai mô hình thậm chí không nhắm đến cùng một đường cong chi phí, và đó chính là toàn bộ vấn đề.

Ai nên xây dựng trên nền tảng nào
Chọn DeepSeek V4 Flash khi chi phí trên mỗi token là ràng buộc quyết định, khi bạn muốn đầu ra dài lên tới 384K, khi bạn cần tùy chọn tự lưu trữ hoặc triển khai air-gapped, hoặc khi bạn đang xây dựng thứ gì đó mà biên lợi nhuận không thể trụ vững với mức giá token hạng flagship. Chọn Gemini 3.7 Flash khi bạn cần tốc độ trong vòng lặp tương tác, đầu vào đa phương thức, độ tin cậy được quản lý của Google, hoặc kết quả lập trình agentic mạnh hơn mà Google báo cáo — và khi bạn chấp nhận rằng mức giá khuyến mãi chỉ là tạm thời. Chúng không phải là đối thủ theo cách hai flagship là đối thủ của nhau; chúng là hai chiến lược mua sắm khác nhau mang cùng một cái tên. Tầng định tuyến là nơi các chiến lược này gặp nhau: DeepSeek V4 Flash đang hoạt động trên OrcaRouter với giá niêm yết của DeepSeek, phụ phí 0%, và mô hình failover khớp một cách tự nhiên với cặp đôi này — một quy tắc chạy phần lớn lưu lượng trên V4 Flash và chuyển tiếp tập con khó lên một mô hình đóng mạnh hơn, với Gemini 3.7 Flash có thể truy cập qua Gemini API của chính Google ở nhánh còn lại của cùng bộ định tuyến.
Cái nhìn trung thực
Nếu bạn có thể tự lưu trữ hoặc đơn thuần bị chi phí dẫn dắt, DeepSeek V4 Flash là mô hình tốt hơn để xây dựng trên đó, và giấy phép biến nó thành một quyết định bạn không bao giờ phải xem xét lại. Nếu bạn cần tốc độ phục vụ của Google, đầu vào đa phương thức, hoặc lợi thế agentic-coding theo báo cáo, Gemini 3.7 Flash là dịch vụ tốt hơn trong khi chương trình khuyến mãi còn kéo dài — với việc giá tăng gấp đôi vào tháng Giêng đã nằm trên lịch. Hai mô hình, một cái tên, và thị trường được chứng kiến triết lý nào sẽ được năm tới của lưu lượng truy cập bỏ phiếu cho.
So sánh trong bài viết này2
Phát hiện từ bài viết này · Benchmark: Artificial Analysis · cập nhật hằng ngày
