Thẻ tiêu đề chính: DeepSeek V4.1 Flash vs Gemini 3.1 Pro — một trong số này vẫn là bản xem trước
Guides & Insights

DeepSeek V4.1 Flash so với Gemini 3.1 Pro: Một trong hai vẫn là bản xem trước

Tác giả

Elias Hawthorne

Ngày đăng

Mô hình mới nhất · 20Xem tất cả mô hình
Benchmark: Artificial Analysis · cập nhật hằng ngày
Quay lại tất cả bài viết

Điều hữu ích nhất cần biết về DeepSeek V4.1 Flash so với Gemini 3.1 Pro không được in trên bảng thông số kỹ thuật của cả hai. DeepSeek V4.1 Flash là một mô hình đã phát hành chính thức, ra mắt ngày 10 tháng 9 năm 2026 với trọng số theo giấy phép MIT mà bạn có thể tải xuống. Gemini 3.1 Pro đã ở dạng xem trước kể từ ngày 19 tháng 2 năm 2026 và vẫn được cung cấp dưới tên bản dựng xem trước khoảng bảy tháng sau đó. Sự bất đối xứng đó không quyết định mô hình nào tốt hơn, nhưng nó quyết định loại cam kết mà bạn đang thực hiện khi xây dựng dựa trên một trong hai, và đó là khuôn khổ cho mọi thứ bên dưới.

Cả hai đều chứa một triệu token ngữ cảnh. Cả hai đều chấp nhận hình ảnh. Những khác biệt thực sự phân tách chúng là đường cong giá trên 200.000 token đầu vào, các phương thức đầu vào, trần đầu ra, và việc một trong hai cái này là một tệp bạn có thể sở hữu còn cái kia là một API.

Hai người thực sự đang ở đâu

• Giá cho mỗi 1 triệu token, với ngữ cảnh lên đến 200K — DeepSeek V4.1 Flash $0.15 đầu vào / $0.60 đầu ra so với Gemini 3.1 Pro $2.00 đầu vào / $12.00 đầu ra. Đó là gấp 13 lần giá đầu vào và gấp 20 lần giá đầu ra.

• Giá trên mỗi 1 triệu token, đối với ngữ cảnh trên 200K — V4.1 Flash không đổi ở mức $0.15 / $0.60 so với Gemini 3.1 Pro $4.00 đầu vào / $18.00 đầu ra. Bội số đầu vào tăng lên 27× đúng tại điểm mà công việc ngữ cảnh dài diễn ra.

• Đầu vào được cache — V4.1 Flash $0.003 mỗi 1M ngoài giờ cao điểm so với Gemini 3.1 Pro $0.40 mỗi 1M. Hai bậc độ lớn, ở đúng mục chi phí quyết định liệu ngữ cảnh đọc lại có thể chi trả được hay không.

• Cửa sổ ngữ cảnh — 1M token so với 1M token. Ngang nhau.

• Đầu ra tối đa — V4.1 Flash 384K token so với Gemini 3.1 Pro 65K token. Gấp sáu lần giới hạn trần.

• Các phương thức đầu vào — V4.1 Flash nhận văn bản và hình ảnh so với Gemini 3.1 Pro nhận văn bản, hình ảnh, âm thanh, video và tệp tải lên.

• Trọng số — V4.1 Flash MIT, có thể tải xuống so với Gemini 3.1 Pro đóng, chỉ API.

• Trạng thái phát hành — V4.1 Flash chính thức khả dụng từ ngày 10 tháng 9 năm 2026 so với Gemini 3.1 Pro ở bản xem trước từ ngày 19 tháng 2 năm 2026.

• Độ trễ quan sát được đến token đầu tiên — V4.1 Flash 2,63 giây ở p50 và 9,05 giây ở p95 so với Gemini 3.1 Pro 10,00 giây ở p50 và 10,00 giây ở p95, trên dữ liệu đo từ xa 7 ngày của chính OrcaRouter. Thời gian chờ trung vị của mô hình đắt tiền đang ở mức trần của dữ liệu đo từ xa, và phần đuôi của nó không rời khỏi mức đó.

Đọc danh sách mà không có giá, và cục diện thì quen thuộc từ mọi so sánh giữa trọng số mở và mô hình tiên phong: mô hình có thể tải xuống thắng về trần đầu ra, hòa về ngữ cảnh, và vượt lên về độ trễ quan sát được. Mô hình đóng thắng về các phương thức, và ở những điểm đó nó thắng dứt khoát. Không có gì ở đây tự nó giải thích mức bội số đầu vào 13×.

Two-column scoreboard: DeepSeek V4.1 Flash vs Gemini 3.1 Pro — price per 1M tokens $0.15 input and $0.60 output vs $2.00 and $12.00 up to 200K and $4.00 and $18.00 above, cached input $0.003 vs $0.40, context window 1M tokens on both, max output 384K tokens vs 65K tokens, input modalities text and images vs audio, file, image, text and video, weights MIT vs closed, release state generally available since 2026-09-10 vs in preview since 2026-02-19, and a time to first token of 2.63 s at p50 and 9.05 s at p95 vs 10.00 s at p50 and p95

Vách đá 200K chính là câu chuyện định giá.

Mức giá được công bố của Gemini 3.1 Pro không phải là một mức duy nhất. Các prompt có tối đa 200.000 token đầu vào được tính $2.00 cho đầu vào và $12.00 cho đầu ra trên mỗi triệu token; một prompt vượt ngưỡng đó sẽ được tính ở mức $4.00 và $18.00. DeepSeek V4.1 Flash không có bậc phân tầng — nó tính $0.15 và $0.60 bất kể yêu cầu là 2.000 token hay 900.000 token, với một lưu ý duy nhất rằng DeepSeek tăng gấp đôi mức giá trong giờ cao điểm và chạy hoàn toàn ngoài giờ cao điểm vào cuối tuần.

Ranh giới bậc đó nằm ở đúng vị trí tệ nhất có thể đối với công việc ngữ cảnh dài, bởi vì công việc ngữ cảnh dài theo định nghĩa chính là công việc vượt qua ranh giới đó. Một so sánh có tính toán sẽ khiến điều này trở nên cụ thể. Lấy một pipeline thực hiện 20.000 lượt gọi mỗi tháng, mỗi lượt trung bình 250.000 token đầu vào và 4.000 token đầu ra — một tác vụ phân tích tài liệu trên các tệp lớn.

• DeepSeek V4.1 Flash ở mức giá thấp điểm: 20.000 × 250.000 là 5.000M token đầu vào với đơn giá $0,15 mỗi triệu, tức $750,00. Đầu ra là 20.000 × 4.000, tức 80M token với đơn giá $0,60 mỗi triệu, tức $48,00. Tổng cộng $798,00.

• Gemini 3.1 Pro ở bậc trên 200K của nó: cùng 5.000M token đầu vào ở mức $4,00 mỗi triệu là $20.000,00, và 80M token đầu ra ở mức $18,00 mỗi triệu là $1.440,00. Tổng cộng $21.440,00.

Đó là mức chênh lệch 27× trong chi tiêu hàng tháng cho cùng một lưu lượng truy cập, và đó không phải là bội số mà bạn có thể đoán ra từ những con số tiêu đề. Bội số trên tiêu đề là 13×. Bội số mà bạn thực sự phải trả cho công việc ngữ cảnh dài là 27×, bởi vì ranh giới giữa các bậc nằm đúng ngay chỗ các câu lệnh (prompt) của bạn đang tọa lạc.

Cái giá thực sự mà nhãn xem trước khiến bạn phải trả

Một bản dựng xem trước thì trong toàn ngành vẫn là bản dựng xem trước: nó không đi kèm bất kỳ bảo đảm ổn định nào được công bố. Nhà cung cấp chưa cam kết giữ endpoint ở hành vi đó, mức giá đó hay tên gọi đó. Đó không phải là lời chỉ trích Gemini 3.1 Pro — đó là ý nghĩa của cái nhãn ấy, và đó là lý do hậu tố preview đã tồn tại suốt bảy tháng thay vì chỉ là một thủ tục kéo dài hai tuần.

Với một bản prototype thì điều này chẳng là gì. Với một lộ trình production thì đó là một rủi ro cụ thể, có thể định lượng được: bạn đang đặt cược rằng bản build mà bạn đã tinh chỉnh dựa trên đó sẽ giữ nguyên. Sự tương phản với phía bên kia của phép so sánh này mang tính cấu trúc chứ không phải tu từ. DeepSeek V4.1 Flash đã GA, và trọng số của nó được cấp phép theo MIT và có thể tải xuống, nghĩa là ngay cả khi API được host thay đổi điều khoản vào ngày mai, bản thân mô hình vẫn sẽ nằm trong tay bạn. Một mô hình preview đóng không cho bạn cam kết GA lẫn lối thoát. Nếu workload của bạn có thể chạy trên cả hai, thì sự khác biệt đó đáng giá hơn một điểm benchmark.

Khi nào Gemini 3.1 Pro là công cụ tốt hơn

Khoảng cách phương thức không phải là sai số làm tròn, và đây là khía cạnh duy nhất trong danh sách này mà mô hình rẻ không thể được thay thế bằng bất kỳ mức giá nào. Gemini 3.1 Pro nhận âm thanh và video như đầu vào hạng nhất, cộng với tải tệp lên. DeepSeek V4.1 Flash nhận văn bản và hình ảnh. Nếu pipeline của bạn thu nạp bản ghi âm cuộc gọi, ảnh chụp màn hình hoặc video đánh giá, DeepSeek V4.1 Flash không phải là một lựa chọn rẻ hơn — nó không phải là một lựa chọn. Bội số 13× chẳng có ý nghĩa gì đối với một tác vụ mà một mô hình làm được còn mô hình kia thì không.

Có một trường hợp thứ hai, ít ồn ào hơn. Gemini 3.1 Pro đã được cung cấp công khai, dưới một hình thức nào đó, kể từ tháng Hai, và đây là mô hình có lịch sử vận hành thực tế dài hơn — nhiều người đã chạm tới các giới hạn của nó hơn, và hành vi của nó trên lưu lượng thực tế được ghi nhận đầy đủ hơn so với một bản phát hành mới mười hai ngày. Đối với công việc tương tác nặng về đầu ra, nơi mức chờ trung vị mười giây là chấp nhận được vì công việc chạy nền, thành tích đó chính là lý lẽ, và đó là một lý lẽ thực sự. Đây không phải là một lập luận về độ trễ: theo dữ liệu đo từ xa ở trên, mô hình rẻ hơn là mô hình nhanh hơn trong hai mô hình, ở cả trung vị lẫn đuôi.

Và còn có câu hỏi về ý nghĩa của nhãn xem trước đối với lịch sử đó. Bảy tháng hiện diện dưới tên một bản dựng xem trước là khoảng thời gian dài hơn hầu hết các mô hình có được, và đó cũng là bảy tháng không có cam kết GA. DeepSeek V4.1 Flash mới được mười hai ngày tuổi tính đến thời điểm viết bài và hồ sơ độc lập của nó còn mỏng: lần khảo sát tổng hợp gần đây duy nhất của bên thứ ba mà nó xuất hiện, bảng lập trình tác tử Agents on Rails công bố ngày 21 tháng 9 năm 2026, đã xếp nó ở mức 17% ở chế độ nỗ lực tối đa, giữa bảng. Mười hai ngày không đủ thời gian để danh tiếng của một mô hình có ý nghĩa gì, theo cả hai hướng — đó là lý do trung thực khiến người mua có thể thích mô hình cũ hơn ở đây, và điều đó không liên quan gì đến tốc độ.

Định tuyến theo độ dài ngữ cảnh, vì đó mới là quyết định thực sự

Quyết định mà sự so sánh này ngụ ý không phải là "chọn một." Đó là một quy tắc gồm hai mệnh đề: công việc ngữ cảnh dài, khối lượng lớn thì giao cho DeepSeek V4.1 Flash, còn bất cứ thứ gì có âm thanh hoặc video thì giao cho Gemini 3.1 Pro. Phần khó xử là quy tắc này dễ phát biểu nhưng lại phiền phức khi triển khai, bởi vì hai mệnh đề đó thường nằm ở những nhà cung cấp khác nhau với khóa khác nhau, SDK khác nhau và giới hạn tốc độ khác nhau.

Cả hai mô hình đều có thể truy cập được từ một khóa OrcaRouter duy nhất, điều này biến quy tắc thành một quy tắc định tuyến thay vì mã rẽ nhánh trong ứng dụng của bạn — bạn có thể đặt quyết định dựa trực tiếp trên độ dài ngữ cảnh của yêu cầu, đây chính là chiều kích thực sự tạo ra sự khác biệt về chi phí ở đây. OrcaRouter chuyển tiếp nguyên mức giá niêm yết của nhà cung cấp với 0% chênh lệch, vì vậy các mức giá theo bậc ở trên là của chính Google và lịch giá cao điểm của DeepSeek là của chính DeepSeek, với thay đổi giá từ nhà cung cấp được cập nhật trực tiếp ở phía chúng tôi ngay trong cùng ngày. Và vì một bên trong cặp đôi này là bản dựng xem trước, nên việc đặt cơ chế chuyển đổi dự phòng tự động phía sau là điều đáng làm: nếu bản dựng bị sửa đổi ngầm bên dưới bạn, yêu cầu sẽ chuyển sang mô hình còn lại thay vì rơi vào trang báo lỗi.

Điểm cuối cùng đó chính là phiên bản thực tiễn của mọi điều ở trên. Bội số 27× trong công việc ngữ cảnh dài là lý do để định tuyến thay vì lựa chọn, và nhãn xem trước trên một trong hai mô hình là lý do để có một nơi cho yêu cầu được chuyển đến khi bản dựng thay đổi.

Screenshot of the OrcaRouter model page for google/gemini-3.1-pro-preview, showing the model id, 1M-token context, 65K max output, audio, file, image, text and video input, $2.00 input and $12.00 output per 1M tokens, and observed time to first token of 10.00 s at both p50 and p95

Xem gì

• Liệu Gemini 3.1 Pro có rời khỏi trạng thái preview hay không. Một bản phát hành GA sẽ loại bỏ lưu ý về độ ổn định và thay đổi cục diện của so sánh này nhiều hơn bất kỳ thay đổi giá nào.

• Liệu bậc trên 200K có thay đổi hay không. Ranh giới bậc đóng vai trò lớn hơn trong phép tính chi phí so với mức giá được nêu bật.

• Liệu DeepSeek V4.1 Flash có tích lũy được một thành tích độc lập hay không. Một mô hình với trọng số MIT, giới hạn đầu ra 384K và ngữ cảnh 1M ở mức 0,15 USD cho mỗi triệu token đầu vào là một gói bất thường; liệu năng lực có thực sự đạt đến mức đó hay không là câu hỏi mà chưa có benchmark công khai nào trả lời.

Cho đến khi mô hình đầu tiên trong số đó ra mắt, bản tóm tắt chính xác là thế này: DeepSeek V4.1 Flash rẻ hơn khoảng mười ba lần trên đầu vào và rẻ hơn hai mươi bảy lần trên đầu vào ngữ cảnh dài so với Gemini 3.1 Pro, đây là mô hình duy nhất trong hai mô hình mà bạn có thể tải xuống, và là mô hình duy nhất trong hai mô hình có cam kết GA đằng sau. Gemini 3.1 Pro là mô hình có lịch sử sản xuất dài hơn và là mô hình duy nhất trong hai mô hình có thể đọc âm thanh và video. Hãy định tuyến cho phù hợp.

Screenshot of DeepSeek's own release page for DeepSeek-V4.1-Flash dated 2026/09/10, showing the 552B-parameter MoE architecture with 8B active for input and 16B for output, a KV-cache memory-reduction graphic, and DeepSeek's own four-benchmark comparison chart