Một tấm tiêu đề cho phép so sánh Gemini 3.7 Flash với Claude Opus 5, hiển thị thẻ vận động viên chạy nước rút nhanh có nhãn Gemini 3.7 Flash với thẻ giá $0.75 / $3.75, thẻ tòa tháp cao có nhãn Claude Opus 5 với thẻ giá $5 / $25, và một biểu tượng phân số 1/6 nhỏ ở giữa chúng.
Guides & Insights

Gemini 3.7 Flash so với Claude Opus 5: Cỗ máy bền bỉ mang lại cho bạn điều gì với chỉ 1/6 mức giá

Tác giả

Rowan Sterling

Ngày đăng

Mô hình mới nhất · 20Xem tất cả mô hình →
Benchmark: Artificial Analysis · cập nhật hằng ngày
Quay lại tất cả bài viết

Đây là con số khiến phép so sánh này đáng giá: Claude Opus 5, mẫu flagship của Anthrop​ic, đạt 61 điểm trên Artificial Analysis Intelligence Index, trong khi Gemini 3.7 Flash, con ngựa thồ của Go​ogle ra mắt ngày 13 tháng 8 năm 2026, đạt 56 điểm. Chênh nhau năm điểm. Và với mức giá khuyến mãi Go​ogle đang áp dụng đến hết năm, Gemini 3.7 Flash có giá 0,75 USD cho mỗi triệu token đầu vào và 3,75 USD cho mỗi triệu token đầu ra — khoảng một phần sáu so với mức 5,00 USD / 25,00 USD của Claude Opus 5. Khoảng cách từng tách biệt "con ngựa thồ" khỏi "flagship" đã thu hẹp đến mức câu hỏi trung thực không còn là liệu mô hình rẻ có tốt hay không, mà là mô hình đắt tiền vẫn làm được điều gì mà mô hình rẻ không làm được.

Cách đặt vấn đề rất quan trọng, vì đây không phải là cuộc so sánh ngang cơ, và nếu giả vờ điều ngược lại thì sẽ đánh lừa bạn. Claude Opus 5, phát hành ngày 24 tháng 7 năm 2026, là mô hình mạnh nhất hiện được cung cấp rộng rãi của Anthrop​ic: một mô hình suy luận với ngữ cảnh 1 triệu token, trần đầu ra 128K, được thiết kế cho những tác vụ kỹ thuật, nghiên cứu và sử dụng máy tính khó khăn nhất. Gemini 3.7 Flash là con ngựa thồ chịu tải cao của Go​ogle: ngữ cảnh 1M, đầu ra 64K, đầu vào văn bản/hình ảnh/âm thanh/video, và một định hướng thiết kế trái ngược hoàn toàn với Opus — tạo ra càng nhiều token càng tốt, càng rẻ càng tốt, cho 95% lưu lượng truy cập là những tác vụ thường nhật. So sánh chúng bằng một con số duy nhất là cách bạn nhận câu trả lời sai; so sánh chúng dựa trên dạng công việc bạn thực sự chạy mới là cách để có câu trả lời hữu ích.

The Google DeepMind model card for Gemini 3.7 Flash, showing the model's headline description as Google's workhorse model for coding and agents, its 1M-token context window and 64K output cap, and benchmark tables of its gains over Gemini 3.6 Flash.

Năm điểm, được phân tích chi tiết

Chỉ số Trí tuệ không phải là một thang đo tuyến tính, và khoảng cách giữa 56 và 61 có ý nghĩa lớn hơn ở một số tác vụ so với những tác vụ khác. Điểm 61 của Opus 5 đến từ việc dẫn đầu ở những thành phần khó nhất của chỉ số tổng hợp — các kết quả 30.2 trên ARC-AGI-3, 43.3 trên FrontierBench và 79.2 trên SWE-bench Pro đều do nhà cung cấp báo cáo, nhưng chúng là loại kết quả lý luận tiên phong mà không mô hình lớp Flash nào chạm tới. Điểm 56 của Gemini 3.7 Flash đạt được theo cách khác: các con số do Go​ogle báo cáo cho mô hình này (65.3 trên DeepSWE v1.1, 1588 Elo trên WebDev Arena, 30.4 trên AutomationBench) cho thấy một mô hình xuất sắc trong các tác vụ kỹ thuật có giới hạn và khối lượng lớn, cũng như trong tác nhân (agents), chứ không phải trong lý luận mở và mới lạ. Do đó, năm điểm chỉ số mô tả một vách đá năng lực thực sự, dù khoảng cách trên bề mặt trông có vẻ nhỏ.

• Intelligence Index — 56 cho Gemini 3.7 Flash so với 61 cho Claude Opus 5 (nỗ lực tối đa), theo Artificial Analysis.

• Tốc độ đầu ra — khoảng 340 token/giây cho Gemini 3.7 Flash so với khoảng 53 token/giây cho Claude Opus 5, cả hai đều theo Artificial Analysis. Chênh lệch gấp 6,4 lần.

• Cửa sổ ngữ cảnh — 1M token cho cả hai, nhưng trần đầu ra của Claude Opus 5 là 128K so với 64K của Gemini 3.7 Flash.

• Giá đầu vào — $0,75 (khuyến mãi, đến năm 2026) so với $5,00 — chênh lệch 6,7 lần.

• Giá đầu ra — $3,75 (khuyến mãi) so với $25,00 — chênh lệch 6,7 lần.

• Đầu vào đa phương thức — Gemini 3.7 Flash nhận văn bản, hình ảnh, âm thanh và video; Claude Opus 5 chỉ nhận văn bản và hình ảnh.

A comparison scoreboard for Gemini 3.7 Flash and Claude Opus 5: Claude Opus 5 leads 61 to 56 on the AA Index and 128K to 64K on max output, but Gemini 3.7 Flash leads ~340 to ~53 tokens per second, $0.75 to $5.00 input and $3.75 to $25.00 output, with both at 1M context.

Nơi Claude Opus 5 vẫn xứng đáng với giá tiền của nó

{{1}}Lý do chọn model chủ lực không phải là hoài niệm, mà là phần đuôi của phân phối tác vụ.{{/1}} {{2}}Kỹ thuật tự trị tầm xa — một mô hình được để một mình với một kho mã trong một giờ để lập kế hoạch, chỉnh sửa, kiểm thử và lặp lại — là nơi khoảng cách dẫn đầu được báo cáo của Opus 5 rộng nhất,{{/2}} {{3}}và kết quả sử dụng máy tính của nó (71 trên OSWorld, do nhà cung cấp công bố) đưa nó vào một hạng mà Gemini 3.7 Flash không thể bước vào.{{/3}} {{4}}Các đội đang chuyển khỏi Claude Opus 4.8 cũng nên biết rằng Opus 5 đi kèm với chế độ tư duy thích ứng được bật mặc định cùng các mức nỗ lực được hiệu chỉnh lại, và việc tắt tư duy bị giới hạn ở mức nỗ lực cao —{{/4}} {{5}}những thay đổi hành vi có thể phá vỡ các pipeline hiện có.{{/5}} {{6}}Không điều nào trong số đó khiến nó trở thành lựa chọn sai cho công việc khó khăn; chúng khiến nó trở thành lựa chọn đúng cho một phần công việc hẹp hơn những gì mức giá của nó gợi ý.{{/6}}

Điều khác mà Opus 5 bán là kinh tế nền tảng của Anthropic. Bộ nhớ đệm prompt của nó có thể cắt giảm chi phí đầu vào hiệu quả tới 90% khi trúng cache, và gói batch giảm một nửa giá cho lưu lượng không đồng bộ — vì vậy, khối lượng công việc có tỷ lệ cache và batch cao trên Opus 5 sẽ cho hóa đơn thực tế gần với mức giá thấp hơn nhiều so với con số $5 / $25 nổi bật. Giá thực tế của mẫu chủ lực phụ thuộc vào khối lượng công việc; còn mẫu phổ thông thì không.

Khi nào Gemini 3.7 Flash là lựa chọn mua thông minh hơn

Đối với bất kỳ tác vụ nào phát trực tuyến, xử lý theo lô, hoặc tiêu thụ ngữ cảnh dài, mô hình chủ lực không chỉ rẻ hơn mà còn có vị thế tốt hơn về mặt cấu trúc. Lợi thế tốc độ đầu ra gấp 6,4 lần thay đổi những gì bạn có thể xây dựng: hoàn thành mã tương tác, tóm tắt trực tiếp toàn bộ kho mã nguồn, các vòng lặp tác nhân cần nhiều lần gọi mỗi phút — tất cả đều chạm trần thông lượng trên mô hình 53 token/s rất lâu trước khi chạm trần chất lượng. Gemini 3.7 Flash cũng hỗ trợ đầu vào âm thanh và video, mở ra các trường hợp sử dụng (phiên âm cuộc họp, hiểu khung hình video) mà không mô hình Claude nào làm được trên phương diện đầu vào đó. Và mức độ tư duy có thể điều chỉnh của nó cho phép bạn chạy ở mức nỗ lực thấp cho các tác vụ thường quy chi phí thấp và ở mức nỗ lực cao cho tập con khó hơn, chỉ trả tiền cho phần suy luận bạn sử dụng.

Cẩm nang ghép cặp

Những người đang trực tiếp áp dụng về cơ bản đã ngừng coi đây là một bài toán một-mất-một-còn, và mô hình lặp lại thường thấy là một vòng lặp chia để trị: Claude Opus 5 lập kế hoạch và thiết kế, Gemini 3.7 Flash triển khai khối lượng lớn, còn Opus 5 thì rà soát. Mỗi mô hình được dùng ở nơi mà tỷ lệ chất lượng/chi phí là tối ưu, và đường ống kết hợp vừa rẻ hơn vừa nhanh hơn so với việc chạy đơn lẻ từng mô hình. Một lớp định tuyến khiến mô hình này không chỉ còn là kiến trúc mà đã đi vào thực tế: Claude Opus 5 đã hoạt động trên OrcaRouter với giá niêm yết của Anthrop​ic, 0% phụ phí; DSL định tuyến cho phép bạn tạo một lời gọi duy nhất, gửi bộ lập kế hoạch đến Opus 5 và bộ thực thi qua các mô hình lớp Flash đứng sau một endpoint tương thích OpenAI — bước tiến xa hơn là mô hình hợp nhất (model fusion), khi cả hai mô hình cùng trả lời một câu hỏi và một bộ trọng tài đối chiếu hai kết quả.

The OrcaRouter model page for Claude Opus 5, showing Anthropic's $5.00 per million input and $25.00 per million output list pricing and a 1M-token context window.

Hóa đơn, hiển thị cạnh nhau

Hãy đưa ra những con số thực tế. Một ngày với 10 triệu token đầu vào và 1 triệu token đầu ra — một pipeline tác nhân nặng nhưng thông thường — có chi phí $75 + $375 = $450 theo mức giá tiêu chuẩn của Claude Opus 5. Cùng mức sử dụng đó trên mức giá khuyến mãi của Gemini 3.7 Flash có chi phí $7.50 + $37.50 = $45, chính xác là một phần mười. Ngay cả khi tính đến các khoản giảm giá bộ nhớ đệm của Opus cho đầu vào, khoảng cách vẫn là một bậc độ lớn, và đó là lý do "flash cho phần lớn, opus cho phần khó nhằn" đã trở thành cấu hình sản xuất mặc định thay vì một cấu hình hiếm gặp. Khi chương trình khuyến mãi kết thúc, mức giá đầu vào của Gemini 3.7 Flash tăng gấp đôi lên $1.50 — vẫn bằng một phần ba của Opus, và vẫn đủ rẻ để giữ nguyên phép tính kết hợp.

Cái nhìn trung thực

{{1}}Khoảng cách năm điểm là có thật và nó nằm chính xác ở nơi bạn mong đợi: ở những công việc khó nhất, dài hạn nhất.{{/1}} {{2}}Nếu khối lượng công việc của bạn bị chi phối bởi phần đuôi đó{{/2}} — {{3}}nghiên cứu tiên phong, công việc kỹ thuật tự động kéo dài nhiều giờ, sử dụng máy tính{{/3}} — {{4}}Claude Opus 5 xứng đáng với mức giá của nó và bạn không nên suy nghĩ quá nhiều.{{/4}} {{5}}Nếu khối lượng công việc của bạn bị chi phối bởi khối lượng, độ trễ hoặc ngữ cảnh dài{{/5}}, {{6}}Gemini 3.7 Flash ở mức giá ưu đãi là lựa chọn đáng mua hơn hẳn{{/6}}, và {{7}}khoảng cách đến mẫu flagship chỉ là một bậc benchmark, không phải một vực thẳm.{{/7}} {{8}}Các mô hình đang hội tụ{{/8}}, và {{9}}câu trả lời thực tế cho hầu hết các đội ngũ không còn là{{/9}} "{{10}}chọn cái nào{{/10}}" {{11}}mà{{/11}} là "{{12}}phần nào của công việc nên giao cho cái nào.{{/12}}"

So sánh trong bài viết này1

Phát hiện từ bài viết này · Benchmark: Artificial Analysis · cập nhật hằng ngày