
Gemini 3.7 Flash so với Claude Opus 5: Cỗ máy bền bỉ mang lại cho bạn điều gì với chỉ 1/6 mức giá
- openaiMỚIOpenAI: GPT-6.1 Sol2026-09-2952Trí tuệ
- anthropicMỚIAnthropic: Claude Sonnet 5.52026-09-2856Trí tuệ
- typesafeMỚITypeSafe: Jev 1.132026-09-24$0.04 / $0.00 trên 1 triệu token · 221 tok/s
- OpenAIMỚIOpenAI: GPT-6 Luna2026-09-2238Trí tuệ
- OpenAIMỚIOpenAI: GPT-6 Sol2026-09-2248Trí tuệ
- AnthropicMỚIAnthropic: Claude Opus 5.52026-09-2258Trí tuệ
- xAIMỚIGrok 4.72026-09-2146Trí tuệ
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 trên 1 triệu token · 106 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 trên 1 triệu token · 1148 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Trí tuệ
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Trí tuệ77Lập trình
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Trí tuệ76Lập trình
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Trí tuệ76Lập trình
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Trí tuệ82Lập trình
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 trên 1 triệu token · 48 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 trên 1 triệu token · 104 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Trí tuệ72Lập trình
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 trên 1 triệu token · 214 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Trí tuệ75Lập trình
- obsidianQwen3.8 27B2026-08-1534Trí tuệ68Lập trình
Đây là con số khiến phép so sánh này đáng giá: Claude Opus 5, mẫu flagship của Anthropic, đạt 61 điểm trên Artificial Analysis Intelligence Index, trong khi Gemini 3.7 Flash, con ngựa thồ của Google ra mắt ngày 13 tháng 8 năm 2026, đạt 56 điểm. Chênh nhau năm điểm. Và với mức giá khuyến mãi Google đang áp dụng đến hết năm, Gemini 3.7 Flash có giá 0,75 USD cho mỗi triệu token đầu vào và 3,75 USD cho mỗi triệu token đầu ra — khoảng một phần sáu so với mức 5,00 USD / 25,00 USD của Claude Opus 5. Khoảng cách từng tách biệt "con ngựa thồ" khỏi "flagship" đã thu hẹp đến mức câu hỏi trung thực không còn là liệu mô hình rẻ có tốt hay không, mà là mô hình đắt tiền vẫn làm được điều gì mà mô hình rẻ không làm được.
Cách đặt vấn đề rất quan trọng, vì đây không phải là cuộc so sánh ngang cơ, và nếu giả vờ điều ngược lại thì sẽ đánh lừa bạn. Claude Opus 5, phát hành ngày 24 tháng 7 năm 2026, là mô hình mạnh nhất hiện được cung cấp rộng rãi của Anthropic: một mô hình suy luận với ngữ cảnh 1 triệu token, trần đầu ra 128K, được thiết kế cho những tác vụ kỹ thuật, nghiên cứu và sử dụng máy tính khó khăn nhất. Gemini 3.7 Flash là con ngựa thồ chịu tải cao của Google: ngữ cảnh 1M, đầu ra 64K, đầu vào văn bản/hình ảnh/âm thanh/video, và một định hướng thiết kế trái ngược hoàn toàn với Opus — tạo ra càng nhiều token càng tốt, càng rẻ càng tốt, cho 95% lưu lượng truy cập là những tác vụ thường nhật. So sánh chúng bằng một con số duy nhất là cách bạn nhận câu trả lời sai; so sánh chúng dựa trên dạng công việc bạn thực sự chạy mới là cách để có câu trả lời hữu ích.

Năm điểm, được phân tích chi tiết
Chỉ số Trí tuệ không phải là một thang đo tuyến tính, và khoảng cách giữa 56 và 61 có ý nghĩa lớn hơn ở một số tác vụ so với những tác vụ khác. Điểm 61 của Opus 5 đến từ việc dẫn đầu ở những thành phần khó nhất của chỉ số tổng hợp — các kết quả 30.2 trên ARC-AGI-3, 43.3 trên FrontierBench và 79.2 trên SWE-bench Pro đều do nhà cung cấp báo cáo, nhưng chúng là loại kết quả lý luận tiên phong mà không mô hình lớp Flash nào chạm tới. Điểm 56 của Gemini 3.7 Flash đạt được theo cách khác: các con số do Google báo cáo cho mô hình này (65.3 trên DeepSWE v1.1, 1588 Elo trên WebDev Arena, 30.4 trên AutomationBench) cho thấy một mô hình xuất sắc trong các tác vụ kỹ thuật có giới hạn và khối lượng lớn, cũng như trong tác nhân (agents), chứ không phải trong lý luận mở và mới lạ. Do đó, năm điểm chỉ số mô tả một vách đá năng lực thực sự, dù khoảng cách trên bề mặt trông có vẻ nhỏ.
• Intelligence Index — 56 cho Gemini 3.7 Flash so với 61 cho Claude Opus 5 (nỗ lực tối đa), theo Artificial Analysis.
• Tốc độ đầu ra — khoảng 340 token/giây cho Gemini 3.7 Flash so với khoảng 53 token/giây cho Claude Opus 5, cả hai đều theo Artificial Analysis. Chênh lệch gấp 6,4 lần.
• Cửa sổ ngữ cảnh — 1M token cho cả hai, nhưng trần đầu ra của Claude Opus 5 là 128K so với 64K của Gemini 3.7 Flash.
• Giá đầu vào — $0,75 (khuyến mãi, đến năm 2026) so với $5,00 — chênh lệch 6,7 lần.
• Giá đầu ra — $3,75 (khuyến mãi) so với $25,00 — chênh lệch 6,7 lần.
• Đầu vào đa phương thức — Gemini 3.7 Flash nhận văn bản, hình ảnh, âm thanh và video; Claude Opus 5 chỉ nhận văn bản và hình ảnh.

Nơi Claude Opus 5 vẫn xứng đáng với giá tiền của nó
{{1}}Lý do chọn model chủ lực không phải là hoài niệm, mà là phần đuôi của phân phối tác vụ.{{/1}} {{2}}Kỹ thuật tự trị tầm xa — một mô hình được để một mình với một kho mã trong một giờ để lập kế hoạch, chỉnh sửa, kiểm thử và lặp lại — là nơi khoảng cách dẫn đầu được báo cáo của Opus 5 rộng nhất,{{/2}} {{3}}và kết quả sử dụng máy tính của nó (71 trên OSWorld, do nhà cung cấp công bố) đưa nó vào một hạng mà Gemini 3.7 Flash không thể bước vào.{{/3}} {{4}}Các đội đang chuyển khỏi Claude Opus 4.8 cũng nên biết rằng Opus 5 đi kèm với chế độ tư duy thích ứng được bật mặc định cùng các mức nỗ lực được hiệu chỉnh lại, và việc tắt tư duy bị giới hạn ở mức nỗ lực cao —{{/4}} {{5}}những thay đổi hành vi có thể phá vỡ các pipeline hiện có.{{/5}} {{6}}Không điều nào trong số đó khiến nó trở thành lựa chọn sai cho công việc khó khăn; chúng khiến nó trở thành lựa chọn đúng cho một phần công việc hẹp hơn những gì mức giá của nó gợi ý.{{/6}}
Điều khác mà Opus 5 bán là kinh tế nền tảng của Anthropic. Bộ nhớ đệm prompt của nó có thể cắt giảm chi phí đầu vào hiệu quả tới 90% khi trúng cache, và gói batch giảm một nửa giá cho lưu lượng không đồng bộ — vì vậy, khối lượng công việc có tỷ lệ cache và batch cao trên Opus 5 sẽ cho hóa đơn thực tế gần với mức giá thấp hơn nhiều so với con số $5 / $25 nổi bật. Giá thực tế của mẫu chủ lực phụ thuộc vào khối lượng công việc; còn mẫu phổ thông thì không.
Khi nào Gemini 3.7 Flash là lựa chọn mua thông minh hơn
Đối với bất kỳ tác vụ nào phát trực tuyến, xử lý theo lô, hoặc tiêu thụ ngữ cảnh dài, mô hình chủ lực không chỉ rẻ hơn mà còn có vị thế tốt hơn về mặt cấu trúc. Lợi thế tốc độ đầu ra gấp 6,4 lần thay đổi những gì bạn có thể xây dựng: hoàn thành mã tương tác, tóm tắt trực tiếp toàn bộ kho mã nguồn, các vòng lặp tác nhân cần nhiều lần gọi mỗi phút — tất cả đều chạm trần thông lượng trên mô hình 53 token/s rất lâu trước khi chạm trần chất lượng. Gemini 3.7 Flash cũng hỗ trợ đầu vào âm thanh và video, mở ra các trường hợp sử dụng (phiên âm cuộc họp, hiểu khung hình video) mà không mô hình Claude nào làm được trên phương diện đầu vào đó. Và mức độ tư duy có thể điều chỉnh của nó cho phép bạn chạy ở mức nỗ lực thấp cho các tác vụ thường quy chi phí thấp và ở mức nỗ lực cao cho tập con khó hơn, chỉ trả tiền cho phần suy luận bạn sử dụng.
Cẩm nang ghép cặp
Những người đang trực tiếp áp dụng về cơ bản đã ngừng coi đây là một bài toán một-mất-một-còn, và mô hình lặp lại thường thấy là một vòng lặp chia để trị: Claude Opus 5 lập kế hoạch và thiết kế, Gemini 3.7 Flash triển khai khối lượng lớn, còn Opus 5 thì rà soát. Mỗi mô hình được dùng ở nơi mà tỷ lệ chất lượng/chi phí là tối ưu, và đường ống kết hợp vừa rẻ hơn vừa nhanh hơn so với việc chạy đơn lẻ từng mô hình. Một lớp định tuyến khiến mô hình này không chỉ còn là kiến trúc mà đã đi vào thực tế: Claude Opus 5 đã hoạt động trên OrcaRouter với giá niêm yết của Anthropic, 0% phụ phí; DSL định tuyến cho phép bạn tạo một lời gọi duy nhất, gửi bộ lập kế hoạch đến Opus 5 và bộ thực thi qua các mô hình lớp Flash đứng sau một endpoint tương thích OpenAI — bước tiến xa hơn là mô hình hợp nhất (model fusion), khi cả hai mô hình cùng trả lời một câu hỏi và một bộ trọng tài đối chiếu hai kết quả.

Hóa đơn, hiển thị cạnh nhau
Hãy đưa ra những con số thực tế. Một ngày với 10 triệu token đầu vào và 1 triệu token đầu ra — một pipeline tác nhân nặng nhưng thông thường — có chi phí $75 + $375 = $450 theo mức giá tiêu chuẩn của Claude Opus 5. Cùng mức sử dụng đó trên mức giá khuyến mãi của Gemini 3.7 Flash có chi phí $7.50 + $37.50 = $45, chính xác là một phần mười. Ngay cả khi tính đến các khoản giảm giá bộ nhớ đệm của Opus cho đầu vào, khoảng cách vẫn là một bậc độ lớn, và đó là lý do "flash cho phần lớn, opus cho phần khó nhằn" đã trở thành cấu hình sản xuất mặc định thay vì một cấu hình hiếm gặp. Khi chương trình khuyến mãi kết thúc, mức giá đầu vào của Gemini 3.7 Flash tăng gấp đôi lên $1.50 — vẫn bằng một phần ba của Opus, và vẫn đủ rẻ để giữ nguyên phép tính kết hợp.
Cái nhìn trung thực
{{1}}Khoảng cách năm điểm là có thật và nó nằm chính xác ở nơi bạn mong đợi: ở những công việc khó nhất, dài hạn nhất.{{/1}} {{2}}Nếu khối lượng công việc của bạn bị chi phối bởi phần đuôi đó{{/2}} — {{3}}nghiên cứu tiên phong, công việc kỹ thuật tự động kéo dài nhiều giờ, sử dụng máy tính{{/3}} — {{4}}Claude Opus 5 xứng đáng với mức giá của nó và bạn không nên suy nghĩ quá nhiều.{{/4}} {{5}}Nếu khối lượng công việc của bạn bị chi phối bởi khối lượng, độ trễ hoặc ngữ cảnh dài{{/5}}, {{6}}Gemini 3.7 Flash ở mức giá ưu đãi là lựa chọn đáng mua hơn hẳn{{/6}}, và {{7}}khoảng cách đến mẫu flagship chỉ là một bậc benchmark, không phải một vực thẳm.{{/7}} {{8}}Các mô hình đang hội tụ{{/8}}, và {{9}}câu trả lời thực tế cho hầu hết các đội ngũ không còn là{{/9}} "{{10}}chọn cái nào{{/10}}" {{11}}mà{{/11}} là "{{12}}phần nào của công việc nên giao cho cái nào.{{/12}}"
So sánh trong bài viết này1
Phát hiện từ bài viết này · Benchmark: Artificial Analysis · cập nhật hằng ngày
