
Claude Haiku 5.5 vs Gemini 3.7 Flash: Một trong hai đã bị khai tử rồi
- openaiMỚIOpenAI: GPT-6.1 Sol2026-09-2952Trí tuệ
- anthropicMỚIAnthropic: Claude Sonnet 5.52026-09-2856Trí tuệ
- typesafeMỚITypeSafe: Jev 1.132026-09-24$0.04 / $0.00 trên 1 triệu token · 128 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238Trí tuệ
- OpenAIOpenAI: GPT-6 Sol2026-09-2248Trí tuệ
- AnthropicAnthropic: Claude Opus 5.52026-09-2258Trí tuệ
- xAIGrok 4.72026-09-2146Trí tuệ
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 trên 1 triệu token · 60 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 trên 1 triệu token · 320 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Trí tuệ
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Trí tuệ77Lập trình
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Trí tuệ76Lập trình
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Trí tuệ76Lập trình
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Trí tuệ82Lập trình
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 trên 1 triệu token · 54 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 trên 1 triệu token · 356 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Trí tuệ72Lập trình
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 trên 1 triệu token · 232 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Trí tuệ75Lập trình
- obsidianQwen3.8 27B2026-08-1534Trí tuệ68Lập trình
Có một sự thật trớ trêu nằm dưới bất kỳ bài so sánh Claude Haiku 5.5 so với Gemini 3.7 Flash nào được viết hôm nay: Gemini 3.7 Flash đã bị ngừng hỗ trợ. Nhà cung cấp đã phát hành nó vào ngày 13 tháng 8 năm 2026, thay thế bằng Gemini 3.8 Flash vào ngày 2 tháng 9, và Artificial Analysis hiện giữ trang 3.7 với cờ báo ngừng hỗ trợ trên đó. Ngược lại, Claude Haiku 5.5 ra mắt vào ngày 7 tháng 10 năm 2026 và có cam kết ngừng hỗ trợ không sớm hơn tháng 10 năm 2027.
Điều đó không làm cho việc so sánh trở nên vô ích. Nó thay đổi câu hỏi. Đây không còn là “trong hai cái này tôi nên gọi cái nào” — với hầu hết các đội nhóm, câu trả lời cho điều đó là không cái nào cả, bởi vì dòng 3.7 đã bị thay thế ngay trong chính gia đình của nó. Cái nó hữu ích cho là một điều tinh tế hơn và có thể nói là hữu dụng hơn: một cách đọc rõ ràng về việc tầng flash của Google đã tiến nhanh đến mức nào trong ba tuần, và về việc những phần nào trong bảng thông số của một mô hình thuộc tầng flash thực sự quyết định liệu nó có được dùng hay không.
Những gì bạn vẫn có thể đo lường
Cả hai mô hình đều đã được chạy trên cùng một bảng đánh giá độc lập, nơi duy nhất có thể so sánh trực tiếp cả hai. Trên Artificial Analysis Intelligence Index v4.3.2, Claude Haiku 5.5 đạt 43,40 điểm ở cấu hình Max, so với 39,06 của Gemini 3.7 Flash ở cấu hình High — chênh lệch 4,33 điểm.
Cả hai nhà cung cấp cũng công bố các bộ đánh giá của riêng họ, và chúng không trùng nhau theo cách cho phép so sánh trực tiếp. Các hàng độc lập dùng chung là bốn bộ mà Artificial Analysis đã chạy trên cả hai:
• Terminal Bench 4.0 — 0.3283 cho Claude Haiku 5.5 so với 0.1364 cho Gemini 3.7 Flash. Khoảng cách tuyệt đối 19 điểm, và là mức bất đối xứng lớn nhất trong bộ này.
• SciCode — 0.5498 so với 0.5718. Gemini 3.7 Flash nhỉnh hơn 2.2 điểm.
• Humanity's Last Exam — 0,4439 so với 0,4787. Gemini 3.7 Flash hơn 3,5 điểm.
AutomationBench, điểm một phần — 0.3541 so với 0.6203. Do Gemini 3.0 Flash thực hiện.
Hãy đọc kỹ tập hợp đó, vì nó chứa kết quả thú vị. Gemini 3.7 Flash thắng ba trong bốn benchmark chung và vẫn thua chỉ số tổng hợp 4,3 điểm. Chỉ số là một hỗn hợp có trọng số, và cách đánh trọng số đặt các hạng mục terminal-và-code — nơi khoảng cách lại chạy theo hướng ngược lại với biên độ lớn hơn nhiều — lên trước phần tổng hợp của những hạng mục còn lại. Đó không phải là một sản phẩm phụ của cách tính điểm mà đúng hơn là một phát biểu về mục đích của chỉ số: nó đang cố dự đoán liệu một mô hình có thể hoàn thành một công việc hay không, và ở câu hỏi đó, dòng 3.7 yếu theo một cách mà điểm số benchmark khoa học đáng nể của nó không hề che giấu được.

Dòng 3.7 thực sự yếu ở những điểm nào
Hai hàng kể câu chuyện tốt hơn chỉ mục.
Terminal Bench 4.0 ở mức 0.1364 là một con số thấp, và nó nằm cạnh mức 0.8577 trên thế hệ Terminal Bench trước đó của cùng mô hình. Đó không phải là một mô hình trở nên tệ hơn; mà là một benchmark đã thay đổi thứ nó đo lường, và Gemini 3.7 Flash đã không thực hiện được bước chuyển đổi đó. Claude Haiku 5.5, trên cùng benchmark đã được sửa đổi, đạt 0.3283 — không ấn tượng nếu xét theo giá trị tuyệt đối, nhưng gần gấp hai lần rưỡi con số của 3.7 Flash, trên hàng dự báo trực tiếp nhất về hiệu năng lập trình tác tử.
Hàng thứ hai là Tau-Bench Banking, nơi Gemini 3.7 Flash đạt điểm 0.3278. Độ tin cậy khi sử dụng công cụ trong một lĩnh vực có cấu trúc chính là lý do người ta triển khai một mô hình rẻ, và mức điểm dưới 0.33 là kiểu con số âm thầm giết chết một dự án thí điểm. Claude Haiku 5.5 không có số liệu Tau-Bench nào được công bố trong cùng bảng đó, nên không có cơ sở để so sánh ở đây — điều trung thực là nói rõ như vậy thay vì suy diễn ra một con số.
Nơi Gemini 3.7 Flash trụ vững cũng chính là nơi nó luôn trụ vững: GPQA ở mức 0.9455 và MMMU-Pro ở mức 0.8549 đều là những điểm mạnh thực sự, và đầu vào đa phương thức của nó chưa bao giờ bị nghi ngờ. Thất bại nằm ở phần của bảng thông số quyết định liệu một vòng lặp agent có hoạt động hay không, chứ không phải phần giúp giành các dòng trên bảng xếp hạng.
Điều gì đã thay đổi trong ba tuần sau đó?
Gemini 3.8 Flash ra mắt vào ngày 2 tháng 9 năm 2026, và sự chuyển dịch bên trong chính phân khúc Flash của Google là phép so sánh hữu ích hơn cho bất kỳ ai đang lên kế hoạch cho pipeline năm 2027.
Trên cùng chỉ số, Gemini 3.8 Flash đạt 40,93 so với 39,06 của dòng 3.7 — mức tăng 1,87 điểm trong ba tuần. Terminal Bench 4.0 đã tăng từ 0,1364 lên 0,1970. Tau-Bench Banking đã tăng từ 0,3278 lên 0,4495. Đó chính xác là những dòng mà mô hình 3.7 làm tệ nhất, điều này cho thấy bản kế nhiệm đã nhắm vào đúng điểm yếu này thay vì một sự cải thiện năng lực tổng quát.
Giá hoàn toàn không nhúc nhích. Gemini 3.7 Flash được niêm yết ở mức 0,75 USD cho đầu vào và 3,75 USD cho đầu ra trên mỗi triệu token, và Gemini 3.8 Flash ra mắt với đúng mức 0,75 USD và 3,75 USD — cùng một bảng giá y hệt, gắn với một mô hình tốt hơn hai điểm chỉ số ở những dòng quan trọng đối với các agent.

Bảng cước chính là nơi cuộc so sánh này thực sự đổi chiều.
So với Claude Haiku 5.5, giá của Google là tất cả, và khoảng cách không hề nhỏ.
• Đầu vào — Claude Haiku 5.5 $0,10 mỗi triệu token cho đến 100.000 token, $0,50 cho phần vượt trên; Gemini 3.7 Flash $0,75 cố định, tức gấp bảy lần rưỡi mức giá của Anthropic trong bậc đầu tiên.
• Đầu ra — $0.50 cho Claude Haiku 5.5 trong bậc đầu tiên, $2.50 khi vượt bậc đó; $3.75 cho Gemini 3.7 Flash.
• Đầu vào được lưu trong bộ nhớ đệm — $0.01 và $0.125 cho Claude Haiku 5.5; $0.075 cho đọc và $0.75 cho ghi đối với Gemini 3.7 Flash.
• Ngữ cảnh — một triệu token cho cả hai. Đầu ra tối đa — 128.000 token cho Claude Haiku 5.5 so với 65.536 token cho Gemini 3.7 Flash.
• Phương thức đầu vào — văn bản và hình ảnh cho Claude Haiku 5.5; văn bản, hình ảnh, giọng nói và video cho Gemini 3.7 Flash. Đây vẫn là dòng duy nhất mà thông số kỹ thuật của Google thực sự dài hơn, và nó vẫn giữ nguyên không đổi qua lần chuyển tiếp sang 3.8.
• Chi phí độc lập cho mỗi tác vụ Index đã hoàn thành — 0,21 USD đối với Claude Haiku 5.5 so với 0,93 USD đối với Gemini 3.7 Flash. Một khoảng cách 4,4 lần, rộng hơn mức mà tỷ lệ đầu vào 7,5 trên 1 có thể gợi ý, bởi vì mô hình của Anthropic mới là bên dài dòng ở đây: 162.164 token đầu ra cho mỗi tác vụ Index, so với 58.387 token của Gemini 3.7 Flash. Anthropic cũng ghi nhận một tokenizer dùng chung với Claude 4.7 và các phiên bản về sau, vốn đếm nhiều hơn khoảng 30% số token cho cùng một đoạn văn bản, điều này cũng đẩy theo cùng một hướng.
• Tốc độ — 212,3 giây cho mỗi tác vụ Index đối với Gemini 3.7 Flash, so với 424,6 giây của Claude Haiku 5.5. Mô hình của Google nhanh hơn mô hình kia gấp hai lần, và đây là dòng duy nhất trong phần này mà mô hình rẻ hơn không đồng thời cũng là mô hình tốt hơn.
Điều này có nghĩa gì nếu bạn đang lựa chọn ngày hôm nay
Cách hiểu thực tế là cả hai điều này đều không phải là câu trả lời đúng, vì những lý do khác nhau.
Gemini 3.7 Flash đã bị ngừng hỗ trợ, được định giá ngang bằng với mô hình kế nhiệm, và kém hơn mô hình kế nhiệm đó đúng ở những dòng mà một mô hình production giá rẻ cần. Đề xuất nó chẳng khác nào đề xuất một bảng giá gắn với một mô hình đã bị thay thế — mô hình kế nhiệm có cùng mức giá mà làm được nhiều hơn. Không ai đang chọn giữa hai mô hình này vào tháng 10 năm 2026 lại nên chọn dòng 3.7, và việc bảng giá của nó không thay đổi chính là điều định đoạt.
Claude Haiku 5.5 là mô hình đang hoạt động, và với công việc văn bản vào, văn bản ra, nó rẻ hơn theo mọi thước đo, cao hơn ở điểm tổng hợp, và tốt hơn hẳn ở hai hàng dự đoán thành công của tác nhân. Nó cũng là mô hình chậm hơn và không thể nhận giọng nói hay video. Việc điều đó có quan trọng hay không là câu hỏi về pipeline của bạn, không phải về các mô hình.
Lựa chọn thứ ba, vốn được khoảng cách điểm chỉ số giữa 3.8 và 3.7 làm cho hiện rõ, là dòng Flash của Google đang tiến bộ nhanh tới mức một phép so sánh đã ba tuần tuổi cũng đã thành dĩ vãng. Hãy coi bất kỳ màn đối đầu trực tiếp nào ở dòng Flash cũng chỉ có hạn sử dụng được đo bằng tuần, chứ không phải bằng quý.
Chạy bất kỳ bên nào bạn chọn
Gemini 3.8 Flash — phiên bản kế nhiệm, không phải bản 3.7 đã ngừng hỗ trợ — có trong danh mục của OrcaRouter theo giá niêm yết của Google với mức chênh 0%, vì vậy mức giá Google công bố chính là mức giá đi thẳng vào hóa đơn của bạn và thay đổi từ phía họ sẽ được cập nhật bên chúng tôi ngay trong cùng ngày. Claude Sonnet 5.5 và Claude Opus 5.5 cũng có trong danh mục, khiến một bài kiểm thử định tuyến hai nhà cung cấp trở thành một cấu hình thay vì một dự án: một API cho hơn 200 mô hình, một khóa, chuyển đổi dự phòng tự động ở bên dưới, cùng DSL định tuyến khi bạn muốn giữ việc leo thang trong tuyến hơn là trong mã.
Bản thân Gemini 3.7 Flash không có trong danh mục của chúng tôi, và Claude Haiku 5.5 cũng vậy. Cả hai vẫn có thể truy cập được thông qua API riêng của nhà cung cấp chúng và, trong trường hợp của Google, một số nền tảng bên thứ ba. Điều đó đáng được nói thẳng ra thay vì để người đọc tự phát hiện.

Số trừ
Vấn đề không phải là khoảng cách 4,33 điểm trên chỉ số. Mà là việc Gemini 3.7 Flash thắng ba trong bốn benchmark dùng chung và vẫn thua điểm tổng hợp bốn điểm, bởi vì benchmark được chỉ số này đánh trọng số cao nhất lại chính là cái mà nó đạt 0,1364. Điểm số khoa học của một mô hình phân khúc flash có thể trông vẫn ổn trong khi nó thất bại ở đúng thứ mà người ta mua các mô hình rẻ để làm.
Hệ quả là người kế nhiệm đã sửa chính xác những hàng đó trong vòng ba tuần, với mức giá không đổi. Dựa trên bằng chứng này, áp lực cạnh tranh ở phân khúc này không phải là giá. Mà là liệu mô hình có thể hoàn thành một tác vụ gồm nhiều bước hay không, và điều đó hiện đang tiến triển nhanh hơn cả bảng giá.
