Một thẻ hero được tạo có tiêu đề 'Claude Haiku 5.5 vs Gemini 3.6 Flash' với dòng nhấn 'CHI PHÍ MỖI CÂU TRẢ LỜI GẤP 7.5 LẦN', hiển thị Claude Haiku 5.5 ở Đầu vào $0.10, Đầu ra $0.50 và Chỉ số 43.40 so với Gemini 3.6 Flash ở Đầu vào $0.75, Đầu ra $3.75 và Chỉ số 33.98, trên một thanh ghi 'Chi phí cho mỗi tác vụ hoàn thành $0.21 so với $1.60'.
Engineering & Research

Claude Haiku 5.5 so với Gemini 3.6 Flash: Chi phí mỗi câu trả lời cao gấp 7,5 lần, mô hình kém hơn 9 điểm

Tác giả

Rowan Sterling

Ngày đăng

Mô hình mới nhất · 20Xem tất cả mô hình →
Benchmark: Artificial Analysis · cập nhật hằng ngày
Quay lại tất cả bài viết

Claude Haiku 5.5 và Gemini 3.6 Flashnằm cùng một phân khúc trong dòng sản phẩm tương ứng — bản nhỏ, nhanh và rẻ — và đó chính là nơi mọi điểm tương đồng chấm dứt. Trên Artificial Analysis Intelligence Index v4.3.2, Claude Haiku 5.5 đạt 43,40 điểm ở cấu hình Max, so với 33,98 điểm của Gemini 3.6 Flash ở cấu hình High. Trong cùng lần chạy đó, một tác vụ Index hoàn thành tốn 0,21 USD trên Claude Haiku 5.5 và 1,60 USD trên Gemini 3.6 Flash.

Hãy đọc cặp này cùng nhau, vì đọc riêng từng cái đều gây hiểu lầm. Mô hình rẻ hơn không chỉ rẻ hơn chút đỉnh; nó rẻ hơn 7,5 lần cho mỗi tác vụ hoàn thành. Và mô hình mà nó đang đánh bại không chỉ yếu hơn chút đỉnh; nó yếu hơn 9,42 điểm chỉ số, mà trên một bảng xếp hạng 182 mô hình, đó là khoảng cách giữa tứ phân vị trên và tứ phân vị dưới.

Cả hai dữ kiện đều đến từ cùng một lần chạy độc lập; điều này quan trọng vì các thẻ nhà cung cấp ở đây không cho bạn biết cái nào trong hai dữ kiện đó. Anthropic ra mắt Claude Haiku 5.5 vào ngày 7 tháng 10 năm 2026; Google phát hành Gemini 3.6 Flash vào ngày 21 tháng 7 năm 2026. Ba tháng giữa hai mốc thời gian đó mới là phần thú vị.

Hai thẻ, cạnh nhau

Trên mỗi triệu token, tính bằng đô la Mỹ. Mức giá của Anthropic và Google đến từ tài liệu định giá của chính họ; các hàng dùng chung là Artificial Analysis Intelligence Index v4.3.2. Đã lưu trong bộ nhớ đệm 2026-10-08.

A generated two-column scoreboard titled 'Claude Haiku 5.5 vs Gemini 3.6 Flash — the scoreboard' with rows Index v4.3.2 43.40 against 33.98, cost per task $0.21 against $1.60, input price $0.10 against $0.75, output tokens per task 162,164 against 41,606, Terminal Bench 4.0 0.3283 against 0.0707 and input modality 'text, image' against 'text, image, video, audio', footed 'All figures per Artificial Analysis Intelligence Index v4.3.2; Gemini 3.6 Flash is flagged deprecated on the board.'

• Đầu vào — Claude Haiku 5.5 $0.10 cho tối đa 100.000 token và $0.50 cho phần vượt trên; Gemini 3.6 Flash $0.75 cố định hiện nay, sẽ tăng lên $1.50 vào ngày 1 tháng 1 năm 2027.

• Đầu ra — Claude Haiku 5.5 $0.50 cho tối đa 100.000 token và $2.50 cho phần vượt trên; Gemini 3.6 Flash $3.75 mức cố định hôm nay, tăng lên $7.50 vào cùng ngày.

• Đầu vào được lưu trong bộ nhớ đệm — Claude Haiku 5.5 $0,01 và $0,05; Gemini 3.6 Flash $0,075, cộng thêm phí lưu trữ $0,50 cho mỗi triệu token mỗi giờ.

• Ngữ cảnh và giới hạn đầu ra — 1M token cho cả hai. Claude Haiku 5.5 giới hạn phản hồi ở 128.000 token; Gemini 3.6 Flash ở 65.536.

• Phương thức — Claude Haiku 5.5 tiếp nhận văn bản và hình ảnh. Gemini 3.6 Flash tiếp nhận văn bản, hình ảnh, video, âm thanh và tệp. Đây là hàng duy nhất mà phía Google vượt trội một cách không thể tranh cãi, và đối với một pipeline hiểu phương tiện, nó có thể quyết định toàn bộ vấn đề.

• Điểm độc lập — 43,40 cho Claude Haiku 5.5 (Max) so với 33,98 cho Gemini 3.6 Flash (High).

• Chi phí cho mỗi tác vụ đã hoàn thành — $0.21 so với $1.60, trong cùng một lần chạy đánh giá.

A capture of Anthropic's Claude Platform models documentation showing the Claude model comparison table — Claude Fable 5.1, Claude Opus 5.5, Claude Sonnet 5.5 and Claude Haiku 5.5 'This model', the latter reading 1M context, 128K max output, 'From $0.10/$0.50', latency 'Fastest', default effort medium — above the Claude Haiku 5.5 specifications block with model ids claude-haiku-5-5, the pricing lines $0.10/$0.50 up to 100,000 tokens and $0.50/$2.50 over it, and the release line 'Released October 7, 2026'.

Tại sao con số cần dùng là theo mỗi tác vụ, chứ không phải theo mỗi token

Bội số trên bảng giá đã trông như là 7,5 ở đầu vào và 7,5 ở đầu ra, nên con số trên mỗi tác vụ ở đây không có gì đáng ngạc nhiên — nhưng đáng để chỉ ra vì sao hai mô hình lại cùng đạt một mức ở một thước đo và lại cách xa nhau đến vậy ở thước đo kia, bởi vì cùng phép tính đó lại có chiều tác động ngược lại trong các cặp so sánh khác của lô này.

Gemini 3.6 Flash là mô hình ít dài dòng hơn trong hai mô hình. Nó phát ra 41.606 token đầu ra cho mỗi tác vụ Intelligence Index — 20.061 token suy luận và 21.545 token trả lời — so với 162.164 của Claude Haiku 5.5, chia thành 129.047 token suy luận và 33.118 token trả lời. Mô hình của Anthropic tiêu tốn gần gấp bốn lần số token để làm cùng một việc, và đây cũng là mô hình có tốc độ đầu ra chỉ bằng một phần bảy của Google, nên khoảng cách về token và khoảng cách về tốc độ nhân lên với nhau thay vì triệt tiêu nhau.

Sự kết hợp đó — đồng hồ đo giá rẻ nhân với mức sử dụng cao — là cách mô tả trung thực về kinh tế của Claude Haiku 5.5, và bài đăng ra mắt của chính Anthropic cũng thừa nhận mặt còn lại của nó: mô hình này "đặc biệt đáng giá khi được dùng cho các tác vụ có prompt lên tới 100.000 token, vốn chiếm khoảng 90% số yêu cầu gửi đến mô hình Haiku trước đây của chúng tôi." Vượt qua 100.000 token, đồng hồ đo đầu vào trở thành 0,50 USD và đồng hồ đo đầu ra là 2,50 USD, đến lúc đó bội số so với Gemini 3.6 Flash thu hẹp xuống còn khoảng 1,5 lần.

Điều mà gói của chính Google đã làm trong khi bảng so sánh này vẫn đứng yên

Đây là chỗ bài viết không còn là so sánh hai mô hình nữa mà trở thành lời cảnh báo về việc bạn thực sự đang so sánh với Gemini nào.

Google đã giữ giá Flash cố định qua ba thế hệ. Gemini 3.6 Flash, Gemini 3.7 Flash và Gemini 3.8 Flash đều được niêm yết ở mức $0.75 cho đầu vào và $3.75 cho đầu ra trên tài liệu định giá của chính Google, với cùng mức cache $0.075 và cùng mức tăng vào ngày 1 tháng 1 năm 2027 lên $1.50 và $7.50. Thẻ sản phẩm của Google dành cho dòng 3.6 mô tả nó là "mô hình Flash thế hệ trước của chúng tôi", đó là cách nói của chính nhà cung cấp về nó.

Thứ thay đổi là điểm số, không phải giá. Trên bảng đánh giá độc lập, Gemini 3.6 Flash đạt 33.98, Gemini 3.7 Flash đạt 39.06, và Gemini 3.8 Flash đạt 40.93 — tất cả ở cấu hình công bố có cường độ cao nhất của chúng. Chín điểm chỉ số đã xuất hiện trong phân hạng flash của Google trong vòng sáu tuần, mà không có thay đổi nào về mức giá.

Hệ quả đối với bất kỳ ai đang đánh giá dở là rất cụ thể: nếu bạn chạy benchmark cho cuộc đối đầu này cách đây ba tuần với Gemini 3.7 Flash, kết quả của bạn đã lỗi thời; còn nếu bạn chạy benchmark với Gemini 3.8 Flash, khoảng cách tới Claude Haiku 5.5 thu hẹp xuống còn 2,47 điểm. Gemini 3.6 Flash là phiên bản của phép so sánh này có lợi cho Anthropic nhất, và cũng là phiên bản mà Google còn cách việc bán ra xa nhất.

Artificial Analysis đánh dấu mục 3.6 là không còn được khuyến nghị. Tài liệu định giá của Google vẫn công bố mức giá đó, và danh sách mô hình của họ vẫn dẫn đến một mục 3.6, nên cách hiểu trung thực không phải là “đã biến mất” mà là “bị thay thế hai lần trong chính dòng mô hình của nó chỉ trong mười tuần” — và đó là một sự thật về việc hạng này thay đổi nhanh đến mức nào, chứ không phải lý do để bỏ qua so sánh.

Điều này thực sự quyết định cho ai

Có một lý do thực sự chính đáng cho Gemini 3.6 Flash, và đó không phải là điểm số.

Nếu bạn cần âm thanh hoặc video trong prompt, Claude Haiku 5.5 hoàn toàn không làm được — nó chỉ đọc văn bản và hình ảnh, không gì khác. Gemini 3.6 Flash đọc được văn bản, hình ảnh, video, âm thanh và tệp, và danh mục của chính chúng tôi ghi nhận mức đo được là 582 token đầu ra mỗi giây với thời gian trung vị 4,1 giây để có token đầu tiên trong tuần qua, đây là một mô hình nhanh ngay cả theo tiêu chuẩn Flash. Với một pipeline hiểu phương tiện, danh sách phương thức là toàn bộ yếu tố quyết định và khoảng cách chỉ số chỉ là chú thích.

Nếu công việc của bạn là văn bản và hình ảnh, thì phép tính không đủ sít sao để phải tranh cãi. Với tỷ lệ pha trộn thiên về đầu vào 7:2:1 — dạng mà hầu hết lưu lượng production đều có — Claude Haiku 5.5 có giá $0.077 mỗi triệu token, so với $0.63 của Gemini 3.6 Flash. Với hơn một triệu token pha trộn mỗi ngày, đó là 77 xu so với $6.30, và con số thứ hai sẽ tệ hơn vào ngày 1 tháng 1 năm 2027 trong khi con số thứ nhất không hề nhúc nhích.

Ngưỡng 100.000 token là điều kiện duy nhất làm đảo ngược cục diện. Một pipeline truy xuất hoặc xử lý tài liệu dài thường xuyên tổng hợp các prompt 150.000 token sẽ phải trả theo mức $0.50/$2.50 của Anthropic cho toàn bộ yêu cầu, và khi đó hai mô hình chỉ còn chênh nhau trong vòng 1,5 lần về giá, trong khi Gemini 3.6 Flash vẫn thắng về modality và về con số 91.8% mà Google công bố cho multi-needle retrieval ở mức trung bình 128k. Đó là số liệu do nhà cung cấp tự báo cáo và chưa được tái lập, và nó cần được đặt chính xác trong cách định khung đó.

A capture of the OrcaRouter model page for Gemini 3.6 Flash under google/gemini-3.6-flash, showing a 65K maximum output, text, image, video, file and audio input, public benchmarks published by Google dated 2026-07-21, a p50 time to first token of 4.1 seconds, and the page's own description of the model as Google's fast, cost-efficient multimodal model in the Gemini 3 family with a 1M-token context window.

Gọi cả hai, hoặc gọi một

Gemini 3.6 Flash đã có trên danh mục OrcaRouter hôm nay tại google/gemini-3.6-flash, theo giá niêm yết của Google, không đội giá — $0.75 và $3.75 với $0.075 cho mỗi lần đọc bộ nhớ đệm, được phản ánh đúng như nhà cung cấp tính phí. Điều đó quan trọng với mô hình cụ thể này vì đợt tăng ngày 1 tháng 1 của Google là một thay đổi mức giá, và một danh mục chuyển tiếp sẽ áp dụng ngay trong ngày điều đó xảy ra thay vì vào kỳ gia hạn hợp đồng tiếp theo. Một khóa API và một lệnh gọi SDK dùng được cho mô hình này hoặc bất kỳ mô hình nào trong hơn 200 mô hình khác trên danh mục, vì vậy việc A/B giữa một nhánh Google và một nhánh Anthropic chỉ là thay đổi chuỗi mô hình với cơ chế chuyển đổi dự phòng tự động ở bên dưới, chứ không phải một tích hợp thứ hai.

Claude Haiku 5.5 không có trong danh mục. Mô hình của Anthropic có thể truy cập được thông qua API riêng của Anthropic và thông qua AWS, Google Cloud cùng Microsoft Azure, và đó là toàn bộ câu trả lời trung thực. Điều chúng tôi thực sự có từ dòng sản phẩm đó là Claude Sonnet 5.5 và Claude Opus 5.5 — chính điều này khiến đường nâng cấp từ một lệnh gọi phân loại rẻ tiền lên một lệnh gọi agentic tầm trung trở thành một quyết định định tuyến chứ không phải một dự án.

Điều đó khiến phán quyết trở nên đơn giản đến mức có thể nói thẳng ra. Với công việc văn bản và hình ảnh ở độ dài prompt ngắn, Claude Haiku 5.5 thắng trên mọi phương diện trừ mức trần phản hồi. Với bất kỳ thứ gì có âm thanh hoặc video trong đó, Gemini 3.6 Flash là lựa chọn duy nhất trong hai mô hình có thể trả lời được — và nếu bạn định trả mức giá của Google cho khả năng đó, hãy hỏi bạn đang trả tiền cho Gemini nào, vì ở hạng này bạn có thể nhận thêm chín điểm chỉ số với cùng số tiền từ một mô hình anh em mới hơn.

Một API cho hơn 200 mô hình, một khóa duy nhất, tự động chuyển đổi dự phòng ở bên dưới, nên việc A/B giữa một nhánh Google và một nhánh Anthropic chỉ là thay đổi chuỗi mô hình thay vì phải tích hợp thêm lần thứ hai.

So sánh trong bài viết này2

Phát hiện từ bài viết này · Benchmark: Artificial Analysis · cập nhật hằng ngày