Một thẻ hero được tạo tự động cho 'Chi phí gấp sáu lần cho hai điểm chỉ số', được gắn nhãn 'CHI PHÍ MỖI TÁC VỤ' với dòng kicker 'HAI MÔ HÌNH HẠNG FLASH, MỘT BẢNG XẾP HẠNG' và phụ đề 'Claude Haiku 5.5 đạt 43.40 so với Gemini 3.8 Flash đạt 40.93 trên Intelligence Index v4.3.2.' Bốn chip hiển thị '43.40 so với 40.93', '$0.21 so với $1.24', '$0.10 so với $0.75' và 'tăng vào ngày 1 tháng 1 năm 2027'. Hai thẻ bên dưới được dán nhãn 'LỢI THẾ CỦA ANTHROPIC' ('cao hơn trên bảng xếp hạng chung, và rẻ hơn sáu lần cho mỗi tác vụ hoàn thành') và 'LỢI THẾ CỦA GOOGLE' ('đầu vào giọng nói và video, cùng mức giá cố định trong suốt khoảng thời gian'). Một dòng chân trang ghi 'Các đo lường độc lập từ Artificial Analysis; giá niêm yết được ghi nhận ngày 8 tháng 10 năm 2026.' Logo OrcaRouter được ghép vào góc dưới bên phải.
Guides & Insights

Claude Haiku 5.5 vs Gemini 3.8 Flash: Hai điểm chỉ số, gấp sáu lần chi phí mỗi tác vụ

Tác giả

Alistair Wren

Ngày đăng

Mô hình mới nhất · 20Xem tất cả mô hình →
Benchmark: Artificial Analysis · cập nhật hằng ngày
Quay lại tất cả bài viết

Claude Haiku 5.5 và Gemini 3.8 Flash gần nhau hơn về năng lực đo được so với bất kỳ cặp mô hình nào khác trong cùng khoảng giá này — 43,40 so với 40,93 trên Chỉ số Thông minh Artificial Analysis v4.3.2, cả hai đều nằm trong top năm mươi của một bảng xếp hạng gồm 225 mô hình. Điều phân biệt chúng chính là chi phí cho một điểm chỉ số đó. Trên cùng phép đo độc lập ấy, một tác vụ Chỉ số Thông minh đã hoàn thành tốn 0,21 đô-la với Claude Haiku 5.5 và 1,24 đô-la với Gemini 3.8 Flash.

Đó là khoảng cách gấp sáu lần cho một chênh lệch điểm số hai điểm rưỡi, và đó chính là con số nên quyết định sự so sánh này. Mọi thứ còn lại — mức giá niêm yết, danh sách phương thức, các thời hạn gắn với bảng giá của Google — chỉ là tranh luận về những phần rìa.

Cả hai mô hình, xét trên những con số quan trọng

Mỗi triệu token tính bằng đô la Mỹ, theo tài liệu định giá của chính Anthropic và Google, với các phép đo độc lập được ghi nguồn từ Artificial Analysis. Được lưu trữ ngày 2026-10-08.

A generated scoreboard titled 'Claude Haiku 5.5 vs Gemini 3.8 Flash - on the numbers that matter'. Claude Haiku 5.5 reads input $0.10 under 100K and $0.50 above, output $0.50 and $2.50, cached input $0.01 and $0.05, maximum output 128,000 tokens, input modality text and images, Intelligence Index v4.3.2 43.40, cost per task $0.21. Gemini 3.8 Flash reads input $0.75 now and $1.50 after January 1 2027, output $3.75 and $7.50, cached input $0.075 plus storage, maximum output 65,536 tokens, input modality text images speech and video, Intelligence Index v4.3.2 40.93, cost per task $1.24. A footer reads 'Vendors' published list rates; Google's lower rate runs through December 31, 2026; independent scores from Artificial Analysis.'

• Đầu vào — Claude Haiku 5.5 $0.10 cho tối đa 100.000 token và $0.50 nếu vượt mức đó; Gemini 3.8 Flash $0.75 cố định, tăng lên $1.50 vào ngày 1 tháng 1 năm 2027.

• Đầu ra — Claude Haiku 5.5 $0,50 cho tối đa 100.000 token và $2,50 cho phần vượt trên; Gemini 3.8 Flash $3,75 cố định, tăng lên $7,50 vào cùng ngày.

• Đầu vào được lưu trong bộ nhớ đệm — Claude Haiku 5.5 $0,01 và $0,05; Gemini 3.8 Flash $0,075, cộng thêm phí lưu trữ $0,50 cho mỗi triệu token mỗi giờ.

• Ngữ cảnh — 1M token cho cả hai. Đầu ra tối đa — 128.000 token cho Claude Haiku 5.5 so với 65.536 cho Gemini 3.8 Flash.

• Phương thức đầu vào — văn bản và hình ảnh đối với Claude Haiku 5.5; văn bản, hình ảnh, giọng nói và video đối với Gemini 3.8 Flash. Đây là dòng duy nhất mà danh sách của Google thực sự dài hơn.

• Điểm số độc lập — 43,40 cho Claude Haiku 5.5 (Max) so với 40,93 cho Gemini 3.8 Flash (High), trên Intelligence Index v4.3.2.

• Chi phí độc lập cho mỗi tác vụ — 0,21 USD so với 1,24 USD trên cùng một bo mạch.

• Tốc độ — 241,9 token đầu ra mỗi giây so với 125,2, cả hai đều được đo bởi Artificial Analysis.

Con số gấp sáu lần đó đến từ đâu

Khoảng cách chi phí trên mỗi tác vụ lớn hơn khoảng cách giá niêm yết, và đó mới là phần thú vị, vì điều đó có nghĩa là chỉ riêng bảng giá không giải thích được nó.

Phép tính trên giá niêm yết đơn giản thôi: 0,10 USD so với 0,75 USD ở đầu vào là rẻ hơn bảy lần rưỡi, và 0,50 USD so với 3,75 USD ở đầu ra cũng có cùng tỷ lệ đó. Nếu cả hai mô hình tạo ra cùng số token cho cùng một công việc, thì tỷ lệ đó sẽ đi thẳng vào hóa đơn.

Điều đó không được duy trì, và cả hai hiệu ứng đều có lợi cho Google. Claude Haiku 5.5 dài dòng theo cách mà chính nhà cung cấp của nó thừa nhận: Artificial Analysis ghi nhận 440 triệu token đầu ra khi chạy Index, so với mức trung vị 100 triệu, và gọi mô hình này là rất dài dòng. Gemini 3.8 Flash tạo ra 170 triệu so với mức trung vị 81 triệu — cũng bị đánh dấu là dài dòng, nhưng chỉ bằng một phần ba lượng token. Tài liệu của chính Anthropic bổ sung hiệu ứng thứ hai: Claude Haiku 5.5 dùng tokenizer mới hơn, được chia sẻ với Claude 4.7 và các phiên bản sau, nên cùng một đoạn văn bản được tính thành nhiều hơn khoảng 30% token so với mô hình mà nó thay thế.

Ghép lại, phiên bản trung thực của tuyên bố về giá là thế này: lợi thế về mức giá đầu vào gấp mười lần và lợi thế về mức giá đầu ra gấp bảy lần rưỡi, bị tiêu hao một phần bởi một mô hình viết nhiều token hơn cho mỗi câu trả lời, dẫn đến lợi thế gấp sáu lần trong phép đo tính phí cho toàn bộ công việc. Vẫn là một sự áp đảo, và nhỏ hơn so với mức mà bảng giá gợi ý.

Giá của Google có kèm một ngày

Điều hữu ích nhất trên trang định giá của Google là một câu mà hầu hết các bảng so sánh đều bỏ qua.

Gemini 3.8 Flash được niêm yết ở mức $0,75 cho đầu vào và $3,75 cho đầu ra “đến hết ngày 31 tháng 12 năm 2026,” và ở mức $1,50 và $7,50 “bắt đầu từ ngày 1 tháng 1 năm 2027.” Giá đầu vào được lưu trong bộ nhớ đệm tăng từ $0,075 lên $0,15 vào cùng ngày. Đó là mức giá giới thiệu có ngày hết hạn được ghi ngay bên cạnh, cách thời điểm viết bài này khoảng mười một tuần.

Không có gì trong bảng giá của Anthropic được ghi theo cách đó. Mức giá của Claude Haiku 5.5 được nêu rõ là mức giá, với cấu trúc hai bậc dựa trên độ dài prompt thay vì dựa trên lịch, và cam kết ngừng cung cấp không sớm hơn ngày 7 tháng 10 năm 2027. Nếu bạn đang mô hình hóa một pipeline chạy sang năm sau, bước tháng Một của Google là một sự tăng gấp đôi và nó cần đưa vào mô hình; còn Anthropic thì không có sự kiện tương đương nào để lên kế hoạch.

Điều đó đúng theo cả hai chiều, và cách diễn giải công bằng không phải là “một nhà cung cấp trung thực còn nhà kia thì không”. Một mức giá khuyến mại vẫn là mức giá thật chừng nào nó còn hiệu lực, và Google có quyền định giá một đợt ra mắt theo cách đó. Đơn giản đó chỉ là một sự thật về phép so sánh rằng phía trông rẻ hơn trong các con số tháng Một lại chính là phía có thời hạn.

A screenshot of Anthropic's model documentation showing the Claude Haiku 5.5 specifications row and the published pricing table beneath it, with the per-million-token input, output and cache rates and the prompt-length threshold at which the second tier begins.

Hai điểm của chỉ số nào thì đáng giá?

Khoảng cách 2,47 điểm trên một chỉ số có thang điểm lên tới hàng sáu mươi không phải là sai số làm tròn, và cũng không phải là một vực thẳm. Cả hai mô hình đều nằm trong cùng một dải hoạt động, và câu hỏi thực tiễn là liệu khoảng cách đó có xuất hiện trên những tác vụ bạn thực sự chạy hay không.

Dựa trên số liệu của chính các nhà cung cấp, hai bên không được đo trên cùng một harness, nên không thể đối chiếu trực tiếp — Ant​hropic công bố kết quả GDPval-AA v2.1, OS 2.1, Terminal-Bench 4.0 và FrontierCode cho Claude Haiku 5.5, còn Google công bố bộ kết quả riêng cho Gemini 3.8 Flash, và không nhà cung cấp nào chạy bộ đánh giá của bên kia. Phép so sánh cùng tiêu chuẩn duy nhất có được là bảng xếp hạng độc lập, và ở đó câu trả lời là Ant​hropic dẫn trước với một khoảng cách tuy nhỏ.

Khác biệt về năng lực mà sẽ quan trọng hơn đối với một số đội nhóm nằm ở khía cạnh phương thức. Gemini 3.8 Flash chấp nhận đầu vào là giọng nói và video; Claude Haiku 5.5 chấp nhận văn bản và hình ảnh. Một pipeline tiếp nhận bản ghi cuộc gọi hoặc bản ghi màn hình ở dạng gốc thì hoàn toàn không phải đang lựa chọn giữa hai mô hình này dựa trên giá — một trong hai không thể làm được công việc nếu không có bước phiên âm hoặc trích xuất khung hình ở phía trước, và bước đó có chi phí riêng cùng những kiểu lỗi riêng.

Vận hành bên rẻ hơn của cặp

Gemini 3.8 Flash có trong danh mục của OrcaRouter ở đúng giá niêm yết của Google với 0% markup, điều này ở đây quan trọng hơn mức thông thường: mức giá của nhà cung cấp được chuyển nguyên vẹn thay vì pha trộn, nên nếu bạn muốn thấy mức tăng vào tháng Một thực sự tác động thế nào đến hóa đơn, con số sẽ thay đổi khi Google thay đổi. Claude Sonnet 5.5 và Claude Opus 5.5 cũng có trong danh mục, khiến một bài kiểm thử định tuyến ba nhánh — nhánh Flash của Google, một hạng trung của Anthropic, và một hạng nhỏ của Anthropic sau này — trở thành một cấu hình thay vì một dự án. Một khóa, một SDK, tự động chuyển đổi dự phòng bên dưới, và DSL định tuyến nếu bạn muốn thể hiện việc leo thang ngay trong tuyến thay vì trong mã ứng dụng.

Claude Haiku 5.5 hiện chưa có trên danh mục, và nói rõ điều đó tốt hơn là để mập mờ. Nhánh Ant​hropic trong so sánh này hiện chỉ có thể truy cập tại Ant​hropic, trong khi nhánh Google có thể được gọi từ chúng tôi ngay hôm nay với mức giá hiển thị ở trên.

A screenshot of the OrcaRouter catalogue page for Gemini 3.8 Flash, showing the model identifier in provider-slash-model form, the provider Google, the model description and a stat strip carrying the per-million-token input and output rates alongside the context window and maximum output.

Cái nào, và cho ai?

Nếu công việc của bạn là văn bản vào và văn bản ra, các prompt của bạn nằm dưới 100.000 token, và bạn đang trả tiền theo token cho khối lượng thực tế, thì Claude Haiku 5.5 là mô hình rẻ hơn theo mọi thước đo trong bài này và là mô hình đạt điểm cao hơn trên bảng chung duy nhất — với lưu ý rằng lợi thế là gấp sáu lần về chi phí cho mỗi tác vụ, chứ không phải gấp mười lần như mức giá niêm yết ngụ ý.

Nếu bạn cần đầu vào là âm thanh hoặc video, hoặc bạn cần phản hồi từ 65K trở lên, hoặc các prompt của bạn thường xuyên dài, thì cách tính sẽ thay đổi: Gemini 3.8 Flash nhận được những đầu vào mà gói nhỏ của Anthropic không thể, và khi vượt quá 100.000 token, gói thứ hai của chính Anthropic có giá cao hơn hẳn mức giá cố định của Google.

Điều duy nhất cần bám lấy là các mốc thời gian. Mức giá của Google có hiệu lực đến hết năm nay và tăng gấp đôi sau đó. Mức của Anthropic được công bố cố định kèm một bậc theo độ dài. Dù bạn chọn bên nào trong số đó, hãy đưa lịch vào bảng tính trước khi xây dựng pipeline.