Một thẻ hero được tạo cho 'Rẻ hơn theo token, đắt hơn theo câu trả lời', được gắn nhãn 'CHI PHÍ TRÊN MỖI CÂU TRẢ LỜI' với dòng nhấn 'HAI HẠNG RẺ, MỘT BẢNG CHUNG' và phụ đề 'Claude Haiku 5.5 đạt 43.40 so với Gemini 3.5 Flash-Lite đạt 22.2 trên Intelligence Index v4.3.2.' Bốn chip ghi '43.40 so với 22.2', '$0.21 so với $0.12', '$0.10 so với $0.30' và '$0.50 so với $2.50'. Hai thẻ bên dưới được dán nhãn 'LỢI THẾ CỦA ANTHROPIC' ('cao hơn hai mươi mốt điểm trên bảng chung, và rẻ hơn trên cả hai thước đo') và 'LỢI THẾ CỦA GOOGLE' ('rẻ hơn cho một tác vụ hoàn chỉnh, và nó nhận cả video lẫn âm thanh'). Phần chân trang ghi 'Điểm số độc lập và chi phí trên mỗi tác vụ từ Artificial Analysis; giá niêm yết đọc ngày 8 tháng 10 năm 2026.' Logo OrcaRouter được ghép ở góc dưới cùng bên phải.
Guides & Insights

Claude Haiku 5.5 so với Gemini 3.5 Flash-Lite: Rẻ hơn trên mỗi token, đắt hơn trên mỗi câu trả lời

Tác giả

Gideon Frost

Ngày đăng

Mô hình mới nhất · 20Xem tất cả mô hình →
Benchmark: Artificial Analysis · cập nhật hằng ngày
Quay lại tất cả bài viết

Claude Haiku 5.5 có giá 0,10 USD cho mỗi triệu token đầu vào và 0,50 USD cho mỗi triệu token đầu ra. Gemini 3.5 Flash-Lite có giá 0,30 USD và 2,50 USD cho cùng hai chỉ số đó. Mô hình của Anthropic có giá bằng một phần ba khi tính đầu vào và một phần năm khi tính đầu ra, đồng thời đạt 43,40 điểm so với 22,2 điểm trên Artificial Analysis Intelligence Index v4.3.2 — một khoảng cách hơn hai mươi điểm trong một lĩnh vực mà mười điểm đã là một bước nhảy vọt giữa các thế hệ. Trên bảng giá, đây không phải là một so sánh sít sao, và về năng lực, cũng không phải là một so sánh sít sao.

Trên hóa đơn, đây là một so sánh sát nút, và kết quả lại đi theo hướng ngược lại. Đặt cả hai mô hình lên cùng một bảng đo độc lập và tính phí cho mỗi mô hình theo một tác vụ đã hoàn thành thay vì theo token, thì Gemini 3.5 Flash-Lite hóa ra lạirẻ hơn trên mỗi câu trả lời. Artificial Analysis xác định Claude Haiku 5.5 ở mức 0,21 USD cho mỗi tác vụ Chỉ số Trí tuệ và Gemini 3.5 Flash-Lite ở mức 0,1235 USD — lợi thế 1,7 lần thuộc về mô hình phải trả gấp năm lần cho mỗi token mà nó phát ra.

Sự đảo ngược đó chính là toàn bộ nội dung của so sánh này. Claude Haiku 5.5 thay thế hạng rẻ nhất mà Anthropic từng phát hành và đánh bại mọi thứ gần nó trên bảng xếp hạng chung. Gemini 3.5 Flash-Lite được phát hành vào ngày 21 tháng 7 năm 2026 và đã là lựa chọn đáng giá trong phân khúc này kể từ mùa hè. Câu hỏi mà người mua thực sự có không phải là cái nào tốt hơn, bởi vì câu trả lời cho điều đó đã ngã ngũ. Mà là nên dùng cái nào cho một yêu cầu phải trả về với chi phí thấp.

Tất cả nội dung dưới đây được tính trên mỗi triệu token bằng đô la Mỹ. Giá niêm yết là mức giá do chính các nhà cung cấp công bố. Các điểm số độc lập, số liệu chi phí trên mỗi tác vụ và phép đo tốc độ được gán cho Artificial Analysis là của chính đơn vị đánh giá đó. Các số liệu độ trễ của Gemini 3.5 Flash-Lite đến từ lưu lượng đo đếm của chúng tôi. Khi một con số được lưu trên hồ sơ mô hình mà chúng tôi nắm giữ thay vì được đọc từ trang của đơn vị đánh giá vào ngày hôm đó, chúng tôi coi đơn vị đánh giá đó là nguồn và không phải chính chúng tôi.

Tem và hóa đơn không khớp nhau

Khoảng cách chi phí trên mỗi tác vụ không được bảng giá giải thích, và lý do nó tồn tại là điều đáng để biết trước khi một trong hai mô hình tiến gần đến môi trường sản xuất.

Claude Haiku 5.5 dài dòng, và người đánh giá cũng nói đúng như vậy. Khi chạy Intelligence Index, Artificial Analysis ghi nhận mô hình tạo ra 440 triệu token đầu ra, so với mức trung vị 100 triệu trên toàn bộ, và gắn cờ nó là rất dài dòng. Thinking được tính phí như đầu ra, Thinking mặc định được bật với thang điều chỉnh nỗ lực khởi đầu ở mức trung bình, và mức giá đầu vào rẻ không giúp gì cho một khối lượng công việc mà hóa đơn chủ yếu là đầu ra.

Gemini 3.5 Flash-Lite cũng không súc tích, nhưng nó rẻ hơn một cách có thể đo được trên mỗi tác vụ. Cùng bảng đó ghi nhận 17.507 token đầu ra cho mỗi tác vụ lập chỉ mục đã hoàn thành đối với nó — 10.405 trong số đó là suy luận và 7.102 là câu trả lời. Đặt con số đó bên cạnh khối lượng token của mô hình Ant​hropic và phép tính sẽ sáng tỏ: lợi thế năm trên một về đơn giá đầu ra bị tiêu hao một phần bởi một mô hình phát ra phản hồi lớn hơn, và thứ còn trụ lại ở cấp tác vụ là một bất lợi nhỏ chứ không phải một lợi thế lớn.

Có một hiệu ứng thứ hai, âm thầm hơn, cũng diễn ra theo cùng một hướng. Tài liệu của Ant​hropic cho biết Claude Haiku 5.5 sử dụng tokenizer dùng chung với Claude 4.7 và các phiên bản sau, vì vậy cùng một đoạn văn bản sẽ được tính thành khoảng 30% token nhiều hơn so với trên mô hình mà bản này thay thế. Mức giá đã giảm ba lần so với bậc của Goo​gle. Số lượng token không hề giảm, mà với cùng đoạn văn bản đó, nó còn tăng.

Cả hai mô hình, xét trên những con số quan trọng

Giá đã lưu cache và giá niêm yết từ tài liệu của chính Anthropic và Google; các số liệu độc lập được ghi nguồn cho Artificial Analysis; độ trễ trực tiếp từ cửa sổ lưu lượng bảy ngày của chúng tôi. Đã lưu cache 2026-10-08.

A generated scoreboard titled 'Claude Haiku 5.5 vs Gemini 3.5 Flash-Lite - on the numbers that matter'. Claude Haiku 5.5 reads input $0.10 under 100K and $0.50 above, output $0.50 and $2.50, cached input $0.01 and $0.05, maximum output 128,000 tokens, input modality text and images, Intelligence Index v4.3.2 43.40, cost per task $0.21. Gemini 3.5 Flash-Lite reads input $0.30, output $2.50, cached input $0.03, maximum output 65,536 tokens, input modality text images video audio and files, Intelligence Index v4.3.2 22.2, cost per task $0.12. A footer reads 'Vendors' published list rates; independent scores and cost per task from Artificial Analysis.'

• Đầu vào — Claude Haiku 5.5 $0,10 lên đến 100.000 token và $0,50 trở lên; Gemini 3.5 Flash-Lite $0,30 cố định trong cửa sổ 1.048.576 token.

• Đầu ra — Claude Haiku 5.5 $0.50 cho tối đa 100.000 token và $2.50 cho phần vượt; Gemini 3.5 Flash-Lite $2.50 đồng giá.

• Đầu vào được lưu trong bộ nhớ đệm — Claude Haiku 5.5 $0,01 cho tối đa 100.000 token và $0,05 cho phần vượt trên; Gemini 3.5 Flash-Lite $0,03. Ghi bộ nhớ đệm có giá $0,125 và $0,625 mỗi triệu token đối với Claude Haiku 5.5.

• Ngữ cảnh và đầu ra — một triệu token cho mỗi loại. Đầu ra tối đa là 128.000 token đối với Claude Haiku 5.5 so với 65.536 token đối với Gemini 3.5 Flash-Lite, vì vậy mức trần của Ant​hropic gần như gấp đôi.

• Phương thức đầu vào — văn bản và hình ảnh đối với Claude Haiku 5.5; văn bản, hình ảnh, video, âm thanh và tệp đối với Gemini 3.5 Flash-Lite. Cả hai đều trả về văn bản.

• Điểm số độc lập — 43,40 cho Claude Haiku 5.5 (Max), đứng thứ hai trong số 182 mô hình trên Intelligence Index v4.3.2, so với 22,2 của Gemini 3.5 Flash-Lite, đứng thứ chín mươi sáu trong số 147 và thuộc phân vị thứ ba mươi tư của bảng xếp hạng đó.

• Chi phí độc lập cho mỗi tác vụ — $0.21 so với $0.1235 trên cùng một bo mạch.

• Thông lượng — 241,9 token đầu ra mỗi giây được Artificial Analysis đo cho Claude Haiku 5.5, so với 280,0 của Gemini 3.5 Flash-Lite đo trên playground của chính chúng tôi trong bảy ngày qua. Đó là hai harness khác nhau, chứ không phải một, nên hãy đọc chúng như một bậc độ lớn chứ đừng đọc như một cuộc đua.

Hai mươi mốt điểm, và chúng được làm từ gì

Khoảng cách hai mươi mốt điểm trên một chỉ số nằm trong khoảng sáu mươi không phải là một biên độ. Đó là sự khác biệt giữa một mô hình có thể đảm nhận một vòng lặp agentic và một mô hình nên được giao một lệnh gọi duy nhất được đặc tả rõ ràng.

Hai nhà cung cấp không đo khung đánh giá của nhau, nên không thể đối chiếu trực tiếp các bộ kiểm thử của riêng họ. Anthropic công bố kết quả GDPval-AA v2.1, OSWorld 2.1, Terminal-Bench 4.0 và FrontierCode cho Claude Haiku 5.5; Google công bố bộ kết quả riêng cho phân khúc Flash-Lite; không bên nào chạy bộ của bên kia. Phép so sánh cùng hệ quy chiếu duy nhất hiện có là bảng xếp hạng độc lập, và ở đó mô hình của Anthropic dẫn trước với khoảng cách không hề nhỏ.

Các điểm phụ mà người đánh giá dành cho Gemini 3.5 Flash-Lite đã ghi nhận rõ hình dạng của hạng đó. Nó đạt 83.8% trên GPQA Diamond và 54.2% trên SWE-Bench Pro, 54% trên Terminal-bench 2.1, 41.3% trên SciCode và 39.2% trên MLE-Bench, cùng với 18.8% trên Humanity's Last Exam. Đó là những con số của một hạng đa dụng, rẻ, có năng lực — mạnh ở các câu hỏi kiến thức, nhưng tụt lại thấy rõ ở những đánh giá lý luận và nghiên cứu khó nhất. Claude Haiku 5.5 với 43.40 trên điểm tổng hợp nằm ở một dải hoàn toàn khác, và cách hiểu thực tế là công việc cần lập kế hoạch nhiều bước trong một chân trời dài không phải là việc dành cho hạng Goo​gle chút nào.

Một triệu token cửa sổ, và 65.536 token câu trả lời

Hai cửa sổ ngữ cảnh có cùng kích thước và chúng không phải là cùng một sản phẩm.

Ngữ cảnh dài trên Gemini 3.5 Flash-Lite suy giảm theo khoảng cách theo cách đáng để định giá trước khi được tin dùng. Trên GDM-MRCR v2, đánh giá truy hồi tám needle, nó đạt trung bình 72,2% khi các needle nằm trong 128.000 token và 21,3% trên biến thể pointwise một triệu token. Chỉ số Long-Context Recall của nó là 76%, và CharXiv Reasoning đạt 74,5% khi không dùng công cụ và 76,5% khi dùng công cụ. Cửa sổ một triệu token là một năng lực thực sự; truy hồi đáng tin cậy từ đầu xa của nó là một năng lực nhỏ hơn, và hai con số ở trên chính là khoảng cách giữa chúng. Cửa sổ của mô hình Claude chưa được đo theo cùng cách trên cùng bảng, nên không có con số tương đương nào dành cho nó, và bài viết này sẽ không tự bịa ra một con số.

Các giới hạn đầu ra là khác biệt hữu ích tức thì hơn. Claude Haiku 5.5 sẽ phát ra 128.000 token trong một phản hồi; Gemini 3.5 Flash-Lite dừng ở 65.536. Nếu thứ bạn muốn nhận lại là một tệp dài, một bản di trú đầy đủ, một bộ kiểm thử được tạo hay một bản viết lại quy mô bản ghi, một trong hai mô hình này có thể tạo ra nó chỉ trong một lần gọi còn mô hình kia thì không — và một tác vụ bị chia thành hai lần gọi sẽ tốn hơn gấp đôi một lần gọi, vì tiền tố chung bị gửi hai lần.

A screenshot of the Artificial Analysis model page for Gemini 3.5 Flash-Lite, showing the model name over the provider Google, the release month July 2026, a one-million-token context window, the input modality list covering text, image, video, audio and PDF, an Intelligence Index v4.3.2 score of 22, the per-million-token input and output rates with the cached-input discount, and the measured output speed, total response time and cost per task.

Âm thanh và video không phải là vấn đề về giá

Gemini 3.5 Flash-Lite chấp nhận video, âm thanh và tệp với cùng mức giá như văn bản. Claude Haiku 5.5 chấp nhận văn bản và hình ảnh.

Đối với một pipeline tiếp nhận các cuộc gọi đã ghi âm, bản ghi màn hình hoặc cảnh quay giám sát, sự khác biệt về năng lực quan trọng không nằm ở hai mươi mốt điểm chỉ số. Mà nằm ở việc một trong các mô hình này nhận đầu vào trực tiếp, còn mô hình kia cần một bước phiên âm hoặc trích xuất khung hình ở phía trước — một mô hình thứ hai, một hóa đơn thứ hai, và một dạng lỗi mới nằm giữa nguồn và câu trả lời. Các đội ngũ ở vị trí đó không phải đang lựa chọn giữa hai bậc giá rẻ. Họ đang lựa chọn giữa một mô hình và một pipeline.

Điều ngược lại đúng với hình ảnh và tài liệu. Cả hai mô hình đều đọc hình ảnh native, và Claude Haiku 5.5 đạt 43.40 trên điểm tổng hợp, nên một tác vụ trích xuất hình ảnh trang hoặc hiểu sơ đồ không có âm thanh trong đó thuộc về phía Ant​hropic dựa trên các con số thay vì dựa trên một lập luận về phương thức.

Chạy một trong hai từ đây

Gemini 3.5 Flash-Lite có trong danh mục OrcaRouter với giá niêm yết của Google và mức chênh lệch 0%, nghĩa là mức giá của nhà cung cấp được chuyển thẳng thay vì được trộn, và khi bảng giá của Goo​gle thay đổi thì hóa đơn của bạn cũng nhận được thay đổi đó ngay trong ngày họ nhận được. Đó là một khóa và một SDK cho tầng của Goo​gle cùng với Claude Sonnet 5.5 và Claude Opus 5.5, cũng có trong danh mục — vì vậy việc A/B giữa một nhánh Goo​gle Flash-Lite và một nhánh Ant​hropic đã là một cấu hình chứ không phải một dự án tích hợp. Chuyển đổi dự phòng tự động nằm ở bên dưới, nên không nhánh nào là điểm lỗi duy nhất, và DSL định tuyến sẽ thể hiện việc leo thang trong tuyến nếu đó là nơi logic thuộc về.

Hồ sơ độ trễ của chặng đó dựa trên đo lường của chính chúng tôi chứ không phải của nhà cung cấp. Trong bảy ngày gần nhất với lưu lượng trực tiếp, Gemini 3.5 Flash-Lite duy trì p50 ở 2.426 mili giây và p95 ở 8.600 mili giây tại 280 token đầu ra mỗi giây, với tỷ lệ lỗi 0,313%. Hãy coi đó là một cửa sổ trượt chứ không phải một lời hứa: nó thay đổi khi lưu lượng và điều kiện của nhà cung cấp thay đổi, và con số đáng tin cho một pipeline nhất định là con số bạn tự đo sau một tuần.

A screenshot of the Artificial Analysis model page for Claude Haiku 5.5 (Max), showing the Anthropic model name and an October 2026 release, Intelligence Index v4.3.2 of 43 ranking second of 182, speed ninth of 182 at 241.9 output tokens per second, a $0.21 cost per task, input $0.10 and output $0.50 per million tokens, and a one-million-token context window.

Claude Haiku 5.5 không có trong danh mục. Nó ra mắt ngày 7 tháng 10 năm 2026 — một ngày trước khi bài này được viết — và hiện nay nó không thể định tuyến qua chúng tôi, nên phía Ant​hropic trong so sánh này hiện chỉ có thể tiếp cận được tại Ant​hropic. Nói thẳng như vậy tốt hơn là để người đọc tự suy ra. Khoảng cách giữa việc một mô hình ra mắt và việc một mô hình có thể được gọi qua chúng tôi là chuyện bình thường, đó không phải là lời hứa về thời điểm khoảng cách ấy được khép lại, và một người đọc đang lên kế hoạch chuyển đổi nên lên kế hoạch dựa trên lịch họ có thể thấy chứ không phải lịch họ mong muốn.

Cái nào, và cho ai?

Nếu công việc là văn bản vào và văn bản ra, nếu các prompt nằm dưới 100.000 token, và nếu tác vụ cần lập kế hoạch nhiều bước hoặc các agent tầm xa, thì Claude Haiku 5.5 là mô hình mạnh hơn hai mươi mốt điểm và rẻ hơn trên mỗi token với hệ số từ ba đến năm lần. Hãy lập ngân sách dựa trên chi phí mỗi tác vụ thay vì dựa trên bảng giá, dự kiến khoảng $0,21 cho loại công việc mà hội đồng độc lập đo lường, và đếm lại prompt của bạn trước khi dự báo bất cứ điều gì, vì thay đổi tokenizer tự nó làm dịch chuyển số lượng khoảng ba mươi phần trăm.

Nếu công việc ngắn, khối lượng lớn và có dạng câu trả lời — một thẻ, một danh mục, một trích xuất, một quyết định về rào chắn — thì phép tính nghiêng về Gemini 3.5 Flash-Lite, và nghiêng về đó vì một lý do không hào nhoáng. Hóa đơn cho một lệnh gọi xuất ra rất ít bị chi phối bởi đầu vào, hai mức giá đầu vào là 0,30 đô-la so với 0,10 đô-la, và dấu chân tác vụ ngắn hơn nhiều của mô hình Google khiến mức giá rẻ hơn thắng ở công việc hoàn thành dù nó thua ở giá niêm yết. Thêm đầu vào video, âm thanh hoặc tệp thì lựa chọn không còn là về giá nữa.

Điều mà sự ghép cặp này thực sự xác lập thì hẹp hơn so với “Haiku mới là rẻ”. Nó xác lập rằng mức giá nổi bật trên một hạng rẻ không phải là chỉ dẫn tốt cho việc hạng đó tốn của bạn bao nhiêu, và rằng mô hình trông đắt gấp ba lần trên trang định giá có thể gửi cho bạn hóa đơn nhỏ hơn. Dù bạn chọn hướng nào, hãy đo lượng token bạn phát ra chứ không phải lượng token bạn gửi đi, vì trên cả hai mô hình này, đó mới là đồng hồ đo mà hóa đơn thực sự được tính theo.