Một thẻ hero được tạo tự động có tiêu đề 'Claude Haiku 5.5 so với DeepSeek V4.1 Flash' với dòng nhãn 'HAI MÔ HÌNH, HAI QUAN NIỆM VỀ SỰ RẺ', hiển thị Claude Haiku 5.5 ở mức Đầu vào $0.10, Đầu ra $0.50 và Chỉ số 43.40 so với DeepSeek V4.1 Flash ở mức Đầu vào $0.30, Đầu ra $1.20 và Chỉ số 39.46, phía trên một thanh hiển thị 'Chi phí mỗi tác vụ hoàn thành $0.21 so với $0.27'.
Engineering & Research

Claude Haiku 5.5 so với DeepSeek V4.1 Flash: Giá niêm yết rẻ hơn không có nghĩa là model rẻ hơn

Tác giả

Gideon Frost

Ngày đăng

Mô hình mới nhất · 20Xem tất cả mô hình →
Benchmark: Artificial Analysis · cập nhật hằng ngày
Quay lại tất cả bài viết

Trên bảng giá, chuyện này không hề sát nút. Claude Haiku 5.5, được nhà cung cấp phát hành ngày 7 tháng 10 năm 2026, niêm yết ở mức 0,10 đô la cho mỗi triệu token đầu vào và 0,50 đô la cho mỗi triệu token đầu ra. DeepSeek V4.1 Flash, ra mắt ngày 10 tháng 9 năm 2026, niêm yết ở mức 0,30 đô la và 1,20 đô la trên bảng độc lập, hoặc 0,15 đô la và 0,30 đô la trên bảng giá giờ thấp điểm của chính nhà cung cấp. Nhà cung cấp này rẻ hơn từ hai đến ba lần ở cả hai chỉ số, và đây là lần đầu tiên một mô hình tầm cỡ Haiku xuống dưới mức giá DeepSeek Flash.

Sau đó, bạn đo chi phí thực tế của một tác vụ đã hoàn thành, và khoảng cách thu hẹp lại. Trong cùng một lần chạy đánh giá, một tác vụ Intelligence Index tốn 0,21 USD trên Claude Haiku 5.5 và 0,27 USD trên DeepSeek V4.1 Flash — lợi thế 20%, chứ không phải 200%. Lý do nằm ngay trên cùng trang: Claude Haiku 5.5 tạo ra 162.164 token đầu ra cho mỗi tác vụ, so với 88.574 của DeepSeek. Bạn trả ít hơn cho mỗi token và mua số lượng gần gấp đôi.

Sự đảo ngược đó chính là toàn bộ phép so sánh, và mọi thứ bên dưới là một lập luận về việc khối lượng công việc của bạn rơi vào phía nào của nó.

Cả hai bảng giá, đọc nguyên văn.

Trên mỗi triệu token, tính bằng đô la Mỹ. Số liệu của Anthropic lấy từ tài liệu định giá của chính Anthropic; số liệu của DeepSeek lấy từ trang Model & Pricing của DeepSeek, đây là bảng giá chính thức cho cơ cấu giá giờ cao điểm và thấp điểm của hãng. Các phép đo độc lập là Artificial Analysis Intelligence Index v4.3.2, truy cập ngày 2026-10-08.

A generated two-column scoreboard titled 'Claude Haiku 5.5 vs DeepSeek V4.1 Flash — the scoreboard' with rows Index v4.3.2 43.40 against 39.46, cost per task $0.21 against $0.27, output tokens per task 162,164 against 88,574, Terminal Bench 4.0 0.3283 against 0.2677, AutomationBench 0.3541 against 0.6889 and open weights 'no' against 'yes, MIT', footed 'All figures per Artificial Analysis Intelligence Index v4.3.2; prices per vendor documentation.'

• Đầu vào — Claude Haiku 5.5 $0.10 cho tối đa 100.000 token và $0.50 cho phần vượt trên mức đó. DeepSeek V4.1 Flash $0.30 cố định trên thẻ của bảng, hoặc $0.15 trong các khung giờ thấp điểm của DeepSeek.

• Đầu ra — Claude Haiku 5.5 $0.50 cho tối đa 100.000 token và $2.50 cho phần vượt trên. DeepSeek V4.1 Flash $1.20 cố định, hoặc $0.60 vào giờ thấp điểm.

• Đầu vào được lưu đệm — Claude Haiku 5.5 $0.01 dưới 100.000 token và $0.05 trên, giảm giá 90%. DeepSeek V4.1 Flash $0.006, giảm giá 98%. Đây là thước đo duy nhất mà thẻ DeepSeek rẻ hơn về mặt tuyệt đối, và nó rẻ hơn nhiều so với mọi người mong đợi.

• Định giá theo thời điểm trong ngày — Anthropic không có hình thức này. DeepSeek tăng gấp đôi cả hai mức tính từ 01:00 đến 04:00 và một lần nữa từ 06:00 đến 10:00 UTC vào các ngày trong tuần, trừ các ngày lễ công cộng của Trung Quốc. Mọi khung giờ khác, kể cả toàn bộ cuối tuần, đều là giờ thấp điểm.

• Ngữ cảnh và trần đầu ra — mỗi loại 1 triệu token. Claude Haiku 5.5 giới hạn một phản hồi duy nhất ở 128.000 token; DeepSeek V4.1 Flash giới hạn ở 384.000 token.

• Trọng số — Claude Haiku 5.5 là độc quyền, chỉ có qua API, id mô hình claude-haiku-5-5. DeepSeek V4.1 Flash được mở theo giấy phép MIT, tổng cộng 552B tham số với 16B tham số hoạt động, trên Hugging Face.

• Phương thức — cả hai đều nhận văn bản và hình ảnh rồi trả về văn bản. Cả hai đều không phải là native video.

• Điểm số độc lập — 43,40 cho Claude Haiku 5.5 (Max) so với 39,46 cho DeepSeek V4.1 Flash (Max). Khoảng cách 3,94 điểm trên bảng xếp hạng gồm 182 mô hình.

A capture of Anthropic's Claude Platform models documentation showing the Claude model comparison table — Claude Fable 5.1, Claude Opus 5.5, Claude Sonnet 5.5 and Claude Haiku 5.5 'This model', the latter reading 1M context, 128K max output, 'From $0.10/$0.50', latency 'Fastest', default effort medium — above the Claude Haiku 5.5 specifications block with model ids claude-haiku-5-5, the pricing lines $0.10/$0.50 up to 100,000 tokens and $0.50/$2.50 over it, and the release line 'Released October 7, 2026'.

Vì sao con số tính theo từng tác vụ lại vượt trội hơn con số tính theo từng token

Giá niêm yết được báo theo token vì đó là đơn vị được đo đếm. Chúng không phải là thước đo tốt cho chi phí của một khối lượng công việc, vì một mô hình suy luận quyết định một tác vụ cần bao nhiêu token, và hai mô hình ở đây chênh lệch nhau 1,8 lần.

Claude Haiku 5.5 phát ra 162.164 token đầu ra cho mỗi tác vụ Intelligence Index, chia thành 129.047 token suy luận và 33.118 token trả lời. DeepSeek V4.1 Flash phát ra 88.574, chia thành 62.670 token suy luận và 25.904 token trả lời. Cả hai đều tính phí phần suy nghĩ như output. Vậy nên mô hình có lượng đầu ra thấp hơn 60% lại tiêu tốn gần gấp đôi phần đo đếm đắt đỏ, và phép tính đưa chúng về cách nhau chỉ trong vòng sáu xu.

Có một tác động thứ hai cũng đẩy theo cùng một hướng. Lần chạy chỉ mục bị chi phối bởi cả đầu vào lẫn đầu ra vì harness gửi lại ngữ cảnh: $0.2128 mỗi tác vụ của Claude Haiku 5.5 được phân tách thành $0.1317 đầu vào và $0.0811 đầu ra, và trong phần đầu vào, $0.0954 là đọc cache còn $0.0337 là ghi cache, so với chỉ $0.0026 đầu vào mới. $0.2652 của DeepSeek chia thành $0.1589 đầu vào và $0.1063 đầu ra, với $0.0966 trong phần đầu vào nằm ở ghi cache. Hai mô hình đọc lượng ngữ cảnh được cache gần như tương đương; DeepSeek trả nhiều hơn cho cùng một lượng đọc và ghi.

Bài đăng ra mắt của chính Anthropic cũng mở đầu bằng một lưu ý tương tự, nhưng từ hướng ngược lại. Bài viết nói Haiku 5.5 "đặc biệt đáng giá khi dùng cho các tác vụ có prompt lên tới 100.000 token, vốn chiếm khoảng 90% số yêu cầu gửi đến mô hình Haiku trước đây của chúng tôi." Lời hạn định đó thực sự đóng vai trò quan trọng — hãy xem vực sụt bên dưới.

Bờ vực 100.000 token mới là ngã rẽ thực sự

Anthropic không định giá Claude Haiku 5.5 theo mức cố định. Các mức $0.10 và $0.50 áp dụng cho prompt tối đa 100.000 token, sau đó trở thành $0.50 và $2.50 — bước nhảy gấp năm lần ở đầu vào và gấp năm lần ở đầu ra, được áp dụng cho toàn bộ yêu cầu thay vì phần vượt mức.

Cấu trúc của DeepSeek hoàn toàn khác. Mức giá của nó phụ thuộc vào thời điểm bạn gửi, chứ không phải số lượng. Một prompt 150.000 token có giá trên mỗi token bằng với một prompt 500 token, tăng gấp đôi trong hai khung giờ ngày thường.

Đưa một pipeline prompt dài vào cả hai và phép so sánh đảo ngược hoàn toàn. Ở 150.000 token đầu vào với 20.000 token đầu ra, Claude Haiku 5.5 tính $0,125 cho đầu vào và $0,05 cho đầu ra — $0,175 cho cuộc gọi — trong khi DeepSeek ngoài giờ cao điểm tính $0,0225 và $0,012, tức chưa đến bốn xu. Điều đó có nghĩa là DeepSeek thắng với hệ số khoảng 4,5, trên chính hai mô hình mà trường hợp prompt ngắn đã có Anthropic thắng với hệ số ba.

Xét một cách trừu tượng, không cấu trúc nào tốt hơn. Một cái định giá theo lượng bạn gửi, cái kia theo thời điểm bạn gửi, và chỉ một trong hai biến đó nằm trong tầm kiểm soát của bạn tại thời điểm yêu cầu.

Đòn bẩy khác của DeepSeek mà không ai tính vào giá.

Dòng cache đáng được xem xét riêng, vì nó là thước đo rẻ nhất trong toàn bộ so sánh này và là thứ tăng lên theo sản lượng sản xuất chứ không hề giảm đi.

Giá mỗi triệu token khi cache hit của DeepSeek là $0.006 với mức giảm giá 98% được công bố — khoảng một phần sáu mức $0.01 của Anthropic và chỉ bằng một phần nhỏ so với chi phí đầu vào mới ở cả hai bên. Bất cứ thứ gì gửi lại một tiền tố ổn định — lời nhắc hệ thống dài, một tập tài liệu được truy xuất, một lược đồ công cụ — đều trả mức đó ở mọi lượt sau lượt đầu tiên. Lần chạy chỉ mục ở trên đã cho thấy tỷ trọng đó lớn đến mức nào: $0.0954 trong chi phí đầu vào mỗi tác vụ của Claude Haiku 5.5 là các lượt đọc cache, chỉ từ $0.0026 đầu vào chưa được cache.

Vậy nên sự phân chia thực tế hẹp hơn kiểu “Anthropic rẻ hơn”. Nếu các yêu cầu của bạn ngắn, một lượt và cache còn ấm, thì Claude Haiku 5.5 dẫn đầu về giá, dẫn đầu về năng lực với 3,94 điểm chỉ số, và dẫn đầu ở các hàng tổng hợp dạng tác tử. Nếu yêu cầu của bạn dài, hoặc nặng tiền tố, hoặc có thể lên lịch vào các khung giờ thấp điểm của DeepSeek, thì DeepSeek V4.1 Flash áp đảo về chi phí và khoảng cách không hề nhỏ.

Những gì bạn thực sự có thể gọi hôm nay

Cả hai mô hình đều có thể truy cập được, nhưng không đối xứng với nhau, và sự bất đối xứng đó đáng được nêu rõ ra thay vì để bạn tự phát hiện.

DeepSeek V4.1 Flash hiện đã có trên danh mục của OrcaRouter, được chuyển tiếp đúng theo giá niêm yết của nhà cung cấp với mức chênh lệch 0% — điều này ở đây quan trọng hơn thường lệ, bởi mức giá của DeepSeek có cấu trúc theo giờ cao điểm. Chúng tôi niêm yết $0.15 cho đầu vào và $0.60 cho đầu ra, cùng $0.003 cho mỗi lần đọc cache, và hai khung giờ tăng gấp đôi vào ngày thường được ghi lại trong bản ghi giá, nên một yêu cầu định tuyến qua nhánh DeepSeek được tính đúng như cách DeepSeek tính, chứ không theo mức trung bình gộp. Cơ chế chuyển đổi dự phòng tự động nằm bên dưới tuyến, nên lỗi 429 trong khung giờ cao điểm hay sự cố tạm thời từ nhà cung cấp sẽ chuyển cuộc gọi đi thay vì để nó thất bại.

Claude Haiku 5.5 không có trong danh mục. Mô hình của Anthropic có thể được truy cập trực tiếp qua Anthropic và qua ba đối tác đám mây của hãng — AWS, Google Cloud và Microsoft Azure, những cái tên được nêu trong bài đăng ra mắt — và đó là cách duy nhất trung thực để nói điều đó. Những gì danh mục thực sự có từ dòng Anthropic là Claude Sonnet 5.5 và Claude Opus 5.5, và chính điều đó biến việc nâng cấp từ một lệnh gọi phân loại giá rẻ lên một lệnh gọi agentic tầm trung thành một cấu hình định tuyến thay vì một tích hợp thứ hai.

A capture of the OrcaRouter model page for DeepSeek V4.1 Flash under deepseek/deepseek-v4.1-flash, showing a 1M-token context, a 384K maximum output, text and image input, public benchmarks dated 2026-09-10, a p50 time to first token of 1.74 seconds, and the page's own description of the model as the smallest in DeepSeek's new architecture family, released September 10, 2026.

Chọn cái nào?

Nếu lưu lượng của bạn là phân loại, trích xuất, quyết định định tuyến, tóm tắt và các lượt tác nhân phụ — prompt ngắn, khối lượng lớn, có xen lẫn hình ảnh — thì Claude Haiku 5.5 là mô hình tốt hơn và, dưới 100.000 token, là mô hình rẻ hơn. Nó đạt điểm chỉ số cao hơn 3,94 điểm, có thể nhận hình ảnh, và Anthropic cung cấp một núm điều chỉnh mức nỗ lực để bạn có thể đánh đổi giữa năng lực và chi phí mỗi lần gọi mà không cần đổi mô hình.

Nếu lưu lượng của bạn thuộc dạng tài liệu dài, nặng về truy xuất, hoặc bạn có thể lên lịch cho nó, thì DeepSeek V4.1 Flash thắng về mặt con số: rẻ hơn gấp ba đến bốn lần cho mỗi lượt gọi dài, tỷ lệ cache chỉ bằng một phần sáu của Anthropic, giới hạn phản hồi 384.000 token, và trọng số mở mà bạn có thể nắm giữ nếu mô hình tính theo token không còn phù hợp nữa.

Điều mà sự so sánh này thực sự chốt lại thì hẹp hơn câu “Anthropic hiện là lựa chọn rẻ”. Nó chốt lại rằng một mô hình Anthropic nhỏ có thể thấp hơn mức giá niêm yết của DeepSeek Flash trên nhãn giá, trong khi vẫn nằm trong vòng 20% so với mức đó trên hóa đơn — và rằng khoảng cách giữa hai sự thật ấy là một cài đặt độ dài dòng.

Một API cho hơn 200 mô hình, một khóa, tự động chuyển đổi dự phòng ở bên dưới, nên lỗi 429 trong khung giờ cao điểm hoặc tình trạng suy giảm dịch vụ của nhà cung cấp sẽ chuyển cuộc gọi thay vì làm nó thất bại.

So sánh trong bài viết này1

Phát hiện từ bài viết này · Benchmark: Artificial Analysis · cập nhật hằng ngày