
Claude Haiku 5.5 vs Claude Haiku 4.5: Việc giảm giá 90% không đồng nghĩa với tiết kiệm 90%
- openaiMỚIOpenAI: GPT-6.1 Sol2026-09-2952Trí tuệ
- anthropicMỚIAnthropic: Claude Sonnet 5.52026-09-2856Trí tuệ
- typesafeMỚITypeSafe: Jev 1.132026-09-24$0.04 / $0.00 trên 1 triệu token · 128 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238Trí tuệ
- OpenAIOpenAI: GPT-6 Sol2026-09-2248Trí tuệ
- AnthropicAnthropic: Claude Opus 5.52026-09-2258Trí tuệ
- xAIGrok 4.72026-09-2146Trí tuệ
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 trên 1 triệu token · 67 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 trên 1 triệu token · 320 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Trí tuệ
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Trí tuệ77Lập trình
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Trí tuệ76Lập trình
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Trí tuệ76Lập trình
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Trí tuệ82Lập trình
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 trên 1 triệu token · 54 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 trên 1 triệu token · 360 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Trí tuệ72Lập trình
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 trên 1 triệu token · 232 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Trí tuệ75Lập trình
- obsidianQwen3.8 27B2026-08-1534Trí tuệ68Lập trình
Claude Haiku 5.5 có giá 0,10 USD cho mỗi triệu token đầu vào và 0,50 USD cho mỗi triệu token đầu ra đối với prompt lên tới 100.000 token. Claude Haiku 4.5 có giá 1 USD và 5 USD, cố định, cho toàn bộ cửa sổ 200.000 token mà nó vốn luôn có. Anthropic nói mức chênh lệch là "thấp hơn 90%" trong một chú thích và "chi phí vận hành ít hơn khoảng 75%" trong câu ngay phía trên — và khoảng cách mười một tháng giữa hai mô hình đúng bằng khoảng cách giữa hai con số đó.
Đó không phải là một chiêu trò tiếp thị. Đó là thực tế trung thực của một thế hệ mô hình đã thay đổi tokenizer, mặc định suy nghĩ và cửa sổ ngữ cảnh cùng lúc với mức giá của nó, và điều đó có nghĩa là bất kỳ ai chỉ đổi model id rồi mong hóa đơn giảm đi mười lần sẽ thất vọng vì phép tính chứ không phải vì sản phẩm.
Cả hai mẫu, như khi xuất xưởng
Mọi thông tin dưới đây được tính trên mỗi triệu token, bằng đô la Mỹ, và được lấy từ tài liệu định giá và mô hình của chính Anthropic vào ngày 2026-10-08, trừ khi có ghi chú khác.

• Đầu vào — Claude Haiku 5.5: $0,10 cho tối đa 100.000 token, $0,50 nếu vượt quá; Claude Haiku 4.5: $1,00 bất kể độ dài.
• Đầu ra — Claude Haiku 5.5 $0,50 cho tối đa 100.000 token, $2,50 cho phần vượt trên; Claude Haiku 4.5 $5,00 bất kể độ dài.
• Đọc cache — Claude Haiku 5.5 $0,01 cho tối đa 100.000 token và $0,05 cho phần vượt trên; Claude Haiku 4.5 $0,10. Ghi cache — $0,125 và $0,625 so với $1,25.
• Ngữ cảnh — 1M token so với 200.000. Đầu ra tối đa — 128.000 token so với 64.000.
• Thinking — Claude Haiku 5.5 có tính thích ứng và được bật theo mặc định với một núm điều chỉnh effort mặc định ở mức medium; Claude Haiku 4.5 dùng dạng thủ công cũ hơn và hoàn toàn không có tham số effort.
• Điểm số độc lập — Artificial Analysis Intelligence Index v4.3.2 xếp Claude Haiku 4.5 ở mức 43,40, đứng thứ hai trong số 182 mô hình, và Claude 4.5 Haiku ở mức 16,88, đứng thứ ba mươi trong số 61 — với bên đánh giá ghi chú rằng 4.5 là ước tính.
• Tốc độ — cùng một nguồn đo được 242 token đầu ra mỗi giây đối với Claude Haiku 5.5, so với 89.7 ở thế hệ 4.5, và đây là điểm duy nhất mà mô hình cũ vẫn còn tỏ ra thoải mái.
Nơi câu chuyện giá bằng một phần mười sụp đổ
Ba điều ăn mòn khoản cắt giảm, và chỉ điều đầu tiên trong số đó là lời cảnh báo của chính Anthropic.
Tokenizer mới là vấn đề lớn. Claude Haiku 5.5 sử dụng tokenizer mới hơn được giới thiệu cùng Claude 4.7, và tài liệu của Anthropic cho biết cùng một đoạn văn bản "được tính là khoảng 30% nhiều token hơn so với trên Claude Haiku 4.5." Bạn không phải trả một phần mười mức giá cho cùng số lượng token; bạn đang trả một phần mười mức giá cho khoảng 1,3 lần số token. Hướng dẫn chuyển đổi của chính nhà cung cấp đưa điều này thành mục thứ hai trong danh sách kiểm tra, trước mọi thay đổi mã: đếm lại prompt của bạn, sau đó xem lại max_tokens và ước tính chi phí của bạn.
Token suy nghĩ được tính như token đầu ra, và Claude Haiku 5.5 mặc định suy nghĩ. Trang ra mắt của Anthropic nói rõ rằng mô hình này "rất dài dòng" ngay trên các biểu đồ, và phép đo độc lập còn củng cố điều đó rõ nét hơn cả nhà cung cấp: khi đánh giá Intelligence Index, Artificial Analysis ghi nhận 440 triệu token đầu ra từ Claude Haiku 5.5 so với mức trung vị 100 triệu trên toàn bộ các mô hình, và đánh dấu mô hình này là rất dài dòng. Một mức giá đầu vào rẻ không giúp gì cho khối lượng công việc mà hóa đơn chủ yếu nằm ở đầu ra.
Mức 100.000 token là bậc thứ ba. Trên mức đó, mức giá là $0,50 và $2,50 — bằng một nửa mức mà Claude Haiku 4.5 tính cho cùng một yêu cầu, đây là một mức giá hời và không phải là mức giá mà hầu hết độc giả sẽ đọc được. Anthropic nói rằng các prompt dưới ngưỡng chiếm khoảng 90% yêu cầu gửi đến mô hình Haiku trước đó, đây là con số khiến cho ngưỡng cắt này có thể trụ được như một tiêu đề; đó cũng là cơ cấu lưu lượng của chính nhà cung cấp, không phải của bạn.

Cùng một công việc tốn bao nhiêu chi phí đối với hai mô hình?
Chi phí cho mỗi tác vụ đã hoàn thành là chỉ số trụ vững qua cả ba hiệu ứng trên, bởi vì nó tính phí mô hình cho mọi thứ nó đã phát ra, chứ không chỉ những gì bạn đã gửi cho nó.
Artificial Analysis xếp Claude Haiku 5.5 (Max) ở mức 0,21 USD cho mỗi tác vụ Intelligence Index — con số mà họ công bố song song với mức giá 0,10 USD cho đầu vào và 0,50 USD cho đầu ra. Với thế hệ 4.5, họ hoàn toàn không công bố con số chi phí cho mỗi tác vụ; ô hiển thị ghi là unknown, bởi mô hình chưa từng được chạy trên Index ở cấu hình suy luận. Điều mà trang đó công bố là mức giá niêm yết thô 1,00 USD và 5,00 USD, cùng một điểm số đo được khác và thấp hơn.
Vậy nên so sánh trung thực dành cho người mua không phải là gấp 10 lần về token, mà gần với điều này hơn: bằng một phần mười mức giá đầu vào cho lượng token nhiều hơn 30%, một nửa mức giá đầu ra khi bạn vượt 100K, và một mô hình dùng nhiều token đầu ra hơn cho mỗi câu trả lời so với phiên bản tiền nhiệm — đối chiếu với bước nhảy năng lực từ 16.88 lên 43.40 trên cùng một bảng đánh giá độc lập. Con số 75% mà Anthropic đưa ra cho các khối lượng công việc trung bình là con số lập kế hoạch hợp lý. Đó cũng là một ước tính tổng hợp của nhà cung cấp trên một cơ cấu lưu lượng mà bạn không kiểm soát.
Quá trình migration không phải là việc hoán đổi model-id.
Hướng dẫn di chuyển của Anthropic lên tới mười mục dành cho bất kỳ ai rời bỏ Claude Haiku 4.5, và một số mục là lỗi cứng chứ không phải lời khuyên.
• Tư duy thủ công bị hỏng — thinking: {"type": "enabled", "budget_tokens": N} trả về lỗi. Tư duy thích ứng thay thế nó, và thinking.display phải được đặt thành "summarized" nếu bạn muốn thấy quá trình suy luận dù chỉ một chút.
• Các tham số lấy mẫu bị lỗi — temperature, top_p và top_k tất cả đều phải được gỡ khỏi yêu cầu.
• Tính năng tiền điền của trợ lý bị lỗi — cuộc trò chuyện kết thúc bằng lượt trợ lý sẽ trả về lỗi; hãy kết thúc nó bằng lượt người dùng.
• Thay đổi thứ tự khối — một phản hồi có thể bắt đầu bằng các khối suy nghĩ, vì vậy mã đọc khối nội dung đầu tiên như là câu trả lời phải chọn theo type thay vào đó.
• Việc từ chối là điểm mới — mô hình chạy các bộ phân loại an toàn, có thể trả về stop_reason: "refusal", và không có cơ chế dự phòng phía máy chủ.
• Replay bị hạn chế — các khối suy nghĩ chỉ hoạt động trong tài khoản đã tạo ra chúng, hoặc một tài khoản được liên kết với tài khoản đó.
• Priority Tier không được chuyển tiếp — các tổ chức có cam kết Priority Tier trên Claude Haiku 4.5 phải lập kế hoạch dung lượng riêng, vì tier này không được hỗ trợ trên Claude Haiku 5.5.
Hai trong số đó đáng được chú ý hơn phần còn lại. Lý do dừng từ chối là một thay đổi luồng điều khiển trong bất kỳ vòng lặp nào vốn giả định mọi phản hồi đều có nội dung, và các khối suy nghĩ gắn với tài khoản phá vỡ bất kỳ hàng đợi nào lưu trữ các cuộc hội thoại và phát lại chúng thông qua một nhóm thông tin xác thực. Cả hai đều không xuất hiện cho đến khi lên production.
Chạy cả hai tầng dưới cùng một khóa
Câu hỏi thực tế đối với hầu hết các nhóm không phải là mô hình nào trong hai mô hình này tốt hơn, vì câu trả lời hoàn toàn phụ thuộc vào việc bạn đang thực hiện cuộc gọi nào. Mà là liệu nhánh rẻ của một mô hình xếp tầng có thể được nâng cấp độc lập với mọi thứ xung quanh nó hay không.
Claude Haiku 4.5 đã có trên danh mục OrcaRouter ngay hôm nay với đúng giá niêm yết của Anthropic, mức chênh lệ 0%, nên mức giá của nhà cung cấp được chuyển thẳng qua và mọi thay đổi mà Anthropic thực hiện với mức giá đó đều xuất hiện ở phía chúng tôi ngay trong ngày. Claude Sonnet 5.5 và Claude Opus 5.5 cũng có mặt ở đó, nghĩa là một pipeline hai tầng — mô hình nhỏ cho phần lớn tác vụ thường ngày, mô hình lớn hơn cho các trường hợp cần nâng cấp — giờ đây có thể được dựng lên chỉ với một khóa, một SDK và cơ chế chuyển đổi dự phòng tự động ở bên dưới, rồi sau này hoán đổi nhánh nhỏ sang Claude Haiku 5.5 chỉ bằng một thay đổi model-id thay vì viết lại.
Claude Haiku 5.5 hiện chưa có trên đó, và thật đáng để nói thẳng điều này ra thay vì cứ để nó ngầm hiểu. Khoảng trống trong ngày ra mắt giữa việc một mô hình được phát hành và việc mô hình đó có thể được định tuyến là chuyện bình thường, và đó không phải là một lời hứa về thời điểm nó được khép lại; những mô hình có thể gọi được từ phía chúng tôi vào sáng nay chính là những mô hình được nêu tên ở trên.

Ai nên chuyển, và nên chuyển cuộc gọi nào trước?
Nếu lưu lượng Haiku 4.5 của bạn là phân loại, trích xuất, định tuyến, nén hoặc tóm tắt với prompt dưới 100.000 token, hãy chuyển — mức giá chỉ bằng một phần mười, cửa sổ rộng gấp năm lần, và mang lại mức chi phí mà bản cũ chưa từng có. Con số này thấp hơn khoảng 75% và hãy đối chiếu với số token của riêng bạn sau một tuần.
Nếu các prompt của bạn thường xuyên vượt quá 100.000 token, thì bạn đang mua mức giảm 50% chứ không phải 90%, và bậc thứ hai thay đổi phép so sánh theo những cách khiến việc tìm hiểu các lựa chọn trở nên đáng giá: mức giá đầu ra trên 100K là $2.50 cao hơn mức mà một số mô hình nhỏ cạnh tranh tính cho toàn bộ cửa sổ.
Và nếu bạn đang dùng Haiku 4.5 vì đó là lựa chọn rẻ duy nhất phù hợp với một tài liệu 200.000 token, hãy lưu ý điều gì đã thay đổi. Cửa sổ giờ đây là một triệu token, tức là một sản phẩm khác, và lý do để giữ mô hình cũ đã lặng lẽ biến mất cùng với lý do nó từng rẻ.
