
Câu chuyện thật sự của Claude Haiku 5.5 là vách đá 100K: Mức phí mới của Haiku khi vượt qua 100.000 token
- openaiMỚIOpenAI: GPT-6.1 Sol2026-09-2952Trí tuệ
- anthropicMỚIAnthropic: Claude Sonnet 5.52026-09-2856Trí tuệ
- typesafeTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 trên 1 triệu token · 128 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238Trí tuệ
- OpenAIOpenAI: GPT-6 Sol2026-09-2248Trí tuệ
- AnthropicAnthropic: Claude Opus 5.52026-09-2258Trí tuệ
- xAIGrok 4.72026-09-2146Trí tuệ
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 trên 1 triệu token · 57 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 trên 1 triệu token · 320 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Trí tuệ
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Trí tuệ77Lập trình
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Trí tuệ76Lập trình
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Trí tuệ76Lập trình
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Trí tuệ82Lập trình
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 trên 1 triệu token · 56 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 trên 1 triệu token · 345 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Trí tuệ72Lập trình
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 trên 1 triệu token · 230 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Trí tuệ75Lập trình
- obsidianQwen3.8 27B2026-08-1534Trí tuệ68Lập trình
Claude Haiku 5.5 ra mắt ngày 7 tháng 10 năm 2026 với mức giá gây chú ý là $0.10 mỗi triệu token đầu vào và $0.50 mỗi triệu token đầu ra, và con số được lặp đi lặp lại ở khắp mọi nơi chính là con số mà Anthropic tự đưa vào thông báo: mức giảm 90% so với giá Haiku 4.5 cho cùng hai hạng mục đó. Con số 90% đó là thật. Nó cũng chỉ giới hạn ở một nửa của một chiều trong hóa đơn, và ngay khi một yêu cầu vượt qua 100.000 token, mọi mức giá trong đó đều làm một điều mà các bài đưa tin về màn ra mắt phần lớn đã bỏ qua. Bài viết này nói về ranh giới đó — nó tốn bao nhiêu, những khối lượng công việc nào thực sự chạm tới nó, và vì sao “rẻ hơn 90%” là một tuyên bố về một phần của hóa đơn chứ không phải về hóa đơn của bạn.
Hai mức giá, và điểm chúng chuyển đổi
Anthropic công bố hai cột cho mô hình, và việc chuyển đổi giữa chúng là một ngưỡng duy nhất về kích thước yêu cầu chứ không phải dựa trên bất kỳ cài đặt mô hình nào bạn chọn:
• Bậc ngắn, từ 100.000 token trở xuống — $0,10 mỗi triệu token đầu vào, $0,50 mỗi triệu token đầu ra (bảng giá Anthropic) • Bậc dài, trên 100.000 token — $0,50 mỗi triệu token đầu vào, $2,50 mỗi triệu token đầu ra (bảng giá Anthropic) • Đọc bộ nhớ đệm — $0,01 mỗi triệu (bậc ngắn) và $0,05 mỗi triệu (bậc dài) • Batch API — giảm 50% ở cột bất kỳ, và độ dài đầu ra tối đa là 300.000 token • Đầu ra tối đa tiêu chuẩn — 128.000 token, với cửa sổ ngữ cảnh 1 triệu token ở cả hai bậc

Đó là mức giá do chính Anthropic công bố, không phải mức giá được đo lường, và chúng là bảng giá hiện hành: giá cho một mô hình mới như thế này chưa có thời gian thay đổi, mặc dù Anthropic không có bất kỳ cam kết nào phải giữ nguyên mức giá đó.
Đọc bốn con số đó theo thứ tự và hình dạng của vấn đề sẽ hiện ra rõ ràng. Mọi mức giá trong bậc ngữ cảnh dài đều đúng bằng năm lần mức giá ngữ cảnh ngắn, và ngưỡng đều là cùng một mức 100.000 token cho tất cả cùng lúc. Không có đường cong dần dần, không có nội suy, không có dải trung gian — một yêu cầu 99.000 token và một yêu cầu 101.000 token khác nhau gấp năm lần ở mọi token trong hóa đơn, chứ không chỉ ở 2.000 token đã vượt ngưỡng. Đó là phần khiến đây là một vách đá chứ không phải một con dốc, và đó là phần mà cách diễn đạt "rẻ hơn 90 phần trăm" có thể thấy.

Tại sao vết cắt trông lớn hơn thực tế
So với Haiku 4.5, phép so sánh mà Anthropic đưa ra, bậc ngắn thực sự là mức giảm 90 phần trăm trên cả đầu vào lẫn đầu ra — Haiku 4.5 có giá $1.00 và $5.00 mỗi triệu cho cùng hai cột đó. Bậc dài lại là câu chuyện khác: $0.50 và $2.50 so với cùng mức $1.00 và $5.00 là mức cắt giảm 50 phần trăm, không phải 90 phần trăm. Vậy phiên bản trung thực của tuyên bố ra mắt là Claude Haiku 5.5 rẻ hơn 90 phần trăm so với Haiku 4.5 dưới 100.000 token và rẻ hơn 50 phần trăm trên ngưỡng đó, đúng bằng cách phân tách mà tài liệu của chính Anthropic đưa ra khi bạn đọc cả hai cột thay vì một cột. Con số phần trăm duy nhất đó không sai; đó là tỷ lệ phần trăm của bậc ngắn, được trình bày mà không kèm điều kiện của nó.
Có một điều thứ hai đang kéo về hướng ngược lại, và nó mới là điều thú vị hơn vì rất dễ bị bỏ sót và khó lách qua. Claude Haiku 5.5 được phát hành kèm một tokenizer mới, và hướng dẫn của chính Anthropic đặt số token cho một đoạn văn bản nhất định cao hơn khoảng 30% so với mức Haiku 4.5 tạo ra cho cùng nội dung. Mức bạn từng trả cho mỗi token đã giảm, còn mức bạn trả cho mỗi token trong văn bản *của bạn* đã tăng khoảng một phần ba, so với cách tính của mô hình cũ. Con số ròng mà Anthropic công bố, rằng mô hình trung bình rẻ hơn khoảng 75% khi vận hành, đã bao gồm yếu tố này — mức giảm giá niêm yết 90% trừ đi mức lạm phát token khoảng 30% sẽ nằm trong khoảng đó với lưu lượng ngữ cảnh ngắn — nhưng hai hiệu ứng này có thể tách riêng và đáng để tách riêng. Thay đổi về giá là một thay đổi giá niêm yết mà bạn có thể đọc thấy trên trang; thay đổi về tokenizer làm thay đổi số đơn vị của mức giá đó mà các prompt hiện có của bạn tiêu thụ, và nó xuất hiện trong số token của chính bạn trước khi xuất hiện ở bất kỳ nơi nào khác.
Đối với một khối lượng công việc vốn đã ở mức thoải mái dưới 100.000 token mỗi lần gọi, tác động thực tế là việc giảm chi phí mỗi lần gọi một cách trực tiếp, phần nào bị tokenizer bù trừ. Còn với trường hợp không như vậy, phép tính lại đảo chiều hai lần ở nửa dài.
Thực sự thì có gì tồn tại trên 100.000 token?
Phản xạ thường là xếp giá theo ngữ cảnh dài vào mục "agentic coding và RAG, không phải chúng ta." Như vậy là quá vội, bởi vì mốc 100.000 token là mốc theo từng yêu cầu, và kích thước theo từng yêu cầu không giống với kích thước tác vụ. Một vài mẫu thường xuyên vượt qua mốc đó:
• Một agent đọc codebase duy trì một tập làm việc lớn trong ngữ cảnh xuyên suốt một phiên, thay vì truy xuất lại theo từng bước
• Phân tích tài liệu và hợp đồng, trong đó đầu vào là một PDF dài cùng với các hướng dẫn riêng và ví dụ few-shot — kiểu prompt vốn đã là 60.000 token trước khi có ai đó thêm các ví dụ
• Các pipeline nhập dữ liệu gộp nhiều mục nhỏ vào một lần gọi để phân bổ chi phí trên mỗi lần gọi, và khi làm như vậy, đẩy toàn bộ lô vượt qua ngưỡng
• Các sản phẩm chat giữ toàn bộ lịch sử hội thoại ngay trong ngữ cảnh thay vì tóm tắt nó, khiến yêu cầu tăng đơn điệu cho đến khi có thứ gì đó cắt ngắn nó
• Đầu vào kiểu phiên âm âm thanh và video dài, vốn chính là loại lưu lượng mà cửa sổ 1 triệu token được quảng cáo là có thể xử lý
Cửa sổ ngữ cảnh 1 triệu token là phần trong bảng thông số khiến cú nhảy giá trở nên đáng bàn. Anthropic đang bán khả năng giao cho mô hình một yêu cầu rất lớn, và mức giá được đặt sao cho 900.000 token cuối của ngữ cảnh đó có chi phí gấp năm lần 100.000 token đầu tiên. Cả hai đều là chủ đích; chúng được công bố ở những nơi khác nhau. Nếu cửa sổ ngữ cảnh dài là lý do bạn cân nhắc mô hình này, thì cột ngữ cảnh dài là cột dành cho bạn, còn tỷ lệ phần trăm khi ra mắt là chuyện của người khác.
Áp lực mà mức giá tạo ra đối với gói Flash
Ý định mà Anthropic tuyên bố đằng sau mô hình này là giữ lấy phân khúc rẻ, thông lượng cao của ngăn xếp, và mức giá khiến ý định đó trở nên rõ ràng. Các bài đưa tin của Bloomberg về mô hình này mô tả nó như việc Anthropic bảo vệ vị thế chi phí thấp hơn của mình trước các đối thủ trọng số mở rẻ hơn, còn cách định vị từ phía nhà cung cấp thì đi xa hơn — rằng Haiku mới được định giá để thấp hơn đáng kể so với các đối thủ trực tiếp của nó.
Phép so sánh chỉ thực sự rõ ràng ở bậc ngắn, nơi $0,10 và $0,50 cực kỳ thấp. Trên 100.000 token, mức $0,50 và $2,50 không còn định giá thấp hơn bậc ngắn của bất kỳ ai nữa; chúng là những con số trung cấp thông thường. Tuyên bố “biên rộng” của nhà cung cấp là phát biểu về cột đầu tiên của bảng giá, và Anthropic có quyền đưa ra tuyên bố đó ở đó — đó là cách đọc chính xác những con số mà công ty công bố. Đó không phải là tuyên bố về mức mà một khối lượng công việc ngữ cảnh dài phải trả, và không nên được trích dẫn như thể là một tuyên bố như vậy.
Tóm tắt phần còn lại của mô hình
Claude Haiku 5.5 giữ nguyên các tính năng đã có trên dòng Sonnet và Opus thay vì cắt giảm chúng cho phù hợp với phân khúc kích thước. Tính năng suy luận thích ứng với thiết lập effort mặc định là medium vẫn hiện diện, và đây là mô hình đầu tiên trong lớp Haiku có núm điều chỉnh effort từ Low đến Max. Thời điểm kiến thức cập nhật là tháng 6 năm 2026 và ID mô hình là claude-haiku-5-5. Anthropic công bố ngày ngừng hoạt động không sớm hơn ngày 7 tháng 10 năm 2027 — trùng với ngày phát hành, tức sau đúng một năm — và mô hình này được niêm yết trên Amazon Bedrock, Google Cloud và Microsoft Azure cùng với API riêng của Anthropic.

Về phương diện benchmark, mọi thứ trong bài đăng ra mắt đều mang cùng một nhãn nguồn gốc và xứng đáng với nhãn đó: đây là những con số do nhà cung cấp tự báo cáo, được đo bởi chính công ty bán mô hình, không có bản tái lập độc lập nào được công bố tại thời điểm viết bài.
• GDPval-AA v2.1 — con số 1.620 do nhà cung cấp báo cáo dành cho Claude Haiku 5.5, so với 735 dành cho Haiku 4.5 trong cùng một harness
• AA-Briefcase v1.1 — 1.578 do nhà cung cấp báo cáo, so với 614 của thế hệ trước
• OSWorld 2.1 — do nhà cung cấp báo cáo là 72,4 phần trăm, so với 15,7 phần trăm
• Terminal-Bench 4.0 — do nhà cung cấp báo cáo là 39.2, so với 0.0
• Humanity's Last Exam — theo báo cáo của nhà cung cấp là 45,9 phần trăm, hoặc 57,4 khi sử dụng công cụ
Độ lớn của những mức chênh lệch đó chính là lý do để gắn cờ cảnh báo chúng thay vì trích dẫn chúng. Một bước nhảy từ 15.7 lên 72.4 trên một benchmark OS-agent do chính nhà cung cấp của mô hình đo lường là con số nên được nhìn nhận dè dặt cho đến khi một bên thứ ba chạy cùng bộ khung đánh giá đó. Artificial Analysis đã công bố chỉ số riêng của mình cho mô hình này tính đến đầu tháng 10 năm 2026 — một con số độc lập là 43.395, với 0.329 trên Terminal-Bench Hard và 0.444 trên HLE — và bộ số liệu đó mới là thứ cần trích dẫn khi tuyên bố phải đủ sức trụ vững trước một thách thức. Các con số của nhà cung cấp và các con số độc lập không hề mâu thuẫn; chúng chỉ đơn giản là những bộ khung đánh giá khác nhau, và việc trộn chúng vào cùng một câu chính là cách một bài blog đi đến chỗ khẳng định rằng một đánh giá của nhà cung cấp là sự thật.
Ghi chú về hạ tầng, vì chúng tôi vận hành một cái
Anthropic bán Claude Haiku 5.5 qua API của riêng mình và qua Bedrock, Google Cloud cùng Azure. Nếu bạn đang cân nhắc nên gọi qua kênh nào trong số đó, hoặc đang thêm nó vào bên cạnh những mô hình khác đã có trong hệ thống của mình, hãy lưu ý rằng giá niêm yết của nhà cung cấp là như nhau dù bán ở đâu, và OrcaRouter được xây dựng để chuyển nguyên mức giá niêm yết đó với mức markup bằng không — nên khi Anthropic thay đổi giá của mô hình này, phía chúng tôi cập nhật ngay trong cùng ngày thay vì bị độ trễ. Danh mục của chúng tôi cũng có qwen/qwen3.8-flash với giá $0.15 và $0.47 mỗi triệu token và z-ai/glm-5.3-flash với giá $0.15 và $0.50, cặp mô hình thường xuyên nằm ở vị trí bên cạnh một mô hình hạng Haiku, dùng cùng một key và cùng một hoá đơn — điều giúp một hệ thống hỗn hợp chỉ tốn một hợp đồng thay vì ba. Chúng tôi không cung cấp Claude Haiku 5.5; muốn dùng nó, hãy gọi trực tiếp Anthropic.
Một hệ quả thực tế của vách giá, nếu bạn định tuyến nhiều hơn một mô hình: ranh giới 100.000 token là nơi một yêu cầu từng rẻ trở nên đắt đỏ mà không có gì trong yêu cầu thay đổi đáng kể. Nếu lớp định tuyến của bạn có thể chuyển đổi dự phòng, cách hợp lý là giữ lưu lượng ngữ cảnh dài hướng đến mô hình thực sự rẻ ở trên ngưỡng và để lưu lượng ngữ cảnh ngắn rơi về mô hình rẻ ở dưới ngưỡng, thay vì giả định mức giá niêm yết của một mô hình áp dụng cho cả hai.
Những điều rút ra từ buổi ra mắt
Mức cắt giảm giá là có thật và rất lớn, ở mức dưới 100.000 token. Mô hình này là Haiku đầu tiên có bộ tính năng được phát hành trọn vẹn và một núm điều chỉnh mức nỗ lực, thứ quan trọng hơn mức giá đối với việc sử dụng agentic. Các mức chênh lệch benchmark là do nhà cung cấp báo cáo và cần được ghi nhãn như vậy mỗi khi chúng được nhắc lại. Và bảng giá có một nấc tại 100.000 token, nấc này nhân mọi đơn giá lên năm lần cùng một lúc — đó là điều duy nhất về lần ra mắt này mà người đọc stack của bạn, chứ không phải người đọc thông cáo báo chí, cần biết nhất trước khi ngân sách token của sprint tiếp theo được thiết lập.
Nếu bạn muốn kiểm tra phép tính này dựa trên lưu lượng của chính mình, hai con số cần lấy ra là phân vị thứ 95 về kích thước yêu cầu của bạn và tỷ trọng chi tiêu của bạn cho các yêu cầu trên 100.000 token. Nếu con số thứ nhất nằm dưới ngưỡng, mức 90 phần trăm sẽ áp dụng cho bạn và bài đưa tin ra mắt đã đúng về tình huống của bạn. Nếu con số thứ hai chiếm một phần đáng kể trong hóa đơn, con số quan trọng là 50, và đáng để chạy lại ước tính chi phí cho bất kỳ mô hình nào trong ngăn xếp mà bạn đã chọn theo giả định về mức 90.
So sánh trong bài viết này1
Phát hiện từ bài viết này · Benchmark: Artificial Analysis · cập nhật hằng ngày
