Một thẻ tiêu đề được tạo có nội dung 'Claude Haiku 5.5 đã ra mắt' với huy hiệu phát hành 'GA 7 tháng 10 năm 2026', hai thẻ thông tin ghi 'Đầu vào $0,10 / 1M tối đa 100K token' và 'Đầu ra $0,50 / 1M tối đa 100K token', cùng một dòng chân trang ghi 'Một tiêu đề bị cắt, hai chú thích: 90 phần trăm dưới ngưỡng, 50 phần trăm trên ngưỡng, với khoảng 30 phần trăm token nhiều hơn.' Logo OrcaRouter thật được ghép ở góc dưới bên phải.
Guides & Insights

Claude Haiku 5.5 đã ra mắt với mức 0,10 USD mỗi triệu token: Tuyên bố 75%, và hai chú thích của nó

Tác giả

Alistair Wren

Ngày đăng

Mô hình mới nhất · 20Xem tất cả mô hình →
Benchmark: Artificial Analysis · cập nhật hằng ngày
Quay lại tất cả bài viết

Anthropic đã đưa Claude Haiku 5.5 vào diện phát hành chung vào ngày 7 tháng 10 năm 2026 với mức 0,10 USD mỗi triệu token đầu vào và 0,50 USD mỗi triệu token đầu ra — cũng đúng hai con số mà OpenAI thu cho GPT-6 Luna, và chỉ bằng một phần năm mức mà Claude Haiku 4.5 đã duy trì từ năm 2025, khi nó ra mắt ở mức 1,00 USD và 5,00 USD. Tiêu đề trong bài đăng ra mắt của Anthropic là mô hình mới tốn "khoảng 75% ít hơn để vận hành" so với bản tiền nhiệm tính trung bình, và đó là con số mà mọi bản tóm tắt kể từ đó đều lặp lại. Nó đi kèm hai chú thích mà phần lớn những bản tóm tắt đó đã bỏ qua: dưới 100.000 token thì mức giảm là 90%, trên mức đó thì mức giảm là 50%, và Claude Haiku 5.5 dùng tokenizer mới hơn, dùng chung với Claude 4.7 và các phiên bản sau, nên cùng một đoạn văn bản sẽ được tính thành khoảng nhiều hơn 30% token so với trên Claude Haiku 4.5. Vậy nên con số 75% là phát biểu về một hoá đơn, không phải về bảng giá, và với bất kỳ ai có prompt dài thì đó là hai chuyện khác nhau. Bảng so sánh của chính nhà cung cấp cũng đặt GPT-6 Luna và Claude Sonnet 5.5 thành các cột ngay bên cạnh, khiến tài liệu ra mắt trở nên dễ tranh cãi một cách bất thường.

Số học đằng sau "ít hơn 75%"

Hãy xem bảng giá trước, vì nó không đồng nhất. Đầu vào là $0,10 mỗi triệu cho tới 100.000 token và $0,50 mỗi triệu trên mức đó — gấp năm lần. Đầu ra là $0,50 và sau đó là $2,50. Bộ nhớ đệm cũng theo đúng bậc tương tự: ghi cache năm phút tốn $0,125 mỗi triệu dưới ngưỡng và $0,625 trên ngưỡng, ghi trong một giờ là $0,20 và $1,00, và đọc cache là $0,01 và $0,05. Message Batches API giảm 50% cho cả hai chỉ số, và trên đường batch, mô hình hỗ trợ tối đa 300.000 token đầu ra với output-300k-2026-03-24 beta header.

Giờ hãy đặt tokenizer lên trên đó, vì đây chính là chỗ khiến tuyên bố nổi bật trở nên thú vị. Một prompt đo được 90.000 token trên tokenizer Claude Haiku 4.5 sẽ đo được khoảng 117.000 token trên tokenizer mới. Nó không thay đổi về kích thước, nhưng đã vượt qua mốc 100.000 token, nên được tính phí ở mức $0,50 mỗi triệu input thay vì $0,10. Trên Claude Haiku 4.5, cùng nội dung đó tốn $0,09 tiền input ($1,00 mỗi triệu × 0,09 triệu). Trên Claude Haiku 5.5, nó tốn $0,0585. Đó là mức giảm 35% — có thật, và không hề gần mức 90%. Con số 90% áp dụng cho những yêu cầu vẫn ở dưới mốc sau khi tokenizer mở rộng chúng, và đây là nơi tập trung rất nhiều lưu lượng gọi ngắn: một cuộc gọi phân loại 20.000 token trở thành 26.000 token, vẫn nằm ở bậc đầu tiên, và ở đó giá input thực sự chỉ bằng một phần mười so với trước.

Từ đó suy ra ba điều, và chúng đáng được tách riêng thay vì gộp chung lấy trung bình:

• Cuộc gọi ngắn được hưởng trọn mức giảm giá. Trích xuất, định tuyến, phân loại, tóm tắt một tài liệu nằm dưới ngưỡng — những tác vụ này nhận mức 90% trên cả đầu vào lẫn đầu ra, trừ đi phần mở rộng của tokenizer.

• Các lệnh gọi dài chỉ được giảm khoảng một phần ba, chứ không phải ba phần tư. Một yêu cầu rơi vào mức trên 100.000 token sau khi tái token hóa sẽ trả $0,50 và $2,50 mỗi triệu token — vẫn bằng một nửa mức giá của Claude Haiku 4.5, nhưng bậc mà nó thực sự thuộc vào cao gấp năm lần bậc được quảng cáo trên nhãn giá.

• "Rẻ hơn 75% tính theo mức trung bình" là con số được gia trọng theo lưu lượng và đó là con số của Anthropic. Đó là mô tả của chính nhà cung cấp về tổ hợp dự kiến của chính họ, và Anthropic nói rõ rằng một prompt dưới ngưỡng chiếm khoảng 90% yêu cầu gửi đến Haiku trước đó. Nếu tổ hợp của bạn không giống tổ hợp đó, mức trung bình của bạn sẽ không giống mức trung bình đó — và cách duy nhất để biết là đếm token trên lưu lượng của chính bạn, trên tokenizer mới, trước khi bạn lập ngân sách.

A generated one-column scoreboard titled 'Claude Haiku 5.5 — the scoreboard' with six rows reading 'Input: $0.10 / 1M up to 100K, then $0.50', 'Output: $0.50 / 1M up to 100K, then $2.50', 'Context: 1,000,000 tokens', 'Independent score: 43 at Max effort, rank 2 of 182', 'Cost per task: $0.21', and 'Throughput: 241.9 tokens per second', with a footer reading 'Independent figures per Artificial Analysis; pricing per Anthropic.' The real OrcaRouter logo is composited bottom-right.

Còn gì khác đã được phát hành kèm với nó

Mô hình này không chỉ là một mức giá. Một số chi tiết khi ra mắt sẽ thay đổi cách bạn viết mã để làm việc với nó, và một trong số đó sẽ làm hỏng một client hiện có.

• Suy nghĩ thích ứng được bật theo mặc định, với thang mức nỗ lực từ Thấp đến Tối đa và mặc định là trung bình. Đây là mô hình đầu tiên thuộc lớp Haiku có cài đặt mức nỗ lực có thể điều chỉnh, và đây là đòn bẩy chính tác động đến cả chất lượng lẫn chi phí cho mỗi câu trả lời.

• Các tham số lấy mẫu bị từ chối. Gửi giá trị không mặc định cho temperature, top_p hoặc top_k sẽ trả về lỗi 400. Bất kỳ quá trình migration nào mang theo những đối số đó sẽ thất bại rõ ràng ngay ở yêu cầu đầu tiên thay vì âm thầm suy giảm, điều này ít nhất là một kiểu thất bại trung thực.

• Ngữ cảnh 1M token và tối đa 128.000 token đầu ra trong Messages API đồng bộ, với thời điểm cắt kiến thức là tháng 6 năm 2026 và cam kết ngừng hỗ trợ không sớm hơn ngày 7 tháng 10 năm 2027.

• Năm nền tảng ngay từ ngày đầu tiên: Claude API, Amazon Bedrock, Google Cloud, Microsoft Foundry và Claude Platform trên AWS. Đó là việc triển khai trong cùng một ngày, thay vì kiểu ra mắt theo từng giai đoạn mà những đợt ra mắt như thế này thường có.

Công cụ cũng đã chuyển đi. SDK Python và TypeScript của Anthropic nay đã hỗ trợ tính năng sử dụng máy tính và sử dụng trình duyệt ở bản beta, đồng thời công ty đã bổ sung tín dụng API hàng tháng cho các thuê bao Max 5x ($100), Max 20x ($200) và Team (gộp chung tối đa $500).

• Lập trường an toàn hẹp hơn so với mức giá gợi ý. Anthropic cho biết các biện pháp bảo vệ an ninh mạng trên Claude Haiku 5.5 có tính hạn chế cao hơn so với Claude Haiku 4.5 nhưng ít hạn chế hơn so với các mô hình tiên phong gần đây — cho phép sử dụng phòng thủ rộng hơn mức Claude Sonnet 5.5 cho phép, trong khi kiểm thử xâm nhập vẫn bị chặn — và rằng các biện pháp bảo vệ sinh học tương đương với Claude Sonnet 5, Claude Sonnet 5.5 và Claude Opus 5. Các đánh giá về căn chỉnh nhìn chung đã cải thiện so với phiên bản tiền nhiệm trên bộ đánh giá của chính Anthropic.

Những gì bảng của nhà cung cấp nói, và những gì hội đồng độc lập nói

Anthropic đã công bố một bảng điểm chuẩn với ba cột so sánh, và nó đáng để đọc như một tài liệu về cách các nhà cung cấp tranh luận. Mọi số liệu dưới đây đều do nhà cung cấp tự báo cáo, được tạo ra trên các harness của Anthropic, và không có số liệu nào được tái lập một cách độc lập; ở đâu xuất hiện GPT-6 Luna, thì đó là Anthropic đang chạy các đánh giá của chính mình đối với mô hình của một đối thủ cạnh tranh.

• Công việc tri thức — GDPval-AA v2.1 ở mức 1620 cho Claude Haiku 5.5, so với 735 cho Claude Haiku 4.5, 1437 cho GPT-6 Luna và 1840 cho Claude Sonnet 5.5. AA-Briefcase v1.1 ở mức 1578, 614, 1336 và 1824.

• Máy tính — OSWorld 2.1 ngoại tuyến đạt 72.4% so với 15.7%, 48.9% và 83.9%.

• Suy luận — Humanity's Last Exam đạt 45,9% khi không dùng công cụ và 57,4% khi dùng chúng, so với 10,2% và 18,7% của Claude Haiku 4.5 và 56,9% và 64,5% của Claude Sonnet 5.5.

• Lập trình agentic — Terminal-Bench 4.0 đạt 39,2% so với 0,0%, 16,4% và 70,6%. FrontierCode 1.1 (Main) đạt 46,4% so với 42,4% của GPT-6 Luna và 52,1% của Claude Sonnet 5.5.

• Đọc biểu đồ — Chartography đạt 46.4% khi không dùng công cụ, so với 6.4%, 29.1% và 61.6%.

Trên bảng đó, Claude Haiku 5.5 thắng mọi hàng trước cả Haiku thế hệ trước lẫn GPT-6 Luna, và thua phần lớn trong số đó trước Claude Sonnet 5.5 — đó là diện mạo trung thực của một tầng nhỏ: một bước nhảy lớn giữa các thế hệ, mà vẫn thấp hơn mô hình tầm trung một tầng ở những công việc khó nhất. Anthropic cũng nói đúng như vậy trong bài đăng, khuyến nghị Claude Sonnet 5.5 và Claude Opus 5.5 cho lập trình agentic phức tạp, đồng thời định vị Haiku cho các vai trò nén, tóm tắt, phân loại và subagent.

Bức tranh độc lập thì tinh tế hơn và đòi hỏi nhiều sự chú ý hơn. Artificial Analysis đo Claude Haiku 5.5 ở mức Max effort đạt 43 điểm trên Intelligence Index v4.3.2, xếp thứ hai trong số 182 mô hình, và 241,9 token đầu ra mỗi giây — nhanh, đúng như quảng cáo. Tổ chức này cũng đo được chi phí 0,21 USD cho mỗi tác vụ Index hoàn thành, bởi vì mô hình đã tạo ra 440 triệu token đầu ra khi chạy bộ kiểm thử, so với mức trung vị 100 triệu; bên đánh giá mô tả nó là cực kỳ dài dòng. GPT-6 Luna, với 38 điểm trên cùng chỉ số, tốn 0,07 USD mỗi tác vụ. Cùng một mức giá niêm yết, nhưng hóa đơn gấp ba lần. Đó không phải là mâu thuẫn với tuyên bố khi ra mắt — mà chính là hiện tượng mà tuyên bố khi ra mắt nói tới, nhìn từ đầu bên kia: bảng giá là số tiền bạn trả cho mỗi token, và con số bạn thực sự phải trả là đơn giá nhân với số token, mà Claude Haiku 5.5 lại tiêu tốn nhiều token hơn cho mỗi câu trả lời so với các đối thủ. Effort là đòn bẩy; mặc định của mô hình là medium, không phải Max, và một nhóm mà cố định nó ở mức thấp hơn sẽ thấy cả hóa đơn nhỏ hơn lẫn điểm số nhỏ hơn.

Gọi nó từ một nơi

Câu hỏi về việc di chuyển mà lần ra mắt này đặt ra không phải là "liệu nó có tốt hơn không" mà là "lưu lượng của tôi tốn bao nhiêu khi dùng nó", và câu trả lời đó phụ thuộc vào độ dài prompt của bạn, tỷ lệ cache hit của bạn và cài đặt effort mà bạn chọn. Để làm được điều đó, bạn phải chạy bộ prompt của riêng mình qua cả hai thế hệ — việc này rẻ khi làm phía sau một endpoint và tẻ nhạt khi phải làm xuyên qua hai endpoint.

Bản thân Claude Haiku 5.5 hiện chưa có trong danh mục của OrcaRouter, và nói thẳng điều đó hữu ích hơn là ngụ ý ngược lại. Phần còn lại của dòng Anthropic là: Claude Haiku 4.5, Claude Sonnet 5.5 và Claude Opus 5.5 đều có thể gọi từ chúng tôi ngay hôm nay với giá niêm yết của nhà cung cấp cùng với mức markup 0% được chuyển tiếp, nên chặng "trước" của một bài kiểm thử di trú chạy trên cùng khóa mà bạn sẽ giữ sau đó, và đợt giảm giá từ nhà cung cấp trên chặng đó sẽ có hiệu lực ở phía chúng tôi ngay trong cùng ngày. Chặng "sau" là API của Anthropic cho đến khi mô hình mới có mặt trên một runtime mà chúng tôi định tuyến. Điều mà endpoint dùng chung mang lại cho bạn trong lúc đó là tự động chuyển đổi dự phòng bên dưới lệnh gọi, để một mô hình mới có thể gánh lưu lượng production mà đường đi không phụ thuộc vào nó, và DSL định tuyến cho trường hợp việc nâng cấp từ Haiku lên Sonnet thuộc về tuyến thay vì trong mã ứng dụng của bạn.

A screenshot of OrcaRouter's model page for anthropic/claude-haiku-4.5, showing the model card and its list pricing of $1.00 per million input tokens and $5.00 per million output tokens, captured in English.

Hai kết quả khách hàng trong đợt ra mắt đáng để xem như đầu mối tiềm năng hơn là bằng chứng. Asana báo cáo mức giảm độ trễ trên 30% và suy luận nhanh hơn tới 2,5 lần cho mỗi lượt tác nhân; HubSpot báo cáo 92,8% tính trung bình qua ba lần chạy trên bộ CRM của mình; AlphaSense báo cáo 0,84 so với 0,76 trên 400 truy vấn. Đây là những con số khách hàng do nhà cung cấp tự chọn lọc, nằm trong chính thông báo của nhà cung cấp, và giá trị của chúng nằm ở chỗ cho bạn biết nên kiểm thử những khối lượng công việc nào trước, chứ không phải cho bạn biết bạn sẽ đạt được điều gì.

Điều gì sẽ thay đổi cục diện

Con số 75% sẽ được phân định theo đúng cách mọi tuyên bố của nhà cung cấp được cân theo lưu lượng được phân định: bằng chính hóa đơn của bạn. Điều thực sự còn bỏ ngỏ ở phía độc lập là con số chi phí cho mỗi tác vụ. Nếu nó vẫn đứng vững khi ngày càng nhiều lượt chạy được tích lũy, thì tóm tắt trung thực về lần ra mắt này là Anthropic đã cắt bảng giá xuống 80% và xây dựng một mô hình dùng nhiều token hơn cho mỗi câu trả lời, nên khoản tiết kiệm thực tế là có thật, lớn, phụ thuộc vào khối lượng công việc, và hiếm khi là con số trên áp phích. Nếu nó giảm xuống nhờ cài đặt mức độ nỗ lực và bộ nhớ đệm, thì gói đó còn trông tốt hơn nữa. Dù thế nào, con số cần kiểm tra trước khi chuyển đổi là số token của chính bạn cho mỗi tác vụ theo tokenizer mới — đó là con số duy nhất mà bài đăng ra mắt không thể cung cấp cho bạn.

A screenshot of the Artificial Analysis model page for Claude Haiku 5.5 at maximum effort, showing an Intelligence Index of 43 on v4.3.2 at rank 2 of 182 models, a 1,000,000-token context window, 241.9 output tokens per second at rank 8 of 182, a cost of $0.21 per Intelligence Index task, and 440 million output tokens against a 100 million median.

So sánh trong bài viết này1

Phát hiện từ bài viết này · Benchmark: Artificial Analysis · cập nhật hằng ngày