Thẻ hero được tạo hiển thị 'Daily AI Brief — October 8, 2026' với nhãn NEWS, tiêu đề 'Claude Haiku 5.5 ra mắt, và đọc cache của Sonnet 5.5 giảm một nửa', cùng bốn chip hiển thị $0.10 / $0.50 trên 1M, ngữ cảnh 1M token, mức effort mặc định Medium và đọc cache từ $0.20 xuống $0.10.
Engineering & Research

Tin AI hằng ngày, ngày 8 tháng 10: Claude Haiku 5.5 ra mắt ở mức 0,10 USD và Sonnet 5.5 giảm một nửa chi phí đọc bộ nhớ đệm

Tác giả

Gideon Frost

Ngày đăng

Mô hình mới nhất · 20Xem tất cả mô hình →
Benchmark: Artificial Analysis · cập nhật hằng ngày
Quay lại tất cả bài viết

Claude Haiku 5.5 ra mắt ngày 7 tháng 10 năm 2026, và đây là thứ rẻ nhất mà công ty từng đặt phía sau một API: 0,10 USD cho mỗi triệu token đầu vào và 0,50 USD cho mỗi triệu token đầu ra với prompt tối đa 100.000 token, cùng cửa sổ ngữ cảnh 1M token và một núm điều chỉnh effort chạy từ Low đến Max. Cùng ngày hôm đó, mà không có bài đăng ra mắt riêng, giá đọc prompt-cache trên Claude Sonnet 5.5 giảm từ 0,20 USD xuống 0,10 USD mỗi triệu token. Một trong hai thứ đó là sản phẩm, còn thứ kia chỉ là một dòng mục chi phí, và chính dòng mục chi phí mới là thứ sẽ dịch chuyển nhiều tiền hơn trong quý này.

Giá trước, vì đó là phần bạn có thể hành động ngay hôm nay. Rồi đến nỗ lực, thứ âm thầm quyết định giá. Rồi đến mức giảm giá cache, thứ mà một nửa số người đang trả tiền cho Sonnet 5.5 sẽ không nghe nói tới cho đến hóa đơn tiếp theo.

Claude Haiku 5.5 là gì, theo thứ tự quan trọng

Cách diễn đạt của chính nhà cung cấp là "mô hình nhỏ rẻ nhất, nhanh nhất và có năng lực cao nhất mà chúng tôi từng phát hành", và ngày phát hành là 7 tháng 10 năm 2026 — một ngày trước bản tóm tắt này. ID mô hình là claude-haiku-5-5. Đầu vào là văn bản và hình ảnh, đầu ra là văn bản. Cửa sổ ngữ cảnh là 1.000.000 token, tăng từ 200.000 trên Claude Haiku 4.5, và đầu ra tối đa là 128.000 token, với một beta header trên Batch API nâng con số đó lên 300.000. Thời điểm cắt dữ liệu huấn luyện là tháng 6 năm 2026, và Anthropic cam kết không ngừng cung cấp nó trước ngày 7 tháng 10 năm 2027.

Điểm quan trọng nhất đối với bất kỳ ai định tuyến lưu lượng không phải là cửa sổ ngữ cảnh. Mà là việc đây là mô hình lớp Haiku đầu tiên có mức nỗ lực điều chỉnh được. Mức nỗ lực gồm Low, Medium, High, Xhigh và Max, mặc định là Medium, và tư duy thích ứng được bật theo mặc định — một tính năng của Sonnet và Opus đang đến ở một bậc thấp hơn. Bài đăng ra mắt cũng mang hai nội dung nói về việc mua thay vì xây dựng: tín dụng API hàng tháng cho các gói Claude Max và Team, 100 đô-la ở Max 5x và 200 đô-la ở Max 20x với tối đa 500 đô-la được gộp cho Team, cùng hỗ trợ beta computer-use và browser-use trong các SDK. An toàn cũng theo kịp bậc này: các biện pháp bảo vệ an ninh mạng nghiêm ngặt hơn so với các biện pháp của Claude Haiku 4.5, với các yêu cầu kiểm thử xâm nhập vẫn bị chặn, và các biện pháp bảo vệ sinh học tương đương với những biện pháp trên Claude Sonnet 5, Claude Sonnet 5.5 và Claude Opus 5.

A capture of Anthropic's Claude Haiku 5.5 announcement page showing the October 7, 2026 date, the headline framing Claude Haiku 5.5 as a performance, pricing and safety upgrade, and the on-page sections for Performance, Pricing, Safety and Further updates.

Giá, cửa sổ ngữ cảnh 100.000 token và cách nó so sánh với Gemini.

Mức giá nổi bật là $0,10 mỗi triệu token đầu vào và $0,50 mỗi triệu token đầu ra. Hãy đọc dấu hoa thị: đó là mức giá cho các prompt từ 100.000 token trở xuống. Trên 100.000, cả hai con số đều nhân với năm, thành $0,50 cho đầu vào và $2,50 cho đầu ra. Ghi cache tốn $0,125 mỗi triệu ở bậc năm phút và $0,20 ở bậc một giờ trong dải giá rẻ, còn đọc cache tốn $0,01 mỗi triệu — bằng một phần mười giá đầu vào, đây là mức chiết khấu cache sâu nhất mà Anthropic từng công bố trên bất kỳ mô hình nào. Batch lại giảm một nửa mọi thứ: $0,05 và $0,25 trong dải giá rẻ, $0,25 và $1,25 khi vượt dải đó.

So sánh điều đó với Claude Haiku 4.5, mẫu vẫn còn trên bảng giá ở mức cố định 1,00 đô la cho đầu vào và 5,00 đô la cho đầu ra, không có phân tầng dựa trên ngữ cảnh, giá đọc bộ nhớ đệm 0,10 đô la và cửa sổ 200.000 token. Mô hình mới chỉ bằng một phần mười giá với cùng dạng prompt, nhưng có ngữ cảnh gấp năm lần. Ở đây không có phép tính di trú nào cần chạy; các con số không hề gần nhau.

Vách đá chính là phần cần thiết kế xoay quanh. Một prompt 99.000 token tốn 99 xu cho mỗi nghìn lần gọi theo mức giá đầu vào. Một prompt 101.000 token tốn $5,05 cho mỗi nghìn. Chênh lệch hai nghìn token là hóa đơn gấp 5 lần, vì vậy bất cứ thứ gì bạn xây dựng trên vùng giá rẻ đều nên hoặc nằm thoải mái dưới 100.000 token, hoặc cố ý và nhất quán vượt qua ngưỡng đó — kết cục tồi tệ nhất là một pipeline nằm vắt qua ranh giới và trả mức giá cao cho một nửa lưu lượng của nó.

Công sức giờ là một tham số định giá, và mặc định không phải là rẻ nhất.

Vì mức nỗ lực mặc định là Medium và tính năng suy nghĩ được bật theo mặc định, giá niêm yết và giá thực tế không phải là cùng một con số. Token suy luận được tính như token đầu ra. Trong lần chạy do chính Anthropic công bố trên Artificial Analysis Intelligence Index — do nhà cung cấp báo cáo, chúng tôi chưa tái lập — Claude Haiku 5.5 phát ra khoảng 162.000 token mỗi tác vụ, trong đó khoảng 129.000 là suy luận. Mô hình trung vị của chỉ số này phát ra ở mức 100 triệu token trên toàn bộ bộ đánh giá; Haiku 5.5 tiêu tốn 440 triệu. Với mức 0,50 đô la mỗi triệu token đầu ra, việc dài dòng đó là chấp nhận được về chi phí, và đó chính xác là điểm mấu chốt: ở mức giá của Haiku 5.5, suy nghĩ nhiều vẫn rẻ hơn suy nghĩ ít trên một mô hình tính 5,00 đô la cho đầu ra.

Đặt mức nỗ lực thành Low cho các quyết định phân loại, trích xuất và định tuyến khi bạn muốn có câu trả lời nhanh thay vì một câu trả lời đã được cân nhắc kỹ, và giữ nguyên ở Medium cho bất kỳ nội dung nào người dùng sẽ đọc. Giảm xuống Low cũng là cách đáng tin cậy để giữ một agent dài dòng nằm trong dải 100,000 token, vì nó cắt giảm token suy luận trước khi cắt giảm chất lượng câu trả lời.

Dòng êm ả hơn: Sonnet 5.5 giảm một nửa lượt đọc cache

Claude Sonnet 5.5 đọc prompt được lưu trong bộ nhớ đệm với giá $0.10 mỗi triệu token tính đến ngày 7 tháng 10, giảm từ $0.20. Giá đầu vào của Sonnet 5.5 là $2.00 và giá đầu ra là $10.00, vì vậy hệ số nhân 0,05x cho lượt đọc cache giờ đây chính là hệ số nhân mà Haiku 5.5 có, được áp dụng cho mức giá đầu vào lớn gấp hai mươi lần. Ước tính của chính Anthropic là điều này cắt giảm chi phí của hầu hết công việc agentic khoảng 20%, đây là một tuyên bố về hình dạng khối lượng công việc chứ không phải một benchmark: nó chỉ đúng nếu một phần lớn đầu vào của bạn là tiền tố ổn định mà bạn gửi lại mỗi lượt. Nếu prompt của bạn là duy nhất trong mỗi lần gọi, thay đổi này không tốn kém gì cho bạn và cũng không tiết kiệm được gì.

Đáng chú ý là việc cắt giảm này hàm ý điều gì. Anthropic đang định giá mạnh tay cho các prefix có vòng đời dài trên mô hình tầm trung đúng vào thời điểm hãng tung ra một mô hình nhỏ cực rẻ, điều này được xem như một lập luận ủng hộ kiến trúc hai mô hình: một nhánh Sonnet 5.5 với bộ đệm nóng cho công việc cần phán đoán, và một nhánh Haiku 5.5 cho khối lượng công việc không cần phán đoán.

Những gì các con số độc lập cho thấy, sau một ngày

Artificial Analysis đã chấm điểm Claude Haiku 5.5 vào ngày sau khi ra mắt. Chỉ số Intelligence Index của nó đạt tổng thể 43, với cấu hình Max-effort được báo cáo ở mức 43,40, đứng thứ hai trong số 182 mô hình trên bảng xếp hạng. Chi phí cho mỗi tác vụ chỉ số là 0,21 đô la, rẻ thứ bốn mươi sáu. Giá kết hợp theo tỷ lệ 7:2:1 giữa đầu vào, đầu vào được lưu vào bộ đệm và đầu ra là 0,08 đô la mỗi triệu, con số khiến việc so sánh phân khúc trước đó có cảm giác không công bằng với mọi thứ khác. Tốc độ đầu ra là 243,4 token mỗi giây, nhanh thứ chín trên bảng xếp hạng, với độ trễ token đầu tiên được báo cáo khoảng 0,3 giây và mức chiết khấu bộ nhớ đệm 90%.

Con số đầu ra 440 triệu token đó chính là điều đáng lưu ý gắn liền với con số 43. Điểm số là thật và được chạy độc lập; mức độ dài dòng cũng vậy. Một mô hình suy nghĩ nhiều đến thế thì rẻ tính theo token và không phải lúc nào cũng rẻ tính theo tác vụ, và khoảng cách giữa hai con số ấy chính là nơi một quyết định định tuyến thực sự tồn tại.

Để dễ hình dung về quy mô, các so sánh do chính Anthropic công bố xếp Claude Haiku 5.5 ở mức 1620 trên GDPval-AA v2.1 so với 735 của Claude Haiku 4.5, 72,4% trên OSWorld 2.1 so với 15,7%, 45,9% trên Humanity's Last Exam không dùng công cụ so với 10,2%, và 39,2% trên Terminal-Bench 4.0 so với 0,0%. Đó là những số liệu do nhà cung cấp báo cáo trên các bài đánh giá do nhà cung cấp tự chọn và nên được hiểu là chỉ mang tính định hướng, nhưng xu hướng thì không hề mơ hồ — đây không phải là một bản nâng cấp nhỏ dành cho một mô hình nhỏ.

A generated single-column scoreboard titled 'Claude Haiku 5.5 — the scoreboard' listing an Artificial Analysis Intelligence Index of 43 ranked second of 182, a cost per index task of $0.21, a blended price of $0.08 per million tokens, output speed of 243.4 tokens per second, a 1M-token context window and a $0.01-per-million cache read.

Tiếp cận được các mô hình này mà không cần hợp đồng thứ hai

Claude Haiku 5.5 có mặt thông qua API riêng của Anthropic và, từ đó, ở bất cứ nơi nào các mô hình của Anthropic được bán lại. Trên danh mục của OrcaRouter, dòng Anthropic hiện nay gồm anthropic/claude-haiku-4.5, anthropic/claude-sonnet-5.5, anthropic/claude-opus-5.5 và anthropic/claude-fable-5.1 — chúng tôi không host Claude Haiku 5.5, và bản tóm tắt này sẽ không giả vờ điều ngược lại. Điều chúng tôi thực sự cung cấp là tầng cao hơn nó, và OrcaRouter chuyển tiếp nguyên giá niêm yết của nhà cung cấp với mức markup 0%, đó là lý do vì sao việc cắt giảm giá đọc cache của Sonnet 5.5 đã xuất hiện trong bảng giá của chúng tôi ngay cùng ngày Anthropic thực hiện nó, thay vì theo một chu kỳ điều chỉnh giá đã lên lịch.

Phiên bản thực tế: nếu bạn muốn thử Haiku 5.5 trên một nhánh phân loại trong khi nhánh phán đoán vẫn dùng Claude Sonnet 5.5, thì bạn đang cầm hai chìa khóa thay vì một, và lớp định tuyến chính là nơi quyết định A/B. Đó là toàn bộ lập luận cho việc dùng gateway thay vì tích hợp trực tiếp — một endpoint, các chuỗi model, và một đường dự phòng khi nhà cung cấp gặp trục trặc.

A capture of the OrcaRouter models catalogue showing the filterable model list with input-modality, context-length, input-price, status and series filters, the line counting the model list and providers on one API key and one bill, and model cards carrying per-million input and output prices.

Những điều cần theo dõi từ đây

Ba điều. Liệu các nhà cung cấp bên thứ ba có bắt đầu bán lại Haiku 5.5 ở mức giá kết hợp dưới $0.10 hay không, đó là điểm mà lớp định tuyến khẳng định được giá trị của mình chứ không chỉ đơn thuần giúp việc mua sắm đơn giản hơn. Liệu Anthropic có mở rộng ranh giới bậc 100.000 token hay không, vì một vách đá đúng tại mốc 100.000 là một chỗ kỳ lạ để một mô hình với cửa sổ 1 triệu token có một ranh giới như vậy. Và liệu con số độ dài dòng 440 triệu token có giảm xuống trong một bản phát hành nhỏ hay không, bởi vì chính con số đó là thứ đứng giữa Haiku 5.5 và việc trở thành mặc định hiển nhiên cho toàn bộ nửa dưới của một ngăn xếp sản xuất.