Một thẻ hero được tạo tự động cho 'Claude Haiku 5.5 có giá chỉ bằng một phần mười', gắn nhãn 'CLAUDE RẺ NHẤT' với dòng nhấn 'ANTHROPIC, NGÀY 7 THÁNG 10 NĂM 2026' và phụ đề 'Giảm giá 90%, một tokenizer làm tăng thêm khoảng 30% token, và một video ra mắt mà Anthropic đã không đăng.' Bốn chip hiển thị '$0.10 vào', '$0.50 ra', 'ngữ cảnh 1M' và 'tiết kiệm thực 75%'. Hai thẻ bên dưới được gắn nhãn 'NHỮNG GÌ ĐÃ GIẢM' ('đầu vào từ $1.00 xuống $0.10, đầu ra từ $5.00 xuống $0.50 với dưới 100.000 token') và 'NHỮNG GÌ ĐÃ TĂNG' ('cùng một đoạn văn bản được tính thành khoảng 30% token nhiều hơn so với trước đây'). Một dòng chân trang ghi 'Tài liệu giá của nhà cung cấp được đọc ngày 8 tháng 10 năm 2026.' Logo OrcaRouter được ghép vào góc dưới cùng bên phải.
Guides & Insights

Claude Haiku 5.5: Mức giảm giá 90%, một tokenizer mới và video mà Anthropic không đăng

Tác giả

Rowan Sterling

Ngày đăng

Mô hình mới nhất · 20Xem tất cả mô hình →
Benchmark: Artificial Analysis · cập nhật hằng ngày
Quay lại tất cả bài viết

Ai đó đã gõ một câu vào Claude Haiku 5.5 và nhận lại một thước phim ra mắt hoàn chỉnh. Câu lệnh, được đăng lên X vào tối ngày 7 tháng 10 năm 2026, nguyên văn là: "hãy làm một video ra mắt chất gấp 10 lần cho buổi ra mắt của bạn, thể hiện bạn là motion designer giỏi đến mức nào." Chú thích của bài đăng dài ba từ — "Làm một phát là xong video này" — và nó đính kèm clip. Không thử lại, không storyboard, không editor. Nếu đó là những gì mô hình rẻ nhất trong dòng Claude làm được bây giờ, thì phân khúc này đã không còn là một sự thỏa hiệp nữa.

Đó là nửa thú vị của buổi ra mắt. Nửa còn lại là số học, và đó mới chính là chỗ có tin thật: Claude Haiku 5.5 có giá 0,10 đô-la cho mỗi triệu token đầu vào và 0,50 đô-la cho mỗi triệu token đầu ra với prompt tối đa 100.000 token, so với mức giá cố định 1 đô-la và 5 đô-la của Claude Haiku 4.5. Chính chú thích của Anthropic gọi đó là thấp hơn 90% ở trường hợp phổ biến — rồi ngay sau đó nói rằng con số mà người mua nên dựa vào để tính toán thì gần với 75% hơn. Cả hai con số đều đúng, và khoảng cách giữa chúng là điều quan trọng nhất trong bản phát hành này.

Những gì Ant​hropic đã công bố chính thức vào ngày 7 tháng 10

Bài đăng ra mắt của nhà cung cấp và tài liệu định giá của họ nhất trí với nhau về hình hài của thứ này, và đó là một bước tiến lớn hơn mức mà một đợt cắt giảm giá thường đi kèm.

A generated scoreboard titled 'Claude Haiku 5.5 benchmark table - Anthropic's own harness' with two columns. Claude Haiku 5.5 reads GDPval-AA v2.1 1620, AA-Briefcase v1.1 1578, OSWorld 2.1 72.4%, Humanity's Last Exam 45.9%, Terminal-Bench 4.0 39.2% and Chartography 46.4%. Claude Haiku 4.5 reads 735, 614, 15.7%, 10.2%, 0.0% and 6.4%. A footer reads 'Vendor-reported evaluations published by Anthropic on October 7, 2026; not independently reproduced.'

• Giá — $0.10 mỗi triệu token đầu vào và $0.50 mỗi triệu token đầu ra cho các prompt tối đa 100.000 token. Vượt ngưỡng đó, cùng yêu cầu sẽ được tính ở mức $0.50 và $2.50. Đọc cache tốn $0.01 mỗi triệu token cho đến 100K và $0.05 khi vượt mức; ghi cache là $0.125 và $0.625.

• Ngữ cảnh — 1M token, với đầu ra tối đa 128.000 token. Đó chính là cửa sổ ngữ cảnh và giới hạn đầu ra mà Claude Fable 5.1, Claude Opus 5.5 và Claude Sonnet 5.5 sở hữu, được tái hiện trên hạng rẻ nhất.

• Thinking — tư duy thích ứng với tham số effort, mặc định ở mức medium. Ant​hropic cho biết đây là mô hình đầu tiên thuộc lớp Haiku có thiết lập effort có thể điều chỉnh, nghĩa là cùng một model id có thể được chạy tiết kiệm hoặc chạy cẩn thận mà không cần thay đổi bất cứ điều gì khác.

• Tokenizer — tokenizer mới hơn được dùng chung với Claude 4.7 và các phiên bản sau, loại tokenizer “tạo ra lượng token nhiều hơn khoảng 30% cho cùng một văn bản.” Tài liệu của Anthropic cho biết mức tăng chính xác phụ thuộc vào nội dung và dạng thức khối lượng công việc.

• Vòng đời — thời điểm cắt kiến thức là tháng 6 năm 2026, và cam kết ngừng hoạt động là "không sớm hơn ngày 7 tháng 10 năm 2027".

• Tính khả dụng — Claude API, Amazon Web Services, Goo​gle Cloud, Microsoft Azure và Claude Platform trên AWS, tất cả cùng một lúc ngay từ ngày đầu tiên.

Nhãn dán 10x và thực tế 75%

Rẻ hơn mười lần là con số sẽ lan xa nhất, và cũng là con số dễ bị đặt sai chỗ nhất trong mô hình ngân sách của ai đó. Nó áp dụng cho các prompt tối đa 100.000 token. Haiku 5.5 không giữ mức giá đó cho toàn bộ cửa sổ.

• Lên đến 100.000 token — 0,10 đô la cho đầu vào và 0,50 đô la cho đầu ra, so với 1 đô la và 5 đô la của Haiku 4.5. Đó là mức giảm 90%, và Anthropic nói rằng 90% yêu cầu gửi đến mô hình Haiku trước đó nằm trong khoảng này.

• Hơn 100.000 token — 0,50 USD đầu vào và 2,50 USD đầu ra. Vẫn đúng bằng một nửa mức mà Haiku 4.5 đã tính, trên cùng một yêu cầu, không có mức trần nào phải chạm.

• Tokenizer — cùng một đoạn văn bản sẽ tạo ra nhiều token hơn khoảng 30% so với trên Haiku 4.5, nên mức cắt giảm trên mỗi token không chuyển đổi theo tỷ lệ một-một thành hóa đơn nhỏ hơn.

• Con số trung bình của chính nhà cung cấp — Anthropic mô tả sự kết hợp này là “chi phí chạy thấp hơn khoảng 75%”. Đó là con số của họ, không phải một phép đo độc lập, và đó là con số nên đưa vào dự báo.

• Kinh tế học bộ nhớ đệm — lượt đọc bộ nhớ đệm giảm từ $0.10 xuống $0.01 mỗi triệu trong dải phổ biến, điều này quan trọng hơn mức giá đầu vào đối với bất kỳ pipeline nào gửi lại một tiền tố dùng chung dài.

Con số 75% cũng giải thích điều mà nếu không thì người đọc có thể coi là một mâu thuẫn. Hai con số chủ đạo không hề xung đột; một con số là tỷ lệ trên một dạng yêu cầu, con số kia là ước tính pha trộn trên một hỗn hợp lưu lượng thực tế bao gồm nhóm thiểu số trên 100K và các token thêm của tokenizer. Nếu bạn đang mô hình hóa chi phí, hãy dùng 75% và kiểm tra phân bố độ dài prompt của chính mình trước khi bạn tin rằng sẽ tốt hơn.

Video khẳng định điều gì, và điều gì thì không

Đoạn clip là thật, lời nhắc được trích dẫn nguyên văn ở trên, và dấu thời gian — 19:49 UTC ngày 7 tháng 10, gần như cùng ngày mô hình ra mắt — có thể kiểm chứng được. Việc ghi công thuộc về một người dùng cá nhân, không phải Anthropic.

Sự phân biệt đó quan trọng ở đây, bởi vì trang sản phẩm riêng của Anthropic cho Claude Haiku 5.5 không có video nhúng nào cả: không có trình phát, không có tệp media, chỉ có một liên kết đến kênh YouTube của công ty. Nếu một phim ra mắt đã được tạo bằng mô hình này, thì nhà cung cấp chưa nói như vậy. Vậy nên phát biểu chính xác là hẹp: một người dùng báo cáo rằng đã tạo một video ra mắt chỉ trong một lần thử với Claude Haiku 5.5, và công bố prompt. Việc đó có phải chỉ một lần thử hay không, tốn bao nhiêu, và bao nhiêu phần của nó còn sót lại sau khi chỉnh sửa đều là những tuyên bố từ một nguồn duy nhất. Hãy coi clip đó như một minh họa, không phải như một thước đo chuẩn.

Lý do dù sao nó vẫn đáng nhắc đến là việc tạo video không nằm trong đặc tả của mô hình. Haiku 5.5 nhận văn bản và hình ảnh đầu vào rồi trả về văn bản. Một kết quả motion design ở chất lượng đó ngụ ý rằng mô hình đang điều khiển một thứ gì đó khác — một đường sinh mã, một pipeline kết xuất, một vòng lặp công cụ — chứ không phải tự tạo ra các khung hình. Đó là một nhận định về điều phối agentic ở mức đầu vào $0.10, và đó mới là phần thực sự đáng ngạc nhiên.

Những con số Anthropic đã công bố

Bảng ra mắt của nhà cung cấp là bảng so sánh trước–sau với Haiku 4.5, có GPT-6 Luna và Claude Sonnet 5.5 trong cùng các cột để làm thước đo quy mô. Mọi số liệu dưới đây là kết quả đánh giá do chính Anthropic báo cáo, chạy trên harness của Anthropic, và được sao chép lại nhưng không được xác minh độc lập.

A screenshot of Anthropic's Claude Haiku 5.5 launch page, dated October 7 2026 and headed with the model name, the identifier claude-haiku-5-5 and the launch standfirst, with the vendor's reported evaluation rows and pricing notes below.

• Công việc tri thức — GDPval-AA v2.1 đạt 1620 so với 735 của Haiku 4.5, 1437 của GPT-6 Luna và 1840 của Sonnet 5.5. AA-Briefcase v1.1 đạt 1578 so với 614, 1336 và 1824.

• Sử dụng máy tính — OSWorld 2.1 đạt 72,4% trên tập con ngoại tuyến, so với 15,7% của Haiku 4.5, 48,9% của GPT-6 Luna và 83,9% của Sonnet 5.5.

• Suy luận đa lĩnh vực — Humanity's Last Exam đạt 45,9% khi không dùng công cụ và 57,4% khi có công cụ, so với 10,2% và 18,7% của Haiku 4.5.

• Lập trình tác tử — Terminal-Bench 4.0 đạt 39,2% so với 0,0%, 16,4% và 70,6%. FrontierCode 1.1 (Main) đạt 46,4% so với 42,4% của GPT-6 Luna và 52,1% của Sonnet 5.5.

• Suy luận thị giác — Chartography đạt 46,4% khi không dùng công cụ, so với 6,4%, 29,1% và 61,6%.

Anthropic cũng đặc biệt thẳng thắn về việc phân khúc nhỏ không chiếm ưu thế ở đâu. Bình luận của chính họ trên biểu đồ Terminal-Bench nói rằng Sonnet 5.5 và Opus 5.5 “vẫn là lựa chọn tốt hơn cho các tác vụ lập trình agentic phức tạp”, đồng thời định vị Haiku 5.5 cho công việc nén, tóm tắt và tác nhân phụ thay vào đó. Những trích dẫn khách hàng trong bài viết chỉ về cùng một hướng và mang cùng lưu ý — đây là các đối tác truy cập sớm mô tả đánh giá của chính họ, không phải kiểm toán: Asana báo cáo độ trễ thấp hơn trên 30% khi hoàn thành tác vụ và suy luận nhanh hơn tới 2,5 lần mỗi lượt tác nhân; HubSpot báo cáo 92,8% tính trung bình qua ba lần chạy trên một bộ cổng CRM; AlphaSense báo cáo 0,84 so với 0,76 trên 400 truy vấn trong một khối lượng công việc thực hiện khoảng 8 triệu lệnh gọi mỗi tuần; Box báo cáo cao hơn 11 điểm so với Haiku 4.5 với độ trễ chỉ bằng khoảng một nửa; Rogo mô tả một tác nhân phụ Haiku 5.5 trích xuất một dòng doanh thu phân khúc từ báo cáo 10-K; và Cognition báo cáo Devin Fusion đạt điểm FrontierCode 66,2 với Haiku 5.5 làm trợ thủ.

Hội đồng độc lập nói gì

Bảng của nhà cung cấp là của nhà cung cấp. Vị trí xếp hạng từ bên ngoài đầu tiên là con số hữu ích hơn cho bất kỳ ai đang quyết định liệu hạng đó đã dịch chuyển đủ xa để thay đổi một pipeline sản xuất hay chưa.

A screenshot of the Artificial Analysis model page for Claude Haiku 5.5 in its Max configuration, showing an Intelligence Index v4.3.2 score of 43.40 ranked second of 182 models, an output speed of 242 tokens per second, a cost of $0.21 per Intelligence Index task, and the evaluator's note that the model generated 440 million output tokens against a 100 million median and is very verbose.

Artificial Analysis cho Claude Haiku 5.5 điểm 43 trên Intelligence Index v4.3.2 của mình ở cấu hình Max của mô hình, xếp thứ hai trong số 182 mô hình trên bảng đó và cao hơn hẳn mức trung vị 13 của bảng. Cùng trang đó cũng đo được 242 token đầu ra mỗi giây — thứ chín trong số 182 — và chi phí 0,21 USD cho mỗi tác vụ Intelligence Index.

Có hai điều trên trang đó đáng giá hơn cả tiêu đề. Thứ nhất là tính dài dòng: khi đánh giá Index, Artificial Analysis ghi nhận 440 triệu token đầu ra, so với mức trung vị 100 triệu, và mô tả mô hình là "rất dài dòng". Giá niêm yết được tính theo từng token, nên một mô hình suy nghĩ dài dòng sẽ phải trả giá cho điều đó — đó chính xác là lý do vì sao con số chi phí mỗi tác vụ nằm ở mức 0,21 đô la thay vì gần bằng không, và vì sao việc cắt giảm 90% đầu vào không phải là toàn bộ câu chuyện. Thứ hai là thang bậc nỗ lực: cùng trang đó phơi bày các cấu hình từ Max xuống đến Low, và mặc định của Anthropic là medium, không phải max. Con số 43 trên bảng xếp hạng là đỉnh của thang bậc đó, chứ không phải thiết lập bạn nhận được nếu không làm gì cả.

Chạy ở bậc thấp hơn bậc mà bạn đã có thể gọi.

Claude Haiku 5.5 không có trong danh mục của OrcaRouter, và sẽ đáng để nói thẳng điều đó thay vì ngụ ý điều ngược lại: khoảng cách trong ngày ra mắt giữa việc một mô hình tồn tại và việc một mô hình có thể được định tuyến thường chỉ là vài ngày, và đôi khi lâu hơn.

Trên danh mục của Anthropic hôm nay có Claude Haiku 4.5, Claude Sonnet 5.5 và Claude Opus 5.5, mỗi mô hình đều theo đúng giá niêm yết của nhà cung cấp, chuyển nguyên xi với mức phụ thu 0%, nên bất kỳ đợt giảm giá nào Anthropic thực hiện đều đến phía chúng ta ngay trong ngày nó đến phía họ. Đó chính là cây cầu thực tế cho bất kỳ ai muốn thử mẫu subagent ngay lúc này: một cascade đưa những lượt xử lý thường nhật sang Haiku 4.5 và đẩy những lượt khó lên trên đã có thể chạy được ngay hôm nay dưới một khóa duy nhất và một SDK duy nhất, còn việc đổi chân nhỏ sang Haiku 5.5 về sau chỉ là thay model-id chứ không phải một cuộc di trú. Cơ chế tự động chuyển đổi dự phòng nằm bên dưới bất kể bạn chọn chân nào, nên một buổi chiều xấu trời của một nhà cung cấp đơn lẻ sẽ không kéo cả pipeline xuống theo.

Nếu bạn không muốn phải chờ đợi chút nào, mức giá đầu vào $0.10 tương tự đã được GPT-6 Luna chiếm giữ, mà chúng tôi có định tuyến, và giữ mức giá đó đến 272.000 token trước khi tăng lên.

Ai nên di chuyển, và ai không nên

Nếu khối lượng công việc của bạn là phân loại, trích xuất, định tuyến, nén hoặc tóm tắt ở quy mô lớn, và các prompt của bạn nằm dưới 100.000 token, thì trường hợp rất đơn giản: mức giá chỉ bằng một phần mười so với trước đây, cửa sổ rộng gấp năm lần, và núm điều chỉnh nỗ lực cho phép bạn đánh đổi theo hướng ngược lại khi một yêu cầu cần điều đó. Hãy dự trù thấp hơn khoảng 75% và bạn sẽ không bị bất ngờ.

Nếu các prompt của bạn thường xuyên vượt quá 100.000 token, thì bạn đang mua mức giảm 50% chứ không phải mức giảm 90%, và việc so sánh các lựa chọn cho ngữ cảnh sâu vẫn đáng để bỏ ra một buổi chiều — trên thị trường có một số mô hình ở mức bằng hoặc thấp hơn mức giá trên 100K của phân khúc này.

Và nếu bài đánh giá của bạn vẫn thất bại với loại công việc có dạng Terminal-Bench, thì đây không phải là mô hình khắc phục được điều đó; chính Anthropic nói vậy, và 39,2% so với 70,6% của Sonnet 5.5 là bằng chứng rõ ràng nhất trong bài viết. Tóm tắt trung thực về ngày 7 tháng 10 là mức sàn của trí tuệ hữu ích đã tụt xuống rất xa, còn mức trần thì không nhích lên chút nào.

So sánh trong bài viết này1

Phát hiện từ bài viết này · Benchmark: Artificial Analysis · cập nhật hằng ngày