
Claude Haiku 5.5 Nhắm vào Phân khúc Flash của Trung Quốc. Chỉ một nửa tuyên bố đó đứng vững trước sự soi xét.
- openaiMỚIOpenAI: GPT-6.1 Sol2026-09-2952Trí tuệ
- anthropicMỚIAnthropic: Claude Sonnet 5.52026-09-2856Trí tuệ
- typesafeMỚITypeSafe: Jev 1.132026-09-24$0.04 / $0.00 trên 1 triệu token · 128 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238Trí tuệ
- OpenAIOpenAI: GPT-6 Sol2026-09-2248Trí tuệ
- AnthropicAnthropic: Claude Opus 5.52026-09-2258Trí tuệ
- xAIGrok 4.72026-09-2146Trí tuệ
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 trên 1 triệu token · 60 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 trên 1 triệu token · 320 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Trí tuệ
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Trí tuệ77Lập trình
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Trí tuệ76Lập trình
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Trí tuệ76Lập trình
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Trí tuệ82Lập trình
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 trên 1 triệu token · 54 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 trên 1 triệu token · 356 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Trí tuệ72Lập trình
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 trên 1 triệu token · 232 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Trí tuệ75Lập trình
- obsidianQwen3.8 27B2026-08-1534Trí tuệ68Lập trình
Một độc giả viết bằng tiếng Trung đã đưa ra một lập luận sắc bén trong tuần này: Claude Haiku 5.5 trông như được tạo ra để chiếm lĩnh thị trường Trung Quốc tầm trung, bởi nó có giá thấp hơn DeepSeek V4.1 Flash và GLM 5.3 Flash, đồng thời đạt điểm cao hơn GLM 5.3 Flash trên Terminal Bench 4.0 và Chỉ số Trí tuệ Artificial Analysis. Đó là một cách lý giải sắc sảo hơn hầu hết các bài bình luận về màn ra mắt. Đó cũng là hai tuyên bố khoác chung một chiếc áo, và chúng không mang cùng mức độ đúng đắn.
Anthropic đã phát hành Claude Haiku 5.5 vào ngày 7 tháng 10 năm 2026 — một đợt ra mắt công khai trọn vẹn với thông báo có ghi ngày cụ thể, một system card và một bảng giá được công bố. Điều đó mang lại cho tuyên bố này một thứ mà các bài bình luận thị trường thứ cấp hiếm khi có được: những con số bạn có thể kiểm chứng.
Bản đánh giá dưới đây cho thấy một nửa mạnh hơn so với điều độc giả nói, còn nửa kia sai ở tiêu chuẩn cụ thể mà nó trích dẫn. Cả hai phát hiện đều đáng để biết, vì chúng chỉ về hai hướng trái ngược nhau.
Tuyên bố, được phát biểu một cách chính xác
Bóc tách thành các phần, lập luận này có ba phần.
• Giá cả — Claude Haiku 5.5 rẻ hơn DeepSeek V4.1 Flash và rẻ hơn GLM 5.3 Flash.
• Điểm số độc lập — nó cao hơn khoảng một điểm so với GLM 5.3 Flash trên Artificial Analysis Intelligence Index.
• Điểm chuẩn lập trình — nó cũng đạt điểm cao hơn GLM 5.3 Flash một điểm trên Terminal Bench 4.0.
Hai trong số đó có thể kiểm chứng dựa trên các bảng đã công bố và vẫn đứng vững, với một vài điều chỉnh. Cái thứ ba cũng có thể kiểm chứng dựa trên cùng bảng đó nhưng lại cho ra kết quả khác với mô tả.

Phần về giá: đúng, và bị nói giảm ở một hướng, còn bị nói quá ở hướng khác.
Mức giá công bố của Anthropic cho Claude Haiku 5.5 là 0,10 USD cho mỗi triệu token đầu vào và 0,50 USD cho mỗi triệu token đầu ra đối với prompt tối đa 100.000 token, tăng lên 0,50 USD và 2,50 USD khi vượt ngưỡng đó. Đọc đầu vào đã lưu đệm có giá 0,01 USD và ghi là 0,125 USD. Cửa sổ ngữ cảnh là một triệu token; đầu ra tối đa là 128.000.
GLM 5.3 Flash, từ Z.ai, được niêm yết ở mức $0.15 và $0.50, với đầu vào được lưu trong bộ nhớ đệm ở mức $0.026. DeepSeek V4.1 Flash được niêm yết ở mức $0.30 và $1.20, với đầu vào được lưu trong bộ nhớ đệm ở mức $0.006.
Về mức giá được nêu trên tiêu đề, người đọc đã đúng. Mức giá đầu vào $0.10 thấp hơn GLM 5.3 Flash một phần ba và thấp hơn DeepSeek V4.1 Flash hai phần ba, còn mức giá đầu ra $0.50 khớp chính xác với GLM 5.3 Flash trong khi thấp hơn đáng kể so với một nửa của DeepSeek. Đó có vẻ là một sự định vị có chủ đích: ngang bằng đầu ra với đối thủ rẻ hơn, vượt trội ở đầu vào, và để tỷ lệ tự nói lên tất cả.
Điểm khiến tuyên bố này khả quan hơn nằm ở chi phí đo được cho mỗi tác vụ hoàn thành. Trên Intelligence Index v4.3.2 của Artificial Analysis, tổng chi phí là 0,21 USD cho Claude Haiku 5.5, 0,25 USD cho GLM 5.3 Flash và 0,27 USD cho DeepSeek V4.1 Flash. Bảng giá cho biết Claude Haiku 5.5 rẻ hơn GLM 5.3 Flash 1,5 lần ở đầu vào; phép đo lại cho thấy chi phí cho một tác vụ hoàn thành rẻ hơn khoảng một phần sáu. Nó vẫn là mẫu rẻ nhất trong ba mẫu — chỉ là không đạt mức chênh lệch mà giá niêm yết ngụ ý.
Lý do là điều mà hầu hết các so sánh giá đều bỏ qua. Claude Haiku 5.5 dài dòng. Artificial Analysis ghi nhận 162.164 token đầu ra cho nó khi chạy Index, so với 68.673 của GLM 5.3 Flash và 88.574 của DeepSeek V4.1 Flash. Tài liệu của chính Anthropic bổ sung thêm một hiệu ứng thứ hai: mô hình dùng tokenizer mới hơn, dùng chung với Claude 4.7 và các phiên bản sau, nên cùng một đoạn văn bản được tính là nhiều hơn khoảng 30% token so với mô hình mà nó thay thế. Một mức giá rẻ hơn áp dụng cho nhiều token hơn là một mức giá rẻ hơn áp dụng cho nhiều token hơn.
Một điểm rắc rối chỉ xuất hiện trên hóa đơn định tuyến: danh mục của chính chúng tôi liệt kê DeepSeek V4.1 Flash ở mức 0,15 USD cho đầu vào và 0,60 USD cho đầu ra, với hệ số nhân 2× được áp dụng trong hai khung giờ mỗi ngày, 01:00–04:00 và 06:00–10:00 UTC. Mười tám giờ mỗi ngày, đó là mức giá cơ bản; sáu giờ mỗi ngày, mức giá đầu ra là 1,20 USD. Lưu lượng theo lô có thể được lên lịch tránh những khung giờ đó sẽ nhận được mức giá DeepSeek tốt hơn đáng kể so với mức giá niêm yết nổi bật của nhà cung cấp gợi ý, còn lưu lượng tương tác thì không. Nếu bạn đang mô hình hóa so sánh này một cách thực tế, thì lịch cũng quan trọng không kém bảng giá.

Phần điểm số: "khoảng một điểm" là 1.6
Trên Artificial Analysis Intelligence Index v4.3.2, Claude Haiku 5.5 được đo ở mức 43,40 trong cấu hình Max của nó. GLM 5.3 Flash được đo ở mức 41,81. DeepSeek V4.1 Flash ở mức 39,46.
Vậy nên nửa phần chỉ số của nhận định là đúng về hướng và làm tròn xuống: khoảng cách là 1,59 điểm, không phải một điểm. Đó là một lợi thế dẫn đầu thực sự trên một chỉ số có giá trị lên tới hàng sáu mươi, và đó là con số được trích dẫn trong mọi bản tóm tắt về cuộc đối đầu này.
Điều nó không phải là một tuyên bố về các benchmark bên dưới. Cả hai nhà cung cấp đều công bố bộ đánh giá của riêng mình, và chúng không phải là cùng những bộ giống nhau — Anthropic báo cáo GDPval-AA v2.1, OSWorld 2.1, Terminal-Bench 4.0 và FrontierCode cho Claude Haiku 5.5; Z.ai báo cáo bộ riêng của mình cho GLM 5.3 Flash. Bảng xếp hạng độc lập là hàng so sánh cùng chuẩn duy nhất hiện có, đó chính xác là lý do khoảng cách chỉ số được vin vào mạnh mẽ đến vậy và là lý do phần tiếp theo quan trọng.
Phần lập trình: cái này hòa hoàn toàn, không phải thắng.
Terminal Bench 4.0, trên phép đo độc lập dùng chung, cho kết quả 0.32828 đối với Claude Haiku 5.5 và 0.32828 đối với GLM 5.3 Flash. Giống hệt nhau đến năm chữ số thập phân.
Đó là con số đáng trích dẫn nhất trong màn so tài này, và tuyên bố về nó là sai. Nguồn gây nhầm lẫn khả dĩ là hàng bên cạnh: GLM-5.3 bản đầy đủ, người anh em không phải Flash, đạt 0.4192 trên cùng bộ benchmark. Nếu bạn từng thấy "GLM" và "Terminal Bench" trong cùng một câu bên cạnh một con số cao hơn Claude Haiku 5.5 một điểm, thì đó là phiên bản anh em, không phải Flash.
Ba hàng còn lại mà Artificial Analysis công bố cho cả hai mô hình thú vị hơn kết quả hòa, và chúng không cùng chỉ về một hướng:
• SciCode — 0.5498 cho Claude Haiku 5.5 so với 0.5162 cho GLM 5.3 Flash. Một lợi thế 3,4 điểm cho Anthropic.
• Humanity's Last Exam — 0.4439 so với 0.3985. Lợi thế 4,5 điểm cho Anthropic.
• AutomationBench, điểm số một phần — 0.3541 so với 0.6037. Lợi thế 25 điểm nghiêng về GLM 5.3 Flash, và đây là khoảng cách lớn nhất trong bộ này tính đến nay.
Hàng cuối cùng đó là hàng mà các đội ngũ thu mua sẽ quan tâm nhất, vì tự động hóa dạng tác nhân chính là nơi các mô hình tầm trung thực sự đang được triển khai. Ở một phép đo xem liệu mô hình có thể hoàn thành trọn vẹn một tác vụ gồm nhiều bước hay không, mô hình open-weights rẻ hơn khi vận hành thắng với cách biệt lớn hơn hẳn mức chênh lệch chỉ số 1,6 điểm ở chiều ngược lại.
Tốc độ cũng chia tách theo cùng cách mà giá cả chia tách, chỉ có phần rõ hơn mà thôi. Artificial Analysis đo được 424,6 giây cho mỗi tác vụ Index đối với Claude Haiku 5.5, so với 1035,4 giây đối với GLM 5.3 Flash. Mô hình của Anthropic đạt được kết quả trong chưa bằng một nửa thời gian thực, mà trên một vòng lặp agent thì đó là một con số vận hành lớn hơn tốc độ token.
Những gì mà tuyên bố bỏ qua hoàn toàn
Việc so sánh được đóng khung như một câu chuyện về giá và điểm số, điều này âm thầm bỏ qua khía cạnh mà hai mô hình ít giống nhau nhất. GLM 5.3 Flash có trọng số mở, được công bố theo giấy phép MIT, với tổng cộng 320 tỷ tham số và 18 tỷ tham số hoạt động. DeepSeek V4.1 Flash cũng có trọng số mở với tổng cộng 552 tỷ và 16 tỷ hoạt động. Claude Haiku 5.5 là độc quyền, chỉ dùng qua API, không có số lượng tham số được công bố và không có kho lưu trữ.
Đối với nhiều người mua, đó không phải là một chú thích cuối trang; đó là dòng đầu tiên của tài liệu yêu cầu. Một nhóm cần chạy suy luận trong tenancy riêng của mình, tinh chỉnh, hoặc giữ cố định một phiên bản mô hình trong nhiều năm thì hoàn toàn không lựa chọn giữa ba lựa chọn này dựa trên các điểm chỉ số — hai trong ba lựa chọn bị loại trước khi cột giá được đọc. Cách định khung của người đọc là một nhận định về định vị thị trường và đó là một nhận định hợp lý; chỉ có điều khác biệt về cấu trúc lại đi ngược với mô hình mà cách định khung đó đang bảo vệ.
Tự bạn chạy so sánh
GLM 5.3 Flash và DeepSeek V4.1 Flash đều có mặt trong danh mục của OrcaRouter ở mức giá niêm yết của nhà cung cấp với 0% phụ phí, điều này khiến phía Trung Quốc trong so sánh này trở thành thứ bạn có thể gọi ngay hôm nay thay vì phải mô phỏng trong bảng tính. Vì mức giá được chuyển thẳng thay vì cộng gộp, một thay đổi giá từ nhà cung cấp sẽ tác động đến phía chúng ta ngay trong cùng ngày nó tác động đến họ — và cửa sổ DeepSeek dựa trên lịch được mô tả ở trên hiển thị ngay trong chính khối giá mà bạn sẽ định tuyến dựa vào. Một khóa, một SDK, tự động chuyển đổi dự phòng bên dưới, cùng DSL định tuyến nếu bạn muốn thể hiện mức trần chi phí trong tuyến thay vì trong mã ứng dụng.
Claude Haiku 5.5 không có trong danh mục của chúng tôi. Nó có thể truy cập được thông qua API riêng của Anthropic, và tốt hơn là nên nói thẳng điều đó.

Người đọc đã hiểu đúng điều gì, và cần làm gì với điều đó
Trực giác ấy là đúng. Nếu bạn muốn làn sóng các mô hình tầm trung Trung Quốc giá rẻ mà vẫn đủ giỏi trông thật đắt đỏ, thì đây đại khái chính là nước cờ bạn sẽ đi: ngang bằng mức giá đầu ra của đối thủ rẻ hơn, giảm một nửa mức giá đầu vào, vượt lên trước 1,6 điểm chỉ số, và để con số chi phí cho mỗi tác vụ hoàn thành làm nên lập luận. Claude Haiku 5.5 làm được điều đó, và làm được trong khi nhanh hơn ít nhất gấp đôi tính theo mỗi tác vụ so với mô hình mà nó nhắm tới.
Điều mà người đọc hiểu sai thì hẹp hơn và thú vị hơn. Terminal Bench 4.0 không phải là một chiến thắng; đó là một thế hòa chính xác. Lợi thế về giá, một khi bạn tính phí cho toàn bộ công việc thay vì tính theo token, chỉ vào khoảng một phần sáu, chứ không phải 1.5× như bảng giá gợi ý. Và bài đánh giá duy nhất mà hai mô hình cách biệt nhau xa nhất chính là bài về tác tử, nơi GLM 5.3 Flash dẫn trước 25 điểm.
Vậy phiên bản trung thực của tuyên bố là thế này: Claude Haiku 5.5 nhắm đến phân khúc flash Trung Quốc, nó thắng trong so sánh đó ở chỉ số tổng hợp, ở chi phí cho mỗi tác vụ đã hoàn thành và ở độ trễ, nó không thắng ở tự động hóa agentic hay ở tính mở, và lợi thế benchmark lập trình cụ thể khiến lập luận có vẻ mang tính quyết định thì không hề tồn tại.
So sánh trong bài viết này2
Phát hiện từ bài viết này · Benchmark: Artificial Analysis · cập nhật hằng ngày
