Một thẻ hero có tiêu đề 'Ngang tài ngang sức ở mức 0.32828', với Claude Haiku 5.5 và GLM 5.3 Flash ở hai bên con số, một hàng ghi Terminal Bench 4.0 0.32828, một hàng Index ghi 43.40 so với 41.81, và phụ đề 'Cùng một con số, những cỗ máy khác nhau'.
Guides & Insights

Claude Haiku 5.5 vs GLM 5.3 Flash: Ngang ngửa trên benchmark mà cả hai nhà cung cấp đều trích dẫn

Tác giả

Rowan Sterling

Ngày đăng

Mô hình mới nhất · 20Xem tất cả mô hình →
Benchmark: Artificial Analysis · cập nhật hằng ngày
Quay lại tất cả bài viết

Run Claude Haiku 5.5 and GLM 5.3 Flash through Terminal Bench 4.0 and you get the same number: 0.32828 for both. Not close — identical, to five decimal places, on the benchmark that the vendor leads with in its own launch materials and that Z.ai's launch materials lead with too. For two models built on entirely different stacks, by vendors in different countries, released six weeks apart, that is a coincidence worth stopping on.

Đó cũng là con số sai để đưa ra quyết định. Hai mô hình tách biệt rõ rệt ở mọi khía cạnh khác, và kiểu tách biệt đó đủ bất thường để thay đổi cách bạn đọc những tuyên bố nổi bật của cả hai nhà cung cấp. Một mô hình thắng chỉ số tổng hợp và con số chi phí trên mỗi tác vụ. Mô hình còn lại thắng gần như mọi thứ trông giống một triển khai thực tế.

Chúng không được phân tách bởi khả năng. Chúng được phân tách bởi hình dạng.

Hãy bắt đầu với con số duy nhất nói rằng "đây là cùng một lớp mô hình."

• SciCode — 0.5498 cho Claude Haiku 5.5 so với 0.5162 của GLM 5.3 Flash. Hai điểm cho Anthropic, trên một benchmark mà hai điểm chỉ là nhiễu.

• Terminal Bench 4.0 — 0.32828 so với 0.32828. Hòa, chính xác.

• Cửa sổ ngữ cảnh — một triệu token cho cả hai.

• Giá đầu ra, bậc đầu tiên — $0.50 cho mỗi triệu token, áp dụng cho cả hai.

Bốn hàng, bốn kết quả gần như trùng khớp. Nếu bạn dừng lại ở đây, bạn sẽ kết luận rằng những mô hình này có thể thay thế cho nhau và chọn theo giá. Kết luận đó sẽ là sai, và bộ hàng tiếp theo chính là lý do.

Ở những điểm chúng khác biệt, hướng đi vẫn nhất quán

Những hàng thực sự phân tách chúng không hề nằm rải rác. Chúng tụ lại thành hai nhóm, và mỗi mô hình sở hữu trọn vẹn một nhóm.

Nhóm agentic thuộc về GLM 5.3 Flash.Điểm một phần của AutomationBench ghi nhận 0.6037 cho GLM 5.3 Flash so với 0.3541 cho Claude Haiku 5.5 — khoảng cách 25 điểm, mức khác biệt đơn lẻ lớn nhất giữa hai mô hình này trên mọi phép đo chung. Tau-Bench Banking ghi nhận 0.4722 cho GLM 5.3 Flash; Claude Haiku 5.5 không có số liệu công bố ở hàng đó. GPQA ghi nhận 0.9121 cho GLM 5.3 Flash; một lần nữa không có số liệu của Anthropic để so sánh. Trên các phép đo về việc liệu một mô hình có thể duy trì một tác vụ nhiều bước và sử dụng công cụ một cách đáng tin cậy trong một lĩnh vực có cấu trúc hay không, mô hình của Z.ai đang dẫn trước với khoảng cách lấn át mức chênh lệch chỉ số tổng hợp theo hướng ngược lại.

Nhóm tổng hợp và chi phí thuộc về Claude Haiku 5.5.Chỉ số Trí tuệ Artificial Analysis v4.3.2 ghi nhận 43,40 so với 41,81 — 1,59 điểm, và là con số mà mọi bản tóm tắt về màn đối đầu này đều trích dẫn. Chi phí cho mỗi tác vụ Index hoàn thành ghi nhận 0,21 USD so với 0,25 USD. Thời gian thực tế cho mỗi tác vụ Index ghi nhận 424,6 giây so với 1.035,4 giây: mô hình của Anthropic hoàn thành trong chưa đầy một nửa thời gian.

Đó là hình hài của sự lựa chọn. Claude Haiku 5.5 nhanh hơn, rẻ hơn cho mỗi công việc đã hoàn thành, và cao hơn trên tổng thể. GLM 5.3 Flash đáng tin cậy hơn ở đúng nhóm công việc cụ thể mà người ta mua các mô hình rẻ để xử lý.

A two-column scoreboard titled 'Claude Haiku 5.5 vs GLM 5.3 Flash - the scoreboard' with rows Terminal Bench 4.0 0.32828 against 0.32828, SciCode 0.5498 against 0.5162, Humanity's Last Exam 0.4439 against 0.3985, AutomationBench 0.3541 against 0.6037, Index v4.3.2 43.40 against 41.81 and cost per task $0.21 against $0.25, footed 'Both figures per Artificial Analysis v4.3.2; Terminal Bench 4.0 is an exact tie.'

Đâu là điều đáng tin?

Không cái nào, tự thân nó — và chính sự bất đồng đó là thông tin.

Intelligence Index là một kết hợp có trọng số giữa các hạng mục suy luận, khoa học, lập trình và agentic. Nó được thiết kế để trả lời “mô hình này có năng lực đại khái đến đâu” bằng một con số duy nhất, và nó làm tốt việc đó. Điều nó không thể làm là cho bạn biết liệu mức dẫn trước 1,59 điểm đến từ những hạng mục mà khối lượng công việc của bạn nằm trong đó hay từ những hạng mục mà nó không bao giờ chạm tới. Ở đây, mức dẫn trước đến phần lớn từ những dòng như SciCode và Humanity's Last Exam — 0,5498 so với 0,5162, và 0,4439 so với 0,3985 — trong khi mức thiếu hụt 25 điểm nằm ở AutomationBench với dấu ngược lại.

Một nhóm đang xây dựng trợ lý lập trình trên vòng lặp terminal sẽ nhận ra lợi thế của SciCode. Một nhóm đang xây dựng tác tử phải hoàn thành trọn vẹn một quy trình ngân hàng từ đầu đến cuối sẽ nhận ra khoảng trống của AutomationBench, và họ sẽ nhận ra điều đó mỗi ngày. Hai nhóm này đang nhìn vào cùng một bộ chỉ số và lẽ ra phải đi đến những kết luận trái ngược nhau.

Cách làm thực tế là đọc chỉ số tổng hợp như một bộ lọc thay vì một bảng xếp hạng. Nếu hai mô hình nằm trong khoảng hai điểm chỉ số, chỉ số tổng hợp đã cho bạn biết chúng ở cùng một nhóm và không cho bạn biết nên chọn cái nào. Vào thời điểm đó, những hàng duy nhất đáng đọc là những hàng phù hợp với khối lượng công việc của bạn — và nếu một nhà cung cấp chưa công bố một hàng mà bạn cần, thì sự vắng mặt đó tự nó là một điểm dữ liệu, không phải là một khoảng trống để lấp đầy bằng giả định.

Dòng tokenizer mà chẳng ai đưa vào bảng so sánh

Tài liệu của chính Anthropic có một câu làm thay đổi mọi so sánh giá liên quan đến Claude Haiku 5.5, và rất dễ đọc lướt qua câu đó. Mô hình này sử dụng tokenizer mới hơn, dùng chung với Claude 4.7 và các phiên bản sau, vốn đếm cùng một đoạn văn bản thành lượng token nhiều hơn khoảng 30% so với mô hình mà nó thay thế.

Đặt điều đó bên cạnh bảng giá và phép tính trở nên kém hấp dẫn hơn so với mức giá niêm yết gợi ý. Giá đầu vào của Claude Haiku 5.5 là $0.10 mỗi triệu token, so với $0.15 của GLM 5.3 Flash — một lợi thế 1,5×. Nếu cần thêm 30% token cho cùng một prompt, lợi thế hiệu dụng trên cùng một đoạn văn bản sẽ thu hẹp đáng kể, dù không biến mất. Giá đầu ra giống hệt nhau ở mức $0.50 trong bậc đầu tiên, nên hiệu ứng tokenizer vẫn áp dụng mà không có gì bù trừ ở đó.

Kết quả đo được là phiên bản trung thực của tuyên bố: theo cách tính của chính Artificial Analysis, Claude Haiku 5.5 tạo ra 162.164 token đầu ra cho mỗi tác vụ Index, so với 68.673 của GLM 5.3 Flash — gấp 2,4 lần — và vẫn cho kết quả $0,21 cho mỗi tác vụ đã hoàn thành so với $0,25. Lợi thế về đơn giá vẫn tồn tại bất chấp việc dài dòng, và phần còn lại của nó nhỏ hơn mức mà bảng giá nói.

Chỉ một trong hai mô hình này có mức giá được nêu ở dạng đồng giá. Giá của Claude Haiku 5.5 tăng bậc khi vượt qua 100.000 token prompt, lên $0.50 cho đầu vào và $2.50 cho đầu ra; GLM 5.3 Flash không công bố ngưỡng tương đương. Với hầu hết lưu lượng trò chuyện và hỗ trợ lập trình, bậc giá đó không bao giờ được áp dụng. Với công việc tác tử trên tài liệu dài hoặc ngữ cảnh lớn, nó liên tục được áp dụng, và khi đó, phép so sánh đảo ngược vượt xa mọi điều mà các con số ở bậc đầu tiên gợi ý.

A capture of Anthropic's models-overview documentation table headed 'Lifecycle and reference', listing Claude Fable 5.1, Claude Opus 5.5, Claude Sonnet 5.5 and Claude Haiku 5.5 with context windows, maximum outputs, prices per million tokens, latency and default effort, and showing Claude Haiku 5.5 as 'This model' at 1M context, 128K maximum output and 'From $0.10/$0.50'.

Lằn ranh quyết định điều đó trước khi bất kỳ con số nào làm được.

Mọi điều ở trên đều giả định rằng bạn có thể tự do lựa chọn giữa hai mô hình này. Một phần lớn các nhóm không thể làm được như vậy, và lý do nằm ở một dòng duy nhất trong bảng thông số kỹ thuật mà các cuộc thảo luận về benchmark thường chôn vùi.

GLM 5.3 Flash có trọng số mở, được phát hành theo giấy phép MIT, với tổng cộng 320 tỷ tham số, trong đó 18 tỷ tham số hoạt động. Nó có thể được tải xuống, tự lưu trữ, tinh chỉnh, lượng tử hóa, ghim vào một phiên bản và chạy bên trong một tenancy do bạn kiểm soát. Claude Haiku 5.5 là độc quyền và chỉ hỗ trợ API, không có số lượng tham số được công bố, không có giấy phép và không có kho lưu trữ.

Nếu tài liệu yêu cầu của bạn nói rằng mô hình phải chạy trên phần cứng của chính bạn, hoặc rằng một checkpoint cụ thể phải vẫn có thể gọi được trong ba năm tới, thì so sánh này kết thúc trước khi người ta đọc đến cột giá. Đó không phải là một tiểu tiết kỹ thuật. Đó là lý do phổ biến nhất khiến các đội ngũ rốt cuộc chọn một mô hình open-weights tầm trung, và đó là lý do lợi thế 25 điểm trên AutomationBench không phải là thứ duy nhất kéo về phía Z.ai.

Điều đó cũng đúng theo chiều ngược lại, và sự trung thực tương tự cũng được áp dụng. Anthropic công bố cam kết ngừng hỗ trợ đối với Claude Haiku 5.5 không sớm hơn tháng 10 năm 2027, và cung cấp mô hình trên một API first-party với thẻ hệ thống và một bộ đánh giá có tài liệu. Một bản phát hành trọng số mở không tự động bền vững hơn — bạn thừa hưởng gánh nặng vận hành cùng với trọng số, và một tệp giấy phép không phải là một hợp đồng hỗ trợ. Việc bạn muốn cái nào trong hai lựa chọn đó là câu hỏi về nhóm của bạn, không phải về các mô hình.

Cả hai phía trên cùng một phím, nếu bạn muốn giải quyết nó bằng thực nghiệm.

GLM 5.3 Flash có trong danh mục của OrcaRouter ở đúng mức giá niêm yết của Z.ai với 0% phụ phí, được chuyển thẳng nguyên mức giá thay vì gộp chung, vì vậy mức giá nêu trên chính là mức giá trên hóa đơn và mọi thay đổi mà Z.ai thực hiện đều đến phía chúng tôi ngay trong ngày. Claude Haiku 5.5 không có trong danh mục của chúng tôi — có thể truy cập qua API riêng của Anthropic — và nói rõ điều đó vẫn tốt hơn là để người đọc tự suy đoán.

Điều mà danh mục thực sự làm cho dễ dàng chính là dạng bài kiểm tra mà cuộc đối đầu này thực sự đòi hỏi. Sự bất đồng giữa chỉ số tổng hợp và các dòng agentic là một giả thuyết về của bạnkhối lượng công việc {{2}}của bạn{{/2}}, và cách duy nhất để giải quyết nó là chạy cả hai mô hình trên cùng một trace. Với GLM 5.3 Flash trên tuyến và một chặng Anthropic ở phía bên kia của cùng một gateway, điều đó trở thành một thay đổi cấu hình thay vì hai tích hợp — một API cho hơn 200 mô hình, một khóa, chuyển đổi dự phòng tự động bên dưới, và DSL định tuyến khi bạn muốn chia lưu lượng theo lớp tác vụ và đọc chi phí từ một hóa đơn duy nhất.

A capture of the OrcaRouter model page for GLM 5.3 Flash under z-ai/glm-5.3-flash, showing a 1M-token context window, 128K maximum output, text, image and video input, benchmarks published by Z.ai on 2026-08-26, the description of its 320B total and 18B active parameters, and a price strip of $0.15 input, $0.50 output and $0.030 cache read per million tokens.

Phán quyết, được nêu theo cách mà những con số ủng hộ

Nếu công việc của bạn là văn bản vào, văn bản ra, các prompt của bạn vẫn nằm trong bậc giá đầu tiên, và bạn đang trả tiền theo token cho khối lượng thực tế, thì Claude Haiku 5.5 là mô hình tốt hơn ở đây: điểm tổng hợp cao hơn, rẻ hơn cho mỗi tác vụ hoàn thành, và nhanh hơn gấp đôi trở lên cho mỗi tác vụ. Con số nổi bật của terminal-benchmark là huề và không nên được dùng để phân định bất cứ điều gì.

Nếu công việc của bạn là một tác nhân phải hoàn thành một quy trình nhiều bước mà không có giám sát, GLM 5.3 Flash dẫn đầu trên một chuẩn đánh giá chung đo lường chính xác điều đó, hơn 25 điểm, và nó là lựa chọn rẻ hơn trong hai để sửa đổi vì bạn có thể nắm giữ các trọng số.

Việc hòa nhau ở 0,32828 là hình ảnh đúng cho cặp này, nhưng không phải vì các mô hình ngang bằng nhau. Đó là hàng duy nhất mà hai mô hình gần như không có gì chung lại tình cờ rơi vào cùng một chữ số — và việc coi chữ số đó như một bản tóm tắt của phép so sánh chính là cách một quyết định mua sắm được đưa ra dựa trên con số ít thông tin nhất trong bảng.