Thẻ tiêu đề được tạo cho 'Claude Haiku 5.5 so với GLM-5.3-FlashX — trả gấp 2,5 lần cho cùng trọng số', hiển thị hai tên mô hình ở hai bên đường phân cách và chú thích 'Hai mô hình giá tầm trung, bốn bảng giá, một ngưỡng 100K', với chân trang 'Giá niêm yết của Anthropic và Z.ai, tháng 10 năm 2026.' Logo OrcaRouter thật được ghép ở góc dưới bên phải.
Guides & Insights

Claude Haiku 5.5 so với GLM-5.3-FlashX: Trả gấp 2,5 lần cho cùng một bộ trọng số, và liệu điều đó có đáng hay không

Tác giả

Gideon Frost

Ngày đăng

Mô hình mới nhất · 20Xem tất cả mô hình →
Benchmark: Artificial Analysis · cập nhật hằng ngày
Quay lại tất cả bài viết

Điều hữu ích nhất cần biết về GLM-5.3-FlashX trước khi so sánh nó với Claude Haiku 5.5 là nó chạy cùng bộ trọng số như GLM-5.3-Flash và chi phí gọi cao gấp 2,5 lần. Z​.ai đã ra mắt FlashX trên API riêng của mình vào ngày 18 tháng 9 năm 2026, ở mức 0,37 USD cho mỗi triệu token đầu vào và 1,25 USD cho mỗi triệu token đầu ra, so với 0,15 USD và 0,50 USD cho mô hình cơ sở mà nó được phát triển dựa trên. Không có gì về mô hình thay đổi; điều thay đổi là nơi nó chạy và tốc độ mà nó được hứa hẹn sẽ chạy tại đó. Hiểu được sự kết đôi đó chính là toàn bộ cốt lõi ở đây, bởi vì điều đó có nghĩa đây không phải là so sánh giữa hai mức năng lực — mà là so sánh giữa một bậc giá và một bậc phục vụ, và Haiku 5.5 lại nằm ngay giữa cuộc tranh luận đó từ một hướng hoàn toàn khác.

Hai mô hình, bốn mức giá, một ngưỡng

Xếp bốn bảng giá liên quan cạnh nhau và hình dạng của quyết định sẽ trở nên rõ ràng hơn so với bất kỳ cặp đơn lẻ nào:

• Claude Haiku 5.5, dưới 100.000 token — 0,10 USD cho đầu vào, 0,50 USD cho đầu ra mỗi triệu (bảng giá niêm yết của Anthropic)

• Claude Haiku 5.5, trên 100.000 token — 0,50 USD cho đầu vào, 2,50 USD cho đầu ra mỗi triệu (giá niêm yết của Anthropic)

• GLM-5.3-Flash — 0,15 đô la đầu vào, 0,50 đô la đầu ra mỗi triệu (danh sách Z​.ai)

• GLM-5.3-FlashX — $0,37 đầu vào, $1,25 đầu ra mỗi triệu (bảng giá Z​.ai)

• Ngữ cảnh — 1 triệu token trên cả bốn (do nhà cung cấp công bố)

• Trọng số mở — GLM-5.3-Flash và FlashX kế thừa trọng số được cấp phép MIT của mô hình cơ sở; Claude Haiku 5.5 là đóng (do nhà cung cấp công bố)

• Điểm số độc lập — GLM-5.3-Flash được đo ở mức 41.807 trên Chỉ số Trí tuệ Artificial Analysis; Claude Haiku 5.5 được đo ở mức 43.395 (Artificial Analysis)

Điều đầu tiên đáng chú ý là giá của FlashX gần như nằm chính xác ngay trên mức long-context của Claude Haiku 5.5 — 0,37 đô la so với 0,50 đô la ở đầu vào, 1,25 đô la so với 2,50 đô la ở đầu ra. Đó không phải là sự trùng hợp của thị trường; đó là mức giá mà một tầng phục vụ cao cấp có, khi mô hình nền tảng thuộc hạng trung và nhà cung cấp đang tính tiền theo thông lượng chứ không phải theo năng lực. Điều thứ hai là GLM-5.3-FlashX là phiên bản đắt tiền của một mô hình mà Haiku mới của Anthropic rẻ hơn ở ngữ cảnh ngắn và tương đương ở ngữ cảnh dài. Điều thứ ba là cả bốn con số đều nằm trong khoảng cách nhau chưa tới năm lần, một dải hẹp hơn nhiều so với cách đóng khung "mô hình rẻ so với mô hình đắt" mà hầu hết các so sánh đối đầu ngụ ý.

A generated two-column scoreboard titled 'Claude Haiku 5.5 vs GLM-5.3-FlashX — the scoreboard'. Left column Claude Haiku 5.5: input price (short) $0.10 per million, output price (short) $0.50 per million, input price (over 100K) $0.50 per million. Right column GLM-5.3-FlashX: input price $0.37 per million, output price $1.25 per million, and a serving-premium row. A footer labels the sources. The real OrcaRouter logo is composited bottom-right.

FlashX thực sự là gì

GLM-5.3-FlashX không phải là một mô hình mới. Nó là GLM-5.3-Flash được phục vụ trên hạ tầng riêng của Z.ai, được quảng cáo đạt tới 200 token đầu ra mỗi giây ở mức cao nhất, so với tốc độ đo được của mô hình cơ sở, và có giá bằng 2,5 lần giá niêm yết của mô hình cơ sở. Lời chào hàng của Z.ai rất thẳng thắn: cùng câu trả lời, nhiều hơn mỗi giây, và bạn trả tiền cho việc phục vụ thay vì cho trọng số. Đối với một khối lượng công việc bị ràng buộc bởi thông lượng — phân loại theo lô, trích xuất khối lượng lớn, bất cứ việc gì mà độ trễ là ràng buộc chứ không phải chi phí — thì đó là một thứ hợp lý để bán và một thứ hợp lý để mua.

Nó không phải là một nâng cấp về năng lực, và cách định giá phản ánh điều đó một cách trung thực: nếu FlashX là một mô hình tốt hơn, Z​.ai đã không thể thu phí riêng cho trọng số của mô hình cơ sở. Con số 2,5x là một khoản phụ phí phục vụ. Việc có đáng trả tiền hay không là câu hỏi về điểm nghẽn trong khối lượng công việc của bạn, và nó có câu trả lời khác nhau đối với một pipeline bị ràng buộc bởi độ trễ so với một pipeline bị ràng buộc bởi chi phí.

Artificial Analysis không có trang riêng cho FlashX tại thời điểm viết bài, và điều này đáng được nói thẳng ra thay vì che lấp: con số độc lập mà bảng xếp hạng công bố cho GLM-5.3-Flash — 41.807 trên Intelligence Index, 52.14 token đầu ra mỗi giây được đo, 0.328 trên Terminal-Bench Hard — là con số dành cho mô hình cơ sở, không phải cho phiên bản được phục vụ ở mức 2.5x. Tuyên bố thông lượng của chính nhà cung cấp cho FlashX là con số đỉnh và do nhà cung cấp tự báo cáo. Chưa có bên độc lập nào công bố thông lượng cho chính FlashX, nên bất kỳ so sánh nào giữa tốc độ đo được của Haiku 5.5 với tốc độ của FlashX cũng là so sánh với một con số do Z.ai cung cấp về chính hoạt động phục vụ của họ.

Hệ số nhân 2,5x của Z​.ai không phải là thứ duy nhất khiến FlashX trở nên đắt so với mức cơ sở của nó. Vì các trọng số cơ sở được cấp phép theo giấy phép MIT và được lưu trữ bởi các bên thứ ba, một tải công việc thực sự cần thông lượng lớn hơn mức mà endpoint của một nhà cung cấp đáp ứng thường có thể đạt được bằng cách dàn trải qua nhiều nhà cung cấp cùng các trọng số đó ở mức hoặc gần mức giá cơ sở, thay vì trả cho gói cao cấp của một nhà cung cấp. Đó là một phương án thay thế thực sự mà bảng giá FlashX đang phải cạnh tranh, và Z​.ai biết điều đó — có lẽ đó là lý do vì sao bài chào hàng dựa vào thông lượng đỉnh thay vì tính độc nhất.

A screenshot of Z.ai's documentation pricing page, showing the API pricing table for the GLM model line with per-million input and output rates, captured in English.

Nơi Haiku 5.5 và FlashX rẽ hướng

Hãy đặt hai phương án đối đầu với nhau trên những phương diện quyết định một khối lượng công việc thực tế, và sự phân định đủ rõ ràng để lựa chọn dựa trên đó:

• Giá trong ngữ cảnh dưới 100K — Haiku 5.5 $0.10 / $0.50 so với FlashX $0.37 / $1.25; Haiku thắng ở cả hai chiều

• Giá cho ngữ cảnh trên 100K — Haiku 5.5 $0.50 / $2.50 so với FlashX $0.37 / $1.25; FlashX thắng ở cả hai phía

• Thông lượng — mức đỉnh do nhà cung cấp công bố là 200 tok/s đối với FlashX, so với dịch vụ do Anthropic công bố cho Haiku 5.5, vốn không quảng cáo mức đỉnh kiểu đó

• Chỉ số độc lập — Haiku 5.5 43.395 so với GLM-5.3-Flash 41.807 (Artificial Analysis; không có số liệu độc lập cho chính FlashX)

• Trọng số — FlashX kế thừa các trọng số mở được cấp phép MIT; Haiku 5.5 là đóng và chỉ truy cập qua API

• Tự host — khả thi với FlashX thông qua trọng số mở; không khả thi với Haiku 5.5

• Bộ tính năng công cụ/tác nhân — nút điều chỉnh mức nỗ lực trên Haiku 5.5, không có trên dòng G​LM Flash

Ô đáng chú ý là ô thứ hai. Claude Haiku 5.5 là một mô hình rẻ hơn năm lần so với GLM-5.3-FlashX ở các yêu cầu ngắn và đắt hơn một chút so với nó ở các yêu cầu dài, bởi vì bảng giá của Haiku tăng gấp 5 lần tại mốc 100.000 token trong khi FlashX tính một mức giá cố định. Nếu lưu lượng của bạn chủ yếu là ngắn, Haiku là lựa chọn hiển nhiên chỉ xét về giá. Nếu lưu lượng chủ yếu là dài, FlashX hoàn toàn không cạnh tranh với mức giá bậc ngắn của Haiku — nó đang cạnh tranh với bậc dài của Haiku, và nó thắng trong so sánh đó với mức chênh khoảng một phần ba.

So sánh năng lực hóa ra lại sít sao hơn mức cả hai nhà cung cấp mong muốn. 41.807 so với 43.395 trên cùng một chỉ số độc lập là mức chênh lệch dưới bốn phần trăm, nằm gọn trong ngưỡng nhiễu của hầu hết các đánh giá ở cấp ứng dụng và quá nhỏ để tự nó có thể biện minh cho một lựa chọn. Không mô hình nào vượt trội hơn mô hình kia về khả năng suy luận tổng quát; quyết định được đưa ra dựa trên bảng giá và thông lượng, chứ không phải dựa trên việc mô hình nào thông minh hơn.

A screenshot of the Artificial Analysis model page for Claude Haiku 5.5, headlined 'Proprietary model — Released October 2026', showing an Intelligence Index of 43.395 and speed rank #10 of 182, with the cost comparison block reading $0.10 input.

Sự khác biệt về giấy phép là một sự khác biệt thực sự.

Việc FlashX vốn là mô hình trọng số mở quan trọng hơn khoảng cách giá ở một khía cạnh: nó có thể tự vận hành (self-hosted), và bất kỳ ai cũng có thể phục vụ nó. Claude Haiku 5.5 thì không thể làm được cả hai. Với một nhóm có yêu cầu tuân thủ rằng việc suy luận phải diễn ra trên phần cứng của chính họ, hoặc có đủ lưu lượng ổn định để việc khấu hao một GPU rẻ hơn so với trả tiền theo từng token, dòng G​LM là dòng duy nhất trong hai dòng thực sự trả lời được câu hỏi đó. Còn với tất cả những người khác — số đông, những người muốn có một mô hình đằng sau một API và không muốn tự chạy lớp phục vụ — thì giấy phép chỉ là một chú thích, còn giá mới là lý lẽ.

Điều đó cũng có nghĩa là hai mô hình có những kiểu hỏng hóc khác nhau khi một nhà cung cấp gặp ngày xấu. Một mô hình đóng chỉ được phục vụ bởi nhà cung cấp của nó và các đối tác đám mây của nhà cung cấp đó sẽ ngừng hoạt động khi những dịch vụ đó ngừng hoạt động. Một mô hình mở với nhiều máy chủ độc lập có thể được chuyển đổi dự phòng giữa chúng, miễn là có thứ gì đó đang đảm nhiệm việc chuyển đổi dự phòng. Đó là một khác biệt vận hành thực sự và là kiểu điều chỉ xuất hiện vào đúng ngày nó quan trọng.

Định tuyến cả hai mà không cần hợp đồng thứ hai

Nếu quyết định ở trên không thu gọn về một người thắng duy nhất cho lưu lượng của bạn — điều thường không xảy ra, vì hai mô hình thắng nhau ở hai nửa khác nhau của bảng giá — thì câu hỏi thực tế là làm sao chạy cả hai mà không phải duy trì hai tích hợp. OrcaRouter phục vụ z-ai/glm-5.3-flash ở mức $0,15 và $0,50 mỗi triệu theo giá niêm yết của nhà cung cấp, cùng với qwen/qwen3.8-flash và phần còn lại của danh mục hơn 200 mô hình, trên cùng một key và một hóa đơn. Một thay đổi giá từ A​nthropic đối với Claude Haiku 5.5, hay một thay đổi từ Z​.ai đối với dòng Flash, được chuyển tiếp với mức đánh dấu bằng không ngay trong cùng ngày thay vì chậm chân so với bảng giá riêng của nhà bán lại, nên những con số ở trên vẫn là những con số bạn thực sự trả.

Chúng tôi không cung cấp Claude Haiku 5.5 và cũng không cung cấp GLM-5.3-FlashX — cả hai đều không nằm trong danh mục của chúng tôi; với những model đó, hãy gọi trực tiếp cho A​nthropic và Z​.ai. Thứ chúng tôi cung cấp là GLM-5.3-Flash, model nền bên dưới FlashX, và đây là lựa chọn đúng đắn cho rất nhiều workload mà ở đó mức phụ trội phục vụ gấp 2,5 lần chỉ mua lấy thông lượng chẳng ai yêu cầu. Khi một luồng production thực sự phụ thuộc vào một trong hai model mà chúng tôi không host, cơ chế failover của chúng tôi chính là cách để thử nó mà không đặt cược toàn bộ luồng vào đó: trỏ request vào nó, giữ một model đang hoạt động làm phương án dự phòng, và để lớp routing quyết định model nào sẽ trả lời.

Chọn cái nào?

Với dưới 100.000 token mỗi yêu cầu, Claude Haiku 5.5 thắng về giá và đủ gần FlashX về năng lực đến mức lựa chọn trở nên rõ ràng. Trên 100.000 token, GLM-5.3-FlashX rẻ hơn bậc ngữ cảnh dài của Haiku 5.5 và là mô hình nên tìm đến nếu kích thước yêu cầu là thuộc tính của tác vụ chứ không phải điều bạn chọn — mặc dù GLM-5.3-Flash bản cơ sở vẫn rẻ hơn, và lý do duy nhất để trả mức gấp 2,5 lần là nếu bạn đặc biệt cần thông lượng được quảng cáo của FlashX.

Cách đóng khung cần gạt bỏ là việc cho rằng một trong hai là lựa chọn tiết kiệm và cái còn lại là lựa chọn hiệu năng. Cả hai đều là những mẫu tầm trung với bảng giá cố định, được công bố đầy đủ, và biến số đáng quan tâm không phải là cái nào tốt hơn mà là nửa lưu lượng nào của bạn thì mỗi bên rẻ hơn. Hãy lấy phân bố kích thước yêu cầu của bạn trước; bảng so sánh giá hai cột ở trên sẽ cho bạn biết phần còn lại.

danh mục hơn 200 mẫu

So sánh trong bài viết này1

Phát hiện từ bài viết này · Benchmark: Artificial Analysis · cập nhật hằng ngày