Một thẻ tiêu đề được tạo cho 'Claude Haiku 5.5 vs Xiaomi MiMo-V2.6-Flash', với hai tên mô hình ở hai bên dấu phân cách và chú thích 'Rẻ hơn trên mỗi token, rẻ hơn trên mỗi tác vụ, và vẫn không phải là cùng một quyết định', nằm trên chân trang 'Bảng giá do nhà cung cấp công bố; chi phí tác vụ theo Artificial Analysis.' Logo OrcaRouter thật được ghép ở góc dưới bên phải.
Guides & Insights

Claude Haiku 5.5 vs Xiaomi MiMo-V2.6-Flash: Khi bảng giá và hóa đơn thực đo không khớp nhau

Tác giả

Magnus Corvin

Ngày đăng

Mô hình mới nhất · 20Xem tất cả mô hình →
Benchmark: Artificial Analysis · cập nhật hằng ngày
Quay lại tất cả bài viết

Cứ nhìn thẳng vào hai bảng giá, thì Claude Haiku 5.5 so với X​iaomi MiMo-V2.6-Flash trông như một chiến thắng áp đảo dành cho mô hình X​iaomi: 0,14 USD và 0,28 USD mỗi triệu token so với 0,10 USD và 0,50 USD, lợi thế 1,8 lần ở đầu ra trên mức giá cố định thay vì mức giá tăng bậc sau 100.000 token. Rồi hãy nhìn vào chi phí thực tế của các lần chạy tác vụ độc lập, và thứ tự đảo ngược — MiMo-V2.6-Flash chỉ tốn 0,06231 USD để hoàn thành một tác vụ mà Haiku hoàn thành với 0,2128 USD, vậy mà Haiku lại đạt điểm cao hơn 15% trên cùng bảng xếp hạng và hoàn thành tác vụ chỉ trong một phần ba thời gian thực. Không phát biểu nào trong bốn phát biểu đó là sai; chúng đang đo những thứ khác nhau. Bài viết này bàn về việc phát biểu nào trong số đó dự báo hóa đơn của bạn, và mỗi phát biểu ngừng hữu ích ở đâu.

Hai bảng giá

Hãy bắt đầu với những con số mà mỗi nhà cung cấp công bố, vì đó là những con số được đem ra so sánh và phần lớn chúng không phải là những con số thực sự quan trọng:

• Giá — Claude Haiku 5.5 $0.10 / $0.50 mỗi triệu token dưới 100K, $0.50 / $2.50 trên (bảng giá của Anthropic); Xiaomi MiMo-V2.6-Flash $0.14 / $0.28 cố định (bảng giá của nhà cung cấp)

• Cửa sổ ngữ cảnh — 1.000.000 token cho Claude Haiku 5.5, 1.000.000 cho MiMo-V2.6-Flash, cả hai đều do nhà cung cấp công bố

• Đầu ra tối đa — 128.000 token trên Haiku (300.000 trên Batch); không được công bố như một giới hạn riêng cho MiMo-V2.6-Flash

• Kiến trúc — không được tiết lộ đối với Haiku; tổng 309 tỷ tham số với 15 tỷ tham số hoạt động, Mixture-of-Experts, đối với MiMo-V2.6-Flash (do nhà cung cấp công bố)

• Giấy phép — mã đóng và chỉ truy cập qua API đối với Haiku; MIT đối với MiMo-V2.6-Flash (do nhà cung cấp công bố)

• Chỉ số độc lập — 43.395 cho Claude Haiku 5.5 so với 37.884 của MiMo-V2.6-Flash (Artificial Analysis)

Ba trong số những dòng đó quyết định phần lớn các giao dịch mua thực tế, và chúng chỉ về ba hướng khác nhau. Về giá đầu ra, mô hình Xiaomi rẻ hơn — 0,28 USD so với 0,50 USD ở ngữ cảnh ngắn. Về giá đầu vào, Haiku rẻ hơn dưới 100.000 token và đắt hơn nhiều ở trên mức đó. Về cửa sổ ngữ cảnh, mô hình Xiaomi tuyên bố có dung lượng gấp đôi. Chỉ một trong ba điều đó — điều cuối cùng — mới thực sự là một tuyên bố về năng lực, và bước giá cố định của Haiku tại 100.000 token nghĩa là việc so sánh giá có một mối nối mà một cặp con số duy nhất che giấu.

A generated two-column scoreboard titled 'Claude Haiku 5.5 vs Xiaomi MiMo-V2.6-Flash — the scoreboard'. Left column Claude Haiku 5.5: input price (short) $0.10 per million, output price (short) $0.50 per million, context window 1,000,000 tokens, weights closed and API-only, cost per task $0.2128, seconds per task 426. Right column Xiaomi MiMo-V2.6-Flash: input price (flat) $0.14 per million, output price (flat) $0.28 per million, context window 1,000,000 tokens, weights open under MIT, cost per task $0.0623, seconds per task 1,320. Footer reads 'Task costs and timings per Artificial Analysis; prices vendor-published.' The real OrcaRouter logo is composited bottom-right.

Hóa đơn đã được đo lường

Bảng giá niêm yết giá theo token. Công việc tốn tiền. Artificial Analysis chạy cả hai mô hình qua cùng một bộ tác vụ và công bố chi phí thực tế để hoàn thành từng tác vụ, một đại lượng khác với giá trên mỗi token và thường cho ra một xếp hạng khác:

• Chi phí mỗi tác vụ — MiMo-V2.6-Flash $0.06231 so với Claude Haiku 5.5 $0.2128

• Token đầu ra mỗi tác vụ — MiMo-V2.6-Flash 77.792 so với Claude Haiku 5.5 162.164

• Thời gian thực tế mỗi tác vụ — MiMo-V2.6-Flash 1.320,08 giây so với Claude Haiku 5.5 426,26 giây

• Chỉ số Trí tuệ — Claude Haiku 5.5 43.395 so với MiMo-V2.6-Flash 37.884

• Terminal-Bench Hard — Claude Haiku 5.5 0.329 so với MiMo-V2.6-Flash 0.227

Cả năm số liệu đều là của Artificial Analysis, được lấy từ chính các trang mô hình của bảng xếp hạng vào đầu tháng 10 năm 2026, và chúng là những con số cần dùng khi một quyết định phải trụ được khi có người kiểm tra lại.

Khoảng cách chi phí trên mỗi tác vụ lớn hơn mức mà bảng giá gợi ra, và lý do nằm ở dòng thứ hai. Claude Haiku 5.5 tiêu tốn 162.164 token đầu ra để hoàn thành một tác vụ mà MiMo-V2.6-Flash chỉ mất 77.792 token — gấp khoảng 2,1 lần số token, phần lớn là vì mặc định nó suy luận dài dòng. Một mô hình rẻ hơn 1,8 lần trên mỗi token đầu ra và phát ra chưa bằng một nửa số token đó cho mỗi tác vụ thì không chỉ rẻ hơn 1,8 lần; trên bộ kiểm thử cụ thể này, nó rẻ hơn gần một bậc độ lớn. Đó là điều quan trọng nhất trên trang này, và không có bảng giá nào ở đâu công bố điều đó.

Đường thời gian thực lại chạy theo hướng ngược lại, và điều đó đáng để nói thẳng. MiMo-V2.6-Flash mất 1.320 giây cho mỗi tác vụ, so với 426 giây của Haiku — dài gấp ba lần, dù tốc độ đo được cao hơn là 56,69 token mỗi giây, bởi khả năng suy luận của Haiku không phải là nút thắt cổ chai trên bài này theo cách mà tốc độ token thô sẽ dự đoán. Nếu một khối lượng công việc bị giới hạn bởi độ trễ thay vì bị giới hạn bởi chi phí, thì mô hình rẻ không tự động là lựa chọn đúng, và bảng độc lập là nơi duy nhất mà một trong hai con số này tồn tại.

A screenshot of the Artificial Analysis model page for MiMo-V2.6-Flash, marked 'Open weights model' and 'Released September 2026', showing its Intelligence Index rank of #8 of 117, a speed measured at 56.7 output tokens per second, and the comparison summary.

Nơi mười lăm điểm thực sự nằm

43.395 so với 37.884 là khoảng cách mười lăm phần trăm trên Intelligence Index, và đây là lập luận mạnh nhất cho Haiku trong màn đối đầu này. Việc điều đó có quan trọng hay không phụ thuộc hoàn toàn vào tác vụ. Trên Terminal-Bench Hard, hai mô hình đạt 0.329 và 0.227 — một khoảng cách tương đối rộng hơn, và nằm ở phía agentic, nhiều bước của bảng, nơi mức chênh lệch chỉ số mười lăm phần trăm có xu hướng nhân lên thành khác biệt lớn hơn nhiều trong việc hoàn thành tác vụ. Trên các bài đánh giá con về suy luận tổng quát và kiến thức, hai mô hình gần nhau hơn mức chỉ số tiêu đề gợi ý, và MiMo-V2.6-Flash đang dẫn trước ở một số bài trong đó.

Cách hiểu thực tế: ở đáy đường cong độ khó, hai mô hình có thể hoán đổi cho nhau và chênh lệch chi phí nên là yếu tố quyết định. Ở phía trên — các agent tầm xa, cơ sở mã, bất cứ thứ gì mà một tác vụ thất bại phải được chạy lại — mười lăm điểm của Haiku là sự khác biệt giữa một tác vụ hoàn thành và một tác vụ ngốn cùng số tiền hai lần, và lợi thế chi phí trên mỗi tác vụ của mô hình rẻ có thể đảo chiều theo cách mà mức trung bình trên bảng xếp hạng không thể cho bạn thấy. Đây là trường hợp bạn phải tự chạy đánh giá của mình thay vì đọc chỉ số của người khác, vì không mức trung bình được công bố nào giải quyết được điều đó.

Giấy phép MIT đáng giá bao nhiêu

MiMo-V2.6-Flash được phát hành theo giấy phép MIT — giấy phép ít hạn chế nhất trong số các giấy phép mở, không có giới hạn trần về mục đích thương mại và không có điều khoản chia sẻ tương tự. Đó là một sự cấp phép mạnh hơn Giấy phép Cộng đồng Qwen và điều đó có nghĩa là trọng số MoE 309B/15B có thể được tự lưu trữ, tinh chỉnh và phân phối lại bởi bất kỳ ai muốn làm vậy. Đối với một đội mà ràng buộc của họ là suy luận diễn ra trên phần cứng của chính họ, hoặc có khối lượng đủ lớn đến mức sở hữu GPU lợi hơn thuê token, đây không phải là một chú thích nhỏ — đó là dòng duy nhất trong bảng so sánh thực sự quan trọng, bởi vì Claude Haiku 5.5 hoàn toàn không thể do bạn chạy.

Nó cũng thay đổi hồ sơ lỗi. Một mô hình đóng được cung cấp bởi một nhà cung cấp và các đối tác đám mây của nhà cung cấp đó sẽ ngừng hoạt động khi họ ngừng hoạt động; một mô hình theo giấy phép MIT với nhiều máy chủ độc lập có thể được chuyển đổi dự phòng giữa chúng, miễn là có thứ gì đó thực hiện việc chuyển đổi dự phòng. Cả hai điều này đều không phải là lý do để chọn MiMo-V2.6-Flash cho một nhóm chỉ muốn một API và không gì khác. Cả hai đều mang tính quyết định đối với một nhóm không như vậy.

Những tuyên bố của nhà cung cấp đáng để bạn tự mình kiểm chứng

Dòng MiMo là của Xiaomi, và Xiaomi công bố các số liệu về tốc độ và chất lượng của riêng mình trong tài liệu ra mắt. Đó là những con số của nhà cung cấp, chưa được tái lập vào thời điểm viết bài, và bảng xếp hạng độc lập hiện đo mô hình thấp hơn vị trí mà cách định khung của nhà cung cấp sẽ đặt nó — 37,884 trên chỉ số, và 0,227 trên Terminal-Bench Hard so với 0,329 của Haiku. Đó không phải là lời cáo buộc điều gì; đó là khoảng cách bình thường giữa bộ đánh giá của chính nhà cung cấp và của bên thứ ba, và đó là lý do cần ghi rõ cái nào là cái nào mỗi khi một con số được nhắc lại.

Phép kiểm tra đáng làm trên lưu lượng của riêng bạn chỉ tốn một buổi chiều và giải quyết câu hỏi tốt hơn bất kỳ bảng chỉ số nào. Hãy chạy cùng hai mươi tác vụ qua cả hai mô hình bằng prompt của riêng bạn, ghi lại token đầu vào, token đầu ra và thời gian thực cho mỗi tác vụ ở từng mô hình, rồi nhân với mức giá ở trên. Bốn con số quyết định điều đó đều là những thứ bạn có thể đo được: token vào, token ra, số giây và liệu tác vụ có thành công hay không. Con số chi phí mỗi tác vụ trên bảng độc lập là bức tranh cho một bộ tác vụ chung; của bạn sẽ khác, và khác biệt giữa hai bên thường là độ dài dòng, đúng thứ mà bảng giá che giấu. Nếu việc Haiku mặc định suy luận đang mang lại cho bạn những lần hoàn thành tác vụ mà nếu không bạn sẽ phải trả tiền để thử lại, thì nó vẫn rẻ ở mức giá gấp 3,4 lần chi phí mỗi tác vụ. Nếu không, bạn đang trả tiền cho những token không làm thay đổi câu trả lời.

Lấy cả hai thông qua một endpoint

Cả Claude Haiku 5.5 lẫn Xiaomi MiMo-V2.6-Flash đều không được OrcaRouter phục vụ — với những mô hình đó, API riêng của nhà cung cấp và một số nền tảng bên thứ ba là nơi để có được chúng. Thứ mà chúng tôi thực sự vận hành là dàn phụ xung quanh: qwen/qwen3.8-flash với mức $0.15 và $0.47 mỗi triệu token và z-ai/glm-5.3-flash với mức $0.15 và $0.50, cả hai đều theo giá niêm yết của nhà cung cấp, trên cùng một key và cùng một hóa đơn như một danh mục hơn 200 mô hình với giá chuyển tiếp và tự động chuyển đổi dự phòng.

Điều đó quan trọng với cuộc so găng này theo một cách cụ thể: khi hai mô hình mà bạn đang cân nhắc là những mô hình bạn không thể định tuyến, yếu tố phân định thường được quyết định bằng cách chạy chúng song song trên lưu lượng thật — nghĩa là giữ chúng sẵn có bên cạnh những mô hình bạn định tuyến, mà không cần hợp đồng thứ hai hay SDK thứ hai cho bất kỳ mô hình nào. Đặt ứng viên lên đường đi production với một mô hình đang hoạt động phía sau làm phương án dự phòng, để yêu cầu đi đến bất kỳ mô hình nào mà lớp định tuyến chọn, và để nhật ký token của chính bạn tạo ra con số chi phí trên mỗi tác vụ mà bảng giá đã từ chối cung cấp cho bạn. Bộ kiểm thử của hội đồng độc lập chỉ là đại diện; khối lượng công việc của bạn mới là phép đo.

A screenshot of the OrcaRouter models index, headed 'Models — 207 models' with the line '16 providers: one API key, one bill', a filter row for input modalities, context length, input price, status, series and supported parameters, and the first steps of the 'How to call any model' walkthrough.

Cuộc gọi

Nếu khối lượng công việc lớn, đầu ra ngắn và chấp nhận được việc thỉnh thoảng phải thử lại, Xiaomi MiMo-V2.6-Flash là mô hình rẻ hơn với mức chênh lệch lớn hơn mức mà bảng giá của nó quảng cáo — 0,06231 USD mỗi tác vụ so với 0,2128 USD — và giấy phép MIT mang lại cho bạn một lối thoát mà Haiku không có. Nếu khối lượng công việc có tầm nhìn dài hạn và mang tính tác tử, mười lăm điểm chỉ số cùng tốc độ hoàn thành tác vụ nhanh gấp ba lần của Claude Haiku 5.5 xứng đáng với mức giá cao gấp bội, và khoảng cách chi phí sẽ thu hẹp hoặc đảo chiều khi tính đến các lần thử lại.

Điều duy nhất không nên làm là chỉ chọn dựa trên bảng giá. Hai mô hình ở đây có mức giá chênh nhau trong khoảng gấp đôi trên mỗi token nhưng lại cách nhau cả một bậc độ lớn trên mỗi tác vụ hoàn thành, và chỉ một trong những con số đó nằm trên trang mà nhà cung cấp cho bạn xem.

danh mục hơn 200 mẫu

So sánh trong bài viết này1

Phát hiện từ bài viết này · Benchmark: Artificial Analysis · cập nhật hằng ngày