
Muse Spark 1.2 so với Claude Haiku 4.5: Mức giá hỗn hợp giống hệt nhau, nhưng quan điểm trái ngược về tư duy
- metaMỚIMeta: Muse Spark 1.22026-08-0557Trí tuệ72Lập trình
- qwenMỚIQwen: Qwen3.8 Max2026-08-0358Trí tuệ72Lập trình
- deepseekMỚIDeepSeek: DeepSeek V4 Flash 07312026-07-3152Trí tuệ69Lập trình
- qwenMỚIQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 trên 1 triệu token · 1604 tok/s
- orcaMỚIOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463Trí tuệ78Lập trình
- googleGoogle: Gemini 3.6 Flash2026-07-2152Trí tuệ69Lập trình
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137Trí tuệ49Lập trình
- metaMeta: Muse Spark 1.12026-07-1653Trí tuệ71Lập trình
- kimiMoonshotAI: Kimi K32026-07-1560Trí tuệ76Lập trình
- openaiOpenAI: GPT-5.6 Luna2026-07-0952Trí tuệ71Lập trình
- openaiOpenAI: GPT-5.6 Terra2026-07-0957Trí tuệ77Lập trình
- openaiOpenAI: GPT-5.6 Sol2026-07-0961Trí tuệ77Lập trình
- grokxAI: Grok 4.52026-07-0856Trí tuệ72Lập trình
- tencentTencent: Hy32026-07-0642Trí tuệ59Lập trình
- obsidianQwen3.6 35B A3B Uncensored (Aggressive)2026-07-0232Trí tuệ42Lập trình
- obsidianGemma4 26B A4B Uncensored (Balanced)2026-07-0226Trí tuệ39Lập trình
- anthropicAnthropic: Claude Sonnet 52026-06-3055Trí tuệ72Lập trình
- klingKling: Kling 3.0 Turbo2026-06-1757Trí tuệ52Lập trình57Toán
- z-aiZ.ai: GLM 5.22026-06-1653Trí tuệ69Lập trình60Toán
Artificial Analysis prices Muse Spark 1.2 at $0.78 per million tokens blended and Claude Haiku 4.5 at $0.77. One cent apart, from two labs that agreed on nothing else. Meta's model cannot stop reasoning; Claude Haiku 4.5 only reasons when you ask it to. Meta gives you 1,048,576 tokens of context; Claude Haiku 4.5 gives you 200,000. Meta shipped this one on August 5, 2026 as a coding model with a terminal agent attached; Claude Haiku 4.5 shipped in October 2025 as the fast, cheap worker a bigger model tells what to do. Same price per token, entirely different machines.
That coincidence is the useful place to start a comparison, because it removes the variable people usually decide on and forces the question to be about shape instead. What follows uses independent numbers where they exist — Artificial Analysis for index scores and lab latency, OrcaRouter's own seven-day production telemetry for real-traffic latency — and flags vendor-reported figures as such, including one benchmark headline of the vendor's that has no third-party counterpart.
Đối chiếu thông số, từng chiều một.
• Price — Muse Spark 1.2 at $1.25 in / $4.25 out per million; Claude Haiku 4.5 at $1.00 in / $5.00 out. Meta is cheaper on input, Claude Haiku 4.5 on output.
• Cache — $0,15 mỗi triệu lần truy cập cache trên Muse Spark 1.2, giảm 88%; $0,10 mỗi triệu lần đọc cache trên Claude Haiku 4.5, giảm 90%, với phí ghi cache là $1,25.
• Ngữ cảnh — 1.048.576 token so với 200.000. Chênh lệch gấp 5,2 lần, và là khoảng cách lớn nhất giữa chúng.
• Đầu ra tối đa — Claude Haiku 4.5 công bố giới hạn 64.000 token; endpoint Muse Spark 1.2 không khai báo bất kỳ giới hạn độ dài hoàn thành tối đa nào, điều này đủ bất thường để cần kiểm tra thay vì giả định.
• Suy luận — bắt buộc trên Muse Spark 1.2, với năm mức độ nỗ lực từ tối thiểu đến xhigh và mặc định là trung bình; tùy chọn trên Claude Haiku 4.5, vốn là mô hình không suy luận cho đến khi bạn bật chế độ suy luận mở rộng và cung cấp ngân sách suy luận cho nó.
• Inputs — Meta advertises text, images, video, audio and PDF; Claude Haiku 4.5 takes text and images. Both return text.
• Weights and providers — both closed. Muse Spark 1.2 is served only by Meta's own Model API; Claude Haiku 4.5 is available from the vendor and through the usual cloud resellers and aggregators.
• Tuổi — Muse Spark 1.2 mới chỉ vài ngày tuổi. Claude Haiku 4.5 đã hoạt động trong sản xuất từ ngày 15 tháng 10 năm 2025, với mốc cắt kiến thức tháng 7 năm 2025 và chín tháng kinh nghiệm thực tế tích lũy đằng sau.
Khoảng cách chỉ số là có thật. Còn con số mà mọi người sẽ trích dẫn thì không.

Artificial Analysis chấm Muse Spark 1.2 đạt 54 trên Chỉ số Trí tuệ của họ, xếp hạng #13/185. Mục nhập hiện tại của họ cho Claude Haiku 4.5 là 24. Đặt hai con số đó cạnh nhau là bạn có một tiêu đề giật tít; nhưng nhìn vào những gì các mục nhập thực sự là, tiêu đề đó sụp đổ.
Con số 54 là Muse Spark 1.2 được đánh giá ở mức xhigh, cấu hình suy luận đắt nhất của nó. Con số 24 là Claude Haiku 4.5 được đánh giá như một mô hình không suy luận — tắt suy nghĩ — và Artificial Analysis gắn cờ đó là ước tính chứ không phải một lần chạy hoàn chỉnh. Trên một phiên bản trước của cùng chỉ số đó, trước khi điều chỉnh lại trọng số v4.1, Artificial Analysis đặt Claude Haiku 4.5 ở mức 55 khi bật suy luận và 42 khi không bật. Những con số cũ đó cũng không thể so sánh với 54, vì các phiên bản chỉ số được thang đo lại và điểm số thời v3 không phải là điểm số v4.1.
Vì vậy, tuyên bố trung thực hẹp hơn so với những gì bảng xếp hạng thể hiện: Muse Spark 1.2 ở mức nỗ lực tối đa đạt 54 điểm trên chỉ số hiện tại; chưa có điểm v4.1 nào được công bố cho Claude Haiku 4.5 khi bật suy luận mở rộng, nên chưa có sự so sánh cùng điều kiện nào giữa hai mô hình này ở mức nỗ lực tối đa. Bất kỳ ai cho bạn xem 54 so với 24 là đang so sánh một mô hình suy luận đầy đủ với một mô hình được yêu cầu không suy luận.
Where the vendor has published a number, it is a specific one: Claude Haiku 4.5 scores 73.3% on SWE-bench Verified, averaged over 50 trials with a 128K thinking budget. That is a vendor figure, and the thinking budget in it is enormous for a model marketed on speed — but it is the same evaluation the industry quotes for frontier models, and it puts Haiku in a bracket its price does not suggest. Meta's counterpart claims for Muse Spark 1.2 are Terminal-Bench 2.1 at 82.9% and DeepSWE v1.1 at 59.3%, also vendor-run, on Meta's own harness with each competitor paired to its own agent product. Two vendors, two benchmarks, no overlap. There is currently no single evaluation on which both of these models have a published score from the same evaluator.
Bốn con số độ trễ, hai câu chuyện khác nhau

Độ trễ là nơi mà cách đóng khung "cùng mức giá" không còn chỉ là điều gây tò mò mà bắt đầu trở thành một quyết định, và cũng là nơi mà nguồn đo lường đóng vai trò quan trọng nhất.
Trong bộ công cụ benchmark, Artificial Analysis ghi nhận thời gian đến token đầu tiên là 26,12 giây cho Muse Spark 1.2 ở mức xhigh, và 1,00 giây cho Claude Haiku 4.5. Khoảng cách gấp 26 lần, và nếu mọi chuyện chỉ có vậy thì cuộc so sánh đã kết thúc.
Trong môi trường production thì điều này đảo ngược. Qua bảy ngày lưu lượng thực tế trên OrcaRouter — người gọi sử dụng mức độ nỗ lực tùy ý họ muốn — Claude Haiku 4.5 cho thấy p50 thời gian đến token đầu tiên là 3,84 giây và p95 là 10,00 giây, với 214 token mỗi giây và tỷ lệ lỗi 1,0%. Muse Spark 1.1, phiên bản mô hình của Meta có trong danh mục, cho thấy p50 là 1,84 giây và p95 là 6,00 giây, với 519 token mỗi giây và không ghi nhận lỗi nào. Trên lưu lượng thực tế, mô hình Meta là mô hình nhanh hơn.
Cả hai bộ số đều đúng và chúng đo lường những thứ khác nhau. Con số trong phòng thí nghiệm là từng mô hình ở mức suy luận tối đa với bộ nhớ đệm lạnh — đây là bài kiểm tra công bằng cho trần hiệu năng nhưng lại là bài kiểm tra kém cho một hộp trò chuyện. Con số trong sản xuất bao gồm các lượt truy cập bộ nhớ đệm, prompt ngắn, mức nỗ lực thấp và mọi thứ khác mà ứng dụng thực tế thực hiện — đây là bài kiểm tra công bằng cho giá trị trung vị nhưng hoàn toàn không kiểm tra được trường hợp xấu nhất. Cái bẫy là trích dẫn con số này để suy luận về con số kia. Nếu bạn đang định cỡ thời gian chờ hướng tới người dùng, p95 là con số của bạn. Nếu bạn đang hỏi một bước tác tử sâu tốn bao nhiêu thời gian thực tế, con số benchmark gần với sự thật hơn — và lời cảnh báo trung thực là vẫn chưa có con số sản xuất nào cho Muse Spark 1.2, vì nó quá mới và chưa được định tuyến rộng rãi.
Cả hai phòng thí nghiệm đều bán cho bạn một subagent. Chúng có ý nghĩa khác nhau.
The vendor's pitch for Claude Haiku 4.5 was explicit about hierarchy: Sonnet-class models plan and orchestrate, Haiku instances execute in parallel underneath. Cheap, fast, disposable, many at once. The product design follows — a 200K window is plenty for a scoped subtask and deliberately not enough for a whole repository, thinking is off by default because a worker that deliberates is a worker that costs orchestrator money, and the vendor's own marketing names real-time chat, customer service and pair programming as the target.
Lời giới thiệu của Meta về Muse Spark 1.2 khẳng định cả hai đầu của cùng một hệ thống phân cấp. Nội dung quảng bá của Meta cho biết mô hình có thể là tác nhân chính thu thập ngữ cảnh, lập kế hoạch và phân công, hoặc là một tác nhân phụ chạy song song bên dưới một tác nhân chính. Muse Code, tác nhân đầu cuối ra mắt cùng với nó, điều phối nhiều tác nhân phụ thường trực cho mỗi nhiệm vụ trong các worktree cô lập, trên một runtime nhật ký sự kiện có khả năng phát lại chính xác. Cửa sổ triệu token và khả năng lập luận thường trực là những gì một tác nhân lập kế hoạch cần; chúng chính xác là điều bạn sẽ không chọn cho một tác nhân fan-out, vì mỗi instance song song đều phải trả chi phí cho sự cân nhắc mà bạn không yêu cầu.
Read as architecture rather than marketing, that is the real difference: the vendor built a worker and expects you to bring an orchestrator; Meta built an orchestrator and claims it can also work. If you already run a hierarchy, the interesting experiment is not choosing between them — it is Muse Spark 1.2 planning and Claude Haiku 4.5 executing, which is a shape neither vendor will sell you as a package.
Một bước thực sự có giá bao nhiêu trên mỗi
Các mức giá trên mỗi triệu token chẳng quyết định được gì với các mô hình suy luận, vì mô hình tự quyết định sẽ dùng bao nhiêu token. Thay vào đó, hãy định giá theo bước.
Hãy xét một tác vụ mã có phạm vi giới hạn: 60,000 token ngữ cảnh kho lưu trữ đầu vào, 3,000 token bản vá đầu ra. Ở trạng thái nguội, Claude Haiku 4.5 tốn $0.060 cho đầu vào cộng $0.015 cho đầu ra — 7.5 xu. Muse Spark 1.2 tốn $0.075 cộng $0.013 — 8.8 xu. Đủ gần để coi là nhiễu, đúng như mức giá kết hợp đã hứa.
Now add the thing the blended rate hides. Muse Spark 1.2 cannot turn reasoning off, and at its default medium setting a step like this plausibly emits a few thousand reasoning tokens before the patch — they bill as output. Add 3,000 and the same step is $0.075 + $0.026 = 10.1 cents, about 35% above Haiku on identical inputs. Claude Haiku 4.5 with thinking off pays nothing for deliberation and stays at 7.5 cents; with a large thinking budget it will exceed Muse Spark 1.2, because Claude Haiku 4.5 charges $5.00 per million output against Meta's $4.25.
Việc lưu vào bộ nhớ đệm lại đảo ngược trọng tâm một lần nữa. Giữ ngữ cảnh kho lưu trữ ổn định để đạt được cache hit, và chi phí đầu vào của Haiku giảm xuống $0.006 còn của Muse Spark 1.2 xuống $0.009 — phía đầu vào hoàn toàn không còn quan trọng, và toàn bộ sự so sánh trở thành cuộc chiến về token đầu ra, tức là cuộc chiến về việc mỗi mô hình suy nghĩ bao nhiêu. Với khối lượng công việc lặp lại ngữ cảnh, độ ổn định của cache-key có giá trị hơn việc lựa chọn mô hình, và điều đó đúng với cả hai mô hình này.
The 1M window is the one place the arithmetic is not close. Anything that genuinely needs more than 200,000 tokens in a single call cannot be run on Claude Haiku 4.5 at any price. You either chunk and orchestrate — which is what the vendor intends — or you use a model with the room.
Thử cả hai mà không cần hợp đồng thứ hai.

Claude Haiku 4.5 is in the OrcaRouter catalog at $1.00 and $5.00 — the vendor's list price, because OrcaRouter runs 0% markup and passes provider pricing through untouched, which also means a vendor price change is live on our side the same day rather than at the next contract cycle. The production latency figures above come from that same routing layer.
Muse Spark 1.2 không có trong danh mục. {{1}}Model API của Meta hiện là nơi duy nhất có thể gọi nó, nên một cuộc so tài trực diện thực sự ngày hôm nay có nghĩa là một tích hợp qua chúng tôi và một tích hợp trực tiếp với Meta.{{/1}} Muse Spark 1.1 được lưu trữ, với mức giá ${{2}}1.25{{/2}} và ${{3}}4.25{{/3}} giống hệt mức Meta tính cho phiên bản 1.2, điều này khiến nó trở thành một lựa chọn thay thế hợp lý về đặc điểm chi phí và độ trễ của dòng sản phẩm này, nhưng không phải cho những cải tiến về lập trình mà 1.2 được bán dựa trên. Khi 1.2 có thể định tuyến được, việc so sánh chỉ còn là thay đổi chuỗi mô hình một dòng với cùng một khóa — và đối với thử nghiệm orchestrator-plus-worker được mô tả ở trên, {{4}}DSL định tuyến là cách bạn kết nối một bộ lập kế hoạch và một worker phân luồng vào một lệnh gọi duy nhất thay vì tự xây dựng cơ chế bàn giao.{{/4}}
Chọn theo hình thức của công việc, không phải theo điểm số.
Chọn Claude Haiku 4.5 khi công việc có phạm vi giới hạn và người dùng đang chờ đợi. Hỗ trợ các tác nhân, phân loại, trích xuất, trò chuyện, hoàn thành lập trình cặp và tầng công nhân song song trong hệ phân cấp tác nhân. Đây là một lựa chọn đã được biết đến với chín tháng lịch sử triển khai thực tế, chế độ suy luận là tùy chọn nên bạn chỉ trả phí khi muốn cân nhắc, và 200K là đủ cho hầu hết mọi tác vụ con có phạm vi xác định. Kết quả SWE-bench Verified được công bố của nó cho thấy năng lực vượt trội hơn nhiều so với mức giá, miễn là bạn sẵn sàng chi ngân sách suy luận mà kết quả đó đã sử dụng.
Hãy chọn Muse Spark 1.2 khi đơn vị công việc là một kho lưu trữ thay vì một yêu cầu. Tái cấu trúc nhiều tệp tin, gỡ lỗi kéo dài, tạo toàn bộ dự án, các vòng lặp tác nhân dài hạn mà không ai theo dõi vòng xoay tải. Cửa sổ triệu token loại bỏ vấn đề phân đoạn mà Haiku không thể giải quyết ở bất kỳ mức giá nào, và cơ chế suy luận bắt buộc vốn làm hỏng trải nghiệm trò chuyện lại là lựa chọn mặc định đúng đắn khi một kế hoạch sai tốn kém hơn một kế hoạch chậm.
What should decide it is not the index number. Ask two questions instead: does a single call ever need to see more than 200,000 tokens, and is there a human waiting on the first token? Yes to the first points at Meta. Yes to the second points at the vendor. Yes to both means you want two models, which is the honest answer more often than either vendor's marketing admits.
So sánh trong bài viết này1
Phát hiện từ bài viết này · Benchmark: Artificial Analysis · cập nhật hằng ngày
