Muse Spark 1.2 เทียบกับ Claude Haiku 4.5: ราคาผสมที่เท่ากัน แต่แนวคิดเรื่องการคิดที่ตรงข้ามกัน
Guides & Insights

Muse Spark 1.2 เทียบกับ Claude Haiku 4.5: ราคาผสมที่เท่ากัน แต่แนวคิดเรื่องการคิดที่ตรงข้ามกัน

ผู้เขียน

Jim Song

วันที่เผยแพร่

โมเดลล่าสุด · 20ดูโมเดลทั้งหมด
เบนช์มาร์ก: Artificial Analysis · อัปเดตทุกวัน
กลับไปยังโพสต์ทั้งหมด

Artificial Analysis prices Muse Spark 1.2 at $0.78 per million tokens blended and Claude Haiku 4.5 at $0.77. One cent apart, from two labs that agreed on nothing else. Meta's model cannot stop reasoning; Claude Haiku 4.5 only reasons when you ask it to. Meta gives you 1,048,576 tokens of context; Claude Haiku 4.5 gives you 200,000. Meta shipped this one on August 5, 2026 as a coding model with a terminal agent attached; Claude Haiku 4.5 shipped in October 2025 as the fast, cheap worker a bigger model tells what to do. Same price per token, entirely different machines.

That coincidence is the useful place to start a comparison, because it removes the variable people usually decide on and forces the question to be about shape instead. What follows uses independent numbers where they exist — Artificial Analysis for index scores and lab latency, OrcaRouter's own seven-day production telemetry for real-traffic latency — and flags vendor-reported figures as such, including one benchmark headline of the vendor's that has no third-party counterpart.

ความแตกต่างของสเปก ทีละมิติ

Price — Muse Spark 1.2 at $1.25 in / $4.25 out per million; Claude Haiku 4.5 at $1.00 in / $5.00 out. Meta is cheaper on input, Claude Haiku 4.5 on output.

แคช — $0.15 ต่อล้านสำหรับการเข้าถึงแคชของ Muse Spark 1.2 ซึ่งเป็นส่วนลด 88%; $0.10 ต่อล้านสำหรับการอ่านแคชของ Claude Haiku 4.5 ซึ่งเป็นส่วนลด 90%, โดยการเขียนแคชคิดเป็น $1.25

บริบท — 1,048,576 โทเคนเทียบกับ 200,000 ซึ่งต่างกัน 5.2 เท่า และเป็นช่องว่างที่ใหญ่ที่สุดระหว่างทั้งสอง

เอาต์พุตสูงสุด — Claude Haiku 4.5 ระบุเพดานสูงสุดที่ 64,000 โทเคน; เอนด์พอยต์ Muse Spark 1.2 ระบุว่าไม่มีการจำกัดความยาวของผลลัพธ์สูงสุดเลย ซึ่งผิดปกติพอที่จะทดสอบมากกว่าจะคาดเดา

การให้เหตุผล — จำเป็นบน Muse Spark 1.2 โดยมีระดับความพยายามห้าระดับตั้งแต่ minimal ถึง xhigh และค่าเริ่มต้นคือ medium; ไม่บังคับบน Claude Haiku 4.5 ซึ่งเป็นโมเดลที่ไม่มีการให้เหตุผล จนกว่าคุณจะเปิด extended thinking และกำหนดงบประมาณการคิดให้

Inputs — Meta advertises text, images, video, audio and PDF; Claude Haiku 4.5 takes text and images. Both return text.

Weights and providers — both closed. Muse Spark 1.2 is served only by Meta's own Model API; Claude Haiku 4.5 is available from the vendor and through the usual cloud resellers and aggregators.

อายุ — Muse Spark 1.2 เพิ่งเปิดตัวได้ไม่กี่วัน Claude Haiku 4.5 อยู่ในระบบการผลิตจริงตั้งแต่วันที่ 15 ตุลาคม 2025 โดยมีจุดตัดความรู้เดือนกรกฎาคม 2025 และประสบการณ์ภาคสนามที่สั่งสมมาเก้าเดือนอยู่เบื้องหลัง

ช่องว่างของดัชนีมีจริง แต่ตัวเลขที่ทุกคนจะอ้างถึงนั้นไม่จริง

Artificial Analysis ให้คะแนน Muse Spark 1.2 อยู่ที่ 54 ในดัชนีความฉลาด (Intelligence Index) อยู่อันดับที่ #13 จากทั้งหมด 185 รายการ ส่วนรายการปัจจุบันของ Claude Haiku 4.5 อยู่ที่ 24 หากนำสองสิ่งนี้มาเทียบเคียงกันก็จะได้พาดหัวข่าว แต่เมื่อดูว่าจริงๆ แล้วรายการเหล่านั้นคืออะไร พาดหัวข่าวนั้นก็พังทลายลงทันที

54 คือ Muse Spark 1.2 ที่ประเมินที่ xhigh ซึ่งเป็นการตั้งค่าการใช้เหตุผลที่แพงที่สุด 24 คือ Claude Haiku 4.5 ที่ประเมินเป็นโมเดลที่ไม่ใช้เหตุผล — ปิดการคิด — และ Artificial Analysis ระบุว่ามันเป็นค่าประมาณ ไม่ใช่การรันที่สมบูรณ์ ในเวอร์ชันก่อนหน้าของดัชนีเดียวกัน ก่อนการปรับน้ำหนัก v4.1 Artificial Analysis ให้คะแนน Claude Haiku 4.5 อยู่ที่ 55 เมื่อเปิดใช้เหตุผล และ 42 เมื่อไม่เปิด ตัวเลขเก่าเหล่านั้นก็ไม่สามารถเทียบกับ 54 ได้เช่นกัน เพราะเวอร์ชันดัชนีมีการปรับสเกล และคะแนนในยุค v3 ไม่ใช่คะแนนแบบ v4.1

ดังนั้น คำกล่าวที่ตรงไปตรงมาก็แคบกว่าที่ลีดเดอร์บอร์ดทำให้ดูเหมือน: Muse Spark 1.2 เมื่อใช้ความพยายามสูงสุดได้คะแนน 54 บนดัชนีปัจจุบัน ยังไม่มีคะแนน v4.1 ที่เผยแพร่สำหรับ Claude Haiku 4.5 ที่เปิดใช้ extended thinking จึงยังไม่มีการเปรียบเทียบในเงื่อนไขเดียวกันระหว่างสองรุ่นนี้ที่ใช้ความพยายามเต็มที่ ใครก็ตามที่เอา 54 เทียบกับ 24 มาให้คุณดู กำลังเปรียบเทียบโมเดลที่ใช้การไตร่ตรองอย่างเต็มที่กับโมเดลที่ถูกบอกว่าไม่ต้องไตร่ตรอง

Where the vendor has published a number, it is a specific one: Claude Haiku 4.5 scores 73.3% on SWE-bench Verified, averaged over 50 trials with a 128K thinking budget. That is a vendor figure, and the thinking budget in it is enormous for a model marketed on speed — but it is the same evaluation the industry quotes for frontier models, and it puts Haiku in a bracket its price does not suggest. Meta's counterpart claims for Muse Spark 1.2 are Terminal-Bench 2.1 at 82.9% and DeepSWE v1.1 at 59.3%, also vendor-run, on Meta's own harness with each competitor paired to its own agent product. Two vendors, two benchmarks, no overlap. There is currently no single evaluation on which both of these models have a published score from the same evaluator.

ตัวเลขความหน่วงสี่ค่า เรื่องราวที่แตกต่างกันสองเรื่อง

ความหน่วงคือจุดที่กรอบแนวคิด "ราคาเดียวกัน" หยุดเป็นเพียงข้อน่าสนใจและกลายเป็นสิ่งที่ต้องตัดสินใจ และยังเป็นจุดที่แหล่งที่มาของการวัดผลมีความสำคัญที่สุดอีกด้วย

ในชุดทดสอบ benchmark นั้น Artificial Analysis บันทึกเวลาจนถึงโทเคนแรกเป็น 26.12 วินาทีสำหรับ Muse Spark 1.2 ที่ระดับ xhigh และ 1.00 วินาทีสำหรับ Claude Haiku 4.5 ช่องว่าง 26 เท่า และถ้านั่นคือภาพรวมทั้งหมด การเปรียบเทียบก็จบลง

ในสภาพแวดล้อมการผลิตจริง ผลลัพธ์กลับตรงกันข้าม จากปริมาณทราฟฟิกจริงเป็นเวลาเจ็ดวันบน OrcaRouter — ผู้เรียกใช้ที่ใช้ความพยายามตามที่ต้องการจริง ๆ — Claude Haiku 4.5 แสดงค่า p50 ของเวลาจนถึงโทเคนแรกที่ 3.84 วินาที และ p95 ที่ 10.00 วินาที ด้วยความเร็ว 214 โทเคนต่อวินาที และอัตราข้อผิดพลาด 1.0% ส่วน Muse Spark 1.1 ซึ่งเป็นเวอร์ชันของโมเดล Meta ที่อยู่ในแคตตาล็อก แสดงค่า p50 ที่ 1.84 วินาที และ p95 ที่ 6.00 วินาที ด้วยความเร็ว 519 โทเคนต่อวินาที โดยไม่มีการบันทึกข้อผิดพลาด บนทราฟฟิกสด โมเดลของ Meta เป็นตัวที่เร็วกว่า

ตัวเลขทั้งสองชุดต่างก็เป็นจริง และวัดสิ่งที่แตกต่างกัน ตัวเลขจากห้องแล็บคือแต่ละโมเดลที่ใช้การไตร่ตรองสูงสุดโดยมีแคชเย็น ซึ่งเป็นการทดสอบเพดานความสามารถอย่างเป็นธรรม แต่เป็นการทดสอบที่ไม่ดีสำหรับแชตบ็อกซ์ ตัวเลขจากการใช้งานจริงรวมถึงการชนแคช พรอมป์สั้น ระดับความพยายามต่ำ และสิ่งอื่น ๆ ทั้งหมดที่แอปพลิเคชันจริงทำ ซึ่งเป็นการทดสอบค่ามัธยฐานอย่างเป็นธรรม และไม่ได้ทดสอบกรณีเลวร้ายที่สุดเลย กับดักคือการอ้างอิงตัวเลขชุดหนึ่งแล้วใช้เหตุผลกับอีกชุดหนึ่ง หากคุณกำลังกำหนดไทม์เอาต์ที่ผู้ใช้เห็น p95 คือตัวเลขที่คุณควรใช้ หากคุณถามว่าขั้นตอนเอเจนต์เชิงลึกหนึ่งขั้นกินเวลาวอลล์คล็อกเท่าไร ตัวเลขเกณฑ์มาตรฐานจะใกล้เคียงความจริงมากกว่า — และข้อแม้ที่ตรงไปตรงมาก็คือ ยังไม่มีตัวเลขการใช้งานจริงสำหรับ Muse Spark 1.2 เอง เพราะมันใหม่เกินไปและยังไม่มีการใช้งานอย่างแพร่หลาย

ห้องแล็บทั้งสองขายซับเอเจนต์ให้คุณ พวกเขาหมายถึงสิ่งที่แตกต่างกัน

The vendor's pitch for Claude Haiku 4.5 was explicit about hierarchy: Sonnet-class models plan and orchestrate, Haiku instances execute in parallel underneath. Cheap, fast, disposable, many at once. The product design follows — a 200K window is plenty for a scoped subtask and deliberately not enough for a whole repository, thinking is off by default because a worker that deliberates is a worker that costs orchestrator money, and the vendor's own marketing names real-time chat, customer service and pair programming as the target.

การนำเสนอของ Meta สำหรับ Muse Spark 1.2 กล่าวอ้างถึงปลายทั้งสองด้านของลำดับชั้นเดียวกัน ข้อความของ Meta กล่าวว่าโมเดลสามารถเป็นตัวแทนหลักที่รวบรวมบริบท วางแผน และมอบหมายงาน หรือเป็นตัวแทนย่อยที่ทำงานแบบขนานภายใต้ตัวแทนหลักหนึ่งตัว Muse Code ตัวแทนปลายทางที่เปิดตัวพร้อมกับมัน ประสานงานกับตัวแทนย่อยถาวรหลายตัวต่อหนึ่งงานใน worktrees ที่แยกออกจากกัน บนรันไทม์ที่บันทึกเหตุการณ์แบบ replay-exact หน้าต่างโทเคนล้านโทเคนและการให้เหตุผลที่ทำงานตลอดเวลาคือสิ่งที่ผู้วางแผนต้องการ สิ่งเหล่านี้คือสิ่งที่คุณจะไม่เลือกสำหรับ worker แบบ fan-out เพราะทุกอินสแตนซ์แบบขนานต้องจ่ายสำหรับการไตร่ตรองที่คุณไม่ได้ขอ

Read as architecture rather than marketing, that is the real difference: the vendor built a worker and expects you to bring an orchestrator; Meta built an orchestrator and claims it can also work. If you already run a hierarchy, the interesting experiment is not choosing between them — it is Muse Spark 1.2 planning and Claude Haiku 4.5 executing, which is a shape neither vendor will sell you as a package.

ในแต่ละอย่าง หนึ่งขั้นตอนจริงมีค่าใช้จ่ายเท่าไร

อัตราต่อล้านไม่ได้ตัดสินอะไรในโมเดลเชิงเหตุผล เพราะโมเดลเป็นผู้เลือกว่าจะใช้โทเคนจำนวนเท่าใด ให้กำหนดราคาต่อขั้นตอนแทน

ลองพิจารณางานโค้ดที่มีขอบเขต: อินพุต 60,000 โทเคนจากบริบท repository, เอาต์พุต 3,000 โทเคนเป็นแพตช์ แบบ Cold, Claude Haiku 4.5 ราคาอินพุต $0.060 บวกเอาต์พุต $0.015 — 7.5 เซนต์. Muse Spark 1.2 ราคา $0.075 บวก $0.013 — 8.8 เซนต์. ใกล้เคียงจนถือเป็นความคลาดเคลื่อนเล็กน้อย ตรงตามอัตราเฉลี่ยที่ให้สัญญาไว้

Now add the thing the blended rate hides. Muse Spark 1.2 cannot turn reasoning off, and at its default medium setting a step like this plausibly emits a few thousand reasoning tokens before the patch — they bill as output. Add 3,000 and the same step is $0.075 + $0.026 = 10.1 cents, about 35% above Haiku on identical inputs. Claude Haiku 4.5 with thinking off pays nothing for deliberation and stays at 7.5 cents; with a large thinking budget it will exceed Muse Spark 1.2, because Claude Haiku 4.5 charges $5.00 per million output against Meta's $4.25.

การแคชพลิกจุดเน้นอีกครั้ง รักษาบริบทของ repository ให้คงที่เพื่อให้เข้าถึงแคชได้ และอินพุตของ Haiku ลดลงเหลือ $0.006 และของ Muse Spark 1.2 เหลือ $0.009 — ด้านอินพุตไม่มีความสำคัญอีกต่อไป และการเปรียบเทียบทั้งหมดกลายเป็นการแข่งขันเรื่อง output tokens ซึ่งเป็นการแข่งขันว่าแต่ละโมเดลคิดมากแค่ไหน ในงานที่ใช้บริบทซ้ำๆ ความเสถียรของ cache-key มีค่ามากกว่าการเลือกโมเดล และนั่นเป็นจริงสำหรับทั้งสองโมเดลนี้

The 1M window is the one place the arithmetic is not close. Anything that genuinely needs more than 200,000 tokens in a single call cannot be run on Claude Haiku 4.5 at any price. You either chunk and orchestrate — which is what the vendor intends — or you use a model with the room.

ลองทั้งสองแบบโดยไม่มีสัญญาที่สอง

Claude Haiku 4.5 is in the OrcaRouter catalog at $1.00 and $5.00 — the vendor's list price, because OrcaRouter runs 0% markup and passes provider pricing through untouched, which also means a vendor price change is live on our side the same day rather than at the next contract cycle. The production latency figures above come from that same routing layer.

Muse Spark 1.2 ไม่อยู่ในแคตตาล็อก ในปัจจุบัน Meta's Model API เป็นที่เดียวที่สามารถเรียกใช้งานได้ ดังนั้นการเปรียบเทียบแบบตัวต่อตัวที่แท้จริงในวันนี้จึงหมายถึงการผสานรวมหนึ่งช่องทางผ่านเรา และอีกหนึ่งช่องทางตรงกับ Meta Muse Spark 1.1 ถูกโฮสต์ไว้ในราคาเท่ากันที่ $1.25 และ $4.25 ซึ่งเป็นราคาที่ Meta เรียกเก็บสำหรับ 1.2 ทำให้เป็นตัวแทนที่สมเหตุสมผลสำหรับรูปแบบต้นทุนและความหน่วงของตระกูลนี้ แต่ไม่ใช่สำหรับประโยชน์ด้านการเขียนโค้ดที่ 1.2 ใช้เป็นจุดขาย เมื่อ 1.2 กลายเป็นแบบกำหนดเส้นทางได้ การเปรียบเทียบจะเปลี่ยนเป็นการแก้สตริงโมเดลเพียงหนึ่งบรรทัดโดยใช้คีย์เดียวกัน และสำหรับการทดลองแบบออร์เคสเตรเตอร์บวกเวิร์กเกอร์ที่อธิบายไว้ข้างต้น DSL สำหรับจัดเส้นทางคือวิธีที่คุณเชื่อมต่อ planner และ fan-out worker เข้าในการเรียกครั้งเดียว แทนที่จะสร้างการส่งต่องานด้วยตัวเอง

เลือกตามลักษณะของงาน ไม่ใช่ตามคะแนน

เลือก Claude Haiku 4.5เมื่องานมีขอบเขตจำกัดและผู้ใช้กำลังรอคอย รองรับเอเจนต์ การจำแนกประเภท การแยกข้อมูล แชท การเติมโค้ดแบบคู่โปรแกรมเมอร์ และระดับ worker แบบขนานในลำดับชั้นของเอเจนต์ เป็นโมเดลที่รู้จักกันดี มีประวัติการใช้งานจริงเก้าเดือน การคิดเป็นทางเลือก คุณจึงจ่ายค่าไตร่ตรองเฉพาะเมื่อต้องการ และ 200K ก็เพียงพอสำหรับงานย่อยที่มีขอบเขตแทบทุกประเภท ผลลัพธ์ SWE-bench Verified ที่เผยแพร่ระบุว่ามีความสามารถสูงกว่าราคาที่ระบุไว้มาก หากคุณยินดีใช้จ่ายงบประมาณการคิดตามที่ผลลัพธ์นั้นใช้

เลือก Muse Spark 1.2 เมื่อหน่วยการทำงานคือ repository แทนที่จะเป็น request. การรีแฟกเตอร์หลายไฟล์, การดีบักที่ยาวนาน, การสร้างโปรเจกต์ทั้งหมด, ลูปเอเจนต์ระยะยาวที่ไม่มีใครเฝ้าดูสปินเนอร์. หน้าต่างหนึ่งล้านโทเคนขจัดปัญหาการแบ่งส่วนข้อมูลที่ Haiku ไม่สามารถแก้ได้ไม่ว่าจะด้วยราคาเท่าใด, และการใช้เหตุผลแบบบังคับซึ่งทำให้มันไม่เหมาะสำหรับการแชทนั้นเป็นค่าเริ่มต้นที่เหมาะสมเมื่อแผนที่ผิดมีต้นทุนมากกว่าแผนที่ช้า.

What should decide it is not the index number. Ask two questions instead: does a single call ever need to see more than 200,000 tokens, and is there a human waiting on the first token? Yes to the first points at Meta. Yes to the second points at the vendor. Yes to both means you want two models, which is the honest answer more often than either vendor's marketing admits.

การเปรียบเทียบในบทความนี้1

ตรวจพบจากบทความนี้ · เบนช์มาร์ก: Artificial Analysis · อัปเดตทุกวัน

© 2026 OrcaRouter

สำหรับผู้ให้บริการ

ให้บริการแพลตฟอร์มการอนุมานอยู่หรือไม่ นำโมเดลของคุณขึ้น OrcaRouter

ติดต่อเรา

เข้าร่วมคอมมูนิตี้ของเรา

DiscordEmailXGitHubYouTube