
Muse Spark 1.2 เทียบกับ Claude Fable 5: ต้นทุนที่แท้จริงของหกจุดดัชนี
- metaใหม่Meta: Muse Spark 1.22026-08-0557ความฉลาด72การเขียนโค้ด
- qwenใหม่Qwen: Qwen3.8 Max2026-08-0358ความฉลาด72การเขียนโค้ด
- deepseekใหม่DeepSeek: DeepSeek V4 Flash 07312026-07-3152ความฉลาด69การเขียนโค้ด
- qwenใหม่Qwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 ต่อ 1 ล้านโทเค็น · 197 tok/s
- orcaใหม่OrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463ความฉลาด78การเขียนโค้ด
- googleGoogle: Gemini 3.6 Flash2026-07-2152ความฉลาด69การเขียนโค้ด
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137ความฉลาด49การเขียนโค้ด
- metaMeta: Muse Spark 1.12026-07-1653ความฉลาด71การเขียนโค้ด
- kimiMoonshotAI: Kimi K32026-07-1560ความฉลาด76การเขียนโค้ด
- openaiOpenAI: GPT-5.6 Luna2026-07-0952ความฉลาด71การเขียนโค้ด
- openaiOpenAI: GPT-5.6 Terra2026-07-0957ความฉลาด77การเขียนโค้ด
- openaiOpenAI: GPT-5.6 Sol2026-07-0961ความฉลาด77การเขียนโค้ด
- grokxAI: Grok 4.52026-07-0856ความฉลาด72การเขียนโค้ด
- tencentTencent: Hy32026-07-0642ความฉลาด59การเขียนโค้ด
- obsidianQwen3.6 35B A3B Uncensored (Aggressive)2026-07-0232ความฉลาด42การเขียนโค้ด
- obsidianGemma4 26B A4B Uncensored (Balanced)2026-07-0226ความฉลาด39การเขียนโค้ด
- anthropicAnthropic: Claude Sonnet 52026-06-3055ความฉลาด72การเขียนโค้ด
- klingKling: Kling 3.0 Turbo2026-06-1757ความฉลาด52การเขียนโค้ด57คณิตศาสตร์
- z-aiZ.ai: GLM 5.22026-06-1653ความฉลาด69การเขียนโค้ด60คณิตศาสตร์
Artificial Analysis เผยแพร่บางสิ่งที่ตาราง benchmark ส่วนใหญ่ไม่แสดง: จำนวนเงินที่ใช้จ่าย การรัน Intelligence Index ซึ่งมีการประเมินเก้าอย่างมีค่าใช้จ่าย $637.85 สำหรับ Muse Spark 1.2 และ $5,630.52 สำหรับ Claude Fable 5 ชุด benchmark เดียวกัน, harness เดียวกัน, ค่าใช้จ่ายหนึ่งเป็น 8.8 เท่าของอีกอันหนึ่ง Fable 5 ได้คะแนน 60 ขณะที่ Muse Spark 1.2 ได้ 54.
หารความแตกต่างแล้วคุณจะได้ตัวเลขที่การเปรียบเทียบนี้เกี่ยวข้องจริงๆ: บนปริมาณงานนั้น จุดสติปัญญาหกจุดสุดท้ายมีราคาประมาณ $832 ต่อจุด การที่คุณควรจ่ายหรือไม่นั้นไม่ใช่คำถามเชิงเกณฑ์มาตรฐาน แต่เป็นคำถามว่าทราฟฟิกของคุณต้องการจุดเหล่านั้นมากเพียงใด และคำตอบสำหรับทีมส่วนใหญ่คือสัดส่วนที่เล็กและระบุได้
จุดดัชนีส่วนเพิ่มมีราคา และราคานั้นสูงชัน
ตัวเลขทั้งสองมาจากผู้ประเมินอิสระรายเดียวกันที่ใช้ชุดทดสอบเดียวกัน — GDPval-AA v2, τ³-Banking, Terminal-Bench v2.1, SciCode, Humanity's Last Exam, GPQA Diamond, CritPt, AA-Omniscience และ AA-LCR ไม่มีรายใดเป็นการอ้างสิทธิ์จากผู้ขาย Fable 5 อยู่อันดับที่ 3 จาก 185 รุ่น; Muse Spark 1.2 อยู่อันดับที่ 13 โดยค่ามัธยฐานของกลุ่มอยู่ที่ 32 ทั้งสองอยู่เหนือค่าเฉลี่ยอย่างมาก; มีเพียงหนึ่งเดียวที่อยู่ระดับแนวหน้า

ราคาที่ระบุไว้อธิบายช่องว่างส่วนใหญ่และตีค่าส่วนที่เหลือต่ำเกินไป:
• อินพุต — Muse Spark 1.2 $1.25 ต่อล้าน, Claude Fable 5 $10.00 แปดเท่า.
• ผลลัพธ์ — $4.25 เทียบกับ $50.00. เกือบสิบสองเท่า.
• อินพุตที่แคชไว้ — $0.15 เทียบกับ $1.00 ซึ่งมากกว่าประมาณเจ็ดเท่า และ Fable 5 ยังคิดค่าธรรมเนียม $12.50 ต่อล้านสำหรับการเขียนแคช หรือ $20.00 สำหรับ TTL หนึ่งชั่วโมง ขณะที่ Muse Spark 1.2 ไม่คิดค่าธรรมเนียมการเขียนแคชแยกต่างหากเลย
• อัตราผสม — Artificial Analysis ประเมิน Muse Spark 1.2 ไว้ที่ $0.78 ต่อล้านโทเคน และ Fable 5 ไว้ที่ $7.70 ซึ่งเกือบสิบเท่า
Fable 5 เป็นโมเดลที่แพงที่สุดเท่าที่ Artificial Analysis เคย benchmark เมื่อเปิดตัว และยังครองตำแหน่งนั้นอยู่ ควรพูดให้ชัดเจนว่าทำไม: โมเดลใช้ น้อยกว่า output tokens ในการผ่าน index เมื่อเทียบกับ Muse Spark 1.2 — 87M ต่อ 95M — ดังนั้นความแตกต่างของต้นทุนทั้งหมดคืออัตรา ไม่ใช่ความเยิ่นเย้อ Fable 5 ไม่ได้สุรุ่ยสุร่าย แต่ถูกตั้งราคาเป็นผลิตภัณฑ์ระดับแนวหน้า
เมื่อแปลงเป็นขั้นตอน agent ที่อ่านโทเคน 60,000 ตัวจากบริบท repository และเขียนโทเคน 3,000 ตัวเป็นแพตช์: ประมาณ 8.8 เซนต์บน Muse Spark 1.2 และประมาณ 75 เซนต์บน Claude Fable 5 หนึ่งพันขั้นต่อวันคือ $88 เทียบกับ $750 ในหนึ่งปีคือ $32,000 เทียบกับ $274,000
ในกรณีที่ Claude Fable 5 ไม่สามารถทดแทนได้
กรณีเรื่องต้นทุนจะออกมาเป็นฝ่ายเดียว หากหกประเด็นคือความแตกต่างทั้งหมด แต่ก็ไม่ใช่อย่างนั้น และจุดที่ช่องว่างขยายกว้างขึ้นก็คือจุดที่ Meta ได้ปรับตำแหน่ง Muse Spark 1.2 เพื่อแข่งขันพอดี
Fable 5 ครองอันดับหนึ่งในหลากหลายส่วนของแลดเดอร์ตัวต่อตัวของ Design Arena: 1399 Elo และอันดับ 1 ในด้านการพัฒนาเกม, 1367 และอันดับ 1 ในด้าน ASCII art, 1353 และอันดับ 1 ในด้านการสร้าง SVG, รวมถึงอันดับ 1 ในสนามเอเจนต์สำหรับการพัฒนาเกม Godot (1344), Android native (1318), การพัฒนาเกมแบบเอเจนต์ (1300) และ HTML slides (1260), และได้อันดับสองในเว็บแอปและงานฟูลสแตก. Muse Spark 1.2 นั้นไม่มีรายการ Design Arena ใดๆ เลย — รุ่นก่อนหน้าสะสมผลงานกลางตารางที่น่านับถือ (1334 ในด้านการพัฒนาเกมที่อันดับ 5, 1309 ในหมวดหมู่โค้ดทั่วไปที่อันดับ 9) แต่เวอร์ชันใหม่ยังไม่ได้รับการจัดอันดับแม้แต่ครั้งเดียว
ดัชนีรายมิติชี้ไปในทิศทางเดียวกัน Artificial Analysis ให้คะแนน Claude Fable 5 ที่ดัชนีการเขียนโค้ด 76.5 และดัชนีด้านเอเจนต์ 52.8 Muse Spark 1.1 อยู่ที่ 71.3 และ 37.5 — ตามหลังห้าจุดในด้านการเขียนโค้ด และสิบห้าจุดในงานด้านเอเจนต์ ยังไม่มีการเผยแพร่ตัวเลขรายมิติสำหรับ 1.2 ดังนั้นข้อความที่ตรงไปตรงมาก็คือ เรารู้ว่าคะแนนรวมไล่ตามมาชิดขึ้นสามจุด แต่เราไม่รู้ว่าส่วนไหนของสามจุดนั้นไปตกอยู่บนแกนเอเจนต์

การวางตำแหน่งผลิตภัณฑ์ของ Fable 5 เองอ้างว่าความนำจะกว้างขึ้นตามความยาวและความซับซ้อนของงาน นั่นเป็นคำกล่าวอ้างของผู้จำหน่ายและยังไม่ได้รับการพิสูจน์ตามที่กล่าวอ้าง แต่มันสอดคล้องกับรูปแบบของข้อมูลอิสระ: ส่วนต่างที่มากที่สุดของ Fable 5 อยู่ในสนาม agents ซึ่งโมเดลต้องรักษาแผนไว้ให้ต่อเนื่องในหลาย ๆ เทิร์น มากกว่าการสร้างผลลัพธ์แบบครั้งเดียวจบ
ในกรณีที่ Muse Spark 1.2 คือคำตอบที่ถูกต้องอย่างแท้จริง
สามสิ่งทำให้มันเป็นตัวเลือกที่ถูกต้อง ไม่ว่าหกประเด็นนั้นจะเป็นอย่างไร
• การนำเข้าเสียงและวิดีโอรายการของ Meta โฆษณารองรับข้อความ รูปภาพ วิดีโอ เสียง และ PDF ส่วน Claude Fable 5 รองรับข้อความ รูปภาพ และไฟล์ โดยไม่รองรับเสียงและวิดีโอ สำหรับไปป์ไลน์ใดๆ ที่ต้องจัดการกับการบันทึกเสียงหรือภาพวิดีโอ นี่ไม่ใช่การแลกเปลี่ยนผลได้ผลเสีย แต่เป็นตัวกรองที่เข้มงวด ข้อแม้ที่ตรงไปตรงมาข้อหนึ่ง: การ์ดข้อมูลจำเพาะของ Artificial Analysis สำหรับ Muse Spark 1.2 ระบุว่าได้ประเมินเพียงข้อความและรูปภาพเท่านั้น ดังนั้นขอบเขตความสามารถที่กว้างกว่าจึงเป็นเพียงการโฆษณา มิได้ผ่านการตรวจสอบโดยอิสระ.
• ความเร็ว. 165.0 โทเคนต่อวินาที เทียบกับ 71.7. Muse Spark 1.2 สตรีมผลลัพธ์ได้เร็วมากกว่าสองเท่า และจัดอันดับ #16 จาก 185 ในด้านความเร็ว เทียบกับค่ามัธยฐานของคลาสที่ 71 — Fable 5 อยู่ที่ค่ามัธยฐาน.
• ต้นทุนตามปริมาณ. ทุกอย่างในส่วนก่อนหน้า.
เพิ่มตัวเลือกที่สี่สำหรับผู้ที่คำขอมีขนาดใหญ่อย่างแท้จริง: ทั้งสองโมเดลโฆษณาบริบทประมาณหนึ่งล้านโทเค็น — 1,048,576 สำหรับ Muse Spark 1.2, 1,000,000 สำหรับ Fable 5 — แต่ Muse Spark 1.2 คิดอัตราคงที่ตลอดทั้งส่วน ในขณะที่การกำหนดราคาแบบ cache-write ของ Fable 5 หมายความว่าการถือ prefix ที่มีเสถียรภาพขนาดใหญ่ต้องเสียเงินจริงล่วงหน้าก่อนที่มันจะเริ่มช่วยให้คุณประหยัดได้
ทั้งสองตัวนี้ไม่ใช่โมเดลที่เร็ว
นี่คือส่วนที่การเปรียบเทียบแบบตัวต่อตัวส่วนใหญ่มักจะข้าม และมันเปลี่ยนแปลงสถาปัตยกรรมมากกว่าใบแจ้งหนี้
ที่ระดับการใช้เหตุผลสูงสุด Artificial Analysis วัดเวลาจนถึงโทเค็นแรกได้ 26.12 วินาทีสำหรับ Muse Spark 1.2 และ 141.26 วินาทีสำหรับ Claude Fable 5 โดยมีเวลาตอบสนองแบบ end-to-end สำหรับ Fable 5 เท่ากับ 148.24 วินาที ทั้งคู่ไม่สมควรถูกวางไว้ต่อหน้าผู้ใช้ที่การตั้งค่าเหล่านั้น
ตัวเลขการใช้งานจริงนั้นเป็นมิตรกว่ามากและน่ารู้. บน OrcaRouter, Claude Fable 5 แสดง p50 ของเวลาถึงโทเคนแรกที่ 7.04 วินาที และ p95 ที่ 10.00 วินาที ตลอดหนึ่งสัปดาห์แบบหมุนเวียน — นั่นคือปริมาณการใช้งานจริงตามระดับความพยายามที่ผู้เรียกใช้ร้องขอ, ไม่ใช่ benchmark ที่ระดับสูงสุด. Muse Spark 1.1, ซึ่งใช้สำหรับเทียบเคียง, มีค่า p50 1.84 วินาที. ส่วน Muse Spark 1.2 ยังไม่มีข้อมูล telemetry จากการใช้งานจริง.

ประเด็นเชิงโครงสร้าง: ทั้งสองโมเดลมีการให้เหตุผลภาคบังคับ. แป้นปรับระดับความพยายามของ Fable 5 ไล่จากระดับต่ำถึงสูงสุดและตั้งค่าเริ่มต้นที่สูง ส่วนของ Muse Spark 1.2 ไล่จากระดับต่ำสุดถึงสูงพิเศษและตั้งค่าเริ่มต้นที่ปานกลาง ทั้งคู่ไม่อนุญาตให้ปิดการคิด หากคุณต้องการการตอบสนองภายในเวลาไม่ถึงหนึ่งวินาที การเปรียบเทียบทั้งหมดนี้เป็นชั้นที่ผิด — นั่นคือสิ่งที่โมเดลระดับ Luna หรือ Flash-Lite มีไว้สำหรับ
สแตกสองโมเดลที่ราคาสูงเกินเอื้อม
การมองว่าเป็นการเลือกแบบผู้ชนะได้ทั้งหมดนั้นเป็นความผิดพลาด เนื่องจากปริมาณงานไม่ได้เป็นเนื้อเดียวกัน เอเจนต์ที่ใช้งานจริงเกือบทุกตัวมีขั้นตอนประจำจำนวนมากอยู่ส่วนหางยาว เช่น อ่านไฟล์ สรุป diff จัดรูปแบบ patch ตัดสินใจว่าจะเรียกใช้เครื่องมือใดต่อไป และมีส่วนหัวสั้น ๆ ของงานที่ยากจริง ๆ ซึ่งคำตอบที่ผิดอาจทำให้เสียเวลาถึงหนึ่งชั่วโมง
ทำขั้นตอนเอเจนต์วันละพันขั้นเท่าเดิม ถ้าใช้ทั้งหมดบน Claude Fable 5: ประมาณ 750 ดอลลาร์ ถ้าใช้ทั้งหมดบน Muse Spark 1.2: ประมาณ 88 ดอลลาร์ ถ้าแบ่งงานทั่วไป 900 รายการให้โมเดลราคาถูก และงานยาก 100 รายการให้โมเดลราคาแพง: ประมาณ 79 ดอลลาร์บวก 75 ดอลลาร์ หรือ 154 ดอลลาร์ต่อวัน ซึ่งคิดเป็นหนึ่งในห้าของค่าใช้จ่ายแบบใช้ Fable ทั้งหมด ขณะที่ยังคงความสามารถระดับแนวหน้าไว้สำหรับหนึ่งในสิบของการเรียกใช้ที่จำเป็นจริง ๆ และนี่คือความแตกต่างประมาณ 220,000 ดอลลาร์ต่อปีบนลูปเอเจนต์เดียว
เหตุผลที่การแยกนี้คุ้มค่าที่จะสร้างขึ้นมากกว่าแค่การอธิบายก็คือ เมื่อก่อนมันต้องใช้ความสัมพันธ์กับผู้จำหน่ายสองราย, SDK สองชุด และชุดข้อมูลรับรองสองชุด แต่ปัจจุบันไม่ต้องแล้ว Claude Fable 5 อยู่ในแคตตาล็อกของ OrcaRouter ในราคา $10.00 และ $50.00 — เป็นราคารายการของผู้จำหน่าย ส่งผ่านโดยมาร์กอัป 0% — และ Muse Spark 1.1 ก็อยู่ที่นั่นในราคา $1.25 และ $4.25 ด้วยหลักการเดียวกัน ผ่านจุดเชื่อมต่อที่เข้ากันได้กับ OpenAI เดียวกัน DSL การกำหนดเส้นทางช่วยให้คุณแสดงคำสั่ง "ใช้โมเดลราคาถูกก่อน เพิ่มระดับเมื่อความเชื่อมั่นต่ำหรือเมื่อการรันทดสอบล้มเหลว" เป็นการเรียกใช้ครั้งเดียว แทนที่จะเป็นโค้ดออร์เคสเตรชันที่คุณต้องดูแลรักษา และ model fusion ช่วยให้คุณส่งขั้นตอนที่คลุมเครืออย่างแท้จริงไปยังกลุ่มโมเดลพร้อมกันแล้วเปรียบเทียบผล Muse Spark 1.2 เองยังไม่อยู่ในแคตตาล็อก — Meta ให้บริการโดยตรง โดยเป็นผู้ให้บริการเพียงรายเดียว — ดังนั้นวันนี้สิ่งที่ใกล้เคียงที่สุดที่คุณสามารถสร้างสำหรับสแต็กนี้คือการใช้เวอร์ชัน 1.1 ในฝั่งราคาถูก
รายละเอียดผู้ให้บริการรายเดียวนั้นสมควรมีบรรทัดของตัวเองในการประเมินความเสี่ยง Claude Fable 5 มีเส้นทางการให้บริการหลายเส้นทางและมีการเฟลโอเวอร์อัตโนมัติระหว่างเส้นทางเหล่านั้น Muse Spark 1.2 มีเอนด์พอยต์เดียวเท่านั้น ซึ่งดำเนินการโดย Meta หากมันหยุดทำงาน จะไม่มีระบบสำรองที่เป็นโมเดลเดียวกัน
แบบจำลองต้นทุน ไม่ใช่คำตัดสิน
ผลลัพธ์ที่มีประโยชน์ของการเปรียบเทียบนี้ไม่ใช่ "โมเดลไหนชนะ" แต่เป็นเกณฑ์ที่คุณสามารถคำนวณได้สำหรับภาระงานของคุณเอง
ประมาณสัดส่วนของการเรียกใช้ที่คำตอบระดับ Muse Spark 1.2 ล้มเหลว และคำตอบระดับ Fable 5 สำเร็จ คูณด้วยต้นทุนของความล้มเหลว — นาทีของวิศวกร, การรวมโค้ดที่ผิดพลาด, การวนซ้ำลองใหม่, ลูกค้า เปรียบเทียบกับ 66 เซนต์ต่อขั้นตอน ซึ่งเป็นต้นทุนในการอัปเกรดการเรียกใช้หนึ่งครั้งจาก Muse Spark 1.2 เป็น Claude Fable 5 ในตัวอย่าง 60K-in / 3K-out ข้างต้น หากความเสียหายที่คาดหวังจากคำตอบที่ผิดเกิน 66 เซนต์ ให้ส่งขั้นตอนนั้นไปยัง Fable 5 หากไม่เกิน ก็ไม่ต้องส่ง
สำหรับทีมส่วนใหญ่ การคำนวณนั้นจัดให้ Fable 5 อยู่ในงานตรวจสอบโค้ด การสร้างแพตช์สุดท้าย การวางแผนสถาปัตยกรรม และทุกอย่างที่เกี่ยวข้องกับข้อมูลในระบบจริง และจัดให้ Muse Spark 1.2 อยู่ในงานอื่นๆ ทั้งหมด ตั้งแต่การอ่านไฟล์ การสรุปความ การคัดกรองการทดสอบ การเลือกเครื่องมือ ไปจนถึงช่วงกลางที่มีปริมาณงานสูงของ agent loop ซึ่งมีต้นทุนจริงแต่ความเสี่ยงต่อการเรียกใช้แต่ละครั้งไม่สูง
สิ่งหนึ่งที่ควรจับตามองต่อไป: ตารางอันดับของ Design Arena และดัชนีรายมิติสำหรับ Muse Spark 1.2 ซึ่งทั้งคู่ยังไม่มีอยู่จริง หลักฐานที่แข็งแกร่งที่สุดของ Fable 5 อยู่ในสนามแข่งขันแบบตัวต่อตัวซึ่งโมเดลใหม่ของ Meta ยังไม่มีสถิติเลย เมื่อสถิตินั้นปรากฏขึ้น เกณฑ์นี้จะขยับ — อาจจะขยับไปมาก
การเปรียบเทียบในบทความนี้2
ตรวจพบจากบทความนี้ · เบนช์มาร์ก: Artificial Analysis · อัปเดตทุกวัน
