Muse Spark 1.2 เทียบกับ Muse Spark 1.1-1
Guides & Insights

Muse Spark 1.2 กับ Muse Spark 1.1: คุณควรอัปเกรดหรือไม่?

ผู้เขียน

Jim Song

วันที่เผยแพร่

โมเดลล่าสุด · 20ดูโมเดลทั้งหมด
เบนช์มาร์ก: Artificial Analysis · อัปเดตทุกวัน
กลับไปยังโพสต์ทั้งหมด

Meta แทนที่ Muse Spark 1.1 ด้วย Muse Spark 1.2 เมื่อวันที่ 5 สิงหาคม 2026 โดยไม่มีการเปลี่ยนแปลงราคา หน้าต่างบริบท รายการโมดัลลิตี พารามิเตอร์ที่รองรับ หรือระดับการใช้เหตุผล การย้ายครั้งนี้จึงดูเหมือนไม่มีค่าใช้จ่าย — ตระกูลสตริงโมเดลเดียวกัน การเรียกเก็บเงินเดียวกัน ไม่มีอะไรต้องเจรจาใหม่ แต่มันไม่ได้ฟรี การวัดโดยอิสระระบุว่าเวลาจนถึงโทเคนแรกของเวอร์ชันใหม่อยู่ที่ 26.12 วินาที เทียบกับเวอร์ชันเก่าที่ 2.90 วินาที และอัตราการส่งออกต่อเนื่องอยู่ที่ 165 โทเคนต่อวินาที เทียบกับ 213.5 คุณกำลังซื้อความฉลาดที่วัดได้สามจุด พร้อมกับเวลารอที่ยาวขึ้นประมาณเก้าเท่าก่อนที่สิ่งใดจะตอบกลับมา

การจะทำเช่นนั้นคุ้มค่าหรือไม่นั้นแทบจะขึ้นอยู่กับว่างานของคุณใช้เวลานานเพียงใด นี่คือสิ่งที่แตกต่างจริง ๆ สิ่งที่ยังคงเหมือนเดิม และสิ่งที่ยังไม่มีใครสามารถบอกคุณได้ในขณะนี้

การตัดสินใจในสี่บรรทัด

• ดัชนีความฉลาด: 51 → 54ซึ่งวัดโดยอิสระโดย Artificial Analysis ในการตั้งค่า xhigh ของแต่ละเวอร์ชัน

• เวลาจนถึงโทเคนแรก: 2.90s → 26.12s โดยใช้แหล่งข้อมูลเดียวกันและเงื่อนไขเดียวกัน

• ค่าใช้จ่ายในการรันชุดเกณฑ์มาตรฐานที่เหมือนกัน: $548.07 → $637.85 โดยอิงราคาต่อโทเค็นที่เหมือนกัน ส่วนที่เพิ่มขึ้น 16% คือการเผาโทเค็นล้วนๆ

• ทุกสิ่งที่แบบฟอร์มการจัดซื้อสอบถาม: ไม่มีการเปลี่ยนแปลง

Muse Spark 1.2 vs Muse Spark 1.1-2

อะไรที่เหมือนกันอย่างแท้จริง

สิ่งนี้ควรค่าแก่การแจกแจง เพราะมันคือเหตุผลที่การโยกย้ายระบบดูเหมือนเป็นเรื่องง่ายบนกระดาษ และเพราะความแตกต่างที่ไม่มีอยู่จริงคือสิ่งที่คุณไม่จำเป็นต้องทดสอบ

ราคา — 1.25 ดอลลาร์ต่อหนึ่งล้านโทเคนอินพุต, 4.25 ดอลลาร์ต่อหนึ่งล้านโทเคนเอาต์พุต, 0.15 ดอลลาร์ต่อหนึ่งล้านโทเคนเมื่อแคชถูกใช้งาน, 2.50 ดอลลาร์ต่อหนึ่งพันครั้งของการค้นหาเว็บในตัว ตัวเลขทุกตัวเหมือนกันทั้งสองเวอร์ชัน

บริบท — ทั้งสองมี 1,048,576 โทเคน โดยไม่มีระดับค่าธรรมเนียมเพิ่มเติมสำหรับบริบทแบบยาวในทั้งสอง

รูปแบบ — รับข้อมูลเป็นข้อความ รูปภาพ วิดีโอ เสียง และ PDF; ส่งออกเป็นข้อความ ทั้งสองรายการระบุอินพุตห้าประเภทเดียวกัน

แป้นปรับระดับการใช้เหตุผล — จำเป็นในทั้งสองเวอร์ชัน, มีห้าระดับ (minimal, low, medium, high, xhigh), ค่าเริ่มต้นคือ medium ในทั้งสอง. ไม่มีตัวตั้งค่าในเวอร์ชันใดที่ปิดการคิดได้

พารามิเตอร์ — tools, tool_choice, structured_outputs, response_format, reasoning_effort, include_reasoning, max_tokens, temperature, top_p, top_k, repetition_penalty. รายการเหมือนกัน

การให้บริการ — ผู้ให้บริการรายเดียวคือ Meta เอง ทั้งสองฝั่ง ไม่มีโฮสต์ของบุคคลที่สาม ไม่มีตัวแปร quantization

ราคาแบบผสม — Artificial Analysis กำหนดราคาทั้งสองที่ 0.78 ดอลลาร์ต่อล้านโทเคนตามการถ่วงน้ำหนักแบบผสม ซึ่งเป็นสิ่งที่คาดหวังได้จากอัตราค่าบริการที่เหมือนกัน

หากคุณหวังว่าการอัปเกรดนี้จะมาพร้อมกับบริบทที่มากขึ้น การการันตีความยาวเอาต์พุต หรือแคชที่ถูกลง มันก็ไม่ได้เป็นเช่นนั้น นี่คือการปล่อยโมเดลแบบ weights-and-post-training โดยมีเรตการ์ดที่ก็อปปี้มาจากเวอร์ชันก่อนหน้า

อะไรที่เคลื่อนไปจริงๆ

Artificial Analysis เป็นหน่วยงานอิสระเพียงรายเดียวในปัจจุบันที่ได้ประเมินทั้งสองเวอร์ชัน และได้ประเมินทั้งสองที่ระดับการใช้เหตุผลสูงสุด ดังนั้นการเปรียบเทียบจึงเป็นการเปรียบเทียบแบบเทียบเคียงโดยตรง

ดัชนีความฉลาด — 51 สำหรับเวอร์ชัน 1.1 (อันดับที่ 22 จาก 185) ถึง 54 สำหรับเวอร์ชัน 1.2 (อันดับที่ 13) ขยับขึ้น 9 อันดับบนกระดานจัดอันดับ ซึ่งค่ามัธยฐานของชั้นเรียนอยู่ที่ 32 ดังนั้นการเพิ่มขึ้นนี้จึงได้ตำแหน่งที่แท้จริงมา ไม่ใช่แค่ทศนิยมที่มากขึ้น

เวลาจนถึงโทเคนแรก — 2.90 ถึง 26.12 วินาที นี่คือการถดถอยหลักและไม่ใช่เรื่องเล็กน้อย

ความเร็วเอาต์พุต — 213.5 ถึง 165.0 โทเคนต่อวินาที ยังคงอยู่อันดับที่ 16 จาก 185 และยังคงถูกอธิบายโดย Artificial Analysis ว่า "เร็วอย่างเห็นได้ชัด" แต่ช้าลง 23% เมื่อเทียบกับรุ่นที่แทนที่

ความฟุ่มเฟือย — โทเค็นเอาต์พุต 94M เพื่อผ่านดัชนี เทียบกับ 95M แทบไม่เปลี่ยนแปลง และทั้งคู่สูงกว่าค่ามัธยฐาน 65M ประมาณ 45%

ค่าใช้จ่ายในการประเมินทั้งหมด — $548.07 ถึง $637.85. เนื่องจากความยาวของเอาต์พุตแทบไม่เปลี่ยนแปลง และราคาก็ไม่เปลี่ยนแปลงเลย การเพิ่มขึ้น 16% จึงมาจากที่อื่นนอกเหนือจากเอาต์พุตที่มองเห็นได้: การให้เหตุผลภายในที่ยาวขึ้น การลองใหม่มากขึ้น หรือการเรียกใช้เครื่องมือต่อหนึ่งงานที่มากขึ้น

รูปแบบนี้สอดคล้องกัน Meta ไม่ได้ทำให้โมเดลถูกลง เร็วขึ้น หรือใหญ่ขึ้น แต่ทำให้โมเดลใช้เวลาคิดนานขึ้นก่อนจะตัดสินใจ และการคิดเพิ่มเติมนั้นแสดงออกมาเป็นความหน่วง ความเร็วในการสตรีมที่ช้าลงเล็กน้อย และค่าใช้จ่ายที่สูงขึ้น 16% สำหรับงานที่เหมือนกัน สิ่งที่ได้มาคือจุดดัชนีสามจุด

ความหน่วงนั้นแย่แค่ไหนกันแน่

ตัวเลข 26.12 วินาทีนี้จะถูกนำไปอ้างอิงโดยไม่พิจารณาบริบท ดังนั้นควรตีความให้ถูกต้อง: ค่านี้วัดที่ xhigh ซึ่งเป็นระดับความพยายามที่แพงที่สุดจากห้าระดับ บนชุดเกณฑ์มาตรฐานที่ออกแบบมาให้ยาก. ค่าเริ่มต้นของ API คือ medium.

เพื่อให้เห็นภาพว่าค่าเริ่มต้นให้ความรู้สึกอย่างไรจริง ๆ Muse Spark 1.1 บน OrcaRouter — ซึ่งให้บริการผู้โทรจริงตามระดับความพยายามที่พวกเขาร้องขอ — แสดงค่า p50 เวลาจนถึงโทเคนแรกคือ 1.84 วินาที และ p95 คือ 6.00 วินาที ตลอดสัปดาห์หมุนเวียน. นี่คือข้อมูลการผลิตจริงที่ระดับความพยายามตามจริง และต่ำกว่าตัวเลขเกณฑ์อ้างอิงมากกว่าหนึ่งลำดับความสำคัญ. เวอร์ชัน 1.2 ยังไม่มีเทเลเมทรีจากการผลิตจริง

Muse Spark 1.2 vs Muse Spark 1.1-3

ดังนั้นการอ่านอย่างตรงไปตรงมาจึงไม่ใช่ "1.2 ใช้เวลา 26 วินาทีในการตอบสนอง" แต่เป็น: ในการตั้งค่าที่ 1.2 ได้รับคะแนนพิเศษสามคะแนน โทเค็นแรกจะทำให้คุณเสียเวลา 26 วินาที และในการตั้งค่าเดียวกัน โมเดลเก่าทำให้คุณเสียเวลาเพียงสามวินาที หากคุณรันที่ระดับ xhigh อยู่แล้ว ซึ่งเป็นคอนฟิกที่การเพิ่มความฉลาดเกิดขึ้นจริง คุณก็จะได้รับตัวเลขนั้น หากคุณรันที่ระดับ medium หรือต่ำกว่า คุณจะเห็นค่าที่สั้นกว่ามาก และคุณจะเห็นการปรับปรุงที่น้อยลงด้วย

การผูกโยงนั้นคือกับดักที่แท้จริงในการอัปเกรดครั้งนี้ คุณไม่สามารถจะได้ความชาญฉลาดมาโดยไม่ผ่านการไตร่ตรอง เพราะการไตร่ตรองคือที่มาของความชาญฉลาดนั้น

การ repositioning เบื้องหลังตัวเลข

Meta ไม่ได้เผยแพร่โพสต์เปิดตัวสำหรับ 1.2 — หน้าเพจประกาศ Muse Spark ยังคงอธิบายถึง 1.1 — แต่ได้เขียนคำอธิบายผลิตภัณฑ์ใหม่ และการเขียนใหม่นั้นอธิบายถึงข้อแลกเปลี่ยน

Muse Spark 1.1 ถูกวางจำหน่ายในฐานะโมเดลการให้เหตุผลแบบมัลติโมดัลที่มีพื้นผิวอินพุตกว้างอย่างไม่ธรรมดา โดยมุ่งเป้าไปที่ "เอเจนต์มัลติโมดัล, การวิจัยเชิงลึกเหนือสื่อผสม, และการวิเคราะห์บริบทยาว": รายงานยาว, คลังสื่อ, การบันทึก และวิดีโอควบคู่กับข้อความ

คำอธิบายของ Muse Spark 1.2 ละทิ้งเกือบทั้งหมดนั้น และหันไปกล่าวถึงวิศวกรรมซอฟต์แวร์แทน — การปรับโครงสร้างหลายไฟล์ การดีบักที่ยาวนาน การสร้างทั้งรีโพซิทอรี — จากนั้นก็เพิ่มข้อกล่าวอ้างเรื่องหลายเอเจนต์อย่างชัดเจน: โมเดลสามารถทำหน้าที่เป็นเอเจนต์หลักที่รวบรวมบริบท วางแผน และมอบหมายงาน หรือเป็นเอเจนต์ย่อยที่ทำงานแบบขนานภายใต้เอเจนต์หลัก นอกจากนี้ยังอ้างว่าการแคชพรอมป์สามารถลดต้นทุนจริงได้ 60–80% ขึ้นอยู่กับปริมาณบริบทที่ซ้ำกันระหว่างการเรียกใช้ ตัวเลขสุดท้ายนั้นเป็นการประมาณการของ Meta มากกว่าผลลัพธ์ที่วัดได้ แม้ว่าอัตราการแคชที่ $0.15 จะทำให้ตัวเลขดังกล่าวมีความน่าเชื่อถือทางคณิตศาสตร์ก็ตาม

อ่านการถดถอยของ latency เทียบกับการปรับตำแหน่งใหม่นั้น แล้วมันก็ไม่ดูเหมือนความผิดพลาดอีกต่อไป ไม่มีใครที่รีแฟกเตอร์ไฟล์เป็นโหลจะสนใจการวางแผน 26 วินาที Meta เลือกลูกค้าคนหนึ่ง และไม่ใช่รายที่ 1.1 ถูกขายให้

สิ่งที่ 1.1 ยังมีอยู่ แต่ 1.2 ไม่มี

การมีอายุเพียงสี่สัปดาห์ไม่เพียงพอที่จะสะสมประวัติการทำงาน และในสามด้านที่เป็นรูปธรรม รุ่นที่เก่ากว่ายังคงเป็นผลิตภัณฑ์ที่มีข้อมูลประกอบดีกว่าในขณะนี้

สถิติในสนามประลอง. Muse Spark 1.1 มีประวัติใน Design Arena อย่างมาก: 1334 Elo ในอันดับที่ 5 ด้านการพัฒนาเกม, 1334 ในอันดับที่ 7 ด้านคอมโพเนนต์ UI, 1320 ในอันดับที่ 3 ด้าน ASCII art, 1318 ด้านการแสดงข้อมูลเป็นภาพ, 1309 ในหมวดหมู่โค้ดทั่วไป, รวมถึง ladder ที่สมบูรณ์ของ agents-arena ซึ่งครอบคลุมเว็บแอป, สไลด์ HTML และการพัฒนาเกม Godot. Muse Spark 1.2 ไม่มีข้อมูลใดๆ เลย. ในมิติที่ Meta กำลังทำการตลาดหนักที่สุดในเวลานี้ ไม่มีข้อมูลการเปรียบเทียบแบบตัวต่อตัวสำหรับโมเดลใหม่เลย.

คะแนนดัชนีย่อยArtificial Analysis เผยแพร่ดัชนีการเขียนโค้ดที่ 71.3 และดัชนีเอเจนต์ที่ 37.5 สำหรับเวอร์ชัน 1.1 ยังไม่มีตัวเลขที่เผยแพร่เทียบเคียงสำหรับเวอร์ชัน 1.2 เนื่องจากคะแนนเอเจนต์เป็นมิติที่อ่อนแอที่สุดของเวอร์ชัน 1.1 อย่างเห็นได้ชัด และความสามารถด้านเอเจนต์ก็เป็นสิ่งที่เวอร์ชัน 1.2 อ้างว่าปรับปรุงขึ้นพอดี ตัวเลขนี้จึงเป็นตัวชี้ขาดคำถามเรื่องการอัปเกรด — แต่ตัวเลขดังกล่าวยังไม่มีอยู่จริง

เทเลเมทรีโปรดักชัน. 1.1 มีค่า p50 และ p95 จริงสะสมหนึ่งสัปดาห์ และมีทราฟฟิกสด 4.4M โทเคนบน OrcaRouter ส่วน 1.2 ไม่มีทั้งสองอย่าง เอนด์พอยต์ของมันไม่รายงานสถิติหน่วงเวลาหรือทรูพุตเลย เนื่องจากปริมาณต่ำเกินไปที่จะสุ่มตัวอย่าง

สถานที่ให้เช่านอกเหนือจาก MetaMuse Spark 1.1 อยู่ในแค็ตตาล็อกOrcaRouter ที่ราคา $1.25 และ $4.25 — ซึ่งเป็นราคาที่ Meta กำหนดเอง ส่งผ่านโดยไม่มีมาร์กอัป 0% ส่วน Muse Spark 1.2 ยังไม่มีอยู่ในนั้น ดังนั้นวันนี้จึงเป็นการผสานรวมโดยตรงกับ Meta กับผู้ให้บริการรายเดียวและไม่มีเส้นทางสำรอง

Muse Spark 1.2 vs Muse Spark 1.1-4

ทั้งหมดนี้ไม่ได้หมายความว่า 1.2 แย่กว่า แต่มันหมายความว่าหลักฐานสำหรับ 1.2 ประกอบด้วยคะแนนรวมหนึ่งชุดจากผู้ประเมินหนึ่งคน ขณะที่หลักฐานสำหรับ 1.1 คือหนึ่งเดือนของสนามทดสอบ ดัชนีย่อย และทราฟฟิกจริง ความไม่สมดุลนั้นควรส่งผลต่อวิธีที่คุณจัดขั้นตอนการย้ายระบบ ไม่ใช่จะลองทำหรือไม่

รายการตรวจสอบการย้ายระบบที่สั้นจริงๆ

เนื่องจากเรตการ์ดและพื้นผิวพารามิเตอร์เหมือนกัน การสลับจึงเป็นการเปลี่ยนแปลงสตริงโมเดล งานอยู่ที่การตรวจสอบสิ่งสามอย่างที่เคลื่อนย้ายไปจริง

วัดเวลาจนถึงโทเค็นแรกของคุณเองที่ระดับ effort ที่คุณตั้งไว้เอง อย่ายอมรับตัวเลข 2.90 วินาทีหรือ 26.12 วินาที รันพรอมป์ต์จริงของคุณด้วยค่า reasoning_effort ที่คุณส่งจริง ๆ แล้วเปรียบเทียบโดยตรง นี่คือตัวเลขเพียงตัวเดียวที่สามารถทำให้การย้ายระบบล้มเหลวได้โดยสิ้นเชิง

ตรวจสอบการกำหนดค่าหมดเวลาและการสตรีมของคุณ การเพิ่มขึ้น 9 เท่าของเวลาแฝงของโทเค็นแรกเมื่อใช้ความพยายามสูงจะทำให้ไคลเอนต์หมดเวลาที่ปรับตั้งไว้กับ 1.1 ละเมิด และจะทำให้การผสานรวมแบบไม่สตรีมดูเหมือนค้าง

คำนวณต้นทุนใหม่จากจำนวนโทเค็นที่วัดได้ ไม่ใช่จากเรตการ์ด ราคาเท่ากันทุกอย่าง การเปลี่ยนแปลงค่าใช้จ่ายจึงเกิดจากพฤติกรรมล้วนๆ Artificial Analysis พบว่าต้องใช้จ่ายเพิ่มขึ้น 16% เพื่อทำงานเดียวกัน; จะเห็นผลต่างนั้นหรือไม่ก็ขึ้นอยู่กับสัดส่วนงานของคุณ

ตรวจสอบความเสถียรของ cache-key ก่อน ด้วย prefix ที่เสถียรขนาด 60,000 token ขั้นตอนของ agent โดยทั่วไปจะลดลงจากประมาณ 8.8 เซนต์เป็นประมาณ 2.2 เซนต์ในทั้งสองเวอร์ชัน การเปลี่ยนแปลง 75% นี้มากกว่าสิ่งที่การเปลี่ยนเวอร์ชันทำได้ และมันอยู่ภายใต้การควบคุมของคุณทั้งหมด

ทดสอบเส้นทางเสียงและวิดีโอใหม่อย่างเจาะจง ทั้งสองรายการโฆษณารูปแบบอินพุตห้าแบบเดียวกัน แต่การ์ดข้อมูลจำเพาะของ Artificial Analysis สำหรับ 1.2 บันทึกเพียงข้อความและรูปภาพตามที่ประเมินไว้ Meta เขียนคำโปรยใหม่ให้ออกห่างจากงานสื่อผสม ไม่มีหน่วยงานอิสระใดตรวจสอบว่าความสามารถดังกล่าวยังคงอยู่

เก็บ 1.1 ไว้ให้เข้าถึงได้ในฐานะตัวสำรอง การรันทั้งสองเวอร์ชันภายใต้คีย์เดียวกันหมายความว่าการโรลแบ็กเป็นการเปลี่ยนคอนฟิก ไม่ใช่เหตุการณ์ขัดข้อง และยังให้คุณเทสต์ A/B ทั้งสองบนทราฟฟิกจริง แทนที่จะเถียงกันเรื่องเบนช์มาร์ก

ตอนนี้ใครเดิน ใครรอ

ย้ายเลย หากคุณใช้เอเจนต์เขียนโค้ดแบบ long-horizon ที่ระดับการใช้เหตุผลสูง งานเหล่านี้ใช้เวลาเป็นนาทีอยู่แล้ว ค่าเสียหายด้านความหน่วงจึงกลืนหายไปกับเวลานั้น การเพิ่มขึ้นของความฉลาดวัดโดยบุคคลที่สาม ไม่ใช่การอ้างของ Meta และดัชนีสามจุดคือการกระโดดที่มีนัยสำคัญในระดับนี้ — เก้าอันดับบนตารางที่มี 185 โมเดล

เดี๋ยวก่อนหากสิ่งที่คุณให้บริการเป็นแบบโต้ตอบ ไม่มีการกำหนดค่าใดที่ 1.2 จะตอบสนองได้เร็วกว่า 1.1 และการใช้เหตุผลแบบบังคับหมายความว่าคุณไม่สามารถซื้อความตอบสนองกลับคืนมาได้ด้วยการปิดการคิด เวอร์ชัน 1.1 ยังคงเป็นโมเดลที่เร็วกว่าในทุกระดับความพยายาม และมีค่าใช้จ่ายเท่าเดิมทุกประการ

เดี๋ยวก่อนหากปริมาณงานของคุณคือการวิเคราะห์สื่อผสม — กรณีการใช้งานรายงานยาว วิดีโอและเสียง ที่ 1.1 ถูกสร้างและทำการตลาดไว้อย่างชัดเจน Meta หยุดโฆษณามัน และการประเมินอิสระเพียงครั้งเดียวของ 1.2 ครอบคลุมข้อความและรูปภาพ ความสามารถนี้อาจยังคงอยู่ เพียงแต่ไม่มีหลักฐานใดๆ ทั้งสองทาง และ 1.1 มีหลักฐานหนึ่งเดือนในเรื่องนี้

เดี๋ยวก่อนถ้าคุณต้องการข้อมูลอารีน่า โมเดลที่วางขายบนจุดขายเรื่องการสร้างทั้งรีพอสิทอรี โดยไม่มีรายการใน Design Arena และไม่มีดัชนีย่อยด้าน agentic ที่เผยแพร่ กำลังขอให้คุณเชื่อคำพูดของ Meta ในสิ่งที่มันเปลี่ยนไป ให้เวลาสามหรือสี่สัปดาห์ แล้วสิ่งนั้นจะไม่เป็นความจริงอีกต่อไป — ณ จุดนั้น การตัดสินใจนี้จะง่ายขึ้นมากที่จะทำบนพื้นฐานของหลักฐาน มากกว่าตัวเลขประกอบเพียงตัวเดียว

การเปรียบเทียบในบทความนี้1

ตรวจพบจากบทความนี้ · เบนช์มาร์ก: Artificial Analysis · อัปเดตทุกวัน

© 2026 OrcaRouter

สำหรับผู้ให้บริการ

ให้บริการแพลตฟอร์มการอนุมานอยู่หรือไม่ นำโมเดลของคุณขึ้น OrcaRouter

ติดต่อเรา

เข้าร่วมคอมมูนิตี้ของเรา

DiscordEmailXGitHubYouTube