การ์ด hero ที่สร้างขึ้นมีหัวข้อ 'Step 5 Preview vs Muse Glimmer - API กับแล็ปท็อป' การ์ดซ้าย 'Step 5 Preview' ระบุว่า: ดัชนี AA 44 เทียบกับค่ามัธยฐานของกลุ่มที่ 26, StepFun, ประกาศเมื่อ 20 ก.ย. 2026, ประมาณ 600B พารามิเตอร์ทั้งหมด / 27B ที่ใช้งานอยู่, คอนเท็กซ์ 1M โทเค็น, $1.00 ต่ออินพุต / $2.70 ต่อเอาต์พุต ต่อ 1M โทเค็น, รันบนเซิร์ฟเวอร์ของผู้ให้บริการ การ์ดขวา 'Muse Glimmer' ระบุว่า: ดัชนี AA 17, Meta Superintelligence Labs, เปิดตัวเมื่อ 10 ส.ค. 2026, พารามิเตอร์ 30B ที่ 4-bit ภายใต้ 20 GB, คอนเท็กซ์ 131K โทเค็น ขยายได้ถึง 262K, Apache 2.0, รันบน GPU ของคุณเองแบบออฟไลน์ ส่วนท้ายระบุว่า 'ตัวเลขดัชนีอ้างอิงจาก Artificial Analysis; ข้อมูลจำเพาะของ Muse Glimmer อ้างอิงจาก Meta'
Guides & Insights

Step 5 Preview vs Muse Glimmer: Frontier API และโมเดลแล็ปท็อป

ผู้เขียน

Alistair Wren

วันที่เผยแพร่

โมเดลล่าสุด · 20ดูโมเดลทั้งหมด →
เบนช์มาร์ก: Artificial Analysis · อัปเดตทุกวัน
กลับไปยังโพสต์ทั้งหมด

บนตารางจัดอันดับ Step 5 Preview กับ Muse Glimmer ไม่ได้ใกล้กันเลย: 44 ต่อ 17 บน Artificial Analysis Intelligence Index — ช่องว่างยี่สิบเจ็ดจุดบนสเกลที่ผู้นำคนปัจจุบันอยู่ที่ปลายห้าสิบ — เป็นช่องว่างที่ต่อให้ปรับจูนมากแค่ไหนก็ปิดไม่ได้ แต่ในคำถามที่ทีมงานต้องตอบจริง ๆ — โทเคนของฉันไปวิ่งอยู่ที่ไหน — ทั้งสองคือคู่แข่งที่แข่งกันตรง ๆ Step 5 Preview เป็นเรือธงของ StepFun เปิดตัวเมื่อ 20 กันยายน 2026 มีพารามิเตอร์รวมราว 6 แสนล้าน โดยมีพารามิเตอร์ที่ทำงานอยู่ 27,000 ล้าน คอนเท็กซ์ 1 ล้านโทเคน ราคา 1.00 ดอลลาร์ต่ออินพุตหนึ่งล้านโทเคน และ 2.70 ดอลลาร์ต่อเอาต์พุตหนึ่งล้านโทเคน และเข้าถึงได้ทางเครือข่ายเท่านั้น Muse Glimmer เป็นโมเดลเอเจนต์แบบเปิดน้ำหนักของ Meta Superintelligence Labs ขนาด 30,000 ล้านพารามิเตอร์ เปิดตัวเมื่อ 10 สิงหาคม 2026 ภายใต้สัญญาอนุญาต Apache 2.0 จัดส่งมาในรูปแบบควอนไทซ์ 4 บิต จึงพอดีกับหน่วยความจำที่ไม่ถึง 20 GB และรันบน GPU สำหรับผู้ใช้ทั่วไปเพียงตัวเดียวโดยไม่ต้องต่อเครือข่าย วิธีอ่านคู่นี้ให้ถูกไม่ใช่ "ตัวไหนฉลาดกว่า" แต่คือ "ในสองข้อจำกัดนี้ — ความสามารถ หรือ ขอบเขตการเข้าถึง — ข้อไหนคือข้อที่งานของคุณเลี่ยงไม่ได้"

การเปรียบเทียบนี้ยังเป็นเครื่องช่วยแก้ไขที่มีประโยชน์ต่อนิสัยหนึ่งที่ตลาดนี้ติดมา นั่นคือการมองคะแนนดัชนีแบบรวมเป็นมูลค่าทั้งหมดของโมเดล ช่องว่าง 27 จุดนั้นเป็นของจริง และไม่ใช่ตัวเลขเดียวในไฟล์นี้ ในด้านการดึงข้อมูลบริบทยาว คณะกรรมการอิสระชุดเดียวกันจัดให้ Muse Glimmer อยู่ในระยะห่างเพียงครึ่งคะแนนจากโมเดลแบบเปิดน้ำหนักจากคลาสน้ำหนักที่ใหญ่กว่ามาก และเบนช์มาร์กเชิงเอเจนต์ของ Meta เองก็น่านับถือสำหรับโมเดลที่รันบนแล็ปท็อป ในขณะเดียวกัน จุดอ่อนที่ถูกอ้างถึงมากที่สุดของ Step 5 Preview ไม่ใช่เรื่องความสามารถเลย แต่เป็นความฟุ่มเฟือยทางคำพูด และมันยังปิดอยู่จนกว่าเวตที่สัญญาไว้จะมาถึงในวันที่ 15 ตุลาคม

สองโมเดล สองวัตถุที่แตกต่างกันโดยสิ้นเชิง

Step 5 Preview เป็นระบบ Mixture-of-Experts ที่ให้บริการจากโครงสร้างพื้นฐานของ StepFun: พารามิเตอร์รวมประมาณ 600B เปิดใช้งาน 27B ต่อโทเคน รับอินพุตทั้งข้อความและภาพ มีหน้าต่างบริบท 1M โทเคน และมีคะแนน Intelligence Index อิสระอยู่ที่ 44 เทียบกับค่ามัธยฐานของโมเดลที่เทียบเคียงกันได้ที่ 26 เอาต์พุตของมันทำงานที่ 87 โทเคนต่อวินาที เทียบกับค่าเฉลี่ย 78 จากการวัดของบอร์ดเดียวกัน และมันสร้างโทเคนเอาต์พุตประมาณ 160 ล้านโทเคนทั่วทั้งชุดงานของดัชนี ขณะที่โมเดลค่ามัธยฐานปล่อยออกมาประมาณ 82 ล้าน — ราวสองเท่าของข้อความต่อหนึ่งหน่วยงาน โดยคิดค่าบริการที่ $2.70 ต่อล้าน น้ำหนัก BF16 ถูกสัญญาไว้สำหรับวันที่ 15 ตุลาคม 2026 และยังไม่ปรากฏใน repository ดังนั้นในตอนนี้โมเดลจึงมีให้คุณใช้ในรูปแบบ API เท่านั้น

Muse Glimmer เป็นสิ่งที่ตรงกันข้าม มันเป็นโมเดลขนาด 30B พารามิเตอร์ที่ฝึกด้วยการกลั่นลอจิตจากโมเดลครู Muse Spark ที่ใหญ่กว่าของ Meta จากนั้นปรับแต่งละเอียดบนข้อมูลเอเจนติกบริบทยาวและเสริมกำลังสำหรับการใช้เครื่องมือ Meta เปิดตัวมันในเวอร์ชันควอนไทซ์ 4 บิต ซึ่งลดหน่วยความจำจากมากกว่า 55 GB ที่ความแม่นยำเต็มลงเหลือต่ำกว่า 20 GB — ภายในกรอบ VRAM 24 GB หรือ 32 GB — และมันถูกทดสอบโดย Meta บน Nvidia RTX 5090 และบนซิลิคอน Apple M4 Max และ M5 Max มันรับอินพุตข้อความและภาพในภาษามากกว่าร้อยภาษา รองรับบริบท 131,072 โทเค็นที่ขยายได้ถึง 262,144 และถูกสร้างมาเพื่อรับเป้าหมาย แบ่งเป็นขั้นตอน เรียกใช้เครื่องมือ และลองใหม่เมื่อการเรียกล้มเหลวแทนที่จะหยุด มันเป็น Apache 2.0 และทำงานแบบออฟไลน์

• คะแนนอิสระ — Step 5 Preview: 44 เทียบกับค่ามัธยฐานที่ 26 ในระดับเดียวกัน เมื่อเทียบกับ Muse Glimmer: 17 บนดัชนีเดียวกันในคอนฟิกูเรชันระดับสูงของมัน

• ขนาด — Step 5 Preview: รวมประมาณ 600B, ทำงาน 27B ต่อ StepFun เทียบกับ Muse Glimmer: 30B, ควอนไทซ์เป็น 4-bit ภายใต้ 20 GB

• หน้าต่างบริบท — Step 5 Preview: 1M โทเคน เทียบกับ Muse Glimmer: 131,072 ซึ่งขยายได้ถึง 262,144 ตามข้อมูลของ Meta

• ราคา — Step 5 Preview: $1.00 ขาเข้า / $2.70 ขาออก ต่อล้านโทเค็น เมื่อเทียบกับที่ประกาศไว้กับ Muse Glimmer: ไม่คิดค่าบริการต่อโทเค็น คุณต้องจัดหา GPU เอง

• รันที่ไหน — Step 5 Preview: เซิร์ฟเวอร์ของผู้ขาย ผ่าน HTTP เทียบกับ Muse Glimmer: ฮาร์ดแวร์ของคุณเอง แบบออฟไลน์

• สัญญาอนุญาต — Step 5 Preview: พรีวิวแบบปิด โดยสัญญาว่าจะปล่อยเวตโมเดลในวันที่ 15 ตุลาคม 2026 เทียบกับ Muse Glimmer: Apache 2.0 ดาวน์โหลดได้เลยตอนนี้

• การดึงข้อมูลบริบทขนาดยาว — Muse Glimmer ทำคะแนนได้ 80.0 ในการประเมินการให้เหตุผลกับบริบทขนาดยาวของ index board ห่างจากโมเดลที่ราคาสูงกว่าหลายเท่าไม่ถึงครึ่งคะแนน และใกล้เคียงกับคะแนนของ Step 5 Preview มากพอที่ความต่างนี้จะไม่ส่งผลต่อการตัดสินใจสำหรับงานค้นหาข้อเท็จจริง

ยี่สิบเจ็ดประเด็น และสิ่งที่ประเด็นเหล่านี้ไม่ได้วัด

โมเดลขนาด 30B ที่ถูกกลั่นให้ทำงานในหน่วยความจำ 20 GB ย่อมแพ้โมเดลเรือธงขนาด 600B ในดัชนีวัดความฉลาดทั่วไป และเอกสารของ Meta เองก็ไม่ได้อ้างเป็นอย่างอื่น — หนึ่งในกรอบคำอธิบายของบริษัทระบุตรง ๆ ว่า Glimmer ไม่ได้ถูกออกแบบมาให้เทียบเท่าพลังการให้เหตุผลดิบของโมเดลคลาวด์ขนาดเต็มรูปแบบ ดังนั้นคะแนน 17 จึงไม่ใช่คำตัดสินเกี่ยวกับงานวิศวกรรม หากแต่เป็นผลลัพธ์ที่คาดไว้จากการชั่งน้ำหนักวัตถุประสงค์ที่ต่างออกไป คำถามที่ถูกต้องคือ งานใดของคุณที่ช่องว่างนี้ครอบคลุมอยู่จริง

บริบทแบบยาวคือจุดที่สองสิ่งนี้เข้าใกล้กันมากที่สุด และเป็นจุดที่สัญชาตญาณใช้ไม่ได้ผล Muse Glama ทำคะแนนได้ 80.0 ในการประเมินการให้เหตุผลด้านบริบทแบบยาวของบอร์ด — คะแนนที่คงไม่น่าจับตามองสำหรับโมเดลระดับแนวหน้า แต่กลับน่าทึ่งสำหรับโมเดลที่รันบน GPU สำหรับผู้บริโภค หากภาระงานของคุณคือการค้นคืน การสรุปความ หรือการสกัดข้อมูลจากเอกสารยาว โมเดลภายในเครื่องที่อยู่ในระดับนั้นก็ไม่ใช่เครื่องมือที่ผิดอย่างชัดเจน และการที่คำขอไม่เคยออกจากเครื่องของคุณก็เป็นฟีเจอร์ที่คุณซื้อจาก Muse ไม่ได้ไม่ว่าจะจ่ายราคาเท่าใด

จากนั้นก็มีส่วนของการเปรียบเทียบที่ตัวเลขของ Meta ไม่ได้แสดงให้เห็น การศึกษาที่ผ่านการทบทวนโดยผู้ทรงคุณวุฒิเกี่ยวกับการประสานงานแบบหลายเอเจนต์ได้ทดสอบ Muse-Glimmer-30B ในสภาพแวดล้อมแบบควบคุม — งานเดียวกัน ชุดทดสอบเดียวกัน ที่ปรึกษาชุดเดียวกัน — และพบว่ามันไม่สามารถกู้คืนแคนดิเดตใด ๆ ที่สร้างขึ้นโดยโมเดลแนวหน้าขนาดใหญ่กว่าได้ โดยล้มเหลวทั้งสามความพยายามในแต่ละการตั้งค่า นั่นคือการศึกษาเดียวของการกำหนดค่าเดียว และเป็นหลักฐานประเภทที่หน้าโมเดลไม่เคยเปิดเผย สำหรับไปป์ไลน์แบบเอเจนต์ที่ตัวประสานงานที่อ่อนกว่าต้องกู้คืนจากความล้มเหลวของโมเดลที่แข็งแกร่งกว่า มันเป็นผลลัพธ์ที่เกี่ยวข้องกับการตัดสินใจมากที่สุดในบทความนี้ และควรค่าแก่การอ่านก่อนเบนช์มาร์กใด ๆ ที่ผู้ขายอย่าง Meta รายงาน

เพื่อความครบถ้วน เบนช์มาร์กเหล่านั้นเป็นของ Meta เองและยังไม่ถูกทำซ้ำ: 76.0% บน SWE-Bench Verified, 51.2% บน SWE-Bench Pro, 51.7% บน TerminalBench 2.1, 65.9% บน OSWorld-Verified, 83.5% บน GPQA Diamond, 22% บน Humanity's Last Exam และ 75.5 บน MCP-Atlas โดยวัดเทียบกับโมเดลในระดับขนาดเดียวกัน และบ่งบอกถึงเอเจนต์ท้องถิ่นที่มีความสามารถ มากกว่าจะเป็นตัวให้เหตุผลระดับแนวหน้า

Generated two-column scoreboard card titled 'Step 5 Preview vs Muse Glimmer - the scoreboard'. The left column gives Step 5 Preview an independent index of 44, the vendor's servers as the runtime, closed preview weights, $1.00 / $2.70 per 1M tokens, about 160M output tokens against an 82M median, and wins on capability ceiling, 1M context and image input. The right column gives Muse Glimmer an independent index of 17, your own GPU offline as the runtime, Apache 2.0 weights, no per-token charge, a long-context retrieval score of 80.0 within half a point of much larger models, and wins on privacy perimeter, zero marginal cost and portability. A footer reads 'Index and long-context figures per Artificial Analysis; Muse Glimmer specifications per Meta, vendor-reported.'

ขอบเขตจริงๆ ตกอยู่ตรงไหน

ข้อได้เปรียบเชิงโครงสร้างของ Step 5 Preview คือมันทำงานที่คุณไม่สามารถทำได้ในเครื่องของคุณเอง คอนเท็กซ์ 1M โทเคน การป้อนข้อมูลภาพ คะแนนที่วัดได้ซึ่งใกล้เคียงระดับแนวหน้า และเอาต์พุต 87 โทเคนต่อวินาทีโดยไม่ต้องซื้อฮาร์ดแวร์ใด ๆ: สำหรับการร่าง การวางแผน การรีวิวโค้ดทั่วทั้งคลังโค้ดขนาดใหญ่ หรืออะไรก็ตามที่เพดานความสามารถของโมเดลเป็นคอขวด API ชนะ และ 27 คะแนนคือข้อโต้แย้งทั้งหมด ต้นทุนของสิ่งนั้นตรงกันข้ามกับของ Muse Glimmer: พรอมต์ออกไปนอกขอบเขตของคุณ ราคาถูกคิดซ้ำในทุกโทเคน และความเยิ่นเย้อของโมเดลทำให้งานที่ได้เอาต์พุตยาวมีค่าใช้จ่ายแพงกว่าที่อัตรา $2.70 บ่งชี้

Screenshot of the Artificial Analysis model page for Muse Glimmer in its high configuration, headed 'Muse Glimmer (High) Intelligence, Performance & Price Analysis', showing Meta as the creator, an open-weights release date of August 2026, an Intelligence Index of 17, and a 131k-token context window with text and image input.

ข้อได้เปรียบของ Muse Glimmer คือมันทำงานที่ไม่สามารถออกไปข้างนอกได้ ถ้าข้อมูลอยู่ภายใต้การกำกับดูแล ถ้างบความหน่วงอยู่ที่เพียงไม่กี่มิลลิวินาที ถ้าเครื่องออฟไลน์ หรือถ้าต้นทุนส่วนเพิ่มของคำขอที่ล้านต้องเป็นศูนย์ แล้วไม่มี API ใดเป็นตัวเลือก — ไม่ใช่ตัวนี้ ไม่ใช่ตัวใดเลย ราคาที่ต้องจ่ายสำหรับสิ่งนั้นคือขีดความสามารถ: คุณกำลังเลือก 17 ทั้งที่มี 44 อยู่ และในการประสานงานแบบเอเจนต์ คุณอาจกำลังเลือกผู้ประสานงานที่ไม่สามารถฟื้นตัวจากความผิดพลาดของโมเดลที่แข็งแกร่งกว่าได้

สำหรับทีมส่วนใหญ่ คำตอบไม่ใช่การเลือกอย่างใดอย่างหนึ่ง แต่เป็นการแบ่งแยก และการแบ่งแยกนั้นต้องมีที่อยู่ให้ลงตัว OrcaRouter จัดเส้นทางโมเดลมากกว่า 200 รายการไว้เบื้องหลังคีย์ API เดียวและบิลใบเดียว โดยบวกกำไร 0% และส่งต่อราคาตามรายการของผู้ให้บริการ พร้อมด้วยการสลับไปใช้ระบบสำรองอัตโนมัติและ DSL สำหรับจัดเส้นทางเพื่อส่งทราฟฟิกตามงาน ต้นทุน หรือความหน่วง ทั้ง Step 5 Preview และ Muse Glimmer ต่างก็ไม่อยู่ในแค็ตตาล็อกนั้น — เรือธงของ StepFun ไม่ได้ถูกจัดเส้นทางโดยเรา และ Glimmer เป็นไฟล์ดาวน์โหลดที่รันในเครื่อง — ดังนั้นคุณค่าที่นำเสนอจึงไม่ใช่การเข้าถึงโมเดลใดในสองตัวนี้ แต่เป็นชุดโมเดลที่คุณจะนำมาใช้เป็นมาตรฐานเปรียบเทียบกับทั้งสองตัว ซึ่งเรียกใช้ได้ด้วยคีย์เดียวตั้งแต่วันนี้ เพื่อให้การตัดสินใจระหว่างในเครื่องกับระยะไกล ถูกกำหนดโดยการกระจายงานของคุณเอง มากกว่าจะขึ้นอยู่กับหน้าของผู้ขายรายใดรายหนึ่งที่คุณอ่านเป็นครั้งสุดท้าย

Screenshot of the OrcaRouter models page at www.orcarouter.ai/models, showing 207 models from 16 providers behind one API key and one bill, with filters for input modalities, context length, input price, status, series and supported parameters, and a credits panel.

วิธีตัดสินใจ

เลือก Step 5 Preview เมื่อเพดานคือข้อจำกัด หากงานของคุณเป็นแบบปลายเปิด มัลติโมดัล บริบทยาว หรือแบบเอเจนต์ในความหมายที่ต้องมีตัววางแผนที่มีความสามารถ โมเดล API คือหนึ่งเดียวในสองตัวที่ทำสิ่งเหล่านั้นได้ และราคาของมันต่ำพอสำหรับระดับของมัน จนการนำร่องใช้งานเป็นเพียงรายการงบประมาณ ไม่ใช่โครงการ เผื่องบสำหรับความเยิ่นเย้อ วางแผนเผื่อว่ากำหนดการน้ำหนักวันที่ 15 ตุลาคมจะเลื่อน และกันเวิร์กโหลดที่ต้องไม่ออกจากอาคารไว้ไม่ให้เกี่ยวกับเรื่องนี้

เลือก Muse Glimmer เมื่อขอบเขต (perimeter) เป็นข้อจำกัด หากข้อมูลของคุณส่งออกไม่ได้ หากคุณต้องรันบนเครื่องบินหรือในโรงงาน หรือหากปริมาณการใช้งานของคุณทำให้การคิดราคาต่อโทเคนดูไม่สมเหตุสมผล โมเดล 30B Apache-2.0 ที่พอดีใน 20 GB คือทางเลือกที่ใช้ได้จริง และผลลัพธ์การดึงข้อมูลบริบทแบบยาวของมันดีพอที่ช่องว่างด้านความสามารถจะไม่ปรากฏในทุกเวิร์กโหลด ทดสอบมันในงาน orchestration ก่อนที่คุณจะเชื่อใจมันในจุดนั้น เพราะนั่นคือจุดที่หลักฐานอิสระอ่อนแอที่สุด

หากข้อจำกัดทั้งสองอย่างมีผลพร้อมกัน ก็ทำทั้งสองทางไปเลย: รันบนเครื่องสำหรับข้อมูลที่ย้ายไม่ได้ ใช้ API สำหรับงานที่ต้องใช้โมเดลที่ใหญ่กว่า และให้การตัดสินใจเรื่องการจัดเส้นทางเป็นการแก้คอนฟิก ไม่ใช่การย้ายระบบ สิ่งที่ต้องนำมาเปรียบเทียบไม่ใช่ 44 กับ 0 แต่คือข้อมูลส่วนไหนของคุณที่ยอมให้ออกจากเครื่องได้ และนั่นเป็นคำถามที่ทราฟฟิกของคุณเองเท่านั้นที่ตอบได้

© 2026 OrcaRouter

สำหรับผู้ให้บริการ

ให้บริการแพลตฟอร์มการอนุมานอยู่หรือไม่ นำโมเดลของคุณขึ้น OrcaRouter

providers@orcarouter.ai

เข้าร่วมคอมมูนิตี้ของเรา

Discordsupport@orcarouter.aiXGitHubYouTube