
Muse Spark 1.3 Max Reasoning เปิดใช้งานแล้ว: การตั้งค่าที่อยู่เบื้องหลังคะแนนสูงสุดของ Meta ตอนนี้พร้อมส่งถึงทุกคนแล้ว
- openaiใหม่OpenAI: GPT-6.1 Sol2026-09-2952ความฉลาด
- anthropicใหม่Anthropic: Claude Sonnet 5.52026-09-2856ความฉลาด
- typesafeใหม่TypeSafe: Jev 1.132026-09-24$0.04 / $0.00 ต่อ 1 ล้านโทเค็น · 221 tok/s
- OpenAIใหม่OpenAI: GPT-6 Luna2026-09-2238ความฉลาด
- OpenAIใหม่OpenAI: GPT-6 Sol2026-09-2248ความฉลาด
- Anthropicใหม่Anthropic: Claude Opus 5.52026-09-2258ความฉลาด
- xAIใหม่Grok 4.72026-09-2146ความฉลาด
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 ต่อ 1 ล้านโทเค็น · 110 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 ต่อ 1 ล้านโทเค็น · 1148 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040ความฉลาด
- OpenAIOpenAI: GPT-6 Astra2026-09-0453ความฉลาด77การเขียนโค้ด
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241ความฉลาด76การเขียนโค้ด
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245ความฉลาด76การเขียนโค้ด
- AnthropicAnthropic: Claude Fable 5.12026-09-0153ความฉลาด82การเขียนโค้ด
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 ต่อ 1 ล้านโทเค็น · 48 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 ต่อ 1 ล้านโทเค็น · 103 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642ความฉลาด72การเขียนโค้ด
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 ต่อ 1 ล้านโทเค็น · 214 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845ความฉลาด75การเขียนโค้ด
- obsidianQwen3.8 27B2026-08-1534ความฉลาด68การเขียนโค้ด
Muse Spark 1.3 — โมเดลเหตุผลชั้นแนวหน้าซึ่ง Meta Superintelligence Labs เปิดตัวเมื่อวันที่ 2 กันยายน — เพิ่งได้รับโหมดที่กระดานคะแนนของตัวเองถูกสร้างขึ้นมา เมื่อวันที่ 4 กันยายน หลังจากการทดสอบความปลอดภัยเพิ่มเติมสองวัน Meta ได้เปิดการตั้งค่าเหตุผลแบบ "max" ซึ่งใช้การคำนวณมากที่สุดของโมเดลให้กับนักพัฒนาบน Meta Model API และใน Muse Code ซึ่งเป็นเอเจนต์เขียนโค้ดบนเทอร์มินัล Alexandr Wang ประธานเจ้าหน้าที่ฝ่าย AI ประกาศการเปิดตัวบน X และบัญชี @AIatMeta ของบริษัทก็ยืนยัน; สิ่งที่เคยเป็นค่ากำหนดที่จำกัดเฉพาะ Meta และการพรีวิวสำหรับพันธมิตรตอนเปิดตัว ตอนนี้กลายเป็นระดับเหตุผลที่นักพัฒนาคนใดก็เลือกได้
ลำดับดังกล่าวมีความสำคัญ เพราะตัวเลขหลายตัวที่ครองการรายงานข่าวการเปิดตัว Muse Spark 1.3 — 75.4 บน DeepSWE v1.1, 66.9 บน OSWorld 2.0, 1,754 บน GDPval-AA v2 — มาจากการกำหนดค่าแบบ max ขณะที่โมเดลที่นักพัฒนาสามารถเรียกใช้ได้จริงนั้นมาพร้อมกับการจำกัดความพยายามในการให้เหตุผลไว้ที่ "xhigh" Meta ระบุชัดเจนในการเปิดตัวว่า max ยังอยู่ระหว่างการทดสอบความปลอดภัย แต่การแยกนี้หมายความว่าคะแนนที่ใช้เป็นพาดหัวข่าวกับโมเดลที่เรียกใช้ได้จริงเป็นสองสิ่งที่แตกต่างกันเป็นเวลาสองวัน การปล่อยเวอร์ชันในวันพฤหัสบดีทำให้ช่องว่างนั้นหายไป และทำได้โดยไม่แตะต้องราคาต่อโทเคน ตัวเลขเบนช์มาร์กในรายการดังกล่าวเป็นของ Meta เอง และยังไม่มีการทำซ้ำโดยชุดทดสอบอิสระ ทุกสิ่งที่ผู้ผลิตเป็นผู้รายงานในบทความนี้ถูกติดป้ายกำกับไว้เช่นนั้น
สิ่งที่ถูกยับยั้งไว้ — และสิ่งที่เปลี่ยนไปเมื่อวันที่ 4 กันยายน
Muse Spark 1.3 มีขั้นบันไดการให้เหตุผล (reasoning ladder) รูปแบบเดิมมาตั้งแต่ API แบบชำระเงินของตระกูลนี้เปิดตัว: การให้เหตุผลเปิดใช้งานอยู่เสมอ และพารามิเตอร์ effort ของโมเดลบน Meta Model API รับค่า minimal, low, medium, high และ xhigh โดยโมเดลจะใช้งบประมาณเอาต์พุตไปกับการคิดมากขึ้นเมื่อระดับสูงขึ้น Max อยู่เหนือระดับ xhigh — ใช้พลังประมวลผลมากขึ้น มี reasoning tokens มากขึ้น และในคำบอกเล่าของ Meta แล้ว แข็งแกร่งขึ้นอย่างมีนัยสำคัญต่องานแบบเอเจนต์ที่ต้องวางแผนระยะยาว ในการเปิดตัวเมื่อวันที่ 2 กันยายน Meta ปล่อยทุกระดับจนถึง xhigh แต่ยังไม่นำ Max เข้าสู่ API สาธารณะระหว่างรอสิ่งที่บริษัทเรียกว่าการทดสอบความปลอดภัยเพิ่มเติม และแชร์ให้เฉพาะพันธมิตรกลุ่มจำกัดเท่านั้น — พอเพียงให้การประเมินอิสระดำเนินได้ แต่ไม่พอสำหรับเวิร์กโหลดในระดับโปรดักชัน
เมื่อวันที่ 4 กันยายน Wang กล่าวว่าการทดสอบเสร็จสมบูรณ์แล้ว ตอนนี้ Max เป็นการตั้งค่าที่เลือกได้ใน Muse Code — สคริปต์การติดตั้งอยู่ที่ dev.meta.ai/install.sh — และบนรหัสโมเดล muse-spark-1.3 ผ่าน Meta Model API ซึ่งพารามิเตอร์ effort ตอนนี้รองรับค่า max Wang อธิบายการเปิดตัวแบบเหลื่อมเวลาสองวันว่าเป็นวิธีของ Meta ในการควบคุมการเข้าถึง "ในระดับการกำหนดค่า" และบอกกับ Axios ว่า Meta ไม่จำเป็นต้องหยุดงานในวงกว้างของตนเนื่องจากข้อกังวลด้านความปลอดภัย หน้าต่างเวลาสั้น แต่ถือเป็นแบบอย่างที่แท้จริง: Meta เปิดใจที่จะเก็บโหมดการให้เหตุผลเฉพาะไว้หลังการทบทวนด้านความปลอดภัย ขณะที่ปล่อยส่วนที่เหลือของ checkpoint ออกมาทันที
ข้อควรระวังเชิงปฏิบัติประการหนึ่งสำหรับผู้ที่เรียกใช้โมเดลผ่านเกตเวย์แทนที่จะใช้เอนด์พอยต์ของ Meta โดยตรง: หน้าเอกสารของบุคคลที่สามหลายหน้าและรายการจากผู้รวบรวมข้อมูลถูกเขียนขึ้นในวันเปิดตัว และยังคงระบุระดับความพยายามในการใช้เหตุผล (reasoning effort) สูงสุดเพียง xhigh เท่านั้น ค่า max เป็นการเปิดตัวฝั่ง Meta ดังนั้นโปรดตรวจสอบว่าเส้นทางที่คุณเรียกใช้ได้อัปเดตพื้นผิวพารามิเตอร์แล้วหรือไม่ ก่อนที่จะถือว่า max ใช้งานได้ — พร็อกซีที่ตรวจสอบค่าที่ยอมรับเมื่อวันที่ 2 กันยายนอาจปฏิเสธ "max" จนกว่าผู้ดูแลจะตามทัน
สิ่งที่ Max ซื้อจริง ๆ — และจุดที่มันไม่ช่วย
เอกสารของ Meta เมื่อวันพฤหัสบดีมีการแบ่งแบบชัดเจนระหว่าง max กับ xhigh ในการวัดผลที่บริษัทดำเนินการ และนี่คือสิ่งที่มีประโยชน์ที่สุดที่บริษัทเคยเผยแพร่เกี่ยวกับโมเดลนี้จนถึงตอนนี้ ทั้งหมดเป็นข้อมูลที่ผู้ขายรายงานเอง ผลิตขึ้นภายในชุดทดสอบ Muse Code ของ Meta เอง และ Meta ระบุว่าการเปรียบเทียบกับ Claude Opus 5 และ GPT-5.6 Sol เป็นการรันแบบ "best-effort" ที่การตั้งค่าสูงสุดของคู่แข่งเหล่านั้น ซึ่ง "อาจไม่สะท้อนประสิทธิภาพที่ผู้ให้บริการปรับแต่งมา" ด้วยข้อแม้นั้น การแบ่งส่วนนี้บอกทิศทางที่ชัดเจน:
• OSWorld 2.0 (งานเอเจนต์การใช้คอมพิวเตอร์) — 66.9 ที่ max เทียบกับ 57.2 ที่ xhigh
• GDPval-AA v2 (Elo ของเอเจนต์งานความรู้) — 1,754 ที่ max เทียบกับ 1,709 ที่ xhigh
• JobBench (งานอาชีพระยะยาว) — 64.9 ที่ max เทียบกับ 61.2 ที่ xhigh
• DeepSearchQA — เสมอที่ 89.4
• Terminal-Bench 2.1 (การเขียนโค้ดของเทอร์มินัลเอเจนต์) — 89.2 ที่ xhigh เทียบกับ 88.8 ที่ max ซึ่งเป็นชุดเดียวที่การกำหนดค่าที่เปิดตัวเมื่อวันที่ 2 กันยายนเป็นฝ่ายชนะ

รูปแบบนี้ควรอ่านอย่างละเอียด Max ช่วยได้มากที่สุดเมื่องานเป็น agentic loop ที่ยาว — เช่น การควบคุมคอมพิวเตอร์ การทำงานตาม brief ของงานที่ใช้ความรู้ หรือการรักษาตารางงานย่อยแบบที่ JobBench ทำ ในการทดสอบเทอร์มินัลแบบเทิร์นเดียว Max ไม่ได้เพิ่มผลลัพธ์อะไรเลยและยังมีต้นทุนเพิ่มขึ้นเล็กน้อย: Terminal-Bench คือเครื่องเตือนใจว่า “การใช้เหตุผลมากขึ้น” ไม่ใช่การอัปเกรดที่จะให้ผลดีขึ้นอย่างสม่ำเสมอเสมอไป และเป็นเหตุผลว่าทำไมคุณจึงควร A/B test ระหว่าง max กับ xhigh บนเวิร์กโหลดของคุณเอง แทนที่จะสรุปว่าการตั้งค่าที่สูงกว่าจะดีกว่าในทุกที่ Meta ยังระบุว่าผลลัพธ์ 75.4 ของ DeepSWE v1.1 — ตัวเลขพาดหัววันแรก ซึ่งเพิ่มขึ้นจาก 59.3 ที่ Meta รายงานสำหรับ Muse Spark 1.2 เมื่อหกสัปดาห์ก่อน — เป็นตัวเลขที่มาจากการตั้งค่าแบบ max และนี่คือตัวเลขที่ผู้ประเมินอิสระจะนำไปรันซ้ำเป็นลำดับแรก
การรายงานข่าวอิสระเริ่มตามทันแล้ว
สิ่งที่ขาดหายไปตอนเปิดตัวคือการวัดผลแบบอิสระใดๆ และช่องว่างนั้นกำลังถูกปิดตามกำหนดการที่บังเอิญตรงกับการเปิดตัว max ดัชนี Coding Agent ของ Artificial Analysis — ซึ่งให้คะแนนแต่ละโมเดลภายในแฮร์เนส coding-agent ดั้งเดิมของมัน และผสมผสานงาน DeepSWE, Terminal-Bench และ SWE-Atlas — จัดอันดับ Muse Spark 1.3 (max) ในแฮร์เนส Muse Code อยู่ที่ 68 ในสัปดาห์นี้ อยู่อันดับสองรองจาก Claude Opus 5 (xhigh) ใน Claude Code และนำหน้า Claude Fable 5 (max) ที่ 67 และ GPT-5.6 Sol (max) ที่ 65 บอร์ดเดียวกันให้คะแนนคอนฟิก xhigh ที่วางจำหน่ายแล้วอยู่ที่ 64 ในแฮร์เนส Muse Code เดียวกัน ซึ่งเป็นการอ่านผลแบบต่างที่ตรงกันที่สุดเท่าที่มีมาว่า max เพิ่มอะไร — ประมาณสี่จุดดัชนี — บนชุดงานอิสระ แถวบนบอร์ดนั้นถูกเผยแพร่ในขณะที่ max ยังอยู่ในช่วงพรีวิวสำหรับพันธมิตร; คอนฟิกที่อธิบายไว้คือตัวที่เปิดให้ใช้งานทั่วไปเมื่อวันที่ 4 กันยายน
Artificial Analysis ยังได้อัปเดตการ์ดโมเดลของตนเองสำหรับคอนฟิกแบบ max นับตั้งแต่การเปิดตัวเช่นกัน ในช่วงพรีวิว การ์ดฉบับนั้นไม่มีการระบุผู้ให้บริการหรือราคา แต่การ์ดที่แสดงอยู่ในปัจจุบันระบุ Meta ที่ราคามาตรฐาน $1.25 ต่อล้านโทเคนนำเข้า และ $4.25 ต่อล้านโทเคนส่งออก ซึ่งเป็นราคาเดียวกับรายการราคาของ Muse Spark 1.2 พร้อมทั้งเพิ่มข้อแม้เรื่องความเยิ่นเย้อของเอาต์พุต โดยการรันการประเมินของ AA ใช้โทเคนประมาณ 130 ล้านเทียบกับค่ามัธยฐานที่ 79 ล้าน มีค่าใช้จ่ายรวมประมาณ $1,335 และอยู่ที่ประมาณ $0.95 ต่องานตามการประมาณการต่องานของ AA ที่เอาต์พุตประมาณ 190 โทเคนต่อวินาที
ตัวเลขหนึ่งจากการรายงานก่อนหน้านี้สมควรทบทวนตามเวอร์ชันใหม่ Artificial Analysis ได้รีเฟรชดัชนี Intelligence Index เป็น v4.2 ในสัปดาห์นี้ — ซึ่งเป็นสัปดาห์เดียวกับที่ max เปิดตัว — โดยประเมินค่าของบรรดาโมเดลใหม่ทั้งหมดและขยับค่ามัธยฐาน บนการ์ดปัจจุบัน คอนฟิกูเรชัน max ให้ค่า 53 เทียบกับค่ามัธยฐานของโมเดลที่เทียบเคียงได้ที่ 29 ส่วนค่า 62 ที่เคยถูกอ้างอิงในการรายงานช่วงสัปดาห์เปิดตัวนั้นวัดจากดัชนีเวอร์ชันก่อนหน้า และสองค่านี้ไม่สามารถนำมาเทียบกันได้ ส่วนการแบ่งระหว่าง xhigh กับ max ของ Meta เองข้างต้นเป็นอิสระจากดัชนีของ AA และไม่ได้รับผลกระทบจากการรีเฟรชครั้งนี้

ค่าใช้จ่ายสูงสุดคือเท่าไร — คิดเงินตามจำนวนโทเค็น ไม่ใช่ตามรายการราคา
Meta ไม่ได้เผยแพร่ราคาแยกต่างหากสำหรับคอนฟิกูเรชันแบบ max และไม่ได้ให้การวิเคราะห์ความหน่วงเฉพาะเจาะจงด้วยเช่นกัน ราคาต่อโทเคนเหมือนกับ Muse Spark 1.2 และทุกระดับความพยายามอื่นๆ ใน Muse Spark 1.3: 1.25 ดอลลาร์ต่อล้านโทเคนอินพุต 4.25 ดอลลาร์ต่อล้านโทเคนเอาต์พุต และ 0.15 ดอลลาร์สำหรับอินพุตที่แคชไว้ในระดับมาตรฐาน โทเคนการให้เหตุผลถูกเรียกเก็บในฐานะโทเคนเอาต์พุต และนับรวมอยู่ในงบประมาณเอาต์พุต ดังนั้นการเลือก max จึงไม่ใช่การขึ้นราคาแบบแยกรายการ — แต่เป็นคำมั่นว่าจะใช้งบประมาณส่วนนั้นไปกับการคิดมากขึ้นก่อนจะตอบ
{{1}}นั่นทำให้คำถามต้นทุนที่แท้จริงกลายเป็นเรื่องของปริมาณโทเคน และข้อมูลช่วงแรกบ่งชี้ว่า max สิ้นเปลืองตรงจุดที่ xhigh ประหยัด{{/1}} {{2}}การรันแบบติดตั้งเครื่องมือวัดของ AA ใช้โทเคนไปประมาณ 130 ล้านในการประเมินคอนฟิกูเรชันเพียงครั้งเดียว{{/2}} {{3}}สำหรับนักพัฒนาที่รันลูปเอเจนต์ยาว ๆ ที่ระดับ xhigh อยู่แล้ว การทดสอบ A/B ที่สำคัญไม่ใช่ “max ทำงานสำเร็จมากกว่าหรือไม่” แต่เป็น “max ทำงานสำเร็จเพิ่มขึ้นมากพอจะคุ้มกับบิลค่าโทเคนที่ใหญ่ขึ้นอย่างมีนัยสำคัญบนเวิร์กโหลดเดียวกันหรือไม่”{{/3}}
ระดับ Contributor ของ Meta — 0.10 ดอลลาร์สำหรับ input และ 0.20 ดอลลาร์สำหรับ output ต่อล้านโทเคน เพื่อแลกกับการให้ Meta ใช้พรอมป์และคอมพลีชันของคุณฝึกโมเดล — ใช้กับเช็คพอยต์เดียวกัน และ Meta กล่าวว่านักพัฒนาเป็นเปอร์เซ็นต์สองหลักอย่างมีนัยสำคัญเลือกใช้มัน เงื่อนไขของ Contributor ทำให้ทุกสิ่งที่คุณส่งเข้าสู่ระบบกลายเป็นข้อมูลฝึก และขีดจำกัดอัตราการเรียกใช้ก็เข้มงวด ดังนั้นจึงไม่เหมาะที่จะเป็นค่าเริ่มต้นสำหรับการกระจายงานในโปรดักชัน แต่เป็นวิธีที่ใช้ได้จริงในการรันการทดลองแบบ max ที่มีค่าใช้จ่ายสูงให้ถูกลง หากคุณยอมรับข้อแลกเปลี่ยนด้านข้อมูลได้
เกณฑ์อ้างอิงด้านราคาของทั้งหมดนี้ตรวจสอบได้ง่ายโดยไม่ต้องเชื่อคำพูดของ Meta เพราะ checkpoint Muse Spark 1.3 มีราคาเท่ากับรุ่นที่ขึ้นรายการบน OrcaRouter อยู่แล้วที่ราคารายการของ Meta เอง:Muse Spark 1.2 ขึ้นรายการบน OrcaRouter ที่ราคา $1.25 ต่อล้านโทเคนสำหรับอินพุต และ $4.25 ต่อล้านโทเคนสำหรับเอาต์พุต โดยไม่มีการบวกเพิ่ม ด้วยเหตุนี้ ข้อกล่าวอ้างที่ว่า “ราคาไม่เปลี่ยนแปลง” จึงตรวจสอบได้จากหน้าเว็บจริงซึ่งตัวเลขเหล่านั้นปรากฏอยู่ Muse Spark 1.3 เองยังไม่มีรายการบน OrcaRouter ในตอนนี้ เมื่อผู้ให้บริการที่อยู่ในระบบของเราเริ่มให้บริการรุ่นนี้ด้วย max ราคาที่แสดงทางฝั่งเราจะเป็นราคารายการของ Meta ที่ส่งผ่านตรง ๆ โดยเราไม่บวกเพิ่มจากราคาผู้ให้บริการ และเมื่อ Meta ลดราคา การลดนั้นก็จะมีผลในวันเดียวกับที่ Meta ประกาศ สำหรับการเปิดตัวในรูปแบบนี้ ซึ่งความน่าสนใจทางเศรษฐศาสตร์อยู่ที่ปริมาณโทเคน ไม่ใช่ราคาที่ประกาศออกมา การส่งผ่านราคาตรง ๆ เช่นนี้คือสิ่งที่ทำให้ตัวเลขที่คุณถูกเรียกเก็บจริงเท่ากับตัวเลขที่ Meta เผยแพร่.

ใครควรเปลี่ยนเป็น max
การตัดสินใจแยกออกอย่างชัดเจน:
• เปลี่ยนไปใช้สำหรับงานเอเจนต์แบบระยะยาว — การใช้คอมพิวเตอร์ บรีฟงานที่ใช้ความรู้ และการวนลูปเครื่องมือหลายขั้นตอนใน Muse Code — ซึ่งทั้งชุดข้อมูลแยกของ Meta เองและลีดเดอร์บอร์ดเอเจนต์เขียนโค้ดของ AA ต่างแสดงการเพิ่มสูงสุดมากที่สุด ควรทำ A/B เทียบกับ xhigh บนตัวอย่างงานจริงของคุณก่อน เพราะความเยิ่นเย้อเป็นเรื่องจริง
• ให้ใช้ xhigh สำหรับการเรียกใช้ที่มีปริมาณสูง อ่อนไหวต่อความหน่วง หรือเป็นการสนทนาแบบเทิร์นเดียวสั้นๆ ซึ่ง max ส่วนใหญ่จะเพิ่มเพียงแค่โทเค็น Terminal-Bench คือข้อพิสูจน์ว่ามันไม่ได้เพิ่มความสามารถเสมอไป
• จากตรงนี้ ให้จับตาสามสิ่ง: การปล่อย open-weights ที่ Zuckerberg สัญญาไว้โดยยังไม่มีกำหนดวัน, การเปิดตัว Muse Spark 1.3 สู่ผู้บริโภคบน Instagram, Facebook และ Meta AI ในอีกไม่กี่สัปดาห์ข้างหน้า และว่ากระดาน coding-agent ของ Artificial Analysis จะเริ่มคิดราคาสำหรับแถว max หรือไม่ เนื่องจากการกำหนดค่าดังกล่าวพร้อมใช้งานทั่วไปแล้ว
การหน่วงเวลาสองวันกลายเป็นเรื่องสั้น แต่ก็ได้สร้างข้อพิสูจน์ที่ยืนยาวเกินกว่าตัวการเปิดตัว: ตัวเลขที่แข็งแกร่งที่สุดของ Muse Spark 1.3 ของ Meta ไม่เคยเป็นภาพลวงตา — พวกมันเพียงแค่รอการตรวจสอบความปลอดภัย ณ วันที่ 4 กันยายน โมเดลที่นักพัฒนาสามารถเรียกใช้ได้และโมเดลที่อยู่บนกระดานคะแนนก็เป็นโมเดลเดียวกันในที่สุด ส่วนคำถามที่ว่า max คุ้มค่ากับโทเค็นหรือไม่ ตอนนี้เป็นคำถามเชิงประจักษ์ที่นักพัฒนาทุกคนสามารถตอบได้ ไม่ว่าจะผ่านทาง API ของ Meta หรือเส้นทางที่พวกเขาใช้เข้าถึงตระกูล Muse Spark อยู่แล้ว
การเปรียบเทียบในบทความนี้1
ตรวจพบจากบทความนี้ · เบนช์มาร์ก: Artificial Analysis · อัปเดตทุกวัน
