
Muse Spark 1.2 กับ Muse Spark 1.1: คุณควรอัปเกรดหรือไม่?
- metaใหม่Meta: Muse Spark 1.22026-08-0557ความฉลาด72การเขียนโค้ด
- qwenใหม่Qwen: Qwen3.8 Max2026-08-0358ความฉลาด72การเขียนโค้ด
- deepseekใหม่DeepSeek: DeepSeek V4 Flash 07312026-07-3152ความฉลาด69การเขียนโค้ด
- qwenใหม่Qwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 ต่อ 1 ล้านโทเค็น · 2038 tok/s
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463ความฉลาด78การเขียนโค้ด
- googleGoogle: Gemini 3.6 Flash2026-07-2152ความฉลาด69การเขียนโค้ด
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137ความฉลาด49การเขียนโค้ด
- metaMeta: Muse Spark 1.12026-07-1653ความฉลาด71การเขียนโค้ด
- kimiMoonshotAI: Kimi K32026-07-1560ความฉลาด76การเขียนโค้ด
- openaiOpenAI: GPT-5.6 Luna2026-07-0952ความฉลาด71การเขียนโค้ด
- openaiOpenAI: GPT-5.6 Terra2026-07-0957ความฉลาด77การเขียนโค้ด
- openaiOpenAI: GPT-5.6 Sol2026-07-0961ความฉลาด77การเขียนโค้ด
- grokxAI: Grok 4.52026-07-0856ความฉลาด72การเขียนโค้ด
- tencentTencent: Hy32026-07-0642ความฉลาด59การเขียนโค้ด
- obsidianQwen3.6 35B A3B Uncensored (Aggressive)2026-07-0232ความฉลาด42การเขียนโค้ด
- obsidianGemma4 26B A4B Uncensored (Balanced)2026-07-0226ความฉลาด39การเขียนโค้ด
- anthropicAnthropic: Claude Sonnet 52026-06-3055ความฉลาด72การเขียนโค้ด
- klingKling: Kling 3.0 Turbo2026-06-1757ความฉลาด52การเขียนโค้ด57คณิตศาสตร์
- z-aiZ.ai: GLM 5.22026-06-1653ความฉลาด69การเขียนโค้ด60คณิตศาสตร์
Meta แทนที่ Muse Spark 1.1 ด้วย Muse Spark 1.2 เมื่อวันที่ 5 สิงหาคม 2026 โดยไม่มีการเปลี่ยนแปลงราคา หน้าต่างบริบท รายการโมดัลลิตี พารามิเตอร์ที่รองรับ หรือระดับการใช้เหตุผล การย้ายครั้งนี้จึงดูเหมือนไม่มีค่าใช้จ่าย — ตระกูลสตริงโมเดลเดียวกัน การเรียกเก็บเงินเดียวกัน ไม่มีอะไรต้องเจรจาใหม่ แต่มันไม่ได้ฟรี การวัดโดยอิสระระบุว่าเวลาจนถึงโทเคนแรกของเวอร์ชันใหม่อยู่ที่ 26.12 วินาที เทียบกับเวอร์ชันเก่าที่ 2.90 วินาที และอัตราการส่งออกต่อเนื่องอยู่ที่ 165 โทเคนต่อวินาที เทียบกับ 213.5 คุณกำลังซื้อความฉลาดที่วัดได้สามจุด พร้อมกับเวลารอที่ยาวขึ้นประมาณเก้าเท่าก่อนที่สิ่งใดจะตอบกลับมา
การจะทำเช่นนั้นคุ้มค่าหรือไม่นั้นแทบจะขึ้นอยู่กับว่างานของคุณใช้เวลานานเพียงใด นี่คือสิ่งที่แตกต่างจริง ๆ สิ่งที่ยังคงเหมือนเดิม และสิ่งที่ยังไม่มีใครสามารถบอกคุณได้ในขณะนี้
การตัดสินใจในสี่บรรทัด
• ดัชนีความฉลาด: 51 → 54ซึ่งวัดโดยอิสระโดย Artificial Analysis ในการตั้งค่า xhigh ของแต่ละเวอร์ชัน
• เวลาจนถึงโทเคนแรก: 2.90s → 26.12s โดยใช้แหล่งข้อมูลเดียวกันและเงื่อนไขเดียวกัน
• ค่าใช้จ่ายในการรันชุดเกณฑ์มาตรฐานที่เหมือนกัน: $548.07 → $637.85 โดยอิงราคาต่อโทเค็นที่เหมือนกัน ส่วนที่เพิ่มขึ้น 16% คือการเผาโทเค็นล้วนๆ
• ทุกสิ่งที่แบบฟอร์มการจัดซื้อสอบถาม: ไม่มีการเปลี่ยนแปลง

อะไรที่เหมือนกันอย่างแท้จริง
สิ่งนี้ควรค่าแก่การแจกแจง เพราะมันคือเหตุผลที่การโยกย้ายระบบดูเหมือนเป็นเรื่องง่ายบนกระดาษ และเพราะความแตกต่างที่ไม่มีอยู่จริงคือสิ่งที่คุณไม่จำเป็นต้องทดสอบ
• ราคา — 1.25 ดอลลาร์ต่อหนึ่งล้านโทเคนอินพุต, 4.25 ดอลลาร์ต่อหนึ่งล้านโทเคนเอาต์พุต, 0.15 ดอลลาร์ต่อหนึ่งล้านโทเคนเมื่อแคชถูกใช้งาน, 2.50 ดอลลาร์ต่อหนึ่งพันครั้งของการค้นหาเว็บในตัว ตัวเลขทุกตัวเหมือนกันทั้งสองเวอร์ชัน
• บริบท — ทั้งสองมี 1,048,576 โทเคน โดยไม่มีระดับค่าธรรมเนียมเพิ่มเติมสำหรับบริบทแบบยาวในทั้งสอง
• รูปแบบ — รับข้อมูลเป็นข้อความ รูปภาพ วิดีโอ เสียง และ PDF; ส่งออกเป็นข้อความ ทั้งสองรายการระบุอินพุตห้าประเภทเดียวกัน
• แป้นปรับระดับการใช้เหตุผล — จำเป็นในทั้งสองเวอร์ชัน, มีห้าระดับ (minimal, low, medium, high, xhigh), ค่าเริ่มต้นคือ medium ในทั้งสอง. ไม่มีตัวตั้งค่าในเวอร์ชันใดที่ปิดการคิดได้
• พารามิเตอร์ — tools, tool_choice, structured_outputs, response_format, reasoning_effort, include_reasoning, max_tokens, temperature, top_p, top_k, repetition_penalty. รายการเหมือนกัน
• การให้บริการ — ผู้ให้บริการรายเดียวคือ Meta เอง ทั้งสองฝั่ง ไม่มีโฮสต์ของบุคคลที่สาม ไม่มีตัวแปร quantization
• ราคาแบบผสม — Artificial Analysis กำหนดราคาทั้งสองที่ 0.78 ดอลลาร์ต่อล้านโทเคนตามการถ่วงน้ำหนักแบบผสม ซึ่งเป็นสิ่งที่คาดหวังได้จากอัตราค่าบริการที่เหมือนกัน
หากคุณหวังว่าการอัปเกรดนี้จะมาพร้อมกับบริบทที่มากขึ้น การการันตีความยาวเอาต์พุต หรือแคชที่ถูกลง มันก็ไม่ได้เป็นเช่นนั้น นี่คือการปล่อยโมเดลแบบ weights-and-post-training โดยมีเรตการ์ดที่ก็อปปี้มาจากเวอร์ชันก่อนหน้า
อะไรที่เคลื่อนไปจริงๆ
Artificial Analysis เป็นหน่วยงานอิสระเพียงรายเดียวในปัจจุบันที่ได้ประเมินทั้งสองเวอร์ชัน และได้ประเมินทั้งสองที่ระดับการใช้เหตุผลสูงสุด ดังนั้นการเปรียบเทียบจึงเป็นการเปรียบเทียบแบบเทียบเคียงโดยตรง
• ดัชนีความฉลาด — 51 สำหรับเวอร์ชัน 1.1 (อันดับที่ 22 จาก 185) ถึง 54 สำหรับเวอร์ชัน 1.2 (อันดับที่ 13) ขยับขึ้น 9 อันดับบนกระดานจัดอันดับ ซึ่งค่ามัธยฐานของชั้นเรียนอยู่ที่ 32 ดังนั้นการเพิ่มขึ้นนี้จึงได้ตำแหน่งที่แท้จริงมา ไม่ใช่แค่ทศนิยมที่มากขึ้น
• เวลาจนถึงโทเคนแรก — 2.90 ถึง 26.12 วินาที นี่คือการถดถอยหลักและไม่ใช่เรื่องเล็กน้อย
• ความเร็วเอาต์พุต — 213.5 ถึง 165.0 โทเคนต่อวินาที ยังคงอยู่อันดับที่ 16 จาก 185 และยังคงถูกอธิบายโดย Artificial Analysis ว่า "เร็วอย่างเห็นได้ชัด" แต่ช้าลง 23% เมื่อเทียบกับรุ่นที่แทนที่
• ความฟุ่มเฟือย — โทเค็นเอาต์พุต 94M เพื่อผ่านดัชนี เทียบกับ 95M แทบไม่เปลี่ยนแปลง และทั้งคู่สูงกว่าค่ามัธยฐาน 65M ประมาณ 45%
• ค่าใช้จ่ายในการประเมินทั้งหมด — $548.07 ถึง $637.85. เนื่องจากความยาวของเอาต์พุตแทบไม่เปลี่ยนแปลง และราคาก็ไม่เปลี่ยนแปลงเลย การเพิ่มขึ้น 16% จึงมาจากที่อื่นนอกเหนือจากเอาต์พุตที่มองเห็นได้: การให้เหตุผลภายในที่ยาวขึ้น การลองใหม่มากขึ้น หรือการเรียกใช้เครื่องมือต่อหนึ่งงานที่มากขึ้น
รูปแบบนี้สอดคล้องกัน Meta ไม่ได้ทำให้โมเดลถูกลง เร็วขึ้น หรือใหญ่ขึ้น แต่ทำให้โมเดลใช้เวลาคิดนานขึ้นก่อนจะตัดสินใจ และการคิดเพิ่มเติมนั้นแสดงออกมาเป็นความหน่วง ความเร็วในการสตรีมที่ช้าลงเล็กน้อย และค่าใช้จ่ายที่สูงขึ้น 16% สำหรับงานที่เหมือนกัน สิ่งที่ได้มาคือจุดดัชนีสามจุด
ความหน่วงนั้นแย่แค่ไหนกันแน่
ตัวเลข 26.12 วินาทีนี้จะถูกนำไปอ้างอิงโดยไม่พิจารณาบริบท ดังนั้นควรตีความให้ถูกต้อง: ค่านี้วัดที่ xhigh ซึ่งเป็นระดับความพยายามที่แพงที่สุดจากห้าระดับ บนชุดเกณฑ์มาตรฐานที่ออกแบบมาให้ยาก. ค่าเริ่มต้นของ API คือ medium.
เพื่อให้เห็นภาพว่าค่าเริ่มต้นให้ความรู้สึกอย่างไรจริง ๆ Muse Spark 1.1 บน OrcaRouter — ซึ่งให้บริการผู้โทรจริงตามระดับความพยายามที่พวกเขาร้องขอ — แสดงค่า p50 เวลาจนถึงโทเคนแรกคือ 1.84 วินาที และ p95 คือ 6.00 วินาที ตลอดสัปดาห์หมุนเวียน. นี่คือข้อมูลการผลิตจริงที่ระดับความพยายามตามจริง และต่ำกว่าตัวเลขเกณฑ์อ้างอิงมากกว่าหนึ่งลำดับความสำคัญ. เวอร์ชัน 1.2 ยังไม่มีเทเลเมทรีจากการผลิตจริง

ดังนั้นการอ่านอย่างตรงไปตรงมาจึงไม่ใช่ "1.2 ใช้เวลา 26 วินาทีในการตอบสนอง" แต่เป็น: ในการตั้งค่าที่ 1.2 ได้รับคะแนนพิเศษสามคะแนน โทเค็นแรกจะทำให้คุณเสียเวลา 26 วินาที และในการตั้งค่าเดียวกัน โมเดลเก่าทำให้คุณเสียเวลาเพียงสามวินาที หากคุณรันที่ระดับ xhigh อยู่แล้ว ซึ่งเป็นคอนฟิกที่การเพิ่มความฉลาดเกิดขึ้นจริง คุณก็จะได้รับตัวเลขนั้น หากคุณรันที่ระดับ medium หรือต่ำกว่า คุณจะเห็นค่าที่สั้นกว่ามาก และคุณจะเห็นการปรับปรุงที่น้อยลงด้วย
การผูกโยงนั้นคือกับดักที่แท้จริงในการอัปเกรดครั้งนี้ คุณไม่สามารถจะได้ความชาญฉลาดมาโดยไม่ผ่านการไตร่ตรอง เพราะการไตร่ตรองคือที่มาของความชาญฉลาดนั้น
การ repositioning เบื้องหลังตัวเลข
Meta ไม่ได้เผยแพร่โพสต์เปิดตัวสำหรับ 1.2 — หน้าเพจประกาศ Muse Spark ยังคงอธิบายถึง 1.1 — แต่ได้เขียนคำอธิบายผลิตภัณฑ์ใหม่ และการเขียนใหม่นั้นอธิบายถึงข้อแลกเปลี่ยน
Muse Spark 1.1 ถูกวางจำหน่ายในฐานะโมเดลการให้เหตุผลแบบมัลติโมดัลที่มีพื้นผิวอินพุตกว้างอย่างไม่ธรรมดา โดยมุ่งเป้าไปที่ "เอเจนต์มัลติโมดัล, การวิจัยเชิงลึกเหนือสื่อผสม, และการวิเคราะห์บริบทยาว": รายงานยาว, คลังสื่อ, การบันทึก และวิดีโอควบคู่กับข้อความ
คำอธิบายของ Muse Spark 1.2 ละทิ้งเกือบทั้งหมดนั้น และหันไปกล่าวถึงวิศวกรรมซอฟต์แวร์แทน — การปรับโครงสร้างหลายไฟล์ การดีบักที่ยาวนาน การสร้างทั้งรีโพซิทอรี — จากนั้นก็เพิ่มข้อกล่าวอ้างเรื่องหลายเอเจนต์อย่างชัดเจน: โมเดลสามารถทำหน้าที่เป็นเอเจนต์หลักที่รวบรวมบริบท วางแผน และมอบหมายงาน หรือเป็นเอเจนต์ย่อยที่ทำงานแบบขนานภายใต้เอเจนต์หลัก นอกจากนี้ยังอ้างว่าการแคชพรอมป์สามารถลดต้นทุนจริงได้ 60–80% ขึ้นอยู่กับปริมาณบริบทที่ซ้ำกันระหว่างการเรียกใช้ ตัวเลขสุดท้ายนั้นเป็นการประมาณการของ Meta มากกว่าผลลัพธ์ที่วัดได้ แม้ว่าอัตราการแคชที่ $0.15 จะทำให้ตัวเลขดังกล่าวมีความน่าเชื่อถือทางคณิตศาสตร์ก็ตาม
อ่านการถดถอยของ latency เทียบกับการปรับตำแหน่งใหม่นั้น แล้วมันก็ไม่ดูเหมือนความผิดพลาดอีกต่อไป ไม่มีใครที่รีแฟกเตอร์ไฟล์เป็นโหลจะสนใจการวางแผน 26 วินาที Meta เลือกลูกค้าคนหนึ่ง และไม่ใช่รายที่ 1.1 ถูกขายให้
สิ่งที่ 1.1 ยังมีอยู่ แต่ 1.2 ไม่มี
การมีอายุเพียงสี่สัปดาห์ไม่เพียงพอที่จะสะสมประวัติการทำงาน และในสามด้านที่เป็นรูปธรรม รุ่นที่เก่ากว่ายังคงเป็นผลิตภัณฑ์ที่มีข้อมูลประกอบดีกว่าในขณะนี้
• สถิติในสนามประลอง. Muse Spark 1.1 มีประวัติใน Design Arena อย่างมาก: 1334 Elo ในอันดับที่ 5 ด้านการพัฒนาเกม, 1334 ในอันดับที่ 7 ด้านคอมโพเนนต์ UI, 1320 ในอันดับที่ 3 ด้าน ASCII art, 1318 ด้านการแสดงข้อมูลเป็นภาพ, 1309 ในหมวดหมู่โค้ดทั่วไป, รวมถึง ladder ที่สมบูรณ์ของ agents-arena ซึ่งครอบคลุมเว็บแอป, สไลด์ HTML และการพัฒนาเกม Godot. Muse Spark 1.2 ไม่มีข้อมูลใดๆ เลย. ในมิติที่ Meta กำลังทำการตลาดหนักที่สุดในเวลานี้ ไม่มีข้อมูลการเปรียบเทียบแบบตัวต่อตัวสำหรับโมเดลใหม่เลย.
• คะแนนดัชนีย่อยArtificial Analysis เผยแพร่ดัชนีการเขียนโค้ดที่ 71.3 และดัชนีเอเจนต์ที่ 37.5 สำหรับเวอร์ชัน 1.1 ยังไม่มีตัวเลขที่เผยแพร่เทียบเคียงสำหรับเวอร์ชัน 1.2 เนื่องจากคะแนนเอเจนต์เป็นมิติที่อ่อนแอที่สุดของเวอร์ชัน 1.1 อย่างเห็นได้ชัด และความสามารถด้านเอเจนต์ก็เป็นสิ่งที่เวอร์ชัน 1.2 อ้างว่าปรับปรุงขึ้นพอดี ตัวเลขนี้จึงเป็นตัวชี้ขาดคำถามเรื่องการอัปเกรด — แต่ตัวเลขดังกล่าวยังไม่มีอยู่จริง
• เทเลเมทรีโปรดักชัน. 1.1 มีค่า p50 และ p95 จริงสะสมหนึ่งสัปดาห์ และมีทราฟฟิกสด 4.4M โทเคนบน OrcaRouter ส่วน 1.2 ไม่มีทั้งสองอย่าง เอนด์พอยต์ของมันไม่รายงานสถิติหน่วงเวลาหรือทรูพุตเลย เนื่องจากปริมาณต่ำเกินไปที่จะสุ่มตัวอย่าง
• สถานที่ให้เช่านอกเหนือจาก MetaMuse Spark 1.1 อยู่ในแค็ตตาล็อกOrcaRouter ที่ราคา $1.25 และ $4.25 — ซึ่งเป็นราคาที่ Meta กำหนดเอง ส่งผ่านโดยไม่มีมาร์กอัป 0% ส่วน Muse Spark 1.2 ยังไม่มีอยู่ในนั้น ดังนั้นวันนี้จึงเป็นการผสานรวมโดยตรงกับ Meta กับผู้ให้บริการรายเดียวและไม่มีเส้นทางสำรอง

ทั้งหมดนี้ไม่ได้หมายความว่า 1.2 แย่กว่า แต่มันหมายความว่าหลักฐานสำหรับ 1.2 ประกอบด้วยคะแนนรวมหนึ่งชุดจากผู้ประเมินหนึ่งคน ขณะที่หลักฐานสำหรับ 1.1 คือหนึ่งเดือนของสนามทดสอบ ดัชนีย่อย และทราฟฟิกจริง ความไม่สมดุลนั้นควรส่งผลต่อวิธีที่คุณจัดขั้นตอนการย้ายระบบ ไม่ใช่จะลองทำหรือไม่
รายการตรวจสอบการย้ายระบบที่สั้นจริงๆ
เนื่องจากเรตการ์ดและพื้นผิวพารามิเตอร์เหมือนกัน การสลับจึงเป็นการเปลี่ยนแปลงสตริงโมเดล งานอยู่ที่การตรวจสอบสิ่งสามอย่างที่เคลื่อนย้ายไปจริง
• วัดเวลาจนถึงโทเค็นแรกของคุณเองที่ระดับ effort ที่คุณตั้งไว้เอง อย่ายอมรับตัวเลข 2.90 วินาทีหรือ 26.12 วินาที รันพรอมป์ต์จริงของคุณด้วยค่า reasoning_effort ที่คุณส่งจริง ๆ แล้วเปรียบเทียบโดยตรง นี่คือตัวเลขเพียงตัวเดียวที่สามารถทำให้การย้ายระบบล้มเหลวได้โดยสิ้นเชิง
• ตรวจสอบการกำหนดค่าหมดเวลาและการสตรีมของคุณ การเพิ่มขึ้น 9 เท่าของเวลาแฝงของโทเค็นแรกเมื่อใช้ความพยายามสูงจะทำให้ไคลเอนต์หมดเวลาที่ปรับตั้งไว้กับ 1.1 ละเมิด และจะทำให้การผสานรวมแบบไม่สตรีมดูเหมือนค้าง
• คำนวณต้นทุนใหม่จากจำนวนโทเค็นที่วัดได้ ไม่ใช่จากเรตการ์ด ราคาเท่ากันทุกอย่าง การเปลี่ยนแปลงค่าใช้จ่ายจึงเกิดจากพฤติกรรมล้วนๆ Artificial Analysis พบว่าต้องใช้จ่ายเพิ่มขึ้น 16% เพื่อทำงานเดียวกัน; จะเห็นผลต่างนั้นหรือไม่ก็ขึ้นอยู่กับสัดส่วนงานของคุณ
• ตรวจสอบความเสถียรของ cache-key ก่อน ด้วย prefix ที่เสถียรขนาด 60,000 token ขั้นตอนของ agent โดยทั่วไปจะลดลงจากประมาณ 8.8 เซนต์เป็นประมาณ 2.2 เซนต์ในทั้งสองเวอร์ชัน การเปลี่ยนแปลง 75% นี้มากกว่าสิ่งที่การเปลี่ยนเวอร์ชันทำได้ และมันอยู่ภายใต้การควบคุมของคุณทั้งหมด
• ทดสอบเส้นทางเสียงและวิดีโอใหม่อย่างเจาะจง ทั้งสองรายการโฆษณารูปแบบอินพุตห้าแบบเดียวกัน แต่การ์ดข้อมูลจำเพาะของ Artificial Analysis สำหรับ 1.2 บันทึกเพียงข้อความและรูปภาพตามที่ประเมินไว้ Meta เขียนคำโปรยใหม่ให้ออกห่างจากงานสื่อผสม ไม่มีหน่วยงานอิสระใดตรวจสอบว่าความสามารถดังกล่าวยังคงอยู่
• เก็บ 1.1 ไว้ให้เข้าถึงได้ในฐานะตัวสำรอง การรันทั้งสองเวอร์ชันภายใต้คีย์เดียวกันหมายความว่าการโรลแบ็กเป็นการเปลี่ยนคอนฟิก ไม่ใช่เหตุการณ์ขัดข้อง และยังให้คุณเทสต์ A/B ทั้งสองบนทราฟฟิกจริง แทนที่จะเถียงกันเรื่องเบนช์มาร์ก
ตอนนี้ใครเดิน ใครรอ
ย้ายเลย หากคุณใช้เอเจนต์เขียนโค้ดแบบ long-horizon ที่ระดับการใช้เหตุผลสูง งานเหล่านี้ใช้เวลาเป็นนาทีอยู่แล้ว ค่าเสียหายด้านความหน่วงจึงกลืนหายไปกับเวลานั้น การเพิ่มขึ้นของความฉลาดวัดโดยบุคคลที่สาม ไม่ใช่การอ้างของ Meta และดัชนีสามจุดคือการกระโดดที่มีนัยสำคัญในระดับนี้ — เก้าอันดับบนตารางที่มี 185 โมเดล
เดี๋ยวก่อนหากสิ่งที่คุณให้บริการเป็นแบบโต้ตอบ ไม่มีการกำหนดค่าใดที่ 1.2 จะตอบสนองได้เร็วกว่า 1.1 และการใช้เหตุผลแบบบังคับหมายความว่าคุณไม่สามารถซื้อความตอบสนองกลับคืนมาได้ด้วยการปิดการคิด เวอร์ชัน 1.1 ยังคงเป็นโมเดลที่เร็วกว่าในทุกระดับความพยายาม และมีค่าใช้จ่ายเท่าเดิมทุกประการ
เดี๋ยวก่อนหากปริมาณงานของคุณคือการวิเคราะห์สื่อผสม — กรณีการใช้งานรายงานยาว วิดีโอและเสียง ที่ 1.1 ถูกสร้างและทำการตลาดไว้อย่างชัดเจน Meta หยุดโฆษณามัน และการประเมินอิสระเพียงครั้งเดียวของ 1.2 ครอบคลุมข้อความและรูปภาพ ความสามารถนี้อาจยังคงอยู่ เพียงแต่ไม่มีหลักฐานใดๆ ทั้งสองทาง และ 1.1 มีหลักฐานหนึ่งเดือนในเรื่องนี้
เดี๋ยวก่อนถ้าคุณต้องการข้อมูลอารีน่า โมเดลที่วางขายบนจุดขายเรื่องการสร้างทั้งรีพอสิทอรี โดยไม่มีรายการใน Design Arena และไม่มีดัชนีย่อยด้าน agentic ที่เผยแพร่ กำลังขอให้คุณเชื่อคำพูดของ Meta ในสิ่งที่มันเปลี่ยนไป ให้เวลาสามหรือสี่สัปดาห์ แล้วสิ่งนั้นจะไม่เป็นความจริงอีกต่อไป — ณ จุดนั้น การตัดสินใจนี้จะง่ายขึ้นมากที่จะทำบนพื้นฐานของหลักฐาน มากกว่าตัวเลขประกอบเพียงตัวเดียว
การเปรียบเทียบในบทความนี้1
ตรวจพบจากบทความนี้ · เบนช์มาร์ก: Artificial Analysis · อัปเดตทุกวัน
