
Xiaomi MiMo-V2.6-Pro: คะแนน DeepSWE 72.57 การรันที่หยุดชะงัก และยังไม่มีกำหนดวางจำหน่าย
- Orcaใหม่Orca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 ต่อ 1 ล้านโทเค็น
- orcaใหม่Orca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 ต่อ 1 ล้านโทเค็น
- deepseekใหม่DeepSeek: DeepSeek V4.1 Flash2026-09-1040ความฉลาด
- openaiOpenAI: GPT-6 Astra2026-09-0453ความฉลาด77การเขียนโค้ด
- googleGoogle: Gemini 3.8 Flash2026-09-0241ความฉลาด76การเขียนโค้ด
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245ความฉลาด76การเขียนโค้ด
- anthropicAnthropic: Claude Fable 5.12026-09-0153ความฉลาด82การเขียนโค้ด
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 ต่อ 1 ล้านโทเค็น
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642ความฉลาด72การเขียนโค้ด
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 ต่อ 1 ล้านโทเค็น
- z-aiZ.ai: GLM 5.32026-08-1845ความฉลาด75การเขียนโค้ด
- obsidianQwen3.8 27B2026-08-1534ความฉลาด68การเขียนโค้ด
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236ความฉลาด69การเขียนโค้ด
- grokSpaceXAI: Grok 4.62026-08-1244ความฉลาด77การเขียนโค้ด
- metaMeta: Muse Spark 1.22026-08-0540ความฉลาด72การเขียนโค้ด
- qwenQwen: Qwen3.8 Max2026-08-0345ความฉลาด76การเขียนโค้ด
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3134ความฉลาด69การเขียนโค้ด
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 ต่อ 1 ล้านโทเค็น
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
Xiaomi MiMo-V2.6-Pro หยุดการรันการเรียนรู้แบบเสริมกำลังที่ถ่ายทอดสู่สาธารณะเมื่อวันที่ 20 กันยายน ด้วยคะแนน DeepSWE v1.1 ที่ 72.57 ซึ่งปรากฏอยู่บนแดชบอร์ดของ Xiaomi เอง — ต่ำกว่า 74% ที่ GPT-6 Astra, Gemini 3.8 Flash และ Claude Opus 5 ครองตำแหน่งสูงสุดร่วมกันบนลีดเดอร์บอร์ดเดียวกันอยู่ 1.4 จุด Xiaomi MiMo-V2.6-Flash โมเดลขนาดเล็กที่ฝึกไปพร้อมกัน หยุดเมื่อวันที่ 19 กันยายน ที่ 65.68 การรันทั้งสองครั้งสิ้นสุดที่สเต็ป 30 และบิลรวมที่ Xiaomi เผยแพร่ควบคู่กันระบุว่า $3,474,715 เมื่อเราบันทึกหน้าเว็บนี้เมื่อเช้านี้
นั่นคือทั้งหมดของข่าวดี และมันเป็นข่าวดีจริงๆ ส่วนที่เหลือของเรื่องราวคือช่องว่างระหว่างตัวเลขกับผลิตภัณฑ์ ทั้ง Xiaomi MiMo-V2.6-Pro และ Xiaomi MiMo-V2.6-Flash ต่างไม่มีวันวางจำหน่าย ไม่มีการ์ดโมเดล ไม่มีตัวระบุ API ไม่มีราคาที่เผยแพร่ และไม่มีชุดน้ำหนักที่ดาวน์โหลดได้ ไม่มีเอนด์พอยต์ให้เรียกใช้ สิ่งที่มีอยู่คือแดชบอร์ดการฝึกอบรมที่ใครๆ ก็ดูได้ ตัวเลขเบนช์มาร์กที่ชุดทดสอบของ Xiaomi เองสร้างขึ้น และชุมชนที่ใช้เวลาหกวันอ่านหน้าเทเลเมทรีเหมือนกับที่ผู้คนเคยอ่านใบชา
นี่คือบทความแบบเท่าที่เรารู้กันถึงตอนนี้ และฉบับที่ซื่อตรงของมันจะแยกสามสิ่งที่การรายงานข่าวในสัปดาห์ที่ผ่านมาได้ปนเข้าด้วยกันอย่างเงียบ ๆ ออกมา ได้แก่ สิ่งที่ Xiaomi ได้ประกาศอย่างเป็นทางการ สิ่งที่ผู้สังเกตการณ์เพียงรายเดียวรายงานเกี่ยวกับเรื่องนี้ และทั้งหมดนั้นหมายความว่าอย่างไรสำหรับคนที่กำลังเลือกโมเดลเขียนโค้ดในวันนี้
สิ่งที่ Xiaomi โพสต์ออนไลน์จริง ๆ
เมื่อวันที่ 16 กันยายน ทีม MiMo ซึ่งนำโดย Luo Fuli ได้เปิดหน้าถ่ายทอดสดบนโดเมนของ Xiaomi เอง เพื่อแสดงขั้นตอน post-training ของโมเดลที่ยังไม่เปิดตัวสองตัวแบบเรียลไทม์ ได้แก่ จำนวนสเต็ป เส้นโค้งรางวัล อัตราการประมวลผลโทเคน จำนวนแซนด์บ็อกซ์ การแจ้งเตือนข้อขัดข้องของ GPU และตัวนับค่าใช้จ่ายที่เพิ่มขึ้นเรื่อย ๆ ขณะที่คุณเฝ้าดู การวางกรอบของ Xiaomi ตามรายงานข่าวคือ บริษัทใช้เวลาประมาณหกเดือนในการศึกษาคำถามหนึ่งข้อ — การเรียนรู้แบบเสริมกำลังสามารถขยายขนาดได้ไกลแค่ไหน — และตัดสินใจทำการทดลองนั้นต่อสาธารณะ แทนที่จะประกาศผลลัพธ์
แดชบอร์ดนี้เปิดเผยอย่างตรงไปตรงมาอย่างผิดปกติสำหรับอาร์ติแฟกต์จากผู้ขาย โดยระบุความล้มเหลวของตัวเองไว้ในฟีดประกาศ: การรีสตาร์ต Pro ที่สเต็ป 17 ซึ่งเกิดจากความผิดพลาด GPU หน่วยความจำไม่พอ (out-of-memory) จากความไม่สมดุลของภาระโหลดผู้เชี่ยวชาญ (expert load imbalance) ซึ่งทีมกล่าวว่าแก้ไขแล้วโดยปรับกลยุทธ์การทำขนานการฝึก (training parallelism strategy); ความผิดพลาดในการเชื่อมต่อเครือข่ายระหว่างคลัสเตอร์การฝึก Pro กับดีพลอยเมนต์สำหรับให้คะแนน (grading deployment) ซึ่งบังคับให้ต้องรีสตาร์ตและตัดสินใจตัดชุดข้อมูลไซเบอร์ (cyber dataset) ออกจากการรัน Pro ที่กำลังจะมาถึง หลังจาก "รูปแบบที่ไม่ดีในบันทึกการโรลเอาต์ (rollout logs)"; การรีสตาร์ต Flash จากสเต็ป 15 หลังจากข้อผิดพลาดด้านโครงสร้างพื้นฐานประเภทหนึ่งไม่ถูกตรวจพบเป็นเวลาประมาณสามชั่วโมง; และการรีสตาร์ต Pro จากความผิดพลาดของ VRAM บนโหนดเดียว นอกจากนี้ยังระบุว่างานที่ถูกประเมินว่า "ค่อนข้างง่ายสำหรับโมเดล pro ปัจจุบัน" ถูกกรองออก — เป็นการยอมรับที่รายงานหลังการฝึก (post-training reports) ส่วนใหญ่ไม่เอ่ยถึง

การ์ดการรันทั้งสองใบคือส่วนที่สำคัญสำหรับใครก็ตามที่ติดตามเรื่องเวลา ทั้งสองโมเดลถูกระบุสถานะว่าหยุดแล้ว: MiMo-V2.6-Pro หลังผ่านไป 5 วัน 7 ชั่วโมงตามเวลาจริง และ MiMo-V2.6-Flash หลังผ่านไป 3 วัน 11 ชั่วโมง โดยแต่ละโมเดลอยู่ที่สเต็ป 30 เมื่อวันที่ 20 กันยายน และ 19 กันยายน ตามลำดับ Pro ใช้โทเคน 75B และตัวอย่าง 753k คิดเป็นค่าใช้จ่าย $2.62M ส่วน Flash ใช้โทเคน 81.4B คิดเป็น $854k แต่ละสเต็ปดึงแบตช์พรอมป์ต์ 1,568 รายการ โดยมี 16 โรลเอาต์ต่อพรอมป์ต์ — เท่ากับ 25,088 เส้นทางต่อสเต็ป รันแบบอะซิงโครนัสเต็มรูปแบบ
พูดให้ชัด ๆ เลย: Xiaomi ยังไม่ได้ระบุว่า "stopped" หมายถึงการรันเสร็จสิ้น หยุดชั่วคราว หรือถูกบันทึกเป็นเช็กพอยต์แล้ว การ์ดที่ขึ้นสถานะหยุดไม่ใช่ประกาศว่าเสร็จสมบูรณ์ และไม่มีใครนอกทีมรู้ว่ามันเป็นแบบไหน
สิ่งที่ได้รับการยืนยันแล้ว และสิ่งที่ยังไม่ได้รับการยืนยัน
72.57 ไม่ใช่ข่าวลือ มันถูกพิมพ์อยู่บนแดชบอร์ดของ Xiaomi ในแผนภูมิที่ระบุชื่อ DeepSWE v1.1, mini-swe-agent, avg@3 ข้างๆ เส้นโค้งสีส้มของการรัน Pro ค่า 65.68 ของโมเดล Flash อยู่บนแผนภูมิเดียวกัน ตัวเลขนี้ยังปรากฏ — ในรูป 62.24 และต่อมา 65.97 — ในสแนปช็อตก่อนหน้าของแผงเดียวกัน ซึ่งเป็นสิ่งที่ทำให้เส้นโค้งมีรูปร่างเช่นนี้: การไต่ขึ้นอย่างต่อเนื่องตลอด 30 ขั้นตอน มากกว่าการประเมินที่โชคดีเพียงครั้งเดียว
สิ่งที่เป็นเพียงการรายงานคือจุดเริ่มต้น ข้อกล่าวอ้างที่แพร่กระจายบน X เมื่อวันที่ 21 กันยายน จากบัญชี @nrehiew_ คือโมเดล Pro เพิ่มขึ้น “จาก 58.41 เป็น 72.57” บน DeepSWE และการรันเสร็จสิ้นแล้ว จุดปลายทางตรงกับแดชบอร์ดของผู้ขายอย่างแม่นยำ ค่าฐาน 58.41 เป็นการอ่านของบัญชีนั้นว่ากราฟเริ่มต้นตรงไหน — จุด Pro ซ้ายสุดของกราฟอยู่ในช่วงปลาย 50 จริง — และ Xiaomi ยังไม่ได้เผยแพร่ตัวเลขขั้นที่ 1 ข้ออ้างเรื่องการเสร็จสิ้นก็เช่นกันเป็นการตีความจากการ์ดสองใบที่ถูกทำเครื่องหมายว่าหยุด ซึ่งเป็นการอ่านที่สมเหตุสมผลและไม่ใช่ถ้อยแถลงของ Xiaomi ให้ถือว่าการปรับปรุง 14 จุดนั้นหนักแน่นในเชิงทิศทางและเป็นตัวเลขโดยประมาณ

ยังมีความแตกต่างอีกหนึ่งอย่างที่การรายงานข่าวมองข้ามไป และมันคือสิ่งที่ชี้ว่าตัวเลขนี้มีค่าแค่ไหน แผงเบนช์มาร์กบนแดชบอร์ดเป็นการประเมินของ Xiaomi เอง บริษัทได้รัน harness บน checkpoint ของตัวเองและเผยแพร่ผลลัพธ์ออกมา harness ตัวนี้เป็นตัวเดียวกับที่ลีดเดอร์บอร์ดสาธารณะใช้ — mini-swe-agent, DeepSWE v1.1 — ซึ่งทำให้ตัวเลขนี้เปรียบเทียบกันได้มากกว่าที่เบนช์มาร์กที่ผู้ขายพัฒนาขึ้นเองจะทำได้ แต่การประเมินที่รันเองไม่ใช่รายการบนลีดเดอร์บอร์ด และ 72.57 ไม่ปรากฏบนบอร์ดของ Datacurve เพราะยังไม่มีใครส่งมันเข้าไป
เพดาน 74% แน่นกว่าที่พาดหัวข่าวบอกไว้
ซึ่งทำให้การเปรียบเทียบชัดเจนขึ้น ลีดเดอร์บอร์ด DeepSWE v1.1 ของ Datacurve ซึ่งอัปเดตล่าสุดเมื่อวันที่ 3 กันยายน 2026 ระบุ 113 งานจาก 91 รีพอซิทอรีในห้าภาษา และสามคอนฟิกูเรชันอันดับแรกของมันเสมอกันที่ 74% Pass@1: GPT-6 Astra ที่ความพยายามในการใช้เหตุผลระดับ xhigh, Gemini 3.8 Flash ที่ระดับ high และ Claude Opus 5 ที่ระดับ max ตัวเลขที่อยู่ข้าง ๆ คะแนนเหล่านั้นต่างหากที่น่าสนใจ
• ความมั่นใจ — GPT-6 Astra 74% ±3, Gemini 3.8 Flash 74% ±1, Claude Opus 5 74% ±4 บนกระดานเดียวกัน GPT-5.6 Sol อยู่ที่ 73% ±3 ส่วน GLM-5.3 และ Kimi K3 อยู่ที่ 69% ช่วงความเชื่อมั่นเหล่านี้ซ้อนทับกันเกินทศนิยมตำแหน่งที่สองไปไกล
• ต้นทุนต่องาน — Gemini 3.8 Flash เฉลี่ย $2.36, GPT-6 Astra $6.52, Claude Opus 5 $11.84 แผนภูมิของลีดเดอร์บอร์ดเองชี้ว่า Gemini 3.8 Flash เป็นการกำหนดค่าที่มีประสิทธิภาพสูงสุดบนบอร์ด และส่วนต่างระหว่างสามรุ่นนี้อยู่ที่ประมาณห้าต่อหนึ่งสำหรับอัตราการผ่านที่แบบทดสอบไม่สามารถแยกความแตกต่างได้
• ขั้นตอน — Gemini 3.8 Flash ต้องใช้ขั้นตอนของเอเจนต์โดยเฉลี่ย 166 ขั้นตอนต่องาน, Claude Opus 5 ใช้ 99, GPT-6 Astra ใช้ 29 คะแนนที่เสมอกันซ่อนรูปแบบการทำงานที่แตกต่างกันมากถึงสามแบบ และตัวที่ถูกที่สุดคือตัวที่ทำงานหนักที่สุด

ดังนั้น เมื่อ 72.57 ที่รายงานถูกอธิบายว่า "เข้าใกล้จุดสูงสุดของกระดาน" เวอร์ชันที่แม่นยำกว่านั้นแคบกว่าและไม่หวือหวาเท่า มันห่างจากกลุ่มที่เสมอกันสามทางประมาณหนึ่งจุดครึ่ง ซึ่งสมาชิกของกลุ่มไม่สามารถแยกออกจากกันได้ด้วยแถบข้อผิดพลาดของเบนช์มาร์กเอง มันเป็นผลลัพธ์ที่แข็งแกร่งสำหรับโมเดลที่ยังอยู่ในช่วงหลังการฝึก ซึ่งผลิตโดยผู้ขาย ไม่ใช่ผู้ดูแลเบนช์มาร์ก บนกระดานที่โมเดลยังไม่ได้ถูกส่งเข้าร่วม การอัปเดตล่าสุดของลีดเดอร์บอร์ดเกิดขึ้นก่อนการรันของ Xiaomi ทั้งหมด ซึ่งเป็นเหตุผลว่าทำไมจึงยังไม่มี MiMo ปรากฏอยู่บนนั้น
ทำไม Xiaomi จึงฝึกแบบเปิดเผย
ความโปร่งใสนี้ไม่ได้เกิดขึ้นโดยบังเอิญ การเปิดตัวโมเดลแบบเปิดน้ำหนักครั้งล่าสุดของ Xiaomi คือ Xiaomi MiMo-V2.5 และ Xiaomi MiMo-V2.5-Pro เมื่อปลายเดือนเมษายน ทั้งคู่อยู่ภายใต้สัญญาอนุญาต MIT — ใช้ในเชิงพาณิชย์ได้ ปรับแต่งละเอียดได้ และแจกจ่ายซ้ำได้ MiMo-V2.5-Pro เป็นโมเดล mixture-of-experts ขนาด 1.02 ล้านล้านพารามิเตอร์ ที่มีพารามิเตอร์ที่ใช้งานจริง 42B สถาปัตยกรรมแบบ hybrid-attention และหน้าต่างบริบท 1M โทเคน และสื่อเปิดตัวของมันได้ระบุข้ออ้างด้าน agentic อย่างชัดเจน: คอมไพเลอร์ที่เขียนขึ้นใหม่ตั้งแต่ต้นด้วย Rust ผ่านการเรียกใช้เครื่องมือหลายร้อยครั้ง แอปพลิเคชันเดสก์ท็อปแปดพันบรรทัดที่สร้างขึ้นภายในเวลาสิบเอ็ดชั่วโมงของการทำงานของเอเจนต์
การสตรีมโพสต์เทรนนิงของรุ่นถัดไปเป็นคำกล่าวอ้างอีกแบบหนึ่ง ห้องแล็บที่เผยแพร่เส้นโค้งรางวัล จำนวนแซนด์บ็อกซ์ และข้อขัดข้องของ GPU แบบเรียลไทม์ กำลังขอให้ถูกตัดสินจากกระบวนการ มากกว่าชุดสไลด์เปิดตัว และกำลังส่งสัญญาณไทม์ไลน์ Luo Fuli กล่าวว่า รายละเอียดทางเทคนิคของงาน RL จะถูกโอเพนซอร์สทีละส่วนในอีกไม่กี่สัปดาห์ข้างหน้า นั่นคือสิ่งที่ใกล้เคียงกับกำหนดการมากที่สุดเท่าที่มีใครเสนอมา: วิธีการก่อน โมเดลทีหลัง
นอกจากนี้ยังสอดคล้องกับรูปแบบที่ Xiaomi เคยใช้มาก่อน โดยที่โมเดลหนึ่งจะปรากฏต่อสาธารณะภายใต้ชื่ออื่นก่อนที่บริษัทจะออกมาประกาศว่าเป็นของตน นิสัยของบริษัทคือการฝึกอย่างเงียบ ๆ ทดสอบอย่างเปิดเผย แล้วจึงปล่อยพร้อมน้ำหนักโมเดล
สิ่งที่คุณสามารถรันได้ในวันนี้
ไม่มีอะไรในตระกูล MiMo-V2.6 หากคุณต้องการโมเดล Xiaomi MiMo ในตอนนี้ สิ่งที่มีอยู่คือรุ่น V2.5 — น้ำหนักแบบเปิดผ่านช่องทางของ Xiaomi เองและแพลตฟอร์มบุคคลที่สามหลายแห่ง พร้อมการ์ดและราคาที่เผยแพร่แล้ว ไม่มี API ของ MiMo-V2.6 ไม่มีตัวระบุโมเดล และไม่มีรายการราคา และหน้าใดก็ตามที่อ้างตัวระบุ MiMo-V2.6 หรืออัตราต่อโทเคน กำลังเติมช่องว่างที่ Xiaomi ปล่อยว่างไว้ สตริง `mimo-v2.6-pro` และ `mimo-v2.6-flash` บนแดชบอร์ดเป็นชื่อของงานฝึกโมเดล ไม่ใช่ปลายทางที่เผยแพร่แล้ว
ผลลัพธ์ในทางปฏิบัติอีกประการหนึ่งก็คือ ระหว่างนี้ควรทำอย่างไร หากเหตุผลที่ MiMo-V2.6-Pro น่าสนใจสำหรับคุณคือมันอาจเป็นวิธีที่ถูกกว่าในการไปถึงประสิทธิภาพการเขียนโค้ดระดับแนวหน้า บรรดาคอนฟิกูเรชันที่มันถูกนำมาเปรียบเทียบด้วยนั้นเรียกใช้ได้อยู่แล้ว และลีดเดอร์บอร์ดก็บอกว่าตัวที่ถูกกว่านั้นแข่งขันได้: Gemini 3.8 Flash ทำอัตราการผ่านสูงสุดได้เท่ากันที่ $2.36 ต่องาน และถูกระบุว่าเป็นคอนฟิกูเรชันที่มีประสิทธิภาพสูงสุดของบอร์ด Gemini 3.8 Flash, Claude Opus 5 และ GPT-6 Astra ล้วนเข้าถึงได้ผ่านคีย์ API เดียวของ OrcaRouter ในราคาตามที่ผู้ให้บริการประกาศ โดยไม่บวกเพิ่ม 0% — ดังนั้นการเปลี่ยนแปลงราคาของผู้ขายจึงมีผลจริงฝั่งเราภายในวันเดียวกัน แทนที่จะรอรอบบิลถัดไป — โดยมีการตั้งค่า failover แยกตามโมเดลแทนที่จะแยกตามผู้ขาย และเมื่อห้องแล็บใดเปิดโมเดลแบบนี้จริง การกำหนดเส้นทางให้มันอยู่หลังคีย์เดียวกันคือวิธีประเมินมันแบบที่ผูกมัดน้อย: คุณสามารถนำมันมารองรับทราฟฟิกจริงได้โดยไม่ต้องเดิมพันเส้นทางโปรดักชันกับเช็กพอยต์ที่ยังไม่มีใครจำแนกลักษณะไว้
อะไรที่จะเปลี่ยนเรื่องนี้ได้จริง ๆ
สัญญาณสี่อย่าง เรียงตามลำดับโดยประมาณว่าสิ่งใดจะช่วยชี้ขาดได้มากน้อยเพียงใด:
• น้ำหนักโมเดลบน Hugging Face ภายใต้สัญญาอนุญาตที่ระบุไว้ ซึ่งเป็นวิธีที่รุ่น V2.5 เปิดตัว และเป็นหลักฐานที่ชัดเจนที่สุดว่าการรัน RL ให้ผลเป็นโมเดลที่พร้อมนำออกใช้จริง มากกว่าจะเป็นการทดลองที่สิ้นสุดลงเพียงเท่านั้น
• การ์ดโมเดลที่ระบุจำนวนพารามิเตอร์ ความยาวคอนเท็กซ์ และสถาปัตยกรรม — ตัวเลขของ V2.6 ไม่มีตัวใดเปิดเผยต่อสาธารณะ และแดชบอร์ดก็ไม่ได้แสดงตัวเลขเหล่านั้น การสมมติว่า V2.6-Pro สืบทอดโครงสร้าง 1.02T/42B ของ V2.5-Pro ถือเป็นการคาดเดา
• ตัวระบุ API และตารางราคา ซึ่งเป็นจุดที่ตัวเลขของ DeepSWE กลายเป็นการตัดสินใจซื้อ มิใช่แค่กีฬาที่นั่งดูอยู่ห่าง ๆ
• การส่งผลงานไปยังบอร์ด DeepSWE ของ Datacurve ซึ่งจะทำให้ MiMo-V2.6-Pro อยู่บนตารางเดียวกันและภายใต้แถบความคลาดเคลื่อนเดียวกันกับโมเดลที่กำลังถูกนำมาเปรียบเทียบด้วย การประเมินที่ผู้ขายเป็นผู้ดำเนินการกับการส่งเข้าลีดเดอร์บอร์ดไม่ใช่คำกล่าวอ้างเดียวกัน และช่องว่างระหว่างทั้งสองก็คือหนึ่งแถวของตารางนั้นพอดี
จนถึงตอนนั้น สรุปอย่างตรงไปตรงมาก็คือ เสียวหมี่ได้แสดงให้เห็นการรันหลังการฝึก (post-training run) ที่โปร่งใสที่สุดเท่าที่ห้องแล็บชั้นนำใดๆ เคยเผยแพร่ บนโมเดลสองตัวที่ยังไม่ได้เปิดตัว โดยมีคะแนน benchmark ที่รายงานเองหนึ่งค่า ซึ่งเข้าใกล้ — แต่ไม่ได้ติด — อันดับต้นๆ ของตารางจัดอันดับ เอกสารอธิบายระเบียบวิธีได้รับการสัญญาว่าจะมาในอีกไม่กี่สัปดาห์ข้างหน้า ส่วนวันเปิดตัวนั้นไม่ได้ให้สัญญาไว้เลย
