
Ternary Bonsai 2 27B vs Bonsai 27B: สองเดือน สองโมเดลฐาน หนึ่งวาเรียนต์ที่หายไป
- Orcaใหม่Orca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 ต่อ 1 ล้านโทเค็น
- orcaใหม่Orca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 ต่อ 1 ล้านโทเค็น
- deepseekใหม่DeepSeek: DeepSeek V4.1 Flash2026-09-1040ความฉลาด
- openaiใหม่OpenAI: GPT-6 Astra2026-09-0453ความฉลาด77การเขียนโค้ด
- googleGoogle: Gemini 3.8 Flash2026-09-0241ความฉลาด76การเขียนโค้ด
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245ความฉลาด76การเขียนโค้ด
- anthropicAnthropic: Claude Fable 5.12026-09-0153ความฉลาด82การเขียนโค้ด
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 ต่อ 1 ล้านโทเค็น
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642ความฉลาด72การเขียนโค้ด
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 ต่อ 1 ล้านโทเค็น
- z-aiZ.ai: GLM 5.32026-08-1845ความฉลาด75การเขียนโค้ด
- obsidianQwen3.8 27B2026-08-1534ความฉลาด68การเขียนโค้ด
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236ความฉลาด69การเขียนโค้ด
- grokSpaceXAI: Grok 4.62026-08-1244ความฉลาด77การเขียนโค้ด
- metaMeta: Muse Spark 1.22026-08-0540ความฉลาด72การเขียนโค้ด
- qwenQwen: Qwen3.8 Max2026-08-0345ความฉลาด76การเขียนโค้ด
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135ความฉลาด69การเขียนโค้ด
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 ต่อ 1 ล้านโทเค็น
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
Ternary Bonsai 2 27B มาถึงเมื่อวันที่ 17 กันยายน 2026 สองเดือนหลังจากที่ Bonsai 27B เปิดตัวเมื่อวันที่ 14 กรกฎาคม 2026 และการเปรียบเทียบแบบพาดหัวข่าวระหว่างทั้งสองก็คือตัวเลขเพียงคู่เดียว: รุ่นแรกยังคงรักษาค่าเฉลี่ย benchmark ของโมเดลฐานความแม่นยำเต็มไว้ได้ราว 95% ส่วนรุ่นที่สองรักษาไว้ได้ 98.2% ซึ่งอ่านดูเหมือนเป็นการพัฒนาตามรุ่นที่ตรงไปตรงมา และส่วนใหญ่ก็เป็นเช่นนั้นจริง — แต่ตัวเลขสองค่านั้นไม่ได้วัดสิ่งเดียวกัน เพราะโมเดลฐานเปลี่ยนไปข้างใต้พวกมัน การเปิดตัวในเดือนกรกฎาคมบีบอัด Qwen3.6-27B ส่วนการเปิดตัวในเดือนกันยายนบีบอัด Qwen3.8-27B คุณภาพที่เพิ่มขึ้นส่วนหนึ่งเป็นของสูตรการบีบอัด และอีกส่วนหนึ่งเป็นของ Qwen3.8-27B ที่ใหม่กว่า และไม่มีตัวเลขที่เผยแพร่ใดแยกสองส่วนนี้ออกจากกัน
ยังมีความแตกต่างประการที่สองระหว่างรุ่นต่าง ๆ ที่ได้รับความสนใจน้อยกว่ามาก และสำคัญกว่าสำหรับผู้ใช้กลุ่มเฉพาะ: Bonsai รุ่นแรกวางจำหน่ายสองแบบ ส่วนรุ่นที่สองวางจำหน่ายแบบเดียว บิลด์ขนาด 3.9 GB ที่ทำให้โมเดลระดับ 27B พอดีกับ iPhone 17 Pro ไม่มีรุ่นสืบทอดในรีลีสนี้ หากขนาดพื้นที่ติดตั้งนั้นคือเหตุผลที่ทำให้คุณสนใจ Bonsai ตั้งแต่แรก รุ่นใหม่กว่านี้ไม่ใช่การอัปเกรด — มันคือผลิตภัณฑ์ที่แตกต่างซึ่งไม่ครอบคลุมกรณีการใช้งานของคุณ
สิ่งที่เจนเนอเรชันแรกส่งมอบจริงๆ
Bonsai 27B เปิดตัวเมื่อวันที่ 14 กรกฎาคม 2026 ภายใต้ Apache 2.0 โดยเป็นอาร์ติแฟกต์สองชิ้นที่สร้างบนโมเดลฐานเดียวกัน และการแยกออกจากกันระหว่างทั้งสองคือจุดสำคัญของการเปิดตัวครั้งนี้
• Ternary Bonsai 27B — น้ำหนักแบบ ternary {−1, 0, +1} พร้อมการสเกลแบบกลุ่มด้วย FP16, 1.71 บิตประสิทธิผลต่อน้ำหนัก, ขนาดหน่วยความจำ 5.9 GB เป็นรุ่นที่มุ่งเน้นคุณภาพ วางตำแหน่งสำหรับแล็ปท็อปใช้งานทั่วไป โดยมีความสามารถด้านการให้เหตุผล การเรียกใช้เครื่องมือ และการทำงานแบบเอเจนต์อย่างเต็มรูปแบบ
• 1-bit Bonsai 27B — น้ำหนักแบบไบนารี {−1, +1} พร้อมการสเกลแบบกลุ่มเดียวกัน, 1.125 บิตประสิทธิผลต่อน้ำหนัก, ขนาด 3.9 GB บิลด์ที่เน้นขนาดหน่วยความจำ ปรับขนาดให้พอดีกับงบหน่วยความจำของ iPhone 17 Pro
ทั้งคู่รองรับบริบทขนาด 262K โทเคน ทั้งคู่เก็บ vision tower แบบ 4-bit ที่กะทัดรัดไว้เพื่อให้โมเดลยังเป็นมัลติโมดัล และทั้งคู่รองรับ speculative decoding ด้วย DSpark drafter กรอบแนวคิดของ Prism ML ในตอนนั้นคือ การแทนค่าบิตต่ำทำงานตั้งแต่ต้นจนจบ — embeddings, attention, MLP และ LM head — โดยไม่มีช่องทางหนีไปใช้ความแม่นยำที่สูงกว่า และบิลด์ 1-bit นั้นเป็นโมเดลระดับ 27B ตัวแรกที่รันบนโทรศัพท์ได้เลย ปริมาณงาน (throughput) ที่รายงานบนตัวแปร 1-bit อยู่ที่ประมาณ 11 โทเคนต่อวินาทีบน iPhone 17 Pro, 87 tok/s บน Apple M5 Max และ 163 tok/s บน RTX 5090; ส่วนตัวแปร ternary ระบุไว้ที่ 58 tok/s บน M5 Max และ 134 tok/s บน 5090
ต้นทุนด้านคุณภาพถูกเปิดเผยควบคู่ไปกับตัวเลขเหล่านั้น แทนที่จะถูกซ่อนไว้ ในชุดทดสอบโหมดคิด (thinking-mode) จำนวน 15 เบนช์มาร์ก โมเดลฐาน full-precision ทำคะแนนได้ 85.0 บิลด์ ternary ได้ 80.5 — ประมาณ 95% — และบิลด์ 1-bit ได้ 76.1 ประมาณ 90% การลดลงกระจุกตัวอยู่ที่การเรียกใช้เครื่องมือแบบเอเจนต์ (agentic tool calling) ซึ่งลดลงจาก 80.0 เหลือ 66.0 ในบิลด์ 1-bit และในด้านวิชัน (vision) ซึ่งลดลงจาก 72.6 เหลือ 59.6 ส่วนคณิตศาสตร์และการเขียนโค้ดยังทำได้ดีกว่าอย่างเห็นได้ชัดในทั้งสองเวอร์ชัน

สิ่งที่รุ่นที่สองเปลี่ยนแปลงไป
Ternary Bonsai 2 27B คงสูตรไว้และเปลี่ยนแปลงอินพุต การแทนค่าแบบไตรภาคยังคงเป็น {−1, 0, +1} โดยมีสเกล FP16 หนึ่งค่าต่อกลุ่มน้ำหนัก 128 ค่า ตอนนี้จัดแพ็กเป็น 1.76 บิตต่อน้ำหนักในไฟล์ขนาด 5.93 GB พร้อมบริบท 262K และ vision tower แยกเช่นเดิม — 0.63 GB ที่ 4-bit ในรีลีสนี้ โหลดเฉพาะเมื่อมีภาพเข้ามา
มีสองสิ่งที่เป็นของใหม่จริง ๆ และทั้งสองอย่างถูกอธิบายว่าเป็นเหตุผลที่ตัวเลขการคงอยู่เปลี่ยนไป
ประการแรกคือความแม่นยำแบบเลือกสรร ต่างจากบิลด์เดือนกรกฎาคมที่ทำให้แทบทุกอย่างกลายเป็น ternary บอนไซ 2 เก็บพารามิเตอร์ 26,238,464 ตัวไว้ที่ความแม่นยำเต็ม — คิดเป็น 0.0976% ของโมเดลภาษา ประมาณ 52 MB ที่ bf16 โดยกระจุกตัวอยู่ในเส้นทางสถานะแบบเกิดซ้ำของเลเยอร์ความสนใจเชิงเส้น บวกกับน้ำหนักการปรับมาตรฐาน นั่นเป็นการยอมแลกเล็กน้อยในแง่ไบต์ แต่ดูเหมือนจะเป็นการยอมแลกครั้งใหญ่ในแง่พฤติกรรม
ข้อที่สองคือฐานน้ำหนักแบบหมุน เมทริกซ์น้ำหนักจะถูกจัดเก็บหลังจากการหมุน Walsh–Hadamard แบบบล็อกที่ขนาดบล็อก 1,024 โดยมีการใช้การแปลงที่สอดคล้องกับแอคติเวชันในขณะรันไทม์ ด้วยทฤษฎีที่ว่าการกระจายค่าผิดปกติไปตามพิกัดทำให้การประมาณค่าแบบสามระดับสูญเสียข้อมูลน้อยลง มันไม่มีค่าใช้จ่ายในการจัดเก็บเพิ่มเติมเนื่องจาการหมุนถูกรวมเข้ากับน้ำหนัก แต่ก็อยู่บนเส้นทางการคำนวณ
แล้วยังมีการเปลี่ยนแปลงที่ไม่ใช่เทคนิคเลย: โมเดลฐาน Qwen3.8-27B เป็นการออกแบบแบบ hybrid-attention — ประมาณ 75% เป็น linear attention และ 25% เป็น full attention — ในขณะที่รุ่นก่อนไม่เป็นเช่นนั้น คะแนนตามหมวดหมู่ที่ Prism ML รายงานแสดงให้เห็นว่าการเปลี่ยนแปลงนั้นได้อะไรมา การทำตามคำสั่งอยู่ที่ 82.66 สำหรับ Bonsai 2 เทียบกับ 74.53 สำหรับ Qwen3.6-27B ซึ่งเป็นโมเดลฐานที่รุ่นแรกบีบอัด การให้เหตุผลและความรู้อยู่ที่ 83.95 เทียบกับ 84.71 สำหรับโมเดลฐานรุ่นเก่า และการเขียนโค้ดอยู่ที่ 81.58 เทียบกับ 82.57 โมเดลฐานใหม่ทำได้ดีกว่าในด้านการทำตามคำสั่งอย่างชัดเจน และตามหลังเล็กน้อยในอีกสองหมวดหมู่ ซึ่งเป็นลักษณะแบบนี้แหละที่ทำให้เปอร์เซ็นต์การรักษาสมรรถนะข้ามรุ่นไม่ค่อยมีประโยชน์เมื่อดูเพียงลำพัง
ทำไมตัวเลข retention สองตัวนี้จึงไม่สามารถเปรียบเทียบกันได้
95% และ 98.2% ดูเหมือนเป็นค่าที่อ่านได้สองค่าบนสเกลเดียวกัน แต่ไม่ใช่ ด้วยเหตุผลสามข้อที่ควรแยกให้ชัดก่อนจะสรุปว่าสูตรนี้ดีขึ้น 3.2 จุด
• ตัวส่วนนั้นแตกต่างกัน 95% ของรุ่นแรกวัดบนชุดแบบทดสอบ 15 รายการ เทียบกับ Qwen3.6-27B ส่วน 98.2% ของรุ่นที่สองมาจากชุดแบบทดสอบ 20 รายการ เทียบกับ Qwen3.8-27B ชุดต่างกัน ค่าฐานต่างกัน การผสมระดับความยากก็ต่างกัน
• เส้นฐานเคลื่อนไปอย่างอิสระ ส่วนหนึ่งของผลได้ด้านการคงประสิทธิภาพมาจากโมเดลที่ถูกบีบอัดเก่งขึ้นในการบีบอัด และอีกส่วนมาจากโมเดลฐานที่เปลี่ยนไปในลักษณะที่เป็นมิตรต่อน้ำหนักแบบ ternary มากขึ้น ยังไม่มีงานตีพิมพ์ใดที่แยกการมีส่วนเหล่านี้ออกจากกัน
• การรักษาความสามารถเป็นเรื่องสัมพัทธ์ ดังนั้นจึงสามารถเพิ่มขึ้นได้ในขณะที่ความสามารถสัมบูรณ์ในหมวดหมู่หนึ่งลดลง โมเดลที่รักษาความสามารถไว้ได้ 99% ของโมเดลแม่ที่อ่อนกว่า ก็ยังอาจตามหลังโมเดลที่รักษาความสามารถไว้ได้ 96% ของโมเดลแม่ที่แข็งแกร่งกว่า
การเปรียบเทียบแบบสัมบูรณ์ให้ข้อมูลมากกว่าการเปรียบเทียบแบบสัมพัทธ์ และบนพื้นฐานนั้นเรื่องราวก็ชัดเจนกว่า คะแนนรวม 83.9 ของ Bonsai 2 สูงกว่า 83.6 ที่ Qwen3.6-27B แบบความแม่นยำเต็มทำได้บนชุดทดสอบรุ่นเก่า — ซึ่งหมายความว่ารุ่นสืบทอดที่ถูกบีบอัดตอนนี้นำหน้ารุ่นที่ไม่ได้บีบอัดซึ่งมันเข้าแทนที่เมื่อหนึ่งรุ่นก่อนหน้า บิลด์แบบ ternary รุ่นแรกทำคะแนนได้ 80.5 บนชุดทดสอบของตัวเอง ตัวเลขทั้งสองนั้นเป็นของ Prism ML และชุดทดสอบก็แตกต่างกัน ดังนั้นให้อ่านลำดับ มากกว่าตัวเลขทศนิยม

สายพันธุ์ที่ไม่ได้กลับมา
นี่คือส่วนของการเปรียบเทียบที่เปลี่ยนการตัดสินใจซื้อ มากกว่าที่จะเป็นแค่กราฟ benchmark
ไม่มี Bonsai 2 แบบ 1-bit การเปิดตัวในเดือนกันยายนเป็นบิลด์แบบ ternary ในรูปแบบการแพ็กสองแบบ — PTQ1_0 ที่ 1.76 บิตต่อน้ำหนัก และ 5.93 GB และ PQ2_0 ที่ 2.16 บิตต่อน้ำหนัก และ 7.25 GB — พร้อมคอนเทนเนอร์ MLX สำหรับ Apple Silicon ไม่มีเวอร์ชันไบนารีขนาด 3.9 GB และไม่มีการประกาศเกี่ยวกับเวอร์ชันดังกล่าว ตัวเลขระดับโทรศัพท์ 3.9 GB ที่ปรากฏในการรายงานข่าวปัจจุบันยังคงหมายถึงรุ่นเดือนกรกฎาคม
ผลลัพธ์ในทางปฏิบัติเป็นเรื่องตรงไปตรงมา หากเป้าหมายของคุณคือ iPhone หรือ iPad หรืออุปกรณ์ใดก็ตามที่โมเดลภาษาขนาด 5.9 GB บวกกับ vision tower ขนาด 0.63 GB บวกกับงบประมาณบริบทไม่พอดีแล้ว บิลด์ 1-bit รุ่นแรกยังคงเป็นตัวเลือกเดียวในตระกูลนี้ และจะเป็นเช่นนี้ต่อไปจนกว่าจะมี Bonsai 2 แบบ 1-bit การอัปเกรดเส้นทาง ternary ไม่ได้อัปเกรดเส้นทางนั้น ใครก็ตามที่อ่านว่า "Bonsai 2 ดีกว่า" แล้วดาวน์โหลดใหม่ลงบนโทรศัพท์จะพบว่าไฟล์ไม่พอดี
ถ้าคุณใช้แล็ปท็อปหรือเดสก์ท็อป การชั่งน้ำหนักจะตรงกันข้าม: ไม่มีเหตุผลที่จะรันบิลด์ ternary ของเดือนกรกฎาคม เมื่อบิลด์เดือนกันยายนมีขนาดเล็กกว่าต่อหน่วยคุณภาพ ทำคะแนนได้ดีกว่าในเบนช์มาร์กที่สำคัญ และมีบริบท 262K เท่ากัน
ความเร็ว ซึ่งเป็นจุดที่ยากจะจัดอันดับเจเนอเรชันต่างๆ ได้อย่างแท้จริง
ทรูพุตเป็นส่วนหนึ่งของการเปรียบเทียบนี้ที่คำตอบอย่างตรงไปตรงมาคือ ตัวเลขที่เผยแพร่ออกมาไม่สนับสนุนการจัดอันดับที่ชัดเจนลงตัว และเป็นเรื่องที่ควรพูดเช่นนั้นมากกว่าจะเลือกคู่ที่ดูเข้าข้างตัวเอง
การวัดที่ได้มาตรฐานของรุ่นที่สองที่ขนาดแบตช์ 1 โดยไม่รวม vision tower อยู่ที่การถอดรหัส 142.5 tok/s บน RTX 5090 ในการแพ็ก PQ2_0, 46.8 tok/s บน Apple M5 Max, 27.7 บน M5 Pro และ 18.0 บน M4 Pro รุ่นแรกอ้างอิงไว้ที่ 134 tok/s บน RTX 5090 และ 58 tok/s บน M5 Max สำหรับบิลด์ ternary ของมัน ตัวเลขของ 5090 ขยับเล็กน้อยไปในทิศทางที่คาดไว้ ตัวเลขของ M5 Max กลับขยับไปอีกทาง — จาก 58 ลงมาเป็น 46.8 — ซึ่งไม่ใช่สิ่งที่ก้าวข้ามรุ่นในสองเดือนควรจะเป็น
ข้อควรระวังสองประการทำให้สิ่งนั้นยังไม่ถือเป็นข้อค้นพบ ฐานการวัดแตกต่างกันระหว่างการเปิดตัวแต่ละครั้ง และตัวเลข M5 Max ที่เผยแพร่อย่างน้อยหนึ่งตัวสำหรับรุ่นใหม่กว่านั้น ถูกระบุว่ามาจากบิลด์ที่เกิดขึ้นก่อนการปรับให้เหมาะสมด้านการหมุน แต่มันคุ้มค่าที่จะตั้งเป็นคำถามเปิด เพราะกลไกที่จะอธิบายเรื่องนี้อยู่ในบันทึกการเผยแพร่: ฐานที่หมุนแล้วทำให้มีการแปลงอยู่ในเส้นทางวิกฤตของการฉายทุกครั้งที่ขนาดแบตช์ 1 และการถอดรหัสบน Apple Silicon คือสภาวะที่สิ่งนั้นสร้างผลกระทบหนักที่สุด เทคนิคที่ได้คุณภาพมาอาจต้องแลกด้วยอัตราการส่งผ่านการถอดรหัส และบนฮาร์ดแวร์หน่วยความจำแบบรวม การแลกเปลี่ยนนั้นคมที่สุด
คอนเทนเนอร์ MLX เพิ่มความยุ่งยากอีกชั้นสำหรับผู้ใช้ Apple มันเป็นรูปแบบ 2 บิตแบบ affine ซึ่งบล็อกของมันเก็บทั้งสเกลและไบแอสสำหรับทุกกลุ่มของน้ำหนัก 128 ค่า แต่น้ำหนักแบบ ternary ต้องการเพียงสเกล ดังนั้นไบแอสจึงเป็นน้ำหนักที่ไม่ได้ใช้ บล็อกนี้กินพื้นที่ 36 ไบต์ต่อน้ำหนัก 128 ค่าแทนที่จะเป็น 34 และอัตราการแพ็กอยู่ที่ 2.25 บิตต่อน้ำหนัก โดยมีขนาดไฟล์ที่วัดได้ 8.005 GiB มันเป็นคอนเทนเนอร์ที่ต่างออกไปซึ่งบรรทุกค่าเดียวกัน และเป็นแพ็กที่ชุดสาธิตดาวน์โหลดมาโดยค่าเริ่มต้น
การรันเจเนอเรชันใดก็ได้
ทั้งสองรุ่นมีข้อจำกัดด้านการดำเนินงานร่วมกันหนึ่งข้อที่ไม่มีเวอร์ชันใดของโมเดลนี้หลุดพ้นไปได้: ไม่มีรุ่นใดรันบน llama.cpp มาตรฐานได้ เคอร์เนลเทอร์นารีสำหรับสถาปัตยกรรมนี้อยู่ในฟอร์กของ Prism ML เอง llama.cpp มาตรฐานปฏิเสธการแพ็กปัจจุบันว่าไม่รู้จัก และ — ที่แย่กว่านั้น — มันจะโหลดรูปแบบเทอร์นารีเก่าโดยไม่บ่น และสร้างข้อความที่ลื่นไหลแต่ไร้สาระ เพราะมันไม่ได้ใช้การหมุนที่น้ำหนักสมมติไว้ บิลด์ MLX มีเคอร์เนล Metal และ CPU แต่ไม่มีเส้นทาง CUDA ไม่ว่าคุณจะเลือกรุ่นไหน คำถามเรื่องรันไทม์จะได้รับคำตอบจากดิสทริบิวชันของ Prism ML เอง หรือจากรันไทม์ที่นำเคอร์เนลของมันไปใช้ ไม่ใช่จากระบบนิเวศ ggml โดยรวม
จุดที่ OrcaRouter เข้ามาเกี่ยวข้องกับการตัดสินใจแบบนี้อยู่ที่อีกระดับหนึ่งขึ้นไป ทั้งสองรุ่นของ Bonsai ไม่ได้ถูกโฮสต์ไว้ที่นี่ — พวกมันเป็นไฟล์ดาวน์โหลดที่คุณรันบนฮาร์ดแวร์ของคุณเอง สิ่งที่เลเยอร์การจัดเส้นทางมีประโยชน์ก็คือขอบเขต: คำขอที่โมเดลภายในเครื่องของคุณไม่ควรตอบ กำหนดนโยบายการยกระดับไว้ครั้งเดียวในคอนฟิกูเรชันการจัดเส้นทาง แทนที่จะอยู่ในโค้ดแอปพลิเคชัน เพื่อให้ชั้นที่ให้บริการภายในเครื่องส่งต่อคำขอที่ใช้บริบทขนาดยาว เน้นงานภาพ หรืออยู่นอกขอบเขตไปยังโมเดลที่โฮสต์ไว้ แทนที่จะทำให้คำขอล้มเหลว และเพื่อให้กลไกสำรองยังใช้ได้ไม่ว่าคุณจะติดตั้ง Bonsai รุ่นใดไว้ก็ตาม จากนั้นทั้งชั้นภายในเครื่องและชั้นที่โฮสต์ไว้ จะอยู่เบื้องหลังคีย์เดียว และนโยบายจะอยู่ในที่เดียวเมื่อ Bonsai รุ่นถัดไปเปิดตัว และขอบเขตของชั้นเปลี่ยนไปอีกครั้ง
จะทำอะไรกับสิ่งนี้ดี

• หากคุณรันบิลด์ ternary เวอร์ชันเดือนกรกฎาคมบนแล็ปท็อปหรือเดสก์ท็อป — ให้เปลี่ยนไปใช้ Ternary Bonsai 2 27B มันเป็นโมเดลที่ดีกว่าโดยใช้ทรัพยากรพอ ๆ กัน และคะแนนในหมวดหมู่ที่มันชนะคือหมวดหมู่ที่สำคัญสำหรับงานแบบ agentic และการปฏิบัติตามคำสั่ง
• หากคุณใช้บิลด์ 1-bit ประจำเดือนกรกฎาคมบนโทรศัพท์ — ให้ใช้เวอร์ชันนี้ต่อไป ไม่มีเวอร์ชันสืบทอด และบิลด์ ternary ขนาด 5.93 GB ไม่ใช่ตัวแทนที่ใช้แทนกันได้ทันทีสำหรับบิลด์ขนาด 3.9 GB
• หากคุณกำลังประเมินตระกูลผลิตภัณฑ์นี้เป็นครั้งแรก — ให้ตัดสินใจเรื่องฟุตปรินต์ก่อน แล้วจึงค่อยเลือกเจเนอเรชัน รูปแบบที่คุณต้องการจะเป็นตัวกำหนดว่าคุณกำลังเลือกซื้ออยู่ในรุ่นวางจำหน่ายใด และลำดับเช่นนี้กลับกันกับวิธีที่มักใช้บรรยายการอัปเกรดนี้
• หากคุณกำลังเลือกโดยพิจารณาจากเบนช์มาร์ก — ให้มอง 95% และ 98.2% เป็นการวัดที่แตกต่างกันสองค่า ไม่ใช่จุดสองจุดบนเส้นเดียวกัน และให้ถือว่าตัวเลขทุกตัวในทั้งสองนั้นเป็นข้อมูลของผู้ขายเอง จนกว่าการประเมินที่เป็นอิสระของโมเดลเดือนกันยายนจะปรากฏขึ้น การประเมินนั้นคือสิ่งที่ต้องจับตาดู เพราะมันจะเป็นครั้งแรกที่สามารถเปรียบเทียบสองเจเนอเรชันบนพื้นฐานเดียวกันได้
