การ์ดชื่อเรื่องที่สร้างขึ้นซึ่งมีข้อความว่า 'Bonsai vs Ternary Bonsai 2 27B' โดยมีคำบรรยายว่า 'สองเดิมพันบิตต่ำ กับไม้บรรทัดสองแบบที่ต่างกัน' เหนือการ์ดสามใบที่มีข้อความว่า 'น้ำหนัก: 0.43 GB vs 5.93 GB', 'คำกล่าวอ้างด้านคุณภาพ: การเปรียบเทียบ vs การคงคุณภาพไว้ 98.2%' และ 'ซิลิคอน: Hexagon NPU vs Apple silicon และ CUDA' พร้อมส่วนท้ายที่ระบุว่า 'ตัวเลขคุณภาพทั้งหมดเป็นข้อมูลที่ผู้ขายรายงานและยังไม่ได้ทำซ้ำ' โลโก้ OrcaRouter อยู่ที่มุมขวาล่าง
Guides & Insights

Bonsai vs Ternary Bonsai 2 27B: สองเดิมพันแบบบิตต่ำ สองไม้บรรทัดที่แตกต่างกัน

ผู้เขียน

Alistair Wren

วันที่เผยแพร่

โมเดลล่าสุด · 20ดูโมเดลทั้งหมด
เบนช์มาร์ก: Artificial Analysis · อัปเดตทุกวัน
กลับไปยังโพสต์ทั้งหมด

วางโมเดลภาษาภาพ 1-bit Bonsai 2B ไว้ข้าง Ternary Bonsai 2 27B และการเปรียบเทียบที่เห็นได้ชัด — พารามิเตอร์ 2 พันล้านเทียบกับ 27 พันล้าน, น้ำหนักภาษา 0.43 GB เทียบกับ 5.93 GB — กลับเป็นสิ่งที่น่าสนใจน้อยที่สุดในคู่นี้ สิ่งที่น่าสนใจคือ โมเดลทั้งสองจากผู้ขายรายเดียวกันและโครงการบีบอัดเดียวกัน ไม่ได้รายงานคุณภาพของตนในแบบเดียวกัน Ternary Bonsai 2 27B รายงานการคงไว้: มันรักษาประสิทธิภาพรวมจากชุดทดสอบมาตรฐานของรุ่นคู่เทียบความแม่นยำเต็มรูปแบบไว้ได้มากกว่า 98% โดยวัดเทียบกับตัวมันเอง ส่วน 1-bit Bonsai 2B รายงานการเปรียบเทียบ: มันทำ "ผลการทดสอบมาตรฐานเชิงเปรียบเทียบ" ได้เมื่อเทียบกับโมเดล Qwen 3 1.7B ที่ควอนไทซ์ 4 บิต โดยวัดเทียบกับโมเดลของเจ้าอื่นที่ความแม่นยำต่างออกไป อย่างหนึ่งเป็นข้อความเกี่ยวกับปริมาณที่สูญเสียไป อีกอย่างเป็นข้อความเกี่ยวกับว่ามันเทียบชั้นได้อย่างไร ไม่มีอันใดเป็นข้อความเกี่ยวกับว่าโมเดลใดดีเพียงใดในเชิงสัมบูรณ์ และทั้งสองไม่สามารถอ่านบนมาตรวัดเดียวกันได้

ความแตกต่างนั้นสำคัญกว่าจำนวนพารามิเตอร์ เพราะมันกำหนดว่าจริง ๆ แล้วคุณสรุปอะไรได้จากตัวเลขของผู้จำหน่าย — และจากหลักฐานที่เผยแพร่จนถึงตอนนี้ คำตอบที่ซื่อตรงก็คือ น้อยกว่าที่ตัวเลขพาดหัวบ่งชี้

คำกล่าวอ้างคุณภาพสองแบบ ไม้บรรทัดสองอันที่ต่างกัน

Ternary Bonsai 2 27B ซึ่งเปิดตัวเมื่อวันที่ 17 กันยายน 2026 เป็นการสร้างใหม่แบบ ternary {−1, 0, +1} ของ Qwen3.8-27B ที่ 1.76 บิตประสิทธิผลต่อน้ำหนัก และตัวเลขที่ PrismML ใช้นำเสนอคือมันยังคงรักษาประสิทธิภาพโดยรวมจากการวัด benchmark ของโมเดลความแม่นยำเต็มไว้ได้มากกว่า 98% นั่นคือข้อกล่าวอ้างเรื่องการคงไว้ และข้อกล่าวอ้างเรื่องการคงไว้นั้นอ้างอิงตัวเองโดยโครงสร้าง: มันบอกคุณว่าเดิมเหลือรอดจากการบีบอัดมากแค่ไหน ไม่ใช่ตำแหน่งที่ต้นฉบับยืนอยู่ โมเดลที่คงไว้ 98% ของพื้นฐานธรรมดา ๆ ก็ยังเป็นโมเดลธรรมดา ๆ และ Qwen3.8-27B ไม่ธรรมดา — แต่ตัวเลขเพียงอย่างเดียวไม่ได้บอกเช่นนั้น และไม่สามารถนำไปเปรียบเทียบข้ามโมเดลฐานได้

โมเดลภาษาภาพ 1-bit Bonsai 2B ซึ่งเปิดตัวเมื่อวันที่ 23 กันยายน 2026 สำหรับแพลตฟอร์มแว่นตา Snapdragon AR1 Gen 1 เป็นโมเดลภาษา 1-bit ขนาด 1.7B บวกกับตัวเข้ารหัสภาพ 4-bit ขนาด 0.3B คำแถลงคุณภาพที่เผยแพร่ของมันแตกต่างในเชิงประเภท: PrismML ประเมินมันเทียบกับโมเดล Qwen 3 1.7B ที่การควอนไทซ์ 4-bit ใน BFCL v3, HumanEval+, MMLU Redux, IFEval, IFBench, MuSR, GSM8K และ GPQA Diamond และรายงานว่าทั้งสองการกำหนดค่าบรรลุผลลัพธ์ที่เทียบเคียงกัน นั่นคือการอ้างความเท่าเทียมเทียบกับเส้นฐานภายนอก มันบอกว่าการบีบอัดไม่ได้ทำให้คุณต้องเสียเปรียบอย่างชัดเจนเมื่อเทียบกับเส้นทาง 4-bit ที่คุณน่าจะใช้เป็นอย่างอื่น — ซึ่งเป็นคำถามที่ถูกต้องพอดีสำหรับการเปิดตัวระดับอุปกรณ์ และเป็นการอ้างที่อ่อนกว่ามากเมื่อเทียบกับ "โมเดลนี้ดี"

ดังนั้นไม่มีการตีความใดที่ 98.2% จะชนะ "comparative" หรือในทางกลับกัน พวกมันเป็นคำตอบสำหรับคำถามสองข้อที่ต่างกัน ซึ่งถามเทียบกับข้อมูลอ้างอิงสองชุดที่ต่างกัน บนชุดทดสอบสองชุดที่ต่างกัน โดยผู้ขายรายเดียวกัน ใครก็ตามที่จัดอันดับสองโมเดลนี้โดยอาศัยสองประโยคนั้น กำลังจัดอันดับตัวประโยคเอง

โมเดลพื้นฐานมาจากแหล่งที่แตกต่างกัน

มีความแตกต่างเชิงโครงสร้างประการที่สอง และมันคือสิ่งที่จะสำคัญในปีหน้า Ternary Bonsai 2 27B เป็นการบีบอัดซ้ำของโมเดลภายนอก — Qwen3.8-27B ของ Alibaba เพดานคุณภาพของมันถูกกำหนดโดยกำหนดการเปิดตัวของคนอื่น และจังหวะการออกรุ่นของมันเป็นไปตามของ Qwen มากกว่าของ PrismML เมื่อ Qwen เปิดตัว 27B ใหม่ ไลน์ Bonsai 27B ก็ได้อินพุตใหม่ และค่าการคงอยู่จะถูกคำนวณใหม่เทียบกับค่าฐานใหม่

1-bit Bonsai 2B ถูกสร้างขึ้นบน Bonsai 1.7B ของ PrismML เอง เพดานของมันถูกกำหนดภายในองค์กร จังหวะการอัปเดตเป็นของ PrismML ที่จะเลือก และการปรับปรุงของมันมาจากสูตรการบีบอัดและเส้นทางเคอร์เนล มากกว่าจากการสลับโมเดลต้นทาง นั่นเป็นสินทรัพย์ประเภทที่แตกต่างออกไป: ปรับปรุงความสามารถดิบได้ช้ากว่า อยู่ภายใต้การควบคุมของผู้ขายโดยสมบูรณ์ และ — อย่างที่การเปิดตัวแว่นตาแสดงให้เห็น — สามารถปรับแต่งสำหรับตัวเร่งความเร็วเฉพาะได้ในแบบที่การบีบอัดซ้ำทั่วไปทำไม่ได้

ทั้งสองเป็นกลยุทธ์ที่ชอบด้วยเหตุผล ทั้งสองใช้แทนกันไม่ได้ และอันที่คุณต้องการนั้นขึ้นอยู่กับว่าโรดแมปของคุณยึดกับของ Qwen หรือยึดกับอุปกรณ์

A screenshot of PrismML's announcement page titled 'PrismML Brings 1-Bit Bonsai Models to AI Smart Glasses Powered by Snapdragon', dated September 23 2026, describing a 2-billion-parameter vision-language model with a 1.7B 1-bit LLM and a 0.3B 4-bit vision encoder running on the Snapdragon AR1 Gen 1 Platform.

การเปรียบต่างข้อกำหนด ทีละบรรทัด

• พารามิเตอร์ — LLM ขนาด 1.7B แบบ 1-bit พร้อม vision encoder ขนาด 0.3B แบบ 4-bit ในโมเดลแว่นตา เทียบกับโมเดลระดับ 27B ที่ได้มาจาก Qwen3.8-27B ใน Ternary Bonsai 2 27B

• การแทนค่า — แบบไบนารี {−1, +1} ด้วยการสเกลแบบกลุ่ม FP16 ในโมเดลแว่นตา เทียบกับแบบไตรภาค {−1, 0, +1} ด้วยการสเกลเดียวกันที่ 1.76 บิตที่มีประสิทธิผลต่อน้ำหนักใน 27B

• น้ำหนักโมเดลภาษา — 0.43 GB สำหรับรุ่น 1-bit 1.7B เมื่อเทียบกับ 5.93 GB สำหรับการแพ็ก PTQ1_0 ของ Ternary Bonsai 2 27B โดยยังมีแพ็ก PQ2_0 ขนาด 7.25 GB ให้ใช้งานได้ด้วย

• บริบท — 1,024 โทเคนบนโมเดลแว่นตา เทียบกับบริบทเต็ม 262,000 โทเคนบน Ternary Bonsai 2 27B

• ตัวเร่งความเร็ว — Qualcomm Hexagon NPU ผ่าน QNN SDK ที่รองรับเคอร์เนลแบบ 1-bit เมื่อเทียบกับ Apple silicon ผ่าน MLX และ NVIDIA ผ่าน CUDA

• คำกล่าวอ้างด้านคุณภาพ — "ผลการวัดเปรียบเทียบมาตรฐาน" เมื่อเทียบกับ Qwen 3 1.7B แบบ 4-bit เทียบกับการรักษาความแม่นยำไว้ "มากกว่า 98%" ของ baseline Qwen3.8-27B แบบ full-precision ทั้งสองเป็นการรายงานโดยผู้ขายเอง ไม่มีรายใดถูกทำซ้ำโดยอิสระ และวัดกันบนชุดทดสอบที่แตกต่างกัน

• รันไทม์ — ชุดเครื่องมือ Qualcomm NPU สำหรับโมเดลแว่นตา เทียบกับฟอร์ก llama.cpp ของ PrismML เอง และคอนเทนเนอร์ MLX สำหรับ 27B ซึ่งไม่มีสิ่งใดที่ llama.cpp มาตรฐานรองรับ

A screenshot of PrismML's launch post for Bonsai 2 27B dated September 17 2026, stating the model is available as a ternary build based on Qwen3.8 27B, reduces the memory footprint by more than 9x to 5.9 GB, and that while the original Ternary Bonsai 27B retained 95% of the aggregate benchmark performance of its full precision counterpart the new model retains over 98%.

สิ่งที่การเดิมพันแบบบิตต่ำให้ในแต่ละกรณี

ปรัชญาการบีบอัดนั้นเหมือนกันในทั้งสองโมเดล และควรค่าแก่การระบุชื่อ เพราะมันคือแก่นข้อเสนอที่แท้จริงของตระกูลนี้: การแทนค่าบิตต่ำทำงานแบบครบวงจรตั้งแต่ต้นจนจบ — embeddings, attention, MLPs และ LM head — ด้วยการสเกลแบบกลุ่มด้วย FP16 และไม่มีช่องทางหนีไปสู่ความแม่นยำที่สูงกว่า ทั้งสองโมเดลไม่ได้เก็บตาข่ายความปลอดภัยแบบ float ไว้สำหรับส่วนที่ควอนไทซ์ได้ยาก นั่นเป็นจุดยืนที่รุกหนักกว่างานควอนไทซ์ส่วนใหญ่ และเป็นสิ่งที่ทำให้ 1.76 บิตต่อน้ำหนักและน้ำหนัก 0.43 GB เป็นไปได้เลย

จุดที่การเดิมพันให้ผลตอบแทนนั้นแตกต่างกัน ใน Ternary Bonsai 2 27B ผลตอบแทนคือความสามารถต่อไบต์บนฮาร์ดแวร์ที่คุณมีอยู่แล้ว: โมเดลระดับ 27B ใน 5.93 GB ที่ทำงานบนแล็ปท็อปหรือโทรศัพท์ ที่ 98% ของค่าพื้นฐาน ใน 1-bit Bonsai 2B ผลตอบแทนคือการมีอยู่บนประเภทอุปกรณ์ที่ไม่มีทางเลือก: โมเดลมัลติโมดัลใน 0.43 GB ของน้ำหนักภาษา บน NPU ที่ 15.36 โทเค็นต่อวินาที อันแรกคือเวอร์ชันที่ดีกว่าของสิ่งที่ทำงานได้อยู่แล้ว อันที่สองคือสิ่งที่ยังไม่เคยทำงานได้มาก่อน

ขอบเขตของระดับอยู่ตรงไหน

สองตัวนี้ไม่ใช่ทางเลือกแทนกัน และการมองว่าเป็นการแข่งแบบตัวต่อตัวก็พลาดรูปแบบการติดตั้งใช้งานที่ทั้งสองเวอร์ชันที่เปิดตัวกำลังชี้ไป ผลิตภัณฑ์แว่นตาหรืออุปกรณ์สวมใส่จะรัน 2B ในเครื่อง เพราะไม่มีอย่างอื่นที่ลงตัว ผลิตภัณฑ์แล็ปท็อปหรือโทรศัพท์จะรัน 27B เพราะทำได้ ทันทีที่ผลิตภัณฑ์หนึ่งครอบคลุมทั้งสองแบบ — แอปโทรศัพท์ที่จับคู่กับแว่นตา แอปแล็ปท็อปที่มีผู้ช่วยบนอุปกรณ์ — คำถามจะไม่ใช่ "โมเดลไหน" อีกต่อไป แต่กลายเป็นว่าแต่ละระดับได้รับอนุญาตให้ตอบคำขอใด

ขอบเขตนั้นควรค่าแก่การใส่ไว้ในคอนฟิกูเรชันมากกว่าในโค้ดแอปพลิเคชัน เพราะทั้งสองชั้นจะขยับเขยื้อน เส้น 27B ขยับเมื่อ Qwen ออกเวอร์ชันใหม่ เส้น 2B ขยับเมื่อ PrismML เปลี่ยนสูตร และกฎที่ฮาร์ดโค้ดไว้เกี่ยวกับความยาวคอนเท็กซ์หรือความสามารถจะพังลงเมื่อเกิดทั้งสองเหตุการณ์ นโยบายการจัดเส้นทางที่ยกระดับคำขอที่เกินงบของชั้นโลคัลไปยังโมเดลโฮสต์จะอยู่รอดได้ทั้งสองการเปลี่ยนแปลง ชั้นโลคัลยังคงเป็นเพียงชั้นหนึ่งในหลายชั้น แทนที่จะเป็นสมมติฐานที่ร้อยเรียงอยู่ทั่วไคลเอนต์ OrcaRouter คือเลเยอร์ที่ทำการยกระดับนั้น — ปลายทางเดียวครอบคลุมโมเดลโฮสต์กว่า 200 โมเดล รวมถึงการสลับเมื่อล้มเหลว ด้วยนโยบายที่แสดงออกมาเป็นคอนฟิกูเรชัน ทั้ง Bonsai สองตัวไม่ได้ถูกจัดเส้นทางที่นี่ ทั้งคู่เป็นดาวน์โหลดแบบโลคัล สิ่งที่อยู่ตรงนี้คือชั้นที่อยู่เหนือทั้งสองขึ้นไป และเมื่อโมเดลโลคัลมีขนาด 1,024 โทเคน ชั้นนั้นก็ทำงานส่วนใหญ่ไป

A generated scoreboard titled 'Bonsai vs Ternary Bonsai 2 27B — the scoreboard'. The Bonsai column reads: parameters 1.7B 1-bit LLM plus 0.3B 4-bit vision encoder; weights 0.43 GB; context 1,024 tokens; representation binary; quality claim comparative against 4-bit Qwen 3 1.7B; accelerator Qualcomm Hexagon NPU. The Ternary Bonsai 2 27B column reads: parameters 27B on Qwen3.8-27B; weights 5.93 GB PTQ1_0; context 262K tokens; representation ternary at 1.76 bits per weight; quality claim over 98% retention of full precision; accelerator Apple MLX and NVIDIA CUDA. Footer reads 'All quality figures vendor-reported; the two claims use different baselines and suites.' The OrcaRouter logo sits in the bottom-right.

อะไรจะยุติเรื่องนี้ได้

การวัดสามอย่างจะเปลี่ยนคู่นี้จากคำกล่าวอ้างทางการตลาดสองข้อให้กลายเป็นการเปรียบเทียบ การแยกย่อยราย benchmark ที่อยู่เบื้องหลังบรรทัด "ผลลัพธ์เชิงเปรียบเทียบ" เพื่อให้เห็นข้อแลกเปลี่ยนเมื่อเทียบกับ 4-bit แทนที่จะเป็นแค่การสรุป ตัวเลขการรักษาคุณภาพของ Bonsai 2B แบบ 1-bit เมื่อเทียบกับ baseline ความแม่นยำเต็มของมันเอง — การวัดที่ PrismML ใช้กับไลน์ 27B และไม่ได้เผยแพร่ในที่นี้ และการประเมินที่เป็นอิสระของโมเดลใดโมเดลหนึ่ง เนื่องจากตัวเลขทุกตัวในทั้งสองรุ่นที่เปิดตัวในขณะนี้มาจากผู้ขาย

จนกว่าหนึ่งในนั้นจะมีอยู่จริง จุดยืนที่ปกป้องได้คือจุดยืนที่ตัวเลขสนับสนุนจริง ๆ: Ternary Bonsai 2 27B เป็นโมเดลที่ดีกว่าอย่างทิ้งห่าง และ 1-bit Bonsai 2B เป็นเพียงรุ่นเดียวในสองรุ่นนี้ที่รันบนอุปกรณ์ที่มันถูกสร้างขึ้นมาเพื่อ สองข้อความนี้ไม่ได้ขัดแย้งกัน และความจริงที่ว่าผู้ขายรายเดียวกันวัดพวกมันด้วยไม้บรรทัดคนละอันคือสิ่งที่ควรจดจำไว้ในครั้งต่อไปที่มีการอ้างตัวเลขใดตัวเลขหนึ่งเหล่านี้โดยไม่มีค่าฐานของมัน

© 2026 OrcaRouter

สำหรับผู้ให้บริการ

ให้บริการแพลตฟอร์มการอนุมานอยู่หรือไม่ นำโมเดลของคุณขึ้น OrcaRouter

providers@orcarouter.ai

เข้าร่วมคอมมูนิตี้ของเรา

Discordsupport@orcarouter.aiXGitHubYouTube