การ์ดชื่อเรื่องที่สร้างขึ้นซึ่งมีข้อความว่า 'Bonsai บนแว่นตาอัจฉริยะ' โดยมีคำบรรยายรองว่า 'โมเดลภาษาภาพ 1-bit ขนาด 2 พันล้านพารามิเตอร์ที่รันในเครื่อง' เหนือการ์ดสามใบที่มีข้อความว่า '1.7B 1-bit LLM + 0.3B 4-bit ตัวเข้ารหัสภาพ', 'บริบท: 1,024 โทเค็น' และ 'น้ำหนัก LLM: 0.43 GB เทียบกับ 1.66 GB ที่ 4-bit' พร้อมส่วนท้ายที่อ่านว่า 'ตัวเลขที่ผู้ขายรายงาน กันยายน 2026.' โลโก้ OrcaRouter อยู่ที่มุมล่างขวา
Engineering & Research

Bonsai บนแว่นตาอัจฉริยะ: VLM ขนาด 2B แบบ 1-บิต ที่รันบน Snapdragon AR1 Gen 1

ผู้เขียน

Magnus Corvin

วันที่เผยแพร่

โมเดลล่าสุด · 20ดูโมเดลทั้งหมด →
เบนช์มาร์ก: Artificial Analysis · อัปเดตทุกวัน
กลับไปยังโพสต์ทั้งหมด

ตัวเลขที่ตัดสินว่าประกาศนี้มีประโยชน์จริงกับสิ่งใด ไม่ใช่ 4x และไม่ใช่ 2x หากแต่คือ 1,024 — ความยาวคอนเท็กซ์ของโมเดลที่ PrismML นำไปใส่ในแว่นตาอัจฉริยะหนึ่งคู่ที่งาน Snapdragon Summit เมื่อวันที่ 23 กันยายน 2026 โมเดลวิสชัน-ภาษา Bonsai 2B แบบ 1-bit ซึ่งเป็นระบบขนาด 2 พันล้านพารามิเตอร์ที่สร้างบน Bonsai 1.7B ทำงานในเครื่องบนแว่นตาอัจฉริยะ AI ที่ขับเคลื่อนด้วย Snapdragon AR1 Gen 1 Platform และตัวเลขที่ PrismML นำมาโชว์ก่อนคือหน่วยความจำและความเร็ว: น้ำหนัก LLM 0.43 GB เทียบกับ 1.66 GB สำหรับโมเดล 1.7B แบบ 4-bit ที่เทียบเคียงกัน ลดลง 3.83 เท่า และ 15.36 โทเค็นต่อวินาที เทียบกับ 7.44 ปรับปรุงขึ้น 2.06 เท่า ตัวเลขทั้งสองเป็นของเจ้าของผลิตภัณฑ์เอง ทั้งคู่วัดบนแพลตฟอร์มทดสอบ 4 GB และทั้งคู่วัดเทียบกับโมเดล Qwen 3 1.7B แบบ 4-bit พวกมันไม่ได้วัดเทียบกับ Bonsai 27B ใด ๆ และไม่ได้วัดเทียบกับสิ่งใดก็ตามที่โฮสต์ไว้ การตีความว่ามันเป็นคำกล่าวอ้างเกี่ยวกับคุณภาพของ Bonsai จะเป็นการเข้าใจผิด ส่วนการตีความว่ามันเป็นคำกล่าวอ้างเกี่ยวกับสิ่งที่พอดีกับงบหน่วยความจำระดับแว่นตาต่างหากที่ถูกต้อง

ทุกสิ่งที่ถูกประกาศไว้ รวมอยู่ในที่เดียว

ประกาศของ PrismML — ซึ่งมีต้นข่าวจากพาซาดีนา และเชื่อมโยงกับงาน Snapdragon Summit ของ Qualcomm — นำโมเดลภาพ-ภาษาขนาด 2 พันล้านพารามิเตอร์มาสู่แพลตฟอร์มแว่น AR1 Gen 1 โดยโครงสร้างแบ่งเป็นโมเดลภาษาแบบ 1 บิตขนาด 1.7B บวกกับตัวเข้ารหัสภาพแบบ 4 บิตขนาด 0.3B และมีความยาวบริบท 1,024 โทเคน มันสร้างขึ้นบน Bonsai 1.7B ของ PrismML จึงจัดเป็นรุ่นเล็กสุดในตระกูล Bonsai มากกว่าจะเป็นสถาปัตยกรรมใหม่ และถูกคอมไพล์สำหรับ Qualcomm Hexagon NPU โดยใช้ QNN SDK ภายในที่รองรับเคอร์เนลแบบ 1 บิต

พาดหัวข่าวกล่าวอ้าง ตามที่ผู้ขายระบุ:

• รองรับโมเดลที่มีจำนวนพารามิเตอร์เป็น 4 เท่า ภายใต้ข้อจำกัดหน่วยความจำเดียวกันบนฟอร์มแฟกเตอร์ของแว่นตาบางรูปแบบ

• ให้ความสามารถเชิงปัญญาเทียบเท่าโดยประมาณกับโมเดลเดียวกันที่ความแม่นยำ 4 บิต ขณะที่ใช้หน่วยความจำน้อยลงประมาณ 4 เท่า

• สร้างโทเค็นด้วยความเร็วมากกว่า 2 เท่า

สามประโยคนั้นคือข่าวประชาสัมพันธ์ การวัดเฉพาะเจาะจงที่อยู่เบื้องหลังคำกล่าวอ้างด้านหน่วยความจำและความเร็ว คือ 0.43 GB เทียบกับ 1.66 GB และ 15.36 เทียบกับ 7.44 โทเคนต่อวินาที โดยทั้งคู่อยู่บนแพลตฟอร์มที่กำหนดค่าด้วยหน่วยความจำ 4 GB AR1 Gen 1 เองระบุไว้ที่ค่าสูงสุด 6 TOPS และ 2,304 MACs ต่อรอบ — เป็นตัวเลขของแพลตฟอร์ม ไม่ใช่สำหรับการอนุมานของโมเดลภาษา ซึ่งเป็นความแตกต่างที่ตัวเลขของประกาศเองทำให้ชัดเจนโดยการระบุโทเคนต่อวินาทีแยกต่างหาก

A screenshot of PrismML's announcement page titled 'PrismML Brings 1-Bit Bonsai Models to AI Smart Glasses Powered by Snapdragon', dated September 23 2026, describing a 2-billion-parameter vision-language model running locally on AI smart glasses powered by the Snapdragon AR1 Gen 1 Platform, fitted with a 1.7B 1-bit LLM and a 0.3B 4-bit vision encoder and a 1,024-token context.

4x เป็นข้อกล่าวอ้างเกี่ยวกับหน่วยความจำ และค่าพื้นฐานนั้นเป็นโมเดลที่แตกต่างออกไป

นี่คือส่วนที่ควรแก่การค่อย ๆ พิจารณาให้ดี เพราะ "4x" เป็นตัวเลขประเภทที่แพร่ไปไกลกว่าประโยคที่มันถือกำเนิดมา ทุกการเปรียบเทียบที่ PrismML เผยแพร่สำหรับโมเดลแว่นตานั้นเป็นการเทียบกับควอนไทเซชัน 4 บิตของ Qwen 3 1.7B — ระดับพารามิเตอร์เดียวกัน งานเดียวกัน แต่ควอนไทเซชันต่างกัน นั่นเป็นการเปรียบเทียบที่สมเหตุสมผลและมีประโยชน์: มันคือการเปรียบเทียบที่ผู้ผลิตแว่นตา OEM เผชิญจริง โดยคำถามคือเส้นทางแบบ 1 บิตให้หน่วยความจำคืนมามากพอที่จะคุ้มกับงานพัฒนาเคอร์เนลหรือไม่ มันไม่ใช่การเปรียบเทียบกับ Bonsai เวอร์ชัน 4 บิต และไม่ใช่การเปรียบเทียบกับ Bonsai ขนาดใหญ่กว่าที่รันอยู่ที่อื่น

เชิงอรรถด้าน benchmark ที่แนบท้ายประกาศก็รอบคอบในลักษณะเดียวกัน PrismML ได้ประเมิน Bonsai 1.7B 1-bit LLM เทียบกับโมเดล Qwen 3 1.7B 4-bit ในเดือนกันยายน 2026 บน BFCL v3, HumanEval+, MMLU Redux, IFEval, IFBench, MuSR, GSM8K และ GPQA Diamond และผลลัพธ์ที่รายงานคือการกำหนดค่าทั้งสองแบบ "ให้ผลการทดสอบ benchmark ที่เทียบเคียงกันได้" เทียบเคียงกันได้ ไม่ได้เหนือกว่า ในประกาศไม่มีคะแนนแยกตาม benchmark และไม่มีการทำซ้ำผลลัพธ์ใด ๆ ของทั้งหมดนั้นโดยอิสระ ซึ่งเป็นเรื่องปกติสำหรับการเปิดตัวรุ่น edge ในสัปดาห์เปิดตัว และนั่นคือเหตุผลที่ตัวเลขเหล่านี้ควรถูกนำเสนอเป็นข้อมูลที่ผู้ขายรายงาน จนกว่าจะมีบุคคลภายนอก PrismML เป็นผู้รันการทดสอบเหล่านั้น

1,024 โทเคน คือสเปกที่กำหนดรูปร่างของผลิตภัณฑ์

โมเดลภาษาศาสตร์-ภาพบนแว่นตาเป็นภาระงานที่ต่างจากโมเดลภาษาศาสตร์-ภาพในหน้าต่างแชต และความยาวบริบทคือจุดที่ความต่างนี้ปรากฏชัด ที่ 1,024 โทเคน โมเดลสามารถถือคำสั่งสั้น ๆ บวกกับสิ่งที่กล้องกำลังมองอยู่ในขณะนั้นได้ แต่ไม่สามารถถือประวัติการสนทนา เอกสาร หรือลำดับการสนทนาก่อนหน้ายาว ๆ ไว้ได้ นั่นไม่ใช่ข้อบกพร่องของการเปิดตัว — มันคือข้อจำกัดที่ทำให้การเปิดตัวนี้เกิดขึ้นได้ เพราะ KV cache และแอ็กติเวชันต้องอยู่ในหน่วยความจำ 4 GB เดียวกับเวท และโมเดลระดับ 27B ที่มีบริบท 262K โทเคนต้องใช้พื้นที่สำหรับสถานะนั้นมากกว่าหลายอันดับขนาด

ดังนั้น คำอธิบายที่ตรงไปตรงมาของสิ่งที่ถูกส่งมอบก็คือ ผู้ช่วยที่มีความสามารถด้านบริบทสั้นซึ่งทำงานทั้งหมดบนอุปกรณ์ งานที่เหมาะกับแว่นตา — จดจำสิ่งนี้ อ่านสิ่งนั้น แปลป้ายที่อยู่ตรงหน้าฉัน ตอบคำถามเกี่ยวกับสิ่งที่ฉันกำลังมองอยู่ — พอดีอยู่ใน 1,024 โทเคน อะไรก็ตามที่ต้องจดจำช่วงสิบนาทีล่าสุดจะไม่พอดี และต่อให้บีบอัดแบบ 1 บิตมากแค่ไหนก็ไม่เปลี่ยนความจริงข้อนี้ เพราะขีดจำกัดอยู่ที่สถานะ ไม่ใช่น้ำหนัก

สิ่งที่ระบบนิเวศ edge ควรนำไปปรับใช้จากมัน

วิศวกรรมที่เป็นของใหม่จริง ๆ ในประกาศนี้ไม่ใช่ตัวโมเดล แต่เป็นเส้นทางเคอร์เนล: LLM แบบ 1 บิตที่คอมไพล์สำหรับ Hexagon NPU ผ่าน QNN SDK ที่รองรับเคอร์เนลแบบ 1 บิต ค่าน้ำหนักแบบบิตต่ำสามารถรันบน CPU และ GPU ได้มาสักระยะหนึ่งแล้ว และการเปิดตัว Bonsai 27B ของ PrismML เองก็แสดงให้เห็นสิ่งนั้นบนฮาร์ดแวร์ Apple silicon และ NVIDIA การนำเคอร์เนลที่มีค่าน้ำหนักแบบไบนารีไปทำงานบน NPU ของมือถือเป็นปัญหาที่ต่างออกไป เพราะเส้นทางข้อมูลของตัวเร่งความเร็ว รูปแบบการแพ็กข้อมูล และการจัดตารางเวลาของมัน ล้วนต้องรองรับการแทนค่าที่ไม่ใช่ชนิดข้อมูลแบบ float เลย

หากเส้นทางนั้นสามารถขยายผลไปได้เกินกว่าโมเดลนี้เพียงตัวเดียว — และถ้อยคำในเอกสาร SDK บ่งชี้ว่า PrismML ตั้งใจให้เป็นเช่นนั้น — ผลลัพธ์ที่น่าสนใจก็คือ ตระกูล 1-bit จะไม่ใช่เรื่องราวของแล็ปท็อปและโทรศัพท์อีกต่อไป แต่จะกลายเป็นเรื่องราวของอุปกรณ์ที่เปิดทำงานตลอดเวลา แพลตฟอร์ม 4 GB ที่ประกาศในข่าวคือเพดานปัจจุบัน สิ่งใดก็ตามที่ลดขนาดหน่วยความจำของน้ำหนักลงได้โดยคุณภาพคงที่ ย่อมเพิ่มขนาดของโมเดลที่ใส่ลงไปได้ภายใต้เพดานนั้น

A screenshot of the Hugging Face model page for prism-ml/Bonsai-1.7B-mlx-1bit, PrismML's 1-bit Bonsai 1.7B language model — the parameter class and 1-bit representation that the glasses release is built on.

คำกล่าวอ้างเรื่องบนอุปกรณ์นั้นสมควรมีข้อแม้สักหนึ่งข้อ

การอนุมานแบบมัลติโมดัลภายในเครื่องทั้งหมดบนแว่นตาหนึ่งคู่เป็นคำกล่าวอ้างที่หนักแน่น และควรค่าแก่การแยกว่าอะไรคือสิ่งที่ถูกสาธิตให้เห็นแล้ว กับอะไรคือสิ่งที่บอกเป็นนัย AR1 Gen 1 เป็นแพลตฟอร์มแว่นตาที่สร้างขึ้นสำหรับการรับรู้และเสียงแบบทำงานตลอดเวลา การวางกรอบของ Qualcomm เองสำหรับโมเดลภาษาบนอุปกรณ์โดยทั่วไปเป็นแบบไฮบริด โดยอุปกรณ์จัดการสิ่งที่ทำได้และส่งส่วนที่เหลือไปยังโทรศัพท์ที่จับคู่ไว้หรือคลาวด์ การสาธิตโมเดลภาษาขนาดเล็กบนอุปกรณ์ต่อสาธารณะครั้งแรกของ Qualcomm ผูกอยู่กับแพลตฟอร์ม AR1+ Gen 1 ไม่ใช่ AR1 Gen 1 ไม่มีประเด็นใดขัดแย้งกับประกาศของ PrismML — ประกาศระบุว่าโมเดลทำงานภายในเครื่องบน AR1 Gen 1 และตัวเลขอัตราการประมวลผลกับหน่วยความจำของผู้ขายเองก็สอดคล้องกับโมเดลขนาดเล็กที่ทำเช่นนั้นจริง — แต่ประเด็นเหล่านี้หมายความว่าผลิตภัณฑ์จริงที่สร้างบนพื้นฐานนี้เกือบจะแน่นอนว่าจะเป็นระดับภายในเครื่องที่มีเส้นทางส่งต่อไปยังระบบอื่น ไม่ใช่อุปกรณ์ที่ไม่เคยสื่อสารกับสิ่งอื่นใดเลย

นั่นก็เป็นสถาปัตยกรรมที่ถูกต้องอยู่แล้ว โมเดลโลคัลขนาด 1,024 โทเคนนั้นเก่งมากกับคำขอที่พอดีกับ 1,024 โทเคน และไม่สามารถตอบคำขอที่ไม่พอดีได้

ตำแหน่งที่เส้นทางการยกระดับควรอยู่

สำหรับใครก็ตามที่กำลังสร้างบนรีลีสแบบนี้ คำถามด้านการออกแบบไม่ใช่ว่าโมเดลสำหรับแว่นตานั้นดีหรือไม่ แต่คือจะเกิดอะไรขึ้นกับคำขอที่มันให้บริการไม่ได้ ถ้าตอบด้วยโค้ดของแอปพลิเคชัน มันก็จะกลายเป็นกองของกรณีพิเศษที่ต้องเขียนใหม่ทุกครั้งที่โมเดลบนอุปกรณ์เปลี่ยนขนาดหรือคอนเท็กซ์ ถ้าตอบด้วยนโยบายการจัดเส้นทาง มันก็จะกลายเป็นกฎเพียงข้อเดียว: คำขอที่เกินงบคอนเท็กซ์ของเทียร์โลคอล หรือที่ต้องใช้เครื่องมือหรือการให้เหตุผลที่เทียร์โลคอลไม่มี จะถูกยกระดับไปยังโมเดลที่โฮสต์ไว้ นโยบายแบบนี้คือสิ่งที่ OrcaRouter ถูกสร้างขึ้นมาเพื่อรองรับ — ปลายทางเดียวที่อยู่หน้าโมเดลที่โฮสต์ไว้กว่า 200 ตัว พร้อมการสลับสำรองเมื่อล้มเหลว และ นโยบายที่กำหนดไว้ในคอนฟิกูเรชันแทนที่จะอยู่ในไคลเอนต์. ตัว Bonsai เองไม่ได้ถูกจัดเส้นทางที่นี่ มันเป็นสิ่งที่คุณดาวน์โหลดไปรันบนฮาร์ดแวร์ของคุณเอง สิ่งที่เลเยอร์การจัดเส้นทางครอบคลุมคือขอบเขตที่อยู่เหนือมันขึ้นไป และขอบเขตนั้นคือจุดที่การติดตั้งใช้งานแว่นตาจะใช้เวลาในงานวิศวกรรมไปมากที่สุด

A generated scoreboard titled 'Bonsai 2B VLM on Snapdragon AR1 Gen 1 — the scoreboard', listing: parameters 1.7B 1-bit LLM plus 0.3B 4-bit vision encoder; context 1,024 tokens; LLM weights 0.43 GB versus 1.66 GB for a 4-bit 1.7B; decode speed 15.36 versus 7.44 tokens per second; accelerator Qualcomm Hexagon NPU via a QNN SDK with 1-bit kernel support; test platform 4 GB of memory. Footer reads 'All figures vendor-reported, September 2026; comparison baseline is a 4-bit Qwen 3 1.7B, not another Bonsai.' The OrcaRouter logo sits in the bottom-right.

สิ่งที่ควรดูต่อไป

สามสิ่งจะยกระดับสิ่งนี้จากการประกาศให้กลายเป็นแพลตฟอร์มได้ การแจกแจงรายเบนช์มาร์กเบื้องหลังบรรทัด "ผลลัพธ์เปรียบเทียบ" เพื่อให้เห็นข้อแลกเปลี่ยนเมื่อเทียบกับ 4-bit แทนที่จะเป็นเพียงการสรุป หน้าต่างบริบทที่ใหญ่ขึ้นบนเส้นทาง NPU เดียวกัน ซึ่งเป็นปัญหาเรื่องหน่วยความจำสถานะมากกว่าปัญหาเรื่องเวต และด้วยเหตุนี้จึงเป็นเรื่องที่ยากกว่าในสองเรื่องนี้ และการประเมินที่เป็นอิสระของ LLM 1-bit ขนาด 1.7B เทียบกับคู่เทียบ 4-bit เพราะตัวเลขทุกตัวในรุ่นนี้ในตอนนี้มาจากฝ่ายที่สร้างมันขึ้นมา

จนถึงตอนนั้น สรุปที่แม่นยำก็ยังคงแคบและมีประโยชน์: โมเดลมัลติโมดัลขนาด 2 พันล้านพารามิเตอร์ตอนนี้รันบนอุปกรณ์ระดับแว่นตาด้วยค่าน้ำหนักภาษาขนาด 0.43 GB ที่ความเร็วประมาณสองเท่าและหน่วยความจำประมาณหนึ่งในสี่ของเวอร์ชันเทียบเท่าแบบ 4-bit ภายใต้งบประมาณบริบท 1,024 โทเคน นั่นเป็นก้าวที่แท้จริงสำหรับการอินเฟอเรนซ์บนอุปกรณ์ และเป็นก้าวเล็ก ๆ สำหรับความสามารถของโมเดล และสองสิ่งนี้ไม่ใช่คำกล่าวอ้างเดียวกัน

© 2026 OrcaRouter

สำหรับผู้ให้บริการ

ให้บริการแพลตฟอร์มการอนุมานอยู่หรือไม่ นำโมเดลของคุณขึ้น OrcaRouter

providers@orcarouter.ai

เข้าร่วมคอมมูนิตี้ของเรา

Discordsupport@orcarouter.aiXGitHubYouTube