
Bonsai กับ Bonsai 27B: ชื่อตระกูลเดียวกัน แต่พารามิเตอร์มากกว่า 16 เท่า
- openaiใหม่OpenAI: GPT-6 Luna2026-09-2237ความฉลาด
- openaiใหม่OpenAI: GPT-6 Sol2026-09-2248ความฉลาด
- anthropicใหม่Anthropic: Claude Opus 5.52026-09-2258ความฉลาด
- grokใหม่Grok 4.72026-09-2146ความฉลาด
- Orcaใหม่Orca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 ต่อ 1 ล้านโทเค็น
- orcaใหม่Orca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 ต่อ 1 ล้านโทเค็น
- deepseekใหม่DeepSeek: DeepSeek V4.1 Flash2026-09-1040ความฉลาด
- openaiOpenAI: GPT-6 Astra2026-09-0453ความฉลาด77การเขียนโค้ด
- googleGoogle: Gemini 3.8 Flash2026-09-0241ความฉลาด76การเขียนโค้ด
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245ความฉลาด76การเขียนโค้ด
- anthropicAnthropic: Claude Fable 5.12026-09-0153ความฉลาด82การเขียนโค้ด
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 ต่อ 1 ล้านโทเค็น
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642ความฉลาด72การเขียนโค้ด
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 ต่อ 1 ล้านโทเค็น
- z-aiZ.ai: GLM 5.32026-08-1845ความฉลาด75การเขียนโค้ด
- obsidianQwen3.8 27B2026-08-1534ความฉลาด68การเขียนโค้ด
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236ความฉลาด69การเขียนโค้ด
- grokSpaceXAI: Grok 4.62026-08-1244ความฉลาด77การเขียนโค้ด
- metaMeta: Muse Spark 1.22026-08-0540ความฉลาด72การเขียนโค้ด
- qwenQwen: Qwen3.8 Max2026-08-0345ความฉลาด76การเขียนโค้ด
ใครก็ตามที่เลือกซื้อโมเดลในตระกูลนี้ตามชื่อจะได้โมเดลผิดรุ่น และเหตุผลก็คือชื่อล้วน ๆ ว่า "Bonsai" ไม่ใช่ชื่อโมเดล แต่มันคือตระกูล และ ณ สัปดาห์นี้ ตระกูลนี้มีโมเดลภาษา-ภาพขนาด 2 พันล้านพารามิเตอร์ที่รันบนแว่นตาอัจฉริยะหนึ่งคู่ กับโมเดลขนาด 27 พันล้านพารามิเตอร์ที่รันบนโทรศัพท์ แล็ปท็อป หรือเดสก์ท็อป ตัวแรกคือโมเดลภาษา-ภาพ 1-bit Bonsai 2B ที่ประกาศเมื่อวันที่ 23 กันยายน 2026 — โมเดลภาษา 1-bit ขนาด 1.7B บวกตัวเข้ารหัสภาพ 4-bit ขนาด 0.3B, บริบท 1,024 โทเคน, สร้างบน Bonsai 1.7B ตัวที่สองคือ Bonsai 27B เปิดตัวเมื่อวันที่ 14 กรกฎาคม 2026 ภายใต้ Apache 2.0 สร้างบน Qwen3.6-27B ด้วยบริบท 262,000 โทเคน และมีให้เลือกเป็นบิลด์ ternary 5.9 GB หรือบิลด์ไบนารี 3.9 GB ทั้งสองใช้ชื่อเดียวกัน ผู้จำหน่ายรายเดียวกัน ปรัชญาการบีบอัดเดียวกัน และแทบไม่มีอะไรเหมือนกันเลย พารามิเตอร์มากกว่าสิบหกเท่า บริบทมากกว่าสองร้อยห้าสิบหกเท่า และอุปกรณ์ที่แตกต่างกันโดยสิ้นเชิงสองแบบ
หน้านี้จัดทำขึ้นสำหรับผู้ที่ค้นหาหนึ่งในนั้นแล้วมาพบอีกอันหนึ่ง
ปัญหาการตั้งชื่อ ที่พูดกันตรง ๆ
เมนูโมเดลของ PrismML ขณะนี้มีรายการ Bonsai 2 27B, Bonsai 27B, Bonsai 8B, Bonsai 4B, Bonsai 1.7B และ Bonsai Image การประกาศเกี่ยวกับแว่นตาเพิ่มโมเดลแบบภาพ-ภาษาขนาด 2 พันล้านพารามิเตอร์ต่อยอดจากสาย Bonsai 1.7B ดังนั้นคำว่า "Bonsai" เพียงลำพังอาจหมายถึงคลาสพารามิเตอร์อย่างน้อยสี่ระดับและสองรุ่น และคำต่อท้ายขนาดเป็นเพียงสิ่งเดียวที่ช่วยแยกแยะความกำกวม นั่นไม่ใช่การวิจารณ์การตั้งชื่อ — มันเป็นรูปแบบปกติของตระกูลโมเดล — แต่ก็หมายความว่าชื่อตระกูลไม่ได้ให้ข้อมูลใด ๆ เกี่ยวกับสิ่งที่คุณกำลังดาวน์โหลด
การแบ่งที่มีประโยชน์ไม่ใช่การแบ่งตามเจเนอเรชัน แต่เป็นการแบ่งตามคลาสของอุปกรณ์ ทุกอย่างในสาย 27B ตั้งสมมติฐานว่าคุณมีหน่วยความจำระหว่าง 4 GB ถึง 8 GB ที่จะมอบให้โมเดลภาษา และยินดีที่จะใช้จ่ายหน่วยความจำนั้น ทุกอย่างในสาย 1.7B ตั้งสมมติฐานว่าคุณมีเพียงไม่กี่ร้อยเมกะไบต์และไม่มีมากไปกว่านั้น ข้อเท็จจริงเดียวนี้เป็นตัวกำหนดว่าครึ่งไหนของตระกูลที่เกี่ยวข้องกับคุณ ก่อนที่ผลเบนช์มาร์กใด ๆ จะเป็นตัวกำหนด
แต่ละอย่างจริงๆ แล้วคืออะไร
• พารามิเตอร์ — LLM แบบ 1 บิตขนาด 1.7B พร้อมตัวเข้ารหัสภาพแบบ 4 บิตขนาด 0.3B ในโมเดลแว่นตา เทียบกับโมเดลระดับ 27B ที่ต่อยอดจาก Qwen3.6-27B ใน Bonsai 27B
• บริบท — 1,024 โทเคนบนโมเดลแว่นตา เทียบกับบริบทแบบเต็ม 262,000 โทเคนบน Bonsai 27B
• น้ำหนักของโมเดลภาษา — 0.43 GB สำหรับ 1-bit 1.7B เทียบกับ 5.9 GB สำหรับ Bonsai 27B แบบ ternary และ 3.9 GB สำหรับบิลด์ 1-bit ของมัน
• การแทนค่า — น้ำหนักไบนารี {−1, +1} พร้อมการสเกลแบบกลุ่มด้วย FP16 ในทั้งสองแบบ ซึ่งเป็นสูตร 1-bit ที่ตระกูลนี้สร้างขึ้นมาโดยยึดเป็นแกนหลัก; Bonsai 27B ยังมีบิลด์แบบ ternary {−1, 0, +1} เพิ่มเติมที่ 1.71 บิตที่มีประสิทธิผลต่อน้ำหนัก
• ซิลิคอนเป้าหมาย — Qualcomm Hexagon NPU บนแพลตฟอร์มแว่นตา Snapdragon AR1 Gen 1 ซึ่งคอมไพล์ผ่าน QNN SDK ที่รองรับเคอร์เนล 1-bit เทียบกับ Apple silicon ผ่าน MLX และ NVIDIA ผ่าน CUDA สำหรับ Bonsai 27B
• ทรูพุตการถอดรหัส — 15.36 โทเคนต่อวินาที บนแพลตฟอร์มทดสอบ AR1 Gen 1 ขนาด 4 GB สำหรับโมเดลแว่นตา เทียบกับประมาณ 11 โทเคนต่อวินาทีบน iPhone 17 Pro, 87 บน Apple M5 Max และ 163 บน RTX 5090 สำหรับ 1-bit Bonsai 27B
ตัวเลขเหล่านั้นทั้งหมดเป็นของฝ่ายขาย และชุดข้อมูลทั้งสองถูกวัดบนฮาร์ดแวร์ที่ต่างกันโดยเทียบกับค่าพื้นฐานที่ต่างกัน ดังนั้นจึงอธิบายถึงผลิตภัณฑ์สองอย่างมากกว่าที่จะเป็นสองจุดบนเส้นโค้งเดียวกัน

จุดที่ Bonsai 27B ชนะ และไม่ใช่การแข่งขันที่สูสี
คอนเท็กซ์คือสิ่งแรก และความต่างไม่ใช่รายละเอียดปลีกย่อย หน้าต่าง 262,000 โทเคนบรรจุโค้ดเบส เอกสารยาว บันทึกการถอดเสียง หรือเซสชันเอเจนต์ที่ทำงานอยู่ได้อย่างเหลือเฟือ หน้าต่าง 1,024 โทเคนบรรจุคำสั่งสั้น ๆ หนึ่งคำสั่งและรูปภาพหนึ่งรูป หากปริมาณงานของคุณเกี่ยวข้องกับการอ่านสิ่งใดที่ยาวกว่าหนึ่งหน้า Bonsai 27B เป็นเพียงหนึ่งเดียวในสองรุ่นที่ทำงานนี้ได้เลย และไม่ว่าการพรอมป์ต์อย่างชาญฉลาดบนโมเดลแว่นตาจะมากเพียงใดก็ปิดช่องว่างนั้นไม่ได้ เพราะขีดจำกัดคือหน่วยความจำที่สงวนไว้สำหรับสถานะคีย์-แวลู ไม่ใช่ขนาดของเวต
ความสามารถเป็นเรื่องรองลงมา มีรายงานว่าบิลด์แบบ ternary ของ Bonsai 27B ยังคงคุณภาพไว้ประมาณ 95% เมื่อเทียบกับค่าพื้นฐานแบบ full-precision ของมันในชุดทดสอบโหมดคิดจำนวน 15 เบนช์มาร์ก และบิลด์ 1-bit ประมาณ 90% โดยสูญเสียมากที่สุดในงานด้านภาพและการใช้เครื่องมือ นั่นเป็นตัวเลขจากผู้ขายบนชุดทดสอบของผู้ขายเอง และยังเป็นคนละระดับกันโดยสิ้นเชิงกับโมเดลขนาด 2 พันล้านพารามิเตอร์ ซึ่งคำกล่าวอ้างด้านคุณภาพเดียวที่เผยแพร่ของมันคือทำได้ “ผลการทดสอบเบนช์มาร์กที่เทียบเคียงได้” กับ Qwen 3 1.7B แบบ 4-bit โมเดลสำหรับแว่นตานี้ไม่ได้ถูกนำไปเปรียบเทียบกับโมเดล 27B โดยผู้ผลิตของมันเอง เพราะการเปรียบเทียบนั้นจะไม่มีประโยชน์
ระบบนิเวศคือข้อที่สาม Bonsai 27B มีให้ใช้งานในรูปแบบแพ็ก GGUF, MLX และ AWQ พร้อมรันไทม์ที่มีเอกสารประกอบ ดังนั้นจึงมีเส้นทางให้รันบนฮาร์ดแวร์ที่คุณมีอยู่แล้ว โมเดลแว่นตามีอยู่ภายในทูลเชน Qualcomm NPU

จุดที่ 2B ชนะ และนั่นคือประเด็นทั้งหมด
โมเดลภาษาขนาด 0.43 GB พอจะใส่ลงในที่ที่โมเดลขนาด 5.9 GB ไปไม่ได้ และแพลตฟอร์มแว่นตาก็เป็นหนึ่งในนั้น นั่นคือข้อโต้แย้งทั้งหมด และมันเป็นข้อโต้แย้งที่หนักแน่นกว่าที่การเปรียบเทียบสเปกทำให้ดูเหมือน เพราะอุปกรณ์ที่พูดถึงไม่มีทางเลือกอื่น: แว่นตาหนึ่งคู่ที่มีหน่วยความจำแพลตฟอร์มร่วม 4 GB ไม่สามารถรองรับ Bonsai 27B ได้ในบิลด์ใด ๆ และโทรศัพท์ก็ไม่สามารถรองรับบิลด์ ternary ได้โดยไม่ต้องสละจุดประสงค์หลักของโทรศัพท์ไปเกือบทั้งหมด
ยังมีข้อดีอีกประการที่ได้รับความสนใจน้อยกว่า: การแทนค่าด้วย 1 บิตไม่ใช่การประนีประนอมสำหรับอุปกรณ์ระดับนี้ แต่เป็นกลไกสำคัญที่ทำให้มันเป็นไปได้ คำอธิบายของ PrismML เองก็คือ เส้นทางแบบ 1 บิตให้ความสามารถเชิงสติปัญญาเทียบเท่ากับโมเดลเดียวกันที่ความแม่นยำ 4 บิตโดยประมาณ ขณะที่ใช้หน่วยความจำประมาณหนึ่งในสี่ และสร้างโทเคนด้วยความเร็วมากกว่าสองเท่า สำหรับอุปกรณ์ที่เปิดทำงานตลอดเวลาซึ่งทุกมิลลิวัตต์และทุกเมกะไบต์ต้องแย่งชิงกัน การแลกเปลี่ยนนั้นคือตัวผลิตภัณฑ์
ดังนั้นสองโมเดลนี้จึงไม่ได้แข่งขันกัน ตัว 2B คือตัวที่รันเมื่อไม่มีที่อื่นให้รัน ส่วน 27B คือตัวที่รันเมื่อมีที่ให้รัน
เส้นแบ่งระดับต่างหากคือการตัดสินใจที่แท้จริง
แทบไม่มีใครเลยที่กำลังเลือกระหว่างสองตัวนี้ การติดตั้งใช้งานจริงมีทั้งสองอย่าง: โมเดลเล็กที่ทำงานตลอดเวลาบนอุปกรณ์สำหรับคำขอที่พอดีใน 1,024 โทเคน และมีสิ่งที่ใหญ่กว่าอยู่เบื้องหลังสำหรับทุกอย่างอื่น เมื่อคุณยอมรับรูปแบบนั้นแล้ว คำถามทางวิศวกรรมก็จะไม่ใช่ "จะใช้ Bonsai ตัวไหน" อีกต่อไป แต่กลายเป็น "เส้นแบ่งอยู่ตรงไหน และใครเป็นคนบังคับใช้"
หากบังคับใช้ในโค้ดแอปพลิเคชัน บรรทัดนั้นจะกลายเป็นสาขาเงื่อนไขที่ต้องเขียนใหม่ทุกครั้งที่โมเดลบนอุปกรณ์เปลี่ยนความยาวบริบทหรือขีดความสามารถ ซึ่งจากหลักฐานในช่วงสามเดือนที่ผ่านมา เกิดขึ้นราวเดือนละครั้ง หากบังคับใช้เป็นนโยบายการจัดเส้นทาง มันจะกลายเป็นกฎเพียงข้อเดียวเกี่ยวกับงบประมาณบริบทและขีดความสามารถที่ต้องการ และระดับท้องถิ่นก็ยังคงเป็นเพียงระดับหนึ่ง แทนที่จะกลายเป็นสมมติฐานที่ฝังแน่นอยู่ทั่วทั้งไคลเอนต์ นั่นคือชั้นที่ OrcaRouter ทำงานอยู่: ปลายทางเดียวที่วางอยู่หน้าโมเดลที่โฮสต์ไว้กว่า 200 ตัว พร้อมการสลับสำรองเมื่อเกิดข้อขัดข้อง และนโยบายการยกระดับที่แสดงออกผ่านการตั้งค่า ไม่มี Bonsai ตัวใดถูกจัดเส้นทางที่นี่ ทั้งสองตัวเป็นไฟล์ดาวน์โหลดที่คุณรันบนฮาร์ดแวร์ของคุณเอง ดังนั้นการอธิบายอย่างตรงไปตรงมาคือชั้นการจัดเส้นทางครอบคลุมระดับที่อยู่เหนือระดับท้องถิ่นขึ้นไป และด้วยโมเดลท้องถิ่นขนาด 1,024 โทเคน ระดับนั้นคือที่ที่ปริมาณการรับส่งส่วนใหญ่จะไปลงเอย

ถ้าคุณต้องเลือกสักหนึ่งอย่าง
• คุณกำลังสร้างสำหรับแว่นตา อุปกรณ์สวมใส่ หรืออุปกรณ์ที่เปิดทำงานตลอดเวลาใด ๆ — โมเดลด้านภาพและภาษา Bonsai 2B แบบ 1-bit เป็นตัวเลือกเดียวในที่นี้ และบริบทขนาด 1,024 โทเคนคือข้อจำกัดด้านการออกแบบที่คุณต้องออกแบบให้สอดรับ ไม่ใช่ฝ่าฝืน
• คุณกำลังสร้างสำหรับโทรศัพท์ — 1-bit Bonsai 27B ที่ 3.9 GB เป็นโมเดลที่ใหญ่ที่สุดในตระกูลนี้ที่พอดีกับงบหน่วยความจำระดับ iPhone และมันให้บริบท 262K แก่คุณ ซึ่งโมเดลสำหรับแว่นตาไม่สามารถเข้าใกล้ได้
• คุณกำลังสร้างสำหรับแล็ปท็อปหรือเดสก์ท็อป — บิลด์ ternary Bonsai 27B เป็นตัวเลือกที่เน้นคุณภาพในตระกูลนี้ และบิลด์ 1-bit ให้ความเร็วมามากกว่าความสามารถ
• คุณกำลังสร้างระบบไฮบริด — ตัดสินใจกฎการยกระดับก่อน แล้วค่อยเลือกโมเดล โมเดลนั้นคุณสลับได้ แต่ขอบเขตนั้นคุณสลับไม่ได้ เมื่อมันเข้าไปอยู่ในไคลเอนต์แล้ว
สิ่งที่น่าจับตาคือเส้นทาง NPU ที่ทำให้การเปิดตัวแว่นตานั้นเป็นไปได้จะขยายขึ้นไปสู่ระดับที่สูงขึ้นหรือไม่ หากเคอร์เนล 1-bit บนตัวเร่งความเร็วสำหรับมือถือสามารถทำงานได้โดยทั่วไป สายงาน 1.7B จะขยายใหญ่ขึ้น และเหตุผลสนับสนุนโมเดล 27B บนโทรศัพท์ก็จะแข็งแรงขึ้น จนกว่าจะถึงตอนนั้น สองครึ่งของตระกูลนี้ยังคงแยกจากกันอย่างชัดเจนตามระดับอุปกรณ์ ซึ่งทำให้การเลือกทำได้ง่ายกว่าที่ชื่อร่วมกันบ่งบอก
