
Ternary Bonsai 2 27B กับ Qwen3.8-27B: 47.9 กิกะไบต์ของความแม่นยำให้อะไรได้จริง
- Orcaใหม่Orca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 ต่อ 1 ล้านโทเค็น
- orcaใหม่Orca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 ต่อ 1 ล้านโทเค็น
- deepseekใหม่DeepSeek: DeepSeek V4.1 Flash2026-09-1040ความฉลาด
- openaiใหม่OpenAI: GPT-6 Astra2026-09-0453ความฉลาด77การเขียนโค้ด
- googleGoogle: Gemini 3.8 Flash2026-09-0241ความฉลาด76การเขียนโค้ด
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245ความฉลาด76การเขียนโค้ด
- anthropicAnthropic: Claude Fable 5.12026-09-0153ความฉลาด82การเขียนโค้ด
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 ต่อ 1 ล้านโทเค็น
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642ความฉลาด72การเขียนโค้ด
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 ต่อ 1 ล้านโทเค็น
- z-aiZ.ai: GLM 5.32026-08-1845ความฉลาด75การเขียนโค้ด
- obsidianQwen3.8 27B2026-08-1534ความฉลาด68การเขียนโค้ด
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236ความฉลาด69การเขียนโค้ด
- grokSpaceXAI: Grok 4.62026-08-1244ความฉลาด77การเขียนโค้ด
- metaMeta: Muse Spark 1.22026-08-0540ความฉลาด72การเขียนโค้ด
- qwenQwen: Qwen3.8 Max2026-08-0345ความฉลาด76การเขียนโค้ด
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135ความฉลาด69การเขียนโค้ด
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 ต่อ 1 ล้านโทเค็น
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
Ternary Bonsai 2 27B และ Qwen3.8-27B คือโมเดลเดียวกันในสองโลกเชิงตัวเลข ทั้งสองใช้สถาปัตยกรรมเดียวกัน โทเคไนเซอร์เดียวกัน สายการฝึกเดียวกัน และหน้าต่างบริบทขนาด 262,144 โทเคน สิ่งที่ทำให้ทั้งสองต่างกันคือวิธีเขียนน้ำหนักลงไป: Qwen3.8-27B เก็บน้ำหนักแต่ละค่าเป็นเลขทศนิยม 16 บิต และกินพื้นที่ 53.81 GB ในรูปแบบอ้างอิง FP16 ขณะที่ Ternary Bonsai 2 27B เก็บน้ำหนักแต่ละค่าเป็นหนึ่งในสามสัญลักษณ์ และกินพื้นที่ 5.93 GB Prism ML ประกาศเวอร์ชันบีบอัดนี้เมื่อวันที่ 17 กันยายน 2026 และเผยแพร่บน Hugging Face ภายใต้สัญญาอนุญาต Apache 2.0 ส่วนน้ำหนักต้นฉบับของ Qwen3.8-27B ถูกเผยแพร่เมื่อวันที่ 13 สิงหาคม 2026 ภายใต้สัญญาอนุญาต Apache 2.0 เช่นกัน
การเปรียบเทียบที่สำคัญไม่ใช่ว่าอันไหนดีกว่า แต่เป็นว่าสิ่งที่ 47.9 GB ที่หายไปนั้นทำให้คุณต้องเสียอะไรไป และคำตอบที่ตรงไปตรงมาจะแคบและเฉพาะเจาะจงยิ่งกว่าที่ฝ่ายใดฝ่ายหนึ่งจะบอกคุณ Prism ML รายงานว่าเวอร์ชันของบริษัทเก็บค่าเฉลี่ยของโมเดลความแม่นยำเต็มรูปแบบไว้ได้ 98.2%จากชุดทดสอบ 20 รายการ — 83.9 เทียบกับ 85.4 ตัวเลขนั้นเป็นของเจ้าของผลิตภัณฑ์เอง วัดบนฮาร์เนสของเจ้าของผลิตภัณฑ์เอง และหนึ่งวันหลังการเปิดตัว ยังไม่มีใครนอก Prism ML ที่ทำซ้ำตัวเลขนี้ได้ ค่าภาพรวมยังซ่อนส่วนที่คุณควรใส่ใจจริง ๆ ไว้ เพราะ 1.8 คะแนนนั้นไม่ได้กระจายอย่างเท่าเทียมกัน ในสองเบนช์มาร์กที่ทดสอบวิศวกรรมซอฟต์แวร์อย่างต่อเนื่อง ช่องว่างไม่ใช่ 1.8% — แต่ใกล้เคียง 25% มากกว่า
เครือข่ายเดียวกัน ที่เขียนไว้ต่างออกไป
เริ่มจากสิ่งที่การบีบอัดไม่ได้แตะต้อง เพราะนั่นคือเหตุผลที่ทำให้การเปรียบเทียบนี้มีความน่าสนใจตั้งแต่แรก จำนวนเลเยอร์ ขนาด hidden คำศัพท์ รูปแบบ attention และ vision tower เป็นของโมเดลฐาน Qwen3.8-27B เป็นการออกแบบแบบ hybrid-attention: เลเยอร์ linear-attention แบบ Gated DeltaNet จำนวน 48 เลเยอร์ สลับกับเลเยอร์ full-attention จำนวน 16 เลเยอร์ คิดเป็นสัดส่วนประมาณ 3:1 จากทั้งหมด 64 เลเยอร์ โดยมีขนาด hidden 5,120 และคำศัพท์ขนาด 248,320 โทเคน โครงสร้างหลักที่เป็นเชิงเส้นเป็นส่วนใหญ่นั้นคือสิ่งที่ทำให้บริบท 262K จ่ายไหวตั้งแต่แรก และเป็นคุณสมบัติที่ Bonsai สืบทอดมาโดยไม่เปลี่ยนแปลง
สิ่งที่ Prism ML เปลี่ยนแปลงคือการแทนค่าของเมทริกซ์ในโมเดลภาษา รวมถึงเคอร์เนลที่จำเป็นสำหรับการคำนวณบนเมทริกซ์เหล่านั้น ไวท์เปเปอร์ของ Prism ML แบ่งพารามิเตอร์ 27.36B ออกเป็น 24.35B ในแกนหลักภาษา (language backbone) กระจายอยู่ใน 64 บล็อก, 2.54B ใน embedding และ LM head, และ 0.47B ใน vision tower 27 บล็อก vision tower ถูกจัดส่งเป็นไฟล์ mmproj แบบ 4-bit แยกต่างหากขนาดประมาณ 0.63 GB และจะโหลดเฉพาะเมื่อมีรูปภาพเข้ามาจริง ๆ ดังนั้นการติดตั้งใช้งานแบบข้อความล้วนจึงไม่ต้องรับภาระนี้เลย
ผลที่ตามมาในทางปฏิบัติของการออกแบบที่เกือบเป็นเชิงเส้นนั้นควรค่าแก่การชี้ให้เห็นก่อนการอภิปรายเรื่องเบนช์มาร์กใด ๆ เนื่องจากสถาปัตยกรรมนี้ไม่ใช่ทรานส์ฟอร์เมอร์แบบดั้งเดิม เคอร์เนลบิตต่ำจึงต้องถูกเขียนขึ้นสำหรับมันโดยเฉพาะ llama.cpp มาตรฐานปฏิเสธการแพ็กทั้งสองแบบของ Prism ML ว่าเป็นชนิดข้อมูลที่ไม่รู้จัก — และที่อันตรายยิ่งกว่าคือ มันโหลดรูปแบบ ternary ที่เก่ากว่าได้โดยไม่บ่น และสร้างข้อความที่ลื่นไหลแต่ไร้สาระ เพราะไม่มีการหมุนที่เข้ากันถูกนำไปใช้กับแอกติเวชัน หากคุณรันโมเดลนี้บนไบนารีที่ไม่รู้จักมัน คุณจะไม่ได้รับข้อผิดพลาด คุณจะได้ผลลัพธ์ที่มั่นใจแต่ผิด
การเปรียบเทียบ แยกตามหมวดหมู่
ต่อไปนี้คือรายละเอียดผลการทดสอบ 20 รายการของผู้จำหน่าย โดยใช้ฐานความแม่นยำเต็มรูปแบบเป็นข้อมูลอ้างอิง ตัวเลขทุกตัวในรายการนี้เป็นของ Prism ML; ไม่มีตัวใดได้รับการตรวจสอบอย่างอิสระ
• คณิตศาสตร์ — 96.57 สำหรับ Ternary Bonsai 2 27B เทียบกับ 97.06 สำหรับ Qwen3.8-27B ถือว่าอยู่ในระดับเดียวกันโดยแทบไม่ต่าง
• การเขียนโค้ด — 81.58 กับ 82.17 ใกล้กันเช่นกัน และเป็นหมวดหมู่ที่เทคนิคทั้งหมดกำลังถูกโต้แย้งกันอยู่
• การทำตามคำสั่ง — 82.66 เทียบกับ 81.25 โมเดลที่ถูกบีบอัดนำหน้าตรงนี้ ซึ่งเป็นบรรทัดเดียวในตารางที่เป็นเรื่องน่าประหลาดใจจริง ๆ
• ความรู้และการให้เหตุผล — 83.95 เทียบกับ 86.66 การลดลง 2.7 คะแนน และเป็นปัจจัยเดียวที่มีส่วนมากที่สุดต่อ 1.8 คะแนนที่หายไป
• การทำงานแบบเอเจนต์และการเรียกใช้เครื่องมือ — 77.57 เทียบกับ 79.74 ครอบคลุม τ2-Bench ที่ 80.22 และ BFCL v3 ที่ 74.92
• Vision — 78.59 vs 81.64 ซึ่งเป็นการลดลงในหมวดหมู่ที่มากที่สุด โปรดทราบว่า vision tower เองไม่ใช่ส่วนที่ถูกบีบอัด ส่วนที่เป็นคือโมเดลภาษาที่อ่านเอาต์พุตของมัน

อ่านรูปทรงแทนค่าเฉลี่ย แล้วเรื่องราวที่ชัดเจนขึ้นก็จะปรากฏ การบีบอัดแทบไม่มีต้นทุนกับคณิตศาสตร์ การเขียนโค้ด และการทำตามคำสั่ง แต่มีต้นทุนสูงกับความรู้และการมองเห็น นั่นตรงข้ามกับความเชื่อพื้นๆ เกี่ยวกับโมเดลบิตต่ำ ซึ่งถือว่าความรู้ผิวเผินยังคงอยู่ แต่การใช้เหตุผลกลับพังทลาย ในกรณีนี้กลับเป็นความรู้ที่ค่อยๆ กร่อนหายไป และการใช้เหตุผลที่ยังคงอยู่
1.8 คะแนนอยู่ตรงไหนกันแน่
ค่าที่รวมกันคือค่าเฉลี่ยจากเบนช์มาร์กยี่สิบรายการ และค่าเฉลี่ยคือที่ที่ความต่างซ่อนตัวอยู่ ดึงผลลัพธ์รายรายการออกมาดู แล้วจะพบว่าสองรายการแย่กว่าที่ค่าเฉลี่ยบ่งชี้ไว้มาก
• Terminal-Bench 2.1 — 52.8 สำหรับบิลด์แบบ ternary เทียบกับ 69.7 สำหรับความแม่นยำเต็มรูปแบบ
• SWE-bench Verified — 60.8 เทียบกับ 80.6
ทั้งสองทำได้ใกล้เคียงสามในสี่ของคะแนนแบบ full-precision เมื่อเทียบกับตัวเลขนั้น AIME26 อยู่ที่ 95.83, LiveCodeBench ที่ 90.07 และ AA-LCR ที่ 77.0 — ห่างจากโมเดลที่ไม่ถูกบีบอัดไม่เกินหนึ่งคะแนน นี่เป็นครั้งแรกที่ตระกูล Bonsai ได้รับการประเมินบน Terminal-Bench เลย และ Prism ML ระบุชัดเจนในเอกสารของตัวเองว่า ความสามารถด้านวิศวกรรมซอฟต์แวร์ระยะยาว (long-horizon) ที่ตนสัญญาไว้ในรุ่นแรกนั้นถูกส่งมอบเพียงบางส่วน ไม่ใช่ทั้งหมด
ดังนั้น คำถามในทางปฏิบัติจึงไม่ใช่ "มันรักษาความแม่นยำไว้ที่ 98.2% หรือไม่" แต่เป็น "ภาระงานของฉันคืออะไร" หากคุณกำลังรัน coding agent ที่ถือแผนไว้ตลอดการเรียกใช้เครื่องมือหลายสิบครั้งและแก้ไขไฟล์เป็นเวลาหลายนาที คุณอยู่ในหมวดที่มีช่องว่าง 25% และตัวเลขรวมนั้นทำให้เข้าใจผิดอย่างมาก หากคุณกำลังทำคณิตศาสตร์ การสร้างโค้ดแบบเทิร์นเดียว การสกัดข้อมูล การจำแนกประเภท หรือแชต คุณอยู่ในหมวดที่ช่องว่างนั้นหายไปเมื่อปัดเศษ สิ่งที่มีประโยชน์ที่สุดเกี่ยวกับตารางของผู้ขายเองก็คือมันช่วยให้คุณแยกแยะความแตกต่างนั้นได้ แทนที่จะต้องเดา
สิ่งที่แต่ละอันต้องการจริง ๆ เพื่อให้ทำงานได้
เรื่องฮาร์ดแวร์มีความสมมาตรน้อยกว่าที่อัตราส่วนขนาดบ่งชี้ โมเดล FP16 ขนาด 53.81 GB ไม่สามารถใส่ลงในแล็ปท็อป 16 GB ได้เลย ซึ่งทำให้การเปรียบเทียบไม่ได้เป็นเรื่อง "เร็วกว่ากับช้ากว่า" มากนัก แต่เป็น "เป็นไปได้กับเป็นไปไม่ได้" มากกว่า การวัดที่ได้มาตรฐานของ Prism ML ที่ขนาดแบตช์ 1 โดยไม่รวม vision tower:
• NVIDIA RTX 5090 — ถอดรหัส 142.5 tok/s บนการแพ็ก PQ2_0 ที่ 0.582 mWh ต่อโทเคน
• Apple M5 Max — ถอดรหัส 46.8 tok/s โดยประมวลผลพรอมต์ที่ประมาณ 765 tok/s
• Apple M5 Pro — {{1}}27.7{{/1}} tok/s {{2}}ถอดรหัส{{/2}}
• Apple M4 Pro — การถอดรหัส 18.0 tok/s โดยการประมวลผลพรอมต์ที่ใกล้ 125 tok/s กลายเป็นข้อจำกัดที่ผูกมัดสำหรับบริบทที่ยาวมาก
ข้อแม้สำคัญคือ ทั้งหมดนี้ไม่มีสิ่งใดที่เป็นไบนารีเพียงตัวเดียว การแพ็ก PTQ1_0 ให้คุณได้ 5.93 GB ที่ 1.76 บิตต่อน้ำหนัก; PQ2_0 ใช้ 7.25 GB ที่ 2.16 บิตต่อน้ำหนัก และแลกมาได้ซึ่งความเร็วในการถอดรหัสบนฮาร์ดแวร์ที่ขีดจำกัดคืออัตราการประมวลผลคำสั่ง ไม่ใช่แบนด์วิดท์หน่วยความจำ บิลด์ MLX สำหรับ Apple Silicon เป็นอาร์ติแฟกต์ที่สามที่มีการคิดบัญชีของตัวเอง — คอนเทนเนอร์ 2 บิตแบบ affine ที่เก็บไบแอสซึ่งน้ำหนักแบบ ternary ไม่จำเป็นต้องใช้ อยู่ที่ 2.25 บิตต่อน้ำหนัก และ 8.005 GiB บนดิสก์ พร้อมเคอร์เนล Metal และ CPU แต่ไม่มีเส้นทาง CUDA “มันรันใน 5.9 GB” เป็นจริงกับไฟล์เหล่านั้นเพียงไฟล์เดียวเท่านั้น บนรันไทม์ที่ถูกต้องเท่านั้น
การเปรียบเทียบต้นทุนที่นำเสนออย่างตรงไปตรงมา
มีสองวิธีในการจ่ายเงินสำหรับ Qwen3.8-27B และมีเพียงวิธีเดียวในการจ่ายเงินสำหรับรุ่นพี่น้องที่ถูกบีบอัดของมัน Ternary Bonsai 2 27B เป็นการดาวน์โหลด: Apache 2.0 ฮาร์ดแวร์ของคุณเอง ไม่มีมิเตอร์วัดการใช้งาน Qwen3.8-27B เป็นทั้งการดาวน์โหลดและบริการโฮสต์ และหากคุณเลือกเส้นทางโฮสต์ ตัวเลขที่เกี่ยวข้องคือตัวเลขบนหน้าของโมเดล — $0.33 ต่อโทเค็นอินพุตหนึ่งล้านโทเค็น และ $2.40 ต่อโทเค็นเอาต์พุตหนึ่งล้านโทเค็น ให้บริการจากโครงสร้างพื้นฐานของ OrcaRouter เอง แทนที่จะขายต่อจากของคนอื่น
นั่นคือจุดที่ OrcaRouter ได้ที่ยืนในการเปรียบเทียบนี้ ไม่ใช่แค่เป็นเชิงอรรถ เวอร์ชันที่ให้บริการผ่านการจัดเส้นทางของ Qwen3.8-27B รองรับบริบท 262K เท่ากัน รับข้อความ รูปภาพ และวิดีโอ และเปิดให้ใช้การควบคุมระดับความพยายามในการให้เหตุผลที่มาพร้อมกับโมเดล มันอยู่เบื้องหลังคีย์เดียวกับโมเดลอื่นอีกกว่า 200 โมเดล โดยไม่มีการบวกเพิ่มจากราคาตามรายการของผู้ให้บริการ ซึ่งสำคัญกว่าที่ฟังดู เพราะราคาตามรายการถูกส่งผ่านโดยตรงแทนที่จะถูกขายต่อ การเปลี่ยนแปลงราคาของผู้ให้บริการจึงปรากฏที่นี่ในวันเดียวกัน แทนที่จะเป็นตอนต่อสัญญาครั้งถัดไป สำหรับทีมที่ต้องการใช้ฐานความแม่นยำเต็มรูปแบบเป็นระดับยกระดับเหนือ Bonsai ภายในเครื่อง นั่นคือปลายทางเดียวและคีย์เดียว แทนที่จะเป็นความสัมพันธ์กับผู้ให้บริการสองราย

ควรเลือกอันไหนดี
การตัดสินใจส่วนใหญ่อยู่ที่ว่างานเกิดขึ้นที่ไหน ไม่ใช่ว่าโมเดลไหนดีกว่า เพราะในงานส่วนใหญ่แล้วพวกมันเป็นโมเดลเดียวกัน
• เลือก Qwen3.8-27B แบบความละเอียดเต็ม (full precision) เมื่องานเป็นแบบระยะยาวและต้องทำงานแบบเอเจนต์ เมื่อคุณกำลังประเมินหรือปรับแต่งโมเดล เมื่อคุณต้องการบริบท YaRN ขนาด 1M โทเคน หรือเมื่อความแม่นยำด้านการมองเห็นเป็นปัจจัยสำคัญที่แบกรับผลลัพธ์เอาไว้ ตัวเลขของ Terminal-Bench และ SWE-bench คือเหตุผลนั้น
• เลือก Ternary Bonsai 2 27B เมื่องานต้องทำบนฮาร์ดแวร์ที่คุณเป็นเจ้าของ เมื่อทางเลือกอื่นคือการไม่รันโมเดล 27B เลย หรือเมื่องานนั้นเป็นคณิตศาสตร์ การเขียนโค้ด การสกัดข้อมูล หรือการให้เหตุผลโดยไม่ใช้เครื่องมือ ซึ่งหมวดหมู่เหล่านี้อยู่ในระดับเดียวกัน
• อย่าเลือกจากค่าสรุปรวม 83.9 กับ 85.4 ใกล้กันพอที่การสลับเกณฑ์วัดเพียงรายการเดียวอาจทำให้ลำดับเปลี่ยนไปได้ และมีเพียงหนึ่งในสองตัวเลขเท่านั้นที่ได้รับการตรวจสอบยืนยันอย่างเป็นอิสระ
สิ่งที่ใหม่จริง ๆ ที่นี่ไม่ใช่การที่โมเดล 27B พอดีอยู่ในหกกิกะไบต์ — Bonsai รุ่นแรกทำได้แบบนั้นในเดือนกรกฎาคม สิ่งที่ใหม่คือการทำตามคำสั่งออกมาดีกว่ารุ่นต้นแบบ และคณิตศาสตร์กับการเขียนโค้ดอยู่ในระดับเดียวกัน ซึ่งเป็นข้ออ้างที่แตกต่างจาก "เล็กเมื่อเทียบกับขนาดของมัน" ว่ามันจะได้ผลกับภาระงานของคุณหรือไม่นั่นคือสิ่งที่อายุหนึ่งวันบอกคุณไม่ได้ และการประเมินอิสระครั้งแรกของโมเดลนี้คือผลลัพธ์ที่ควรค่าแก่การรอ

หากคุณต้องการรันการเปรียบเทียบบนพรอมป์ของคุณเอง แทนที่จะรันบนชุดเบนช์มาร์ก เส้นทางที่เร็วที่สุดคือเรียก Qwen3.8-27B ที่โฮสต์ไว้ผ่านเอนด์พอยต์เดียว แล้วรันบิลด์ ternary ในเครื่อง จากนั้นดิฟเอาต์พุตบนงานที่คุณมีจริง ๆ นั่นเป็นงานแค่เช้าเดียว และมันจะบอกคุณเกี่ยวกับ 1.8 คะแนนได้มากกว่าตารางที่ตีพิมพ์ใด ๆ
