
Ternary Bonsai 2 27B vs Qwen3.8-27B IQ2_XXS GGUF: บิตน้อยลง แต่คะแนนดีขึ้น
- Orcaใหม่Orca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 ต่อ 1 ล้านโทเค็น
- orcaใหม่Orca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 ต่อ 1 ล้านโทเค็น
- deepseekใหม่DeepSeek: DeepSeek V4.1 Flash2026-09-1040ความฉลาด
- openaiใหม่OpenAI: GPT-6 Astra2026-09-0453ความฉลาด77การเขียนโค้ด
- googleGoogle: Gemini 3.8 Flash2026-09-0241ความฉลาด76การเขียนโค้ด
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245ความฉลาด76การเขียนโค้ด
- anthropicAnthropic: Claude Fable 5.12026-09-0153ความฉลาด82การเขียนโค้ด
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 ต่อ 1 ล้านโทเค็น
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642ความฉลาด72การเขียนโค้ด
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 ต่อ 1 ล้านโทเค็น
- z-aiZ.ai: GLM 5.32026-08-1845ความฉลาด75การเขียนโค้ด
- obsidianQwen3.8 27B2026-08-1534ความฉลาด68การเขียนโค้ด
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236ความฉลาด69การเขียนโค้ด
- grokSpaceXAI: Grok 4.62026-08-1244ความฉลาด77การเขียนโค้ด
- metaMeta: Muse Spark 1.22026-08-0540ความฉลาด72การเขียนโค้ด
- qwenQwen: Qwen3.8 Max2026-08-0345ความฉลาด76การเขียนโค้ด
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135ความฉลาด69การเขียนโค้ด
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 ต่อ 1 ล้านโทเค็น
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
Ternary Bonsai 2 27B มีขนาดเล็กกว่าบิลด์ IQ2_XXS GGUF ของ Qwen3.8-27B และเมื่อดูจากตัวเลขที่เผยแพร่มาพร้อมกัน ก็ยังดีกว่าด้วย — ซึ่งไม่น่าจะเป็นไปได้หากสิ่งเดียวที่แยกทั้งสองออกจากกันคืองบประมาณบิต บิลด์ Bonsai มี 1.76 บิตต่อน้ำหนักในไฟล์ขนาด 5.93 GB ส่วนการควอนไทซ์แบบ 2 บิตตามปกติของโมเดลฐานเดียวกันมีประมาณ 2.2 บิตต่อน้ำหนักในไฟล์ขนาดราว 7.3 GB Prism ML ซึ่งประกาศบิลด์แบบไตรนารีเมื่อวันที่ 17 กันยายน 2026 รายงานค่าเฉลี่ยจาก 20 เบนช์มาร์กที่ 83.9 สำหรับโมเดลของตน เทียบกับ 75.2 สำหรับจุดเปรียบเทียบ IQ2_XXS — ช่องว่าง 8.7 จุดที่ได้เปรียบโมเดลซึ่งใช้บิตน้อยกว่า
การกลับด้านนั้นคือเรื่องทั้งหมด และมันไม่ใช่กลลวง ไฟล์ทั้งสองถูกสร้างขึ้นโดยกระบวนการที่แตกต่างกันในขั้นตอนต่างๆ ของอายุการใช้งานของโมเดล และความแตกต่างระหว่างกระบวนการเหล่านั้นมีค่ามากกว่าความแตกต่างของความกว้างบิต มันยังเป็นการเปรียบเทียบที่คำแนะนำยอดนิยม — “แค่คว้า 2-bit quant มาเลย เดี๋ยวนี้พวกมันโอเคแล้ว” — ต้องเจอกับตัวอย่างโต้แย้งที่ชัดเจนที่สุด และที่ซึ่งตัวอย่างโต้แย้งนั้นมีงานวัดที่เป็นอิสระรองรับ แทนที่จะเป็นเพียงคำพูดของผู้ขาย
ปฏิทรรศน์คือกลไก
IQ2_XXS เป็นรูปแบบการควอนไทซ์หลังการฝึก โมเดลถูกฝึกจนลู่เข้าด้วยความละเอียดเต็ม จากนั้นน้ำหนักของมันจะถูกปัดให้อยู่ในรูปแบบบิตต่ำที่เลือกโดยกระบวนการฟิตติ้ง โมเดลไม่เคยมีโอกาสปรับตัว มันถูกวัดผลหลังจากนั้นและถูกประมาณค่า ตระกูล i-quant ปรับปรุงเหนือ k-quants รุ่นเก่าโดยใช้เมทริกซ์ความสำคัญ — รอบการคาลิเบรตที่ตัดสินว่าน้ำหนักใดควรได้รับความละเอียดที่มีอยู่มากขึ้น — แต่ลำดับการดำเนินการพื้นฐานยังคงเดิม ฝึกก่อน แล้วจึงบีบอัด
Bonsai กลับลำดับนั้น คำอธิบายวิธีการของ Prism ML เองคือมันละทิ้งการควอนไทเซชันหลังการฝึกไปทั้งหมด และบังคับข้อจำกัดแบบเทอร์นารี ระหว่างการฝึก: การส่งผ่านไปข้างหน้าคำนวณด้วยน้ำหนักที่จำกัดให้อยู่ใน {−1, 0, +1} ขณะที่การส่งผ่านย้อนกลับยังคงมีเกรเดียนต์ความละเอียดเต็ม โมเดลใช้การฝึกของมันในการเรียนรู้รีเพรเซนเทชันที่อยู่รอดภายใต้ข้อจำกัด แทนที่จะให้ข้อจำกัดถูกบังคับกับรีเพรเซนเทชันที่ไม่เคยคาดหวังมัน อัลกอริทึมนี้ถูกอธิบายว่าเป็นทรัพย์สินทางปัญญาแบบเฉพาะเจ้าของ แต่รูปร่างของมันจะคุ้นเคยสำหรับใครก็ตามที่เคยอ่านสายงาน BitNet
มีการปรับละเอียดสองอย่างซ้อนอยู่ด้านบน และทั้งสองปรากฏให้เห็นในการคำนวณ อย่างแรกคือความแม่นยำแบบเลือก: พารามิเตอร์ 26.2 ล้านตัว — ประมาณ 0.098% ของโมเดล ราว 52 MB ที่ bf16 ส่วนใหญ่เป็นเส้นทางสถานะแบบวนซ้ำของเลเยอร์ linear-attention บวกกับน้ำหนักนอร์มัลไลเซชัน — ถูกเก็บไว้ที่ความแม่นยำเต็ม แทนที่จะถูกแปลงเป็น ternary อย่างที่สองคือการหมุนแบบบล็อก เมทริกซ์น้ำหนักแต่ละตัวจะถูกแปลงด้วยการหมุน Walsh–Hadamard ที่ขนาดบล็อก 1,024 ก่อนที่จะเลือกค่า ternary ซึ่งช่วยกระจายค่าผิดปกติไปทั่วพิกัดและทำให้การประมาณค่าแบบสามระดับสร้างความเสียหายน้อยลง การหมุนนี้ถูกพับรวมเข้ากับน้ำหนักที่จัดเก็บไว้ จึงไม่ต้องใช้ไบต์เพิ่มเติม; การแปลงที่เข้าคู่กันจะถูกนำไปใช้กับแอกติเวชันในระหว่างรันไทม์แทน
รายละเอียดสุดท้ายนั้นมีผลตามมาที่คุณจะได้พบตั้งแต่ครั้งแรกที่ลองรันมัน และนั่นแหละคือต้นทุนที่แท้จริงของแนวทางนี้
คุณหมายถึง IQ2_XXS ตัวไหน และจริง ๆ แล้วมันได้คะแนนเท่าไหร่
ก่อนจะเปรียบเทียบคุณภาพ มีข้อแก้ไขที่การรายงานส่วนใหญ่ข้ามไป: "IQ2_XXS" ไม่ใช่เพียงอาร์ติแฟกต์เดียว มันเป็นชนิดการควอนไทซ์ของ llama.cpp และชนิดเดียวกันเมื่อถูกนำไปใช้โดยชุดเครื่องมือที่ต่างกันกับโมเดลฐานเดียวกัน จะสร้างไฟล์ที่ต่างกันอย่างมีนัยสำคัญในด้านขนาด และต่างกันอย่างมากในด้านคุณภาพ
หลักฐานสาธารณะที่ชัดเจนที่สุดคือการเปรียบเทียบอิสระที่โพสต์เมื่อวันที่ 15 สิงหาคม 2026 โดยผู้ใช้ที่กำลังตรวจสอบว่า Qwen3.8-27B แบบต่ำกว่า 2 บิตนั้นคุ้มค่าที่จะสร้างตั้งแต่แรกหรือไม่ การทดสอบเป็นการวัดค่า KL-divergence บน wikitext-2 จำนวน 100 ชังก์ที่บริบท 512 เทียบกับเรฟเฟอเรนซ์ Q8_0 ที่สร้างขึ้นในเครื่องซึ่งมีค่า perplexity 6.7500 โดยทุกแคนดิเดตใช้ importance matrix, คอร์ปัส, baseline และบิลด์ llama.cpp ชุดเดียวกันในคราวเดียว ผลลัพธ์:
• unsloth UD-IQ2_XXS — 8.39 GiB, ค่าเพอร์เพล็กซิตี้ 7.6528, KLD เฉลี่ย 0.146, KLD มัธยฐาน 0.076, ความสอดคล้องอันดับ 1 82.98%
• bartowski IQ2_XXS — 8.75 GiB, ค่า perplexity 8.5352, ค่าเฉลี่ย KLD 0.301, ค่ามัธยฐาน KLD 0.162, ความสอดคล้องอันดับ top-1 76.53%
ตัวแปรแบบไดนามิกเล็กกว่าแบบสแตติก 0.36 GiB และดีกว่าประมาณ 2.1 เท่าในค่าเฉลี่ย KLD — โดยมี perplexity อยู่ที่ 1.13 เท่าของค่าพื้นฐาน ไฟล์สองไฟล์ที่ติดป้ายเดียวกัน แต่ต่างกันถึงสองเท่าในเมตริกที่วัดว่าการกระจายของเอาต์พุตเบี่ยงเบนไปไกลเพียงใด การทดสอบเดียวกันยังพบว่าผู้เข้าเกณฑ์ที่ต่ำกว่า 2 บิตทุกรายแย่กว่าตัวเลือก IQ2 ที่เผยแพร่ทั้งสองแบบ ซึ่งเป็นเหตุผลว่าทำไมพื้นปฏิบัติจริงของโมเดลฐานนี้จึงอยู่ที่ IQ2 ไม่ใช่ต่ำกว่านั้น

เรื่องนี้สำคัญต่อการเปรียบเทียบ เพราะมันเปลี่ยนความหมายว่าสิ่งที่เรียกว่า "บิลด์ IQ2_XXS ขนาด 7.3 GB" นั้นหมายถึงอะไร ตัวเลขของ Prism ML มาจากการควอนไทซ์โมเดลฐานของตัวเองที่ 2.2 บิตต่อน้ำหนัก บิลด์ไดนามิกของ unsloth ในตระกูลเดียวกันวัดได้ 8.39 GiB บิลด์ของ bartowski วัดได้ 8.75 GiB ช่องว่างขนาดระหว่าง Bonsai กับ "IQ2_XXS" จึงอยู่ที่ประมาณ 1.4 เท่าถึง 1.5 เท่า ขึ้นอยู่กับว่าคุณหมายถึงบิลด์ไหน — มากกว่า 1.23 เท่าที่พาดหัวสื่อไว้ และทั้งหมดนี้เกิดขึ้นก่อนที่การเปรียบเทียบคุณภาพจะเริ่มขึ้น
จุดที่บิลด์หลังการฝึกอบรมแตกหัก และเหตุใดจึงเป็นเรื่องง่ายที่จะมองข้าม
ช่องว่างโดยรวม 8.7 จุดเป็นวิธีที่ให้ข้อมูลน้อยที่สุดในการบอกความแตกต่าง เพราะการเสื่อมคุณภาพในบิลด์ IQ2_XXS ไม่ได้เกิดขึ้นสม่ำเสมอ มันเป็นการเสื่อมแบบเลือกเป็นบางส่วน และรูปแบบที่เห็นกลับตรงกันข้ามกับที่คนส่วนใหญ่จะคาดเดา
• MMLU-Redux — บิลด์หลังการฝึกยังทำได้ดีอย่างน่าพอใจ โดยอยู่ในช่วง 80 กลางถึงปลาย
• GPQA Diamond — ประมาณ 65.5 เทียบกับ 85.76 สำหรับบิลด์แบบ ternary
• AIME26 — อยู่ในช่วง 57.5 ถึง 78.6 ขึ้นอยู่กับบิลด์ เมื่อเทียบกับ 95.83 สำหรับบิลด์แบบไตรภาค
• LiveCodeBench — อยู่ในช่วง 56.4 ถึง 70.05 เมื่อเทียบกับ 90.07 สำหรับบิลด์แบบ ternary
ตัวเลข IQ2 ที่แน่นอนเคลื่อนไปมาระหว่างชุดทดสอบของ Prism ML กับการวัดของชุมชน และช่วงที่กล่าวข้างต้นครอบคลุมทั้งสองแหล่ง แต่รูปแบบสอดคล้องกันในทุกแหล่งข้อมูล: ความรู้ผิวเผินยังคงอยู่ และสิ่งใดก็ตามที่ต้องใช้ห่วงโซ่การให้เหตุผลที่ต่อเนื่องจะเสื่อมลงอย่างรวดเร็ว นั่นแหละคือรูปแบบความล้มเหลวที่การทดสอบแบบชิวๆ จะหาไม่พบ เมื่อสั่งให้บิลด์ 2-bit สรุปเอกสารหรือตอบคำถามเชิงข้อเท็จจริง มันก็ทำงานได้เหมือนโมเดลที่ใหญ่กว่ามาก เมื่อสั่งให้มันคงการอนุมานหลายขั้นตอนหรือสร้างโค้ดที่ไม่ธรรมดา การล่มสลายกลับเกิดขึ้นอย่างฉับพลันมากกว่าค่อยเป็นค่อยไป นี่คือเหตุผลว่าทำไม "มันรู้สึกโอเคตอนที่ฉันลองใช้" จึงไม่ใช่หลักฐานเกี่ยวกับโมเดลแบบควอนไทซ์ — มันเป็นหลักฐานเกี่ยวกับพรอมต์ที่คุณบังเอิญได้ลองต่างหาก
บิลด์แบบ ternary ไม่แสดงการล่มนั้นบนเบนช์มาร์กเดียวกัน Prism ML รายงาน AIME26 ที่ 95.83 เทียบกับ 94.58 สำหรับฐานแบบ full-precision ของตน และ LiveCodeBench ที่ 90.07 เทียบกับ 90.05 — ซึ่งแทบจะเท่ากัน และเป็นข้ออ้างที่มีประโยชน์ที่สุดเพียงหนึ่งเดียวในการเปิดตัวครั้งนี้ เพราะมันบอกว่าข้อจำกัดระหว่างการฝึกได้สิ่งที่ข้อจำกัดหลังการฝึกสูญเสียไป
ข้อโต้แย้งซึ่งเป็นเรื่องจริงและซึ่งตารางคุณภาพไม่ได้สะท้อนให้เห็น
ทุกอย่างข้างต้นให้น้ำหนักกับบิลด์ ternary ในแง่คุณภาพต่อไบต์ มีอยู่มิติหนึ่งที่ GGUF แบบดั้งเดิมชนะขาดลอย และนั่นไม่ใช่เรื่องเล็ก: มันทำงานบนซอฟต์แวร์ที่คุณมีอยู่แล้ว
IQ2_XXS บิลด์ของ Qwen3.8-27B เป็นอาร์ติแฟกต์มาตรฐานของ llama.cpp มันโหลดได้ใน llama.cpp, Ollama, LM Studio, Jan และอะไรก็ตามที่ลิงก์กับ ggml บนทุกแพลตฟอร์มที่ ggml รองรับ โดยไม่ต้องมี fork และไม่ต้องใช้เคอร์เนลพิเศษ เมทริกซ์ความสำคัญ (importance matrix) ของมันสามารถสร้างใหม่หรือแทนที่ได้ มันทำงานเหมือนโมเดลควอนไทซ์ตัวอื่น ๆ ทุกตัวที่คุณมีอยู่ในเครื่อง
Ternary Bonsai 2 27B ไม่เป็นเช่นนั้น เคอร์เนล ternary สำหรับกลไกความสนใจแบบไฮบริดของสถาปัตยกรรมนี้อยู่ใน fork ของ llama.cpp ที่ Prism ML พัฒนาเอง llama.cpp เวอร์ชันมาตรฐานปฏิเสธ PTQ1_0 และ PQ2_0 ว่าเป็นชนิดที่ไม่รู้จัก — และไม่รู้เลยว่าจะจัดการกับฐานแบบหมุนที่แพ็กเหล่านั้นสมมติขึ้นได้อย่างไร บิลด์ MLX สำหรับ Apple Silicon มีเคอร์เนล Metal และ CPU แต่ไม่มีเส้นทาง CUDA ดังนั้นบนเครื่อง NVIDIA จึงถอยไปใช้การประมวลผลไปข้างหน้าบน CPU ซึ่งอาจใช้เวลาหลายนาที Prism ML ระบุถึงการผสานรวมกับรันไทม์หลายตัวจริง แต่ประเด็นพื้นฐานยังคงอยู่: ความสามารถในการใช้งานของโมเดลนี้ถูกจำกัดด้วยว่ารันไทม์ที่คุณเลือกได้ถูกสอนให้รู้จักมันแล้วหรือไม่
นั่นคือข้อแลกเปลี่ยนที่ตรงไปตรงมา คุณกำลังเลือกระหว่างบิลด์ที่ใหญ่กว่า 1.4 เท่า แย่ลงอย่างวัดผลได้ในงานที่คุณน่าจะต้องการโมเดล 27B มากที่สุด และรันได้ทั่วไป — กับบิลด์ที่เล็กกว่าและดีกว่า บนระบบนิเวศที่ปัจจุบันมีเพียงฟอร์กของแล็บหนึ่งแห่งบวกรันไทม์ใดก็ตามที่รับมันไปใช้

สิ่งที่ต้องใช้ในการรันอันใดอันหนึ่ง
การคำนวณหน่วยความจำนั้นชิดกันกว่าที่ขนาดไฟล์บ่งบอก เพราะไฟล์ไม่ใช่สิ่งเดียวที่อยู่ใน VRAM
• บิลด์ IQ2_XXS — น้ำหนัก 8.39 ถึง 8.75 GiB เหลือพื้นที่ว่างประมาณ 7.5 GB บนการ์ด 16 GB สำหรับคอนเท็กซ์และโมเดลแบบร่าง การทดสอบอิสระข้างต้นระบุโดยเฉพาะว่าบิลด์ 8.39 GiB สามารถรองรับโมเดลแบบร่างขนาด 2.1 GB ควบคู่ไปด้วยได้แล้ว
• Ternary Bonsai 2 27B — 5.93 GB สำหรับโมเดลภาษา PTQ1_0 บวกกับวิสชันทาวเวอร์ 0.63 GB หากคุณใช้รูปภาพเลย บวกกับบริบท การแพ็ก PQ2_0 ของ Prism ML ใช้พื้นที่ 7.25 GB และเป็นตัวเลือกที่เร็วกว่าบนฮาร์ดแวร์ที่จำกัดด้วยอัตราการประมวลผลคำสั่งมากกว่าแบนด์วิดท์
ในด้านความเร็ว ตัวเลขเทอร์นารีที่{{1}}รายงาน{{/1}}คือ 142.5 tok/s ในการดีโค้ดบน RTX 5090 และ 46.8 tok/s บน Apple M5 Max; การรายงานจากบุคคลที่สามเกี่ยวกับบิลด์ IQ2 นั้นเบาบางกว่า โดยมีการวัดด้วย Vulkan บนการ์ด Radeon สองใบที่ประมาณ 3.8 tok/s ในการเจนเนอเรต แม้ว่าตัวเลขนั้นจะบอกข้อมูลเกี่ยวกับแบ็กเอนด์นั้นโดยเฉพาะมากกว่าจะเกี่ยวกับการควอนไทซ์ ควรถือว่าตัวเลขทรูพุตทั้งสองฝั่งขึ้นอยู่กับฮาร์ดแวร์อย่างมาก
OrcaRouter เหมาะกับตรงไหน และไม่เหมาะกับตรงไหน
ไฟล์ทั้งสองนี้ไม่ใช่สิ่งที่เราเตอร์ให้บริการ พวกมันเป็นอาร์ติแฟกต์ที่อยู่ในเครื่องของคุณเอง และการอธิบายอย่างตรงไปตรงมาก็คือ OrcaRouter ไม่ได้โฮสต์ไฟล์ใดในสองไฟล์นี้เลย — นี่คือการเปรียบเทียบเกี่ยวกับสิ่งที่รันอยู่บนฮาร์ดแวร์ของคุณเอง สิ่งที่อยู่ฝั่งเราจริง ๆ ก็คือโมเดลที่ทั้งสองไฟล์นี้พัฒนามาจาก Qwen3.8-27B ความแม่นยำเต็มรูปแบบนั้นพร้อมให้ใช้งานผ่านโครงสร้างพื้นฐานของ OrcaRouter เอง ในราคา $0.33 ต่อล้านโทเคนอินพุต และ $2.40 ต่อล้านโทเคนเอาต์พุต โดยที่บริบท 262K แบบเนทีฟของโมเดลและตัวควบคุมความพยายามในการให้เหตุผลระดับต่ำ/กลาง/สูงยังคงอยู่ครบถ้วน
นั่นทำให้ได้การตั้งค่าแบบไฮบริดที่ควรอธิบายให้เป็นรูปธรรม รันบิลด์ที่บีบอัดไว้ในเครื่องสำหรับงานที่มันถนัด และส่งคำขอเป็นครั้งคราวที่ต้องการความแม่นยำเต็มรูปแบบไปยังโมเดลฐานที่โฮสต์ผ่านคีย์เดียวกัน — ไม่ต้องมีสัญญาผู้ให้บริการรายที่สอง ไม่ต้องแก้โค้ด เพราะทั้งสองฝั่งพูด API เดียวกัน หากปรากฏว่าบิลด์ในเครื่องไม่เหมาะกับเวิร์กโหลดหนึ่ง คำขอที่ล้มเหลวนั้นสามารถถูกส่งต่อไปโดยอัตโนมัติแทนที่จะส่งกลับเป็นข้อผิดพลาด ซึ่งเป็นวิธีที่ถูกกว่าในการค้นพบว่าการควอนไทซ์ไม่เหมาะสม เมื่อเทียบกับการไปค้นพบในโปรดักชัน
เวอร์ชันสั้น
• ในด้านคุณภาพที่เผยแพร่ต่อไบต์ บิลด์แบบเทอร์นารีชนะอย่างชัดเจน และชัยชนะนั้นกระจุกตัวอยู่ในหมวดการให้เหตุผลและโค้ด ซึ่งเป็นหมวดที่บิลด์หลังการฝึกเสื่อมลงมากที่สุด
• ในด้านความสามารถในการพกพา บิลด์ IQ2_XXS ก็ชนะอย่างชัดเจนไม่แพ้กัน ใช้รันไทม์มาตรฐานได้ทุกที่ ไม่ต้องฟอร์ก ไม่ต้องมีเคอร์เนลพิเศษ ไม่มีโหมดล้มเหลวแบบปล่อยขยะเงียบ ๆ
• การเปรียบเทียบไม่ใช่ "1.76 บิต เทียบกับ 2.2 บิต" แต่เป็น "การแทนค่าที่เลือกไว้ระหว่างการฝึก เทียบกับอีกแบบที่ถูกฟิตภายหลัง" และความแตกต่าง 0.44 บิตก็เป็นเพียงความคลาดเคลื่อนจากการปัดเศษเมื่อเทียบกับเรื่องนั้น
• ตัวเลขคุณภาพทุกตัวสำหรับบิลด์แบบ ternary ในบทความนี้คือการวัดของ Prism ML เองบนชุดทดสอบที่ Prism ML เลือกเอง ผล KLD สำหรับบิลด์ IQ2 นั้นเป็นอิสระ เป็นการรันครั้งเดียว และเฉพาะกับโมเดลฐานหนึ่งตัวและชุดทดสอบหนึ่งชุด; ผลเหล่านี้เป็นหลักฐานจากบุคคลที่สามที่แข็งแกร่งที่สุดในการเปรียบเทียบนี้ และไม่ได้บอกอะไรเกี่ยวกับ Bonsai
ช่องว่างจะปิดลงจากอีกทิศทางหนึ่งเช่นกัน และน่าจะเร็ว ๆ นี้ หากเคอร์เนลเทอร์นารีถูกนำเข้า upstream ใน llama.cpp ข้อโต้แย้งจริงจังเพียงข้อเดียวต่อ Bonsai ก็จะหายไป และการเลือกก็จะกลายเป็นเรื่องตรงไปตรงมา จนถึงตอนนั้น บิลด์ IQ2_XXS ยังคงมีข้อได้เปรียบที่แท้จริง ซึ่งไม่เกี่ยวอะไรกับว่ามันดีแค่ไหนเลย

ถ้าคุณกำลังตัดสินใจในสัปดาห์นี้ การทดสอบที่ตัดสินเรื่องนี้ได้ใช้เวลาแค่ช่วงบ่ายเดียว: หยิบพรอมป์ต์ยี่สิบรายการจากงานของคุณเองที่ต้องใช้การให้เหตุผลมากกว่าหนึ่งขั้น รันทั้งสองบิลด์ แล้วให้คะแนนคำตอบแบบไม่รู้ที่มา ตารางที่เผยแพร่จะบอกว่าควรมองตรงไหน แต่บอกไม่ได้ว่างานของคุณอยู่ในจุดนั้นหรือไม่
