การ์ดชื่อเรื่องที่สร้างขึ้นซึ่งมีข้อความว่า 'Ternary Bonsai 2 27B vs Qwen3.8-27B IQ2_XXS GGUF' พร้อมคำบรรยายย่อย 'บิตน้อยลง คะแนนดีขึ้น' เหนือการ์ดสามใบที่มีข้อความว่า 'บิตต่อน้ำหนัก: 1.76 vs 2.2', 'ขนาด: 5.93 GB vs 7.3 GB' และ 'ค่าเฉลี่ยชุดทดสอบของผู้ขาย: 83.9 vs 75.2' โดยมีส่วนท้ายที่อ่านว่า 'ตัวเลขของ Bonsai เป็นข้อมูลที่ผู้ขายรายงาน; ตัวเลขของ IQ2_XXS อ้างอิงจากการทดสอบของผู้ขายและชุมชน' โลโก้ OrcaRouter อยู่ที่มุมขวาล่าง
Engineering & Research

Ternary Bonsai 2 27B vs Qwen3.8-27B IQ2_XXS GGUF: บิตน้อยลง แต่คะแนนดีขึ้น

ผู้เขียน

Rowan Sterling

วันที่เผยแพร่

โมเดลล่าสุด · 20ดูโมเดลทั้งหมด
เบนช์มาร์ก: Artificial Analysis · อัปเดตทุกวัน
กลับไปยังโพสต์ทั้งหมด

Ternary Bonsai 2 27B มีขนาดเล็กกว่าบิลด์ IQ2_XXS GGUF ของ Qwen3.8-27B และเมื่อดูจากตัวเลขที่เผยแพร่มาพร้อมกัน ก็ยังดีกว่าด้วย — ซึ่งไม่น่าจะเป็นไปได้หากสิ่งเดียวที่แยกทั้งสองออกจากกันคืองบประมาณบิต บิลด์ Bonsai มี 1.76 บิตต่อน้ำหนักในไฟล์ขนาด 5.93 GB ส่วนการควอนไทซ์แบบ 2 บิตตามปกติของโมเดลฐานเดียวกันมีประมาณ 2.2 บิตต่อน้ำหนักในไฟล์ขนาดราว 7.3 GB Prism ML ซึ่งประกาศบิลด์แบบไตรนารีเมื่อวันที่ 17 กันยายน 2026 รายงานค่าเฉลี่ยจาก 20 เบนช์มาร์กที่ 83.9 สำหรับโมเดลของตน เทียบกับ 75.2 สำหรับจุดเปรียบเทียบ IQ2_XXS — ช่องว่าง 8.7 จุดที่ได้เปรียบโมเดลซึ่งใช้บิตน้อยกว่า

การกลับด้านนั้นคือเรื่องทั้งหมด และมันไม่ใช่กลลวง ไฟล์ทั้งสองถูกสร้างขึ้นโดยกระบวนการที่แตกต่างกันในขั้นตอนต่างๆ ของอายุการใช้งานของโมเดล และความแตกต่างระหว่างกระบวนการเหล่านั้นมีค่ามากกว่าความแตกต่างของความกว้างบิต มันยังเป็นการเปรียบเทียบที่คำแนะนำยอดนิยม — “แค่คว้า 2-bit quant มาเลย เดี๋ยวนี้พวกมันโอเคแล้ว” — ต้องเจอกับตัวอย่างโต้แย้งที่ชัดเจนที่สุด และที่ซึ่งตัวอย่างโต้แย้งนั้นมีงานวัดที่เป็นอิสระรองรับ แทนที่จะเป็นเพียงคำพูดของผู้ขาย

ปฏิทรรศน์คือกลไก

IQ2_XXS เป็นรูปแบบการควอนไทซ์หลังการฝึก โมเดลถูกฝึกจนลู่เข้าด้วยความละเอียดเต็ม จากนั้นน้ำหนักของมันจะถูกปัดให้อยู่ในรูปแบบบิตต่ำที่เลือกโดยกระบวนการฟิตติ้ง โมเดลไม่เคยมีโอกาสปรับตัว มันถูกวัดผลหลังจากนั้นและถูกประมาณค่า ตระกูล i-quant ปรับปรุงเหนือ k-quants รุ่นเก่าโดยใช้เมทริกซ์ความสำคัญ — รอบการคาลิเบรตที่ตัดสินว่าน้ำหนักใดควรได้รับความละเอียดที่มีอยู่มากขึ้น — แต่ลำดับการดำเนินการพื้นฐานยังคงเดิม ฝึกก่อน แล้วจึงบีบอัด

Bonsai กลับลำดับนั้น คำอธิบายวิธีการของ Prism ML เองคือมันละทิ้งการควอนไทเซชันหลังการฝึกไปทั้งหมด และบังคับข้อจำกัดแบบเทอร์นารี ระหว่างการฝึก: การส่งผ่านไปข้างหน้าคำนวณด้วยน้ำหนักที่จำกัดให้อยู่ใน {−1, 0, +1} ขณะที่การส่งผ่านย้อนกลับยังคงมีเกรเดียนต์ความละเอียดเต็ม โมเดลใช้การฝึกของมันในการเรียนรู้รีเพรเซนเทชันที่อยู่รอดภายใต้ข้อจำกัด แทนที่จะให้ข้อจำกัดถูกบังคับกับรีเพรเซนเทชันที่ไม่เคยคาดหวังมัน อัลกอริทึมนี้ถูกอธิบายว่าเป็นทรัพย์สินทางปัญญาแบบเฉพาะเจ้าของ แต่รูปร่างของมันจะคุ้นเคยสำหรับใครก็ตามที่เคยอ่านสายงาน BitNet

มีการปรับละเอียดสองอย่างซ้อนอยู่ด้านบน และทั้งสองปรากฏให้เห็นในการคำนวณ อย่างแรกคือความแม่นยำแบบเลือก: พารามิเตอร์ 26.2 ล้านตัว — ประมาณ 0.098% ของโมเดล ราว 52 MB ที่ bf16 ส่วนใหญ่เป็นเส้นทางสถานะแบบวนซ้ำของเลเยอร์ linear-attention บวกกับน้ำหนักนอร์มัลไลเซชัน — ถูกเก็บไว้ที่ความแม่นยำเต็ม แทนที่จะถูกแปลงเป็น ternary อย่างที่สองคือการหมุนแบบบล็อก เมทริกซ์น้ำหนักแต่ละตัวจะถูกแปลงด้วยการหมุน Walsh–Hadamard ที่ขนาดบล็อก 1,024 ก่อนที่จะเลือกค่า ternary ซึ่งช่วยกระจายค่าผิดปกติไปทั่วพิกัดและทำให้การประมาณค่าแบบสามระดับสร้างความเสียหายน้อยลง การหมุนนี้ถูกพับรวมเข้ากับน้ำหนักที่จัดเก็บไว้ จึงไม่ต้องใช้ไบต์เพิ่มเติม; การแปลงที่เข้าคู่กันจะถูกนำไปใช้กับแอกติเวชันในระหว่างรันไทม์แทน

รายละเอียดสุดท้ายนั้นมีผลตามมาที่คุณจะได้พบตั้งแต่ครั้งแรกที่ลองรันมัน และนั่นแหละคือต้นทุนที่แท้จริงของแนวทางนี้

คุณหมายถึง IQ2_XXS ตัวไหน และจริง ๆ แล้วมันได้คะแนนเท่าไหร่

ก่อนจะเปรียบเทียบคุณภาพ มีข้อแก้ไขที่การรายงานส่วนใหญ่ข้ามไป: "IQ2_XXS" ไม่ใช่เพียงอาร์ติแฟกต์เดียว มันเป็นชนิดการควอนไทซ์ของ llama.cpp และชนิดเดียวกันเมื่อถูกนำไปใช้โดยชุดเครื่องมือที่ต่างกันกับโมเดลฐานเดียวกัน จะสร้างไฟล์ที่ต่างกันอย่างมีนัยสำคัญในด้านขนาด และต่างกันอย่างมากในด้านคุณภาพ

หลักฐานสาธารณะที่ชัดเจนที่สุดคือการเปรียบเทียบอิสระที่โพสต์เมื่อวันที่ 15 สิงหาคม 2026 โดยผู้ใช้ที่กำลังตรวจสอบว่า Qwen3.8-27B แบบต่ำกว่า 2 บิตนั้นคุ้มค่าที่จะสร้างตั้งแต่แรกหรือไม่ การทดสอบเป็นการวัดค่า KL-divergence บน wikitext-2 จำนวน 100 ชังก์ที่บริบท 512 เทียบกับเรฟเฟอเรนซ์ Q8_0 ที่สร้างขึ้นในเครื่องซึ่งมีค่า perplexity 6.7500 โดยทุกแคนดิเดตใช้ importance matrix, คอร์ปัส, baseline และบิลด์ llama.cpp ชุดเดียวกันในคราวเดียว ผลลัพธ์:

• unsloth UD-IQ2_XXS — 8.39 GiB, ค่าเพอร์เพล็กซิตี้ 7.6528, KLD เฉลี่ย 0.146, KLD มัธยฐาน 0.076, ความสอดคล้องอันดับ 1 82.98%

• bartowski IQ2_XXS — 8.75 GiB, ค่า perplexity 8.5352, ค่าเฉลี่ย KLD 0.301, ค่ามัธยฐาน KLD 0.162, ความสอดคล้องอันดับ top-1 76.53%

ตัวแปรแบบไดนามิกเล็กกว่าแบบสแตติก 0.36 GiB และดีกว่าประมาณ 2.1 เท่าในค่าเฉลี่ย KLD — โดยมี perplexity อยู่ที่ 1.13 เท่าของค่าพื้นฐาน ไฟล์สองไฟล์ที่ติดป้ายเดียวกัน แต่ต่างกันถึงสองเท่าในเมตริกที่วัดว่าการกระจายของเอาต์พุตเบี่ยงเบนไปไกลเพียงใด การทดสอบเดียวกันยังพบว่าผู้เข้าเกณฑ์ที่ต่ำกว่า 2 บิตทุกรายแย่กว่าตัวเลือก IQ2 ที่เผยแพร่ทั้งสองแบบ ซึ่งเป็นเหตุผลว่าทำไมพื้นปฏิบัติจริงของโมเดลฐานนี้จึงอยู่ที่ IQ2 ไม่ใช่ต่ำกว่านั้น

A screenshot of a Hugging Face community discussion titled 'Independent KLD benchmark: UD-IQ2_XXS beats bartowski IQ2_XXS on both size and quality', opened 15 August 2026, describing a wikitext-2 test of 100 chunks at 512 context against a locally built Q8_0 reference with perplexity 6.7500. Its table lists unsloth UD-IQ2_XXS at 8.39 GiB with perplexity 7.6528, mean KLD 0.146, median KLD 0.076 and 82.98% top-1 agreement; bartowski IQ2_XXS at 8.75 GiB with perplexity 8.5352, mean KLD 0.301, median 0.162 and 76.53%; stock IQ1_M at 7.33 GiB with mean KLD 0.659; and stock IQ1_S at 6.88 GiB with mean KLD 0.896.

เรื่องนี้สำคัญต่อการเปรียบเทียบ เพราะมันเปลี่ยนความหมายว่าสิ่งที่เรียกว่า "บิลด์ IQ2_XXS ขนาด 7.3 GB" นั้นหมายถึงอะไร ตัวเลขของ Prism ML มาจากการควอนไทซ์โมเดลฐานของตัวเองที่ 2.2 บิตต่อน้ำหนัก บิลด์ไดนามิกของ unsloth ในตระกูลเดียวกันวัดได้ 8.39 GiB บิลด์ของ bartowski วัดได้ 8.75 GiB ช่องว่างขนาดระหว่าง Bonsai กับ "IQ2_XXS" จึงอยู่ที่ประมาณ 1.4 เท่าถึง 1.5 เท่า ขึ้นอยู่กับว่าคุณหมายถึงบิลด์ไหน — มากกว่า 1.23 เท่าที่พาดหัวสื่อไว้ และทั้งหมดนี้เกิดขึ้นก่อนที่การเปรียบเทียบคุณภาพจะเริ่มขึ้น

จุดที่บิลด์หลังการฝึกอบรมแตกหัก และเหตุใดจึงเป็นเรื่องง่ายที่จะมองข้าม

ช่องว่างโดยรวม 8.7 จุดเป็นวิธีที่ให้ข้อมูลน้อยที่สุดในการบอกความแตกต่าง เพราะการเสื่อมคุณภาพในบิลด์ IQ2_XXS ไม่ได้เกิดขึ้นสม่ำเสมอ มันเป็นการเสื่อมแบบเลือกเป็นบางส่วน และรูปแบบที่เห็นกลับตรงกันข้ามกับที่คนส่วนใหญ่จะคาดเดา

• MMLU-Redux — บิลด์หลังการฝึกยังทำได้ดีอย่างน่าพอใจ โดยอยู่ในช่วง 80 กลางถึงปลาย

• GPQA Diamond — ประมาณ 65.5 เทียบกับ 85.76 สำหรับบิลด์แบบ ternary

• AIME26 — อยู่ในช่วง 57.5 ถึง 78.6 ขึ้นอยู่กับบิลด์ เมื่อเทียบกับ 95.83 สำหรับบิลด์แบบไตรภาค

• LiveCodeBench — อยู่ในช่วง 56.4 ถึง 70.05 เมื่อเทียบกับ 90.07 สำหรับบิลด์แบบ ternary

ตัวเลข IQ2 ที่แน่นอนเคลื่อนไปมาระหว่างชุดทดสอบของ Prism ML กับการวัดของชุมชน และช่วงที่กล่าวข้างต้นครอบคลุมทั้งสองแหล่ง แต่รูปแบบสอดคล้องกันในทุกแหล่งข้อมูล: ความรู้ผิวเผินยังคงอยู่ และสิ่งใดก็ตามที่ต้องใช้ห่วงโซ่การให้เหตุผลที่ต่อเนื่องจะเสื่อมลงอย่างรวดเร็ว นั่นแหละคือรูปแบบความล้มเหลวที่การทดสอบแบบชิวๆ จะหาไม่พบ เมื่อสั่งให้บิลด์ 2-bit สรุปเอกสารหรือตอบคำถามเชิงข้อเท็จจริง มันก็ทำงานได้เหมือนโมเดลที่ใหญ่กว่ามาก เมื่อสั่งให้มันคงการอนุมานหลายขั้นตอนหรือสร้างโค้ดที่ไม่ธรรมดา การล่มสลายกลับเกิดขึ้นอย่างฉับพลันมากกว่าค่อยเป็นค่อยไป นี่คือเหตุผลว่าทำไม "มันรู้สึกโอเคตอนที่ฉันลองใช้" จึงไม่ใช่หลักฐานเกี่ยวกับโมเดลแบบควอนไทซ์ — มันเป็นหลักฐานเกี่ยวกับพรอมต์ที่คุณบังเอิญได้ลองต่างหาก

บิลด์แบบ ternary ไม่แสดงการล่มนั้นบนเบนช์มาร์กเดียวกัน Prism ML รายงาน AIME26 ที่ 95.83 เทียบกับ 94.58 สำหรับฐานแบบ full-precision ของตน และ LiveCodeBench ที่ 90.07 เทียบกับ 90.05 — ซึ่งแทบจะเท่ากัน และเป็นข้ออ้างที่มีประโยชน์ที่สุดเพียงหนึ่งเดียวในการเปิดตัวครั้งนี้ เพราะมันบอกว่าข้อจำกัดระหว่างการฝึกได้สิ่งที่ข้อจำกัดหลังการฝึกสูญเสียไป

ข้อโต้แย้งซึ่งเป็นเรื่องจริงและซึ่งตารางคุณภาพไม่ได้สะท้อนให้เห็น

ทุกอย่างข้างต้นให้น้ำหนักกับบิลด์ ternary ในแง่คุณภาพต่อไบต์ มีอยู่มิติหนึ่งที่ GGUF แบบดั้งเดิมชนะขาดลอย และนั่นไม่ใช่เรื่องเล็ก: มันทำงานบนซอฟต์แวร์ที่คุณมีอยู่แล้ว

IQ2_XXS บิลด์ของ Qwen3.8-27B เป็นอาร์ติแฟกต์มาตรฐานของ llama.cpp มันโหลดได้ใน llama.cpp, Ollama, LM Studio, Jan และอะไรก็ตามที่ลิงก์กับ ggml บนทุกแพลตฟอร์มที่ ggml รองรับ โดยไม่ต้องมี fork และไม่ต้องใช้เคอร์เนลพิเศษ เมทริกซ์ความสำคัญ (importance matrix) ของมันสามารถสร้างใหม่หรือแทนที่ได้ มันทำงานเหมือนโมเดลควอนไทซ์ตัวอื่น ๆ ทุกตัวที่คุณมีอยู่ในเครื่อง

Ternary Bonsai 2 27B ไม่เป็นเช่นนั้น เคอร์เนล ternary สำหรับกลไกความสนใจแบบไฮบริดของสถาปัตยกรรมนี้อยู่ใน fork ของ llama.cpp ที่ Prism ML พัฒนาเอง llama.cpp เวอร์ชันมาตรฐานปฏิเสธ PTQ1_0 และ PQ2_0 ว่าเป็นชนิดที่ไม่รู้จัก — และไม่รู้เลยว่าจะจัดการกับฐานแบบหมุนที่แพ็กเหล่านั้นสมมติขึ้นได้อย่างไร บิลด์ MLX สำหรับ Apple Silicon มีเคอร์เนล Metal และ CPU แต่ไม่มีเส้นทาง CUDA ดังนั้นบนเครื่อง NVIDIA จึงถอยไปใช้การประมวลผลไปข้างหน้าบน CPU ซึ่งอาจใช้เวลาหลายนาที Prism ML ระบุถึงการผสานรวมกับรันไทม์หลายตัวจริง แต่ประเด็นพื้นฐานยังคงอยู่: ความสามารถในการใช้งานของโมเดลนี้ถูกจำกัดด้วยว่ารันไทม์ที่คุณเลือกได้ถูกสอนให้รู้จักมันแล้วหรือไม่

นั่นคือข้อแลกเปลี่ยนที่ตรงไปตรงมา คุณกำลังเลือกระหว่างบิลด์ที่ใหญ่กว่า 1.4 เท่า แย่ลงอย่างวัดผลได้ในงานที่คุณน่าจะต้องการโมเดล 27B มากที่สุด และรันได้ทั่วไป — กับบิลด์ที่เล็กกว่าและดีกว่า บนระบบนิเวศที่ปัจจุบันมีเพียงฟอร์กของแล็บหนึ่งแห่งบวกรันไทม์ใดก็ตามที่รับมันไปใช้

A screenshot of Prism ML's launch post for Bonsai 2 27B dated September 17 2026, showing the headline 'PrismML Launches Bonsai 2 27B, Its Most Capable Model Yet' and the paragraphs stating the model is based on Qwen3.8 27B, reduces memory footprint by more than 9x at 5.9 GB, and that the original Ternary Bonsai 27B retained 95% of its full-precision counterpart's aggregate benchmark performance while the new model retains over 98%.

สิ่งที่ต้องใช้ในการรันอันใดอันหนึ่ง

การคำนวณหน่วยความจำนั้นชิดกันกว่าที่ขนาดไฟล์บ่งบอก เพราะไฟล์ไม่ใช่สิ่งเดียวที่อยู่ใน VRAM

• บิลด์ IQ2_XXS — น้ำหนัก 8.39 ถึง 8.75 GiB เหลือพื้นที่ว่างประมาณ 7.5 GB บนการ์ด 16 GB สำหรับคอนเท็กซ์และโมเดลแบบร่าง การทดสอบอิสระข้างต้นระบุโดยเฉพาะว่าบิลด์ 8.39 GiB สามารถรองรับโมเดลแบบร่างขนาด 2.1 GB ควบคู่ไปด้วยได้แล้ว

• Ternary Bonsai 2 27B — 5.93 GB สำหรับโมเดลภาษา PTQ1_0 บวกกับวิสชันทาวเวอร์ 0.63 GB หากคุณใช้รูปภาพเลย บวกกับบริบท การแพ็ก PQ2_0 ของ Prism ML ใช้พื้นที่ 7.25 GB และเป็นตัวเลือกที่เร็วกว่าบนฮาร์ดแวร์ที่จำกัดด้วยอัตราการประมวลผลคำสั่งมากกว่าแบนด์วิดท์

ในด้านความเร็ว ตัวเลขเทอร์นารีที่{{1}}รายงาน{{/1}}คือ 142.5 tok/s ในการดีโค้ดบน RTX 5090 และ 46.8 tok/s บน Apple M5 Max; การรายงานจากบุคคลที่สามเกี่ยวกับบิลด์ IQ2 นั้นเบาบางกว่า โดยมีการวัดด้วย Vulkan บนการ์ด Radeon สองใบที่ประมาณ 3.8 tok/s ในการเจนเนอเรต แม้ว่าตัวเลขนั้นจะบอกข้อมูลเกี่ยวกับแบ็กเอนด์นั้นโดยเฉพาะมากกว่าจะเกี่ยวกับการควอนไทซ์ ควรถือว่าตัวเลขทรูพุตทั้งสองฝั่งขึ้นอยู่กับฮาร์ดแวร์อย่างมาก

OrcaRouter เหมาะกับตรงไหน และไม่เหมาะกับตรงไหน

ไฟล์ทั้งสองนี้ไม่ใช่สิ่งที่เราเตอร์ให้บริการ พวกมันเป็นอาร์ติแฟกต์ที่อยู่ในเครื่องของคุณเอง และการอธิบายอย่างตรงไปตรงมาก็คือ OrcaRouter ไม่ได้โฮสต์ไฟล์ใดในสองไฟล์นี้เลย — นี่คือการเปรียบเทียบเกี่ยวกับสิ่งที่รันอยู่บนฮาร์ดแวร์ของคุณเอง สิ่งที่อยู่ฝั่งเราจริง ๆ ก็คือโมเดลที่ทั้งสองไฟล์นี้พัฒนามาจาก Qwen3.8-27B ความแม่นยำเต็มรูปแบบนั้นพร้อมให้ใช้งานผ่านโครงสร้างพื้นฐานของ OrcaRouter เอง ในราคา $0.33 ต่อล้านโทเคนอินพุต และ $2.40 ต่อล้านโทเคนเอาต์พุต โดยที่บริบท 262K แบบเนทีฟของโมเดลและตัวควบคุมความพยายามในการให้เหตุผลระดับต่ำ/กลาง/สูงยังคงอยู่ครบถ้วน

นั่นทำให้ได้การตั้งค่าแบบไฮบริดที่ควรอธิบายให้เป็นรูปธรรม รันบิลด์ที่บีบอัดไว้ในเครื่องสำหรับงานที่มันถนัด และส่งคำขอเป็นครั้งคราวที่ต้องการความแม่นยำเต็มรูปแบบไปยังโมเดลฐานที่โฮสต์ผ่านคีย์เดียวกัน — ไม่ต้องมีสัญญาผู้ให้บริการรายที่สอง ไม่ต้องแก้โค้ด เพราะทั้งสองฝั่งพูด API เดียวกัน หากปรากฏว่าบิลด์ในเครื่องไม่เหมาะกับเวิร์กโหลดหนึ่ง คำขอที่ล้มเหลวนั้นสามารถถูกส่งต่อไปโดยอัตโนมัติแทนที่จะส่งกลับเป็นข้อผิดพลาด ซึ่งเป็นวิธีที่ถูกกว่าในการค้นพบว่าการควอนไทซ์ไม่เหมาะสม เมื่อเทียบกับการไปค้นพบในโปรดักชัน

เวอร์ชันสั้น

• ในด้านคุณภาพที่เผยแพร่ต่อไบต์ บิลด์แบบเทอร์นารีชนะอย่างชัดเจน และชัยชนะนั้นกระจุกตัวอยู่ในหมวดการให้เหตุผลและโค้ด ซึ่งเป็นหมวดที่บิลด์หลังการฝึกเสื่อมลงมากที่สุด

• ในด้านความสามารถในการพกพา บิลด์ IQ2_XXS ก็ชนะอย่างชัดเจนไม่แพ้กัน ใช้รันไทม์มาตรฐานได้ทุกที่ ไม่ต้องฟอร์ก ไม่ต้องมีเคอร์เนลพิเศษ ไม่มีโหมดล้มเหลวแบบปล่อยขยะเงียบ ๆ

• การเปรียบเทียบไม่ใช่ "1.76 บิต เทียบกับ 2.2 บิต" แต่เป็น "การแทนค่าที่เลือกไว้ระหว่างการฝึก เทียบกับอีกแบบที่ถูกฟิตภายหลัง" และความแตกต่าง 0.44 บิตก็เป็นเพียงความคลาดเคลื่อนจากการปัดเศษเมื่อเทียบกับเรื่องนั้น

• ตัวเลขคุณภาพทุกตัวสำหรับบิลด์แบบ ternary ในบทความนี้คือการวัดของ Prism ML เองบนชุดทดสอบที่ Prism ML เลือกเอง ผล KLD สำหรับบิลด์ IQ2 นั้นเป็นอิสระ เป็นการรันครั้งเดียว และเฉพาะกับโมเดลฐานหนึ่งตัวและชุดทดสอบหนึ่งชุด; ผลเหล่านี้เป็นหลักฐานจากบุคคลที่สามที่แข็งแกร่งที่สุดในการเปรียบเทียบนี้ และไม่ได้บอกอะไรเกี่ยวกับ Bonsai

ช่องว่างจะปิดลงจากอีกทิศทางหนึ่งเช่นกัน และน่าจะเร็ว ๆ นี้ หากเคอร์เนลเทอร์นารีถูกนำเข้า upstream ใน llama.cpp ข้อโต้แย้งจริงจังเพียงข้อเดียวต่อ Bonsai ก็จะหายไป และการเลือกก็จะกลายเป็นเรื่องตรงไปตรงมา จนถึงตอนนั้น บิลด์ IQ2_XXS ยังคงมีข้อได้เปรียบที่แท้จริง ซึ่งไม่เกี่ยวอะไรกับว่ามันดีแค่ไหนเลย

A screenshot of OrcaRouter's model page for Qwen3.8-27B, showing the qwen/qwen3.8-27b identifier attributed to Qwen and dated 2026-08-13, a 262K token context with text, image and video input and text output, input pricing of $0.33 and output pricing of $2.40 per million tokens, a p50 time to first token of 4.80 seconds over seven days, and a description stating the model is self-hosted on OrcaRouter's own infrastructure.

ถ้าคุณกำลังตัดสินใจในสัปดาห์นี้ การทดสอบที่ตัดสินเรื่องนี้ได้ใช้เวลาแค่ช่วงบ่ายเดียว: หยิบพรอมป์ต์ยี่สิบรายการจากงานของคุณเองที่ต้องใช้การให้เหตุผลมากกว่าหนึ่งขั้น รันทั้งสองบิลด์ แล้วให้คะแนนคำตอบแบบไม่รู้ที่มา ตารางที่เผยแพร่จะบอกว่าควรมองตรงไหน แต่บอกไม่ได้ว่างานของคุณอยู่ในจุดนั้นหรือไม่

© 2026 OrcaRouter

สำหรับผู้ให้บริการ

ให้บริการแพลตฟอร์มการอนุมานอยู่หรือไม่ นำโมเดลของคุณขึ้น OrcaRouter

providers@orcarouter.ai

เข้าร่วมคอมมูนิตี้ของเรา

Discordsupport@orcarouter.aiXGitHubYouTube