
Ternary Bonsai 2 27B so với Qwen3.8-27B: 47,9 gigabyte độ chính xác thực sự mang lại điều gì
- OrcaMỚIOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 trên 1 triệu token
- orcaMỚIOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 trên 1 triệu token
- deepseekMỚIDeepSeek: DeepSeek V4.1 Flash2026-09-1040Trí tuệ
- openaiMỚIOpenAI: GPT-6 Astra2026-09-0453Trí tuệ77Lập trình
- googleGoogle: Gemini 3.8 Flash2026-09-0241Trí tuệ76Lập trình
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Trí tuệ76Lập trình
- anthropicAnthropic: Claude Fable 5.12026-09-0153Trí tuệ82Lập trình
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 trên 1 triệu token
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Trí tuệ72Lập trình
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 trên 1 triệu token
- z-aiZ.ai: GLM 5.32026-08-1845Trí tuệ75Lập trình
- obsidianQwen3.8 27B2026-08-1534Trí tuệ68Lập trình
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Trí tuệ69Lập trình
- grokSpaceXAI: Grok 4.62026-08-1244Trí tuệ77Lập trình
- metaMeta: Muse Spark 1.22026-08-0540Trí tuệ72Lập trình
- qwenQwen: Qwen3.8 Max2026-08-0345Trí tuệ76Lập trình
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135Trí tuệ69Lập trình
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 trên 1 triệu token
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
Ternary Bonsai 2 27B và Qwen3.8-27B là cùng một mô hình trong hai thế giới số. Chúng dùng chung một kiến trúc, một tokenizer, một nguồn gốc huấn luyện và cửa sổ ngữ cảnh 262.144 token. Điều phân biệt chúng là cách các trọng số được ghi lại: Qwen3.8-27B lưu mỗi trọng số dưới dạng số thực dấu phẩy động 16-bit và chiếm 53,81 GB ở dạng tham chiếu FP16, trong khi Ternary Bonsai 2 27B lưu mỗi trọng số dưới dạng một trong ba ký hiệu và chiếm 5,93 GB. Prism ML đã công bố bản dựng nén vào ngày 17 tháng 9 năm 2026 và đưa nó lên Hugging Face theo giấy phép Apache 2.0; các trọng số gốc của Qwen3.8-27B được công bố vào ngày 13 tháng 8 năm 2026, cũng theo giấy phép Apache 2.0.
Phép so sánh đáng quan tâm không phải là cái nào tốt hơn. Mà là 47.9 GB thiếu hụt khiến bạn phải trả giá những gì, và câu trả lời trung thực thì hẹp hơn và cụ thể hơn những gì cả hai phe sẽ nói với bạn. Prism ML báo cáo rằng bản dựng của họ giữ được 98.2% mức trung bình của mô hình độ chính xác đầy đủ trên một bộ 20 bài kiểm chuẩn — 83.9 so với 85.4. Con số đó là của chính nhà cung cấp, được đo trên hệ thống đo của chính nhà cung cấp, và một ngày sau khi phát hành, chưa có ai ngoài Prism ML tái lập được nó. Con số tổng hợp cũng che giấu phần mà bạn thực sự nên quan tâm, bởi vì 1.8 điểm không được phân bố đều. Trên hai bài kiểm chuẩn thử thách khả năng làm kỹ thuật phần mềm liên tục, khoảng cách không phải 1.8% — mà là gần 25%.
Cùng một mạng, được viết ra theo cách khác
Bắt đầu với những gì mà nén không đụng tới, vì đó chính là lý do khiến phép so sánh trở nên thú vị ngay từ đầu. Số lượng lớp, kích thước ẩn, từ vựng, mẫu attention và tháp thị giác đều thuộc về mô hình cơ sở. Qwen3.8-27B là một thiết kế attention lai: 48 lớp attention tuyến tính Gated DeltaNet xen kẽ với 16 lớp attention đầy đủ, tỷ lệ chia khoảng 3:1, trên 64 lớp với kích thước ẩn 5.120 và từ vựng 248.320 token. Chính xương sống chủ yếu tuyến tính đó là thứ khiến ngữ cảnh 262K trở nên khả thi ngay từ đầu, và đó là thuộc tính mà Bonsai kế thừa nguyên vẹn.
Điều Prism ML thay đổi là cách biểu diễn các ma trận của mô hình ngôn ngữ, cùng với các kernel cần thiết để tính toán trên chúng. Sách trắng của họ chia 27,36B tham số thành 24,35B trong backbone ngôn ngữ trải qua 64 khối, 2,54B trong phần embedding và LM head, và 0,47B trong một tháp thị giác 27 khối. Tháp thị giác được phát hành dưới dạng tệp mmproj 4-bit riêng biệt khoảng 0,63 GB và chỉ được tải khi thực sự có ảnh đến, nên một triển khai chỉ dùng văn bản sẽ không bao giờ phải chịu chi phí cho nó.
Một hệ quả thực tế của thiết kế gần như tuyến tính đó đáng để nêu ra trước khi bàn đến bất kỳ benchmark nào. Vì kiến trúc này không phải một transformer thông thường, các kernel bit thấp phải được viết riêng cho nó. llama.cpp nguyên bản từ chối cả hai cách đóng gói của Prism ML vì coi chúng là loại không xác định — và nguy hiểm hơn, nó tải một định dạng ternary cũ hơn mà không hề phàn nàn và tạo ra những câu vô nghĩa trôi chảy, vì nó không áp dụng phép quay tương ứng lên activations. Nếu bạn chạy mô hình này trên một binary không biết về nó, bạn sẽ không nhận được lỗi. Bạn sẽ nhận được đầu ra sai một cách đầy tự tin.
So sánh, theo từng danh mục
Đây là bảng phân tích 20 điểm chuẩn của nhà cung cấp, với cơ sở độ chính xác đầy đủ làm tham chiếu. Mọi số liệu trong danh sách này đều là của Prism ML; không có số liệu nào được xác minh độc lập.
• Toán — 96,57 cho Ternary Bonsai 2 27B so với 97,06 cho Qwen3.8-27B. Thực tế là ngang bằng.
• Lập trình — 81.58 so với 82.17. Cũng sát nút, và là hạng mục mà toàn bộ kỹ thuật đang được tranh luận.
• Tuân thủ hướng dẫn — 82.66 so với 81.25. Mô hình nén dẫn trước ở đây, đây là dòng duy nhất trong bảng thực sự đáng ngạc nhiên.
• Kiến thức và lập luận — 83,95 so với 86,66. Mức giảm 2,7 điểm, và là yếu tố đóng góp lớn nhất vào 1,8 điểm còn thiếu.
• Năng lực tác tử và gọi công cụ — 77.57 so với 79.74, bao gồm τ2-Bench ở 80.22 và BFCL v3 ở 74.92.
• Thị giác — 78,59 so với 81,64, mức giảm lớn nhất trong các hạng mục. Lưu ý rằng bản thân tháp thị giác không phải là phần bị nén; mà chính mô hình ngôn ngữ đọc đầu ra của nó mới là.

Hãy đọc hình dạng thay vì giá trị trung bình, và một câu chuyện rõ ràng hơn sẽ hiện ra. Nén gần như không tốn kém đối với toán học, lập trình và tuân theo chỉ dẫn, nhưng lại tốn kém đối với kiến thức và thị giác. Điều đó trái ngược với quan niệm phổ biến về các mô hình bit thấp, vốn cho rằng kiến thức bề mặt tồn tại còn suy luận thì sụp đổ. Ở đây, chính kiến thức bị bào mòn còn suy luận lại trụ vững.
1,8 điểm thực sự nằm ở đâu
Con số tổng hợp là giá trị trung bình trên hai mươi bài kiểm chuẩn, và trung bình chính là nơi những khác biệt ẩn mình. Tách riêng từng kết quả ra, và hai trong số đó tệ hơn nhiều so với mức mà giá trị trung bình ngụ ý.
• Terminal-Bench 2.1 — 52.8 cho bản dựng ternary so với 69.7 cho độ chính xác đầy đủ
• SWE-bench Verified — 60.8 so với 80.6
Cả hai đều đạt gần ba phần tư điểm full-precision. So với đó, AIME26 đạt 95,83, LiveCodeBench đạt 90,07, và AA-LCR đạt 77,0 — chỉ trong vòng một điểm so với mô hình không nén. Đây là lần đầu tiên dòng Bonsai được đánh giá trên Terminal-Bench, và Prism ML nói rõ trong tài liệu của chính mình rằng năng lực kỹ thuật phần mềm tầm xa mà hãng hứa hẹn ở thế hệ đầu tiên chỉ được đáp ứng một phần, chứ chưa đầy đủ.
Vậy nên câu hỏi thực tế không phải là "liệu nó có giữ được 98,2% không" mà là "khối lượng công việc của tôi là gì". Nếu bạn đang chạy một agent lập trình giữ một kế hoạch xuyên suốt hàng chục lệnh gọi công cụ và chỉnh sửa tệp trong nhiều phút, thì bạn thuộc nhóm có khoảng cách 25%, và con số tổng hợp đang thực sự gây hiểu lầm. Nếu bạn đang làm toán, sinh mã một lượt, trích xuất, phân loại hoặc trò chuyện, thì bạn thuộc những nhóm mà khoảng cách đó biến mất khi làm tròn. Điều hữu ích nhất ở bảng của chính nhà cung cấp là nó cho phép bạn phân biệt điều đó thay vì phải đoán.
Mỗi cái thực sự cần gì để chạy
Câu chuyện phần cứng kém đối xứng hơn so với tỷ lệ kích thước gợi ý. Một mô hình FP16 53,81 GB hoàn toàn không vừa trên laptop 16 GB, khiến so sánh này ít mang tính “nhanh hơn so với chậm hơn” mà đúng hơn là “khả thi so với không khả thi”. Các phép đo được chuẩn hóa của Prism ML ở batch size 1, không tính vision tower:
• NVIDIA RTX 5090 — giải mã 142.5 tok/s trên cách đóng gói PQ2_0, ở mức 0.582 mWh mỗi token
• Apple M5 Max — 46,8 tok/s khi giải mã, với tốc độ xử lý prompt khoảng 765 tok/s
• Apple M5 Pro — 27.7 tok/s giải mã
• Apple M4 Pro — giải mã 18,0 tok/s, với việc xử lý prompt gần 125 tok/s đang trở thành ràng buộc quyết định đối với các ngữ cảnh rất dài
Lưu ý quan trọng là không có thứ nào trong số này là một tệp nhị phân duy nhất. Cách đóng gói PTQ1_0 cho bạn 5,93 GB ở mức 1,76 bit mỗi trọng số; PQ2_0 tốn 7,25 GB ở mức 2,16 bit mỗi trọng số và đổi lấy tốc độ giải mã trên phần cứng nơi thông lượng lệnh, chứ không phải băng thông bộ nhớ, mới là giới hạn. Bản dựng MLX cho Apple Silicon là tạo tác thứ ba với cách tính riêng — một bộ chứa affine 2-bit lưu một bias mà trọng số tam phân không cần, đạt 2,25 bit mỗi trọng số và 8,005 GiB trên đĩa, với các kernel Metal và CPU nhưng không có đường CUDA. “Nó chạy trong 5,9 GB” chỉ đúng với đúng một trong những tệp đó trên đúng môi trường chạy thích hợp.
So sánh chi phí, được trình bày một cách trung thực
Có hai cách để trả tiền cho Qwen3.8-27B và chỉ có một cách để trả tiền cho người anh em nén của nó. Ternary Bonsai 2 27B là bản tải về: Apache 2.0, phần cứng của bạn, không có đồng hồ tính phí. Qwen3.8-27B vừa là bản tải về vừa là dịch vụ lưu trữ, và nếu bạn chọn con đường dịch vụ lưu trữ thì con số liên quan chính là con số trên trang mô hình — 0,33 USD mỗi triệu token đầu vào và 2,40 USD mỗi triệu token đầu ra, được phục vụ từ cơ sở hạ tầng riêng của OrcaRouter thay vì bán lại từ cơ sở hạ tầng của người khác.
Đó là nơi OrcaRouter giành được một vị trí trong so sánh này thay vì chỉ là một chú thích cuối trang. Bản dựng được định tuyến của Qwen3.8-27B mang cùng ngữ cảnh 262K, chấp nhận văn bản, hình ảnh và video, đồng thời cung cấp điều khiển mức nỗ lực suy luận mà mô hình đi kèm. Nó nằm sau cùng một khóa như hơn 200 mô hình khác mà không có phụ giá cộng thêm trên giá niêm yết của nhà cung cấp, điều này quan trọng hơn mức nghe có vẻ: bởi vì giá niêm yết được chuyển nguyên thay vì bán lại, thay đổi giá của nhà cung cấp sẽ xuất hiện ở đây ngay trong cùng ngày thay vì vào lần gia hạn hợp đồng tiếp theo. Đối với một nhóm muốn dùng bản cơ sở đầy đủ độ chính xác làm tầng leo thang phía trên một Bonsai cục bộ, đó là một endpoint và một khóa thay vì hai mối quan hệ nhà cung cấp.

Nên chọn cái nào
Quyết định chủ yếu là về nơi công việc diễn ra, không phải về việc mô hình nào tốt hơn, vì trong hầu hết các tác vụ, chúng là cùng một mô hình.
• Chọn Qwen3.8-27B độ chính xác đầy đủ khi tác vụ có tầm xa dài hạn và mang tính tác nhân, khi bạn đang đánh giá hoặc tinh chỉnh, khi bạn cần ngữ cảnh YaRN 1M token, hoặc khi độ chính xác thị giác đóng vai trò then chốt. Các con số Terminal-Bench và SWE-bench chính là lý do.
• Chọn Ternary Bonsai 2 27B khi công việc phải diễn ra trên phần cứng bạn sở hữu, khi giải pháp thay thế là không chạy mô hình 27B nào cả, hoặc khi khối lượng công việc là toán, lập trình, trích xuất hoặc suy luận không dùng công cụ, nơi các hạng mục ngang bằng nhau.
• Đừng chọn dựa trên điểm tổng hợp. 83.9 và 85.4 đủ gần nhau đến mức chỉ một lần hoán đổi benchmark cũng có thể đảo thứ tự của chúng, và chỉ một trong hai con số được xác minh độc lập.
Điều thực sự mới ở đây không phải là một mô hình 27B vừa trong sáu gigabyte — thế hệ Bonsai đầu tiên đã làm được điều đó vào tháng Bảy. Mà là việc tuân thủ chỉ dẫn vượt qua mô hình cha và toán cùng lập trình đạt mức ngang bằng, một khẳng định khác với "nhỏ so với kích thước của nó". Việc nó có trụ vững trên khối lượng công việc của bạn hay không chính là điều mà việc mới ra đời một ngày không thể cho bạn biết, và đánh giá độc lập đầu tiên về mô hình này là kết quả đáng để chờ đợi.

Nếu bạn muốn chạy so sánh trên các prompt của riêng mình thay vì trên một bộ benchmark, cách nhanh nhất là gọi Qwen3.8-27B được host qua một endpoint và chạy bản build ternary cục bộ, sau đó so sánh khác biệt đầu ra trên những tác vụ bạn thực sự có. Đó chỉ là công việc của một buổi sáng và nó sẽ cho bạn biết nhiều hơn về 1,8 điểm so với bất kỳ bảng công bố nào.
