Một thẻ tiêu đề được tạo tự động ghi 'Ternary Bonsai 2 27B vs Qwen3.8-27B' với phụ đề 'Cùng một mạng ở hai độ chính xác', phía trên ba thẻ ghi 'Kích thước tệp: 5.93 GB vs 53.81 GB', 'Mức giảm: 9.05x' và 'Ngữ cảnh: 262K token, cả hai', cùng dòng chân trang ghi 'Tỷ lệ duy trì 98.2% do nhà cung cấp báo cáo và chưa được tái lập.' Logo OrcaRouter nằm ở góc dưới bên phải.
Guides & Insights

Ternary Bonsai 2 27B so với Qwen3.8-27B: 47,9 gigabyte độ chính xác thực sự mang lại điều gì

Tác giả

Rowan Sterling

Ngày đăng

Mô hình mới nhất · 20Xem tất cả mô hình
Benchmark: Artificial Analysis · cập nhật hằng ngày
Quay lại tất cả bài viết

Ternary Bonsai 2 27B và Qwen3.8-27B là cùng một mô hình trong hai thế giới số. Chúng dùng chung một kiến trúc, một tokenizer, một nguồn gốc huấn luyện và cửa sổ ngữ cảnh 262.144 token. Điều phân biệt chúng là cách các trọng số được ghi lại: Qwen3.8-27B lưu mỗi trọng số dưới dạng số thực dấu phẩy động 16-bit và chiếm 53,81 GB ở dạng tham chiếu FP16, trong khi Ternary Bonsai 2 27B lưu mỗi trọng số dưới dạng một trong ba ký hiệu và chiếm 5,93 GB. Prism ML đã công bố bản dựng nén vào ngày 17 tháng 9 năm 2026 và đưa nó lên Hugging Face theo giấy phép Apache 2.0; các trọng số gốc của Qwen3.8-27B được công bố vào ngày 13 tháng 8 năm 2026, cũng theo giấy phép Apache 2.0.

Phép so sánh đáng quan tâm không phải là cái nào tốt hơn. Mà là 47.9 GB thiếu hụt khiến bạn phải trả giá những gì, và câu trả lời trung thực thì hẹp hơn và cụ thể hơn những gì cả hai phe sẽ nói với bạn. Prism ML báo cáo rằng bản dựng của họ giữ được 98.2% mức trung bình của mô hình độ chính xác đầy đủ trên một bộ 20 bài kiểm chuẩn — 83.9 so với 85.4. Con số đó là của chính nhà cung cấp, được đo trên hệ thống đo của chính nhà cung cấp, và một ngày sau khi phát hành, chưa có ai ngoài Prism ML tái lập được nó. Con số tổng hợp cũng che giấu phần mà bạn thực sự nên quan tâm, bởi vì 1.8 điểm không được phân bố đều. Trên hai bài kiểm chuẩn thử thách khả năng làm kỹ thuật phần mềm liên tục, khoảng cách không phải 1.8% — mà là gần 25%.

Cùng một mạng, được viết ra theo cách khác

Bắt đầu với những gì mà nén không đụng tới, vì đó chính là lý do khiến phép so sánh trở nên thú vị ngay từ đầu. Số lượng lớp, kích thước ẩn, từ vựng, mẫu attention và tháp thị giác đều thuộc về mô hình cơ sở. Qwen3.8-27B là một thiết kế attention lai: 48 lớp attention tuyến tính Gated DeltaNet xen kẽ với 16 lớp attention đầy đủ, tỷ lệ chia khoảng 3:1, trên 64 lớp với kích thước ẩn 5.120 và từ vựng 248.320 token. Chính xương sống chủ yếu tuyến tính đó là thứ khiến ngữ cảnh 262K trở nên khả thi ngay từ đầu, và đó là thuộc tính mà Bonsai kế thừa nguyên vẹn.

Điều Prism ML thay đổi là cách biểu diễn các ma trận của mô hình ngôn ngữ, cùng với các kernel cần thiết để tính toán trên chúng. Sách trắng của họ chia 27,36B tham số thành 24,35B trong backbone ngôn ngữ trải qua 64 khối, 2,54B trong phần embedding và LM head, và 0,47B trong một tháp thị giác 27 khối. Tháp thị giác được phát hành dưới dạng tệp mmproj 4-bit riêng biệt khoảng 0,63 GB và chỉ được tải khi thực sự có ảnh đến, nên một triển khai chỉ dùng văn bản sẽ không bao giờ phải chịu chi phí cho nó.

Một hệ quả thực tế của thiết kế gần như tuyến tính đó đáng để nêu ra trước khi bàn đến bất kỳ benchmark nào. Vì kiến trúc này không phải một transformer thông thường, các kernel bit thấp phải được viết riêng cho nó. llama.cpp nguyên bản từ chối cả hai cách đóng gói của Prism ML vì coi chúng là loại không xác định — và nguy hiểm hơn, nó tải một định dạng ternary cũ hơn mà không hề phàn nàn và tạo ra những câu vô nghĩa trôi chảy, vì nó không áp dụng phép quay tương ứng lên activations. Nếu bạn chạy mô hình này trên một binary không biết về nó, bạn sẽ không nhận được lỗi. Bạn sẽ nhận được đầu ra sai một cách đầy tự tin.

So sánh, theo từng danh mục

Đây là bảng phân tích 20 điểm chuẩn của nhà cung cấp, với cơ sở độ chính xác đầy đủ làm tham chiếu. Mọi số liệu trong danh sách này đều là của Prism ML; không có số liệu nào được xác minh độc lập.

• Toán — 96,57 cho Ternary Bonsai 2 27B so với 97,06 cho Qwen3.8-27B. Thực tế là ngang bằng.

• Lập trình — 81.58 so với 82.17. Cũng sát nút, và là hạng mục mà toàn bộ kỹ thuật đang được tranh luận.

• Tuân thủ hướng dẫn — 82.66 so với 81.25. Mô hình nén dẫn trước ở đây, đây là dòng duy nhất trong bảng thực sự đáng ngạc nhiên.

• Kiến thức và lập luận — 83,95 so với 86,66. Mức giảm 2,7 điểm, và là yếu tố đóng góp lớn nhất vào 1,8 điểm còn thiếu.

• Năng lực tác tử và gọi công cụ — 77.57 so với 79.74, bao gồm τ2-Bench ở 80.22 và BFCL v3 ở 74.92.

• Thị giác — 78,59 so với 81,64, mức giảm lớn nhất trong các hạng mục. Lưu ý rằng bản thân tháp thị giác không phải là phần bị nén; mà chính mô hình ngôn ngữ đọc đầu ra của nó mới là.

A generated two-column scoreboard titled 'Ternary Bonsai 2 27B vs Qwen3.8-27B — the scoreboard'. The Ternary Bonsai 2 27B column reads: bits per weight 1.76 packed, file size 5.93 GB, 20-benchmark average 83.9, math 96.57, instruction following 82.66, Terminal-Bench 2.1 52.8. The Qwen3.8-27B FP16 column reads: bits per weight 16.0, file size 53.81 GB, 20-benchmark average 85.4, math 97.06, instruction following 81.25, Terminal-Bench 2.1 69.7. Footer reads 'Both columns are one vendor suite; the compressed figures are unaudited.' The OrcaRouter logo sits in the bottom-right.

Hãy đọc hình dạng thay vì giá trị trung bình, và một câu chuyện rõ ràng hơn sẽ hiện ra. Nén gần như không tốn kém đối với toán học, lập trình và tuân theo chỉ dẫn, nhưng lại tốn kém đối với kiến thức và thị giác. Điều đó trái ngược với quan niệm phổ biến về các mô hình bit thấp, vốn cho rằng kiến thức bề mặt tồn tại còn suy luận thì sụp đổ. Ở đây, chính kiến thức bị bào mòn còn suy luận lại trụ vững.

1,8 điểm thực sự nằm ở đâu

Con số tổng hợp là giá trị trung bình trên hai mươi bài kiểm chuẩn, và trung bình chính là nơi những khác biệt ẩn mình. Tách riêng từng kết quả ra, và hai trong số đó tệ hơn nhiều so với mức mà giá trị trung bình ngụ ý.

• Terminal-Bench 2.1 — 52.8 cho bản dựng ternary so với 69.7 cho độ chính xác đầy đủ

• SWE-bench Verified — 60.8 so với 80.6

Cả hai đều đạt gần ba phần tư điểm full-precision. So với đó, AIME26 đạt 95,83, LiveCodeBench đạt 90,07, và AA-LCR đạt 77,0 — chỉ trong vòng một điểm so với mô hình không nén. Đây là lần đầu tiên dòng Bonsai được đánh giá trên Terminal-Bench, và Prism ML nói rõ trong tài liệu của chính mình rằng năng lực kỹ thuật phần mềm tầm xa mà hãng hứa hẹn ở thế hệ đầu tiên chỉ được đáp ứng một phần, chứ chưa đầy đủ.

Vậy nên câu hỏi thực tế không phải là "liệu nó có giữ được 98,2% không" mà là "khối lượng công việc của tôi là gì". Nếu bạn đang chạy một agent lập trình giữ một kế hoạch xuyên suốt hàng chục lệnh gọi công cụ và chỉnh sửa tệp trong nhiều phút, thì bạn thuộc nhóm có khoảng cách 25%, và con số tổng hợp đang thực sự gây hiểu lầm. Nếu bạn đang làm toán, sinh mã một lượt, trích xuất, phân loại hoặc trò chuyện, thì bạn thuộc những nhóm mà khoảng cách đó biến mất khi làm tròn. Điều hữu ích nhất ở bảng của chính nhà cung cấp là nó cho phép bạn phân biệt điều đó thay vì phải đoán.

Mỗi cái thực sự cần gì để chạy

Câu chuyện phần cứng kém đối xứng hơn so với tỷ lệ kích thước gợi ý. Một mô hình FP16 53,81 GB hoàn toàn không vừa trên laptop 16 GB, khiến so sánh này ít mang tính “nhanh hơn so với chậm hơn” mà đúng hơn là “khả thi so với không khả thi”. Các phép đo được chuẩn hóa của Prism ML ở batch size 1, không tính vision tower:

• NVIDIA RTX 5090 — giải mã 142.5 tok/s trên cách đóng gói PQ2_0, ở mức 0.582 mWh mỗi token

• Apple M5 Max — 46,8 tok/s khi giải mã, với tốc độ xử lý prompt khoảng 765 tok/s

• Apple M5 Pro — 27.7 tok/s giải mã

• Apple M4 Pro — giải mã 18,0 tok/s, với việc xử lý prompt gần 125 tok/s đang trở thành ràng buộc quyết định đối với các ngữ cảnh rất dài

Lưu ý quan trọng là không có thứ nào trong số này là một tệp nhị phân duy nhất. Cách đóng gói PTQ1_0 cho bạn 5,93 GB ở mức 1,76 bit mỗi trọng số; PQ2_0 tốn 7,25 GB ở mức 2,16 bit mỗi trọng số và đổi lấy tốc độ giải mã trên phần cứng nơi thông lượng lệnh, chứ không phải băng thông bộ nhớ, mới là giới hạn. Bản dựng MLX cho Apple Silicon là tạo tác thứ ba với cách tính riêng — một bộ chứa affine 2-bit lưu một bias mà trọng số tam phân không cần, đạt 2,25 bit mỗi trọng số và 8,005 GiB trên đĩa, với các kernel Metal và CPU nhưng không có đường CUDA. “Nó chạy trong 5,9 GB” chỉ đúng với đúng một trong những tệp đó trên đúng môi trường chạy thích hợp.

So sánh chi phí, được trình bày một cách trung thực

Có hai cách để trả tiền cho Qwen3.8-27B và chỉ có một cách để trả tiền cho người anh em nén của nó. Ternary Bonsai 2 27B là bản tải về: Apache 2.0, phần cứng của bạn, không có đồng hồ tính phí. Qwen3.8-27B vừa là bản tải về vừa là dịch vụ lưu trữ, và nếu bạn chọn con đường dịch vụ lưu trữ thì con số liên quan chính là con số trên trang mô hình — 0,33 USD mỗi triệu token đầu vào và 2,40 USD mỗi triệu token đầu ra, được phục vụ từ cơ sở hạ tầng riêng của OrcaRouter thay vì bán lại từ cơ sở hạ tầng của người khác.

Đó là nơi OrcaRouter giành được một vị trí trong so sánh này thay vì chỉ là một chú thích cuối trang. Bản dựng được định tuyến của Qwen3.8-27B mang cùng ngữ cảnh 262K, chấp nhận văn bản, hình ảnh và video, đồng thời cung cấp điều khiển mức nỗ lực suy luận mà mô hình đi kèm. Nó nằm sau cùng một khóa như hơn 200 mô hình khác mà không có phụ giá cộng thêm trên giá niêm yết của nhà cung cấp, điều này quan trọng hơn mức nghe có vẻ: bởi vì giá niêm yết được chuyển nguyên thay vì bán lại, thay đổi giá của nhà cung cấp sẽ xuất hiện ở đây ngay trong cùng ngày thay vì vào lần gia hạn hợp đồng tiếp theo. Đối với một nhóm muốn dùng bản cơ sở đầy đủ độ chính xác làm tầng leo thang phía trên một Bonsai cục bộ, đó là một endpoint và một khóa thay vì hai mối quan hệ nhà cung cấp.

A screenshot of Prism ML's launch post for Bonsai 2 27B, dated September 17 2026 and titled 'PrismML Launches Bonsai 2 27B, Its Most Capable Model Yet', showing the opening paragraphs stating the model is based on Qwen3.8 27B, reduces memory footprint by more than 9x at 5.9 GB, and that while the original Ternary Bonsai 27B retained 95% of its full-precision counterpart's aggregate benchmark performance the new model retains over 98%.

Nên chọn cái nào

Quyết định chủ yếu là về nơi công việc diễn ra, không phải về việc mô hình nào tốt hơn, vì trong hầu hết các tác vụ, chúng là cùng một mô hình.

• Chọn Qwen3.8-27B độ chính xác đầy đủ khi tác vụ có tầm xa dài hạn và mang tính tác nhân, khi bạn đang đánh giá hoặc tinh chỉnh, khi bạn cần ngữ cảnh YaRN 1M token, hoặc khi độ chính xác thị giác đóng vai trò then chốt. Các con số Terminal-Bench và SWE-bench chính là lý do.

• Chọn Ternary Bonsai 2 27B khi công việc phải diễn ra trên phần cứng bạn sở hữu, khi giải pháp thay thế là không chạy mô hình 27B nào cả, hoặc khi khối lượng công việc là toán, lập trình, trích xuất hoặc suy luận không dùng công cụ, nơi các hạng mục ngang bằng nhau.

• Đừng chọn dựa trên điểm tổng hợp. 83.9 và 85.4 đủ gần nhau đến mức chỉ một lần hoán đổi benchmark cũng có thể đảo thứ tự của chúng, và chỉ một trong hai con số được xác minh độc lập.

Điều thực sự mới ở đây không phải là một mô hình 27B vừa trong sáu gigabyte — thế hệ Bonsai đầu tiên đã làm được điều đó vào tháng Bảy. Mà là việc tuân thủ chỉ dẫn vượt qua mô hình cha và toán cùng lập trình đạt mức ngang bằng, một khẳng định khác với "nhỏ so với kích thước của nó". Việc nó có trụ vững trên khối lượng công việc của bạn hay không chính là điều mà việc mới ra đời một ngày không thể cho bạn biết, và đánh giá độc lập đầu tiên về mô hình này là kết quả đáng để chờ đợi.

A screenshot of OrcaRouter's model page for Qwen3.8-27B, showing the qwen/qwen3.8-27b identifier attributed to Qwen and dated 2026-08-13, a 262K token context with text, image and video input and text output, input pricing of $0.33 and output pricing of $2.40 per million tokens, a p50 time to first token of 4.80 seconds over seven days, and the description that the model is self-hosted on OrcaRouter's own infrastructure.

Nếu bạn muốn chạy so sánh trên các prompt của riêng mình thay vì trên một bộ benchmark, cách nhanh nhất là gọi Qwen3.8-27B được host qua một endpoint và chạy bản build ternary cục bộ, sau đó so sánh khác biệt đầu ra trên những tác vụ bạn thực sự có. Đó chỉ là công việc của một buổi sáng và nó sẽ cho bạn biết nhiều hơn về 1,8 điểm so với bất kỳ bảng công bố nào.