生成されたタイトルカードには「Ternary Bonsai 2 27B vs Qwen3.8-27B IQ2_XXS GGUF」と表示され、サブタイトルは「ビット数は少なく、スコアは上」、その上に3枚のカードがあり、それぞれ「重みあたりのビット数:1.76 vs 2.2」「サイズ:5.93 GB vs 7.3 GB」「ベンダースイート平均:83.9 vs 75.2」と表示され、フッターには「Bonsaiの数値はベンダー報告、IQ2_XXSの数値はベンダーおよびコミュニティのテストによる。」と書かれている。OrcaRouterのロゴは右下にある。
Engineering & Research

Ternary Bonsai 2 27B vs Qwen3.8-27B IQ2_XXS GGUF:ビット数は少なく、スコアは上

著者

Rowan Sterling

公開日

最新モデル · 20すべてのモデルを見る
ベンチマーク:Artificial Analysis · 毎日更新
すべての記事に戻る

Ternary Bonsai 2 27B は、Qwen3.8-27B の IQ2_XXS GGUF ビルドより小さく、それに付随して公表された数値では性能も上回っている。両者を隔てているのがビット予算だけなら、これは起こり得ないはずだ。Bonsai ビルドは 5.93 GB のファイルに 1 ウェイトあたり 1.76 ビットを載せている。同じベースモデルの従来型 2 ビット量子化は、約 7.3 GB のファイルに 1 ウェイトあたりおよそ 2.2 ビットを載せている。2026年9月17日に三値ビルドを発表した Prism ML は、自社モデルについて20ベンチマーク平均 83.9 を報告しているのに対し、IQ2_XXS の比較対象は 75.2 だ。より少ないビットを使うモデルに有利な 8.7 ポイントの差である。

その逆転こそがすべてであり、それはトリックではない。二つのファイルは、モデルのライフサイクルの異なる段階で、異なるプロセスによって生成される。そして、それらのプロセスの違いは、ビット幅の違いよりも重要だ。これはまた、よくある助言——「とりあえず2ビット量子化を選んでおけばいい、今は問題ない」——が最も明確な反例に突き当たる比較であり、その反例の背後には、ベンダーの言葉ではなく独立した測定がある比較でもある。

そのパラドックスこそがメカニズムである

IQ2_XXS はポストトレーニング量子化フォーマットです。モデルはフル精度で収束するまで訓練され、その後、その重みはフィッティング手順によって選ばれた低ビット表現に丸められます。モデルには適応する機会がまったく与えられません。事後に測定され、近似されるだけです。i-quant ファミリーは、重要度行列——どの重みにより多くの利用可能な精度を割り当てるべきかを決めるキャリブレーション・パス——を用いることで、古い k-quants を改良していますが、基本的な演算の順序は変わりません。訓練してから、圧縮する。

Bonsaiはその順序を逆にする。Prism MLの自身の手法に関する説明は、ポストトレーニング量子化を完全に放棄し、三値制約を課した中にトレーニング:フォワードパスは重みを{−1, 0, +1}に制限して計算し、バックワードパスは依然としてフル精度の勾配を運ぶ。モデルは、制約を予期していなかった表現に制約を課すのではなく、制約を生き残る表現を学習することにトレーニングを費やす。このアルゴリズムはプロプライエタリなIPとして説明されているが、その形はBitNetの一連の研究を読んだことがある人には馴染み深いだろう。

2つの改良点が上に載っており、どちらも算術に現れている。1つ目は選択的精度である。2620万個のパラメータ — モデルの約0.098%、bf16でおおよそ52 MB、主に線形アテンション層の再帰状態パスと正規化重み — は、三値化されずに完全精度で保持される。2つ目はブロック単位の回転である。各重み行列は、三値値が選ばれる前にブロックサイズ1,024のウォルシュ・アダマール回転によって変換され、これにより外れ値が座標全体に広がり、3レベル近似の破壊性が低くなる。回転は保存された重みに畳み込まれるため、余分なバイトを消費しない。代わりに、対応する変換が実行時にアクティベーションに適用される。

その最後の細部には、いざそれを動かそうとする最初の試みで直面することになる帰結が伴う。そしてそれが、このアプローチの本当の代償なのだ。

どのIQ2_XXSのことですか、そして実際にどれくらいのスコアを出すのですか?

品質を比較する前に、ほとんどの報道が見落としている訂正事項がひとつある。「IQ2_XXS」は単一の成果物ではない。それは llama.cpp の量子化タイプであり、同じタイプを異なるツールチェーンで同じベースモデルに適用すると、サイズは意味のある差が出て、品質は大幅に異なるファイルが生成される。

最も明確な公開証拠は、2ビット未満の Qwen3.8-27B をそもそも作る価値があるのかを検証していたユーザーが 2026年8月15日に投稿した独立した比較である。そのテストは wikitext-2 の KL ダイバージェンス測定で、512 コンテキストで 100 チャンク、パープレキシティ 6.7500 のローカルでビルドした Q8_0 リファレンスに対して行われ、すべての候補が同じ重要度行列、コーパス、ベースライン、および llama.cpp ビルドを一度のセッションで使用している。結果は次のとおり:

• unsloth UD-IQ2_XXS — 8.39 GiB、パープレキシティ 7.6528、平均KLD 0.146、中央値KLD 0.076、top-1一致率 82.98%

• bartowski IQ2_XXS — 8.75 GiB、パープレキシティ 8.5352、平均KLD 0.301、中央値KLD 0.162、トップ1一致率 76.53%

動的バリアントは0.36 GiB小さく、静的バリアントより平均KLDで約2.1倍優れており、ベースライン困惑度の1.13倍に相当する。同じラベルをまとった2つのファイルが、出力分布がどれだけずれたかを測る指標において2倍の差で分かれている。同じテストでは、2ビット未満の候補がすべて、公開されているIQ2の2つの選択肢より劣ることが判明した。これが、このベースモデルの実用的な下限がそれより下ではなくIQ2に位置する理由である。

A screenshot of a Hugging Face community discussion titled 'Independent KLD benchmark: UD-IQ2_XXS beats bartowski IQ2_XXS on both size and quality', opened 15 August 2026, describing a wikitext-2 test of 100 chunks at 512 context against a locally built Q8_0 reference with perplexity 6.7500. Its table lists unsloth UD-IQ2_XXS at 8.39 GiB with perplexity 7.6528, mean KLD 0.146, median KLD 0.076 and 82.98% top-1 agreement; bartowski IQ2_XXS at 8.75 GiB with perplexity 8.5352, mean KLD 0.301, median 0.162 and 76.53%; stock IQ1_M at 7.33 GiB with mean KLD 0.659; and stock IQ1_S at 6.88 GiB with mean KLD 0.896.

これは比較にとって重要だ。なぜなら「7.3 GBのIQ2_XXSビルド」が何を指すかが変わるからだ。Prism MLの数値は、ベースモデルを重みあたり2.2ビットで同社自身が量子化したものに由来する。同じファミリーのunsloth dynamicビルドは8.39 GiB。bartowskiビルドは8.75 GiB。したがって、Bonsaiと「IQ2_XXS」のサイズ差は、どのビルドを指すかによって1.4倍から1.5倍の間のどこかになり、見出しが示唆する1.23倍より大きく、しかもその差はすべて品質比較が始まる前に存在している。

ポストトレーニングビルドがどこで壊れるのか、そしてなぜそれを見逃しやすいのか

8.7ポイントという総合的な差は、この違いを述べるうえで最も情報量の少ない方法だ。というのも、IQ2_XXSビルドにおける劣化は一様ではないからだ。それは選択的であり、そのパターンはほとんどの人が予想するものとは正反対だ。

• MMLU-Redux — ポストトレーニングビルドは、80点台中盤から後半で、まずまず健闘している

• GPQA Diamond — 約65.5、ターナリビルドの85.76に対して

• AIME26 — ビルドによって57.5~78.6の範囲で、三値ビルドの95.83に対して

• LiveCodeBench — 56.4~70.05の範囲で、三値ビルドの90.07に対して

正確なIQ2の数値はPrism MLのスイートとコミュニティ測定の間で変動し、上記の範囲はその両方にまたがるが、あらゆる情報源を通じて傾向は一貫している。つまり、表面的な知識は残り、持続的な推論の連鎖を必要とするものは急激に劣化する。まさにそれこそ、何気ないテストでは見つからない失敗モードである。2ビットビルドに文書の要約や事実に関する質問への回答を頼むと、はるかに大きなモデルのように振る舞う。多段階の導出を保持したり、非自明なコードを生成したりするように頼むと、崩壊は段階的ではなく突然起きる。これが、「試したときは問題なく感じた」が量子化モデルについての証拠にはならない理由である——それは、たまたまあなたが試したプロンプトについての証拠なのである。

三値ビルドは、同じベンチマークではその崩壊を示さない。Prism ML は、AIME26 でフル精度ベースの 94.58 に対して 95.83、LiveCodeBench で 90.05 に対して 90.07 —— 実質同等と報告しており、これはこのリリースで最も有用な主張である。なぜなら、訓練時の制約が、訓練後の制約が失うものを得たと述べているからだ。

現実に存在し、品質表には捉えられていない反論

上記のすべては、バイトあたりの品質において三値ビルドに軍配を上げている。ただ一つの面では、従来の GGUF が完全に優位に立っており、それは小さな点ではない。すでに手元にあるソフトウェアで動作するのだ。

IQ2_XXSビルドのQwen3.8-27Bは、標準的なllama.cppのアーティファクトです。これはllama.cpp、Ollama、LM Studio、Jan、およびggmlをリンクするその他すべてで、ggmlがサポートするすべてのプラットフォーム上で、フォークを必要とせず、特別なカーネルもなしに読み込まれます。その重要度行列は再構築または置換できます。ディスク上にある他のすべての量子化モデルと同じように動作します。

Ternary Bonsai 2 27B はそうではない。このアーキテクチャのハイブリッドアテンション向けの三値カーネルは、Prism ML 独自の llama.cpp フォークに存在する。素の llama.cpp は PTQ1_0 と PQ2_0 を未認識の型として拒否し、それらのパックが前提とする回転基底の扱い方も分からない。Apple Silicon 向けの MLX ビルドには Metal と CPU のカーネルはあるが CUDA パスがないため、NVIDIA マシンでは数分かかりうる CPU フォワードパスにフォールバックする。Prism ML は複数のランタイムとの統合を確かに列挙しているが、根本的な点は変わらない。このモデルの使いやすさは、選んだランタイムがこのモデルについて教えられているかどうかによって制約される。

それが正直なトレードオフだ。あなたは、1.4倍大きく、まさに27Bモデルに最も求めているであろうタスクで測定可能なほど性能が劣り、しかも普遍的に実行できるビルドと、より小さくより優れた、現時点では1つのラボのフォークとそれを採用したランタイム分にすぎないエコシステム上のビルドの間で選んでいる。

A screenshot of Prism ML's launch post for Bonsai 2 27B dated September 17 2026, showing the headline 'PrismML Launches Bonsai 2 27B, Its Most Capable Model Yet' and the paragraphs stating the model is based on Qwen3.8 27B, reduces memory footprint by more than 9x at 5.9 GB, and that the original Ternary Bonsai 27B retained 95% of its full-precision counterpart's aggregate benchmark performance while the new model retains over 98%.

どちらか一方を実行するために必要なもの

メモリの計算は、ファイルサイズが示唆するよりも僅差だ。なぜなら、VRAM に入っているのはファイルだけではないからだ。

• IQ2_XXS ビルド — 重みが 8.39~8.75 GiB で、16 GB のカード上にコンテキストとドラフトモデル用としておよそ 7.5 GB の空きが残ります。上記の独立したテストでは、8.39 GiB のビルドでもすでに 2.1 GB のドラフトモデルを併用できることが具体的に指摘されています。

• Ternary Bonsai 2 27B — PTQ1_0 言語モデルで 5.93 GB、画像を少しでも使うなら 0.63 GB のビジョンタワーも加わり、さらにコンテキストも必要。Prism ML の PQ2_0 パッキングは 7.25 GB かかり、帯域幅ではなく命令スループットによって制限されるハードウェアではより高速な選択肢です。

速度面では、報告されている三値の数値は、RTX 5090でデコード142.5 tok/s、Apple M5 Maxで46.8 tok/sです。IQ2ビルドに関する第三者による報告はより乏しく、デュアルRadeonカードでのVulkan測定では生成が約3.8 tok/sですが、この数値は量子化よりもその特定のバックエンドについて多くを語っています。双方のスループット数値は、強くハードウェア依存として扱ってください。

OrcaRouterが適する場面と、適さない場面

これらのファイルはいずれも、ルーターが配信するものではありません。これらはローカルな成果物であり、正直に言えばOrcaRouterはどちらもホストしていません——これは、あなた自身のハードウェア上で何が動作するかについての比較です。私たちの側にあるのは、両者の派生元となったモデルです。Qwen3.8-27Bのフル精度版はOrcaRouter自身のインフラストラクチャを通じて利用可能で、100万入力トークンあたり$0.33、100万出力トークンあたり$2.40、モデル本来の262Kコンテキストとlow/medium/highの推論エフォート制御もそのまま維持されています。

それは、具体的に述べておく価値のあるハイブリッド構成をもたらす。得意なタスクには圧縮ビルドをローカルで実行し、完全な精度を必要とするたまのリクエストは、同じキーを通してホスト型ベースモデルにルーティングする。2つ目のベンダー契約は不要で、コード変更も不要だ。両者が同じ API を話すからだ。ローカルビルドが特定のワークロードに適していないと判明した場合、失敗したリクエストは自動的にフェイルオーバーされる可能性がある。エラーとして返されるのではなく、これは、量子化が不適切であることを本番環境で発見するよりも安価に発見できる方法である。

短いバージョン

• 公表されたバイトあたりの品質では、三値ビルドが明らかに勝利しており、その優位は推論とコードに集中している — ポストトレーニングビルドが最も劣化するカテゴリにおいてである。

• ポータビリティに関しても、IQ2_XXS ビルドが同じくらい明確に優位に立つ。どこでも標準のランタイム、フォークなし、特別なカーネルなし、無言でゴミを出力するような失敗モードもない。

• 比較すべきは「1.76ビット 対 2.2ビット」ではない。「学習中に選ばれる表現 対 後から当てはめられる表現」であり、0.44ビットの差は、それに比べれば丸め誤差にすぎない。

• この記事における三値ビルドの品質指標はすべて、Prism ML が自ら選んだスイート上で Prism ML 自身が測定したものです。IQ2 ビルドの KLD 結果は独立した単一実行によるもので、1 つのベースモデルと 1 つのテストセットに固有のものです。これらはこの比較における最も強力な第三者による証拠ですが、Bonsai については何も述べていません。

その差は逆方向からも、おそらく間もなく埋まるだろう。三値カーネルがllama.cppのアップストリームに入れば、Bonsaiに対する唯一の重大な反論は消え去り、選択は単純明快になる。それまでは、IQ2_XXSビルドが、その出来の良さとは何の関係もない確かな優位性を保ち続ける。

A screenshot of OrcaRouter's model page for Qwen3.8-27B, showing the qwen/qwen3.8-27b identifier attributed to Qwen and dated 2026-08-13, a 262K token context with text, image and video input and text output, input pricing of $0.33 and output pricing of $2.40 per million tokens, a p50 time to first token of 4.80 seconds over seven days, and a description stating the model is self-hosted on OrcaRouter's own infrastructure.

今週中に決めるなら、白黒つけるテストは半日でできる。自分の業務から、複数段階の推論を要するプロンプトを20件取り出し、両方のビルドを実行して、回答をブラインドで採点する。公開されている表は、どこを見ればよいかを教えてくれる。だが、あなたの仕事がそこに当てはまるかどうかまでは教えてくれない。