
Bonsai vs Ternary Bonsai 2 27B:二つの低ビットの賭け、二つの異なる物差し
- openaiNEWOpenAI: GPT-6 Luna2026-09-2237知能
- openaiNEWOpenAI: GPT-6 Sol2026-09-2248知能
- anthropicNEWAnthropic: Claude Opus 5.52026-09-2258知能
- grokNEWGrok 4.72026-09-2146知能
- OrcaNEWOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 100万トークンあたり
- orcaNEWOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 100万トークンあたり
- deepseekNEWDeepSeek: DeepSeek V4.1 Flash2026-09-1040知能
- openaiOpenAI: GPT-6 Astra2026-09-0453知能77コーディング
- googleGoogle: Gemini 3.8 Flash2026-09-0241知能76コーディング
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245知能76コーディング
- anthropicAnthropic: Claude Fable 5.12026-09-0153知能82コーディング
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 100万トークンあたり
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642知能72コーディング
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 100万トークンあたり
- z-aiZ.ai: GLM 5.32026-08-1845知能75コーディング
- obsidianQwen3.8 27B2026-08-1534知能68コーディング
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236知能69コーディング
- grokSpaceXAI: Grok 4.62026-08-1244知能77コーディング
- metaMeta: Muse Spark 1.22026-08-0540知能72コーディング
- qwenQwen: Qwen3.8 Max2026-08-0345知能76コーディング
1-bit Bonsai 2B の視覚言語モデルを Ternary Bonsai 2 27B の隣に置くと、明白な比較——20億パラメータ対270億パラメータ、言語重み 0.43 GB 対 5.93 GB——は、このペアについて最も興味深い点ではありません。興味深いのは、同じベンダー、同じ圧縮プログラムによるこの2つのモデルが、品質を同じ方法で報告していないことです。Ternary Bonsai 2 27B が報告するのは保持率です。つまり、フル精度版の総合ベンチマーク性能の98%超を、それ自身を基準に測定して維持しています。1-bit Bonsai 2B が報告するのは比較です。4ビット量子化された Qwen 3 1.7B モデルに対して「比較可能なベンチマーク結果」を達成したというもので、別の精度の他社モデルを基準に測定されています。一方は、どれだけ失われたかについての記述です。もう一方は、どれだけ対抗できるかについての記述です。どちらも、それぞれのモデルが絶対的な意味でどれほど優れているかについての記述ではなく、この2つを同じ尺度で読むことはできません。
その区別はパラメータ数よりも重要だ。ベンダーの数値から実際に何を結論できるかを決めるからであり、これまでに公表された証拠に基づくなら、正直な答えは見出しの数字が示唆するよりも少ない。
二つの品質主張、二つの異なる基準
Ternary Bonsai 2 27Bは2026年9月17日にリリースされた、Qwen3.8-27Bを三値 {−1, 0, +1} で再構築したもので、重みあたり実効1.76ビットであり、PrismMLが前面に押し出す数字は、フル精度モデルの総合ベンチマーク性能の98%超を保持しているというものだ。これは保持率の主張であり、保持率の主張は構造上自己言及的である。つまり、圧縮後に元のどれだけが生き残ったかを語るのであって、元がどの位置にあったかを語るのではない。凡庸なベースラインの98%を保持するモデルは依然として凡庸なモデルであり、Qwen3.8-27Bは凡庸ではない — しかし数字だけではそのことは分からず、またベースモデルをまたいで比較することもできない。
2026年9月23日にSnapdragon AR1 Gen 1グラスプラットフォーム向けに発表された1ビットBonsai 2B視覚言語モデルは、1.7Bの1ビット言語モデルと0.3Bの4ビット視覚エンコーダーで構成されている。公表されている品質に関する説明は、種類が異なる。PrismMLは、BFCL v3、HumanEval+、MMLU Redux、IFEval、IFBench、MuSR、GSM8K、GPQA Diamondにわたって、4ビット量子化のQwen 3 1.7Bモデルと比較評価し、2つの構成が同等の結果を達成したと報告した。それは外部ベースラインに対する同等性の主張である。それは、その圧縮によって、そうでなければ使っていたであろう4ビット経路に対して明らかな犠牲が生じたわけではない、と言っている——これはデバイスクラスのリリースにとってまさに適切な問いであり、「このモデルは良い」という主張よりはるかに弱い主張だ。
つまり、98.2%が「comparative」を上回るという読み方も、その逆も成り立たない。それらは、同じベンダーが、二つの異なるスイート上で、二つの異なる参照基準に対して行った、二つの異なる問いへの答えである。これら二つの文を根拠にこの二つのモデルを順位付けする人は、文を順位付けしているだけだ。
ベースモデルはそれぞれ異なる場所から来ています
2つ目の構造的な違いがあり、それは今後1年で重要になるものだ。Ternary Bonsai 2 27Bは外部モデル、AlibabaのQwen3.8-27Bを再圧縮したものだ。その品質の上限は他社のリリーススケジュールによって決まり、世代更新の周期もPrismMLではなくQwenのそれに追随する。Qwenが新しい27Bをリリースすると、Bonsai 27Bラインには新たな入力が入り、保持率は新しいベースラインに対して再計算される。
1-bit Bonsai 2Bは、PrismML自身のBonsai 1.7Bを基盤としている。その上限は社内で設定され、更新サイクルはPrismMLが選ぶもので、改善は上流モデルの交換からではなく、圧縮レシピとカーネル経路からもたらされる。これは別種の資産だ。素の能力の向上は遅く、完全にベンダーの管理下にあり、そして——グラス製品のリリースが示すように——一般的な再圧縮にはできない形で、特定のアクセラレータ向けにチューニングできる。
どちらも正当な戦略です。両者は置き換え可能なものではなく、どちらを求めるかは、あなたのロードマップがQwenのものに紐づいているのか、それともデバイスに紐づいているのかによって決まります。

仕様の対比を、一行ずつ
• パラメータ — グラスモデルには 1.7B の 1ビット LLM と 0.3B の 4ビット視覚エンコーダを搭載し、それに対するのが Ternary Bonsai 2 27B の Qwen3.8-27B から派生した 27B クラスのモデルです。
• 表現形式 — 眼鏡モデルでは FP16 グループ単位スケーリングを用いたバイナリ {−1, +1}、27B では同じスケーリングを用いた三値 {−1, 0, +1} で、重みあたり実効 1.76 ビット。
• 言語モデルの重み — 1ビットの1.7Bでは0.43 GB、これに対してTernary Bonsai 2 27BのPTQ1_0パッキングでは5.93 GB、さらに7.25 GBのPQ2_0パッキングも利用可能です。
• コンテキスト — グラスモデルでは1,024トークン、それに対し Ternary Bonsai 2 27B ではフル262,000トークンのコンテキスト。
• アクセラレータ — 1ビットカーネルをサポートする QNN SDK 経由の Qualcomm Hexagon NPU、そして MLX 経由の Apple シリコンや CUDA 経由の NVIDIA との比較。
• 品質主張 — 4ビットQwen 3 1.7Bに対する「比較ベンチマーク結果」、フル精度Qwen3.8-27Bベースラインの「98%超」の保持率に対する。両方ともベンダー報告であり、どちらも独立に再現されておらず、異なるスイートで測定されている。
• ランタイム — グラス用モデル向けのQualcomm NPUツールチェーン。PrismML自身のllama.cppフォークと、27B向けのMLXコンテナに対抗するもので、後者はいずれも素のllama.cppではサポートされていない。

各ケースで低ビットの賭けがもたらすもの
圧縮の思想は両モデルで同じであり、それには名前を付ける価値がある。なぜなら、それがこのファミリーの実際のテーゼだからだ。低ビット表現はエンドツーエンドで走る——埋め込み、アテンション、MLP、LMヘッド——FP16のグループ単位スケーリングを用い、より高精度な逃げ道はない。どちらのモデルも、量子化が難しい部分のために浮動小数点の安全網を残していない。これはほとんどの量子化研究が取るよりも攻撃的な立場であり、重みあたり1.76ビットと0.43 GBの重みをそもそも可能にしているものだ。
賭けが報われる形はそれぞれ異なる。Ternary Bonsai 2 27B では、すでに所有しているハードウェア上でのバイトあたりの性能がその見返りだ。5.93 GB に収まる 27B クラスのモデルが、ノート PC やスマートフォンで、ベースラインの 98% で動作する。1-bit Bonsai 2B では、これまで選択肢がなかったデバイスクラスでの存在そのものが見返りだ。0.43 GB の言語重みに収まるマルチモーダルモデルが、NPU 上で毎秒 15.36 トークンを処理する。前者は、すでに動作していたものの改良版だ。後者は、以前は動作しなかったものだ。
階層の境界がどこに位置するか
これら二つは代替案ではなく、一対一の対決として扱うと、両リリースが示しているデプロイ形態を見落としてしまう。グラスやウェアラブル製品は、ほかに収まるものがないから2Bをローカルで動かす。ノートPCやスマホ製品は、それが可能だから27Bを動かす。製品が両方にまたがった瞬間——グラスとペアリングするスマホアプリ、オンデバイスアシスタントを備えたノートPCアプリ——問いはどのモデルかではなく、各ティアがどのリクエストに応答を許されるかになる。
その境界は、アプリケーションコードではなく設定に置く価値がある。どちらのティアも動くからだ。27BのラインはQwenが出荷されれば動き、2BのラインはPrismMLがレシピを変えれば動き、コンテキスト長や能力に関するハードコードされたルールは、そのどちらの出来事でも破綻する。ローカルティアの予算を超えるリクエストをホスト型モデルへエスカレーションするルーティングポリシーなら、どちらの変化にも耐えられる。ローカルティアは、クライアント全体に張り巡らされた前提ではなく、複数あるうちの一つのティアであり続ける。OrcaRouterは、そのエスカレーションを行うレイヤーだ — 200以上のホスト型モデルにまたがる単一のエンドポイントで、フェイルオーバーも込み、ポリシーは設定として表現される。Bonsaiはどちらもここではルーティングされない。どちらもローカルへのダウンロードだ。ここにあるのは、その上のティアであり、1,024トークンのローカルモデルでは、そのティアが作業の大半を担うことになる。

それを解決するものは何だろう
3つの測定値があれば、この2つは2つのマーケティング上の主張から比較へと変わる。「比較結果」という一行の裏にあるベンチマークごとの内訳——そうすれば4-bitに対するトレードオフが要約されるのではなく可視化される。1-bit Bonsai 2Bについて、自身のフル精度ベースラインに対する保持率——PrismMLが27Bラインで用いながらここでは公表しなかった測定値。そして、どちらか一方のモデルの独立した評価。現在、両リリースのあらゆる数値がベンダー由来だからだ。
それらのいずれかが存在するまでは、擁護できる立場は数字が実際に裏付けている立場だ。Ternary Bonsai 2 27B は大差で優れたモデルであり、1-bit Bonsai 2B は、それが作られたデバイス上で動作する、両者のうち唯一のものである。この2つの記述は矛盾しておらず、同じベンダーが異なる物差しでそれらを測定したという事実こそ、次にこれらの数値のどれかがそのベースラインなしで引用されるときに覚えておく価値がある。
