
スマートグラス上のBonsai:Snapdragon AR1 Gen 1で動作する2B 1ビットVLM
- typesafeNEWTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 100万トークンあたり · 36 tok/s
- openaiNEWOpenAI: GPT-6 Luna2026-09-2237知能
- openaiNEWOpenAI: GPT-6 Sol2026-09-2248知能
- anthropicNEWAnthropic: Claude Opus 5.52026-09-2258知能
- grokNEWGrok 4.72026-09-2146知能
- OrcaNEWOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 100万トークンあたり · 182 tok/s
- orcaNEWOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 100万トークンあたり · 1277 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040知能
- openaiOpenAI: GPT-6 Astra2026-09-0453知能77コーディング
- googleGoogle: Gemini 3.8 Flash2026-09-0241知能76コーディング
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245知能76コーディング
- anthropicAnthropic: Claude Fable 5.12026-09-0153知能82コーディング
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 100万トークンあたり · 110 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642知能72コーディング
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 100万トークンあたり · 221 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845知能75コーディング
- obsidianQwen3.8 27B2026-08-1534知能68コーディング
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236知能69コーディング
- grokSpaceXAI: Grok 4.62026-08-1244知能77コーディング
- metaMeta: Muse Spark 1.22026-08-0540知能72コーディング
この発表が実際に何に向いているかを決める数字は4倍ではなく、2倍でもない。それは1,024 — PrismMLが2026年9月23日のSnapdragon Summitでスマートグラスに搭載したモデルのコンテキスト長だ。1-bit Bonsai 2B vision-language modelは、Bonsai 1.7Bを基に構築された20億パラメータのシステムで、Snapdragon AR1 Gen 1 Platformを搭載したAIスマートグラス上でローカルに動作する。PrismMLが前面に押し出す数値はメモリと速度だ。LLMの重みは0.43 GBで、対応する4-bit 1.7Bモデルの1.66 GBに対して3.83倍の削減。毎秒15.36トークンで、7.44に対して2.06倍の改善。どちらの数値もベンダー自身によるもので、どちらも4 GBのテストプラットフォームで測定され、どちらもQwen 3 1.7B 4-bitモデルと比較したものだ。Bonsai 27Bとは比較しておらず、ホストされたものとも比較していない。これをBonsaiの品質に関する主張として読むのは誤りであり、グラス級のメモリ予算に何が収まるかに関する主張として読むのが正しい。
発表された内容をひとまとめに
PrismMLの発表は——パサデナ発、QualcommのSnapdragon Summitに関連づけられたものだが——20億パラメータの視覚言語モデルをAR1 Gen 1グラスプラットフォーム上に載せるものだ。その構成は、1.7Bの1ビット言語モデルと0.3Bの4ビット視覚エンコーダで、コンテキスト長は1,024トークン。PrismMLのBonsai 1.7Bを基盤としているため、新しいアーキテクチャではなくBonsaiファミリーの最小側に位置し、1ビットカーネルをサポートする社内製QNN SDKを用いてQualcomm Hexagon NPU向けにコンパイルされている。
見出しの主張は、販売元が述べているとおり:
• 一部のメガネ型フォームファクタでは、同じメモリ制約内で4倍のパラメータ数を持つモデルを収められる。
• 4ビット精度の同じモデルとほぼ同等の知能を、約4分の1のメモリ使用量で実現します。
• 2倍以上の速度でトークンを生成します。
その3つの文が発表のすべてだ。メモリと速度に関する主張の根拠となる具体的な測定値は、0.43 GB 対 1.66 GB、および毎秒 15.36 トークン対 7.44 トークンであり、いずれも 4 GB のメモリを搭載したプラットフォーム上でのものだ。AR1 Gen 1 自体は、ピーク 6 TOPS および 1 サイクルあたり 2,304 MACs と記載されている——これはプラットフォームに関する数値であり、言語モデル推論に関する数値ではない。この区別は、発表自体の数値がトークン毎秒を別途示していることから明らかだ。

4xはメモリに関する主張であり、ベースラインは別のモデルです
ここは立ち止まって考える価値がある部分だ。というのも、「4x」は、それが登場した文以上に独り歩きする類の数字だからだ。PrismMLがグラスモデル向けに公表した比較はすべて、Qwen 3 1.7Bの4ビット量子化との比較だ — 同じパラメータクラス、同じ用途、異なる量子化。これは正当で有用な比較だ。グラスOEMが実際に直面する比較であり、そこでの問いは、1ビットの経路がカーネル作業に見合うだけのメモリを取り戻せるかどうかにある。これはBonsaiの4ビット版との比較ではなく、どこか別の場所で動いているより大きなBonsaiとの比較でもない。
発表に添えられたベンチマーク脚注も、同じように慎重だ。PrismMLは2026年9月に、Bonsai 1.7B 1-bit LLMをQwen 3 1.7B 4-bitモデルと、BFCL v3、HumanEval+、MMLU Redux、IFEval、IFBench、MuSR、GSM8K、GPQA Diamondにわたって評価し、報告された結果は、2つの構成が「比較可能なベンチマーク結果を達成した」というものだ。比較可能であって、優れているわけではない。発表にはベンチマークごとのスコアはなく、そのいずれについても独立した再現もない。これは発売週のエッジリリースとしては普通のことだが、まさにそのために、PrismMLの外部の誰かがそれらを実行するまでは、数値はベンダー報告として扱うべきなのである。
1,024トークンは製品を形作る仕様です
メガネ上の視覚言語モデルは、チャットウィンドウ内の視覚言語モデルとは異なるワークロードであり、コンテキスト長にそれが表れる。1,024トークンでは、モデルは短い指示とカメラが現在見ているものを保持できる。会話履歴、ドキュメント、または以前のターンの長い連鎖を保持することはできない。それはリリースの欠陥ではない — リリースを可能にした制約なのだ。なぜなら、KVキャッシュとアクティベーションは重みと同じ4GB内に存在しなければならず、262Kトークンのコンテキストを持つ27Bクラスのモデルは、その状態のために桁違いに多くのスペースを必要とするからだ。
つまり、実際に出荷されたものについて正直に言えば、完全にデバイス上で動作する、有能な短いコンテキストのアシスタントだ。メガネ型のタスク——これを見分け、あれを読み、目の前の看板を翻訳し、自分が見ているものについての質問に答える——は1,024トークン以内に収まる。直近10分間を覚えておく必要があるものは収まらないし、どれだけ1ビット圧縮を施してもそれは変わらない。なぜなら、限界は状態にあり、重みにあるのではないからだ。
エッジエコシステムがそこから学ぶべきこと
この発表で真に新しいエンジニアリングは、モデルではない。それはカーネルパスだ。1ビットカーネルをサポートするQNN SDKを通じて、Hexagon NPU向けにコンパイルされた1ビットLLMである。低ビット重みは以前からCPUやGPUで実行可能であり、PrismML自身のBonsai 27BリリースがAppleシリコンおよびNVIDIAハードウェアでそれを実証した。バイナリ重みカーネルをモバイルNPU上で動かすことは別問題である。というのも、アクセラレータのデータパス、パッキング形式、スケジューリングのすべてが、浮動小数点型ですらない表現に対応しなければならないからだ。
もしその道筋がこの1つのモデルを超えて一般化するなら——そしてSDKの文言はPrismMLがそう意図していることを示唆している——興味深い帰結は、1ビットファミリーがラップトップとスマートフォンの話ではなくなり、常時オンのデバイスの話になるということだ。発表にある4 GBのプラットフォームが現在の上限だ。一定の品質で重みのフットプリントを下げるものは何であれ、その上限の下に収まるモデルのサイズを引き上げる。

オンデバイスという主張には、ひとつ留保を付しておくべきだ。
メガネ上での完全ローカルなマルチモーダル推論は強い主張であり、実証されていることと示唆されていることを切り分ける価値がある。AR1 Gen 1は、常時オンのセンシングとオーディオ向けに作られたメガネ向けプラットフォームだ。Qualcomm自身によるオンデバイス言語モデルの位置づけは概してハイブリッドで、デバイスが処理できるものはデバイスで処理し、残りはペアリングされたスマートフォンやクラウドに渡すというものだった。Qualcommが初めて公にしたオンデバイス小型言語モデルのデモは、AR1 Gen 1ではなくAR1+ Gen 1プラットフォームに結びついていた。どちらの点もPrismMLの発表と矛盾しない——発表ではモデルはAR1 Gen 1上でローカルに動作するとされており、ベンダー自身のスループットとメモリの数値は、小型モデルがまさにそうしていることと整合する——が、これらの点は、これに基づいて作られる実用的な製品が、他の何とも一切通信しないデバイスではなく、ほぼ確実にローカル層とエスカレーション経路を備えたものになることを意味している。
いずれにせよ、それが正しいアーキテクチャだ。1,024トークンのローカルモデルは、1,024トークンに収まるリクエストはとても得意だが、収まらないものには答えられない。
エスカレーション・パスが属する場所
このようなリリースに取り組む人にとって、設計上の問いは、グラスモデルが優れているかどうかではなく、対応できないリクエストがどうなるかである。アプリケーションコードで答えるなら、それは、オンデバイスモデルがサイズやコンテキストを変更するたびに書き直さなければならない特別なケースの山になる。ルーティングポリシーとして答えるなら、それは1つのルールになる。ローカル層のコンテキスト予算を超えるリクエスト、あるいはローカル層が持たないツールや推論を必要とするリクエストは、ホストされたモデルにエスカレーションされる。そのポリシーこそ、OrcaRouterが存在する理由である— 200以上のホストされたモデルの前にある1つのエンドポイント、フェイルオーバー、そしてクライアントではなく設定で表現されるポリシー。Bonsai自体はここではルーティングされない。それは自分のハードウェアで実行するダウンロードである。ルーティング層がカバーするのはその上の境界であり、その境界こそ、グラス展開がエンジニアリング時間の大部分を費やす場所である。

次に見るもの
この発表をプラットフォームへと押し上げるには、3つのことが必要だ。「比較結果」の行の背後にあるベンチマーク別の内訳があれば、4ビットとのトレードオフが要約されるだけでなく可視化される。同じNPU経路上でのより大きなコンテキストウィンドウは、重みの問題ではなく状態メモリの問題であり、したがって2つの中ではより難しい方だ。そして、1ビットの1.7B LLMを4ビット版と比較する独立評価だ。というのも、このリリースのすべての数値は現時点では、それを作った当事者から出ているからだ。
それまでは、正確な要約は限定的で有用だ。20億パラメータのマルチモーダルモデルが、言語ウェイト0.43 GBで、4ビット相当のものと比べて約2倍の速度と約4分の1のメモリで、1,024トークンのコンテキスト予算のもと、メガネクラスのデバイス上で動作するようになった。これはオンデバイス推論にとっては確かな一歩であり、モデル能力にとっては小さな一歩であり、両者は同じ主張ではない。
