Perceptron Mk1.5 と Qwen 3.8 の比較用に生成されたタイトルカード。大見出しは「Perceptron Mk1.5 vs Qwen 3.8」、副見出しは「目とプランナーは同じモデルではない」、3枚のカードには「Mk1.5: 36,864トークン、座標を出力」「Qwen 3.8: 2.4T MoE、AA Index 40」「継ぎ目:フレームは一方へ、プランはもう一方へ」と記され、脚注は「Qwen 3.8 のインデックスは Artificial Analysis による。」
Guides & Insights

Perceptron Mk1.5 対 Qwen 3.8:ロボットには両方が必要であり、どちらも代替にはならない

著者

Elias Hawthorne

公開日

最新モデル · 20すべてのモデルを見る →
ベンチマーク:Artificial Analysis · 毎日更新
すべての記事に戻る

ロボットが何かをつかみ上げるには、モデルから2つのものを受け取る必要があり、この組み合わせの中にその両方を与えてくれる単一のモデルは存在しない。Perceptron Mk1.5は幾何情報を返す。動画フレームを与えれば、点、ボックス、ポリゴン、あるいはタイムスタンプ付きの<track>要素を返すことができ、そのコンテキストウィンドウは36,864トークンだ。Qwen 3.8 ——ベンダーのオープンウェイトであるQwen3.8-2.4T-A95Bコアを指す名前——は、2.4兆パラメータのmixture-of-experts推論モデルで、ネイティブの262Kウィンドウが100万トークンに向けて拡張され、しかもテキスト専用であるため、フレームをまったく見ることができない。一方は知覚レイヤーで、100万トークンあたり$0.15と$1.50かかる。もう一方は推論コアで、入力はおよそ13倍、出力は4倍のコストがかかり、Artificial Analysis Intelligence Indexで独立したスコア40を持つのに対し、知覚モデルのほうにはどこにも独立したスコアが存在しない。

競合製品として並べてみると、両者は互いに逆の方向で相手に劣り、その比較からは使えるものは何も出てこない。一つのパイプラインの両半分として並べてみると、両者は身体性スタックにおけるコストと信頼性のほぼすべての判断を説明してくれる。フレームがどこで解釈されるのか、計画がどこで作られるのか、そして推論を担う半分がタスクに必要な量を超えるトークンを書き込むと、請求額がどうなるのか。

この組み合わせを理にかなったものにする分割

Perceptron Mk1.5は、Perceptron Mk1の後継として2026年9月25日に出荷され、その役割は狭く定義されている。テキスト、画像、動画、音声を受け取り、テキストと任意の構造化アノテーション(点、バウンディングボックス、ポリゴン、クリップ、トラック)を返す。<track>出力は空間的な観測とそれが属するタイムスタンプの両方を保持するため、60秒のクリップは1つの平均的な推測ではなく、時間に沿った位置として返される。asset_idxフィールドにより、1つのリクエストで複数の画像や動画を個別に指定でき、これが参照フレーム対ライブフレームの比較に必要なものである。制約付き応答にはJSON Schemaとregexの2種類があり、どちらの要点も出力が型付けされることにある。

Qwen 3.8 は正反対の種類の道具である。2.4T コアは細粒度の MoE であり、92 層、1 層あたり 512 エキスパート(ルーティングされる 10 個+共有 1 個)、そしてその 92 層のうち 69 層が線形アテンションである。これが、これほど大規模なアーキテクチャが長いコンテキストを実現する方法である。強みは大量のテキストにまたがる推論、すなわち複雑な多段階分析、長い導出、エージェント型計画である。不得意なのは入力側である。オープンなコアはテキストのみで、その推論をオフにはできない。望むかどうかに関係なく、すべての応答は思考ブロックで始まる。

それは推論モデルの欠陥ではなく、知覚モデルにおける欠陥であり、Qwen 3.8 は知覚モデルではない。二つを順に並べれば、全体像は明らかだ — Mk1.5 は「フォークリフトはどこにあり、いつ動いたのか」に答え、Qwen 3.8 は「それを踏まえて、アームは何をすべきか」に答える。どちらの問いも、もう一方のモデルには答えられない。

A generated two-column scoreboard titled 'Perceptron Mk1.5 vs Qwen 3.8 - the scoreboard', comparing six dimensions: role in a stack (perception, frames to geometry vs reasoning, text to plans); scale (hosted perception API vs 2.4T total / 95B active MoE); context (36,864 tokens vs 262K native, to roughly 1M); input (text, image, video, audio vs text only on the open core); price ($0.15 in / $1.50 out per 1M tokens vs $2.00 in / $6.00 out); and independent score ('none yet' vs AA Index 40 of 115). Footnoted that the Qwen 3.8 index is per Artificial Analysis and that all Mk1.5 figures are vendor-reported.

それぞれの半分にかかる費用を、実際に請求される料金で

• 入力 — Perceptron Mk1.5 は100万トークンあたり$0.15。Qwen 3.8 は、独立したハーネスが計測するホスト版で100万トークンあたり$2.00で、88%のキャッシュ割引が適用され、キャッシュヒットはおよそ$0.24になる。

• 出力 — Mk1.5 100万あたり$1.50。Qwen 3.8 100万あたり$6.00。

• キャッシュ — Mk1.5 のキャッシュ済み入力は100万あたり $0.0375 で、標準入力料金のちょうど4分の1です。Qwen 3.8 の割引は割合ベースですがより大きく、88% なので、キャッシュ済み料金は絶対額では二者のうち安い方であり、非キャッシュ料金は Mk1.5 の10倍以上です。

• 完了したタスクあたりのコスト — ここで順位が逆転する。Artificial Analysisは、Qwen 3.8のIntelligence Indexタスクあたりのコストを2.16ドルと算出しており、同クラス115中32位、コスト評価は4段階中4としている — トークンは高価なのに、完了したタスクあたりでは安い。というのも、このモデルはインデックスの実行全体で1億7000万出力トークンを生成したのに対し、競合他社はさらに長々と出力するからだ。Mk1.5には、誰も公表していない同等の数値がない。

• コンテキスト — Mk1.5は36,864トークン、これに対しQwenコアはネイティブで262K、適切なサービング構成なら100万まで拡張可能。

• 推論の制御 — Mk1.5 は reasoning_effort を high、medium、low、minimal、none として公開しており、デフォルトは high です。Qwen 3.8 は思考を常にオンに固定しているため、呼び出しのたびに思考トークン分のコストを支払うことになります。

そのリストを2回読んでください。2つのモデルはコストの点で逆転しているからです。トークンあたりでは、Mk1.5 は劇的に安いです。独立したベンチマークでの完了したタスクあたりでは、Qwen 3.8 は安いと測定されており、Mk1.5 は未測定です。これら2つの記述が矛盾するのは、両者が同じジョブを実行していると仮定した場合だけであり、実際はそうではありません。

A screenshot of the Perceptron documentation model card for perceptron-mk1.5, showing the Specifications table (model ID perceptron-mk1.5, context window 36,864 tokens, maximum output 8,192 tokens, input modalities text, images, video, audio, audio formats WAV, MP3 and FLAC, an audio limit of 16,384 audio tokens per item, reasoning via reasoning_effort, function calling on chat completions, and constrained JSON Schema and regex responses) and the Pricing table below it (input $0.15, output $1.50, cached input $0.0375 per million tokens).

ここでは証拠は逆の方向を示している

このバッチの比較の大半では、オープンウェイト側こそがベンダー申告の数値を山のように積み上げた側で、クローズドAPI側こそが第三者のページを持つ側だ。ここではそれが逆になっており、この逆転は、何を検証できて何を検証できないかを変えるからこそ、正確に述べておく価値がある。

Qwen 3.8には独立した測定結果がある。Artificial Analysis Intelligence Indexは、2.4Tコアを40と評価しており、執筆時点で同クラス115モデル中5位、出力速度は毎秒39.6トークン——115中56位で、中位に位置する。これは、それを中心に対話型ループを計画する前に知っておく価値がある。Indexの改訂はスナップショット間で動くため、これらの数値を誠実に読むなら方向性を示すものとして扱うべきだが、要点は変わらない。Alibabaの外部の誰かがこのモデルを実行し、数値を公表したのだ。

Perceptron Mk1.5にはそんなものはない。Artificial Analysisの登録も、Mk1.5やその前身についてのアリーナスコアも存在しない。したがって、現存するあらゆる能力指標は、Perceptronが自社モデルについて作成したものである。その数値群は異常に具体的で、それは利点ではある——ベンダー自身の実行で、egocentric hand_boxでは0.9433、これに対するGemini 3.1 Proは0.4467;EgoSchemaでは80.40、同じ競合は81.20で、広範な理解ベンチマークでは僅差の敗北、その一方でより難しいEgoSchemaサブセットでは63.75で12%の優位を主張;Molmo2-Trackではcentre-F1が0.647、point-HOTAが0.628——だが、具体的であることと独立に検証済みであることは別の性質であり、あなたの映像で何が起きるかを教えてくれるのは後者だけだ。

Perceptronの表を読むうえでの注意点が2つあり、どちらもこの表を引用するあらゆる場合に当てはまる。ツールを有効にしたときのLiveVQA-Wの56.0という数値は4サンプルによる多数決投票から来ている一方、Google Searchグラウンディングを用いたGemini 3.8 Flashについてそれと対置されている53.2は多数決投票ではない。この手法自体は正当だが、単一のグリーディパスと比べてスコアを良く見せる。また、トラッキングの行ではQwen3-VL-8Bが0.180 centre-F1として挙げられているが、これは同モデルの論文から取られた数値であり、異なるチェックポイント系列の測定値と同じ列に位置している。測定列にある論文の数値は同一条件で比較できる行ではなく、まさに出典を伴わずに引用されがちな類いの行である。

2.4Tコアは当社から呼び出せるものではありません — しかし、そのアーキテクチャは呼び出せます

A screenshot of the OrcaRouter model page for Qwen3.8 Max, showing the breadcrumb Home > Models > Qwen, the model id qwen/qwen3.8-max with text, image and video input, the $2.00 and $6.00 per million token rates and the 1,000,000-token context window stated on the page, the capabilities row covering vision, tools, JSON and reasoning, and the Qwen-published benchmark section dated 2026-08-03.

これは、正直な答えがモデルの知名度から連想されるものとは異なる比較の部分です。Qwen 3.8 という名前は広くオープンコアを指すものとして使われており、そのオープンコアはダウンロード対象であってエンドポイントではありません。アリババの独自ライセンス Qwen3.8-Max の下で 2026年8月に公開された 2.4TB の BF16 重みです。当社はそれを提供しておらず、今日、我々の側でそれを提供しているプロバイダーもありません — カタログのエントリは、稼働中のルートではなく、告知済みで未提供の追跡ページとして存在しています。

私たちが提供しているのは、同じ 2.4T アーキテクチャ上に構築されたフラッグシップ API です。これはqwen/qwen3.8-maxとして、100万トークンあたり $2.00 と $6.00 で稼働しており、アリババ自身の料金がそのまま適用され、トークンあたりの上乗せは一切ありません。100万トークンのマルチモーダルウィンドウ(テキスト、画像、動画入力)を備え、オープンコアと同じハイブリッドアテンション設計を採用しています。推論を担う側が何かを見る必要があるなら、それがこの経路であり、ベンダーの料金改定が次の請求サイクルではなく当日に私たちの側へ反映される経路でもあります。あわせて、アリババの密な兄弟モデル qwen/qwen3.8-27b を自社インフラ上で 100万トークンあたり $0.33 と $2.40 で提供しており、262,144 トークンのウィンドウとテキスト・画像・動画入力に対応しています。27B の推論モデルで十分で、2.4T の 40 のインデックスがタスクの要求を超えているようなケースに向いています。

第二の契約なしで二つの半分を配線する

この組み合わせがベンチマークの議論よりも重要な実用的な理由は、エンボディド・スタックはすでに2つのモデルで成り立っており、3つ目の統合コストこそが、その設計を静かに殺してしまうものだからだ。Mk1.5は私たちのカタログには載っていないので、それに到達するにはベンダー自身のAPIを使うことになる——pip install "perceptron>=0.4.0"、キーはPERCEPTRON_API_KEYに設定、エンドポイントはapi.perceptron.inc。Qwenの側はあとキー1つで済む。

ゲートウェイがその真価を発揮するのは、まさに継ぎ目においてだ。問いを含むあらゆるフレームを知覚モデルへ送り、テキストのみのあらゆる計画を推論モデルへ送るというルーティングルールは、両者が単一のOpenAI互換エンドポイントの背後にあるなら設定1行で済み、自動フェイルオーバーがあれば、どちらか一方でプロバイダー障害が起きてもロボットが停止するのではなくフォールバックへと劣化する。200以上ものモデルをカバーし、定価を0%のマークアップでそのまま通す単一のAPIは、本記事が答えられない問いに答えるための最も安価な方法でもある。あなたの物体追跡タスクにMk1.5の座標が本当に必要なのか、それともはるかに大きなウィンドウと独立したスコアを備えた汎用視覚モデルで十分だったのか、という問いだ。実際のトラフィックの一部を候補間でルーティングし、自分のフレームで測定する方が、委託できるどんなベンチマーク調査よりもコストが低い。

これを具体的にどうするか

物理システムに知覚を組み込もうとしているなら、この組み合わせの中で座標で応答する唯一のモデルは Perceptron Mk1.5 であり、それはスコアではなく能力です。ハンドボックスの主張は自分の動画で検証し、reasoning_effort は高いデフォルトを受け入れるのではなく意図的に設定し、36,864トークンのウィンドウはソフトな制約ではなくハードな制約として予算に組み込んでください。その上に推論レイヤーを構築しているなら、Qwen 3.8 は Mk1.5 では測られていない領域で測定されており、完了したタスクあたりのコストは $2.00 という見出しの数字ではなく、それに照らして計画すべき数値です。ただし、その思考はオフにできないため、思考の連鎖を必要としないタスクでも、とにかくその分を支払うことになります。

これを間違えるチームは、1つのモデルに両方をやらせようとするチームだ。36,864トークンの知覚特化モデルは運用履歴を保持できないし、テキスト専用の2.4T推論モデルはフレームを決して見ることはない。この組み合わせは、2つの製品間の妥協ではない。それは実際の分業であり、有益な問いは、あなたの各呼び出しがそのどちら側に属するか、ただそれだけだ。

この記事で比較したモデル1

この記事から検出 · ベンチマーク:Artificial Analysis · 毎日更新