
Perceptron Mk1.5、エンボディドエージェントに構造化された空間出力をもたらす — そして同日にIsaacを引退させる
- typesafeNEWTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 100万トークンあたり · 578 tok/s
- openaiNEWOpenAI: GPT-6 Luna2026-09-2237知能
- openaiNEWOpenAI: GPT-6 Sol2026-09-2248知能
- anthropicNEWAnthropic: Claude Opus 5.52026-09-2258知能
- grokNEWGrok 4.72026-09-2146知能
- OrcaNEWOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 100万トークンあたり · 182 tok/s
- orcaNEWOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 100万トークンあたり · 1312 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040知能
- openaiOpenAI: GPT-6 Astra2026-09-0453知能77コーディング
- googleGoogle: Gemini 3.8 Flash2026-09-0241知能76コーディング
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245知能76コーディング
- anthropicAnthropic: Claude Fable 5.12026-09-0153知能82コーディング
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 100万トークンあたり · 114 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642知能72コーディング
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 100万トークンあたり · 225 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845知能75コーディング
- obsidianQwen3.8 27B2026-08-1534知能68コーディング
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236知能69コーディング
- grokSpaceXAI: Grok 4.62026-08-1244知能77コーディング
- metaMeta: Muse Spark 1.22026-08-0540知能72コーディング
Perceptron Mk1.5が一般提供開始となりました。その興味深い点はベンチマークの表ではなく、レスポンスボディに返ってくる内容です。通常の視覚言語モデルにフォークリフトがどこにあるか尋ねれば、返ってくるのは一文です。Perceptron Mk1.5に動画フレームについて尋ねると、その文章に加えて、機械が解析可能な幾何情報が得られます。点、バウンディングボックス、ポリゴン、クリップ、あるいは<track>要素で、ファイル全体にわたるタイムスタンプ付きの空間観測を保持します。これこそ、シーンを描写するモデルと、ロボットコントローラが二段目の解析処理なしにそのまま利用できるモデルとの違いです。これは、2026年5月に同社が最初にリリースしたPerceptron Mk1の直系の後継であり、9月25日には、それに先立つIsaac 0.1および0.2チェックポイントの廃止とともに提供が開始されました。
Mk1.5が実際に返すもの
このモデルは、物理エージェント向けの身体化推論システムです。入力側では、テキスト、画像、動画、音声を受け取ります。出力側では、テキストに加えて、点、ボックス、ポリゴン、クリップ、トラックといった任意の構造化アノテーションを生成します。トラッキング出力は、じっくり検討する価値のある部分です。Perceptronのドキュメントでは、<track>ブロックについて説明されています。このブロックの各エントリは、空間的観測と、それが属するタイムスタンプの両方を保持するため、60秒のクリップは、シーンに関する単一の平均的な推測ではなく、時間の経過に伴うオブジェクト位置のシーケンスとして返されます。
複数のアセットを含むパイプラインにこれを組み込むすべての人にとって重要な2つ目の詳細: Mk1.5 は asset_idxフィールドをサポートしているため、1回のリクエストで複数の画像や動画を参照し、それらを個別に扱えます。参照写真とライブカメラのフレームを比較する作業 — 欠陥チェックループ、組立検証ステップ — であれば、それは2回ではなく1回の呼び出しで行うべきです。
このモデルは制約付き応答もサポートしており、JSON Schema と正規表現の両方に対応しています。これにより「だいたい合っている」を、下流のコードで検証できるスキーマに変換できます。Function calling は chat completions でサポートされており、Perceptron のホスト型 MCP サーバーは現在デフォルトでperceptron-mk1.5 を使用します。以前のデフォルトに固定するには、model: "perceptron-mk1" を明示的に渡します。
仕様書と、その費用

ここにある数字は、読者が予想しないかもしれないところで控えめなので、率直に述べておく価値がある。コンテキストウィンドウは36,864トークン——100万でも256Kでもない。最大出力は8,192トークン。これは、2時間の動画と300ページのマニュアルを渡すようなモデルではない。構造化された回答を伴う、厳密な知覚タスクに合うサイズになっている。
Pricing is $0.15 per million input tokens and $1.50 per million output tokens, with cached input at $0.0375 per million — exactly a quarter of the standard input rate. The client library is pip install "perceptron>=0.4.0", the endpoint is https://api.perceptron.inc/v1/chat/completions, and the key lives in PERCEPTRON_API_KEY. Nothing about the integration is exotic.
• コンテキスト — 36,864トークン(Perceptron Mk1 の 32K ウィンドウに対して)
• 最大出力 — 8,192トークン
• 入力 — テキスト、画像、動画、音声(WAV、MP3、FLAC)
• キャッシュ済み入力 — $0.0375/M(標準入力料金 $0.15/M の 4 分の 1)
• 出力 — $1.50/M
• 推論制御 — reasoning_effort は high、medium、low、minimal、none に対応し、デフォルトは high
最後の行は、見かけによらず破壊的変更です。Mk1.5は、従来のvision_config.enable_thinkingブール値をreasoning_effortに置き換えるため、以前のモデル向けに作成したリクエストは、単に参照先を変えるだけでなく編集が必要になります。highのデフォルト値には、別の理由で注目する価値があります。このフィールドを設定しない場合、呼び出しごとに最も高コストな推論経路を選ぶことになります。
オーディオ、および独自のサウンドトラックを持つビデオ
音声入力はここでは本当に新しいものです。Perceptron はこれを 3 通りで受け付けます — インラインの input_audio、audio_url、または audio_file_id — 1 アイテムあたり最大 16,384 音声トークンです。ドキュメントでは、これを毎分約 750 トークンで約 21.8 分の音声に相当するとしています。これは、勤務交代の引き継ぎ録音や保守ログにとって妥当な許容量です。
さらに珍しいのは動画の経路です。デフォルトでは、Mk1.5 は動画をフレームとして読み取り、音声トラックを無視します。設定vision_config.enable_audio_in_video: trueはサウンドトラックを再び有効にします。これは、ノイズこそが信号であるあらゆるケースに必要な設定です——見た目より先に音がおかしくなる機械、カメラ外で発せられた音声指示、現場のウォークスルーの背景で鳴るアラームなど。デフォルトではオフなので、音声の異常がある動画は、明示的にそう指定しない限り無声映画として黙って解析されます。
ベンチマークの全体像、出典を明示したもの

以下のすべての数値は Perceptron 自身の発表に由来し、Perceptron によって測定されたものです。Mk1.5 にもその前身にも Artificial Analysis のインデックス項目やアリーナスコアは存在しないため、この比較の中にはそれらと突き合わせる第三者の数値はどこにもありません。これらの数値は、中立的な結果としてではなく、自社製品に関するベンダーの主張として扱ってください。
エゴセントリックなハンドトラッキングでは、その差は大きく、そして明確だ。Mk1.5はhand_boxで0.9433を記録しており、Gemini 3.1 Proの0.4467、そしてPerceptronの実行で最高のGemini——発表ではGemini 3.8 Flashと特定されている——の0.6179と対比される。これがローンチ投稿が冒頭で掲げる+111%と+53%であり、今回のリリースの中で最も強い単一の数値だ。
一般的なエゴセントリック動画理解に関して言えば、形勢はかなり僅差だ。Perceptronは、Mk1.5のEgoSchemaスコアが80.40、Gemini 3.8 Flashが81.20だと報告している。0.80ポイントの敗北だ。一方で、EgoSchema-hardサブセットでは63.75で12%の優位を主張している。細粒度の手の形状認識では決定的に勝ち、広範な理解ベンチマークでは僅差で負けるモデルは、特定の種類のツールであり、まさにそのようなツールとして売り込まれている。
動画オブジェクトセグメンテーションは、Molmo2-Track で 0.647 center-F1 と 0.628 point-HOTA を記録する。Perceptron によれば、これは Molmo2-Track、Ref-DAVIS17、ReasonVOS を上回る一方、MeViS valid_u では MolmoPoint-8B に後れを取る。Qwen の vision 系との比較では、この追跡の比較は注意深く読む価値がある。発表では Qwen3-VL-8B をその論文の 0.180 center-F1 として挙げ、Qwen3.5-27B を 0.530 と 0.476 としている — 異なるチェックポイント、異なる評価設定であり、論文の数値が実測値と同じ列に並んでいる。それは同一条件の行ではない。
音声結果は DailyOmni 74.67、WorldSense 50.32、OmniBench 51.05、AVHBench 80.56 として報告されており、比較行は添付されていない。ツールを有効にしたマルチモーダル検索では、Mk1.5 は LiveVQA-W で4サンプル多数決により 56.0 を記録し、Google Search グラウンディングを用いた Gemini 3.8 Flash の 53.2、OpenAI web search を用いた GPT-6 sol の 51.0、GPT-5.2 online の 33.2 に対する結果となっている。Perceptron はまた、ツールをオンにすると MMSearch で 36.1 ポイントの向上を主張している。4サンプルでの多数決は正当な手法であり、単一のグリーディーパスと比べてスコアを実際より良く見せる。したがって、56.0 と 53.2 は同じ方法で測定されたものではない。
レイテンシと、4.7×がどのように測定されたか
速度の主張は、文脈を省かれて引用される可能性が最も高いものなので、ここにその文脈を示します。Perceptronは、単一のH100上での3回の実行の中央値で、LMArenaプロンプト(回答は256トークンに制限)に加え、MIA-BenchとVideo-MME(Perception Test付き)を用いて、最大4.7倍のエンドツーエンド高速化を報告しています。4.7倍はチャットの場合で、5.2秒から1.1秒です。画像質問応答は1.7秒から0.51秒になり、約3.3倍です。60秒の動画を8本同時に処理する場合は19秒から9.1秒で、およそ2.1倍です。
つまり、見出しの倍率は3つの中で最良のものであって、典型的なケースではない。単一のH100では、短い回答において、チャット経路は実際に4.7×高速だ。身体化エージェントが実際に実行する動画ワークロードでは、2×に近い。どちらも良い数字だが、見出しになるのはそのうち片方だけだ。
Isaac 0.1と0.2は同じ日に廃止されました

Mk1.5の変更履歴には9月25日付の2番目の項目があり、すでに本番環境で運用している人にとってはこれが効いてくるものです。isaac-0.1、isaac-0.2-1b、isaac-0.2-2b-previewのモデルIDがPerceptron APIから廃止されました。これらはGET /v1/modelsに表示されなくなり、ホスト型MCPサーバーからも削除され、これらを指定したリクエストはHTTP 404 model_not_foundで失敗するようになりました。
同じエントリには、Isaac モデルに一切言及していないコードにも影響する2つ目の動作変更が隠れています。不明なモデル ID は、以前の 400 ではなく 404 を返すようになりました。不正なモデル名に対して 400 で一致していた再試行ロジック、エラー分岐、アラートルールは、今では何にも一致していません。Perceptron が提供する移行パスはperceptron-mk1.5。
モデルファミリーを、その代替を出荷するのと同じ日に廃止するのは、きれいな移行の話であると同時に、過酷な話でもある。Isaac が動いていたからという理由でそれにピン留めしていたなら、すでに過ぎてしまった締め切りを抱えていることになる。
どこで実行するか、そしてそれに賭けずに試す方法
可用性はベンダー自身のAPIおよび複数のサードパーティ製プラットフォームを通じて提供されています。OrcaRouterは現在Perceptron Mk1.5をルーティングしていません — このモデルは当社のカタログにありません — そのため、正直なガイダンスとしては、それについてはapi.perceptron.incに直接アクセスすることです。まさにそのためにSDKとPERCEPTRON_API_KEY環境変数があるのです。
とはいえ、言っておく価値がある。これはモデルではなく意思決定に関わる話だからだ:36,864トークンのウィンドウ上の2日前のチェックポイントで、推論のデフォルトがhighに設定されているものは、まさに本番経路に未検証のまま投入すべきではないものの典型だ。まず自分のフレームに対して実行し、特に2つの点を測定すべきだ — 構造化出力が実際のエッジケースを耐え抜くかどうか、そしてreasoning_effort: "high"に下げた場合と比べて1回あたりいくらかかるかmedium または low。2つ目は1行の変更で、請求額に直接影響する。そして、このリリースで最も安価な実験だ。
これが当てはまるより広いパターン——知覚モデルが形容詞ではなく幾何学を返すこと——は、まさにOrcaRouterが取り込むために作られたものです。1つのAPIが200以上のモデルをカバーし、プロバイダーの定価を0%のマークアップでそのまま提供するため、そのいずれかでベンダーの価格変更があれば当社側では即日反映され、自動フェイルオーバーにより、知覚呼び出しはリクエストを失敗させる代わりに2番目のモデルへフォールバックできます。Mk1.5だけがあなたの精度基準をクリアする唯一のものであるなら、そうしたことは今日のあなたには何の役にも立ちません。それが複数の候補のうちの1つであるなら、比較を単一のエンドポイントを通して実行する方が、それを確かめるために2つ目のSDKを組み込むよりも安くつきます。
このリリースが何であり、何でないか
Perceptron Mk1.5は、異例なほど正直な一連の限界が付いた、焦点を絞ったツールだ。説明だけでなく座標を返す。音声を読み取り、オンにすれば動画のサウンドトラックも含む。短いチャット応答では高速だ。また、36,864トークンのモデルで出力上限は8,192トークン、価格は$0.15と$1.50、ベンチマークは完全に自社ベンダーによるもので、同じ変更履歴の項目で前世代を廃止した企業によって販売されている。
あなたの課題が「手を見つけ、クリップ全体を通して追跡し、どこへいつ移動したかを教えてくれる」ことなら、試すべきはハンドボックスの数値だ。あなたの課題が最先端の汎用モデルに対する広範な動画理解なら、EgoSchemaのライン——80.40 対 81.20——は、ほぼ互角の専門特化型を選んでいることを示しており、乗り換える論拠は精度からではなく、構造化出力とレイテンシから来なければならない。
この記事で比較したモデル1
この記事から検出 · ベンチマーク:Artificial Analysis · 毎日更新
