Perceptron Mk1.5 的主视觉标题卡,副标题为“面向具身智能体的结构化空间输出”,标题上方有三个扁平线条图标:围绕一个小物体绘制的边界框、一条带两个路点的虚线运动轨迹,以及一道声波。OrcaRouter 标志位于右下角。
Guides & Insights

Perceptron Mk1.5 为具身智能体带来结构化空间输出——并于同日让 Isaac 退役

作者

Rowan Sterling

发布日期

最新模型 · 20查看全部模型 →
基准测试:Artificial Analysis · 每日更新
返回全部文章

Perceptron Mk1.5 现已正式发布,而它真正有趣的地方不在于基准测试表——而在于响应正文中返回的内容。问一个普通的视觉语言模型叉车在哪里,你会得到一句话。对视频帧询问 Perceptron Mk1.5,除了解释性文字之外,你还能得到机器可解析的几何信息:一个点、一个边界框、一个多边形、一段剪辑,或一个 <track>元素,它承载贯穿整个文件的、带时间戳的空间观测。这就是描述场景的模型与机器人控制器无需第二道解析阶段即可使用的模型之间的区别。它是 Perceptron Mk1 的直接后继版本,后者是该公司于 2026 年 5 月首次发布的产品,而它于 9 月 25 日发布,同时先于它的 Isaac 0.1 和 0.2 检查点被退役。

Mk1.5 究竟返回什么

该模型是一个面向物理智能体的具身推理系统。在输入侧,它接收文本、图像、视频和音频。在输出侧,它生成文本以及可选的结构化标注:点、框、多边形、片段和轨迹。跟踪输出才是值得细究的那部分。Perceptron 的文档描述了一个 <track> 块,其条目同时携带空间观测及其所属的时间戳,因此一段 60 秒的片段返回的是随时间变化的物体位置序列,而不是对场景的单一平均猜测。

如果你要把这套东西接入一条涉及多个素材的流水线,还有第二个细节值得注意:Mk1.5 支持 asset_idx字段,因此单次请求即可引用多张图片或多个视频,并分别对它们进行指定。如果你的任务是拿参考照片与实时摄像头画面做比对——比如缺陷检测循环、装配验证环节——那应该放在一次调用里,而不是拆成两次。

该模型还支持受限响应,包括 JSON Schema 和正则表达式两种形式,借此你可以把“大致差不多”变成下游代码能够校验的 schema。聊天补全支持函数调用,而 Perceptron 托管的 MCP 服务器现在默认使用 perceptron-mk1.5;显式传入 model: "perceptron-mk1"即可固定为之前的默认值。

规格表,以及它的价格

A single-column scoreboard titled 'Perceptron Mk1.5 — the scoreboard' listing Context window 36,864 tokens, Max output 8,192 tokens, Input price $0.15 per million tokens, Output price $1.50 per million tokens, Cached input $0.0375 per million, Reasoning default high, with a footer reading 'Figures per Perceptron's own documentation, September 25, 2026.'

这些数字值得直截了当地说明,因为它们在读者可能意想不到的地方显得相当克制。上下文窗口为 36,864 个 token——不是一百万,也不是 256K。最大输出为 8,192 个 token。这不是那种你丢给它一段两小时视频和一本 300 页手册的模型。它的体量是为一项有结构化答案的紧凑感知任务而设计的。

Pricing is $0.15 per million input tokens and $1.50 per million output tokens, with cached input at $0.0375 per million — exactly a quarter of the standard input rate. The client library is pip install "perceptron>=0.4.0", the endpoint is https://api.perceptron.inc/v1/chat/completions, and the key lives in PERCEPTRON_API_KEY. Nothing about the integration is exotic.

• 上下文 — 36,864 个 token,而 Perceptron Mk1 发布时配备的是 32K 窗口
• 最大输出 — 8,192 个 token
• 输入 — 文本、图像、视频、音频(WAV、MP3、FLAC)
• 缓存输入 — $0.0375/M,是 $0.15/M 标准输入费率的四分之一
• 输出 — $1.50/M
• 推理控制 — reasoning_effort 可设为 high、medium、low、minimal 或 none,默认 high

最后那一行其实是伪装起来的破坏性变更。Mk1.5 将旧的 vision_config.enable_thinking 布尔值替换为 reasoning_effort,因此,你针对先前模型构建的任何请求都需要修改,而不仅仅是重新指向。其默认值high 之所以值得注意,还有另一个原因:如果你不设置该字段,那么每次调用你都是在为最昂贵的推理路径买单。

音频,以及自带配乐的视频

音频输入在这里确实是全新的。Perceptron 以三种方式接收它——内联的 input_audio、audio_url,或 audio_file_id——每个条目的上限为 16,384 个音频 token。文档指出,按每分钟约 750 个 token 计算,这大约相当于 21.8 分钟的语音,对于班次交接录音或维护日志来说,是一个合理的额度。

更不寻常的是视频路径。默认情况下,Mk1.5 会逐帧读取视频,并忽略音轨。设置 vision_config.enable_audio_in_video: true会重新开启音轨,对于任何噪声本身就是信号的情况——机器在看起来出问题之前,听起来就已经不对劲;在镜头外发出的语音指令;现场巡视背景中的警报声——这都是你需要的设置。它默认处于关闭状态,因此除非你另行要求,否则带有可听故障的视频会被静默地当作无声影片来分析。

基准图,并明确标注来源

A single-column results scoreboard titled 'Perceptron Mk1.5 — the benchmark picture' listing hand_box 0.9433 against Gemini 3.8 Flash 0.6179, EgoSchema 80.40 against Gemini 3.8 Flash 81.20, EgoSchema-hard 63.75, Molmo2-Track centre-F1 0.647, LiveVQA-W with tools 56.0 against Gemini 3.8 Flash 53.2, and Audio DailyOmni 74.67, with a footer reading 'All figures reported by Perceptron, September 25, 2026. No independent scores.'

下面每一个数字都来自 Perceptron 自己发布的公告,且由 Perceptron 自行测量。Artificial Analysis 的指数条目中没有 Mk1.5,也没有其前代产品的任何评分,因此本次对比中不存在任何可用于对照的第三方数字。请将这些数字视为厂商对自家产品的主张,而非中立的结果。

在以自我为中心的手部追踪上,差距很大且非常具体:Mk1.5 在 hand_box 上得分 0.9433,而 Gemini 3.1 Pro 为 0.4467,Perceptron 测试中表现最好的 Gemini 为 0.6179,公告确认其为 Gemini 3.8 Flash。这正是发布帖着重打出的 +111% 和 +53%,也是该发布中最突出的单项数字。

在通用第一人称视频理解上,情况要接近得多。Perceptron 报告称,Mk1.5 在 EgoSchema 上为 80.40,而 Gemini 3.8 Flash 为 81.20——落后 0.80 分——同时声称在 EgoSchema-hard 子集上以 63.75 的得分取得 12% 的优势。一个在细粒度手部几何上决定性胜出、却在广泛理解基准上小幅落后的模型,是一种特定类型的工具,而它正被当作这样一种工具来推销。

视频目标分割在 Molmo2-Track 上取得 0.647 的中心 F1 和 0.628 的点 HOTA。Perceptron 表示,这一成绩在 Molmo2-Track、Ref-DAVIS17 和 ReasonVOS 上处于领先,但在 MeViS valid_u 上落后于 MolmoPoint-8B。面对 Qwen 视觉系列,这项跟踪对比值得仔细解读:公告中列出 Qwen3-VL-8B 在其论文中为 0.180 的中心 F1,而 Qwen3.5-27B 为 0.530 和 0.476——不同的检查点、不同的评估设置,而且一个论文数值与实测数值并排放在同一列中。这并非一行同等条件下的对比。

音频结果报告为 DailyOmni 74.67、WorldSense 50.32、OmniBench 51.05 和 AVHBench 80.56,未附带对比行。在启用工具的多模态搜索中,Mk1.5 在 LiveVQA-W 上通过四样本多数投票获得 56.0,相比之下,带 Google Search grounding 的 Gemini 3.8 Flash 为 53.2,带 OpenAI 网络搜索的 GPT-6 sol 为 51.0,GPT-5.2 在线版为 33.2。Perceptron 还声称,一旦开启工具,在 MMSearch 上可获得 36.1 分的提升。对四个样本进行多数投票是一种正当技术,而且相比单次贪心解码,它会抬高分数,因此 56.0 和 53.2 的测量方式并不相同。

延迟,以及4.7×是如何测量得出的

速度声明是最容易被脱离语境引用的,所以这里给出语境。Perceptron 报告称,在单块 H100 上,基于三次运行的中位数,端到端最高可快 4.7 倍,使用的是答案上限为 256 个 token 的 LMArena 提示,外加 MIA-Bench,以及采用 Perception Test 的 Video-MME。4.7 倍是聊天场景:从 5.2 秒降至 1.1 秒。图像问答从 1.7 秒降至 0.51 秒,约为 3.3 倍。一段 60 秒的视频以每次八个的方式处理,从 19 秒降至 9.1 秒,约为 2.1 倍。

所以,标题里的那个倍数在三者中是最好的,并不是典型情况。在单块 H100 上,对于简短回答,聊天路径确实快了 4.7 倍。而在具身智能体实际会运行的视频工作负载上,它更接近 2 倍。两个都是不错的数据;但只有其中一个成了标题数字。

Isaac 0.1 和 0.2 在同一天退役

A screenshot of the Perceptron documentation model card for perceptron-mk1.5, showing the specifications table (Model ID perceptron-mk1.5, context window 36,864 tokens, maximum output 8,192 tokens, input modalities text, images, video and audio, audio formats WAV/MP3/FLAC, audio limit 16,384 tokens per item, reasoning configured with reasoning_effort, function calling on chat completions, constrained JSON Schema and regex responses) and the pricing table (input $0.15, output $1.50, cached input $0.0375 per million tokens).

Mk1.5 更新日志还包含第二条日期为 9 月 25 日的条目,对任何已在生产环境中的用户来说,那才是真正有杀伤力的那条。isaac-0.1、isaac-0.2-1b和isaac-0.2-2b-preview 这些模型 ID 已从 Perceptron API 中停用。它们不再出现在 GET /v1/models 中,已从托管的 MCP 服务器中移除,而且现在指定它们的请求会失败,并返回 HTTP 404 model_not_found。

同一条目中还藏着第二处行为变更,它会波及那些压根儿没提过 Isaac 模型的代码:未知的模型 ID 现在会返回 404,而不再是此前的 400。任何针对错误模型名匹配 400 的重试逻辑、错误分支或告警规则,如今都匹配不到任何东西。Perceptron 给出的迁移路径是 perceptron-mk1.5。

在发布某模型系列的替代品同一天就让该系列退役,既是一个干净利落的迁移故事,也是一个残酷的故事。如果你当初因为 Isaac 能用而锁定了它,那你手头就有一个已经过去的截止日期。

在哪里运行它,以及如何在不押注它的情况下尝试它

该模型可通过供应商自有 API 以及若干第三方平台获取。OrcaRouter 目前并不路由 Perceptron Mk1.5——该模型不在我们的目录中——因此最诚实的建议是直接前往 api.perceptron.inc 获取,而这正是 SDK 和 PERCEPTRON_API_KEY 环境变量的用途所在。

无论如何值得说的是,因为它适用于决策而非模型:一个两天前的检查点,基于 36,864 token 窗口,推理默认设置为 high,这恰恰是你不应未经检查就放到生产路径上的那种东西的典型特征。先用你自己的帧运行它,并具体衡量两件事——结构化输出能否经受住你实际的边缘情况,以及 reasoning_effort: "high" 每次调用相比降到 medium 或 low 的成本是多少。第二项是一行改动,直接影响你的账单,而且它是本次发布中最便宜的实验。

这符合一个更广泛的模式——感知模型返回的是几何数据而非形容词——而这正是 OrcaRouter 旨在承载的。一个 API 覆盖 200 多个模型,供应商标价按 0% 加价原样传递,因此其中任何一家供应商调价,我们这边当天就会同步生效,而且自动故障转移意味着感知调用可以回退到第二个模型,而不是让请求失败。如果 Mk1.5 是唯一能达到你准确率标准的模型,那这一切今天都帮不上你。但如果它只是多个候选项之一,通过单一端点进行对比,比接入第二个 SDK 去验证要便宜得多。

本次发布涵盖和不涵盖的内容

Perceptron Mk1.5 是一款专注的工具,附带着一套异常坦诚的限制条件。它返回的是坐标,而不仅仅是描述。它能读取音频,如果你开启该功能,还包括视频的音轨。它在处理简短聊天回答时速度很快。它同时也是一个 36,864-token 的模型,输出上限为 8,192 token,定价为 $0.15 和 $1.50,基准测试完全由其自家厂商完成,并且由一家在同一则更新日志中让上一代产品退役的公司销售。

如果你的问题是“找到手、在整段视频里跟踪它、告诉我它去了哪里以及什么时候去的”,那么手部框指标才是该测试的那个。如果你的问题是针对前沿通用模型做广泛的视频理解,那么 EgoSchema 那一行——80.40 对 81.20——表明你是在以大致持平的表现买一个专用模型,而转用它的理由必须来自结构化输出和延迟,而不是来自准确率。

本文中的对比1

根据本文内容识别 · 基准测试:Artificial Analysis · 每日更新