为 Perceptron Mk1.5 与 Qwen 3.8 的对比生成的标题卡,主标题为“Perceptron Mk1.5 vs Qwen 3.8”,副标题为“眼睛与规划器并非同一个模型”,三张卡片分别写着“Mk1.5:36,864 个 token,输出坐标”“Qwen 3.8:2.4T MoE,AA Index 40”和“接缝:帧交给一个,规划交给另一个”,脚注为“Qwen 3.8 的指数依据 Artificial Analysis。”
Guides & Insights

Perceptron Mk1.5 对比 Qwen 3.8:机器人两者皆需,且彼此不可替代

作者

Elias Hawthorne

发布日期

最新模型 · 20查看全部模型 →
基准测试:Artificial Analysis · 每日更新
返回全部文章

一个必须捡起某物的机器人需要模型提供两样东西,而这一组合中没有任何单一模型能同时给出这两者。Perceptron Mk1.5 返回几何信息:给定视频帧,它可以交回一个点、一个框、一个多边形或一个带时间戳的 <track> 元素,其上下文窗口为 36,864 个 token。Qwe​n 3.8——这个名字所指的是该厂商开放权重的 Qwen3.8-2.4T-A95B 核心——是一个 2.4 万亿参数的混合专家推理器,原生窗口为 262K,可扩展至接近一百万,而且它仅支持文本,因此完全无法查看这些帧。一个是感知层,每百万 token 收费 $0.15 和 $1.50;另一个是推理核心,输入成本约为前者的十三倍,输出成本约为前者的四倍,并且在 Artificial Analysis Intelligence Index 上拥有 40 的独立评分,而感知模型在任何地方都没有独立评分。

把它们并排当作相互竞争的产品,它们会在相反的方向上彼此落败,而这种比较也产生不出任何有用的东西。把它们并排看作同一条流水线的两半,它们几乎能解释具身栈中的每一个成本与可靠性决策:帧在哪里被解释、计划在哪里制定,以及当推理的那一半写出的 token 超过任务所需时,你的账单会发生什么。

让这种配对说得通的拆分

Perceptron Mk1.5 于 2026 年 9 月 25 日发布,是 Perceptron Mk1 的后继产品,其职责被严格限定。它接受文本、图像、视频和音频输入,并返回文本以及可选的结构化标注——点、边界框、多边形、片段和轨迹。<track> 输出同时携带空间观测结果及其所属的时间戳,因此一段 60 秒的片段返回的是随时间变化的位置,而不是一个平均后的猜测结果。asset_idx 字段让单个请求可以分别处理多个图像或视频,而这正是参考帧与实时帧对比所需要的。受约束的响应有两种形式,JSON Schema 和正则表达式,而两者的关键都在于输出是有类型的。

Qwen 3.8 是另一种截然不同的工具。其 2.4T 核心是一个细粒度 MoE——92 层,每层 512 个专家,其中 10 个路由专家加 1 个共享专家,且这 92 层中有 69 层采用线性注意力——正是这种设计让如此庞大的架构能够实现长上下文。它的强项在于跨大量文本进行推理:复杂的多步骤分析、长推导、智能体规划。它的短板则在输入侧。其开放核心仅支持文本,而且推理无法关闭:无论你是否需要,每次响应都会以一个思考块开头。

这不是推理模型的缺陷;这是感知模型的缺陷,而 Qwen 3.8 并不是感知模型。把两者按顺序放在一起,形态就显而易见了——Mk1.5 回答“叉车在哪里、它什么时候移动了”,Qwen 3.8 回答“既然如此,机械臂该做什么”。这两个问题都不是另一个模型能回答的。

A generated two-column scoreboard titled 'Perceptron Mk1.5 vs Qwen 3.8 - the scoreboard', comparing six dimensions: role in a stack (perception, frames to geometry vs reasoning, text to plans); scale (hosted perception API vs 2.4T total / 95B active MoE); context (36,864 tokens vs 262K native, to roughly 1M); input (text, image, video, audio vs text only on the open core); price ($0.15 in / $1.50 out per 1M tokens vs $2.00 in / $6.00 out); and independent score ('none yet' vs AA Index 40 of 115). Footnoted that the Qwen 3.8 index is per Artificial Analysis and that all Mk1.5 figures are vendor-reported.

每一半的费用是多少,按实际计费的费率计算

• 输入 — Perceptron Mk1.5 每百万 token $0.15。Qwen 3.8 在独立测试框架所测量的托管版本上为每百万 $2.00,并应用了 88% 的缓存折扣,这使得缓存命中的价格降至约 $0.24。

• 输出 — Mk1.5 每百万 $1.50。Qwen 3.8 每百万 $6.00。

• 缓存 — Mk1.5 的缓存输入为每百万 $0.0375,恰好是其标准输入费率的四分之一。Qwen 3.8 的折扣基于百分比,但幅度更大,达到 88%,因此其缓存费率在绝对值上是两者中更低的,而其未缓存费率是 Mk1.5 的十倍以上。

• 每个已完成任务的成本——排名正是在这里发生反转。Artificial Analysis 将 Qwen 3.8 每项 Intelligence Index 任务的成本定为 2.16 美元,在其所属类别的 115 个模型中排名第 32,并在成本方面获评满分(4/4)——尽管 token 昂贵,但每个已完成任务成本低廉,因为该模型在 Intelligence Index 的各轮运行中共生成 1.7 亿个输出 token,而与之相比的同场模型则更加冗长。Mk1.5 则没有任何人发布过同类可比数据。

• 上下文 — Mk1.5 为 36,864 个 token,而 Qwen 核心原生支持 262K,在合适的服务配置下可扩展至一百万。

• 推理控制——Mk1.5 暴露 reasoning_effort,可选 high、medium、low、minimal 或 none,默认为 high。Qwen 3.8 将思考锁定为开启状态,因此每次调用你都要为思考 token 付费。

把那份列表读两遍,因为这两个模型在成本上正好相反。按 token 计算,Mk1.5 要便宜得多。而在独立基准测试中按完成的任务计算,Qwen 3.8 测出来成本很低,Mk1.5 则没有测量数据。只有当你假设它们在做同一项工作时,这两种说法才会相互矛盾,而事实并非如此。

A screenshot of the Perceptron documentation model card for perceptron-mk1.5, showing the Specifications table (model ID perceptron-mk1.5, context window 36,864 tokens, maximum output 8,192 tokens, input modalities text, images, video, audio, audio formats WAV, MP3 and FLAC, an audio limit of 16,384 audio tokens per item, reasoning via reasoning_effort, function calling on chat completions, and constrained JSON Schema and regex responses) and the Pricing table below it (input $0.15, output $1.50, cached input $0.0375 per million tokens).

这里的证据恰恰指向相反的方向

在这批对比的大多数情况下,开放权重的一侧是拥有一堆厂商自报数字的一方,而闭源 API 则是拥有第三方页面的一方。这里情况反过来了,而这一反转值得明确指出,因为它改变了你能验证什么、不能验证什么。

Qwen 3.8 有独立测量。Artificial Analysis Intelligence Index 给 2.4T 核心打出 40 分,在撰写本文时于同类别的 115 个模型中排名第 5,输出速度为每秒 39.6 个 token——在 115 个中位列第 56,处于中游,在任何人计划围绕它搭建交互式循环之前,这一点值得了解。指数修订会在不同快照之间变化,诚实解读这些数字的方式都是将其视为方向性的,但这一点依然成立:阿里巴巴之外的某个人已经运行了这个模型,并公布了一个数字。

Perceptron Mk1.5 没有这种东西。对于 Mk1.5 或其前代,既没有 Artificial Analysis 条目,也没有竞技场得分,因此现存的每一项能力数据,都是 Perceptron 针对自家模型给出的。这套数据具体得不同寻常,这是它有利的一面——在厂商自己的运行中,egocentric hand_box 上为 0.9433,而 Gemini 3.1 Pro 为 0.4467;EgoSchema 为 80.40,同一竞争对手为 81.20,在广义理解基准上小幅落后,同时据称在更难的 EgoSchema 子集上以 63.75 取得 12% 的优势;在 Molmo2-Track 上,centre-F1 为 0.647,point-HOTA 为 0.628——但具体和经过独立验证是两种不同的属性,只有后者才能告诉你,在你的素材上会发生什么。

关于阅读 Perceptron 的表格,有两点提醒,这两点对该表格的任何引用都适用。LiveVQA-W 在启用工具时的 56.0 这一数字来自四样本多数投票,而与之对照的 Gemini 3.8 Flash 在 Google Search grounding 下的 53.2 并非多数投票;这种做法本身是合理的,但相对于单次贪心解码,它会抬高分数。此外,跟踪那一行把 Qwen3-VL-8B 列为 0.180 centre-F1,取自该模型的论文,却与属于另一检查点家族的实测数字同处一列。实测列中的论文数字并非同类可比的一行,而这正是那种会被引用却不提及其来源的条目。

2.4T 核心不是你能从我们这里调用的东西——但它的架构是。

A screenshot of the OrcaRouter model page for Qwen3.8 Max, showing the breadcrumb Home > Models > Qwen, the model id qwen/qwen3.8-max with text, image and video input, the $2.00 and $6.00 per million token rates and the 1,000,000-token context window stated on the page, the capabilities row covering vision, tools, JSON and reasoning, and the Qwen-published benchmark section dated 2026-08-03.

对比的这一部分,正是诚实答案与模型名气所暗示的内容不一致的地方。Qwen 3.8 这个名字被广泛用来指代开放核心,而开放核心是一个下载项,而非一个端点:2.4TB 的 BF16 权重,采用阿里巴巴定制的 Qwen3.8-Max 许可,于 2026 年 8 月发布。我们并不提供它,而且在我们这一侧,如今也没有任何提供商在提供它——该目录条目只是一个已宣布、尚未可用的跟踪页面,而非一条实时路由。

我们真正提供的,是构建在同一 2.4T 架构之上的旗舰 API。它已上线,模型名为 qwen/qwen3.8-max,每百万 token 收费 2.00 美元和 6.00 美元,直接沿用阿里巴巴自己的价格,每 token 不加任何加价,具备 100 万 token 的多模态窗口——支持文本、图像和视频输入——以及与开放核心相同的混合注意力设计。如果你的推理那一半需要看到任何东西,那就是该走的路径,而且在这条路径上,供应商的价格变动当天就会落到我们这边,而不是等到你的下一个计费周期。与此同时,我们还提供阿里巴巴的稠密同门 qwen/qwen3.8-27b,运行在我们自己的基础设施上,每百万 token 收费 0.33 美元和 2.40 美元,拥有 262,144 token 的窗口,支持文本、图像和视频输入,适用于 27B 推理模型已经够用、而 2.4T 的 40 这一索引超出任务所需的情况。

将这两部分连接起来,无需第二份契约

这种配对之所以比基准测试论点更重要,实际原因在于,一个具身技术栈已经是两个模型,而第三个模型的集成成本正是会悄无声息地毁掉设计的东西。Mk1.5 不在我们的目录中,因此要接入它就意味着要调用供应商自己的 API——pip install "perceptron>=0.4.0",密钥填入 PERCEPTRON_API_KEY,端点为 api.perceptron.inc。Qwen 这一半只差一个密钥。

网关真正体现价值的地方在于衔接处。当感知模型和推理模型都置于同一个兼容 OpenAI 的端点之后时,一条把每个带有问题的帧都送往感知模型、把每一份纯文本计划都送往推理模型的路由规则就只是一行配置;而自动故障转移意味着任何一侧的供应商事故都会降级为回退,而不是让机器人陷入停滞。一个 API 覆盖 200 多个模型、并以 0% 加价率透传标价,这也是回答本文无法回答的那个问题的最省钱方式:你的目标跟踪任务到底是否需要 Mk1.5 的坐标,还是一个窗口大得多、评分独立的通用视觉模型就已经足够。在候选模型之间分流一部分真实流量,并在自己的帧上做测量,成本低于你能委托的任何基准研究。

具体来说,这个该怎么处理?

如果你正在把感知能力构建进一个物理系统,Perceptron Mk1.5 是这组搭配中唯一以坐标作答的模型,这是一种能力,而不是一项分数——请在你自己的视频上测试手部边界框(hand-box)的说法,刻意设置 reasoning_effort,而不是接受较高的默认值,并把 36,864 token 的窗口当作硬约束而非软约束来规划预算。如果你正在它之上构建推理层,Qwen 3.8 在 Mk1.5 未被衡量的方面有评测数据,而你要据以规划的是其每完成一项任务的成本,而不是 $2.00 这个标题数字——但需注意,它的思考无法关闭,因此一个不需要思维链的任务无论如何都在为此付费。

把这件事搞错的团队,往往是那些试图让一个模型同时承担两者的团队。一个 36,864 token 的感知专用模型无法承载运行历史,而一个纯文本的 2.4T 推理模型也永远看不到画面。这种配对并不是两个产品之间的妥协。它就是实际的分工,而真正有用的问题只有一个:你的每一次调用分别属于这条分界的哪一侧。

本文中的对比1

根据本文内容识别 · 基准测试:Artificial Analysis · 每日更新