
Perceptron Mk1.5 对比 Qwen 3.8:机器人两者皆需,且彼此不可替代
- typesafe新TypeSafe: Jev 1.132026-09-24$0.04 / $0.00 每百万 tokens · 610 tok/s
- openai新OpenAI: GPT-6 Luna2026-09-2237智能
- openai新OpenAI: GPT-6 Sol2026-09-2248智能
- anthropic新Anthropic: Claude Opus 5.52026-09-2258智能
- grok新Grok 4.72026-09-2146智能
- Orca新Orca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 每百万 tokens · 189 tok/s
- orca新Orca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 每百万 tokens · 1306 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040智能
- openaiOpenAI: GPT-6 Astra2026-09-0453智能77代码
- googleGoogle: Gemini 3.8 Flash2026-09-0241智能76代码
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245智能76代码
- anthropicAnthropic: Claude Fable 5.12026-09-0153智能82代码
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 每百万 tokens · 111 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642智能72代码
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 每百万 tokens · 225 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845智能75代码
- obsidianQwen3.8 27B2026-08-1534智能68代码
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236智能69代码
- grokSpaceXAI: Grok 4.62026-08-1244智能77代码
- metaMeta: Muse Spark 1.22026-08-0540智能72代码
一个必须捡起某物的机器人需要模型提供两样东西,而这一组合中没有任何单一模型能同时给出这两者。Perceptron Mk1.5 返回几何信息:给定视频帧,它可以交回一个点、一个框、一个多边形或一个带时间戳的 <track> 元素,其上下文窗口为 36,864 个 token。Qwen 3.8——这个名字所指的是该厂商开放权重的 Qwen3.8-2.4T-A95B 核心——是一个 2.4 万亿参数的混合专家推理器,原生窗口为 262K,可扩展至接近一百万,而且它仅支持文本,因此完全无法查看这些帧。一个是感知层,每百万 token 收费 $0.15 和 $1.50;另一个是推理核心,输入成本约为前者的十三倍,输出成本约为前者的四倍,并且在 Artificial Analysis Intelligence Index 上拥有 40 的独立评分,而感知模型在任何地方都没有独立评分。
把它们并排当作相互竞争的产品,它们会在相反的方向上彼此落败,而这种比较也产生不出任何有用的东西。把它们并排看作同一条流水线的两半,它们几乎能解释具身栈中的每一个成本与可靠性决策:帧在哪里被解释、计划在哪里制定,以及当推理的那一半写出的 token 超过任务所需时,你的账单会发生什么。
让这种配对说得通的拆分
Perceptron Mk1.5 于 2026 年 9 月 25 日发布,是 Perceptron Mk1 的后继产品,其职责被严格限定。它接受文本、图像、视频和音频输入,并返回文本以及可选的结构化标注——点、边界框、多边形、片段和轨迹。<track> 输出同时携带空间观测结果及其所属的时间戳,因此一段 60 秒的片段返回的是随时间变化的位置,而不是一个平均后的猜测结果。asset_idx 字段让单个请求可以分别处理多个图像或视频,而这正是参考帧与实时帧对比所需要的。受约束的响应有两种形式,JSON Schema 和正则表达式,而两者的关键都在于输出是有类型的。
Qwen 3.8 是另一种截然不同的工具。其 2.4T 核心是一个细粒度 MoE——92 层,每层 512 个专家,其中 10 个路由专家加 1 个共享专家,且这 92 层中有 69 层采用线性注意力——正是这种设计让如此庞大的架构能够实现长上下文。它的强项在于跨大量文本进行推理:复杂的多步骤分析、长推导、智能体规划。它的短板则在输入侧。其开放核心仅支持文本,而且推理无法关闭:无论你是否需要,每次响应都会以一个思考块开头。
这不是推理模型的缺陷;这是感知模型的缺陷,而 Qwen 3.8 并不是感知模型。把两者按顺序放在一起,形态就显而易见了——Mk1.5 回答“叉车在哪里、它什么时候移动了”,Qwen 3.8 回答“既然如此,机械臂该做什么”。这两个问题都不是另一个模型能回答的。

每一半的费用是多少,按实际计费的费率计算
• 输入 — Perceptron Mk1.5 每百万 token $0.15。Qwen 3.8 在独立测试框架所测量的托管版本上为每百万 $2.00,并应用了 88% 的缓存折扣,这使得缓存命中的价格降至约 $0.24。
• 输出 — Mk1.5 每百万 $1.50。Qwen 3.8 每百万 $6.00。
• 缓存 — Mk1.5 的缓存输入为每百万 $0.0375,恰好是其标准输入费率的四分之一。Qwen 3.8 的折扣基于百分比,但幅度更大,达到 88%,因此其缓存费率在绝对值上是两者中更低的,而其未缓存费率是 Mk1.5 的十倍以上。
• 每个已完成任务的成本——排名正是在这里发生反转。Artificial Analysis 将 Qwen 3.8 每项 Intelligence Index 任务的成本定为 2.16 美元,在其所属类别的 115 个模型中排名第 32,并在成本方面获评满分(4/4)——尽管 token 昂贵,但每个已完成任务成本低廉,因为该模型在 Intelligence Index 的各轮运行中共生成 1.7 亿个输出 token,而与之相比的同场模型则更加冗长。Mk1.5 则没有任何人发布过同类可比数据。
• 上下文 — Mk1.5 为 36,864 个 token,而 Qwen 核心原生支持 262K,在合适的服务配置下可扩展至一百万。
• 推理控制——Mk1.5 暴露 reasoning_effort,可选 high、medium、low、minimal 或 none,默认为 high。Qwen 3.8 将思考锁定为开启状态,因此每次调用你都要为思考 token 付费。
把那份列表读两遍,因为这两个模型在成本上正好相反。按 token 计算,Mk1.5 要便宜得多。而在独立基准测试中按完成的任务计算,Qwen 3.8 测出来成本很低,Mk1.5 则没有测量数据。只有当你假设它们在做同一项工作时,这两种说法才会相互矛盾,而事实并非如此。

这里的证据恰恰指向相反的方向
在这批对比的大多数情况下,开放权重的一侧是拥有一堆厂商自报数字的一方,而闭源 API 则是拥有第三方页面的一方。这里情况反过来了,而这一反转值得明确指出,因为它改变了你能验证什么、不能验证什么。
Qwen 3.8 有独立测量。Artificial Analysis Intelligence Index 给 2.4T 核心打出 40 分,在撰写本文时于同类别的 115 个模型中排名第 5,输出速度为每秒 39.6 个 token——在 115 个中位列第 56,处于中游,在任何人计划围绕它搭建交互式循环之前,这一点值得了解。指数修订会在不同快照之间变化,诚实解读这些数字的方式都是将其视为方向性的,但这一点依然成立:阿里巴巴之外的某个人已经运行了这个模型,并公布了一个数字。
Perceptron Mk1.5 没有这种东西。对于 Mk1.5 或其前代,既没有 Artificial Analysis 条目,也没有竞技场得分,因此现存的每一项能力数据,都是 Perceptron 针对自家模型给出的。这套数据具体得不同寻常,这是它有利的一面——在厂商自己的运行中,egocentric hand_box 上为 0.9433,而 Gemini 3.1 Pro 为 0.4467;EgoSchema 为 80.40,同一竞争对手为 81.20,在广义理解基准上小幅落后,同时据称在更难的 EgoSchema 子集上以 63.75 取得 12% 的优势;在 Molmo2-Track 上,centre-F1 为 0.647,point-HOTA 为 0.628——但具体和经过独立验证是两种不同的属性,只有后者才能告诉你,在你的素材上会发生什么。
关于阅读 Perceptron 的表格,有两点提醒,这两点对该表格的任何引用都适用。LiveVQA-W 在启用工具时的 56.0 这一数字来自四样本多数投票,而与之对照的 Gemini 3.8 Flash 在 Google Search grounding 下的 53.2 并非多数投票;这种做法本身是合理的,但相对于单次贪心解码,它会抬高分数。此外,跟踪那一行把 Qwen3-VL-8B 列为 0.180 centre-F1,取自该模型的论文,却与属于另一检查点家族的实测数字同处一列。实测列中的论文数字并非同类可比的一行,而这正是那种会被引用却不提及其来源的条目。
2.4T 核心不是你能从我们这里调用的东西——但它的架构是。

对比的这一部分,正是诚实答案与模型名气所暗示的内容不一致的地方。Qwen 3.8 这个名字被广泛用来指代开放核心,而开放核心是一个下载项,而非一个端点:2.4TB 的 BF16 权重,采用阿里巴巴定制的 Qwen3.8-Max 许可,于 2026 年 8 月发布。我们并不提供它,而且在我们这一侧,如今也没有任何提供商在提供它——该目录条目只是一个已宣布、尚未可用的跟踪页面,而非一条实时路由。
我们真正提供的,是构建在同一 2.4T 架构之上的旗舰 API。它已上线,模型名为 qwen/qwen3.8-max,每百万 token 收费 2.00 美元和 6.00 美元,直接沿用阿里巴巴自己的价格,每 token 不加任何加价,具备 100 万 token 的多模态窗口——支持文本、图像和视频输入——以及与开放核心相同的混合注意力设计。如果你的推理那一半需要看到任何东西,那就是该走的路径,而且在这条路径上,供应商的价格变动当天就会落到我们这边,而不是等到你的下一个计费周期。与此同时,我们还提供阿里巴巴的稠密同门 qwen/qwen3.8-27b,运行在我们自己的基础设施上,每百万 token 收费 0.33 美元和 2.40 美元,拥有 262,144 token 的窗口,支持文本、图像和视频输入,适用于 27B 推理模型已经够用、而 2.4T 的 40 这一索引超出任务所需的情况。
将这两部分连接起来,无需第二份契约
这种配对之所以比基准测试论点更重要,实际原因在于,一个具身技术栈已经是两个模型,而第三个模型的集成成本正是会悄无声息地毁掉设计的东西。Mk1.5 不在我们的目录中,因此要接入它就意味着要调用供应商自己的 API——pip install "perceptron>=0.4.0",密钥填入 PERCEPTRON_API_KEY,端点为 api.perceptron.inc。Qwen 这一半只差一个密钥。
网关真正体现价值的地方在于衔接处。当感知模型和推理模型都置于同一个兼容 OpenAI 的端点之后时,一条把每个带有问题的帧都送往感知模型、把每一份纯文本计划都送往推理模型的路由规则就只是一行配置;而自动故障转移意味着任何一侧的供应商事故都会降级为回退,而不是让机器人陷入停滞。一个 API 覆盖 200 多个模型、并以 0% 加价率透传标价,这也是回答本文无法回答的那个问题的最省钱方式:你的目标跟踪任务到底是否需要 Mk1.5 的坐标,还是一个窗口大得多、评分独立的通用视觉模型就已经足够。在候选模型之间分流一部分真实流量,并在自己的帧上做测量,成本低于你能委托的任何基准研究。
具体来说,这个该怎么处理?
如果你正在把感知能力构建进一个物理系统,Perceptron Mk1.5 是这组搭配中唯一以坐标作答的模型,这是一种能力,而不是一项分数——请在你自己的视频上测试手部边界框(hand-box)的说法,刻意设置 reasoning_effort,而不是接受较高的默认值,并把 36,864 token 的窗口当作硬约束而非软约束来规划预算。如果你正在它之上构建推理层,Qwen 3.8 在 Mk1.5 未被衡量的方面有评测数据,而你要据以规划的是其每完成一项任务的成本,而不是 $2.00 这个标题数字——但需注意,它的思考无法关闭,因此一个不需要思维链的任务无论如何都在为此付费。
把这件事搞错的团队,往往是那些试图让一个模型同时承担两者的团队。一个 36,864 token 的感知专用模型无法承载运行历史,而一个纯文本的 2.4T 推理模型也永远看不到画面。这种配对并不是两个产品之间的妥协。它就是实际的分工,而真正有用的问题只有一个:你的每一次调用分别属于这条分界的哪一侧。
本文中的对比1
根据本文内容识别 · 基准测试:Artificial Analysis · 每日更新
