
Pareto 26.10 预览版 vs Pareto:相同的模型字符串,两个不同的模型
- openai新OpenAI: GPT-6.1 Sol2026-09-2952智能
- anthropic新Anthropic: Claude Sonnet 5.52026-09-2856智能
- typesafe新TypeSafe: Jev 1.132026-09-24$0.04 / $0.00 每百万 tokens · 221 tok/s
- OpenAI新OpenAI: GPT-6 Luna2026-09-2238智能
- OpenAI新OpenAI: GPT-6 Sol2026-09-2248智能
- Anthropic新Anthropic: Claude Opus 5.52026-09-2258智能
- xAI新Grok 4.72026-09-2146智能
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 每百万 tokens · 103 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 每百万 tokens · 1148 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040智能
- OpenAIOpenAI: GPT-6 Astra2026-09-0453智能77代码
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241智能76代码
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245智能76代码
- AnthropicAnthropic: Claude Fable 5.12026-09-0153智能82代码
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 每百万 tokens · 48 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 每百万 tokens · 104 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642智能72代码
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 每百万 tokens · 214 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845智能75代码
- obsidianQwen3.8 27B2026-08-1534智能68代码
Unbiased 发布了Pareto 26.10 Preview,时间为 2026 年 10 月 1 日,并保留了上一个版本Pareto 列在旁边。这两个并不是同一个家族里靠一个标志来选择的变体。它们是同一个品牌下的两个发布版本,而供应商自己的模型字符串——pareto——现在会解析到更新的、明确不稳定的那个。因此,比较问题其实不是“哪个更好”。而是:你的请求实际会到达哪一个,以及当这一点在你脚下发生变化时,答案会怎样?
唯一把两者放在一起提及的地方,是模型的公开技术条目。Unbiased 自家的模型卡、定价页面和 FAQ 都只描述了一个打包产品,从未提及这种拆分。这种不对称——一侧是详尽的公开差异说明,另一侧却是沉默——正是进行正面对比时最诚实的起点,因为它告诉你下文每一个数字的来源。
六个维度,双方
区分这两个版本的所有差异,都集中在这六行里。左边是 Pareto 26.10 Preview;右边是 9 月 17 日发布的 Pareto 版本,也就是预览版目录文本所称的稳定之选。
• 上下文窗口 —— 1,048,576 tokens vs 262,144 tokens。纸面上是四倍的空间,而两者都没有提供更小的档位。
• 最大输出 —— 131,072 tokens vs 131,072 tokens。没有变化。更大的窗口并没有带来更大的回答。
• 输入价格,按路由计 —— 每百万 $0.80 vs 每百万 $2.50。在该报价中,预览版大约只有其三分之一的价格。
• 输出价格,按路由计 —— 每百万 $3.20 vs 每百万 $7.50。不到一半。
• 缓存输入,按路由计 —— 每百万 $0.03 vs 每百万 $0.25。最长的智能体轨迹在这里获益最多。
• 已公布的基准测试表 —— 四项分数,明确标注为"初步"且"最终发布前可能变更" vs 完全没有公布基准测试表。
这些行中有两行才是决定实际工作的关键。上下文窗口是厂商不会在自家网站上写明的头条数字——它出现在商品页面上,而不是模型卡上——而缓存输入价格才是会改变智能体账单、而非其上限的那一项。其余的一切要么是营销上的增量,要么——就输出得分而言——是一种坦白:把预览版的数字贴上“初步”标签公之于众,比另一种做法更诚实,而且它同时也是一则警告。

你看到的价格取决于你在哪里看
把两张费率表并排一比,它们对不上账,而这一点恰恰是这次比较中谁都没有解释的地方。
在 26.10 Preview 成为当前版本的那一天,Unbiased 自己的平台仍然列出每百万输入 $2.50、缓存 $0.25 和输出 $7.50。这些是九月的数字,没有变化,在定价页面和模型卡片上都是如此。较低的一组——$0.80、$0.03、$3.20——出现在同一预览版本的路由目录列表中。因此,客户在调用 pareto 时,如果直接通过供应商的 API,就要为新模型支付旧价目表的价格,而路由列表宣传的价格大约只有它的三分之一。两者都仍在生效。供应商尚未公布促销结束日期,也没有发布任何调和二者的声明。
这是一个渠道问题,而在预览版本上,这也是一个时机问题:无论你以哪个数字来建模成本,另一个数字距离成为正确数字都只差一份发布说明。一个以0%加价率直接透传供应商标价的路由器,恰好消除了这种摩擦——供应商价格变动当天即生效,而不是等到下一次合同评审——而这是值得从OrcaRouter这里借鉴的唯一结构性做法。我们今天不代理Unbiased的任何一个版本,所以对“我在哪里调用它”的直接回答是Unbiased自己的API,具体取决于你通过其购买的产品恰好携带的是哪一套价格。之所以要明说这一点,是因为两者相差三倍,而预览版不是你发现自己定价定错了那一个的地方。
预览能给你带来什么,又会让你付出什么代价
预览版自己的目录描述已经把条件写明白了:它“可能在不另行通知的情况下变更”,而任何需要可预测行为的人,都会被引回九月的发布版本。这不是套话——这就是产品定义。把这一点与长时间智能体会话的实际形态对照来看,其中的取舍就变得具体了。
持续对话的智能体会不断累积上下文,而长对话正是提示缓存发挥价值的地方。端点未变、背后的模型却已更换,这是丢掉缓存的典型方式:缓存会以生成这些 token 的模型为键,因此轨迹中途发生静默版本切换,可能会使你原本已缓存的内容失效,并让你以为已经付过费的工作再次计费。Unbiased 自己的文档从相反方向论证了这一点——它把自己的混合方案定位为缓存稳定,而切换式路由器则不是——所以这是供应商非常清楚的风险,只是为了发布预览版而选择接受。这个问题值得点名,因为这种故障在仪表盘上是看不见的:你的 token 照常计费,你的回答照常返回,只是数字比上周更大。
预览版的优势是真实存在的,而其劣势也与之相称。上下文长度达到四倍,在路由清单上,缓存输入的价格是稳定版的八分之一,而且还有一张基准测试表——九月版本从未公布过分数。如果你的工作负载是长上下文且对成本敏感,预览版就是你要选的那个;而要在不押注整个技术栈的情况下采用它,办法就是刻意将其固定:为预览版指定一个命名端点,为稳定版指定一个命名端点,以及一个 二者之间的回退机制,只需配置一次。路由 DSL 正是为这类问题形态而存在的——将两者组合为两条独立支路,让一部分真实流量分别走每一条,并让请求日志告诉你每条实际花费了多少。预览版应该是一个能用一行配置撤销的决定,而不是一个要靠账单才发现的端点属性。

一幅不够稳定、难以令人信赖的业绩图景
上面每一个数字都来自公开榜单,而榜单自身的性能面板在发布当天的多次读取之间发生了变化。对 26.10 Preview 页面的一次读取报告的中位延迟为 5.28 秒、每秒 35 个 token;同一天发布的一份并排对比视图则报告该预览版为 3.54 秒、每秒 21 个 token,而 9 月发布版为 1.05 秒、每秒 45 个 token。这些差异可不小。一个由单一提供商提供服务的全新模型,其测量基础本就薄弱,而按小时计的滚动窗口也会发生变化。
诚实的说法是,这两个版本都没有稳定到足以据此做规划的吞吐量或延迟数字;而对预览版来说,这是产品本身固有的问题,而不是快照问题。9 月版本至少已经经历了几周流量——其列表显示多日可用性处于 90% 的高位,并且背后有完整的提供商历史记录。预览版只有几个小时。如果你在两者之间做选择的理由是速度,而不是价格或上下文,那么可供选择的证据尚不存在;负责任的做法是用你自己的提示词去实测,而不是从任一页面上读一个数字。

该打给哪一个,以及如何不再在意
如果你的工作是长上下文、对成本敏感且可评估的——智能体会话、批处理,凡是四倍窗口、三分之一输入价格足以抵偿周中突生变更风险的工作——那就调用这个预览版。把它当成一次试用,底下挂一行配置,并坚持用你自己测出的数字,因为厂商的数字会变。
如果你的工作负载属于生产环境、对延迟敏感,或者需要接受合规审查,而审查方不希望模型被描述为可能未经通知就发生变化,那就调用稳定的 Pareto。你会放弃 1M 窗口、更便宜的缓存和已公布的成绩;换来的是一个有历史记录、且名字在下周仍代表同样含义的端点。对很多团队来说,这就是全部需求。
错误在于把它当作永久性的分叉。Unbiased 当初设计这个拆分就是为了让它临时存在——预览版的存在是为了被评估,然后被吸收——而真正重要的决定不是你选两者中的哪一个,而是在它们之间切换是五分钟的改动,还是一个季度级的项目。在一个端点、一个模型字符串上,目前两者都不是:它是一则你必须及时捕捉的公告。改为把这一选择配置成路由决策,你所调用的版本就变成了一个旋钮,而这正是预览版发布历来唯一真正给予回报的姿态。
