一张生成的标题卡,标题为“Unbiased 的 Pareto 26.10 Preview”,副标题为“同一模型字符串背后的一次 1M 上下文切换”,位于三张卡片上方,卡片上分别写着“发布时间:2026年10月1日”、“上下文:1,048,576 个 token”和“路由价格:每 1M 为 $0.80 / $3.20”,页脚写着“由厂商运行的初步基准测试;截至2026年10月1日,尚无独立评分发布。”
Guides & Insights

Unbiased 的 Pareto 26.10 预览:同一模型字符串背后的 1M 上下文切换

作者

Alistair Wren

发布日期

最新模型 · 20查看全部模型 →
基准测试:Artificial Analysis · 每日更新
返回全部文章

集成不会改变。改变的是它背后的模型。2026 年 10 月 1 日,Unbiased 将其模型字符串—— pareto——迁移到了 Pareto 26.10 Preview,这是一个新版本,上下文窗口扩大了四倍,路由目录上的价格更低,而且其基准测试表——按供应商自己的说法——是初步的、最终形式尚未发布。如果你今天按名称调用 Pareto,你调用的就是 26.10 Preview,供应商的变更日志用最直白的措辞说明了这一点:“Pareto 26.10 Preview 现在是当前的 Pareto 版本……模型字符串仍为 pareto。”

那一行对于任何在技术栈中使用 Pareto 的人来说就是事情的全貌。这不是与第一个产品一同推出的第二个产品。它就是第一个产品,在原位被替换,名称却未曾改变——这意味着你获得的版本取决于发布日历,而不是你请求中的任何内容。

10月1日到底发生了什么变化

有四样东西发生了变化,而它们并不都指向同一个方向。

• 上下文窗口——9 月 Pareto 版本为 262,144 个 token,如今则为 1,048,576。Unbiased 自家文档从未给出这一数字;该数字来自模型的公开技术清单,其中它是单次请求的上限,且未提供更小的档位。
• 按路由计的价格——Pareto 通常被引用的价格组合为每百万输入 token 2.50 美元、每百万输出 token 7.50 美元,缓存输入为 0.25 美元。26.10 Preview 的标价则分别为 0.80 美元、3.20 美元和 0.03 美元——约为输入费率的三分之一,略高于输出费率的 40%。
• 基准测试分数——该版本首次公布,且按厂商自己的说法属于初步数据。
• 稳定选项——26.10 Preview 是预览版。Unbiased 的产品目录文案称其“可能随时变更,恕不另行通知”,并建议需要可预测行为的人改用上一个版本。

其他一切保持不变。最大输出仍为 131,072 个 token。输入仍为文本和图像;输出仍仅为文本。列表中仍然没有 Hugging Face 标识符,因此权重仍保持封闭。而且仍然只有一个服务提供商——Unbiased 本身——列表内没有第二家托管方。

A generated single-column card titled "Pareto 26.10 Preview - what changed" with six rows reading "Context: 262K to 1M", "Max output: 131,072 (unchanged)", "Input price: $2.50 to $0.80 per 1M", "Output price: $7.50 to $3.20 per 1M", "Benchmarks: four, preliminary" and "Providers: one, the vendor", with a footer reading "Preview figures per the public listing; the vendor's own site keeps the $2.50 / $7.50 card."

价格才是值得读两遍的部分

在 Unbiased 自己的平台上,费率卡没有变动。模型卡和定价页面仍显示每百万输入 $2.50、缓存 $0.25、输出 $7.50——与 9 月发布版所载的同样三个数字——而由于模型字符串仍为 pareto,使用该供应商 API 的客户正在为 26.10 Preview 支付这些费率。较低的数字是经路由的目录列表上的数字,而两者之间的差距,恰恰是决定迁移与否的那类因素。

存在两种解读,而供应商并未说明哪一种属实。要么 26.10 Preview 确实是通过那条渠道以更低价格提供,作为导入期的推广举措;要么该条目代表的是一种不同于直营平台的商业安排。Unbiased 并未公布促销结束日期,而在发布当天设定的价格并不构成承诺。

这是整个故事中路由器唯一改变其形态的部分。OrcaRouter 将供应商的标价直接传递,加价率为 0%,因此供应商的降价在落地当天就会在我们这边生效,而不是等到合同周期;而自动故障转移意味着,下周表现不同的预览版本可以在无需修改代码的情况下被替换掉。我们并不提供 Unbiased 的 Pareto 26.10 Preview,所以说实话是这样的:如果你想要这个特定模型,请通过 Unbiased 自己的 API 调用它。重点只是在于,对于预览版本,价格和版本都是变量,二者都不应被固定在代码中。

基准表,连同它自带的标签

Unbiased 为 26.10 Preview 发布了四项评分,每项都配有一个实测的单任务成本,并且每项都附带一条厂商自己写下的说明。请把它们当作厂商自行运行、未经复现的结果来看待,因为它们本就是如此:

• DeepSWE v1.1(智能体编程)——69.9%,每任务 $0.24
• Terminal-Bench 4.0(智能体终端使用)——50.8%,每任务 $0.48
• Humanity's Last Exam,纯文本(专家推理)——49.9%,每任务 $0.008
• GPQA-Diamond(科学推理)——92.4%,每任务 $0.004

A generated single-column scoreboard titled "Pareto 26.10 Preview - the benchmark sheet" listing six rows: "DeepSWE v1.1: 69.9% at $0.24 per task", "Terminal-Bench 4.0: 50.8% at $0.48 per task", "HLE text-only: 49.9% at $0.008 per task", "GPQA-Diamond: 92.4% at $0.004 per task", "Context: 1,048,576 tokens" and "Independent scores: none yet", with a footer reading "Vendor-run, preliminary results; not independently validated."

厂商的说法是,26.10 Preview“在所有四项基准上都追平或确立了帕累托前沿”。与这一说法一同发布的表格则更为具体,而它能被公开,本身就归功于 Unbiased:在 Terminal-Bench 4.0 上,GPT 6 Astra 列为 58,Fable 5.1 为 56,均高于 Pareto 的 50.8,厂商自己那节“其他模型得分更高的地方”也直接说明了这一点。在 DeepSWE v1.1 上,该发布版本身处一个密集簇中——GLM-5.3 和 Kimi K3 均列为 69.0,而 Pareto 为 69.9——这在实践中算是平手,并且落在单次运行所携带的任何误差范围之内。

这些对比数字还带有第二个注意事项,它比第一个更重要:它们是从 9 月 21 日的一次比较中转录而来的,并且用供应商的话说,“未经独立验证”,而且它们是在对各个模型分别进行的另一项评估中得出的——因此不应把它们与 Pareto 的每任务成本数据并列,仿佛二者都出自同一测试台。供应商在评估详情中说明了这一点。跳过那一行的读者会过度解读这张图表。

这一切都不是:独立的。Artificial Analysis——大多数团队在信任价目表上的一个新名字之前会查看的排行榜——完全没有 Pareto 的页面。上面每一个数字,都是由销售该模型的公司自己产出的。唯一能缓和这一点的是,评测框架是公开的——供应商发布了一套可复现的正面对比测试套件,任何人都可以把它指向某个端点——这让“相信我们的分数”变成了“重跑我们的分数”。这是一个实实在在的承诺,但它和经过验证的数字并不是一回事。目前还没有人公布重跑结果。

合同中的"preview"是什么意思

这个词在这里承担的分量,比发布说明还要重。Unbiased 自己的文档将当前的访问描述为其条款下的评估访问,并声明商业或生产用途需要另行签订书面协议。新账户在 API 密钥发放之前需经人工审核。该 API 与 OpenAI 和 Anthropic 兼容——基础 URL、密钥、模型字符串,无需改写——但文档所呈现的接口仅有 chat completions 和 messages,且厂商公开列出了已知的缺口:GET /v1/models 并未实现,未知的模型标识符也不会被拒绝,因此调用方必须显式发送pareto,而无法自行发现有哪些可用。

把预览标签和私有测试版合约放在一起看,运维建议就不言自明了。这是一个应当置于路由层之后、用你自己的实际工作负载来评估的模型,而不是一个放在营收流量前面就可以不管的模型。为此所需的机制并不光鲜:一次性配置好一条回退链,这样某个在周中于你眼皮底下发生变化的发布版本,就变成一次配置变更,而不是一起事故。Unbiased 在九月花时间在自己的系统上修复的正是这一类问题——9 月 16 日的一条变更日志记录显示,约 13% 的长非流式请求撞上了 120 秒超时,于是网关上限被提高到了 300 秒。这是一个厂商在坦率地谈论自己的一块粗糙边缘。它也提醒我们,预览版的运维画像仍在书写之中。

A screenshot of the Unbiased Pareto 26.10 Preview model card page, headed "Pareto 26.10 Preview model card" and subtitled "Pareto is our blended AI model, available through the Unbiased AI platform. Send one request and receive one answer.", showing the DeepSWE v1.1 and Terminal-Bench cost-per-score chart with the Pareto 26.10 Preview point at 69.9% and $0.24 alongside other labs' published points, over an evaluation-details block stating the Pareto 26.10 Preview results are from October 1, 2026 runs and may change before final publication.

做出承诺前需要注意什么

三件具体的事情就能解决这些悬而未决的问题,而且每一件都是可核查的。

第一项是独立评分。在第三方于公开发布的评测框架上运行 26.10 Preview 之前,GPQA-Diamond 上的 92.4 和 Terminal-Bench 上的 50.8 都只是厂商对自家工作的说法——足以决定是否要测试,但不足以决定是否要迁移。

第二点是预览对价格产生的影响。如果经路由的商品挂牌价保持在 $0.80 和 $3.20,而供应商自有平台上的价格是 $2.50 和 $7.50,那么这一差异就是一项渠道决策,在依据其中任何一个数字构建成本模型之前,都值得先弄明白。

第三点是,“可能变更,恕不另行通知”在实践中实际意味着什么。一个月内被修订两次的预览版,与在季度末被冻结并重新命名的预览版,是两种不同的工具,而变更日志正是最先体现这一点的地方。

这一切都不构成反对尝试它的理由。一个 100 万 token 的多模态模型,以每项任务 0.24 美元的成本报告出接近前沿水平的分数,值得你花一个下午,用你自己的提示词做一番实打实的测试,而这项评估的成本比围绕它的争论还低。它反对的是这样一种假设:你这周做基准测试的模型,就是你下周拿到的模型——对于一个厂商自己都称为预览版的发布而言,这是唯一必须成立的假设。

预览版本正是自动故障转移所针对的场景:自动故障转移能把一个在周中悄然发生变化的模型变成一次配置变更,而不是一次服务中断。