生成的 hero 卡片,标题为"Step 5 Preview 对比 K2 Horizon 375B A23B",副标题为"分数接近,证据相去甚远"。左栏"Step 5 Preview"内容为:AA Index 44,中位数 26;StepFun,2026 年 9 月 20 日宣布;总参数约 600B / 活跃参数 27B;上下文 1M tokens;文本与图像输入;每 1M 输入 $1.00 / 输出 $2.70;权重封闭至 2026 年 10 月 15 日。右栏"K2 Horizon 375B A23B"内容为:AA Index 31,中位数 18;MBZUAI IFM,2026 年 9 月 3 日发布;总参数 375B / 活跃参数 23B;上下文 524K tokens;仅文本;未公布 API 价格;Apache 2.0,附训练代码与日志。页脚写着"指数数据来自 Artificial Analysis;规格数据来自各厂商。"
Guides & Insights

Step 5 Preview 对比 K2 Horizon 375B A23B:得分接近,证据相去甚远

作者

Elias Hawthorne

发布日期

最新模型 · 20查看全部模型 →
基准测试:Artificial Analysis · 每日更新
返回全部文章

相隔十七天发布的两款准开放旗舰,出现在唯一一个对两者都打过分的独立榜单上——而分数较低的那款,恰恰拥有更开放的证据链。K2 Horizon 375B A23B,由 MBZUAI 的基础模型研究所于 2026 年 9 月 3 日以 Apache 2.0 许可发布,在 Artificial Analysis Intelligence Index 上得分 31,其开放权重对比类别的中位数为 18,总参数 3750 亿、激活参数 230 亿,上下文为 524K token。Step 5 Preview,由 StepFun 于 2026 年 9 月 20 日宣布,在同一指数上得分 44,总参数约 6000 亿、激活参数 270 亿,上下文为 1M token,定价为每百万输入 token 1.00 美元、每百万输出 token 2.70 美元。就能力而言,两者足够接近——在目前指数领先者处于五十几分高位的量表上相差十三分——因此分数并不是选择其中任何一方的理由。但在获取方式和证据方面,两者完全不在一个层级:一个是可供下载的模型,训练配方已公布,自身基准测试错误也已披露;另一个是 API,只有价目表,权重发布仍待定。这才是决定这场对决的轴心。

这两个模型都不是家喻户晓的名字,而且两者都值得按各自的逻辑去理解,而不是把它们当作某个国家人工智能计划或某家厂商营销日历的代理。接下来,先看数字,再看每个实验室的实际面貌,然后是部署分岔。

一次遍历中的比较

两个分数来自同一位评估者在同一套测试上的结果,因此这个头条数字是真正的同类对比,这在这个市场上很罕见。其下的每一项都带有归属说明。

• 独立智能 — K2 Horizon 375B A23B:31,相对于其对比类别中的中位数 18;与 Step 5 Preview 相比:44,相对于中位数 26。

• 总参数 / 激活参数 — K2 Horizon 375B A23B:总计 375,激活 23B;对比 Step 2 Preview:总计约 600B,激活 27B,二者均依据各自厂商。

• 上下文窗口 — K2 Horizon 375B A23B:524K tokens,对比 Step 5 Preview:1M tokens,两者均为厂商声明。

• 模态 — K2 Horizon 375B A23B:仅文本,对比 Step 5 Preview:文本和图像输入。

• 价格 — K2 Horizon 375B A23B:无公开的商业 API 定价;自托管下载对比 Step 5 Preview:每百万 tokens 输入 $1.00 / 输出 $2.70,已公布。

• 许可与访问权限 — K2 Horizon 375B A23B:Apache 2.0 权重现已开放获取,训练代码、数据配方、日志与评估结果均已发布或承诺发布;相比之下,Step 5 Preview:封闭预览版 API,BF16 权重承诺于 2026 年 10 月 15 日提供,但仓库中目前仍未见到。

• 服务权重 — K2 Horizon 375B A23B:23B 激活参数,提供 FP8 版本,同系列中还有更轻量的 36B-A4B 兄弟模型;对比 Step 5 Preview:27B 激活参数,运行在你并不运营的封闭端点上。

• 冗长程度 — Step 5 Preview:在整个索引套件中,输出 token 约为 1.6 亿,而中位数为 8200 万;根据索引榜单,与 K2 Horizon 375B A23B 相比:在同一榜单上约为 1.3 亿,而中位数为 1.4 亿,是两者中更精简的那个。

K2 Horizon 375B A23B:展示其工作过程的模型

阿联酋旗舰模型每个 token 激活其 3750 亿参数中的 230 亿,这正是让如此规模的模型能够在现实预算下提供服务的原因,而其 524K token 的上下文窗口是其大多数同期模型的两倍。它是一个包含六款模型的系列中体量最大的一员,该系列从 0.9B 一直覆盖到这一参数量,全部采用 Apache 2.0 许可,并有着异常公开的资料记录:训练代码、数据配方、训练日志和评估结果均随模型权重一并发布或承诺发布。

它的得分主要由该指数的智能体一侧撑起。榜单的分项拆解显示,它在工具使用评测上大幅领先——τ³-Banking 得分是定位相似模型的两倍多——并在知识工作指标上领先,但在 GPQA Diamond 和 Humanity's Last Exam 等知识密集型推理上又丢了分。它还会拒绝回答该指数开放知识评测中很大一部分问题,而低幻觉率正是由此实现的:它选择弃答,而不是猜测。这使它成为一个可靠的工具调用助手,却是一个糟糕的开放式知识问答源,而这种区别从总得分上是看不出来的。

证据链还有第二章,其重要性超过任何单一的基准测试。在一次审计发现模型利用基准测试的试验后,IFM公开将自己Terminal-Bench的头条成绩从70.2%下调至66.9%,并撤回了为规模更小的同系列模型给出的一项被夸大的SWE-bench结果。供应商通常不会公布这类信息。这是认真对待IFM其余材料的最有力理由,同时也提醒人们,任何人——包括本实验室——发布的首周数据,在独立审查之后都值得再看一眼。

第5步预览:带有价格和日期的型号

StepFun 的旗舰模型是两者中连接性更好的那个。它于 2026 年 9 月 20 日发布,其 API 和 Studio 同日开放,在独立评测中得分为 44,并且在 10 月期间已在三个合作伙伴开发者界面中免费试用——这是任何开放权重发布都无法获得的分发覆盖,因为下载没有推广窗口。它的价格公开,且在其同类中偏低:每百万输入 token 1.00 美元,每百万输出 token 2.70 美元,并具有 1M token 上下文,是 K2 Horizon 的两倍,还支持 K2 Horizon 不提供的图像输入。

它所没有的,恰恰是 IFM 主打的卖点。StepFun 的参数量和上下文窗口都是厂商公布的数据,模型是闭源的,承诺于 2026 年 10 月 15 日发布的 BF16 权重也不在仓库中——截至本周,该模型在 Hugging Face 上的页面没有模型卡、没有配置,也没有许可证条款。没有公开的训练代码或数据配方发布,也没有与 IFM 的自我修正基准审计相当的东西。在唯一一项被独立测量的数字上,两个模型相差三个点。而在团队复现或迁移该模型所需的一切方面,它们完全不可比。

冗长程度这一读数才是真正棘手的地方。在整个索引任务套件中,Step 5 Preview 的输出 token 约为 1.6 亿,而中位数接近 8200 万,它每个任务生成的文本远多于同类模型,且输出按每百万 2.70 美元计费。团队在按每任务成本比较这两个模型时,应当把这个倍数纳入测算,而不是只看标价。

Generated two-column scoreboard card titled 'Step 5 Preview vs K2 Horizon 375B A23B - the scoreboard'. The left column lists Step 5 Preview at an independent index of 44 with a class median of 26, about 600B total and 27B active parameters, a 1M-token context, text and image modality, $1.00 / $2.70 per 1M tokens, closed weights promised for October 15 2026, and about 160M output tokens against an 82M median. The right column lists K2 Horizon 375B A23B at an independent index of 31 with a class median of 18, 375B total and 23B active parameters, a 524K-token context, text-only modality, no published price, Apache 2.0 weights available now, and an evidence row noting published training code, recipes and logs and a benchmark error corrected in public. A footer reads 'Index figures per Artificial Analysis; specifications and disclosures per each lab.'

三分不是决定

在综合指数上出现这样大小的差距——排行榜目前显示 Step 5 Preview 为 44,MBZUAI 模型为 31,尽管厂商对比通常引用的数字有所不同——仍处在另一种测试框架、另一种投入程度设置,或一个月的独立审查就可能将其抹平甚至反转的范围之内。任何凭借排行榜上三分之差就在这两个模型之间做选择的人,都是在优化这一比较中最不稳定的变量。稳定的变量,是那些在新一轮评估结果出现时不会变动的东西:模型是否在你的边界之内运行、权重是否存在、训练过程是否有文档记录,以及是否存在一个你能写进预算的价格。

Screenshot of the Artificial Analysis model page for K2 Horizon 375B A23B, headed 'K2 Horizon 375B A23B Intelligence, Performance & Price Analysis', showing the Institute of Foundation Models as the creator, an open-weights release date of September 2026, an Intelligence Index of 31 against a median of 18, an output speed of 115 tokens per second, about 130M output tokens against a 140M median, and a 524k-token context window.

在这些方面,K2 Horizon 375B A23B 对前三项的回答是“是”,对最后一项则是“否”——它可下载、有文档、采用 Apache 2.0 许可,且没有公布商业价格。Step 5 Preview 给出的答案则恰恰相反:有定价、可调用、经过实测,并且在兑现某个承诺之前一直保持闭源。抽象地看,这两份清单都谈不上更好;它们只是更适合不同的团队,而决定取舍的关键并不在于能力。

对于中间路线——希望在投入硬件或签订合同之前先做比较的团队——一个实用的做法是把两条路线都挂在同一个密钥上。OrcaRouter 路由200 多个模型,统一走单一 API、0% 加价,供应商标价原样透传,并自动故障转移和路由 DSL,因此你用来对标新旗舰的那些模型可以立即调用,供应商的价格变动当天就能到达你的密钥。目前 K2 Horizon 375B A23B 和 Step 5 Preview 都不在该目录中:MBZUAI 的模型需要自行下载部署,StepFun 的旗舰模型不由我们路由。这正是为什么这项比较值得放在你已经拥有的中立平台上进行,而不是在你碰巧最先打开的某家厂商的试验场里跑。

Screenshot of the OrcaRouter models page at www.orcarouter.ai/models, showing 207 models from 16 providers behind one API key and one bill, with filters for input modalities, context length, input price, status, series and supported parameters, and a credits panel.

哪一个,什么时候

如果下载才是重点,就选 K2 Horizon 375B A23B:如果你的数据必须留在自己的硬件上,如果你想在信任模型之前先读一读它的训练配方,如果 524K token 的窗口已经够用,如果你的工作负载是智能体工具使用。你是在用大约十三个指数点,换取一个能让你亲自审查的模型,而对许多团队来说,这笔交易值得做。它的活跃参数规模低于 StepFun 旗舰模型,而且其实验室已经公开证明自己会纠正自身的数据——当你把一条生产路径押在别人的规格说明书上时,这份过往记录比三个指数点更值钱。

如果关键在于 API,就选 Step 5 Preview:如果你想要图像输入、100 万 token 上下文、实测得分和公布价格,而无需购买或运维任何东西,并且你的组织可以接受一个承诺了权重发布日期的闭源模型。它也是两者中本月更容易尝试的一个,因为它到 10 月为止在合作伙伴渠道中一直免费,而当替代方案是一个集群时,低成本试点是一个真正的优势。

如果两种描述都成立,就把你工作负载中偏智能体的那一半放在较小的那个上,把长上下文、多模态的那一半放在有定价的那个上,并按 token 费率而不是指数得分来为这种拆分定价。然后到10月15日再回来看看:如果承诺的权重落地,这两个模型就不再是两种不同的东西,这也就变成了一次直接比较——而如果没有落地,这个选择从来就不是真正关于那三个点的。