
Spark-X2.5-4B 和 Spark-X2.5-1.7B:拥有原生 1M 上下文的紧凑型端侧智能体模型
- orca新Orca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 每百万 tokens
- deepseek新DeepSeek: DeepSeek V4.1 Flash2026-09-1040智能
- openai新OpenAI: GPT-6 Astra2026-09-0453智能77代码
- googleGoogle: Gemini 3.8 Flash2026-09-0241智能76代码
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245智能76代码
- anthropicAnthropic: Claude Fable 5.12026-09-0153智能82代码
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 每百万 tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642智能72代码
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 每百万 tokens
- z-aiZ.ai: GLM 5.32026-08-1845智能75代码
- obsidianQwen3.8 27B2026-08-1534智能68代码
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236智能69代码
- grokSpaceXAI: Grok 4.62026-08-1244智能77代码
- metaMeta: Muse Spark 1.22026-08-0540智能72代码
- qwenQwen: Qwen3.8 Max2026-08-0345智能76代码
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135智能69代码
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 每百万 tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2451智能78代码
Spark-X2.5-4B 和 Spark-X2.5-1.7B 于 2026 年 9 月 1 日公开发布。当天,科大讯飞的子公司 XHToken(词元星火)即 SparkLLM 在 Apache 2.0 许可下将这两款紧凑型模型开源,权重、代码和部署文档同日上线 Hugging Face 和 GitHub。最引人注目的规格是原生 1,000,000 token 上下文窗口,且模型足够小,可在设备端运行;厂商还声称其支持 200 多种语言词汇,并采用了针对智能体工作调优的混合注意力设计。如今从代码库中能了解到的信息已相当丰富;但尚未确认的则是那些只有独立基准测试才能判定的一切,因为几小时前刚发布的模型还没有任何中立评估。X2.5 系列还有一个更大的成员即将到来——Spark-X2.5-293B,已宣布将于 9 月 7 日发布。
这些仓库实际展示的内容
Hugging Face 集合包含六个仓库:经过指令微调的 Spark-X2.5-4B 和 Spark-X2.5-1.7B、它们的基础检查点,以及两者的 GGUF 转换版本。4B 模型卡描述了一种混合注意力架构——每三个滑动窗口注意力层对应一个全注意力层——当营销数字是 1M token 时,这正是你想要的形状,因为否则对一百万个 token 进行全注意力计算将是二次方级别的昂贵。该模型卡声明原生上下文窗口最高可达 1M token,并在预训练阶段通过长上下文训练阶段将序列长度扩展到 1M。
• 架构 — 混合注意力,每三个滑动窗口层设一个全注意力层;BF16 safetensors。
• 上下文 — 原生支持高达1,000,000个token;长上下文训练将序列扩展到了1M。
• 语言——超过200种,据模型卡片所述(1.7B版本也声称如此)。
• 预训练——涵盖约20万亿token的网页、书籍、学术出版物、代码和百科全书材料,在Huawei Ascend集群上实现了端到端训练。
• 后训练——先进行SFT,再进行大规模RL,涵盖推理、编码、智能体行为和指令遵循,并通过论文中称为MOPD的技术整合领域策略。
• 许可证 — 两种尺寸均采用 Apache 2.0 许可,不含其他几家中国实验室在开放版本中附加的那种收入或地区条款。

智能体数字——以及多大程度上信任它们
模型卡发布了一张完整的智能体与推理基准测试表,而且所有数据均为供应商自行报告且未经复现——请照此标注,因为对于一个发布仅一天的4B模型而言,有趣的问题在于这些结果能否经受住独立评估的检验。在供应商自己的表格中,Spark-X2.5-4B 在 BFCL-V4(函数调用)上得分 65.1,在 τ²-bench(长时程智能体任务)上为 75.1,BrowseComp 上为 40.9,SWE-Bench Pro 上为 44.4,AIME 2026 上为 90.7,HMMT February 2026 上为 81.2,IMO-AnswerBench 上为 74.2,GPQA 上为 67.4。1.7B 版本则在智能家居测试中迎来高光时刻:在 Domux 数据集上实现了 90.3% 的端到端命令准确率,平均延迟 0.85 秒。供应商还声称,4B 模型在算法实现、代码补全和生成方面“可与规模为其 2–3 倍的云端模型相匹敌”——这句话既是整份发布中最有用的一句话,也最需要中立验证。

从结构上看,比任何单一数字都更有趣的是,该版本从一开始就面向智能体(agent)。该卡列出了与 Codex、Claude Code、OpenClaw 和 Hermes 框架的集成、在 SGLang 中通过专用解析器实现的工具调用支持,以及默认启用的推理能力(一个运行时标志,enable_thinking可将其关闭)。换句话说,厂商将 4B 定位为工具使用模型,而非聊天机器人,这确实是一场豪赌:小型智能体模型才是端侧市场真正的发展方向。
Day-0 生态系统与 vLLM 的故事
Spark-X2.5-4B 和 Spark-X2.5-1.7B 从一开始就通过树外通用插件(而非上游合并)在 vLLM 中得到支持。该集成位于 XHToken/Spark-plugin 仓库中:你克隆它并uv pip install .,然后用vllm serve和--trust-remote-code,配合自定义聊天模板来服务模型。SGLang 路径是使用--tool-call-parser spark25和--context-length 1048576启动的预构建 Docker 镜像——启动命令中的完整百万 token 窗口,这是在真实硬件上快速验证上下文声明的最快方式。

除了 vLLM 和 SGLang,该模型还可在 llama.cpp 分支、MLX(Apple silicon 和 Linux CPU)、Ollama 和 LM Studio 上通过 GGUF 运行,并可通过 LLaMA-Factory 分支支持微调。硬件支持是另一大亮点:NVIDIA、华为、海光和 HOUMO.AI——再加上 Apple silicon——这一点很重要,因为中国实验室的模型很少能在发布首日就附带昇腾、海光及国产芯片的部署文档,而非仅仅停留在承诺层面。
1M-token 端侧模型是做什么的
上下文长度是这项特性的核心,它瞄准了特定的任务。在4B模型上,一百万token的原生上下文意味着可以将整个代码库或长文档集加载到本地运行的模型中——无需RAG流水线,无需分块。厂商自己的演示基于其Loomy办公工具,让4B模型编写脚本,汇总销售电子表格、提取关键指标与趋势,并生成一份约3000词的双语报告。机器人领域则是另一半:两种尺寸的模型都定位于机器人和边缘端的感知与执行,涵盖控制、目标跟踪和导航,这对于能在不到一秒内响应的1.7B模型来说是一个合理的细分市场。
更大的布局:Spark-X2.5-293B
这两个小模型只是开局。9月7日,SparkLLM宣布将发布Spark-X2.5-293B,这是一个2930亿参数的基座模型,据公告称,其编码和智能体能力均有所升级。X2.5小模型实际上是双层布局中的端侧部分;大模型才是决定整个系列天花板的所在。若将4B和1.7B模型视作本次发布的全部,就会错失其发展方向。
如何尝试它,以及需要注意什么
API 已在 iFlytek 的 Xingchen MaaS 平台上上线,并限时免费;权重已发布在 Hugging Face、ModelScope 和 Ollama 库上。在路由方面,Spark-X2.5-4B 太新了,任何聚合器都还无法提供它——OrcaRouter 目前不会路由它,本页上的任何内容都不应被解读为它已经在路由该模型。但一旦某个已路由的提供商将其加入,经济性就会以可预测的方式改变:OrcaRouter 以 0% 加价原样传递提供商的列表价格,因此供应商定价多少,你就支付多少,使用你已经在用的同一个 API 密钥,以及自动故障转移,这样一款 day-0 模型就永远不必成为生产环境中的一场赌注。这就是本博客看待全新模型的标准方式,值得明确说出来。
四件事将决定这次发布是成为高光时刻还是沦为脚注。第一,独立评估——一个Artificial Analysis指数条目、一个竞技场排名、一次复现的τ²-bench运行——能否接近供应商给出的表格数据;一个4B模型在AIME上得分90.7是一个大数字,而发布日规格表上的大数字恰恰是会被重点核查的。第二,在真实服务负载下,1M token的上下文窗口在混合注意力技术栈上能否保持稳定,而不只是在启动命令中表现良好。第三,基于Ascend训练的权重在实际部署中能否在NVIDIA硬件上表现正常。第四,Spark-X2.5-293B在9月7日实际能交付什么。在那之前,对Spark-X2.5-4B和Spark-X2.5-1.7B的诚实总结是:有前景、开放、且完全未经证实——对于今早刚发布的模型来说,这才是正确的状态。
