
Spark3 泄露:iFLYTEK 的 1.7B 和 4B 小模型正在接入 vLLM
- DeepSeek新DeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.15 / $0.29 每百万 tokens
- z-ai新Z.ai: GLM 5.32026-08-1860智能75代码
- obsidian新Qwen3.8 27B2026-08-1552智能68代码
- qwen新Qwen: Qwen3.8 27B (free)2026-08-13qwen/qwen3.8-27b-free
- deepseek新DeepSeek: DeepSeek V4 Pro 08132026-08-1253智能69代码
- grok新SpaceXAI: Grok 4.62026-08-1261智能77代码
- metaMeta: Muse Spark 1.22026-08-0557智能72代码
- qwenQwen: Qwen3.8 Max2026-08-0358智能72代码
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3152智能69代码
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 每百万 tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463智能78代码
- googleGoogle: Gemini 3.6 Flash2026-07-2152智能69代码
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137智能49代码
- metaMeta: Muse Spark 1.12026-07-1653智能71代码
- kimiMoonshotAI: Kimi K32026-07-1560智能76代码
- openaiOpenAI: GPT-5.6 Luna2026-07-0952智能71代码
- openaiOpenAI: GPT-5.6 Terra2026-07-0957智能77代码
- openaiOpenAI: GPT-5.6 Sol2026-07-0961智能77代码
Spark3没有公开的权重,没有模型卡片,也没有官方公告——然而本周,一个拉取请求被合入vLLM推理引擎,以惊人的细节描述了两个模型:{{2}}Spark3-1.7B{{/2}}和{{3}}Spark3-4B{{/3}}。vLLM仓库中的拉取请求#53373,题为{{1}}"[Model] Add Spark3 Model,"{{/1}},为Spark3架构添加了原生服务支持:滑动窗口注意力、四级可控思考预算、两种尺寸均原生支持百万级token上下文,以及一个指向{{4}}iFLYTEK{{/4}}的模型ID。以上内容均未得到供应商的确认,也没有任何东西正式发布。这是一篇基于目前已知信息的报道:拉取请求是真实存在的,但在{{5}}iFLYTEK{{/5}}——或任何发布Spark3的机构——真正发布权重之前,关于这些模型的所有说法都未经证实。
泄露:一个读起来像规格说明书的拉取请求
这一信号是一个开放的 vLLM PR,由名为 KnightYao 的 GitHub 用户(一位常驻合肥的贡献者,其资料列出中国科学技术大学)提交,截至 2026 年 8 月 23 日尚未合并。8 月 22 日,一位 vLLM 维护者要求修改,并附注“暂缓讨论”。该 PR 尚处于早期且存在争议,这对这类集成来说属正常现象——而且就一个针对实验室外无人能下载的模型的框架 PR 而言,它也显得异常详细。
该diff涉及八个文件。它在vLLM的模型执行器中添加了Spark3ForCausalLM实现,在vLLM的配置与模型注册表中注册了原生Spark3Config,支持滑窗注意力与全局注意力,以及按头的注意力输出门控,支持张量并行与流水线并行的权重加载,并新增了一个Spark3 XML工具解析器,以便能够以结构化方式解码模型的工具调用。它还在vLLM的支持模型文档中添加了一行,将检查点列为XHToken/Spark3-1.7B。描述甚至声称该集成经过了基准测试:在作者的测试环境中,500个并发请求,100%成功,大约每秒106个请求,每秒13.5K个输出token。这些数字由撰写PR的人自行报告,并非独立的基准测试结果,应当以这样的角度来理解。
为什么 iFLYTEK 是显而易见——但未经证实——的母公司
PR 中完全没有提及供应商。{{1}}但它注册的检查点 ID XHToken/Spark3-1.7B 位于 Hugging Face 的 XHToken 组织名下,而该组织正是 iFLYTEK 的{{/1}}:{{2}}该组织页面将其列为一家公司,链接到 opensource.iflytek.com,目前显示零个公共模型和零个公共数据集{{/2}}。{{3}}"XH" 是星火 (Xinghuo, "Spark") 的自然缩写{{/3}},{{4}}即 iFLYTEK 的模型系列{{/4}}。{{5}}再加上作者位于合肥——iFLYTEK 的总部就在合肥——在供应商确认之前,这一推断已经强到无以复加{{/5}}。
这符合科大讯飞近期的模式。该公司于2026年2月发布的Spark X2明确瞄准教育、医疗、汽车和智能体应用场景,其SparkAuto-EMM端侧模型系列提供从0.5B到7B的小尺寸版本。在这份新闻稿曝光的两天前,即8月21日的中期业绩发布会上,科大讯飞表示,一款完全基于国产算力构建的新旗舰通用模型即将推出,分阶段版本预计"于8月底"发布,全面上线则在10月的1024开发者日。Spark3-1.7B和Spark3-4B究竟是该分阶段发布的一部分,还是一条独立的端侧产品线,这份新闻稿并未给出答案。

据说模型是什么
该PR的声明,均未经核实:
• 两种规格。 Spark3-1.7B 和 Spark3-4B。两者均被描述为效率优先的设计,采用滑动窗口注意力机制,而非密集的全注意力布局。
• 两者均原生支持100万token上下文。这并非扩展模式的承诺——PR说明该上下文是架构原生的,意味着一个足够小、可在单个GPU上运行的模型就能支持百万token。
• 四级思考预算。推理可设置为无、低、中或高,这是一种可切换思考的设计,让应用能在推理深度与延迟及每次调用成本之间进行权衡。
• 支持200多种语言,具备中国考试实力。该新闻稿声称其在K-12和高考答题方面表现强劲——鉴于该公司的教育业务,这是iFLYTEK的标志性特色——并覆盖200多种语言。
• 编码与智能体导向。声称具备强大的代码生成、工具使用、多步执行,以及与其规模相称的长上下文推理能力,并由同一 PR 中包含的 XML 工具解析器提供支持。
1.7B模型上原生的1M上下文才是值得注意的地方
上下文长度是小模型一直难以突破的地方。在当前的开源权重模型中,1.7B–4B 的模型通常配备 32K–256K 的原生窗口:Qwen3 的小型检查点原生为 32K,通过 RoPE 缩放可达 131K,而 Qwen3.5 在小尺寸变体上原生支持 256K 的改进也只是最近的一步。百万 token 的上下文至今仍是大模型的专属特性——GLM 的 1M 上下文检查点拥有数千亿参数。如果 Spark3 真的能在 4B 模型上交付原生 1M 窗口,那将是一个真正罕见的规格,而滑动窗口注意力架构正是让其在内存上变得廉价的关键。但必须同时说明的是:原生 1M 这个宣传数字在 PR 里写起来很容易,在实践中真正好用却很难。长上下文质量——模型是否真的能找到并利用 700K token 之前的事实——与窗口能容纳多少 token 是两个不同的问题,而且目前还没有任何独立的评估。
可控的思考预算之所以重要,也是出于同样的原因。四个推理等级(无/低/中/高)是一种可切换思考的设计,与 Qwen3 的开/关思考模式一脉相承,但更丰富:它不是二选一,应用可以为每个请求选择一个等级——翻译时无需思考,多步智能体任务则用高等级——并且只为所需的推理付费。对于智能体或批处理工作负载来说,这正是把“能力强但昂贵”的小模型变成成本可控模型的旋钮。
后训练配方符合2026年的模式
该 PR 称,Spark3 使用“Scaled Reinforcement Learning 和 MOPD”进行了后训练。MOPD(Multi-Teacher On-Policy Distillation,多教师在线策略蒸馏)是一种真实存在且时下流行的技术,在 arXiv 论文(2606.30406)中有描述:并行训练多个领域专家的 RL 教师,然后在学生模型自身的 rollout(采样轨迹)上将其蒸馏回一个学生模型,并针对每个 prompt 最小化与正确教师之间的逐 token 反向 KL 散度。这是 2026 年的配方,让单个模型能够继承数学、编码和智能体技能,而不会让各次 RL 运行相互冲突;MiMo Flash V2、DeepSeek V4 和 Nemotron 3 Ultra 等模型的后训练也都公开归功于这一技术。Spark3 引用同样的配方,使其跻身于那一代——小型模型、前沿后训练技术。这也意味着“强大的编码和智能体能力”的说法背后有合理的机制支撑。但合理并不等于已被证实:在权重公布、独立评估开展之前,这些说法仍只是供应商的报告。
真正未知之物
几乎所有带日历的东西:
• 发布日期。Hugging Face 上没有权重,没有公告,没有时间表。XHToken 组织今天为空。
• 厂商确认。 iFLYTEK 对 Spark3 只字未提。XHToken 组织链接是强有力的证据,而非官方声明。
• 这是否就是分阶段旗舰。iFLYTEK“八月底”新旗舰的分阶段版本可能就是这款——或者与此无关。新闻稿中完全没有给出日期。
• 定价与许可。没有披露任何信息。iFLYTEK 的 Spark 系列历来主要通过 API 提供服务,而非开放权重,因此 Spark3-1.7B 和 Spark3-4B 是开放检查点还是内部服务目标,仍是一个悬而未决的问题。
• 每一项基准测试。PR中的吞吐量数据只是作者自己的服务测试,而非独立评估;由于模型没有公开发布,目前没有任何排行榜对该模型进行过评分。

看什么
XHToken 的 Hugging Face 组织是值得关注的发布渠道。如果这个模型是真的,它的权重——或者至少是模型卡——应该会出现在那里,而该组织从零到一拥有第一个公开仓库,就是最重要的信号。当它发生时,有几件事需要检查:
• 上下文编号。 1M 是原生的,还是通过 rope 扩展并伴有质量权衡?PR 说是原生的;模型卡才是决定这一点的地方。
• 思考预算 API。四种推理级别如何呈现——作为采样参数、聊天模板字段,还是独立模型变体——决定了其实际使用的难易程度。
• 许可证。开放权重将使 Spark3 成为首款支持原生 1M 上下文、可自托管的 5B 以下参数模型;仅限 API 的发布则会使其成为另一类产品。
• iFLYTEK 的公告日程。分阶段发布的旗舰产品承诺于8月底前推出,全面发布则定于10月的1024开发者日。如果 Spark3 属于其中任何一个,官方描述将会说明新闻稿中未明确的内容。
• PR 是否会被合并。vLLM 支持作为质量信号和基础设施都很重要:作为首个原生支持 Spark3 的运行时,它能让模型在权重发布当天即可在生产环境运行。
开发者现在应该做什么
什么都没有。没有模型可调用,没有权重可下载,没有API密钥可配置——任何声称今天就能提供Spark3服务的工具,实际提供的都是别的东西。你现在能做的,是决定当它出现的那一天你将如何评估它,因为这个模型的承诺非常容易检验:一个能读取百万token并以四种深度推理的1.7B或4B模型,要么是真正全新的小模型类别,要么只是参数表上的故事,而这二者的区别,花一个下午在你自己的工作负载上就能衡量出来。
这也是路由层证明自身价值的地方。在 OrcaRouter 上,模型不是你要承诺的合同,而是目录中的一个条目,通过同一个 API 即可调用;提供商目录价以零加成原样透传——因此,当新模型出现在提供商目录中时,其真实价格当天就在我们这边生效,试用它不需要第二次集成,也不需要重新谈判。对于像 Spark3 这样尚未被验证的模型,合理的做法与你在任何有前景的泄露上采用的做法相同:把它放在路由 DSL 的自动故障转移后面,让一部分流量打到它,同时在规则另一侧保留一个经过验证的模型,这样一来,糟糕的评估、许可证意外或令人失望的长上下文结果只是路由变更,而不是事故。一个密钥、一个端点、200 多个模型——当 Spark3-1.7B 或 Spark3-4B 真正可运行时,透传和故障转移对它们同样适用,就像对待其他任何模型一样。
![A screenshot of vLLM pull request 53373 titled '[Model] Add Spark3 Model' on GitHub (captured August 23, 2026) showing the open PR status, the author KnightYao, the 'new-model' label, the reviewers including youkaichao, and the description 'This PR adds native support for the Spark 3 model architecture'.](https://cms.orcarouter.ai/api/media/file/4-438.png)
诚实的总结只有一句话,而非判决:本周提交的一则框架PR声称,科大讯飞(iFLYTEK)有两款原生支持百万token上下文的小模型,并配备四级思考预算,但目前没有任何实质性证据公布来支撑这些说法。关注XHToken组织,关注科大讯飞八月底的承诺;等权重真正落地后,先用带故障转移的路由规则测试,再决定是否让生产路径押注其上。这就是应对泄露的完整打法——相信基础设施,验证模型,并保持低成本的退出通道。
