一張為「Spark-X2.5-4B 與 Spark-X2.5-1.7B」設計的主視覺標題卡,副標題為「具備原生 1M 上下文的輕量型裝置端代理模型」。左側有一個結合手機與筆電的小型裝置圖示,中間橫跨一個圓角上下文視窗膠囊標籤,標示「1M 詞元」,右側則列出「200+ 種語言」、「Apache 2.0」與「Day-0 vLLM」。OrcaRouter 標誌合成於右下角。
Guides & Insights

Spark-X2.5-4B 與 Spark-X2.5-1.7B:具備原生 1M 上下文的輕量裝置端代理模型

作者

Magnus Corvin

發佈日期

最新模型 · 20查看全部模型
基準測試:Artificial Analysis · 每日更新
返回全部文章

Spark-X2.5-4B 與 Spark-X2.5-1.7B 於 2026 年 9 月 1 日正式公開,當天 iFlytek(科大訊飛)旗下的 SparkLLM——XHToken(詞元星火)子公司——以 Apache 2.0 授權開源了這兩款緊湊型模型,權重、程式碼與部署文件同日上架 Hugging Face 和 GitHub。最受矚目的規格是原生 1,000,000 token 的上下文視窗,且模型體積小到足以在裝置端運行,並號稱具備 200+ 語言詞彙,以及供應商聲稱專為智慧體(agentic)任務調校的混合注意力設計。目前能從程式庫中確認的資訊相當可觀;但尚未得到證實的,是那些唯有獨立基準測試才能定論的一切——畢竟一款幾小時前才發布的模型,還沒有任何中立的評測。X2.5 家族還有一位更大的成員即將到來——Spark-X2.5-293B,已宣布將於 9 月 7 日推出。

這些儲存庫實際顯示的內容

Hugging Face 系列包含六個儲存庫:指令微調的 Spark-X2.5-4B 與 Spark-X2.5-1.7B、它們的基礎檢查點,以及兩者的 GGUF 轉換版本。4B 模型卡描述了一種混合注意力架構——每三個滑動視窗注意力層配置一個全注意力層——這正是當行銷數字為 1M 令牌時所需的形狀,因為否則對一百萬個令牌進行全注意力運算會產生平方級的昂貴成本。該模型卡說明原生上下文視窗可達 1M 令牌,並在預訓練階段透過長上下文訓練階段將序列長度延伸至 1M。

架構:混合注意力,每三個滑動視窗層設有一個全注意力層;BF16 safetensors。

上下文 — 原生支援最多 1,000,000 個 token;長上下文訓練的序列長度達 1M。

語言 — 超過200種,根據模型卡(1.7B也聲稱如此)。

預訓練 — 約 20 兆個 token,涵蓋網頁、書籍、學術出版物、程式碼與百科全書資料,並在 Huawei Ascend 叢集上進行端到端訓練。

後訓練——先進行SFT,再進行涵蓋推理、程式設計、代理行為與指令遵循的大規模RL,並透過論文中所稱的MOPD技術整合領域策略。

授權 — 兩種尺寸均採用 Apache 2.0 授權,不含其他幾家中國實驗室在開放釋出時附加的那種收益或地區條款。

A single-column scoreboard titled 'Spark-X2.5-4B — the scoreboard'. Six rows read 'Context: 1M native', 'Languages: 200+', 'License: Apache 2.0', 'AIME 2026: 90.7 (vendor)', 'Agent BFCL-V4: 65.1 (vendor)', 'Frameworks: vLLM, SGLang, MLX'. A footer reads 'Vendor-reported figures; no independent scores yet.' The OrcaRouter logo is composited in the bottom-right corner.

代理數字——以及應該多大程度信任它們

模型卡發布了完整的代理與推理基準測試表,而這些數據全部由廠商自行報告且未經複測——請如實標註這點,因為對一個剛發布一天的 4B 模型而言,有趣的問題在於這些成績有多少能經得起獨立評測的考驗。在廠商自己的表格中,Spark-X2.5-4B 在 BFCL-V4(函式呼叫)上得分 65.1,在 τ²-bench(長時程代理任務)上得分 75.1,BrowseComp 得分 40.9,SWE-Bench Pro 得分 44.4,AIME 2026 得分 90.7,HMMT February 2026 得分 81.2,IMO-AnswerBench 得分 74.2,GPQA 得分 67.4。1.7B 版本則在智慧家庭測試中迎來它的高光時刻:在 Domux 資料集上達到 90.3% 的端到端指令準確率,平均延遲 0.85 秒。廠商還宣稱 4B 在演算法實作、程式碼補全與生成方面「能與體積大 2 到 3 倍的雲端模型匹敵」——這句話既是發布內容中最有用的一句話,也是最需要中立檢視的一句話。

A screenshot of the Hugging Face model card for XHToken/Spark-X2.5-4B, showing the SparkLLM organization header, the TextGeneration tag, Transformers & Safetensors formats, and the introduction text describing Spark-X2.5-4B and Spark-X2.5-1.7B as compact general-purpose models for conversation, writing, translation, reasoning, coding, tool use and agentic workflows.

比任何單一數字在結構上更有趣的是,這個版本從一開始就鎖定代理(agent)用途。模型卡列出了與 Codex、Claude Code、OpenClaw 和 Hermes 框架的整合、在 SGLang 中配備專用解析器的工具呼叫支援,以及預設啟用的推理能力(一個執行時期旗標,enable_thinking,可將其關閉)。換句話說,該廠商將一款 4B 模型定位為工具使用模型,而非聊天機器人,這是個真正的賭注:小型代理模型才是裝置端市場實際的發展方向。

Day-0 生態系統,以及 vLLM 的故事

Spark-X2.5-4B 和 Spark-X2.5-1.7B 從一開始就透過樹外(out-of-tree)通用外掛程式而非上游合併的方式獲得 vLLM 支援。整合程式碼位於 XHToken/Spark-plugin 儲存庫中:你將其複製並uv pip install .,接著使用vllm serve--trust-remote-code搭配自訂聊天範本來服務模型。SGLang 的作法則是使用預先建置的 Docker 映像檔啟動,並搭配--tool-call-parser spark25--context-length 1048576——即啟動指令中完整的百萬 token 上下文視窗,這是在真實硬體上快速驗證上下文長度宣稱的最快方式。

A screenshot of the XHToken/Spark-X2.5 GitHub repository, showing the repo header 'Spark-x2.5 open model series', the tagline 'Pushing the Limits of Agentic Capabilities in On-Device Models', and the file tree with agent, huggingface, llamacpp, modelscope, ollama, sglang, transformer and vllm directories alongside the LICENSE file.

除了 vLLM 與 SGLang 之外,該模型也能在 llama.cpp 分支、MLX(Apple silicon 與 Linux CPU)、Ollama 及 LM Studio 上透過 GGUF 執行,並可經由 LLaMA-Factory 分支進行微調。硬體支援是另一項重點:NVIDIA、Huawei、Hygon 與 HOUMO.AI——加上 Apple silicon——這之所以重要,是因為中國實驗室的模型能在發佈當天就隨附 Ascend、Hygon 與國產晶片的部署文件,而非只是承諾,實屬罕見。

裝置端 1M-token 模型的用途是什麼

上下文長度正是其賣點,而且它瞄準的是具體的工作。4B 模型擁有百萬 token 的原生上下文,意謂著整個程式碼庫或一組長篇文件都能載入本機運行的模型中——不需要 RAG 管線,也不需要分塊處理。供應商自家的示範建立在其 Loomy 辦公工具之上,讓 4B 撰寫腳本來彙整銷售試算表、提取關鍵指標與趨勢,並生成一份約 3,000 字的雙語報告。機器人應用則是另一半重點:兩種尺寸都定位在機器人端與邊緣的感知與執行,涵蓋控制、目標追蹤與導航;這對於一個能在不到一秒內回應的 1.7B 模型來說,是個合理的利基。

更大的布局:Spark-X2.5-293B

這兩個小模型只是開場棋步。9月7日,SparkLLM 宣布將發布 Spark-X2.5-293B,這是一個擁有2930億參數的基礎模型,根據公告,其編碼與 Agent 能力均有升級。X2.5 小模型實際上是雙層架構故事中的裝置端那一半;大模型才是決定整個系列天花板的關鍵。若將 4B 與 1.7B 視為這次發布的全部內容,就會錯失整體的發展方向。

如何試用,以及要注意什麼

API 已在科大訊飛的星火 MaaS 平台上線,並限時免費;模型權重已可在 Hugging Face、ModelScope 和 Ollama library 取得。在路由方面,Spark-X2.5-4B 太新,目前還沒有任何聚合器提供它——OrcaRouter 今天不會路由它,本頁任何內容都不應被解讀為它已可路由。但當某個已路由的提供者加入它時,經濟效益就會以可預測的方式改變:OrcaRouter 以 0% 加成轉傳提供者的牌價,所以供應商定價多少,你就支付多少,使用你原本就在用的 API key,而且自動故障轉移所以一個第 0 天的模型永遠不必成為生產環境的賭注。這就是本部落格看待全新模型的標準方式,值得明白說清楚。

有四件事將決定這次發布會成為一個重要時刻,還是淪為一則註腳。第一,獨立評測——Artificial Analysis 指數條目、競技場排名、可重現的 τ²-bench 測試——是否與供應商公布的數據相去不遠;一個 4B 模型在 AIME 上拿到 90.7 分是個很大的數字,而發布日規格表上的大數字,正是最容易被拿出來檢驗的那種。第二,百萬 token 的上下文長度在混合注意力技術棧上,於真實推論服務負載下是否依然站得住腳,而不只是在啟動指令中表現亮眼。第三,以 Ascend 訓練出的權重在實際場域的 NVIDIA 硬體上表現是否正常。第四,Spark-X2.5-293B 在 9 月 7 日究竟會交出什麼樣的成績。在此之前,對 Spark-X2.5-4B 和 Spark-X2.5-1.7B 最誠實的總結是:前景可期、開放,但完全未經證實——而對於今天早上才發布的模型來說,這正是正確的狀態。