
Spark-X2.5-4B och Spark-X2.5-1.7B: Kompakta agentmodeller på enheten med en nativ 1M-kontext
- orcaNYOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1M tokens
- deepseekNYDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligens
- openaiNYOpenAI: GPT-6 Astra2026-09-0453Intelligens77Kodning
- googleGoogle: Gemini 3.8 Flash2026-09-0241Intelligens76Kodning
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Intelligens76Kodning
- anthropicAnthropic: Claude Fable 5.12026-09-0153Intelligens82Kodning
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1M tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligens72Kodning
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1M tokens
- z-aiZ.ai: GLM 5.32026-08-1845Intelligens75Kodning
- obsidianQwen3.8 27B2026-08-1534Intelligens68Kodning
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Intelligens69Kodning
- grokSpaceXAI: Grok 4.62026-08-1244Intelligens77Kodning
- metaMeta: Muse Spark 1.22026-08-0540Intelligens72Kodning
- qwenQwen: Qwen3.8 Max2026-08-0345Intelligens76Kodning
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135Intelligens69Kodning
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 per 1M tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2451Intelligens78Kodning
Spark-X2.5-4B och Spark-X2.5-1.7B blev offentliga den 1 september 2026, när SparkLLM — XHToken-dotterbolaget (词元星火) till iFlytek — släppte båda kompakta modellerna som öppen källkod under Apache 2.0, med vikter, kod och distributionsdokument som hamnade på Hugging Face och GitHub samma dag. Huvudspecifikationen är ett inbyggt kontextfönster på 1 000 000 tokens på modeller som är tillräckligt små för att köras på enheten, med stöd för en påstådd vokabulär som täcker 200+ språk och en hybrid-uppmärksamhetsdesign som leverantören säger är anpassad för agentarbete. Det som går att veta idag från repona är betydande; det som ännu inte är bekräftat är allt som bara oberoende benchmarktester kan fastställa, eftersom en modell som släpptes för timmar sedan ännu inte har några neutrala utvärderingar. X2.5-familjen har också en större medlem på väg — Spark-X2.5-293B, tillkännagiven för den 7 september.
Vad repon faktiskt visar
The Hugging Face-samlingen innehåller sex arkiv: instruktionsfinjusterade Spark-X2.5-4B och Spark-X2.5-1.7B, deras bascheckpoints samt GGUF-omvandlingar av båda. Kortet för 4B beskriver en hybrid-uppmärksamhetsarkitektur — ett fullt uppmärksamhetslager per tre glidfönster-uppmärksamhetslager — vilket är precis den form du vill ha när marknadsföringssiffran är 1M token, eftersom full uppmärksamhet över en miljon token annars skulle vara kvadratiskt dyr. Kortet anger ett inbyggt kontextfönster på upp till 1M token, med ett långkontextträningssteg som utökade sekvenslängden till 1M under förträningen.
• Arkitektur — hybrid attention, ett full-attention-lager per tre sliding-window-lager; BF16 safetensors.
• Kontext — nativt upp till 1 000 000 tokens; långkontextträning körde sekvenser till 1M.
• Språk — fler än 200, enligt modellkortet (1.7B delar påståendet).
• Förträning — ungefär 20 biljoner token av webbsidor, böcker, vetenskapliga publikationer, kod och encyklopediskt material, tränat från början till slut på Huawei Ascend-kluster.
• Efterträning — SFT följt av storskalig RL inom resonemang, kodning, agentiskt beteende och instruktionsföljning, med domänpolicyer konsoliderade via en teknik som artikeln kallar MOPD.
• Licens — Apache 2.0 för båda storlekarna, utan intäkts- eller regionklausuler av det slag flera andra kinesiska labb kopplar till öppna releaser.

Agentnumren — och hur mycket man kan lita på dem
Modellkortet publicerar en fullständig tabell över agent- och resonemangsbenchmark, och den är genomgående leverantörsrapporterad och inte oberoende reproducerad – märk den på det sättet, eftersom den intressanta frågan för en dag gammal 4B är om något av det överlever kontakt med oberoende utvärderingar. På leverantörens egen tabell får Spark-X2.5-4B 65,1 på BFCL-V4 (funktionsanrop), 75,1 på τ²-bench (långsiktiga agentuppgifter), 40,9 på BrowseComp, 44,4 på SWE-Bench Pro, 90,7 på AIME 2026, 81,2 på HMMT februari 2026, 74,2 på IMO-AnswerBench och 67,4 på GPQA. 1.7B-modellen får sitt ögonblick i ett smarta-hem-test: 90,3 % kommandonoggrannhet från början till slut vid en genomsnittlig latens på 0,85 sekunder på Domux-setet. Leverantören hävdar också att 4B-modellen ”konkurrerar med molnmodeller som är 2–3 gånger större” när det gäller algoritmimplementation, kodkomplettering och kodgenerering – ett påstående som samtidigt är den mest användbara meningen i releasen och den som mest behöver en neutral kontroll.

Det som är strukturellt mer intressant än något enskilt nummer är att utgåvan riktar sig till agenter redan från start. Kortet listar integration med Codex-, Claude Code-, OpenClaw- och Hermes-ramverken, stöd för verktygsanrop med en dedikerad parser i SGLang, och resonemang aktiverat som standard (en körningsflagga, enable_thinking, stänger av det). Med andra ord har leverantören positionerat en 4B som en modell för verktygsanvändning, inte en chatbot, vilket är en verklig satsning: små agentmodeller är där marknaden för enhetsbaserade modeller faktiskt rör sig.
Day-0-ekosystem och vLLM-historien
Spark-X2.5-4B och Spark-X2.5-1.7B stöds i vLLM från dag ett via en generell plugin utanför trädet snarare än en uppströmsmerge. Integrationen ligger i XHToken/Spark-plugin-repot: du klonar det och uv pip install ., sedan kör du modellen med vllm serve och --trust-remote-code mot en anpassad chattmall. SGLang-vägen är en förbyggd Docker-avbild som startas med --tool-call-parser spark25 och --context-length 1048576 — ett fullt fönster på en miljon tokens i startkommandot, vilket är det snabbaste sättet att verifiera kontextanspråket på riktig hårdvara.

Utöver vLLM och SGLang körs modellen på llama.cpp-grenen, MLX (Apple silicon och Linux CPU), Ollama och LM Studio via GGUF, med finjustering som stöds genom en LLaMA-Factory-gren. Hårdvarustödet är den andra stora nyheten: NVIDIA, Huawei, Hygon och HOUMO.AI — plus Apple silicon — vilket är betydelsefullt eftersom det är ovanligt att en modell från ett kinesiskt labb levereras med Ascend-, Hygon- och inhemska chipdokumentationer från dag ett, inte som ett löfte.
Vad en 1M-token-modell på enheten är till för
Kontextlängden är funktionen, och den pekar på specifika arbetsuppgifter. En miljon tokens av inbyggd kontext på en 4B innebär en hel kodbas, eller en lång dokumentuppsättning, inläst i en modell som körs lokalt – ingen RAG-pipeline, ingen chunkning. Leverantörens egen demonstration, byggd på dess Loomy-kontorsverktyg, får 4B-modellen att skriva ett skript som aggregerar ett säljkalkylblad, extraherar viktiga mätetal och trender samt genererar en cirka 3 000 ord lång tvåspråkig rapport. Robotvinkeln är den andra hälften: båda storlekarna är positionerade för perception och exekvering på roboten och i edge-miljöer – detta omfattar styrning, målföljning och navigering – vilket är en tänkbar nisch för en 1.7B som svarar på under en sekund.
Den större satsningen: Spark-X2.5-293B
De två små modellerna är öppningsdraget. Den 7 september säger SparkLLM att man kommer att släppa Spark-X2.5-293B, en basmodell med 293 miljarder parametrar som enligt tillkännagivandet har uppgraderade kodnings- och agentfunktioner. De små X2.5-modellerna är i praktiken enhetshalvan i en tvådelad historia; den stora modellen är där familjens tak sätts. Att betrakta 4B och 1.7B som hela releasen skulle missa färdriktningen.
Hur du testar det, och vad du ska titta efter.
API:et är live på iFlyteks Xingchen MaaS-plattform och gratis under en begränsad tid; vikterna finns på Hugging Face, ModelScope och Ollama-biblioteket. På routing-sidan är Spark-X2.5-4B för ny för att någon aggregator ska kunna servera den ännu — OrcaRouter routar den inte idag, och inget på denna sida ska läsas som om den gjorde det. Men den dag en routad leverantör lägger till den, förändras ekonomin på ett förutsägbart sätt: OrcaRouter skickar vidare leverantörens listpris med 0% påslag, så vad leverantören än sätter för pris är vad du betalar, med samma API-nyckel som du redan använder, och automatisk failover så en dag-0-modell behöver aldrig vara en produktionssatsning. Det är så den här bloggen brukar se på en helt ny modell, och det är värt att säga rent ut.
Fyra saker avgör om den här releasen blir ett ögonblick eller en fotnot. För det första: om oberoende utvärderingar — en Artificial Analysis-indexpost, en arenaplacering, en reproducerad τ²-bench-körning — kommer i närheten av leverantörens tabell; att en 4B-modell får 90,7 på AIME är en stor siffra, och stora siffror från lanseringskortet är precis de som kontrolleras. För det andra: om 1M-token-kontexten håller måttet i hybrid-attention-stacken vid verkliga serveringslaster, inte bara i lanseringskommandot. För det tredje: om de Ascend-tränade vikterna beter sig på NVIDIA-hårdvara ute i fält. För det fjärde: vad Spark-X2.5-293B faktiskt levererar den 7 september. Till dess är den ärliga sammanfattningen av Spark-X2.5-4B och Spark-X2.5-1.7B att de är lovande, öppna och helt overifierade — vilket, för en modell som släpptes i morse, är rätt status.
