
Spark-X2.5-4B en Spark-X2.5-1.7B: compacte on-device agentmodellen met een native 1M-context
- orcaNIEUWOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1 mln tokens
- deepseekNIEUWDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligentie
- openaiNIEUWOpenAI: GPT-6 Astra2026-09-0453Intelligentie77Coderen
- googleGoogle: Gemini 3.8 Flash2026-09-0241Intelligentie76Coderen
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Intelligentie76Coderen
- anthropicAnthropic: Claude Fable 5.12026-09-0153Intelligentie82Coderen
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1 mln tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligentie72Coderen
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1 mln tokens
- z-aiZ.ai: GLM 5.32026-08-1845Intelligentie75Coderen
- obsidianQwen3.8 27B2026-08-1534Intelligentie68Coderen
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Intelligentie69Coderen
- grokSpaceXAI: Grok 4.62026-08-1244Intelligentie77Coderen
- metaMeta: Muse Spark 1.22026-08-0540Intelligentie72Coderen
- qwenQwen: Qwen3.8 Max2026-08-0345Intelligentie76Coderen
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135Intelligentie69Coderen
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 per 1 mln tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2451Intelligentie78Coderen
Spark-X2.5-4B en Spark-X2.5-1.7B werden op 1 september 2026 openbaar gemaakt, toen SparkLLM — de XHToken (词元星火) dochteronderneming van iFlytek — beide compacte modellen open-sourcete onder Apache 2.0, met gewichten, code en implementatiedocumentatie die dezelfde dag op Hugging Face en GitHub verschenen. De belangrijkste specificatie is een native contextvenster van 1.000.000 tokens op modellen die klein genoeg zijn om op het apparaat te draaien, ondersteund door een beweerde woordenschat van meer dan 200 talen en een hybride-aandachtsontwerp waarvan de leverancier zegt dat het is afgestemd op agentisch werk. Wat vandaag uit de repositories bekend is, is aanzienlijk; wat nog niet is bevestigd, is alles dat alleen onafhankelijke benchmarking kan vaststellen, omdat een model dat enkele uren geleden is uitgebracht nog geen neutrale evaluaties heeft. De X2.5-familie heeft ook een groter lid op komst — Spark-X2.5-293B, aangekondigd voor 7 september.
Wat de repos daadwerkelijk tonen
De Hugging Face-collectie bevat zes repositories: de op instructies afgestemde Spark-X2.5-4B en Spark-X2.5-1.7B, hun basis-checkpoints en GGUF-conversies van beide. De modelkaart van de 4B beschrijft een hybride attention-architectuur — één full-attention-laag per drie sliding-window-attention-lagen — precies de vorm die je wilt wanneer het marketingcijfer 1M tokens is, want anders zou full attention over een miljoen tokens kwadratisch duur zijn. De modelkaart vermeldt een native contextvenster tot 1M tokens en een trainingsfase voor lange context die tijdens de pretraining de sequentielengte tot 1M verlengde.
• Architectuur — hybride aandacht, één volledige aandachtslaag per drie schuifvensterlagen; BF16 safetensors.
• Context — native tot 1.000.000 tokens; de long-context-training gebruikte sequenties tot 1M.
• Talen — meer dan 200, volgens de modelkaart (de 1.7B deelt deze bewering).
• Pretraining — ongeveer 20 biljoen tokens van webpagina's, boeken, academische publicaties, code en encyclopedisch materiaal, end-to-end getraind op Huawei Ascend-clusters.
• Post-training — SFT gevolgd door grootschalige RL op het gebied van redeneren, coderen, agentisch gedrag en het opvolgen van instructies, waarbij domeinbeleid wordt geconsolideerd via een techniek die het paper MOPD noemt.
• Licentie — Apache 2.0 voor beide groottes, zonder de omzet- of regioclausules die verschillende andere Chinese labs aan open releases koppelen.

De cijfers over agents — en in hoeverre je die kunt vertrouwen
De modelkaart publiceert een volledige benchmarktabel voor agenten en redeneren, en die is uniform door de leverancier gerapporteerd en niet onafhankelijk gereproduceerd — label het zo, want de interessante vraag voor een 4B van één dag oud is of er iets van overeind blijft bij onafhankelijke evaluaties. Op de eigen tabel van de leverancier scoort Spark-X2.5-4B 65,1 op BFCL-V4 (function calling), 75,1 op τ²-bench (langetermijn-agenttaken), 40,9 op BrowseComp, 44,4 op SWE-Bench Pro, 90,7 op AIME 2026, 81,2 op HMMT februari 2026, 74,2 op IMO-AnswerBench en 67,4 op GPQA. De 1.7B krijgt zijn moment op een smart-home-test: 90,3% end-to-end commando-nauwkeurigheid bij een gemiddelde latentie van 0,85 seconden op de Domux-set. De leverancier beweert ook dat de 4B "cloudmodellen van 2–3× zijn omvang evenaart" op algoritme-implementatie, code-aanvulling en -generatie — een bewering die tegelijkertijd de meest bruikbare zin in de release is en de zin die het meest behoefte heeft aan een neutrale toets.

Wat structureel interessanter is dan welk afzonderlijk getal ook, is dat de release vanaf het begin op agents is gericht. De kaart vermeldt integratie met de Codex-, Claude Code-, OpenClaw- en Hermes-harnesses, ondersteuning voor tool calling met een speciale parser in SGLang en standaard ingeschakelde reasoning (een runtime-vlag, enable_thinking, schakelt dat uit). Met andere woorden: de leverancier heeft een 4B als tool-use model gepositioneerd, niet als chatbot — een echte gok: small-agent-modellen zijn waar de on-device-markt zich daadwerkelijk naartoe beweegt.
Day-0-ecosysteem, en het vLLM-verhaal
Spark-X2.5-4B en Spark-X2.5-1.7B worden vanaf dag één ondersteund in vLLM via een algemene out-of-tree-plugin in plaats van een upstream-merge. De integratie bevindt zich in de repository XHToken/Spark-plugin: je clont deze en draait uv pip install .; vervolgens serveer je het model met vllm serve en --trust-remote-code met behulp van een aangepaste chat-template. Het SGLang-pad is een vooraf gebouwde Docker-image die wordt gestart met --tool-call-parser spark25 en --context-length 1048576 — een volledig venster van een miljoen tokens in het startcommando, wat de snelste manier is om de contextclaim op echte hardware te controleren.

Naast vLLM en SGLang draait het model op de llama.cpp-fork, MLX (Apple silicon en Linux-CPU), Ollama en LM Studio via GGUF, met ondersteuning voor fine-tuning via een LLaMA-Factory-fork. Hardware-ondersteuning is het andere hoofdpunt: NVIDIA, Huawei, Hygon en HOUMO.AI — plus Apple silicon — en dat is belangrijk omdat het zeldzaam is dat een model van een Chinees laboratorium vanaf dag één wordt geleverd met documentatie voor implementatie op Ascend, Hygon en binnenlandse chips, en niet als belofte.
Waarvoor een 1M-token on-device model dient
De contextlengte is het kenmerk, en het is gericht op specifieke taken. Een miljoen tokens aan native context op een 4B betekent dat een volledige codebase of een grote documentenset wordt geladen in een model dat lokaal draait — geen RAG-pipeline, geen chunking. De eigen demonstratie van de leverancier, gebaseerd op de Loomy-kantoortooling, laat de 4B een script schrijven om een verkoopspreadsheet te aggregeren, kerncijfers en trends te extraheren en een tweetalig rapport van ongeveer 3.000 woorden te genereren. De robotica-invalshoek is de andere helft: beide formaten zijn gepositioneerd voor on-robot- en edge-perceptie-en-uitvoering, waaronder besturing, doelvolging en navigatie — een aannemelijke niche voor een 1.7B die in minder dan een seconde antwoordt.
De grotere zet: Spark-X2.5-293B
De twee kleine modellen zijn de openingszet. Op 7 september zegt SparkLLM dat het Spark-X2.5-293B zal uitbrengen, een basismodel met 293 miljard parameters dat volgens de aankondiging verbeterde codeer- en agentmogelijkheden biedt. De X2.5 kleine modellen vormen feitelijk de on-device helft van een verhaal in twee lagen; het grote model bepaalt waar de bovengrens van de familie ligt. Door de 4B en 1.7B als de volledige release te beschouwen, zou men de richting van de ontwikkeling missen.
Hoe je het kunt proberen, en waar je op moet letten
De API is live op het Xingchen MaaS-platform van iFlytek en tijdelijk gratis; de gewichten staan op Hugging Face, ModelScope en in de Ollama-bibliotheek. Op het gebied van routing is Spark-X2.5-4B nog te nieuw om al door welke aggregator dan ook te worden aangeboden — OrcaRouter routeert het vandaag niet, en niets op deze pagina mag worden opgevat alsof dat wel zo is. Maar op de dag dat een gerouteerde provider het toevoegt, verandert de prijsdynamiek op een voorspelbare manier: OrcaRouter geeft de lijstprijs van de provider door met 0% opslag, dus wat de leverancier er ook voor rekent, betaal je, met dezelfde API-sleutel die je al gebruikt, en automatische failover, zodat een day-0-model nooit een gok voor de productie hoeft te zijn. Dat is de standaardmanier waarop deze blog naar een gloednieuw model kijkt, en het is de moeite waard om dat ronduit te zeggen.
Vier dingen bepalen of deze release een mijlpaal is of een voetnoot. Ten eerste of onafhankelijke evals — een Artificial Analysis-indexvermelding, een arena-plaatsing, een gereproduceerde τ²-bench-run — ook maar enigszins in de buurt komen van de cijfers van de leverancier; een 4B die 90,7 haalt op AIME is een groot getal, en grote getallen op een releasedagkaart zijn precies de getallen die worden gecontroleerd. Ten tweede of de 1M-token context standhoudt op de hybride-aandachtsstack bij echte serveringslasten, niet alleen in het startcommando. Ten derde of de met Ascend getrainde gewichten zich in de praktijk gedragen op NVIDIA-hardware. Ten vierde wat Spark-X2.5-293B op 7 september daadwerkelijk levert. Tot die tijd is de eerlijke samenvatting van Spark-X2.5-4B en Spark-X2.5-1.7B: veelbelovend, open en volledig ongeverifieerd — wat voor een model dat vanmorgen is uitgekomen de juiste status is.
