Ein Helden-Titelkarten für „Spark-X2.5-4B und Spark-X2.5-1.7B“ mit dem Untertitel „Kompakte On-Device-Agentmodelle mit nativem 1M-Kontext“. Ein kleines Gerätesymbol, das Telefon und Laptop kombiniert, befindet sich links, eine abgerundete Kontextfenster-Pille mit der Beschriftung „1M TOKENS“ erstreckt sich über die Mitte, und die rechte Seite listet „200+ Sprachen“, „Apache 2.0“ und „Day-0 vLLM“ auf. Das OrcaRouter-Logo ist in die untere rechte Ecke eingefügt.
Guides & Insights

Spark-X2.5-4B und Spark-X2.5-1.7B: Kompakte On-Device-Agentenmodelle mit nativem 1M-Kontext

Autor

Magnus Corvin

Veröffentlicht am

Neueste Modelle · 20Alle Modelle ansehen
Benchmarks: Artificial Analysis · täglich aktualisiert
Zurück zu allen Beiträgen

Spark-X2.5-4B und Spark-X2.5-1.7B wurden am 1. September 2026 veröffentlicht, als SparkLLM – die XHToken-Tochtergesellschaft (词元星火) von iFlytek – beide kompakten Modelle unter Apache 2.0 als Open Source bereitstellte; Gewichte, Code und Bereitstellungsdokumente erschienen noch am selben Tag auf Hugging Face und GitHub. Die herausragende Spezifikation ist ein natives Kontextfenster von 1.000.000 Token bei Modellen, die klein genug sind, um direkt auf dem Gerät zu laufen – unterstützt durch einen angeblich über 200 Sprachen umfassenden Wortschatz und ein Hybrid-Attention-Design, das laut Anbieter für agentische Aufgaben optimiert ist. Was sich heute aus den Repositories ableiten lässt, ist erheblich; was noch nicht bestätigt ist, ist alles, was nur unabhängige Benchmarks klären können, denn ein Modell, das erst vor Stunden veröffentlicht wurde, hat noch keine neutralen Evaluierungen. Zur X2.5-Familie gehört außerdem ein größeres Mitglied – Spark-X2.5-293B, angekündigt für den 7. September.

Was die Repos tatsächlich zeigen

Die Hugging-Face-Collection umfasst sechs Repositories: die instruktionsabgestimmten Spark-X2.5-4B und Spark-X2.5-1.7B, ihre Basis-Checkpoints sowie GGUF-Konvertierungen beider Modelle. Die 4B-Modellkarte beschreibt eine Hybrid-Attention-Architektur – eine Vollaufmerksamkeitsschicht pro drei Sliding-Window-Aufmerksamkeitsschichten –, was genau die Form ist, die man sich wünscht, wenn die Marketingzahl 1M Token lautet, denn Vollaufmerksamkeit über eine Million Token wäre andernfalls quadratisch teuer. Die Karte gibt ein natives Kontextfenster von bis zu 1M Token an, mit einer Trainingsphase für lange Kontexte, die die Sequenzlänge während des Vortrainings auf 1M erweiterte.

Architektur — hybride Attention, ein Full-Attention-Layer pro drei Sliding-Window-Layer; BF16 safetensors.

Kontext — nativ bis zu 1.000.000 Token; das Long-Context-Training lief mit Sequenzlängen bis zu 1M.

Sprachen — mehr als 200, laut der Modellkarte (die 1.7B teilt diese Angabe).

Pretraining — etwa 20 Billionen Tokens aus Webseiten, Büchern, akademischen Publikationen, Code und enzyklopädischem Material, die Ende-zu-Ende auf Huawei-Ascend-Clustern trainiert wurden.

Post-Training – SFT, gefolgt von RL in großem Maßstab für Reasoning, Coding, agentisches Verhalten und Anweisungsbefolgung, wobei Domänen-Policies mithilfe einer Technik konsolidiert werden, die im Paper als MOPD bezeichnet wird.

Lizenz — Apache 2.0 für beide Größen, ohne Umsatz- oder Regionsklauseln, wie sie mehrere andere chinesische Labore an offene Veröffentlichungen knüpfen.

A single-column scoreboard titled 'Spark-X2.5-4B — the scoreboard'. Six rows read 'Context: 1M native', 'Languages: 200+', 'License: Apache 2.0', 'AIME 2026: 90.7 (vendor)', 'Agent BFCL-V4: 65.1 (vendor)', 'Frameworks: vLLM, SGLang, MLX'. A footer reads 'Vendor-reported figures; no independent scores yet.' The OrcaRouter logo is composited in the bottom-right corner.

Die Agentennummern — und wie sehr man ihnen vertrauen kann

Die Modellkarte veröffentlicht eine vollständige Benchmark-Tabelle für Agenten und Reasoning, und sie ist durchgängig vom Anbieter gemeldet und nicht unabhängig reproduziert – kennzeichnen Sie sie genau so, denn die interessante Frage bei einem erst einen Tag alten 4B-Modell ist, ob irgendetwas davon den Kontakt mit unabhängigen Evaluierungen übersteht. In der eigenen Tabelle des Anbieters erzielt Spark-X2.5-4B 65,1 bei BFCL-V4 (Funktionsaufruf), 75,1 bei τ²-bench (Langzeit-Agentenaufgaben), 40,9 bei BrowseComp, 44,4 bei SWE-Bench Pro, 90,7 bei AIME 2026, 81,2 bei HMMT Februar 2026, 74,2 bei IMO-AnswerBench und 67,4 bei GPQA. Die 1,7B-Variante hat ihren Auftritt bei einem Smart-Home-Test: 90,3 % End-to-End-Befehlsgenauigkeit bei 0,85 Sekunden durchschnittlicher Latenz auf dem Domux-Datensatz. Der Anbieter behauptet außerdem, das 4B-Modell stelle sich bei Algorithmusimplementierung, Code-Vervollständigung und -generierung „auf Augenhöhe mit Cloud-Modellen, die 2–3× so groß sind“ – eine Behauptung, die zugleich der nützlichste Satz der Veröffentlichung ist und derjenige, der am dringendsten einer neutralen Überprüfung bedarf.

A screenshot of the Hugging Face model card for XHToken/Spark-X2.5-4B, showing the SparkLLM organization header, the TextGeneration tag, Transformers & Safetensors formats, and the introduction text describing Spark-X2.5-4B and Spark-X2.5-1.7B as compact general-purpose models for conversation, writing, translation, reasoning, coding, tool use and agentic workflows.

Strukturell interessanter als jede einzelne Zahl ist, dass das Release von Anfang an auf Agenten ausgerichtet ist. Die Karte listet die Integration mit den Harnesses von Codex, Claude Code, OpenClaw und Hermes, die Unterstützung für Tool-Calling mit einem dedizierten Parser in SGLang sowie das standardmäßig aktivierte Reasoning auf (ein Laufzeit-Flag, enable_thinking, schaltet es ab). Mit anderen Worten: Der Anbieter hat ein 4B-Modell als Tool-Use-Modell positioniert, nicht als Chatbot, was eine echte Wette ist: Der On-Device-Markt bewegt sich tatsächlich in Richtung kleiner Agentenmodelle.

Day-0-Ökosystem und die vLLM-Geschichte

Spark-X2.5-4B und Spark-X2.5-1.7B werden in vLLM von Anfang an über ein allgemeines Out-of-Tree-Plugin statt eines Upstream-Merges unterstützt. Die Integration befindet sich im XHToken/Spark-plugin-Repository: Sie klonen es und führen uv pip install . aus, dann servieren Sie das Modell mit vllm serve und --trust-remote-code gegen eine benutzerdefinierte Chat-Vorlage. Der SGLang-Weg ist ein vorgefertigtes Docker-Image, gestartet mit --tool-call-parser spark25 und --context-length 1048576 — ein volles Million-Token-Fenster im Startbefehl, was der schnellste Weg ist, die Kontext-Behauptung auf echter Hardware zu überprüfen.

A screenshot of the XHToken/Spark-X2.5 GitHub repository, showing the repo header 'Spark-x2.5 open model series', the tagline 'Pushing the Limits of Agentic Capabilities in On-Device Models', and the file tree with agent, huggingface, llamacpp, modelscope, ollama, sglang, transformer and vllm directories alongside the LICENSE file.

Über vLLM und SGLang hinaus läuft das Modell auf dem llama.cpp-Fork, MLX (Apple silicon und Linux-CPU), Ollama und LM Studio über GGUF, wobei das Feintuning über einen LLaMA-Factory-Fork unterstützt wird. Hardware-Unterstützung ist die andere Schlagzeile: NVIDIA, Huawei, Hygon und HOUMO.AI – plus Apple silicon – was deshalb wichtig ist, weil es selten vorkommt, dass ein Modell aus einem chinesischen Labor am ersten Tag mit Ascend-, Hygon- und Bereitstellungsdokumenten für heimische Chips ausgeliefert wird, statt nur als Versprechen.

Wozu ein 1M-Token-On-Device-Modell dient

Die Kontextlänge ist das zentrale Feature, und sie zielt auf konkrete Aufgaben ab. Eine Million Tokens nativen Kontexts bei einem 4B-Modell bedeutet, dass eine gesamte Codebasis oder ein umfangreicher Dokumentensatz in ein Modell geladen wird, das lokal läuft — ohne RAG-Pipeline, ohne Chunking. Die eigene Demonstration des Anbieters, aufgebaut auf seiner Loomy-Bürosoftware, lässt das 4B-Modell ein Skript schreiben, das eine Vertriebstabelle aggregiert, wichtige Kennzahlen und Trends extrahiert und einen rund 3.000 Wörter umfassenden zweisprachigen Bericht erzeugt. Der Robotik-Aspekt ist die andere Hälfte: Beide Modellgrößen sind für die Wahrnehmung und Ausführung direkt am Roboter sowie am Edge positioniert — einschließlich Steuerung, Zielverfolgung und Navigation —, was eine plausible Nische für ein 1.7B-Modell darstellt, das in unter einer Sekunde antwortet.

Der größere Coup: Spark-X2.5-293B

Die beiden kleinen Modelle sind der Eröffnungszug. Am 7. September kündigt SparkLLM an, Spark-X2.5-293B zu veröffentlichen, ein Basismodell mit 293 Milliarden Parametern, das laut der Ankündigung über verbesserte Programmier- und Agentenfähigkeiten verfügt. Die kleinen X2.5-Modelle sind praktisch die On-Device-Hälfte einer zweistufigen Geschichte; das große Modell setzt die Obergrenze der Modellfamilie. Wer die 4B- und 1.7B-Modelle als die gesamte Veröffentlichung betrachtet, verkennt die Richtung, in die es geht.

Wie man es ausprobiert und worauf man achten sollte.

Die API ist auf der Xingchen-MaaS-Plattform von iFlytek live und für eine begrenzte Zeit kostenlos; die Gewichte sind auf Hugging Face, ModelScope und in der Ollama-Bibliothek verfügbar. Was das Routing angeht, ist Spark-X2.5-4B zu neu, als dass ein Aggregator es bereits anbieten würde — OrcaRouter routet es heute nicht, und nichts auf dieser Seite sollte so gelesen werden, als ob es das täte. Aber an dem Tag, an dem ein angebundener Anbieter es hinzufügt, ändern sich die wirtschaftlichen Rahmenbedingungen auf vorhersehbare Weise: OrcaRouter reicht den Listenpreis des Anbieters ohne Aufschlag durch, also zahlst du den Preis, den der Anbieter verlangt, mit demselben API-Schlüssel, den du bereits verwendest, und bekommst automatisches Failover, sodass ein Day-0-Modell nie eine Produktionswette sein muss. Das ist die Standardform, in der dieses Blog ein brandneues Modell betrachtet, und es ist wert, klar ausgesprochen zu werden.

Vier Dinge werden darüber entscheiden, ob diese Veröffentlichung ein großer Moment ist oder eine Fußnote. Erstens, ob unabhängige Evaluierungen — ein Eintrag im Artificial-Analysis-Index, eine Arena-Platzierung, ein reproduzierter τ²-bench-Lauf — auch nur annähernd an die Herstellerangaben herankommen; ein 4B-Score von 90,7 beim AIME ist eine große Zahl, und große Zahlen auf einer am Erscheinungstag veröffentlichten Modellkarte sind genau diejenigen, die überprüft werden. Zweitens, ob der 1M-Token-Kontext auf dem Hybrid-Attention-Stack unter realen Serving-Lasten hält, nicht nur im Startbefehl. Drittens, ob sich die auf Ascend trainierten Gewichte im Feldeinsatz auf NVIDIA-Hardware bewähren. Viertens, was Spark-X2.5-293B am 7. September tatsächlich liefert. Bis dahin lautet die ehrliche Bilanz für Spark-X2.5-4B und Spark-X2.5-1.7B: vielversprechend, offen und völlig unverifiziert — was bei einem Modell, das heute Morgen veröffentlicht wurde, der richtige Status ist.