Une bannière de titre principale pour « Spark-X2.5-4B et Spark-X2.5-1.7B » avec le sous-titre « Modèles d’agent compacts sur appareil avec un contexte natif de 1M ». Une petite icône d’appareil combinant un téléphone et un ordinateur portable se trouve à gauche, une pastille arrondie de fenêtre de contexte étiquetée « 1M DE JETONS » s’étend au milieu, et le côté droit liste « 200+ langues », « Apache 2.0 » et « Day-0 vLLM ». Le logo OrcaRouter est incrusté dans le coin inférieur droit.
Guides & Insights

Spark-X2.5-4B et Spark-X2.5-1.7B : modèles d'agents compacts sur appareil avec un contexte natif de 1M

Auteur

Magnus Corvin

Date de publication

Retour à tous les articles

Spark-X2.5-4B et Spark-X2.5-1.7B ont été rendus publics le 1er septembre 2026, lorsque SparkLLM — la filiale XHToken (词元星火) d’iFlytek — a publié ces deux modèles compacts sous licence Apache 2.0, avec poids, code et documentation de déploiement disponibles dès le même jour sur Hugging Face et GitHub. La caractéristique principale annoncée est une fenêtre de contexte native de 1 000 000 de tokens sur des modèles assez petits pour fonctionner sur appareil, adossée à un vocabulaire revendiqué de plus de 200 langues et à une architecture à attention hybride que le fournisseur dit conçue pour les tâches d’agents. Ce qui est vérifiable aujourd’hui à partir des dépôts est considérable ; ce qui n’est pas encore confirmé, c’est tout ce que seuls des benchmarks indépendants peuvent établir, car un modèle livré il y a quelques heures ne dispose pas encore d’évaluations neutres. La famille X2.5 compte également un membre plus grand à venir — Spark-X2.5-293B, annoncé pour le 7 septembre.

Ce que les repos montrent réellement.

La collection Hugging Face comprend six dépôts : Spark-X2.5-4B et Spark-X2.5-1.7B affinés par instructions, leurs points de contrôle de base, et les conversions GGUF des deux. La fiche du modèle 4B décrit une architecture à attention hybride — une couche d’attention complète pour trois couches d’attention à fenêtre glissante — ce qui correspond exactement à la forme souhaitée lorsque le chiffre marketing est d’1 million de jetons, car une attention complète sur un million de jetons serait sinon quadratiquement coûteuse. La fiche indique une fenêtre de contexte native allant jusqu’à 1 million de jetons, avec une étape d’entraînement sur contexte long qui a étendu la longueur de séquence à 1 million pendant le pré-entraînement.

Architecture — attention hybride, une couche d'attention complète pour trois couches à fenêtre glissante ; BF16 safetensors.

Contexte — jusqu’à 1 000 000 de jetons en natif ; l’entraînement en long contexte a utilisé des séquences allant jusqu’à 1 M.

Langues — plus de 200, selon la fiche du modèle (la 1.7B reprend cette affirmation).

Pré-entraînement — environ 20 000 milliards de jetons issus de pages web, de livres, de publications académiques, de code et de matériel encyclopédique, le tout entraîné de bout en bout sur des clusters Huawei Ascend.

Post-entraînement — SFT suivi d’un RL à grande échelle portant sur le raisonnement, le codage, le comportement agentique et le suivi d’instructions, avec des politiques de domaine consolidées par une technique que l’article appelle MOPD.

Licence — Apache 2.0 pour les deux tailles, sans clauses de revenus ni de région du type de celles que plusieurs autres laboratoires chinois attachent à leurs versions open source.

A single-column scoreboard titled 'Spark-X2.5-4B — the scoreboard'. Six rows read 'Context: 1M native', 'Languages: 200+', 'License: Apache 2.0', 'AIME 2026: 90.7 (vendor)', 'Agent BFCL-V4: 65.1 (vendor)', 'Frameworks: vLLM, SGLang, MLX'. A footer reads 'Vendor-reported figures; no independent scores yet.' The OrcaRouter logo is composited in the bottom-right corner.

Les chiffres des agents — et à quel point s'y fier.

La fiche du modèle publie un tableau complet de benchmarks d’agents et de raisonnement, et celui-ci est intégralement rapporté par le fournisseur sans reproduction indépendante — il faut le présenter ainsi, car la question intéressante pour un 4B vieux d’un jour est de savoir si une partie de ces résultats survit au contact d’évaluations indépendantes. Dans le tableau du fournisseur lui-même, Spark‑X2.5‑4B obtient 65.1 sur BFCL‑V4 (appel de fonctions), 75.1 sur τ²‑bench (tâches d’agent à long horizon), 40.9 sur BrowseComp, 44.4 sur SWE‑Bench Pro, 90.7 sur AIME 2026, 81.2 sur HMMT février 2026, 74.2 sur IMO‑AnswerBench et 67.4 sur GPQA. Le 1.7B a son moment sur un test de maison intelligente : 90.3 % de précision de commande de bout en bout avec une latence moyenne de 0.85 seconde sur l’ensemble Domux. Le fournisseur affirme également que le 4B « rivalise avec des modèles cloud 2 à 3 fois plus grands que lui » en matière d’implémentation d’algorithmes, de complétion et de génération de code — une affirmation qui est à la fois la phrase la plus utile du communiqué et celle qui a le plus besoin d’une vérification neutre.

A screenshot of the Hugging Face model card for XHToken/Spark-X2.5-4B, showing the SparkLLM organization header, the TextGeneration tag, Transformers & Safetensors formats, and the introduction text describing Spark-X2.5-4B and Spark-X2.5-1.7B as compact general-purpose models for conversation, writing, translation, reasoning, coding, tool use and agentic workflows.

Ce qui est structurellement plus intéressant que n'importe quel chiffre pris isolément, c'est que cette version est destinée aux agents dès le départ. La fiche énumère l'intégration avec les environnements Codex, Claude Code, OpenClaw et Hermes, la prise en charge de l'appel d'outils avec un analyseur dédié dans SGLang, et le raisonnement activé par défaut (une option d'exécution, enable_thinking, le désactive). En d'autres termes, le fournisseur a positionné ce 4B comme modèle d'utilisation d'outils, et non comme un chatbot, ce qui est un réel pari : c'est vers les petits modèles d'agents que se dirige réellement le marché sur appareil.

Écosystème Day-0, et l'histoire de vLLM.

Spark-X2.5-4B et Spark-X2.5-1.7B sont pris en charge dans vLLM dès le premier jour via un plugin général hors arborescence, plutôt que par un merge en amont. L’intégration se trouve dans le dépôt XHToken/Spark-plugin : vous le clonez et exécutez uv pip install ., puis vous servez le modèle avec vllm serve et --trust-remote-code en utilisant un template de chat personnalisé. Pour SGLang, l’approche repose sur une image Docker préconstruite, lancée avec --tool-call-parser spark25 et --context-length 1048576 — une fenêtre complète d’un million de tokens dans la commande de lancement, soit le moyen le plus rapide de valider, sur du matériel réel, l’affirmation relative à la longueur de contexte.

A screenshot of the XHToken/Spark-X2.5 GitHub repository, showing the repo header 'Spark-x2.5 open model series', the tagline 'Pushing the Limits of Agentic Capabilities in On-Device Models', and the file tree with agent, huggingface, llamacpp, modelscope, ollama, sglang, transformer and vllm directories alongside the LICENSE file.

Au-delà de vLLM et SGLang, le modèle fonctionne sur le fork de llama.cpp, MLX (Apple Silicon et CPU Linux), Ollama et LM Studio via GGUF, avec un fine-tuning pris en charge par un fork de LLaMA-Factory. La prise en charge matérielle est l'autre point fort : NVIDIA, Huawei, Hygon et HOUMO.AI — plus Apple Silicon — ce qui est important, car il est rare qu'un modèle issu d'un laboratoire chinois soit livré dès le premier jour avec des documents de déploiement pour Ascend, Hygon et les puces nationales, et non comme une simple promesse.

À quoi sert un modèle sur appareil de 1M de jetons

La longueur du contexte est la fonctionnalité phare, et elle cible des tâches précises. Un million de jetons de contexte natif sur un modèle 4B, c'est une base de code entière ou un vaste corpus de documents qui tient dans un modèle fonctionnant en local — sans pipeline RAG, sans découpage. La démonstration du fournisseur, construite sur son outil bureautique Loomy, fait écrire au 4B un script qui agrège un tableur de ventes, en extrait les indicateurs et tendances clés, puis génère un rapport bilingue d'environ 3 000 mots. L'autre volet est la robotique : les deux tailles sont positionnées pour la perception et l'exécution sur robot et en périphérie, couvrant le contrôle, le suivi de cible et la navigation — un créneau plausible pour un 1.7B qui répond en moins d'une seconde.

Le plus grand coup : Spark-X2.5-293B

Les deux petits modèles constituent le coup d’ouverture. Le 7 septembre, SparkLLM annonce qu’il publiera Spark-X2.5-293B, un modèle de base de 293 milliards de paramètres avec, selon l’annonce, des capacités améliorées de codage et d’agent. Les petits modèles X2.5 sont en réalité la partie embarquée d’une histoire à deux niveaux ; le grand modèle est celui qui fixe le plafond de la famille. Considérer les modèles 4B et 1.7B comme l’ensemble de la sortie reviendrait à manquer la direction du mouvement.

Comment l'essayer, et quoi regarder

L'API est en ligne sur la plateforme Xingchen MaaS d'iFlytek et gratuite pour une durée limitée ; les poids sont disponibles sur Hugging Face, ModelScope et la bibliothèque Ollama. Côté routage, Spark-X2.5-4B est trop récent pour qu'un agrégateur le serve déjà — OrcaRouter ne le route pas aujourd'hui, et rien sur cette page ne doit être lu comme si c'était le cas. Mais le jour où un fournisseur routé l'ajoute, la donne économique change de manière prévisible : OrcaRouter transmet le prix catalogue du fournisseur sans aucune marge, donc vous payez exactement le prix fixé par le vendeur, avec la même clé API que vous utilisez déjà, et le basculement automatique fait qu'un modèle à J+0 n'a jamais à être un pari en production. C'est la façon typique dont ce blog envisage un tout nouveau modèle, et il vaut la peine de le dire clairement.

Quatre éléments décideront si cette sortie est un moment marquant ou une simple note de bas de page. Premièrement, si les évaluations indépendantes — une entrée dans l'indice Artificial Analysis, une place dans un classement d'arène, une exécution reproduite de τ²-bench — s'approchent ne serait-ce que de loin des chiffres annoncés par le fournisseur ; un score de 90,7 sur AIME pour un 4B est un gros chiffre, et les gros chiffres annoncés le jour de la sortie sont exactement ceux que l'on vérifie. Deuxièmement, si le contexte de 1M de jetons tient le coup sur la pile d'attention hybride en conditions réelles de service, et pas seulement dans la commande de lancement. Troisièmement, si les poids entraînés sur Ascend se comportent correctement une fois déployés sur du matériel NVIDIA. Quatrièmement, ce que Spark-X2.5-293B livrera réellement le 7 septembre. En attendant, le résumé honnête de Spark-X2.5-4B et de Spark-X2.5-1.7B est : prometteur, ouvert et entièrement non vérifié — ce qui, pour un modèle sorti ce matin, est le bon statut.