Una hero card con il titolo 'Spark-X2.5-4B e Spark-X2.5-1.7B' e il sottotitolo 'Modelli agente on-device compatti con contesto nativo di 1M'. Una piccola icona di dispositivo che combina telefono e laptop è posizionata a sinistra, una pillola arrotondata per la finestra di contesto etichettata '1M TOKEN' si trova al centro e sul lato destro sono elencati '200+ lingue', 'Apache 2.0' e 'Day-0 vLLM'. Il logo OrcaRouter è composto nell'angolo in basso a destra.
Guides & Insights

Spark-X2.5-4B e Spark-X2.5-1.7B: Modelli Agente Compatti On-Device con Contesto Nativo di 1M

Autore

Magnus Corvin

Data di pubblicazione

Ultimi modelli · 20Vedi tutti i modelli
Benchmark: Artificial Analysis · aggiornato ogni giorno
Torna a tutti gli articoli

Spark-X2.5-4B e Spark-X2.5-1.7B sono stati resi pubblici il 1° settembre 2026, quando SparkLLM — la sussidiaria XHToken (词元星火) di iFlytek — ha rilasciato entrambi i modelli compatti con licenza Apache 2.0, con pesi, codice e documentazione di distribuzione su Hugging Face e GitHub lo stesso giorno. La caratteristica principale è una finestra di contesto nativa di 1.000.000 di token su modelli abbastanza piccoli da funzionare su dispositivo, supportata da un vocabolario dichiarato di oltre 200 lingue e da un design di attenzione ibrida che il fornitore afferma essere ottimizzato per il lavoro agentico. Quello che si può sapere oggi dai repository è sostanziale; quello che non è ancora confermato è tutto ciò che solo i benchmark indipendenti possono stabilire, perché un modello uscito poche ore fa non ha ancora valutazioni neutrali. La famiglia X2.5 ha anche un membro più grande in arrivo — Spark-X2.5-293B, annunciato per il 7 settembre.

Cosa mostrano effettivamente i repository

La collezione Hugging Face comprende sei repository: Spark-X2.5-4B e Spark-X2.5-1.7B ottimizzati tramite instruction-tuning, i rispettivi checkpoint base e le conversioni GGUF di entrambi. La scheda del modello 4B descrive un'architettura ad attenzione ibrida — uno strato di attenzione completa ogni tre strati di attenzione a finestra scorrevole — che è esattamente la struttura che serve quando il numero di marketing è 1 milione di token, perché l'attenzione completa su un milione di token sarebbe altrimenti quadraticamente costosa. La scheda dichiara una finestra di contesto nativa fino a 1 milione di token, con una fase di addestramento su contesti lunghi che ha esteso la lunghezza delle sequenze a 1 milione durante il pre-addestramento.

Architettura — attenzione ibrida, uno strato di attenzione completa ogni tre strati a finestra scorrevole; BF16 safetensors.

Contesto — nativo fino a 1.000.000 di token; l’addestramento a lungo contesto ha elaborato sequenze fino a 1M.

Lingue — più di 200, secondo la scheda del modello (il modello 1.7B condivide questa affermazione).

Pre-addestramento — circa 20.000 miliardi di token tra pagine web, libri, pubblicazioni accademiche, codice e materiale enciclopedico, addestrato end-to-end sui cluster Huawei Ascend.

Post-addestramento — SFT seguito da RL su larga scala nel ragionamento, nella programmazione, nel comportamento agentico e nel seguire le istruzioni, con le politiche di dominio consolidate tramite una tecnica che l'articolo chiama MOPD.

Licenza — Apache 2.0 per entrambe le dimensioni, senza clausole su ricavi o regioni del tipo che diversi altri laboratori cinesi applicano ai rilasci open source.

A single-column scoreboard titled 'Spark-X2.5-4B — the scoreboard'. Six rows read 'Context: 1M native', 'Languages: 200+', 'License: Apache 2.0', 'AIME 2026: 90.7 (vendor)', 'Agent BFCL-V4: 65.1 (vendor)', 'Frameworks: vLLM, SGLang, MLX'. A footer reads 'Vendor-reported figures; no independent scores yet.' The OrcaRouter logo is composited in the bottom-right corner.

I numeri degli agenti — e quanto fidarsi di loro

La scheda del modello pubblica una tabella completa di benchmark per agenti e ragionamento, ed è interamente riportata dal vendor e mai riprodotta in modo indipendente — etichettala così, perché la domanda interessante per un 4B fresco di giornata è se qualcosa di tutto ciò regge al contatto con valutazioni indipendenti. Nella tabella dello stesso vendor, Spark-X2.5-4B ottiene 65,1 su BFCL-V4 (chiamate di funzioni), 75,1 su τ²-bench (compiti per agenti a lungo orizzonte), 40,9 su BrowseComp, 44,4 su SWE-Bench Pro, 90,7 su AIME 2026, 81,2 su HMMT February 2026, 74,2 su IMO-AnswerBench e 67,4 su GPQA. Il modello 1.7B ha il suo momento di gloria in un test per la casa smart: 90,3% di accuratezza end-to-end dei comandi con 0,85 secondi di latenza media sul set Domux. Il vendor afferma inoltre che il 4B “rivaleggia con modelli cloud 2–3 volte più grandi” su implementazione di algoritmi, completamento e generazione di codice — un'affermazione che è allo stesso tempo la frase più utile del rilascio e quella che ha più bisogno di una verifica neutrale.

A screenshot of the Hugging Face model card for XHToken/Spark-X2.5-4B, showing the SparkLLM organization header, the TextGeneration tag, Transformers & Safetensors formats, and the introduction text describing Spark-X2.5-4B and Spark-X2.5-1.7B as compact general-purpose models for conversation, writing, translation, reasoning, coding, tool use and agentic workflows.

Ciò che è strutturalmente più interessante di qualsiasi singolo numero è che il rilascio è pensato per gli agenti fin dall’inizio. La scheda elenca l’integrazione con gli harness Codex, Claude Code, OpenClaw e Hermes, il supporto al tool calling con un parser dedicato in SGLang, e il ragionamento abilitato per impostazione predefinita (un flag di runtime, enable_thinking, lo disattiva). In altre parole, il fornitore ha posizionato un 4B come modello per l’uso di strumenti, non come chatbot, il che è una vera scommessa: i piccoli modelli per agenti sono dove il mercato on-device si sta effettivamente muovendo.

Ecosistema Day-0 e la storia di vLLM

Spark-X2.5-4B e Spark-X2.5-1.7B sono supportati in vLLM fin dal primo giorno tramite un plugin generico out-of-tree, anziché un merge upstream. L'integrazione risiede nel repository XHToken/Spark-plugin: lo si clona e si esegue uv pip install ., quindi si avvia il modello con vllm serve e --trust-remote-code usando un template di chat personalizzato. Il percorso SGLang è un'immagine Docker preconfigurata avviata con --tool-call-parser spark25 e --context-length 1048576 — un'intera finestra da un milione di token nel comando di avvio, che è il modo più rapido per verificare su hardware reale l'affermazione sulla finestra di contesto.

A screenshot of the XHToken/Spark-X2.5 GitHub repository, showing the repo header 'Spark-x2.5 open model series', the tagline 'Pushing the Limits of Agentic Capabilities in On-Device Models', and the file tree with agent, huggingface, llamacpp, modelscope, ollama, sglang, transformer and vllm directories alongside the LICENSE file.

Oltre a vLLM e SGLang, il modello gira sul fork di llama.cpp, MLX (silicio Apple e CPU Linux), Ollama e LM Studio tramite GGUF, con supporto al fine-tuning tramite un fork di LLaMA-Factory. Il supporto hardware è l'altra notizia principale: NVIDIA, Huawei, Hygon e HOUMO.AI — più il silicio Apple — il che è importante perché è raro che un modello di un laboratorio cinese arrivi con documentazione di deployment per Ascend, Hygon e chip nazionali fin dal primo giorno, e non come una promessa.

A cosa serve un modello on-device da 1M-token

La lunghezza del contesto è la caratteristica distintiva, e punta a compiti specifici. Un milione di token di contesto nativo su un modello da 4B significa un'intera codebase, o un ampio set di documenti, caricata in un modello che gira in locale — niente pipeline RAG, niente chunking. La dimostrazione del fornitore, costruita sul suo tooling da ufficio Loomy, fa scrivere al modello da 4B uno script per aggregare un foglio di calcolo delle vendite, estrarre metriche e trend chiave, e generare un report bilingue di circa 3.000 parole. L'angolo della robotica è l'altra metà: entrambe le dimensioni sono posizionate per la percezione ed esecuzione su robot e su dispositivi edge, coprendo controllo, tracciamento del target e navigazione, una nicchia plausibile per un modello da 1.7B che risponde in meno di un secondo.

La mossa più grande: Spark-X2.5-293B

I due modelli piccoli sono la mossa di apertura. Il 7 settembre, SparkLLM annuncia che rilascerà Spark-X2.5-293B, un modello base da 293 miliardi di parametri con, secondo l'annuncio, capacità di coding e agente potenziate. I modelli piccoli X2.5 sono di fatto la metà on-device di una storia a due livelli; è il modello grande a fissare il tetto della famiglia. Trattare i modelli 4B e 1.7B come se fossero l'intero rilascio significherebbe non cogliere la direzione di marcia.

Come provarlo e a cosa prestare attenzione.

L'API è attiva sulla piattaforma Xingchen MaaS di iFlytek ed è gratuita per un periodo limitato; i pesi sono disponibili su Hugging Face, ModelScope e sulla libreria Ollama. Sul fronte del routing, Spark-X2.5-4B è troppo nuovo perché un qualsiasi aggregatore lo stia già servendo — OrcaRouter oggi non lo instrada, e nulla di quanto scritto in questa pagina va letto come se lo facesse. Ma il giorno in cui un provider instradato lo aggiungerà, le dinamiche economiche cambieranno in modo prevedibile: OrcaRouter trasmette il prezzo di listino del provider con un markup dello 0%, quindi qualunque sia il prezzo stabilito dal fornitore è quello che paghi, con la stessa chiave API che già usi, e il failover automatico, così un modello day-0 non deve mai essere una scommessa in produzione. Questo è lo schema standard con cui questo blog guarda a un modello appena uscito, e vale la pena dirlo chiaramente.

Quattro cose decideranno se questo rilascio sarà un momento o una nota a piè di pagina. Primo, se le valutazioni indipendenti — una voce nell’indice Artificial Analysis, un posizionamento in arena, una run riprodotta di τ²-bench — si avvicineranno anche solo lontanamente ai risultati nella tabella del fornitore; un modello da 4B che totalizza 90.7 su AIME è un numero grande, e i numeri grandi nella scheda del giorno di rilascio sono esattamente quelli che vengono controllati. Secondo, se il contesto da 1M token regge sullo stack di attenzione ibrida con carichi di servizio reali, non solo nel comando di lancio. Terzo, se i pesi addestrati su Ascend si comportano su hardware NVIDIA sul campo. Quarto, cosa Spark-X2.5-293B offrirà effettivamente il 7 settembre. Fino ad allora, la sintesi onesta di Spark-X2.5-4B e Spark-X2.5-1.7B è: promettente, aperto e del tutto non verificato — che, per un modello uscito stamattina, è lo stato corretto.