Una tarjeta de título principal para 'Spark-X2.5-4B y Spark-X2.5-1.7B' con el subtítulo 'Modelos de agente compactos en el dispositivo con contexto nativo de 1M'. Un pequeño icono de dispositivo que combina un teléfono y una laptop se sitúa a la izquierda, una píldora de ventana de contexto redondeada etiquetada como '1M TOKENS' se extiende en el medio, y el lado derecho enumera '200+ idiomas', 'Apache 2.0' y 'vLLM desde el día cero'. El logotipo de OrcaRouter está superpuesto en la esquina inferior derecha.
Guides & Insights

Spark-X2.5-4B y Spark-X2.5-1.7B: Modelos de agente compactos en el dispositivo con un contexto nativo de 1M

Autor

Magnus Corvin

Fecha de publicación

Últimos modelos · 20Ver todos los modelos
Benchmarks: Artificial Analysis · actualizado a diario
Volver a todas las publicaciones

Spark-X2.5-4B y Spark-X2.5-1.7B se hicieron públicos el 1 de septiembre de 2026, cuando SparkLLM — la subsidiaria XHToken (词元星火) de iFlytek — publicó ambos modelos compactos como código abierto bajo Apache 2.0, con los pesos, el código y la documentación de implementación disponibles en Hugging Face y GitHub ese mismo día. La especificación principal es una ventana de contexto nativa de 1.000.000 de tokens en modelos lo suficientemente pequeños como para ejecutarse en el dispositivo, respaldada por un vocabulario de más de 200 idiomas según se afirma, y un diseño de atención híbrida que el proveedor dice estar ajustado para el trabajo de agentes. Lo que hoy se puede saber de los repositorios es sustancial; lo que aún no se confirma es todo aquello que solo la evaluación independiente puede determinar, porque un modelo lanzado hace horas no tiene aún evaluaciones neutrales. La familia X2.5 también tiene un miembro más grande en camino: Spark-X2.5-293B, anunciado para el 7 de septiembre.

Lo que los repos realmente muestran

La colección de Hugging Face incluye seis repositorios: Spark-X2.5-4B y Spark-X2.5-1.7B ajustados con instrucciones, sus checkpoints base y conversiones GGUF de ambos. La ficha del modelo 4B describe una arquitectura de atención híbrida — una capa de atención completa por cada tres capas de atención de ventana deslizante — que es exactamente la forma que se necesita cuando el número de marketing es 1M de tokens, porque la atención completa sobre un millón de tokens sería, de otro modo, cuadráticamente costosa. La ficha indica una ventana de contexto nativa de hasta 1M de tokens, con una etapa de entrenamiento de contexto largo que extendió la longitud de secuencia a 1M durante el preentrenamiento.

Arquitectura — atención híbrida, una capa de atención completa por cada tres capas de ventana deslizante; safetensors BF16.

Contexto — nativo de hasta 1,000,000 de tokens; el entrenamiento de contexto largo procesó secuencias de hasta 1M.

Idiomas: más de 200, según la ficha del modelo (el 1.7B comparte esta afirmación).

Preentrenamiento — aproximadamente 20 billones de tokens de páginas web, libros, publicaciones académicas, código y material enciclopédico, entrenado de extremo a extremo en clústeres Huawei Ascend.

Post-entrenamiento — SFT seguido de RL a gran escala en razonamiento, codificación, comportamiento agéntico y seguimiento de instrucciones, con políticas de dominio consolidadas mediante una técnica que el artículo denomina MOPD.

Licencia — Apache 2.0 para ambos tamaños, sin cláusulas de ingresos ni de región del tipo que varios otros laboratorios chinos adjuntan a sus lanzamientos abiertos.

A single-column scoreboard titled 'Spark-X2.5-4B — the scoreboard'. Six rows read 'Context: 1M native', 'Languages: 200+', 'License: Apache 2.0', 'AIME 2026: 90.7 (vendor)', 'Agent BFCL-V4: 65.1 (vendor)', 'Frameworks: vLLM, SGLang, MLX'. A footer reads 'Vendor-reported figures; no independent scores yet.' The OrcaRouter logo is composited in the bottom-right corner.

Los números de los agentes — y cuánto confiar en ellos

La ficha del modelo publica una tabla completa de benchmarks de agentes y razonamiento, y todos sus resultados son reportados por el proveedor sin verificación independiente — etiquétala así, porque lo interesante para un 4B de un día es si algo de eso sobrevive al contacto con evaluaciones independientes. En la propia tabla del proveedor, Spark-X2.5-4B obtiene 65.1 en BFCL-V4 (llamada a funciones), 75.1 en τ²-bench (tareas de agentes de horizonte largo), 40.9 en BrowseComp, 44.4 en SWE-Bench Pro, 90.7 en AIME 2026, 81.2 en HMMT February 2026, 74.2 en IMO-AnswerBench y 67.4 en GPQA. El 1.7B tiene su momento en una prueba de hogar inteligente: 90.3% de precisión de comandos de extremo a extremo con una latencia media de 0.85 segundos en el conjunto Domux. El proveedor también afirma que el 4B «rivaliza con modelos en la nube de entre 2 y 3 veces su tamaño» en implementación de algoritmos, finalización y generación de código — una afirmación que es a la vez la frase más útil del lanzamiento y la que más necesita una comprobación neutral.

A screenshot of the Hugging Face model card for XHToken/Spark-X2.5-4B, showing the SparkLLM organization header, the TextGeneration tag, Transformers & Safetensors formats, and the introduction text describing Spark-X2.5-4B and Spark-X2.5-1.7B as compact general-purpose models for conversation, writing, translation, reasoning, coding, tool use and agentic workflows.

Lo que resulta estructuralmente más interesante que cualquier cifra individual es que el lanzamiento está orientado a agentes desde el principio. La ficha enumera la integración con los entornos Codex, Claude Code, OpenClaw y Hermes, el soporte de llamada a herramientas con un parser dedicado en SGLang y el razonamiento habilitado por defecto (un flag de ejecución, enable_thinking, lo desactiva). En otras palabras, el proveedor ha posicionado un 4B como un modelo de uso de herramientas, no como un chatbot, lo que supone una apuesta real: los modelos de agentes pequeños son hacia donde se está moviendo realmente el mercado on-device.

Ecosistema Day-0 y la historia de vLLM

Spark-X2.5-4B y Spark-X2.5-1.7B son compatibles con vLLM desde el primer día mediante un plugin general externo al árbol en lugar de una fusión en upstream. La integración está en el repositorio XHToken/Spark-plugin: lo clonas y ejecutas uv pip install ., después sirves el modelo con vllm serve y --trust-remote-code con una plantilla de chat personalizada. La vía SGLang es una imagen Docker precompilada que se lanza con --tool-call-parser spark25 y --context-length 1048576 — una ventana completa de un millón de tokens en el comando de lanzamiento, que es la forma más rápida de verificar en hardware real la afirmación sobre el contexto.

A screenshot of the XHToken/Spark-X2.5 GitHub repository, showing the repo header 'Spark-x2.5 open model series', the tagline 'Pushing the Limits of Agentic Capabilities in On-Device Models', and the file tree with agent, huggingface, llamacpp, modelscope, ollama, sglang, transformer and vllm directories alongside the LICENSE file.

Más allá de vLLM y SGLang, el modelo se ejecuta en el fork de llama.cpp, MLX (Apple silicon y CPU Linux), Ollama y LM Studio mediante GGUF, con soporte de fine-tuning a través de un fork de LLaMA-Factory. El soporte de hardware es el otro titular: NVIDIA, Huawei, Hygon y HOUMO.AI, además de Apple silicon, lo cual importa porque es raro que un modelo de un laboratorio chino se lance con documentación de despliegue para Ascend, Hygon y chips domésticos desde el primer día, no como una promesa.

Para qué sirve un modelo en el dispositivo de 1M de tokens

La longitud del contexto es la característica clave, y apunta a trabajos específicos. Un millón de tokens de contexto nativo en un modelo de 4B significa un código base completo, o un conjunto extenso de documentos, cargado en un modelo que se ejecuta localmente — sin pipeline de RAG, sin fragmentación. La propia demostración del proveedor, construida sobre su herramienta ofimática Loomy, hace que el modelo de 4B escriba un script para agregar una hoja de cálculo de ventas, extraer métricas y tendencias clave, y generar un informe bilingüe de aproximadamente 3.000 palabras. El ángulo de la robótica es la otra mitad: ambos tamaños están posicionados para percepción y ejecución en robots y en el edge, cubriendo control, seguimiento de objetivos y navegación, lo cual es un nicho plausible para un modelo de 1.7B que responde en menos de un segundo.

La jugada más grande: Spark-X2.5-293B

Los dos modelos pequeños son la jugada inicial. El 7 de septiembre, SparkLLM anuncia que lanzará Spark-X2.5-293B, un modelo base de 293 mil millones de parámetros con, según el anuncio, capacidades mejoradas de codificación y de agente. Los modelos pequeños de la X2.5 son efectivamente la vertiente local de una historia en dos niveles; el modelo grande es donde se fija el techo de la familia. Tratar los modelos de 4B y 1.7B como el lanzamiento completo sería perder de vista la dirección del avance.

Cómo probarlo y en qué fijarse

La API está disponible en la plataforma Xingchen MaaS de iFlytek y es gratuita por tiempo limitado; los pesos están en Hugging Face, ModelScope y la biblioteca de Ollama. En cuanto al enrutamiento, Spark-X2.5-4B es demasiado nuevo para que ningún agregador lo esté sirviendo todavía — OrcaRouter no lo enruta hoy, y nada en esta página debe leerse como si lo hiciera. Pero el día en que un proveedor enrutado lo añada, la economía cambia de manera predecible: OrcaRouter transmite el precio de lista del proveedor con un margen del 0%, de modo que pagas exactamente lo que el proveedor fije, con la misma clave de API que ya usas, y failover automático para que un modelo del día cero nunca tenga que ser una apuesta de producción. Esa es la forma estándar en que este blog ve un modelo completamente nuevo, y vale la pena decirlo con claridad.

Cuatro cosas decidirán si este lanzamiento es un hito o una nota al pie. Primero, si las evaluaciones independientes — una entrada en el índice de Artificial Analysis, un puesto en el arena, una ejecución reproducida de τ²-bench — se acercan siquiera a la tabla del proveedor; un modelo 4B que obtiene 90.7 en AIME es una cifra muy alta, y las cifras altas de una tarjeta de lanzamiento son exactamente las que se comprueban. Segundo, si el contexto de 1M de tokens se mantiene en la pila de atención híbrida bajo cargas de servicio reales, no solo en el comando de lanzamiento. Tercero, si los pesos entrenados con Ascend se comportan en hardware NVIDIA sobre el terreno. Cuarto, qué ofrece realmente Spark-X2.5-293B el 7 de septiembre. Hasta entonces, la conclusión honesta sobre Spark-X2.5-4B y Spark-X2.5-1.7B es: prometedores, abiertos y completamente no verificados — lo cual, para un modelo que salió esta mañana, es el estado correcto.