
Spark-X2.5-4B e Spark-X2.5-1.7B: Modelos de Agente Compactos no Dispositivo com Contexto Nativo de 1M
- orcaNOVOOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 por 1M de tokens
- deepseekNOVODeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligência
- openaiNOVOOpenAI: GPT-6 Astra2026-09-0453Inteligência77Código
- googleGoogle: Gemini 3.8 Flash2026-09-0241Inteligência76Código
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Inteligência76Código
- anthropicAnthropic: Claude Fable 5.12026-09-0153Inteligência82Código
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 por 1M de tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligência72Código
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 por 1M de tokens
- z-aiZ.ai: GLM 5.32026-08-1845Inteligência75Código
- obsidianQwen3.8 27B2026-08-1534Inteligência68Código
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Inteligência69Código
- grokSpaceXAI: Grok 4.62026-08-1244Inteligência77Código
- metaMeta: Muse Spark 1.22026-08-0540Inteligência72Código
- qwenQwen: Qwen3.8 Max2026-08-0345Inteligência76Código
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135Inteligência69Código
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 por 1M de tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2451Inteligência78Código
Spark-X2.5-4B e Spark-X2.5-1.7B foram lançados publicamente em 1º de setembro de 2026, quando a SparkLLM — a subsidiária XHToken (词元星火) da iFlytek — disponibilizou ambos os modelos compactos como código aberto sob a licença Apache 2.0, com pesos, código e documentação de implantação chegando ao Hugging Face e ao GitHub no mesmo dia. A principal especificação é uma janela de contexto nativa de 1.000.000 de tokens em modelos pequenos o suficiente para rodar no dispositivo, apoiada por um vocabulário declarado de mais de 200 idiomas e um design de atenção híbrida que o fornecedor diz ser ajustado para trabalho de agentes. O que é possível saber hoje a partir dos repositórios é substancial; o que ainda não foi confirmado é tudo o que somente a avaliação independente (benchmarking) pode determinar, porque um modelo lançado há poucas horas não possui avaliações neutras ainda. A família X2.5 também tem um membro maior chegando — Spark-X2.5-293B, anunciado para 7 de setembro.
O que os repositórios realmente mostram
A coleção do Hugging Face contém seis repositórios: Spark-X2.5-4B e Spark-X2.5-1.7B ajustados por instrução, seus checkpoints base e conversões GGUF de ambos. A ficha do 4B descreve uma arquitetura de atenção híbrida — uma camada de atenção plena para cada três camadas de atenção com janela deslizante — que é exatamente o formato que você deseja quando o número de marketing é 1M tokens, porque atenção plena sobre um milhão de tokens seria, de outra forma, quadraticamente cara. A ficha afirma uma janela de contexto nativa de até 1M tokens, com um estágio de treinamento de contexto longo que estendeu o comprimento da sequência para 1M durante o pré-treinamento.
• Arquitetura — atenção híbrida, uma camada de atenção completa para cada três camadas de janela deslizante; safetensors BF16.
• Contexto — nativo de até 1.000.000 de tokens; o treinamento de contexto longo executou sequências de até 1M.
• Idiomas — mais de 200, de acordo com o model card (o 1.7B faz a mesma afirmação).
• Pré-treinamento — cerca de 20 trilhões de tokens de páginas web, livros, publicações acadêmicas, código e material enciclopédico, treinado de ponta a ponta em clusters Huawei Ascend.
• Pós-treinamento — SFT seguido de RL em larga escala em raciocínio, codificação, comportamento agêntico e seguimento de instruções, com políticas de domínio consolidadas por uma técnica que o artigo chama de MOPD.
• Licença — Apache 2.0 para ambos os tamanhos, sem cláusulas de receita ou região do tipo que vários outros laboratórios chineses impõem a lançamentos abertos.

Os números dos agentes — e o quanto confiar neles.
O model card publica uma tabela completa de benchmarks de agente e raciocínio, e os resultados são uniformemente relatados pelo fornecedor e não reproduzidos — rotule-a dessa forma, porque a questão interessante para um 4B lançado há apenas um dia é saber se algo disso sobrevive ao contato com avaliações independentes. Na própria tabela do fornecedor, o Spark-X2.5-4B pontua 65,1 no BFCL-V4 (chamada de funções), 75,1 no τ²-bench (tarefas de agente de longo horizonte), 40,9 no BrowseComp, 44,4 no SWE-Bench Pro, 90,7 no AIME 2026, 81,2 no HMMT February 2026, 74,2 no IMO-AnswerBench e 67,4 no GPQA. O 1.7B tem seu momento em um teste de casa inteligente: 90,3% de precisão de comandos de ponta a ponta, com latência média de 0,85 segundo no conjunto Domux. O fornecedor também afirma que o 4B “rivaliza com modelos na nuvem de 2 a 3 vezes o seu tamanho” em implementação de algoritmos, conclusão e geração de código — uma afirmação que é, ao mesmo tempo, a frase mais útil do comunicado e a que mais precisa de uma verificação neutra.

O que é estruturalmente mais interessante do que qualquer número isolado é que o lançamento é voltado para agentes desde o início. A ficha técnica lista integração com os harnesses Codex, Claude Code, OpenClaw e Hermes, suporte a chamada de ferramentas com um parser dedicado no SGLang e raciocínio habilitado por padrão (uma flag de tempo de execução, enable_thinking, o desativa). Ou seja, o fornecedor posicionou um 4B como modelo de uso de ferramentas, não como um chatbot, o que é uma aposta real: é para os modelos de agentes pequenos que o mercado on-device está de fato se movendo.
Ecossistema Day-0 e a história do vLLM
O Spark-X2.5-4B e o Spark-X2.5-1.7B são suportados no vLLM desde o primeiro dia por meio de um plugin geral fora da árvore, em vez de um merge upstream. A integração fica no repositório XHToken/Spark-plugin: você o clona e uv pip install ., então serve o modelo com vllm serve e --trust-remote-code contra um template de chat personalizado. O caminho SGLang é uma imagem Docker pré-construída iniciada com --tool-call-parser spark25 e --context-length 1048576 — uma janela completa de um milhão de tokens no comando de inicialização, que é a forma mais rápida de verificar na prática a alegação de contexto em hardware real.

Além do vLLM e do SGLang, o modelo é executado no fork do llama.cpp, MLX (Apple silicon e CPU Linux), Ollama e LM Studio via GGUF, com fine-tuning suportado por meio de um fork do LLaMA-Factory. O suporte de hardware é o outro destaque: NVIDIA, Huawei, Hygon e HOUMO.AI — além de Apple silicon — o que importa porque é raro um modelo de laboratório chinês ser lançado com documentação de implantação para Ascend, Hygon e chips nacionais logo no primeiro dia, e não como uma promessa.
Para que serve um modelo on-device de 1M de tokens
O tamanho do contexto é o recurso, e ele aponta para tarefas específicas. Um milhão de tokens de contexto nativo em um modelo de 4B significa um repositório inteiro de código, ou um conjunto extenso de documentos, carregado em um modelo executado localmente — sem pipeline de RAG, sem chunking. A demonstração do próprio fornecedor, construída sobre sua ferramenta de escritório Loomy, faz o modelo de 4B escrever um script para consolidar uma planilha de vendas, extrair métricas-chave e tendências e gerar um relatório bilíngue de aproximadamente 3.000 palavras. O ângulo da robótica é a outra metade: ambos os tamanhos são posicionados para percepção e execução no robô e na borda, abrangendo controle, rastreamento de alvos e navegação — o que é um nicho plausível para um modelo de 1.7B que responde em menos de um segundo.
A jogada maior: Spark-X2.5-293B
Os dois modelos pequenos são a jogada de abertura. Em 7 de setembro, a SparkLLM afirma que lançará o Spark-X2.5-293B, um modelo base de 293 bilhões de parâmetros com, segundo o anúncio, capacidades aprimoradas de codificação e agente. Os modelos pequenos X2.5 são efetivamente a metade no dispositivo de uma história em duas camadas; o modelo grande é onde o teto da família é definido. Tratar os modelos 4B e 1.7B como o lançamento completo seria perder a direção do movimento.
Como experimentar e o que observar.
A API está disponível na plataforma MaaS Xingchen da iFlytek e gratuita por tempo limitado; os pesos estão no Hugging Face, no ModelScope e na biblioteca Ollama. Quanto ao roteamento, o Spark-X2.5-4B é novo demais para que qualquer agregador já o esteja servindo — o OrcaRouter não o roteia hoje, e nada nesta página deve ser lido como se o fizesse. Mas no dia em que um provedor roteado o adicionar, a economia muda de forma previsível: o OrcaRouter repassa o preço de tabela do provedor com margem de 0%; portanto, o que o fornecedor cobrar é o que você paga, com a mesma chave de API que você já usa, e failover automático para que um modelo do dia 0 nunca precise ser uma aposta de produção. Essa é a forma padrão como este blog enxerga um modelo recém-lançado, e vale a pena dizer isso claramente.
Quatro coisas decidirão se este lançamento será um momento ou uma nota de rodapé. Primeiro, se as avaliações independentes — uma entrada no índice Artificial Analysis, uma colocação em arena, uma execução reproduzida do τ²-bench — chegam perto dos números do fornecedor; um 4B marcando 90,7 no AIME é um número grande, e números grandes de um cartão de lançamento são exatamente os que são verificados. Segundo, se o contexto de 1M de tokens se sustenta na pilha de atenção híbrida sob cargas reais de serviço, não apenas no comando de lançamento. Terceiro, se os pesos treinados no Ascend se comportam em hardware NVIDIA no campo. Quarto, o que o Spark-X2.5-293B realmente entrega em 7 de setembro. Até lá, o resumo honesto do Spark-X2.5-4B e do Spark-X2.5-1.7B é: promissor, aberto e totalmente não verificado — o que, para um modelo que foi lançado esta manhã, é o status correto.
