
Vazamento do Spark3: Modelos pequenos de 1.7B e 4B da iFLYTEK estão sendo integrados ao vLLM
- DeepSeekNOVODeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.15 / $0.29 por 1M de tokens
- z-aiNOVOZ.ai: GLM 5.32026-08-1860Inteligência75Código
- obsidianNOVOQwen3.8 27B2026-08-1552Inteligência68Código
- qwenNOVOQwen: Qwen3.8 27B (free)2026-08-13qwen/qwen3.8-27b-free
- deepseekNOVODeepSeek: DeepSeek V4 Pro 08132026-08-1253Inteligência69Código
- grokNOVOSpaceXAI: Grok 4.62026-08-1261Inteligência77Código
- metaMeta: Muse Spark 1.22026-08-0557Inteligência72Código
- qwenQwen: Qwen3.8 Max2026-08-0358Inteligência72Código
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3152Inteligência69Código
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 por 1M de tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463Inteligência78Código
- googleGoogle: Gemini 3.6 Flash2026-07-2152Inteligência69Código
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137Inteligência49Código
- metaMeta: Muse Spark 1.12026-07-1653Inteligência71Código
- kimiMoonshotAI: Kimi K32026-07-1560Inteligência76Código
- openaiOpenAI: GPT-5.6 Luna2026-07-0952Inteligência71Código
- openaiOpenAI: GPT-5.6 Terra2026-07-0957Inteligência77Código
- openaiOpenAI: GPT-5.6 Sol2026-07-0961Inteligência77Código
O Spark3 não tem pesos públicos, nem model card, nem anúncio — {{1}}e, mesmo assim,{{/1}} um pull request chegou esta semana no motor de inferência vLLM descrevendo dois modelos, Spark3-1.7B e Spark3-4B, com detalhes notáveis. {{2}}O pull request #53373{{/2}} no repositório vLLM, "[Model] Add Spark3 Model", adiciona suporte nativo de serving para a arquitetura Spark3: atenção de janela deslizante, um orçamento de raciocínio controlável com quatro níveis, contexto nativo de um milhão de tokens em ambos os tamanhos e um ID de modelo que aponta para a iFLYTEK. {{3}}Nada disso é confirmado pelo fornecedor{{/3}}, e nada foi lançado. Este é um texto do tipo "o que sabemos até agora": o pull request é real, e tudo o que se diz que os modelos fazem continua sem verificação até que a iFLYTEK — ou quem quer que lance o Spark3 — publique de fato os pesos.
O vazamento: um pull request que parece uma especificação.
O sinal é um PR aberto de vLLM, submetido por um usuário do GitHub chamado KnightYao (um contribuidor baseado em Hefei que menciona a Universidade de Ciência e Tecnologia da China), e, em 23 de agosto de 2026, ainda não foi mesclado. Um mantenedor do vLLM solicitou alterações em 22 de agosto com a nota "aguardando discussões". O PR é inicial e contestado, o que é normal para esse tipo de integração — e também é incomumente detalhado para um PR de framework sobre um modelo que ninguém fora do laboratório pode baixar.
O diff altera oito arquivos. Ele adiciona uma implementação do Spark3ForCausalLM no executor de modelos do vLLM, um Spark3Config nativo cadastrado nos registros de configuração e de modelos do vLLM, suporte à atenção de janela deslizante e à atenção completa, além de gating da saída de atenção por cabeça, carregamento de pesos com paralelismo de tensor e de pipeline, e um parser XML de ferramentas do Spark3 para que as chamadas de ferramentas do modelo possam ser decodificadas de forma estruturada. Também adiciona uma linha à documentação de modelos suportados do vLLM listando o checkpoint como XHToken/Spark3-1.7B. A descrição chega até a afirmar que a integração passou por benchmark: 500 requisições concorrentes, 100% de sucesso, aproximadamente 106 requisições por segundo e 13,5 mil tokens de saída por segundo na configuração de teste do autor. Esses números foram autoinformados pela pessoa que escreveu o PR, não são um benchmark independente, e devem ser lidos exatamente dessa forma.
Por que a iFLYTEK é a controladora óbvia — mas não confirmada
Nada no PR nomeia o fornecedor. Mas o ID do checkpoint que ele registra, XHToken/Spark3-1.7B, está sob a organização XHToken no Hugging Face, e essa organização é da iFLYTEK: a página da organização a lista como uma empresa, aponta para opensource.iflytek.com e atualmente mostra zero modelos públicos e zero conjuntos de dados públicos. "XH" é a abreviação natural de 星火 (Xinghuo, "Spark"), a família de modelos da iFLYTEK. Adicione a localização do autor em Hefei — a iFLYTEK está sediada em Hefei — e a inferência é tão forte quanto uma inferência pode ser antes de o fornecedor confirmá-la.
Isso se encaixa no padrão recente da iFLYTEK. O Spark X2 da empresa, lançado em fevereiro de 2026, foi explicitamente direcionado para casos de uso em educação, medicina, automotivo e agentes, e sua linha SparkAuto-EMM de modelos on-device é oferecida em tamanhos pequenos, de 0,5B a 7B. Dois dias antes de esse comunicado de imprensa vir à tona, na conferência de resultados de 21 de agosto, a iFLYTEK afirmou que um novo modelo emblemático de propósito geral, construído inteiramente com computação nacional, estava por vir, com uma versão faseada prevista para "até o final de agosto" e um lançamento completo no 1024 Developer Day, em outubro. Se o Spark3-1.7B e o Spark3-4B fazem parte dessa liberação faseada, ou de uma trilha separada focada em edge, é uma questão em aberto que o comunicado não responde.

O que se diz que os modelos são
As alegações do PR, todas não verificadas:
• Dois tamanhos. Spark3-1.7B e Spark3-4B. Ambos são descritos como designs que priorizam a eficiência, utilizando atenção de janela deslizante em vez de um layout de atenção total densa.
• Contexto nativo de 1M tokens em ambos.Não é uma promessa de modo estendido — o PR afirma que o contexto é nativo da arquitetura, o que colocaria um milhão de tokens em um modelo pequeno o suficiente para ser plausível em uma única GPU.
• Um orçamento de pensamento de quatro níveis. O raciocínio pode ser definido como nenhum, baixo, médio ou alto, um design de pensamento alternável que permite a um aplicativo trocar a profundidade do raciocínio por latência e custo por chamada.
• 200+ idiomas e força em exames chineses. O comunicado de imprensa afirma um forte desempenho em perguntas e respostas para K-12 e Gaokao — uma marca registrada da iFLYTEK, dado o negócio de educação da empresa — e cobertura multilíngue em mais de 200 idiomas.
• Codificação e orientação a agentes. Alegações de forte geração de código, uso de ferramentas, execução em múltiplas etapas e raciocínio de contexto longo para o seu tamanho, respaldadas pelo parser de ferramentas XML incluído no mesmo PR.
Contexto nativo de 1M em um 1.7B é a parte que vale a pena notar
O comprimento de contexto é onde os modelos pequenos têm estagnado. No cenário atual de pesos abertos, um modelo de 1,7B–4B normalmente é lançado com uma janela nativa de 32K–256K: os checkpoints pequenos do Qwen3 são 32K nativos, com 131K via rope scaling, e até mesmo o 256K nativo melhorado do Qwen3.5 em variantes pequenas é um passo recente. O contexto de um milhão de tokens tem sido, até agora, um recurso de modelos grandes — os checkpoints de contexto de 1M do GLM têm centenas de bilhões de parâmetros. Se o Spark3 realmente entregar uma janela nativa de 1M em um modelo de 4B, seria uma especificação genuinamente incomum, e a arquitetura de atenção com janela deslizante é exatamente como se torna isso barato em memória. A ressalva que precisa vir junto: um número de manchete de 1M nativo é fácil de escrever em um comunicado e difícil de tornar útil na prática. A qualidade de contexto longo — o modelo consegue realmente encontrar e usar um fato 700K tokens atrás — é uma questão separada de quantos tokens cabem na janela, e ainda não existe nenhuma avaliação independente.
O orçamento de pensamento controlável é importante pelo mesmo motivo. Quatro níveis de raciocínio (nenhum / baixo / médio / alto) são um design de pensamento alternável no espírito do modo de pensamento liga/desliga do Qwen3, mas mais rico: em vez de uma escolha binária, um aplicativo pode escolher um nível por solicitação — sem pensamento para uma tradução, alto para um turno de agente com várias etapas — e pagar apenas pelo raciocínio de que precisa. Para uma carga de trabalho agêntica ou em lote, esse é exatamente o controle que transforma um modelo pequeno "capaz, mas caro" em um modelo com custo gerenciado.
A receita de pós-treinamento segue um padrão de 2026.
O PR afirma que o Spark3 foi pós-treinado com "Scaled Reinforcement Learning e MOPD". MOPD — Multi-Teacher On-Policy Distillation (Destilação On-Policy com Múltiplos Professores) — é uma técnica real e atual, descrita em um artigo do arXiv (2606.30406): treinar professores RL especialistas em domínios paralelos e, em seguida, destilá-los de volta em um único aluno usando as próprias rolagens do aluno, minimizando a KL reversa por token contra o professor certo para cada prompt. É a receita de 2026 que permite que um único modelo herde habilidades de matemática, codificação e agente sem que uma execução de RL brigue com outra, e tem sido publicamente creditada no pós-treinamento de modelos como MiMo Flash V2, DeepSeek V4 e Nemotron 3 Ultra. O Spark3 citando a mesma receita o coloca nessa geração — modelos pequenos, técnicas de pós-treinamento de ponta. Também significa que as "fortes alegações de codificação e agente" têm um mecanismo plausível por trás delas. Plausível não é o mesmo que comprovado: as alegações continuam sendo reportadas pelo fornecedor até que os pesos sejam lançados e avaliações independentes sejam executadas.
O que é genuinamente desconhecido
Quase tudo com um calendário:
• Data de lançamento. Sem pesos no Hugging Face, sem anúncio, sem cronograma. A organização XHToken está vazia hoje.
• Confirmação do fornecedor. iFLYTEK não disse nada sobre o Spark3. O link da organização XHToken é uma forte evidência, não uma declaração oficial.
• Seja o carro-chefe por fases. a versão por fases "final de agosto" do novo carro-chefe da iFLYTEK pode ser esta — ou não relacionada. O comunicado não fornece nenhuma data.
• Preços e licença. Nada é divulgado. Historicamente, a família Spark da iFLYTEK tem sido majoritariamente composta por modelos servidos via API em vez de pesos abertos, portanto saber se os Spark3-1.7B e Spark3-4B são checkpoints abertos ou um alvo de serviço interno é uma questão em aberto.
• Todos os benchmarks. Os números de throughput no PR são do teste de serving do próprio autor, não uma avaliação independente, e nenhum leaderboard pontuou o modelo porque nenhum modelo existe publicamente.

O que assistir
A organização XHToken no Hugging Face é o canal de lançamento a observar. Se o modelo for real, seus pesos — ou pelo menos um model card — devem aparecer lá, e a organização passando de zero para um repositório público é o sinal que mais importa. Algumas coisas para verificar no momento em que isso acontecer:
• O número do contexto. O 1M é nativo, ou estendido por rope com trade-off de qualidade? O PR diz nativo; os model cards são onde isso é definido.
• A API de orçamento de raciocínio. A forma como os quatro níveis de raciocínio são expostos — como um parâmetro de amostragem, um campo do template de chat ou uma variante de modelo separada — determina o quão fácil é realmente usá-la.
• A licença. Pesos abertos fariam do Spark3 o primeiro modelo sub-5B com contexto nativo de 1M disponível para auto-hospedagem; um lançamento apenas via API o tornaria um tipo diferente de produto.
• Calendário de anúncios da iFLYTEK. O carro-chefe em fases é prometido para o final de agosto, e o lançamento completo no October 1024 Developer Day. Se o Spark3 fizer parte de qualquer um deles, a descrição oficial dirá o que o comunicado de imprensa deixa em aberto.
• Se o PR for mesclado.O suporte ao vLLM importa como sinal de qualidade e como infraestrutura: o primeiro runtime com suporte nativo ao Spark3 torna o modelo executável em produção no dia em que os pesos forem disponibilizados.
O que um desenvolvedor deve fazer agora
Nada. Não há modelo para chamar, nenhum peso para baixar, nenhuma chave de API para provisionar — qualquer ferramenta que afirma servir o Spark3 hoje está servindo outra coisa. O que você pode fazer é decidir como avaliá-lo no dia em que ele aparecer, porque este é um modelo com uma promessa muito verificável: um 1.7B ou 4B que lê um milhão de tokens e raciocina em quatro profundidades é ou uma categoria genuinamente nova de modelo pequeno ou uma história de ficha técnica, e a diferença é mensurável em uma tarde no seu próprio workload.
É também aí que uma camada de roteamento mostra seu valor. No OrcaRouter, um modelo não é um contrato ao qual você se compromete; é uma entrada em um catálogo que você acessa por meio de uma única API, e os preços de tabela dos provedores são repassados sem nenhuma margem — então, quando um novo modelo aparece no catálogo de um provedor, o preço real dele fica ativo no nosso lado no mesmo dia, e testá-lo não custa uma segunda integração nem renegociação. Para um modelo tão pouco comprovado quanto o Spark3, o padrão sensato é o mesmo que você usaria para qualquer vazamento promissor: colocá-lo atrás de failover automático na DSL de roteamento, deixar uma parcela do tráfego alcançá-lo e manter um modelo comprovado do outro lado da regra, para que uma avaliação ruim, uma surpresa de licença ou um resultado decepcionante de contexto longo seja uma mudança de roteamento, e não um incidente. Uma chave, um endpoint, 200+ modelos — e quando o Spark3-1.7B ou o Spark3-4B estiver de fato executável, o repasse e o failover se aplicam a ele como a qualquer outro modelo.
![A screenshot of vLLM pull request 53373 titled '[Model] Add Spark3 Model' on GitHub (captured August 23, 2026) showing the open PR status, the author KnightYao, the 'new-model' label, the reviewers including youkaichao, and the description 'This PR adds native support for the Spark 3 model architecture'.](https://cms.orcarouter.ai/api/media/file/4-438.png)
O resumo honesto é uma frase, não um veredito: um PR de framework escrito esta semana afirma que a iFLYTEK tem dois modelos pequenos com contexto nativo de um milhão de tokens e um orçamento de pensamento de quatro níveis, e nenhuma evidência substancial foi publicada para sustentar qualquer uma dessas afirmações. Fique de olho na organização XHToken, fique de olho na promessa da iFLYTEK para o fim de agosto e, quando os pesos forem reais, coloque-os em uma regra de roteamento com failover antes de apostar um caminho de produção neles. Esse é todo o manual para um vazamento — acredite na infraestrutura, verifique o modelo e mantenha a saída barata.
