Card de título hero para o artigo 'Spark3 — RELATÓRIO DE VAZAMENTO' com um selo '{{1}}NÃO VERIFICADO{{/1}}', o subtítulo 'os modelos pequenos Spark3-1.7B e Spark3-4B da iFLYTEK estão sendo integrados ao vLLM — o que o PR diz e o que ainda é desconhecido', três chips com os textos 'Fonte: vLLM PR #53373', '22 de ago. de 2026' e 'XHToken / iFLYTEK', um card à esquerda com o texto 'O sinal: um PR aberto no vLLM adicionando suporte nativo a Spark3 para um modelo sem pesos públicos' e um card à direita com o texto 'Esperado: 1.7B e 4B, contexto nativo de 1M de tokens, orçamento de raciocínio de 4 níveis'. O logotipo do OrcaRouter é composto no canto inferior direito.
Guides & Insights

Vazamento do Spark3: Modelos pequenos de 1.7B e 4B da iFLYTEK estão sendo integrados ao vLLM

Autor

Magnus Corvin

Data de publicação

Modelos mais recentes · 20Ver todos os modelos
Benchmarks: Artificial Analysis · atualizado diariamente
Voltar para todas as publicações

O Spark3 não tem pesos públicos, nem model card, nem anúncio — {{1}}e, mesmo assim,{{/1}} um pull request chegou esta semana no motor de inferência vLLM descrevendo dois modelos, Spark3-1.7B e Spark3-4B, com detalhes notáveis. {{2}}O pull request #53373{{/2}} no repositório vLLM, "[Model] Add Spark3 Model", adiciona suporte nativo de serving para a arquitetura Spark3: atenção de janela deslizante, um orçamento de raciocínio controlável com quatro níveis, contexto nativo de um milhão de tokens em ambos os tamanhos e um ID de modelo que aponta para a iFLYTEK. {{3}}Nada disso é confirmado pelo fornecedor{{/3}}, e nada foi lançado. Este é um texto do tipo "o que sabemos até agora": o pull request é real, e tudo o que se diz que os modelos fazem continua sem verificação até que a iFLYTEK — ou quem quer que lance o Spark3 — publique de fato os pesos.

O vazamento: um pull request que parece uma especificação.

O sinal é um PR aberto de vLLM, submetido por um usuário do GitHub chamado KnightYao (um contribuidor baseado em Hefei que menciona a Universidade de Ciência e Tecnologia da China), e, em 23 de agosto de 2026, ainda não foi mesclado. Um mantenedor do vLLM solicitou alterações em 22 de agosto com a nota "aguardando discussões". O PR é inicial e contestado, o que é normal para esse tipo de integração — e também é incomumente detalhado para um PR de framework sobre um modelo que ninguém fora do laboratório pode baixar.

O diff altera oito arquivos. Ele adiciona uma implementação do Spark3ForCausalLM no executor de modelos do vLLM, um Spark3Config nativo cadastrado nos registros de configuração e de modelos do vLLM, suporte à atenção de janela deslizante e à atenção completa, além de gating da saída de atenção por cabeça, carregamento de pesos com paralelismo de tensor e de pipeline, e um parser XML de ferramentas do Spark3 para que as chamadas de ferramentas do modelo possam ser decodificadas de forma estruturada. Também adiciona uma linha à documentação de modelos suportados do vLLM listando o checkpoint como XHToken/Spark3-1.7B. A descrição chega até a afirmar que a integração passou por benchmark: 500 requisições concorrentes, 100% de sucesso, aproximadamente 106 requisições por segundo e 13,5 mil tokens de saída por segundo na configuração de teste do autor. Esses números foram autoinformados pela pessoa que escreveu o PR, não são um benchmark independente, e devem ser lidos exatamente dessa forma.

Por que a iFLYTEK é a controladora óbvia — mas não confirmada

Nada no PR nomeia o fornecedor. Mas o ID do checkpoint que ele registra, XHToken/Spark3-1.7B, está sob a organização XHToken no Hugging Face, e essa organização é da iFLYTEK: a página da organização a lista como uma empresa, aponta para opensource.iflytek.com e atualmente mostra zero modelos públicos e zero conjuntos de dados públicos. "XH" é a abreviação natural de 星火 (Xinghuo, "Spark"), a família de modelos da iFLYTEK. Adicione a localização do autor em Hefei — a iFLYTEK está sediada em Hefei — e a inferência é tão forte quanto uma inferência pode ser antes de o fornecedor confirmá-la.

Isso se encaixa no padrão recente da iFLYTEK. O Spark X2 da empresa, lançado em fevereiro de 2026, foi explicitamente direcionado para casos de uso em educação, medicina, automotivo e agentes, e sua linha SparkAuto-EMM de modelos on-device é oferecida em tamanhos pequenos, de 0,5B a 7B. Dois dias antes de esse comunicado de imprensa vir à tona, na conferência de resultados de 21 de agosto, a iFLYTEK afirmou que um novo modelo emblemático de propósito geral, construído inteiramente com computação nacional, estava por vir, com uma versão faseada prevista para "até o final de agosto" e um lançamento completo no 1024 Developer Day, em outubro. Se o Spark3-1.7B e o Spark3-4B fazem parte dessa liberação faseada, ou de uma trilha separada focada em edge, é uma questão em aberto que o comunicado não responde.

A two-column infographic titled 'Spark3 — what we know / what we don't'. Left column 'What we know (from the PR)': 'Open vLLM PR #53373, review requested Aug 22, 2026', 'Two sizes: Spark3-1.7B and Spark3-4B', 'Native 1M-token context on both', 'Thinking budget: none / low / medium / high', '200+ languages; strong Gaokao and K-12 results', 'Model ID under iFLYTEK's XHToken HF org'. Right column 'What we don't': 'Release date — no weights, no announcement', 'Vendor confirmation — iFLYTEK has not commented', 'Independent benchmarks — PR figures are self-reported', 'Pricing and license — undisclosed', 'Whether it is the phased flagship due end of August', 'Whether the 1M context is native or rope-scaled'. Footer: 'All model claims unverified; only the pull request is confirmed.' The OrcaRouter logo is composited in the bottom-right corner.

O que se diz que os modelos são

As alegações do PR, todas não verificadas:

Dois tamanhos. Spark3-1.7B e Spark3-4B. Ambos são descritos como designs que priorizam a eficiência, utilizando atenção de janela deslizante em vez de um layout de atenção total densa.

Contexto nativo de 1M tokens em ambos.Não é uma promessa de modo estendido — o PR afirma que o contexto é nativo da arquitetura, o que colocaria um milhão de tokens em um modelo pequeno o suficiente para ser plausível em uma única GPU.

Um orçamento de pensamento de quatro níveis. O raciocínio pode ser definido como nenhum, baixo, médio ou alto, um design de pensamento alternável que permite a um aplicativo trocar a profundidade do raciocínio por latência e custo por chamada.

200+ idiomas e força em exames chineses. O comunicado de imprensa afirma um forte desempenho em perguntas e respostas para K-12 e Gaokao — uma marca registrada da iFLYTEK, dado o negócio de educação da empresa — e cobertura multilíngue em mais de 200 idiomas.

Codificação e orientação a agentes. Alegações de forte geração de código, uso de ferramentas, execução em múltiplas etapas e raciocínio de contexto longo para o seu tamanho, respaldadas pelo parser de ferramentas XML incluído no mesmo PR.

Contexto nativo de 1M em um 1.7B é a parte que vale a pena notar

O comprimento de contexto é onde os modelos pequenos têm estagnado. No cenário atual de pesos abertos, um modelo de 1,7B–4B normalmente é lançado com uma janela nativa de 32K–256K: os checkpoints pequenos do Qwe​n3 são 32K nativos, com 131K via rope scaling, e até mesmo o 256K nativo melhorado do Qwe​n3.5 em variantes pequenas é um passo recente. O contexto de um milhão de tokens tem sido, até agora, um recurso de modelos grandes — os checkpoints de contexto de 1M do G​LM têm centenas de bilhões de parâmetros. Se o Spark3 realmente entregar uma janela nativa de 1M em um modelo de 4B, seria uma especificação genuinamente incomum, e a arquitetura de atenção com janela deslizante é exatamente como se torna isso barato em memória. A ressalva que precisa vir junto: um número de manchete de 1M nativo é fácil de escrever em um comunicado e difícil de tornar útil na prática. A qualidade de contexto longo — o modelo consegue realmente encontrar e usar um fato 700K tokens atrás — é uma questão separada de quantos tokens cabem na janela, e ainda não existe nenhuma avaliação independente.

O orçamento de pensamento controlável é importante pelo mesmo motivo. Quatro níveis de raciocínio (nenhum / baixo / médio / alto) são um design de pensamento alternável no espírito do modo de pensamento liga/desliga do Qwe​n3, mas mais rico: em vez de uma escolha binária, um aplicativo pode escolher um nível por solicitação — sem pensamento para uma tradução, alto para um turno de agente com várias etapas — e pagar apenas pelo raciocínio de que precisa. Para uma carga de trabalho agêntica ou em lote, esse é exatamente o controle que transforma um modelo pequeno "capaz, mas caro" em um modelo com custo gerenciado.

A receita de pós-treinamento segue um padrão de 2026.

O PR afirma que o Spark3 foi pós-treinado com "Scaled Reinforcement Learning e MOPD". MOPD — Multi-Teacher On-Policy Distillation (Destilação On-Policy com Múltiplos Professores) — é uma técnica real e atual, descrita em um artigo do arXiv (2606.30406): treinar professores RL especialistas em domínios paralelos e, em seguida, destilá-los de volta em um único aluno usando as próprias rolagens do aluno, minimizando a KL reversa por token contra o professor certo para cada prompt. É a receita de 2026 que permite que um único modelo herde habilidades de matemática, codificação e agente sem que uma execução de RL brigue com outra, e tem sido publicamente creditada no pós-treinamento de modelos como MiMo Flash V2, DeepSeek V4 e Nemotron 3 Ultra. O Spark3 citando a mesma receita o coloca nessa geração — modelos pequenos, técnicas de pós-treinamento de ponta. Também significa que as "fortes alegações de codificação e agente" têm um mecanismo plausível por trás delas. Plausível não é o mesmo que comprovado: as alegações continuam sendo reportadas pelo fornecedor até que os pesos sejam lançados e avaliações independentes sejam executadas.

O que é genuinamente desconhecido

Quase tudo com um calendário:

Data de lançamento. Sem pesos no Hugging Face, sem anúncio, sem cronograma. A organização XHToken está vazia hoje.

Confirmação do fornecedor. iFLYTEK não disse nada sobre o Spark3. O link da organização XHToken é uma forte evidência, não uma declaração oficial.

Seja o carro-chefe por fases. a versão por fases "final de agosto" do novo carro-chefe da iFLYTEK pode ser esta — ou não relacionada. O comunicado não fornece nenhuma data.

Preços e licença. Nada é divulgado. Historicamente, a família Spark da iFLYTEK tem sido majoritariamente composta por modelos servidos via API em vez de pesos abertos, portanto saber se os Spark3-1.7B e Spark3-4B são checkpoints abertos ou um alvo de serviço interno é uma questão em aberto.

Todos os benchmarks. Os números de throughput no PR são do teste de serving do próprio autor, não uma avaliação independente, e nenhum leaderboard pontuou o modelo porque nenhum modelo existe publicamente.

A screenshot of the XHToken Hugging Face organization page (captured August 23, 2026) showing the organization name 'XHToken', listed as a company with a link to opensource.iflytek.com, and the text 'None public yet' with zero public models and zero public datasets — confirming no Spark3 weights have been released.

O que assistir

A organização XHToken no Hugging Face é o canal de lançamento a observar. Se o modelo for real, seus pesos — ou pelo menos um model card — devem aparecer lá, e a organização passando de zero para um repositório público é o sinal que mais importa. Algumas coisas para verificar no momento em que isso acontecer:

O número do contexto. O 1M é nativo, ou estendido por rope com trade-off de qualidade? O PR diz nativo; os model cards são onde isso é definido.

A API de orçamento de raciocínio. A forma como os quatro níveis de raciocínio são expostos — como um parâmetro de amostragem, um campo do template de chat ou uma variante de modelo separada — determina o quão fácil é realmente usá-la.

A licença. Pesos abertos fariam do Spark3 o primeiro modelo sub-5B com contexto nativo de 1M disponível para auto-hospedagem; um lançamento apenas via API o tornaria um tipo diferente de produto.

Calendário de anúncios da iFLYTEK. O carro-chefe em fases é prometido para o final de agosto, e o lançamento completo no October 1024 Developer Day. Se o Spark3 fizer parte de qualquer um deles, a descrição oficial dirá o que o comunicado de imprensa deixa em aberto.

Se o PR for mesclado.O suporte ao vLLM importa como sinal de qualidade e como infraestrutura: o primeiro runtime com suporte nativo ao Spark3 torna o modelo executável em produção no dia em que os pesos forem disponibilizados.

O que um desenvolvedor deve fazer agora

Nada. Não há modelo para chamar, nenhum peso para baixar, nenhuma chave de API para provisionar — qualquer ferramenta que afirma servir o Spark3 hoje está servindo outra coisa. O que você pode fazer é decidir como avaliá-lo no dia em que ele aparecer, porque este é um modelo com uma promessa muito verificável: um 1.7B ou 4B que lê um milhão de tokens e raciocina em quatro profundidades é ou uma categoria genuinamente nova de modelo pequeno ou uma história de ficha técnica, e a diferença é mensurável em uma tarde no seu próprio workload.

É também aí que uma camada de roteamento mostra seu valor. No OrcaRouter, um modelo não é um contrato ao qual você se compromete; é uma entrada em um catálogo que você acessa por meio de uma única API, e os preços de tabela dos provedores são repassados sem nenhuma margem — então, quando um novo modelo aparece no catálogo de um provedor, o preço real dele fica ativo no nosso lado no mesmo dia, e testá-lo não custa uma segunda integração nem renegociação. Para um modelo tão pouco comprovado quanto o Spark3, o padrão sensato é o mesmo que você usaria para qualquer vazamento promissor: colocá-lo atrás de failover automático na DSL de roteamento, deixar uma parcela do tráfego alcançá-lo e manter um modelo comprovado do outro lado da regra, para que uma avaliação ruim, uma surpresa de licença ou um resultado decepcionante de contexto longo seja uma mudança de roteamento, e não um incidente. Uma chave, um endpoint, 200+ modelos — e quando o Spark3-1.7B ou o Spark3-4B estiver de fato executável, o repasse e o failover se aplicam a ele como a qualquer outro modelo.

A screenshot of vLLM pull request 53373 titled '[Model] Add Spark3 Model' on GitHub (captured August 23, 2026) showing the open PR status, the author KnightYao, the 'new-model' label, the reviewers including youkaichao, and the description 'This PR adds native support for the Spark 3 model architecture'.

O resumo honesto é uma frase, não um veredito: um PR de framework escrito esta semana afirma que a iFLYTEK tem dois modelos pequenos com contexto nativo de um milhão de tokens e um orçamento de pensamento de quatro níveis, e nenhuma evidência substancial foi publicada para sustentar qualquer uma dessas afirmações. Fique de olho na organização XHToken, fique de olho na promessa da iFLYTEK para o fim de agosto e, quando os pesos forem reais, coloque-os em uma regra de roteamento com failover antes de apostar um caminho de produção neles. Esse é todo o manual para um vazamento — acredite na infraestrutura, verifique o modelo e mantenha a saída barata.

© 2026 OrcaRouter

Para provedores

Opera uma plataforma de inferência? Traga seus modelos para o OrcaRouter.

providers@orcarouter.ai

Junte-se à comunidade

Discordsupport@orcarouter.aiXGitHubYouTube