Um cartão de título gerado com o texto 'FrogNano-4B-2609' e o subtítulo 'um agente de programação 4B no backbone Qwen3.5-4B', três chips com os textos '59,6B bytes de pesos', 'o cartão diz 22-SEP-2026' e 'nenhum post de lançamento', um rodapé com o texto 'Números conforme o cartão de modelo e o relatório técnico da Microsoft; nada aqui é reproduzido de forma independente', e o logotipo do OrcaRouter composto no canto inferior direito.
Engineering & Research

FrogNano-4B-2609: A Microsoft lançou um agente de programação de 4B no Hugging Face e nunca o anunciou

Autor

Alistair Wren

Data de publicação

Modelos mais recentes · 20Ver todos os modelos →
Benchmarks: Artificial Analysis · atualizado diariamente
Voltar para todas as publicações

O repositório foi publicado em 17 de setembro de 2026 com o commit inicial, e o próprio checkpoint chegou quatro minutos depois. Depois, nada. Nenhum tweet da Microsoft AI, nenhuma entrada no blog da Microsoft Research, nenhuma página de lançamento. Sete semanas depois microsoft/FrogNano-4B-2609 — um agente de programação de classe de quatro bilhões construído sobre Qwen3.5-4B — ainda não tem nenhum anúncio por trás dele, e esse silêncio é o fato mais importante sobre a publicação deste modelo. O que ele tem é um cartão de modelo que alega um artigo e um harness, um repositório no GitHub que acaba sendo o harness e não o artigo, e um createdAt de 17 de setembro sob um cartão que diz "Release date 22-SEP-2026". Ambas as datas são improvisadas; nenhuma está errada; elas discordam entre si.

O que é realmente publicado

Tudo abaixo pode ser verificado no hub agora mesmo, e cada número neste artigo vem do próprio card da Microsoft ou das contagens de bytes no próprio repositório. Nada foi reproduzido por terceiros — não há entrada no Artificial Analysis, nem classificação de arena, nem avaliação independente do FrogNano em lugar algum.

• Pesos — um repositório público sob a organização Microsoft, sem restrições, marcado como MIT no hub, 15 arquivos, sem barreira de download e sem acordo para assinar.

• Pesos em disco — 9,32 GB distribuídos em dois shards de safetensors, 59,6 bilhões de bytes de dados do repositório, incluindo o conjunto de arquivos sem otimizador, 738 tensores no índice.

• Arquitetura — Qwen3_5ForConditionalGeneration, o stack híbrido denso de 32 camadas herdado do Qwen3.5-4B, com uma torre de visão de 24 camadas que, segundo a ficha, foi herdada e nunca passou por pós-treinamento.

• O próprio campo de parâmetro do cartão — "500M-5B". Trata-se de uma faixa, não de um número, e o download é o documento mais preciso.

• Licença — o preâmbulo do cartão diz MIT. O corpo do próprio cartão diz Apache License 2.0, e o harness do GitHub realmente inclui um arquivo LICENSE do MIT. Essas duas afirmações dizem respeito a artefatos diferentes na mesma versão.

• Anúncio — nenhum. Nem no blog do Microsoft Research, nem no site de pesquisa da própria equipe, nem no feed da organização no Hugging Face como algo além de uma listagem de repositório.

Essa última linha é a que deveria definir a postura de um leitor para o resto deste texto. Um checkpoint publicado silenciosamente não é um artefato inferior a um anunciado — seu card costuma ser mais longo, porque ninguém o está encurtando para um comunicado à imprensa. Mas ele não passou pelo único filtro que um lançamento anunciado ganha de graça: outras pessoas olhando para ele.

A screenshot of Microsoft's Hugging Face model card for FrogNano-4B-2609 showing the model summary table with rows for Developer (Microsoft Corporation), Description, Model architecture, Parameters (500M-5B), Inputs, Outputs, Context length (approximately 131K tokens in the evaluated coding-agent configuration), Training Dates (Jun 2026 to Aug 2026), Release date (22-SEP-2026), License (Apache License 2.0), the Qwen/Qwen3.5-4B model dependency, the 'Technical report;' and 'Leaf harness.' asset links, and the section 1 Model overview naming Qwen3.5-4B and the dense 32-layer hybrid Gated DeltaNet and gated-attention architecture.

As pontuações, e quem produziu cada uma delas

A Microsoft informa que o FrogNano alcança 61,5% no SWE-bench Verified, 37,6% no SWE-bench Pro, 31,1% no Terminal-Bench 2.0 e 47,3% no PatchEval-Verified, todos como taxas de resolução Avg@3 medidas por meio do harness Leaf. O mesmo cartão fornece o ponto de partida: o Qwen3.5-4B pontuou 39,4% no SWE-bench Verified sob o mesmo harness e orçamento. Cinco iterações de aprendizado por reforço o fizeram passar por 49,1%, 53,1%, 56,7%, 59,1% e 61,5% — 22,1 pontos acima do modelo base, o que o próprio enquadramento da Microsoft arredonda para cerca de 56% de melhoria relativa.

Vale a pena parar para pensar em duas coisas dessa escada, porque elas são pontos em que um resumo pode errar, e não pontos em que o fornecedor errou.

A primeira é a discrepância do Iter 5. A tabela principal do card diz 61,5% para a iteração final; o próprio apêndice de eficiência do artigo relata a mesma progressão de cinco checkpoints como 48,2%, 53,4%, 58,3%, 58,6% e 61,6%. Só o último número está próximo, e só o último número é o que todo mundo cita. Trate o valor final como o resultado estável e os degraus intermediários como medição de coisas diferentes, porque, sob uma agregação diferente, eles claramente o são.

A segunda é que o FrogNano não é uniformemente melhor do que o modelo do qual partiu em todos os aspectos. A sua taxa publicada de chamadas paralelas de ferramentas é de 1,71%. A ficha do modelo é franca ao afirmar que iterações posteriores perderam a capacidade de disparar várias chamadas de ferramentas em um único turno, e que o trabalho de consolidação da equipe existe em parte para recuperá-la. Um modelo que resolve mais problemas enquanto faz quase nenhuma chamada concorrente é um trade-off real de engenharia, não uma nota de rodapé.

A generated two-column scoreboard reading 'Microsoft reports' on the left with rows Qwen3.5-4B base 39.4%, Iter 2 49.1%, Iter 4 59.1% and Iter 5 61.5%, and 'What is not verified' on the right with rows Independent evaluation: none, Parallel tool calls: 1.71%, Repository size: 59.6B bytes, Card release date: 22-SEP-2026 and Hub created: 17-SEP-2026, with a footer reading 'All scores vendor-reported through the Leaf harness; no third party has reproduced any of them.'

O harness é o produto, e o repositório é o harness.

O FrogNano não é executado por conta própria. Ele emite chamadas estruturadas para cinco ferramentas — Read, Write, Edit, Glob e Bash — e algo precisa executá-las em um ambiente isolado e devolver a saída. Esse algo é o Leaf, e aqui a trilha faz algo levemente incomum.

A linha "recursos relacionados adicionais" do cartão de modelo aponta para um relatório técnico em aka.ms/frognano-tech-report e para um harness em github.com/microsoft/FrogNano. O link aka.ms não aponta para um PDF; redireciona diretamente para a página de resumo do arXiv, que é onde o relatório real está. O repositório do GitHub, por sua vez, não contém código de treinamento, receita de RL nem checkpoints. O próprio README descreve um harness de avaliação que executa agentes de codificação em sandboxes do Kubernetes contra um endpoint compatível com OpenAI, e remete de volta ao artigo do arXiv para a história do treinamento. Portanto, os dois links de ativos do cartão são um ponteiro para o artigo e um ponteiro para a resposta ao artigo, e o nome é compartilhado.

Isto é importante para quem planeia usar o modelo, por uma razão prática. A receita de serving documentada é SGLang com --reasoning-parser qwen3 e --tool-call-parser qwen3_coder, e o harness quer um endpoint que já fale chamadas de ferramentas e raciocínio. Basta configurar o parsing ligeiramente mal e o modelo produz texto onde o harness espera JSON, o que, visto de fora, parece exatamente um modelo mau em vez de uma configuração má. O card é explícito ao afirmar que qualquer pontuação correspondente exige um checkpoint, tokenizer, configuração de serving, imagens de tarefa e protocolo de avaliação correspondentes — ou seja, é o fornecedor a dizer que o harness é metade do resultado.

Também vale dizer claramente para quem está dimensionando hardware: um checkpoint de 9,32 GB no contexto avaliado da ficha do modelo não é um problema de inferência de 9,32 GB. As avaliações rodaram com cerca de 131K tokens combinados e um orçamento de 150 passos. A memória escala com o contexto, não com os pesos, e a ficha diz que a configuração mínima de GPU ainda "deve ser validada antes do lançamento" — uma frase que aparece em um modelo que já está disponível para download.

O que o treinamento realmente fez, em um parágrafo

A contribuição do artigo não é o modelo, é o loop. O TaskPilot gera tarefas candidatas de engenharia de software a partir de snapshots reais de repositórios, executa rollouts a partir do checkpoint atual sobre elas, mantém aquelas que estão perto do limite daquilo que a política às vezes consegue resolver e descarta as candidatas que são permanentemente triviais ou permanentemente impossíveis. O conjunto aceito treina o próximo checkpoint. Esse próximo checkpoint então calibra a rodada seguinte de geração de tarefas, de modo que a distribuição de tarefas se move conforme a política se move. Cerca de 1.500 ambientes validados no total. Sem destilação: o card afirma categoricamente que o pós-treinamento específico para agente não usou trajetórias de solução, ações, traços de raciocínio ou alvos de patch de modelos mais fortes. Modelos mais fortes escrevem tarefas; eles não demonstram respostas.

A Microsoft executou esse loop por cinco iterações e relata um ganho de 8,7 pontos antes de qualquer consolidação, com uma penalidade de comprimento de log adicionada no meio da execução porque os traços de raciocínio estavam crescendo mais rápido do que melhoravam.

O cartão do modelo é excepcionalmente direto sobre onde toda a abordagem é frágil. Os dados de treinamento são fortemente baseados em Python e predominantemente em inglês; o conjunto de linguagem natural suportado declarado no cartão é o inglês e nada mais, com a cobertura multilíngue mais ampla do modelo base explicitamente não reivindicada. O desempenho é sensível ao harness e à qualidade dos testes. Os patches gerados "podem estar incorretos ou inseguros, apesar de passarem nos testes disponíveis." O cartão do modelo para o 4B encerra esse parágrafo com a frase que todo leitor deveria levar consigo: não deve ser usado sem revisão humana qualificada e testes independentes de regressão e segurança. Essa é uma declaração de fornecedor sobre um artefato de fornecedor, e é uma frase mais útil do que qualquer uma das linhas do placar acima dela.

Onde isso deixa um comprador, e onde um roteador se encaixa

O FrogNano não é um modelo que você chama. Não há API própria, endpoint hospedado nem imagem serverless. Ele é um checkpoint, e usá-lo significa ou montar sua própria implantação do SGLang atrás de um sandbox hospedado no Kubernetes, ou avaliá-lo como componente dentro de uma stack de agentes que você já opera. Esse é todo o caminho de adoção hoje, e nenhum anúncio teria mudado sua forma.

O que uma camada de roteamento pode honestamente fazer aqui é algo mais restrito do que parece à primeira vista. Se o plano é comparar um FrogNano auto-hospedado com um modelo de codificação hospedado dentro do seu próprio harness, a metade hospedada é a que se beneficia de estar atrás de uma única chave em vez de um segundo contrato: o OrcaRouter carrega mais de 200 modelos atrás de um único endpoint compatível com OpenAI com 0% de markup, o que significa que os preços de tabela dos provedores passam sem alteração e uma mudança de preço de um fornecedor entra em vigor do nosso lado no mesmo dia. Isso importa para um bake-off cujo resultado é decidido pelo custo por problema resolvido, e não por um único número de benchmark. Não hospedamos o FrogNano e não há data para isso; os pesos e o trabalho de serving são seus.

A generated timeline card headed 'One model, three dates' with three markers: 17 September 2026 labelled 'Hugging Face creation timestamp', 22 September 2026 labelled 'Release date printed on the model card', and 2 October 2026 labelled 'Most recent file update', with a footer reading 'No announcement accompanied any of the three. Dates read from the Hugging Face repository history on 3 October 2026.'

As três coisas que resolveriam isso

Primeiro, uma reprodução independente. Todos os números deste artigo — 61,5, 37,6, 31,1, 47,3 — foram produzidos pelo laboratório que treinou o modelo, em um harness mantido pelo mesmo laboratório, em comparação com um valor de modelo-base medido pelo mesmo laboratório. Esse é um quadro completo e internamente consistente, e também é um ciclo fechado. O teste útil é verificar se alguém sem interesses envolvidos reproduz o salto de 39,4 para 61,5 nas mesmas 500 tarefas sem o trabalho de calibração da Microsoft no conjunto de tarefas.

Segundo, alguém precisa verificar a alegação do harness de ponta a ponta. O repositório é público, o que já é mais do que muitos lançamentos conseguem, mas ele é o aparato de avaliação. Se as cinco ferramentas e o isolamento do sandbox são genuinamente o mecanismo de desempenho, um terceiro executando a configuração publicada deveria chegar perto dos números publicados. Se não for o caso, a lacuna é o verdadeiro achado.

Terceiro, e o mais fácil de responder: a Microsoft deveria dizer se isto é um produto ou um artefato de artigo. A seção de distribuição do cartão trata os pesos, o cartão e o harness como o entregável, o que soa como publicação, e não como lançamento. "Data de lançamento 22-SEP-2026" soa como lançamento. Um modelo anunciado teria resolvido essa ambiguidade na primeira frase de um post de blog, e não há post de blog nenhum.

Até então, a postura correta é a que o próprio lançamento implica. FrogNano-4B-2609 é um checkpoint real, baixável, MIT-and-Apache-and-maybe-not, com um cartão de modelo excepcionalmente completo, um harness de avaliação público, uma ideia metodológica genuína e um placar que nunca foi tocado por ninguém sem um endereço da Microsoft. Para um laboratório, isso é um artefato completo e interessante. Para uma equipe prestes a colocar um agente diante de um repositório às três da manhã, é uma pista que vale a pena seguir e ainda não uma decisão que vale a pena tomar.