Um cartão de título gerado com o texto 'FrogNano-4B-2609 vs Gemma 4 12B' e o subtítulo 'um agente de repositório 4B contra um generalista multimodal de 11,95B', três chips com o texto '61,5% SWE-bench, informado pelo fornecedor', '72,0% LiveCodeBench, informado pelo fornecedor' e 'nenhum benchmark compartilhado', um rodapé com o texto 'Benchmarks diferentes sem sobreposição; ambos os placares informados pelo fornecedor', e o logotipo da OrcaRouter composto no canto inferior direito.
Guides & Insights

FrogNano-4B-2609 vs Gemma 4 12B: 61,5% no SWE-bench e ninguém verificou isso

Autor

Elias Hawthorne

Data de publicação

Modelos mais recentes · 20Ver todos os modelos →
Benchmarks: Artificial Analysis · atualizado diariamente
Voltar para todas as publicações

da MicrosoftFrogNano-4B-2609 é um agente de codificação de classe de quatro bilhões derivado do Qwen3.5-4B que reporta 61,5% no SWE-bench Verified. Gemma 4 12B é o modelo multimodal sem encoder de 11,95 bilhões de parâmetros do DeepMind, e sua ficha reporta 72,0% no LiveCodeBench v6. Esses são os dois números que um comprador vai colocar lado a lado, e colocá-los lado a lado é o erro. Eles vêm de benchmarks diferentes, harnesses diferentes, laboratórios diferentes, e — mais importante — apenas um deles tem uma metodologia de avaliação publicada que um estranho leu. Todo o resto sobre esse confronto é uma questão do que cada modelo realmente é, e a resposta é que eles não são da mesma categoria de coisa de forma alguma.

Os números do FrogNano abaixo vêm do cartão de modelo da Microsoft e do seu relatório técnico, ambos públicos desde setembro e nenhum dos dois foi reproduzido por alguém fora do laboratório. Os números do Gemma 4 12B vêm do cartão de modelo do Google, que também é um documento de fornecedor — a diferença é que os números do Gemma têm atrás de si vinte semanas e cerca de 2,6 milhões de downloads de escrutínio, enquanto o FrogNano tem duas semanas e um contador de downloads que não passou de um dígito.

Para que serve cada modelo

Esta é a parte que uma ficha técnica esconde. O FrogNano-4B-2609 não é um modelo geral que por acaso é bom em código. É um checkpoint cujo pós-treinamento inteiro consistiu em engenharia de software em nível de repositório e que foi concebido para ser conduzido por um harness, e não para conversar.

Suas cinco ferramentas são Read, Write, Edit, Glob e Bash. Ele emite chamadas para elas, um sandbox as executa e retorna a saída, e o loop é executado até que o modelo pare de solicitar. A configuração avaliada é de 150 etapas de interação dentro de aproximadamente 131K tokens combinados, e produziu um patch candidato por tarefa. O card da Microsoft deixa explícito que o modelo é para repositórios em inglês e com uso intenso de Python, com ambientes reproduzíveis e suítes de testes executáveis, e que os componentes de imagem e vídeo herdados do modelo base nunca passaram por pós-treinamento e não são suportados.

O Gemma 4 12B tem o formato oposto. É um modelo unificado de 48 camadas com contexto de 256K e sem codificador de visão ou áudio separado — patches de imagem brutos e formas de onda de áudio são projetados diretamente no espaço de embeddings do decodificador único por meio de camadas lineares leves. Ele recebe texto, imagem e áudio e produz texto. Ele tem um modo de pensamento acionado por um token no prompt do sistema, chamada de função nativa, e o card do Google faz questão de listar fluxos de trabalho agênticos entre seus usos pretendidos.

Então, a verdadeira questão não é qual dos dois é mais inteligente. É se você quer um componente especializado que só funciona dentro de um aparato que você mesmo tem de operar, ou um modelo generalista que faz um trabalho razoável em muitas coisas e pode ser chamado por qualquer coisa.

A screenshot of the google/gemma-4-12B-it model card on Hugging Face showing the Gemma 4 12B Unified heading, the Any-to-Any, Transformers, Safetensors and image-text-to-text tags, the Apache 2.0 license line credited to Google DeepMind, and the model overview explaining that text, audio, image and video inputs are handled without separate encoders.

Linha por linha, onde eles realmente diferem

• Parâmetros — FrogNano-4B-2609 divulga uma faixa, "500M-5B", em um card cuja própria descrição indica aproximadamente 4,66 bilhões; o download o define em 9,32 GB de pesos BF16. Gemma 4 12B é 11,95B, declarado uma vez e nunca relativizado. A proporção é de aproximadamente 2,6 para 1, e isso aparece diretamente naquilo que você precisa alugar.

• Contexto — A configuração avaliada do FrogNano tem cerca de 131K tokens combinados, com raciocínio e saída de ferramentas compartilhando o orçamento. O Gemma 4 12B carrega 256.000 tokens e, em sua própria linha de contexto longo, pontua 43,4% no MRCR v2 com oito agulhas a 128K. Quase o dobro da janela, e o segundo número é uma medição publicada, não uma alegação de capacidade.

• Modalidade — FrogNano-4B-2609 é texto de entrada, texto de saída, apesar da torre de visão presente em seu checkpoint. Gemma 4 12B é texto, imagem e áudio de entrada.

• Teto de saída — a configuração validada do FrogNano permite 8.192 tokens gerados por turno do assistente, e seu card observa que a configuração de treinamento de RL usou esse mesmo teto. O Gemma 4 12B não publica nenhum teto equivalente de turno único; a restrição ali é a janela de 256K.

• Interface agêntica — FrogNano emite chamadas Leaf estruturadas e precisa de um harness para executá-las. O Gemma 4 12B inclui chamadas de função nativas em sua forma ajustada por instruções e pode ser chamado diretamente.

• Licença — O Gemma 4 12B é Apache 2.0 sob os termos do Gemma 4 do Google, declarado de forma clara. O cartão do FrogNano é MIT nos elementos pré-textuais e Apache 2.0 em seu próprio corpo, o tipo de ambiguidade que acaba em uma revisão jurídica, e não em uma nota de rodapé.

• Números — FrogNano relata 61,5% no SWE-bench Verified, 37,6% no SWE-bench Pro, 31,1% no Terminal-Bench 2.0 e 47,3% no PatchEval-Verified. O Gemma 4 12B relata 77,2% no MMLU Pro, 72,0% no LiveCodeBench v6, um ELO de 1659 no Codeforces, 78,8% no GPQA Diamond e 69,0% no Tau2. O card do Google não publica uma linha do SWE-bench, e o card da Microsoft não publica o LiveCodeBench. Não há sobreposição alguma entre os dois placares.

Esse último item é o que deveria pôr fim ao instinto de comparar por números. Nenhum benchmark aparece nos dois cartões. Um leitor que coloca 61,5 ao lado de 72,0 comparou uma taxa de resolução de repositórios com uma taxa de aprovação em programação competitiva, o que é mais ou menos como comparar o tempo de uma maratona com o tempo de cem metros só porque ambos estão em segundos.

Por que o silêncio do Google sobre o SWE-bench não é um sinal de alerta

A conclusão tentadora da lista com marcadores é que FrogNano tem um número real no SWE-bench e Gemma não, então FrogNano vence a questão da programação. Isso não se segue, por uma razão sobre a qual vale a pena ser preciso.

O Gemma 4 12B reporta Tau2 em 69,0% — um benchmark de uso de ferramentas agênticas ao longo de três execuções — juntamente com seu suporte a chamadas de funções e seu posicionamento explícito para fluxos de trabalho agênticos. Um modelo que obtém 69,0 no Tau2 não é um modelo que não consegue realizar trabalho agêntico; é um modelo cujo fornecedor escolheu reportar desempenho de uso de ferramentas em vez de resolução de repositório. O Google também não reporta linhas do SWE-bench para o 26B ou o 31B, o que é uma escolha editorial de toda a família, e não uma fraqueza do 12B.

Enquanto isso, o resultado contraintuitivo do próprio artigo da Microsoft é algo que um comprador de Gemma deveria ler com atenção. O FrogNano parte do Qwen3.5-4B, um modelo geral, que obteve 39,4% no SWE-bench Verified por meio do harness Leaf. Cinco rodadas de aprendizado por reforço em aproximadamente 1.500 tarefas sintéticas o levaram a 61,5%. A lição não é que "modelos pequenos não conseguem programar" — é que um checkpoint geral de 4B com 39,4% já estava resolvendo mais de um terço de um conjunto difícil de problemas validados por humanos quando alguém o executou dentro de um loop de agente competente. O Gemma 4 12B tem três vezes esse tamanho e vinte semanas a mais de maturidade. Ninguém o executou pelo Leaf e, até que alguém o faça, "Gemma não é um agente de repositório" é uma suposição, e não uma constatação.

O imposto do harness, que os placares escondem completamente

Aqui está a assimetria prática, e é ela que decide a compra.

Gemma 4 12B é um modelo. Baixe 11,95B de pesos, aponte Transformers, vLLM ou SGLang para eles, envie texto, receba texto. O Google publica o caminho de serving, a licença é inequívoca, e pessoas equivalentes a 2,6 milhões de downloads já esbarraram nas arestas e as documentaram. Se a tarefa for "resuma este stack trace", "leia esta captura de tela e diga o que está quebrado" ou "chame esta função com estes argumentos", funciona hoje.

O FrogNano-4B-2609 é um modelo mais um harness, e o próprio README da Microsoft torna o harness não opcional. O repositório em github.com/microsoft/FrogNano é a estrutura de avaliação Leaf, não o código de treinamento — ele precisa de um cluster Kubernetes, um namespace existente, permissões para gerenciar pods e políticas de rede, acesso de pull a imagens de contêiner de benchmark e um endpoint compatível com OpenAI configurado com os parsers corretos de raciocínio e de chamadas de ferramentas. O card da Microsoft afirma a condição de correspondência de forma direta: pontuações idênticas exigem checkpoint, tokenizer, configuração de serving, imagens de tarefas e protocolo de avaliação correspondentes. A metade do lançamento que gera a pontuação é a metade para a qual o card aponta um link do GitHub.

Há valor real nisso, e vale a pena nomeá-lo em vez de descartá-lo. A contribuição do FrogNano é um loop de síntese de tarefas que regenera problemas de treinamento de acordo com a capacidade da política atual — a alegação do artigo é que um agente pequeno pode ser treinado até um nível competitivo em tarefas sintéticas sem nenhuma destilação, e isso abre um caminho para quem não pode pagar por um professor de fronteira. Sua API é pública. Seus métodos são reprodutíveis em princípio. Essa é uma contribuição mais forte do que mais um checkpoint incremental, e também é mais trabalho do que a maioria das equipes está disposta a assumir.

A generated two-column scoreboard titled 'FrogNano-4B-2609 vs Gemma 4 12B'. The left column reads Parameters approx 4.66B with the card saying 500M-5B, Context about 131K evaluated, Input text only, Harness required Leaf with 5 tools, SWE-bench Verified 61.5% vendor, and Independent evals none. The right column reads Parameters 11.95B, Context 256,000 tokens, Input text, image, audio, Harness none required, LiveCodeBench v6 72.0% vendor, and Independent evals widely run. A footer reads 'Different benchmarks, no overlap; both scoreboards vendor-reported.'

Se você estiver escolhendo um, escolha com base no trabalho.

Escolha o Gemma 4 12B se o trabalho misturar modalidades, se algo precisar de ver uma imagem ou ouvir áudio, se o contexto tiver de conter uma árvore de ficheiros grande e uma transcrição longa ao mesmo tempo, ou se quiser um modelo que qualquer framework consiga carregar sem um segundo sistema por trás. A sua pontuação de 69,0 no Tau2 e a chamada de funções nativa fazem dele uma escolha defensável para pipelines agênticos, e ninguém tem de acreditar na palavra de um laboratório — o modelo foi avaliado por milhares de pessoas e os resultados não são segredo.

Escolha o FrogNano-4B-2609 se você já executa um agente de repositório em sandbox e quer um checkpoint de classe 4B para encaixar nele, e se um download de 9,32 GB que cabe em hardware modesto é a restrição que impulsiona a decisão. Seja realista quanto ao sequenciamento: você não está comprando uma pontuação, está fazendo uma aposta em um método, e a primeira coisa que você vai descobrir é se o seu loop de polling e o seu parser de chamadas de ferramentas se parecem o suficiente com o Leaf. Algumas equipes terão um comportamento próximo de 61,5% na terceira tarde e algumas passarão duas semanas descobrindo que o conjunto de avaliação delas era mais fácil que o SWE-bench Verified, e ninguém fora do laboratório ainda pode dizer qual dos dois você é.

Se a decisão estiver genuinamente equilibrada, o experimento barato é rodar ambos no mesmo harness com os seus próprios problemas, em vez de debater números publicados que não compartilham nenhum benchmark. O OrcaRouter oferece mais de 200 modelos por trás de uma única chave compatível com OpenAI com 0% de markup, então os preços de tabela dos provedores são repassados sem alteração — o que torna possível colocar um modelo geral hospedado e o restante do seu conjunto de candidatos atrás de um único endpoint e uma única linha de cobrança enquanto você decide. O FrogNano não é uma das nossas rotas e não há data para ele; os pesos são um download que você mesmo hospeda. O que podemos remover é a fricção do outro lado da comparação: trocar modelos candidatos no seu próprio harness sem um segundo contrato, um segundo SDK ou um segundo conjunto de credenciais.

A generated timeline card headed 'Two releases, twenty weeks apart' showing an upper bar labelled Gemma 4 12B uploaded 23 May 2026 with 2.6 million downloads across the family, and a lower bar labelled FrogNano-4B-2609 uploaded 17 September 2026 with no announcement, with a span marker of 20 weeks between them and a footer reading 'Download figures from Hugging Face on 3 October 2026.'

O resumo honesto é que o número 61.5 é trabalho real do laboratório que o criou, e que atualmente é a única razão para preferir o FrogNano em codificação. Quando alguém fora da Microsoft reproduzir 61.5 nas mesmas 500 tarefas — ou não conseguir —, esta comparação terá uma resposta genuína. Até lá, a opção padrão mais segura para a maioria das equipes é o modelo 11.95B com a licença limpa, a medição de contexto longo publicada e vinte semanas de erros de outras pessoas já absorvidos na sua documentação.