
FrogNano-4B-2609 vs Qwen 3.8: Quanto custa um agente de codificação quando os pesos são seus
- openaiNOVOOpenAI: GPT-6.1 Sol2026-09-2952Inteligência
- anthropicNOVOAnthropic: Claude Sonnet 5.52026-09-2856Inteligência
- typesafeNOVOTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 por 1M de tokens · 219 tok/s
- OpenAINOVOOpenAI: GPT-6 Luna2026-09-2238Inteligência
- OpenAINOVOOpenAI: GPT-6 Sol2026-09-2248Inteligência
- AnthropicNOVOAnthropic: Claude Opus 5.52026-09-2258Inteligência
- xAINOVOGrok 4.72026-09-2146Inteligência
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 por 1M de tokens · 114 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 por 1M de tokens · 1064 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligência
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Inteligência77Código
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Inteligência76Código
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Inteligência76Código
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Inteligência82Código
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 por 1M de tokens · 41 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 por 1M de tokens · 105 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligência72Código
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 por 1M de tokens · 213 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Inteligência75Código
- obsidianQwen3.8 27B2026-08-1534Inteligência68Código
microsoft/FrogNano-4B-2609 é um agente de repositório da classe de quatro bilhões, derivado do Qwen3.5-4B, que você mesmo baixa e executa.Qwen3.8-Max é o carro-chefe hospedado — um modelo esparso de mistura de especialistas de 2,4 trilhões de parâmetros, com cerca de 95 bilhões de parâmetros ativos por token, uma janela multimodal de um milhão de tokens e uma tabela de preços de $2,00 por milhão de tokens de entrada e $6,00 por milhão de saída — acessível com uma chave de API desde 3 de agosto de 2026. Um deles custa uma GPU e uma tarde. O outro não custa nada até você usá-lo, e depois cobra por token nas trajetórias mais longas de uso comum. Essa troca, e não a tabela de benchmarks, é o verdadeiro confronto.
Os números do FrogNano aqui vêm do model card e do relatório técnico da Microsoft; os números do Qwen3.8-Max vêm dos preços publicados pela Alibaba e do registro do modelo em nosso próprio catálogo, com as pontuações independentes rotuladas como números da Artificial Analysis onde quer que apareçam. Observe a nomenclatura com atenção: Qwen3.8, a versão de pesos abertos, foi anunciada, mas ainda não foi lançada, enquanto Qwen3.8-Max está ativo e com preço definido hoje. Tudo o que pode ser chamado neste artigo é este último.
A aritmética que decide a comparação
Comece pelo que custa uma única tarefa, porque não é óbvio e não é pequeno.
As avaliações do FrogNano executaram cada trajetória com um orçamento de 150 passos dentro de aproximadamente 131 mil tokens combinados, com até 8.192 tokens gerados por turno do assistente e um teto de 10.800 segundos. Multiplique os dois limites publicados e você obtém um teto de cerca de 1,23 milhão de tokens gerados para uma trajetória no pior caso — o que, a US$ 6,00 por milhão de tokens de saída do Qwen3.8-Max, dá aproximadamente US$ 7,38 para uma única tarefa que foi até o fim do seu orçamento. Isso é aritmética sobre dois números publicados, não uma medição: trajetórias reais param cedo, a média fica bem abaixo do teto, e resultados de ferramentas e saída de shell são cobrados à tarifa mais barata de entrada, não à de saída. Mas isso estabelece o formato da coisa. Um agente de programação não gasta algumas centenas de tokens com uma pergunta; ele gasta uma longa conversa consigo mesmo, carregada de raciocínio, e cada token dessa conversa é gerado.
Agora, coloque o outro lado do livro-razão ao lado disso. FrogNano-4B-2609 são 9,32 GB de pesos BF16 em dois shards, baixáveis sem gate. Para servi-lo, é preciso SGLang com um parser de raciocínio Qwen3 e um parser de chamadas de ferramentas do Qwen3 coder, além de um sandbox isolado para as cinco ferramentas. Depois disso, o custo marginal de uma trajetória é eletricidade, e a memória que ela ocupa é aquilo que seu contexto crescer, e não o que os pesos pesam.
• Modelo de custo — FrogNano-4B-2609 tem custo fixo de hardware e custo marginal quase zero. Qwen3.8-Max tem custo fixo zero e cobrança por token, com uma divisão de US$ 2,00 / US$ 6,00 que não concentra nada no início e concentra tudo no final, na tarifa de saída.
• O que o dinheiro compra — um agente de classe 4B no seu próprio hardware, em comparação com um modelo de escala de fronteira para o qual você nunca precisa planejar capacidade.
• Ponto de equilíbrio — é atingido quando o volume mensal de trajetórias multiplicado pela fatura média de tokens por trajetória excede o custo da GPU que você alugaria de outra forma. Para uma equipe executando algumas tarefas de repositório por dia, esse limiar está muito distante, e o modelo hospedado vence só pela conveniência.
Dois modelos que não fazem o mesmo trabalho
A comparação de custos só é justa se os resultados forem comparáveis, e aqui não são — que é a parte que a maioria das fichas técnicas enterra.
FrogNano-4B-2609 foi pós-treinado exclusivamente em engenharia de software em nível de repositório. Toda a sua interface é um loop de cinco ferramentas — Read, Write, Edit, Glob e Bash — executado pelo harness Leaf em um sandbox isolado, iterando até que o modelo pare de fazer chamadas. A ficha da Microsoft declara seu idioma suportado como inglês e seu domínio de programação validado como Python, e afirma explicitamente que os componentes de imagem e vídeo no checkpoint nunca foram pós-treinados e não são suportados. Ele não raciocina sobre sua arquitetura, não responde a perguntas sobre seu negócio nem lê uma captura de tela.
O Qwen3.8-Max é um modelo geral. O registro de catálogo da Alibaba indica que ele aceita entrada de texto, imagem e vídeo, com saída em texto e uma janela de contexto de 1.000.000 de tokens. Ele raciocina, escreve, lê documentos e mantém uma conversa, e sua chamada de funções é um recurso de um modelo geral, e não o objetivo central do checkpoint. Seus números no Artificial Analysis, lidos do registro em 2 de setembro de 2026, são um Intelligence Index de 45,4 e um Coding Index de 76,2.
• Entrada — FrogNano-4B-2609 é somente texto. Qwen3.8-Max aceita texto, imagens e vídeo.
• Contexto — cerca de 131K tokens combinados para a configuração avaliada do FrogNano, contra 1.000.000 para o Qwen3.8-Max. Isso é um fator de sete e meio, e importa sobretudo exatamente para entradas do tamanho de um repositório que um agente de codificação recebe.
• Saída por turno — a configuração validada do FrogNano limita um único turno do assistente a 8.192 tokens. O Qwen3.8-Max não publica nenhum teto equivalente por resposta.
• Formato de saída — FrogNano emite chamadas de ferramenta Leaf estruturadas e precisa de um harness para executá-las. Qwen3.8-Max retorna prosa ou uma chamada de função para o cliente que você já tiver.
• Pontuações independentes — nenhuma para o FrogNano-4B-2609 além do seu próprio cartão; os números do Qwen3.8-Max acima são de terceiros, da Artificial Analysis.
• Parâmetros — aproximadamente 4,66 bi para o FrogNano, segundo a própria descrição do card dele, contra 2,4 trilhões no total e cerca de 95 bi ativos para o Qwen3.8-Max.

Onde o 4B realmente conquista seu lugar
Há um eixo no qual um agente de 4B supera um modelo de fronteira de forma categórica, e não é a acurácia.
O artigo do FrogNano parte do Qwen3.5-4B, que obteve 39,4% no SWE-bench Verified por meio do Leaf harness como um modelo geral comum. Cinco iterações de aprendizado por reforço em cerca de 1.500 tarefas sintéticas o levaram a 61,5%, com o apêndice do mesmo artigo relatando a progressão por iteração como 48,2%, 53,4%, 58,3%, 58,6% e 61,6%. O método — gerar tarefas calibradas à fronteira de aprendibilidade da política atual, sem destilação de um modelo mais forte — é a contribuição, e a razão pela qual um grupo de pesquisa sem orçamento para modelos de fronteira se interessaria.
Leia o que isso implica para a comparação. O cartão da Microsoft é franco ao admitir que o FrogNano não é uniformemente melhor do que o modelo de onde veio: sua taxa de chamadas paralelas de ferramentas é de 1,71%, porque iterações posteriores perderam a capacidade de disparar chamadas concorrentes, e a equipe adicionou uma etapa de consolidação para tentar recuperá-la. Um modelo que resolve mais problemas enquanto piora em um comportamento específico é um artefato de engenharia real com costuras visíveis, e seu cartão diz isso em vez de escondê-lo.
E o número do SWE-bench é um ciclo fechado. A linha de base do modelo base, o harness e a pontuação final vêm todos do mesmo laboratório, e as duas tabelas do mesmo artigo apresentam duas escalas diferentes para o mesmo experimento. O número de codificação do Qwen3.8-Max, em contrapartida, foi produzido pela Artificial Analysis, e não pela Alibaba — um tipo diferente de evidência, um tipo diferente de confiança, e os dois nunca devem ser subtraídos um do outro.
O 4B com o qual você ainda não pode bem contar
Duas coisas estão entre o FrogNano-4B-2609 e uma vaga de produção, e ambas estão na sua própria documentação, e não na opinião de qualquer revisor.
O primeiro é hardware. A ficha indica que o requisito de pesos em BF16 é de cerca de 9,3 GB e depois acrescenta que a memória "aumenta substancialmente à medida que o contexto combinado se aproxima de aproximadamente 131K tokens", antes de declarar que o modelo mínimo exato de GPU, a configuração de VRAM, as versões de runtime e o perfil de desempenho "ainda precisam ser validados antes do lançamento" — uma frase que aparece em um modelo já disponível para download. Ninguém publicou um valor de VRAM para a configuração avaliada, e a ficha não contém nenhum.
A segunda é a postura de segurança. A própria nota de alinhamento da Microsoft afirma que o pós-treinamento específico do agente não utilizou conjuntos de dados de preferência de segurança, de recusa, de conteúdo prejudicial ou adversariais, que, em vez disso, foi otimizado para a correção funcional e a prevenção de regressões, e que o modelo "não deve ser considerado independentemente alinhado em termos de segurança para implantação autônoma irrestrita". O cartão encerra nomeando os riscos concretos: os patches podem estar incorretos ou inseguros, apesar de passarem nos seus testes; o desempenho é sensível à qualidade desses testes; e cada patch candidato precisa de revisão humana qualificada e de testes independentes de regressão e segurança antes do uso. Um modelo hospedado genérico não traz nenhuma dessas ressalvas específicas e também não executará um comando de shell no seu repositório.
Uma chave para qualquer lado que escolher
O que é útil em fazer essa comparação na prática é que só metade dela é um download. O Qwen3.8-Max, e os modelos gerais com os quais você compararia um agente auto-hospedado, estão todos acessíveis por um único endpoint compatível com OpenAI no OrcaRouter com 0% de markup — preço de tabela do provedor repassado, então uma mudança de preço de um fornecedor chega ao nosso lado no mesmo dia, que é o número que de fato se move quando a conta de tokens de saída de um agente de programação é o que você está tentando controlar. Isso também simplifica a questão do failover: se a metade hospedada do seu pipeline se degradar, a nova tentativa é automática e o experimento continua.
FrogNano-4B-2609 não é uma das nossas rotas e não há uma data para ele. Os pesos são seus para servir, e a ficha do modelo é honesta ao dizer que a configuração de serving não foi totalmente validada. O que podemos fazer é tornar o outro lado da comparação sem custo de configuração, para que a pergunta que você acaba respondendo seja a real — se um agente SWE-bench com 61,5% reportado pelo fornecedor, na sua própria GPU, supera um modelo de fronteira medido por uso nas suas próprias tarefas, no seu próprio volume.

Qual escolher
Recorra ao Qwen3.8-Max quando o trabalho for genérico, quando for a equipe de operações de outra pessoa que deveria estar arcando com a capacidade, quando a entrada puder conter uma imagem ou um documento longo, ou quando você precisar de uma resposta hoje em vez de uma pilha de serving até sexta-feira. Suas pontuações de terceiros significam que você consegue prever aproximadamente o que está comprando, e sua cobrança por token é um custo variável que você pode ver antes de se comprometer. Para uma equipe que executa um número modesto de tarefas de repositório por mês, a conta não chega nem perto.
Recorra ao FrogNano-4B-2609 quando o volume for alto o suficiente para que a cobrança por token em trajetórias longas seja a restrição, quando os dados não puderem sair da sua infraestrutura, ou quando a pergunta de pesquisa — é possível treinar um agente pequeno até competência em nível de repositório sem um professor — for aquilo que você está realmente testando. Entre sabendo três coisas: os 61,5% são uma medição do próprio laboratório em um harness mantido pelo laboratório, ninguém publicou um número de VRAM para a configuração avaliada, e o próprio card diz que a configuração de serving ainda não foi validada.
O que faz valer a pena escrever sobre esse par é que eles compartilham um ancestral duas gerações atrás. O FrogNano descende do Qwen3.5-4B — um modelo geral da mesma empresa cujo carro-chefe de 2,4 trilhões de parâmetros está do outro lado desta página. A Microsoft pegou o pequeno, gastou cinco iterações de RL em repositórios sintéticos e conseguiu um especialista. A Alibaba seguiu o caminho oposto e escalou. Ambas as respostas estão publicadas, e a diferença entre o que o download custa e o que a API custa é a maneira honesta de escolher entre elas.

Comparados neste artigo1
Detectado a partir deste artigo · Benchmarks: Artificial Analysis · atualizado diariamente
