Una scheda di titolo generata che recita 'FrogNano-4B-2609 vs Gemma 4 12B' con il sottotitolo 'un agente per repository da 4B contro un generalista multimodale da 11,95B', tre chip che recitano '61,5% SWE-bench, dichiarato dal fornitore', '72,0% LiveCodeBench, dichiarato dal fornitore' e 'nessun benchmark condiviso', un piè di pagina che recita 'Benchmark diversi senza sovrapposizione; entrambi i punteggi dichiarati dal fornitore', e il logo OrcaRouter composto nell'angolo in basso a destra.
Guides & Insights

FrogNano-4B-2609 vs Gemma 4 12B: 61,5% su SWE-bench e nessuno l'ha verificato

Autore

Elias Hawthorne

Data di pubblicazione

Ultimi modelli · 20Vedi tutti i modelli →
Benchmark: Artificial Analysis · aggiornato ogni giorno
Torna a tutti gli articoli

di MicrosoftFrogNano-4B-2609è un agente di coding di classe quattro miliardi derivato da Qwen3.5-4B che riporta il 61,5% su SWE-bench Verified. Gemma 4 12B è il modello multimodale senza encoder da 11,95 miliardi di parametri di DeepMind, e la sua scheda riporta il 72,0% su LiveCodeBench v6. Questi sono i due numeri che un acquirente metterà fianco a fianco, e metterli fianco a fianco è l'errore. Provengono da benchmark diversi, harness diversi, laboratori diversi e — cosa ancora più importante — solo uno dei due ha una metodologia di valutazione pubblicata che un estraneo ha letto. Tutto il resto di questo confronto è una questione di ciò che ciascun modello è realmente, e la risposta è che non sono affatto la stessa categoria di cosa.

I dati di FrogNano riportati di seguito provengono dalla scheda del modello di Microsoft e dal suo rapporto tecnico, entrambi pubblici da settembre e nessuno dei due riprodotto da qualcuno al di fuori del laboratorio. I dati di Gemma 4 12B provengono dalla scheda del modello di Google, che è anch'essa un documento del fornitore — la differenza è che i numeri di Gemma hanno alle spalle venti settimane di esame e circa 2,6 milioni di download, mentre FrogNano ha avuto due settimane e un contatore di download che non ha superato la singola cifra.

A cosa serve ogni modello

Questa è la parte che una scheda tecnica nasconde. FrogNano-4B-2609 non è un modello generico che per caso se la cava bene con il codice. È un checkpoint il cui intero post-training è stato ingegneria del software a livello di repository, e che è progettato per essere guidato da un harness anziché per conversare.

I suoi cinque strumenti sono Read, Write, Edit, Glob e Bash. Emette chiamate ad essi, una sandbox le esegue e restituisce l'output, e il ciclo continua finché il modello non smette di chiedere. La configurazione valutata è di 150 passi di interazione all'interno di circa 131K token combinati, e ha prodotto una patch candidata per ogni attività. La scheda di Microsoft è esplicita sul fatto che il modello è per repository in inglese e prevalentemente Python con ambienti riproducibili e suite di test eseguibili, e che i componenti immagine e video ereditati dal modello di base non sono mai stati post-addestrati e non sono supportati.

Gemma 4 12B ha una forma opposta. È un modello unificato a 48 livelli con un contesto di 256K e nessun encoder separato per immagini o audio — patch grezze di immagini e forme d'onda audio vengono proiettate direttamente nello spazio di embedding dell'unico decoder tramite leggeri strati lineari. Accetta in ingresso testo, immagini e audio e restituisce testo. Ha una modalità di pensiero attivata da un token nel prompt di sistema, il richiamo nativo di funzioni e la scheda di Google ci tiene a elencare i flussi di lavoro agentici tra i suoi usi previsti.

Quindi la vera domanda non è quale dei due sia più intelligente. È se vuoi un componente specializzato che funziona solo all'interno di un'apparecchiatura che devi far funzionare tu, oppure un modello generale che se la cava bene in molte cose e può essere chiamato da qualsiasi cosa.

A screenshot of the google/gemma-4-12B-it model card on Hugging Face showing the Gemma 4 12B Unified heading, the Any-to-Any, Transformers, Safetensors and image-text-to-text tags, the Apache 2.0 license line credited to Google DeepMind, and the model overview explaining that text, audio, image and video inputs are handled without separate encoders.

Riga per riga, dove differiscono effettivamente

• Parametri — FrogNano-4B-2609 pubblica una fascia, "500M-5B", su una card la cui stessa descrizione riporta circa 4,66 miliardi; il download lo fissa a 9,32 GB di pesi BF16. Gemma 4 12B è 11,95B, dichiarato una volta e mai attenuato. Il rapporto è di circa 2,6 a uno, e si riflette direttamente in ciò che devi affittare.

• Contesto — la configurazione valutata di FrogNano è di circa 131K token combinati, con ragionamento e output degli strumenti che condividono il budget. Gemma 4 12B dispone di 256.000 token e, nella propria riga di contesto lungo, ottiene il 43,4% su MRCR v2 con otto needle a 128K. Quasi il doppio della finestra, e il secondo numero è una misurazione pubblicata, non una dichiarazione di capacità.

• Modalità — FrogNano-4B-2609 è testo in input, testo in output, nonostante la torre di visione presente nel suo checkpoint. Gemma 4 12B accetta testo, immagini e audio.

• Limite di output — la configurazione FrogNano convalidata consente 8.192 token generati per turno dell'assistente, e la sua scheda indica che la configurazione di addestramento RL usava lo stesso tetto. Gemma 4 12B non pubblica alcun tetto equivalente per il singolo turno; il vincolo, in quel caso, è la finestra da 256K.

• Interfaccia agentica — FrogNano emette chiamate Leaf strutturate e necessita di un harness per eseguirle. Gemma 4 12B include il function calling nativo nella sua forma ottimizzata per le istruzioni ed è direttamente invocabile.

• Licenza — Gemma 4 12B è Apache 2.0 secondo i termini di Google per Gemma 4, dichiarato chiaramente. La scheda di FrogNano è MIT nel suo front matter e Apache 2.0 nel suo stesso corpo, il che è il tipo di ambiguità che finisce in una revisione legale anziché in una nota a piè di pagina.

• Numeri — FrogNano riporta il 61,5% su SWE-bench Verified, il 37,6% su SWE-bench Pro, il 31,1% su Terminal-Bench 2.0 e il 47,3% su PatchEval-Verified. Gemma 4 12B riporta il 77,2% su MMLU Pro, il 72,0% su LiveCodeBench v6, un ELO Codeforces di 1659, il 78,8% su GPQA Diamond e il 69,0% su Tau2. La scheda di Google non pubblica alcuna riga relativa a SWE-bench, e la scheda di Microsoft non pubblica LiveCodeBench. Non c'è alcuna sovrapposizione tra le due classifiche.

Quell'ultimo punto è quello che dovrebbe porre fine all'istinto di confrontare i numeri. Non un solo benchmark compare su entrambe le schede. Un lettore che mette 61,5 a confronto con 72,0 ha paragonato un tasso di risoluzione di repository a un tasso di superamento nella programmazione competitiva, il che è più o meno come confrontare il tempo di una maratona con il tempo dei cento metri perché entrambi sono in secondi.

Perché il silenzio di Google su SWE-bench non è un campanello d'allarme

La conclusione allettante che si trae dall'elenco puntato è che FrogNano ha un vero numero SWE-bench e Gemma no, quindi FrogNano vince la questione della programmazione. Non ne consegue, per una ragione sulla quale vale la pena essere precisi.

Gemma 4 12B riporta Tau2 al 69,0% — un benchmark agentico di uso degli strumenti su tre esecuzioni — insieme al supporto per il function calling e al suo posizionamento esplicito per flussi di lavoro agentici. Un modello che ottiene 69,0 su Tau2 non è un modello che non può svolgere lavoro agentico; è un modello il cui fornitore ha scelto di riportare le prestazioni nell'uso degli strumenti anziché la risoluzione di repository. Google inoltre non riporta righe SWE-bench per il 26B o il 31B, il che è una scelta editoriale a livello di famiglia anziché una debolezza del 12B.

Nel frattempo, il risultato controintuitivo nel documento di Microsoft è qualcosa che un acquirente di Gemma dovrebbe leggere con attenzione. FrogNano parte da Qwen3.5-4B, un modello generalista, che ha ottenuto il 39,4% su SWE-bench Verified tramite l'harness Leaf. Cinque cicli di apprendimento per rinforzo su circa 1.500 attività sintetiche lo hanno portato al 61,5%. La lezione non è "i modelli piccoli non sanno programmare" — è che un checkpoint generalista da 4B al 39,4% stava già risolvendo più di un terzo di un insieme di problemi difficile, convalidato da esseri umani, quando qualcuno lo ha eseguito all'interno di un ciclo agentico competente. Gemma 4 12B è tre volte più grande e venti settimane più maturo. Nessuno lo ha eseguito tramite Leaf e, finché qualcuno non lo farà, "Gemma non è un agente per repository" è un'assunzione più che un risultato.

La tassa dell'imbracatura, che i tabelloni nascondono completamente

Ecco l'asimmetria pratica, ed è quella che decide l'acquisto.

Gemma 4 12B è un modello. Scarica 11,95B di pesi, indirizza Transformers, vLLM o SGLang verso di essi, invia testo, ricevi testo. Google pubblica il percorso di serving, la licenza è inequivocabile e l'equivalente di 2,6 milioni di download di persone ha già sbattuto contro le asperità e le ha documentate. Se il compito è "riassumi questo stack trace", "leggi questo screenshot e dimmi cosa è rotto" oppure "chiama questa funzione con questi argomenti", funziona già oggi.

FrogNano-4B-2609 è un modello più un harness, e il README di Microsoft rende l'harness non opzionale. Il repository su github.com/microsoft/FrogNano è il banco di valutazione Leaf, non il codice di addestramento — richiede un cluster Kubernetes, un namespace esistente, autorizzazioni per gestire pod e politiche di rete, accesso pull alle immagini container di benchmark e un endpoint compatibile con OpenAI configurato con i corretti parser di reasoning e tool-call. La scheda di Microsoft enuncia senza mezzi termini la condizione di corrispondenza: punteggi identici richiedono checkpoint, tokenizer, configurazione di serving, immagini dei task e protocollo di valutazione corrispondenti. La metà della release che genera il punteggio è quella che la scheda indica tramite un link a GitHub.

C'è un valore reale in questo, e vale la pena nominarlo anziché liquidarlo. Il contributo di FrogNano è un ciclo di sintesi di compiti che rigenera problemi di addestramento in base all'abilità della policy corrente — la tesi del paper è che un piccolo agente possa essere addestrato a livello competitivo su compiti sintetici senza alcuna distillazione, e questo apre una strada per chiunque non possa permettersi un teacher di frontiera. La sua API è pubblica. I suoi metodi sono riproducibili in linea di principio. Questo è un contributo più forte di un altro checkpoint incrementale, ed è anche più lavoro di quanto la maggior parte dei team si aspetti quando si iscrive.

A generated two-column scoreboard titled 'FrogNano-4B-2609 vs Gemma 4 12B'. The left column reads Parameters approx 4.66B with the card saying 500M-5B, Context about 131K evaluated, Input text only, Harness required Leaf with 5 tools, SWE-bench Verified 61.5% vendor, and Independent evals none. The right column reads Parameters 11.95B, Context 256,000 tokens, Input text, image, audio, Harness none required, LiveCodeBench v6 72.0% vendor, and Independent evals widely run. A footer reads 'Different benchmarks, no overlap; both scoreboards vendor-reported.'

Se ne stai scegliendo uno, scegli in base al lavoro

Scegli Gemma 4 12B se il lavoro mescola modalità, se qualcosa deve vedere un'immagine o ascoltare audio, se il contesto deve contenere allo stesso tempo un grande albero di file e una lunga trascrizione, o se vuoi un modello che qualsiasi framework possa caricare senza un secondo sistema alle spalle. Il suo punteggio Tau2 di 69,0 e il function calling nativo lo rendono una scelta difendibile per pipeline agentiche, e nessuno deve credere sulla parola a un laboratorio — il modello è stato valutato da migliaia di persone e i risultati non sono un segreto.

Scegli FrogNano-4B-2609 se esegui già un agente per repository in sandbox e vuoi un checkpoint di classe 4B da inserirvi, e se un download da 9,32 GB che entra su hardware modesto è il vincolo che guida la decisione. Sii lucido sulla sequenza: non stai comprando un punteggio, stai scommettendo su un metodo, e la prima cosa che scoprirai è se il tuo ciclo di polling e il tuo parser delle chiamate agli strumenti assomigliano abbastanza a Leaf. Alcuni team otterranno un comportamento vicino al 61,5% il terzo pomeriggio e altri passeranno due settimane a scoprire che il loro set di valutazione era più facile di SWE-bench Verified, e nessuno fuori dal laboratorio può ancora dirti quale dei due sei.

Se la decisione è davvero sul filo del rasoio, l'esperimento a basso costo è eseguire entrambi nello stesso harness sui tuoi problemi, invece di discutere numeri pubblicati che non condividono alcun benchmark. OrcaRouter porta oltre 200 modelli dietro un'unica chiave compatibile con OpenAI a markup 0%, quindi i prezzi di listino dei provider passano invariati — il che rende possibile mettere un modello generalista ospitato e il resto del tuo insieme di candidati dietro un unico endpoint e un'unica voce di fatturazione mentre decidi. FrogNano non è una delle nostre rotte e non c'è una data per esso; i pesi sono un download che ospiti tu stesso. Quello che possiamo rimuovere è l'attrito dall'altro lato del confronto: scambiare modelli candidati nel tuo harness senza un secondo contratto, un secondo SDK o un secondo set di credenziali.

A generated timeline card headed 'Two releases, twenty weeks apart' showing an upper bar labelled Gemma 4 12B uploaded 23 May 2026 with 2.6 million downloads across the family, and a lower bar labelled FrogNano-4B-2609 uploaded 17 September 2026 with no announcement, with a span marker of 20 weeks between them and a footer reading 'Download figures from Hugging Face on 3 October 2026.'

Il riassunto onesto è che il numero 61,5 è lavoro reale del laboratorio che l'ha prodotto, e che al momento è l'unico motivo per preferire FrogNano sulla programmazione. Quando qualcuno al di fuori di Microsoft riprodurrà 61,5 sugli stessi 500 task — o non ci riuscirà — questo confronto otterrà una risposta autentica. Fino ad allora, l'opzione predefinita più sicura per la maggior parte dei team è il modello da 11,95B con la licenza pulita, la misurazione pubblicata del contesto lungo e venti settimane di errori altrui già assorbite nella sua documentazione.