
FrogNano-4B-2609 vs Gemma 4 12B: 61,5% su SWE-bench e nessuno l'ha verificato
- openaiNUOVOOpenAI: GPT-6.1 Sol2026-09-2952Intelligenza
- anthropicNUOVOAnthropic: Claude Sonnet 5.52026-09-2856Intelligenza
- typesafeNUOVOTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 per 1M di token · 219 tok/s
- OpenAINUOVOOpenAI: GPT-6 Luna2026-09-2238Intelligenza
- OpenAINUOVOOpenAI: GPT-6 Sol2026-09-2248Intelligenza
- AnthropicNUOVOAnthropic: Claude Opus 5.52026-09-2258Intelligenza
- xAINUOVOGrok 4.72026-09-2146Intelligenza
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 per 1M di token · 114 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1M di token · 1064 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligenza
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Intelligenza77Codice
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Intelligenza76Codice
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Intelligenza76Codice
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Intelligenza82Codice
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 per 1M di token · 41 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1M di token · 105 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligenza72Codice
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1M di token · 213 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Intelligenza75Codice
- obsidianQwen3.8 27B2026-08-1534Intelligenza68Codice
di MicrosoftFrogNano-4B-2609è un agente di coding di classe quattro miliardi derivato da Qwen3.5-4B che riporta il 61,5% su SWE-bench Verified. Gemma 4 12B è il modello multimodale senza encoder da 11,95 miliardi di parametri di DeepMind, e la sua scheda riporta il 72,0% su LiveCodeBench v6. Questi sono i due numeri che un acquirente metterà fianco a fianco, e metterli fianco a fianco è l'errore. Provengono da benchmark diversi, harness diversi, laboratori diversi e — cosa ancora più importante — solo uno dei due ha una metodologia di valutazione pubblicata che un estraneo ha letto. Tutto il resto di questo confronto è una questione di ciò che ciascun modello è realmente, e la risposta è che non sono affatto la stessa categoria di cosa.
I dati di FrogNano riportati di seguito provengono dalla scheda del modello di Microsoft e dal suo rapporto tecnico, entrambi pubblici da settembre e nessuno dei due riprodotto da qualcuno al di fuori del laboratorio. I dati di Gemma 4 12B provengono dalla scheda del modello di Google, che è anch'essa un documento del fornitore — la differenza è che i numeri di Gemma hanno alle spalle venti settimane di esame e circa 2,6 milioni di download, mentre FrogNano ha avuto due settimane e un contatore di download che non ha superato la singola cifra.
A cosa serve ogni modello
Questa è la parte che una scheda tecnica nasconde. FrogNano-4B-2609 non è un modello generico che per caso se la cava bene con il codice. È un checkpoint il cui intero post-training è stato ingegneria del software a livello di repository, e che è progettato per essere guidato da un harness anziché per conversare.
I suoi cinque strumenti sono Read, Write, Edit, Glob e Bash. Emette chiamate ad essi, una sandbox le esegue e restituisce l'output, e il ciclo continua finché il modello non smette di chiedere. La configurazione valutata è di 150 passi di interazione all'interno di circa 131K token combinati, e ha prodotto una patch candidata per ogni attività. La scheda di Microsoft è esplicita sul fatto che il modello è per repository in inglese e prevalentemente Python con ambienti riproducibili e suite di test eseguibili, e che i componenti immagine e video ereditati dal modello di base non sono mai stati post-addestrati e non sono supportati.
Gemma 4 12B ha una forma opposta. È un modello unificato a 48 livelli con un contesto di 256K e nessun encoder separato per immagini o audio — patch grezze di immagini e forme d'onda audio vengono proiettate direttamente nello spazio di embedding dell'unico decoder tramite leggeri strati lineari. Accetta in ingresso testo, immagini e audio e restituisce testo. Ha una modalità di pensiero attivata da un token nel prompt di sistema, il richiamo nativo di funzioni e la scheda di Google ci tiene a elencare i flussi di lavoro agentici tra i suoi usi previsti.
Quindi la vera domanda non è quale dei due sia più intelligente. È se vuoi un componente specializzato che funziona solo all'interno di un'apparecchiatura che devi far funzionare tu, oppure un modello generale che se la cava bene in molte cose e può essere chiamato da qualsiasi cosa.

Riga per riga, dove differiscono effettivamente
• Parametri — FrogNano-4B-2609 pubblica una fascia, "500M-5B", su una card la cui stessa descrizione riporta circa 4,66 miliardi; il download lo fissa a 9,32 GB di pesi BF16. Gemma 4 12B è 11,95B, dichiarato una volta e mai attenuato. Il rapporto è di circa 2,6 a uno, e si riflette direttamente in ciò che devi affittare.
• Contesto — la configurazione valutata di FrogNano è di circa 131K token combinati, con ragionamento e output degli strumenti che condividono il budget. Gemma 4 12B dispone di 256.000 token e, nella propria riga di contesto lungo, ottiene il 43,4% su MRCR v2 con otto needle a 128K. Quasi il doppio della finestra, e il secondo numero è una misurazione pubblicata, non una dichiarazione di capacità.
• Modalità — FrogNano-4B-2609 è testo in input, testo in output, nonostante la torre di visione presente nel suo checkpoint. Gemma 4 12B accetta testo, immagini e audio.
• Limite di output — la configurazione FrogNano convalidata consente 8.192 token generati per turno dell'assistente, e la sua scheda indica che la configurazione di addestramento RL usava lo stesso tetto. Gemma 4 12B non pubblica alcun tetto equivalente per il singolo turno; il vincolo, in quel caso, è la finestra da 256K.
• Interfaccia agentica — FrogNano emette chiamate Leaf strutturate e necessita di un harness per eseguirle. Gemma 4 12B include il function calling nativo nella sua forma ottimizzata per le istruzioni ed è direttamente invocabile.
• Licenza — Gemma 4 12B è Apache 2.0 secondo i termini di Google per Gemma 4, dichiarato chiaramente. La scheda di FrogNano è MIT nel suo front matter e Apache 2.0 nel suo stesso corpo, il che è il tipo di ambiguità che finisce in una revisione legale anziché in una nota a piè di pagina.
• Numeri — FrogNano riporta il 61,5% su SWE-bench Verified, il 37,6% su SWE-bench Pro, il 31,1% su Terminal-Bench 2.0 e il 47,3% su PatchEval-Verified. Gemma 4 12B riporta il 77,2% su MMLU Pro, il 72,0% su LiveCodeBench v6, un ELO Codeforces di 1659, il 78,8% su GPQA Diamond e il 69,0% su Tau2. La scheda di Google non pubblica alcuna riga relativa a SWE-bench, e la scheda di Microsoft non pubblica LiveCodeBench. Non c'è alcuna sovrapposizione tra le due classifiche.
Quell'ultimo punto è quello che dovrebbe porre fine all'istinto di confrontare i numeri. Non un solo benchmark compare su entrambe le schede. Un lettore che mette 61,5 a confronto con 72,0 ha paragonato un tasso di risoluzione di repository a un tasso di superamento nella programmazione competitiva, il che è più o meno come confrontare il tempo di una maratona con il tempo dei cento metri perché entrambi sono in secondi.
Perché il silenzio di Google su SWE-bench non è un campanello d'allarme
La conclusione allettante che si trae dall'elenco puntato è che FrogNano ha un vero numero SWE-bench e Gemma no, quindi FrogNano vince la questione della programmazione. Non ne consegue, per una ragione sulla quale vale la pena essere precisi.
Gemma 4 12B riporta Tau2 al 69,0% — un benchmark agentico di uso degli strumenti su tre esecuzioni — insieme al supporto per il function calling e al suo posizionamento esplicito per flussi di lavoro agentici. Un modello che ottiene 69,0 su Tau2 non è un modello che non può svolgere lavoro agentico; è un modello il cui fornitore ha scelto di riportare le prestazioni nell'uso degli strumenti anziché la risoluzione di repository. Google inoltre non riporta righe SWE-bench per il 26B o il 31B, il che è una scelta editoriale a livello di famiglia anziché una debolezza del 12B.
Nel frattempo, il risultato controintuitivo nel documento di Microsoft è qualcosa che un acquirente di Gemma dovrebbe leggere con attenzione. FrogNano parte da Qwen3.5-4B, un modello generalista, che ha ottenuto il 39,4% su SWE-bench Verified tramite l'harness Leaf. Cinque cicli di apprendimento per rinforzo su circa 1.500 attività sintetiche lo hanno portato al 61,5%. La lezione non è "i modelli piccoli non sanno programmare" — è che un checkpoint generalista da 4B al 39,4% stava già risolvendo più di un terzo di un insieme di problemi difficile, convalidato da esseri umani, quando qualcuno lo ha eseguito all'interno di un ciclo agentico competente. Gemma 4 12B è tre volte più grande e venti settimane più maturo. Nessuno lo ha eseguito tramite Leaf e, finché qualcuno non lo farà, "Gemma non è un agente per repository" è un'assunzione più che un risultato.
La tassa dell'imbracatura, che i tabelloni nascondono completamente
Ecco l'asimmetria pratica, ed è quella che decide l'acquisto.
Gemma 4 12B è un modello. Scarica 11,95B di pesi, indirizza Transformers, vLLM o SGLang verso di essi, invia testo, ricevi testo. Google pubblica il percorso di serving, la licenza è inequivocabile e l'equivalente di 2,6 milioni di download di persone ha già sbattuto contro le asperità e le ha documentate. Se il compito è "riassumi questo stack trace", "leggi questo screenshot e dimmi cosa è rotto" oppure "chiama questa funzione con questi argomenti", funziona già oggi.
FrogNano-4B-2609 è un modello più un harness, e il README di Microsoft rende l'harness non opzionale. Il repository su github.com/microsoft/FrogNano è il banco di valutazione Leaf, non il codice di addestramento — richiede un cluster Kubernetes, un namespace esistente, autorizzazioni per gestire pod e politiche di rete, accesso pull alle immagini container di benchmark e un endpoint compatibile con OpenAI configurato con i corretti parser di reasoning e tool-call. La scheda di Microsoft enuncia senza mezzi termini la condizione di corrispondenza: punteggi identici richiedono checkpoint, tokenizer, configurazione di serving, immagini dei task e protocollo di valutazione corrispondenti. La metà della release che genera il punteggio è quella che la scheda indica tramite un link a GitHub.
C'è un valore reale in questo, e vale la pena nominarlo anziché liquidarlo. Il contributo di FrogNano è un ciclo di sintesi di compiti che rigenera problemi di addestramento in base all'abilità della policy corrente — la tesi del paper è che un piccolo agente possa essere addestrato a livello competitivo su compiti sintetici senza alcuna distillazione, e questo apre una strada per chiunque non possa permettersi un teacher di frontiera. La sua API è pubblica. I suoi metodi sono riproducibili in linea di principio. Questo è un contributo più forte di un altro checkpoint incrementale, ed è anche più lavoro di quanto la maggior parte dei team si aspetti quando si iscrive.

Se ne stai scegliendo uno, scegli in base al lavoro
Scegli Gemma 4 12B se il lavoro mescola modalità, se qualcosa deve vedere un'immagine o ascoltare audio, se il contesto deve contenere allo stesso tempo un grande albero di file e una lunga trascrizione, o se vuoi un modello che qualsiasi framework possa caricare senza un secondo sistema alle spalle. Il suo punteggio Tau2 di 69,0 e il function calling nativo lo rendono una scelta difendibile per pipeline agentiche, e nessuno deve credere sulla parola a un laboratorio — il modello è stato valutato da migliaia di persone e i risultati non sono un segreto.
Scegli FrogNano-4B-2609 se esegui già un agente per repository in sandbox e vuoi un checkpoint di classe 4B da inserirvi, e se un download da 9,32 GB che entra su hardware modesto è il vincolo che guida la decisione. Sii lucido sulla sequenza: non stai comprando un punteggio, stai scommettendo su un metodo, e la prima cosa che scoprirai è se il tuo ciclo di polling e il tuo parser delle chiamate agli strumenti assomigliano abbastanza a Leaf. Alcuni team otterranno un comportamento vicino al 61,5% il terzo pomeriggio e altri passeranno due settimane a scoprire che il loro set di valutazione era più facile di SWE-bench Verified, e nessuno fuori dal laboratorio può ancora dirti quale dei due sei.
Se la decisione è davvero sul filo del rasoio, l'esperimento a basso costo è eseguire entrambi nello stesso harness sui tuoi problemi, invece di discutere numeri pubblicati che non condividono alcun benchmark. OrcaRouter porta oltre 200 modelli dietro un'unica chiave compatibile con OpenAI a markup 0%, quindi i prezzi di listino dei provider passano invariati — il che rende possibile mettere un modello generalista ospitato e il resto del tuo insieme di candidati dietro un unico endpoint e un'unica voce di fatturazione mentre decidi. FrogNano non è una delle nostre rotte e non c'è una data per esso; i pesi sono un download che ospiti tu stesso. Quello che possiamo rimuovere è l'attrito dall'altro lato del confronto: scambiare modelli candidati nel tuo harness senza un secondo contratto, un secondo SDK o un secondo set di credenziali.

Il riassunto onesto è che il numero 61,5 è lavoro reale del laboratorio che l'ha prodotto, e che al momento è l'unico motivo per preferire FrogNano sulla programmazione. Quando qualcuno al di fuori di Microsoft riprodurrà 61,5 sugli stessi 500 task — o non ci riuscirà — questo confronto otterrà una risposta autentica. Fino ad allora, l'opzione predefinita più sicura per la maggior parte dei team è il modello da 11,95B con la licenza pulita, la misurazione pubblicata del contesto lungo e venti settimane di errori altrui già assorbite nella sua documentazione.
