
FrogNano-4B-2609: Microsoft ha rilasciato un agente di coding da 4B su Hugging Face senza mai annunciarlo
- openaiNUOVOOpenAI: GPT-6.1 Sol2026-09-2952Intelligenza
- anthropicNUOVOAnthropic: Claude Sonnet 5.52026-09-2856Intelligenza
- typesafeNUOVOTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 per 1M di token · 219 tok/s
- OpenAINUOVOOpenAI: GPT-6 Luna2026-09-2238Intelligenza
- OpenAINUOVOOpenAI: GPT-6 Sol2026-09-2248Intelligenza
- AnthropicNUOVOAnthropic: Claude Opus 5.52026-09-2258Intelligenza
- xAINUOVOGrok 4.72026-09-2146Intelligenza
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 per 1M di token · 114 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1M di token · 1064 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligenza
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Intelligenza77Codice
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Intelligenza76Codice
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Intelligenza76Codice
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Intelligenza82Codice
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 per 1M di token · 41 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1M di token · 105 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligenza72Codice
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1M di token · 213 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Intelligenza75Codice
- obsidianQwen3.8 27B2026-08-1534Intelligenza68Codice
Il repository è apparso il 17 settembre 2026 con il commit iniziale e il checkpoint stesso è arrivato quattro minuti dopo. Poi nulla. Nessun tweet da Microsoft AI, nessun post sul blog di Microsoft Research, nessuna pagina di lancio. Sette settimane dopo microsoft/FrogNano-4B-2609 — un agente di coding di classe quattro miliardi di parametri costruito su Qwen3.5-4B — non ha ancora nessun annuncio alle spalle, e quel silenzio è il fatto più importante in assoluto riguardo alla pubblicazione di questo modello. Quello che ha, invece, è una model card che dichiara un paper e un harness, un repository GitHub che si scopre essere l'harness e non il paper, e un createdAt del 17 settembre sotto una card che dice "Release date 22-SEP-2026". Entrambe le date sono improvvisate; nessuna delle due è sbagliata; non concordano tra loro.
Cosa viene effettivamente pubblicato
Tutto ciò che segue è verificabile in questo momento sull'hub, e ogni cifra in questo pezzo proviene dalla scheda di Microsoft stesso o dai conteggi di byte nel repository stesso. Nulla è stato riprodotto da terzi — non esiste alcuna voce su Artificial Analysis, alcun rating arena e alcuna valutazione indipendente di FrogNano da nessuna parte.
• Pesi — un repository pubblico all'interno dell'organizzazione Microsoft, senza restrizioni, con tag MIT sull'hub, 15 file, nessun blocco al download e nessun accordo da firmare.
• Pesi su disco — 9,32 GB distribuiti su due shard safetensors, 59,6 miliardi di byte di dati del repository, incluso il set di file senza optimizer, 738 tensori nell'indice.
• Architettura — Qwen3_5ForConditionalGeneration, lo stack ibrido denso a 32 livelli ereditato da Qwen3.5-4B, con una torre di visione a 24 livelli che, secondo la scheda, è stata ereditata e mai addestrata successivamente.
• Il campo parametri della scheda stessa — "500M-5B". Questa è una banda, non un numero, e il download è il documento più preciso.
• Licenza — il front matter della card dice MIT. Il corpo stesso della card dice Apache License 2.0, e l'harness di GitHub include davvero un file LICENSE MIT. Queste due affermazioni riguardano artefatti diversi nella stessa release.
• Annuncio — nessuno. Non sul blog di Microsoft Research, né sul sito di ricerca del team stesso, né nel feed dell'organizzazione Hugging Face se non come elenco di repository.
Quell'ultima riga è quella che dovrebbe impostare la postura del lettore per il resto di questo pezzo. Un checkpoint caricato in sordina non è un artefatto inferiore rispetto a uno annunciato — la sua scheda è spesso più lunga, perché nessuno la sta accorciando per un comunicato stampa. Ma non è passato attraverso l'unico filtro che un rilascio annunciato ottiene gratis: altre persone che lo guardano.

Gli spartiti, e chi ha realizzato ognuno di essi
Microsoft riferisce che FrogNano raggiunge il 61,5% su SWE-bench Verified, il 37,6% su SWE-bench Pro, il 31,1% su Terminal-Bench 2.0 e il 47,3% su PatchEval-Verified, tutti come tassi di risoluzione Avg@3 misurati tramite l'harness Leaf. La stessa scheda fornisce il punto di partenza: Qwen3.5-4B ha ottenuto il 39,4% su SWE-bench Verified con lo stesso harness e lo stesso budget. Cinque iterazioni di apprendimento per rinforzo lo hanno portato attraverso il 49,1%, il 53,1%, il 56,7%, il 59,1% e il 61,5% — 22,1 punti rispetto al modello base, che la stessa impostazione di Microsoft arrotonda a circa il 56% di miglioramento relativo.
Due cose su quella scala su cui vale la pena soffermarsi, perché sono punti in cui un riassunto può sbagliare, non punti in cui ha sbagliato il fornitore.
La prima è la discrepanza dell'Iter 5. La tabella principale della scheda indica 61,5% per l'iterazione finale; l'appendice sull'efficienza dello stesso articolo riporta la stessa progressione a cinque checkpoint come 48,2%, 53,4%, 58,3%, 58,6% e 61,6%. Solo l'ultimo numero è vicino, e solo l'ultimo è quello che chiunque cita. Considera la cifra finale come il risultato stabile e i gradini intermedi come misurazioni di cose diverse, perché con un'aggregazione diversa lo sono palesemente.
Il secondo punto è che FrogNano non è uniformemente migliore, su ogni asse, rispetto al modello da cui è partito. Il suo tasso pubblicato di chiamate agli strumenti in parallelo è dell'1,71%. La scheda è schietta nel riconoscere che le iterazioni successive hanno perso la capacità di effettuare diverse chiamate agli strumenti in un singolo turno, e che il lavoro di consolidamento del team esiste in parte per recuperarla. Un modello che risolve più problemi pur effettuando quasi nessuna chiamata concorrente è un vero trade-off ingegneristico, non una nota a piè di pagina.

L'harness è il prodotto, e il repository è l'harness.
FrogNano non viene eseguito da solo. Emette chiamate strutturate a cinque strumenti — Read, Write, Edit, Glob e Bash — e qualcosa deve eseguirle in un ambiente isolato e restituire l'output. Quel qualcosa è Leaf, e qui la traccia fa qualcosa di lievemente insolito.
La riga "asset correlati aggiuntivi" della model card rimanda a un rapporto tecnico su aka.ms/frognano-tech-report e a un harness su github.com/microsoft/FrogNano. Il link aka.ms non punta a un PDF; reindirizza direttamente alla pagina dell'abstract su arXiv, ovvero dove si trova il rapporto vero e proprio. Il repository GitHub, nel frattempo, non contiene codice di addestramento, né una ricetta RL, né checkpoint. Il suo stesso README descrive un harness di valutazione che esegue agenti di programmazione in sandbox Kubernetes verso un endpoint compatibile con OpenAI, e rimanda al paper su arXiv per la storia dell'addestramento. Quindi i due link agli asset presenti nella card sono un puntatore al paper e un puntatore alla risposta al paper, e il nome è condiviso.
Questo è importante per chiunque pianifichi di usare il modello, per una ragione pratica. La ricetta di serving documentata è SGLang con --reasoning-parser qwen3 e --tool-call-parser qwen3_coder, e l'harness vuole un endpoint che parli già tool call e reasoning. Basta sbagliare di poco la configurazione di parsing e il modello produce testo dove l'harness si aspetta JSON, il che visto dall'esterno sembra esattamente un modello scadente anziché una configurazione sbagliata. La card è esplicita sul fatto che qualsiasi punteggio corrispondente richiede un checkpoint, tokenizer, configurazione di serving, immagini del task e protocollo di valutazione corrispondenti — cioè il fornitore ti sta dicendo che l'harness è metà del risultato.
Vale anche la pena affermarlo chiaramente per chiunque stia dimensionando l'hardware: un checkpoint da 9,32 GB al contesto valutato della scheda non è un problema di inferenza da 9,32 GB. Le valutazioni sono state eseguite a circa 131K token complessivi con un budget di 150 passi. La memoria scala con il contesto, non con i pesi, e la scheda dice che la configurazione GPU minima deve ancora essere "convalidata prima del rilascio" — una frase che compare su un modello già scaricabile.
Che cosa ha effettivamente fatto l'addestramento, in un paragrafo
Il contributo del paper non è il modello, ma il ciclo. TaskPilot genera compiti candidati di ingegneria del software a partire da snapshot reali di repository, esegue rollout dal checkpoint corrente su di essi, conserva quelli vicini al limite di ciò che la politica riesce talvolta a risolvere e scarta i candidati che sono permanentemente banali o permanentemente impossibili. L'insieme accettato addestra il checkpoint successivo. Quel checkpoint successivo calibra poi il round seguente di generazione dei compiti, così la distribuzione dei compiti si sposta man mano che si sposta la politica. Circa 1.500 ambienti validati in totale. Nessuna distillazione: la scheda dichiara apertamente che il post-addestramento specifico per l'agente non ha utilizzato traiettorie di soluzione, azioni, tracce di ragionamento o target di patch provenienti da modelli più forti. I modelli più forti scrivono i compiti; non dimostrano le risposte.
Microsoft ha eseguito quel ciclo per cinque iterazioni e riporta un guadagno di 8,7 punti prima di qualsiasi consolidamento, con una penalità sulla lunghezza del log aggiunta a metà esecuzione perché le tracce di ragionamento crescevano più velocemente di quanto migliorassero.
La scheda del modello è insolitamente diretta su dove l'intero approccio è fragile. I dati di addestramento sono prevalentemente in Python e principalmente in inglese; l'insieme dichiarato di linguaggi naturali supportati dalla scheda è l'inglese e nient'altro, senza che venga esplicitamente rivendicata la più ampia copertura multilingue del modello di base. Le prestazioni sono sensibili all'harness e alla qualità dei test. Le patch generate «potrebbero essere errate o non sicure nonostante superino i test disponibili». La scheda del modello del 4B chiude quel paragrafo con la frase che ogni lettore dovrebbe tenere a mente: non deve essere usato senza una revisione umana qualificata e test indipendenti di regressione e sicurezza. Questa è un'affermazione del fornitore su un artefatto del fornitore, ed è una frase più utile di qualsiasi riga del tabellone dei punteggi sopra di essa.
Dove questo lascia un acquirente, e dove si inserisce un router
FrogNano non è un modello che si invoca. Non esiste un'API di prima parte, nessun endpoint ospitato e nessuna immagine serverless. È un checkpoint, e usarlo significa o mettere in piedi un proprio deployment SGLang dietro una sandbox ospitata su Kubernetes, oppure valutarlo come componente all'interno di uno stack di agenti che già gestisci. Questo è l'intero percorso di adozione oggi, e nessun annuncio ne avrebbe cambiato la forma.
Ciò che un layer di routing può onestamente fare in questo caso è una cosa più limitata di quanto non sembri a prima vista. Se il piano è confrontare un FrogNano self-hosted con un modello di coding hosted all'interno del vostro harness, la metà hosted è quella che trae vantaggio dallo stare dietro a una sola chiave invece che a un secondo contratto: OrcaRouter porta oltre 200 modelli dietro un unico endpoint compatibile con OpenAI con markup 0%, il che significa che i prezzi di listino dei provider passano invariati e una variazione di prezzo di un fornitore è attiva dalla nostra parte lo stesso giorno. Questo conta per un bake-off il cui esito è deciso dal costo per problema risolto più che da un singolo numero di benchmark. Non ospitiamo FrogNano e non c'è una data; i pesi e il lavoro di serving sono vostri.

Le tre cose che lo risolverebbero
Innanzitutto, una riproduzione indipendente. Ogni numero in questo articolo — 61.5, 37.6, 31.1, 47.3 — è stato prodotto dal laboratorio che ha addestrato il modello, su un sistema di valutazione mantenuto dallo stesso laboratorio, rispetto a un valore del modello base misurato dallo stesso laboratorio. È un quadro completo e internamente coerente, ed è anche un ciclo chiuso. Il test utile è se qualcuno che non ha interessi in gioco riproduce il salto da 39.4 a 61.5 sulle stesse 500 attività senza il lavoro di calibrazione di Microsoft sul set di attività.
In secondo luogo, qualcuno deve verificare end-to-end l'affermazione sull'harness. Il repository è pubblico, il che è più di quanto riescano a fare molte release, ma è l'apparato di valutazione. Se i cinque strumenti e l'isolamento sandbox sono davvero il meccanismo delle prestazioni, un terzo che esegue la configurazione pubblicata dovrebbe arrivare vicino ai numeri pubblicati. Se non lo fanno, il divario è il vero risultato.
Terzo, e il più economico a cui rispondere: Microsoft dovrebbe dire se questo è un prodotto o un artefatto cartaceo. La sezione sulla distribuzione della scheda considera i pesi, la scheda e l'harness come il risultato finale, il che suona come una pubblicazione più che come un lancio. «Data di rilascio 22-SEP-2026» suona come un lancio. Un modello annunciato avrebbe risolto quell'ambiguità nella prima frase di un post sul blog, e non esiste alcun post sul blog.
Fino ad allora, l'atteggiamento corretto è quello che il rilascio stesso implica. FrogNano-4B-2609 è un checkpoint reale, scaricabile, MIT-e-Apache-e-forse-no, con una scheda insolitamente accurata, un harness di valutazione pubblico, un'idea metodologica autentica e un tabellone che non è mai stato toccato da nessuno senza un indirizzo Microsoft. Per un laboratorio, questo è un artefatto completo e interessante. Per un team in procinto di mettere un agente davanti a un repository alle tre del mattino, è una pista che vale la pena seguire e non ancora una decisione che valga la pena prendere.
