
FrogNano-4B-2609 vs Qwen 3.8: quanto costa un agente di coding quando i pesi sono tuoi
- openaiNUOVOOpenAI: GPT-6.1 Sol2026-09-2952Intelligenza
- anthropicNUOVOAnthropic: Claude Sonnet 5.52026-09-2856Intelligenza
- typesafeNUOVOTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 per 1M di token · 219 tok/s
- OpenAINUOVOOpenAI: GPT-6 Luna2026-09-2238Intelligenza
- OpenAINUOVOOpenAI: GPT-6 Sol2026-09-2248Intelligenza
- AnthropicNUOVOAnthropic: Claude Opus 5.52026-09-2258Intelligenza
- xAINUOVOGrok 4.72026-09-2146Intelligenza
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 per 1M di token · 114 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1M di token · 1064 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligenza
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Intelligenza77Codice
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Intelligenza76Codice
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Intelligenza76Codice
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Intelligenza82Codice
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 per 1M di token · 41 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1M di token · 105 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligenza72Codice
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1M di token · 213 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Intelligenza75Codice
- obsidianQwen3.8 27B2026-08-1534Intelligenza68Codice
microsoft/FrogNano-4B-2609 è un agente per repository di classe quattro miliardi, derivato da Qwen3.5-4B, che scarichi ed esegui in autonomia. Qwen3.8-Max è il modello di punta ospitato — un modello sparse mixture-of-experts da 2,4 trilioni di parametri con circa 95 miliardi di parametri attivi per token, una finestra multimodale da un milione di token e un listino di 2,00 $ per milione di token in input e 6,00 $ per milione in output — raggiungibile con una chiave API dal 3 agosto 2026. Uno dei due costa una GPU e un pomeriggio. L'altro non costa nulla finché non lo usi, e poi fa pagare a token sulle traiettorie più lunghe di uso comune. Questo compromesso, e non la tabella dei benchmark, è il vero confronto.
I dati di FrogNano qui riportati provengono dalla model card e dal report tecnico di Microsoft; i dati di Qwen3.8-Max provengono dal listino pubblicato da Alibaba e dalla scheda del modello nel nostro catalogo, con i punteggi indipendenti etichettati come dati Artificial Analysis ovunque compaiano. Prestate attenzione alla denominazione: Qwen3.8, la release open-weights, è stata annunciata ma non ancora distribuita, mentre Qwen3.8-Max è disponibile e a listino oggi. Tutto ciò che è invocabile in questo articolo è quest'ultimo.
L'aritmetica che decide il confronto
Inizia da quanto costa un singolo costo, perché non è ovvio e non è piccolo.
Le valutazioni di FrogNano hanno eseguito ogni traiettoria con un budget di 150 passi entro circa 131K token combinati, fino a 8.192 token generati per turno dell'assistente, e un limite di 10.800 secondi. Moltiplica i due limiti pubblicati e ottieni un tetto di circa 1,23 milioni di token generati per una traiettoria nel caso peggiore — che, a 6,00 $ per milione di token di output di Qwen3.8-Max, è di circa 7,38 $ per un singolo compito che ha esaurito il suo budget. Questa è aritmetica su due numeri pubblicati, non una misurazione: le traiettorie reali si fermano prima, la media è molto al di sotto del tetto, e i risultati degli strumenti e l'output della shell vengono fatturati alla tariffa di input più economica anziché a quella di output. Ma ne stabilisce la forma. Un agente di coding non spende qualche centinaio di token per una domanda; spende una lunga conversazione con se stesso, ricca di ragionamenti, e ogni token di quella conversazione viene generato.
Ora metti l'altro lato del registro accanto a questo. FrogNano-4B-2609 è 9,32 GB di pesi BF16 in due shard, scaricabili senza gate. Per servirlo servono SGLang con un parser di ragionamento Qwen3 e un parser di tool-call per coder Qwen3, più una sandbox isolata per i cinque tool. Dopodiché il costo marginale di una traiettoria è l'elettricità, e la memoria che occupa è quella a cui cresce il tuo contesto, non quanto pesano i pesi.
• Modello di costo — FrogNano-4B-2609 prevede un costo hardware fisso e un costo marginale quasi nullo. Qwen3.8-Max prevede costo fisso nullo e fatturazione per token, con una ripartizione di $2,00 / $6,00 che non anticipa nulla e scarica tutto sulla tariffa di output.
• Cosa si compra con il denaro — un agente di classe 4B sul tuo hardware, contro un modello di scala frontier per cui non devi mai pianificare la capacità.
• Punto di pareggio — si raggiunge quando il volume mensile delle tue traiettorie moltiplicato per il costo medio in token per traiettoria supera il costo della GPU che altrimenti noleggeresti. Per un team che esegue una manciata di attività di repository al giorno, quel traguardo è ancora molto lontano e il modello hosted vince solo per comodità.
Due modelli che non svolgono lo stesso lavoro
Il confronto dei costi è equo solo se gli output sono comparabili, e qui non lo sono, ed è proprio questo l'aspetto che la maggior parte delle schede tecniche sotterra.
FrogNano-4B-2609 è stato addestrato con post-training esclusivamente su ingegneria del software a livello di repository. L'intera sua interfaccia è un ciclo di cinque strumenti — Read, Write, Edit, Glob e Bash — eseguito dall'harness Leaf in una sandbox isolata, iterando finché il modello non smette di chiamare. La scheda di Microsoft indica la lingua supportata come inglese e il dominio di programmazione validato come Python, e afferma senza mezzi termini che i componenti per immagini e video nel checkpoint non sono mai stati addestrati con post-training e non sono supportati. Non ragiona sulla tua architettura, non risponde a domande sul tuo business e non legge uno screenshot.
Qwen3.8-Max è un modello generale. La scheda di catalogo di Alibaba gli attribuisce input testuale, immagini e video con output testuale e una finestra di contesto di 1.000.000 di token. Ragiona, scrive, legge documenti e sostiene una conversazione, e il suo function calling è una caratteristica di un modello generale piuttosto che il punto centrale del checkpoint. I suoi valori di Artificial Analysis, letti dalla scheda il 2 settembre 2026, sono un Intelligence Index di 45,4 e un Coding Index di 76,2.
• Input — FrogNano-4B-2609 supporta solo testo. Qwen3.8-Max accetta testo, immagini e video.
• Contesto — circa 131K token combinati per la configurazione valutata di FrogNano, contro 1,000,000 per Qwen3.8-Max. È un fattore di sette volte e mezzo, e conta soprattutto proprio per gli input delle dimensioni di un repository che riceve un agente di programmazione.
• Output per turno — La configurazione convalidata di FrogNano limita un turno dell'assistente a 8.192 token. Qwen3.8-Max non pubblica alcun tetto equivalente per risposta.
• Formato di output — FrogNano emette chiamate strutturate agli strumenti Leaf e necessita di un harness per eseguirle. Qwen3.8-Max restituisce prosa o una chiamata di funzione al client che già usi.
• Punteggi indipendenti — nessuno per FrogNano-4B-2609 oltre alla sua scheda; i dati di Qwen3.8-Max sopra sono di terze parti, da Artificial Analysis.
• Parametri — circa 4,66B per FrogNano secondo la descrizione della sua stessa scheda, contro 2,4 trilioni totali e circa 95B attivi per Qwen3.8-Max.

Dove il 4B si guadagna davvero il suo posto
C'è un asse su cui un agente 4B batte nettamente un modello di frontiera, e non è l'accuratezza.
Il paper di FrogNano parte da Qwen3.5-4B, che ha ottenuto il 39,4% su SWE-bench Verified attraverso l'harness Leaf come semplice modello generalista. Cinque iterazioni di apprendimento per rinforzo su circa 1.500 attività sintetiche lo hanno portato al 61,5%, con l'appendice dello stesso paper che riporta la progressione per iterazione come 48,2%, 53,4%, 58,3%, 58,6% e 61,6%. Il metodo — generare attività calibrate sulla frontiera di apprendibilità della policy corrente, senza distillazione da un modello più forte — è il contributo, e la ragione per cui un gruppo di ricerca senza budget per modelli di frontiera se ne interesserebbe.
Leggi cosa implica per il confronto. La scheda di Microsoft è franca nel dire che FrogNano non è uniformemente migliore del modello da cui deriva: il suo tasso di chiamate a strumenti in parallelo è dell'1,71%, perché le iterazioni successive hanno perso la capacità di effettuare chiamate concorrenti, e il team ha aggiunto una fase di consolidamento per cercare di recuperarla. Un modello che risolve più problemi mentre peggiora in uno specifico comportamento è un vero artefatto ingegneristico con cuciture visibili, e la sua scheda lo dice invece di nasconderlo.
E il numero di SWE-bench è un circuito chiuso. Il baseline del modello di base, l'harness e il punteggio finale provengono tutti dallo stesso laboratorio, e le due tabelle dello stesso articolo offrono due classifiche diverse per lo stesso esperimento. Il dato di Qwen3.8-Max sul coding, al contrario, è stato prodotto da Artificial Analysis anziché da Alibaba — un tipo diverso di evidenza, un tipo diverso di fiducia, e i due non dovrebbero mai essere sottratti l'uno dall'altro.
Il 4B che non riesci ancora a pianificare del tutto
Due cose si frappongono tra FrogNano-4B-2609 e uno slot di produzione, ed entrambe si trovano nella sua stessa documentazione anziché nell'opinione di qualsiasi revisore.
Il primo è l'hardware. La scheda indica il requisito di peso BF16 in circa 9,3 GB e poi aggiunge che la memoria "aumenta sostanzialmente man mano che il contesto combinato si avvicina a circa 131K token", prima di affermare che l'esatto modello minimo di GPU, la configurazione VRAM, le versioni runtime e il profilo prestazionale "devono ancora essere convalidati prima del rilascio" — una frase che appare su un modello già scaricabile. Nessuno ha pubblicato un valore VRAM per la configurazione valutata, e la scheda non ne contiene alcuno.
Il secondo è la postura di sicurezza. La nota di allineamento di Microsoft afferma che il post-addestramento specifico per l'agente non ha utilizzato dataset di preferenza per la sicurezza, di rifiuto, di contenuti dannosi o avversariali, che è stato ottimizzato invece per la correttezza funzionale e l'evitamento delle regressioni, e che il modello "non dovrebbe essere considerato autonomamente allineato alla sicurezza per una distribuzione autonoma senza restrizioni". La scheda si conclude elencando i rischi concreti: le patch possono essere errate o non sicure nonostante superino i loro test, le prestazioni sono sensibili alla qualità di tali test, e ogni patch candidata necessita di una revisione umana qualificata e di test indipendenti di regressione e sicurezza prima dell'uso. Un modello hostato generico non presenta nessuno di questi specifici avvertimenti, e inoltre non eseguirà un comando shell nel tuo repository.
Una chiave per qualunque lato tu scelga
La cosa utile di eseguire questo confronto nella pratica è che solo una metà di esso è un download. Qwen3.8-Max, e i modelli generali con cui confronteresti un agente self-hosted, sono tutti raggiungibili tramite un unico endpoint compatibile con OpenAI su OrcaRouter con markup allo 0% — prezzo di listino del provider passato direttamente, quindi una variazione di prezzo del fornitore arriva dalla nostra parte lo stesso giorno, ed è il numero che si muove davvero quando la bolletta dei token di output di un agente di coding è ciò che stai cercando di controllare. Questo rende anche semplice la questione del failover: se la metà ospitata della tua pipeline si degrada, il retry è automatico e l'esperimento prosegue.
FrogNano-4B-2609 non è una delle nostre route e non esiste una data per esso. I pesi sono tuoi da servire, e la scheda dichiara onestamente che la configurazione di serving non è stata completamente validata. Quello che possiamo fare è rendere l'altro lato del confronto a costo zero da configurare, così la domanda a cui finirai per rispondere è quella vera: se un agente SWE-bench dichiarato dal fornitore al 61,5% sulla tua GPU batte un modello frontier a consumo sulle tue attività, al tuo volume.

Quale scegliere
Scegli Qwen3.8-Max quando il lavoro è generico, quando è il team operativo di qualcun altro a doversi sobbarcare la capacità, quando l'input potrebbe contenere un'immagine o un documento lungo, oppure quando ti serve una risposta oggi anziché un serving entro venerdì. I suoi punteggi di terze parti significano che puoi prevedere all'incirca cosa stai acquistando, e la sua tariffa per token è un costo variabile che puoi vedere prima di impegnarti. Per un team che esegue un numero contenuto di attività sul repository al mese, non c'è partita.
Ricorri a FrogNano-4B-2609 quando il volume è abbastanza alto che la fatturazione per token su traiettorie lunghe è il vincolo, quando i dati non possono lasciare la tua infrastruttura, o quando la domanda di ricerca — un piccolo agente può essere addestrato a una competenza a livello di repository senza un insegnante — è ciò che stai effettivamente mettendo alla prova. Procedi sapendo tre cose: il 61,5% è una misurazione effettuata da un laboratorio su un harness mantenuto dal laboratorio stesso, nessuno ha pubblicato un dato di VRAM per la configurazione valutata, e la scheda stessa dichiara che l'assetto di serving non è ancora validato.
Ciò che rende la coppia degna di essere raccontata è che condividono un antenato due generazioni indietro. FrogNano discende da Qwen3.5-4B — un modello generalista della stessa azienda il cui modello di punta da 2,4 trilioni di parametri si trova dall'altra parte di questa pagina. Microsoft ha preso quello piccolo, ha dedicato cinque iterazioni RL a repository sintetici e ha ottenuto uno specialista. Alibaba ha fatto il contrario e ha puntato sulla scala. Entrambe le risposte sono pubblicate, e il divario tra quanto costa il download e quanto costa l'API è il modo onesto per scegliere tra le due.

Confrontati in questo articolo1
Rilevato da questo articolo · Benchmark: Artificial Analysis · aggiornato ogni giorno
