Un cartello del titolo generato che recita 'FrogNano-4B-2609 vs Qwen 3.8' con il sottotitolo 'un agente da 4B sulla tua GPU contro un flagship ospitato da 2,4T', tre chip che riportano '9,32 GB di download', '$2 in / $6 out per milione' e 'fino a 150 passaggi per attività', un piè di pagina che recita 'dati di FrogNano secondo FrogNano; prezzi di Qwen3.8-Max secondo Alibaba. Nulla qui è indipendente', e il logo di OrcaRouter sovrapposto nell'angolo in basso a destra.
Guides & Insights

FrogNano-4B-2609 vs Qwen 3.8: quanto costa un agente di coding quando i pesi sono tuoi

Autore

Magnus Corvin

Data di pubblicazione

Ultimi modelli · 20Vedi tutti i modelli →
Benchmark: Artificial Analysis · aggiornato ogni giorno
Torna a tutti gli articoli

microsoft/FrogNano-4B-2609 è un agente per repository di classe quattro miliardi, derivato da Qwen3.5-4B, che scarichi ed esegui in autonomia. Qwen3.8-Max è il modello di punta ospitato — un modello sparse mixture-of-experts da 2,4 trilioni di parametri con circa 95 miliardi di parametri attivi per token, una finestra multimodale da un milione di token e un listino di 2,00 $ per milione di token in input e 6,00 $ per milione in output — raggiungibile con una chiave API dal 3 agosto 2026. Uno dei due costa una GPU e un pomeriggio. L'altro non costa nulla finché non lo usi, e poi fa pagare a token sulle traiettorie più lunghe di uso comune. Questo compromesso, e non la tabella dei benchmark, è il vero confronto.

I dati di FrogNano qui riportati provengono dalla model card e dal report tecnico di Microsoft; i dati di Qwen3.8-Max provengono dal listino pubblicato da Alibaba e dalla scheda del modello nel nostro catalogo, con i punteggi indipendenti etichettati come dati Artificial Analysis ovunque compaiano. Prestate attenzione alla denominazione: Qwen3.8, la release open-weights, è stata annunciata ma non ancora distribuita, mentre Qwen3.8-Max è disponibile e a listino oggi. Tutto ciò che è invocabile in questo articolo è quest'ultimo.

L'aritmetica che decide il confronto

Inizia da quanto costa un singolo costo, perché non è ovvio e non è piccolo.

Le valutazioni di FrogNano hanno eseguito ogni traiettoria con un budget di 150 passi entro circa 131K token combinati, fino a 8.192 token generati per turno dell'assistente, e un limite di 10.800 secondi. Moltiplica i due limiti pubblicati e ottieni un tetto di circa 1,23 milioni di token generati per una traiettoria nel caso peggiore — che, a 6,00 $ per milione di token di output di Qwen3.8-Max, è di circa 7,38 $ per un singolo compito che ha esaurito il suo budget. Questa è aritmetica su due numeri pubblicati, non una misurazione: le traiettorie reali si fermano prima, la media è molto al di sotto del tetto, e i risultati degli strumenti e l'output della shell vengono fatturati alla tariffa di input più economica anziché a quella di output. Ma ne stabilisce la forma. Un agente di coding non spende qualche centinaio di token per una domanda; spende una lunga conversazione con se stesso, ricca di ragionamenti, e ogni token di quella conversazione viene generato.

Ora metti l'altro lato del registro accanto a questo. FrogNano-4B-2609 è 9,32 GB di pesi BF16 in due shard, scaricabili senza gate. Per servirlo servono SGLang con un parser di ragionamento Qwen3 e un parser di tool-call per coder Qwen3, più una sandbox isolata per i cinque tool. Dopodiché il costo marginale di una traiettoria è l'elettricità, e la memoria che occupa è quella a cui cresce il tuo contesto, non quanto pesano i pesi.

• Modello di costo — FrogNano-4B-2609 prevede un costo hardware fisso e un costo marginale quasi nullo. Qwen3.8-Max prevede costo fisso nullo e fatturazione per token, con una ripartizione di $2,00 / $6,00 che non anticipa nulla e scarica tutto sulla tariffa di output.

• Cosa si compra con il denaro — un agente di classe 4B sul tuo hardware, contro un modello di scala frontier per cui non devi mai pianificare la capacità.

• Punto di pareggio — si raggiunge quando il volume mensile delle tue traiettorie moltiplicato per il costo medio in token per traiettoria supera il costo della GPU che altrimenti noleggeresti. Per un team che esegue una manciata di attività di repository al giorno, quel traguardo è ancora molto lontano e il modello hosted vince solo per comodità.

Due modelli che non svolgono lo stesso lavoro

Il confronto dei costi è equo solo se gli output sono comparabili, e qui non lo sono, ed è proprio questo l'aspetto che la maggior parte delle schede tecniche sotterra.

FrogNano-4B-2609 è stato addestrato con post-training esclusivamente su ingegneria del software a livello di repository. L'intera sua interfaccia è un ciclo di cinque strumenti — Read, Write, Edit, Glob e Bash — eseguito dall'harness Leaf in una sandbox isolata, iterando finché il modello non smette di chiamare. La scheda di Microsoft indica la lingua supportata come inglese e il dominio di programmazione validato come Python, e afferma senza mezzi termini che i componenti per immagini e video nel checkpoint non sono mai stati addestrati con post-training e non sono supportati. Non ragiona sulla tua architettura, non risponde a domande sul tuo business e non legge uno screenshot.

Qwen3.8-Max è un modello generale. La scheda di catalogo di Alibaba gli attribuisce input testuale, immagini e video con output testuale e una finestra di contesto di 1.000.000 di token. Ragiona, scrive, legge documenti e sostiene una conversazione, e il suo function calling è una caratteristica di un modello generale piuttosto che il punto centrale del checkpoint. I suoi valori di Artificial Analysis, letti dalla scheda il 2 settembre 2026, sono un Intelligence Index di 45,4 e un Coding Index di 76,2.

• Input — FrogNano-4B-2609 supporta solo testo. Qwen3.8-Max accetta testo, immagini e video.

• Contesto — circa 131K token combinati per la configurazione valutata di FrogNano, contro 1,000,000 per Qwen3.8-Max. È un fattore di sette volte e mezzo, e conta soprattutto proprio per gli input delle dimensioni di un repository che riceve un agente di programmazione.

• Output per turno — La configurazione convalidata di FrogNano limita un turno dell'assistente a 8.192 token. Qwen3.8-Max non pubblica alcun tetto equivalente per risposta.

• Formato di output — FrogNano emette chiamate strutturate agli strumenti Leaf e necessita di un harness per eseguirle. Qwen3.8-Max restituisce prosa o una chiamata di funzione al client che già usi.

• Punteggi indipendenti — nessuno per FrogNano-4B-2609 oltre alla sua scheda; i dati di Qwen3.8-Max sopra sono di terze parti, da Artificial Analysis.

• Parametri — circa 4,66B per FrogNano secondo la descrizione della sua stessa scheda, contro 2,4 trilioni totali e circa 95B attivi per Qwen3.8-Max.

A screenshot of the OrcaRouter model page for Qwen3.8 Max showing the breadcrumb Home, Models, Qwen; the model name and the qwen/qwen3.8-max model id; the FEATURED badge with Vision, Tools, JSON and Reasoning capability chips; the 1M-token context, text, image and video input and text output row; the $2.00 and $6.00 per-million price cards with the p50 TTFT figure; the byline 'by Qwen, 2026-08-03'; the on-page section list for Code samples, Pricing, Performance, Public benchmarks, Community buzz, How it compares and FAQ; and the opening of the long description describing Qwen3.8-Max as Alibaba's newest flagship.

Dove il 4B si guadagna davvero il suo posto

C'è un asse su cui un agente 4B batte nettamente un modello di frontiera, e non è l'accuratezza.

Il paper di FrogNano parte da Qwen3.5-4B, che ha ottenuto il 39,4% su SWE-bench Verified attraverso l'harness Leaf come semplice modello generalista. Cinque iterazioni di apprendimento per rinforzo su circa 1.500 attività sintetiche lo hanno portato al 61,5%, con l'appendice dello stesso paper che riporta la progressione per iterazione come 48,2%, 53,4%, 58,3%, 58,6% e 61,6%. Il metodo — generare attività calibrate sulla frontiera di apprendibilità della policy corrente, senza distillazione da un modello più forte — è il contributo, e la ragione per cui un gruppo di ricerca senza budget per modelli di frontiera se ne interesserebbe.

Leggi cosa implica per il confronto. La scheda di Microsoft è franca nel dire che FrogNano non è uniformemente migliore del modello da cui deriva: il suo tasso di chiamate a strumenti in parallelo è dell'1,71%, perché le iterazioni successive hanno perso la capacità di effettuare chiamate concorrenti, e il team ha aggiunto una fase di consolidamento per cercare di recuperarla. Un modello che risolve più problemi mentre peggiora in uno specifico comportamento è un vero artefatto ingegneristico con cuciture visibili, e la sua scheda lo dice invece di nasconderlo.

E il numero di SWE-bench è un circuito chiuso. Il baseline del modello di base, l'harness e il punteggio finale provengono tutti dallo stesso laboratorio, e le due tabelle dello stesso articolo offrono due classifiche diverse per lo stesso esperimento. Il dato di Qwen3.8-Max sul coding, al contrario, è stato prodotto da Artificial Analysis anziché da Alibaba — un tipo diverso di evidenza, un tipo diverso di fiducia, e i due non dovrebbero mai essere sottratti l'uno dall'altro.

Il 4B che non riesci ancora a pianificare del tutto

Due cose si frappongono tra FrogNano-4B-2609 e uno slot di produzione, ed entrambe si trovano nella sua stessa documentazione anziché nell'opinione di qualsiasi revisore.

Il primo è l'hardware. La scheda indica il requisito di peso BF16 in circa 9,3 GB e poi aggiunge che la memoria "aumenta sostanzialmente man mano che il contesto combinato si avvicina a circa 131K token", prima di affermare che l'esatto modello minimo di GPU, la configurazione VRAM, le versioni runtime e il profilo prestazionale "devono ancora essere convalidati prima del rilascio" — una frase che appare su un modello già scaricabile. Nessuno ha pubblicato un valore VRAM per la configurazione valutata, e la scheda non ne contiene alcuno.

Il secondo è la postura di sicurezza. La nota di allineamento di Microsoft afferma che il post-addestramento specifico per l'agente non ha utilizzato dataset di preferenza per la sicurezza, di rifiuto, di contenuti dannosi o avversariali, che è stato ottimizzato invece per la correttezza funzionale e l'evitamento delle regressioni, e che il modello "non dovrebbe essere considerato autonomamente allineato alla sicurezza per una distribuzione autonoma senza restrizioni". La scheda si conclude elencando i rischi concreti: le patch possono essere errate o non sicure nonostante superino i loro test, le prestazioni sono sensibili alla qualità di tali test, e ogni patch candidata necessita di una revisione umana qualificata e di test indipendenti di regressione e sicurezza prima dell'uso. Un modello hostato generico non presenta nessuno di questi specifici avvertimenti, e inoltre non eseguirà un comando shell nel tuo repository.

Una chiave per qualunque lato tu scelga

La cosa utile di eseguire questo confronto nella pratica è che solo una metà di esso è un download. Qwen3.8-Max, e i modelli generali con cui confronteresti un agente self-hosted, sono tutti raggiungibili tramite un unico endpoint compatibile con OpenAI su OrcaRouter con markup allo 0% — prezzo di listino del provider passato direttamente, quindi una variazione di prezzo del fornitore arriva dalla nostra parte lo stesso giorno, ed è il numero che si muove davvero quando la bolletta dei token di output di un agente di coding è ciò che stai cercando di controllare. Questo rende anche semplice la questione del failover: se la metà ospitata della tua pipeline si degrada, il retry è automatico e l'esperimento prosegue.

FrogNano-4B-2609 non è una delle nostre route e non esiste una data per esso. I pesi sono tuoi da servire, e la scheda dichiara onestamente che la configurazione di serving non è stata completamente validata. Quello che possiamo fare è rendere l'altro lato del confronto a costo zero da configurare, così la domanda a cui finirai per rispondere è quella vera: se un agente SWE-bench dichiarato dal fornitore al 61,5% sulla tua GPU batte un modello frontier a consumo sulle tue attività, al tuo volume.

A generated two-column scoreboard titled 'FrogNano-4B-2609 vs Qwen3.8-Max'. The left column reads Cost your GPU, electricity; Output tool calls and patches; Context about 131K evaluated; Input text only; Published score 61.5% SWE-bench Verified, vendor, unreproduced; Turn cap 8,192 tokens. The right column reads Cost $2.00 in / $6.00 out per million; Output prose or function call; Context 1,000,000 tokens; Input text, image, video; Published score AA Intelligence 45.4 and AA Coding 76.2, third-party; Turn cap not published. A footer reads 'FrogNano figures per Microsoft; Qwen3.8-Max scores per Artificial Analysis. Different benchmarks; not comparable.'

Quale scegliere

Scegli Qwen3.8-Max quando il lavoro è generico, quando è il team operativo di qualcun altro a doversi sobbarcare la capacità, quando l'input potrebbe contenere un'immagine o un documento lungo, oppure quando ti serve una risposta oggi anziché un serving entro venerdì. I suoi punteggi di terze parti significano che puoi prevedere all'incirca cosa stai acquistando, e la sua tariffa per token è un costo variabile che puoi vedere prima di impegnarti. Per un team che esegue un numero contenuto di attività sul repository al mese, non c'è partita.

Ricorri a FrogNano-4B-2609 quando il volume è abbastanza alto che la fatturazione per token su traiettorie lunghe è il vincolo, quando i dati non possono lasciare la tua infrastruttura, o quando la domanda di ricerca — un piccolo agente può essere addestrato a una competenza a livello di repository senza un insegnante — è ciò che stai effettivamente mettendo alla prova. Procedi sapendo tre cose: il 61,5% è una misurazione effettuata da un laboratorio su un harness mantenuto dal laboratorio stesso, nessuno ha pubblicato un dato di VRAM per la configurazione valutata, e la scheda stessa dichiara che l'assetto di serving non è ancora validato.

Ciò che rende la coppia degna di essere raccontata è che condividono un antenato due generazioni indietro. FrogNano discende da Qwen3.5-4B — un modello generalista della stessa azienda il cui modello di punta da 2,4 trilioni di parametri si trova dall'altra parte di questa pagina. Microsoft ha preso quello piccolo, ha dedicato cinque iterazioni RL a repository sintetici e ha ottenuto uno specialista. Alibaba ha fatto il contrario e ha puntato sulla scala. Entrambe le risposte sono pubblicate, e il divario tra quanto costa il download e quanto costa l'API è il modo onesto per scegliere tra le due.

A screenshot of the microsoft/FrogNano GitHub repository README showing the description that FrogNano evaluates coding agents with the Leaf harness in isolated Kubernetes sandboxes against OpenAI-compatible endpoints and five tools Read, Write, Edit, Glob and Bash; the requirements list naming a Kubernetes cluster with pod and network-policy permissions and an OpenAI-compatible endpoint with reasoning and tool-call parsers configured for Qwen3.5; the frognano-eval run commands; and the benchmark table listing SWE-bench Verified at 500 tasks with an 8,192-token cap, SWE-bench Pro at 731 with 32,000, Terminal-Bench 2.0 Verified at 89 with 32,000 and PatchEval Verified at 230 with 8,192.

Confrontati in questo articolo1

Rilevato da questo articolo · Benchmark: Artificial Analysis · aggiornato ogni giorno