Una scheda del titolo generata con scritto 'FrogNano-4B-2609 vs Intern-Decision-4B', con il sottotitolo 'lo stesso antenato Qwen3.5-4B, due output opposti', tre chip con scritto 'chiamate a strumenti e patch', 'un simbolo per campo' e 'nessuno dei due valutato in modo indipendente', un piè di pagina con scritto 'Entrambi i tabelloni dei punteggi sono riportati dal fornitore; nessuna terza parte ha riprodotto nessuno dei due', e il logo OrcaRouter composto nell'angolo in basso a destra.
Guides & Insights

FrogNano-4B-2609 vs Intern Decision 4B: un unico modello di base, due scommesse completamente diverse

Autore

Gideon Frost

Data di pubblicazione

Ultimi modelli · 20Vedi tutti i modelli →
Benchmark: Artificial Analysis · aggiornato ogni giorno
Torna a tutti gli articoli

Due laboratori hanno preso lo stesso checkpoint, Qwen3.5-4B, e lo hanno spinto in direzioni che non si somigliano tra loro. microsoft/FrogNano-4B-2609 è stato addestrato in una fase successiva con apprendimento per rinforzo su circa 1.500 ambienti sintetici di ingegneria del software finché non è stato in grado di emettere chiamate strutturate agli strumenti e patch multi-file attraverso un harness a cinque strumenti. internlm/Intern-Decision-4B è stato ottimizzato con fine-tuning per non emettere alcun testo — riceve in ingresso un prompt più uno schema di domande denominate e restituisce una probabilità calibrata per ciascuna opzione in un singolo forward pass. Uno scrive codice. L'altro rifiuta di scrivere qualsiasi cosa e restituisce una distribuzione. Confrontarli sulla qualità è privo di senso; confrontarli su quanto ti costano da eseguire e su ciò a cui possono essere affidati è l'esercizio onesto.

Entrambi sono stati rilasciati senza annuncio, che è l'altra cosa che hanno in comune. Nessuno dei due ha una voce su Artificial Analysis, un punteggio nell'arena o una singola valutazione indipendente. Ogni cifra riportata di seguito — la scala SWE-bench da un lato, le righe di calibrazione Brier ed ECE dall'altro — è stata prodotta dal laboratorio che ha addestrato il modello, sul suo stesso harness, e non ha mai incontrato un set di test che non provenisse da lì.

Il fork è avvenuto prima che esistesse uno dei due modelli

Il checkpoint di base è un modello denso ibrido a 32 livelli Gated DeltaNet e gated-attention, ed entrambi i derivati ne ereditano lo scheletro. Dopodiché le due pipeline di post-addestramento non hanno nulla in comune.

La pipeline di Microsoft è un ciclo chiuso. TaskPilot genera task di repository candidati da snapshot reali, esegue rollout dal checkpoint corrente per trovare quelli che la policy a volte risolve, li mantiene e addestra. Cinque iterazioni, ciascuna calibrata rispetto alla policy dell'iterazione precedente, che terminano al 61,5% su SWE-bench Verified e al 37,6% su SWE-bench Pro. Nessuna distillazione — la scheda afferma che nessuna traiettoria, azione o traccia di ragionamento di modelli più forti è stata utilizzata come target.

La pipeline di InternLM è un singolo obiettivo supervisionato su una forma di task fissa. Al modello vengono forniti un system prompt, uno stato, uno schema decisionale e uno scheletro JSON completo dell'assistente con un segnaposto per ogni campo. Esegue un singolo passaggio forward causale, legge i logits in corrispondenza di ciascun segnaposto e applica un softmax solo sui simboli candidati consentiti per quel campo. La scheda di InternLM lo dichiara apertamente: questo percorso "non chiama generate() né campiona testo libero."

Quella differenza non è una differenza di scala. È una differenza in ciò che l’artefatto stesso è. FrogNano-4B-2609 è un agente che può sbagliare in cento modi interessanti e può essere corretto dai test. Intern-Decision-4B è uno scorer il cui modo di fallire è un numero sicuro di sé.

Due contratti, e nessuno dei due è "invia un prompt"

FrogNano's contract is a loop. The model emits calls to Read, Write, Edit, Glob and Bash; the Leaf harness executes them inside an isolated repository sandbox and returns the output; the loop continues until the model stops calling. Evaluations ran at 150 steps inside roughly 131K combined tokens, with up to 8,192 generated tokens per assistant turn. Serving needs SGLang with a Qwen3 reasoning parser and a Qwen3 coder tool-call parser — get that wrong and the model produces prose where the harness expects JSON, which from the outside looks exactly like a broken model.

Il contratto di Intern-Decision-4B prevede un solo passaggio, con un limite rigido. Domande e opzioni mantengono il loro ordine. Le opzioni sono mappate su simboli da un solo token — A fino a Z, poi a fino a z, poi 0 fino a 9, che è la ragione aritmetica per cui una domanda arriva al massimo a 62 opzioni. Il tetto massimo del wrapper è di 8.192 token e la scheda di InternLM è esplicita sul fatto che gli input più lunghi vengono rifiutati senza troncamento. Sono supportati tre tipi di domanda: choice con una mappa ordinata di criteri, score con un elenco o una mappa con chiavi numeriche, e noul, un binario. Sono consentite fino a otto immagini e i loro token rientrano nel conteggio degli stessi 8.192.

• Formato dell'output — FrogNano-4B-2609 emette chiamate di strumenti, testo di ragionamento e una patch. Intern-Decision-4B emette un simbolo per campo e nient'altro.

• Determinismo — FrogNano campiona a temperatura 0,6 su tre seed, quindi è probabilistico per scelta progettuale. L'argmax di Intern-Decision-4B è fissato dal forward pass; la temperatura adattata ne modifica solo la confidenza.

• Superficie di fallimento — FrogNano può allucinare un'API, ampliare eccessivamente una modifica, oppure superare i test introducendo una vulnerabilità, tutte cose che la sua scheda nomina. Intern-Decision-4B non può allucinare una risposta, perché può solo scegliere tra le opzioni che gli hai fornito — può solo essere mal calibrato.

• Tetto di input — circa 131K token complessivi per FrogNano nella sua configurazione valutata, rispetto a un limite rigido di 8.192 per Intern-Decision-4B, ovvero un fattore sedici, e non c'è alcun modo di aggirarlo.

• Struttura dei costi — FrogNano fattura per traiettoria, e le traiettorie sono lunghe. Intern-Decision-4B non ha alcun token di output da fatturare.

• Parametri — la scheda FrogNano fornisce una fascia "500M-5B" e descrive approssimativamente 4,66B, con un download BF16 da 9,32 GB; Intern-Decision-4B è indicato a 4,54B con una torre di visione da 612 MB e un proiettore da 54 MB insieme ai suoi shard linguistici.

Il numero che decide questo abbinamento

La scheda di InternLM colloca Intern-Decision-4B a 44,16 ms di latenza media e 44,03 ms di mediana su una singola RTX 4090 lungo il percorso locale di Hugging Face, con un P95 di 44,60 ms. Rileggete quella forbice: dalla mediana alla coda c'è ben meno di un millisecondo, perché un forward pass a forma fissa non ha quasi nulla da variare. È tutto qui l'argomento a favore dell'architettura.

La cifra corrispondente di FrogNano non è in millisecondi. Le sue valutazioni hanno consentito un budget di 150 passi con un tetto di 10.800 secondi per agente per attività. Quelle non sono unità comparabili e non dovrebbero mai essere messe nella stessa frase di un'affermazione sulla latenza — ma ti dicono comunque la forma del compromesso. Un modello risponde a una decisione in quarantaquattro millisecondi e l'altro impiega minuti di chiamate agli strumenti inseguendo una patch. Se il tuo problema è «instradare questo ticket verso una delle sei code e dirmi quanto sei sicuro», il primo non è una versione più economica del secondo, è una macchina diversa.

Entrambi i laboratori si sono misurati con attenzione, ed entrambi i gruppi di misurazioni dovrebbero essere letti come intenzioni piuttosto che come risultati. InternLM riporta una media su sette set di 90,02 con un Brier score di 0,347 e un errore di calibrazione atteso di 0,065, adattato a una temperatura di 1,99241824 su 1.728 casi di calibrazione designati. Microsoft riporta una salita di cinque iterazioni dal 39,4% al 61,5% su SWE-bench Verified, e l'appendice dello stesso articolo riporta quella stessa progressione come 48,2%, 53,4%, 58,3%, 58,6% e 61,6% — un promemoria che anche all'interno di un solo laboratorio, lo stesso fatto misurato in due modi produce due scale.

A generated two-column scoreboard titled 'FrogNano-4B-2609 vs Intern-Decision-4B'. The left column reads Output tool calls and patch, Latency minutes per trajectory, Context about 131K evaluated, Independent evals none, Base Qwen3.5-4B, and Score 61.5% SWE-bench Verified vendor. The right column reads Output one symbol per field, Latency 44.16 ms mean, Context 8,192 tokens rejected above, Independent evals none, Base Qwen3.5-4B, and Score 90.02 seven-set average vendor. A footer reads 'Both scoreboards vendor-reported; no third party has reproduced either.'

L'indizio sta in ciò su cui ogni carta sceglie di avvertirti

Entrambe le schede sono insolitamente oneste, e l'onestà punta in direzioni opposte — che è la cosa più utile in questo confronto.

La sezione sulle limitazioni note di Microsoft suona come un avvertimento sul deployment. Solo inglese e Python. Prestazioni sensibili all'harness e alla qualità dei test. Patch che possono essere errate o non sicure pur superando i loro test. La frase della scheda stessa è che FrogNano «non dovrebbe essere considerato allineato alla sicurezza in modo indipendente per un deployment autonomo senza restrizioni», e indica la lacuna specifica: il post-training specifico per l'agente non ha usato dati di preferenza per la sicurezza, di rifiuto o avversariali, perché ha invece ottimizzato la correttezza funzionale e l'evitamento delle regressioni. Inoltre dichiara spontaneamente il tasso dell'1,71% di chiamate parallele agli strumenti, il che significa che il modello quasi mai attiva due strumenti in un solo turno nonostante l'harness lo consenta — una vera regressione di capacità rispetto al modello di base, che il team ha cercato di recuperare aggiungendo una fase di consolidamento.

La scheda di InternLM mette in guardia dalla classe opposta di cose. Non c'è alcuna superficie di allucinazione di cui avvertire, quindi le avvertenze riguardano gli input: il rifiuto a 8.192, il tetto di 62 opzioni, il fatto che la torre di testo sottostante dichiari un limite di posizione di 262.144 token che il wrapper rilasciato si rifiuta di usare. Il suo rischio è che ci si fidi di un numero sicuro più di quanto meriti, e la scheda è schietta nel dire che la calibrazione riduce un divario con la baseline Jev senza colmarlo su ogni slice.

Letti insieme, descrivono due diverse posture di fiducia. FrogNano ha bisogno di supervisione perché agisce. Intern-Decision-4B ha bisogno di un audit perché assegna un punteggio — e un numero che influenza una decisione di produzione è esattamente il tipo di output che nessuno pensa di testare.

Dove si colloca un router, e una nota sincera su entrambi

Nessuno dei due modelli è un endpoint ospitato. FrogNano viene distribuito come pesi più un harness di valutazione Kubernetes; Intern-Decision-4B viene distribuito come una classe Python che si importa dopo aver scaricato quattro shard. Per un team che vuole provare l'uno o l'altro davanti a qualcosa di reale, lo schema sicuro è lo stesso per entrambi e non è affascinante: mettere il componente sperimentale dietro un fallback, così che una traiettoria negativa o una giornata mal calibrata costi un nuovo tentativo anziché un incidente.

Questo schema è esattamente ciò a cui serve un livello di routing. OrcaRouter esegue oltre 200 modelli dietro un'unica chiave compatibile con OpenAI con markup dello 0% — il prezzo di listino del provider passato tal quale, così una variazione di prezzo del fornitore arriva dalla nostra parte lo stesso giorno — e il suo failover si colloca davanti al modello generalista su cui ripieghi, non davanti a questi due. Per dirla chiaramente: non distribuiamo FrogNano-4B-2609 né Intern-Decision-4B, e non esiste una data per nessuno dei due. Ciò che un endpoint unico ti offre qui è che il confronto stesso diventa economico — una sola credenziale, una sola riga di fatturazione e nessuna seconda integrazione ogni volta che cambi il modello generalista rispetto al quale stai valutando lo specialista.

A screenshot of the internlm/Intern-Decision-4B model card on Hugging Face showing the model heading and the Qwen3.5-4B base-model line, the five-step explanation of how inference works (single-token symbol mapping, one causal forward pass, a softmax over each field's allowed symbols and the checkpoint's probability calibration), the Benchmark results table listing Intern-Decision-0.8B, Intern-Decision-2B and Intern-Decision-4B against the Jev, Laya, SemIf, Kev and JevK5 comparison rows, and the inference latency table with the 4B row at 44.16 ms mean, 44.03 ms median and 44.60 ms P95.

Quale, e quando

Usa Intern-Decision-4B quando la risposta esiste già nel tuo prompt e ti serve che venga scelta, con un livello di confidenza associato, a una velocità di migliaia al secondo. Routing a tassonomia fissa, valutazione tramite rubric, estrazione vincolata allo schema, moderazione rispetto a un insieme chiuso di etichette. Il forward pass da 44 millisecondi e il costo zero in token di output sono il prodotto, e la calibrazione è ciò che va verificato prima di fidartene.

Prendi FrogNano-4B-2609 quando la risposta non esiste ancora e deve essere scoperta leggendo un repository ed eseguendone i test. È un processo di alcuni minuti, in sandbox e revisionabile, e il 61,5% su SWE-bench Verified — riportato dal fornitore, non riprodotto — è la migliore prova attuale che un checkpoint da 4B possa farlo, in assoluto.

Ciò che non dovrebbe passare in nessuno dei due casi è l'abitudine di confrontare i loro punteggi. Una media di 90,02 su sette set e un tasso del 61,5% su SWE-bench Verified sono misurazioni di due domande diverse, prodotte da due laboratori, su due sistemi di valutazione, e nessuno dei due numeri è passato per le mani di una terza parte. Condividono un antenato e nient'altro.

A screenshot of the file listing for the microsoft/FrogNano-4B-2609 repository on Hugging Face showing the model header with its size and the Safetensors, qwen3_5 and license:mit tags, the two safetensors shards model-00000-of-00002 and model-00001-of-00002, the config, tokenizer, vocab, merges, chat template and preprocessor files, and the commit column listing 'Update README.md', 'Upload FrogNano 4B SWE checkpoint' and 'Update FrogNano 4B README.md' across two contributors and four commits.

L'unica previsione davvero utile dell'antenato condiviso: poiché entrambi i modelli partono dallo stesso checkpoint 4B, la differenza tra loro sta quasi interamente nel post-training, il che significa che la domanda interessante per chiunque costruisca su Qwen3.5-4B è quale di queste due strutture di ricompensa si trasferisca al proprio dominio. Un ciclo di attività sintetiche che si calibra rispetto alla propria policy, oppure una testa di scoring a forma fissa con una temperatura adattata. Queste sono due ricette, entrambe pubblicate, entrambe provenienti da laboratori che non hanno ancora permesso a nessun altro di eseguirle. È una situazione rara e vale la pena osservarla anziché abboccare.