
FrogNano-4B-2609 vs LFM2.5 2.6B Base: uno specialista finito e un sacco di pesi preaddestrati
- openaiNUOVOOpenAI: GPT-6.1 Sol2026-09-2952Intelligenza
- anthropicNUOVOAnthropic: Claude Sonnet 5.52026-09-2856Intelligenza
- typesafeNUOVOTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 per 1M di token · 219 tok/s
- OpenAINUOVOOpenAI: GPT-6 Luna2026-09-2238Intelligenza
- OpenAINUOVOOpenAI: GPT-6 Sol2026-09-2248Intelligenza
- AnthropicNUOVOAnthropic: Claude Opus 5.52026-09-2258Intelligenza
- xAINUOVOGrok 4.72026-09-2146Intelligenza
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 per 1M di token · 114 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1M di token · 1064 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligenza
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Intelligenza77Codice
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Intelligenza76Codice
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Intelligenza76Codice
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Intelligenza82Codice
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 per 1M di token · 41 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1M di token · 105 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligenza72Codice
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1M di token · 213 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Intelligenza75Codice
- obsidianQwen3.8 27B2026-08-1534Intelligenza68Codice
Digita una domanda in LFM2.5 2.6B Base e continuerà la tua frase invece di rispondere. Non è un difetto: Liquid AI lo ha pubblicato come checkpoint pre-addestrato alla base della famiglia LFM2.5, con l'instruction tuning deliberatamente lasciato al suo sibling non-Base, e la scheda dice chiaramente che è pensato per un fine-tuning intensivo. FrogNano-4B-2609 di Microsoft è l'aspetto dell'altro capo di quella pipeline: lo stesso tipo di piccolo modello linguistico, sottoposto a cinque iterazioni di reinforcement learning su compiti sintetici di repository fino a emettere chiamate a strumenti strutturate e patch candidate tramite un harness a cinque strumenti. Nessuno dei due ha un benchmark indipendente pubblicato. La differenza è che uno dei due ha completato il proprio post-training, e sapere quale sia è l'intera decisione.
I dati FrogNano riportati di seguito provengono dalla scheda del modello e dal rapporto tecnico di Microsoft. I dati LFM provengono dalla scheda di Liquid AI, dalla sua configurazione dell'architettura e dal suo file di licenza. Ogni numero attribuito all'una o all'altra azienda è etichettato come dichiarato dall'azienda, e nessuno di questi modelli è stato sottoposto alla valutazione di terzi — per LFM2.5 2.6B Base ciò è in gran parte intenzionale, poiché un checkpoint senza messa a punto per le istruzioni non è un obiettivo equo per un benchmark di chat.
Il confronto funziona solo se sai cosa stai confrontando
Metti le due schede tecniche una accanto all’altra e la prima cosa che non torna è il conteggio dei parametri. LFM2.5 2.6B Base è composto da 2,69 miliardi di parametri densi in 30 livelli — 22 blocchi a convoluzione breve a doppio gate e 8 livelli di attenzione con query raggruppate, addestrato su circa 34 trilioni di token in 16 lingue, con un vocabolario di 128.000 token e una finestra di contesto di 131.072 token. La sua build quantizzata si attesta intorno a 1,67 GB in Q4_K_M.
La scheda di FrogNano-4B-2609 indica il campo dei parametri come la fascia "500M-5B", e il riepilogo del modello lo descrive come circa 4,66 miliardi. Il download risolve la questione: due shard safetensors per un totale di 9,32 GB di pesi BF16, 738 tensori, su uno stack ereditato di Gated DeltaNet e gated attention, ibrido denso a 32 livelli. Nel checkpoint è presente un vision tower a 24 livelli, che non è mai stato sottoposto a post-training.
Quindi il rapporto dimensionale è all'incirca di 1,7 a uno, mentre il rapporto di memoria è più vicino a 5,6 a uno una volta che si considera la quantizzazione. Quel divario conta più della riga dei parametri, perché entrambi questi modelli sono potenziali candidati all'auto-hosting anziché endpoint — ed è l'unico motivo per cui figurano nello stesso articolo.
• Uso previsto — LFM2.5 2.6B Base è materiale grezzo per un'esecuzione di fine-tuning. FrogNano-4B-2609 è una policy finita per l'ingegneria del software a livello di repository all'interno dell'harness Leaf.
• Seguito delle istruzioni — LFM2.5 2.6B Base non ne offre alcuno di default; la scheda di Liquid AI lo consiglia per attività che richiedono un fine-tuning intensivo. FrogNano-4B-2609 segue una descrizione di attività ed emette chiamate agli strumenti strutturate, perché è esattamente ciò su cui è stato addestrato il suo obiettivo RL.
• Contesto — 131.072 token per LFM2.5 2.6B Base, contro circa 131K token complessivi per la configurazione valutata di FrogNano. Nominalmente identiche, ma la finestra di FrogNano deve contenere risultati degli strumenti, output della shell e log dei test, non solo un prompt.
Limite di output — la configurazione convalidata di FrogNano consente 8.192 token generati per turno dell'assistente. LFM2.5 2.6B Base non ne pubblica uno equivalente, poiché non è progettato per concludere una risposta.
• Modalità — entrambi sono solo testo. I componenti di visione di FrogNano sono ereditati ed esplicitamente non supportati; LFM2.5 2.6B Base è text-in, text-out per costruzione.
• Licenza — LFM2.5 2.6B Base è distribuito con la LFM Open License v1.0, che è gratuita al di sotto dei 10 milioni di dollari di fatturato annuo e richiede una licenza separata a partire da tale soglia, con le opere derivate che ereditano il limite. La scheda di FrogNano indica MIT nella sua parte introduttiva e Apache 2.0 nel corpo.
La cosa per cui Microsoft ha pagato, e la cosa per cui dovresti pagare tu stesso
Questa è la sezione portante, perché è quella in cui un confronto tra specifiche trae in inganno.
L'intero valore aggiunto di FrogNano-4B-2609 sta nel post-training, e Microsoft ha pubblicato il metodo. Si parte da Qwen3.5-4B, che ha ottenuto il 39,4% su SWE-bench Verified tramite l'harness Leaf come modello generale. Genera task di repository candidati da snapshot reali, esegui rollout dal checkpoint corrente per trovare i task che riesce a risolvere a volte, conserva quelli, addestra e ripeti — cinque iterazioni, circa 1.500 ambienti sintetici validati in totale, e nessuna distillazione da un modello più grande in nessun momento. Il risultato sulla scheda ufficiale di Microsoft è 61,5% su SWE-bench Verified, 37,6% su SWE-bench Pro, 31,1% su Terminal-Bench 2.0 e 47,3% su PatchEval-Verified. L'appendice sull'efficienza del paper riporta la stessa ascesa come 48,2%, 53,4%, 58,3%, 58,6% e 61,6% attraverso le iterazioni, il che è un utile promemoria del fatto che persino le due tabelle dello stesso esperimento del laboratorio non concordano sui gradini.
Ora leggete quanto sopra confrontandolo con LFM2.5 2.6B Base. È il checkpoint prima che quel lavoro inizi. La raccomandazione della sua scheda — eseguirne il fine-tuning — è esattamente il lavoro che FrogNano documenta: un ambiente di task, una ricompensa eseguibile, un harness con tempi di serving più lunghi e diverse iterazioni di addestramento contro una policy in evoluzione. L'articolo non sostiene che sia facile. Riporta che i checkpoint intermedi sono diventati progressivamente più costosi da addestrare man mano che le tracce di ragionamento si allungavano, che è stato necessario aggiungere una penalità sulla lunghezza dei log per fermare la deriva e che le iterazioni successive hanno perso la capacità di chiamata parallela degli strumenti che aveva il modello base, finendo con un tasso di chiamate concorrenti dell'1,71%. Chiunque pianifichi di eseguire la ricetta FrogNano su una base 2.6B diversa dovrebbe preventivare specificamente quei tre problemi.
Ciò che LFM2.5 2.6B Base offre è un tipo diverso di vantaggio iniziale: un budget di pretraining di 34 trilioni di token, un'architettura ibrida documentata, una build quantizzata già esistente e un contesto documentato di 131.072 token, il tutto a una dimensione che gira su hardware sul quale un checkpoint BF16 da 9,32 GB non entrerebbe. Se il tuo compito è abbastanza ristretto che un piccolo fine-tune batte un modello generale, quella è una posizione reale — e se non lo è, ti sei risparmiato un ciclo di addestramento.

Quello che devi costruire in ogni caso
Nessuno dei due è una chiamata di rete, e questo plasma il confronto pratico più di qualsiasi riga di specifiche.
LFM2.5 2.6B Base richiede un runtime di inferenza e un'esecuzione di addestramento. La card di Liquid AI elenca build in formato nativo, GGUF, ONNX e MLX, quindi la metà serving è ben coperta — llama.cpp su un laptop è un'opzione concreta per il checkpoint quantizzato. La metà addestramento è tua: dati, obiettivo, valutazione e un modo per capire se il risultato è migliorato o è solo diverso.
FrogNano-4B-2609 vuole un endpoint compatibile con OpenAI con i parser corretti e un cluster Kubernetes con il permesso di gestire pod e network policy. Il README di Microsoft è insolitamente esplicito sul fatto che l'harness è una dipendenza, non una comodità, e la scheda dichiara che punteggi identici richiedono un checkpoint, un tokenizer, una configurazione di serving, immagini delle attività e un protocollo di valutazione corrispondenti. La configurazione qui non è un dettaglio: servilo senza un parser di reasoning Qwen3 e un parser di tool-call di Qwen3 coder e il modello scrive prosa dove l'harness si aspetta una tool call.
Questa è la forma di questo confronto: da un lato, un progetto di training con un piccolo problema di serving; dall'altro, un progetto di serving con un grande problema di valutazione e niente più training da fare. Entrambi sono serate di lavoro. Solo uno dei due è una serata di lavoro che può finire con "il modello non è abbastanza buono" senza che sia colpa tua.

Dove un router si guadagna il suo posto in una build come questa
Entrambi questi modelli finiscono dentro una pipeline che chiama anche qualcosa di ospitato. Il banco di valutazione di FrogNano stesso ne è la prova: l'harness Leaf comunica con un endpoint compatibile con OpenAI, il che significa che il modello in prova e qualsiasi modello con cui lo confronti vengono raggiunti attraverso la stessa interfaccia. È un pattern che vale la pena copiare anche quando la ragione è solo l'igiene, ed è qui che un unico endpoint fa qualcosa di concreto.
OrcaRouter offre oltre 200 modelli dietro un'unica chiave compatibile con OpenAI con markup dello 0%, quindi i prezzi di listino dei fornitori passano invariati e una variazione di prezzo di un fornitore è attiva dalla nostra parte lo stesso giorno — ed è proprio il dato che cambia davvero quando devi decidere se uno specialista self-hosted batte un modello generalista ospitato sul costo per attività. Il failover automatico copre la metà ospitata di questo confronto, non il checkpoint che stai servendo tu stesso. Non ospitiamo FrogNano-4B-2609 né LFM2.5 2.6B Base; entrambi sono download. Ciò che un livello di routing elimina è la seconda integrazione ogni volta che la metà ospitata del tuo benchmark cambia.
Sceglierne uno, onestamente
Scegli LFM2.5 2.6B Base se il tuo compito è ristretto, il tuo hardware è limitato e sei pronto a gestire tu stesso il training run — la licenza è gratuita sotto i 10 milioni di dollari di fatturato, la build quantizzata è di 1,67 GB, e la scheda di Liquid AI stessa lo consiglia esattamente per questo. Il compromesso è che ottieni un punto di partenza, non una capacità: nulla nella release ti dice quanto otterrebbe un RL run a forma di FrogNano costruito sopra di esso, e nessuno ne ha pubblicato uno.
Scegli FrogNano-4B-2609 se il compito è ingegneria del software a livello di repository e vuoi che il post-training sia già fatto. Il 61,5%, il 37,6%, il 31,1% e il 47,3% sono risultati autentici pubblicati da un laboratorio che ha descritto il proprio metodo in dettaglio — e sono anche, in questo momento, un circuito chiuso: stesso laboratorio, stesso harness, stessa baseline del modello base. Il download da 9,32 GB, la dipendenza dall'harness e la licenza composta sono il prezzo per saltare un progetto di training che altrimenti dovresti eseguire.

La riformulazione utile è che questi non sono concorrenti. LFM2.5 2.6B Base è a monte di un processo che ha prodotto qualcosa di simile a FrogNano-4B-2609. Se ti trovi a scegliere tra i due, la vera domanda è se vale la pena gestire in proprio un'esecuzione di addestramento per il tuo problema — e se la risposta è no, il checkpoint 4B con l'harness, il metodo pubblicato e la scala SWE-bench riportata dal fornitore è quello che arriva già pronto.
