
Intern-Decision-0.8B vs LFM2.5 2.6B Base: due modi per costruire qualcosa da soli
- typesafeNUOVOTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 per 1M di token · 592 tok/s
- openaiNUOVOOpenAI: GPT-6 Luna2026-09-2237Intelligenza
- openaiNUOVOOpenAI: GPT-6 Sol2026-09-2248Intelligenza
- anthropicNUOVOAnthropic: Claude Opus 5.52026-09-2258Intelligenza
- grokNUOVOGrok 4.72026-09-2146Intelligenza
- OrcaNUOVOOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 per 1M di token · 187 tok/s
- orcaNUOVOOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1M di token · 1306 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligenza
- openaiOpenAI: GPT-6 Astra2026-09-0453Intelligenza77Codice
- googleGoogle: Gemini 3.8 Flash2026-09-0241Intelligenza76Codice
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Intelligenza76Codice
- anthropicAnthropic: Claude Fable 5.12026-09-0153Intelligenza82Codice
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1M di token · 113 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligenza72Codice
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1M di token · 224 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Intelligenza75Codice
- obsidianQwen3.8 27B2026-08-1534Intelligenza68Codice
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Intelligenza69Codice
- grokSpaceXAI: Grok 4.62026-08-1244Intelligenza77Codice
- metaMeta: Muse Spark 1.22026-08-0540Intelligenza72Codice
Metti Intern-Decision-0.8B accanto a LFM2.5 2.6B Base e la prima osservazione onesta è che nessuno dei due è un prodotto nel senso in cui di solito lo intende un acquirente. Intern-Decision-0.8B è il checkpoint che InternLM ha caricato su Hugging Face il 26 settembre 2026 senza alcun annuncio — un fine-tuning da 852.985.920 parametri di Qwen3.5-0.8B che risponde a domande digitate e non emette testo, distribuito con licenza Apache 2.0 con un link a GitHub che restituisce 404. LFM2.5 2.6B Base è il checkpoint testuale pre-addestrato da 2,69 miliardi di parametri di Liquid AI, pubblicato il 1º agosto 2026 come base per la famiglia LFM2.5, e la sua stessa scheda dice che è «consigliato solo per attività che richiedono un fine-tuning intenso». Uno è finito e ristretto. L'altro è incompiuto e generale. Entrambi presuppongono che sia tu a fare il lavoro — e il lavoro non è lo stesso lavoro.
Questa distinzione è l'intero confronto, ed è il motivo per cui una tabella di specifiche diretta sarebbe fuorviante. La domanda che un lettore ha davvero è «quale di questi devo scaricare?», e la risposta dipende dal fatto che ciò che devi costruire sia uno strato decisionale o una capacità linguistica. Sono progetti diversi con tempistiche diverse.
Cosa ti offre ciascun modello
Intern-Decision-0.8B arriva come un sistema funzionante. Il repository fornisce inference.py, una classe DecisionEngine, uno schema di richiesta documentato e uno schema di risposta, e un esempio funzionante che puoi eseguire dopo aver installato quattro dipendenze Python bloccate. Fornisci uno stato, da una a sedici domande nominate con un massimo di 62 opzioni ciascuna, e facoltativamente fino a otto immagini, e ricevi una distribuzione calibrata più un'etichetta argmax per campo. Il motore legge i logit in posizioni fisse in uno scheletro pre-renderizzato invece di generare qualsiasi cosa, quindi non c'è alcuna fase di decodifica, né token di output, né JSON da riparare. Funziona da circa 1,73 GB di file.
LFM2.5 2.6B Base ti offre l'opposto: capacità grezza senza interfaccia. È un modello linguistico causale solo testo con 30 livelli disposti come 22 blocchi a convoluzione breve a doppio gating e 8 livelli di grouped-query attention, pre-addestrato su circa 34 trilioni di token in 16 lingue, con un vocabolario di 128.000 token e una finestra di contesto di 131.072 token. Non ha un proprio instruction tuning né benchmark di attività riportati sulla scheda, perché un checkpoint base non viene valutato — lo sono i modelli che addestri a partire da esso. È la pipeline di post-training di Liquid a trasformarlo nell'agentico LFM2.5-2.6B, e quella pipeline è ciò che ti viene chiesto di riprodurre, parzialmente o integralmente, per il tuo dominio.
Quindi l'asse non è la dimensione. È se il pezzo mancante è un contratto decisionale o un'esecuzione di addestramento.
Il tabellone, con le avvertenze accluse
• Tempo al primo risultato — Intern-Decision-0.8B: un pomeriggio, caricando un checkpoint e chiamando predict()/. LFM2.5 2.6B Base: per tutto il tempo che richiede la tua esecuzione di pre-training continuato o SFT, più il lavoro sui dati per prepararlo.
• Parametri — Intern-Decision-0.8B: 852.985.920 su uno shard linguistico da 1,50 GB, uno shard di visione da 176 MB e un proiettore da 25 MB. LFM2.5 2.6B Base: 2,69B, circa 2,5 GB di pesi.
• Modalità di input — Intern-Decision-0.8B: testo più fino a otto immagini, con pesi di visione presenti nel repository. LFM2.5 2.6B Base: solo testo, per scelta progettuale — il lavoro multimodale nella famiglia LFM2.5 risiede nelle varianti VL.
• Contesto pratico — Intern-Decision-0.8B: 8.192 token, rifiutato anziché troncato, nonostante un embedding di posizione massimo di 262.144 nella configurazione. LFM2.5 2.6B Base: 131.072 token nativi.
• Output — Intern-Decision-0.8B: una distribuzione di probabilità calibrata e un'etichetta argmax per campo, deterministico. LFM2.5 2.6B Base: testo continuato, campionato.
• Benchmark — Intern-Decision-0.8B: una tabella completa del fornitore su sette benchmark, non riprodotta da nessuno. LFM2.5 2.6B Base: nessuno pubblicato per la base stessa, per scelta progettuale.
• Licenza — Intern-Decision-0.8B: Apache 2.0, con un LICENSE-QWEN/ conservato per i pesi upstream. LFM2.5 2.6B Base: LFM Open License v1.0.

La riga della licenza merita una propria sezione
Entrambe le schede dicono «open», e le due parole significano cose sostanzialmente diverse. Intern-Decision-0.8B è Apache 2.0 — nessuna condizione sui ricavi, nessuna restrizione sul campo di utilizzo, nessuna concessione commerciale separata da negoziare. Il secondo file di licenza nel repository è la licenza Qwen riportata perché il modello è un derivato di Qwen3.5-0.8B, il che è la gestione corretta anziché una limitazione.
LFM2.5 2.6B Base è distribuito con la LFM Open License v1.0, e vale la pena leggere integralmente la sezione 5 di tale licenza prima che qualsiasi piano commerciale vi faccia affidamento. I diritti concessi per l'Uso Commerciale sono subordinati alla condizione che tu o la tua entità giuridica non superiate una soglia definita nella licenza come ricavi annui pari o superiori a 10 milioni di dollari USA. Al di sopra di tale soglia, l'uso commerciale dell'opera o di un derivato non è concesso in licenza ai sensi dell'accordo. L'uso senza scopo di lucro e di ricerca è escluso. Si tratta di un confine reale e applicabile e, poiché si applica anche alle opere derivate, si propaga a qualsiasi cosa di cui tu faccia il fine-tuning a partire dalla base — che è l'intero uso previsto di questo checkpoint.
C'è una lettura semplice qui: se stai costruendo a scopo commerciale e la tua entità supera i $10M di fatturato annuo, LFM2.5 2.6B Base non è lo stesso tipo di asset di Intern-Decision-0.8B, indipendentemente da come si comportano i due. Se sei sotto la soglia, fai ricerca o fine-tuning per uno scopo non commerciale, la distinzione non fa presa. In ogni caso, è una domanda a cui rispondere prima dell'esecuzione di addestramento, non dopo.
Dove ciascuno è effettivamente il download giusto
LFM2.5 2.6B Base è la scelta giusta quando la capacità di cui hai bisogno non esiste ancora in un modello finito. La scheda di Liquid elenca esplicitamente i casi previsti: assistenti specifici per una lingua come il giapponese, assistenti specifici per un dominio come quello medico, l'addestramento su dati proprietari che non puoi inviare a un'API, o la sperimentazione di approcci innovativi al post-training. Il ragionamento alla base di questo elenco è che 34 trilioni di token di pre-addestramento multilingue sono costosi da riprodurre e quasi gratuiti da ereditare: stai acquistando un punto di partenza già competente in 16 lingue e con un contesto di 128K, e investi la tua potenza di calcolo sulla parte che è specifica per te.
Il supporto dell'ecosistema per quel piano è insolitamente completo per l'epoca. Liquid documenta il pre-training di continuazione, DPO e GRPO tramite Unsloth e TRPO, con notebook per ciascuno, e il checkpoint è supportato da Transformers, vLLM, SGLang, llama.cpp, MLX e LM Studio. Non è un testo pubblicitario — è la differenza tra un modello base che puoi fine-tunare questa settimana e uno che passi due settimane a incollare in un trainer.
Intern-Decision-0.8B è la scelta giusta quando la capacità di cui hai bisogno esiste già e il problema è la sua forma. Se il tuo compito è una decisione circoscritta con un insieme chiuso di risposte — instrada questo ticket, valuta questo claim, classifica questo record in base a una rubrica — allora un modello generativo è un modo goffo per ottenere un'etichetta, e un modello base non è affatto un modo per ottenerla. Quello che vuoi è qualcosa che restituisca la distribuzione, ti dica la sua confidenza e lo faccia negli stessi 34 millisecondi ogni volta. La latenza misurata di InternLM su una singola RTX 4090 è 33,98 ms di media con un p95 di 37,50 ms, e i dati della scheda stessa mostrano il fratello 2B a 33,28 ms di media — un promemoria del fatto che, con queste lunghezze di prompt, il costo sta nel leggere lo schema, non nell'eseguire i pesi.
Lo scambio che stai facendo è flessibilità in cambio di un contratto. Un modello di base può diventare qualsiasi cosa, prima o poi, se hai i dati e la potenza di calcolo. Una testa decisionale è già quella cosa, e non diventerà mai nient'altro. Se il tuo schema cambia forma ogni mese, quello è un costo reale. Se non lo fa, non è affatto un costo.
Quello che nessuno può dirti sulla tabella Intern-Decision
Ogni numero di prestazione di Intern-Decision-0.8B è dichiarato dal fornitore, e l'avvertenza qui è più pesante del solito perché il rilascio risale a una settimana fa ed è completamente privo di documentazione. Non esiste alcun articolo scientifico, nessuna raccolta che riunisca le tre dimensioni, nessun repository GitHub funzionante e nessuna valutazione indipendente. Una ricerca su Artificial Analysis non restituisce nulla per il modello.
InternLM ha selezionato i benchmark, ha selezionato i modelli di confronto — un insieme dominato da modelli decisionali tra cui Jev di TypeSafe, Laya e Kev di Convai — e ha pubblicato la tabella senza un post di lancio.

Con quell'etichetta apposta, la forma vale comunque la pena di essere letta. Intern-Decision-0.8B registra 97.92 / 80.56 / 52.25 sulle tre split di Jevbench, 77.35 su Typed Decision e 94.52 su ToolACE, con una media di 79.38. Il suo profilo di calibrazione è la voce più interessante: un Brier di 0.530 e un errore di calibrazione atteso di 0.066, che è un ECE migliore di quello di Jev, 0.095, nonostante un Brier peggiore. In termini semplici, è meno accurato ma più onesto su quanto sia accurato, e per un flusso di lavoro basato su soglie questo ordinamento conta più della media. La colonna che dovrebbe bloccare una messa in produzione è WildJailBreak a 64.48 contro il 96.29 di Jev. Un deficit di robustezza al rifiuto così grande è una proprietà del fine-tuning, e se appartenga alla base Qwen3.5-0.8B, all'obiettivo di decision-tuning o al numero di parametri non è documentato da nessuna parte sulla scheda.
Il confronto con LFM.5 2.6B Base su questo asse non è «chi ottiene un punteggio più alto», perché la base non ha punteggi. È che i numeri di un modello non sono verificati e i numeri dell'altro modello non esistono, e un lettore che sceglie tra loro sta scegliendo con quale tipo di incognita lavorare.
La pipeline che la maggior parte delle persone finisce effettivamente per costruire
Esiste una configurazione che usa entrambi, e vale la pena darle un nome perché è lì che approdano la maggior parte dei sistemi di produzione. Il livello decisionale gestisce le chiamate chiuse — triage, routing, valutazione con rubriche — dove l'insieme delle risposte è noto, la latenza si accumula su un milione di record e i token di output sono puro sovraccarico. Il livello linguistico gestisce tutto ciò che richiede prosa, sintesi o contesto lungo: il riepilogo di escalation, la spiegazione associata all'etichetta, la bozza che un umano modifica. LFM2.5 2.6B Base è un substrato plausibile per la seconda metà se hai dati di dominio su cui vale la pena addestrare; una testa decisionale è la forma naturale della prima.
Combinare i due è la parte più complicata, ed è la parte che vale la pena non costruire a mano. Il DSL di routing di OrcaRouter esprime il routing come codice — YAML con condizioni CEL, distribuito senza un nuovo deploy — così una pipeline che invia una classe di richieste a un endpoint decisionale e un'altra a un modello linguistico è una regola di routing anziché un load balancer che devi mantenere tu. Il gateway copre oltre 200 modelli dietro un'unica chiave compatibile con OpenAI, con il prezzo di listino del provider passato senza alcun ricarico, e non aggiunge alcun ricarico sul modello che scegli. Per essere precisi sul confine: né Intern-Decision-0.8B né LFM2.5 2.6B Base è uno dei nostri — entrambi sono checkpoint che scarichi ed esegui in locale, e in entrambi i casi è proprio questo il punto, perché il motivo per scegliere un modello da 2 GB è che gira dove i tuoi dati già si trovano. Un gateway serve per quella metà dello stack verso cui, altrimenti, faresti chiamate esterne.
Se il livello decisionale è la parte che vuoi testare senza dedicargli un'esecuzione di addestramento, un modello decisionale ospitato è l'esperimento più economico, e Jev 1.13 di TypeSafe è quello rispetto al quale InternLM ha eseguito il benchmark — chiamabile oggi tramite un unico endpoint compatibile con OpenAI a $0,042 per milione di token di input con l'output fatturato a zero.

Quale, allora?
Scegli LFM2.5 2.6B Base se la capacità non esiste ancora e hai sia i dati di dominio sia la voglia di eseguire un fine-tuning, e controlla la soglia di ricavi di $10M nella LFM Open License prima di costruirci sopra commercialmente. Scegli Intern-Decision-0.8B se la capacità esiste, le risposte sono già enumerabili nel tuo prompt e ciò di cui hai bisogno è un modo rapido, deterministico e con licenza pulita per ottenere l'etichetta — accettando che la sua documentazione manca, i suoi benchmark non sono verificati e il suo comportamento di rifiuto su input avversariali non è stato testato da nessuno al di fuori del laboratorio che lo ha messo a punto. Il secondo è il percorso più breve e l'incognita più grande. Il primo è il percorso più lungo e quello più documentato, e nessuno dei due fatti equivale a migliore.
