Hero card generata per Kolibri vs LFM2.5 2.6B Base, con intestazione 'Kolibri vs LFM2.5 2.6B Base' e sottotitolo 'ragionamento di livello server contro un checkpoint on-device', un'icona di colibrì a sinistra e un piccolo contorno di chip a destra, ai due lati di un sottile divisore. Il logo OrcaRouter si trova nella striscia sotto l'illustrazione.
Guides & Insights

Kolibri vs LFM2.5 2.6B Base: un deployment sovrano da 78B contro un checkpoint grande quanto un telefono

Autore

Gideon Frost

Data di pubblicazione

Ultimi modelli · 20Vedi tutti i modelli →
Benchmark: Artificial Analysis · aggiornato ogni giorno
Torna a tutti gli articoli

Metti Kolibri accanto a LFM2.5 2.6B Base e l'interpretazione ovvia è Davide e Golia: 78,1 miliardi di parametri contro 2,69 miliardi, una soglia minima di deployment a due GPU contro un modello che, secondo Liquid AI, gira su un telefono. L'interpretazione ovvia è sbagliata, e non nella direzione che ti aspetteresti. Nessuno dei due è un modello che oggi puoi assegnare a un compito. Kolibri è stato rilasciato da Aleph Alpha il 3 ottobre 2026 come assistente completo, post-addestrato e con tool-calling per tedesco e inglese, con un plugin di serving e una configurazione di campionamento consigliata. LFM2.5 2.6B Base, pubblicato da Liquid AI all'inizio di agosto 2026, è un checkpoint pre-addestrato senza alcun instruction tuning, rilasciato specificamente per il fine-tuning. Uno è un prodotto che distribuisci. L'altro è materia prima. Confrontare la loro qualità è un errore di categoria, e la domanda interessante è quale tipo di materia prima richieda davvero il tuo progetto.

Il divario che decide la maggior parte degli approvvigionamenti reali tra questi due non sono i parametri. È la licenza. Kolibri è distribuito con licenza Apache 2.0. LFM2.5 2.6B Base è distribuito con la LFM Open License v1.0, una licenza su misura (la model card la classifica come "license: other"), e questa differenza è quella che arriva a un team legale anziché a un team di ingegneria.

Due diversi significati di "open weights"

Entrambi i modelli ti permettono di scaricare i pesi ed eseguirli. È su ciò che ti è consentito fare in seguito che le loro strade si separano.

• Kolibri — Apache 2.0, nessuna clausola aggiuntiva sull'uso accettabile, nessuna soglia del numero di utenti, nessun termine commerciale separato. La scheda di Aleph Alpha riporta soltanto che il laboratorio è firmatario del Codice di pratica GPAI dell'UE.

• LFM2.5 2.6B Base — la LFM Open License v1.0, che è una licenza di Liquid AI stessa anziché una licenza standard OSI. È la stessa licenza che disciplina il modello post-addestrato LFM2.5 2.6B e il resto della famiglia.

Per un team di ricerca va bene l'una o l'altra. Per un'impresa che deve dichiarare la propria posizione in materia di licenze in un documento di gara, una è un dato noto e l'altra è un documento che qualcuno deve leggere. Questo è un costo reale, si paga prima che venga generato un singolo token ed è invisibile in qualsiasi tabella di benchmark.

C'è una seconda distinzione nella stessa categoria, ed è quella che la stessa scheda di Liquid AI tiene particolarmente a precisare. Base non è un assistente. Non porta alcun instruction tuning, il che significa che non seguirà un prompt, non si asterrà, non emetterà una chiamata a uno strumento e non resterà in argomento — non perché sia debole, ma perché non è mai stato addestrato a farlo. La scheda afferma chiaramente che è consigliato solo per attività che richiedono un fine-tuning intenso: assistenti specifici per lingua o per dominio, addestramento su dati proprietari o sperimentazione di nuovi approcci di post-training. Tutto ciò che sta a valle del checkpoint base — fine-tuning supervisionato, specializzazione del teacher, distillazione on-policy, apprendimento per rinforzo agentico — è un problema dell'acquirente. Kolibri arriva con tutto questo già fatto, a quattro livelli di sforzo di ragionamento, con un parser di tool call in stile Hermes fornito accanto ai pesi.

Cosa ti danno davvero le dimensioni

Tolto l'inquadramento, i due modelli sono ottimizzati per vincoli opposti.

• Parametri — 78.103.074.560 in totale con 3.457.573.120 attivi per token su Kolibri, contro 2,69 miliardi in totale su LFM2.5 Base, che utilizza uno stack ibrido di 22 blocchi a convoluzione breve a doppio gate e 8 layer di attenzione grouped-query anziché un transformer a blocchi uniformi.

• Contesto — 131.072 token su LFM2.5 Base, rispetto a una finestra nativa di 262.144 token su Kolibri e a 1.048.576 convalidati oltre essa.

• Dati di addestramento — 34 trilioni di token su LFM2.5 Base, contro 20 trilioni su Kolibri, attinti da un pool grezzo di oltre 200 trilioni dopo filtraggio e deduplicazione, di cui il 13,6 per cento era codice.

• Lingue — sedici su LFM2.5 Base, tra cui arabo, cinese, giapponese, coreano, thai e vietnamita, contro esattamente due su Kolibri, tedesco e inglese, per esplicita progettazione.

• Memoria — l'LFM2.5 Base ha build GGUF, ONNX e MLX pubblicate insieme a esso ed è pensato per il deployment edge; i pesi FP8 di Kolibri occupano circa 78 GB e richiedono come minimo due schede A100 80 GB, due H100 SXM5, una H200, una B200 o una B300.

Leggi quelle cinque righe insieme e il quadro smette di essere sbilanciato. Il modello di Liquid AI copre dieci volte il numero di lingue su un hardware tre ordini di grandezza più piccolo. Il modello di Aleph Alpha copre due lingue con una finestra di contesto otto volte più lunga e una profondità di specializzazione che emerge solo all'interno delle sue valutazioni verticali. Nessuno dei due è una versione peggiore dell'altro; sono risposte a domande diverse, e le domande sono «può funzionare senza un server» e «può ragionare su un documento normativo tedesco».

Generated two-column scoreboard for Kolibri and LFM2.5 2.6B Base. Left column Kolibri: role 'post-trained assistant', parameters '78.1B MoE, 3.46B active', context '262,144 native, 1M validated', languages 'German and English', licence Apache 2.0, deployment 'two 80 GB accelerators'. Right column LFM2.5 2.6B Base: role 'pre-trained checkpoint', parameters 2.69B, context 131,072, languages 'sixteen', licence 'LFM Open License v1.0', deployment 'phone, GGUF and MLX'. The footer reads 'Kolibri figures vendor-reported; LFM2.5 2.6B Base has no published evaluation.'

Solo uno di essi ha un punteggio misurato, e non è il Base

Ecco la parte che l'abbinamento nasconde. Artificial Analysis ha effettivamente una pagina del modello per LFM2.5-2.6B, ma per il modello post-addestrato, non per il Base. Quella pagina riporta un Intelligence Index di 8, classificato al #9 posto su 49 modelli della sua classe, con una finestra di contesto di 128.000 token, 2,7 miliardi di parametri e la LFM Open License v1.0. È un punteggio modesto e onesto: il modello è misurato, prezzato a un valore effettivamente pari a zero e valutato per ciò che è: un piccolo modello di ragionamento.

Il checkpoint Base non ha un punteggio, e non può averne uno. Un Intelligence Index viene calcolato eseguendo un modello su compiti di ragionamento e conoscenza; un checkpoint che non è stato sottoposto a instruction tuning non ha un comportamento significativo su quei compiti. Liquid AI non pubblica alcuna tabella di valutazione per esso, e tale assenza è un'affermazione sull'artefatto, non una lacuna nel rilascio.

La posizione di Kolibri è ancora diversa, e vale la pena enunciarla con precisione perché è facile fraintenderla. Non esiste una pagina di Artificial Analysis neanche per Kolibri — abbiamo verificato, e il modello è del tutto assente da quel confronto. Quello che esiste è la tabella di post-training di Aleph Alpha stessa, in cui Kolibri ottiene 75,5 sulla media inglese e 70,8 sulla media tedesca nel suo harness, contro 54,1 e 46,4 per il suo predecessore Kolibri Origin. Sono numeri prodotti dal fornitore su una suite di valutazione costruita dal fornitore, e non sono convertibili in un Intelligence Index. Quindi dei due modelli in questo titolo, uno ha un punteggio indipendente per una versione sorella, uno ha una tabella del fornitore, e nessuno dei due artefatti esatti messi a confronto ha una misurazione indipendente.

Screenshot of the Artificial Analysis model page for LFM2.5-2.6B, showing an Intelligence Index of 8 against a median of 5, a #9/49 intelligence rank, 128k-token context window, the summary line that the model is amongst the leading models in intelligence and well priced compared with other open-weight models of similar size, $0.00 input and output pricing against $0.00 medians, and the 49 models in this class count.

La sorella che cambia la raccomandazione

Valutare LFM2.5 2.6B Base da solo è il modo sbagliato di valutare il rilascio di Liquid AI, perché il Base esiste per servire il LFM2.5 2.6B post-addestrato, e i due vengono distribuiti insieme. Se non hai intenzione di scrivere una pipeline di fine-tuning, il Base non è il tuo modello — lo è il modello gemello post-addestrato, ed è quello con un punteggio pubblico e un prezzo pubblicato di praticamente nulla per token quando lo ospiti tu stesso.

Questa è la stessa relazione che Kolibri ha con Kolibri Origin, e vale la pena fare il confronto perché Aleph Alpha ha pubblicato la timeline. Origin ha terminato il pre-training a 30,6 miliardi di parametri e 3,27 miliardi attivi l'11 giugno 2026 e non è mai stato rilasciato; Kolibri ha terminato l'11 settembre 2026 a 78,1 miliardi ed è stato rilasciato il 3 ottobre. Due modelli, tre mesi, uno dei quali solo interno. La suddivisione equivalente di Liquid AI è pubblica in entrambe le direzioni: Base e post-addestrati, fianco a fianco, con build quantizzate per llama.cpp, ONNX Runtime e MLX di Apple pubblicate insieme al checkpoint nativo. Se il tuo piano è fare fine-tuning, quel corredo di strumenti circostante vale più di una riga di benchmark, perché determina quanto del lavoro devi fare da solo.

Cosa distribuire, per requisito

Questo si riduce a una breve lista di decisioni piuttosto che a un vincitore.

• Se il modello deve funzionare senza un server — su un telefono, un laptop, un dispositivo in una fabbrica — LFM2.5 2.6B Base è l'unico dei due a essere anche solo un candidato, e il modello LFM2.5 2.6B post-addestrato è quello da cui si partirebbe effettivamente. Kolibri non può funzionare lì a nessuna quantizzazione.

• Se il carico di lavoro consiste nel ragionamento su documenti in tedesco o inglese all'interno del proprio perimetro, con vincoli sui dati regolamentati e la necessità di un comportamento di astensione, LFM2.5 Base non è il tipo di artefatto adatto e Kolibri punta esattamente a questo — a condizione che tu possa fornire due acceleratori da 80 GB e accettare una posizione in materia di licenza che puoi riassumere in una riga.

• Se hai bisogno di più del tedesco e dell'inglese, la famiglia di Liquid AI copre sedici lingue a 2,6B, e a quella dimensione l'argomentazione sulla copertura linguistica si ribalta.

• Se hai bisogno di un assistente in produzione entro questo trimestre e non vuoi eseguire una pipeline di post-addestramento, Kolibri è già post-addestrato; LFM2.5 Base non lo è, e il modello LFM2.5 post-addestrato è un assistente molto più piccolo di Kolibri, piuttosto che una versione più economica di quest'ultimo.

Per i team il cui carico di lavoro si colloca davvero nella fascia intermedia — qualche miliardo di token al mese, contesto moderato, nessun obbligo normativo di possedere l'hardware — nessuna di queste due opzioni è la prima a cui rivolgersi. I modelli sotto i 4B sono economici da ospitare in autonomia e scomodi da instradare su larga scala, perché il costo operativo di un deployment può superare la bolletta dei token; un modello da 78B ha il problema opposto. Il tier che viene effettivamente instradato è quello intermedio, e quel tier è su OrcaRouter oggi: Qwen3.5 35B-A3B a $0,057 per milione di input e $0,459 di output, Qwen3.8-Flash a $0,15 e $0,47 con un contesto da 1M di token, oppure il mixture-of-experts Gemma 4 26B-A4B IT a $0,06 e $0,33. Quelli sono i prezzi di listino dei provider, passati attraverso senza nulla in più per token, su un'unica chiave compatibile con OpenAI con failover, e sono la risposta onesta per un team che vuole misurare il proprio volume reale di token prima di impegnarsi in un progetto di fine-tuning o in un rack.

Per essere espliciti su ciò che non offriamo: né Kolibri né LFM2.5 2.6B Base sono instradabili su OrcaRouter oggi. Abbiamo esaminato il catalogo per entrambi con ogni grafia di fornitore e modello, e nessuno dei due è presente. Kolibri è disponibile solo in self-hosting, e LFM2.5 Base è un artefatto di fine-tuning che non è mai stato pensato per stare dietro a un'API.

Screenshot of the OrcaRouter model page for qwen/qwen3.5-35b-a3b, showing the 32K-token context badge, 65K maximum output, text, image and video input, the Vision, Tools, JSON and Reasoning capability tags, the attribution 'Public benchmarks by Qwen - 2026-02-25', the description as an open-weight mixture-of-experts multimodal model with 35B total and 3B active parameters, the pricing tiles $0.06 and $0.46, and a pricing table with two tiers: under 128K input tokens at $0.057 input and $0.459 output, and above that at $0.229 and $1.835, selected by each request's input token count.

La scelta in una riga

Kolibri è un reasoner tedesco-inglese finito, con licenza, documentato, da 78 miliardi di parametri che costa due acceleratori per essere eseguito. LFM2.5 2.6B Base è un punto di partenza multilingue non finito da 2,69 miliardi di parametri che costa una pipeline di fine-tuning ed entra in tasca. Il rapporto tra i loro parametri è di 29 a 1, ed è il numero meno informativo di questo articolo.