
LFM2.5-2.6B-Base: la release più silenziosa di Liquid AI è quella che i fine-tuner volevano davvero
- qwenNUOVOQwen: Qwen3.8 Max2026-08-03$2.00 / $6.00 per 1M di token · 56 tok/s
- deepseekNUOVODeepSeek: DeepSeek V4 Flash 07312026-07-3150Intelligenza69Codice
- qwenNUOVOQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 per 1M di token · 201 tok/s
- orcaNUOVOOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicNUOVOAnthropic: Claude Opus 52026-07-2461Intelligenza78Codice
- googleGoogle: Gemini 3.6 Flash2026-07-2150Intelligenza69Codice
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137Intelligenza49Codice
- metaMeta: Muse Spark 1.12026-07-1651Intelligenza71Codice
- kimiMoonshotAI: Kimi K32026-07-1557Intelligenza76Codice
- openaiOpenAI: GPT-5.6 Luna2026-07-0951Intelligenza71Codice
- openaiOpenAI: GPT-5.6 Terra2026-07-0955Intelligenza77Codice
- openaiOpenAI: GPT-5.6 Sol2026-07-0959Intelligenza77Codice
- grokxAI: Grok 4.52026-07-0854Intelligenza72Codice
- tencentTencent: Hy32026-07-0641Intelligenza59Codice
- obsidianQwen3.6 35B A3B Uncensored (Aggressive)2026-07-0232Intelligenza42Codice
- obsidianGemma4 26B A4B Uncensored (Balanced)2026-07-0226Intelligenza39Codice
- anthropicAnthropic: Claude Sonnet 52026-06-3053Intelligenza72Codice
- klingKling: Kling 3.0 Turbo2026-06-1757Intelligenza52Codice57Matematica
- z-aiZ.ai: GLM 5.22026-06-1651Intelligenza69Codice60Matematica
- kimiMoonshotAI: Kimi K2.7 Code2026-06-1242Intelligenza61Codice61Matematica
Leggendo i contatori di Hugging Face il 5 agosto 2026, il divario è difficile da non notare: LFM2.5-2.6B, il modello agentico on-device che Liquid AI ha lanciato il 4 agosto, si attesta a 47.393 download. LFM2.5-2.6B-Base, il checkpoint pre-addestrato da cui discendono tutti quei pesi, si attesta a 151. Stessa organizzazione, stessa architettura, stessa settimana, un rapporto di 314 a 1.
Il checkpoint base non è stato divulgato né nascosto. È apparso nel post di lancio di Liquid in esattamente una parentesi — "I modelli base (LFM2.5-2.6B-Base) e post-addestrati (LFM2.5-2.6B) sono disponibili oggi su Hugging Face" — e questo è l'intero resoconto pubblicato al riguardo. Nessun benchmark dedicato, nessuna sezione, nessuna scheda separata. Tutto ciò che segue è letto direttamente dal repository — la scheda del modello, config.json, il file LICENSE e l'API di Hugging Face — più i calcoli che abbiamo fatto noi stessi. Dove un numero proviene dalle valutazioni di Liquid, lo diciamo, perché per questo particolare checkpoint il fatto più importante è quanto poco sia stato effettivamente misurato.
Questo conta più di quanto suggerisca una nota a piè di pagina. Un modello post-addestrato si può giudicare provandolo. Un checkpoint base è un'offerta per spendere due settimane e un budget di GPU prima di imparare qualsiasi cosa, quindi i termini dell'offerta — cosa contiene, per cosa è concesso in licenza, cosa è stato valutato — sono l'intera decisione.
Cosa c'è effettivamente nel repository
Nove file, uno shard di pesi, nessun codice di modellazione. L'elenco delle specifiche della scheda, verificato rispetto a config.json:
• 2,69B di parametri totali, bfloat16, in un singolo file da 5,39 GB, model.safetensors. Pianifica storage e VRAM in base a quel numero, non a "2,6B."
• 30 layer, ibrido. La scheda riporta 22 blocchi convoluzionali short a doppio gate più 8 layer di attenzione GQA. L'array layer_types in config.json lo conferma esattamente: 22 voci di conv e 8 di full_attention, con i layer di attenzione distanziati più o meno ogni terzo o quarto blocco anziché raggruppati.
• larghezza nascosta 2048, dimensione intermedia 10752, 32 teste di attenzione su 8 teste chiave-valore — un rapporto GQA di 4 a 1 — con embedding di input e output legati e un theta rope di 10.000.000.
• vocabolario da 128.000 token, e un tokenizer da 18 MB incluso. Liquid ha raddoppiato il vocabolario in questa generazione, un costo significativo a 2,6B: con embedding legati, la sola tabella del vocabolario rappresenta circa 262M del budget dei parametri, quasi un decimo del modello.
• 34 trilioni di token di addestramento. Si tratta di un pre-addestramento insolitamente lungo per questa classe di dimensioni, ed è la ragione più forte in assoluto per guardare il checkpoint.
• 16 lingue dichiarate: inglese, arabo, cinese, francese, tedesco, hindi, indonesiano, italiano, giapponese, coreano, polacco, portoghese, russo, spagnolo, tailandese e vietnamita.
Una incongruenza per chiunque stia pianificando un lavoro con contesto lungo: la scheda pubblicizza una lunghezza del contesto di 131.072 token, mentre config.json imposta max_position_embeddings a 128.000. Il blog e la documentazione di Liquid dicono entrambi 128K. La differenza di 3.072 token non avrà importanza per la maggior parte delle persone, ma se stai scrivendo uno script di addestramento che impacchetta le sequenze fino al massimo pubblicizzato, fidati del file di configurazione piuttosto che della scheda.
La stringa dell'architettura è il titolo pratico: model_type è lfm2 e la classe è Lfm2ForCausalLM — la stessa classe con cui è stato distribuito LFM2. LFM2.5 è un pre-training esteso e un nuovo post-training su un'architettura esistente, non una nuova, quindi qui non serve alcun codice di modellazione personalizzato. È per questo che llama.cpp, vLLM, MLX, ONNX Runtime, SGLang e LM Studio hanno supportato questa famiglia fin dal primo giorno, e perché il percorso di fine-tuning tramite Unsloth e TRL funziona senza patch. Hai bisogno di transformers>=5.0.0.
La carta che ricevi è la carta dell'altro modello.
Apri il repository di base e il primo titolo è "LFM2.5-2.6B" — il nome del modello post-addestrato, non quello che stai guardando. Non è una pignoleria; l'intera pagina si legge come la scheda instruct con un paragrafo base inserito al suo interno, e tre degli artefatti rimasti possono costarti tempo prezioso.

• The YAML frontmatter says base_mode: LiquidAI/LFM2.5-2.6B-Base. Two problems in one line: the key is a misspelling of Hugging Face's base_model, and it points the base repository at itself. Nothing breaks, but the model tree links you would expect from a properly declared lineage are not being generated from this.
• Il repository è etichettato come conversazionale e include un chat_template.jinja, quindi Hugging Face mostra un badge "Chat template" su un checkpoint che non è mai stato addestrato con istruzioni. Il template esiste perché la configurazione del tokenizer è stata ereditata, non perché i pesi sappiano cosa farci.
• Lo snippet di avvio rapido usa quindi quel template. L'esempio Python sulla scheda base chiama tokenizer.apply_chat_template con un {"role": "user"} messaggio e chiede "Cos'è C. elegans?" — il modo classico per far sembrare rotto un modello base. Avvolgi un checkpoint pre-addestrato grezzo in turni di chat e ottieni testo che deriva, si ripete, si auto-continua, ed è facile interpretarlo come un modello scadente piuttosto che come il formato di prompt sbagliato. Usa questo come completatore di testo, few-shot, con sequenze di stop che controlli.
• La tabella delle varianti elenca solo la linea post-training — LFM2.5-2.6B, più le sue build GGUF, ONNX e MLX. Non esiste alcuna build GGUF o MLX del checkpoint di base, quindi "eseguirlo localmente stasera in LM Studio" non è un'opzione senza convertirlo da soli.
Hugging Face riporta inoltre che nessun provider di inferenza serve questo repository. Non c'è alcun endpoint ospitato per il checkpoint base da nessuna parte; se vuoi i suoi logits, devi affittare la GPU.
La sezione benchmark che non esiste
Nemmeno un numero di valutazione è stato pubblicato per LFM2.5-2.6B-Base. Niente MMLU, niente MMLU-Pro, niente GPQA, niente HellaSwag, niente ARC, nessuna cifra di perplexity — proprio nulla, su nessuna delle tre superfici di Liquid (la scheda del modello, il post di lancio, i documenti). Per un checkpoint base questa è un'assenza che salta all'occhio, perché quei punteggi di conoscenza e ragionamento sono esattamente il modo in cui si giudica se 34T token di pre-addestramento ti abbiano lasciato qualcosa che valga la pena di mettere a punto.
Ciò che esiste appartiene al gemello post-addestrato, è riportato da Liquid e non è stato riprodotto in modo indipendente. Nelle valutazioni di Liquid stesso, LFM2.5-2.6B ottiene 51.87 su AIME25, 59.17 su IFBench, 80.07 su Multi-IF, 56.88 su BFCLv4, 77.83 su ToolSandbox e 26.89 su BrowseComp+ all'interno dell'ambiente OpenClaw, confrontato con gemma-4-E2B-it (5.1B), gemma-4-E4B-it (8B), Qwen3.5-4B (4.7B) e Qwen3.5-9B (9.7B). Il riepilogo di Liquid è che supera ogni benchmark di istruzioni e quasi tutti quelli di utilizzo di strumenti, e il suo stesso grafico è onesto riguardo alle eccezioni: Qwen3.5-9B è in testa su AIME25 con 56.07 e su BFCLv4 con 60.13. Le affermazioni sulla velocità seguono la stessa regola — 220 token/s in decodifica su un M5 Max, 113 su un Ryzen AI Max+ 395, circa 30 su un telefono, meno di 2,5 GB di memoria e circa 15K token/s di output ad alta concorrenza su un singolo H100 — tutti misurati dal fornitore, nessuno ancora verificato da altri.
La trappola è presumere che tutto questo si trasferisca. Quei punteggi sono il prodotto di una pipeline in quattro fasi applicata sopra questo checkpoint: due cicli di fine-tuning supervisionato, specializzazione del teacher per dominio, distillazione on-policy multi-dominio, poi apprendimento per rinforzo agentico con GRPO eseguito all'interno di ambienti reali. Il tool-calling e il seguire le istruzioni sono esattamente i comportamenti che quella pipeline installa. Prendi i pesi base e parti prima di tutto questo. Ciò che erediti è il pre-training — le lingue, la conoscenza del mondo, la capacità di contesto lungo, l'efficiente architettura ibrida — e dovresti presumere di non ereditare nulla del punteggio agentico.
151 download non è solo precoce — è fuori dal pattern della famiglia stessa.
Liquid pubblica regolarmente checkpoint di base, quindi questo rilascio non è eccezionale nel suo genere. È la negligenza che è misurabile. Confrontando ogni repository di base LFM2.5 con la sua controparte instruct nello stesso giorno si ottiene una chiara norma interna — e una chiara anomalia.

• LFM2.5-230M — 58,676 downloads against 6,982 for its base: about 8 to 1.
• LFM2.5-350M — 94.526 contro 9.397: circa 10 a 1.
• LFM2.5-1.2B — 583.914 per la versione Instruct contro 17.867 per la base: circa 33 a 1.
• LFM2.5-8B-A1B — 171.520 contro 3.996: circa 43 a 1.
• LFM2.5-2.6B — 47.393 contro 151: circa 314 a 1.
Parte di ciò è semplicemente l'età; il repository di base è stato creato il 1º agosto e il modello instruct ha avuto un vantaggio di quattro giorni più un post di lancio. Ma i checkpoint base più vecchi di questa famiglia si sono assestati tra 8 a 1 e 43 a 1, quindi un ordine di grandezza oltre il peggiore di essi è una vera anomalia piuttosto che un artefatto di arrotondamento di un nuovo repository.
I like raccontano una storia più sottile. Il repository base ha 28 like contro 151 download — circa un segnalibro ogni cinque download. Il modello instruct ha 232 like contro 47.393, circa uno ogni 204. Gli utenti salvano il checkpoint base per tornarci, non per scaricarlo. Due fine-tuning della community e sette quantizzazioni esistono già nel suo albero del modello, che è come appare il fronte avanzato dell'adozione prima che arrivi il volume.
"Senza restrizioni" non è ciò che dice la licenza
La pagina di lancio di Liquid descrive il rilascio come open-weight: "Scarica, perfeziona e distribuisci senza restrizioni." Il file nel repository dice qualcosa di più restrittivo, e questa è la sezione da leggere due volte se stai pensando di costruire un prodotto su questi pesi.

La licenza è LFM Open License v1.0 — non Apache-2.0, non MIT, e non gli stessi termini della maggior parte dei piccoli modelli open-weight con cui probabilmente la stai confrontando. Citando direttamente il file, la Sezione 5 è intitolata "Limitazione all'uso commerciale" e recita: "I diritti concessi ai sensi della presente Licenza per l'Uso Commerciale sono subordinati alla condizione che Tu o la Tua Entità Giuridica non superiate la Soglia," seguito da "Qualsiasi Uso Commerciale dell'Opera o di un'Opera Derivata da parte di un'Entità Giuridica che superi la Soglia non è concesso ai sensi del presente Accordo." La Sezione 1 definisce la Soglia come "un fatturato annuo di 10 milioni di dollari statunitensi ($10.000.000) o più."
Quindi la lettura pratica:
• Meno di $10M di fatturato annuo — disponi di una licenza ampia, perpetua e esente da royalty che copre riproduzione, opere derivate, distribuzione e sublicenza, incluso l'uso commerciale.
• A partire da $10M — l'uso commerciale è non autorizzato dal presente accordo. Non “richiede attribuzione”, non “richiede notifica”. Devi parlare con Liquid, che è presumibilmente il motivo per cui la scheda termina con un link al loro team di vendita.
• Le opere derivate ereditano la limitazione. La tua messa a punto di questo checkpoint è un'Opera Derivata, quindi un modello che ti costa un trimestre di addestramento porta con sé la stessa concessione condizionata ai ricavi. Se la tua azienda supera la soglia — o viene acquisita da una che l'ha già superata — i termini da cui dipende il tuo prodotto cambiano alla radice.
• Le organizzazioni non profit qualificate sono escluse: la Soglia non si applica a un'organizzazione 501(c)(3) o equivalente straniero che utilizza l'opera per scopi non commerciali o di ricerca. Si applicano anche gli obblighi ordinari — trasmetti la licenza, conserva le note di attribuzione, segna i file che hai modificato.
Nulla di tutto ciò rende il rilascio avaro; una soglia di 10 milioni di dollari esenta quasi tutte le startup e tutti i ricercatori, ed è un modo legittimo per pubblicare i pesi. Ma "senza restrizioni" è una frase di marketing che la licenza contraddice, e la discrepanza colpisce più duramente proprio qui. Il fine-tuning di un checkpoint di base è il modo più costoso e meno reversibile per adottare un modello. È il posto peggiore in cui scoprire una clausola sui ricavi.
Chi dovrebbe effettivamente fare questo checkpoint
Liquid's own guidance is refreshingly narrow, and worth following: the card says the pre-trained checkpoint is "only recommended for tasks that require heavy fine-tuning, like language-specific (e.g., Japanese) or domain-specific (e.g., medical) assistants, training on proprietary data, or experimenting with novel post-training approaches." That word "only" is doing real work. If you want an on-device agent that calls tools, the post-trained LFM2.5-2.6B is strictly the better starting point and the base checkpoint will waste your month.
I casi in cui è genuinamente la scelta giusta:
• Una lingua che il post-training non serve adeguatamente. 34T di token in 16 lingue è una solida base multilingue, e Liquid ha già dimostrato il pattern internamente con una build giapponese nella linea 1.2B. Continuare il pre-training sulla tua lingua, seguito dal tuo instruction tuning, evita di combattere una persona post-addestrata incentrata sull'inglese.
• Un verticale regolamentato con dati proprietari. Meno di 2,5 GB in fase di inferenza, nessuna dipendenza dal cloud e una licenza sufficientemente permissiva al di sotto della soglia di fatturato rappresentano una combinazione rara per implementazioni in ambito medico, legale o industriale, dove i dati non possono lasciare il dispositivo.
• Ricerca sul post-training.Liquid ha pubblicato la sua ricetta — SFT, specializzazione del teacher, MOPD, RL agentico — e poi ha fornito l'input esatto di quella ricetta insieme all'output. Poter eseguire il proprio metodo sugli stessi pesi iniziali e fare un diff con un'implementazione di riferimento solida è insolito e prezioso.
• Obiettivi di distillazione. Un ibrido da 2,6B che decodifica a 220 token/s su un laptop è uno studente interessante per comprimere un insegnante molto più grande in qualcosa di distribuibile.
È su quell'ultimo paio che il costo si concentra davvero, e non sono ore di GPU — sono dati. La pipeline di Liquid si basa su specializzazione dell'insegnante e distillazione on-policy, il che significa che il vero prerequisito per riprodurre qualcosa di simile è un grande volume di dati generati da modelli più forti, più coppie di preferenza e rollouts con reward verificabile. È un lavoro da molti modelli prima ancora che un lavoro di training: vuoi confrontare gli insegnanti candidati sul tuo dominio, poi generare in volume da quello che vince. È la parte del lavoro a cui punta il nostro prodotto — OrcaRouter mette 200+ modelli dietro un'unica chiave API con markup 0%, quindi quello che paghi per un set SFT sintetico è il prezzo di listino del fornitore, non un premio di routing (quando un vendor taglia i prezzi, arriva dalla nostra parte lo stesso giorno), il failover automatico evita che una generazione di venti ore muoia per l'ora critica di un singolo provider, e il DSL di routing ti consente di distribuire un singolo prompt su più insegnanti e tenere la risposta migliore. Per essere chiari su ciò che non offriamo: LFM2.5-2.6B-Base non è su OrcaRouter e nessun provider di inferenza lo ospita — questi pesi li esegui tu. Noi siamo utili per gli insegnanti, non per lo studente.
{{1}}La stessa ripartizione vale per qualunque cosa tu rilasci.{{/1}} {{2}}Il post di Liquid sostiene che gli agenti locali rendono gratuita l'inferenza ed eliminano il costo per token come vincolo, il che vale per il token marginale ma non per il conto totale — lo hai già pagato in anticipo nell'hardware, e un modello da 2.6B ha comunque un tetto.{{/2}} {{3}}Liquid lo dice apertamente, sconsigliando questa famiglia per lavori agentici ad alto contenuto di codice o ad alta intensità di conoscenza.{{/3}} {{4}}L'approccio duraturo è un modello locale ottimizzato che gestisce il percorso comune ad alto volume sul dispositivo e rimanda la minoranza difficile a un modello di frontiera tramite API, mantenendo i vantaggi di privacy e latenza dove contano, senza fingere che 2.6B parametri possano fare tutto.{{/4}}
Il percorso da questi pesi a qualcosa di utilizzabile
La pubblicazione di lancio non dice nulla al riguardo, ma la scheda del modello base contiene silenziosamente la cosa più pratica dell'intero repository: sette notebook Colab pronti all'uso che coprono esattamente le fasi della pipeline di cui un checkpoint base ha bisogno. Due di queste sono pre-addestramento continuato — uno per il completamento del testo, uno per la traduzione — che è il passaggio che ha senso solo a partire dai pesi base e quello per cui nessuno scrive tutorial. Il resto copre l'addestramento supervisionato tramite Unsloth e TRL, il DPO tramite TRL e il GRPO tramite entrambi. Liquid include anche LEAP Finetune come stack di addestramento separato, se preferisci non assemblarne uno.
Leggendo la documentazione di fine-tuning di Liquid rispetto alla forma di questo modello, la sequenza realistica è la seguente:
• Prima di addestrare qualsiasi cosa, provatelo come modello di completamento. Ignorate il template di chat sulla scheda. Few-shot, testo grezzo, sequenze di stop personalizzate. È così che scoprite se il pre-training copre già il vostro dominio e la vostra lingua, il che determina se avete davvero bisogno di un pre-training continuato o se potete saltare direttamente all'SFT.
• Pre-training continuato solo se stai aggiungendo conoscenza o una lingua. Questo è il ramo costoso — su scala di corpus, non su scala di esempi — e l'unica cosa che il fratello post-addestrato non può davvero darti.
• Poi SFT con LoRA, su 500-5.000 esempi.L'indicazione di Liquid è che qualità e distribuzione battono il volume e che gli esempi dovrebbero corrispondere agli input di produzione. A 2.6B una passata LoRA è breve: la documentazione indica che un run da 1.2B richiede da minuti a decine di minuti su una GPU moderna, quindi questa dimensione è ancora un ciclo che si completa nello stesso pomeriggio.
• Congela un set di validazione prima di addestrare. Brutale, e vale la pena ripeterlo per questo checkpoint in particolare, perché non c'è un baseline pubblicato con cui confrontarsi — il tuo set di valutazione è l'unico numero disponibile.
• Le fasi di preferenza o RL vengono per ultime, e solo se il comportamento è il problema. Le ricette DPO e GRPO esistono per la famiglia, ma sono perfezionamenti su un modello che già risponde; ricorrere a esse prima che l'SFT sia disponibile è il modo in cui i progetti basati su checkpoint base si arenano.
Nota cosa non è in quella lista: nulla qui richiede un kernel personalizzato, un trainer modificato o un file di modellazione. Poiché LFM2.5 riutilizza l'architettura LFM2, il checkpoint di base si integra nello stack standard, e l'intero costo di questo progetto è il corpus e il set di valutazione che costruisci per esso.
Cosa cambierebbe il quadro
Tre cose meritano attenzione, tutte economiche per Liquid da risolvere e nessuna di esse è stata risolta oggi.
Il primo punto sono le valutazioni di base. Un singolo punteggio MMLU-Pro o GPQA sul checkpoint pre-addestrato direbbe a chi fa fine-tuning più di tutti i benchmark agentici del post di lancio messi insieme, e il fatto che siano entrati 34T token rende la sua assenza più curiosa, non meno. Il secondo è la scheda stessa — un repository di base la cui intestazione indica un modello diverso, la cui guida rapida applica un template di chat a un modello non-chat e il cui frontmatter sbaglia a scrivere base_model. È una correzione da dieci minuti che impedirebbe alle persone di concludere che i pesi sono rotti quando invece lo sono le istruzioni. Il terzo è il report tecnico di LFM2.5. Il blocco di citazione punta a arXiv 2511.23404, che è il LFM2 (report tecnico del novembre 2025); il paper della generazione 2.5 stessa non è ancora uscito, quindi il mix di dati di pre-addestramento dietro quei 34T token rimane non divulgato.
Fino ad allora, il riassunto onesto è che questo è un modello foundation da 2,6B ben specificato, addestrato a lungo, dalla forma efficiente, con un pubblico di riferimento insolitamente chiaro, pubblicato senza misurazioni e con una licenza con tetto ai ricavi, e finora quasi nessuno l'ha tirato fuori dalla scatola. Se fai parte del pubblico che la scheda descrive, vale il tempo della tua GPU — e sarai tra le prime persone in assoluto a sapere quanto sia davvero buono.
Domande a cui vale la pena rispondere
Questo è lo stesso checkpoint da cui è stato post-addestrato LFM2.5-2.6B, o una corsa di pre-addestramento separata?
La scheda afferma che LFM2.5-2.6B-Base {{1}}è il checkpoint pre-addestrato solo testuale, utilizzato per creare tutte le varianti LFM2.5-2.6B,{{/1}} {{2}}quindi è l'input effettivo della pipeline pubblicata e non una release parallela o ridotta.{{/2}} {{3}}È proprio questo che lo rende utile per la ricerca sul post-addestramento: il tuo metodo e le quattro fasi di Liquid partono da pesi identici,{{/3}} {{4}}quindi un confronto tra i due è significativo.{{/4}} {{5}}Vale la pena notare che il repository di base è stato creato il 1° agosto e modificato l'ultima volta il 4 agosto, giorno del lancio{{/5}} — {{6}}controlla la cronologia dei commit prima di presumere che il file scaricato in precedenza sia quello pubblicato.{{/6}}
Posso metterlo a punto e vendere il risultato?
Se il fatturato annuo della tua persona giuridica è inferiore a 10.000.000 di dollari, sì: la sovvenzione LFM1.0 copre l'uso commerciale delle opere derivate, a condizione di mantenere integre la licenza e le note di attribuzione e di contrassegnare i file modificati. A partire da questa soglia, l'uso commerciale del modello o di qualsiasi cosa derivata da esso esula dalla licenza e richiede un accordo separato con Liquid. La soglia è legata al fatturato della tua entità, non al modello o ai ricavi che esso genera; quindi lo stesso fine-tuning può essere concesso in licenza a un'azienda e non a un'altra, e un'azienda che supera la soglia non conserva la sovvenzione che aveva.
Perché non fare invece semplicemente fine-tuning del LFM2.5-2.6B post-addestrato?
Per la maggior parte dei progetti dovresti, e la scheda di Liquid di fatto lo dice. Il motivo per partire dal checkpoint di base è quando il post-addestramento lavora contro di te anziché a tuo favore: un intenso pre-addestramento continuato su una nuova lingua o su un corpus specialistico tende comunque a danneggiare il comportamento instruction-tuned, e i pattern di rifiuto, le convenzioni di chiamata degli strumenti e lo stile di risposta incorporati da SFT e RL sono difficili da rimuovere e facili da far entrare in conflitto. Se stai aggiungendo conoscenza o una lingua, parti dalla base. Se stai ritoccando il comportamento ai margini, parti dal modello post-addestrato e conserva le quattro fasi di lavoro che qualcuno ha già pagato.
