
AREX-2 vs LFM2.5 2.6B Base: Un repository vuoto e un checkpoint senza istruzioni
- typesafeNUOVOTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 per 1M di token · 507 tok/s
- OpenAINUOVOOpenAI: GPT-6 Luna2026-09-2237Intelligenza
- OpenAINUOVOOpenAI: GPT-6 Sol2026-09-2248Intelligenza
- AnthropicNUOVOAnthropic: Claude Opus 5.52026-09-2258Intelligenza
- xAINUOVOGrok 4.72026-09-2146Intelligenza
- OrcaNUOVOOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 per 1M di token · 194 tok/s
- OrcaNUOVOOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1M di token · 1143 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligenza
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Intelligenza77Codice
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Intelligenza76Codice
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Intelligenza76Codice
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Intelligenza82Codice
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 per 1M di token · 55 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1M di token · 106 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligenza72Codice
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1M di token · 220 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Intelligenza75Codice
- obsidianQwen3.8 27B2026-08-1534Intelligenza68Codice
- DeepSeekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Intelligenza69Codice
- xAISpaceXAI: Grok 4.62026-08-1244Intelligenza77Codice
Metti AREX-2 accanto a LFM2.5 2.6B Base e la prima cosa che hanno in comune è che nessuno dei due è un prodotto che si possa usare oggi — per ragioni che non hanno nulla a che fare l'una con l'altra. AREX-2 è un repository Hugging Face creato da BAAI il 29 settembre 2026 alle 17:56 UTC; contiene un file .gitattributes, occupa zero byte di dati del modello e non riporta alcuna model card, alcun tag di licenza né alcun tipo di annuncio. LFM2.5 2.6B Base, pubblicato da Liquid AI nell'agosto 2026, è il tipo opposto di incompiuto: un checkpoint completo e scaricabile da 2,69 miliardi di parametri, solo testo, sotto la LFM Open License (lfm1.0) che viene distribuito deliberatamente senza instruction tuning, perché è pensato per essere sottoposto a fine-tuning anziché per rispondere a domande.
Uno è l'assenza di un artefatto. L'altro è un artefatto a cui manca un passaggio che non avrebbe mai dovuto avere. Sono la stessa categoria solo se si dà una scorsa, e trattarli come la stessa categoria è esattamente il modo in cui un team finisce per aspettare la cosa sbagliata. Il confronto utile tra questi due non è la capacità — non c'è nessun AREX-2 da misurare — ma ciò che ciascuno è una materia prima per, e quanto costa scoprire se vale qualcosa.
La differenza di genere, dichiarata per prima
LFM2.5 2.6B Base è una sostanza. È il checkpoint preaddestrato della famiglia ibrida LFM2.5 di Liquid AI: 30 livelli, di cui 22 blocchi a convoluzione breve con doppio gate e 8 di grouped-query attention, addestrato su circa 34 trilioni di token in 16 lingue, con una finestra di contesto di 131.072 token e una build quantizzata che si attesta vicino a 1,67 GB a Q4_K_M. Non ha instruction tuning. Dagli una domanda e continua il testo; non risponde. La scheda di Liquid AI stessa indica il fine-tuning intensivo come uso previsto, e c'è un modello gemello post-addestrato per chiunque voglia un modello che risponda ai prompt. È un substrato, e il fatto che ottenga punteggi scarsi nei benchmark di prompt-following non è un difetto — è la definizione stessa della cosa.
AREX-2 non è una sostanza né un prodotto; è un namespace. Gli unici fatti disponibili sono l'organizzazione (BAAI), il timestamp di creazione (29 settembre 2026) e il nome. Non è stato caricato nulla e non è stato detto nulla. Il nome stesso appartiene a una famiglia che esiste davvero: il 23 luglio 2026 BAAI ha rilasciato AREX-Base, un mixture-of-experts da 122 miliardi di parametri con 10 miliardi di parametri attivi basato su Qwen3.5-122B-A10B, e AREX-Turbo, un modello denso 4B basato su Qwen3.5-4B — entrambi Apache 2.0, entrambi agenti di ricerca approfondita con un'architettura a due cicli che raccoglie prove, produce una risposta candidata con un valore di confidenza, poi verifica tale risposta rispetto ai vincoli originali e la affina o riparte da zero. I suoi numeri pubblicati, dichiarati dal fornitore e non riprodotti in modo indipendente, arrivano a 82,5 su BrowseComp e 85,4 su GAIA per la versione Base, e 70,7 / 81,6 per la versione Turbo.
• Disponibilità — LFM2.5 2.6B Base è scaricabile ora. AREX-2 non ha file nel suo repository.
• Dimensione — 2,69B parametri dense per il modello Liquid, tutti visibili nel checkpoint. Sconosciuto per AREX-2; la famiglia comprende un MoE da 122B e un dense da 4B, quindi il "2" non predice nulla.
• Contesto — 131.072 token per LFM2.5 2.6B Base. Nulla di pubblicato per AREX-2.
• Licenza — LFM Open License v1.0, gratuita sotto i 10 milioni di dollari di ricavi annuali e con obbligo di una licenza separata a partire da tale soglia. Ancora nessun tag di licenza su AREX-2; la prima generazione AREX era Apache 2.0.
• Cos'è — un substrato di fine-tuning contrapposto, a giudicare dalla famiglia, a un agente ospitato il cui valore risiede in un ciclo di ricerca e verifica piuttosto che nei suoi pesi.

Schede di valutazione vuote che significano cose opposte
Nessuno dei due modelli ha un benchmark su cui dovresti pianificare, e le ragioni divergono completamente.
Liquid AI non nasconde nulla lasciando il suo Base non valutato. Valutare un checkpoint preaddestrato su benchmark di instruction-following misurerebbe l'assenza di fine-tuning, non la qualità del substrato — ecco perché l'azienda valuta il sibling post-addestrato e lascia il Base non valutato. Quel vuoto è verificabile dalla tua parte, e questo è il punto: puoi scaricare 1,67 GB, eseguire la tua valutazione sul tuo compito e conoscere la risposta prima di spendere qualsiasi cosa per il serving.
Il vuoto di AREX-2 non è una decisione di design, è un non-ancora. Non c'è nulla da scaricare, quindi non c'è nulla da testare, e nessuna valutazione che potresti eseguire questa settimana ti direbbe qualcosa al riguardo. Chiunque pubblichi numeri di benchmark di AREX-2 nei prossimi giorni sta pubblicando qualcosa che non può aver misurato.

Due diverse domande di fine-tuning
Poiché entrambi questi sono punti di partenza anziché servizi finiti, vale la pena essere precisi su ciò di cui ciascuno sarebbe un punto di partenza, dato che è proprio lì che smettono davvero di assomigliarsi.
Un checkpoint ibrido da 2,69B è uno strumento per creare un modello piccolo, economico e specializzato. Gli usi interessanti sono quelli poco appariscenti: un classificatore che legge una tipologia di documento in un flusso di lavoro regolamentato, un modello di estrazione che trasforma un modulo in JSON strutturato, un riscrittore specifico per dominio che gira su una singola scheda vicino ai dati. Il valore deriva dal fatto che in seguito possiedi l'artefatto e che il costo marginale di una chiamata è l'elettricità. Il ciclo di addestramento è il lavoro, ed è un lavoro che puoi iniziare oggi.
AREX-2 punta nella direzione opposta. La famiglia AREX non è progettata per essere messa a punto fino a diventare un prodotto; è progettata per essere chiamata come un agente che esegue ricerche, integra prove e verifica le proprie risposte rispetto ai vincoli. Se una seconda generazione continua così, ciò che valuteresti è una traiettoria — quanti passi compie, se nota una contraddizione, se il valore di confidenza sulla sua risposta candidata significa qualcosa. Non è una questione di messa a punto e non è una questione di pesi. È una questione di serving, e comincia con qualcuno che pubblica i pesi e una model card.
Non sono sostituti, a nessuna dimensione. Un team che ha bisogno di un modello che possa possedere e riaddestrare non sta aspettando AREX-2. Un team che ha bisogno di un agente di ricerca non si metterà a fare il fine-tuning di un ibrido da 2,6B per trasformarlo in uno.
Dove si inserisce il livello di routing, per ciascuno di essi
La differenza pratica tra questi due si manifesta nel momento in cui un modello entra in un'applicazione, perché i due hanno rapporti opposti con l'hosting.
LFM2.5 2.6B Base non è nel catalogo di OrcaRouter e nessuna variante di LFM2.5 lo è, quindi proviene dalla distribuzione propria di Liquid AI e dai soliti host di terze parti — un artefatto locale più che un endpoint instradato. Anche AREX-Base e AREX-Turbo non sono nel nostro catalogo. Ciò per cui un livello di routing è davvero pensato in questo quadro è l'altro lato dell'architettura: il giorno in cui confronti il tuo fine-tune con i modelli che deve battere, vuoi che quel confronto costi un cambio di configurazione anziché un ciclo di approvvigionamento. Una sola API davanti a oltre 200 modelli, prezzo di listino del provider passato così com'è, senza nulla aggiunto per token, una chiave per l'intero pannello e il failover, così che un pomeriggio storto di un provider non diventi il pomeriggio storto della tua valutazione. Sono queste le condizioni in cui un test A/B su un modello non ancora collaudato è abbastanza economico da poter essere davvero eseguito.
Questo è anche il modo onesto di inquadrare AREX-2 stesso. Quando verrà rilasciato — supponendo che venga rilasciato con pesi aperti, come hanno fatto i suoi due predecessori — il modo sensato di provare un agente nuovo di zecca su un carico di lavoro reale è su un percorso secondario, in failover, non come l'unico provider da cui dipende il tuo ciclo di produzione.
Cosa fa una persona ragionevole riguardo a ciascuno questa settimana
Se hai un compito piccolo e ristretto e dati che non possono lasciare la tua infrastruttura, il checkpoint Liquid è disponibile, piccolo, con licenza permissiva sotto una soglia di ricavi e testabile questo pomeriggio. Scaricalo, eseguilo sul tuo set di valutazione e lascia che il risultato decida. Nulla riguardo ad AREX-2 cambia quel piano.
Se oggi ti serve un comportamento di ricerca a lungo orizzonte, il modello a cui rivolgerti è quello che esiste già: AREX-Base, rilasciato a luglio, con benchmark per agenti pubblicati che puoi almeno verificare rispetto a un paper. AREX-2 è un nome con un timestamp, e le due cose che cambierebbero il suo status sono visibili dall'esterno — se compaiono file nell'albero, e se insieme a essi compare una scheda con un conteggio dei parametri e una licenza.
La modalità di errore che questo articolo esiste per prevenire è quella in cui un nome riservato viene trattato come una voce di roadmap. Non lo è. È un repository che BAAI ha creato ieri, e la quantità corretta di pianificazione da fare al riguardo in questo momento è nulla.
