Card hero editoriale generata intitolata "Ling-3.1-flash è live e gratis per due settimane" con il sottotitolo "Cosa offre davvero oggi il MoE da 560B". Quattro card arrotondate recitano "Parametri: 560B totali / ~25B attivi", "Contesto: 262.144 token", "Limite di output: 32.768 token" e "Pesi: non pubblicati", sopra una riga di footer che recita "Specifiche dichiarate dal fornitore; nessun prezzo pubblicato dopo il periodo di prova."
Guides & Insights

Ling-3.1-flash è ora disponibile e gratuito per due settimane: cosa offre davvero il MoE da 560B

Autore

Alistair Wren

Data di pubblicazione

Ultimi modelli · 20Vedi tutti i modelli →
Benchmark: Artificial Analysis · aggiornato ogni giorno
Torna a tutti gli articoli

Ling-3.1-flash, il mixture-of-experts da circa 560 miliardi di parametri che il laboratorio inclusionAI di Ant Group ha annunciato il 29 e 30 settembre 2026, questa settimana ha smesso di essere un comunicato stampa: ora risponde alle richieste su una API commerciale attiva. Il modello è in prova gratuita per due settimane su un gateway di inferenza di terze parti, e compare anche nel prodotto Ling Studio di Ant — il che sposta la domanda da "esiste?" a "cosa serve davvero?". La risposta è più limitata di quanto suggeriscano i numeri di copertina. Ling-3.1-flash accetta testo e restituisce testo; serve un contesto di 262.144 token (256K) anche se l'annuncio cita 1M come obiettivo finale; il suo output è limitato a 32.768 token; e nessuno ha pubblicato il prezzo che pagherai il quindicesimo giorno, quando la finestra gratuita si chiuderà e i pesi dovrebbero seguire.

Quel divario tra la scheda di annuncio e l'endpoint live è la cosa utile da tenere presente, perché gran parte della copertura di questo rilascio legge le specifiche come se il modello le stesse rilasciando oggi. Non è così. Ling-3.1-flash è il secondo modello di questo laboratorio in tre mesi ad arrivare come ciò che il tracker indipendente LLM Releases classifica senza mezzi termini sotto "weights not released", e la differenza tra ciò che Ant dice che il modello sia e ciò che uno sviluppatore può chiamare in questo momento è il punto in cui un budget o un progetto pilota possono silenziosamente prendere una brutta piega.

Cosa è cambiato tra l'annuncio e oggi?

L'annuncio stesso era un post di specifica: ~560B parametri totali, ~25B attivi per token, fino a 1M token di contesto, tre numeri di valutazione principali e una promessa — «prevediamo di rendere il modello open source a breve». Niente di tutto ciò è cambiato. Ciò che è cambiato è la disponibilità. Entro un giorno dall'annuncio il modello era raggiungibile su un edge commerciale, e la prova gratuita espone lo stesso endpoint reale che esporrebbe una versione a pagamento: stessa superficie API, stessa modalità solo testo, stesso interruttore della modalità di pensiero per il lavoro agentico a lungo orizzonte.

Per chiunque stia decidendo se dedicarci tempo di sviluppo, questa settimana la prova è tutto ciò che conta, e ha un doppio taglio. Due settimane di inferenza gratuita sono un modo davvero economico per vedere come si comporta il modello sui tuoi prompt — una rarità per un modello di queste dimensioni. Ma il gratuito è uno stato promozionale, non un prezzo. Non esiste ancora da nessuna parte un listino prezzi post-prova pubblicato per Ling-3.1-flash, quindi qualsiasi modello di costo tu costruisca sul piano gratuito è un segnaposto finché Ant e i suoi host non ci metteranno dei numeri.

La scheda tecnica, e le tre cifre che sono ancora promesse

• Parametri — 560B totali, ~25B attivi per token. Dichiarato dal fornitore, e circa il quadruplo della generazione precedente: 124B totali / 5.1B attivi. Il rapporto di sparsità si mantiene vicino a 1 su 22, quindi l'attivazione non è drasticamente più snella — il modello è semplicemente molto più grande di quello che sostituisce.

• Contesto — servito a 262.144 token oggi. "Fino a 1M" è l'obiettivo una volta che la finestra sarà abilitata; non è ciò che ti offre l'endpoint di prova, ed è in assoluto la lettura errata più comune di questa release.

• Output — massimo 32.768 token. Ragionevole per i loop degli agenti, risicato se intendi generare documenti lunghi in un'unica passata.

• Modalità: testo in input, testo in output. Questo è un modello testuale. Visione, audio e input di file non fanno parte del lancio, e non è stata comunicata alcuna data per essi.

• Ragionamento — uno stack ibrido con un interruttore esplicito della modalità di pensiero, lo stesso schema usato dalla generazione precedente, pensato per attività multi-step con agenti e chiamata di strumenti anziché per chat a singolo turno.

• Pesi e licenza — non pubblicati. Questo è il dato che conta di più e quello che ancora non ha alcun valore: a oggi non esistono né un repository Hugging Face, né un testo di licenza, né un checkpoint scaricabile.

Ant Group's own Ling-3.1-flash benchmark chart, published 30 September 2026. Twelve bar-chart panels cover GDPval-AA v2.1 (1,673 for Ling-3.1-flash), tau-squared Banking (47.60), SkillsBench (69.70), Automationbench public (52.50), Terminal-Bench 4.0 (40.40), CyberGym (87.90), FrontierSWE (75.16), SWE Atlas Codebase QnA (55.92), Finance Agent v2 (57.87), HealthBench Professional (65.35), DRACO (85.49) and MultiChallenge (69.78), with GPT-5.6 Sol, Claude Opus 5, Kimi K3, GLM 5.3, GLM 5.3 flash and DeepSeek-V4.1-Flash as the comparison set. A footnote states HealthBench Professional was evaluated in the AQ environment and that Ling-3.1-flash's healthcare capabilities can currently be experienced only in AQ.

La scheda benchmark, letta con lo sconto di cui ha bisogno

La reportistica di Ant colloca Ling-3.1-flash a un aggregato di 81,0 su cinque benchmark per agenti, con il 40,4% su Terminal-Bench 4.0, il 55,9% su SWE-Atlas e il 65,35% su HealthBench Professional; il resoconto aziendale aggiunge 1.673 Elo su GDPVal-AA v2.1 e 75,16 su FrontierSWE. Ognuno di quei numeri è di prima parte. Non esiste un harness, un set di prompt né pesi che consentano a chiunque altro di rieseguire la suite, che è l'avvertenza standard per un modello in questa fase — e qui vale la pena dirlo chiaramente: un punteggio di un fornitore non riprodotto è un'affermazione su un modello, non una misurazione dello stesso.

La scheda è anche informativa in un modo che i suoi autori forse non avevano previsto. Il risultato del 40,4% su Terminal-Bench 4.0 si colloca ben dietro la fascia di frontiera; Claude Sonnet 5.5, un modello di fascia media più che un flagship, ottiene il 70,6% sulla stessa versione di quel benchmark. La lettura onesta non è che Ling-3.1-flash sia debole — il 40,4% è un numero rispettabile in ambito agentico-terminale per un modello posizionato sul costo — ma che l'inquadramento «vicino alla frontiera sui benchmark chiave» che circolava sui social media il giorno dell'annuncio non sopravvive al contatto con le righe specifiche. Il benchmark in cui il modello appare più forte, HealthBench Professional a 65,35, è anche quello che porta l'imbarazzante nota a piè di pagina: Ant dichiara che è stato valutato in un ambiente che chiama AQ e che la capacità sanitaria del modello «al momento può essere sperimentata solo in AQ», senza definire cosa sia AQ in alcun contesto pubblico. Un punteggio di richiamo con annesso un ambiente senza nome è una demo, non un risultato riproducibile.

Perché un modello di grandi dimensioni che arriva come prova è la vera notizia

La mossa più interessante qui è la sequenza, non i parametri. Ling-3.0-flash è passato direttamente ai pesi aperti. Questo invece arriva prima in versione di prova, con pesi, licenza e prezzi ufficiali tutti trattenuti e un impegno pubblico all'open source solo dopo la fine del periodo gratuito. È un manuale di rilascio commerciale che indossa l'annuncio di un modello aperto, ed è un vero cambiamento da tenere d'occhio: se i pesi arrivano con una licenza permissiva, la comunità ottiene un modello base da 560B da mettere a punto e distillare; se arrivano con vincoli commerciali, la prova di due settimane era il prodotto e la linea "open source" era marketing. In ogni caso, la scelta cade all'interno della finestra di prova, ed è la cosa da osservare piuttosto che qualsiasi singola riga di benchmark.

Dove viene eseguito, e il quadro onesto del routing

Per ora, Ling-3.1-flash è raggiungibile tramite la superficie di prodotto dello stesso fornitore e tramite piattaforme di inferenza di terze parti che eseguono la prova — e questo è tutto. Oggi non è nel catalogo di OrcaRouter; una ricerca nel nostro API pubblico dei modelli per Ling-3.1-flash, Ling-3.0-flash e la variante vision di Ling-3.0 restituisce not-found per tutti, e non fingeremo il contrario. Quando un endpoint Ant raggiungerà la disponibilità generale con un prezzo di listino pubblicato, il modello pass-through su cui opera OrcaRouter — prezzo di listino del fornitore inoltrato con markup zero, così un taglio di prezzo del fornitore è attivo dalla nostra parte lo stesso giorno — è esattamente l'accordo che si addice a un modello il cui prezzo non è ancora stato definito.

Ciò che puoi fare oggi, senza aspettare la decisione sulla licenza, è eseguire il confronto che conta davvero per un modello non collaudato: misurarlo rispetto ai modelli di fascia Flash che puoi chiamare subito. Gemini 3.8 Flash e DeepSeek-V4.1-Flash sono entrambi nel nostro catalogo ai prezzi di listino dei loro fornitori, dietro un'unica chiave API, con failover automatico tra loro. Per un modello in prova gratuita di cui sono ignoti sia i pesi sia il tariffario, è il modo ragionevole di gestirlo — un candidato in più a cui instradare finché dura la prova, e un percorso di produzione che non dipende da ciò che accade il quindicesimo giorno.

Headless capture of Ant's Ling Studio interface with Ling-3.1-flash selected in the model picker. The centre panel shows the model-experience card headed "Ling-3.1-flash Model Experience", describing the model as strong at general-purpose agents, search, routine office work and software/code development, above three starter tasks (Hot Spot Scout, Interaction Design Master, Product Assistant). The Model Settings panel on the right shows Max Length 262144, temperature 0.6, top_k 20, top_p 0.95 and Thinking enabled.

Cosa fare questa settimana

Se il modello è rilevante per il tuo lavoro, la prova è il motivo per agire adesso invece di aspettare che si risolva la questione dei pesi aperti — due settimane di inferenza gratuita su un MoE da 560B è la valutazione più economica che otterrai, e la risposta a "regge sui miei prompt?" è disponibile oggi anche se la risposta a "posso self-hostarlo?" non lo è. Tre cose da controllare mentre la finestra è aperta, in ordine:

• Esegui il tuo carico di lavoro, non la scheda di benchmark. I numeri pubblicati sono una selezione di attività di Ant; sono i tuoi prompt a decidere il tuo stack.

• Verifica il contesto che utilizzerai davvero. L'endpoint eroga 262.144 token, non 1M. Se il tuo progetto dipende dalla finestra più ampia, stai progettando basandoti su una promessa.

• Non costruire un modello di costo sul "gratuito". Il gratuito è uno stato di due settimane. Finché non viene pubblicato un listino prezzi, pianifica il ritorno a un modello Flash-tier a pagamento come predefinito e considera Ling-3.1-flash come capacità aggiuntiva.

L'annuncio è reale e il modello è in esecuzione, cosa che una settimana fa non si poteva dire. Ma rilasciato-e-aperto e in-esecuzione-in-prova sono stati diversi, e questo è saldamente il secondo — una specifica da 560B, un endpoint da 256K, una scheda di benchmark riservata al fornitore e un timer di due settimane che è l'unica scadenza ferma dell'intero rilascio.

Generated editorial card titled "Ling-3.1-flash on trial - what to verify this week" listing six rounded rows: "Your workload: run it, not the card"; "Context: 262,144 served, not 1M"; "Cost model: free is a two-week state"; "Weights: none published, promise only"; "Fallback: keep a priced Flash-tier route"; "Deadline: the trial window is the only firm date", above a footer reading "Vendor-stated specs; no published post-trial rate card."

Confrontati in questo articolo1

Rilevato da questo articolo · Benchmark: Artificial Analysis · aggiornato ogni giorno