Laguna S 2.1: il modello di codifica a pesi aperti di Poolside che dà un pugno ben al di sopra del suo peso (e prezzo)
Guides & Insights

Laguna S 2.1: il modello di codifica a pesi aperti di Poolside che dà un pugno ben al di sopra del suo peso (e prezzo)

Autore

jinhao song

Data di pubblicazione

Ultimi modelli · 20Vedi tutti i modelli
Benchmark: Artificial Analysis · aggiornato ogni giorno
Torna a tutti gli articoli

Il 21 luglio 2026, Poolside ha rilasciato Laguna S 2.1 — un modello di codifica open-weight da 118 miliardi di parametri con solo circa 8 miliardi di parametri attivi per token — e lo ha presentato come "il modello open-weight più capace dell'Occidente" e la sua risposta a DeepSeek e Qwen. Il titolo non è che supera ogni sistema frontier chiuso; è che supera modelli molte volte più grandi nei benchmark di codifica agentica con un costo di $0,10 / $0,20 per milione di token. Questa guida spiega cos'è realmente Laguna S 2.1, la sua modalità di pensiero, ciò che è riportato in modo indipendente rispetto al venditore, quanto costa, come eseguirlo e chi dovrebbe usarlo.

Ogni figura qui sotto è etichettata per fonte. I punteggi principali di Laguna sono riportati da Poolside (dai suoi materiali di lancio e dalla scheda di Hugging Face) a meno che non venga citata una terza parte nominata; trattateli come gestiti dal fornitore fino a quando laboratori indipendenti non li confermeranno. I benchmark e i prezzi cambiano — verifica prima di impegnare il budget.

TL;DR. Laguna S 2.1 è un modello di coding open-weight, MoE (118B totali / ~8B attivi) con fino a 1M di contesto e un interruttore "thinking / no-thinking", al prezzo di appena $0.10 input / $0.20 output per 1M token — una frazione della maggior parte dei rivali. Poolside riporta il 78.5% su SWE-Bench Multilingual (leader tra i modelli open con dimensioni dichiarate), 70.2% su Terminal-Bench 2.1 e 40.4% su DeepSWE v1.1 (contro il 9.0% di DeepSeek-V4-Pro-Max) — a circa un sesto dei parametri attivi. È la miglior opzione open-weight in termini di rapporto coding/prezzo che abbiamo visto, ma modelli frontier chiusi come Claude Fable 5, Claude Opus 5 e Kimi K3 sono ancora in testa su diversi benchmark assoluti. Se desideri un coder economico e auto-ospitabile che supera la sua categoria di peso, Laguna S 2.1 fa al caso tuo; se necessiti della massima accuratezza assoluta nel coding, un flagship frontier vince ancora.

Punti chiave

• Miglior modello open-weight per programmazione per dollaro. $0.10/$0.20 per 1M token per un modello che è leader tra i modelli open disclosed-size su SWE-Bench Multilingual (78,5%).

• Supera le aspettative per le sue dimensioni. ~8B parametri attivi, eppure eguaglia o supera modelli molto più grandi su Terminal-Bench 2.1 e SWE-Bench Pro.

• Pesi aperti e auto-ospitabili. Pesi su Hugging Face (poolside/Laguna-S-2.1) — puoi eseguirlo nel tuo ambiente.

• La modalità di pensiero guida i punteggi. Il pensiero massimo porta DeepSWE dal 16,5% al 40,4% — potente, ma consuma token di ragionamento, quindi mettilo a budget.

• Non il numero 1 assoluto. I flagship di frontiera chiusi (Fable 5, Opus 5, Kimi K3) sono ancora in testa in diversi benchmark di codifica assoluti; la rivendicazione di Laguna riguarda la classe di peso e il prezzo, non la vetta della classifica.

Una nota sulla lettura di questo brief: tutto ciò che è attribuito a Poolside è un'affermazione del fornitore tratta dai materiali di lancio; laddove un benchmark sia indipendente, ne citiamo la fonte. Se un punteggio indipendente di intelligenza generale non è pubblicato, lo diciamo invece di fare supposizioni — Laguna è uno specialista nella programmazione, non un leader delle classifiche generaliste.

Cosa è realmente Laguna S 2.1

Laguna S 2.1 è il modello di codifica agentivo e a pesi aperti di Poolside. Dal punto di vista architetturale è una miscela di esperti: 118 miliardi di parametri totali, ma solo circa 8 miliardi attivati per token, motivo per cui è economico da servire rispetto alle sue capacità. Supporta un contesto fino a 1 milione di token e due modalità operative: un percorso rapido "senza pensiero" e un percorso "con pensiero" che spende token di ragionamento extra per problemi più difficili. È progettato per codifica e lavoro agentivo: uso di strumenti, chiamate di funzione, attività multi-step. Poolside offre anche un fratello minore, Laguna XS 2.1 (33B totali / ~3B attivi), a un prezzo ancora più basso di $0,06 / $0,12.

Fondamentalmente, i pesi sono aperti e pubblicati su Hugging Face, quindi a differenza di un modello API chiuso puoi scaricare Laguna S 2.1, eseguirlo nella tua infrastruttura, metterlo a punto e fissare una versione. Questa combinazione — coding di frontiera, numero ridottissimo di parametri attivi, pesi aperti e un prezzo bassissimo — è l'intera proposta, ed è il motivo per cui Poolside lo presenta come la risposta dell'Occidente ai potenti modelli aperti di DeepSeek e Qwen.

Novità: i benchmark

I numeri del lancio riguardano tutti la programmazione. Su SWE-Bench Multilingual, Poolside riporta il 78,5%, che secondo l'azienda è il miglior risultato tra i modelli open source con dimensione dichiarata. Su Terminal-Bench 2.1 ottiene il 70,2%. Su DeepSWE v1.1 raggiunge il 40,4% — e il confronto più sorprendente di Poolside è che questo batte il 9,0% di DeepSeek-V4-Pro-Max sullo stesso test con circa un sesto dei parametri attivi. Su Terminal-Bench 2.1 e SWE-Bench Pro, Poolside afferma che Laguna S 2.1 eguaglia o supera modelli di dimensioni diverse volte superiori, tra cui DeepSeek V4 Flash, NVIDIA Nemotron 3 Ultra e Thinking Machines Inkling.

La cornice onesta che Poolside stesso utilizza riguarda la classe di peso, non la supremazia assoluta: modelli frontier chiusi come Claude Fable 5 e Kimi K3 sono ancora in testa in diversi benchmark. Quindi il modo corretto di interpretare Laguna S 2.1 è "la maggiore capacità che si possa ottenere da un modello aperto, ~8B-active, a buon mercato", non "il miglior programmatore in assoluto".

Modalità di pensiero: da dove proviene la performance

I punteggi headline di Laguna S 2.1 si basano fortemente sulla sua modalità "max thinking". L'esempio più chiaro è DeepSWE v1.1, dove il punteggio sale dal 16,5% senza thinking al 40,4% con max thinking — la maggior parte della forza del modello nei benchmark deriva dal lasciarlo ragionare. Terminal-Bench 2.1 mostra lo stesso schema (60,4% → 70,2%). Questo è importante per costi e latenza: la modalità thinking consuma token di ragionamento extra, quindi mentre il prezzo per token è minimo, un task complesso eseguito al massimo del thinking usa più token (e richiede più tempo) rispetto al percorso senza thinking. In pratica, eseguirai le completazioni di routine in modalità no-thinking per velocità e costo, e passerai a thinking solo per i problemi difficili e multi-step dove il salto di accuratezza vale i token — un'eco specifica del coding dei quadranti di sforzo che appaiono sui modelli di frontiera.

Approfondimento del benchmark: cosa misurano questi test di programmazione

SWE-Bench Multilingual estende il noto SWE-bench (che risolve problemi reali di GitHub) attraverso più linguaggi di programmazione, quindi il 78.5% è un forte segnale di correzione di bug pratica e cross-linguaggio — e "guida modelli di dimensioni aperte e divulgate" è un'affermazione significativa, seppur dichiarata dal fornitore. Terminal-Bench 2.1 testa se un modello può operare un terminale reale per completare attività dall'inizio alla fine, il che è più vicino a ciò che un agente di codifica autonomo fa effettivamente rispetto a un completamento di codice singolo. DeepSWE v1.1 è una suite di ingegneria del software agentica più difficile; il 40.4% (contro il 9.0% di DeepSeek-V4-Pro-Max) è il numero più appariscente di Laguna proprio perché rappresenta un grande divario rispetto a un modello molto più grande.

Il caveat che mantiene questo onesto: questi sono risultati eseguiti da Poolside al momento del lancio, e non esiste ancora un indice Artificial Analysis Intelligence pubblicato o una cifra indipendente SWE-bench Verified per Laguna S 2.1. Quindi considera le affermazioni di leadership come riportate dal fornitore finché una terza parte non le conferma, e ricorda che Laguna è uno specialista della codifica — non è posizionato come leader del ragionamento generico, e non dovresti aspettarti che sia in cima a un indice di intelligenza generale.

Quanto costa in pratica

È qui che Laguna S 2.1 è veramente dirompente. A $0.10 di input / $0.20 di output per 1 milione di token, una chiamata di codifica rappresentativa di 15,000 token in input e 3,000 token in output costa 15k × $0.10/1M + 3k × $0.20/1M = $0.0015 + $0.0006 = circa $0.0021 — all'incirca un quinto di centesimo. La stessa chiamata su un modello all'avanguardia come Claude Opus 5 ($5/$25) costa circa $0.15 — quasi 70 volte di più. Persino rispetto a rivali economici, Laguna sottocosta: si posiziona al di sotto dei prezzi di DeepSeek. L'asterisco è la modalità pensiero — un compito difficile con pensiero massimo può generare diverse volte più token di output, quindi una chiamata da "$0.0006 di output" potrebbe diventare di qualche centesimo. Ma anche gonfiato, il costo è un errore di arrotondamento rispetto ai modelli chiusi all'avanguardia. Per l'automazione di codifica ad alto volume — bot CI, refactoring in blocco, flotte di agenti — l'economia è difficile da contestare, soprattutto perché puoi anche auto-ospitare per eliminare completamente il costo per token.

Come accedere ed eseguire Laguna S 2.1

Poiché i pesi sono aperti, hai due strade. Puoi chiamarlo tramite provider ospitati (appare su aggregatori come OpenRouter) al costo di $0,10/$0,20, che è il modo più rapido per provarlo. Oppure puoi scaricare i pesi da Hugging Face (poolside/Laguna-S-2.1) e auto-ospitarli — mantenendo codice e dati nel tuo ambiente, ottimizzando sui tuoi repository, quantizzando per il tuo hardware e limitando i costi alla tua infrastruttura. La variante XS (33B-A3B) è l'opzione quando vuoi eseguire qualcosa di ancora più piccolo ed economico localmente. In entrambi i casi, espone l'uso di strumenti e la chiamata di funzioni, quindi si inserisce in harness di codifica agentici.

A chi è rivolto: tre scenari

1. Automazione della codifica ad alto volume con un budget limitato

Se gestisci bot di correzione automatica per CI, migrazioni di massa o grandi flotte di agenti dove il costo dei token si accumula, il prezzo di Laguna S 2.1 è trasformativo: usa la modalità 'senza pensiero' per il lavoro di routine e la modalità 'con pensiero' per i casi difficili. Questo è il suo caso d'uso più forte.

2. Team che devono auto-ospitare modelli di codice

Per le organizzazioni che non possono inviare codice proprietario a un'API chiusa, un codificatore open-weight che guida la sua classe dimensionale è esattamente ciò che mancava. Laguna S 2.1 (o XS per hardware più piccolo) ti offre una codifica quasi di frontiera che controlli completamente.

3. Startup attente ai costi che sviluppano prodotti di codifica

Se i tuoi margini di prodotto dipendono dal costo dell'inferenza, Laguna ti permette di offrire funzionalità di codifica AI a una frazione dei prezzi frontier — riservando un modello flagship frontier solo per le richieste più difficili che i tuoi utenti incontrano.

Quando non usarlo

Non ricorrere a Laguna S 2.1 quando hai bisogno della migliore accuratezza di codifica assoluta e puoi permettertela — i modelli closed frontier (il 95.0% SWE-bench Verified di Fable 5, il #1 indice generale di Opus 5, il #1 Frontend Coding Arena di Kimi K3) sono ancora in testa in diversi benchmark. Non usarlo per ragionamenti generici, compiti multimodali o non di codifica — è uno specialista di codifica senza un pedigree di intelligenza generale. E non dare per scontato che i numeri di punta valgano in modalità no-thinking; se disabiliti il pensiero per risparmiare, fai il benchmark dei punteggi più bassi che otterrai realmente.

Checklist decisionale

• Scegli Laguna S 2.1 se: vuoi il codificatore open-weight capace più economico, devi ospitarlo tu stesso, o esegui automazione di codifica ad alto volume dove il costo domina.

Scegli invece un modello di punta se: hai bisogno della massima accuratezza assoluta nella codifica, del ragionamento generale o della multimodalità — e puoi permettertelo.

• Esegui entrambi se: codifica di routine predefinita a Laguna e delega i compiti più difficili a un modello di frontiera, dietro un singolo endpoint.

Domande frequenti

Quanto costa Laguna S 2.1?

$0.10 per 1M token in input e $0.20 per 1M token in output — con un modello più piccolo Laguna XS 2.1 a $0.06 / $0.12. È uno dei modelli di codifica più economici disponibili, ed essendo open-weight puoi ospitarlo da solo per eliminare il costo per token. [OpenRouter/BenchLM]

Laguna S 2.1 è open source?

È open-weight: i pesi del modello sono pubblicati su Hugging Face (poolside/Laguna-S-2.1), quindi puoi scaricarli, eseguirli e metterli a punto. Controlla la licenza di Poolside per il tuo uso specifico.

È meglio di DeepSeek o Qwen per la programmazione?

Poolside lo presenta come la risposta dell'Occidente a loro e riporta di aver battuto DeepSeek-V4-Pro-Max su DeepSWE (40,4% contro 9,0%) con molti meno parametri attivi. Su benchmark di codifica aperti e di dimensioni dichiarate è in testa secondo Poolside — ma questi sono gestiti dal fornitore, quindi convalidate sui vostri repository.

Supera i modelli frontier?

Non completamente. I flagship chiusi come Claude Fable 5, Claude Opus 5 e Kimi K3 continuano a guidare diversi benchmark assoluti. La rivendicazione di Laguna è la migliore nella sua classe di peso e il miglior rapporto qualità-prezzo, non il migliore in assoluto.

Cos'è la modalità di pensiero?

Un interruttore tra un percorso veloce senza pensiero e un percorso di massimo pensiero che spende token di ragionamento extra per una maggiore precisione (ad esempio, DeepSWE 16.5% → 40.4%). Usa senza pensiero per il lavoro di routine, pensiero per compiti difficili.

Qual è la finestra di contesto?

Fino a 1 milione di token, quindi grandi codebase e lunghi trascritti di agenti sono adatti.

Dovrei usare S o XS?

Laguna S 2.1 (118B/8B) per la codifica più potente; Laguna XS 2.1 (33B/3B) quando vuoi qualcosa di più piccolo ed economico da auto-ospitare o servire a volumi molto elevati.

Il risultato finale

Laguna S 2.1 è il modello di coding open-weight più convincente della sua categoria fino ad oggi: un MoE da 118B/8B con fino a 1M di contesto e un thinking toggle, proposto a un prezzo notevole di $0,10 / $0,20, che secondo Poolside supera i modelli open con dimensioni dichiarate su SWE-Bench Multilingual (78,5%) e batte rivali molto più grandi nei test di coding agentico. Non è il miglior codificatore in assoluto — i flagship chiusi di frontiera guidano ancora diversi benchmark — e i suoi punteggi principali si basano sulla modalità di pensiero, che consuma token. Ma per coding a basso costo, auto-ospitabile e ad alto volume, nulla nella sua classe di peso può competere. Instradate Laguna S 2.1 insieme a ogni flagship di frontiera attraverso un unico endpoint compatibile con OpenAI su OrcaRouter e inviategli la maggior parte del vostro traffico di coding, inoltrando solo i compiti più difficili.

© 2026 OrcaRouter

Per i provider

Gestisci una piattaforma di inferenza? Porta i tuoi modelli su OrcaRouter.

Contattaci

Unisciti alla community

DiscordEmailXGitHubYouTube