Laguna S 2.1: Modelo de Codificação de Peso Aberto da Poolside que Bate Muito Acima do Seu Peso (e Preço)
Guides & Insights

Laguna S 2.1: Modelo de Codificação de Peso Aberto da Poolside que Bate Muito Acima do Seu Peso (e Preço)

Autor

jinhao song

Data de publicação

Modelos mais recentes · 20Ver todos os modelos
Benchmarks: Artificial Analysis · atualizado diariamente
Voltar para todas as publicações

Em 21 de julho de 2026, a Poolside lançou Laguna S 2.1 — um modelo de codificação de pesos abertos com 118 bilhões de parâmetros, mas apenas cerca de 8 bilhões de parâmetros ativos por token — e o apresentou como "o modelo de pesos abertos mais capaz do Ocidente" e sua resposta para DeepSeek e Qwen. O destaque não é que ele supera todos os sistemas fechados de fronteira; é que ele supera modelos muitas vezes maiores que ele em benchmarks de codificação agentiva, custando $0,10 / $0,20 por milhão de tokens. Este guia aborda o que realmente é o Laguna S 2.1, seu modo de pensamento, o que é relatado de forma independente versus pelo fornecedor, quanto custa, como executá-lo e quem deve usá-lo.

Cada figura abaixo é rotulada por fonte. As pontuações principais da Laguna são reportadas pelo Poolside (a partir de seus materiais de lançamento e cartão do Hugging Face), a menos que um terceiro nomeado seja citado; trate-as como administradas pelo fornecedor até que laboratórios independentes confirmem. Benchmarks e preços mudam — verifique antes de comprometer o orçamento.

Resumo. O Laguna S 2.1 é um modelo de codificação MoE de pesos abertos (118B total / ~8B ativos) com até 1M de contexto e um alternador "pensar / não pensar", com preço de apenas $0,10 de entrada / $0,20 de saída por 1M de tokens — uma fração da maioria dos concorrentes. A Poolside relata 78,5% no SWE-Bench Multilíngue (líder entre modelos abertos de tamanho divulgado), 70,2% no Terminal-Bench 2.1 e 40,4% no DeepSWE v1.1 (contra 9,0% do DeepSeek-V4-Pro-Max) — com aproximadamente um sexto dos parâmetros ativos. É a melhor opção de codificação por dólar entre modelos de pesos abertos que vimos, mas modelos fechados de fronteira como Claude Fable 5Claude Opus 5e Kimi K3ainda lideram em vários benchmarks absolutos. Se você quer um codificador barato e auto-hospedável que supera sua classe de peso, o Laguna S 2.1 é a escolha; se você precisa da maior precisão absoluta em codificação, um carro-chefe de fronteira ainda vence.

Principais conclusões

• Melhor codificação open-weight por dólar. $0.10/$0.20 por 1 milhão de tokens para um modelo que lidera modelos abertos de tamanho divulgado no SWE-Bench Multilingual (78,5%).

• Supera seu peso. ~8B de parâmetros ativos, mas iguala ou supera modelos muito maiores no Terminal-Bench 2.1 e no SWE-Bench Pro.

• Peso aberto e auto-hospedável. Pesos no Hugging Face (poolside/Laguna-S-2.1) — você pode executá-lo no seu próprio ambiente.

• O modo de pensamento impulsiona as pontuações. O pensamento máximo eleva o DeepSWE de 16.5% para 40.4% — poderoso, mas gasta tokens de raciocínio, então aloque orçamento para isso.

• Não o #1 absoluto. Os principais modelos da fronteira fechada (Fable 5, Opus 5, Kimi K3) ainda lideram vários benchmarks absolutos de codificação; a alegação da Laguna é classe de peso e preço, não o topo da tabela.

Uma nota sobre a leitura deste resumo: tudo o que é atribuído à Poolside é uma declaração do fornecedor a partir de materiais de lançamento; quando um benchmark é independente, nomeamos a fonte. Quando uma pontuação independente de inteligência geral não é publicada, dizemos isso em vez de adivinhar — a Laguna é uma especialista em codificação, não uma líder de placar de propósito geral.

O que Laguna S 2.1 realmente é

Laguna S 2.1 é o modelo de codificação agêntico e de pesos abertos da Poolside. Arquiteturalmente, é uma mistura de especialistas: 118B parâmetros no total, mas apenas cerca de 8B ativados por token, e é por isso que é barato de servir em relação à sua capacidade. Ele suporta até um contexto de 1M-token e dois modos de operação — um caminho rápido "no-thinking" e um caminho "thinking" que gasta tokens extras de raciocínio para problemas mais difíceis. Ele é construído para codificação e trabalho agêntico: uso de ferramentas, chamada de funções, tarefas de múltiplas etapas. A Poolside também oferece um irmão menor, o Laguna XS 2.1 (33B total / ~3B ativos), a um preço ainda mais baixo de $0.06 / $0.12.

Crucialmente, os pesos são abertos e publicados no Hugging Face, então, ao contrário de um modelo de API fechado, você pode baixar o Laguna S 2.1, executá-lo em sua própria infraestrutura, ajustá-lo finamente e fixar uma versão. Essa combinação — codificação próxima da fronteira, contagem minúscula de parâmetros ativos, pesos abertos e um preço baixíssimo — é toda a proposta, e é por isso que a Poolside a enquadra como a resposta do Ocidente para os modelos abertos fortes da DeepSeek e Qwen.

Novidades: os benchmarks

Os números de lançamento são todos sobre codificação. No SWE-Bench Multilingual, a Poolside relata 78,5%, o que, segundo ela, lidera modelos abertos de tamanho divulgado. No Terminal-Bench 2.1, ela obtém 70,2%. No DeepSWE v1.1, atinge 40,4% — e a comparação mais impressionante da Poolside é que isso supera os 9,0% do DeepSeek-V4-Pro-Max no mesmo teste com aproximadamente um sexto dos parâmetros ativos. No Terminal-Bench 2.1 e no SWE-Bench Pro, a Poolside afirma que o Laguna S 2.1 iguala ou supera modelos várias vezes maiores, incluindo DeepSeek V4 Flash, o Nemotron 3 Ultra da NVIDIA e o Inkling da Thinking Machines.

O enquadramento honesto que o próprio Poolside usa é sobre classe de peso, não supremacia absoluta: modelos de fronteira fechados como Claude Fable 5 e Kimi K3 ainda lideram em vários benchmarks. Portanto, a maneira correta de ler Laguna S 2.1 é "a maior capacidade que você pode obter de um modelo aberto, ~8B ativo, extremamente barato", não "o melhor programador, ponto final".

Thinking mode: where the performance comes from

Os principais resultados da Laguna S 2.1 dependem fortemente do modo "max thinking". O exemplo mais claro é o DeepSWE v1.1, onde a pontuação salta de 16,5% sem thinking para 40,4% com max thinking — a maior parte da força do modelo em benchmarks vem de permitir que ele raciocine. O Terminal-Bench 2.1 mostra o mesmo padrão (60,4% → 70,2%). Isso é importante para custo e latência: o modo thinking gasta tokens extras de raciocínio, então, embora o preço por token seja pequeno, uma tarefa difícil executada com max thinking usa mais tokens (e leva mais tempo) do que o caminho sem thinking. Na prática, você executaria conclusões rotineiras no modo no-thinking para velocidade e custo, e mudaria para thinking apenas para os problemas difíceis e de várias etapas, onde o salto de precisão vale os tokens — um eco específico de codificação dos dials de esforço que aparecem em modelos de fronteira.

O mergulho profundo no benchmark: o que esses testes de codificação medem

SWE-Bench Multilingual estende o conhecido SWE-bench (resolução de problemas reais do GitHub) por várias linguagens de programação, portanto 78.5% é um forte sinal de correção prática e multilíngue de bugs — e "leads open disclosed-size models" é uma afirmação significativa, ainda que declarada pelo fornecedor. Terminal-Bench 2.1 testa se um modelo pode operar um terminal real para completar tarefas de ponta a ponta, o que está mais próximo do que um agente autônomo de codificação realmente faz do que um completamento de código de uma única tentativa. DeepSWE v1.1 é um conjunto de engenharia de software agentic mais difícil; os 40.4% (contra os 9.0% do DeepSeek-V4-Pro-Max) são o número mais chamativo da Laguna precisamente porque é uma grande lacuna em relação a um modelo muito maior.

O aviso que mantém isso honesto: esses são resultados administrados pela Poolside na data do lançamento, e ainda não há um Índice de Inteligência de Análise Artificial publicado ou um número independente do SWE-bench Verified para o Laguna S 2.1. Portanto, trate as alegações de liderança como relatadas pelo fornecedor até que um terceiro as confirme, e lembre-se de que o Laguna é um especialista em codificação — ele não se posiciona como um líder de raciocínio de uso geral, e você não deve esperar que ele supere um índice de inteligência geral.

O que custa na prática

É aqui que o Laguna S 2.1 é genuinamente disruptivo. Com $0,10 de entrada / $0,20 de saída por 1M de tokens, uma chamada de codificação representativa de 15.000 tokens de entrada e 3.000 tokens de saída custa 15k × $0,10/1M + 3k × $0,20/1M = $0,0015 + $0,0006 = cerca de $0,0021 — aproximadamente um quinto de centavo. A mesma chamada em um modelo de fronteira como o Claude Opus 5 ($5/$25) custa cerca de $0,15 — quase 70 vezes mais. Mesmo contra rivais baratos, o Laguna subcotiza: está posicionado abaixo do preço do DeepSeek. O asterisco é o modo de pensamento — uma tarefa difícil no máximo de pensamento pode gerar várias vezes mais tokens de saída, então uma chamada de "$0,0006 de saída" pode se tornar alguns centavos. Mas mesmo inflado, o custo é um erro de arredondamento em comparação com modelos fechados de fronteira. Para automação de codificação em alto volume — bots de CI, refatorações em lote, frotas de agentes — a economia é difícil de contestar, especialmente porque você também pode auto-hospedar para eliminar completamente o custo por token.

Como acessar e executar o Laguna S 2.1

Porque os pesos são abertos, você tem dois caminhos. Pode usá-lo por meio de provedores hospedados (aparece em agregadores como OpenRouter) com a taxa de $0,10/$0,20, que é a maneira mais rápida de testá-lo. Ou pode baixar os pesos do Hugging Face (poolside/Laguna-S-2.1) e auto-hospedar — mantendo código e dados no seu ambiente, fazendo fine-tuning nos seus repositórios, quantizando para o seu hardware e limitando o custo à sua infraestrutura. A variante XS (33B-A3B) é a opção para quando deseja executar algo ainda menor e mais barato localmente. De qualquer forma, ela expõe uso de ferramentas e chamadas de função, então se encaixa em harnesses de codificação agentiva.

Para quem é: três cenários.

1. Automação de codificação de alto volume com orçamento limitado

Se você executa bots de correção de CI, migrações em massa ou grandes frotas de agentes onde o custo de tokens aumenta, o preço do Laguna S 2.1 é transformador — execute sem pensamento para tarefas rotineiras e com pensamento para os casos difíceis. Este é o seu caso de uso mais forte.

2. Equipes que precisam auto-hospedar modelos de código

Para organizações que não podem enviar código proprietário para uma API fechada, um codificador de peso aberto que lidera sua classe de tamanho é exatamente o que estava faltando. Laguna S 2.1 (ou XS para hardware menor) oferece a você codificação adjacente à fronteira que você controla totalmente.

3. Startups sensíveis a custos que constroem produtos de codificação

Se suas margens de produto dependem do custo de inferência, a Laguna permite que você ofereça recursos de codificação de IA a uma fração dos preços frontier — reservando um carro-chefe frontier apenas para as solicitações mais difíceis que seus usuários enfrentam.

Quando não usá-lo

Não recorra ao Laguna S 2.1 quando precisar da melhor precisão absoluta em codificação e puder pagar por ela — modelos frontier fechados (Fable 5 com 95,0% no SWE-bench Verified, Opus 5 com #1 no índice geral, Kimi K3 com #1 no Frontend Coding Arena) ainda lideram vários benchmarks. Não o use para raciocínio de uso geral, multimodal ou tarefas não relacionadas a código — é um especialista em codificação sem pedigree de inteligência geral. E não presuma que os números de destaque se mantenham no modo sem raciocínio; se você desativar o raciocínio para economizar custos, avalie as pontuações mais baixas que realmente obterá.

Lista de verificação de decisões

• Escolha Laguna S 2.1 se: você quer o codificador open-weight capaz mais barato, você deve auto-hospedar, ou você executa automação de codificação de alto volume onde o custo domina.

• Escolha um carro-chefe de fronteira se: você precisa da melhor precisão de codificação, raciocínio geral ou multimodal — e pode pagar por isso.

• Execute ambos se: codificação de rotina padrão para Laguna e escalar as tarefas mais difíceis para um modelo de fronteira, por trás de um único endpoint.

Perguntas Frequentes

Quanto custa o Laguna S 2.1?

$0,10 por 1M tokens de entrada e $0,20 por 1M tokens de saída — com o menor Laguna XS 2.1 a $0,06 / $0,12. É um dos modelos de codificação mais baratos e capazes disponíveis e, por ser de pesos abertos, você pode hospedar por conta própria para eliminar o custo por token. [OpenRouter/BenchLM]

O Laguna S 2.1 é código aberto?

É de pesos abertos: os pesos do modelo são publicados no Hugging Face (poolside/Laguna-S-2.1), então você pode baixar, executar e ajustá-lo. Verifique a licença do Poolside para o seu uso específico.

É melhor que o DeepSeek ou o Qwen para programação?

Poolside posiciona-o como a resposta do Ocidente a eles e relata ter superado o DeepSeek-V4-Pro-Max no DeepSWE (40,4% vs 9,0%) com muito menos parâmetros ativos. Em benchmarks de codificação abertos e com tamanho divulgado, ele lidera de acordo com a Poolside — mas estes são conduzidos pelo fornecedor, então valide em seus próprios repositórios.

Isso supera os modelos de fronteira?

Não totalmente. Flagships fechados como Claude Fable 5, Claude Opus 5 e Kimi K3 ainda lideram vários benchmarks absolutos. A alegação da Laguna é a melhor em sua classe de peso e a melhor pelo preço, não a melhor no geral.

O que é o modo de pensamento?

Um alternador entre um caminho rápido de no-thinking e um caminho de max-thinking que gasta tokens extras de raciocínio para maior precisão (por exemplo, DeepSWE 16,5% → 40,4%). Use no-thinking para trabalho rotineiro, thinking para tarefas difíceis.

Qual é a janela de contexto?

Até 1 milhão de tokens, então bases de código grandes e transcrições longas de agentes cabem.

Devo usar S ou XS?

Laguna S 2.1 (118B/8B) para a codificação mais forte; Laguna XS 2.1 (33B/3B) quando você quer algo menor e mais barato para auto-hospedar ou servir em volume muito alto.

Conclusão

Laguna S 2.1 é o modelo de código aberto de peso mais convincente do seu tamanho até hoje: um MoE de 118B/8B com até 1M de contexto e um alternador de pensamento, com preço notável de $0,10 / $0,20, que, segundo a Poolside, lidera os modelos de tamanho divulgado no SWE-Bench Multilingual (78,5%) e supera concorrentes muito maiores em testes de codificação agentiva. Não é o melhor codificador absoluto — os carros-chefe fechados ainda lideram vários benchmarks — e seus resultados principais dependem do modo de pensamento, que consome tokens. Mas para codificação barata, auto-hospedável e de alto volume, nada em sua classe de peso compete. Roteie o Laguna S 2.1 junto com todos os carros-chefe de fronteira através de um único endpoint compatível com OpenAI no OrcaRouter e envie a maior parte do seu tráfego de codificação, escalando apenas as tarefas mais difíceis.

© 2026 OrcaRouter

Para provedores

Opera uma plataforma de inferência? Traga seus modelos para o OrcaRouter.

Fale conosco

Junte-se à comunidade

DiscordEmailXGitHubYouTube