Laguna S 2.1: El modelo de codificación de peso abierto de Poolside que golpea muy por encima de su peso (y precio)
Guides & Insights

Laguna S 2.1: El modelo de codificación de peso abierto de Poolside que golpea muy por encima de su peso (y precio)

Autor

jinhao song

Fecha de publicación

Últimos modelos · 20Ver todos los modelos
Benchmarks: Artificial Analysis · actualizado a diario
Volver a todas las publicaciones

El 21 de julio de 2026, Poolside lanzó Laguna S 2.1 — un modelo de codificación de pesos abiertos con 118 mil millones de parámetros y solo unos 8 mil millones de parámetros activos por token — y lo presentó como "el modelo de pesos abiertos más capaz de Occidente" y su respuesta a DeepSeek y Qwen. El titular no es que supera a todos los sistemas fronterizos cerrados; es que supera a modelos muchas veces más grandes en benchmarks de codificación agentiva a un costo de $0.10 / $0.20 por millón de tokens. Esta guía cubre qué es realmente Laguna S 2.1, su modo de pensamiento, qué es reportado de forma independiente versus por el vendedor, cuánto cuesta, cómo ejecutarlo y quién debería usarlo.

Cada figura a continuación está etiquetada por fuente. Las puntuaciones principales de Laguna son reportadas por Poolside (a partir de sus materiales de lanzamiento y la tarjeta de Hugging Face) a menos que se cite a un tercero nombrado; trátelas como gestionadas por el proveedor hasta que laboratorios independientes las confirmen. Los puntos de referencia y los precios cambian: verifique antes de comprometer su presupuesto.

TL;DR. Laguna S 2.1 es un modelo de codificación MoE de peso abierto (118B total / ~8B activos) con hasta 1M de contexto y un conmutador "pensamiento / sin pensamiento", con un precio de solo $0.10 de entrada / $0.20 de salida por 1M de tokens — una fracción de la mayoría de los rivales. Poolside informa 78.5% en SWE-Bench Multilingual (líder entre modelos abiertos de tamaño conocido), 70.2% en Terminal-Bench 2.1 y 40.4% en DeepSWE v1.1 (frente al 9.0% de DeepSeek-V4-Pro-Max) — aproximadamente una sexta parte de los parámetros activos. Es la mejor opción de codificación por dólar en peso abierto que hemos visto, pero los modelos frontera cerrados como Claude Fable 5, Claude Opus 5 y Kimi K3 todavía lideran en varios benchmarks absolutos. Si quieres un codificador barato y autoinstalable que supere a su categoría de peso, Laguna S 2.1 es la historia; si necesitas la máxima precisión de codificación, un buque insignia frontera sigue ganando.

Conclusiones clave

• Mejor codificación de peso abierto por dólar. $0.10/$0.20 por 1M de tokens para un modelo que lidera modelos abiertos de tamaño revelado en SWE-Bench Multilingual (78.5%).

• Golpea por encima de su peso. ~8 mil millones de parámetros activos, pero iguala o supera a modelos mucho más grandes en Terminal-Bench 2.1 y SWE-Bench Pro.

• Pesos abiertos y autoalojable. Pesos en Hugging Face (poolside/Laguna-S-2.1) — puedes ejecutarlo en tu propio entorno.

• El modo de pensamiento impulsa las puntuaciones. El pensamiento máximo eleva DeepSWE del 16.5% al 40.4% — poderoso, pero consume tokens de razonamiento, así que presupueste para ello.

• No es el número uno indiscutible. Los buques insignia de Closed Frontier (Fable 5, Opus 5, Kimi K3) siguen liderando varios puntos de referencia de codificación absolutos; el reclamo de Laguna es la categoría de peso y el precio, no la cima de la tabla.

Una nota sobre la lectura de este resumen: todo lo atribuido a Poolside es una afirmación del proveedor extraída de materiales de lanzamiento; cuando un punto de referencia es independiente, mencionamos la fuente. Cuando no se publica una puntuación independiente de inteligencia general, lo decimos en lugar de adivinar — Laguna es un especialista en codificación, no un líder en tablas de clasificación de propósito general.

Qué es realmente Laguna S 2.1

Laguna S 2.1 es el modelo de codificación agéntico y de pesos abiertos de Poolside. Arquitectónicamente es una mezcla de expertos: 118B parámetros en total, pero solo unos 8B activados por token, por lo que es económico de servir en relación con su capacidad. Soporta hasta un contexto de 1 millón de tokens y dos modos de operación: una ruta rápida «sin pensamiento» y una ruta de «pensamiento» que gasta tokens de razonamiento adicionales para problemas más difíciles. Está diseñado para codificación y trabajo agéntico: uso de herramientas, llamadas a funciones, tareas de múltiples pasos. Poolside también lanza un hermano más pequeño, Laguna XS 2.1 (33B total / ~3B activos), a un precio aún más bajo de $0.06 / $0.12.

Crucialmente, los pesos son abiertos y están publicados en Hugging Face, por lo que, a diferencia de un modelo de API cerrada, puedes descargar Laguna S 2.1, ejecutarlo en tu propia infraestructura, ajustarlo y fijar una versión. Esa combinación — programación cercana a la vanguardia, un número minúsculo de parámetros activos, pesos abiertos y un precio increíblemente bajo — es toda la propuesta, y es por eso que Poolside lo presenta como la respuesta de Occidente a los modelos abiertos fuertes de DeepSeek y Qwen.

Novedades: los benchmarks

Las cifras de lanzamiento giran en torno a la codificación. En SWE-Bench Multilingual, Poolside reporta un 78,5%, lo que, según afirma, lidera entre los modelos abiertos de tamaño conocido. En Terminal-Bench 2.1 obtiene un 70,2%. En DeepSWE v1.1 alcanza un 40,4% — y la comparación más impactante de Poolside es que esto supera el 9,0% de DeepSeek-V4-Pro-Max en la misma prueba con aproximadamente una sexta parte de los parámetros activos. En Terminal-Bench 2.1 y SWE-Bench Pro, Poolside afirma que Laguna S 2.1 iguala o supera modelos varias veces su tamaño, incluidos DeepSeek V4 Flash, NVIDIA's Nemotron 3 Ultra, y Thinking Machines' Inkling.

El marco honesto que utiliza Poolside en sí mismo es sobre clase de peso, no supremacía absoluta: los modelos fronterizos cerrados como Claude Fable 5 y Kimi K3 aún lideran varios benchmarks. Por lo tanto, la forma correcta de interpretar Laguna S 2.1 es "la mayor capacidad que puedes obtener de un modelo abierto, de ~8B activos y súper barato", no "el mejor programador y punto".

Modo de pensamiento: de dónde proviene el rendimiento

Las puntuaciones principales de Laguna S 2.1 dependen en gran medida de su modo de "pensamiento máximo". El ejemplo más claro es DeepSWE v1.1, donde la puntuación salta del 16.5% sin pensamiento al 40.4% con pensamiento máximo — la mayor parte de la fortaleza del modelo en benchmarks proviene de permitirle razonar. Terminal-Bench 2.1 muestra el mismo patrón (60.4% → 70.2%). Esto es importante para el costo y la latencia: el modo de pensamiento gasta tokens de razonamiento adicionales, por lo que aunque el precio por token es mínimo, una tarea difícil ejecutada con pensamiento máximo usa más tokens (y tarda más) que la ruta sin pensamiento. En la práctica, ejecutarías las finalizaciones rutinarias en modo sin pensamiento para velocidad y costo, y cambiarías al modo de pensamiento solo para los problemas difíciles de múltiples pasos donde el salto de precisión vale los tokens — un eco específico de codificación de los diales de esfuerzo que aparecen en los modelos fronterizos.

El análisis exhaustivo del benchmark: qué miden estas pruebas de codificación

SWE-Bench Multilingualextiende el conocido SWE-bench (que resuelve problemas reales de GitHub) a múltiples lenguajes de programación, por lo que un 78.5% es una fuerte señal de corrección de errores práctica y multilingüe — y "leads open disclosed-size models" es una afirmación significativa, aunque declarada por el proveedor. Terminal-Bench 2.1prueba si un modelo puede operar una terminal real para completar tareas de principio a fin, lo cual está más cerca de lo que realmente hace un agente de codificación autónomo que una finalización de código de un solo intento. DeepSWE v1.1es un conjunto de herramientas de ingeniería de software agéntico más difícil; el 40.4% (frente al 9.0% de DeepSeek-V4-Pro-Max) es el número más llamativo de Laguna precisamente porque es una gran brecha contra un modelo mucho más grande.

La advertencia que mantiene esto honesto: estos son resultados ejecutados por Poolside hasta la fecha de lanzamiento, y aún no hay un Índice de Inteligencia de Análisis Artificial publicado ni una cifra independiente de SWE-bench Verified para Laguna S 2.1. Así que trate las afirmaciones de liderazgo como reportadas por el proveedor hasta que un tercero las confirme, y recuerde que Laguna es un especialista en codificación — no está posicionado como un líder en razonamiento de propósito general, y no debe esperar que encabece un índice de inteligencia general.

Lo que cuesta en la práctica

Aquí es donde Laguna S 2.1 es genuinamente disruptivo. A $0.10 de entrada / $0.20 de salida por 1M de tokens, una llamada de codificación representativa de 15,000 tokens de entrada y 3,000 tokens de salida cuesta 15k × $0.10/1M + 3k × $0.20/1M = $0.0015 + $0.0006 = aproximadamente $0.0021 — más o menos una quinta parte de un centavo. La misma llamada en un modelo de frontera como Claude Opus 5 ($5/$25) cuesta unos $0.15 — casi 70× más. Incluso frente a rivales baratos, Laguna supera en precio: se sitúa por debajo del precio de DeepSeek. El asterisco es el modo de pensamiento — una tarea difícil con el pensamiento máximo puede generar varias veces más tokens de salida, por lo que una llamada de "$0.0006 de salida" podría convertirse en unos pocos centavos. Pero incluso inflado, el costo es un error de redondeo comparado con los modelos cerrados de frontera. Para la automatización de codificación de alto volumen — bots de CI, refactorizaciones masivas, flotas de agentes — la economía es difícil de discutir, especialmente porque también puedes auto-alojarlo para eliminar el costo por token por completo.

Cómo acceder y ejecutar Laguna S 2.1

Debido a que los pesos son abiertos, tienes dos caminos. Puedes usarlo a través de proveedores alojados (aparece en agregadores como OpenRouter) con la tarifa de $0.10/$0.20, que es la forma más rápida de probarlo. O puedes descargar los pesos desde Hugging Face (poolside/Laguna-S-2.1) y autoalojarlo, manteniendo el código y los datos en tu entorno, ajustándolo en tus repositorios, cuantizándolo para tu hardware y limitando el costo a tu infraestructura. La variante XS (33B-A3B) es la opción cuando quieres ejecutar algo aún más pequeño y económico localmente. De cualquier manera, expone el uso de herramientas y la invocación de funciones, por lo que se integra en arneses de codificación agéntica.

Para quién es: tres escenarios

1. Automatización de codificación de alto volumen con un presupuesto limitado.

Si ejecutas bots de corrección de CI, migraciones masivas o grandes flotas de agentes donde el costo de tokens se acumula, el precio de Laguna S 2.1 es transformador: usa sin pensamiento para el trabajo rutinario y con pensamiento para los casos difíciles. Este es su caso de uso más fuerte.

2. Equipos que deben autoalojar modelos de código

Para organizaciones que no pueden enviar código propietario a una API cerrada, un codificador de peso abierto que lidera su clase de tamaño es exactamente lo que faltaba. Laguna S 2.1 (o XS para hardware más pequeño) te brinda codificación adyacente a la frontera que controlas por completo.

3. Startups sensibles al costo que desarrollan productos de programación.

Si los márgenes de su producto dependen del costo de inferencia, Laguna le permite ofrecer funciones de codificación de IA a una fracción de los precios de frontera, reservando un buque insignia de frontera solo para las solicitudes más difíciles que sus usuarios realizan.

Cuándo no usarlo

No optes por Laguna S 2.1 cuando necesites la mejor precisión de codificación absoluta y puedas pagarla — los modelos fronterizos cerrados (Fable 5 con 95.0% en SWE-bench Verified, Opus 5 con el #1 en índice general, Kimi K3 con el #1 en Frontend Coding Arena) todavía lideran varios benchmarks. No lo uses para razonamiento de propósito general, multimodal o tareas no relacionadas con codificación — es un especialista en codificación sin un pedigrí de inteligencia general. Y no asumas que los números destacados se mantienen en modo sin pensamiento; si desactivas el pensamiento por costo, evalúa las puntuaciones más bajas que realmente obtendrás.

Lista de verificación de decisiones

• Elige Laguna S 2.1 si: quieres el codificador de peso abierto más barato y capaz, debes autoalojarlo, o ejecutas automatización de codificación de alto volumen donde el costo domina.

• Elige en su lugar un buque insignia de frontera si: necesitas la máxima precisión en codificación, razonamiento general o multimodal — y puedes permitírtelo.

• Ejecutar ambos si: codificación rutinaria predeterminada a Laguna y escalar las tareas más difíciles a un modelo fronterizo, detrás de un endpoint.

Preguntas frecuentes

¿Cuánto cuesta la Laguna S 2.1?

$0.10 por 1M tokens de entrada y $0.20 por 1M tokens de salida — con un modelo más pequeño Laguna XS 2.1 a $0.06 / $0.12. Es uno de los modelos de codificación más baratos y capaces disponibles, y al ser open-weight puedes autoalojarlo para eliminar el costo por token. [OpenRouter/BenchLM]

¿Es Laguna S 2.1 de código abierto?

Es de peso abierto: los pesos del modelo se publican en Hugging Face (poolside/Laguna-S-2.1), por lo que puedes descargarlo, ejecutarlo y ajustarlo. Consulta la licencia de Poolside para tu uso específico.

¿Es mejor que DeepSeek o Qwen para programar?

Poolside lo posiciona como la respuesta de Occidente a ellos e informa que supera a DeepSeek-V4-Pro-Max en DeepSWE (40.4% frente a 9.0%) con muchos menos parámetros activos. En benchmarks de codificación abiertos y de tamaño revelado, lidera según Poolside — pero estos son realizados por el proveedor, así que valida en tus propios repositorios.

¿Supera a los modelos fronterizos?

No de forma absoluta. Los buques insignia cerrados como Claude Fable 5, Claude Opus 5 y Kimi K3 todavía lideran varios benchmarks absolutos. La afirmación de Laguna es la mejor en su clase de peso y la mejor relación calidad-precio, no la mejor en general.

¿Qué es el modo de pensamiento?

Un interruptor entre un camino rápido sin pensamiento y un camino de máximo pensamiento que gasta tokens de razonamiento adicionales para mayor precisión (por ejemplo, DeepSWE 16.5% → 40.4%). Use sin pensamiento para trabajo rutinario, pensamiento para tareas difíciles.

¿Cuál es la ventana de contexto?

Hasta 1 millón de tokens, por lo que caben bases de código grandes y transcripciones largas de agente.

¿Debería usar S o XS?

Laguna S 2.1 (118B/8B) para la codificación más potente; Laguna XS 2.1 (33B/3B) cuando quieres algo más pequeño y económico para autohospedar o servir con un volumen muy alto.

En resumen

Laguna S 2.1 es el modelo de código abierto de pesos abiertos más convincente de su tamaño hasta la fecha: un MoE de 118B/8B con hasta 1M de contexto y un interruptor de razonamiento, con un precio notable de $0.10 / $0.20, que Poolside dice que lidera los modelos abiertos de tamaño conocido en SWE-Bench Multilingual (78.5%) y supera a rivales mucho más grandes en pruebas de codificación agente. No es el mejor codificador absoluto — los buques insignia cerrados de frontera aún lideran varios benchmarks — y sus puntuaciones destacadas dependen del modo de razonamiento, que gasta tokens. Pero para codificación barata, auto-alojable y de alto volumen, nada en su clase de peso compite. Enruta Laguna S 2.1 junto con cada buque insignia de frontera a través de un punto final compatible con OpenAI en OrcaRouter y envíale la mayor parte de tu tráfico de codificación, escalando solo las tareas más difíciles.

© 2026 OrcaRouter

Para proveedores

¿Operas una plataforma de inferencia? Publica tus modelos en OrcaRouter.

Contáctanos

Únete a la comunidad

DiscordEmailXGitHubYouTube