
Laguna S 2.1: Poolside的开放权重编程模型,性能远超其规格和价格
- qwen新Qwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 每百万 tokens
- orca新OrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropic新Anthropic: Claude Opus 52026-07-2461智能78代码
- google新Google: Gemini 3.6 Flash2026-07-2150智能69代码
- google新Google: Gemini 3.5 Flash-Lite2026-07-2137智能49代码
- meta新Meta: Muse Spark 1.12026-07-1651智能71代码
- kimiMoonshotAI: Kimi K32026-07-1557智能76代码
- openaiOpenAI: GPT-5.6 Luna2026-07-0951智能71代码
- openaiOpenAI: GPT-5.6 Terra2026-07-0955智能77代码
- openaiOpenAI: GPT-5.6 Sol2026-07-0959智能77代码
- grokxAI: Grok 4.52026-07-0854智能72代码
- tencentTencent: Hy32026-07-0641智能59代码
- obsidianQwen3.6 35B A3B Uncensored (Aggressive)2026-07-0232智能42代码
- obsidianGemma4 26B A4B Uncensored (Balanced)2026-07-0226智能39代码
- anthropicAnthropic: Claude Sonnet 52026-06-3053智能72代码
- klingKling: Kling 3.0 Turbo2026-06-1757智能52代码57数学
- z-aiZ.ai: GLM 5.22026-06-1651智能69代码60数学
- kimiMoonshotAI: Kimi K2.7 Code2026-06-1242智能61代码61数学
- anthropicAnthropic: Claude Fable 52026-06-0960智能77代码
- qwenQwen: Qwen3.7 Plus2026-06-0139智能56代码59数学
2026年7月21日,Poolside发布了Laguna S 2.1——一个1180亿参数的开源权重编码模型,每个token仅约80亿活跃参数——并将其标榜为“西方最具能力的开源权重模型”,是对DeepSeek和Qwen的回应。重点不是它击败了所有封闭前沿系统,而是它在代理编码基准测试中击败了比它大数倍的模型,同时每百万token成本仅为0.10/0.20美元。本指南涵盖Laguna S 2.1实际是什么、它的思考模式、哪些是独立报告与厂商报告、成本、如何运行以及谁应该使用它。
以下每个图表都标注了来源。Laguna的标题分数由Poolside报告(来自其发布材料及Hugging Face卡片),除非另有指定的第三方引用;在独立实验室确认之前,将其视为供应商运行数据。基准测试和价格会变动——在承诺预算之前请核实。
长话短说。Laguna S 2.1 是一款开放权重的 MoE 编码模型(总参数量 118B / 激活约 8B),支持高达 1M 的上下文,并提供“思考 / 不思考”切换功能,定价仅为每百万 token (输入 $0.10 / 输出 $0.20) — 远低于多数竞品。Poolside 报告显示,该模型在 SWE-Bench Multilingual 上取得 78.5% 的成绩(领先已公开规模的开放权重模型),在 Terminal-Bench 2.1 上达到 70.2%,在 DeepSWE v1.1 上达到 40.4%(作为对比,DeepSeek-V4-Pro-Max 为 9.0%)— 而它的活跃参数量仅为后者的约六分之一。这是我们在开放权重模型中见过的编码性价比最高的选择,但一些封闭前沿模型如 Claude Fable 5、Claude Opus 5 以及 Kimi K3 在多项绝对基准测试上仍然领先。如果你想要一个廉价、可自托管、且超越同重量级水平的编码模型,Laguna S 2.1 就是答案;如果你需要绝对的顶尖编码精度,那还是前沿旗舰更胜一筹。
关键要点
• 每美元最佳开放权重编程。$0.10/$0.20每100万tokens,该模型在SWE-Bench Multilingual(78.5%)上领先于公开披露尺寸的模型。
• 超越其体量。约8B活跃参数,却能在Terminal-Bench 2.1和SWE-Bench Pro上匹配甚至超越远大于它的模型。
• 开放权重且可自行托管。权重可在Hugging Face (poolside/Laguna-S-2.1)上获取——你可以在自己的环境中运行它。
• 思考模式驱动得分。最大思考使DeepSWE从16.5%提升到40.4%——强大,但会消耗推理令牌,因此需要为其做预算。
• 并非绝对的#1。封闭式旗舰型号(Fable 5, Opus 5, Kimi K3)仍在几个绝对编码基准测试中领先;Laguna的优势是重量级别和价格,而非排行榜之首。
关于阅读这份简报的说明:凡归因于Poolside的内容均为发布材料中的供应商声明;若基准测试为独立进行,则会注明来源。若未公布独立的通用智能评分,我们会如实说明而非猜测——Laguna是编码专家,而非通用排行榜的领先者。
Laguna S 2.1 到底是什么
Laguna S 2.1 是 Poolside 的开源权重、智能体编码模型。架构上采用混合专家模型:总参数量为 118B,但每个 token 仅激活约 8B 参数,因此相较于其能力,服务成本较低。它支持长达 1M token 的上下文和两种运行模式——快速“无思考”路径和“思考”路径,后者为更困难的问题额外消耗推理 token。该模型专为编码和智能体工作(工具使用、函数调用、多步骤任务)而构建。Poolside 还推出了更小规模的兄弟模型 Laguna XS 2.1(总参数量 33B / 激活约 3B),价格更低,为 $0.06 / $0.12。
至关重要的是,权重是开放的并在 Hugging Face 上公开发布,因此与封闭的 API 模型不同,你可以下载 Laguna S 2.1,在自己的基础设施上运行它,对其进行微调,并锁定一个版本。这种组合——接近前沿水平的编码能力、极少的活跃参数数量、开放的权重以及极低的价格——就是其全部卖点,也是 Poolside 将其定位为西方对 DeepSeek 和 Qwen 强大开放模型回应的重要原因。
最新动态:基准测试
这些发布数据都与编码能力有关。在SWE-Bench Multilingual上,Poolside报告了78.5%的成绩,据称这领先于所有已公开规模的开放模型。在Terminal-Bench 2.1上,它得分为70.2%。在DeepSWE v1.1上,它达到40.4%——Poolside最引人注目的对比是,这一成绩击败了DeepSeek-V4-Pro-Max在相同测试中9.0%的结果,而前者活跃参数仅为后者的约六分之一。在Terminal-Bench 2.1和SWE-Bench Pro上,Poolside表示Laguna S 2.1匹配或超越了数倍于其规模的模型,包括DeepSeek V4 Flash、NVIDIA's Nemotron 3 Ultra和Thinking Machines' Inkling。
Poolside 自身的诚实表述是围绕“重量级”,而非绝对优势:像 Claude Fable 5 和 Kimi K3 这样的封闭前沿模型在多项基准测试中仍处于领先地位。因此,对 Laguna S 2.1 的正确解读应该是“你能从开源、约 8B 活跃参数、成本极低的模型中获得的最高能力”,而不是“绝对的最佳编码模型”。

Thinking mode: where the performance comes from
Laguna S 2.1 的核心评分高度依赖于其“最大思考”模式。最明显的例子是 DeepSWE v1.1,其评分从无思考模式下的 16.5% 跃升至最大思考模式下的 40.4%——该模型的大部分基准测试实力来自于让其进行推理。Terminal-Bench 2.1 也显示出相同的模式(60.4% → 70.2%)。这对成本和延迟至关重要:思考模式会消耗额外的推理令牌,因此,虽然每个令牌的价格很小,但在最大思考模式下运行一项困难任务会比无思考路径使用更多的令牌(并且花费更长时间)。在实践中,为了速度和成本,你会在无思考模式下运行常规补全任务,只有在那些需要多步骤解决且准确性提升值得花费令牌的难题上,才切换到思考模式——这是前沿模型上出现的“努力程度调节钮”在编码领域的具体体现。
基准测试深度解析:这些编程测试衡量什么
SWE-Bench Multilingual将广为人知的SWE-bench(解决真实GitHub问题)扩展到多种编程语言,因此78.5%是一个强有力的信号,表明其实用且跨语言的错误修复能力——而“领先于公开披露尺寸的模型”这一说法,即便是供应商声称的,也具有意义。Terminal-Bench 2.1测试模型是否能操作真实终端以端到端完成任务,这比单次代码补全更接近自主编码代理的实际行为。DeepSWE v1.1是一个更难的自主软件工程套件;40.4%(对比DeepSeek-V4-Pro-Max的9.0%)是Laguna最亮眼的数字,正因为它与一个规模大得多的模型之间存在着巨大差距。
使这一说法保持诚实的前提是:这些是Poolside在发布时的结果,目前还没有已发布的人工分析智能指数(Artificial Analysis Intelligence Index)或针对Laguna S 2.1的独立SWE-bench Verified数据。因此,在第三方确认之前,请将领先声明视为供应商报告,并记住Laguna是一个编码专家——它并非定位为通用推理领导者,你不应期望它在通用智能指数中排名靠前。

实际成本是多少
这就是 Laguna S 2.1 真正具有颠覆性的地方。按每100万输入/输出 token 分别收取 $0.10 / $0.20 计算,一次典型的编码调用(15,000 输入 token、3,000 输出 token)的开销为 15k × $0.10/1M + 3k × $0.20/1M = $0.0015 + $0.0006 ≈ $0.0021——大约五分之一美分。同样的调用在 Claude Opus 5($5/$25)这样的前沿模型上约为 $0.15——贵了近 70 倍。即使与便宜的竞品相比,Laguna 也更具价格优势:其定价低于 DeepSeek。有个注意事项是推理模式——在最高推理量下处理困难任务可能生成数倍于 token 的输出,因此一次“$0.0006 输出”的调用可能变成几美分。但即使翻倍,与封闭前沿模型相比,这种成本也只是四舍五入的零头。对于高频编码自动化——CI 机器人、批量重构、智能体集群——其经济性很难被反驳,尤其是你还可以完全自托管以消除每 token 的成本。
如何访问和运行 Laguna S 2.1
由于权重是开放的,你有两条路径。你可以通过托管服务商调用它(它出现在OpenRouter等聚合器上),价格为0.10/0.20美元,这是最快的试用方式。或者你可以从Hugging Face(poolside/Laguna-S-2.1)下载权重并自行托管——将代码和数据保留在你的环境中,在你的代码仓库上进行微调,针对你的硬件进行量化,并将成本控制在你的基础设施范围内。XS变体(33B-A3B)则是当你希望在本地上运行更小、更便宜的模型时的选择。无论哪种方式,它都支持工具使用和函数调用,因此可以轻松嵌入到代理编程框架中。
适用对象:三种场景
1. 低成本高容量编码自动化
如果您运行CI修复机器人、批量迁移或大型代理集群,令牌成本会累积,Laguna S 2.1的价格具有变革性——在常规工作中运行无思考模式,在困难案例中运行思考模式。这是其最强大的用例。
2. 必须自行托管代码模型的团队
对于无法将专有代码发送到封闭API的组织来说,一个领先其尺寸级别的开放权重编码器正是所缺失的。Laguna S 2.1(或适用于较小硬件的XS)为您提供了完全可控的、接近前沿的编码能力。
3. 成本敏感的初创公司构建编程产品
如果您的产品利润依赖于推理成本,Laguna让您以前沿价格的一小部分提供AI编码功能——只将前沿旗舰保留给用户遇到的最困难请求。

何时不应使用
当你需要绝对最好的编码精度并且愿意为此付费时,不要选择 Laguna S 2.1 — 封闭的前沿模型(Fable 5 的 95.0% SWE-bench Verified、Opus 5 的 #1 通用指数、Kimi K3 的 #1 前端编码竞技场)仍在多个基准测试中领先。不要将其用于通用推理、多模态或非编码任务 — 它是一个没有通用智能背景的编码专家。并且不要以为标题数字在无思考模式下保持不变;如果你为了降低成本而禁用思考,请衡量你实际会获得的较低分数。
决策检查清单
• 选择 Laguna S 2.1 如果:你想要最便宜且能力足够的开放权重编程模型,你必须自行托管,或者你运行大规模编码自动化,其中成本占主导地位。
• 选择前沿旗舰机型,如果:您需要绝对的顶级编码准确性、通用推理能力或多模态功能——并且能负担得起。
• 同时运行两者:默认将常规编码任务分配给Laguna,并将最困难的任务升级到前沿模型,通过同一个端点。
常见问题
Laguna S 2.1 多少钱?
输入每100万标记0.10美元,输出每100万标记0.20美元——较小的Laguna XS 2.1版本价格为0.06美元/0.12美元。它是目前最便宜且能力足够的编码模型之一,并且由于是开源权重,你可以自行托管以消除按标记计费的成本。[OpenRouter/BenchLM]
Laguna S 2.1 是开源的吗?
它是开放权重的:模型权重已发布在 Hugging Face 上(poolside/Laguna-S-2.1),因此您可以下载、运行并进行微调。请查阅 Poolside 的许可证以了解您的具体用途。
它在编程方面比DeepSeek或Qwen更好吗?
Poolside将其定位为西方对它们的回应,并报告称在DeepSWE上以远少于活跃参数的情况下击败了DeepSeek-V4-Pro-Max(40.4%对9.0%)。在公开、披露规模的编程基准测试中,据Poolside称它领先——但这些是供应商运行的,因此请在自己的代码库上验证。
它是否击败了前沿模型?
并非绝对领先。像Claude Fable 5、Claude Opus 5和Kimi K3这样的封闭式旗舰模型仍在多个绝对基准测试中领先。Laguna宣称的是同级别最佳和性价比最高,而非整体最佳。
什么是思考模式?
一种在快速无思考路径和最大思考路径之间切换的选项,后者会消耗额外的推理令牌以获得更高准确率(例如,DeepSWE 从16.5%提升至40.4%)。对于常规工作使用无思考模式,对于困难任务则使用思考模式。
什么是上下文窗口?
支持高达100万token,因此适合大型代码库和长智能体转录文本。
我应该使用S还是XS?
Laguna S 2.1 (118B/8B) 用于最强编码;当你想要更小更便宜以自行托管或处理极高容量时,可选择 Laguna XS 2.1 (33B/3B)。
底线
Laguna S 2.1 是迄今为止同尺寸最具吸引力的开源权重编程模型:一个 118B/8B 的 MoE,支持高达 1M 上下文和思考切换,价格仅为 $0.10/$0.20,Poolside 称其在 SWE-Bench Multilingual(78.5%)上领先于公开披露尺寸的模型,并在智能体编程测试中击败了远大于它的竞争对手。它并非绝对最强的编程模型——封闭前沿旗舰仍在几项基准测试中领先——而且其亮点分数依赖会消耗 Token 的思考模式。但就廉价、可自托管、高吞吐量的编程任务而言,同权重级别内没有对手。通过 OrcaRouter 上兼容 OpenAI 的端点,将 Laguna S 2.1 与每个前沿旗舰模型一起路由,并将大部分编程流量发送给它,仅把最困难的任务升级处理。
