
Laguna S 2.1:Poolside 的開放權重編碼模型,其表現遠超其重量(及價格)
- qwen新Qwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 每百萬 tokens
- orca新OrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropic新Anthropic: Claude Opus 52026-07-2461智能78程式
- google新Google: Gemini 3.6 Flash2026-07-2150智能69程式
- google新Google: Gemini 3.5 Flash-Lite2026-07-2137智能49程式
- meta新Meta: Muse Spark 1.12026-07-1651智能71程式
- kimiMoonshotAI: Kimi K32026-07-1557智能76程式
- openaiOpenAI: GPT-5.6 Luna2026-07-0951智能71程式
- openaiOpenAI: GPT-5.6 Terra2026-07-0955智能77程式
- openaiOpenAI: GPT-5.6 Sol2026-07-0959智能77程式
- grokxAI: Grok 4.52026-07-0854智能72程式
- tencentTencent: Hy32026-07-0641智能59程式
- obsidianQwen3.6 35B A3B Uncensored (Aggressive)2026-07-0232智能42程式
- obsidianGemma4 26B A4B Uncensored (Balanced)2026-07-0226智能39程式
- anthropicAnthropic: Claude Sonnet 52026-06-3053智能72程式
- klingKling: Kling 3.0 Turbo2026-06-1757智能52程式57數學
- z-aiZ.ai: GLM 5.22026-06-1651智能69程式60數學
- kimiMoonshotAI: Kimi K2.7 Code2026-06-1242智能61程式61數學
- anthropicAnthropic: Claude Fable 52026-06-0960智能77程式
- qwenQwen: Qwen3.7 Plus2026-06-0139智能56程式59數學
2026年7月21日,Poolside 釋出了 Laguna S 2.1——這是一個擁有1180億參數的開放權重編碼模型,但每個令牌僅約80億活躍參數——並將其定位為「西方最具能力的開放權重模型」,作為對 DeepSeek 與 Qwen 的應對方案。這則消息的重點並非它超越所有封閉前沿系統,而是在於它在自主編碼基準測試中超越了規模數倍於己的模型,同時每百萬令牌成本僅需0.10美元/0.20美元。本指南將說明 Laguna S 2.1 的實際內涵、其思考模式、獨立報告與廠商報告的差異、使用成本、運行方式,以及適合的使用族群。
每個下方的圖表都標示了來源。Laguna的標題分數是由Poolside報告(來自其發布材料和Hugging Face卡片),除非引用了指定的第三方;在獨立實驗室確認前,應將其視為供應商運行。基準測試和價格會變動——在承諾預算前請核實。
TL;DR。Laguna S 2.1 是一個開源權重、MoE 編碼模型(總參數 118B,活躍參數約 8B),支援最多 1M 上下文,並提供「思考/不思考」切換,價格僅為每 1M 個 token 輸入 0.10 美元、輸出 0.20 美元——僅為大多數競爭對手的一小部分。Poolside 報告其在 SWE-Bench Multilingual 上達到 78.5%(領先公開披露尺寸的模型),在 Terminal-Bench 2.1 上達到 70.2%,在 DeepSWE v1.1 上達到 40.4%(而 DeepSeek-V4-Pro-Max 為 9.0%)——活躍參數約為其六分之一。這是我們所見過的最佳開源權重編碼性價比選項,但封閉的前沿模型如Claude Fable 5, Claude Opus 5, and Kimi K3仍然在多個絕對基準測試中領先。如果你想要一個便宜、可自行託管的編碼器,且性能超越其權重級別,那麼 Laguna S 2.1 就是答案;如果你需要絕對頂尖的編碼準確度,那麼前沿旗艦仍然勝出。
關鍵要點
• 每美元最佳開放權重編碼。每100萬令牌$0.10/$0.20,該模型在多語言SWE-Bench上領先於開放公開尺寸的模型(78.5%)。
• 超越其規模的表現。約80億活躍參數,卻能在Terminal-Bench 2.1和SWE-Bench Pro上匹配或擊敗遠更大的模型。
• 開放權重且可自行托管。權重在 Hugging Face(poolside/Laguna-S-2.1)上——你可以在自己的環境中運行它。
• 思考模式驅動分數。最大思考將 DeepSWE 從 16.5% 提升至 40.4% —— 強大,但會消耗推理 tokens,因此請為此編列預算。
• 並非毫無疑問的第一名。封閉式旗艦機型(Fable 5、Opus 5、Kimi K3)仍在多項絕對編碼基準測試中領先;Laguna的主張是體積重量等級與價格,而非榜首地位。
閱讀此簡報的注意事項:所有歸因於Poolside的內容皆為啟動材料中的供應商聲明;若基準測試為獨立完成,我們會註明來源。若未公佈獨立的通用智能評分,我們會如實說明而非臆測——Laguna是編碼專家,而非通用型排行榜的領跑者。
Laguna S 2.1 究竟是甚麼
Laguna S 2.1 是 Poolside 的開放權重、代理型編碼模型。在架構上,它是一個混合專家模型:總參數為 118B,但每個 token 僅激活約 8B,這就是為什麼相對於其能力,服務成本低廉的原因。它支援高達 100 萬 token 的上下文和兩種操作模式——一種快速的「無思考」路徑和一種「思考」路徑,後者為更難的問題花費額外的推理 token。它專為編碼和代理工作而構建:工具使用、函數調用、多步驟任務。Poolside 還推出了一個較小的兄弟模型 Laguna XS 2.1(總 33B / 約 3B 激活),價格更低,為 $0.06 / $0.12。
關鍵在於,權重是公開的,並上傳至 Hugging Face,因此與封閉的 API 模型不同,你可以下載 Laguna S 2.1、在自己的基礎架構中執行、進行微調,並鎖定特定版本。這種組合——接近前沿的編碼能力、極少的活躍參數、開放的權重,以及極具競爭力的價格——正是其核心賣點,也是 Poolside 將其定位為西方對 DeepSeek 與 Qwen 等強大開放模型之回應的原因。
最新消息:基準測試
這些發布數據全都與編碼有關。在SWE-Bench Multilingual上,Poolside報告達到78.5%,並聲稱領先於所有公開大小的開放模型。在Terminal-Bench 2.1上,它獲得70.2%。在DeepSWE v1.1上,它達到40.4%——而Poolside最驚人的對比是,這成績擊敗了DeepSeek-V4-Pro-Max在同一測試中僅以約六分之一活躍參數所達到的9.0%。在Terminal-Bench 2.1和SWE-Bench Pro上,Poolside表示Laguna S 2.1能與數倍於其規模的模型匹敵或超越,包括DeepSeek V4 Flash、NVIDIA的Nemotron 3 Ultra,以及Thinking Machines的Inkling。
Poolside 自身使用的誠實框架是關於重量級別,而非絕對霸權:封閉前沿模型如 Claude Fable 5 和 Kimi K3 仍在多項基準測試中領先。因此,正確解讀 Laguna S 2.1 的方式是「從開源、約 8B 活躍參數、極低成本的模型中能獲得的最大能力」,而非「最佳編碼器」。

Thinking mode: where the performance comes from
Laguna S 2.1 的總體分數高度仰賴其「最大思考」模式。最明顯的例子是 DeepSWE v1.1,分數從無思考模式下的 16.5% 躍升至最大思考模式下的 40.4%——該模型多數的基準測試強度來自於讓它進行推理。Terminal-Bench 2.1 也呈現相同模式(60.4% → 70.2%)。這對成本與延遲有影響:思考模式會消耗額外的推理 token,因此雖然每個 token 的價格極低,但在最大思考模式下執行困難任務會消耗更多 token(且耗時更長),相較於無思考模式。實務上,你可以為了速度和成本在無思考模式下執行常規任務,僅在遇到需要多步驟推理的困難問題時切換至思考模式——此時準確率的提升值得花費那些 token,這也呼應了前沿模型上出現的「努力調節」機制在程式碼領域中的具體表現。
基準測試深度解析:這些程式碼測試衡量什麼
SWE-Bench Multilingual擴展了知名的 SWE-bench(解決真實 GitHub 問題)到多種程式語言,因此 78.5% 是實用跨語言除錯的強烈訊號——而「領先開放披露規模模型」是一個有意義的(儘管是供應商聲稱的)說法。Terminal-Bench 2.1測試模型是否能操作真實終端以端到端完成任務,這比一次性程式碼補全更接近自主編碼代理的實際行為。DeepSWE v1.1是一個更難的自主軟體工程套件;40.4%(對比 DeepSeek-V4-Pro-Max 的 9.0%)是 Laguna 最亮眼的數字,正因為它與一個更大的模型之間存在巨大差距。
让這項說法保持可信的前提是:這些是Poolside在推出時公布的結果,且目前尚無已發布的「人工分析情報指數」或針對Laguna S 2.1的獨立SWE-bench Verified數據。因此,在第三方確認之前,請將這些領先地位的主張視為廠商自行報告的結果,並請記住Laguna是一款程式碼專用模型——它並非定位為通用推理的領導者,不應期待它在通用智能指數中名列前茅。

實際上的成本是多少
這是 Laguna S 2.1 真正具有顛覆性的地方。以每 100 萬個 token $0.10 輸入 / $0.20 輸出的價格計算,一個代表性的編碼調用需要 15,000 個輸入 token 和 3,000 個輸出 token,成本為 15k × $0.10/1M + 3k × $0.20/1M = $0.0015 + $0.0006 = 約 $0.0021——大約五分之一美分。同樣的調用在前沿模型如 Claude Opus 5($5/$25)上約為 $0.15——相差近 70 倍。即使與廉價競爭對手相比,Laguna 也更具優勢:其定價低於 DeepSeek。星號指的是思考模式——在最大思考情況下,一個困難任務可能產生數倍於原來的輸出 token,因此一個「$0.0006 輸出」的調用可能變成幾美分。但即使如此,與封閉前沿模型相比,增加的成本也只是個零頭。對於高規模的編碼自動化——CI 機器人、批量重構、智能體集群——這樣的經濟性很難被反駁,尤其是你還可以自行部署以完全消除按 token 計費的成本。
如何存取並執行 Laguna S 2.1
因為權重是開放的,你有兩條路徑。你可以通過託管提供商調用它(它出現在如 OpenRouter 的聚合器上),費率為 $0.10/$0.20,這是嘗試它的最快方式。或者你可以從 Hugging Face(poolside/Laguna-S-2.1)下載權重並自行託管——將程式碼和數據保留在你的環境中,在你的儲存庫上進行微調,為你的硬體進行量化,並將成本限制在你的基礎設施內。XS 變體(33B-A3B)是當你想在本地運行更小、更便宜的東西時的選項。無論哪種方式,它都支援工具使用和函式呼叫,因此可以整合到代理編碼框架中。
適用對象:三種情境
1. 低成本的高容量編碼自動化
如果你運行CI修復機器人、批量遷移或大型代理艦隊,其中令牌成本會複合增長,Laguna S 2.1的價格具有變革性——對於常規工作使用無思考模式,對於困難案例使用思考模式。這是它最強大的用例。
2. 必須自行託管程式碼模型的團隊
對於無法將專有程式碼傳送至封閉式API的組織,一個在其尺寸類別中領先的開放權重編碼器正是長久以來所欠缺的。Laguna S 2.1(或針對較小硬體的XS)為你提供完全掌控、接近前沿的編碼能力。
3. 注重成本的新創公司開發編碼產品
如果您的產品利潤取決於推理成本,Laguna 讓您能夠以前沿價格的一小部分提供 AI 編碼功能——僅為用戶遇到的最困難請求保留前沿旗艦模型。

何時不應使用
不要在你需要絕對最佳編碼準確度且願意為此付費時選擇 Laguna S 2.1——封閉前沿模型(Fable 5 的 95.0% SWE-bench Verified、Opus 5 的通用指標排名第一、Kimi K3 的前端編碼競技場排名第一)仍在多項基準測試中領先。也別將它用於通用推理、多模態或非編碼任務——它是個缺乏通用智慧血統的編碼專精模型。此外,不要假設其頭條數字在無思考模式下仍然成立;若為了節省成本而停用思考,請針對你實際會得到的較低分數進行基準測試。
決策檢查清單
• 選擇 Laguna S 2.1 如果:你想要最便宜且具備能力的開放權重編碼器、你必須自行託管,或者你運行高量編碼自動化,其中成本主導。
• 如果您需要絕對頂尖的編碼準確性、一般推理或多模態能力,並且能夠負擔得起,請選擇前沿旗艦產品。
• 同時執行兩者:預設將常規編碼任務交給 Laguna,並將最困難的工作升級到前沿模型,全部位於單一端點之後。
常見問題
Laguna S 2.1 的價格是多少?
每100萬輸入代幣0.10美元,每100萬輸出代幣0.20美元 — 較小的 Laguna XS 2.1 則為0.06美元/0.12美元。它是目前市面上最便宜且功能齊全的程式碼模型之一,而且由於開源權重,你可以自行部署以消除按代幣計費的成本。[OpenRouter/BenchLM]
Laguna S 2.1 是開源的嗎?
它是開放權重的:模型權重已發布在 Hugging Face(poolside/Laguna-S-2.1),因此您可以下載、運行並進行微調。請根據您的具體用途查閱 Poolside 的授權條款。
它比DeepSeek或Qwen更適合編程嗎?
Poolside 將其定位為西方對它們的回應,並報告在參數活躍數遠少的情況下,於 DeepSWE 上擊敗 DeepSeek-V4-Pro-Max(40.4% 對 9.0%)。在公開、揭露規模的編碼基準測試中,依 Poolside 的說法它領先——但這些測試由供應商自行執行,因此請在你的自有儲存庫上驗證。
它是否胜过了前沿模型?
不是绝对的。像Claude Fable 5、Claude Opus 5和Kimi K3這樣的封閉式旗艦產品仍然在多項絕對基準測試中領先。Laguna的主張是在其重量級別中最佳且性價比最高,而非整體最佳。
What is thinking mode?
在快速無思考路徑與最大思考路徑之間切換,後者會花費額外的推理令牌以追求更高準確度(例如 DeepSWE 從 16.5% 提升至 40.4%)。在例行工作上使用無思考,在困難任務上使用思考。
上下文窗口?
支援多達 100 萬個 token,因此大型程式碼庫和長篇代理記錄都能容納。
我應該使用S還是XS?
Laguna S 2.1 (118B/8B) 適用於最強大的編碼能力;而 Laguna XS 2.1 (33B/3B) 則適合需要更小、更便宜的自托管或高流量服務時使用。
底線
Laguna S 2.1 是目前同尺寸中最具吸引力的開放權重編碼模型:一款 118B/8B MoE,支援最高 1M 上下文與思考模式切換,定價僅 $0.10 / $0.20,Poolside 表示它在 SWE-Bench Multilingual(78.5%)上領先所有公開尺寸的模型,並在代理編碼測試中擊敗遠大於它的競爭對手。它並非絕對最強的編碼器——封閉前沿旗艦模型仍在一系列基準測試中領先——而其亮眼成績多仰賴會消耗 token 的思考模式。但對於低價、可自託管、高流量的編碼任務而言,同重量級別中無出其右。將 Laguna S 2.1 與所有前沿旗艦模型一起透過 OrcaRouter 上一個 OpenAI 相容端點路由,並將大部分編碼流量發送給它,僅將最困難的任務上報。
