
Laguna S 2.1: Poolsideのオープンウェイトコーディングモデル - 重量(と価格)をはるかに超える実力
- qwenNEWQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 100万トークンあたり
- orcaNEWOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicNEWAnthropic: Claude Opus 52026-07-2461知能78コーディング
- googleNEWGoogle: Gemini 3.6 Flash2026-07-2150知能69コーディング
- googleNEWGoogle: Gemini 3.5 Flash-Lite2026-07-2137知能49コーディング
- metaNEWMeta: Muse Spark 1.12026-07-1651知能71コーディング
- kimiMoonshotAI: Kimi K32026-07-1557知能76コーディング
- openaiOpenAI: GPT-5.6 Luna2026-07-0951知能71コーディング
- openaiOpenAI: GPT-5.6 Terra2026-07-0955知能77コーディング
- openaiOpenAI: GPT-5.6 Sol2026-07-0959知能77コーディング
- grokxAI: Grok 4.52026-07-0854知能72コーディング
- tencentTencent: Hy32026-07-0641知能59コーディング
- obsidianQwen3.6 35B A3B Uncensored (Aggressive)2026-07-0232知能42コーディング
- obsidianGemma4 26B A4B Uncensored (Balanced)2026-07-0226知能39コーディング
- anthropicAnthropic: Claude Sonnet 52026-06-3053知能72コーディング
- klingKling: Kling 3.0 Turbo2026-06-1757知能52コーディング57数学
- z-aiZ.ai: GLM 5.22026-06-1651知能69コーディング60数学
- kimiMoonshotAI: Kimi K2.7 Code2026-06-1242知能61コーディング61数学
- anthropicAnthropic: Claude Fable 52026-06-0960知能77コーディング
- qwenQwen: Qwen3.7 Plus2026-06-0139知能56コーディング59数学
2026年7月21日、Poolsideは Laguna S 2.1 — 1180億パラメータのオープンウェイトのコーディングモデルで、トークンあたり約80億のアクティブパラメータのみを持ち — そして「西側で最も有能なオープンウェイトモデル」であり、DeepSeekとQwenへの回答として売り込んだ。注目すべき点は、すべてのクローズドフロンティアシステムを打ち負かすということではなく、エージェント型コーディングベンチマークで、サイズが何倍もあるモデルを打ち負かすということと、百万トークンあたり0.10ドル/0.20ドルというコストである。このガイドでは、Laguna S 2.1が実際に何であるか、その思考モード、独立した報告とベンダー報告の違い、コスト、実行方法、誰が使用すべきかをカバーする。
以下の各図はソースによってラベル付けされています。Lagunaのヘッドラインスコアは、指名された第三者が引用されていない限り、Poolside(そのローンチ資料とHugging Faceカード)によって報告されています。独立したラボが確認するまでは、それらをベンダー運営として扱ってください。ベンチマークと価格は変動します — 予算を確定する前に確認してください。
TL;DR. Laguna S 2.1は、オープンウェイトのMoEコーディングモデル(総パラメータ118B、アクティブ約8B)で、最大1Mコンテキストと"thinking / no-thinking"トグルを備え、価格は1Mトークンあたり入力$0.10、出力$0.20と、ほとんどの競合の数分の一です。PoolsideはSWE-Bench Multilingualで78.5%(公開サイズ開示モデル中トップ)、Terminal-Bench 2.1で70.2%、DeepSWE v1.1で40.4%(DeepSeek-V4-Pro-Maxの9.0%と比較)を報告しており、アクティブパラメータは約6分の1です。これは私たちが見た中で最高のオープンウェイトのコーディング費用対効果オプションですが、クローズドフロンティアモデルとしては Claude Fable 5, Claude Opus 5, and Kimi K3 依然としていくつかの絶対ベンチマークでリードしています。安価で自己ホスティング可能、かつそのパラメータクラスを上回るコーダーを求めるなら、Laguna S 2.1が最適です。一方、絶対的なトップコーディング精度が必要なら、フロンティアフラッグシップが依然として勝ります。
重要なポイント
• 1ドルあたり最良のオープンウェイトコーディング。SWE-Bench Multilingual (78.5%) でオープンなサイズ公開モデルをリードするモデルでは、100万トークンあたり$0.10/$0.20。
• 規模以上の性能を発揮。約80億のアクティブパラメータでありながら、Terminal-Bench 2.1およびSWE-Bench Proではるかに大きなモデルに匹敵するか上回る。
• オープンウェイトで自己ホスト可能。Hugging Face上のウェイト (poolside/Laguna-S-2.1) — 自分の環境で実行できます。
思考モードがスコアを牽引します。最大思考はDeepSWEを16.5%から40.4%に引き上げます—強力ですが、推論トークンを消費するため、予算を組んでおいてください。
• 絶対的な1位ではない。クローズドフロンティアのフラッグシップ(Fable 5、Opus 5、Kimi K3)は、いくつかの絶対的なコーディングベンチマークで依然としてトップである。Lagunaの売りは、その重量クラスと価格であり、ベンチマークの頂点ではない。
このブリーフを読む際の注意点:Poolsideに帰属するものはすべて、ローンチ資料からのベンダーの主張です。ベンチマークが独立したものである場合、そのソースを明記します。独立した一般知能スコアが公開されていない場合は、推測するのではなくその旨を述べます。Lagunaはコーディング専門家であり、汎用リーダーボードのトップではありません。
Laguna S 2.1 が実際に何なのか
Laguna S 2.1は、Poolsideのオープンウェイトでエージェンティックなコーディングモデルです。アーキテクチャ的には混合専門家モデルであり、合計118Bパラメータですが、トークンあたり約8Bのみが活性化するため、その性能に対してサービス提供コストが低くなっています。最大1Mトークンのコンテキストと、高速な「思考なし」パスと、難しい問題に対して追加の推論トークンを使用する「思考」パスの2つの動作モードをサポートします。ツール使用、関数呼び出し、マルチステップタスクといったコーディングおよびエージェント業務向けに構築されています。Poolsideはさらに小型の兄弟モデル、Laguna XS 2.1(合計33B / 約3B活性)も、より低い$0.06 / $0.12で出荷しています。
重要なのは、ウェイトがオープンでHugging Faceに公開されていることです。そのため、クローズドなAPIモデルとは異なり、Laguna S 2.1をダウンロードして、自社のインフラで実行し、ファインチューニングし、バージョンを固定することができます。この組み合わせ——最先端に近いコーディング能力、極めて少ないアクティブパラメータ数、オープンなウェイト、そして驚くほど低価格——が全てのセールスポイントであり、PoolsideがこれをDeepSeekやQwenの強力なオープンモデルに対する西側の回答と位置づける理由です。
新着情報: ベンチマーク
公開された数値はすべてコーディングに関するものです。SWE-Bench Multilingualでは、Poolsideは78.5%を報告しており、これは公開されたサイズのオープンモデルをリードしていると述べています。Terminal-Bench 2.1では70.2%を記録しています。DeepSWE v1.1では40.4%に達し、Poolsideの最も印象的な比較は、同じテストでDeepSeek-V4-Pro-Maxの9.0%を、アクティブパラメータが約6分の1でありながら上回ったことです。Terminal-Bench 2.1とSWE-Bench Proでは、PoolsideによるとLaguna S 2.1は、数倍のサイズのモデルと同等かそれ以上であり、それにはDeepSeek V4 Flash、NVIDIA's Nemotron 3 Ultra、およびThinking Machines' Inklingが含まれます。
Poolside自身が使用する正直な枠組みは、絶対的な優位性ではなく、重量クラスに関するものです。Claude Fable 5やKimi K3といったクローズドなフロンティアモデルは、依然としていくつかのベンチマークでリードしています。したがって、Laguna S 2.1を正しく解釈する方法は、「オープンで、約8Bアクティブ、非常に安価なモデルから得られる最大の能力」であり、「最高のコーダー(期間)」ではありません。

思考様式:{{1}}パフォーマンス{{/1}}の源泉
Laguna S 2.1のベンチマークスコアは、その「最大思考」モードに大きく依存しています。最も明確な例はDeepSWE v1.1で、思考なしの16.5%から最大思考では40.4%へとスコアが跳ね上がります。モデルのベンチマーク性能の大部分は、推論させることで得られています。Terminal-Bench 2.1でも同様のパターンが見られます(60.4%→70.2%)。これはコストとレイテンシに影響します。思考モードは追加の推論トークンを消費するため、トークン単価はわずかですが、最大思考で難しいタスクを実行すると、思考なしのパスよりも多くのトークンを使用し(時間もかかります)。実際には、ルーチンの補完は速度とコストのために思考なしモードで実行し、精度の向上がトークンに見合う難しい多段階の問題にのみ思考モードに切り替えることになります。これは、フロンティアモデルに現れている「努力ダイアル」のコーディングに特化した反映です。
ベンチマークの詳細な分析:これらのコーディングテストが測定するもの
SWE-Bench Multilingual は、よく知られているSWE-bench(実際のGitHub issueを解決する)を複数のプログラミング言語に拡張したものであり、78.5%という数字は実践的な言語横断的なバグ修正の強力な指標です。また、「leads open disclosed-size models」は、ベンダーによる主張ではありますが、意味のある主張です。 Terminal-Bench 2.1 は、モデルが実際のターミナルを操作してエンドツーエンドでタスクを完了できるかどうかをテストするものであり、シングルショットのコード補完よりも自律的なコーディングエージェントが実際に行うことに近いものです。 DeepSWE v1.1 は、より難しいエージェンティックソフトウェアエンジニアリングスイートであり、40.4%(DeepSeek-V4-Pro-Maxの9.0%に対して)は、はるかに大きなモデルとの大きな差であるため、Lagunaにとって最も目立つ数字です。
正直さを保つための注意点:これはローンチ時点でのPoolsideの実施結果であり、Laguna S 2.1に関する公表されたArtificial Analysis Intelligence Indexや独立したSWE-bench Verifiedの数値はまだありません。したがって、リーダーシップの主張は第三者によって確認されるまではベンダー報告として扱い、Lagunaはコーディング専門家であり、汎用推論のリーダーとして位置づけられていないこと、そして汎用知能指数でトップになることを期待すべきではないことを覚えておいてください。

実際のコスト
ここがラグーナS 2.1が真に破壊的である点です。1Mトークンあたり入力$0.10、出力$0.20という料金で、代表的なコーディングコール(入力15,000トークン、出力3,000トークン)のコストは、15k × $0.10/1M + 3k × $0.20/1M = $0.0015 + $0.0006 = 約$0.0021 — およそ0.21セントです。同じコールをClaude Opus 5($5/$25)のようなフロンティアモデルで行うと約$0.15 — 約70倍の差です。安価な競合他社と比べても、ラグーナは低価格を実現しています。DeepSeekの価格設定を下回っています。アスタリスクは思考モードです — 最大思考での難しいタスクは、出力トークンが数倍に増える可能性があるため、「$0.0006出力」のコールが数セントになることもあります。しかし、膨らんだとしても、そのコストはクローズドなフロンティアモデルと比べれば誤差の範囲です。大量のコーディング自動化 — CIボット、一括リファクタリング、エージェント群 — にとって、この経済性は否定しがたいものです。特に、セルフホストすればトークン単位のコストを完全に排除できるからです。
Laguna S 2.1 にアクセスして実行する方法
重みが公開されているため、2つの方法があります。ホスティングプロバイダー経由で呼び出すことができます(OpenRouterのようなアグリゲーターに表示されます)。料金は$0.10/$0.20のレートで、試すのに最も速い方法です。または、Hugging Face(poolside/Laguna-S-2.1)から重みをダウンロードしてセルフホストすることもできます。これにより、コードとデータを自分の環境に保持し、自分のリポジトリでファインチューニングし、自分のハードウェアに量子化し、コストを自分のインフラストラクチャに抑えることができます。XSバリアント(33B-A3B)は、さらに小さく安価なものをローカルで実行したい場合のオプションです。いずれにしても、ツール使用と関数呼び出しを公開しているため、エージェンティックコーディングハーネスにそのまま組み込むことができます。
対象:3つのシナリオ
1. 予算を抑えた大量コーディング自動化
CI fix-it ボット、一括移行、またはトークンコストが増大する大規模なエージェントフリートを実行する場合、Laguna S 2.1 の価格は革新的です — 日常業務には思考不要モードを、難しいケースには思考モードを実行してください。これが最も強力なユースケースです。
2. コードモデルをセルフホストする必要があるチーム
プロプライエタリコードをクローズドAPIに送信できない組織にとって、自らのサイズクラスをリードするオープンウェイトコーダーはまさに欠けていたものです。Laguna S 2.1(または小型ハードウェア向けのXS)は、完全に制御可能なフロンティアに近いコーディングを提供します。
3. コストに敏感なスタートアップによるコーディング製品開発
製品の利益率が推論コストに依存するなら、Lagunaは最先端モデルの価格のほんの一部でAIコーディング機能を提供できるようにします — ユーザーが直面する最も難しいリクエストにのみフラッグシップモデルを温存します。

使用すべきでない場合
最高のコーディング精度が必要で、その対価を支払える場合には、Laguna S 2.1 に手を出さないでください——クローズドフロンティアモデル(Fable 5 の 95.0% SWE-bench Verified、Opus 5 の #1 一般インデックス、Kimi K3 の #1 Frontend Coding Arena)は依然としていくつかのベンチマークでリードしています。汎用的な推論、マルチモーダル、またはコーディング以外のタスクには使用しないでください——これは汎用知能の血統を持たないコーディング専門家です。また、見出しの数字が思考なしモードでも維持されると思い込まないでください。コストのために思考を無効にした場合、実際に得られる低いスコアをベンチマークしてください。
決定チェックリスト
• 次の場合に Laguna S 2.1 を選択してください: 最も安価で有能なオープンウェイトコーダーが必要な場合、セルフホストする必要がある場合、またはコストが支配的な大量のコーディング自動化を実行する場合。
• 代わりにフロンティアフラッグシップを選んでください:絶対的なトップのコーディング精度、一般的な推論、またはマルチモーダルが必要で、それを購入できる場合。
• 両方を実行する場合: デフォルトのルーチンコーディングはLagunaに、最も困難なタスクはフロンティアモデルにエスカレーションし、単一のエンドポイントの背後で行う。
よくある質問
Laguna S 2.1の価格はいくらですか?
入力トークン100万個あたり$0.10、出力トークン100万個あたり$0.20 — より小型のLaguna XS 2.1では$0.06 / $0.12。これは入手可能なコーディングモデルの中で最も安価なものの一つであり、オープンウェイトであるため、セルフホスティングしてトークン単位のコストを排除できます。[OpenRouter/BenchLM]
ラグナS 2.1はオープンソースですか?
オープンウェイトです。モデルの重みはHugging Face(poolside/Laguna-S-2.1)で公開されているので、ダウンロード、実行、ファインチューニングが可能です。ご利用の用途に応じてPoolsideのライセンスをご確認ください。
コーディングにおいて、DeepSeekやQwenより優れていますか?
Poolsideはそれを西側の彼らへの答えとして位置付け、はるかに少ないアクティブパラメータでDeepSWE上でDeepSeek-V4-Pro-Maxを打ち負かした(40.4% vs 9.0%)と報告している。公開され規模が開示されたコーディングベンチマークでは、Poolsideによるとリードしているが、これらはベンダーによる実行のため、自身のリポジトリで検証すること。
それは最先端モデルに勝つのか?
完全にではありません。Claude Fable 5、Claude Opus 5、Kimi K3のようなクローズドフラグシップは、依然としていくつかの絶対的なベンチマークでリードしています。Lagunaの主張は、クラス内最高性能とコストパフォーマンス最高であり、全体的に最高というわけではありません。
思考モードとは何ですか?
高速な無思考パスと、追加の推論トークンを使用して精度を高める最大思考パスとの切り替え(例:DeepSWE 16.5% → 40.4%)。ルーチンワークには無思考を、難しいタスクには思考を使用してください。
コンテキストウィンドウとは?
最大100万トークンまで対応するので、大規模なコードベースや長いエージェントのトランスクリプトにも対応できます。
SとXS、どちらを使うべきですか?
Laguna S 2.1 (118B/8B)は、最も強力なコーディング向けです。Laguna XS 2.1 (33B/3B)は、より小型で低コストなものをセルフホストするか、非常に高いボリュームでサービスを提供したい場合に適しています。
結論
Laguna S 2.1は、現時点で同サイズのオープンウェイトコーディングモデルとして最も魅力的なモデルであり、118B/8BのMoE、最大100万トークンのコンテキスト、思考モードの切り替え機能を備え、価格は驚くべき$0.10/$0.20に設定されています。Poolsideによると、このモデルはSWE-Bench Multilingual(78.5%)において開示されたサイズのオープンモデルをリードし、エージェントベースのコーディングテストでははるかに大規模なライバルを打ち負かしています。ただし、絶対的な最高のコーダーというわけではなく、クローズドなフロンティアフラッグシップモデルは依然としていくつかのベンチマークでリードしており、注目のスコアは思考モード(トークンを消費する)に依存しています。しかし、安価でセルフホスト可能なハイボリュームコーディングにおいては、このウェイトクラスで競合するものはありません。Laguna S 2.1をすべてのフロンティアフラッグシップとともに、OrcaRouterで1つのOpenAI互換エンドポイントにルーティングし、コーディングトラフィックの大部分を送り、最も難しいタスクだけをエスカレーションしてください。
