라구나 S 2.1: 자신의 무게(와 가격)를 훨씬 웃도는 성능을 자랑하는 Poolside의 오픈 웨이트 코딩 모델
Guides & Insights

라구나 S 2.1: 자신의 무게(와 가격)를 훨씬 웃도는 성능을 자랑하는 Poolside의 오픈 웨이트 코딩 모델

작성자

jinhao song

게시일

최신 모델 · 20모든 모델 보기
벤치마크: Artificial Analysis · 매일 업데이트
모든 게시물로 돌아가기

2026년 7월 21일, Poolside가 출시한 Laguna S 2.1 — 1,180억 개의 매개변수를 가진 오픈 가중치 코딩 모델로, 토큰당 약 80억 개의 활성 매개변수만 사용하며, "서방 세계에서 가장 강력한 오픈 가중치 모델"로 홍보되며 DeepSeekQwen에 대한 대응으로 제시되었습니다. 이 헤드라인이 의미하는 것은 모든 폐쇄형 프론티어 시스템을 이긴다는 것이 아니라, 에이전틱 코딩 벤치마크에서 훨씬 더 큰 모델들을 이기면서도 백만 토큰당 $0.10 / $0.20의 비용을 자랑한다는 점입니다. 이 가이드는 Laguna S 2.1이 실제로 무엇인지, 사고 모드, 독립적으로 보고된 것과 공급업체가 보고한 것, 비용, 실행 방법, 그리고 누가 사용해야 하는지에 대해 다룹니다.

아래의 모든 수치는 출처별로 표시되어 있습니다. 라구나의 주요 점수는 Poolside(자사의 출시 자료와 Hugging Face 카드 기준)에서 보고된 것으로, 명시된 제3자가 인용된 경우는 제외합니다. 독립 연구소가 확인하기 전까지는 공급업체가 운영한 것으로 간주하세요. 벤치마크와 가격은 변동되므로, 예산을 확정하기 전에 반드시 확인하십시오.

TL;DR. Laguna S 2.1은 오픈 가중치를 가진 MoE 코딩 모델(총 118B / 활성 ~8B)로, 최대 1M 컨텍스트와 "생각하기 / 생각하지 않기" 토글을 지원하며, 가격은 100만 토큰당 입력 $0.10 / 출력 $0.20로 대부분의 경쟁사보다 훨씬 저렴합니다. Poolside는 SWE-Bench Multilingual에서 78.5%(공개된 크기의 모델 중 선두), Terminal-Bench 2.1에서 70.2%, DeepSWE v1.1에서 40.4%(DeepSeek-V4-Pro-Max의 9.0% 대비)를 기록했으며, 이는 활성 매개변수가 약 6분의 1 수준입니다. 이는 우리가 본 것 중 가장 가성비 좋은 오픈 가중치 코딩 옵션이지만, 폐쇄형 프론티어 모델인Claude Fable 5, Claude Opus 5, and Kimi K3 는 여전히 여러 절대 벤치마크에서 선두를 달리고 있습니다. 저렴하면서 자체 호스팅이 가능하고 무게 등급을 뛰어넘는 코더를 원한다면 Laguna S 2.1이 정답이고, 최고의 코딩 정확도가 필요하다면 프론티어 플래그십이 여전히 승리합니다.

주요 시사점

• 달러당 최고의 오픈 가중치 코딩. SWE-Bench Multilingual(78.5%)에서 공개된 크기 공개 모델을 선도하는 모델의 1M 토큰당 $0.10/$0.20.

• 자신의 체급 이상의 성능을 발휘합니다. 약 80억 개의 활성 파라미터를 가지면서도 Terminal-Bench 2.1 및 SWE-Bench Pro에서 훨씬 더 큰 모델들과 맞먹거나 능가합니다.

• 오픈 가중치 및 자체 호스팅 가능. 가중치: Hugging Face (poolside/Laguna-S-2.1) — 자신의 환경에서 실행할 수 있습니다.

• 사고 모드가 점수를 좌우합니다. 최대 사고는 DeepSWE를 16.5%에서 40.4%로 끌어올립니다 — 강력하지만, 추론 토큰을 소비하므로 예산을 책정하세요.

• 명백한 1위는 아닙니다. 폐쇄형 프런티어 플래그십(Fable 5, Opus 5, Kimi K3)은 여전히 몇몇 절대적인 코딩 벤치마크에서 선두를 차지하고 있습니다. Laguna의 주장은 체급과 가격에 관한 것이지, 최고 자리에 관한 것이 아닙니다.

이 브리프를 읽을 때 참고하세요: Poolside에 기인한 모든 내용은 출시 자료에서 나온 판매사 주장입니다. 독립적인 벤치마크가 있는 경우에는 출처를 명시합니다. 독립적인 일반 지능 점수가 발표되지 않은 경우에는 추측하지 않고 그렇게 밝힙니다—Laguna는 코딩 전문가이지, 범용 리더보드 1위가 아닙니다.

Laguna S 2.1이 실제로 무엇인지

Laguna S 2.1은 Poolside의 개방형 가중치 에이전트 코딩 모델입니다. 구조적으로는 혼합 전문가 모델로, 총 매개변수는 118B이지만 토큰당 활성화되는 것은 약 8B에 불과하여 성능 대비 서비스 비용이 저렴합니다. 최대 1M 토큰 컨텍스트와 두 가지 작동 모드, 즉 빠른 "비사고" 경로와 어려운 문제에 추가 추론 토큰을 사용하는 "사고" 경로를 지원합니다. 코딩 및 에이전트 작업(도구 사용, 함수 호출, 다단계 작업)에 최적화되어 있습니다. Poolside는 더 작은 형제 모델인 Laguna XS 2.1(총 33B / 활성 약 3B)도 더 낮은 $0.06 / $0.12에 제공합니다.

중요한 점은 가중치가 공개되어 Hugging Face에 게시되어 있으므로, 폐쇄형 API 모델과 달리 Laguna S 2.1을 다운로드하여 자체 인프라에서 실행하고, 미세 조정하고, 버전을 고정할 수 있다는 것입니다. 이러한 조합 — 최첨단에 가까운 코딩 능력, 적은 활성 파라미터 수, 오픈 가중치, 그리고 매우 낮은 가격 — 이 바로 전체적인 핵심이며, 이것이 Poolside가 이를 DeepSeek와 Qwen의 강력한 오픈 모델에 대한 서방의 대응책으로 제시하는 이유입니다.

새로운 소식: 벤치마크

출시 수치는 모두 코딩에 관한 것입니다. SWE-Bench Multilingual에서 Poolside는 78.5%를 보고했으며, 이는 공개된 크기의 오픈 모델을 선도한다고 합니다. Terminal-Bench 2.1에서는 70.2%를 기록했습니다. DeepSWE v1.1에서는 40.4%에 도달했으며, Poolside의 가장 눈에 띄는 비교는 이 결과가 동일 테스트에서 DeepSeek-V4-Pro-Max의 9.0%를 약 6분의 1의 활성 파라미터로 이겼다는 점입니다. Terminal-Bench 2.1 및 SWE-Bench Pro에서 Poolside는 Laguna S 2.1이 자체 크기의 몇 배에 달하는 모델과 일치하거나 능가한다고 말하며, 다음을 포함합니다: DeepSeek V4 Flash, NVIDIA의 Nemotron 3 Ultra, 그리고 Thinking Machines의 Inkling.

Poolside 자체가 사용하는 정직한 프레임은 절대적 우위가 아니라 체급에 관한 것입니다: Claude Fable 5 및 Kimi K3와 같은 폐쇄형 프론티어 모델은 여전히 여러 벤치마크에서 선두를 달리고 있습니다. 따라서 Laguna S 2.1을 올바르게 읽는 방법은 "공개형, 약 8B 활성, 매우 저렴한 모델에서 얻을 수 있는 가장 뛰어난 성능"이지 "최고의 코더, 그게 다야."가 아닙니다.

Thinking mode: where the performance comes from

Laguna S 2.1의 주요 점수는 '최대 사고(max thinking)' 모드에 크게 의존합니다. 가장 명확한 예는 {{2}}DeepSWE v1.1{{/2}}입니다. 여기서 점수는 생각 없이 할 때 16.5%에서 최대 사고 시 40.4%로 상승합니다 — 모델의 벤치마크 성능 대부분은 추론을 허용함으로써 얻어집니다. {{3}}Terminal-Bench 2.1{{/3}}도 동일한 패턴을 보입니다(60.4% → 70.2%). 이는 비용과 지연 시간 측면에서 중요합니다. 사고 모드는 추가 추론 토큰을 소비하므로, 토큰당 가격은 낮지만, 어려운 작업을 최대 사고로 실행하면 생각 없는 경로보다 더 많은 토큰을 사용하고(더 오래 걸립니다). 실제로는 루틴 완료 작업은 속도와 비용을 위해 생각 없는 모드로 실행하고, 정확도 향상이 토큰을 사용할 가치가 있는 어려운 다단계 문제에 대해서만 사고 모드로 전환할 것입니다. 이는 최첨단 모델에 나타나는 노력 다이얼의 코딩 특화 에코입니다.

벤치마크 심층 분석: 이 코딩 테스트들이 측정하는 것

SWE-Bench Multilingual 은 잘 알려진 SWE-bench(실제 GitHub 이슈 해결)를 여러 프로그래밍 언어로 확장하므로, 78.5%는 실용적이고 언어를 초월한 버그 수정의 강력한 신호입니다 — 그리고 '공개된 크기의 모델을 선도한다'는 비록 공급업체가 주장한 것이지만 의미 있는 주장입니다. Terminal-Bench 2.1 는 모델이 실제 터미널을 작동하여 작업을 종단 간 완료할 수 있는지 테스트하며, 이는 단일 코드 완성보다 자율 코딩 에이전트가 실제로 수행하는 작업에 더 가깝습니다. DeepSWE v1.1 는 더 어려운 에이전틱 소프트웨어 엔지니어링 제품군입니다. 40.4%(vs DeepSeek-V4-Pro-Max의 9.0%)는 훨씬 더 큰 모델과의 큰 격차이기 때문에 Laguna에서 가장 눈에 띄는 수치입니다.

이것이 정직함을 유지하게 하는 주의사항은 다음과 같습니다: 이 결과는 출시 시점 기준으로 Poolside에서 실행한 결과이며, Laguna S 2.1에 대한 게시된 Artificial Analysis Intelligence Index나 독립적인 SWE-bench Verified 수치는 아직 없습니다. 따라서 리더십 주장은 제3자가 확인할 때까지 공급업체가 보고한 것으로 간주하고, Laguna는 코딩 전문 모델이라는 점을 기억하세요. 이는 범용 추론 리더로 포지셔닝되지 않았으며, 일반 지능 지수에서 상위권을 차지할 것으로 기대해서는 안 됩니다.

실제 비용은 얼마인가

바로 이 지점이 Laguna S 2.1이 진정으로 파괴적인 이유입니다. 1M 토큰당 입력 $0.10, 출력 $0.20의 가격으로, 15,000 입력 토큰과 3,000 출력 토큰으로 구성된 일반적인 코딩 호출의 비용은 15k × $0.10/1M + 3k × $0.20/1M = $0.0015 + $0.0006 = 약 $0.0021, 즉 {{1}}0.2센트{{/1}} 수준입니다. 동일한 호출을 Claude Opus 5($5/$25)와 같은 최첨단 모델에서 실행하면 약 $0.15로, 거의 {{2}}70배{{/2}} 차이가 납니다. 저렴한 경쟁사와 비교해도 Laguna는 더 저렴합니다. {{3}}DeepSeek{{/3}}의 가격보다 낮게 책정되어 있죠. {{4}}단, 사고 모드의 경우{{/4}} 까다로운 작업에서 최대 사고를 사용하면 출력 토큰이 몇 배로 늘어나 "$0.0006 출력" 호출이 몇 센트가 될 수도 있습니다. 하지만 비용이 부풀려져도 폐쇄형 최첨단 모델과 비교하면 오차 범위 수준에 불과합니다. CI 봇, 대규모 리팩토링, 에이전트 플릿과 같은 고용량 코딩 자동화에서는 경제성이 탁월합니다. 특히 자체 호스팅을 통해 토큰당 비용을 완전히 제거할 수도 있으므로 더욱 그렇습니다.

Laguna S 2.1에 액세스하여 실행하는 방법

가중치가 공개되어 있기 때문에 두 가지 경로가 있습니다. 호스팅 제공업체를 통해 호출할 수 있습니다(OpenRouter와 같은 애그리게이터에 나타납니다). 요금은 $0.10/$0.20이며, 이것이 가장 빠르게 시도해볼 수 있는 방법입니다. 또는 Hugging Face(poolside/Laguna-S-2.1)에서 가중치를 다운로드하여 자체 호스팅할 수 있습니다. 즉, 코드와 데이터를 자체 환경에 유지하고, 자체 저장소에서 미세 조정하고, 하드웨어에 맞게 양자화하며, 인프라 비용을 제한할 수 있습니다. XS 변형(33B-A3B)은 더 작고 저렴한 것을 로컬에서 실행하려는 경우의 옵션입니다. 어느 쪽이든, tool use와 function calling을 노출하므로 agentic coding harnesses에 통합됩니다.

대상: 세 가지 시나리오

1. 예산에 맞춘 대량 코딩 자동화

CI 수정 봇, 대량 마이그레이션, 또는 토큰 비용이 누적되는 대규모 에이전트 플릿을 운영한다면, Laguna S 2.1의 가격은 혁신적입니다 — 일상적인 작업에는 사고 없이 실행하고, 까다로운 케이스에는 사고를 적용하면 됩니다. 이것이 가장 강력한 사용 사례입니다.

2. 코드 모델을 자체 호스팅해야 하는 팀

자체 코드를 폐쇄형 API로 보낼 수 없는 조직을 위해, 해당 크기 클래스를 선도하는 오픈 웨이트 코더가 정말 필요했습니다. Laguna S 2.1(또는 더 작은 하드웨어용 XS)은 완전히 통제할 수 있는 최첨단에 근접한 코딩을 제공합니다.

3. 코딩 제품을 만드는 비용에 민감한 스타트업

제품 마진이 추론 비용에 달려 있다면, Laguna를 통해 frontier 가격의 일부로 AI 코딩 기능을 제공할 수 있습니다 — 사용자가 가장 어려운 요청을 할 때만 frontier 플래그십을 예약하는 방식입니다.

사용하지 말아야 할 때

절대적인 최고의 코딩 정확도가 필요하고 비용을 지불할 수 있을 때 Laguna S 2.1을 선택하지 마세요 — 폐쇄형 프론티어 모델(Fable 5의 95.0% SWE-bench Verified, Opus 5의 #1 일반 지수, Kimi K3의 #1 프론트엔드 코딩 아레나)이 여전히 여러 벤치마크에서 선두를 달리고 있습니다. 일반 목적 추론, 멀티모달 또는 비코딩 작업에는 사용하지 마세요 — 이는 일반 지능 혈통이 없는 코딩 전문가입니다. 그리고 헤드라인 수치가 무사고 모드에서 유지된다고 가정하지 마세요; 비용 절감을 위해 생각을 비활성화하면 실제로 얻을 수 있는 낮은 점수를 벤치마킹하세요.

결정 체크리스트

• 다음의 경우 Laguna S 2.1을 선택하십시오: 가장 저렴한 유능한 오픈웨이트 코더를 원하거나, 자체 호스팅해야 하거나, 비용이 중요한 대량 코딩 자동화를 실행하는 경우.

• 대신 플래그십 프리미어를 선택하세요: 최고 수준의 코딩 정확도, 일반 추론, 또는 멀티모달이 필요하고, 그 비용을 감당할 수 있다면.

• 기본 루틴 코딩을 Laguna에 할당하고 가장 어려운 작업을 프론티어 모델로 에스컬레이션하여, 하나의 엔드포인트 뒤에서 둘 다 실행합니다.

자주 묻는 질문

Laguna S 2.1의 가격은 얼마인가요?

입력 토큰 100만 개당 $0.10, 출력 토큰 100만 개당 $0.20 — 더 작은 Laguna XS 2.1은 $0.06 / $0.12입니다. 이는 가장 저렴하면서도 성능이 뛰어난 코딩 모델 중 하나이며, 오픈 가중치이므로 자체 호스팅하여 토큰당 비용을 없앨 수 있습니다. [OpenRouter/BenchLM]

라구나 S 2.1은 오픈 소스인가요?

오픈 가중치(open-weight)입니다: 모델 가중치가 Hugging Face(poolside/Laguna-S-2.1)에 게시되어 있어 다운로드, 실행 및 미세 조정이 가능합니다. 특정 사용 사례에 대해서는 Poolside의 라이선스를 확인하세요.

코딩에 있어서 DeepSeek나 Qwen보다 더 나은가요?

Poolside는 자사가 서구의 답안이라고 포지셔닝하며, 훨씬 적은 활성 파라미터로 DeepSWE에서 DeepSeek-V4-Pro-Max를 이겼다(40.4% vs 9.0%)고 보고합니다. 공개되고 크기가 공개된 코딩 벤치마크에서는 Poolside에 따르면 선두를 달리고 있지만, 이는 공급업체가 운영한 것이므로 자체 저장소에서 검증하십시오.

프론티어 모델을 이기나요?

완전히 그렇지는 않습니다. Claude Fable 5, Claude Opus 5, Kimi K3 같은 폐쇄형 플래그십 모델들이 여전히 여러 절대 벤치마크에서 선두를 달리고 있습니다. Laguna의 주장은 체급 내 최고 및 가성비 최고이지, 전반적인 최고는 아닙니다.

What is thinking mode?

빠른 무사고 경로와 더 높은 정확도를 위해 추가 추론 토큰을 사용하는 최대 사고 경로 간의 전환 (예: DeepSWE 16.5% → 40.4%). 일상적인 작업에는 무사고를 사용하고, 어려운 작업에는 사고를 사용하세요.

컨텍스트 창이란 무엇인가요?

최대 1M 토큰까지 지원하므로 대규모 코드베이스와 긴 에이전트 대본이 적합합니다.

S 또는 XS를 사용해야 하나요?

Laguna S 2.1 (118B/8B)는 가장 강력한 코딩을 위한 것이며; Laguna XS 2.1 (33B/3B)는 더 작고 저렴한 것을 자체 호스팅하거나 매우 높은 볼륨으로 서비스하고 싶을 때 사용합니다.

결론

Laguna S 2.1은 현재까지 같은 크기에서 가장 매력적인 오픈 가중치 코딩 모델입니다: 최대 1M 컨텍스트와 생각 전환 기능을 갖춘 118B/8B MoE로, 놀라운 가격인 $0.10/$0.20에 제공되며, Poolside에 따르면 SWE-Bench Multilingual(78.5%)에서 공개된 크기의 모델을 선도하고 에이전트 코딩 테스트에서 훨씬 더 큰 경쟁자들을 능가합니다. 절대적으로 최고의 코더는 아닙니다 — 폐쇄형 프론티어 플래그십은 여전히 여러 벤치마크를 선도하고 있습니다 — 그리고 주요 점수는 토큰을 소비하는 생각 모드에 의존합니다. 하지만 저렴하고 자체 호스팅 가능하며 대량 코딩 작업을 위해서는 그 무게 등급에서 경쟁할 수 있는 모델이 없습니다. Laguna S 2.1을 모든 프론티어 플래그십과 함께 OrcaRouter의 OpenAI 호환 엔드포인트를 통해 라우팅하고 코딩 트래픽의 대부분을 보내며, 가장 어려운 작업만 에스컬레이션하십시오.

© 2026 OrcaRouter

제공업체용

추론 플랫폼을 운영하시나요? OrcaRouter에 모델을 등록하세요.

문의하기

커뮤니티에 참여하세요

DiscordEmailXGitHubYouTube