Laguna S 2.1: Mô hình mã hóa trọng số mở của Poolside vượt xa kỳ vọng về hiệu năng (và giá thành)
Guides & Insights

Laguna S 2.1: Mô hình mã hóa trọng số mở của Poolside vượt xa kỳ vọng về hiệu năng (và giá thành)

Tác giả

jinhao song

Ngày đăng

Mô hình mới nhất · 20Xem tất cả mô hình
Benchmark: Artificial Analysis · cập nhật hằng ngày
Quay lại tất cả bài viết

Vào ngày 21 tháng 7 năm 2026, Poolside đã phát hành Laguna S 2.1 — một mô hình open-weight coding với 118 tỷ tham số, chỉ có khoảng 8 tỷ tham số hoạt động trên mỗi token — và được quảng bá như "mô hình open-weight mạnh nhất phương Tây" và câu trả lời của họ cho DeepSeekQwen. Tiêu đề không phải là nó vượt qua mọi hệ thống đóng hàng đầu; mà là nó đánh bại các mô hình lớn gấp nhiều lần kích thước trên các benchmark coding tác nhân trong khi chi phí $0.10 / $0.20 mỗi triệu token. Hướng dẫn này đề cập đến Laguna S 2.1 thực sự là gì, chế độ suy luận của nó, thông tin nào độc lập so với thông tin từ nhà cung cấp, chi phí ra sao, cách chạy và ai nên sử dụng.

Mọi số liệu dưới đây đều được ghi nguồn. Các điểm số chính của Laguna do Poolside báo cáo (từ tài liệu ra mắt và thẻ Hugging Face của họ) trừ khi có bên thứ ba được nêu tên; hãy coi chúng do nhà cung cấp chạy cho đến khi phòng thí nghiệm độc lập xác nhận. Các điểm chuẩn và giá cả thay đổi — hãy kiểm tra trước khi cam kết ngân sách.

Tóm lại. Laguna S 2.1 là mô hình mã hóa mã nguồn mở dạng MoE (tổng 118B / hoạt động ~8B) với ngữ cảnh lên tới 1M và công tắc "suy nghĩ / không suy nghĩ", có giá chỉ $0,10 đầu vào / $0,20 đầu ra trên mỗi 1M token — chỉ bằng một phần nhỏ so với hầu hết đối thủ. Poolside báo cáo 78,5% trên SWE-Bench Đa ngôn ngữ (dẫn đầu các mô hình công bố kích thước mở), 70,2% trên Terminal-Bench 2.1 và 40,4% trên DeepSWE v1.1 (so với 9,0% của DeepSeek-V4-Pro-Max) — với khoảng một phần sáu tham số hoạt động. Đây là lựa chọn mã hóa tốt nhất về chi phí trên mỗi lần sử dụng mô hình mở mà chúng tôi từng thấy, nhưng các mô hình biên giới đóng nhưClaude Fable 5, Claude Opus 5, và Kimi K3 vẫn dẫn đầu trên một số tiêu chuẩn đánh giá tuyệt đối. Nếu bạn muốn một trình mã hóa giá rẻ, có thể tự lưu trữ có hiệu suất vượt trội so với hạng cân của nó, thì Laguna S 2.1 là sự lựa chọn; nếu bạn cần độ chính xác mã hóa hàng đầu tuyệt đối, một mô hình biên giới hàng đầu vẫn là lựa chọn chiến thắng.

Những điểm chính rút ra

• Mô hình mã hóa trọng số mở tốt nhất theo chi phí. $0.10/$0.20 mỗi 1 triệu token cho một mô hình dẫn đầu các mô hình có kích thước công bố mở trên SWE-Bench Multilingual (78.5%).

• Đánh trên chân. Khoảng 8B tham số hoạt động, nhưng vẫn ngang bằng hoặc vượt qua các mô hình lớn hơn nhiều trên Terminal-Bench 2.1 và SWE-Bench Pro.

• Trọng số mở và có thể tự lưu trữ. Trọng số trên Hugging Face (poolside/Laguna-S-2.1) — bạn có thể chạy nó trong môi trường của riêng bạn.

• Chế độ suy luận thúc đẩy điểm số. Suy luận tối đa nâng DeepSWE từ 16,5% lên 40,4% — mạnh mẽ, nhưng nó tiêu tốn token lý luận, vì vậy hãy dự trù cho nó.

• Không phải là số một tuyệt đối. Những flagship tiên phong kín (Fable 5, Opus 5, Kimi K3) vẫn dẫn đầu một số chuẩn đo lường mã hóa tuyệt đối; Tuyên bố của Laguna là về hạng cân và giá cả, không phải về vị trí đầu bảng.

Một lưu ý khi đọc bản tóm tắt này: mọi thứ được gán cho Poolside đều là tuyên bố của nhà cung cấp từ tài liệu ra mắt; ở đâu có điểm chuẩn độc lập, chúng tôi nêu rõ nguồn. Ở đâu không công bố điểm trí thông minh tổng quát độc lập, chúng tôi nói thẳng thay vì phỏng đoán — Laguna là chuyên gia về mã hóa, không phải kẻ dẫn đầu bảng xếp hạng đa năng.

Thực chất Laguna S 2.1 là gì

Laguna S 2.1 là mô hình lập trình mã nguồn mở (open-weight), mang tính tác nhân (agentic) của Poolside. Về mặt kiến trúc, nó là mô hình hỗn hợp chuyên gia (mixture-of-experts): tổng cộng 118B tham số nhưng chỉ có khoảng 8B được kích hoạt cho mỗi token, đó là lý do tại sao nó rẻ để phục vụ so với năng lực của nó. Nó hỗ trợ ngữ cảnh lên tới 1M token và hai chế độ hoạt động — một đường dẫn "không suy nghĩ" (no-thinking) nhanh và một đường dẫn "suy nghĩ" (thinking) tốn thêm token lý luận cho các vấn đề khó hơn. Nó được xây dựng cho công việc lập trình và tác nhân: sử dụng công cụ, gọi hàm, các tác vụ đa bước. Poolside cũng cung cấp một phiên bản nhỏ hơn, Laguna XS 2.1 (tổng 33B / ~3B hoạt động), với mức giá thậm chí còn thấp hơn $0.06 / $0.12.

Quan trọng là, các trọng số được công khai và đăng tải trên Hugging Face, vì vậy không giống như một mô hình API đóng, bạn có thể tải Laguna S 2.1 về, chạy nó trên cơ sở hạ tầng của riêng mình, tinh chỉnh nó và ghim một phiên bản. Sự kết hợp đó — khả năng lập trình gần với tiên tiến, số lượng tham số hoạt động cực nhỏ, trọng số mở và mức giá cực kỳ thấp — chính là toàn bộ điểm nhấn, và đó là lý do tại sao Poolside coi nó như câu trả lời của phương Tây cho các mô hình mở mạnh mẽ từ DeepSeek và Qwen.

Có gì mới: các điểm chuẩn

Các con số ra mắt đều liên quan đến lập trình. Trên SWE-Bench Multilingual, Poolside báo cáo 78,5%, mà họ cho biết dẫn đầu các mô hình mở có kích thước được tiết lộ. Trên Terminal-Bench 2.1, nó đạt 70,2%. Trên DeepSWE v1.1, nó đạt 40,4% — và so sánh ấn tượng nhất của Poolside là con số này vượt qua 9,0% của DeepSeek-V4-Pro-Max trên cùng bài kiểm tra với chỉ khoảng một phần sáu tham số hoạt động. Trên Terminal-Bench 2.1 và SWE-Bench Pro, Poolside cho biết Laguna S 2.1 sánh ngang hoặc vượt qua các mô hình lớn gấp nhiều lần, bao gồm DeepSeek V4 Flash, NVIDIA's Nemotron 3 Ultra và Thinking Machines' Inkling.

Cách định khung trung thực mà Poolside tự sử dụng là về hạng cân, không phải sự vượt trội tuyệt đối: các mô hình biên giới đóng như Claude Fable 5 và Kimi K3 vẫn dẫn đầu trên một số chuẩn. Vì vậy, cách đúng để hiểu Laguna S 2.1 là "khả năng cao nhất bạn có thể có được từ một mô hình mở, ~8B-active, cực kỳ rẻ," chứ không phải "trình mã hóa tốt nhất chung cuộc."

Thinking mode: where the performance comes from

Laguna S 2.1's headline scores lean heavily on its "max thinking" mode. The clearest example is DeepSWE v1.1, where the score jumps from 16.5% without thinking to 40.4% with max thinking — most of the model's benchmark strength comes from letting it reason. Terminal-Bench 2.1 shows the same pattern (60.4% → 70.2%). This matters for cost and latency: thinking mode spends extra reasoning tokens, so while the per-token price is tiny, a hard task run at max thinking uses more tokens (and takes longer) than the no-thinking path. In practice you'd run routine completions in no-thinking mode for speed and cost, and switch to thinking only for the hard, multi-step problems where the accuracy jump is worth the tokens — a coding-specific echo of the effort dials appearing on frontier models.

Phân tích chuyên sâu về benchmark: những bài kiểm tra lập trình này đo lường điều gì

SWE-Bench Multilingual mở rộng SWE-bench nổi tiếng (giải quyết các vấn đề thực tế trên GitHub) qua nhiều ngôn ngữ lập trình, do đó 78.5% là một tín hiệu mạnh mẽ về khả năng sửa lỗi thực tế, đa ngôn ngữ — và "dẫn đầu các mô hình có kích thước công bố" là một tuyên bố có ý nghĩa, dù do nhà cung cấp đưa ra. Terminal-Bench 2.1 kiểm tra liệu một mô hình có thể vận hành một terminal thực để hoàn thành các tác vụ từ đầu đến cuối hay không, điều này gần với những gì một tác tử mã hóa tự động thực sự làm hơn là một lần hoàn thành mã đơn lẻ. DeepSWE v1.1 là một bộ công cụ kỹ thuật phần mềm dạng tác tử khó hơn; 40.4% (so với 9.0% của DeepSeek-V4-Pro-Max) là con số hào nhoáng nhất của Laguna chính xác vì nó là một khoảng cách lớn so với một mô hình lớn hơn nhiều.

Lưu ý để giữ điều này trung thực: đây là kết quả do Poolside chạy tại thời điểm ra mắt, và chưa có Chỉ số Trí tuệ Phân tích Nhân tạo nào được công bố hoặc con số SWE-bench Verified độc lập cho Laguna S 2.1. Vì vậy, hãy coi các tuyên bố về vị trí dẫn đầu là do nhà cung cấp báo cáo cho đến khi bên thứ ba xác nhận, và hãy nhớ rằng Laguna là chuyên gia về mã hóa — nó không được định vị như một nhà lãnh đạo về lý luận đa năng, và bạn không nên mong đợi nó đứng đầu một chỉ số trí tuệ tổng quát.

Chi phí thực tế

Đây là nơi Laguna S 2.1 thực sự gây đột phá. Với mức {{1}}$0,10 đầu vào / $0,20 đầu ra trên 1M token{{/1}}, một cuộc gọi mã hóa đại diện gồm {{2}}15.000 token đầu vào{{/2}} và {{3}}3.000 token đầu ra{{/3}} có chi phí: {{4}}15.000 × $0,10/1M + 3.000 × $0,20/1M{{/4}} = {{5}}$0,0015 + $0,0006{{/5}} = khoảng {{6}}$0,0021{{/6}} — tức khoảng một phần năm xu. Cùng một cuộc gọi trên mô hình tiên tiến như {{7}}Claude Opus 5 ($5/$25){{/7}} có giá khoảng {{8}}$0,15{{/8}} — gần gấp {{9}}70{{/9}} lần. Ngay cả so với các đối thủ giá rẻ, {{10}}Laguna{{/10}} vẫn rẻ hơn: nó được định vị thấp hơn mức giá của {{11}}DeepSeek{{/11}}. Dấu hoa thị là chế độ suy luận — một tác vụ khó ở mức suy luận tối đa có thể tạo ra số token đầu ra nhiều gấp nhiều lần, vì vậy một cuộc gọi "{{12}}$0,0006 đầu ra{{/12}}" có thể trở thành vài xu. Nhưng ngay cả khi bị thổi phồng, chi phí này vẫn là sai số làm tròn so với các mô hình tiên tiến đóng. Đối với tự động hóa mã hóa khối lượng lớn — {{13}}bot CI, tái cấu trúc hàng loạt, đội tác tử{{/13}} — hiệu quả kinh tế khó có thể bàn cãi, đặc biệt là bạn cũng có thể tự lưu trữ để loại bỏ hoàn toàn chi phí trên mỗi token.

Cách truy cập và chạy Laguna S 2.1

Vì các trọng số được mở, bạn có hai lựa chọn. Bạn có thể gọi nó qua các nhà cung cấp lưu trữ (nó xuất hiện trên các nền tảng tổng hợp như OpenRouter) với mức giá $0.10/$0.20, đây là cách nhanh nhất để thử. Hoặc bạn có thể tải trọng số từ Hugging Face (poolside/Laguna-S-2.1) và tự lưu trữ — giữ mã và dữ liệu trong môi trường của bạn, tinh chỉnh trên kho lưu trữ của bạn, lượng tử hóa cho phần cứng của bạn và giới hạn chi phí trong cơ sở hạ tầng của bạn. Biến thể XS (33B-A3B) là lựa chọn khi bạn muốn chạy thứ gì đó thậm chí nhỏ hơn và rẻ hơn ở địa phương. Dù theo cách nào, nó cũng hỗ trợ sử dụng công cụ và gọi hàm, vì vậy nó phù hợp với các khung mã hóa tác nhân.

Dành cho ai: ba tình huống

1. Tự động hóa viết mã khối lượng lớn với ngân sách tiết kiệm

Nếu bạn chạy các bot sửa lỗi CI, di chuyển hàng loạt, hoặc các đội agent lớn nơi chi phí token tăng lên, giá của Laguna S 2.1 mang tính đột phá — hãy chạy không suy nghĩ cho công việc thông thường và suy nghĩ cho các trường hợp khó. Đây là trường hợp sử dụng mạnh nhất của nó.

2. Các nhóm phải tự lưu trữ mô hình code

Đối với các tổ chức không thể gửi mã nguồn độc quyền đến một API đóng, một trình mã hóa trọng số mở dẫn đầu trong lớp kích thước của nó chính xác là thứ còn thiếu. Laguna S 2.1 (hoặc XS dành cho phần cứng nhỏ hơn) mang đến cho bạn khả năng mã hóa gần như tiên phong mà bạn hoàn toàn kiểm soát.

3. Các startup nhạy cảm về chi phí xây dựng sản phẩm lập trình

Nếu lợi nhuận sản phẩm của bạn phụ thuộc vào chi phí suy luận, Laguna cho phép bạn cung cấp các tính năng lập trình AI với một phần nhỏ so với giá frontier — dành riêng một flagship frontier chỉ cho những yêu cầu khó nhất mà người dùng của bạn gặp phải.

Khi nào không nên sử dụng

Đừng với tới Laguna S 2.1 khi bạn cần độ chính xác mã tốt nhất tuyệt đối và có thể trả tiền — các mô hình frontier đóng (Fable 5 với 95,0% SWE-bench Verified, Opus 5 với #1 chỉ số tổng quát, Kimi K3 với #1 Frontend Coding Arena) vẫn dẫn đầu một số benchmark. Đừng sử dụng nó cho lý luận đa năng, đa phương thức hoặc các tác vụ không liên quan đến mã — nó là một chuyên gia mã hóa không có nền tảng trí tuệ tổng quát. Và đừng cho rằng các con số tiêu đề vẫn đúng ở chế độ không suy luận; nếu bạn tắt suy luận để tiết kiệm chi phí, hãy benchmark các điểm số thấp hơn mà bạn thực sự sẽ nhận được.

Danh sách kiểm tra quyết định

• Chọn Laguna S 2.1 nếu: bạn muốn bộ mã hóa nguồn mở có khả năng rẻ nhất, bạn phải tự lưu trữ, hoặc bạn chạy tự động hóa viết mã khối lượng lớn nơi chi phí chiếm ưu thế.

• Thay vào đó, hãy chọn một flagship tiên tiến nếu: bạn cần độ chính xác mã hóa hàng đầu tuyệt đối, lý luận tổng quát hoặc đa phương thức — và có thể chi trả.

• Chạy cả hai nếu: lập trình mặc định thông thường cho Laguna và chuyển các tác vụ khó nhất lên mô hình tiên phong, đằng sau một điểm cuối.

Câu hỏi thường gặp

Laguna S 2.1 giá bao nhiêu?

$0.10 cho mỗi 1 triệu token đầu vào và $0.20 cho mỗi 1 triệu token đầu ra — với phiên bản Laguna XS 2.1 nhỏ hơn ở mức $0.06 / $0.12. Đây là một trong những mô hình lập trình có khả năng rẻ nhất hiện có, và vì là open-weight, bạn có thể tự lưu trữ để loại bỏ chi phí theo token. [OpenRouter/BenchLM]

Laguna S 2.1 có phải là mã nguồn mở không?

Nó có trọng số mở: các trọng số mô hình được công bố trên Hugging Face (poolside/Laguna-S-2.1), vì vậy bạn có thể tải xuống, chạy và tinh chỉnh nó. Hãy kiểm tra giấy phép của Poolside cho mục đích sử dụng cụ thể của bạn.

Nó có tốt hơn DeepSeek hay Qwen cho việc viết mã không?

Poolside định vị nó như câu trả lời của phương Tây dành cho họ và báo cáo đánh bại DeepSeek-V4-Pro-Max trên DeepSWE (40,4% so với 9,0%) với số lượng tham số hoạt động ít hơn đáng kể. Trên các benchmark mã nguồn mở có công bố kích thước, nó dẫn đầu theo Poolside — nhưng các benchmark này do nhà cung cấp chạy, vì vậy hãy xác thực trên kho lưu trữ của riêng bạn.

Nó có đánh bại các mô hình tiên tiến không?

Không hoàn toàn. Các flagship đóng như Claude Fable 5, Claude Opus 5 và Kimi K3 vẫn dẫn đầu một số benchmark tuyệt đối. Tuyên bố của Laguna là tốt nhất trong hạng cân và tốt nhất về giá trị đồng tiền, không phải tốt nhất tổng thể.

What is thinking mode?

Một công tắc chuyển đổi giữa đường dẫn không suy nghĩ nhanh và đường dẫn suy nghĩ tối đa, tiêu tốn thêm token lý luận để đạt độ chính xác cao hơn (ví dụ: DeepSWE 16.5% → 40.4%). Sử dụng không suy nghĩ cho công việc thường ngày, suy nghĩ cho các tác vụ khó.

Cửa sổ ngữ cảnh là gì?

Lên tới 1 triệu token, do đó các mã nguồn lớn và bản ghi tác nhân dài phù hợp.

Tôi nên dùng S hay XS?

Laguna S 2.1 (118B/8B) dành cho khả năng coding mạnh nhất; Laguna XS 2.1 (33B/3B) khi bạn muốn một thứ gì đó nhỏ hơn và rẻ hơn để tự lưu trữ hoặc phục vụ ở khối lượng rất cao.

Kết luận

Laguna S 2.1 là mô hình mã nguồn mở về trọng số hấp dẫn nhất trong phân khúc kích thước của nó cho đến nay: một MoE 118B/8B với ngữ cảnh lên tới 1M và công tắc suy luận, được định giá đáng kinh ngạc ở mức $0,10 / $0,20, mà Poolside tuyên bố dẫn đầu các mô hình có kích thước công khai trên SWE-Bench Multilingual (78,5%) và đánh bại các đối thủ lớn hơn nhiều trong các bài kiểm tra mã hóa tác nhân. Nó không phải là công cụ mã hóa tốt nhất tuyệt đối — các flagship biên giới đóng vẫn dẫn đầu một số chuẩn — và các điểm số nổi bật của nó phụ thuộc vào chế độ suy luận, vốn tiêu tốn token. Nhưng đối với mã hóa giá rẻ, có thể tự lưu trữ, khối lượng lớn, không có gì trong cùng hạng trọng lượng của nó có thể cạnh tranh. Định tuyến Laguna S 2.1 cùng với mọi flagship biên giới thông qua một endpoint tương thích OpenAI tại OrcaRouter và gửi cho nó phần lớn lưu lượng mã hóa của bạn, chỉ chuyển tiếp các tác vụ khó nhất.

© 2026 OrcaRouter

Dành cho nhà cung cấp

Bạn vận hành nền tảng suy luận? Đưa mô hình của bạn lên OrcaRouter.

Liên hệ với chúng tôi

Tham gia cộng đồng

DiscordEmailXGitHubYouTube