
ลากูน่า เอส 2.1: โมเดลโค้ดดิ้งแบบโอเพนเวทจากพูลไซด์ที่ทรงพลังเกินตัว (และราคา)
- qwenใหม่Qwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 ต่อ 1 ล้านโทเค็น
- orcaใหม่OrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicใหม่Anthropic: Claude Opus 52026-07-2461ความฉลาด78การเขียนโค้ด
- googleใหม่Google: Gemini 3.6 Flash2026-07-2150ความฉลาด69การเขียนโค้ด
- googleใหม่Google: Gemini 3.5 Flash-Lite2026-07-2137ความฉลาด49การเขียนโค้ด
- metaใหม่Meta: Muse Spark 1.12026-07-1651ความฉลาด71การเขียนโค้ด
- kimiMoonshotAI: Kimi K32026-07-1557ความฉลาด76การเขียนโค้ด
- openaiOpenAI: GPT-5.6 Luna2026-07-0951ความฉลาด71การเขียนโค้ด
- openaiOpenAI: GPT-5.6 Terra2026-07-0955ความฉลาด77การเขียนโค้ด
- openaiOpenAI: GPT-5.6 Sol2026-07-0959ความฉลาด77การเขียนโค้ด
- grokxAI: Grok 4.52026-07-0854ความฉลาด72การเขียนโค้ด
- tencentTencent: Hy32026-07-0641ความฉลาด59การเขียนโค้ด
- obsidianQwen3.6 35B A3B Uncensored (Aggressive)2026-07-0232ความฉลาด42การเขียนโค้ด
- obsidianGemma4 26B A4B Uncensored (Balanced)2026-07-0226ความฉลาด39การเขียนโค้ด
- anthropicAnthropic: Claude Sonnet 52026-06-3053ความฉลาด72การเขียนโค้ด
- klingKling: Kling 3.0 Turbo2026-06-1757ความฉลาด52การเขียนโค้ด57คณิตศาสตร์
- z-aiZ.ai: GLM 5.22026-06-1651ความฉลาด69การเขียนโค้ด60คณิตศาสตร์
- kimiMoonshotAI: Kimi K2.7 Code2026-06-1242ความฉลาด61การเขียนโค้ด61คณิตศาสตร์
- anthropicAnthropic: Claude Fable 52026-06-0960ความฉลาด77การเขียนโค้ด
- qwenQwen: Qwen3.7 Plus2026-06-0139ความฉลาด56การเขียนโค้ด59คณิตศาสตร์
ในวันที่ 21 กรกฎาคม 2026 Poolside ได้เปิดตัว Laguna S 2.1 — โมเดลโค้ด open-weight ที่มีพารามิเตอร์ 118 พันล้านพารามิเตอร์ โดยมีพารามิเตอร์ที่ทำงานอยู่เพียงประมาณ 8 พันล้านพารามิเตอร์ต่อโทเคน — และโฆษณาว่าเป็น "โมเดล open-weight ที่มีความสามารถมากที่สุดในตะวันตก" และเป็นคำตอบของ DeepSeek และ Qwen ประเด็นหลักไม่ได้อยู่ที่มันเอาชนะระบบ frontier แบบปิดทุกระบบ แต่อยู่ที่มันเอาชนะโมเดลที่มีขนาดใหญ่กว่าหลายเท่าในการทดสอบ agentic coding ขณะที่มีค่าใช้จ่าย $0.10 / $0.20 ต่อล้านโทเคน คู่มือนี้ครอบคลุมว่าแท้จริงแล้ว Laguna S 2.1 คืออะไร โหมดการคิดของมัน สิ่งที่รายงานโดยอิสระเทียบกับที่ผู้ผลิตแจ้ง ราคาเท่าไร วิธีการรัน และใครควรใช้มัน
รูปแต่ละรูปด้านล่างมีป้ายกำกับแหล่งที่มา คะแนนหลักของ Laguna รายงานโดย Poolside (จากเอกสารเปิดตัวและบัตร Hugging Face) เว้นแต่จะมีการอ้างถึงบุคคลที่สามที่มีชื่อ; ให้ถือว่าคะแนนเหล่านี้ดำเนินการโดยผู้ขายจนกว่าห้องปฏิบัติการอิสระจะยืนยัน เกณฑ์มาตรฐานและราคามีการเปลี่ยนแปลง — ตรวจสอบก่อนที่คุณจะตกลงงบประมาณ
TL;DR. Laguna S 2.1 เป็นโมเดลโค้ดแบบเปิดน้ำหนัก MoE (118B รวม / ~8B แอคทีฟ) รองรับบริบทสูงสุด 1M และมีสวิตช์ "คิด/ไม่คิด" ราคาเพียง $0.10 ต่อ 1M โทเค็นสำหรับอินพุต และ $0.20 สำหรับเอาต์พุต — เป็นเศษเสี้ยวของคู่แข่งส่วนใหญ่ Poolside รายงาน 78.5% บน SWE-Bench Multilingual (นำในกลุ่มโมเดลเปิดที่เปิดเผยขนาด), 70.2% บน Terminal-Bench 2.1 และ 40.4% บน DeepSWE v1.1 (เทียบกับ DeepSeek-V4-Pro-Max ที่ 9.0%) — โดยใช้พารามิเตอร์แอคทีฟประมาณหนึ่งในหก ถือเป็นตัวเลือกคุ้มค่าโค้ดต่อราคาที่ดีที่สุดในกลุ่มเปิดเท่าที่เราเคยเห็น แต่โมเดลปิดแนวหน้าอย่าง Claude Fable 5, Claude Opus 5, และ Kimi K3 ยังคงนำในหลายเกณฑ์มาตรฐานสัมบูรณ์ หากคุณต้องการตัวเขียนโค้ดราคาถูกที่โฮสต์เองได้และมีประสิทธิภาพเหนือกว่าน้ำหนักคลาสของมัน Laguna S 2.1 คือคำตอบ; แต่ถ้าต้องการความแม่นยำระดับสูงสุด โมเดลเรือธงแนวหน้าก็ยังคงชนะ
ประเด็นสำคัญ
• รุ่นน้ำหนักเปิดสำหรับการเขียนโค้ดที่ดีที่สุดต่อดอลลาร์ $0.10/$0.20 ต่อ 1M โทเค็น สำหรับรุ่นที่เป็นผู้นำรุ่นที่เปิดเผยขนาดบน SWE-Bench Multilingual (78.5%)
• ต่อยหนักเกินตัว มีพารามิเตอร์ใช้งานจริง ~8B แต่ยังเทียบเท่าหรือเหนือกว่าโมเดลที่ใหญ่กว่ามากใน Terminal-Bench 2.1 และ SWE-Bench Pro
• โอเพนเวทและสามารถโฮสต์เองได้ น้ำหนักบน Hugging Face (poolside/Laguna-S-2.1) — คุณสามารถรันมันในสภาพแวดล้อมของคุณเอง
• โหมดการคิดขับเคลื่อนคะแนน การคิดสูงสุดยกระดับ DeepSWE จาก 16.5% เป็น 40.4% — ทรงพลัง แต่ใช้โทเค็นการให้เหตุผล ดังนั้นควรจัดสรรงบประมาณให้
• ไม่ใช่อันดับหนึ่งโดยตรง เรือธงรุ่นปิดที่ล้ำสมัย (Fable 5, Opus 5, Kimi K3) ยังคงนำในหลายเกณฑ์มาตรฐานการเขียนโค้ดที่สมบูรณ์ จุดเด่นของ Laguna คือระดับน้ำหนักและราคา ไม่ใช่การเป็นอันดับสูงสุด
หมายเหตุเกี่ยวกับการอ่านบทสรุปนี้: ทุกสิ่งที่ระบุว่าเป็นของ Poolside เป็นการอ้างสิทธิ์จากผู้จำหน่ายที่มาจากเอกสารเปิดตัว; ในกรณีที่เกณฑ์วัดเป็นอิสระ เราจะระบุชื่อแหล่งที่มา. ในกรณีที่คะแนนความฉลาดทั่วไปที่เป็นอิสระยังไม่ได้รับการเผยแพร่ เราจะบอกตามนั้นแทนที่จะเดา — Laguna เป็นผู้เชี่ยวชาญด้านการเขียนโค้ด ไม่ใช่ผู้ที่ขึ้นอันดับสูงในกระดานผู้นำทั่วไป
ที่จริงแล้ว Laguna S 2.1 คืออะไร
Laguna S 2.1 เป็นโมเดลการเขียนโค้ดแบบ agentic แบบ open-weight ของ Poolside ในทางสถาปัตยกรรม มันเป็น mixture-of-experts: มีพารามิเตอร์รวม 118B แต่เปิดใช้งานเพียงประมาณ 8B ต่อโทเค็น ซึ่งเป็นเหตุผลว่าทำไมมันถึงมีต้นทุนการให้บริการต่ำเมื่อเทียบกับความสามารถ มันรองรับบริบทสูงสุด 1M โทเค็น และโหมดการทำงานสองโหมด — เส้นทาง "no-thinking" ที่รวดเร็ว และเส้นทาง "thinking" ที่ใช้โทเค็นการให้เหตุผลเพิ่มเติมสำหรับปัญหาที่ยากขึ้น มันถูกสร้างมาสำหรับงานเขียนโค้ดและงานแบบ agentic: การใช้เครื่องมือ การเรียกฟังก์ชัน งานหลายขั้นตอน Poolside ยังจัดส่งรุ่นน้องที่เล็กกว่า คือ Laguna XS 2.1 (รวม 33B / เปิดใช้งาน ~3B) ในราคาที่ต่ำกว่าอีกคือ $0.06 / $0.12
สิ่งสำคัญคือ น้ำหนัก (weights) ถูกเปิดเผยและเผยแพร่บน Hugging Face ดังนั้นแตกต่างจากโมเดล API แบบปิด คุณสามารถดาวน์โหลด Laguna S 2.1 รันบนโครงสร้างพื้นฐานของคุณเอง ปรับแต่งละเอียด (fine-tune) และกำหนดเวอร์ชันได้ การผสมผสานนั้น — การเขียนโค้ดที่ใกล้เคียงกับระดับแนวหน้า จำนวนพารามิเตอร์ที่ใช้งานน้อย น้ำหนักที่เปิดเผย และราคาที่ถูกที่สุด — คือข้อเสนอทั้งหมด และนี่คือเหตุผลที่ Poolside มองว่าเป็นคำตอบของตะวันตกต่อโมเดลโอเพนที่แข็งแกร่งจาก DeepSeek และ Qwen
มีอะไรใหม่: เกณฑ์มาตรฐาน
ตัวเลขการเปิดตัวนั้นเกี่ยวกับการเขียนโค้ดทั้งหมด บน SWE-Bench Multilingual Poolside รายงาน 78.5% ซึ่งระบุว่านำหน้าโมเดลเปิดที่เปิดเผยขนาด บน Terminal-Bench 2.1 ได้คะแนน 70.2% บน DeepSWE v1.1 ถึง 40.4% — และการเปรียบเทียบที่โดดเด่นที่สุดของ Poolside คือสิ่งนี้เอาชนะ DeepSeek-V4-Pro-Max ที่ 9.0% ในการทดสอบเดียวกันโดยใช้พารามิเตอร์ที่ใช้งานอยู่ประมาณหนึ่งในหก บน Terminal-Bench 2.1 และ SWE-Bench Pro Poolside กล่าวว่า Laguna S 2.1 เทียบเท่าหรือเกินกว่าโมเดลที่มีขนาดใหญ่กว่าหลายเท่า รวมถึง DeepSeek V4 Flash, NVIDIA's Nemotron 3 Ultra, และ Thinking Machines' Inkling.
กรอบการนำเสนอที่ตรงไปตรงมาซึ่ง Poolside ใช้เองนั้นเกี่ยวกับระดับน้ำหนัก ไม่ใช่ความเหนือกว่าอย่างเด็ดขาด: โมเดลปิดชั้นนำอย่าง Claude Fable 5 และ Kimi K3 ยังคงนำอยู่ในเกณฑ์วัดหลายตัว ดังนั้นวิธีที่ถูกต้องในการอ่าน Laguna S 2.1 คือ "ความสามารถมากที่สุดที่คุณจะได้จากโมเดลเปิดที่ทำงาน ~8B-active และต้นทุนต่ำมาก" ไม่ใช่ "โค้ดเดอร์ที่ดีที่สุดโดยทั่วไป"

Thinking mode: where the performance comes from
คะแนนเด่นของรุ่น Laguna S 2.1 พึ่งพาโหมด "การคิดขั้นสูงสุด" เป็นอย่างมาก ตัวอย่างที่ชัดเจนที่สุดคือ DeepSWE v1.1 ซึ่งคะแนนกระโดดจาก 16.5% เมื่อไม่ใช้การคิด เป็น 40.4% เมื่อใช้การคิดขั้นสูงสุด — จุดแข็งด้านเกณฑ์มาตรฐานส่วนใหญ่ของโมเดลมาจากการปล่อยให้มันใช้เหตุผล Terminal-Bench 2.1 ก็แสดงรูปแบบเดียวกัน (60.4% → 70.2%) เรื่องนี้สำคัญต่อต้นทุนและเวลาแฝง: โหมดการคิดใช้โทเค็นการใช้เหตุผลเพิ่มเติม ดังนั้นแม้ราคาต่อโทเค็นจะเล็กน้อย แต่งานที่ยากซึ่งทำงานที่การคิดขั้นสูงสุดจะใช้โทเค็นมากกว่า (และใช้เวลานานกว่า) เส้นทางที่ไม่ใช้การคิด ในทางปฏิบัติ คุณจะให้ทำงานประจำโดยใช้โหมดไม่คิดเพื่อความเร็วและต้นทุน แล้วสลับไปใช้การคิดเฉพาะปัญหาที่ยากและหลายขั้นตอนที่การเพิ่มความแม่นยำคุ้มค่ากับโทเค็นที่ใช้ — ซึ่งเป็นภาพสะท้อนเฉพาะด้านการเขียนโค้ดของปุ่มปรับความพยายามที่ปรากฏในโมเดลระดับ前沿
การเจาะลึกเกณฑ์มาตรฐาน: สิ่งที่การทดสอบการเขียนโค้ดเหล่านี้วัด
SWE-Bench Multilingual ขยายขอบเขตของ SWE-bench ที่รู้จักกันดี (การแก้ไขปัญหา GitHub จริง) ครอบคลุมหลายภาษาโปรแกรม ดังนั้น 78.5% จึงเป็นสัญญาณที่แข็งแกร่งของการแก้ไขข้อบกพร่องข้ามภาษาในทางปฏิบัติ — และ 'นำหน้าโมเดลขนาดเปิดเผย' เป็นข้อกล่าวอ้างที่มีความหมาย หากเป็นการกล่าวโดยผู้ขาย Terminal-Bench 2.1 ทดสอบว่าโมเดลสามารถทำงานบนเทอร์มินัลจริงเพื่อทำงานให้เสร็จสมบูรณ์แบบ end-to-end ได้หรือไม่ ซึ่งใกล้เคียงกับสิ่งที่ตัวแทนเขียนโค้ดอัตโนมัติทำจริงมากกว่าการเติมโค้ดครั้งเดียว DeepSWE v1.1 เป็นชุดทดสอบวิศวกรรมซอฟต์แวร์แบบ agentic ที่ยากขึ้น; คะแนน 40.4% (เทียบกับ 9.0% ของ DeepSeek-V4-Pro-Max) เป็นตัวเลขที่โดดเด่นที่สุดของ Laguna เพราะเป็นช่องว่างขนาดใหญ่ที่เทียบกับโมเดลที่ใหญ่กว่ามาก
ข้อควรระวังที่ทำให้สิ่งนี้ซื่อตรง: นี่เป็นผลลัพธ์ที่ Poolside ดำเนินการ ณ เวลาเปิดตัว และยังไม่มีดัชนี Artificial Analysis Intelligence หรือตัวเลข SWE-bench Verified ที่เป็นอิสระสำหรับ Laguna S 2.1 ดังนั้นให้ถือว่าข้อกล่าวอ้างเรื่องความเป็นผู้นำเป็นข้อมูลที่ผู้ขายรายงานจนกว่าบุคคลที่สามจะยืนยัน และโปรดจำไว้ว่า Laguna เป็นผู้เชี่ยวชาญด้านการเขียนโค้ด — มันไม่ได้ถูกวางตำแหน่งให้เป็นผู้นำด้านการใช้เหตุผลทั่วไป และคุณไม่ควรคาดหวังให้มันขึ้นนำในดัชนีความฉลาดทั่วไป

ค่าใช้จ่ายในทางปฏิบัติ
นี่คือจุดที่ Laguna S 2.1 สร้างความเปลี่ยนแปลงอย่างแท้จริง ด้วยราคา $0.10 ต่ออินพุต / $0.20 ต่อเอาต์พุตต่อ 1 ล้านโทเคน การเรียกใช้โค้ดโดยทั่วไปที่อินพุต 15,000 และเอาต์พุต 3,000 โทเคน จะมีต้นทุน 15k × $0.10/1M + 3k × $0.20/1M = $0.0015 + $0.0006 = ประมาณ $0.0021 — หรือประมาณหนึ่งในห้าของเซนต์ การเรียกใช้แบบเดียวกันบนโมเดล frontier อย่าง Claude Opus 5 ($5/$25) อยู่ที่ประมาณ $0.15 — มากกว่าเกือบ 70 เท่า แม้เทียบกับคู่แข่งราคาถูก Laguna ก็ยังถูกกว่า: ราคาของมันต่ำกว่าการกำหนดราคาของ DeepSeek ข้อสังเกตคือโหมดคิด — งานยากที่คิดสูงสุดอาจสร้างโทเคนเอาต์พุตมากขึ้นหลายเท่า ดังนั้นการเรียกใช้ "$0.0006 เอาต์พุต" อาจกลายเป็นไม่กี่เซนต์ แต่ถึงจะพองตัว ต้นทุนก็เป็นแค่เศษเล็กเศษน้อยเมื่อเทียบกับโมเดล frontier แบบปิด สำหรับการทำงานอัตโนมัติด้านโค้ดปริมาณสูง — บอท CI, การรีแฟคเตอร์จำนวนมาก, กลุ่มเอเจนต์ — เศรษฐศาสตร์นี้เถียงยาก โดยเฉพาะอย่างยิ่งเมื่อคุณสามารถโฮสต์เองเพื่อตัดต้นทุนต่อโทเคนออกไปทั้งหมด
วิธีการเข้าถึงและรัน Laguna S 2.1
เนื่องจากน้ำหนักของโมเดลเป็นแบบโอเพน คุณจึงมีสองทางเลือก คุณสามารถเรียกใช้ผ่านผู้ให้บริการโฮสต์ (ซึ่งปรากฏบนแอ็กกริเกเตอร์อย่าง OpenRouter) ในอัตรา $0.10/$0.20 ซึ่งเป็นวิธีที่เร็วที่สุดในการทดลองใช้งาน หรือคุณสามารถดาวน์โหลดน้ำหนักจาก Hugging Face (poolside/Laguna-S-2.1) และโฮสต์ด้วยตนเอง — โดยเก็บโค้ดและข้อมูลไว้ในสภาพแวดล้อมของคุณ ปรับแต่งบนรีพอสิทอรีของคุณ ควอนไทซ์สำหรับฮาร์ดแวร์ของคุณ และจำกัดค่าใช้จ่ายไว้ที่โครงสร้างพื้นฐานของคุณ รูปแบบ XS (33B-A3B) เป็นตัวเลือกเมื่อคุณต้องการรันอะไรที่เล็กกว่าและถูกกว่าในเครื่อง ไม่ว่าคุณจะเลือกทางไหน มันก็เปิดให้ใช้เครื่องมือและการเรียกใช้ฟังก์ชัน ดังนั้นมันจึงเข้ากับชุดเครื่องมือโค้ดแบบเอเจนต์ได้
เหมาะสำหรับใคร: สามสถานการณ์
1. การเขียนโค้ดอัตโนมัติปริมาณสูงในงบประมาณจำกัด
หากคุณใช้บอทซ่อมแซม CI การโยกย้ายข้อมูลจำนวนมาก หรือกองทัพตัวแทนขนาดใหญ่ที่ต้นทุนโทเค็นทบต้น ราคาของ Laguna S 2.1 นั้นเปลี่ยนแปลงได้อย่างพลิกโฉม — ใช้โหมดไม่คิดสำหรับงานประจำ และใช้โหมดคิดสำหรับกรณียาก นี่คือกรณีการใช้งานที่แข็งแกร่งที่สุด
2. ทีมที่ต้องโฮสต์โค้ดโมเดลด้วยตนเอง
สำหรับองค์กรที่ไม่สามารถส่งโค้ดที่เป็นกรรมสิทธิ์ไปยัง API แบบปิดได้ โค้ดเดอร์แบบ open-weight ที่เป็นผู้นำในระดับขนาดเดียวกันนั้นคือสิ่งที่ขาดหายไป Laguna S 2.1 (หรือ XS สำหรับฮาร์ดแวร์ขนาดเล็ก) มอบการเขียนโค้ดที่ใกล้เคียงกับ frontier ซึ่งคุณควบคุมได้อย่างเต็มที่
3. สตาร์ทอัพที่ไวต่อต้นทุนซึ่งสร้างผลิตภัณฑ์ด้านการเขียนโค้ด
หากอัตรากำไรของผลิตภัณฑ์ของคุณขึ้นอยู่กับต้นทุนการอนุมาน Laguna จะช่วยให้คุณนำเสนอฟีเจอร์การเขียนโค้ดด้วย AI ในราคาเพียงเศษเสี้ยวของราคารุ่นเรือธงแนวหน้า — โดยสงวนรุ่นเรือธงแนวหน้าไว้สำหรับคำขอที่ยากที่สุดที่ผู้ใช้ของคุณเจอเท่านั้น

เมื่อใดที่ไม่ควรใช้
อย่าใช้ Laguna S 2.1 เมื่อคุณต้องการความแม่นยำในการเขียนโค้ดที่ดีที่สุดอย่างแท้จริงและสามารถจ่ายได้ — โมเดล frontier แบบปิด (Fable 5's 95.0% SWE-bench Verified, Opus 5's #1 general index, Kimi K3's #1 Frontend Coding Arena) ยังคงนำในหลายเกณฑ์มาตรฐาน อย่าใช้มันสำหรับการให้เหตุผลทั่วไป หลายรูปแบบ หรืองานที่ไม่ใช่การเขียนโค้ด — มันเป็นผู้เชี่ยวชาญด้านการเขียนโค้ดที่ไม่มีพื้นฐานความฉลาดทั่วไป และอย่าสมมติว่าตัวเลขที่โดดเด่นนั้นคงอยู่ที่โหมดไม่คิด; หากคุณปิดการคิดเพื่อประหยัดต้นทุน ให้วัด benchmark คะแนนที่ต่ำกว่าที่คุณจะได้รับจริง
รายการตรวจสอบการตัดสินใจ
• เลือก Laguna S 2.1 หาก: คุณต้องการนักเขียนโค้ดโอเพนเวทที่ถูกที่สุดและมีความสามารถ คุณต้องโฮสต์เอง หรือคุณใช้งานระบบอัตโนมัติด้านการเขียนโค้ดปริมาณมากที่ต้นทุนเป็นปัจจัยหลัก
• เลือกใช้รุ่นเรือธงระดับแนวหน้าแทน หาก: คุณต้องการความแม่นยำในการเขียนโค้ดสูงสุด การใช้เหตุผลทั่วไป หรือมัลติโหมด — และสามารถจ่ายได้
• เรียกใช้ทั้งสองหาก: โค้ดประจำตามค่าเริ่มต้นไปที่ Laguna และส่งต่องานที่ยากที่สุดไปยัง frontier model ที่อยู่เบื้องหลังปลายทางเดียว
คำถามที่พบบ่อย
Laguna S 2.1 ราคาเท่าไหร่?
$0.10 ต่อ 1M input tokens และ $0.20 ต่อ 1M output — โดยมีรุ่น Laguna XS 2.1 ที่เล็กกว่าที่ $0.06 / $0.12. มันเป็นหนึ่งในโมเดล coding ที่มีความสามารถและราคาถูกที่สุดที่มีอยู่ และด้วยการเป็น open-weight คุณสามารถ self-host เพื่อกำจัดค่าใช้จ่ายต่อ token. [OpenRouter/BenchLM]
Laguna S 2.1 เป็นโอเพนซอร์สหรือไม่?
มันเป็น open-weight: น้ำหนักของโมเดลถูกเผยแพร่บน Hugging Face (poolside/Laguna-S-2.1) ดังนั้นคุณสามารถดาวน์โหลด รัน และ fine-tune มันได้ ตรวจสอบใบอนุญาตของ Poolside สำหรับการใช้งานเฉพาะของคุณ
มันดีกว่า DeepSeek หรือ Qwen สำหรับการเขียนโค้ดหรือไม่?
Poolside วางตำแหน่งตัวเองเป็นคำตอบของโลกตะวันตกต่อพวกเขา และรายงานว่าสามารถเอาชนะ DeepSeek-V4-Pro-Max บน DeepSWE (40.4% เทียบกับ 9.0%) โดยใช้พารามิเตอร์ที่ใช้งานน้อยกว่ามาก ในการวัดประสิทธิภาพการเขียนโค้ดแบบเปิดเผยขนาด มันเป็นผู้นำตามที่ Poolside กล่าว — แต่สิ่งเหล่านี้ดำเนินการโดยผู้ขาย ดังนั้นให้ตรวจสอบบนที่เก็บโค้ดของคุณเอง
มันเอาชนะโมเดลแนวหน้าได้ไหม?
ไม่ได้โดยสิ้นเชิง รุ่นเรือธงแบบปิดอย่าง Claude Fable 5, Claude Opus 5 และ Kimi K3 ยังคงนำในหลายเกณฑ์มาตรฐานที่สมบูรณ์ การอ้างสิทธิ์ของ Laguna คือดีที่สุดในระดับน้ำหนักและดีที่สุดต่อราคา ไม่ใช่ดีที่สุดโดยรวม
โหมดการคิดคืออะไร?
การสลับระหว่างเส้นทางที่รวดเร็วแบบไม่ต้องคิด กับเส้นทางที่คิดมากที่สุด ซึ่งใช้โทเค็นการใช้เหตุผลเพิ่มเติมเพื่อความแม่นยำที่สูงขึ้น (เช่น DeepSWE 16.5% → 40.4%) ใช้โหมดไม่ต้องคิดสำหรับงานประจำ และใช้โหมดคิดสำหรับงานยาก
หน้าต่างบริบทคืออะไร?
สูงสุด 1M โทเคน ดังนั้นฐานโค้ดขนาดใหญ่และบันทึกการสนทนาของ agent ที่ยาวจึงพอดี
ฉันควรใช้ S หรือ XS?
Laguna S 2.1 (118B/8B) สำหรับการเขียนโค้ดที่แข็งแกร่งที่สุด; Laguna XS 2.1 (33B/3B) เมื่อคุณต้องการสิ่งที่เล็กกว่าและถูกกว่าในการโฮสต์ด้วยตนเองหรือให้บริการในปริมาณที่สูงมาก
บรรทัดล่าง
Laguna S 2.1 เป็นโมเดลถอดรหัสแบบ open-weight ที่น่าสนใจที่สุดในขนาดเท่านี้จนถึงปัจจุบัน: MoE ขนาด 118B/8B พร้อมบริบทสูงสุด 1M และสลับโหมดการคิด ราคาเพียง $0.10 / $0.20 ซึ่ง Poolside ระบุว่านำโมเดล open-disclosed-size อื่นๆ บน SWE-Bench Multilingual (78.5%) และเอาชนะคู่แข่งที่ใหญ่กว่ามากในการทดสอบ agentic coding มันไม่ใช่โค้ดเดอร์ที่ดีที่สุดโดยสมบูรณ์ — flagships แบบปิดยังคงนำในหลายเกณฑ์ — และคะแนนเด่นของมันพึ่งพาโหมดการคิด ซึ่งใช้โทเค็นมาก แต่สำหรับการเขียนโค้ดราคาถูก โฮสต์เองได้ และปริมาณมาก ไม่มีโมเดลใดในระดับน้ำหนักเดียวกันที่เทียบได้ กำหนดเส้นทาง Laguna S 2.1 ไปพร้อมกับทุก flagship ระดับแนวหน้าผ่าน OrcaRouter ซึ่งเป็น endpoint ที่เข้ากันได้กับ OpenAI และส่งปริมาณการรับส่งโค้ดส่วนใหญ่ไปให้มัน โดยเลื่อนเฉพาะงานที่ยากที่สุดไปยังระดับที่สูงขึ้น
