Laguna S 2.1: מודל הקוד במשקל הפתוח של Poolside שמכה הרבה מעל משקלו (ומחירו)
Guides & Insights

Laguna S 2.1: מודל הקוד במשקל הפתוח של Poolside שמכה הרבה מעל משקלו (ומחירו)

מחבר

jinhao song

תאריך פרסום

מודלים אחרונים · 20צפו בכל המודלים
בנצ'מרקים: Artificial Analysis · מתעדכן יומית
חזרה לכל הפוסטים

ב-21 ביולי 2026, Poolside שחררה Laguna S 2.1 — מודל open-weight לקידוד בעל 118 מיליארד פרמטרים, עם רק כ-8 מיליארד פרמטרים פעילים לכל טוקן — והציגה אותו כ"מודל ה-open-weight היכול ביותר במערב" ותשובה ל‑DeepSeek ול‑Qwen. הכותרת אינה שהוא מנצח כל מערכת חזיתית סגורה; אלא שהוא מנצח מודלים הגדולים ממנו פי כמה במדדי קידוד אוטונומיים (agentic coding) תוך עלות של 0.10$ / 0.20$ למיליון טוקנים. מדריך זה מכסה מהו Laguna S 2.1 בפועל, מצב החשיבה שלו, מה מדווח באופן עצמאי לעומת דיווחי הספק, מה העלויות, איך להריץ אותו, ולמי כדאי להשתמש בו.

כל איור שלהלן מסומן לפי מקור. הציונים הראשיים של Laguna מדווחים על ידי Poolside (מחומרי ההשקה ומכרטיס Hugging Face) אלא אם כן מצוטט צד שלישי מוכר; יש להתייחס אליהם כאל תוצאות שמנוהלות על ידי הספק עד שמעבדות עצמאיות יאשרו. מדדים ומחירים משתנים — אשר לפני שאתה מתחייב לתקציב.

תקציר: Laguna S 2.1 הוא מודל קוד במשקל פתוח מסוג MoE (118B סך הכול / ~8B פעילים) עם קונטקסט של עד 1M ומצב חלופי "חשיבה / ללא חשיבה", במחיר של $0.10 לקלט / $0.20 לפלט ל-1M טוקנים בלבד — שבריר ממחיר רוב המתחרים. Poolside מדווחת על 78.5% ב-SWE-Bench Multilingual (מוביל בקרב מודלים עם משקלים חשופים), 70.2% ב-Terminal-Bench 2.1, ו-40.4% ב-DeepSWE v1.1 (לעומת 9.0% של DeepSeek-V4-Pro-Max) — עם כשישית מהפרמטרים הפעילים. זוהי האפשרות הטובה ביותר שראינו של קוד במחיר משתלם לעומת משקל פתוח, אך מודלי החזית הסגורים כמו Claude Fable 5, Claude Opus 5, ו-Kimi K3 עדיין מובילים במספר מדדי אמת מוחלטים. אם אתם מחפשים מתכנת זול וניתן לאירוח עצמי שמתעלה על משקל המחלקה שלו, Laguna S 2.1 הוא הסיפור; אם אתם זקוקים לדיוק הקוד הגבוה ביותר באופן מוחלט, דגל החזית עדיין מנצח.

נקודות עיקריות

• קידוד במשקל פתוח הטוב ביותר לדולר. $0.10/$0.20 לכל 1M טוקנים עבור מודל שמוביל את מודלי הגודל הפתוח המפורסמים על SWE-Bench Multilingual (78.5%).

• מכה מעל משקלו. כ-8B פרמטרים פעילים, ובכל זאת משתווה או מנצח דגמים גדולים בהרבה ב-Terminal-Bench 2.1 וב-SWE-Bench Pro.

• משקל פתוח וניתן לאירוח עצמי. המשקלים ב‑Hugging Face (poolside/Laguna‑S‑2.1) — אתה יכול להריץ אותו בסביבה שלך.

• מצב החשיבה מניע את הציונים. חשיבה מקסימלית מעלה את DeepSWE מ-16.5% ל-40.4% — עוצמתי, אבל היא משתמשת בטוקני חשיבה, אז תקצבו לכך.

• לא #1 המוחלט. דגמי הדגל הסגורים (Fable 5, Opus 5, Kimi K3) עדיין מובילים במספר מבחני קידוד מוחלטים; הטענה של Laguna היא ברמת משקל ומחיר, לא בראש הטבלה.

הערה לגבי קריאת סיכום זה: כל מה שמיוחס ל-Poolside הוא טענה של ספק מחומרי ההשקה; כאשר benchmark עצמאי, אנו מציינים את המקור. כאשר ציון עצמאי של בינה כללית לא פורסם, אנו אומרים זאת במקום לנחש — Laguna היא מומחית בקידוד, לא מובילת טבלת דירוג למטרות כלליות.

מהי בעצם Laguna S 2.1

Laguna S 2.1 הוא מודל קידוד פתוח-משקל של Poolside, המיועד לעבודה אג'נטית. מבחינה ארכיטקטונית, הוא תערובת של מומחים: 118B פרמטרים בסך הכול, אך רק כ-8B מופעלים לכל טוקן, וזו הסיבה שהוא זול לשירות ביחס ליכולתו. הוא תומך בהקשר של עד מיליון טוקנים ובשני מצבי פעולה — נתיב מהיר של "ללא חשיבה" ונתיב "חשיבה" שמשקיע טוקני הגיון נוספים לבעיות קשות יותר. הוא בנוי לקידוד ועבודה אג'נטית: שימוש בכלים, קריאות פונקציות, משימות מרובות שלבים. Poolside גם משווקת אחות קטנה יותר, Laguna XS 2.1 (33B סה"כ / ~3B פעילים), במחיר נמוך אף יותר של $0.06 / $0.12.

באופן קריטי, המשקולות פתוחות ומפורסמות ב-Hugging Face, כך שבניגוד למודל API סגור, אתה יכול להוריד את Laguna S 2.1, להריץ אותו בתשתית שלך, לכוונן אותו, ולנעול גרסה. השילוב הזה – קידוד ברמת גבול, ספירת פרמטרים פעילים זעירה, משקולות פתוחות ומחיר נמוך במיוחד – הוא כל ההצעה, וזו הסיבה ש-Poolside מציגה אותו כתשובת המערב למודלים הפתוחים החזקים של DeepSeek ו-Qwen.

מה חדש: הבנצ'מרקים

נתוני ההשקה כולם עוסקים בקוד. ב-SWE-Bench Multilingual, Poolside מדווחת על 78.5%, שלדבריה מובילה מודלים פתוחים בגודל ידוע. ב-Terminal-Bench 2.1 היא קולעת 70.2%. ב-DeepSWE v1.1 היא מגיעה ל-40.4% — וההשוואה המרשימה ביותר של Poolside היא שזה מנצח את 9.0% של DeepSeek-V4-Pro-Max באותו מבחן עם בערך שישית מהפרמטרים הפעילים. ב-Terminal-Bench 2.1 ו-SWE-Bench Pro, Poolside אומרת ש-Laguna S 2.1 תואמת או עולה על מודלים גדולים ממנה פי כמה, כולל DeepSeek V4 Flash, NVIDIA's Nemotron 3 Ultra, and Thinking Machines' Inkling.

המסגור הכנה שפולסייד עצמה משתמשת בו הוא על קטגוריית משקל, לא על עליונות מוחלטת: דגמי חזית סגורים כמו Claude Fable 5 ו-Kimi K3 עדיין מובילים בכמה מדדי ביצוע. לכן הדרך הנכונה לקרוא את Laguna S 2.1 היא "הכי הרבה יכולת שאפשר לקבל ממודל פתוח, ~8B-active, זול מאוד," לא "הקודן הטוב ביותר, נקודה."

Thinking mode: where the performance comes from

הציון העיקרי של Laguna S 2.1 מסתמך במידה רבה על מצב 'max thinking' שלה. הדוגמה הברורה ביותר היא DeepSWE v1.1, שבה הציון קופץ מ-16.5% ללא חשיבה ל-40.4% עם max thinking — רוב החוזק של המודל במדדים נובע מהיכולת לחשוב. Terminal-Bench 2.1 מראה את אותו הדפוס (60.4% → 70.2%). יש לכך השלכות על עלות והשהיה: מצב החשיבה משתמש באסימוני נימוק נוספים, כך שלמרות שהמחיר לאסימון זעיר, משימה קשה במצב max thinking משתמשת ביותר אסימונים (ולוקחת יותר זמן) מאשר הנתיב ללא חשיבה. בפועל, היית מריץ השלמות שגרתיות במצב no-thinking למהירות ועלות, ועובר לחשיבה רק עבור הבעיות הקשות מרובות השלבים שבהן קפיצת הדיוק שווה את האסימונים — הד ספציפי לקידוד של חוגות המאמץ המופיעות במודלים מתקדמים.

הצלילה העמוקה למבחני הביצועים: מה מודדים מבחני הקוד הללו

SWE-Bench Multilingual מרחיב את SWE-bench המוכר (פתרון בעיות אמיתיות מ-GitHub) על פני שפות תכנות מרובות, כך ש-78.5% הוא אות חזק לתיקון באגים מעשי חוצה-שפות — ו-"leads open disclosed-size models" היא טענה משמעותית, אם כי מוצהרת על-ידי הספק. Terminal-Bench 2.1 בודק האם מודל יכול להפעיל טרמינל אמיתי כדי להשלים משימות מקצה לקצה, מה שקרוב יותר למה שסוכן קידוד אוטונומי עושה בפועל מאשר השלמת קוד חד-פעמית. DeepSWE v1.1 היא ערכת תוכנה הנדסית אוטונומית קשה יותר; ה-40.4% (לעומת 9.0% של DeepSeek-V4-Pro-Max) הוא המספר המרשים ביותר של Laguna דווקא בגלל הפער הגדול מול מודל גדול בהרבה.

הסתייגות ששומרת על כנות: אלו תוצאות שנערכו על ידי Poolside במועד ההשקה, ואין עדיין מדד Artificial Analysis Intelligence או נתון SWE-bench Verified עצמאי עבור Laguna S 2.1. לכן יש להתייחס לטענות ההובלה כאל דיווח ספק עד שאישור צד שלישי יאשר אותן, ולזכור ש-Laguna היא מומחית קידוד — היא אינה ממוצבת כמובילת חשיבה כללית, ואין לצפות ממנה לעמוד בראש מדד אינטליגנציה כללית.

מה זה עולה בפועל

כאן Laguna S 2.1 באמת משבשת את השוק. בעלות של 0.10$ לקלט / 0.20$ לפלט למיליון טוקנים, קריאת קוד מייצגת של 15,000 טוקני קלט ו-3,000 טוקני פלט עולה 15k × 0.10$/1M + 3k × 0.20$/1M = 0.0015$ + 0.0006$ = כ-0.0021$ — בערך חמישית של סנט. אותה קריאה במודל חזיתי כמו Claude Opus 5 (5$/25$) עולה כ-0.15$ — כמעט פי 70 יותר. אפילו מול מתחרים זולים, Laguna זולה יותר: היא ממוקמת מתחת למחירון של DeepSeek. הכוכבית היא מצב החשיבה — משימה קשה בחשיבה מקסימלית עשויה לייצר פי כמה יותר טוקני פלט, כך שקריאה של "0.0006$ פלט" עלולה להפוך לכמה סנטים. אבל אפילו מנופחת, העלות היא שגיאת עיגול ליד מודלי חזית סגורים. לאוטומציית קידוד בנפח גבוה — בוטי CI, רפקטורים בכמות גדולה, ציי סוכנים — הכלכלה קשה לערעור, במיוחד מכיוון שאתה יכול גם לארח בעצמך כדי להסיר לחלוטין את העלות לטוקן.

איך לגשת ולהפעיל את Laguna S 2.1

מכיוון שהמשקולות פתוחות, יש לך שני מסלולים. אפשר לקרוא לזה דרך ספקים מתארחים (הוא מופיע בצוברים כמו OpenRouter) בתעריף של $0.10/$0.20, שהיא הדרך המהירה ביותר לנסות את זה. או שאפשר להוריד את המשקולות מ-Hugging Face (poolside/Laguna-S-2.1) ולארח בעצמך – לשמור קוד ונתונים בסביבה שלך, לכוונן עדין על מאגרי הקוד שלך, לכמת לחומרה שלך, ולהגביל עלויות לתשתית שלך. הגרסה XS (33B-A3B) היא האופציה כשאתה רוצה להריץ משהו קטן וזול יותר מקומית. בכל מקרה, הוא חושף שימוש בכלים וקריאה לפונקציות, כך שהוא משתלב ברתמות קידוד אוטונומיות (agentic coding harnesses).

למי זה מיועד: שלושה תרחישים

1. אוטומציית קידוד בנפח גבוה בתקציב מוגבל

אם אתה מריץ {{1}}CI fix-it bots{{/1}}, הגירות המוניות, או ציים גדולים של סוכנים שבהם עלות האסימונים מצטברת, המחיר של {{2}}Laguna S 2.1{{/2}} הוא מהפכני — הפעל no-thinking לעבודה שוטפת ו-thinking למקרים הקשים. זהו מקרה השימוש החזק ביותר שלה.

2. צוותים שחייבים לארח בעצמם מודלי קוד

לארגונים שאינם יכולים לשלוח קוד קנייני ל-API סגור, בדיוק מה שהיה חסר הוא מקודד בעל משקל פתוח שמוביל את קטגוריית הגודל שלו. Laguna S 2.1 (או XS לחומרה קטנה יותר) נותנת לך קידוד שמהווה שכנה לחזית הפרונטיר, שאתה שולט בו לחלוטין.

3. סטארטאפים רגישים לעלות הבונים מוצרי תכנות

אם שולי הרווח של המוצר שלך תלויים בעלות ההסקה, Laguna מאפשרת לך להציע תכונות קידוד AI בחלק ממחירי Frontier — תוך שמירת דגל Frontier רק לבקשות הקשות ביותר שהמשתמשים שלך מגישים.

מתי לא להשתמש בזה

אל תגיע ל-Laguna S 2.1 כשאתה צריך את הדיוק הטוב ביותר בתכנות ומוכן לשלם עליו — מודלים חזיתיים סגורים (Fable 5 עם 95.0% ב-SWE-bench Verified, Opus 5 עם #1 ב-General Index, Kimi K3 עם #1 ב-Frontend Coding Arena) עדיין מובילים במספר מדדי השוואה. אל תשתמש בו למטרות חשיבה כללית, ריבוי-מודאליות או משימות שאינן תכנות — הוא מומחה תכנות ללא רקע של אינטליגנציה כללית. ואל תניח שהנתונים הבולטים נשמרים במצב ללא חשיבה; אם תשבית את החשיבה כדי לחסוך בעלויות, מדוד את הציונים הנמוכים שבפועל תקבל.

רשימת תיוג להחלטה

• בחר ב-Laguna S 2.1 אם: אתה רוצה {{1}}את הקודר הפתוח-משקל הזול ביותר המסוגל{{/1}}, עליך {{2}}לארח בעצמך{{/2}}, או שאתה מריץ {{3}}אוטומציית קידוד בנפח גבוה{{/3}} שבה {{4}}העלות שולטת{{/4}}.

• בחר בדגלון עילית במקום זאת אם: אתה זקוק לדיוק הקוד המוחלט העליון, לשיקול כללי, או לרב-מודאלי — ואתה יכול להרשות זאת לעצמך.

• הרץ את שניהם אם: תכנות שגרתי ברירת מחדל ללאגונה והעלה את המשימות הקשות ביותר למודל גבולי, מאחורי נקודת קצה אחת.

שאלות נפוצות

כמה עולה Laguna S 2.1?

$0.10 ל-1 מיליון טוקני קלט ו-$0.20 ל-1 מיליון טוקני פלט — עם דגם קטן יותר Laguna XS 2.1 במחיר $0.06 / $0.12. זהו אחד מדגמי התכנות הזולים והיכולים ביותר שקיימים, ובהיותו בעל משקל פתוח, ניתן לארח אותו בעצמך כדי להיפטר מהעלות לטוקן. [OpenRouter/BenchLM]

האם Laguna S 2.1 הוא קוד פתוח?

זה מודל במשקל פתוח: משקלי המודל מתפרסמים ב-Hugging Face (poolside/Laguna-S-2.1), כך שתוכלו להוריד, להריץ ולכוון אותו. בדקו את הרישיון של Poolside לשימוש הספציפי שלכם.

האם זה טוב יותר מ-DeepSeek או Qwen לקידוד?

Poolside מציגה את עצמה כתשובת המערב להם ומדווחת על ניצחון על DeepSeek-V4-Pro-Max ב-DeepSWE (40.4% לעומת 9.0%) עם הרבה פחות פרמטרים פעילים. במבחני קוד פתוחים ומגולים בגודל, היא מובילה לפי Poolside — אך אלו מבוצעים על ידי הספק, לכן יש לאמת במאגרים שלכם.

האם זה מנצח את מודלי החזית?

לא באופן מוחלט. דגלי דגל סגורים כמו Claude Fable 5, Claude Opus 5 ו-Kimi K3 עדיין מובילים בכמה מדדי ביצועים מוחלטים. הטענה של Laguna היא הטוב ביותר בקטגוריית המשקל והטוב ביותר ביחס למחיר, לא הטוב ביותר הכולל.

מהו מצב חשיבה?

מתג בין מסלול מהיר ללא־חשיבה לבין מסלול חשיבה מקסימלית שמשקיע אסימוני חשיבה נוספים לדיוק גבוה יותר (למשל, DeepSWE 16.5% → 40.4%). השתמש בללא־חשיבה לעבודה שגרתית, ובחשיבה למשימות קשות.

מהו חלון ההקשר?

עד 1M טוקנים, כך שבסיסי קוד גדולים ותמלילי סוכן ארוכים מתאימים.

האם עלי להשתמש ב-S או ב-XS?

Laguna S 2.1 (118B/8B) לקוד החזק ביותר; Laguna XS 2.1 (33B/3B) כשאתה רוצה משהו קטן וזול יותר לאירוח עצמי או לשרת בנפח גבוה מאוד.

השורה התחתונה

Laguna S 2.1 הוא מודל הקידוד הפתוח-משקל המשכנע ביותר בגודלו עד כה: MoE של 118B/8B עם קונטקסט של עד 1M וטוגל חשיבה, במחיר מדהים של $0.10 / $0.20, ש-Poolside טוען שמוביל את מודלי הגודל הפתוחים המוצהרים ב-SWE-Bench Multilingual (78.5%) ומנצח מתחרים גדולים בהרבה במבחני קידוד אג'נטיים. זה לא מקודד הטוב ביותר המוחלט — דגלי הדגל סגורים עדיין מובילים במספר מדדי השוואה — והציונים הבולטים שלו מסתמכים על מצב חשיבה, שצורך טוקנים. אבל לקידוד זול, בר-התקנה עצמית, בנפח גבוה, שום דבר במחלקת המשקל שלו לא מתחרה. נתב את Laguna S 2.1 יחד עם כל דגל דגל Frontier דרך נקודת קצה תואמת OpenAI ב-OrcaRouter ושלח אליו את רוב תעבורת הקידוד שלך, תוך הסלמה רק של המשימות הקשות ביותר.

© 2026 OrcaRouter

לספקים

מפעילים פלטפורמת הסקה (inference)? הציגו את המודלים שלכם ב-OrcaRouter.

צרו קשר

הצטרפו לקהילה שלנו

DiscordEmailXGitHubYouTube