
Solar Mini 4 לעומת LFM2.5 2.6B Base: פי שלושה מהמדד, והשוואת עלויות שלא קיימת
- openaiחדשOpenAI: GPT-6.1 Sol2026-09-29$2.00 / $10.00 לכל 1M טוקנים
- anthropicחדשAnthropic: Claude Sonnet 5.52026-09-28$2.00 / $10.00 לכל 1M טוקנים · 159 tok/s
- typesafeחדשTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 לכל 1M טוקנים · 220 tok/s
- OpenAIחדשOpenAI: GPT-6 Luna2026-09-2238אינטליגנציה
- OpenAIחדשOpenAI: GPT-6 Sol2026-09-2248אינטליגנציה
- AnthropicחדשAnthropic: Claude Opus 5.52026-09-2258אינטליגנציה
- xAIחדשGrok 4.72026-09-2146אינטליגנציה
- OrcaחדשOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 לכל 1M טוקנים · 118 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 לכל 1M טוקנים · 1148 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040אינטליגנציה
- OpenAIOpenAI: GPT-6 Astra2026-09-0453אינטליגנציה77כתיבת קוד
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241אינטליגנציה76כתיבת קוד
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245אינטליגנציה76כתיבת קוד
- AnthropicAnthropic: Claude Fable 5.12026-09-0153אינטליגנציה82כתיבת קוד
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 לכל 1M טוקנים · 48 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 לכל 1M טוקנים · 102 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642אינטליגנציה72כתיבת קוד
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 לכל 1M טוקנים · 217 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845אינטליגנציה75כתיבת קוד
- obsidianQwen3.8 27B2026-08-1534אינטליגנציה68כתיבת קוד
הדרך ההוגנת להשוות בין Solar Mini 4 ל-LFM2.5 2.6B Base היא להודות מלכתחילה שהם אינם נמצאים באותו שוק. Solar Mini 4 הוא מודל mixture-of-experts דליל בעל 35 מיליארד פרמטרים של Upstage, שיצא ב-22 בספטמבר 2026, מפעיל כ-3 מיליארד פרמטרים לכל טוקן, קנייני, ותעריפו עומד על 0.10 דולר למיליון טוקני קלט ו-0.40 דולר למיליון טוקני פלט. LFM2.5 2.6B Base הוא צ'קפוינט מאומן מראש בעל 2.69 מיליארד פרמטרים של Liquid AI, שפורסם ב-Hugging Face בתחילת אוגוסט 2026 תחת LFM Open License v1.0, וקטן מספיק כדי לשבת בזיכרון של טלפון. האחד הוא נקודת קצה. האחר הוא קובץ משקלים, ואם אתם קוראים את זה כי אתם רוצים להריץ מודל ולא לקרוא לו, ההשוואה כבר נגמרה מזמן.
מה שבכל זאת הופך את הזיווג לראוי למאמר הוא הממד האחד שבו הם באמת חופפים: שניהם הוצבו מול אותו קנה מידה בלתי תלוי, וצורת ההשוואה הזו היא מה שמספרי הפרמטרים חוזים. Artificial Analysis נותנת ל-Mini 4 ציון 24 ב-Intelligence Index v4 ומדרגת את הדור LFM2.5 2.6B ב-8.4 — אבל הנתון השני הוא הערכה, והוא אינו מודד את הצ'קפוינט שבכותרת המאמר הזה. שתי ההסתייגויות חשובות, והן הדבר הראשון שצריך להבהיר.
גיליון המפרט, זה לצד זה
• פרמטרים — Solar Mini 4 מכיל 35B בסך הכול עם 3B פעילים; LFM2.5 2.6B Base הוא צפוף ב-2.69B, כשאין שום דבר שנשמר בצד. פי שלושה עשר מהמשקלים בצד של Upstage עבור תקציב מחשוב דומה בערך לכל טוקן.
• ארכיטקטורה — Solar Mini 4 הוא תערובת מומחים דלילה. LFM2.5 2.6B Base הוא בעל 30 שכבות, 22 מהן בלוקים של קונבולוציה קצרה עם שער כפול ו-8 שכבת קשב עם שאילתות מקובצות, העיצוב ההיברידי ש-Liquid בנתה עבור CPU והסקה בקצה.
• אימון — Upstage אינה מפרסמת תקציב טוקנים. הכרטיס של Liquid מתעד 34 טריליון טוקנים ואוצר מילים של 128,000 טוקנים ב-16 שפות, ובהן קוריאנית ויפנית.
• רישיון — Solar Mini 4 הוא קנייני. LFM2.5 2.6B Base מופץ תחת רישיון LFM Open License v1.0 — מתירני לשימוש מסחרי עם תנאים, וניתן לבצע בו כיוונון עדין.
• הקשר — Upstage מתעדת 512K טוקנים, Artificial Analysis מציגה 1.05M עבור אותו מודל, לכן יש להתייחס לתקרה כבלתי מוכרעת. LFM2.5 2.6B Base מריץ 131,072.
• מודאליות — שניהם קלט טקסט, פלט טקסט. אף אחד מהם אינו מקבל תמונות או אודיו.
• מחיר — Solar Mini 4 ב-$0.10 / $0.01 במטמון / $0.40 למיליון טוקנים, כעת 50% הנחה עד 22 באוקטובר 2026. ל-LFM2.5 2.6B Base אין כלל מחירון; המארח Artificial Analysis עוקב אחר מחירים ומעריך את מחיר הדור LFM2.5 2.6B ב-$0.00.
מה "8.4, estimated" מודד ומה לא

הרשומה של Artificial Analysis עבור הדור LFM2.5 2.6B — המודל שעבר אימון-לאחר, לא ה-Base שאומן מראש — נושאת אינדקס של 8.4 המסומן כהערכה, כאשר רוב הערכות הרכיבים שלה מסומנות באותו אופן. זהו מיקום בלוח דירוג, לא מפרט שעל פיו בונים, ואסור לצטט אותו כאילו מישהו הריץ את צ'קפוינט ה-Base דרך חבילת המבחנים. אף אחד לא עשה זאת. כרטיס המודל של Liquid עצמה אינו מפרסם כלל טבלת מבחני ביצועים עבור LFM2.5 2.6B Base: זהו צ'קפוינט של השלמת טקסט שאומן מראש, והכרטיס אומר במפורש שהוא מומלץ רק לכוונון עדין כבד.
האח המנוקד הוא ארטיפקט אחר. טבלת הבנצ'מרק של Liquid עבור LFM2.5 2.6B שעבר אימון-המשך מציגה IFStruct ב-85.5 ו-Multi-IF ב-80.1, AIME25 ב-51.9, LiveCodeBench v6 ב-59.4, BFCLv4 ב-56.9 ו-τ³-Banking ב-5.7 — כולם בהרצת הספק, כולם על בניית הגרסה המכווננת להוראות, ונתון ה-τ³ הוא זה שנקרא כמו אזהרה.
הפרופיל של Solar Mini 4 הוא צורה שונה לחלוטין. הוא משיג 83.3% ב-AA-LCR v1.1 עבור נימוק בהקשר ארוך, 47.6% ב-SciCode, ו-−10.8 ב-AA-Omniscience עם דיוק של 18.4% ושיעור אי-הזיות של 64.2%. הוא גם משיג 1% ב-Terminal-Bench 4.0 ו-22.3% ב-AutomationBench-AA. שתי המשפחות חלשות בעבודה סוכנית; המודל של Upstage חלש בעבודה סוכנית בעודו יקר, וזה מקום גרוע יותר מאשר להיות חלש בעבודה סוכנית בעודו בחינם.
המקום שבו Solar Mini 4 מצדיק את מחירו הוא בהיקף ההיסק. ב-88,300 טוקנים של פלט לכל משימת אינדקס — מהם 71,600 של היסק — הוא מוציא מחשוב באופן שמודל צפוף של 2.6B לא יכול לחקות על ידי כך שמקבל פרומפט ארוך יותר. אפשר לומר למודל עם 2.69B פרמטרים לחשוב שלב אחר שלב; אי אפשר לומר לו שיהיו לו 35B פרמטרים. זה המוצר האמיתי.
פי שלושה מהמדד, ואין נתון עלות בר-השוואה
Artificial Analysis מציבה את Solar Mini 4 על $0.36 למשימת אינדקס שהושלמה, לעומת $0.006 עבור Granite 4.2 3B, והדור של LFM2.5 2.6B מתומחר באפס, כך שאין נתון עלות-למשימה שיהפוך את זה ליחס הוגן. הניסוח "Solar Mini 4 עולה הרבה יותר מ-LFM2.5 2.6B Base" הוא אפוא נכון, וקצת מפספס את הנקודה. השאלה הרלוונטית היא אם עבודת חילוץ מובנה בשפה הקוריאנית ממסמכים ארוכים, שעבורה נבנה Solar Mini 4, יכולה להיעשות בכלל על ידי צ'קפוינט מאומן מראש בגודל 2.69B. בדרך כלל זה לא אפשרי, ואז ההשוואה הופכת להיות Solar Mini 4 מול מודל כללי חזיתי ולא Solar Mini 4 מול מודל טלפון.
המקרה שבו LFM2.5 2.6B Base מנצח אינו המקרה שבו הוא זול יותר. זה המקרה שבו המשימה צרה מספיק כדי שכיוונון עדין יסגור את הפער. חילוץ שדות מובנה מפורמט מסמך מוכר, סיווג מול טקסונומיה קבועה, עוזר על־מכשיר שחייב לעבוד בלי רשת — אלה משימות שבהן צ'קפוינט של 2.69B בתוספת נתוני האימון שלכם מנצח גנרליסט של 35B בתוספת כרטיס תעריפים, ועולה מופע GPU במקום מד טוקנים. Liquid מספקת את צ'קפוינט הבסיס עם מתכוני continued-pretraining, LoRA SFT, DPO ו-GRPO דרך Unsloth ו-TRL בדיוק לשם כך.
למי להתקשר
פנה אל Solar Mini 4 כאשר הקלט ארוך, יש לבצע הסקה על הפלט, ותמהיל השפות כולל קוריאנית או יפנית — וכאשר שבע דקות של פענוח לכל משימה קשה הם בגדר סביר. פנה אל LFM2.5 2.6B Base כאשר המשקלים צריכים להיות שלך, במכשיר אין רשת, והמשימה צרה מספיק כדי לכוונן אותה. הפריסות המעניינות משתמשות בשניהם, כי הם אינם חלופות: מודל מקומי קטן מבצע את הניתוב, ההשחרה והחילוץ, ומודל מתארח נקרא רק עבור החלק של הבקשות שאכן נזקקו ל-35B פרמטרים.
המודל של Liquid אינו נמצא ב-OrcaRouter, וגם לא זה של Upstage, כך ששני המסלולים האלה אינם משהו שאנחנו יכולים למכור לך. מה שכן אפשר לעשות הוא החלק שהופך את ההשוואה הזו מהחלטה לקונפיגורציה: יותר מ-200 מודלים מאחורי מפתח אחד, במרווח של 0% מעל מחיר המחירון של הספק, עם מעבר אוטומטי בין ספקים ו-DSL ניתוב שמאפשר לך להרכיב כמה מודלים לקריאה אחת. כשהתשובה הנכונה היא "הזול רוב הזמן והטוב כשזה חשוב", זו בעיית ניתוב, וזו הסיבה ש-DSL הניתוב קיים.

המספר שאף ספק לא יציג במצגת
השהיה. Solar Mini 4 שורף 88,300 אסימוני פלט לכל משימת Intelligence Index בקצב מדוד של 204 אסימונים לשנייה, כך שהוא עמד בממוצע על 430 שניות — קצת יותר משבע דקות — בכל משימה קשה. הדור LFM2.5 2.6B, על המארח שבדקה Artificial Analysis, רץ בקצב של 45.7 אסימונים לשנייה עם המתנה של 2.8 שניות למקטע הראשון, אבל זהו מארח של מרכז נתונים שמדבר עם מודל שבדרך כלל היה רץ על השולחן שלך. המדידות של Liquid עצמה מעמידות את אותה ארכיטקטורה על 220 אסימונים לשנייה על M5 Max, 113 על Ryzen AI Max+ 395, וכ-30 אסימונים לשנייה בטלפון — וזהו לולאת סוכן שמישה במכשיר ללא רשת.
אם עומס העבודה שלך הוא אינטראקטיבי, ההשוואה בכלל לא צמודה ואף ציון benchmark לא ישנה זאת. אם עומס העבודה שלך הוא באצ'י והדבר שממתין הוא משימת cron, שבע דקות זה בסדר ועומק החשיבה שווה את זה.

שתי הערות מקור לסיום. כל נתון של Artificial Analysis כאן הוא מדידה עצמאית של אותו ארגון על מערך מבחנים משותף; המדד של LFM2.5 2.6B הוא במפורש הערכה ומתייחס למודל שעבר אימון-משך (post-trained) ולא לנקודת ה-Base checkpoint שהוכשרה מראש ושמה הוזכר לעיל. כל נתון של Liquid AI הוא הרצה של הספק עצמו על הבנצ'מרקים של הספק עצמו, שלא שוחזרה — ולנקודת ה-Base checkpoint עצמה אין כלל ציונים מפורסמים, וזו עובדה בנוגע למודלים שהוכשרו מראש ולא ביקורת על המודל הזה.
