
AREX-2 לעומת LFM2.5 2.6B Base: מאגר ריק וצ'קפוינט ללא הוראות
- typesafeחדשTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 לכל 1M טוקנים · 397 tok/s
- OpenAIחדשOpenAI: GPT-6 Luna2026-09-2237אינטליגנציה
- OpenAIחדשOpenAI: GPT-6 Sol2026-09-2248אינטליגנציה
- AnthropicחדשAnthropic: Claude Opus 5.52026-09-2258אינטליגנציה
- xAIחדשGrok 4.72026-09-2146אינטליגנציה
- OrcaחדשOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 לכל 1M טוקנים · 195 tok/s
- OrcaחדשOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 לכל 1M טוקנים · 1141 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040אינטליגנציה
- OpenAIOpenAI: GPT-6 Astra2026-09-0453אינטליגנציה77כתיבת קוד
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241אינטליגנציה76כתיבת קוד
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245אינטליגנציה76כתיבת קוד
- AnthropicAnthropic: Claude Fable 5.12026-09-0153אינטליגנציה82כתיבת קוד
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 לכל 1M טוקנים · 54 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 לכל 1M טוקנים · 106 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642אינטליגנציה72כתיבת קוד
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 לכל 1M טוקנים · 220 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845אינטליגנציה75כתיבת קוד
- obsidianQwen3.8 27B2026-08-1534אינטליגנציה68כתיבת קוד
- DeepSeekDeepSeek: DeepSeek V4 Pro 08132026-08-1236אינטליגנציה69כתיבת קוד
- xAISpaceXAI: Grok 4.62026-08-1244אינטליגנציה77כתיבת קוד
הצב את AREX-2לצד LFM2.5 2.6B Baseוהדבר הראשון שמשותף לשניהם הוא ששניהם אינם מוצר שאפשר להשתמש בו היום — מסיבות שאין להן דבר זו עם זו. AREX-2 הוא מאגר ב-Hugging Face ש-BAAI יצרה ב-29 בספטמבר 2026 בשעה 17:56 UTC; הוא מכיל קובץ .gitattributes, שומר אפס בתים של נתוני מודל, ואינו כולל כרטיס מודל, תג רישיון או הכרזה מכל סוג שהוא. LFM2.5 2.6B Base, שפורסם על ידי Liquid AI באוגוסט 2026, הוא הסוג ההפוך של "לא גמור": צ'ק פוינט שלם וניתן להורדה, טקסט בלבד, עם 2.69 מיליארד פרמטרים, תחת רישיון LFM Open License (lfm1.0), שמשווק בכוונה ללא כיוונון פקודות, מפני שהוא נועד לכיוונון עדין ולא לשאלות.
האחד הוא היעדר ארטיפקט. האחר הוא ארטיפקט שחסר בו שלב שמעולם לא היה אמור להיות בו. אלה באותה קטגוריה רק אם אתה מרפרף, והתייחסות אליהם כאל אותה קטגוריה היא בדיוק הדרך שבה צוות מגיע למצב שהוא ממתין לדבר הלא נכון. ההשוואה המועילה בין השניים אינה ביכולת — אין AREX-2 למדוד — אלא מה כל אחד מהם מהווה חומר גלם בשביל, ומה העלות לגלות אם הוא שווה משהו.
ההבדל בסוג, כפי שנאמר תחילה
LFM2.5 2.6B Base הוא חומר. זהו הצ'קפוינט המאומן-מראש של המשפחה ההיברידית LFM2.5 של Liquid AI: 30 שכבות, מתוכן 22 הן קונבולוציה קצרה כפולת-שער ו-8 הן תשומת לב עם שאילתות מקובצות, שאומנו על כ-34 טריליון טוקנים ב-16 שפות, עם חלון הקשר של 131,072 טוקנים ובנייה מכומתת שמגיעה לקרוב ל-1.67 GB ב-Q4_K_M. אין לו כיוונון הוראות. הזינו לו שאלה והוא ימשיך טקסט; הוא לא עונה. הכרטיס של Liquid AI עצמה מצביע על כיוונון כבד כשימוש המיועד, ויש אח מאומן-לאחר-כך למי שרוצה מודל שמגיב לפרומפטים. זהו מצע, והעובדה שהוא מקבל ציונים גרועים במבחני ציות לפרומפטים אינה פגם — זו ההגדרה של הדבר.
AREX-2 אינו חומר או מוצר; הוא מרחב שמות. העובדות היחידות הזמינות הן הארגון (BAAI), חתימת הזמן של היצירה (29 בספטמבר 2026) והשם. לא הועלה דבר ולא נאמר דבר. השם עצמו שייך למשפחה שכן קיימת: ב-23 ביולי 2026 BAAI שחררה את AREX-Base, תערובת מומחים עם 122 מיליארד פרמטרים ו-10 מיליארד פרמטרים פעילים הבנויה על Qwen3.5-122B-A10B, ואת AREX-Turbo, מודל צפוף 4B הבנוי על Qwen3.5-4B — שניהם Apache 2.0, שניהם סוכני מחקר מעמיק עם עיצוב דו-לולאי שאוסף ראיות, מייצר תשובה מועמדת עם נתון ביטחון, ואז מאמת את התשובה מול האילוצים המקוריים ומשפר או מאתחל מחדש. המספרים המפורסמים שלה, כפי שדווחו על ידי הספק ולא שוחזרו באופן בלתי תלוי, מגיעים ל-82.5 ב-BrowseComp ו-85.4 ב-GAIA עבור ה-Base, ול-70.7 / 81.6 עבור ה-Turbo.
• זמינות — LFM2.5 2.6B Base ניתן להורדה כעת. ל-AREX-2 אין קבצים במאגר שלו.
• גודל — 2.69B פרמטרים צפופים עבור מודל Liquid, כולם גלויים בצ'קפוינט. לא ידוע עבור AREX-2; המשפחה כוללת MoE של 122B ו-4B צפוף, כך שה־"2" לא מנבא דבר.
• הקשר — 131,072 אסימונים עבור LFM2.5 2.6B Base. לא פורסם דבר עבור AREX-2.
• רישיון — LFM Open License v1.0, חינם מתחת להכנסה שנתית של 10 מיליון דולר ומחייב רישיון נפרד ברף זה ומעלה. אין עדיין תג רישיון על AREX-2; הדור הראשון של AREX היה Apache 2.0.
• מה זה — מצע לכוונון עדין לעומת, אם לשפוט לפי המשפחה, סוכן מתארח שערכו בלולאת חיפוש ואימות ולא במשקולות שלו.

כרטיסי ניקוד ריקים
לאף אחד מהמודלים אין בנצ'מרק שכדאי לתכנן לפיו, והסיבות שונות לחלוטין.
Liquid AI אינה מסתירה דבר בכך שהיא מותירה את ה-Base ללא ניקוד. ניקוד של נקודת ביקורת מאומנת מראש במדדי עמידה בהוראות היה מודד את היעדרו של כיוונון עדין, לא את איכות המצע — ולכן החברה מודדת את הגרסה התאומה לאחר האימון ומותירה את ה-Base ללא הערכה. החלל הזה ניתן לאימות מצדך, וזו כל הנקודה: אתה יכול להוריד 1.67 GB, להריץ הערכה משלך על המשימה שלך, ולדעת את התשובה לפני שאתה מוציא משהו על הגשה.
החלל הריק של AREX-2 אינו החלטת עיצוב; זהו עדיין-לא. אין מה להוריד, ולכן אין מה לבדוק, ושום הערכה שתוכל להריץ השבוע לא תספר לך דבר עליו. כל מי שמפרסם נתוני בנצ'מרק של AREX-2 בימים הקרובים מפרסם משהו שלא יכול היה למדוד.

שתי שאלות כיוונון עדין שונות
מכיוון ששניהם נקודות התחלה ולא שירותים מוגמרים, כדאי להיות מדויקים לגבי מה כל אחד מהם יהיה נקודת התחלה עבורו, שכן שם הם באמת מפסיקים להידמות זה לזה.
צ'קפוינט היברידי של 2.69B הוא כלי ליצירת מודל קטן, זול ומתמחה. השימושים המעניינים הם דווקא הלא-זוהרים: מסווג שקורא סוג מסמך בתהליך עבודה מוסדר, מודל חילוץ שהופך טופס ל-JSON מובנה, משכתב ייעודי לתחום שרץ על כרטיס בודד קרוב לנתונים. הערך נובע מכך שאתה הבעלים של התוצר בסופו של דבר והעלות השולית של קריאה היא חשמל. לולאת האימון היא העבודה, וזו עבודה שאתה יכול להתחיל היום.
AREX-2 מצביע לכיוון ההפוך. משפחת AREX אינה מתוכננת לעבור כיוונון עדין לכדי מוצר; היא מיועדתלהיקרא כסוכן שמריץ חיפושים, משלב ראיות ומאמת את תשובותיו שלו מול אילוצים. אם דור שני ימשיך בכך, הדבר שתעריכו הוא מסלול — כמה צעדים הוא לוקח, האם הוא מבחין בסתירה, האם לנתון הביטחון בתשובתו המועמדת יש משמעות. זו אינה שאלה של כיוונון עדין וזו אינה שאלה של משקלים. זו שאלת הגשה, והיא מתחילה במישהו שמפרסם משקלים וכרטיס.
אלה אינם תחליפים בשום גודל. צוות שזקוק למודל בבעלותו שאותו יוכל לאמן מחדש לא ממתין ל-AREX-2. צוות שזקוק לסוכן מחקר לא יבצע כיוונון עדין של מודל היברידי בנפח 2.6B כדי להפוך אותו לכזה.
היכן שכבת הניתוב משתלבת, עבור כל אחד מהם
ההבדל המעשי בין השניים מתגלה ברגע שמודל נכנס ליישום, מפני שלשניים יש יחסים מנוגדים לאירוח.
LFM2.5 2.6B Base אינו נמצא בקטלוג של OrcaRouter, ואילו וריאנט LFM2.5 כן, כך שהוא מגיע מההפצה העצמאית של Liquid AI ומהמארחים החיצוניים הרגילים — ארטיפקט מקומי ולא נקודת קצה מנותבת. גם AREX-Base ו-AREX-Turbo אינם בקטלוג שלנו.לשם מה באמת נועדה שכבת ניתוב בתמונה הזו הוא הצד האחר של הארכיטקטורה: ביום שבו תשוו את הפיין-טיון שלכם למודלים שהוא צריך לנצח, תרצו שההשוואה הזו תעלה לכם שינוי בקונפיגורציה ולא מחזור רכש.API אחד מול יותר מ-200 מודלים, מחיר המחירון של הספקים מועבר הלאה בלי שום תוספת לכל טוקן, מפתח אחד לכל הפאנל, ומעבר אוטומטי בעת כשל כך שאחר צהריים רע של ספק לא יהפוך לאחר צהריים רע של ההערכה שלכם. אלו התנאים שבהם בדיקת A/B על מודל לא מוכח היא זולה מספיק כדי שבאמת תריצו אותה.
זו גם ההצגה הכנה של AREX-2 עצמו. כשהוא ייצא לאור — בהנחה שהוא ייצא במשקולות פתוחות, כפי שעשו שני קודמיו — הדרך ההגיונית לנסות סוכן חדש לגמרי על עומס עבודה אמיתי היא במסלול צדדי, מאחורי failover, ולא כספק היחיד שלולאת הייצור שלך נשענת עליו.
מה שאדם סביר עושה לגבי כל אחד השבוע
אם יש לכם משימה קטנה ומצומצמת ונתונים שלא יכולים לצאת מהתשתית שלכם, ה-checkpoint של Liquid זמין, קטן, ברישיון מתירני מתחת לסף הכנסות, וניתן לבדיקה כבר אחר הצהריים. הורידו אותו, הריצו אותו על סט ההערכה שלכם, ותנו לתוצאה להכריע. שום דבר ב-AREX-2 לא משנה את התוכנית הזו.
אם אתם זקוקים היום להתנהגות מחקרית לטווח ארוך, המודל שכדאי לפנות אליו הוא זה שכבר קיים: AREX-Base, שהושק ביולי, עם בנצ'מרקים של סוכנים שפורסמו, שאפשר לפחות לבדוק אותם מול מאמר. AREX-2 הוא שם עם חתימת זמן, ושני הדברים שישנו את מעמדו נראים מבחוץ — אם קבצים מופיעים בעץ, ואם כרטיס עם מספר פרמטרים ורישיון מופיע יחד איתם.
דפוס הכשל שמאמר זה נועד למנוע הוא זה שבו מתייחסים לשם שמור כאל פריט במפת דרכים. זה לא המצב. זהו מאגר ש-BAAI יצרו אתמול, וכמות התכנון הנכונה לעשות סביבו כרגע היא אפס.
