
AREX-2 מול Gemma 4 12B: אחד מאלה הוא מודל
- typesafeחדשTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 לכל 1M טוקנים · 397 tok/s
- OpenAIחדשOpenAI: GPT-6 Luna2026-09-2237אינטליגנציה
- OpenAIחדשOpenAI: GPT-6 Sol2026-09-2248אינטליגנציה
- AnthropicחדשAnthropic: Claude Opus 5.52026-09-2258אינטליגנציה
- xAIחדשGrok 4.72026-09-2146אינטליגנציה
- OrcaחדשOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 לכל 1M טוקנים · 195 tok/s
- OrcaחדשOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 לכל 1M טוקנים · 1141 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040אינטליגנציה
- OpenAIOpenAI: GPT-6 Astra2026-09-0453אינטליגנציה77כתיבת קוד
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241אינטליגנציה76כתיבת קוד
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245אינטליגנציה76כתיבת קוד
- AnthropicAnthropic: Claude Fable 5.12026-09-0153אינטליגנציה82כתיבת קוד
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 לכל 1M טוקנים · 54 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 לכל 1M טוקנים · 106 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642אינטליגנציה72כתיבת קוד
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 לכל 1M טוקנים · 220 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845אינטליגנציה75כתיבת קוד
- obsidianQwen3.8 27B2026-08-1534אינטליגנציה68כתיבת קוד
- DeepSeekDeepSeek: DeepSeek V4 Pro 08132026-08-1236אינטליגנציה69כתיבת קוד
- xAISpaceXAI: Grok 4.62026-08-1244אינטליגנציה77כתיבת קוד
להשוואה בין Gemma 4 12B ל-AREX-2 יש תכונה שאין לשום התמודדות אחרת בבלוג הזה: אחת משתי העמודות ריקה כי המודל באותו צד עדיין לא קיים. Gemma 4 12B הוא ארטיפקט ששוחרר — Google DeepMind פרסמה אותו ב-3 ביוני 2026 כמודל צפוף עם משקולות פתוחות בעל 11.95 מיליארד פרמטרים תחת Apache 2.0, עם כרטיס מודל מלא, חלון הקשר של 256K טוקנים, קלט אודיו ותמונה נייטיבי, ושלושה חודשים וחצי של בדיקות עצמאיות מאחוריו. AREX-2 הוא מאגר Hugging Face שנוצר על ידי BAAI ב-29 בספטמבר 2026 בשעה 17:56 UTC ועדיין לא הוכנס בו דבר: אין משקולות, אין כרטיס, אין תג רישיון, אין הערכה, אין הודעה.
אי-הסימטריה הזו אינה סיבה לדלג על ההשוואה. זו ההשוואה. השאלה ששווה לענות עליה אינה איזו מהן טובה יותר — שום דבר לא יכול לענות על כך עד שיהיו קבצים בתוך AREX-2 — אלא האם סוכן מחקר BAAI מהדור השני בכלל יתחרה עם מודל edge בגודל 12B מלכתחילה, או האם שני אלה תופסים עמדות בסטאק שלעולם אינן נוגעות זו בזו. לטעות בכך זו הטעות היקרה, מפני שזו הטעות שמובילה צוות להקצות תקציב לדבר הלא נכון.
הצד שנשלח, בתנאים שלו
Gemma 4 12B הוא החבר הקטן במשפחת המודלים הפתוחים מהדור הרביעי של Google, והבחירה העיצובית המכוננת שלו היא ארכיטקטונית: הוא זונח לחלוטין את מקודד הראייה הנפרד ומזרים טלאי תמונה גולמיים וגלי אודיו ישר אל תוך ה-transformer. זה לא טריק של בנצ'מרק. זה מה שהופך את המודל לנייד באמת — כ-27 GB של משקולות BF16 שעוברות קוונטיזציה מתחת ל-7 GB, וכרטיס שמציין 16 GB של VRAM כיעד הפריסה. על מחשב נייד או כרטיס בינוני בודד, זהו מודל שאפשר ממש להחזיק.
פרופיל היכולות נובע מכך. הכרטיס של Google עצמה — מדווח על ידי הספק, וראוי לתייג אותו ככזה — מפרט DocVQA 94.9 ו-InfoVQA 88.4 להבנת מסמכים, MMLU-Pro 77.2, GPQA Diamond 78.8, AIME 2026 77.5 ו-LiveCodeBench v6 72.0 במצב חשיבה. Artificial Analysis, שהיא בלתי תלויה, מעניקה לתצורת החשיבה ציון Intelligence Index של 14, מודדת אותה ב-114 טוקנים לשנייה, ומתמחרת קריאה טיפוסית בשירות ב-$0.10 למיליון טוקני קלט ו-$0.30 למיליון פלט. הערך שלנו בקטלוג עבור Gemma 4 31B הגדול יותר מציג 85.7 ב-GPQA Diamond. הצורה של זה היא ג'נרליסט קטן שהוא חזק באופן יוצא דופן במסמכים ובתמונות, סביר בהיסק, ואינו מתקרב למודל חזית בעבודה קשה מרובת שלבים.
תיאור התפקיד שלה הוא אפוא קונקרטי: הסקה מקומית או בדייר יחיד, הבנת מסמכים וצילומי מסך, לולאות סוכניות צנועות, וכל דבר שבו הנתונים אינם יכולים לצאת מהבניין. זה אינו מנוע מחקר מעמיק וגוגל אינה מוכרת אותו ככזה.

הצד השני, שהוא שם וחותמת זמן
כל מה שניתן לאמת לגבי AREX-2 השבוע נכנס למשפט אחד. זהו מאגר תחת ארגון BAAI ב-Hugging Face, שנוצר ב-29 בספטמבר 2026, ומכיל .gitattributes בתור קובץ ותו לא — אפס בתים של נתוני מודל מאוחסנים, אפס הורדות, ללא כרטיס מודל, ללא הצהרת רישיון, ללא פריסת ספק. BAAI עצמה לא הודיעה דבר.
מה שהופך אותו לראוי לכתוב עליו הוא המשפחה שעל שמה הוא נקרא. סדרת AREX של BAAI הושקה ב-23 ביולי 2026 עם שני מודלים: AREX-Base, מודל תערובת מומחים בעל 122 מיליארד פרמטרים ועם 10 מיליארד פרמטרים פעילים המבוסס על Qwen3.5-122B-A10B, ו-AREX-Turbo, מודל צפוף של 4B הבנוי על Qwen3.5-4B. שניהם ברישיון Apache 2.0. שניהם סוכני מחקר מעמיק ולא מודלי צ'אט — לולאה פנימית שאוספת ראיות ומפיקה תשובה מועמדת עם ציון ביטחון, ולולאה חיצונית שבודקת את התשובה הזו מול האילוצים המקוריים ויכולה לחדד או להפעיל מחדש את כל המסלול. לפי המספרים שפרסמה BAAI, AREX-Base מגיע ל-82.5 ב-BrowseComp, ל-85.4 ב-GAIA ול-89.9 ב-DeepSearch QA; AREX-Turbo מגיע ל-70.7, ל-81.6 ול-78.5 באותם שלושה.
כל הנתונים האלה הם של הספק עצמו, ואף אחד מהם לא שוחזר על ידי גורם בלתי תלוי. הם גם מתייחסים למודל אחר. ל-AREX-2 אין נתונים, וה״2״ לא אומר לך דבר על גודל, שלד רשת או ארכיטקטורה — דור שני בסדרה הזו יכול להיות סוכן גדול יותר, דיסטילציה קטנה יותר, או פריימוורק שאומן מחדש ושלד הרשת שלו הוחלף.
האם שני אלה בכלל נפגשים?
כאן ההשוואה נעשית שימושית יותר ממה שהיא נראית. קח את שתי הקריאות הסבירות של מה ש-AREX-2 הופך להיות.
אם מדובר בסוכן מחקר מהדור השני בהיקף דומה לזה של Base, הוא ו-Gemma 4 12B לעולם לא מתחרים זה בזה. תערובת מומחים של 122B שמפעילה חיפוש רב-מקורות היא שירות מתארח, בחיוב לפי טוקן ותלוי רשת; Gemma 4 12B הוא צ'קפוינט שאתה מוריד ומריץ בעצמך. ההחלטה ביניהם אינה השוואת איכות, אלא החלטה אם עומס העבודה שלך הוא לולאת מחקר או נקודת קצה להסקה.
אם AREX-2 יתברר כדרגה הקטנה — היורש של 4B Turbo ולא של 122B Base — אז השניים כן חולקים מדף, וההשוואה הופכת לאמיתית. הגרסה הזו של AREX-2 תהיה בערך כשליש מכמות הפרמטרים של Gemma 4 12B, תתמחה בחיפוש מונחה-כלים ולא ברוחב רב-מודלי, ותימדד ב-BrowseComp וב-GAIA ולא ב-DocVQA. שני מודלים קטנים, האחד מותאם לשמור על מסלול מחקר ארוך, והאחר לראות ולקרוא על חומרה צנועה. צוות שבונה צנרת תיעוד לא אמור להתעניין בראשון; צוות שבונה סוכן מחקר לא אמור להתעניין בשני.
• מה קיים — Gemma 4 12B ניתן להורדה היום עם כרטיס מלא. AREX-2 הוא מאגר שאין בו קבצים.
• פרמטרים — 11.95B צפוף עבור Gemma 4 12B. לא צוין, וניתן להסיק רק משם מוצר, עבור AREX-2.
• הקשר — 256K טוקנים (262,144 מיקומים) עבור Gemma 4 12B. לא ידוע עבור AREX-2.
• מודאליות — טקסט, תמונה ואודיו פנימה עבור Gemma 4 12B. לא ידוע עבור AREX-2; הדור הראשון של AREX היה טקסט בתוספת שימוש בכלים.
• רישיון — Apache 2.0 עבור Gemma 4 12B, מצוין בכרטיס. לא מצוין עבור AREX-2; AREX-Base ו-AREX-Turbo היו Apache 2.0.
• למה זה נועד — הסקה מולטימודלית הניתנת לפריסה על החומרה שלך לעומת, על פי העדויות של המשפחה, חיפוש ארוך-טווח ואיגום ראיות מול נקודת קצה מתארחת.

החלק שבאמת ניתן להשוות: היכן שכל אחד מהם פועל
מאחר שהשוואת היכולות אינה זמינה, ההשוואה ההגונה שיש לערוך היא השוואת הפריסות, והיא אינה צמודה.
Gemma 4 12B רץ היכן שתשימו אותו. אין כרטיס תעריפים, אין מדידה לפי טוקנים ואין ספק בין you לבין המודל — העלות היא החומרה והחשמל, ואופן הכשל הוא תכנון הקיבולת שלכם. לעומת זאת, כאשר AREX-Base שוחרר ביולי, הוא היה תערובת מומחים של 122B: מודל שאתם מריצים על אשכול או שוכרים לפי טוקן, וה-4B Turbo של המשפחה קיים בדיוק משום שלבחירה הזו יש מחיר. אם הדור השני ילך באותה צורה, הכלכלה של AREX-2 תהיה פונקציה של טוקנים הנצרכים לשאילתה כפול מספר צעדי החיפוש שמסלול מבצע — מספר שגדול בהרבה עבור סוכן מחקר מעמיק מאשר עבור מודל קריאת מסמכים, משום שהסוכן קורא מחדש הקשר הולך וגדל בכל איטרציה.
שם מפסיקה שכבת ניתוב להיות הפשטה ומתחילה להיות סעיף חיוב. אם בסופו של דבר תריץ סוכן מחקר מול מודל מתארח תוך שמירה על Gemma 4 12B מקומי לעבודת המסמכים, אלו שתי אינטגרציות במקרה הרגיל. דרך API אחד לפני יותר מ-200 מודלים — כשמחיר המחירון של הספק מועבר הלאה כלשונו ובלי תוספת רווח מעליו, כך ששינוי מחיר של ספק מגיע באותו יום — הם מפתח אחד, חשבון אחד ולקוח אחד, וכלל failover יכול להעביר בקשה מספק שעובר שעה רעה בלי שלולאת הסוכן שלך יהיה מושג. אנחנו מנתבים היום את Gemma 4 26B-A4B ואת Gemma 4 31B; אנחנו לא מנתבים את ה-12B, וגם שום דבר מקו AREX לא נמצא בקטלוג שלנו, אז אם מי מאלה הוא המודל שאתה צריך, הוא מגיע מההפצה של הספק שלו עצמו.
מה לעשות השבוע
אם אתה זקוק למודל מולטימודלי קומפקטי שתוכל להריץ בעצמך, ההחלטה מעולם לא הייתה תלויה ב-AREX-2. Gemma 4 12B שוחרר, מתועד, מדורג באופן עצמאי וניתן לפריסה, ועמודת ההשוואה בצד השני ריקה. אל תקנה דבר על סמך שם שמור.
אם אתה בונה סוכן מחקר מעמיק וסדרת AREX היא מה שאתה באמת רוצה, הדבר שכדאי לשים לב אליו הוא לא השם אלא העץ: האם safetensors מופיעים במאגר הזה, מה הכרטיס אומר על מספר הפרמטרים, ואיזו תגית רישיון נוחתת עליו. הדור הראשון הופץ עם Apache 2.0, ואם גם השני יופץ כך, השאלה הופכת לשאלת אירוח ולא לשאלת רישוי. עד אז, AREX-Base הוא מודל AREX שאתה באמת יכול להריץ, והוא זמין מאז יולי.
הדבר האחד ששווה לומר בפשטות על ההשוואה שהמאמר הזה לכאורה עוסק בה: עמוד VS שבו צד אחד הוא קומיט במאגר והצד האחר הוא מודל שכבר שוחרר אינו התמודדות, אלא לוח זמנים. לוח הזמנים אומר ש-Gemma 4 12B זמין עכשיו ו-AREX-2 אינו זמין כלל.
