כרטיס כותרת שנוצר ועליו הכיתוב 'AREX-2 מול Gemma 4 12B – אחד מאלה הוא מודל', עם שני פאנלים. הפאנל השמאלי, שבראשו Gemma 4 12B, מפרט: שוחרר ב-3 ביוני 2026; 11.95B פרמטרים, dense; חלון הקשר של 256K, Apache 2.0; הורידו אותו עוד היום. הפאנל הימני, שבראשו AREX-2, מפרט: המאגר נוצר ב-29 בספטמבר 2026; לא הועלו משקולות; אין כרטיס, אין תג רישיון; לא ניתן להורדה. בתחתית כתוב 'עמודה אחת היא מודל. האחרת היא חתימת זמן.' הלוגו של OrcaRouter מורכב בפינה הימנית התחתונה.
Guides & Insights

AREX-2 מול Gemma 4 12B: אחד מאלה הוא מודל

מחבר

Gideon Frost

תאריך פרסום

מודלים אחרונים · 20צפו בכל המודלים →
בנצ'מרקים: Artificial Analysis · מתעדכן יומית
חזרה לכל הפוסטים

להשוואה בין Gemma 4 12B ל-AREX-2 יש תכונה שאין לשום התמודדות אחרת בבלוג הזה: אחת משתי העמודות ריקה כי המודל באותו צד עדיין לא קיים. Gemma 4 12B הוא ארטיפקט ששוחרר — Goog​le DeepMind פרסמה אותו ב-3 ביוני 2026 כמודל צפוף עם משקולות פתוחות בעל 11.95 מיליארד פרמטרים תחת Apache 2.0, עם כרטיס מודל מלא, חלון הקשר של 256K טוקנים, קלט אודיו ותמונה נייטיבי, ושלושה חודשים וחצי של בדיקות עצמאיות מאחוריו. AREX-2 הוא מאגר Hugging Face שנוצר על ידי BAAI ב-29 בספטמבר 2026 בשעה 17:56 UTC ועדיין לא הוכנס בו דבר: אין משקולות, אין כרטיס, אין תג רישיון, אין הערכה, אין הודעה.

אי-הסימטריה הזו אינה סיבה לדלג על ההשוואה. זו ההשוואה. השאלה ששווה לענות עליה אינה איזו מהן טובה יותר — שום דבר לא יכול לענות על כך עד שיהיו קבצים בתוך AREX-2 — אלא האם סוכן מחקר BAAI מהדור השני בכלל יתחרה עם מודל edge בגודל 12B מלכתחילה, או האם שני אלה תופסים עמדות בסטאק שלעולם אינן נוגעות זו בזו. לטעות בכך זו הטעות היקרה, מפני שזו הטעות שמובילה צוות להקצות תקציב לדבר הלא נכון.

הצד שנשלח, בתנאים שלו

Gemma 4 12B הוא החבר הקטן במשפחת המודלים הפתוחים מהדור הרביעי של Google, והבחירה העיצובית המכוננת שלו היא ארכיטקטונית: הוא זונח לחלוטין את מקודד הראייה הנפרד ומזרים טלאי תמונה גולמיים וגלי אודיו ישר אל תוך ה-transformer. זה לא טריק של בנצ'מרק. זה מה שהופך את המודל לנייד באמת — כ-27 GB של משקולות BF16 שעוברות קוונטיזציה מתחת ל-7 GB, וכרטיס שמציין 16 GB של VRAM כיעד הפריסה. על מחשב נייד או כרטיס בינוני בודד, זהו מודל שאפשר ממש להחזיק.

פרופיל היכולות נובע מכך. הכרטיס של Goog​le עצמה — מדווח על ידי הספק, וראוי לתייג אותו ככזה — מפרט DocVQA 94.9 ו-InfoVQA 88.4 להבנת מסמכים, MMLU-Pro 77.2, GPQA Diamond 78.8, AIME 2026 77.5 ו-LiveCodeBench v6 72.0 במצב חשיבה. Artificial Analysis, שהיא בלתי תלויה, מעניקה לתצורת החשיבה ציון Intelligence Index של 14, מודדת אותה ב-114 טוקנים לשנייה, ומתמחרת קריאה טיפוסית בשירות ב-$0.10 למיליון טוקני קלט ו-$0.30 למיליון פלט. הערך שלנו בקטלוג עבור Gemma 4 31B הגדול יותר מציג 85.7 ב-GPQA Diamond. הצורה של זה היא ג'נרליסט קטן שהוא חזק באופן יוצא דופן במסמכים ובתמונות, סביר בהיסק, ואינו מתקרב למודל חזית בעבודה קשה מרובת שלבים.

תיאור התפקיד שלה הוא אפוא קונקרטי: הסקה מקומית או בדייר יחיד, הבנת מסמכים וצילומי מסך, לולאות סוכניות צנועות, וכל דבר שבו הנתונים אינם יכולים לצאת מהבניין. זה אינו מנוע מחקר מעמיק וגוגל אינה מוכרת אותו ככזה.

A screenshot of the Artificial Analysis model page for Gemma 4 12B (Reasoning), showing an Artificial Analysis Intelligence Index of 14, a speed rank of 19 of 142, $0.10 per million input tokens and $0.30 per million output, a 256K-token context window, text, image, speech and video input with text output, and the note that it is among the leading models in intelligence but somewhat expensive for its size. The page header reads 'Released June 2026' and 'Open weights model'.

הצד השני, שהוא שם וחותמת זמן

כל מה שניתן לאמת לגבי AREX-2 השבוע נכנס למשפט אחד. זהו מאגר תחת ארגון BAAI ב-Hugging Face, שנוצר ב-29 בספטמבר 2026, ומכיל .gitattributes בתור קובץ ותו לא — אפס בתים של נתוני מודל מאוחסנים, אפס הורדות, ללא כרטיס מודל, ללא הצהרת רישיון, ללא פריסת ספק. BAAI עצמה לא הודיעה דבר.

מה שהופך אותו לראוי לכתוב עליו הוא המשפחה שעל שמה הוא נקרא. סדרת AREX של BAAI הושקה ב-23 ביולי 2026 עם שני מודלים: AREX-Base, מודל תערובת מומחים בעל 122 מיליארד פרמטרים ועם 10 מיליארד פרמטרים פעילים המבוסס על Qwen3.5-122B-A10B, ו-AREX-Turbo, מודל צפוף של 4B הבנוי על Qwen3.5-4B. שניהם ברישיון Apache 2.0. שניהם סוכני מחקר מעמיק ולא מודלי צ'אט — לולאה פנימית שאוספת ראיות ומפיקה תשובה מועמדת עם ציון ביטחון, ולולאה חיצונית שבודקת את התשובה הזו מול האילוצים המקוריים ויכולה לחדד או להפעיל מחדש את כל המסלול. לפי המספרים שפרסמה BAAI, AREX-Base מגיע ל-82.5 ב-BrowseComp, ל-85.4 ב-GAIA ול-89.9 ב-DeepSearch QA; AREX-Turbo מגיע ל-70.7, ל-81.6 ול-78.5 באותם שלושה.

כל הנתונים האלה הם של הספק עצמו, ואף אחד מהם לא שוחזר על ידי גורם בלתי תלוי. הם גם מתייחסים למודל אחר. ל-AREX-2 אין נתונים, וה״2״ לא אומר לך דבר על גודל, שלד רשת או ארכיטקטורה — דור שני בסדרה הזו יכול להיות סוכן גדול יותר, דיסטילציה קטנה יותר, או פריימוורק שאומן מחדש ושלד הרשת שלו הוחלף.

האם שני אלה בכלל נפגשים?

כאן ההשוואה נעשית שימושית יותר ממה שהיא נראית. קח את שתי הקריאות הסבירות של מה ש-AREX-2 הופך להיות.

אם מדובר בסוכן מחקר מהדור השני בהיקף דומה לזה של Base, הוא ו-Gemma 4 12B לעולם לא מתחרים זה בזה. תערובת מומחים של 122B שמפעילה חיפוש רב-מקורות היא שירות מתארח, בחיוב לפי טוקן ותלוי רשת; Gemma 4 12B הוא צ'קפוינט שאתה מוריד ומריץ בעצמך. ההחלטה ביניהם אינה השוואת איכות, אלא החלטה אם עומס העבודה שלך הוא לולאת מחקר או נקודת קצה להסקה.

אם AREX-2 יתברר כדרגה הקטנה — היורש של 4B Turbo ולא של 122B Base — אז השניים כן חולקים מדף, וההשוואה הופכת לאמיתית. הגרסה הזו של AREX-2 תהיה בערך כשליש מכמות הפרמטרים של Gemma 4 12B, תתמחה בחיפוש מונחה-כלים ולא ברוחב רב-מודלי, ותימדד ב-BrowseComp וב-GAIA ולא ב-DocVQA. שני מודלים קטנים, האחד מותאם לשמור על מסלול מחקר ארוך, והאחר לראות ולקרוא על חומרה צנועה. צוות שבונה צנרת תיעוד לא אמור להתעניין בראשון; צוות שבונה סוכן מחקר לא אמור להתעניין בשני.

• מה קיים — Gemma 4 12B ניתן להורדה היום עם כרטיס מלא. AREX-2 הוא מאגר שאין בו קבצים.

• פרמטרים — 11.95B צפוף עבור Gemma 4 12B. לא צוין, וניתן להסיק רק משם מוצר, עבור AREX-2.

• הקשר — 256K טוקנים (262,144 מיקומים) עבור Gemma 4 12B. לא ידוע עבור AREX-2.

• מודאליות — טקסט, תמונה ואודיו פנימה עבור Gemma 4 12B. לא ידוע עבור AREX-2; הדור הראשון של AREX היה טקסט בתוספת שימוש בכלים.

• רישיון — Apache 2.0 עבור Gemma 4 12B, מצוין בכרטיס. לא מצוין עבור AREX-2; AREX-Base ו-AREX-Turbo היו Apache 2.0.

• למה זה נועד — הסקה מולטימודלית הניתנת לפריסה על החומרה שלך לעומת, על פי העדויות של המשפחה, חיפוש ארוך-טווח ואיגום ראיות מול נקודת קצה מתארחת.

A generated two-column card headed 'Two deployment shapes, and only one of them exists'. It contrasts where Gemma 4 12B runs (local or single-tenant; about 27 GB BF16, under 7 GB quantised, 16 GB VRAM target; no rate card or per-token meter) against where AREX-Base runs (a 122B mixture-of-experts, a cluster or a hosted endpoint billed per token), names tokens per search step times steps per trajectory as the cost driver for the AREX shape, and notes that AREX-2 is neither shape because there are no files in the repository. A footer reads 'Is this a quality comparison? Not until one side has a model in it.' The OrcaRouter logo is composited in the bottom-right corner.

החלק שבאמת ניתן להשוות: היכן שכל אחד מהם פועל

מאחר שהשוואת היכולות אינה זמינה, ההשוואה ההגונה שיש לערוך היא השוואת הפריסות, והיא אינה צמודה.

Gemma 4 12B רץ היכן שתשימו אותו. אין כרטיס תעריפים, אין מדידה לפי טוקנים ואין ספק בין you לבין המודל — העלות היא החומרה והחשמל, ואופן הכשל הוא תכנון הקיבולת שלכם. לעומת זאת, כאשר AREX-Base שוחרר ביולי, הוא היה תערובת מומחים של 122B: מודל שאתם מריצים על אשכול או שוכרים לפי טוקן, וה-4B Turbo של המשפחה קיים בדיוק משום שלבחירה הזו יש מחיר. אם הדור השני ילך באותה צורה, הכלכלה של AREX-2 תהיה פונקציה של טוקנים הנצרכים לשאילתה כפול מספר צעדי החיפוש שמסלול מבצע — מספר שגדול בהרבה עבור סוכן מחקר מעמיק מאשר עבור מודל קריאת מסמכים, משום שהסוכן קורא מחדש הקשר הולך וגדל בכל איטרציה.

שם מפסיקה שכבת ניתוב להיות הפשטה ומתחילה להיות סעיף חיוב. אם בסופו של דבר תריץ סוכן מחקר מול מודל מתארח תוך שמירה על Gemma 4 12B מקומי לעבודת המסמכים, אלו שתי אינטגרציות במקרה הרגיל. דרך ‏API אחד לפני יותר מ-200 מודלים — כשמחיר המחירון של הספק מועבר הלאה כלשונו ובלי תוספת רווח מעליו, כך ששינוי מחיר של ספק מגיע באותו יום — הם מפתח אחד, חשבון אחד ולקוח אחד, וכלל failover יכול להעביר בקשה מספק שעובר שעה רעה בלי שלולאת הסוכן שלך יהיה מושג. אנחנו מנתבים היום את Gemma 4 26B-A4B ואת Gemma 4 31B; אנחנו לא מנתבים את ה-12B, וגם שום דבר מקו AREX לא נמצא בקטלוג שלנו, אז אם מי מאלה הוא המודל שאתה צריך, הוא מגיע מההפצה של הספק שלו עצמו.

מה לעשות השבוע

אם אתה זקוק למודל מולטימודלי קומפקטי שתוכל להריץ בעצמך, ההחלטה מעולם לא הייתה תלויה ב-AREX-2. Gemma 4 12B שוחרר, מתועד, מדורג באופן עצמאי וניתן לפריסה, ועמודת ההשוואה בצד השני ריקה. אל תקנה דבר על סמך שם שמור.

אם אתה בונה סוכן מחקר מעמיק וסדרת AREX היא מה שאתה באמת רוצה, הדבר שכדאי לשים לב אליו הוא לא השם אלא העץ: האם safetensors מופיעים במאגר הזה, מה הכרטיס אומר על מספר הפרמטרים, ואיזו תגית רישיון נוחתת עליו. הדור הראשון הופץ עם Apache 2.0, ואם גם השני יופץ כך, השאלה הופכת לשאלת אירוח ולא לשאלת רישוי. עד אז, AREX-Base הוא מודל AREX שאתה באמת יכול להריץ, והוא זמין מאז יולי.

הדבר האחד ששווה לומר בפשטות על ההשוואה שהמאמר הזה לכאורה עוסק בה: עמוד VS שבו צד אחד הוא קומיט במאגר והצד האחר הוא מודל שכבר שוחרר אינו התמודדות, אלא לוח זמנים. לוח הזמנים אומר ש-Gemma 4 12B זמין עכשיו ו-AREX-2 אינו זמין כלל.