
Apodex 1.1, מוסבר: 44 במדד האינטליגנציה, כוח סוכני אמיתי — ומלכוד באמינות הידע
- openaiחדשOpenAI: GPT-6 Luna2026-09-2237אינטליגנציה
- openaiחדשOpenAI: GPT-6 Sol2026-09-2248אינטליגנציה
- anthropicחדשAnthropic: Claude Opus 5.52026-09-2258אינטליגנציה
- grokחדשGrok 4.72026-09-2146אינטליגנציה
- OrcaחדשOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 לכל 1M טוקנים · 177 tok/s
- orcaחדשOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 לכל 1M טוקנים · 1323 tok/s
- deepseekחדשDeepSeek: DeepSeek V4.1 Flash2026-09-1040אינטליגנציה
- openaiOpenAI: GPT-6 Astra2026-09-0453אינטליגנציה77כתיבת קוד
- googleGoogle: Gemini 3.8 Flash2026-09-0241אינטליגנציה76כתיבת קוד
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245אינטליגנציה76כתיבת קוד
- anthropicAnthropic: Claude Fable 5.12026-09-0153אינטליגנציה82כתיבת קוד
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 לכל 1M טוקנים · 108 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642אינטליגנציה72כתיבת קוד
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 לכל 1M טוקנים · 220 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845אינטליגנציה75כתיבת קוד
- obsidianQwen3.8 27B2026-08-1534אינטליגנציה68כתיבת קוד
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236אינטליגנציה69כתיבת קוד
- grokSpaceXAI: Grok 4.62026-08-1244אינטליגנציה77כתיבת קוד
- metaMeta: Muse Spark 1.22026-08-0540אינטליגנציה72כתיבת קוד
- qwenQwen: Qwen3.8 Max2026-08-0345אינטליגנציה76כתיבת קוד
Apodex 1.1 הוא בן שבוע, קנייני, ועד השבוע הזה היה בעיקר סקרנות מעבדה. אז פרסם Artificial Analysis את ההערכה העצמאית הראשונה שלו למודל — הראשונה של Apodex בפלטפורמה — ולוח התוצאות עשה משהו חריג: Apodex 1.1 קיבל 44 במדד האינטליגנציה של Artificial Analysis, דורג במקום 11 מתוך 177, ובמקביל רשם ציוני עבודה-סוכנתית שהביסו כל מודל בדרגת האינטליגנציה שלו, כולל DeepSeek V4 Pro, Qwen3.7 Max ו-Kimi K2.6. אותו דוח חשף מספר שני ומכוער יותר: רשומת מהימנות-ידע חלשה מספיק כדי לשנות את ההחלטה על הרצת עבודה אמיתית עליו. אחותו בעלת המשקלים הפתוחים, Apodex 1.1 Mini, היא המודל שרוב האנשים יכולים בפועל להריץ. הנה מה שההערכה אומרת, מה היא לא אומרת, ולמי זה צריך להיות חשוב.
Apodex, חברת הבינה המלאכותית שהוקמה על ידי צ'ן טיאנקיאו, השיקה את המשפחה ב-24 באוגוסט 2026, יחד עם מאמר arXiv בן 70 מחברים, "Apodex 1.1: Scaling Agentic Intelligence for Complex Work" (2608.23283). הדגם הדגל הוא קנייני — עם כ-397 מיליארד פרמטרים, לפי דוח הספק — והוא נבנה סביב התזה שהצוואר בקבוק האמיתי של סוכנים אינו אינטליגנציה גולמית, אלא הסביבה שבה הם פועלים. לכן, Apodex 1.1 אומן לעבוד ישירות עם קבצים, חיפוש וקוד על פני אופקי זמן ארוכים, עם מערכת ריצה משותפת ("AgentOS") שמתאמת עד 150 תתי-סוכנים במקביל ושומרת תיעוד מקור לכל צעד. החלק הפתוח הוא האח התאום: Apodex 1.1 Mini, מודל MoE מסוג 35B, מכוונן מהדגם של אליבאבא,Qwen3.5-35B-A3B, ששוחרר תחת רישיון Apache-2.0 עם מערכת סוכנים נלווית בשם FrontierAgent. הדגם המלא מגיע אליך רק דרך ה-API של Apodex וסביבת העבודה המקוונת; ה-Mini הוא לאירוח עצמי בלבד, או כלום.
מה אומר ציון 44 במדד האינטליגנציה
מדד הבינה המלאכותית של Artificial Analysis הוא צבירה משוקללת של חבילת מבחני הביצוע של הפלטפורמה — כולל הערכות סוכנים (agentic evals) כמו GDPval-AA v2 ו-Terminal-Bench, וכן רכיבי חשיבה, מתמטיקה וידע. ציון של 44 ממקם את Apodex 1.1 במקום ה-11 מתוך 177 דגמים, הרבה מעל החציון של 18. זה גם מכניס את הדגם לדרגה צפופה ומעניינת: Kimi K2.6 (45), MiniMax-M3 (45) ו-Inkling (42) כולם נמצאים בטווח של שלוש נקודות, ו-Apodex 1.1 הוא היחיד בקבוצה הזו ששמו לא היה מוכר לרוב משתמשי הבינה המלאכותית לפני שבוע. Artificial Analysis מציינת שהעמוד מכסה את גרסת החשיבה (reasoning) של הדגם, וכי ייתכן שקיימת גם גרסה שאינה מבוססת חשיבה.

ציון מדד הכותרת אינו המקום שבו המודל הזה נהיה מעניין. הוא מעניין בגלל היכן שחוזקותיו וחולשותיו יושבות ביחס לאותו ציון — וזה מה שהשוואת הרמות הופכת למוחשי.
היכן שהוא מתעלה על הרמה שלו: הערכות סוכנותיות ועבודת ידע
בשני מרכיבי המדד שמודדים עבודה סוכנותית בעולם האמיתי, Apodex 1.1 מבצע ביצועי יתר לעומת שכניו שבמרחק 44 נקודות. ב-GDPval-AA v2 — מדד שבודק את יכולתו של סוכן להשלים משימות משרדיות מציאותיות מקצה לקצה — Apodex 1.1 רושם Elo של 1348, לפני DeepSeek V4 Pro (1333), Qwen3.7 Max (1308) ו-Kimi K2.6 (1202). ב-TerminalBench v2.1, שבוחן סוכן העובד במסוף, הוא משיג 70%, לפני Kimi K2.6 (66%) וקצת מאחורי Qwen3.7 Max (75%). אלה מספרים עצמאיים שהריצה Artificial Analysis, והם הראיה החזקה ביותר בדוח לכך שהאימון הממוקד-סביבה עובד.
טענות אמות המידה של הספק עצמו הולכות רחוק יותר, ויש לקרוא אותן כדיווח ספק עד שמישהו ישחזר אותן: APEX-Agents 38.5, GDPVal 78.8, SWE-bench Verified 77.7%, Terminal-Bench 2.1 70.8%, Humanity's Last Exam 56.1% עם כלים, DeepSearchQA 92.4%, FrontierFinance 54.3, ו-FrontierScience-Research 63.3. מה שהופך את הפרופיל הסוכני לאמין ולא להייפ הוא הארכיטקטורה שמאחוריו: קנה-מידה סביבתי (הרחבת מגוון סביבות הקבצים, החיפוש והקוד הניתנות להרצה שבהן נעשה שימוש באימון) וקנה-מידה של תיאום סוכני (אימון המודל לפרק משימות ארוכות-טווח, להאציל עבודה מקבילה, לשלב תוצאות אסינכרוניות ולתכנן מחדש). מצב "Agent Team" מפעיל עד 150 תת-סוכנים על משימות אחזור וסינתזה, ושלב אימות מובנה ("Statement Review") בודק מסקנות לפני שהן נמסרות. במילים אחרות: זהו מודל שתוכנן לטעות, לבדוק את עצמו ולתקן — לא לדקלם עובדות מהזיכרון.
המחיר הנסתר של כל אותה סוכנות: מילוליות יתר
העיצוב הזה מופיע בטבלת עלות-היעילות של Artificial Analysis כחולשה הברורה ביותר של המודל אחרי הידע: הוא מאוד מילולי. הרצת מדד האינטליגנציה המלא צרכה 180 מיליון אסימוני פלט — לעומת חציון של 67 מיליון — וכ-17,000 אסימוני פלט למשימת benchmark, בהשוואה לכ-9,400 עבור Qwen3.7 Max ו-8,100 עבור MiniMax-M3. בסך הכול, ההערכה המלאה עלתה 618.41 דולר בהוצאות API, לפי Artificial Analysis.

התמחור שמייצר את החשבון הזה: $0.30 למיליון אסימוני קלט ו-$3.00 למיליון פלט — מחיר של $0.03 לפגיעת מטמון על קלט שמור, הנחה של 90% — שמתאזן לכ-$0.38 למיליון בשילוב אופייני של 7:2:1 מטמון/קלט/פלט. שני המחירים לאסימון נמצאים מעל חציוני הפלטפורמה ($0.25 קלט, $0.90 פלט). ובכל זאת, הערכת העלות למשימה של Artificial Analysis עדיין ממקמת את Apodex 1.1 על כ-$0.05 למשימת benchmark, זול יותר מ-Qwen3.7 Max (~$0.07) ו-Kimi K2.6 (~$0.06). ההתאמה הזו חשובה לתקציב: האסימונים שלו זולים מספיק כדי שגם מילוליות כבדה תישאר תחרותית למשימה — סיכון העלות הוא הנפח, לא התעריף. אם תציבו עליו סוכן ארוך-טווח, החשבון נקבע לפי כמה הוא מדבר, והוא מדבר הרבה.
הערת תמחור אחת לפני שתבנה תקציב: $0.30/$3.00 הוא המחירון הרשמי של הספק. פלטפורמת ניתוב שמעבירה את מחירי הרשימה של הספק במרווח של 0% גובה בדיוק את הסכום הזה, וכל הפחתת מחיר עתידית של Apodex תופיע באותו היום שבו היא תוכרז.
המלכוד: רקורד אמינות ידע חלש
הנה המספר שרוב הסיקור של ההשקה מפספס. במבחן AA-Omniscience, בדיקת מהימנות הידע של Artificial Analysis, Apodex 1.1 מקבל ציון 21.9-. הוא מנסה לענות על 87% מהשאלות במקום לסרב, אבל מצליח רק ב-32%, ושיעור ההזיות שלו הוא 78.4%. עבור מודל שממוצב כפותר משימות כבדות, זה פיצול אישיות רציני: חזק בביצוע סוכני, חלש בידע מבוסס.
שתי העובדות קשורות, לא סותרות. בנצ'מרקים אג'נטיים מתגמלים פעולה בסביבה — הנפקת קריאות לכלים, איטרציה, התאוששות — כך שמודל יכול להשיג ציון גבוה שם בעוד יכולת השליפה שלו ירודה, כי הסביבה היא זו שזוכרת. העיצוב אפילו מניח זאת: Statement Review קיימת כדי לבדוק פלטים, וסביבת העבודה בנויה סביב אימות, לא סביב דיוק המודל מהזיכרון. הקריאה המעשית חדה: אל תכוונו את Apodex 1.1 למשימות שתלויות בשליפת עובדות מהמשקולות שלו עצמו. כוונו אותו למשימות ארוכות טווח שבהן אפשר לבדוק את התוצאה מול קבצים, קוד ומקורות — ואמתו את המסירה.
האח הפתוח: Apodex 1.1 Mini ו-FrontierAgent
אם הדלת הסגורה של דגם הדגל היא בעיה, החצי הפתוח של המשפחה הוא משקל הנגד. Apodex 1.1 Mini הוא מודל MoE עם ~35B פרמטרים בסך הכול / ~3B אקטיביים, שכוונן עדין על בסיס Qwen3.5-35B-A3B (מודל בסיס שאליבאבא פרסמה בקוד פתוח בפברואר 2026), ושוחרר תחת רישיון Apache-2.0 עם חלון הקשר של 262K וגרסאות FP8, FP4 ו-GPTQ-Int4 ב-Hugging Face. הציון הראשי המדווח על ידי הספק הוא 50.2 ב-FrontierFinance (מקום ראשון בהשוואה הפנימית של Apodex) ו-27.7 ב-APEX-Agents כשמסגרת ה-Agent Team מופעלת. ו-FrontierAgent — סביבת הריצה בקוד פתוח שמגיעה איתו — היא הדבר המעניין באמת: מסגרת הרצה מבוססת טרמינל עם מצבי ReAct ו-Agent Team, עבודה על קבצים בארגז חול, שערי אישור, נקודות שמירה ורישומי מעקב, והכול מתחבר לכל נקודת קצה תואמת-OpenAI.
שני דברים שכדאי לדעת לפני שאתם מארחים בעצמכם. ראשית, ה-Mini הוא כוונון עדין (fine-tune), לא מודל חזית — קראו את נתוני הבenchmark שלו באותה דרך שבה אתם קוראים את טבלת הספק של הדגם הדגל: השוואות שלא שוחזרו, כוללות תשתית הרצה, ונבחרו על ידי הספק. שנית, ההתנהגות שלו יורשת את הבסיס: אם אתם רוצים לבדוק האם ה-Qwen3.5-35B-A3B הבסיסי כבר מבצע את המשימה שלכם, אין צורך ב-GPU ובתשתית שרת כדי לגלות — הבסיס נמצא במרחק קריאת API אחת.
מי צריך להשתמש ב-Apodex 1.1 היום
דגם הדגל הוא מוקדם, סגור, ובינתיים זמין רק ב-API של הספק עצמו ובסביבת העבודה המקוונת שלו; Apodex אומרת שזמינות API רחבה יותר תגיע דרך פלטפורמות מרכזיות, אבל המשקולות אינן פתוחות. זה מגביל את מי שיכול לפעול על לוח התוצאות של השבוע: צוותים שכבר נמצאים בסביבת העבודה של Apodex, או שמוכנים להירשם לקבלת מפתח API ישיר. ה-Mini הוא הנתיב הנגיש יותר, אבל המשמעות היא אירוח עצמי.

היכן שהמודל באמת מרוויח את מקומו: צינורות סוכנים ארוכי-טווח שבהם הפלטים מאומתים בהמשך הדרך — סביבות עבודה מחקריות, משימות מרובות-שלבים עם קבצים וכלים, עבודת טרמינל — ובהם פרופיל העלות של כ-$0.05 למשימה שורד את הנפחיות. היכן שהוא עדיין לא שייך: כל דבר שתלוי באמינות הידע של המודל עצמו, או נתיב ייצור שאינו יכול לסבול מודל לא מוכח בן שבעה ימים שמתנהג לא כראוי. בדיוק למצב כזה, שכבת ניתוב היא המעטפת הנכונה.ממשק API אחד ל-200+ מודליםפירושו שמודל הבסיס Qwen3.5-35B-A3B כבר ניתן לקריאה במחיר המחירון, Mini באירוח עצמי יכול לשבת מאחורי אותו נתב עם failover אוטומטי, ומצטרף חדש ובלתי יציב לא יכול להפיל נתיב ייצור — כשהוא לא מתפקד היטב, הבקשה מתגלגלת לספק בריא במקום.
מה לצפות בהמשך
הערכה זו היא קריאה ראשונית, לא פסק דין. שלושה דברים יכריעו אם {{1}}Apodex 1.1{{/1}} יהיה רלוונטי בעוד חודש: שכפול עצמאי של טענות ה-agentic של הספק (תוצאות ה-GDPval וה-TerminalBench שמריצה Artificial Analysis הן היחידות שלא הופקו על ידי Apodex עצמו); האם פער אמינות הידע יצטמצם בגרסה שאינה מסוג reasoning או במהדורת המשך; והאם המודל יופיע בממשקי API נוספים ובלוחות תוצאות עצמאיים נוספים, ואז ה-44 וה-21.9- יהפכו לבעיה של מישהו אחר לנצח. למודל בן שבעה ימים עם פרופיל מפוצל כזה, זה בערך כל מה שאפשר לבקש: יתרון agentic אמיתי, מחיר הוגן, וחולשה אחת שאתה יודע עליה לפני שאתה נרשם.
השוואות במאמר הזה1
זוהה מתוך המאמר הזה · בנצ'מרקים: Artificial Analysis · מתעדכן יומית
