
Ornith-1.5: משפחת המודלים בעלי המשקל הפתוח שכותבת לעצמה את תוכנית האימונים — וטוענת שמנצחת את Claude Opus 4.8
- z-aiחדשZ.ai: GLM 5.32026-08-1860אינטליגנציה75כתיבת קוד
- obsidianחדשQwen3.8 27B Uncensored (Aggressive)2026-08-1552אינטליגנציה68כתיבת קוד
- qwenחדשQwen: Qwen3.8 27B (free)2026-08-13qwen/qwen3.8-27b-free
- deepseekחדשDeepSeek: DeepSeek V4 Pro 08132026-08-1253אינטליגנציה69כתיבת קוד
- grokחדשSpaceXAI: Grok 4.62026-08-1261אינטליגנציה77כתיבת קוד
- metaMeta: Muse Spark 1.22026-08-0557אינטליגנציה72כתיבת קוד
- qwenQwen: Qwen3.8 Max2026-08-0358אינטליגנציה72כתיבת קוד
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3152אינטליגנציה69כתיבת קוד
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 לכל 1M טוקנים
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463אינטליגנציה78כתיבת קוד
- googleGoogle: Gemini 3.6 Flash2026-07-2152אינטליגנציה69כתיבת קוד
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137אינטליגנציה49כתיבת קוד
- metaMeta: Muse Spark 1.12026-07-1653אינטליגנציה71כתיבת קוד
- kimiMoonshotAI: Kimi K32026-07-1560אינטליגנציה76כתיבת קוד
- openaiOpenAI: GPT-5.6 Luna2026-07-0952אינטליגנציה71כתיבת קוד
- openaiOpenAI: GPT-5.6 Terra2026-07-0957אינטליגנציה77כתיבת קוד
- openaiOpenAI: GPT-5.6 Sol2026-07-0961אינטליגנציה77כתיבת קוד
- grokxAI: Grok 4.52026-07-0856אינטליגנציה72כתיבת קוד
Ornith-1.5, משפחת המשקלים הפתוחים של Ornith AI שטוענת שהיא מנצחת את Claude Opus 4.8 בארבעה benchmarks, שוחררה ב-19 באוגוסט 2026 — והנקודה שבאמת כדאי לעצור עליה היא לולאת האימון, לא מספר הפרמטרים. המשפחה כוללת שלושה מודלים: Ornith-1.5-397B, מודל דגל מסוג mixture-of-experts עם 397 מיליארד פרמטרים; Ornith-1.5-35B-A3B, מודל MoE בגודל 35B שמפעיל 3 מיליארד פרמטרים לכל token; ו-Ornith-1.5-9B, מודל dense בגודל 9B עם גרסה ניידת מכומתת. כל הנתונים הבולטים כאן הם מדיווח ספק: המספרים מגיעים מריצות ההערכה של Ornith AI עצמה, בממוצע על פני חמש ריצות, והעוקב היחיד מצד שלישי שיש לו פרופיל — BenchLM — מתייג את כל 18 שורות ה-benchmark שלו כמדווחות-ספק ומשאיר את המשפחה ללא דירוג עד שיהיה כיסוי בלתי תלוי. הנה מה שבאמת שוחרר, מה המשמעות האמיתית של "משפר את עצמו", ומה אפשר להריץ היום.
מה שוחרר: שלושה סולמות, רישיון MIT, ללא API
Ornith AI — הקבוצה שמאחורי Ornith-1.0 בעל המשקלים הפתוחים, ומזוהה עם עבודת DeepReinforce על מערכות מרובות-סוכנים לתכנות תחרותי (GrandCode) ועל אופטימיזציית קרנלי GPU (CUDA-L2) — פרסמה את המשפחה ב-Hugging Face תחת רישיון MIT, עם קוונטיזציות FP8, GGUF, MLX ו-NVFP4 לצד נקודות הביקורת הגולמיות. חלון הקשר של 256K (262,144 טוקנים) חל על כל המשפחה. אין API מתארח רשמי מצד החברה ואין מחיר לטוקן; זהו שחרור להרצה עצמית או לסביבה מקומית, ודוח ההשקה אומר זאת במפורש.
שלושת הסולמות מכוונים לשלוש מציאויות שונות:
• Ornith-1.5-397B — "ההצעה לחזית הפתוחה": מודל MoE בעל 397B פרמטרים המכוון לחזית הסגורה בעומסי עבודה של סוכנים וקידוד.
• Ornith-1.5-35B-A3B — מודל MoE בגודל 35B שמפעיל רק 3B פרמטרים לכל טוקן, עבור נקודת הביניים: יכולת קרובה למודל הדגל בעלות הסקה לכל טוקן שהיא שבריר מזו של מודל דחוס בגודל 35B.
• Ornith-1.5-9B — מודל 9B צפוף לשימוש מקומי ועל-גבי המכשיר, וכן גרסת Ornith-1.5-9B-Mobile עם קוונטיזציה שהיצרן אומר שמוכנה לפריסה על iPhone ואנדרואיד.

דף ההשקה למעלה הוא ההודעה כולה: דוח טכני יותר מאשר פוסט שיווקי, מה שעולה בקנה אחד עם הפרופיל של המעבדה.
הטענה בדבר שיפור עצמי, מפוענחת
Ornith-1.0, שיצא ביוני 2026, לימד מודל ליצור את השלד סביב משימות קוד — הרתמה, הפירוק והניצוח. Ornith-1.5 מרחיב את הלולאה הזו ליצירת המשימות עצמן. באימון, המודל עושה כעת שלושה דברים:
• הצע משימות אימון חדשות וקשות יותר.
צור את הפיגום הייעודי למשימה המשמש לפתרון והערכת המשימות הללו.
• הפק גלילי פתרונות שהופכים לסבב הנתונים הבא של האימון.
התגמול זורם דרך כל שלושת השלבים, ומותאם במשותף עם GRPO. כל משימה מוצעת מקבלת ציון על תקפות (היא חייבת להיות ניתנת לביצוע ולאימות), קושי גבולי (שיעור הצלחת הפתרון היעד נקבע על 0.2 — משימות שהמודל בדרך כלל נכשל בהן אך עדיין יכול ללמוד מהן), וחידוש (גיוון ביחס לכל מה שכבר נראה). השלד (scaffold) מקבל תגמול משלו עבור יישור (alignment), נאמנות תגמול, ועמידות בפני פריצת תגמול, והצנרת כוללת אמצעי הגנה נגד פריצות: הגבלות על נגיעה בסביבת הבדיקה, ניטור של גישה לנתיבים מוגבלים, ומודל הכרעה קפוא שמחליף תוצאות חריגות.
ההסתייגות החשובה נמצאת במילה "שיפור עצמי": היא מתארת את תהליך האימון, לא את התוצר. המודל שהורדתם אינו מאמן את עצמו מחדש על המחשב הנייד שלכם. מה שמקבלים הוא מודל שנתוני האימון שלו נוצרו, באופן חריג, על ידי גרסאות קודמות של עצמו — וזו בדיוק סוג הטענה שכדאי לבחון לפני שהיא הופכת לדוגמה.
הבנצ'מרק טוען, מתויג בכנות
כל המספרים בחלק זה הם של Ornith AI עצמה, מתוך דוח ההשקה, ממוצעים על פני חמש ריצות, ולא שוחזרו באופן בלתי תלוי. ארבעת הניצחונות הנטענים של הדגל על פני Claude Opus 4.8:
• Terminal-Bench 2.1 (Terminus-2 harness): Ornith-1.5-397B 86.1 לעומת Claude Opus 4.8 85.0
• SWE-bench Verified: 86.0 לעומת 85.8
• WideSearch: 80.8 לעומת 72.9
• BrowseComp: 86.6 לעומת 84.3
קראו את אלה כטענות ספק, לא כעובדות. מדד הדגל היחיד שבו Ornith AI לא טוען לניצחון הוא DeepSWE, 56.0 לעומת 59.0 של Claude Opus 4.8 — הדו"ח ממסגר את זה כ"שוויון", וזו הדרך הכנה לקרוא הפסד. שאר נתוני הדגל מאותו דו"ח: HLE 44.6 ללא כלים ו-56.1 עם כלים, GPQA Diamond 92.8, ו-SWE-bench Pro 65.1.
השניים הקטנים יותר חזקים גם על הנייר: Ornith-1.5-35B-A3B מדווח על SWE-bench Verified 79.0 ו-Terminal-Bench 2.1 (Claude Code harness) 68.5, בעוד Ornith-1.5-9B מדווח על SWE-bench Verified 70.6 ו-Terminal-Bench 2.1 47.0. בהשוואה למודלים אחרים עם משקלים פתוחים באותו דוח, Ornith AI משווה את ה-397B עם 86.1 Terminal-Bench / 56.0 DeepSWE לעומת DeepSeek-V4-Flash-0731 עם 82.7 / 54.4 ו-GLM-5.2 עם 81.0 / 46.2.

לוח התוצאות העצמאי היחיד — ומדוע הוא עדיין זמני
הפרופיל של BenchLM עבור Ornith-1.5-397B הוא כרגע העמוד היחיד מצד צד שלישי על המודל. הכותרת שלו: ציון פומבי של 68.5 מתוך 100, מדורג #20 מתוך 221, עם Agentic כקטגוריה החזקה ביותר במקום #13. אבל קראו את האותיות הקטנות, כי הוא עושה עבודה אמיתית — כל 18 שורות ה-benchmark מסומנות כ"מדווח על ידי הספק", והפרופיל מציין שהמודל "עדיין אין לו מספיק כיסוי ממקורות לעמדה מאומתת." עמדה לא מדורגת ברשימה המאומתת אינה פסק דין נגד המודל; היא הצהרה שאף אחד עדיין לא הריץ אותו באופן עצמאי, וזה בדיוק מה שהייתם מצפים לו מהשקה בת ימים ספורים.

זהו הפער בין שני המספרים במאמר זה: ה-86.1 של הספק ב-Terminal-Bench הוא טענה, וה-68.5 של BenchLM הוא ציון שנבנה כולו על שורות שדווחו על ידי הספק. אף אחד מהשניים אינו מדידה עצמאית. המעבדה הראשונה שתריץ את Ornith-1.5-397B באמצעות מסגרת בדיקה ציבורית — SWE-bench Verified על קבוצה מבוקרת, Terminal-Bench על גרסת מסגרת קבועה — תייצר את המספר הראשון שחשוב.
מה שאתה יכול להריץ בפועל היום
זוהי מהדורה עם משקלים פתוחים, כך ש"להריץ אותה" פירושו למשוך את המשקלים. קטלוג Ollama כבר מציג את ornith-1.5:9b (גרסה של כ-6.6 GB) ואת ornith-1.5:35b (גרסה של כ-23 GB), שתיהן עם הקשר של 256K; גרסת ה-9B כוללת גם תמיכה בקלט תמונה ברשומת הקטלוג. ה-397B הוא קטגוריה אחרת של בעיה: MoE עם 397B פרמטרים אינו מודל למחשב נייד, וכל פריסה רצינית דורשת מספר GPUs ואורכיסטרציה אמיתית.
הנקודה המתוקה המעשית עבור רוב הצוותים היא Ornith-1.5-35B-A3B: 3B פרמטרים פעילים לכל טוקן מעניקים את היכולת של MoE בשבריר מהעלות לכל טוקן של מודל dense בגודל 35B, והמבנה של Ollama ב-23 ג'יגה-בייט רץ על כרטיס יחיד עם VRAM גבוה או על אשכול קטן. ה-9B הוא זה שמתקינים על טלפון.
התכונה '3B active' היא גם הנקודה שבה כלכלת הניתוב (routing) נעשית מעניינת. מודלי MoE עם פרמטרים אקטיביים מתומחרים הרבה מתחת לגודלם הכולל, וכשספקים מאמצים מודל כזה, המחיר לטוקן נוטה לרדת מהר — וזה המצב בקנייה דרך ראוטר שמעביר את מחירי הרשימה של הספקים ב-0% סימון, במקום מספק יחיד שמנהלים איתו משא ומתן פעם אחת. OrcaRouter עושה בדיוק את זה על פני 200+ מודלים, כך שהפחתת מחיר של ספק על מודל open-weights חדש נכנסת לתוקף אצלנו באותו היום. ובשביל מודל שהושק עם שום דבר מלבד benchmarks של הספק, טיעון ה-failover הוא המשמעותי ביותר: שכבת ניתוב מאפשרת לכוון נתיב בדיקה למודל חדש לגמרי ולחזור למודל מוכח ברגע שהוא נתקע — לנסות גרסה לא מוכחת בלי להמר על נתיב ייצור עבורה.
מה עדיין חסר
• אין API מתארח. אם תרצו את Ornith-1.5 כשירות, הוא עדיין לא קיים; כל האפשרויות הן אחסון עצמי או מקומי.
• אין הערכה בלתי תלויה. BenchLM משאיר את המשפחה ללא דירוג; אף מעבדה לא פרסמה ריצה מבוקרת.
• אין תמחור שצריך להתחשב בו. אין תעריף אסימונים, כך שהמקרה של "החזית הפתוחה הזולה" הוא כולו על כלכלת ה-GPU שלך.
• התשתיות מעורבות. ל־Terminal-Bench יש מספר גרסאות, והמספרים בדוח עצמו משתרעים על פניהן: ה־86.1 של ה־397B הוא על תשתית Terminus-2, ואילו ה־68.5 של ה־35B הוא על תשתית Claude Code. תשתיות שונות הן משחקים שונים, מה שמקשה על השוואה הוגנת בין תפוחים לתפוחים יותר מכפי שטבלת הכותרת מרמזת.
מה לצפות בהמשך
הסיפור המתמשך אינו "מודל פתוח מנצח את Claude Opus 4.8" — זו טענה שלא נבדקה ובת יום. הסיפור הוא שמעבדה סגרה את הלולאה על נתוני אימון שנוצרו עצמית ופרסמה את המשקלים לבדיקה, וזה החלק שכדאי לעקוב אחריו. הדברים שיהפכו את זה מהשקה מבטיחה להשקה מהימנה: ריצה בלתי תלויה ראשונה של ה-397B על SWE-bench Verified ומסגרת Terminal-Bench מתוקנת; קוד ההערכה שיופץ בפועל; ומסלול מתארח שיהיה זמין, כך שניתן יהיה למדוד את פרופיל העלות של 35B-A3B מול הטענות שלו. אם המספרים יחזיקו מעמד, Ornith-1.5-35B-A3B הוא סיפור המחיר/ביצועים של הרבעון במשקלים פתוחים. אם לא, החלק הכנה — שיטת השיפור העצמי ומשקלי ה-MIT — שורד בכל מקרה.
השוואות במאמר הזה1
זוהה מתוך המאמר הזה · בנצ'מרקים: Artificial Analysis · מתעדכן יומית
