כרטיס כותרת ראשי לסרטון ההסבר על השקת Ornith-1.5, עם הכותרת 'Ornith-1.5 — משקלים פתוחים, שיפור עצמי', כותרת המשנה 'משפחת מודלים שכותבת את תוכנית האימונים של עצמה — 397B MoE · 35B-A3B · 9B', ושלושה שבבי מודל שמחוברים בחץ לולאה מעגלי המרמז על מחזור שיפור עצמי, כשהלוגו של OrcaRouter משולב בפינה.
Guides & Insights

Ornith-1.5: משפחת המודלים בעלי המשקל הפתוח שכותבת לעצמה את תוכנית האימונים — וטוענת שמנצחת את Claude Opus 4.8

מחבר

Rowan Sterling

תאריך פרסום

מודלים אחרונים · 20צפו בכל המודלים
בנצ'מרקים: Artificial Analysis · מתעדכן יומית
חזרה לכל הפוסטים

Ornith-1.5, משפחת המשקלים הפתוחים של Ornith AI שטוענת שהיא מנצחת את Claude Opus 4.8 בארבעה benchmarks, שוחררה ב-19 באוגוסט 2026 — והנקודה שבאמת כדאי לעצור עליה היא לולאת האימון, לא מספר הפרמטרים. המשפחה כוללת שלושה מודלים: Ornith-1.5-397B, מודל דגל מסוג mixture-of-experts עם 397 מיליארד פרמטרים; Ornith-1.5-35B-A3B, מודל MoE בגודל 35B שמפעיל 3 מיליארד פרמטרים לכל token; ו-Ornith-1.5-9B, מודל dense בגודל 9B עם גרסה ניידת מכומתת. כל הנתונים הבולטים כאן הם מדיווח ספק: המספרים מגיעים מריצות ההערכה של Ornith AI עצמה, בממוצע על פני חמש ריצות, והעוקב היחיד מצד שלישי שיש לו פרופיל — BenchLM — מתייג את כל 18 שורות ה-benchmark שלו כמדווחות-ספק ומשאיר את המשפחה ללא דירוג עד שיהיה כיסוי בלתי תלוי. הנה מה שבאמת שוחרר, מה המשמעות האמיתית של "משפר את עצמו", ומה אפשר להריץ היום.

מה שוחרר: שלושה סולמות, רישיון MIT, ללא API

Ornith AI — הקבוצה שמאחורי Ornith-1.0 בעל המשקלים הפתוחים, ומזוהה עם עבודת DeepReinforce על מערכות מרובות-סוכנים לתכנות תחרותי (GrandCode) ועל אופטימיזציית קרנלי GPU (CUDA-L2) — פרסמה את המשפחה ב-Hugging Face תחת רישיון MIT, עם קוונטיזציות FP8, GGUF, MLX ו-NVFP4 לצד נקודות הביקורת הגולמיות. חלון הקשר של 256K (262,144 טוקנים) חל על כל המשפחה. אין API מתארח רשמי מצד החברה ואין מחיר לטוקן; זהו שחרור להרצה עצמית או לסביבה מקומית, ודוח ההשקה אומר זאת במפורש.

שלושת הסולמות מכוונים לשלוש מציאויות שונות:

• Ornith-1.5-397B — "ההצעה לחזית הפתוחה": מודל MoE בעל 397B פרמטרים המכוון לחזית הסגורה בעומסי עבודה של סוכנים וקידוד.

• Ornith-1.5-35B-A3B — מודל MoE בגודל 35B שמפעיל רק 3B פרמטרים לכל טוקן, עבור נקודת הביניים: יכולת קרובה למודל הדגל בעלות הסקה לכל טוקן שהיא שבריר מזו של מודל דחוס בגודל 35B.

• Ornith-1.5-9B — מודל 9B צפוף לשימוש מקומי ועל-גבי המכשיר, וכן גרסת Ornith-1.5-9B-Mobile עם קוונטיזציה שהיצרן אומר שמוכנה לפריסה על iPhone ואנדרואיד.

A screenshot of the Ornith AI launch page for Ornith-1.5, titled 'Ornith-1.5: From Self-Scaffolding to Self-Improvement', showing the three model scales 397b-moe, 35b-moe and 9b-dense and the opening paragraph describing the end-to-end self-improvement loop.

דף ההשקה למעלה הוא ההודעה כולה: דוח טכני יותר מאשר פוסט שיווקי, מה שעולה בקנה אחד עם הפרופיל של המעבדה.

הטענה בדבר שיפור עצמי, מפוענחת

Ornith-1.0, שיצא ביוני 2026, לימד מודל ליצור את השלד סביב משימות קוד — הרתמה, הפירוק והניצוח. Ornith-1.5 מרחיב את הלולאה הזו ליצירת המשימות עצמן. באימון, המודל עושה כעת שלושה דברים:

• הצע משימות אימון חדשות וקשות יותר.

צור את הפיגום הייעודי למשימה המשמש לפתרון והערכת המשימות הללו.

• הפק גלילי פתרונות שהופכים לסבב הנתונים הבא של האימון.

התגמול זורם דרך כל שלושת השלבים, ומותאם במשותף עם GRPO. כל משימה מוצעת מקבלת ציון על תקפות (היא חייבת להיות ניתנת לביצוע ולאימות), קושי גבולי (שיעור הצלחת הפתרון היעד נקבע על 0.2 — משימות שהמודל בדרך כלל נכשל בהן אך עדיין יכול ללמוד מהן), וחידוש (גיוון ביחס לכל מה שכבר נראה). השלד (scaffold) מקבל תגמול משלו עבור יישור (alignment), נאמנות תגמול, ועמידות בפני פריצת תגמול, והצנרת כוללת אמצעי הגנה נגד פריצות: הגבלות על נגיעה בסביבת הבדיקה, ניטור של גישה לנתיבים מוגבלים, ומודל הכרעה קפוא שמחליף תוצאות חריגות.

ההסתייגות החשובה נמצאת במילה "שיפור עצמי": היא מתארת את תהליך האימון, לא את התוצר. המודל שהורדתם אינו מאמן את עצמו מחדש על המחשב הנייד שלכם. מה שמקבלים הוא מודל שנתוני האימון שלו נוצרו, באופן חריג, על ידי גרסאות קודמות של עצמו — וזו בדיוק סוג הטענה שכדאי לבחון לפני שהיא הופכת לדוגמה.

הבנצ'מרק טוען, מתויג בכנות

כל המספרים בחלק זה הם של Ornith AI עצמה, מתוך דוח ההשקה, ממוצעים על פני חמש ריצות, ולא שוחזרו באופן בלתי תלוי. ארבעת הניצחונות הנטענים של הדגל על פני Claude Opus 4.8:

• Terminal-Bench 2.1 (Terminus-2 harness): Ornith-1.5-397B 86.1 לעומת Claude Opus 4.8 85.0

• SWE-bench Verified: 86.0 לעומת 85.8

• WideSearch: 80.8 לעומת 72.9

• BrowseComp: 86.6 לעומת 84.3

קראו את אלה כטענות ספק, לא כעובדות. מדד הדגל היחיד שבו Ornith AI לא טוען לניצחון הוא DeepSWE, 56.0 לעומת 59.0 של Claude Opus 4.8 — הדו"ח ממסגר את זה כ"שוויון", וזו הדרך הכנה לקרוא הפסד. שאר נתוני הדגל מאותו דו"ח: HLE 44.6 ללא כלים ו-56.1 עם כלים, GPQA Diamond 92.8, ו-SWE-bench Pro 65.1.

השניים הקטנים יותר חזקים גם על הנייר: Ornith-1.5-35B-A3B מדווח על SWE-bench Verified 79.0 ו-Terminal-Bench 2.1 (Claude Code harness) 68.5, בעוד Ornith-1.5-9B מדווח על SWE-bench Verified 70.6 ו-Terminal-Bench 2.1 47.0. בהשוואה למודלים אחרים עם משקלים פתוחים באותו דוח, Ornith AI משווה את ה-397B עם 86.1 Terminal-Bench / 56.0 DeepSWE לעומת DeepSeek-V4-Flash-0731 עם 82.7 / 54.4 ו-GLM-5.2 עם 81.0 / 46.2.

A single-column scoreboard for Ornith-1.5-397B listing: Size 397B MoE (open weights), Context 262K tokens, Terminal-Bench 2.1 86.1 (vendor), SWE-bench Verified 86.0 (vendor), License MIT, API none — self-hosted, with a footer noting all figures are vendor-reported and no independent scores yet exist.

לוח התוצאות העצמאי היחיד — ומדוע הוא עדיין זמני

הפרופיל של BenchLM עבור Ornith-1.5-397B הוא כרגע העמוד היחיד מצד צד שלישי על המודל. הכותרת שלו: ציון פומבי של 68.5 מתוך 100, מדורג #20 מתוך 221, עם Agentic כקטגוריה החזקה ביותר במקום #13. אבל קראו את האותיות הקטנות, כי הוא עושה עבודה אמיתית — כל 18 שורות ה-benchmark מסומנות כ"מדווח על ידי הספק", והפרופיל מציין שהמודל "עדיין אין לו מספיק כיסוי ממקורות לעמדה מאומתת." עמדה לא מדורגת ברשימה המאומתת אינה פסק דין נגד המודל; היא הצהרה שאף אחד עדיין לא הריץ אותו באופן עצמאי, וזה בדיוק מה שהייתם מצפים לו מהשקה בת ימים ספורים.

A screenshot of the BenchLM profile for Ornith-1.5-397B, showing the release date of August 18 2026, a score of 68.5 out of 100 and rank #20 of 221, with Agentic ranked #13, and a note that the profile lacks enough sourced coverage for a verified position.

זהו הפער בין שני המספרים במאמר זה: ה-86.1 של הספק ב-Terminal-Bench הוא טענה, וה-68.5 של BenchLM הוא ציון שנבנה כולו על שורות שדווחו על ידי הספק. אף אחד מהשניים אינו מדידה עצמאית. המעבדה הראשונה שתריץ את Ornith-1.5-397B באמצעות מסגרת בדיקה ציבורית — SWE-bench Verified על קבוצה מבוקרת, Terminal-Bench על גרסת מסגרת קבועה — תייצר את המספר הראשון שחשוב.

מה שאתה יכול להריץ בפועל היום

זוהי מהדורה עם משקלים פתוחים, כך ש"להריץ אותה" פירושו למשוך את המשקלים. קטלוג Ollama כבר מציג את ornith-1.5:9b (גרסה של כ-6.6 GB) ואת ornith-1.5:35b (גרסה של כ-23 GB), שתיהן עם הקשר של 256K; גרסת ה-9B כוללת גם תמיכה בקלט תמונה ברשומת הקטלוג. ה-397B הוא קטגוריה אחרת של בעיה: MoE עם 397B פרמטרים אינו מודל למחשב נייד, וכל פריסה רצינית דורשת מספר GPUs ואורכיסטרציה אמיתית.

הנקודה המתוקה המעשית עבור רוב הצוותים היא Ornith-1.5-35B-A3B: 3B פרמטרים פעילים לכל טוקן מעניקים את היכולת של MoE בשבריר מהעלות לכל טוקן של מודל dense בגודל 35B, והמבנה של Ollama ב-23 ג'יגה-בייט רץ על כרטיס יחיד עם VRAM גבוה או על אשכול קטן. ה-9B הוא זה שמתקינים על טלפון.

התכונה '3B active' היא גם הנקודה שבה כלכלת הניתוב (routing) נעשית מעניינת. מודלי MoE עם פרמטרים אקטיביים מתומחרים הרבה מתחת לגודלם הכולל, וכשספקים מאמצים מודל כזה, המחיר לטוקן נוטה לרדת מהר — וזה המצב בקנייה דרך ראוטר שמעביר את מחירי הרשימה של הספקים ב-0% סימון, במקום מספק יחיד שמנהלים איתו משא ומתן פעם אחת. OrcaRouter עושה בדיוק את זה על פני 200+ מודלים, כך שהפחתת מחיר של ספק על מודל open-weights חדש נכנסת לתוקף אצלנו באותו היום. ובשביל מודל שהושק עם שום דבר מלבד benchmarks של הספק, טיעון ה-failover הוא המשמעותי ביותר: שכבת ניתוב מאפשרת לכוון נתיב בדיקה למודל חדש לגמרי ולחזור למודל מוכח ברגע שהוא נתקע — לנסות גרסה לא מוכחת בלי להמר על נתיב ייצור עבורה.

מה עדיין חסר

• אין API מתארח. אם תרצו את Ornith-1.5 כשירות, הוא עדיין לא קיים; כל האפשרויות הן אחסון עצמי או מקומי.

• אין הערכה בלתי תלויה. BenchLM משאיר את המשפחה ללא דירוג; אף מעבדה לא פרסמה ריצה מבוקרת.

• אין תמחור שצריך להתחשב בו. אין תעריף אסימונים, כך שהמקרה של "החזית הפתוחה הזולה" הוא כולו על כלכלת ה-GPU שלך.

• התשתיות מעורבות. ל־Terminal-Bench יש מספר גרסאות, והמספרים בדוח עצמו משתרעים על פניהן: ה־86.1 של ה־397B הוא על תשתית Terminus-2, ואילו ה־68.5 של ה־35B הוא על תשתית Claude Code. תשתיות שונות הן משחקים שונים, מה שמקשה על השוואה הוגנת בין תפוחים לתפוחים יותר מכפי שטבלת הכותרת מרמזת.

מה לצפות בהמשך

הסיפור המתמשך אינו "מודל פתוח מנצח את Claude Opus 4.8" — זו טענה שלא נבדקה ובת יום. הסיפור הוא שמעבדה סגרה את הלולאה על נתוני אימון שנוצרו עצמית ופרסמה את המשקלים לבדיקה, וזה החלק שכדאי לעקוב אחריו. הדברים שיהפכו את זה מהשקה מבטיחה להשקה מהימנה: ריצה בלתי תלויה ראשונה של ה-397B על SWE-bench Verified ומסגרת Terminal-Bench מתוקנת; קוד ההערכה שיופץ בפועל; ומסלול מתארח שיהיה זמין, כך שניתן יהיה למדוד את פרופיל העלות של 35B-A3B מול הטענות שלו. אם המספרים יחזיקו מעמד, Ornith-1.5-35B-A3B הוא סיפור המחיר/ביצועים של הרבעון במשקלים פתוחים. אם לא, החלק הכנה — שיטת השיפור העצמי ומשקלי ה-MIT — שורד בכל מקרה.

השוואות במאמר הזה1

זוהה מתוך המאמר הזה · בנצ'מרקים: Artificial Analysis · מתעדכן יומית

© 2026 OrcaRouter

לספקים

מפעילים פלטפורמת הסקה (inference)? הציגו את המודלים שלכם ב-OrcaRouter.

providers@orcarouter.ai

הצטרפו לקהילה שלנו

Discordsupport@orcarouter.aiXGitHubYouTube