
Ox Alpha נחשף: Z.AI משחררת אותו במשקל פתוח בשם GLM-5.3-Flash
- openaiחדשOpenAI: GPT-6.1 Sol2026-09-2952אינטליגנציה
- anthropicחדשAnthropic: Claude Sonnet 5.52026-09-2856אינטליגנציה
- typesafeחדשTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 לכל 1M טוקנים · 144 tok/s
- OpenAIחדשOpenAI: GPT-6 Luna2026-09-2238אינטליגנציה
- OpenAIחדשOpenAI: GPT-6 Sol2026-09-2248אינטליגנציה
- AnthropicחדשAnthropic: Claude Opus 5.52026-09-2258אינטליגנציה
- xAIחדשGrok 4.72026-09-2146אינטליגנציה
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 לכל 1M טוקנים · 126 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 לכל 1M טוקנים · 933 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040אינטליגנציה
- OpenAIOpenAI: GPT-6 Astra2026-09-0453אינטליגנציה77כתיבת קוד
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241אינטליגנציה76כתיבת קוד
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245אינטליגנציה76כתיבת קוד
- AnthropicAnthropic: Claude Fable 5.12026-09-0153אינטליגנציה82כתיבת קוד
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 לכל 1M טוקנים · 50 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 לכל 1M טוקנים · 106 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642אינטליגנציה72כתיבת קוד
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 לכל 1M טוקנים · 217 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845אינטליגנציה75כתיבת קוד
- obsidianQwen3.8 27B2026-08-1534אינטליגנציה68כתיבת קוד
בערב יום רביעי, 26 באוגוסט, הסתיימה התעלומה בדיוק כפי שהפורנזיקה ניבאה. Z.AI — המעבדה הבייג'ינגית שמאחורי סדרת GLM — שחררה את המודל שבחנה במסווה כמוצר במשקלים פתוחים, תחת השם GLM-5.3-Flash, בדיוק שם המשנה שאליו התכנסו ניתוח הטוקנייזר הפורנזי ושווקי החיזוי. Ox Alpha, המודל האנונימי שמוביל את טבלאות השימוש מאז שהופיע ב-20 באוגוסט, הוא כעת מודל שפורסם וניתן לאירוח עצמי: רישיון MIT, 320B פרמטרים בסך הכל עם 18B פעילים לטוקן, חלון הקשר של 1,048,576 טוקנים וקלט טקסט/תמונה/וידאו כפי שפורסם ברשימה, והמשקלים ב-Hugging Face. החשיפה גם ענתה על החידה הגדולה ביותר של השבוע האנונימי — איך מודל שאיש לא החזיק בו יכול להזיז 100 טריליון טוקנים ביום: Z.AI אומרת שהשרתים רצו לחלוטין על כ-100,000 שבבי AI סיניים מקומיים, הפעם הראשונה שסיליקון סיני נשא תעבורה גלובלית בקנה מידה פורץ דרך. הקיבולת הזו גם הולידה את הניחוש השגוי הפופולרי ביותר של השבוע — בקנה מידה כזה, משקיפים רבים, שהועודדו על ידי פוסטים מסתוריים של חוקרי Google DeepMind, טענו ש-Ox Alpha חייב להיות Gemini שרץ על חומרה של NVIDIA; החשיפה תיקנה גם את זה. באותו ערב, Alibaba שלחה Qwen3.8-Flash-Next, תצוגה מקדימה במשקלים פתוחים של ארכיטקטורת Qwen4 — ערב אחד, שני שחרורים במשקלים פתוחים ברמה פורצת דרך ממעבדות סיניות. ארבעת השחרורים האנונימיים שקדמו ל-Ox Alpha נתבעו בסופו של דבר על ידי מעבדות סיניות: של Zhipu AI GLM-5, של Xiaomi MiMo-V2-Pro, של Ant Group Lingxi Ling-2.6-flash, ושל Meituan LongCat-2.0. Ox Alpha אינו עוד ניסוי בלעדי לפלטפורמה; הוא מודל שמפתחים יכולים לארח בעצמם.
כל נתון במאמר זה הוא טענה עצמית של המפעיל, נתון מרישום הפלטפורמה עצמה, הודעה ציבורית, או טביעת אצבע קהילתית. מספרי ה-DeepSWE הם מדידות קהילתיות של החוקר העצמאי בן דייוויס — ריצה מלאה של 113 משימות, לא ערך רשמי בלוח תוצאות, אם כי נתון ה-~63% תואם כעת בקירוב לציון 63.4 ש-Z.AI עצמה דיווחה כספקית עבור DeepSWE v1.1. שאלת הזהות סגורה: ב-26 באוגוסט Z.AI שחררה את Ox Alpha כמודל במשקלים פתוחים תחת השם GLM-5.3-Flash — רישיון MIT, 320B פרמטרים סה"כ עם 18B פעילים — ובכך אושש שם-המשנה שאליו התכנסו ניתוחי הטוקנייזר ומקודד הווידאו. הארכיטקטורה, מספר הפרמטרים והתמחור הם כעת פרסומים רשמיים של החברה; מה שנותר מוצהר על ידי הספק ולא אומת באופן בלתי תלוי הוא מערך אמות המידה והטענה של Z.AI שהשרתים בשבוע האנונימי רצו על כ-100,000 שבבי AI סיניים מקומיים בעלות לכל טוקן המשתווה לחומרת NVIDIA המיינסטרימית — טענה חברתית שכלי תקשורת רבים חזרו עליה, אך אינה נתון מבוקר. השערת ה-Gemini המוקדמת — שאותה הולידה הקיבולת של 100T טוקנים ליום ועודדו פוסטים מסתוריים של חוקרי Google DeepMind — הייתה שגויה, והשחרור יישב את העניין. דירוג האיכות שיוחס לאנליסט teortaxesTex — והצעתו ש-Ox Alpha שעבר אימון נוסף יכול להיות סוס העבודה ל-GLM 5.5 חזק יותר — הוא הערכה אישית של אותו אנליסט מתוך פוסט חברתי, לא מדידה בלתי תלויה ולא הצהרה של Zhipu. הדגמת האנימציה החוזרת המתוארת להלן היא אף היא דיווח קהילתי — פוסט של מפתח ב-X, שהודהד בפורומים סיניים למפתחים — לא טענת יכולת של הספק, והמפעיל לא הכריז על תכונה כזו.
מה שאנחנו יודעים — ומה שלא
הגרסה המהירה:
המפעיל מתאר את Ox Alpha כ"מודל חזיתי שנבנה לקידוד יעיל, עבודה סוכנותית מתמשכת, ושימוש בייצור בעולם האמיתי" — מודל חשיבה שנועד להנדסת תוכנה ארוכת טווח ולזרימות עבודה המשלבות טקסט עם הקשר ויזואלי.
• יש לו חלון הקשר של 1,048,576 טוקנים (1M), מגבלת פלט של 131,072 טוקנים, והוא מקבל קלט טקסט, תמונה וווידאו — הראשון מבין המהדורות האנונימיות שמפרסם קלט וידאו, ויכולת שמהדורת GLM-5.3-Flash מאשרת כמובנית ולא כתוספת חיצונית.
• זה היה חינם למשך שבוע אחד: $0 למיליון טוקנים פנימה והחוצה, כשהמפעיל טוען ל"מגבלות קצב נדיבות, שימוש כמעט בלתי מוגבל" ול-100 טריליון טוקנים ליום של קיבולת שירות — קיבולת שלפי החשיפה המאוחרת יותר, סופקה על ידי כ-100,000 שבבים סיניים מקומיים.
• אושר: ב-26 באוגוסט Z.AI שחררה את Ox Alpha כמודל במשקלים פתוחים תחת השם GLM-5.3-Flash — רישיון MIT, 320B פרמטרים סה"כ עם 18B פעילים — בדיוק הדבר אליו התכנסו הטוקנייזר של תת-השם, מקודד הווידאו, בדיקות קודי השגיאה ושווקי התחזיות. האנליסט העצמאי teortaxesTex מדרג אותו בערך ברמה של GLM-5.3, מלבד הוויז'ן, ומציע ש-Ox Alpha שאומן נוסף יכול להיות כוח העבודה מאחורי GLM 5.5 חזק בהרבה.
• לקריאה הפלאש-מולטימודלית יש כעת הדגמה מאחוריה: כשהתבקש ליצור אנימציית לולאה של שקנאי שרוכב על אופניים ופותח טלפון שמנגן את אותה אנימציה, Ox Alpha השיב עם אנימציית לולאה עצמאית כקובץ HTML/SVG יחיד — הדגמה קהילתית, לא טענה של ספק.
• נתוני פעילות מוקדמים בפלטפורמה כבר מראים תעבורת ייצור אמיתית, כולל סוכן קוד מ-Nous Research ועורך Zed.
• החברה כבר השיקה אותו — ב-26 באוגוסט Z.AI שחררה את Ox Alpha בתור GLM-5.3-Flash במשקולות פתוחות תחת רישיון MIT, ובכך סיימה בבת אחת את שאלות הזהות, המפרט והמחיר: 320B פרמטרים בסך הכול עם 18B פעילים, מולטימודאלי באופן מובנה, עם מחיר מחירון של Z.AI של $0.15 לקלט / $0.50 לפלט למיליון טוקנים, ומבצע השקה של 50% שנאמר כי יחול רק עד 9 בספטמבר — תאריך שעברו מאז שמונה ימים, כשהתעריף המוזל הוא עדיין זה שמוגש. Z.AI גם חשפה ששירות השבוע האנונימי של 100T טוקנים ליום פעל על כ-100,000 שבבים סיניים מקומיים, לראשונה בקנה מידה כזה. מה שהחשיפה לא כללה הוא מבחן ביצועים בלתי תלוי — כרטיס הניקוד של המודל מדווח על ידי הספק — ולכן המספר העצמאי המייצג ביותר נותר ההרצה המלאה של Ben Davis בת 113 משימות ב-DeepSWE, בסביבות 63%, בדומה ל-GPT-5.6 Sol mid.
מה זה Ox Alpha
תיאור הפלטפורמה מציג את Ox Alpha כ"מודל חשיבה שנועד לקידוד, עבודה סוכנית מתמשכת, ועומסי ייצור — הנדסת תוכנה לטווח ארוך, חשיבה מורכבת, ותהליכי עבודה המשלבים טקסט עם הקשר חזותי." זהו מיצוב ספציפי: הוא בנוי ללולאות סוכן ארוכות טווח ולקוד, לא לצ'אט כללי. הקונטקסט של 1M הוא האינדיקטור הבולט — זהו מרחב מספיק לסשן סוכן רב-שעתי או למאגר קוד גדול — ומגבלת הפלט של 131K מאפשרת יצירת רצפים ארוכים בודדים. הוא תומך בקריאה לפונקציות וכלים, ובפלט JSON מובנה, שזה שאר הרשימה הסוכנית.

קלט הווידאו הוא הפריט הבולט ביותר בגיליון. אף אחד מהמודלים האנונימיים המוקדמים יותר לא פרסם אותו, ומודל שיכול לקלוט פריימי וידאו לצד טקסט ותמונות מכוון לסוג אחר של עומסי עבודה מאשר המהדורות שכווננו לצ'אט וקדמו לו. הוא גם, כפי שהבדיקות הפורנזיות יראו מאוחר יותר, אחד מסימני הזהות החזקים ביותר שמודל יכול לשאת. כל זה — התיאור, המפרטים, נתוני המהירות — הגיע מהמפעיל ומהרישום בפלטפורמה. מהדורת GLM-5.3-Flash אישרה את מפרטי הכותרת (320B-A18B, רב-מודאלי מובנה); נתוני המהירות והקיבולת נותרו טענות ספק.
הסיפור המולטימודלי קיבל השבוע הדגמה קונקרטית. המפתח Chetaslua — שבדיקות צד-השרת שלו הן חלק משרשרת טביעות האצבע — פרסם בדיקה שבה ביקש מ-Ox Alpha ליצור לולאה של שקנאי רוכב על אופניים ופותח טלפון שמנגן את אותה אנימציה בחזרה: לולאה רפרנסיבית בתוך הלולאה. לפי הדיווח שלו, המודל סיפק אנימציית HTML/SVG בקובץ יחיד — שקנאי עם רגליים דו-מקטעיות שבאמת מדוושות, מהירות גלגלים מסונכרנת למהירות הקרקע, רקע פרלקס, והשיא של הטלפון בתוך הלולאה. פורומים של מפתחים בסין הריצו בנפרד הנחיות דומות עם שקנאי על אופניים ודנו בתוצאה, כך שההדגמה אינה טענה בלתי-ניתנת לאימות. כיוון שהפלט הוא קוד, הדבר עקבי עם המפרט של הפלטפורמה לפלט-טקסט-בלבד: הבנה מולטימודלית ויצירת קוד יצירתית שעובדות יחד, לא סינתזת וידאו מקורית. המסקנה של Chetaslua — שזו התוצאה של מולטימודליות, ומודל קוד-פתוח מסוגל יגיע עם זה — היא תחזית אישית שלו, לא הצהרה של ספק; המפעיל לא הכריז על דבר.
המבצע החינמי לשבוע
הקידום היה אגרסיבי. חינם למשך השבוע שבו פעל, "מגבלות קצב נדיבות, שימוש כמעט בלתי מוגבל," ויכולת מוצהרת של 100 טריליון אסימונים ביום, עם הערת המפעיל שהזמינה משתמשים "לראות מה אתם יכולים לעשות." אם לוקחים זאת מילולית, 100T אסימונים ביום היו מציבים את המפעיל הזה בין ספקי הה�קה הגדולים ביותר בעולם — הקביעה נשמעת פחות כמו מפרט ויותר כמו אתגר מבחן-מאמץ, וזה מתאים לדפוס: מהדורות אנונימיות הן הדרך שבה מעבדה מקבלת תעבורה אמיתית בקנה מידה של חזית המחקר מבלי לשים את שמה על הדלת. האישור הפך את טענת קנה המידה לקונקרטית ולא רק לקלה יותר ליישוב: Z.AI חשפה שמערך השרתים שסיפק 100T אסימונים ליום רץ על כ-100,000 שבבי בינה מלאכותית סיניים מקומיים — הפעם הראשונה שמהדורה ברמת חזית מוגשת בקנה מידה כזה ללא חומרה של NVIDIA. החשיפה הזו עדיין טענה של החברה, שחזרו עליה כעת כלי תקשורת מרובים אך לא בוקרה באופן בלתי תלוי, והיא נושאת עמה קביעת ספק שנייה ורכה יותר: Z.AI אומרת שהעלות לאסימון באשכול המקומי דומה ל-GPU המיינסטרים של NVIDIA.
הצד האחר של "חינם לשבוע" היה שהמחיר שבא אחריו לא היה ידוע — החשיפה ענתה על כך. מחיר המחירון המפורסם של Z.AI עבור GLM-5.3-Flash הוא $0.15 למיליון טוקני קלט, $0.50 למיליון טוקני פלט, ו-$0.03 למיליון קלט במטמון. מבצע השקה של 50% הנחה נאמר שיתקיים עד 9 בספטמבר 2026, והוריד זאת ל-$0.075 / $0.25. שמונה ימים אחרי אותו תאריך, התעריף המוזל הוא עדיין התעריף שנגבה: בקריאה חוזרת ב-17 בספטמבר 2026, עמוד המודל z-ai/glm-5.3-flash מתמחר קלט ב-$0.075, פלט ב-$0.25, וקריאות מטמון ב-$0.0173 למיליון טוקנים, ללא תווית מבצעית עליו. לעומת מחיר המחירון של GLM-5.3, $1.40 / $4.40, מדובר בכחלק עשרים. ההשלכה המעשית היא שתאריך הסיום 9 בספטמבר מיושן ולא מחייב — מפתח שמתקצב לפי $0.15 / $0.50 מתקצב לפי נתון שאיש לא מחויב בו כיום. מה שעמודי התמחור אינם מיישבים הוא מדוע. רשימת המודלים של Z.AI עצמה עדיין מציגה $0.15 / $0.50 עבור GLM-5.3-Flash, ולכן אם המבצע הוארך, הפך לקבוע, או פשוט הושאר פועל — אין לנו מקור לכך; התעריף המוזל הוא העובדה הנצפית בתאריך זה, והסיבה נותרת פתוחה.
הבנצ'מרק המלא הראשון — והוא נוחת ברמה של GPT-5.6 Sol mid
לאוקס אלפא (Ox Alpha) עדיין אין רישום במעקבים עצמאיים כמו Artificial Analysis או LMArena — המילה "frontier" היא של המפעיל עצמו, ונתוני אמות המידה שזי.איי (Z.AI) פרסמה עם השקת GLM-5.3-Flash (DeepSWE v1.1 63.4, AutomationBench 48.8, מדד אינטליגנציה של Artificial Analysis של 57) הם מדווחי ספק, לא ציונים עצמאיים. מה שהשתנה מאז ההשקה הוא שמספרים שנמדדו על ידי הקהילה מתחילים להסתובב — והתמונה הצטמצמה. ב-Kingbench, ריצות מוקדמות הציבו את Ox Alpha על 87.5, ממש מתחת ל-91.25 של GLM-5.3. ב-DeepSWE, החוקר העצמאי בן דייוויס הריץ תחילה תת-קבוצה של 10 משימות ודיווח על 80% Pass@1, לפני Claude Fable 5 (65%), GLM-5.3 ו-Grok 4.6 (62%), ו-GPT-5.6 Sol (52%). מאז הוא השלים ריצה מלאה מול כל מערך ה-DeepSWE בן 113 המשימות, והתוצאה המתוקנת היא בערך 63% — פחות או יותר בשורה אחת עם GPT-5.6 Sol mid. תת-הקבוצה של 80% הייתה המספר שתפס את העין, אבל עשר משימות הן פחות מ-9% מהמדד; דייוויס עצמו סימן את נתון הריצה המלאה כזה ש"הרבה יותר הגיוני". אלה נתונים שנמדדו על ידי הקהילה, לא אמת מידה של ספק ולא תוצאה רשמית של לוח תוצאות — אבל הריצה המלאה היא המספר המייצג ביותר שמישהו השיג מהמודל, והוא עכשיו מתיישר מקרוב עם הציון של Z.AI עצמה, DeepSWE v1.1, 63.4, מדווח ספק — בדיקה צולבת שימושית, אף שמספר החברה הוא טענה ולא מדידה.
השוואה אחת חשובה יותר עכשיו מאשר בעת ההשקה. DeepSeek V4 Pro 0813 — מבנה ה-GA של דגל DeepSeek שיצא ב-13 באוגוסט — מדווח על DeepSWE של 62.7 בכרטיס הביצועים של DeepSeek עצמו, לעומת 12.8 עבור ה-DeepSeek V4 Pro Preview המוקדם יותר. שני הנתונים הם דיווח של הספק, שלא שוכפלו על ידי מעבדה עצמאית נכון לכתיבת שורות אלה. בקריאה לצד ריצת הקהילה המלאה של GLM-5.3-Flash שעמדה על כ-63% ולצד DeepSWE v1.1 של Z.AI עצמו שעומד על 63.4, ה-62.7 של DeepSeek מציב את שתי הטענות הסיניות המוכרות ביותר בנושא סוכני קוד באותה רצועה של שנות ה-60 הנמוכות. הפער של עשר הנקודות שנראה כמו כרטיס הביקור של Ox Alpha נמדד מול DeepSeek V4 Flash 0731, המודל הקטן והזול יותר; מול דגל הדגל של DeepSeek, GLM-5.3-Flash נוחת בשוויון, לא ביתרון של עשר נקודות.
הלקח הנוסף נוגע למספר עצמו. האנליסט teortaxesTex — שעוקב אחר ההערכות האלה מאז השבוע האנונימי — מציין שגם הדיווח הראשון על Ox Alpha נתן 80% DeepSWE: זו הייתה קבוצת המשנה של Davis שכללה 10 משימות ובלטה לעין, והתוצאה הסופית על מכלול 113 המשימות הייתה 63%. כשה-62.7 הרשמי של DeepSeek V4 Pro 0813 נמצא באותו טווח, ההבחנה שלו היא ששום דבר עדיין לא התקרב ל-80% ששוחזר בצורה לגיטימית — נתון ה-80% ממשיך להופיע מוקדם בחייו הציבוריים של מודל, וממשיך להתייצב בשנות ה-60 הנמוכות ברגע שמריצים את המכלול המלא. זוהי הקריאה האנליטית שלו, לא מדידה, אבל זו העדשה הנכונה שדרכה יש לראות את הכותרת הבאה של DeepSWE, כולל כל כותרת על GLM-5.3-Flash עצמו.

מה שקיים גם כן הוא שימוש. נתוני הפעילות של הפלטפורמה מראים תעבורת ייצור אמיתית בתוך השעות הראשונות — כולל Hermes Agent, פרויקט הקידוד האג'נטיק של Nous Research, ועורך Zed. שניהם בדיוק מקרי השימוש — "עבודה וקידוד אג'נטיים מתמשכים" — שהמודל ממוצב עבורם. זה לא ציון, אבל זה אות: מפתחים עם עומסי עבודה אמיתיים החליטו שהימור חינמי, אנונימי ומרמת קצה היה שווה להתחבר אליו. לפני שהריצת DeepSWE המלאה הגיעה, האימוץ המוקדם הזה היה הראיה היחידה שהייתה; נתון ה-~63% על הסט המלא נותן כעת למודל עוגן מדד לשקול מולו.
האותיות הקטנות של שמירת הנתונים
ההכרזה על השבוע החינמי מתהדרת ב{{1}}"אפס שמירת נתונים."{{/1}} הרישום של המודל בפלטפורמה מציג תמונה מדויקת יותר: פרומפטים ותשובות נשמרים אצל הספק, אך אינם משמשים לאימון, במסגרת תנאי המודל הסמוי של הפלטפורמה. ההבדל חשוב אם אתם עומדים להדביק קוד קנייני לתוך חלון של מיליון טוקנים שבבעלות ספק שהיה אנונימי עד ש-Z.AI חשפה את עצמה ב-26 באוגוסט. התייחסו אל {{2}}"אפס שמירת נתונים"{{/2}} כאל שיווק עד ש-Z.AI תפרסם תנאים שיגידו זאת במפורש — ונתבו כל דבר שאינכם רוצים שיירשם דרך מודל נפרד וניתן לזיהוי.
ספר המשחקים של המודל האנונימי
Ox Alpha הוא הפרסום האנונימי החמישי בשישה חודשים, וארבעת הקודמים נפתרו באותה צורה — הופעת בכורה אנונימית, פרץ של תנועה חינמית, ואז חברה שצועדת קדימה:
• Pony Alpha (פברואר 2026) — אושר על ידי Zhipu AI כחמישה ימים לאחר ההשקה כ-GLM-5, דגם הדגל מסוג MoE עם 744B פרמטרים.
• Hunter Alpha (11 במרץ) — מודל חינמי עם טריליון פרמטרים ועם קונטקסט של 1M, שהפך לסיפור ההשערות של האביב, שרבים ניחשו שהוא DeepSeek V4; נחשף כ-MiMo-V2-Pro של שיאומי, כשבן הלוויה Healer Alpha זוהה כ-MiMo-V2-Omni.
Elephant Alpha (אפריל) — מודל טקסט חינמי המתמקד ביעילות, שחברת Ant Group טענה שהוא Lingxi Ling-2.6-flash כשבועיים לאחר שהופיע.
• Owl Alpha (סוף אפריל) — מודל ממוקד-סוכן עם קריאת כלים מובנית והקשר של ~1M שמייטואן אישרה כ-LongCat-2.0 ב-30 ביוני, מודל הטריליון-פרמטרים הראשון שאומן והוגש כולו על שבבים סיניים מקומיים.
• Ox Alpha (20 באוגוסט) — נחשף ב-26 באוגוסט כ-GLM-5.3-Flash, מודל בעל משקל פתוח, ברישיון MIT, בגודל 320B-A18B; הזהות, הרישיון והמפרטים היו רשמיים באותו היום שבו הוסרה המסכה.

למה להשיק מודל טוב מאחורי מסכה? הקריאה הסטנדרטית, {{1}}שמחזור Hunter Alpha הפך אותה לקונקרטית,{{/1}} היא שאנונימיות מסירה הטיית מותג מהערכות, {{2}}והשימוש החופשי מייצר נתוני הערכה מעולם אמיתי בהיקף חזיתי{{/2}} בזמן שכולם מתווכחים על הבעלות. {{3}}כפי שניסח זאת ניתוח אחד של הדפוס, "היעדר מותג הוא השיווק."{{/3}} {{4}}הרווח הנוסף הוא מהירות:{{/4}} מודל אנונימי יכול להגיע לקהל מפתחים גלובלי תוך שעות ללא אירוע השקה, {{5}}והמסתורין עצמו הופך להפצה.{{/5}}
מי הוא Ox Alpha?
עד להשקה ב-26 באוגוסט, אף חברה לא טענה לבעלות עליו ו-Zhipu AI לא אמרה דבר — אבל מצב הראיות המוצקות השתנה תוך 48 שעות מהופעת המודל, והניתוח הפורנזי שלהלן הוא הסיבה לכך שהחשיפה — כ-GLM-5.3-Flash — התקבלה בהפתעה כה מועטה. נתון הקיבולת פעל זמנית נגד הניתוח הפורנזי: 100 טריליון טוקנים ביום נראו כמו חתימתה של מעבדה מהשורה הראשונה על שבבי NVIDIA, והתאוריה שאוקס אלפא הוא Gemini חדש — שעודדו פוסטים מסתוריים של חוקרי Google DeepMind — זכתה לתנופה אמיתית עד שראיות הטוקנייזר, ולאחר מכן השחרור של Z.AI עצמה, סגרו את העניין. האות החזק ביותר הוא הטוקנייזר. כלי לזיהוי טביעת אמירה שנבנה על ידי הקהילה, modelprint, הריץ תשע בדיקות תשתית מול Ox Alpha ומצא שהוא תואם ל-GLM-5.3 של Z.ai בשש מהן, כאשר כל ארבעת ספירות הטוקנים המנורמלות תואמות למשפחת GLM, בעוד שהמועמד הטוב ביותר שאינו GLM השיג שתיים מתוך ארבע. החוקר העצמאי בן דייוויס דיווח שספירות הטוקנים של Ox Alpha תאמו בדיוק את GLM-5.3 על פני 25 הנחיות בדיקה, כשההבדל היחיד היה תוספת קבועה של 75+ טוקנים שהוא ייחס למעטפת נסתרת. התאמת הטוקנייזר היא אות הזהות הקשה ביותר לזיוף — מודל אינו יכול לשנות את האופן שבו הוא מפצל טקסט ללא אימון מחדש.
נתיב הווידאו הוא החתימה השנייה. {{1}}צריכת הטוקנים של Ox Alpha תאמה בדיוק את זו של GLM-5V-Turbo בארבע דגימות מבוקרות — אותם מנגנוני דגימת פריימים, התאמת משך זמן, ורזולוציה — בעוד MiMo v2.5, Qwen 3.8 Max, ו-GLM-4.6V כולם סטו.{{/1}} זהו סימן חזק: טיפול בווידאו מוטמע עמוק במודל, לא תוסף חיצוני. {{2}}שאר מערך טביעות האצבע מתיישר עם אותה קריאה:{{/2}} {{3}}Ox Alpha דוחה קלט אודיו כמו ש-GLM-5V עושה,{{/3}} {{4}}חולק את קוד השגיאה האופייני "1301" של GLM,{{/4}} {{5}}פולט סגנון פלט דומה (כ-1.3 אימוג'ים לכל 1,000 תווים),{{/5}} {{6}}נושא את אותה תצורת פרמטרים ו-API מוגבלת שהופיעה ברישום GLM-5.3 בפלטפורמה יומיים לפני השקת Ox Alpha,{{/6}} {{7}}ויש לו חתך ידע קרוב לנובמבר 2025.{{/7}}
לזיהוי הזה יש תקדים בספר המשחקים של Zhipu: Pony Alpha, השחרור האנונימי מפברואר, התברר כ־GLM-5, טענה שהושמעה כחמישה ימים לאחר ההשקה. פרשנות האנליסטים שנפוצה השבוע — ש־Ox Alpha הוא GLM-5.3, ככל הנראה דגם ה־Flash — זכתה להד אצל Pliny the Liberator, שאמר שהסוכן שלו אישר כי "Ox-alpha הוא מ־Zai, ממשפחת GLM-5.X". האנליסט העצמאי teortaxesTex קובע אותו דבר לגבי האיכות ומוסיף טענת תזמון: הוא מדרג את Ox Alpha ברמה של בערך GLM-5.3, מלבד יכולות הראייה, ומוצא שהביצוע המהיר הוא החלק הבולט ביותר — דחיסת ה־GLM-5.3 שמוגבל לטקסט בלבד ושחרורו עם ראייה מתפקדת בתוך ימים מההשקה ב־14 באוגוסט. זו הערכה של אנליסט אחד, לא ציון עצמאי, והוא טוען שהיא אמורה לעורר הרהור בנוגע לנרטיב של "סין משחררת דגמים ישר מהתנור". הפוסט החדש שלו מוסיף שכבה של ניחוש מפת דרכים על הפרשנות הזאת: מחזור העדכונים של GLM-5 עשוי להיות קצר; Ox Alpha קרוב מספיק ל־GLM-5.3 עד שכמעט אין טעם להשתמש בו כתת־סוכן — "פשוט תריץ ox @4 במקום" הוא הקיצור שלו להרצת הדגם ישירות; ו־Ox Alpha שעבר אימון נוסף היה הגיוני מאוד כסוס העבודה, במילתו "בהמת משא", עבור GLM 5.5 חזק בהרבה. זו ספקולציה של אנליסט אחד על מפת דרכים, לא הצהרה של Zhipu. שאלת שם המשנה, לעומת זאת, הוכרעה: ב־26 באוגוסט Z.AI שחררה את Ox Alpha בשם GLM-5.3-Flash. הסיבוך שבעבר הותיר את תווית ה־Flash בצד ה"משוער" — GLM-5.3 הושק ב־14 באוגוסט כדגם טקסט בלבד, בעוד Ox Alpha מציע קלט וידאו — הוא בדיוק מה שהשחרור פתר: GLM-5.3-Flash הוא דגם מולטימודלי ייחודי מטבעו, ולא אותו דגם טקסט־בלבד. תיאוריות חלופיות — צוות MiMo של שיאומי, DeepSeek — הועלו ונדחו ברובן על סמך עדויות הטוקנייזר והווידאו, והשחרור פותר את שאלת המשפחה באופן מוחלט.הטיעון של דייוויס לכך שחשוב לשים לב לתווית ה־Flash התברר כמעשי: כיוון ש־Ox Alpha אכן הוא GLM-5.3-Flash שמתפקד ברמת הביניים של GPT-5.6 Sol, אפשר עכשיו להריץ אותו מקומית — המשקולות זמינות ב־Hugging Face, ו־SGLang, vLLM ו־TokenSpeed משרתים אותו — מה שהופך דגם קוד חזיתי מרמת הביניים לעלות חומרה חד־פעמית במקום חשבון פר־טוקן, לכל מי שמוכן לארח אותו.
המסגור הגיאופוליטי הוא של האנליסטים, לא של הראיות: "זה מטיל לחץ עצום אף יותר על מעבדות החזית האמריקאיות, והפער עם סין הולך ומצטמצם." זו פרשנות למשמעות של מודל חינמי ברמת Zhipu הפועל בקנה מידה חזיתי עבור הסדר התחרותי — והחשיפה של פרטי החומרה מעניקה לו יתרון שלא היה לאנליסטים. מתן שירות של 100 טריליון טוקנים ביום על כ-100,000 שבבים מקומיים הוא ההדגמה הראשונה בקנה מידה גדול לכך שמחסנית סינית ללא סיליקון של NVIDIA יכולה לשאת תעבורת הסקה חזיתית — התרחיש שעליו הזהיר מנכ"ל NVIDIA ג'נסן הואנג בפודקאסט Dwarkesh באביב הזה, כשטען שהגבלות הייצוא יאיצו את המחסנית הסינית העצמאית מ-NVIDIA, ושמודל חזיתי שרץ בצורה המיטבית על חומרה סינית מקומית יהיה "תוצאה איומה" עבור ארצות הברית. נתון שוויון העלויות של Z.AI הוא עדיין טענה של ספק, אבל האירוע עצמו אמיתי. באותו ערב הומחשה הנקודה גם בצד המודלים: בזמן ש-Z.AI שחררה את GLM-5.3-Flash, עליבאבא שלחה את Qwen3.8-Flash-Next, תצוגה מקדימה במשקלים פתוחים של ארכיטקטורת Qwen4. שני שחרורים סיניים חזיתיים במשקלים פתוחים בלילה אחד הם הצורה הקונקרטית של מה שמשקיפים כינו "יום גדול לקוד הפתוח הסיני."
האם כדאי לך לבנות על זה השבוע?
השבוע החינמי הסתיים, אבל המבחן עדיין זול: התעריף שנגבה בפועל ב-17 בספטמבר הוא 0.075$ לקלט / 0.25$ לפלט למיליון טוקנים, ולא מחיר המחירון של 0.15$ / 0.50$ — מבצע ההשקה של 50% שהוצהר שיסתיים ב-9 בספטמבר עדיין בתוקף שמונה ימים לאחר מכן. אם אתם עוסקים בעבודה סוכנית באופק ארוך, כותבים קוד בהקשרים ארוכים, או מריצים צינורות עתירי וידאו, זה בדיוק הצומת שבו ממוקמת Ox Alpha — וכשהמשקלים פתוחים, אתם יכולים להריץ את המבחן על החומרה שלכם במקום להיות תלויים בחסדיה של פלטפורמה אנונימית. שתי הסתייגויות. ראשית, התווית "frontier" היא עדיין הצהרה: כרטיס הניקוד של GLM-5.3-Flash הוא דיווח של הספק, והמספר העצמאי המוצק היחיד — ריצת ה-DeepSWE של דייוויס, כ-63% — חזק, אבל רחוק מה-80% הוויראליים של תת-הקבוצה המוקדמת בת 10 המשימות. שנית, מחיר ה-0$ היה מוגבל בזמן, והחשיפה תמחרה את מה שבא אחריו — זול עבור היכולת, אבל לא עוד בחינם. מה שהשחרור במשקלים פתוחים מסיר הוא את התלות: הקבצים בחוץ, כך שאפשר לארח את המודל בעצמכם במקום לשכור אותו. זו צורתו של מבחן, לא של תלות.
הדרך הבטוחה-לייצור להריץ בדיקה כזו היא שרשרת נפילה לאחור: המודל הניסיוני עונה כשהוא בריא, והבקשה עוברת למודל מוכח ברגע שהוא נתקע, נכשל או נעלם. לשם כך קיימת שכבת ניתוב. הגילוי הופך את בחירת הגיבוי לטריוויאלית: Ox Alpha הוא GLM-5.3-Flash, והמודל עצמו פעיל ב-OrcaRouter תחת שמו האמיתי במחיר $0.075 לקלט / $0.25 לפלט למיליון טוקנים, עם קריאות מטמון ב-$0.0173 — תעריף ההשקה של 50% הנחה שהוצהר להסתיים ב-9 בספטמבר, ונכון ל-17 בספטמבר, עדיין המחיר שמופיע בעמוד ולא נתון המחירון של $0.15 / $0.50. הוא מועבר הלאה עם 0% תוספת מחיר, API אחד על פני 200+ מודלים, עם מעבר אוטומטי לכשל כך שזינוק תנועה בשבוע ההשקה לא יהפוך להשבתה שלכם. תנו אודישן למודל החדש מלפנים עם גיבוי מוכח מאחוריו בשרשרת; כשמחיר משתנה, המספר שאתם רואים ב-OrcaRouter הוא המספר שאתם משלמים, באותו יום. או דלגו לגמרי על ה-API — המשקלים פתוחים, כך שאחסון עצמי של GLM-5.3-Flash מאחורי אותה שרשרת הוא גם אפשרות.
מה לצפות
שישה דברים יספרו את המשך הסיפור. מדד הביצועים העצמאי: כרטיס הניקוד של GLM-5.3-Flash מדווח מטעם הספק, ריצת ה-DeepSWE של Davis, כ-63%, היא המספר העצמאי המוצק היחיד עד כה, ה-62.7 הרשמי של DeepSeek V4 Pro 0813 נמצא כעת באותה רצועה, ורשומה ב-Artificial Analysis או ב-LMArena — או השוואה ישירה ראש בראש עצמאית — תהיה הבדיקה הסופית בשאלה אם "חזית" היא עובדה או סיסמה שיווקית. מסלול המחירים: לשאלת המצב היציב יש תשובה על בסיס הראיות עד כה — נאמר שהמבצע של 50% יסתיים ב-9 בספטמבר, אך ב-17 בספטמבר התעריף המוזל של $0.075 / $0.25 הוא עדיין מה שמוגש, כך שנתון המבצע, ולא מחיר המחירון של $0.15 / $0.50, הוא המספר שלפיו יש לתקצב; מה שנשאר בלתי פתור הוא הסיבה, מאחר שמחיר המחירון של Z.AI עצמה לא זז. טענת החומרה: Z.AI אומרת שהשבוע האנונימי רץ על כ-100,000 שבבים מתוצרת מקומית בעלות שווה לזו של NVIDIA — המבחן הציבורי הראשון של זה בקנה מידה הוא אם הטענה תשרוד בדיקה עצמאית, ואם מערך החומרה המקומי יהפוך לברירת המחדל עבור קו ה-GLM. חשבון האימוץ: אם התנועה שהובילה בפלטפורמות, שאותה משך Ox Alpha תחת המסכה, תומר לפריסות בהתארחות עצמית ול-API כעת, כשיש לו שם, רישיון ומחיר. ההמשך: אם GLM-5.3-Flash מציג את Ox Alpha כשלב ביניים — הרמז של teortaxesTex הוא שגרסה שעברה אימון נוסף תהפוך לסוס העבודה של GLM 5.5 חזק בהרבה, מה שיהפוך את המהדורה הזו ליסוד של ה-GLM הבא. והתגובה: כש-Qwen3.8-Flash-Next נוחת באותו לילה ומאחוריו חשיפה של שבב מקומי, הלחץ מוטל על מעבדות החזית האמריקאיות — ועל הדיון בבקרות היצוא — להשיב; שימו לב אם מהלך עוקב מהיר, מהלך תמחור או תגובת מדיניות ינחתו בצדו השני של הפער.
השורה התחתונה הכנה: Ox Alpha היה ניסוי זול במיוחד בשני הכיוונים. הפלטפורמה בחנה אם מודל אנונימי ברמת frontier במחיר $0 יכול לזכות בתעבורת ייצור אמיתית בתוך שבוע — והוא עשה זאת, בצורה משכנעת מספיק כדי ש-Z.AI לא רק שחשפה את עצמה ביום השישי אלא גם שחררה את המשקלים כמודל פתוח באותו לילה. אתה זוכה לבדוק אם המודל ראוי למקום בסטאק שלך, כעת ללא סיכון האנונימיות: GLM-5.3-Flash הוא מודל בעל שם, ברישיון MIT, הניתן לאירוח עצמי במחיר מפורסם, וגם שאלת החומרה קיבלה תשובה — Z.AI אומרת שההגשה של 100T טוקנים ליום רצה על כ-100,000 שבבים סיניים מקומיים, הצהרה מצד החברה אך כעת מדווחת בהרחבה. מה שנותר ללמוד הוא האם "frontier" שורד מדידה בלתי תלויה, האם טענת השוויון בעלויות של Z.AI עם שבבים מקומיים מחזיקה בקנה מידה, מדוע מבצע ההשקה של 50% הוא עדיין המחיר שמוצע שמונה ימים אחרי תאריך הסיום המוצהר של 9 בספטמבר, והאם החשיפה מציגה את GLM-5.3-Flash כסוס העבודה עבור GLM 5.5 חזק יותר, כפי שרומז teortaxesTex. הרץ את הניסוי, אבל הרץ אותו עם גיבוי מתחת.
השוואות במאמר הזה4
זוהה מתוך המאמר הזה · בנצ'מרקים: Artificial Analysis · מתעדכן יומית
