
Union Alpha מול Qwen3.8 Flash: נקודה אחת היא כל הסיפור
- OrcaחדשOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 לכל 1M טוקנים
- orcaחדשOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 לכל 1M טוקנים
- deepseekחדשDeepSeek: DeepSeek V4.1 Flash2026-09-1040אינטליגנציה
- openaiחדשOpenAI: GPT-6 Astra2026-09-0453אינטליגנציה77כתיבת קוד
- googleGoogle: Gemini 3.8 Flash2026-09-0241אינטליגנציה76כתיבת קוד
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245אינטליגנציה76כתיבת קוד
- anthropicAnthropic: Claude Fable 5.12026-09-0153אינטליגנציה82כתיבת קוד
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 לכל 1M טוקנים
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642אינטליגנציה72כתיבת קוד
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 לכל 1M טוקנים
- z-aiZ.ai: GLM 5.32026-08-1845אינטליגנציה75כתיבת קוד
- obsidianQwen3.8 27B2026-08-1534אינטליגנציה68כתיבת קוד
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236אינטליגנציה69כתיבת קוד
- grokSpaceXAI: Grok 4.62026-08-1244אינטליגנציה77כתיבת קוד
- metaMeta: Muse Spark 1.22026-08-0540אינטליגנציה72כתיבת קוד
- qwenQwen: Qwen3.8 Max2026-08-0345אינטליגנציה76כתיבת קוד
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135אינטליגנציה69כתיבת קוד
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 לכל 1M טוקנים
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
Union Alpha ו-Qwen3.8 Flash נמצאים בהפרש של נקודה אחת במבחן היחיד שמדד את שניהם. בסוויטת SMF Clearinghouse Official A — 157 מבחנים, עם reasoning כבוי — Union Alpha קיבל ציון 136, והרצה מקומית של Qwen3.8-Flash-Next קיבלה ציון 137. זו תוצאת העימות הראש-בראש הצמודה ביותר שיש לאחד משני המודלים, והיא גם המספר המטעה ביותר בהשוואה הזו, מפני ששני הפריטים לא הורצו באותם תנאים ורק אחד מהם הוא מודל שאפשר ממש לשכור כרגע.
מה פער נקודה אחת אומר לך ומה הוא לא אומר
התחל במה שזה מבסס. Union Alpha אינו בלוף במובן הפשוט — חבילת בדיקות רחבה בת 157 בדיקות, עם אפס שגיאות, חשיבה מושלמת (30/30) ושימוש מושלם בכלים (2/2), אינה משהו שנקודת קצה חלולה מפיקה. תוצאת הקידוד שלו, 26/30, והציון שלו במתמטיקה, 24/30, ממקמים אותו בטריטוריה אמינה, וציון הכתיבה שלו, 2/5, ממקם אותו הרחק מעבודת פרוזה למטרות כלליות.
ועתה ההסתייגויות, שהן נושאות עומס.
הערך של Qwen3.8 Flash היה הרצה מקומית של Qwen3.8-Flash-Next — ה-checkpoint במשקולות פתוחות — ולא ה-API המתארח של Qwen3.8 Flash. הגשה מקומית משמעה כימות משלך, מחסנית הסקה משלך, ומפרסר קריאות כלים משלך. שום דבר מזה לא מובטח להתאים למה שנקודת הקצה המתארחת מחזירה, והאנשים שהריצו את הבדיקה סימנו את ההשוואה כלא-מכרעת בדיוק מהסיבה הזו.
חבילת בדיקות אחת אינה פרופיל. A הרשמי הוא רחב אך רדוד בכל קטגוריה: בקטגוריית כלים יש 2 בדיקות. קטגוריית כלים עם שתי בדיקות שמקבלת 2/2 היא סימן טוב, לא הוכחה לאמינות סוכנית, ו-Union Alpha ממוצב במפורש כמודל סוכני וקידודי. כלי המדידה מודד משהו שסמוך לטענה.
והנקודה היחידה עצמה נמצאת בתוך הרעש של חבילת בדיקות הכוללת 157 בדיקות. התייחס ל-136 ול-137 כ'אלה באותו טווח', ולא כדירוג.
זה לצד זה
• חלון הקשר — Union Alpha 262,144 אסימונים לעומת Qwen3.8 Flash 1,000,000 אסימונים מוגשים (262,144 נייטיביים, מורחב באמצעות YaRN).
• פלט מקסימלי — Union Alpha 131,072 טוקנים לעומת Qwen3.8 Flash 131,000 טוקנים. למעשה באותה רמה.
• קלטים — טקסט ותמונה ב-Union Alpha לעומת טקסט, תמונה ווידאו ב-Qwen3.8 Flash.
• תמחור — $0 במהלך שלב התצוגה המקדימה של Union Alpha לעומת Qwen3.8 Flash במחיר $0.150 למיליון טוקנים בקלט, $0.470 למיליון טוקנים בפלט, $0.018 למיליון קריאות מהמטמון, $0.230 למיליון כתיבות למטמון.
• בקרות הסקה — אין ב-Union Alpha, לעומת מצב חשיבה ב-Qwen3.8 Flash שמופעל כברירת מחדל וניתן להשביתו.
• זמן עד לטוקן הראשון — Union Alpha 10.00 s p50 לעומת Qwen3.8 Flash 6.62 s p50, שניהם נמדדו בנקודת הקצה שלנו באותו חלון של שבעה ימים. מהירות פענוח גולמית קרובה יותר ממה שהמוניטין מרמז: 170 טוקנים לשנייה לעומת 103.
• מקור — מפעיל אנונימי, ללא משקלים לעומת Alibaba/Qwen, כשמשקלי Qwen3.8-Flash-Next בקוד פתוח ב-Hugging Face וב-ModelScope.

Qwen3.8 Flash: הימור על יעילות עם 6B פעילים
Qwen3.8 Flash הושק ב-26 באוגוסט 2026 כגרסה המנוהלת והמוכנה לייצור של נקודת הבדיקה במשקלים פתוחים Qwen3.8-Flash-Next, שאליבאבא שחררה במקביל. זהו מודל תערובת מומחים בעל 125 מיליארד פרמטרים, המפעיל כ-6 מיליארד פרמטרים לכל טוקן, בתוספת 51 מיליארד פרמטרי הטמעת N-gram, הבנוי על קשב היברידי המשלב Gated DeltaNet עם אינדקסר קשב דליל.
המסגור של הספק נוגע לכלכלת האימון: Alibaba מדווחת כי עלות ההרצה היא כתשיעית בקירוב מזו של Qwen3.7-Plus, עם טענה ש-prefill מהיר עד פי 7.6 ו-decode מהיר עד פי 4.9 בעומסי עבודה של 1M טוקנים עם שיעורי פגיעת מטמון גבוהים. אלו נתוני ספק ולא שוחזרו באופן בלתי תלוי.
טבלת הבנצ'מרקים שלו גם היא מדווחת על ידי הספק ואינה משוחזרת: SWE-bench Pro 62.5, DeepSWE v1.1 58.7, SWE-bench Multilingual 81.0, NL2Repo 48.1, CoWorkBench 73.9, JobBench 55.7, RealWorldQA 88.5, LVBench 76.6, AndroidWorld 84.5. המספר שראוי לצטט בחזרה לשיווק הוא Humanity's Last Exam עם 35.9, שנמצא מתחת ל-40.0 של Claude Opus 4.6 באותה השוואה.
בעמוד המודל שלנו, אזור הבנצ'מרק הציבורי עדיין מציג "בהמתנה" — אף צד שלישי עדיין לא דירג אותו. מה שכן יש לנו הוא התעבורה שלנו: זמן חציוני של 6.62 שניות עד לאסימון הראשון, קצב פלט של 103 אסימונים לשנייה, ושיעור שגיאות של 4.5%. שיעור השגיאות הזה גבוה מספיק כדי שכדאי לעקוב אחריו, והוא מסוג הנתונים שמופיעים רק כשמודדים נקודת קצה חיה ולא פוסט השקה.

Union Alpha: המודל ללא בעלים
Union Alpha הופיע בקטלוגים של צד שלישי ב-16 בספטמבר 2026, והוא מוגש בשכבה החינמית של OrcaRouter. אין לו מעבדה בעלת שם, אין משקולות, אין רישיון, אין מספר פרמטרים ואין הערת ארכיטקטורה. בשדה הספק שלו כתוב "Stealth".
נקודת הקצה שלו, לכל הפחות, מובנת: הקשר של 262,144 טוקנים, פלט מקסימלי של 131,072 טוקנים, קלט טקסט ותמונה עם פלט טקסט בלבד, קריאה לכלים, פלט JSON, temperature, top_p ו-max_tokens, וללא בקרות הסקה כלל. בחירת כלים בפועל מכבדת רק "auto". החלון החינמי שלו תואר ככשבוע בערך, עם הגבלת קצב, ולא הוכרז תמחור לאחר התצוגה המקדימה.
הטענה האמורה — "ביצועים ברמת החזית במגוון רחב של משימות כלליות" — מדווחת על ידי המפעיל ולא מבוקרת. תוצאת 136/157 של Official A היא המדידה העצמאית היחידה שקיימת.

המהירות היא המקום שבו הם מפסיקים להיראות דומים
נתוני התפוקה הכותרתיים אינם מבדילים ביניהם כפי שהייתם מצפים, וכדאי להבין את הסיבה.
בטלמטריית הניתוב שלנו בשבעת הימים האחרונים, Qwen3.8 Flash מזרים 103 טוקני פלט לשנייה עם זמן p50 עד לטוקן הראשון של 6.62 שניות ושיעור שגיאות של 4.5%. Union Alpha, שנמדד באותה שיטה, מזרים 170 טוקנים לשנייה. במהירות פענוח גולמית, המודל האנונימי הוא המהיר מבין השניים.
מה שזה לא עושה זה להתחיל. מדדי ה-p50 וה-p95 של Union Alpha לזמן עד לאסימון הראשון נעולים שניהם על 10.00 שניות, כלומר לפחות מחצית מכלל הבקשות ממתינות עשר שניות או יותר לפני שהאסימון הראשון מופיע, ושיעור השגיאות שלה באותו חלון הוא 7.7% — בערך פי 1.7 מזה של Qwen. הרצת Official A עם 157 בדיקות שהקטעים המוקדמים נשענים עליה ארכה 4.6 שעות של זמן קיר, עם חביון חציוני של 91.9 שניות וממוצע של 104.8 שניות לבדיקה, וארבע בדיקות הגיעו לפסק הזמן של 300 שניות של מערכת הבדיקות. בודקים עצמאיים שהריצו אותו ביום ההשקה דיווחו על תפוקה נמוכה בהרבה מזו שנקודת הקצה שלנו מציגה, וזה מה שהייתם מצפים משירות שעדיין סופג עומס עצום של היום הראשון.
אז ההבדל המעשי אינו במהירות הפענוח. הוא בזמן עד לאסימון הראשון ובאמינות. Union Alpha אינו שמיש לשום דבר אינטראקטיבי — בלי השלמה אוטומטית, בלי סיוע בתוך השורה, בלי לולאת סוכן הדוקה — כי עשר שניות של שקט אינן ניתנות להבחנה מתקיעה. הוא מתאים לעבודה אסינכרונית: עבודות אצווה ליליות, עיבודי מסמכים ארוכים, ריצות הערכה לא מקוונות שבהן שום דבר לא ממתין לאסימון הראשון ושיעור כשל של 7.7% נספג בניסיון חוזר.
גם Qwen3.8 Flash, עם 103 טוקנים לשנייה וזמן חציוני של 6.62 שניות עד לטוקן הראשון, אינו מהיר. הצגה כנה תהיה ששניהם איטיים, ורק אחד מהם נכשל בערך בבקשה אחת מכל שלוש עשרה.
טיעון היעילות, ומי זוכה להשמיע אותו
עליבאבא מעלה טיעון של עלות אימון: תשיעית מהעלות של Qwen3.7-Plus לאימון, שישה מיליארד פרמטרים פעילים לכל טוקן, ולכן זול להגשה. זוהי טענה על מודל שהמשקולות שלו קיימות והשושלת שלו מתועדת.
סיפור היעילות של Union Alpha משתמע ולא נאמר במפורש — מודל אנונימי 256K שהקריאה אליו חינמית. חינם אינו זהה לזול. מישהו משלם עבור כרטיסי ה-GPU האלה, לתצוגה המקדימה יש סוף מוצהר, וההודאה של המפעיל עצמו שכיוונן למהירות מרמזת שכלכלת ההגשה טרם התייצבה. למודל שהוא חינם לשבוע ואחר כך לא ניתן לתמחור יש טיעון יעילות שפג עם תום החלון.
לנסות את הלא נודע בלי להמר עליו
הסיבה שכדאי להחזיק בראש את ההתמודדות הספציפית הזו היא שהיא המבחן הזול ביותר האפשרי של מודל לא מוכח. Qwen3.8 Flash הוא הכמות הידועה: ספק בשם, משקולות פתוחות, בנצ'מרקים מפורסמים (אם כי בטעם הספק), ומחיר אמיתי לכל טוקן של $0.150/$0.470. Union Alpha הוא הלא־נודע, במחיר אפס, שכל הטענה התחרותית שלו נשענת על תוצאה אחת של 157 בדיקות.
במקום לבחור, שים את הלא־נודע מאחורי כלל failover. OrcaRouter מעביר את מחיר המחירון של הספק הלאה בתוספת של 0% ותומך ב-failover אוטומטי בין ספקים, כך שנקודת קצה של Union Alpha שמוגבלת בקצב או שנעלמה עוברת למודל שעדיין עונה במקום להופיע כמשימה שנכשלה ב-3 לפנות בוקר. שני המודלים יושבים על אותו מפתח, כך שהניסוי עולה שינוי בקונפיגורציה ולא אינטגרציה שנייה — ואף אחד מהם לא צריך להיות החלטה שאתה צריך להגן עליה, כי אתה יכול להחליף את הניתוב כשחלון החינם נסגר.
פסק דין
Qwen3.8 Flash הוא המודל שעליו כדאי לבנות. שישה מיליארד פרמטרים פעילים, משקולות אחיות בקוד פתוח, חלון של מיליון טוקנים, קלט וידאו, 103 טוקנים לשנייה שעובדים, ומחיר מפורסם שאפשר לחזות. מדדי הביצועים שלו מדווחים על ידי הספק, ושיעור השגיאות שלו שווה ניטור, אבל הוא שייך למישהו, ומישהו הזה משיק.
Union Alpha הוא המודל שכדאי למדוד. הפער של נקודה אחת ב-Official A הוא באמת מעניין — הוא מרמז שכל מה שזה לא יהיה, זה לא צעצוע — וב-$0 עם תקרת פלט של 131K וקלט חזותי, הוא שווה שבוע מתשומת הלב שלך. אבל פער של נקודה אחת בסוויטה אחת, שהופק על ידי מפעיל אנונימי עם שיעור שגיאות של 7.7%, הוא סיבה לחקור ולא סיבה להחליף.
הדבר שכדאי לשים לב אליו הוא אותו הדבר שתמיד הכריע את העניין: שם. Ox Alpha, הערך הקודם בסדרה הזו, נחשף שישה ימים לאחר שהופיע בתור GLM-5.3-Flash של Zhipu. אם Union Alpha יקבל אחד, ההשוואה מפסיקה להיות עניין של נקודה ומתחילה להיות עניין של מחיר.
הישות הידועה מתומחרת ומתועדת: עמוד המודל Qwen3.8 Flashמציג את התעריפים של $0.150/$0.470, את חלון ההקשר המוגש של 1M טוקנים ואת תקרת הפלט של 131K, בעוד המדדים הציבוריים עדיין בהמתנה.
