
AuK-Flash מול MathForm-8B: שני מומחים שקטים על מוחות Qwen שאולים
- deepseekחדשDeepSeek: DeepSeek V4.1 Flash2026-09-1040אינטליגנציה
- openaiחדשOpenAI: GPT-6 Astra2026-09-0453אינטליגנציה77כתיבת קוד
- googleחדשGoogle: Gemini 3.8 Flash2026-09-0241אינטליגנציה76כתיבת קוד
- qwenחדשQwen: Qwen3.8 Max (0902)2026-09-0240אינטליגנציה72כתיבת קוד
- anthropicחדשAnthropic: Claude Fable 5.12026-09-0153אינטליגנציה82כתיבת קוד
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 לכל 1M טוקנים
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642אינטליגנציה72כתיבת קוד
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 לכל 1M טוקנים
- z-aiZ.ai: GLM 5.32026-08-1845אינטליגנציה75כתיבת קוד
- obsidianQwen3.8 27B2026-08-1534אינטליגנציה68כתיבת קוד
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236אינטליגנציה69כתיבת קוד
- grokSpaceXAI: Grok 4.62026-08-1244אינטליגנציה77כתיבת קוד
- metaMeta: Muse Spark 1.22026-08-0540אינטליגנציה72כתיבת קוד
- qwenQwen: Qwen3.8 Max2026-08-0340אינטליגנציה72כתיבת קוד
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135אינטליגנציה69כתיבת קוד
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 לכל 1M טוקנים
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2451אינטליגנציה78כתיבת קוד
- googleGoogle: Gemini 3.6 Flash2026-07-2134אינטליגנציה69כתיבת קוד
ל-AuK-Flash ול-MathForm-8B יש יותר משותף משכל אחת מהמעבדות כנראה מודעת לו, ואף אחד מהדברים הללו אינו המשימה שהן מבצעות. MathForm-8B הוא מודל האוטופורמליזציה בגודל 8B של OpenBMB — כוונון עדין ברישיון Apache-2.0 של Qwen3-8B, שהופך מתמטיקה בשפה טבעית להצהרות Lean 4 שמהדר יכול לבדוק. AuK-Flash הוא מודל הדיבור המזוקק של Tencent — מחולל דיפוזיה ברישיון MIT לסינתוז ועריכת דיבור, שמנתב את ההוראות שלו דרך מקודד Qwen2.5-Omni-3B לפני שהוא מפיק צליל. האחד ממיר מתמטיקה בפרוזה לטקסט פורמלי שניתן לבדיקה הוכחתית; השני ממיר טקסט והוראות לאודיו. הם חולקים את אותה אסטרטגיה ארכיטקטונית מכיוונים מנוגדים: אף אחד מהם אינו מאמן מוח שפה כללי מאפס — כל אחד עוטף מודל פתוח קיים ומשקיע את המאמץ האמיתי במודאליות הפלט שלו. גם הדרך שבה שוחררו זהה — משקלים שפורסמו בשקט ב-Hugging Face, ללא הודעה לעיתונות — ושתיהן הן בדיוק הסוג של שחרור צר ומארח-עצמי שאמת מידה למודלי גבול אינה יכולה ללכוד.
התבנית שמאחדת אותם
התבוננו בשני רצפי השחרור זה לצד זה — הם כמעט תמונת מראה. המאגר AuK-Flash של Tencent מתוארך ל-21 באוגוסט ב-Hugging Face (אחיו, מודל הבסיס AuK, מתוארך ל-18 באוגוסט); ההכרזה על הקוד הפתוח — קוד, משקלים וקישורי הדגמה — פורסמה רק השבוע, עם תאריך 7 בספטמבר בכרטיס Hugging Face ו-9 בספטמבר במאגר GitHub המקושר. המאגר MathForm-8B של OpenBMB הופיע ב-14 באוגוסט ללא כל הכרזה. בשני המקרים, כרטיס המודל הוא ההשקה, המשקלים נגישים ללא חסימה תחת רישיון מתירני, ואין API מתארח לניסוי — אתה מוריד את ה-checkpoint ומריץ אותו על חומרה שבשליטתך. עבור קורא שמחליט מה לאמץ, המבנה המשותף הזה חשוב יותר מההבדל בתחום: שתי הגישות מהוות הימור שמודל פתוח בעל היקף מצומצם יכול לשרת נישה שמודל גנרליסטי משרת אותה גרוע, ושתיהן מבקשות ממך לספק את ההערכה שהמפרסם לא סיפק.
לוח התוצאות הישר
הואיל ושני המודלים אינם חופפים באף מדד-השוואה, לוח התוצאות מתאר שתי הימורים שונות, לא דירוג. המקור משנה בכל שורה — הטענות של AuK-Flash הן הצהרות כרטיס של Tencent, בנות ימים, שלא שוחזרו; ונתוני MathForm-8B הם דיווח של OpenBMB מתוך arXiv 2608.14221, והם לא שוחזרו:
• מה זה — AuK-Flash: מודל ליצירת ועריכת דיבור של Tencent, עם ~1.5B פרמטרים, שעבר דיסטילציה לגרסת דיפוזיה של 4 שלבים. MathForm-8B: אוטופורמליזר בגודל 8B של OpenBMB, שהופך מתמטיקה בלתי-פורמלית ל-Lean 4.
• פלט — AuK-Flash: אודיו ב-24 קילוהרץ — דיבור, דיבור מעובד, מקורות מופרדים. MathForm-8B: הצהרות Lean 4 עם כותרת ומשפט בעל שם.
**הוראות תרגום:** - **Construction** → **בנייה** - **AuK-Flash** → **AuK-Flash** (שם מוצר/דגם — אין לתרגם) - **diffusion transformer distilled to fixed NFE 4 / CFG 0** → **טרנספורמר דיפוזיה מזוקק ל-NFE קבוע של 4 / CFG 0** (NFE ו-CFG הם מונחים טכניים, נשארים באנגלית) - **Qwen2.5-Omni-3B** → **Qwen2.5-Omni-3B** (שם דגם) - **instruction encoder** → **מקודד הוראות** - **MathForm-8B** → **MathForm-8B** (שם דגם) - **Qwen3-8B** → **Qwen3-8B** (שם דגם) - **fine-tuned with SFT then RL** → **כוונון עדין עם SFT ולאחר מכן RL** (SFT ו-RL נשארים באנגלית) - **~367K-example FormalVerse dataset** → **מערך הנתונים FormalVerse עם כ-367,000 דוגמאות** **תרגום מלא:** **בנייה** — AuK-Flash: טרנספורמר דיפוזיה מזוקק ל-NFE קבוע של 4 / CFG 0, עם Qwen2.5-Omni-3B כמקודד ההוראות. MathForm-8B: Qwen3-8B מכוונן עדין עם SFT ולאחר מכן RL על מערך הנתונים FormalVerse עם כ-367,000 דוגמאות.**בנייה** — AuK-Flash: טרנספורמר דיפוזיה מזוקק ל-NFE קבוע של 4 / CFG 0, עם Qwen2.5-Omni-3B כמקודד ההוראות. MathForm-8B: Qwen3-8B מכוונן עדין עם SFT ולאחר מכן RL על מערך הנתונים FormalVerse עם כ-367,000 דוגמאות.
• שפת קלט — AuK-Flash: סינית ואנגלית (לפי כרטיס המודל). MathForm-8B: אנגלית, במשלב של ניסוחי בעיות מתמטיות.
• שחרור — AuK-Flash: מאגרי קוד ב-18 וב-21 באוגוסט; הוכרז כקוד פתוח ב-7–9 בספטמבר. MathForm-8B: מאגר קוד ב-14 באוגוסט; אין הכרזה נכון לכתיבת שורות אלה.
• עדויות — AuK-Flash: עדיין אין מעבר לרשימת היכולות בכרטיס. MathForm-8B: דווח על ידי הספק 88.06% Pass@8 תחת בדיקת תחביר ו-72.37% תחת בדיקת עקביות, עם FATE-H 63% ו-FATE-X 37% על קבוצות העקביות הקשות.

לוח התוצאות בשש שורות: שניהם מומחי משקלים פתוחים עם מוחות שאולים מ-Qwen וראיות עצמאיות דלות — הם נבדלים במה שהם מייצרים, לא באופן שבו הם שוחררו.
AuK-Flash: דיבור כתפוקת המומחה
הטענה בדבר "מוח שאול" לגבי AuK-Flash היא מילולית, לא רטורית. קובץ הצ'קפוינט שטנסנט מפרסמת מכיל את משקלי טרנספורמר הדיפוזיה ואת משקלי איחוי השכבות; המודל שלמעשה מבין את ההוראה שלך — Qwen2.5-Omni-3B — מורד בנפרד ונטען בזמן הריצה, וכך גם ה-BigVGANFlowVAE שממיר את הייצוג הכמוס (latent) בחזרה לגל קול בתדר 24 קילוהרץ. מה שטנסנט אימנה, אם כן, אינו מודל שפה כלל, אלא מחולל conditional flow-matching: בהינתן תכנית סמנטית ממקודד Qwen, הוא מרנדר אודיו במספר מצומצם של צעדים. AuK-Flash הוא הגרסה המזוקקת בת ארבעת הצעדים של אותו מחולל, והמאגר שלו — כ-6.1 גיגה-בייט עבור צ'קפוינט ה-Flash ב-BF16, ועוד VAE בנפח 637 מגה-בייט — מגיע עם CLI, מנוע Python, צמתי Gradio ו-ComfyUI וסקריפט כוונון עדין. רשימת היכולות רחבה עבור מודל דיבור: TTS באפס-שוט ומבוסס הוראות, עריכת תוכן ומילים, שינויי גובה צליל/מהירות/עוצמה ורגש/גוון קול, הסרת מבטא, המרת לחישה, שיפור איכות והפרדת מקורות — הכול דרך ממשק הוראה אחד בשפה טבעית, בסינית ובאנגלית. האם כל אחת מהיכולות עובדת כמתואר לא נבדק מחוץ לטנסנט; טענת הארכיטקטורה — Qwen קטן שמבין, מודל דיפוזיה מזוקק שמפיק צליל — נראית לעין במאגר עצמו.

דף המאגר tencent/AuK-Flash — משקולות ברישיון MIT עבור מודל הדיבור המזוקק בעל 4 השלבים, עם המקודד Qwen2.5-Omni-3B וה-VAE שנטענים מקבצים נפרדים בזמן הריצה.
MathForm-8B: הוכחה פורמלית כפלט של המומחה
MathForm-8B הוא אותו דפוס, רק בתחום אחד הלאה. OpenBMB לקחו את Qwen3-8B — מודל כללי שאומן על 119 שפות — והשקיעו את כל היכולת שלו בצורת פלט אחת: הצהרת משפט Lean 4 הנגזרת מבעיה בשפה טבעית. שלב ה-SFT על FormalVerse מלמד את ההמרה מבלתי-פורמלי לפורמלי; שלב למידת חיזוק (RL) לאחר מכן מחדד אותה מול פסק הדין של המהדר של Lean, ולכן המודל מדווח לא על ציון איכות מעורפל אלא על Pass@8 תחת בדיקת תחביר, ועל מעבר מחמיר יותר תחת בדיקת עקביות סמנטית. המספרים של הספק חזקים — 88.06% ו-72.37% על פני שישה benchmarks, כשהם גוברים על קווי הבסיס הייעודיים של 7B–32B מהמאמר — ובדיוק כמו הטענות של AuK-Flash, גם הם לא שוחזרו. המאגר הוא Apache-2.0, מוגש דרך Transformers, vLLM או SGLang, ובתמורה מוותר למעשה על כל מה ש-Qwen3-8B ידוע בו: אין צ'אט כללי ב-119 שפות, תקציב פלט של כ-16K טוקנים ל-Lean, ואין יכולת מתועדת מחוץ לתחום הפורמליזציה.

המאגר openbmb/MathForm-8B — משקולות Apache-2.0 עבור האוטופורמלייזר, שמציג את Qwen3-8B כמודל הבסיס שלו. זוהי כל הנוכחות הציבורית של MathForm-8B.
אימות הוא הנושא שאף אחד מהמדדים אינו לוכד.
שים את שני הפלטים זה לצד זה ומופיעה סימטריה מוזרה. כל העיצוב של MathForm-8B קיים מכיוון שלמתמטיקה בשפה טבעית אין אות נכונות — מהדר ה-Lean מספק אחד, כך שהמודל מאומן מול פסק דין עובר/נכשל שהוא יכול ממש לחוש. לתחום של AuK-Flash יש את אותה בעיה עם פתרון שונה: אין מהדר עבור "האם הקליפ הזה נשמע כמו הדובר, בלחש, כשהשיעול הוסר," ולכן אות העובר/נכשל הוא אוזן אנושית. אף מדד מצרפי לא מודד את זה — Elo על טקסט או ציון איכות על דיבור מסונתז אומרים לך מעט על כך שההבטחה המרכזית של המומחה (Lean מאומת, או דיבור בר-עריכה ובר-שכפול) אכן מתקיימת בזרימת העבודה שלך. התוצאה המעשית היא ששני המודלים חייבים להיות מוערכים בדרך שהספק לא יכול היה להעריך אותם: MathForm-8B על ידי הרצת הפלט שלו דרך Lean, ו-AuK-Flash על ידי האזנה לפלט שלו על הנתונים שלך. עד שמישהו יעשה את זה, הטענות שבכותרות על שני הכרטיסים הן כיוונים, לא תוצאות.
למי כל אחד מיועד, ומי צריך לחכות
בחר ב-MathForm-8B כאשר עומס העבודה שלך מסתיים בפורמליזציה — המרת מאגרי בעיות, בניית קורפוסים של Lean, הזנת אוטומציית הוכחות — ואתה רוצה את המומחה הפתוח החזק ביותר במשקל הזה. זה לא מודל כללי, אז שלב אותו עם מודל אחד לכל מה שמסביב לשלב הפורמלי.
• בחר ב‑AuK‑Flash כאשר עומס העבודה שלך מסתיים באודיו — קול שיקריא את הטקסט שלך, הקלטה לעריכה, מיקס להפרדה — ואתה רוצה מודל פתוח שמתייחס ליצירה ולעריכה כפעולה אחת. הקצה תקציב גם למקודד Qwen לצידו, וגם לבדיקת האזנה משלך.
• אם אתה זקוק לתשתית מוכחת ונתמכת, חכה עם שתיהן: לאף אחת אין תוצאות עצמאיות, לאף אחת אין API מתארח, ושתיהן בנות ימים עד שבועות. התבנית שכדאי לגנוב היא ארכיטקטונית — מוח שפה קטן שאול בתוספת ראש פלט מתמחה הוא זול בהרבה לאימון ולאיטרציה מאשר גנרליסט מלא — והיא תבנית שתוכל לאמץ בכוונון העדין שלך, בין אם תריץ אי פעם את שתי נקודות הביקורת הללו ובין אם לא.
שתי הגרסאות גם ממחישות מדוע שכבת ניתוב ראויה למקומה במחסנית מעורבת: כשהפייפליין שלך עובר ממודל חשיבה כללי למודל מומחה כמו אחד מאלה, הרעיון של הנתב הוא שהארכיטקטורה אינה מחויבת לתשובה אחת. API יחיד שמכסה 200+ מודלים, מעבר אוטומטי אם ספק מתדרדר, ומחירי המחירון של הספקים שמועברים הלאה ב-0% ריווח — כל אלה מאפשרים לך להשאיר את המודל הכללי על נתיב ברירת המחדל, לקרוא למודל המומחה רק עבור תת-הקבוצה של הבקשות שזקוקות לו — ולהחליף את המומחה ביום שבו ישוחרר מודל טוב יותר.
ההשוואה שצריך להחזיק בה אינה בין AuK-Flash ל-MathForm-8B — הם לעולם לא יתחרו על אותה בקשה. אלא שמדובר בשניהם יחד מול ההנחה שמודל כללי מתקדם הוא המודל היחיד ששווה להריץ. עריכת דיבור ופורמליזציה מאומתת מהוות שני תחומים שבהם מודל קטן, ממוקד ופתוח, עם מוח שאול, יכול לנצח מודל גדול בהרבה שמעולם לא כוון אל הבעיה — וזה בדיוק ההימור שגם Tencent וגם OpenBMB פרסמו זה עתה, ובדיוק מה שעדיין דורש הוכחה עצמאית.
