כרטיס כותרת ראשי להשוואה בין 'AuK-Flash ל-MathForm-8B' עם כתובית המשנה 'שני מומחים שקטים על מוחות Qwen שאולים', המציג שבב מרכזי שמתויג 'מוח Qwen שאול' שמתפצל לאריח פלט-דיבור של AuK-Flash ולאריח פלט-Lean-4 של MathForm-8B, עם הלוגו של OrcaRouter משולב בפינה.
Guides & Insights

AuK-Flash מול MathForm-8B: שני מומחים שקטים על מוחות Qwen שאולים

מחבר

Elias Hawthorne

תאריך פרסום

מודלים אחרונים · 20צפו בכל המודלים
בנצ'מרקים: Artificial Analysis · מתעדכן יומית
חזרה לכל הפוסטים

ל-AuK-Flash ול-MathForm-8B יש יותר משותף משכל אחת מהמעבדות כנראה מודעת לו, ואף אחד מהדברים הללו אינו המשימה שהן מבצעות. MathForm-8B הוא מודל האוטופורמליזציה בגודל 8B של OpenBMB — כוונון עדין ברישיון Apache-2.0 של Qwen3-8B, שהופך מתמטיקה בשפה טבעית להצהרות Lean 4 שמהדר יכול לבדוק. AuK-Flash הוא מודל הדיבור המזוקק של Tencent — מחולל דיפוזיה ברישיון MIT לסינתוז ועריכת דיבור, שמנתב את ההוראות שלו דרך מקודד Qwen2.5-Omni-3B לפני שהוא מפיק צליל. האחד ממיר מתמטיקה בפרוזה לטקסט פורמלי שניתן לבדיקה הוכחתית; השני ממיר טקסט והוראות לאודיו. הם חולקים את אותה אסטרטגיה ארכיטקטונית מכיוונים מנוגדים: אף אחד מהם אינו מאמן מוח שפה כללי מאפס — כל אחד עוטף מודל פתוח קיים ומשקיע את המאמץ האמיתי במודאליות הפלט שלו. גם הדרך שבה שוחררו זהה — משקלים שפורסמו בשקט ב-Hugging Face, ללא הודעה לעיתונות — ושתיהן הן בדיוק הסוג של שחרור צר ומארח-עצמי שאמת מידה למודלי גבול אינה יכולה ללכוד.

התבנית שמאחדת אותם

התבוננו בשני רצפי השחרור זה לצד זה — הם כמעט תמונת מראה. המאגר AuK-Flash של Tencent מתוארך ל-21 באוגוסט ב-Hugging Face (אחיו, מודל הבסיס AuK, מתוארך ל-18 באוגוסט); ההכרזה על הקוד הפתוח — קוד, משקלים וקישורי הדגמה — פורסמה רק השבוע, עם תאריך 7 בספטמבר בכרטיס Hugging Face ו-9 בספטמבר במאגר GitHub המקושר. המאגר MathForm-8B של OpenBMB הופיע ב-14 באוגוסט ללא כל הכרזה. בשני המקרים, כרטיס המודל הוא ההשקה, המשקלים נגישים ללא חסימה תחת רישיון מתירני, ואין API מתארח לניסוי — אתה מוריד את ה-checkpoint ומריץ אותו על חומרה שבשליטתך. עבור קורא שמחליט מה לאמץ, המבנה המשותף הזה חשוב יותר מההבדל בתחום: שתי הגישות מהוות הימור שמודל פתוח בעל היקף מצומצם יכול לשרת נישה שמודל גנרליסטי משרת אותה גרוע, ושתיהן מבקשות ממך לספק את ההערכה שהמפרסם לא סיפק.

לוח התוצאות הישר

הואיל ושני המודלים אינם חופפים באף מדד-השוואה, לוח התוצאות מתאר שתי הימורים שונות, לא דירוג. המקור משנה בכל שורה — הטענות של AuK-Flash הן הצהרות כרטיס של Tencent, בנות ימים, שלא שוחזרו; ונתוני MathForm-8B הם דיווח של OpenBMB מתוך arXiv 2608.14221, והם לא שוחזרו:

• מה זה — AuK-Flash: מודל ליצירת ועריכת דיבור של Tencent, עם ~1.5B פרמטרים, שעבר דיסטילציה לגרסת דיפוזיה של 4 שלבים. MathForm-8B: אוטופורמליזר בגודל 8B של OpenBMB, שהופך מתמטיקה בלתי-פורמלית ל-Lean 4.

• פלט — AuK-Flash: אודיו ב-24 קילוהרץ — דיבור, דיבור מעובד, מקורות מופרדים. MathForm-8B: הצהרות Lean 4 עם כותרת ומשפט בעל שם.

**הוראות תרגום:** - **Construction** → **בנייה** - **AuK-Flash** → **AuK-Flash** (שם מוצר/דגם — אין לתרגם) - **diffusion transformer distilled to fixed NFE 4 / CFG 0** → **טרנספורמר דיפוזיה מזוקק ל-NFE קבוע של 4 / CFG 0** (NFE ו-CFG הם מונחים טכניים, נשארים באנגלית) - **Qwen2.5-Omni-3B** → **Qwen2.5-Omni-3B** (שם דגם) - **instruction encoder** → **מקודד הוראות** - **MathForm-8B** → **MathForm-8B** (שם דגם) - **Qwen3-8B** → **Qwen3-8B** (שם דגם) - **fine-tuned with SFT then RL** → **כוונון עדין עם SFT ולאחר מכן RL** (SFT ו-RL נשארים באנגלית) - **~367K-example FormalVerse dataset** → **מערך הנתונים FormalVerse עם כ-367,000 דוגמאות** **תרגום מלא:** **בנייה** — AuK-Flash: טרנספורמר דיפוזיה מזוקק ל-NFE קבוע של 4 / CFG 0, עם Qwen2.5-Omni-3B כמקודד ההוראות. MathForm-8B: Qwen3-8B מכוונן עדין עם SFT ולאחר מכן RL על מערך הנתונים FormalVerse עם כ-367,000 דוגמאות.**בנייה** — AuK-Flash: טרנספורמר דיפוזיה מזוקק ל-NFE קבוע של 4 / CFG 0, עם Qwen2.5-Omni-3B כמקודד ההוראות. MathForm-8B: Qwen3-8B מכוונן עדין עם SFT ולאחר מכן RL על מערך הנתונים FormalVerse עם כ-367,000 דוגמאות.

• שפת קלט — AuK-Flash: סינית ואנגלית (לפי כרטיס המודל). MathForm-8B: אנגלית, במשלב של ניסוחי בעיות מתמטיות.

• שחרור — AuK-Flash: מאגרי קוד ב-18 וב-21 באוגוסט; הוכרז כקוד פתוח ב-7–9 בספטמבר. MathForm-8B: מאגר קוד ב-14 באוגוסט; אין הכרזה נכון לכתיבת שורות אלה.

• עדויות — AuK-Flash: עדיין אין מעבר לרשימת היכולות בכרטיס. MathForm-8B: דווח על ידי הספק 88.06% Pass@8 תחת בדיקת תחביר ו-72.37% תחת בדיקת עקביות, עם FATE-H 63% ו-FATE-X 37% על קבוצות העקביות הקשות.

A two-column scoreboard comparing AuK-Flash and MathForm-8B: AuK-Flash with 24 kHz audio output, Qwen2.5-Omni-3B encoder, speech generation and editing specialty, MIT license, no hosted API, vendor-card-only evidence; MathForm-8B with Lean 4 statement output, a fine-tune of Qwen3-8B, math autoformalization specialty, Apache-2.0, no hosted API, and vendor-reported Pass@8 of 88.06 under syntax check and 72.37 under consistency check; a footer notes AuK-Flash claims are Tencent-reported and MathForm-8B figures are OpenBMB-reported and unreproduced.

לוח התוצאות בשש שורות: שניהם מומחי משקלים פתוחים עם מוחות שאולים מ-Qwen וראיות עצמאיות דלות — הם נבדלים במה שהם מייצרים, לא באופן שבו הם שוחררו.

AuK-Flash: דיבור כתפוקת המומחה

הטענה בדבר "מוח שאול" לגבי AuK-Flash היא מילולית, לא רטורית. קובץ הצ'קפוינט שטנסנט מפרסמת מכיל את משקלי טרנספורמר הדיפוזיה ואת משקלי איחוי השכבות; המודל שלמעשה מבין את ההוראה שלך — Qwen2.5-Omni-3B — מורד בנפרד ונטען בזמן הריצה, וכך גם ה-BigVGANFlowVAE שממיר את הייצוג הכמוס (latent) בחזרה לגל קול בתדר 24 קילוהרץ. מה שטנסנט אימנה, אם כן, אינו מודל שפה כלל, אלא מחולל conditional flow-matching: בהינתן תכנית סמנטית ממקודד Qwen, הוא מרנדר אודיו במספר מצומצם של צעדים. AuK-Flash הוא הגרסה המזוקקת בת ארבעת הצעדים של אותו מחולל, והמאגר שלו — כ-6.1 גיגה-בייט עבור צ'קפוינט ה-Flash ב-BF16, ועוד VAE בנפח 637 מגה-בייט — מגיע עם CLI, מנוע Python, צמתי Gradio ו-ComfyUI וסקריפט כוונון עדין. רשימת היכולות רחבה עבור מודל דיבור: TTS באפס-שוט ומבוסס הוראות, עריכת תוכן ומילים, שינויי גובה צליל/מהירות/עוצמה ורגש/גוון קול, הסרת מבטא, המרת לחישה, שיפור איכות והפרדת מקורות — הכול דרך ממשק הוראה אחד בשפה טבעית, בסינית ובאנגלית. האם כל אחת מהיכולות עובדת כמתואר לא נבדק מחוץ לטנסנט; טענת הארכיטקטורה — Qwen קטן שמבין, מודל דיפוזיה מזוקק שמפיק צליל — נראית לעין במאגר עצמו.

A screenshot of the Hugging Face model page for tencent/AuK-Flash, showing the model card title 'AuK-Flash: Fast 4-Step Speech Generation and Editing', the MIT license tag, and the text-to-speech and diffusion tags.

דף המאגר tencent/AuK-Flash — משקולות ברישיון MIT עבור מודל הדיבור המזוקק בעל 4 השלבים, עם המקודד Qwen2.5-Omni-3B וה-VAE שנטענים מקבצים נפרדים בזמן הריצה.

MathForm-8B: הוכחה פורמלית כפלט של המומחה

MathForm-8B הוא אותו דפוס, רק בתחום אחד הלאה. OpenBMB לקחו את Qwen3-8B — מודל כללי שאומן על 119 שפות — והשקיעו את כל היכולת שלו בצורת פלט אחת: הצהרת משפט Lean 4 הנגזרת מבעיה בשפה טבעית. שלב ה-SFT על FormalVerse מלמד את ההמרה מבלתי-פורמלי לפורמלי; שלב למידת חיזוק (RL) לאחר מכן מחדד אותה מול פסק הדין של המהדר של Lean, ולכן המודל מדווח לא על ציון איכות מעורפל אלא על Pass@8 תחת בדיקת תחביר, ועל מעבר מחמיר יותר תחת בדיקת עקביות סמנטית. המספרים של הספק חזקים — 88.06% ו-72.37% על פני שישה benchmarks, כשהם גוברים על קווי הבסיס הייעודיים של 7B–32B מהמאמר — ובדיוק כמו הטענות של AuK-Flash, גם הם לא שוחזרו. המאגר הוא Apache-2.0, מוגש דרך Transformers, vLLM או SGLang, ובתמורה מוותר למעשה על כל מה ש-Qwen3-8B ידוע בו: אין צ'אט כללי ב-119 שפות, תקציב פלט של כ-16K טוקנים ל-Lean, ואין יכולת מתועדת מחוץ לתחום הפורמליזציה.

A screenshot of the Hugging Face model page for openbmb/MathForm-8B, showing the model card title 'MathForm: Scaling Mathematical Autoformalization with Knowledge Retrieval and Verification-Guided Refinement', base model Qwen3-8B in the metadata, and the Apache-2.0 license.

המאגר openbmb/MathForm-8B — משקולות Apache-2.0 עבור האוטופורמלייזר, שמציג את Qwen3-8B כמודל הבסיס שלו. זוהי כל הנוכחות הציבורית של MathForm-8B.

אימות הוא הנושא שאף אחד מהמדדים אינו לוכד.

שים את שני הפלטים זה לצד זה ומופיעה סימטריה מוזרה. כל העיצוב של MathForm-8B קיים מכיוון שלמתמטיקה בשפה טבעית אין אות נכונות — מהדר ה-Lean מספק אחד, כך שהמודל מאומן מול פסק דין עובר/נכשל שהוא יכול ממש לחוש. לתחום של AuK-Flash יש את אותה בעיה עם פתרון שונה: אין מהדר עבור "האם הקליפ הזה נשמע כמו הדובר, בלחש, כשהשיעול הוסר," ולכן אות העובר/נכשל הוא אוזן אנושית. אף מדד מצרפי לא מודד את זה — Elo על טקסט או ציון איכות על דיבור מסונתז אומרים לך מעט על כך שההבטחה המרכזית של המומחה (Lean מאומת, או דיבור בר-עריכה ובר-שכפול) אכן מתקיימת בזרימת העבודה שלך. התוצאה המעשית היא ששני המודלים חייבים להיות מוערכים בדרך שהספק לא יכול היה להעריך אותם: MathForm-8B על ידי הרצת הפלט שלו דרך Lean, ו-AuK-Flash על ידי האזנה לפלט שלו על הנתונים שלך. עד שמישהו יעשה את זה, הטענות שבכותרות על שני הכרטיסים הן כיוונים, לא תוצאות.

למי כל אחד מיועד, ומי צריך לחכות

בחר ב-MathForm-8B כאשר עומס העבודה שלך מסתיים בפורמליזציה — המרת מאגרי בעיות, בניית קורפוסים של Lean, הזנת אוטומציית הוכחות — ואתה רוצה את המומחה הפתוח החזק ביותר במשקל הזה. זה לא מודל כללי, אז שלב אותו עם מודל אחד לכל מה שמסביב לשלב הפורמלי.

• בחר ב‑AuK‑Flash כאשר עומס העבודה שלך מסתיים באודיו — קול שיקריא את הטקסט שלך, הקלטה לעריכה, מיקס להפרדה — ואתה רוצה מודל פתוח שמתייחס ליצירה ולעריכה כפעולה אחת. הקצה תקציב גם למקודד Qwen לצידו, וגם לבדיקת האזנה משלך.

• אם אתה זקוק לתשתית מוכחת ונתמכת, חכה עם שתיהן: לאף אחת אין תוצאות עצמאיות, לאף אחת אין API מתארח, ושתיהן בנות ימים עד שבועות. התבנית שכדאי לגנוב היא ארכיטקטונית — מוח שפה קטן שאול בתוספת ראש פלט מתמחה הוא זול בהרבה לאימון ולאיטרציה מאשר גנרליסט מלא — והיא תבנית שתוכל לאמץ בכוונון העדין שלך, בין אם תריץ אי פעם את שתי נקודות הביקורת הללו ובין אם לא.

שתי הגרסאות גם ממחישות מדוע שכבת ניתוב ראויה למקומה במחסנית מעורבת: כשהפייפליין שלך עובר ממודל חשיבה כללי למודל מומחה כמו אחד מאלה, הרעיון של הנתב הוא שהארכיטקטורה אינה מחויבת לתשובה אחת. API יחיד שמכסה 200+ מודלים, מעבר אוטומטי אם ספק מתדרדר, ומחירי המחירון של הספקים שמועברים הלאה ב-0% ריווח — כל אלה מאפשרים לך להשאיר את המודל הכללי על נתיב ברירת המחדל, לקרוא למודל המומחה רק עבור תת-הקבוצה של הבקשות שזקוקות לו — ולהחליף את המומחה ביום שבו ישוחרר מודל טוב יותר.

ההשוואה שצריך להחזיק בה אינה בין AuK-Flash ל-MathForm-8B — הם לעולם לא יתחרו על אותה בקשה. אלא שמדובר בשניהם יחד מול ההנחה שמודל כללי מתקדם הוא המודל היחיד ששווה להריץ. עריכת דיבור ופורמליזציה מאומתת מהוות שני תחומים שבהם מודל קטן, ממוקד ופתוח, עם מוח שאול, יכול לנצח מודל גדול בהרבה שמעולם לא כוון אל הבעיה — וזה בדיוק ההימור שגם Tencent וגם OpenBMB פרסמו זה עתה, ובדיוק מה שעדיין דורש הוכחה עצמאית.