
AuK לעומת AuK-Flash: 32 שלבי דגימה או 4, ולמה התלמיד לפעמים מנצח
- openaiחדשOpenAI: GPT-6 Astra2026-09-0453אינטליגנציה77כתיבת קוד
- googleחדשGoogle: Gemini 3.8 Flash2026-09-0241אינטליגנציה76כתיבת קוד
- qwenחדשQwen: Qwen3.8 Max (0902)2026-09-0240אינטליגנציה72כתיבת קוד
- anthropicחדשAnthropic: Claude Fable 5.12026-09-0153אינטליגנציה82כתיבת קוד
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 לכל 1M טוקנים
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642אינטליגנציה72כתיבת קוד
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.24 / $0.73 לכל 1M טוקנים
- z-aiZ.ai: GLM 5.32026-08-1845אינטליגנציה75כתיבת קוד
- obsidianQwen3.8 27B2026-08-1534אינטליגנציה68כתיבת קוד
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236אינטליגנציה69כתיבת קוד
- grokSpaceXAI: Grok 4.62026-08-1244אינטליגנציה77כתיבת קוד
- metaMeta: Muse Spark 1.22026-08-0540אינטליגנציה72כתיבת קוד
- qwenQwen: Qwen3.8 Max2026-08-0340אינטליגנציה72כתיבת קוד
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135אינטליגנציה69כתיבת קוד
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 לכל 1M טוקנים
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2451אינטליגנציה78כתיבת קוד
- googleGoogle: Gemini 3.6 Flash2026-07-2134אינטליגנציה69כתיבת קוד
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2123אינטליגנציה49כתיבת קוד
שתי נקודות הביקורת שוקלות בדיוק 6.122 ג'יגה-בייט. שתיהן מופצות תחת רישיון MIT. שתיהן מונעות על ידי אותו מקודד הוראות שמורד בנפרד, עם 3 מיליארד פרמטרים, ואותו VAE בגודל 637 מגה-בייט.AuK ו-AuK-Flash נבדלים כמעט בכלום במה שאתה מקצה — ובדבר אחד שאתה מרגיש בכל קריאה: כמה פעמים רץ הדוגם. AuK, מודל הבסיס ליצירת ועריכת דיבור עם משקלים פתוחים ו-1.5 מיליארד פרמטרים, שצוות Hunyuan של Tencent והכותבים האקדמיים השותפים מאוניברסיטת שנגחאי ג'יאו טונג ו-NTU העלו ל-Hugging Face ב-9 בספטמבר, מבצע 32 הערכות פונקציה עם הכוונה נטולת מסווגים ב-2.0. AuK-Flash, המודל המזוקק, מבצע ארבע, כשההכוונה מכובה לחלוטין, תמורת האצה מוצהרת של 4.5× בזמן שעון. הקריאה הברורה היא שפלאש הוא המושב התקציבי שאתה בוחר כשהשהייה גוברת על האיכות. הקריאה הזו שגויה, וטבלאות ההערכה של הספק עצמו הן מה שסותרות אותה: בשורות ההשוואה הישירה של הדו"ח הטכני, פלאש זוכה בציון הגבוה ביותר במדד יחס העריכה של MMAE-Speech, בעמודה הפראלינגוויסטית של SpeechEditBench, במעקב אחר הוראות באנגלית, בדמיון הדובר בעריכה אקוסטית, ובכל ארבע שורות האיכות התפיסתית של שיפור הדיבור. זו לא הורדה בדרגה. זו עסקה אחרת, ואיזה צד שלה מתאים לך תלוי באיזו משתי המשימות אתה מריץ בפועל.
מה בעצם שונה ביניהם
אם מסירים את השיווק, הבחירה מצטמצמת לקובץ הגדרות. מנוע הריצה של AuK הוא טרנספורמר היברידי מבוסס rectified-flow — בלוקי MMDiT דו-זרמיים המזינים בלוקי DiT חד-זרמיים מאוחדים — המריץ פותר אוילר מסוג bfloat16 בתדר 24 קילו־הרץ, עם סמויים (latents) בני 64 ממדים בקצב 50 הרץ. AuK-Flash מריץ את אותה ארכיטקטורה בדיוק, עם דגם דגימה (sampler) מזוקק מחובר, שנוצר באמצעות אתחול עקביות (consistency initialization) ו-Decoupled DMD המנותב לפי משימה. כל שאר הרכיבים משותפים.
• שלבי דגימה — AuK: 32 הערכות פונקציה, ניתן להגדרה. AuK-Flash: 4, קבוע.
• הנחיה ללא מסווג — AuK: קנה מידה 2.0, ניתן לכיוונון. AuK-Flash: אין (CFG=0).
• גודל צ'קפוינט — AuK: auk_base.safetensors בגודל 6.122 GB. AuK-Flash: auk_flash.safetensors בגודל 6.122 GB. זהה עד למגה-בייט.
• סביבת ריצה משותפת — VAE בגודל 637 MB בתוספת המקודד Qwen/Qwen2.5-Omni-3B, שמורד בנפרד ומשמש את שניהם.
• מהירות מוצהרת — AuK-Flash: מהיר 4.5× בזמן שעון-קיר מהמורה עם 32-NFE, בחומרה, משך זמן וגודל אצווה זהים.
• רישיון — MIT לשניהם, שהפעם זה אומר בדיוק מה שנאמר.
גודל נקודת הביקורת הזהה הוא הפרט שממסגר מחדש את כל ההשוואה. גרסאות מזוקקות בדרך כלל קונות את המהירות שלהן בכך שהן קטנות יותר. AuK-Flash אינו קטן יותר. אתה לא חוסך בדיסק, אתה לא חוסך בזמן העברה, ומכיוון שהמקודד וה-VAE משותפים וה-DiT הוא באותו רוחב, אתה גם לא חוסך באופן משמעותי ב-VRAM כשאתה בוחר במודל התלמיד. המשאב היחיד ש-Flash מחזיר לך הוא זמן. בכל זאת, כדאי לציין מלכודת תקציב אחת: ה-"1.5B" בשם המודל מתאר את עמוד השדרה של הדיפוזיה, והקובץ על הדיסק הוא 6.122 GB. תכנן מראש עבור הקובץ.
היכן ש-AuK-Flash באמת מנצח את המודל המלא
זה החלק שבו האינסטינקט "מזוקק = גרוע יותר" טועה, והוא מתקיים על פני כמה משפחות משימות לא קשורות בטבלאות הדוח. נתחיל בתפיסה. בסט השיפור של DNS Challenge, Flash משיג UTMOS 4.05 לעומת 3.86 של AuK; ב-CHiME-4, 3.91 לעומת 3.72; ב-Libri2Mix, 4.03 לעומת 3.87; ב-VCTKSR, 4.05 לעומת 3.93. Flash גם זוכה בעמודת שגיאות הזיהוי בשניים מתוך ארבעת הסטים הללו, עם WER של 7.84 ב-CHiME-4 לעומת 7.98 ו-WER של 2.92 ב-VCTKSR לעומת 3.06. הטבעיות המדורגת על ידי בני אדם היא הציר היחיד שבו התלמיד נמצא בעקביות לפני, והדוח אומר זאת במפורש: המודל המלא מציע דיוק לשוני חזק יותר ונאמנות עריכה גבוהה יותר, בעוד ש-Flash "לעתים קרובות מציע איכות תפיסתית טובה יותר".
הניצחונות אינם מוגבלים לשיפור. במדד עריכת-היחס של MMAE-Speech — האם עריכה נוחתת בעוצמה המיועדת — Flash משיג 13.85 לעומת 12.44 של AuK. בעמודה הפרה-לשונית של SpeechEditBench הוא עומד על 39.25 לעומת 38.50. במשימת התיאור-באנגלית-לדיבור של InstructTTSEval הוא מגיע ל-82.40 מול 81.60, מה שמשווה אותו לקו הבסיס הטוב ביותר בשורה זו. בעריכה אקוסטית בחבילת Ming-Freeform הוא מחזיק בדמיון הדובר הגבוה ביותר במשפחה — 0.79 בסינית ו-0.75 באנגלית, לעומת 0.78 ו-0.74 עבור הדגם הבסיסי. שמירה על זהות הדובר, במילים אחרות, היא אחד הדברים שארבעה צעדים קונים לך — סיכום הדוח עצמו הוא שהמודל המלא נותן שגיאת זיהוי ממוצעת נמוכה יותר, בעוד Flash משמר טוב יותר את זהות הדובר. אם אתם עוסקים בהמרת קול, דיבוב, או עבודת שיפור שבה הגוון חשוב יותר משגיאת מילים — דווקא הסטודנט הוא המודל הטוב יותר.

במקום שבו 32 הצעדים עדיין מצדיקים את קיומם
היתרונות של המודל הבסיסי מתרכזים בדיוק במקום שבו היית מצפה ממודל דיפוזיה עם תקציב דגימה גדול יותר: בכל דבר שהפלט שלו צריך להיות נכון מבחינה לשונית.
ב-Seed-TTS-Eval, ה-WER הממוצע של AuK הוא 2.65 לעומת 2.85 של Flash, עם דמיון דובר של 0.795 לעומת 0.790. הפיזור בתוך הממוצע הזה אינפורמטיבי יותר מהממוצע עצמו. שניהם למעשה שקולים על ערכת הבדיקה האנגלית — 1.02 ו-1.03 — ונפרדים על הסינית, 1.02 לעומת 1.10, ושוב על תת-הקבוצה הסינית הקשה, 5.91 לעומת 6.43. בסינית, שם הצעדים הנוספים משתלמים.
הדפוס הזה מופיע גם במעקב אחר הוראות. במשימת תיאור-לדיבור הסינית של InstructTTSEval, הפער רחב: 83.37 עבור AuK לעומת 78.80 עבור Flash, והדו"ח מציין שמודל הבסיס מוביל בכל שלושת המדדים הסיניים של אותה סוויטה, בעוד שה"יתרון העיקרי" של Flash הוא תוצאת DSD האנגלית החזקה יותר שלו. השפה, לא הארכיטקטורה, היא קו ההפרדה.
נאמנות העריכה היא המפרידה ביניהם יותר מכול. דיוק עריכת התוכן ב-SpeechEditBench עומד על 91.83 עבור AuK לעומת 87.50 עבור Flash — הפער הבודד הגדול ביותר בהשוואה. העריכה האקוסטית כמעט חד-צדדית באותה מידה: 37.07 לעומת 30.26. בחבילת Ming-Freeform מדווחת AuK על WER נמוך יותר כמעט בכל מקום שחשוב: 3.09 לעומת 3.34 בעריכה סינית מלאה, ופער רחב בהרבה של 3.96 לעומת 4.84 בעריכה אנגלית מלאה. אם המוצר שלך משכתב את המילים בהקלטה של מישהו — עריכות מילים, החלפת תוכן, הוספה ומחיקה — המודל בן 32 הצעדים הוא זה ששומר על אמינות התמליל, והפרש של פי 8 בצעדים שווה את המחיר.
שני המודלים הם גם, לפי המספרים של הדו"ח עצמו, עדיין חלשים בעריכה רגשית: דיוק הרגש של SpeechEditBench הוא 9.94 עבור AuK ו-6.29 עבור Flash. זה לא תוצר לוואי של דיסטילציה. מדובר במשפחת משימות שאיש לא פתר, ובחירת התלמיד לא תהפוך אותך לגרוע יותר בזה ממה שאתה כבר.
ה-4.5× הוא מספר דגימה, לא מספר מקצה לקצה.
הנה החשבון שהכותרת על האצת המהירות מסתירה, וזה הדבר השימושי ביותר להבין לפני שמתחייבים לארכיטקטורה מבוססת Flash.
AuK-Flash מבצע 4 שלבי דגימה בעוד AuK מבצע 32. כלומר, פי 8 פחות שלבים. הספק מדווח על זמן שעון מהיר פי 4.5. ההבדל בין שני הנתונים הללו הוא כל מה שמסביב ללולאת הדגימה, והוא נשלט על ידי המקודד: מודל מולטי-מודאלי Qwen2.5-Omni-3B ששני הצ'קפוינטים טוענים ושניהם חייבים להריץ על כל בקשה. המקודד הזה הוא בערך פי שניים בגודלו מעמוד השדרה של הדיפוזיה, והעלות שלו קבועה. Flash לא יכול להאיץ אותו, כי Flash אינו חלק ממנו.
אז הגרסה הכנה של הטענה היא זו: 4.5× זה מה שמקבלים בחלק הדיפוזיה בתנאים תואמים, והרווח הכולל שלך (end-to-end) יהיה כחלק מזמן השעון (wall clock) שלולאת הדגימה תופסת בפועל. אם אתה מריץ יצירה ארוכת-פורמט (long-form generation) שבה 32 צעדים על פני פריימים סמויים רבים שולטים, תגיע קרוב למספר שפורסם. אם עומס העבודה שלך הוא קליפים קצרים עם עיבוד מקדים כבד של הוראות, או אם אתה מאגד בקשות קטנות, חלק גדול יותר מכל קריאה יושב במקודד המשותף, וההאצה האמיתית שלך תהיה קטנה משמעותית מ-4.5×. מדוד את התמהיל שלך לפני שאתה נותן לתקציב השהיה (latency) להסתמך עליו. איש עוד לא פרסם את המספר הכולל (end-to-end) הזה — כולל הספק, שלא מדווח כלל על נתוני השהיה מוחלטים או על דרישות VRAM.
מה עולה הזיקוק, במילותיהם של המחברים
הדוח הטכני כנה באופן יוצא דופן לגבי הנקודה שבה הסטודנט נשבר, ואופני הכשל הללו שימושיים יותר למטמיע מאשר טבלת אמות המידה.
יעדי ההנחיה של מודל המורה התבררו כבעיה. שימוש ביעדי CFG בענף העקביות "עלול לחשוף את הסטודנט עם מספר הצעדים המועט לתחזיות רוויות-יתר", לטענת המחברים, מה שגורם לחריגה ולקיטוע נשמע. בנפרד, לוח זמנים אחיד של DMD מנותק "פוגע בהפרדת דוברים מרובים ובהפרדה ווקאלית", כאשר חלק מפלטי הסטודנט נסוגים לכיוון התערובת הלא-מעובדת — הזיקוק מוחק את ההפרדה שהמודל היה אמור לבצע. DMD מנותב-משימה הוא הפתרון המתואר, וזו הסיבה שהדוח מקפיד לתחום את החולשה הספציפית הזו לגרסה האחידה בלבד. אם הפרדת דיבור היא חלק מרכזי בצינור העבודה שלכם, זו הפסקה שכדאי לבחון מולה לפני שנותנים אמון בו.
שני אילוצים נוספים הם תפעוליים ולא סטטיסטיים. משפר ההנחיות (Prompt Enhancer) של הצינור ממפה ניסוחים דיבוריים בנושא מהירות, עוצמה וגובה צליל לקבוצת ערכים נתמכים קבועה, ודוחה כל דבר שאינו יכול למפות לפני הפעלת ההסקה האקוסטית — כך שבקשות בלתי נתמכות נכשלות מוקדם ולא מתדרדרות באלגנטיות. והמאגר מקבל רק את Qwen/Qwen2.5-Omni-3B כמקודד; קובץ ה-README מציין ש-Qwen3-Omni אינו נתמך כרגע, כך שמקודד חדש יותר אינו שדרוג ישיר (drop-in). שילוב ה-ComfyUI נושא מגבלה של 30 שניות על רצפי מקור-פלוס-יעד.
הרצת שניהם היא התצורה המיועדת.
הדוגמה רבת-ה-GPU של המאגר עצמו מציבה את AuK על התקן אחד ואת AuK-Flash על התקן אחר — cuda:0 ו-cuda:1 — וזו אינדיקציה ברורה שטנסנט מצפה שהם יתקיימו זה לצד זה במקום להתחרות. זו גם התשובה הנכונה עבור רוב מערכות הדיבור בייצור, מכיוון ששני המודלים חזקים בתחומים שונים. נתב בקשות עתירות-עריכה ובקשות בסינית ל-AuK; נתב שיפור, הפרדה, ביצוע הוראות באנגלית, וכל דבר אינטראקטיבי ל-AuK-Flash. שני המודלים טוענים את אותו encoder ואת אותו VAE, ולכן משלמים על זמן הריצה המשותף פעם אחת ומחליפים בין checkpoints מאחוריו.
זוהי החלטת ניתוב בשכבת המודל, והיא באותה צורה שמיישם OrcaRouter בשכבת ה-API עבור מודלים מתארחים. המקום שבו השניים נפגשים כיום הוא התפר בצנרת של AuK עצמה: משפר ההנחיות דורש נקודת קצה צ'אט תואמת OpenAI כדי להפוך הוראה גסה לאוצר המילים הנתמך של המודל, והגיבוי האופציונלי של ASR דורש נתיב תמלול. כוון כל אחד מהם לנקודת קצה צ'אט תואמת OpenAI ותקבל מפתח אחד על פני יותר מ-200 מודלים, מחיר המחירון של הספק מועבר עם 0% תוספת, ומעבר אוטומטי אם צד אחורי נופל — וזה חשוב דווקא משום שמדובר בגרסה בת יומיים ללא API מתארח וללא שכפול עצמאי, ואתה לא רוצה תלות לא מוכחת שיושבת על נקודת קצה מקודדת.
עם זאת, היה ברור בנוגע למה שאינו זמין. לא AuK ולא AuK-Flash מסופקים על ידי ספק היסק מתארח כלשהו — כרטיסי Hugging Face אומרים זאת ישירות — ואף אחד מהם אינו ניתן לניתוב דרך OrcaRouter כיום. זוהי החלטה של אירוח עצמי מקצה לקצה.

מה שעוד לא ידוע
כמעט כל הפרטים על המהדורה הזו מגיעים מדיווחי הספק. האצת ה-4.5×, נתוני ה-WER, עמודות ה-SpeechEditBench ושורות ה-UTMOS, כולם לקוחים מהדוח הטכני של צוות AuK עצמו, arXiv 2609.08936, שהוגש ב-8 בספטמבר — אין שכפול בלתי תלוי, אין רישום בלוח תוצאות של צד שלישי, ואין תוצאה מתשתית בדיקה נייטרלית. אות האימוץ דליל באותה מידה: נכון ל-10 בספטמבר, שני מאגרי ה-Hugging Face מציגים 30 הורדות בחודש האחרון וכ-24 לייקים לכל אחד, בעוד שמאגר ה-GitHub מציג 217 כוכבים, 12 פיצולים ושלושה תורמים. זהו שחרור מחקרי, לא רכיבה על גל.
img src="4.png" alt="צילום מסך של קובץ ה-README של מאגר Tencent-Hunyuan AuK ב-GitHub, המציג את הודעת הקוד הפתוח מה-9 בספטמבר 2026 ואת טבלת גרסאות AuK ו-AuK-Flash"> p>השחרור עצמו היה שקט באופן שראוי לציין במפורש, כי קל לקרוא לתוכו יותר מדי. לא הייתה הודעת Hunyuan, לא פוסט בבלוג, לא דף מחירים, ולא אירוע השקה. ההצהרה המתוארכת היחידה של הספק היא שורה אחת בקובץ ה-README של המאגר — [2026/09/09] אנו משחררים את AuK כקוד פתוח. מטא-הנתונים של מאגר Hugging Face מראים שהמרחבים (Spaces) נוצרו מוקדם יותר, באמצע אוגוסט, והמשקלים עודכנו לאחרונה ב-9 וב-10 בספטמבר, כך שהאריזה התרחשה לפני ההכרזה. מה שידוע מהמאגר: משקלים ברישיון MIT לשתי הגרסאות, דוח טכני, הוראות הורדה תקינות עבור Hugging Face ו-ModelScope, ורשימת משימות מתועדת. מה שלא אושר: האם המספרים המדווחים יעמדו במבחן עצמאי, האם תופיע נקודת קצה מתארחת, והאם נקודת הביקורת Flash תישאר ברירת המחדל המומלצת לאחר שאנשים אחרים יריצו אותה.

איזה אחד לבחור?
אם אתה בונה תוכן או עורך מילות שירים, או מגיש דיבור בשפה הסינית בכל צורה שהיא, קח את AuK וקבל את 32 השלבים. היתרונות שלו שם גדולים, עקביים בשתי מערכות עריכה עצמאיות, והם בדיוק מסוג כשלי הנכונות — מילה שגויה בתמליל — שמשתמשים מבחינים בהם מיידית.
אם אתה בונה שיפור, הפרדת קול, המרת קול, או כל דבר שיש בו אדם שממתין לפלט, קח את AuK-Flash. הוא מהיר בפער גדול בלולאת הדגימה, הוא זוכה בשורות האיכות התפיסתית ישירות, והוא שומר על זהות הדובר טוב יותר מהמודל שממנו הוא זוקק. פער האיכות שקיים מרוכז במשימות שכנראה אינך מריץ.
אם אתה בונה מוצר דיבור שמכסה את שניהם, הרץ את שניהם. אותו דיסק, אותו מקודד, אותו רישיון, הבדל config אחד — ותבנית הפריסה שהריפוזיטורי כבר מדגים. הדבר היחיד ששווה לחכות לו הוא מדידת ה-latency שלך מקצה לקצה: ה-4.5× אמיתי, אבל הוא שייך ל-sampler, ורק תמהיל ה-workload שלך אומר לך כמה ממנו מגיע למשתמשים שלך.
