כרטיס כותרת ראשי (hero) שנוצר עבור AuK, המציג את סימן המילה "AuK" מעל שורות המשנה "מודל דיבור בקוד פתוח בגודל 1.5B של Tencent" ו"הוראה אחת בשפה טבעית לכל משימת אודיו — שכפול, עריכה, שיפור, הפרדה.", עם גל שמע כחול ורך שנערך באמצעות סמן טקסט דק, וארבעה אייקונים שטוחים המסומנים שכפול קול, עריכה, שיפור והפרדה, כשלוגו OrcaRouter מורכב בפינה הימנית התחתונה.
Guides & Insights

AuK: טנסנט שחררה בשקט קוד פתוח למודל דיבור של 1.5B שמתייחס לכל משימת אודיו כאל פקודת טקסט.

מחבר

Rowan Sterling

תאריך פרסום

מודלים אחרונים · 20צפו בכל המודלים
בנצ'מרקים: Artificial Analysis · מתעדכן יומית
חזרה לכל הפוסטים

הנה משפט שאף כלי דיבור אחד שתוכלו להוריד היום לא יבצע במעבר אחד: קחו את ההקלטה הזאת, החליפו את המילה "house" ב-"home", העלו את גובה הצליל בחצי טון, הסירו את הנשימה לפני המשפט האחרון, נקו את רעשי הרקע, ואז קראו שוב את התוצאה בקול חדש לגמרי המתואר רק כ"גבר בגיל העמידה חם עם מבטא קנטונזי קל". התשובה של Tencent למשפט הזה היא AuK, מודל עם 1.5 מיליארד פרמטרים המכונה "מודל בסיס ליצירת ועריכת דיבור" ששוחרר כקוד פתוח השבוע ללא פוסט השקה וללא הודעה לעיתונות — ואחיו המזוקק AuK-Flash מגיע כעת עם הדבר האחד שחסר בסיפור הזה כשכתבנו אותו לראשונה: דוח טכני עם מספרים. "AuK Technical Report: An Open-Source Foundational Model for Speech Generation and Editing" (arXiv:2609.08936, cs.SD, הוגש ב-2026-09-08) מצוטט כעת גם בכרטיס המודל של Hugging Face וגם ב-README של GitHub, כאשר רישום המאמר מתוארך ל-2026-09-08 ושורת החדשות של מאגר הקוד עצמו מתוארכת ל-2026/09/09. מה שהדוח אינו עושה הוא להכריע בשאלה שהייתה חשובה — כל נתון בו הוא של Tencent עצמה, שהורץ מול קווי בסיס ש-Tencent בחרה, ונכון ל-2026-09-10 איש מחוץ לחברה לא שחזר אפילו נתון אחד.

זהו מאמר מסוג "מה אנחנו יודעים נכון לעכשיו", שעודכן פעם אחת. טנסנט עדיין לא הכריזה על AuK באף אחד מהערוצים המרכזיים שלה שנוכל לאתר, כך שהתיעוד כולל: כרטיסי המודל והמאגרים של AuK ו-AuK-Flash ב־Hugging Face, מאגר הקוד תחת ארגון Tencent-Hunyuan, אתר הפרויקט בכתובת auk-project.github.io, ועכשיו גם המאמר. התוספת האחרונה משנה את מה שבידוע — הארכיטקטורה, מתכון האימון ומספרי ההערכה מתוארים בפירוט בפעם הראשונה — מבלי לשנות את מה שאומת. יש להתייחס לכל נתון מספרי להלן כמוצהר על ידי הספק, כי זה בדיוק מה שהוא, ולציין שההשוואות בדוח הן אך ורק מול מודלים פתוחים אחרים, ולא מול פלטפורמות הדיבור המארחות הסגורות שאיתן AuK הייתה מתחרה בפועל.

מה שבפועל שוחרר, ועד כמה בשקט

ציר הזמן נותר עדיין הסיכום הכנה ביותר של ההשקה, עם תיקון אחד ביחס לבדיקה הראשונה שלנו. מאגרי Hugging Face נוצרו באמצע אוגוסט — AuK ב-2026-08-18 — אך נותרו חשוכים עד השבוע. כשקראנו את כרטיס המודל של AuK ב-2026-09-09, שורת החדשות היחידה בו הייתה מתוארכת ל-2026-09-07; יום לאחר מכן אותה שורה מציינת 2026/09/09 ומפנה את הקוראים למאמר ול-Spaces של הדמו. מאגר GitHub, שמכיל את קוד ההיסק והאימון, נוצר ב-2026-08-19 והעדכון האחרון שלו היה ב-2026-09-09. במילים אחרות: משקלים, אחר כך קוד, ולאחר מכן דוח טכני — שלושה פרסומים מדורגים בארבעה ימים, ובכל זאת עדיין אין הודעה מהערוצים הראשיים של Tencent נכון למועד כתיבת שורות אלו.

• המשקולות מתארחות ב־Hugging Face תחת ארגון tencent ומשוכפלות ב־ModelScope תחת Tencent-Hunyuan — שתי מראות, אותו רישיון MIT.

• כל מאגר מודל מכיל checkpoint יחיד של safetensors בתוספת config ו־VAE: auk_base.safetensors בגודל 6.12 GB ו־vae.safetensors בגודל 0.64 GB עבור AuK; אותה פריסה עבור AuK-Flash. כרטיס המודל מבקש ממך גם להוריד את Qwen/Qwen2.5-Omni-3B, מקודד הטקסט ש־AuK טוען בנפרד בזמן ריצה.

• מסגרת ה"אף אחד לא שם לב" פגה, ובמהירות. מאגר הקוד עמד על אפס כוכבים ואפס forks כשבדקנו ב-2026-09-09; עד 2026-09-10 הוא מציג 216 כוכבים, 12 forks והנושא הפתוח הראשון שלו. כרטיס ה-AuK מדווח על כשלושים הורדות בחודש האחרון עם 26 לייקים. מה שלא השתנה: לשוניות הדיון ריקות, והכרטיס עדיין מציין שה-checkpoint אינו פרוס על ידי אף ספק inference.

• שני כרטיסי המודל, ה-README והקישור למאמר מקשרים ל-Spaces של הדגמות ב-Hugging Face וב-ModelScope. ה-Space של Hugging Face לא היה נגיש לציבור ללא התחברות כשבדקנו, ולכן יש להתייחס לנתיב 'נסה בדפדפן' כלא מאומת עבור משתמשים אנונימיים.

A screenshot of the Hugging Face model page for tencent/AuK, captured September 9, 2026, showing the Tencent org, the model name, the Text-to-Speech pipeline tag, model tags including zero-shot-tts, voice-cloning, speech-editing, instruction-guided and diffusion, the licence "mit", and the model card opening with "AuK: An Open-Source Foundational Model for Speech Generation and Editing", a News entry dated 2026/09/07 reading "AuK is now open-source. Code and model weights are publicly available.", and the start of the Introduction describing AuK as a 1.5B foundation model.

כרטיס ה-Hugging Face שלמעלה הוא עדיין המשטח הציבורי המלא של גרסה הניתנת להתקנה: כרטיס מודל, קובץ config, שני קבצי safetensors ורישיון. מה שנוסף מאז הוא שכבת התיעוד סביבו — מאמר, טבלת benchmark ובלוק ציטוט — וכל זה אינו משנה את העובדה שאין changelog, אין שרשור דיון ואין רשימת ספקי inference מאחוריו.

הקונספט: ממשק הנחיות אחד, שש עשרה משימות דיבור

הטענה של AuK אינה שזהו מודל הטקסט-לדיבור הטוב ביותר שיצא אי פעם. היא שיצירת הדיבור היא רק אחת מחמש משפחות של משימות דיבור שהמודל אומן לבצע דרך ממשק שפה טבעית יחיד, שבו בקשה היא הודעת צ'אט שיכולה לשאת טקסט בתוספת קובץ שמע ייחוס אופציונלי. המאמר מנסח באופן פורמלי בדיוק את הטקסונומיה שאתר הפרויקט כבר פרסם:

• יצירת דיבור — zero-shot TTS (הקראת הטקסט הזה בקול קליפ הייחוס) ו-instruction TTS (יצירת דיבור מתיאור קול בלבד, ללא אודיו ייחוס בכלל).

• עריכת תוכן — שכתוב של מה שנאמר: החלפה, הוספה או מחיקה של מילים בהקלטה קיימת; ועריכת מילות שיר, הכוללת שכתוב של מילים מושרות תוך שמירה על המנגינה והקול.

• עריכת שמע — גובה צליל בחצאי טונים, התאמת קצב דיבור, ועוצמת קול בדציבלים.

• עריכה פארה־לשונית — שינויי רגש, שינויי גוון קול מתוך תיאור, הסרת מבטא, הוספה או הסרה של צלילים לא־מילוליים (נשימות, צחוקים, שיעולים), והמרה בין דיבור רגיל ללחישה תוך שמירה על הדובר.

• שיפור והפרדה — הפחתת רעש והדהוד בדיבור, הפרדת דיבור לפי סדר דיבור, הפרדת מוזיקה/קול, וחילוץ דובר מטרה המזוהה על פי מה שהדובר אומר.

מקרה ה-instruction-TTS הוא זה שמבדיל את השחרור הזה משחרור טיפוסי של שכפול קול: AuK יקרא משפט בקול שקיים רק כתיאור טקסטואלי — הדוגמה שבתיעוד עצמו מתארת אישה בשנות העשרים לחייה, המדברת אל בן זוג שרגע חזר הביתה, חמה, אכפתית וקוקטית קלות, בגוון רך ומתוק ובטון עולה קל בסוף המשפט, והכל ללא קליפ ייחוס. זה מסיר את הצורך בהקלטת ייחוס, שהיא עלות הסף הרגילה של שכפול. הדו"ח מכמת את המשימה הזו בפעם הראשונה, וזהו אחד המקומות הבודדים שבהם AuK מנצחת את התחום במובהק, ולא רק בשוליים.

בתוך "1.5B": המספר ממעיט בערך זמן הריצה.

ספירת הפרמטרים של AuK מתארת את ה-Transformer הדיפוזי, לא את כל הצנרת, והמאמר מציין כעת במפורש את שני החלקים. עמוד השדרה הוא Transformer זרימה מיושרת היברידי — שלושים שכבות המורכבות מעשרה בלוקי MMDiT דו-זרמיים ואחריהם עשרים בלוקי DiT חד-זרמיים מאוחדים, גודל חבוי 1536, 24 ראשי קשב מממד 64, רוחב ביניים של SwiGLU 3072, וזה המקור לנתון "בערך 1.5 מיליארד פרמטרים". סביבו יושבים שני רכיבים הנטענים בנפרד: LLM מולטימודלי (Qwen/Qwen2.5-Omni-3B) שהופך את ההוראה וכל אודיו ייחוס להתניה סמנטית, ו-VAE אודיו סיבתי ב-24 קילו-הרץ — שהקונפיגורציה מכנה אותו BigVGANFlowVAE — המפעיל לט�טים מממד 64 בקצב מסגרות של 50 הרץ, עם רוחבי ערוצי מקודד עד 768 ומפענח עד 1536. אז זמן הריצה המלא הוא עמוד השדרה של ~1.5B פלוס מקודד של 3B פלוס ה-VAE, והוראת ההורדה מציינת במפורש שהמקודד הוא checkpoint נפרד עם תנאים משלו.

לפי הדוח, האימון התנהל בשלבים ובקנה מידה שאתר הפרויקט רק רמז עליו: חימום־מקדים ליצירה בלבד של 50,000 עדכונים, ולאחר מכן 600,000 עדכונים משותפים ליצירה ולעריכה, על כ־3.03 מיליארד דוגמאות הוראה–אודיו המייצגות כ־1.95 מיליון שעות של פיקוח אפקטיבי, על פני 256 GPUs, עם 1.24 מיליון עדכונים נוספים על ה־VAE. האימון המאוחר שילב אופטימיזציית העדפות משוב אנושי עם למידת חיזוק מבוססת תגמול, שנבנתה על 818 קבוצות העדפה אינפורמטיביות ו־9,080 מועמדים מדורגים, מאגרי הנחיות ל־RL של 10,000 הנחיות zero-shot ו־5,000 הנחיות עוקבות־הוראה, 30,000 דוגמאות שיפוט סגנון, ומודל תגמול שכוונן מ־Qwen2.5-Omni-7B. זהו מחסן אימון מאוחר רציני לשחרור פתוח של 1.5B, וזו גם תזכורת לכך ש"משקולות פתוחות" מתאר את הארטיפקט, לא את הכוח החישובי שהפיק אותו — נקודה שכדאי לזכור כששוקלים אם אפשר לשחזר אותו.

A generated single-column scoreboard for AuK listing Params: 1.5B backbone + 3B Qwen encoder; License: MIT; Open-sourced: 2026-09-07 weights · 2026-09-09 code; Tasks: 16 across 5 speech families; Runtime: 24 kHz · 50 Hz audio latents; AuK-Flash: 4-step, no CFG, 4.5× faster (vendor), with the footer "Specs from Tencent's repos & project site; vendor-reported, not independently reproduced yet." and the OrcaRouter logo composited in the bottom-right corner.

כל נתון בגיליון המפרט הזה נקרא מהמאגרים ומהאתר של Tencent עצמם ולא נמדד על ידינו, והמאמר לא שינה את זה — הוא רק העביר יותר מהשורות האלה מ"מוצהר" ל"מתועד". המספר היחיד שנבדק בפועל מאז שפרסמנו לראשונה הוא הפעילות של המאגר עצמו, שעלתה מאפס כוכבים לכמה מאות ביום.

A screenshot of the AuK project website at auk-project.github.io, captured September 9, 2026, showing the title "AuK: An Open-Source Foundational Model for Speech Generation and Editing", badge links for GitHub, Hugging Face and ModelScope, the AuK-Flash variant name alongside Tencent Hunyuan co-branding, the tagline "One model for every speech task", and the opening description of AuK as a 1.5B-parameter foundational model with a multimodal language model, a 50 Hz VAE and a hybrid transformer under a flow-matching objective.

אתר הפרויקט נשאר המקום שבו מתגוררים דיאגרמת הארכיטקטורה והמיתוג המשותף האקדמי, וזו עדיין הדרך הזולה ביותר לראות את צורת המודל: מודל שפה רב-מודאלי להתניה סמנטית, VAE בתדר 50 הרץ לאקוסטיקה, וטרנספורמר היברידי תחת מטרת התאמת זרימה. קטע הבנצ'מרק שלו, שבפעם הראשונה שבה הסתכלנו כלל מערך הערכה ללא ציונים, כולל כעת מאמר שניתן להסתמך עליו.

הדוח הטכני נוחת, והמספרים הם של Tencent עצמה.

זוהי תמצית העדכון. המאמר מדווח על תוצאות בשבע ערכות הערכה — אותה רשימה שאתר הפרויקט פרסם ללא מספרים — ובמרבית צירי היצירה ועריכת התוכן AuK מוביל את התחום הפתוח. קראו את אלה כטבלת אמות מידה של ספק, כי זה מה שהם: tencent הריצה כל השוואה, בחרה כל קו בסיס, ועדיין לא פרסמה קוד לשחזור תשתית הבדיקות.

• TTS ללא דוגמאות (Zero-shot) על Seed-TTS-Eval: AuK משיג בממוצע 2.65 WER עם דמיון דובר של 0.795, לעומת Qwen3-TTS עם 3.07 ו-0.745, Seed-TTS עם 3.65 ו-0.778, ו-VoxCPM2 עם 3.65 ו-0.767. AuK-Flash מגיע ל-2.85 ו-0.790. הפיצולים הבודדים הטובים ביותר הם 1.02 WER בסט המבחנים האנגלי ו-5.91 בסט הקשה הסיני.

• TTS מבוקר הוראה על InstructTTSEval: AuK משיג 83.37 בסינית ו-81.60 באנגלית במעקב אחר תיאור, לעומת Qwen3-TTS-VD עם 81.10 ו-82.40 ו-MOSS-VoiceGenerator עם 80.00 ו-82.00. AuK-Flash משיג 78.80 בסינית אך משתווה לתוצאה האנגלית הטובה ביותר בתחום עם 82.40.

עריכת תוכן על SpeechEditBench: דיוק של 91.83 לעומת 76.46 של Ming-UniAudio, ו-71.33 בפרוזודיה לעומת 26.50 — שני הפערים הגדולים ביותר בכל הדוח.

עריכה מונחית הוראות על Ming-Freeform-Audio-Edit, הגדרה מלאה: שגיאת המילים יורדת מ-10.46 ל-3.09 בסינית ומ-14.28 ל-3.96 באנגלית לעומת Ming-UniAudio, עם דיוק העריכה עולה מ-79.62 ל-91.47 ומ-70.98 ל-85.25. בעריכות אקוסטיות, אותה השוואה מזיזה את שגיאת המילים מ-5.01 ל-2.02 בסינית ומ-10.75 ל-3.48 באנגלית.

• עריכה פארא-לשונית על MMAE-Speech: שיעור מעקב אחר הוראות 48.23 ושכתוב תוכן 88.11, לעומת Step-Audio-EditX עם 43.52 ו-77.27, ו-Ming-UniAudio עם 34.13 ו-76.01. AuK-Flash מציג את רף הרקול הטוב ביותר של מודל העריכה בטבלה עם 13.85.

שיקום, שבו המודל תחרותי ולא דומיננטי: DNS Challenge שגיאת מילים לא מסונכרנת 2.66 עם דמיון דובר 0.99 לעומת RE-USE ב-3.31; CHiME-4 שגיאת מילים 7.98 לעומת RE-USE ב-10.71; Libri2Mix שגיאת מילים 9.12 לעומת MossFormer2-SS ב-9.34; ו-VCTKSR שגיאת מילים 3.06 עם דמיון 0.97.

• ה-VAE עצמו, כשהוא מוערך בנפרד: AuK-VAE משיג 4.143 PESQ על דיבור, 3.833 על אודיו כללי ו-3.884 על מוזיקה, לעומת MiniMax-H3-AudioVAE עם 3.633, 2.835 ו-2.801 — ניצחון מוחץ שחשוב יותר ממה שנראה, מכיוון שלטנט אקוסטי מאבד נתונים מגביל כל משימה שנבנית על גביו.

הדפוס לאורך הנקודות הללו מעניין יותר מהניצחונות שבכותרת. AuK מקדימה בהרבה בכל מה שמשמעותו "לשנות את מה שנאמר או את האופן שבו הוא נשמע, ולשמור על כל השאר" — עריכת תוכן, פרוזודיה, עריכות אקוסטיות, שחזור. היא קרובה הרבה יותר לתחום בעריכת רגשות ובעריכה פרא-לשונית, כשדיוק הרגשות שלה ב-SpeechEditBench העומד על 9.94 כמעט בלתי ניתן להבחנה מזה של Ming-UniAudio העומד על 3.43, במדד שבו שתיהן חלשות, וציון האקוסטיקה הכולל שלה, 37.07, נמצא בטווח דומה לזה של קווי הבסיס. אז "מודל אחד לכל משימת דיבור" הוא הניסוח של Tencent; אבל מה שהדוח מראה בפועל הוא מודל אחד שמצטיין בכמה מהן ורק נוכח ביתר.

שני צ'קפוינטים: AuK ו-AuK-Flash

Tencent שחררה שתי גרסאות תחת אותו רישיון MIT. AuK היא מודל הבסיס באיכות מלאה, והדוח קובע את הגדרות הדגימה שלו על 32 הערכות פונקציה עם קנה מידה של 2.0 להכוונה ללא מסווג (classifier-free guidance). AuK-Flash היא הגרסה המזוקקת: אתחול עקביות (consistency initialisation) ומטרת DMD מנותקת (Decoupled DMD) המנותבת לפי משימה, תוך יצירה בארבעה שלבים קבועים כשההכוונה כבויה לחלוטין, והדוח מציג זאת כמאיץ של פי 4.5 בזמן ריצה (wall-clock) לעומת המודל המלא בתנאים תואמים. הנתונים של הדוח עצמו שומרים על Flash קרובה ברוב משימות היצירה — 2.85 שגיאת מילים ממוצעת ו-0.790 דמיון ב-Seed-TTS-Eval — וזה מה שהופך את טענת המהירות לכדאית לבדיקה במקום לבטלה: דיפוזיה בארבעה שלבים באיכות קרובה למודל המורה היא מה שיהפוך עורך דיבור בגודל 1.5B לאינטראקטיבי על GPU יחיד. עם זאת, "תנאים תואמים" הוא הביטוי של Tencent לתיאור הקריטריון של Tencent, ומספר פי 4.5 שנמדד על ידי הכותבים הוא בדיוק סוג הטענה שצריכה צד שלישי לפני שהיא משנה כל החלטת רכש.

מה ניתן להריץ כיום

ההיקף המעשי רחב יותר מאשר שחרור משקלים שקט טיפוסי, מכיוון שהקוד הגיע יחד איתו. ההתקנה מיועדת ל-Python 3.10 באמצעות uv או Conda, וה-README מציע יעדי התקנה נוספים שמושכים פנימה את Gradio, צמתי ComfyUI, או את ערימת הכיוונון העדין. כלי שורת הפקודה auk-infer מכסה כל משימה עם אותו מבנה הודעה: --instruction נדרש תמיד, ו--audio אופציונלי בהתאם למשימה. שרת Gradio (auk-gradio) חושף את המודלים עם בורר, וישנם צמתי ComfyUI מותאמים אישית עם תהליך עבודה לשימוש חוזר, אם כי האינטגרציה מתועדת עם מגבלת רצף של 30 שניות למקור ולתוצאה גם יחד. API של Python משקף את ה-CLI, וצינור כיוונון עדין קל משקל מתאמן על JSONL של זוגות הוראה ואודיו תוך שימוש באותו פורמט הודעה כמו בהסקה. ה-README מתאר גם משפר הנחיות (Prompt Enhancer) שהופך בקשות חופשיות לפקודות auk-infer מוכנות להרצה; הוא מצפה לנקודת קצה צ'אט תואמת OpenAI, ונופל למודל SenseVoiceSmall מקומי לזיהוי דיבור כשאין פרטי גישה ל-ASR בענן מוגדרים. מגבלה נוכחית אחת מתועדת בפשטות: Qwen3-Omni אינו נתמך כנתיב המקודד עדיין, ולכן נקודת הבידוק (checkpoint) Qwen2.5-Omni-3B נותרה זו שצריך להוריד.

מה שהמסמכים עדיין לא נותנים לך הוא רף חומרה. לא פורסם נתון VRAM עבור inference. קבצי התצורה כוללים הערת gradient-checkpointing על שיא של כ-91 GB שיורד לכ-75 GB, המתארת את מעטפת הזיכרון בזמן אימון ולא מספר inference ריאלי לפעולה בודדת, ופקודת הייחוס שטוענת את AuK ו-AuK-Flash יחד מפזרת אותן על פני שתי GPUs — תוך ציון ששתיהן יכולות לחלוק אחת. הקצה תקציב להורדה עצמה: כ-6.8 GB לכל וריאנט בתוספת מקודד Qwen2.5-Omni-3B, ולאחר מכן מדוד את הזיכרון על ה-GPU שלך.

מה שלא אושר

הדיוק בנוגע לבלתי ידוע הוא עדיין הטעם בסיקור מודל בשלב כה מוקדם, והדוח הסיר בדיוק פריט אחד מהרשימה הזאת כשהיתר נותרו על כנם:

• אין ריצה עצמאית שאנחנו יכולים למצוא. אין דוגמיות קול של צד שלישי, אין שכפול benchmark, אין התרשמויות בשרשורי דיון. הבעיה הפתוחה הראשונה במאגר נרשמה ונותרה ללא מענה, וספירת ההורדות של כרטיס המודל עדיין נעה בעשרות בודדות, כך שהפער בין טבלה שפורסמה לטבלה ששוחזרה הוא כרגע כל הסיפור.

• ההערכה היא עצמית וצרה בהיבט ספציפי אחד. כל קו בסיס בדוח הוא מודל אחר עם משקלים פתוחים — Qwen3-TTS, Seed-TTS, VoxCPM2, Ming-UniAudio, Step-Audio-EditX, MOSS-VoiceGenerator, RE-USE, MossFormer2-SS. אף אחת מהפלטפורמות הסגורות והמארחות לדיבור, שקונה היה שוקל בפועל להשוות אליהן את AuK, אינה מופיעה, ולכן "מוביל את התחום" כאן פירושו "מוביל את התחום הפתוח שטנסנט בחרה".

השם "AuK" עדיין אינו מורחב בשום מקום במאמר, בכרטיסים או בקוד, והוא מתנגש חזק בחיפוש עם עוף הים, עם American University of Kuwait ועם מאגרים שאינם קשורים.

הצוות כעת לפחות נראה לעין — המאמר כולל 33 מחברים, בראשות זיאנג מה, עם השתייכויות המשתרעות על פני ארגון Tencent Hunyuan, אוניברסיטת שנגחאי ג'יאו טונג, מוסד החדשנות של שנגחאי והאוניברסיטה הטכנולוגית נאניאנג — אך מי בתוך טנסנט מחזיק במודל על בסיס יומיומי, והאם מדובר בקו Hunyuan או בשיתוף פעולה אקדמי נפרד, נותר בלתי מוצהר.

• כיסוי השפות עדיין מתועד רק חלקית: כרטיס AuK-Flash מצהיר על סינית ואנגלית ודוגמאות הקוד מערבבות את שתיהן, אבל למודל הבסיס אין רשימת שפות רשמית. לרישוי יש אותה צורה — AuK עצמו הוא MIT, בעוד שמקודד Qwen המורד בנפרד נושא תנאים משלו, כך ש"מודל MIT" ו"כל מה שצריך כדי להריץ אותו הוא MIT" אינן אותה אמירה.

מדוע מודל דיבור מאוחד עם משקלים פתוחים חשוב

קריאת רשימת המשימות של AuK מול מה שמפתח עושה בפועל היום מבהירה את ההימור יותר מכפי שהיה לפני שהמספרים הגיעו. ביצוע כל העבודות האלה עם הכלים הקיימים פירושו שרשור של כמה מודלים מתמחים — צ'קפוינט פתוח אחד לקלונינג, אחד אחר לשיפור, מפריד נפרד, ועריכה ידנית או בסיוע מודל לתוכן — או השכרה של כמה ממשקי API סגורים ומתארחים, כשכל אחד מתומחר לפי משימה ולפי דקת אודיו, ואף אחד מהם אינו ניתן לעריכה בדרך ש-AuK מתאר. צ'קפוינט יחיד בעל משקלים פתוחים שמתייחס לכל אלה כבעיית יצירה אחת מותנית בטקסט הוא אובייקט שונה באמת, והדוח תומך כעת בגרסה חדה יותר של הטענה מזו שהשיווק הציג: חצי העריכה אמיתי, לא שאיפה. קלונינג קול הפך לסחורה בשנה האחרונה, אבל עריכת תוכן ופרוזודיה מונחית הוראות היא המקום שבו הפלטפורמות הסגורות המארחות עדיין מרוויחות את השוליים שלהן, וציון של 91.83 מול 76.46 בעריכת תוכן הוא הראיה הראשונה לכך שמודל פתוח יכול לכבוש את הקרקע הזו.

ההסמכה הכנה היא שזהו מודל דיפוזיה עם מודל שפה מסוג 3B שחובר אליו לצורך קונדישנינג, והוא יורש את המחירים של המבנה הזה. האיכות אינה אחידה בין משימות — מצוינת במקום שבו המשימה היא "לשמר הכל חוץ מהעריכה", דלילה יותר ברגש — ואין נקודת קצה מתארחת, אין מענה עיבוד קבוצתי (batching) ואין נתוני חביון שפורסמו מלבד ההשוואה הפנימית של גרסת ה-Flash. עבור חלקי צינור הקול שמסביב — ה-LLM שמחליט מה צריך להיאמר, ונקודת הקצה לצ'אט של Prompt Enhancer שתואמת את OpenAI — API לניתוב הוא ההתאמה הטבעית, ו-OrcaRouter מקדם 200+ מודלים במחיר המחירון של הספק ללא תוספת מחיר, כך שמחצית הערימה דורשת מפתח אחד וללא חוזה שני. מחצית האודיו היא עדיין GPU שבשליטתך ו-checkpoint שאיש מחוץ לטנסנט לא בחן.

מי צריך להסתכל עכשיו, ומי צריך לחכות

עבור חוקרי דיבור, בוני כלים וכל מי שעבודתו היא הערכת מודלי קול חדשים, הנימוק להורדת AuK השבוע חזק יותר מאשר ביום הראשון, ועדיין הוא מגיע עם אותו הסתייגות. עכשיו מקבלים ארכיטקטורה מתועדת, מתכון שנראה ניתן לשחזור וטבלה מלאה של יעדים שיש לנצח — וזה בדיוק מה שהופך טענה שלא שוחזרה לכדאי לתקוף. המחיר של הקדימה נשאר סוף שבוע של התקנה ו-GPU. עבור כל מי שבוחר מחסנית קול לייצור, הדוח משנה את צורת ההחלטה בלי להכריע אותה: יש עכשיו מספרים שאפשר להתווכח איתם, אבל הם של הספק, הם אינם כוללים את הפלטפורמות הסגורות שהיית באמת משווה מולן, ועדיין אין API, אין רף VRAM ואין רקורד. יש לעקוב, לפי הסדר: שכפול עצמאי של השורות Seed-TTS-Eval ו-SpeechEditBench; דוגמאות שפורסמו או Space הדגמה נגיש; וספק inference או API מתארח שאימץ את AuK — ובנקודה זו מחיר ה-pass-through בצד שלנו הוא מחיר המחירון של הספק, באותו היום, כי זו המשמעות של 0% תוספת. השאלה המעניינת אינה עוד אם Tencent שחררה מודל TTS נוסף — אלא אם מודל פתוח אחד באמת יכול להחזיק את כל חמש משפחות המשימות האלה בו-זמנית, ועכשיו ש-Tencent פרסמה את התשובה שלה, הדבר היחיד שנותר הוא שמישהו אחר יבדוק אותה.