
Motif-Audio: מודל בסיס האודיו שחברת Motif Technologies שחררה בלי לספר לאף אחד
- qwenחדשQwen: Qwen3.8 Max2026-08-03$2.00 / $6.00 לכל 1M טוקנים · 56 tok/s
- deepseekחדשDeepSeek: DeepSeek V4 Flash 07312026-07-3150אינטליגנציה69כתיבת קוד
- qwenחדשQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 לכל 1M טוקנים · 201 tok/s
- orcaחדשOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicחדשAnthropic: Claude Opus 52026-07-2461אינטליגנציה78כתיבת קוד
- googleGoogle: Gemini 3.6 Flash2026-07-2150אינטליגנציה69כתיבת קוד
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137אינטליגנציה49כתיבת קוד
- metaMeta: Muse Spark 1.12026-07-1651אינטליגנציה71כתיבת קוד
- kimiMoonshotAI: Kimi K32026-07-1557אינטליגנציה76כתיבת קוד
- openaiOpenAI: GPT-5.6 Luna2026-07-0951אינטליגנציה71כתיבת קוד
- openaiOpenAI: GPT-5.6 Terra2026-07-0955אינטליגנציה77כתיבת קוד
- openaiOpenAI: GPT-5.6 Sol2026-07-0959אינטליגנציה77כתיבת קוד
- grokxAI: Grok 4.52026-07-0854אינטליגנציה72כתיבת קוד
- tencentTencent: Hy32026-07-0641אינטליגנציה59כתיבת קוד
- obsidianQwen3.6 35B A3B Uncensored (Aggressive)2026-07-0232אינטליגנציה42כתיבת קוד
- obsidianGemma4 26B A4B Uncensored (Balanced)2026-07-0226אינטליגנציה39כתיבת קוד
- anthropicAnthropic: Claude Sonnet 52026-06-3053אינטליגנציה72כתיבת קוד
- klingKling: Kling 3.0 Turbo2026-06-1757אינטליגנציה52כתיבת קוד57מתמטיקה
- z-aiZ.ai: GLM 5.22026-06-1651אינטליגנציה69כתיבת קוד60מתמטיקה
- kimiMoonshotAI: Kimi K2.7 Code2026-06-1242אינטליגנציה61כתיבת קוד61מתמטיקה
ליד החלק העליון של Motif-Audio כרטיס המודל, יש הערת HTML שאף קורא לא נועד לראות: "TODO לפני פרסום פומבי: להוסיף ל-Model Sources קישורים למאמר ול-demo/Space." היא עדיין שם. ב-22 ביולי 2026, Motif Technologies דחפה את המשקלים, את קוד המודל, קובץ קונפיגורציה וכרטיס של 13KB ל-Hugging Face ב-commit בודד — ואז הפסיקה. אין מאמר. אין Space הדגמה. אין פוסט בבלוג, אין שרשור השקה, אין הודעה לעיתונות. כעבור שבועיים המאגר מציג 14 הורדות ו-14 לייקים, שזה בערך מה שמודל מקבל כשהאנשים היחידים שמוצאים אותו הם אלה שכבר עוקבים אחרי דף הארגון.
השתיקה היא החלק המטעה, כי הכרטיס שמתחתיה אינו סתם מציין מקום. הוא מתעד אוטואנקודר אודיו דו-זרמי עם 726M פרמטרים, כולל בנצ'מרקים על 21 מערכי נתונים מול DAC, EnCodec, Mimi, X-Codec2, SemantiCodec, WavLM, HuBERT ו-Whisper Large v3, מגיע עם קוד הסקה עובד, ומשחרר את כל העניין תחת MIT. כל מה שבמאמר הזה לקוח מהמאגר הזה — הכרטיס, config.json ו-model.py — בתוספת חשבונות שעשינו בעצמנו היכן שהכרטיס משמיט מספר. כל נתון ביצועים להלן הוא של Motif עצמו, הופעל על ידי Motif, ללא שכפול: ככל הידוע לנו, איש מחוץ לחברה עדיין לא פרסם אפילו מדידה עצמאית אחת של המודל הזה.
מהו Motif-Audio, וארבעת הדברים שהוא אינו
מדובר באוטואנקודר לצליל. מאכילים אותו בצורת גל מונו גולמית של 16 קילו-הרץ; הוא מקודד אותה לייצוג סמוי רציף, ומפענח את הייצוג הסמוי חזרה לצורת גל. כרטיס המודל מתיר בדיוק שני שימושים ישירים: שחזור וווקודינג עצבי לשמע ודיבור כלליים, ושימוש בייצוג הסמוי כייצוג קלט עבור מודל אחר בהמשך. זהו מוצר צר יותר ממה שהביטוי "מודל יסוד לשמע למטרות כלליות" מרמז, ואי-ההתאמה הזו היא המקום שבו רוב הקוראים טועים.
• זה אינו המרת טקסט לדיבור. אין שום התניה מבוססת טקסט מכל סוג שהוא, וכרטיס המודל מפרט במפורש שסינתזה מותנית בטקסט היא מחוץ לתחום. הוא יכול רק לעבד מחדש אודיו שכבר קיים.
• זה אינו מקור טוקנים למודלי שפה אודיו. הלטנט הוא רציף, ולא רצף של אינדקסי קודבוק מקוונטטים. לכן הדפוס בסגנון Moshi/Mimi של הזנת טוקני אודיו בדידים למודל שפה אינו חל. הכרטיס אומר זאת במפורש, וזו מידה מבורכת של משמעת — לא מעט מהדורות קודק מאפשרות לקוראים להניח אחרת.
• הוא אינו פס מלא. דגימה של 16 קילוהרץ מציבה תקרת ניקוויסט קשיחה של 8 קילוהרץ על כל מה שהיא נוגעת בו. מצוין לזיהוי דיבור ואירועים; חומה להפקת מוזיקה או לכל דבר הזקוק לאוויר ולסיבילנטים שלמים.
• ולמרות המילה 'codec', הוא אינו מדחס קצב סיביות. זה זקוק לסעיף משלו, מכיוון שטבלת השחזור של הכרטיס עצמו מזמינה בדיוק את ההשוואה שהארכיטקטורה לא יכולה לתמוך בה.

העיצוב הדו-זרמי, ומדוע היה זול לאמנו
המודל מריץ צורת גל אחת דרך שני מקודדים מקבילים וממזג אותם.
• הזרם הסמנטי קפוא והוא מבצע את העבודה הכבדה. הוא קורא ספקטרוגרמת log-mel עם 80 תאים כתמונה דו-ממדית ומעבד אותה עם טרנספורמר ראייה בעל 48 שכבות, רוחב 1024 ו-16 ראשי קשב, תוך שימוש בפאצ'ים של 16x16, אמבדינגים רוטריים דו-ממדיים וארבעה טוקני רג'יסטר — כ-605 מיליון מפרמטרי המודל. הוא אומן מראש בעצמו באמצעות מידול ספקטרוגרמה מוסווה: לחזות אזורי זמן-תדר מוסווים מתוך סביבתם, ללמוד מבנה תוכן מאודיו לא מסומן, ואז להקפיא.
• הזרם האקוסטי זעיר ומאומן.הוא קורא מל-ספקטרום של 160-bin ברזולוציה גבוהה יותר ומטמיע אותו עם Conv2d יחיד שהליבה שלו משתרעת על כל גובה 160-bin ועל שני פריימים בזמן — מסלול רדוד במכוון שתפקידו היחיד הוא הפרט הספקטרלי העדין שהמקודד הסמנטי משליך.
• Fusion היא שכבת קרוס-אטנשן אחת שבה הטוקנים האקוסטיים משמשים כ-query והטוקנים הסמנטיים כ-keys ו-values, ואחריה חיבור שיורי ונורמליזציית RMS. איזה סטרים משמש כ-query משנה, כפי שהחלק הבא מראה.
• המפענח הוא עמוד שדרה של ConvNeXt בעל 12 בלוקים, עם שכבת ביניים ברוחב 4096, אקטיבציות Snake וראש inverse-STFT שמנבא את הגודל והפאזה ומשחזר את צורת הגל ישירות, ללא אוטורגרסיה.
רק 121M פרמטרים — המקודד האקוסטי, שכבת האיחוד והמפענח — אומנו אי פעם. זו העובדה המעניינת מבחינה כלכלית שמסתתרת במספר הפרמטרים: Motif השיגה מודל אודיו תחרותי מתוך שלד קפוא של למידה עצמית בתוספת קליפה קטנה שאומנה, שזה תקציב שונה מאוד מאימון 726M פרמטרים מקצה לקצה. זה גם עיצוב שמהמר בשקט על הכל באיכות המקודד הקפוא.
אי-התאמה קטנה אחת שכדאי לציין לכל מי שסופר: הכרטיס מציין 726M בסך הכול, בעוד שקורא ה-safetensors של Hugging Face מונה 752.4M פרמטרים מסוג BF16 בנקודת הבידוק. פער של 26M, ללא הסבר. לא דגל אדום — הבדלי חשבונאות במאגרים וב-heads הם דבר רגיל — אבל המספר שבכרטיס אינו המספר שבקובץ.
המספר שהכרטיס אף פעם לא מדפיס
בשום מקום בכרטיס המודל לא מצוין קצב הפריימים של הלטנט, הממדיות שלו לשנייה, או קצב ביטים מקביל. כל אחד מאלה ניתן לגזור מconfig.jsonוmodel.py, והתשובה ממסגרת מחדש את כל טבלת השחזור. החשבון, שכל אחד יכול לבדוק:
• אודיו של 16,000 הרץ עם אורך הופ של 160 נותן 100 מסגרות מל לשנייה.
• הטמעת התיקון האקוסטי משתמשת בגרעין של 160-bin על 2-frame עם stride תואם, כך שהיא פולטת 50 אסימונים בשנייה בממדים של 1024.
• שכבת המיזוג מקדישה קשב מהזרם האקוסטי לזרם הסמנטי, כך שהלטנט הממוזג יורש את אורך הרצף האקוסטי: 50 וקטורים לשנייה, ברוחב 1024.
• הקונבולוציה המהופכת של המקודד מבצעת דגימת-על (upsampling) של הטוקנים הללו בדיוק פי 2, חזרה ל-100 פריימים, וראש ה-iSTFT עם הופ של 160 הופך 100 פריימים ל-16,000 דגימות. השרשרת נסגרת — וזו הבדיקה לכך שקריאת ה-50 הרץ נכונה.
עכשיו תמחרו את זה. ב-bfloat16, 50 וקטורים בשנייה כפול 1024 ממדים כפול 2 בתים זה 102.4 kB/s, או בערך 819 kbit/s. PCM לא דחוס ב-16 ביט בתדר 16 קילו-הרץ הוא 256 kbit/s. ה"ייצוג הרציף הקומפקטי" הוא בערך גדול פי 3.2 מהאודיו הגולמי שהוא מקודד, ובערך פי 6 מגודלו של ספקטרוגרם המלב (mel spectrogram) עם 160 התאים שהוא מחושב ממנו.
זו לא שערורייה — זה מה שמרחב לטנטי גנרטיבי אמור להיראות, כמו שמרחב לטנטי של VAE לדיפוזיית תמונות אינו JPEG. אבל זה כן אומר שטבלת השחזור נותנת ציון ל-Motif-Audio מול מערכות שמבצעות עבודה קשה יותר מהותית. Mimi, EnCodec, DAC ו-X-Codec2 בתצורות הסטנדרטיות שלהן פועלות איפשהו בטווח של בערך 1 עד 6 kbit/s. Motif-Audio משחזר ממשהו בסדר גודל של פי מאה יותר מידע לשנייה. קראו את הטבלה הזו כראיה לכך שהמפענח נאמן, לא כראיה לכך שזה דוחס טוב יותר מ-DAC. לזכותה של Motif, החלק של out-of-scope כבר מזהיר מפני התייחסות אליה כאל token codec; חלק ההערכה בכל זאת מכניס אותה לטבלה עם ארבעה כאלה.
הערה אחת על החישוב שלנו: זה נגזר, לא מוצהר על ידי הספק. אם קראנו לא נכון את כיוון האיחוי, התיקון עולה שורה אחת — טען את המודל והדפס את הצורה של z_fused.
לקרוא בכנות את לוח התוצאות של מוטיף עצמו
ההערכה הסמנטית מקפיאה את מאפייני המודל ומאמנת עליהם פרוב MLP קטן, על פני 21 מערכי נתונים בשלוש משפחות, מול שש קווי בסיס. זהו פרוטוקול סטנדרטי ורחב באמת. הוא גם מבוצע כולו על ידי הספק.

• בצליל סביבתי הוא גורף את כל העמודות. דיוק ESC-50 0.911, UrbanSound8K 0.871, DESED F1 0.616, FSD50k mAP 0.478, Clotho R@1 0.066, ו-FSD18-Kaggle mAP 0.759 לעומת 0.496 של Whisper Large v3 — הפער הרחב ביותר בכל הכרטיס. אם אתה בונה תיוג אודיו או זיהוי אירועים אקוסטיים, זו התוצאה שצריכה לגרום לך להוריד אותו.
• בדיבור הוא הטוב ביותר בשלוש מתוך אחת עשרה עמודות — CREMA-D 0.744, RAVDESS 0.726, VoxCeleb1 0.754. זוהי זיהוי רגשות וזהות דובר, בדיוק מה שזרם הנושא גוון ומרקם אמור להיות טוב בו. Whisper Large v3 עדיין מוביל על פני רוב השאר.
• יש חור אחד ברור. ב-inverse-WER של LibriSpeech-100h, Motif-Audio משיג 0.000, לעומת 0.900 עבור Whisper Large v3 ו-0.825 עבור HuBERT. Fluent Speech Commands משיג 0.800 לעומת 0.987 של HuBERT. חלק מזה נובע כנראה מהכלי ולא מהמודל — גם DAC, SemantiCodec ו-MSM-MAE משיגים בדיוק 0.000 בעמודה הזו, ובדיקת MLP ברמת פריים היא דרך גרועה לזיהוי. אבל המסקנה המעשית נכונה בכל מקרה: אם אתה צריך תכונות קפואות ל-ASR, זה לא המודל.
• הטבלה משמשת גם כניסוי אבלציה, ונראה ש-Motif לא ציין זאת.MSM-MAE, אחד מששת קווי הבסיס, הוא מאותה משפחת מודלים של ספקטרוגרמה מוסווית שממנה מגיע המקודד הסמנטי הקפוא. לכן השוואה בין שתי השורות הללו מודדת מה הזרם האקוסטי המאומן באמת משיג. Motif-Audio מנצח ב-15 מתוך 21 העמודות, משיג תיקו באחת, ומפסיד בחמש. כל שש עמודות הסביבה משתפרות, כמה מהן במידה רבה. שניים מחמשת ההפסדים הם במוזיקה: FMA 0.582 לעומת 0.627, NSynth 0.699 לעומת 0.730. הוספת פירוט אקוסטי עוזרת מאוד באירועי קול ובפארה-לשוניות, ופוגעת מעט בסיווג גוון הצליל המוזיקלי.
• טור אחד הוא הטוב בטבלה ועדיין גרוע. מוטיף-אודיו מובילה בתמלול תווים של MAESTRO עם F1 של 0.200, בעוד שכל מערכת אחרת נעה בין 0.000 ל-0.128. ניצחון בטור שבו התקרה היא 0.2 אינו יכולת תמלול; הוא הערה שתכונות קפואות אינן יכולות לבצע משימה זו עדיין.
שחזור: חזק, ועדיין לא הטוב ביותר בטבלה שלו
ב-LibriSpeech test-clean, Motif-Audio משיג PESQ 3.768, STOI 0.980, ו-1.97% WER על האודיו המשוחזר, עם FAD של 0.4506. DAC גובר עליו בשניים מתוך ארבעת המדדים הללו — PESQ 4.010 ו-FAD 0.2099 — ומנצח אותו בהפרש קטן ב-WER עם 1.94%. Motif-Audio זוכה ב-STOI לחלוטין. בהשוואה ל-Mimi (PESQ 3.439), EnCodec (2.768) ו-X-Codec2 (2.433), הוא בבירור מקדים, אם כי שוב, בקצב מידע גבוה בהרבה.
השורה המגלה ביותר בשקט היא האחרונה: FLEURS קוריאנית, PESQ 3.731, CER 5.13%, FAD 0.1448 — ה-FAD הטוב ביותר בכל הטבלה. זוהי ההערכה היחידה שאינה באנגלית בכרטיס, ולא הורצה לצדה שום baseline. עבור חברת AI ריבונית קוריאנית, הערכת שחזור קוריאנית ודיווח עליה ללא מתחרים נראית פחות כמו benchmark ויותר כמו מבחן קבלה פנימי שהגיע לכרטיס הציבורי.
ארבעה רפוזיטוריז בשלושה ימים
Motif-Audio לא הגיע לבד, וההקשר הזה משנה מה שזה כנראה.
• 20 ביולי — Motif-3-Beta, מודל הדגל עם 315B פרמטרים מסוג mixture-of-experts, שמדד ה-Artificial Analysis Intelligence Index שלו, שעמד על 44, הציב אותו במקום השלישי מבין המודלים הפתוחים בעולם. סיקרנו את השחרור הזה בנפרד; זה המודל שהפך את החברה לנראית מחוץ לקוריאה.
• 21 ביולי — Motif-Vision-Encoder, טרנספורמר ראייה בעל 7B פרמטרים, עם תוצאות שפורסמו בהשוואה ל-DINOv3, V-JEPA 2.1 ו-SigLIP2.
• 22 ביולי — Motif-Audio.
• מוקדם יותר — Motif-VAE, ממיר וידאו, ביוני; Motif-Video-2B באפריל.

שני דפוסים בולטים מתוך הרשימה. הראשון הוא רישוי: הרכיבים כולם MIT — מקודד האודיו, מקודד הראייה, ו-VAE של הווידאו — בעוד Motif-3 (Beta), מודל השפה הדגל, מוגבל לשימוש אישי, חינוכי ולמחקר לא-מסחרי. Motif נותנת בחינם את החלקים וחוסמת את המוח. זוהי אסטרטגיה קוהרנטית עבור חברה שהכנסותיה נשענות על עסקי המחשוב של Moreh ועל תוכנית AI ריבונית של הממשלה הקוריאנית, ולא על מכירת משקלים.
הנקודה השנייה היא שרשימת הרכיבים מתחילה להיראות כמכלול. עמוד שדרה לטקסט, מקודד חזותי, טוקנייזר וידאו, ועכשיו אוטואנקודר שמע, שהכרטיס שלו מפרסם, כיכולת שלישית, "מתן בסיס שעליו יוכלו להיבנות מודלים של המרת טקסט לאודיו ויצירת מוזיקה." הספרייה המוצהרת במאגר היא diffusers. לטנט רציף ברוחב 1024 יחד עם diffusers הוא המצע הסטנדרטי ליצירת אודיו בדיפוזיה סמויה. Motif לא הכריזה על דבר כזה — זוהי היסק מארבעה מאגרים ומתג מטא-נתונים, לא מפת דרכים. אבל זו הקריאה שהארטיפקטים תומכים בה.
פער האימוץ בין האחים בולט, וכדאי לזכור את זה כשרואים את מונה ההורדות: Motif-3-Beta עומד על 4,674 הורדות ו-210 לייקים, Motif-Vision-Encoder על 2,143, ו-Motif-Audio על 14. אותו ארגון, אותו שבוע, שלושה סדרי גודל זה מזה. שום דבר באיכות של מודל האודיו לא מסביר את זה. מה שמסביר את זה הוא אי-ההכרזה עליו.
להריץ אותו, ואיפה מודל כזה מתאים
מדור תחילת העבודה ישר בצורה יוצאת דופן לגבי הקצוות החדים שלו, וכל אחד מהם יעלה לכם שעה אם תדלגו עליהם.
• התקן את torchcodec. מהדורות torchaudio האחרונות מפענחות דרכו, כך torchaudio.load מעלה ImportError בלעדיו. סט מלא: torch, torchaudio, torchcodec, diffusers, timm.
• טען עם trust_remote_code=True. קוד המודל מגיע עם המשקלים ומועבר דרך auto_map, ולכן אין מחלקה מקורית של Transformers.
• בצעו Cast עם .to(device, torch.bfloat16), ולא עם torch_dtype ב-from_pretrained.הכרטיס מציין במפורש ששני אלה אינם שקולים: השני משאיר את באפרי ה-mel filterbank ב-float32 ואינו משחזר את הציונים המדווחים. מעט מאוד כרטיסים טורחים לתעד מלכודת ספציפית כל כך, והעובדה שהכרטיס הזה טורח — מרמזת שמישהו נכווה ממנה פנימית.
• הזינו אותו במונו 16 קילו-הרץ, מעוצב כ-(batch, 1, samples), מרופד כך שמספר מסגרות מל מתחלק ב-16, ואז גזמו את הפלט בחזרה. הכרטיס כולל pad_for_model, פונקציית עזר שעושה את החישוב.
• Forward מחזיר ארבעה טנזורים: את צורת הגל המשוחזרת, בתוספת z_fused, z_sem ו-z_acou, כך שניתן להשתמש בכל אחד מהזרמים בנפרד כתכונות.
מה שלא תמצאו הוא נקודת קצה מתארחת. סרגל הצד של Hugging Face עצמו אומר זאת במפורש: "המודל הזה לא פרוס על ידי שום ספק Inference." Motif-Audio היא משקלים, לא API — אף אחד לא מארח אותה, כולל אותנו — ועבור משהו שחי בתוך לולאת האימון שלכם או בתוך מחלץ המאפיינים שלכם, זו הצורה הנכונה. כדאי להיות ברורים לגבי איזה חצי של מחסנית אודיו זה מתאר. החלקים שאתם שוכרים הם שכבת הסינתזה ומודל השפה שעושה את החשיבה בין האוזניים; ב-OrcaRouter אלה יושבים מאחורי מפתח אחד במחיר המחירון של הספק עם 0% תוספת ו-failover אוטומטי, כך שהחלפת OpenAI TTS-1 HDבספק דיבור אחרהיא שינוי במחרוזת ולא מחזור רכש. החלקים שאתם מארחים הם אלה שאתם מכווננים עדין, מכמתים ומטמיעים לתוך צינור — מקודד קפוא כמו זה. קודק הוא לא בעיית ניתוב. ספק סינתזה שאולי תחליפו ברבעון הבא — כן.
מה שעוד לא ניתן לדעת
• אין מאמר. ה-TODO של הכרטיס עצמו מבטיח אחד; מדף ה-Papers של הארגון ב-Hugging Face עדיין מציג רק את הדוחות הטכניים של Motif-Video 2B ו-Motif 2 12.7B. עד שמאמר שמע יגיע, תיאור הארכיטקטורה הוא כל מה שיש, ללא אבלציה המסבירה מדוע הזרם הסמנטי נשאר קפוא או מול מה נבחר גודל ה-patch האקוסטי.
• אין חשיפת נתוני אימון."אודיו לא מסומן" הוא כל ההצהרה. רישיון MIT על המשקולות פותר את סוגיית רישיון הקוד ואינו פותר דבר בנוגע למקור הנתונים — ובניגוד לכרטיס מקודד הראייה, שמעביר במפורש את האחריות לעמידה ברישיונות מערכי הנתונים למשתמשי הקצה, כרטיס האודיו אינו מעלה את הנושא כלל.
• אין נתוני השהיה, תפוקה או סטרימינג.טרנספורמר עם 48 שכבות על חלונות ספקטרוגרף של 5.12 שניות אינו בעליל עיצוב בזמן אמת, והכרטיס אף פעם לא טוען שזה כך. אם אתה שוקל אותו לאודיו חי, הנח שאתה זה שיצטרך למדוד.
• אין גרסת 24 kHz או 48 kHz, אין buildים מכומתים, אין demo Space, אין דוגמאות שמע להאזנה. עבור מודל שכל ההבטחה שלו היא איכות שחזור, השקה ללא ולו קליפ אחד של לפני/אחרי היא השמטה מוזרה.
• אין כל הערכה בלתי תלויה. כל מספר כאן הוא של Motif.
שלוש שאלות שהריפו הזה הולך לקבל
האם אני יכול לבנות מוצר קולי על זה?
לא עם מה ששוחרר. אין התניית טקסט, כך שהוא לא יכול לדבר — הוא יכול רק לעבד מחדש אודיו שאתה נותן לו. מה שהוא יכול באופן סביר לעשות הוא לשבת מתחת למוצר קולי שמישהו אחר מאמן: מודל טקסט-לדיבור או טקסט-לאודיו שלומד לחזות z_fused מטקסט, כשהמפענח של Motif-Audio הופך את הלטנט הזה לצליל. זה בדיוק מסר ה״Generate״ בפתיחת הכרטיס. זהו בסיס למוצר, לא מוצר.
האם רישיון MIT באמת בטוח לשימוש מסחרי, בהינתן שהדגל אינו?
הרישיונות ב-Hugging Face הם לכל מאגר בנפרד, וזה חד-משמעי: MIT — אפשר להשתמש, לשנות ולהפיץ מסחרית, לשמור על ההודעה, ללא אחריות. הסיבוך אינו בנוסח הרישיון אלא בהיעדר הצהרת נתונים. הכרטיס של מקודד הראייה מטיל בכתב את האחריות לעמידה ברישיון מערך הנתונים על המשתמשים במורד הזרם; כרטיס האודיו אינו מזכיר שום קורפוס. אם זה מיועד למוצר משווק, זו שאלה לייעוץ המשפטי שלך, לא לכרטיס מודל. הכרטיס גם מציין, בצדק, ששחזור נאמן הופך את המודל לרכיב שמיש בצנרת של שיבוט קול והתחזות.
האם עלי להחליף את DAC, EnCodec או Mimi בזה?
זה תלוי לחלוטין למה נועד הקודק שלך. לשידור או אחסון מוגבלי רוחב פס — לא, האריתמטיקה של קצב הסיביות לעיל פוסלת זאת, וזו לא המשימה שלשמה הוא נבנה. כמחלץ תכונות קפוא לתיוג אודיו, זיהוי אירועים או פראלינגוויסטיקה, הוא החזק ביותר בטבלה שלו בפער ניכר, ברישיון MIT, וזול להערכה: הפעל את בדיקתך, השווה לשלדה הנוכחית שלך, ושמור על המנצח. כמרחב החבוי למודל אודיו גנרטיבי, זה סביר וברור שזה השימוש המיועד — אבל תהיה הראשון לפרסם תוצאה כזו, וזו הזדמנות או אזהרה, תלוי במועד האחרון שלך.
מה לצפות
הדבר האינפורמטיבי ביותר בנוגע למאגר הזה במהלך החודש הקרוב הוא האם אותו TODO ייפתר אי פעם. אם יופיעו מאמר, Space להדגמה ואחות מטקסט-לאודיו, אז Motif-Audio היה הרכיב הציבורי הראשון במחסנית omni-modal, ששוחרר מוקדם משום שהחלקים הם MIT והדגל הראשי אינו, ו-14 הורדות ייראו כהערת שוליים. אם המאגר יישאר ב-commit אחד לאורך הסתיו, זה היה רכיב פנימי שמישהו הפך לציבורי כי MIT היה קל יותר מדליון פרטי, והארטיפקט המעניין היה תמיד הנוסחה של backbone קפוא בתוספת מעטפת קטנה, ולא ה-checkpoint.
בכל מקרה, המשקולות עלו, הרישיון מתירני, והעמדה הכנה עבור כל מי שנמצא מחוץ למוטיף כרגע היא שקראנו כרטיס מודל טוב מאוד ואף אחד לא בדק אותו. הדרך המהירה ביותר להתחיל לבדוק היא לטעון אותו ולהדפיס את הצורה של z_fused.
