כותרת שנוצרה שכותרת-העל שלה 'עיון במודל', עם הכותרת 'Muse Voice Transcribe' והכתובית 'מודל תמלול הדיבור בזרימה של Meta ב-Model', מעל ארבעה כרטיסים מעוגלים שעליהם כתוב: '0.18$ לשעת אודיו', 'WebSocket בזרימה + נקודת קצה לקובץ', '25 נבחנו עם החלפת קודים' ו'חותמות זמן ברמת שיחה, לא ברמת מילה', עם כותרת תחתונה: 'מקור: עמוד המודל והתיעוד של Meta עצמה, 2026-09-29.'
Guides & Insights

Muse Voice Transcribe: מודל תמלול דיבור לטקסט בזרימה של Meta, מוסבר

מחבר

Magnus Corvin

תאריך פרסום

מודלים אחרונים · 20צפו בכל המודלים →
בנצ'מרקים: Artificial Analysis · מתעדכן יומית
חזרה לכל הפוסטים

Muse Voice Transcribe הוא מודל תמלול הדיבור לטקסט בזרימה של Meta. הוא פועל ב-Meta Model API במחיר של $0.18 לשעת אודיו, תחת מזהה המודל muse-voice-transcribe-1.0, והמחיר זהה בין אם תזרימו אודיו חי ובין אם תעבירו הקלטה מוכנה. מה שהופך אותו לראוי לעמוד עיון ולא לבדיקת מחיר של שורה אחת הוא היכן מתרחשת העבודה: ייחוס דוברים ליותר מעשרים קולות וזיהוי סוף דיבור פועלים בתוך מודל הזיהוי, ולא במעבר אצווה שמתווסף בסוף הזרימה. זהו תמלול דיבור לטקסט בלבד — מסמכי המפתחים של Meta אומרים זאת במפורש: הוא אינו מסנתז דיבור ואינו מספק API לשיחה מדיבור לדיבור.

זהו הדף שאליו מגיע קורא לאחר חיפוש שם המודל עצמו, ולכן הוא נבנה כדי להיות התשובה היציבה לשתי שאלות — מהו המודל הזה, וכמה עולה שעת אודיו — ולא כהכרזה. תאריך אחד ראוי להירשם לפני כל דבר אחר, משום שהוא עובדה על המודל ולא הסיבה לקיומו של הדף: Meta Superintelligence Labs הציגה את Muse Voice Transcribe ב-2026-09-01, בפוסט ההכרזה המתוארך מציגים את Muse Voice Transcribe — הפוסט שקורא עדיין יכול להגיע אליו דרך אינדקס הבלוג של Meta, אף שהוא כבר אינו עונה בכתובת ה-URL שלו. כל מה שלהלן נקרא בעמודים של Meta עצמה ב-2026-09-29, בעיקר עמוד המודל ותיעוד ה-API בנושא תמלול מדיבור לטקסט וסקירה כללית. כאשר Meta אינה מפרסמת נתון, הדף הזה אומר זאת במקום לפנות לנתון תחליפי.

מה זה, במונחים של מטא

התיעוד של Meta עצמה פותח את תיאורו בפשטות: "Muse Voice Transcribe הוא מודל המרת דיבור לטקסט של Meta ב-Meta Model API. תמלל אודיו חי או הקלטה קיימת, עם זיהוי תורות דיבור, תוויות דובר והטיית אוצר מילים." עמוד הסקירה מצמצם את אותו הדבר למשפט אחד — דיאריזציה של דוברים בזרימה, זיהוי נקודות סיום וזיהוי פעילות קולית מובנים, הטיה הקשרית והטיית מילות מפתח, ו-25 שפות שנבחנו עם החלפת קודים. כך שהפלט הוא זרם תמלול יחיד הנושא שלוש תוויות בבת אחת: המילים, מי מדבר, והאם המבע הסתיים. זהו השילוב שרוב מערכי הייצור מרכיבים כיום ממזהה דיבור בתוספת גלאי פעילות קולית נפרד בתוספת מודל דיאריזציה נפרד, שלכל אחד מהם תקציב השהיה משלו.

עמוד המודל של Meta מציג זאת כ"השהיה תחרותית ודיוק תמלול בזרימה עם ייחוס חי ל-20+ דוברים", ותיעוד המפתחים מתאר את שדה הפלט כ"טקסט תמלול עם תזמון ברמת התור ותוויות דובר אופציונליות". שני דברים נובעים מכך, ושניהם חשובים יותר מהמסגור:

• זהו מודל של קלט אודיו ופלט טקסט. הוא אינו קלט טקסט ולא פלט טקסט, ומטא מבהירה במפורש שהוא אינו מחולל דיבור.

• זהו מודל סטרימינג בראש ובראשונה. נתיב זמן האמת אינו עטיפה סביב נתיב הקובץ; זהו סשן WebSocket עם אירועים, מצבים ומגבלות משל עצמו, המתוארים להלן.

כמה עולה שעת אודיו

עמוד המודל של Meta עבור Muse Voice Transcribe מציין את המחיר כ"בנייה עם מודל יחיד במחיר $0.18 לשעה", וטבלת המפרט שלו מציינת את muse-voice-transcribe-1.0 ב-$0.18 לשעה של אודיו ו-$3.00 לכל 1,000 דקות. אלו שתי דרכים להציג את אותו תעריף ביחידות שונות, ושתיהן מודפסות בעמוד של Meta עצמו כפי שנקרא ב-2026-09-29. תיעוד המפתחים מציין את אותו תעריף בדרך שלישית: "התמחור הוא $0.18 לשעה של אודיו מעובד." אף נתון בעמוד זה אינו מועתק מעמוד תמחור של Meta, משום שאין עמוד תמחור קריא של Meta לקרוא: המסמכים מקשרים את התעריף אל עמוד "תמחור ומגבלות קצב" שעונה הדף הזה אינו זמין כפי שנקרא ב-2026-09-29, כך שעמוד המודל הוא מקור התיעוד לתעריף, והוא היחיד שמשמש כאן.

פרטי החיוב נמצאים במסמכי המפתחים וכדאי להכיר אותם לפני שאתם קובעים את גודל עומס העבודה:

• סטרימינג ולא-סטרימינג עולים אותו דבר. אין תוספת מחיר עבור נקודת הקצה בזמן אמת.

• עיבוד ללא שמירת נתונים מתומחר באופן זהה למסלול Standard, על פי התיעוד — הוא אינו סעיף של תוספת מחיר.

• החיוב מעוגל כלפי מטה לשניות שלמות, כך שתור של שתי שניות מחויב כשתי שניות ולא שלוש.

• כשלים המתרחשים לפני הפקת תמלול אינם מחויבים, וכך גם 429 תגובות של הגבלת קצב.

• קרדיטים חינם קיימים ברמת הפלטפורמה, לא ברמת המודל. התיעוד של Meta לדיבור-לטקסט מסתיים את פסקת התמחור שלו במשפט "קרדיטים של מסלול חינם בפלטפורמה חלים." זהו הניסוח היחיד שמזכיר משהו חינם בדפים עבור המודל הזה, והוא בכוונה לא ספציפי: הוא מצביע על תוכנית קרדיטים של הפלטפורמה במקום להבטיח הקצאה חינם לתמלול, ושום נתון, משך או כלל זכאות לא מודפס עבורו. יש לקרוא אותו כקרדיט שעשוי להפחית את החשבון, לא כמסלול חינם עבור המודל. הצהרת Meta הפונה לצרכנים שהסוכן האישי שלה הוא "חינם עבור רוב מה שאנשים צריכים" היא משפט נפרד על אפליקציית Muse ואינה חלה על Model API.

דוגמה מחושבת, כי קשה להרגיש מחיר לפי שעה: ראיון מוקלט בן שעתיים עולה $0.36 לתמלול. אלף שעות של אודיו משיחות — בערך הנפח החודשי של מרכז קשר בינוני — מסתכמות ב-$180. בקנה מידה כזה, התעריף הוא הטיעון כולו, ותעריף הוא גם הדבר היחיד שיכול לזוז לך מתחת לרגליים: העמוד של Meta הוא הסמכות בנושא, ואם הנתון משתנה שם, הוא משתנה כאן.

ממשק הסטרימינג, נקודת קצה אחר נקודת קצה

This is the part a reference page owes a reader that a launch write-up cannot carry, so here it is in the order you meet it. Base URL for Model API is https://api.meta.ai/v1 with a Bearer token, and Muse Voice Transcribe adds two endpoints on top of it.

• אודיו חי — wss://api.meta.ai/v1/asr/realtime. התעבורה היא WebSocket, ופרט האימות הוא מלכוד: אתה מבצע אימות בפריים של לחיצת היד, ומתעלמים מהכותרת Authorization. לחיצת היד חייבת להיות פריים טקסט ה-JSON הראשון ולהגיע בתוך 10 שניות. סשן נמשך עד 60 דקות, WebSocket חדש יוצר סשן חדש, ואין טוקן חידוש.

• הקלטות — POST https://api.meta.ai/v1/asr/transcribe.העלאה מסוג Multipart, וזה כן מבצע אימות עם כותרת Authorization. הקלט מצומצם: מונו 16-ביט PCM WAV ב-16 או 24 קילו-הרץ בלבד. המגבלות הן 32 MB לכל גוף ו-10 דקות של אודיו לכל בקשה.

בתוך סשן בזמן אמת, שלושה מצבים משנים את מה שמועבר אליך. PUSH_TO_TALK הוא ברירת המחדל ומבצע תמלול של תור בודד. ENDPOINTING מספק גבולות תור שזוהו על ידי המודל, תור אחד לכל מקטע דיבור שזוהה, ופולט אירועי speechStart, חזרה של transcript, speechEnd ו-speechComplete — עם האזהרה ש-speechEnd אינו התמלול. DIARIZATION מוסיף זיהוי דובר אוטומטי וייחוס, ופולט אירועי speaker עם תוויות כמו A ו-B. תמלולים חלקיים מגיעים או באופן מצטבר, שבו כל תמלול חלקי מחליף את הקודם, או כדלתות.

שני פרטים תפעוליים מאותו תיעוד קל לפספס ויקרים לגלות בסביבת הייצור:

• דיאריזציה מסמנת דובר חדש אפשרי ולא נקודת סיום דיבור נקייה, ו-Meta מצהירה שהיא אינה מכווננת לשימוש בהשהיה נמוכה ובפקודות קוליות. התייחסו לתוויות כמזהים המוגדרים לפי מפגש — A במפגש אחד אינו אותו אדם כמו A במפגש הבא.

• תורות עשויים לחפוף זה לזה, לכן מצב ברמת התור צריך להיות ממופתח לפי מזהה התור ולא לפי סדר ההגעה.

• התקרות המפורסמות לכל דייר הן 128 זרמים במקביל ו-16,000 זרמים בשעה.

מה רץ בתוך המודל, ומה הוא מחליף

עמוד המודל של מטא מציג טענה ספציפית על הארכיטקטורה ולא על ציונים: "ייחוס דובר עבור יותר מ-20 דוברים וזיהוי סוף דיבור מתרחשים בתוך מודל הזיהוי" — והוא מעמיד זאת במפורש בניגוד למעבר אצווה בסוף זרם האודיו. ההבדל המעשי הוא שאין שלב שני שיש להמתין לו. תוויות דובר וגבולות תור מגיעים באותו זרם שבו מגיעות המילים, כך שסוכן קולי במורד הזרם או ממשק כתוביות בזמן אמת מקבל תור שהושלם וזהות ללא שלב עיבוד נוסף.

היכולות האחרות ש-Meta מתעדת כקיימות במודל:

• זיהוי נקודות קצה וזיהוי פעילות קולית מובנים, כך שאינך מריץ VAD משלך לפני ה-API. בלשון התיעוד, אתה מקבל תמלול אחד שהושלם לכל אמירה בלי להריץ זיהוי פעילות קולית משלך, וסוף דיבור שזוהה אינו מסיים את הסשן.

• הטיה הקשרית והטיית מילות מפתח, ללא כוונון עדין. עמוד המודל של Meta מתאר דיוק שנשמר "באמצעות הטיה הקשרית והטיית מילות מפתח, ללא כוונון עדין", וזו התכונה שהופכת זיהוי דיבור אוטומטי בזרימה לשמיש על אוצר מילים תחומי — שמות תרופות, סימולי מניות, מקטי"ם של מוצרים — ולא על הממוצע של השפה הכללית. התיעוד מדייק לגבי המגבלות: מילות מפתח מטות את הזיהוי אך אינן מבטיחות איות מדויק, וגם מילות המפתח וגם הטיית השפה נקבעות מראש בתחילת הסשן.

• 25 שפות שנבדקו עם החלפת קוד. המסמכים מפרטים אותן: ערבית, בנגלית, הולנדית, אנגלית, צרפתית, גרמנית, עברית, הינדי, אינדונזית, איטלקית, יפנית, קנאדה, קוריאנית, מלאית, סינית מנדרינית, מראטהי, פולנית, פורטוגזית, ספרדית, טאגאלוג, טמילית, טלוגו, תאית, טורקית ווייטנאמית. החלפת קוד — באמצע משפט ובאמצע אמירה בלי שנאמר מראש איזו שפה מגיעה — היא היכולת שמזהים חד-לשוניים אינם יכולים להציע מבחינה מבנית. אזהרה אחת שכדאי לזכור: הטיית שפה היא רשימה של שפות, לא הקשר חופשי, והיא לא מכריחה את המודל להשתמש בהן.

פוסט ההכרזה המתוארך מרחיק לכת: הוא אומר שהמודל אומן על 70+ שפות, כש-25 מהן "מאומתות ביסודיות" — לפי דיווח הספק, ורשימת 25 המאומתות היא תת-הקבוצה שמטא עומדת מאחוריה. זהו הכיסוי שצריך לתכנן לפיו, לא ה-70.

המגבלות המתועדות

דף עזר אינו טוב יותר מהאילוצים שהוא מציג, ו-Meta מציגה כמה.

• חותמות זמן ברמת תור, לא ברמת מילה.גם עמוד המודל וגם התיעוד מציינים זאת במפורש: "הוא מחזיר חותמות זמן ברמת תור, אך לא חותמות זמן ברמת מילה." תורים נושאים זמני התחלה וסיום במילישניות. אם המוצר שלך צריך לחיצה כדי לדלג לכל מילה — הדגשת קריוקי, ניתוב ביטחון ברמת מילה, יישור מאולץ — זה המודל הלא נכון, ושום כמות של הנדסת פרומפטים לא תשנה את זה.

• אין ציוני ביטחון, אין זיהוי אירועי קול, אין זיהוי רגשות, אין עיצוב מחדש של תמלול.Meta מפרטת את כל ארבעת אלה כלא זמינים. אתה מקבל מילים, תורות דיבור, תזמונים ותוויות דובר, ושום דבר על מידת הביטחון של המודל.

• אין סינתזת דיבור ואין API לשיחה מדיבור לדיבור. זה בכיוון אחד בלבד.

• פורמטי האודיו מצומצמים בנתיב הקובץ.מונו PCM WAV 16-ביט, 16 או 24 קילוהרץ. כל דבר אחר חייב לעבור המרה לפני העלאתו.

משקלים פתוחים, והבלבול סביב Muse Glimmer

Muse Voice Transcribe הוא קנייני ומסופק דרך ה־API — הוא אינו מהדורה במשקולות פתוחות, והתיעוד של Meta לעולם אינו טוען אחרת. זה חשוב משום שקוראים מנתבים את המסלול במשקולות פתוחות של משפחת Muse לשם הלא נכון. Muse Glimmer הוא המסלול הזה: התיעוד של Meta מתאר אותו כמודל מולטימודלי במשקולות פתוחות שזוקק מ־Muse Spark, המופץ תחת רישיון מתירני Apache 2.0, שאותו מורידים ומריצים על החומרה שלכם באמצעות סביבת הרצה כגון vLLM, SGLang, llama.cpp או ExecuTorch. Muse Voice Transcribe מקובץ באותו עמוד עם Muse Spark, Muse Image ו־SAM כמודלים שקוראים להם ולא מורידים אותם.

אז: אין משקולות ל-Muse Voice Transcribe, אין אפשרות אירוח עצמי, אין דרך לבצע ביקורת עליו או לכוונן אותו. אם דף אומר לך אחרת, הוא בלבל בינו לבין Muse Glimmer. כשהמשקולות של מודל אינן מפורסמות, פלטפורמת ההגשה היא כל הסיפור — וזה מה שהחלק הבא עוסק בו.

איך לקוח מגיע לזה

ה-Model API של Meta בנוי כך שניתן להטמיע אותו בלקוחות שכבר יש לך. הצהרת הספק, המודפסת בעמוד הסקירה של ה-API, היא ש-Model API "תואם באופן מיידי לספריות לקוח תואמות OpenAI ו-Anthropic, ולממשקי CLI של סוכנים תואמי OpenAI. הגדר את כתובת ה-URL הבסיסית של הלקוח שלך, הוסף את המפתח שלך, והשאר את שאר הקוד שלך ללא שינוי." באופן כללי, Model API מציע שלושה סוגי בקשות — Responses API, Chat Completions API ו-Messages API — כך שלרוב לאינטגרציה קיימת יש משטח מתאים ללא שכתוב. הערה אחת לגבי היקף: משפט התאימות הזה ושלושת הצורות האלה הם יכולות של Model API בכללותו, ולא שורות שמודפסות בעמוד המודל של Muse Voice Transcribe עצמו. המדריך המהיר של עמוד המודל עצמו מצומצם יותר — הוא אומר רק ש"תפנה את הלקוח הקיים שלך תואם OpenAI אל Meta Model API", ושתהיה לך בקשה עובדת ראשונה תוך פחות מחמש דקות.

פער אמיתי אחד שראוי לציין בדף עזר: התיעוד של Meta לדגם הזה אינו מציין ספריית לקוח רשמית עבור Muse Voice Transcribe, ועמוד "Client libraries" שלה נמצא תחת מקטע SAM ולא תחת מקטע Voice. מה שמדריך המרת דיבור לטקסט נותן לך במקום זאת הוא רשימת תלויות קונקרטית — Python 3.9 ואילך עם websockets ו-sounddevice כחבילות — ובנוסף ספר מתכונים ליסודות voice-API. אז הטענה בדבר drop-in מתארת את משטח הבקשות של Model API באופן כללי; נקודת הקצה של ASR בזמן אמת עצמה היא WebSocket עם כללי לחיצת יד משלה וללא עטיפה מתועדת.

A screenshot of Meta's model page for Muse Voice Transcribe (captured 2026-09-29), showing the headline 'Competitive latency and streaming transcription accuracy with live attribution for 20+ speakers. Build with a single model at $0.18/hour.', a 'Meet Muse Voice Transcribe' panel of capability cards headed 'Competitive transcription accuracy', 'Live speaker and turn awareness' and 'Production pricing', a 'Muse Voice Transcribe benchmarks' section labelled 'AA-WER Streaming Index - Final Transcription Diarization' with 3.9% and 3.9%, and the pricing row reading muse-voice-transcribe-1.0 at $3.00 per 1,000 minutes and $0.18 per hour.

מה שמטא לא פרסמה

היעדר בנצ'מרק הוא עובדה על התיעוד, ולכן כאן הוא מצוין ככזו. דף המודל של Meta עבור Muse Voice Transcribe אינו כולל טבלת דיוק מודפסת: הראיות לדיוק שלו מסופקות כשלושה נכסי תמונה — לוח דירוג של שיעור שגיאות מילים בזרימה, השוואת שיעור שגיאות דיאריזציה ומדד דיוק בזרימה — ללא נתונים בטקסט הניתן לחילוץ. דף המודל עצמו אינו מספק שיעור שגיאות מילים, שיעור שגיאות דיאריזציה, ולא פילוח לפי שפות.

פוסט ההכרזה אכן כולל נתונים שמדווחים על ידי הספק, לרבות שיעור שגיאת מילים בזרימה ושיעור שגיאת דיאריזציה ממוצע, ואלה המספרים שכתבנו כשהמודל הושק; אלה המדידות של Meta עצמה והן נותרו לא משוחזרות על ידי צד שלישי. הדף הזה אינו מריץ מחדש את ההשוואה הזו, משום שהרצה מחדש של בנצ'מרק ספק מיום ההשקה בעמוד תיעוד תציג נתון שלא שוחזר כאילו היה נתון מוסכם. מה שאפשר לומר בפשטות הוא מצומצם יותר: Meta אינה מפרסמת הערכה ראש-בראש מול מתחרה נקוב במאמץ תואם ובמערכת בדיקה תואמת עבור המודל הזה, ולכן כל השוואה שתקראו בכל מקום היא השוואה של נתוני ספקים שנאספו בתנאים שונים.

תאריך אחד גם נותר בלתי קבוע בכוונה. דף המודל אינו נושא תאריך שחרור כלל — סמן הגרסה היחיד שלו הוא ה--1.0 במזהה המודל. התאריך 2026-09-01 בכתבה זו מגיע מאותו פוסט הכרזה מתוארך, והוא משמש כאן לתיארוך המודל ולא לדיווח על אירוע.

A generated reference scoreboard titled 'Muse Voice Transcribe — the reference', listing six rows for the model: price $0.18 per hour of audio, interface as a realtime WebSocket at wss://api.meta.ai/v1/asr/realtime plus a file endpoint, speaker attribution for 20+ speakers inside the recognition model, turn-level timestamps without word-level times, 25 evaluated languages with code-switching, and proprietary weights with no open download.A screenshot of the Speech to text page in Meta's Model API documentation (captured 2026-09-29), showing the opening sentence 'Muse Voice Transcribe is Meta's speech-to-text model on Meta Model API', an 'Available endpoints' table contrasting wss://api.meta.ai/v1/asr/realtime for live audio against POST https://api.meta.ai/v1/asr/transcribe for a recording and noting that the Authorization header is ignored on the WebSocket, and a Features table whose rows include language biasing across 25 supported languages with code-switching, vocabulary biasing, speech-turn detection, speaker labels, partial transcripts and progress events.

למי כדאי לפנות לזה, ולמי לא

הטיעון בעד Muse Voice Transcribe הוא צר וחזק: אודיו חי שבו צריך מילים, זהות דובר וסיומי תורים באותו זרם, במחיר נמוך מספיק כדי להריץ אותו ברציפות ולא לפי דרישה. סוכני קול, כתוביות בזמן אמת, תובנות מפגישות ושיחות, הכתבה ותמלול בנפח גבוה הם עומסי העבודה ש-Meta מציינת, ואלה עומסי העבודה שהממשק אכן מעוצב עבורם — WebSocket של 60 דקות עם מצבי endpointing ותוויות דובר בהיקף הסשן.

הטיעון נגדו ספציפי באותה מידה. אם אתה צריך חותמות זמן ברמת המילה, רמת ביטחון לכל מילה, זיהוי אירועי קול או רגשות, או עיצוב מחדש של תמלול, למודל הזה אין אותם, וזהו היעדר מתועד ולא באג. אם השמע שלך מגיע בפורמטים שאינם WAV מונו 16-ביט ב-16 או 24 kHz ואתה משתמש בנקודת הקצה לקובץ, אתה משלם על שלב המרה שלא היית משלם במקום אחר. ואם הדרישה שלך היא תמלול באצווה של הקלטות ארכיוניות שבהן הדיוק הוא הציר היחיד, המסר השיווקי של הסטרימינג לא קונה לך דבר — המחיר זהה בשני המסלולים, כך שאתה משלם על יכולת בזמן אמת שלא תשתמש בה.

הדבר היחיד שצריך לבדוק לפני שמתחייבים למסלול ייצור הוא הנתון שהדף הזה קיים כדי לענות עליו, והוא הנתון היחיד שיכול להשתנות בלי שהמודל ישתנה בכלל: $0.18 לשעת אודיו, כפי שמודפס היום בדף המודל של Meta עצמה. הדף של Meta הוא הסמכות בנושא. כשהוא משתנה, כל מה שמחושב לפיו — חודש אלף השעות, העלות לכל ראיון, חשבון הבנייה מול הקנייה — משתנה איתו.