כרטיס כותרת ראשי עבור Muse Voice Transcribe, מודל תפיסת האודיו הראשון בזמן אמת של Meta Superintelligence Labs, המציג צורת גל בזרימה עם תיוג של ASR, הפרדת דוברים ל-20+ דוברים, וזיהוי נקודות קצה, ותג מחיר המציג $0.18 לשעת אודיו.
Guides & Insights

Muse Voice Transcribe עלה לאוויר: מודל תפיסת השמע הראשון בזמן אמת של Meta

מחבר

Rowan Sterling

תאריך פרסום

מודלים אחרונים · 20צפו בכל המודלים
בנצ'מרקים: Artificial Analysis · מתעדכן יומית
חזרה לכל הפוסטים

Muse Voice Transcribe, מודל תפיסת האודיו הראשון בזמן אמת של Meta Superintelligence Labs, הושק ב-1 בספטמבר 2026, והמחיר שלו הוא כמו ספוילר: 3.00 דולר לכל 1,000 דקות שמע — בערך 0.18 דולר לשעה — ב-API של Meta Model. במעבר סטרימינג אחד הוא עושה את מה שרוב מערכי התמלול מפצלים בין שלוש מערכות: זיהוי דיבור אוטומטי, הפרדת דוברים על פני יותר מ-20 קולות, וזיהוי סיום דיבור — המשימה של לקבוע מתי הדובר סיים בפועל ולא רק עצר באמצע מחשבה. Meta מציינת שהמודל מוביל את טבלת הדירוג של Artificial Analysis לזיהוי דיבור לטקסט בסטרימינג, עם שיעור שגיאות מילים של 3.1% בתמלילים סופיים, המועברים 0.16 שניות לאחר שהדובר מפסיק לדבר.

המספר האחרון הזה צריך תווית כנה לפני שהוא עושה כל עבודה: זוהי טענת יום ההשקה של מטא, המתייחסת ללוח תוצאות עצמאי, עבור מודל שהיה ניתן לקריאה במשך פחות מיום כשההכרזה יצאה. איש מחוץ למעבדה עוד לא שחזר את ה-3.1%, וטענת הדיוק היא דבר אחד, בעוד ששאר ההצעה — 70+ שפות שנלמדו, החלפת קוד טבעית, "השהיה אדפטיבית" שנלמדה בלמידת חיזוק — היא קבוצה נפרדת של הצהרות ספק באותה סירה. כל מה בפוסט הזה הוא מצב המודל ביום הראשון, כשמספרי ספק מתויגים כמספרי ספק.

המספרים שחשובים ביום הראשון

• מחיר — $3.00 לכל 1,000 דקות אודיו (בערך $0.18 לשעת אודיו) ב- Meta Model API, במחיר הנמוך מכל API מרכזי לתמלול סטרימינג שאנו עוקבים אחריו.

• טענת דיוק — 3.1% WER בתמלילים סופיים ב-0.16 שניות לאחר סיום הדיבור; 3.6% WER בתמלילים חלקיים ראשונים ב-0.13 שניות. דווח על ידי הספק, תוך ציטוט לוח ההובלה לסטרימינג של Artificial Analysis.

• דיאריזציה — 20+ דוברים, מופקת בזרימה ללא שלב עיבוד נפרד לאחר מעשה (Meta מדווחת על שיעור שגיאת דיאריזציה ממוצע של 17.5%).

• שפות — אומן על 70+; 25 „אומתו בהרחבה" בהשקה; החלפת קוד חלקה בתוך משפטים ובין משפטים.

• הקשר — מטפל באודיו באורך של יותר משעה; הטיית שפה, מילות מפתח והקשר עבור תחומים עמוסי מונחים מקצועיים.

A screenshot of the Meta AI Research announcement post for Muse Voice Transcribe (captured September 2, 2026), showing the headline 'Introducing Muse Voice Transcribe', the September 1, 2026 publication date, and an interactive real-time transcription demo at the top of the page.

מה המשמעות של "מודל תפיסת שמע" כאן.

הארכיטקטורה היא הסיפור. Muse Voice Transcribe קולט אודיו בנתחים של 80 מילישניות ומזרים מילים החוצה כשהן מתקבעות, וזו המשמעות המעשית של "זמן אמת". החלק המעניין הוא איך הוא מחליט מתי להתחייב למילה. במקום תקציב השהיה קבוע — הפשרה הסטנדרטית שבה מזהה דיבור או מתחייב מוקדם ומנחש, או ממתין זמן רב יותר ומתחמק — המודל משתמש במה שמטה מכנה {{1}}"השהיה אדפטיבית"{{/1}}: הוא מתקדם במהירות בדיבור קל, ושומר על יותר הקשר אודיו למילים שהוא פחות בטוח לגביהן. מדיניות ההשהיה עצמה נלמדה באמצעות למידת חיזוק, כך שהמודל למעשה מאזן בין מהירות לדיוק לכל מילה, במקום להחיל הגדרה גלובלית אחת.

ההבחנה הזו היא הסיבה שמטה מכנה את Muse Voice Transcribe "מודל תפיסת אודיו" ולא מודל ASR. זרם הפלט הוא תמלול חי יחיד שנושא גם מידע על מי המדבר ומתי האמירה מסתיימת — שלוש תוויות שמערכות סטרימינג בדרך כלל מרכיבות על ידי הדבקת מזהה דיבור לגלאי פעילות קולית ולמודל דיאוריזציה, כשכל אחד מוסיף חביון משלו ודרכי כשל משלו.

A screenshot of the Artificial Analysis Speech to Text leaderboard showing the WER Index (non-streaming), Speed Factor, Streaming, and Price in USD per 1,000 minutes of audio sections.

דיאריזציה וזיהוי סוף דיבור, מובנים

פילוח דוברים הוא החלק שכדאי לבחון מקרוב ביותר, כי הוא התכונה שבה מוצרי סטרימינג נוטים ביותר להגזים. Meta טוענת שהמודל מפריד בין 20+ דוברים בהקלטה אחת ומדווחת על שיעור שגיאת פילוח ממוצע של 17.5%, אותו היא משווה לטווח של 21.1–28.6% שהיא מייחסת למערכות מתחרות. שני המספרים פורסמו על ידי הספקית ביום ההשקה, ואף הערכה בלתי תלויה לא אישרה עדיין את נתון ה-17.5%. מה שמבני ואמיתי הוא שהפילוח רץ בתוך אותו מעבר סטרימינג כמו הזיהוי — אין שלב שני של "העלה את האודיו, חכה, קבל חזרה את הדוברים", וזהו בחירת העיצוב שבכלל מאפשרת מעקב אחר 20+ דוברים בסביבה חיה.

זיהוי סוף האמירה הוא היכולת השקטה יותר וככל הנראה השימושית ביותר. ממשקי תמלול שחושפים ASR זורם גולמי מאלצים את הצד הקורא ליישם בעצמם זיהוי סוף אמירה, ולכן סוכני קול קוטעים אנשים לעיתים קרובות או מותירים דממה. Muse Voice Transcribe מחליט מתי תור הדיבור הסתיים ופולט את הגבול הזה כחלק מהזרם, כך שהיישום מקבל אות ברור של "הדובר סיים" בלי לבנות שכבת VAD.

הטענה הרב-לשונית, קרא בעיון

מטה אימנה את המודל על למעלה מ-70 שפות, אך מאמתת 25 בעת ההשקה. אלה דברים שונים: "מאומן על" פירושו שהנתונים כללו אותן; "אומת בהרחבה" הוא תת-הקבוצה שמטה באמת עומדת מאחוריה באמצעות בדיקות פנימיות. לשימוש בייצור, הרשימה המאומתת של 25 היא הכיסוי האמיתי, והפער בין 70 ל-25 כדאי לדעת לפני שמעבירים דרכה 40 שפות. מה שבאמת יוצא דופן הוא סיפור החלפת השפות — המודל מתוכנן לעבור בין שפות באמצע משפט ובאמצע אמירה ללא הנחיה, דבר שהוא נקודת כאב אמיתית באזורים רב-לשוניים ומשהו שרוב מוצרי ה-ASR החד-לשוניים פשוט אינם מסוגלים לעשות. הטיית שפה, מילות מפתח והקשר משלימות את סיפור ההתאמה האישית: אפשר להטות את הזיהוי לכיוון אוצר מילים תחומי, וזו התכונה שהופכת זיהוי דיבור בזרם (streaming ASR) לשימושי בתורי רפואה, משפטים ותמיכה.

שלושה משטחים, מודל אחד

Muse Voice Transcribe מושק על פני שלושה משטחים בבת אחת. המשטח בתשלום הוא Meta Model API במחיר של 3.00 דולר לכל 1,000 דקות שמע. המשטח לצרכנים הוא Meta AI for Mac, שבו החזקת מקש Fn מכתיבה לכל יישום — התשובה של מטא לתכתיב המובנה של אפל, והפריסה האמיתית הבולטת ביותר של המודל ביום הראשון. המשטח למפתחים הוא Muse Code, סוכן הקוד של מטא, שבו פקודות קוליות מניעות סשנים מרובי-סוכנים וזרימות ריפקטורינג. מודל אחד שמפעיל תכונת תכתיב וסוכן קוד הוא הגרסה המוצרית של ההבטחה "מודל סטרימינג אחד, משטחים רבים".

מה שהמחיר נמוך ממנו

במחיר של 0.18 דולר לשעת שמע, Muse Voice Transcribe נמוכה יותר במחיר המחירון מכל תחום תמלול הסטרימינג. קבוצת ההשוואה כפי שאנו עוקבים אחריה: Gemini 3.5 Transcribe Live של גוגל עולה כ-9 דולר לכל 1,000 דקות, Scribe v2 Realtime של ElevenLabs רשומה במחיר של 6.50 דולר לכל 1,000 דקות, Ink-2 של Cartesia ב-4.00 דולר, ו-GPT Live Transcribe של OpenAI ב-17.00 דולר. אלה הם המספרים שפרסמו הספקים, ולחלק מהמודלים האלה יש עדויות דיוק עצמאיות שאין ל-Muse עדיין — הובלת מחיר ביום הראשון אינה זהה ללוח דירוג מבוסס. אבל מודל סטרימינג עם זיהוי דוברים וזיהוי סוף דיבור מובנים, שנכנס במחיר של כחמישית עד עשירית מהמחיר של ממשקי הסטרימינג הקיימים, הוא מספר מסוג שמאפס את הציפיות בכל מקרה.

A generated price-comparison infographic titled 'Streaming transcription — list price per 1,000 minutes' showing Muse Voice Transcribe at $3.00 against Cartesia Ink-2 at $4.00, ElevenLabs Scribe v2 Realtime at $6.50, Gemini 3.5 Transcribe Live at $9.00, and GPT Live Transcribe at $17.00, with a footer noting these are vendor list prices as published in September 2026, and the OrcaRouter logo in the bottom-right corner.

האזהרות הכנות

Muse Voice Transcribe הוא קנייני, ומשקלי המודל לא פורסמו — האפשרות "להריץ בעצמך" אינה קיימת, ואין מסלול של משקלים פתוחים לביקורת או לכיוונון עדין. טענת הדיוק היא מיום ההשקה ולא שוחזרה. 25 השפות המאומתות עשויות שלא להתאים לנתון "אומן על" של 70+ שפות בכל הנוגע לכיסוי שפות דלות-משאבים. ומדד הפרדת הדוברים, מבטיח ככל שיהיה, הוא מדידה של היצרן עד שריצה בלתי תלויה תאשר אותו. עבור צוותים שהדרישה היחידה שלהם היא תמלול אצווה מדויק של אודיו מוקלט מראש, עדיין קיימות אפשרויות זולות יותר ובעלות ביקורת טובה יותר — טיעון הסטרימינג עוסק באינטראקציה בזמן אמת, לא בניצחון על עולם תמלול האצווה במחיר לשעת אודיו.

מה לצפות בהמשך

ארבעה דברים יכריעו אם ההשקה הזו היא רגע או מגמה. ראשית, האם לוח המובילים הסטרימינג של Artificial Analysis אכן מציב את Muse Voice Transcribe במקום הראשון לאחר אימות בלתי תלוי — טענת יום ההשקה זקוקה לערך לוח יציב. שנית, האם פילוח הדוברים של 20+ שורד מגע עם פגישות אמיתיות ורועשות. שלישית, האם משטח ההכתבה של Meta ל-Mac הופך לאימוץ הממשק (API) על ידי מפתחים. רביעית, כיצד השחקנים הקיימים יגיבו במחיר, מכיוון שמודל סטרימינג עם פילוח דוברים וזיהוי סיום דיבור ב-0.18 דולר לשעה מפעיל לחץ ברור על כל מי שמעליו. כאשר Meta תפתח את המודל לשותפי אספקה נוספים, שער העברה כמו OrcaRouter — שמעביר את מחירי הרשימה של הספקים ללא תוספת (0% markup) — יציג את אותו נתון של 3.00 דולר לכל 1,000 דקות ללא תוספת משווק ביום שבו הוא ינחת. עד אז, המקום היחיד לקרוא ל-Muse Voice Transcribe הוא ה-API של Meta עצמה.

© 2026 OrcaRouter

לספקים

מפעילים פלטפורמת הסקה (inference)? הציגו את המודלים שלכם ב-OrcaRouter.

providers@orcarouter.ai

הצטרפו לקהילה שלנו

Discordsupport@orcarouter.aiXGitHubYouTube