כרטיס כותרת עם הכיתוב Qwen3.8-LiveTranslate, עם כותרת המשנה "חצי השנייה שמעמידה את הפרשנות של הבינה המלאכותית בקצב אנושי", ושלושה תגי נתונים: השהיה ממוצעת מ-2.8 שניות ל-2.3 שניות, 60 שפות מקור, 29 שפות פלט מדובר.
Engineering & Research

הכירו את Qwen3.8-LiveTranslate: חצי השנייה שמביאה את תרגום ה-AI לקצב אנושי

מחבר

Alistair Wren

תאריך פרסום

מודלים אחרונים · 20צפו בכל המודלים
בנצ'מרקים: Artificial Analysis · מתעדכן יומית
חזרה לכל הפוסטים

Qwen3.8-LiveTranslateשוחררה ב-19 בספטמבר 2026, וכל ההכרזה כולה מצטמצמת לחיסור אחד. ההשהיה הממוצעת — LAAL, הפער הממוצע בין הרגע שבו מילה יוצאת מפיו של הדובר לרגע שבו התרגום שלה מגיע לאוזנו של המאזין — יורדת מ-2.8 שניות בדור הקודם ל-2.3 שניות. מתורגמנים מקצועיים עובדים בטווח של בערך 2 עד 3 שניות בין האוזן לקול. זה כל הסיפור: לא שמכונה נעשתה מהירה יותר, אלא שההשהיה שלה נמצאת כעת בתוך הטווח שבו מאזינים מפסיקים להבחין במכונה כלל. נתוני ההשקה מציבים את איכות התרגום ב-FLEURS של הדור הקודם על 83.0 xCOMET-XXL; עבור זה הנוכחי נטען 85.7. שני המספרים הם של הספק, הופקו במערך ההערכה של הספק עצמו, ואף גורם בלתי תלוי עדיין לא שחזר אותם — וזו ההסתייגות החשובה ביותר במאמר זה.

מה שהופך את השחרור לשווה קריאה מעבר לכותרת הוא המנגנון. Qwen לא קיצץ בזמן השהיה בכך שיצר מזהה מהיר יותר או מסנתז רזה יותר. הוא מחק את התפרים ביניהם.

מה שבאמת השתנה: התפרים נעלמו

פרשנות סימולטנית קלאסית היא צינור תלת-שלבי שהורכב באותו אופן כבר עשור: זיהוי דיבור אוטומטי מתמלל את הזרם, תרגום מכונה ממיר את התמלול, והמרת טקסט לדיבור מקריאה את התוצאה בקול רם. כל שלב הוא מודל נפרד עם תקציב השהיה משלו, וכל העברה בין-שלבית מאבדת משהו — פרוזודיה בראשון, זהות הדובר בשלישי, וכמה מאות מילישניות קבועות בכל גבול שבו מודול צריך להמתין למספר מספיק של טוקנים כדי להיות בטוח.

Qwen3.8-LiveTranslate מחליף את הקסקדה הזו במה שהיצרן מכנה ארכיטקטורת Interleave הבנויה על עמוד שדרה של Hybrid MoE, המחולקת לשני מודולים משתפי פעולה:

Thinker — מסדר וידאו, אודיו, טקסט מקור ותרגום לרצף סיבתי יחיד, שזורים לפי סדר הזמן, ומפיק הבנה ותרגום מקצה לקצה במעבר אחד במקום בשלושה.

Talker — לוקח את הטקסט המתורגם יחד עם האודיו המקורי ומסנתז דיבור ששומר על טימבר הדובר המקורי, כך שאפשר לזהות שהקול המדובב הוא של האדם שדיבר.

הטענה הארכיטקטונית היא שמכיוון שזיהוי, תרגום והפקה חולקים מסגרת אחת למידול רצפים במקום להעביר הודעות בין גבולות מודולים, המערכת מפסיקה לשלם את המס הבין-מודולי פעמיים בכל אמירה. זהו הסבר סביר מאין הגיעו 0.5 השניות, וזה גם בדיוק מסוג הטענות שזול להצהיר עליהן ויקר לאמת אותן. התייחסו לזה כהסבר של הספק, לא כתוצאה מבוססת.

שלוש היכולות שהן באמת חדשות

כיסוי השפות לא זז: 60 שפות מקור מזוהות, 29 זמינות לפלט קולי — אותם מספרים כמו ב-Qwen3.5-LiveTranslate. התוספות המעניינות עוסקות כולן במה שקורה כשמדבר יותר מאדם אחד.

דיאריזציה של דוברים בזמן אמת — כל משפט מיוחס לדובר בזמן אמירתו, ושכפול גוון הקול מתואר כיציב יותר בעת החלפות דובר. Qwen מדווחת בעצמה על שיעור שגיאות דיאריזציה של 9.7% במערך המבחן הארוך שלה עם מספר דוברים, לעומת 30.6% עבור Seed LiveInterpret 2.0. שני הנתונים מגיעים מ-Qwen.

מקור ותרגום באותו פריים — המודל מפיק את התמלול המקורי ואת הטקסט המתורגם על ציר זמן אחד, וזה מה שמאפשר זוג כתוביות דו־לשוניות על המסך ללא מעבר יישור נוסף.

פתרון עמימויות בהקשר ארוך — ההקשר המוקדם נשמר וממשיך הלאה, כך ששמות, תארי כבוד ומונחי תחום נשארים עקביים. זהו הגורם החשוב ביותר בפועל: הכשל הקלאסי בתרגום סימולטני אינו מילה שגויה, אלא אותו אדם עצמו שמתורגם בשלוש דרכים שונות באותה פגישה.

דיאריזציה היא הפריט המבדיל באמת כאן. ל-Gemini 3.5 Live Translate, המודל המתחרה של גוגל לדיבור-אל-דיבור בזמן אמת, יש בעיה מתועדת עם חילופי תורות — הוא עלול להתקשות לדעת מתי דובר באמת הפסיק. Qwen מציגה את המאפיין ההפוך כתכונה. אף אחת מהחברות לא פרסמה השוואה ראש בראש שתכריע בסוגיה.

Screenshot of Alibaba Qwen team's own announcement page for Qwen3.8-LiveTranslate, showing the release headline, the Interleave architecture description with Thinker and Talker modules, and the stated average lagging figure of 2.3 seconds.

לקרוא ביושר את טענות הבנצ'מרק

Qwen נבדק על שתי קבוצות, וכדאי להפריד ביניהן משום שהן מודדות דברים שונים.

FLEURS, 70 כיווני שפה — הבנצ'מרק האודיו הרב-לשוני הציבורי והנפוץ בשימוש. Qwen טוענת ליתרון הן על קודמתה והן על מה שהיא מכנה מערכות תרגום בזמן אמת מיינסטרימיות עכשוויות, באיכות התרגום, בהשהיה הממוצעת, בדיוק בזיהוי דיבור ובאיכות סינתזת דיבור. ההשוואה של 85.7 מול 83.0 ב-xCOMET-XXL נמצאת כאן.

Omnilingua-MSpeaker, 14 כיווני שפה — ערכת ההערכה הרב-דוברית לאודיו ארוך של Qwen עצמה. החברה טוענת לנאמנות, שטף ותמציתיות טובים יותר, ולשיעור שגיאות דיאריזציה נמוך יותר. בנצ'מרק שנבנה על ידי ספק אינו חסר ערך, אך הוא גם אינו ראיה: הוא תוכנן על ידי האנשים שהמודל שלהם נבחן בו.

הסיכום הכנה הוא ש-FLEURS הוא אמיתי וציבורי, ולכן ה-85.7 ניתן לפחות לבדיקה באופן עקרוני; Omnilingua-MSpeaker אינו כזה, ולכן ההישג בדיאריזציה הוא טענה עד שמישהו יריץ אותו מחדש. אף צד שלישי לא פרסם מספרים של Qwen3.8-LiveTranslate במועד כתיבת הדברים, והמודל בן שעות בלבד.

כמה עולה ה-API, ומספר אחד שינשך אותך

Qwen3.8-LiveTranslate הוא בעל משקלים סגורים וזמין דרך API בלבד. הוא פועל דרך WebSocket Realtime API תחת מזהה המודל qwen3.8-livetranslate-flash-realtime, ולא דרך נקודת קצה HTTP רגילה. התמחור הוא לפי מיליון טוקנים, ומכיוון שטוקני אודיו צפופים, התעריפים המוצהרים נראים מפתיעים לצד מודלי טקסט — עד שנזכרים מהו טוקן אודיו:

אזור סינגפור — קלט אודיו $7.50, קלט תמונה $0.55, פלט טקסט $20.00, פלט אודיו $30.00 למיליון טוקנים.

אזור בייג'ינג — קלט אודיו ב-¥40, קלט תמונות ב-¥3.3, פלט טקסט ב-¥100, פלט אודיו ב-¥160 למיליון טוקנים, שהם בערך $5.65 / $0.47 / $14.13 / $22.61 לפי השערים הנוכחיים.

הקשר — סה״כ 53,248 טוקנים, מחולקים ל־49,152 קלט מקסימלי ול־4,096 פלט מקסימלי.

הגבלות קצב — 10 בקשות לדקה ו-100,000 טוקנים לדקה, זהות בשני האזורים.

מגבלת הקצב הזו היא המספר שיש להדגיש. עשר בקשות בדקה זה נדיב עבור קומץ חדרי ישיבות, ורחוק מאוד מלהספיק לפריסה של מרכז שירות או לשידור חי עם אלפי זרמים במקביל. Qwen שמרה על תמחור הממשק כשהוא כמעט זהה לחלוטין לזה של הדור הקודם — התעריפים בבייג'ינג לא השתנו וסינגפור זולה במעט — אבל מודל שבארכיטקטורה שלו מוכן לקנה מידה מתוקצב כמו גרסת תצוגה מקדימה. כל מי שמתכנן תעבורת ייצור צריך לקרוא את תקרת 10 ה-RPM כאילוץ המחייב, ולא את המחיר לפי טוקן.

Single-column scoreboard for Qwen3.8-LiveTranslate listing average lag (LAAL) 2.3 seconds, languages 60 source and 29 spoken, context 53,248 tokens, input audio plus image, output text plus audio, and weights closed and API-only, with a footer reading 'All figures vendor-reported; no independent replication yet.'

הקריאה לזה אינה דומה לקריאה למודל צ'אט

ה-Realtime API מונחה אירועים, שזה מודל מנטלי שונה מנקודת קצה מסוג completion. אתה פותח סוקט, מקבל session.created, ואז שולח session.update אירוע כדי להגדיר את הסשן לפני שמועבר אודיו כלשהו.

target_language נדרש ויש להגדיר אותו לפני קטע השמע הראשון — אין יעד ברירת מחדל משתמע.

source_language הוא אופציונלי, וברירת המחדל שלו היא זיהוי אוטומטי.

output_modalities בוחר את ["text"] עבור תמלול בלבד או ["text","audio"] עבור דיבור מתורגם.

input_audio_buffer.append מעביר למעלה מקטעי PCM מקודדים ב-base64; response.text.delta ו- response.audio.delta מגיעים חזרה למטה, כאשר response.done מסמן את סוף התור.

שתי הערות מעשיות. ראשית, דפדפן לא יכול להגדיר Authorization ככותרת בלחיצת יד של WebSocket, ולכן את החיבור יש לפתוח בצד השרת ולהעביר את האודיו אל הלקוח דרך הסוקט שלך — זה לא משהו שמחברים ישירות לפרונט-אנד. שנית, Qwen מזהירה במפורש שקבוצת הפרמטרים והאירועים שונה מהדור הקודם של LiveTranslate, ולכן כל קוד שנכתב מול Qwen3.5-LiveTranslate צריך בדיקה מחודשת ולא רק כיוון מחדש. נקודת קצה לניסיון חינם פועלת בכתובת omni.qwen.ai/live-translate אם ברצונך לשמוע את השיהוי לפני שאתה מקדיש זמן הנדסי.

מה שזה במכוון לא עושה

Qwen מפרטת סט של יכולות כלא זמינות, והרשימה מבהירה. ללא קריאה לפונקציות. ללא פלט מובנה. ללא חיפוש באינטרנט. ללא המשך מקידומת, שמירת הקשר במטמון, או הסקה באצוות. ללא כיוונון עדין.

זהו מומחה, לא גנרליסט שחובש כובע של מתורגמן. הוא לא יריץ את לולאת הסוכן שלך, והוא לא יהיה המודל שמסכם את הפגישה. תכנן בהתאם: המתורגמן מייצר תמלול וזרם אודיו מתורגם, וכל מה שבהמשך לכך — מחלץ פריטי הפעולה, אוכף המילון, הכתיבה חזרה ל-CRM — הוא תפקידו של מודל טקסט נפרד.

החלוקה הזו היא המקום שבו ראוטר מצדיק את מקומו. Qwen3.8-LiveTranslate עצמו זמין דרך ה-API של הספק עצמו וכמה פלטפורמות של צד שלישי; הוא אינו נמצא בקטלוג של OrcaRouter היום, ולא נעמיד פנים אחרת. מה שכן OrcaRouter מציע הוא המחסנית שסביבו — כולל Qwen3.8-Max, דגם הדגל של עליבאבא עצמה, מודל sparse mixture-of-experts עם 2.4 טריליון פרמטרים וקונטקסט של מיליון טוקנים במחיר של $2.00 למיליון טוקני קלט ו-$6.00 למיליון טוקני פלט, בחיוב לפי מחיר המחירון של הספק עם אפס תוספת. החזקת המתרגם והמודלים שצורכים את הפלט שלו מאחורי נקודת קצה אחת ומפתח אחד משמעה שצינור התמלול אינו זקוק לחוזה נוסף כשמחליפים את המסכם, וכשל אוטומטי שומר על החצי במורד הזרם של המערכת פעיל כשספק בודד מתערער — וזה, בקצב של 10 בקשות בדקה, תרחיש שכדאי לתכנן לקראתו ולא לגלות אותו.

Screenshot of the OrcaRouter model page for Qwen3.8 Max (model ID qwen/qwen3.8-max), showing the $2.00 per million token input price, the $6.00 output price, the 1M token context window, and text, image and video input tags.

מה לצפות בהמשך

שני דברים יהפכו את הגרסה הזו מטענה מנומקת היטב לעובדה מוגמרת. הראשון הוא מדידת השהיה בלתי־תלויה: LAAL הוא מדד מוגדר היטב, וכל מי שיש לו נקודת הקצה של הניסוי ומערכת שעון עצר יכול להפיק מספר שלא הופק בידי Qwen. השני הוא מפת הדרכים המוצהרת של Qwen עצמה — להתקרב לרצפת השהיה, זיכרון ארוך טווח חוצה־מפגשים, וכיסוי של שפות בזנב הארוך וניבים אזוריים. פריט הזנב הארוך הוא זה שצריך לדרוש מהם לעמוד בו, משום ש־60 שפות מקור הוא מספר מכובד שמחריג בשקט את רוב דוברי העולם, והפער בין הדגמה שעובדת במנדרינית ובאנגלית לבין כזו שעובדת ביורובה או בקצ׳ואה הוא המקום שבו מוצרי פרשנות בזמן אמת נתקעו היסטורית.

לעת עתה, העמדה הסבירה היא ש-Qwen3.8-LiveTranslate הוא המודל הראשון לתרגום סימולטני שמספר הכותרת שלו ממוסגר אל מול מתורגמנים אנושיים ולא אל מול קודמו — ומיסגור כזה הוא מבחן שקשה בהרבה לעבור מהמבחן שהוא מחליף. הוא עדיין לא עבר אותו. הוא רק התנדב לעבור אותו.

השוואות במאמר הזה1

זוהה מתוך המאמר הזה · בנצ'מרקים: Artificial Analysis · מתעדכן יומית