כרטיס כותרת ראשי עבור 'Realtime-Venus vs Qwen-Audio-3.0-TTS', עם כותרת משנה 'מרנדר ומאזין אינם אותה רכישה', עם שלושה כרטיסים שעליהם כתוב 'Qwen-Audio-3.0-TTS-Plus: Elo 1,259, במקום השני ב-Artificial Analysis Provider Voice Arena', 'Realtime-Venus: אין כלל ציון לאיכות קול', ו'הקלט הוא כל ההבדל: טקסט בלבד, לעומת אודיו, וידאו וטקסט', מעל פס תחתון שעליו כתוב 'נתוני Qwen לפי Artificial Analysis; נתוני Realtime-Venus מתוך הדו"ח הטכני שלה, שלא שוחזרו.' הלוגו של OrcaRouter משולב בפינה הימנית התחתונה.
Guides & Insights

Realtime-Venus מול Qwen-Audio-3.0-TTS: האחד קורא את התסריט שלך, והאחר חייב לשמוע אותך

מחבר

Gideon Frost

תאריך פרסום

מודלים אחרונים · 20צפו בכל המודלים
בנצ'מרקים: Artificial Analysis · מתעדכן יומית
חזרה לכל הפוסטים

ההשוואה המפתה בין Realtime-Venus ל-Qwen-Audio-3.0-TTS היא מחיר לשעת אודיו, והיא מניבה תשובה נקייה ששגויה לחלוטין. Qwen-Audio-3.0-TTS-Plus מפיק דיבור בקצב של בערך 27.6 דולר למיליון תווים, מה שמסתכם בקרוב ל-1.66 דולר לשעה של אודיו מוגמר. ל-Realtime-Venus, המערכת הדופלקסית המלאה בעלת 9B שצוות Venus של Ant Group בנה עם אוניברסיטת צינגהואה, אין מחיר בכלל משום שאין לה שירות מתארח — אבל באירוח עצמי היא תעלה לך צומת GPU שרץ ברציפות, וזה לפחות סדר גודל יותר לשעה. המרנדר מנצח בחשבון. החשבון מודד שני מוצרים שונים: Qwen-Audio-3.0-TTS לוקח טקסט ומחזיר אודיו, ו-Realtime-Venus לוקח אודיו וווידאו ומחזיר שיחה. השאלה שבאמת מבדילה ביניהם אינה מה הם פולטים. היא אם משהו צריך להשיב.

הקלט הוא כל ההבדל

Qwen-Audio-3.0-TTS, ששוחרר על ידי Tongyi Lab של Alibaba Cloud ב-20 ביולי 2026, הוא מודל טקסט-לדיבור שנחשף כ-API מתארח ללא משקלים פתוחים. טקסט נכנס דרך נקודת קצה HTTP ואודיו יוצא. אין מסלול קלט אודיו, אין תור לקחת, אין תמלול להחזיר, ואין מושג של להיות מופרע — המודל מעולם לא שמע דבר. כל מודל העלויות שלו הוא מכבש דפוס: תווים נכנסים, אודיו יוצא.

Realtime-Venus, לעומת זאת, מקשיב באופן קבוע. נקודת הביקורת האורקולית נושאת מקודד ויזואלי SigLIP2 עבור פריימים בזרימה ומקודד אודיו Whisper-Medium המזין עמוד שדרה Qwen3-8B, ושתי נקודות הביקורת מריצות לולאת אינטראקציה של שנייה אחת שמעדכנת באופן רציף את מצב השיחה ומחליטה אם לדבר או לשתוק. היא מפיקה דיבור באמצעות אסימוני S3 בדידים ומפענח flow-matching בזרימה במקום שלב סינתזה נפרד, והיא יכולה להחזיר טקסט לצד צורת הגל.

זה לא הבדל בתכונות. זה ההבדל בין רכיב למערכת. הצב את השניים זה לצד זה, ואחד מהם יכול להיכנס ישירות לתוך צינור עיבוד שכבר יש לפניו מזהה דיבור ומודל שפה. האחר מחליף את שלושתם.

מקרה מעובד הופך זאת למוחשי

קחו קו תמיכה. לקוח מתקשר, מתאר בעיה בצורה גרועה, עוצר באמצע משפט כדי למצוא מספר חשבון, נקטע על ידי הכרזה ברקע, ואז שואל שאלת המשך לפני שהנציג סיים לענות.

מערכת הבנויה על Qwen-Audio-3.0-TTS מתייחסת לכך כאל שלושה ספקים ושלוש חשבוניות: מנוע זיהוי הופך את דיבור המתקשר לטקסט, מודל שפה מחליט מה לומר, ו-Qwen-Audio-3.0-TTS משמיע אותו. כל קפיצה מוסיפה השהיה, וכל גבול הוא המקום שבו הפרוזודיה מתה. הכשל הקריטי הוא מבני — רגל ה-TTS אינה יכולה לשמוע את ההפסקה באמצע משפט שאותו היא כבר משמיעה, ולכן ההפרעה (barge-in) חייבת להיות מטופלת על ידי משהו שלפניה.

Realtime-Venus מטפל באותה שיחה כמודל אחד, בלי גלאי פעילות קולית חיצוני, בלי העברת שליטה. הנתונים שלו מ-Full-Duplex-Bench v1.5 — 75% תגובה להפרעות ושיעורי המשכיות של 97% תחת תגובות האזנה, 88% תחת דיבור מכוון לזולת ו-86% תחת דיבור רקע — הם בדיוק המדדים שמתארים תרחיש זה. הם גם מדווחים עצמית, מתוך הדוח הטכני של המודל עצמו, בלי שחזור חיצוני. יש לקרוא אותם כטענה עיצובית, לא כמדידה.

איכות קול: לאחד יש Elo, ולשני אין כלום

זהו החלק החד-צדדי ביותר בהשוואה, והוא מטיב עם אליבאבא בפער עצום.

• ציון בלתי תלוי — Qwen-Audio-3.0-TTS-Plus ממוקם שני ב-Provider Voice Arena של Artificial Analysis עם Elo של 1,259 על פני 1,544 דגימות נכון ל-18 בספטמבר 2026, אחרי Cartesia Sonic 3.6 עם 1,277 ולפני Inworld Realtime TTS-2 עם 1,247 ו-Speechify Simba 3.2 עם 1,241.

• מאיפה זה התחיל — טור השחרורים של הארנה עצמה מפרט את הדגם הזה כרשומה מספטמבר 2026, וזו הדרגה כפי שהיא מדורגת כעת ולא תאריך ההשקה של 20 ביולי 2026. בכל פעם שהוא זז, הוא שמר לאורך כל הדרך על שני המקומות הראשונים.

• Realtime-Venus — אין רשומה בארנה, אין הערכת קול של צד שלישי, כלום. הנתון היחיד שקשור לקול הוא ציון VoiceBench AlpacaEval של 4.81 המדווח עצמית, שהדוח מתאר כמתואם לנתון ההשוואתי הטוב ביותר.

• מה זה אומר — אף אחד מחוץ למחברים לא בחן אם Realtime-Venus נשמע טוב. זו לא נקודה לרעתו; זה פשוט לא־ידוע, ולא־ידוע שונה מרע. אבל אם איכות הקול היא התוצר, לקנות מודל עם דירוג Elo עדיף מלקחת מודל ללא דירוג מתוך אמונה.

A screenshot of the Artificial Analysis Provider Voice Arena Leaderboard for text-to-speech, captured 18 September 2026, showing the ranked table: Cartesia Sonic 3.6 first at Elo 1,277 with 1,810 samples, released August 2026 at $49.0 per million characters; Alibaba's Qwen-Audio-3.0-TTS-Plus second at Elo 1,259 with 1,544 samples and $27.6 per million characters; Inworld Realtime TTS-2 third at Elo 1,247; SpeechifyAI Simba 3.2 fourth at Elo 1,241; VUI Labs Luna TTS fifth at Elo 1,231; Inworld Realtime TTS-2 Flash sixth at Elo 1,216; StepFun StepAudio 2.5 TTS seventh at Elo 1,209; and BreezeBlue Breeze TTS 2 eighth at Elo 1,207 with an Open Weights badge.A two-column comparison scoreboard titled 'Realtime-Venus vs Qwen-Audio-3.0-TTS — the scoreboard'. The left column, labelled Realtime-Venus, reads 'Job: full-duplex conversation', 'Input: audio, video and text', 'Output: text and speech', 'Independent voice score: none', 'Availability: Apache-2.0 weights, no API', 'Price: none published'. The right column, labelled Qwen-Audio-3.0-TTS, reads 'Job: text-to-speech rendering', 'Input: text only', 'Output: audio', 'Independent voice score: Elo 1,259, second of 20-plus', 'Availability: hosted API since 20 July 2026', 'Price: about $27.6 per 1M characters'. The footer reads 'Qwen figures per Artificial Analysis and Alibaba Cloud documentation; Realtime-Venus figures from its technical report, unreproduced.'

שפה, קולות ושליטה אקספרסיבית

המודל של Alibaba נבנה לרוחב הגשה. הוא מספק יותר מאלף קולות, מכסה שש עשרה שפות — כולל עשרים אזורי ניבים סיניים — וחושף 86 תגים מוטבעים לרגש ולהגשה: משטח שליטה שכותבים לתוך הטקסט עצמו, בתוספת הוראות הגשה בשפה טבעית. הפלט מגיע עד 48 קילו־הרץ, לעומת 24 קילו־הרץ בדור הקודם, וסינתזה בודדת יכולה להימשך עד שלוש דקות. שכבת Flash מכוונת לכ־300 מילישניות עד לחבילה הראשונה להשמעה בזמן אמת; שכבת Plus היא שכבת האיכות ומייצרת בקצב של כשש עשרה תווים בשנייה — איטי מספיק כדי להשפיע במוצר חי, אך בלתי נראה ברינדור אצווה.

Realtime-Venus מתועד באנגלית ובסינית, מגיע עם קול ייחוס אחד יחד עם המשקולות, ומספק לך מפענח token-to-waveform במקום ספריית קולות. לאקספרסיביות במובן של Qwen — תגיות, הוראות, אלף פריסטים — אין מקבילה כאן. מה שיש לו במקום זה הוא היכולת לשנות את אופן ההגשה שלו בתגובה למה שהוא שומע, שהיא סוג אחר של שליטה אקספרסיבית וקשה הרבה יותר להציג אותה בדף מפרט.

העלות של כל נתיב, בכנות

יש הסתייגות אמיתית לגבי הנתון של Alibaba לפני שמתכננים תקציב על בסיסו. המחיר המצוטט בהרחבה, $27.6 למיליון תווים, אינו תואם את עמוד התמחור של Alibaba בכל תמונת מצב, והמדרגות מתומחרות בנפרד. בדקו את הנתון ברמת החשבון במקום להסתמך על טבלת השוואה, כולל זו.

ל-Realtime-Venus אין מחיר מחירון כי אין מה לקנות. העלות היא שני צ'קפוינטים של 9B ב-BF16 — כשמונה-עשרה ג'יגה-בייט של משקלים כל אחד לפני זיכרון אקטיבציה — בתוספת לולאת סטרימינג מתמשכת, כלומר צומת GPU שמחויבת על בסיס חודשי בין אם מישהו מתקשר ובין אם לא. בנפח יציב זה זול יותר לכל שיחה מ-API קולי מחויב לפי שימוש. בנפח לסירוגין זה גרוע בהרבה, ונקודת ההצטלבות היא השאלה הפיננסית היחידה שחשובה.

יש נתיב שלישי שצוותים רבים יגיעו אליו, וכדאי לתת לו שם כי הוא משנה את צורת ההחלטה. אם משאירים קסקדה, הרגל היחידה שצריכה להיות מודל מתארח היא האמצעית — ההסקה. OrcaRouter לא מציע לא את Qwen-Audio-3.0-TTS ולא את Realtime-Venus; שתי שכבות הקול נמצאות מחוץ למה שאנחנו מספקים, ואנחנו מעדיפים לומר זאת מאשר לרמוז אחרת. רגל ההסקה היא מה שאנחנו כן מכסים: כמעט 200 מודלים טקסטואליים מאחורי מפתח אחד במחיר המחירון של הספק וללא תוספת, מעבר אוטומטי בין ספקים במעלה הזרם כך שאחר צהריים רע אצל ספק אחד לא מפיל שיחה חיה, DSL ניתוב שמרכיב כמה מודלים לקריאה אחת, ומיזוג מודלים כשהחלטה ראויה ליותר מדעה אחת. בקסקדה, זו הרגל שאתם הכי רוצים להיות מסוגלים להחליף בלי משא ומתן על חוזה, וזו שבה הורדת מחיר של ספק מגיעה באותו יום ולא בחידוש.

A screenshot of the Hugging Face model page for inclusionAI/Realtime-Venus, captured 18 September 2026, showing the Apache-2.0 licence badge alongside the Any-to-Any, Safetensors, audio, video, streaming and full-duplex tags, the model card heading 'A full-duplex interaction system with asynchronous delegation', and a side panel reading 'Downloads last month: -' and 'This model isn't deployed by any Inference Provider.'

השיבוט הוא חרב פיפיות

Qwen-Audio-3.0-TTS יכול לשכפל קול מדגימת התייחסות קצרה, באופן חוצה-שפות, והוא מתועד כעמיד בפני קלט רועש או מהדהד. זו היכולת השימושית ביותר מבחינה מסחרית בהשוואה, ומשטח הציות הגדול ביותר. למוצר שיכול לשחזר כל דובר מעשר שניות של אודיו יש תשובה ארוכה בהרבה ל"של מי הקול הזה, ומי נתן את הסכמתו לכך" מאשר לכזה שמדבר רק בפריסטים של ספק.

Realtime-Venus מגיעה עם קול ייחוס יחד עם המשקולות. אפשר לשכפל באמצעותו אם יש לך את האודיו ואת ריצת האימון, אבל שום דבר במהדורה הזו לא נבנה סביב הפיכת זה לקל — מה שעבור פריסה באירוח עצמי בתוך גבול תאימות הוא כנראה ברירת המחדל הבטוחה יותר.

איזה אחד אתה בעצם קונה

קנו את Qwen-Audio-3.0-TTS כאשר האודיו הוא הפלט. קריינות, לוקליזציה, נגישות, דיבוב — כל תהליך עבודה שבו הטקסט קיים לפני שהצליל נוצר, והאיכות לשעת רינדור היא המדד. התחילו ב-Flash אם ההשמעה היא בזמן אמת, עברו ל-Plus כאשר הקול עצמו הוא המוצר, ותמחרו את תהליך השיבוט בנפרד מספריית הפריסטים.

פנה אל Realtime-Venus כאשר הקלט הוא אדם והמערכת צריכה להתנהג כמאזין. סיוע מודע למצלמה, אינטראקציה ללא ידיים, כל דבר שבו אדם עומד להפריע באמצע משפט ולצפות שהמערכת תטפל בזה. העסקה חדה: אתה מוותר על קול מדורג ב-Elo, אלף פריסטים, וכל אפשרות מתארחת, ובתמורה אתה מקבל את היחיד מבין השניים שיכול לשמוע אותך.

רוב המוצרים רוצים את שניהם, במקומות שונים. מה שהם לא צריכים לחלוק הוא מודל עלויות — מחיר לשעת אודיו הוא המדד הנכון בדיוק עבור אחד משני המודלים האלה, והוא לא זה שמנהל את השיחה.