כרטיס הירו שנוצר שכותרתו 'HeyGen Voice vs Qwen-Audio-3.0-TTS', המציג את פער ה-Elo של 79 נקודות בקול מבוקר לעומת שני המחירים לכל מיליון תווים, עם הערה שאחד המחירים מפורסם על ידי הספק והאחר הוא המרה נגזרת של תמחור קרדיטים של הזירה, לפי Artificial Analysis, 9 באוקטובר 2026. הלוגו של OrcaRouter מופיע בפינה הימנית התחתונה.
Engineering & Research

HeyGen Voice לעומת Qwen-Audio-3.0-TTS: מה אתם משלמים עבור ה-Elo, ואיזו רמת Qwen בעצם בדקתם

מחבר

Rowan Sterling

תאריך פרסום

מודלים אחרונים · 20צפו בכל המודלים →
בנצ'מרקים: Artificial Analysis · מתעדכן יומית
חזרה לכל הפוסטים

בצע את החשבון תחילה, משום שהוא פחות מוטה ממה שלוח התוצאות מרמז. Qwen-Audio-3.0-TTS-Plus עולה $19.30 למיליון תווים בפלטפורמת Model Studio — תעריף שהספק מפרסם. HeyGen Voice עומד על $30.00 למיליון תווים בטבלת המחירים של Artificial Analysis עצמה, נתון שהאתר גוזר מתמחור הקרדיטים של HeyGen, משום שדף התמחור הציבורי של HeyGen מוכר קרדיטים בלי לציין מה צורכת יצירת קול. בינתיים, פער הקול המבוקר ביניהם הוא 79 Elo: HeyGen Voice קיבל 1,202 בזירה שמחזיקה את כל שמונת קולות הייחוס קבועים, Qwen-Audio-3.0-TTS-Plus 1,123. אז המודל הזול מדורג הרחק מאחורי הטוב יותר, היחס ביניהם הוא בערך פי 1.55, ורק אחד משני המחירים האלה הוא מספר שהספק שמוכר אותו שם את שמו עליו.

המלכודת בשם

לפני כל זה, ודא שהדרגה נכונה, כי זו משפחה שבשמחה תאפשר לך לבצע בנצ'מרק על הדגם הלא נכון. שתי רשומות של Alibaba חשובות כאן, והן אינן ניתנות להחלפה.

Qwen-Audio-3.0-TTS-Plus הוא המודל שאליו משווה המאמר הזה. הוא מקבל ציון 1,123 בלוח המבוקר — שביעי מתוך ארבעים ושניים — ו־1,264 בלוח Provider Voices, שם הוא מדורג שישי מתוך תשעים ושישה. זהו מוצר TTS אמיתי, עכשווי וזורם, עם תעריף מפורסם של $19.30 למיליון תווים.

Qwen-Audio-3.1-TTS-Plus הוא דרג היורש שלה, והוא זה שנמצא במקום השני בלוח המבוקר ב-1,186 — המודל שהתקרב ביותר להביס את HeyGen Voice בהופעת הבכורה שלו. התעריף שלו רשום באותו $19.30, אף שהתיעוד של Alibaba מזהיר שגרסאות מודל שונות דורשות קולות תואמים, כך ש"אותו מחיר, דרג חדש יותר" לא אומר "החלפה ישירה".

מי שקורא "#1 ahead of Qwen" ואז מריץ בנצ'מרק על Qwen-Audio-3.0-TTS יבחן מודל חלש ב-63 Elo מזה שהכותרת עסקה בו. ההתעקשות הקטנונית על הדירוג שווה 63 נקודות, יותר מהפער בין HeyGen Voice למקום השלישי.

לוח התוצאות

A generated two-column scoreboard titled 'HeyGen Voice vs Qwen-Audio-3.0-TTS — the scoreboard'. The HeyGen Voice column reads 'Controlled Voice Elo: 1,202, #1 of 42', 'Provider Voices Elo: not ranked', 'Price per 1M characters: $30.00, arena conversion of credit pricing', 'Cost of 100 hours of narration: roughly $1,440, derived', 'Voice control: design from a description, instant clone, professional clone' and 'Audio output: speed 0.5 to 1.5, pitch plus or minus 50 semitones'. The Qwen-Audio-3.0-TTS-Plus column reads 'Controlled Voice Elo: 1,123, #7 of 42', 'Provider Voices Elo: 1,264, #6 of 96', 'Price per 1M characters: $19.30 on Alibaba Cloud', 'Cost of 100 hours of narration: roughly $926', 'Voice control: instruction parameter, emotion and language tags, cloning and design' and 'Audio output: PCM, WAV, MP3 and Opus up to 48kHz'. A footer states that the Qwen price is Alibaba Cloud Model Studio's published rate at default settings while the HeyGen figure is the arena's conversion of credit pricing.

• Elo קולי מבוקר (אותם 8 קולות משובטים) — HeyGen Voice: 1,202, מקום 1 מתוך 42. Qwen-Audio-3.0-TTS-Plus: 1,123, מקום 7.

• Elo של קולות הספק (קולות מקוריים) — Qwen-Audio-3.0-TTS-Plus: 1,264, מקום 6 מתוך 96. HeyGen Voice: לא מדורג.

• מחיר למיליון תווים — Qwen-Audio-3.0-TTS-Plus: $19.30, מפורסם על ידי הספק ב-Alibaba Cloud. HeyGen Voice: $30.00 לפי המרת תמחור הקרדיטים של הזירה עצמה; HeyGen אינה מפרסמת תעריף לקול.

• עלות של 100 שעות קריינות — Qwen-Audio-3.0-TTS-Plus: כ-926 דולר לפי ~480,000 תווים לכל שעת דיבור. HeyGen Voice: כ-1,440 דולר לפי ההמרה של הארנה בסך 30.00 דולר — נגזר, לא מצוטט.

• שליטה קולית — Qwen-Audio-3.0-TTS-Plus: הוראה: פרמטר, תגיות רגש ושפה, שכפול קול ועיצוב קול. HeyGen Voice: עיצוב טקסט-לקול מתיאור של עד 1,000 תווים, שכפול מיידי, שכפול מקצועי שאומן על 20 דקות ומעלה.

• פלט — Qwen-Audio-3.0-TTS-Plus: PCM, WAV, MP3 ו-Opus בקצב דגימה של עד 48kHz, עם קצב, גובה צליל, עוצמת קול וקצב סיביות הניתנים להתאמה. HeyGen Voice: מהירות 0.5–1.5 וגובה צליל ±50 חצאי טונים לכל בקשה.

A screenshot of Artificial Analysis's Controlled Voice arena leaderboard, captured 10 October 2026, showing the language selector set to 'English (US & UK)' with HeyGen Voice first at 1,202 Elo, Qwen-Audio-3.1-TTS-Plus second at 1,186 and Qwen-Audio-3.0-TTS-Plus seventh at 1,123, alongside samples, release dates and per-1M-character API pricing columns showing $30.0 and $19.3 respectively.

מה ההנדסה של עליבאבא באמת נותנת לך

משפחת Qwen-Audio-3.0-TTS היא מוצר סטרימינג, והתיעוד שלה כתוב בהתאם. בקשות עוברות בפרוטוקול WebSocket המשותף עם CosyVoice, עם זרימת האירועים run-task, continue-task ו-finish-task לצד התגובות task-started, result-generated, task-finished ו-task-failed. ביטול נתמך בכל מודל Qwen-Audio-TTS, הן באזור בייג'ינג והן באזור סינגפור, באמצעות streaming_cancel(). הפלט מגיע ל-48kHz, והפורמטים כוללים את Opus, מה שחשוב אם אתם מעבירים אודיו לדפדפן או לשיחת טלפון ולא לקובץ WAV.

שני פרטים בתיעוד הזה קל להחמיץ ויקרים לגלות באיחור. תגיות של רגש ושל שפה עשירה חלות רק על שכבות Plus ו-Flash — לא על כל המשפחה — והן פועלות רק במצב זרימה חד-כיוונית. ומפתחות API נבדלים בין אזור סינגפור לאזור בייג'ינג, כאשר סביבות עבודה ממוענות בכתובות מהצורה wss://{WorkspaceId}.ap-southeast-1.maas.aliyuncs.com/api-ws/v1/inference. מפתחות אזוריים הם פרט של הקצאה עד היום שבו הם הופכים להפסקת שירות.

הצד של HeyGen הוא צורה שונה של מוצר: API בסגנון REST של v3 שבו POST /v3/voices/speech מפיק דיבור, GET /v3/voices מציג את הקטלוג מאחורי מסנן engine, ועיצוב קול מחזיר עד שלוש אפשרויות מדורגות מתוך פרומפט טקסט עם seed לשחזוריות. התיעוד גם חושף שהמסנן engine מקבל ערכים מעבר לאלה של HeyGen עצמה — כך ש-HeyGen תשמח לנתב אותך למנוע קול של צד שלישי דרך ה-API שלה. ספק שמספק מודל של מתחרה כאפשרות לבחירה אומר לך משהו על המקום שלדעתו כוחו טמון בו.

A screenshot of HeyGen's public landing page, captured 10 October 2026, showing the headline 'The video you imagine, delivered into your system.' with the line about orchestrating avatars, voices, images, editing, music and assets into deterministic, repeatable renders.

לאן ה-79 Elo הולך

פער של 79 נקודות בלוח מבוקר הוא משמעותי — גדול מהפער של 16 נקודות שמפריד בין HeyGen Voice למקום השני, ובקירוב כמרחק בין המקום השלישי לשמיני באותה קבוצה. הוא גם נמדד על ציר אחד.

הזירה המבוקרת משכפלת שמונה קולות ומחזיקה אותם קבועים. היא לא אומרת דבר על משטח השליטה המונחה בהוראות ש-Qwen חושף, לא על פלט Opus ב-48kHz דרך WebSocket שניתן לבטל, ולא על פריסה אזורית. אלה תכונות הנדסיות, והן הסיבה לכך שצוות שבונה מוקד שירות בשפה המנדרינית לא יעבור למודל שמקבל ציון גבוה ב-79 נקודות על שמונה קולות ייחוס באנגלית.

מה שהתוצאה המבוקרת כן אומרת הוא צר יותר ועדיין שימושי: כאשר שני המנועים מקבלים את אותו קול משוכפל, המאזינים העדיפו את הרינדור של HeyGen Voice. אם המוצר שלכם משכפל קולות, זה הציר שלכם. אם המוצר שלכם בוחר קול מקטלוג ומזרים אותו לתוך שיחה, לוח הדירוג של הספקים קרוב יותר למציאות שלכם — ושם ל-HeyGen Voice אין דירוג בכלל, בעוד ש-Qwen-Audio-3.0-TTS-Plus נמצא במקום השישי מתוך תשעים ושישה.

טיעון המחיר, אם מתייחסים אליו ברצינות

במחיר של $19.30 למיליון תווים, Qwen-Audio-3.0-TTS-Plus עולה בערך כמחצית מהעלות של מסלול $40 של ElevenLabs וכ-40% מ-$49 של Cartesia Sonic 3.6. עבור עומס עבודה של 100 שעות קריינות — כ-48 מיליון תווים בקצב דיבור אופייני — זה בסדר גודל של $926. אותו נפח ב-Eleven v4 Turbo יהיה בערך $1,920 וב-Sonic 3.6 בערך $2,352. HeyGen Voice, במחיר $30.00 של הארנה, מתקרב ל-$1,440: בין המסלול הזול לשני השחקנים הוותיקים, קרוב יותר לאמצע מאשר לראש הטווח.

החישוב הזה טומן בחובו הסתייגות שאחרים אינם זקוקים לה. $19.30 הוא התעריף ש-Alibaba פרסמה בעצמה. $30.00 הוא ההמרה של Artificial Analysis של מערכת קרדיטים ש-HeyGen מעולם לא תרגמה לתווים, ולכן זהו אומדן בתום לב ולא ציטוט. אם יחס התווים לקרדיט האמיתי גרוע מכפי שהתרשים מניח, יתרון ה-79-Elo עולה יותר מה-1.55× שהוא מרמז עליו; אם הוא טוב יותר, פחות. מודל שאת מחירו יש להסיק הוא מודל שעורכים עליו פיילוט על פרוסה מדודה של תעבורה, ולא כזה שקובעים אותו כתקן. זו אינה ביקורת על המנוע — זהו תיאור של המידע הזמין ב-10 באוקטובר 2026.

מחליט

בחר ב-Qwen-Audio-3.0-TTS-Plus כאשר עלות ותשתית סטרימינג מכתיבות את ההחלטה. מתחת ל-20 דולר למיליון תווים, WebSocket שניתן לבטלו עם פלט Opus ב-48kHz, פרמטר הוראה ותגי רגש, ודירוג במקום השישי בלוח הספקים הופכים אותו לקול החסכוני ביותר בעל הציון הטוב בהשוואה הזו. בחר בדרג 3.1 במקום אם אתה רוצה את המודל שבאמת הגיע למקום השני בלוח המבוקר, ואמת את רשימת הקולות לפני שאתה מניח שההחלפה בחינם.

בחן את HeyGen Voice כאשר נאמנות השיבוט היא המוצר. דובר אחד, שורות רבות, קול שחייב להיות *הקול ההוא* בכל פעם — זה הציר שהלוח המבוקר מודד, והציר שבו הוא מוביל את כל התחום. תקצב תקופת מדידה, כי מודל הקרדיטים אומר שתלמד את העלות האמיתית שלך בהרצת הטקסט שלך ולא בקריאת מחירון.

והתעלם לחלוטין מההשוואה אם עומס העבודה הוא בשפה הסינית ובזמן אמת. אף אחד ממספרי ה-Elo לא נמדד על הקולות שלך, בשפה שלך, בתקציב ההשהיה שלך.

להשאיר את שניהם נגישים

זו אחת מהשילובים שבהם שכבת הניתוב מצדיקה את מקומה ולא משמשת כתוספת חיצונית. מפתח API יחיד שמכסה את שני הספקים — מחיר המחירון של הספק מועבר הלאה ללא תוספת רווח, כך ש-19.30 הדולר המפורסם של Alibaba הוא מה שאתה משלם, ושינוי מחיר של Qwen נכנס לתוקף באותו היום — מסיר את הצורך לבחור מנצח לפני שיש לך ראיות. מעבר אוטומטי לגיבוי מכסה את הסיכון המובן מאליו בצינור קולי, שבו זרם שנתקע נשמע למאזין, וה-DSL של הניתוב מאפשר לך לשלוח קריינות בכמויות למנוע הזול ולשלוח שורות קריטיות לשיבוט לזה שמקבל ציון גבוה ב-79 נקודות, בלי שתי ספריות לקוח ושתי מערכות חיוב. הערך של OrcaRouter כאן אינו בכך שהוא מארח מודל קולי; הוא בכך שהוא הופך את העלות של לגלות איזה מהם אתה רוצה לכמעט אפס.

השאלות הפתוחות

שלושה דברים יכריעו את העניין. תעריף קולי בעמוד התמחור של HeyGen עצמו יהפוך את ה-$30.00 שהארנה מפיקה למספר שניתן לבצע בו ביקורת. רשומת HeyGen בלוח Provider Voices תגיד לנו האם היתרון של קול משוכפל שורד מול קולות מקוריים — המבחן ש-Qwen-Audio-3.0-TTS-Plus עובר בו במקום השישי מתוך תשעים ושישה. ותוצאה לקול מבוקר עבור Qwen-Audio-3.1-TTS-Plus מול HeyGen Voice לאחר עוד הצבעות תגיד לנו האם 16 Elo הוא סדר יציב. עד אז: Qwen היא האפשרות המתומחרת, הניתנת להזרמה והמדורגת היטב; HeyGen Voice היא זו בעלת הניקוד הגבוה יותר, שאינה ניתנת לתמחור; והשכבה שאתה מודד חשובה יותר מהכותרת שאתה קורא.