
Gemini 3.8 Live מול GLM-4-Voice: מה באמת השיגו 21 חודשים של בינה מלאכותית קולית
- typesafeחדשTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 לכל 1M טוקנים · 459 tok/s
- openaiחדשOpenAI: GPT-6 Luna2026-09-2237אינטליגנציה
- openaiחדשOpenAI: GPT-6 Sol2026-09-2248אינטליגנציה
- anthropicחדשAnthropic: Claude Opus 5.52026-09-2258אינטליגנציה
- grokחדשGrok 4.72026-09-2146אינטליגנציה
- OrcaחדשOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 לכל 1M טוקנים · 183 tok/s
- orcaחדשOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 לכל 1M טוקנים · 1285 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040אינטליגנציה
- openaiOpenAI: GPT-6 Astra2026-09-0453אינטליגנציה77כתיבת קוד
- googleGoogle: Gemini 3.8 Flash2026-09-0241אינטליגנציה76כתיבת קוד
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245אינטליגנציה76כתיבת קוד
- anthropicAnthropic: Claude Fable 5.12026-09-0153אינטליגנציה82כתיבת קוד
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 לכל 1M טוקנים · 119 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642אינטליגנציה72כתיבת קוד
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 לכל 1M טוקנים · 224 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845אינטליגנציה75כתיבת קוד
- obsidianQwen3.8 27B2026-08-1534אינטליגנציה68כתיבת קוד
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236אינטליגנציה69כתיבת קוד
- grokSpaceXAI: Grok 4.62026-08-1244אינטליגנציה77כתיבת קוד
- metaMeta: Muse Spark 1.22026-08-0540אינטליגנציה72כתיבת קוד
GLM-4-Voice הושק ב-3 בדצמבר 2024. Gemini 3.8 Live הוכרז ב-15 בספטמבר 2026. מדובר ב-21 חודשים, וזו העובדה החשובה ביותר בהשוואה הזו — חשובה יותר מכל בנצ'מרק, משום שהיא קובעת איזה סוג של שאלה אתה בעצם שואל.
שני המודלים האלה אינם יריבים. אף אחד שמפריס קול בקנה מידה ב-2026 לא בוחר ביניהם על בסיס איכות. השאלה האמיתית היא זו ש-GLM-4-Voice מעלה ו-Gemini 3.8 Live לא יכול לענות עליה: מה יידרש כדי להיות הבעלים של זה במקום לשכור אותו? לשאלה הזו יש תשובה אמיתית, והיא השתנתה פחות ב-21 חודשים ממה שאולי הייתם מצפים.
מה שגוגל השיקה, ומה שז'יפו השיקה
Gemini 3.8 Live הוא מודל דיאלוג חי מתארח עם משקולות סגורות. הוא מטפל בקלט חזותי כמעט בזמן אמת, מזהה באופן אוטומטי ועובר בין 97 שפות נתמכות תוך כדי השיחה, ומפעיל כלים וקריאות API ברקע בזמן שהשיחה נמשכת. הוא זמין למפתחים דרך Gemini API ו-Google AI Studio, בתצוגה מקדימה פרטית ב-Gemini Enterprise, וב-Search Live. התמחור המוצהר הוא 0.005$ לדקת קלט אודיו ו-0.018$ לדקת פלט אודיו דרך Live API; התרשים של עלות-לשעת-קלט-אודיו של Artificial Analysis מציב אותו באופן עצמאי ב-1.50$ לשעה. המודל התאום שלו, Gemini 3.8 Live Extended Thinking, מוביל כיום את אותו מדד עם 82.6, בעוד Gemini 3.8 Live עצמו עומד על 76.0.
GLM-4-Voice הוא מודל הדיבור הראשון מקצה לקצה של Zhipu AI, והוא צ'ק-פוינט שניתן להורדה. זהו מכלול בן שלושה חלקים: טוקנייזר דיבור הבנוי על מקודד Whisper-large-v3 עם צוואר בקבוק מכומת וקטורית בכ-0.4B פרמטרים, מודל שפה אוטורגרסיבי (GLM-4-Voice-9B, מאותחל מ-GLM-4-9B) בכ-9B פרמטרים, ומפענח Flow Matching שאומן מחדש מ-CosyVoice. הוא דובר סינית ואנגלית, תומך ברגש, טון, קצב דיבור וניב הנשלטים באמצעות הוראות — קנטונזית, מנדרינית צ'ונגצ'ינג ודיבור בייג'ינגי ביניהם — ומבצע טוקניזציה של דיבור ב-12.5 Hz לזרם ספר-קודים יחיד בקצב של כ-175bps, נמוך בסדר גודל מקודקי אודיו עצביים טיפוסיים.
המידות, זו לצד זו:
• שחרור — Gemini 3.8 Live: 15 בספטמבר 2026. GLM-4-Voice: 3 בדצמבר 2024.
• משקלים — סגור, באירוח בלבד לעומת ניתן להורדה, קוד Apache-2.0 עם רישיון משקלים מותאם אישית.
• שפות — 97 עם החלפה בתוך השיחה לעומת סינית ואנגלית.
• ראייה — קלט חזותי כמעט בזמן אמת לעומת ללא.
• קריאה לכלים — ביצוע כלים ו-API ברקע במהלך השיחה לעומת היעדר ערוץ כלים לחלוטין.
• הקשר — לא מפורסם על ידי Google לעומת הקשר של 8K, פלט מקסימלי של 4K.
• מינימום להרצה עצמית — לא רלוונטי לעומת 32 GB RAM בתוספת CUDA GPU באופן רשמי; בערך 12 GB VRAM ב-int4.
• סימון מים — SynthID על כל האודיו שנוצר לעומת היעדר תיאור.

21 חודשים קנו יכולת, לא רק איכות
הסיפור הקל הוא שמודל חזית מ-2026 מנצח צ'קפוינט פתוח מ-2024. הוא אכן מנצח, והפער גדול — אבל התצפית המועילה יותר היא שהקטגוריה שינתה צורה במקום לנוע לאורך ציר אחד.
בדוח הטכני של Zhipu עצמו, GLM-4-Voice משיג 93.6% דיוק של דיבור לטקסט ב-Topic-StoryCloze, 82.9% דיבור לדיבור, טבעיות UTMOS של 4.45, ושאלות-תשובות מדוברות של 5.40/10 בתחום הכללי ו-5.20/10 בתחום הידע — הכול מדווח באופן עצמי ולא שוחזר. הערכה בלתי תלויה נדירה יותר ופחות מחמיאה: ב-VoiceBench הוא רושם ציון כולל של 56.48, וממקם אותו בסביבות המקום ה-29 מתוך 42 בספירה אחת והמקום ה-30 מתוך 40 באחרת, כאשר הבנה מרובת-תורות מתוארת כחלשה בשתי השפות. במבחן C³ להבנת דיאלוגים מרובי-תורות הוא מגיע ל-11.09% בסינית ו-33.22% באנגלית. VCB Bench מצא שהוא הוביל בשליטה רגשית עם 93.0 בתת-מדד SIF הסיני, ובהתאמה חזקה בין טקסט לדיבור, אך הטיפול בניבים ב-TELEVAL הגיע ל-4.57% ללא הוראה מפורשת.
המספרים האלה מתארים מודל שטוב בהבעה קולית וחלש בהבנה מתמשכת. זהו מודל דיבור משנת 2024 במשפט אחד.
הציון 76.0 של Gemini 3.8 Live במדד Speech to Speech של Artificial Analysis הוא ציון מורכב המשקלל הסקת דיבור, ביצועים סוכניים, העדפת זירה ושיעור הצלחה במשימות. זה לא שהמודל החדש יותר טוב באותה משימה בכפולה גדולה יותר. אלא שהציון המורכב כולל כעת בכלל ביצועים סוכניים והצלחה במשימות — קטגוריות ש-GLM-4-Voice אינו יכול להתחרות בהן כי אין לו ערוץ כלים. המודל מ-2024 נמדד במשחק שהוא מעולם לא נבנה לשחק בו.

הרישיון הוא החלק שאנשים מדלגים עליו
אם אתה מסתכל על GLM-4-Voice בגלל שהוא פתוח, קרא את התנאים לפני שההורדה של המשקלים תסתיים. הפיצול הוא אמיתי וקל לטעות בקריאה:
• Code — Apache-2.0. מתירני באמת.
• משקולות — רישיון מותאם אישית המחייב ייחוס ורישום אצל Zhipu לשימוש מסחרי.
"משקלים פתוחים" ו-"Apache-2.0" אינם אותה טענה, והרבה סיקור משני של המודל הזה מבלבל ביניהם. אם בכוונתך להשיק מוצר מסחרי על GLM-4-Voice, דרישת הרישום היא צעד משפטי, לא פורמליות, והיא צריכה להיות על הנתיב הקריטי. גוף מעקב אחד מרחיק לכת ומתאר את המודל כקנייני עם שימוש מסחרי מותנה. כך או כך, היעדרו של חיוב לפי דקה אינו היעדרם של יחסים מסחריים.
חשבון העלויות, נעשה ביושר
הטיעון בעד אירוח עצמי הוא שעלות חודשית קבועה עדיפה על עלות לפי דקה בהיקף שימוש גבוה. הטיעון הזה ממשי, והוא קטן מכפי שהוא נראה כשמביאים בחשבון את מה שאתם מפעילים.
GLM-4-Voice דורש רשמית 32 GB של RAM ו-GPU של CUDA. קוונטיזציות int4 קהילתיות פועלות בכ-12 GB של VRAM, כ-10–11 GB בפועל, שזה בטווח של RTX 3060, עם תקרה מעשית של כ-30 שניות של דיבור לכל תור. A10 בענן במחיר של בערך $0.50–$1.00 לשעה שווה ערך לסכום שבין $350 ל-$700 בחודש עבור מופע שרץ באופן רציף — לפני שהגשת שירות ולו למשתמש אחד, וללא failover, ללא קיבולת פרץ, ואין מי שיתריע כשהמפענח מייצר רעש בשעה 3 לפנות בוקר.
מנגד, Gemini 3.8 Live במחיר של 1.50 דולר לשעת אודיו קלט פירושו ש-350 דולר קונים לך בערך 233 שעות של קול. זה לא גרוע יותר באופן מובהק, וזה בא עם קיבולת שלא הקצית. נקודת ההצטלבות קיימת; היא גבוהה ממה שההשוואה הכותרתית מרמזת, והיא נעה בהתאם לשאלה אם התעבורה שלך יציבה או פרצית. תעבורה פרצית היא המקרה שבו תמחור לפי דקה מנצח באופן מכריע, כי מעבדי GPU במנוחה מחויבים בדיוק כמו אלה שעמוסים.
יש גם הבדל במה שמקבלים תמורת הכסף. דיווחים קהילתיים על פריסות מכומתות של GLM-4-Voice מציבים את השהיית הדיאלוג הרציף על 38–120 מ״ש, אם כי הנתונים האלה מגיעים מכתבות ולא מ-Zhipu. השהיה של Gemini 3.8 Live לא פורסמה על ידי Google כלל. אם השהיה נמוכה היא דרישת חובה עבורך, לאף אחד מאלה אין מספר שאפשר לתכנן לפיו — לאחד יש מדידות קהילתיות מצד שלישי, ולשני יש עדויות של שותפים ובלי נתון.

האפשרות האמצעית: להחזיק בלוגיקה, לשכור את היכולת
הצגת זה כבחירה בין אירוח עצמי לשירות מתארח מפספסת את ההסדר שרוב הצוותים למעשה מוצאים את עצמם בו. ל-GLM-4-Voice אין ערוץ כלים, ולכן כל מוצר שנבנה עליו זקוק למודל טקסט נפרד שיבצע את החיפוש — מה שאומר שמודל הדיבור באירוח עצמי יושב לפני מודל טקסט מתארח כך או כך. החלטת הפריסה והחלטת היכולת ניתנות להפרדה.
הפיצול הזה הוא המקום שבו ראוטר עושה עבודה אמיתית. OrcaRouter נושאת 190 מודלים מאחורי מפתח אחד במחיר המחירון של הספק וללא תוספת, כך שאפשר להחליף את יעד ההאצלה שמאחורי חזית הדיבור שלך על תעבורה חיה בלי לבנות מחדש דבר, וירידת מחיר במעלה הזרם מגיעה אליך באותו יום ולא בחידוש הבא. מעבר אוטומטי לגיבוי חשוב יותר מהרגיל בהתקנה מתארחת עצמית, כי כשמופע ה-GPU שלך הוא זה שנפל, המודל שבקצה האחורי עדיין נגיש והסשן לא חייב למות איתו. שתי הבהרות, מפני שההשוואה הזו מזמינה בלבול: אנחנו לא מארחים את GLM-4-Voice, וגם נקודות הקצה של Gemini 3.8 Live לא נמצאות בראוטר שלנו — הן מגיעות מהספקים שלהן. מה שכן נמצא בראוטר הוא שכבת הטקסט ששתיהן מעבירות אליה עבודה.
ההחלטה, והלקח שמתחתיה
בחר את GLM-4-Voiceאם אתה צריך את המודל על החומרה שלך, אם התעבורה שלך באמת יציבה בנפח גבוה, אם אתה בונה בסינית או באנגלית בלבד, ואם אתה צריך לשנות את המודל ולא רק לקרוא לו. תקצב את רישום הרישיון כמשימה אמיתית, וצפה לפתור הבנה רב-תורית בעצמך — זוהי נקודת התורפה המתועדת של המודל, ושום כמות של כוונון עדין סביב תקרת פלט של 4K לא תסתיר זאת לחלוטין.
בחר/י בGemini 3.8 Liveאם הדרישות שלך כוללות ראייה, קריאה לכלים, יותר משתי שפות, או כל דפוס תעבורה שהיית מתאר כמתפרץ. זהו מודל תצוגה מקדימה שנתוני חלון ההקשר וזמני ההשהיה שלו לא פורסמו, וזהו סיכון תכנוני ממשי, אך הוא גם היחיד מבין השניים שמסוגל לחפש משהו באמצע המשפט.
הלקח הכללי שווה יותר מאשר כל אחד משני פסקי הדין. עשרים ואחד חודשים של בינה מלאכותית קולית הניבו מודל שאינו בראש ובראשונה מודל קולי טוב יותר — הוא ממשק קולי לסוכן. אם הסיבה שלך לרצות משקלים פתוחים הייתה עלות, החשבון צמוד יותר ממה שהמסגור נטול-הרישיון מרמז. אם הסיבה שלך הייתה שליטה, היא כלל לא הפכה לסחורה, ו-GLM-4-Voice נותר תשובה לגיטימית לשאלה ש-Gemini 3.8 Live אינו מתייחס אליה.
