
Gemini 3.5 Transcribe לעומת Whisper Large v3 Turbo: האם צריך להחליף את קו הבסיס?
- AlibabaחדשQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 לכל 1M טוקנים
- z-aiחדשZ.ai: GLM 5.3 Flash2026-08-2658אינטליגנציה72כתיבת קוד
- DeepSeekחדשDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.15 / $0.29 לכל 1M טוקנים
- z-aiחדשZ.ai: GLM 5.32026-08-1860אינטליגנציה75כתיבת קוד
- obsidianחדשQwen3.8 27B2026-08-1552אינטליגנציה68כתיבת קוד
- qwenQwen: Qwen3.8 27B (free)2026-08-13qwen/qwen3.8-27b-free
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1253אינטליגנציה69כתיבת קוד
- grokSpaceXAI: Grok 4.62026-08-1261אינטליגנציה77כתיבת קוד
- metaMeta: Muse Spark 1.22026-08-0557אינטליגנציה72כתיבת קוד
- qwenQwen: Qwen3.8 Max2026-08-0358אינטליגנציה72כתיבת קוד
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3152אינטליגנציה69כתיבת קוד
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 לכל 1M טוקנים
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463אינטליגנציה78כתיבת קוד
- googleGoogle: Gemini 3.6 Flash2026-07-2152אינטליגנציה69כתיבת קוד
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137אינטליגנציה49כתיבת קוד
- metaMeta: Muse Spark 1.12026-07-1653אינטליגנציה71כתיבת קוד
- kimiMoonshotAI: Kimi K32026-07-1560אינטליגנציה76כתיבת קוד
- openaiOpenAI: GPT-5.6 Luna2026-07-0952אינטליגנציה71כתיבת קוד
Whisper Large v3 Turbo הוא המודל שהביטוי "speech-to-text" מתייחס אליו כברירת מחדל בחלק גדול מהתעשייה, ו-Gemini 3.5 Transcribe הוא מודל התמלול הראשון של Google שמשווק במפורש כמתחרה לקו הבסיס הזה, ולא כ-API כללי לדיבור. Gemini 3.5 Transcribe, הנמצא בתצוגה מקדימה ציבורית מאז 26 באוגוסט 2026, ממסגר מחדש את התמלול כמשימת חשיבה — הוא פותר תיקונים עצמיים, מעצב את הפלט, מייחס דוברים, וקורא למודלים אחרים של Gemini בעצמו. Whisper Large v3 Turbo הוא זיקוק של 809 מיליון פרמטרים של Whisper Large-v3 מבית OpenAI, ברישיון MIT, ניתן לאירוח עצמי, תומך ב-99 שפות, ומהיר בערך פי ארבעה עד שמונה מהמודל שממנו זווקק, תלוי בחומרה. האחד הוא שכבת בינה מנוהלת מעל שמע; השני הוא רכיב חינמי ומוכר היטב שאתה מריץ בכל מקום שתרצה. השאלה שהדף הזה נועד לענות עליה היא מצומצמת ושימושית יותר מ"מה עדיף": מתי קו הבסיס מפסיק להיות טוב מספיק?
קו הבסיס, למקרה ששכחת כמה הוא טוב
Whisper Large v3 Turbo ראוי למעמד ברירת המחדל שלו, ולכן הטיעון בעדו מובא ראשון:
זה רץ בכל מקום — רישיון MIT, משקלים פתוחים, ניתן להתקנה על מחשב נייד, GPU יחיד, או פונקציה ללא שרת (serverless). אין ספק, אין מדידה, אין נתונים שיוצאים מהרשת שלך.
• זה מהיר — המפענח המזוקק (32 שכבות מקודד, 4 שכבות מפענח, ירידה מ-32) הופך אותו למהיר בערך פי ארבעה מ-Whisper Large-v3 על חומרה טיפוסית, ועל חלק מהחומרות אף יותר, תוך שמירה על רוב הדיוק שלו. הנתון של OpenAI עצמה הוא בערך פי שמונה על A100.
• הוא מכסה 99 שפות לתמלול, רשימה רחבה יותר מ-85+ של Gemini 3.5 Transcribe.
הדיוק שלו מתועד היטב: 2.1% WER על LibriSpeech test-clean, 4.2% על test-other, 9.1% על Common Voice English — מספרים ששוכפלו ברחבי הקהילה במשך שנים.
• האקוסיסטם עצום — faster-whisper, whisper.cpp, ONNX exports, וכל מסגרת הסקה שבה אתה כבר משתמש. אם אתה יכול להריץ מודל, אתה יכול להריץ את זה.

עבור תמלול אצווה באנגלית ובשפות קרובות לאנגלית בקנה מידה נרחב, Whisper Large v3 Turbo הוא המוביל מסיבות מבניות ששום פער במדדי השוואה לא יכול בקלות להפוך: הוא חינמי, הוא שלך, והוא בכל מקום.

מה מוסיף Gemini 3.5 Transcribe מעבר לכך
ערכו של המתמודד המנוהל אינו בכך שהוא מנצח את קו הבסיס באנגלית נקייה — זהו קרב שהמספרים אינם יכולים אפילו להכריע בו בצורה נקייה עדיין. ערכו הוא העבודה שמתרחשת מעל למילים, ש-Whisper במפורש אינה עושה:
• ייחוס דובר — עד שלושה דוברים עם חותמות זמן ברמת מילה, במודל הבסיסי. Whisper מתמלל זרם דיבור אחד; אין לו מושג מי אמר מה.
• עיצוב חכם — הסרת חוסר שטף, פתרון תיקונים עצמיים, החלת פיסוק ורישיות. Whisper מחזיר את המילים כפי שנאמרו, כולל האממ והכל.
• אוצר מילים מותאם אישית — נטייה לז'רגון ולאיותים חריגים. ל-Whisper אין מנגנון כזה; אתה מבצע עיבוד לאחר או כוונון עדין.
• Function calling — התמליל יכול להעביר ידיים למודלים אחרים של Gemini, מה שהופך את התמלול לשלב בצינור עיבוד של סוכן ולא לפלט סופי.
• סשנים ארוכים — כשעה של אודיו במעבר אחד (הקשר של 96K לפי דיווחי העיתונות) לעומת הצורך המעשי של Whisper לפצל ולתפור קבצים ארוכים.
זה מוצר שונה. זה מה ש-Google מכנה "תמלול חכם", וזה החלק בהשוואה שאינו תלוי בחשבון מדדים.
שאלת הדיוק שאף אחד לא יכול עדיין לענות עליה בצורה ברורה
שני המספרים העיקריים של המודלים אינם מתמודדים זה מול זה בפועל. ה-WER הלא‑מקוון של Gemini 3.5 Transcribe, שעומד על 2.6%, הוא מדידה של Artificial Analysis שצוטטה על ידי Google, וחושבה על פני 85+ שפות. ה‑WER של Whisper Large v3 Turbo, 2.1% ב‑LibriSpeech test‑clean, הוא מדד אנגלי ממאמר הזיקוק של OpenAI עצמו, ששוחזר באופן נרחב. קורפוסים שונים, כיסוי שפות שונה, ספקים שונים. מה שניתן לומר בכנות: על אנגלית נקייה, קו‑הבסיס הפתוח והמתמודד המנוהל נמצאים באופן סביר באותו אזור, והיתרון של המודל המנוהל הוא התכונות הרב‑לשוניות והמבניות שלו, לא ניצחון מוכח ב‑WER באנגלית. חומרי ההשקה של Google אינם כוללים השוואה ישירה מול מודלים ממשפחת Whisper, והשוואה אדוורסרית עצמאית עדיין אינה קיימת, כי Gemini 3.5 Transcribe פומבי כבר יום אחד. עד שתופיע השוואה כזו, כתר הדיוק אינו מוכרע, וכל מאמר — כולל זה — שמכריז על מנצח ב‑WER על סמך שני המספרים הללו, חורג מהמותר.

עלות: חינם להפעלה תמורת $0.005 לדקה
ל-Whisper Large v3 Turbo יש עלות חומרה ואין מונה. אם מריצים אותו על GPU שכבר בבעלותך, העלות השולית לדקת תמלול קרובה לאפס; אם שוכרים GPU, העלות היא מה שעולה המופע בזמן שהוא עובד. Gemini 3.5 Transcribe גובה בערך $0.005 לדקת אודיו בממוצע משוקלל, עם ה-SKU החי בסביבות $0.009 לדקה ומסלול חינמי. באלף שעות אודיו מדובר בכ-$300 על המונה של Gemini, לעומת כמה דולרים בודדים של זמן GPU על הבסיס הפתוח. הפער הזה הוא סיפור העלות האמיתי של ההתמודדות הזו, וזו הסיבה שהבסיס ישמור על מעמדו כברירת מחדל לעבודת אצווה באנגלית בהיקפים גדולים לאורך זמן. הכלכלה של המודל המנוהל נסגרת רק כשהתכונות שהוא כולל — דיאריזציה, עיצוב, בקרת אוצר מילים — היו עולות לך בעצמן זמן הנדסי להרכבה על גבי Whisper.
שפות וסטרימינג
Whisper Large v3 Turbo מפרט 99 שפות לעומת 85+ של Gemini, אבל הסיפור המעשי של תמיכה רב־לשונית שונה: Whisper מתמלל את כל 99 במעבר אחד, ללא זיהוי אוטומטי, והדיוק שלו יורד בעיקר בשפות דלות־משאבים ורועשות — הפשרה הכרוכה במודל מזוקק. Gemini מזהה אוטומטית בין 85+ השפות שלו, ו־Google מדגישה מבטאים וניבים אזוריים. לגבי סטרימינג, ל־Whisper אין מודל זמן־אמת מובנה; פריסות זמן־אמת משתמשות ב־faster-whisper ובמסגרות דומות על החומרה שלך, בעוד של־Gemini 3.5 Transcribe יש נקודת קצה חיה ייעודית עם השהיה תת־שנייה שמוצהרת, ומחיר תואם. אם עומס העבודה שלך הוא חי ורב־לשוני, נקודת הקצה המנוהלת פשוטה יותר להפעלה; אם הוא אצווה ואנגלית, הבסיס הפתוח זול יותר.
פסק הדין, ככל שהוא
Whisper Large v3 Turbo נותר ברירת המחדל הנכונה לתמלול אנגלי בהיקף גדול, לכל מה שחייב לרוץ על התשתית שלך, ולצוותים שרוצים ארטפקט קפוא ובר-ביקורת. Gemini 3.5 Transcribe הוא הבחירה הנכונה כאשר התמליל צריך להיות יותר מסתם מילים — תוויות דוברים, עיצוב נקי, אוצר מילים תחומי, כיסוי רב-לשוני או חיבור לסוכן — וכאשר אתה מוכן לשלם לפי שימוש עבור התכונות האלה. השניים מתקיימים זה לצד זה, והתבנית שהופכת את הדו-קיום לזול היא גבול ניתוב: המתמלל שמתאים לשמע, ואז שכבת ה-LLM שמחליטה מה יקרה לטקסט. על השכבה הזו פועל OrcaRouter — API אחד על פני 200+ מודלים, מעבר אוטומטי בין ספקים, ו-DSL לניתוב שמרכיב כמה מודלים לקריאה אחת. אף מודל דיבור אינו מתארח אצלנו; בחירת התמלול היא בין ה-GPU שלך למונה של Google, ושניהם יישארו כאן עוד הרבה זמן.
השוואות במאמר הזה1
זוהה מתוך המאמר הזה · בנצ'מרקים: Artificial Analysis · מתעדכן יומית
