כרטיס כותרת ראשי עבור 'Gemini 3.5 Transcribe לעומת Whisper Large v3 Turbo' עם כותרת משנה 'האם קו הבסיס זקוק להחלפה?', המציג כרטיס API מנוהל משמאל עם התווית Gemini 3.5 Transcribe ב-2.6% WER ללא סטרימינג, וכרטיס בעל משקלים פתוחים מימין עם התווית Whisper Large v3 Turbo ב-2.1% LibriSpeech clean עם תג MIT ותג 809M, ולוגו OrcaRouter בפינה הימנית התחתונה.
Guides & Insights

Gemini 3.5 Transcribe לעומת Whisper Large v3 Turbo: האם צריך להחליף את קו הבסיס?

מחבר

Alistair Wren

תאריך פרסום

מודלים אחרונים · 20צפו בכל המודלים
בנצ'מרקים: Artificial Analysis · מתעדכן יומית
חזרה לכל הפוסטים

Whisper Large v3 Turbo הוא המודל שהביטוי "speech-to-text" מתייחס אליו כברירת מחדל בחלק גדול מהתעשייה, ו-Gemini 3.​5 Transcribe הוא מודל התמלול הראשון של Go​ogle שמשווק במפורש כמתחרה לקו הבסיס הזה, ולא כ-API כללי לדיבור. Gemini 3.​5 Transcribe, הנמצא בתצוגה מקדימה ציבורית מאז 26 באוגוסט 2026, ממסגר מחדש את התמלול כמשימת חשיבה — הוא פותר תיקונים עצמיים, מעצב את הפלט, מייחס דוברים, וקורא למודלים אחרים של G​emini בעצמו. Whisper Large v3 Turbo הוא זיקוק של 809 מיליון פרמטרים של Whisper Large-v3 מבית Ope​nAI, ברישיון MIT, ניתן לאירוח עצמי, תומך ב-99 שפות, ומהיר בערך פי ארבעה עד שמונה מהמודל שממנו זווקק, תלוי בחומרה. האחד הוא שכבת בינה מנוהלת מעל שמע; השני הוא רכיב חינמי ומוכר היטב שאתה מריץ בכל מקום שתרצה. השאלה שהדף הזה נועד לענות עליה היא מצומצמת ושימושית יותר מ"מה עדיף": מתי קו הבסיס מפסיק להיות טוב מספיק?

קו הבסיס, למקרה ששכחת כמה הוא טוב

Whisper Large v3 Turbo ראוי למעמד ברירת המחדל שלו, ולכן הטיעון בעדו מובא ראשון:

זה רץ בכל מקום — רישיון MIT, משקלים פתוחים, ניתן להתקנה על מחשב נייד, GPU יחיד, או פונקציה ללא שרת (serverless). אין ספק, אין מדידה, אין נתונים שיוצאים מהרשת שלך.

• זה מהיר — המפענח המזוקק (32 שכבות מקודד, 4 שכבות מפענח, ירידה מ-32) הופך אותו למהיר בערך פי ארבעה מ-Whisper Large-v3 על חומרה טיפוסית, ועל חלק מהחומרות אף יותר, תוך שמירה על רוב הדיוק שלו. הנתון של OpenAI עצמה הוא בערך פי שמונה על A100.

• הוא מכסה 99 שפות לתמלול, רשימה רחבה יותר מ-85+ של Gemini 3.5 Transcribe.

הדיוק שלו מתועד היטב: 2.1% WER על LibriSpeech test-clean, 4.2% על test-other, 9.1% על Common Voice English — מספרים ששוכפלו ברחבי הקהילה במשך שנים.

• האקוסיסטם עצום — faster-whisper, whisper.cpp, ONNX exports, וכל מסגרת הסקה שבה אתה כבר משתמש. אם אתה יכול להריץ מודל, אתה יכול להריץ את זה.

A screenshot of the Hugging Face model page for openai/whisper-large-v3-turbo, showing the MIT license tag, the automatic-speech-recognition pipeline tag, the Transformers and Safetensors tags, the 99-languages tag, and the model card for the 809 million parameter distilled version of Whisper Large-v3, captured August 27 2026.

עבור תמלול אצווה באנגלית ובשפות קרובות לאנגלית בקנה מידה נרחב, Whisper Large v3 Turbo הוא המוביל מסיבות מבניות ששום פער במדדי השוואה לא יכול בקלות להפוך: הוא חינמי, הוא שלך, והוא בכל מקום.

A generated two-column scoreboard titled 'Gemini 3.5 Transcribe vs Whisper Large v3 Turbo - the scoreboard'. Left column Gemini 3.5 Transcribe: Deployment managed API, Languages 85+, WER 2.6% non-streaming, Speaker ID built in, Formatting intelligent, Price ~$0.005/min. Right column Whisper Large v3 Turbo: Deployment anywhere self-host, Languages 99, WER 2.1% LibriSpeech clean, Speaker ID none, Formatting plain, Price free to run. Footer reads 'Gemini WER per Artificial Analysis, cited by Google; Whisper WER on LibriSpeech - a different set, see text.'

מה מוסיף Gemini 3.​5 Transcribe מעבר לכך

ערכו של המתמודד המנוהל אינו בכך שהוא מנצח את קו הבסיס באנגלית נקייה — זהו קרב שהמספרים אינם יכולים אפילו להכריע בו בצורה נקייה עדיין. ערכו הוא העבודה שמתרחשת מעל למילים, ש-Whisper במפורש אינה עושה:

• ייחוס דובר — עד שלושה דוברים עם חותמות זמן ברמת מילה, במודל הבסיסי. Whisper מתמלל זרם דיבור אחד; אין לו מושג מי אמר מה.

• עיצוב חכם — הסרת חוסר שטף, פתרון תיקונים עצמיים, החלת פיסוק ורישיות. Whisper מחזיר את המילים כפי שנאמרו, כולל האממ והכל.

• אוצר מילים מותאם אישית — נטייה לז'רגון ולאיותים חריגים. ל-Whisper אין מנגנון כזה; אתה מבצע עיבוד לאחר או כוונון עדין.

• Function calling — התמליל יכול להעביר ידיים למודלים אחרים של G​emini, מה שהופך את התמלול לשלב בצינור עיבוד של סוכן ולא לפלט סופי.

• סשנים ארוכים — כשעה של אודיו במעבר אחד (הקשר של 96K לפי דיווחי העיתונות) לעומת הצורך המעשי של Whisper לפצל ולתפור קבצים ארוכים.

זה מוצר שונה. זה מה ש-Go​ogle מכנה "תמלול חכם", וזה החלק בהשוואה שאינו תלוי בחשבון מדדים.

שאלת הדיוק שאף אחד לא יכול עדיין לענות עליה בצורה ברורה

שני המספרים העיקריים של המודלים אינם מתמודדים זה מול זה בפועל. ה-WER הלא‑מקוון של Gemini 3.​5 Transcribe, שעומד על 2.6%, הוא מדידה של Artificial Analysis שצוטטה על ידי Go​ogle, וחושבה על פני 85+ שפות. ה‑WER של Whisper Large v3 Turbo, 2.1% ב‑LibriSpeech test‑clean, הוא מדד אנגלי ממאמר הזיקוק של Ope​nAI עצמו, ששוחזר באופן נרחב. קורפוסים שונים, כיסוי שפות שונה, ספקים שונים. מה שניתן לומר בכנות: על אנגלית נקייה, קו‑הבסיס הפתוח והמתמודד המנוהל נמצאים באופן סביר באותו אזור, והיתרון של המודל המנוהל הוא התכונות הרב‑לשוניות והמבניות שלו, לא ניצחון מוכח ב‑WER באנגלית. חומרי ההשקה של Go​ogle אינם כוללים השוואה ישירה מול מודלים ממשפחת Whisper, והשוואה אדוורסרית עצמאית עדיין אינה קיימת, כי Gemini 3.​5 Transcribe פומבי כבר יום אחד. עד שתופיע השוואה כזו, כתר הדיוק אינו מוכרע, וכל מאמר — כולל זה — שמכריז על מנצח ב‑WER על סמך שני המספרים הללו, חורג מהמותר.

A screenshot of the Google blog announcement page for Gemini 3.5 Transcribe, titled 'Intelligent transcription with Gemini 3.5 Transcribe', showing the August 26 2026 date and the authors Diego Melendo Casado and Luke Leonhard, captured August 27 2026.

עלות: חינם להפעלה תמורת $0.005 לדקה

ל-Whisper Large v3 Turbo יש עלות חומרה ואין מונה. אם מריצים אותו על GPU שכבר בבעלותך, העלות השולית לדקת תמלול קרובה לאפס; אם שוכרים GPU, העלות היא מה שעולה המופע בזמן שהוא עובד. Gemini 3.5 Transcribe גובה בערך $0.005 לדקת אודיו בממוצע משוקלל, עם ה-SKU החי בסביבות $0.009 לדקה ומסלול חינמי. באלף שעות אודיו מדובר בכ-$300 על המונה של Gemini, לעומת כמה דולרים בודדים של זמן GPU על הבסיס הפתוח. הפער הזה הוא סיפור העלות האמיתי של ההתמודדות הזו, וזו הסיבה שהבסיס ישמור על מעמדו כברירת מחדל לעבודת אצווה באנגלית בהיקפים גדולים לאורך זמן. הכלכלה של המודל המנוהל נסגרת רק כשהתכונות שהוא כולל — דיאריזציה, עיצוב, בקרת אוצר מילים — היו עולות לך בעצמן זמן הנדסי להרכבה על גבי Whisper.

שפות וסטרימינג

Whisper Large v3 Turbo מפרט 99 שפות לעומת 85+ של Gemini, אבל הסיפור המעשי של תמיכה רב־לשונית שונה: Whisper מתמלל את כל 99 במעבר אחד, ללא זיהוי אוטומטי, והדיוק שלו יורד בעיקר בשפות דלות־משאבים ורועשות — הפשרה הכרוכה במודל מזוקק. Gemini מזהה אוטומטית בין 85+ השפות שלו, ו־Google מדגישה מבטאים וניבים אזוריים. לגבי סטרימינג, ל־Whisper אין מודל זמן־אמת מובנה; פריסות זמן־אמת משתמשות ב־faster-whisper ובמסגרות דומות על החומרה שלך, בעוד של־Gemini 3.5 Transcribe יש נקודת קצה חיה ייעודית עם השהיה תת־שנייה שמוצהרת, ומחיר תואם. אם עומס העבודה שלך הוא חי ורב־לשוני, נקודת הקצה המנוהלת פשוטה יותר להפעלה; אם הוא אצווה ואנגלית, הבסיס הפתוח זול יותר.

פסק הדין, ככל שהוא

Whisper Large v3 Turbo נותר ברירת המחדל הנכונה לתמלול אנגלי בהיקף גדול, לכל מה שחייב לרוץ על התשתית שלך, ולצוותים שרוצים ארטפקט קפוא ובר-ביקורת. Gemini 3.5 Transcribe הוא הבחירה הנכונה כאשר התמליל צריך להיות יותר מסתם מילים — תוויות דוברים, עיצוב נקי, אוצר מילים תחומי, כיסוי רב-לשוני או חיבור לסוכן — וכאשר אתה מוכן לשלם לפי שימוש עבור התכונות האלה. השניים מתקיימים זה לצד זה, והתבנית שהופכת את הדו-קיום לזול היא גבול ניתוב: המתמלל שמתאים לשמע, ואז שכבת ה-LLM שמחליטה מה יקרה לטקסט. על השכבה הזו פועל OrcaRouter — API אחד על פני 200+ מודלים, מעבר אוטומטי בין ספקים, ו-DSL לניתוב שמרכיב כמה מודלים לקריאה אחת. אף מודל דיבור אינו מתארח אצלנו; בחירת התמלול היא בין ה-GPU שלך למונה של Google, ושניהם יישארו כאן עוד הרבה זמן.

השוואות במאמר הזה1

זוהה מתוך המאמר הזה · בנצ'מרקים: Artificial Analysis · מתעדכן יומית

© 2026 OrcaRouter

לספקים

מפעילים פלטפורמת הסקה (inference)? הציגו את המודלים שלכם ב-OrcaRouter.

providers@orcarouter.ai

הצטרפו לקהילה שלנו

Discordsupport@orcarouter.aiXGitHubYouTube