
Granite Speech 5.0 470M TurboCTC: ה-ASR של IBM ברישיון Apache-2.0 טוען ל-12,600 RTFx
- DeepSeekחדשDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.15 / $0.29 לכל 1M טוקנים
- z-aiחדשZ.ai: GLM 5.32026-08-1860אינטליגנציה75כתיבת קוד
- obsidianחדשQwen3.8 27B2026-08-1552אינטליגנציה68כתיבת קוד
- qwenחדשQwen: Qwen3.8 27B (free)2026-08-13qwen/qwen3.8-27b-free
- deepseekחדשDeepSeek: DeepSeek V4 Pro 08132026-08-1253אינטליגנציה69כתיבת קוד
- grokחדשSpaceXAI: Grok 4.62026-08-1261אינטליגנציה77כתיבת קוד
- metaMeta: Muse Spark 1.22026-08-0557אינטליגנציה72כתיבת קוד
- qwenQwen: Qwen3.8 Max2026-08-0358אינטליגנציה72כתיבת קוד
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3152אינטליגנציה69כתיבת קוד
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 לכל 1M טוקנים
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463אינטליגנציה78כתיבת קוד
- googleGoogle: Gemini 3.6 Flash2026-07-2152אינטליגנציה69כתיבת קוד
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137אינטליגנציה49כתיבת קוד
- metaMeta: Muse Spark 1.12026-07-1653אינטליגנציה71כתיבת קוד
- kimiMoonshotAI: Kimi K32026-07-1560אינטליגנציה76כתיבת קוד
- openaiOpenAI: GPT-5.6 Luna2026-07-0952אינטליגנציה71כתיבת קוד
- openaiOpenAI: GPT-5.6 Terra2026-07-0957אינטליגנציה77כתיבת קוד
- openaiOpenAI: GPT-5.6 Sol2026-07-0961אינטליגנציה77כתיבת קוד
Granite Speech 5.0 470M TurboCTC הוא המודל במהדורת הדיבור החדשה של IBM שאתה למעשה רשאי לשחרר לשימוש, וזה הדבר הראשון שכדאי לדעת עליו. IBM פרסמה שתי נקודות ביקורת (checkpoints) לזיהוי דיבור באנגלית ב־Hugging Face ב־25 באוגוסט 2026 — Granite Speech 5.0 470M TurboCTC תחת רישיון Apache 2.0 ו־Granite Speech 5.0 470M TurboCTC-NC תחת רישיון CC-BY-NC-SA-4.0 שאינו מסחרי. אותה ארכיטקטורה עם 470 מיליון פרמטרים, נתונים שונים, ורישוי הפוך. המודל עם רישיון Apache הוא זה ש־IBM מצביעה עליו עבור "מקרי שימוש אחרים" — שזה בשפה של ספקים ייצור מסחרי — והוא גם זה שנושא את המספר המרכזי: IBM מדווחת על תפוקה מצטברת של יותר מ־12,600 RTFx על NVIDIA H200 יחיד, שהיא מתרגמת ליותר משלוש וחצי שעות של אודיו באנגלית שמתומלל בכל שנייה עם הסקה באצוות.
נתון המהירות הזה הוא {{1}}טענת ספק{{/1}} בת יום שלא שוחזרה על ידי גורם שלישי כלשהו, אז יש לקרוא אותו כמספר תיאורטי חזק ולא כעובדה מבוקרת. הסיבה שהוא בכל זאת ראוי לתשומת לבכם היא התכנון שמאחוריו: {{2}}Granite Speech 5.0 TurboCTC{{/2}} מסיר את {{3}}מפענח מודל השפה{{/3}} שבו השתמשו כל דגמי Granite Speech הקודמים, ומשאיר מקודד {{4}}Conformer{{/4}} טהור שאומן עם {{5}}סיווג זמני מבוסס חיבורים (CTC){{/5}} ומפוענח {{6}}לא-אוטורגרסיבית{{/6}}. היעדר {{7}}לולאת יצירה אסימון-אחר-אסימון{{/7}} הוא מה שגורם ל-{{8}}מודל עם 470M פרמטרים{{/8}} בסופו של דבר לטעון לתפוקה שעוקפת מודלים גדולים ממנו פי כמה — וזו הסיבה שהגרסה הזו חשובה לכל מי שבונה מערכות {{9}}דיבור-לטקסט{{/9}}, ולא רק עבור {{10}}טבלת המדדים{{/10}}.
מה שנשלח בפועל
שני צ'קפוינטים, שניהם שוחררו ב-25 באוגוסט 2026 בארגון ibm-granite של Hugging Face, שניהם ASR לאנגלית בלבד עם אותה ארכיטקטורת encoder-only:
• Granite Speech 5.0 470M TurboCTC — Apache 2.0, שימוש מסחרי מותר, אומן על כ-60,000 שעות של אודיו באנגלית.
Granite Speech 5.0 470M TurboCTC-NC — CC-BY-NC-SA-4.0, לשימוש מחקרי ולא מסחרי בלבד, אומן על כ-75,000 שעות של אודיו באנגלית.
מאמר זה עוסק בדגם Apache — זה שמוצר יכול להסתמך עליו כחוק — עם התאום -NC המוזכר היכן שסיפור הרישוי דורש זאת. שני ה-checkpoints נשלחים כקבצי safetensors בפורמטים F32 ו-BF16, ולשניהם יש תמיכה מקורית בספריית Hugging Face Transformers באמצעות AutoModelForCTC ו-AutoProcessor. התכונה תגיע בגרסת Transformers הבאה; עד אז מתקינים את Transformers מהמקור, טוענים את המעבד והמודל, ומריצים פענוח חמדן (greedy decoding). IBM גם מקשרת להדגמת סטרימינג WebGPU מבוססת דפדפן, שהיא הדרך המהירה ביותר לשמוע כמה נמוך החביון בפועל.
ההימור הארכיטקטוני: מקודד, ללא מפענח, 12.5 אסימונים בשנייה
הסיפור מאחורי טענת המהירות הוא השינוי העיצובי. גרסאות קודמות של Granite Speech שילבו מקודד אקוסטי עם מקרן ומפענח מודל שפה, והמפענח הזה הוא מה שהושמט. Granite Speech 5.0 470M TurboCTC הוא מקודד Conformer עם 16 שכבות שאומן עם CTC, והסקה היא מעבר חמדן יחיד שאינו אוטורגרסיבי. אין מה לדגום, ולכן אין אחזור יצירה שצריך לחכות לו.
שלושה פרטי תצורה הופכים אותו למהיר ולא רק לקטן:
דגימת משנה זמנית בפקטור של 8. הקצה הקדמי רץ במהירות של 100 פריימים לשנייה; המודל מוציא 12.5 טוקנים לשנייה. ערימה ודילוג על פריימי log-mel, ולאחר מכן קונבולוציות עם פסיעה ושיירים מאוגמים בשני הבלוקים הראשונים של Conformer, מקצרים את קצב הפלט בשלושה שלבים של פי 2.
• אוצר מילים של תת-מילים במקום תווים. מקודדי Granite Speech קודמים הפיקו 50 תווים בשנייה; גרסה 5.0 מפיקה 12.5 אסימוני תת-מילים בשנייה מתוך אוצר מילים BPE של 16,384 יחידות (SentencePiece בגרסת -NC). פחות יחידות פלט בשניית שמע פירושו שלמפענח CTC יש פחות החלטות לקבל.
• CTC מותנה-עצמית. שכבת ה-Conformer האמצעית משכללת את הייצוגים הביניים של המודל עצמו, וזה הטריק שמאפשר למקודד קטן לשמור על הדיוק שלו בזמן שהמפענח איננו.
כל זה נמצא בכרטיס המודל ובתיעוד הטכני של IBM. מה שיוצא מכל זה הוא checkpoint שנבנה עבור מחשבים ניידים, טלפונים וצינורות סטרימינג שבהם מפענח אוטורגרסיבי כבד לא היה מתאים — מיצוב הקצה מפורש בתיאור של IBM עצמה.
המספרים ש-IBM טוענת
כל מה שבסעיף זה מדווח על ידי IBM, הופעל דרך מערכת הבדיקה הציבורית של לוח התוצאות Open ASR על תשתית Hugging Face נכון ל-25 באוגוסט 2026, ולא שוחזר באופן בלתי תלוי. יש להתייחס אליהם כמספרי ספק שנראים אמינים, לא כאמת מוסכמת:
• תפוקה — מעל 12,600 RTFx על NVIDIA H200 יחיד עם הסקה באצווה, ש-IBM מתרגמת ליותר מ-3.5 שעות שמע בשנייה. IBM מוסיפה כי מדובר במעל פי 20 מתפוקת דגמי Granite Speech הקודמים. מדובר בנתון של GPU למרכז נתונים והסקה באצווה, לא במה שמחשב נייד יספק לך.
• דיוק — שיעור שגיאות מילים מצטבר של 5.00% עבור מודל Apache במערכות הבדיקה הציבוריות באנגלית קצרה של לוח התוצאות Open ASR (גרסת ה--NC משיגה 4.85% באותן מערכות). ההסקה הופעלה באמצעות תשתית המשרות של Hugging Face והוערכה עם הכלים של לוח התוצאות, ולכן IBM מצפה שאלה יתאימו לטבלה הרשמית ברגע שהמודלים החדשים ייקלטו בה.
• שדה רחוק — בלוח התוצאות של FFASR לסצנות רועשות ומהדהדות, דגם Apache מדורג במקום התשיעי בדיוק ודגם ה‑NC במקום החמישי, ושניהם הדגמים המהירים ביותר בלוח זה (תפוקה שנמדדה על NVIDIA L4 יחיד).
• אימון — כ-60,000 שעות של אודיו אנגלי ציבורי עבור מודל Apache, שבוצע בעשרה ימים על שמונה NVIDIA H100s באשכול Blue Vela של IBM.

מה Apache 2.0 בעצם נותן לך
מה שמיוחד במהדורה הזו הוא הרישיון. מודלי דיבור עם משקלים פתוחים נוטים לצאת תחת רישיונות מחקר או עם התחייבויות שגורמות למחלקה המשפטית של צוות הפיתוח להתכווץ; כאן, התאום הניתן לשימוש מסחרי הוא זה שבו IBM השיגה דיוק מעט נמוך יותר. אתה מוותר על 0.15 נקודות של WER מצטבר (5.00% לעומת 4.85%) תמורת הזכות לפרוס במוצר, להפיק רווח מהפלט, לכוונן ולשמור את המשקולות הנגזרות לעצמך, ולהשתמש בו בתשתית ענן ללא סעיף מחקר-בלבד שיפריע.
קל לבצע את העסקה הזו בכיוון הלא נכון אם אתה רודף אחרי טבלת הדירוג. ה-4.85% של מודל ה-NC מגיע מכ-15,000 שעות נוספות של נתוני אימון (GigaSpeech ו-SPGI Speech), וזוהי הגרסה ש-IBM מגדירה במפורש כ"למטרות מחקר ולא מסחריות בלבד". זה מודל בֶּנצ'מרק מצוין אבל תלות גרועה עבור מוצר. מודל ה-Apache מאבד מעט דיוק ומקבל את היכולת לשמש בסיס לצינור תמלול מסחרי, מערכת אבטחת איכות למוקד טלפוני, או מכשיר קצה. אם אתה מעריך את המשפחה הזו, החלטת הרישוי מגיעה לפני החלטת הבֶּנצ'מרק.

מה שאתה מוותר עליו
השמטת מודל השפה אינה בחינם, וכרטיס המודל כנה לגבי הקיצוצים:
• אין תרגום דיבור. דורות קודמים של Granite Speech יכלו לעבור דרך מודל שפה כדי לתרגם בזמן התמלול; 5.0 הוא תמלול בלבד.
• ללא מִנטייה למילות מפתח. ה־LM טיפל גם בהטיה למונחי תחום ושמות; כשהיא נעלמה, מקבלים את מה שאוצר המילים התת־מילולי מייצר באופן טבעי.
• אנגלית בלבד. אין נקודת ביקורת רב-לשונית במהדורה זו, ואין שום אינדיקציה שהיא תגיע בקרוב.
• ה-WER של 5.00% הוא נתון לאודיו קצר ונקי. תוצאת ה-FFASR (מקום תשיעי, על דיבור בשדה רחוק עם רעש) היא האינדיקטור הריאלי יותר לשימוש בחדרי ישיבות ובידיים חופשיות, והיא דירוג, לא נתון עיקרי.
למשימת תמלול מצומצמת — אודיו של שיחות, פגישות, תזכירים קוליים, כתוביות, הכתבה — אף אחד מאלה אינו חסם. הם חשובים אם קיווית שמודל קטן אחד גם יתרגם, או שיתמלל באופן מהימן אוצר מילים מותאם אישית כבר מההתחלה.
איך להריץ את זה היום
אינך צריך API ענן שעדיין לא קיים. המודל רץ מקומית:
• התקן את Transformers מהמקור (ערכת התכונות של CTC עדיין לא נמצאת במהדורה האחרונה), ולאחר מכן AutoModelForCTC יחד עם AutoProcessor ופענוח חמדני (greedy decoding) — ה‑pipeline הסטנדרטי. המעבד יכול לחשב תכונות log‑mel על המכשיר של המודל, ובכך לחסוך העתקה מהמארח להתקן.
הדוגמה בכרטיס המודל היא בת שתי שורות באמצעות pipeline: automatic-speech-recognition עם המודל "ibm-granite/granite-speech-5.0-470m-turboctc".
• הדגמת סטרימינג של WebGPU הפועלת בכרטיסיית דפדפן היא הדרך המהירה ביותר לאמוד חביון לפני שמשקיעים אחר צהריים במתקן בדיקות ביצועים.
• עבור ייצור, השאלה המעשית היא הגשת המודל. מודלי ASR פתוחים בקטגוריה זו בדרך כלל רצים על CPU או GPU קטן עם מעין הסקת סטרימינג בקבוצות (batched streaming inference) — המספר 12,600 RTFx בכותרת הוא מספר אצווה של H200; מספר ריאלי לזרם בודד על מחשב נייד יהיה נמוך בהרבה, ו-IBM לא פרסמה נתוני זמן עד לטוקן הראשון.
שכבת ההגשה היא המקום שבו העלות והמורכבות האמיתית של זיהוי דיבור פתוח (ASR) שוכנות, והיא גם המקום שבו פלטפורמת ניתוב מצדיקה את עצמה. המודל של OrcaRouter הוא API אחד על פני 200+ מודלים, כאשר מחירון הספק מועבר הלאה עם סימון של 0% — כך שכאשר ספק מוריד מחיר, ההורדה נכנסת לתוקף באותו היום — בתוספת מעבר אוטומטי בין ספקים ו-DSL לניתוב להרכבת מספר מודלים לתוך קריאה אחת. אף אחד מאלה לא חל על Granite Speech 5.0 470M TurboCTC באופן ספציפי, כי אף אחת מהגרסאות לא נמצאת עדיין ב-OrcaRouter: המשקולות בנות יום אחד ואף ספק מסחרי לא מגיש אותן. כאשר מודל דיבור פתוח כזה אכן מקבל מסלול אירוח — או כשמשווים אותו לממשקי API מתארחים לזיהוי דיבור שכבר קיימים — שכבת ניתוב היא הדרך לנסות אותו ולחזור לחלופה בלי לשכתב את האינטגרציה, והתמחור המועבר הוא מה ששומר על ההשוואה הוגנת.
מה עדיין לא אושר?
למודל בן יום אחד יש שובל תיעוד קצר, וכדאי לפרט בדיוק מה שעדיין לא ידוע:
• אין מדד של צד שלישי. ערך ה-RTFx של 12,600, ה-WER של 5.00%, ודירוגי ה-FFASR הם כולם ריצות משלה של IBM דרך מסגרת לוח התוצאות הציבורי. אף גורם בלתי תלוי לא פרסם מספרים.
• אין API המתארח ב-IBM. אין דף מודל של watsonx, אין נקודת קצה מנוהלת, אין תמחור, ואין תאריך להגעת כל אלה.
• אין נתוני השהיית סטרימינג. קיימים תמיכה בסטרימינג והדגמת WebGPU; אבל אין נתונים לגבי זמן עד לטוקן הראשון והשהיית נתחים.
• אין השוואה בתנאי benchmark זהים מול מודלי ה-ASR הפתוחים המהירים האחרים. ההתמודדויות שחשובות — מול Whisper large-v3, NVIDIA Parakeet TDT 0.6B, וממשקי התמלול המתארחים — טרם בוצעו על נתונים זהים על ידי אף אחד.
מה לצפות בהמשך
ה{{1}}אותות לטווח הקרוב{{/1}} הם ה{{2}}שחזורים הבלתי תלויים{{/2}}. {{3}}לוח התוצאות של Open ASR הוא ציבורי, כלי ההרצה הוא סטנדרטי, והמשקלים נמצאים על Hugging Face, כך שריצה של צד שלישי אמורה לנחות תוך ימים — שימו לב האם 5.00% מחזיק מעמד והאם ה-12,600 RTFx שורד על H200 יחיד מחוץ להגדרת ה-batch של IBM עצמה.{{/3}} {{4}}הדבר הנוסף שכדאי לעקוב אחריו הוא האם IBM הופכת את התאום של Apache לשירות מנוהל, שכן נקודת קצה של watsonx תהפוך מיידית את זה ל-ASR הפתוח עם הנתיב המסחרי האמין ביותר.{{/4}} {{5}}Granite Speech 5.0 470M TurboCTC הוא, מהיום הראשון, ASR לאנגלית מהיר באמת, מתירני באמת, עם שובל אימות דק באמת.{{/5}} {{6}}השניים הראשונים אמיתיים; השלישי הוא עניין של זמן.{{/6}}

