NVIDIA NemotronLabs VoiceChat 11B-1
Engineering & Research

NVIDIA NemotronLabs VoiceChat 11B: המודל הקולי בדופלקס מלא ש-NVIDIA שחררה בלי להכריז עליו

מחבר

Rowan Sterling

תאריך פרסום

מודלים אחרונים · 20צפו בכל המודלים
בנצ'מרקים: Artificial Analysis · מתעדכן יומית
חזרה לכל הפוסטים

שני כרטיסי מודל נמצאים באותו מאגר של Hugging Face, והם לא מסכימים זה עם זה. זה שמוצג בדף קורא למודל NVIDIA NemotronLabs VoiceChat 11B, נותן את תאריך השחרור כ-3 באוגוסט 2026, ומפרט 11B פרמטרים. השני, קובץ בשם overview.md שאף אחד לא רואה אלא אם כן פותחים את לשונית הקבצים, קורא לאותו מודל 12B, קובע את תאריך השחרור ל-16 ביולי, כולל קטע benchmark שהכרטיס הציבורי משמיט, ועדיין יש את המילה TODO שיושבת במקום שבו אמור להיות תיאור תוצאות. אף כרטיס לא לווה בפוסט השקה, בהודעה לעיתונות, בדו"ח טכני או בציוץ של NVIDIA.

אולם מה שיש שם אינו placeholder. זהו checkpoint בגודל 44 GB שמקשיב ומדבר בו-זמנית: מחסנית אחת שלוקחת אודיו מהמיקרופון ופולטת דיבור מסונתז, ללא המעבר הרגיל מזיהוי דיבור למודל שפה לטקסט-לדיבור. הוא בנוי על שלד ה-Nemotron Nano 9B v2, הוא יכול לקרוא לכלים באמצע משפט בזמן שהוא ממשיך לדבר, ו-NVIDIA טוענת שזהו המודל הפול-דופלקס הפתוח הראשון שמסוגל לעשות זאת.

כל מה שלהלן נקרא ישירות מהמאגר הזה — שני הכרטיסים, config.json, ואינדקס הטנזור בתוך קובץ המשקלים, שפרסנו בעצמנו כדי ליישב את שאלת 11B לעומת 12B. כל מספר ביצועים ש-NVIDIA מפרסמת עבור המודל הזה הוא של NVIDIA עצמה, נמדד על ידי NVIDIA, ולא שוחזר על ידי אף אחד. קיימת בציבור מדידה בלתי תלויה אחת בדיוק של שושלת זו, מאת Artificial Analysis, והיא רשומה תחת שם שונה וספירת פרמטרים שונה — וזה מתברר כדבר המעניין ביותר בהשקה.

מה נמצא בפועל במאגר

המאגר נוצר ב-29 ביולי 2026 ונערך לאחרונה ב-4 באוגוסט. הוא מכיל שבעה-עשר קבצים: שני כרטיסי המודל המתחרים, רישיון, config.json, קובץ אחד בגודל 44.4 גיגה-בייט model.safetensors, דיאגרמת ארכיטקטורה, תיקיית טוקנייזר RNN-T, ארבע הערות מדיניות קצרות בנושא הטיה, בטיחות, פרטיות והסברתיות, ושלושה .wav קבצים — הדגמת תורנות דיבור, הדגמת הפרעה (barge-in), והדגמת קריאת כלים — המוטמעים כנגני שמע בראש הכרטיס כך שתשמעו את המודל לפני שתקראו עליו.

כמה דברים חסרים, והם חשובים יותר מרשימת הקבצים.

אין מאמר עבור מודל זה. הכרטיס מציין חמישה: VoiceBench, Full-Duplex-Bench 1.0, Full-Duplex-Bench v3, SALM-Duplex, Audio Flamingo 3, ובנוסף ה-preprint של PersonaPlex של NVIDIA עצמה. אף אחד מהם אינו דוח טכני של NemotronLabs VoiceChat. הארכיטקטורה מתוארת בשלוש פסקאות בערך ובדיאגרמה, וזה כל התיאור הציבורי של אופן בנייתו.

אין שום דרך לקרוא למודל.דף Hugging Face מצהיר במפורש שהמודל "לא מסופק על ידי שום Inference Provider." אין נקודת קצה מתארחת, לא של NVIDIA ולא של אף אחד אחר. האשכול הפתוח היחיד בקהילה בריפו הוא משתמש שמבקש מ-NVIDIA להוסיף handler.py כדי שניתן יהיה לפרוס את נקודת הביקורת ל-Hugging Face Inference Endpoints — מישהו שניסה להריץ את זה בדרך הקלה וגילה שאין כזו.

אין pipeline_tag ואין library_name. זו הסיבה שלעמוד אין וידג'ט הסקה ואין תווית משימה, וזהו תסמין לבעיה העמוקה יותר: config.json אינו קובץ תצורה של Transformers. זהו NeMo בגודל 32 KB לאימון config, הכולל בלוק AdamW, לוח זמנים של קצב למידה, דליים של dataloader ופיצול אימות. לא ניתן להצביע AutoModel.from_pretrained על זה. אתה משכפל ענף ספציפי של המאגר Speech של NVIDIA — nemotron-labs-voicechat — מקים סביבת conda המקובעת ל-Python 3.12, PyTorch 2.10 ו-Transformers 4.56, מהדר causal-conv1d ו-mamba-ssm ללא build isolation, ולהריץ את הסקריפט שלהם.

מונה ההורדות משקף את כל זה. 107 לייקים מול 80 הורדות בחודש הראשון של המודל הוא סימן ההיכר של גרסה שאנשים שמרו בסימניות ולא הריצו.

NVIDIA NemotronLabs VoiceChat 11B-2

ספרנו את הפרמטרים, ו-11B מנצח

קובץ safetensors נושא כותרת JSON המפרטת כל טנזור, צורתו וסוג ה-dtype שלו, כך שמספר הפרמטרים אינו עניין של דעה. שלפנו את הכותרת וחיברנו: 11,095 מיליון פרמטרים ב-1,626 טנזורים מסוג float32, התופסים 44.38 ג'יגה-בייט. אז הכרטיס המוצג נכון ו-overview.md מיושן — זהו מודל 11B, והנתון 12B הוא שארית.

עץ המודלים של Hugging Face מסביר היכן 12B יכול היה להתגנב פנימה. השושלת שהוא מצייר רצה: Nemotron Nano 12B v2 Base, אחר כך Nemotron Nano 12B v2, אחר כך Nemotron Nano 9B v2, ורק אז המודל הזה. משפחת ה-backbone הטקסטואלי של NVIDIA מכילה גם 12B וגם 9B, כאשר ה-9B הוא הצאצא שגוזם מה-12B, ו-VoiceChat בנוי על ה-9B. כרטיס מודל שנוסח מוקדם יותר בשרשרת היה נושא מטבע הדברים את המספר הגדול יותר.

הכותרת גם מתפצלת באופן נקי לאורך שני חצאיה של הארכיטקטורה:

צד ההבנה — 10.098B.מתוך זה, 7.714B היא מחסנית הטרנספורמר של Nemotron Nano v2, 0.609B הוא מקודד הדיבור, ושלוש מטריצות נפרדות של 131,072 × 4,480 תופסות 0.587B כל אחת.

צד הדיבור — 0.997B. עמוד שדרה של טקסט-לדיבור עם 28 שכבות ורוחב 1,152, בגודל 0.595B, ראש פלט של תערובת גאוסיאנים בגודל 0.159B, ומקודד שמע עצבי שהמקודד והמפענח שלו הם 0.092B כל אחד.

שתי השלכות מעשיות נובעות מה-dtype. הראשונה היא שההורדה בגודל 44 GB אינה מודל גדול, אלא מודל רגיל שנשלח ב-float32; אם תמירו אותו ל-bfloat16, המשקלים יהיו בערך 22 GB. השנייה היא שרצפת ה-80 GB שהוצהרה על ידי NVIDIA נובעת מהבחירה הזו ולא מגודל המודל, וכל מי שיש לו כרטיס עם 48 GB ומוכן להמיר את נקודת הביקורת (checkpoint) בעצמו אינו חסום באופן מובהק — אף על פי שאיש לא פרסם ריצה מאומתת עם טביעת רגל זו, כך שיש להתייחס לזה כחשבון, לא כהבטחה.

איך זה מקשיב ומדבר בו זמנית

"Full duplex" הוא כל העניין של המהדורה, והקונפיגורציה מראה איך רוכשים אותו. שלוש בחירות עיצוביות עושות את העבודה.

מקודד הדיבור אינו יכול להציץ קדימה. זהו Conformer בעל 24 שכבות ו-8 ראשים, שטווח תשומת הלב שלו מוגדר ל-[70, 0] — שבעים פריימים של הקשר משמאל ו-אפס פריימים של הקשר מימין. מזהה קונבנציונלי מציץ באודיו שאחרי הרגע הנוכחי כדי לפרק עמימות במה ששמע זה עתה; לזה אסור לעשות זאת, מה שעולה בדיוק ומקנה את היכולת להוציא החלטה ברגע שפריים מגיע.

הכל מקוונטט ל-80 אלפיות שנייה. אורך המסגרת בקונפיג הוא 0.08 שניות, התואם לגודל המקטע של 80 אלפיות השנייה שתיארה NVIDIA במקומות אחרים עבור קו עבודה זה. המודל מחליט, כל 80 אלפיות שנייה, האם להמשיך להאזין או להתחיל לדבר. הקצב הזה הוא מה שגורם ל-barge-in להרגיש מיידי ולא מנומס.

קריאות הכלים יוצאות מפיהן שלהן. זכור את אותן שלוש מטריצות בעלות צורה זהה ואוצר מילים של 131,072. האחת היא הטמעת הקלט, אחת היא ראש מודל השפה הרגיל — והשלישית נקראת function_head. "ערוץ הפלט הנפרד לסקריפטים של קריאות כלים" בפרוזה של הכרטיס הוא היטל פלט שלישי ממשי, ברוחב 587 מיליון פרמטרים, הפועל במקביל להפקת הדיבור. זו הסיבה הארכיטקטונית לכך שהמודל יכול לשגר קריאת כלי מבלי לעצור את השיחה, וזו מחויבות עיצובית אמיתית ולא מוסכמת פרומפט.

במורד הזרם, מפענח הטקסט-לדיבור חוזה קודים עבור קודק מבוסס קוונטיזציה וקטורית של שארית עם 31 קוונטיזרים וקצבי הורדת דגימה של 7, 7 ו-9 — הפחתה של פי 441 שמעמידה את קצב אסימוני האודיו על 50 פריימים בשנייה, בפלט של 22.05 קילו-הרץ. הקלט הוא 16 קילו-הרץ. קיימים גם מפענח RNN-T ורשת משותפת בנקודת הבידוק, וזו הסיבה שהפלטים המוצהרים של המודל כוללים תמליל של המשתמש לצד הטקסט והאודיו שלו עצמו: התמלול הוא ראש זיהוי אמיתי, לא תוצר לוואי. הקול ברירת המחדל נקרא Aria, וקטע ייחוס בן שלוש שניות מתנה את הדובר.

עוד פרט מהתצורה ראוי להדגשה משום שהוא מאשש מגבלה מוצהרת: מטעין הנתונים של האימון מגביל קטעי קול ל-142.39 שניות. האזהרה בכרטיס שהמודל מחזיק לכל היותר הקשר אודיו של שתי דקות נראית בצינור הנתונים שהפיק אותו.

הציונים, ומי שבעצם מדד אותם

הטענות העיקריות של NVIDIA נוגעות לזמן השהייה ולדירוג. ב-Full-Duplex-Bench 1.0 היא מדווחת על 448 אלפיות שנייה לנטילת תור בצורה חלקה ו-480 אלפיות שנייה לפנות את המקום כשמפריעים, עם שיעור השתלטות של 0.82 בנטילת תור חלקה ו-1.0 בהפרעת משתמש, וציון שופט GPT-4o של 4.33 בטיפול בהפרעות. היא טוענת למקום השני בין מודלי full-duplex פתוחים ב-VoiceBench ולמקום השני בין מודלים פתוחים ב-Full-Duplex-Bench. כל אלה הם ריצות משלה של NVIDIA.

ישרו אותם מול העולם החיצון ושני פערים נפתחים.

בנוגע להיגיון דיבור, המספר של הספק גבוה בכ-שמונה נקודות.הלא מעובדoverview.mdמדווח על 37.0% ב-Big Bench Audio. Artificial Analysis מדדה באופן עצמאי את השושלת הזו ב-29.2%. אותו benchmark, אותה משפחה, פער גדול מספיק כדי לשנות את מקומה של המודל בדירוג.

ב-VoiceBench, המספר של הספק צנוע מדי. הכרטיס טוען למקום #2 בין מודלים פתוחים עם דופלקס מלא; לוח התוצאות הציבורי של VoiceBench מציב את המודל הזה על 58.10, שהוא הגבוה ביותר בקטגוריית הדופלקס המלא הפתוחה, לפני Freeze-Omni עם 55.20 ו-Moshi עם 29.51. כרטיס הדראפט של NVIDIA מדווח על 55.1 לעצמו — מתחת למספר שמופיע כעת בלוח התוצאות.

יש גם מוזרות קטנה יותר: טבלת ההשוואה של NVIDIA עצמה מדרגת את מתחרותיה בנדיבות רבה יותר מאשר Artificial Analysis. כרטיס הטיוטה מציב את Freeze-Omni על 33.4% ואת PersonaPlex 7B על 19.1% ב-Big Bench Audio; Artificial Analysis מודדת 33.9% ו-12.6%. סדר הדירוג של העמיתים נשמר בכל אחת מהדרכים, וזה מרגיע, אבל זה מזכיר שרתמת הבדיקה של ספק ורתמה עצמאית אינן מחזירות את אותם המספרים אפילו עבור צדדים שלישיים.

NVIDIA NemotronLabs VoiceChat 11B-3

התרשים הופך את הכותרת הכנה לבלתי נמנעת. בקרב המודלים הפתוחים בדופלקס מלא, זהו צעד אמיתי קדימה — הוא מכפיל ביותר מפי שניים את הביצועים של PersonaPlex בהיגיון מדובר ומשאיר את Moshi בקטגוריה אחרת לגמרי. בהשוואה למה שאפשר לקנות, זה לא מתקרב: Step-Audio R1.1 ב-96%, Voice Agent של Grok 4.5 ו-Gemini 2.5 Flash (Thinking) ב-92%, Nova 2.0 Sonic ב-87%. מדובר בפער של בערך שלושה לאחד בהיגיון מקלט מדובר.

הדרך הנקייה ביותר לראות כמה עולה דופלקס מלא כיום היא בתוך הקטלוג של NVIDIA עצמה. ב-VoiceBench, NVIDIA Nemotron 3 Nano Omni 30B A3B — מודל גדול יותר שאינו דופלקס מלא — מקבל ציון 89.39, לעומת 58.10 עבור VoiceChat. בערך שלושים נקודות של איכות עוזר הם המחיר של טיפול בהפרעות ושל קצב התור מתחת ל-500 אלפיות השנייה, לפחות בדור הזה. אם המוצר שלך לא צריך מודל שניתן לקטוע באמצע מילה, אתה משלם הרבה על תכונה שלא תשתמש בה.

קריאת הכלים היא הכותרת, וגם החלק החלש ביותר

הטענה שההשקה נשענת עליה היא "מודל ה-full-duplex הראשון בקוד פתוח שתומך בקריאות לכלים", והמספרים שמתחתיה אינם אחידים. בהמרה מדוברת של BFCL-v3, NVIDIA מדווחת על ממוצע של 56.1%: 58.5% פשוטים, 62.5% מרובים, 42.5% מקבילים, 27.5% מקבילים-מרובים, ו-89.6% בסירוב נכון לקריאות לא רלוונטיות. ב-Full-Duplex-Bench v3 הפיצול חד עוד יותר.

בחירת פונקציה — 82.5%. בחירת הפונקציה הנכונה מהרשימה, ש-NVIDIA מתארת בצדק כתחרותית למודלים פורצי הדרך.

דיוק הארגומנט — 44.2%. מילוי נכון של הפרמטרים של הפונקציה לפי מה שהמשתמש אמר.

Pass@1 — 33%. לקבל את כל השיחה נכון בניסיון הראשון.

מודל שיודע באיזה כלי הוא רוצה להשתמש{{1}} בסבירות גבוהה בשני שלישים מזו שהוא יודע למלא את הארגומנטים של הכלי{{/1}} הוא מודל שיחפש בביטחון את מזג האוויר של העיר הלא נכונה. בסוכן טקסט הייתם תופסים את זה עם שכבת ולידציה וניסיון חוזר; בשיחת קול חיה, הניסיון החוזר נשמע למשתמש, והכרטיס מציין שהמודל לא צריך לנסות שיחה שנכשלה בכלל — הוא מקבל הוראה לומר למשתמש שיש בעיה ב-API.

האילוצים התפעוליים סביבו הדוקים, ו-NVIDIA מציגה אותם בלי לייפות: לכל היותר חמישה כלים לכל סשן לפני שהאיכות מתדרדרת, אין קריאות בו-זמנית אמינות למספר כלים, אין דרך למשתמש לקטוע בזמן שכלי מתבצע, ובשיחות מעורבות יש נטייה לענות מהידע שלה במקום לקרוא לכלי שהיה צריך. תגובות ארוכות של כלים משתקות את הסוכן, וזו הבעיה שתכונת "הודעת ההמתנה" קיימת כדי לכסות — כותבים מראש משפט שהסוכן אומר ברגע שקריאה נשלחת, כך שלשתיקה יש תוכן.

מוזרות אחת שתעלה למישהו אחר צהריים: הנחיות מערכת ותגובות כלים חייבות להיות ASCII בלבד. בלי מקפים ארוכים, בלי מרכאות מסולסלות, בלי סמלי מעלות, בלי אמוג'י. פלט כלים צריך להיות משוטח למשפטי ASCII פשוטים וידידותיים לדיבור לפני שהוא מגיע למודל, מה שאומר שלא ניתן להעביר תגובת JSON API כפי שהיא.

כמה עולה להפעיל, והרישיון שעוצר אתכם

התחילו עם החומרה. תיעוד הענף של NVIDIA דורש GPU עם לפחות 80 GB של זיכרון, מה שמצביע על H100 או H200, והתצורה שנבדקה היא H100 עם vLLM. קיבולת H100 לפי דרישה עולה בערך 2–3 דולר לשעה בענני ה-GPU הנפוצים, כך שמופע הפועל ברציפות עולה בסביבות 1,500–2,200 דולר לחודש, לפני שכתבתם קוד יישום כלשהו, שכרתם מישהו כדי לשמור על כך, או טיפלתם בשיחה מקבילה שנייה.

עכשיו ההשוואה. Artificial Analysis מנרמלת תמחור דיבור-לדיבור מתארח לעלות לשעת שמע קלט, והטווח הנוכחי נע בין כ-1.42 דולר לשעה בקצה הזול ועד 10.75 דולר לשעה בשכבת הפרימיום היקרה ביותר, כשאפשרות בינונית מוערכת כמו Grok Voice Think Fast 2.0 נוחתת על 4.80 דולר לשעה — כלומר 0.08 דולר לדקת שמע.

NVIDIA NemotronLabs VoiceChat 11B-4

קריאת שתי הפסקאות יחד מחלישה את טיעון האירוח העצמי יותר מכפי שנראה. H100 ייעודי זול יותר מנקודת קצה מתארחת במחיר בינוני רק אם אתה באמת עושה בו שימוש מלא, והוא יקר יותר מהקצה הזול של השוק המתארח כמעט ללא קשר לשיעור הניצול — בזמן שאתה גם סופג את ההנדסה, את הכוננות, ומודל שמשיג 29.2% היכן שהאפשרויות המתארחות משיגות 87–96%.

ואז יש את הקיר. הרישיון הוא OpenMDW License Agreement v1.1, ובציטוט של הכרטיס עצמו נכתב שהמודל "מוכן למטרות מחקר בלבד." הקוד בענף ה-GitHub הוא ברישיון Apache-2.0; המשקלים אינם. ניתן להוריד את זה, ללמוד אותו, לכוונן אותו, להריץ עליו בדיקות ביצועים ולכתוב עליו. אין לשים אותו מול לקוחות. כל טיעון כלכלי לעיל הוא לפיכך אקדמי עבור חברה שמנסה לשחרר מוצר קולי — השאלה מעולם לא הייתה האם חשבון ה-GPU עבד.

וזו גם הסיבה לכך שנגיד את הדבר המובן מאליו בפשטות: NemotronLabs VoiceChat 11B אינו בר-קריאה דרך OrcaRouter, משום שאינו בר-קריאה דרך שום אמצעי. מה שמפתח אחד אכן נותן לך הוא קו הבסיס שלפיו יש למדוד אותו — מודלי הקול והאודיו המתארחים יושבים מאחורי API יחיד עם 0% תוספת, כלומר אנחנו מעבירים את מחיר המחירון של הספק ישירות, כך שכאשר ספק מוריד את תעריף השמע שלו, המספר הנמוך הוא מה שאתה משלם באותו יום, ולא לאחר מחזור חוזה. אם אתה מתמחר סוכן קולי, התעריף לדקה הזה הוא המספר ש-GPU של 80 GB צריך לנצח, וכדאי לדעת אותו במדויק לפני שאתה מתחייב ל-rack.

בעיית השם: 11B, 12B, NemotronLabs, Nemotron 3

כאן רוב הסיקור המוקדם שגה, ולכן כדאי להיות זהירים לגבי מה שמוכח ומה שלא.

ארבעה אפיקים של NVIDIA עצמה מתארים את העבודה הזו תחת שלוש תוויות שונות. Hugging Face מפרסמת את "NVIDIA NemotronLabs VoiceChat 11B" עם משקלים פתוחים ורישיון למחקר בלבד. הבלוג למפתחים של NVIDIA, במרץ 2026, תיאר את "Nemotron 3 VoiceChat" כמודל דופלקס מלא עם 12B פרמטרים בגישה מוקדמת, המכוון ל-sub-300 ms שהייה מקצה לקצה על נתחים של 80 ms, עם תכנית גישה מוקדמת המציעה קונטיינרים של ייחוס, תוצאות בנצ'מרק ומסלול כוונון עדין, ומבטיחה "משקלים פתוחים וניתנים לבדיקה לפריסה ארגונית." לוח התוצאות הציבורי של VoiceBench ו-Artificial Analysis מגישים את הערכים שלהם כ-"Nemotron 3 VoiceChat (V1)," 12B.

מה שניתן לדעת: תיאורי הארכיטקטורה תואמים רכיב אחר רכיב — מקודד Fast Conformer, שלדת Nemotron Nano v2 9B, מפענח טקסט-לדיבור של NVIDIA, ערוץ נפרד לקריאת כלים, מסגרות של 80 אלפיות שנייה, מחסנית אחידה אחת. הכרטיס שאינו מעובד במאגר Hugging Face משתמש בנתון 12B שבו משתמשים הממשקים האחרים. מדובר באותו קו עבודה, והרישומים של צד שלישי מודדים כמעט בוודאות את המשפחה הזו.

מה שלא מאומת: שהצ'קפוינט שאתה יכול להוריד היום הוא זהה ביט-לביט למה ש-Artificial Analysis ו-VoiceBench העריכו, או למה שתוכנית הגישה המוקדמת מחלקת. שני פרטים מערערים על ההנחה הזו. מספרי הפרמטרים שונים — 11.095B שנמדדו לעומת 12B כפי שדווח. ויעדי ההשהיה שונים בחדות — הטענה הארגונית של הבלוג היא מתחת ל-300 מילישניות מקצה לקצה, בעוד שהכרטיס המשווק מציג מדידות של 448 מילישניות ו-480 מילישניות ב-Full-Duplex-Bench. אלה יכולים להיות נקודות מדידה שונות על אותו מודל, או מודלים שונים. NVIDIA לא אמרה, כי NVIDIA לא אמרה דבר על השחרור הזה בכלל.

המשמעות המעשית: אם אתה מצטט מספר עבור המודל הזה, ציין מאיזה מקור הוא הגיע. סיקור שמייחס את 29.2% של Artificial Analysis לכרטיס המודל של Hugging Face, או את 37.0% של NVIDIA למבחן עצמאי, מיזג שני דברים ש-NVIDIA עצמה שומרת במסמכים נפרדים עם ספירות פרמטרים שונות.

איפה זה נשבר

סעיף המגבלות בכרטיס הטיוטה ישר להפליא, וסניף ה-GitHub מוסיף עוד. נאסף:

אנגלית בלבד, ואין מפת דרכים רב-לשונית במאגר.

זיכרון של שתי דקות. שיחה מעבר לחלון שמע של שתי דקות עשויה שלא להישמר — תקרה קשיחה לשיחות תמיכה או לכל דבר שצריך לזכור מה סוכם לפני ארבע דקות.

טיפש יותר מעמוד השדרה של עצמו. NVIDIA מציינת כי הוא עשוי לבצע ביצועים נמוכים יותר מ־Nemotron Nano 9B v2 בידע, במעקב אחר הוראות ובבטיחות, משום שהוא כוונן לטבעיות שיחה. הוא לא אומן במפורש להיגיון או ליישור; היגיון רב־שלבי וחשבון מסומנים כחלשים.

אין תגובות הקשבה אמינות. ה"ממ-הממ" שמסמן שבן אדם עדיין מקשיב אינו מטופל באופן שיטתי.

זה יקטע אותך באמצע המשפט. הערות הענף מפרטות הפרעה למשתמש בהפסקה באמצע משפט, ו"המשך בלתי נשלט / דיבור עצמי", בין מצבי הכשל הידועים — העלות הישירה של מקודד עם אפס הקשר ימני.

חדרים שקטים בלבד.אינו מתאים במפורש לסביבות רועשות או בעלות הדהוד, במיוחד במקומות שבהם יש דיבור ברקע. זה פוסל את רוב קומות מוקדי השירות ואת רוב המכוניות.

מי בעצם צריך להוריד את זה

חוקרים העובדים על מודלים של דיבור דופלקס מקבלים כאן את המרב, וכדאי להם לעבור: checkpoint פתוח של 11B עם ערוץ קריאת כלים תקין, שאומן על כ-550,000 שעות של אודיו מעורב אמיתי וסינתטי, הוא נקודת התחלה טובה בהרבה מאשר יישום מחדש מהמאמר של SALM-Duplex. רישיון המחקר אינו מהווה אילוץ על עבודה זו.

צוותים שבונים סוכני קול צריכים לקרוא את הכרטיס ולדלג על ההורדה. שום דבר שתלמדו מ-checkpoint של 44 GB בפורמט float32 שאינכם יכולים לשלוח לא ישנה את הארכיטקטורה שלכם, והלקח הכנה של מדדי הביצועים הוא שתקשורת דופלקס מלא מקצה לקצה עדיין אינה תחרותית לעומת מודל מתארח טוב בדבר שמשתמשים מבחינים בו ביותר, כלומר האם העוזר הבין אותם. בינתיים הצעד ההגיוני הוא לבנות מול נקודת קצה מתארחת ולשמור על החלפה זולה — מפתח אחד עבור 200+ מודלים עם מעבר אוטומטי לגיבוי משמעותו שתקרית אצל ספק לא מפילה את קו הטלפון שלכם באמצע שיחה, וזה אומר שמעבר למודל פתוח עם דופלקס מלא בשלב מאוחר יותר הוא שינוי בקונפיגורציה ולא שכתוב.

ארגונים שהנושא הזה חשוב להם במיוחד צריכים להגיש בקשה לגישה המוקדמת של Nemotron 3 VoiceChat במקום לבנות על משקולות Hugging Face. התכנית הזו היא המקום שבו נמצאים הרישיון הניתן לפריסה, מיכלי הייחוס והטענה על פחות מ-300 אלפיות השנייה. נקודת הביקורת הציבורית היא תצוגה מקדימה למחקר של אותו רעיון, שפורסמה ללא הניירת שתאפשר להשתמש בו.

שלוש שאלות שהמאגר הזה ימשיך לקבל

האם אוכל להשתמש בזה מסחרית אם אני מכוונן אותו בכבדות? לא. OpenMDW v1.1, יחד עם הצהרת "למטרות מחקר בלבד" של הכרטיס, שולט על המשקלים וכל מה שנגזר מהם; הרישיון Apache-2.0 בענף ה-GitHub מכסה את קוד ההסקה, לא את הצ'קפוינט. כיוונון עדין אינו מלבין רישיון. אם זכויות מסחריות הן מה שאתה צריך, תוכנית הגישה המוקדמת היא המסלול ש-NVIDIA הקימה בפועל למטרה זו.

האם זה אותו דגם כמו זה שבלוחות המובילים? אותה משפחה, כמעט בוודאות; חפץ זהה, לא אושר. הערכים בלוח המובילים וב-Artificial Analysis רשומים כ-"Nemotron 3 VoiceChat (V1)" בגודל 12B, נקודת הבקרה הניתנת להורדה נמדדת ב-11.095B, ו-NVIDIA לא פרסמה דבר המיישב ביניהם. השתמשו במספרים של לוח המובילים כקריאה העצמאית הטובה ביותר הזמינה על השושלת, לא כמדידה מאומתת של הקובץ ב-Hugging Face.

האם זה ירוץ על כרטיס קטן יותר מ-80 GB? סביר להניח, עם עבודה, ואף אחד לא פרסם הוכחה. המשקולות הן float32, אז המרה ל-bfloat16 אמורה להוריד כ-44 GB של פרמטרים לכ-22 GB, מה שמותיר מרווח אמיתי על כרטיס של 48 GB לפני שמתחשבים במטמון KV, בקודק ובבאפרים של הסטרימינג. אבל הנתיב הנתמך הוא vLLM על H100 עם 80 GB, קונטיינר הפריסה בנוי לכך, והתצורה היחידה שנבדקה ש-NVIDIA מדווחת עליה היא זו. הקדש זמן, לא רק VRAM.

מה לצפות

שלושה דברים, כל אחד מהם, היו משנים את האופן שבו המהדורה הזו נתפסת. דוח טכני, או אפילו כרטיס שמפסיק לסתור את עצמו, היה אומר לנו אם נקודת הביקורת 11B היא הפריט שנמדד בלוחות התוצאות. שחזור עצמאי של זמן ההשהיה — מישהו מחוץ ל-NVIDIA שמאשר 448 ms של מעברי תור על חומרה משלו — היה הופך את הטענה הכי מושכת של המהדורה משיווק לעובדה. ורישיון מסחרי, או נקודת קצה מתארחת מכל גורם, היה מעביר את זה מסקרנות שולית של מאמר לאופציה אמיתית עבור הצוותים הרבים שהיו שמחים לוותר על קצת מאיכות החשיבה תמורת סוכן קולי שניתן להפריע לו.

עד שאחת מהאפשרויות הללו תתממש, התיאור המדויק הוא צר אך ראוי לציון באמת: NVIDIA פרסמה את נקודת הביקורת הקולית הדו-כיוונית הפתוחה החזקה ביותר שנמדדה עד כה, נתנה לה את ערוץ קריאת הכלים הראשון שעובד בקטגוריה זו, רשמה רישיון כך שאיש לא יכול לשחרר אותה, ונמנעה מלציין שכל זה קרה.

השוואות במאמר הזה1

זוהה מתוך המאמר הזה · בנצ'מרקים: Artificial Analysis · מתעדכן יומית

© 2026 OrcaRouter

לספקים

מפעילים פלטפורמת הסקה (inference)? הציגו את המודלים שלכם ב-OrcaRouter.

providers@orcarouter.ai

הצטרפו לקהילה שלנו

Discordsupport@orcarouter.aiXGitHubYouTube