כרטיס הירו שנוצר שכותרתו 'NV-Reason-CT vs Gemini 3.1 Pro' עם כותרת משנה 'משטח הקלט הרחב ביותר, ועדיין לא קורא CT'. שני כרטיסים זה מול זה מופרדים בזוג חצים כחולים: הכרטיס השמאלי מסומן 'NV-Reason-CT' עם אייקון סריקת גוף ו'חזה ובטן בלבד - 13,824 אסימונים חזותיים לנפח - OpenMDW-1.1'; הכרטיס הימני מסומן 'Gemini 3.1 Pro' עם אייקון שבב ו'אודיו, וידאו, תמונה, קובץ, טקסט בקלט - הקשר של 1M - שכבת תצוגה מקדימה'. הלוגו של OrcaRouter משולב בפינה הימנית התחתונה.
Guides & Insights

NV-Reason-CT לעומת Gemini 3.1 Pro: משטח הקלט הרחב ביותר, ועדיין לא קורא CT

מחבר

Magnus Corvin

תאריך פרסום

מודלים אחרונים · 20צפו בכל המודלים →
בנצ'מרקים: Artificial Analysis · מתעדכן יומית
חזרה לכל הפוסטים

תשעים וארבעה אחוזים. זהו שיעור השגיאות שהקטלוג שלנו מתעד כעת עבור נתיב אחד שמשרת Gemini 3.1 Pro — 93.93%, לצד חציון זמן עד לאסימון הראשון שנראה כתקרה של עשר שניות ונתון תפוקה של 978 אסימונים בשנייה. אם תפרשו זאת כהצהרה על המודל, תגיעו בדיוק למסקנה השגויה. אם תפרשו זאת כהצהרה על שכבת תצוגה מקדימה תחת עומס, זה הופך לדבר השימושי ביותר בעמוד, מפני שזה מה שצינור קליני באמת חווה כאשר הוא תלוי בנתיב שלא הוקצה עבור תעבורת ייצור.

למודל בצד השני של ההשוואה הזו אין בעיה כזו ואין מדידה כזו. NV-Reason-CT הוא מודל ההסקה התלת-ממדי המקורי ל-CT של NVIDIA עם 4.69 מיליארד פרמטרים, הזמין להורדה תחת OpenMDW-1.1, ללא נתון תפוקה מפורסם כלל וללא אירוח בשום מקום. אז צד אחד של ההתמודדות הזו נותן לכם את משטח הקלט הרחב ביותר בתחום, עם פרופיל זמינות שעליכם לתכנן סביבו; הצד האחר נותן לכם יכולת צרה אחת עם השהיה שעליכם למדוד בעצמכם. לאף אחד מהם אין לוח מחוונים לניטור שאפשר לסמוך עליו מהיום הראשון, ומסיבות הפוכות.

שני מודלים, שתי הגדרות של "מולטימודאל"

המילה עושה עבודה רבה בשני תיאורי המוצרים, וכמעט שאף חלק ממנה אינו משותף.

• קלטים מתקבלים — Gemini 3.1 Pro מקבל טקסט, תמונות, אודיו, וידאו וקבצים; NV-Reason-CT מקבל נפח NIfTI חד-ערוצי ביחידות Hounsfield, ושום דבר אחר

• מה המשמעות של "3D" — NV-Reason-CT דוגם מחדש ל-2 מ"מ איזוטרופי על פני קובייה של 384 מילימטרים וחותך אותה לטלאים של 8 x 8 x 8 עבור רשת של 24 x 24 x 24; קלט הווידאו של Gemini 3.1 Pro הוא רצף של פריימים דו-ממדיים עם ציר זמן

• הקשר — 1,048,576 טוקנים בקלט ו-65,536 בפלט עבור Gemini 3.1 Pro; נפח אחד הוא 13,824 טוקנים חזותיים עבור NV-Reason-CT, ללא דגימה מטה וללא שכבת מיזוג, ואין חלון צ'אט סביבו

• שחרור — 19 בפברואר 2026 עבור Gemini 3.1 Pro, ב-slug של תצוגה מקדימה; השקה מחקרית שלא הוכרזה עבור NV-Reason-CT, עם פעילות במאגר המתוארכת ל-2 עד 25 בספטמבר 2026

• מחיר — $2 ו-$12 למיליון טוקנים עד 200,000 טוקנים, ואז $4 ו-$18, עם קריאות מטמון ב-$0.20 וכתיבות מטמון ב-$0.375; לעומת משקלים באירוח עצמי ללא מחירון

• יכולות — ראייה, שמע, שימוש בכלים, פלט JSON והסקה עבור Gemini 3.1 Pro; ממצאים מובנים לפי אזור אנטומי עבור NV-Reason-CT, ללא כלים

• רישיון ומצב — API מתארח לתצוגה מקדימה; מול משקולות OpenMDW-1.1 שכרטיס המודל שלהן מציין מחקר וחינוך בלבד ומצהיר במפורש שאינו מכשיר רפואי

קלט וידאו וקלט CT נפחי נראים סמוכים ממרחק, אך מקרוב אין רחוקים זה מזה יותר. וידאו הוא פריימים לאורך זמן. בדיקת CT היא נפח סטטי יחיד עם שלושה צירים מרחביים, קנה מידה פיזי במילימטרים ויחידת צפיפות מכוילת, כאשר הדבר הנמדד הוא הצפיפות של מבנה שגודלו חשוב. Gemini 3.1 Pro יצפה בהקלטה כירורגית ויתאר מה קרה. הוא לא ימדוד נודולה. זו אינה מגבלה שגוגל לא הצליחה לטפל בה; זו בעיה אחרת שאיש לא פתר עם מודל כללי.

מה שתי רשומות הבנצ'מרק מכסות, ומה הן משמיטות

ל-Gemini 3.1 Pro יש רקורד עצמאי, והוא טוב בצירים שהוא מודד.

• GPQA Diamond — 94.1, הנתון הגבוה ביותר בכל קבוצת המאמרים הזו

• Humanity's Last Exam — 47, עם ציון שחזור בהקשר ארוך של 82, שוב הגבוה ביותר בהשוואה הזו

• IFBench and SciCode — 77.14 ו-58.7

• τ²-Bench — 95.61, כאשר tau_banking עומד על 21.44 ו-Terminal-Bench Hard עומד על 53.79

• Artificial Analysis אינטליגנציה וקידוד — 29.7 ו-68.8

• השהיה נמדדת — חציון של עשר שניות עד לאסימון הראשון, שנראה כתקרה ולא כחציון אמיתי, בקצב של 978 אסימונים לשנייה ובשיעור שגיאות של 93.93%

שימו לב לצורה של זה: פרופיל ידע והקשר ארוך בראש ההשוואה, מדד אינטליגנציה במרכז-למטה, ומדידת זמינות שאינה שמישה. שלושתם מתארים את אותו מודל באותו מסלול. ציון GPQA Diamond גבוה אומר שהוא יודע המון. ציון משולב של 29.7 אומר שהוא לא מוביל בכל. שיעור שגיאות של 93.93% אומר שבמסלול המסוים הזה, רוב הבקשות שלכם לא יושלמו — וכמעט בוודאות מדובר בעובדת קיבולת והקצאה בנוגע לנקודת קצה בתצוגה מקדימה, ולא בתכונה של המשקולות. איננו יכולים להוכיח מה מהם מבחוץ. מה שכן אפשר לומר הוא שאף אחד משלושת המספרים האלה אינו שגיאת הקלדה, וכל ארכיטקטורה שקוראת רק את הראשון עומדת לחוות שבוע רע.

הרשומה של NV-Reason-CT צרה יותר ומגיעה עם הסתייגות שונה. ה-F1 של 0.614 וה-AUROC של 0.871 שלו על CT-RATE, על פני שמונה עשרה תוויות עם סף אחיד קבוע והנחיית כן/לא ישירה וללא ראש סיווג או התאמה ספציפית למשימה, הם המספרים של NVIDIA עצמה מתוך המאמר של NVIDIA עצמה. קבוצת ההשוואה שמאחוריהם — VoxelFM עם 0.581, Pillar-0 עם 0.544, ClinFusion-8B עם 0.442, CT-CLIP עם 0.398, Merlin עם 0.358, MedGemma 1.5 עם 0.303 — מכילה רק מודלים של הדמיה. לא מופיע שום מודל מולטימודלי כללי, מה שאומר שהשאלה "כיצד יתפקד Gemini 3.1 Pro ב-CT-RATE" לא נשאלה, ועל אחת כמה וכמה לא נענתה.

A generated scoreboard titled 'Breadth on one side, depth on the other' with two columns. The left column, headed 'Gemini 3.1 Pro', lists six rows: inputs, text, image, audio, video, file; context, 1,048,576 in and 65,536 out; GPQA Diamond 94.1; AA Intelligence 29.7; route reliability, 93.93% measured error rate; price, $2 and $12 per million tokens, doubling past 200k. The right column, headed 'NV-Reason-CT', lists six rows: input, one-channel NIfTI in Hounsfield units; context, 13,824 visual tokens per volume, no chat window; CT-RATE F1 0.614 and AUROC 0.871; provenance, the authors paper only; route reliability, not applicable, self-hosted; price, no rate card, no published throughput. A footer reads 'The 93.93% error rate describes a preview route under load, not the quality of the weights.'

הבעיה של שכבת התצוגה המקדימה, כשהיא מנוסחת כראוי

זה החלק בהשוואה שאין לו שום קשר ל-CT והכול קשור להפעלה של כל דבר קליני.

שיעור שגיאות של 93.93% אינו הידרדרות עדינה. זהו נתיב שבו הרוב המכריע של הקריאות נכשל. התגובה הטבעית היא להכריז שהמודל אינו שמיש, והתגובה הזו שגויה משתי סיבות. ראשית, שיעור שגיאות שנמדד בנקודת קצה של תצוגה מקדימה משקף קיבולת, מכסה וניתוב אזורי, ולא את יכולתו של המודל. שכבות התצוגה המקדימה של Google ידועות בכך שהן מוקצות להערכה ולא לייצור, ו-slug שנקרא על שם תצוגה מקדימה הוא slug שעלול להיות מוגבל בקצב ללא הודעה. שנית, המדידה היא תמונת מצב של נתיב אחד ברגע אחד. היא תשתנה. מה שלא ישתנה הוא הלקח: תלות בנתיב תצוגה מקדימה היא תלות בהחלטת קיבולת שמישהו אחר מקבל.

אמצעי ההפחתה אינם זוהרים, והם כל הסיבה לכך שהניתוב קיים כדיסציפלינה ולא כעניין של נוחות.

• לעולם אל תקודד סלאג של תצוגה מקדימה באופן קשיח בנתיב ייצור — הצב את היכולת מאחורי ממשק כך שאפשר להחליף את המודל שמאחוריו בלי פריסה

• נסה שוב ועבור כגיבוי לספק אחר או למודל אחר — עבור משימת חילוץ באצווה, שיעור כשלים של 94% הוא בר-הישרדות אם הכשלים מנותבים למקום אחר, וקטלני אם לא

• מדוד את שיעור השגיאות של עצמך במקום לרשת אחד — הנתון של 93.93% הוא המספר בקטלוג שלנו עבור מסלול אחד, וזה שלך יהיה תלוי באזור שלך, בנפח שלך ובצורת עומס העבודה שלך

• החזק מודל שני חם לכל דבר על ציר זמן קליני — מצב הכשל שאתה מגן מפניו אינו תשובה גרועה, אלא היעדר תשובה

אותה משמעת חלה בכיוון ההפוך בצד ה-CT, שבו אין נתיב בכלל. למודל באירוח עצמי אין שיעור שגיאות של ספק; יש לו שיעור שגיאות חומרה, נטל תחזוקה, ותקרת קיבולת שנקבעת לפי מספר ה-GPUs שרכשת. מצב הכשל הוא תור, וההקלה היא תזמון ולא failover. בעיה אחרת, אותו כלל: דע על איזה מספר אתה בעצם תלוי.

היכן שקונטקסט ארוך באמת עוזר, והיכן שהוא לא.

חלון ה-1,048,576 טוקנים של Gemini 3.1 Pro וציון היזכרות בהקשר ארוך של 82 נקודות הם יתרונות אמיתיים, וכדאי להשתמש בהם במכוון ולא בטעות.

המקום שבו הם מניבים תמורה בתוכנית CT אינו הסריקה. אלא כל מה שסביבה. פעולת חילוץ אחת מתוך תיעוד ניתוחי ארוך והדוחות הנלווים לו, תוך החזקת המסמך כולו בהקשר כך שהשדות יהיו עקביים זה עם זה. סיכום עוקבה שנדרש להחזיק מאות תיאורי מטופלים בבת אחת כדי למצוא את הדפוס החוצה אותם. משימת המרה שבה הסכמה, מאה רשומות לדוגמה ויומן השגיאות — כולם צריכים להיות גלויים באותה קריאה. אלו משימות שבהן חלון ארוך משנה את התשובה, לא רק את הנוחות.

המקום שבו זה לא עוזר הוא הסריקה עצמה, והסיבה שווה לנסח במדויק, משום שזו הטעות שההשוואה הזו מזמינה. סריקת CT של בית החזה המיוצגת באופן שבו NV-Reason-CT מייצג אותה עולה 13,824 אסימונים. Gemini 3.1 Pro יכול להכיל שבעים בדיקות כאלה בתוך החלון שלו ועדיין יישאר לו מקום. המגבלה אינה מקום. היא שמסלול הראייה של Gemini 3.1 Pro מתייחס לתמונה כתמונה בעלת קנה מידה של פיקסלים, כך שבדיקה המוצגת כך איבדה את המרווח בין הפרוסות ואת כיול הצפיפות לפני שנפלט האסימון הראשון. אפשר לבזבז מיליון אסימונים על נפח ועדיין לא לקבל נפח. ההשוואה של המאמר עצמו ממחישה באופן מוחשי את המחיר של כך: MedGemma 1.5 עם 0.303 F1 כאשר מזינים לו עד 85 פרוסות אקסיאליות, לעומת 0.614 עבור המודל הנפחי הנייטיבי, כלומר פער של בערך פי שניים.

איפה אנחנו משתלבים, והדבר האחד שלא נגיד

Gemini 3.1 Pro מוגש דרך OrcaRouter בתור google/gemini-3.1-pro-preview לפי מחירון הספק ללא תוספת כלשהי, בתוך API יחיד שמכסה יותר מ-200 מודלים. עבור מודל שנמצא כרגע בשלב תצוגה מקדימה, השילוב הזה שימושי יותר ממה שזה נשמע. אפס תוספת פירושו ששינוי בתעריפי הספק מגיע אלינו באותו יום, במקום להיספג בשכבת ביניים שמחזיקה מספר ישן. מעבר אוטומטי בין נתיבים פירושו שנתיב שמתחיל להיכשל לא מפיל איתו אצווה שלמה — וזה, בהתחשב בשיעור שגיאות שנמדד בטווח התשעים באחוזים בנתיב אחד, אינו תרחיש היפותטי. ו-DSL לניתוב, שמאפשר לשלוח בקשות בודדות למודל שאמור לטפל בהן, מאפשר לך להפנות את עבודת ההקשר הארוך למודל אחד ואת העבודה הזולה בנפח גבוה למודל אחר, בלי לתחזק שתי אינטגרציות.

‏NV-Reason-CT לא נמצא בפלטפורמה שלנו. גם לא שום מודל של NVIDIA. אלו משקלים שאתה מוריד ומריץ בעצמך, וההצגה הכנה היא ששני חצאיו של הארכיטקטורה הזו חיים במקומות שונים לחלוטין: האחד מאחורי API עם מחירון וסיכון של תצוגה מקדימה, והאחר על החומרה שלך עם רישיון OpenMDW-1.1 ונתון תפוקה שאתה צריך להפיק בעצמך.

A generated scoreboard titled 'What each side gives you, and what it costs' listing five paired rows. Row one: widest input surface, audio, video, image and file against text only, one modality at a time. Row two: longest context, 1,048,576 tokens in against 13,824 tokens per volume. Row three: highest benchmark, GPQA Diamond 94.1 against CT-RATE F1 0.614. Row four: weakest measured figure, a 93.93% route error rate against no published throughput at all. Row five: dependency, a hosted preview tier against your own GPUs. A footer reads 'Both sides carry a number nobody should build on without measuring it themselves.'A screenshot of the OrcaRouter model page for Gemini 3.1 Pro, showing the identifier google/gemini-3.1-pro-preview with tags for Vision, Audio, Video, Tools, JSON and Reasoning, the description of it as a multimodal model accepting text, image, audio, video and file input, and a side panel listing a 1,048,576-token context window with up to 65,536 output tokens. A stat strip reads $2.00 per million input tokens, $12.00 per million output tokens, a median time to first token, and an error rate of 93.93 percent.

ההחלטה ששורדת את המפגש עם הייצור

אם הבעיה שלך היא הבנת טקסט, אודיו, וידאו או מסמכים בהקשר ארוך, Gemini 3.1 Pro נמדד באופן עצמאי בראש התחום בידע ובריקול, והדבר היחיד שעומד בינו לבין צינור ייצור הוא אמינות הניתוב — וזו בעיית הנדסה ניתנת לפתרון, לא בעיית מודל. הצב אותו מאחורי מנגנון failover, אל תכתוב בקוד קשיח את ה-slug של התצוגה המקדימה, ומדוד את שיעור השגיאות שלך במקום לסמוך על של אחרים, כולל שלנו.

אם הבעיה שלך היא נפח CT של החזה או הבטן, יש בדיוק מודל פתוח אחד בהשוואה הזו שיכול לטפל בה, הוא לא זה עם חלון מיליון הטוקנים, והמספר שאמור להנחות את התכנון שלך הוא לא ציון ה-F1 שלו. זו השהיה לכל בדיקה שאיש לא פרסם. מדוד אותה לפני שאתה מבטיח למישהו נתון תפוקה.

ההשוואה שווה לעשותה כי היא מפרידה בין שני דברים שמתערבבים כל הזמן: רוחב הקלט ועומק הייצוג. ל-Gemini 3.1 Pro יש משטח הקלט הרחב ביותר שמישהו הוציא לשוק והשליפה הטובה ביותר מהקשר ארוך בקבוצה הזו, והוא עדיין לא יכול לקרוא בדיקת CT כבדיקת CT. NV-Reason-CT יכול לקרוא אחת ושום דבר אחר. פייפליין צריך את שניהם, צריך אותם על תשתית שונה, וצריך לדעת איזה משני המספרים בכל צד הוא זה שיזעיק אותך בשלוש לפנות בוקר.