
NV-Reason-CT מול GLM-5.2: אחד מאלה הוצא משימוש, וזה לא זה שאתם חושבים
- typesafeחדשTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 לכל 1M טוקנים · 97 tok/s
- openaiחדשOpenAI: GPT-6 Luna2026-09-2237אינטליגנציה
- openaiחדשOpenAI: GPT-6 Sol2026-09-2248אינטליגנציה
- anthropicחדשAnthropic: Claude Opus 5.52026-09-2258אינטליגנציה
- grokחדשGrok 4.72026-09-2146אינטליגנציה
- OrcaחדשOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 לכל 1M טוקנים · 182 tok/s
- orcaחדשOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 לכל 1M טוקנים · 1285 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040אינטליגנציה
- openaiOpenAI: GPT-6 Astra2026-09-0453אינטליגנציה77כתיבת קוד
- googleGoogle: Gemini 3.8 Flash2026-09-0241אינטליגנציה76כתיבת קוד
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245אינטליגנציה76כתיבת קוד
- anthropicAnthropic: Claude Fable 5.12026-09-0153אינטליגנציה82כתיבת קוד
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 לכל 1M טוקנים · 119 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642אינטליגנציה72כתיבת קוד
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 לכל 1M טוקנים · 224 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845אינטליגנציה75כתיבת קוד
- obsidianQwen3.8 27B2026-08-1534אינטליגנציה68כתיבת קוד
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236אינטליגנציה69כתיבת קוד
- grokSpaceXAI: Grok 4.62026-08-1244אינטליגנציה77כתיבת קוד
- metaMeta: Muse Spark 1.22026-08-0540אינטליגנציה72כתיבת קוד
המודל הישן יותר בהשוואה הזו הוא זה שמוצא משימוש. GLM-5.2 שוחרר ב-16 ביוני 2026; NV-Reason-CT פעילות המאגר שלו מתוארכת בין 2 ל-25 בספטמבר 2026. הייתם מצפים שזה מספטמבר יהיה הלא-ודאי וזה מיוני יהיה הבחירה המוגמרת. ההפך נכון בציר שחשוב לצינור טקסט: GLM-5.2 הוחלף ב-GLM-5.3, שיצא ב-18 באוגוסט 2026, והוא כעת נושא סימון הוצאה משימוש בלוח הדירוג העצמאי שבו מפורסמים הנתונים שלו. NV-Reason-CT, עם כל מה שעוד לא מוכרע לגביו, הוא הגרסה הנוכחית של הדבר היחיד שהוא עושה.
אז המשפט השימושי הראשון במאמר הזה הוא זה שסביר שהקורא הכי פחות יצפה לו: אם אתם מתחילים היום בניית טקסט ופונים ל-GLM-5.2 מתוך הרגל, עצרו והסתכלו קודם על GLM-5.3. הוא עולה $1.26 למיליון טוקנים בקלט ו-$3.96 למיליון בפלט, לעומת $1.40 ו-$4.40 של GLM-5.2 — הוא גם חדש יותר וגם זול יותר — ומדד האינטליגנציה העצמאי שלו הוא 44.8 לעומת 33.7, כלומר צעד למעלה באותו סולם ולא תזוזה הצידה. זו החלטה נפרדת מכל דבר שקשור ל-CT, והיא ראויה להיעשות בנפרד.
שני המודלים, ושני הסוגים השונים של מיושן
יש הבחנה אמיתית בין מודל ישן לבין מודל שהוחלף, והצימוד הזה הופך אותה למוחשית.
• מה זה עושה — NV-Reason-CT קורא נפח CT של בית החזה או הבטן ומפיק ממצאים מובנים לפי אזור אנטומי; GLM-5.2 הוא מודל שפה טקסטואלי בלבד להסקה, קוד ועבודה עם מסמכים ארוכים
• שוחרר — הארטיפקטים של NV-Reason-CT מתוארכים ל-2 עד 25 בספטמבר 2026; GLM-5.2 ב-16 ביוני 2026, כאשר GLM-5.3 מגיע לאחריו ב-18 באוגוסט 2026
• מצב הדור — NV-Reason-CT הוא גרסה 0.1, מהדורה ראשונית, שטרם הוכרזה; GLM-5.2 הוא הדור הקודם של קו מוצרים המשווק כיום
• מעמד עצמאי — לא קיימות מדידות עצמאיות של NV-Reason-CT; GLM-5.2 נמדד ב-33.7 במדד האינטליגנציה של Artificial Analysis, עם סימון הוצאה משימוש, לעומת GLM-5.3 ב-44.8
• רישיון וגישה — משקולות OpenMDW-1.1 שאתם מורידים; לעומת מודל במשקלים פתוחים המוצע במחיר של $1.40 ו-$4.40 למיליון טוקנים, עם קריאות מהמטמון ב-$0.26
• הקשר — 13,824 טוקנים חזותיים לכל כרך ללא חלון צ'אט; לעומת 1,000,000 טוקנים בקלט ו-128,000 בפלט
• שימוש מוצהר — למחקר וחינוך בלבד, אינו מכשיר רפואי; נגד פריסה לשימוש כללי
המילה "deprecated" עושה כאן עבודה מדויקת, וכדאי לא לקרוא בה יותר מדי. סימון deprecation בלוח דירוג אומר שהמעריך הפסיק להתייחס למודל כאל עדכני, בדרך כלל מפני שמחליף תפס את מקומו. זה לא אומר שהמשקלים נסוגו, ש-API כובה, או שהמודל הפסיק לעבוד. צוותים שהפייפליינים שלהם מכווננים מול GLM-5.2 לא נמצאים בצרה. מה שזה כן אומר הוא שהנתונים שלו הם תמונת מצב מלפני ש-GLM-5.3 היה קיים, ושערבוב שלהם עם מספרים עדכניים של מודלים אחרים הוא השוואה בין מדידה מיוני לשדה מספטמבר.
המספרים שיש לכל צד, וכמה הם שווים
הרשומה של GLM-5.2 מאוכלסת היטב באופן יוצא דופן, והיא מגיעה משני מקורות שחלוקים ביניהם בדרכים מלמדות.
לפי הדיווח העצמי של Z.ai, המודל מציג 99.12 ב-τ²-Bench, 62.1 ב-SWE-bench Pro, 54.7 ב-Humanity's Last Exam עם כלים, ו-82.7 המדווח הטוב ביותר ב-Terminal-Bench 2.1. בצד העצמאי, Artificial Analysis מודדת את אותו מודל ב-77.9 ב-Terminal-Bench 2.1, 33.7 ב-Intelligence Index שלה, 89.5 ב-GPQA Diamond ו-41.1 ב-Humanity's Last Exam. ישנם נתוני ספקים אחרים — 99.2 ב-AIME 2026, 92.5 ב-HMMT February 2026, 91 ב-IMOAnswerBench, 74.4 ב-FrontierSWE, 63.7 ב-ProgramBench, 76.8 ב-MCP-Atlas — וכולם של Z.ai.
שני דברים ברשימה הזו ראויים לציון. ראשית, פער של 4.8 נקודות ב-Terminal-Bench 2.1 בין הנתון הטוב ביותר המדווח על ידי הספק, 82.7, לבין 77.9 הבלתי־תלוי אינו סתירה. נתוני השיא המדווחים על ידי הספק הם בדרך כלל הטובים מבין כמה ארנסים, והמספר של Z.ai עצמה ב-Terminus-2 עבור אותו מדד הוא 81 — המדידה העצמאית נמצאת בתוך הטווח של הספק עצמו. שנית, הפער ב-Humanity's Last Exam גדול יותר: 41.1 באופן עצמאי לעומת נתון ספק של 40.5 ללא כלים ו-54.7 איתם, מה שאומר ש-54.7 הכותרתי הוא מספר בסיוע כלים ואילו 41.1 הוא הנתון ללא כלים. ציטוט של 54.7 לצד ציון ללא כלים של מודל אחר יהיה טעות של ממש.
ל-NV-Reason-CT אין מבנה דו-מקורי כזה, וזה בדיוק המקום שבו הוא חלש יותר. תוצאות ה-CT-RATE שלו — 0.614 F1 ו-0.871 AUROC על פני שמונה עשרה תוויות, עם סף אחיד קבוע ופרומפט ישיר של כן/לא וללא ראש סיווג או התאמה ספציפית למשימה — הן של NVIDIA עצמה. המודלים שאיתם הוא מושווה במאמר הזה (VoxelFM 0.581, Pillar-0 0.544, ClinFusion-8B 0.442, CT-CLIP 0.398, Merlin 0.358, MedGemma 1.5 0.303) הם כולם מודלי הדמיה. שום דבר לא שוחזר באופן עצמאי, והמודל זמין להורדה כבר שבועות. הוא גם מדווח על macro-F1 של 0.592 הנגזר מדוח, ועל מחקר ראשוני עם רדיולוגים מומחים המקשר בין סקירה מסייעת להפחתה של 50% בזמן הפענוח המדווח הממוצע, שאותו המחברים עצמם מסמנים כבעיית מדגם קטן חמורה.
אז השוואת המקור לא מעדיפה את המודל החדש יותר, וזו הנקודה שכדאי להתעכב עליה. GLM-5.2 הוא המודל הישן יותר, שהוחלף, והמספרים שלו מהימנים יותר מאלה של NV-Reason-CT, מפני שמישהו מחוץ לחברה הריץ את מערכת ההערכה. להיות עדכני אינו אותו דבר כמו להיות מאומת.

למה ההוצאה משימוש חשובה יותר ממה שזה נשמע
יש כשל ספציפי שההשוואה הזו נועדה למנוע, והוא בכלל לא קשור ל-CT.
צוות שבונה צינור עיבוד לטקסט קליני יוצא לחפש מודל במשקלים פתוחים (open-weight) שירוץ על החומרה של עצמם, משום שהנתונים רגישים. הם מוצאים את GLM-5.2, שיש לו רישיון MIT, עם 743 מיליארד פרמטרים ומתוכם כ-40 מיליארד פעילים, שמתאים לדרישות ובעל תיעוד מוסמך של תוצאות בנצ'מרק. הם מכווננים מולו. שישה חודשים אחר כך הם מגלים שהדור הנוכחי הוא GLM-5.3, שהוא בעל חלון הקשר של 1M ותקרת פלט של 128K, שהוא זול יותר במחירים של 1.26 דולר ו-3.96 דולר, ושההחלטה שהם חשבו שהם מקבלים — על איזה מודל במשקלים פתוחים לתקנן — הייתה למעשה החלטה על איזה דור, והם קיבלו אותה בטעות.
זו תאונה יקרה לגלות באיחור, וניתן להימנע ממנה בחיפוש אחד. ההנחיה המעשית:
• בדקו אם המודל שאתם עומדים לתקנן עליו הוא מהדור הנוכחי — סימן ההתיישנות בלוח הדירוגים הוא האות המהיר ביותר, ורשימת המודלים של הספק עצמו היא המקור הסמכותי
• אל תערבבו תמונת מצב מיוני עם נתוני ספטמבר — האינדקס של GLM-5.2, 33.7, נמדד לפני ש-GLM-5.3 היה קיים, והצבתו לצד האינדקס של מודל נוכחי משווה בין שני רגעים שונים בתחום משתנה
• היזהרו עם השם — רשומה בשם "GLM-5.3 Prime" היא שכבת שירות שנושאת את אותם משקלים במחיר כפול בערך ממחיר המחירון, ולא מודל נפרד. בדקו את המשקלים שמאחורי כל SKU לפני שאתם משלמים עליו פרמיה
• התייחסו לתעריף מוצהר נמוך יותר כאל שאלה, לא כתשובה — היות ש-GLM-5.3 זול מקודמו היא תופעה יוצאת דופן שראויה לאימות מול עומס העבודה שלך, ולא להנחה מראש
שום דבר מכל זה לא הופך את GLM-5.2 לבחירה גרועה. מודל 743B ברישיון MIT במחיר $1.40 ו-$4.40, שצוות כבר כיון מולו, הוא דבר הגיוני בהחלט להמשיך להריץ, ומודל מאמצע הדור עם רקורד מבוסס הוא לעתים בדיוק מה שתהליך עבודה רגולטורי רוצה. הנקודה היא שזו צריכה להיות בחירה, שנעשתה במכוון, ולא ברירת מחדל שנורשה מרשימה שהייתה עדכנית ביולי.
המלכודת בהשוואת מודל טקסט למודל CT
הסיבה שהזיווג הזה נראה בכלל סביר היא ששניהם מודלים עם משקלים פתוחים שיצאו ב-2026, וקורא שסורק קטלוג רואה שני פריטים בני-השוואה. הם אינם בני-השוואה, ולחוסר ההתאמה יש צורה מסוימת.
GLM-5.2 מחזיק 1,000,000 טוקנים. נפח CT בודד של NV-Reason-CT עולה 13,824 טוקנים חזותיים. לפי החשבון הזה, GLM-5.2 יכול להכיל שבעים בדיקות CT ועדיין יישאר מקום, מה שמזמין את המסקנה שמודל טקסט בעל הקשר ארוך מספיק הופך את מודל הדימות למיותר. המסקנה אינה נובעת מכך, והסיבה היא הממשק ולא התקציב.
אותם 13,824 אסימונים אינם תקציר. הם קובייה בת 384 מילימטרים שנדגמה מחדש ל-2 מ"מ איזוטרופי, נחתכה ל-8 x 8 x 8 טלאים על גבי רשת 24 x 24 x 24, והועברה לעמוד שדרה לשוני בלי דגימה מטה מרחבית ובלי שכבת מיזוג — ולכן המסלול הפעיל הוא 4.35B פרמטרים מתוך 4.69B בסך הכול, ולכן החישוב מושקע בשמירה על רזולוציה במקום לדחוס אותה ולסלקה. GLM-5.2 הוא טקסט בלבד. אין לו מסלול ראייה כלל, כך שהשאלה כיצד יתמודד עם סריקה אינה עולה; התשובה היא שלא ניתן לתת לו אחת בשום צורה. שני כרטיסי המודל מתארים הבדל של פי שש מאות בתקציב האסימונים שאין לו שום קשר להשוואה, משום שלאחד מהם אין שום דרך לקלוט את הקלט.
הטעות ההפוכה זמינה באותה מידה. NV-Reason-CT תומך בחזה ובבטן, מקבל קובץ NIfTI ולא פרומפט, אין לו שימוש בכלים, וכרטיס המודל שלו מגביל אותו למחקר ולחינוך וקובע שהוא אינו מכשיר רפואי ושהפלטים עלולים להיות שגויים. הוא אינו יכול לנרמל קורפוס של דוחות, לכתוב מסגרת הערכה, או להסיק על מסמך הנחיות. מודל הדמיה של 4.7B אינו תחליף למודל טקסט של 743B, וכך גם ההפך.

לשים חצי מהטקסט על מקש אחד
אם השאלה היא על איזה מודל טקסט להריץ את עבודת ה-pipeline, התשובה כיום היא כנראה GLM-5.3 ולא GLM-5.2 — ושניהם נמצאים בקטלוג שלנו תחת מפתח אחד. z-ai/glm-5.2 מוגש בתעריף רשימת הספקים של Z.ai ללא תוספת מחיר, ולצידו GLM-5.3, בתוך API אחד שמכסה יותר מ-200 מודלים. שמירה על זמינותם של השניים חשובה יותר מהרגיל במהלך החלפת דור: אפשר למדוד את היורש על הקורפוס שלכם לפני שמתחייבים, להשאיר את המודל הקיים כגיבוי בזמן הזה, ולעבור בלי חוזה נוסף או שינוי בקוד.
תעריף ה-pass-through ראוי למשפט מאותה סיבה שהוא חשוב בכל מודל שהספק שלו מתמחר מחדש. בלי שכבת תוספת מחיר באמצע, שינוי בתעריף של הספק נוחת אצלנו באותו יום. מעבר אוטומטי לגיבוי מכסה ספק שמתדרדר באמצע אצווה, אשר עבור משימת חילוץ ארוכה הוא התקלה שבאמת עולה לילה שלם, וה-DSL של הניתוב מאפשר לך לשלוח בקשות בודדות למודל שאמור לטפל בהן במקום להפנות הכול לנקודת קצה אחת.
NV-Reason-CT אינו נמצא בפלטפורמה שלנו, וגם לא אף מודל של NVIDIA. ראוי לומר זאת במפורש ולא להשאיר זאת להסקה: צד ה-CT בארכיטקטורה הזו הוא משקלים שהורדו על החומרה שלך, תחת רישיון שמתיר זאת וכרטיס מודל שאוסר שימוש קליני. אנחנו לא מארחים אותו ולא נכתוב משפט שמרמז אחרת.
הסדר שבו יש לקבל החלטות אלו
הרצף הנכון לבנייה קלינית אינו זה שההשוואה מרמזת עליו.
תחילה בשאלת יצירת הטקסט, והתחל אותה בבדיקה איזו גרסה היא הנוכחית — GLM-5.3 ולא GLM-5.2, מבחינת מחיר ומבחינת יכולת מדודה, אלא אם יש לך סיבה להישאר במקום. לאחר מכן מדוד את השהיה לכל מחקר של מודל ה-CT על החומרה שלך, מכיוון שמספר זה אינו מפורסם והוא קובע את יתרת התקציב. לאחר מכן תכנן את הצינור כך ששני החצאים יהיו ניתנים להחלפה באופן עצמאי, שכן האחד נמצא במחזור חיים סמוך לתצוגה מקדימה והאחר נמצא בגרסה 0.1.
הדבר האחד שאסור לעשות הוא להתייחס לשניים כאל בחירה. למודל טקסט 743B שהוחלף ולמודל CT הנוכחי 4.69B אין שום משימה משותפת. כדאי לערוך את ההשוואה רק בשל מה שהיא חושפת: שמאחורי הארטיפקט החדש יותר עומדות הראיות החלשות יותר, שהעתיק יותר יצא בשקט מן הדור, ושתי העובדות האלה בלתי נראות לכל מי שקורא שורת קטלוג שמפרטת אותן זו לצד זו כאילו היו חלופות.

השוואות במאמר הזה1
זוהה מתוך המאמר הזה · בנצ'מרקים: Artificial Analysis · מתעדכן יומית
