
NV-Reason-CT לעומת Kimi K3: 210 הורדות ו-588 מיליון טוקנים
- typesafeחדשTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 לכל 1M טוקנים · 45 tok/s
- openaiחדשOpenAI: GPT-6 Luna2026-09-2237אינטליגנציה
- openaiחדשOpenAI: GPT-6 Sol2026-09-2248אינטליגנציה
- anthropicחדשAnthropic: Claude Opus 5.52026-09-2258אינטליגנציה
- grokחדשGrok 4.72026-09-2146אינטליגנציה
- OrcaחדשOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 לכל 1M טוקנים · 182 tok/s
- orcaחדשOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 לכל 1M טוקנים · 1285 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040אינטליגנציה
- openaiOpenAI: GPT-6 Astra2026-09-0453אינטליגנציה77כתיבת קוד
- googleGoogle: Gemini 3.8 Flash2026-09-0241אינטליגנציה76כתיבת קוד
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245אינטליגנציה76כתיבת קוד
- anthropicAnthropic: Claude Fable 5.12026-09-0153אינטליגנציה82כתיבת קוד
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 לכל 1M טוקנים · 119 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642אינטליגנציה72כתיבת קוד
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 לכל 1M טוקנים · 224 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845אינטליגנציה75כתיבת קוד
- obsidianQwen3.8 27B2026-08-1534אינטליגנציה68כתיבת קוד
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236אינטליגנציה69כתיבת קוד
- grokSpaceXAI: Grok 4.62026-08-1244אינטליגנציה77כתיבת קוד
- metaMeta: Muse Spark 1.22026-08-0540אינטליגנציה72כתיבת קוד
אחד מהמודלים האלה הורד 210 פעמים מ-Hugging Face. השני העביר 588 מיליון טוקנים דרך ה-playground שלנו בשבעת הימים האחרונים. שניהם במשקולות פתוחות, שניהם ניתנים להורדה ממש עכשיו, והפער בין שני המספרים האלה הוא הדבר המועיל ביותר בהשוואה הזו. NV-Reason-CT הוא מודל ראייה-שפה תלת-ממדי של NVIDIA עם 4.69 מיליארד פרמטרים ל-CT של החזה והבטן, שפורסם ל-Hugging Face ב-8 בספטמבר 2026 בלי שום הכרזה. Kimi K3 הוא דגל הדגל של MoonshotAI עם חלון של 1,048,576 טוקנים, שיצא ב-15 ביולי 2026 וכעת הוא אחד המודלים העמוסים ביותר ברשת שלנו. שניהם "פתוחים" במובן שחשוב לטופס רכש. אבל הם ממש לא פתוחים באותה צורה.
שתי משמעויות של "you can download it"
התחל ממה שכל הורדה בפועל מפקידה על הדיסק שלך, כי כאן רוב ההשוואות של משקולות פתוחות נחלשות.
NV-Reason-CT נותן לך model.safetensors בגודל של כ-10.6 GB ב-BF16, ובנוסף model.py וprocessor.py משמעותי — 26 KB של קוד עיבוד מותאם אישית שמממש את החיתוך מודע-האנטומיה, הדגימה מחדש של 2 מ״מ וה-patchification התלת-ממדית. אתה טוען אותו עם trust_remote_code=True, מה שאומר שאתה מריץ את קוד המאגר של NVIDIA בתוך התהליך שלך. האינפרנס דורש CUDA PyTorch, וכרטיס המודל מפרט Ampere, Hopper ו-Lovelace, ונבדק על H100 ו-L40S. הקלט הוא נפח NIfTI אחד בכל פעם. אין סיפור באצ'ינג שפורסם, אין נתון תפוקה, ואין תצורת הגשה במאגר מעבר לinference.py כדוגמה.
Kimi K3 נותן לך מודל חשיבה לשימוש כללי עם חלון הקשר של 1,048,576 טוקנים, קלט טקסט ותמונה, קריאה מובנית לכלים, פלטים מובנים, ומאמץ חשיבה ניתן להגדרה. זהו המודל שאליו תפנה כדי לקרוא מאה קווים מנחים קליניים בבקשה אחת, או עשור של דוחות של מחלקה. ציון ה-recall בהקשר ארוך שלו ב-Artificial Analysis הוא 88.7 — הגבוה מבין המודלים בסדרה הזו, ו-8.4 נקודות שלמות מעל ה-80.3 של Grok 4.6.
במילים פשוטות: NV-Reason-CT הוא צ'קפוינט מתמחה עם משטח קלט צר וקוד מותאם אישית שעליכם לסמוך עליו ולתחזק אותו. Kimi K3 הוא מודל כללי עם משטח קלט רחב שמתנהג כמו תשתית. שניהם ניתנים להורדה. רק אחד מהם הוא תחליף ישיר.
ראיות ה-CT, במלואן, והן קצרות
כל מה שידוע באופן פומבי על איכותו של NV-Reason-CT נשען על טבלה אחת בכרטיס המודל של עצמו: משימת הסיווג בת 18 התוויות של CT-RATE בסף אחיד קבוע, הנחיה ישירה של Yes/No, ללא ראש סיווג, ללא התאמה ספציפית למשימה. Macro-F1 0.614, Macro-AUROC 0.871.
שורות ההשוואה הן VoxelFM ב-0.581/0.870, Pillar-0 ב-0.544/0.861, ClinFusion-8B ב-0.442, CT-CLIP ב-0.398/0.733, Merlin ב-0.358/0.662 ו-MedGemma 1.5 ב-0.303. כל אחד מאלה הוא מספר שדווח על ידי הספק מתוך הכרטיס של NVIDIA, ואף אחד מהם עדיין לא שוחזר באופן בלתי תלוי — המאמר בן יומיים.
מה שהטבלה מבססת הוא צר וראוי לציין אותו במדויק: מודל גנרטיבי תלת-ממדי ללא ראש ייעודי למשימה גובר על קווי בסיס של אימון מקדים קונטרסטיבי תלת-ממדי ועל מודל חזית מבוסס פרוסות בסיווג CT עם 18 תוויות. מה שהיא אינה מבססת הוא דבר כלשהו לגבי הסקה כללית, דבר כלשהו לגבי מודאליות שאינן CT של בית החזה והבטן, ודבר כלשהו לגבי יתרון ה-AUROC — 0.871 מול 0.870 הוא תיקו שעוטה נקודה עשרונית.
המספרים של Kimi K3, וההסתייגות של לוח המשקלים הפתוחים
Artificial Analysis מודדת את Kimi K3 במדד Intelligence Index של 43.6, מה שממקם אותו במקום ה-19 מתוך 145 מודלים בלוח הזה בתמונת המצב של הדירוג ב-API המודלים שלנו. הציון שלו ב-GPQA Diamond הוא 93.5, ב-Humanity's Last Exam 46.9, ב-SciCode 59.5, ב-Terminal-Bench 2.1 85.0, ב-AA Coding 76.2 במקום 9, וב-𝜏²-banking 46.0.
טענת דירוג אחת דורשת זהירות, כי קל לטעות בה, וכבר טעו בה בעבר. מדד ה-AA Intelligence של Kimi K3, שערכו 44, מדורג שלישי בין מודלים במשקולות פתוחות בלוח המשקולות הפתוחות, אחרי MiMo-V2.6-Pro עם 46 ו-GLM-5.3 עם 45. הוא אינו המוביל בלוח הזה, והוא אינו מתחרה באותו לוח כמו Grok 4.6 — Artificial Analysis מסווגת את Grok 4.6 כקנייני, ולכן ה-44 שלו שייך לדירוג הכללי, ולא לדירוג המשקולות הפתוחות. שני המדדים נראים זהים — אך אינם.
מה שהמפעיל למעשה רואה
זהו המקור למספר 588 מיליון, וכדאי להסביר זאת במפורש, כי זו פיסת הראיות היחידה במאמר הזה שהיא שלנו ולא שיווק של מישהו אחר.
במהלך שבעת הימים האחרונים, Kimi K3 העביר 587.8 מיליון טוקנים דרך ה-playground של Orca. הזמן החציוני עד לטוקן הראשון שלו היה 7.8 שניות, הוא הפיק 42.9 פלטים בשנייה, ושיעור השגיאות שלו בחלון הזה היה 0.21% — כשל אחד מתוך כ-480 בקשות. שיעור השגיאות הנמדד הזה הוא הדבר שאפשר לקבל מכרטיס מודל, והוא המספר שקובע אם בטוח להציב מודל מאחורי משימת אצווה.
עבור NV-Reason-CT אין מקבילה, משום שהוא אינו נקודת קצה מתארחת בשום מקום — הוא צ'קפוינט שאתה מריץ בעצמך. אין p50, אין שיעור שגיאות, אין זמן פעילות, ואין אל מי לעבור בעת כשל. זו אינה עקיצה; זוהי עובדה מבנית לגבי אירוח עצמי, וזו הסיבה שקבוצת מחקר יכולה לאמץ את NV-Reason-CT ביום שלישי, בעוד שצוות פרודקשן בדרך כלל לא יכול.
אם אתה מריץ את שני החצאים של זה — Kimi K3 כשכבה כללית מתארחת ו-NV-Reason-CT על מארז ה-GPU שלך — צד הניתוב הוא המקום שבו החצי המתארח מקבל את החוסן שלו. Kimi K3 מוגש במחיר המחירון של Moonshot עצמה, $3.00 למיליון טוקנים בקלט ו-$15.00 למיליון בפלט ללא תוספת מחיר, שיעור קריאת המטמון שלו של $0.30 למיליון הוא עשירית מהקלט, ומכיוון שהמחיר מועבר הלאה ללא שינוי, הנחה מצד הספק מגיעה לחשבון שלך באותו היום. מעבר אוטומטי בין ספקים הוא מה שמשאיר משימת אצווה בחיים כשנקודת קצה במעלה הזרם מתנדנדת — ובשיעור שגיאות של 0.21%, התנודות נדירות מספיק כדי שיהיה קל לשכוח מהן עד שהן כבר לא.
צורות העלות אינן דומות זו לזו
• מחיר — הוצאות הון על GPU של NV-Reason-CT בתוספת סטאק ההגשה שלכם לעומת Kimi K3 $3.00 / $15.00 למיליון, $0.30 לקריאה מהמטמון
• הוצאה מינימלית ישימה — NV-Reason-CT מעבד גרפי אחד מדגם Ampere או חדש יותר המוחזק ללא הגבלת זמן לעומת Kimi K3 בקשה אחת
• הקשר — NV-Reason-CT נפח אחד, 13,824 טוקנים קבועים לעומת Kimi K3 1,048,576 טוקנים
• עלות שולית של הבקשה האלף — NV-Reason-CT למעשה אפסית לאחר שה-GPU כבר שולם, לעומת Kimi K3 שהוא ליניארי בטוקנים
• היכן זה נשבר ראשון — תפוקה לא מאומתת של NV-Reason-CT וללא פתרון באצ'ינג, לעומת עלות ההקשר הארוך של Kimi K3 ב-1M טוקנים לבקשה
• מודאליות — NV-Reason-CT 3D NIfTI, חזה או בטן לעומת Kimi K3 טקסט ותמונה, כל דבר

הכלכלה מתהפכת בהתאם לנפח. Kimi K3 לא עולה דבר כדי להתחיל, והעלות גדלה באופן ליניארי. NV-Reason-CT דורש GPU כדי להתחיל, ואז העלות כמעט לא משתנה — ולכן 210 הורדות אינן אות כישלון. זה המספר הנכון עבור צ'קפוינט שקהל היעד שלו הוא מוסדות שכבר מחזיקים בחומרה, ושאותם בכלל לא תמצאו בסטטיסטיקת תפוקת טוקנים.

איזה אחד אתה בעצם בוחר
אם המשימה היא לקרוא נפח CT ולהפיק ממצא מובנה עם עקבות חשיבה, Kimi K3 לא מסוגל לעשות זאת ו-NV-Reason-CT מסוגל. לא "עושה זאת פחות טוב" — לא מסוגל, מפני שאין בו מקודד נפחי בשום מקום, והשטחת סריקה לתמונות תחילה משליכה את היחסים המרחביים שמסלול ה-3D נועד לשמר.
אם המשימה היא לקרוא 400 עמודים של הערות הפניה, להשוות אותן מול מסמך פרוטוקול, ולהפיק פלט מובנה, NV-Reason-CT לא נמצא בתמונה ו-Kimi K3 הוא אחת התשובות הטובות הזמינות, עם שיעור שגיאה מדוד של פחות מרבע אחוז ברשת שלנו.

ההחלטה האמיתית אינה בין השניים. היא אם הבעיה שלך היא בעיית נפח או בעיית טקסט, והפער שבין 210 ל-588 מיליון הוא פשוט איך שהבחנה הזו נראית מבחוץ. מודל אחד הוא מאמר עם משקלים. האחר הוא פיסת תשתית. כדאי להחזיק את שניהם; אף אחד מהם אינו מחליף את האחר.
השוואות במאמר הזה1
זוהה מתוך המאמר הזה · בנצ'מרקים: Artificial Analysis · מתעדכן יומית
