כרטיס הירו שנוצר בכותרת 'NV-Reason-CT לעומת Kimi K3' עם כתובית המשנה '210 הורדות ו-588 מיליון טוקנים'. שלושה צ'יפים מופיעים לאורך החלק התחתון: '210 הורדות HF לעומת 587.8M טוקנים / 7d', '0.21% שגיאה נמדדת ברשת שלנו', ו'כרך אחד לעומת 1,048,576 טוקנים'. הלוגו של OrcaRouter מורכב בפינה הימנית התחתונה.
Guides & Insights

NV-Reason-CT לעומת Kimi K3: 210 הורדות ו-588 מיליון טוקנים

מחבר

Elias Hawthorne

תאריך פרסום

מודלים אחרונים · 20צפו בכל המודלים →
בנצ'מרקים: Artificial Analysis · מתעדכן יומית
חזרה לכל הפוסטים

אחד מהמודלים האלה הורד 210 פעמים מ-Hugging Face. השני העביר 588 מיליון טוקנים דרך ה-playground שלנו בשבעת הימים האחרונים. שניהם במשקולות פתוחות, שניהם ניתנים להורדה ממש עכשיו, והפער בין שני המספרים האלה הוא הדבר המועיל ביותר בהשוואה הזו. NV-Reason-CT הוא מודל ראייה-שפה תלת-ממדי של NVIDIA עם 4.69 מיליארד פרמטרים ל-CT של החזה והבטן, שפורסם ל-Hugging Face ב-8 בספטמבר 2026 בלי שום הכרזה. Kimi K3 הוא דגל הדגל של MoonshotAI עם חלון של 1,048,576 טוקנים, שיצא ב-15 ביולי 2026 וכעת הוא אחד המודלים העמוסים ביותר ברשת שלנו. שניהם "פתוחים" במובן שחשוב לטופס רכש. אבל הם ממש לא פתוחים באותה צורה.

שתי משמעויות של "you can download it"

התחל ממה שכל הורדה בפועל מפקידה על הדיסק שלך, כי כאן רוב ההשוואות של משקולות פתוחות נחלשות.

NV-Reason-CT נותן לך model.safetensors בגודל של כ-10.6 GB ב-BF16, ובנוסף model.py וprocessor.py משמעותי — 26 KB של קוד עיבוד מותאם אישית שמממש את החיתוך מודע-האנטומיה, הדגימה מחדש של 2 מ״מ וה-patchification התלת-ממדית. אתה טוען אותו עם trust_remote_code=True, מה שאומר שאתה מריץ את קוד המאגר של NVIDIA בתוך התהליך שלך. האינפרנס דורש CUDA PyTorch, וכרטיס המודל מפרט Ampere, Hopper ו-Lovelace, ונבדק על H100 ו-L40S. הקלט הוא נפח NIfTI אחד בכל פעם. אין סיפור באצ'ינג שפורסם, אין נתון תפוקה, ואין תצורת הגשה במאגר מעבר לinference.py כדוגמה.

Kimi K3 נותן לך מודל חשיבה לשימוש כללי עם חלון הקשר של 1,048,576 טוקנים, קלט טקסט ותמונה, קריאה מובנית לכלים, פלטים מובנים, ומאמץ חשיבה ניתן להגדרה. זהו המודל שאליו תפנה כדי לקרוא מאה קווים מנחים קליניים בבקשה אחת, או עשור של דוחות של מחלקה. ציון ה-recall בהקשר ארוך שלו ב-Artificial Analysis הוא 88.7 — הגבוה מבין המודלים בסדרה הזו, ו-8.4 נקודות שלמות מעל ה-80.3 של Grok 4.6.

במילים פשוטות: NV-Reason-CT הוא צ'קפוינט מתמחה עם משטח קלט צר וקוד מותאם אישית שעליכם לסמוך עליו ולתחזק אותו. Kimi K3 הוא מודל כללי עם משטח קלט רחב שמתנהג כמו תשתית. שניהם ניתנים להורדה. רק אחד מהם הוא תחליף ישיר.

ראיות ה-CT, במלואן, והן קצרות

כל מה שידוע באופן פומבי על איכותו של NV-Reason-CT נשען על טבלה אחת בכרטיס המודל של עצמו: משימת הסיווג בת 18 התוויות של CT-RATE בסף אחיד קבוע, הנחיה ישירה של Yes/No, ללא ראש סיווג, ללא התאמה ספציפית למשימה. Macro-F1 0.614, Macro-AUROC 0.871.

שורות ההשוואה הן VoxelFM ב-0.581/0.870, ‏Pillar-0 ב-0.544/0.861, ‏ClinFusion-8B ב-0.442, ‏CT-CLIP ב-0.398/0.733, ‏Merlin ב-0.358/0.662 ו-MedGemma 1.5 ב-0.303. כל אחד מאלה הוא מספר שדווח על ידי הספק מתוך הכרטיס של NVIDIA, ואף אחד מהם עדיין לא שוחזר באופן בלתי תלוי — המאמר בן יומיים.

מה שהטבלה מבססת הוא צר וראוי לציין אותו במדויק: מודל גנרטיבי תלת-ממדי ללא ראש ייעודי למשימה גובר על קווי בסיס של אימון מקדים קונטרסטיבי תלת-ממדי ועל מודל חזית מבוסס פרוסות בסיווג CT עם 18 תוויות. מה שהיא אינה מבססת הוא דבר כלשהו לגבי הסקה כללית, דבר כלשהו לגבי מודאליות שאינן CT של בית החזה והבטן, ודבר כלשהו לגבי יתרון ה-AUROC — 0.871 מול 0.870 הוא תיקו שעוטה נקודה עשרונית.

המספרים של Kimi K3, וההסתייגות של לוח המשקלים הפתוחים

Artificial Analysis מודדת את Kimi K3 במדד Intelligence Index של 43.6, מה שממקם אותו במקום ה-19 מתוך 145 מודלים בלוח הזה בתמונת המצב של הדירוג ב-API המודלים שלנו. הציון שלו ב-GPQA Diamond הוא 93.5, ב-Humanity's Last Exam 46.9, ב-SciCode 59.5, ב-Terminal-Bench 2.1 85.0, ב-AA Coding 76.2 במקום 9, וב-𝜏²-banking 46.0.

טענת דירוג אחת דורשת זהירות, כי קל לטעות בה, וכבר טעו בה בעבר. מדד ה-AA Intelligence של Kimi K3, שערכו 44, מדורג שלישי בין מודלים במשקולות פתוחות בלוח המשקולות הפתוחות, אחרי MiMo-V2.6-Pro עם 46 ו-GLM-5.3 עם 45. הוא אינו המוביל בלוח הזה, והוא אינו מתחרה באותו לוח כמו Grok 4.6 — Artificial Analysis מסווגת את Grok 4.6 כקנייני, ולכן ה-44 שלו שייך לדירוג הכללי, ולא לדירוג המשקולות הפתוחות. שני המדדים נראים זהים — אך אינם.

מה שהמפעיל למעשה רואה

זהו המקור למספר 588 מיליון, וכדאי להסביר זאת במפורש, כי זו פיסת הראיות היחידה במאמר הזה שהיא שלנו ולא שיווק של מישהו אחר.

במהלך שבעת הימים האחרונים, Kimi K3 העביר 587.8 מיליון טוקנים דרך ה-playground של Orca. הזמן החציוני עד לטוקן הראשון שלו היה 7.8 שניות, הוא הפיק 42.9 פלטים בשנייה, ושיעור השגיאות שלו בחלון הזה היה 0.21% — כשל אחד מתוך כ-480 בקשות. שיעור השגיאות הנמדד הזה הוא הדבר שאפשר לקבל מכרטיס מודל, והוא המספר שקובע אם בטוח להציב מודל מאחורי משימת אצווה.

עבור NV-Reason-CT אין מקבילה, משום שהוא אינו נקודת קצה מתארחת בשום מקום — הוא צ'קפוינט שאתה מריץ בעצמך. אין p50, אין שיעור שגיאות, אין זמן פעילות, ואין אל מי לעבור בעת כשל. זו אינה עקיצה; זוהי עובדה מבנית לגבי אירוח עצמי, וזו הסיבה שקבוצת מחקר יכולה לאמץ את NV-Reason-CT ביום שלישי, בעוד שצוות פרודקשן בדרך כלל לא יכול.

אם אתה מריץ את שני החצאים של זה — Kimi K3 כשכבה כללית מתארחת ו-NV-Reason-CT על מארז ה-GPU שלך — צד הניתוב הוא המקום שבו החצי המתארח מקבל את החוסן שלו. Kimi K3 מוגש במחיר המחירון של Moonshot עצמה, $3.00 למיליון טוקנים בקלט ו-$15.00 למיליון בפלט ללא תוספת מחיר, שיעור קריאת המטמון שלו של $0.30 למיליון הוא עשירית מהקלט, ומכיוון שהמחיר מועבר הלאה ללא שינוי, הנחה מצד הספק מגיעה לחשבון שלך באותו היום. מעבר אוטומטי בין ספקים הוא מה שמשאיר משימת אצווה בחיים כשנקודת קצה במעלה הזרם מתנדנדת — ובשיעור שגיאות של 0.21%, התנודות נדירות מספיק כדי שיהיה קל לשכוח מהן עד שהן כבר לא.

צורות העלות אינן דומות זו לזו

• מחיר — הוצאות הון על GPU של NV-Reason-CT בתוספת סטאק ההגשה שלכם לעומת Kimi K3 $3.00 / $15.00 למיליון, $0.30 לקריאה מהמטמון

• הוצאה מינימלית ישימה — NV-Reason-CT מעבד גרפי אחד מדגם Ampere או חדש יותר המוחזק ללא הגבלת זמן לעומת Kimi K3 בקשה אחת

• הקשר — NV-Reason-CT נפח אחד, 13,824 טוקנים קבועים לעומת Kimi K3 1,048,576 טוקנים

• עלות שולית של הבקשה האלף — NV-Reason-CT למעשה אפסית לאחר שה-GPU כבר שולם, לעומת Kimi K3 שהוא ליניארי בטוקנים

• היכן זה נשבר ראשון — תפוקה לא מאומתת של NV-Reason-CT וללא פתרון באצ'ינג, לעומת עלות ההקשר הארוך של Kimi K3 ב-1M טוקנים לבקשה

• מודאליות — NV-Reason-CT 3D NIfTI, חזה או בטן לעומת Kimi K3 טקסט ותמונה, כל דבר

A generated scoreboard titled 'NV-Reason-CT vs Kimi K3 - the scoreboard'. Left column 'NV-Reason-CT': Price GPU capex plus your serving stack; Minimum viable spend one Ampere-or-newer GPU; Context one volume, 13,824 tokens; Marginal cost of request #1000 effectively zero; Breaks first at unverified throughput, no batching; Modalities 3D NIfTI, chest or abdomen. Right column 'Kimi K3': Price $3.00 / $15.00 per M, $0.30 cached read; Minimum viable spend one request; Context 1,048,576 tokens; Marginal cost of request #1000 linear in tokens; Breaks first at long-context cost at 1M per request; Modalities text and image, anything. A footer reads 'Kimi K3 traffic and error rate measured on OrcaRouter's playground over seven days; NV-Reason-CT has no hosted endpoint to measure.'

הכלכלה מתהפכת בהתאם לנפח. Kimi K3 לא עולה דבר כדי להתחיל, והעלות גדלה באופן ליניארי. NV-Reason-CT דורש GPU כדי להתחיל, ואז העלות כמעט לא משתנה — ולכן 210 הורדות אינן אות כישלון. זה המספר הנכון עבור צ'קפוינט שקהל היעד שלו הוא מוסדות שכבר מחזיקים בחומרה, ושאותם בכלל לא תמצאו בסטטיסטיקת תפוקת טוקנים.

A screenshot of NVIDIA's Hugging Face model page for NV-Reason-CT, showing the model card header with Like 1 and 0 followers, the Image-Text-to-Text and Transformers and Safetensors tags, the qwen3_5, medical-imaging, ct, 3d-vlm and custom_code tags, 'Downloads last month 210', the 5B-parameter BF16 size row, the model description describing the 384x384x384-mm volume becoming a 24x24x24 grid of 13,824 visual tokens with no spatial downsampling, the training paragraph citing roughly 550,000 structured QA examples from 70,111 unique CT volumes, a side panel showing Base model Qwen/Qwen3.5-4B and the CT-RATE and CancerVerse datasets, and the arXiv 2609.27511 paper link.

איזה אחד אתה בעצם בוחר

אם המשימה היא לקרוא נפח CT ולהפיק ממצא מובנה עם עקבות חשיבה, Kimi K3 לא מסוגל לעשות זאת ו-NV-Reason-CT מסוגל. לא "עושה זאת פחות טוב" — לא מסוגל, מפני שאין בו מקודד נפחי בשום מקום, והשטחת סריקה לתמונות תחילה משליכה את היחסים המרחביים שמסלול ה-3D נועד לשמר.

אם המשימה היא לקרוא 400 עמודים של הערות הפניה, להשוות אותן מול מסמך פרוטוקול, ולהפיק פלט מובנה, NV-Reason-CT לא נמצא בתמונה ו-Kimi K3 הוא אחת התשובות הטובות הזמינות, עם שיעור שגיאה מדוד של פחות מרבע אחוז ברשת שלנו.

A screenshot of the OrcaRouter model page for Kimi K3, showing the identifier kimi/kimi-k3, input text + image, output text, the Vision, Tools, JSON and Reasoning badges, a 1M-token context window with a p50 time to first token of 7.77 seconds, the description of it as MoonshotAI's 2.8-trillion-parameter Mixture-of-Experts flagship built for long-horizon coding, OpenAI-compatible code samples pointing at https://api.orcarouter.ai/v1, and a stat strip reading $3.00 per million input tokens, $15.00 per million output tokens and 591.2M tokens of seven-day traffic.

ההחלטה האמיתית אינה בין השניים. היא אם הבעיה שלך היא בעיית נפח או בעיית טקסט, והפער שבין 210 ל-588 מיליון הוא פשוט איך שהבחנה הזו נראית מבחוץ. מודל אחד הוא מאמר עם משקלים. האחר הוא פיסת תשתית. כדאי להחזיק את שניהם; אף אחד מהם אינו מחליף את האחר.

השוואות במאמר הזה1

זוהה מתוך המאמר הזה · בנצ'מרקים: Artificial Analysis · מתעדכן יומית