
NV-Reason-CT เทียบกับ Kimi K3: 210 ดาวน์โหลด และ 588 ล้านโทเคน
- typesafeใหม่TypeSafe: Jev 1.132026-09-24$0.04 / $0.00 ต่อ 1 ล้านโทเค็น · 45 tok/s
- openaiใหม่OpenAI: GPT-6 Luna2026-09-2237ความฉลาด
- openaiใหม่OpenAI: GPT-6 Sol2026-09-2248ความฉลาด
- anthropicใหม่Anthropic: Claude Opus 5.52026-09-2258ความฉลาด
- grokใหม่Grok 4.72026-09-2146ความฉลาด
- Orcaใหม่Orca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 ต่อ 1 ล้านโทเค็น · 182 tok/s
- orcaใหม่Orca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 ต่อ 1 ล้านโทเค็น · 1285 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040ความฉลาด
- openaiOpenAI: GPT-6 Astra2026-09-0453ความฉลาด77การเขียนโค้ด
- googleGoogle: Gemini 3.8 Flash2026-09-0241ความฉลาด76การเขียนโค้ด
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245ความฉลาด76การเขียนโค้ด
- anthropicAnthropic: Claude Fable 5.12026-09-0153ความฉลาด82การเขียนโค้ด
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 ต่อ 1 ล้านโทเค็น · 119 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642ความฉลาด72การเขียนโค้ด
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 ต่อ 1 ล้านโทเค็น · 224 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845ความฉลาด75การเขียนโค้ด
- obsidianQwen3.8 27B2026-08-1534ความฉลาด68การเขียนโค้ด
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236ความฉลาด69การเขียนโค้ด
- grokSpaceXAI: Grok 4.62026-08-1244ความฉลาด77การเขียนโค้ด
- metaMeta: Muse Spark 1.22026-08-0540ความฉลาด72การเขียนโค้ด
หนึ่งในโมเดลเหล่านี้ถูกดาวน์โหลด 210 ครั้งจาก Hugging Face อีกโมเดลหนึ่งประมวลผล 588 ล้านโทเคนผ่าน playground ของเราเองในเจ็ดวันที่ผ่านมา ทั้งคู่เป็น open-weights, ทั้งคู่สามารถดาวน์โหลดได้ตอนนี้, และช่องว่างระหว่างตัวเลขสองตัวนั้นเป็นสิ่งที่มีประโยชน์ที่สุดในการเปรียบเทียบนี้ NV-Reason-CT เป็นโมเดล 3D vision-language ขนาด 4.69B พารามิเตอร์ของ NVIDIA สำหรับ CT ทรวงอกและช่องท้อง เผยแพร่ไปยัง Hugging Face เมื่อวันที่ 8 กันยายน 2026 โดยไม่มีการประกาศ Kimi K3 เป็นเรือธงขนาด 1,048,576 โทเคนของ MoonshotAI จัดส่งเมื่อวันที่ 15 กรกฎาคม 2026 และตอนนี้เป็นหนึ่งในโมเดลที่มีการใช้งานมากที่สุดในเครือข่ายของเรา ทั้งคู่เป็น "open" ในความหมายที่สำคัญสำหรับแบบฟอร์มจัดซื้อจัดจ้าง ทั้งคู่ไม่ได้เปิดในลักษณะเดียวกันเลย
สองความหมายของ "you can download it"
เริ่มจากสิ่งที่การดาวน์โหลดแต่ละครั้งเก็บไว้ในดิสก์ของคุณจริง ๆ เพราะนี่คือจุดที่การเปรียบเทียบแบบ open-weights ส่วนใหญ่มักคลุมเครือ
NV-Reason-CT มอบ model.safetensors ให้คุณซึ่งมีขนาดประมาณ 10.6 GB ใน BF16 พร้อมกับ model.py และ processor.py ขนาดใหญ่ — โค้ดประมวลผลแบบกำหนดเอง 26 KB ที่ใช้งานการครอบตัดแบบรับรู้กายวิภาค การรีแซมเปิล 2 มม. และการแบ่งแพตช์ 3D คุณโหลดมันด้วย trust_remote_code=True ซึ่งหมายความว่าคุณกำลังรันโค้ดของที่เก็บ NVIDIA ภายในโปรเซสของคุณ การอนุมานต้องใช้ CUDA PyTorch และการ์ดระบุ Ampere, Hopper และ Lovelace ทดสอบบน H100 และ L40S อินพุตเป็นปริมาตร NIfTI ทีละหนึ่ง ไม่มีข้อมูลการแบตช์ที่เผยแพร่ ไม่มีตัวเลขปริมาณงาน และไม่มีการกำหนดค่าการให้บริการในที่เก็บนอกเหนือจาก inference.py ตัวอย่าง
Kimi K3 มอบโมเดลการให้เหตุผลอเนกประสงค์ที่มีหน้าต่างบริบทขนาด 1,048,576 โทเคน รองรับอินพุตทั้งข้อความและรูปภาพ เรียกใช้เครื่องมือได้แบบเนทีฟ ให้เอาต์พุตแบบมีโครงสร้าง และปรับระดับความพยายามในการให้เหตุผลได้ เป็นโมเดลที่คุณจะหยิบมาใช้เพื่ออ่านแนวทางเวชปฏิบัติทางคลินิกหนึ่งร้อยฉบับในคำขอเดียว หรือรายงานของแผนกย้อนหลังสิบปี คะแนนการเรียกคืนบริบทยาวจาก Artificial Analysis ของมันอยู่ที่ 88.7 — สูงที่สุดในบรรดาโมเดลในซีรีส์นี้ และมากกว่าคะแนน 80.3 ของ Grok 4.6 อยู่ถึง 8.4 คะแนนเต็ม
พูดตรง ๆ ก็คือ NV-Reason-CT เป็นเช็กพอยต์เฉพาะทางที่มีขอบเขตอินพุตแคบ และมีโค้ดกำหนดเองที่คุณต้องไว้วางใจและดูแลรักษา ส่วน Kimi K3 เป็นโมเดลทั่วไปที่มีขอบเขตอินพุตกว้าง และทำงานราวกับเป็นโครงสร้างพื้นฐาน ทั้งสองตัวดาวน์โหลดได้ แต่มีเพียงตัวเดียวเท่านั้นที่ใช้งานได้ทันทีโดยไม่ต้องปรับอะไร
หลักฐานจาก CT ทั้งหมด และมันก็สั้น
ทุกสิ่งที่เปิดเผยต่อสาธารณะเกี่ยวกับคุณภาพของ NV-Reason-CT ล้วนตั้งอยู่บนตารางเดียวในโมเดลการ์ดของตัวมันเอง: งานจำแนกประเภท 18 ป้ายกำกับของ CT-RATE ที่เกณฑ์คงที่สม่ำเสมอ, การพรอมป์ต์แบบ Yes/No โดยตรง, ไม่มีหัวจำแนกประเภท, ไม่มีการปรับเฉพาะงาน. Macro-F1 0.614, Macro-AUROC 0.871.
แถวการเปรียบเทียบคือ VoxelFM ที่ 0.581/0.870, Pillar-0 ที่ 0.544/0.861, ClinFusion-8B ที่ 0.442, CT-CLIP ที่ 0.398/0.733, Merlin ที่ 0.358/0.662 และ MedGemma 1.5 ที่ 0.303 ตัวเลขทั้งหมดนั้นเป็นตัวเลขที่ผู้ขายรายงานจากเอกสารข้อมูลของการ์ด NVIDIA และยังไม่มีตัวใดได้รับการทำซ้ำอย่างอิสระเลย — เปเปอร์เพิ่งออกมาได้สองวัน
สิ่งที่ตารางนี้ยืนยันนั้นแคบ และควรกล่าวให้ชัดเจนว่า: โมเดล 3D แบบเจเนอเรทีฟที่ไม่มี head เฉพาะงาน เอาชนะ baseline การ pretrain แบบ contrastive 3D และโมเดล frontier แบบอิงสไลซ์ ในการจำแนก CT แบบ 18 ป้ายกำกับ สิ่งที่ตารางนี้ไม่ได้ยืนยันคืออะไรก็ตามเกี่ยวกับการให้เหตุผลทั่วไป อะไรก็ตามเกี่ยวกับ modality อื่นที่ไม่ใช่ CT ทรวงอกและช่องท้อง และอะไรก็ตามเกี่ยวกับข้อได้เปรียบด้าน AUROC — 0.871 เทียบกับ 0.870 เป็นผลเสมอที่สวมจุดทศนิยม
ตัวเลขของ Kimi K3 และข้อควรระวังของบอร์ด open-weights
Artificial Analysis วัดค่า Kimi K3 ได้ดัชนี Intelligence Index ที่ 43.6 ซึ่งจัดให้อยู่ในอันดับที่ 19 จาก 145 โมเดลบนบอร์ดนั้นในสแนปช็อตการจัดอันดับของ model API ของเรา คะแนน GPQA Diamond ของมันคือ 93.5, Humanity's Last Exam 46.9, SciCode 59.5, Terminal-Bench 2.1 85.0, AA Coding 76.2 ที่อันดับ 9 และ 𝜏²-banking 46.0
คำกล่าวอ้างเกี่ยวกับการจัดอันดับหนึ่งข้อต้องระมัดระวัง เพราะเป็นเรื่องง่ายที่จะเข้าใจผิด และเคยเข้าใจผิดกันมาก่อนแล้ว ดัชนี AA Intelligence Index ของ Kimi K3 อยู่ที่ 44 อยู่อันดับสามในบรรดาโมเดล open-weights บนบอร์ด open-weights ตามหลัง MiMo-V2.6-Pro ที่ 46 และ GLM-5.3 ที่ 45 มันไม่ใช่ผู้นำบนบอร์ดนั้น และไม่ได้แข่งขันบนบอร์ดเดียวกับ Grok 4.6 — Artificial Analysis บันทึก Grok 4.6 ว่าเป็น proprietary ดังนั้น 44 ของมันจึงอยู่ในอันดับทั่วไป ไม่ใช่อันดับ open-weights ดัชนีทั้งสองดูเหมือนกัน แต่แท้จริงไม่เหมือนกัน
สิ่งที่ผู้ปฏิบัติงานเห็นจริง ๆ
นี่คือที่มาของตัวเลข 588 ล้าน และควรค่าแก่การอธิบายให้กระจ่าง เพราะมันเป็นหลักฐานชิ้นเดียวในบทความนี้ที่เป็นของเรา ไม่ใช่การตลาดของใคร
ในช่วงเจ็ดวันที่ผ่านมา Kimi K3 ประมวลผล 587.8 ล้านโทเค็นผ่าน playground ของ OrcaRouter ค่ามัธยฐานของเวลาถึงโทเค็นแรกอยู่ที่ 7.8 วินาที ให้ผลลัพธ์ 42.9 โทเค็นต่อวินาที และอัตราความผิดพลาดในช่วงเวลาดังกล่าวอยู่ที่ 0.21% — ล้มเหลวหนึ่งครั้งในประมาณ 480 คำขอ อัตราความผิดพลาดที่วัดได้นี้คือสิ่งที่คุณไม่สามารถได้จากโมเดลการ์ด และเป็นตัวเลขที่ตัดสินว่าโมเดลปลอดภัยพอที่จะนำไปใช้เบื้องหลังงานแบบแบตช์หรือไม่
สำหรับ NV-Reason-CT นั้นไม่มีสิ่งที่เทียบเท่า เพราะมันไม่ใช่ endpoint ที่ถูกโฮสต์อยู่ที่ใดเลย — มันเป็น checkpoint ที่คุณรันด้วยตัวเอง ไม่มี p50 ไม่มีอัตราความผิดพลาด ไม่มี uptime และไม่มีที่ให้ failover ไป นั่นไม่ใช่การตำหนิ แต่เป็นข้อเท็จจริงเชิงโครงสร้างของการโฮสต์เอง และเป็นเหตุผลที่กลุ่มวิจัยสามารถนำ NV-Reason-CT ไปใช้ในวันอังคารได้ แต่ทีมโปรดักชันโดยทั่วไปทำไม่ได้
หากคุณกำลังรันทั้งสองส่วนของระบบนี้ — Kimi K3 ในฐานะเลเยอร์ทั่วไปแบบโฮสต์ และ NV-Reason-CT บนเครื่อง GPU ของคุณเอง — ฝั่งการกำหนดเส้นทางคือจุดที่ครึ่งที่โฮสต์ได้รับความยืดหยุ่น Kimi K3 ให้บริการในราคาตามรายการของ Moonshot เองที่ $3.00 ต่ออินพุตหนึ่งล้านและ $15.00 ต่อเอาต์พุตหนึ่งล้านโดยไม่บวกกำไรเพิ่ม อัตราการอ่านแคชที่ $0.30 ต่อล้านนั้นเป็นหนึ่งในสิบของอินพุต และเนื่องจากราคาถูกส่งผ่านโดยไม่เปลี่ยนแปลง การปรับลดราคาจากผู้ให้บริการจึงไปถึงบิลของคุณในวันเดียวกัน การสลับระบบสำรองอัตโนมัติระหว่างผู้ให้บริการคือสิ่งที่ทำให้งานแบบแบตช์ยังคงเดินหน้าต่อเมื่อปลายทางต้นทางรายใดรายหนึ่งสะดุด — และด้วยอัตราข้อผิดพลาด 0.21% การสะดุดนั้นเกิดขึ้นได้น้อยพอที่จะลืมไปได้ง่าย ๆ จนกระทั่งมันไม่ใช่เช่นนั้นอีกต่อไป
รูปร่างของต้นทุนไม่เหมือนกัน
• ราคา — เงินลงทุน GPU ของ NV-Reason-CT บวกสแต็กการให้บริการของคุณเอง เทียบกับ Kimi K3 $3.00 / $15.00 ต่อล้าน, $0.30 สำหรับการอ่านจากแคช
• ค่าใช้จ่ายขั้นต่ำที่เพียงพอ — NV-Reason-CT ถือ GPU Ampere หรือใหม่กว่าหนึ่งตัวไว้อย่างไม่มีกำหนด เทียบกับ Kimi K3 หนึ่งคำขอ
• บริบท — NV-Reason-CT หนึ่งวอลุ่ม, 13,824 โทเคนแบบคงที่ เทียบกับ Kimi K3 1,048,576 โทเคน
• ต้นทุนส่วนเพิ่มของคำขอที่หนึ่งพัน — NV-Reason-CT เป็นศูนย์จริงในทางปฏิบัติเมื่อจ่ายค่า GPU ไปแล้ว เทียบกับ Kimi K3 ที่แปรผันเชิงเส้นตามจำนวนโทเคน
• จุดที่พังก่อนเป็นอันดับแรก — ปริมาณงาน (throughput) ของ NV-Reason-CT ที่ยังไม่ได้รับการยืนยัน และยังไม่มีแนวทางรองรับการทำ batching เทียบกับต้นทุน long-context ของ Kimi K3 ที่ 1 ล้านโทเคนต่อคำขอ
• รูปแบบข้อมูล — NV-Reason-CT 3D NIfTI, ทรวงอกหรือช่องท้อง เทียบกับ Kimi K3 ข้อความและภาพ, อะไรก็ได้

เศรษฐศาสตร์จะพลิกผันไปตามปริมาณ Kimi K3 ไม่มีค่าใช้จ่ายใด ๆ ในการเริ่มต้น และขยายตัวแบบเชิงเส้น ส่วน NV-Reason-CT มีค่าใช้จ่ายเริ่มต้นเป็น GPU หนึ่งตัว แล้วหลังจากนั้นแทบจะขยายตัวแบบราบเรียบ — นั่นคือเหตุผลที่ยอดดาวน์โหลด 210 ครั้งไม่ใช่สัญญาณของความล้มเหลว มันเป็นตัวเลขที่ถูกต้องสำหรับเช็กพอยต์ที่กลุ่มเป้าหมายคือสถาบันที่ถือครองฮาร์ดแวร์อยู่แล้ว และจะไม่มีทางปรากฏอยู่ในสถิติอัตราการประมวลผลโทเคนเลยแม้แต่ครั้งเดียว

คุณกำลังเลือกอันไหนจริงๆ
หากงานคือการอ่านปริมาตร CT และสร้างผลการตรวจที่มีโครงสร้างพร้อมร่องรอยการให้เหตุผล Kimi K3 ทำไม่ได้ และ NV-Reason-CT ทำได้ ไม่ใช่ “ทำได้แย่กว่า” — หากแต่ทำไม่ได้เลย เพราะไม่มีตัวเข้ารหัสเชิงปริมาตรอยู่ที่ไหนในตัวมัน และการแปลงผลสแกนให้เป็นภาพแบนตั้งแต่แรกก็ทิ้งความสัมพันธ์เชิงพื้นที่ที่เส้นทาง 3D ถูกสร้างขึ้นมาเพื่อรักษาไว้
ถ้างานคือการอ่านบันทึกการส่งต่อ 400 หน้า จับคู่กับเอกสารโปรโตคอล และส่งออกผลลัพธ์แบบมีโครงสร้าง NV-Reason-CT ก็ไม่ได้อยู่ในวงสนทนานี้ และ Kimi K3 ก็เป็นหนึ่งในคำตอบที่ดีกว่าที่มีให้ใช้ โดยมีอัตราความผิดพลาดที่วัดได้ต่ำกว่าหนึ่งในสี่ของหนึ่งเปอร์เซ็นต์บนเครือข่ายของเรา

การตัดสินใจที่แท้จริงไม่ใช่การเลือกระหว่างสองสิ่งนี้ แต่คือว่าปัญหาของคุณเป็นปัญหาด้านปริมาณหรือปัญหาด้านข้อความ และช่องว่างระหว่าง 210 กับ 588 ล้านเป็นเพียงสิ่งที่ความแตกต่างนั้นดูเหมือนเมื่อมองจากภายนอก โมเดลหนึ่งคือเปเปอร์ที่มาพร้อมเวต อีกโมเดลหนึ่งคือโครงสร้างพื้นฐานชิ้นหนึ่ง ทั้งสองอย่างมีค่าควรมีไว้ และไม่มีอันใดทดแทนอีกอันได้
การเปรียบเทียบในบทความนี้1
ตรวจพบจากบทความนี้ · เบนช์มาร์ก: Artificial Analysis · อัปเดตทุกวัน
