
NV-Reason-CT vs Grok 4.6: ใครอ่านภาพสแกน และใครอ่านรายงาน
- typesafeใหม่TypeSafe: Jev 1.132026-09-24$0.04 / $0.00 ต่อ 1 ล้านโทเค็น · 45 tok/s
- openaiใหม่OpenAI: GPT-6 Luna2026-09-2237ความฉลาด
- openaiใหม่OpenAI: GPT-6 Sol2026-09-2248ความฉลาด
- anthropicใหม่Anthropic: Claude Opus 5.52026-09-2258ความฉลาด
- grokใหม่Grok 4.72026-09-2146ความฉลาด
- Orcaใหม่Orca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 ต่อ 1 ล้านโทเค็น · 182 tok/s
- orcaใหม่Orca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 ต่อ 1 ล้านโทเค็น · 1285 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040ความฉลาด
- openaiOpenAI: GPT-6 Astra2026-09-0453ความฉลาด77การเขียนโค้ด
- googleGoogle: Gemini 3.8 Flash2026-09-0241ความฉลาด76การเขียนโค้ด
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245ความฉลาด76การเขียนโค้ด
- anthropicAnthropic: Claude Fable 5.12026-09-0153ความฉลาด82การเขียนโค้ด
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 ต่อ 1 ล้านโทเค็น · 119 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642ความฉลาด72การเขียนโค้ด
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 ต่อ 1 ล้านโทเค็น · 224 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845ความฉลาด75การเขียนโค้ด
- obsidianQwen3.8 27B2026-08-1534ความฉลาด68การเขียนโค้ด
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236ความฉลาด69การเขียนโค้ด
- grokSpaceXAI: Grok 4.62026-08-1244ความฉลาด77การเขียนโค้ด
- metaMeta: Muse Spark 1.22026-08-0540ความฉลาด72การเขียนโค้ด
มีสองวิธีในการนำ AI เข้าสู่ไปป์ไลน์ CT และมีเพียงวิธีเดียวเท่านั้นที่เกี่ยวกับตัวภาพ NV-Reason-CT คือวิธีแรก: โมเดล 3D vision-language ขนาด 4.69B พารามิเตอร์ที่อ่านไฟล์ปริมาตร NIfTI โดยตรง และถูกเผยแพร่ขึ้น Hugging Face เมื่อวันที่ 8 กันยายน 2026 โดยไม่มีโพสต์เปิดตัวจาก NVIDIA Grok 4.6 คือวิธีที่สอง: โมเดลข้อความและภาพขนาด 500,000 โทเคน ที่วางจำหน่ายเมื่อวันที่ 12 สิงหาคม 2026 ราคา 2.00 ดอลลาร์ต่อโทเคนอินพุตหนึ่งล้านโทเคน และเก่งมากในส่วนของงานที่เกิดขึ้นหลังจากที่มีคนบันทึกสิ่งที่ตรวจพบลงไปแล้ว เมื่อนำทั้งสองมาเปรียบเทียบกัน คำถามที่มักถามกัน — อันไหนดีกว่า — กลับกลายเป็นคำถามที่ไม่ถูกต้อง พวกมันไม่ได้แข่งขันกันเพื่อช่องเดียวกันในไปป์ไลน์ พวกมันแข่งขันกันเพื่อบรรทัดงบประมาณเดียวกัน
สิ่งที่ถูกส่งมอบจริงในแต่ละฝ่าย
NV-Reason-CT ปรากฏในรูปแบบของรีโพซิทอรี งานวิจัย และเดโม Space ไม่ใช่ในฐานะผลิตภัณฑ์ รีโพซิทอรี GitHub ภายใต้ NVIDIA-Medtech ถูกสร้างเมื่อวันที่ 2 กันยายน 2026; น้ำหนักโมเดลบน Hugging Face ตามมาเมื่อวันที่ 8 กันยายน; บทความ preprint บน arXiv, NV-Reason-CT: โมเดลภาษาภาพ 3 มิติสำหรับการวิเคราะห์ CT, เผยแพร่เมื่อวันที่ 23 กันยายน พร้อมผู้เขียนสิบหกคนจาก NVIDIA, NIH และมหาวิทยาลัยซือริช ห้องข่าวของ NVIDIA ไม่มีอะไรเกี่ยวกับเรื่องนี้เลย การ์ดโมเดลระบุเวอร์ชัน 0.1 และจำกัดการใช้งานไว้สำหรับการวิจัยและการศึกษา
Grok 4.6 เป็นการเปิดตัวในแบบที่ตรงกันข้าม โดยเป็นเอนด์พอยต์เชิงพาณิชย์ระดับเฟิร์สคลาส ถูกระบุว่าเป็น "Latest" ในเอกสารสำหรับนักพัฒนาของผู้ให้บริการ มีการกำหนดราคาตามตารางราคาที่เผยแพร่ และพร้อมใช้งานในฐานะโมเดลที่เข้ากันได้กับ OpenAI ซึ่งอินทิเกรชันที่มีอยู่เดิมนำไปใช้ได้เพียงเปลี่ยน base URL โดยสืบทอดต่อจาก Grok 4.5 ด้วยหน้าต่างบริบทเดียวกัน พื้นผิวอินพุตเดียวกัน และราคาพื้นฐานเดียวกัน
ความไม่สมมาตรนั้นคือเรื่องราวทั้งหมดของการเปรียบเทียบนี้ สิ่งหนึ่งเป็นผลงานวิจัยที่บังเอิญดาวน์โหลดได้ ส่วนอีกสิ่งหนึ่งคือโครงสร้างพื้นฐาน การอ่านสองสิ่งนี้เทียบกันจะบอกคุณว่าขอบเขตระหว่าง "ผลงานวิจัย" กับ "โครงสร้างพื้นฐาน" ในปัจจุบันอยู่ตรงไหนในด้านการถ่ายภาพทางการแพทย์ — และมันไม่ได้อยู่ตรงที่คุณคงเดา
การแบ่งแยกแรงงาน ในด้านปัจจัยนำเข้าและผลผลิต
• อินพุตเชิงปริมาตร — NV-Reason-CT อ่านปริมาตร NIfTI .nii/.nii.gz ในหน่วย Hounsfield เฉพาะทรวงอกหรือช่องท้อง เทียบกับ Grok 4.6 ที่อ่านข้อความ รูปภาพ และไฟล์ ไม่มีเส้นทางเชิงปริมาตร • การจัดการเชิงพื้นที่ — NV-Reason-CT แปลงปริมาตรขนาด 384×384×384 มม. เป็นกริด 24×24×24 จำนวน 13,824 โทเคน ด้วย 3D MRoPE โดยไม่ลดขนาดตัวอย่าง เทียบกับ Grok 4.6 ที่มองภาพเป็นภาพ 2 มิติ • บริบท — NV-Reason-CT หนึ่งปริมาตรคือคำนำหน้าคงที่หนึ่งค่า ไม่มีหน้าต่างบริบทในความหมายปกติ เทียบกับ Grok 4.6 ที่ 500,000 โทเคน • เอาต์พุต — NV-Reason-CT รายงานแบบมีโครงสร้าง คำตอบ หรือร่องรอยการให้เหตุผล โดยปิดการคิดได้ เทียบกับ Grok 4.6 ข้อความพร้อมเอาต์พุตแบบมีโครงสร้างและการเรียกเครื่องมือ • สัญญาอนุญาต — NV-Reason-CT OpenMDW-1.1 น้ำหนัก BF16 ขนาด 10.6 GB เทียบกับ Grok 4.6 ที่เป็นกรรมสิทธิ์ ใช้ผ่าน API เท่านั้น • ราคา — NV-Reason-CT ต้นทุนการลงทุน GPU (capex) ไม่มีอัตราต่อโทเคน เทียบกับ Grok 4.6 $2.00 / $6.00 ต่อล้านโทเคน และเพิ่มเป็นสองเท่าเมื่ออินพุตเกิน 200K

คู่นี้อ่านแล้วเป็นการส่งไม้ต่อที่เป็นธรรมชาติ NV-Reason-CT สร้างข้อค้นพบจากข้อมูลปริมาณมหาศาล ส่วน Grok 4.6 คือโมเดลที่คุณจะส่งข้อค้นพบเหล่านั้นเป็นพันรายการให้ โดยอยู่ในหน้าต่างบริบทเดียว เพื่อมองหารูปแบบข้ามกลุ่มตัวอย่าง ยังไม่มีใครเผยแพร่ไปป์ไลน์นั้น มันเป็นสถาปัตยกรรมที่ชัดเจน และควรพูดตรง ๆ ว่ายังไม่ผ่านการทดสอบ
ตัวเลขของ Grok 4.6 และมันเป็นของใคร
ตัวเลขสองตัวสำหรับ Grok 4.6 ถูกพูดถึงพร้อมกัน และมันไม่ใช่สิ่งประเภทเดียวกัน คะแนน GPQA Diamond ที่ 94.9 นั้นวัดโดย Artificial Analysis ไม่ใช่รายงานโดยผู้ขาย — ซึ่งเป็นประเภทที่น่าเชื่อถือมากกว่าระหว่างสองประเภทนี้ เพราะว่าบุคคลที่สามเป็นผู้ดำเนินการ คะแนน Artificial Analysis Intelligence Index ที่ 44 บนดัชนี revision v4.3.2 จัดให้ Grok 4.6 อยู่อันดับ 28 จาก 211 ในคลาสของมัน Artificial Analysis ยังบันทึกโมเดลนี้ว่าเป็น proprietary: น้ำหนักไม่เปิดเผยต่อสาธารณะ
บนกระดานเดียวกัน AA วัด Terminal-Bench 2.1 ได้ 88.4, SciCode 56.5, Humanity's Last Exam 42.9, 𝜏²-banking 50.7 และ long-context recall 80.3 สิ่งเหล่านี้เป็นเครื่องมือวัดการให้เหตุผลทั่วไป ไม่มีสักตัวเดียวในนั้นที่สามารถรันบนปริมาตร CT 3D ได้ และนั่นไม่ใช่การตำหนิ Grok 4.6 — มันเป็นข้อความเกี่ยวกับสิ่งที่ชุดแบบทดสอบนี้วัด
ฝั่ง CT มีตารางเพียงหนึ่งเดียว และเป็นตารางของผู้เขียน
ฐานหลักฐานสาธารณะทั้งหมดของ NV-Reason-CT คือตารางการจำแนกประเภทหนึ่งตารางบน 18 ป้ายกำกับของ CT-RATE ที่เกณฑ์คงที่แบบเดียวกัน โดยใช้พรอมต์ Yes/No โดยตรงโดยไม่มี classification head โดยรายงาน Macro-F1 0.614 และ Macro-AUROC 0.871 เทียบกับ VoxelFM ที่ 0.581/0.870, Pillar-0 ที่ 0.544/0.861, ClinFusion-8B ที่ 0.442, CT-CLIP ที่ 0.398/0.733, Merlin ที่ 0.358/0.662 และ MedGemma 1.5 ที่ 0.303
ข้อมูลเหล่านี้เป็นข้อมูลที่ผู้ขายรายงานมา จากโมเดลการ์ด และฉันติดป้ายกำกับไว้เช่นนั้นเพราะยังไม่มีฝ่ายอิสระใดทำซ้ำผลลัพธ์เหล่านี้ได้ มีสองสิ่งที่น่าสังเกตภายในตาราง ส่วนต่าง F1 เหนือ VoxelFM อยู่ที่ 0.033 ซึ่งเป็นช่องว่างจริงบน 18 เลเบลที่มีเกณฑ์คงที่ ส่วนต่าง AUROC เหนือโมเดลเดียวกันอยู่ที่ 0.001 ซึ่งถือว่าเสมอกัน ตัวเลขทั้งสองปรากฏอยู่ในแถวเดียวกันของตารางเดียวกัน และมีเพียงตัวเดียวเท่านั้นที่มีข้อกล่าวอ้าง
อีกสิ่งที่ตารางบอกคุณคือเกี่ยวกับกรอบการวางของบทความเอง โมเดลที่ใช้เปรียบเทียบคือระบบพรีเทรนแบบคอนทราสต์ 3D, MLLM เชิงสร้างที่ผสาน 2D/3D, และโมเดลแนวหน้าที่อิงสไลซ์ ผู้เขียนเลือกวัดผลเทียบกับระบบที่รับข้อมูลเป็นปริมาตร เพราะข้ออ้างที่มีความหมายเดียวตรงนี้คือโมเดล 3D เชิงสร้างสามารถเอาชนะโมเดล 3D แบบจำแนกในการจัดประเภทโดยไม่มีเฮดได้ มันไม่ได้บอกอะไรเกี่ยวกับว่า NV-Reason-CT เทียบกับโมเดลแนวหน้าทั่วไปเป็นอย่างไรในเรื่องใด ๆ เพราะการเปรียบเทียบนั้นไม่มีอยู่บนแกนนี้

เงินไหลไปที่ใด และเหตุใดเส้นแบ่งระดับจึงสำคัญ
ตารางราคาของ Grok 4.6 มีรายละเอียดหนึ่งที่ตัดสินสถาปัตยกรรมหลายอย่างอย่างเงียบ ๆ: พรอมต์ที่มีโทเคนอินพุตเกิน 200K จะถูกคิดค่าบริการเป็นสองเท่าของอัตราฐาน — ขาเข้า $4.00 ขาออก $12.00 โดยอัตราการอ่านแคชเพิ่มจาก $0.50 เป็น $1.00 งานรีวิวแบบโคฮอร์ตที่สะสมสิ่งที่พบไว้ในบริบทเดียวที่ยาวคือปริมาณงานแบบที่ข้ามเส้นนั้นไปพอดี เมื่ออยู่ใต้เส้นนั้น อัตราการอ่านแคชที่ $0.50 ต่อล้าน คิดเป็นหนึ่งในสี่ของราคาอินพุต ซึ่งเป็นสิ่งที่ทำให้การวนใช้คำนำหน้าคงที่ขนาดใหญ่ซ้ำกับรายงานหลายพันฉบับนั้นจ่ายไหว ไม่ใช่แค่เป็นไปได้
ผ่าน OrcaRouter, Grok 4.6 ให้บริการในราคาตามรายการของผู้ให้บริการรายนั้นโดยไม่มีการบวกเพิ่ม ดังนั้นการคำนวณตามระดับชั้นข้างต้นคือการคำนวณที่คุณจ่ายจริง และการปรับเปลี่ยนใด ๆ กับมันในอนาคตจะสะท้อนถึงบิลของคุณภายในวันเดียวกัน แทนที่จะรอถึงการต่ออายุครั้งถัดไป เหตุผลที่ควรกำหนดเส้นทางงานแบบนี้แทนการฮาร์ดโค้ดปลายทางเดียวก็คือ ครึ่งหนึ่งที่เกี่ยวกับการทบทวนกลุ่มโคฮอร์ตของไปป์ไลน์ทางคลินิกเป็นจุดที่คุณจะอยากลองโมเดลที่แตกต่างกันสามแบบก่อนตัดสินใจ — และบนคีย์ที่เข้ากันได้กับ OpenAI เพียงคีย์เดียวที่มีการสลับไปยังผู้ให้บริการรายอื่นโดยอัตโนมัติเมื่อเกิดข้อขัดข้องการทดลองนั้นมีค่าใช้จ่ายเป็นเพียงการเปลี่ยนชื่อโมเดล
ครึ่ง CT ของไปป์ไลน์ไม่มีตัวเลือกแบบนั้น NV-Reason-CT ไม่ได้โฮสต์อยู่บน OrcaRouter — มันเป็นเช็กพอยต์ขนาด 10.6 GB พร้อมโค้ดโมเดลแบบกำหนดเองที่คุณรันเอง บนซิลิคอน Ampere, Hopper หรือ Lovelace โดยใช้ trust_remote_code=True เราจะไม่สื่อเป็นนัยเป็นอย่างอื่น หากคุณกำลังสร้างไปป์ไลน์นี้ คุณกำลังซื้อ GPU สำหรับครึ่งหนึ่ง และโทเคนสำหรับอีกครึ่งหนึ่ง และข้อเท็จจริงที่ว่าทั้งสองครึ่งอย่างน้อยก็สามารถจัดการได้จากคอนโซลเดียว คือข้ออ้างเรื่องการผสานรวมเพียงหนึ่งเดียวที่คุ้มค่าแก่การกล่าวถึง

ผู้้อ่านคนที่สองมีค่าจริง ๆ แค่ไหน
บทความ NV-Reason-CT มีการศึกษานำร่องโดยรังสีแพทย์ผู้เชี่ยวชาญ ซึ่งรายงานว่า "คะแนนความมั่นใจเชิงบวกต่อการทบทวนโดยมี AI ช่วย" และเวลาที่รายงานโดยเฉลี่ยสำหรับการตีความและการรายงานลดลง 50% ตัวเลขเหล่านั้นแข็งแรง และมาพร้อมข้อแม้ที่บทความระบุไว้เองว่า เป็นการศึกษาเบื้องต้น และเป็นการออกแบบการศึกษาของผู้เขียนเอง ยังไม่มีการศึกษาซ้ำโดยอิสระที่ตีพิมพ์ออกมา และการลดเวลาลง 50% ในการศึกษาการอ่านแบบควบคุมก็เป็นผลลัพธ์ประเภทที่มักหดลงเมื่อมีการศึกษาซ้ำพอดี มันคุ้มค่าที่จะติดตาม แต่ไม่คุ้มค่าที่จะอ้างอิงเสมือนเป็นข้อสรุปที่ยืนยันแล้ว
เมื่อพิจารณาเทียบกับสิ่งนั้นแล้ว สิ่งที่ Grok 4.6 มีส่วนช่วยในเวิร์กโฟลว์รังสีวิทยาไม่ใช่การวินิจฉัยเลย แต่เป็นชั้นที่อ่านรายงาน ได้แก่ คิวคัดกรอง จดหมายติดตามผล การลงรหัส และชุดเอกสารขออนุมัติล่วงหน้า งานเหล่านี้เป็นงานข้อความ มีปริมาณสูง ต้นทุนต่อหน่วยต่ำ และรูปแบบความล้มเหลวเมื่อทำผิดพลาดเป็นเรื่องธุรการมากกว่าด้านคลินิก อีกทั้งยังเป็นจุดที่หน้าต่างบริบท 500K และการอ่านแคชราคา $0.50 พิสูจน์คุณค่าของตัวเองได้อย่างแท้จริง
ดังนั้นจุดแบ่งที่การเปรียบเทียบนี้ลงเอยจึงตรงไปตรงมา: NV-Reason-CT มีเส้นทาง 3D จริง แต่ไม่มีการจัดจำหน่าย ไม่มีราคา และไม่มีการตรวจสอบอิสระ ส่วน Grok 4.6 มีการจัดจำหน่าย มีราคา มีการครอบคลุมจาก benchmark อิสระ และไม่มีเส้นทางเชิงปริมาตรเลย ถ้าคุณต้องการให้อ่านผลสแกน มีเพียงตัวเดียวในสองตัวนี้ที่ทำได้ ถ้าคุณต้องการให้จัดการเอกสารรอบๆ การสแกน มีเพียงอีกตัวเดียวเท่านั้นที่เป็นผลิตภัณฑ์
การเปรียบเทียบในบทความนี้1
ตรวจพบจากบทความนี้ · เบนช์มาร์ก: Artificial Analysis · อัปเดตทุกวัน
