การ์ดฮีโร่ที่สร้างขึ้นชื่อ 'NV-Reason-CT vs Grok 4.6' พร้อมคำบรรยายรอง 'ใครอ่านภาพสแกน และใครอ่านรายงาน' มีชิปสามอันเรียงรายอยู่ด้านล่าง: 'ปริมาตร CT หนึ่งชุด vs 500,000 โทเค็น', '0.871 vs 0.870 เสมอกัน' และ 'Grok 4.6: $2.00 / $6.00 ต่อ M' โลโก้ OrcaRouter ถูกคอมโพสิตไว้มุมขวาล่าง
Guides & Insights

NV-Reason-CT vs Grok 4.6: ใครอ่านภาพสแกน และใครอ่านรายงาน

ผู้เขียน

Gideon Frost

วันที่เผยแพร่

โมเดลล่าสุด · 20ดูโมเดลทั้งหมด →
เบนช์มาร์ก: Artificial Analysis · อัปเดตทุกวัน
กลับไปยังโพสต์ทั้งหมด

มีสองวิธีในการนำ AI เข้าสู่ไปป์ไลน์ CT และมีเพียงวิธีเดียวเท่านั้นที่เกี่ยวกับตัวภาพ NV-Reason-CT คือวิธีแรก: โมเดล 3D vision-language ขนาด 4.69B พารามิเตอร์ที่อ่านไฟล์ปริมาตร NIfTI โดยตรง และถูกเผยแพร่ขึ้น Hugging Face เมื่อวันที่ 8 กันยายน 2026 โดยไม่มีโพสต์เปิดตัวจาก NVIDIA Grok 4.6 คือวิธีที่สอง: โมเดลข้อความและภาพขนาด 500,000 โทเคน ที่วางจำหน่ายเมื่อวันที่ 12 สิงหาคม 2026 ราคา 2.00 ดอลลาร์ต่อโทเคนอินพุตหนึ่งล้านโทเคน และเก่งมากในส่วนของงานที่เกิดขึ้นหลังจากที่มีคนบันทึกสิ่งที่ตรวจพบลงไปแล้ว เมื่อนำทั้งสองมาเปรียบเทียบกัน คำถามที่มักถามกัน — อันไหนดีกว่า — กลับกลายเป็นคำถามที่ไม่ถูกต้อง พวกมันไม่ได้แข่งขันกันเพื่อช่องเดียวกันในไปป์ไลน์ พวกมันแข่งขันกันเพื่อบรรทัดงบประมาณเดียวกัน

สิ่งที่ถูกส่งมอบจริงในแต่ละฝ่าย

NV-Reason-CT ปรากฏในรูปแบบของรีโพซิทอรี งานวิจัย และเดโม Space ไม่ใช่ในฐานะผลิตภัณฑ์ รีโพซิทอรี GitHub ภายใต้ NVIDIA-Medtech ถูกสร้างเมื่อวันที่ 2 กันยายน 2026; น้ำหนักโมเดลบน Hugging Face ตามมาเมื่อวันที่ 8 กันยายน; บทความ preprint บน arXiv, NV-Reason-CT: โมเดลภาษาภาพ 3 มิติสำหรับการวิเคราะห์ CT, เผยแพร่เมื่อวันที่ 23 กันยายน พร้อมผู้เขียนสิบหกคนจาก NVIDIA, NIH และมหาวิทยาลัยซือริช ห้องข่าวของ NVIDIA ไม่มีอะไรเกี่ยวกับเรื่องนี้เลย การ์ดโมเดลระบุเวอร์ชัน 0.1 และจำกัดการใช้งานไว้สำหรับการวิจัยและการศึกษา

Grok 4.6 เป็นการเปิดตัวในแบบที่ตรงกันข้าม โดยเป็นเอนด์พอยต์เชิงพาณิชย์ระดับเฟิร์สคลาส ถูกระบุว่าเป็น "Latest" ในเอกสารสำหรับนักพัฒนาของผู้ให้บริการ มีการกำหนดราคาตามตารางราคาที่เผยแพร่ และพร้อมใช้งานในฐานะโมเดลที่เข้ากันได้กับ OpenAI ซึ่งอินทิเกรชันที่มีอยู่เดิมนำไปใช้ได้เพียงเปลี่ยน base URL โดยสืบทอดต่อจาก Grok 4.5 ด้วยหน้าต่างบริบทเดียวกัน พื้นผิวอินพุตเดียวกัน และราคาพื้นฐานเดียวกัน

ความไม่สมมาตรนั้นคือเรื่องราวทั้งหมดของการเปรียบเทียบนี้ สิ่งหนึ่งเป็นผลงานวิจัยที่บังเอิญดาวน์โหลดได้ ส่วนอีกสิ่งหนึ่งคือโครงสร้างพื้นฐาน การอ่านสองสิ่งนี้เทียบกันจะบอกคุณว่าขอบเขตระหว่าง "ผลงานวิจัย" กับ "โครงสร้างพื้นฐาน" ในปัจจุบันอยู่ตรงไหนในด้านการถ่ายภาพทางการแพทย์ — และมันไม่ได้อยู่ตรงที่คุณคงเดา

การแบ่งแยกแรงงาน ในด้านปัจจัยนำเข้าและผลผลิต

• อินพุตเชิงปริมาตร — NV-Reason-CT อ่านปริมาตร NIfTI .nii/.nii.gz ในหน่วย Hounsfield เฉพาะทรวงอกหรือช่องท้อง เทียบกับ Grok 4.6 ที่อ่านข้อความ รูปภาพ และไฟล์ ไม่มีเส้นทางเชิงปริมาตร • การจัดการเชิงพื้นที่ — NV-Reason-CT แปลงปริมาตรขนาด 384×384×384 มม. เป็นกริด 24×24×24 จำนวน 13,824 โทเคน ด้วย 3D MRoPE โดยไม่ลดขนาดตัวอย่าง เทียบกับ Grok 4.6 ที่มองภาพเป็นภาพ 2 มิติ • บริบท — NV-Reason-CT หนึ่งปริมาตรคือคำนำหน้าคงที่หนึ่งค่า ไม่มีหน้าต่างบริบทในความหมายปกติ เทียบกับ Grok 4.6 ที่ 500,000 โทเคน • เอาต์พุต — NV-Reason-CT รายงานแบบมีโครงสร้าง คำตอบ หรือร่องรอยการให้เหตุผล โดยปิดการคิดได้ เทียบกับ Grok 4.6 ข้อความพร้อมเอาต์พุตแบบมีโครงสร้างและการเรียกเครื่องมือ • สัญญาอนุญาต — NV-Reason-CT OpenMDW-1.1 น้ำหนัก BF16 ขนาด 10.6 GB เทียบกับ Grok 4.6 ที่เป็นกรรมสิทธิ์ ใช้ผ่าน API เท่านั้น • ราคา — NV-Reason-CT ต้นทุนการลงทุน GPU (capex) ไม่มีอัตราต่อโทเคน เทียบกับ Grok 4.6 $2.00 / $6.00 ต่อล้านโทเคน และเพิ่มเป็นสองเท่าเมื่ออินพุตเกิน 200K

A generated scoreboard titled 'NV-Reason-CT vs Grok 4.6 - the scoreboard'. Left column 'NV-Reason-CT': Volumetric input NIfTI, Hounsfield, chest or abdomen; Spatial handling 24x24x24 grid, no downsampling; Context one volume, a fixed prefix; Output report, answer or reasoning trace; Licence OpenMDW-1.1, 10.6 GB BF16; Price GPU capex, no per-token rate. Right column 'Grok 4.6': Volumetric input none - 2D images, text, files; Spatial handling an image is a picture; Context 500,000 tokens; Output text, structured outputs, tools; Licence proprietary, API only; Price $2.00 / $6.00, doubled above 200K. A footer reads 'NV-Reason-CT figures from NVIDIA's model card and paper; Grok 4.6 pricing per the vendor rate card.'

คู่นี้อ่านแล้วเป็นการส่งไม้ต่อที่เป็นธรรมชาติ NV-Reason-CT สร้างข้อค้นพบจากข้อมูลปริมาณมหาศาล ส่วน Grok 4.6 คือโมเดลที่คุณจะส่งข้อค้นพบเหล่านั้นเป็นพันรายการให้ โดยอยู่ในหน้าต่างบริบทเดียว เพื่อมองหารูปแบบข้ามกลุ่มตัวอย่าง ยังไม่มีใครเผยแพร่ไปป์ไลน์นั้น มันเป็นสถาปัตยกรรมที่ชัดเจน และควรพูดตรง ๆ ว่ายังไม่ผ่านการทดสอบ

ตัวเลขของ Grok 4.6 และมันเป็นของใคร

ตัวเลขสองตัวสำหรับ Grok 4.6 ถูกพูดถึงพร้อมกัน และมันไม่ใช่สิ่งประเภทเดียวกัน คะแนน GPQA Diamond ที่ 94.9 นั้นวัดโดย Artificial Analysis ไม่ใช่รายงานโดยผู้ขาย — ซึ่งเป็นประเภทที่น่าเชื่อถือมากกว่าระหว่างสองประเภทนี้ เพราะว่าบุคคลที่สามเป็นผู้ดำเนินการ คะแนน Artificial Analysis Intelligence Index ที่ 44 บนดัชนี revision v4.3.2 จัดให้ Grok 4.6 อยู่อันดับ 28 จาก 211 ในคลาสของมัน Artificial Analysis ยังบันทึกโมเดลนี้ว่าเป็น proprietary: น้ำหนักไม่เปิดเผยต่อสาธารณะ

บนกระดานเดียวกัน AA วัด Terminal-Bench 2.1 ได้ 88.4, SciCode 56.5, Humanity's Last Exam 42.9, 𝜏²-banking 50.7 และ long-context recall 80.3 สิ่งเหล่านี้เป็นเครื่องมือวัดการให้เหตุผลทั่วไป ไม่มีสักตัวเดียวในนั้นที่สามารถรันบนปริมาตร CT 3D ได้ และนั่นไม่ใช่การตำหนิ Grok 4.6 — มันเป็นข้อความเกี่ยวกับสิ่งที่ชุดแบบทดสอบนี้วัด

ฝั่ง CT มีตารางเพียงหนึ่งเดียว และเป็นตารางของผู้เขียน

ฐานหลักฐานสาธารณะทั้งหมดของ NV-Reason-CT คือตารางการจำแนกประเภทหนึ่งตารางบน 18 ป้ายกำกับของ CT-RATE ที่เกณฑ์คงที่แบบเดียวกัน โดยใช้พรอมต์ Yes/No โดยตรงโดยไม่มี classification head โดยรายงาน Macro-F1 0.614 และ Macro-AUROC 0.871 เทียบกับ VoxelFM ที่ 0.581/0.870, Pillar-0 ที่ 0.544/0.861, ClinFusion-8B ที่ 0.442, CT-CLIP ที่ 0.398/0.733, Merlin ที่ 0.358/0.662 และ MedGemma 1.5 ที่ 0.303

ข้อมูลเหล่านี้เป็นข้อมูลที่ผู้ขายรายงานมา จากโมเดลการ์ด และฉันติดป้ายกำกับไว้เช่นนั้นเพราะยังไม่มีฝ่ายอิสระใดทำซ้ำผลลัพธ์เหล่านี้ได้ มีสองสิ่งที่น่าสังเกตภายในตาราง ส่วนต่าง F1 เหนือ VoxelFM อยู่ที่ 0.033 ซึ่งเป็นช่องว่างจริงบน 18 เลเบลที่มีเกณฑ์คงที่ ส่วนต่าง AUROC เหนือโมเดลเดียวกันอยู่ที่ 0.001 ซึ่งถือว่าเสมอกัน ตัวเลขทั้งสองปรากฏอยู่ในแถวเดียวกันของตารางเดียวกัน และมีเพียงตัวเดียวเท่านั้นที่มีข้อกล่าวอ้าง

อีกสิ่งที่ตารางบอกคุณคือเกี่ยวกับกรอบการวางของบทความเอง โมเดลที่ใช้เปรียบเทียบคือระบบพรีเทรนแบบคอนทราสต์ 3D, MLLM เชิงสร้างที่ผสาน 2D/3D, และโมเดลแนวหน้าที่อิงสไลซ์ ผู้เขียนเลือกวัดผลเทียบกับระบบที่รับข้อมูลเป็นปริมาตร เพราะข้ออ้างที่มีความหมายเดียวตรงนี้คือโมเดล 3D เชิงสร้างสามารถเอาชนะโมเดล 3D แบบจำแนกในการจัดประเภทโดยไม่มีเฮดได้ มันไม่ได้บอกอะไรเกี่ยวกับว่า NV-Reason-CT เทียบกับโมเดลแนวหน้าทั่วไปเป็นอย่างไรในเรื่องใด ๆ เพราะการเปรียบเทียบนั้นไม่มีอยู่บนแกนนี้

A screenshot of NVIDIA's Hugging Face model page for NV-Reason-CT, showing the model card header with Like 1 and 0 followers, the Image-Text-to-Text and Transformers and Safetensors tags, the qwen3_5, medical-imaging, ct, 3d-vlm and custom_code tags, 'Downloads last month 210', the 5B-parameter BF16 size row, the model description describing the 384x384x384-mm volume becoming a 24x24x24 grid of 13,824 visual tokens with no spatial downsampling, the training paragraph citing roughly 550,000 structured QA examples from 70,111 unique CT volumes, a side panel showing Base model Qwen/Qwen3.5-4B and the CT-RATE and CancerVerse datasets, and the arXiv 2609.27511 paper link.

เงินไหลไปที่ใด และเหตุใดเส้นแบ่งระดับจึงสำคัญ

ตารางราคาของ Grok 4.6 มีรายละเอียดหนึ่งที่ตัดสินสถาปัตยกรรมหลายอย่างอย่างเงียบ ๆ: พรอมต์ที่มีโทเคนอินพุตเกิน 200K จะถูกคิดค่าบริการเป็นสองเท่าของอัตราฐาน — ขาเข้า $4.00 ขาออก $12.00 โดยอัตราการอ่านแคชเพิ่มจาก $0.50 เป็น $1.00 งานรีวิวแบบโคฮอร์ตที่สะสมสิ่งที่พบไว้ในบริบทเดียวที่ยาวคือปริมาณงานแบบที่ข้ามเส้นนั้นไปพอดี เมื่ออยู่ใต้เส้นนั้น อัตราการอ่านแคชที่ $0.50 ต่อล้าน คิดเป็นหนึ่งในสี่ของราคาอินพุต ซึ่งเป็นสิ่งที่ทำให้การวนใช้คำนำหน้าคงที่ขนาดใหญ่ซ้ำกับรายงานหลายพันฉบับนั้นจ่ายไหว ไม่ใช่แค่เป็นไปได้

ผ่าน OrcaRouter, Grok 4.6 ให้บริการในราคาตามรายการของผู้ให้บริการรายนั้นโดยไม่มีการบวกเพิ่ม ดังนั้นการคำนวณตามระดับชั้นข้างต้นคือการคำนวณที่คุณจ่ายจริง และการปรับเปลี่ยนใด ๆ กับมันในอนาคตจะสะท้อนถึงบิลของคุณภายในวันเดียวกัน แทนที่จะรอถึงการต่ออายุครั้งถัดไป เหตุผลที่ควรกำหนดเส้นทางงานแบบนี้แทนการฮาร์ดโค้ดปลายทางเดียวก็คือ ครึ่งหนึ่งที่เกี่ยวกับการทบทวนกลุ่มโคฮอร์ตของไปป์ไลน์ทางคลินิกเป็นจุดที่คุณจะอยากลองโมเดลที่แตกต่างกันสามแบบก่อนตัดสินใจ — และบนคีย์ที่เข้ากันได้กับ OpenAI เพียงคีย์เดียวที่มีการสลับไปยังผู้ให้บริการรายอื่นโดยอัตโนมัติเมื่อเกิดข้อขัดข้องการทดลองนั้นมีค่าใช้จ่ายเป็นเพียงการเปลี่ยนชื่อโมเดล

ครึ่ง CT ของไปป์ไลน์ไม่มีตัวเลือกแบบนั้น NV-Reason-CT ไม่ได้โฮสต์อยู่บน OrcaRouter — มันเป็นเช็กพอยต์ขนาด 10.6 GB พร้อมโค้ดโมเดลแบบกำหนดเองที่คุณรันเอง บนซิลิคอน Ampere, Hopper หรือ Lovelace โดยใช้ trust_remote_code=True เราจะไม่สื่อเป็นนัยเป็นอย่างอื่น หากคุณกำลังสร้างไปป์ไลน์นี้ คุณกำลังซื้อ GPU สำหรับครึ่งหนึ่ง และโทเคนสำหรับอีกครึ่งหนึ่ง และข้อเท็จจริงที่ว่าทั้งสองครึ่งอย่างน้อยก็สามารถจัดการได้จากคอนโซลเดียว คือข้ออ้างเรื่องการผสานรวมเพียงหนึ่งเดียวที่คุ้มค่าแก่การกล่าวถึง

A screenshot of the OrcaRouter model page for Grok 4.6, showing the identifier grok/grok-4.6, input text + image + file, output text, the Vision, Tools, JSON and Reasoning badges, a 500,000-token context window, the description of it as SpaceXAI's smartest model to date and the current flagship listed as Latest in the vendor's own developer docs, OpenAI-compatible code samples pointing at https://api.orcarouter.ai/v1, and a pricing strip reading $2.00 per million input tokens and $6.00 per million output tokens.

ผู้้อ่านคนที่สองมีค่าจริง ๆ แค่ไหน

บทความ NV-Reason-CT มีการศึกษานำร่องโดยรังสีแพทย์ผู้เชี่ยวชาญ ซึ่งรายงานว่า "คะแนนความมั่นใจเชิงบวกต่อการทบทวนโดยมี AI ช่วย" และเวลาที่รายงานโดยเฉลี่ยสำหรับการตีความและการรายงานลดลง 50% ตัวเลขเหล่านั้นแข็งแรง และมาพร้อมข้อแม้ที่บทความระบุไว้เองว่า เป็นการศึกษาเบื้องต้น และเป็นการออกแบบการศึกษาของผู้เขียนเอง ยังไม่มีการศึกษาซ้ำโดยอิสระที่ตีพิมพ์ออกมา และการลดเวลาลง 50% ในการศึกษาการอ่านแบบควบคุมก็เป็นผลลัพธ์ประเภทที่มักหดลงเมื่อมีการศึกษาซ้ำพอดี มันคุ้มค่าที่จะติดตาม แต่ไม่คุ้มค่าที่จะอ้างอิงเสมือนเป็นข้อสรุปที่ยืนยันแล้ว

เมื่อพิจารณาเทียบกับสิ่งนั้นแล้ว สิ่งที่ Grok 4.6 มีส่วนช่วยในเวิร์กโฟลว์รังสีวิทยาไม่ใช่การวินิจฉัยเลย แต่เป็นชั้นที่อ่านรายงาน ได้แก่ คิวคัดกรอง จดหมายติดตามผล การลงรหัส และชุดเอกสารขออนุมัติล่วงหน้า งานเหล่านี้เป็นงานข้อความ มีปริมาณสูง ต้นทุนต่อหน่วยต่ำ และรูปแบบความล้มเหลวเมื่อทำผิดพลาดเป็นเรื่องธุรการมากกว่าด้านคลินิก อีกทั้งยังเป็นจุดที่หน้าต่างบริบท 500K และการอ่านแคชราคา $0.50 พิสูจน์คุณค่าของตัวเองได้อย่างแท้จริง

ดังนั้นจุดแบ่งที่การเปรียบเทียบนี้ลงเอยจึงตรงไปตรงมา: NV-Reason-CT มีเส้นทาง 3D จริง แต่ไม่มีการจัดจำหน่าย ไม่มีราคา และไม่มีการตรวจสอบอิสระ ส่วน Grok 4.6 มีการจัดจำหน่าย มีราคา มีการครอบคลุมจาก benchmark อิสระ และไม่มีเส้นทางเชิงปริมาตรเลย ถ้าคุณต้องการให้อ่านผลสแกน มีเพียงตัวเดียวในสองตัวนี้ที่ทำได้ ถ้าคุณต้องการให้จัดการเอกสารรอบๆ การสแกน มีเพียงอีกตัวเดียวเท่านั้นที่เป็นผลิตภัณฑ์

การเปรียบเทียบในบทความนี้1

ตรวจพบจากบทความนี้ · เบนช์มาร์ก: Artificial Analysis · อัปเดตทุกวัน

© 2026 OrcaRouter

สำหรับผู้ให้บริการ

ให้บริการแพลตฟอร์มการอนุมานอยู่หรือไม่ นำโมเดลของคุณขึ้น OrcaRouter

providers@orcarouter.ai

เข้าร่วมคอมมูนิตี้ของเรา

Discordsupport@orcarouter.aiXGitHubYouTube