
NV-Reason-CT กับ GPT-5.6 Sol: 13,824 โทเคนภาพก่อนที่คุณจะพิมพ์สักคำ
- typesafeใหม่TypeSafe: Jev 1.132026-09-24$0.04 / $0.00 ต่อ 1 ล้านโทเค็น · 45 tok/s
- openaiใหม่OpenAI: GPT-6 Luna2026-09-2237ความฉลาด
- openaiใหม่OpenAI: GPT-6 Sol2026-09-2248ความฉลาด
- anthropicใหม่Anthropic: Claude Opus 5.52026-09-2258ความฉลาด
- grokใหม่Grok 4.72026-09-2146ความฉลาด
- Orcaใหม่Orca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 ต่อ 1 ล้านโทเค็น · 182 tok/s
- orcaใหม่Orca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 ต่อ 1 ล้านโทเค็น · 1285 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040ความฉลาด
- openaiOpenAI: GPT-6 Astra2026-09-0453ความฉลาด77การเขียนโค้ด
- googleGoogle: Gemini 3.8 Flash2026-09-0241ความฉลาด76การเขียนโค้ด
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245ความฉลาด76การเขียนโค้ด
- anthropicAnthropic: Claude Fable 5.12026-09-0153ความฉลาด82การเขียนโค้ด
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 ต่อ 1 ล้านโทเค็น · 119 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642ความฉลาด72การเขียนโค้ด
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 ต่อ 1 ล้านโทเค็น · 224 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845ความฉลาด75การเขียนโค้ด
- obsidianQwen3.8 27B2026-08-1534ความฉลาด68การเขียนโค้ด
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236ความฉลาด69การเขียนโค้ด
- grokSpaceXAI: Grok 4.62026-08-1244ความฉลาด77การเขียนโค้ด
- metaMeta: Muse Spark 1.22026-08-0540ความฉลาด72การเขียนโค้ด
ทุกภาพ CT ทรวงอกที่คุณส่งไปยัง NV-Reason-CT มีค่าใช้จ่าย 13,824 โทเค็นภาพก่อนที่พรอมป์ต์จะเริ่มต้นด้วยซ้ำ นั่นไม่ใช่ความแปลกประหลาดหรือทางเลือกจากการปรับแต่ง — แต่มันคือการออกแบบทั้งหมด ตัวเข้ารหัสภาพ 3D แบบเนทีฟของโมเดลรับปริมาตรขนาด 384×384×384 มม. แล้วเปลี่ยนให้เป็นกริดขนาด 24×24×24 และการ์ดโมเดลระบุไว้อย่างชัดเจนว่าโทเค็นทั้ง 13,824 รายการพร้อมพิกัดสามมิติของมันไปถึงโมเดลภาษา "โดยไม่มีการดาวน์แซมเปิลเชิงพื้นที่" ลองเปรียบเทียบกับสิ่งที่คุณน่าจะจ่ายอยู่แล้ว GPT-5.6 Sol ยอมรับข้อความ รูปภาพ และไฟล์ และรูปภาพที่ส่งไปหามันก็เป็นภาพ 2D — สไลซ์หนึ่งภาพ ภาพหน้าจอของโปรแกรมดู DICOM หรือภาพประกอบทางรังสีวิทยาที่คัดลอกมาจาก PDF หนึ่งในโมเดลเหล่านี้มีเส้นทางเชิงปริมาตร ส่วนอีกโมเดลมีหน้าต่างบริบท การเปรียบเทียบส่วนใหญ่ระหว่างสองสิ่งนี้มักพังทลายลงตรงความแตกต่างนั้น และการพังทลายนั้นแหละคือส่วนที่น่าสนใจ
การเปิดตัวที่ไม่มีใครประกาศ
NVIDIA ไม่ได้เผยแพร่แม้แต่คำเดียวเกี่ยวกับ NV-Reason-CT ในห้องข่าวของตน ไม่มีโพสต์เปิดตัว ไม่มีสไลด์ปาฐกถาหลัก ไม่มีข่าวประชาสัมพันธ์ สิ่งที่มีอยู่คือรีโพซิทอรีบน Hugging Face ที่สร้างเมื่อวันที่ 8 กันยายน 2026 รีโพซิทอรีบน GitHub ภายใต้องค์กร NVIDIA-Medtech ที่สร้างเมื่อวันที่ 2 กันยายน Gradio demo Space และ preprint บน arXiv — NV-Reason-CT: โมเดลภาษาภาพ 3 มิติสำหรับการวิเคราะห์ CT — ส่งเมื่อวันที่ 23 กันยายน 2026 โดยทีมผู้เขียนสิบหกคนจาก NVIDIA พร้อมผู้เขียนร่วมจาก NIH และมหาวิทยาลัยซูริก
นั่นคือแพตเทิร์นที่มีอยู่จริง และมันคุ้มค่าที่จะเรียกชื่อมันให้ชัดเจน แทนที่จะมองมันเป็นเรื่องลึกลับ กลุ่มงานภาพทางการแพทย์ของ NVIDIA ปล่อยเวตอย่างเงียบ ๆ และให้เปเปอร์กับรีโพซิทอรีเป็นตัวประกาศ รุ่นก่อนหน้าอย่าง NV-Reason-CXR-3B เปิดตัวในเดือนตุลาคม 2025 ด้วยวิธีเดียวกัน ความต่างตรงนี้คือสเกล นี่เป็นครั้งแรกที่กลุ่มนั้นขยายสูตรจากภาพเอกซเรย์ 2D ไปสู่วอลุ่ม 3D แบบเนทีฟ และเปเปอร์เพิ่งอายุได้สองวัน
สิ่งที่เป็นที่รู้ได้จากรีโพซิทอรี: สถาปัตยกรรม สัญญาอนุญาต ข้อมูลฝึก และตารางเปรียบเทียบประสิทธิภาพ สิ่งที่ยังไม่ได้รับการยืนยัน: NVIDIA ตั้งใจให้สิ่งนี้เป็นสายผลิตภัณฑ์ที่ได้รับการสนับสนุนหรือไม่ จะมีเช็กพอยต์ตามมาอีกหรือไม่ และมันจะยืนหยัดได้แค่ไหนภายใต้การประเมินของผู้อื่นที่ไม่ใช่ผู้เขียน รีโพซิทอรีนี้อยู่ในเวอร์ชัน 0.1 และระบุว่าตนเองมีไว้เพื่อการวิจัยและการศึกษาเท่านั้น
แต่ละโมเดลยอมรับอะไรได้จริง
นี่คือจุดที่การเทียบกันแบบตัวต่อตัวเผยความจริงได้อย่างรวดเร็ว สองโมเดลนี้ไม่ได้ใช้พื้นผิวอินพุตร่วมกัน
NV-Reason-CT อ่านปริมาตร NIfTI — .nii หรือ .nii.gz — โดยมีความเข้มของ voxel ในหน่วย Hounsfield ระบบจะครอบตัดไปยังทรวงอกหรือช่องท้องโดยอัตโนมัติโดยใช้ค่าหน่วย Hounsfield ของปอดและฮิวริสติกทางสัณฐานวิทยาแบบ 3D รีแซมเปิลเป็นความละเอียดไอโซทรอปิก 2 มม. และยอมรับเฉพาะ "chest" หรือ "abdomen" เป็นค่ากายวิภาคศาสตร์เท่านั้น ระบบจะส่งข้อความออกมา: รายงานที่มีโครงสร้าง คำตอบ หรือร่องรอยการให้เหตุผลแบบทีละขั้นตอน พร้อมสวิตช์เพื่อปิดการให้เหตุผลสำหรับคำตอบแบบสั้น
GPT-5.6 Sol อ่านข้อความ ภาพ และไฟล์ได้ ด้วยหน้าต่างบริบทขนาด 1,050,000 โทเคน และเอาต์พุตได้สูงสุด 128,000 โทเคนในการตอบกลับครั้งเดียว มันไม่มีตัวเข้ารหัสเชิงปริมาตร ป้อนซีทีให้มัน แล้วคุณต้องตัดสินใจก่อนว่าจะแบนสไลซ์ราวสามร้อยกว่าภาพให้เป็นสิ่งที่ตัวเข้ารหัสภาพ 2D ยอมรับได้อย่างไร — ภาพตัดต่อ, สไลซ์สำคัญไม่กี่ภาพ, หรือการฉายภาพความเข้มสูงสุดที่เรนเดอร์แล้ว ทุกทางเลือกเหล่านั้นล้วนทิ้งความสัมพันธ์เชิงพื้นที่ที่เส้นทาง 3D ถูกสร้างขึ้นมาเพื่อรักษาไว้
ดังนั้นการวางกรอบอย่างตรงไปตรงมาจึงไม่ใช่คำถามว่า “โมเดลไหนฉลาดกว่า” หากแต่เป็นว่าเส้นทางภาพของ Sol และเส้นทาง 3D ของ NV-Reason-CT กำลังตอบคำถามคนละคำถาม Sol สามารถให้เหตุผลเกี่ยวกับคำบรรยายภาพสแกนของรังสีแพทย์ได้ NV-Reason-CT สามารถให้เหตุผลเกี่ยวกับภาพสแกนได้
มีเกณฑ์มาตรฐานอยู่หนึ่งรายการ และมีเพียงรายการเดียวในนั้นที่มีตัวเลขกำกับอยู่
NV-Reason-CT รายงาน Macro-F1 0.614 และ Macro-AUROC 0.871 บนงานจำแนกประเภท 18 ป้ายกำกับของ CT-RATE โดยใช้พรอมป์ต์ Yes/No โดยตรง ไม่มี classification head และไม่มีการปรับให้เข้ากับงานเฉพาะ ตัวเลขเหล่านี้เป็นตัวเลขของผู้เขียนเองจาก model card และส่วนที่มีประโยชน์คือแถวเปรียบเทียบ: VoxelFM ที่ 0.581 Macro-F1, Pillar-0 ที่ 0.544, ClinFusion-8B ที่ 0.442, CT-CLIP ที่ 0.398, Merlin ที่ 0.358, MedGemma 1.5 ที่ 0.303 บนเกณฑ์คงที่แบบสม่ำเสมอเดียวกัน โมเดล 3D เชิงสร้างเอาชนะ baseline การฝึกก่อนแบบเปรียบเทียบ 3D และโมเดลระดับแนวหน้าสุดที่อิงสไลซ์
ตัวเลขหนึ่งตัวในตารางนั้นควรถูกมองด้วยความกังขามากกว่าการพูดซ้ำ: ช่องว่าง AUROC โดย NV-Reason ได้ 0.871 เทียบกับ 0.870 ของ VoxelFM หนึ่งในพันของจุด ในการประเมินที่ผู้ขายเป็นผู้ดำเนินการ ไม่ใช่ชัยชนะ — แต่เป็นผลเสมอภายในสัญญาณรบกวนที่การประเมินนั้นมีอยู่ ต่างหากที่ช่องว่าง Macro-F1 ที่ 0.033 เป็นข้อกล่าวอ้างที่มีหลักฐานรองรับ
GPT-5.6 Sol ไม่มีตัวเลข CT-RATE เพราะ CT-RATE ไม่ใช่ benchmark ที่它能ถูกนำไปรันได้ มันมี Artificial Analysis Intelligence Index อยู่ที่ 47 คะแนน GPQA Diamond ที่วัดโดย AA อยู่ที่ 94.1 และคะแนน Humanity's Last Exam อยู่ที่ 49.5 — ทั้งหมดล้วนเป็นเครื่องมือวัดการให้เหตุผลทั่วไป การเอา 0.614 Macro-F1 ไปวางไว้ข้าง 47 บน AA Index ก็คือการคำนวณบนไม้บรรทัดสองอันที่ต่างกัน ผมจะไม่ทำแบบนั้น และคุณควรไม่ไว้ใจใครก็ตามที่ทำ
ร่องรอยการให้เหตุผล ผลิตภัณฑ์ที่แตกต่างกันสองชนิด
โมเดลทั้งสองต่างก็สร้างการให้เหตุผลออกมา นั่นคือความทับซ้อนทางปรัชญาที่แท้จริงเพียงจุดเดียว และความแตกต่างนั้นให้แง่คิด
GPT-5.6 Sol เปิดให้กำหนดค่าความพยายามในการคิดวิเคราะห์ได้ คุณจึงแลกความหน่วงและค่าใช้จ่ายกับความลึกต่อคำขอ และคุณสามารถขอผลการคิดวิเคราะห์กลับมาได้ผ่าน include_reasoning ซึ่งเป็นความสามารถทั่วไปที่นำไปใช้กับอะไรก็ตามที่คุณส่งไป
การให้เหตุผลของ NV-Reason-CT นั้นแคบโดยเจตนา คลังข้อมูลสำหรับฝึกประกอบด้วยตัวอย่าง QA แบบมีโครงสร้างประมาณ 550,000 ตัวอย่าง ซึ่งดึงมาจากปริมาตร CT ที่ไม่ซ้ำกัน 70,111 ปริมาตร และส่วนหนึ่งเป็นการให้เหตุผลที่นักรังสีวิทยาเขียนขึ้น โดยรวบรวมจากการตีความของผู้เชี่ยวชาญที่บันทึกและถอดความไว้ ขั้นตอน GRPO ที่ตามหลัง SFT ใช้รางวัลที่ตรวจสอบได้กับชุดความผิดปกติของทรวงอกและช่องท้อง — หมายความว่าสัญญาณรางวัลนั้นอ้างอิงกับว่าสิ่งที่พบตามที่ระบุมีอยู่จริงในปริมาตรหรือไม่ ไม่ใช่ว่าข้อความอ่านลื่นไหลดีหรือไม่ การ์ดโมเดลอธิบายผลลัพธ์ว่าเป็น "ข้อสังเกตที่ตรวจสอบได้ การวินิจฉัยแยกโรค และความไม่แน่นอน" และมีคำเตือนชัดเจนว่าการให้เหตุผลที่สร้างขึ้นนั้น "ไม่รับประกันว่าจะเป็นตัวแทนการคำนวณภายในของโมเดล" คำเตือนนั้นมีผลจริง มันคือความแตกต่างระหว่างร่องรอยที่คุณตรวจสอบเทียบกับข้อมูลได้ กับร่องรอยที่คุณได้แต่ชื่นชม
ขนาดและใบอนุญาต ในครั้งเดียว
• พารามิเตอร์ — NV-Reason-CT รวม 4.69B / ใช้งาน 4.35B ในเส้นทาง CT จากโครงหลัก Qwen3.5-4B บวก Primus 3D ViT เทียบกับ GPT-5.6 Sol ที่ไม่เปิดเผย • ขนาดเช็กพอยต์ — NV-Reason-CT ~10.6 GB BF16 safetensors ทำงานบน Ampere/Hopper/Lovelace เทียบกับ GPT-5.6 Sol ที่ใช้เฉพาะ API • อินพุต — ปริมาตร CT NIfTI 3D ในหน่วย Hounsfield เทียบกับข้อความ รูปภาพ ไฟล์ • คอนเท็กซ์ — NV-Reason-CT ไม่เกี่ยวข้อง หนึ่งปริมาตรคือคำนำหน้าคงที่ขนาด 13,824 โทเคน เทียบกับ Sol 1,050,000 โทเคนเข้า, 128,000 ออก • สัญญาอนุญาต — OpenMDW-1.1, ดาวน์โหลดเวตได้ เทียบกับแบบมีกรรมสิทธิ์ เข้าถึงผ่าน API เท่านั้น • ความพร้อมใช้งาน — ที่เก็บของผู้จำหน่ายและเวตของตัวเอง เทียบกับ ให้บริการผ่าน OrcaRouter ในราคา $4.00 / $20.00 ต่อล้าน โดยอัตราของ Sol เมื่ออินพุตเกิน 272K โทเคนจะเพิ่มเป็นสองเท่าเป็น $8.00 / $30.00

สิ่งที่การแยกจากกันต้องแลกมาด้วยจริง ๆ สำหรับคุณ
การเปรียบเทียบต้นทุนจะสมเหตุสมผลก็ต่อเมื่อคุณยอมรับก่อนว่าปริมาณงานนั้นแตกต่างกัน ดังนั้นนี่คือเวอร์ชันที่สมเหตุสมผลจริง ๆ
Sol คิดค่าบริการต่อโทเค็น และราคาของมันมีจุดเปลี่ยนแปลงแบบขั้นบันได: $4.00 ต่อล้านโทเค็นอินพุต และ $20.00 ต่อล้านโทเค็นเอาต์พุต สำหรับพรอมป์ต์สูงสุด 272K โทเค็น จากนั้นเป็น $8.00 และ $30.00 บน OrcaRouter มันให้บริการในราคาตามรายการของ OpenAI เองโดยไม่มีมาร์กอัป ซึ่งสำคัญกว่าที่ฟังดู — อัตราที่คุณเห็นคืออัตราที่ OpenAI ประกาศ ดังนั้นการเปลี่ยนแปลงราคาใด ๆ จะไปถึงบิลของคุณในวันเดียวกัน แทนที่จะเป็นตอนต่อสัญญาครั้งถัดไป อัตราการอ่านแคชของมันคือ $0.40 ต่อล้าน คิดเป็นหนึ่งในสิบของอินพุต ซึ่งเป็นสิ่งที่ทำให้ลูปแบบเอเจนต์ที่ยาวนานซึ่งมีคำนำหน้าคงที่ขนาดใหญ่ยังคงอยู่รอดได้ในเชิงคณิตศาสตร์
NV-Reason-CT ไม่มีราคาต่อโทเคนเลย คุณดาวน์โหลด 10.6 GB และจ่ายค่า GPU นั่นเป็นคำถามเรื่อง CAPEX กับ OPEX และมันมีคำตอบเดียว: เมื่อปริมาณสูงพอ การโฮสต์โมเดลที่มีพารามิเตอร์ที่ใช้งาน 4.35B ด้วยตัวเองจะได้เปรียบในด้านต้นทุน ต่ำกว่าปริมาณนั้นมันจะไม่คุ้ม และจุดคุ้มทุนขึ้นอยู่กับอัตราการใช้งาน GPU ของคุณเพียงอย่างเดียว ยังไม่มีใครนอก NVIDIA เผยแพร่ตัวเลข throughput สำหรับเช็คพอยต์นี้ ดังนั้นใครก็ตามที่บอกจุดคุ้มทุนกับคุณก็แค่เดา

สิ่งที่เราเตอร์ช่วยได้ในกรณีนี้คือส่วนของเวิร์กโฟลว์ที่ไม่ใช่การสแกน ไปป์ไลน์การวิจัยทางคลินิกในระดับโปรดักชันแทบไม่เคยเป็นโมเดลเดียว — มันคือการสกัดข้อมูล ขั้นตอนการให้เหตุผล ขั้นตอนการสรุป บางครั้งก็เป็นการขอความเห็นที่สอง OrcaRouter เปิดให้เข้าถึง โมเดลมากกว่า 200 รายการผ่านปลายทางเดียวที่เข้ากันได้กับ OpenAI พร้อมการสลับไปใช้ผู้ให้บริการรายอื่นโดยอัตโนมัติเมื่อเกิดข้อขัดข้อง ดังนั้นครึ่งหนึ่งของไปป์ไลน์ที่เป็นงานทั่วไปจึงสามารถสลับหรือเปลี่ยนเส้นทางได้โดยไม่ต้องมีสัญญาที่สอง NV-Reason-CT ไม่ใช่หนึ่งในโมเดลที่เราเลือกเส้นทางให้ มันคือเช็กพอยต์ที่คุณรันเอง ทั้งสองครึ่งของไปป์ไลน์ยังคงอยู่ภายใต้คีย์เดียวได้

คำถามที่เปิดอยู่
NV-Reason-CT มีอายุสองวันในฐานะบทความ และสิบเจ็ดวันในฐานะรีโพซิทอรี และสาขาที่มันสังกัดอยู่นั้นเล็กพอที่จุดข้อมูลถัดไปจะให้ข้อมูลที่เป็นประโยชน์ เฝ้าจับตาสามสิ่ง: การทำซ้ำ CT-RATE ที่เป็นอิสระ, เช็กพอยต์ที่สองในตระกูลนี้, และสัญญาณใด ๆ ว่ากลุ่มการแพทย์ของ NVIDIA กำลังปฏิบัติต่อสิ่งนี้ในฐานะสายงานหนึ่ง มากกว่าจะเป็นบทความเดียว จนกว่าจะถึงตอนนั้น จุดยืนที่ปกป้องได้นั้นแคบและชัดเจน — นี่คือเช็กพอยต์การให้เหตุผล CT แบบ native-3D ที่แข็งแกร่งที่สุดที่ดาวน์โหลดได้ในปัจจุบัน เมื่อตัดสินจากตารางของเหล่าผู้เขียนเอง และมันไม่ใช่สิ่งทดแทนโมเดลแนวหน้าทั่วไปในเรื่องใดเลย ยกเว้นการอ่านภาพ CT
