
NV-Reason-CT กับ Claude Opus 5: ข้อผิดพลาดเชิงหมวดหมู่ที่ควรค่าแก่การใส่ใจอย่างจริงจัง
- typesafeใหม่TypeSafe: Jev 1.132026-09-24$0.04 / $0.00 ต่อ 1 ล้านโทเค็น · 506 tok/s
- openaiใหม่OpenAI: GPT-6 Luna2026-09-2237ความฉลาด
- openaiใหม่OpenAI: GPT-6 Sol2026-09-2248ความฉลาด
- anthropicใหม่Anthropic: Claude Opus 5.52026-09-2258ความฉลาด
- grokใหม่Grok 4.72026-09-2146ความฉลาด
- Orcaใหม่Orca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 ต่อ 1 ล้านโทเค็น · 183 tok/s
- orcaใหม่Orca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 ต่อ 1 ล้านโทเค็น · 1285 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040ความฉลาด
- openaiOpenAI: GPT-6 Astra2026-09-0453ความฉลาด77การเขียนโค้ด
- googleGoogle: Gemini 3.8 Flash2026-09-0241ความฉลาด76การเขียนโค้ด
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245ความฉลาด76การเขียนโค้ด
- anthropicAnthropic: Claude Fable 5.12026-09-0153ความฉลาด82การเขียนโค้ด
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 ต่อ 1 ล้านโทเค็น · 119 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642ความฉลาด72การเขียนโค้ด
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 ต่อ 1 ล้านโทเค็น · 224 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845ความฉลาด75การเขียนโค้ด
- obsidianQwen3.8 27B2026-08-1534ความฉลาด68การเขียนโค้ด
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236ความฉลาด69การเขียนโค้ด
- grokSpaceXAI: Grok 4.62026-08-1244ความฉลาด77การเขียนโค้ด
- metaMeta: Muse Spark 1.22026-08-0540ความฉลาด72การเขียนโค้ด
การนำNV-Reason-CT และ Claude Opus 5 มาไว้ในประโยคเดียวกันถือเป็นความผิดพลาดเชิงหมวดหมู่ และก็ยังคุ้มค่าที่จะทำอยู่ดี เพราะความผิดพลาดนั้นให้บทเรียนที่มีประโยชน์ NV-Reason-CT เป็นโมเดลภาพและภาษาแบบ 3 มิติเนทีฟขนาด 4.69 พันล้านพารามิเตอร์จาก NVIDIA ที่รับปริมาตร CT ของทรวงอกหรือช่องท้องในหน่วย Hounsfield และสร้างรายงานผลการตรวจแบบมีโครงสร้างทีละข้อค้นพบ มันไม่ใช่อุปกรณ์ทางการแพทย์ และการ์ดโมเดลของมันเองก็ระบุไว้เช่นนั้น Claude Opus 5 คือโมเดลข้อความและภาพระดับฟรอนเทียร์อเนกประสงค์ของผู้ให้บริการ เปิดตัวเมื่อวันที่ 24 กรกฎาคม 2026 พร้อมหน้าต่างบริบทขนาดหนึ่งล้านโทเคน เพดานเอาต์พุต 128,000 โทเคน และอัตราค่าบริการที่ประกาศไว้ที่ห้าดอลลาร์ต่อหนึ่งล้านโทเคนอินพุต และยี่สิบห้าดอลลาร์ต่อหนึ่งล้านโทเคนเอาต์พุต หนึ่งในสองตัวนี้อ่าน CT ส่วนอีกตัวอ่านทุกอย่างอื่น
เหตุผลที่การเปรียบเทียบนี้ยังคงถูกหยิบยกขึ้นมาเรื่อย ๆ — และมันจะเกิดขึ้นทุกครั้งที่ใครบางคนเห็น VLM ทางการแพทย์ตัวใหม่แล้วเอื้อมไปหยิบไม้บรรทัดวัดที่คุ้นเคยมาใช้ — ก็คือทั้งสองอย่างต่างผลิตข้อความร้อยเรียงเกี่ยวกับภาพหนึ่ง ๆ ความคล้ายคลึงผิวเผินนั้นกำลังสร้างความเสียหายจริง ๆ ต่อวิธีที่ผู้คนให้เหตุผลเกี่ยวกับทั้งสองสิ่งนี้ จึงคุ้มค่าที่จะแกะมันออกมาอย่างละเอียด
แกนจริงที่พวกเขามีร่วมกัน และแกนที่พวกเขาไม่มีร่วมกัน
พวกมันทับซ้อนกันในจุดเดียวเท่านั้น และมันก็แคบกว่าที่เห็น
• โมดัลลิตีใน — NV-Reason-CT รับข้อมูลปริมาตร NIfTI แบบช่องสัญญาณเดียวในหน่วย Hounsfield ผ่านโปรเซสเซอร์สามมิติโดยเฉพาะ ส่วน Claude Opus 5 รับข้อความ รูปภาพ และไฟล์ ซึ่งเป็นอินเทอร์เฟซรุ่นที่สองสำหรับรูปภาพ และไม่สามารถรับข้อมูลการศึกษาซีทีเชิงปริมาตรได้เองโดยตรง
• สิ่งที่ส่งกลับมา — รายการสิ่งที่ตรวจพบซึ่งจัดตามบริเวณทางกายวิภาคจาก NV-Reason-CT เทียบกับข้อความร้อยแก้วทั่วไป JSON แบบมีโครงสร้าง หรือการเรียกใช้เครื่องมือจาก Claude Opus 5
• หน่วยของงาน — ปริมาตร CT หนึ่งชุด รีแซมเพิลเป็น 2 มม. แบบไอโซทรอปิก ครอปให้เหลือเฉพาะกายวิภาค ตัดเป็นแพตช์ขนาด 8 x 8 x 8; เทียบกับจำนวนใดก็ตามที่คุณใส่ไว้ในงบโทเค็น
• บริบท — NV-Reason-CT ไม่มีหน้าต่างแชตเลย; วอลุ่มเดียวกลายเป็น 13,824 โทเคนภาพโดยไม่มีการดาวน์แซมปลิง Claude Opus 5 รองรับโทเคนขาเข้า 1,000,000 และส่งออกได้สูงสุด 128,000
• สัญญาอนุญาต — OpenMDW-1.1 โมเดลที่ดาวน์โหลดได้ซึ่งคุณรันบนฮาร์ดแวร์ของคุณเอง เทียบกับ API ที่โฮสต์ให้บริการ
• การใช้งานที่ระบุไว้ — เพื่อการวิจัยและการศึกษาเท่านั้น ระบุไว้อย่างชัดเจนว่าไม่ใช่อุปกรณ์ทางการแพทย์ สำหรับ NV-Reason-CT; ไม่สนับสนุนการให้ความช่วยเหลือเพื่อวัตถุประสงค์ทั่วไปสำหรับ Claude Opus 5
• ราคา — ไม่มีราคาตั้ง เพราะไม่มีอะไรให้ซื้อ มีเพียงเวตให้รัน เมื่อเทียบกับ $5 และ $25 ต่อล้านโทเค็น โดยการอ่านจากแคชอยู่ที่ $0.50
แถว "modality in" คือจุดกำเนิดของความผิดพลาดเชิงหมวดหมู่ ทั้งคู่รับภาพได้ ทั้งคู่จึงดูเหมือนโมเดลภาพ และผู้อ่านก็ถามอย่างสมเหตุสมผลว่าตัวไหนเก่งเรื่องภาพมากกว่า แต่การศึกษา CT ไม่ใช่ภาพ มันคืออาร์เรย์เชิงปริมาตรที่มีสเกลทางกายภาพเป็นมิลลิเมตร หน่วยความหนาแน่นที่ปรับเทียบแล้ว และกายวิภาคที่มีความหมายก็ต่อเมื่ออยู่ในสามมิติ วิสัยทัศน์ของ Claude Opus 5 มีความสามารถจริงและจะพูดคุยเกี่ยวกับภาพรังสีหรือสไลด์พยาธิวิทยาได้อย่างสมเหตุสมผล นั่นเป็นงานที่แตกต่างจากการผสานรวมลูกบาศก์ขนาด 384 มิลลิเมตรของค่าฮาวน์สฟิลด์ที่ความละเอียด 2 มม. และรายงานเกี่ยวกับการเป็นพูของก้อนเนื้อ
ตัวเลขในแต่ละด้านวัดอะไรกันแน่
โมเดลทั้งสองมีบันทึกผลการทดสอบที่ไม่เคยทับซ้อนกันเลย และการนำบันทึกเหล่านั้นมาอ่านวางเทียบกันโดยไม่ทันสังเกตข้อนี้ ก็คือหนทางที่ทำให้เกิดการตัดสินใจจัดซื้อที่ผิดพลาด
NV-Reason-CT รายงานผลลัพธ์ของตนบนชุดทดสอบมาตรฐาน CT ทรวงอกสาธารณะ CT-RATE ครอบคลุม 18 ป้ายกำกับ โดยใช้เกณฑ์คงที่แบบสม่ำเสมอและพรอมต์แบบใช่/ไม่ใช่โดยตรง โดยไม่มีหัวจำแนกประเภทและไม่มีการปรับให้เข้ากับงานเฉพาะ โมเดลทำได้ 0.614 F1 และ 0.871 AUROC นำหน้า VoxelFM ที่ 0.581 และ 0.870, Pillar-0 ที่ 0.544 และ 0.861, ClinFusion-8B ที่ 0.442 F1, CT-CLIP ที่ 0.398 และ 0.733, Merlin ที่ 0.358 และ 0.662 และ MedGemma 1.5 ที่ 0.303 F1 เมื่อป้อนภาพสไลซ์แนวแกนสูงสุด 85 สไลซ์ นอกจากนี้ยังมี macro-F1 ที่ได้จากรายงานเท่ากับ 0.592 ตัวเลขทั้งหมดเหล่านั้นมาจากบทความของ NVIDIA เอง ยังไม่มีใครทำซ้ำได้ และโมเดลนี้เปิดให้ดาวน์โหลดมาได้สองสามสัปดาห์แล้ว
บันทึกของ Claude Opus 5 เป็นแบบอเนกประสงค์และเป็นอิสระโดยส่วนใหญ่ Artificial Analysis วัดได้ที่ 50.8 บน Intelligence Index, 78 บน Coding Index, 93.2 บน GPQA Diamond และ 54.9 บน Humanity's Last Exam โดยมีคะแนนการเรียกคืนบริบทยาวที่ 79.33 เหล่านั้นเป็นตัวเลขจากบุคคลที่สามเกี่ยวกับงานด้านการให้เหตุผลทั่วไป โค้ด และความรู้ ไม่มีเกณฑ์มาตรฐานด้านการถ่ายภาพทางคลินิกในชุดนั้น และไม่มีแถว CT-RATE ที่ใดในบันทึกที่เผยแพร่ของ Claude Opus 5
ดังนั้นคำกล่าวที่ซื่อตรงจึงไม่ใช่การบอกว่าตัวหนึ่งนำหน้าอีกตัว แต่คือทั้งสองโมเดลยังไม่เคยถูกวัดบนงานเดียวกันโดยใครเลยประโยคใดก็ตามในรูปแบบ "NV-Reason-CT เก่งกว่า Claude Opus 5 ในการสร้างภาพทางการแพทย์" ถือเป็นข้อความที่ไม่อาจพิสูจน์ว่าเป็นเท็จได้ตามที่เขียนไว้ เพราะยังไม่มีใครทำการทดลองนี้ ตารางเปรียบเทียบของ NVIDIA เองก็ไม่มีโมเดลแนวหน้าทั่วไปอยู่ในนั้น

จุดที่ผู้คนเข้าใจคำถามเกี่ยวกับอินเทอร์เฟซผิด
จุดที่ทับซ้อนกันทางเทคนิคซึ่งน่าสนใจอย่างแท้จริงเพียงจุดเดียว คือจุดที่ไม่มีใครโต้แย้งด้วย นั่นก็คือหน้าตาของอินเทอร์เฟซระหว่างโมเดล CT กับโมเดลข้อความควรเป็นอย่างไร
สัญชาตญาณที่สมเหตุสมผลคือการป้อนชุดภาพ CT หรือวอลุ่มที่ดาวน์แซมเปิลแล้วให้ Claude Opus 5 และขอให้มันใช้เหตุผล เมื่อมีบริบท 1,000,000 โทเค็น ฟังดูใจกว้าง และเมื่อเทียบกับงานศึกษาที่มีเพียง 13,824 โทเค็นภาพ ก็ฟังดูเหมือนมีที่ว่างเหลือเฟือ ปัญหาไม่ใช่ที่ว่าง ไปป์ไลน์การมองเห็นของ Claude Opus 5 มองภาพเป็นรูปสองมิติที่มีสเกลพิกเซล ซีทีทรวงอกที่นำเสนอในลักษณะนั้นสูญเสียระยะห่างระหว่างสไลซ์ที่ทำให้รอยโรควัดค่าได้ และสูญเสียการปรับเทียบความหนาแน่นที่ทำให้ "ground-glass" เป็นเกณฑ์ตัดขาด มากกว่าคำบรรยาย คุณส่งภาพตัดขวางตามแนวแกนแบบเรียงต่อกันให้มันได้ แล้วได้ย่อหน้าที่ฟังดูสอดคล้องกัน สิ่งที่คุณไม่ได้คือการวัดค่า
นั่นคือสิ่งที่การออกแบบของ NV-Reason-CT ใช้พลังประมวลผลไปกับมันอย่างแม่นยำ กริดขนาด 24 x 24 x 24 จากปริมาตร 384 มิลลิเมตรถูกส่งให้โมเดลภาษาแบบความละเอียดเต็ม โดยไม่มีการลดทอนเชิงพื้นที่และไม่มีเลเยอร์รวม ซึ่งเป็นเหตุว่าทำไมเส้นทางที่ทำงานอยู่จึงมีพารามิเตอร์ 4.35B แทนที่จะเป็นสิ่งที่เล็กกว่านั้นมาก สถาปัตยกรรมนี้เป็นการเดิมพันว่าการเก็บรายละเอียดเชิงพื้นที่ไว้คุ้มค่ากับต้นทุนโทเคน มันเป็นการเดิมพันเกี่ยวกับการแทนข้อมูล ไม่ใช่เกี่ยวกับความสามารถทางภาษา และ Claude Opus 5 ไม่ได้มีส่วนร่วมในการเดิมพันนี้
รูปแบบที่ให้ผลผลิตคือแบบที่น่าเบื่อ: ใช้โมเดล CT สำหรับการอ่านเชิงปริมาตร และใช้โมเดลข้อความสำหรับทุกสิ่งรอบๆ การสร้างรายงานและการทำให้เป็นมาตรฐาน สรุปกลุ่มผู้ป่วย เครื่องมือประเมินผล การแปลงคลัง DICOM เป็น NIfTI ในวงกว้าง การคัดแยกว่าการตรวจใดที่มนุษย์ควรดูก่อน นั่นคืองานเอกสารยาวและงานโค้ด และนั่นคือจุดที่โมเดล 1M-context คุ้มค่ากับค่าบริการ
ค่าใช้จ่าย ในสองหน่วยที่ไม่สามารถแปลงกันได้
Claude Opus 5 คิดค่าบริการตามการใช้งาน 5 ดอลลาร์ต่อ 1 ล้านโทเคนอินพุต และ 25 ดอลลาร์ต่อ 1 ล้านโทเคนเอาต์พุต การอ่านแคชอยู่ที่ 50 เซนต์ การเขียนแคชอยู่ที่ 10 ดอลลาร์ สำหรับไปป์ไลน์ที่ปรับมาตรฐานคลังรายงาน หรือเขียนและเขียนใหม่โค้ดประเมินผล สิ่งนี้ให้การคาดการณ์ที่คุณสร้างได้: โทเคนเข้า โทเคนออก การอ่านแคช และค่าใช้จ่ายที่ถูกกว่ามากหากคุณจัดการแคชได้อย่างถูกต้อง
NV-Reason-CT ไม่มีราคา คุณดาวน์โหลดพารามิเตอร์ 4.69 พันล้านตัว และจ่ายด้วยค่าไฟฟ้า ชั่วโมง GPU และเวลาทำงานของวิศวกร ไม่มีตัวเลขปริมาณงานที่เผยแพร่สำหรับการศึกษาแบบเต็ม 13,824 โทเคน และไม่มีเวอร์ชันควอนไทซ์ให้เลือก ดังนั้นค่าใช้จ่ายต่อการศึกษาของการรันมันคือตัวเลขที่คุณต้องวัดเอง นั่นเป็นเรื่องปกติสำหรับน้ำหนักโมเดลงานวิจัย และยังเป็นความแตกต่างในทางปฏิบัติที่ใหญ่ที่สุดเพียงหนึ่งเดียวระหว่างทั้งสอง: ตัวหนึ่งมีตารางราคา อีกตัวมีใบเรียกเก็บเงินที่คุณมองไม่เห็นจนกว่าคุณจะจ่ายไปแล้ว
การเปรียบเทียบที่สำคัญจริง ๆ คือต่อหนึ่งการศึกษา ไม่ใช่ต่อโทเค็น การอ่านซีทีเป็นงานหนึ่งหน่วย การปรับรายงานให้เป็นมาตรฐานสำหรับเคสเดียวกันเป็นงานข้อความที่วัดเป็นพันโทเค็น การกำหนดมูลค่าเป็นดอลลาร์ให้กับสิ่งแรกหมายถึงการรู้ฮาร์ดแวร์ของคุณ ส่วนการกำหนดให้กับสิ่งหลังเป็นเพียงเลขคณิต
กับดักที่อยู่ตรงกลางของการเปรียบเทียบ
มีความผิดพลาดเฉพาะอย่างหนึ่งที่ควรค่าแก่การเอ่ยชื่อ เพราะมันเป็นข้อผิดพลาดที่การจับคู่นี้ชักจูงให้เกิด นั่นคือการมองว่า NV-Reason-CT เป็นการไฟน์จูนเฉพาะทางจากโมเดลทั่วไป และจึงสันนิษฐานว่าโมเดลทั่วไปจะใกล้เคียงพอในกรณีส่วนใหญ่และยืดหยุ่นกว่ามาก
มันไม่ใช่ fine-tune มันคือทรานสฟอร์เมอร์เชิงภาพ 3 มิติที่ชื่อ Primus ซึ่งเริ่มต้นจาก COLIPRI ต่อเข้ากับแบ็กโบนภาษาของ Qwen3.5-4B ด้วยการฝังตำแหน่งแบบหมุนหลายแกน 3 มิติ ฝึกบนตัวอย่างคำถาม-คำตอบที่มีโครงสร้างประมาณ 550,000 ตัวอย่างซึ่งดึงมาจากปริมาตร CT 70,111 ชุดจาก CT-RATE, CancerVerse และคอลเลกชัน NIH ภายใน จากนั้นปรับจูนด้วย GRPO เทียบกับรางวัลที่ให้น้ำหนัก F1 ของชุดความผิดปกติที่ 2.0 คะแนนโครงสร้างรายงานเฉพาะบริเวณที่ 0.5 และบทลงโทษความยาวแบบอ่อนที่ 1.0 เอนโคเดอร์สามมิติคือจุดสำคัญของโมเดล ฟรอนต์เอนด์แบบสองมิติหรือแบบอิงสไลซ์เป็นเครื่องมือที่แตกต่างออกไป และการเปรียบเทียบของบทความเองก็แสดงให้เห็นว่าความแตกต่างนั้นมีค่าเท่าใด: MedGemma 1.5 ได้ 0.303 F1 เมื่อป้อนสไลซ์ตามแนวแกนสูงถึง 85 สไลซ์ เทียบกับ 0.614 สำหรับโมเดล volumetric แบบเนทีฟ
ข้อผิดพลาดตรงกันข้ามก็พบได้บ่อยพอ ๆ กัน และมีต้นทุนสูงพอ ๆ กัน: การสันนิษฐานว่าเพราะ NV-Reason-CT เป็นโมเดลเฉพาะทาง คุณจึงควรใช้มันกับงานด้านคลินิกทุกอย่าง มันรองรับเฉพาะทรวงอกและช่องท้องเท่านั้น ไม่รองรับอย่างอื่น การเรียกใช้งานมันทำผ่านไฟล์ NIfTI ไม่ใช่ข้อความแชต และข้อกำหนดสัญญาอนุญาตของมันระบุว่าใช้เพื่อการวิจัยและการศึกษาเท่านั้น มันจะไม่อ่านสไลด์ทางพยาธิวิทยา ไม่ตอบคำถามเกี่ยวกับแนวทางปฏิบัติ หรือเขียนโค้ดที่แปลง DICOM ของคุณแบบเป็นชุด การหยิบโมเดล CT มาใช้งานด้านข้อความก็เป็นข้อผิดพลาดเชิงหมวดหมู่แบบเดียวกับการหยิบโมเดลข้อความมาทำงาน volumetrics เพียงแต่ไปในทิศทางตรงกันข้าม

สองครึ่งนี้เข้ากันในระบบเดียวได้อย่างไร
ทั้งสองโมเดลไม่ได้แทนที่กัน และสถาปัตยกรรมที่สมเหตุสมผลก็ประกอบด้วยทั้งสองแบบ ซึ่งนำไปสู่คำถามเชิงปฏิบัติว่าเราจะเรียกใช้งานมันอย่างไร
Claude Opus 5 ให้บริการผ่าน OrcaRouter ในชื่อ anthropic/claude-opus-5ในราคาตามรายการของผู้ให้บริการของ Anthropic โดยไม่มีการบวกเพิ่มใด ๆ ภายใน API เดียวที่ครอบคลุมมากกว่า 200 โมเดลเรื่องนี้มีความสำคัญน้อยกว่าสำหรับการเรียกใช้งานเพียงครั้งเดียว เมื่อเทียบกับสิ่งที่เกิดขึ้นในไปป์ไลน์โดยรอบ เมื่อครึ่งที่เป็นข้อความของงานเชิงคลินิกเป็นโมเดลหนึ่งในบรรดาตัวเลือกหลายตัว การมีทั้งหมดอยู่หลังคีย์เดียวหมายความว่าคุณสามารถเปรียบเทียบพวกมันบนคลังข้อมูลของคุณเองได้โดยไม่ต้องมีสัญญาฉบับที่สองหรือแก้ไขโค้ด และ DSL สำหรับการกำหนดเส้นทางช่วยให้คุณส่งคำขอแต่ละรายการไปยังโมเดลที่ควรจัดการกับคำขอนั้น ขณะที่ ระบบสำรองอัตโนมัติจะคอยคุ้มครองคุณเมื่อผู้ให้บริการมีประสิทธิภาพลดลง.
NV-Reason-CT ไม่ได้อยู่บนแพลตฟอร์มของเรา และไม่มีโมเดล NVIDIA ใดอยู่บนนั้นด้วย มันเป็นเวตที่คุณดาวน์โหลดไปรันบนฮาร์ดแวร์ของคุณเอง ซึ่งเป็นสิ่งที่สัญญาอนุญาตให้คุณทำได้พอดี และเมื่อพิจารณาว่าอินพุตเป็นข้อมูลเชิงปริมาตรที่ได้จากผู้ป่วย ก็น่าจะเป็นสิ่งที่คุณต้องการอยู่แล้ว เราจะไม่สื่อเป็นนัยว่าเราจัดเส้นทางไปยังโมเดลที่เราไม่ได้โฮสต์ ด้านข้อความของบิลด์คือจุดที่เรามีประโยชน์ ส่วนด้านเชิงปริมาตรคือจุดที่คุณต้องจัดการเองด้วยโมเดล 4.69B และ GPU

คำตัดสินที่ผ่านการตรวจสอบอย่างละเอียดถี่ถ้วน
ถ้าคุณต้องการให้อ่านปริมาตร CT ให้เป็นผลการตรวจที่มีโครงสร้าง มีโมเดลสำหรับงานนั้น มันมาจากกลุ่มวิจัยของ NVIDIA และเป็นการดาวน์โหลดแทนที่จะเป็นการเรียก API ถ้าคุณต้องการคลังรายงานที่ถูกทำให้เป็นมาตรฐาน การเขียนชุดประเมินผล การเขียนสคริปต์งานแปลง DICOM หรือการสรุปกลุ่มตัวอย่าง ก็มีโมเดลสำหรับสิ่งนั้นเช่นกัน และมันมีเรทการ์ด
แนวทางที่ต้องยึดคือ ยังไม่มีหลักฐานว่าฝ่ายใดฝ่ายหนึ่งดีกว่าอีกฝ่ายในเรื่องใด เพราะยังไม่ได้ทำการทดลอง สิ่งที่มีหลักฐานแสดงแล้วคือ อินเทอร์เฟซสามมิติแบบเนทีฟชนะอินเทอร์เฟซแบบอิงสไลซ์บนเบนช์มาร์ก chest-CT สาธารณะด้วยส่วนต่างที่ผู้เขียนประเมินไว้ราวสามคะแนน F1 และโมเดลแนวหน้าทั่วไปได้รับการวัดอย่างอิสระว่าอยู่แถวหน้าสุดของสาขาในงานด้านการให้เหตุผล โค้ด และบริบทยาว นั่นเป็นสองข้อความเกี่ยวกับงานสองอย่างที่ต่างกัน การอ่านสองสิ่งนี้เป็นอันดับคือความผิดพลาดเชิงหมวดหมู่ และมันยังคงอยู่จนกระทั่งมีใครสักคนตีพิมพ์ผลการเปรียบเทียบแบบตัวต่อตัวที่ยังไม่มีใครตีพิมพ์
