การ์ด hero ที่สร้างขึ้น หัวข้อ 'NV-Reason-CT vs Qwen3.8 Max' พร้อมคำบรรยายใต้หัวข้อ 'โมเดล fine-tune และตระกูลที่มันถือกำเนิดมา' มีชิปสามอันเรียงอยู่ด้านล่าง: 'Backbone: Qwen/Qwen3.5-4B', '13,824 โทเคน vs 1,000,000' และ 'ข้อผิดพลาดที่วัดได้ 3.5% vs 0.21%' โลโก้ OrcaRouter ถูกคอมโพสิตไว้มุมขวาล่าง
Guides & Insights

NV-Reason-CT เทียบกับ Qwen3.8 Max: ไฟน์ทูนและตระกูลต้นกำเนิดของมัน

ผู้เขียน

Alistair Wren

วันที่เผยแพร่

โมเดลล่าสุด · 20ดูโมเดลทั้งหมด →
เบนช์มาร์ก: Artificial Analysis · อัปเดตทุกวัน
กลับไปยังโพสต์ทั้งหมด

บรรทัดแรกของNV-Reason-CT การ์ดโมเดลบอกอะไรบางอย่างที่คนส่วนใหญ่ข้ามผ่านไป โมเดลฐานคือ Qwen/Qwen3.5-4B ซึ่งระบุไว้ในเมทาดาทาของที่เก็บข้อมูลว่าเป็นความสัมพันธ์แบบไฟน์จูน ดังนั้นเมื่อ NVIDIA ต้องการโมเดลภาษามาสวมเข้ากับ Primus 3D วิชันทรานส์ฟอร์เมอร์ จึงเลือก Qwe​n มา เปรียบเทียบเช็กพอยต์นั้นกับ Qwen3.8 Max — เรือธง 1,000,000 โทเคนของ Aliba​ba เอง ที่วางจำหน่ายเมื่อวันที่ 3 สิงหาคม 2026 — แล้วคุณกำลังมองดูไฟน์จูนกับธุรกิจครอบครัวอยู่ อันหนึ่งเป็นผู้เชี่ยวชาญขนาด 4.69B ที่อ่านปริมาตร CT ทรวงอกและช่องท้อง และเผยแพร่ไปยัง Hugging Face เมื่อวันที่ 8 กันยายน 2026 โดยไม่มีการประกาศ อีกอันหนึ่งเป็นเรือธงทั่วไปที่มีอินพุตข้อความ รูปภาพ และวิดีโอ มีตารางราคาที่เผยแพร่ และมีปริมาณการรับส่งข้อมูลที่วัดได้ 37.2 ล้านโทเคนบนเครือข่ายของเราในสัปดาห์ที่ผ่านมา คำถามที่น่าสนใจไม่ใช่ว่าอันไหนชนะ แต่เป็นว่าไฟน์จูนขนาด 4B ทำอะไรได้บ้างที่เรือธงในตระกูลเดียวกันทำไม่ได้ และทำไมคำตอบจึงเฉพาะเจาะจงกว่าที่คุณคาดคิด

การปรับละเอียดซื้ออะไรมา อย่างเป็นรูปธรรม

การวางกรอบช่องว่างของ NVIDIA เองนั้นแม่นยำอย่างผิดปกติ และมันเป็นประโยคที่มีประโยชน์ที่สุดในคลังเก็บโค้ดนี้: ระบบ vision-language ส่วนใหญ่ "ไม่ก็ทำงานบนภาพ 2D หรือไม่ก็บีบอัดคุณลักษณะเชิงปริมาตรก่อนการถอดรหัสภาษา" นั่นคือคำอธิบายของแบบจำลองทั้งคลาส และมันครอบคลุมเรือธงมัลติโมดัลทั่วไปทุกรุ่นในตลาด

การแก้ไขนี้เป็นเชิงสถาปัตยกรรมมากกว่าที่จะเป็นเรื่องของขนาด ปริมาตรอินพุตขนาด 384×384×384 มม. กลายเป็นกริดขนาด 24×24×24 ที่มีโทเคนภาพ 13,824 โทเคน โทเคนเหล่านั้นและพิกัดสามมิติของมันจะเข้าสู่แบบจำลองภาษาโดยไม่มีการลดตัวอย่างเชิงพื้นที่ และ 3D MRoPE รักษาความสัมพันธ์เชิงพื้นที่ภายในตัวถอดรหัส ปริมาตรอินพุตจะถูกครอปแบบรับรู้กายวิภาคไปยังทรวงอกหรือช่องท้องโดยใช้หน่วย Hounsfield ของปอด จากนั้นรีแซมเปิลเป็นความละเอียดไอโซทรอปิก 2 มม.

ลองอ่านสิ่งนั้นเทียบกับสิ่งที่ Qwen3.8 Max ยอมรับ ข้อความ รูปภาพ และวิดีโอ — และวิดีโอคือสิ่งที่ใกล้เคียงที่สุดในซีรีส์นี้กับอินพุตเชิงปริมาตร ซึ่งทำให้มันเป็นจุดเปรียบเทียบที่ตรงไปตรงมามากกว่าจะเป็นการเปรียบเทียบเชิงวาทศิลป์ วิดีโอคือสแต็กของเฟรม 2D ที่เรียงลำดับตามเวลา ปริมาตร CT คือสแต็กของสไลซ์ 2D ที่เรียงลำดับตามตำแหน่งทางกายภาพตามแนวแกน z ในหน่วย Hounsfield โดยมีระยะห่างเป็นมิลลิเมตรที่ทราบค่า ทั้งสองเป็นอาร์เรย์สามมิติ มีเพียงหนึ่งในนั้นที่มีระบบพิกัดทางกายภาพที่สามารถระบุตำแหน่งสิ่งที่รังสีแพทย์ตรวจพบได้ และมีเพียงหนึ่งในนั้นที่วัดในหน่วยที่มีความหมายนอกเหนือจากเซ็นเซอร์ภาพ โมเดลที่ฝึกบนวิดีโอเรียนรู้ความต่อเนื่องเชิงเวลา โมเดลที่ฝึกบนปริมาตร CT เรียนรู้ว่าก้อนเนื้อในสไลซ์หนึ่งคือก้อนเนื้อเดียวกันในสไลซ์ถัดไปที่ต่ำลงแปดมิลลิเมตร

คลังข้อมูลสำหรับฝึกคือความแตกต่างที่แท้จริง

นี่คือจุดที่โมเดลทั้งสองไม่สามารถนำมาเปรียบเทียบกันได้อีกต่อไปโดยสิ้นเชิง และเป็นส่วนที่สเปกชีตปกปิดไว้

NV-Reason-CT ได้รับการฝึกแบบ end-to-end ด้วย supervised fine-tuning ตามด้วย Group Relative Policy Optimization บนตัวอย่าง QA ที่มีโครงสร้างประมาณ 550,000 ตัวอย่าง ซึ่งดึงมาจากปริมาตร CT ที่ไม่ซ้ำกัน 70,111 ปริมาตร แหล่งข้อมูล ได้แก่ CT-RATE — 47,149 เคสจาก Istanbul Medipol University Mega Hospital พร้อมรายงานรังสีวิทยาที่จับคู่กัน — ชุดข้อมูลภายในของ NIH จำนวน 15,991 เคส และเคสของ CancerVerse จำนวน 22,720 เคส ครอบคลุมสี่ระยะการฉีดสารทึบรังสีและเนื้องอกร้าย 13 ชนิด คลังข้อมูลนี้ประกอบด้วยรายงานมาตรฐาน, QA ที่มุ่งเน้นความผิดปกติ, บทสนทนาแบบหลายรอบ และเหตุผลที่เขียนโดยรังสีแพทย์ซึ่งถอดความจากบันทึกการตีความของผู้เชี่ยวชาญ ขั้นตอน GRPO ใช้รางวัลที่ตรวจสอบได้กับชุดความผิดปกติของทรวงอกและช่องท้อง ซึ่งหมายความว่าสัญญาณรางวัลจะตรวจสอบว่าสิ่งที่พบที่ระบุไว้นั้นมีอยู่ในปริมาตรหรือไม่ แทนที่จะดูว่าถ้อยความเรียงฟังดูเป็นทางคลินิกหรือไม่

ชุดข้อมูลฝึกของ Qwen3.8 Max ไม่ได้ถูกเปิดเผยในระดับรายละเอียดแบบนั้น และต่อให้เปิดเผยก็ไม่ช่วย เพราะความสามารถที่เป็นเป้าหมายนั้นเป็นความสามารถทั่วไป ตัวเลขจาก Artificial Analysis ต่างหากที่เป็นหลักฐานที่เกี่ยวข้อง ได้แก่ ดัชนี Intelligence Index ที่ 45.4 ทำให้อยู่อันดับ 15 จาก 145 โมเดลในสแนปช็อต API ของเรา, AA Coding 76.2 อยู่อันดับ 9, Terminal-Bench 2.1 ที่ 88.8, GPQA Diamond 92.8, Humanity's Last Exam 43.1, SciCode 52.1 และความแม่นยำในการเรียกคืนบริบทแบบยาว 80.3 นี่เป็นการวัดโดยบุคคลที่สาม ไม่ใช่คำกล่าวอ้างของผู้ขาย ซึ่งทำให้ตัวเลขเหล่านี้เป็นตัวเลขที่น่าเชื่อถือที่สุดในทั้งสองด้านของหน้านี้

ผลลัพธ์การให้เหตุผล, สัญญาที่แตกต่างกันสองฉบับ

โมเดลทั้งสองสร้างร่องรอยการให้เหตุผล และทั้งคู่ก็ให้คุณปิดมันได้ ความคล้ายคลึงกันสิ้นสุดเพียงที่อินเทอร์เฟซ

Qwen3.8 Max เปิดให้เข้าถึง enable_thinking และ reasoning_effort พร้อมด้วยความสามารถด้านการสุ่มแบบครบถ้วน — temperature, top_p, seed, penalties, structured outputs, tool calling มันเป็นความสามารถในการใช้เหตุผลทั่วไปที่คุณนำไปใช้กับสิ่งใดก็ตามที่คุณมี การคิดของมันจะดีเท่ากับปัญหาที่คุณมอบให้ และมันไม่มีวิธีตรวจสอบคำกล่าวอ้างกับสิ่งอื่นใดได้ นอกเหนือจากข้อความที่มันได้รับ

การให้เหตุผลของ NV-Reason-CT มีข้อตกลงกับผู้อ่านที่แคบกว่า และการ์ดโมเดลระบุขีดจำกัดไว้อย่างชัดเจนว่า การให้เหตุผลที่สร้างขึ้นเป็น "เอาต์พุตของโมเดลที่ตรวจสอบได้ และไม่ได้รับประกันว่าจะเป็นตัวแทนของการคำนวณภายในของโมเดล" ข้อแม้นั้นมีบทบาทจริง และเป็นประโยคแบบที่ปรากฏขึ้นเพียงเมื่อทีมได้คิดแล้วว่าคลินิเชียนจะทำอะไรกับร่องรอยที่ฟังดูสมเหตุสมผล การ์ดนี้อธิบายเอาต์พุตว่าเป็นข้อสังเกตที่ตรวจสอบได้ การวินิจฉัยแยกโรค และความไม่แน่นอน พูดอีกนัยหนึ่ง คือร่องรอยที่คุณตรวจเทียบกับภาพปริมาตรได้ แทนที่จะเป็นร่องรอยที่คุณอ่านได้เท่านั้น

ปริมาณงานที่ส่งผ่าน จากจุดเดียวที่เราสามารถวัดได้

ในช่วงเจ็ดวันที่ผ่านมา Qwen3.8 Max ส่งโทเคน 37.2 ล้านโทเคนผ่าน playground ของ OrcaRouter เอง ค่ามัธยฐานเวลาถึงโทเคนแรกอยู่ที่ 1.96 วินาที ซึ่งถือว่าเร็วที่สุดในบรรดาโมเดลในซีรีส์นี้อย่างสบาย ๆ ที่อัตรา 53.3 โทเคนเอาต์พุตต่อวินาที อัตราข้อผิดพลาดในช่วงเวลาดังกล่าวอยู่ที่ 3.5%

ตัวเลขสองตัวนั้นดึงไปคนละทาง และทั้งคู่ก็สำคัญ ความหน่วงนั้นยอดเยี่ยมมาก และทำให้การวนซ้ำพัฒนากับโมเดลเป็นเรื่องน่าพอใจ อัตราข้อผิดพลาดสูงกว่าประมาณสิบเจ็ดเท่าเมื่อเทียบกับ 0.21% ของ Kimi K3 ในช่วงเวลาเดียวกัน และนั่นคือตัวเลขที่ตัดสินว่าคุณจะวางมันไว้เบื้องหลังการเรียกแบบซิงโครนัสที่ผู้ใช้เห็นโดยตรง หรือเป็นงานแบบแบตช์ที่มีการลองใหม่ นี่คือพฤติกรรมที่วัดได้จริงบนเครือข่ายของเรา ไม่ใช่การทดสอบ benchmark และเป็นสิ่งประเภทที่ตารางเรตไม่เคยบอกคุณ

NV-Reason-CT ไม่มีการวัดค่าใดที่เทียบเท่าได้เลยสักแห่ง มันเป็นเช็กพอยต์ BF16 ขนาด 10.6 GB พร้อมโค้ดโมเดลแบบกำหนดเอง โหลดด้วย trust_remote_code=Trueบนฮาร์ดแวร์ Ampere, Hopper หรือ Lovelace ทดสอบโดย NVIDIA บน H100 และ L40S ไม่มีการเผยแพร่ค่า p50 ไม่มีอัตราความผิดพลาด และไม่มีตัวเลขปริมาณงาน (throughput) ใด ๆ ใครก็ตามที่บอกคุณว่าปริมาณการใช้งาน ณ จุดตัดที่การโฮสต์เองจะคุ้มกว่าการจ่ายต่อโทเคนนั้นกำลังเดาเอา

ราคาและรูปทรง เคียงข้างกัน

• ราคา — NV-Reason-CT ค่าใช้จ่ายฝ่ายทุน GPU, ไม่มีอัตราต่อโทเค็น เทียบกับ Qwen3.8 Max $2.00 / $6.00 ต่อล้านโทเค็น, $0.25 สำหรับอ่านแคช, $2.50 สำหรับเขียนแคช

• อินพุต — ปริมาตร CT 3D NIfTI ของ NV-Reason-CT ในหน่วย Hounsfield เฉพาะทรวงอกหรือช่องท้อง เทียบกับ Qwen3.8 Max แบบข้อความ รูปภาพ และวิดีโอ

• บริบท — NV-Reason-CT หนึ่งวอลุ่ม, พรีฟิกซ์คงที่ 13,824 โทเคน เทียบกับ Qwen3.8 Max 1,000,000 โทเคน

• พารามิเตอร์ — NV-Reason-CT รวม 4.69B / ใช้งาน 4.35B ในเส้นทาง CT เทียบกับ Qwen3.8 Max ที่ไม่เปิดเผย

• สัญญาอนุญาต — NV-Reason-CT OpenMDW-1.1 เผยแพร่น้ำหนักโมเดลแล้ว vs Qwen3.8 Max เป็นกรรมสิทธิ์เฉพาะ เข้าถึงได้ผ่าน API เท่านั้น

• คะแนนอิสระ — NV-Reason-CT ไม่มี เทียบกับ Qwen3.8 Max AA Intelligence Index 45.4, GPQA Diamond 92.8

A generated scoreboard titled 'NV-Reason-CT vs Qwen3.8 Max - the scoreboard'. Left column 'NV-Reason-CT': Price GPU capex, no per-token rate; Input 3D NIfTI CT, chest or abdomen; Context one volume, 13,824-token prefix; Parameters 4.69B total / 4.35B active; Licence OpenMDW-1.1, weights published; Independent score none published. Right column 'Qwen3.8 Max': Price $2.00 / $6.00, $0.25 cached read; Input text, image and video; Context 1,000,000 tokens; Parameters undisclosed; Licence proprietary, API only; Independent score AA Index 45.4, GPQA Diamond 92.8. A footer reads 'Qwen3.8 Max scores per Artificial Analysis; NV-Reason-CT figures are the authors' own, from the model card.'

เศรษฐศาสตร์แคชของ Qwen3.8 Max เอื้อต่อรูปแบบการใช้งานเฉพาะ: การอ่านจากแคชราคา $0.25 เมื่อเทียบกับอินพุตใหม่ราคา $2.00 นับเป็นส่วนลดแปดเท่า และการเขียนแคชราคา $2.50 หมายความว่าคำนำหน้าที่ใช้ซ้ำได้แบบยาวจะคืนทุนอย่างรวดเร็ว นั่นคือภาระงานของพรอมต์ระบบบวกกับเอกสารโปรโตคอลที่ใช้ซ้ำในคำขอหลายพันรายการ NV-Reason-CT มีโปรไฟล์ต้นทุนที่ตรงกันข้าม — ต้นทุนส่วนเพิ่มเกือบเป็นศูนย์ต่อการสแกนหนึ่งครั้งเมื่อซื้อ GPU แล้ว และมีพื้นขั้นต่ำที่ตายตัวคือ GPU หนึ่งตัวที่ต้องถือไว้อย่างไม่มีกำหนด

A screenshot of NVIDIA's Hugging Face model page for NV-Reason-CT, showing the model card header with Like 1 and 0 followers, the Image-Text-to-Text and Transformers and Safetensors tags, the qwen3_5, medical-imaging, ct, 3d-vlm and custom_code tags, 'Downloads last month 210', the 5B-parameter BF16 size row, the model description describing the 384x384x384-mm volume becoming a 24x24x24 grid of 13,824 visual tokens with no spatial downsampling, the training paragraph citing roughly 550,000 structured QA examples from 70,111 unique CT volumes, a side panel showing Base model Qwen/Qwen3.5-4B and the CT-RATE and CancerVerse datasets, and the arXiv 2609.27511 paper link.

ช่วยกันดูแลครอบครัว

สถาปัตยกรรมที่เป็นธรรมชาติตรงนี้ และควรกล่าวไว้ว่ายังไม่มีใครเผยแพร่มัน คือโมเดลไฟน์จูนสำหรับงานปริมาณมาก และโมเดลเรือธงสำหรับทุกอย่างรอบ ๆ NV-Reason-CT สร้างข้อค้นพบที่มีโครงสร้าง; Qwen3.8 Max จัดการข้อความส่งต่อ การจับคู่โปรโตคอล การลงรหัส จดหมายติดตามผล — งานข้อความปริมาณมากที่หน้าต่างหนึ่งล้านโทเคนและส่วนลดแคชแปดเท่าคุ้มค่ากับการมีอยู่จริง ๆ

ถ้านั่นคือไปป์ไลน์ของคุณ ครึ่งหนึ่งของมันคือเช็กพอยต์ที่คุณโฮสต์เอง และอีกครึ่งหนึ่งคือโทเค็นที่คุณซื้อ และครึ่งหลังนี้เองที่เราเตอร์ทำในสิ่งที่เอนด์พอยต์ของผู้ให้บริการรายเดียวทำไม่ได้ Qwen3.8 Max ให้บริการผ่าน OrcaRouter ในราคาตามที่ Alibaba ประกาศ โดยไม่บวกเพิ่ม ดังนั้นราคา $2.00 / $6.00 ข้างต้นคือสิ่งที่คุณจ่าย และการปรับราคาในอนาคตจะปรากฏในบิลของคุณในวันเดียวกัน ไม่ใช่รอถึงรอบต่ออายุ การสลับไปยังผู้ให้บริการรายอื่นโดยอัตโนมัติจึงสำคัญกว่าปกติ เมื่ออัตราความผิดพลาดที่วัดได้ของโมเดลเองอยู่ที่ 3.5% — การลองใหม่ที่ไปยังเอนด์พอยต์อื่นที่ยังทำงานปกติ คือความแตกต่างระหว่างปัญหาชั่วคราวเล็กน้อยกับการที่แบตช์ล้มเหลว และเนื่องจากครึ่งที่เป็นโมเดลทั่วไปของไปป์ไลน์คือชื่อโมเดลหนึ่งที่อยู่หลังเอนด์พอยต์ที่เข้ากันได้กับ OpenAI ซึ่งครอบคลุมกว่า 200 โมเดล การสลับไปใช้อย่างอื่นเพื่อทดลองสักหนึ่งสัปดาห์จึงมีค่าแค่การเปลี่ยนสตริง ไม่ใช่การอินทิเกรต

NV-Reason-CT พูดให้ชัดเจนนะ ไม่ได้อยู่บน OrcaRouter และจะไม่มีทางอยู่ — มันคือการทำ inference 3D ด้วยโค้ดเฉพาะทางที่คุณรันเอง เวอร์ชันที่ตรงไปตรงมาของเรื่องราวการผสานรวมคือ specialist ที่โฮสต์เองกับ generalist ที่ถูก route นั้นสามารถอยู่ภายใต้คีย์เดียว และนั่นคือทั้งหมดของข้อกล่าวอ้าง

A screenshot of the OrcaRouter model page for Qwen3.8 Max, showing the identifier qwen/qwen3.8-max, input text + image + video, output text, the Vision, Tools, JSON and Reasoning badges, a 1,000,000-token context window with a p50 time to first token of 1.96 seconds, the description of it as Alibaba's newest flagship positioned against GPT-5.5, Claude Opus 4.7 and Gemini 3.1 Pro, OpenAI-compatible code samples pointing at https://api.orcarouter.ai/v1, and a stat strip reading $2.00 per million input tokens, $6.00 per million output tokens and 37.2M tokens of seven-day traffic.

คำตัดสินที่ยังคงมีผลจริง

การจับคู่นี้ถูกจัดไว้ใต้หัวข้อ "อันไหนดีกว่า" และมันก็ไม่ควรเป็นเช่นนั้น Qwen3.8 Max ถูกวัดโดยบุคคลที่สามในด้านการให้เหตุผลทั่วไป และเอาชนะคู่แข่งส่วนใหญ่ในวงการ ส่วน NV-Reason-CT มีเพียงตารางเดียวที่เป็นตัวเลขของตัวเองบนเบนช์มาร์ก CT เพียงหนึ่งรายการ และมีจำนวนพารามิเตอร์ 4.69B ซึ่งจะถือว่าไม่น่าสนใจเลยในการเปรียบเทียบทั่วไป บนเบนช์มาร์กทั่วไปใด ๆ เรือธงย่อมชนะ และเหตุผลก็คือเบนช์มาร์กทั่วไปคือสิ่งที่มันถูกสร้างขึ้นมาเพื่อ

สำหรับงานเดียวที่ NV-Reason-CT ถูกสร้างขึ้นมาเพื่อทำ — การอ่านภาพ CT ทรวงอกหรือช่องท้องแบบปริมาตร แล้วบอกว่ามีอะไรอยู่ในนั้น พร้อมร่องรอยที่ใครสักคนตรวจสอบได้ — Qwen3.8 Max ไม่ใช่คู่แข่งที่อ่อนกว่า มันไม่มีตัวเข้ารหัสเชิงปริมาตร จึงไม่สามารถรันบนอินพุตได้เลย หากไม่มีใครมาตัดสินใจก่อนว่าจะแบนสแกนให้เป็นภาพอย่างไร การตัดสินใจนั้นคือจุดที่ข้อมูลเชิงพื้นที่สูญหายไป นั่นคือประเด็นทั้งหมดของการ fine-tune ขนาด 4B ที่มีเส้นทาง 3D แบบเนทีฟและพรีฟิกซ์คงที่ขนาด 13,824 โทเคน และนี่คือเหตุผลว่าทำไมสิ่งที่น่าสนใจของโมเดลนี้จึงเป็นความเล็กของแบ็กโบน แทนที่จะเป็นขนาดของมัน

© 2026 OrcaRouter

สำหรับผู้ให้บริการ

ให้บริการแพลตฟอร์มการอนุมานอยู่หรือไม่ นำโมเดลของคุณขึ้น OrcaRouter

providers@orcarouter.ai

เข้าร่วมคอมมูนิตี้ของเรา

Discordsupport@orcarouter.aiXGitHubYouTube