การ์ดฮีโร่ที่สร้างขึ้นชื่อ 'NV-Reason-CT vs Gemini 3.1 Pro' พร้อมคำโปรย 'พื้นผิวอินพุตที่กว้างที่สุด และยังไม่ใช่เครื่องอ่าน CT' การ์ดสองใบที่หันหน้าเข้าหากันถูกคั่นด้วยลูกศรสีน้ำเงินคู่หนึ่ง: การ์ดซ้ายมีป้ายกำกับว่า 'NV-Reason-CT' พร้อมไอคอนสแกนร่างกาย และ 'เฉพาะทรวงอกและช่องท้อง - 13,824 โทเคนภาพต่อปริมาตร - OpenMDW-1.1'; การ์ดขวามีป้ายกำกับว่า 'Gemini 3.1 Pro' พร้อมไอคอนชิป และ 'อินพุตเสียง วิดีโอ รูปภาพ ไฟล์ ข้อความ - บริบท 1M - ระดับพรีวิว' โลโก้ OrcaRouter ถูกคอมโพสิตไว้ที่มุมขวาล่าง
Guides & Insights

NV-Reason-CT กับ Gemini 3.1 Pro: พื้นผิวอินพุตที่กว้างที่สุด และก็ยังไม่ใช่เครื่องอ่าน CT

ผู้เขียน

Magnus Corvin

วันที่เผยแพร่

โมเดลล่าสุด · 20ดูโมเดลทั้งหมด →
เบนช์มาร์ก: Artificial Analysis · อัปเดตทุกวัน
กลับไปยังโพสต์ทั้งหมด

เก้าสิบสี่เปอร์เซ็นต์ นั่นคืออัตราข้อผิดพลาดที่แค็ตตาล็อกของเราเองบันทึกอยู่ในปัจจุบันสำหรับหนึ่งเส้นทางที่ให้บริการ Gemini 3.1 Pro — 93.93% พร้อมกับค่ามัธยฐานเวลาถึงโทเคนแรกที่อ่านได้เหมือนเพดานสิบวินาที และตัวเลขปริมาณงาน 978 โทเคนต่อวินาที อ่านสิ่งนั้นเป็นข้อความเกี่ยวกับโมเดล แล้วคุณจะได้ข้อสรุปที่ผิดถนัด อ่านมันเป็นข้อความเกี่ยวกับระดับพรีวิวที่อยู่ภายใต้โหลด แล้วมันจะกลายเป็นสิ่งที่มีประโยชน์ที่สุดบนหน้านี้ เพราะนั่นคือสิ่งที่ไปป์ไลน์ทางคลินิกประสบจริงเมื่อต้องพึ่งพาเส้นทางที่ยังไม่ได้จัดสรรสำหรับทราฟฟิกโปรดักชัน

โมเดลอีกฝั่งของการเปรียบเทียบนี้ไม่มีปัญหาดังกล่าว และไม่มีการวัดเช่นนั้น NV-Reason-CTเป็นตัวให้เหตุผล 3D CT แบบเนทีฟขนาด 4.69 พันล้านพารามิเตอร์ของ NVIDIA ดาวน์โหลดได้ภายใต้ OpenMDW-1.1 โดยไม่มีตัวเลขปริมาณงานที่เผยแพร่เลยแม้แต่ค่าเดียว และไม่มีการโฮสต์ที่ใดเลย ดังนั้นฝั่งหนึ่งของการจับคู่นี้ให้พื้นผิวอินพุตที่กว้างที่สุดในวงการ พร้อมโปรไฟล์ความพร้อมใช้งานที่คุณต้องออกแบบรองรับ ส่วนอีกฝั่งให้ความสามารถแคบ ๆ เพียงอย่างเดียว พร้อมความหน่วงที่คุณต้องวัดด้วยตัวเอง ทั้งสองฝั่งไม่มีแดชบอร์ดตรวจสอบที่คุณไว้วางใจได้ตั้งแต่วันแรก และด้วยเหตุผลที่ตรงกันข้าม

สองโมเดล สองนิยามของ “มัลติโมดัล”

คำนี้ทำงานหนักมากในคำอธิบายผลิตภัณฑ์ทั้งสอง และแทบไม่มีส่วนใดที่ใช้ร่วมกันเลย

• อินพุตที่รองรับ — Gemini 3.1 Pro รองรับข้อความ รูปภาพ เสียง วิดีโอ และไฟล์; NV-Reason-CT รับปริมาตร NIfTI แบบช่องสัญญาณเดียวในหน่วย Hounsfield และไม่มีอย่างอื่น

• ความหมายของ "3D" — NV-Reason-CT รีแซมเปิลเป็น 2 มม. ไอโซโทรปิกบนลูกบาศก์ขนาด 384 มิลลิเมตร และตัดเป็นแพตช์ขนาด 8 x 8 x 8 สำหรับกริดขนาด 24 x 24 x 24; อินพุตวิดีโอของ Gemini 3.1 Pro เป็นลำดับของเฟรมสองมิติพร้อมไทม์ไลน์

• บริบท — 1,048,576 โทเค็นขาเข้าและ 65,536 ขาออกสำหรับ Gemini 3.1 Pro; หนึ่งวอลุ่มคือ 13,824 โทเค็นภาพสำหรับ NV-Reason-CT โดยไม่มีการดาวน์แซมปลิงและไม่มีเลเยอร์การรวม และไม่มีหน้าต่างแชตล้อมรอบมัน

• เปิดตัว — 19 กุมภาพันธ์ 2026 สำหรับ Gemini 3.1 Pro บน preview slug; การปล่อยงานวิจัยที่ไม่ประกาศล่วงหน้าสำหรับ NV-Reason-CT โดยมีกิจกรรมในรีโพซิทอรีลงวันที่ 2 ถึง 25 กันยายน 2026

• ราคา — $2 และ $12 ต่อล้านโทเค็น จนถึง 200,000 โทเค็น จากนั้น $4 และ $18 โดยการอ่านแคชอยู่ที่ $0.20 และการเขียนแคชอยู่ที่ $0.375 เทียบกับเวทที่โฮสต์เองซึ่งไม่มีตารางราคา

• ความสามารถ — การมองเห็น เสียง การใช้เครื่องมือ เอาต์พุต JSON และการให้เหตุผลสำหรับ Gemini 3.1 Pro; ผลการวิเคราะห์แบบมีโครงสร้างตามบริเวณทางกายวิภาคสำหรับ NV-Reason-CT โดยไม่ใช้เครื่องมือ

• ใบอนุญาตและสถานะ — API พรีวิวแบบโฮสต์; เทียบกับเวต OpenMDW-1.1 ซึ่งการ์ดโมเดลระบุว่าใช้เพื่อการวิจัยและการศึกษาเท่านั้น และระบุไว้อย่างชัดเจนว่าไม่ใช่อุปกรณ์ทางการแพทย์

อินพุตวิดีโอและอินพุต CT แบบปริมาตรดูอยู่ติดกันเมื่อมองจากระยะไกล แต่เมื่อมองใกล้กลับแตกต่างกันสุดขั้ว วิดีโอคือเฟรมต่าง ๆ เมื่อเวลาผ่านไป การศึกษา CT คือปริมาตรคงที่หนึ่งเดียวที่มีแกนเชิงพื้นที่สามแกน มีสเกลทางกายภาพเป็นมิลลิเมตร และมีหน่วยความหนาแน่นที่ปรับเทียบแล้ว โดยสิ่งที่ถูกวัดคือความหนาแน่นของโครงสร้างที่ขนาดมีความสำคัญ Gemini 3.1 Pro จะดูบันทึกการผ่าตัดและอธิบายว่าเกิดอะไรขึ้น มันจะไม่วัดก้อนเนื้อ นั่นไม่ใช่ข้อจำกัดที่ Google ล้มเหลวในการแก้ไข แต่เป็นปัญหาที่แตกต่างออกไปซึ่งยังไม่มีใครแก้ได้ด้วยโมเดลทั่วไป

สิ่งที่บันทึกผลการทดสอบมาตรฐานทั้งสองฉบับครอบคลุม และสิ่งที่ละเว้นไว้

Gemini 3.1 Pro มีบันทึกที่เป็นอิสระ และเป็นบันทึกที่ดีในแกนที่มันวัด

• GPQA Diamond — 94.1 ซึ่งเป็นตัวเลขสูงสุดในบทความทั้งชุดนี้

• Humanity's Last Exam — 47 โดยมีคะแนนการเรียกคืนบริบทแบบยาวอยู่ที่ 82 และสูงที่สุดในการเปรียบเทียบนี้เป็นอีกครั้ง

• IFBench และ SciCode — 77.14 และ 58.7

• τ²-Bench — 95.61 โดยมี tau_banking อยู่ที่ 21.44 และ Terminal-Bench Hard อยู่ที่ 53.79

• Artificial Analysis Intelligence และ Coding — 29.7 และ 68.8

• เวลาแฝงที่วัดได้ — ค่ามัธยฐานสิบวินาทีถึงโทเคนแรก ซึ่งดูเหมือนว่าจะเป็นเพดานจำกัดมากกว่าค่ามัธยฐานจริง ที่ 978 โทเคนต่อวินาที และอัตราข้อผิดพลาด 93.93%

สังเกตโครงร่างของสิ่งนั้นสิ: โปรไฟล์ด้านความรู้และบริบทยาวอยู่ข้างบนของการเปรียบเทียบ ดัชนีความฉลาดอยู่แถวกลางค่อนล่าง และการวัดความพร้อมใช้งานที่ใช้ไม่ได้จริง ทั้งสามอย่างอธิบายโมเดลเดียวกันบนเส้นทางเดียวกัน GPQA Diamond ที่สูงหมายความว่ามันรู้เรื่องราวมากมาย คอมโพสิต 29.7 หมายความว่ามันไม่ได้นำในทุกเรื่อง อัตราความผิดพลาด 93.93% หมายความว่าบนเส้นทางเฉพาะเส้นนี้ คำขอส่วนใหญ่ของคุณจะไม่สำเร็จ — และนั่นเกือบจะแน่นอนว่าเป็นข้อเท็จจริงเรื่องขีดความสามารถและการจัดสรรทรัพยากรของปลายทางแบบพรีวิว มากกว่าจะเป็นคุณสมบัติของน้ำหนักโมเดล เราไม่อาจพิสูจน์ได้จากภายนอกว่าอันไหนกันแน่ สิ่งที่พูดได้คือ ไม่มีตัวเลขทั้งสามตัวนั้นตัวใดพิมพ์ผิด และสถาปัตยกรรมใดก็ตามที่อ่านแค่ตัวแรกจะเจอสัปดาห์ที่ย่ำแย่แน่นอน

สถิติของ NV-Reason-CT นั้นแคบกว่าและมาพร้อมข้อแม้ที่แตกต่างออกไป ค่า F1 0.614 และ AUROC 0.871 ของมันบน CT-RATE ทั่วสิบแปดป้ายกำกับ ด้วยเกณฑ์คงที่แบบเดียวกัน และพรอมป์ต์ใช่/ไม่ใช่โดยตรง โดยไม่มีหัวจำแนกประเภทหรือการปรับให้เข้ากับงานเฉพาะ เป็นตัวเลขของ NVIDIA เองจากบทความของ NVIDIA เอง ชุดเปรียบเทียบที่อยู่เบื้องหลัง — VoxelFM ที่ 0.581, Pillar-0 ที่ 0.544, ClinFusion-8B ที่ 0.442, CT-CLIP ที่ 0.398, Merlin ที่ 0.358, MedGemma 1.5 ที่ 0.303 — มีเพียงโมเดลด้านภาพเท่านั้น ไม่มีโมเดลมัลติโมดัลทั่วไปปรากฏอยู่ ซึ่งหมายความว่าคำถามที่ว่า "Gemini 3.1 Pro จะทำได้อย่างไรบน CT-RATE" ยังไม่ถูกถาม ยิ่งไม่ต้องพูดถึงการตอบ

A generated scoreboard titled 'Breadth on one side, depth on the other' with two columns. The left column, headed 'Gemini 3.1 Pro', lists six rows: inputs, text, image, audio, video, file; context, 1,048,576 in and 65,536 out; GPQA Diamond 94.1; AA Intelligence 29.7; route reliability, 93.93% measured error rate; price, $2 and $12 per million tokens, doubling past 200k. The right column, headed 'NV-Reason-CT', lists six rows: input, one-channel NIfTI in Hounsfield units; context, 13,824 visual tokens per volume, no chat window; CT-RATE F1 0.614 and AUROC 0.871; provenance, the authors paper only; route reliability, not applicable, self-hosted; price, no rate card, no published throughput. A footer reads 'The 93.93% error rate describes a preview route under load, not the quality of the weights.'

ปัญหาระดับพรีวิว เมื่อว่ากันให้ถูกต้อง

นี่คือส่วนของการเปรียบเทียบที่ไม่ได้เกี่ยวข้องอะไรกับ CT เลย แต่เกี่ยวข้องทั้งหมดกับการดำเนินการใด ๆ ทางคลินิก

อัตราข้อผิดพลาด 93.93% ไม่ใช่การเสื่อมประสิทธิภาพเพียงเล็กน้อย แต่มันคือเส้นทางที่การเรียกส่วนใหญ่ล้มเหลวอย่างท่วมท้น ปฏิกิริยาตามธรรมชาติคือการประกาศว่าโมเดลนี้ใช้งานไม่ได้ และปฏิกิริยานั้นผิดด้วยเหตุผลสองประการ ประการแรก อัตราข้อผิดพลาดที่วัดบน endpoint แบบ preview สะท้อนความจุ โควตา และการกำหนดเส้นทางระดับภูมิภาค ไม่ใช่ความสามารถของโมเดล ระดับ preview ของ Google ขึ้นชื่อว่าถูกจัดสรรสำหรับการประเมินมากกว่าการใช้งานจริง และ slug ที่ตั้งชื่อตาม preview ก็เป็น slug ที่อาจถูกจำกัดอัตราได้โดยไม่แจ้งให้ทราบ ประการที่สอง การวัดนั้นเป็นภาพชั่วขณะของเส้นทางหนึ่ง ณ ช่วงเวลาหนึ่ง มันจะเปลี่ยนไป สิ่งที่จะไม่เปลี่ยนคือบทเรียน: การพึ่งพาเส้นทาง preview คือการพึ่งพาการตัดสินใจเรื่องความจุที่คนอื่นเป็นผู้ทำ

มาตรการบรรเทาเหล่านั้นไม่หรูหรา และเป็นเหตุผลทั้งหมดที่ทำให้การจัดเส้นทางดำรงอยู่เป็นสาขาวิชา มากกว่าจะเป็นเพียงความสะดวก

• อย่าฮาร์ดโค้ด slug พรีวิวลงในพาธโปรดักชัน — วางความสามารถไว้หลังอินเทอร์เฟซ เพื่อให้โมเดลที่อยู่เบื้องหลังสามารถสลับได้โดยไม่ต้องดีพลอย

• ลองใหม่และสลับไปใช้ผู้ให้บริการรายอื่นหรือโมเดลอื่น — สำหรับงานสกัดข้อมูลแบบเป็นชุด อัตราความล้มเหลว 94% ยังพอรับมือได้หากความล้มเหลวเหล่านั้นถูกส่งต่อไปที่อื่น และถึงขั้น fatal หากไม่เป็นเช่นนั้น

• วัดอัตราความผิดพลาดของคุณเองแทนที่จะรับค่าของคนอื่นมาใช้ — ตัวเลข 93.93% เป็นตัวเลขของแคตตาล็อกของเราสำหรับเส้นทางหนึ่ง และค่าของคุณจะขึ้นอยู่กับภูมิภาคของคุณ ปริมาณของคุณ และรูปแบบภาระงานของคุณ

• เก็บโมเดลตัวที่สองให้พร้อมใช้งานอยู่เสมอ สำหรับทุกอย่างที่อยู่ในไทม์ไลน์ทางคลินิก — โหมดความล้มเหลวที่คุณกำลังป้องกันไว้ไม่ใช่คำตอบที่แย่ แต่คือการไม่มีคำตอบเลย

หลักการเดียวกันนี้ใช้ในทิศทางตรงกันข้ามบนฝั่ง CT ซึ่งไม่มีเส้นทางเลย โมเดลที่โฮสต์เองไม่มีอัตราความผิดพลาดของผู้ให้บริการ แต่มีอัตราความผิดพลาดของฮาร์ดแวร์ ภาระในการบำรุงรักษา และเพดานความจุที่กำหนดโดยจำนวน GPU ที่คุณซื้อ รูปแบบความล้มเหลวคือคิว และการบรรเทาคือการจัดตารางเวลา ไม่ใช่การสลับไปใช้ระบบสำรอง ปัญหาต่างกัน กฎเดียวกัน: รู้ว่าคุณพึ่งพาตัวเลขใดอยู่จริง ๆ

ในกรณีที่บริบทยาวช่วยได้จริง และในกรณีที่มันไม่ช่วย

หน้าต่าง 1,048,576 โทเคนของ Gemini 3.1 Pro และคะแนนการเรียกคืนบริบทยาว 82 คะแนน ถือเป็นข้อได้เปรียบที่แท้จริง และคุ้มค่าที่จะใช้อย่างจงใจมากกว่าปล่อยให้ใช้โดยบังเอิญ

จุดที่สิ่งเหล่านี้ให้ผลตอบแทนในโปรแกรม CT ไม่ใช่การสแกน แต่เป็นทุกสิ่งรอบ ๆ การสแกนต่างหาก การดึงข้อมูลเพียงรอบเดียวจากบันทึกการผ่าตัดที่ยาวและรายงานที่เกี่ยวข้อง โดยเก็บเอกสารทั้งหมดไว้ในบริบทเพื่อให้ฟิลด์ต่าง ๆ สอดคล้องกัน สรุปกลุ่มผู้ป่วยที่ต้องเก็บเรื่องเล่าของผู้ป่วยหลายร้อยรายไว้พร้อมกันเพื่อหาแพตเทิร์นที่พาดผ่านเรื่องเหล่านั้น งานแปลงข้อมูลที่สคีมา ระเบียนตัวอย่างหนึ่งร้อยรายการ และบันทึกข้อผิดพลาดทั้งหมดจำเป็นต้องมองเห็นได้ในการเรียกครั้งเดียวกัน นั่นคืองานที่หน้าต่างบริบทแบบยาวเปลี่ยนคำตอบ ไม่ใช่แค่ความสะดวก

จุดที่มันไม่ได้ช่วยคือตัวการสแกนเอง และเหตุผลนี้ควรกล่าวให้ชัดเจน เพราะมันคือข้อผิดพลาดที่การจับคู่นี้ชักนำให้เกิด CT ทรวงอกที่นำเสนอในแบบที่ NV-Reason-CT นำเสนอนั้นใช้ 13,824 โทเคน Gemini 3.1 Pro สามารถเก็บการศึกษาดังกล่าวได้ถึงเจ็ดสิบชุดภายในหน้าต่างของมันโดยยังมีที่ว่างเหลือ ข้อจำกัดไม่ใช่เรื่องของพื้นที่ หากแต่เป็นเพราะเส้นทางประมวลผลภาพของ Gemini 3.1 Pro มองภาพเป็นรูปภาพที่มีมาตราส่วนพิกเซล ดังนั้นการศึกษาที่นำเสนอในลักษณะนั้นจึงสูญเสียระยะห่างระหว่างสไลซ์และการปรับเทียบความหนาแน่นไปก่อนที่โทเคนแรกจะถูกปล่อยออกมา คุณอาจใช้โทเคนหนึ่งล้านกับข้อมูลปริมาตรหนึ่งชุด แล้วก็ยังไม่มีข้อมูลปริมาตรอยู่ดี การเปรียบเทียบของบทความเองทำให้ต้นทุนของเรื่องนี้เป็นรูปธรรม: MedGemma 1.5 ได้ 0.303 F1 เมื่อป้อนสไลซ์ตามแนวแกนสูงถึง 85 สไลซ์ เทียบกับ 0.614 สำหรับโมเดลเชิงปริมาตรแบบเนทีฟ ซึ่งเป็นช่องว่างประมาณสองเท่า

ที่ที่เราเหมาะสม และสิ่งหนึ่งที่เราจะไม่พูด

Gemini 3.1 Pro ให้บริการผ่าน OrcaRouter ในชื่อ google/gemini-3.1-pro-preview ในราคาตามที่ผู้ให้บริการกำหนดโดยไม่บวกเพิ่ม ภายใน API เดียวที่ครอบคลุมมากกว่า 200 โมเดล สำหรับโมเดลที่ยังอยู่ในระดับพรีวิวในตอนนี้ การผสมผสานนี้มีประโยชน์กว่าที่ฟังดู การไม่บวกเพิ่มหมายความว่าการเปลี่ยนแปลงราคาจากผู้ขายจะมาถึงฝั่งเราภายในวันเดียวกัน แทนที่จะถูกกลืนหายไปโดยคนกลางที่ยังยึดตัวเลขเก่าไว้ การสลับสำรองอัตโนมัติหมายความว่าเส้นทางที่เริ่มล้มเหลวจะไม่ลากทั้งแบตช์ลงไปด้วย — ซึ่งเมื่อพิจารณาจากอัตราข้อผิดพลาดที่วัดได้ระดับเก้าสิบกว่าเปอร์เซ็นต์บนเส้นทางหนึ่ง นี่ไม่ใช่เรื่องสมมติ และ DSL สำหรับกำหนดเส้นทางที่ช่วยส่งคำขอแต่ละรายการไปยังโมเดลที่ควรจัดการคำขอนั้น ช่วยให้คุณมอบงานบริบทขนาดยาวให้โมเดลหนึ่ง และงานปริมาณมากราคาถูกให้อีกโมเดลหนึ่ง โดยไม่ต้องดูแลการเชื่อมต่อถึงสองชุด

NV-Reason-CT ไม่ได้อยู่บนแพลตฟอร์มของเรา และไม่มีโมเดลของ NVIDIA ใดอยู่บนนั้นด้วย มันคือเวตที่คุณดาวน์โหลดไปรันเอง และการอธิบายอย่างตรงไปตรงมาคือ สองครึ่งของสถาปัตยกรรมนี้อยู่ในที่ที่แตกต่างกันโดยสิ้นเชิง: ครึ่งหนึ่งอยู่หลัง API ที่มีตารางราคาและความเสี่ยงแบบเวอร์ชันพรีวิว อีกครึ่งหนึ่งอยู่บนฮาร์ดแวร์ของคุณเอง ภายใต้สัญญาอนุญาต OpenMDW-1.1 พร้อมตัวเลขทรูพุตที่คุณต้องผลิตขึ้นมาเอง

A generated scoreboard titled 'What each side gives you, and what it costs' listing five paired rows. Row one: widest input surface, audio, video, image and file against text only, one modality at a time. Row two: longest context, 1,048,576 tokens in against 13,824 tokens per volume. Row three: highest benchmark, GPQA Diamond 94.1 against CT-RATE F1 0.614. Row four: weakest measured figure, a 93.93% route error rate against no published throughput at all. Row five: dependency, a hosted preview tier against your own GPUs. A footer reads 'Both sides carry a number nobody should build on without measuring it themselves.'A screenshot of the OrcaRouter model page for Gemini 3.1 Pro, showing the identifier google/gemini-3.1-pro-preview with tags for Vision, Audio, Video, Tools, JSON and Reasoning, the description of it as a multimodal model accepting text, image, audio, video and file input, and a side panel listing a 1,048,576-token context window with up to 65,536 output tokens. A stat strip reads $2.00 per million input tokens, $12.00 per million output tokens, a median time to first token, and an error rate of 93.93 percent.

การตัดสินใจที่ยังคงอยู่เมื่อเจอกับโปรดักชัน

หากปัญหาของคุณคือการทำความเข้าใจข้อความ เสียง วิดีโอ หรือเอกสารในบริบทยาว Gemini 3.1 Pro ได้รับการวัดผลอย่างอิสระว่าอยู่ในอันดับต้น ๆ ของวงการในด้านความรู้และการเรียกคืนข้อมูล และสิ่งเดียวที่กั้นระหว่างมันกับไปป์ไลน์โปรดักชันคือความน่าเชื่อถือของเส้นทาง — ซึ่งเป็นปัญหาทางวิศวกรรมที่แก้ไขได้ ไม่ใช่ปัญหาของโมเดล ให้วางมันไว้หลังระบบ failover อย่าฮาร์ดโค้ด preview slug และจงวัดอัตราความผิดพลาดของคุณเอง แทนที่จะเชื่อของใคร รวมถึงของเรา

หากปัญหาของคุณคือภาพ CT เชิงปริมาตรของทรวงอกหรือช่องท้อง ในการเปรียบเทียบนี้มีโมเดลแบบเปิดเพียงหนึ่งเดียวเท่านั้นที่รับมือกับปัญหานั้นได้ โมเดลนั้นไม่ใช่ตัวที่มีหน้าต่างขนาดหนึ่งล้านโทเคน และตัวเลขที่ควรกำกับการวางแผนของคุณก็ไม่ใช่คะแนน F1 ของมัน แต่เป็นความหน่วงต่อการตรวจหนึ่งครั้งที่ยังไม่มีใครเผยแพร่ จงวัดมันก่อนที่คุณจะสัญญากับใครเรื่องตัวเลขอัตราการประมวลผล

การเปรียบเทียบนี้คุ้มค่าที่จะทำ เพราะมันแยกสองสิ่งที่มักถูกหลอมรวมกันอยู่เสมอ: ความกว้างของอินพุตและความลึกของการแทนค่า Gemini 3.1 Pro มีขอบเขตอินพุตที่กว้างที่สุดเท่าที่ใครเคยเปิดตัว และมีความสามารถในการเรียกคืนบริบทยาวที่ดีที่สุดในชุดนี้ แต่ก็ยังไม่สามารถอ่านภาพ CT ในฐานะภาพ CT ได้ NV-Reason-CT อ่านภาพ CT ได้เพียงอย่างเดียว และอ่านอย่างอื่นไม่ได้เลย ไปป์ไลน์ต้องการทั้งสองอย่าง ต้องการให้มันอยู่บนโครงสร้างพื้นฐานที่แตกต่างกัน และต้องการรู้ว่าในตัวเลขสองตัวในแต่ละด้าน ตัวไหนคือตัวที่จะปลุกคุณตอนตีสาม

© 2026 OrcaRouter

สำหรับผู้ให้บริการ

ให้บริการแพลตฟอร์มการอนุมานอยู่หรือไม่ นำโมเดลของคุณขึ้น OrcaRouter

providers@orcarouter.ai

เข้าร่วมคอมมูนิตี้ของเรา

Discordsupport@orcarouter.aiXGitHubYouTube