การ์ด hero ที่สร้างขึ้น โดยมีชื่อเรื่องว่า 'NV-Reason-CT vs DeepSeek V4 Pro' พร้อมคำบรรยายย่อยว่า 'ต้นทุนของการอ่านผลสแกน และเมื่อใดจึงควรประมวลผลเป็นชุด' การ์ดสองใบหันหน้าเข้าหากัน คั่นกลางด้วยลูกศรสีน้ำเงินคู่หนึ่ง การ์ดด้านซ้ายมีป้ายกำกับว่า 'NV-Reason-CT' พร้อมไอคอนสแกนร่างกาย และข้อความ 'หนึ่งชุดภาพ CT - 13,824 โทเคนภาพ - ไม่มีข้อมูลอัตราการประมวลผลที่เผยแพร่' การ์ดด้านขวามีป้ายกำกับว่า 'DeepSeek V4 Pro' พร้อมไอคอนชิป และข้อความ '1.6T ทั้งหมด / 49B ที่ใช้งานอยู่แบบ MoE - คอนเท็กซ์ 1M - $0.66 / $1.98 ต่อล้าน เพิ่มเป็นสองเท่าในช่วงเวลาสองช่วงตามเวลา UTC' โลโก้ OrcaRouter ถูกคอมโพสิตไว้ที่มุมขวาล่าง
Guides & Insights

NV-Reason-CT กับ DeepSeek V4 Pro: ต้นทุนของการอ่านสแกน และเมื่อใดควรรันแบตช์

ผู้เขียน

Magnus Corvin

วันที่เผยแพร่

โมเดลล่าสุด · 20ดูโมเดลทั้งหมด →
เบนช์มาร์ก: Artificial Analysis · อัปเดตทุกวัน
กลับไปยังโพสต์ทั้งหมด

นี่คือข้อเท็จจริงด้านการดำเนินงานที่ส่งผลต่องบประมาณไปป์ไลน์ทางคลินิกมากกว่าเกณฑ์มาตรฐานใด ๆ: DeepSeek V4 Pro มีค่าใช้จ่าย $0.66 ต่อโทเค็นอินพุตหนึ่งล้านโทเค็น และ $1.98 ต่อโทเค็นเอาต์พุตหนึ่งล้านโทเค็น และอัตราเหล่านั้นจะเพิ่มเป็นสองเท่าในช่วงสองช่วงเวลาต่อวัน คือ 01:00 ถึง 04:00 และ 06:00 ถึง 10:00 UTC งานแบบแบตช์ที่รันนอกช่วงเวลาเหล่านั้นมีค่าใช้จ่ายครึ่งหนึ่งของค่าใช้จ่ายเมื่อรันในช่วงเวลาเหล่านั้น ในทางกลับกัน NV-Reason-CT ตัวให้เหตุผล 3D CT ขนาด 4.69 พันล้านพารามิเตอร์ของ NVIDIA ไม่มีตารางราคาเลย — มันคือชุดเวตที่คุณดาวน์โหลดและรันเอง โดยไม่มีตัวเลขปริมาณงานที่เผยแพร่สำหรับการตรวจหนึ่งครั้งที่ใช้ 13,824 โทเค็น โมเดลเหล่านี้ตัวหนึ่งคุณจัดตารางเวลาได้ ส่วนอีกตัวคุณต้องวัดก่อนจึงจะจัดงบประมาณได้

ความไม่สมมาตรนั้นเป็นช่องทางที่มีประโยชน์สำหรับการเปรียบเทียบนี้ เพราะสองโมเดลนี้ตั้งอยู่คนละปลายของไปป์ไลน์ และล้มเหลวในเชิงการเงินคนละแบบ NV-Reason-CT เป็นเครื่องมือต้นทุนคงที่: การศึกษาส่วนเพิ่มแทบไม่มีค่าใช้จ่ายเมื่อซื้อฮาร์ดแวร์แล้ว แต่การตัดสินใจเรื่องฮาร์ดแวร์นั้นเป็นการตัดสินใจครั้งใหญ่ และความหน่วงต่อการศึกษาไม่มีการบันทึกไว้ DeepSeek V4 Pro เป็นเครื่องยนต์ต้นทุนผันแปร: ไม่มีอะไรต้องซื้อ ทุกอย่างคิดตามการใช้งาน และมิเตอร์มีตารางที่คุณอ่านได้จากปฏิทิน

แต่ละอันคืออะไร อันละหนึ่งบรรทัด

• งาน — NV-Reason-CT อ่านชุดภาพซีที (CT) ของทรวงอกหรือช่องท้อง และให้ผลการตรวจที่มีโครงสร้าง ส่วน DeepSeek V4 Pro อ่านและเขียนข้อความ

• สถาปัตยกรรม — ทรานส์ฟอร์มเมอร์วิสชัน 3D ที่เรียกว่า Primus ซึ่งเริ่มต้นจาก COLIPRI ด้วยโครงข่ายหลักภาษาขนาด Qwen3.5-4B และการฝังตำแหน่งแบบโรตารีหลายแกน 3D ที่ 4.69 พันล้านพารามิเตอร์ ซึ่ง 4.35 พันล้านพารามิเตอร์นั้นทำงานอยู่; เทียบกับโมเดลแบบ Mixture of Experts ขนาด 1.6 ล้านล้านพารามิเตอร์ ที่มี 49 พันล้านพารามิเตอร์ที่ทำงานต่อโทเค็น

• อินพุต — วอลุ่ม NIfTI แบบหนึ่งช่องสัญญาณ (.nii, .nii.gz) ในหน่วย Hounsfield จัดแนวแบบ LPS รีแซมเป็น 2 มม. แบบไอโซทรอปิก และครอปให้เหลือเฉพาะกายวิภาค; เทียบกับข้อความ

• บริบท — ปริมาตรเดียวกลายเป็น 13,824 โทเคนภาพในกริดขนาด 24 x 24 x 24 โดยไม่มีการลดทอนเชิงพื้นที่ และไม่มีเลเยอร์รวม เทียบกับโทเคนขาเข้า 1,048,576 และขาออก 384,000

• กายวิภาคที่รองรับ — ทรวงอกและช่องท้อง และไม่มีอย่างอื่น; เทียบกับทุกสิ่งที่ข้อความสามารถอธิบายได้

• ราคา — ไม่มีราคาตามรายการ, โฮสต์เอง, ไม่มีอัตราการประมวลผลต่อการศึกษาที่เผยแพร่; เทียบกับ $0.66 / $1.98 ต่อล้านโทเค็น ซึ่งเพิ่มเป็นสองเท่าในช่วงเวลา UTC สองช่วงที่ระบุข้างต้น โดยการอ่านจากแคชอยู่ที่ $0.022

• ความหน่วงที่วัดได้ — ไม่ได้เผยแพร่; เทียบกับค่ามัธยฐานเวลาถึงโทเคนแรก 3,483 มิลลิวินาที ที่ 96.01 โทเคนเอาต์พุตต่อวินาที โดยมีอัตราความผิดพลาด 0.75%

มีสองแถวที่ควรค่าแก่การอธิบายมากกว่าหนึ่งบรรทัดต่อแถว แถวบริบทคือแถวที่ชัดเจนอยู่แล้ว — หนึ่งล้านโทเคนเทียบกับ 13,824 — แต่หน่วยเหล่านี้เทียบกันไม่ได้ และเป็นการผิดพลาดที่จะตีความว่ามันเป็นช่องว่างด้านขีดความสามารถไม่ว่าในทิศทางใด 13,824 โทเคนคือจำนวนที่ต้องใช้เพื่อแทนการตรวจ CT หนึ่งครั้งอย่างแม่นยำ ส่วนหนึ่งล้านโทเคนคือปริมาณข้อความแวดล้อมที่คุณรองรับได้ ตัวเลขแรกบอกถึงความละเอียด ส่วนตัวเลขที่สองบอกถึงหน่วยความจำ

แถวค่าความหน่วง (latency) คือแถวที่มักถูกข้ามไป ค่ามัธยฐาน 3.48 วินาทีถึงโทเคนแรก และ 96 โทเคนต่อวินาทีของ DeepSeek V4 Pro เป็นตัวเลขที่วัดจริงและเผยแพร่แล้ว และตัวเลขเหล่านี้ทำให้คุณประเมินขนาดของงานข้อความได้บนกระดาษ การที่ NV-Reason-CT ไม่มีตัวเลขเทียบเคียงใด ๆ ไม่ใช่การวิจารณ์ตัวโมเดล แต่เป็นเหตุผลว่าทำไมไปป์ไลน์ CT จึงประเมินต้นทุนไม่ได้ก่อนที่ใครสักคนจะลองรันมัน โมเดลขนาด 4.69B ที่ประมวลผลภาพ 13,824 โทเคนไม่ใช่การคำนวณเล็ก ๆ และจนกว่าคุณจะจับเวลามันบนฮาร์ดแวร์ของคุณเอง คุณก็แค่คาดเดาไปเท่านั้น

การอ่านบันทึกการวัดประสิทธิภาพทั้งสองรายการโดยไม่หลอกตัวเอง

สถิติของ DeepSeek V4 Pro เป็นการผสมผสานระหว่างการวัดผลอิสระและการรายงานจากผู้ขาย และการผสมผสานนี้ให้แง่คิด เพราะมีตัวเลขหนึ่งตัวที่ดูน่าตกใจแต่แท้จริงไม่ใช่

• Artificial Analysis Intelligence Index — 36 ซึ่งอยู่ที่เปอร์เซ็นไทล์ที่ 72.4 ของโมเดลที่วัด

• GPQA Diamond — 92.8 ซึ่งอยู่ใกล้ระดับสูงสุดของวงการ

• Humanity's Last Exam — 41 และ 41 ใน MMLU-Pro, 62.51 ในดัชนีคณิตศาสตร์

• τ²-Bench — 96.20 โดยมี IFBench อยู่ที่ 76.46 และ tau_banking อยู่ที่ 39.59

• การเรียกคืนบริบทแบบยาว — 80.33

• SciCode และ Terminal-Bench — 51 และ 78.65 ในเวอร์ชันที่สองของ Terminal-Bench

ดัชนีแบบรวมที่ 36 อยู่ข้าง ๆ คะแนน GPQA Diamond ที่ 92.8 ดูเหมือนจะขัดแย้งกัน จนกว่าคุณจะสังเกตว่าดัชนีคืออะไร มันคือค่าที่รวบรวมจากการประเมินหลายชุด และโมเดลที่ยอดเยี่ยมในไม่กี่ชุดและแค่พอใช้ในชุดอื่น ๆ จะอยู่อันดับกลาง ๆ เมื่อรวมคะแนนทั้งหมด แต่ครองอันดับต้น ๆ ในตารางคะแนนรายด้าน ใครก็ตามที่ยก 36 มาเพียงลำพังเพื่อโต้แย้งว่า DeepSeek V4 Pro อยู่ระดับกลาง ๆ กำลังอ้างค่าเฉลี่ยเสมือนเป็นค่าสูงสุด ใครก็ตามที่ยก 92.8 มาเพียงลำพังเพื่อโต้แย้งว่ามันนำหน้าทุกคนในวงการ กำลังอ้างค่าสูงสุดเสมือนเป็นค่าเฉลี่ย ทั้งสองตัวเลขมาจาก Artificial Analysis และทั้งคู่เป็นความจริง

บันทึกของ NV-Reason-CT ไม่มีส่วนผสมเช่นนั้น และนั่นคือปัญหาที่ตรงไปตรงมาของมัน ตัวเลข CT-RATE ของมัน — 0.614 F1 และ 0.871 AUROC จากสิบแปดป้ายกำกับ โดยใช้เกณฑ์แบบสม่ำเสมอคงที่และพรอมป์ต์ใช่/ไม่ใช่แบบตรง ๆ โดยไม่มีหัวจำแนกประเภทและไม่มีการปรับให้เข้ากับงานเฉพาะ — มาจากบทความของ NVIDIA เองเท่านั้น และไม่มีที่อื่น ชุดเปรียบเทียบในบทความนั้น (VoxelFM ที่ 0.581, Pillar-0 ที่ 0.544, ClinFusion-8B ที่ 0.442, CT-CLIP ที่ 0.398, Merlin ที่ 0.358, MedGemma 1.5 ที่ 0.303) ล้วนเป็นโมเดลการถ่ายภาพอื่นทั้งหมด ไม่มีโมเดลข้อความทั่วไปแม้แต่ตัวเดียวปรากฏอยู่ในนั้น และไม่มีบุคคลที่สามรายใดทำซ้ำตัวเลขใด ๆ ได้

A generated scoreboard titled 'Two records, two kinds of provenance' with two columns. The left column, headed 'NV-Reason-CT', lists five rows: CT-RATE F1 0.614 and AUROC 0.871; provenance, the authors paper only; reproduced, no; throughput, not published; price, self-hosted, no rate card. The right column, headed 'DeepSeek V4 Pro', lists five rows: AA Intelligence 36, GPQA Diamond 92.8, tau-squared Bench 96.20; provenance, Artificial Analysis plus vendor; reproduced, yes, independently measured; throughput, 3,483 ms to first token at 96 tokens per second; price, $0.66 and $1.98 per million tokens. A footer reads 'An index of 36 beside a benchmark of 92.8 is an average beside a maximum, not a contradiction.'

คำถามเรื่องการจัดตาราง ที่คิดจนจบแล้ว

การคิดราคาตามช่วงเวลาบน DeepSeek V4 Pro ถือเป็นสิ่งที่นำไปปฏิบัติได้จริงในเชิงปฏิบัติการมากที่สุดของทั้งสองโมเดล ดังนั้นจึงควรค่าแก่การอธิบายทีละขั้นตอนอย่างเป็นรูปธรรม

งานด้านข้อความที่สมจริงสำหรับโครงการ CT ไม่ใช่เรื่องหรูหรา มันคือการดึงฟิลด์ที่มีโครงสร้างจากคลังรายงานในอดีตเพื่อให้มีเลเบลสำหรับฝึกโมเดล การแปลงโครงสร้างไดเรกทอรี DICOM เป็น NIfTI ในระดับขนาดใหญ่ การเขียนและเขียนใหม่ของฮาร์เนสประเมินผล การปรับหน่วยและคำศัพท์ให้เป็นมาตรฐานข้ามสี่ชุดข้อมูล และการสรุปกลุ่มประชากร เรียกได้ว่าหนึ่งร้อยล้านโทเคนอินพุตและสิบล้านโทเคนเอาต์พุตสำหรับโครงการขนาดกลาง ซึ่งเป็นตัวเลขกลมโดยเจตนาที่ใช้แทน "งานข้อความจำนวนมาก"

• ภายในช่วงเวลาที่เป็นสองเท่า — $1.32 และ $3.96 ต่อล้าน ดังนั้น $132 บวก $39.60 จากปริมาณเหล่านั้น

• นอกช่วงเหล่านั้น — $0.66 และ $1.98 ต่อล้าน ดังนั้น $66 บวก $19.80

• ความแตกต่าง — ประมาณ $86 หรือ 49% ของบิลนอกช่วงพีค สำหรับการย้ายงานที่สามารถประมวลผลเป็นชุดได้โดยธรรมชาติ

• การอ่านจากแคช — $0.022 ต่อล้าน ซึ่งเป็นหนึ่งในหกสิบของอัตราอินพุต ดังนั้นคำนำหน้าพรอมต์ใดๆ ที่คุณใช้ซ้ำทั่วทั้งคลังข้อมูลจึงแทบไม่มีค่าใช้จ่าย

นั่นไม่ใช่ข้อผิดพลาดจากการปัดเศษ และมันเป็นไปได้เพราะงานเป็นแบบอะซิงโครนัส การดึงรายงานไม่จำเป็นต้องเกิดขึ้นตอน 14:00 ไม่มีอะไรในงานแปลง DICOM ที่สนใจว่าเวลากี่โมง โครงสร้างราคาคือคำเชิญโดยตรงให้จัดตารางเวลา และไปป์ไลน์ที่เพิกเฉยต่อมันกำลังจ่ายส่วนเพิ่ม 49% เพื่อสิทธิ์ในการรันตามอำเภอใจ การอ่านแคชก็สำคัญด้วยเหตุผลเดียวกัน: พรอมต์ระบบที่ใช้ร่วมกันหรือสคีมาการดึงข้อมูลแบบตายตัว ซึ่งนำกลับมาใช้ซ้ำในรายงานหลายพันฉบับ อยู่ที่หนึ่งในหกสิบของอัตราอินพุต

NV-Reason-CT ไม่มีคันโยกที่เทียบเท่า เพราะมันไม่มีมาตรวัด ต้นทุนของการอ่านสแกนหนึ่งครั้งคือค่า GPU ของคุณต่อชั่วโมงหารด้วยจำนวนสแกนต่อชั่วโมงที่คุณสามารถประมวลผลผ่านมันได้ และตัวเลขตัวที่สองคือตัวที่ไม่มีใครเคยเผยแพร่ ถ้าการศึกษาหนึ่งครั้งใช้เวลาสองวินาที L40S ตัวเดียวก็รองรับโปรแกรมขนาดใหญ่ได้อย่างสบาย ๆ ถ้าใช้เวลายี่สิบวินาที เลขคณิตของฮาร์ดแวร์ก็เปลี่ยนไปโดยสิ้นเชิง NVIDIA ทดสอบบน H100 และ L40S ซึ่งบอกคุณได้ถึงระดับของการ์ด ไม่ใช่อัตรา

กับดักของการสมมติว่าพวกมันใช้แทนกันได้

ข้อผิดพลาดที่การจับคู่นี้ชักชวนให้เกิดนั้นละเอียดอ่อนกว่าข้อผิดพลาดทางหมวดหมู่แบบปกติ เพราะมันมีรูปแบบหนึ่งที่ดูสมเหตุสมผลเมื่ออยู่บนสไลด์

DeepSeek V4 Pro มีความจุ 1,048,576 โทเค็น และปล่อยได้สูงสุด 384,000 โทเค็น ปริมาตร CT นั้น ตามการคำนวณของโมเดลที่อ่านมันอย่างถูกต้อง มีเพียง 13,824 โทเค็น ดังนั้นโมเดลข้อความที่มีหน้าต่างขนาดหนึ่งล้านโทเค็นจึงมีที่สำหรับการตรวจ CT ประมาณเจ็ดสิบกว่าครั้งที่จำนวนโทเค็นดังกล่าว การคำนวณเลขนั้นถูกต้อง และข้อสรุป — ที่ว่าคุณสามารถป้อนข้อมูล CT ให้โมเดลข้อความและประหยัดโครงสร้างพื้นฐานด้านการถ่ายภาพ — นั้นผิด ด้วยเหตุผลที่ว่าทำไมตัวเลข 13,824 จึงเกิดขึ้นตั้งแต่แรก

ตัวเลขนั้นไม่ใช่บทสรุปแบบบีบอัดของการสแกน มันคือการสแกนนั้นเอง ที่ความละเอียดไอโซทรอปิก 2 มม. ครอบคลุมลูกบาศก์ขนาด 384 มิลลิเมตร ถูกตัดเป็นแพตช์ 8 x 8 x 8 แล้วส่งให้โมเดลภาษาโดยไม่มีการดาวน์แซมปลิงเชิงพื้นที่และไม่มีเลเยอร์ผสาน จำนวนโทเคนสูงก็เพราะไม่มีอะไรถูกทิ้งไปเลย: ระยะห่างระหว่างสไลซ์ที่ทำให้ก้อนเนื้อวัดได้ ค่าความหนาแน่นที่ทำให้เท็กซ์เจอร์เป็นค่าขีดแบ่งมากกว่าจะเป็นคำคุณศัพท์ โมเดลข้อความไม่สามารถรับโทเคนเหล่านั้นในรูปของปริมาตรได้ เช่นเดียวกับที่เอกสารก็ไม่สามารถทำได้ มันมีงบประมาณ แต่มันไม่มีอินเทอร์เฟซ

การเปรียบเทียบภายในของบทความนี้เองได้ระบุตัวเลขของความแตกต่างดังกล่าวไว้ MedGemma 1.5 ซึ่งได้รับสไลซ์ตามแนวแกนสูงสุด 85 สไลซ์ — สิ่งที่ดีที่สุดที่ส่วนหน้าแบบสองมิติหรือแบบซ้อนสไลซ์จะทำได้อย่างสมเหตุสมผล — ทำคะแนนได้ 0.303 F1 เทียบกับ 0.614 สำหรับโมเดลเชิงปริมาตรแบบเนทีฟ ช่องว่างนั้นคือคุณค่าของเอนโคเดอร์สามมิติ และไม่ว่าหน้าต่างบริบทจะใหญ่แค่ไหนก็ปิดช่องว่างนี้ไม่ได้

การแทนที่ย้อนกลับล้มเหลวด้วยเหตุผลที่ตรงไปตรงมามากกว่า NV-Reason-CT รองรับทรวงอกและช่องท้อง รับไฟล์ NIfTI แทนที่จะรับพรอมป์ต์ ไม่มีความสามารถในการใช้เครื่องมือ และการ์ดโมเดลของมันจำกัดการใช้ไว้เพื่อการวิจัยและการศึกษา พร้อมระบุว่ามันไม่ใช่อุปกรณ์ทางการแพทย์ และผลลัพธ์อาจไม่ถูกต้อง มันไม่สามารถดึงฟิลด์จากรายงานได้ และไม่สามารถเขียนสคริปต์ที่สร้างคลังข้อมูลของคุณได้

A generated scoreboard titled 'Where the money actually goes' listing five rows for a worked example of 100 million input and 10 million output tokens on DeepSeek V4 Pro. Row one: inside the doubled UTC windows, $132 input and $39.60 output. Row two: outside those windows, $66 input and $19.80 output. Row three: difference, about $86, or 49% of the off-peak bill. Row four: cached reads, $0.022 per million, a sixtieth of the input rate. Row five: the CT side, self-hosted with no published per-study throughput, so the cost per scan has to be measured. A footer reads 'Pricing per the provider rate card; the CT column has no rate card to quote.'

จุดที่เราเหมาะสม และจุดที่เราเจตนาไม่เหมาะสม

DeepSeek V4 Pro ให้บริการผ่าน OrcaRouter ในชื่อ deepseek/deepseek-v4-pro ในราคาตามรายการของผู้ให้บริการโดยไม่มีส่วนบวกเพิ่ม ภายใน API เดียวที่ครอบคลุมโมเดลมากกว่า 200 รายการ การส่งผ่านราคาตรงนี้สำคัญกว่าปกติสำหรับโมเดลที่มีราคาแปรผันตามช่วงเวลาของวัน เพราะเมื่อผู้ขายเปลี่ยนราคาหรือเปลี่ยนช่วงเวลา ราคาฝั่งเราก็เปลี่ยนตามในวันเดียวกัน เนื่องจากไม่มีชั้นบวกเพิ่มคั่นกลางที่ยึดตัวเลขเดิมไว้ การสลับไปใช้ระบบสำรองอัตโนมัติครอบคลุมกรณีที่ผู้ให้บริการมีประสิทธิภาพลดลงกลางชุดงาน ซึ่งสำหรับงานสกัดข้อมูลระยะยาวที่ไม่มีคนเฝ้า นี่คือรูปแบบความล้มเหลวที่ทำให้คุณเสียเวลาทั้งคืนจริง ๆ และ routing DSL ช่วยให้คุณส่งคำขอแต่ละรายการไปยังโมเดลที่ควรจัดการได้ แทนที่จะส่งทุกอย่างผ่านปลายทางเดียว

NV-Reason-CT ไม่ได้อยู่บนแพลตฟอร์มของเรา ไม่มีโมเดลของ NVIDIA อยู่บนนั้นเลย ฝั่ง CT ของสถาปัตยกรรมนี้คือฮาร์ดแวร์ของคุณเองพร้อมน้ำหนักที่คุณดาวน์โหลดมาเอง และเราจะไม่เขียนประโยคที่ทำให้ผู้อ่านเข้าใจเป็นอย่างอื่น เมื่อพิจารณาว่าข้อมูลนำเข้าเป็นข้อมูลเชิงปริมาตรที่ได้จากผู้ป่วย และสัญญาอนุญาตคือ OpenMDW-1.1 โดยไม่มีบริการโฮสต์ใด ๆ ผูกอยู่ การรันในเครื่องจึงเป็นที่ที่โมเดลนั้นควรอยู่ไม่ว่าจะอย่างไร

สิ่งที่การจับคู่บอกคุณจริง ๆ

สองโมเดลนี้ไม่ได้แข่งขันกัน และประเด็นของการเปรียบเทียบก็คือพวกมันล้มเหลวต่างกัน NV-Reason-CT ให้ความสามารถที่ไม่มีสิ่งอื่นใดในโอเพนซอร์สทำได้ — การให้เหตุผลแบบ CT สามมิติโดยกำเนิดที่ความละเอียดเต็มของการตรวจ — และขอให้คุณยอมรับค่าใช้จ่ายต่อการตรวจที่ไม่ได้ตั้งงบประมาณไว้ ปริมาณงานที่ไม่ได้เปิดเผย และสัญญาอนุญาตที่ห้ามนำไปใช้งานทางคลินิก DeepSeek V4 Pro ให้เอนจินแบบคิดค่าตามการใช้งาน พร้อมความหน่วงที่เปิดเผย อัตราความผิดพลาดที่เปิดเผย การวัดผลโดยอิสระ และราคาที่คุณลดครึ่งหนึ่งได้เพียงแค่มองนาฬิกา และมันมองไม่เห็นภาพสแกนเลย

ถ้าคุณสร้างสิ่งนั้นเองแทนที่จะซื้อ รูปร่างที่ยังรอดเมื่อเจอของจริงคือแบบที่น่าเบื่อ จงรันการอ่าน CT ในเครื่อง ประเมินงบมันด้วยการวัดแทนการอ้างอิง และจัดทุกอย่างที่เป็นข้อความรอบ ๆ มันให้นัดพบกับช่วงเวลาออฟพีค ตารางเวลาเดียวที่ไม่มีใครควรลอกเลียนแบบคือตารางที่รันการสกัดหนึ่งร้อยล้านโทเคนตอน 02:00 UTC เพราะนั่นคือเวลาที่แบตช์บังเอิญพร้อมพอดี

A screenshot of the OrcaRouter model page for DeepSeek V4 Pro, showing the identifier deepseek/deepseek-v4-pro, the description of it as a large mixture-of-experts model with a one-million-token context window, and a side panel listing a 1,048,576-token context window with up to 384,000 output tokens and text input with text output. A stat strip reads $0.66 per million input tokens, $1.98 per million output tokens, a 3.5-second p50 time to first token, and traffic measured in the billions of tokens over seven days.
© 2026 OrcaRouter

สำหรับผู้ให้บริการ

ให้บริการแพลตฟอร์มการอนุมานอยู่หรือไม่ นำโมเดลของคุณขึ้น OrcaRouter

providers@orcarouter.ai

เข้าร่วมคอมมูนิตี้ของเรา

Discordsupport@orcarouter.aiXGitHubYouTube