
Mistral Large 4 กับ DeepSeek V4 Pro: สถาปัตยกรรมคู่แฝด การเดิมพันที่ตรงกันข้าม
- openaiใหม่OpenAI: GPT-6.1 Sol2026-09-2952ความฉลาด
- anthropicใหม่Anthropic: Claude Sonnet 5.52026-09-2856ความฉลาด
- typesafeใหม่TypeSafe: Jev 1.132026-09-24$0.04 / $0.00 ต่อ 1 ล้านโทเค็น · 151 tok/s
- OpenAIใหม่OpenAI: GPT-6 Luna2026-09-2238ความฉลาด
- OpenAIใหม่OpenAI: GPT-6 Sol2026-09-2248ความฉลาด
- Anthropicใหม่Anthropic: Claude Opus 5.52026-09-2258ความฉลาด
- xAIGrok 4.72026-09-2146ความฉลาด
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 ต่อ 1 ล้านโทเค็น · 120 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 ต่อ 1 ล้านโทเค็น · 1202 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040ความฉลาด
- OpenAIOpenAI: GPT-6 Astra2026-09-0453ความฉลาด77การเขียนโค้ด
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241ความฉลาด76การเขียนโค้ด
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245ความฉลาด76การเขียนโค้ด
- AnthropicAnthropic: Claude Fable 5.12026-09-0153ความฉลาด82การเขียนโค้ด
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 ต่อ 1 ล้านโทเค็น · 52 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 ต่อ 1 ล้านโทเค็น · 250 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642ความฉลาด72การเขียนโค้ด
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 ต่อ 1 ล้านโทเค็น · 231 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845ความฉลาด75การเขียนโค้ด
- obsidianQwen3.8 27B2026-08-1534ความฉลาด68การเขียนโค้ด
โมเดลสองตัวในบทเปรียบเทียบนี้แทบจะเหมือนกันบนกระดาษ และในทางปฏิบัติกลับแตกต่างกันอย่างสิ้นเชิง Mistral Large 4เป็น sparse mixture-of-experts ขนาด 1.05 ล้านล้านพารามิเตอร์ ที่มีพารามิเตอร์ใช้งานจริง 49 พันล้านพารามิเตอร์ ประกาศเมื่อวันที่ 6 ตุลาคม 2026 DeepSeek V4 Proเป็น sparse mixture-of-experts ขนาด 1.6 ล้านล้านพารามิเตอร์ ที่มีพารามิเตอร์ใช้งานจริง 49 พันล้านพารามิเตอร์ เปิดตัวเมื่อวันที่ 24 เมษายน 2026 งบประมาณการเปิดใช้งานเท่ากัน ตระกูลสถาปัตยกรรมเดียวกัน คำกล่าวอ้างเรื่องประสิทธิภาพระดับแนวหน้าที่ต้นทุนแบบโมเดลน้ำหนักเปิดเหมือนกัน — และมีเพียงหนึ่งเดียวในนั้นที่มีน้ำหนักให้ดาวน์โหลดได้ในวันนี้
การจับคู่นี้ไม่ใช่สิ่งที่บทความนี้คิดขึ้นมาเอง โพสต์เปิดตัวของ Mistral เองก็วัดประสิทธิภาพเทียบกับ DeepSeek V4 Pro โดยเอ่ยชื่อในสามจุดแยกกัน ได้แก่ การเขียนโค้ดแบบเอเจนต์ งานความรู้ระยะยาว และระบบอัตโนมัติสำหรับเวิร์กโฟลว์ทางธุรกิจ การถามคำถามเดียวกันกับอีกฝ่าย — ว่า DeepSeek V4 Pro ทำอะไรได้แล้วบ้างซึ่ง Mistral Large 4 กำลังสัญญาว่าจะทำได้ — กลายเป็นวิธีที่เร็วที่สุดในการดูว่า preview นี้เพิ่มอะไรเข้ามาจริง ๆ
ข้อกำหนด เทียบเคียงกัน
อ่านเมื่อวันที่ 6 ตุลาคม ตัวเลขของ Mistral จากประกาศและโมเดลการ์ดของตัวเอง ส่วนของ DeepSeek จากรายการแค็ตตาล็อกสด:
• พารามิเตอร์ทั้งหมดเทียบกับพารามิเตอร์ที่ใช้งาน — 1.05T ทั้งหมด / 49B ที่ใช้งาน เทียบกับ 1.6T ทั้งหมด / 49B ที่ใช้งาน
• รูปแบบข้อมูล — ป้อนข้อความและรูปภาพ ออกเป็นข้อความ เทียบกับข้อความเท่านั้น
• หน้าต่างบริบท — Mistral ระบุไว้ 1M, 524,288 บนการตั้งค่าที่ Artificial Analysis กำลังทดสอบ เทียบกับ 1M ที่ให้บริการจริง
• เพดานเอาต์พุต — ไม่เปิดเผยสำหรับเวอร์ชันพรีวิว เทียบกับ 384K โทเคน
ราคาต่อล้าน, อินพุต / เอาต์พุต — $1.36 / $4.18 ตามราคาปกติ, ปัจจุบัน $0.68 / $2.09 ในโปรโมชัน, เทียบกับ $0.66 / $1.98
อินพุตแคชต่อล้าน — $0.14, ปัจจุบัน $0.07, เทียบกับ $0.022
• เวท — สัญญาว่าจะมีภายในปลายเดือนตุลาคม, ไม่ระบุชื่อสัญญาอนุญาต เทียบกับพร้อมใช้งานแล้วตอนนี้
• โครงสร้างพื้นฐานการเทรน — 3,800 NVIDIA Grace Blackwell ในศูนย์ข้อมูลยุโรปของ Mistral เอง เทียบกับคลัสเตอร์ของ DeepSeek

ความสมมาตรของตัวเลขการเปิดใช้งาน 49B เป็นทั้งพาดหัวข่าวและกับดัก พารามิเตอร์ที่ทำงานอยู่เป็นตัวกำหนดว่าโทเค็นหนึ่งตัวมีต้นทุนเท่าใดในการสร้าง ส่วนพารามิเตอร์ทั้งหมดเป็นตัวกำหนดว่าโมเดลรู้อะไร 1.6T ของ DeepSeek เทียบกับ 1.05T ของ Mistral หมายความว่า DeepSeek มีความจุต่อโทเค็นที่คำนวณได้มากกว่าประมาณ 50% — เป็นข้อได้เปรียบจริงในงานที่เน้นความรู้ และไม่มีข้อได้เปรียบเลยในงานที่คอขวดคือการทำตามคำสั่งหรือการใช้เครื่องมือ
สิ่งที่ดัชนีอิสระกล่าว
ทั้งสองโมเดลมีหน้าอยู่บน Artificial Analysis ซึ่งทำให้การเปรียบเทียบนี้เป็นหนึ่งในไม่กี่รายการในซีรีส์ที่ทั้งสองฝ่ายถูกวัดบนชุดทดสอบเดียวกัน Intelligence Index v4.3 อ่านเมื่อ 6 ตุลาคม:
• ดัชนีสติปัญญา — 38.4 สำหรับ Mistral Large 4 Preview เทียบกับ 36.0 สำหรับ DeepSeek V4 Pro 0813
• ต้นทุนต่องานจัดทำดัชนี — $1.13 เทียบกับ $0.67
• Terminal-Bench 4.0 — 26.8% เทียบกับ 14.1%
• Humanity's Last Exam — 35.0% เทียบกับ 41.0%
• AutomationBench, เวิร์กโฟลว์ทางธุรกิจ — 59.9% เทียบกับ 56.7%
• τ²-Bench, ความสามารถเชิงเอเจนต์ด้านการใช้เครื่องมือ — ยังไม่เผยแพร่สำหรับพรีวิว เทียบกับ 96.2%
• SciCode — 54.2% vs 51.0%
การแข่งขันนี้สูสีกันมากกว่าที่ป้ายราคาบ่งบอกไว้มาก และความเห็นที่ไม่ตรงกันก็ให้ข้อมูลที่เป็นประโยชน์มากกว่าเป็นเพียงเสียงรบกวน Mistral Large 4 ชนะในหมวดการเขียนโค้ดแบบเอเจนต์ด้วยคะแนนนำเกือบสิบสามจุด และชนะในหมวดระบบอัตโนมัติเวิร์กโฟลว์อย่างเฉียดฉิว ขณะที่ DeepSeek V4 Pro ชนะในหมวดความรู้แบบเปิดกว้างด้วยคะแนนนำหกจุด และมีต้นทุนต่องานต่ำกว่า 40% ขอให้สังเกตด้วยว่าดัชนีนี้กระจายต้นทุนไปยังการอ่านแคช การเขียนแคช โทเคนการให้เหตุผล และโทเคนคำตอบ — แคชของ Mistral ได้ส่วนลด 90% ในขณะที่แคชของ DeepSeek ได้ส่วนลด 97% จึงเป็นเหตุผลว่าทำไมสองโมเดลที่มีอัตราราคาแสดงไว้ใกล้เคียงกันจึงลงเอยที่ $1.13 และ $0.67 ต่องานที่เสร็จสมบูรณ์

จุดที่ DeepSeek V4 Pro ชนะไปแล้ว
ความแตกต่างที่ชี้ขาดไม่ใช่ผลทดสอบ benchmark แต่คือวันนี้ DeepSeek V4 Pro เป็นแบบ open-weight ขณะที่ Mistral Large 4 เป็นเพียงพรีวิวที่ให้บริการจากฝั่งผู้สร้าง Mistral กล่าวว่าเวตจะพร้อมภายในสิ้นเดือนกรกฎาคม — ซึ่งเป็นคำมั่นสัญญา ไม่ใช่สิ่งที่ส่งมอบจริง องค์กร Hugging Face ของ它 เมื่อตรวจสอบเมื่อวันที่ 6 ไม่มีอะไรใหม่กว่าเดือนกรกฎาคม จนกว่าจะมี repository ปรากฏขึ้นพร้อมไฟล์ใบอนุญาต ข้อโต้แย้งเรื่องการติดตั้งใช้งานเองที่ Mistral กำลังกล่าวอ้างก็เป็นของ DeepSeek
ความแตกต่างประการที่สองคือความกว้างของความพร้อมใช้งาน DeepSeek V4 Pro สามารถกำหนดเส้นทางได้ตั้งแต่เดือนเมษายน และเป็นโมเดลที่ถูกใช้งานมากที่สุดในแคตตาล็อกของเราเองอย่างท่วมท้น — 1.13 พันล้านโทเค็นในช่วงเจ็ดวันล่าสุด ณ เวลาที่เขียน เทียบกับหลักสิบล้านที่โมเดลระดับแนวหน้าทั่วไปประมวลผล ปริมาณดังกล่าวมีความสำคัญต่อผู้ซื้อในแบบที่กระดานจัดอันดับทำไม่ได้: นั่นหมายความว่ารูปแบบความล้มเหลวเป็นที่รู้จัก ลักษณะเฉพาะของ throughput เป็นที่รู้จัก และผู้ให้บริการที่รองรับโมเดลนี้ได้ผ่านการทดสอบความเครียดจากทราฟฟิกโปรดักชันของผู้อื่นมาแล้ว
DeepSeek ยังชนะในเรื่องกลไกพื้นฐานที่น่าเบื่อด้วย เพดานเอาต์พุต 384K เทียบกับของอีกฝ่ายที่ไม่ได้เปิดเผย คอนเท็กซ์ 1M ที่ให้บริการจริง ไม่ใช่แค่ประกาศไว้ และขอบเขตแบบข้อความล้วนที่ทำให้ปริมาณงานคอนเท็กซ์ยาวคาดการณ์ได้ หากเวิร์กโหลดของคุณคือการวิเคราะห์เอกสาร การสร้างเนื้อหารูปแบบยาว หรือการสกัดข้อมูลที่ใช้ความรู้จำนวนมหาศาลเกินหนึ่งล้านโทเคน DeepSeek V4 Pro ถูกกว่า เปิดกว้างกว่า และมีหลักฐานพิสูจน์มากกว่า Mistral preview ในทุกมิติ
ในกรณีที่ Mistral Large 4 เป็นตัวเลือกที่ดีกว่า
Mistral เลือกแถวที่ใช้ benchmarking อย่างรอบคอบ และช่องว่างด้านการเขียนโค้ดไม่ใช่เรื่องผิวเผิน 26.8% เทียบกับ 14.1% บน Terminal-Bench 4.0 นั้นมากกว่าประมาณสองเท่า และสอดคล้องกับคำกล่าวอ้างของ Mistral ที่ว่า 61.7% บน DeepSWE v1.1 และ 59.4% บน SWE-Atlas-QnA — ตัวเลขที่ Mistral บอกว่า Artificial Analysis ประเมินแบบส่วนตัวก่อนการเปิดตัวฮาร์เนสต่อสาธารณะ ซึ่งเป็นเหตุผลว่าทำไมตัวเลขเหล่านี้จึงยังไม่อยู่ในดัชนีสาธารณะ เมื่อตัวเลขเหล่านั้นเผยแพร่ หรือไม่เผยแพร่ จะเป็นตัวตัดสินคำถามเรื่องการเขียนโค้ด
ความสามารถหลายรูปแบบเป็นจุดแบ่งแยกชัดเจนจุดที่สอง Mistral Large 4 รับภาพได้โดยตรงในตัว ด้วยตัวเข้ารหัสภาพเฉพาะทางขนาด 1.6B และ Mistral อ้างว่ามีความสามารถด้านการอ้างอิงเชิงภาพระดับสูงสุดในบรรดาโมเดลเปิด โดยระบุคะแนน 42% เทียบกับ 41% ของ GPT-6 Astra บน Dense 200 ส่วน DeepSeek V4 Pro เป็นแบบข้อความล้วน และการ์ดในแคตตาล็อกก็ระบุไว้ตรงๆ ไปป์ไลน์ใดก็ตามที่เกี่ยวข้องกับภาพหน้าจอ แบบวิศวกรรม เอกสารที่สแกน หรือการอ่านแผนภูมิ มีตัวเลือกเพียงหนึ่งเดียวที่นี่ ไม่ใช่สอง
และจากนั้นก็มีด้านไซเบอร์ ซึ่งข้ออ้างของ Mistral นั้นคมชัดกว่าสิ่งใดที่ DeepSeek เผยแพร่: 82% ในการทดสอบ Artificial Analysis Cyber Index ที่ให้โมเดลจำลองช่องโหว่จริงและแพตช์มัน กล่าวกันว่าเป็นค่าสูงสุดของโมเดลใด ๆ และ 93% ในแบบฝึกหัดการแข่งขันของ Cybench ตัวเลขเหล่านั้นเป็นตัวเลขที่ผู้ขายอ้างอิง และควรติดป้ายกำกับว่าเป็นเช่นนั้น — แต่พวกมันอยู่บนดัชนีอิสระ และไม่มีผลลัพธ์ของ DeepSeek ที่เทียบเคียงได้ถูกเผยแพร่ สำหรับงานด้านความปลอดภัย จุดยืนที่ซื่อสัตย์คือ Mistral Large 4 กำลังอ้างว่ามีความนำหน้า ซึ่งยังไม่ถูกแสดงว่าเป็นเท็จ
ความแตกต่างข้อสุดท้ายคือเรื่องเขตอำนาจศาล Mistral ฝึกโมเดลนี้บน GPU Grace Blackwell จำนวน 3,800 ตัวในศูนย์ข้อมูลของตนเองในยุโรป และให้บริการพรีวิวที่นั่น โดยมีการติดตั้งใช้งานในยุโรปที่ดำเนินการแบบครบวงจรภายใต้กฎหมายยุโรป สำหรับผู้ซื้อในยุโรปที่อยู่ภายใต้การกำกับดูแล ซึ่งทางเลือกอื่นคือโมเดลแบบเปิดน้ำหนักของจีนหรือโมเดลแบบปิดของสหรัฐฯ นั่นถือเป็นหมวดหมู่เฉพาะตัวในตัวเอง
ราคา อ่านให้ถูกต้อง
ราคาติดป้ายของทั้งสองโมเดลไม่ใช่เรื่องราวทั้งหมด รายการในแค็ตตาล็อกของ DeepSeek V4 Pro มีช่วงเวลาที่กำหนดไว้สองช่วง — 01:00–04:00 และ 06:00–10:00 UTC — ซึ่งอัตราที่ระบุไว้จะถูกคูณ ดังนั้นงานที่ตกอยู่ในช่วงเวลาเหล่านั้นจะมีค่าใช้จ่ายเป็นสองเท่าของราคาที่ประกาศไว้ $0.68 / $2.09 ของ Mistral Large 4 เป็นโปรโมชันเปิดตัวเมื่อเทียบกับเรตการ์ด $1.36 / $4.18 โปรโมชันคือราคาวันนี้ ส่วนเรตการ์ดคือราคาที่ควรใช้จำลองบิลของคุณ
จุดที่ OrcaRouter ทำให้เรื่องนี้กระจ่างก็คือการส่งผ่านราคาตรง ๆ นั่นเอง: ส่วนเพิ่ม 0% จากราคาตามรายการของผู้ให้บริการ ซึ่งหมายความว่าการลดราคาของผู้ขายก็คือการลดราคาของคุณในวันเดียวกัน และอัตราโปรโมชันของผู้ขายจะถูกส่งต่อไปให้คุณแทนที่จะถูกกลืนไว้ ส่วน DeepSeek V4 Pro นั้นเลือกเส้นทางได้แล้ววันนี้ผ่านปลายทางที่เข้ากันได้กับ OpenAI เพียงปลายทางเดียว ในอัตราของผู้ให้บริการ และใช้ข้อมูลรับรองชุดเดียวกับโมเดลอื่นอีกกว่า 200 รายการพร้อมการสลับไปยังผู้ให้บริการรายอื่นโดยอัตโนมัติเมื่อรายใดรายหนึ่งมีปัญหา Mistral Large 4 ไม่ได้อยู่ในแค็ตตาล็อกของเรา — รุ่นพรีวิวนี้เข้าถึงได้ผ่าน API ของ Mistral เองและแพลตฟอร์มของบุคคลที่สามหลายแห่ง — ดังนั้นหากคุณต้องการรันทั้งสองฝั่งของการเปรียบเทียบนี้พร้อมกันในวันนี้ นั่นหมายความว่าหนึ่งเส้นทางผ่านเราและอีกหนึ่งเส้นทางต่อตรง

เลือกอันไหนดี
ถ้าคุณต้องการเวตที่ถือครองได้เอง เอาต์พุต 384K คอนเท็กซ์ที่ให้บริการได้หนึ่งล้านโทเคน ต้นทุนต่ำที่สุดต่องานที่ทำสำเร็จเมื่อเทียบกันเป็นคู่ และโมเดลที่คนอื่น ๆ ได้หาจุดแตกหักของพฤติกรรมในโปรดักชันมาแล้ว DeepSeek V4 Pro ไม่ใช่ตัวประนีประนอม — มันคือผลิตภัณฑ์สำเร็จรูปเมื่อเทียบกับตัวอย่างหนัง มันเป็นค่าเริ่มต้นที่เหมาะสมสำหรับงานเอกสาร งานองค์ความรู้ และงานรูปแบบยาว และการเปิดเวตของมันหมายความว่าเพดานของสิ่งที่คุณทำได้ด้วยมันคือโครงสร้างพื้นฐานของคุณเอง ไม่ใช่แผนงานของผู้ขาย
ถ้าภาระงานของคุณคือการเขียนโค้ดแบบเอเจนต์ ถ้ามันเกี่ยวข้องกับภาพ ถ้ามันเกี่ยวข้องกับงานด้านความปลอดภัย หรือถ้าเขตอำนาจศาลยุโรปเป็นข้อกำหนด而非ตัวเลือก Mistral Large 4 คือโมเดลที่คุ้มค่ากับความเสี่ยงจากการใช้เวอร์ชันพรีวิว — และความเสี่ยงนั้นมีขอบเขตจำกัด เพราะ Mistral ได้ผูกมัดเรื่องน้ำหนักโมเดลและช่วงเวลา red-teaming ที่มีกำหนดสิ้นสุดชัดเจนไว้แล้ว ตอนนี้ลองส่งทราฟฟิกส่วนหนึ่งไปที่มัน ให้ DeepSeek V4 Pro รับส่วนที่เหลือ และปล่อยให้ทั้งสองตัดสินคำถามเรื่องสถาปัตยกรรมจากข้อมูลของคุณ งบประมาณการเปิดใช้งาน 49B จะดูเหมือนกันไม่ว่าจะมองจากฝั่งไหน สิ่งที่ต่างคือทุกอย่างที่อยู่รอบๆ มัน
การเปรียบเทียบในบทความนี้2
ตรวจพบจากบทความนี้ · เบนช์มาร์ก: Artificial Analysis · อัปเดตทุกวัน
