
Mistral Large 4 vs Gemini 3.1 Pro: แปดเดือน สองทิศทาง
- openaiใหม่OpenAI: GPT-6.1 Sol2026-09-2952ความฉลาด
- anthropicใหม่Anthropic: Claude Sonnet 5.52026-09-2856ความฉลาด
- typesafeใหม่TypeSafe: Jev 1.132026-09-24$0.04 / $0.00 ต่อ 1 ล้านโทเค็น · 151 tok/s
- OpenAIใหม่OpenAI: GPT-6 Luna2026-09-2238ความฉลาด
- OpenAIใหม่OpenAI: GPT-6 Sol2026-09-2248ความฉลาด
- Anthropicใหม่Anthropic: Claude Opus 5.52026-09-2258ความฉลาด
- xAIGrok 4.72026-09-2146ความฉลาด
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 ต่อ 1 ล้านโทเค็น · 120 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 ต่อ 1 ล้านโทเค็น · 1202 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040ความฉลาด
- OpenAIOpenAI: GPT-6 Astra2026-09-0453ความฉลาด77การเขียนโค้ด
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241ความฉลาด76การเขียนโค้ด
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245ความฉลาด76การเขียนโค้ด
- AnthropicAnthropic: Claude Fable 5.12026-09-0153ความฉลาด82การเขียนโค้ด
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 ต่อ 1 ล้านโทเค็น · 52 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 ต่อ 1 ล้านโทเค็น · 250 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642ความฉลาด72การเขียนโค้ด
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 ต่อ 1 ล้านโทเค็น · 231 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845ความฉลาด75การเขียนโค้ด
- obsidianQwen3.8 27B2026-08-1534ความฉลาด68การเขียนโค้ด
Gemini 3.1 Pro วางตลาดมาตั้งแต่วันที่ 19 กุมภาพันธ์ 2026 และยังคงติดอันดับต้น ๆ ของตารางความสามารถแบบกว้างทุกตาราง รวมถึงตารางที่นำไปเปรียบเทียบกับโมเดลที่เปิดตัวในฤดูใบไม้ร่วงปีนี้ Mistral Large 4 มีอายุอย่างมากไม่เกินสามสัปดาห์ — เป็นเวอร์ชันพรีวิวที่ประกาศเมื่อวันที่ 6 ตุลาคม 2026 โดยสัญญาว่าจะปล่อยเวตภายในสิ้นเดือนตุลาคม และยังไม่มีการระบุชื่อสัญญาอนุญาต บนดัชนี Intelligence Index ของ Artificial Analysis ซึ่งอ่านเมื่อวันที่ 6 ตุลาคม Gemini 3.1 Pro ที่มีอายุแปดเดือนได้คะแนน 29.7 เทียบกับ 38.4 ของผู้มาใหม่ นี่คือจุดเริ่มต้นที่ซื่อตรงสำหรับการเปรียบเทียบนี้ และมันให้ผลตรงกันข้ามกับสิ่งที่วันที่เปิดตัวบ่งชี้
คำอธิบายไม่ใช่เรื่องลึกลับ Gemini 3.1 Pro เป็นเรือธงในสายพรีวิวที่ Google ไม่เคยผลักดันให้เป็นเวอร์ชันเสถียร และหน้าของ Artificial Analysis สำหรับโมเดลนี้ติดป้ายว่า "Gemini 3.1 Pro Preview" — หน้าเดียวกันกับที่ดัชนีที่ต่ำกว่าอยู่ข้าง ๆ GPQA Diamond ระดับท็อป มันเป็นโมเดลที่สร้างมาเพื่อความกว้าง: หน้าต่างบริบทขนาดใหญ่มาก ชุดมอดัลลิตี้ที่หลากหลาย และการให้เหตุผลที่แข็งแกร่งในคำถามด้านความรู้ Mistral Large 4 ถูกสร้างมาเพื่อแผนที่ของโลกคนละใบโดยสิ้นเชิง และตั้งราคาไว้ให้สอดคล้องกัน
แต่ละอย่างคืออะไร
Gemini 3.1 Pro เป็นโมเดลการให้เหตุผลแบบหลายรูปแบบระดับแนวหน้าของ Google มี API id คือ gemini-3.1-pro-preview พร้อมหน้าต่างบริบทขนาด 1,048,576 โทเคน และเพดานเอาต์พุต 65,536 โทเคน รองรับข้อความ รูปภาพ วิดีโอ เสียง และไฟล์ ให้บริการผ่านแค็ตตาล็อกของ OrcaRouter ในอัตราค่าบริการของ Google เอง เอกสารของ Google ไม่ได้ระบุ Gemini 3.1 Pro เวอร์ชันที่ไม่ใช่ preview ไว้เลย ชื่อ preview คือชื่อผลิตภัณฑ์
Mistral Large 4 เป็นโมเดล sparse mixture-of-experts ขนาด 1.05 ล้านล้านพารามิเตอร์ ที่มีพารามิเตอร์ที่ใช้งานอยู่ 49,000 ล้านพารามิเตอร์ และมี vision encoder ขนาด 1.6 พันล้านพารามิเตอร์โดยเฉพาะ เปิดให้บริการในชื่อ "Mistral Large 4 Preview" ภายใต้ API id mistral-large-4-0 เอกสารของ Mistral ระบุว่ามี context window ขนาด 1 ล้านโทเคน ส่วน Artificial Analysis วัดค่าได้ 524,288 บนคอนฟิกูเรชันที่กำลังทดสอบ ขนาดเอาต์พุตสูงสุดยังไม่มีการเผยแพร่ Mistral อธิบายว่าเป็นโมเดลที่ใหญ่และมีความสามารถสูงสุดเท่าที่บริษัทเคยมี และระบุว่าเวตจะเปิดให้ใช้งานในช่วงปลายเดือนตุลาคม
ตัวเลข พร้อมที่มาแนบมาด้วย
โมเดลทั้งสองมีหน้าแยกกันของตัวเอง ดังนั้นการเปรียบเทียบด้านล่างนี้จึงเป็นแบบฮาร์เนสเดียวกัน มากกว่าจะเป็นการเปรียบเทียบระหว่างผู้จำหน่ายกับผู้จำหน่าย:
• ดัชนี Intelligence Index v4.3 — Mistral Large 4 Preview 38.4 เทียบกับ Gemini 3.1 Pro 29.7
• ต้นทุนต่องานจัดทำดัชนี — $1.13 เทียบกับ $1.30
• การให้เหตุผลแบบบริบทยาว — 81.3% เทียบกับ 82.0%
• GPQA Diamond — ไม่ได้เผยแพร่สำหรับเวอร์ชันพรีวิว เทียบกับ 94.1%
• การสอบสุดท้ายของมนุษยชาติ — 35.0% กับ 47.0%
• Terminal-Bench 4.0 — 26.8% เทียบกับ 4.0%
• SciCode — 54.2% เทียบกับ 58.7%
• AutomationBench, เวิร์กโฟลว์ทางธุรกิจ — 59.9% vs 35.4%
• MMMU-Pro การให้เหตุผลแบบหลายโมดัล — 76.4% เทียบกับ 82.4%
• หน้าต่างบริบท — ระบุ 1M / ทดสอบ 524,288 เทียบกับให้บริการ 1,048,576
• เพดานเอาต์พุต — ไม่เปิดเผย เทียบกับ 65,536 โทเค็น
• ราคาต่อล้าน, อินพุต / เอาต์พุต — $1.36 / $4.18 ราคาปกติ, $0.68 / $2.09 ราคาโปรโมชัน, เทียบกับ $2.00 / $12.00 สำหรับต่ำกว่า 200K โทเค็น และ $4.00 / $18.00 สำหรับมากกว่า
• เวท — ให้คำมั่นไว้, ไม่ระบุชื่อสัญญาอนุญาต, เทียบกับกรรมสิทธิ์

แถวที่สะดุดตาที่สุดเพียงแถวเดียวคือ Terminal-Bench 4.0 Gemini 3.1 Pro ได้ 4.0% — ไม่ใช่พิมพ์ผิด และไม่ใช่ภาพลวงตาในตาราง: มันสะท้อนว่าโมเดลจากเดือนกุมภาพันธ์ถูกนำไปรันบน terminal-agent harness ที่เกิดขึ้นหลังโมเดลนั้น 26.8% ของ Mistral Large 4 สูงกว่าถึงหกเท่าในการทดสอบเดียวกัน ใครก็ตามที่ตัด Gemini ออกโดยอ้างตัวเลข agentic-coding เก่า ๆ ควรนำมันกลับมาพิจารณาจาก GPQA Diamond ของมัน และใครก็ตามที่ตัด Mistral ออกเพราะอันดับในดัชนี ควรดูแถวเทอร์มินัลก่อน
จุดที่ Gemini 3.1 Pro ยังได้เปรียบอยู่
ความรู้และความกว้างขวาง GPQA Diamond ที่ 94.1% เป็นตัวเลขที่สูงที่สุดในบทความนี้ ไม่ว่าจะฝั่งใด และมันเป็น benchmark วิทยาศาสตร์ระดับบัณฑิตศึกษา ไม่ใช่ตัวเลขที่โมเดลจะพูดจนได้มา Humanity's Last Exam ที่ 47.0% เทียบกับ 35.0% และคะแนน SciCode ที่เฉือนเอาชนะผู้มาใหม่ บอกเรื่องเดียวกัน หากภาระงานของคุณคือการตอบคำถามยาก ๆ อย่างแม่นยำจากคลังความรู้ Gemini 3.1 Pro ยังคงเป็นโมเดลที่แข็งแกร่งกว่าแม้จะเปิดตัวมาแล้วแปดเดือน
ความกว้างของโมดาลิตี้เป็นข้อได้เปรียบอันดับที่สอง Gemini 3.1 Pro รองรับทั้งวิดีโอและเสียง ตลอดจนข้อความและรูปภาพ Mistral Large 4 รองรับข้อความและรูปภาพ หากไปป์ไลน์ของคุณนำเข้าข้อมูลจากการประชุมที่บันทึกไว้ การบันทึกหน้าจอ หรือเสียงจากเซ็นเซอร์ มีเพียงโมเดลเดียวเท่านั้นที่สามารถมองเห็นข้อมูลนำเข้าทั้งหมดได้
เพดานเอาต์พุตคือประเด็นที่สาม 65,536 โทเคนเป็นเพดานที่ประกาศไว้และรับประกันได้ ส่วน Mistral ยังไม่ได้ประกาศเพดานดังกล่าวสำหรับเวอร์ชันพรีวิวเลย ไม่มีสิ่งใดในโพสต์เปิดตัวที่จะกัดคุณในสภาพแวดล้อมโปรดักชันได้มากไปกว่าขีดจำกัดเอาต์พุตที่ไม่ได้ระบุไว้
และหน้าต่างบริบทของ Gemini นั้นให้บริการจริงที่ 1,048,576 โทเคน ขณะที่ 1M ของ Mistral เป็นตัวเลขที่ผู้ขายระบุไว้ เมื่อเทียบกับค่าที่อ่านได้อย่างอิสระที่ 524,288 สำหรับภาระงานที่อยู่ปลายสุดของหน้าต่างบริบท ความต่างระหว่างตัวเลขที่ระบุไว้กับตัวเลขที่วัดได้นั้นหมายถึงการต้องรื้อเขียนใหม่ทั้งหมด
จุดที่ Mistral Large 4 เปลี่ยนการตัดสินใจ
งานแบบเอเจนต์ และโดยเฉพาะสิ่งใดก็ตามที่เกี่ยวข้องกับเทอร์มินัล คือจุดที่โมเดลทั้งสองเริ่มเปรียบเทียบกันไม่ได้ โพสต์เปิดตัวของ Mistral เองรวบรวม 61.7% บน DeepSWE v1.1, 59.4% บน SWE-Atlas-QnA และ 28.3% บน Terminal-Bench 4.0 เข้าเป็น Coding Agent Index ที่ 49.8% และระบุอย่างชัดเจนว่าอยู่เหนือ DeepSeek V4 Pro 0813 และ Qwen3.8 Max ในการวัดรวมนั้น ตัวเลขทั้งสามนี้ ในถ้อยคำของ Mistral คือตัวเลขที่ Artificial Analysis ประเมินแบบส่วนตัวก่อนที่ชุดทดสอบของบริษัทจะเปิดเผยต่อสาธารณะ ยังไม่ปรากฏบนดัชนีสาธารณะ และควรติดป้ายว่าเผยแพร่โดยผู้ขายจนกว่าจะปรากฏ
หลักฐานอิสระชี้ไปในทิศทางเดียวกัน บน AutomationBench — เวิร์กโฟลว์ทางธุรกิจ 657 รายการที่ครอบคลุม Gmail, Sheets, Slack และ Salesforce — Mistral Large 4 ได้คะแนน 59.9% นำหน้า Kimi K3, MiMo-V2.6-Pro และ DeepSeek V4 Pro และบนชุดทดสอบเดียวกันนี้ Gemini 3.1 Pro ไม่ปรากฏเลยเพราะเบนช์มาร์กดังกล่าวเกิดขึ้นหลังจากนั้น การศึกษาแบบปกปิดโดยมนุษย์ที่ดำเนินการโดย Surge AI จัดอันดับให้ Mistral Large 4 Preview อยู่อันดับสองจากห้าโมเดลในด้านคุณภาพการเขียนโค้ดที่ 3.74 นำหน้า GLM-5.3 และ Kimi K3 และเป็นรองเพียง Claude Opus 5
ข้อกล่าวอ้างด้านไซเบอร์เป็นข้อที่คมชัดที่สุดในโพสต์ของ Mistral และควรกล่าวให้ตรงเป๊ะ: 82% ในการทดสอบ Artificial Analysis Cyber Index ซึ่งขอให้โมเดลจำลองช่องโหว่จริงแล้วแพตช์ช่องโหว่นั้น โดยระบุว่าเป็นค่าสูงสุดในบรรดาโมเดลใด ๆ พร้อม 93% ในแบบฝึกหัดการแข่งขัน 40 ข้อของ Cybench และคำยืนยันของ Mistral ว่ามันติดอันดับห้าอันดับแรกของโลกโดยรวมบน Cyber Index ขณะที่เป็นผู้นำในบรรดาโมเดลน้ำหนักเปิดที่พัฒนานอกจีน นั่นเป็นตัวเลขที่ผู้ขายอ้างอิงบนดัชนีอิสระ จุดได้เปรียบในทางปฏิบัติของมันคือ Mistral สร้างโมเดลขึ้นมาเพื่อทำงานนั้นแทนที่จะปฏิเสธ
รายการที่ถูกที่สุดในตารางก็เป็นของ Mistral เช่นกัน แต่ชนะเพียงเล็กน้อยเท่านั้น: $1.13 ต่องาน เทียบกับ $1.30 ซึ่งเป็นความได้เปรียบ 13% ที่เกิดจากอัตราโปรโมชัน และเรตการ์ดจะลบความได้เปรียบนั้นทิ้งไป Gemini 3.1 Pro เป็นโมเดลปี 2026 ที่ใช้ราคาของปี 2026 และการรันงาน index ด้วยโมเดลนี้ก็ไม่แพง
ตัวตัดสินชี้ขาดที่ไม่มีใครวัดผล
มีสองสิ่งที่กำลังมีบทบาทซึ่งตารางไม่สามารถแสดงให้เห็นได้ ประการแรกคือการออกใบอนุญาต Gemini 3.1 Pro เป็นซอฟต์แวร์กรรมสิทธิ์และจะยังคงเป็นเช่นนั้นต่อไป Mistral Large 4 เป็นพรีวิวที่จุดขายทั้งหมดคือการที่มันจะกลายเป็นไฟล์ที่ดาวน์โหลดได้ ซึ่งคุณสามารถรันได้ภายใต้นโยบายของคุณเอง บนฮาร์ดแวร์ของคุณเอง ภายใต้กฎหมายยุโรป — Mistral ฝึกมันบน GPU Grace Blackwell จำนวน 3,800 ตัวในศูนย์ข้อมูลของตัวเอง และให้บริการพรีวิวที่นั่น ข้อโต้แย้งนั้นไม่มีค่าอะไรเลยจนกว่ารีโพซิทอรีจะปรากฏขึ้นและใบอนุญาตจะมีชื่อ แต่ในวันที่สิ่งนั้นเกิดขึ้นจริง มันจะมีค่ามหาศาล

ข้อที่สองคือความเสี่ยงด้านการดำเนินงาน พรีวิวที่ยังอยู่ระหว่างการขัดเกลาจะเปลี่ยนไปโดยที่คุณตั้งตัวไม่ทัน บน OrcaRouter ทั้งสองฝั่งของการเปรียบเทียบนี้เข้าถึงได้ผ่าน endpoint เดียวที่เข้ากันได้กับ OpenAI ในราคาตามรายการของผู้ให้บริการโดยบวกกำไร 0% — Gemini 3.1 Pro พร้อมใช้งานในแค็ตตาล็อกในอัตราของ Google ส่วน Mistral Large 4 ต้องเข้าถึงผ่าน API ของ Mistral เองและแพลตฟอร์มของบุคคลที่สามหลายแห่ง เนื่องจากไม่ใช่เส้นทางที่เรารองรับ ชิ้นส่วนที่มีประโยชน์ตรงนี้คือ routing DSL: ส่งงานจำแนกประเภทและการสกัดข้อมูลไปยังโมเดลใดก็ตามที่ถูกกว่าในสัปดาห์นั้น ยกระดับงานยากส่วนที่เหลือขึ้นไป และปล่อยให้การสลับสำรองอัตโนมัติรองรับวันที่แย่ ๆ ของพรีวิว แทนที่ตารางเวร on-call ของคุณจะต้องมารองรับสิ่งเหล่านั้น

คำตัดสิน
ถามว่าภาระงานคืออะไร ไม่ใช่ถามว่าโมเดลไหนดีกว่า สำหรับงานความรู้ อินพุตเสียงและวิดีโอ เพดานเอาต์พุตที่รับประกันได้ และหน้าต่างหนึ่งล้านโทเคนที่ให้บริการ Gemini 3.1 Pro ยังคงเป็นโมเดลที่แข็งแกร่งกว่า และอายุของมันไม่ใช่ข้อบกพร่อง — มันคือแปดเดือนที่คนอื่นค้นหาขอบเขตของมัน สำหรับการเขียนโค้ดแบบเอเจนติก งานเทอร์มินัล และการปฏิบัติการด้านความปลอดภัย Mistral Large 4 นำอยู่ด้วยระยะห่างที่กว้างพอจนอันดับในดัชนีทำให้เข้าใจผิด และเป็นหนึ่งในสองตัวเดียวที่อาจจะโฮสต์เองได้ในที่สุด
ตัวชี้ขาดที่ต้องจับตาคือปลายเดือนตุลาคม หากเวตมาภายใต้สัญญาอนุญาตแบบผ่อนปรน Mistral Large 4 จะหยุดแข่งขันกับ Gemini 3.1 Pro ในด้านราคา และเริ่มแข่งขันกับมันในด้านการควบคุม และนั่นคือการต่อสู้ที่ต่างออกไป หากเวตมาภายใต้สัญญาอนุญาตแบบจำกัด คำตอบของบทความนี้แทบไม่เปลี่ยนไปมากนัก — แต่เหตุผลเปลี่ยนไป
การเปรียบเทียบในบทความนี้1
ตรวจพบจากบทความนี้ · เบนช์มาร์ก: Artificial Analysis · อัปเดตทุกวัน
