
Mercury 2.5 Preview เทียบกับ Gemini 3.1 Pro: สองพรีวิวที่ห่างกันหกเดือน
- googleใหม่Google: Gemini 3.8 Flash2026-09-0259ความฉลาด76การเขียนโค้ด
- qwenใหม่Qwen: Qwen3.8 Max (0902)2026-09-0258ความฉลาด72การเขียนโค้ด
- anthropicใหม่Anthropic: Claude Fable 5.12026-09-0166ความฉลาด82การเขียนโค้ด
- Alibabaใหม่Qwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 ต่อ 1 ล้านโทเค็น
- z-aiใหม่Z.ai: GLM 5.3 Flash2026-08-2658ความฉลาด72การเขียนโค้ด
- DeepSeekใหม่DeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.15 / $0.29 ต่อ 1 ล้านโทเค็น
- z-aiZ.ai: GLM 5.32026-08-1860ความฉลาด75การเขียนโค้ด
- obsidianQwen3.8 27B2026-08-1552ความฉลาด68การเขียนโค้ด
- qwenQwen: Qwen3.8 27B (free)2026-08-13qwen/qwen3.8-27b-free
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1253ความฉลาด69การเขียนโค้ด
- grokSpaceXAI: Grok 4.62026-08-1261ความฉลาด77การเขียนโค้ด
- metaMeta: Muse Spark 1.22026-08-0557ความฉลาด72การเขียนโค้ด
- qwenQwen: Qwen3.8 Max2026-08-0358ความฉลาด72การเขียนโค้ด
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3152ความฉลาด69การเขียนโค้ด
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 ต่อ 1 ล้านโทเค็น
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463ความฉลาด78การเขียนโค้ด
- googleGoogle: Gemini 3.6 Flash2026-07-2152ความฉลาด69การเขียนโค้ด
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137ความฉลาด49การเขียนโค้ด
โมเดลทั้งสองตัวในการประลองครั้งนี้ต่างมีคำว่า "preview" อยู่ในชื่อ และนั่นคือจุดที่ความคล้ายคลึงสิ้นสุดลง Mercury 2.5 Preview และ Gemini 3.1 Pro ต่างก็เป็นโมเดลให้เหตุผลที่คุณสามารถเรียกใช้ผ่าน API ได้ในวันนี้ แต่ทั้งคู่เป็นพรีวิวที่ยืนอยู่คนละฟากของช่วงอายุขัย Gemini 3.1 Pro โมเดลเรือธงด้านการให้เหตุผล อยู่ในสถานะพรีวิวตั้งแต่วันที่ 19 กุมภาพันธ์ 2026 — โดยมีผลการประเมินโดยอิสระหกเดือน การติดอันดับบนลีดเดอร์บอร์ดสาธารณะ และปริมาณการใช้งานจริงในระบบโปรดักชันอยู่เบื้องหลัง พร้อมด้วย Artificial Analysis Intelligence Index ที่ 57 ณ วันเปิดตัว การรองรับอินพุตแบบมัลติโมดัลทั้งข้อความ รูปภาพ เสียง และวิดีโอ หน้าต่างบริบทขนาด 1M token และราคา $2.00 / $12.00 ต่อล้าน token ส่วน Mercury 2.5 Preview โมเดลภาษาขนาดใหญ่แบบ diffusion (diffusion LLM) ของ Inception ที่เปิดตัวเมื่อวันที่ 31 สิงหาคม 2026 เพิ่งมีอายุได้เพียงสองวัน: เป็นโมเดลที่รองรับเฉพาะข้อความ มีบริบท 256K อ้างความเร็ว 1,107 token ต่อวินาที ราคาที่ประกาศไว้ $0.20 / $0.75 (ราว $0.04 / $0.15 หากใช้ส่วนลดจนถึงวันที่ 8 กันยายน) และไม่มีผลการวัดประสิทธิภาพโดยอิสระจากภายนอกแม้แต่รายการเดียว การเรียกทั้งคู่ว่า "preview" กลับบดบังคำถามที่แท้จริง นั่นคือ การมีความได้เปรียบจากหลักฐานเชิงประจักษ์นำหน้าถึงหกเดือนนั้นมีมูลค่าเท่าใด เมื่อเทียบกับแนวทางการสร้างข้อความที่เร็วกว่าในเชิงพื้นฐาน
แต่ละโมเดลจริงๆ แล้วคืออะไร
Gemini 3.1 Pro เป็นโมเดลเรือธงแบบปิดสำหรับการให้เหตุผลอเนกประสงค์แบบมัลติโมดัล รองรับการอ่านข้อความ รูปภาพ เสียง และวิดีโอ จัดการหน้าต่างบริบทขนาด 1M โทเคนโดยมีเพดานเอาต์พุต 64K และปรับความลึกของการให้เหตุผลแบบไดนามิก — ผู้พัฒนาอธิบายว่ามีความเข้มข้นการให้เหตุผลสี่ระดับที่ปรับตามความซับซ้อนของงาน ตัวเลขเปิดตัว — ARC-AGI-2 ที่ 77.1%, GPQA Diamond ที่ 94.3%, SWE-bench Verified ที่ 80.6%, Terminal-Bench 2.0 ที่ 68.5% — เป็นตัวเลขที่ผู้พัฒนารายงานเอง แต่ตัวเลขเหล่านี้ตั้งอยู่บนการตรวจสอบอย่างอิสระนานหกเดือน รวมถึงการวัดซ้ำโดย Artificial Analysis บนมาตราดัชนีที่เข้มงวดขึ้น ซึ่งโมเดลอ่านค่าได้ประมาณ 46.5 การวัดซ้ำเช่นนั้นคือสิ่งที่โมเดลที่โตเต็มที่พึงได้รับ: มันถูกทดสอบอย่างหนักหน่วงพอจนดัชนีต้องเข้มงวดขึ้นรอบ ๆ มัน Mercury 2.5 Preview เป็นโมเดลดิฟฟิวชัน — ซึ่งสร้างและปรับแต่งโทเคนแบบขนานแทนที่จะทีละตัว — พร้อมการให้เหตุผลที่ปรับจูนได้ การเรียกเครื่องมือแบบขนาน และ JSON ที่สอดคล้องกับสกีมา สร้างขึ้นสำหรับภาระงานที่ความหน่วงทบต้นซึ่ง Inception เอ่ยชื่อ: เอเจนต์ค้นหา ไพพ์ไลน์เสียง และซับเอเจนต์เขียนโค้ด การอ้างคุณภาพทุกข้อที่ติดมากับมัน รวมถึงการพุ่งขึ้นมากกว่า 10 จุดเหนือ Mercury 2 ล้วนเป็นของผู้พัฒนาเอง และยังไม่มีบุคคลที่สามเป็นผู้วัด

ความแตกต่างของสเปก
• ราคา — Mercury 2.5 Preview: $0.20 / $0.75 ต่อ 1M อินพุต/เอาต์พุต, ~$0.04 / $0.15 ราคาโปรโมชันถึง 8 ก.ย. Gemini 3.1 Pro: $2.00 / $12.00 ต่อ 1M โดยปรับขึ้นเป็น $4.00 / $18.00 เมื่ออินพุตเกิน 200K
• บริบท / เอาต์พุต — Mercury 2.5 Preview: บริบท 256K. Gemini 3.1 Pro: บริบท 1M, เอาต์พุตสูงสุด 64K.
• อินพุต — Mercury 2.5 Preview: ข้อความเท่านั้น. Gemini 3.1 Pro: ข้อความ, รูปภาพ, เสียง, วิดีโอ, ไฟล์.
• สถาปัตยกรรม — Mercury 2.5 Preview: LLM แบบดิฟฟิวชัน, การสร้างโทเคนแบบขนาน. Gemini 3.1 Pro: ออโตรีเกรสซีฟ, ความลึกการให้เหตุผลแบบไดนามิก.
• ความเร็ว — Mercury 2.5 Preview: อ้างความเร็ว 1,107 โทเค็น/วินาที ส่วน Gemini 3.1 Pro: ไม่มีคำกล่าวอ้างเด่นที่เทียบเคียงได้
• หลักฐาน — Mercury 2.5 Preview: รายงานจากผู้จำหน่ายเท่านั้น Gemini 3.1 Pro: AA Index 57 ตอนเปิดตัว (46.5 ในสเกลใหม่) พร้อมทั้งมีบันทึกการประเมินอิสระที่ยาวนาน

ช่องว่างพหุโมดัลคือความแตกต่างที่ชี้ขาด
สำหรับแอปพลิเคชันส่วนใหญ่ การเปรียบเทียบนี้จะยุติลงก่อนที่ราคาหรือเบนช์มาร์กจะเข้ามาเกี่ยวข้อง เพราะ Mercury 2.5 Preview ไม่สามารถมองเห็นได้ Gemini 3.1 Pro อ่านภาพหน้าจอ ไดอะแกรม เสียง และวิดีโอได้ — มันคือโมเดลที่คุณเล็งไปที่ไฟล์ PDF แผนภูมิ บันทึกการประชุม หรือ UI เมื่อต้องการคำตอบเกี่ยวกับสิ่งที่ยังไม่เป็นข้อความ Mercury 2.5 Preview รองรับเฉพาะข้อความโดยการออกแบบ โมเดลภาษารูปแบบดิฟฟิวชันที่สร้างข้อความแบบขนานไม่มีช่องทางรับภาพหรือเสียงเลยแม้แต่น้อย สำหรับแอปพลิเคชันที่เน้นเอกสาร เอเจนต์ด้านภาพ หรือผลิตภัณฑ์มัลติโมดัลใดๆ ก็ตาม Gemini 3.1 Pro คือตัวเลือกเดียวเท่านั้น ณ จุดนี้ จบ ข้อจำกัดแบบข้อความเท่านั้นของ Mercury 2.5 Preview ไม่ใช่ข้อแม้เล็กน้อยที่ซ่อนในรายละเอียดปลีกย่อย แต่มันคือเส้นแบ่งที่กำหนดว่าเวิร์กโหลดรูปแบบใดบ้างที่โมเดลนี้มีสิทธิ์รับผิดชอบได้
การทดสอบหกเดือนเทียบกับสองวัน
เมื่อดูจากหลักฐาน นี่ไม่ใช่การแข่งขัน และจำเป็นต้องพูดให้ชัดว่าเพราะเหตุใด Gemini 3.1 Pro ถูกแยกวิเคราะห์โดยแล็บอิสระมาเป็นเวลาหกเดือน คะแนนของมันถูกวางไว้ ถูกวัดซ้ำ และถูกถกเถียง ซึ่งนั่นคือสิ่งที่คำว่า "trustworthy" มีหน้าตาเป็นอย่างไรสำหรับโมเดล Mercury 2.5 Preview มีแหล่งข้อมูลเพียงแหล่งเดียว — นั่นคือผู้สร้างมัน — และแหล่งนั้นอ้างว่ามีการก้าวกระโดดทางสติปัญญามากกว่า 10 จุดเหนือ Mercury 2 และความเท่าเทียมกับชั้นที่ปรับต้นทุนให้เหมาะสมของโมเดลระดับแนวหน้า ข้ออ้างทั้งสองอาจเป็นจริงก็ได้ ไม่มีใครภายนอก Inception ยืนยัน และโมเดลใหม่เกินกว่าที่สิ่งนั้นจะเป็นอย่างอื่นนอกเหนือจากที่คาดหวัง ความไม่สมดุลไม่ได้อยู่ที่ว่าใครดีกว่า แต่อยู่ที่ฝ่ายหนึ่งรู้ได้ แต่อีกฝ่ายหนึ่งยังรู้ไม่ได้
จุดที่ความเร็วของดาวพุธชนะจริงๆ
กรณีที่ตรงไปตรงมาสำหรับ Mercury 2.5 Preview นั้นแคบ เป็นข้อความล้วน และเป็นจริง การสร้างโทเคนแบบขนานเปลี่ยนสมการความหน่วงในแบบที่โมเดลออโตรีเกรสซีฟไม่มีทางตามทัน — รวมถึง Gemini 3.1 Pro — เพราะโมเดลออโตรีเกรสซีฟทำงานเป็นลำดับโดยโครงสร้าง สำหรับไปป์ไลน์เสียง ความตลกก็คืออินพุตและเอาต์พุตเป็นเสียง แต่การคิดระหว่างทั้งสองเป็นข้อความ: ชั้นการให้เหตุผลแบบข้อความที่เร็วคือสิ่งที่ทำให้เอเจนต์เสียงรู้สึกตอบสนองทันที สำหรับเอเจนต์ค้นหาที่เรียกเครื่องมือซ้ำ ๆ และสำหรับซับเอเจนต์เขียนโค้ดที่ยิงคอมพลีชันเล็ก ๆ หลายครั้งต่อหนึ่งงาน ความหน่วงต่อการเรียกแต่ละครั้งสะสมกลายเป็นความเร็วที่รับรู้ได้ ที่ราคาเปิดตัว — $0.04 ขาเข้า $0.15 ขาออก — Mercury 2.5 Preview ถูกกว่าเรตเอาต์พุตมาตรฐานของ Gemini 3.1 Pro ประมาณ 80 เท่า ซึ่งทำให้มันไม่เพียงแค่เร็วกว่า แต่เป็นคลาสต้นทุนที่แตกต่างสำหรับการให้เหตุผลแบบข้อความปริมาณมาก ข้อแม้ที่ต้องมาพร้อมกับทุกประโยคเหล่านั้น: ความเร็วเป็นเพียงการอ้างสิทธิ์ ความเท่าเทียมของคุณภาพก็เป็นเพียงการอ้างสิทธิ์ และไม่มีการวัดผลจากภายนอกที่เป็นอิสระใด ๆ เลย
ราคา: พรีเมียมบริบทระยะยาวของ Gemini เทียบกับทีเซอร์ของ Mercury
ตารางอัตราค่าบริการของ Gemini 3.1 Pro มีรายละเอียดที่ควรรู้ก่อนเปรียบเทียบตัวเลขหลัก: คำขอที่ใช้โทเคนอินพุตเกิน 200K จะขยับขั้นราคาจาก $2.00 / $12.00 เป็น $4.00 / $18.00 ต่อล้านโทเคน บนโมเดลบริบท 1M ค่าส่วนเพิ่มสำหรับบริบทยาวนี้ไม่ใช่กรณีขอบ — แต่มันคือราคาของการได้ใช้งานหน้าต่างบริบทที่ทำให้โมเดลนี้โด่งดังจริง ๆ Mercury 2.5 Preview ไม่มีขั้นราคาเช่นนั้น และบริบท 256K ของมันก็ไม่น่าจะเข้าสู่ช่วงบริบทยาวได้บ่อยครั้ง แต่ราคาต่ำของ Mercury เป็นโปรโมชันล่อใจที่หมดอายุในวันที่ 8 กันยายน ขณะที่ของ Gemini เป็นอัตราประกาศที่มั่นคง เมื่อเปรียบเทียบกัน ให้เทียบราคาปกติของ Mercury ที่ $0.20 / $0.75 กับระดับมาตรฐานของ Gemini ไม่ใช่ตัวเลขหลังหักส่วนลด — เพราะส่วนลดคือสิ่งจูงใจให้ทดลองใช้ ไม่ใช่ราคาที่จะยึดเป็นหลักในการวางแผน
การตัดสินใจเส้นทาง
ตอนนี้ทั้งสองโมเดลกำหนดเส้นทางได้แล้ว และนั่นเปลี่ยนวิธีที่คุณควรจัดการกับแต่ละโมเดล Gemini 3.1 Pro อยู่บน OrcaRouter ในชื่อ google/gemini-3.1-pro-preview ที่ราคารายการของผู้ให้บริการ โดยส่งผ่านที่ มาร์กอัป 0% ดังนั้นระดับมาตรฐานและระดับบริบทยาวจึงมีค่าใช้จ่ายเท่ากับราคาที่ผู้ให้บริการเผยแพร่ทุกประการ พร้อมกับโมเดลอื่นอีก 200+ รายการบนคีย์ API เดียว ป้าย "preview" คือสิ่งที่ควรเลี่ยงโดยการกำหนดเส้นทางมากกว่าจะนำมาเสี่ยง — แผงอัตราความผิดพลาดของหน้าโมเดลมีไว้ด้วยเหตุผลนี้ และการเฟลโอเวอร์อัตโนมัติหมายความว่าการตอบสนองของ preview ที่เสื่อมคุณภาพจะถูกส่งไปยังผู้ให้บริการรายที่สองโดยไม่ต้องแก้ไขโค้ด Mercury 2.5 Preview ยังไม่อยู่บน OrcaRouter แต่ Inception ให้บริการโมเดลนี้ผ่าน API ของตัวเองและแพลตฟอร์มภายนอกอีกหลายแห่ง โมเดลที่เพิ่งเปิดตัวได้สองวันซึ่งคุณยังไม่สามารถวางไว้หลังการเฟลโอเวอร์ได้คือตัวทดสอบ ไม่ใช่สิ่งที่ต้องพึ่งพาในระบบจริง วันที่ผู้ให้บริการลงรายการ หลักการส่งผ่านเดียวกันจะถูกนำไปใช้ และส่วนลดเปิดตัวจะมาที่นี่ในวันเดียวกัน — ซึ่งเป็นจุดที่การจับคู่นี้กลายเป็นกฎการกำหนดเส้นทาง แทนที่จะเป็นการตัดสินใจ
คำตัดสินที่ตรงไปตรงมาก็คือ พรีวิวทั้งสองตัวนี้ตอบคำถามคนละข้อกัน Gemini 3.1 Pro ตอบคำถามที่ว่า “วันนี้ฉันควรสร้างโปรดักต์ของฉันบนโมเดลตัวไหน” — มันเป็นโมเดลมัลติโมดัล รองรับบริบทยาว ผ่านการทดสอบโดยหน่วยงานอิสระ และเสถียร ในราคาที่สะท้อนคุณสมบัติทั้งหมดที่ว่า ส่วน Mercury 2.5 Preview ตอบคำถามที่ว่า “การให้เหตุผลเชิงข้อความจะเร็วได้ถึงขีดจำกัดทางกายภาพแค่ไหน” — และสถาปัตยกรรมด้านความเร็วของมันคือสิ่งที่น่าสนใจที่สุดในโมเดลนี้ ซึ่งกำลังรอให้ห้องแล็บอิสระมายืนยันว่าคุณภาพที่มาพร้อมกับความเร็วนั้นเป็นของจริงหรือไม่ ถ้าเวิร์กโหลดของคุณเป็นงานมัลติโมดัลหรืองานบริบทยาว คุณก็รู้อยู่แล้วว่าต้องเลือกตัวไหน แต่ถ้าเป็นงานข้อความล้วนที่ความหน่วงทบต้นและอ่อนไหวต่อราคา Mercury 2.5 Preview คือตัวเก็งที่น่าจับตา — และวันที่ 8 กันยายนคือวันที่ต้องเอามันไปเทียบกับคู่แข่ง

