
Mercury 2.5 เทียบกับ Mercury 2.5 Preview: โมเดลดิฟฟิวชันเดียว แต่วันเปิดตัวสองวัน
- deepseekใหม่DeepSeek: DeepSeek V4.1 Flash2026-09-1040ความฉลาด
- openaiใหม่OpenAI: GPT-6 Astra2026-09-0453ความฉลาด77การเขียนโค้ด
- googleใหม่Google: Gemini 3.8 Flash2026-09-0241ความฉลาด76การเขียนโค้ด
- qwenใหม่Qwen: Qwen3.8 Max (0902)2026-09-0240ความฉลาด72การเขียนโค้ด
- anthropicใหม่Anthropic: Claude Fable 5.12026-09-0153ความฉลาด82การเขียนโค้ด
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 ต่อ 1 ล้านโทเค็น
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642ความฉลาด72การเขียนโค้ด
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 ต่อ 1 ล้านโทเค็น
- z-aiZ.ai: GLM 5.32026-08-1845ความฉลาด75การเขียนโค้ด
- obsidianQwen3.8 27B2026-08-1534ความฉลาด68การเขียนโค้ด
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236ความฉลาด69การเขียนโค้ด
- grokSpaceXAI: Grok 4.62026-08-1244ความฉลาด77การเขียนโค้ด
- metaMeta: Muse Spark 1.22026-08-0540ความฉลาด72การเขียนโค้ด
- qwenQwen: Qwen3.8 Max2026-08-0340ความฉลาด72การเขียนโค้ด
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135ความฉลาด69การเขียนโค้ด
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 ต่อ 1 ล้านโทเค็น
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2451ความฉลาด78การเขียนโค้ด
- googleGoogle: Gemini 3.6 Flash2026-07-2134ความฉลาด69การเขียนโค้ด
นี่คือการเปรียบเทียบแบบตัวต่อตัวที่ทั้งสองฝ่ายใช้การ์ดโมเดลเดียวกัน Mercury 2.5 Preview ของ Inception ซึ่งเปิดตัวเมื่อวันที่ 31 สิงหาคม 2026 และ Mercury 2.5 ซึ่งเปิดตัวเมื่อวันที่ 8 กันยายน 2026 คือโมเดลภาษาแบบ diffusion ตัวเดียวกันที่ห่างกันแปดวัน: ช่องทางพรีวิวที่ Inception เปิดให้นักพัฒนา และเวอร์ชันโปรดักชัน "พร้อมใช้ในองค์กร" ที่เปิดตัวในอีกหนึ่งสัปดาห์ต่อมา Inception ไม่ได้เปิดเผย checkpoint ที่ต่างกัน ตัวเลขความเร็วที่ต่างกัน หรือราคาที่ต่างกันสำหรับ Mercury 2.5 — และตัวเลขที่เปลี่ยนไประหว่างการประกาศสองครั้งนั้นดูเหมือนการเก็บรายละเอียดให้เรียบร้อย ไม่ใช่โมเดลใหม่ ตัวเลข context ถูกแก้จาก 256K บนหน้าพรีวิวเป็น 260K ตอนเปิดตัว และการเพิ่มขึ้นของความฉลาดเมื่อเทียบกับ Mercury 2 ถูกปรับกรอบจาก "มากกว่า 10 คะแนน" (ในสื่อพรีวิว) เป็น "40 เปอร์เซ็นต์" (ในสื่อเปิดตัว) เอนจิน ตัวเลข 1,107 โทเคนต่อวินาที และชีตราคาเหมือนกันทั้งหมด ดังนั้นนี่ไม่ใช่การแข่งขันสเปกตามปกติ และการเติมข้อมูลฝั่งใดฝั่งหนึ่งให้ดูดีขึ้นก็ไม่ซื่อสัตย์ การเปรียบเทียบที่สำคัญระหว่างสองชื่อนี้อยู่ที่แพ็กเกจจิ้งและจังหวะเวลา: การเปิดตัวโปรดักชันเปลี่ยนอะไรจริง ๆ ป้าย Preview บอกอะไรคุณจริง ๆ และตอนนี้ควรใช้ชื่อใดในการเรียก API
ทำไมโมเดลจึงถูกเปรียบเทียบกับตัวเอง
ผู้จำหน่ายมักจะเปิดตัวโมเดลแบบพรีวิว แล้วก็ค่อย ๆ กลืนมันเข้าไปในชื่อหลักอย่างเงียบ ๆ รายการพรีวิวหายไป และไม่มีใครเขียนถึงการเปรียบเทียบ ในทางกลับกัน Inception กลับใช้สองชื่อนี้เคียงคู่กันเป็นเวลาหนึ่งสัปดาห์ และตัวตนแบบพรีวิวเพิ่งจะถูกยกเลิกในตอนนี้ — ซึ่งเป็นเหตุผลว่าทำไมการเปรียบเทียบนี้จึงมีเนื้อหา พรีวิวเป็นเส้นทางลัดที่ Inception ใช้เพื่อนำแผนการ diffusion ของมันไปเสนอต่อนักพัฒนา มันปรากฏเมื่อวันที่ 31 สิงหาคมพร้อมสเปกชุดเดียวกับที่ตอนนี้เป็นของ Mercury 2.5: โมเดล LLM แบบ diffusion (dLLM) ที่สร้างและปรับปรุงบล็อกของโทเค็นแบบขนาน แทนที่จะปล่อยโทเค็นทีละตัว; อ้างความเร็ว 1,107 โทเค็นต่อวินาทีบน GPU มาตรฐาน; อ้างเวลาถึงโทเค็นแรกต่ำกว่า 300 มิลลิวินาที; หน้าต่างบริบท 260,000 โทเค็นพร้อมเอาต์พุต 65,536 โทเค็น; ระดับการให้เหตุผลที่ปรับได้; การใช้เครื่องมือแบบเนทีฟ, การเรียกเครื่องมือแบบขนาน, และเอาต์พุตที่มีโครงสร้าง ตัวเลขทุกตัวเป็นของ Inception เอง และไม่มีห้องปฏิบัติการอิสระใดเคยวัดประสิทธิภาพโมเดลนี้เมื่อพรีวิวเปิดตัว
เมื่อวันที่ 8 กันยายน Inception เปิดตัว Mercury 2.5 ในฐานะ "ระดับถัดไปของความฉลาดสำหรับดิฟฟิวชัน LLM" และเป็นโมเดลการให้เหตุผลที่เร็วที่สุดในระบบโปรดักชัน — พร้อมสำหรับองค์กร มุ่งเป้าไปที่เอเจนต์เสียง เอเจนต์ย่อยสำหรับเขียนโค้ด การค้นหาในองค์กร และงานสนับสนุน สเปกเดียวกัน การวางตำแหน่งเดียวกัน ราคาเดียวกัน การเปิดตัวครั้งนี้ยังเปิดตัวอย่างพี่น้องสองรุ่นที่ทำให้เห็นทิศทางของ Inception ชัดเจนขึ้น: Mercury Voice คือ dLLM ที่ปรับจูนให้โทเค็นแรกต่ำกว่า 170 มิลลิวินาทีสำหรับเอเจนต์เสียง และ Mercury Router ซึ่งจัดเส้นทางพรอมต์ไปยังโมเดลต่างๆ ตามคุณภาพ ความเร็ว และต้นทุน Mercury 2.5 คือเรือธงของตระกูลที่สร้างขึ้นสำหรับงานแบบเอเจนต์ที่ไวต่อความหน่วง มากกว่าระดับคุณภาพที่ล้ำสมัย
สิ่งที่การเปิดตัวเมื่อวันที่ 8 กันยายนเปลี่ยนแปลงไปจริง ๆ
เปรียบเทียบสองชื่อทีละบรรทัด และความต่างไม่ได้อยู่ที่ตัวเครื่องยนต์ — แต่อยู่ที่ทุกอย่างที่ห่อหุ้มเครื่องยนต์อยู่:
• สถานะ — Mercury 2.5 Preview: พรีวิวแบบปิดที่อาจ "เปลี่ยนแปลงพฤติกรรมหรือความพร้อมใช้งาน" Mercury 2.5: รุ่นสำหรับการผลิตที่เปิดตัวพร้อมการให้คำมั่นเรื่องความพร้อมใช้งานระดับองค์กร ช่องทางการจัดจำหน่าย และรายการการผลิตที่ระบุวันที่
• ตัวตน — หน้าโมเดลของ Inception ตอนนี้แสดงรายการ Mercury 2.5, Mercury Voice และ Mercury Router โดยไม่มี Preview ให้เห็น และเชิงอรรถการสนับสนุนระบุชื่อ Mercury 1, Mercury 2 และ Mercury Edit 2 เป็นโมเดลที่ “ยังคงรองรับสำหรับลูกค้าปัจจุบัน” Preview ไม่ปรากฏในรายการใดเลย ในมุมมองของผู้ให้บริการ ป้ายกำกับ Preview ได้ถูกรวมเข้าเป็นส่วนหนึ่งของ Mercury 2.5 แล้ว
• เอนด์พอยต์ — แพลตฟอร์มนักพัฒนาของ Inception ให้บริการโมเดลในชื่อ mercury-2.5 และรายการในโปรดักชันที่เปิดให้บริการเมื่อวันที่ 8 กันยายนคือจุดที่รองรับการรับส่งข้อมูลใหม่ ในแคตตาล็อกที่เปิดตัว Preview เป็นครั้งแรกช่วงปลายเดือนสิงหาคม ตอนนี้ชื่อ Preview ไม่ชี้ไปยังเอนด์พอยต์ที่ให้บริการจริงอีกต่อไป ขณะที่รายการ Mercury 2.5 ซึ่งเพิ่มเมื่อวันที่ 8 กันยายนเป็นฝ่ายตอบสนองคำขอ ใครก็ตามที่เขียนโค้ดเรียกชื่อ Preview ควรเปลี่ยนไปใช้ Mercury 2.5 และตรวจสอบว่าผู้ให้บริการของคุณเรียกเก็บเงินตามอะไรจริง ๆ — ไอดีที่คุณผสานการใช้งานในสัปดาห์แรกคือไอดีที่กำลังจะถูกยกเลิก
• ราคา — รายการราคาเหมือนกันและส่วนลดเหมือนกัน ทั้งคู่คิดเงิน $0.20 ต่ออินพุตหนึ่งล้านและ $0.75 ต่อเอาต์พุตหนึ่งล้าน โดยอินพุตแบบแคชอยู่ที่ $0.02 และทั้งคู่เปิดตัวด้วยส่วนลดประมาณ 80%: $0.04 / $0.15, แบบแคช $0.004 ส่วนลดของ Preview ถูกจำกัดเวลาอย่างชัดเจนถึงวันที่ 8 กันยายน; Mercury 2.5 เปิดตัวพร้อมข้อเสนอส่วนลด 80% เดียวกัน และราคาที่ลดแล้วยังคงแสดงอยู่ในรายการโปรดักชัน ณ เวลาที่เขียนบทความนี้ นั่นคือกับดัก ซึ่งจะอธิบายเพิ่มเติมด้านล่าง
• การเริ่มต้นใช้งาน — การเปิดตัวเวอร์ชันจริงเพิ่มโควต้าโทเค็นฟรีสำหรับบัญชีนักพัฒนาใหม่ — เอกสารการเปิดตัวระบุจำนวนโทเค็น 100 ล้าน — และเปิดช่องทางการติดต่อสำหรับองค์กรซึ่งเวอร์ชันพรีวิวไม่เคยมี.
• หลักฐาน — ไม่มีการเปลี่ยนแปลง ทั้งสองชื่อไม่มีเกณฑ์ชี้วัดอิสระรองรับ และข้อกล่าวอ้างของผู้ผลิตก็เป็นข้อกล่าวอ้างชุดเดียวกันที่เปลี่ยนถ้อยคำเพียงเล็กน้อย: การก้าวกระโดดด้านความฉลาด "มากกว่า 10 คะแนน" เมื่อเทียบกับ Mercury 2 ในเอกสารตัวอย่าง กลายเป็นการเพิ่มขึ้น "40 เปอร์เซ็นต์" ในเอกสารเปิดตัว พร้อมกับข้อความระบุความเท่าเทียมกับโมเดลระดับแนวหน้าสายประหยัดต้นทุนแบบเดียวกัน (GPT-5.6 Luna ในโหมดความพยายามต่ำ, Gemini 3.5 Flash-Lite, Claude Haiku 4.5) และผลคะแนน 79% บน GPQA Diamond กับ 77% บน IFBench ที่ผู้ผลิตรายงานไว้เท่าเดิม การกล่าวอ้างซ้ำไม่ใช่การพิสูจน์ข้อกล่าวอ้าง

กับดักการตั้งราคาที่เป็นหัวใจของการจับคู่
เนื่องจากชื่อทั้งสองมีราคาขายปลีกเท่ากันและมีโปรโมชันลด 80% เท่ากัน จึงง่ายที่จะเข้าใจว่าทั้งสองมีต้นทุนเท่ากันเสมอ แต่ความจริงไม่จำเป็นต้องเป็นเช่นนั้น ส่วนลดของ Preview หยุดลงอย่างเด็ดขาดในวันที่ 8 กันยายน ขณะที่ส่วนลดเปิดตัวของ Mercury 2.5 ยังคงนับเวลาใหม่ทั้งหมด ในช่วงหนึ่งสัปดาห์ เป็นไปได้โดยสิ้นเชิงที่จะจ่าย $0.20 / $0.75 สำหรับการเรียกใช้ Preview ในขณะที่เอนจินเดียวกันตอบกลับในราคา $0.04 / $0.15 ภายใต้ชื่อโปรดักชัน — หรือมีแนวโน้มมากกว่าที่จะใช้ preview id ที่หยุดให้บริการอย่างเงียบ ๆ ในขณะที่บิลยังคงส่งมาอย่างต่อเนื่อง ส่วนลดเปิดตัวที่หมดอายุตามเอนด์พอยต์คือรายละเอียดปลีกย่อยแบบที่ทำให้เรื่องราว "รุ่นเดียวกัน ราคาเดียวกัน" กลายเป็นความแตกต่างด้านต้นทุนที่แท้จริง
ตัวเลขที่ยั่งยืนคือราคาเต็ม (list price) และคำแนะนำที่ยั่งยืนคือให้จัดงบประมาณโดยยึดราคานั้นเป็นหลัก: $0.20 / $0.75 ต่อล้าน, อินพุตแคช $0.02 — ซึ่งถูกสำหรับโมเดล reasoning ที่มี context 260K และอยู่ต่ำกว่าระดับเรือธงอย่างสบาย ๆ แต่ไม่ใช่ $0.04 / $0.15 ตามที่แบนเนอร์เปิดตัวโฆษณาไว้ ให้มองอัตราส่วนลดนี้เป็นราคาทดลองขับที่มีอายุการใช้งาน ตรวจสอบว่าผู้ให้บริการเรียกเก็บเงินตาม model id ที่ตรงกันในโค้ดของคุณ ไม่ใช่ตามชื่อบนหน้าทางการตลาด และหากคุณเริ่มใช้บน Preview ให้ย้ายไปยัง Mercury 2.5 ก่อนที่วันหมดอายุหรือ endpoint ที่เลิกใช้จะมาตัดสินใจแทนคุณ
นี่ก็คือปัญหาประเภทที่เลเยอร์การจัดเส้นทางมีไว้เพื่อขจัด โมเดลเราเตอร์ที่ส่งผ่านราคารายการของผู้ให้บริการโดยคิดมาร์กอัป 0% แสดงราคาที่ผู้ให้บริการเรียกเก็บจริง อัปเดตในวันเดียวกับที่ส่วนลดเปิดตัวเริ่มใช้หรือหมดอายุ และการเฟลโอเวอร์อัตโนมัติช่วยให้การโทรดำเนินต่อไปได้เมื่อเอนด์พอยต์ถูกยกเลิกการใช้งานเบื้องหลัง Mercury 2.5 ยังไม่ปรากฏบน OrcaRouter ในขณะที่เขียนบทความนี้ — Inception ให้บริการ Mercury 2.5 ผ่าน API ของตนเองและแพลตฟอร์มบุคคลที่สามหลายแห่ง — ดังนั้นตอนนี้หน้ารายการโมเดลของผู้ให้บริการจึงเป็นแหล่งอ้างอิงหลักของอัตรานี้ ทันทีที่ผู้ให้บริการลงรายการราคานั้น กลไกการส่งผ่านราคาเหล่านี้คือสิ่งที่คุณจะได้รับด้วยคีย์เดียว และการลดราคาหรือการหมดอายุของส่วนลดจะแสดงขึ้นในฝั่งของเราในวันเดียวกับที่มีการประกาศ
ปัญหาหลักฐานที่ทั้งสองชื่อมีร่วมกัน
กระดานคะแนนที่ตรงไปตรงมาสำหรับคู่รุ่นนี้สั้นมาก เพราะสองคอลัมน์นี้คือโมเดลเดียวกันที่ไม่มีหลักฐานพิสูจน์เหมือนกัน ทั้ง Mercury 2.5 และ Mercury 2.5 Preview ต่างไม่มีคะแนนดัชนีอิสระ ไม่มีการรันซ้ำ หรืออันดับในอารีนา ณ วันที่ 9 กันยายน 2026 คำกล่าวอ้างของ Inception เอง — การก้าวกระโดดทางปัญญาเหนือ Mercury 2 ความเทียบเท่ากับระดับ Haiku 4.5 คะแนน GPQA Diamond 79% และ 1,107 โทเคนต่อวินาที — เป็นเพียงคำพูดของบริษัท และเหมือนกันทุกประการสำหรับทั้งสองชื่อ เพราะโมเดลตัวเดียวกัน
หลักฐานอิสระชิ้นเดียวในตระกูลนี้ชี้ให้เห็นวิธีอ่านค่าการอ้างความเร็ว Artificial Analysis วัด Mercury 2 รุ่นก่อนหน้าที่ 684 โทเคนต่อวินาทีบนเอนด์พอยต์สำหรับโปรดักชัน ได้คะแนน 22 บนดัชนีความฉลาด (Intelligence Index) — ถือว่าเร็วจริงและเป็นข้อพิสูจน์ว่าแนวทางแบบดิฟฟิวชันไม่ใช่ภาพลวงตา แต่ยังห่างไกลจากประมาณ 1,000 โทเคนต่อวินาทีที่ Inception โฆษณาไว้สำหรับรุ่นนั้นบนฮาร์ดแวร์ Blackwell คาดว่าช่องว่างระหว่างตัวเลข 1,107 ของ Mercury 2.5 กับสิ่งที่เอนด์พอยต์แบบหลายผู้ใช้ร่วมกันจะส่งมอบจริงภายใต้โหลดจริงจะคล้ายคลึงกัน ข้อควรระวังเดียวกันนี้ใช้กับคุณภาพด้วย: โมเดลดิฟฟิวชันใหม่เอี่ยมที่วัดโดยผู้สร้างเพียงฝ่ายเดียว ไม่ควรเชื่อตามคำกล่าวอ้างที่ว่าจะเทียบเท่า Claude Haiku 4.5 จนกว่าบุคคลที่สามจะทดสอบจริง

แทรกเกอร์ที่เริ่มให้ความครอบคลุมการเปิดตัวครั้งนี้สะท้อนสถานการณ์ดังกล่าวได้อย่างแม่นยำ บันทึก BenchLM สำหรับ Mercury 2.5 ซึ่งโพสต์เมื่อวันที่ 8 กันยายน ไม่ได้ให้คะแนนสาธารณะหรืออันดับสาธารณะแก่โมเดลแต่อย่างใด โดยระบุตัวเลข GPQA Diamond 79% และ IFBench 77% ของ Inception อย่างชัดเจนว่าเป็นข้อมูลที่ผู้ให้บริการรายงาน และตั้งข้อสังเกตว่ายังไม่ได้มีการวัดความเร็วรันไทม์อิสระ การปรากฏรายการแรกในดัชนี Artificial Analysis การจัดอันดับใน LMArena หรือการรัน GPQA ที่ทำซ้ำได้ จะเปลี่ยน Mercury 2.5 จากข้อกล่าวอ้างให้เป็นวัตถุที่เทียบเคียงได้ — และจะใช้ได้กับทั้งสองชื่อพร้อมกัน เพราะมีโมเดลเพียงหนึ่งเดียวที่ต้องวัด

ควรเรียกชื่อไหน
• การผสานรวมแบบใหม่ ไม่มีระบบเดิม: เรียกใช้ Mercury 2.5 และไม่ต้องไปสนใจ Preview ชื่อ production นี้มีเอนจินเดียวกัน มีส่วนลดเดียวกันในตอนนี้ มีเงื่อนไขระดับองค์กรเดียวกัน และการรับประกันว่านี่คือ id ที่ผู้ให้บริการใช้งานจริง ส่วน Preview เพิ่มความเสี่ยงเรื่องความไม่เสถียรเท่านั้น ไม่มีอะไรอื่น
• ผสานรวม Preview เรียบร้อยแล้ว:ตรวจสอบวันนี้ว่าผู้ให้บริการของคุณเสิร์ฟอะไรภายใต้ชื่อนั้น และเรียกเก็บเงินเท่าไรสำหรับสิ่งนั้น เปลี่ยนไคลเอนต์ของคุณให้ชี้ไปที่ id ของ Mercury 2.5 และยืนยันอัตรา การคงชื่อ Preview ไว้ในโค้ดที่ใช้งานจริงคือการเดิมพันว่าช่องทาง preview ที่ถูกจำกัดเวลาอย่างชัดเจนจะมีอายุยืนกว่าการเลิกใช้งานของมันเอง
• ปริมาณงานระดับองค์กรหรือที่มีความสำคัญต่อการผลิต:ใช้งาน Mercury 2.5 ผ่านเส้นทางระดับองค์กรของ Inception ไม่ใช่ป้ายตัวอย่างที่ไม่มีข้อผูกพันรองรับ ความต้องการด้านเสียงและการกำหนดเส้นทางชี้ไปที่ Mercury Voice และ Mercury Router ตามลำดับ ซึ่งทั้งคู่ยังคงเป็นเวอร์ชันตัวอย่างอยู่
• ใครก็ตามที่กำลังประเมินระดับ diffusion: ทั้งสองชื่อเป็นเป้าหมายการประเมินเดียวกัน ดังนั้นให้รันการประเมินของคุณกับ Mercury 2.5 หนึ่งครั้ง แล้วถือว่าผลลัพธ์นั้นใช้ได้กับโมเดลไลน์ กำหนดงบประมาณตามราคาที่ระบุ และให้น้ำหนักกับข้อกล่าวอ้างของผู้ขายเป็นเพียงสมมติฐาน จนกว่าจะมีคะแนนจากแหล่งอิสระออกมา
ดูอะไรดี
สามสิ่งจะตัดสินคู่นี้ในอีกไม่กี่สัปดาห์ข้างหน้า ประการแรก เกณฑ์วัดอิสระครั้งแรก — การจัดอันดับในดัชนี หรือการรัน GPQA หรือ AIME ที่ทำซ้ำได้ — ซึ่งจะทดสอบข้ออ้างเรื่องความเท่าเทียมที่เป็นเดิมพันเชิงพาณิชย์ทั้งหมด ประการที่สอง ว่าอัตลักษณ์ของ Preview จะหายไปจากระบบนิเวศของโมเดลโดยสิ้นเชิงหรือไม่ ตามที่หน้าโมเดลของ Inception เองก็บอกเป็นนัยแล้ว ประการที่สาม จะเกิดอะไรขึ้นกับส่วนลดเปิดตัว 80% เมื่อจุดอ้างอิงวันที่ 8 กันยายนที่ Preview ถูกผูกไว้ได้ผ่านพ้นไปแล้ว: การขยายเวลาทำให้ Mercury 2.5 ถูกในเชิงโครงสร้าง ในขณะที่การกลับไปที่ $0.20 / $0.75 ทำให้มันแค่แข่งขันได้เท่านั้น จนกว่าจะถึงตอนนั้น คำตอบที่ถูกต้องสำหรับ "Mercury 2.5 หรือ Mercury 2.5 Preview?" คือมันคือโมเดลเดียว และคุณควรเรียกใช้ตัวที่ยังเป็นผลิตภัณฑ์อยู่
