
OpenAI o3 เทียบกับ DeepSeek V4 Pro: ยุคแห่งการให้เหตุผลระดับพรีเมียมสิ้นสุดลงตรงที่ช่องว่างด้านราคาเปิดกว้าง
- DeepSeekใหม่DeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.15 / $0.29 ต่อ 1 ล้านโทเค็น
- z-aiใหม่Z.ai: GLM 5.32026-08-1860ความฉลาด75การเขียนโค้ด
- obsidianใหม่Qwen3.8 27B2026-08-1552ความฉลาด68การเขียนโค้ด
- qwenใหม่Qwen: Qwen3.8 27B (free)2026-08-13qwen/qwen3.8-27b-free
- deepseekใหม่DeepSeek: DeepSeek V4 Pro 08132026-08-1253ความฉลาด69การเขียนโค้ด
- grokใหม่SpaceXAI: Grok 4.62026-08-1261ความฉลาด77การเขียนโค้ด
- metaMeta: Muse Spark 1.22026-08-0557ความฉลาด72การเขียนโค้ด
- qwenQwen: Qwen3.8 Max2026-08-0358ความฉลาด72การเขียนโค้ด
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3152ความฉลาด69การเขียนโค้ด
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 ต่อ 1 ล้านโทเค็น
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463ความฉลาด78การเขียนโค้ด
- googleGoogle: Gemini 3.6 Flash2026-07-2152ความฉลาด69การเขียนโค้ด
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137ความฉลาด49การเขียนโค้ด
- metaMeta: Muse Spark 1.12026-07-1653ความฉลาด71การเขียนโค้ด
- kimiMoonshotAI: Kimi K32026-07-1560ความฉลาด76การเขียนโค้ด
- openaiOpenAI: GPT-5.6 Luna2026-07-0952ความฉลาด71การเขียนโค้ด
- openaiOpenAI: GPT-5.6 Terra2026-07-0957ความฉลาด77การเขียนโค้ด
- openaiOpenAI: GPT-5.6 Sol2026-07-0961ความฉลาด77การเขียนโค้ด
การประจัญบานระหว่าง OpenAI o3 และ DeepSeek V4 Pro คือการชนกันของตัวเลขสองตัวจริงๆ OpenAI o3 ซึ่งเปิดตัวเมื่อวันที่ 16 เมษายน 2025 เป็นจุดอ้างอิงสำหรับการให้เหตุผลระดับพรีเมียม — โมเดลที่คุณยอมจ่ายเพิ่มเมื่อต้นทุนของคำตอบที่ผิดสูงกว่าต้นทุนของโทเคน DeepSeek V4 Pro ซึ่งเข้าสู่สถานะ GA ในบิลด์ 0813 เมื่อวันที่ 13 สิงหาคม 2026 หลังจากการปล่อยในตอนเย็นอย่างเงียบๆ และการเปิดตัวที่รวมถึงการถอนประกาศและการอัปโหลดน้ำหนักใหม่ เป็นโมเดลที่ทำให้ความพรีเมียมนั้นดูเหมือนความผิดพลาดเชิงหมวดหมู่: ดัชนีอิสระที่อยู่เหนือกว่าดัชนีของ o3 ในราคาประมาณหนึ่งในห้า พร้อมน้ำหนักแบบเปิดเหนือสิ่งอื่นใด และการชนกันครั้งนี้มีตราบเวลา เพราะ OpenAI o3 จะออกจาก ChatGPT ในวันที่ 26 สิงหาคม 2026 สแนปช็อต API ของมันจะตามมาในวันที่ 11 ธันวาคม และทุกสัปดาห์ของการเปรียบเทียบนี้ต่างเข้าข้างโมเดลที่ไม่ได้ไปไหน
แบบจำลองสองแบบในปรัชญาที่วางจำหน่ายห่างกันหนึ่งปี
o3 คือเรือธงสายให้เหตุผลล้วน: โมเดลแบบปิดที่ถูกฝึกให้คิดเป็นเวลานานก่อนจะตอบ มีหน้าต่างบริบท 200K เอาต์พุตสูงสุด 100K และอินพุตรูปภาพที่ถูกผนวกเข้าไปในห่วงโซ่ความคิด ตามตัวเลขของ OpenAI เอง มันวางมาตรฐานของปี 2025 ไว้ — 96.7% บน AIME 2024, 87.7% บน GPQA Diamond, 69.1% บน SWE-bench Verified โดยไม่มีการต่อโครง (scaffolding), คะแนน Codeforces Elo 2727 — และต่อมา OpenAI ก็ลดราคาจาก $10/$40 เป็น $2/$8 ต่อล้านโทเคน ซึ่งยังคงอยู่ระดับนั้นจนถึงตอนนี้ DeepSeek V4 Pro เป็นแนวคิดเศรษฐศาสตร์ที่ต่างออกไปโดยสิ้นเชิง: โมเดล mixture-of-experts ที่มีพารามิเตอร์ 1.6 ล้านล้าน โดยมีพารามิเตอร์ทำงานจริงประมาณ 49 พันล้านต่อโทเคน หน้าต่างบริบท 1 ล้านโทเคน เอาต์พุตสูงสุด 384K อินพุตรับเฉพาะข้อความ และ — ใหม่ในบิลด์ 0813 GA — สแต็กหลังการเทรนที่สร้างขึ้นใหม่ พร้อมการผสานรวม Respons-API และ Codex แบบเนทีฟ ซึ่งทำให้คะแนนเอเจนต์กระโดดจาก 12.8 ของเวอร์ชันพรีวิวเป็น 62.7 บน DeepSWE อีกทั้งยังเป็นโมเดลแบบเปิดน้ำหนัก (open-weights): เช็คพอยต์ DeepSeek-V4-Pro-0813 ดาวน์โหลดได้บน Hugging Face ภายใต้ใบอนุญาต MIT หลังจาก 24 ชั่วโมงแรกที่อลหม่าน ซึ่งมีการดึงแบนเนอร์เปิดตัวออกและไฟล์น้ำหนักขึ้น 404 อยู่ครู่หนึ่ง ก่อนที่จะถูกขึ้นรายการใหม่ด้วยคอนฟิกที่แก้ไขแล้ว
ช่องว่างของต้นทุนในตัวเลขจริง
เรตการ์ดส่วนใหญ่ก็โต้แย้งด้วยตัวเองอยู่แล้ว:
• OpenAI o3 — $2.00 ต่ออินพุตหนึ่งล้าน, $8.00 ต่อเอาต์พุตหนึ่งล้าน, $0.50 สำหรับอินพุตแคช โทเคนการให้เหตุผลถูกคิดเงินเป็นเอาต์พุต ดังนั้นคำถามยาก ๆ จะใช้โทเคนการคิดไปก่อนที่จะได้คำตอบ
• DeepSeek V4 Pro — อินพุต (cache miss) ราคา $0.435 ต่อล้าน, cache hit ราคา $0.003625, เอาต์พุตวันนี้ราคา $0.87 ต่อล้าน เอาต์พุตถูกกว่า o3 ประมาณ 4.6 เท่า ส่วนอินพุตแบบ cache hit แทบจะฟรี
• ข้อแม้ที่มีวันที่ระบุไว้ — การขึ้นราคาตามกำหนดการของ DeepSeek ในวันที่ 17 สิงหาคมจะทำให้ราคาเอาต์พุตของ V4 Pro จาก 6 หยวนเป็น 27 หยวนต่อล้านในช่วงชั่วโมงเร่งด่วน (13.5 ในช่วงนอกเวลาเร่งด่วน) และอินพุตแบบ cache-miss จาก 3 เป็น 9 หยวน แม้ในอัตราชั่วโมงเร่งด่วนใหม่ ราคาเอาต์พุตก็ยังเป็นเพียงเศษเสี้ยวเล็กน้อยของ $8 ของ o3 หน้าต่างเวลาในการพัฒนาตามอัตราปัจจุบันวัดกันเป็นวัน ซึ่งถือเป็นส่วนหนึ่งของการคำนวณการย้ายระบบด้วยเช่นกัน
เศรษฐศาสตร์แบบคิดต่อคำตอบที่ถูกต้องยิ่งทำให้ประเด็นชัดเจนขึ้น โทเค็นการให้เหตุผลที่ซ่อนอยู่ของ o3 หมายความว่าต้นทุนจริงต่อคำตอบยากนั้นสูงเป็นหลายเท่าของอัตราค่าเอาต์พุต DeepSeek V4 Pro ก็ให้เหตุผลเช่นกัน และการคิดของมันก็ถูกเรียกเก็บเป็นเอาต์พุตด้วย แต่ที่ราคา $0.87 ยอดใช้จ่ายจริงนั้นเป็นเพียงเศษเดนเมื่อเทียบกับเซสชันของ o3 ที่ใช้เวลาคิดหนึ่งนาทีครึ่ง กรอบต้นทุนเอเจนต์ที่ DeepSeek ใช้ตอนเปิดตัว — ซึ่งมีช่องว่างราคาต่องานประมาณ 45 เท่าเมื่อเทียบกับฟรอนเทียร์แบบปิด — พูดเกินจริงเมื่อเทียบกับ o3 โดยเฉพาะ แต่ทิศทางนั้นไม่เป็นที่โต้แย้ง: นี่คือช่องว่างต้นทุนที่แท้จริง 4–10 เท่า ขึ้นอยู่กับปริมาณงาน
ช่องว่างคุณภาพที่แท้จริงอยู่ตรงไหน
คะแนนที่สำคัญที่สุดคือคะแนนจากหน่วยงานอิสระ ในดัชนี Intelligence Index ของ Artificial Analysis นั้น DeepSeek V4 Pro ได้ 53 คะแนน และครองอันดับ #2 จาก 104 โมเดลที่ดัชนีระบุอยู่ในปัจจุบัน ขณะที่ o3 อยู่ที่ประมาณ 30 — ช่องว่างกว่า 20 คะแนนบนชุดทดสอบเดียวกัน นั่นคือบทสรุปที่ชัดเจนที่สุดว่าเส้นทางความก้าวหน้าสองปีทำให้เรือธงด้านการให้เหตุผลระดับพรีเมียมตกอยู่ในสถานะใด: มันไม่ใช่แค่ถูกตัดราคาอีกต่อไป แต่พ่ายแพ้ในคะแนนรวมจากหน่วยงานอิสระ
ภาพรวมรายเกณฑ์ชี้วัดนั้นยุ่งเหยิงกว่าและต้องการการติดป้ายอย่างตรงไปตรงมา ตัวเลขเด่นด้านเอเจนต์ของ DeepSeek V4 Pro — Terminal-Bench 2.1 ที่ 87.9, CyberGym ที่ 83.3, DeepSWE ที่ 62.7 และ AutomationBench ที่นำหน้าโมเดลปิดระดับแนวหน้า — เป็นข้ออ้างของ DeepSeek เองจากการเปิดตัว 0813 ซึ่งยังไม่มีผู้ใดทำซ้ำผลโดยอิสระ ณ เวลาที่เขียนบทความนี้ และเหตุการณ์ตั้งค่าผิดพลาดระหว่างการเปิดตัวทำให้นักวิเคราะห์ภายนอกไม่มั่นใจว่า API ให้บริการน้ำหนักที่แก้ไขครั้งสุดท้ายจริงหรือไม่ในช่วงที่เก็บตัวเลขจากบุคคลที่สามในช่วงแรก o3 เองก็มีตัวเลขจากการเปิดตัวที่ผู้ผลิตเป็นผู้รายงานเช่นกัน แต่บางส่วนได้รับการตรวจสอบยืนยันจากการทดสอบซ้ำโดยอิสระย้อนไปในปี 2025 ซึ่งตอนนั้น o3 นำตารางอันดับด้านการให้เหตุผลอย่างแท้จริง ในด้านคณิตศาสตร์และการให้เหตุผลล้วน ๆ บันทึกผลที่เผยแพร่ของ o3 ยังคงดูดีกว่า DeepSeek V4 Pro — จุดแข็งของ DeepSeek อยู่ที่การใช้เครื่องมือแบบเอเจนต์ การเขียนโค้ด และงานที่กินระยะเวลายาวนาน ซึ่งเป็นคนละชุดทดสอบกับโอลิมปิกคณิตศาสตร์ที่ o3 เคยทำผลงานได้โดดเด่น

สิ่งที่ o3 ยังทำได้ดีกว่า
สองสิ่งที่รอดจากการเปรียบเทียบนี้โดยไม่เสียหาย ประการแรก คณิตศาสตร์และการใช้เหตุผลอย่างรอบคอบ: คะแนน AIME 96.7% และ GPQA 87.7% ของ o3 ยังคงสูงกว่าสิ่งใดก็ตามที่ DeepSeek V4 Pro เผยแพร่ และหากภาระงานของคุณคือบทพิสูจน์ที่ยากหรือโจทย์แข่งขัน o3 — ในขณะที่ยังคงทำงานอยู่ — คือคำตอบที่ปลอดภัยกว่า ประการที่สอง การใช้เหตุผลเกี่ยวกับภาพ: o3 สามารถคิดเกี่ยวกับภาพหน้าจอหรือแผนภาพภายในกระบวนการคิดแบบลูกโซ่ของมันได้ และ DeepSeek V4 Pro รองรับเฉพาะข้อความเท่านั้น บิลด์ 0813 ไม่ได้เพิ่มตัวเข้ารหัสภาพ และหากงานของคุณต้องการให้โมเดลอ่านภาพ DeepSeek V4 Pro ก็ไม่สามารถใช้แทน o3 ในด้านนั้นได้ ข้อได้เปรียบทั้งสองประการไม่ใช่เหตุผลที่จะอยู่กับโมเดลที่กำลังจะปลดระวาง แต่ทั้งคู่เป็นเหตุผลที่ต้องยอมรับอย่างตรงไปตรงมาว่าการย้ายครั้งนี้ไม่ใช่การอัปเกรดล้วน ๆ
อีกสิ่งที่ควรสังเกตคือความแตกต่างของ open-weights ซึ่งไม่ใช่ benchmark เลย o3 เป็นโมเดลปิดและกำลังถูกยุบรวมจนหมดไป คุณไม่สามารถรันมันบนฮาร์ดแวร์ของคุณเองได้ DeepSeek V4 Pro 0813 checkpoint เป็นของคุณถาวร ใช้สัญญาอนุญาต MIT — น้ำหนักเดียวกัน โมเดล 1.6 ล้านล้านพารามิเตอร์เดียวกัน โฮสต์เองได้หากคุณมีฮาร์ดแวร์ประมาณ 1.5 เทราไบต์ สำหรับทีมที่เคยเจ็บตัวจากการพึ่งพาโมเดลปิดที่ผู้ขายอาจยกเลิกได้ นี่คือคำตอบเชิงโครงสร้างต่อปัญหาที่การเลิกใช้ o3 ก่อให้เกิด
กำลังย้ายเวิร์กโหลด
สำหรับทีม API ที่ย้ายมาจาก o3 นั้น DeepSeek V4 Pro เป็นตัวเลือกที่ถูกที่สุด และในงานแบบ agentic และการเขียนโค้ด ซึ่งเป็นสิ่งที่การใช้งาน API ส่วนใหญ่เป็นจริง ๆ แล้ว มันแทบจะไม่เป็นการลดระดับลงเลย ปัญหาที่แท้จริงเป็นเรื่องการปฏิบัติการ ไม่ใช่คุณภาพ: V4 Pro ถูกจำกัดที่ 500 คำขอพร้อมกันบน API อย่างเป็นทางการ ซึ่งเป็นเพดานที่คุณจะชนเมื่อใช้ฝูงเอเจนต์ และราคาของมันจะเปลี่ยนในวันที่ 17 สิงหาคม ทั้งสองอย่างนี้คือสิ่งที่เลเยอร์การจัดเส้นทาง (routing layer) มีไว้สำหรับสิ่งนั้น
บน OrcaRouter, DeepSeek V4 Pro ให้บริการในราคารายการของผู้ให้บริการที่ส่งผ่านโดยไม่มีการบวกกำไร (0% markup) — ดังนั้น $0.44/$0.87 ของวันนี้จะใช้งานที่นี่ในวันเดียวกับที่ใช้งานที่ DeepSeek และเมื่อตารางช่วงพีค/นอกพีคของวันที่ 17 สิงหาคมมาถึง มันก็จะสะท้อนที่นี่ในวันเดียวกันเช่นกัน คีย์เดียวยังเข้าถึงกลุ่มโมเดลที่ใช้แทน o3 ที่เหลือนี้ และการเฟลโอเวอร์อัตโนมัติคือคำตอบที่สะอาดสำหรับขีดจำกัดการเชื่อมต่อพร้อมกัน 500: ชี้เส้นทางการผลิตไปที่ V4 Pro บวกกับโมเดลที่สองบนคีย์เดียวกัน แล้วให้เราเตอร์ดูดซับเพดานนั้น OpenAI o3 เองไม่ได้อยู่บนคีย์นั้น — มันยังคงใช้งานได้ผ่าน API ของ OpenAI เองและแพลตฟอร์มบุคคลที่สามหลายแห่งจนถึงกำหนดตัดภาพรวมในวันที่ 11 ธันวาคม

ผู้ที่คณิตศาสตร์เข้าข้าง
สำหรับใครก็ตามที่เวิร์กโหลดของ o3 คือการเขียนโค้ด เอเจนต์ลูป หรือการประมวลผลบริบทยาว คณิตศาสตร์ไม่ได้สูสีกันเลย: DeepSeek V4 Pro ชนะ o3 ในดัชนีอิสระ มีต้นทุนเพียงเศษเสี้ยว และน้ำหนักโมเดลแบบเปิดหมายความว่าการพึ่งพาเฉพาะนี้ไม่สามารถถูกถอนออกจากใต้เท้าคุณได้ ทีมที่มีเหตุผลแท้จริงที่จะเก็บ o3 ไว้ในตอนนี้คือกลุ่มแคบ ๆ — การให้เหตุผลทางคณิตศาสตร์บริสุทธิ์แบบยาก และอะไรก็ตามที่สร้างบนการคิดภาพของ o3 — และแม้แต่กลุ่มเหล่านั้นก็ควรทดสอบตัวแทนกับเวิร์กโหลดจริงก่อนเดือนธันวาคม เพราะเส้นตายไม่สนใจกรณีมุมของคุณ ยุคการให้เหตุผลระดับพรีเมียมที่ o3 นิยามไว้จบลงพร้อมกับประกาศการปลดระวาง; DeepSeek V4 Pro เป็นเพียงจุดที่ที่นั่งถูกที่สุดในยุคถัดไปตั้งอยู่

การเปรียบเทียบในบทความนี้2
ตรวจพบจากบทความนี้ · เบนช์มาร์ก: Artificial Analysis · อัปเดตทุกวัน
