
DeepSeek V4 Pro vs Qwen3.8 Max: ผู้เชี่ยวชาญด้านการให้เหตุผล vs อเนกประสงค์แห่งจีน
- Alibabaใหม่Qwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 ต่อ 1 ล้านโทเค็น
- z-aiใหม่Z.ai: GLM 5.3 Flash2026-08-2658ความฉลาด72การเขียนโค้ด
- DeepSeekใหม่DeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.15 / $0.29 ต่อ 1 ล้านโทเค็น
- z-aiZ.ai: GLM 5.32026-08-1860ความฉลาด75การเขียนโค้ด
- obsidianQwen3.8 27B2026-08-1552ความฉลาด68การเขียนโค้ด
- qwenQwen: Qwen3.8 27B (free)2026-08-13qwen/qwen3.8-27b-free
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1253ความฉลาด69การเขียนโค้ด
- grokSpaceXAI: Grok 4.62026-08-1261ความฉลาด77การเขียนโค้ด
- metaMeta: Muse Spark 1.22026-08-0557ความฉลาด72การเขียนโค้ด
- qwenQwen: Qwen3.8 Max2026-08-0358ความฉลาด72การเขียนโค้ด
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3152ความฉลาด69การเขียนโค้ด
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 ต่อ 1 ล้านโทเค็น
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463ความฉลาด78การเขียนโค้ด
- googleGoogle: Gemini 3.6 Flash2026-07-2152ความฉลาด69การเขียนโค้ด
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137ความฉลาด49การเขียนโค้ด
- metaMeta: Muse Spark 1.12026-07-1653ความฉลาด71การเขียนโค้ด
- kimiMoonshotAI: Kimi K32026-07-1560ความฉลาด76การเขียนโค้ด
- openaiOpenAI: GPT-5.6 Luna2026-07-0952ความฉลาด71การเขียนโค้ด
ห่างกันสิบวัน โมเดลสองตัวที่ถูกจับตามองมากที่สุดในจีนก็เปิดตัว: อาลีบาบาเปิดตัว Qwen3.8 Max เมื่อวันที่ 3 สิงหาคม 2026 — โมเดลเรือธงแบบ sparse-MoE ขนาด 2.4 ล้านล้านพารามิเตอร์ ซึ่งบริษัทโปรโมตว่าเป็นโมเดลอเนกประสงค์สำหรับเอเยนต์ งานออฟฟิศ และความเข้าใจมัลติโมดัล — และ DeepSeek ก็ส่งเวอร์ชันทางการของ DeepSeek V4 Pro เมื่อวันที่ 12 สิงหาคม ซึ่งเป็นโมเดลเฉพาะทางด้านการให้เหตุผลและการเขียนโค้ด ด้วยพารามิเตอร์รวม 1.6T และราคาต่อโทเค็นผลลัพธ์คิดเป็นประมาณหนึ่งในเจ็ดของ Qwen โมเดลทั้งสองต่างมุ่งเป้าไปที่เงินในกระเป๋าของนักพัฒนากลุ่มเดียวกัน แต่กลับเห็นไม่ตรงกันว่าจุดประสงค์ของโมเดลเรือธงควรเป็นอย่างไร Qwen3.8 Max ต้องการเป็นโมเดลเดียวที่คุณจะใช้เป็นเส้นทางสำหรับทุกอย่าง ส่วน DeepSeek V4 Pro ต้องการเป็นโมเดลที่คุณเลือกใช้สำหรับงานยากๆ

ประเด็นสำคัญ
• Qwen3.8 Max เป็นโมเดลที่มีศักยภาพดิบสูงกว่าในลีดเดอร์บอร์ดทั่วไปของจีน (SuperCLUE อันดับ #1, กรกฎาคม) และเป็นแพ็กเกจมัลติโมดัล/ระดับองค์กรที่แข็งแกร่งกว่า — รองรับอินพุตวิดีโอ เครื่องมือในตัว ผลลัพธ์แบบมีโครงสร้าง ครบใน API เดียว
• DeepSeek V4 Pro มีราคาถูกกว่าอย่างมาก (ประมาณ 7 เท่าในส่วนของ output) เปิดน้ำหนักโมเดลแล้ว และตอนนี้ครองการอ้างสิทธิ์ที่สูงกว่าในด้านการเขียนโค้ด/agentic — Terminal-Bench 2.1 ได้ 87.9 เทียบกับ Qwen ที่ผู้ขายรายงานไว้ที่ 86.6
• จงระวังต้นทุนด้านความยืดยาว: การรันแบบอิสระแสดงให้เห็นว่า Qwen3.8 Max เฉลี่ยประมาณ 64 เทิร์น และ ~$1.14 ต่องานแบบเอเจนต์ — เป็นปัญหาต้นทุนที่แท้จริงซึ่งสเปกชีตปิดบังไว้
• พาดหัวที่ตรงไปตรงมา: Qwen3.8 Max คือเรือธงของ "สงครามความสามารถ" ที่ตั้งราคาเทียบเท่าโมเดลปิดของสหรัฐฯ ส่วน DeepSeek V4 Pro คือการโต้กลับด้วยความคุ้มค่า
สองปรัชญาในตารางสเปกเดียว
• พารามิเตอร์ทั้งหมด — Qwen3.8 Max 2.4T (sparse MoE, ใช้งาน ~95B) เทียบกับ DeepSeek V4 Pro 1.6T (MoE, ใช้งาน ~49B)
• บริบท / เอาต์พุตสูงสุด — ทั้งคู่มีบริบท 1M; Qwen เอาต์พุตสูงสุดประมาณ 128–131K เทียบกับ DeepSeek ที่ 384K
• อินพุต — Qwen รองรับข้อความ รูปภาพ และวิดีโอ ส่วน DeepSeek V4 Pro รองรับข้อความและรูปภาพ พร้อมการให้เหตุผลเกี่ยวกับภาพแบบเนทีฟใหม่ในบิลด์อย่างเป็นทางการ
• โอเพนเวตส์ — DeepSeek V4 Pro: ปล่อยแล้ว (MIT); Qwen3.8 Max: สัญญาว่าจะปล่อยในสัปดาห์ของวันที่ 10 สิงหาคม ซึ่งเป็น Qwen ระดับ Max รุ่นแรกเท่าที่เคยถูกโอเพนซอร์ส
• API เพิ่มเติม — Qwen มีเครื่องมือในตัวและเอาต์พุตแบบมีโครงสร้างมาให้พร้อมใช้งาน; DeepSeek V4 Pro มีตัวสลับโหมดคิด, JSON แบบมีโครงสร้าง, Responses API และความเข้ากันได้กับ Codex
• ราคา — Qwen3.8 Max $2.00 / $6.00 ต่อล้านโทเคน ($0.25 แบบ cached) เทียบกับ DeepSeek V4 Pro ~$0.42 / $0.87 ($0.0035 แบบ cached)

จุดที่ Qwen3.8 Max ชนะ
ในแกนทั่วไป Qwen3.8 Max นำหน้า และข้อมูลอิสระก็เห็นด้วย {{1}}Artificial Analysis ระบุค่าดัชนีความฉลาด (Intelligence Index) ที่ 58 ดัชนีการเขียนโค้ด (Coding Index) ที่ 71.8 และดัชนีเอเจนต์ (Agentic Index) ที่ 58 — ซึ่งถือเป็นผลงานที่ใกล้เคียงอันดับสูงสุดของกระดานผู้นำด้านเอเจนต์มากที่สุดในบรรดาห้องแล็บจีน{{/1}} {{2}}ในการจัดอันดับภาษาจีนของ SuperCLUE เดือนกรกฎาคม มันอยู่ในอันดับ #1 ด้วยคะแนน 71.48 ขณะที่ DeepSeek-V4-Pro อยู่ในอันดับ #5 ด้วยคะแนน 64.4{{/2}} {{3}}การสาธิตเปิดตัวของ Alibaba — การรันโค้ดอัตโนมัติเป็นเวลา 16 วัน และการจำลองงานวิจัยจากบทความที่เอาชนะผลลัพธ์ AIME24 ของบทความต้นฉบับ — เป็นหลักฐานที่แข็งแกร่งที่สุดในรอบการเปิดตัวทั้งหมดว่าเป็นเอเจนต์ที่ทำงานระยะยาวได้อย่างแท้จริง{{/3}}
สำหรับผู้สร้าง ข้อได้เปรียบในทางปฏิบัติคือเรื่องของการผสานรวม: รองรับอินพุตวิดีโอ, การเรียกใช้เครื่องมือในตัว, การสร้างผลลัพธ์แบบมีโครงสร้างโดยไม่ต้องตั้งค่าใด ๆ และระบบนิเวศ (Model Studio, ชุดเครื่องมือ Qwen) ที่ DeepSeek ไม่พยายามจะไล่ตาม หากปริมาณงานเน้นเอกสาร เป็น multimodal หรือต้องการเรื่องราวการผสานรวมระดับองค์กร Qwen3.8 Max คือโมเดลที่ตลาดจีนเลือกใช้เป็นค่าเริ่มต้นในปัจจุบัน
จุดที่ DeepSeek V4 Pro ชนะ
ในด้านการเขียนโค้ดและต้นทุน V4 Pro เวอร์ชันทางการคือคำตอบโต้ DeepSeek รายงานว่าบิลด์ทางการได้ 87.9 บน Terminal-Bench 2.1 (เพิ่มขึ้นจาก 72.1 ในเวอร์ชันพรีวิว) และ 62.7 บน DeepSWE — เทียบกับ 86.6 บน Terminal-Bench ที่ Qwen รายงานโดยผู้ผลิต เวอร์ชันพรีวิวทำได้ 80.6 บน SWE-bench Verified, 90.1 บน GPQA Diamond และ 93.5 บน LiveCodeBench ซึ่งเป็นคะแนนการเขียนโปรแกรมเชิงแข่งขันอันดับ 1 ของโมเดลเปิด และการเปลี่ยนแปลงในบิลด์ทางการกระจุกตัวอยู่ในงานเชิงเอเจนต์และงานเชิงให้เหตุผลซึ่งเป็นที่มาของตัวเลขเหล่านั้นพอดี
จากนั้นก็เรื่องราคา ที่ $0.42/$0.87 ต่อล้านโทเคน DeepSeek V4 Pro ถูกกว่าทั้งอินพุตประมาณ 4.8 เท่าและเอาต์พุตประมาณ 6.9 เท่าเมื่อเทียบกับ Qwen3.8 Max ซึ่งอยู่ที่ $2/$6 DeepSeek ยังได้แจ้งเตือนเมื่อวันที่ 6 สิงหาคมว่าราคากำลังจะปรับขึ้น ซึ่งทำให้เรตของวันนี้เป็นเพียงช่วงเวลาเท่านั้น ไม่ใช่คำสัญญา — รายละเอียดเพิ่มเติมด้านล่าง

คำนวณบนงานแบบ agentic จริง
การทำงานแบบ agentic อิสระคือจุดที่ราคาป้ายของ Qwen ไม่ใช่ราคาจริงอีกต่อไป ในงาน agentic ของ Artificial Analysis นั้น Qwen3.8 Max เฉลี่ยประมาณ 64 เทิร์นต่องาน และมีต้นทุนประมาณ 1.14 ดอลลาร์ต่องาน เทียบกับประมาณ 0.53 ดอลลาร์สำหรับรุ่นก่อนหน้า — โมเดลนี้ใช้คำเยอะและวางแผนมาก หากรันงานในรูปแบบเดียวกันบน DeepSeek V4 Pro ที่ราคา 0.87 ดอลลาร์ต่อล้าน output ต้นทุนต่องานจะต่ำลงประมาณหนึ่งลำดับขนาด หากผลิตภัณฑ์ของคุณเป็นลูปที่เรียกใช้โมเดลวันละร้อยครั้งต่อผู้ใช้ ความแตกต่างนั้นคือมาร์จินของคุณ
ข้อควรระวังเรื่องความน่าเชื่อถือของทั้งสองฝ่าย
ความซื่อตรงของแหล่งข้อมูลเป็นดาบสองคม การทดสอบอิสระพบว่าอัตราการหลงผิด (hallucination) ของ Qwen3.8 Max เพิ่มขึ้นจาก 23% เป็น 40% และคะแนน AA-Omniscience ลดลงสิบจุด — ในรุ่นที่ปล่อยเดียวกันนี้ โมเดลฉลาดขึ้นแต่กลับน่าเชื่อถือน้อยลง เวอร์ชันพรีวิวของ DeepSeek มีอัตราการตอบเสมอ (answer-always) ที่บันทึกไว้ที่ 94% จากการทดสอบ AA-Omniscience ซึ่งหมายความว่ามันจะสร้างคำตอบออกมาไม่ว่าจะรู้คำตอบหรือไม่ก็ตาม ทั้งสองประเด็นนี้ส่งผลต่อการใช้งานในระบบผลิตจริง แต่ก็ไม่ได้ทำให้โมเดลไม่มีคุณสมบัติเหมาะสมสำหรับปริมาณงานที่มันถูกออกแบบมา
เหตุใดจังหวะเวลาของ open-weights จึงเปลี่ยนแปลงการคำนวณราคา
การเปิดตัวแบบ open-weights ของ Qwen3.8 Max เมื่อมันออกมาจะเปลี่ยนเศรษฐศาสตร์ของการแข่งขันนี้ภายในหนึ่งสัปดาห์ — ผู้ที่โฮสต์ด้วยตัวเองจะได้เรือธงขนาด 2.4T และแรงกดดันด้านราคา API จะเป็นจริง นี่คือสถานการณ์ที่โมเดลการกำหนดราคาแบบ pass-through ทำให้คุณซื่อสัตย์ OrcaRouter ส่งผ่านราคารายการของผู้ให้บริการโดยไม่บวกกำไรใดๆ ดังนั้นทันทีที่ Alibaba หรือ DeepSeek ปรับเปลี่ยนราคา — ขึ้นหรือลง — การเปลี่ยนแปลงจะมีผลในวันเดียวกันบนคีย์เดียว โดยไม่ต้องเจรจาใหม่และไม่มีสัญญาฉบับที่สองให้อ่าน คุณเลือกเส้นทางไปยัง Qwen3.8 Max หรือ DeepSeek V4 Pro ตามที่การประเมินปัจจุบันของคุณต้องการ และราคาจะยังคงเป็นสิ่งที่ผู้ให้บริการเรียกเก็บจริง
อันไหนสำหรับการตัดสินใจเลือก API builder ของคุณ
เลือก Qwen3.8 Max เมื่องานต้องการความครอบคลุมทุกด้าน — อินพุตแบบมัลติโมดัล, เอาต์พุตที่มีโครงสร้าง, เครื่องมือในตัว, คุณภาพภาษาจีนที่อยู่ในระดับสูงสุดของการจัดอันดับปัจจุบัน — และโมเดลต้นทุนของคุณยอมรับการทำงานแบบ agentic ที่ verbose ได้ เลือก DeepSeek V4 Pro เมื่องานเน้นการใช้เหตุผลหรือเขียนโค้ดอย่างหนัก, ปริมาณโทเคนสูง, น้ำหนักโมเดลแบบเปิดสำคัญต่อการปฏิบัติตามข้อกำหนดหรือการโฮสต์ด้วยตนเอง, หรืองบประมาณเป็นข้อจำกัดหลัก การอ่านการเปรียบเทียบนี้ที่ชัดเจนที่สุดคือสิ่งที่ทั้งสองบริษัทเองส่งสัญญาณ: Qwen3.8 Max คือเรือธงที่คุณใช้เป็นมาตรฐานวัดทุกสิ่ง, ส่วน DeepSeek V4 Pro คือตัวที่ทำให้เกณฑ์มาตรฐานดูแพง
การเปรียบเทียบในบทความนี้3
ตรวจพบจากบทความนี้ · เบนช์มาร์ก: Artificial Analysis · อัปเดตทุกวัน
