
การวัดประสิทธิภาพ DeepSeek V4 Pro: กระดานคะแนน 0813 ฉบับเต็ม การตรวจสอบอิสระทุกครั้ง และสิ่งที่ยังไม่มีใครยืนยัน
- z-aiใหม่Z.ai: GLM 5.32026-08-1860ความฉลาด75การเขียนโค้ด
- obsidianใหม่Qwen3.8 27B Uncensored (Aggressive)2026-08-1552ความฉลาด68การเขียนโค้ด
- qwenใหม่Qwen: Qwen3.8 27B (free)2026-08-1340 tok/s
- deepseekใหม่DeepSeek: DeepSeek V4 Pro 08132026-08-1253ความฉลาด69การเขียนโค้ด
- grokใหม่SpaceXAI: Grok 4.62026-08-1261ความฉลาด77การเขียนโค้ด
- metaใหม่Meta: Muse Spark 1.22026-08-0557ความฉลาด72การเขียนโค้ด
- qwenQwen: Qwen3.8 Max2026-08-0358ความฉลาด72การเขียนโค้ด
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3152ความฉลาด69การเขียนโค้ด
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 ต่อ 1 ล้านโทเค็น · 221 tok/s
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463ความฉลาด78การเขียนโค้ด
- googleGoogle: Gemini 3.6 Flash2026-07-2152ความฉลาด69การเขียนโค้ด
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137ความฉลาด49การเขียนโค้ด
- metaMeta: Muse Spark 1.12026-07-1653ความฉลาด71การเขียนโค้ด
- kimiMoonshotAI: Kimi K32026-07-1560ความฉลาด76การเขียนโค้ด
- openaiOpenAI: GPT-5.6 Luna2026-07-0952ความฉลาด71การเขียนโค้ด
- openaiOpenAI: GPT-5.6 Terra2026-07-0957ความฉลาด77การเขียนโค้ด
- openaiOpenAI: GPT-5.6 Sol2026-07-0961ความฉลาด77การเขียนโค้ด
- grokxAI: Grok 4.52026-07-0856ความฉลาด72การเขียนโค้ด
คำตอบแบบสั้น: จากตัวเลขของ DeepSeek เอง DeepSeek V4 Pro ทำสกอร์การ์ดด้าน agentic ได้แข็งแกร่งอย่างแท้จริง — Terminal-Bench 2.1 ที่ 87.9, DeepSWE ที่ 62.7, CyberGym ที่ 83.3 — แต่ตัวเลขหลักเกือบทุกตัวเป็นข้อมูลที่ผู้พัฒนารายงานเอง และภาพจากหน่วยงานอิสระกลับดูไม่ร้อนแรงเท่า Artificial Analysis จัดให้บิลด์ 0813 อย่างเป็นทางการได้ 53 คะแนนบน Intelligence Index เท่ากับ GLM-5.2 ตามหลัง GPT-5.6 Terra อยู่ 4 คะแนน และตามหลัง Kimi K3 อยู่ 7 คะแนน ส่วน Vals AI จัดอันดับให้อยู่อันดับที่ 12 ต่ำกว่า GPT-5.5 รุ่นก่อนหน้า บทความนี้คือการรวบรวมข้อมูลฉบับเต็มที่ยังไม่มีใครเขียน: สกอร์การ์ดของ 0813 ฉบับสมบูรณ์ ชุดทดสอบโค้ดแบบขยายจากรายงานทางเทคนิค ผลตรวจสอบจากหน่วยงานอิสระทุกชิ้นที่มีอยู่ และบันทึกที่ตรงไปตรงมาว่าตัวเลขใดบ้างที่ถูกพิสูจน์ซ้ำแล้ว และตัวเลขใดที่ยังเป็นเพียงคำกล่าวของ DeepSeek เพียงฝ่ายเดียว
กระดานคะแนน 0813 อย่างเป็นทางการ — ตัวเลขทั้งหมดของ DeepSeek เอง
ประกาศอย่างเป็นทางการของ DeepSeek (เอกสาร API, news260813, 13 สิงหาคม 2026) รายงานว่าบิลด์สำหรับการผลิตเทียบกับพรีวิวเดือนเมษายน ทุกตัวเลขในส่วนนี้มาจากผู้จำหน่าย — ยังไม่มีใครทำการยืนยันอย่างอิสระ ณ วันที่ 16 สิงหาคม 2026:
• Terminal-Bench 2.1 — 87.9 (พรีวิว: 72.1).
• DeepSWE — 62.7 (พรีวิว: 12.8) — เพิ่มขึ้นประมาณ 5 เท่า ซึ่งเป็นตัวเลขที่โดดเด่นที่สุดบนการ์ด
• CyberGym — 83.3 (พรีวิว: 52.7).
• Humanity's Last Exam — 42.7 โดยไม่ใช้เครื่องมือ, 60.0 โดยใช้เครื่องมือ (ตัวอย่าง: 37.7 / 48.2).
• Toolathlon-Verified — 74.1 (พรีวิว: 55.9).
• AutomationBench (สาธารณะ) — 31.8 (ตัวอย่าง: 12.8).
• DSBench-FullStack — 71.1; DSBench-Hard — 67.2 (ตัวอย่าง: 41.8 / 31.1).
• NL2Repo — 61.5 (พรีวิว: 38.5).
• Agents' Last Exam — 25.7 (ตัวอย่าง: 16.5).
รูปแบบที่ควรสังเกตคือจุดที่ผลการปรับปรุงกระจุกตัว: เกณฑ์มาตรฐานด้าน agentic และความมั่นคงปลอดภัยทางไซเบอร์ นั่นคือประเภทของผลการประเมินที่ห้องปฏิบัติการผลิตขึ้นเมื่อต้องการโฆษณาโมเดลเอเจนต์ — และเป็นประเภทที่จำเป็นต้องมีการรันซ้ำอย่างเป็นกลางก่อนที่คุณจะใช้เงินในการผลิตไปกับมัน

ชุดรหัสที่ขยายจากรายงานทางเทคนิคของ DeepSeek
นอกเหนือจากการ์ดเอเจนต์แล้ว รายงานทางเทคนิคของ DeepSeek (ซึ่งรวบรวมโดย BenchLM เมื่อวันที่ 16 สิงหาคม 2026) ยังเพิ่มชุดการเขียนโค้ดและบริบทระยะยาวที่กว้างขึ้นด้วย นอกจากนี้ยังเป็นข้อมูลที่รายงานโดยผู้จำหน่าย และติดป้ายกำกับว่า "Provider exact" โดย BenchLM — ไม่มีการทดสอบอิสระ:
• SWE-bench Verified — 80.6%; SWE-bench Pro — 55.4%.
• LiveCodeBench Pass@1-CoT — 93.5% ซึ่งเป็นค่าที่ดีที่สุดที่ได้รับการยืนยันในแคตตาล็อกของ BenchLM
• เรตติ้ง Codeforces — 3206 — ซึ่งเป็นอันดับที่ดีที่สุดที่ได้รับการยืนยันในแคตตาล็อก
• BrowseComp — 83.4%; Terminal-Bench 2.0 — 67.9%.
• MRCR 1M — 83.5%; CorpusQA 1M — 62.0% — ทั้งคู่เป็นสถิติที่ดีที่สุดในแคตตาล็อกสำหรับการดึงข้อมูลด้วย 1M โทเคน ซึ่งสำคัญสำหรับโมเดลที่โฆษณาหน้าต่างบริบทขนาด 1M โทเคน
• GPQA Diamond — 92.8, SciCode — 49.2 และ Long-Context Recall — 75.3 (ตามที่แสดงอยู่ในหน้าโมเดลของ OrcaRouter)
สิ่งที่ผู้ประเมินอิสระวัดจริง
แหล่งข้อมูลอิสระสามแหล่งได้ทดสอบ DeepSeek V4 Pro และข้อสรุปของพวกเขากลุ่มอยู่ใต้การ์ดของผู้จำหน่าย:
• Artificial Analysis Intelligence Index — 53 (รายงานของ SCMP, สิงหาคม 2026; หน้าโมเดลของ OrcaRouter แสดง 53.2 อยู่ในอันดับที่ 20 จาก 132) เสมอกับ GLM-5.2 ตามหลัง GPT-5.6 Terra อยู่ 4 คะแนน และตามหลัง Kimi K3 อยู่ 7 คะแนน
• Artificial Analysis Coding — 68.8 อยู่ในอันดับที่ 24 จาก 130 (อ้างอิงจากหน้าข้อมูลโมเดลของ OrcaRouter)
• Vals AI Index — อันดับที่ 12 ตามหลัง GPT-5.5 รุ่นก่อนหน้า และตามหลัง Kimi K3 และ Claude Opus 5 เป็นอย่างมาก (SCMP) การทดสอบของ Vals AI เองชี้ให้เห็นจุดอ่อนที่เป็นรูปธรรมสองประการ ได้แก่ การทำงานให้สำเร็จภายในสภาพแวดล้อมเทอร์มินัลแบบแซนด์บ็อกซ์ และการสร้างแบบจำลองทางการเงินที่ซับซ้อนในสเปรดชีต Excel
• Vibe Code Bench v1.1 — 49.93 (Vals AI, การรันอิสระแบบ "Benchmark exact" เพียงหนึ่งเดียวในชุด)
บันทึกที่ซื่อตรง — สิ่งที่ถูกทำซ้ำแล้ว เทียบกับสิ่งที่ยังเป็นเพียงคำพูดของ DeepSeek
นี่คือส่วนที่บทความ benchmark มีไว้เพื่อนำเสนอ และเป็นเหตุผลที่ควรบุ๊กมาร์กหน้านี้มากกว่าการรายงานข่าวเปิดตัว แบ่งคะแนนทั้งหมดออกเป็นหนึ่งในสองกลุ่ม:
• จากแหล่งข้อมูลอิสระ: AA Intelligence Index 53 / 53.2, AA Coding 68.8, Vals AI อันดับที่ 12, Vibe Code Bench 49.93 — และผลการรัน Terminal-Bench 2.1 จากแหล่งข้อมูลแยกต่างหากที่ได้ค่า 78.7 ที่อยู่เคียงข้าง 87.9 ของ DeepSeek บนหน้าโมเดลของ OrcaRouter ช่องว่างเก้าจุดระหว่างตัวเลขของผู้ขายและผลการรันอิสระคือจุดข้อมูลที่สำคัญที่สุดเพียงจุดเดียวบนหน้านี้: มันคือช่องว่างการทำซ้ำที่วัดออกมาเป็นตัวเลข
• รายงานโดยผู้จำหน่ายเท่านั้น ยังไม่มีการทำซ้ำโดยอิสระ: ทุกตัวเลขในการ์ด 0813 อย่างเป็นทางการด้านบน (Terminal-Bench 2.1 87.9, DeepSWE 62.7, CyberGym 83.3, HLE 42.7/60.0, Toolathlon 74.1, AutomationBench 31.8, DSBench 71.1/67.2, NL2Repo 61.5, Agents' Last Exam 25.7) และชุดการเขียนโค้ดแบบขยายทั้งหมด (SWE-bench Verified 80.6, LiveCodeBench 93.5, Codeforces 3206, BrowseComp 83.4, MRCR 83.5, CorpusQA 62.0, GPQA Diamond 92.8) เอกสารของ DeepSeek เองระบุว่าตัวเลข Terminal-Bench 2.1 เป็น "provider run."
เมื่ออ่านแบบนั้น เรื่องราวก็สมเหตุสมผล: DeepSeek V4 Pro เป็นโมเดล frontier ระดับกลางจริงๆ — AA 53 อยู่อันดับที่ 13 ถึง 29 — พร้อมกับสกอร์การ์ดจากผู้ผลิตที่อ้างว่ามีประสิทธิภาพด้าน agentic และการเขียนโค้ดใกล้ระดับสูงสุด ข้อความทั้งสองเป็นจริงและไม่ขัดแย้งกัน ข้อหนึ่งวัดจากผลการทดสอบ อีกข้อหนึ่งเป็นการกล่าวอ้าง

ราคาสกอร์การ์ด
DeepSeek V4 Pro คือโมเดลเรือธง MoE ที่มีพารามิเตอร์รวม 1.6T / แอกทีฟ 49B พร้อมหน้าต่างบริบท 1M โทเคนและเอาต์พุตสูงสุด 384K บน OrcaRouter ราคาตามรายการของ DeepSeek โดยไม่มีมาร์กอัป: 0.435 ดอลลาร์ต่อล้านโทเคนอินพุต และ 0.87 ดอลลาร์ต่อล้านโทเคนเอาต์พุต (การอ่านแคช 0.060 ดอลลาร์ต่อล้านโทเคน) ตามไดเรกทอรีที่ตรวจสอบเมื่อวันที่ 15 สิงหาคม 2026 และยืนยันบนหน้าโมเดลจริง ในอัตรานี้ การคำนวณราคาต่อคะแนนคือข้อโต้แย้งที่แข็งแกร่งที่สุดสำหรับโมเดลนี้: ราคาเอาต์พุตอยู่ที่ประมาณหนึ่งในสิบของโมเดลที่ได้คะแนนใกล้เคียงกันในดัชนีอิสระ ดังนั้นคุณจึงจ่ายในราคากลาง ๆ เพื่อผลคะแนนที่หากคำกล่าวอ้างของผู้ให้บริการเป็นจริง ก็จะอยู่ใกล้ระดับบนสุด ข้อควรระวัง: DeepSeek ได้ประกาศตารางราคาช่วงพีค/นอกพีค (นอกพีคคิด 50% ของพีค) ซึ่งมีผลตั้งแต่วันที่ 17 สิงหาคม ตามเวลาในกรุงปักกิ่ง ดังนั้นอัตราจึงอาจเปลี่ยนแปลงได้ ตัวเลขที่แสดงนี้คือราคารายการจริง ณ เวลาที่เขียนบทความนี้

เมื่อคำแนะนำนี้ไม่ถูกต้อง
กรณีที่ตรงไปตรงมาที่ DeepSeek V4 Pro ไม่ควรเป็นตัวเลือกของคุณ:
• คุณต้องการการให้เหตุผลระดับแนวหน้าที่ได้รับการยืนยันโดยอิสระAA Index 53 อยู่ในกลุ่มกลาง — Kimi K3 (60) และ GPT-5.6 Terra (57) อยู่ข้างหน้าและผ่านการยืนยันแล้ว หากการตัดสินใจของคุณขึ้นอยู่กับเพดานที่วัดได้ การ์ดผู้จำหน่ายก็ไม่ได้เปลี่ยนมัน
• คุณกำลังวางเดิมพันการผลิตไว้ที่ DeepSWE 62.7 ก่อนที่ใครสักคนจะรันมันซ้ำ การพุ่งขึ้นจาก 12.8 เป็น 62.7 ในรีลีสเดียวคือการกล่าวอ้าง ไม่ใช่ข้อเท็จจริง รอการทดสอบซ้ำอย่างเป็นกลาง — ช่องว่าง 87.9 เทียบกับ 78.7 ใน Terminal-Bench แสดงให้เห็นว่าอาจพบอะไรบ้าง
• งานของคุณเป็นงานอัตโนมัติบนเทอร์มินัลแบบแซนด์บ็อกซ์หรือการสร้างแบบจำลองทางการเงินด้วย Excel Vals AI กล่าวว่าสิ่งเหล่านี้คือจุดที่โมเดลมีปัญหาจริง ๆ โดยไม่ขึ้นกับคะแนนของผู้จำหน่ายรายใด
• คุณกำลังตัดสินใจเรื่องความปลอดภัยทางไซเบอร์จาก CyberGym 83.3 นั่นคือ DeepSeek กำลังทดสอบโมเดลของตัวเองบนเกณฑ์ชี้วัดของตัวเอง — ผู้จำหน่ายโซลูชันความปลอดภัยที่อ้างอิงตัวเลขนี้ในการตัดสินใจซื้อ กำลังซื้อข้อมูลที่ไม่ผ่านการตรวจสอบ
บรรทัดล่าง
DeepSeek V4 Pro 0813 เป็นโมเดลระดับแนวหน้าที่แท้จริง โดยมีสกอร์การ์ดจากผู้จำหน่ายที่เหนือกว่าสถิติจากการประเมินอิสระ การเปิดตัวรุ่น 0813 เปลี่ยนจากตัวอย่างข้อความมาเป็นคู่แข่งที่จริงจังในด้านเอเจนต์ — เราได้กล่าวถึงการเปิดตัวนั้นแยกต่างหากแล้ว — และหากคุณต้องการประเมินวันนี้ มันคือคีย์ที่เข้ากันได้กับ OpenAI บน OrcaRouter ในราคารายการของ DeepSeek พร้อมระบบ failover อัตโนมัติหากผู้ให้บริการหยุดชะงัก เพียงอ่านสกอร์การ์ดตามที่บทความนี้แยกไว้: การตรวจสอบอิสระ (AA 53, Vals อันดับที่ 12, การรัน Terminal-Bench ที่ 78.7) คือสิ่งที่คุณเชื่อถือได้ในวันนี้ ส่วน 87.9s และ 62.7s คือสิ่งที่คุณควรตรวจสอบก่อนจะนำไปต่อยอด ซื้อมันเพราะความคุ้มค่าด้านราคาต่อประสิทธิภาพและบริบท 1M-token ไม่ใช่เพราะตัวเลขพาดหัวที่ยังไม่ได้รับการทำซ้ำ
การเปรียบเทียบในบทความนี้2
ตรวจพบจากบทความนี้ · เบนช์มาร์ก: Artificial Analysis · อัปเดตทุกวัน
