การ์ดหัวเรื่องหลักสำหรับบทความ 'DeepSeek V4 Pro Benchmarks': กระดานคะแนนพร้อมเกจขนาดใหญ่ หัวข้อ 'DeepSeek V4 Pro — กระดานคะแนนเบนช์มาร์ก' คำบรรยาย 'คะแนนทางการ 0813, การตรวจสอบอิสระ, และสิ่งที่ยังไม่มีใครทำซ้ำได้' และชิปที่ระบุว่า 'TERMINAL-BENCH 2.1: 87.9', 'DEEPSWE: 62.7', 'AA INDEX: 53', '1M CONTEXT' โลโก้ OrcaRouter ประกอบที่มุมขวาล่าง
Guides & Insights

การวัดประสิทธิภาพ DeepSeek V4 Pro: กระดานคะแนน 0813 ฉบับเต็ม การตรวจสอบอิสระทุกครั้ง และสิ่งที่ยังไม่มีใครยืนยัน

ผู้เขียน

Elias Hawthorne

วันที่เผยแพร่

โมเดลล่าสุด · 20ดูโมเดลทั้งหมด
เบนช์มาร์ก: Artificial Analysis · อัปเดตทุกวัน
กลับไปยังโพสต์ทั้งหมด

คำตอบแบบสั้น: จากตัวเลขของ DeepSeek เอง DeepSeek V4 Pro ทำสกอร์การ์ดด้าน agentic ได้แข็งแกร่งอย่างแท้จริง — Terminal-Bench 2.1 ที่ 87.9, DeepSWE ที่ 62.7, CyberGym ที่ 83.3 — แต่ตัวเลขหลักเกือบทุกตัวเป็นข้อมูลที่ผู้พัฒนารายงานเอง และภาพจากหน่วยงานอิสระกลับดูไม่ร้อนแรงเท่า Artificial Analysis จัดให้บิลด์ 0813 อย่างเป็นทางการได้ 53 คะแนนบน Intelligence Index เท่ากับ GLM-5.2 ตามหลัง GPT-5.6 Terra อยู่ 4 คะแนน และตามหลัง Kimi K3 อยู่ 7 คะแนน ส่วน Vals AI จัดอันดับให้อยู่อันดับที่ 12 ต่ำกว่า GPT-5.5 รุ่นก่อนหน้า บทความนี้คือการรวบรวมข้อมูลฉบับเต็มที่ยังไม่มีใครเขียน: สกอร์การ์ดของ 0813 ฉบับสมบูรณ์ ชุดทดสอบโค้ดแบบขยายจากรายงานทางเทคนิค ผลตรวจสอบจากหน่วยงานอิสระทุกชิ้นที่มีอยู่ และบันทึกที่ตรงไปตรงมาว่าตัวเลขใดบ้างที่ถูกพิสูจน์ซ้ำแล้ว และตัวเลขใดที่ยังเป็นเพียงคำกล่าวของ DeepSeek เพียงฝ่ายเดียว

กระดานคะแนน 0813 อย่างเป็นทางการ — ตัวเลขทั้งหมดของ DeepSeek เอง

ประกาศอย่างเป็นทางการของ DeepSeek (เอกสาร API, news260813, 13 สิงหาคม 2026) รายงานว่าบิลด์สำหรับการผลิตเทียบกับพรีวิวเดือนเมษายน ทุกตัวเลขในส่วนนี้มาจากผู้จำหน่าย — ยังไม่มีใครทำการยืนยันอย่างอิสระ ณ วันที่ 16 สิงหาคม 2026:

Terminal-Bench 2.1 — 87.9 (พรีวิว: 72.1).

DeepSWE — 62.7 (พรีวิว: 12.8) — เพิ่มขึ้นประมาณ 5 เท่า ซึ่งเป็นตัวเลขที่โดดเด่นที่สุดบนการ์ด

CyberGym — 83.3 (พรีวิว: 52.7).

Humanity's Last Exam — 42.7 โดยไม่ใช้เครื่องมือ, 60.0 โดยใช้เครื่องมือ (ตัวอย่าง: 37.7 / 48.2).

Toolathlon-Verified — 74.1 (พรีวิว: 55.9).

AutomationBench (สาธารณะ) — 31.8 (ตัวอย่าง: 12.8).

DSBench-FullStack — 71.1; DSBench-Hard — 67.2 (ตัวอย่าง: 41.8 / 31.1).

NL2Repo — 61.5 (พรีวิว: 38.5).

Agents' Last Exam — 25.7 (ตัวอย่าง: 16.5).

รูปแบบที่ควรสังเกตคือจุดที่ผลการปรับปรุงกระจุกตัว: เกณฑ์มาตรฐานด้าน agentic และความมั่นคงปลอดภัยทางไซเบอร์ นั่นคือประเภทของผลการประเมินที่ห้องปฏิบัติการผลิตขึ้นเมื่อต้องการโฆษณาโมเดลเอเจนต์ — และเป็นประเภทที่จำเป็นต้องมีการรันซ้ำอย่างเป็นกลางก่อนที่คุณจะใช้เงินในการผลิตไปกับมัน

Scoreboard card for DeepSeek V4 Pro's official 0813 benchmarks: rows read Terminal-Bench 2.1 87.9 (preview 72.1), DeepSWE 62.7 (12.8), CyberGym 83.3 (52.7), HLE with tools 60.0 (48.2), DSBench-FullStack 71.1 (41.8), Toolathlon-Verified 74.1 (55.9), with a footer reading 'All figures DeepSeek-reported via API docs news260813, Aug 13 2026 — none independently reproduced.'

ชุดรหัสที่ขยายจากรายงานทางเทคนิคของ DeepSeek

นอกเหนือจากการ์ดเอเจนต์แล้ว รายงานทางเทคนิคของ DeepSeek (ซึ่งรวบรวมโดย BenchLM เมื่อวันที่ 16 สิงหาคม 2026) ยังเพิ่มชุดการเขียนโค้ดและบริบทระยะยาวที่กว้างขึ้นด้วย นอกจากนี้ยังเป็นข้อมูลที่รายงานโดยผู้จำหน่าย และติดป้ายกำกับว่า "Provider exact" โดย BenchLM — ไม่มีการทดสอบอิสระ:

SWE-bench Verified — 80.6%; SWE-bench Pro — 55.4%.

LiveCodeBench Pass@1-CoT — 93.5% ซึ่งเป็นค่าที่ดีที่สุดที่ได้รับการยืนยันในแคตตาล็อกของ BenchLM

เรตติ้ง Codeforces — 3206 — ซึ่งเป็นอันดับที่ดีที่สุดที่ได้รับการยืนยันในแคตตาล็อก

BrowseComp — 83.4%; Terminal-Bench 2.0 — 67.9%.

MRCR 1M — 83.5%; CorpusQA 1M — 62.0% — ทั้งคู่เป็นสถิติที่ดีที่สุดในแคตตาล็อกสำหรับการดึงข้อมูลด้วย 1M โทเคน ซึ่งสำคัญสำหรับโมเดลที่โฆษณาหน้าต่างบริบทขนาด 1M โทเคน

GPQA Diamond — 92.8, SciCode — 49.2 และ Long-Context Recall — 75.3 (ตามที่แสดงอยู่ในหน้าโมเดลของ OrcaRouter)

สิ่งที่ผู้ประเมินอิสระวัดจริง

แหล่งข้อมูลอิสระสามแหล่งได้ทดสอบ DeepSeek V4 Pro และข้อสรุปของพวกเขากลุ่มอยู่ใต้การ์ดของผู้จำหน่าย:

Artificial Analysis Intelligence Index — 53 (รายงานของ SCMP, สิงหาคม 2026; หน้าโมเดลของ OrcaRouter แสดง 53.2 อยู่ในอันดับที่ 20 จาก 132) เสมอกับ GLM-5.2 ตามหลัง GPT-5.6 Terra อยู่ 4 คะแนน และตามหลัง Kimi K3 อยู่ 7 คะแนน

Artificial Analysis Coding — 68.8 อยู่ในอันดับที่ 24 จาก 130 (อ้างอิงจากหน้าข้อมูลโมเดลของ OrcaRouter)

Vals AI Index — อันดับที่ 12 ตามหลัง GPT-5.5 รุ่นก่อนหน้า และตามหลัง Kimi K3 และ Claude Opus 5 เป็นอย่างมาก (SCMP) การทดสอบของ Vals AI เองชี้ให้เห็นจุดอ่อนที่เป็นรูปธรรมสองประการ ได้แก่ การทำงานให้สำเร็จภายในสภาพแวดล้อมเทอร์มินัลแบบแซนด์บ็อกซ์ และการสร้างแบบจำลองทางการเงินที่ซับซ้อนในสเปรดชีต Excel

Vibe Code Bench v1.1 — 49.93 (Vals AI, การรันอิสระแบบ "Benchmark exact" เพียงหนึ่งเดียวในชุด)

บันทึกที่ซื่อตรง — สิ่งที่ถูกทำซ้ำแล้ว เทียบกับสิ่งที่ยังเป็นเพียงคำพูดของ DeepSeek

นี่คือส่วนที่บทความ benchmark มีไว้เพื่อนำเสนอ และเป็นเหตุผลที่ควรบุ๊กมาร์กหน้านี้มากกว่าการรายงานข่าวเปิดตัว แบ่งคะแนนทั้งหมดออกเป็นหนึ่งในสองกลุ่ม:

จากแหล่งข้อมูลอิสระ: AA Intelligence Index 53 / 53.2, AA Coding 68.8, Vals AI อันดับที่ 12, Vibe Code Bench 49.93 — และผลการรัน Terminal-Bench 2.1 จากแหล่งข้อมูลแยกต่างหากที่ได้ค่า 78.7 ที่อยู่เคียงข้าง 87.9 ของ DeepSeek บนหน้าโมเดลของ OrcaRouter ช่องว่างเก้าจุดระหว่างตัวเลขของผู้ขายและผลการรันอิสระคือจุดข้อมูลที่สำคัญที่สุดเพียงจุดเดียวบนหน้านี้: มันคือช่องว่างการทำซ้ำที่วัดออกมาเป็นตัวเลข

รายงานโดยผู้จำหน่ายเท่านั้น ยังไม่มีการทำซ้ำโดยอิสระ: ทุกตัวเลขในการ์ด 0813 อย่างเป็นทางการด้านบน (Terminal-Bench 2.1 87.9, DeepSWE 62.7, CyberGym 83.3, HLE 42.7/60.0, Toolathlon 74.1, AutomationBench 31.8, DSBench 71.1/67.2, NL2Repo 61.5, Agents' Last Exam 25.7) และชุดการเขียนโค้ดแบบขยายทั้งหมด (SWE-bench Verified 80.6, LiveCodeBench 93.5, Codeforces 3206, BrowseComp 83.4, MRCR 83.5, CorpusQA 62.0, GPQA Diamond 92.8) เอกสารของ DeepSeek เองระบุว่าตัวเลข Terminal-Bench 2.1 เป็น "provider run."

เมื่ออ่านแบบนั้น เรื่องราวก็สมเหตุสมผล: DeepSeek V4 Pro เป็นโมเดล frontier ระดับกลางจริงๆ — AA 53 อยู่อันดับที่ 13 ถึง 29 — พร้อมกับสกอร์การ์ดจากผู้ผลิตที่อ้างว่ามีประสิทธิภาพด้าน agentic และการเขียนโค้ดใกล้ระดับสูงสุด ข้อความทั้งสองเป็นจริงและไม่ขัดแย้งกัน ข้อหนึ่งวัดจากผลการทดสอบ อีกข้อหนึ่งเป็นการกล่าวอ้าง

Verification ledger card for DeepSeek V4 Pro: left column 'Independently sourced' lists AA Intelligence Index 53, AA Coding 68.8, Vals AI rank 12th, and a separate Terminal-Bench 2.1 run of 78.7; right column 'Vendor-reported only' lists Terminal-Bench 2.1 87.9, DeepSWE 62.7, CyberGym 83.3, LiveCodeBench 93.5, Codeforces 3206, SWE-bench Verified 80.6; footer reads 'Independent per Artificial Analysis, Vals AI, SCMP Aug 2026 · Vendor per DeepSeek API docs and technical report.'

ราคาสกอร์การ์ด

DeepSeek V4 Pro คือโมเดลเรือธง MoE ที่มีพารามิเตอร์รวม 1.6T / แอกทีฟ 49B พร้อมหน้าต่างบริบท 1M โทเคนและเอาต์พุตสูงสุด 384K บน OrcaRouter ราคาตามรายการของ DeepSeek โดยไม่มีมาร์กอัป: 0.435 ดอลลาร์ต่อล้านโทเคนอินพุต และ 0.87 ดอลลาร์ต่อล้านโทเคนเอาต์พุต (การอ่านแคช 0.060 ดอลลาร์ต่อล้านโทเคน) ตามไดเรกทอรีที่ตรวจสอบเมื่อวันที่ 15 สิงหาคม 2026 และยืนยันบนหน้าโมเดลจริง ในอัตรานี้ การคำนวณราคาต่อคะแนนคือข้อโต้แย้งที่แข็งแกร่งที่สุดสำหรับโมเดลนี้: ราคาเอาต์พุตอยู่ที่ประมาณหนึ่งในสิบของโมเดลที่ได้คะแนนใกล้เคียงกันในดัชนีอิสระ ดังนั้นคุณจึงจ่ายในราคากลาง ๆ เพื่อผลคะแนนที่หากคำกล่าวอ้างของผู้ให้บริการเป็นจริง ก็จะอยู่ใกล้ระดับบนสุด ข้อควรระวัง: DeepSeek ได้ประกาศตารางราคาช่วงพีค/นอกพีค (นอกพีคคิด 50% ของพีค) ซึ่งมีผลตั้งแต่วันที่ 17 สิงหาคม ตามเวลาในกรุงปักกิ่ง ดังนั้นอัตราจึงอาจเปลี่ยนแปลงได้ ตัวเลขที่แสดงนี้คือราคารายการจริง ณ เวลาที่เขียนบทความนี้

Screenshot of the OrcaRouter model page for DeepSeek V4 Pro 0813: input price about $0.44 and output about $0.88 per million tokens, cache read $0.060, a 1M-token context window and 384K max output, live performance figures of 80.8 tokens per second output speed and 0.16 percent error rate, and an Artificial Analysis Intelligence score of 53.2 ranked 20th of 132.

เมื่อคำแนะนำนี้ไม่ถูกต้อง

กรณีที่ตรงไปตรงมาที่ DeepSeek V4 Pro ไม่ควรเป็นตัวเลือกของคุณ:

คุณต้องการการให้เหตุผลระดับแนวหน้าที่ได้รับการยืนยันโดยอิสระAA Index 53 อยู่ในกลุ่มกลาง — Kimi K3 (60) และ GPT-5.6 Terra (57) อยู่ข้างหน้าและผ่านการยืนยันแล้ว หากการตัดสินใจของคุณขึ้นอยู่กับเพดานที่วัดได้ การ์ดผู้จำหน่ายก็ไม่ได้เปลี่ยนมัน

คุณกำลังวางเดิมพันการผลิตไว้ที่ DeepSWE 62.7 ก่อนที่ใครสักคนจะรันมันซ้ำ การพุ่งขึ้นจาก 12.8 เป็น 62.7 ในรีลีสเดียวคือการกล่าวอ้าง ไม่ใช่ข้อเท็จจริง รอการทดสอบซ้ำอย่างเป็นกลาง — ช่องว่าง 87.9 เทียบกับ 78.7 ใน Terminal-Bench แสดงให้เห็นว่าอาจพบอะไรบ้าง

งานของคุณเป็นงานอัตโนมัติบนเทอร์มินัลแบบแซนด์บ็อกซ์หรือการสร้างแบบจำลองทางการเงินด้วย Excel Vals AI กล่าวว่าสิ่งเหล่านี้คือจุดที่โมเดลมีปัญหาจริง ๆ โดยไม่ขึ้นกับคะแนนของผู้จำหน่ายรายใด

คุณกำลังตัดสินใจเรื่องความปลอดภัยทางไซเบอร์จาก CyberGym 83.3 นั่นคือ DeepSeek กำลังทดสอบโมเดลของตัวเองบนเกณฑ์ชี้วัดของตัวเอง — ผู้จำหน่ายโซลูชันความปลอดภัยที่อ้างอิงตัวเลขนี้ในการตัดสินใจซื้อ กำลังซื้อข้อมูลที่ไม่ผ่านการตรวจสอบ

บรรทัดล่าง

DeepSeek V4 Pro 0813 เป็นโมเดลระดับแนวหน้าที่แท้จริง โดยมีสกอร์การ์ดจากผู้จำหน่ายที่เหนือกว่าสถิติจากการประเมินอิสระ การเปิดตัวรุ่น 0813 เปลี่ยนจากตัวอย่างข้อความมาเป็นคู่แข่งที่จริงจังในด้านเอเจนต์ — เราได้กล่าวถึงการเปิดตัวนั้นแยกต่างหากแล้ว — และหากคุณต้องการประเมินวันนี้ มันคือคีย์ที่เข้ากันได้กับ OpenAI บน OrcaRouter ในราคารายการของ DeepSeek พร้อมระบบ failover อัตโนมัติหากผู้ให้บริการหยุดชะงัก เพียงอ่านสกอร์การ์ดตามที่บทความนี้แยกไว้: การตรวจสอบอิสระ (AA 53, Vals อันดับที่ 12, การรัน Terminal-Bench ที่ 78.7) คือสิ่งที่คุณเชื่อถือได้ในวันนี้ ส่วน 87.9s และ 62.7s คือสิ่งที่คุณควรตรวจสอบก่อนจะนำไปต่อยอด ซื้อมันเพราะความคุ้มค่าด้านราคาต่อประสิทธิภาพและบริบท 1M-token ไม่ใช่เพราะตัวเลขพาดหัวที่ยังไม่ได้รับการทำซ้ำ

การเปรียบเทียบในบทความนี้2

ตรวจพบจากบทความนี้ · เบนช์มาร์ก: Artificial Analysis · อัปเดตทุกวัน

© 2026 OrcaRouter

สำหรับผู้ให้บริการ

ให้บริการแพลตฟอร์มการอนุมานอยู่หรือไม่ นำโมเดลของคุณขึ้น OrcaRouter

ติดต่อเรา

เข้าร่วมคอมมูนิตี้ของเรา

DiscordEmailXGitHubYouTube