DeepSeek V4 Flash เปิดตัวอย่างเป็นทางการ: อธิบายโมเดล 1M-Context ที่ราคาถูก รวดเร็ว และเป็น Agentic
Guides & Insights

DeepSeek V4 Flash เปิดตัวอย่างเป็นทางการ: อธิบายโมเดล 1M-Context ที่ราคาถูก รวดเร็ว และเป็น Agentic

ผู้เขียน

Rowan Sterling

วันที่เผยแพร่

โมเดลล่าสุด · 20ดูโมเดลทั้งหมด
เบนช์มาร์ก: Artificial Analysis · อัปเดตทุกวัน
กลับไปยังโพสต์ทั้งหมด

DeepSeek V4 Flashเป็นรุ่นราคาถูกของตระกูล V4 ของ DeepSeek และผลการประเมินอิสระก็ไล่ตามมาทันในที่สุด: ในชุดทดสอบ AIME 2026 ของ MathArena ทำคะแนนได้ 95.83% ซึ่งไม่แตกต่างอย่างมีนัยสำคัญทางสถิติจาก 96.67% ของ DeepSeek V4 Pro ในขณะที่ต้นทุนต่อโจทย์อยู่ที่ประมาณหนึ่งในเก้า บิลด์ public-beta อย่างเป็นทางการ -0731 เปิดตัวเมื่อวันที่ 31 กรกฎาคม 2026 โดยใช้สถาปัตยกรรมเดียวกันกับพรีวิวเดือนเมษายน — โมเดล mixture-of-experts ขนาด 284 พันล้านพารามิเตอร์ มีพารามิเตอร์แอ็กทีฟ 13B บริบท 1 ล้านโทเคน — แต่ผ่านการโพสต์เทรนนิ่งเพิ่มเติมอีกชุด ซึ่งช่วยพัฒนาความสามารถด้านเอเจนต์ การเขียนโค้ด และการเรียกใช้เครื่องมือได้อย่างชัดเจน พร้อมรองรับ Responses-API แบบเนทีฟ และปรับแต่งเฉพาะสำหรับเอเจนต์สไตล์ Codex คู่มือนี้ครอบคลุมว่าการรีลีสครั้งนี้เปลี่ยนแปลงไปจริง ๆ อย่างไร การประเมินจากผู้ให้บริการและฝ่ายอิสระต่างพูดว่าอย่างไร ต้นทุนที่แท้จริงเมื่อคำนึงถึงปริมาณการคิดของมัน และวิธีเรียกใช้งาน

หมายเหตุด้านความถูกต้อง: รายละเอียดการเปิดตัวและคะแนน agentic หลักด้านล่างนี้มาจากบันทึกการเปลี่ยนแปลง API อย่างเป็นทางการของ DeepSeek (ลงวันที่ 2026-07-31) ซึ่งเป็นข้อมูลที่ผู้ให้บริการเป็นผู้รายงานและรันบนฮาร์เนสของ DeepSeek เอง — ควรถือเป็นเพียงข้อมูลบ่งชี้แนวโน้ม และควรทำการประเมินของคุณเอง ตัวเลขจากแหล่งอิสระจะมีการระบุแหล่งที่มาอย่างชัดเจนตามจุดที่ปรากฏ: Artificial Analysis สำหรับ Intelligence Index และองค์ประกอบต่าง ๆ, MathArena สำหรับ AIME 2026, และรายการราคาของ DeepSeek เองสำหรับข้อมูลด้านราคา หากเนื้อหาใดอ้างอิงจากรายงานของผู้ปฏิบัติงานเพียงรายเดียว แทนที่จะเป็นการประเมินที่เผยแพร่ ข้อความก็จะระบุไว้เช่นนั้น ข้อมูลจำเพาะและราคาเปลี่ยนแปลงได้ โปรดตรวจสอบก่อนนำไปพัฒนา

โดยสรุป V4 Flash เป็นรุ่นน้องที่คุ้มค่าด้านต้นทุนของ DeepSeek V4 Pro ยักษ์ใหญ่: MoE ขนาด 284B / แอคทีฟ 13B พร้อมบริบท 1 ล้านโทเคนและเอาต์พุตสูงสุด 384K ปรับแต่งมาสำหรับงานเอเจนต์ที่ปริมาณสูงและหน่วงเวลาต่ำ การเปิดตัวอย่างเป็นทางการในวันที่ 31 กรกฎาคมเป็นการอัปเกรดหลังการฝึก — ขนาดเท่าเดิม แต่เอเจนต์และการเขียนโค้ดดีขึ้นอย่างมีนัยสำคัญ — และยังเพิ่มการรองรับ Responses-API และ Codex แบบเนทีฟ DeepSeek รายงานคะแนนเอเจนต์/การเขียนโค้ดที่แข็งแกร่ง (เช่น Terminal-Bench 2.1 ได้ 82.7, Toolathlon ได้ 70.3) และ Artificial Analysis ก็ให้คะแนนบิลด์ -0731 ที่ 50 ในดัชนีความฉลาด (Intelligence Index): สูงกว่าตัวพรีวิวเดือนเมษายน 10 จุด สูงกว่า V4 Pro ซึ่งใหญ่กว่ามาก 6 จุด และเท่ากับ Gemini 3.6 Flash ราคาประมาณ $0.15 / $0.29 ต่อล้านโทเคนอินพุต/เอาต์พุต คิดเป็นประมาณหนึ่งในสามของราคา V4 Pro เฉพาะ Flash API ที่ได้รับการอัปเกรด ส่วน V4 Pro และแอป/เว็บ DeepSeek ไม่มีการเปลี่ยนแปลง บน OrcaRouter คุณจะได้ในราคามาร์กอัป 0% ผ่านเอนด์พอยต์ที่เข้ากันได้กับ OpenAI เพียงจุดเดียว

ประเด็นสำคัญ

• เวอร์ชันอย่างเป็นทางการ (build -0731, 31 กรกฎาคม 2026): การอัปเกรดหลังการฝึกของเวอร์ชันพรีวิว — สถาปัตยกรรมเดียวกัน แต่เอเจนต์ การเขียนโค้ด และการใช้งานเครื่องมือแข็งแกร่งขึ้นมาก

• สถาปัตยกรรมไม่เปลี่ยนแปลง: 284B รวม / 13B แอ็กทีฟ (MoE), บริบท 1M โทเคน (1,048,576), เอาต์พุตสูงสุด 384K, อินพุตเฉพาะข้อความ, พร้อมการให้เหตุผล เครื่องมือ และ JSON

• ใหม่: รองรับ Responses API โดยตรง พร้อมการปรับให้รองรับ Codex โดยเฉพาะ; ยังคงรองรับ OpenAI ChatCompletions และอินเทอร์เฟซแบบ Anthropic รหัสโมเดล deepseek-v4-flash.

• ผลลัพธ์ด้าน agentic/coding ที่ DeepSeek รายงาน: Terminal-Bench 2.1 82.7, Toolathlon (ที่ยืนยันแล้ว) 70.3, Cybergym 76.7, DeepSWE 54.4, NL2Repo 54.2, DSBench-FullStack 68.7.

• ถูกมาก: ประมาณ $0.15 / $0.29 ต่อ 1M โทเค็นอินพุต/เอาต์พุต — ประมาณหนึ่งในสามของ V4 Pro ที่ $0.44 / $0.88 — และ DeepSeek คิดราคา cache hits ที่ $0.0028 ต่อ 1M ซึ่งต่ำกว่าอินพุตใหม่ประมาณ 98% เฉพาะ Flash API ที่เปลี่ยนไป ส่วน Pro และแอป/เว็บเหมือนเดิม

สิ่งที่เวอร์ชันอย่างเป็นทางการอัปเกรดจริง ๆ

V4 Flash เปิดตัวครั้งแรกในรูปแบบพรีวิวเมื่อวันที่ 24 เมษายน 2026 ส่วนรุ่นที่เปิดตัวอย่างเป็นทางการเมื่อวันที่ 31 กรกฎาคม 2026 (บิลด์ -0731 ตามบันทึกการเปลี่ยนแปลง API ของ DeepSeek) นั้นชัดเจนว่าไม่ใช่สถาปัตยกรรมใหม่: พารามิเตอร์รวมและพารามิเตอร์ที่ใช้งานจริง (284B / 13B) และหน้าต่างบริบท 1M ยังคงเท่าเดิม สิ่งที่เปลี่ยนไปคือ post-training — การปรับจูนเพิ่มเติมซึ่ง DeepSeek กล่าวว่าช่วยพัฒนาความสามารถหลักด้าน agentic การเขียนโค้ด และการเรียกใช้เครื่องมือได้อย่างมีนัยสำคัญ การเพิ่มเติมเชิงปฏิบัติที่สำคัญสองประการ: V4 Flash รองรับ Responses API แบบเนทีฟ และถูกปรับแต่งมาโดยเฉพาะสำหรับ coding agents แบบ Codex โดยยังคงรองรับอินเทอร์เฟซแบบ OpenAI ChatCompletions และแบบ Anthropic ที่สำคัญ มีเพียง Flash API เท่านั้นที่ได้รับการอัปเกรดในรุ่นนี้ ส่วน V4 Pro และประสบการณ์การใช้งานแอป/เว็บของ DeepSeek ยังคงเดิม สำหรับทีม นั่นหมายถึงการปรับปรุงที่ใช้แทนที่ได้ทันทีสำหรับงานด้าน agentic ในราคาเดิม โดยไม่ต้องย้ายระบบ

สถาปัตยกรรม: MoE แบบแอคทีฟขนาดเล็กที่ออกแบบมาเพื่อปริมาณงาน

V4 Flash เป็นโมเดลแบบ mixture-of-experts ที่มีพารามิเตอร์ทั้งหมดประมาณ 284 พันล้าน แต่มีเพียงประมาณ 13 พันล้านที่ทำงานต่อโทเคน จำนวนพารามิเตอร์ที่ทำงานอยู่น้อยนี่คือจุดสำคัญ: มันทำให้การอนุมาน (inference) รวดเร็วและประหยัดค่าใช้จ่าย ขณะที่กลุ่มผู้เชี่ยวชาญขนาดใหญ่ช่วยรักษาคุณภาพ หน้าต่างบริบท (context window) มีขนาดเต็ม 1,048,576 โทเคน (ประมาณ 1M) โดยมีเอาต์พุตสูงสุดถึง 384K ซึ่งใหญ่เป็นพิเศษ และโมเดลรองรับการใช้เหตุผล (extended thinking), การเรียกใช้เครื่องมือ (tool calling) และ JSON แบบมีโครงสร้าง อินพุตรองรับเฉพาะข้อความเท่านั้น เป้าหมายการออกแบบ — งานที่มีปริมาณสูง หน่วงเวลาต่ำ และเป็นแบบ agentic — สะท้อนให้เห็นในตัวเลขการให้บริการ: p50 time-to-first-token ประมาณ 394 มิลลิวินาที และเอาต์พุตประมาณ 184 โทเคนต่อวินาที จากการวัดของ OrcaRouter

Benchmarks: ตัวเลขอย่างเป็นทางการบอกอะไร

การเปิดตัวอย่างเป็นทางการเน้นไปที่การประเมินแบบ agentic และการประเมินการเขียนโค้ดเป็นหลัก ซึ่งดำเนินการด้วยแฮร์เนสของ DeepSeek เอง (โดยใช้การตั้งค่า minimal-mode / max-effort) นี่คือวิธีอ่านผลลัพธ์หลักทั้งหมดตามที่ DeepSeek รายงาน:

• Terminal-Bench 2.1: 82.7 — งานแบบ agentic เกี่ยวกับ command-line/ซอฟต์แวร์ในเทอร์มินัลจริง คะแนนสูงในส่วนนี้บ่งชี้ว่าโมเดลสามารถขับเคลื่อนเครื่องมือและเชลล์ได้จริง ไม่ใช่แค่ตอบคำถาม

• Toolathlon (verified): 70.3 และ Automation Bench (Public): 25.1 — ความกว้างและความน่าเชื่อถือของการใช้เครื่องมือและการทำงานอัตโนมัติแบบครบวงจร ความน่าเชื่อถือในการเรียกใช้เครื่องมือเป็นคุณสมบัติที่กำหนดความสำเร็จหรือความล้มเหลวของเอเจนต์

• Cybergym: 76.7 — การแก้ปัญหาเชิงเอเจนต์แบบ security/CTF

• DeepSWE: 54.4, NL2Repo: 54.2, DSBench-FullStack: 68.7, DSBench-Hard: 59.6 — การเขียนโค้ดด้านวิศวกรรมซอฟต์แวร์และฟูลสแตก ตั้งแต่การสร้างในระดับรีโพซิทอรีไปจนถึงงานวิทยาศาสตร์ข้อมูลที่ยาก คะแนน DSBench-FullStack (68.7) ที่สูงบ่งชี้ถึงความสามารถในการเขียนโค้ดหลายไฟล์ในทางปฏิบัติ

• Agent Last Exam: 25.2 — บททดสอบการให้เหตุผลแบบเอเจนต์ที่จงใจทำให้ยาก ซึ่งแม้แต่โมเดลชั้นนำก็ยังได้คะแนนต่ำ มีประโยชน์ในฐานะสัญญาณเชิงสัมพัทธ์ ไม่ใช่ค่าสัมบูรณ์

สำหรับบริบทอิสระ Artificial Analysis ได้ประเมินบิลด์ -0731 เองแล้ว และให้คะแนน 50 ในดัชนีปัญญาประดิษฐ์ของ Artificial Analysis — สูงกว่าพรีวิวเดือนเมษายนที่มันแทนที่สิบจุด สูงกว่า V4 Pro ที่ใหญ่กว่ามากหกจุด และเท่ากับ Gemini 3.6 Flash ผลลัพธ์องค์ประกอบ: GPQA Diamond 91%, AA-LCR 66%, Humanity's Last Exam 37%, SciCode 50%, τ³-Bench Banking 31%, CritPt 17% และ Elo 1559 บน GDPval-AA v2 สองรายการในนั้นควรค่าแก่การพิจารณาอีกครั้ง Artificial Analysis วัด Terminal-Bench 2.1 ได้ 79% เทียบกับที่ DeepSeek รายงาน 82.7 — ใกล้เคียงแต่ต่ำกว่า ซึ่งเป็นทิศทางที่ตัวเลขจากชุดทดสอบของผู้ขายมักพลาด และบน AA-Omniscience โมเดลได้ -16 โดยมีอัตราการหลอนที่วัดได้สูง ฉะนั้นเรื่องเล่าเรื่องราคาถูกและความเป็นเอเจนต์จึงไม่ขยายไปถึงการเรียกคืนข้อเท็จจริงโดยไม่มีการกำกับดูแล นั่นคือวิธีที่เฉียบคมกว่าในการอ่านโมเดลนี้: การให้เหตุผลที่แข็งแกร่งต่อดอลลาร์ แต่ความรู้ที่อ่อนแอต่อการสอบถามหนึ่งครั้ง

คณิตศาสตร์แข่งขัน: จุดเดียวที่ Flash เทียบเท่า Pro

บทวิเคราะห์อิสระที่มีประโยชน์ที่สุดเกี่ยวกับการให้เหตุผลของ V4 Flash มาจาก MathArena ซึ่งรันโมเดลทุกตัวสี่ครั้งต่อแต่ละโจทย์ของการแข่งขันที่เพิ่งปล่อยออกมา และเผยแพร่ตารางผลรายโจทย์ ใน AIME 2026 — ทั้งสองชุดข้อสอบ 30 โจทย์ แต่ละชุดรันสี่ครั้ง — V4 Flash ในโหมด max-reasoning ได้คะแนน 95.83% ±3.58% เทียบกับ DeepSeek V4 Pro ที่ได้ 96.67% ±3.21% ช่วงความคลาดเคลื่อนเหล่านั้นทับซ้อนกันเกือบสมบูรณ์: บนเกณฑ์ชี้วัดนี้ โมเดลขนาดเล็กไม่ได้แย่กว่าโมเดลเรือธงอย่างมีนัยสำคัญที่วัดได้ คอลัมน์ต้นทุนคือจุดที่ทั้งสองแยกจากกัน MathArena ระบุว่าการรัน V4 Flash หนึ่งครั้งมีค่าใช้จ่าย $0.009 ต่อโจทย์ เทียบกับ $0.082 สำหรับ V4 Pro — ถูกกว่าประมาณเก้าเท่าสำหรับความแม่นยำเท่ากัน ซึ่งเป็นเหตุผลสนับสนุนที่แข็งแกร่งกว่าสำหรับระดับประสิทธิภาพมากกว่าสิ่งใดในการประกาศของ DeepSeek เอง

ควรกล่าวถึงข้อควรระวังสองข้อในคราวเดียวกัน MathArena ติดป้ายเตือนการปนเปื้อนให้กับ DeepSeek ทั้งสองรายการ ซึ่งเป็นป้ายสำหรับโมเดลที่เผยแพร่หลังการแข่งขันปรากฏขึ้น ดังนั้นความแม่นยำบางส่วนอาจมาจากการจดจำมากกว่าการใช้เหตุผล และเวอร์ชันที่ MathArena ทดสอบคือวันที่ 2026-04-24 — พรีวิวเดือนเมษายน ไม่ใช่บิลด์ -0731 ในขณะที่เขียนนี้ ยังไม่มีคะแนน AIME 2026 อิสระสำหรับเวอร์ชันทางการ และการ์ดโมเดลของ DeepSeek เองไม่ได้เผยแพร่เกณฑ์มาตรฐานทางคณิตศาสตร์สำหรับมันเลย มีเพียงแบบ agentic เท่านั้น

ตารางยังแสดงตำแหน่งของเพดานด้วย เกือบทุกรุ่นบนกระดานทำคะแนนผ่านข้อส่วนใหญ่ของ AIME 2026; โจทย์ที่แยกพวกเขาออกจากกันคือข้อ 15 มีเพียงสองรายการที่แก้ได้ทั้งสี่รอบ — GPT-5.5 ที่ความพยายามระดับพิเศษสูง และ Claude Opus 4.8 ที่ระดับสูงสุด V4 Flash ได้ศูนย์จากสี่ในข้อนั้น และ V4 Pro ก็เช่นกัน พร้อมกับ GLM-5.2, Gemini 3.6 Flash, Kimi K2.6 และ Claude Opus 4.7

รายละเอียดสุดท้ายนั่นคือสิ่งที่ทำให้รายงานฉบับหนึ่งจากวันที่ 5 สิงหาคม 2026 น่าสนใจที่จะชี้ให้เห็น นักวิจารณ์ AI @teortaxesTex โพสต์ว่าบิลด์ -0731 แก้โจทย์ข้อ 15 ของ AIME 2026 ได้สำเร็จ โดยใช้เวลาประมาณ 1,006 วินาทีและโทเค็นเอาต์พุตประมาณ 100,000 โทเค็น และบรรยายว่าโมเดลเริ่มจะโกงโจทย์อย่างเห็นได้ชัดก่อนที่จะละทิ้งทางลัดและแก้โจทย์อย่างตรงไปตรงมา นี่คือการรันครั้งเดียวของนักปฏิบัติคนหนึ่ง ไม่ใช่ผลลัพธ์จากการวัดมาตรฐาน: ยังไม่มีการทำซ้ำ ไม่มีลีดเดอร์บอร์ดสาธารณะใดให้คะแนนบิลด์ -0731 และทรานสคริปต์เดี่ยวๆ ไม่ใช่การประเมินผล สิ่งที่ตรวจสอบได้คือความสอดคล้องภายใน และมันก็ผ่านเกณฑ์ — Artificial Analysis วัดเอาต์พุตของโมเดลนี้ได้ประมาณ 116 โทเค็นต่อวินาที และ 1,006 วินาทีที่อัตรานั้นคือประมาณ 117,000 โทเค็น ซึ่งเป็นระดับเดียวกันกับจำนวนที่รายงาน คำตอบ 100,000 โทเค็นยังอยู่ในช่วงที่ DeepSeek คาดหวังไว้ เนื่องจากแนะนำให้อนุญาตโทเค็นเอาต์พุตสูงสุด 384K ที่ระดับการใช้เหตุผลสูงหรือสูงสุด ตัวเลขทั้งสองสูงกว่าค่าเฉลี่ยที่ MathArena วัดได้สำหรับโมเดลนี้ประมาณสามเท่า (โทเค็นเอาต์พุต 33,588 และ 6 นาที 50 วินาทีต่อคำตอบ) ซึ่งเป็นสิ่งที่คาดหวังได้สำหรับโจทย์ที่ยากที่สุดข้อเดียวในชุด ดังนั้น: มีเหตุผลในโครงสร้าง ยังไม่ได้รับการยืนยันในผลลัพธ์ และถ้ามันทำซ้ำได้ มันก็เป็นการก้าวกระโดดครั้งใหญ่เหนือบิลด์พรีวิว ซึ่งล้มเหลวในโจทย์ข้อนั้นสี่ครั้งจากสี่ครั้ง

การตั้งราคา: ตัวเลขที่เปลี่ยนแปลงงบประมาณ

บน OrcaRouter ซึ่งส่งผ่านราคาของผู้ให้บริการโดยไม่บวกกำไร (0% markup) V4 Flash อยู่ที่ประมาณ 0.15 ดอลลาร์ต่อล้านโทเคนอินพุต และ 0.29 ดอลลาร์ต่อล้านโทเคนเอาต์พุต ส่วน DeepSeek คงราคาเท่าเดิมสำหรับการอัปเกรดครั้งนี้ ซึ่งคิดเป็นประมาณหนึ่งในสามของราคา DeepSeek V4 Pro ที่ 0.44 / 0.88 ดอลลาร์ การแคชที่โดนฮิตมีราคาถูกกว่าที่คนส่วนใหญ่คิดไว้: DeepSeek ระบุราคาอินพุตที่ถูกแคชไว้ที่ 0.0028 ดอลลาร์ต่อล้านโทเคน ซึ่งต่ำกว่าอินพุตใหม่ราว 98% นี่คือสิ่งที่ทำให้เอเจนต์และแชทที่มี system prompt คงที่นั้นประหยัดค่าใช้จ่ายในการรันต่อเนื่องได้มาก ในแง่ที่เป็นรูปธรรม 10 ล้านโทเคนต่อเดือน โดยแบ่งเป็นอินพุต 70% / เอาต์พุต 30% จะมีค่าใช้จ่ายอยู่ที่หลักไม่กี่ดอลลาร์ แต่ถ้าขยายไปถึงพันล้านโทเคน ช่องว่างด้านราคากับโมเดลเรือธงก็จะกลายเป็นรายการค่าใช้จ่ายที่ฝ่ายการเงินต้องจับตามอง

อย่างไรก็ตาม สำหรับโมเดลแบบใช้เหตุผล (reasoning model) แล้ว อัตราค่าบริการคือครึ่งหนึ่งของบิลที่น่าสนใจน้อยกว่า — สิ่งที่ขับเคลื่อนงบประมาณคือจำนวนโทเคนที่โมเดลเลือกจะใช้ Artificial Analysis ต้องใช้โทเคนเอาต์พุตประมาณ 206 ล้านโทเคนเพื่อรัน Intelligence Index ฉบับเต็มบน V4 Flash ซึ่งมากกว่าค่ามัธยฐาน ~100 ล้านโทเคนของโมเดลทั้งหมดที่ทดสอบประมาณสองเท่า และระบุว่าโมเดลนี้ทำงานเร็วแต่ใช้คำฟุ่มเฟือยมาก เมื่อคิดเป็นค่าใช้จ่ายแล้ว คำตอบขนาด 100,000 โทเคนหนึ่งคำตอบมีราคาประมาณสามเซนต์ และเพดานเอาต์พุต 384K ทำให้คำตอบหนึ่งคำตอบมีราคาสูงสุดเกือบสิบเอ็ดเซนต์ ถูกในแง่ตัวเลขสัมบูรณ์ แต่ก็แพงกว่าคำตอบสั้นๆ หลายร้อยเท่า — ซึ่งเป็นเหตุผลว่าทำไม 'ความพยายามในการใช้เหตุผล' (reasoning effort) จึงเป็นคันโยกงบประมาณ ไม่ใช่ปุ่มปรับคุณภาพที่คุณปล่อยค้างไว้ที่ระดับสูงสุดตลอดเวลา บทความจากการลงมือทดลองใช้งานจริงของ Simon Willison ชี้ประเด็นเดียวกันจากอีกทิศทางหนึ่ง: ในการตั้งค่าเริ่มต้น ผลลัพธ์ที่เขาสร้างขึ้นในการทดสอบนั้นน่าผิดหวัง และเมื่อเพิ่มระดับ reasoning effort เป็นสูง ผลลัพธ์ก็ดีขึ้นอย่างมีนัยสำคัญ จงวัดปริมาณคำขอที่ยากของคุณเอง ก่อนที่จะสรุปว่าอัตราที่ประกาศไว้คือต้นทุนที่แท้จริงของคุณ

V4 Flash เหมาะกับตำแหน่งใดในลำดับชั้น DeepSeek V4

สายผลิตภัณฑ์ V4 ของ DeepSeek คือบันได V4 Pro คือรุ่นเรือธง — โมเดลระดับท็อปที่ใหญ่กว่ามากสำหรับการให้เหตุผลและการเขียนโค้ด V4 Flash คือระดับประสิทธิภาพ: ใช้คอมพิวต์แบบแอกทีฟน้อยกว่ามาก ราคาเพียงเศษเสี้ยว และหลังจากการอัปเกรดภายหลังการเทรนครั้งนี้ มีความสามารถด้านเอเจนต์และการเขียนโค้ดที่แข็งแกร่งอย่างแท้จริง ความจริงที่ว่า DeepSeek ลงทุนเพื่อทำให้ Flash ดีขึ้นในฐานะเอเจนต์ (Responses API, การปรับ Codex, เกณฑ์วัดการใช้เครื่องมือ) บอกให้รู้ว่าบริษัทคาดหวังให้ปริมาณการใช้งานไปอยู่ที่ใด แต่ตัวเลขจาก AIME 2026 ทำให้เรื่องเล่าที่ดูเข้าท่าและเป็นใจให้ Flash กลายเป็นเรื่องซับซ้อน ในการแข่งขันคณิตศาสตร์ โมเดลทั้งสองอยู่ภายในช่วงความคลาดเคลื่อนของกันและกัน ดังนั้นการ "ส่งโจทย์ยากให้ Pro" จึงไม่ใช่สิ่งที่ถูกต้องโดยอัตโนมัติ การแบ่งงานอย่างตรงไปตรงมาคือ Pro ให้ความรู้ที่กว้างขวางและงานเอเจนต์ที่ยากที่สุด ไม่ใช่โอกาสที่ดีกว่าในการแก้โจทย์คณิตศาสตร์ยาก ซึ่งเป็นเหตุผลว่าทำไมการจัดเส้นทางตามระดับความยากที่วัดได้จากงานของคุณเอง จึงดีกว่าการเลือกใช้โมเดลใหญ่ที่สุดโดยปริยาย.

สามสถานการณ์ในโลกจริง

1. เอเจนต์เขียนโค้ดและเวิร์กโฟลว์แบบ Codex

-0731 บิลด์นี้รองรับ Responses-API และ Codex แบบเนทีฟ รวมถึงคะแนน Terminal-Bench (82.7) และ DSBench-FullStack (68.7) ทำให้ V4 Flash เป็นเอนจินที่แข็งแกร่งและราคาไม่แพงสำหรับเอเจนต์เขียนโค้ดอัตโนมัติ — การแก้ไขปัญหา การรีแฟคเตอร์ การสร้างเทสต์ และการใช้เครื่องมือแบบหลายขั้นตอน

2. เอเจนต์ที่ใช้เครื่องมือปริมาณมาก

โทเค็นแรกที่รวดเร็ว (~394 ms), ทรูพุตสูง (~184 tok/s), บริบท 1M และความน่าเชื่อถือ Toolathlon (70.3) ที่แข็งแกร่ง เหมาะสำหรับเอเจนต์ในระบบการผลิตที่เรียกใช้เครื่องมือในระดับใหญ่ — การดึงข้อมูล, ระบบอัตโนมัติ, การจัดประสานงาน

3. การประมวลผลเอกสารยาวในงบประมาณจำกัด

คอนเทกซ์เต็มรูปแบบขนาด 1M โทเคนและเอาต์พุต 384K จัดการการสรุป วิเคราะห์ หรือแปลงอินพุตขนาดใหญ่มาก — บันทึก, ฐานโค้ด, รายงานยาว — ในรอบเดียวอย่างประหยัด

วิธีเข้าถึง V4 Flash

คุณสามารถเรียกใช้ V4 Flash ได้โดยตรงบน API ของ DeepSeek (รหัสโมเดล deepseek-v4-flash; รองรับทั้ง Responses API, OpenAI ChatCompletions และอินเทอร์เฟซแบบ Anthropic) หรือผ่านเอนด์พอยต์ที่ไม่ผูกติดกับผู้ให้บริการรายใด OrcaRouter ให้บริการ V4 Flash แบบไม่มีมาร์กอัป (0%) ผ่านเอนด์พอยต์เดียวที่เข้ากันได้กับ OpenAI (deepseek/deepseek-v4-flash) ควบคู่กับโมเดลอื่นๆ อีกกว่า 200 รายการ — คุณจึงสามารถเปรียบเทียบประสิทธิภาพกับ GPT-5.6 Luna, Gemini 3.6 Flash, GLM-5.2, Qwen3.8-Max และ Kimi K3 ได้ในที่เดียว และกำหนดเส้นทางคำขอแต่ละรายการไปยังตัวเลือกที่ถูกที่สุดสำหรับงานนั้นๆ เนื่องจากราคาถูกส่งผ่านโดยตรงโดยไม่มีการบวกเพิ่ม การเปลี่ยนแปลงราคาของ DeepSeek จึงสะท้อนในบิลของคุณตั้งแต่วันที่ประกาศใช้ และเนื่องจากอินเทอร์เฟซเข้ากันได้กับ OpenAI การนำ V4 Flash มาใช้ — หรือการเปลี่ยนออกจากมันหลังจากการวัดผลหนึ่งสัปดาห์ — จึงเป็นเพียงการเปลี่ยนแปลงการตั้งค่า ไม่ใช่การบูรณาการระบบใหม่

ข้อจำกัดและข้อควรระวังที่ตรงไปตรงมา

V4 Flash เป็นโมเดลที่เน้นประสิทธิภาพ ไม่ใช่รุ่นเรือธง แต่ข้อมูลอิสระทำให้ขอบเขตนั้นชัดเจนกว่าแค่ "แย่กว่ในงานยาก" ในการทดสอบ AIME 2026 มันทำผลงานเทียบเท่า V4 Pro ภายในช่วงความเชื่อมั่น จุดที่ตามหลังอย่างชัดเจนคือความกว้างของความรู้ — AA-Omniscience -16 และอัตราการหลอน (hallucination) ที่วัดได้สูง — และงานที่ต้องใช้ agentic ที่ท้าทายที่สุด อินพุตรองรับเฉพาะข้อความ ไม่มีการรับรูปภาพโดยตรง คะแนน agentic หลักเป็นตัวเลขที่ DeepSeek รายงานจากชุดทดสอบของตัวเอง และตัวเลขหนึ่งที่ห้องแล็บอิสระนำมาทดสอบซ้ำได้ผลต่ำกว่า (Artificial Analysis วัด Terminal-Bench 2.1 ได้ 79% เทียบกับที่รายงานไว้ 82.7) ดังนั้นควรถือว่าตัวเลขจากผู้ผลิตเป็นเพียงแนวโน้ม และ "ถูกต่อโทเคน" ไม่ใช่ "ถูกต่องาน" โมเดลนี้มี output ที่เยิ่นเย้ออย่างที่วัดได้ ดังนั้นควรจำกัดระดับการใช้เหตุผลและการวนซ้ำของเครื่องมือสำหรับงานง่ายๆ แทนที่จะเปิดค่าความพยายามสูงสุดเป็นค่าเริ่มต้น ควรทดสอบกับ workload ของตัวเองก่อนที่จะนำไปใช้กับการรับส่งข้อมูลในระบบ production

คำถามที่พบบ่อย

DeepSeek V4 Flash คืออะไร?

โมเดลประสิทธิภาพของ DeepSeek ในสายผลิตภัณฑ์ V4: โมเดล mixture-of-experts ขนาด 284B / 13B-active พร้อมบริบท 1M โทเคน เอาต์พุตสูงสุด 384K ปรับแต่งมาสำหรับงานที่รวดเร็ว ปริมาณสูง งาน agentic และงานเขียนโค้ด เวอร์ชันเผยแพร่อย่างเป็นทางการ (build -0731) เปิดตัวเมื่อวันที่ 31 กรกฎาคม 2026

มีการเปลี่ยนแปลงอะไรบ้างในเวอร์ชันทางการ

สถาปัตยกรรมไม่มีการเปลี่ยนแปลง เป็นการอัปเกรดหลังการฝึกอบรมที่ช่วยพัฒนาความสามารถด้านเอเจนต์ การเขียนโค้ด และการเรียกใช้เครื่องมืออย่างมีนัยสำคัญ และเพิ่มการรองรับ Responses-API ดั้งเดิมพร้อมการปรับใช้ Codex มีเพียง Flash API เท่านั้นที่ได้รับการอัปเกรด — ส่วน V4 Pro และแอป/เว็บยังคงเหมือนเดิม

V4 Flash ราคาเท่าไหร่?

ประมาณ $0.15 ต่ออินพุตโทเคนหนึ่งล้านตัว และ $0.29 ต่อเอาต์พุตโทเคนหนึ่งล้านตัวบน OrcaRouter (ส่วนเพิ่ม 0%) — คิดเป็นประมาณหนึ่งในสามของ V4 Pro ที่ราคา $0.44 / $0.88 — โดย cache hits ระบุไว้ที่ $0.0028 ต่อหนึ่งล้าน ซึ่งต่ำกว่าอินพุตใหม่ประมาณ 98% ราคายังคงเท่าเดิมในรุ่นนี้ ควรวางงบประมาณสำหรับทั้งปริมาณโทเคนและอัตราด้วย เพราะนี่คือโมเดล reasoning ที่ให้รายละเอียดมาก และคำตอบที่มี 100,000 โทเคนมีต้นทุนประมาณสามเซนต์

V4 Flash เก่งแค่ไหนในงาน agentic และงานเขียนโค้ด?

DeepSeek รายงานคะแนนที่แข็งแกร่ง: Terminal-Bench 2.1 82.7, Toolathlon (verified) 70.3, Cybergym 76.7, DeepSWE 54.4, DSBench-FullStack 68.7 — ทั้งหมดเป็นตัวเลขจากชุดทดสอบของผู้จำหน่าย ดังนั้นควรตรวจสอบกับงานของคุณเอง

V4 Flash เก่งคณิตศาสตร์การแข่งขันไหม?

ดีเกินกว่าราคาที่แนะนำ ในการจัดอันดับ AIME 2026 ของ MathArena บิลด์พรีวิวเดือนเมษายนได้คะแนน 95.83% จากการรันสี่ครั้ง ครั้งละ 30 ข้อ — อยู่ในช่วงความเชื่อมั่นของ 96.67% ของ V4 Pro ที่ต้นทุนต่อโจทย์ประมาณหนึ่งในเก้า — แม้ว่า MathArena จะชี้ว่าโมเดลทั้งสองอาจมีการปนเปื้อนของข้อมูล และยังไม่ได้ให้คะแนนบิลด์ -0731 โจทย์ข้อเดียวที่ไม่เคยแก้ได้คือข้อ 15 ซึ่งมีเพียง GPT-5.5 ที่ใช้ระดับความพยายามสูงพิเศษและ Claude Opus 4.8 ที่ใช้ระดับสูงสุดเท่านั้นที่แก้ได้อย่างน่าเชื่อถือ

V4 Flash เปรียบเทียบกับ V4 Pro อย่างไร

Pro คือเรือธงที่ใหญ่กว่ามากสำหรับงานให้เหตุผลและการเขียนโค้ดที่ยากที่สุด; Flash คือระดับประสิทธิภาพในราคาประมาณ 1 ใน 3 พร้อมความสามารถด้าน agentic/coding ที่แข็งแกร่ง ส่งงานยากไปที่ Pro ส่วนงานอื่นๆ ทั้งหมดไปที่ Flash

หน้าต่างบริบทคืออะไร?

โทเคนเต็ม 1,048,576 โทเคน (ประมาณ 1M) โดยมีโทเคนเอาต์พุตสูงสุด 384K

V4 Flash รองรับหลายรูปแบบหรือไม่

ไม่ — อินพุตเป็นข้อความเท่านั้น รองรับการให้เหตุผล การเรียกใช้เครื่องมือ และเอาต์พุต JSON

V4 Flash ทำงานร่วมกับ Responses API และ Codex ได้หรือไม่

ใช่ — เวอร์ชัน -0731 เพิ่มการรองรับ Responses-API แบบเนทีฟและการปรับให้เข้ากับ Codex โดยเฉพาะ ควบคู่ไปกับอินเทอร์เฟซแบบ OpenAI ChatCompletions และแบบ Anthropic

ฉันจะใช้ V4 Flash ได้อย่างไร?

โดยตรงผ่าน API ของ DeepSeek หรือผ่าน endpoint ที่เข้ากันได้กับ OpenAI ของ OrcaRouter โดยไม่คิดค่าธรรมเนียมเพิ่ม (deepseek/deepseek-v4-flash), ซึ่งคุณยังสามารถเปรียบเทียบและจัดเส้นทางไปยังโมเดลคู่แข่งได้

บรรทัดล่าง

การเปิดตัวอย่างเป็นทางการของ DeepSeek V4 Flash ยังคงสูตรที่ถูกและเร็ว และทำให้เป็นเอเจนต์ที่ดีขึ้นมาก: MoE เดิมขนาด 284B / 13B-active และบริบท 1M, ผ่านการเทรนเพิ่มเติมเพื่อการเขียนโค้ดและการใช้เครื่องมือที่แข็งแกร่งขึ้น, รองรับ Responses-API และ Codex โดยกำเนิด, ในราคาเท่าเดิม ~$0.15 / $0.29 ตัวเลขจากหน่วยงานอิสระตอนนี้สนับสนุนคำโฆษณาส่วนใหญ่ — Artificial Analysis จัดให้บิลด์ -0731 อยู่ในระดับเดียวกับ Gemini 3.6 Flash ด้านความฉลาด และ MathArena พบบิลด์พรีวิวทำคะแนนเท่า V4 Pro ใน AIME 2026 ด้วยต้นทุนต่อปัญหาหนึ่งในเก้า สิ่งที่ราคาถูกไม่ได้ซื้อคือความกว้างของความรู้หรือการปล่อยให้พูดเยอะได้ฟรี: โมเดลนี้ใช้โทเคนประมาณสองเท่าของโมเดลทั่วไป ดังนั้นค่าใช้จ่ายต่องานของคุณขึ้นอยู่กับระดับการใช้เหตุผลที่คุณอนุญาตมากกว่าราคาที่โฆษณา รันผ่านเอนด์พอยต์ที่เข้ากันได้กับ OpenAI และไม่มีมาร์กอัปอย่าง OrcaRouter วัดว่าคำขอที่ยากๆ ของคุณใช้จ่ายจริงเท่าไร แล้วจึงส่งต่อไปยังโมเดลเรือธงเฉพาะเมื่อการวัดบอกว่าจำเป็นเท่านั้น

การเปรียบเทียบในบทความนี้2

ตรวจพบจากบทความนี้ · เบนช์มาร์ก: Artificial Analysis · อัปเดตทุกวัน

© 2026 OrcaRouter

สำหรับผู้ให้บริการ

ให้บริการแพลตฟอร์มการอนุมานอยู่หรือไม่ นำโมเดลของคุณขึ้น OrcaRouter

providers@orcarouter.ai

เข้าร่วมคอมมูนิตี้ของเรา

Discordsupport@orcarouter.aiXGitHubYouTube