การ์ดชื่อเรื่องหลัก: DeepSeek V4.1 Flash Benchmarks — สิ่งที่ 74.2 พิสูจน์และไม่ได้พิสูจน์ ลงวันที่เผยแพร่ 2026-09-10 พร้อมหมายเหตุว่า ผลลัพธ์อิสระเป็นเวลาหกวัน
Guides & Insights

เบนช์มาร์กของ DeepSeek V4.1 Flash: 74.2 พิสูจน์อะไรได้ และพิสูจน์อะไรไม่ได้

ผู้เขียน

Elias Hawthorne

วันที่เผยแพร่

โมเดลล่าสุด · 20ดูโมเดลทั้งหมด →
เบนช์มาร์ก: Artificial Analysis · อัปเดตทุกวัน
กลับไปยังโพสต์ทั้งหมด

DeepSeek V4.1 Flash ทำคะแนนได้ 74.2 บน DeepSWE v1.1 สูงกว่า GPT-6 Astra อยู่หนึ่งในสิบของคะแนน สูงกว่า Gemini 3.8 Flash และ Claude Opus 5 อยู่ครึ่งคะแนน และตัวเลขนี้ถูกอ้างอิงตลอดทั้งสัปดาห์ว่าเป็นสัญญาณของการผลัดเปลี่ยนผู้นำ จึงคุ้มค่าที่จะพูดให้ชัดเจนว่าจริง ๆ แล้วมันคืออะไร ตัวโมเดลเองไม่ใช่ของใหม่ — DeepSeek V4.1 Flash เปิดให้ใช้งานทั่วไปเมื่อ 2026-09-10 หกวันก่อน — ดังนั้นไม่มีอะไรในหน้านี้ที่เป็นการเปิดตัว สิ่งที่เข้ามาในช่วงเวลานั้นคือชั้นการวัด: รายการดัชนีอิสระชุดแรก ผลลัพธ์อารีนาอิสระชุดแรก การรองรับการให้บริการตั้งแต่ Day-0 ในสามสแตก และการตัดสินใจของผู้ผลิตที่จะปลดระวางเรือธงของตัวเองเพื่อหันมาใช้รุ่นนี้แทน หน้านี้เป็นสรุปภาพรวมของสิ่งที่ถูกวัดจริงแล้ว โดยมีการระบุแหล่งที่มาสำหรับทุกตัวเลข และกล่าวอย่างตรงไปตรงมาว่าอะไรที่ยังไม่มีใครยืนยันได้

ตัวเลข DeepSWE และโมเดลอีกสี่ตัวที่ห่างจากค่านั้นไม่เกินครึ่งคะแนน

DeepSWE v1.1 เป็นเบนช์มาร์กวิศวกรรมซอฟต์แวร์ระยะยาวจาก Datacurve — งานต้นฉบับ 113 งาน ครอบคลุม 91 รีพอซิทอรีโอเพนซอร์สและภาษาการเขียนโปรแกรม 5 ภาษา สร้างขึ้นโดยเน้นการเปลี่ยนแปลงหลายไฟล์และความถูกต้องเชิงพฤติกรรม บนการ์ดโมเดลของ DeepSeek เอง ตารางที่ผู้ขายรายงานไว้ระบุว่า: DeepSeek V4.1 Flash 74.2, Claude Opus 5 74.0, GPT-5.6 Sol 73.0, Kimi K3 67.5, GLM-5.3 66.9, DeepSeek V4-Pro-0813 62.7, DeepSeek V4-Flash 54.4

ลีดเดอร์บอร์ดอิสระสำหรับเบนช์มาร์กเดียวกันไม่ได้แสดงลำดับนั้นซ้ำ และความแตกต่างสำคัญกว่าตัวเลขที่พาดหัวข่าว ลีดเดอร์บอร์ด DeepSWE v1.1 Pass@1 ของ Datacurve จัดให้ Muse Spark 1.3 (FAIR) อยู่อันดับแรกที่ 75.40 เหนือกว่า DeepSeek V4.1 Flash ที่ 74.20 ตามหลังมาคือ: GPT-6 Astra ที่ 74.12 (extra high) และ 74.10 (max), Gemini 3.8 Flash ที่ 73.83 (high), Claude Opus 5 ที่ 73.65 (max).

ดังนั้น 74.2 จึงเป็นรายการจริงบนกระดานผู้นำจากบุคคลที่สามที่มีอยู่จริง และมันอยู่อันดับที่สอง ไม่ใช่อันดับที่หนึ่ง คำกล่าวอ้างที่แพร่กระจายในวันเปิดตัว — ว่าคะแนนนี้คือสุดยอดบน DeepSWE — ไม่รอดเมื่อเทียบกับกระดานผู้นำที่บันทึกคะแนนนั้น Muse Spark 1.3 นำอยู่ 1.2 คะแนน

ตอนนี้มาถึงส่วนที่ถูกข้ามไป โมเดลแนวหน้าสี่ตัวอยู่ห่างกันไม่เกิน 0.55 คะแนนบนเบนช์มาร์กนี้: 74.20, 74.12, 73.83, 73.65 นั่นเป็นช่วงที่แคบกว่าความคลาดเคลื่อนจากการวัดเสียอีก ความแปรปรวนระหว่างการรันแต่ละครั้งที่ตีพิมพ์บน DeepSWE อยู่ที่ราว 1.4 ถึง 3.2 คะแนน — คิดเป็นสามถึงหกเท่าของช่วงห่างทั้งหมดของสี่อันดับแรก การนำอยู่ 0.2 คะแนนเหนือ GPT-6 Astra ไม่ใช่ข้อค้นพบอะไรเลย มันคือหน้าตาของการเสมอกันเมื่อคุณพิมพ์ออกมาเป็นทศนิยมสองตำแหน่ง

ความไวต่อสแคฟโฟลด์เป็นเหตุผลประการที่สองที่ทำให้ไม่ควรยึดตัวเลขนั้นไว้แน่นเกินไป และในจุดนี้ เอกสารของผู้ขายเองก็ให้หลักฐานไว้ DeepSeek รายงานผล DeepSWE บนแปดสแคฟโฟลด์ในเอกสารเปิดตัวชุดเดียวกัน ค่า 74.2 ทำได้บน mini-SWE โมเดลเดียวกันได้ 72.6 บน DSH Minimal, 70.5 บน DSH Standard, 69.8 บน Claude Code, 67.6 บน DSH PTC, 66.2 บน Pi, 65.6 บน Codex และ 65.5 บน OpenCode นั่นคือช่วงต่าง 8.7 จุดบนโมเดลเดียวและเบนช์มาร์กเดียว โดยเกิดจากฮาร์เนสที่ห่อหุ้มมันอยู่ล้วน ๆ ใครก็ตามที่นำตัวเลขของ DeepSeek ที่ได้จาก mini-SWE ไปเทียบกับตัวเลขของคู่แข่งที่ได้จาก agent loop อื่น กำลังเปรียบเทียบสแคฟโฟลด์ ไม่ใช่โมเดล

จุดที่ดัชนีอิสระจัดวางมันไว้จริง ๆ

Artificial Analysis รันชุดการทดสอบแบบคงที่ที่การตั้งค่าระดับความพยายามที่ประกาศไว้ ซึ่งทำให้ Intelligence Index ของมันเป็นการตรวจสอบภายนอกที่สะอาดที่สุดเท่าที่มี บนหน้าของโมเดล DeepSeek V4.1 Flash ที่ระดับ max effort ของ reasoning ดัชนีอ่านค่าได้ 40 — จัดอันดับที่ #6 จาก 113 โมเดลในคลาสนั้น เทียบกับค่ามัธยฐานของคลาสที่ 18 คู่แข่งแบบปิดอยู่เหนือกว่า: Claude Opus 5 (max) 51, GPT-5.6 Sol (max) 47, GLM-5.3 (max) 45, Kimi K3 (max) 44, Gemini 3.8 Flash (high) 41 เรือธงรุ่นก่อนของ DeepSeek เอง V4-Pro-0813 อยู่ต่ำกว่าที่ 36

อ่านสองกระดานคะแนนเทียบกันแล้ว ความไม่ตรงกันนี้เป็นเชิงโครงสร้าง ไม่ใช่ความผิดพลาด บนเบนช์มาร์กที่ DeepSeek เลือกใช้ เมื่อตั้ง scaffold อย่างเหมาะสม โมเดลนี้ทำได้ทัดเทียมกับแนวหน้า บนชุดทดสอบภายนอกแบบคงที่ซึ่งเฉลี่ยจากงานด้านการให้เหตุผล การเขียนโค้ด คณิตศาสตร์ และงานแบบเอเจนต์ มันตามหลัง Claude Opus 5 อยู่สิบเอ็ดคะแนน และตามหลัง Gemini 3.8 Flash อยู่หนึ่งคะแนน ทั้งสองอย่างเป็นจริงได้ ตารางของผู้ขายคือข้อโต้แย้ง ส่วนดัชนีคือค่าเฉลี่ย

หน้า index ยังมีตัวเลขสองตัวที่สำคัญต่อการตัดสินใจด้าน routing และแทบไม่ขึ้นพาดหัวข่าว DeepSeek V4.1 Flash ทำงานที่ 214.4 โทเค็นเอาต์พุตต่อวินาทีที่ระดับความพยายามสูงสุด — เร็วมาก นอกจากนี้ยังสร้างโทเค็นเอาต์พุต 250 ล้านโทเค็นในการทำ Intelligence Index ให้เสร็จ เทียบกับค่ามัธยฐานที่ 140 ล้าน ซึ่ง Artificial Analysis ชี้ว่ามีความ verbose อย่างเห็นได้ชัด ความ verbose ไม่ใช่ปัญหาคุณภาพ แต่เป็นบิลค่าใช้จ่าย โมเดลที่คิดด้วยโทเค็นมากกว่าโมเดลระดับเดียวกัน 79% จะคืนข้อได้เปรียบด้านราคาบางส่วนไปในทุกครั้งที่เรียกใช้การให้เหตุผลแบบยาว

Single-column scoreboard for DeepSeek V4.1 Flash: DeepSWE v1.1 74.2, second behind Muse Spark 1.3; Artificial Analysis Intelligence Index 40 against Claude Opus 5 at 51; ProgramBench 20.3 single model; ProgramBench agent team 30.04% at 8 hours; output speed 214.4 tokens per second; off-peak price $0.15 in and $0.60 out per 1M.

ProgramBench: คะแนนจากโมเดลเดียวและคะแนนจากหลายเอเจนต์ไม่ใช่การวัดแบบเดียวกัน

นี่คือตัวเลขที่มีแนวโน้มจะถูกอ่านผิดได้มากที่สุด จึงควรแยกออกอย่างระมัดระวัง

• โมเดลเดียว การกำหนดค่ามาตรฐาน — DeepSeek V4.1 Flash ได้คะแนน 20.3 บน ProgramBench (Almost@1) ตามการ์ดโมเดลของ DeepSeek เอง นั่นคือต่ำกว่า GPT-5.6 Sol ที่ 23.0 และต่ำกว่ามากเมื่อเทียบกับ Claude Opus 5 ที่ 37.0 และสูงกว่าเพียงเล็กน้อยเท่านั้นเมื่อเทียบกับ GLM-5.3 ที่ 19.0 และ Kimi K3 ที่ 17.5 เป็นข้อมูลที่ผู้จำหน่ายรายงานเอง และไม่ได้ทำให้โมเดลดูดีเกินจริง

• การกำหนดค่าทีมแบบหลายเอเจนต์ — รายงานทางเทคนิคของ DeepSeek DeepSeek-V4.1-Flash: Pushing the Limits of KV Cache Compression อธิบายสูตร RL แบบ Agent Swarm เบื้องต้น ซึ่งเอเจนต์หัวหน้าประสานงานเพื่อนร่วมทีมผ่านกระดานงานที่ใช้ร่วมกัน บนชุดย่อย ProgramBench จำนวน 172 งานที่มีความเชื่อมั่นสูง — งานที่โซลูชันอ้างอิงผ่านเกณฑ์ที่ 95% หรือดีกว่า — การกำหนดค่าแบบหลายเอเจนต์ไต่ขึ้นจาก 13.59% ที่กำหนดเวลาหนึ่งชั่วโมง สู่จุดสูงสุดที่ 30.04% ที่แปดชั่วโมง ขณะที่เส้นฐานแบบเอเจนต์เดี่ยวขยับจาก 12.79% เป็น 20.39%

30.04% คือที่มาของข้ออ้าง "30%" และไม่ใช่คะแนนจากโมเดลเดียว แต่เป็นทีมของเอเจนต์ที่ได้รับเวลาแปดชั่วโมง วัดบนชุดย่อยที่ผ่านการกรอง ในการประเมินเบื้องต้นของผู้ขายเอง การเปรียบเทียบที่สิ่งนี้ชวนให้ทำ — "สูงกว่า Sol เดี่ยวมาก เกือบ 2 เท่าของ Kimi K3" — ยุติธรรมทางเลขคณิตเมื่อเทียบกับ 23.0 ของ Sol และ 17.5 ของ K3 และยังเป็นการเปรียบเทียบระหว่างการตั้งค่าแบบหลายเอเจนต์กับเส้นฐานแบบโมเดลเดียวบนชุดงานที่ต่างกัน รายงานเดียวกันแสดงผลกระทบต่อ FrontierSWE v2: แบบหลายเอเจนต์ทำได้ 32.90% ที่ยี่สิบชั่วโมง เทียบกับ 28.20% ของแบบเอเจนต์เดียว ช่องว่างนี้มีอยู่จริง มันแคบลงเมื่อกำหนดเวลาถูกขยายออกไป และต้นทุนโทเค็นในการได้มานั้นไม่น้อย — บันทึกจากการลงมือทำฉบับหนึ่งรายงานว่าใช้โทเค็นมากกว่า 10 เท่า และระยะเวลารันเข้าใกล้สี่ชั่วโมง

จำนวนพารามิเตอร์ยังไม่นิ่ง ดังนั้นให้ถือว่าการเปรียบเทียบขนาดทุกครั้งเป็นเพียงข้อสันนิษฐานชั่วคราว

บันทึกประจำรุ่นของ DeepSeek อธิบายว่าเป็น "MoE ขนาด 552B พารามิเตอร์" นั่นคือตัวเลขจากผู้ขาย และเป็นสิ่งที่สื่อส่วนใหญ่นำไปรายงานซ้ำ อีกทั้งมันยังไม่ใช่ตัวอาร์ติแฟกต์ทั้งหมด

โมเดลการ์ดของ DeepSeek เองบันทึกองค์ประกอบที่สองไว้เคียงข้างแกนหลัก transformer: "Engram conditional memory (พารามิเตอร์ 196B เข้าถึงแบบเบาบางผ่านการค้นหาด้วยโทเคน)" เมื่อบวกทั้งสองเข้าด้วยกันจะได้ 748B นั่นคือเลขคณิตเบื้องหลังการตีความของชุมชนที่แพร่กระจายบน r/LocalLLaMA ภายในไม่กี่ชั่วโมงหลังเปิดตัว และดัชนี safetensors ของโมเดลการ์ดเองก็ระบุพารามิเตอร์ 763B ทั่วประเภทเทนเซอร์ของมัน ตัวเลข FP8 ราว 510 GB มาจากสายการวิเคราะห์เดียวกัน: สิ่งที่คุณดาวน์โหลดและเก็บไว้ในหน่วยความจำจริง ๆ

คำอธิบายที่ทำให้สอดคล้องกันคือ ตัวเลขเหล่านี้วัดสิ่งต่างกัน 552B คือแกนหลักด้านการคำนวณ — พารามิเตอร์ที่โทเคนไหลผ่าน 196B คือตารางค้นหาที่ถูกเรียกใช้ ณ เลเยอร์เฉพาะ ซึ่งคืนค่าข้อมูลที่จัดเก็บไว้แทนที่จะคำนวณบนข้อมูลนั้น 8B และ 16B ซึ่งเป็นตัวเลข activation ที่ DeepSeek อ้างถึง คือสไลซ์ต่อโทเคนที่ทำงานอยู่ระหว่าง prefill และ decode ตามลำดับ ตัวเลขทั้งสี่นี้ล้วนอธิบายโมเดลเดียวกัน

ไม่มีอะไรในนั้นทำให้การเปรียบเทียบปลอดภัย ข้ออ้างทุกรูปแบบที่ว่า "โมเดลนี้เทียบเท่าโมเดลระดับแนวหน้าได้ด้วยขนาดเพียงเศษเสี้ยว" ล้วนอาศัยพาดหัวของผู้ขายที่ตัดหนึ่งในห้าของอาร์ติแฟกต์ออกไป จนกว่าจะมีใครเผยแพร่การนับพารามิเตอร์ที่ทำซ้ำได้ ข้อโต้แย้งที่อิงขนาดควรแนบข้อควรระวังไว้ในเนื้อความ

ARC-AGI: ไม่มีผลลัพธ์สำหรับโมเดลนี้

ยังไม่มีคะแนน ARC-AGI-2 หรือ ARC-AGI-1 สำหรับ DeepSeek V4.1 Flash หน้าผลลัพธ์ที่ตรวจสอบแล้วของ ARC Prize ไม่มีรายการสำหรับเช็กพอยต์นี้ และตารางเบนช์มาร์กของ DeepSeek เองก็ไม่มีแถว ARC ผลลัพธ์ DeepSeek เพียงรายการเดียวที่ ARC Prize ตรวจสอบแล้วเป็นของเช็กพอยต์ V4 Flash 0731 ที่เก่ากว่า — 61.4% บน ARC-AGI-2 semi-private ที่ความพยายามในการใช้เหตุผลสูงสุด และ 89.0% บน ARC-AGI-1 โดยมีค่าใช้จ่าย $0.04 และ $0.02 ต่องานตามลำดับ นั่นเป็นตัวเลขของรุ่นก่อนบนโมเดลที่แตกต่างกัน และการอ้างว่าเป็นผลลัพธ์ของ V4.1 Flash จะผิด หาก ARC-AGI มีความสำคัญต่อการประเมินของคุณ โมเดลนี้ยังไม่ถูกให้คะแนนในปัจจุบัน

มีอะไรอีกไหมที่ตกลงมาในหน้าต่าง

มีสามสิ่งที่เปลี่ยนไปสำหรับผู้อ่านที่กำลังตัดสินใจว่าจะลองใช้โมเดลนี้หรือไม่ และไม่มีข้อใดเลยที่เป็นการเปิดตัวของโมเดลนี้เอง

• ผลลัพธ์จากอารีนาอิสระ OpenDesign Arena ทดสอบโมเดลสิบสามตัวด้วยงานออกแบบเดียวกัน — เว็บแอป แดชบอร์ด หน้าจอมือถือ แลนดิ้งเพจ DeepSeek V4.1 Flash ได้ 81.2 จาก 100 เทียบกับ 82.7 ของ GPT-6 Astra โดยคิดเป็น $0.023 ต่อการออกแบบที่เสร็จสมบูรณ์ เทียบกับ $1.61 และใช้เวลาเสร็จ 5.3 นาที เทียบกับ 11.1 นาที อัตราการส่งมอบ — ผลลัพธ์ที่ใช้งานได้โดยไม่ต้องแก้ไข — อยู่ที่ 57.7% เทียบกับ 60% ของ Astra นี่เป็นการวัดผลโมเดลนี้ที่เป็นอิสระอย่างแท้จริงครั้งแรกๆ และเป็นการวัดผลงานออกแบบโดยเฉพาะ ไม่ใช่การให้เหตุผลทั่วไปหรือการเขียนโค้ด

• การรองรับการให้บริการ Day-0 บนสามสแตก vLLM ได้เผยแพร่อิมเมจ day-0 (2026-09-09) ที่ผ่านการตรวจสอบบนฮาร์ดแวร์ NVIDIA และ AMD SGLang และ Miles ได้เผยแพร่การรองรับ inference และ RL สำหรับ day-0 เมื่อ 2026-09-10 ซึ่งรวมถึงเส้นทางการ offload ไปยังโฮสต์ของ Engram ที่เพิ่มความจุ KV cache ขึ้น 36% บน 4x GB300 และการปรับแต่งแบบ bounded-replay ที่ยก throughput ของ prefill ขึ้น 1.56 เท่าบน 8x H200 Cambricon ประกาศการปรับตัวให้เข้ากับ Day-0 บนสแตก vLLM ในวันเดียวกัน สำหรับโมเดลที่มีจุดขายคือการบีบอัด KV cache เชิงรุก — หนึ่งในสี่ของพื้นที่ HBM ของรุ่นก่อนหน้า หนึ่งในแปดของ SSD — การที่รันได้บนสแตกมาตรฐานตั้งแต่วันแรกคือความแตกต่างระหว่างผลลัพธ์ในห้องแล็บกับสิ่งที่คุณนำไปใช้งานได้

• ผู้ให้บริการยกเลิกเรือธงของตัวเองแล้ว DeepSeek กำลังทยอยยกเลิก V4-Pro ตั้งแต่เวลา 04:00 UTC ของวันที่ 2026-09-14 เป็นต้นไป คำขอใดที่ระบุชื่อ “deepseek-v4-pro” จะถูกส่งต่อไปยัง V4.1 Flash และคิดค่าบริการในอัตราของ Flash โดยดำเนินไปเช่นนี้จนกว่าจะมี V4.1 Pro เปิดตัว DeepSeek V4.1 Pro ยังไม่เปิดตัว — เป็นโมเดลในอนาคต และการเปลี่ยนเส้นทางนี้เป็นมาตรการชั่วคราวที่ช่วยไม่ให้การผสานรวมที่ปักหมุดโมเดลไว้หยุดทำงาน นอกจากนี้ยังยกเลิก “deepseek-v4-flash” และ “deepseek-v4-flash-vision-exp” ซึ่งทั้งคู่ถูกเปลี่ยนเส้นทางไปยัง V4.1 Flash ชั่วคราวเพื่อความเข้ากันได้ หากคุณมี ID โมเดลที่ปักหมุดไว้ในสภาพแวดล้อมโปรดักชัน การเปลี่ยนเส้นทางนั้นคือข้อเท็จจริงเชิงปฏิบัติการเพียงข้อเดียวในหน้านี้ที่คุณไม่อาจมองข้ามได้

ราคาส่งผลต่อการตัดสินใจอย่างไร

ราคาคือจุดที่โมเดลนี้ไม่ได้เป็นแค่เรื่องราวของ benchmark อีกต่อไป ตามอัตราที่ DeepSeek เผยแพร่เอง มีผลตั้งแต่ 04:00 UTC วันที่ 10 กันยายน 2026 โดยช่วงพีคกำหนดเป็น 01:00–04:00 และ 06:00–10:00 UTC ในวันธรรมดา และเวลาอื่นทั้งหมดเป็นช่วงออฟพีค

• นอกช่วงเวลาพีค ต่อหนึ่งล้านโทเค็น — แคชฮิต $0.003, แคชมิส $0.15, เอาต์พุต $0.60

• สูงสุด ต่อล้านโทเคน — แคชฮิต $0.006, แคชมิส $0.30, เอาต์พุต $1.20

• อินพุตที่แคชไว้ เมื่อเทียบกับโมเดลปิดระดับแนวหน้า — สามในสิบของหนึ่งเซนต์ต่อล้าน เทียบกับประมาณห้าสิบเซนต์ สำหรับเอเจนต์ที่วนซ้ำบนรีโพซิทอรีเดียวกัน โทเคนส่วนใหญ่อยู่ในระดับนั้น

• วัดจากแคตตาล็อกของเราเอง — 0.15 ดอลลาร์สำหรับอินพุต และ 0.60 ดอลลาร์สำหรับเอาต์พุตต่อล้านโทเคน เวลามัธยฐานถึงโทเคนแรก 784 มิลลิวินาที 211 โทเคนต่อวินาทีในช่วงเจ็ดวันที่ผ่านมา

Artificial Analysis ระบุโมเดลเดียวกันในราคาอินพุต $0.30 และเอาต์พุต $1.20 โดยมีส่วนลดแคช 98% และราคา blended $0.18 ต่อล้าน — นั่นคือระดับพีค และตัวเลขทั้งสองเป็นราคาเดียวกันในคนละช่วงเวลาของวัน ความแตกต่างนี้ควรค่าแก่การทำความเข้าใจก่อนเปรียบเทียบผู้ให้บริการ: โมเดลที่มีการคิดราคาสองช่วงเวลาตามนาฬิกาไม่สามารถเปรียบเทียบกันด้วยอัตราหลักเพียงตัวเดียวได้

นี่ก็เป็นอีกเหตุผลหนึ่งที่การคิดราคาแบบส่งผ่านต้นทุนตรง ๆ จึงสำคัญกว่าปกติในกรณีนี้ OrcaRouter ให้บริการ DeepSeek V4.1 Flash ควบคู่ไปกับโมเดลอื่น ๆ ในแคตตาล็อกของตนในราคาบวกกำไร 0% — คือราคาตามที่ผู้ให้บริการประกาศไว้ ไม่เปลี่ยนแปลง ดังนั้นระดับราคาช่วงพีคและช่วงออฟพีคของ DeepSeek จึงมาถึงฝั่งเราเหมือนกับที่ DeepSeek ประกาศไว้ทุกประการ และหากผู้ให้บริการเปลี่ยนราคา ก็จะมีผลทันทีในวันเดียวกัน สำหรับโมเดลที่อัตราค่าบริการเพิ่มเป็นสองเท่าเป็นเวลา 4 ชั่วโมงทุกเช้าวันธรรมดา แพลตฟอร์มที่ยุบระดับราคาต่าง ๆ ให้กลายเป็นอัตราเดียวกำลังปกปิดตัวเลขเดียวที่คุณจำเป็นต้องรู้

Screenshot of the Artificial Analysis model page for DeepSeek V4.1 Flash (Reasoning, Max Effort), showing an Artificial Analysis Intelligence Index score of 40 at rank 6 of 113, output speed 214.4 tokens per second at rank 4 of 113, $0.30 per million input and $1.20 per million output tokens with a 98% cache discount and $0.27 cost per Intelligence Index task, verbosity of 250M output tokens at rank 37 of 113, a 1M token context window, 552B total and 16B active parameters, and an MIT license.Screenshot of the OrcaRouter model page for deepseek/deepseek-v4.1-flash, showing the model identifier, NEW and FEATURED badges, Vision, Tools, JSON and Reasoning capability tags, a release date of 2026-09-10, a 1M token context window, 384K maximum output, text and image input, $0.15 input and $0.60 output per million tokens, and a p50 time to first token of 784 ms.

สิ่งที่ไม่มีใครเคยพิสูจน์

ช่องว่างในเรื่องนี้ไม่ใช่การขาดเบนช์มาร์ก แต่คือการที่ยังไม่มีการเปรียบเทียบแบบตัวต่อตัวที่น่าเชื่อถือระหว่าง DeepSeek V4.1 Flash กับคู่แข่งที่ถูกระบุชื่อ บนฮาร์นเนสที่ใช้ร่วมกัน ซึ่งดำเนินการโดยคนที่ไม่มีส่วนได้ส่วนเสียกับผลลัพธ์ ตัวเลขทุกตัวในหน้านี้เป็นหนึ่งในสามอย่าง: ถูกรายงานโดยผู้ขาย ผลิตโดยบุคคลที่สามบนการกำหนดค่าที่แตกต่าง หรือเป็นค่าเฉลี่ยจากชุดทดสอบตายตัวที่ไม่ได้ออกแบบมาเพื่อแยกการจับคู่นี้ออกมา ไม่มีการรันใดที่ DeepSeek V4.1 Flash และ GPT-6 Astra ถูกประเมินบนงานเดียวกัน สแคฟโฟลด์เดียวกัน การตั้งค่าความพยายามเดียวกัน และเผยแพร่พร้อมค่าความแปรปรวน

สามสิ่งเฉพาะเจาะจงจะเปลี่ยนภาพรวม และไม่มีสิ่งใดในนั้นที่มีอยู่ในทุกวันนี้

• การเปรียบเทียบ DeepSWE ที่ควบคุมสแคฟโฟลด์ช่วงห่าง 8.7 จุดระหว่างสแคฟโฟลด์ต่างๆ ของ DeepSeek เองนั้นมากกว่าช่องว่างใดๆ ระหว่างสี่โมเดลอันดับต้นบนลีดเดอร์บอร์ด จนกว่าจะมีการวัดพรมแดนความสามารถด้วยฮาร์เนสเดียว การจัดลำดับที่ด้านบนของตารางนั้นจึงไม่มีความหมาย

• การทำซ้ำผลลัพธ์ของทีมเอเจนต์ ProgramBench โดยอิสระ ตัวเลข 30.04% มาจากรายงานทางเทคนิคของผู้ขาย บนชุดย่อย 172 งานที่ผ่านการกรอง ในการตั้งค่าเบื้องต้น โดยมีต้นทุนโทเค็นที่ยังไม่ได้รับการระบุลักษณะสำหรับงบประมาณการผลิต

• ARC-AGI. ไม่มีคะแนนสำหรับเช็กพอยต์นี้เลยแม้แต่รายการเดียว

ผลลัพธ์ในทางปฏิบัติคือข้ออ้างที่แคบกว่าที่พาดหัวข่าวรองรับ DeepSeek V4.1 Flash วัดได้ว่าอยู่ในช่วงความคลาดเคลื่อนเชิงสถิติจากโมเดลระดับแนวหน้าบนเบนช์มาร์กการเขียนโค้ดระยะยาวหนึ่งรายการ แข่งขันได้จริงบนงานออกแบบอิสระด้วยต้นทุนเพียงราว 1.4% และตามหลังอยู่ราวสิบจุดบนดัชนีรวม นั่นเพียงพอที่จะสนับสนุนให้รันมันเทียบกับภาระงานของคุณเอง และปล่อยให้การประเมินของคุณเป็นตัวตัดสินคำถามนี้ แต่ไม่เพียงพอที่จะสนับสนุนให้เขียนตารางการกำหนดเส้นทางในโปรดักชันใหม่โดยอาศัยคะแนน 0.2 จุด — และข้อเท็จจริงที่ว่าทั้งสองประโยคนี้เป็นจริงคือข้อค้นพบทั้งหมด

การเปรียบเทียบในบทความนี้1

ตรวจพบจากบทความนี้ · เบนช์มาร์ก: Artificial Analysis · อัปเดตทุกวัน

© 2026 OrcaRouter

สำหรับผู้ให้บริการ

ให้บริการแพลตฟอร์มการอนุมานอยู่หรือไม่ นำโมเดลของคุณขึ้น OrcaRouter

providers@orcarouter.ai

เข้าร่วมคอมมูนิตี้ของเรา

Discordsupport@orcarouter.aiXGitHubYouTube