การ์ดไตเติลแบบฮีโร่สำหรับ DeepSeek-V4-Flash-Vision-Exp พร้อมคำบรรยายว่า 'ราคาเท่า V4-Flash ตอนนี้มีดวงตาแล้ว' ไอคอนเส้นรูปดวงตาและป้ายราคา ป้ายขนาดเล็กขอบมนเขียนว่า 'EXPERIMENTAL • API • 2026-08-21' และโลโก้ OrcaRouter ที่มุมขวาล่าง
Guides & Insights

DeepSeek V4 Flash Vision (Exp) เปิดตัวบน API: ราคาเดียวกับ V4-Flash ตอนนี้มีดวงตาแล้ว

ผู้เขียน

Gideon Frost

วันที่เผยแพร่

โมเดลล่าสุด · 20ดูโมเดลทั้งหมด
เบนช์มาร์ก: Artificial Analysis · อัปเดตทุกวัน
กลับไปยังโพสต์ทั้งหมด

DeepSeek V4 Flash Vision (Exp) เปิดตัวบนแพลตฟอร์ม API ของ Deep​Seek ในวันนี้ 21 สิงหาคม 2026 และตัวเลขที่สำคัญที่สุดในประกาศไม่ใช่ benchmark — แต่เป็นราคา: โมเดลวิชันเชิงทดลองนี้เรียกเก็บเงินในอัตรา token เดียวกับ DeepSeek V4 Flash ซึ่งเป็นโมเดลข้อความล้วนที่มีความสามารถด้านข้อความเทียบเท่ากันโดยสิ้นเชิง ทำให้เป็นครั้งแรกที่ API ของ Deep​Seek เองรับรูปภาพได้เลย และหมายความว่าวิธีที่ถูกที่สุดในการรัน agent ที่มีบริบท 1M เพิ่งกลายเป็น multimodal ได้ฟรี

สิ่งที่ส่งมอบจริง

DeepSeek V4 Flash Vision (Exp) เป็นโมเดลมัลติโมดัลเชิงทดลอง เข้าถึงได้โดยใช้รหัสโมเดล deepseek-v4-flash-vision-exp โดยรับข้อความและรูปภาพเข้าแล้วส่งออกเป็นข้อความ บนหน้าต่างบริบทขนาด 1M โทเคน พร้อมผลลัพธ์สูงสุด 384K ทั้งในโหมดคิดและโหมดไม่คิด รองรับรูปแบบ Chat Completions, Messages แบบ Anthropic และรูปแบบ Responses ซึ่งเป็นสามรูปแบบที่เฟรมเวิร์กเอเจนต์จำเป็นต้องใช้เพื่อเชื่อมต่อได้โดยไม่ต้องมีอะแดปเตอร์แบบกำหนดเอง

สำหรับอินพุตรูปภาพ Deep​Seek รองรับ JPEG, PNG, GIF และ WebP โดยส่งผ่านได้สามวิธี: base64 แบบอินไลน์, URL ภายนอก, หรือไฟล์ที่อัปโหลดผ่าน Files API ใหม่ ยังไม่มีอินพุตวิดีโอหรือเสียง — 'การมองเห็น' ในที่นี้เป็นเพียงภาพนิ่งเท่านั้น

A screenshot of the DeepSeek API docs news page (captured August 21 2026) showing 'DeepSeek-V4-Flash-Vision-Exp Release 2026/08/21' at the top of the news list and the release post opening: 'This experimental multimodal model matches DeepSeek-V4-Flash on text capabilities — including agents, reasoning, and world knowledge.'

จุดยืนของ DeepSeek เอง ในเอกสารเผยแพร่ระบุว่า: ความสามารถด้านข้อความล้วน — เอเจนต์ การให้เหตุผล ความรู้เกี่ยวกับโลก — เทียบเท่ากับ DeepSeek V4 Flash เวอร์ชันทางการ ในขณะที่ความสามารถเอเจนต์แบบมัลติโมดัลก้าวกระโดดครั้งใหญ่และเข้าใกล้ Opus-4.8 นั่นเป็นคำกล่าวอ้างของผู้จำหน่าย ยังไม่มีการตรวจสอบซ้ำ และควรอ่านอย่างละเอียด เพราะรายละเอียดเบนช์มาร์กที่อยู่เบื้องหลังน่าสนใจกว่าพาดหัว

ทำไมการกระโดดของเกณฑ์มาตรฐานถึงใหญ่กว่าที่เห็น

ตัวเลขทั้งหมดต่อไปนี้เป็นของ Deep​Seek เอง ซึ่งเผยแพร่ในวันนี้ในหมายเหตุการเปิดตัว ยังไม่มีการตรวจสอบโดยอิสระ สำหรับการวัดประสิทธิภาพแบบเอเจนต์ที่ฝังภาพหน้าจอและรูปภาพไว้ DeepSeek V4 Flash แบบข้อความล้วนจะไม่อ่านสิ่งเหล่านั้น — มันเพียงแค่ไม่สนใจส่วนมัลติโมดัลของงาน DeepSeek V4 Flash Vision (Exp) นั้นดูจริง ๆ ซึ่งเป็นเหตุผลที่ผลต่างมีขนาดใหญ่:

• ApexBench Pass@1 — Vision-Exp 36.5 เทียบกับ V4-Flash 26.2 (Opus-4.8 39.4)

• Agents' Last Exam — Vision-Exp 27.3 เทียบกับ V4-Flash 25.2 (Opus-4.8 25.7)

• Terminal-Bench 2.1 — Vision-Exp 83.9 เทียบกับ V4-Flash 82.7 (Opus-4.8 85.0)

• NL2Repo — Vision-Exp 57.7 เทียบกับ V4-Flash 54.2 (Opus-4.8 69.7)

• DeepSWE — Vision-Exp 59.3 เทียบกับ V4-Flash 54.4 (Opus-4.8 58.0)

• Chartography — Vision-Exp 64.3 (V4-Flash แบบข้อความเท่านั้นไม่สามารถทำได้)

• ZeroBench Pass@5 — Vision-Exp 35.0 (V4-Flash เวอร์ชันข้อความเท่านั้นไม่สามารถทำได้)

A single-column scoreboard titled 'DeepSeek-V4-Flash-Vision-Exp — the scoreboard' listing Context 1M tokens, Max output 384K tokens, Input text + images, Image billing up to 384 tokens each, ApexBench Pass@1 36.5, Status experimental — no GA date, with a footer reading 'All benchmark figures vendor-reported; no independent scores yet.'

ตัวเลขสองตัวนั้นสมควรได้รับการพิจารณาอีกครั้ง ในการทดสอบ Agents' Last Exam นั้น Vision-Exp (27.3) เฉือน Opus-4.8 (25.7) ไปได้ และใน DeepSWE ก็ยังเอาชนะ Opus-4.8 (59.3 vs 58.0) อีกด้วย นี่คือสิ่งที่วลี "close to Opus-4.8" ตั้งอยู่จริง — ไม่ใช่ผลลัพธ์เด่นเพียงชิ้นเดียว แต่เป็นกลุ่มของเกณฑ์วัดแบบ agentic ที่การมองเห็นหน้าจอช่วยปิดช่องว่างส่วนใหญ่กับโมเดลมัลติโมดัลระดับแนวหน้า ในขณะที่ตั้งราคาถูกกว่าประมาณหนึ่งอันดับขนาด (order of magnitude)

ภาพหนึ่งภาพมีราคาเท่าใด ละเอียดถึงทศนิยม

รูปภาพจะถูกแปลงเป็นโทเค็นเพื่อการคิดค่าบริการ — สูงสุด 384 โทเค็นต่อภาพ — จากนั้นคิดค่าบริการในอัตราต่อโทเค็นเดียวกันกับ DeepSeek V4 Flash เนื่องจาก Deep​Seek ได้ย้ายโมเดลทั้งหมดไปใช้การกำหนดราคาแบบช่วงพีค/นอกพีคตั้งแต่วันที่ 16 สิงหาคม 2026 ตัวเลขที่แน่นอนจึงขึ้นอยู่กับเวลาที่คุณเรียกใช้:

• อินพุต, แคชมิส — $0.22 ต่อ 1M โทเคนนอกช่วงพีค, $0.44 ช่วงพีค

• อินพุต, การชนแคช — $0.007 ต่อ 1 ล้านโทเค็นนอกช่วงเวลาเร่งด่วน, $0.014 ช่วงเวลาเร่งด่วน

• เอาต์พุต — $0.66 ต่อ 1M โทเค็นนอกช่วงพีค, $1.32 ช่วงพีค

• ชั่วโมงเร่งด่วน — 01:00–04:00 และ 06:00–10:00 UTC (ชั่วโมงอื่นทั้งหมดเป็นนอกช่วงเร่งด่วน)

ลองคำนวณดู แล้วต้นทุนของการมองเห็นก็แทบจะหายไป ภาพหนึ่งภาพที่เพดาน 384 โทเคนมีราคาประมาณ 0.0085 เซนต์ในช่วงนอกพีค และ 0.017 เซนต์ในช่วงพีค เมื่อคิดเป็นอินพุต เอเจนต์ที่อ่านภาพหน้าจอ 50 ภาพในการรันครั้งเดียวจะเพิ่มต้นทุนโทเคนอินพุตประมาณครึ่งเซนต์ — ก่อนที่โมเดลจะเขียนโทเคนเอาต์พุตแรกด้วยซ้ำ Deep​Seek ยังจำกัดความละเอียดก่อนการอนุมาน: ระดับรายละเอียดต่ำจะปรับขนาดเป็น 512×512 ส่วนระดับสูง/ต้นฉบับจะปรับขนาดภาพล่วงหน้า (ภาพเล็กขยายขึ้นถึงประมาณ 384×384 ภาพใหญ่ย่อลงเหลือประมาณ 800×800) ดังนั้นภาพต้นฉบับความละเอียดสูงจึงไม่ถูกป้อนเข้าสู่โมเดลด้วยจำนวนพิกเซลดั้งเดิม

นักแสดงสมทบ: Files API ฟรีและ Harness 0.1.1

มีโครงสร้างพื้นฐานสองชิ้นที่ปล่อยออกมาพร้อมกับโมเดล Files API เปิดให้บริการแล้วและฟรี: อัปโหลดรูปภาพครั้งเดียว อ้างอิงด้วย file_id และนำมาใช้ซ้ำในหลายคำขอได้โดยไม่ต้องส่ง bytes ซ้ำ — ซึ่งมีประโยชน์สำหรับ browsing agent ที่เก็บหน้าเว็บไว้ในบริบทต่อเนื่องหลายเทิร์น และ Deep​Seek Harness 0.1.1 ที่เปิดตัวในวันเดียวกัน รองรับโมเดลใหม่ได้ทันทีโดยไม่ต้องปรับแต่ง ดังนั้น harness ที่ใช้ benchmark และขับเคลื่อนเวิร์กโหลดแบบ agentic ของ Deep​Seek จึงสามารถกำหนดเป้าหมายมาที่โมเดลนี้ได้ในทันที

ข้อควรระวังด้านการผลิต กล่าวอย่างตรงไปตรงมา

นี่คือโมเดลทดลอง Deep​Seek ระบุชัดเจนว่าเป็นเช่นนั้น ยังไม่ได้ประกาศวัน GA และแนะนำไม่ให้นำไปรันในโปรดักชันโดยตรง แผนที่ระบุไว้คือการปรับปรุงตามฟีดแบ็กและปล่อยเวอร์ชันเสถียรในภายหลัง ผลในทางปฏิบัติคือสมองข้อความได้รับการพิสูจน์แล้ว — เพราะเป็นตระกูลน้ำหนักชุดเดียวกับที่ขับเคลื่อน V4-Flash — แต่เส้นทางด้านวิทัศน์เป็นโค้ดใหม่ และไม่มีใครนอก Deep​Seek ทดสอบที่สเกลใหญ่

นี่คือสถานการณ์ที่เลเยอร์การกำหนดเส้นทาง (routing layer) พิสูจน์คุณค่าของมันอย่างแท้จริง บน OrcaRouter ทั้ง deepseek/deepseek-v4-flash-vision-exp และ deepseek/deepseek-v4-flash ต่างทำงานอยู่เบื้องหลัง API เดียวกัน ในราคารายการของ Deep​Seek ที่ส่งผ่านโดยไม่บวกเพิ่มแม้แต่น้อย คุณสามารถส่งทราฟฟิกที่มีรูปภาพไปยังโมเดลทดลอง และในการตั้งค่าเดียวกันก็ตั้งค่าให้ failover อัตโนมัติไปยังโมเดลสำรองทันทีที่เกิดข้อผิดพลาดหรือหมดเวลา ซึ่งช่วยลดความเสี่ยงของปัญหา 'โค้ดใหม่' ลงได้ทั้งหมด DSL สำหรับกำหนดเส้นทางยังช่วยให้คุณส่งเฉพาะคำขอที่มีรูปภาพจริง ๆ ไปยังโมเดลวิชัน และให้ทราฟฟิกข้อความล้วนใช้ DeepSeek V4 Flash ต่อไป ซึ่งได้ทั้งคะแนน benchmark ที่ดีขึ้นตรงที่ควรได้ และไม่ต้องจ่ายเพิ่มในจุดที่ไม่จำเป็น

A screenshot of the OrcaRouter model page for deepseek/deepseek-v4-flash-vision-exp showing the Vision, Tools, JSON and Reasoning badges, a 1M-token context, 384K max output, 'Input: text + Image', 'Output: text', p50 TTFT 275 ms, and the model description 'Experimental vision-enabled variant of DeepSeek V4 Flash: text + image in, text out'.

สิ่งที่ควรดูต่อไป

คำถามที่ค้างอยู่ก็เป็นคำถามปกติสำหรับการเปิดตัวเชิงทดลอง เมื่อใดที่ DeepSeek V4 Flash Vision (Exp) จะถึงสถานะ GA และราคาจะคงเดิมหรือไม่ วิดีโอหรือเสียงอินพุตจะตามมาหรือไม่ — โมเดลปัจจุบันรองรับเฉพาะภาพนิ่งเท่านั้น ซึ่งทำให้โมเดล multimodal ขนาดใหญ่ระดับแนวหน้าไร้คู่แข่งในสื่อที่เคลื่อนไหว และการประเมินอิสระ (การรันโดยบุคคลที่สามครั้งแรกบน ApexBench หรือ Terminal-Bench) จะให้ผลลัพธ์ตรงกับตัวเลขที่เผยแพร่หรือไม่ ที่น่าสนใจคือ แม้ว่าเกณฑ์ชี้วัดทั้งหมดจะลดลง คำกล่าวอ้างที่คุ้มค่าอยู่แล้ว — วิทัศน์ในราคาข้อความ — เป็นข้อเท็จจริงด้านราคา ไม่ใช่คำกล่าวอ้างจากเกณฑ์ชี้วัด และไม่จำเป็นต้องพิสูจน์ซ้ำ

การเปรียบเทียบในบทความนี้1

ตรวจพบจากบทความนี้ · เบนช์มาร์ก: Artificial Analysis · อัปเดตทุกวัน

© 2026 OrcaRouter

สำหรับผู้ให้บริการ

ให้บริการแพลตฟอร์มการอนุมานอยู่หรือไม่ นำโมเดลของคุณขึ้น OrcaRouter

providers@orcarouter.ai

เข้าร่วมคอมมูนิตี้ของเรา

Discordsupport@orcarouter.aiXGitHubYouTube