
DeepSeek V4 Flash Vision (Exp) เปิดตัวบน API: ราคาเดียวกับ V4-Flash ตอนนี้มีดวงตาแล้ว
- Alibabaใหม่Qwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 ต่อ 1 ล้านโทเค็น
- z-aiใหม่Z.ai: GLM 5.3 Flash2026-08-2658ความฉลาด72การเขียนโค้ด
- DeepSeekใหม่DeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.15 / $0.29 ต่อ 1 ล้านโทเค็น
- z-aiใหม่Z.ai: GLM 5.32026-08-1860ความฉลาด75การเขียนโค้ด
- obsidianใหม่Qwen3.8 27B2026-08-1552ความฉลาด68การเขียนโค้ด
- qwenQwen: Qwen3.8 27B (free)2026-08-13qwen/qwen3.8-27b-free
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1253ความฉลาด69การเขียนโค้ด
- grokSpaceXAI: Grok 4.62026-08-1261ความฉลาด77การเขียนโค้ด
- metaMeta: Muse Spark 1.22026-08-0557ความฉลาด72การเขียนโค้ด
- qwenQwen: Qwen3.8 Max2026-08-0358ความฉลาด72การเขียนโค้ด
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3152ความฉลาด69การเขียนโค้ด
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 ต่อ 1 ล้านโทเค็น
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463ความฉลาด78การเขียนโค้ด
- googleGoogle: Gemini 3.6 Flash2026-07-2152ความฉลาด69การเขียนโค้ด
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137ความฉลาด49การเขียนโค้ด
- metaMeta: Muse Spark 1.12026-07-1653ความฉลาด71การเขียนโค้ด
- kimiMoonshotAI: Kimi K32026-07-1560ความฉลาด76การเขียนโค้ด
- openaiOpenAI: GPT-5.6 Luna2026-07-0952ความฉลาด71การเขียนโค้ด
DeepSeek V4 Flash Vision (Exp) เปิดตัวบนแพลตฟอร์ม API ของ DeepSeek ในวันนี้ 21 สิงหาคม 2026 และตัวเลขที่สำคัญที่สุดในประกาศไม่ใช่ benchmark — แต่เป็นราคา: โมเดลวิชันเชิงทดลองนี้เรียกเก็บเงินในอัตรา token เดียวกับ DeepSeek V4 Flash ซึ่งเป็นโมเดลข้อความล้วนที่มีความสามารถด้านข้อความเทียบเท่ากันโดยสิ้นเชิง ทำให้เป็นครั้งแรกที่ API ของ DeepSeek เองรับรูปภาพได้เลย และหมายความว่าวิธีที่ถูกที่สุดในการรัน agent ที่มีบริบท 1M เพิ่งกลายเป็น multimodal ได้ฟรี
สิ่งที่ส่งมอบจริง
DeepSeek V4 Flash Vision (Exp) เป็นโมเดลมัลติโมดัลเชิงทดลอง เข้าถึงได้โดยใช้รหัสโมเดล deepseek-v4-flash-vision-exp โดยรับข้อความและรูปภาพเข้าแล้วส่งออกเป็นข้อความ บนหน้าต่างบริบทขนาด 1M โทเคน พร้อมผลลัพธ์สูงสุด 384K ทั้งในโหมดคิดและโหมดไม่คิด รองรับรูปแบบ Chat Completions, Messages แบบ Anthropic และรูปแบบ Responses ซึ่งเป็นสามรูปแบบที่เฟรมเวิร์กเอเจนต์จำเป็นต้องใช้เพื่อเชื่อมต่อได้โดยไม่ต้องมีอะแดปเตอร์แบบกำหนดเอง
สำหรับอินพุตรูปภาพ DeepSeek รองรับ JPEG, PNG, GIF และ WebP โดยส่งผ่านได้สามวิธี: base64 แบบอินไลน์, URL ภายนอก, หรือไฟล์ที่อัปโหลดผ่าน Files API ใหม่ ยังไม่มีอินพุตวิดีโอหรือเสียง — 'การมองเห็น' ในที่นี้เป็นเพียงภาพนิ่งเท่านั้น

จุดยืนของ DeepSeek เอง ในเอกสารเผยแพร่ระบุว่า: ความสามารถด้านข้อความล้วน — เอเจนต์ การให้เหตุผล ความรู้เกี่ยวกับโลก — เทียบเท่ากับ DeepSeek V4 Flash เวอร์ชันทางการ ในขณะที่ความสามารถเอเจนต์แบบมัลติโมดัลก้าวกระโดดครั้งใหญ่และเข้าใกล้ Opus-4.8 นั่นเป็นคำกล่าวอ้างของผู้จำหน่าย ยังไม่มีการตรวจสอบซ้ำ และควรอ่านอย่างละเอียด เพราะรายละเอียดเบนช์มาร์กที่อยู่เบื้องหลังน่าสนใจกว่าพาดหัว
ทำไมการกระโดดของเกณฑ์มาตรฐานถึงใหญ่กว่าที่เห็น
ตัวเลขทั้งหมดต่อไปนี้เป็นของ DeepSeek เอง ซึ่งเผยแพร่ในวันนี้ในหมายเหตุการเปิดตัว ยังไม่มีการตรวจสอบโดยอิสระ สำหรับการวัดประสิทธิภาพแบบเอเจนต์ที่ฝังภาพหน้าจอและรูปภาพไว้ DeepSeek V4 Flash แบบข้อความล้วนจะไม่อ่านสิ่งเหล่านั้น — มันเพียงแค่ไม่สนใจส่วนมัลติโมดัลของงาน DeepSeek V4 Flash Vision (Exp) นั้นดูจริง ๆ ซึ่งเป็นเหตุผลที่ผลต่างมีขนาดใหญ่:
• ApexBench Pass@1 — Vision-Exp 36.5 เทียบกับ V4-Flash 26.2 (Opus-4.8 39.4)
• Agents' Last Exam — Vision-Exp 27.3 เทียบกับ V4-Flash 25.2 (Opus-4.8 25.7)
• Terminal-Bench 2.1 — Vision-Exp 83.9 เทียบกับ V4-Flash 82.7 (Opus-4.8 85.0)
• NL2Repo — Vision-Exp 57.7 เทียบกับ V4-Flash 54.2 (Opus-4.8 69.7)
• DeepSWE — Vision-Exp 59.3 เทียบกับ V4-Flash 54.4 (Opus-4.8 58.0)
• Chartography — Vision-Exp 64.3 (V4-Flash แบบข้อความเท่านั้นไม่สามารถทำได้)
• ZeroBench Pass@5 — Vision-Exp 35.0 (V4-Flash เวอร์ชันข้อความเท่านั้นไม่สามารถทำได้)

ตัวเลขสองตัวนั้นสมควรได้รับการพิจารณาอีกครั้ง ในการทดสอบ Agents' Last Exam นั้น Vision-Exp (27.3) เฉือน Opus-4.8 (25.7) ไปได้ และใน DeepSWE ก็ยังเอาชนะ Opus-4.8 (59.3 vs 58.0) อีกด้วย นี่คือสิ่งที่วลี "close to Opus-4.8" ตั้งอยู่จริง — ไม่ใช่ผลลัพธ์เด่นเพียงชิ้นเดียว แต่เป็นกลุ่มของเกณฑ์วัดแบบ agentic ที่การมองเห็นหน้าจอช่วยปิดช่องว่างส่วนใหญ่กับโมเดลมัลติโมดัลระดับแนวหน้า ในขณะที่ตั้งราคาถูกกว่าประมาณหนึ่งอันดับขนาด (order of magnitude)
ภาพหนึ่งภาพมีราคาเท่าใด ละเอียดถึงทศนิยม
รูปภาพจะถูกแปลงเป็นโทเค็นเพื่อการคิดค่าบริการ — สูงสุด 384 โทเค็นต่อภาพ — จากนั้นคิดค่าบริการในอัตราต่อโทเค็นเดียวกันกับ DeepSeek V4 Flash เนื่องจาก DeepSeek ได้ย้ายโมเดลทั้งหมดไปใช้การกำหนดราคาแบบช่วงพีค/นอกพีคตั้งแต่วันที่ 16 สิงหาคม 2026 ตัวเลขที่แน่นอนจึงขึ้นอยู่กับเวลาที่คุณเรียกใช้:
• อินพุต, แคชมิส — $0.22 ต่อ 1M โทเคนนอกช่วงพีค, $0.44 ช่วงพีค
• อินพุต, การชนแคช — $0.007 ต่อ 1 ล้านโทเค็นนอกช่วงเวลาเร่งด่วน, $0.014 ช่วงเวลาเร่งด่วน
• เอาต์พุต — $0.66 ต่อ 1M โทเค็นนอกช่วงพีค, $1.32 ช่วงพีค
• ชั่วโมงเร่งด่วน — 01:00–04:00 และ 06:00–10:00 UTC (ชั่วโมงอื่นทั้งหมดเป็นนอกช่วงเร่งด่วน)
ลองคำนวณดู แล้วต้นทุนของการมองเห็นก็แทบจะหายไป ภาพหนึ่งภาพที่เพดาน 384 โทเคนมีราคาประมาณ 0.0085 เซนต์ในช่วงนอกพีค และ 0.017 เซนต์ในช่วงพีค เมื่อคิดเป็นอินพุต เอเจนต์ที่อ่านภาพหน้าจอ 50 ภาพในการรันครั้งเดียวจะเพิ่มต้นทุนโทเคนอินพุตประมาณครึ่งเซนต์ — ก่อนที่โมเดลจะเขียนโทเคนเอาต์พุตแรกด้วยซ้ำ DeepSeek ยังจำกัดความละเอียดก่อนการอนุมาน: ระดับรายละเอียดต่ำจะปรับขนาดเป็น 512×512 ส่วนระดับสูง/ต้นฉบับจะปรับขนาดภาพล่วงหน้า (ภาพเล็กขยายขึ้นถึงประมาณ 384×384 ภาพใหญ่ย่อลงเหลือประมาณ 800×800) ดังนั้นภาพต้นฉบับความละเอียดสูงจึงไม่ถูกป้อนเข้าสู่โมเดลด้วยจำนวนพิกเซลดั้งเดิม
นักแสดงสมทบ: Files API ฟรีและ Harness 0.1.1
มีโครงสร้างพื้นฐานสองชิ้นที่ปล่อยออกมาพร้อมกับโมเดล Files API เปิดให้บริการแล้วและฟรี: อัปโหลดรูปภาพครั้งเดียว อ้างอิงด้วย file_id และนำมาใช้ซ้ำในหลายคำขอได้โดยไม่ต้องส่ง bytes ซ้ำ — ซึ่งมีประโยชน์สำหรับ browsing agent ที่เก็บหน้าเว็บไว้ในบริบทต่อเนื่องหลายเทิร์น และ DeepSeek Harness 0.1.1 ที่เปิดตัวในวันเดียวกัน รองรับโมเดลใหม่ได้ทันทีโดยไม่ต้องปรับแต่ง ดังนั้น harness ที่ใช้ benchmark และขับเคลื่อนเวิร์กโหลดแบบ agentic ของ DeepSeek จึงสามารถกำหนดเป้าหมายมาที่โมเดลนี้ได้ในทันที
ข้อควรระวังด้านการผลิต กล่าวอย่างตรงไปตรงมา
นี่คือโมเดลทดลอง DeepSeek ระบุชัดเจนว่าเป็นเช่นนั้น ยังไม่ได้ประกาศวัน GA และแนะนำไม่ให้นำไปรันในโปรดักชันโดยตรง แผนที่ระบุไว้คือการปรับปรุงตามฟีดแบ็กและปล่อยเวอร์ชันเสถียรในภายหลัง ผลในทางปฏิบัติคือสมองข้อความได้รับการพิสูจน์แล้ว — เพราะเป็นตระกูลน้ำหนักชุดเดียวกับที่ขับเคลื่อน V4-Flash — แต่เส้นทางด้านวิทัศน์เป็นโค้ดใหม่ และไม่มีใครนอก DeepSeek ทดสอบที่สเกลใหญ่
นี่คือสถานการณ์ที่เลเยอร์การกำหนดเส้นทาง (routing layer) พิสูจน์คุณค่าของมันอย่างแท้จริง บน OrcaRouter ทั้ง deepseek/deepseek-v4-flash-vision-exp และ deepseek/deepseek-v4-flash ต่างทำงานอยู่เบื้องหลัง API เดียวกัน ในราคารายการของ DeepSeek ที่ส่งผ่านโดยไม่บวกเพิ่มแม้แต่น้อย คุณสามารถส่งทราฟฟิกที่มีรูปภาพไปยังโมเดลทดลอง และในการตั้งค่าเดียวกันก็ตั้งค่าให้ failover อัตโนมัติไปยังโมเดลสำรองทันทีที่เกิดข้อผิดพลาดหรือหมดเวลา ซึ่งช่วยลดความเสี่ยงของปัญหา 'โค้ดใหม่' ลงได้ทั้งหมด DSL สำหรับกำหนดเส้นทางยังช่วยให้คุณส่งเฉพาะคำขอที่มีรูปภาพจริง ๆ ไปยังโมเดลวิชัน และให้ทราฟฟิกข้อความล้วนใช้ DeepSeek V4 Flash ต่อไป ซึ่งได้ทั้งคะแนน benchmark ที่ดีขึ้นตรงที่ควรได้ และไม่ต้องจ่ายเพิ่มในจุดที่ไม่จำเป็น

สิ่งที่ควรดูต่อไป
คำถามที่ค้างอยู่ก็เป็นคำถามปกติสำหรับการเปิดตัวเชิงทดลอง เมื่อใดที่ DeepSeek V4 Flash Vision (Exp) จะถึงสถานะ GA และราคาจะคงเดิมหรือไม่ วิดีโอหรือเสียงอินพุตจะตามมาหรือไม่ — โมเดลปัจจุบันรองรับเฉพาะภาพนิ่งเท่านั้น ซึ่งทำให้โมเดล multimodal ขนาดใหญ่ระดับแนวหน้าไร้คู่แข่งในสื่อที่เคลื่อนไหว และการประเมินอิสระ (การรันโดยบุคคลที่สามครั้งแรกบน ApexBench หรือ Terminal-Bench) จะให้ผลลัพธ์ตรงกับตัวเลขที่เผยแพร่หรือไม่ ที่น่าสนใจคือ แม้ว่าเกณฑ์ชี้วัดทั้งหมดจะลดลง คำกล่าวอ้างที่คุ้มค่าอยู่แล้ว — วิทัศน์ในราคาข้อความ — เป็นข้อเท็จจริงด้านราคา ไม่ใช่คำกล่าวอ้างจากเกณฑ์ชี้วัด และไม่จำเป็นต้องพิสูจน์ซ้ำ
การเปรียบเทียบในบทความนี้1
ตรวจพบจากบทความนี้ · เบนช์มาร์ก: Artificial Analysis · อัปเดตทุกวัน
