
DeepSeek V4.1 Flash ใน OpenCode: การตั้งค่า ค่าใช้จ่าย และปุ่มปรับระดับความพยายามที่ไม่มีใครพูดถึง
- openaiใหม่OpenAI: GPT-6.1 Sol2026-09-2952ความฉลาด
- anthropicใหม่Anthropic: Claude Sonnet 5.52026-09-2856ความฉลาด
- typesafeใหม่TypeSafe: Jev 1.132026-09-24$0.04 / $0.00 ต่อ 1 ล้านโทเค็น · 151 tok/s
- OpenAIใหม่OpenAI: GPT-6 Luna2026-09-2238ความฉลาด
- OpenAIใหม่OpenAI: GPT-6 Sol2026-09-2248ความฉลาด
- Anthropicใหม่Anthropic: Claude Opus 5.52026-09-2258ความฉลาด
- xAIGrok 4.72026-09-2146ความฉลาด
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 ต่อ 1 ล้านโทเค็น · 126 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 ต่อ 1 ล้านโทเค็น · 1202 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040ความฉลาด
- OpenAIOpenAI: GPT-6 Astra2026-09-0453ความฉลาด77การเขียนโค้ด
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241ความฉลาด76การเขียนโค้ด
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245ความฉลาด76การเขียนโค้ด
- AnthropicAnthropic: Claude Fable 5.12026-09-0153ความฉลาด82การเขียนโค้ด
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 ต่อ 1 ล้านโทเค็น · 52 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 ต่อ 1 ล้านโทเค็น · 251 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642ความฉลาด72การเขียนโค้ด
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 ต่อ 1 ล้านโทเค็น · 230 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845ความฉลาด75การเขียนโค้ด
- obsidianQwen3.8 27B2026-08-1534ความฉลาด68การเขียนโค้ด
DeepSeek V4.1 Flash อยู่ใน OpenCode Go ตั้งแต่ 10 กันยายน และตัวคูณที่ OpenCode กำหนดให้กับมันมีวันสิ้นสุดที่ประกาศไว้: 20 กันยายน เหลืออีกสี่วันจากนี้ ส่วนที่น่าสนใจไม่ใช่กำหนดเส้นตาย — แต่เป็นการที่ค่าตั้งค่าซึ่งตัดสินว่าโมเดลนี้เขียนโค้ดได้สบายแค่ไหนนั้นหายไปจากคู่มือตั้งค่าทุกฉบับในหน้าแรกของผลการค้นหา และในฮาร์เนสอย่างน้อยสองตัว มันถูกตัดทิ้งอย่างเงียบ ๆ นี่คือเพลย์บุ๊กสำหรับชี้เอเจนต์เขียนโค้ดไปที่ DeepSeek V4.1 Flash: ไอดีโมเดลที่แน่นอน การผสานรวมสามแบบที่ตรวจสอบแล้ววันนี้ การควบคุม reasoning-effort ที่ชุมชนรายงาน และโหมดล้มเหลวแบบคิดมากเกินไปพร้อมมาตรการบรรเทาที่ได้ผลจริง
สิ่งที่คุณกำลังให้เอเจนต์ของคุณมุ่งไปหาจริง ๆ
DeepSeek V4.1 Flash เปิดตัวเมื่อวันที่ 10 กันยายน 2026 — บันทึกการเปิดตัวบนเอกสาร API ของ DeepSeek เองลงวันที่วันนั้น และเป็นโมเดลที่เล็กที่สุดในตระกูลสถาปัตยกรรมใหม่ของผู้ให้บริการ DeepSeek รายงานว่าแกนหลักแบบ mixture-of-experts ขนาด 552B พารามิเตอร์สร้างขึ้นบนสิ่งที่บริษัทเรียกว่าการออกแบบ Causal Encoder–Decoder โดยเปิดใช้งานพารามิเตอร์ประมาณ 8B ต่อโทเคนระหว่าง prefill และ 16B ระหว่าง decode รับข้อความและรูปภาพเป็นอินพุตและส่งคืนข้อความ ให้บริการหน้าต่างบริบทสูงสุดหนึ่งล้านโทเคน และจะสร้างได้สูงสุด 384,000 โทเคนในการตอบกลับครั้งเดียว — เพดานบริบทและเอาต์พุตทั้งคู่มาจากหน้าของโมเดลของ OrcaRouter เองสำหรับโมเดลดังกล่าว ซึ่งระบุ 1,048,576 และ 384,000 ตามลำดับ
ผลการวัดจากผู้ขายเอง จากกราฟบนหน้าเปิดตัวของ DeepSeek จึงเป็นตัวเลขที่ผู้ขายรายงานเองและไม่ผ่านการตรวจสอบ: 30.0 บน Terminal-Bench 3.0, 74.2 บน DeepSWE v1.1, 88.1 บน CyberGym, 54.8 บน Automation-Bench และ 90.9 บน GPQA Diamond การให้คะแนนโดยอิสระนั้นมีบางกว่าแต่ก็มีอยู่ — Artificial Analysis ซึ่งอ่านโดยตรงเมื่อวันนี้ จัดให้ DeepSeek V4.1 Flash อยู่ที่ 40 บน Intelligence Index ของตน อยู่อันดับที่ 6 จาก 113 ในกลุ่มเปรียบเทียบของมัน ข้อความบรรทัดหนึ่งจากหน้าเดียวกันนั้นสำคัญต่อผู้อ่านที่เป็น coding agent ยิ่งกว่าอันดับ: Artificial Analysis ติดป้ายว่าโมเดลนี้พูดมากเป็นพิเศษ โดยใช้โทเคนเอาต์พุตไป 250 ล้านโทเคนเพื่อทำ Intelligence Index ให้เสร็จ เทียบกับค่ามัธยฐานที่ 140 ล้าน เราจะกลับมาที่เรื่องนี้
ข้อเท็จจริงสองข้อเกี่ยวกับการตั้งชื่อช่วยประหยัดเวลาในการดีบักได้จริง ตอนนี้ model id มาตรฐานของ API ของ DeepSeek คือ code>deepseek-flash/code> ส่วนสตริงเก่ากว่า code>deepseek-v4-flash/code> และ code>deepseek-v4-flash-vision-exp/code> ยังคงรับได้อยู่ แต่โมเดลที่อยู่เบื้องหลังนั้นถูกยกเลิกไปแล้ว และคำขอจะถูกให้บริการโดย V4.1 Flash ในราคาระดับ Flash ในอีกด้านหนึ่ง DeepSeek V4 Pro ไม่ได้หายไป: เอกสารของ DeepSeek ระบุว่าบริการ API ของ V4 Pro ยังคงดำเนินต่อไปหลังวันที่ 2026-09-14 โดยการเรียกเก็บเงินไม่เปลี่ยนแปลง หากคุณได้รับแจ้งว่าโมเดลเรือธงถูกปิด นั่นไม่ใช่สิ่งที่เอกสารของผู้จำหน่ายเองระบุไว้

OpenCode: สองเส้นทางเข้า และ id ที่ต้องพิมพ์จริง
มีสองวิธีในการนำ DeepSeek V4.1 Flash มาไว้เบื้องหลัง OpenCode และทั้งสองวิธีมีเศรษฐศาสตร์ที่แตกต่างกัน
เส้นทางการสมัครสมาชิกคือ OpenCode Go ซึ่งเป็นแผนราคา $10/เดือนที่ OpenCode อธิบายว่าเป็นชุดโมเดลเขียนโค้ดแบบเปิดที่คัดสรรแล้ว และได้ทดสอบและวัดประสิทธิภาพมาแล้ว การตั้งค่ามีสี่ขั้นตอนและไม่มีไฟล์กำหนดค่าที่ต้องแก้ไขด้วยมือ: ลงชื่อเข้าใช้ OpenCode Zen, สมัคร Go, คัดลอกคีย์ API จากนั้นรัน code>/connect/code> ใน TUI เลือก OpenCode Go แล้ววางคีย์ หลังจากนั้น code>/models/code> จะแสดงรายการที่มีให้ใช้งาน การอ้างอิงโมเดลในการกำหนดค่าจะมีรูปแบบเป็น code>opencode-go/<model-id>/code>.
โมเดลไอดีไหน? ทั้งคู่ รายการโมเดลของ Go gateway เอง ที่ดึงข้อมูลวันนี้จาก code>https://opencode.ai/zen/go/v1/models/code> จะส่งคืน code>deepseek-flash/code> และ code>deepseek-v4.1-flash/code> เป็นสองรายการที่แตกต่างกัน ควบคู่ไปกับรายการ legacy อย่าง code>deepseek-v4-flash/code> และ code>deepseek-v4-pro/code> ไม่ว่าจะเลือกอันใดจากสองรายการแรก ก็จะได้โมเดลที่คุณต้องการ; code>deepseek-flash/code> เป็นชื่อมาตรฐานและเป็นตัวเลือกที่ปลอดภัยกว่าสำหรับทุกอย่างที่คุณตั้งใจจะใช้งานต่อไป
เส้นทางตรงจะข้ามการสมัครสมาชิกไปเลย: รัน code>/connect/code> ค้นหา DeepSeek แล้ววางคีย์แพลตฟอร์ม DeepSeek จากนั้นคุณจะถูกเรียกเก็บเงินโดย DeepSeek ในราคาตามประกาศ แทนที่จะดึงจากโควตาของ Go DeepSeek ประกาศราคาตามประกาศในช่วงนอกเวลาเร่งด่วนที่ 0.15 ดอลลาร์ต่อ 1 ล้านโทเค็นอินพุต และ 0.60 ดอลลาร์ต่อ 1 ล้านโทเค็นเอาต์พุต โดยการอ่านจากแคชอยู่ที่ 0.003 ดอลลาร์ต่อ 1 ล้านโทเค็น — และเป็นสองเท่าของราคาเหล่านั้นในช่วงเวลาเร่งด่วน ทั้งเอกสาร OpenCode Go และหน้าโมเดลของ OrcaRouter ที่อ่านเมื่อวันนี้ ระบุตัวเลขเหล่านี้ตรงกัน
สิ่งที่ OpenCode Go เพิ่มเข้ามาคือโครงสร้างโควตา และตรงนี้ตัวเลขเหล่านี้ควรอ่านอย่างละเอียด เพราะตัวเลขเหล่านี้คือเหตุผลที่ทำให้เดดไลน์มีความสำคัญ เอกสารของ OpenCode เองระบุ DeepSeek V4.1 Flash โดยมีขีดจำกัดรายเดือนที่ $15 ซึ่งปัจจุบันถูกคูณ 4× เป็น $60 ภายใต้โปรโมชันที่ OpenCode ระบุว่า "สิ้นสุด 20 ก.ย." จำนวนคำขอโดยประมาณถูกเผยแพร่ในสองคอลัมน์: 6,500 ต่อ 5 ชั่วโมง / 16,250 ต่อสัปดาห์ / 32,500 ต่อเดือนที่อัตรามาตรฐาน หรือ 26,000 / 65,000 / 130,000 เมื่อนำตัวคูณ 4× มาใช้ รูปแบบของโควตาสอดคล้องกันในทุกโมเดล — ขีดจำกัด 5 ชั่วโมงคือ 20% ของตัวเลขรายเดือน ขีดจำกัดรายสัปดาห์คือ 50% และขีดจำกัดรายเดือนคือทั้งหมด
นั่นคือตัวเลขที่ OpenCode เผยแพร่ อ่านจากเอกสาร Go ของตัวเองเมื่อวันนี้ โปรโมชันเป็นของพวกเขาที่จะยุติ และมันมีวันที่กำกับไว้

Command Code: ยังใช้งานได้อยู่ และเป็นรายงานข้อบกพร่องที่ควรรู้
แค็ตตาล็อกของ Command Code เองยังคงระบุโมเดลนี้ ณ วันนี้ ภายใต้ id code>deepseek-v4-1-flash/code> พร้อมหน้าต่างบริบท 1 ล้านโทเคน และโครงสร้างราคาแบบส่งผ่านเดียวกัน: $0.15 / $0.60 นอกช่วงพีค, $0.30 / $1.20 ช่วงพีค, $0.003 สำหรับการอ่านจากแคช ราคาที่ตรงกันในฮาร์เนสอิสระสองตัวไม่ใช่เรื่องบังเอิญ — ทั้งคู่ส่งผ่านราคาตามที่ DeepSeek ประกาศไว้ แทนที่จะตั้งราคาของตัวเอง
กลไกนั้นตรงไปตรงมา ติดตั้งด้วย code>npm i -g command-code/code> รันจากไดเรกทอรีโปรเจกต์ของคุณ ยืนยันตัวตนด้วย code>/login/code> และใช้ code>/connect/code> หากคุณต้องการใช้คีย์ผู้ให้บริการของคุณเอง code>/model <id>/code> จะเปลี่ยนโมเดลให้ทันที ส่วน code>/model/code> เปล่า ๆ จะเปิดตัวเลือกขึ้นมา และ code>/effort/code> กำหนดระดับความพยายามในการใช้เหตุผลสำหรับโมเดลปัจจุบัน — ซึ่งเป็นแฟล็กที่สำคัญที่สุดในที่นี้
รายงานบั๊กจากชุมชนฉบับหนึ่งควรค่าแก่การจดจำไว้ในหัวก่อนที่คุณจะดีบั๊กผิดเลเยอร์ issue ที่เปิดอยู่กับเลเยอร์การกำหนดเส้นทางของบุคคลที่สามอธิบายถึงแคช reasoning-replay ที่ไม่เคยทำงานสำหรับ code>command-code/deepseek-v4.1-flash/code> id เพราะแพตเทิร์นที่เลเยอร์การกำหนดเส้นทางใช้จับคู่คาดหวัง code>v4./code> หรือ code>v4-/code> เซกเมนต์ และสตริงคือ code>v4.1/code> อาการที่รายงานคือข้อผิดพลาด 400 จากต้นทางที่แจ้งว่าเนื้อหาการให้เหตุผลที่สร้างขึ้นในโหมด thinking ต้องส่งกลับไปยัง API นั่นคือรายงานบั๊กจากชุมชนเกี่ยวกับตัวจับคู่ฝั่งไคลเอนต์ ไม่ใช่คำแนะนำจากผู้จำหน่าย และไม่ใช่ปัญหาของโมเดล — แต่มันเป็นสิ่งที่ดูเหมือนความผิดพลาดของโมเดลตอนตี 2 พอดี
Claude Code, Codex และไคลเอนต์ต่างๆ ที่ OpenCode ตรวจสอบยืนยันด้วยตัวเองแล้ว
OpenCode Go ไม่ได้รองรับเฉพาะ OpenCode เท่านั้น และเอกสารของพวกเขาก็ระบุไว้อย่างชัดเจนเช่นนั้น: มันถูกออกแบบมาสำหรับ OpenCode และเอเจนต์เขียนโค้ดอื่น ๆ ที่สร้างรูปแบบคำขอในลักษณะใกล้เคียงกัน โดยมีรายชื่อไคลเอนต์ที่ผ่านการตรวจสอบว่าใช้งานได้เผยแพร่ไว้ รายชื่อดังกล่าวในปัจจุบันระบุชื่อ Hermes, Claude Code, Codex, ZCode และ Pi — และสำหรับ Claude Code มีหมายเหตุว่า มัน "รู้จักส่วนหัวเซสชันเนทีฟของตัวเอง จึงไม่จำเป็นต้องมีตัวห่อส่วนหัวแบบกำหนดเอง" ทั้งนี้มาพร้อมกับข้อกำหนดสองประการ: ระบุไคลเอนต์ของคุณด้วย user agent ของตัวเองแทนที่จะใช้ชื่อ SDK แบบทั่วไป และส่งตัวระบุเซสชันที่คงที่ในส่วนหัว code>x-opencode-session/code> ของทุกบทสนทนา ซึ่งเป็นสิ่งที่ทำให้การกำหนดเส้นทางและการแคชพรอมป์ต์ของพวกเขาทำงานได้ สำหรับ Hermes นั้นบิลด์ที่ผ่านการตรวจสอบมีความสำคัญ — การแก้ไขส่วนหัวถูกผสานหลัง v0.21.0 ดังนั้นรีลีสนั้นเพียงอย่างเดียวจึงไม่ได้รวมการแก้ไขนี้ไว้
นอกจากนี้ยังมีเส้นทางที่ไม่มีการสมัครใช้งานผูกอยู่เลย โดยใช้เอนด์พอยต์ที่เข้ากันได้กับ Anthropic ของ DeepSeek โดยตรง ตั้งค่า code>ANTHROPIC_BASE_URL/code> เป็น code>https://api.deepseek.com/anthropic/code> และตั้งค่า code>ANTHROPIC_AUTH_TOKEN/code> เป็นคีย์ DeepSeek ของคุณ และชี้ตัวแปรโมเดลไปที่โมเดลนั้น ชื่อโมเดล Claude จะถูกแมปใหม่เมื่อรับเข้ามา: อะไรก็ตามที่ขึ้นต้นด้วย code>claude-opus/code> จะไปที่ DeepSeek V4 Pro และคิดค่าบริการในราคา V4 Pro ในขณะที่ชื่อ code>claude-sonnet/code> และ code>claude-haiku/code> จะไปที่โมเดล Flash code>[1m]/code> ซึ่งเป็นคำต่อท้ายบนสตริงโมเดลที่ขอรูปแบบบริบทแบบหนึ่งล้านโทเคน คู่มือของ DeepSeek เองสำหรับการตั้งค่านี้ยังตั้งค่า code>CLAUDE_CODE_EFFORT_LEVEL=max/code> และกำหนดหน้าต่าง auto-compact ไว้ที่ 786432 โทเคน
ตัวแปรสุดท้ายนั้นคือจุดที่แพตช์จากชุมชนอยู่ พร็อกซีแบบ workaround มีอยู่เพราะบิลด์ Claude Code รุ่นใหม่ส่ง code>thinking: {"type": "disabled"}/code> ไปกับคำขอ subagent ขณะที่ code>CLAUDE_CODE_EFFORT_LEVEL=max/code> เพิ่มพารามิเตอร์ reasoning effort และเอนด์พอยต์รูปแบบ Anthropic ของ DeepSeek ปฏิเสธการจับคู่นี้ด้วยข้อความเกี่ยวกับตัวเลือก thinking ที่ไม่สามารถปิดได้เมื่อมีการตั้งค่า reasoning effort workaround ที่มีรายงานนั้นแคบ — ตัดพารามิเตอร์ effort ออกจากคำขอ subagent เท่านั้น โดยปล่อยให้ main agent ไม่ถูกแตะต้อง มองสิ่งนี้เป็นข้อค้นพบจากชุมชนเกี่ยวกับความไม่ตรงกันของสัญญาระหว่างไคลเอนต์/เซิร์ฟเวอร์ และคาดว่าขอบเขตเวอร์ชันที่แน่นอนจะเปลี่ยนแปลงไป
ปุ่มหมุนระดับความพยายาม: 1–100 และเหตุใด "ต่ำ" จึงหมายถึง 50
ทุกอย่างในส่วนนี้เป็นข้อค้นพบจากชุมชน ไม่ใช่คำแนะนำจากผู้ให้บริการ DeepSeek ไม่ได้เผยแพร่การแมป preset ไปเป็นตัวเลขที่เราใช้ตรวจสอบได้ และตัวเลขด้านล่างมาจากบันทึกของผู้ปฏิบัติงานและเอกสารฮาร์เนสของบุคคลที่สาม ตัวเลขเหล่านี้สอดคล้องกันมากพอในหลายแหล่งจนมีประโยชน์ และยังไม่ได้รับการยืนยันมากพอที่คุณควรทดสอบกับงานของคุณเอง
DeepSeek V4.1 Flash ถูกฝึกด้วยค่าสเกลาร์ความพยายามในการใช้เหตุผลแบบต่อเนื่องจาก 1 ถึง 100 มันไม่ใช่ขีดจำกัดโทเค็น — แต่เป็นการเลื่อนตำแหน่งที่โมเดลอยู่บนเส้นโค้งที่กระบวนการฝึกเรียนรู้ไว้ โดยความพยายามต่ำจะกดดันให้กระชับมากขึ้น และความพยายามสูงจะทำให้การใช้เหตุผลเพิ่มเติมมีต้นทุนถูกลง พรีเซ็ตสาธารณะสามแบบแมปเข้ากับสเกลนั้น:
• Low — 50, เส้นทางที่สั้นที่สุด และเป็นพรีเซ็ตที่ทำให้ตัวควบคุมนี้ขึ้นชื่อในเรื่องความประหยัด
• สูง — 75 และเป็นระดับที่แหล่งข้อมูลจากชุมชนส่วนใหญ่ระบุว่าเป็นเพดานที่สมเหตุสมผลสำหรับงานของเอเจนต์
• Max — 100 โดยที่การลงโทษเกี่ยวกับความยาวของการใช้เหตุผลถูกลบออกทั้งหมด
สิ่งที่การปรับค่านี้ให้มานั้นเป็นของจริง แต่ผลตอบแทนลดลงอย่างรวดเร็ว การกวาด benchmark จากชุมชนครั้งหนึ่งรายงานว่าการเพิ่ม effort จาก 25 เป็น 100 ทำให้ Terminal-Bench 2.1 ขยับจาก 82.4 เป็น 90.6 ขณะที่จำนวน output tokens โดยรวมเพิ่มขึ้นประมาณ 2.5 เท่า รายงานต่าง ๆ ลงเอยที่ effort ระหว่าง 60 ถึง 80 ซึ่งเก็บเกี่ยวความแม่นยำที่มีอยู่ส่วนใหญ่ได้ด้วยงบ token ไม่ถึงครึ่ง โดยที่ค่า max เพิ่มอีก 1.6–1.8 เท่าให้กับ agent trajectories เพื่อผลตอบแทนที่เพิ่มขึ้นเพียงเล็กน้อย
ค่าเริ่มต้นคือส่วนที่ไม่มีใครเห็นตรงกัน เอกสารประกอบของฮาร์เนสบางฉบับและรายงานจากผู้ใช้งานจริงกล่าวว่า effort ที่ไม่ได้กำหนดไว้จะถูกตีความเป็น high ส่วนฉบับอื่นอธิบายว่าค่าเริ่มต้นของเซิร์ฟเวอร์นั้นไม่ทราบแน่ชัด สิ่งที่ได้รับการบันทึกไว้แทนที่จะเป็นข้อถกเถียงก็คือ พบว่าการผสานรวมฮาร์เนสสองรายไม่ส่งพารามิเตอร์นี้เลย — ทั้งโปรไฟล์ผู้ให้บริการ OpenCode Go และโปรไฟล์ DeepSeek แบบเนทีฟ ต่างก็ไม่ส่ง code>reasoning_effort/code> สำหรับ slug code>deepseek-flash/code> เพราะ guard การจับคู่ของทั้งสองคาดหวังคำนำหน้า code>deepseek-v…/code> ซึ่งไอดีตามมาตรฐานไม่มี ในทั้งสองกรณี ค่าที่ผู้ใช้เลือกไว้ถูกแทนที่ด้วยค่าเริ่มต้นของผู้ให้บริการอย่างเงียบ ๆ หากไคลเอนต์ของคุณแสดงตัวควบคุม effort นั่นไม่ใช่หลักฐานว่ามันถูกส่งออกไปจริง ให้บันทึก body ของคำขอสักหนึ่งครั้งแล้วดู
ความแปลกประหลาดอีกอย่างจากรายงานเดียวกัน: เอนด์พอยต์ OpenCode Go ยอมรับ code>low/code>, code>medium/code>, code>high/code> และ code>max/code>, แต่ปฏิเสธค่า effort แบบจำนวนเต็ม — มีรายงานว่าค่า 80 ส่งคืน HTTP 400 มาตรวัด 1–100 มีอยู่ในโมเดล แต่ไม่ได้เปิดเผยเป็นตัวเลขดิบในทุกที่ ดังนั้น "set effort to 65" อาจไม่สามารถทำได้ในไคลเอนต์ของคุณ
รูปแบบความล้มเหลวจากการคิดมากเกินไป และอะไรที่แก้ไขมันได้จริง ๆ
นี่คือโหมดความล้มเหลวที่ตัดสินว่าคุณจะเก็บโมเดลนี้ไว้ในลูปการทำงานของคุณหรือไม่ รายงานจากชุมชนระบุว่า DeepSeek V4.1 Flash ยังคงให้เหตุผลต่อไปหลังจากงานเสร็จสิ้นแล้ว: เถียงประเด็นที่มันตอบถูกไปแล้วซ้ำอีก บรรยายการแก้ไขข้อสันนิษฐานที่ผิดของตัวเอง และสร้างห่วงโซ่การให้เหตุผลยาว ๆ ที่มีความหนาแน่นของข้อมูลต่ำ ผู้ปฏิบัติงานคนหนึ่งรายงานว่าเอาต์พุตการให้เหตุผลยังคงดำเนินต่อไปนานกว่าหนึ่งชั่วโมงภายในเซสชัน CLI สำหรับเขียนโค้ด อีกคนรายงานว่าไม่สามารถทำให้มันรัน benchmark แบบยาวจนจบได้เลย
บันทึกแหล่งที่มาสำหรับรายงานฉบับที่สองนั้น เพราะมันเป็นข้อกล่าวอ้างประเภทที่มักถูกฟอกให้ดูน่าเชื่อถือ ข้อนี้มาจากกระทู้ในชุมชนเกี่ยวกับการรันโมเดลให้เชื่อถือได้ และ Reddit บล็อกตัวดึงข้อมูลของเรา เราจึงอ่านกระทู้นั้นโดยตรงไม่ได้ — เราถ่ายทอดรายงานต่อ แทนที่จะยกคำพูดจากหน้าที่เราเปิดอ่านเอง สิ่งที่เราตรวจสอบยืนยันได้อย่างอิสระคือลักษณะของปัญหา และในจุดนี้หลักฐานจากภายนอกกลับชัดเจนสะอาดเป็นพิเศษ: Artificial Analysis บนหน้าของตนเองระบุว่าโมเดลนี้ตอบยาวเกินไปมาก โดยใช้เอาต์พุตโทเคน 250M เพื่อทำการรันหนึ่งรอบให้เสร็จ ซึ่งโมเดลคู่เทียบค่ามัธยฐานของมันทำเสร็จใน 140M นั่นคิดเป็นประมาณ 1.8 เท่า วัดโดยบุคคลที่สาม บนชุดงานที่กำหนดไว้ตายตัว รายงานจากฟอรัมและตัวชี้วัดอิสระกำลังอธิบายพฤติกรรมเดียวกัน
มาตรการบรรเทาผลกระทบที่ได้จากรายงานเหล่านั้น ซึ่งมาจากชุมชนทั้งหมด:
• ตรึง effort ไว้ที่ high หรือต่ำกว่า และอย่าปล่อยให้มันไต่เพิ่มขึ้น วิธีแก้ที่ชัดเจนที่สุดที่พบเห็นได้จริงคือปลั๊กอินจัดเส้นทางที่เขียนขึ้นโดยเฉพาะเพื่อหยุดการเพิ่มระดับ effort: ความลึกของเทิร์นไม่มีส่วนช่วยต่อคะแนนการเพิ่มระดับ มีเพียงผลลัพธ์เครื่องมือที่ล้มเหลวหรือการลองซ้ำที่เหมือนเดิมเท่านั้นที่นับ การเพิ่มระดับถูกจำกัดเพดาน และ max ต้องเลือกเปิดเองโดยค่าเริ่มต้นจะถูกลดระดับลง หาก harness ของคุณเปิดทางให้เอเจนต์เพิ่ม effort ของตัวเองเมื่อการรันยาวนานขึ้น นั่นคือกลไกที่ต้องปิด
• อย่าตั้งค่าให้ใช้ max เป็นค่าเริ่มต้น ผู้ใช้งานหลายท่านรายงานว่า max หมุนวนไปมาแทนที่จะลู่เข้าหาผลลัพธ์เมื่องานทั่วไป และการสลับกลับไปใช้ high ช่วยแก้ปัญหานี้ได้
• จำกัด code>max_tokens/code> บนเส้นทางแบบอินเทอร์แอกทีฟ เพดานเอาต์พุต 384,000 โทเคนเป็นขีดจำกัด ไม่ใช่เป้าหมาย และลูปที่ไม่ยอมสิ้นสุดนั้นมีค่าใช้จ่ายสูงที่เพดานระดับนั้น
• ตรวจสอบว่าพารามิเตอร์ถูกส่งไปจริงหรือไม่ เมื่อพบว่าฮาร์เนสสองตัวทิ้งมันไปอย่างเงียบ ๆ คำกล่าวที่ว่า "ฉันตั้งค่าเป็น high" กับ "ค่า high ไปถึง API" จึงเป็นคนละเรื่องกัน
• โครงระบบ (harness) สำคัญกว่าที่คุณคาดคิด ผู้ปฏิบัติที่รันเวตเดียวกันรายงานว่าพฤติกรรมแตกต่างกันอย่างมากในแต่ละเชลล์ — โมเดลเดียวกันที่เถียงกับตัวเองและกลบสัญญาณทิ้งในโครงระบบหนึ่ง กลับไม่ถูก complaints เหล่านั้นเลยในอีกโครงระบบหนึ่ง นั่นเป็นข้อสังเกตของชุมชนเกี่ยวกับพฤติกรรมของโครงระบบ ไม่ใช่คำกล่าวอ้างของผู้ขายเกี่ยวกับตัวโมเดล แต่เป็นคำแนะนำที่ถูกพูดซ้ำมากที่สุดในรายงานเหล่านั้น
รอบการเขียนโค้ดหนึ่งรอบมีค่าใช้จ่ายจริงเท่าไหร่ที่เรตเหล่านี้
ราคาตามประกาศของ DeepSeek อยู่ที่ 0.15 ดอลลาร์ต่อ 1 ล้านโทเคนอินพุต และ 0.60 ดอลลาร์ต่อ 1 ล้านโทเคนเอาต์พุตในช่วงนอกเวลาพีก — เอาต์พุตมีราคาสูงกว่าอินพุตถึงสี่เท่า ซึ่งเป็นสิ่งแรกที่ต้องซึมซับให้ขึ้นใจเกี่ยวกับเอเจนต์ที่สร้างทั้งเหตุผลและโค้ด
ลองนึกถึงการทำงานจริงของเอเจนต์หนึ่งรอบ: บริบท 60,000 โทเค็น (พรอมป์ระบบ สคีมาของเครื่องมือ โค้ดบางส่วนจากรีโป ประวัติการสนทนา) ขาเข้า และ 3,000 โทเค็นสำหรับการให้เหตุผลพร้อมแพตช์ขาออก นั่นคือ 60,000 × $0.15/1M = $0.009 ขาเข้า บวก 3,000 × $0.60/1M = $0.0018 ขาออก ดังนั้นประมาณ 1.1 เซนต์ต่อรอบ สองร้อยรอบเช่นนี้ในหนึ่งวันทำงานจะอยู่ที่ประมาณ $2.16 หรือประมาณ $47 ตลอดหนึ่งเดือนของวันทำงานในอัตราแบบออฟพีค นั่นคือเลขคณิตที่ทำให้โควต้ารายเดือน $15 พร้อมโปรโมชัน 4× ซ้อนทับดูใจกว้าง — และเป็นเลขคณิตที่ทำให้ความเยิ่นเย้อกลายเป็นสิ่งที่ต้องจับตา
เพราะนี่คือเลเวอเรจที่ซ่อนอยู่ในตัวเลขของ Artificial Analysis นั้น การที่โมเดลใช้โทเคนเอาต์พุตเป็น 1.8 เท่าของค่ามัธยฐานบนชุดงานที่กำหนดไว้ หมายความว่าลูปที่ถูกจำกัดด้วยเอาต์พุตมีค่าใช้จ่ายเป็น 1.8 เท่าของสิ่งที่ราคาโทเคนเพียงอย่างเดียวบอกเป็นนัยไว้ และปุ่มปรับ effort คือตัวควบคุมสำหรับสิ่งนั้นโดยตรง รายงานจากชุมชนระบุว่าการเปลี่ยนจาก max ลงมาเป็น high ทำให้จำนวนโทเคนเอาต์พุตลดลงประมาณครึ่งหนึ่ง ซึ่งเป็นการแกว่งที่มากกว่าสิ่งใดที่ตาราง peak/off-peak จะทำกับคุณได้มากนัก การตั้งค่า effort คือคันโยกใหญ่ ส่วนตารางเวลาคืออันที่ให้ฟรี
สิ่งที่ควรรู้ก่อนที่คุณจะกำหนดตารางเวลาใด ๆ: ช่วงพีคคือ 01:00–04:00 และ 06:00–10:00 UTC ตั้งแต่วันจันทร์ถึงวันศุกร์ ส่วนเวลาอื่นทั้งหมด รวมถึงวันหยุดสุดสัปดาห์ เป็นช่วงนอกพีค ทีมในยุโรปที่ทำงาน 09:00–18:00 CET จะไม่แตะช่วงพีคเลย ทีมในปักกิ่งที่ทำงานในเวลาท้องถิ่นเดียวกันจะเจอช่วงพีคตั้งแต่ 09:00–12:00 และ 14:00–18:00 — เจ็ดในเก้าชั่วโมงทำงานคิดราคาสองเท่า โมเดลเดียวกัน โค้ดเดียวกัน แต่ค่าใช้จ่ายเป็นสองเท่า ซึ่งขึ้นอยู่กับเขตเวลาเพียงอย่างเดียว
การประหยัดฟรีอีกทางหนึ่งคืออัตราการอ่านจากแคช อยู่ที่ $0.003 ต่อ 1M เทียบกับ $0.15 สำหรับอินพุตใหม่ — คิดเป็นหนึ่งในห้าสิบ พรอมป์ตของเอเจนต์เขียนโค้ดส่วนใหญ่มักเป็นคำนำหน้าที่คงที่ ได้แก่ คำสั่งระดับระบบ นิยามของเครื่องมือ และส่วนต่าง ๆ ของรีโปที่ไม่มีการเปลี่ยนแปลง ให้วางเนื้อหาที่คงที่ไว้ด้านหน้าและปล่อยให้เนื้อหาที่แปรผันตามมาทีหลัง แล้วแคชฝั่งผู้ให้บริการจะจัดการที่เหลือให้เอง ส่วนว่าอินพุตที่แคชไว้จะได้รับส่วนลดหรือไม่ และภายใต้เงื่อนไขใดนั้น DeepSeek เป็นผู้กำหนด ไม่ใช่ฝั่งไคลเอนต์ ดังนั้นควรตรวจสอบให้แน่ชัดในเอกสารฉบับปัจจุบันก่อนจะนำไปตั้งงบประมาณ — หน้าโมเดลของเราเองสำหรับ code>deepseek/deepseek-v4.1-flash/code> ก็ระบุไว้เช่นเดียวกันว่า อัตราอินพุตที่แคชไว้เป็นไปตามข้อกำหนดของผู้ให้บริการ
หากคุณไม่อยากเพิ่มการสมัครใช้งานที่สองเพื่อประเมินโมเดล ไอดีเดียวกันนี้สามารถเข้าถึงได้ผ่าน เอนด์พอยต์ที่เข้ากันได้กับ OpenAI เพียงแห่งเดียวซึ่งอยู่ด้านหน้าแค็ตตาล็อกทั้งหมดของเรา ในอัตราของผู้ให้บริการ โดยมี มาร์กอัป 0% — ดังนั้นการเปลี่ยนแปลงราคาจากฝั่ง DeepSeek จะมีผลที่นี่ภายในวันเดียวกัน แทนที่จะเป็นตอนปรับราคาครั้งถัดไป สิ่งนี้สำคัญที่สุดสำหรับสถานการณ์ที่บทความนี้อธิบายไว้พอดี: โมเดลที่มีแนวโน้มซึ่งมีการบันทึกไว้ว่าจะทำต่อไปเรื่อย ๆ บนเส้นทางที่คุณยังประเมินไม่เสร็จ การมีเชนสำรองหมายความว่าเทิร์นที่ผิดพลาดจะถูกส่งต่อไปยังโมเดลอื่นก่อนที่การตอบกลับจะเริ่มต้น แทนที่จะทำให้คำขอล้มเหลว
552B, 748B หรือ 763B — คำถามเรื่องขนาดยังเปิดกว้างอย่างแท้จริง
อย่าพูดซ้ำว่าจำนวนพารามิเตอร์ของโมเดลนี้เป็นที่ยุติแล้ว เพราะมีตัวเลขที่แตกต่างกันสามจำนวนแพร่หลายอยู่ และไม่มีจำนวนใดที่ผิดไปเสียทั้งหมด
การ์ดโมเดลของ DeepSeek เองอธิบายว่าเป็นโมเดลที่มี "พารามิเตอร์แกนหลัก 552B" และนั่นคือตัวเลขที่ผู้ขายรายงาน — มันยังเป็นตัวเลขที่แสดงอยู่ในแผงสเปกบนหน้าโมเดลของเราเองด้วย การ์ดเดียวกันยังแยกระบุโมดูล "Engram conditional memory" ที่มีพารามิเตอร์ 196B ซึ่ง "เข้าถึงแบบเบาบางผ่านการค้นหาตามโทเคน" เมื่อบวกทั้งสองเข้าด้วยกันจะได้ 748B ซึ่งเป็นเลขคณิตที่การวิเคราะห์โดยชุมชนได้ข้อสรุปภายในไม่กี่ชั่วโมงหลังเปิดตัว และเมทาดาทาของไฟล์ในรีโพซิทอรีโมเดลเดียวกันระบุขนาดโมเดลไว้ที่พารามิเตอร์ 763B ซึ่งเป็นตัวเลขที่สามอีกครั้ง
ข้อโต้แย้งที่ดูเหมือนเกิดขึ้นเป็นเรื่องของนิยามมากกว่าจะเป็นความขัดแย้งกันเอง พารามิเตอร์ Engram ที่ค้นหามาได้ (looked-up) กินหน่วยความจำแต่แทบไม่ใช้การคำนวณต่อโทเคน ในขณะที่พารามิเตอร์ backbone ที่คำนวณขึ้นมากินเวลาในทุกโทเคน — ซึ่งนี่คือเหตุผลที่ผู้ขายรายงานแยกกัน และเป็นเหตุผลว่าทำไมการเปรียบเทียบตัวเลขพาดหัวของสองโมเดลที่มีสถาปัตยกรรมต่างกันจึงบอกอะไรได้น้อยมาก
สิ่งที่แทบไม่มีใครโต้แย้งอย่างจริงจังคือจำนวนพารามิเตอร์ที่ใช้งานจริง: ประมาณ 8B ต่อโทเคนในช่วง prefill และ 16B ในช่วง decode ซึ่งเป็นตัวเลขที่กำหนดต้นทุนการอนุมานจริง ๆ น้ำหนักโมเดลเปิดเผยภายใต้สัญญาอนุญาต MIT หากคุณต้องการตรวจสอบเรื่องใด ๆ เหล่านี้ด้วยตัวเอง ให้ถือว่า 552B เป็นตัวเลขที่ผู้ขายรายงาน 748B เป็นยอดรวมจากชุมชนที่น่าเชื่อถือ และข้ออ้างใด ๆ ว่าคำถามเรื่องขนาดได้ข้อยุติแล้วถือว่าเร็วเกินไป

สิ่งที่ต้องทำก่อนวันที่ 20
ถ้าคุณจะลองใช้ DeepSeek V4.1 Flash ในเอเจนต์เขียนโค้ด ลำดับที่ใช้เวลาน้อยที่สุดคือ: เลือกฮาร์เนสก่อน จากนั้นกำหนดระดับความพยายาม แล้วจึงวัดผล
ในส่วนของ harness สรุปอย่างตรงไปตรงมาของการตรวจสอบวันนี้ก็คือ ทั้งสามเส้นทางใช้งานได้ และแตกต่างกันตรงสิ่งที่แต่ละเส้นทางเรียกร้องจากคุณ OpenCode Go เป็นการสมัครสมาชิกราคา $10 ต่อเดือน พร้อมตัวคูณโปรโมชันที่หมดอายุในวันที่ 20 กันยายน และการตั้งค่าคือ code>/connect/code> บวกกับ code>/models/code> โดยไม่ต้องแก้ไฟล์ใด ๆ Command Code แสดงโมเดลแบบเรียลไทม์ในแคตตาล็อกของตัวเอง สลับด้วย code>/model <id>/code> และเปิดให้ตั้งค่า effort เป็นคำสั่งระดับแรก Claude Code เข้าถึงได้ผ่านเส้นทาง validated-clients ของ OpenCode Go — ซึ่งไม่ต้องใช้ตัวห่อ header แบบกำหนดเอง — หรือเชื่อมตรงกับ endpoint รูปแบบ Anthropic ของ DeepSeek ซึ่งความขัดแย้งเรื่อง effort ของ subagent คือจุดขรุขระที่เป็นที่รู้กัน
เรื่อง effort ให้ตั้งค่ามันอย่างชัดเจนและตั้งให้ค่อนข้างต่ำ: high หรือค่าเริ่มต้นของโมเดล ถ้าหาก high คือค่าที่ได้จริง และไม่ใช่ max จากนั้นให้ยืนยันว่ามันออกจากเครื่องของคุณไปแล้ว เพราะมีการพบว่า harness สองตัวปล่อยให้มันหลุดหายไป
ในการวัด ให้ดูที่โทเคนเอาต์พุตแทนเวลานาฬิกา ความเยิ่นเย้อคือต้นทุน ปุ่มปรับความพยายามคือตัวควบคุม และตารางเวลาช่วงพีกคือความบังเอิญด้านเขตเวลาที่คุณหลีกเลี่ยงได้ฟรี
และสำหรับข้ออ้างเรื่องขนาดที่คุณจะเห็นถูกยกมาอ้างกับคุณในสัปดาห์นี้ — 552B, 748B, 763B — คำตอบที่มีประโยชน์คือ ผู้ขายรายงานเฉพาะ backbone ของตน ชุมชนเป็นฝ่ายเพิ่มโมดูลหน่วยความจำ และข้อมูลเมตาของ repository ก็บอกเป็นอย่างอื่นอีก ใครก็ตามที่นำตัวเลขใดตัวเลขหนึ่งในนั้นมาเสนอเป็นคำตอบที่ยุติแล้ว ก็แค่เลือกตัวเลขมาใช้ ไม่ได้ตรวจสอบมัน
