
ราคา DeepSeek V4.1 Flash: ตารางอัตราค่าบริการฉบับเต็ม และตัวเลข Cache-Hit ที่กำหนดค่าใช้จ่ายของคุณ
- openaiใหม่OpenAI: GPT-6 Luna2026-09-2237ความฉลาด
- openaiใหม่OpenAI: GPT-6 Sol2026-09-2248ความฉลาด
- anthropicใหม่Anthropic: Claude Opus 5.52026-09-2258ความฉลาด
- grokใหม่Grok 4.72026-09-2146ความฉลาด
- Orcaใหม่Orca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 ต่อ 1 ล้านโทเค็น · 177 tok/s
- orcaใหม่Orca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 ต่อ 1 ล้านโทเค็น · 1323 tok/s
- deepseekใหม่DeepSeek: DeepSeek V4.1 Flash2026-09-1040ความฉลาด
- openaiOpenAI: GPT-6 Astra2026-09-0453ความฉลาด77การเขียนโค้ด
- googleGoogle: Gemini 3.8 Flash2026-09-0241ความฉลาด76การเขียนโค้ด
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245ความฉลาด76การเขียนโค้ด
- anthropicAnthropic: Claude Fable 5.12026-09-0153ความฉลาด82การเขียนโค้ด
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 ต่อ 1 ล้านโทเค็น · 108 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642ความฉลาด72การเขียนโค้ด
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 ต่อ 1 ล้านโทเค็น · 220 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845ความฉลาด75การเขียนโค้ด
- obsidianQwen3.8 27B2026-08-1534ความฉลาด68การเขียนโค้ด
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236ความฉลาด69การเขียนโค้ด
- grokSpaceXAI: Grok 4.62026-08-1244ความฉลาด77การเขียนโค้ด
- metaMeta: Muse Spark 1.22026-08-0540ความฉลาด72การเขียนโค้ด
- qwenQwen: Qwen3.8 Max2026-08-0345ความฉลาด76การเขียนโค้ด
DeepSeek V4.1 Flash พร้อมใช้งานทั่วไปตั้งแต่ 2026-09-10 และ ณ วันนี้ ตารางราคาที่เผยแพร่ของมันเป็นสิ่งที่ถูกที่สุดในระดับบนสุดของตลาดโมเดล: $0.15 ต่อล้านโทเค็นอินพุต, $0.60 ต่อล้านเอาต์พุต และ $0.003 ต่อล้านสำหรับแคชฮิต ตัวเลขสามตัวนั้นคือคอลัมน์นอกช่วงพีค ในช่วงพีคของวันธรรมดาของ DeepSeek ตัวเลขทุกตัวจะเพิ่มเป็นสองเท่า รวมถึงแคชฮิตด้วย การเปรียบเทียบที่สำคัญไม่ใช่กับเรือธงที่เริ่มเก่าของ DeepSeek เอง — DeepSeek-V4-Pro-0813 ตั้งราคาไว้ที่ $0.66 / $1.98 ต่อล้านนอกช่วงพีค ดังนั้น Flash จึงตัดราคาพี่น้องของตัวเองลงประมาณ 4 เท่าในส่วนอินพุต — แต่เป็นการเปรียบเทียบกับระดับพรมแดนแบบปิดที่ผู้ซื้อใช้เทียบราคาจริง: GPT-5.6 Sol, Claude Opus 5 และ Gemini 3.8 Flash ซึ่งแต่ละตัวคิดราคาต่อโทเค็นแพงกว่าประมาณสิบเท่า
ขอแก้ไขหนึ่งจุดก่อนจะถึงตัวเลข เพราะข้อมูลรั่วที่เกิดขึ้นก่อนการเปิดตัวนี้ยังคงแพร่กระจายอยู่ ตัวเลขที่แพร่ก่อน GA ระบุว่าการลดราคาจะมีผล "พรุ่งนี้" ราคานั้นจริง แต่การนำเสนอไม่ใช่ V4.1 Flash เปิดตัวเมื่อ 2026-09-10 โดยที่อัตราเหล่านี้มีผลบังคับใช้อยู่แล้ว และบันทึกการเปลี่ยนแปลงของ DeepSeek เองระบุว่าการลดราคานี้เป็นส่วนหนึ่งของการเปิดตัวครั้งนั้น ไม่ใช่การลดราคาภายหลัง ทุกอย่างด้านล่างนี้อ่านจากหน้าตาราคาสดของ DeepSeek วันนี้ 2026-09-16
ตารางอัตราค่าบริการฉบับเต็ม ณ วันที่ 2026-09-16
DeepSeek เผยแพร่ตารางหนึ่งตารางที่ครอบคลุม SKU ปัจจุบัน โดยทุกรายการถูกแยกออกเป็นคอลัมน์ช่วงพีคและช่วงออฟพีค สำหรับรหัสโมเดล deepseek-flash ซึ่งให้บริการ DeepSeek-V4.1-Flash อัตราที่ประกาศไว้คือ:
• อินพุต, แคชมิส — 0.15 ดอลลาร์ต่อ 1M โทเคนในช่วงออฟพีค; 0.30 ดอลลาร์ต่อ 1M ในช่วงพีค
• อินพุต, แคชฮิต — $0.003 ต่อ 1 ล้านโทเคนนอกช่วงเวลาพีค; $0.006 ต่อ 1 ล้านในช่วงพีค
• เอาต์พุต — $0.60 ต่อ 1 ล้านโทเคนนอกช่วงพีค; $1.20 ต่อ 1 ล้านในช่วงพีค
• หน้าต่างบริบท — 1M โทเค็น พร้อมเอาต์พุตสูงสุด 384K
• ขีดจำกัดการทำงานพร้อมกัน — 2,500 คำขอพร้อมกันบน Flash SKU
• รหัสโมเดลรุ่นเก่า — deepseek-v4-flash และ deepseek-v4-flash-vision-exp ถูกปลดระวางในฐานะผลิตภัณฑ์แยกต่างหาก แต่ยังคงถูกกำหนดเส้นทางไปยัง V4.1 Flash โดยคิดค่าบริการในราคา Flash
ช่องว่างระหว่างสองบรรทัดแรกคือเรื่องราวทั้งหมดของชีตนี้ การแคชฮิตมีค่าใช้จ่ายน้อยกว่าการแคชมิสนอกช่วงพีคถึง 50 เท่า — ส่วนลด 98% ซึ่งเป็นวิธีที่ Artificial Analysis แสดงในโมเดลต้นทุนของตนเช่นกัน ไม่มีสิ่งอื่นใดบนการ์ดที่ทำให้บิลขยับได้ไกลขนาดนั้น


พีคไม่ใช่ความคลาดเคลื่อนจากการปัดเศษ และมันถูกกำหนดเวลาไว้สำหรับปักกิ่ง
ช่วงเวลาพีคของ DeepSeek คือวันจันทร์ถึงวันศุกร์ เวลา 01:00–04:00 UTC และ 06:00–10:00 UTC ทุกช่วงเวลานอกเหนือจากนั้น — รวมถึงชั่วโมงสุดสัปดาห์ทั้งหมด — จะคิดค่าบริการในอัตราครึ่งหนึ่ง การคูณสองมีผลกับทั้งสามรายการ ดังนั้นการพลาดแคชในช่วงพีคจึงมีค่าใช้จ่าย $0.30 และเอาต์พุตในช่วงพีคมีค่าใช้จ่าย $1.20
หน้าต่างเวลาเหล่านั้นจะตกอยู่ในช่วงใดนั้น ขึ้นอยู่กับว่าคุณอยู่ที่ใดทั้งหมด ที่ปักกิ่ง ช่วงเวลาคือ 09:00–12:00 และ 14:00–18:00 — เป็นสองช่วงทำงาน ซึ่งนั่นคือประเด็นสำคัญ ที่เบอร์ลิน ในเดือนกันยายน หน้าต่างที่สองคือ 08:00–12:00 CEST: เช้าทั้งหมดของทีมในยุโรปคือช่วงพีค ที่นิวยอร์ก หน้าต่างเดียวกันคือ 02:00–06:00 EDT ทีมที่ตั้งอยู่ในสหรัฐฯ ซึ่งทำงานตามเวลาปกติแทบจะไม่เคยถูกคิดค่าใช้จ่ายในราคาช่วงพีคเลย และทีมในสหภาพยุโรปต้องจ่ายแพงเป็นสองเท่าทุกเช้าก่อนมื้อกลางวัน หากคุณกำลังเลือกว่าจะรันงานแบบแบตช์เมื่อไร นั่นคือการตัดสินใจที่มีมูลค่า 0.15 ดอลลาร์ต่อล้านโทเค็น และการตัดสินใจนั้นไม่เสียค่าใช้จ่ายใด ๆ
สิ่งที่ราคาแบบแคชฮิตทำกับบิลของเอเจนต์จริง ๆ
การเกิดแคชฮิตเป็นไปโดยอัตโนมัติบน DeepSeek — เอกสารระบุว่าแคชดิสก์ถูกเปิดใช้งานเป็นค่าเริ่มต้นสำหรับผู้ใช้ทุกคนโดยไม่ต้องแก้ไขโค้ด — ดังนั้นส่วนลดนี้จึงไม่ใช่สิ่งที่คุณต้องออกแบบสถาปัตยกรรมมารองรับ นอกจากนี้ยังเป็นเพียงความพยายามอย่างดีที่สุด ไม่ได้รับประกัน: DeepSeek ระบุว่าไม่มี TTL คงที่ แคชที่ไม่ได้ใช้จะถูกล้าง "โดยปกติภายในไม่กี่ชั่วโมงถึงไม่กี่วัน" และระบบไม่สัญญาว่าจะมีอัตราการฮิต 100% ควรอ่านฟิลด์ของ response prompt_cache_hit_tokens และ prompt_cache_miss_tokens ก่อนที่คุณจะนำไปสร้างแบบจำลองใด ๆ จากสิ่งนี้
การคำนวณสำคัญกว่าคำคุณศัพท์ ลองใช้เอเจนต์เขียนโค้ดที่มี stable prefix ขนาด 40,000 โทเคน — system prompt, สคีมาของเครื่องมือ, บริบทของ repo — รันเป็นเซสชัน 60 เทิร์น โดยแต่ละเทิร์นจะต่อท้ายด้วยเอาต์พุตจากเครื่องมือประมาณ 2,000 โทเคน และโมเดลส่งออกประมาณ 1,200 โทเคน อินพุตรวมตลอดเซสชันคือ 5.94M โทเคน และเอาต์พุตรวม 72,000 โทเคน
คิดค่าบริการโดยไม่มีการแคชเลย ในช่วงออฟพีค: อินพุต 5.94 ล้านที่ $0.15 เป็น $0.891 บวกเอาต์พุต 72,000 ที่ $0.60 เป็น $0.043 — ประมาณ $0.93 สำหรับเซสชันนี้
เมื่อคิดค่าบริการโดยที่ prefix ถูกแคชไว้ ซึ่งเป็นสิ่งที่เกิดขึ้นจริงตามค่าเริ่มต้น: จากโทเค็นอินพุตเหล่านั้น 5.782M เข้ามาในฐานะ cache hits ในราคา $0.003 ($0.017), 158,000 เข้ามาในฐานะ cache misses ในราคา $0.15 ($0.024) และโทเค็นเอาต์พุต 72,000 โทเค็นเดิมมีค่าใช้จ่าย $0.043 ประมาณ $0.084 — ถูกกว่า�าราว 11 เท่า อินพุตลดจาก 95% ของบิลเหลือ 49% ส่วนที่เป็นแคชอย่างเดียวคิดเป็น 21% และโทเค็นเอาต์พุตกลายเป็นรายการเดียวที่ใหญ่ที่สุด โมเดลเดิม เซสชันเดิม เอาต์พุตเดิม — สิ่งเดียวที่เปลี่ยนไปคือว่า prefix ถูกนำกลับมาใช้ซ้ำหรือไม่
สังเกตว่าสิ่งที่ไม่อยู่ในชีตของ DeepSeek: รายการบรรทัดค่าธรรมเนียมการเขียนแคช Anthropic คิดค่าอินพุตฐาน 1.25 เท่าเพื่อเติมแคช 5 นาที และ 2 เท่าสำหรับหนึ่งชั่วโมง การ์ดของ DeepSeek แสดงเพียง hit และ miss และคู่มือแคชของบริษัทไม่ได้ระบุค่าธรรมเนียมการเขียนหรือการจัดเก็บใด ๆ หากคุณกำลังเปรียบเทียบเศรษฐศาสตร์ของแคชระหว่างผู้ให้บริการแทนที่จะดูอัตราโทเคนที่พาดหัว การไม่มีรายการนั้นมีค่ามากกว่าที่ส่วนลด hit 50 เท่าจะบอกเป็นนัย
นี่ก็เป็นอีกเหตุผลหนึ่งที่ทำให้รายละเอียดการส่งผ่านราคา (pass-through) ของ DeepSeek V4.1 Flash บน OrcaRouterมีความสำคัญในกรณีนี้ เราคิดค่าบริการตามราคาตามรายการของผู้ให้บริการเองโดยไม่บวกเพิ่มแม้แต่บาทเดียว ดังนั้นเมื่อผู้ให้บริการปรับราคา ฝั่งเราจะสะท้อนราคาใหม่ทันทีในวันเดียวกัน แทนที่จะต้องรอรอบการตั้งราคาใหม่ — และคอลัมน์ cache-hit กับ peak/off-peak ที่คุณเห็นด้านบนคืออัตราที่คุณถูกเรียกเก็บจริง ไม่ใช่ค่าประมาณแบบเฉลี่ยผสม

เมื่อเทียบกับ DeepSeek-V4-Pro-0813: ช่องว่าง 4 เท่า และการปลดระวางที่ไม่ได้เกิดขึ้น
การเปรียบเทียบภายในที่เห็นได้ชัดคือ SKU เรือธง และมันไม่ได้น่าตื่นเต้นเท่าที่อัตราตัวเลขพาดหัวชี้ให้เห็น DeepSeek-V4-Pro-0813 ซึ่งเป็นรหัสโมเดล deepseek-v4-proมีราคาอยู่ที่ $0.66 ต่อ 1M อินพุตเมื่อเกิด cache miss และ $1.98 ต่อ 1M เอาต์พุตในช่วงออฟพีก โดยเพิ่มเป็นสองเท่าในช่วงพีกเป็น $1.32 และ $3.96 การแคชฮิตของมันมีค่าใช้จ่าย $0.022 ในช่วงออฟพีก — มากกว่าของ Flash ถึงกว่า 7 เท่า
• อินพุตที่แคชไม่พบ — $0.15 เทียบกับ $0.66 ในช่วงออฟพีก ดังนั้น Flash จึงถูกกว่า 4.4 เท่า
• เอาต์พุต — $0.60 เทียบกับ $1.98 ในช่วงออฟพีก ดังนั้น Flash จึงถูกกว่า 3.3 เท่า
• อินพุตแบบแคชฮิต — $0.003 เทียบกับ $0.022 ช่วงออฟพีก ดังนั้น Flash จึงถูกกว่า 7.3 เท่า
• ขีดจำกัดบริบทและเอาต์พุต — เหมือนกันที่ 1M และ 384K บนทั้งสอง SKU
• การทำงานพร้อมกัน — 2,500 บน Flash เทียบกับ 500 บน V4 Pro ความต่าง 5 เท่าที่ไม่ปรากฏอยู่ในตารางราคาเลย
มีสามเรื่องเกี่ยวกับการเปรียบเทียบนี้ที่เข้าใจผิดได้ง่าย เรื่องแรก ข้อโต้แย้งเรื่องการใช้ซ้ำ (reuse) มีน้ำหนักกว่าในรุ่นเรือธงเมื่อคิดเป็นค่าสัมบูรณ์ ถึงแม้ Flash จะมีตัวคูณที่สูงกว่า เพราะการแคชหนึ่งล้านโทเคนช่วยประหยัดได้ $0.638 บน V4 Pro และ $0.147 บน Flash เนื่องจากอัตราการพลาดแคช (miss rate) ของรุ่นเรือธงสูงกว่ามากตั้งแต่แรกอยู่แล้ว เรื่องที่สอง โมเดลที่ทุกคนคาดว่าจะถูกยกเลิกไปแล้วกลับไม่ได้เป็นเช่นนั้น: DeepSeek ประกาศว่าจะหยุดให้บริการ V4 Pro ในวันที่ 2026-09-14 และเปลี่ยนเส้นทางคำขอเหล่านั้นไปยัง Flash ซึ่งจุดกระแสต่อต้านจากนักพัฒนาเรื่องการสลับโมเดลแบ็กเอนด์ใต้เวิร์กโฟลว์โปรดักชัน แล้วก็กลับคำตัดสินนั้นเมื่อวันที่ 2026-09-11 ปัจจุบัน V4 Pro ยังคงให้บริการอยู่ โดยคิดค่าบริการเท่าเดิม เรื่องที่สาม และนี่คือกับดักที่การรายงานข่าวหลุดเดินตกลงไป — ไม่มี V4.1 Pro ที่เปิดตัวออกมาแล้ว DeepSeek-V4-Pro-0813 ยังคงเป็น SKU เรือธง และผู้ขายยังไม่ได้ส่งมอบรุ่นสืบทอดภายใต้ชื่อนั้น ใครก็ตามที่ตั้งราคาการย้ายไปยัง "V4.1 Pro" กำลังตั้งราคาให้กับโมเดลที่ไม่มีอยู่จริง
เทียบกับระดับฟรอนเทียร์แบบปิด
เมื่อเทียบกับโมเดลปิดที่ผู้ซื้อนำมาเป็นตัวเลือกจริง ๆ แล้ว ตัวคูณคือประเด็นหลัก ตัวเลขทั้งหมดด้านล่างนี้มาจากหน้าราคาที่ผู้ขายแต่ละรายเผยแพร่เอง ณ วันนี้
• GPT-5.6 Sol — มีราคาตั้งที่ $5.00 ต่ออินพุต 1M และ $30.00 ต่อเอาต์พุต 1M บนระดับบริบทสั้นของ OpenAI โดยปัจจุบันมีเรตโปรโมชัน $4.00 / $20.00 ซึ่ง OpenAI ระบุว่ามีให้ใช้อย่างน้อยถึง 2026-11-21 พร้อมอินพุตแบบแคชที่ $0.40 เมื่อเทียบกับเรตโปรโมชัน DeepSeek V4.1 Flash ถูกกว่า 26.7 เท่าในด้านอินพุต และ 33.3 เท่าในด้านเอาต์พุต เมื่อเทียบกับราคาตั้ง 33 เท่าและ 50 เท่า ค่า cache hit ของ Sol คิดเป็น 133 เท่าของ Flash
• Claude Opus 5 — ราคา 5.00 ดอลลาร์ต่อ 1M ขาเข้า และ 25.00 ดอลลาร์ต่อ 1M ขาออก โดยแคชฮิตอยู่ที่ 0.50 ดอลลาร์ต่อ 1M ในเอกสารราคาที่เผยแพร่ของ Anthropic นั่นคิดเป็น 33 เท่าของอัตราขาเข้าของ Flash, 42 เท่าของอัตราขาออก และ 167 เท่าของอัตราแคชฮิต แคชเขียนอายุ 5 นาทีของ Anthropic ยังเพิ่มอีก 1.25 เท่าทับเข้าไป ส่วนเอกสารของ DeepSeek ไม่มีบรรทัดที่เทียบเท่ากัน
• Gemini 3.8 Flash — $0.75 ต่อ 1M อินพุต และ $3.75 ต่อ 1M เอาต์พุต ถึงวันที่ 2026-12-31 โดยอัตราทั้งสองมีกำหนดจะเพิ่มเป็นสองเท่าในวันที่ 2027-01-01 อินพุตที่แคชไว้ราคา $0.075 และ — นี่คือบรรทัดที่ปรากฏซ้ำบนบิลจริง — แคชสตอเรจ ในราคา $0.50 ต่อ 1M โทเคนต่อชั่วโมง Flash ถูกกว่าถึง 5 เท่าสำหรับอินพุต 6.25 เท่าสำหรับเอาต์พุต และ 25 เท่าสำหรับแคชฮิตเมื่อเทียบกับมัน และ DeepSeek ไม่คิดค่าใช้จ่ายใด ๆ ในการเก็บแคช
บริบทด้านขีดความสามารถคือสิ่งที่ทำให้เรื่องนี้ซื่อตรง บน Intelligence Index v4.3 ของ Artificial Analysis, DeepSeek V4.1 Flash (reasoning, max effort) ได้คะแนน 40 และอยู่อันดับ 6 จาก 113 โมเดล ด้วยราคา $0.27 ต่อหนึ่งงานในดัชนี และ 214.4 โทเคนเอาต์พุตต่อวินาที นั่นเป็นตำแหน่งที่ใกล้ระดับแนวหน้าจริง ๆ ในราคาที่ต่ำกว่าระดับชั้นที่นำมาเปรียบเทียบด้วยกันถึง 26 เท่า — แต่การวัดเดียวกันแสดงว่ามันเป็นหนึ่งในโมเดลที่เขียนเยอะที่สุดเท่าที่ AA เคยทดสอบ โดยสร้างโทเคนเอาต์พุต 250 ล้านโทเคนตลอดการรันดัชนี เทียบกับค่ามัธยฐานที่ 140 ล้าน ความยืดยาวไม่ได้เปลี่ยนราคาต่อโทเคน แต่เปลี่ยนบิล โมเดลที่เขียนโทเคนมากกว่าค่ามัธยฐาน 62% ยังมีค่าใช้จ่ายต่ำกว่ามากในที่นี้ แต่ “ถูกต่อโทเคน” กับ “ถูกต่องาน” เป็นข้ออ้างที่ต่างกัน และมีเพียงข้อหลังเท่านั้นคือสิ่งที่คุณจ่ายจริง
มีแพ็กเกจฟรีไหม
ไม่ หน้าค่าบริการของ DeepSeek เองไม่ได้ระบุว่ามีแพ็กเกจ API ฟรี ไม่มีโควต้ารายเดือนฟรี และไม่มีโมเดลฟรี — การคิดค่าบริการเป็นแบบจ่ายตามการใช้งานจริงจากยอดคงเหลือที่เติมไว้หรือยอดที่ได้รับมอบให้ โดยจะใช้ยอดที่ได้รับมอบให้ก่อน แอปแชตสำหรับผู้ใช้ทั่วไปนั้นฟรี ส่วน API ที่อยู่เบื้องหลัง deepseek-flash นั้นไม่ฟรี และไม่มีเอนด์พอยต์ฟรีสำหรับโมเดลนี้บนแพลตฟอร์มของ DeepSeek เกตเวย์ของบุคคลที่สามหลายแห่งโฆษณาการเข้าถึงโมเดลนี้แบบฟรีหรือแบบทดลอง และเราจะถือว่าทั้งหมดนั้นเป็นช่องทางสำหรับการสร้างต้นแบบมากกว่าจะเป็นแบ็กเอนด์สำหรับงานโปรดักชัน เพราะข้อกำหนดเหล่านั้นเปลี่ยนแปลงได้โดยไม่ต้องแจ้งให้ทราบ และไม่มีเจ้าใดที่มีตารางอัตราค่าบริการของผู้ให้บริการต้นทาง
คำกล่าวอ้างเรื่องประสิทธิภาพที่อยู่เบื้องหลังราคา
ราคานี้ไม่ใช่การอุดหนุน อย่างน้อยก็ตามคำชี้แจงของ DeepSeek เอง การ์ดโมเดลและรายงานทางเทคนิคของผู้จำหน่ายอธิบายว่า V4.1 Flash เป็นโมเดลผสมผู้เชี่ยวชาญ (mixture-of-experts) ขนาด 552B พารามิเตอร์ บนโครงร่างแบบ Causal Encoder-Decoder ที่เปิดใช้งานพารามิเตอร์ประมาณ 8B ต่อโทเคนระหว่าง prefill และ 16B ระหว่าง decode — ไม่สมมาตรโดยการออกแบบ อ่านได้ถูกกว่าและเขียนได้แพงกว่า ในด้านหน่วยความจำ DeepSeek รายงานว่า global KV cache อยู่ที่ประมาณ 890 ไบต์ต่อโทเคน หรือประมาณหนึ่งในสี่ของ DeepSeek-V4-Flash และมี persistent cache footprint ประมาณหนึ่งในแปดของรุ่นนั้นภายใต้ภาระงานเดียวกัน ซึ่งทำได้โดยทิ้ง sliding-window state และเล่นซ้ำ 128 โทเคนสุดท้ายเมื่อเกิด hit ค่าเหล่านี้เป็นค่าที่ผู้จำหน่ายรายงานบนฮาร์ดแวร์ของผู้จำหน่ายเอง และรายงานทางเทคนิคไม่ได้อ้างความสมมูลทางคณิตศาสตร์กับการคำนวณเต็มรูปแบบสำหรับเส้นทาง replay
จำนวนพารามิเตอร์เป็นตัวเลขเดียวในรีลีสนี้ที่ยังไม่นิ่งอย่างแท้จริง และน่าจะคุ้มที่จะพูดให้ชัดว่าเพราะเหตุใด ข้อความบรรยายของ DeepSeek รายงานไว้ที่ 552B และนั่นคือแบ็กโบน — ส่วนที่ทำการประมวลผล วางอยู่เคียงข้างกันคือ Engram ตารางค้นหาหน่วยความจำแบบมีเงื่อนไขที่โมเดลการ์ดระบุขนาดไว้ที่ 196B พารามิเตอร์ ซึ่งเข้าถึงผ่านการค้นหาด้วยโทเคนแทนที่จะคำนวณผ่านตัวมัน เมื่อบวกเข้าด้วยกันจะได้ราว 748B ซึ่งเป็นตัวเลขที่บทวิเคราะห์ชุมชนซึ่งมีผู้อ่านมากบน r/LocalLLaMA เถียงกันภายในไม่กี่ชั่วโมงหลังจากเวทถูกปล่อยออกมา และเป็นตัวเลขที่แผงไฟล์ของที่เก็บ Hugging Face ดันให้สูงขึ้นไปอีก ไปทาง 763B บทความเล่าการดีพลอยของชุมชนนับเช็กพอยต์ได้ประมาณ 510 GB กระจายอยู่ 48 แชร์ด ส่งมาแบบควอนไทซ์ตั้งแต่ต้นเป็นเวทหนาแน่น FP8 พร้อมเอ็กซ์เพิร์ต FP4 ให้ถือว่ายอดรวมยังเป็นที่โต้แย้ง และตัวเลขแบ็กโบนเป็นข้อมูลที่ผู้ขายรายงานเอง จำนวนพารามิเตอร์ที่แอ็กทีฟคือตัวที่ขับเคลื่อนความเร็ว ส่วนเวทที่ต้องพำนักอยู่ในหน่วยความจำคือตัวที่ตัดสินว่าโมเดลจะสตาร์ตได้หรือไม่เลย
การโฮสต์เองเป็นทางเลือกจริงแทนราคานี้ ภายใต้ MIT
น้ำหนักโมเดลอยู่ที่ deepseek-ai/DeepSeek-V4.1-Flashภายใต้สัญญาอนุญาต MIT ซึ่งอนุญาตให้ใช้เชิงพาณิชย์ ดัดแปลง และเผยแพร่ต่อได้ สิ่งนี้ทำให้เรตการใช้งาน API เป็นทางเลือกมากกว่าจะเป็นค่าผ่านทาง: ด้วย MIT ไม่มีอะไรในสัญญาอนุญาตที่ห้ามคุณให้บริการโมเดลนี้ด้วยตัวเอง และจ่ายค่าการประมวลผลแทนการจ่ายต่อโทเคน
มันไม่ได้ทำให้การทำเช่นนี้มีต้นทุนต่ำ เช็กพอยต์มีเวทที่ต้องคงอยู่ในหน่วยความจำราว 510 GB ก่อนรวมแคชและแอกติเวชัน DeepSeek ไม่ได้ระบุข้อกำหนด GPU ไว้ที่ใดเลยในรีพอซิทอรี และบทความการติดตั้งใช้งานจากคอมมูนิตี้ระบุว่าระดับขั้นต่ำที่ใช้ได้จริงคือโหนดหลาย GPU ไม่ใช่เวิร์กสเตชัน สแตกสำหรับให้บริการสามตัวปล่อยการรองรับตั้งแต่วันแรกเมื่อ 2026-09-10 — vLLM, SGLang with Miles และ NeuWare ของ Cambricon ที่อิง vLLM สำหรับแอกเซลเลอเรเตอร์ของตัวเอง — แต่วันเปิดตัว vLLM และ SGLang กลับปล่อยอิมเมจพรีวิวเฉพาะ แทนที่จะเป็นแพ็กเกจอย่างเป็นทางการ และ llama.cpp ยังไม่ได้ผสานการรองรับสถาปัตยกรรม V4.1 การโฮสต์เองบนฮาร์ดแวร์ระดับผู้บริโภคไม่ใช่ทางเลือกแทนราคา API ในวันนี้ การเช่าโหนด 8 GPU ต่างหากคือทางเลือกนั้น ถ้าปริมาณของคุณมากพอที่จะเฉลี่ยต้นทุนนั้นได้ ใบอนุญาตก็ให้คุณทำได้ ถ้าไม่มากพอ $0.15 ต่อล้านโทเคนคือคำตอบที่ถูกกว่า และไม่ได้ใกล้เคียงเลย
สิ่งที่เรตการ์ดจริง ๆ ต้องการให้คุณตัดสินใจ
สามเรื่อง เรียงตามปริมาณเงินที่มันช่วยประหยัด เก็บ prompt prefix ให้คงที่ แล้วปล่อยให้แคชทำงานของมัน — มันทำงานอัตโนมัติ มันคือส่วนลด 50 เท่า และในลูปเอเจนต์ 60 เทิร์น มันเปลี่ยนเซสชันราคา $0.93 ให้กลายเป็น $0.084 รันทราฟฟิกแบบแบตช์ของคุณนอกช่วง 01:00–04:00 และ 06:00–10:00 UTC ในวันธรรมดา ซึ่งสำหรับทีมในสหรัฐฯ แทบไม่มีผลอะไร และสำหรับทีมในยุโรปหมายถึงการย้ายงานตอนเช้าไปเป็นตอนบ่าย และถ้าคุณกำลังเทียบราคาสิ่งนี้กับ flagship ของ DeepSeek เอง จำไว้ว่า flagship ยังอยู่ระหว่างโปรโมชัน — การเลิกใช้ตามกำหนดการถูกยกเลิกไปเมื่อ 2026-09-11 ทั้งสอง SKU อยู่เบื้องหลังคีย์เดียวและการสลับระหว่างสองตัวนี้เป็นการเปลี่ยน model-id ไม่ใช่การโยกย้ายระบบ
สิ่งที่ตารางอัตราค่าใช้จ่ายไม่ได้บอกคุณคือ โมเดลนี้ดีพอสำหรับภาระงานของคุณหรือไม่ และตัวเลขสำหรับเรื่องนั้นใหม่กว่าและมีน้อยกว่าแผ่นราคา การจัดอันดับในดัชนีของ Artificial Analysis เป็นการวัดเพียงครั้งเดียวที่ระดับความพยายามในการให้เหตุผลสูงสุด แถวเกณฑ์มาตรฐานที่ผู้ขายรายงานเองเป็นข้อมูลจากผู้ขาย และจำนวนพารามิเตอร์ยังเป็นที่ถกเถียง ราคาเป็นส่วนที่นิ่งแล้วของการเปิดตัวครั้งนี้ จงประเมินค่าใช้จ่ายในการย้ายระบบของคุณจากราคานี้ และทดสอบความสามารถก่อนที่คุณจะตัดสินใจใช้มัน
การเปรียบเทียบในบทความนี้4
ตรวจพบจากบทความนี้ · เบนช์มาร์ก: Artificial Analysis · อัปเดตทุกวัน
