การ์ดชื่อเรื่องหลักสำหรับ 'Ling-3.1-flash vs DeepSeek V4.1 Flash' พร้อมคำบรรยายใต้ชื่อว่า 'ดัชนีต่างกันสองจุด แต่ค่าบิลสามเท่า' การ์ดมุมมนสองใบวางเคียงข้างกันโดยมีช่องว่างระหว่างกันชัดเจน: ใบซ้าย ติดป้ายว่า 'Ling-3.1-flash' แสดงข้อความ 'ดัชนี AA: 41', 'ค่าใช้จ่ายต่องาน: $0.99', 'น้ำหนักโมเดล: ปิด'; ใบขวา ติดป้ายว่า 'DeepSeek V4.1 Flash (Max)' แสดงข้อความ 'ดัชนี AA: 39', 'ค่าใช้จ่ายต่องาน: $0.27', 'น้ำหนักโมเดล: MIT' บรรทัดท้ายระบุว่า 'ค่าใช้จ่ายและตัวเลขดัชนีอ้างอิงจาก Artificial Analysis' โลโก้ OrcaRouter ถูกคอมโพสิตไว้ที่มุมล่างขวา
Guides & Insights

Ling-3.1-flash เทียบกับ DeepSeek V4.1 Flash: สองจุดบนดัชนี ค่าใช้จ่ายสามเท่า

ผู้เขียน

Elias Hawthorne

วันที่เผยแพร่

โมเดลล่าสุด · 20ดูโมเดลทั้งหมด →
เบนช์มาร์ก: Artificial Analysis · อัปเดตทุกวัน
กลับไปยังโพสต์ทั้งหมด

Ling-3.1-flash และ DeepSeek V4.1 Flash (Max) ห่างกันสองจุดบนดัชนี Artificial Analysis Intelligence Index — 41 ต่อ 39 — และอยู่คนละขั้วกันโดยสิ้นเชิงในเรื่องราคา เมื่อรันการประเมินทั้งสิบรายการที่ประกอบขึ้นเป็นดัชนีนั้นกับแต่ละโมเดล Ling-3.1-flash มีค่าใช้จ่ายราว $0.99 ต่องาน เทียบกับ $0.27 ของ DeepSeek ทั้งคู่เป็นโมเดลแบบ mixture-of-experts ขนาดประมาณ 550 พันล้านพารามิเตอร์ พร้อมบริบทที่อ้างว่าอยู่ที่ 1M โทเคน ตัวหนึ่งเป็นโมเดลปิดที่รองรับเฉพาะข้อความ จากห้องแล็บ InclusionAI ของ Ant Group เปิดตัวเมื่อ 2026-10-01 และยังไม่มีการเผยแพร่น้ำหนักโมเดลหรือสัญญาอนุญาต อีกตัวเปิดให้ใช้ภายใต้ MIT ตั้งแต่ 2026-09-10 รับภาพได้เช่นเดียวกับข้อความ ทำงานบนผู้ให้บริการ 23 ราย และเป็นโมเดลที่ทีมส่วนใหญ่คงมีอยู่ในไฟล์คอนฟิกอยู่แล้ว การเปรียบเทียบนี้ไม่ใกล้เคียงกันในมิติส่วนใหญ่ คำถามที่น่าสนใจคือทำไมสองจุดนั้นถึงมีอยู่เลย

จุดที่ Ling-3.1-flash เหนือกว่าอย่างแท้จริง

มันนำอยู่ในการประเมินที่วัดการใช้งานเทอร์มินัลและการเขียนโค้ดที่ต้องรันได้จริง และส่วนต่างนี้ก็ควรค่าแก่การระบุให้ชัดเจน เพราะภาพรวมกลบมันไว้

• Terminal-Bench 4.0 — Ling-3.1-flash 0.333 เทียบกับ DeepSeek V4.1 Flash (Max) 0.268 ทั้งคู่เป็นตัวเลขที่ไม่สูงนักเมื่อเทียบเป็นค่าสัมบูรณ์ ส่วนต่างคิดเป็นหนึ่งในสี่ของคะแนน DeepSeek

• SciCode — 0.541 เทียบกับ 0.519

• การให้เหตุผลทางฟิสิกส์ของ CritPt — 0.180 เทียบกับ 0.143

• GDPval-AA งานจริงในโลกจริงแบบเอเจนต์ — 1,621.75 Elo เทียบกับ 1,600 Elo

สองในสี่แถวนั้นเป็นผลที่สูสีกันมาก อีกหนึ่งแถวเป็นการชนะแบบเฉียดฉิว และ Terminal-Bench 4.0 เป็นแถวเดียวที่ความแตกต่างจะยังคงอยู่แม้เปลี่ยน seed ลองเทียบกับจุดที่ DeepSeek ชนะ: งานความรู้แบบเอเจนต์ของ AA-Briefcase v1.1 อยู่ที่ 1,420.47 Elo เทียบกับ 1,400.35, AutomationBench-AA อยู่ที่ 0.689 เทียบกับ 0.617, การให้เหตุผลแบบบริบทยาวของ AA-LCR อยู่ที่ 0.84 เทียบกับ 0.83 และ — แถวที่สำคัญที่สุดสำหรับโปรดักชัน — AA-Omniscience อยู่ที่ −5.30 เทียบกับ +2.22 ของ Ling-3.1-flash บนตัวชี้วัดที่การ hallucination ร้ายแรงกว่าการปฏิเสธ ความแม่นยำของ DeepSeek ตรงนั้นคือ 46.4% โดยมีอัตรา hallucination 96.5% ในบรรดาคำถามที่มันตอบ ส่วน Ling-3.1-flash ตอบถูก 29.1% โดยมีอัตรา hallucination 37.9% ทั้งสองไม่ใช่โมเดลที่คุณจะเอาไปใช้กับฐานความรู้โดยไม่มี retrieval อยู่ข้างหน้า

ส่วนต่างราคามากกว่าส่วนต่างของดัชนี และไม่ใช่แค่ตารางอัตราค่าบริการ

อัตราที่พาดหัวข่าวดูเกือบจะเหมือนกันทุกประการ Artificial Analysis บันทึกทั้งสองไว้ที่ $0.30 ต่อโทเค็นอินพุตหนึ่งล้านโทเค็น ทั้งสองแตกต่างกันอย่างชัดเจนในตัวเลขอีกสองตัว:

• เอาต์พุต — Ling-3.1-flash $0.90 ต่อล้าน เทียบกับ DeepSeek V4.1 Flash (Max) $1.20 ต่อล้าน ในที่นี้ Ling-3.1-flash เป็นโมเดลที่ถูกกว่าโดยสิ้นเชิง ถึง 25%

• การอ่านแคช — Ling-3.1-flash $0.06 ต่อล้าน เทียบกับ DeepSeek V4.1 Flash (Max) $0.006 ต่อล้าน ส่วนลด 98% เมื่อเทียบกับ 80% นี่คือจุดที่ทั้งสองโมเดลไม่สามารถเทียบกันได้อีกต่อไป

อัตราค่าใช้จ่ายแบบผสมที่สัดส่วนแคชฮิต/อินพุต/เอาต์พุต 7:2:1 ออกมาอยู่ที่ $0.192 สำหรับ Ling-3.1-flash และ $0.184 สำหรับ DeepSeek V4.1 Flash (Max) — แทบไม่ต่างกัน แต่ส่วนผสมดังกล่าวเป็นสมมติฐานเกี่ยวกับวิธีที่คุณใช้โมเดล และสมมติฐานนี้มีบทบาทอย่างมาก งานใดก็ตามที่มีการใช้พรอมป์ตซ้ำมาก ๆ — พรอมป์ตระบบที่ยาว คำนำสำหรับการดึงข้อมูล ลูปเอเจนต์ที่ส่งบริบทที่สะสมไว้ซ้ำในทุกเทิร์น — จะดันส่วนผสมที่มีผลจริงไปทางการอ่านแคช และตรงนั้นความต่าง 10 เท่าของราคาแคชจะเข้ามามีบทบาทแทน ปริมาณโทเคนก็ทบเพิ่มในลักษณะเดียวกัน: Ling-3.1-flash เป็นโมเดลให้เหตุผลที่ช่างพูด สร้างโทเคนเอาต์พุต 220 ล้านโทเคนในการประเมินดัชนี เทียบกับ 250 ล้านของ DeepSeek และใช้เวลาเฉลี่ยประมาณ 357 วินาทีต่องานประเมิน เทียบกับ 285 ของ DeepSeek มันคิดมากขึ้นต่อคำตอบและใช้เวลานานกว่าในการทำเช่นนั้น

A two-column generated scoreboard titled 'Ling-3.1-flash vs DeepSeek V4.1 Flash — the scoreboard'. The left column, 'Ling-3.1-flash', reads 'AA Index: 41', 'Cost per task: $0.99', 'Terminal-Bench: 0.333', 'Cache read: $0.06', 'Weights: closed', 'Modality: text'; the right column, 'DeepSeek V4.1 Flash (Max)', reads 'AA Index: 39', 'Cost per task: $0.27', 'Terminal-Bench: 0.268', 'Cache read: $0.006', 'Weights: MIT', 'Modality: text + image'. A footer line reads 'Both columns per Artificial Analysis.' The OrcaRouter logo is composited in the bottom-right corner.

ตัวอย่างที่ลงมือทำ: ลูปเอเจนต์เดียวกันบนทั้งสอง

สมมติเอเจนต์ที่ขับเคลื่อนด้วยเครื่องมือซึ่งรันโทเคนอินพุต 1 ล้านโทเคนต่องาน โดย 90% ของโทเคนเหล่านั้นให้บริการจากแคช และส่งคืนโทเคนเอาต์พุต 200,000 โทเคน บน Ling-3.1-flash ตามตัวเลขข้างต้น: โทเคนอินพุตที่แคชไว้ 900,000 โทเคนที่ราคา $0.06 บวกกับอินพุตใหม่ 100,000 โทเคนที่ราคา $0.30 บวกกับเอาต์พุต 200,000 โทเคนที่ราคา $0.90 รวมเป็นประมาณ $0.26 ต่องาน ลูปเดียวกันนี้บน DeepSeek V4.1 Flash (Max) คิดเป็นประมาณ $0.14 — ประมาณครึ่งหนึ่ง

ตอนนี้ให้ใช้กำหนดการของ DeepSeek เพราะนี่คือส่วนที่การเปรียบเทียบส่วนใหญ่ข้ามไป อัตราช่วงออฟพีคของ DeepSeek คืออัตราข้างต้น และออฟพีคครอบคลุมวันหยุดสุดสัปดาห์และเกือบทั้งวัน แต่ในช่วงเวลาวันธรรมดาสองช่วง คือ 01:00–04:00 และ 06:00–10:00 UTC ราคาอินพุตและแคชจะเพิ่มเป็นสองเท่า ย้ายลูปเดิมไปไว้ในช่วงพีค แล้วค่าใช้จ่ายของ DeepSeek จะอยู่ที่ประมาณ $0.28 — ณ จุดนั้น อัตราค่าบริการแบบคงที่ที่สูงกว่าของ Ling-3.1-flash กลายเป็นตัวเลือกที่ถูกกว่าสำหรับชั่วโมงนั้น และส่วนลดแคช 10 เท่าก็ถูกหักล้างด้วยเวลา

ทั้งหมดนี้คือการตัดสินใจในคู่ตัวเลขเดียว หากทราฟฟิกของเอเจนต์คุณเน้นแคชหนักและคุณจัดเวลาได้ DeepSeek V4.1 Flash (Max) มีค่าใช้จ่ายประมาณครึ่งหนึ่งของ Ling-3.1-flash สำหรับความต่างของดัชนีสองจุด หากทราฟฟิกของคุณเน้นแคชหนักและตกในช่วงเวลาพีคของ DeepSeek ทั้งสองโมเดลมีค่าใช้จ่ายใกล้เคียงกัน และผลลัพธ์ในแถว terminal-agent ที่ดีกว่าเล็กน้อยของ Ling-3.1-flash จะกลายเป็นตัวชี้ขาด

แกนที่ไม่มีการเปรียบเทียบให้ทำ

มิติทั้งสามไม่ได้ใกล้เคียงกัน และมิติเหล่านี้มักเป็นสิ่งที่ตัดสินสถาปัตยกรรมก่อนที่จะมีการพูดคุยเรื่องราคา

• น้ำหนักโมเดลและสัญญาอนุญาต — Ling-3.1-flash ยังไม่เผยแพร่น้ำหนักโมเดล ไม่มีข้อความสัญญาอนุญาต และ Artificial Analysis จัดให้เป็น proprietary ส่วน DeepSeek V4.1 Flash (Max) เป็น open weights ภายใต้ MIT ดาวน์โหลดได้จาก Hugging Face และอนุญาตให้ใช้งานเชิงพาณิชย์ได้ หนึ่งในสองตัวนี้สามารถโฮสต์เอง ไฟน์จูน และแยกออกจากเครือข่าย (air-gapped) ได้ ส่วนอีกตัวทำไม่ได้

• โมดัลลิตี้ — Ling-3.1-flash เป็นข้อความเข้า ข้อความออก DeepSeek V4.1 Flash (Max) รับภาพควบคู่กับข้อความ และถูกให้คะแนนบนเกณฑ์มาตรฐานแบบหลายรูปแบบ หากส่วนใดส่วนหนึ่งในไปป์ไลน์ของคุณส่งภาพหน้าจอ แผนภูมิ หรือเอกสารสแกนให้โมเดล การเปรียบเทียบก็จบลงตรงนั้น

• ขอบเขตการให้บริการ — DeepSeek V4.1 Flash (Max) พร้อมใช้งานผ่านผู้ให้บริการ 23 ราย รวมถึง OrcaRouter; Ling-3.1-flash ทำงานผ่าน API ของผู้ขายเองและแพลตฟอร์มบุคคลที่สามที่รองรับการเปิดตัว สำหรับเส้นทางการใช้งานจริง จำนวนผู้ให้บริการเป็นคุณสมบัติด้านความทนทานต่อความล้มเหลว ไม่ใช่การประกวดความนิยม

ความไม่สมมาตรอีกประการหนึ่งที่ไม่มีให้เห็นในรายการเหล่านั้นเลย: DeepSeek V4.1 Flash (Max) เปิดให้ใช้โทเค็นเอาต์พุตได้ 384,000 โทเค็นในการตอบกลับครั้งเดียว ขณะที่ Ant ยังไม่ได้เผยแพร่ความยาวเอาต์พุตสูงสุดสำหรับ Ling-3.1-flash ดังนั้นจึงยังไม่สามารถประเมินขนาดของเวิร์กโหลดที่ต้องสร้างข้อความยาวเทียบกับมันได้ การไม่มีเพดานที่ประกาศไว้ไม่ได้หมายความว่าเพดานจะเล็ก แต่ก็ไม่ใช่ตัวเลขที่คุณใช้อ้างอิงในการออกแบบได้เช่นกัน

{{1}}รันทั้งสองอย่าง และสิ่งที่มันดูเหมือนจริง ๆ{{/1}}

Ling-3.1-flash ไม่ได้อยู่ในแคตตาล็อกของ OrcaRouter ในวันนี้ — การค้นหาผ่าน API โมเดลสาธารณะของเราส่งคืน not-found สำหรับโมเดลภายใต้ InclusionAI และบทความนี้จะไม่แสร้งทำเป็นอย่างอื่น DeepSeek V4.1 Flash สามารถจัดเส้นทางได้ทันทีในราคาของผู้ให้บริการซึ่งเป็นราคาตามรายการโดยไม่บวกเพิ่ม ดังนั้นการเปลี่ยนแปลงราคาจากผู้ขายจะอัปเดตฝั่งเราในวันเดียวกับที่เกิดขึ้น และมันอยู่เบื้องหลังคีย์ API เดียวเดียวกันกับส่วนที่เหลือของแคตตาล็อก พร้อมการสลับไปใช้ระบบสำรองอัตโนมัติระหว่างผู้ให้บริการต้นทาง

ความไม่สมมาตรนั้นมีรูปแบบที่นำไปปฏิบัติได้จริง วิธีที่สมเหตุสมผลในการเปรียบเทียบกรณีที่โมเดลหนึ่งเป็นแบบปิด มีราคาประมาณสี่เท่าของรุ่นก่อน และเข้าถึงได้ผ่านผู้ขายรายเดียว คือการเก็บโมเดลแบบเปิดที่ให้บริการอย่างแพร่หลายไว้เป็นเส้นทางเริ่มต้น และมองผู้ท้าชิงเป็นสิ่งที่คุณทดสอบมากกว่าสิ่งที่คุณผูกมัดเลือกใช้ DeepSeek V4.1 Flash (Max) สามารถรองรับลูปโปรดักชันได้ในวันนี้ — เวตแบบเปิด อินพุตรูปภาพ เอาต์พุต 384K ส่วนลดแคช 98% — ขณะที่ Ling-3.1-flash ได้งานที่เฉพาะเจาะจงกับเอเจนต์ ซึ่งความได้เปรียบจาก Terminal-Bench และ SciCode นำมาใช้ได้จริง เพราะทั้งคู่ใช้รูปแบบ chat-completions ที่เข้ากันได้กับ OpenAI การแยกเช่นนี้จึงเป็นการตัดสินใจด้านการกำหนดเส้นทาง มากกว่าเป็นโครงการผสานรวม: ปลายทางเดียว คีย์เดียว และกฎที่ส่งงานที่แต่ละโมเดลทำได้ดีกว่าอย่างวัดผลได้ไปให้

คำตัดสิน

จากหลักฐานที่มีอยู่ DeepSeek V4.1 Flash (Max) ชนะในแมตช์นี้ และชนะด้วยปัจจัยส่วนใหญ่ที่ไม่เกี่ยวข้องกับสองคะแนนใน Index เลย ได้แก่ การเปิดน้ำหนักโมเดลภายใต้ MIT การรับอินพุตรูปภาพ โทเคนเอาต์พุต 384,000 ส่วนลดแคช 98% และผู้ให้บริการ 23 รายให้สลับสำรองระหว่างกันได้ ข้อได้เปรียบของ Ling-3.1-flash แคบกว่าแต่เป็นของจริง — มันเป็นเอเจนต์สำหรับเทอร์มินัลและเครื่องมือที่ดีกว่าของทั้งสอง และเป็นเพียงตัวเดียวในคู่นี้ที่ยังไม่ได้เผยแพร่ตารางอัตราค่าบริการซึ่งมีตัวคูณช่วงเวลาพีคฝังอยู่ในนั้น

สองสิ่งจะเปลี่ยนการประเมินนี้ หาก Ant เผยแพร่น้ำหนักภายใต้สัญญาอนุญาตแบบผ่อนปรน ช่องว่างด้านความเปิดกว้างก็จะปิดลง และการเปรียบเทียบจะกลายเป็นการพูดคุยเรื่องความสามารถและต้นทุนล้วน ๆ และหากหน้าต่างบริบทแบบยาวที่ Ant ให้บริการได้รับการยืนยันว่าอยู่ที่ 1M โทเคนตามที่ทั้งสองโมเดลประกาศไว้ ข้ออ้างเรื่องความเท่าเทียมของบริบทก็จะไม่ใช่ข้ออ้างอีกต่อไป จนกว่าจะถึงตอนนั้น สรุปที่ตรงไปตรงมาคือ โมเดลหนึ่งอาจชนะในแถวหนึ่งของเบนช์มาร์กแบบเอเจนต์ได้ แต่ก็ยังแพ้ในการประเมินอยู่ดี และช่องว่างดัชนีสองจุดระหว่างโมเดลเหล่านี้มีมูลค่าประมาณ 3.6 เท่าของต้นทุนต่องาน ซึ่งเป็นการแลกเปลี่ยนที่เฉพาะงานบางลักษณะเท่านั้นที่ควรเลือกทำ

Screenshot of the OrcaRouter model page for deepseek/deepseek-v4.1-flash, in English, captured 2026-10-07. The page header reads 'DeepSeek V4.1 Flash', 'ctx 1M tokens', 'Max output 384K', inputs 'text + image' and output 'text', with vision, tools, JSON and reasoning capability icons and a release date of 2026-09-10. Four stat tiles read $0.15, $0.60, 1.81 s and 6.04 s. The description states the model 'accepts text and image input, carries a context window of 1,048,576 tokens, and can generate up to 384,000 tokens in a single response. OrcaRouter bills it at $0.15 per 1M input tokens and $0.60 per 1M output tokens.' A code sample shows base_url https://api.orcarouter.ai/v1 with model 'deepseek/deepseek-v4.1-flash'.Screenshot of the Artificial Analysis model page for DeepSeek V4.1 Flash (Max), in English, captured 2026-10-07, marked 'Open weights model' and 'Released September 2026'. It shows an Intelligence Index of 39, 227 output tokens per second, $0.27 cost per Intelligence Index task, 250M output tokens generated across the index, input $0.30 with a 98% cache discount and output $1.20 per 1M tokens, a 1M context window, text and image input, 552B total parameters, 16B active parameters, and a licence of MIT with weights on Hugging Face.
© 2026 OrcaRouter

สำหรับผู้ให้บริการ

ให้บริการแพลตฟอร์มการอนุมานอยู่หรือไม่ นำโมเดลของคุณขึ้น OrcaRouter

providers@orcarouter.ai

เข้าร่วมคอมมูนิตี้ของเรา

Discordsupport@orcarouter.aiXGitHubYouTube