
Ling-3.1-flash เทียบกับ DeepSeek V4.1 Flash: สองจุดบนดัชนี ค่าใช้จ่ายสามเท่า
- openaiใหม่OpenAI: GPT-6.1 Sol2026-09-2952ความฉลาด
- anthropicใหม่Anthropic: Claude Sonnet 5.52026-09-2856ความฉลาด
- typesafeใหม่TypeSafe: Jev 1.132026-09-24$0.04 / $0.00 ต่อ 1 ล้านโทเค็น · 151 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238ความฉลาด
- OpenAIOpenAI: GPT-6 Sol2026-09-2248ความฉลาด
- AnthropicAnthropic: Claude Opus 5.52026-09-2258ความฉลาด
- xAIGrok 4.72026-09-2146ความฉลาด
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 ต่อ 1 ล้านโทเค็น · 104 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 ต่อ 1 ล้านโทเค็น · 1202 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040ความฉลาด
- OpenAIOpenAI: GPT-6 Astra2026-09-0453ความฉลาด77การเขียนโค้ด
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241ความฉลาด76การเขียนโค้ด
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245ความฉลาด76การเขียนโค้ด
- AnthropicAnthropic: Claude Fable 5.12026-09-0153ความฉลาด82การเขียนโค้ด
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 ต่อ 1 ล้านโทเค็น · 52 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 ต่อ 1 ล้านโทเค็น · 248 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642ความฉลาด72การเขียนโค้ด
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 ต่อ 1 ล้านโทเค็น · 232 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845ความฉลาด75การเขียนโค้ด
- obsidianQwen3.8 27B2026-08-1534ความฉลาด68การเขียนโค้ด
Ling-3.1-flash และ DeepSeek V4.1 Flash (Max) ห่างกันสองจุดบนดัชนี Artificial Analysis Intelligence Index — 41 ต่อ 39 — และอยู่คนละขั้วกันโดยสิ้นเชิงในเรื่องราคา เมื่อรันการประเมินทั้งสิบรายการที่ประกอบขึ้นเป็นดัชนีนั้นกับแต่ละโมเดล Ling-3.1-flash มีค่าใช้จ่ายราว $0.99 ต่องาน เทียบกับ $0.27 ของ DeepSeek ทั้งคู่เป็นโมเดลแบบ mixture-of-experts ขนาดประมาณ 550 พันล้านพารามิเตอร์ พร้อมบริบทที่อ้างว่าอยู่ที่ 1M โทเคน ตัวหนึ่งเป็นโมเดลปิดที่รองรับเฉพาะข้อความ จากห้องแล็บ InclusionAI ของ Ant Group เปิดตัวเมื่อ 2026-10-01 และยังไม่มีการเผยแพร่น้ำหนักโมเดลหรือสัญญาอนุญาต อีกตัวเปิดให้ใช้ภายใต้ MIT ตั้งแต่ 2026-09-10 รับภาพได้เช่นเดียวกับข้อความ ทำงานบนผู้ให้บริการ 23 ราย และเป็นโมเดลที่ทีมส่วนใหญ่คงมีอยู่ในไฟล์คอนฟิกอยู่แล้ว การเปรียบเทียบนี้ไม่ใกล้เคียงกันในมิติส่วนใหญ่ คำถามที่น่าสนใจคือทำไมสองจุดนั้นถึงมีอยู่เลย
จุดที่ Ling-3.1-flash เหนือกว่าอย่างแท้จริง
มันนำอยู่ในการประเมินที่วัดการใช้งานเทอร์มินัลและการเขียนโค้ดที่ต้องรันได้จริง และส่วนต่างนี้ก็ควรค่าแก่การระบุให้ชัดเจน เพราะภาพรวมกลบมันไว้
• Terminal-Bench 4.0 — Ling-3.1-flash 0.333 เทียบกับ DeepSeek V4.1 Flash (Max) 0.268 ทั้งคู่เป็นตัวเลขที่ไม่สูงนักเมื่อเทียบเป็นค่าสัมบูรณ์ ส่วนต่างคิดเป็นหนึ่งในสี่ของคะแนน DeepSeek
• SciCode — 0.541 เทียบกับ 0.519
• การให้เหตุผลทางฟิสิกส์ของ CritPt — 0.180 เทียบกับ 0.143
• GDPval-AA งานจริงในโลกจริงแบบเอเจนต์ — 1,621.75 Elo เทียบกับ 1,600 Elo
สองในสี่แถวนั้นเป็นผลที่สูสีกันมาก อีกหนึ่งแถวเป็นการชนะแบบเฉียดฉิว และ Terminal-Bench 4.0 เป็นแถวเดียวที่ความแตกต่างจะยังคงอยู่แม้เปลี่ยน seed ลองเทียบกับจุดที่ DeepSeek ชนะ: งานความรู้แบบเอเจนต์ของ AA-Briefcase v1.1 อยู่ที่ 1,420.47 Elo เทียบกับ 1,400.35, AutomationBench-AA อยู่ที่ 0.689 เทียบกับ 0.617, การให้เหตุผลแบบบริบทยาวของ AA-LCR อยู่ที่ 0.84 เทียบกับ 0.83 และ — แถวที่สำคัญที่สุดสำหรับโปรดักชัน — AA-Omniscience อยู่ที่ −5.30 เทียบกับ +2.22 ของ Ling-3.1-flash บนตัวชี้วัดที่การ hallucination ร้ายแรงกว่าการปฏิเสธ ความแม่นยำของ DeepSeek ตรงนั้นคือ 46.4% โดยมีอัตรา hallucination 96.5% ในบรรดาคำถามที่มันตอบ ส่วน Ling-3.1-flash ตอบถูก 29.1% โดยมีอัตรา hallucination 37.9% ทั้งสองไม่ใช่โมเดลที่คุณจะเอาไปใช้กับฐานความรู้โดยไม่มี retrieval อยู่ข้างหน้า
ส่วนต่างราคามากกว่าส่วนต่างของดัชนี และไม่ใช่แค่ตารางอัตราค่าบริการ
อัตราที่พาดหัวข่าวดูเกือบจะเหมือนกันทุกประการ Artificial Analysis บันทึกทั้งสองไว้ที่ $0.30 ต่อโทเค็นอินพุตหนึ่งล้านโทเค็น ทั้งสองแตกต่างกันอย่างชัดเจนในตัวเลขอีกสองตัว:
• เอาต์พุต — Ling-3.1-flash $0.90 ต่อล้าน เทียบกับ DeepSeek V4.1 Flash (Max) $1.20 ต่อล้าน ในที่นี้ Ling-3.1-flash เป็นโมเดลที่ถูกกว่าโดยสิ้นเชิง ถึง 25%
• การอ่านแคช — Ling-3.1-flash $0.06 ต่อล้าน เทียบกับ DeepSeek V4.1 Flash (Max) $0.006 ต่อล้าน ส่วนลด 98% เมื่อเทียบกับ 80% นี่คือจุดที่ทั้งสองโมเดลไม่สามารถเทียบกันได้อีกต่อไป
อัตราค่าใช้จ่ายแบบผสมที่สัดส่วนแคชฮิต/อินพุต/เอาต์พุต 7:2:1 ออกมาอยู่ที่ $0.192 สำหรับ Ling-3.1-flash และ $0.184 สำหรับ DeepSeek V4.1 Flash (Max) — แทบไม่ต่างกัน แต่ส่วนผสมดังกล่าวเป็นสมมติฐานเกี่ยวกับวิธีที่คุณใช้โมเดล และสมมติฐานนี้มีบทบาทอย่างมาก งานใดก็ตามที่มีการใช้พรอมป์ตซ้ำมาก ๆ — พรอมป์ตระบบที่ยาว คำนำสำหรับการดึงข้อมูล ลูปเอเจนต์ที่ส่งบริบทที่สะสมไว้ซ้ำในทุกเทิร์น — จะดันส่วนผสมที่มีผลจริงไปทางการอ่านแคช และตรงนั้นความต่าง 10 เท่าของราคาแคชจะเข้ามามีบทบาทแทน ปริมาณโทเคนก็ทบเพิ่มในลักษณะเดียวกัน: Ling-3.1-flash เป็นโมเดลให้เหตุผลที่ช่างพูด สร้างโทเคนเอาต์พุต 220 ล้านโทเคนในการประเมินดัชนี เทียบกับ 250 ล้านของ DeepSeek และใช้เวลาเฉลี่ยประมาณ 357 วินาทีต่องานประเมิน เทียบกับ 285 ของ DeepSeek มันคิดมากขึ้นต่อคำตอบและใช้เวลานานกว่าในการทำเช่นนั้น

ตัวอย่างที่ลงมือทำ: ลูปเอเจนต์เดียวกันบนทั้งสอง
สมมติเอเจนต์ที่ขับเคลื่อนด้วยเครื่องมือซึ่งรันโทเคนอินพุต 1 ล้านโทเคนต่องาน โดย 90% ของโทเคนเหล่านั้นให้บริการจากแคช และส่งคืนโทเคนเอาต์พุต 200,000 โทเคน บน Ling-3.1-flash ตามตัวเลขข้างต้น: โทเคนอินพุตที่แคชไว้ 900,000 โทเคนที่ราคา $0.06 บวกกับอินพุตใหม่ 100,000 โทเคนที่ราคา $0.30 บวกกับเอาต์พุต 200,000 โทเคนที่ราคา $0.90 รวมเป็นประมาณ $0.26 ต่องาน ลูปเดียวกันนี้บน DeepSeek V4.1 Flash (Max) คิดเป็นประมาณ $0.14 — ประมาณครึ่งหนึ่ง
ตอนนี้ให้ใช้กำหนดการของ DeepSeek เพราะนี่คือส่วนที่การเปรียบเทียบส่วนใหญ่ข้ามไป อัตราช่วงออฟพีคของ DeepSeek คืออัตราข้างต้น และออฟพีคครอบคลุมวันหยุดสุดสัปดาห์และเกือบทั้งวัน แต่ในช่วงเวลาวันธรรมดาสองช่วง คือ 01:00–04:00 และ 06:00–10:00 UTC ราคาอินพุตและแคชจะเพิ่มเป็นสองเท่า ย้ายลูปเดิมไปไว้ในช่วงพีค แล้วค่าใช้จ่ายของ DeepSeek จะอยู่ที่ประมาณ $0.28 — ณ จุดนั้น อัตราค่าบริการแบบคงที่ที่สูงกว่าของ Ling-3.1-flash กลายเป็นตัวเลือกที่ถูกกว่าสำหรับชั่วโมงนั้น และส่วนลดแคช 10 เท่าก็ถูกหักล้างด้วยเวลา
ทั้งหมดนี้คือการตัดสินใจในคู่ตัวเลขเดียว หากทราฟฟิกของเอเจนต์คุณเน้นแคชหนักและคุณจัดเวลาได้ DeepSeek V4.1 Flash (Max) มีค่าใช้จ่ายประมาณครึ่งหนึ่งของ Ling-3.1-flash สำหรับความต่างของดัชนีสองจุด หากทราฟฟิกของคุณเน้นแคชหนักและตกในช่วงเวลาพีคของ DeepSeek ทั้งสองโมเดลมีค่าใช้จ่ายใกล้เคียงกัน และผลลัพธ์ในแถว terminal-agent ที่ดีกว่าเล็กน้อยของ Ling-3.1-flash จะกลายเป็นตัวชี้ขาด
แกนที่ไม่มีการเปรียบเทียบให้ทำ
มิติทั้งสามไม่ได้ใกล้เคียงกัน และมิติเหล่านี้มักเป็นสิ่งที่ตัดสินสถาปัตยกรรมก่อนที่จะมีการพูดคุยเรื่องราคา
• น้ำหนักโมเดลและสัญญาอนุญาต — Ling-3.1-flash ยังไม่เผยแพร่น้ำหนักโมเดล ไม่มีข้อความสัญญาอนุญาต และ Artificial Analysis จัดให้เป็น proprietary ส่วน DeepSeek V4.1 Flash (Max) เป็น open weights ภายใต้ MIT ดาวน์โหลดได้จาก Hugging Face และอนุญาตให้ใช้งานเชิงพาณิชย์ได้ หนึ่งในสองตัวนี้สามารถโฮสต์เอง ไฟน์จูน และแยกออกจากเครือข่าย (air-gapped) ได้ ส่วนอีกตัวทำไม่ได้
• โมดัลลิตี้ — Ling-3.1-flash เป็นข้อความเข้า ข้อความออก DeepSeek V4.1 Flash (Max) รับภาพควบคู่กับข้อความ และถูกให้คะแนนบนเกณฑ์มาตรฐานแบบหลายรูปแบบ หากส่วนใดส่วนหนึ่งในไปป์ไลน์ของคุณส่งภาพหน้าจอ แผนภูมิ หรือเอกสารสแกนให้โมเดล การเปรียบเทียบก็จบลงตรงนั้น
• ขอบเขตการให้บริการ — DeepSeek V4.1 Flash (Max) พร้อมใช้งานผ่านผู้ให้บริการ 23 ราย รวมถึง OrcaRouter; Ling-3.1-flash ทำงานผ่าน API ของผู้ขายเองและแพลตฟอร์มบุคคลที่สามที่รองรับการเปิดตัว สำหรับเส้นทางการใช้งานจริง จำนวนผู้ให้บริการเป็นคุณสมบัติด้านความทนทานต่อความล้มเหลว ไม่ใช่การประกวดความนิยม
ความไม่สมมาตรอีกประการหนึ่งที่ไม่มีให้เห็นในรายการเหล่านั้นเลย: DeepSeek V4.1 Flash (Max) เปิดให้ใช้โทเค็นเอาต์พุตได้ 384,000 โทเค็นในการตอบกลับครั้งเดียว ขณะที่ Ant ยังไม่ได้เผยแพร่ความยาวเอาต์พุตสูงสุดสำหรับ Ling-3.1-flash ดังนั้นจึงยังไม่สามารถประเมินขนาดของเวิร์กโหลดที่ต้องสร้างข้อความยาวเทียบกับมันได้ การไม่มีเพดานที่ประกาศไว้ไม่ได้หมายความว่าเพดานจะเล็ก แต่ก็ไม่ใช่ตัวเลขที่คุณใช้อ้างอิงในการออกแบบได้เช่นกัน
{{1}}รันทั้งสองอย่าง และสิ่งที่มันดูเหมือนจริง ๆ{{/1}}
Ling-3.1-flash ไม่ได้อยู่ในแคตตาล็อกของ OrcaRouter ในวันนี้ — การค้นหาผ่าน API โมเดลสาธารณะของเราส่งคืน not-found สำหรับโมเดลภายใต้ InclusionAI และบทความนี้จะไม่แสร้งทำเป็นอย่างอื่น DeepSeek V4.1 Flash สามารถจัดเส้นทางได้ทันทีในราคาของผู้ให้บริการซึ่งเป็นราคาตามรายการโดยไม่บวกเพิ่ม ดังนั้นการเปลี่ยนแปลงราคาจากผู้ขายจะอัปเดตฝั่งเราในวันเดียวกับที่เกิดขึ้น และมันอยู่เบื้องหลังคีย์ API เดียวเดียวกันกับส่วนที่เหลือของแคตตาล็อก พร้อมการสลับไปใช้ระบบสำรองอัตโนมัติระหว่างผู้ให้บริการต้นทาง
ความไม่สมมาตรนั้นมีรูปแบบที่นำไปปฏิบัติได้จริง วิธีที่สมเหตุสมผลในการเปรียบเทียบกรณีที่โมเดลหนึ่งเป็นแบบปิด มีราคาประมาณสี่เท่าของรุ่นก่อน และเข้าถึงได้ผ่านผู้ขายรายเดียว คือการเก็บโมเดลแบบเปิดที่ให้บริการอย่างแพร่หลายไว้เป็นเส้นทางเริ่มต้น และมองผู้ท้าชิงเป็นสิ่งที่คุณทดสอบมากกว่าสิ่งที่คุณผูกมัดเลือกใช้ DeepSeek V4.1 Flash (Max) สามารถรองรับลูปโปรดักชันได้ในวันนี้ — เวตแบบเปิด อินพุตรูปภาพ เอาต์พุต 384K ส่วนลดแคช 98% — ขณะที่ Ling-3.1-flash ได้งานที่เฉพาะเจาะจงกับเอเจนต์ ซึ่งความได้เปรียบจาก Terminal-Bench และ SciCode นำมาใช้ได้จริง เพราะทั้งคู่ใช้รูปแบบ chat-completions ที่เข้ากันได้กับ OpenAI การแยกเช่นนี้จึงเป็นการตัดสินใจด้านการกำหนดเส้นทาง มากกว่าเป็นโครงการผสานรวม: ปลายทางเดียว คีย์เดียว และกฎที่ส่งงานที่แต่ละโมเดลทำได้ดีกว่าอย่างวัดผลได้ไปให้
คำตัดสิน
จากหลักฐานที่มีอยู่ DeepSeek V4.1 Flash (Max) ชนะในแมตช์นี้ และชนะด้วยปัจจัยส่วนใหญ่ที่ไม่เกี่ยวข้องกับสองคะแนนใน Index เลย ได้แก่ การเปิดน้ำหนักโมเดลภายใต้ MIT การรับอินพุตรูปภาพ โทเคนเอาต์พุต 384,000 ส่วนลดแคช 98% และผู้ให้บริการ 23 รายให้สลับสำรองระหว่างกันได้ ข้อได้เปรียบของ Ling-3.1-flash แคบกว่าแต่เป็นของจริง — มันเป็นเอเจนต์สำหรับเทอร์มินัลและเครื่องมือที่ดีกว่าของทั้งสอง และเป็นเพียงตัวเดียวในคู่นี้ที่ยังไม่ได้เผยแพร่ตารางอัตราค่าบริการซึ่งมีตัวคูณช่วงเวลาพีคฝังอยู่ในนั้น
สองสิ่งจะเปลี่ยนการประเมินนี้ หาก Ant เผยแพร่น้ำหนักภายใต้สัญญาอนุญาตแบบผ่อนปรน ช่องว่างด้านความเปิดกว้างก็จะปิดลง และการเปรียบเทียบจะกลายเป็นการพูดคุยเรื่องความสามารถและต้นทุนล้วน ๆ และหากหน้าต่างบริบทแบบยาวที่ Ant ให้บริการได้รับการยืนยันว่าอยู่ที่ 1M โทเคนตามที่ทั้งสองโมเดลประกาศไว้ ข้ออ้างเรื่องความเท่าเทียมของบริบทก็จะไม่ใช่ข้ออ้างอีกต่อไป จนกว่าจะถึงตอนนั้น สรุปที่ตรงไปตรงมาคือ โมเดลหนึ่งอาจชนะในแถวหนึ่งของเบนช์มาร์กแบบเอเจนต์ได้ แต่ก็ยังแพ้ในการประเมินอยู่ดี และช่องว่างดัชนีสองจุดระหว่างโมเดลเหล่านี้มีมูลค่าประมาณ 3.6 เท่าของต้นทุนต่องาน ซึ่งเป็นการแลกเปลี่ยนที่เฉพาะงานบางลักษณะเท่านั้นที่ควรเลือกทำ


