
Ling-3.1-flash แตะ 41 คะแนนบน Artificial Analysis Intelligence Index: MoE ขนาด 560B ทำคะแนนเป็นสองเท่าของรุ่นก่อน
- openaiใหม่OpenAI: GPT-6.1 Sol2026-09-2952ความฉลาด
- anthropicใหม่Anthropic: Claude Sonnet 5.52026-09-2856ความฉลาด
- typesafeใหม่TypeSafe: Jev 1.132026-09-24$0.04 / $0.00 ต่อ 1 ล้านโทเค็น · 151 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238ความฉลาด
- OpenAIOpenAI: GPT-6 Sol2026-09-2248ความฉลาด
- AnthropicAnthropic: Claude Opus 5.52026-09-2258ความฉลาด
- xAIGrok 4.72026-09-2146ความฉลาด
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 ต่อ 1 ล้านโทเค็น · 104 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 ต่อ 1 ล้านโทเค็น · 1202 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040ความฉลาด
- OpenAIOpenAI: GPT-6 Astra2026-09-0453ความฉลาด77การเขียนโค้ด
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241ความฉลาด76การเขียนโค้ด
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245ความฉลาด76การเขียนโค้ด
- AnthropicAnthropic: Claude Fable 5.12026-09-0153ความฉลาด82การเขียนโค้ด
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 ต่อ 1 ล้านโทเค็น · 52 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 ต่อ 1 ล้านโทเค็น · 248 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642ความฉลาด72การเขียนโค้ด
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 ต่อ 1 ล้านโทเค็น · 232 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845ความฉลาด75การเขียนโค้ด
- obsidianQwen3.8 27B2026-08-1534ความฉลาด68การเขียนโค้ด
Ling-3.1-flash โมเดลแบบ mixture-of-experts ขนาด 5.6 แสนล้านพารามิเตอร์ของ Ant Group ตอนนี้มีตัวเลขที่ห้องแล็บของตัวเองไม่ได้เขียนขึ้นเอง: 41 บน Artificial Analysis Intelligence Index ดัชนีนี้ดำเนินการโดยผู้ประเมินอิสระ บนฮาร์ดแวร์ที่ผู้ประเมินเป็นผู้ควบคุม เทียบกับชุดทดสอบที่กำหนดตายตัว — และจัดให้โมเดลอยู่สูงกว่ารุ่นก่อนหน้าโดยตรงของตัวเองถึง 21 คะแนน นั่นคือ Ling-3.0-flash ซึ่งยังคงอยู่ที่ 20 บนดัชนีเดียวกัน Ant ประกาศเปิดตัว Ling-3.1-flash เมื่อปลายเดือนกันยายน 2026 ขณะที่ Artificial Analysis ระบุวันเปิดตัวเป็นวันที่ 1 ตุลาคม และมันอายุน้อยกว่าโมเดลที่มันมีคะแนนเป็นสองเท่าอยู่สามเดือน
ช่องว่างตรงนั้นแหละคือเรื่องราว การขยับ 21 จุดบนคอมโพสิตที่การประเมินสิบแบบที่แตกต่างกันป้อนเข้าด้วยกัน ไม่ใช่สิ่งที่แผนภูมิของผู้ขายจะปลอมแปลงได้ และไม่ใช่สิ่งที่บล็อกนี้จะเขียนถึงได้เมื่อสองสัปดาห์ก่อน เมื่อการวัดที่มีอยู่เพียงอย่างเดียวของ Ling-3.1-flash คือการ์ดเกณฑ์มาตรฐานของ Ant เอง: 1,673 Elo บน GDPval-AA v2.1, 75.16 บน FrontierSWE, 65.35 บน HealthBench Professional ตัวเลขเหล่านั้นเป็นข้ออ้างจริงจากห้องแล็บจริง แต่ยังไม่ถูกทำซ้ำ เลข 41 ต่างกันโดยประเภท มันเป็นตัวเลขแรกในการเปิดตัวครั้งนี้ที่บุคคลที่สามสามารถตรวจสอบยืนยันได้
สิ่งที่ 41 วัดได้จริง ๆ
Artificial Analysis Intelligence Index v4.3.2 เป็นค่าผสมแบบถ่วงน้ำหนักจากการประเมินสิบรายการ: AA-Briefcase v1.1, GDPval-AA v2.1, AutomationBench-AA, Terminal-Bench 4.0, SciCode, Humanity's Last Exam, GDP.pdf, CritPt, AA-Omniscience และ AA-LCR v1.1 การอ่านค่าผสมเพียงลำพังเป็นความผิดพลาด ดังนั้นแถวผลการประเมินรายรายการจึงสำคัญกว่าตัวเลขพาดหัว:
• GDPval-AA — 1,621.75 สำหรับ Ling-3.1-flash เทียบกับ 948.35 สำหรับ Ling-3.0-flash นี่คือการพุ่งขึ้นครั้งเดียวที่ใหญ่ที่สุดในชุด และเป็นปัจจัยที่การเคลื่อนไหวของดัชนีส่วนใหญ่ต้องพึ่งพา
• GDP.pdf — ผ่านทั้งหมด 0.100 เพิ่มขึ้นจาก 0.054 ยังคงต่ำในเชิงค่าสัมบูรณ์ แต่ก็เกือบจะเพิ่มเป็นสองเท่า
• AA-LCR v1.1 การให้เหตุผลแบบบริบทยาว — 0.83 เทียบกับ 0.73 ของรุ่นก่อน และทัดเทียมกับ DeepSeek V4.1 Flash (Max) ที่ 0.84.
• SciCode — 0.541 เทียบกับ 0.420 เป็นการเพิ่มขึ้นในด้านวิทยาศาสตร์การเขียนโค้ด ไม่ใช่การเพิ่มขึ้นของคุณภาพการสนทนา
• การใช้เหตุผลทางฟิสิกส์ของ CritPt — 0.180 เทียบกับ 0.017 ก่อนหน้านี้ เป็นสิบเท่าของรุ่นก่อนบนฐานขนาดเล็ก
• AA-Omniscience — +2.22 เทียบกับ −17.88 สำหรับ Ling-3.0-flash ตัวนี้จะกล่าวถึงด้านล่าง เพราะมันสวนทางกับพาดหัวข่าว
Ling-3.0-flash ไม่ได้แค่แพ้ Ling-3.1-flash ในแถวเหล่านี้เท่านั้น แต่มันยังล่มไปเลยในสองแถว มันได้คะแนน 0.032 บน AutomationBench-AA และ 0.000 พอดีบน Terminal-Bench 4.0 นั่นคือบริบทที่ควรใช้ตีความค่า 41 — รุ่นก่อนหน้าเป็นโมเดล open-weight ที่มีประสิทธิภาพและราคาถูก ซึ่งแทบไม่มีความสามารถด้าน agentic-terminal ใด ๆ เลย

ที่มาของผลลัพธ์: งานที่ทำโดยเอเจนต์ ไม่ใช่การสนทนา
เมื่อเทียบการมีส่วนสนับสนุนต่อดัชนีของ Ling-3.1-flash กับโมเดลระดับ Flash สองตัวที่มักถูกนำมาจัดเทียบข้างกันบ่อยที่สุด ก็จะเห็นรูปแบบหนึ่งที่ค่าภาพรวมซ่อนเอาไว้ DeepSeek V4.1 Flash (Max) ทำได้ 39 คะแนนบนดัชนีเดียวกัน และ GLM 5.3 Flash ทำได้ 42 คะแนน ทั้งสามจึงอยู่ในช่วงห่างกันสามคะแนน แต่กว่าจะไปถึงตรงนั้นได้ พวกมันมาจากคนละจุด
• งานเทอร์มินัลแบบเอเจนต์ — Ling-3.1-flash 0.333 บน Terminal-Bench 4.0, DeepSeek V4.1 Flash (Max) 0.268, GLM 5.3 Flash 0.328
• งานจริงในโลกจริงแบบเอเจนต์ — Ling-3.1-flash 1,621.75 Elo บน GDPval-AA, DeepSeek V4.1 Flash (Max) 1,600, GLM 5.3 Flash 1,646.86
• AutomationBench-AA — Ling-3.1-flash 0.617, DeepSeek V4.1 Flash (Max) 0.689, GLM 5.3 Flash 0.604
• วิทยาการเขียนโค้ด — Ling-3.1-flash 0.541 บน SciCode, DeepSeek V4.1 Flash (Max) 0.519, GLM 5.3 Flash 0.516
การตีความแบบแคบคือ Ling-3.1-flash มีความสามารถในการแข่งขันบนเกณฑ์มาตรฐานแบบเอเจนติกและนำเล็กน้อยใน SciCode การตีความที่มีประโยชน์คือมันแข็งแกร่งที่สุดในสามตัวในตัวชี้วัดแบบ agentic-terminal สองตัวที่คนส่วนใหญ่หมายถึงเมื่อพวกเขาพูดว่า "มันขับเคลื่อนลูปเครื่องมือได้หรือไม่" — และมันตามหลังทั้งสองตัวในตัวชี้วัดความน่าเชื่อถือของความรู้ นั่นคือรูปแบบเฉพาะ ไม่ใช่ชัยชนะทั่วไป และมันคุ้มค่าที่จะกล่าวถึงก่อนที่ใครจะซื้อ workload โดยดูจากตัวเลขดัชนีเพียงอย่างเดียว
บิลที่มาพร้อมกับโมเดลที่ใหญ่ขึ้น
Ling-3.0-flash ตั้งราคาไว้ที่ $0.07 ต่ออินพุตหนึ่งล้านโทเคน และ $0.22 ต่อเอาต์พุตหนึ่งล้านโทเคนบน API ของ Ant เอง และเป็นโมเดลเปิดน้ำหนักภายใต้ MIT ส่วน Ling-3.1-flash ยังไม่เป็นทั้งสองอย่างนั้น Artificial Analysis บันทึกต้นทุนการใช้งานไว้ที่ $0.30 ต่ออินพุตหนึ่งล้านโทเคน และ $0.90 ต่อเอาต์พุตหนึ่งล้านโทเคน — โดยมีอัตราแคชฮิตที่ $0.06 ซึ่งเป็นส่วนลด 80% จากราคาอินพุต — วัดเทียบกับ API ของ InclusionAI เองในฐานะผู้ให้บริการ นั่นคือราคาอินพุตที่เพิ่มขึ้นประมาณสี่เท่าเมื่อเทียบกับโมเดลที่มันแทนที่ เพื่อแลกกับคะแนนดัชนีที่เพิ่มขึ้น 21 จุด
การแลกเปลี่ยนนั้นจะดีหรือไม่นั้นขึ้นอยู่กับภาระงานทั้งหมด และดัชนีเองก็สามารถกำหนดราคาได้: การรันการประเมิน Intelligence Index ทั้งสิบรายการกับ Ling-3.1-flash มีค่าใช้จ่ายประมาณ $960 ตามอัตราเหล่านั้น เทียบกับประมาณ $477 สำหรับ DeepSeek V4.1 Flash (Max) และ $280 สำหรับ GLM 5.3 Flash เหตุผลไม่ได้อยู่ที่ตารางอัตราค่าใช้จ่ายเพียงอย่างเดียว Ling-3.1-flash เป็นตัวให้เหตุผลที่ช่างพูดมาก — มันใช้โทเค็นเอาต์พุตไป 220 ล้านโทเค็นในการทำงานกับดัชนี ซึ่งสูงกว่าค่ามัธยฐานของระดับราคาของมันมาก และการรันการประเมินของมันใช้เวลาเฉลี่ยประมาณ 357 วินาทีต่องาน เทียบกับ 285 วินาทีสำหรับ DeepSeek V4.1 Flash (Max) และ 979 วินาทีสำหรับ GLM 5.3 Flash เมื่อคิดต่องาน Ling-3.1-flash มีค่าใช้จ่ายประมาณ $0.99 เทียบกับ $0.27 ของ DeepSeek และ $0.25 ของ GLM 5.3 Flash
ไม่มีสิ่งใดในนี้ที่มองเห็นได้จาก 41 และทั้งหมดนั้นลงเอยที่ใบแจ้งหนี้ โมเดลหนึ่งอาจชนะในดัชนีแต่แพ้ในงบประมาณ
ตัวเลขสองตัวที่ขัดแย้งกับพาดหัวข่าว
ประการแรกคือความน่าเชื่อถือของความรู้ Ling-3.1-flash ได้คะแนน +2.22 บน AA-Omniscience ซึ่งวัดว่าโมเดลรู้ว่าตัวเองรู้อะไรหรือไม่: คำตอบที่ถูกต้องได้คะแนน การหลอนถูกหักคะแนน และการปฏิเสธไม่เสียคะแนน อัตราความแม่นยำของมันอยู่ที่ 29.1% และอัตราการหลอนอยู่ที่ 37.9% เมื่อวางเทียบกับโมเดลร่วมค่ายเดียวกัน นี่คือโปรไฟล์ที่อ่อนแอที่สุดในกลุ่ม — GLM 5.3 Flash ได้คะแนน +7.47 โดยมีอัตราการหลอน 27.6% และ DeepSeek V4.1 Flash (Max) ได้คะแนน −5.30 โดยมีอัตราการหลอนที่น่าตกใจถึง 96.5% ในบรรดาคำถามที่ตอบ คะแนนรวมให้รางวัล Ling-3.1-flash จากความสามารถที่มันแสดงออก ไม่ใช่จากความน่าเชื่อถือในการแสดงออก และโมเดลที่แต่งขึ้นมาหนึ่งในสามของสิ่งที่มันยืนยันจำเป็นต้องมีระบบดึงข้อมูลประกอบในการใช้งานจริง
ประการที่สองคือเรื่องบริบท Artificial Analysis ระบุว่า Ling-3.1-flash มีหน้าต่างบริบทขนาด 1,000,000 โทเคน เอกสารเปิดตัวของ Ant เองก็อ้างอิง 1M เป็นเป้าหมายเช่นกัน แต่เอกสารสำหรับนักพัฒนาของ Ant ซึ่งแจกแจงหน้าต่างบริบทของตระกูลนี้ทีละโมเดล กลับระบุว่า Ling-3.0-flash มีขนาดเนทีฟ 256K ที่ขยายได้ถึง 1M และยังไม่มีรายการสำหรับ Ling-3.1-flash เลย ส่วนแถวข้อมูลบริบทยาวอันเป็นเอกลักษณ์ที่ถูกวัดมาจริง — AA-LCR ที่ 0.83 — เป็นคะแนนการให้เหตุผลเหนือบริบทยาว ไม่ใช่การวัดหน้าต่างบริบทที่ให้บริการจริง ให้ถือว่า 1M เป็นเพดานที่ประกาศไว้ และตรวจสอบหน้าต่างบริบทที่ได้รับจริงด้วยคำขอแบบบริบทยาวของคุณเองก่อนที่จะออกแบบโดยอิงกับมัน
เทียบกันบนสเปก
ภาพแบบแยกตามมิติ โดยให้หัวข้อมาก่อน ในแต่ละบรรทัด:
• จำนวนพารามิเตอร์ทั้งหมด — Ling-3.1-flash 560B เทียบกับ DeepSeek V4.1 Flash (Max) 552B เทียบกับ GLM 5.3 Flash 320B
• พารามิเตอร์ที่แอ็กทีฟต่อโทเคน — Ling-3.1-flash 25B เทียบกับ DeepSeek V4.1 Flash (Max) 16B เทียบกับ GLM 5.3 Flash 18B Ling-3.1-flash เปิดใช้งานมากที่สุด ซึ่งเป็นเหตุผลหนึ่งที่ต้นทุนการให้บริการของมันอยู่ที่ระดับที่เป็นอยู่
• น้ำหนักและสัญญาอนุญาต — Ling-3.1-flash ไม่ได้เผยแพร่ (เป็นกรรมสิทธิ์ ไม่มีข้อความสัญญาอนุญาต) กับ DeepSeek V4.1 Flash (Max) เปิดภายใต้ MIT กับ GLM 5.3 Flash เปิดภายใต้ MIT
• บริบทที่ประกาศไว้ — Ling-3.1-flash 1M vs DeepSeek V4.1 Flash (Max) 1M vs GLM 5.3 Flash 1M ทั้งสามตัวอ้างเพดานเดียวกัน แต่มีเพียงสองตัวเท่านั้นที่มีเช็กพอยต์ให้ดาวน์โหลดเพื่อตรวจสอบยืนยันได้
• โมดัลลิตี้ — Ling-3.1-flash รับข้อความเข้า ส่งข้อความออก เทียบกับ DeepSeek V4.1 Flash (Max) ที่รับข้อความและภาพเข้า เทียบกับ GLM 5.3 Flash ที่รับข้อความ ภาพ และวิดีโอเข้า นี่คือแกนเดียวที่ Ling-3.1-flash เป็นรองอย่างแท้จริง และไม่มีแถว benchmark ใดชดเชยจุดนี้ได้
• ราคาบน API ของผู้ให้บริการ — Ling-3.1-flash $0.30 / $0.90 ต่อล้านอินพุต / เอาต์พุต เทียบกับ DeepSeek V4.1 Flash (Max) $0.30 / $1.20 เทียบกับ GLM 5.3 Flash $0.15 / $0.50
• คะแนนดัชนี — 41 เทียบกับ 39 เทียบกับ 42 ช่วงห่างสามคะแนนในการเปรียบเทียบแบบสามทางไม่ใช่การจัดอันดับ หากแต่เป็นผลเสมอที่ถูกตัดสินด้วยการประเมินใดก็ตามที่บังเอิญใกล้เคียงกับภาระงานของผู้อ่าน
ที่ที่คุณสามารถเรียกมันได้
Ling-3.1-flash ยังไม่อยู่ในแค็ตตาล็อกของ OrcaRouter ในวันนี้ — การค้นหาโมเดลภายใต้ InclusionAI ผ่าน API โมเดลสาธารณะของเราส่งคืนค่า not-found และเราจะไม่สื่อเป็นนัยว่าเป็นอย่างอื่น ปัจจุบันมันทำงานบน API ของ Ant เองและบนแพลตฟอร์มของบุคคลที่สามที่ให้บริการเวอร์ชันนี้ ซึ่งเป็นขอบเขตความพร้อมใช้งานที่มีอยู่จริงอย่างตรงไปตรงมา สิ่งที่ควรสังเกตสำหรับใครก็ตามที่กำลังเปรียบเทียบสามโมเดลข้างต้นคือ อีกสองโมเดลสามารถเราเตอร์ได้ในตอนนี้: DeepSeek V4.1 Flash และ GLM 5.3 Flash ต่างก็อยู่ในแค็ตตาล็อกของ OrcaRouter ที่ราคาตามรายการของผู้ให้บริการ โดยไม่มีมาร์กอัป ผ่านคีย์ API เดียว พร้อมการสลับไปยังระบบสำรองอัตโนมัติระหว่างกัน หากการเปรียบเทียบข้างต้นบ่งชี้ว่างานของคุณให้ความสำคัญกับความน่าเชื่อถือของความรู้มากกว่างานเทอร์มินัลแบบเอเจนต์ GLM 5.3 Flash คือตัวที่ควรลอง — และคุณสามารถลองใช้มันเทียบกับ DeepSeek V4.1 Flash บนคีย์เดียวกันได้ โดยไม่ต้องมีสัญญาที่สองหรือโค้ดไคลเอนต์ใหม่แม้แต่บรรทัดเดียว
41 เปลี่ยนอะไร และไม่เปลี่ยนอะไร
สิ่งที่มันเปลี่ยนไปคือสถานะของการเปิดตัว Ling-3.1-flash ไม่ใช่สเปกที่แนบแผนภูมิจากผู้ขายมาด้วยอีกต่อไปแล้ว แต่เป็นโมเดลที่มีตำแหน่งซึ่งวัดอย่างเป็นอิสระ และตำแหน่งนั้นคือการก้าวกระโดดข้ามรุ่นอย่างแท้จริงในความสามารถแบบเอเจนต์เมื่อเทียบกับ Ling-3.0-flash — การกระโดดแบบที่เกิดจากการเปลี่ยนการออกแบบ มากกว่าการเพิ่มพลังประมวลผลบนสูตรเดิม สิ่งที่มันไม่เปลี่ยนคือสิ่งใดก็ตามเกี่ยวกับการจัดซื้อ เวตยังปิดอยู่ สัญญาอนุญาตยังไม่ถูกเขียนขึ้น โมดัลลิตียังเป็นข้อความเท่านั้น และราคาสูงกว่ารุ่นก่อนราวสี่เท่า สำหรับประโยชน์ที่ได้ซึ่งกระจุกตัวอยู่ในงานเอเจนต์และงานเทอร์มินัล
หากงานของคุณคือลูปเอเจนต์ การขับเคลื่อนเครื่องมือ และสายโซ่เครื่องมือที่ยาว 41 คือตัวเลขที่มีความหมายที่สุดที่เปิดเผยเกี่ยวกับโมเดลนี้จนถึงตอนนี้ และมันสมควรได้รับการพิจารณาอย่างจริงจังในขณะที่ความพร้อมใช้งานยังขยายตัวอยู่ หากงานของคุณเป็นแบบมัลติโมดัล หรือการตอบคำถามที่ความรู้เป็นสิ่งสำคัญ หรือการอนุมานปริมาณสูงที่คำนึงถึงงบประมาณ 41 ไม่ตอบโจทย์ปัญหาของคุณ — และ GLM 5.3 Flash ซึ่งสามารถกำหนดเส้นทางได้แล้วและเปิดให้ใช้ภายใต้ MIT ในราคาผลลัพธ์เพียงครึ่งเดียว ถือเป็นโมเดลที่อยู่ในตำแหน่งที่ดีกว่าของทั้งสาม ดัชนีบอกคุณว่า Ling-3.1-flash อยู่ตรงไหน แต่มันไม่ได้บอกว่าคุณควรสนใจหรือไม่ และคำถามนั้นมีคำตอบอยู่ที่สิ่งที่คุณกำลังสร้าง


การเปรียบเทียบในบทความนี้1
ตรวจพบจากบทความนี้ · เบนช์มาร์ก: Artificial Analysis · อัปเดตทุกวัน
