การ์ดชื่อเรื่องหลักสำหรับ 'Ling-3.1-flash ทำคะแนนได้ 41 บน AA Intelligence Index' คำบรรยายใต้ชื่อ 'MoE รวม 560B / ใช้งาน 25B จาก Ant Group' การ์ดขอบมนขนาดใหญ่มีตัวเลข '41' พร้อมป้ายกำกับ 'Artificial Analysis Intelligence Index v4.3.2' ด้านล่างเป็นการ์ดเล็กใบที่สองที่ระบุว่า 'เทียบกับ 20' พร้อมป้ายกำกับ 'Ling-3.0-flash' บรรทัดส่วนท้ายระบุว่า 'ค่าดัชนีวัดอย่างเป็นอิสระโดย Artificial Analysis; โมเดลเปิดตัวเมื่อ 2026-10-01' โลโก้ OrcaRouter ถูกนำมาประกอบไว้ที่มุมขวาล่าง
Guides & Insights

Ling-3.1-flash แตะ 41 คะแนนบน Artificial Analysis Intelligence Index: MoE ขนาด 560B ทำคะแนนเป็นสองเท่าของรุ่นก่อน

ผู้เขียน

Rowan Sterling

วันที่เผยแพร่

โมเดลล่าสุด · 20ดูโมเดลทั้งหมด →
เบนช์มาร์ก: Artificial Analysis · อัปเดตทุกวัน
กลับไปยังโพสต์ทั้งหมด

Ling-3.1-flash โมเดลแบบ mixture-of-experts ขนาด 5.6 แสนล้านพารามิเตอร์ของ Ant Group ตอนนี้มีตัวเลขที่ห้องแล็บของตัวเองไม่ได้เขียนขึ้นเอง: 41 บน Artificial Analysis Intelligence Index ดัชนีนี้ดำเนินการโดยผู้ประเมินอิสระ บนฮาร์ดแวร์ที่ผู้ประเมินเป็นผู้ควบคุม เทียบกับชุดทดสอบที่กำหนดตายตัว — และจัดให้โมเดลอยู่สูงกว่ารุ่นก่อนหน้าโดยตรงของตัวเองถึง 21 คะแนน นั่นคือ Ling-3.0-flash ซึ่งยังคงอยู่ที่ 20 บนดัชนีเดียวกัน Ant ประกาศเปิดตัว Ling-3.1-flash เมื่อปลายเดือนกันยายน 2026 ขณะที่ Artificial Analysis ระบุวันเปิดตัวเป็นวันที่ 1 ตุลาคม และมันอายุน้อยกว่าโมเดลที่มันมีคะแนนเป็นสองเท่าอยู่สามเดือน

ช่องว่างตรงนั้นแหละคือเรื่องราว การขยับ 21 จุดบนคอมโพสิตที่การประเมินสิบแบบที่แตกต่างกันป้อนเข้าด้วยกัน ไม่ใช่สิ่งที่แผนภูมิของผู้ขายจะปลอมแปลงได้ และไม่ใช่สิ่งที่บล็อกนี้จะเขียนถึงได้เมื่อสองสัปดาห์ก่อน เมื่อการวัดที่มีอยู่เพียงอย่างเดียวของ Ling-3.1-flash คือการ์ดเกณฑ์มาตรฐานของ Ant เอง: 1,673 Elo บน GDPval-AA v2.1, 75.16 บน FrontierSWE, 65.35 บน HealthBench Professional ตัวเลขเหล่านั้นเป็นข้ออ้างจริงจากห้องแล็บจริง แต่ยังไม่ถูกทำซ้ำ เลข 41 ต่างกันโดยประเภท มันเป็นตัวเลขแรกในการเปิดตัวครั้งนี้ที่บุคคลที่สามสามารถตรวจสอบยืนยันได้

สิ่งที่ 41 วัดได้จริง ๆ

Artificial Analysis Intelligence Index v4.3.2 เป็นค่าผสมแบบถ่วงน้ำหนักจากการประเมินสิบรายการ: AA-Briefcase v1.1, GDPval-AA v2.1, AutomationBench-AA, Terminal-Bench 4.0, SciCode, Humanity's Last Exam, GDP.pdf, CritPt, AA-Omniscience และ AA-LCR v1.1 การอ่านค่าผสมเพียงลำพังเป็นความผิดพลาด ดังนั้นแถวผลการประเมินรายรายการจึงสำคัญกว่าตัวเลขพาดหัว:

• GDPval-AA — 1,621.75 สำหรับ Ling-3.1-flash เทียบกับ 948.35 สำหรับ Ling-3.0-flash นี่คือการพุ่งขึ้นครั้งเดียวที่ใหญ่ที่สุดในชุด และเป็นปัจจัยที่การเคลื่อนไหวของดัชนีส่วนใหญ่ต้องพึ่งพา

• GDP.pdf — ผ่านทั้งหมด 0.100 เพิ่มขึ้นจาก 0.054 ยังคงต่ำในเชิงค่าสัมบูรณ์ แต่ก็เกือบจะเพิ่มเป็นสองเท่า

• AA-LCR v1.1 การให้เหตุผลแบบบริบทยาว — 0.83 เทียบกับ 0.73 ของรุ่นก่อน และทัดเทียมกับ DeepSeek V4.1 Flash (Max) ที่ 0.84.

• SciCode — 0.541 เทียบกับ 0.420 เป็นการเพิ่มขึ้นในด้านวิทยาศาสตร์การเขียนโค้ด ไม่ใช่การเพิ่มขึ้นของคุณภาพการสนทนา

• การใช้เหตุผลทางฟิสิกส์ของ CritPt — 0.180 เทียบกับ 0.017 ก่อนหน้านี้ เป็นสิบเท่าของรุ่นก่อนบนฐานขนาดเล็ก

• AA-Omniscience — +2.22 เทียบกับ −17.88 สำหรับ Ling-3.0-flash ตัวนี้จะกล่าวถึงด้านล่าง เพราะมันสวนทางกับพาดหัวข่าว

Ling-3.0-flash ไม่ได้แค่แพ้ Ling-3.1-flash ในแถวเหล่านี้เท่านั้น แต่มันยังล่มไปเลยในสองแถว มันได้คะแนน 0.032 บน AutomationBench-AA และ 0.000 พอดีบน Terminal-Bench 4.0 นั่นคือบริบทที่ควรใช้ตีความค่า 41 — รุ่นก่อนหน้าเป็นโมเดล open-weight ที่มีประสิทธิภาพและราคาถูก ซึ่งแทบไม่มีความสามารถด้าน agentic-terminal ใด ๆ เลย

A single-column generated scoreboard titled 'Ling-3.1-flash — the scoreboard' with six rows: 'AA Index: 41', 'Predecessor index: 20', 'Terminal-Bench 4.0: 0.333', 'SciCode: 0.541', 'Price: $0.30 / $0.90', 'Weights: not published', and a footer reading 'All figures per Artificial Analysis, independently measured.' The OrcaRouter logo is composited in the bottom-right corner.

ที่มาของผลลัพธ์: งานที่ทำโดยเอเจนต์ ไม่ใช่การสนทนา

เมื่อเทียบการมีส่วนสนับสนุนต่อดัชนีของ Ling-3.1-flash กับโมเดลระดับ Flash สองตัวที่มักถูกนำมาจัดเทียบข้างกันบ่อยที่สุด ก็จะเห็นรูปแบบหนึ่งที่ค่าภาพรวมซ่อนเอาไว้ DeepSeek V4.1 Flash (Max) ทำได้ 39 คะแนนบนดัชนีเดียวกัน และ GLM 5.3 Flash ทำได้ 42 คะแนน ทั้งสามจึงอยู่ในช่วงห่างกันสามคะแนน แต่กว่าจะไปถึงตรงนั้นได้ พวกมันมาจากคนละจุด

• งานเทอร์มินัลแบบเอเจนต์ — Ling-3.1-flash 0.333 บน Terminal-Bench 4.0, DeepSeek V4.1 Flash (Max) 0.268, GLM 5.3 Flash 0.328

• งานจริงในโลกจริงแบบเอเจนต์ — Ling-3.1-flash 1,621.75 Elo บน GDPval-AA, DeepSeek V4.1 Flash (Max) 1,600, GLM 5.3 Flash 1,646.86

• AutomationBench-AA — Ling-3.1-flash 0.617, DeepSeek V4.1 Flash (Max) 0.689, GLM 5.3 Flash 0.604

• วิทยาการเขียนโค้ด — Ling-3.1-flash 0.541 บน SciCode, DeepSeek V4.1 Flash (Max) 0.519, GLM 5.3 Flash 0.516

การตีความแบบแคบคือ Ling-3.1-flash มีความสามารถในการแข่งขันบนเกณฑ์มาตรฐานแบบเอเจนติกและนำเล็กน้อยใน SciCode การตีความที่มีประโยชน์คือมันแข็งแกร่งที่สุดในสามตัวในตัวชี้วัดแบบ agentic-terminal สองตัวที่คนส่วนใหญ่หมายถึงเมื่อพวกเขาพูดว่า "มันขับเคลื่อนลูปเครื่องมือได้หรือไม่" — และมันตามหลังทั้งสองตัวในตัวชี้วัดความน่าเชื่อถือของความรู้ นั่นคือรูปแบบเฉพาะ ไม่ใช่ชัยชนะทั่วไป และมันคุ้มค่าที่จะกล่าวถึงก่อนที่ใครจะซื้อ workload โดยดูจากตัวเลขดัชนีเพียงอย่างเดียว

บิลที่มาพร้อมกับโมเดลที่ใหญ่ขึ้น

Ling-3.0-flash ตั้งราคาไว้ที่ $0.07 ต่ออินพุตหนึ่งล้านโทเคน และ $0.22 ต่อเอาต์พุตหนึ่งล้านโทเคนบน API ของ Ant เอง และเป็นโมเดลเปิดน้ำหนักภายใต้ MIT ส่วน Ling-3.1-flash ยังไม่เป็นทั้งสองอย่างนั้น Artificial Analysis บันทึกต้นทุนการใช้งานไว้ที่ $0.30 ต่ออินพุตหนึ่งล้านโทเคน และ $0.90 ต่อเอาต์พุตหนึ่งล้านโทเคน — โดยมีอัตราแคชฮิตที่ $0.06 ซึ่งเป็นส่วนลด 80% จากราคาอินพุต — วัดเทียบกับ API ของ InclusionAI เองในฐานะผู้ให้บริการ นั่นคือราคาอินพุตที่เพิ่มขึ้นประมาณสี่เท่าเมื่อเทียบกับโมเดลที่มันแทนที่ เพื่อแลกกับคะแนนดัชนีที่เพิ่มขึ้น 21 จุด

การแลกเปลี่ยนนั้นจะดีหรือไม่นั้นขึ้นอยู่กับภาระงานทั้งหมด และดัชนีเองก็สามารถกำหนดราคาได้: การรันการประเมิน Intelligence Index ทั้งสิบรายการกับ Ling-3.1-flash มีค่าใช้จ่ายประมาณ $960 ตามอัตราเหล่านั้น เทียบกับประมาณ $477 สำหรับ DeepSeek V4.1 Flash (Max) และ $280 สำหรับ GLM 5.3 Flash เหตุผลไม่ได้อยู่ที่ตารางอัตราค่าใช้จ่ายเพียงอย่างเดียว Ling-3.1-flash เป็นตัวให้เหตุผลที่ช่างพูดมาก — มันใช้โทเค็นเอาต์พุตไป 220 ล้านโทเค็นในการทำงานกับดัชนี ซึ่งสูงกว่าค่ามัธยฐานของระดับราคาของมันมาก และการรันการประเมินของมันใช้เวลาเฉลี่ยประมาณ 357 วินาทีต่องาน เทียบกับ 285 วินาทีสำหรับ DeepSeek V4.1 Flash (Max) และ 979 วินาทีสำหรับ GLM 5.3 Flash เมื่อคิดต่องาน Ling-3.1-flash มีค่าใช้จ่ายประมาณ $0.99 เทียบกับ $0.27 ของ DeepSeek และ $0.25 ของ GLM 5.3 Flash

ไม่มีสิ่งใดในนี้ที่มองเห็นได้จาก 41 และทั้งหมดนั้นลงเอยที่ใบแจ้งหนี้ โมเดลหนึ่งอาจชนะในดัชนีแต่แพ้ในงบประมาณ

ตัวเลขสองตัวที่ขัดแย้งกับพาดหัวข่าว

ประการแรกคือความน่าเชื่อถือของความรู้ Ling-3.1-flash ได้คะแนน +2.22 บน AA-Omniscience ซึ่งวัดว่าโมเดลรู้ว่าตัวเองรู้อะไรหรือไม่: คำตอบที่ถูกต้องได้คะแนน การหลอนถูกหักคะแนน และการปฏิเสธไม่เสียคะแนน อัตราความแม่นยำของมันอยู่ที่ 29.1% และอัตราการหลอนอยู่ที่ 37.9% เมื่อวางเทียบกับโมเดลร่วมค่ายเดียวกัน นี่คือโปรไฟล์ที่อ่อนแอที่สุดในกลุ่ม — GLM 5.3 Flash ได้คะแนน +7.47 โดยมีอัตราการหลอน 27.6% และ DeepSeek V4.1 Flash (Max) ได้คะแนน −5.30 โดยมีอัตราการหลอนที่น่าตกใจถึง 96.5% ในบรรดาคำถามที่ตอบ คะแนนรวมให้รางวัล Ling-3.1-flash จากความสามารถที่มันแสดงออก ไม่ใช่จากความน่าเชื่อถือในการแสดงออก และโมเดลที่แต่งขึ้นมาหนึ่งในสามของสิ่งที่มันยืนยันจำเป็นต้องมีระบบดึงข้อมูลประกอบในการใช้งานจริง

ประการที่สองคือเรื่องบริบท Artificial Analysis ระบุว่า Ling-3.1-flash มีหน้าต่างบริบทขนาด 1,000,000 โทเคน เอกสารเปิดตัวของ Ant เองก็อ้างอิง 1M เป็นเป้าหมายเช่นกัน แต่เอกสารสำหรับนักพัฒนาของ Ant ซึ่งแจกแจงหน้าต่างบริบทของตระกูลนี้ทีละโมเดล กลับระบุว่า Ling-3.0-flash มีขนาดเนทีฟ 256K ที่ขยายได้ถึง 1M และยังไม่มีรายการสำหรับ Ling-3.1-flash เลย ส่วนแถวข้อมูลบริบทยาวอันเป็นเอกลักษณ์ที่ถูกวัดมาจริง — AA-LCR ที่ 0.83 — เป็นคะแนนการให้เหตุผลเหนือบริบทยาว ไม่ใช่การวัดหน้าต่างบริบทที่ให้บริการจริง ให้ถือว่า 1M เป็นเพดานที่ประกาศไว้ และตรวจสอบหน้าต่างบริบทที่ได้รับจริงด้วยคำขอแบบบริบทยาวของคุณเองก่อนที่จะออกแบบโดยอิงกับมัน

เทียบกันบนสเปก

ภาพแบบแยกตามมิติ โดยให้หัวข้อมาก่อน ในแต่ละบรรทัด:

• จำนวนพารามิเตอร์ทั้งหมด — Ling-3.1-flash 560B เทียบกับ DeepSeek V4.1 Flash (Max) 552B เทียบกับ GLM 5.3 Flash 320B

• พารามิเตอร์ที่แอ็กทีฟต่อโทเคน — Ling-3.1-flash 25B เทียบกับ DeepSeek V4.1 Flash (Max) 16B เทียบกับ GLM 5.3 Flash 18B Ling-3.1-flash เปิดใช้งานมากที่สุด ซึ่งเป็นเหตุผลหนึ่งที่ต้นทุนการให้บริการของมันอยู่ที่ระดับที่เป็นอยู่

• น้ำหนักและสัญญาอนุญาต — Ling-3.1-flash ไม่ได้เผยแพร่ (เป็นกรรมสิทธิ์ ไม่มีข้อความสัญญาอนุญาต) กับ DeepSeek V4.1 Flash (Max) เปิดภายใต้ MIT กับ GLM 5.3 Flash เปิดภายใต้ MIT

• บริบทที่ประกาศไว้ — Ling-3.1-flash 1M vs DeepSeek V4.1 Flash (Max) 1M vs GLM 5.3 Flash 1M ทั้งสามตัวอ้างเพดานเดียวกัน แต่มีเพียงสองตัวเท่านั้นที่มีเช็กพอยต์ให้ดาวน์โหลดเพื่อตรวจสอบยืนยันได้

• โมดัลลิตี้ — Ling-3.1-flash รับข้อความเข้า ส่งข้อความออก เทียบกับ DeepSeek V4.1 Flash (Max) ที่รับข้อความและภาพเข้า เทียบกับ GLM 5.3 Flash ที่รับข้อความ ภาพ และวิดีโอเข้า นี่คือแกนเดียวที่ Ling-3.1-flash เป็นรองอย่างแท้จริง และไม่มีแถว benchmark ใดชดเชยจุดนี้ได้

• ราคาบน API ของผู้ให้บริการ — Ling-3.1-flash $0.30 / $0.90 ต่อล้านอินพุต / เอาต์พุต เทียบกับ DeepSeek V4.1 Flash (Max) $0.30 / $1.20 เทียบกับ GLM 5.3 Flash $0.15 / $0.50

• คะแนนดัชนี — 41 เทียบกับ 39 เทียบกับ 42 ช่วงห่างสามคะแนนในการเปรียบเทียบแบบสามทางไม่ใช่การจัดอันดับ หากแต่เป็นผลเสมอที่ถูกตัดสินด้วยการประเมินใดก็ตามที่บังเอิญใกล้เคียงกับภาระงานของผู้อ่าน

ที่ที่คุณสามารถเรียกมันได้

Ling-3.1-flash ยังไม่อยู่ในแค็ตตาล็อกของ OrcaRouter ในวันนี้ — การค้นหาโมเดลภายใต้ InclusionAI ผ่าน API โมเดลสาธารณะของเราส่งคืนค่า not-found และเราจะไม่สื่อเป็นนัยว่าเป็นอย่างอื่น ปัจจุบันมันทำงานบน API ของ Ant เองและบนแพลตฟอร์มของบุคคลที่สามที่ให้บริการเวอร์ชันนี้ ซึ่งเป็นขอบเขตความพร้อมใช้งานที่มีอยู่จริงอย่างตรงไปตรงมา สิ่งที่ควรสังเกตสำหรับใครก็ตามที่กำลังเปรียบเทียบสามโมเดลข้างต้นคือ อีกสองโมเดลสามารถเราเตอร์ได้ในตอนนี้: DeepSeek V4.1 Flash และ GLM 5.3 Flash ต่างก็อยู่ในแค็ตตาล็อกของ OrcaRouter ที่ราคาตามรายการของผู้ให้บริการ โดยไม่มีมาร์กอัป ผ่านคีย์ API เดียว พร้อมการสลับไปยังระบบสำรองอัตโนมัติระหว่างกัน หากการเปรียบเทียบข้างต้นบ่งชี้ว่างานของคุณให้ความสำคัญกับความน่าเชื่อถือของความรู้มากกว่างานเทอร์มินัลแบบเอเจนต์ GLM 5.3 Flash คือตัวที่ควรลอง — และคุณสามารถลองใช้มันเทียบกับ DeepSeek V4.1 Flash บนคีย์เดียวกันได้ โดยไม่ต้องมีสัญญาที่สองหรือโค้ดไคลเอนต์ใหม่แม้แต่บรรทัดเดียว

41 เปลี่ยนอะไร และไม่เปลี่ยนอะไร

สิ่งที่มันเปลี่ยนไปคือสถานะของการเปิดตัว Ling-3.1-flash ไม่ใช่สเปกที่แนบแผนภูมิจากผู้ขายมาด้วยอีกต่อไปแล้ว แต่เป็นโมเดลที่มีตำแหน่งซึ่งวัดอย่างเป็นอิสระ และตำแหน่งนั้นคือการก้าวกระโดดข้ามรุ่นอย่างแท้จริงในความสามารถแบบเอเจนต์เมื่อเทียบกับ Ling-3.0-flash — การกระโดดแบบที่เกิดจากการเปลี่ยนการออกแบบ มากกว่าการเพิ่มพลังประมวลผลบนสูตรเดิม สิ่งที่มันไม่เปลี่ยนคือสิ่งใดก็ตามเกี่ยวกับการจัดซื้อ เวตยังปิดอยู่ สัญญาอนุญาตยังไม่ถูกเขียนขึ้น โมดัลลิตียังเป็นข้อความเท่านั้น และราคาสูงกว่ารุ่นก่อนราวสี่เท่า สำหรับประโยชน์ที่ได้ซึ่งกระจุกตัวอยู่ในงานเอเจนต์และงานเทอร์มินัล

หากงานของคุณคือลูปเอเจนต์ การขับเคลื่อนเครื่องมือ และสายโซ่เครื่องมือที่ยาว 41 คือตัวเลขที่มีความหมายที่สุดที่เปิดเผยเกี่ยวกับโมเดลนี้จนถึงตอนนี้ และมันสมควรได้รับการพิจารณาอย่างจริงจังในขณะที่ความพร้อมใช้งานยังขยายตัวอยู่ หากงานของคุณเป็นแบบมัลติโมดัล หรือการตอบคำถามที่ความรู้เป็นสิ่งสำคัญ หรือการอนุมานปริมาณสูงที่คำนึงถึงงบประมาณ 41 ไม่ตอบโจทย์ปัญหาของคุณ — และ GLM 5.3 Flash ซึ่งสามารถกำหนดเส้นทางได้แล้วและเปิดให้ใช้ภายใต้ MIT ในราคาผลลัพธ์เพียงครึ่งเดียว ถือเป็นโมเดลที่อยู่ในตำแหน่งที่ดีกว่าของทั้งสาม ดัชนีบอกคุณว่า Ling-3.1-flash อยู่ตรงไหน แต่มันไม่ได้บอกว่าคุณควรสนใจหรือไม่ และคำถามนั้นมีคำตอบอยู่ที่สิ่งที่คุณกำลังสร้าง

Screenshot of the Artificial Analysis model page for Ling 3.1 Flash, in English, captured 2026-10-07, headed 'Ling 3.1 Flash Intelligence, Performance & Price Analysis' and marked 'Proprietary model' and 'Released October 2026'. The page shows an Intelligence Index of 41, 211 output tokens per second, a cost of $0.99 per Intelligence Index task, 220M output tokens generated across the index, input $0.30 and output $0.90 per 1M tokens with an 80% cache discount, a 1M context window, text input and text output, and the summary line that the model 'scores 41 on the Artificial Analysis Intelligence Index, placing it well above average among comparable models (median: 13)'.Screenshot of the Artificial Analysis model page for Ling 3.0 Flash, in English, captured 2026-10-07, headed 'Ling 3.0 Flash Intelligence, Performance & Price Analysis' and marked 'Open weights model' and 'Released August 2026'. It shows an Intelligence Index of 20, 332 output tokens per second, input $0.075 with an 80% cache discount and output $0.22 per 1M tokens, a 262k context window, and 124B total parameters with 5.1B active parameters.

การเปรียบเทียบในบทความนี้1

ตรวจพบจากบทความนี้ · เบนช์มาร์ก: Artificial Analysis · อัปเดตทุกวัน

© 2026 OrcaRouter

สำหรับผู้ให้บริการ

ให้บริการแพลตฟอร์มการอนุมานอยู่หรือไม่ นำโมเดลของคุณขึ้น OrcaRouter

providers@orcarouter.ai

เข้าร่วมคอมมูนิตี้ของเรา

Discordsupport@orcarouter.aiXGitHubYouTube