
Ling-3.1-flash กับ GLM-5.3-Flash: ทรูพุตสี่เท่า แลกกับดัชนีหนึ่งจุด
- openaiใหม่OpenAI: GPT-6.1 Sol2026-09-2952ความฉลาด
- anthropicใหม่Anthropic: Claude Sonnet 5.52026-09-2856ความฉลาด
- typesafeใหม่TypeSafe: Jev 1.132026-09-24$0.04 / $0.00 ต่อ 1 ล้านโทเค็น · 151 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238ความฉลาด
- OpenAIOpenAI: GPT-6 Sol2026-09-2248ความฉลาด
- AnthropicAnthropic: Claude Opus 5.52026-09-2258ความฉลาด
- xAIGrok 4.72026-09-2146ความฉลาด
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 ต่อ 1 ล้านโทเค็น · 104 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 ต่อ 1 ล้านโทเค็น · 1202 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040ความฉลาด
- OpenAIOpenAI: GPT-6 Astra2026-09-0453ความฉลาด77การเขียนโค้ด
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241ความฉลาด76การเขียนโค้ด
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245ความฉลาด76การเขียนโค้ด
- AnthropicAnthropic: Claude Fable 5.12026-09-0153ความฉลาด82การเขียนโค้ด
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 ต่อ 1 ล้านโทเค็น · 52 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 ต่อ 1 ล้านโทเค็น · 248 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642ความฉลาด72การเขียนโค้ด
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 ต่อ 1 ล้านโทเค็น · 232 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845ความฉลาด75การเขียนโค้ด
- obsidianQwen3.8 27B2026-08-1534ความฉลาด68การเขียนโค้ด
Ling-3.1-flash และ GLM-5.3-Flashอยู่ห่างกันหนึ่งคะแนนบนดัชนี Artificial Analysis Intelligence Index — 41 ต่อ 42 — ซึ่งทำให้ทั้งสองดูเหมือนเป็นการตัดสินใจเดียวกันถึงสองครั้ง แต่พวกมันไม่ใช่เช่นนั้น GLM-5.3-Flash สร้างเอาต์พุตที่ 53.0 โทเคนต่อวินาทีบน API ของ Z.ai เอง; Ling-3.1-flash สร้างเอาต์พุตที่ 211.0 โทเคนต่อวินาทีบน API ของ InclusionAI นั่นคือความแตกต่างของทรูพุตถึงสี่เท่า และมันมากกว่าสิ่งที่ดัชนีใช้แยกทั้งสองออกจากกันมาก หนึ่งในสองโมเดลนี้มีความสามารถมากกว่าในเกือบทุกมิติด้านคุณภาพ และเป็นโอเพนซอร์สภายใต้ MIT อีกโมเดลคือโมเดลที่ทำงานเสร็จก่อน เป็นแบบปิด และไม่มีราคา สัญญาอนุญาต หรือเช็กพอยต์ที่เผยแพร่ การเลือกระหว่างสองโมเดลนี้เป็นคำถามว่าเวิร์กโหลดของคุณกำลังรออะไรอยู่
แกน Ling-3.1-flash ชนะอย่างเด็ดขาด
ความเร็วไม่ใช่เรื่องเล็กน้อยเมื่อคุณต้องเลือกระหว่างโมเดลที่อยู่ในระดับความสามารถเดียวกัน และในกรณีนี้ มันคือเหตุผลทั้งหมดที่สนับสนุนโมเดล Ant
• อัตราการประมวลผลเอาต์พุต — Ling-3.1-flash 211.0 โทเคนต่อวินาทีบน API ของ InclusionAI เทียบกับ GLM-5.3-Flash 53.0 โทเคนต่อวินาทีบน API ของ Z.ai อัตราการสร้างเป็น 4 เท่า
• เวลาถึงโทเคนแรก — Ling-3.1-flash 1.80 วินาที เทียบกับ GLM-5.3-Flash 3.18 วินาที โมเดลของ Ant เริ่มตอบในขณะที่โมเดลของ Z.ai ยังคิดอยู่ ซึ่งสำคัญกว่าอัตราการประมวลผลในงานแบบโต้ตอบและแบบสตรีมมิ่ง
• เวลาต่อหนึ่งงานของ Intelligence Index — Ling-3.1-flash ประมาณ 357 วินาที เทียบกับ GLM-5.3-Flash ประมาณ 979 วินาที งานประเมินเพียงงานเดียวใช้เวลากับ GLM-5.3-Flash เกือบสามเท่าตั้งแต่ต้นจนจบ เนื่องจากทั้งช้ากว่าต่อโทเคนและเริ่มต้นช้ากว่า
สำหรับลูปของเอเจนต์ที่เรียกแบบต่อเนื่องกันเป็นสิบ ๆ ครั้ง หรือผลิตภัณฑ์ที่ผู้ใช้กำลังนั่งดูโทเคนไหลเข้ามา นั่นไม่ใช่แค่ตัวช่วยตัดสินใจ — มันคือเหตุผลทั้งหมดที่ควรเลือกโมเดลหนึ่ง GLM-5.3-Flash เป็นโมเดลที่ดีกว่าในทางทฤษฎี แต่กลับเป็นตัวที่ช้ากว่าในเส้นทางการเรียกคำขอ
จุดที่ GLM-5.3-Flash ดีกว่าอย่างชัดเจน
ในที่อื่น ๆ ทั้งหมด และรายการก็ยาวพอที่ความได้เปรียบด้านปริมาณงานจะต้องพิสูจน์คุณค่าของตัวเอง
• ความน่าเชื่อถือของความรู้ — GLM-5.3-Flash ได้คะแนน +7.47 บน AA-Omniscience ซึ่งดีที่สุดในบรรดาโมเดลระดับ Flash ทั้งสาม โดยมีอัตราการหลอน 27.6% ในคำถามที่ตอบแล้ว Ling-3.1-flash ได้คะแนน +2.22 โดยมีอัตราการหลอน 37.9% ในมาตรวัดที่ลงโทษการกุเรื่องมากกว่าการปฏิเสธที่จะตอบ ช่องว่างนี้มีอยู่จริงและชี้ไปในทิศทางเดียวกับดัชนี
• ความรู้ทางวิทยาศาสตร์ — GLM-5.3-Flash ทำได้ 0.912 บน GPQA Diamond. Ling-3.1-flash ไม่มีแถว GPQA Diamond ที่เผยแพร่. DeepSeek V4.1 Flash (Max) ก็เช่นกัน. โมเดลที่ได้ 0.91 ในคำถามวิทยาศาสตร์ระดับบัณฑิตศึกษาถือเป็นเครื่องมือคนละชนิดกับโมเดลที่ยังไม่ถูกวัดกับคำถามเหล่านั้น.
• โมดัลลิตี — GLM-5.3-Flash รับข้อความ รูปภาพ และวิดีโอ ส่วน Ling-3.1-flash รับเฉพาะข้อความ นี่ไม่ใช่ช่องว่างด้านประสิทธิภาพที่จะปิดด้วยเบนช์มาร์ก แต่เป็นความสามารถที่ขาดหายไป
• น้ำหนักและสัญญาอนุญาต — GLM-5.3-Flash เป็นโมเดลน้ำหนักเปิดภายใต้สัญญาอนุญาต MIT สามารถดาวน์โหลดได้และโฮสต์เองได้ ส่วน Ling-3.1-flash ไม่ได้เผยแพร่เช็กพอยต์ ไม่มีข้อความสัญญาอนุญาต และถูกจัดประเภทเป็นซอฟต์แวร์กรรมสิทธิ์
• งานความรู้แบบเอเจนต์ — GLM-5.3-Flash ได้ 1,453.73 Elo บน AA-Briefcase v1.1 เทียบกับ 1,400.35 ของ Ling-3.1-flash บนเบนช์มาร์กที่สร้างขึ้นโดยเฉพาะสำหรับงานด้านความรู้มากกว่าการขับเคลื่อนผ่านเทอร์มินัล
• ราคา — GLM-5.3-Flash เปิดให้ใช้ในราคา $0.15 ต่ออินพุต 1 ล้านโทเคน และ $0.50 ต่อเอาต์พุต 1 ล้านโทเคนบน API ของ Z.ai เทียบกับ $0.30 และ $0.90 ของ Ling-3.1-flash คิดเป็นครึ่งหนึ่งของอัตราอินพุต และประมาณครึ่งหนึ่งของอัตราเอาต์พุต จากโมเดลที่มีคะแนนดัชนีสูงกว่าและมีน้ำหนักแบบเปิด

แถวที่โมเดล Ant ตอบกลับ
Ling-3.1-flash ไม่ได้ถูกเอาชนะในทุกด้าน งานด้าน agentic terminal นั้นนำอยู่เล็กน้อย และด้าน coding-science นั้นอยู่ในระดับเดียวกัน:
• Terminal-Bench 4.0 — Ling-3.1-flash 0.333 กับ GLM-5.3-Flash 0.328 แทบจะเสมอกัน และทั้งคู่อยู่ต่ำกว่าระดับแนวหน้า
• SciCode — Ling-3.1-flash 0.541 เทียบกับ GLM-5.3-Flash 0.516 ชนะไปอย่างหวุดหวิด
• AutomationBench-AA — 0.617 เทียบกับ 0.604 ชนะอย่างเฉียดฉิวอีกครั้ง
• GDPval-AA — Ling-3.1-flash 1,621.75 Elo เทียบกับ GLM-5.3-Flash 1,646.86 GLM เอาอันนี้กลับคืนไป
อ่านสี่บรรทัดนี้รวมกันแล้วรูปร่างก็ชัดเจน ในจุดที่โมเดลทั้งสองแยกออกจากกันได้จริง การแยกนั้นอยู่ภายในสัญญาณรบกวนของการประเมินเพียงครั้งเดียว ความต่างของดัชนีหนึ่งจุดระหว่างทั้งสองไม่ใช่การจัดอันดับ แต่เป็นการโยนเหรียญที่เอนไปทาง GLM เล็กน้อยจากแถวความน่าเชื่อถือ สิ่งที่ไม่ใช่การโยนเหรียญคือช่องว่างทรูพุต 4 เท่า และช่องว่างราคา 2 เท่า ซึ่งทั้งคู่ชี้ไปในทางตรงกันข้าม
ยังมีรายละเอียดด้านการให้บริการที่น่าสนใจควรมาก เพราะมันเปลี่ยนขนาดของช่องว่างด้านอัตราการประมวลผลนั้น ขึ้นอยู่กับว่าคุณเรียกใช้โมเดลจากที่ใด API ของ Z.ai เองวัดได้ที่ 53.0 โทเคนต่อวินาที การวัดเป็นเวลาเจ็ดวันในแคตตาล็อกของเราเองสำหรับ GLM-5.3-Flash บนเส้นทางของเราแสดงผลลัพธ์ 150.6 โทเคนต่อวินาที โดยมีค่ามัธยฐานความหน่วงของโทเคนแรกที่ 4.2 วินาที น้ำหนักชุดเดียวกันที่ให้บริการจากการติดตั้งใช้งานที่ต่างกันทำงานได้เร็วเกือบสามเท่า ตัวเลขอัตราการประมวลผลของผู้จำหน่ายเป็นคุณสมบัติของผู้ให้บริการ ไม่ใช่ของโมเดล
ข้อมูลจำเพาะ ทีละบรรทัด
ให้หัวข้ออยู่ก่อนในทุกบรรทัด:
• ขนาด — Ling-3.1-flash 560B ทั้งหมด / 25B ที่ใช้งาน เทียบกับ GLM-5.3-Flash 320B ทั้งหมด / 18B ที่ใช้งาน
• บริบทที่ประกาศไว้ — 1M โทเคนทั้งคู่ แถวการให้เหตุผลแบบบริบทยาวของ GLM-5.3-Flash วัดได้ที่ 0.80 บน AA-LCR; ของ Ling-3.1-flash อยู่ที่ 0.83 ทั้งคู่ใกล้เคียงกับ 0.84 ของ DeepSeek V4.1 Flash (Max) ซึ่งหมายความว่าการให้เหตุผลแบบบริบทยาวไม่ใช่ปัจจัยสร้างความแตกต่างอีกต่อไปในระดับนี้
• เพดานเอาต์พุต — GLM-5.3-Flash 128,000 โทเคนในแคตตาล็อกของเรา เทียบกับ Ling-3.1-flash ที่ไม่มีค่าสูงสุดที่ประกาศไว้ หนึ่งในสองตัวนี้สามารถกำหนดขนาดสำหรับการสร้างแบบยาวได้ แต่อีกตัวทำไม่ได้
• ดัชนี — 41 กับ 42
• อัตราการประมวลผล — {{1}}211.0 โทเคนต่อวินาที{{/1}} เทียบกับ {{2}}53.0{{/2}} บน API ของผู้ให้บริการ และวัดได้ 150.6 บนเส้นทางของเรา
• เวท — เป็นกรรมสิทธิ์โดยไม่มีสัญญาอนุญาต เทียบกับเปิดภายใต้ MIT
• มอดาลิตี — ข้อความเท่านั้น เทียบกับ ข้อความ รูปภาพ และวิดีโอขาเข้า
• ราคา — $0.30 / $0.90 ต่อล้านอินพุต / เอาต์พุต เทียบกับ $0.15 / $0.50 บน API ของ Z.ai
วิธีรันการเปรียบเทียบนี้จริง ๆ
GLM-5.3-Flash อยู่ในแค็ตตาล็อกของ OrcaRouter แล้ว โดยขึ้นราคาที่ 0.075 ดอลลาร์ต่อล้านโทเคนอินพุต 0.25 ดอลลาร์ต่อล้านโทเคนเอาต์พุต และ 0.0173 ดอลลาร์ต่อล้านโทเคนแคชรีด — ให้อ่านการ์ดแบบสด ๆ แทนย่อหน้านี้ เพราะอัตราการให้บริการเปลี่ยนแปลงได้ และ การส่งผ่านราคาแบบนี้หมายความว่าการเปลี่ยนแปลงราคาจากผู้ให้บริการจะสะท้อนมาที่ฝั่งเราภายในวันเดียวกัน คุณค่าของข้อตกลงนี้สำหรับการจับคู่ครั้งนี้คือ ความเปิดกว้างและข้อได้เปรียบด้านราคาของ GLM-5.3-Flash เป็นสองสิ่งที่ทำให้มันเป็นตัวเลือกเริ่มต้นที่สมเหตุสมผล และเส้นทางแบบปิดที่บวกเพิ่ม 0% คือวิธีที่คุณจะทดสอบ Ling-3.1-flash เทียบกับมันต่อไปได้โดยไม่ต้องเพิ่มความสัมพันธ์กับผู้ขายรายใหม่
Ling-3.1-flash ไม่อยู่ในแค็ตตาล็อกของเรา — การค้นหาผ่าน API โมเดลสาธารณะของเราส่งคืนผลว่าไม่พบโมเดลภายใต้ InclusionAI และบทความนี้จะไม่สื่อว่าเราให้บริการมัน มันทำงานผ่าน API ของ Ant เองและแพลตฟอร์มของบุคคลที่สามที่เผยแพร่เวอร์ชันนี้ ซึ่งเป็นขอบเขตที่แท้จริงของการมีให้ใช้งาน
รูปแบบที่เกิดประโยชน์ของการเปรียบเทียบนี้ไม่ใช่การเลือกอย่างใดอย่างหนึ่ง GLM-5.3-Flash เป็นแบบเปิด ราคาถูกที่สุด รองรับมัลติโมดัล เชื่อถือได้มากกว่าสำหรับคำถามด้านความรู้ และใช้งานได้ผ่านผู้ให้บริการ 23 ราย — นั่นคือเส้นทางเริ่มต้น ส่วนจุดแข็งของ Ling-3.1-flash คืออัตราการประมวลผลและ TTFT ในลูปแบบเอเจนต์ และสิ่งที่ต้องแลกมาคือมันเป็นแบบปิด รองรับเฉพาะข้อความ แพงกว่า และเข้าถึงได้ผ่านช่องทางน้อยกว่า จัดสรรงานเชิงโต้ตอบและงานที่ไวต่อความหน่วงไปยังโมเดลที่เร็ว ส่วนงานแบบแบตช์ งานที่เน้นความรู้หนัก ๆ และงานมัลติโมดัลให้ใช้โมเดลแบบเปิด และวางกลไกสำรองไว้ระหว่างทั้งสอง เพื่อให้ต้นทางที่ช้าไม่กลายเป็นผลิตภัณฑ์ที่ช้า
เลือกอันไหนดี
หากเกณฑ์การประเมินของคุณคือความสามารถ ต้นทุน ความเปิดกว้าง และรูปแบบการทำงาน GLM-5.3-Flash ชนะการเปรียบเทียบนี้ และไม่ใช่การแข่งขันที่สูสีเลย — คะแนนดัชนีที่สูงกว่า โปรไฟล์ความน่าเชื่อถือของความรู้ที่ดีที่สุดในระดับเดียวกัน GPQA Diamond 0.912 น้ำหนัก MIT อินพุตวิดีโอ ราคาครึ่งเดียว และมีผู้ให้บริการ 23 รายอยู่เบื้องหลัง หากเกณฑ์ของคุณรวมถึงระยะเวลาที่ผู้ใช้ต้องรอ หรือจำนวนการเรียกตามลำดับที่งานสามารถทำได้ Ling-3.1-flash คือโมเดลที่ทำงานเสร็จ และอัตราการสร้างสี่เท่าของมันไม่ใช่ข้อผิดพลาดจากการปัดเศษในลูปของเอเจนต์
สิ่งที่ทำให้ตัดสินได้ก็คือรายละเอียดด้านการเสิร์ฟที่ผู้ขายทั้งสองรายไม่มีใครเผยแพร่ในรูปแบบที่เทียบกันได้ นั่นคือ throughput ที่ส่งมอบได้จริงบนเวิร์กโหลดของคุณ ผ่านผู้ให้บริการของคุณ ทั้งสองโมเดลตอบสนองรูปแบบ chat-completions ที่เข้ากันได้กับ OpenAI เหมือนกัน ซึ่งหมายความว่าการสลับไปมาระหว่างสองโมเดลเป็นเพียงการเปลี่ยนการตั้งค่า ไม่ใช่การโยกย้าย — และสำหรับโมเดลสองตัวที่มีคะแนน index ต่างกันแค่หนึ่งพอยต์ และต่างกันสี่เท่าในด้านความเร็ว การวัดตัวเลขเพียงตัวเดียวนั้นบนทราฟฟิกของคุณเอง เป็นการใช้เวลาช่วงบ่ายได้คุ้มค่ากว่าการอ่านแถว benchmark อีกแถวหนึ่ง


การเปรียบเทียบในบทความนี้1
ตรวจพบจากบทความนี้ · เบนช์มาร์ก: Artificial Analysis · อัปเดตทุกวัน
