
Ling-3.0-flash: สิ่งที่เรารู้ตอนนี้เกี่ยวกับ MoE ระดับความเร็วสูงแบบ Open-Weight ของ Ant Group
- Orcaใหม่Orca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 ต่อ 1 ล้านโทเค็น
- orcaใหม่Orca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 ต่อ 1 ล้านโทเค็น
- deepseekใหม่DeepSeek: DeepSeek V4.1 Flash2026-09-1040ความฉลาด
- openaiOpenAI: GPT-6 Astra2026-09-0453ความฉลาด77การเขียนโค้ด
- googleGoogle: Gemini 3.8 Flash2026-09-0241ความฉลาด76การเขียนโค้ด
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245ความฉลาด76การเขียนโค้ด
- anthropicAnthropic: Claude Fable 5.12026-09-0153ความฉลาด82การเขียนโค้ด
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 ต่อ 1 ล้านโทเค็น
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642ความฉลาด72การเขียนโค้ด
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 ต่อ 1 ล้านโทเค็น
- z-aiZ.ai: GLM 5.32026-08-1845ความฉลาด75การเขียนโค้ด
- obsidianQwen3.8 27B2026-08-1534ความฉลาด68การเขียนโค้ด
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236ความฉลาด69การเขียนโค้ด
- grokSpaceXAI: Grok 4.62026-08-1244ความฉลาด77การเขียนโค้ด
- metaMeta: Muse Spark 1.22026-08-0540ความฉลาด72การเขียนโค้ด
- qwenQwen: Qwen3.8 Max2026-08-0345ความฉลาด76การเขียนโค้ด
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135ความฉลาด69การเขียนโค้ด
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 ต่อ 1 ล้านโทเค็น
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
ห้องแล็บ InclusionAI ของ Ant Group ได้เปิดตัว Ling-3.0-flash อย่างเป็นทางการแล้ว — ประกาศเมื่อวันที่ 24 กรกฎาคม 2026 และเปิดซอร์สภายใต้สัญญาอนุญาต MIT เมื่อวันที่ 7 สิงหาคม — และภาพรวมก็เปลี่ยนไปอย่างมากนับตั้งแต่ตัวอย่างที่เราเผยแพร่ในเดือนกรกฎาคม มันเป็นโมเดล mixture-of-experts แบบไฮบริดรีซันนิงโดยกำเนิด ที่มีพารามิเตอร์รวม 124B และพารามิเตอร์แอ็กทีฟเพียง 5.1B ต่อโทเคน สร้างขึ้นเป็นรุ่นที่เร็วและประหยัดของตระกูล Ling ตัวเลขสองค่าที่เปลี่ยนทุกอย่าง: ตอนนี้ Artificial Analysis ให้คะแนนมันที่ 38 ในดัชนี Intelligence Index (เพิ่มขึ้น 24 คะแนนจากรุ่น fast-tier รุ่นก่อนหน้า Ling-2.6-flash) และจัดให้มันอยู่บนเส้นพาเรโตฟรอนเทียร์ของโมเดล open-weights สำหรับความฉลาดเทียบกับพารามิเตอร์รวม น้ำหนักโมเดลพร้อมใช้งานแล้วบน Hugging Face และ ModelScope
เมื่อเราครั้งแรกที่กล่าวถึงโมเดลนี้เมื่อวันที่ 24 กรกฎาคม สรุปอย่างตรงไปตรงมาคือ: API เท่านั้น ไม่มีน้ำหนัก ไม่มีคำชี้แจงใบอนุญาต ไม่มีการวัดผลอิสระ ข้อความทั้งสี่นั้นล้าสมัยแล้วในตอนนี้ Ant เปิดเผยน้ำหนักภายใต้ใบอนุญาต MIT เมื่อวันที่ 7 สิงหาคม และ Artificial Analysis ได้เผยแพร่การประเมินอิสระอย่างเต็มรูปแบบแล้วตั้งแต่นั้นมา การอัปเดตนี้ปรับปรุงข้อมูลสรุปเดิมตามนั้น — ป้ายกำกับ 'ไม่ได้รับการยืนยัน' ที่ครอบงำโพสต์เดือนกรกฎาคมตอนนี้ใช้กับชุดข้อกล่าวอ้างที่แคบกว่ามาก โดยเฉพาะตัวเลขความเร็วสูงสุดของ Ant มากกว่าตัวโมเดลโดยรวม
TL;DR.Ling-3.0-flash คือ MoE แบบเปิดน้ำหนักระดับความเร็วสูงของ Ant Group: พารามิเตอร์รวม 124B / ใช้งานจริง 5.1B, ใบอนุญาต MIT, คอนเทกซ์เนทีฟ 256K (ให้บริการที่ 262K) Artificial Analysis ให้ค่า Intelligence Index อยู่ที่ 38 — สูงขึ้น 24 คะแนนจาก Ling-2.6-flash รุ่นก่อนหน้า และอยู่บน Pareto frontier ของกลุ่มโมเดลเปิดน้ำหนักในด้านความฉลาดเทียบกับจำนวนพารามิเตอร์ทั้งหมด — โดยวัดเอาต์พุตได้ประมาณ 368 โทเคนต่อวินาที น้ำหนักโมเดลอยู่บน Hugging Face และ ModelScope ภายใต้ใบอนุญาต MIT ยังมีตัวเลขเฉพาะจากผู้ให้บริการเท่านั้น ได้แก่ การเคลมปริมาณงานสูงสุด 1,100+ โทเคนต่อวินาที, ตัวเลข time-to-first-token ต่ำกว่า 100 มิลลิวินาที และตาราง benchmark ในโมเดลการ์ด ราคา API จากผู้ให้บริการโดยตรงคือ $0.075 ขาเข้า / $0.22 ขาออก ต่อ 1 ล้านโทเคน (ลด 80% เมื่อ cache โดน) ฟรีเทียร์ช่วงเปิดตัวสิ้นสุดลงเมื่อวันที่ 3 สิงหาคม
ประเด็นสำคัญ
• เป็นระดับที่เร็ว/ถูก ไม่ใช่รุ่นเรือธงโมเดลเรือธงขนาด 1T พารามิเตอร์ของรุ่นก่อนหน้านี้ยังคงเป็นโมเดลที่ใหญ่ที่สุดของ InclusionAI; Ling-3.0-flash เป็นรุ่นน้องที่เล็กกว่าและเร็วกว่า ออกแบบมาสำหรับงานข้อความปริมาณมากและการเรียกใช้เครื่องมือ
• ขณะนี้เปิดเผยน้ำหนักโมเดลภายใต้สัญญาอนุญาต MIT แล้ว น้ำหนักดังกล่าวได้เผยแพร่บน Hugging Face (inclusionAI/Ling-3.0-flash) และ ModelScope เมื่อวันที่ 7 สิงหาคม ภายใต้สัญญาอนุญาต MIT — ซึ่งเป็นการพลิกกลับจากภาพเดิมในเดือนกรกฎาคมที่ระบุว่า “เฉพาะ API”
• ในที่สุดมันก็มีคะแนนของตัวเอง Artificial Analysis วัด Intelligence Index ได้ 38 เพิ่มขึ้น 24 จาก Ling-2.6-flash และจัดให้โมเดลนี้อยู่บนเส้นพาเรโตของโมเดลน้ำหนักเปิด สำหรับการเปรียบเทียบความฉลาดกับจำนวนพารามิเตอร์ทั้งหมด
• ตอนนี้มีการวัดความเร็วบางส่วนแล้วAA มีอัตราเอาต์พุตประมาณ 368 โทเคน/วินาที และใช้เวลาประมาณ 1.98 วินาทีกว่าจะได้โทเคนแรก ส่วนตัวเลขจุดสูงสุด 1,100+ โทเคน/วินาทีที่ Ant ประกาศไว้นั้นยังเป็นข้อมูลจากผู้ผลิตเท่านั้น
• กำหนดราคาแล้ว และช่วงเปิดตัวฟรีสิ้นสุดลงแล้ว API ฝั่งผู้ให้บริการระบุราคา $0.075 ต่อ input / $0.22 ต่อ output ต่อ 1M โทเคน พร้อมส่วนลด 80% สำหรับ cache-hit; ช่วงฟรีสำหรับการเปิดตัวสิ้นสุดลงเมื่อวันที่ 3 สิงหาคม
• มันเป็นหนึ่งในตระกูลที่มีสามโมเดล InclusionAI แบ่งกลุ่มผลิตภัณฑ์ของตนออกเป็น Ling (MoE อเนกประสงค์สำหรับข้อความและเครื่องมือ ซึ่งเป็นโมเดลนี้), Ring (การให้เหตุผล), และ Ming (มัลติโมดัล)
หมายเหตุเกี่ยวกับวิธีอ่านอัปเดตนี้: นี่คือการแก้ไขฉบับพรีวิวเมื่อวันที่ 24 กรกฎาคม ซึ่งเขียนขึ้นหลังจากที่น้ำหนักของโมเดลเผยแพร่แบบเปิดและคะแนนจากการทดสอบอิสระชุดแรกปรากฏออกมา ข้อมูลจำเพาะ เกณฑ์วัดสมรรถนะ และราคาทั้งหมดด้านล่างมีการระบุแหล่งที่มา ในกรณีที่ Ant Group เป็นแหล่งข้อมูลเพียงแหล่งเดียว กล่าวคือ ข้ออ้างเรื่องความเร็วสูงสุดและตารางเกณฑ์วัดสมรรถนะในโมเดลการ์ด เราก็กล่าวไว้อย่างชัดเจน ในกรณีที่ Artificial Analysis ได้ทำการวัดบางอย่างอย่างอิสระ เราก็อ้างอิงแหล่งนั้น
สิ่งที่เรารู้จริงๆ
สถาปัตยกรรมได้รับการบันทึกอย่างครบถ้วนบน model card แล้ว Ling-3.0-flash ใช้สแตก attention แบบไฮบริด-เชิงเส้นโดยกำเนิด โดยสลับชั้น Kimi Delta Attention (KDA) และ Gated MLA ในอัตรา 5:1 (KDA 35 ชั้น + MLA 7 ชั้น) พร้อมการเกตแบบทแยงละเอียดของ KDA วางอยู่บน sparse MoE ขนาด 1/64 (มี routed experts 512 ตัว เปิดใช้งาน 8 ตัวต่อโทเค็น) นี่คือวิธีที่ทำให้มีพารามิเตอร์รวม 124 พันล้าน แต่ใช้งานจริงเพียง 5.1 พันล้าน หน้าต่างบริบทรองรับ 256K โดยกำเนิด ให้บริการที่ 262,144 โทเค็นในสูตรการอนุมาน และ Ant อ้างว่าสถาปัตยกรรมนี้ขยายได้ถึง 1M ความยาวเอาต์พุตสูงสุดไม่มีการเปิดเผย โมเดลนี้รองรับเฉพาะข้อความพร้อมความสามารถในการเรียกใช้เครื่องมือ ส่วนอินพุตแบบมัลติโมดัลอยู่ในไลน์ Ming ที่แยกต่างหาก
แล็บเผยแพร่รูปแบบน้ำหนักสองแบบ — BF16 (ประมาณ 255GB) และ FP8 (ประมาณ 128GB) — และตัวแปรควอนไทซ์จากชุมชนมีการลิงก์ไว้แล้วบนการ์ดโมเดล แนวทางการปรับใช้ของแล็บเองมุ่งเป้าไปที่ SGLang และ vLLM
ความพร้อมใช้งาน: น้ำหนักโมเดลแบบเปิดภายใต้สัญญาอนุญาต MIT
เมื่อวันที่ 7 สิงหาคม ทีม InclusionAI ของ Ant Group ได้เผยแพร่น้ำหนักโมเดลภายใต้สัญญาอนุญาต MIT บน Hugging Face (inclusionAI/Ling-3.0-flash) และ ModelScope นั่นเป็นสัญญาอนุญาตแบบผ่อนปรนที่นำไปใช้เชิงพาณิชย์ได้ ซึ่งเป็นสัญญาเดียวกับที่ Ling 2.0 และ Ling 2.6 เผยแพร่ภายใต้ และหมายความว่าคุณสามารถโฮสต์ด้วยตนเอง ปรับแต่ง และปรับใช้ Ling-3.0-flash ได้เอง แทนที่จะเช่าผ่าน API โมเดลนี้ยังสามารถเรียกใช้ผ่าน developer API ของ Ant เองและแพลตฟอร์มภายนอกหลายแห่ง สำหรับโมเดลระดับความเร็วสูงในราคานี้ คำถามที่น่าสนใจกว่าคือจะโฮสต์ด้วยตนเอง (FP8 ใช้หน่วยความจำประมาณ 128GB) หรือใช้ผ่าน API ต่อไป

คะแนนอิสระ: AA Intelligence Index เท่ากับ 38
การเปลี่ยนแปลงครั้งใหญ่ที่สุดจากโพสต์เดือนกรกฎาคมคือตอนนี้มีตัวเลขที่เป็นอิสระแล้ว Artificial Analysis มีเพจสำหรับ Ling-3.0-flash และวัดค่าอยู่ที่ 38 บนดัชนีความฉลาด (Intelligence Index) — สูงกว่ารุ่นระดับ fast-tier ก่อนหน้าอยู่ 24 คะแนน อย่าง Ling-2.6-flash (14) และเสมอกับ MiMo-V2.5 และ Qwen 3.6 27B ในขณะที่ใช้พารามิเตอร์เพียงเศษเสี้ยวของพวกมัน Artificial Analysis ยังจัดให้โมเดลนี้อยู่บนเส้นแบ่งประสิทธิภาพ (Pareto frontier) ของ open-weights ด้านความฉลาดเทียบกับจำนวนพารามิเตอร์ทั้งหมด: ไม่มีโมเดล open-weights ใดที่มีจำนวนพารามิเตอร์รวมน้อยกว่าที่ทำคะแนนได้สูงกว่า ผู้นำ open-weights ระดับ flash-tier บน AA อย่าง DeepSeek V4 Flash ยังคงทำคะแนนสูงกว่า (ดัชนี 52 ที่ระดับการใช้เหตุผลสูงสุด)
ผลลัพธ์ด้าน agentic และ long-context แข็งแกร่งในเชิงทิศทางเช่นกัน ในชุดทดสอบ τ3-Bench Banking ของ AA Ling-3.0-flash ได้ 27% เป็นอันดับสองในกลุ่มโมเดล open-weights ระดับ flash รองจาก DeepSeek V4 Flash (39%) ส่วนใน GDPval-AA v2 ทำ Elo ได้ 1108 เพิ่มขึ้นจาก 545 ของ Ling-2.6-flash Ant ฝึกโมเดลบนสภาพแวดล้อมแบบอินเทอร์แอกทีฟกว่า 10,000+ รายการ (ตามรายงานของผู้ผลิต) และชูจุดขายว่าเป็นโหนดปฏิบัติการสำหรับเวิร์กโฟลว์ของเอเจนต์ — เร็ว ถูก และใช้แล้วทิ้งได้ โดยให้งานใช้เหตุผลหนักๆ ตกเป็นของโมเดลเรือธงที่ใหญ่กว่า
ข้อควรทราบประการหนึ่งเกี่ยวกับแหล่งข้อมูล: ตารางเกณฑ์มาตรฐานบนการ์ดโมเดลของ Ant — SWE-Bench Pro 56.6, SWE-bench Multilingual 72.4, MathArena AIME 2026 93.2, HLE 22.7 — เป็นข้อมูลที่รายงานโดยผู้จำหน่ายและยังไม่ได้รับการยืนยันโดยอิสระ ควรถือว่าเป็นข้ออ้างของห้องปฏิบัติการเอง อยู่ในหมวดเดียวกับตัวเลขความเร็วสูงสุดด้านล่างนี้
ความเร็ว: วัดก่อน แล้วจึงอ้าง
เรื่องราวความเร็วตอนนี้แยกเป็นสองเรื่องที่แตกต่างกัน โดยอิสระ Artificial Analysis วัดอัตราการส่งออกได้ประมาณ 368 tokens/วินาที และเวลา-to-first-token ~1.98 วินาทีบน API ฝ่ายแรก — ซึ่งถือว่าเร็วอย่างแท้จริงสำหรับ MoE แบบ 5.1B-active และเพียงพอที่จะทำให้โมเดลติดอันดับใกล้จุดสูงสุดของคลาสในด้านความเร็ว ส่วน Ant Group อ้างว่าอัตราการส่งออกเฉลี่ยมากกว่า 1,100 tokens/วินาทีบนการกำหนดค่า GPU ที่ระบุ และเวลา-to-first-token ต่ำกว่า 100 มิลลิวินาที พร้อมเลเยอร์แคชแบบลำดับชั้นระดับคลัสเตอร์ที่สร้างบน SGLang HiCache และ Mooncake ตัวเลขชุดที่สองนี้เป็นข้อมูลจากผู้จำหน่ายเท่านั้น — วัดบนฮาร์ดแวร์และการตั้งค่าแบบแบตช์ที่ Ant ควบคุม โดยไม่มีการเผยแพร่การทดสอบซ้ำจากฝ่ายอิสระ สำหรับการวางแผน ให้ใช้ตัวเลขจาก AA และถือว่า 1,100+ tok/s เป็นเพดานทางการตลาดที่ต้องตรวจสอบกับเวิร์กโหลดของคุณเอง

ราคา: ถูก และโปรโมชั่นสิ้นสุดแล้ว
Artificial Analysis ระบุราคา API อย่างเป็นทางการไว้ที่ $0.075 ต่อ 1M โทเคนสำหรับอินพุต และ $0.22 ต่อ 1M สำหรับเอาต์พุต โดยการเข้าถึงแคช (cache hit) อยู่ที่ $0.015 (ลดลง 80%) — ทั้งหมดเป็นราคาที่ผู้ให้บริการกำหนด สิทธิ์ใช้งานฟรีในช่วงเปิดตัว (โทเคนฟรี 500k ต่อวัน และการเข้าถึง API ฟรี) สิ้นสุดลงเมื่อวันที่ 3 สิงหาคม และ Ant ได้จัดโปรโมชันลดราคา 75% ชั่วคราวสำหรับ Ling Studio ไปจนถึงวันที่ 31 สิงหาคม 2026 หลังจากนั้นจะคิดตามราคาปกติ แม้ในราคาเต็ม $0.075/$0.22 ก็ทำให้ Ling-3.0-flash อยู่ในกลุ่มราคาถูกอย่างชัดเจนสำหรับโมเดลที่มี Index 38
ที่ราคาต่ำขนาดนี้ ต้นทุนในการเปลี่ยนผู้ให้บริการสำคัญกว่าราคาต่อโทเคน OrcaRouter ถูกสร้างขึ้นเพื่อทำให้การเปลี่ยนนั้นมีต้นทุนต่ำ: API เดียวสำหรับโมเดลมากกว่า 200 รุ่น ราคาตามที่ผู้ให้บริการกำหนดถูกส่งผ่านโดยไม่บวกกำไร และมีการสลับไปใช้ผู้ให้บริการรายอื่นโดยอัตโนมัติ — ดังนั้นเมื่อโมเดลที่เพิ่งเปิดตัวใหม่ เช่นโมเดลนี้ ดูดีบนกระดาษ คุณสามารถทดสอบกับปริมาณงานจริงของคุณได้โดยไม่ต้องทำสัญญาเพิ่มเติม และสลับไปใช้โมเดลอื่นภายใต้คีย์เดียวกันได้หากโมเดลนั้นให้ผลลัพธ์ไม่ดีพอสำหรับงานเฉพาะ
ครอบครัว Ling / Ring / Ming
Ling-3.0-flash ไม่ได้อยู่เพียงลำพัง — InclusionAI จัดระเบียบการเปิดตัวผลิตภัณฑ์ของตนออกเป็นสามตระกูลที่มีชื่อ โดยแต่ละตระกูลออกแบบมาสำหรับงานที่แตกต่างกัน Ling คือไลน์ MoE เอนกประสงค์สำหรับการสร้างข้อความในชีวิตประจำวันและการเรียกใช้เครื่องมือ และ Ling-3.0-flash อยู่ที่ด้านที่เร็ว/ถูกของไลน์นี้ ซึ่งต่ำกว่าเรือธงพารามิเตอร์ 1T ของเจนเนอเรชันก่อนหน้าหนึ่งขั้น Ring คือไลน์ที่เน้นการใช้เหตุผล สร้างขึ้นสำหรับการคิดแบบหลายขั้นตอน Ming คือไลน์มัลติโมดัล หากงานของคุณต้องการการใช้เหตุผลหนักๆ หรือการรับภาพเข้า โมเดล InclusionAI ที่เหมาะสมอาจไม่ใช่ Ling-3.0-flash — มันถูกสร้างขึ้นสำหรับปริมาณและความเร็วในเส้นทางข้อความและเครื่องมือ
เหมาะสำหรับใคร: สามสถานการณ์
1. ไปป์ไลน์ข้อความหรือการเรียกใช้เครื่องมือที่มีปริมาณสูงและไวต่อความหน่วง
นี่คือถิ่นที่โมเดลนี้เชี่ยวชาญ ด้วยค่า Index อิสระที่ 38, ใบอนุญาต MIT และความเร็วที่วัดได้ราว 368 tok/s การเดิมพันระดับความเร็วสูงจึงกลายเป็นสิ่งที่ทดสอบได้จริง ไม่ใช่เพียงสมมุติฐาน — คุณสามารถรันชุดประเมินของคุณเองบนมัน หรือดาวน์โหลดค่าน้ำหนักไปโฮสต์ด้วยตัวเองก็ได้ เพียงแต่อย่าออกแบบระบบโดยยึดเพดาน 1,100+ tok/s ของผู้จำหน่าย จนกว่าคุณจะได้วัดบนภาระงานของคุณเองแล้ว
2. ทีมที่ต้องการบริบทระยะยาวโดยมีงบประมาณจำกัด
บริบทเนทีฟ 256K (ให้บริการ 262K) พร้อมเส้นทางที่ระบุไว้ถึง 1M ที่ราคา $0.075/$0.22 ถือเป็นตัวเลือกที่น่าสนใจสำหรับงานที่ต้องค้นคืนข้อมูลจำนวนมากหรือประมวลผลเอกสาร ตัวเลขบริบทระยะยาวในโมเดลการ์ดเป็นข้อมูลที่ผู้ขายรายงานเอง ดังนั้นควรจัดให้อยู่ในรายการสั้นเพื่อเทียบกับตัวเลือกบริบทระยะยาวที่ใช้งานอยู่แล้ว และตรวจสอบกับคลังข้อมูลของคุณเองก่อนตัดสินใจ
3. ผู้ติดตามที่เฝ้าดูภูมิทัศน์ MoE ของจีนและแผนงานของ InclusionAI
คำถามในเดือนกรกฎาคม — ว่า InclusionAI จะยังเปิดให้บริการอยู่หรือไม่ — ตอนนี้มีคำตอบแล้ว: ใช่, MIT, และรวดเร็ว การที่ Ling-3.0-flash ขึ้นมาอยู่บน AA Pareto frontier ด้วยพารามิเตอร์แอคทีฟ 5.1B คือจุดข้อมูลสำหรับผู้ที่ติดตามว่าห้องแล็บจีนกำลังแข่งขันกันด้วยประสิทธิภาพ มากกว่าจำนวนพารามิเตอร์ดิบ
ยังมีอะไรที่ยังไม่ได้รับการยืนยันอีก
รายการสั้นๆ หลังจากช่องว่างใหญ่ๆ ถูกปิดลงแล้ว การอ้างความเร็วสูงสุดของผู้จำหน่าย (1,100+ tok/s, TTFT ต่ำกว่า 100ms) ไม่มีการวัดซ้ำอย่างอิสระ ตาราง benchmark ใน model-card เป็นข้อมูลที่ผู้จำหน่ายรายงาน FP4/INT4 variants และเส้นทางการปรับใช้ single-DGX-Spark เป็นข้อความจากผู้จำหน่าย และในด้านความรู้ ดัชนี Omniscience ของ AA แสดงให้เห็นว่าการปรับปรุงจากรุ่นก่อนหน้ามาจากการงดตอบเป็นหลัก — อาการหลอน (hallucination) ลดลง (97% → 44%) ขณะที่ความแม่นยำเพิ่มขึ้นเพียงเล็กน้อย (16% → 18%) — ดังนั้นอย่าเข้าใจผิดว่าการกระโดดของดัชนีในพาดหัวคือการก้าวกระโดดความรู้ในทุกด้าน
เมื่อใดที่ไม่ควรใช้
ข้าม Ling-3.0-flash สำหรับงานมัลติโมดัล — นั่นคือไลน์ของ Ming ข้ามมันไปถ้าคุณต้องการเรือธงที่เน้นการให้เหตุผลอย่างหนักหน่วง มากกว่าตัวประมวลผลที่รวดเร็ว — นั่นคือเลนของ Ring หากคุณวางแผนจะโฮสต์ด้วยตัวเอง จงเตรียมงบประมาณสำหรับฮาร์ดแวร์จริง: BF16 อยู่ที่ประมาณ 255GB, FP8 อยู่ที่ประมาณ 128GB และถ้าข้อกล่าวอ้างใดมีความสำคัญสำหรับคุณ ก็ตรวจสอบมัน — ตัวเลขความเร็วสูงสุดและบริบทยาวนั้นเป็นของ Ant จนกว่าห้องแล็บอิสระจะทดสอบซ้ำ
คำถามที่พบบ่อย
Ling-3.0-flash เป็น open weight หรือไม่?
ใช่ ค่าน้ำหนักของโมเดลถูกเปิดเป็นโอเพนซอร์สเมื่อวันที่ 7 สิงหาคม ภายใต้สัญญาอนุญาต MIT บน Hugging Face (inclusionAI/Ling-3.0-flash) และ ModelScope ซึ่งเป็นสัญญาอนุญาตแบบให้สิทธิ์กว้างและสามารถใช้งานเชิงพาณิชย์ได้ — แบบเดียวกับที่ Ling 2.0 และ Ling 2.6 ใช้เผยแพร่ภายใต้สัญญานี้
Ling-3.0-flash มีประสิทธิภาพบนเกณฑ์มาตรฐานอย่างไร?
{{1}}Artificial Analysis วัดดัชนีความฉลาด (Intelligence Index) ได้ 38 คะแนน เพิ่มขึ้น 24 จุดจาก {{KEEP}}Ling-2.6-flash{{/KEEP}} และจัดให้โมเดลนี้อยู่บนเส้นเขตแดนพาเรโต (Pareto frontier) ของโมเดล open-weights ในด้านความฉลาดเทียบกับจำนวนพารามิเตอร์ทั้งหมด{{/1}} {{2}}ตาราง benchmark บนการ์ดโมเดลของ Ant (เช่น {{KEEP}}SWE-Bench Pro 56.6{{/KEEP}}) เป็นข้อมูลที่รายงานโดยผู้พัฒนา และยังไม่มีการตรวจสอบซ้ำอย่างอิสระ{{/2}}
มันเร็วแค่ไหนจริงๆ?
{{1}}Artificial Analysis วัดอัตราเอาต์พุตได้ประมาณ 368 โทเคน/วินาที โดยมีเวลาจนถึงโทเคนแรกประมาณ 1.98 วินาทีบน API ของผู้พัฒนาเอง{{/1}} {{2}}Ant อ้างว่ามีทรูพุตสูงสุด 1,100+ โทเคน/วินาที และ TTFT ต่ำกว่า 100 มิลลิวินาทีบนการกำหนดค่า GPU ที่ระบุ{{/2}} — ซึ่งเป็นตัวเลขจากผู้จำหน่ายที่ยังไม่ผ่านการวัดซ้ำโดยอิสระ
Ling-3.0-flash ราคาเท่าไหร่?
AA ระบุราคา API ของตนเอง (first-party) ที่ $0.075 ต่อ 1 ล้าน input tokens และ $0.22 ต่อ 1 ล้าน output tokens พร้อมส่วนลด 80% สำหรับการเข้าถึงแคช (cache hit) ฟรีเทียร์สำหรับการเปิดตัวสิ้นสุดเมื่อวันที่ 3 สิงหาคม และช่วงลดราคาชั่วคราว 75% สำหรับ Ling Studio จะมีไปจนถึงวันที่ 31 สิงหาคม 2026
หน้าต่างบริบทมีขนาดใหญ่แค่ไหน?
256K แบบเนทีฟ ให้บริการที่ 262,144 โทเคน; Ant อ้างว่าสถาปัตยกรรมสามารถขยายไปถึง 1M ไม่มีการเปิดเผยความยาวเอาต์พุตสูงสุด
ความแตกต่างระหว่าง Ling, Ring และ Ming คืออะไร?
Ling คือกลุ่มโมเดล MoE เอนกประสงค์ของ InclusionAI สำหรับงานข้อความและการเรียกใช้เครื่องมือ โดย Ling-3.0-flash อยู่ในตำแหน่งที่รวดเร็วและประหยัดค่าใช้จ่ายที่สุด Ring คือกลุ่มโมเดลที่เน้นการให้เหตุผล Ming จัดการงานมัลติโมดัล ทั้งสามเป็นตระกูลที่แยกจากกันสำหรับงานที่แตกต่างกัน ไม่ใช่ระดับชั้นของโมเดลเดียว
Ling-3.0-flash เหมือนกับเรือธง 1T รุ่นก่อนหน้าหรือไม่?
ไม่ใช่ Ling-3.0-flash คือรุ่นเทียร์ความเร็วสูงรุ่นใหม่ที่เล็กกว่า (124B รวม / 5.1B แอ็กทีฟ) ส่วนเรือธงพารามิเตอร์ 1T ของเจนเนอเรชันก่อนหน้านั้นยังคงเป็นโมเดลที่ใหญ่กว่า
ฉันควรใช้ Ling-3.0-flash ในระบบ production วันนี้หรือไม่
มีความสมเหตุสมผลมากขึ้นกว่าในเดือนกรกฎาคม เนื่องจากตอนนี้มีคะแนนประเมินจากหน่วยงานอิสระและใบอนุญาต MIT แล้ว เรียกใช้ชุดการประเมินของคุณเองก่อน ตรวจสอบการอ้างสิทธิ์ด้านความเร็วของผู้ขายเทียบกับปริมาณงานของคุณ แล้วจึงตัดสินใจระหว่าง API กับการโฮสต์ด้วยตนเอง (FP8 ใช้หน่วยความจำประมาณ 128GB) ตัวเลขเฉพาะที่มาจากผู้ขายส่วนที่เหลือนั้นมีช่วงแคบพอที่จะวางแผนรองรับได้
บรรทัดล่าง
Ling-3.0-flash ก้าวจาก “เอกสารข้อมูลจำเพาะและการอ้างสิทธิ์ของผู้ขาย” ไปสู่ “น้ำหนักเปิดและคะแนนจากการทดสอบอิสระ” ภายในสองสัปดาห์ ค่า AA Intelligence Index ที่ 38 ด้วยพารามิเตอร์แอ็กทีฟ 5.1B — บนเส้นขอบพาเรโตของโมเดลน้ำหนักเปิด, ใช้สัญญาอนุญาต MIT, ที่ราคา $0.075/$0.22 — ทำให้มันเป็นหนึ่งในโมเดลน้ำหนักเปิดที่มีประสิทธิภาพสูงสุดที่คุณสามารถหยิบมาใช้ได้ในตอนนี้ และเป็นโมเดลที่คุณรันเองได้จริง ข้อจำกัดแคบลงกว่าเดิม: ตัวเลขความเร็วสูงสุดและข้อมูลโมเดลการ์ดยังคงเป็นของ Ant จนกว่าห้องปฏิบัติการอิสระจะทดสอบซ้ำได้ สำหรับงานข้อความปริมาณมากและการเรียกใช้เครื่องมือในราคานี้ มันสมควรค่าแก่การประเมินจริง

