
Ling-3.1-flash เปิดให้ใช้งานแล้วและฟรีเป็นเวลาสองสัปดาห์: 560B MoE ให้บริการอะไรจริง ๆ
- openaiใหม่OpenAI: GPT-6.1 Sol2026-09-2952ความฉลาด
- anthropicใหม่Anthropic: Claude Sonnet 5.52026-09-2856ความฉลาด
- typesafeใหม่TypeSafe: Jev 1.132026-09-24$0.04 / $0.00 ต่อ 1 ล้านโทเค็น · 219 tok/s
- OpenAIใหม่OpenAI: GPT-6 Luna2026-09-2238ความฉลาด
- OpenAIใหม่OpenAI: GPT-6 Sol2026-09-2248ความฉลาด
- Anthropicใหม่Anthropic: Claude Opus 5.52026-09-2258ความฉลาด
- xAIใหม่Grok 4.72026-09-2146ความฉลาด
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 ต่อ 1 ล้านโทเค็น · 117 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 ต่อ 1 ล้านโทเค็น · 1064 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040ความฉลาด
- OpenAIOpenAI: GPT-6 Astra2026-09-0453ความฉลาด77การเขียนโค้ด
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241ความฉลาด76การเขียนโค้ด
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245ความฉลาด76การเขียนโค้ด
- AnthropicAnthropic: Claude Fable 5.12026-09-0153ความฉลาด82การเขียนโค้ด
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 ต่อ 1 ล้านโทเค็น · 41 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 ต่อ 1 ล้านโทเค็น · 104 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642ความฉลาด72การเขียนโค้ด
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 ต่อ 1 ล้านโทเค็น · 213 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845ความฉลาด75การเขียนโค้ด
- obsidianQwen3.8 27B2026-08-1534ความฉลาด68การเขียนโค้ด
Ling-3.1-flash โมเดลแบบ mixture-of-experts ที่มีพารามิเตอร์ราว 560 พันล้าน ซึ่งแล็บ inclusionAI ของ Ant Group ประกาศเมื่อวันที่ 29 ถึง 30 กันยายน 2026 สัปดาห์นี้ไม่ใช่แค่ข่าวประชาสัมพันธ์อีกต่อไป: ตอนนี้มันตอบคำขอบน API เชิงพาณิชย์ที่ใช้งานจริงแล้ว โมเดลนี้กำลังทดลองใช้ฟรีสองสัปดาห์บนเกตเวย์อินเฟอเรนซ์ของบุคคลที่สาม และยังปรากฏอยู่ในผลิตภัณฑ์ Ling Studio ของ Ant เองด้วย — ซึ่งเปลี่ยนคำถามจาก "มันมีอยู่จริงไหม" เป็น "มันให้บริการอะไรได้จริง" คำตอบนั้นแคบกว่าที่ตัวเลขในพาดหัวชี้ให้เห็น Ling-3.1-flash รับข้อความเข้าและส่งข้อความออก; มันให้บริบท 262,144 โทเคน (256K) แม้ประกาศจะระบุว่า 1M เป็นเป้าหมายสุดท้าย; เอาต์พุตถูกจำกัดไว้ที่ 32,768 โทเคน; และยังไม่มีใครเผยแพร่ราคาที่คุณจะต้องจ่ายในวันที่สิบห้า เมื่อช่วงฟรีสิ้นสุดลงและน้ำหนักโมเดลมีกำหนดจะตามออกมา
ช่องว่างระหว่างการ์ดประกาศกับเอนด์พอยต์ที่ใช้งานได้จริงคือสิ่งที่ควรจดจำไว้ให้ดี เพราะการรายงานข่าวส่วนใหญ่เกี่ยวกับการเปิดตัวครั้งนี้ตีความสเปกเสมือนว่าโมเดลนี้ส่งมอบให้ใช้งานได้แล้ววันนี้ แต่ไม่ใช่ Ling-3.1-flash เป็นโมเดลตัวที่สองจากแล็บนี้ในรอบสามเดือนที่ออกมาในลักษณะที่ตัวติดตามอิสระ LLM Releases จัดหมวดไว้อย่างตรงไปตรงมาว่า “weights not released” และความแตกต่างระหว่างสิ่งที่ Ant บอกว่าโมเดลนี้เป็น กับสิ่งที่นักพัฒนาสามารถเรียกใช้งานได้จริงในตอนนี้ คือจุดที่งบประมาณหรือโครงการนำร่องอาจผิดพลาดไปอย่างเงียบ ๆ
อะไรเปลี่ยนไปบ้างระหว่างการประกาศกับวันนี้
การประกาศนั้นเองเป็นโพสต์ระบุสเปก: พารามิเตอร์รวม ~560B, เปิดใช้งาน ~25B ต่อโทเคน, บริบทสูงสุด 1M โทเคน, ตัวเลขการประเมินผลหลักสามตัว และคำสัญญา — "เราวางแผนจะเปิดซอร์สโมเดลในเร็วๆ นี้" ไม่มีสิ่งใดในนั้นเปลี่ยนไป สิ่งที่เปลี่ยนไปคือความพร้อมใช้งาน ภายในหนึ่งวันหลังการประกาศ โมเดลก็เข้าถึงได้บน edge เชิงพาณิชย์ และการทดลองใช้ฟรีก็เปิดให้เข้าถึง endpoint จริงตัวเดียวกับที่เวอร์ชันเสียเงินจะให้: API surface เดียวกัน, โมดัลลิตี้แบบข้อความอย่างเดียวเหมือนกัน, สวิตช์โหมดคิดเดียวกันสำหรับงานเอเจนต์ระยะยาว
สำหรับใครก็ตามที่กำลังตัดสินใจว่าจะลงทุนเวลาเชิงวิศวกรรมกับมันหรือไม่ การทดลองใช้คือเรื่องราวทั้งหมดในสัปดาห์นี้ และมันก็ให้ผลได้ทั้งสองทาง การอนุมานฟรีเป็นเวลาสองสัปดาห์เป็นวิธีที่ถูกจริง ๆ ในการดูว่าโมเดลทำงานอย่างไรกับพรอมป์ของคุณเอง — ซึ่งเป็นสิ่งที่หาได้ยากสำหรับโมเดลขนาดนี้ แต่คำว่าฟรีเป็นสถานะโปรโมชัน ไม่ใช่ราคา ยังไม่มีตารางราคาหลังช่วงทดลองใช้ที่เผยแพร่สำหรับ Ling-3.1-flash ที่ไหนเลย ดังนั้นโมเดลต้นทุนใด ๆ ที่คุณสร้างขึ้นบนระดับฟรีก็เป็นเพียงตัวแทนชั่วคราว จนกว่า Ant และผู้ให้บริการโฮสต์ของมันจะกำหนดตัวเลขลงไป
เอกสารข้อมูลจำเพาะ และตัวเลขสามตัวที่ยังเป็นเพียงคำสัญญา
• พารามิเตอร์ — รวม 560B, ใช้งานจริงประมาณ 25B ต่อโทเคน ตามที่ผู้ขายระบุ และคิดเป็นประมาณสี่เท่าของรุ่นก่อน ซึ่งมีขนาดรวม 124B / ใช้งานจริง 5.1B อัตราส่วนความเบาบางยังคงอยู่ใกล้ 1 ต่อ 22 ดังนั้นส่วนที่เปิดใช้งานจึงไม่ได้เบาบางลงอย่างมีนัยสำคัญ — โมเดลนี้เพียงแต่มีขนาดใหญ่กว่ารุ่นก่อนที่มันเข้ามาแทนอย่างมากเท่านั้น
คอนเท็กซ์ — ให้บริการที่ 262,144 โทเคนในวันนี้ “สูงสุดถึง 1M” คือเป้าหมายเมื่อเปิดใช้งานหน้าต่างแล้ว ไม่ใช่สิ่งที่เอนด์พอยต์ทดลองให้คุณ และเป็นการตีความผิดที่พบบ่อยที่สุดของการเปิดตัวครั้งนี้
• เอาต์พุต — สูงสุด 32,768 โทเค็น ถือว่าเหมาะสมสำหรับลูปของเอเจนต์ แต่จะตึงมือถ้าคุณตั้งใจจะสร้างเอกสารยาว ๆ ในรอบเดียว
• โมดัลลิตี้ — ข้อความเข้า ข้อความออก นี่คือโมเดลข้อความ ความสามารถด้านภาพ เสียง และการป้อนไฟล์ไม่ได้เป็นส่วนหนึ่งของการเปิดตัว และยังไม่มีการระบุวันที่สำหรับสิ่งเหล่านี้
• Reasoning — สแต็กแบบไฮบริดที่มีสวิตช์โหมดคิดอย่างชัดเจน ใช้รูปแบบเดียวกับที่รุ่นก่อนหน้าใช้ โดยมุ่งเป้าไปที่งานเอเจนต์หลายขั้นตอนและงานเรียกใช้เครื่องมือ มากกว่าการแชตแบบเทิร์นเดียว
• เวตและสัญญาอนุญาต — ยังไม่เผยแพร่ นี่คือตัวเลขที่สำคัญที่สุด และเป็นตัวที่ยังไม่มีค่าใด ๆ เลยในตอนนี้: ยังไม่มีที่เก็บ Hugging Face ไม่มีข้อความสัญญาอนุญาต และไม่มีเช็กพอยต์ที่ดาวน์โหลดได้ ณ วันนี้

การ์ดเบนช์มาร์ก อ่านพร้อมส่วนลดที่มันต้องการ
รายงานของ Ant เองระบุว่า Ling-3.1-flash ได้คะแนนรวม 81.0 จากห้าเบนช์มาร์กสำหรับเอเจนต์ โดยได้ 40.4% บน Terminal-Bench 4.0, 55.9% บน SWE-Atlas และ 65.35% บน HealthBench Professional; ข้อมูลจากบริษัทเองยังระบุเพิ่มว่าได้ 1,673 Elo บน GDPVal-AA v2.1 และ 75.16 บน FrontierSWE ตัวเลขทุกตัวเหล่านั้นเป็นข้อมูลจากฝ่ายแรก ไม่มีฮาร์เนส ไม่มีชุดพรอมป์ต์ และไม่มีน้ำหนักโมเดลให้คนอื่นรันชุดการทดสอบซ้ำ ซึ่งเป็นข้อแม้มาตรฐานสำหรับโมเดลในขั้นนี้ — และตรงนี้ก็ควรพูดให้ชัดเจนว่า คะแนนจากผู้ขายที่ยังไม่ถูกทำซ้ำเป็นข้อกล่าวอ้างเกี่ยวกับโมเดล ไม่ใช่การวัดตัวโมเดล
การ์ดนี้ยังให้ข้อมูลในแบบที่ผู้เขียนอาจไม่ได้ตั้งใจด้วย ผลลัพธ์ 40.4% บน Terminal-Bench 4.0 ตามหลังกลุ่มแนวหน้าอยู่มาก Claude Sonnet 5.5 ซึ่งเป็นโมเดลขนาดกลางมากกว่าเป็นเรือธง ทำคะแนนได้ 70.6% บนเบนช์มาร์กเวอร์ชันเดียวกัน การตีความตามตรงไม่ใช่ว่า Ling-3.1-flash อ่อน — 40.4% เป็นตัวเลข agentic-terminal ที่นับว่าน่าพอใจสำหรับโมเดลที่วางตำแหน่งด้านต้นทุน — แต่เป็นว่ากรอบคำพูด "ใกล้แนวหน้าบนเบนช์มาร์กสำคัญ" ที่แพร่บนโซเชียลมีเดียในวันประกาศ ไม่ทนต่อการตรวจดูรายแถวข้อมูลเฉพาะ เบนช์มาร์กที่โมเดลดูแข็งแกร่งที่สุด HealthBench Professional ที่ 65.35 ก็เป็นตัวที่มีเชิงอรรถชวนอึดอัดเช่นกัน: Ant ระบุว่ามันถูกประเมินในสภาพแวดล้อมที่บริษัทเรียกว่า AQ และความสามารถด้านสุขภาพของโมเดล "ปัจจุบันสัมผัสได้เฉพาะใน AQ" โดยไม่นิยามว่า AQ คืออะไรที่ใดต่อสาธารณะ คะแนนพาดหัวที่แนบมากับสภาพแวดล้อมไร้นามเป็นเดโม ไม่ใช่ผลลัพธ์ที่ทำซ้ำได้
ทำไมโมเดลขนาดใหญ่ที่มาในรูปแบบทดลองถึงเป็นข่าวจริง
หมากที่น่าสนใจกว่าตรงนี้คือลำดับ ไม่ใช่พารามิเตอร์ Ling-3.0-flash เปิดเวตทันที ส่วนตัวนี้ลงแบบทดลองก่อน โดยยังไม่ปล่อยเวต สัญญาอนุญาต และราคาอย่างเป็นทางการ พร้อมคำมั่นสาธารณะว่าจะเปิดซอร์สเฉพาะหลังจากช่วงฟรีสิ้นสุดลงเท่านั้น นี่คือเพลย์บุ๊กการเปิดตัวเชิงพาณิชย์ที่สวมคราบการประกาศโมเดลเปิด และเป็นความเปลี่ยนแปลงจริงที่ควรติดตาม: ถ้าเวตถูกปล่อยภายใต้สัญญาอนุญาตแบบผ่อนปรน ชุมชนจะได้โมเดลฐาน 560B ไปปรับแต่งละเอียดและกลั่นโมเดล; ถ้ามาพร้อมข้อผูกมัดเชิงพาณิชย์ การทดลองสองสัปดาห์ก็คือตัวผลิตภัณฑ์ และคำว่า "โอเพนซอร์ส" ก็เป็นเพียงการตลาด ไม่ว่าจะทางไหน ทางเลือกนี้จะเกิดขึ้นภายในหน้าต่างการทดลอง และนั่นคือสิ่งที่ต้องจับตา มากกว่าแถวผล benchmark แถวใดแถวหนึ่ง
รันที่ไหน และภาพการกำหนดเส้นทางที่ตรงไปตรงมา
สำหรับตอนนี้ Ling-3.1-flash เข้าถึงได้ผ่านช่องทางผลิตภัณฑ์ของผู้ขายเอง และผ่านแพลตฟอร์ม inference ของบุคคลที่สามที่รันเวอร์ชันทดลอง — และมีเพียงเท่านั้น ยังไม่มีอยู่ในแคตตาล็อกของ OrcaRouter ในวันนี้; การค้นหาผ่าน API โมเดลสาธารณะของเราสำหรับ Ling-3.1-flash, Ling-3.0-flash และเวอร์ชัน vision ของ Ling-3.0 ต่างส่งคืนค่า not-found และเราจะไม่แสร้งทำเป็นอย่างอื่น เมื่อ endpoint ของ Ant เปิดให้ใช้งานทั่วไปพร้อมราคาตามรายการที่ประกาศแล้ว โมเดลแบบ pass-through ที่ OrcaRouter ดำเนินการ — ราคาตามรายการของผู้ให้บริการถูกส่งต่อไปโดยไม่บวกเพิ่ม ดังนั้นเมื่อผู้ขายลดราคา ฝั่งเราจึงมีผลทันทีในวันเดียวกัน — คือรูปแบบที่เหมาะพอดีกับโมเดลที่ราคายังไม่ถูกกำหนด
สิ่งที่คุณทำได้วันนี้ โดยไม่ต้องรอการตัดสินใจเรื่องใบอนุญาต คือการรันการเปรียบเทียบที่สำคัญจริง ๆ สำหรับโมเดลที่ยังไม่มีข้อมูลพิสูจน์: วัดมันเทียบกับโมเดลระดับ Flash ที่คุณเรียกใช้ได้ตอนนี้Gemini 3.8 Flashและ DeepSeek-V4.1-Flash ต่างอยู่ในแค็ตตาล็อกของเราที่ราคาตามรายการของผู้ให้บริการผ่าน API key เพียงตัวเดียวพร้อมการสลับสำรองอัตโนมัติระหว่างกัน สำหรับโมเดลที่อยู่ในช่วงทดลองใช้ฟรีซึ่งทั้งค่าน้ำหนักและเรตการ์ดยังไม่เป็นที่ทราบ นั่นคือวิธีที่สมเหตุสมผลในการถือมันไว้ — ผู้สมัครอีกหนึ่งรายที่คุณกำหนดเส้นทางไปหาได้ตราบเท่าที่การทดลองใช้ยังดำเนินอยู่ และเป็นเส้นทางสู่โปรดักชันที่ไม่ขึ้นกับว่าจะเกิดอะไรขึ้นในวันที่สิบห้า

สิ่งที่ต้องทำในสัปดาห์นี้
หากโมเดลนี้เกี่ยวข้องกับงานของคุณ การทดลองใช้คือเหตุผลที่ควรลงมือตอนนี้แทนที่จะรอให้คำถามเรื่อง open-weight คลี่คลาย — การอินเฟอเรนซ์ฟรีสองสัปดาห์บน 560B MoE คือการประเมินที่ถูกที่สุดที่คุณจะได้ และคำตอบสำหรับ "มันรับมือกับพรอมป์ของฉันได้ไหม" มีให้ใช้ได้วันนี้ แม้ว่าคำตอบสำหรับ "ฉันโฮสต์มันเองได้ไหม" จะยังไม่มีก็ตาม สามสิ่งที่ควรตรวจสอบขณะหน้าต่างยังเปิดอยู่ ตามลำดับ:
• รันเวิร์กโหลดของคุณเอง ไม่ใช่การ์ดเบนช์มาร์ก ตัวเลขที่เผยแพร่คือชุดงานที่ Ant คัดเลือกมา ส่วนพรอมป์ต์ของคุณต่างหากที่เป็นตัวตัดสินสแตกของคุณ
• ทดสอบบริบทที่คุณจะใช้จริง เอนด์พอยต์ให้บริการ 262,144 โทเคน ไม่ใช่ 1M หากการออกแบบของคุณต้องพึ่งพาหน้าต่างที่ใหญ่กว่านั้น คุณกำลังออกแบบโดยอิงกับคำสัญญาเท่านั้น
• อย่าสร้างแบบจำลองต้นทุนบนคำว่า "ฟรี" ฟรีเป็นสภาวะที่อยู่ได้แค่สองสัปดาห์ จนกว่าจะมีการเผยแพร่ตารางราคา ให้วางแผนสลับกลับไปใช้โมเดล Flash-tier ที่มีราคาเป็นค่าเริ่มต้น และมอง Ling-3.1-flash เป็นความจุเสริม
การประกาศเป็นของจริงและโมเดลกำลังทำงาน ซึ่งเป็นสิ่งที่เมื่อสัปดาห์ที่แล้วยังพูดไม่ได้ แต่การเปิดตัวแบบเปิดกว้างกับการรันแบบทดลองเป็นสถานะที่แตกต่างกัน และอันนี้ก็เป็นอย่างหลังอย่างแน่นอน — สเปก 560B, เอนด์พอยต์ 256K, การ์ดผลเบนช์มาร์กจากผู้ขายเท่านั้น และกรอบเวลาสองสัปดาห์ที่เป็นเดดไลน์แน่นอนเพียงหนึ่งเดียวในการเปิดตัวทั้งหมด

การเปรียบเทียบในบทความนี้1
ตรวจพบจากบทความนี้ · เบนช์มาร์ก: Artificial Analysis · อัปเดตทุกวัน
