
LLaDA2.2-mini: น้ำหนักของ Diffusion Agent ของ Ant inclusionAI ปรากฏตัวอย่างเงียบๆ เมื่อวันที่ 5 กันยายน
- openaiใหม่OpenAI: GPT-6 Astra2026-09-0455ความฉลาด77การเขียนโค้ด
- googleใหม่Google: Gemini 3.8 Flash2026-09-0247ความฉลาด76การเขียนโค้ด
- qwenใหม่Qwen: Qwen3.8 Max (0902)2026-09-0247ความฉลาด72การเขียนโค้ด
- anthropicใหม่Anthropic: Claude Fable 5.12026-09-0157ความฉลาด82การเขียนโค้ด
- Alibabaใหม่Qwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 ต่อ 1 ล้านโทเค็น
- z-aiใหม่Z.ai: GLM 5.3 Flash2026-08-2646ความฉลาด72การเขียนโค้ด
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.15 / $0.29 ต่อ 1 ล้านโทเค็น
- z-aiZ.ai: GLM 5.32026-08-1849ความฉลาด75การเขียนโค้ด
- obsidianQwen3.8 27B2026-08-1541ความฉลาด68การเขียนโค้ด
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1242ความฉลาด69การเขียนโค้ด
- grokSpaceXAI: Grok 4.62026-08-1251ความฉลาด77การเขียนโค้ด
- metaMeta: Muse Spark 1.22026-08-0547ความฉลาด72การเขียนโค้ด
- qwenQwen: Qwen3.8 Max2026-08-0347ความฉลาด72การเขียนโค้ด
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3141ความฉลาด69การเขียนโค้ด
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 ต่อ 1 ล้านโทเค็น
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2454ความฉลาด78การเขียนโค้ด
- googleGoogle: Gemini 3.6 Flash2026-07-2140ความฉลาด69การเขียนโค้ด
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2128ความฉลาด49การเขียนโค้ด
เวลา 05:16 UTC ของวันที่ 5 กันยายน 2026 คลังข้อมูล Hugging Face ชื่อ inclusionAI/LLaDA2.2-mini ได้ถือกำเนิดขึ้น และ ณ เวลาที่เขียนบทความนี้ เกือบทั้งเรื่องราวของการเผยแพร่ครั้งนี้ก็มีเพียงเท่านี้: น้ำหนักของโมเดลถูกอัปโหลดแล้ว การ์ดโมเดลถูกเขียนแล้ว และผู้พัฒนา — inclusionAI ห้องแล็บของ Ant Group ที่อยู่เบื้องหลังโมเดลตระกูล LLaDA ซึ่งเป็น diffusion model — ยังไม่พูดถึงมันเลย ไม่มีโพสต์เปิดตัว ไม่มีการโปรโมตบนโซเชียล ไม่มีรายการในตารางโมเดลของ README บน GitHub ในคลัง inclusionAI/LLaDA2.X ซึ่งมีเพียง LLaDA2.2-flash ที่ใหญ่กว่านั่งอยู่อย่างเดียวดาย ยี่สิบสี่ชั่วโมงหลังจากคลังปรากฏขึ้น ตัวนับดาวน์โหลดของมันอ่านค่าเป็นศูนย์ นี่คือบทความแนว “สิ่งที่เรารู้จนถึงตอนนี้” เกี่ยวกับ LLaDA2.2-mini และวินัยของรูปแบบดังกล่าวสำคัญตรงนี้ เพราะตัวเลขที่น่าสนใจเกือบทุกตัวที่ติดมากับโมเดลคือตัวเลขที่ inclusionAI พิมพ์ลงบนการ์ดของตัวเอง บทความนี้แยกแยะสิ่งที่สามารถตรวจสอบได้โดยอิสระเกี่ยวกับการเผยแพร่ครั้งนี้ ออกจากสิ่งที่รายงานโดยผู้พัฒนา และระบุคำถามที่ยังไม่มีคำตอบ แทนที่จะกลบเกลื่อนมัน
เวอร์ชันสั้นๆ สำหรับคนที่อยากเห็นภาพคร่าวๆ: LLaDA2.2-mini เป็นรุ่นน้องเล็กๆ ของโมเดลภาษาระบบ diffusion ชื่อ LLaDA2.2-flash ที่ inclusionAI ประกาศเมื่อเดือนกรกฎาคม 2026 โดยตอนนี้มีให้ใช้เป็น checkpoint แบบ mixture-of-experts ขนาด 16 พันล้านพารามิเตอร์ แต่เปิดใช้งานเพียง 1.4 พันล้านพารามิเตอร์ต่อโทเค็น รองรับบริบท 128K และถูกฝึกมาเพื่อทำงานแบบ agentic — การเรียกใช้เครื่องมือ การแก้ไขหลายรอบ — โดยใช้ diffusion decoder ที่สามารถแทรกและลบโทเค็นระหว่างการสร้างข้อความได้ อยู่ภายใต้สัญญาอนุญาต Apache-2.0 และเนื่องจาก weights เพิ่งออกมาได้หนึ่งวันโดยยังไม่มีการประกาศอะไรเพิ่มเติม โครงสร้างพื้นฐานทั่วไปจึงยังไม่มี: ไม่มีการประเมินผลอิสระ ไม่มี hosted API ที่เราหาได้ ไม่มีคู่มือการ serving นอกเหนือจากที่การ์ดโมเดลแนะนำเอง สิ่งที่คุณสามารถตรวจสอบได้ในวันนี้คือสถาปัตยกรรม สัญญาอนุญาต และตัวเลขที่ inclusionAI เลือกที่จะเผยแพร่
การปล่อยคือคลังเก็บ ไม่ใช่เหตุการณ์
เริ่มจากสิ่งที่ตรวจสอบได้โดยไม่ต้องเชื่อใจใคร. Hugging Face API บันทึกว่า inclusionAI/LLaDA2.2-mini ถูกสร้างขึ้นเมื่อวันที่ 5 กันยายน 2026 และแก้ไขล่าสุดในวันเดียวกัน. โมเดลนี้ได้รับอนุญาตภายใต้ Apache-2.0 ใช้รูปแบบ safetensors ที่มีเทนเซอร์แบบ bf16 มาพร้อมกับ chat template และจำเป็นต้องใช้ trust_remote_code เนื่องจากสถาปัตยกรรมแบบ diffusion ถูกแจกจ่ายเป็นโค้ดโมเดลที่กำหนดเอง. inclusionAI/LLaDA2.2-flash โปรเจกต์พี่น้องของรีโพสิทอรีนี้ ถูกสร้างขึ้นเมื่อวันที่ 16 กรกฎาคม 2026 มียอดดาวน์โหลดหลายพันครั้งและไลก์หลายสิบครั้งในช่วงหลายสัปดาห์นับตั้งแต่นั้นมา และมีการประกาศเปิดตัวต่อสาธารณะ. ส่วน mini กลับไม่มีการประกาศและไม่ถูกนำไปใช้เลย — ในวันแรกมันมียอดไลก์เพียงหลักเดียวและไม่มีการดาวน์โหลดแม้แต่ครั้งเดียว.

ความสนใจจากบุคคลภายนอกเพียงหนึ่งเดียวที่ mini ได้รับจนถึงตอนนี้คือหน้าเว็บรวมลิงก์ที่นำ model card ไปเผยแพร่ซ้ำภายในไม่กี่ชั่วโมงหลังจากที่ repo ปรากฏขึ้น มันเป็นสำเนาของการ์ด ไม่ใช่แหล่งข้อมูลอิสระ และไม่มีข้อมูลใดที่ตัว repo เองไม่มี นั่นคือข้อมูลสาธารณะทั้งหมดที่มี ณ วันที่ 6 กันยายน สำหรับผู้อ่านที่กำลังตัดสินใจว่าจะสนใจหรือไม่ มุมมองที่สำคัญคือ: inclusionAI ปล่อย diffusion weights ออกมาอย่างเงียบๆ ถึงสองครั้งในสัปดาห์เดียวกันแล้ว — รุ่นนี้เมื่อวันที่ 5 กันยายน และ LLaDA-Image generation checkpoints ในวันก่อนหน้า — ดังนั้นการปล่อย repo อย่างเงียบๆ จึงดูเหมือนเป็นรูปแบบการเผยแพร่ที่ทางแล็บทำเป็นปกติ ไม่ใช่ความบังเอิญ รูปแบบดังกล่าวไม่ได้บอกเราเลยว่าจะมีการประกาศตามมาหรือไม่
LLaDA2.2-mini แท้จริงแล้วคืออะไร
สถาปัตยกรรมคือจุดที่โมเดลน่าสนใจที่สุด และได้อธิบายไว้อย่างครบถ้วนบนการ์ด LLaDA2.2-mini เป็นโมเดลภาษาประเภทดิฟฟิวชันแบบ mixture-of-experts ที่สร้างบนแกนหลักของ LLaDA2.0-mini โมเดลภาษาดิฟฟิวชันกลับวงจรการสร้างตามปกติ: แทนที่จะเป็นโมเดล autoregressive ที่คาดเดาทีละโทเคนถัดไป โมเดล LLM แบบดิฟฟิวชันเริ่มจากบล็อกของโทเคนที่ถูกมาสก์หรือมีสัญญาณรบกวน แล้วปรับปรุงทั้งบล็อกพร้อมกัน โดยลดสัญญาณรบกวนไปสู่ลำดับที่สอดคล้องกัน การสร้างใน LLaDA2.2 เพิ่มสิ่งที่ inclusionAI เรียกว่าการแก้ไขแบบเลเวนชไตน์: โทเคนควบคุมสองตัวคือ DELETE และ INSERT ที่ทำให้ตัวถอดรหัสเปลี่ยนความยาวและโครงสร้างของลำดับที่กำลังสร้างได้ ไม่ใช่แค่เนื้อหา — เช่น ลบส่วนที่ซ้ำซ้อนที่เขียนไปแล้ว หรือเปิดจุดแทรกสำหรับบริบทใหม่ (เช่น ผลลัพธ์จากเครื่องมือ) ที่ต้องใส่เข้าไป นี่คือกลไกที่ตระกูลโมเดลใช้เพื่อทำให้การถอดรหัสแบบดิฟฟิวชันทำงานในลูปที่มีหลายรอบและใช้เครื่องมือ ซึ่งโมเดล autoregressive สามารถรอการโต้ตอบรอบถัดไปจากผู้ใช้ได้ แต่โมเดลแบบ block-diffusion ต้องปรับแก้สิ่งที่สร้างไว้แล้ว
สเปกที่เกี่ยวข้องทั้งหมดอ้างอิงจากข้อมูลบนการ์ดโดยตรง: มีพารามิเตอร์รวม 16 พันล้านตัว (ไม่รวม embeddings) โดยมีพารามิเตอร์ที่ทำงานจริง 1.4 พันล้านตัวต่อโทเคน ผ่านสถาปัตยกรรม MoE ที่มีผู้เชี่ยวชาญ 256 ราย และเลือกใช้งาน 8 รายต่อโทเคน; มี 20 เลเยอร์, 16 attention heads, 4 KV heads; คำศัพท์ 157,184 โทเคน; ใช้ rotary position embeddings; และมีหน้าต่างบริบท 128K เทคนิคที่เรียกว่า Block Routing จะจำกัดการทำงานของผู้เชี่ยวชาญในระดับ diffusion block ซึ่งเป็นกลไกที่ทำให้โมเดลสามารถรองรับบริบทขนาด 128K บน GPU ระดับผู้ใช้ทั่วไปเพียงตัวเดียวได้ สเปกการ์ดระบุว่าโมเดลนี้เหมาะกับการ์ดจอที่มีหน่วยความจำตั้งแต่ 24GB ขึ้นไป และแนะนำ SGLang เป็น serving backend สำหรับงานแบบ agentic ที่ต้องใช้บริบทยาว

ข้างต้นคือตำแหน่งที่รุ่นนี้ปรากฏบนไทม์ไลน์ตระกูล — สายเลือดที่ทำให้ "LLaDA2.2-mini" เข้าใจได้ชัดเจน LLaDA2.0 ในเดือนพฤศจิกายน 2025 เป็นโมเดลภาษาประเภทดิฟฟิวชันตัวแรกที่ขยายขนาดเป็น 1 แสนล้านพารามิเตอร์; LLaDA2.1 ในเดือนกุมภาพันธ์ 2026 เพิ่มการแก้ไขโทเค็นเพื่อให้ข้อความดิฟฟิวชันเร็วขึ้น; เจเนอเรชัน LLaDA2.2 ในเดือนกรกฎาคม 2026 ซึ่งประกาศพร้อมกับ LLaDA2.2-flash และรายงานทางเทคนิค ได้ชี้ให้ตระกูลนี้มุ่งสู่วงการเอเจนต์ ส่วน mini คือชิ้นส่วนของเจเนอเรชันนั้นที่ยังคงเป็นเพียงคำมั่นสัญญาจนถึงตอนนี้: บทความเกี่ยวกับการเปิดตัวเดือนกรกฎาคมกล่าวถึงตัวแปร 16B ที่เบากว่าของ flash เพื่อการปรับใช้งานที่ประหยัดกว่า แต่น้ำหนักแบบสแตนด์อโลนเพิ่งถูกปล่อยออกมาจริงในวันที่ 5 กันยายน
ตัวเลขบนการ์ด ซึ่งมีป้ายกำกับว่าคืออะไร
ตาราง benchmark บน model card นี้เป็นของ inclusionAI เอง พิมพ์ออกมาในวันที่ปล่อยน้ำหนักโมเดล และไม่มีห้องแล็บอิสระแห่งใดยืนยันผลได้เลย — Artificial Analysis ไม่มีรายการสำหรับ LLaDA2.2-mini และเราหาการทดสอบจากบุคคลที่สามก็ไม่พบ อ่านตัวเลขเหล่านี้ได้ในฐานะคำกล่าวอ้างของผู้พัฒนาที่มีทิศทาง ไม่ใช่ข้อเท็จจริงที่วัดได้ ภายใต้กรอบนั้น เรื่องราวที่ model card เล่าก็สอดคล้องกัน: LLaDA2.2-mini เป็นผู้เชี่ยวชาญด้านงานแบบเอเจนต์และบริบทยาว และยอมแลกคะแนน benchmark ทั่วไปบางส่วนเพื่อไปถึงจุดนั้น
• ค่าเฉลี่ย Agentic — 59.00 จาก τ²-Bench 57.50, Claw-Eval 57.16 และ PinchBench 62.33 (รายงานโดยผู้ขาย)
• การเรียกใช้ฟังก์ชัน — 47.68 บน BFCL v4 ซึ่งเพิ่มขึ้นจาก 25.05 และ 28.44 สำหรับ LLaDA2.0-mini และ LLaDA2.1-mini ตามลำดับ; และ 69.02 บน BFCL v3 รุ่นเก่า
• บริบทระยะยาว — 34.99 บน LongBench v2 ซึ่งมากกว่าสองเท่าของ 15.51 และ 12.13 ที่ minis รุ่นก่อนหน้าทำได้ ซึ่งเป็นผลลัพธ์ที่จับต้องได้ของหน้าต่าง 128K
• ทั่วไป — ค่าเฉลี่ยโดยรวม 46.47 โดย AIME 2026 ได้ 35.05, OlympiadBench 61.11, LiveCodeBench v6 28.14, GPQA-Diamond 44.41 และ IFBench 24.93 — หลายรายการต่ำกว่ารุ่นมินิก่อนหน้าเล็กน้อย ซึ่งเป็นต้นทุนที่มองเห็นได้ชัดจากการใช้งบประมาณการฝึกไปกับพฤติกรรมแบบเอเจนต์แทน

ประเด็นสุดท้ายนี้ควรค่าแก่การขบคิด เพราะมันคือเหตุผลที่ตรงไปตรงมาว่าทำไมทีมหนึ่งจึงเลือกโมเดลนี้มากกว่าโมเดลเอนกประสงค์ที่ดูแข็งแกร่งกว่าบนกระดาษ LLaDA2.2-mini ไม่ได้อ้างว่าตัวเองเป็นโมเดลเล็กที่เก่งที่สุดด้านคณิตศาสตร์หรือการทำตามคำสั่ง แต่อ้างว่าทำได้ดีในสิ่งที่โมเดลดิฟฟิวชันเคยทำได้แย่ในอดีต นั่นคืองานที่ต้องใช้เครื่องมืออย่างต่อเนื่องหลายเทิร์น พร้อมกับรักษาจำนวนพารามิเตอร์ที่ใช้งานจริงให้ต่ำพอที่จะทำงานบน GPU ตัวเดียวได้จริง การพุ่งขึ้นของคะแนน BFCL v4 และ LongBench v2 คือตัวเลขที่จะยังคงยืนหยัดได้ในการทดสอบซ้ำอย่างอิสระ หากข้อมูลบนโมเดลการ์ดถูกต้องในภาพรวม
การรันมัน และโครงสร้างที่ขาดหายไป
ในทางทฤษฎี เส้นทางสู่การรัน LLaDA2.2-mini นั้นตรงไปตรงมา เพราะรีลีสนี้เป็นแบบ Transformers-native กล่าวคือ การ์ดระบุให้โหลดด้วย AutoModelForCausalLM และ trust_remote_code=True บน transformers ≥ 5.2.0 จากนั้นจึงเรียกใช้ generate ด้วยพารามิเตอร์เฉพาะของดีฟฟิวชัน โดยค่าเริ่มต้นที่แนะนำคือ block length 32 และอุณหภูมิ 0.0 และการ์ดแนะนำความยาวเอาต์พุต 32,768 โทเคนสำหรับคำถามส่วนใหญ่ สำหรับการให้บริการแบบเอเจนต์ที่มีบริบทยาว การ์ดจะชี้ไปที่ SGLang และผู้ใช้ในจีนแผ่นดินใหญ่จะได้มิเรอร์ ModelScope สิ่งที่ยังไม่มีคือระบบนิเวศโดยรอบ: ไม่มี hosted API บนผู้ให้บริการรายใดที่เราตรวจสอบได้ ไม่มีบิลด์ GGUF ที่เราหาได้ และการรองรับเฟรมเวิร์กที่ยังไม่ลงตัว — งานสถาปัตยกรรม LLaDA2 ใน llama.cpp ของชุมชนเพิ่งเกิดขึ้นไม่นาน ดังนั้นเรื่องการควอนไทซ์จึงยังเบาบาง
การผสมผสานแบบนั้น — กระบวนทัศน์การถอดรหัสแบบใหม่เอี่ยมที่เพิ่งถือกำเนิดได้วันเดียวและรองรับเฉพาะการโฮสต์ด้วยตนเองเท่านั้น — คือสถานการณ์ที่เลเยอร์การจัดเส้นทาง (routing layer) พิสูจน์คุณค่าของมันได้จริง โดยไม่ต้องทำเป็นว่าโมเดลใหม่นี้พร้อมใช้ในโปรดักชัน วิธีทดลองใช้ LLaDA2.2-mini อย่างรับผิดชอบคือให้คุณรันมันเองบนเส้นทางทดสอบ ขณะที่โปรดักชันยังคงใช้โมเดลที่โตเต็มที่ และนั่นคือสิ่งที่ OrcaRouter ถูกออกแบบมาเพื่อรองรับ: API เดียวที่เข้าถึงโมเดลกว่า 200 รายการในราคาที่ผู้ให้บริการกำหนด โดยไม่มีการบวกเพิ่ม (0% markup), failover อัตโนมัติเพื่อที่เช็คพอยต์อายุวันเดียวที่ค้างอยู่จะได้ไม่ทำให้เวิร์กโฟลว์ล่มทั้งระบบ และ routing DSL สำหรับผสานการเรียก diffusion แบบโฮสต์เองเข้ากับโมเดลออโตรีเกรสซีฟที่โฮสต์ไว้ภายใต้คีย์เดียวกัน เมื่อ — ถ้า — ผู้ให้บริการรายใดนำ LLaDA2.2-mini ขึ้นบัญชี หลักการส่งผ่าน (pass-through) แบบเดียวกันก็ยังใช้ และราคาที่เห็นคือราคาของผู้ให้บริการรายนั้นเอง จนกว่าจะถึงตอนนั้น คำตอบที่ตรงไปตรงมาเรื่องความพร้อมใช้งานคือ: ดาวน์โหลดน้ำหนักโมเดล (weights) ภายใต้สัญญาอนุญาต Apache-2.0 จาก Hugging Face หรือ ModelScope แล้วรันด้วยตัวเอง
สิ่งที่ควรดูต่อไป
สามสิ่งที่จะทำให้สิ่งที่เรารู้เพียงเท่านี้กลายเป็นเรื่องราวที่แท้จริงได้ และทั้งสามสิ่งนี้ล้วนไม่มีอยู่ในวันนี้ ประการแรก คือการประกาศ: หากเป็นไปตามรูปแบบของ LLaDA2.2-flash โพสต์เปิดตัวและรายงานทางเทคนิคก็อาจตามหลังการปล่อย repo อย่างเงียบ ๆ และน่าจะเพิ่มรายละเอียดการฝึกที่การ์ดข้อมูลละเว้นไว้ ประการที่สอง คือการรันโดยอิสระ: ค่าเฉลี่ย agentic ที่ 59.00 และคะแนน BFCL v4 ที่ 47.68 เป็นข้อกล่าวอ้างที่น่าทำซ้ำมากที่สุด เพราะเบนช์มาร์กแบบ agentic เป็นประเภทที่การเลือก harness ส่งผลต่อคะแนนมากที่สุด ประการที่สาม คือความสมบูรณ์ของการ serving: คู่มือการ serving ของ SGLang เส้นทาง vLLM และการทำ quantization โดยชุมชนจะบอกคุณได้ว่าการใช้ทรัพยากรแบบ 1.4B-active ถูกเสียค่าใช้จ่ายในทางปฏิบัติจริงตามที่สเปกชี้หรือไม่ ไม่มีสิ่งใดในสามข้อนี้ปรากฏในวันที่ 6 กันยายน น้ำหนักโมเดลมีจริง ใบอนุญาตเป็นแบบ permissive และสถาปัตยกรรมนี้เป็นอีกวิธีหนึ่งที่แตกต่างอย่างแท้จริงในการรันเอเจนต์ — แต่หลักฐานที่ว่ามันเป็นยอดเอเจนต์คือ สำหรับตอนนี้ การ์ดจากผู้ให้บริการเพียงรายเดียวเท่านั้น
