การ์ดหัวเรื่องที่สร้างขึ้นเองสำหรับบทความข่าว 'LLaDA2.2-mini — News' คำบรรยาย 'เอเจนต์โมเดลภาษาแบบดิฟฟิวชันที่เผยแพร่อย่างเงียบ ๆ เมื่อวันที่ 5 กันยายน 2026' ป้ายกำกับ '16B MoE / 1.4B active', '128K context', 'Apache-2.0' และส่วนท้าย 'สิ่งที่รู้ได้จากที่เก็บโค้ด และสิ่งที่ยังไม่ได้รับการยืนยัน' พร้อมโลโก้ OrcaRouter ประกอบที่มุมล่างขวา
Guides & Insights

LLaDA2.2-mini: น้ำหนักของ Diffusion Agent ของ Ant inclusionAI ปรากฏตัวอย่างเงียบๆ เมื่อวันที่ 5 กันยายน

ผู้เขียน

Elias Hawthorne

วันที่เผยแพร่

โมเดลล่าสุด · 20ดูโมเดลทั้งหมด
เบนช์มาร์ก: Artificial Analysis · อัปเดตทุกวัน
กลับไปยังโพสต์ทั้งหมด

เวลา 05:16 UTC ของวันที่ 5 กันยายน 2026 คลังข้อมูล Hugging Face ชื่อ inclusionAI/LLaDA2.2-mini ได้ถือกำเนิดขึ้น และ ณ เวลาที่เขียนบทความนี้ เกือบทั้งเรื่องราวของการเผยแพร่ครั้งนี้ก็มีเพียงเท่านี้: น้ำหนักของโมเดลถูกอัปโหลดแล้ว การ์ดโมเดลถูกเขียนแล้ว และผู้พัฒนา — inclusionAI ห้องแล็บของ Ant Group ที่อยู่เบื้องหลังโมเดลตระกูล LLaDA ซึ่งเป็น diffusion model — ยังไม่พูดถึงมันเลย ไม่มีโพสต์เปิดตัว ไม่มีการโปรโมตบนโซเชียล ไม่มีรายการในตารางโมเดลของ README บน GitHub ในคลัง inclusionAI/LLaDA2.X ซึ่งมีเพียง LLaDA2.2-flash ที่ใหญ่กว่านั่งอยู่อย่างเดียวดาย ยี่สิบสี่ชั่วโมงหลังจากคลังปรากฏขึ้น ตัวนับดาวน์โหลดของมันอ่านค่าเป็นศูนย์ นี่คือบทความแนว “สิ่งที่เรารู้จนถึงตอนนี้” เกี่ยวกับ LLaDA2.2-mini และวินัยของรูปแบบดังกล่าวสำคัญตรงนี้ เพราะตัวเลขที่น่าสนใจเกือบทุกตัวที่ติดมากับโมเดลคือตัวเลขที่ inclusionAI พิมพ์ลงบนการ์ดของตัวเอง บทความนี้แยกแยะสิ่งที่สามารถตรวจสอบได้โดยอิสระเกี่ยวกับการเผยแพร่ครั้งนี้ ออกจากสิ่งที่รายงานโดยผู้พัฒนา และระบุคำถามที่ยังไม่มีคำตอบ แทนที่จะกลบเกลื่อนมัน

เวอร์ชันสั้นๆ สำหรับคนที่อยากเห็นภาพคร่าวๆ: LLaDA2.2-mini เป็นรุ่นน้องเล็กๆ ของโมเดลภาษาระบบ diffusion ชื่อ LLaDA2.2-flash ที่ inclusionAI ประกาศเมื่อเดือนกรกฎาคม 2026 โดยตอนนี้มีให้ใช้เป็น checkpoint แบบ mixture-of-experts ขนาด 16 พันล้านพารามิเตอร์ แต่เปิดใช้งานเพียง 1.4 พันล้านพารามิเตอร์ต่อโทเค็น รองรับบริบท 128K และถูกฝึกมาเพื่อทำงานแบบ agentic — การเรียกใช้เครื่องมือ การแก้ไขหลายรอบ — โดยใช้ diffusion decoder ที่สามารถแทรกและลบโทเค็นระหว่างการสร้างข้อความได้ อยู่ภายใต้สัญญาอนุญาต Apache-2.0 และเนื่องจาก weights เพิ่งออกมาได้หนึ่งวันโดยยังไม่มีการประกาศอะไรเพิ่มเติม โครงสร้างพื้นฐานทั่วไปจึงยังไม่มี: ไม่มีการประเมินผลอิสระ ไม่มี hosted API ที่เราหาได้ ไม่มีคู่มือการ serving นอกเหนือจากที่การ์ดโมเดลแนะนำเอง สิ่งที่คุณสามารถตรวจสอบได้ในวันนี้คือสถาปัตยกรรม สัญญาอนุญาต และตัวเลขที่ inclusionAI เลือกที่จะเผยแพร่

การปล่อยคือคลังเก็บ ไม่ใช่เหตุการณ์

เริ่มจากสิ่งที่ตรวจสอบได้โดยไม่ต้องเชื่อใจใคร. Hugging Face API บันทึกว่า inclusionAI/LLaDA2.2-mini ถูกสร้างขึ้นเมื่อวันที่ 5 กันยายน 2026 และแก้ไขล่าสุดในวันเดียวกัน. โมเดลนี้ได้รับอนุญาตภายใต้ Apache-2.0 ใช้รูปแบบ safetensors ที่มีเทนเซอร์แบบ bf16 มาพร้อมกับ chat template และจำเป็นต้องใช้ trust_remote_code เนื่องจากสถาปัตยกรรมแบบ diffusion ถูกแจกจ่ายเป็นโค้ดโมเดลที่กำหนดเอง. inclusionAI/LLaDA2.2-flash โปรเจกต์พี่น้องของรีโพสิทอรีนี้ ถูกสร้างขึ้นเมื่อวันที่ 16 กรกฎาคม 2026 มียอดดาวน์โหลดหลายพันครั้งและไลก์หลายสิบครั้งในช่วงหลายสัปดาห์นับตั้งแต่นั้นมา และมีการประกาศเปิดตัวต่อสาธารณะ. ส่วน mini กลับไม่มีการประกาศและไม่ถูกนำไปใช้เลย — ในวันแรกมันมียอดไลก์เพียงหลักเดียวและไม่มีการดาวน์โหลดแม้แต่ครั้งเดียว.

A screenshot of the Hugging Face model page for inclusionAI/LLaDA2.2-mini (captured September 6, 2026), showing the tags TextGeneration, Transformers, Safetensors, llada2_moe, dllm, diffusion_lm and custom_code, the Apache-2.0 license, the model-card summary 'LLaDA2.2-mini is the lightweight variant of the agentic diffusion language model in the LLaDA2 series', Model size 16B params, Tensor type BF16, a chat template, the line 'This model isn't deployed by any Inference Provider', and the start of the benchmarks table.

ความสนใจจากบุคคลภายนอกเพียงหนึ่งเดียวที่ mini ได้รับจนถึงตอนนี้คือหน้าเว็บรวมลิงก์ที่นำ model card ไปเผยแพร่ซ้ำภายในไม่กี่ชั่วโมงหลังจากที่ repo ปรากฏขึ้น มันเป็นสำเนาของการ์ด ไม่ใช่แหล่งข้อมูลอิสระ และไม่มีข้อมูลใดที่ตัว repo เองไม่มี นั่นคือข้อมูลสาธารณะทั้งหมดที่มี ณ วันที่ 6 กันยายน สำหรับผู้อ่านที่กำลังตัดสินใจว่าจะสนใจหรือไม่ มุมมองที่สำคัญคือ: inclusionAI ปล่อย diffusion weights ออกมาอย่างเงียบๆ ถึงสองครั้งในสัปดาห์เดียวกันแล้ว — รุ่นนี้เมื่อวันที่ 5 กันยายน และ LLaDA-Image generation checkpoints ในวันก่อนหน้า — ดังนั้นการปล่อย repo อย่างเงียบๆ จึงดูเหมือนเป็นรูปแบบการเผยแพร่ที่ทางแล็บทำเป็นปกติ ไม่ใช่ความบังเอิญ รูปแบบดังกล่าวไม่ได้บอกเราเลยว่าจะมีการประกาศตามมาหรือไม่

LLaDA2.2-mini แท้จริงแล้วคืออะไร

สถาปัตยกรรมคือจุดที่โมเดลน่าสนใจที่สุด และได้อธิบายไว้อย่างครบถ้วนบนการ์ด LLaDA2.2-mini เป็นโมเดลภาษาประเภทดิฟฟิวชันแบบ mixture-of-experts ที่สร้างบนแกนหลักของ LLaDA2.0-mini โมเดลภาษาดิฟฟิวชันกลับวงจรการสร้างตามปกติ: แทนที่จะเป็นโมเดล autoregressive ที่คาดเดาทีละโทเคนถัดไป โมเดล LLM แบบดิฟฟิวชันเริ่มจากบล็อกของโทเคนที่ถูกมาสก์หรือมีสัญญาณรบกวน แล้วปรับปรุงทั้งบล็อกพร้อมกัน โดยลดสัญญาณรบกวนไปสู่ลำดับที่สอดคล้องกัน การสร้างใน LLaDA2.2 เพิ่มสิ่งที่ inclusionAI เรียกว่าการแก้ไขแบบเลเวนชไตน์: โทเคนควบคุมสองตัวคือ DELETE และ INSERT ที่ทำให้ตัวถอดรหัสเปลี่ยนความยาวและโครงสร้างของลำดับที่กำลังสร้างได้ ไม่ใช่แค่เนื้อหา — เช่น ลบส่วนที่ซ้ำซ้อนที่เขียนไปแล้ว หรือเปิดจุดแทรกสำหรับบริบทใหม่ (เช่น ผลลัพธ์จากเครื่องมือ) ที่ต้องใส่เข้าไป นี่คือกลไกที่ตระกูลโมเดลใช้เพื่อทำให้การถอดรหัสแบบดิฟฟิวชันทำงานในลูปที่มีหลายรอบและใช้เครื่องมือ ซึ่งโมเดล autoregressive สามารถรอการโต้ตอบรอบถัดไปจากผู้ใช้ได้ แต่โมเดลแบบ block-diffusion ต้องปรับแก้สิ่งที่สร้างไว้แล้ว

สเปกที่เกี่ยวข้องทั้งหมดอ้างอิงจากข้อมูลบนการ์ดโดยตรง: มีพารามิเตอร์รวม 16 พันล้านตัว (ไม่รวม embeddings) โดยมีพารามิเตอร์ที่ทำงานจริง 1.4 พันล้านตัวต่อโทเคน ผ่านสถาปัตยกรรม MoE ที่มีผู้เชี่ยวชาญ 256 ราย และเลือกใช้งาน 8 รายต่อโทเคน; มี 20 เลเยอร์, 16 attention heads, 4 KV heads; คำศัพท์ 157,184 โทเคน; ใช้ rotary position embeddings; และมีหน้าต่างบริบท 128K เทคนิคที่เรียกว่า Block Routing จะจำกัดการทำงานของผู้เชี่ยวชาญในระดับ diffusion block ซึ่งเป็นกลไกที่ทำให้โมเดลสามารถรองรับบริบทขนาด 128K บน GPU ระดับผู้ใช้ทั่วไปเพียงตัวเดียวได้ สเปกการ์ดระบุว่าโมเดลนี้เหมาะกับการ์ดจอที่มีหน่วยความจำตั้งแต่ 24GB ขึ้นไป และแนะนำ SGLang เป็น serving backend สำหรับงานแบบ agentic ที่ต้องใช้บริบทยาว

A self-built timeline graphic titled 'The LLaDA family, to September 5, 2026' with four node cards: 'LLaDA2.0 — Nov 2025 — First diffusion LM scaled to 100B', 'LLaDA2.1 — Feb 2026 — Token editing for faster diffusion', 'LLaDA2.2-flash — Jul 2026 — Agentic diffusion · ~100B, announced', and 'LLaDA2.2-mini — Sep 5, 2026 — 1.4B-active agent · weights, quiet', with a footer 'Per the inclusionAI/LLaDA2.X GitHub README and Hugging Face repository timestamps' and the OrcaRouter logo composited in the bottom-right corner.

ข้างต้นคือตำแหน่งที่รุ่นนี้ปรากฏบนไทม์ไลน์ตระกูล — สายเลือดที่ทำให้ "LLaDA2.2-mini" เข้าใจได้ชัดเจน LLaDA2.0 ในเดือนพฤศจิกายน 2025 เป็นโมเดลภาษาประเภทดิฟฟิวชันตัวแรกที่ขยายขนาดเป็น 1 แสนล้านพารามิเตอร์; LLaDA2.1 ในเดือนกุมภาพันธ์ 2026 เพิ่มการแก้ไขโทเค็นเพื่อให้ข้อความดิฟฟิวชันเร็วขึ้น; เจเนอเรชัน LLaDA2.2 ในเดือนกรกฎาคม 2026 ซึ่งประกาศพร้อมกับ LLaDA2.2-flash และรายงานทางเทคนิค ได้ชี้ให้ตระกูลนี้มุ่งสู่วงการเอเจนต์ ส่วน mini คือชิ้นส่วนของเจเนอเรชันนั้นที่ยังคงเป็นเพียงคำมั่นสัญญาจนถึงตอนนี้: บทความเกี่ยวกับการเปิดตัวเดือนกรกฎาคมกล่าวถึงตัวแปร 16B ที่เบากว่าของ flash เพื่อการปรับใช้งานที่ประหยัดกว่า แต่น้ำหนักแบบสแตนด์อโลนเพิ่งถูกปล่อยออกมาจริงในวันที่ 5 กันยายน

ตัวเลขบนการ์ด ซึ่งมีป้ายกำกับว่าคืออะไร

ตาราง benchmark บน model card นี้เป็นของ inclusionAI เอง พิมพ์ออกมาในวันที่ปล่อยน้ำหนักโมเดล และไม่มีห้องแล็บอิสระแห่งใดยืนยันผลได้เลย — Artificial Analysis ไม่มีรายการสำหรับ LLaDA2.2-mini และเราหาการทดสอบจากบุคคลที่สามก็ไม่พบ อ่านตัวเลขเหล่านี้ได้ในฐานะคำกล่าวอ้างของผู้พัฒนาที่มีทิศทาง ไม่ใช่ข้อเท็จจริงที่วัดได้ ภายใต้กรอบนั้น เรื่องราวที่ model card เล่าก็สอดคล้องกัน: LLaDA2.2-mini เป็นผู้เชี่ยวชาญด้านงานแบบเอเจนต์และบริบทยาว และยอมแลกคะแนน benchmark ทั่วไปบางส่วนเพื่อไปถึงจุดนั้น

• ค่าเฉลี่ย Agentic — 59.00 จาก τ²-Bench 57.50, Claw-Eval 57.16 และ PinchBench 62.33 (รายงานโดยผู้ขาย)

• การเรียกใช้ฟังก์ชัน — 47.68 บน BFCL v4 ซึ่งเพิ่มขึ้นจาก 25.05 และ 28.44 สำหรับ LLaDA2.0-mini และ LLaDA2.1-mini ตามลำดับ; และ 69.02 บน BFCL v3 รุ่นเก่า

• บริบทระยะยาว — 34.99 บน LongBench v2 ซึ่งมากกว่าสองเท่าของ 15.51 และ 12.13 ที่ minis รุ่นก่อนหน้าทำได้ ซึ่งเป็นผลลัพธ์ที่จับต้องได้ของหน้าต่าง 128K

• ทั่วไป — ค่าเฉลี่ยโดยรวม 46.47 โดย AIME 2026 ได้ 35.05, OlympiadBench 61.11, LiveCodeBench v6 28.14, GPQA-Diamond 44.41 และ IFBench 24.93 — หลายรายการต่ำกว่ารุ่นมินิก่อนหน้าเล็กน้อย ซึ่งเป็นต้นทุนที่มองเห็นได้ชัดจากการใช้งบประมาณการฝึกไปกับพฤติกรรมแบบเอเจนต์แทน

A self-built single-column scoreboard titled 'LLaDA2.2-mini — the scoreboard' listing Type 'MoE diffusion LM with Levenshtein editing (DELETE / INSERT)', Total params '16B (excl. embeddings)', Active params '1.4B — top-8 of 256 experts', Context '128K tokens', Agentic avg '59.00 — τ²-Bench 57.50 · Claw-Eval 57.16 · PinchBench 62.33', Function calling 'BFCL v4 47.68 (up from ~25-28 for prior minis)', with a footer 'All figures from the inclusionAI model card — vendor-reported, not independently reproduced' and the OrcaRouter logo composited in the bottom-right corner.

ประเด็นสุดท้ายนี้ควรค่าแก่การขบคิด เพราะมันคือเหตุผลที่ตรงไปตรงมาว่าทำไมทีมหนึ่งจึงเลือกโมเดลนี้มากกว่าโมเดลเอนกประสงค์ที่ดูแข็งแกร่งกว่าบนกระดาษ LLaDA2.2-mini ไม่ได้อ้างว่าตัวเองเป็นโมเดลเล็กที่เก่งที่สุดด้านคณิตศาสตร์หรือการทำตามคำสั่ง แต่อ้างว่าทำได้ดีในสิ่งที่โมเดลดิฟฟิวชันเคยทำได้แย่ในอดีต นั่นคืองานที่ต้องใช้เครื่องมืออย่างต่อเนื่องหลายเทิร์น พร้อมกับรักษาจำนวนพารามิเตอร์ที่ใช้งานจริงให้ต่ำพอที่จะทำงานบน GPU ตัวเดียวได้จริง การพุ่งขึ้นของคะแนน BFCL v4 และ LongBench v2 คือตัวเลขที่จะยังคงยืนหยัดได้ในการทดสอบซ้ำอย่างอิสระ หากข้อมูลบนโมเดลการ์ดถูกต้องในภาพรวม

การรันมัน และโครงสร้างที่ขาดหายไป

ในทางทฤษฎี เส้นทางสู่การรัน LLaDA2.2-mini นั้นตรงไปตรงมา เพราะรีลีสนี้เป็นแบบ Transformers-native กล่าวคือ การ์ดระบุให้โหลดด้วย AutoModelForCausalLM และ trust_remote_code=True บน transformers ≥ 5.2.0 จากนั้นจึงเรียกใช้ generate ด้วยพารามิเตอร์เฉพาะของดีฟฟิวชัน โดยค่าเริ่มต้นที่แนะนำคือ block length 32 และอุณหภูมิ 0.0 และการ์ดแนะนำความยาวเอาต์พุต 32,768 โทเคนสำหรับคำถามส่วนใหญ่ สำหรับการให้บริการแบบเอเจนต์ที่มีบริบทยาว การ์ดจะชี้ไปที่ SGLang และผู้ใช้ในจีนแผ่นดินใหญ่จะได้มิเรอร์ ModelScope สิ่งที่ยังไม่มีคือระบบนิเวศโดยรอบ: ไม่มี hosted API บนผู้ให้บริการรายใดที่เราตรวจสอบได้ ไม่มีบิลด์ GGUF ที่เราหาได้ และการรองรับเฟรมเวิร์กที่ยังไม่ลงตัว — งานสถาปัตยกรรม LLaDA2 ใน llama.cpp ของชุมชนเพิ่งเกิดขึ้นไม่นาน ดังนั้นเรื่องการควอนไทซ์จึงยังเบาบาง

การผสมผสานแบบนั้น — กระบวนทัศน์การถอดรหัสแบบใหม่เอี่ยมที่เพิ่งถือกำเนิดได้วันเดียวและรองรับเฉพาะการโฮสต์ด้วยตนเองเท่านั้น — คือสถานการณ์ที่เลเยอร์การจัดเส้นทาง (routing layer) พิสูจน์คุณค่าของมันได้จริง โดยไม่ต้องทำเป็นว่าโมเดลใหม่นี้พร้อมใช้ในโปรดักชัน วิธีทดลองใช้ LLaDA2.2-mini อย่างรับผิดชอบคือให้คุณรันมันเองบนเส้นทางทดสอบ ขณะที่โปรดักชันยังคงใช้โมเดลที่โตเต็มที่ และนั่นคือสิ่งที่ OrcaRouter ถูกออกแบบมาเพื่อรองรับ: API เดียวที่เข้าถึงโมเดลกว่า 200 รายการในราคาที่ผู้ให้บริการกำหนด โดยไม่มีการบวกเพิ่ม (0% markup), failover อัตโนมัติเพื่อที่เช็คพอยต์อายุวันเดียวที่ค้างอยู่จะได้ไม่ทำให้เวิร์กโฟลว์ล่มทั้งระบบ และ routing DSL สำหรับผสานการเรียก diffusion แบบโฮสต์เองเข้ากับโมเดลออโตรีเกรสซีฟที่โฮสต์ไว้ภายใต้คีย์เดียวกัน เมื่อ — ถ้า — ผู้ให้บริการรายใดนำ LLaDA2.2-mini ขึ้นบัญชี หลักการส่งผ่าน (pass-through) แบบเดียวกันก็ยังใช้ และราคาที่เห็นคือราคาของผู้ให้บริการรายนั้นเอง จนกว่าจะถึงตอนนั้น คำตอบที่ตรงไปตรงมาเรื่องความพร้อมใช้งานคือ: ดาวน์โหลดน้ำหนักโมเดล (weights) ภายใต้สัญญาอนุญาต Apache-2.0 จาก Hugging Face หรือ ModelScope แล้วรันด้วยตัวเอง

สิ่งที่ควรดูต่อไป

สามสิ่งที่จะทำให้สิ่งที่เรารู้เพียงเท่านี้กลายเป็นเรื่องราวที่แท้จริงได้ และทั้งสามสิ่งนี้ล้วนไม่มีอยู่ในวันนี้ ประการแรก คือการประกาศ: หากเป็นไปตามรูปแบบของ LLaDA2.2-flash โพสต์เปิดตัวและรายงานทางเทคนิคก็อาจตามหลังการปล่อย repo อย่างเงียบ ๆ และน่าจะเพิ่มรายละเอียดการฝึกที่การ์ดข้อมูลละเว้นไว้ ประการที่สอง คือการรันโดยอิสระ: ค่าเฉลี่ย agentic ที่ 59.00 และคะแนน BFCL v4 ที่ 47.68 เป็นข้อกล่าวอ้างที่น่าทำซ้ำมากที่สุด เพราะเบนช์มาร์กแบบ agentic เป็นประเภทที่การเลือก harness ส่งผลต่อคะแนนมากที่สุด ประการที่สาม คือความสมบูรณ์ของการ serving: คู่มือการ serving ของ SGLang เส้นทาง vLLM และการทำ quantization โดยชุมชนจะบอกคุณได้ว่าการใช้ทรัพยากรแบบ 1.4B-active ถูกเสียค่าใช้จ่ายในทางปฏิบัติจริงตามที่สเปกชี้หรือไม่ ไม่มีสิ่งใดในสามข้อนี้ปรากฏในวันที่ 6 กันยายน น้ำหนักโมเดลมีจริง ใบอนุญาตเป็นแบบ permissive และสถาปัตยกรรมนี้เป็นอีกวิธีหนึ่งที่แตกต่างอย่างแท้จริงในการรันเอเจนต์ — แต่หลักฐานที่ว่ามันเป็นยอดเอเจนต์คือ สำหรับตอนนี้ การ์ดจากผู้ให้บริการเพียงรายเดียวเท่านั้น

© 2026 OrcaRouter

สำหรับผู้ให้บริการ

ให้บริการแพลตฟอร์มการอนุมานอยู่หรือไม่ นำโมเดลของคุณขึ้น OrcaRouter

providers@orcarouter.ai

เข้าร่วมคอมมูนิตี้ของเรา

Discordsupport@orcarouter.aiXGitHubYouTube