כרטיס כותרת שנבנה עצמית למאמר החדשות 'LLaDA2.2-mini — News', עם כתובית: 'סוכן מודל־שפה דיפוזי, שהושק בשקט ב־5 בספטמבר 2026', תגי־גלולה: '16B MoE / 1.4B active', '128K context', 'Apache-2.0', וכותרת תחתונה: 'מה שניתן לדעת מהמאגר, ומה שעדיין לא אומת', כשהלוגו של OrcaRouter מורכב בפינה הימנית התחתונה.
Guides & Insights

LLaDA2.2-mini: משקלי סוכן הדיפוזיה של Ant inclusionAI הופיעו בשקט ב-5 בספטמבר

מחבר

Elias Hawthorne

תאריך פרסום

מודלים אחרונים · 20צפו בכל המודלים
בנצ'מרקים: Artificial Analysis · מתעדכן יומית
חזרה לכל הפוסטים

ב-05:16 UTC ב-5 בספטמבר 2026, נוצר מאגר Hugging Face בשם inclusionAI/LLaDA2.2-mini, ונכון לכתיבת שורות אלה זה כמעט כל הסיפור של הפרסום: המשקולות עלו, כרטיס המודל נכתב, והיצרן — inclusionAI, מעבדת Ant Group שעומדת מאחורי סדרת מודלי הדיפוזיה LLaDA — לא אמר דבר על כך. אין פוסט השקה, אין פריסה ברשתות חברתיות, אין רשומה בטבלת המודלים בקובץ ה-README של inclusionAI/LLaDA2.X ב-GitHub, שבו יושב LLaDA2.2-flash הגדול יותר לבדו. עשרים וארבע שעות לאחר שהמאגר הופיע, מונה ההורדות שלו עמד על אפס. זהו מאמר מסוג "מה ידוע לנו עד כה" על LLaDA2.2-mini, והמשמעת של פורמט זה חשובה כאן, כי כמעט כל מספר מעניין שקשור למודל הוא מספר שהקלידה inclusionAI על הכרטיס שלה. מאמר זה מפריד בין מה שניתן לאמת באופן בלתי תלוי בפרסום לבין מה שדווח על ידי היצרן, ומציין את השאלות הפתוחות במקום להחליק אותן.

הגרסה הקצרה, למי שרוצה רק את הצורה הכללית: LLaDA2.2-mini הוא האח הקטן של מודל השפה הדיפוזי LLaDA2.2-flash, שחברת inclusionAI הכריזה עליו ביולי 2026. הוא זמין עכשיו כצ'קפוינט בסגנון תערובת מומחים עם 16 מיליארד פרמטרים, שמפעיל רק 1.4 מיליארד פרמטרים לכל טוקן, רץ על קונטקסט של 128K, ואומן לעבודה אג'נטית — קריאה לכלים, תיקון רב-סבבים — באמצעות דיקודר דיפוזיה שיכול להכניס ולמחוק טוקנים תוך כדי ייצור. הוא מופץ תחת הרישיון Apache-2.0. ומכיוון שהמשקלים בני יום אחד ואין מאחוריהם שום הכרזה, עדיין לא קיימת התשתית הרגילה: אין הערכה בלתי תלויה, אין API מתארח שאנחנו יכולים למצוא, ואין מדריכי פריסה מעבר למה שהכרטיס עצמו ממליץ. מה שאפשר לאמת היום הוא הארכיטקטורה, הרישיון, והמספרים ש-inclusionAI בחרה לפרסם.

המהדורה היא מאגר, לא אירוע

התחילו במה שאפשר לבדוק בלי לתת אמון באיש. ממשק ה-API של Hugging Face מתעד את inclusionAI/LLaDA2.2-mini כמודל שנוצר ב-5 בספטמבר 2026 ועודכן לאחרונה באותו יום. הוא מופץ תחת רישיון Apache-2.0, משתמש בפורמט safetensors עם טנסורים מסוג bf16, כולל תבנית צ'אט, ודורש trust_remote_code מכיוון שארכיטקטורת הדיפוזיה מופצת כקוד מודל מותאם אישית. הריפו התאום, inclusionAI/LLaDA2.2-flash, נוצר ב-16 ביולי 2026, צבר אלפי הורדות ועשרות לייקים בשבועות שחלפו מאז, והוכרז בפומבי. ה-mini לא זכה לא להכרזה ולא לאימוץ — ביום הראשון הוא רשם כמות לייקים חד-ספרתית ואפס הורדות.

A screenshot of the Hugging Face model page for inclusionAI/LLaDA2.2-mini (captured September 6, 2026), showing the tags TextGeneration, Transformers, Safetensors, llada2_moe, dllm, diffusion_lm and custom_code, the Apache-2.0 license, the model-card summary 'LLaDA2.2-mini is the lightweight variant of the agentic diffusion language model in the LLaDA2 series', Model size 16B params, Tensor type BF16, a chat template, the line 'This model isn't deployed by any Inference Provider', and the start of the benchmarks table.

חלקת תשומת הלב הצד-השלישי היחידה שה-mini משך עד כה היא דף אגרגטור שפרסם מחדש את כרטיס המודל בתוך שעות מהופעת ה-repo; זוהי השתקפות של הכרטיס, לא מקור עצמאי, והיא אינה נושאת מידע כלשהו שה-repo עצמו אינו מכיל. זהו כל המרשם הציבורי נכון ל-6 בספטמבר. המסגור שחשוב לקורא שמחליט אם לשים לב: inclusionAI שיגרה כעת פעמיים משקלי diffusion בשקט באותו שבוע — מודל זה ב-5 בספטמבר, ונקודות הביקורת של מחולל LLaDA-Image יום קודם לכן — כך שנשירה שקטה של repo נראית כדפוס פרסום מבוסס של המעבדה, לא תאונה. שום דבר בדפוס זה אינו אומר לנו האם הודעה רשמית בדרך.

מהו {{KEEP}}LLaDA2.2-mini{{/KEEP}} באמת

הארכיטקטורה היא הנקודה המעניינת ביותר במודל, והיא מתוארת במלואה על גבי הכרטיס. LLaDA2.2-mini הוא מודל שפה דיפוזי עם תמהיל מומחים (Mixture-of-Experts) הבנוי על תשתית LLaDA2.0-mini. מודלי שפה דיפוזיים הופכים את לולאת היצירה הרגילה: במקום מודל אוטורגרסיבי שמנבא טוקן אחד בכל פעם, מודל שפה דיפוזי מתחיל מגוש של טוקנים מוסווים או רועשים, ומשכלל את כל הגוש במקביל, תוך ניקוי רעש (denoising) כדי להגיע לרצף קוהרנטי. מנגנון היצירה של LLaDA2.2 מוסיף את מה ש-inclusionAI מכנה "עריכת לוונשטיין": שני טוקני בקרה, DELETE ו-INSERT, שמאפשרים למפענח לשנות את האורך והמבנה של הרצף שהוא מייצר, ולא רק את תוכנו — להסיר קטע מיותר שכבר נכתב, או לפתוח נקודת הכנסה שבה צריך להיכנס קונטקסט חדש (למשל, תוצאת כלי). זהו המנגנון שבו המשפחה משתמשת כדי לגרום לפענוח הדיפוזי לעבוד בלולאות מרובות-סיבובים (multi-turn) שמשתמשות בכלים, שבהן מודל אוטורגרסיבי יכול פשוט להמתין לפניית המשתמש הבאה, אבל מודל דיפוזיה מבוסס-בלוקים חייב לתקן את מה שכבר יצר.

המפרטים הרלוונטיים, כולם ישירות מכרטיס המודל: {{1}}16 מיליארד פרמטרים בסך הכול, לא כולל embeddings{{/1}}, {{2}}1.4 מיליארד פעילים לכל טוקן{{/2}} דרך {{3}}MoE עם 256 מומחים, כש-8 מומחים מנותבים לכל טוקן{{/3}}; {{4}}20 שכבות, 16 ראשי קשב ו-4 ראשי KV{{/4}}; {{5}}אוצר מילים של 157,184 טוקנים{{/5}}; {{6}}ייצוגי מיקום סיבוביים (Rotary Position Embeddings){{/6}}; ו{{7}}חלון הקשר של 128K{{/7}}. טכניקה בשם Block Routing מגבילה אילו מומחים מופעלים ברמת בלוק הדיפוזיה, וכך המודל מצליח להפוך חלון הקשר של 128K למעשי על GPU צרכני יחיד. כרטיס המודל מייעד אותו לכרטיס גרפי של 24GB ומעלה וממליץ על SGLang כ-backend הגשה לעומסי עבודה סוכניים (agentic) ארוכי-הקשר.

A self-built timeline graphic titled 'The LLaDA family, to September 5, 2026' with four node cards: 'LLaDA2.0 — Nov 2025 — First diffusion LM scaled to 100B', 'LLaDA2.1 — Feb 2026 — Token editing for faster diffusion', 'LLaDA2.2-flash — Jul 2026 — Agentic diffusion · ~100B, announced', and 'LLaDA2.2-mini — Sep 5, 2026 — 1.4B-active agent · weights, quiet', with a footer 'Per the inclusionAI/LLaDA2.X GitHub README and Hugging Face repository timestamps' and the OrcaRouter logo composited in the bottom-right corner.

למעלה מוצג המיקום של הגרסה בציר הזמן של המשפחה — השושלת שהופכת את "LLaDA2.2-mini" למובן. LLaDA2.0 בנובמבר 2025 היה מודל השפה הדיפוזי הראשון שהורחב ל-100 מיליארד פרמטרים; LLaDA2.1 בפברואר 2026 הוסיף עריכת טוקנים לדיפוזיית טקסט מהירה יותר; דור LLaDA2.2, שהוכרז ביולי 2026 יחד עם LLaDA2.2-flash והדו"ח הטכני שלו, כיוון את המשפחה לעבר סוכנים. ה-mini הוא החלק של אותו דור שנותר בגדר הבטחה עד עכשיו: הסיקור של גרסת יולי כבר הזכיר וריאנט 16B קל יותר של ה-flash לפריסה זולה יותר, אבל המשקלים העצמאיים התממשו רק ב-5 בספטמבר.

המספרים על הכרטיס, שמסומנים כפי שהם.

טבלת ההשוואה בכרטיס המודל היא של inclusionAI עצמו, פורסמה ביום שבו עלו המשקולות, ואף מעבדה עצמאית לא שחזרה אף אחת מהתוצאות — ל-Artificial Analysis אין ערך עבור LLaDA2.2-mini, ואיננו מוצאים שום ריצה של צד שלישי. יש לקרוא את המספרים כטענות של הספק בעלות כיוון, לא כעובדות מדודות. במסגרת הזו, הסיפור שהכרטיס מספר הוא עקבי: LLaDA2.2-mini הוא מומחה לפעולות אוטונומיות ולהקשר ארוך, והוא מקריב כמה נקודות במדדים כלליים כדי להגיע לכך.

• ממוצע Agentic — 59.00, מתוך τ²-Bench 57.50, Claw-Eval 57.16, ו-PinchBench 62.33 (דיווח ספק).

• קריאת פונקציות — 47.68 ב-BFCL v4, עלייה מ-25.05 ו-28.44 עבור LLaDA2.0-mini ו-LLaDA2.1-mini בהתאמה; 69.02 ב-BFCL v3 הישן.

• הקשר ארוך — 34.99 ב-LongBench v2, יותר מכפול מה-15.51 ומה-12.13 שהמיניס הקודמים השיגו, וזו התמורה הקונקרטית של חלון ה-128K.

• כללי — ממוצע כללי של 46.47, עם AIME 2026 ב-35.05, OlympiadBench 61.11, LiveCodeBench v6 28.14, GPQA-Diamond 44.41, ו-IFBench 24.93 — כמה מהם מעט נמוכים מהמיני-גרסאות המוקדמות יותר, המחיר הנראה לעין של השקעת תקציב האימון בהתנהגות סוכנת במקום זאת.

A self-built single-column scoreboard titled 'LLaDA2.2-mini — the scoreboard' listing Type 'MoE diffusion LM with Levenshtein editing (DELETE / INSERT)', Total params '16B (excl. embeddings)', Active params '1.4B — top-8 of 256 experts', Context '128K tokens', Agentic avg '59.00 — τ²-Bench 57.50 · Claw-Eval 57.16 · PinchBench 62.33', Function calling 'BFCL v4 47.68 (up from ~25-28 for prior minis)', with a footer 'All figures from the inclusionAI model card — vendor-reported, not independently reproduced' and the OrcaRouter logo composited in the bottom-right corner.

הנקודה האחרונה הזו ראויה להתבוננות, כי היא הסיבה הכנה שבגללה צוות יבחר במודל הזה על פני מודל כללי שנראה חזק יותר על הנייר. LLaDA2.2-mini אינו טוען שהוא המודל הקטן הטוב ביותר במתמטיקה או בביצוע הוראות; הוא טוען שהוא טוב בדבר שמודלי דיפוזיה היו היסטורית חלשים בו — עבודה מתמשכת, רבת-סבבים, תוך שימוש בכלים — תוך שמירה על מספר פרמטרים פעילים נמוך מספיק כדי להיות משמעותי על GPU אחד. הקפיצה ב-BFCL v4 והקפיצה ב-LongBench v2 הם המספרים שישרדו ריצה עצמאית אם כרטיס המודל מדויק בגדול.

להריץ את זה, והפיגום החסר

על הנייר, הדרך להרצת LLaDA2.2-mini היא פשוטה, שכן מדובר בהפצה הנתמכת ב-Transformers באופן ילידי: הכרטיס מציג טעינה שלה עם AutoModelForCausalLM ו-trust_remote_code=True על transformers ≥ 5.2.0, ולאחר מכן קריאה ל-generate עם פרמטרים ייחודיים לדיפוזיה — אורך בלוק של 32 וטמפרטורה של 0.0 הם ברירות המחדל המומלצות, והכרטיס ממליץ על אורך פלט של 32,768 טוקנים עבור רוב השאילתות. לשירות ארוך-הקשר מבוסס-סוכנים (agentic) הוא מפנה אל SGLang, ומשתמשים בסין היבשתית מקבלים מראת ModelScope. מה שעדיין לא קיים הוא האקוסיסטם שמסביב: אין API מתארח אצל אף ספק שנוכל לאמת, אין מבני GGUF שנוכל למצוא, ותמיכת הפריימוורק עדיין מתגבשת — העבודה הקהילתית על ארכיטקטורת LLaDA2 ב-llama.cpp היא חדשה, כך שסיפור הקוונטיזציה דל.

השילוב הזה — פרדיגמת פענוח חדשה באמת, בת יום, זמינה רק בהתקנה עצמית — הוא בדיוק המצב שבו שכבת ניתוב מצדיקה את קיומה בלי להעמיד פנים שהמודל החדש מוכן לייצור. הדרך לנסות את LLaDA2.2-mini באחריות היא להריץ אותו בעצמך על נתיב בדיקה בעוד הייצור נשאר על מודל בשל, ולשם כך נועד ההתקנה של OrcaRouter: API אחד על פני יותר מ-200 מודלים במחיר המחירון של הספק ללא כל תוספת, גיבוי אוטומטי כך שתקיעות של צ'קפוינט בן יום לא מפילה עובדה, ו-DSL לניתוב שמרכיב קריאה למודל דיפוזיה המארח בעצמך יחד עם מודלים אוטורוגרסיביים מתארחים מאחורי מפתח אחד. כאשר — אם — ספק יצרף את LLaDA2.2-mini לרשימה, אותו מעבר ישיר יחול והמחיר שתראה הוא המחיר של הספק עצמו. עד אז, שורת הזמינות הכנה היא: הורד את המשקולות ברישיון Apache-2.0 מ‑Hugging Face או מ‑ModelScope והרץ אותן בעצמך.

מה לצפות בהמשך

Three things would turn this what-we-know-so-far into a real story, and all three are absent today. First, an announcement: if the LLaDA2.2-flash pattern holds, a launch post and technical-report coverage could follow the quiet repo drop, and it would likely add training details the card omits. Second, an independent run: the agentic average of 59.00 and the BFCL v4 score of 47.68 are the claims most worth reproducing, because agentic benchmarks are the ones where harness choice moves scores the most. Third, serving maturity: SGLang serving guides, a vLLM path, and community quantizations would tell you whether the 1.4B-active footprint is as cheap to operate in practice as the spec sheet suggests. None of those exist on September 6. The weights are real, the license is permissive, and the architecture genuinely is a different way of running an agent — but the evidence that it is a good agent is, for now, one vendor's card.

© 2026 OrcaRouter

לספקים

מפעילים פלטפורמת הסקה (inference)? הציגו את המודלים שלכם ב-OrcaRouter.

providers@orcarouter.ai

הצטרפו לקהילה שלנו

Discordsupport@orcarouter.aiXGitHubYouTube