
Kimi Linear מתפשט: כל מודל שניתן לאמת אכן מריץ KDA
- metaחדשMeta: Muse Spark 1.22026-08-0557אינטליגנציה72כתיבת קוד
- qwenחדשQwen: Qwen3.8 Max2026-08-0358אינטליגנציה72כתיבת קוד
- deepseekחדשDeepSeek: DeepSeek V4 Flash 07312026-07-3152אינטליגנציה69כתיבת קוד
- qwenחדשQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 לכל 1M טוקנים · 198 tok/s
- orcaחדשOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463אינטליגנציה78כתיבת קוד
- googleGoogle: Gemini 3.6 Flash2026-07-2152אינטליגנציה69כתיבת קוד
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137אינטליגנציה49כתיבת קוד
- metaMeta: Muse Spark 1.12026-07-1653אינטליגנציה71כתיבת קוד
- kimiMoonshotAI: Kimi K32026-07-1560אינטליגנציה76כתיבת קוד
- openaiOpenAI: GPT-5.6 Luna2026-07-0952אינטליגנציה71כתיבת קוד
- openaiOpenAI: GPT-5.6 Terra2026-07-0957אינטליגנציה77כתיבת קוד
- openaiOpenAI: GPT-5.6 Sol2026-07-0961אינטליגנציה77כתיבת קוד
- grokxAI: Grok 4.52026-07-0856אינטליגנציה72כתיבת קוד
- tencentTencent: Hy32026-07-0642אינטליגנציה59כתיבת קוד
- obsidianQwen3.6 35B A3B Uncensored (Aggressive)2026-07-0232אינטליגנציה42כתיבת קוד
- obsidianGemma4 26B A4B Uncensored (Balanced)2026-07-0226אינטליגנציה39כתיבת קוד
- anthropicAnthropic: Claude Sonnet 52026-06-3055אינטליגנציה72כתיבת קוד
- klingKling: Kling 3.0 Turbo2026-06-1757אינטליגנציה52כתיבת קוד57מתמטיקה
- z-aiZ.ai: GLM 5.22026-06-1653אינטליגנציה69כתיבת קוד60מתמטיקה
"וואו! Kimi-Linear זוכה לאימוץ! זה כמו המודל החיצוני השלישי שאני רואה." זה היה כל הפוסט — שורה אחת מ-@teortaxesTex מ-5 באוגוסט 2026, עם צילום מסך מצורף ואף מודל אחד לא צוין בשמו. הקישור המקוצר שבו מוביל לתמונה, לא ל-repo, כך שאין מה ללחוץ עליו ואין מה לאמת. הטענה ניתנת לבדיקה בכל זאת, והיא חשובה יותר ממה ששורה אחת מרמזת: אם מעבדות אחרות מלבד Moonshot AI בונות כעת על עיצוב הקשב שמאחורי Kimi-Linear-48B-A3B-Instruct ו-Kimi K3, אז Kimi Delta Attention חדל להיות טריק פנימי של מעבדה אחת והתחיל להפוך למרכיב שאנשים אחרים מאמצים. אז יצאנו לחפש את המודלים במקום את צילום המסך. התשובה הקצרה: המקרה החזק ביותר הוא Ling-3.0-flash, שכרטיס המודל שלו עצמו מתאר מחסנית 5:1 של שכבות KDA ו-MLA; המקרה השימושי ביותר הוא checkpoint מחקרי של מעבדה אמריקאית שמכמת כמה עולה KDA טהור; ובקנה מידה frontier, מחוץ ל-Moonshot, אף אחד לא שחרר אותו.
מהי הטענה, ומה היא אינה
מקצוען אחד, צילום מסך אחד, בלי שם מודל, בלי אישוש. זהו כל הבסיס הראייתי ל"צבירת אימוץ", ויש לקרוא אותו כתזכורת לבדוק, ולא כחדשות. לא יכולנו לשחזר את צילום המסך, ולכן שום דבר להלן אינו אישוש שלו — כל מה שבא אחר כך הוא מה שמטא-נתוני המודל הציבוריים הראו ב-5 באוגוסט 2026, כשסרקנו אחריו, ומה שכל מעבדה אומרת בכרטיס המודל שלה. כאשר מספר מגיע ממדידה עצמית של ספק, הוא מסומן כך, כי בסיפור המסוים הזה כמעט כל מספר בכותרות הוא כזה.
מסך אחד ב-Kimi Linear, כי "אימוץ" פירושו לאמץ את זה.
Kimi Linear היא ארכיטקטורת קשב, שפורסמה על ידי צוות Kimi תחת המזהה arXiv 2510.26692 ב-30 באוקטובר 2025, ולא מוצר. הליבה שלה היא Kimi Delta Attention (KDA), הלוקחת את Gated DeltaNet ומחליפה את שער השכחה הגס שלו בדעיכה עדינה ופר-ערוץ, כך שהמצב הרקורסיבי לומד מה לשמור ערוץ אחר ערוץ, במקום בצורה גורפת. העדכון מסודר מחדש לצורת מקטעים (chunked) בפורמט Diagonal-Plus-Low-Rank, במפורש כדי להגיע לליבות טנזור (tensor cores) במקום להשאיר אותן בטלות. המסגור החומרתי הזה הוא כל העניין בעיצוב: קשב ליניארי תמיד היה זול בתיאוריה, ובדרך כלל מאכזב בפועל.
הצ'קפוינטים ששוחררו — Kimi-Linear-48B-A3B-Base ו-Kimi-Linear-48B-A3B-Instruct — הם בעלי 48B פרמטרים בסך הכל עם 3B פעילים, חלון הקשר של 1M טוקנים, ורישיון MIT. השכבות מתחלפות בערך ביחס 3:1, עשרים שכבות KDA לעומת שבע שכבות Multi-Head Latent Attention, כך ששלוש מתוך ארבע שכבות הן מהסוג הרקורסיבי הזול, וכל שכבה רביעית שומרת על קשב גלובלי מדויק.
מה Moonshot מדווח, הכל נמדד מול קו-בסיס MLA מלא שאומן על מתכון זהה — מספרי ספק, שלא שוחזרו באופן עצמאי:
• תפוקת פענוח — עד פי 6 מהיר יותר בזמן לכל טוקן פלט בהקשר של 1M לעומת MLA מלא
• KV cache — עד 75% קטן יותר, וזה מקור התפוקה
• הקשר ארוך — RULER ב-128K: 84.3 עבור Kimi Linear עם האצה פי 3.98, לעומת 81.3 עבור קו הבסיס של MLA
• הקשר קצר — MMLU-Pro ב-4k: 51.0 לעומת 47.2 עבור קו הבסיס של MLA ו-47.9 עבור הכלאה של Gated DeltaNet, במהירות דומה בערך לתשומת לב מלאה, כך שהעיצוב לא קונה מהירות בהקשר ארוך על ידי ויתור על איכות בהקשר קצר
• אבלציית אימון מקדים — ההיברידית 3:1 מגיעה ל-5.65 perplexity בקבוצת האימות, בעוד שתשומת לב מלאה עומדת על 5.77.
המגבלה הכנה על כל זה: עדויות קו הבסיס המותאם נעצרות ב-48B. איש לא בנה תאום 2.8T עם קשב מלא ל-Kimi K3 כדי להשוות אליו, ונכון לבדיקת עובדות מסוף יולי 2026 של טענות ארכיטקטורת K3, לא פורסמו בדיקות עצמאיות ללא קיצורי דרך לזכירת הקשר ארוך לאף אחד מהמודלים. סיפור היעילות נתמך היטב. הסיפור "עולה על קשב מלא" נתמך בסולם מחקר על ידי המעבדה שכתבה את המאמר.

התנופה, עד כה, נראתה כמו הורדות ולא כמו ארכיטקטורות של אחרים: 98,164 הורדות בחודש האחרון, 570 לייקים, ספק הסקה אחד רשום ב-Hugging Face, ועץ מודלים של 2 אדפטורים, 8 כיוונונים עדינים ו-24 קוונטיזציות. פופולרי, ללא ספק. העתקה היא שאלה אחרת.
מקרה האימוץ החזק ביותר: Ling-3.0-flash
Ling-3.0-flash הוא הדגם שהופך את הטענה למציאות. כרטיס ה-Hugging Face שלו מתאר ארכיטקטורת קשב לינארית היברידית מקורית הבנויה ממחסנית מתחלפת של 5:1 של Kimi Delta Attention ו-MLA — 35 שכבות KDA לעומת 7 שכבות MLA עם שער — על מודל Mixture-of-Experts בעל 124B פרמטרים עם 5.1B פעילים לכל טוקן, הקשר של 256K שאומן בהתקדמות של 8K ל-32K ל-256K, ורישיון MIT. זה לא צעצוע מחקר של חובבן; זה מודל מושק ממעבדה מבוססת, והוא מזכיר את מודול הקשב של Moonshot בתיאור הארכיטקטורה שלו.
הוא גם אגרסיבי יותר בזה מאשר Moonshot. Moonshot שומר על שכבה אחת של קשב מדויק מתוך ארבע; Ling-3.0-flash שומר על אחת מתוך שש. אם עיצוב הוא חיסרון, אתה מגן עליו; אתה לא מקדיש פחות שכבות גלובליות מאלה שהמציאו אותו. בקריאה לצד הדור הקודם, זהו מעבר: סקרי הארכיטקטורה של פברואר 2026 שקיטלגו מחלקה זו של מודלים הציגו את מודל הדגל הקודם של Ling עם Lightning Attention בשילוב MLA ביחס של 7:1. המנגנון השתנה בין הדורות, והכיוון שאליו השתנה היה לעבר KDA.
שתי הסתייגויות שלא נטאטא מתחת לשטיח. זה מדווח לפי הכרטיס: קראנו את תיאור הארכיטקטורה של המאגר עצמו ואת התצורה שלו, שמצהירה על סוג מודל מותאם אישית בשם bailing_hybrid עם מימוש BailingMoeV3 — לא ביצענו ביקורת על הקרנלים כדי לאשר שהמתמטיקה היא KDA ולא רק בהשראת KDA. והמאגר לא נושא תג KDA כלל; מה שצץ בחיפוש תגים הוא המרת GGUF של צד שלישי שמישהו אחר תייג.这是一种 אזהרה שימושית על מתודולוגיה, ומובילה ישירות לשני החלקים הבאים.
Arcee AI הריצה את הניסוי שמונשוט לא.
השימוש החיצוני האינפורמטיבי ביותר ב-KDA אינו מוצר כלל. כשישה שבועות לאחר פרסום מאמר ה-Kimi Linear, באמצע דצמבר 2025, פרסמה Arcee AI שני צ'קפוינטים מחקריים ברישיון Apache-2.0 — AFM-4.5B-Base-KDA-Only ו-AFM-4.5B-Base-KDA-NoPE — תחת היישום ArceeKDAForCausalLM שלהם, עם תג מפורש kimi-delta-attention. השאלה שלהם הייתה זו שהעיצוב ההיברידי של Moonshot נמנע ממנה בקפידה: האם ניתן להחליף את תשומת הלב המלאה לחלוטין? אז הם המירו את כל 24 שכבות תשומת הלב ל-KDA, בלי להשאיר אף שכבת תשומת לב גלובלית, וזיקקו את התוצאה מה-AFM-4.5B-Base המקורי כמורה באורך רצף של 32k.
התוצאות המדווחות שלהם, מורה לעומת תלמיד KDA טהור:
• MMLU — 63.1 ל-55.8, ירידה אמיתית אך ניתנת להישרדות
• GSM8K — מ-52.1 ל-26.8, בערך נחתך בחצי
• HellaSwag — 78.0 עד 74.3, כמעט ללא שינוי

צורת הנזק הזה היא החלק המעניין. ידע רחב והמשך היגיון בריא שורדים ברובם דחיפה דרך מצב רקורסיבי בגודל קבוע. חשבון רב-שלבי, שדורש שליפה מדויקת של תוצאות ביניים שהמודל כתב כמה צעדים קודם לכן, לא שורד. Arcee גם מדווחת שההידרדרות בהקשר ארוך היא הדרגתית, ללא צוק חד. במכלול, זו העדות הציבורית הברורה ביותר לכך שכל פריסה רצינית של KDA היא היברידית: השכבות הגלובליות של Moonshot (אחת מכל ארבע) ושל Ant (אחת מכל שש) אינן ביטוי לביישנות, אלא החלק ששומר על החשבון.
מה זה לא: פסק דין על KDA בקנה מידה גדול. זהו זיקוק של 4.5B, לא ריצת אימון מקדים, וזיקוק לתוך ארכיטקטורה שונה מאבד דברים שאימון מקדים מאפס לא היה מאבד. קראו לזה האבלציה שלספק לא היה תמריץ לפרסם — ממעבדה עצמאית שלא היה לה אינטרס בתשובה.
הזנב הארוך: אשכול של מאגרי KDA זעירים בשבוע אחד
מתחת לשני המקרים החמורים מפוזרים כמה מקרים קטנים, והתאריכים הם שהופכים אותם לראויים לציון. NEXIVON-1B-BASE, שהועלה ב-31 ביולי 2026, מצהיר על סוג המודל שלו כ-kda, פשוטו כמשמעו — Apache-2.0, 285 הורדות, ללא לייקים. qingyi-kda-0.6b, באותו שבוע, הוא מודל Qwen3-0.6B-Base מכוונן (finetune) שמגיע עם מימוש qingyi_kda מותאם אישית. Scrapegoat-Tiny-Coder, גם הוא באותו שבוע, משלב תגית kda עם עיצוב "dual-track parallel attention" משלו. שניים נוספים, maccy-106m-base ו-maccy-96m-16k-base, תויגו ב-kimi-delta-attention ב-27 וב-28 ביולי.
אף אחד מאלה אינו חשוב בפני עצמו — לייקים חד־ספרתיים, מחברים לא ידועים, מספרי פרמטרים בקנה מידה מחקרי. במצטבר, הם כנראה מה שנספר במניין "המודל החיצוני השלישי שאני רואה", ואיננו יכולים לאשר אילו שלושה, כיוון שהפוסט לא ציין אף אחד מהם. האות שבהם אינו המודלים, אלא עשרת הימים: ארבע ריצות אימון קטנות ועצמאיות הגיעו ל־KDA בתוך שבוע וחצי, מה שקורה כשגרעין מפסיק להיות חפץ מחקרי והופך למשהו שאפשר להטמיע בסקריפט אימון במהלך סוף שבוע.
מה שהסריקה לא מצאה
שאלנו את Hugging Face על כל מאגר הנושא את סוג המודל kimi_linear. היו 47. בכל מלבד שלושה יש "Kimi" בשם, ואלה שאינם של Moonshot עצמו הם נגזרות ולא מאמצים: כימותים של AWQ, GPTQ, FP8, NVFP4, SINQ, GGUF ו-MLX בכל עומק סיביות; גרסאות REAP עם גיזום מומחים של 35B מ-Cerebras; ומבני FlagRelease FlagOS של נקודת הבידוק Instruct עבור מאיצי NVIDIA, MetaX ו-Hygon. הקבוצה האחרונה מעניינת באמת מסיבה אחרת — מישהו עשה את העבודה כדי לגרום ל-KDA לרוץ על סיליקון סיני מקומי — אבל אף אחד מזה אינו מעבדה אחרת שמתכננת מודל אחר.
אף מודל ברמת חוד החנית מחוץ למונשוט אינו מצהיר על KDA. Ling-3.0-flash עם 124B בסך הכול ו-5.1B פעילים הוא תקרת האימוץ החיצוני כרגע.
ולשיטה יש חור שכדאי לתת לו שם, משום שהוא סותר את התוצאה השלילית שלנו. מעבדה שמממשת מחדש את KDA רושמת סוג מודל משלה — arcee_kda, qingyi_kda, bailing_hybrid — כך שסריקות תגיות סופרות בחסר באופן שיטתי בדיוק את המאמצים שאנחנו מחפשים, ומודל יכול להשתמש במנגנון בלי לכתוב אי פעם "KDA" בכרטיס שלו. היעדר מתגית הוא ראיה חלשה, לא הוכחה. אם יש מאמץ שקט רביעי או חמישי, זו בדיוק הדרך שבה הוא יישאר בלתי נראה.
כל השאר בחרו באטנציה לינארית שונה
הסיבה לכך ש"Kimi Linear זוכה לאימוץ" היא סיפור בכלל היא שבמשך רוב שנת 2026, זה לא היה כך. קשב לינארי היברידי שטף את תחום המודלים עם המשקלים הפתוחים — אבל לא הווריאציה המסוימת הזו. לפי סקרי הארכיטקטורה שפורסמו בפברואר 2026: גם Qwen3-Next 80B-A3B וגם Qwen3.5-397B-A17B מצמידים את Gated DeltaNet עם קשב מגודר ביחס של 3:1, כלומר Qwen3.5-397B-A17B מריץ 45 שכבות רקורסיביות לעומת 15 שכבות קשב מלא מתוך 60. דגל ה-Ling הקודם השתמש ב-Lightning Attention עם MLA ביחס של 7:1. Nemotron 3 Nano 30B-A3B ו-Super 120B-A12B הם היברידיות של Mamba-2, עם 6 שכבות קשב בלבד בערימה של 52 שכבות ו-8 בערימה של 88 שכבות, בהתאמה. GLM-5 נשאר עם MLA והוסיף קשב דליל בנוסף. MiniMax-M2.5 הלך בכיוון ההפוך לגמרי ושמר על קשב רב-ראשי רגיל, לפי הדיווחים מסיבות של אמינות. ו-Kimi K2.5, מודל הדגל של Moonshot לפני K3, היה MLA — המעבדה פרסמה את KDA באוקטובר 2025 ולא הכניסה אותו למודל הקצה שלה עד יולי 2026.
אז הקטגוריה ניצחה והווריאנט לא. כולם מסכימים ששלושה רבעים מהשכבות שלך יכולות להיות רקורסיביות; אף אחד לא הסכים על איזו רקורסיביות. מבדיל ה-KDA הוא שער הדעיכה לכל-ערוץ, והמחיר שלו הוא שצריך את הקרנלים המותאמים אישית שלו ואת צנרת ה-prefix-caching שלו במקום נתיב ה-Gated DeltaNet שכבר היה בשימוש חצי מהמערכת האקולוגית. עד החודש הזה, מעבדה אחת שילמה את המחיר הזה.
האימוץ שכבר התרחש נמצא בסטאקים של השרתים
ארכיטקטורות אינן מתפשטות בגלל שהן אלגנטיות; הן מתפשטות כשהתשתית הופכת אותן לזולות. החלק הזה כבר הושלם עבור KDA, וזה קרה מהר יותר מאימוץ כרטיסי המודל. גם vLLM וגם SGLang שחררו תמיכה מיום האפס כשהמשקלים של Kimi K3 נחתו ב-27 ביולי 2026, כש-Moonshot העלתה את מימוש ה-prefix-caching של KDA לתוך vLLM עצמו במקום לתחזק פורק. SGLang שחררה קרנלים מאוחים של KDA ושל Gated DeltaNet ודיווחה על קיבולת KV לוגית שגדלה מ-1.5M ל-12.2M טוקנים על חומרה זהה — המדידה שלה עצמה, והנתון הקונקרטי ביותר של יעילות מגורם שלישי בכל הסיפור הזה. קרנלי הייחוס נמצאים ב-fla-core, שכל ריצת אימון קטנה יכולה לייבא.
זה ההבדל בין {{1}}Arcee הזקוקה למאמץ מחקרי מכוון בדצמבר 2025{{/1}} לבין ארבעה מאגרים אנונימיים שמצהירים כלאחר יד על KDA בשבוע אחד ביולי 2026. המנגנון הפך לתלות שאתה מתקין. האם החזית עוקבת זו שאלה נפרדת, אבל טיעון החיכוך נגד KDA התפוגג ברובו.
מה זה משנה אם אתה רק קונה טוקנים?
שום דבר לגבי הקוד שלך. אתה אף פעם לא קורא ל-KDA; אתה חווה אותו כעלות של קונטקסט של מיליון טוקנים וכמה זמן לוקח הטוקן הראשון. Kimi K3 הוא המודל שבו זה בא לידי ביטוי מסחרי היום — ב-OrcaRouter המחיר הוא $3.00 למיליון טוקני קלט ו-$15.00 למיליון טוקני פלט, עם קונטקסט מלא של 1M טוקנים וזמן p50 שנמדד של 8.88 שניות עד לטוקן הראשון בשבעת הימים האחרונים. הכלכלה הזו היא, בעצם, מה שההיברידית KDA ביחס 3:1 קונה: הגשת קונטקסט של מיליון טוקנים במחיר שהוא רק יקר, ולא מופרז.

נקודת הביקורת המחקרית היא עניין שונה. Kimi-Linear-48B-A3B-Instruct הוא ברישיון MIT, עם ספק אינפרנס אחד המופיע בעמוד Hugging Face שלו, והוא אינו ב-OrcaRouter — אם רוצים להריץ אותו, זה אומר אירוח עצמי או אותו ספק. החשבון עבור אירוח עצמי ידידותי יותר ממה שמרמז מספר הפרמטרים: משקלים של 48B ב-bf16 הם בערך 96GB, כך ששני כרטיסים של 80GB, בעוד שהמרות ה-4-bit של MLX ו-GGUF נוחתות קרוב ל-25-30GB ומתאימים לכרטיס יחיד או ל-Mac עם מפרט טוב. Ling-3.0-flash גם הוא לא ב-OrcaRouter כיום. אנחנו לא נעמיד פנים אחרת כדי לטעון טענה לגבי ניתוב.
הנקודה שבה ניתוב אכן משנה כאן היא המחיר של טעות בהימור ארכיטקטוני. מודלים היברידיים של קשב ליניארי הם בדיוק המחלקה שבה טבלת הבנצ'מרק של הספק ועומס העבודה שלך יכולים להתנגש — מצב רקורסיבי בגודל קבוע נכשל על דפוסי שליפה ששום ציון מצטבר אינו חושף, וזה הלקח מאותו מספר GSM8K שהתחצה. הרצת ההשוואה דרך מפתח API אחד על פני 200+ מודלים פירושה שהבדיקה היא שינוי מחרוזת מודל במקום מחזור רכש, במחיר המחירון של הספק עם 0% תוספת מצידנו, ועם failover אוטומטי כך שמודל קונטקסט ארוך שעדיין אתה מעריך אינו נקודת כשל יחידה בנתיב ייצור. נסה את זה על תעבורת הקונטקסט הארוך שלך ליום אחד. זו תשובה זולה יותר מכל טבלת בנצ'מרק, כולל שלנו.
שאלות שכדאי באמת לשאול
האם Kimi Linear הוא אותו דבר כמו Kimi K3?
לא, וערבוב ביניהם הוא הטעות הנפוצה ביותר בסיקור של שניהם. Kimi Linear הוא מאמר הארכיטקטורה ועוד מודל מחקר של 48B בסך הכול, 3B פעילים, עם הקשר של 1M, ששוחרר תחת רישיון MIT בסוף 2025 כדי להדגים שהיברידית כבדת-KDA מנצחת MLA מלא באימון תואם. Kimi K3 הוא דגם הדגל של Moonshot עם 2.8 טריליון פרמטרים מיולי 2026 — 104B פעילים, מולטי-מודאלי במקור, הקשר של 1M — שלקח את רעיון ה-KDA ביחס 3:1 לקנה מידה פורץ דרך והוסיף Attention Residuals, טריק נפרד שלפי דיווחי המעבדה מקנה כ-25% יעילות אימון בעלות נוספת של פחות מ-2%. מנגנון משותף, אבל קנה מידה, יכולות ומחיר שונים לחלוטין. מדדי ביצועים של האחד אומרים מעט מאוד על השני.
מדוע מעבדה תבחר ב-KDA במקום ב-Gated DeltaNet, בהינתן שרובם בחרו ב-Gated DeltaNet?
KDA הוא עידון מחמיר של Gated DeltaNet, כך שהשאלה היא האם העידון שווה את עלות המעבר. העידון הוא השער: Gated DeltaNet מדעיך את הזיכרון הרקורסיבי שלו עם סקלר אחד לכל צעד, ואילו KDA לומד דעיכה לכל ערוץ תכונה, מה שמאפשר למצב להחזיק שם משתנה לאורך עשרת אלפים טוקנים תוך כדי שטיפת המשפט שבו הוא הופיע. האבלציה של Moonshot מעריכה זאת בכ-0.12 perplexity של אימות ב-48B, והניסוח ה-chunked DPLR שלה נכתב כדי להעסיק את ליבות הטנזור, כך שהכושר הביטויי הנוסף אינו עולה בתפוקה שהוא מרוויח. לעומת זאת, ל-Gated DeltaNet כבר הייתה תמיכה רחבה בקרנלים ובמסגרות לפני שכל אחד מהם היה אופנתי, וזה שווה זמן הנדסי אמיתי. התשובה של 2026 הייתה בעיקר "לא שווה את זה." Ling-3.0-flash הוא ההימור הראשון בקנה מידה ייצור בכיוון ההפוך.
האם משהו מזה צריך לשנות את מה שאפרוס ברבעון הזה?
רק אם אתה מריץ קונטקסטים ארוכים מאוד. אם הפרומפטים שלך הם מתחת לכ־32k טוקנים, קשב לינארי היברידי הוא פרט מימוש שאין לו שום השפעה על בחירת המודל; בחר כרגיל לפי איכות, מחיר וחביון. אם אתה דוחף ל־128k והלאה, כדאי לדעת שהמודלים ששומרים על העלויות שלך סבירות באורך כזה הם יותר ויותר היברידיות KDA, ושהציונים המפורסמים שלהם לקונטקסט ארוך הם מדדים מצטברים, לא בדיקות שליפה אדוורסריות. בדוק את האחזור באורך הקונטקסט האמיתי שלך במקום לסמוך על ציון RULER. העצה הזו הייתה זהה גם אם המנגנון היה Gated DeltaNet או Mamba-2.
לאן זה משאיר את הטענה
נכון מבחינת הכיוון, וקטן יותר ממה שנשמע. מה שניתן לאמת ב-5 באוגוסט 2026 הוא מודל ייצור אחד ממעבדה מבוססת, זוג מחקרים אחד ממעבדה אמריקאית עצמאית שפרסמה בכנות את הצד השלילי, קומץ רפוזיטוריות מתחת ל-1B מעשרת הימים האחרונים, ומערכת אקולוגית הגשה שכבר קלטה את הליבה. זה יותר מ"טריק של מעבדה אחת" והרבה פחות מתקן. המספר שצריך לעקוב אחריו הוא לא שלושה מודלים חיצוניים — אלא אם השחרור הבא של מודל open-weight חזיתי ממעבדה שאינה Moonshot יכלול גייטינג per-channel, והאם מישהו מחוץ ל-Moonshot יפרסם אי פעם פרוב recall שבודק מה המצב בגודל הקבוע באמת שוכח. שני אלה יגידו לך יותר מאשר עוד צילום מסך.
