
K-EXAONE-2.0-750B-A37B-DSpark: ה-MoE הקוריאני של LG בגודל 750B מגיע ל-vLLM
- typesafeחדשTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 לכל 1M טוקנים · 36 tok/s
- openaiחדשOpenAI: GPT-6 Luna2026-09-2237אינטליגנציה
- openaiחדשOpenAI: GPT-6 Sol2026-09-2248אינטליגנציה
- anthropicחדשAnthropic: Claude Opus 5.52026-09-2258אינטליגנציה
- grokחדשGrok 4.72026-09-2146אינטליגנציה
- OrcaחדשOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 לכל 1M טוקנים · 181 tok/s
- orcaחדשOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 לכל 1M טוקנים · 1277 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040אינטליגנציה
- openaiOpenAI: GPT-6 Astra2026-09-0453אינטליגנציה77כתיבת קוד
- googleGoogle: Gemini 3.8 Flash2026-09-0241אינטליגנציה76כתיבת קוד
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245אינטליגנציה76כתיבת קוד
- anthropicAnthropic: Claude Fable 5.12026-09-0153אינטליגנציה82כתיבת קוד
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 לכל 1M טוקנים · 110 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642אינטליגנציה72כתיבת קוד
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 לכל 1M טוקנים · 221 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845אינטליגנציה75כתיבת קוד
- obsidianQwen3.8 27B2026-08-1534אינטליגנציה68כתיבת קוד
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236אינטליגנציה69כתיבת קוד
- grokSpaceXAI: Grok 4.62026-08-1244אינטליגנציה77כתיבת קוד
- metaMeta: Muse Spark 1.22026-08-0540אינטליגנציה72כתיבת קוד
ב-9 באוגוסט 2026 נפתח ב-repository של vLLM pull request להוספת K-EXAONE-2.0-750B-A37B-DSpark — גרסת ה-speculative-decoding של דגל הקוריאני של LG AI Research עם 750 מיליארד פרמטרים. ארבעה ימים לאחר מכן, ב-13 באוגוסט, PR שני ויסודי יותר הפך את ההדלפה לקונקרטית: ל-vLLM יש כעת נתיב קונפיגורציה גנרי של DSparkDraftModel, שממפה כל checkpoint של Hugging Face שמצהיר architectures=DSparkDraftModel עם model_type=qwen3 אל ה-Qwen3DSparkModel המוכר, עם תוכנית בדיקה שמשרתת בפועל את ה-drafter RadixArk Qwen3.8-2.4T-A95B-DSpark באמצעות שיטת ה-dspark spec. דגל הבסיס K-EXAONE-2.0-750B-A37B שוחרר ב-31 ביולי תחת Apache 2.0, ובהשקה vLLM יכול היה לשרת אותו עם שיטת ה-MTP draft אבל לא עם DSpark — ה-drafter ש-LG גם משחררת וטוענת שהוא שווה האצת decode של 3–5×. DSpark עצמה היא השיטה של DeepSeek, אותו drafter חצי-אוטורגרסיבי שרץ על DeepSeek-V4-Pro-DSpark ו-DeepSeek-V4-Flash-DSpark, כך ששני ה-PRs יחד הם הסימן הברור ביותר עד כה שמחסנית ה-speculative-decoding של DeepSeek הופכת לברירת המחדל של משקלים פתוחים.
זהו מאמר של מה שאנחנו יודעים עד כה, לא סיפור השקה. שני ה-pull requests פתוחים ולא מוזגו, ל-DSpark checkpoint אין benchmark עצמאי, ונתון ההאצה של LG הוא טענה של ספק. כל מה שלהלן מסומן בהתאם. מה אמיתי היום: המשקולות נמצאות ב-Hugging Face, המודל הבסיסי שוחרר, מפענח ה-spec של vLLM עבור DSpark כבר משרת checkpoints של DeepSeek ו-Kimi, ומסלול התצורה הגנרי שיאפשר לדראפטר DSpark של צד שלישי להיטען — החלק שחיכינו לו בהדלפה הזו — נמצא כעת ב-pull request ציבורי, נבדק אך לא שוחרר.
הגרסה הקצרה
• PR #51558, נפתח ב-9 באוגוסט 2026, מוסיף את K-EXAONE-2.0-750B-A37B-DSpark ל-vLLM; הוא פתוח ועדיין אין אישורים.
• PR #52197, שנפתח ב-13 באוגוסט 2026, מוסיף תמיכת קונפיגורציה גנרית עבור DSparkDraftModel — architectures=DSparkDraftModel עם model_type=qwen3, שמנורמל ל-Qwen3DSparkModel — ותוכנית הבדיקות שלו מריצה את ה-Drafter של RadixArk Qwen3.8-2.4T-A95B-DSpark עם שיטת ה-spec dspark ושבעה spec tokens. גם פתוח, גם לא מוזג.
DSpark הוא ה-drafter ממשפחת EAGLE ש-DeepSeek שחררה כקוד פתוח, והוא כלול ב-DeepSeek-V4-Pro-DSpark וב-DeepSeek-V4-Flash-DSpark; LG הוא האימוץ הבולט ביותר על ידי מעבדה אחרת עד כה, וה-drafter של RadixArk עבור Qwen3.8 הוא שני עצמאי.
גרסת DSpark היא מודל ה-MoE בעל 78 שכבות ו-750B פרמטרים, בתוספת חמש שכבות דראפט; LG טוענת ש-DSpark ו-MTP מספקות כל אחת האצת פענוח של בערך פי 3–5, ומיועדות לעומסי עבודה סוכניים ארוכי טווח.
בהשקה, vLLM תמך ב-MTP עבור K-EXAONE 2.0 אך לא ב-DSpark; ה-PR הספציפי למודל ונתיב התצורה הגנרי הם אמצעי הנחיתה של תמיכת DSpark.
• אף ספק לא מארח היום שום checkpoint של K-EXAONE 2.0, וכל benchmark בכרטיס הוא של LG עצמה.
מה הם ה-pull requests (ומה הם לא)
vLLM PR #51558, "[Model] Add K-EXAONE-2.0-750B-A37B-DSpark," נפתח על ידי lkm2835 — אותו תורם שעמד מאחורי התמיכה הקודמת ב-K-EXAONE ב-vLLM (#50524 עבור המודל הבסיסי) וב-SGLang (#33648). זהו PR מסוג fork שתויג בתווית new-model, נבקשה סקירה מבעלי הקוד של vLLM, ועדיין אין לו אישורים. התיאור הוא שלוש שורות: הוא מוסיף תמיכה עבור checkpoint של DSpark "שפותח על ידי LG AI Research," מקשר לכרטיס המודל של Hugging Face ולדוח הטכני של K-EXAONE 2.0 (arXiv 2608.04505), ומפנה לעבודה הקודמת ב-vLLM ב-#50524.
![Screenshot of vLLM pull request #51558, '[Model] Add K-EXAONE-2.0-750B-A37B-DSpark', captured August 9, 2026. It shows the PR opened by lkm2835 targeting the add-k-exaone2-dspark branch, the description noting the model was 'developed by LG AI Research' with links to the Hugging Face model card and the K-EXAONE 2.0 technical report (arXiv 2608.04505), the open review state with 'At least 1 approving review is required to merge', code-owner reviewers, and the new-model label. English UI.](https://cms.orcarouter.ai/api/media/file/2-70.png)
הפרויקט מ-13 באוגוסט שונה באופיו. #52197, "Support DSpark configs with architectures=DSparkDraftModel + model_type=qwen3," מוסיף שכבת נורמליזציה גנרית: נקודת ביקורת (checkpoint) של Hugging Face שמצהירה על עצמה כ-DSparkDraftModel עם model_type=qwen3 ממופה מחדש ל-Qwen3DSparkModel ש-vLLM's ה-spec-decoder הקיים של vLLM יכול לטעון. מודל הייחוס בתוכנית הבדיקות שלו הוא RadixArk/Qwen3.8-2.4T-A95B-DSpark — ספק DSpark למטרת Qwen3.8-2.4T-A95B ברמת המקסימום — אשר מוגש עם שיטת ה-dspark spec וחלון spec של שבעה טוקנים. הודעת ה-commit היא כל הרעיון: "architectures=DSparkDraftModel+model_type=qwen3." עיקרו של השינוי הוא שטיוטת DSpark של צד שלישי אמורה להיות ניתנת לטעינה באמצעות קונפיגורציה במקום לדרוש קוד ייעודי לכל מודל, וכך כל נקודת DSpark נתמכת מחוברת כיום. הוא פתוח וטרם מוזג, כמו #51558.
קרא את הסטטוס הזה פשוטו כמשמעו. "תמיכה מתווספת" אינו "תמיכה זמינה": עד שתתמזג אחת ה־PRs ותשוחרר בגרסה, build רגיל של vLLM עדיין לא יטעין את גרסת ה־DSpark. כרטיס המודל עצמו אומר שהגשת K-EXAONE 2.0 עם DSpark אינה נתמכת כרגע ב־vLLM, שמשתמש ב־MTP במקום. שתי ה־PRs האלה הם הצעדים שמשנים את המשפט הזה — אם וכאשר הם ינחתו.
למה DSpark הוא הסיפור האמיתי כאן
שם המודל עושה הרבה עבודה. "A37B" פירושו 37 מיליארד פרמטרים פעילים לכל טוקן. "DSpark" הוא דראפטר הפענוח הספקולטיבי ש-DeepSeek הציגה השנה: מודל דראפט חצי-אוטורגרסיבי ממשפחת EAGLE שמציע בלוק של טוקנים במעבר יחיד ומאפשר למודל המטרה לאמת אותם, כך שאיכות הפלט נשארת זהה בעוד היצירה נעשית מהירה יותר. DeepSeek פרסמה אותו כקוד פתוח ומצרפת את הדראפטר עם נקודות הביקורת שלה DeepSeek-V4-Pro-DSpark ו-DeepSeek-V4-Flash-DSpark, עם האצות שדווחו על ידי הקהילה בטווח של 60–85% עבור Flash ו-57–78% עבור Pro, בהשוואה לקו בסיס של MTP עם טוקן יחיד.
מה שה-PR החדש מבהיר הוא שתמיכת DSpark ב-vLLM מעולם לא הייתה השאלה הפתוחה. המסמכים הרשמיים של vLLM כבר כוללים רשימה של מודולי DSpark עבור צ'קפוינטים של DeepSeek-V4, Kimi K3 ו-Gemma4, והצוות תיאר את העיצוב בפוסט הנדסי מיולי. אבל כל אחד מהאינטגרציות האלה מחובר ידנית — רשימה מאושרת של צ'קפוינטים, לא מסלול שכל אחד יכול להשתמש בו. הצ'קפוינט של K-EXAONE פשוט לא נמצא ברשימה הזו. #52197 הוא הניסיון להפוך את המסלול לגנרי: מיפוי קונפיגורציה אחד (DSparkDraftModel עם qwen3) במקום עוד מחלקת מודל ייעודית, ומודל טיוטה של צד שלישי כמקרה מבחן ייחוס במקום מודל DeepSeek. זו הסיבה שסיפור של צ'קפוינט טיוטה מודלף הוא בעצם סיפור תשתית.
K-EXAONE-2.0-750B-A37B-DSpark שומר על 78 השכבות של המודל הבסיסי ומוסיף חמש שכבות דראפט של DSpark, וכרטיס המודל של LG טוען שגם DSpark וגם MTP מאיצים את היצירה בפי 3–5 בערך — המספרים שלו עצמו, המיועדים ל"עומסי עבודה ארוכי טווח כגון משימות סוכן," שבהן זמן ההשהיה של הפענוח הוא הצוואר בקבוק. שני דברים נובעים מכך. ראשית, פענוח ספקולטיבי הופך לתכונה ממדרגה ראשונה של מודלים פתוחים מתקדמים, ולא לטריק שרת שמחברים בדיעבד. שנית, ערימת הדראפט של DeepSeek היא שהופכת לברירת המחדל — וזו בדיוק הסיבה לכך שמודל דגל ריבוני קוריאני, בגיבוי ממשלתי, שמגיע עם הערימה הזו, חשוב מעבר לכתבה הרגילה על "מודל חדש".
המודל שמאחורי ה-PR
K-EXAONE-2.0-750B-A37B-DSpark הוא גרסה של K-EXAONE 2.0, ההמשך לקו K-EXAONE של LG בעל 236B פרמטרים ומודל הבסיס המקומי הגדול ביותר של דרום קוריאה, שנבנה במסגרת תוכנית הבינה המלאכותית הריבונית של הממשלה. מודל הבסיס — 750B פרמטרים בסך הכול, 37B פעילים, Mixture-of-Experts עם 256 מומחים ו-8 פעילים לכל טוקן, חלון הקשר של 262,144 טוקנים, עשר שפות, Apache 2.0 — שוחרר ב-Hugging Face ב-31 ביולי 2026, כשהוא ממוחזר מקודמו בעל 236B במקום להיות מאומן מאפס.

הממוצעים של אמות המידה של LG עצמה (24 אמות מידה, 70.1 בסך הכול) מציגים את הצורה הצפויה למודל ריבוני קוריאני: תוצאות מדווחות חזקות באחזור הקשר ארוך, בבטיחות חברתית-קוריאנית ובתכנות סוכני, לצד נתונים שנמצאים בפיגור אחרי Qwen3.5 של עליבאבא בהנמקה כללית (83.5 לעומת 89.8 ב-MMLU-Pro, לדוגמה). שום דבר מזה לא אומת באופן בלתי-תלוי עדיין. גרסת ה-DSpark לא משנה אף אחד מהציונים האלה — היא רכיב הגשה, דרך מהירה יותר להריץ את אותו מודל — וזה בדיוק למה היא מופיעה ב-pull requests של מסגרות הסקה ולא בהכרזה.
המציאות שמאחורי ההגשה של MoE עם 750B
כאן בעצם חשובה התמיכה של DSpark. K-EXAONE-2.0-750B-A37B-DSpark הוא checkpoint בעל 751 מיליארד פרמטרים בפורמט BF16/F32, וההנחיה של LG היא מינימום של שני צמתים של שמונה NVIDIA H200 GPUs (16 GPUs, tensor-parallel 16). בקנה מידה כזה, תפוקת הפענוח (decode) היא כל המשחק — אסימונים בשנייה, והעלות של פנייה סוכנתית ארוכה — וזה בדיוק מה שפענוח ספקולטיבי תוקף. האצת פענוח פי 3–5, אם היא מתקיימת מחוץ למסגרת הבדיקה של LG, היא ההבדל בין אשכול H200 חסכוני ללא חסכוני. LG גם מתעדת בעיית קריסת יצירה (generation collapse) ב-GPUs מדגם B200 שדורשת את פתרון העוקף --disable-prefill-cuda-graph עד לתיקון — תזכורת לכך שזה שרת חדשני קצה גבוה (bleeding-edge), לא פתרון מוכן מראש.

כמה זה עולה, ואיך באמת תנסו את זה
שום API לא משרת את K-EXAONE 2.0 כיום. כרטיס ה-Hugging Face של הגרסה DSpark עדיין מציג "המודל הזה אינו פרוס על ידי אף ספק הסקה", וטביעת רגל של 16×H200 פירושה שהוא מגיע ל-API מתארח רק כשמישהו עם החומרה הזו מחליט לארח אותו. זו נקודת החיכוך האמיתית: חזית המשקלים הפתוחים היא יותר ויותר בעיית הגשה, לא בעיית זמינות.
כשספק אכן יאמץ את המודל, האצת הפענוח הספקולטיבי תשתקף במחיר לטוקן, ועלות המעבר לנסות אותו תהיה כמעט אפסית אם היישום שלך כבר אינו תלוי במודל ספציפי. ב-OrcaRouter — נקודת קצה אחת תואמת OpenAI על פני 200+ מודלים, כשמחיר המחירון של הספק מועבר ב-0% תוספת — מודל שנוחת אצל ספק כלשהו במעלה הזרם הופך לשינוי ניתוב ולא לאינטגרציה מחדש, וגיבוי אוטומטי (failover) פירושו שמודל MoE חדש לגמרי בגודל 750B שמתגלה כאיטי או לא יציב חוזר למודל מוכר וטוב ללא תקרית. למען הבהירות: OrcaRouter אינו מארח את K-EXAONE-2.0-750B-A37B-DSpark כיום, וגם שום API אחר שמצאנו לא מארח אותו. מטרת שכבת הניתוב היא להיות ערוכה ליום שבו אחד מהם אכן יאמץ אותו.
מה אנחנו צופים
• שני ה-PRs שמתמזגים. #51558 (ספציפי למודל) ו-#52197 (קונפיגורציה גנרית) שניהם פתוחים ללא אישורים. מיזוג ושחרור הם מה שהופכים את "תמיכת DSpark" מ-pull requests לדגלים שבאמת אפשר להעביר.
• היקף הנתיב הגנרי. אם #52197 יתמזג, כל DSparkDraftModel המתויג כ-qwen3 ב-Hugging Face יהיה ניתן לטעינה באמצעות קונפיגורציה — ההבדל בין DSpark כרשימה של checkpoints מאושרים לבין DSpark כתקן פתוח.
• ציון עצמאי ראשון. כל benchmark בכרטיס הוא LG-run. נקודת הנתונים הראשונה של Artificial Analysis או arena על MoE קוריאני 750B תהיה המספר הראשון שלא פורסם על ידי היצרן.
• DSpark מעבר ל-DeepSeek. LG ו-RadixArk הם כעת שני מממשים עצמאיים של שיטת ה-draft של DeepSeek, והנתיב הגנרי של vLLM הוא אות שלישי לכך שהסטאק מתאחד.
• הגשה מקוונטזת. LG משחררת נקודות בקרה (checkpoints) בפורמט FP8 ו-NVFP4 של המודל הבסיסי; וריאנט DSpark מקוונטז שמתאים לפחות GPUs ישנה את הכלכלה מהר יותר מכל מדד ביצועים.
שאלות נפוצות
האם K-EXAONE-2.0-750B-A37B-DSpark שוחרר?
המשקולות נמצאות ב־Hugging Face תחת רישיון Apache 2.0, אבל זה לא סיפור השקה: התמיכה ב־vLLM היא שני pull requests פתוחים שלא מוזגו (#51558 ו־#52197), נתון ההאצה הוא של LG עצמה, ואף ספק לא מאחסן את המודל. המשמעות של "אושר" כאן היא נתיב ההגשה — התמיכה הגנרית בתצורת DSparkDraftModel קיימת כעת ב־PR ציבורי עם תוכנית בדיקה ניתנת להרצה — לא שכל build ששוחרר של vLLM יכול לשרת אותו כבר.
מה ההבדל בין K-EXAONE-2.0-750B-A37B לבין גרסת DSpark?
למודל הבסיס יש 78 שכבות, ועוד חמש שכבות דראפט של DSpark לפענוח ספקולטיבי — אותם משקלים מתחת לפני השטח, אותם מדדי ביצועים, ואובייקט שרת מהיר יותר לפענוח, ולא מודל שונה.
האם DSpark הוא של LG או של DeepSeek?
DSpark היא שיטת הפענוח הספקוליטיבי בקוד פתוח של DeepSeek, המשולבת גם ב-DeepSeek-V4-Pro-DSpark וב-DeepSeek-V4-Flash-DSpark; LG היא המאמצת הבולטת ביותר עד כה, ו-Qwen3.8-2.4T-A95B-DSpark של RadixArk הוא מודל טיוטה עצמאי שני הבנוי על אותה שיטה. כרטיס המודל של LG טוען לאותו טווח האצה של פי 3–5.
האם אני יכול להריץ K-EXAONE-2.0-750B-A37B-DSpark על החומרה שלי היום?
רק באמצעות אירוח עצמי: ההנחיה של LG היא מינימום של 16 GPUs מסוג NVIDIA H200, וגרסאות סטנדרטיות של vLLM, SGLang ו-Transformers עדיין דורשות forks שלא מוזגו או את נתיב התצורה הגנרי שבהמתנה כדי לזהות את הארכיטקטורה. התמיכה ב-DSparkDraftModel ב-#52197 היא הדבר הקרוב ביותר למסלול משותף, אך עדיין מדובר ב-pull request פתוח.
מה שהופך את זה לראוי לצפייה אינו בקשות המשיכה עצמן — אלא מה שהן מאותתות. דגל ריבוני קוריאני עם 750 מיליארד פרמטרים, ברישיון Apache-2.0, בחר לשלב את סטאק הפענוח הספקולטיבי של DeepSeek, חברת אינפרנס עצמאית בנתה דראפטר DSpark עבור Qwen3.8 בדרגת מקס, ו-vLLM מגיב עם נתיב תצורה גנרי במקום תיקון לכל מודל. כך הופכים מודלים פתוחים מתקדמים לאמיתיים — לא ברגע שהמשקולות יורדות, אלא ברגע שהדראפטרים מתמזגים.
השוואות במאמר הזה2
זוהה מתוך המאמר הזה · בנצ'מרקים: Artificial Analysis · מתעדכן יומית
