
A.X K2 DSpark לעומת A.X K2: מה בעצם מרוויחים ממודל דראפטר בלבד
- AlibabaחדשQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 לכל 1M טוקנים
- z-aiחדשZ.ai: GLM 5.3 Flash2026-08-2658אינטליגנציה72כתיבת קוד
- DeepSeekחדשDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.15 / $0.29 לכל 1M טוקנים
- z-aiחדשZ.ai: GLM 5.32026-08-1860אינטליגנציה75כתיבת קוד
- obsidianQwen3.8 27B2026-08-1552אינטליגנציה68כתיבת קוד
- qwenQwen: Qwen3.8 27B (free)2026-08-13qwen/qwen3.8-27b-free
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1253אינטליגנציה69כתיבת קוד
- grokSpaceXAI: Grok 4.62026-08-1261אינטליגנציה77כתיבת קוד
- metaMeta: Muse Spark 1.22026-08-0557אינטליגנציה72כתיבת קוד
- qwenQwen: Qwen3.8 Max2026-08-0358אינטליגנציה72כתיבת קוד
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3152אינטליגנציה69כתיבת קוד
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 לכל 1M טוקנים
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463אינטליגנציה78כתיבת קוד
- googleGoogle: Gemini 3.6 Flash2026-07-2152אינטליגנציה69כתיבת קוד
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137אינטליגנציה49כתיבת קוד
- metaMeta: Muse Spark 1.12026-07-1653אינטליגנציה71כתיבת קוד
- kimiMoonshotAI: Kimi K32026-07-1560אינטליגנציה76כתיבת קוד
- openaiOpenAI: GPT-5.6 Luna2026-07-0952אינטליגנציה71כתיבת קוד
הדבר המוזר ביותר בהשוואה בין A.X K2 DSpark ל-A.X K2 הוא שזו לא באמת השוואה. לא ניתן להשתמש ב-A.X K2 DSpark במקום A.X K2 — אי אפשר להשתמש בו כלל באופן עצמאי. זהו "checkpoint שלדרפט בלבד" ש-SK Telecom פרסמה בשקט ב-Hugging Face בתחילת אוגוסט ללא כל הודעה: מודל ניסוח לניחוש ספקולטיבי (speculative decoding) שכל תפקידו הוא לגרום ל-A.X K2, דגל החברה בעל 688 מיליארד הפרמטרים במשקלים פתוחים מסוג Mixture-of-Experts, לייצר אסימונים מהר יותר תוך השארת תשובותיו ללא שינוי. לכן השאלה האמיתית שהתמודדות זו סובבת סביבה אינה "מה עדיף", אלא "האם להריץ את A.X K2 עם DSpark או בלעדיו?" כל דבר בקטע זה מסומן לפי מקור, משום שהפער בין מה שהריפו (repo) אומר לנו לבין מה שנמדד בפועל הוא כל הסיפור.
מה זה בעצם A.X K2 DSpark
כרטיס המודל של SK Telecom ישיר באופן יוצא דופן לגבי מה המודל נועד עבורו. A.X K2 DSpark "הוא מודל טיוטה לפענוח ספקולטיבי עבור A.X K2" ו"נקודת ביקורת המיועדת לטיוטה בלבד: אין לו שימוש עצמאי, והוא נועד להיטען על ידי vLLM לצד A.X K2 באמצעות פענוח ספקולטיבי." בפועל, זה אומר שאתה מוריד אותו, מכוון vLLM תואם גם אליו וגם אל A.X K2, והשניים עובדים כצוות: DSpark מציע אסימוני מועמדים, A.X K2 מאמת אותם, ורק אסימונים מאומתים נפלטים.
שני פרטים על מנגנון הטיוטה ניתן ללמוד מהמאגר. ראשית, {{1}}DSpark מציעה מספר טוקנים מועמדים במקביל, במקום לכתוב רצף טיוטה טוקן אחר טוקן, תוך הסתמכות על הייצוגים החבויים של A.X K2 עצמו יחד עם מידול תלות מקומית קל-משקל{{/1}}. שנית, {{2}}המנגנון כולו בנוי להיות חסר אובדן: כל מועמד מאומת על ידי מודל היעד לפני שהוא מאומץ, כך שהתפלגות הפלט של A.X K2 נותרת ללא שינוי מעצם הבנייה{{/2}}.
השחרור עצמו הוא הודעה מוקדמת. בכרטיס נכתב שהמודל "נמצא כעת בשלבי אימות סופיים ומתוכנן לשחרור ציבורי בתוך הימים הקרובים", וכי ההערכה "נמצאת כעת בתהליך" — כל מדדי התפוקה (throughput), TPOT ומשך הקבלה הממוצע (mean-accepted-length) בכרטיס עדיין רשומים כ-TBD.
למה ה"versus" הזה הוא באמת "עם לעומת בלי"
מכיוון שאין ל{{1}}A.X K2 DSpark{{/1}} שימוש עצמאי, אין תרחיש שבו תבחר בו במקום {{2}}A.X K2{{/2}}. הבחירה היא בין {{3}}A.X K2{{/3}} לבדו לבין {{4}}A.X K2{{/4}} עם מודל הטיוטה המצורף. באיכות הפלט, שתי התצורות זהות מעצם בנייתן; הציר היחיד שיכול לנוע הוא מהירות הפענוח.
לפרוטוקול, הנה מה זה A.X K2: דיקודר Mixture-of-Experts עם 688B פרמטרים בסך הכול, מתוכם 33B פעילים, עם 256 מומחים ועוד מומחה משותף אחד (8 פעילים בכל מעבר קדימה), 61 שכבות, 64 ראשי קשב, ואוצר מילים של 163,840 טוקנים, ששוחרר עם משקלים פתוחים תחת Apache 2.0 ב-29 ביולי. הוא אומן מראש על כ-8.2 טריליון טוקנים באופן טבעי ב-MXFP8, משתמש ב-Sparse Gated Attention של SK Telecom ליעילות בהקשר ארוך, ונושא הקשר של 262,144 טוקנים (128K טבעי מורחב ל-256K באמצעות YaRN). SK Telecom מדווחת שהוא משיג בממוצע +32.2 נקודות אחוז על פני A.X K1 ב-14 מדדים, עם הערכות של הקשר ארוך וסוכנים גבוהות בכ-83.9 נקודות — הכול דיווח של הספק, ועדיין לא פורסם ציון מורכב בלתי תלוי.
DSpark תוכנן במיוחד עבור ארכיטקטורה זו. לפי הכרטיס, הוא מותאם למבנה ה-MoE של A.X K2, לפריסת הקשב ולתצורת 256K המקורית, ואינו מאומת כנגד כל יעד אחר. הוא יורש את אותו קונטקסט של 262,144 טוקנים, כך שהרצתו אינה עולה לך דבר בגודל החלון.

קריאת כרטיס המודל: ניתן לדעת, אך עדיין לא אושר
הריפו נותן לך תמונה ברורה של מהו המודל, ורשימה קצרה של דברים שהוא לא מספר לך.
ניתן לדעת היום:
• זהו checkpoint המשמש כטיוטה בלבד ואין לו שימוש עצמאי; הוא נטען על ידי vLLM לצד A.X K2 באמצעות פענוח ספקולטיבי.
• הרישיון הוא Apache 2.0; המשקלים זמינים להורדה ולשימוש בחינם.
• אורך ההקשר תואם את A.X K2 ב-262,144 אסימונים.
• הוא פועל דרך הפורק של vLLM של SK Telecom (מאגר SKT-AI/vllm, ענף axk2-v0.23.0) תוך שימוש בדגל --speculative-config.
השיטה מתועדת במאמר, "DSpark: Confidence-Scheduled Speculative Decoding with Semi-Autoregressive Generation" (arXiv:2607.05147, הוגש ב-6 ביולי 2026) — מאמר זה הוא גם המקור למספרי ההאצה שתראו מצוטטים.
• אף ספק אינפרנס לא פורס אותו כיום, כך שאין API מתארח שאפשר לפנות אליו.
טרם אושר:
• הודעה רשמית — הכרטיס מבטיח שחרור לציבור "בתוך הימים הקרובים."
• כל נתון האצה ספציפי ל-A.X K2. ההערכה בעיצומה וכל מדד ביצועים הוא TBD.
• כמה זה באמת עוזר תחת עומס, דבר שהכרטיס מתייג כ'תלוי עומס עבודה'.
• כל מדידה עצמאית של צד שלישי של מודל הטיוטה.

במה שונה DSpark מדיקוד ספקולטיבי רגיל
פענוח ספקולטיבי הוא טריק מוכר היטב: מודל טיוטה קטן ומהיר כותב ניחוש לכמה ה-tokens הבאים, והמודל הגדול בודק את כל הניחוש במעבר קדימה אחד, ומקבל את הקידומת שעומדת באימות לפני שננקט צעד מתקן אחד. כאשר הוא מיושם היטב, הוא חותך את ההשהיה באופן דרמטי ללא אובדן איכות.
המלכוד, כפי שמנסח זאת מאמר DSpark, הוא שכותבי הטיוטה המקבילים האחרונים — המציעים רצפים ארוכים במעבר אחד — סובלים מ"דעיכת קבלה מהירה", משום שהטוקנים המאוחרים יותר בטיוטה אינם נושאים תלות בקודמים להם, ולכן הם נדחים בתדירות גבוהה בהרבה. ואימות עיוור של בלוקים ארוכים מבזבז קיבולת אצווה על טוקנים שסביר שיידחו, וזה פוגע בתפוקה דווקא במערכות שירות בעלות מקביליות גבוהה.
DSpark תוקף את שתי הבעיות:
• ניסוח חצי-אוטורגרסיבי. הוא מצמיד עמוד שדרה מקבילי למודול רציף קל משקל, ומוסיף מידול תלותיות תוך-בלוקית כך שטוקני טיוטה מאוחרים יותר תלויים במוקדמים יותר — וזה מה שממתן את דעיכת הסיומת.
• אימות מתוזמן לפי ביטחון. במקום לאמת אורך בלוק קבוע, הוא מתאים את אורך האימות לכל בקשה, בהתבסס על הסתברויות משוערות להישרדות קידומת ופרופיל התפוקה של המנוע. האימות הופך למודע לעומס.
המספרים של המאמר — ומה שהם לא מספרים לך
הנה המספר שיצוטט לכם: DSpark "מאיץ את מהירויות הייצור למשתמש ב-60 עד 85 אחוז" ברמות תפוקה תואמות, לעומת קו הבסיס היצרני MTP-1. המאמר גם מדווח על שיפור ניכר באורך ההתקבלות לעומת המנסחים האוטורגרסיביים והמקביליים המתקדמים ביותר במבחני ביצועים לא מקוונים, וקובע שהוא מונע הידרדרות חמורה בתפוקה תחת אילוצי אינטראקטיביות מחמירים.
קראו את האותיות הקטנות, כי זה משנה עבור ההתאמה הספציפית הזו: הנתון של 60–85% נמדד במערכת ה-Serving של DeepSeek-V4 תחת תעבורת משתמשים חיה — לא על A.X K2. זוהי טענה לגבי שיטת DSpark שהוטמעה על מחסנית של מודל אחר. כרטיס ה-DSpark של A.X K2, לעומת זאת, עדיין אינו כולל נתון האצה כלל. לוח התוצאות הכנה עבור ההתאמה הזו הוא אפוא: פלט זהה מעצם הבנייה, והאצה שהמאמר על השיטה מציע שהיא סבירה, אך ש-SK Telecom עצמה טרם מדדה על המודל שטיוטת נקודת הביקורת הזו נבנתה עבורו.

מה זה באמת דורש כדי להריץ את זה
התנאי המוקדם הוא החלק שרוב האנשים יירתעו ממנו: צריך לארח בעצמך את A.X K2. אין API מתארח עבור מודל היעד — הוא בעל משקלים פתוחים, והגשת MoE פעיל בגודל 688B/33B היא מחויבות תשתיתית רצינית. DSpark רלוונטי רק לצוותים שכבר קיבלו על עצמם את המחויבות הזו.
אם יש לך, העלות השולית של הוספת מודל הטיוטה קטנה:
• הורד את נקודת הביקורת הטיוטה של Apache 2.0 והרץ את הפיצול (fork) של vLLM של SK Telecom (ענף axk2-v0.23.0).
• הפעל פענוח ספקולטיבי באמצעות הדגל --speculative-config, כשמצביעים אותו אל נקודת הביקורת של DSpark.
• הקצה זיכרון נוסף עבור משקלי הדראפט, וקבל את העובדה שאתה עובד כעת על fork של vLLM של ספק במקום על הגרסה הרשמית — שיקול תחזוקה.
• זכרו את הסתייגותו של המאמר עצמו שאימות אינו בחינם: תחת מקביליות גבוהה, אימות רשלני אוכל את קיבולת האצווה, וזהו בדיוק מצב הכשל שאימות עם תזמון ביטחון (confidence-scheduled verification) נועד לנהל.
עוד דבר אחד שכדאי לדעת: Hugging Face מדווחת שההורדות "אינן במעקב עבור המודל הזה", כך שאין אות ציבורי לכמה צוותים ניסו אותו בפועל.
מי צריך לבחור איזה
הרץ A.X K2 רגיל אם כל אחד מאלה מתאים לך:
אתה מריץ vLLM סטנדרטי ולא רוצה checkpoint שני או fork של ספק בנתיב.
עומסי העבודה שלך מוגבלים על ידי תפוקה אך לא על ידי זמן השהיה, והמשתמשים סובלניים להמתנה ליצירות ארוכות.
אתה מעדיף לחכות לשחרור הרשמי ולמדידות עצמאיות ראשונות.
הרץ A.X K2 ו-DSpark אם זה אתה:
• אתה מארח את A.X K2 בעצמך, ומה שגורם לבעיה הוא השהיית היצירה או תפוקת הטוקנים.
• עומסי עבודה עם הקשר ארוך ועומסי עבודה סוכניים גורמים למשתמשים לחכות לפלטים ארוכים — התרחיש שפענוח ספקולטיבי נועד עבורו.
נוח לך להריץ רכיב הודעה מוקדמת שהסיכון בו מוגבל: במקרה הגרוע הוא לא עוזר, והוא לא יכול לשנות את איכות הפלט.
בחרו באף אחת מהן אם אינכם מארחים בעצמכם MoE בעל 688B פרמטרים כלל. החוזקות של A.X K2 בריבונות ובשפה הקוריאנית מגיעות אליכם רק אם אתם מריצים אותו, וצוותים רבים יגיעו במקום זאת למודלים פתוחים מתקדמים דרך קטלוג מתארח. כאן משתלם לשמור על אינטגרציה שאינה תלויה במודל: נקודת הקצה האחת של OrcaRouter התואמת ל-OpenAI מקיפה 200+ מודלים במחיר המחירון של הספק עם 0% תוספת, מעבר אוטומטי, ו-DSL ניתוב להרכבת מספר מודלים לקריאה אחת. (לא A.X K2 ולא A.X K2 DSpark מתארחים כיום בשום מקום — כולל ב-OrcaRouter — כך שזה נוגע לשאר המחסנית שלכם, לא לניתוב של הצמד הזה.) הגישה עדיין תקפה: נסו מודל לא מוכח על חלק קטן מהתעבורה ועברו אוטומטית למודל גיבוי, במקום להמר עליו בנתיב ייצור.
מה לצפות בהמשך
מצב הדברים פשוט: המאגר אמיתי, השיטה מתועדת, המדידות לא. שלושת הדברים שכדאי לשים לב אליהם הם השחרור הציבורי המובטח (הכרטיס אומר "בתוך הימים הקרובים"), מספרי התפוקה או השהיה הראשונים הספציפיים ל-A.X K2 ברגע שתסתיים ההערכה של SK Telecom, והאם ספק היסק כלשהו יאמץ את הצמד — וזה מה שיהפוך את DSpark לרלוונטי עבור צוותים שלא מארחים בעצמם.
שאלות נפוצות
האם A.X K2 DSpark יכול להחליף את A.X K2?
לא. זוהי נקודת ביקורת (checkpoint) המיועדת ל־drafter בלבד, ללא שימוש עצמאי — היא קיימת כדי להאיץ את הפענוח של A.X K2, לא כדי לשמש חלופה אליו. לא ניתן להריץ את A.X K2 DSpark ללא A.X K2.
האם DSpark משנה את איכות הפלט של A.X K2?
לא, מעצם הבנייה. כל טוקן מועמד מאומת על ידי A.X K2 לפני שהוא נקבע, ולכן התפלגות הפלט נותרת ללא שינוי — הכרטיס מתאר את הגישה ככזו ללא אובדן.
האם אני צריך לארח בעצמי את A.X K2 כדי להשתמש ב-DSpark?
כן. DSpark נטען על ידי vLLM לצד A.X K2, כך שאין לו מה לנסח אלא אם כן אתה מריץ את היעד 688B. אין API מתארח לאף אחד מהמודלים כיום.
האם DSpark עובד עם מודלים אחרים?
SK Telecom תכננה אותו עבור ארכיטקטורת ה-MoE של A.X K2, מבנה הקשב וקונטקסט של 256K, ולא אימתה אותו כנגד יעד אחר.
פסק הדין
ההשוואה בין A.X K2 DSpark ל-A.X K2 היא "משחק כוחות" שבו התשובה הכנה היא "שניהם". אם אתה כבר מריץ A.X K2 ומשתמשים ממתינים לגנרציות ארוכות, מודל ה-draft הוא ניסוי חינמי ונטול סיכון: משקלים תחת רישיון Apache 2.0, במקרה הגרוע אין שיפור מהירות, ואין אפשרות לרגרסיית איכות מעצם הבנייה. אם אינך מוגבל ב-latency — או אינך מארח בעצמך MoE בגודל 688B כלל — אתה יכול להתעלם ממנו בבטחה עד שמספרי ההערכה של SK Telecom יתפרסמו והשחרור הציבורי המובטח יהפוך את המודל לרשמי. מה שאסור לך לעשות הוא לטעות ולחשוב שהנתון 60–85% במאמר הוא מדידה של המודל הזה: כרגע, כל מה שספציפי ל-DSpark ב-A.X K2 הוא עדיין TBD.
