גרפיקת Hero עבור A.X K2 DSpark לעומת A.X K2: מודל טיוטה המציע ארבעה טוקנים מועמדים במקביל, שאותם A.X K2 (688B / 33B פעילים) מאמת, עם הכיתוב 'אותה תשובה, פענוח מהיר יותר.'
Guides & Insights

A.X K2 DSpark לעומת A.X K2: מה בעצם מרוויחים ממודל דראפטר בלבד

מחבר

Rowan Sterling

תאריך פרסום

מודלים אחרונים · 20צפו בכל המודלים
בנצ'מרקים: Artificial Analysis · מתעדכן יומית
חזרה לכל הפוסטים

הדבר המוזר ביותר בהשוואה בין A.X K2 DSpark ל-A.X K2 הוא שזו לא באמת השוואה. לא ניתן להשתמש ב-A.X K2 DSpark במקום A.X K2 — אי אפשר להשתמש בו כלל באופן עצמאי. זהו "checkpoint שלדרפט בלבד" ש-SK Telecom פרסמה בשקט ב-Hugging Face בתחילת אוגוסט ללא כל הודעה: מודל ניסוח לניחוש ספקולטיבי (speculative decoding) שכל תפקידו הוא לגרום ל-A.X K2, דגל החברה בעל 688 מיליארד הפרמטרים במשקלים פתוחים מסוג Mixture-of-Experts, לייצר אסימונים מהר יותר תוך השארת תשובותיו ללא שינוי. לכן השאלה האמיתית שהתמודדות זו סובבת סביבה אינה "מה עדיף", אלא "האם להריץ את A.X K2 עם DSpark או בלעדיו?" כל דבר בקטע זה מסומן לפי מקור, משום שהפער בין מה שהריפו (repo) אומר לנו לבין מה שנמדד בפועל הוא כל הסיפור.

מה זה בעצם A.X K2 DSpark

כרטיס המודל של SK Telecom ישיר באופן יוצא דופן לגבי מה המודל נועד עבורו. A.X K2 DSpark "הוא מודל טיוטה לפענוח ספקולטיבי עבור A.X K2" ו"נקודת ביקורת המיועדת לטיוטה בלבד: אין לו שימוש עצמאי, והוא נועד להיטען על ידי vLLM לצד A.X K2 באמצעות פענוח ספקולטיבי." בפועל, זה אומר שאתה מוריד אותו, מכוון vLLM תואם גם אליו וגם אל A.X K2, והשניים עובדים כצוות: DSpark מציע אסימוני מועמדים, A.X K2 מאמת אותם, ורק אסימונים מאומתים נפלטים.

שני פרטים על מנגנון הטיוטה ניתן ללמוד מהמאגר. ראשית, {{1}}DSpark מציעה מספר טוקנים מועמדים במקביל, במקום לכתוב רצף טיוטה טוקן אחר טוקן, תוך הסתמכות על הייצוגים החבויים של A.X K2 עצמו יחד עם מידול תלות מקומית קל-משקל{{/1}}. שנית, {{2}}המנגנון כולו בנוי להיות חסר אובדן: כל מועמד מאומת על ידי מודל היעד לפני שהוא מאומץ, כך שהתפלגות הפלט של A.X K2 נותרת ללא שינוי מעצם הבנייה{{/2}}.

השחרור עצמו הוא הודעה מוקדמת. בכרטיס נכתב שהמודל "נמצא כעת בשלבי אימות סופיים ומתוכנן לשחרור ציבורי בתוך הימים הקרובים", וכי ההערכה "נמצאת כעת בתהליך" — כל מדדי התפוקה (throughput), TPOT ומשך הקבלה הממוצע (mean-accepted-length) בכרטיס עדיין רשומים כ-TBD.

למה ה"versus" הזה הוא באמת "עם לעומת בלי"

מכיוון שאין ל{{1}}A.X K2 DSpark{{/1}} שימוש עצמאי, אין תרחיש שבו תבחר בו במקום {{2}}A.X K2{{/2}}. הבחירה היא בין {{3}}A.X K2{{/3}} לבדו לבין {{4}}A.X K2{{/4}} עם מודל הטיוטה המצורף. באיכות הפלט, שתי התצורות זהות מעצם בנייתן; הציר היחיד שיכול לנוע הוא מהירות הפענוח.

לפרוטוקול, הנה מה זה A.X K2: דיקודר Mixture-of-Experts עם 688B פרמטרים בסך הכול, מתוכם 33B פעילים, עם 256 מומחים ועוד מומחה משותף אחד (8 פעילים בכל מעבר קדימה), 61 שכבות, 64 ראשי קשב, ואוצר מילים של 163,840 טוקנים, ששוחרר עם משקלים פתוחים תחת Apache 2.0 ב-29 ביולי. הוא אומן מראש על כ-8.2 טריליון טוקנים באופן טבעי ב-MXFP8, משתמש ב-Sparse Gated Attention של SK Telecom ליעילות בהקשר ארוך, ונושא הקשר של 262,144 טוקנים (128K טבעי מורחב ל-256K באמצעות YaRN). SK Telecom מדווחת שהוא משיג בממוצע +32.2 נקודות אחוז על פני A.X K1 ב-14 מדדים, עם הערכות של הקשר ארוך וסוכנים גבוהות בכ-83.9 נקודות — הכול דיווח של הספק, ועדיין לא פורסם ציון מורכב בלתי תלוי.

DSpark תוכנן במיוחד עבור ארכיטקטורה זו. לפי הכרטיס, הוא מותאם למבנה ה-MoE של A.X K2, לפריסת הקשב ולתצורת 256K המקורית, ואינו מאומת כנגד כל יעד אחר. הוא יורש את אותו קונטקסט של 262,144 טוקנים, כך שהרצתו אינה עולה לך דבר בגודל החלון.

A comparison scoreboard for A.X K2 DSpark and A.X K2: drafter-only checkpoint vs 688B / 33B-active MoE target; identical output by construction; shared 262,144-token context and Apache 2.0 license; DSpark's 60-85% faster decode labeled as a paper claim not yet measured on A.X K2; A.X K2 live open weights since 7-29.

קריאת כרטיס המודל: ניתן לדעת, אך עדיין לא אושר

הריפו נותן לך תמונה ברורה של מהו המודל, ורשימה קצרה של דברים שהוא לא מספר לך.

ניתן לדעת היום:

• זהו checkpoint המשמש כטיוטה בלבד ואין לו שימוש עצמאי; הוא נטען על ידי vLLM לצד A.X K2 באמצעות פענוח ספקולטיבי.

• הרישיון הוא Apache 2.0; המשקלים זמינים להורדה ולשימוש בחינם.

• אורך ההקשר תואם את A.X K2 ב-262,144 אסימונים.

• הוא פועל דרך הפורק של vLLM של SK Telecom (מאגר SKT-AI/vllm, ענף axk2-v0.23.0) תוך שימוש בדגל --speculative-config.

השיטה מתועדת במאמר, "DSpark: Confidence-Scheduled Speculative Decoding with Semi-Autoregressive Generation" (arXiv:2607.05147, הוגש ב-6 ביולי 2026) — מאמר זה הוא גם המקור למספרי ההאצה שתראו מצוטטים.

• אף ספק אינפרנס לא פורס אותו כיום, כך שאין API מתארח שאפשר לפנות אליו.

טרם אושר:

• הודעה רשמית — הכרטיס מבטיח שחרור לציבור "בתוך הימים הקרובים."

• כל נתון האצה ספציפי ל-A.X K2. ההערכה בעיצומה וכל מדד ביצועים הוא TBD.

• כמה זה באמת עוזר תחת עומס, דבר שהכרטיס מתייג כ'תלוי עומס עבודה'.

• כל מדידה עצמאית של צד שלישי של מודל הטיוטה.

The Hugging Face model card for skt/A.X-K2-DSpark, showing it is a DSpark speculative-decoding draft model and a drafter-only checkpoint for A.X K2 with no standalone use, Apache 2.0 license, a 262,144-token context, release status 'planned for public release within the next few days,' and the note that no inference provider deploys it.

במה שונה DSpark מדיקוד ספקולטיבי רגיל

פענוח ספקולטיבי הוא טריק מוכר היטב: מודל טיוטה קטן ומהיר כותב ניחוש לכמה ה-tokens הבאים, והמודל הגדול בודק את כל הניחוש במעבר קדימה אחד, ומקבל את הקידומת שעומדת באימות לפני שננקט צעד מתקן אחד. כאשר הוא מיושם היטב, הוא חותך את ההשהיה באופן דרמטי ללא אובדן איכות.

המלכוד, כפי שמנסח זאת מאמר DSpark, הוא שכותבי הטיוטה המקבילים האחרונים — המציעים רצפים ארוכים במעבר אחד — סובלים מ"דעיכת קבלה מהירה", משום שהטוקנים המאוחרים יותר בטיוטה אינם נושאים תלות בקודמים להם, ולכן הם נדחים בתדירות גבוהה בהרבה. ואימות עיוור של בלוקים ארוכים מבזבז קיבולת אצווה על טוקנים שסביר שיידחו, וזה פוגע בתפוקה דווקא במערכות שירות בעלות מקביליות גבוהה.

DSpark תוקף את שתי הבעיות:

• ניסוח חצי-אוטורגרסיבי. הוא מצמיד עמוד שדרה מקבילי למודול רציף קל משקל, ומוסיף מידול תלותיות תוך-בלוקית כך שטוקני טיוטה מאוחרים יותר תלויים במוקדמים יותר — וזה מה שממתן את דעיכת הסיומת.

• אימות מתוזמן לפי ביטחון. במקום לאמת אורך בלוק קבוע, הוא מתאים את אורך האימות לכל בקשה, בהתבסס על הסתברויות משוערות להישרדות קידומת ופרופיל התפוקה של המנוע. האימות הופך למודע לעומס.

המספרים של המאמר — ומה שהם לא מספרים לך

הנה המספר שיצוטט לכם: DSpark "מאיץ את מהירויות הייצור למשתמש ב-60 עד 85 אחוז" ברמות תפוקה תואמות, לעומת קו הבסיס היצרני MTP-1. המאמר גם מדווח על שיפור ניכר באורך ההתקבלות לעומת המנסחים האוטורגרסיביים והמקביליים המתקדמים ביותר במבחני ביצועים לא מקוונים, וקובע שהוא מונע הידרדרות חמורה בתפוקה תחת אילוצי אינטראקטיביות מחמירים.

קראו את האותיות הקטנות, כי זה משנה עבור ההתאמה הספציפית הזו: הנתון של 60–85% נמדד במערכת ה-Serving של DeepSeek-V4 תחת תעבורת משתמשים חיה — לא על A.X K2. זוהי טענה לגבי שיטת DSpark שהוטמעה על מחסנית של מודל אחר. כרטיס ה-DSpark של A.X K2, לעומת זאת, עדיין אינו כולל נתון האצה כלל. לוח התוצאות הכנה עבור ההתאמה הזו הוא אפוא: פלט זהה מעצם הבנייה, והאצה שהמאמר על השיטה מציע שהיא סבירה, אך ש-SK Telecom עצמה טרם מדדה על המודל שטיוטת נקודת הביקורת הזו נבנתה עבורו.

The arXiv abstract page for the DSpark paper (arXiv 2607.05147), stating that DSpark accelerates per-user generation speeds by 60 to 85 percent at matched throughput against the MTP-1 production baseline, deployed in the DeepSeek-V4 serving system.

מה זה באמת דורש כדי להריץ את זה

התנאי המוקדם הוא החלק שרוב האנשים יירתעו ממנו: צריך לארח בעצמך את A.X K2. אין API מתארח עבור מודל היעד — הוא בעל משקלים פתוחים, והגשת MoE פעיל בגודל 688B/33B היא מחויבות תשתיתית רצינית. DSpark רלוונטי רק לצוותים שכבר קיבלו על עצמם את המחויבות הזו.

אם יש לך, העלות השולית של הוספת מודל הטיוטה קטנה:

• הורד את נקודת הביקורת הטיוטה של Apache 2.0 והרץ את הפיצול (fork) של vLLM של SK Telecom (ענף axk2-v0.23.0).

• הפעל פענוח ספקולטיבי באמצעות הדגל --speculative-config, כשמצביעים אותו אל נקודת הביקורת של DSpark.

• הקצה זיכרון נוסף עבור משקלי הדראפט, וקבל את העובדה שאתה עובד כעת על fork של vLLM של ספק במקום על הגרסה הרשמית — שיקול תחזוקה.

• זכרו את הסתייגותו של המאמר עצמו שאימות אינו בחינם: תחת מקביליות גבוהה, אימות רשלני אוכל את קיבולת האצווה, וזהו בדיוק מצב הכשל שאימות עם תזמון ביטחון (confidence-scheduled verification) נועד לנהל.

עוד דבר אחד שכדאי לדעת: Hugging Face מדווחת שההורדות "אינן במעקב עבור המודל הזה", כך שאין אות ציבורי לכמה צוותים ניסו אותו בפועל.

מי צריך לבחור איזה

הרץ A.X K2 רגיל אם כל אחד מאלה מתאים לך:

אתה מריץ vLLM סטנדרטי ולא רוצה checkpoint שני או fork של ספק בנתיב.

עומסי העבודה שלך מוגבלים על ידי תפוקה אך לא על ידי זמן השהיה, והמשתמשים סובלניים להמתנה ליצירות ארוכות.

אתה מעדיף לחכות לשחרור הרשמי ולמדידות עצמאיות ראשונות.

הרץ A.X K2 ו-DSpark אם זה אתה:

• אתה מארח את A.X K2 בעצמך, ומה שגורם לבעיה הוא השהיית היצירה או תפוקת הטוקנים.

• עומסי עבודה עם הקשר ארוך ועומסי עבודה סוכניים גורמים למשתמשים לחכות לפלטים ארוכים — התרחיש שפענוח ספקולטיבי נועד עבורו.

נוח לך להריץ רכיב הודעה מוקדמת שהסיכון בו מוגבל: במקרה הגרוע הוא לא עוזר, והוא לא יכול לשנות את איכות הפלט.

בחרו באף אחת מהן אם אינכם מארחים בעצמכם MoE בעל 688B פרמטרים כלל. החוזקות של A.X K2 בריבונות ובשפה הקוריאנית מגיעות אליכם רק אם אתם מריצים אותו, וצוותים רבים יגיעו במקום זאת למודלים פתוחים מתקדמים דרך קטלוג מתארח. כאן משתלם לשמור על אינטגרציה שאינה תלויה במודל: נקודת הקצה האחת של OrcaRouter התואמת ל-OpenAI מקיפה 200+ מודלים במחיר המחירון של הספק עם 0% תוספת, מעבר אוטומטי, ו-DSL ניתוב להרכבת מספר מודלים לקריאה אחת. (לא A.X K2 ולא A.X K2 DSpark מתארחים כיום בשום מקום — כולל ב-OrcaRouter — כך שזה נוגע לשאר המחסנית שלכם, לא לניתוב של הצמד הזה.) הגישה עדיין תקפה: נסו מודל לא מוכח על חלק קטן מהתעבורה ועברו אוטומטית למודל גיבוי, במקום להמר עליו בנתיב ייצור.

מה לצפות בהמשך

מצב הדברים פשוט: המאגר אמיתי, השיטה מתועדת, המדידות לא. שלושת הדברים שכדאי לשים לב אליהם הם השחרור הציבורי המובטח (הכרטיס אומר "בתוך הימים הקרובים"), מספרי התפוקה או השהיה הראשונים הספציפיים ל-A.X K2 ברגע שתסתיים ההערכה של SK Telecom, והאם ספק היסק כלשהו יאמץ את הצמד — וזה מה שיהפוך את DSpark לרלוונטי עבור צוותים שלא מארחים בעצמם.

שאלות נפוצות

האם A.X K2 DSpark יכול להחליף את A.X K2?

לא. זוהי נקודת ביקורת (checkpoint) המיועדת ל־drafter בלבד, ללא שימוש עצמאי — היא קיימת כדי להאיץ את הפענוח של A.X K2, לא כדי לשמש חלופה אליו. לא ניתן להריץ את A.X K2 DSpark ללא A.X K2.

האם DSpark משנה את איכות הפלט של A.X K2?

לא, מעצם הבנייה. כל טוקן מועמד מאומת על ידי A.X K2 לפני שהוא נקבע, ולכן התפלגות הפלט נותרת ללא שינוי — הכרטיס מתאר את הגישה ככזו ללא אובדן.

האם אני צריך לארח בעצמי את A.X K2 כדי להשתמש ב-DSpark?

כן. DSpark נטען על ידי vLLM לצד A.X K2, כך שאין לו מה לנסח אלא אם כן אתה מריץ את היעד 688B. אין API מתארח לאף אחד מהמודלים כיום.

האם DSpark עובד עם מודלים אחרים?

SK Telecom תכננה אותו עבור ארכיטקטורת ה-MoE של A.X K2, מבנה הקשב וקונטקסט של 256K, ולא אימתה אותו כנגד יעד אחר.

פסק הדין

ההשוואה בין A.X K2 DSpark ל-A.X K2 היא "משחק כוחות" שבו התשובה הכנה היא "שניהם". אם אתה כבר מריץ A.X K2 ומשתמשים ממתינים לגנרציות ארוכות, מודל ה-draft הוא ניסוי חינמי ונטול סיכון: משקלים תחת רישיון Apache 2.0, במקרה הגרוע אין שיפור מהירות, ואין אפשרות לרגרסיית איכות מעצם הבנייה. אם אינך מוגבל ב-latency — או אינך מארח בעצמך MoE בגודל 688B כלל — אתה יכול להתעלם ממנו בבטחה עד שמספרי ההערכה של SK Telecom יתפרסמו והשחרור הציבורי המובטח יהפוך את המודל לרשמי. מה שאסור לך לעשות הוא לטעות ולחשוב שהנתון 60–85% במאמר הוא מדידה של המודל הזה: כרגע, כל מה שספציפי ל-DSpark ב-A.X K2 הוא עדיין TBD.

© 2026 OrcaRouter

לספקים

מפעילים פלטפורמת הסקה (inference)? הציגו את המודלים שלכם ב-OrcaRouter.

providers@orcarouter.ai

הצטרפו לקהילה שלנו

Discordsupport@orcarouter.aiXGitHubYouTube