
A.X-K2-DSpark: מודל הטיוטה לדיקוד ספקולטיבי של SK Telecom הגיע ללא הודעה מוקדמת
- metaחדשMeta: Muse Spark 1.22026-08-0557אינטליגנציה72כתיבת קוד
- qwenחדשQwen: Qwen3.8 Max2026-08-0358אינטליגנציה72כתיבת קוד
- deepseekחדשDeepSeek: DeepSeek V4 Flash 07312026-07-3152אינטליגנציה69כתיבת קוד
- minimaxחדשMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 לכל 1M טוקנים · 2100 tok/s
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463אינטליגנציה78כתיבת קוד
- googleGoogle: Gemini 3.6 Flash2026-07-2152אינטליגנציה69כתיבת קוד
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137אינטליגנציה49כתיבת קוד
- metaMeta: Muse Spark 1.12026-07-1653אינטליגנציה71כתיבת קוד
- kimiMoonshotAI: Kimi K32026-07-1560אינטליגנציה76כתיבת קוד
- openaiOpenAI: GPT-5.6 Luna2026-07-0952אינטליגנציה71כתיבת קוד
- openaiOpenAI: GPT-5.6 Terra2026-07-0957אינטליגנציה77כתיבת קוד
- openaiOpenAI: GPT-5.6 Sol2026-07-0961אינטליגנציה77כתיבת קוד
- grokxAI: Grok 4.52026-07-0856אינטליגנציה72כתיבת קוד
- tencentTencent: Hy32026-07-0642אינטליגנציה59כתיבת קוד
- obsidianQwen3.6 35B A3B Uncensored (Aggressive)2026-07-0232אינטליגנציה42כתיבת קוד
- obsidianGemma4 26B A4B Uncensored (Balanced)2026-07-0226אינטליגנציה39כתיבת קוד
- anthropicAnthropic: Claude Sonnet 52026-06-3055אינטליגנציה72כתיבת קוד
- klingKling: Kling 3.0 Turbo2026-06-1757אינטליגנציה52כתיבת קוד57מתמטיקה
A.X-K2-DSpark הוא מודל שככל הנראה לעולם לא תקראו אליו ישירות — וזו בדיוק הסיבה שכדאי לקרוא עליו. SK Telecom פרסמה אותו בשקט ב-Hugging Face, בלי פוסט השקה ובלי הודעה לעיתונות מאחוריו; כרטיס המודל פשוט נפתח בקביעה שהצ'קפוינט "נמצא כעת באימות סופי ומתוכנן לפרסום פומבי בתוך הימים הקרובים." מדובר בצ'קפוינט מסוג drafter בלבד לפענוח ספקולטיבי, שנבנה למשימה אחת: להפוך את דגל ה-A.X K2 של SK Telecom, בעל 688B הפרמטרים, לזול ומהיר יותר להגשה, על ידי הצעת טוקנים ש-A.X K2 מאמת לאחר מכן. הנה מה שהמאגר מספר לנו בפועל, מה שעדיין לא אושר, ומדוע מודל עזר קטן שכזה הוא המקום שבו מסתתר הסבב הבא של קיצוצי עלויות הגשת מודלי LLM.
מה זה A.X-K2-DSpark בעצם
A.X-K2-DSpark אינו מודל עצמאי בשום מובן משמעותי. כרטיס המודל אומר זאת בהערותיו לגבי השימוש המיועד: הוא "נקודת ביקורת לדראפט בלבד" עם "אין שימוש עצמאי", נטען על ידי vLLM לצד היעד שלו, A.X K2, בתוך לולאת פענוח ספקולטיבי. הוא שלב הדראפט של מחולל דו-שלבי — מודל קטן מציע טוקנים מועמדים במהירות, ומודל היעד מאמת אותם לפני שטוקן כלשהו מתחייב לפלט.
לצורך הקשר, היעד הוא אחד מהמודלים בעלי המשקל הפתוח הגדולים ביותר שקיימים. A.X K2 הוא מודל Mixture-of-Experts של SK Telecom עם סך כולל של 688B פרמטרים ו-33B פעילים, ששוחרר ב-Hugging Face בסוף יולי 2026 תחת Apache 2.0, ונבנה על ארכיטקטורת בסיס המשלבת Multi-head Latent Attention עם DeepSeek Sparse Attention ומוסיפה את שינוי ה-Sparse Gate Attention להקשר ארוך של SK Telecom. A.X-K2-DSpark מתבסס על המצבים החבויים של A.X K2 ומוסיף מודל תלות מקומי קל משקל בין עמדות מועמדות, כך שהוא יכול להציע מספר טוקנים במקביל במקום לייצר טיוטות באופן אוטורגרסיבי לחלוטין. כל מועמד מאומת לאחר מכן על ידי A.X K2 לפני שמתחייבים אליו — וזו הסיבה שכרטיס המודל מכנה את התוצאה "ללא אובדן לפי הבנייה": התפלגות הפלט אינה משתנה על ידי מחבר הטיוטה; רק מהירות ההגשה משתנה.

איך פועל פענוח ספקולטיבי, ולמה מודל MoE של 688B זקוק לו
פענוח ספקולטיבי קיים מכיוון שיצירה אוטורגרסיבית היא סדרתית ומוגבלת בזיכרון. יצירת כל טוקן פירושה קריאת משקלי המודל מהזיכרון, ובמודל של 688B מדובר במספר עצום של בתים שצריך להעביר עבור כל טוקן בודד — גם כשרק 33B פרמטרים פעילים בכל מעבר קדימה. החוכמה היא להשקיע מעט חישוב נוסף בדראפטר קטן שמנחש את הטוקנים הבאים בבת אחת, ואז המודל הגדול מאמת את כל הניחושים במעבר קדימה יחיד ושומר על הקידומת הארוכה ביותר שתואמת את ההתפלגות שלו. כשהדראפטר טוב, מקבלים שניים או שלושה טוקנים לכל מעבר של המודל הגדול במקום אחד, ללא שינוי בפלט הסופי.
המשחק כולו מתמצה ב{{1}}שיעור הקבלה{{/1}}. מנסח שמנחש גרוע מוצא את הצעותיו נדחות, ומעבר האימות עדיין עולה אותו רוחב פס זיכרון, כך שההאצה מתאדה. זו הסיבה שהמנסחים הפכו לנושא מחקר רציני בפני עצמם: עבור מודל בגודל של A.X K2, ההבדל בין האצה של פי 1.5 להאצה של פי 3 הוא ההבדל בין צי של עשרה GPUs לצי של חמישה. שכבות יעילות כאלה הן המקום שממנו יגיע הסבב הבא של הפחתות המחירים בממשקי API מתארחים של LLM — לא ממדדי האיכות של מודל הבסיס, אלא ממחסנית השירות שעוטפת אותו.
DSpark היא השיטה — והיא מגיעה מצוות DeepSeek
ה-DSpark בשם המודל הוא טכניקה ספציפית, ואינו המצאה של SK Telecom. כרטיס המודל מצטט את המאמר "DSpark: Confidence-Scheduled Speculative Decoding with Semi-Autoregressive Generation" (arXiv 2607.05147), טרום-פרסום מ-6 ביולי 2026 מאת צוות של 33 מחברים ב-DeepSeek, שהפעיל את השיטה במערכת השרתים של המחברים עצמם מתקופת V4 תחת תעבורה חיה. SK Telecom התאימה את אותה טכניקה למודל היעד שלה.
שתי התרומות של המאמר מתמפות ישירות למתואר בכרטיס A.X-K2-DSpark. הראשונה, ניסוח חצי-אוטורגרסיבי: שלד מקבילי מציע טוקנים על פני חלון שלם, בעוד מודול רציף קל-משקל ממדל את התלות בין המיקומים המועמדים — ובכך פותר את הבעיה הקלאסית שבה שיעורי הקבלה של מציעים מקביליים דועכים בחדות לאורך הרצף המוצע. השנייה, אימות בתזמון מבוסס ביטחון: במקום לאמת תמיד מספר קבוע של טוקני טיוטה, המערכת מעריכה את ההסתברות שכל קידומת תשרוד וקובעת את אורך האימות לכל בקשה, בהתאם לפרופיל התפוקה של המנוע — כך שמאמץ האימות מותאם לעומס ולא אחיד.
בהתבסס על המספרים שבדו"ח עצמו — שהם המדידות של המחברים עצמם, לא אומתו באופן בלתי תלוי — DSpark סיפקה ייצור מהיר ב-60–85% למשתמש בהשוואה לקו הבסיס היצרני MTP-1 בתפוקה זהה, ומנעה ירידה חמורה בתפוקה תחת אילוצי אינטראקטיביות מחמירים. שתי הסתייגויות חשובות לצורך קריאת ההודעה הזו. התוצאות נמדדו על המחסנית והיעד של המחברים עצמם, לא על A.X K2; וכרטיס המודל של A.X-K2-DSpark מציין במפורש שההערכה שלו עצמה עדיין בעיצומה. המאמר מוכיח שהשיטה עובדת בייצור. הוא אינו מוכיח שה-checkpoint של SK Telecom משחזר את הרווחים הללו — זה בדיוק החלק שלא אומת.

מה שהריפו אומר — ומה שהוא לא אומר
הנה מה שניתן לדעת מהמאגר כרגע, וכל זה מתוך כרטיס המודל:
• תפקיד — נקודת ביקורת לדראפטר בלבד עבור A.X K2; אין שימוש עצמאי; לא אומת עם אף מטרה אחרת ו"אינו תואם למודלים לא קשורים."
• Target — A.X K2, 688B סה״כ / 33B פעילים Mixture-of-Experts.
• אורך ההקשר — 262,144 טוקנים (256K), תואם לתצורה המקורית של A.X K2.
• רישיון — Apache 2.0.
• מנגנון — ניסוח חצי-אוטורגרסיבי של DSpark; כל מועמד מאומת על ידי A.X K2 לפני ביצוע (ללא אובדן).
• סטטוס — "נמצא כעת באימות סופי"; השחרור מתוכנן "בתוך הימים הקרובים."
והנה מה שעדיין לא אושר במפורש:
• דיוק וגודל נקודת ביקורת — שניהם רשומים כ-TBD בכרטיס המודל.
• תפוקה, TPOT, ואורך מקובל ממוצע — שלושת המספרים שיגידו לך האם המנסח באמת עובד, כולם טרם נקבעו, עם "ההערכה נמצאת כעת בעיצומה."
• תוצאות לפי תחום — הכרטיס מבטיח פירוט לקוריאנית, מתמטיקה, מדעים וקוד "בהמשך", ללא תאריך.
• הודעה רשמית — SK Telecom לא הכריזה על A.X-K2-DSpark בשום מקום שמצאנו; המאגר הוא ההכרזה.
• דירוגים עצמאיים — אין כאלה. כל מה שבכרטיס הוא טענה עצמית של SK Telecom, ורובו עדיין הבטחה.

המספר הבלתי מאומת החשוב ביותר הוא אורך הקבלה הממוצע — מספר אסימוני הטיוטה הממוצע ש־A.X K2 מקבל בכל סבב אימות. המספר הבודד הזה הוא הקובע אם דראפטר זה הוא שדרוג קל של 1.2x או שדרוג משמעותי של 2.5x, וזה גם המספר שסביר להניח שיסתובב ללא מקור ברגע שהגרסה תעלה לאוויר. התייחסו אליו בספקנות כשהוא יופיע: נתון ה־60–85% של מאמר DSpark נמדד על מחסנית השרתים של מודל אחר, ול־A.X K2 יש מאפייני קבלת טיוטה משלו.
איך בעצם היית מריץ את זה
הפעלת הדראפטר משמעותה לשרת את A.X K2 מה-fork של SK Telecom של vLLM. הדוגמה בכרטיס המודל, מצומצמת במקצת, היא:
vllm serve skt/A.X-K2 --tensor-parallel-size 8 --tool-call-parser hermes --reasoning-parser deepseek_v3 --speculative-config '{"method": "dspark", "model": "skt/A.X-K2-DSpark", "num_speculative_tokens": N}'
עם הפורק (fork) המותקן מהמאגר של SKT-AI vLLM בענף axk2-v0.23.0. יש כמה הסתייגויות שהכרטיס מציין מראש: ההתקנה מכוונת לתצורת הקונטקסט המקורית של 256K של A.X K2, וההאצה תלויה בעומס העבודה — מקביליות, אורך הפלט, שיעור הקבלה, והעלות היחסית של ניסוח (drafting) מול אימות (verification) כולם משפיעים על התוצאה. במילים אחרות, זו תשתית שרת, לא סקריפט של הורדה-והרצה. אתה צריך את המשקלים של A.X K2, קלאסטר גדול מספיק ל-tensor-parallel 8, וסבלנות לכוונן את num_speculative_tokens מול התעבורה שלך. זה פרויקט משמעותי עבור צוות שכבר משרת את A.X K2; זו לא סיבה להקים אחד.
הכלכלה: שכבות יעילות מנצחות טענות איכות
הסיבה שמודל דראפט עבור מודל 688B כדאי לעקוב אחריו היא שמרוץ מדדי ה-benchmark של מודלי הבסיס הגיע ברובו לרוויה, ואילו מרוץ עלות האחזקה (serving) עדיין לא. ההשקה של SK Telecom עצמה כבר נשענה על יעילות — שינוי ה-Sparse Gate Attention נטען שהעלה את התפוקה הכוללת של טוקנים ב-67.7% לעומת הדור הקודם בקלט של 120K טוקנים — ומודל דראפט הוא אותה תזה המיושמת לפענוח (decode). כל טוקן דראפט שמתקבל הוא מעבר קדימה של המודל הגדול שלא שילמת עליו.
לכל מי שצורך את המודלים הללו דרך API במקום לארח אותם, מודל הטיוטה אינו נראה — וזו בדיוק הנקודה. כאשר ספק מוסיף פענוח ספקולטיבי למחסנית הגשת המודלים שלו, אתה לא רואה מודל חדש; אתה רואה את אותו מודל הופך למהיר וזול יותר לכל טוקן. שכבת התמחור חשובה מאותה סיבה: ב-OrcaRouter אנחנו מעבירים את מחיר המחירון של הספק ישירות ללא תוספת מחיר, כך שכאשר שיפור יעילות הגשת המודלים של ספק מתבטא בהפחתת מחיר, היא פעילה אצלנו באותו יום — ללא משא ומתן, ללא שינוי חוזה. ועבור מודל לא מוכח שאולי יצליח ואולי לא, ניתוב עם העברה אוטומטית (failover) הוא הדרך לנסות אותו מבלי להתחייב למסלול ייצור: מפתח API אחד, והבקשה מועברת לספק אחר אם הראשון מתדרדר.
הערת כנות אחת ספציפית למהדורה זו: A.X-K2-DSpark היא נקודת ביקורת של דראפטר בלבד, כך שאינה משהו ששום API של מודל מתארח יכול לנתב — כולל שלנו. דראפטרים הם רכיב בצד השרת, לא מוצר שניתן לקריאה. כשהדראפטר ישוחרר ומספרי ההערכה יגיעו, הדבר שיופיע במחירון הוא A.X K2 מהיר וזול יותר — לא נקודת קצה חדשה בשם "DSpark".
כמה שאלות שכדאי לענות עליהן
האם אפשר להשתמש ב-A.X-K2-DSpark לבדו?לא — זוהי עובדת היסוד של המהדורה. מדובר בנקודת ביקורת למשרטט בלבד (drafter-only), ללא שימוש עצמאי וללא API ציבורי; היא קיימת רק ככלי עזר בתוך לולאת פענוח ספקולטיבי (speculative decoding) של vLLM המשרתת את A.X K2, והכרטיס מציין שהיא לא אומתה עם שום יעד אחר.
האם A.X-K2-DSpark הוא מתחרה ל-A.X K2? ההפך. זהו מאיץ עבור A.X K2 — אותו דגם נעשה מהיר יותר, כשתוצאת הפלט נותרת ללא שינוי. חשבו עליו כעל חלק יעילות שניתן להרכבה, לא כעל דגם חדש בקו המוצרים.
מתי זה בעצם ישוחרר? בכרטיס המודל נאמר שהמודל נמצא באימות סופי ומתוכנן לשחרור ציבורי "בתוך הימים הקרובים". זה כל מה שאושר. התאריך שכדאי לעקוב אחריו הוא היום שבו הנתונים שעדיין לא נקבעו — תפוקה, TPOT, ואורך ממוצע מקובל — יתמלאו, כי אז השחרור מפסיק להיות הבטחה והופך למשהו שאפשר להעריך.
האם אני צריך לחשוב על זה אם אני משתמש ב-A.X K2 דרך API?ככל הנראה לא ישירות. מחסנית השירות שמאחורי ה-API היא זו שקובעת אם יש דראפטר בלולאה; אתה רואה את התוצאה כמחיר וכזמן השהיה, לא כדגל. זה חשוב בעיקר לצוותים שמארחים את A.X K2 בעצמם, שם ההצטרפות היא שינוי תצורה של vLLM שהם שולטים בו.
הסיפור כאן אינו הדראפטר עצמו — אלא מה שהדראפטר מאותת. עבודת היעילות הופכת בשקט לקטגוריית שחרור בפני עצמה, והמודלים החדשים המעניינים ביותר השנה הם יותר ויותר כלי עזר שהופכים מודלים גדולים לזולים, לא מודלים גדולים יותר. A.X-K2-DSpark הוא הדוגמה הברורה ביותר עד כה: צ׳קפוינט ללא שימוש עצמאי, שפורסם לפני ההכרזה, ונושא את רוב הראיות שלו כ-TBD. שימו לב למספר האורך המאושר כשהוא מגיע, התייחסו להישגי מאמר ה-DSpark כהוכחת מקור לשיטה, ולא כהבטחה לצ׳קפוינט הזה, ואם אתם מפעילים את A.X K2 בעצמכם, הקצו משאבים ל-benchmark — זו הדרך היחידה לדעת אם הדראפטר שפורסם בשקט הוא שיפור נחמד של 1.2x או הדבר האמיתי.
