
Spark-X2.5-4B ו-Spark-X2.5-1.7B: מודלים סוכנים קומפקטיים על-המכשיר עם הקשר מקורי של 1M
- orcaחדשOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 לכל 1M טוקנים
- deepseekחדשDeepSeek: DeepSeek V4.1 Flash2026-09-1040אינטליגנציה
- openaiחדשOpenAI: GPT-6 Astra2026-09-0453אינטליגנציה77כתיבת קוד
- googleGoogle: Gemini 3.8 Flash2026-09-0241אינטליגנציה76כתיבת קוד
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245אינטליגנציה76כתיבת קוד
- anthropicAnthropic: Claude Fable 5.12026-09-0153אינטליגנציה82כתיבת קוד
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 לכל 1M טוקנים
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642אינטליגנציה72כתיבת קוד
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 לכל 1M טוקנים
- z-aiZ.ai: GLM 5.32026-08-1845אינטליגנציה75כתיבת קוד
- obsidianQwen3.8 27B2026-08-1534אינטליגנציה68כתיבת קוד
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236אינטליגנציה69כתיבת קוד
- grokSpaceXAI: Grok 4.62026-08-1244אינטליגנציה77כתיבת קוד
- metaMeta: Muse Spark 1.22026-08-0540אינטליגנציה72כתיבת קוד
- qwenQwen: Qwen3.8 Max2026-08-0345אינטליגנציה76כתיבת קוד
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135אינטליגנציה69כתיבת קוד
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 לכל 1M טוקנים
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2451אינטליגנציה78כתיבת קוד
Spark-X2.5-4B ו-Spark-X2.5-1.7B הושקו ב-1 בספטמבר 2026, כאשר SparkLLM — חברת הבת XHToken (词元星火) של iFlytek — שחררה את שני המודלים הקומפקטיים כקוד פתוח תחת Apache 2.0, כשהמשקלים, הקוד ומסמכי הפריסה הופיעו ב-Hugging Face וב-GitHub באותו היום. המפרט המרכזי הוא חלון הקשר מובנה של 1,000,000 טוקנים במודלים קטנים דיים להרצה על-גבי המכשיר, מגובה באוצר מילים של למעלה מ-200 שפות ובעיצוב קשב היברידי שלפי הספק מותאם לעבודה אייג'נטית. מה שידוע היום מהמאגרים הוא משמעותי; מה שעדיין לא אושר הוא כל מה שרק אמות מידה בלתי תלויות יכולות להכריע, כי מודל ששוחרר לפני שעות אין לו עדיין הערכות נייטרליות. למשפחת X2.5 יש גם חבר גדול יותר בדרך — Spark-X2.5-293B, שהוכרז ל-7 בספטמבר.
מה שה-repos למעשה מראים
אוסף Hugging Face מכיל שישה מאגרים: Spark-X2.5-4B ו-Spark-X2.5-1.7B מכוונני הוראות, נקודות הביקורת הבסיסיות שלהם, והמרות GGUF של שניהם. כרטיס ה-4B מתאר ארכיטקטורת קשב היברידית — שכבת קשב מלא אחת על כל שלוש שכבות קשב עם חלון נע — שזה בדיוק הצורה הרצויה כאשר המספר השיווקי הוא 1M טוקנים, משום שקשב מלא על מיליון טוקנים היה אחרת יקר ביחס ריבועי. הכרטיס מציין חלון הקשר טבעי של עד 1M טוקנים, עם שלב אימון בהקשר ארוך שהאריך את אורך הרצף ל-1M במהלך האימון המקדים.
• ארכיטקטורה — קשב היברידי, שכבת קשב מלאה אחת לכל שלוש שכבות של חלון נע; BF16 safetensors.
• הקשר — תמיכה מקורית בעד 1,000,000 טוקנים; האימון לקונטקסט ארוך כלל רצפים עד 1M.
• שפות — יותר מ-200, לפי כרטיס המודל (גם ה-1.7B טוען זאת).
• אימון מקדים — כ-20 טריליון טוקנים של דפי אינטרנט, ספרים, פרסומים אקדמיים, קוד וחומר אנציקלופדי, שאומנו מקצה לקצה על אשכולות Huawei Ascend.
• פוסט-אימון — SFT ולאחריו RL רחב-היקף בחשיבה, קידוד, התנהגות סוכנית וביצוע הוראות, תוך איחוד מדיניויות תחום באמצעות טכניקה שהמאמר מכנה MOPD.
• רישיון — Apache 2.0 לשני הגדלים, ללא סעיפי הכנסה או הגבלות אזוריות מהסוג שמספר מעבדות סיניות אחרות מצמידות לשחרורים פתוחים.

מספרי הסוכן — ועד כמה ניתן לסמוך עליהם
כרטיס המודל מפרסם טבלת אמות מידה מלאה לסוכנים והסקה, והיא מדווחת כולה על ידי הספק וללא שכפול בלתי תלוי — צריך לתייג אותה כך, כי השאלה המעניינת לגבי מודל 4B בן יום אחד היא האם חלק כלשהו מהתוצאות שורד מגע עם הערכות עצמאיות. בטבלה של הספק עצמו, Spark-X2.5-4B משיג 65.1 ב-BFCL-V4 (קריאות פונקציות), 75.1 ב-τ²-bench (משימות סוכן ארוכות טווח), 40.9 ב-BrowseComp, 44.4 ב-SWE-Bench Pro, 90.7 ב-AIME 2026, 81.2 ב-HMMT פברואר 2026, 74.2 ב-IMO-AnswerBench, ו-67.4 ב-GPQA. ה-1.7B מקבל את הרגע שלו במבחן בית חכם: 90.3% דיוק פקודות מקצה לקצה עם זמן השהייה ממוצע של 0.85 שניות על מערך Domux. הספק גם טוען שה-4B "מתחרה במודלי ענן הגדולים ממנו פי 2–3" ביישום אלגוריתמים, השלמת קוד ויצירת קוד — טענה שהיא בו-זמנית המשפט השימושי ביותר בהודעה וזה שהכי זקוק לבדיקה נייטרלית.

מה שמעניין יותר מבחינה מבנית מכל מספר בודד הוא שהגרסה מכוונת לסוכנים כבר מההתחלה. הכרטיס מפרט אינטגרציה עם רתמות Codex, Claude Code, OpenClaw ו‑Hermes, תמיכה בקריאות לכלים עם מפענח ייעודי ב‑SGLang, וחשיבה מופעלת כברירת מחדל (דגל זמן ריצה, enable_thinking, מכבה אותה). במילים אחרות, החברה מיקמה דגם 4B כמודל לשימוש בכלים, לא כצ׳אטבוט, וזה הימור אמיתי: שוק ה‑on‑device נע בפועל לעבר מודלי סוכנים קטנים.
אקוסיסטם של Day-0, והסיפור של vLLM
Spark-X2.5-4B ו-Spark-X2.5-1.7B נתמכים ב-vLLM מהיום הראשון באמצעות תוסף כללי חיצוני (out-of-tree) במקום מיזוג לענף הראשי. האינטגרציה שוכנת במאגר XHToken/Spark-plugin: משבטים אותו ומריצים uv pip install ., ואז משרתים את המודל באמצעות vllm serve וגם --trust-remote-code מול תבנית צ׳אט מותאמת אישית. בגישת SGLang מריצים תמונת Docker מוכנה מראש עם --tool-call-parser spark25 וגם --context-length 1048576 — חלון מלא של מיליון טוקנים בפקודת ההשקה, וזו הדרך המהירה ביותר לאמת בפועל את טענת חלון ההקשר על חומרה אמיתית.

מעבר ל-vLLM ו-SGLang, המודל רץ על הפורק של llama.cpp, MLX (Apple silicon ו-Linux CPU), Ollama ו-LM Studio דרך GGUF, עם תמיכה בכוונון עדין באמצעות פורק של LLaMA-Factory. תמיכת החומרה היא הכותרת הנוספת: {{1}}NVIDIA, Huawei, Hygon ו-HOUMO.AI{{/1}} — ועוד Apple silicon — וזה חשוב כיוון {{2}}שנדיר שמודל ממעבדה סינית מגיע{{/2}} {{3}}עם מסמכי פריסה עבור Ascend, Hygon ושבבים מקומיים{{/3}} כבר ביום הראשון, {{4}}לא כהבטחה{{/4}}.
לשם מה נועד מודל על-מכשיר עם 1M טוקנים
אורך ההקשר הוא התכונה, והוא מכוון למשימות ספציפיות. מיליון טוקנים של הקשר מובנה על מודל 4B משמעותם כל בסיס הקוד, או מערך מסמכים ארוך, שנטען לתוך מודל שרץ מקומית — ללא צנרת RAG, ללא חלוקה למקטעים. ההדגמה של הספק עצמו, המבוססת על כלי המשרד Loomy שלו, גורמת למודל ה‑4B לכתוב סקריפט שמאגד גיליון אלקטרוני של מכירות, מחלץ מדדים ומגמות מרכזיים ומייצר דוח דו‑לשוני בן כ‑3,000 מילים. הזווית הרובוטית היא החצי השני: שני הגדלים ממוצבים לתפיסה וביצוע על‑גבי רובוט ובקצה, כולל בקרה, מעקב מטרות וניווט — וזוהי נישה סבירה עבור מודל 1.7B שעונה תוך פחות משנייה.
המהלך הגדול יותר: Spark-X2.5-293B
שני המודלים הקטנים הם מהלך הפתיחה. ב-7 בספטמבר, SparkLLM מודיעה שתשחרר את Spark-X2.5-293B, מודל בסיס עם 293 מיליארד פרמטרים, שעל פי ההכרזה כולל יכולות קוד וסוכן משופרות. מודלי ה-X2.5 הקטנים הם למעשה החצי שעל המכשיר בסיפור דו-שכבתי; המודל הגדול הוא זה שקובע את תקרת המשפחה. מי שמתייחס ל-4B ול-1.7B כאל ההשקה המלאה מפספס את כיוון ההתפתחות.
איך לנסות את זה, ומה לראות
ה-API עלה לאוויר בפלטפורמת Xingchen MaaS של iFlytek והוא חינמי לזמן מוגבל; המשקלים זמינים ב-Hugging Face, ב-ModelScope ובספריית Ollama. בצד הניתוב, Spark-X2.5-4B חדש מדי, כך שעדיין שום אגרגטור לא משרת אותו — OrcaRouter לא מנתב אותו היום, ואין לקרוא שום דבר בדף זה כאילו הוא כן. אבל ביום שספק מנותב יוסיף אותו, הכלכלה משתנה בדרך צפויה: OrcaRouter מעביר את מחיר המחירון של הספק ב-0% תוספת, כך שכל מחיר שהספק יקבע הוא מה שתשלמו, עם אותו מפתח API שאתם כבר משתמשים בו, ועם מעבר אוטומטי לגיבוי כך שמודל שזה עתה יצא לעולם אינו חייב להיות הימור בפרודקשן. זוהי הצורה הסטנדרטית שבה הבלוג הזה רואה מודל חדש לגמרי, וראוי לומר זאת במפורש.
ארבעה דברים יקבעו אם השחרור הזה יהיה רגע משמעותי או הערת שוליים. ראשית, האם הערכות בלתי תלויות — כניסה לאינדקס של Artificial Analysis, מיקום בזירה, ריצת τ²-bench משוכפלת — בכלל מתקרבות למספרים בטבלת הספק; מודל 4B שקיבל 90.7 ב-AIME הוא מספר גדול, ומספרים גדולים מכרטיס שחרור הם בדיוק אלה שנבדקים. שנית, האם הקשר של 1M-token מחזיק מעמד על מחסנית הקשב ההיברידית בעומסי עיבוד אמיתיים, ולא רק בפקודת ההשקה. שלישית, האם המשקולות שאומנו על Ascend מתנהגות כראוי על חומרה של NVIDIA בשטח. רביעית, מה Spark-X2.5-293B באמת תספק ב-7 בספטמבר. עד אז, הסיכום הכנה של Spark-X2.5-4B ו-Spark-X2.5-1.7B הוא: מבטיח, פתוח, ובלתי מאומת לחלוטין — וזו, עבור מודל ששוחרר הבוקר, ההגדרה הנכונה.
