
דליפת Spark3: המודלים הקטנים בגודל 1.7B ו-4B של iFLYTEK משולבים ב-vLLM
- DeepSeekחדשDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.15 / $0.29 לכל 1M טוקנים
- z-aiחדשZ.ai: GLM 5.32026-08-1860אינטליגנציה75כתיבת קוד
- obsidianחדשQwen3.8 27B2026-08-1552אינטליגנציה68כתיבת קוד
- qwenחדשQwen: Qwen3.8 27B (free)2026-08-13qwen/qwen3.8-27b-free
- deepseekחדשDeepSeek: DeepSeek V4 Pro 08132026-08-1253אינטליגנציה69כתיבת קוד
- grokחדשSpaceXAI: Grok 4.62026-08-1261אינטליגנציה77כתיבת קוד
- metaMeta: Muse Spark 1.22026-08-0557אינטליגנציה72כתיבת קוד
- qwenQwen: Qwen3.8 Max2026-08-0358אינטליגנציה72כתיבת קוד
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3152אינטליגנציה69כתיבת קוד
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 לכל 1M טוקנים
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463אינטליגנציה78כתיבת קוד
- googleGoogle: Gemini 3.6 Flash2026-07-2152אינטליגנציה69כתיבת קוד
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137אינטליגנציה49כתיבת קוד
- metaMeta: Muse Spark 1.12026-07-1653אינטליגנציה71כתיבת קוד
- kimiMoonshotAI: Kimi K32026-07-1560אינטליגנציה76כתיבת קוד
- openaiOpenAI: GPT-5.6 Luna2026-07-0952אינטליגנציה71כתיבת קוד
- openaiOpenAI: GPT-5.6 Terra2026-07-0957אינטליגנציה77כתיבת קוד
- openaiOpenAI: GPT-5.6 Sol2026-07-0961אינטליגנציה77כתיבת קוד
ל-Spark3 אין משקלים ציבוריים, אין כרטיס מודל, אין הכרזה — ובכל זאת השבוע נחתה במנוע ההסקה vLLM בקשת pull request המתארת שני מודלים, Spark3-1.7B ו-Spark3-4B, בפירוט יוצא דופן. בקשת pull request #53373 במאגר vLLM, "[Model] Add Spark3 Model," מוסיפה תמיכת שירות מקורית לארכיטקטורת Spark3: תשומת לב עם חלון נע, תקציב חשיבה מבוקר עם ארבע רמות, הקשר מקורי של מיליון טוקנים בשני הגדלים, ומזהה מודל שמצביע על iFLYTEK. שום דבר מזה לא אושר על ידי הספק, ושום דבר לא שוחרר. זוהי כתבה מסוג "מה שאנחנו יודעים עד כה": בקשת ה-pull request אמיתית, וכל מה שנאמר שהמודלים עושים אינו מאומת עד ש-iFLYTEK — או מי ששולח את Spark3 — באמת יפרסם משקלים.
ההדלפה: בקשת משיכה שנקראת כמו גיליון מפרטים
האות הוא PR פתוח של vLLM, שהוגש על ידי משתמש GitHub בשם KnightYao (תורם שבסיסו בחֶפֵיי ומציין את אוניברסיטת המדע והטכנולוגיה של סין), ונכון ל-23 באוגוסט 2026 הוא טרם מוזג. מתחזק של vLLM ביקש שינויים ב-22 באוגוסט עם ההערה "להחזיק לדיונים". ה-PR מוקדם ושנוי במחלוקת, וזה נורמלי עבור אינטגרציה מסוג זה — והוא גם מפורט במידה יוצאת דופן עבור PR של פרויקט בנוגע למודל שאיש מחוץ למעבדה לא יכול להוריד.
ה-diff נוגע בשמונה קבצים. הוא מוסיף מימוש של Spark3ForCausalLM ב-model executor של vLLM, Spark3Config מקורי שנרשם ב-registries של config ו-model של vLLM, תמיכה בתשומת לב עם חלון נע (sliding-window attention) ובתשומת לב מלאה, ובנוסף גייטינג (gating) של פלט תשומת הלב לפי ראשים, טעינת משקלים במקביליות מסוג tensor ו-pipeline, ומפצל XML של Spark3, כדי שניתן יהיה לפענח את קריאות הכלים של המודל בצורה מובנית. הוא מוסיף גם שורה לתיעוד המודלים הנתמכים של vLLM, שבה נקודת הבידוק (checkpoint) מופיעה כ-XHToken/Spark3-1.7B. התיאור אף טוען שהאינטגרציה עברה בדיקת benchmark: 500 בקשות במקביל, 100% הצלחה, כ-106 בקשות לשנייה ו-13.5K אסימוני פלט בשנייה, על מערכת הבדיקה של הכותב. הנתונים הללו הם דיווח עצמי של מי שכתב את ה-PR, לא benchmark בלתי תלוי, ויש להבין אותם בדיוק כך.
מדוע iFLYTEK היא ההורה הברור — אך לא מאושר
שום דבר ב-PR לא נוקב בשם הספק. אבל מזהה ה-checkpoint שהוא רושם, XHToken/Spark3-1.7B, נמצא תחת הארגון XHToken ב-Hugging Face, והארגון הזה הוא של iFLYTEK: הדף של הארגון מציג אותו כחברה, מקשר ל-opensource.iflytek.com, וכרגע מראה אפס מודלים ציבוריים ואפס מערכי נתונים ציבוריים. "XH" הוא הקיצור הטבעי של 星火 (Xinghuo, "Spark"), משפחת המודלים של iFLYTEK. הוסיפו לכך את מיקומו של המחבר בחפיי — המטה הראשי של iFLYTEK נמצא בחפיי — וההסקה הזו חזקה בערך ככל שהסקה יכולה להיות לפני שהספק מאשר אותה.
זה מתאים לדפוס הפעילות האחרון של iFLYTEK. ה-Spark X2 של החברה, ששוחרר בפברואר 2026, נועד במפורש למקרי שימוש בחינוך, רפואה, רכב וסוכנים, וקו דגמי ה-SparkAuto-EMM למודלים על-התקן מגיע בגדלים קטנים מ-0.5B ועד 7B. יומיים לפני שההודעה הזו לעיתונות הופיעה, בוועידת הדוחות הביניים של החברה ב-21 באוגוסט, אמרה iFLYTEK שדגם דגל חדש למטרות כלליות, הבנוי כולו על מחשוב מקומי, עתיד לצאת, עם גרסה מדורגת שצפויה "עד סוף אוגוסט" והשקה מלאה ביום המפתחים 1024 שלה באוקטובר. האם Spark3-1.7B ו-Spark3-4B הם חלק מהשחרור המדורג הזה, או מסלול נפרד המתמקד בקצה, היא שאלה פתוחה שההודעה לעיתונות אינה עונה עליה.

מה שנאמר שהמודלים הם
טענות ה-PR, כולן לא מאומתות:
• שני גדלים. Spark3-1.7B ו-Spark3-4B. שניהם מתוארים כעיצובים שמתעדפים יעילות ומשתמשים בתשומת לב בחלון נע, במקום פריסת תשומת לב מלאה וצפופה.
• קונטקסט מקורי של 1M טוקנים בשתי הגרסאות. לא הבטחה של מצב מורחב — ה-PR אומר שהקונטקסט מקורי לארכיטקטורה, מה שישים מיליון טוקנים על מודל קטן מספיק כדי להיות אפשרי על GPU יחיד.
• תקציב חשיבה בעל ארבע רמות. ניתן להגדיר את החשיבה כ'ללא', 'נמוכה', 'בינונית' או 'גבוהה' — עיצוב חשיבה הניתן להחלפה המאפשר לאפליקציה לאזן בין עומק החשיבה לבין זמן ההשהיה והעלות לכל קריאה.
• 200+ שפות ועוצמה במבחנים הסיניים. ההודעה לעיתונות טוענת לביצועים חזקים במענה על שאלות ברמות K-12 ובגאוקאו — חתימת iFLYTEK, בהתחשב בעסקי החינוך של החברה — וכיסוי רב-לשוני על פני 200+ שפות.
• קידוד ואוריינטציה של סוכנים. טענות ליצירת קוד חזקה, שימוש בכלים, ביצוע רב-שלבי, והסקה עם הקשר ארוך ביחס לגודלו, המגובות במפענח כלי ה-XML שנכלל באותו PR.
החלק שכדאי לשים לב אליו הוא קונטקסט מקורי של 1M על מודל של 1.7B.
אורך הקונטקסט הוא המקום שבו מודלים קטנים נתקעו. בנוף הנוכחי של משקלים פתוחים, מודל 1.7B–4B בדרך כלל מגיע עם חלון מקורי של 32K–256K: הצ'קפוינטים הקטנים של Qwen3 הם 32K מקורי עם 131K באמצעות RoPE scaling, ואפילו השיפור של Qwen3.5 ל-256K מקורי בגרסאות הקטנות הוא צעד עדכני. קונטקסט של מיליון טוקנים היה עד כה מאפיין של מודלים גדולים — צ'קפוינטי ה-1M של GLM הם מאות מיליארדי פרמטרים. אם Spark3 באמת יספק חלון מקורי של 1M על מודל 4B, זה יהיה מפרט יוצא דופן באמת, וארכיטקטורת הקשב עם החלון הנע (sliding-window attention) היא בדיוק הדרך להפוך את זה לזול מבחינת זיכרון. ההסתייגות שחייבת לבוא לצד זה: נתון כותרתי של 1M מקורי קל לכתוב בהודעה לעיתונות וקשה להפוך אותו לשימושי בפועל. איכות קונטקסט ארוך — האם המודל באמת יכול למצוא ולהשתמש בעובדה שנמצאת 700K טוקנים אחורה — היא שאלה נפרדת מכמה טוקנים נכנסים בחלון, ועדיין לא קיימת הערכה בלתי תלויה.
תקציב החשיבה בר-השליטה חשוב מאותה סיבה. ארבע רמות חשיבה (ללא / נמוכה / בינונית / גבוהה) הן עיצוב חשיבה בר-מיתוג ברוח מצב החשיבה הדו-מצבי של Qwen3, אבל עשיר יותר: במקום בחירה בינארית, אפליקציה יכולה לבחור רמה לכל בקשה — ללא חשיבה לתרגום, גבוהה לסבב סוכן רב-שלבי — ולשלם רק על החשיבה שהיא צריכה. עבור עומס עבודה סוכני או אצוותי, זה בדיוק הכפתור שהופך מודל קטן "מסוגל אך יקר" למודל מנוהל-עלות.
מתכון הפוסט-אימון מתאים לתבנית של 2026
ה-PR אומר ש-Spark3 עבר פוסט-אימון עם "Scaled Reinforcement Learning and MOPD." MOPD — Multi-Teacher On-Policy Distillation — הוא טכניקה אמיתית ועדכנית, המתוארת במאמר arXiv (2606.30406): מאמנים במקביל מורים מומחים בתחומים שונים עם למידת חיזוק (RL), ואז מזקקים אותם בחזרה לתוך תלמיד אחד על ה-rollouts של התלמיד עצמו, תוך מזעור reverse KL לכל טוקן מול המורה המתאים לכל פרומפט. זוהי המתכון של 2026 שמאפשר למודל יחיד לרשת מיומנויות מתמטיקה, קוד וסוכן, בלי שריצת RL אחת תילחם באחרת, והיא קיבלה קרדיט פומבי בפוסט-אימון של מודלים כמו MiMo Flash V2, DeepSeek V4 ו-Nemotron 3 Ultra. הציטוט של Spark3 את אותו מתכון מציב אותו בדור הזה — מודלים קטנים, טכניקות פוסט-אימון מתקדמות. זה גם אומר שלטענות החזקות על "קוד וסוכן" יש מנגנון סביר מאחוריהן. סביר אינו זהה למוכח: הטענות נשארות מדווחות על ידי היצרן עד שהמשקלים יופיעו וירוצו הערכות בלתי תלויות.
מה שבאמת לא ידוע
כמעט כל דבר שיש עליו לוח שנה:
• תאריך שחרור. אין משקלים ב-Hugging Face, אין הכרזה, אין ציר זמן. ארגון XHToken ריק היום.
• אישור ספק. iFLYTEK לא אמרה דבר על Spark3. הקישור לארגון XHToken הוא ראייה חזקה, לא הצהרה רשמית.
• בין אם זה הדגל המדורג. הגרסה המדורגת של iFLYTEK ל"סוף אוגוסט" של הדגל החדש שלה עשויה להיות זו — או שאינה קשורה. ההודעה לעיתונות לא נותנת תאריכים כלל.
• תמחור ורישיון.שום דבר לא נחשף. משפחת Spark של iFLYTEK הייתה היסטורית בעיקר מוגשת דרך API ולא כמשקלים פתוחים, ולכן השאלה אם Spark3-1.7B ו-Spark3-4B הם נקודות ביקורת פתוחות או יעד שירות פנימי נותרת פתוחה.
• כל מדד.נתוני התפוקה ב-PR הם בדיקת ה-serving של המחבר עצמו, לא הערכה עצמאית, ואף לוח תוצאות לא דירג את המודל מכיוון שאין מודל שקיים בפומבי.

מה לצפות
ארגון ה-XHToken ב-Hugging Face הוא ערוץ הפרסום שכדאי לעקוב אחריו. אם המודל אמיתי, המשקולות שלו — או לפחות כרטיס מודל — אמורות להופיע שם, והמעבר של הארגון מאפס למאגר ציבורי אחד הוא האות החשוב ביותר. כמה דברים שכדאי לבדוק ברגע שזה יקרה:
• מספר ההקשר. האם 1M הוא מקורי, או מורחב ב-rope עם פשרה באיכות? ה-PR אומר מקורי; כרטיסי המודל הם המקום שבו זה נקבע.
• ממשק ה-API של תקציב החשיבה. האופן שבו ארבע רמות החשיבה חשופות — כפרמטר דגימה, שדה בתבנית צ'אט, או וריאנט דגם נפרד — קובע כמה קל להשתמש בו בפועל.
• הרישיון. משקלים פתוחים יהפכו את Spark3 לדגם הראשון מתחת ל-5B פרמטרים עם הקשר מובנה של 1M הזמין לאירוח עצמי; השקה באמצעות API בלבד תהפוך אותו למוצר מסוג אחר.
• לוח ההכרזות של iFLYTEK. מוצר הדגל השלבי מובטח עד סוף אוגוסט, וההשקה המלאה ביום המפתחים 1024 באוקטובר. אם Spark3 הוא חלק מאחד מהשניים, התיאור הרשמי יגיד מה שההודעה לעיתונות משאירה פתוח.
• האם ה-PR יתמזג. תמיכה ב-vLLM חשובה כאות איכות וכתשתית: ה-runtime הראשון עם תמיכה מקורית ב-Spark3 הופך את המודל לבר-הרצה בייצור ביום שבו המשקולות ינחתו.
מה שכדאי למפתח לעשות עכשיו
כלום. אין מודל שניתן לקרוא לו, אין משקולות להוריד, אין מפתח API להקצות — כל כלי שטוען שהוא משרת את Spark3 היום משרת משהו אחר. מה שאתה יכול לעשות הוא להחליט כיצד תעריך אותו ביום שבו הוא יופיע, כי זה מודל עם הבטחה שניתנת לבדיקה בקלות: מודל של 1.7B או 4B שקורא מיליון טוקנים ומנמק בארבע רמות עומק, הוא או קטגוריה חדשה באמת של מודלים קטנים, או סיפור של גיליון מפרטים, וההבדל ניתן למדידה תוך אחר צהריים על עומס העבודה שלך.
שם גם שכבת הניתוב מוכיחה את ערכה. ב-OrcaRouter, מודל אינו חוזה שמתחייבים אליו; הוא רשומה בקטלוג שקוראים אליו דרך API אחד, ומחירי המחירון של הספק מועברים הלאה ללא תוספת מחיר — כך שכאשר מודל חדש מופיע בקטלוג של ספק, המחיר האמיתי שלו זמין אצלנו כבר באותו היום, וכדי לנסות אותו אין צורך באינטגרציה שנייה או במשא ומתן מחדש. למודל לא מוכח כמו Spark3, הדפוס ההגיוני הוא אותו דפוס שבו היית משתמש לכל דליפה מבטיחה: שים אותו מאחורי failover אוטומטי ב-DSL של הניתוב, תן לחלק מהתעבורה לפגוע בו, ושמור מודל מוכח בצד השני של הכלל — כך שהערכה גרועה, הפתעת רישוי או תוצאה מאכזבת בהקשר ארוך הופכות לשינוי ניתוב, לא לתקרית. מפתח אחד, נקודת קצה אחת, 200+ מודלים — וכאשר Spark3-1.7B או Spark3-4B יהיו ניתנים להרצה בפועל, ה-pass-through וה-failover יחולו עליהם כמו על כל מודל אחר.
![A screenshot of vLLM pull request 53373 titled '[Model] Add Spark3 Model' on GitHub (captured August 23, 2026) showing the open PR status, the author KnightYao, the 'new-model' label, the reviewers including youkaichao, and the description 'This PR adds native support for the Spark 3 model architecture'.](https://cms.orcarouter.ai/api/media/file/4-438.png)
התקציר הכנה הוא משפט, לא פסק דין: PR של מסגרת שנכתב השבוע טוען של-iFLYTEK יש שני מודלים קטנים עם הקשר של מיליון טוקנים מקורי ותקציב חשיבה בארבע רמות, ולא פורסם שום משקל ראיות שתומך בכך. עקבו אחרי ארגון XHToken, עקבו אחרי ההבטחה של iFLYTEK לסוף אוגוסט, וכשהמשקלים אמיתיים, העבירו אותם דרך כלל ניתוב עם גיבוי (failover) לפני שאתם מהמרים על נתיב ייצור עליהם. זה כל ספר המשחקים לדליפה — תאמינו בתשתית, אמתו את המודל, ושמרו על יציאה זולה.
