
Xing4_0 מגיע ל-SGLang: PR שישי, והגודל המוצהר הראשון, עבור ה-MoE הבא של China Telecom
- OrcaחדשOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 לכל 1M טוקנים
- orcaחדשOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 לכל 1M טוקנים
- deepseekחדשDeepSeek: DeepSeek V4.1 Flash2026-09-1040אינטליגנציה
- openaiחדשOpenAI: GPT-6 Astra2026-09-0453אינטליגנציה77כתיבת קוד
- googleGoogle: Gemini 3.8 Flash2026-09-0241אינטליגנציה76כתיבת קוד
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245אינטליגנציה76כתיבת קוד
- anthropicAnthropic: Claude Fable 5.12026-09-0153אינטליגנציה82כתיבת קוד
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 לכל 1M טוקנים
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642אינטליגנציה72כתיבת קוד
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 לכל 1M טוקנים
- z-aiZ.ai: GLM 5.32026-08-1845אינטליגנציה75כתיבת קוד
- obsidianQwen3.8 27B2026-08-1534אינטליגנציה68כתיבת קוד
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236אינטליגנציה69כתיבת קוד
- grokSpaceXAI: Grok 4.62026-08-1244אינטליגנציה77כתיבת קוד
- metaMeta: Muse Spark 1.22026-08-0540אינטליגנציה72כתיבת קוד
- qwenQwen: Qwen3.8 Max2026-08-0345אינטליגנציה76כתיבת קוד
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135אינטליגנציה69כתיבת קוד
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 לכל 1M טוקנים
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
בהפרש של שעתיים זו מזו, ב-16 בספטמבר 2026, שתי מערכות ההגשה הדומיננטיות בקוד פתוח הפסיקו לחלוק על השם. vLLM הגישה בבוקר את "[Model] Add Xing4_0 support"; sgl-project/sglang באה בעקבותיה עם "feat: add Xing4_0 model support" ב-10:38 UTC, ולאחר שישה שבועות שבהם היו שלושה שמות במשחק, שתי התשתיות אומרות כעת Xing4_0. בקשת ה-pull request של SGLang מכילה משהו שאף אחת קודמת לא הכילה: גודל. היא מתארת את המודל כ-Xing4.0-29B-A4B, "MoE עם 29B פרמטרים וכ-4B פרמטרים פעילים", ומספקת פקודת הרצה שמציינת נתיב checkpoint, הקשר של 262,144 טוקנים ופענוח ספקולטיבי EAGLE. זהו ה-MoE שטרם שוחרר של China Telecom, אותו אחד שבקשות ה-pull request של XingChen4 חגות סביבו מאז אוגוסט, והוא עדיין לא שוחרר: המשקלים אינם פומביים, נתיב ה-checkpoint שה-PR מציין אינו מתפענח לאף אחד מחוץ לפרויקט, אף ספק לא אישר את השם או את המספר, ושום דבר בכתבה הזו אינו מאומת באופן עצמאי. עובדות שנלקחו מבקשות pull request מסומנות ככאלה; השאר הוא היסטוריה והסקה. המודל הקרוב ביותר שאפשר למעשה לקרוא לו היום הוא DeepSeek V4 Flash.
זהו מאמר מסוג 'מה שאנחנו יודעים עד כה', שנשמר מעודכן במקום להתחיל מחדש. הוא מכסה את שרשרת בקשות המשיכה בת שישה השבועות ואת האופן שבו נפתרה שאלת השמות, מה שתי בקשות המשיכה מ-16 בספטמבר באמת מוסיפות, את הארכיטקטורה שקבצי התצורה מדליפים כעת בפירוט אמיתי, ומה כדאי לעקוב אחריו בהמשך. הגרסה במשפט אחד: ה-MoE הבא של China Telecom אמיתי מספיק כדי לצבור שש אינטגרציות הגשה, שורה בטבלה ב-vLLM המסומנת כ-TBA, ערך תיעוד ב-SGLang המסומן כ'בקרוב' וספירת פרמטרים מוצהרת — ועדיין לא אמיתי מספיק כדי לרוץ בכל מקום שאתה יכול להגיע אליו.
האות: שש אינטגרציות, שלושה שמות, שישה שבועות
העקבות מתחילות מוקדם יותר מהגרסה של הכתבה הזו שדווחה לראשונה, ויומן השינויים שלה הוא עדיין הממצא החושפני ביותר בהדלפה. ה-PR הראשון של vLLM היה #51237, נפתחה ב-6 באוגוסט 2026 תחת הכותרת "[WIP][Model] Add upcoming XingChen4 model support." שלושת הקומיטים שלה מספרים את הסיפור בעצמם. הראשון נקרא "Add TeleChat4 model support." השני, קצת יותר משעה לאחר מכן, הוא "chore: revert premature docs and test entry for telechat4" — התיעוד ורשומת הבדיקה של הרישום נמשכו החוצה כמוקדמים. השלישי, ב-27 באוגוסט, הוא "rename xingchen4." דקה לאחר מכן ה-PR נסגר ללא מיזוג, ואחת עשרה דקות לאחר מכן #54051 נפתח עם אותה כותרת, אותו ענף פורק (supported_telechat4) וקומיט מרוכז בודד. תווית needs-rebase הוספה בינתיים, כך שזה נקרא כסגירה ופתיחה מחדש לאחר ניקוי ולא כשינוי דעה. כל זה הוגש מחשבון GitHub zyp2014, כאשר כל קומיט נכתב ונחתם על ידי zhangyp26 <zhangyp26@chinatelecom.com.cn>.
ה-PR השני הזה הוא זה שהכתבה הזו נבנתה במקור סביבו, והוא כבר אינו פתוח. #54051 נסגר על ידי המחבר שלו ב-7 בספטמבר 2026, מבלי שמוזג. עם זאת, שווה לצטט את התיאור שלו, כי זה המשפט ששרד כל שינוי שם וכל פתיחה מחדש:
משקלי המודל עדיין לא פומביים ב-Hugging Face Hub. PR זה נפתח לסקירת קוד מוקדמת. לאחר שמשקלי המודל ישוחררו, אוסיף ערך בדיקה ב-tests/models/registry.py, אעדכן את docs/models/supported_models.md, ואסמן את ה-PR כמוכן לסקירה.
המשפט הזה הוא הצורה של הסיפור כולו: הקוד מקדים את המשקולות. הצילום מסך שלהלן הוא עמוד #54051 כפי שהיה ב-27 באוגוסט 2026, היום שבו נפתח — תמונת מצב מתוארכת, שנשמרה משום שבקשת המשיכה שהיא מציגה נסגרה מאז. יש לקרוא אותה כתיעוד של האות באותו רגע, ולא של מצבו כעת.
![A screenshot of vLLM pull request #54051 '[WIP][Model] Add upcoming XingChen4 model support' opened August 27, 2026, showing the summary that XingChen4 reuses the DeepSeek-V2/V3 backbone (MLA attention, MoE block, optional DSA indexer) and replaces the residual connection with Manifold-constrained Hyper-Connections via Sinkhorn-Knopp projection, optional FlagOS/FlagGems acceleration with up to 19.87% TTFT and 26.32% TPOT reduction claimed on an H100 benchmark, and the status line that model weights are not yet public on Hugging Face (captured August 27, 2026).](https://cms.orcarouter.ai/api/media/file/2-547.png)
ואז, ב-16 בספטמבר, התבנית חזרה על עצמה — פעמיים ביום אחד. #57135, "[מודל] הוספת תמיכה ב-Xing4_0," נפתחה באותו בוקר מאותו חשבון, zyp2014, עם קומיט בודד שכעת נכתב על ידי מהנדס אחר של China Telecom — xiongji <xiongj9@chinatelecom.cn>. אחד עשר קבצים שונו, בערך 1,300 הוספות, שם חדש בכל מקום, ואותה הסתייגות באותו מקום: "משקולות המודל עדיין לא ציבוריות ב-Hugging Face Hub."
שעתיים ועשרים דקות לאחר מכן, מערכת ההגשה האחרת הפסיקה להיות בפיגור של שינוי שם אחד. sgl-project/sglang #39793, "feat: הוספת תמיכה במודל Xing4_0", נפתח מענף בשם support_xing4_0, והקומיט היחיד שלו נושא את אותה כתובת xiongji כמו שינוי השם של vLLM. ארבעה עשר קבצים וכ-1,400 תוספות, שמתוכן קצת יותר מאלף הן קובץ מודל בודד. זהו האינטגרציה השישית שהוגשה עבור המודל הזה בשישה שבועות, והראשונה שהוגשה לא כטיוטה: GitHub מציג אותו כפתוח ומוכן לסקירה, עם עשרה סוקרים מבוקשים — וכל שלוש הרצות ה-CI שלו כבר אדומות.
צד ה-SGLang לפני היום התנהל כמו זה של vLLM. #33982, "feat(model): הוספת תמיכה במודל TeleChat4," נפתח ב-7 באוגוסט 2026 על ידי התורם PaddyXj ונסגר ללא מיזוג ב-31 באוגוסט — באותו יום #37228, "feat: הוספת תמיכה במודל XingChen4," נפתח במקומו. זה עדיין פתוח כטיוטה תחת PaddyXj, בענף בשם support_xingchen4, עם שלושה קומיטים, כשהנגיעה האחרונה בו הייתה ב-8 בספטמבר. רשימת המשימות שלו היא הדבר המעניין ביותר בשני הפריימוורקים: טעינת מודל ויצירה "באופן מקומי, על משקולות פנימיות" מסומנת ב-V, קריאה לכלים מסומנת ב-V, ניתוח חשיבה מסומן ב-V — ו-CI ציבורי לא, משום שהוא "חסום עד לשחרור המשקולות." למישהו יש צ'קפוינט. אף אחד לא פרסם אותו. ובשונה מ-vLLM, שבו כל הגשה מחדש סגרה תחילה את קודמתה, ל-SGLang כעת יש שתי בקשות משיכה פעילות פתוחות עבור אותו מודל, תחת שני שמות שונים.
מה ששש אינטגרציות בשש שבועות מסתכמות בו הוא לא גרסה חזקה יותר של אותו אות; זה אות שונה. שש אינטגרציות היו עקביות עם צוות שעושה איטרציות. שש אינטגרציות תחת שלושה שמות — TeleChat4, XingChen4, Xing4_0 — זה צוות שעושה איטרציות על השם שהמודל ישוחרר תחתיו, בפומבי, בעוד המשקלים נשארים פרטיים. זו הסקה לא מאומתת, וזה הדבר המשמעותי ביותר ששביל ה-PR חושף כעת.
מה ששני ה-PR-ים של ספטמבר בעצם מוסיפים
בקשת ה-pull request של vLLM היא שינוי שם של העבודה מאוגוסט ולא כתיבה מחדש שלה. קובץ המודל הוא כעת vllm/model_executor/models/xing4_0.py, המחלקה היא Xing4_0ForCausalLM, וה-model_type xing4_0 ממופה ל-DeepseekV3Config — אותה קונפיגורציית DeepSeek-V3 שבה השתמשה גרסת XingChen4. מה שהוא נושא:
• מימוש מודל מלא ב-vllm/model_executor/models/xing4_0.py — מחלקה Xing4_0ForCausalLM, עם forward pass, מתאם mHC, ומימוש load_weights() במקביליות טנזורים. הודעת ה-commit מציינת שנתמכות גם גרסאות DSA וגם גרסאות שאינן DSA, תוך שימוש חוזר בפעולות mhc_pre / mhc_post המשותפות.
• רישום של Xing4_0ForCausalLM ב-vllm/model_executor/models/registry.py, כך ש-vLLM מכיר את הארכיטקטורה לפי שמה.
• מנתח הסקה (vllm/reasoning/xing4_0_reasoning_parser.py) "עבור וריאנטים בעלי יכולת הסקה," ומנתח כלים (vllm/tool_parsers/xing4_0_tool_parser.py) לקריאה אוטומטית לכלים.
• רישום ב-vllm/config/speculative.py, vllm/transformers_utils/model_arch_config_convertor.py ו-vllm/transformers_utils/config.py — עם הודעת commit שמציינת שראש MTP תואם DeepSeek-V3 מופעל עבור פענוח ספקולטיבי.
• שני קובצי תיעוד — החלק החדש באמת, והיפוך ישיר של מה שקרה באוגוסט. הקומיט המקורי הכיל רשומת תיעוד ובדיקה שבוטלה כשעה לאחר מכן כמוקדמת מדי; ה-PR של ספטמבר מחזיר את התיעוד בחזרה ומסומן בתור תיעוד, מודל חדש וקריאה לכלים.
ערכי התיעוד של vLLM הם המקום שבו קורא למד לראשונה משהו קונקרטי. ובתוך docs/models/supported_models.md, השורה החדשה מציגה `Xing4_0ForCausalLM` | Xing4_0 | TBA — עמודת ה-checkpoint אומרת פשוט TBA, וזה אותו "עדיין לא" בגופן שונה. ובתוך docs/features/tool_calling.md, תחת הכותרת "Xing4_0 Models (xing4_0)", ה-PR מתעד את פורמט קריאות הכלים של המודל: הקריאות נפלטות בתוך בלוקים של <tool_call>...</tool_call>, אם כ-JSON ({"name": ..., "arguments": {...}}) ואם בצורה מבוססת תגיות המשתמשת ב-<param_key>...</param_key> וב-<param_value>...</param_value>. זו רמת ספציפיות שה-PR-ים המוקדמים לא הגיעו אליה — פרט מימוש של פורמט הצ'אט של המודל, שרשום בתיעוד הציבורי של פריימוורק מרכזי, עבור checkpoint שאיש אינו יכול להוריד.
ה-PR של SGLang מעניין יותר, מכיוון שהוא כולל מימוש וקונפיגורציה ולא רשומת מרשם בתוספת תיעוד. שורת התיעוד שלו היא הפעם הראשונה שמסגרת שמה את שם הספק בתיעוד של עצמה. ב-docs/docs/supported-models/generative_models.mdx, השורה החדשה מפרטת את Xing4_0, כאשר עמודת ה-checkpoint מציינת `Xing4_0` (בקרוב) ותיאור: "המודל MoE של China Telecom עם MLA attention ו-mHC (Manifold-constrained Hyper-Connection) residual streams; תומך בפענוח ספקולטיבי MTP מקורי, בקריאה לכלים ובהסקה." השורה של vLLM אמרה TBA ולא ציינה ספק; זו של SGLang מציינת את China Telecom ואומרת בקרוב. שניהם אינם תאריך שחרור, ושורה בתיעוד של מסגרת אינה מוצר.
תיאור ה-PR מוסיף את המספר שכל גרסה קודמת של הסיפור הזה הייתה חסרה. "PR זה מוסיף תמיכה ב-Xing4.0-29B-A4B (MoE בעל 29 מיליארד פרמטרים עם כ-4 מיליארד פרמטרים פעילים)." הוא גם מספק פקודת הרצה — --model-path XingChen-AGI/Xing4.0-29B-A4B --trust-remote-code --tp-size 2 --context-length 262144 --reasoning-parser xing4_0 --tool-call-parser xing4_0 --speculative-algorithm EAGLE — ומציין שהתצורה אומתה במקביליות טנסורית של 2, הקשר של 262,144 טוקנים ופענוח ספקולטיבי EAGLE MTP, עם תמלילים של תגובת חשיבה וקריאה לכלי get_weather שהודבקו לתיאור כראיות. המשקולות שמאחורי האימות הזה הן של המחבר עצמו: נתיב המאגר שה-PR מציין אינו קריא לציבור, וארגון Hugging Face שאליו הוא מפנה אינו מפרט כלל מודלים פומביים. יש להתייחס לגודל, לאורך ההקשר ולתמלילים כאל טענות שמדווחות ב-PR וצמודות לנקודת ביקורת פרטית, ולא כאל מדידות שמישהו יכול לחזור עליהן. כל זה לפי בקשת המשיכה (pull request) ולא משוחזר.
הופעתם של מנתח החשיבה ומנתח הכלים תחת שני השמות חשובה מאותה סיבה שהיא הייתה חשובה באוגוסט. מנתח חשיבה נועד להסיר סמני חשיבה מפלטו של מודל — שרשרת המחשבה הפנימית שהמודל פולט לפני תשובתו הסופית. מנתח שנבנה במיוחד עבור המודל הזה מרמז שמצפים שמשפחת המודלים תכלול גרסאות בעלות יכולת חשיבה, באותו אופן שבו TeleChat3 הוציאה מהדורות Thinking. מנתח הכלים, יחד עם פורמט הקריאה המתועד כעת, מרמז שגם קריאה לפונקציות נייטיבית צפויה. אף אחד מהשניים אינו ערובה לגבי המוצר הסופי; שניהם הרמזים החזקים ביותר שה-PRs נושאים לגבי מה ש-China Telecom מכוונת אליו.
מה שאנחנו יודעים עד כה, במבט חטוף
לוח התוצאות שלמטה הוא זה שנערך עבור היצירה הזו ב-27 באוגוסט 2026, מתוך ה-PR של vLLM כפי שהיה אז. הוא נשמר כאן בכוונה כתצלום מצב מתאריך מסוים ולא מצויר מחדש, מכיוון שכל שורה בו עדיין נכונה שלושה שבועות לאחר מכן — לא שוחרר, המשקולות אינן פומביות, עמוד שדרה של DeepSeek, שארית mHC, שני המנתחים כלולים. מה שהשתנה אינו ערך על הכרטיס אלא כל מה שסביבו: ה-PR של vLLM שהוא מצטט נסגר ב-7 בספטמבר, העבודה הופיעה מחדש תחת שם חדש ב-16 בספטמבר, SGLang עקבה אחרי שינוי השם שעות לאחר מכן, וספירת הפרמטרים הראשונה שהוצהרה הגיעה איתה. שום דבר על הכרטיס אינו שגוי. הוא פשוט בן שלושה שבועות, והסיפור כבר חלף על פניו. הנתונים של FlagGems בשורה האחרונה שלו עברו ל-PR החדש של vLLM ללא שינוי, עדיין מדווחים ב-PR ועדיין לא משוחזרים.

הארכיטקטורה שה-PRs מדליפים
שינוי שם של קובץ אינו משנה שם של ארכיטקטורה, וטקסט הסיכום ב-PR של vLLM מספטמבר הוא הטקסט של אוגוסט עם Xing4_0 במקום XingChen4 — סעיף אחר סעיף. שני משפטים נושאים את הסימן:
• "Xing4_0 עושה שימוש חוזר בעמוד השדרה של DeepSeek-V2/V3 (קשב MLA, בלוק MoE, אינדקסר DSA אופציונלי)."
הוא מחליף את חיבור השארית הסטנדרטי בחיבורי-על מוגבלי-יריעה (mHC): זרם השארית מורחב ל-num_residual_streams זרמים מקבילים המעורבבים על ידי מטריצות דו-סטוכסטיות תלויות-קלט, המופקות באמצעות היטל Sinkhorn-Knopp.
כל סעיף מתמפה למשהו מוחשי. MLA הוא Multi-head Latent Attention, סכמת הקשב הדחוסה ש-DeepSeek הציגה ב-V2 ומאפשרת למטמון ה-KV להישאר קטן; MoE הוא ניתוב mixture-of-experts, ששומר על מספר פרמטרים גדול עם נפח פעיל קטן. רכיב האינדוקס DSA האופציונלי הוא מנגנון DeepSeek Sparse Attention מסדרת V3.2 — מודול ניקוד קל-משקל שבוחר את טוקני ה-top-k שעליהם להפעיל קשב, ומצמצם את עלות הקשב מריבועית ללינארית בקירוב באורך ההקשר. ומשפט ה-mHC הוא הכותרת: המודל הזה מאמץ את ארכיטקטורת ה-residual ש-DeepSeek עצמה הציגה רק בדור הזה.
ה-PR של SGLang הוא הראשון שמפרסם את הצורה של הדבר במקום לתאר אותה. קובץ התצורה שלו, python/sglang/srt/configs/xing4_0.py, מצהיר על 40 שכבות נסתרות, גודל נסתר של 3,584 ואוצר מילים של 131,072 טוקנים; MLA עם דירוג KV LoRA של 512 ודירוג query LoRA של 768 על פני 32 ראשים; ו-MoE דליל עם 64 מומחים מנותבים ועוד מומחה משותף אחד, ניתוב top-4, ניקוד sigmoid, מקדם סקיילינג מנותב של 2.0 ובחירת מומחים noaux_tc. גם שדות ה-mHC מפורשים: hc_mult 4, עשרים איטרציות Sinkhorn-Knopp, חסם h_res ב-plus או מינוס 30, ו-rope_theta של 10,000 עם הטבעת מיקום מקסימלית של 262,144. אלה ערכי ברירת המחדל באינטגרציה שטרם שוחררה, לפי ה-pull request — קובץ תצורה הוא הצהרת כוונות, לא כרטיס דגם, והנתון 29B-A4B בתיאור ה-PR אינו נגזר מהם בשום מקום פומבי.
שדה אחד שווה יותר מכל השאר, כי זה המקום הראשון שבו המודל הזה מפסיק באופן גלוי להיות העתק של DeepSeek. תצורת SGLang מגדירה את hc_contract_for_draft, שממזגת את זרמי ה-mHC בחזרה למטה לגודל ה-hidden size של המודל עצמו לפני הנרמול הסופי ומזינה אותו טנזור מכווץ לראש הטיוטה של Eagle. DeepSeek V4 מזין במקום זאת את הטנזור המשוטח ב-mHC בגודל n-times-hidden_size. ההערה בתצורה אומרת זאת במפורש, וזה מסוג הפרטים שרק מתגלים לאחר שהמימוש עוצב מול checkpoint אמיתי — וזה מה שרשימת המשימות של ה-PR הקודם של SGLang טוענת שיש לה, בלי לפרסם אותו.
מתמטיקת ה-mHC היא המקום שבו שתי הערימות נפרדות מבחינת המימוש ומסכימות מבחינת ההנחה. ה-PR של vLLM מציין שהוא "matches the shared ops in vllm.model_executor.layers.mhc, so no private kernels are introduced" — המודול הזה קיים משום ש-vLLM כבר תומך ב-mHC עבור DeepSeek V4, כך שהעלות המצטברת של הוספת המודל הזה קטנה. SGLang מגיעה לאותו מקום בדרך אחרת: מודול ה-mHC שלה משתמש בקרנלים של TileLang במיזוג, הרשומים כ-torch custom ops, וה-PR מרחיב את קרנל ה-split-K הקיים mhc_pre כך שיקבל hc_hidden_size 14,336 לצד שני הגדלים שכבר טופלו בו. הוא גם מכבה את נתיב ה-tf32_hc_prenorm_gemm של DeepGEMM עבור הארכיטקטורה הזו, משום שהנתיב הזה הוא הרחבת C גולמית ש-torch.compile אינו יכול לעקוב אחריה; mHC נופל במקום זאת לקרנל של TileLang. היתרון המעשי זהה בשתי המסגרות: אם אתם מגישים את DeepSeek V4 על vLLM או SGLang היום, המכונות שיגישו את ה-MoE הבא של China Telecom כבר מותקנות.
mHC, הטריק של DeepSeek שבמרכז של הכול
Manifold-constrained Hyper-Connections שווה לפרק לגורמים, כי זהו הדבר היחיד המעניין ביותר במודל הזה — וזו לא המצאה של China Telecom. היא של DeepSeek.
הסיפור מתחיל ב-Hyper-Connections, שהוצעו על ידי צוות Kimi ב-2024. Transformer סטנדרטי מחזיק זרם שיורי אחד לכל שכבה: הקלט מתווסף לפלט של השכבה, מה שנותן לגרדיאנטים נתיב נקי ומאפשר לרשת ללמוד תיקון שיורי. Hyper-Connections מחליף את הזרם הבודד הזה במספר זרמים מקבילים שמעורבבים על ידי מטריצות נלמדות בכל שכבה, ובכך נותן למודל נתיב עשיר בהרבה למעבר מידע. המלכוד הוא היציבות: מטריצות ערבוב ללא אילוצים שוברות את תכונת מיפוי הזהות שהופכת חיבורים שיוריים לניתנים לאימון, ובקנה מידה של טריליון פרמטרים האובדן באימון נעשה לא יציב.
התרומה של DeepSeek, שפורסמה כמאמר mHC בדצמבר 2025 ואז שימשה ב-DeepSeek V4, הייתה להגביל את מטריצות המיזוג להיות דו-סטוכסטיות — אי-שליליות, כאשר כל שורה ועמודה מסתכמות לאחת — נאכפת על ידי הקרנת Sinkhorn-Knopp במהלך האימון. למטריצה דו-סטוכסטית יש רדיוס ספקטרלי של בדיוק אחד, כך שאותות לא יכולים להיות מוגברים או מוחלשים באופן אקספוננציאלי כשהם עוברים דרך מאות שכבות. הגבול הזה הוא שמחזיק את האימון יציב בקנה מידה גדול, וההקרנה זולה מספיק כדי ש-DeepSeek דיווחה על תקורת אימון של רק כ-6.7% בארבעה זרמים שיוריים. DeepSeek V4, שיצא ב-24 באפריל 2026, הוא השימוש המוביל בכך, עם שיפור מדווח של כ-15% במשימות הסקה מתמטית וחלון הקשר של מיליון טוקנים בנוסף.
אז מה שה-PRs האלה אומרים, במילים פשוטות, הוא: המודל הבא של China Telecom לוקח את עמוד השדרה המוכח של DeepSeek ואת מנגנון השארית החדש ביותר של DeepSeek, במקום להמציא כל אחד מהם מאפס. זו בחירה פרגמטית, והיא טומנת בחובה אישור עדין — המעבדה הגדולה השנייה, אחרי DeepSeek עצמה, שמאמצת את mHC, מאמינה שהטריק מוכן לייצור.
ה-PRs לא הסתיימו עם mHC, והפריטים הפתוחים כנים לגבי זה. לאורך ה-PRs של vLLM המחבר מציין שההטיות של ה-checkpoint (bias_pre, bias_post, bias_res) ו-clamp של h_res ממוזגים או מושמטים כרגע, ושהאישור של סוקר לשקילות הנוסחה הוא "שאלת הנכונות העיקרית". יש גם פעולת transpose מותאמת אישית שמשאירה טנזור C-contiguous עבור קרנל של TileLang — ששמה שונה יחד עם כל השאר, מ-_xingchen4_transpose_contiguous ל-_xing4_0_transpose_contiguous — ומגבלה קשה: מקביליות pipeline אינה נתמכת במצב mHC כאשר num_residual_streams גדול מאחד, בעוד מקביליות tensor נתמכת. שום דבר מזה אינו מפתיע עבור טיוטה, אבל זה אותו קצה לא-גמור שהיה באוגוסט, וזה כשלעצמו מלמד: שישה שבועות של שינויי שמות לא הזיזו את שאלת הנכונות, ושלוש ריצות ה-CI האדומות ב-PR החדש ביותר של SGLang הן אותו סיפור בצבע אחר. מה שתצורת SGLang כן מכריעה הוא מספר הזרמים. כאשר hc_mult מוגדר ל-4 וגודל hidden הוא 3,584, ה-14,336 ב-kernel patch הוא בדיוק ארבעה זרמים — וההערה ב-kernel אומרת זאת במפורש. הקריאה הזו הייתה הסקה ממספר בלבד כשהקטע הזה פורסם לראשונה; כעת היא כתובה בקובץ תצורה.
זווית ההאצה: FlagGems, שוב
חוט שני קושר את המודל הזה לקשר הקיים של China Telecom עם Beijing Academy of Artificial Intelligence, וזה החוט היחיד ששרד כל שינוי שם בשלמותו. ה-PR של vLLM מאפשר האצה אופציונלית של FlagOS/FlagGems מאחורי דגל סביבה USE_FLAGOS, מושבת כברירת מחדל, תוך החלפה לקרנלים של מסלול חם עבור MoE, attention, softmax ו-top-k. הרווח הנטען, מבנצ'מרק H100 של מחבר ה-PR על עומס עבודה של פרומפט ארוך עם מקביליות גבוהה (יותר מ-10K טוקני קלט, מקביליות 10): עד 19.87% פחות זמן עד לטוקן הראשון ועד 26.32% פחות זמן לכל טוקן פלט, בעוד עומסי עבודה אחרים נותרים נייטרליים. המספרים האלה מדווחים ב-PR ולא שוחזרו, והם מגיעים כשהדגל כבוי כברירת מחדל.
מה שראוי לתעד הוא עד כמה מעט נגע שינוי השם. ה-PR של vLLM מספטמבר נושא את אותם מספרים, את אותה הערת היקף מצומצמת על כך שהדגל נמצא רק בתוך קובץ המודל, ואת אותה הוראה להתקין את flagtree ואת flag-gems. המספרים לא השתנו משום שהקוד לא השתנה; רק התווית השתנתה. בבקשות ה-pull request של SGLang אין כלל שרשור FlagGems — הן בוחרות במקום זאת במסלול של TileLang ו-DeepGEMM — מה שהופך את זה לוויכוח על למי שייכת האופטימיזציה של שכבת ההגשה, ולא על המודל.
זהו סיפור של המשכיות. TeleChat3-36B-Thinking היה, נכון לאפריל 2026, המודל הגדול הראשון שהועבר באופן עצמאי ל-FlagOS, מחסנית התוכנה של BAAI לבינה מלאכותית בקוד פתוח. יהיה אשר יהיה האופן שבו המודל הזה יופץ, המשכת אותו חוט — עם ליבות FlagGems בתוך אינטגרציית ה-vLLM של עצמו — אומר שהאסטרטגיה של המעבדה למחסנית מקומית משתרעת אל תוך שכבת ההגשה, ולא רק לאימון.
שאלת השיום, והמשפחה שממנה היא באה
עד 16 בספטמבר שאלת השמות הייתה הערת שוליים. כעת היא כמעט סגורה, והראיות עדיין כולן בשמות ענפים ובמחרוזות שנשארו ולא בהצהרות — אך שתי המסגרות התכנסו לאותה תשובה מאותו כיוון.
• הודעות הקומיט, לפי הסדר: "הוסף תמיכה במודל TeleChat4", ואז "מטלה: החזר תיעוד ורשומת בדיקה שהוקדמו עבור telechat4", ואז — שלושה שבועות לאחר מכן ודקה אחת לפני שה-PR נסגר — "שנה שם xingchen4". קומיט שכל מטרתו הייתה שינוי השם.
• הפורק מסתעף. שני ה-PRים הראשונים של vLLM, #51237 ו-#54051, נחתכו מ-zyp2014:supported_telechat4. השלישי, #57135, הוא zyp2014:support_xing4_0. שם הענף שונה באותו מהלך ששינה את שם המודל — וצד ה-SGLang עשה כעת את המסלול הזהה בשלושה שלבים, מ-support_telechat4 דרך support_xingchen4 ל-support_xing4_0.
• גוף הטקסט של #51237, שבו נאמר שהאצת FlagGems הייתה "עבור TeleChat4", בעוד שאותה פסקה ממש כינתה את המודל XingChen4. שני השמות כבר התנגשו בסיכום של המחבר עצמו ב-6 באוגוסט.
• שינוי השם קובץ-מול-קובץ בשני הצדדים. ב-vLLM זה היה מ־xingchen4.py ל־xing4_0.py ומ־XingChen4ForCausalLM ל־Xing4_0ForCausalLM; ב-SGLang זה xingchen4.py ל־xing4_0.py ומ־XingChen4Config ל־Xing4_0Config, על ענף שגם שמו שונה יחד עם זה. אף אחד מה-PRים לא השאיר את השם הישן בשום מקום ב-diff שלו.
אז שלושה שמות היו במשחק בשתי מסגרות, והדפוס עקבי עם מודל יחיד שמשנים את שמו כשהוא מתקרב למה שיהיה שמו הציבורי. "Xing4_0" נקרא באופן טבעי כ-Xingchen 4.0 — המשפחה של המודל ממותגת 星辰 (Xingchen) בסינית — אבל זו עדיין הסקה מהמחרוזת, לא משהו שכל הודעת יחסי ציבור מציינת במפורש. זה יכול באותה מידה להיות ש-TeleChat4 ו-XingChen4 הם אחים באותו דור ולא מודל אחד תחת שני שמות, אם כי ה-fork המשותף, פסקת הארכיטקטורה המשותפת, מספרי FlagGems המשותפים, הפריטים הפתוחים המשותפים וכעת שינוי שם משותף מקשים לטעון זאת. איש לא אישר את הקשר ו-China Telecom לא הגיבה. מה שכן השתנה הוא ששינוי השם אינו עוד בחירה של תורם אחד: שני פרויקטי serving עצמאיים, המתוחזקים בידי אנשים שונים, תייגו מחדש את האינטגרציה שלהם לאותו שם שלישי בתוך יום זה מזה.
המשפחה עצמה ראויה להימצא לנגד עינינו, כי היא מסבירה את הפרגמטיות. הגרסאות הציבוריות שהופצו עד כה מותגו כ-TeleChat:
• TeleChat-7B ו-TeleChat-12B, ששוחררו כקוד פתוח בינואר 2024 עם מאגר של טריליון טוקנים.
• TeleChat2-115B (ספטמבר 2024), שהוצג כמודל הפתוח הראשון בעל טריליון פרמטרים שכולו מקומי, ובנוסף לו הדגמים האחים 35B, 7B ו-3B.
• TeleChat2-39B-A12B (מרץ 2025), ה-MoE הראשון של המשפחה.
• TeleChat3-105B-A4.7-Thinking (דצמבר 2025), מודל MoE מגורען-דק עם 105B פרמטרים בסך הכול ו-4.7B פרמטרים פעילים, שאומן על 15 טריליון טוקנים, לצד המודל הדחוס TeleChat3-36B ומאוחר יותר TeleChat3-Coder-36B-Thinking.
אם הנתון 29B-A4B מחזיק, המודל הזה היה ממוקם מתחת ל-TeleChat3-105B-A4.7-Thinking הן בפרמטרים הכוללים והן בפרמטרים הפעילים — אח קטן וזול יותר ולא ספינת דגל חלופית. זו פרשנות, לא עובדה; אין דבר באף אחד משני ה-PR-ים שאומר לאיזו דרגה המודל מכוון. מותג Xingchen הוא המקום שבו החברה משקיעה את מאמצי ה-AI שלה: Xingchen AGI Lab הוקמה רשמית בבייג'ינג במרץ 2026, בהתבסס על אותה משפחת מודלים, ו-China Telecom מתארת את מערכת "三全" שלה (כל-מודאלי, בכל הגדלים, תוצרת מקומית מלאה) כמשתרעת על מודלים סמנטיים, קוליים, חזותיים ורב-מודאליים מ-1B ועד 1T+ פרמטרים. שינוי שם מ-TeleChat ל-Xingchen הוא בדיוק מה שמעבדה עושה כשהיא רוצה שמשפחת המודלים תישא את המותג של המעבדה ולא את המותג של קו המוצרים.
מה שאנחנו עדיין לא יודעים
עבור מודל כה מוקדם, הרשימה הכנה עדיין ארוכה מהרשימה הידועה, אף שהיא הצטמצמה בשני מקומות השבוע:
• אין תאריך שחרור. חמש משש האינטגרציות הן טיוטות שנפתחו לסקירת קוד מוקדמת, בדיוק משום שהמשקלים אינם פומביים. השישית, SGLang #39793, פתוחה לסקירה ולא כטיוטה — אך היא אינה ממוזגת, כל שלוש הרצות ה-CI שלה נכשלות, והיא זקוקה לסוקר שיאשר אותה. אין לוח זמנים מוכרז.
• מספר פרמטרים, אך רק כזה שנטען. כל גרסה קודמת של הקטע הזה פירטה את תצורת ה-MoE כלא מפורסמת. ה-PR של SGLang משנה זאת על הנייר: Xing4.0-29B-A4B, 29B סה״כ, כ-4B פעילים. הנתון מגיע מ-pull request, אינו מצורף לשום checkpoint ציבורי, אינו מאושש על ידי אף קובץ קונפיגורציה, ואף אחד מחוץ לפרויקט לא שחזר אותו. התייחס לזה כאל כוונה מוצהרת, לא כמפרט.
• אין מספרי בנצ'מרק, בין אם מדווחים על ידי הספק ובין אם לאו, ואין ציונים בלתי־תלויים. תמלילי האימות ב-PR של SGLang מראים שהמודל עונה לפרומפט חשיבה ומפיק קריאה לכלי עם מבנה תקין; הם גם אינם מראים דבר על עד כמה הוא עושה זאת היטב.
• אין תמחור, ואין רישיון מאושר. כל גרסה קודמת של TeleChat היא Apache-2.0, וזה מעודד, אך לא צוין רישיון עבור זו.
• אין משקלים ציבוריים — עובדה מאומתת ולא הנחה. נכון ל-16 בספטמבר 2026, נתיב ה-Hugging Face שה-PR של SGLang מציין אינו קריא לציבור, והארגון שאליו הוא מפנה אינו מפרט מודלים ציבוריים; הרשומה הציבורית החדשה ביותר במשפחה היא TeleChat3-Coder-36B-Thinking מינואר. טבלת המודלים הנתמכים של vLLM מציינת TBA בעמודת ה-checkpoint, זו של SGLang מציינת "בקרוב", ולשתי בקשות ה-PR של SGLang יש CI ציבורי שנכשל.
• אין מילה רשמית מ-China Telecom — אין הכרזה, אין משקולות, אין אישור לשם או לגודל. שימו לב היטב לחוסר הסימטריה: שורת התיעוד של SGLang מייחסת את המודל ל-China Telecom, אבל זה תיאור של תורם בתוך בקשת משיכה, לא הצהרה של החברה, ותיאור ה-PR החדש ביותר משמיט לחלוטין את שם הספק. שש אינטגרציות שנבנות עבור המודל הזה הן הראיה החזקה ביותר עד כה שהוא אמיתי, אבל אינטגרציות נסגרות ושמות קוד משתנים; שתיים כבר נסגרו. שום דבר לא מאושר עד שהמעבדה תאמר זאת.
הקריאה הנכונה של כל זה אינה ספקנות לגבי המודל; היא תמונה מדויקת של אות ראשוני. מה שקיים היום הוא ארטיפקט הנדסי אמיתי — שישה כאלה, על פני שתי מסגרות — עם ארכיטקטורה אמיתית, ולראשונה, צורה מוצהרת שמצורפת אליו. מה שעדיין לא קיים הוא משהו שאפשר להוריד, לקרוא לו או למדוד את ביצועיו.
הדבר הקרוב ביותר שאפשר להריץ היום
המודל הזה אינו ניתן להפעלה בשום מקום — לא דרך API ולא באופן מקומי, מכיוון שהמשקלים אינם פומביים. המודל הקרוב ביותר שקורא יכול למעשה לקרוא לו היום ושחולק את ה-DNA הארכיטקטוני שלו הוא DeepSeek V4 Flash, שמשתמש באותה סכמת שיורית mHC מעל MLA ו-MoE, והוא מימוש הייחוס שעבורו נבנו מודולי ה-mHC המשותפים בשתי המסגרות. עמוד המודל של OrcaRouter עבור deepseek/deepseek-v4-flash מציג הקשר של 1M טוקנים, פלט מקסימלי של 384K ותמחור מחירון של $0.15 למיליון טוקני קלט ו-$0.29 למיליון פלט — אותם נתונים ש-DeepSeek עצמה מפרסמת, מועברים הלאה עם 0% תוספת, כך ששינוי מחיר של ספק חי כאן באותו יום. מפתח API אחד מכסה את הקטלוג, מה שהופך את ההשוואה שלו לשאר שכבת ההיסק לכלל ניתוב ולא לאינטגרציה חדשה.
זו גם התשובה המעשית לשאלה "איך אני מנסה את המודל הזה כשהוא יוצא." צ'קפוינט חדש לגמרי ובלתי מוכח הוא בדיוק המקום שבו מעבר אוטומטי לגיבוי מצדיק את עצמו: לנתב אליו חלק מהתעבורה, להשאיר מודל מוכח כגיבוי, ולתת לשכבת הניתוב לקבל את ההחלטה במקום להמר על מסלול פרודקשן על סמך התנהגות היום הראשון. מודל MoE של 29B עם בערך 4B פרמטרים פעילים, אם זה מה שיגיע, הוא דבר זול לנתב מול מודל חוד בדיוק מפני שכל כך מעט ממנו מופעל לכל טוקן. אם השם ישתנה שוב בין עכשיו לשחרור — וששת השבועות האחרונים מרמזים שזה עשוי לקרות — כלל הניתוב הוא מה שתשכתב, לא האינטגרציה.

שאלות נפוצות
למה ה-PR של vLLM נסגר?
אנחנו יכולים לראות את הסגירה, לא את הסיבה. #54051 נסגר על ידי המחבר שלו ב-7 בספטמבר 2026 בלי שאוחד, והעבודה הופיעה מחדש תשעה ימים לאחר מכן כ-#57135 תחת שם חדש. PR קודם של vLLM, #51237, נסגר והוגש מחדש באותו יום תחת אותה כותרת, כך שסגירה והגשה מחדש הן הדפוס של המחבר הזה ולא סימן לצרות — אבל גופי ה-PR אינם מציינים סיבה ואנחנו לא מתכוונים להמציא אחת.
מתי ישוחרר Xing4_0?
אין תאריך. חמש מתוך שש האינטגרציות הן טיוטות שנפתחו לסקירת קוד מוקדמת, והתוכניות של המחברים עצמם הן להוסיף רשומות בדיקה, לעדכן תיעוד ולסמן את ה-PRs כמוכנים רק לאחר שהמשקלים ישוחררו. רשימת המשימות הישנה יותר של SGLang היא ההצהרה הברורה ביותר לגבי מצב הדברים: "המודל נטען ומייצר (באופן מקומי, על משקלים פנימיים)" מסומן ב-V, וה-CI הציבורי "חסום עד לשחרור המשקלים". ה-PR החדש יותר של SGLang הוגש כמוכן לסקירה ולא כטיוטה, שזה שינוי בגישה ולא שינוי בסטטוס — הוא טרם מוזג, ה-CI שלו אדום, ושורת תיעוד שעליה כתוב "בקרוב" אינה השקה.
האם Xing4_0 הוא אותו דגם כמו XingChen4?
כמעט בוודאות כן, וה-PRs מקלים לבדוק: אותו קו פיצול, אותה פסקת ארכיטקטורה, אותם נתוני benchmark של FlagGems, אותם פריטים פתוחים, ושינוי שם קובץ-לקובץ בשתי המסגרות — xingchen4.py ל-xing4_0.py, כולל מחלקת config, בענפים ששמם שונה בהתאמה. זו אותה עבודה שעוטה שם חדש, ונכון ל-16 בספטמבר גם vLLM וגם SGLang אימצו את השם הזה. מה שאף PR לא מציין הוא איזה שם יישא צ'קפוינט משוחרר.
האם זה מודל DeepSeek?
לא. זה המודל של China Telecom, מהמעבדה Xingchen AGI Lab. הקשר ל-DeepSeek הוא ארכיטקטוני: הוא עושה שימוש חוזר בעמוד השדרה של DeepSeek-V2/V3 ובסכמת השארית mHC ש-DeepSeek הציעה והשיקה ב-V4. אימוץ הארכיטקטורה של מישהו אחר אינו זהה לכך ששני הפרויקטים קשורים.
מה לצפות בהמשך
ה-PR-ים עדיין מספקים צ'קליסט קונקרטי, והזוג מ-16 בספטמבר הוסיף לו שני פריטים. ראשית, המשקלים: כל מחבר אמר שהעבודה שלו תלויה ב-Hugging Face, ולכן הופעתו של מאגר ציבורי היא האירוע הקריטי — וה-PR של SGLang נותן כעת את הנתיב המדויק למעקב, XingChen-AGI/Xing4.0-29B-A4B, שכרגע אינו נגיש לאף אחד. שנית, ה-PR-ים עצמם: זה של vLLM זקוק לכך שנוסחאות ההטיה של mHC יאושרו, שהרשומה של הבדיקה ב-registry תיווסף ושה-CI שלו יהיה ירוק; ה-#39793 של SGLang זקוק לכך ששלוש ההרצות האדומות שלו יתוקנו ושעשרת הסוקרים שהתבקשו יאשרו אותו, בעוד ש-#37228 הישן עדיין זקוק לרשומת הבדיקה שלו, לבנצ'מרק האצת ה-MTP שלו ול-CI לא חסום. שלישית, וחדש השבוע: האם SGLang תסגור את #37228 לטובת #39793 כפי ש-vLLM תמיד סגרה קודמו לפני הגשה מחדש. שתי אינטגרציות חיות עבור מודל אחד שטרם שוחרר הוא מצב שאיש לא מתחזק לאורך זמן, ואיזו מהן שורדת אומר משהו על עד כמה זה באמת קרוב. רביעית, המספרים: האם צ'קפוינט משוחרר תואם את צורת 29B-A4B, את ה-MoE בעל 64 המומחים ואת חלון ההקשר של 262,144 טוקנים שהקונפיגורציה ותיאור ה-PR מצהירים עליו כעת. חמישית, האם ה-PR השלישי של vLLM שורד זמן רב יותר משני קודמיו, שנמשכו 21 ו-11 ימים בהתאמה לפני שנסגרו ללא מיזוג. ועקבו אם מנתחי ההיסק מתארים וריאנט Thinking נפרד כפי ש-TeleChat3 שחררה אחד.
עד שאחד מהדברים האלה יקרה, התייחסו למודל הזה כאל מה שהוא: תוכנית מוגדרת היטב ממעבדה רצינית, שנתפסה בעת הכנת תשתית ההגשה שלה — כעת בשני סטאקי ההגשה המרכזיים בקוד פתוח, תחת שם ששניהם אימצו וגודל שרק ה-pull request של המודל עצמו מציין. הארכיטקטורה לבדה הופכת אותו לראוי למעקב: זהו האימוץ המשמעותי השני של mHC אחרי DeepSeek עצמה, ממעבדה שהדור הקודם שלה כבר היה MoE בעל גרעיניות עדינה שאומן על שבבים מקומיים. כשהמשקולות ישתחררו, לא תהיה שאלה אם הוא ירוץ ב-vLLM או ב-SGLang. שני הסטאקים כתבו את הקוד שלוש פעמים, תחת שלושה שמות שונים.
השוואות במאמר הזה2
זוהה מתוך המאמר הזה · בנצ'מרקים: Artificial Analysis · מתעדכן יומית
