
Qwen3.8-27B Text+Video מגיע ל-CPU: מה משנה PR ה-torchcodec של SGLang?
- z-aiחדשZ.ai: GLM 5.32026-08-1860אינטליגנציה75כתיבת קוד
- obsidianחדשQwen3.8 27B Uncensored (Aggressive)2026-08-1552אינטליגנציה68כתיבת קוד
- qwenחדשQwen: Qwen3.8 27B (free)2026-08-1341 tok/s
- deepseekחדשDeepSeek: DeepSeek V4 Pro 08132026-08-1253אינטליגנציה69כתיבת קוד
- grokחדשSpaceXAI: Grok 4.62026-08-1261אינטליגנציה77כתיבת קוד
- metaחדשMeta: Muse Spark 1.22026-08-0557אינטליגנציה72כתיבת קוד
- qwenQwen: Qwen3.8 Max2026-08-0358אינטליגנציה72כתיבת קוד
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3152אינטליגנציה69כתיבת קוד
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 לכל 1M טוקנים · 237 tok/s
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463אינטליגנציה78כתיבת קוד
- googleGoogle: Gemini 3.6 Flash2026-07-2152אינטליגנציה69כתיבת קוד
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137אינטליגנציה49כתיבת קוד
- metaMeta: Muse Spark 1.12026-07-1653אינטליגנציה71כתיבת קוד
- kimiMoonshotAI: Kimi K32026-07-1560אינטליגנציה76כתיבת קוד
- openaiOpenAI: GPT-5.6 Luna2026-07-0952אינטליגנציה71כתיבת קוד
- openaiOpenAI: GPT-5.6 Terra2026-07-0957אינטליגנציה77כתיבת קוד
- openaiOpenAI: GPT-5.6 Sol2026-07-0961אינטליגנציה77כתיבת קוד
- grokxAI: Grok 4.52026-07-0856אינטליגנציה72כתיבת קוד
טיוטת בקשת משיכה ב-SGLang כרגע שכותרתה “[CPU] Support Qwen3.8 text+video: adding torchcodec, ffmpeg and removing pin_memory.” אם נפשיט את זה, זה נשמע כמו מפת דרכים: Qwen3.8-27B — מודל הראייה-שפה של Alibaba, תחת רישיון Apache-2.0, עם 27 מיליארד פרמטרים, שפורסם כקוד פתוח לפני חמישה ימים — מחובר כך שמצב הטקסט+וידאו שלו ירוץ על חומרה ללא GPU. זהו האות הקונקרטי הראשון לכך שה-27B הרב-מודלי מקבל נתיב שרת CPU אמיתי באחת מסביבות ההרצה שצוותים פורסים בפועל, וזה חשוב לכל מי שחיכה להריץ הבנת וידאו מקומית בלי לקנות כרטיס 48GB.
שום דבר ב-PR הזה עוד לא מוזג — זה טיוטה, ה-CI אדום, ופיני הגרסאות עדיין זזים. אבל זו בדיוק הסיבה שכדאי לקרוא אותו בעיון. המודל שמאחוריו אמיתי ושוחרר, המערכת האקולוגית של השרתים כבר השיגה את הקצב על GPU, וה-PR הזה מראה לאן מועדת הדרך בלי GPU. הנה מה שהשינוי בעצם עושה, למה הסקת וידאו על CPU למודל של 27B היא עניין גדול יותר ממה שזה נשמע, מה אושר לגבי Qwen3.8-27B, ואיפה אפשר לקרוא לו היום.
המודל בפסקה אחת
Qwen3.8-27B הוא המודל הפתוח בגודל 27B של דור Qwen 3.8: מודל ראייה-שפה צפוף עם כ-27.8B פרמטרים (64 שכבות, גודל חבוי 5,120) הכולל מגדל ראייה ייעודי, שיצא לאור תחת רישיון Apache 2.0 ב-Hugging Face וב-ModelScope בערב ה-14 באוגוסט 2026 (שעון בייג'ינג). הוא מקבל טקסט, תמונות ווידאו ומחזיר טקסט — באופן טבעי, לא באמצעות מתאם שהוצמד מבחוץ — עם חלון הקשר טבעי של 262,144 טוקנים, הניתן להרחבה לכמיליון בקירוב באמצעות YaRN. הרישיון הוא המתיר: שימוש מסחרי, כיוונון עדין והפצה מחדש, ללא סף הכנסות וללא הסכם מסחרי נפרד, בניגוד לתנאי נקודת הביקורת הדגלית.
שני פרטים ארכיטקטוניים חשובים למפרס יותר ממפרטי הכותרת. הראשון הוא קשב היברידי: רוב השכבות משתמשות בקשב ליניארי של Gated DeltaNet ורק רבע מהן שומרות על מטמון KV מלא, ולכן זיכרון ההקשר הארוך הוא שבריר ממה שמודל צפוף רגיל בעל 64 שכבות דורש — אותו טריק שהופך חלון של 262K למציאותי בתוך GPU צרכני יחיד. השני הוא חיזוי רב-טוקנים (MTP), שמגיע עם ה-checkpoint כולל ראש פענוח ספקולטיבי משלו, ומאיץ את הפענוח בצורה הניתנת למדידה כשמחסנית ההגשה משתמשת בו.
הוא גם הדגם במשפחה שתומך בווידאו. הצ'קפוינט הפתוח הדגל, Qwen3.8-2.4T-A95B, הוא למעשה טקסט בלבד בגרסה הניתנת להורדה, וה-API המארח Qwen3.8-Max מוסיף יכולת ראייה על גבי אותם משקלים. דגם ה-27B הוא זה שבאמת אפשר להוריד ולהריץ, והוא תומך בטקסט, תמונה ווידאו ישירות מהקופסה — ולכן נתיב CPU עבור מצב הווידאו שלו שווה מעקב.
מה ה-PR של SGLang בעצם משנה
ה-PR (sgl-project/sglang #35492) הוא צר וקריא. התיאור שלו: “ה-PR הזה הוא לתמוך ב-Qwen3.8 טקסט+וידאו, על ידי הוספת torchcodec, ffmpeg והסרת pin_memory.” בפועל מדובר בשלוש פעולות.
• torchcodec — ספריית פענוח הווידאו של PyTorch המבוססת על ffmpeg — נוספת למחסנית, כך שניתן לפענח ולעבד מראש פריימי וידאו עבור Qwen3.8 text+video על ה-CPU של המארח. בקשת המשיכה קובעת את torchcodec 0.12.0 מול torch 2.12, ומציינת כי ffmpeg חייב להישאר מתחת לגרסה 9.
• pin_memory מוסר מהנתיב הרב-מודאלי. pin_memory הוא אופטימיזציית העברת GPU שמקבעת את באפרי המארח להעתקה אסינכרונית מהירה להתקן; הסרתו בנתיב CPU בלבד היא הסימן לכך שלחומרת היעד אין מאיץ בדיד בנתיב הנתונים.
פקודת השכפול משיקה את המודל בפועל — {{1}}Qwen/Qwen3.8-27B{{/1}} — דרך {{2}}sglang.launch_server{{/2}} על {{3}}CPU{{/3}} עם נתיב הקלט {{4}}text+video{{/4}} מופעל.
קרא את תוויות הסטטוס לפני שאתה בונה על זה משהו: ה-PR הוא טיוטה, שתי ריצות ה-CI נכשלות, והוא עדיין ממתין לסקירה של בעלי הקוד של SGLang נכון להיום. זה כיוון, לא שחרור. ההקשר החשוב הוא ש-SGLang כבר משרת את Qwen3.8-27B על GPU — המדריך מכסה את H200, RTX PRO 6000, RTX 5090 ו-DGX Spark, עם תמונת lmsysorg/sglang:qwen38-27b ייעודית — ולכן נתיב הטקסט+וידאו על CPU הוא החלק החדש באמת.
![A screenshot of the draft SGLang pull request #35492 titled '[CPU] Support Qwen3.8 text+video: adding torchcodec, ffmpeg and removing pin_memory', showing the description quoting torchcodec 0.12.0 against torch 2.12 and ffmpeg below 9, a reproduce command launching Qwen/Qwen3.8-27B with --device cpu, and the note that an approving review is required before the pull request can merge.](https://cms.orcarouter.ai/api/media/file/2-375.png)
למה טקסט+וידאו במעבד חשוב יותר ממה שזה נשמע
אליבאבא מיצבה את ה-27B לבינה מלאכותית קצה מהיום הראשון — MediaTek התאימה אותו לשבבי המובייל Dimensity ולתא הטייס לרכב C-X1 באותו היום שבו שוחררו המשקלים. סיפור הפריסה המקומית חיזק זאת: קוונטיזציה Q4_K_M היא בערך 17.1GB, מה שמתאים ל-GPU צרכני עם 24GB או ל-Mac עם Apple Silicon וזיכרון מאוחד של 32GB. הדבר היחיד שהסיפור הזה לא יכל לעשות היה וידאו על מכונה ללא GPU כלל. זה הפער ש-PR הזה נותן לו מענה.
נתיב טקסט+וידאו על CPU הופך הבנת וידאו לניתנת לפריסה על שרתי CPU רגילים — מכונות וירטואליות, שרתים קטנים, יחידות מדף מקומיות, שערי קצה — שבהם העומס הוא אסינכרוני והתפוקה חשובה יותר מהשהיה. כיתוב וידאו, ניהול תוכן, ניתוח מסמכים ודיאגרמות, שליפה לא מקוונת מתוך הקלטות: אלה בדיוק משימות האצווה שאינן זקוקות ל-GPU, וכיום הן עדיין מניחות שקיים GPU עבור כל VLM עם קלט וידאו.
הפשרה הכנה היא ש-Qwen3.8-27B הוא מודל עם 27 מיליארד פרמטרים, ושום נתיב CPU לא הופך 27B למהיר. צפו לכמה אסימונים בודדים בשנייה על שרת AVX רציני עם פריימים של וידאו בהקשר — מתאים לעבודות אצווה וללילה, אבל לא לצ'אט אינטראקטיבי על וידאו. הנקודה של נתיב ה-CPU היא שהאופציה קיימת בכלל: פריסה ללא GPU יכולה להריץ את מצב הווידאו של אותו מודל במקום לרדת למודל ראייה קטן יותר או לשלוח כל פריים ל-GPU בענן.
היכן Qwen3.8-27B פועל כיום
המערכת האקולוגית הדביקה את המודל מהר. בצד האירוח העצמי יש לך llama.cpp ו-LM Studio עם חבילות GGUF עד לקוונטיזציה של כ-10.7GB ב-2 ביט, Ollama לפקודה אחת, ו-vLLM ו-SGLang לשרת תקין. רוב זה טקסט או תמונה היום; נתיב הווידאו על CPU הוא החלק שעדיין נמצא בבנייה.
אם אתה מעדיף לא להריץ 27B בעצמך, המסלול המתארח כבר קיים: OrcaRouter משרת את qwen/qwen3.8-27b עם קלטי טקסט, תמונה ווידאו, חלון הקשר של 262,144 טוקנים, ופלט טקסט, במחיר של $0.33 למיליון טוקני קלט ו-$2.40 למיליון טוקני פלט. הוא נמצא מאחורי אותו endpoint תואם OpenAI כמו כל דגם אחר בפלטפורמה — מפתח API אחד, בלי חוזה שני — וה-failover האוטומטי ו-DSL הניתוב של הפלטפורמה חלים על 200+ הדגמים על אותו מפתח. דגם בן חמישה ימים עם נתיב CPU לא מוכח הוא המקרה המובהק לניתוב במקום חיבור ישיר: אתה יכול לנסות את Qwen3.8-27B על עומסי עבודה אמיתיים מאחורי מסלול מבלי להמר על כל נתיב הקריאות שלך על סטאק שירות אחד, ולעבור בין גרסה באירוח עצמי לגרסה מתארחת בלי לשנות קוד.

המספרים — שדווחו על ידי הספק, וכדאי לבדוק
כל נתון ראשי להלן הוא נתון של עליבאבא עצמה, מתוך כרטיס המודל וחומרי ההשקה. המודל בן חמישה ימים ושכפול בלתי תלוי רק מתחיל להופיע, לכן יש להתייחס לנתונים אלה כאל טענות עם כיוון ברור ולא כאל פסקי דין. עבור דגם 27B, ציוני הקידוד והסוכן הם אלו שמושכים תשומת לב:
• SWE-bench Pro — 61.7 (דווח על ידי Alibaba; הטבלה שלו מציגה את Claude Opus 4.6 Max ב-53.4)
• Terminal-Bench 2.1 — 73.0 (קידוד סוכני בטרמינל)
• OSWorld-Verified — 84.3 (משימות סוכן לשימוש במחשב)
• AndroidWorld — 81.9
• DeepSWE 1.1 — 42.2, בערך פי שלושה מהציון 13.3 של ה-27B הפתוח הקודם
בצד הראייה — הצד שהמאמר הזה באמת עוסק בו — Alibaba מדווחת על VideoMME 87.0 להבנת וידאו ועל MathVision 90.0 להיגיון חזותי ללא כלים. הקריאה המוקדמת של Artificial Analysis מציבה את המודל על 52 במדד ה-Intelligence Index שלו ועל 51 במדד ה-Agentic Index שלו, תחרותי מול מודלים סגורים גדולים בהרבה בהגדרות חשיבה מסוימות; אלה עדיין ציונים מוקדמים עבור מודל בן חמישה ימים.

אזהרה אחת חשובה באופן לא פרופורציונלי לכל מי שמריץ את המודל מקומית או על CPU, והיא חוגת החשיבה. Qwen3.8-27B מגיע עם מצב חשיבה מופעל והגדרת reasoning_effort לכל בקשה (low / medium / xhigh). ברירת המחדל xhigh חושבת יתר על המידה: הריצה הראשונה המפורסמת של ה-GGUF בגודל 17GB ארכה כ-21 דקות ו-22,000 טוקני חשיבה כדי לצייר תמונה פשוטה. במיוחד על CPU, הגדר את reasoning_effort במכוון — ההבדל בין אינטראקטיבי לבלתי שמיש הוא פרמטר אחד.
מה לצפות
שלושה דברים יגידו לך אם נתיב ה-CPU הופך לאמיתי:
• האם PR #35492 יתמזג. כיום הוא טיוטה עם CI אדום. גרסה ממוזגת וירוקה שנוחתת בריליס היא הנקודה שבה נתיב הטקסט+וידאו של ה-CPU הופך לניתן להרצה עבור כולנו.
• מדדים בלתי תלויים. נתוני ה-61.7 SWE-bench Pro וה-87.0 VideoMME הם דיווחי ספק. ריצות של LMArena ו-Artificial Analysis בשבועות הקרובים יראו כמה ישרוד מחוץ למסגרת הבדיקות של עליבאבא.
• האם גרסה מתארחת עם הקשר של 1M תתממש.262K מקורי הוא כבר הרבה; מצב מולטי-מודאלי של מיליון טוקנים הוא המקום שבו חיסכון המטמון של קשב היברידי מחזיר את עצמו.
לעת עתה ההחלטה פשוטה. אם יש לכם את החומרה, ה-17GB Q4 GGUF יחד עם SGLang או llama.cpp מריצים את המודל היום, וה-PR של ה-CPU לטקסט+וידאו מראה לאן הנתיב ללא GPU מוביל. אם לא, Qwen3.8-27B נגיש דרך OrcaRouter במחיר של $0.33 למיליון טוקני קלט ו-$2.40 למיליון טוקני פלט, באמצעות מפתח יחיד. בכל מקרה, המודל הפתוח 27B התומך בוידאו הוא המודל המעניין ביותר לעקוב אחריו בדור Qwen 3.8 — והוא בן חמישה ימים.
