
Intern-Decision-0.8B לעומת Qwen 3.8: 853 מיליון פרמטרים וקבוצה סגורה של תשובות
- typesafeחדשTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 לכל 1M טוקנים · 592 tok/s
- openaiחדשOpenAI: GPT-6 Luna2026-09-2237אינטליגנציה
- openaiחדשOpenAI: GPT-6 Sol2026-09-2248אינטליגנציה
- anthropicחדשAnthropic: Claude Opus 5.52026-09-2258אינטליגנציה
- grokחדשGrok 4.72026-09-2146אינטליגנציה
- OrcaחדשOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 לכל 1M טוקנים · 187 tok/s
- orcaחדשOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 לכל 1M טוקנים · 1306 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040אינטליגנציה
- openaiOpenAI: GPT-6 Astra2026-09-0453אינטליגנציה77כתיבת קוד
- googleGoogle: Gemini 3.8 Flash2026-09-0241אינטליגנציה76כתיבת קוד
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245אינטליגנציה76כתיבת קוד
- anthropicAnthropic: Claude Fable 5.12026-09-0153אינטליגנציה82כתיבת קוד
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 לכל 1M טוקנים · 113 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642אינטליגנציה72כתיבת קוד
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 לכל 1M טוקנים · 224 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845אינטליגנציה75כתיבת קוד
- obsidianQwen3.8 27B2026-08-1534אינטליגנציה68כתיבת קוד
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236אינטליגנציה69כתיבת קוד
- grokSpaceXAI: Grok 4.62026-08-1244אינטליגנציה77כתיבת קוד
- metaMeta: Muse Spark 1.22026-08-0540אינטליגנציה72כתיבת קוד
Intern-Decision-0.8B הוא הקטן מבין שלושה מודלי החלטה ש-InternLM העלתה ל-Hugging Face בבוקר ה-26 בספטמבר 2026, והוא אינו המהיר שבהם. זה הדבר הראשון שכדאי לדעת. לפי המדידות של המעבדה עצמה, האח ה-2B רץ מעט מהר יותר — 33.28 מ״ש מול 33.98 מ״ש — ומשיג שש נקודות יותר באותו ממוצע של שבע סוויטות, כך שהסיבה הרגילה לפנות לנקודת ביקורת של פחות ממיליארד פרמטרים, מהירות גולמית, אינה רלוונטית כאן. מה שכן רלוונטי הוא הגודל: 852,985,920 פרמטרים, 1.71 GB של משקולות bf16, קטן מספיק כדי לשבת באופן קבוע בשולי מכונה שיש לה משהו אחר לעשות. העמידו זאת מול Qwen3.8-Max — המסירה המתארחת של ליבת sparse mixture-of-experts בת 2.4 טריליון פרמטרים שהספק פרסם באוגוסט, במחיר של $2.00 ו-$6.00 למיליון טוקנים — והשניים אינם מתחרים על אותו תפקיד. האחד מחזיר התפלגות הסתברות על אפשרויות שסיפקתם מראש. האחר כותב.
התשובה הקצרה: Intern-Decision-0.8B שווה להחזיק בו אם אתה צריך החלטה מתוך סט סגור שמקבלת ציון על חומרה שכבר בבעלותך, ואם 1.71 GB במקום 4.43 GB הם ההבדל בין לשחרר לבין לא לשחרר. הוא לא שווה להחזיק בו אם אתה רוצה את מודל הניקוד הקטן המדויק ביותר ש-InternLM שחררה השבוע — כלומר ה-4B — או אם התשובה שלך אינה כבר מנויה בפרומפט שלך, ובמקרה כזה אף אחד מהשניים האלה אינו הכלי הנכון, ו-Qwen 3.8 הוא היחיד מבין השניים שמסוגל בכלל לבצע את העבודה.
מה שהמאגר אומר, ומה ששום דבר אחר לא עושה
התחילו מהראיות, כי יש מעט מאוד מהן. InternLM לא פרסמה כל הודעה על המודל הזה. אין פוסט השקה, אין מאמר, אין תיאור מאגר. כרטיס Hugging Face מקשר ל-Space להדגמה ולמאגר GitHub, ונכון לכתיבת שורות אלו ה-Space מחזיר 401 והקישור ל-GitHub מחזיר 404 — שני המקומות שאליהם הכרטיס מפנה אותך למידע נוסף סגורים. שלושה צ'קפוינטים הופיעו בתוך ארבעים שניות זה מזה בסביבות 05:36 UTC ב-26 בספטמבר: Intern-Decision-0.8B, Intern-Decision-2B ו-Intern-Decision-4B, כולם נושאים את אותם תגים — קבלת החלטות, רב-מודאלי, חיזוי מובנה — וכולם כוונונים עדינים של צ'קפוינטים של Qwen, במקרה הזה Qwen3.5-0.8B.
מה שאפשר לדעת מהמאגר הוא מדויק באופן יוצא דופן עבור מהדורה שלא הוכרזה, כי המעבדה סיפקה את מודול ההסקה שלה לצד המשקולות. ה-0.8B נטען דרך קובץ 16 KB בשם inference.py בספריית המודל, דורש Python 3.12 או חדש יותר ו-torch 2.9.1 עם transformers 5.14.1, וחושף מחלקת DecisionEngine שאותה יוצרים פעם אחת ומשתמשים בה שוב. מילון Python אחד נכנס, מילון תגובה אחד יוצא. מה שאי אפשר לדעת: אם זו מהדורה גמורה או דחיפה מוקדמת, אם נקודת קצה מתארחת עתידה להגיע, ואם שתי נקודות הביקורת שהוא יושב ביניהן אמורות להיות אותו מוצר בגדלים שונים או שלושה מוצרים שונים שבמקרה חולקים שם. אף אחד מחוץ ל-InternLM לא הריץ אף אחד מהם.

בעיית האחים: ה-2B מהיר יותר וטוב יותר
הנה החלק בטבלה שפרסמה InternLM בעצמה שהופך את ה-0.8B לקשה למיקום. בקריאה של שלושת הגדלים לאורך אותן שבע חבילות מבחנים:
• מהירות — 0.8B: 33.98 ms ממוצע, 33.44 ms חציון, 37.50 ms ב-p95. 2B: 33.28 ms, 33.15 ms, 33.55 ms. 4B: 44.16 ms, 44.03 ms, 44.60 ms. כל המדידות בוצעו לכל שאילתה על RTX 4090 בודד דרך הנתיב המקומי של Hugging Face.
• ממוצע שבע סוויטות — 0.8B: 79.38. 2B: 84.68. 4B: 90.02.
• כיול — 0.8B: Brier 0.530, ECE 0.066. 2B: Brier 0.437, ECE 0.100. 4B: Brier 0.347, ECE 0.065.
• גודל בדיסק ב-bf16 — 0.8B: 1.71 GB. 2B: 4.43 GB. 4B: 9.08 GB.
ה-2B מהיר יותר בממוצע, הדוק בהרבה בזנב, ומדויק יותר — הכול בבת אחת. אז "קטן יותר אומר מהיר יותר" הוא שקרי בכל המשפחה הזו — כפליים, שכן ה-4B איטי משניהם. המדד היחיד שבו ה-0.8B מנצח באופן מוחלט הוא זה שאיש לא מבנצ'מרק: 1.71 GB לעומת 4.43 GB של ה-2B ו-9.08 GB של ה-4B. אם אתם ממקמים מודל ניקוד בתקציב זיכרון קבוע — קופסה קטנה שדולקת תמיד, GPU משותף, צומת קצה עם מודל שפה שכבר תופס את רוב הכרטיס — זה כל הטיעון, והוא ממשי.
שאר הטבלה היא מחקר במקומות שבהם מודלים קטנים נשברים באופן לא אחיד. הציון של ה-0.8B ב-Typed Decision הוא 77.35 לעומת 80.55 של ה-4B — פער של שלוש נקודות בחמישית ממספר הפרמטרים. אבל Jevbench-Original צונח מ-98.61 ל-80.56 ו-WildJailBreak קורס מ-89.86 ל-64.48. יהיה אשר יהיה מה ששתי חבילות הבדיקה האלה מודדות — הכרטיס אינו אומר, והכרטיס אינו מספק הגדרות כלל לחבילות — הן אלה שמענישות את הצ'קפוינט הקטן hardest. מודל שמחזיק מעמד בציר אחד ונופל מצוק בשני אחרים אינו מודל חלש באופן אחיד. זהו מודל עם גבול כשירות מוגדר, והייתם רוצים לדעת היכן נמצא עומס העבודה שלכם לפני שאתם מחייבים את הצי אליו.
אזהרה נוספת לגבי שורת הכיול. ה-ECE של 0.8B, 0.066, הוא המספר הטוב ביותר שלו — טוב יותר מ-0.095 של Jev באותה סוויטה — בעוד שציון Brier שלו, 0.530, גרוע יותר מ-0.358 של Jev. שגיאת כיול ושגיאת ריבוע ממוצע של הסתברות אינן אותה מדידה, וטבלה שמציגה אחת כחזקה והאחרת כחלשה אומרת לך שההתפלגות מעוצבת היטב בקרבת שיאי הביטחון שלה ושמנה מכפי שהיא אמורה להיות בין לבין. אם המערכת שלך קובעת סף על בסיס ביטחון, ההבחנה הזו חשובה יותר מהממוצע.
מה 1.71 GB באמת נותן
מסלול ההסקה במודל הזה הוא סקורר, לא גנרטור, וההבדל בעלות הוא מבני ולא מצטבר. אתם מוסרים לו מצב משותף, סכמה של שאלות בעלות שמות, ובאופן אופציונלי עד שמונה תמונות. כל שאלה היא אחד משלושה סוגים: choice (אחד מקבוצת אפשרויות מסודרת), score (סולם אורדינלי, המוחזר כערך צפוי משוקלל לפי הסתברות), או noul (בינארי לא/כן). המצב, הסכמה ושלד JSON מלא של העוזר מרונדרים עם מציין מקום אחד לכל שדה, המודל מבצע מעבר קדמי סיבתי יחיד, והלוגיטים נקראים במיקום מיד לפני כל מציין מקום. מתבצעת softmax רק על סמלי המועמדים המותרים של אותו שדה, מיושמת הכיול המותאם של נקודת הבדיקה, והסמלים ממופים בחזרה לערכי האפשרויות שלכם.
שלוש השלכות נובעות מכך. אין טוקן פלט ולכן אין מחיר פלט — מיליון החלטות לא עולות דבר בטוקנים. אין לולאת פענוח ואין סוגר שאפשר לשכוח, ולכן JSON פגום אינו מצב כשל. ומכיוון שמרחב התשובות של כל שדה מורכב לכל בקשה, סכימה שאתה ממציא היום אחר הצהריים אינה דורשת אימון מחדש: הוסף שאלה והאפשרויות שלה הופכות לסמלים מועמדים עבור אותו שדה.
המגבלות מוצהרות בפשטות לא פחות. בין שאלה אחת לשש־עשרה שאלות, עד 62 אפשרויות בכל אחת, עד שמונה תמונות, ותקרה של 8,192 טוקנים כברירת מחדל — כאשר קלטים החורגים ממנה נדחים ולא נחתכים. הסעיף האחרון הזה הוא החלטת עיצוב שראוי להתעכב עליה, מפני שחיתוך שקט הוא הדרך שבה מסווג מתחיל בשקט לענות על שאלה אחרת מזו ששאלת. InternLM נכשל בקול רם במקום זאת, וזה נכון וגם מלכודת תפעולית: שרשור פניות ארוך בתוספת סכימה בתוספת תמונות יחרוג מ־8,192 מהר יותר משתצפו, ואין נתיב חינני כשהוא עושה זאת.
ו-1.71 GB קונים לך כלכלת זמן ריצה שאפשר לחשב ולסיים. ב-33.98 מ"ש לכל החלטה, מיליון החלטות הן 9.44 שעות של RTX 4090 אחד. ה-4B זקוק ל-12.3 שעות עבור אותו מיליון, ומוותר על עשר וחצי נקודות דיוק בתמורה ל-7.37 GB שלא היו לך. אף אחד מהמספרים לא כולל את עלות המכונה, ואף אחד מהם לא כולל את החלק שאנשים שוכחים: אתה מפעיל שירות, ואין שרת במאגר.

Qwen 3.8 הוא לא מודל אחד, והקצה הזול הוא זה שכדאי לשים לב אליו
Qwen 3.8, כשהוא משמש כשם עצמאי, הוא Qwen3.8-2.4T-A95B: ליבת תערובת מומחים דלילה (sparse mixture-of-experts) בת 2.4 טריליון פרמטרים שאליבאבא פרסמה כמשקולות פתוחות ב-12 באוגוסט 2026, עם כ-95 מיליארד פרמטרים פעילים לכל טוקן ורישיון מותאם אישית ולא Apache 2.0. המסלול המתארח של אותה ליבה הוא Qwen3.8-Max, זמין באופן כללי ב-API בתשלום מאז 3 באוגוסט ומרוענן כגרסת snapshot מתוארכת ל-2 בספטמבר. מדובר במוח אחד שנמכר בשתי דרכים, והמסלול השני הוא זה שרוב האנשים יקראו לו בפועל.
לפי נתונים בלתי־תלויים, Artificial Analysis מודדת את תמונת המצב של ספטמבר של Qwen3.8-Max במדד Intelligence Index של 45.4 — החמישה־עשר מתוך 145 מודלים במדד — עם ציון AA Coding של 76.2 במקום התשיעי מתוך 138, GPQA Diamond של 92.8, Humanity's Last Exam של 43.1 וציון שחזור להקשר ארוך של 80.3. הצ'קפוינט הפתוח מפגר אחרי ה-API שממנו זוקק, ב-39.9. בחלון ה-playground בן שבעת הימים שלנו, Qwen3.8-Max נמצא ב-p50 של 2,578 ms וב-p95 של 9,539 ms בקצב של 55.5 אסימוני פלט לשנייה, עם שיעור שגיאות של 1.57%. ניתן לקרוא ל-Qwen3.8-Max ב-OrcaRouter במחיר מחירון הספק עם תוספת של 0%, כך ששינוי מחיר של Alibaba נכנס לתוקף אצלנו באותו יום ולא במחזור החיוב הבא.
האח הצפוף הוא זה שכדאי לשקול מול צ'קפוינט מקומי של 1.71 GB, עם זאת, מכיוון שזו הדרך הזולה ביותר לקנות יכולת כללית במשפחה הזו. Qwen3.8-27B הוא Apache 2.0, נושא הקשר מקורי של 262,144 טוקנים, ו-Qwen3.8-27B עומד על $0.33 ו-$2.40 למיליון טוקנים בקטלוג שלנו. מדד האינטליגנציה של Artificial Analysis שלו הוא 33.7. הוא בערך פי שלושים ושניים ממספר הפרמטרים של Intern-Decision-0.8B, עדיין גנרטיבי, ועדיין הכלי הלא נכון להחלטה בקבוצה סגורה בהיקף — אבל זו אפשרות הביניים הכנה, והחבר היחיד בהשוואה הזו שהוא גם זול באמת וגם כללי באמת בו-זמנית.
מודד מול מחולל, בניסוח פשוט
• הקשר — Qwen3.8-Max נושא חלון של 1,000,000 טוקנים. Intern-Decision-0.8B דוחה כל דבר מעבר ל-8,192. פקטור של 122, שנאכף ולא נחתך.
• קלט — Qwen3.8-Max מקבל טקסט, תמונה ווידאו. Intern-Decision-0.8B מקבל טקסט ועד שמונה תמונות, וטוקני התמונות נספרים במסגרת אותו תקציב של 8,192.
• פלט — Qwen3.8-Max כותב, מנמק, קורא לכלים ומפיק JSON לפי בקשה. Intern-Decision-0.8B אינו יכול להפיק פסקה, נימוק או תוכנית. הוא יכול רק לדרג את האפשרויות שכבר חשבת לרשום.
• עלות לכל קריאה — קריאת מיון מציאותית של 800 טוקני קלט ו-150 טוקני פלט עולה כ-$0.0025 ב-Qwen3.8-Max, לפני טוקני הסקה כלשהם, וצד הפלט שלה קטן באופן אופטימי משום שזהו מודל הסקה. מיליון קריאות כאלה הן בערך $2,500. ל-Intern-Decision-0.8B אין מחיר טוקנים כלל: מיליון החלטות הן 9.44 שעות של 4090 שבבעלותך או שאתה שוכר.
• השהיה — 2,578 ms בחציון ב-Qwen3.8-Max בשבעת הימים האחרונים, כולל רשת ותורים. 33.98 ms של Intern-Decision-0.8B הוא מעבר קדימה בלבד על כרטיס מקומי ואינו אותה מדידה; ההשוואה ההוגנת היא סדר גודל אחד, לא פי שמונים.
• ראיות — כל נתון של Intern-Decision-0.8B כאן הוא דיווח ספק בהרנסים של InternLM עצמה ואינו משוחזר על ידי איש, כולל זמן השהיה. כל נתון של Qwen 3.8 הוא או של Alibaba עצמה או מדידה של Artificial Analysis, והם מתויגים בנפרד לעיל.
• ציון בלתי־תלוי — ל-Qwen3.8-Max יש אחד. ל-Intern-Decision-0.8B אין אף אחד מכל סוג, ואף ספק הסקה לא מפעיל אותו.

שתי דרכים להריץ את הפייפליין הזה
הפיצול התפעולי חד יותר מהפיצול של הבנצ'מרק. Intern-Decision-0.8B הוא מודול, לא שירות. אין נקודת קצה תואמת OpenAI, אין שרת עיבוד באצוות, אין בדיקת תקינות, אין מדיניות ניסיונות חוזרים, ואין רפליקה שנייה אלא אם תבנו אחת. הוא נטען בתהליך אחד ועונה ל-dict אחד בכל פעם, ואם אתם זקוקים ל-failover, אתם ה-failover. זהו תיאור הוגן של נקודת ביקורת מחקרית בת 853 מיליון פרמטרים שפורסמה בלי הערת השקה, ויש לתמחר זאת בהתאם בתוך ההחלטה.
החצי הגנרטיבי של אותו צינור עיבוד הוא קריאת רשת, ולקריאת רשת נועד נתב. גם Qwen3.8-Max וגם Qwen3.8-27B נגישים מאחורי מפתח יחיד תואם OpenAI, ומעבר אוטומטי לגיבוי פירושו ששירות במעלה הזרם שמצבו הורע לא הופך לתקרית שלך — ראוי להזכיר זאת כאן משום ששיעור השגיאות החי של Qwen3.8-Max על פני שבעה ימים בצד שלנו הוא 1.57%, וזה נמוך עד שזו הבקשה שלך. הדפוס ההגיוני הוא זה שהשילוב הזה מתאר בשקט כבר זמן מה: להריץ באופן מקומי את הסקורר הזול של הקבוצה הסגורה, כי הוא מהיר ולא עולה כלום לכל קריאה, ולנתב את שלב ההיסק, כי שם באמת מתרחשות הורדות המחירים, תחלופת המודלים והשבתות.
שני דברים שלא נטען להם. Intern-Decision-0.8B אינו אחד מהמסלולים שלנו ולא יהיה, עד ש-InternLM יארח אותו במקום כלשהו — איננו מתכוונים לרמוז אחרת. ואנחנו לא מארחים כיום שום מודל של InternLM בכלל, כך ששום דבר במאמר הזה אינו ניסיון לשכנע להריץ את הנושא דרכנו.
מה ישנה את התשובה
שלוש שאלות פתוחות, שכולן ניתנות למענה בתוך ימים. האם InternLM מפרסמת את מאגר ה-GitHub שאליו מקשר הכרטיס שלה עצמה, ולצדו תיאור של האופן שבו כווננו את המשקלים האלה? האם פוסט השקה מגיע אחרי הצ'קפוינטים, והופך דחיפה שקטה לשחרור מתועד עם סיפור פריסה מוצהר? והאם מישהו בלתי תלוי משחזר את הממוצע 79.38 או את שגיאת הכיול 0.066 על חומרה שאינה של InternLM?
עד שאחד מאלה יגיע, הפרשנות הכנה של Intern-Decision-0.8B היא צרה וספציפית: הוא מודל הניקוד הזול ביותר לסט סגור במשפחה של שלושה, בטביעת רגל שמתאימה היכן שאחיו המהיר והמדויק יותר לא מתאים, שפורסם בלי הכרזה ובלי הארטיפקט האחד שהיה מגלה לך עבור מה הוא כוונן. אם ההחלטה שלך היא בסט סגור, התשובות שלך ניתנות למנייה בפרומפט, ו-1.71 GB הוא המספר שהפריסה שלך בפועל תלויה בו, זו הבחירה הנכונה ואין שום דבר אחר כמוהו בגודל הזה. אם התשובה שלך אינה ניתנת למנייה מראש, או שהמצב שלך חורג מ-8,192 טוקנים, או שאתה צריך נימוק שתוכל להראות לבן אדם, אז ההשוואה מעולם לא הייתה צמודה — והמודל שאתה רוצה מעולם לא היה זה עם 853 מיליון פרמטרים.
השוואות במאמר הזה1
זוהה מתוך המאמר הזה · בנצ'מרקים: Artificial Analysis · מתעדכן יומית
