כרטיס כותרת עבור מאמר השוואה עם הכיתוב Intern-Decision-0.8B לעומת Qwen 3.8, עם כתובית משנה: 853 מיליון פרמטרים, 1.71 GB, וקבוצה סגורה של תשובות, עם שלושה כרטיסי שורה שטוחים עם הכיתוב: נושא: Intern-Decision-0.8B הושק ב-26 בספטמבר 2026 ללא הכרזה, יריב: Qwen 3.8, ליבה דלילה של 2.4T עם Qwen3.8-Max במחיר של $2.00 ו-$6.00, וממצא עיקרי: האח ה-2B מהיר יותר ומדויק יותר בעוד שרק טביעת הרגל מעדיפה את ה-0.8B.
Engineering & Research

Intern-Decision-0.8B לעומת Qwen 3.8: 853 מיליון פרמטרים וקבוצה סגורה של תשובות

מחבר

Magnus Corvin

תאריך פרסום

מודלים אחרונים · 20צפו בכל המודלים →
בנצ'מרקים: Artificial Analysis · מתעדכן יומית
חזרה לכל הפוסטים

Intern-Decision-0.8B הוא הקטן מבין שלושה מודלי החלטה ש-InternLM העלתה ל-Hugging Face בבוקר ה-26 בספטמבר 2026, והוא אינו המהיר שבהם. זה הדבר הראשון שכדאי לדעת. לפי המדידות של המעבדה עצמה, האח ה-2B רץ מעט מהר יותר — 33.28 מ״ש מול 33.98 מ״ש — ומשיג שש נקודות יותר באותו ממוצע של שבע סוויטות, כך שהסיבה הרגילה לפנות לנקודת ביקורת של פחות ממיליארד פרמטרים, מהירות גולמית, אינה רלוונטית כאן. מה שכן רלוונטי הוא הגודל: 852,985,920 פרמטרים, 1.71 GB של משקולות bf16, קטן מספיק כדי לשבת באופן קבוע בשולי מכונה שיש לה משהו אחר לעשות. העמידו זאת מול Qwen3.8-Max — המסירה המתארחת של ליבת sparse mixture-of-experts בת 2.4 טריליון פרמטרים שהספק פרסם באוגוסט, במחיר של $2.00 ו-$6.00 למיליון טוקנים — והשניים אינם מתחרים על אותו תפקיד. האחד מחזיר התפלגות הסתברות על אפשרויות שסיפקתם מראש. האחר כותב.

התשובה הקצרה: Intern-Decision-0.8B שווה להחזיק בו אם אתה צריך החלטה מתוך סט סגור שמקבלת ציון על חומרה שכבר בבעלותך, ואם 1.71 GB במקום 4.43 GB הם ההבדל בין לשחרר לבין לא לשחרר. הוא לא שווה להחזיק בו אם אתה רוצה את מודל הניקוד הקטן המדויק ביותר ש-InternLM שחררה השבוע — כלומר ה-4B — או אם התשובה שלך אינה כבר מנויה בפרומפט שלך, ובמקרה כזה אף אחד מהשניים האלה אינו הכלי הנכון, ו-Qwen 3.8 הוא היחיד מבין השניים שמסוגל בכלל לבצע את העבודה.

מה שהמאגר אומר, ומה ששום דבר אחר לא עושה

התחילו מהראיות, כי יש מעט מאוד מהן. InternLM לא פרסמה כל הודעה על המודל הזה. אין פוסט השקה, אין מאמר, אין תיאור מאגר. כרטיס Hugging Face מקשר ל-Space להדגמה ולמאגר GitHub, ונכון לכתיבת שורות אלו ה-Space מחזיר 401 והקישור ל-GitHub מחזיר 404 — שני המקומות שאליהם הכרטיס מפנה אותך למידע נוסף סגורים. שלושה צ'קפוינטים הופיעו בתוך ארבעים שניות זה מזה בסביבות 05:36 UTC ב-26 בספטמבר: Intern-Decision-0.8B, Intern-Decision-2B ו-Intern-Decision-4B, כולם נושאים את אותם תגים — קבלת החלטות, רב-מודאלי, חיזוי מובנה — וכולם כוונונים עדינים של צ'קפוינטים של Qwen, במקרה הזה Qwen3.5-0.8B.

מה שאפשר לדעת מהמאגר הוא מדויק באופן יוצא דופן עבור מהדורה שלא הוכרזה, כי המעבדה סיפקה את מודול ההסקה שלה לצד המשקולות. ה-0.8B נטען דרך קובץ 16 KB בשם inference.py בספריית המודל, דורש Python 3.12 או חדש יותר ו-torch 2.9.1 עם transformers 5.14.1, וחושף מחלקת DecisionEngine שאותה יוצרים פעם אחת ומשתמשים בה שוב. מילון Python אחד נכנס, מילון תגובה אחד יוצא. מה שאי אפשר לדעת: אם זו מהדורה גמורה או דחיפה מוקדמת, אם נקודת קצה מתארחת עתידה להגיע, ואם שתי נקודות הביקורת שהוא יושב ביניהן אמורות להיות אותו מוצר בגדלים שונים או שלושה מוצרים שונים שבמקרה חולקים שם. אף אחד מחוץ ל-InternLM לא הריץ אף אחד מהם.

The Hugging Face model card for InternLM's Intern-Decision-0.8B, showing the internlm organisation, a 0.9B params label, tags for image-text-to-text, transformers, safetensors, qwen3_5, decision-making, multimodal, structured-prediction and conversational, an opening line stating the model is a multimodal structured decision model fine-tuned from Qwen3.5-0.8B, and a Checkpoint and docs section that also reports 0.9B params.

בעיית האחים: ה-2B מהיר יותר וטוב יותר

הנה החלק בטבלה שפרסמה InternLM בעצמה שהופך את ה-0.8B לקשה למיקום. בקריאה של שלושת הגדלים לאורך אותן שבע חבילות מבחנים:

• מהירות — 0.8B: 33.98 ms ממוצע, 33.44 ms חציון, 37.50 ms ב-p95. 2B: 33.28 ms, 33.15 ms, 33.55 ms. 4B: 44.16 ms, 44.03 ms, 44.60 ms. כל המדידות בוצעו לכל שאילתה על RTX 4090 בודד דרך הנתיב המקומי של Hugging Face.

• ממוצע שבע סוויטות — 0.8B: 79.38. 2B: 84.68. 4B: 90.02.

• כיול — 0.8B: Brier 0.530, ECE 0.066. 2B: Brier 0.437, ECE 0.100. 4B: Brier 0.347, ECE 0.065.

• גודל בדיסק ב-bf16 — 0.8B: 1.71 GB. 2B: 4.43 GB. 4B: 9.08 GB.

ה-2B מהיר יותר בממוצע, הדוק בהרבה בזנב, ומדויק יותר — הכול בבת אחת. אז "קטן יותר אומר מהיר יותר" הוא שקרי בכל המשפחה הזו — כפליים, שכן ה-4B איטי משניהם. המדד היחיד שבו ה-0.8B מנצח באופן מוחלט הוא זה שאיש לא מבנצ'מרק: 1.71 GB לעומת 4.43 GB של ה-2B ו-9.08 GB של ה-4B. אם אתם ממקמים מודל ניקוד בתקציב זיכרון קבוע — קופסה קטנה שדולקת תמיד, GPU משותף, צומת קצה עם מודל שפה שכבר תופס את רוב הכרטיס — זה כל הטיעון, והוא ממשי.

שאר הטבלה היא מחקר במקומות שבהם מודלים קטנים נשברים באופן לא אחיד. הציון של ה-0.8B ב-Typed Decision הוא 77.35 לעומת 80.55 של ה-4B — פער של שלוש נקודות בחמישית ממספר הפרמטרים. אבל Jevbench-Original צונח מ-98.61 ל-80.56 ו-WildJailBreak קורס מ-89.86 ל-64.48. יהיה אשר יהיה מה ששתי חבילות הבדיקה האלה מודדות — הכרטיס אינו אומר, והכרטיס אינו מספק הגדרות כלל לחבילות — הן אלה שמענישות את הצ'קפוינט הקטן hardest. מודל שמחזיק מעמד בציר אחד ונופל מצוק בשני אחרים אינו מודל חלש באופן אחיד. זהו מודל עם גבול כשירות מוגדר, והייתם רוצים לדעת היכן נמצא עומס העבודה שלכם לפני שאתם מחייבים את הצי אליו.

אזהרה נוספת לגבי שורת הכיול. ה-ECE של 0.8B, 0.066, הוא המספר הטוב ביותר שלו — טוב יותר מ-0.095 של Jev באותה סוויטה — בעוד שציון Brier שלו, 0.530, גרוע יותר מ-0.358 של Jev. שגיאת כיול ושגיאת ריבוע ממוצע של הסתברות אינן אותה מדידה, וטבלה שמציגה אחת כחזקה והאחרת כחלשה אומרת לך שההתפלגות מעוצבת היטב בקרבת שיאי הביטחון שלה ושמנה מכפי שהיא אמורה להיות בין לבין. אם המערכת שלך קובעת סף על בסיס ביטחון, ההבחנה הזו חשובה יותר מהממוצע.

מה 1.71 GB באמת נותן

מסלול ההסקה במודל הזה הוא סקורר, לא גנרטור, וההבדל בעלות הוא מבני ולא מצטבר. אתם מוסרים לו מצב משותף, סכמה של שאלות בעלות שמות, ובאופן אופציונלי עד שמונה תמונות. כל שאלה היא אחד משלושה סוגים: choice (אחד מקבוצת אפשרויות מסודרת), score (סולם אורדינלי, המוחזר כערך צפוי משוקלל לפי הסתברות), או noul (בינארי לא/כן). המצב, הסכמה ושלד JSON מלא של העוזר מרונדרים עם מציין מקום אחד לכל שדה, המודל מבצע מעבר קדמי סיבתי יחיד, והלוגיטים נקראים במיקום מיד לפני כל מציין מקום. מתבצעת softmax רק על סמלי המועמדים המותרים של אותו שדה, מיושמת הכיול המותאם של נקודת הבדיקה, והסמלים ממופים בחזרה לערכי האפשרויות שלכם.

שלוש השלכות נובעות מכך. אין טוקן פלט ולכן אין מחיר פלט — מיליון החלטות לא עולות דבר בטוקנים. אין לולאת פענוח ואין סוגר שאפשר לשכוח, ולכן JSON פגום אינו מצב כשל. ומכיוון שמרחב התשובות של כל שדה מורכב לכל בקשה, סכימה שאתה ממציא היום אחר הצהריים אינה דורשת אימון מחדש: הוסף שאלה והאפשרויות שלה הופכות לסמלים מועמדים עבור אותו שדה.

המגבלות מוצהרות בפשטות לא פחות. בין שאלה אחת לשש־עשרה שאלות, עד 62 אפשרויות בכל אחת, עד שמונה תמונות, ותקרה של 8,192 טוקנים כברירת מחדל — כאשר קלטים החורגים ממנה נדחים ולא נחתכים. הסעיף האחרון הזה הוא החלטת עיצוב שראוי להתעכב עליה, מפני שחיתוך שקט הוא הדרך שבה מסווג מתחיל בשקט לענות על שאלה אחרת מזו ששאלת. InternLM נכשל בקול רם במקום זאת, וזה נכון וגם מלכודת תפעולית: שרשור פניות ארוך בתוספת סכימה בתוספת תמונות יחרוג מ־8,192 מהר יותר משתצפו, ואין נתיב חינני כשהוא עושה זאת.

ו-1.71 GB קונים לך כלכלת זמן ריצה שאפשר לחשב ולסיים. ב-33.98 מ"ש לכל החלטה, מיליון החלטות הן 9.44 שעות של RTX 4090 אחד. ה-4B זקוק ל-12.3 שעות עבור אותו מיליון, ומוותר על עשר וחצי נקודות דיוק בתמורה ל-7.37 GB שלא היו לך. אף אחד מהמספרים לא כולל את עלות המכונה, ואף אחד מהם לא כולל את החלק שאנשים שוכחים: אתה מפעיל שירות, ואין שרת במאגר.

The OrcaRouter model page for Qwen3.8 Max, showing the model name, family and tier badges, a 1,000,000-token context window, pricing of $2.00 per million input tokens and $6.00 per million output tokens, an output speed of 63.71 tokens per second, an error rate of 0.69 percent, an Artificial Analysis index of 45.4 at rank 15 of 145, and a side panel listing Qwen 3.8 27B at an Artificial Analysis intelligence index of 33.65 with $0.33 and $2.40 per million tokens.

Qwen 3.8 הוא לא מודל אחד, והקצה הזול הוא זה שכדאי לשים לב אליו

Qwen 3.8, כשהוא משמש כשם עצמאי, הוא Qwen3.8-2.4T-A95B: ליבת תערובת מומחים דלילה (sparse mixture-of-experts) בת 2.4 טריליון פרמטרים שאליבאבא פרסמה כמשקולות פתוחות ב-12 באוגוסט 2026, עם כ-95 מיליארד פרמטרים פעילים לכל טוקן ורישיון מותאם אישית ולא Apache 2.0. המסלול המתארח של אותה ליבה הוא Qwen3.8-Max, זמין באופן כללי ב-API בתשלום מאז 3 באוגוסט ומרוענן כגרסת snapshot מתוארכת ל-2 בספטמבר. מדובר במוח אחד שנמכר בשתי דרכים, והמסלול השני הוא זה שרוב האנשים יקראו לו בפועל.

לפי נתונים בלתי־תלויים, Artificial Analysis מודדת את תמונת המצב של ספטמבר של Qwen3.8-Max במדד Intelligence Index של 45.4 — החמישה־עשר מתוך 145 מודלים במדד — עם ציון AA Coding של 76.2 במקום התשיעי מתוך 138, GPQA Diamond של 92.8, Humanity's Last Exam של 43.1 וציון שחזור להקשר ארוך של 80.3. הצ'קפוינט הפתוח מפגר אחרי ה-API שממנו זוקק, ב-39.9. בחלון ה-playground בן שבעת הימים שלנו, Qwen3.8-Max נמצא ב-p50 של 2,578 ms וב-p95 של 9,539 ms בקצב של 55.5 אסימוני פלט לשנייה, עם שיעור שגיאות של 1.57%. ניתן לקרוא ל-Qwen3.8-Max ב-OrcaRouter במחיר מחירון הספק עם תוספת של 0%, כך ששינוי מחיר של Alibaba נכנס לתוקף אצלנו באותו יום ולא במחזור החיוב הבא.

האח הצפוף הוא זה שכדאי לשקול מול צ'קפוינט מקומי של 1.71 GB, עם זאת, מכיוון שזו הדרך הזולה ביותר לקנות יכולת כללית במשפחה הזו. Qwen3.8-27B הוא Apache 2.0, נושא הקשר מקורי של 262,144 טוקנים, ו-Qwen3.8-27B עומד על $0.33 ו-$2.40 למיליון טוקנים בקטלוג שלנו. מדד האינטליגנציה של Artificial Analysis שלו הוא 33.7. הוא בערך פי שלושים ושניים ממספר הפרמטרים של Intern-Decision-0.8B, עדיין גנרטיבי, ועדיין הכלי הלא נכון להחלטה בקבוצה סגורה בהיקף — אבל זו אפשרות הביניים הכנה, והחבר היחיד בהשוואה הזו שהוא גם זול באמת וגם כללי באמת בו-זמנית.

מודד מול מחולל, בניסוח פשוט

• הקשר — Qwen3.8-Max נושא חלון של 1,000,000 טוקנים. Intern-Decision-0.8B דוחה כל דבר מעבר ל-8,192. פקטור של 122, שנאכף ולא נחתך.

• קלט — Qwen3.8-Max מקבל טקסט, תמונה ווידאו. Intern-Decision-0.8B מקבל טקסט ועד שמונה תמונות, וטוקני התמונות נספרים במסגרת אותו תקציב של 8,192.

• פלט — Qwen3.8-Max כותב, מנמק, קורא לכלים ומפיק JSON לפי בקשה. Intern-Decision-0.8B אינו יכול להפיק פסקה, נימוק או תוכנית. הוא יכול רק לדרג את האפשרויות שכבר חשבת לרשום.

• עלות לכל קריאה — קריאת מיון מציאותית של 800 טוקני קלט ו-150 טוקני פלט עולה כ-$0.0025 ב-Qwen3.8-Max, לפני טוקני הסקה כלשהם, וצד הפלט שלה קטן באופן אופטימי משום שזהו מודל הסקה. מיליון קריאות כאלה הן בערך $2,500. ל-Intern-Decision-0.8B אין מחיר טוקנים כלל: מיליון החלטות הן 9.44 שעות של 4090 שבבעלותך או שאתה שוכר.

• השהיה — 2,578 ms בחציון ב-Qwen3.8-Max בשבעת הימים האחרונים, כולל רשת ותורים. 33.98 ms של Intern-Decision-0.8B הוא מעבר קדימה בלבד על כרטיס מקומי ואינו אותה מדידה; ההשוואה ההוגנת היא סדר גודל אחד, לא פי שמונים.

• ראיות — כל נתון של Intern-Decision-0.8B כאן הוא דיווח ספק בהרנסים של InternLM עצמה ואינו משוחזר על ידי איש, כולל זמן השהיה. כל נתון של Qwen 3.8 הוא או של Alibaba עצמה או מדידה של Artificial Analysis, והם מתויגים בנפרד לעיל.

• ציון בלתי־תלוי — ל-Qwen3.8-Max יש אחד. ל-Intern-Decision-0.8B אין אף אחד מכל סוג, ואף ספק הסקה לא מפעיל אותו.

A two-column scoreboard comparing Intern-Decision-0.8B and Qwen 3.8. The Intern-Decision-0.8B column reads Parameters 853M, Seven-suite average 79.38, Context 8,192 tokens, Output scores only no text, Cost no token price 1.71 GB local, Latency 33.98 ms local pass. The Qwen 3.8 Max column reads Parameters 2.4T sparse, AA Intelligence Index 45.4, Context 1,000,000 tokens, Output text image video tools, Cost $2.00 and $6.00 per million, Latency 2,578 ms p50 hosted. A footer reads Intern-Decision-0.8B figures are vendor-reported and unreproduced; Qwen3.8-Max figures per Artificial Analysis and our own seven-day window.

שתי דרכים להריץ את הפייפליין הזה

הפיצול התפעולי חד יותר מהפיצול של הבנצ'מרק. Intern-Decision-0.8B הוא מודול, לא שירות. אין נקודת קצה תואמת OpenAI, אין שרת עיבוד באצוות, אין בדיקת תקינות, אין מדיניות ניסיונות חוזרים, ואין רפליקה שנייה אלא אם תבנו אחת. הוא נטען בתהליך אחד ועונה ל-dict אחד בכל פעם, ואם אתם זקוקים ל-failover, אתם ה-failover. זהו תיאור הוגן של נקודת ביקורת מחקרית בת 853 מיליון פרמטרים שפורסמה בלי הערת השקה, ויש לתמחר זאת בהתאם בתוך ההחלטה.

החצי הגנרטיבי של אותו צינור עיבוד הוא קריאת רשת, ולקריאת רשת נועד נתב. גם Qwen3.8-Max וגם Qwen3.8-27B נגישים מאחורי מפתח יחיד תואם OpenAI, ומעבר אוטומטי לגיבוי פירושו ששירות במעלה הזרם שמצבו הורע לא הופך לתקרית שלך — ראוי להזכיר זאת כאן משום ששיעור השגיאות החי של Qwen3.8-Max על פני שבעה ימים בצד שלנו הוא 1.57%, וזה נמוך עד שזו הבקשה שלך. הדפוס ההגיוני הוא זה שהשילוב הזה מתאר בשקט כבר זמן מה: להריץ באופן מקומי את הסקורר הזול של הקבוצה הסגורה, כי הוא מהיר ולא עולה כלום לכל קריאה, ולנתב את שלב ההיסק, כי שם באמת מתרחשות הורדות המחירים, תחלופת המודלים והשבתות.

שני דברים שלא נטען להם. Intern-Decision-0.8B אינו אחד מהמסלולים שלנו ולא יהיה, עד ש-InternLM יארח אותו במקום כלשהו — איננו מתכוונים לרמוז אחרת. ואנחנו לא מארחים כיום שום מודל של InternLM בכלל, כך ששום דבר במאמר הזה אינו ניסיון לשכנע להריץ את הנושא דרכנו.

מה ישנה את התשובה

שלוש שאלות פתוחות, שכולן ניתנות למענה בתוך ימים. האם InternLM מפרסמת את מאגר ה-GitHub שאליו מקשר הכרטיס שלה עצמה, ולצדו תיאור של האופן שבו כווננו את המשקלים האלה? האם פוסט השקה מגיע אחרי הצ'קפוינטים, והופך דחיפה שקטה לשחרור מתועד עם סיפור פריסה מוצהר? והאם מישהו בלתי תלוי משחזר את הממוצע 79.38 או את שגיאת הכיול 0.066 על חומרה שאינה של InternLM?

עד שאחד מאלה יגיע, הפרשנות הכנה של Intern-Decision-0.8B היא צרה וספציפית: הוא מודל הניקוד הזול ביותר לסט סגור במשפחה של שלושה, בטביעת רגל שמתאימה היכן שאחיו המהיר והמדויק יותר לא מתאים, שפורסם בלי הכרזה ובלי הארטיפקט האחד שהיה מגלה לך עבור מה הוא כוונן. אם ההחלטה שלך היא בסט סגור, התשובות שלך ניתנות למנייה בפרומפט, ו-1.71 GB הוא המספר שהפריסה שלך בפועל תלויה בו, זו הבחירה הנכונה ואין שום דבר אחר כמוהו בגודל הזה. אם התשובה שלך אינה ניתנת למנייה מראש, או שהמצב שלך חורג מ-8,192 טוקנים, או שאתה צריך נימוק שתוכל להראות לבן אדם, אז ההשוואה מעולם לא הייתה צמודה — והמודל שאתה רוצה מעולם לא היה זה עם 853 מיליון פרמטרים.

השוואות במאמר הזה1

זוהה מתוך המאמר הזה · בנצ'מרקים: Artificial Analysis · מתעדכן יומית