כרטיס כותרת שנוצר, שכותרתו 'TwIL-LM3-Pro מול Qwen 3.8', עם כותרת משנה 'ההשוואה שהכרטיס הזה באמת הריץ', עם שני כרטיסים מעוגלים שעליהם כתוב 'TwIL-LM3-Pro - 3.66B, מקומי, לא מסחרי' ו-'Qwen3.8-Max - מתארח, הקשר של 1M, $2 / $6'. בשורת כותרת תחתונה נכתב 'webAI נמדד מול Qwen3-8B, לא Qwen3.8-Max.' הלוגו של OrcaRouter משולב בפינה הימנית התחתונה.
Guides & Insights

TwIL-LM3-Pro מול Qwen 3.8: אי-התאמה, וההשוואה שבאמת חשובה

מחבר

Rowan Sterling

תאריך פרסום

מודלים אחרונים · 20צפו בכל המודלים →
בנצ'מרקים: Artificial Analysis · מתעדכן יומית
חזרה לכל הפוסטים

TwIL-LM3-Pro וQwen3.8-Max אינם שייכים לאותו עמוד, והסיבה אינה שאחד מהם עדיף. הסיבה היא שהנימוק המפורסם בעד מודל הלוגיקה הפורמלית 3.66B של webAI מבוסס על השוואה מול מודל Qwe​n — והמודל של Qwe​n המדובר אינו זה ששמו מופיע בכותרת. הטבלאות Track A ו-Track B של webAI משוות את TwIL-LM3-Pro מול Qwen3-8B, מודל dense עם 8B פרמטרים ומשקולות פתוחות מדור קודם, ואינן מתייחסות ל-Qwen3.8-Max כלל: לא מפני ש-TwIL-LM3-Pro היה מנצח, אלא מפני ש-Qwen3.8-Max הוא מערכת הדגל המתארחת של Aliba​ba, מודל sparse mixture-of-experts המדווח כ-2.4 טריליון פרמטרים עם כ-95 מיליארד פעילים לכל טוקן, חלון הקשר מולטימודלי של מיליון טוקנים, ותעריף של 2.00 דולר למיליון טוקני קלט ו-6.00 דולר למיליון טוקני פלט. להעמיד GGUF של 2.09 GiB למחשב נייד לצד זה הוא שגיאת קטגוריה העטופה בעמוד השוואה.

אז המאמר הזה עושה שני דברים. הוא מתקן את ההשוואה שתוצאות החיפוש טועות בה, ואז הוא עונה לגרסה של השאלה שסביר להניח שלקורא באמת יש: בהינתן שמודל חזית נמצא במרחק קריאת API אחת ומומחה ללוגיקה פורמלית פועל על המכונה שלך, מתי כל אחד מהם מצדיק את מקומו?

המודל שהכרטיס מדד בפועל

ההשוואה הרלוונטית היא מול Qwen3-8B, והסיכום של webAI עצמה לגביו צנוע יותר ממה שדיווחים מיד שנייה מרמזים. שער המאקרו בתוך־התחום של TwIL-LM3-Pro הוא 0.5539 לעומת 0.5336 של Qwen3-8B, וכרטיס המודל מכיל את המשפט שדף שיווקי היה מסיר: יתרון השער הוא 0.020, "קטן מרעש הדגימה ב-n = 200 לכל נתיב — ולכן יש לקרוא את זה כשוויון, לא כניצחון."

במקום שבו ההשוואה אינה הטלת מטבע: strict-7, 0.2879 לעומת 0.2093, שורה שלא משתמשת בשום ניקוד התאמה רופפת בשום מקום ולכן לא ניתן לייצר אותה באמצעות פורמט. רב-ברירה קפדני, 0.4100 לעומת 0.0000. אינדוקציית כללים, 0.4195 לעומת 0.3680. ויחס הפרמטרים — 3.66B לעומת בערך 8B — שזה כל הטענה של "פחות מחצי מהגודל".

בחבילת ההערכה המוחזקת webAI בוטה אף יותר: "TwIL-LM3-Pro אינו מוביל בה." המאקרו של עשרת מערכי הנתונים הוא 0.7901, בשוויון עם בסיס ה-Granite של עצמו ומאחורי 0.8493 של Qwen3-8B. מומחה קטן שמשתווה למודל כללי כפול מגודלו בלוגיקה פורמלית ומפסיד לו ביכולת כללית הוא הצורה הצפויה, ודיווח על כך בדרך הזו הוא מה שהופך את הנתון strict-7 לאמין.

מהו בעצם Qwen3.8-Max

Qwen3.8-Max אינו איטרציה של Qwen3-8B. זהו דרג הפרימיום של Aliba​ba, ובעמוד הקטלוג של OrcaRouter הוא מופיע בתור `qwen/qwen3.8-max` עם תאריך יציאה של 3 באוגוסט 2026, חלון הקשר של מיליון טוקנים, קלט טקסט, תמונה וווידאו, פלט טקסט, ותמיכה מלאה במצב חשיבה, קריאה לפונקציות, כלים מובנים ופלטים מובנים. הוא מוגש דרך לוחות מחוונים תואמי OpenAI, תואמי Anthropic ונייטיביים בחמישה אזורים, והחשיבה מופעלת ומכובה עם הפרמטר `enable_thinking`. התעריף הוא $2.00 למיליון טוקני קלט ו-$6.00 למיליון טוקני פלט.

תמונת מצב מתוארכת, `qwen/qwen3.8-max-0902`, פורסמה ב-2 בספטמבר 2026 עם אותן יכולות ואותו תמחור, ופורסמה במיוחד כדי שניתן יהיה לקבע את ההתנהגות לצורך הרצות ברות-שחזור. אם אתם בונים מול Qwen3.8-Max למשהו ארוך טווח, מזהה תמונת המצב הזה הוא זה שכדאי לשים בקונפיגורציה ולא את הכינוי המשתנה.

שימו לב למה שנעדר מהתיאור הזה: מספר פרמטרים שאפשר להוריד, קובץ רישיון, וכל דרך להריץ אותו בעצמכם. Qwen3.8-Max הוא מוצר מתארח. סיקור עיתונאי בזמן ההשקה דיווח על משקולות פתוחות שהובטחו לשבוע שלאחר מכן, והניסוח של techsy — "2.4T פרמטרים, חלון הקשר של 1M, עדיין אין משקולות" — הוא המצב שעל הקורא לאמת ולא להניח, משום שהבטחה שדווחה בהשקה אינה צ'קפוינט שפורסם.

ארבעה ממדים, ואף אחד מהם לא קרוב

• פרמטרים — TwIL-LM3-Pro 3.66B צפוף, כולו פעיל, לעומת Qwen3.8-Max המדווח ב-2.4T סה"כ בתכנון תערובת מומחים דלילה עם כ-95B פעילים לכל טוקן. שלושה סדרי גודל בסה"כ, ושניים בפעילים.

• היכן הוא רץ — TwIL-LM3-Pro מורד כ-bf16 בגודל 6.82 GiB או כ-Q4_K_M GGUF בגודל 2.09 GiB עבור CPU או 4 GB של VRAM, לעומת Qwen3.8-Max, שקיים רק כנקודת קצה מתארחת.

• הקשר — TwIL-LM3-Pro 131,072 טוקנים, בירושה מבסיס ה-Granite שלו ומעולם לא אומת מעבר ל-8,192 בהערכה שלו עצמו לעומת Qwen3.8-Max ב-1,000,000 טוקנים.

• מודליות — טקסט נכנס, טקסט יוצא לעומת טקסט, תמונה ווידאו נכנסים, טקסט יוצא.

• רישיון — webAI Non-Commercial License ver. 1.0, עם הסכם נפרד הנדרש לשימוש מניב הכנסות לעומת API מסחרי מתארח ללא משקלים לרישוי.

• עלות — TwIL-LM3-Pro: ללא תשלום לפי טוקן וללא נקודת קצה מתארחת, לעומת $2.00 למיליון טוקני קלט ו-$6.00 למיליון פלט של Qwen3.8-Max, עם תעריף קלט במטמון של כ-$0.25 למיליון.

מודל 3.66B הוא זול כי הוא קטן, והוא קטן כי הוא עושה דבר אחד. Qwen3.8-Max הוא יקר כי הוא כללי והוא מתארח. אף אחד מהתעריפים אינו פסק דין.

השאלה שמאחורי השאלה

הסירו את בלבול השמות ותישאר שאלה הנדסית, והיא שאלה טובה: אם מודל חזית מתארח מסוגל להסיק מסקנות בלוגיקה פורמלית, למה בכלל להריץ מומחה צר?

שלושה נימוקים מחזיקים מעמד. הראשון הוא הרישיון והרשת: קבוצת מחקר לא-מסחרית, סביבה מבודדת מרשת, או מעבר תיוג בקבוצה שצריך לרוץ על מחשב נייד בלי קישוריות — אינם יכולים לפנות לנקודת קצה מתארחת, ו-GGUF בנפח 2.09 GiB עונה ישירות על האילוץ הזה. השני הוא מבנה העלויות ביחס לנפח — משימת תיוג בלוגיקה פורמלית על מיליון קלטים קצרים משלמת לפי טוקן במודל חזית מתארח, ובמודל מקומי משלמת רק זמן קיר. השלישי הוא צורת הפלט: TwIL-LM3-Pro כוונן לפלוט מבנים הניתנים לבדיקה מכנית ולא פרוזה, ועבור תוויות גרירה וניתוחים סמנטיים זהו צינור עיבוד קטן יותר מאשר להנחות מודל כללי ולפרסר את תשובתו.

מול זה, הטיעון של Qwen3.8-Max פשוט. הוא רואה תמונות ווידאו, הוא מכיל מיליון טוקנים, הוא מטפל בכלים ובפלט מובנה דרך API מתועד, ומאחוריו עומדים בנצ'מרקים שפורסמו והערכה עצמאית. שום דבר במומחה צר אינו מאיים על כך; השניים עונים למערכי אילוצים שונים.

הסטאק שמשתמש בשניהם

התבנית ששורדת מפגש עם פייפליין אמיתי היא דו-שכבתית, והיא אינה אקזוטית. מודל מתקדם המתארח אצל ספק קורא את הקלט המבולגן — עמוד ספר לימוד סרוק, מקור במודאליות מעורבת, מפרט ארוך — והופך אותו לטקסט מובנה ונקי. הטקסט הזה עובר למודל לוגיקה פורמלית מקומי שכל תפקידו הוא להפיק תווית, פענוח או ביקורת Lean על חומרה שבבעלותך. ההכרעה אם השכבה השנייה הזאת שווה את עלות התחזוקה שלה היא ההשוואה בסגנון strict-7, ולא השער, מפני שמודל מומחה מרוויח את מקומו במסלולים שבהם למדד אין מקום לניקוד סלחני.

יש גם רמז שכדאי לקחת מהכרטיס של webAI עצמה: הפייפליין הורץ על חמישה מודלי בסיס שונים, כאשר רק מקדם המיזוג השתנה ממודל למודל, ו-webAI מדווחת על התוצאה עבור כל אחד מהם, כולל אלה שהשתנו הכי מעט. זו טענה חזקה יותר על מתכון מכל שורת בנצ'מרק בודדת, וזה סוג הראיות שאומר לך ששיטה מכלילה, ולא שצ'קפוינט אחד התמזל מזלו.

מה ניתן לניתוב כאן, ומה לא

זה המקום היחיד שבו שני המודלים יושבים באותו משפט בכנות. Qwen3.8-Max הוא נתיב: הוא מוגש דרך OrcaRouter בתור `qwen/qwen3.8-max`, ומכיוון שהפלטפורמה מעבירה הלאה את מחיר המחירון של הספק עם תוספת של 0%, תעריף $2.00/$6.00 הוא של הספק עצמו, והורדת מחיר מצד הספק נכנסת לתוקף באותו יום ולא לאחר מחזור חוזה. תמונת המצב המתוארכת `qwen/qwen3.8-max-0902` ניתנת לניתוב לצידו, כך שהצמדת מזהה מודל שניתן לשחזר היא בחירת תצורה ולא קשר ספק נפרד.

TwIL-LM3-Pro אינו נתיב, וזה יהיה חסר יושר לרמוז אחרת. הוא ברישיון לא-מסחרי, ללא נקודת קצה מתארחת שפורסמה, והדרך הנוכחית להשתמש בו היא להוריד את הצ'קפוינט ולהריץ אותו בעצמך. מה שהנתב עושה עבור צינור שנבנה סביבו הוא עבודת הטקסט שמסביב — הרחבת הפרומפט, יצירת הקורפוס, מעבר הסינון — שרצה על אותה נקודת קצה תואמת OpenAI מול יותר מ-200 מודלים, כך שהחלפת המודל שמייצר נתוני הערכה במודל שמדרג אותם לא עולה דבר מלבד עריכת קונפיגורציה, עם מעבר אוטומטי לגיבוי כדי לשמור על אצווה ארוכה פעילה כאשר ספק מגמגם.

השימוש המוצדק ביותר בשניים יחד הוא בדיוק זה: שכבת חזית ניתנת לניתוב שמבצעת חשיבה כללית וחילוץ מובנה, מומחה שהורד שמבצע את השיפוט הלוגי-פורמלי, ומפתח אחד לכל מה שביניהם.

איזה מודל להשוות, ומתי

אם אתם מעריכים מודלים קטנים של לוגיקה פורמלית, ה-Qwe​n ששווה להציב לצד TwIL-LM3-Pro הוא Qwen3-8B, ו-webAI כבר פרסמה את ההשוואה הזו עם ההסתייגויות המצורפות. אם אתם בוחרים היכן להריץ עומס עבודה בסביבת ייצור, Qwen3.8-Max הוא החלטה שונה לחלוטין — מערכת חזיתית מתארחת עם מחירון וללא הורדה — והשאלה הנכונה היא לא מה עדיף אלא איזה אילוץ מחייב: קישוריות ורישיון מצד אחד, והקשר, מודאליות וקנה מידה מצד שני. רוב המערכות האמיתיות מגיעות בסופו של דבר למצב שבו הן זקוקות לשתי התשובות.

A generated two-column scoreboard headed 'TwIL-LM3-Pro vs Qwen3.8-Max - the scoreboard' with six shared dimension rows. TwIL-LM3-Pro: Parameters 3.66B dense; Where it runs local download; Context 131,072 tokens; Input text only; Licence non-commercial; Cost no per-token fee. Qwen3.8-Max: Parameters 2.4T total, sparse MoE; Where it runs hosted endpoint; Context 1,000,000 tokens; Input text, image, video; Licence hosted commercial API; Cost $2.00 in / $6.00 out. A footer line reads 'Qwen3.8-Max specs per its OrcaRouter catalogue page; TwIL figures vendor-reported by webAI.' The OrcaRouter logo is composited in the bottom-right corner.A screenshot of the OrcaRouter model page for qwen/qwen3.8-max, showing the Qwen author line and release date 2026-08-03, the Vision, Tools, JSON and Reasoning capability badges, the vendor description positioning Qwen3.8-Max against GPT-5.5, Claude Opus 4.7 and Gemini 3.1 Pro, the /v1/chat/completions, /v1/messages and /v1/responses wire formats, and the $2.00 input and $6.00 output rates.A screenshot of the OrcaRouter model page for qwen/qwen3.8-max-0902, headed 'Qwen3.8 Max (0902)', showing the dated snapshot identifier, the Vision, Tools, JSON and Reasoning badges, text plus image and video input, and a 131K maximum output length field.

השוואות במאמר הזה1

זוהה מתוך המאמר הזה · בנצ'מרקים: Artificial Analysis · מתעדכן יומית