Inkling-Small-1
Guides & Insights

Inkling-Small: הדגם ברבע גודל שמנצח את דגם הדגל שלו, ועדיין מפגר אחרי המדד

מחבר

Jim Song

תאריך פרסום

מודלים אחרונים · 20צפו בכל המודלים
בנצ'מרקים: Artificial Analysis · מתעדכן יומית
חזרה לכל הפוסטים

Thinking Machines Lab spent the two weeks after shipping its first open-weights model building one about a quarter the size, and on the lab's own scorecard the smaller one wins. Inkling-Small reports 80.2% on SWE-bench Verified against Inkling's 77.6%, 89.5% on GPQA Diamond against 87.2%, 64.7% on Terminal-Bench 2.1 against 63.8%, and 31.6% on Humanity's Last Exam against 29.7% — from 276B total parameters with 12B active, rather than 975B with 41B. Of the headline numbers the two model cards share, the 975B flagship holds exactly one: AIME 2026, by 1.6 points.

אז Artificial Analysis הריץ את שניהם באופן עצמאי ומיקם את Inkling-Small על 40 במדד Intelligence Index שלו, מול 41 של Inkling — המודל הקטן יותר נקודה אחת מאחור. שני התוצאות האלה אמיתיות, והפער ביניהן הוא הדבר השימושי ביותר בהשקה הזו. כל מה שלהלן מפריד בין מה ש-Thinking Machines מדווחת על המודל שלה לבין מה שמישהו אחר מדד: נתוני הספק מגיעים מההודעה ומשני כרטיסי המודל של Hugging Face, הנתונים הבלתי-תלויים מהריצות של Artificial Analysis עצמה, ומספרי התמחור וההקשר מהנתונים החיים של נקודת הקצה של OpenRouter, שנבדקו ביום כתיבת הדברים. במקום שבו שלושת אלה חלוקים — ובאורך ההקשר הם אכן חלוקים — אנו אומרים זאת במקום לבחור את המחמיא.

מה בעצם שוחרר ב-30 ביולי

Inkling-Small הוא טרנספורמר דליל של תערובת מומחים: סך הכל 276B פרמטרים, 12B פעילים לכל טוקן, 42 שכבות, כאשר כל טוקן מנותב ל-6 מתוך 256 מומחים בתוספת 2 מומחים משותפים שפועלים על הכל. תשומת הלב מתחלפת בין שכבות מקומיות לגלובליות. המשקלים נמצאים ב-Hugging Face תחת רישיון Apache 2.0 ללא הגבלות מסחריות, ניתן לכוונן אותו דרך Tinker API של Thinking Machines, ואפשר לדבר איתו בטקסט, תמונה ואודיו ב-Tinker Playground. המעבדה אומרת שהוא אומן על מערכות NVIDIA GB300 NVL72.

Inkling-Small-2

רב-מודליות היא תכונה מהותית ולא תוספת מאוחרת, והכרטיס ספציפי במידה יוצאת דופן בנוגע לאופן שבו זה עובד. אין מקודד נפרד לוויז׳ן או לאודיו: אודיו מגיע כספקטרוגרמות dMel, תמונות מגיעות כפלטות של 40×40 פיקסלים שמועברות דרך hMLP בעל ארבע שכבות, ושתיהן מוטמעות ישירות באותו רצף טוקנים כמו טקסט. הקלט הוא טקסט, תמונות ואודיו;הפלט הוא טקסט בלבד, וזה חשוב לציין במפורש, כי ״רב-מודלי״ נקרא לעתים קרובות כ״הוא יכול לדבר״ — במידה מספקת כדי לגרום אחר צהריים רע. עוצמת החשיבה היא חוגה עם חמישה מצבים — minimal, low, medium, high, xhigh — כך שניתן להפעיל את אותם משקלים בזול או במאמץ מלא.

החלק המעניין במתכון הוא הפוסט-אימון. Inkling-Small זוקק בשיטת on-policy כשהמורה שלו הוא Inkling המלא, ולאחר מכן קיבל כשבועיים נוספים של למידת חיזוק בקנה מידה מורחב על קידוד אייג'נטי. הסדר הזה מסביר את צורת התוצאות: התלמיד ירש את הכשירות הכללית של המורה שלו, ואז קיבל אימון נוסף בדיוק על הציר שבו הוא עכשיו מנצח את המורה.

לוח התוצאות שפרסמה Thinking Machines

מדדי ספקים הם שיווק עד שמישהו משחזר אותם, אז קראו את הסעיף הזה כטענות המעבדה, לא כעובדות שאומתו. ובכל זאת מדובר במערך רחב, והוא רחב בכיוון שאינו מחמיא לדגם הדגל.

Inkling-Small-3

מעבר לארבעת המספרים המשותפים, הכרטיס משלים את שאר התמונה — כל הריצות של Thinking Machines עצמן:

עבודה אגנטית — 1269 Elo על GDPval-AA v2, מדד של משימות כלכליות מציאותיות ולא חידות.

תרשימים ומסמכים — 77.4% ב-CharXiv RQ, שעולה ל-81.3% כאשר המודל רשאי לכתוב ולהריץ Python. הקפיצה של 3.9 נקודות היא רמז שימושי לכך שגישה לכלים משיגה יותר בעבודה של חשיבה חזותית מאשר הנדסת פרומפטים.

Vision — 74.0% ב-MMMU Pro, מעט מעל 73.5% של Inkling.

אודיו — 90.1% VoiceBench ו-77.0% MMAU, שניהם במעט מתחת ל-91.4% ו-77.2% של דגם הדגל. אודיו הוא אחד משני התחומים שבהם ההקטנה בבירור עלתה במשהו.

Safety — 98.4% StrongREJECT and 96.9% on FORTRESS benign prompts, but 71.6% on FORTRESS adversarial against the flagship's 78.0%. That is the other cost: a 6.4-point regression in adversarial robustness, which matters more than any coding gain if the model is going to sit behind a public text box.

חיזוי — 61.3 ± 0.46 Brier Index ב-ForecastBench ללא גישה לחיפוש, ו-0.1238 ± 0.0086 Brier score ב-Prophet Arena. עצם הדיווח על פסי שגיאה מעיד על משמעת גבוהה יותר ממה שרוב פוסטי ההשקה משיגים.

פער אחד: הכרטיס של הדגל מציג 54.3% ב-SWE-bench Pro, האח הקשה יותר של SWE-bench Verified. הכרטיס של Inkling-Small אינו מדווח על SWE-bench Pro. בהתחשב בכמה שהנתון של Verified מוצג בולט, היעדרו הוא הנתון שהיינו הכי רוצים לראות ממולא.

מה שהמדד העצמאי אומר במקום זאת

{{1}}Artificial Analysis ממקמת את Inkling-Small על 40 בגרסה 4.1 של מדד האינטליגנציה שלה, נקודה אחת מתחת ל-Inkling שעומד על 41.{{/1}} המדד הוא שילוב של תשע הערכות — GDPval-AA v2, τ³-Banking, Terminal-Bench v2.1, SciCode, Humanity's Last Exam, GPQA Diamond, CritPt, AA-Omniscience ו-AA-LCR — והרשימה הזו מסבירה את רוב הסתירה לכאורה. {{2}}רק שתיים מתוך התשע חופפות לתצוגת ההיגיון בכרטיס של Thinking Machines.{{/2}} השאר משוקלל לכיוון שימוש בכלים אוטונומיים, אחזור הקשר ארוך ועמידות בפני הזיות, ומודל יכול לנצח במבחני הביצוע שמעבדה בוחרת לפרסם בעודו מפסיד באלה שגורם שלישי בוחר להריץ. {{3}}אף צד אינו משקר; הם מודדים דברים שונים.{{/3}}

Inkling-Small-4

יש גם פרט באותיות הקטנות ששווה יותר מהכותרת על נקודת היתרון: Artificial Analysis מציג את הערך של הדגם הראשי כ־Inkling (xhigh) — הגדרת מאמץ החשיבה הגבוהה ביותר שלו — ואילו בשורה של Inkling-Small אין סיומת מאמץ. כלומר, יתרון הנקודה הבודדת של הדגם הראשי נרשם כשחוגת ההנמקה שלו מסובבת עד הסוף. אם התאמת המאמץ הייתה מזיזה את ההשוואה הזו אפילו במעט, הטיעון האחרון בעד המודל הגדול יותר על בסיס יכולת בלבד היה נעלם גם הוא.

התחום שבו הנתונים הבלתי תלויים אינם קרובים כלל הוא המהירות והעלות, וכאן זה מיטיב עם המודל הקטן בפערים שאף טבלת מדדים אינה משקפת:

מהירות פלט — 133 טוקנים לשנייה לעומת 80 עבור Inkling (xhigh). Artificial Analysis מדרג את Inkling-Small במקום ה-7 מתוך 101 מודלים בקטגוריה שלו מבחינת מהירות, לעומת חציון קטגוריה של 66.

זמן עד לטוקן הראשון — 1.63 שניות לעומת 1.84 שניות. יתרון אמיתי אך מינורי.

מחיר משולב למיליון טוקנים — $0.22 לעומת $0.72 בשקלול שלהם. בערך שליש מהעלות, תמורת נקודת אינדקס אחת פחות.

דירוג אינטליגנציה — מקום 15 מתוך 101, לעומת חציון כיתתי של 25. בנוחות מעל הממוצע, רחוק מאוד מהחזית.

ורבוזיות — והנה הקאץ'. הוא שרף 130M טוקיני פלט כדי לעבור את המדד, לעומת חציון של 100M. הסיכום של Artificial Analysis עצמו מכנה אותו "מהיר במידה ניכרת, אך ורבוזי במקצת." הוא חושב בכ־30% יותר מהרגיל, מה שמכרסם בשקט חלק מההנחה לכל טוקון.

הערת רישום קטנה, מכיוון שכל מי שמשווה מקורות ייתקל בזה: Artificial Analysis מציינת את מספר הפרמטרים כ-266B בסך הכול, בעוד שההכרזה, שני כרטיסי המודל ו-OpenRouter מציינים כולם 276B. השתמשנו ב-276B לאורך כל הדרך. זה לא משנה שום מסקנה, אבל זה סוג הפער שכדאי לדעת עליו לפני שמצטטים מספר במסמך עיצוב.

מה שאפשר לשכור בפועל היום, וזה לא מה שגיליון המפרט אומר.

הפער בין הכרזה על משקלים פתוחים לבין נקודת קצה שמישה הוא המקום שרוב סיקור ההשקות מפסיק לשים לב אליו. Thinking Machines מפרסמת חלון הקשר של עד 1M טוקנים, ו-Artificial Analysis מציינת גם היא 1M. ב-OpenRouter, שני הספקים שמשרתים כיום את Inkling-Small מגבילים אותו ל-524,288 טוקנים — מחצית מהנתון המוצהר. זה לא סתירה אלא הבדל בין מה שהארכיטקטורה תומכת בו לבין מה שמישהו הקים בפועל בסביבת הייצור. לשם השוואה, דגם הדגל Inkling אכן כולל נקודת קצה אחת עם מלוא 1,048,576 הטוקנים, אם כי אותה נקודת קצה מגבילה את ההשלמות ל-32,768 טוקנים.

שאר התמונה החיה, שנקראה מנתוני נקודת הקצה של OpenRouter:

שני ספקים, שני מחירים — $0.45 לכל מיליון אסימוני קלט ו-$1.20 לכל מיליון אסימוני פלט מספק אחד, $0.50 ו-$1.20 מהשני. Artificial Analysis מציגה את התעריף הישיר של Thinking Machines עצמה כנמוך עוד יותר, $0.30 ו-$1.20, עם קלט שמור במטמון ב-$0.06. אירוח צד-שלישי גובה פרמיה של 50–67% על הקלט עבור אותם משקלים.

אחסון הנחיות במטמון — $0.10 לכל מיליון אסימוני קלט במטמון דרך OpenRouter, לעומת $0.17 עבור המודל הראשי.

הנתונים המספריים שאתה שוכר אינם אלה שנמדדו ב-benchmark — כרטיס המודל מפרט BF16 ו-NVFP4. נקודת הקצה הזולה יותר מגישה fp8; האחרת אינה מצהירה על קוונטיזציה כלל. ציוני ה-benchmark של הספק לא נמדדו על הגשה בפורמט fp8 של משקלים אלה, והשפעות הקוונטיזציה על ריצות סוכן ארוכות הן בדיוק סוג הדבר שפער של 0.9 נקודה ב-Terminal-Bench לא יכול לשרוד. אם אתה משחזר מספר, ציין באיזו נקודת קצה השתמשת.

כיסוי התכונות אינו אחיד בין הספקים — שני הקצוות חושפים reasoning ו-reasoning_effort, אז חוגת החשיבה עם חמש הגדרות פועלת. אבל רק אחד מפרסם קריאת כלים ו-logprobs, בעוד שאף אחד מהם לא מפרסם כרגע response_format, פרמטר הפלט המובנה/JSON-mode. ל-Inkling הדגל יש נקודת קצה שאכן מפרסמת זאת. אם הצינור שלך תלוי ב-JSON שנאכף לפי סכמה, זה הפרט שיכאיב ביום הראשון, וזו מגבלה של הספק ולא של המודל.

תקרת השלמה — 262,144 אסימונים בנקודת הקצה fp8; השנייה מצהירה שאין הגבלה.

תרחיש העלות, על פי ספירות הטוקנים שנמדדו

מחירים למיליון הם דרך גרועה להשוות מודלים של חשיבה, כי המשתנה כולו הוא כמה טוקנים הם שורפים בחשיבה. Artificial Analysis מפרסם את ההוצאה בפועל, שהיא כלי הרבה יותר טוב: הרצת Inkling-Small על כל Intelligence Index צרכה בערך 130 מיליון טוקני פלט ועלתה $192.37, מה שמסתכם בכ-$0.07 למשימה בממוצע המשוקלל שלהם.

השוו זאת למדידה של אותם מודלים שאנשים פורסים בפועל: DeepSeek V4 Flash ב-$0.03 למשימה, gpt-oss-120b ב-$0.08, Gemini 3.6 Flash ב-$0.56, GLM-5.2 ב-$0.57, Kimi K3 ב-$0.86, GPT-5.6 Sol ב-$1.23, Claude Opus 5 ב-$2.34, Claude Fable 5 ב-$3.15. Inkling-Small הוא המודל השני הכי זול בקבוצה הזו, ובערך פי 18 זול יותר למשימה מאשר GPT-5.6 Sol, שמשיג 59 לעומת 40 של Inkling-Small.

יש גם דרך נקייה יותר להבין מדוע המחיר ירד לאן שירד. הפרמטרים הפעילים ירדו מ-41B ל-12B, פי 3.4. מחיר הפלט ירד מ-4.05$ ל-1.20$ למיליון, פי 3.375. מחיר ההשכרה של MoE דליל הוא למעשה רק עלות החישוב שלו לכל טוקן, ו-Thinking Machines תמחרו בהתאם, במקום לתמחר לפי הביצועים במבחנים.

הערה מעשית אחת בנוגע להרצת ההשוואה בעצמך: Inkling-Small אינו נמצא בקטלוג OrcaRouter כיום, אז היית שוכר אותו מנקודות הקצה שלו. המודלים הסגורים שהיית מודד אותו מולם — GPT-5.6 Sol, Claude Opus 5, Gemini 3.6 Flash ושאר הרשימה — נמצאים ב־OrcaRouter מאחורי מפתח יחיד, בשיעור 0% מארק־אפ, כלומר אתה משלם את מחיר המחירון של כל ספק בלי שום תוספת. זה חשוב דווקא למודל עלות: המספר שאתה מכניס לגיליון האלקטרוני הוא המספר שיחויב, וכשספק מוריד מחירים, זה נוחת אצלנו באותו יום ולא אחרי משא ומתן מחדש. מעבר אוטומטי בין ספקים מכסה את החצי השני של הערכה, דהיינו הזרוע הבסיסית שנופלת באמצע הריצה ומרעילה בשקט את המספרים שלך.

איפה הוא באמת ממוקם בין מודלים פתוחי-משקל

בקריאה מול הדגל, Inkling-Small נראה כניצחון. בקריאה מול השדה, הוא נראה כמודל open-weights מוצק באמצע הטבלה, וסיקור ההשקה דילג ברובו על הקריאה השנייה.

במדד ה-Artificial Analysis Intelligence, הדגמים שנמצאים לפני שני ה-Inklings כוללים את Claude Opus 5 עם 61, Claude Fable 5 עם 60, GPT-5.6 Sol עם 59, Kimi K3 עם 57, Grok 4.5 עם 54, GLM-5.2 ו-Muse Spark 1.1 עם 51, ו-Gemini 3.6 Flash עם 50. זה צפוי — אלה מערכות frontier, רובן סגורות, וכמה מהן עצומות.

הדבר שלמעשה צריך לשנות החלטה הוא DeepSeek V4 Flash, שמקבל ציון 50 לעומת 40 של Inkling-Small, עם 284B בסך הכול ו-13B פעילים — למעשה באותה קטגוריית גודל ובאותה מציאה של משקלים פתוחים, בפחות מחצי עלות למשימה. אם מה שאתה רוצה הוא המודל הזול ביותר בעל משקלים פתוחים שמסוגל, הנתונים העצמאיים מצביעים לשם, לא לכאן. הוא גם, בניגוד ל-Inkling-Small, זמין דרך OrcaRouter, כך שבדיקת החלופה הזו מול עומס העבודה שלך היא שינוי במחרוזת המודל במקום תהליך רכש.

מה שלהאינקלינג-סמול יש ולדיפ-סיק V4 פלאש אין הוא קלט שמע ותמונה מקורי באותם משקלים, חוגת חשיבה בחמש רמות, וכוונון עדין מסוג טינקר מהמעבדה שאימנה אותו. אלה הם מבדלים אמיתיים עבור סוכן מולטי-מודאלי, והם הסיבה הכנה לבחור בו — לא ציון המדד.

מי צריך לזוז, ומי צריך להישאר במקום

ההחלטה מתפצלת בצורה נקייה, דבר חריג מספיק כדי שראוי לציינו ככזה.

עברו מ-Inkling ל-Inkling-Small אם אתם מריצים סוכני קידוד. נתוני הספק מעדיפים את הדגם הקטן ב-SWE-bench Verified ו-Terminal-Bench, ה-RL הסוכני הנוסף הוא הסיבה המתועדת, וזה עולה כשליש מהמחיר ומחזיר טוקנים במהירות גבוהה פי 1.66. לשלם פי 3.3 עבור נקודת אינדקס אחת שנמדדה במאמץ חשיבה מרבי הוא מקרה קשה לנמק.

עבור אם עלות לכל משימת חשיבה היא האילוץ המחייב ואתה יכול לחיות עם 40 במדד. $0.07 למשימה עם שיעור פגיעות מטמון של $0.06 למיליון בנקודת הקצה של הצד הראשון הוא תמחור אגרסיבי עבור מודל עם שמע וראייה מקוריים.

עברו אם אתם מבצעים כוונון עדין. מודל 276B/12B זול בהרבה להתאמה ולשרת מאשר 975B/41B, וטינקר תומך בשניהם.

הישארו ב-Inkling אם אתם צריכים אודיו ארוך. זו הרגרסיה החדה ביותר במהדורה והיא קבורה בכרטיסי המודל: הדגם הראשי ממליץ על קלט אודיו של פחות מ-20 דקות, בעוד שהכרטיס של Inkling-Small ממליץ על פחות מ-2 דקות. קיצוץ של פי עשרה. אם היית מתמלל או מנתח פגישות, המודל הקטן אינו תחליף ישיר בכל מחיר.

הישארו אם אתם צריכים קונטקסט מעבר ל-512K מנקודת קצה מתארחת, או השלמות ארוכות יותר מ-262K טוקנים. היום רק למודל הדגל יש נקודת קצה שמשרתת את המיליון המלא.

הישאר אם אתה צריך JSON עם אכיפת סכמה בלי לכתוב לולאת אימות וניסיון חוזר משלך, עד שספק יספק response_format עבור המודל הקטן.

הישאר אם חוסן אדוורסרי הוא קריטי. 71.6% לעומת 78.0% ב-FORTRESS האדוורסרי הוא כיוון שגוי לכל דבר הפונה למשתמשים, וזהו המספר של המעבדה עצמה.

שלוש שאלות שסיקור השיגור השאיר פתוחות

האם Inkling-Small הוא רק Inkling מזוקק?

חלקית, והחלק שלא — הוא החלק שקובע. זיקוק on-policy עם Inkling כמורה היה אחד משלבי הפוסט-אימון, כך שחלק גדול מהיכולת הכללית אכן עובר בירושה. אבל זהו מודל עם ארכיטקטורה נפרדת — 42 שכבות לעומת 66 של מודל הדגל, עם אותה טופולוגיית ניתוב של 6 מומחים פעילים מתוך 256 ועוד 2 משותפים, מה שאומר שהמומחים עצמם צרים יותר, לא פחות במספרם. הוא גם קיבל כשבועיים של למידת חיזוק (RL) לקידוד אייג'נטי, שהמורה מעולם לא קיבל. השלב האחרון הזה הוא הסיבה שתלמיד מזוקק עוקף את המורה שלו במדדי קידוד — מה שאחרת לא היה אמור לקרות.

האם אני יכול באופן ריאלי לארח את זה בעצמי?

רק על חומרה רצינית. 276B פרמטרים הם בערך 276GB של משקולות ב-8-bit וכ-552GB ב-BF16, לפני כל מטמון KV — צומת מרובה GPU בכל מקרה, לא תחנת עבודה. היתרון של MoE דליל הוא עלות ההסקה, לא טביעת הזיכרון; מאחסנים את כל 276B ומחשבים עם 12B. כרטיס המודל מציין את SGLang, vLLM, TokenSpeed, Unsloth ו-Hugging Face Transformers כמסלולי הגשה נתמכים ומפרט BF16 ו-NVFP4. שים לב גם ששתי נקודות הקצה המתארחות כיום מגישות גרסה מכומתת, כך ש"אותו המודל" באירוח עצמי ב-BF16 לא יתנהג זהה ל-API שבדקת מולו.

האם ל-975B Inkling עדיין יש סיבה להתקיים?

שלוש, וכולן צרות: הקשר המלא של 1M טוקנים שמוגש, קלטי אודיו ארוכים משתי דקות, והתנהגות בטיחותית טובה יותר נגד יריבים. יש לציין, "הוא חכם יותר" אינו ברשימה הזו בביטחון — נקודת אינדקס אחת במאמץ חשיבה מקסימלי, מול סט של אמות מידה של ספקים שהמודל הקטן מנצח ברובן, אינה טיעון יכולת. שבועיים לאחר השקת דגל של 975B, Thinking Machines שחררה את המודל שמקשה על ההמלצה. זה או כנות יוצאת דופן או מהירות יוצאת דופן, ובכל מקרה זה סימן טוב לגבי המעבדה.

מה לצפות בהמשך

שלושה דברים יקבעו כיצד המהדורה הזו תתיישן. האם תופיע נקודת קצה שתשרת את חלון ההקשר של 1M כפי שפורסם, מה שיסיר את היתרון הברור האחרון של דגם הדגל. האם מישהו יפרסם השוואה עצמאית עם התאמת מאמץ בין שני הדגמים, שזו הדרך היחידה לדעת אם אותה נקודת אינדקס אחת אמיתית. והאם המלצת האודיו של 2 דקות היא מגבלת אימון או ברירת מחדל של ההגשה — כי אם זו האחרונה, הסיבה הגדולה ביותר להישאר עם הדגם הגדול יותר מתפוגגת. עד אז, הסיכום הכנה הוא ש-Thinking Machines שחררה דגם שעולה שליש מהמחיר, מהיר יותר בשני שלישים, טוב יותר בקידוד לפי העדויות שלה, מעט מאחור בציונים מצטברים עצמאיים, ובבירור מאחורי מתחרה באותו גודל שרוב הסיקור לא הזכיר.

© 2026 OrcaRouter

לספקים

מפעילים פלטפורמת הסקה (inference)? הציגו את המודלים שלכם ב-OrcaRouter.

צרו קשר

הצטרפו לקהילה שלנו

DiscordEmailXGitHubYouTube