סקירת מודל Inkling AI: המודל הפתוח-משקלים הראשון של Thinking Machines, נבדק והוסבר
Guides & Insights

סקירת מודל Inkling AI: המודל הפתוח-משקלים הראשון של Thinking Machines, נבדק והוסבר

מחבר

Jim Song

תאריך פרסום

מודלים אחרונים · 20צפו בכל המודלים
בנצ'מרקים: Artificial Analysis · מתעדכן יומית
חזרה לכל הפוסטים

זוסקירת מודל Inkling AI בוחנת מקרוב את ההשקה הראשונה של Thinking Machines Lab, הסטארטאפ שבראשו עומדת מירה מוראטי, לשעבר מנהלת הטכנולוגיה הראשית של OpenAI. Inkling הוא מודל בעל משקלים פתוחים, רב-מודאלי מסוג Mixture-of-Experts (MoE) עם חלון הקשר של מיליון טוקנים וחוגה ניתנת לשליטה של "מאמץ חשיבה". הוא מהיר, זול לאירוח עצמי, ובנוי להתאמה אישית במקום לשליטה בלוחות התוצאות. להלן, אנו מפרידים בין אמות המידה המדווחות על ידי הספק לבין מדידה בלתי תלויה, עוברים על הארכיטקטורה, מראים לכם כיצד להריץ אותו, ומסבירים בדיוק מי צריך (ומי לא) לאמץ אותו.

נכון ל: 2026-07-16 — יום אחד לאחר ההשקה. זוהי סקירה מבוססת מחקר; עדיין אין מבחני שימוש ארוכי טווח עבור אף דגם חדש כל כך, ואנחנו מסמנים כל נתון לא מאומת להלן.

הערה לבונים: אם ברצונך לנסות את Inkling לצד מודלים אחרים, OrcaRouter משמש כחזית למודלים זמינים דרך API באמצעות endpoint יחיד תואם OpenAI, כך שתוכל להשוות ולעבור ללא אינטגרציות חדשות.

- מסקנת TL;DR: Inkling הוא מודל פתוח בעל יכולות אמיתיות ויעיל שמצטיין בכיוונון עדין ובפריסה רגישה לעלות, אך אינו מוביל חזית ויוצרו אומר זאת בגלוי. אם אתה רוצה בסיס הניתן להתאמה אישית וללא תמלוגים עם חלון הקשר ענק, זוהי אחת ההשקות המעניינות ביותר של 2026. אם אתה רוצה את הדגם החזק ביותר הקיים, חפש במקום אחר.

- מה זה: מודל הנמקה מבוסס MoE במשקלים פתוחים (Apache 2.0). למי זה מיועד: אנשי מקצוע המעוניינים לכוונן ולארח בעצמם במקום לשלם עבור API סגור מוביל.

נקודות עיקריות

יוצר ותאריך: Thinking Machines Lab; שוחרר ב-15 ביולי 2026 כמודל הראשון של המעבדה.

ארכיטקטורה: Sparse MoE, 975B סה"כ / 41B פרמטרים פעילים, 66 שכבות, הקשר של עד 1M טוקנים במשקולות (256K דרך APIs מאוחסנים).

רישיון: Apache 2.0 — משקלים מלאים ב-Hugging Face, חינם לשימוש מסחרי ואירוח עצמי.

מיצוב ישר: החברה מצהירה באופן גלוי כי היא "אינה המודל החזק ביותר הזמין כיום, לא סגור ולא פתוח."

ציון עצמאי: 41/100 במדד Artificial Analysis Intelligence Index — #10 מתוך 97 מודלים, ולפני מספר עמיתים פתוחים (ראה התאמה למטה).

עלות: המשקלים הם ללא תמלוגים לאירוח עצמי; גישה באירוח מתחילה בסביבות $1.87 למיליון טוקני קלט.

אזהרה: כמעט כל מדדי הביצועים הראשיים מדווחים על ידי הספק עצמו ואינם נבדקים באופן בלתי תלוי.

מי עומד מאחורי Inkling

- תיבת המייסד.Inkling הוא הדגם הראשון מThinking Machines Lab (thinkingmachines.ai), שהוקם על ידי Mira Murati, לשעבר מנהלת הטכנולוגיה הראשית ב-OpenAI. המעבדה פעלה בחשאיות יחסית לפני ההשקה הזו ונקטה בעמדה של משקולות פתוחות, בניגוד לגישת הדגל הסגור של המעסיק הקודם של מוראטי. Thinking Machines אינה מונטת את המודל עצמו – ההכנסות זורמות דרך Tinker פלטפורמת הכוונון העדין שלה ושותפי אירוח צד שלישי. המודל העסקי הזה הוא מרכזי להבנת Inkling: המשקולות הן רמפה חינם, והחברה מרוויחה כשאתה מתאים אישית או מגדיל.

מה זה Inkling?

Inkling הוא מודל שפה והסקה גדול בעל משקלים פתוחים, מולטי-מודלי, Mixture-of-Experts, שהוכרז על ידי Thinking Machines Lab ב-15 ביולי 2026 ושוחרר תחת מתירני Apache 2.0 רישיון עם משקלים מלאים ב-Hugging Face.

מה שהופך את ההשקה הזו לבולטת הוא המסגור. במקום לטעון לכתר חלוצי, Thinking Machines מתארת את Inkling כמודל פתוח, רב-תכליתי, יעיל וניתן להתאמה אישית. בהודאה כנה בצורה יוצאת דופן ליום השקה, החברה מצהירה כי Inkling “אינו המודל החזק ביותר הזמין כיום, סגור או פתוח.” הכנות הזו קובעת את הטון לכל הסקירה הזו: Inkling הוא כלי שנועד להתאמה, אירוח עצמי וכיוונון עדין, לא גביע אמת מידה.

הסיקור מ-Fortune ו-TechCrunch הדהד פרשנות זו. TechCrunch טען כי Inkling אינה מאיימת על OpenAI, Anthropic או Google ברובד הגבול (frontier tier), אלא דווקא מפעילה לחץ על השכבה האמצעית של ספקי אירוח במשקלים פתוחים ופלטפורמות כוונון עדין. Forbes הציג את אסטרטגיית המשקלים הפתוחים של Murati כקרובה יותר לספר המשחקים הפתוחים הסיני (DeepSeek, Qwen, Kimi) מאשר לדגלונים האמריקאיים הסגורים — נרטיב של משקלים פתוחים בין ארה"ב לסין העובר דרך חלק ניכר מהפרשנות סביב ההשקה.

ארכיטקטורה ומפרטים

מאחורי הקלעים, Inkling הוא טרנספורמר דליל מסוג Mixture-of-Experts. רק חלק קטן מהפרמטרים שלו מופעלים עבור כל טוקן, וזה מה ששומר על יעילות ההסקה למרות מספר הפרמטרים הכולל הגדול. הפרטים מתועדים בכרטיס המודל הרשמי ובבלוג של Hugging Face.

סך כל הפרמטרים: 975B

פרמטרים פעילים: 41B (sparse MoE)

שכבות: טרנספורמר של 66 שכבות מבוסס מפענח בלבד

מומחים: 256 מנותבים + 2 משותפים; 6 מתוך 256 מנותבים לכל אסימון (ה-2 המשותפים תמיד פעילים)

ניתוב: Sigmoid / aux-loss-free

תשומת לב: היברידי, 5:1 חלון הזזה (מקומי) לגלובלי; 8 ראשי KV

קידוד מיקום: נלמדות הטבעות מיקום יחסיות (לא RoPE)

רב-מודאליות: ללא מקודד — אודיו כספקטרוגרמות dMel, תמונות כפאצ'ים של 40×40, המוזנים ישירות

תוספות: קונוולוציות קצרות (SConv); שכבות MTP לפענוח ספקולטיבי

נומריקה: BF16, MXFP8, NVFP4 (NVFP4 checkpoint עבור NVIDIA Blackwell)

חלון הקשר: עד 1,000,000 טוקנים במשקולות (256K ב-API מתארחים)

גרסה קטנה יותר: Inkling-Small, 276B סה״כ / 12B פעילים (תצוגה מקדימה, משקלים עדיין לא שוחררו)

כמה בחירות עיצוב מבדילות את Inkling מ-MoE רגילה:

פריסת מומחים. עם 256 מומחים מנותבים ועוד 2 מומחים משותפים, ו‑6 מומחים מנותבים הפועלים לכל טוקן, צמד המומחים המשותפים משמש כ"כיור מומחים" שתמיד פעיל, הלוכד חישובים נפוצים בעוד המומחים המנותבים מתמחים. ניתוב סיגמואידי ללא הפסד עזר נמנע ממונח העונש של איזון עומסים, שנמצא בשימוש בתכנוני MoE רבים.

אמבדינגים של מיקום יחסי, לא RoPE. רוב המודלים המודרניים עם הקשר ארוך מסתמכים על אמבדינגים סיבוביים; Inkling במקום זאת משתמשת באמבדינגים של מיקום יחסי שנלמדים, בחירה יוצאת דופן בקנה מידה זה.

רב-מודאליות ללא מקודד. במקום להתקין בנפרד מקודדי ראייה/שמע, Inkling מזינה ישירות למחסנית הטרנספורמר רסיסי תמונה בגודל 40×40 וספקטרוגרמות שמע dMel. זה מפשט את הצינור וחלק מהסיבה לכך שהמודל מתואר כרב-מודאלי טבעי.

MTP עבור פענוח ספקולטיבי. שכבות חיזוי רב-טוקנים (MTP) פועלות כנוסח מובנה, ומאיצות יצירה ללא מודל טיוטה נפרד.

הערת עורך — הוסף ויזואל: תרשים בלוקים מסומן של שכבת Inkling אחת — תשומת לב חלון נע לעומת תשומת לב גלובלית (5:1), נתב המומחים 256+2 עם 6 מומחים פעילים מודגשים, SConv, וראש ניסוח MTP.

אימון וחוגת "מאמץ החשיבה"

אינקלינג אומן מראש על 45 טריליון טוקנים מולטי‑מודליים המכסים טקסט, תמונות, אודיו ווידאו, תוך שימוש באופטימייזר היברידי (Muon עבור משקלי מטריצה גדולים, Adam עבור השאר) על מערכות NVIDIA GB300 NVL72. אימון לאחר האימון השתמש בלמידת חיזוק א‑סינכרונית בקנה מידה גדול שהתרחבה מעבר ל‑ 30M+ רולאאוטים על פני שני ריצות רציפות ארוכות, שבוצעו ב‑bootstrap מאימון עדין מונחה ראשוני על נתונים סינתטיים.

תכונה ייחודית היא פרמטר מאמץ חשיבה שניתן לשליטה, שהודגם בטווח של כ-0.2 עד 0.99, כשלערכים גבוהים יותר משמעותם יותר חשיבה ועלות גבוהה יותר. הדבר מאפשר למפעילים לאזן בין עיכוב (latency) והוצאה לבין עומק המחשבה. כל נתוני הבנצ'מרק להלן הופעלו עם Effort = 0.99.

מאמץ חשיבה בר-שליטה: מדריך תפעולי

בפריסה, בקרת המאמץ מוצגת כ-enum בשם reasoning_effort עם הרמות ללא / מינימלי / נמוך / בינוני / גבוה / גבוה במיוחד / מקסימלי. אין הגדרה "נכונה" אחת — זהו מנוף חי עבור האיזון בין השהייה, עלות ואיכות. השתמש בטבלה שלהלן כמפת התחלה (הנחיה יחסית; איכות ברמת אמת מידה נמדדה בחלק העליון של הטווח):

אין / מינימלי. עלות שהות יחסית ואסימונים: הנמוך ביותר; הכי טוב ל: סיווג, חילוץ, עיצוב, ניתוב, דבק שליפה

נמוך. שהות יחסית & עלות טוקנים: נמוך; הכי מתאים ל: שאלות ותשובות קצרות, סיכום פשוט, עבודות אצווה בנפח גבוה

בינוני. השהיה יחסית ועלות אסימון: בינוני; הכי מתאים ל: שיחה כללית, ניסוח, רוב קריאות כלים של הסוכן

גבוה. זמן השהייה יחסי ועלות אסימונים: גבוה יותר; מתאים ל: נימוק רב-שלבי, יצירת קוד, ניתוח

xhigh / max. עיכוב יחסי ועלות אסימונים: הגבוה ביותר; הכי טוב עבור: מתמטיקה קשה, חשיבה בסגנון תחרויות, שוויון benchmark (Effort=0.99)

האם ניתן להריץ את זה מקומית? חומרה ו-VRAM

מכיוון שאינקלינג היא מודל עם 975 מיליארד פרמטרים, "מקומי" בפועל אומר שרת עם מספר GPUs, לא מחשב נייד. דרישות משוערות (על פי סיקור ההשקה וכלי הקהילה):

BF16 (מלא). זיכרון VRAM מצטבר משוער: ~2 TB; דוגמאות תצורה: 8× NVIDIA B300, או 16× H200

NVFP4 (מוונט). זכרון VRAM מצטבר משוער: ~600 GB; דוגמאות לתצורות: 4× NVIDIA B300, או 8× H200

GGUF (קהילה). סך VRAM משוער: משתנה לפי quant; דוגמאות תצורה: קיימים בני GGUF של Unsloth לטביעות רגל קטנות יותר/מקוונטזות

נקודת הבידוק NVFP4 — שנשלחת במיוחד עבור NVIDIA Blackwell — מקטינה את עלות הזיכרון בכ-שני שלישים לעומת BF16, שזה ההבדל בין צומת B300 בעל 8-GPU לצומת בעל 4-GPU. עבור רוב הצוותים, זה עדיין מצביע על ספק אירוח או צומת GPU שכור במקום חומרה בבעלות. קוונטיזציות Unsloth GGUF מרחיבות את הטווח עוד יותר למטה בסולם החומרה לצורך ניסויים, במחיר של איכות מסוימת.

התחלה מהירה לפריסה

Inkling חושףAPI תואם OpenAI, כך שרוב קוד הלקוח הקיים עובד כתחליף ישיר עם שינוי של כתובת ה-URL הבסיסית ושם המודל. שלושת נתיבי ההגשה הנפוצים:

vLLM — שרת עם פקודה בודדת (ברירת מחדל לפורט 8000):

vllm serve thinkingmachines/Inkling --port 8000
# אז קרא לנקודת הקצה התואמת OpenAI בכתובת http://localhost:8000/v1

SGLang — פיצול על פני 8 GPUs (ברירת מחדל לפורט 30000):

python -m sglang.launch_server \
  --model-path thinkingmachines/Inkling \
  --tp 8 --port 30000

Hugging Face transformers — טעינה באמצעות המחלקה האוטומטית הרב-מודאלית:

from transformers import AutoModelForMultimodalLM, AutoProcessor

model = AutoModelForMultimodalLM.from_pretrained("thinkingmachines/Inkling")
processor = AutoProcessor.from_pretrained("thinkingmachines/Inkling")
# העבר reasoning_effort באחת מהאפשרויות: {none, minimal, low, medium, high, xhigh, max}

מכיוון שהתחנה הסופית תואמת ל-OpenAI, העברת אפליקציה קיימת היא בדרך כלל עניין של הפניית ה-SDK שלך לכתובת ה-URL הבסיסית החדשה והגדרת reasoning_effort לפי הטעם. רכיבי זמן ריצה נוספים בהשקה כוללים את TokenSpeed ו-Unsloth.

איפה להריץ: זמינות ספק ההסקה

אם אתה מעדיף לא לנהל GPUs, מספר שותפים מארחים את Inkling. אפשרויות “Run Inkling on X” בהשקה:

טינקר (מכונות חושבות). תפקיד: כיוונון עדין; הערות: אפשרויות הקשר של 64K ו-256K; 50% הנחת השקה לזמן מוגבל (בתשלום)

Together AI. תפקיד: אינפרנס מאוחסן; הערות: נקודות קצה תואמות OpenAI

Fireworks. תפקיד: הסקה מאוחסנת; הערות:

מודל. תפקיד: הסקה מאוחסנת / GPU ללא שרת; הערות:

Databricks. תפקיד: הסקה מתארחת; הערות: באמצעות Unity AI Gateway

Baseten. תפקיד: הסקה מתארחת; הערות:

מדדים: טענות הספק מול מדידה עצמאית

זה החלק החשוב ביותר בכל סקירה כנה של Inkling review 2026, כי המספרים מגיעים משני מקומות שונים מאוד.

גילוי נאות: למעט אינדקס Artificial Analysis, כל מדד Inkling להלן דיווח עצמי של הספק בעת ההשקה (Effort = 0.99, temperature 1.0) ובעל לא עבר ביקורת בלתי תלויה. מספרי המתחרים מקורם בצדדים שלישיים (MarkTechPost, Artificial Analysis) או הופעלו מחדש על ידי Thinking Machines, וכמוהם לא ביקורת בלתי תלויה כאן. חלק מהנתונים כוללים מפרט רתמה או תת‑קבוצה. התייחסו לכולם כאל כיווניים, לא כאוונגליון.

ציונים מדווחים עצמית של ספק

על פי חומרי ההשקה של Thinking Machines עצמם:

AIME 2026 (מתמטיקה): 97.1%

GPQA Diamond (הנמקה מדעית): 87.2%

SWE-bench Verified (קידוד, רתמת bash בלבד): 77.6%

SWE-bench Pro (Public): 54.3%

MMMU Pro (רב-מודאלי): 73.3%

VoiceBench (אודיו): 91.4%

MMAU (שמע): 77.2%

IFBench (ביצוע הוראות): 79.8%

Terminal Bench 2.1 (מסוף אייג'נטי): 63.8

FORTRESS Adversarial: 78.0%

SimpleQA מאומת: 43.9%

על הנייר אלה נראים חזקים, במיוחד נתוני ההיגיון במתמטיקה ובמדעים. אבל החברה אמדה את Inkling מול גרסאות מתחרות עתידיות קרובות (GPT 5.6 Sol, Claude Fable 5, Gemini 3.1 Pro, DeepSeek V4 Pro, Kimi K2.5/K2.6, GLM 5.2, Nemotron 3 Ultra) תוך שימוש בציונים שהיא עצמה יצרה. ייתכן שמספרי המתחרים הללו אינם תואמים לנתונים המדווחים על ידי היריבים עצמם, ולכן יש לקרוא השוואות ישירות בזהירות.

השוואה ישירה בין מודלים מרובים (מתחרים עם משקלים פתוחים)

ההשוואה הצמודה הברורה ביותר של Inkling מול מודלים פתוחי-משקל אחרים מגיעה מMarkTechPost’s comparison table (מובא להלן, בשיוך ל-MarkTechPost). היא שימושית דווקא משום שהיא מציבה את המתחרים במסגרת אחת:

HLE. Inkling: 29.7%; Nemotron 3 Ultra: 26.6%; Kimi K2.6: 35.9%; GLM 5.2: 40.1%; DeepSeek V4 Pro: 35.9%

AIME 2026. Inkling: 97.1%; Nemotron 3 Ultra: 94.2%; Kimi K2.6: 96.4%; GLM 5.2: 99.2%; DeepSeek V4 Pro: 96.7%

SWE-bench Verified. Inkling: 77.6%; Nemotron 3 Ultra: 70.7%; Kimi K2.6: 80.2%; GLM 5.2: 80.0%; DeepSeek V4 Pro: 80.6%

Terminal Bench 2.1. Inkling: 63.8%; Nemotron 3 Ultra: 56.4%; Kimi K2.6: 71.3%; GLM 5.2: 82.7%; DeepSeek V4 Pro: 64%

FORTRESS (עוינת). Inkling: 78.0%; Nemotron 3 Ultra: 77.6%; Kimi K2.6: 65.6%; GLM 5.2: 71.3%; DeepSeek V4 Pro: 36.0%

MarkTechPost. לא עבר ביקורת עצמאית.

הדפוס ברור ועקבי עם הצניעות של Thinking Machines. Inkling מוביל ב-FORTRESS (בטיחות אדוורסרית) ומנצח את Nemotron 3 Ultra בכל התחומים, אבל הוא מפגר אחרי GLM 5.2, Kimi K2.6 ו-DeepSeek V4 Pro ב-HLE, SWE-bench Verified, ובמיוחד Terminal Bench 2.1 (63.8% לעומת 82.7% של GLM 5.2). אם קידוד אייג'נטי ומשימות טרמינל הם בראש סדר העדיפויות שלך, המודלים הפתוחים המובילים מסין נמצאים בחזית כיום.

מדידה עצמאית (Artificial Analysis)

לקריאה ניטרלית יותר, Artificial Analysis העריך את Inkling בתאריך 2026-07-15 ומיקם אותו ב-41/100 במדד האינטליגנציה שלו, מדורג #10 מתוך 97 מודלים. שתי נקודות על איך לקרוא את הדירוג הזה בצורה הוגנת:

זוהי תצוגה חזקה של מודל פתוח, לא #1 כולל. לפי Artificial Analysis, האינדקס של Inkling שעומד על 41 נמצא לפני Nemotron 3 Ultra (38), Gemma 4 31B (29), ו-gpt-oss-120b (24) — כך שבין עמיתי משקלים פתוחים היא תחרותית עד מובילה. אבל מקום 10 מתוך 97 אומר שתשעה מודלים מדורגים גבוה יותר בסך הכל, בהתאם למסגור "מסוגל, לא חלוצי".

היעילות היא המקום שבו הוא בולט.Artificial Analysis מציין יעילות אסימונים גבוהה — כ-25K אסימונים להשלמת סט ההערכה שלו לעומת 37–43K למודלים להשוואה — ו-GDPval-AA v2 Elo של 1238, לפני Kimi (1190) ו-DeepSeek V4 Flash (1189), בתוספת יתרון קטן (+2) על AA-Omniscience.

מהירות הפלט נמדדה ב-72.7 אסימונים לשנייה עם זמן לאסימון ראשון של 1.75 שניות. בקיצור: מיקום מכובד בעשירייה הראשונה, ויעיל באמת – אבל אנחנו נמנעים במכוון מהגזמה בתיאורו כניצחון בטבלת המובילים.

יכולות רב-מודאליות והקשר ארוך

Inkling מקבל טקסט (UTF-8), תמונות (40px עד 4096px באמצעות מקודד טלאים היררכי), ואודיו (WAV ב‑16kHz, עד כ‑20 דקות, באמצעות קידוד אסימונים בדידים). הפלט הוא טקסט בלבד — אין יצירת תמונות או אודיו, אז תכננו למודל הבנה, לא מודל יצירה. וידאו שימש במהלך האימון המקדים אך הוא לא קלט נתמך או מוערך בהשקה, אז אל תתכננו סביבו עדיין.

היכולת המרכזית היא חלון הקשר של 1-מיליון טוקנים במשקולות ששוחררו, מה שפותח את הדלת לניתוח קוד של מאגר שלם, סינתזה של מסמכים ארוכים, והפעלות סוכן מרובות-סיבובים מורחבות ללא חלוקה אגרסיבית. שימו לב לניואנס המעשי: APIs מתארחים חושפים עד 256K טוקנים, כך שה-1M המלא הוא תכונה לאחסון עצמי כיום. בשילוב עם עיצוב הקשב של חלון הזזה ופענוח ספקולטיבי, סיפור ההקשר הארוך נותר אחד מנקודות המכירה המעשיות ביותר של Inkling.

תמחור, דרגות ועלות בעלות כוללת

Inkling הוא פתוח באמת. משקלים מלאים (BF16 checkpoint ו-NVFP4 checkpoint) נמצאים בHugging Face תחת Apache 2.0, לכן אירוח עצמי הוא ללא תמלוגים — אתה משלם רק על חישוב. Thinking Machines אינה מנטת את המודל עצמו; ההכנסות זורמות דרך Tinker ומארחים צד שלישי.

תמחור לפי אסימון מתארח (לפי Artificial Analysis), לפי שכבת הקשר:

64K. קלט / 1M: $1.87; קלט במטמון / 1M: $0.374; פלט / 1M: $4.68

256K. קלט / 1M: $3.74; קלט במטמון / 1M: $0.748; פלט / 1M: $9.36

משקף הנחת השקה מוגבלת בזמן של 50%; המספרים המדויקים של Tinker לכל אסימון נמצאים בתיעוד וישתנו.

אחסון עצמי לעומת API — איך לחשוב על TCO. הכלכלה תלויה בנפח ובניצול:

API (Tinker / שותפים): עלות קבועה אפס, תשלום לפי טוקן, התחלה כמעט מיידית. הכי טוב בנפח נמוך או ספייקי, או בזמן פיתוח אב-טיפוס.

אירוח עצמי (שרתים מושכרים או בבעלות): אתה משלם עבור צומת עם 4–8 GPUs בין אם הוא עמוס ובין אם לא, אך העלות השולית לאסימון מתקרבת לעלות החשמל הגולמית. מכיוון ש-Inkling מפעילה רק 41B פרמטרים והיא יעילה באסימונים (~25K לעומת 37–43K לפי מערכת Artificial Analysis), התפוקה לשעת GPU טובה, ועבודות כבדות ויציבות יכולות להגיע לעלות נמוכה משמעותית מתמחור לאסימון של API ברגע שהצומת מנוצל היטב. פרשנות סביב ההשקה הציגה אירוח עצמי של משקלים פתוחים כזול בכ-40–60% לעומת שימוש ב-API סגורים דומים בקנה מידה — טענה כיוונית, לא נתון מבוקר.

הערת עורך — הוסף איור: תרשים איזון — נפח אסימונים חודשי (x) לעומת עלות כוללת (y) עם שלושה קווים: closed frontier API, Inkling hosted API, ו-Inkling self-hosted על צומת GPU שכור — המציג את נקודת החצייה שבה אחסון עצמי מנצח.

בטיחות, יישור וצנזורה

בטיחות היא אחד מהסיפורים החזקים והמובחנים יותר של Inkling. על ה- FORTRESS adversarial מדד היא משיגה 78.0% — ה-טוב ביותר מבין מודלים במשקל פתוח בהשוואה של MarkTechPost, לפני GLM 5.2 (71.3%), Kimi K2.6 (65.6%), והרבה לפני DeepSeek V4 Pro (36.0%). Thinking Machines גם מדגישים אי-ודאות מכוילת בתפוקות המודל.

הסיקור של VentureBeat הדגיש תכונה קשורה: התנגדות לצנזורה. בשילוב עם רישיון Apache 2.0 מתירני, זה מציב את Inkling כמודל פתוח שצוותים יכולים להתאים למדיניות שלהם במקום לרשת משטר תוכן אטום שהוטל על ידי הספק — שיקול משמעותי לפריסות מוסדרות או ספציפיות לאזור. כמו תמיד במודל ביום ההשקה, לא עלה דוח אבטחה בלתי תלוי של צוות אדום או צד שלישי במועד הכתיבה, לכן יש להתייחס ל-FORTRESS lead כמקור ספק/צד שלישי ולא כאישור חיצוני.

האם כדאי לך לבצע כוונון דק ב-Inkling?

כיוונון עדין הוא ללא ספק הסיבה לקיומה של Inkling. מסגרת החלטה מהירה:

כוונן (באמצעות Tinker או צינור עיבוד משלך) אם: יש לך נתונים קנייניים, תחום צר, או משימה שבה מודל קטן מיוחד מביס מודל כללי; אתה צריך להיות הבעלים של המשקולות; או שאתה רוצה להטמיע טון, פורמט או מדיניות ספציפיים. אפשרויות ההקשר של Tinker בגודל 64K/256K וההנחה בהשקה מורידים את המחסום.

פשוט השתמש במודל הבסיסי (אירוח עצמי או API) אם: המשימה שלך היא למטרות כלליות, הנפח שלך נמוך, או שעדיין לא אימתת שכיוונון עדין מזיז את המדד שלך. הנדסת הנחיה בתוספת חוגת reasoning_effort לעיתים קרובות מספיקה לך.

חפש במקום אחר:אם אתה צריך קידוד אוטונומי מתקדם היום (GLM 5.2 ו-Kimi K2.6 מובילים במדדים האלה) או שאתה דורש ערבויות איכות שנבדקו באופן עצמאי,

יתרונות וחסרונות

יתרונות

משקלים פתוחים לחלוטין תחת Apache 2.0, ללא תמלוגים לאירוח עצמי וחינמי לשימוש מסחרי.

MoE חסכוני ודליל (רק 41B פעילים) בתוספת יעילות טוקן חזקה שומרת על עלות ומהירות הסקה תחרותיים.

עצום הקשר של 1M-טוקנים במשקלים (256K דרך API).

רב-מודאליות אמיתית (טקסט, תמונה, אודיו קלט).

חוגה לשליטה במאמץ ההיסק (ללא → מקסימום) לפשרות בזמן אמת בין עלות לאיכות.

בטיחות אדוורסרית ברמה הגבוהה ביותר במשקל פתוח (FORTRESS 78.0%, per MarkTechPost) ו"התנגדות לצנזורה".

עמידה עצמאית חזקה — מקום 10 מתוך 97 במדד Artificial Analysis Index, לפני Nemotron 3 Ultra, Gemma 4 31B ו-gpt-oss-120b.

חסרונות

במפורש לא מודל חזיתי, בהודאת היצרן עצמו.

מפגר אחרי המתחרים המובילים בקוד פתוח (GLM 5.2, Kimi K2.6, DeepSeek V4 Pro) במבחני ביצועים סוכניים וקידוד (Terminal Bench 2.1, SWE-bench Verified, HLE).

רוב מדדי הביצועים מדווחים על ידי היצרן עצמו ואינם מבוקרים באופן עצמאי.

פלט טקסט בלבד; ללא יצירת תמונות/אודיו; ללא קלט וידאו בהשקה; Inkling-Small עדיין בתצוגה מקדימה.

שימוש "מקומי" אמיתי דורש צומת מרובה GPU (כ-600GB VRAM אפילו לאחר קוונטיזציה).

לא התגלתה ביקורת מהותית בלתי תלויה או סקירת בטיחות/צוות אדום בזמן ההשקה.

מי כדאי שישתמש ב‑Inkling?

Inkling הוא התאמה חזקה אם אתה מתרגל או צוות שרוצה לבעול ולהתאים אישית את המודל שלך ולא לשכור API סגור. מקרי שימוש אידיאליים כוללים:

צוותי כיוונון עדין בונים מודלים תחום־ספציפיים באמצעות Tinker או הצינור האישי שלהם.

פריסות רגישות לעלות ונפח גבוהשבהן אירוח עצמי ללא תמלוגים מנצח תמחור גבולי לפי אסימון

מטלות בעלות הקשר ארוך כגון סיוע בקוד ברמת המאגר, ניתוח מסמכים, וסשנים ארוכים של סוכן.

יישומים מולטימודליים הזקוקים להבנה משולבת של טקסט, תמונה ואודיו.

פריסות רגישות למדיניות שרוצות בסיס פתוח, בעל בטיחות חזקה ועמידות לצנזורה, כדי ליישר קו.

זהו התאמה גרועה אם אתה זקוק ליכולת החשיבה החזקה ביותר או ביצועי קידוד סוכניים, זקוק לקלט וידאו או פלט גנרטיבי, או דורש אמות מידה שנבדקו באופן עצמאי לפני הפריסה.

מסקנה ודירוג סופי

בואו נתייחס ישירות לפיל: Inkling אינו המודל החזק ביותר הזמין כיום, ו- Thinking Machines אומרת בדיוק את זה. בקריאה צינית, זהו רף נמוך. בקריאה הוגנת, זאת בדיוק הנקודה – Inkling מותאם למטרה שונה מאשר להיות בראש טבלת הדירוג. הוא יעיל (41B פעיל, תקציב משימה של ~25K טוקנים), ברישיון פתוח (Apache 2.0), בטוח לפי תקני משקלים פתוחים (FORTRESS 78%), ובנוי לכיוונון עדין ולאירוח עצמי. השילוב הזה הופך אותו לאחת ההשקות המחושבות יותר של מודלים פתוחים ב-2026, גם כשהוא מפגר אחרי GLM 5.2 ו- Kimi K2.6 במבחני המודיעין והקוד הקשים ביותר.

הכוכביות הנותרות הן בעיקר אמות מידה המדווחות על ידי המשתמשים עצמם, והיעדר כל ביקורת עצמאית בשלב כה מוקדם. אך עבור קהל היעד שלה — בונים שמעריכים בעלות, התאמה אישית, שליטה בעלויות וחלון הקשר עצום יותר מאשר זכויות התרברבות בחזית — Inkling מספקת את הסחורה.

דירוג: 4 מתוך 5עבור קהל היעד של בונים ומכווננים; נמוך יותר אם אתה רוכש אך ורק ליכולת חלוצית.

שאלות נפוצות

מה זה Inkling ומי יצר אותו? Inkling הוא המודל הראשון של Thinking Machines Lab, סטארט-אפ הבינה המלאכותית שבראשו עומדת מירה מוראטי (CTO לשעבר של OpenAI). הוא הושק ב-15 ביולי 2026 כמודל חשיבה פתוח-משקלי, רב-מודלי, מסוג Mixture-of-Experts.

האם אינקלינג הוא מודל הבינה המלאכותית הטוב ביותר?לא, והחברה לא טוענת שכן — היא קובעת שאינקלינג "אינו המודל החזק ביותר הזמין כיום, סגור או פתוח." מדידה עצמאית (Artificial Analysis) מדרגת אותו במקום ה-10 מתוך 97 בסך הכל, למרות שהוא מוביל על פני כמה מתחרים פתוחים.

כמה פרמטרים יש ל-Inkling, ומהו חלון ההקשר?סה"כ 975B עם 41B פעילים (sparse MoE), על פני 66 שכבות. חלון ההקשר הוא עד 1,000,000 טוקנים במשקולות ששוחררו, ועד 256K ב-APIs המאוחסנים.

האם Inkling הוא קוד פתוח, ומהו הרישיון? המשקלים משוחררים תחת Apache 2.0, המאפשר שימוש מסחרי ואירוח עצמי. מדובר ב'משקלים פתוחים' — כל המשקלים נמצאים ב-Hugging Face.

האם Inkling חינם לשימוש?המשקולות חינמיות וללא תמלוגים לאירוח עצמי. כיוונון עדין (Fine-tuning) על Tinker והסקה מאוחסנת דרך ספקים כמו Together AI, Fireworks, Modal, Databricks, או Baseten הם שירותים בתשלום. גישה מאוחסנת מתחילה בכ-$1.87 ל-1M טוקני קלט (הנחת השקה לזמן מוגבל).

איך אני מריץ או מוריד את Inkling, ואיזה חומרה אני צריך? הורד את המשקולות מ-Hugging Face ושרת אותם עם vLLM, SGLang, או Hugging Face transformers דרך API תואם ל-OpenAI. צפה לכ-2TB של VRAM מצטבר עבור BF16 (8× B300 / 16× H200) או כ-600GB עבור checkpoint NVFP4 המכומת (4× B300 / 8× H200). גרסאות GGUF של Unsloth מהקהילה מורידות את הרף לניסויים.

איך אני מכוון עדין את Inkling? השתמש ב- Thinking Machines’ Tinker פלטפורמה, המציעה אפשרויות הקשר של 64K ו-256K והנחה מוגבלת בזמן של 50% בהשקה, או כוון עדין את המשקולות הפתוחות בפייפליין שלך.

מהו מאמץ חשיבה בר-שליטה?הגדרת reasoning_effort (none / minimal / low / medium / high / xhigh / max) המחליפה השהייה ועלות אסימונים תמורת עומק חשיבה. מאמץ נמוך מתאים לסיווג ושליפה; מאמץ מקסימלי מתאים למתמטיקה קשה ותואם את תצורת הבנצ'מרק (Effort=0.99).

כיצד Inkling משתווה ל-Kimi, GLM, DeepSeek, ו-Nemotron? לפי ההשוואה של MarkTechPost, Inkling מובילה ב-FORTRESS (בטיחות) ומנצחת את Nemotron 3 Ultra באופן נרחב, אך מפגרת אחרי GLM 5.2, Kimi K2.6, ו-DeepSeek V4 Pro ב-Terminal Bench 2.1, SWE-bench Verified, ו-HLE. היא תחרותית אך לא המודל הפתוח החזק ביותר בקידוד אגנטי.

האם Inkling יכול לעבד תמונות, קול ווידאו? הוא מקבל טקסט, תמונות (40px–4096px), וקול (16kHz WAV, עד כ-20 דקות) כקלט. הפלט הוא טקסט בלבד — ללא יצירת תמונות או קול. וידאו שימש באימון מקדים אך אינו קלט נתמך בעת ההשקה.

האם ציוני המדדים של Inkling אמינים? התייחס אליהם בזהירות. מלבד מדד ה-Artificial Analysis Intelligence Index העצמאי, המספרים הראשיים מדווחים על ידי הספקים בהשקה ולא עברו ביקורת עצמאית. נתוני המתחרים מגיעים מגורמים שלישיים (MarkTechPost) או הורצו מחדש על ידי Thinking Machines וייתכן שאינם תואמים את המספרים המדווחים של היריבים.

מהו Inkling-Small, ומה בתוכנית העבודה? Inkling-Small הוא וריאנט קטן יותר (סה״כ 276B / 12B פעילים). בעת ההשקה הוא עדיין היה בתצוגה מקדימה, המשקלים טרם שוחררו. המודל הראשי כבר כולל שכבות MTP לפענוח ספקולטיבי.



השוואות במאמר הזה2

זוהה מתוך המאמר הזה · בנצ'מרקים: Artificial Analysis · מתעדכן יומית

© 2026 OrcaRouter

לספקים

מפעילים פלטפורמת הסקה (inference)? הציגו את המודלים שלכם ב-OrcaRouter.

צרו קשר

הצטרפו לקהילה שלנו

DiscordEmailXGitHubYouTube