
TwIL-LM3-Pro: מודל לוגיקה פורמלית בן 3.66B פרמטרים שמסופק לפי בקשת דוא״ל
- openaiחדשOpenAI: GPT-6.1 Sol2026-09-2952אינטליגנציה
- anthropicחדשAnthropic: Claude Sonnet 5.52026-09-2856אינטליגנציה
- typesafeחדשTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 לכל 1M טוקנים · 219 tok/s
- OpenAIחדשOpenAI: GPT-6 Luna2026-09-2238אינטליגנציה
- OpenAIחדשOpenAI: GPT-6 Sol2026-09-2248אינטליגנציה
- AnthropicחדשAnthropic: Claude Opus 5.52026-09-2258אינטליגנציה
- xAIחדשGrok 4.72026-09-2146אינטליגנציה
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 לכל 1M טוקנים · 118 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 לכל 1M טוקנים · 1064 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040אינטליגנציה
- OpenAIOpenAI: GPT-6 Astra2026-09-0453אינטליגנציה77כתיבת קוד
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241אינטליגנציה76כתיבת קוד
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245אינטליגנציה76כתיבת קוד
- AnthropicAnthropic: Claude Fable 5.12026-09-0153אינטליגנציה82כתיבת קוד
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 לכל 1M טוקנים · 47 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 לכל 1M טוקנים · 104 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642אינטליגנציה72כתיבת קוד
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 לכל 1M טוקנים · 213 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845אינטליגנציה75כתיבת קוד
- obsidianQwen3.8 27B2026-08-1534אינטליגנציה68כתיבת קוד
TwIL-LM3-Pro הוא מודל הסקה בעל 3.66 מיליארד פרמטרים מבית webAI, שנבנה במיוחד ללוגיקה פורמלית ולא לשיחה כללית, והוא נמצא ב-Hugging Face מאז 3 בספטמבר 2026. זה אינו מהדורה חדשה, והמסגור שמסתובב סביבו השבוע — ש-webAI "השיקה מודל של 3.66B" — מאחר בחודש אחרי המשקלים. מה שבאמת השתנה בימים האחרונים קטן יותר ושימושי יותר: הצ'קפוינט עודכן ב-30 בספטמבר, וב-1 באוקטובר webAI פרסמה בילד LiteRT-LM של המודל להסקה על-מכשיר ב-Android וב-iOS. אז השאלה המעניינת היא לא מהו TwIL-LM3-Pro, אלא אם אתם יכולים להשיג אותו, והתשובה תלויה באיזה משלושת ערוצי ההפצה אתם עומדים — מפני שאחד מהם הוא טופס.
ההבחנה הזו חשובה יותר מכפי שהיא בדרך כלל, כי TwIL-LM3-Pro הוא לא מוצר שאפשר פשוט לקרוא לו. זהו צ'קפוינט שאתה מוריד, מריץ על החומרה שלך, ומקבל את תנאי הרישיון שאוסר שימוש מסחרי. ההשוואה שכרטיס המודל של עצמו מזמין — מול Qwen3-8B, מודל עם יותר מפי שניים פרמטרים — היא אמיתית, אבל היא השוואה של מבחני ביצועים שהורצו על ידי הספק על גבי מערכת בדיקה שנבנתה על ידי הספק, וכרטיס המודל עצמו אומר זאת במקומות רבים יותר מהמקובל. המאמר הזה קורא את הכרטיס הזה בקפידה ומפריד בין מה ש-webAI מדד לבין מה שאחרים מדדו.
מהו המודל בעצם
` block before answering and was evaluated with greedy decoding at a 2,048-token budget." Need parse: "40 layers, hidden size ???" User says "hidden size 40, 40 attention against 8 key-value heads" Actually exact: "TwIL-LT-Pro is a dense Granite decoder — GraniteForCausalLM, 40 layers, hidden size 40, 40 attention against 8 key-value heads — IBM's granite-4.3-8b." Wait "hidden size 40" likely? Let's read: "hidden size 40, 40 attention against 8 key-value heads" maybe missing "heads"? It says "40 attention against 8 key-value heads". Hmm. Original: "TwIL-LT-Pro is a dense Granite decoder — GraniteForCausalLM, 40 layers, hidden size 40, 40 attention against 8 key-value heads — IBM's granite-4.3-8b." Actually user text: "TwIL-LT-Pro is a dense Granite decoder — GraniteForCausalLM, 40 layers, hidden size 40, 40 attention against 8 key-value heads — IBM's granite-4.3-8b." Wait actual: "hidden size 40, 40 attention against 8 key-value heads" maybe "hidden size 40" yes. But then "40 attention against 8 key-value heads" unusual. Could be "40 attention heads against 8 key-value heads". The given: "40 attention against 8 key-value heads" no "heads" after attention. We translate as written? We can maintain. "The 3.3B parameter count is the real total, 3,659,737,600" Wait 3.3B? 3,659,737,600 is ~3.66B. User says "3.3B parameter count is the real total, 3,659,737,600" Hmm exact: "The 3.3B parameter count is the real total, 3,659,737,600". Actually number 3.3B? Let's see: The text: "The 3.3B parameter count is the real total, 3,659,737,600" I see "3.3B" yes. Wait prompt says "The 3.3B parameter count is the real total, 3,659,737,600". But 3,659,737,600 = 3.66B. Maybe typo. We translate exactly: "ספירת הפרמטרים 3.3B היא הסך הכולל האמיתי, 3,659,737,600". Keep 3.3B? It includes B. Usually in Hebrew keep "3.3B" or "3.3 מיליארד"? Since brand/technical maybe keep exactly. But translation can use Hebrew "3.3B" unchanged. Same for 131,072 tokens. "2,048-token budget" translate "תקציב של 2,048 טוקנים". "context window" = חלון ההקשר. "carried through unchanged" = מועבר כפי שהוא / ללא שינוי. "greedy decoding" = פענוח חמדני? In ML Hebrew often "פענוח חמדני" or "דיקוד חמדני". Use "פענוח חמדני". "evaluated" = הוערך. "emits a <think>…</think> block before answering" = פולט בלוק <think>…</think> לפני שהוא עונה. Keep <think> tags exactly? The instruction: "Output the translated text with markers — no quotes." Tags are not markers but likely keep as-is. We should keep <think>…</think> exactly. The ellipsis … maybe keep. "TwIL-LT-Pro" brand/product? Keep exact. "dense Granite decoder" = מפענח Granite צפוף? Maybe "מודל Granite צפוף מסוג decoder". "GraniteForCausalLM" keep. "IBM's granite-4.3-8b" keep IBM and granite-4.3-8b. Add "של IBM"? "granite-4.3-8b של IBM". Actually "IBM's granite-4.3-8b" -> "granite-4.3-8b של IBM". Keep product. "40 layers" = 40 שכבות. "hidden size 40" = גודל מוסתר 40? In neural nets "hidden size" = גודל שכבת חבויה? Usually "hidden size" = "גודל חבוי" or "ממד חבוי". Use "גודל חבוי 40". "40 attention against 8 key-value heads" = 40 קשב מול 8 ראשי key-value? In Hebrew "40 קשב כנגד 8 ראשי key-value". Maybe "40 ראשי קשב מול 8 ראשי key-value". But original missing "heads" after attention; however "attention heads" is likely intended. But translation should reflect source. It says "40 attention against 8 key-value heads". Could translate "40 קשב מול 8 ראשי key-value". But sounds odd. Maybe "40 attention heads against 8 key-value heads" was intended but omitted "heads". We can translate literally: "40 קשב מול 8 ראשי key-value". Hmm. Let's parse source exactly: "TwIL-LT-Pro is a dense Granite decoder — GraniteForCausalLM, 40 layers, hidden size 40, 40 attention against 8 key-value heads — IBM's granite-4.3-8b. The 3.3B parameter count is the real total, 3,659,737,600, and the context window is the base model's 131,072 tokens carried through unchanged. It emits a `<think>…</think>` block before answering and was evaluated with greedy decoding at a 2,048-token budget." Need maybe "hidden size 40" actually "hidden size 40, 40 attention against 8 key-value heads" maybe "hidden size 40, 40 attention against 8 key-value heads" No hidden size likely 4096? But given 40? It's not our job. Hebrew translation: "TwIL-LT-Pro הוא מפענח Granite צפוף — GraniteForCausalLM, 40 שכבות, גודל חבוי 40, 40 קשב מול 8 ראשי key-value — granite-4.3-8b של IBM. ספירת הפרמטרים 3.3B היא הסך הכולל האמיתי, 3,659,737,600, וחלון ההקשר הוא 131,072 הטוקנים של מודל הבסיס, המועברים ללא שינוי. הוא פולט בלוק <think>…</think> לפני המענה והוערך בפענוח חמדני בתקציב של 2,048 טוקנים." Check "base model's 131,072 tokens" -> "131,072 הטוקנים של מודל הבסיס" yes. "carried through unchanged" -> "המועברים ללא שינוי" or "כפי שהם". Good. "hidden size" -> "גודל חבוי" maybe "ממד חבוי". "hidden size" in Hebrew ML often "גודל שכבה חבויה" or "מימד חבוי". Use "גודל חבוי". "attention" -> "קשב" but "40 attention against 8 key-value heads" maybe "40 קשב מול 8 ראשי key-value". Maybe "קשב" singular collective. Could be "40 קשב כנגד 8 ראשי key-value". Better "40 קשב לעומת 8 ראשי key-value"? Hmm. "against" in model config means "עם"? "40 attention heads against 8 key-value heads" = "40 ראשי קשב מול 8 ראשי key-value". But source lacks "heads" after attention, but maybe translate "40 קשב מול 8 ראשי key-value" sounds incomplete. Could be "40 קשב כנגד 8 ראשי key-value". I'll use "40 קשב לעומת 8 ראשי key-value"? "לעומת" means compared to. "against" maybe "מול". Use "מול". "dense Granite decoder" = "מודל פענוח Granite צפוף"? A decoder in transformers is "מפענח" or "פענח". Models: "מודל מסוג decoder". "dense" = "צפוף". I'd write "מפענח Granite צפוף" but maybe better "מודל Granite צפוף מסוג decoder". But product says "dense Granite decoder". Hebrew: "הוא מפענח Granite צפוף". I think "מפענח" is fine. "GraniteForCausalLM" keep. "IBM's granite-4.3-8b" -> "granite-4.3-8b של IBM". Keep. "evaluated with greedy decoding" -> "הוערך באמצעות פענוח חמדני". Good. "emits a `<think>…</think>` block before answering" -> "הוא פולט בלוק `<think>…</think>` לפני שהוא עונה" But the backticks around <think>? Source has backticks: "a `<think>…</think>` block". Should we keep backticks? It is markup maybe. The instruction says "Any text inside a {{K}}...{{/K}} must be reproduced EXACTLY". Not relevant. We can keep tags in backticks? Hebrew: "בלוק `<think>…</think>`" or without backticks? To be safe, keep backticks as in source. The instruction says Output the translated text with markers — no quotes. Backticks are not quotes? It might be code formatting. Should we preserve? Maybe yes, keep exactly `<think>…</think>` with backticks. Hebrew: "בלוק `<think>…</think>`". Fine. Need no extra explanation. Final only translation. Potential issue: "3.3B parameter count" maybe 3.6B? User wrote "3.3B". Translate exactly "3.3B". Maybe convert to "3.3 מיליארד"? But brand/technical? I'd keep "3.3B" since exact. But in Hebrew, "ספירת הפרמטרים 3.3B" is okay. Could write "ספירת הפרמטרים של 3.3B היא הסך הכולל האמיתי". Better: "ספירת הפרמטרים של 3.3B היא הסכום הכולל האמיתי". "parameter count" = "מספר הפרמטרים". "The 3.3B parameter count" = "מספר הפרמטרים 3.3B". "is the real total" = "הוא הסך הכולל האמיתי". Good. "real total" -> "הסכום הכולל האמיתי" or "הסך הכולל האמיתי". Use "הסך הכולל האמיתי". "and the context window is the base model's 131,072 tokens carried through unchanged." -> "וחלון ההקשר הוא 131,072 הטוקנים של מודל הבסיס, כפי שהם ללא שינוי." Or "מועבר ללא שינוי". I'll write "וחלון ההקשר הוא 131,072 הטוקנים של מודל הבסיס כפי שהם." But "carried through unchanged" means unchanged. "מועברים ללא שינוי" good. "131,072 tokens" in Hebrew number then noun: "131,072 טוקנים". But "the base model's 131,072 tokens" -> "131,072 הטוקנים של מודל הבסיס" is okay colloquially. More formal: "131,072 הטוקנים של מודל הבסיס". Yes. "at a 2,048-token budget" -> "בתקציב של 2,048 טוקנים". Good. Need maybe use "טוקנים" or "אסימונים"? In Hebrew ML, token = טוקן/אסימון. Common "טוקנים". Use טוקנים. "greedy decoding" = "פענוח חמדני" perhaps "דיקוד חמדני". I'll use "פענוח חמדני". "decoder" also "מפענח" same root. Maybe "דיקוד חמדני" avoids confusion. In Hebrew NLP, "greedy decoding" = "פענוח חמדני" commonly. Fine. "emits" = "פולט". "before answering" = "לפני המענה" or "לפני שהוא עונה". Use "לפני שהוא עונה". "evaluated" = "הוערך". Good. Let's assemble: "TwIL-LT-Pro הוא מפענח Granite צפוף — GraniteForCausalLM, 40 שכבות, גודל חבוי 40, 40 קשב מול 8 ראשי key-value — granite-4.3-8b של IBM. מספר הפרמטרים 3.3B הוא הסך הכולל האמיתי, 3,659,737,600, וחלון ההקשר הוא 131,072 הטוקנים של מודל הבסיס, מועברים ללא שינוי. הוא פולט בלוק `<think>…</think>` לפני שהוא עונה, והוערך בפענוח חמדני בתקציב של 2,048 טוקנים." Should "40 attention" maybe "40 קשב" sounds odd. Could be "40 קשב" but maybe "40 ראשי קשב"? If source omitted "heads", but "attention" in transformer config is "attention heads" often. The phrase "40 attention against 8 key-value heads" maybe if translated "40 קשב מול 8 ראשי key-value" readers may infer. But Hebrew would be odd. Could write "40 קשב מול 8 ראשי key-value" okay. Maybe better: "40 קשב כנגד 8 ראשי key-value". "against" = "כנגד" or "מול". "מול" is natural. "hidden size 40" maybe if hidden size = 40? Then "גודל חבוי 40". Good. "dense Granite decoder" maybe "מודל Granite צפוף מסוג decoder". This is clearer. But source: "is a dense Granite decoder". Hebrew: "הוא פענח Granite צפוף". "מפענח" as noun. I'll use "מפענח Granite צפוף". "TwIL-LT-Pro" maybe product, keep. Do we need markers? None. Final no quotes. Let's final. TwIL-LT-Pro הוא מפענח Granite צפוף — GraniteForCausalLM, 40 שכבות, גודל חבוי 40, 40 קשב מול 8 ראשי key-value — granite-4.3-8b של IBM. מספר הפרמטרים 3.3B הוא הסך הכולל האמיתי, 3,659,737,600, וחלון ההקשר הוא 131,072 הטוקנים של מודל הבסיס, מועברים ללא שינוי. הוא פולט בלוק `<think>…</think>` לפני שהוא עונה, והוערך בפענוח חמדני בתקציב של 2,048 טוקנים.
מערך האימון שאחרי האימון הוא החלק ש-webAI בעצם רוצה שתסתכלו עליו, והוא מתועד היטב באופן יוצא דופן עבור מודל בגודל הזה: כיוונון עדין מפוקח ב-LoRA בדרגה 64 על קורפוס סינתטי של לוגיקה פורמלית, זיקוק רב-נתיבי כדי לייצר כמה עקבות נימוק לכל פרומפט, מיזוג צ'קפוינטים במרחב הפרמטרים במקום לקחת את הצ'קפוינט הסופי, אינטרפולציית WiSE-FT ב-α = 0.15 שמוזגה בחזרה לעבר הבסיס המאומן מראש עם TIES ו-DARE-SLERP, ולבסוף שלב GRPO משוקלל באנטרופיה — webAI מכנה אותו MGPO — מול מאמת תוכנתי, שרץ עד שלב 2580, שהוא הצ'קפוינט שהופץ.
הארטיפקט שפורסם הוא המדיניות הממוזגת ולא מתאם LoRA, וזה הפרט המעשי: אפשר להריץ אותו כמודל עצמאי, ב-bf16 בנפח 6.82 GiB, או כ-Q4_K_M GGUF בנפח 2.09 GiB על CPU או 4 GB של VRAM. זו הטענה של "רץ על לפטופ", והיא הטענה היחידה בכל הכרטיס שאפשר לאמת בקלות ולכן ראויה לאמון.
השוואת Qwen3-8B, קראו בעיון
הכותרת הראשית ש-webAI שמה על המודל היא ש-TwIL-LM3-Pro מגיע לראש שורות הסיכום של ה-Track A של עצמו ב-3.66B פרמטרים. ארבע שורות הסיכום הן שער מאקרו של 0.5539, strict-7 של 0.2879, ממוצע של שישה מסלולים של 0.5389, ו-macro_primary של 0.5875. מול Qwen3-8B, שער המאקרו הוא 0.5539 לעומת 0.5336 — וכרטיס המודל עצמו כותב את המשפט שדף שיווקי היה מוחק: "היתרון בשער מול Qwen3-8B הוא 0.020 — קטן מרעש הדגימה ב-n = 200 לכל מסלול — אז יש לקרוא את זה כשוויון, לא כניצחון."
זו השורה החשובה ביותר בעמוד. האופן שבו webAI עצמה מנסחת את תוצאת הכותרת הוא שזה תיקו. במקום שבו ההשוואה אינה תיקו:
• Strict-7 — TwIL-LM3-Pro 0.2879 לעומת Qwen3-8B 0.2093, והשורה הזו אינה משתמשת בשום זיכוי בגין התאמה רופפת בשום מקום, כך שהיא לא יכולה להיווצר בגלל מזל בפורמט.
• MCQ קפדני — TwIL-LM3-Pro 0.4100 לעומת Qwen3-8B 0.0000, הפער הרחב ביותר במסלול מבין אחת עשרה השורות שדווחו.
• הסקת כללים — TwIL-LM3-Pro 0.4195 לעומת Qwen3-8B 0.3680.
• התאמת קורפוס — הפרפלקסיה הנמוכה ביותר של `lm_corpus` מבין כל זרוע, ב-2.3130, כאשר Qwen3-8B ב-2.5478.
• פרמטרים — 3.66B לעומת כ-8B, שזהו הבסיס כולו לטענה בדבר "פחות ממחצית הפרמטרים".
שתי הסתייגויות תלויות בטבלה הזו ו-webAI מציין את שתיהן. הדורות של Track A מ-TwIL-LM3-Pro הם בממוצע 1,902 טוקנים ו-24.2% מהם מגיעים למגבלת האורך, לעומת 564 טוקנים אצל קודמו TwIL-LM3; הניסוח של הכרטיס לגבי הפער שנוצר הוא "אינדיקטיבי ולא מדויק." ונתוני התפוקה בטבלה נמדדו בסשן מאוחר יותר על vLLM חדש יותר (0.19.1) מאשר עמודות ההשוואה (0.11.2), כך ששורות הטוקנים-לשנייה ניתנות להשוואה זו עם זו, ורק בקירוב עם השאר.
היכן שזה לא מנצח
במערך המוחזק, כרטיס הדגם חד משמעי: "TwIL-LM3-Pro לא מוביל בו." המאקרו של 10 מערכי נתונים הוא 0.7901, סטטיסטית זהה למודל הבסיס של עצמו ב-0.7942, ומפגר משמעותית אחרי Qwen3-8B ב-0.8493 ו-gpt-oss-120b ב-0.8689. המאקרו של 14 מערכי נתונים שלו, 0.7425, מנצח את הבסיס שלו ב-0.0093, וכל הרווח הזה מגיע מ-BBH-logic (0.9540 לעומת 0.9013 של הבסיס) — הסר את השורה האחת הזו והמודל מגיע לממוצע של 0.7263 על פני שלוש עשרה הנותרות, מתחת ל-0.7350 של VibeThinker-3B.
ישנן שלוש נקודות תורפה אמיתיות בתוך ההתמחות, וכולן נחשפו: התאמה מדויקת של תרגום FOL ב-0.0100, `procedural` ב-0.1200 במצב מחמיר, והתאמה מדויקת של ניתוח סמנטי ב-0.0000. אינדוקציה של כללים מנתחת רק 56.5% מהפלטים שלה. והמודל מפורט מעצם בנייתו — כ-792 אסימונים לכל תשובת Track B לעומת 482 עבור קודמו — וזה עלות, לא יכולת.
אין בזה שום ביקורת על השחרור. כך נראה כרטיס מודל כתוב היטב, וזו הסיבה שאפשר בכלל לצטט את המספרים כאן.
שלוש דרכים להשיג את זה, ואחת מהן היא טופס
מצב ההפצה הוא הבשורה האמיתית של השבוע, וראוי לנסח אותו במדויק.
המשקולות נמצאות ב-Hugging Face, ללא הגבלת גישה, תחת webAI Non-Commercial License ver. 1.0 — שמתיר מחקר ושימוש אישי ומחייב הסכם נפרד עם webAI עבור פריסה מניבת הכנסות. הרישיון הזה הוא האילוץ המחייב של כל השחרור, והוא הסיבה לכך ש-TwIL-LM3-Pro אינו מודל שרוב צוותי המוצר יכולים פשוט לאמץ.
webAI אומרת שהמשפחה עברה חצי מיליון הורדות בחודש, נתון שהחברה פרסמה בהודעה שלה ושאינו עבר ביקורת בלתי תלויה. הורדות של צ׳קפוינט חינמי לא-מסחרי אינן מדד עקיף לשימוש בפרודקשן, ו-webAI אינה מציגה אותן ככאלה.
הפלטפורמה של הספק עצמו, לעומת זאת, אינה נקודת קצה ציבורית. webAI מתארת את עצמה כפלטפורמה ארגונית שמביאה AI לנתונים שלך, עם יישום מודל מקומי תחילה, והמסלול המסחרי שלה הוא הסדר ארגוני ולא מחירון מפורסם לפי טוקן. TwIL-LM3-Pro גם נעדר מהפלטפורמות הגדולות להסקה של צדדים שלישיים שמאנדקסות צ'קפוינטים פתוחים — בדקנו, והוא גם אינו בקטלוג של OrcaRouter — כך שהתשובה המעשית לשאלה "מאיפה אני קורא לזה מ-API" היא שכרגע, ברוב המקרים, אתה פשוט לא; אתה מוריד אותו.
הערוץ השלישי הוא החדש. המאגר `TwIL-LM3-Pro-LiteRT-LM` הופיע ב-1 באוקטובר 2026, כשהוא נושא ארטיפקטים של `.litertlm` ומתויג עבור Android ו-iOS — האריזה של webAI עצמה של זמן הריצה LiteRT-LM של אותם משקלים. האם הבנייה הזו יורשת את הרישיון הלא-מסחרי היא השאלה שיש להשיב עליה לפני שמתכננים סביבה, משום שמאגר האב כן יורש אותו.
למה שווה לעקוב אחרי מומחה ללוגיקה פורמלית בגודל הזה
הסיבה שהמהדורה הזו ממשיכה לצוף מחדש אינה טבלת הבנצ'מרקים. הסיבה היא ש-webAI פרסמה את כל ה-pipeline, הריצה את המתכון הזהה על חמישה מודלי בסיס שונים, ודיווחה מה קרה. טבלת השוואת המשפחות מתעדת תנועה של macro-gate ב-Track A של +0.012 עד +0.145 בהתאם למודל הבסיס, בעוד שמערך ה-held-out נשאר בתוך ±0.013 — הגרסה של "זה מכליל" במונחי שרשרת התיעוד. המקדם היחיד שנבחר לכל מודל הוא משקל המיזוג, שנסרק על ביצועי held-out: 0.15 עבור SmolLM3, 0.20 עבור Granite ובסיס TwIL, ו-0.50 עבור VibeThinker-3B.
זהו מתכון לשימוש חוזר להפיכת מודל כללי קטן למומחה צר בלי להרוס את מה שכבר ידע, שפורסם עם התוצאות השליליות המצורפות. עבור כל מי שזקוק לתוויות היסק, לפורמליזציה של הצהרות ב-Lean או לניתוחים סמנטיים במקום לפרוזה שוטפת, GGUF בנפח 2.09 GiB שפועל באופן לא מקוון ללא תשלום לפי קריאה וללא תלות ברשת הוא הצעה שונה מזו של כל מודל מתארח, ולא משנה מה אומרת טבלת ה-Elo.
השאלה הפתוחה היא אם המשקלים יופיעו אי פעם תחת רישיון המתיר שימוש מסחרי, ואם הפורט של LiteRT-LM יגיע עם אותה הגבלה. עד אז, TwIL-LM3-Pro הוא ארטיפקט מחקרי עם כרטיס מודל כנה באופן יוצא דופן — וזה לא כלום.

אם אתה זקוק ליכולת הזו בפרודקשן היום
בפריסה מסחרית, דווקא הרישיון ולא מדדי הביצועים הוא המכשול, והתחליף המעשי הוא מודל מתארח שאפשר לנתב אליו. זו השכבה שבה פועל OrcaRouter: נקודת קצה אחת תואמת OpenAI שלפניה יותר מ-200 מודלים במחיר המחירון של הספק, בלי תוספת רווח, כך שהורדת מחיר מצד ספק נכנסת לתוקף באותו יום ולא אחרי מחזור חוזה. עבור קומץ המקומות שבהם צ'ק-פוינט קטן של לוגיקה פורמלית באמת מתאים — תיוג אצווה במצב לא מקוון, מעבר גזירה בסביבה מבודדת, שלב עיבוד מקדים שפלטו הוא תווית ולא טקסט חופשי — החלוקה הכנה היא להריץ את המודל המקומי במקום שבו עומס העבודה הוא טקסט-לתווית, ולנתב את החשיבה הסובבת, הרחבת הפרומפט ובקרת האיכות למודלים מתארחים באותו מפתח.
הסתייגות אחת ששווה לחזור עליה דווקא בסעיף הזה: עם מעבר אוטומטי לשרת גיבוי, תוכל גם להצביע על מודל לפני שאתה סומך עליו בנתיב ייצור, ולחזור אחורה על ידי עריכת כלל ניתוב במקום פריסה מחדש. זו התבנית שמתאימה למודל כזה כאשר מצבו המסחרי טרם הוכרע.

מה לצפות
שלושה דברים היו משנים את הסיפור הזה. שינוי רישיון, או פורט מוסמך בבירור של LiteRT-LM, יעביר את TwIL-LM3-Pro מיצירת מחקר לרכיב שניתן לפרוס. הופעה בפלטפורמת הסקה מתארחת גדולה תעניק לו API אמיתי. והערכה בלתי תלויה — כל גורם שאינו webAI שיריץ את תשתית הבדיקה של Track A — תגיד לנו אם היתרון של strict-7 על פני Qwen3-8B שורד כשמודד אותו מי שלא בנה את התשתית. אף אחד מהשלושה עוד לא קרה, וכרטיס המודל כן מספיק כדי שתוכל לראות בדיוק מה יצטרך להתקיים כדי שהם יהיו משמעותיים.

