
Claude Haiku 5.5 מול Nemotron 3.5 Lightning 30B A3B Base: הזול לא יכול לענות על שאלה
- openaiחדשOpenAI: GPT-6.1 Sol2026-09-2952אינטליגנציה
- anthropicחדשAnthropic: Claude Sonnet 5.52026-09-2856אינטליגנציה
- typesafeTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 לכל 1M טוקנים · 128 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238אינטליגנציה
- OpenAIOpenAI: GPT-6 Sol2026-09-2248אינטליגנציה
- AnthropicAnthropic: Claude Opus 5.52026-09-2258אינטליגנציה
- xAIGrok 4.72026-09-2146אינטליגנציה
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 לכל 1M טוקנים · 56 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 לכל 1M טוקנים · 320 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040אינטליגנציה
- OpenAIOpenAI: GPT-6 Astra2026-09-0453אינטליגנציה77כתיבת קוד
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241אינטליגנציה76כתיבת קוד
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245אינטליגנציה76כתיבת קוד
- AnthropicAnthropic: Claude Fable 5.12026-09-0153אינטליגנציה82כתיבת קוד
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 לכל 1M טוקנים · 54 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 לכל 1M טוקנים · 347 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642אינטליגנציה72כתיבת קוד
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 לכל 1M טוקנים · 230 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845אינטליגנציה75כתיבת קוד
- obsidianQwen3.8 27B2026-08-1534אינטליגנציה68כתיבת קוד
בשני המספרים שגיליון הרכש הכי מתעניין בהם, המודל הזול והמהיר יותר מנצח. Nemotron 3.5 Lightning 30B A3B Base פועל בקצב של 298.9 טוקני פלט לשנייה, המהיר מבין 142 מודלים שנעקבו באופן בלתי תלוי, ועולה 0.06 דולר למיליון טוקני קלט לעומת 0.10 דולר של Claude Haiku 5.5. הוא גם, כפי שהמילה "Base" בשמו מזהירה אותך, אינו עוזר. זהו צ'ק-פוינט מאומן מראש — בלי כיוונון עדין בפיקוח, בלי למידת חיזוק, בלי תבנית צ'אט שראויה לשמה — שפורסם תחת רישיון OpenMDW-1.1 ב-11 באוגוסט 2026 כדי שאנשים אחרים יוכלו לבנות עליו. Claude Haiku 5.5, שיצא ב-7 באוקטובר 2026, הוא מוצר מוגמר שאפשר לשלוח לו שאלה. השוואה ביניהם לפי מחיר היא כמו השוואת מחיר הקמח למחיר הלחם, והחלק המעניין בהתמודדות הזו הוא להבין איזה מהם נדרש בפועל לעומס העבודה שלך.
אף אחד בסיקור ההשקה לא אומר את החלק הזה בבירור, כי "זול יותר ומהיר יותר מ-Claude Haiku 5.5" הוא כותרת טובה יותר מ"זול יותר, מהיר יותר, ולא שמיש בלי הרצת כיוונון עדין". שתי הקביעות נכונות. רק אחת מהן שימושית.
מה כל מודל הוא בפועל
Claude Haiku 5.5 — Anthropic, מזהה claude-haiku-5-5, שוחרר ב-7 באוקטובר 2026. טקסט ותמונה נכנסים, טקסט יוצא. הקשר של 1M טוקנים, פלט מקסימלי של 128,000 טוקנים (300,000 מאחורי כותרת בטא ב-Batch API), חיתוך אימון ביוני 2026, פרישה לא לפני 7 באוקטובר 2027. מאמץ מתכוונן ברמות Low, Medium, High, Xhigh ו-Max, כשברירת המחדל היא Medium, עם חשיבה אדפטיבית פעילה כברירת מחדל. API במדידה, קריאות מטמון ב-$0.01 למיליון, Batch בחצי תעריף. זמין דרך ה-API של Anthropic, ומשם, בכל מקום שבו דגמי Anthropic נמכרים מחדש.
Nemotron 3.5 Lightning 30B A3B Base — NVIDIA, הוכרז ב-11 באוגוסט 2026. צ'קפוינט היברידי מסוג mixture-of-experts עם 30 מיליארד פרמטרים וכ-3 מיליארד פרמטרים פעילים לכל טוקן, הבנוי על מחסנית של Mamba-2 בתוספת MoE וקשב, מזוקק מ-Nemotron 3 Ultra, ומגיע עם פענוח ספקולטיבי MTP, DFlash ו-DSpark. ההקשר מגיע עד מיליון טוקנים, אם כי כ-256,000 הוא התקרה המעשית על H100 בודד. הוא מיועד לטקסט בלבד. המשקולות פתוחות תחת OpenMDW-1.1. וזהו צ'קפוינט בסיסי: משקולות מאומנות מראש גולמיות ללא כיוונון הוראות, כלומר הוא משלים טקסט במקום לבצע הוראות.

• המידות, כל אחת בשורה אחת
• מחיר קלט — Claude Haiku 5.5 $0.10 למיליון עד 100K טוקנים, ואחר כך $0.50; Nemotron 3.5 Lightning 30B A3B Base $0.06 למיליון.
• מחיר פלט — $0.50 למיליון עד 100K טוקנים, ואז $2.50, לעומת $0.20 למיליון.
• עלות לכל משימה שהושלמה — $0.21 לכל משימת אינדקס עצמאית עבור Claude Haiku 5.5, לעומת $0.09 עבור Nemotron — המודל הזול יותר זול יותר לכל משימה, לא רק לכל טוקן.
• מהירות פלט — 243.4 טוקנים לשנייה עבור Claude Haiku 5.5, במקום התשיעי מתוך 182; 298.9 טוקנים לשנייה עבור Nemotron, במקום הראשון מתוך 142.
• זמן עד לטוקן הראשון — כ-0.3 שניות עבור Claude Haiku 5.5, לעומת 0.54 שניות עבור Nemotron.
• ציון עצמאי — מדד האינטליגנציה של Artificial Analysis עומד על 43 עבור Claude Haiku 5.5, שני מתוך 182, כאשר תצורת Max עומדת על 43.40; מדד 13 עבור Nemotron, עשרים ותשיעי מתוך 142.
• חלון הקשר — 1,000,000 טוקנים כל אחד, כאשר כ-256,000 מהם פרקטיים עבור Nemotron על H100 בודד.
• מודאליות — טקסט ותמונה עבור Claude Haiku 5.5; טקסט בלבד עבור Nemotron.
• משקלים — קנייני לעומת פתוח תחת OpenMDW-1.1, MoE היברידי עם 30B סה"כ ו-3B פעילים.
• כיוונון הוראות — קיים ב-Claude Haiku 5.5, נעדר בנקודת הביקורת Base.
הבעיה של "Base", בניסוח פשוט
צ'קפוינט בסיס מנבא את הטוקן הבא. שאל אותו שאלה והוא לעיתים קרובות ימשיך את הטקסט בסגנון של מסמך שעשוי להכיל שאלה כזו, במקום לענות. תן לו את ההנחיה "סכם את החוזה הזה" ומודל בסיס עשוי להפיק המשך סביר של מסמך אימון משפטי במקום סיכום של החוזה שלך. NVIDIA מפרסמת צ'קפוינט BF16 נפרד ואחים נפרדים שעברו כיוונון להוראות בדיוק מפני שמשקולות הבסיס הן חומר גלם.
בכרטיס המודל של NVIDIA עצמה — מדווח על ידי הספק, ולא שוחזר באופן עצמאי — הצ'קפוינט הבסיסי משיג 78.59 ב-MMLU, 67.94 ב-MMLU-Pro, 91.28 ב-GSM8K, 77.44 ב-HumanEval ו-69.62 ב-RULER ב-1M אסימונים. כרטיס ה-Lightning של האח המכוונן מדווח על MMLU-Pro 81.94, GPQA Diamond 75.44, SWE-Bench Verified 51.56 ו-86% ב-PinchBench, עם הסקה מהירה בכ-30% מהמודל שהוא החליף. אפילו המספרים המכווננים הם של NVIDIA עצמה, והמספרים הבסיסיים הם אלה שחלים על הצ'קפוינט הנקוב בכותרת המאמר הזה. לעומתם, 43.40 שנמדד באופן עצמאי עבור Claude Haiku 5.5 — מקום שני מתוך 182 במדד של Artificial Analysis, מדד אחר שמודד דברים אחרים — אינו בר-השוואה ישירה, והקריאה הכנה היא שצ'קפוינט בסיס של 30B ומודל קטן מוגמר נמדדים בכלים שונים למטרות שונות.
מה שאפשר לומר ללא סייג הוא צורת הפער. צ'ק-פוינט בסיסי שזקוק לצינור כיוונון עדין, מערכת הגשה ומנגנון הערכה לפני שהוא מספק תשובה כלשהי אינו מהווה תחליף למודל מתארח ב-0.10 דולר למיליון. זו נקודת התחלה למי שרוצה להחזיק בבעלות על המודל.
היכן ש-Nemotron באמת מנצח, וזה לא פרס ניחומים
קודם כל מהירות. 298.9 אסימוני פלט לשנייה מציבים אותו בראש לוח של 142 מודלים — מהיר ב-23% מ-243.4 של Claude Haiku 5.5. עבור צינור רגיש לשהיה, זהו הבדל אמיתי ומדיד, וזו הסיבה שהשם "Lightning" נמצא על הקופסה.
משקלים פתוחים, שנית, וזה ההבדל הגדול יותר. תחת OpenMDW-1.1 אפשר להוריד את הצ'קפוינט, לכוונן אותו עדין על הנתונים שלכם, ולהגיש אותו בעצמכם. Claude Haiku 5.5 אינו ניתן לכוונון עדין כלל, ואינו ניתן לאירוח עצמאי בשום מחיר. עבור צוות עם משימה קניינית, התפלגות קלט לא שגרתית, או דרישת תאימות שהתעבורה לעולם אינה יוצאת מהתשתית שלו, ההבדל הזה מכריע, ללא קשר למה שכתוב בעמודי הבנצ'מרק. מודל של 30B בסך הכול עם 3B פעילים הוא גם קטן מספיק כדי שניתן לשרת אותו באופן כלכלי — הארכיטקטורה תוכננה בדיוק לשם כך.
מחיר שלישי: $0.06 לקלט ו-$0.20 לפלט למיליון, עם הנחת מטמון של 17% ו-$0.09 לכל משימת אינדקס, הוא בערך מחצית מה-$0.21 של Claude Haiku 5.5. שני המודלים זולים; Nemotron זול יותר.
היכן ש-Claude Haiku 5.5 מנצח, וזה בכל מימד שמצריך תשובה
ביצוע הוראות, משום שהוא אומן לכך. יכולת עצמאית, באינדקס 43 לעומת 13 — פער של שלושים נקודות בלוח שדירג את שניהם, שהוא הפער הגדול מסוגו בקבוצת ההשוואות הזו. קלט תמונות, ש-Nemotron אינו מקבל כלל. פלט מרבי של 128,000 טוקנים לעומת נתון שלא פורסם, עם מסלול בטא של 300,000 טוקנים ב-Batch. וחוגת המאמץ, שמאפשרת לך לחסוך בעלויות על ידי הפחתת מאמץ החשיבה במקום על ידי בניית המודל מחדש.
ההסתייגות בנוגע לוורבוזיות חותכת כאן לשני הכיוונים. במערך הבדיקות של Artificial Analysis, Claude Haiku 5.5 מפיק כ-440 מיליון טוקני פלט לעומת חציון של כ-100 מיליון — הוא חושב הרבה מאוד. Nemotron מפיק כ-120 מיליון, שאותו מקור מתאר כוורבוזי במידה מסוימת ביחס לגודלו. העלות למשימה של Haiku 5.5 היא בכל זאת $0.21 לעומת $0.09 של Nemotron, כך שאפילו המודל הפטפטן אינו היקר. מה שזה אומר הוא שמחירים פר טוקן מטעים בשני הכיוונים, והמספר פר משימה הוא זה שלפיו צריך לתקצב.
אירוח עצמי לעומת נקודת קצה אחת
Nemotron 3.5 Lightning 30B A3B Base מופץ כמשקולות פתוחות ומשרתים אותו כמה מספקי ההסקה; NVIDIA גם מפרסמת את האחים המכווננים. Claude Haiku 5.5 זמין דרך ה-API של Anthropic ומשם, בכל מקום שבו נמכרים מחדש המודלים של Anthropic. אף אחד מהם אינו בקטלוג של OrcaRouter, ולא נעמיד פנים אחרת — מה שאנחנו מנתבים מהשכונה הזו הוא anthropic/claude-haiku-4.5, anthropic/claude-sonnet-5.5, anthropic/claude-opus-5.5וanthropic/claude-fable-5.1, השכבה שמעל לנושא המאמר הזה.
לשתי הדרכים שההשוואה הזו מתארת יש צנרת שונה בתכלית, וכדאי לתת להן שם. הדרך של אירוח עצמי משמעה GPU, מסגרת הגשה, החלטת כימות ותורנות תפעול. הדרך של אירוח אצל ספק משמעה מפתח ומחרוזת מודל. OrcaRouter קיים עבור הדרך השנייה: API אחד ליותר מ-200 מודלים, מפתח אחד וחיוב אחד, מחיר המחירון של הספק מועבר הלאה בתוספת של 0%, כך שהפחתת מחיר מצד ספק נכנסת לתוקף באותו יום, עם מעבר אוטומטי לגיבוי מתחת. זה לא מסלול לצ'קפוינט בסיס בגודל 30B, וקניית מכונה בדרגת DGX אינה מסלול למודל קטן באירוח.

מי צריך לבחור מה
אם המשימה שלך מוגדרת היטב, נתוני האימון שלך גדולים מספיק כדי שיהיה להם משמעות, והתעבורה שלך אינה יכולה לצאת מהתשתית שלך, Nemotron 3.5 Lightning 30B A3B Base הוא האובייקט המעניין יותר: המהיר מבין 142 במהירות פלט, חצי מהמחיר לטוקן, ושלך לשינוי. תקצב את ריצת הכיוונון העדין ואת עלות ההגשה לפני שאתה סופר את החיסכון, כי תעריף הקלט של $0.06 מניח שמישהו כבר עשה את העבודה שהופכת צ'קפוינט לעוזר.
אם אתם רוצים לשלוח פרומפט ולקבל תשובה כבר אחר הצהריים, Claude Haiku 5.5 הוא זה שעושה את זה — 43 במדד העצמאי לעומת 13, קלט תמונות, תקרת פלט של 128,000 טוקנים ומחיר שהוא באמת קטן. ההשוואה נראית צמודה רק בדף מחירים. היא מפסיקה להיראות צמודה ברגע שהמשימה היא לענות על שאלה ולא להמשיך מסמך.

