כרטיס כותרת שנוצר עם הכיתוב 'Claude Haiku 5.5 נגד Qwen3.8-Flash-Next' וכתובית המשנה 'המודל במשקלים פתוחים אינו הזול', עמודה שכותרתה 'עלות למשימת Intelligence Index שהושלמה', שעליה $0.21 עבור Claude Haiku 5.5 ו-$0.37 עבור Qwen3.8-Flash-Next, ושורת כותרת תחתונה עם הכיתוב 'נתונים בלתי תלויים לפי Artificial Analysis; תמחור לפי Anthropic ו-Alibaba.' הלוגו האמיתי של OrcaRouter מורכב בפינה הימנית התחתונה.
Guides & Insights

Claude Haiku 5.5 מול Qwen3.8-Flash-Next: המודל בקוד פתוח אינו הזול

מחבר

Rowan Sterling

תאריך פרסום

מודלים אחרונים · 20צפו בכל המודלים →
בנצ'מרקים: Artificial Analysis · מתעדכן יומית
חזרה לכל הפוסטים

האינסטינקט הוא שמודל במשקלים פתוחים מדרגת ה-Flash של אליבאבא יהיה זול יותר ממודל קטן סגור של אנתרופיק, ובשני מספרי המחיר המוצהרים זה אכן כך: Qwen3.8-Flash-Next מוצע במחיר של 0.15 דולר למיליון טוקנים בקלט ו-0.47 דולר למיליון טוקנים בפלט ב-API של אליבאבא עצמה, לעומת 0.10 ו-0.50 דולר עבור Claude Haiku 5.5. אבל אם מריצים את שניהם על אותה חבילת מבחנים, הסדר מתהפך. Artificial Analysis מודדת את Claude Haiku 5.5 במאמץ מקסימלי בעלות של 0.21 דולר למשימת Intelligence Index שהושלמה; Qwen3.8-Flash-Next עולה 0.37 דולר באותה מדידה, עבור ציון נמוך בשלוש נקודות. המחיר המוצהר הזול יותר שייך למודל עם החשבון הגדול יותר, והסיבה היא אותה סיבה שמכריעה את רוב ההשוואות האלה: כרטיס התעריפים אינו המחיר, והמודל במשקלים פתוחים מצדיק את עצמו במקום אחר ולא בחשבון של API מנוהל. ה"מקום האחר" הזה הוא הנושא האמיתי של העימות הזה.

מה כל אחד מהם הוא

השניים נחתו בהפרש של שישה שבועות זה מזה, והם לא מאותו סוג של חפץ.

• Claude Haiku 5.5 — מודל עם משקלים סגורים שיצא ב-7 באוקטובר 2026, ב-Claude API, Amazon Bedrock, Google Cloud, Microsoft Foundry ו-Claude Platform on AWS. חלון הקשר של 1M טוקנים, עד 128,000 טוקני פלט ב-Messages API הסינכרוני, חשיבה אדפטיבית עם חוגת מאמץ מ"נמוך" עד "מקסימום" וברירת המחדל היא בינונית, תאריך חיתוך ידע של יוני 2026, ולוח תעריפים עם מדרגה ב-100,000 טוקנים.

• Qwen3.8-Flash-Next — מודל תערובת מומחים במשקלים פתוחים, ששוחרר ב-26 באוגוסט 2026 תחת רישיון qwen-community-1.0, ומתואר על ידי Alibaba כתצוגה ניסיונית מקדימה של הארכיטקטורה שתשמש בסיס ל-Qwen4. הוא מאחסן 125B פרמטרים של המודל הראשי ובנוסף טבלת הטמעת n-gram נפרדת של 51B — כ-176B לפני מודול חיזוי רב-אסימוני של 4B — ומפעיל 6B לכל אסימון, עם 512 מומחים, ניתוב top-10 ו-48 שכבות. חלון ההקשר שלו הוא 262,144 אסימונים באופן מקורי, ניתן להרחבה ל-1M עם YaRN, והוא קולט קלט של טקסט, תמונה ווידאו.

• Qwen3.8-Flash — המקבילה המסחרית המוגשת, שזמינה גם היא מאז 26 באוגוסט 2026 ב-QwenCloud של אליבאבא במחיר של 0.16 דולר למיליון טוקני קלט ו-0.47 דולר למיליון טוקני פלט, עם הקשר ברירת מחדל של 1M טוקנים. כדאי להשאיר אותה נפרדת מ-Flash-Next: האחת היא צ'קפוינט שאפשר להוריד ולבחון, והאחרת היא נקודת קצה מנוהלת בתשלום.

ההבחנה בין השניים האחרונים היא כל הסיבה שההשוואה הזו מעניינת. Claude Haiku 5.5 ו-Qwen3.8-Flash-Next מתחרים על מעט מאוד, מכיוון שרק אחד מהם יכול לרוץ על החומרה שלך.

הצעת החוק המדודה, שמצביעה לכיוון ההפוך

כל הנתונים העצמאיים שלהלן מקורם ב-Artificial Analysis על Intelligence Index v4.3.2. מחירוני Anthropic ו-Alibaba הם המחירים המפורסמים של הספקים עצמם.

• מדד האינטליגנציה — Claude Haiku 5.5 במאמץ Max: 43, שני מתוך 182 מודלים. Qwen3.8-Flash-Next: 40, שישי מתוך 117 בקטגוריה שלו. פער של שלוש נקודות, לטובת Anthropic.

• עלות לכל משימה — 0.21$ לעומת 0.37$. המודל היקר יותר לכל טוקן זול ב-43% לכל משימה שהושלמה.

• טוקני פלט בהרצת Index — 440 מיליון עבור Claude Haiku 5.5 ו-240 מיליון עבור Qwen3.8-Flash-Next, שניהם לעומת חציון של 100 מיליון. מודל Qwen הוא הכותב היעיל יותר ובכל זאת המשימה היקרה יותר, מה שאומר לך שהפער אינו רק נפח הטוקנים אלא שילוב הקלט וההערכה שהמעריך מיישם.

• מהירות פלט — 241.9 טוקנים לשנייה לעומת 56.0. Claude Haiku 5.5 מהיר יותר מפי ארבעה באותה מדידה, וזמן של 295 שניות לטוקן הראשון באותה הרצה הוא תוצר של חשיבה במאמץ מקסימלי ולא נתון רשת; זמן הטוקן הראשון של Qwen3.8-Flash-Next הוא 2.53 שניות.

• צורת המחירון — Claude Haiku 5.5 עולה מ-$0.10 ו-$0.50 ל-$0.50 ו-$2.50 ב-100,000 טוקנים. Qwen3.8-Flash נשאר אחיד ב-$0.16 ו-$0.47 ללא תלות באורך, וזה יתרון אמיתי בפרומפטים ארוכים והמקום היחיד שבו טיעון תג המחיר שורד מפגש עם מסמך ארוך.

• טוקנייזר — Claude Haiku 5.5 משתמש בטוקנייזר החדש יותר, שמשותף עם Claude 4.7 ואילך, כך שאותו טקסט נספר ככ-30% יותר טוקנים מאשר ב-Haiku הקודם. זה מנפח את הפרומפטים לעבר מדרגת 100,000 הטוקנים; זה מופיע בתיעוד של Anthropic עצמה, והוא פועל לרעת המודל בדיוק במקרה של פרומפט ארוך, שבו התעריף האחיד של Qwen נראה הטוב ביותר.

אז צורת העסקה היא: לשלם יותר לכל טוקן, ולקבל תשובה מהירה יותר וקצת חכמה יותר שעולה פחות לכל משימה שהושלמה, עם צוק תעריף שכדאי לשים לב אליו בקלטים ארוכים. או לשלם פחות לכל טוקן ולקבל מודל איטי יותר שעולה יותר לכל משימה שהושלמה, עם תעריף אחיד וחלון נייטיבי של 262,144 טוקנים.

A screenshot of OrcaRouter's model page for qwen/qwen3.8-flash, showing the model card and its list pricing of $0.15 per million input tokens and $0.47 per million output tokens, captured in English.A screenshot of the Artificial Analysis model page for Claude Haiku 5.5 at maximum effort, showing an Intelligence Index of 43 on v4.3.2 at rank 2 of 182 models, a 1,000,000-token context window, 241.9 output tokens per second at rank 8 of 182, a cost of $0.21 per Intelligence Index task, and 440 million output tokens against a 100 million median.

היכן שהמשקלים הפתוחים באמת משנים את החשבון

כל מה שלמעלה משווה בין שני ממשקי API מנוהלים, וזו ההשוואה ש-Qwen3.8-Flash-Next לא תוכנן לנצח בה. הטיעון שלו הוא שאין הכרח לשכור אותו.

• תמיכת הגשה מיום אפס. SGLang פרסמה עמוד קוקבוק ותמונה ייעודית; ל-vLLM יש בילד עבורו, בעוד שבקשת המשיכה (pull request) לתמיכה בארכיטקטורה עדיין פתוחה. NVIDIA אימתה את שניהם וכן את TensorRT LLM על מתלה GB300 NVL72, ו-NeMo מכסה כוונון עדין.

• רף החומרה נמוך עבור צ'קפוינט של 176B. טבלת ההטמעות של n-gram בגודל 51B יכולה לשבת בזיכרון המארח ולא ב-VRAM, מכיוון שכתובות החיפוש שלה ידועות מראש וניתן לבצע להן prefetch. זה מה שמאפשר למודל לרוץ על אשכולות DGX Spark ותחנות עבודה 4×RTX PRO 6000, וקוונטיזציות קהילתיות באותו יום — בניות 1-bit שנכנסות ל-75GB של RAM בכ-80% מהדיוק המלא — מכניסות אותו לחומרה שצוות קטן מחזיק בה.

• כיוונון עדין זמין.לא במובן של API לכיוונון מתארח: המשקלים הם שלך, תחת רישיון קהילתי עם התנאים הרגילים, והארכיטקטורה מתועדת בדוח טכני שמפרסם את האבלציות ואת התוצאות השליליות.

• החלון קטן יותר ממה שהוא נראה. 262,144 טוקנים באופן מקורי, ניתנים להרחבה ל-1M עם YaRN — לעומת 1M מקורי ב-Claude Haiku 5.5, בלי הסתייגות של rope-scaling. בעומסי עבודה של מסמכים ארוכים, שבהם התעריף האחיד של Qwen נראה הכי אטרקטיבי, המודל שבאמת יכול להחזיק את המסמך הוא דווקא זה האחר.

• הבנצ'מארקים מדווחים על ידי הספק. הטבלה של עליבאבא עצמה מציבה את Flash-Next לפני DeepSeek-V4-Flash-0731 ב-DeepSWE 1.1 (58.7 לעומת 54.4), SWE-bench Pro (62.5 לעומת 56.0) ו-GPQA Diamond (91.7 לעומת 90.8), ומאחוריו ב-NL2Repo-Bench (48.1 לעומת 54.2) — יצירת קוד ברמת המאגר, הממד הסוכני היחיד שבו המודל הקטן יותר אינו מדביק את הקצב. אף אחד מהנתונים לא שוחזר על ידי צד שלישי, והמודל בן שישה שבועות.

זהו הגבול האמיתי בין השניים. Claude Haiku 5.5 הוא שירות מדוד עם תקרת איכות קבועה וללא משטח תפעולי. Qwen3.8-Flash-Next הוא ארטיפקט שעקומת העלות שלו מתכופפת כלפי מטה לעבר מחיר החשמל, ותקרת האיכות שלו היא מה שתוכל לשרת, בתוספת הסיכון של טבלת בנצ'מרק שלא שוחזרה ושל ארכיטקטורה שעדיין נספגת על ידי סביבות ההרצה.

הדרך המציאותית להחליט

שלוש שאלות מכריעות את העניין, ורק הראשונה עוסקת במבחני ביצועים.

יש לך GPUs, או שאתה רוצה כאלה? אם לא, תרחיש ההרצה העצמית הוא תאורטי, וההשוואה המנוהלת שלמעלה היא כל הסיפור — והיא נוטה לטובת Claude Haiku 5.5 בעלות למשימה, במהירות ובציון, עם הסתייגות שצעד של 100,000 טוקנים שלו מעניש פרומפטים ארוכים. אם כן יש לך מאיצים שיושבים מתחת ליעד ניצול, Qwen3.8-Flash-Next הוא אחד המודלים הפתוחים הבודדים שבהם פענוח עם 6B פרמטרים פעילים הוא באמת זול להרצה בהיקף, ונתון ה-$0.37 למשימה מפסיק להיות המספר הרלוונטי.

כמה ארוך הפרומפט הממוצע? זה המקום היחיד שבו טיעון תג המחיר תקף. מתחת ל-100,000 טוקנים — לאחר טוקנייזר שמנפח בכ-30% — Claude Haiku 5.5 זול יותר בכל מדד. מעל זה, התעריף האחיד של $0.16 ו-$0.47 הוא הכרטיס הטוב יותר, והיתרון שלו מתרחב עם האורך ממש עד לחלון המקורי של 262,144 טוקנים, שמעבר לו הרחבת YaRN היא בעיה הנדסית אחרת.

מהי הסובלנות של עומס העבודה לשונות בהשהיה? 241.9 אסימוני פלט לשנייה לעומת 56.0 הוא פער גדול, ופריסה באירוח עצמי מוסיפה לכך תורים. סוכן תמיכה בזמן אמת או סוכן שמפעיל דפדפן — עומסי העבודה שאנתרופיק מכנה עבור שכבה זו — ירגיש את ההבדל.

למי שרוצה לענות על השאלות השנייה והשלישית במקום לנמק עליהן, הכלי הזול ביותר הוא נקודת קצה משותפת. Qwen3.8-Flash-Next עדיין לא מופיע בקטלוג של OrcaRouter, וגם לא Claude Haiku 5.5; אח ה-Qwen שאנחנו כן מנתבים הוא Qwen3.8-Flash, במחיר המחירון של הספק עם 0% תוספת שמועברת הלאה, שהוא המקבילה הקרובה ביותר שמוגשת למודל בהשוואה הזו והבסיס הנכון למבחן עלות של פרומפט ארוך. בצד של Anthropic, Claude Haiku 4.5, Claude Sonnet 5.5 ו-Claude Opus 5.5 כולם ניתנים לקריאה מאותו מפתח היום, כך שניסוי מחירים של שני דורות הוא קונפיגורציה ולא חוזה נוסף — ומכיוון שהתמחור הוא לפי העברה ישירה ולא משולב, קיצוץ מצד הספק באחת מהרגליים מופיע אצלנו באותו יום שבו הוא מוכרז. מעבר אוטומטי לכשל הוא מה שהופך את הניסוי לבטוח להרצה על תעבורה אמיתית: מודל בתצוגה מקדימה או טבלת בנצ'מרקים שלא שוחזרה הם בדיוק המקרה שבו מכוונים נתיב למשהו חדש כשמודל מהימן יושב מאחוריו.

מה ישנה את התשובה

שני דברים, ושניהם ניתנים לבדיקה. הראשון הוא הערכה בלתי־תלויה של Qwen3.8-Flash-Next על הרנס שמריץ גם את Claude Haiku 5.5 — טבלת הספק היא מול DeepSeek, וה-40 של הלוח העצמאי הוא מיקום בודד. ציון קידוד ברמת מאגר הוא השורה שכדאי לעקוב אחריה, מפני ש-NL2Repo הוא המקום שבו כבר הוכח שהמודל מפגר. השני הוא אם עבודת ה-runtime תגיע לידי מימוש: התמיכה ב-vLLM עדיין נמזגת דרך בקשות משיכה פתוחות, ועד שזה יקרה, אירוח עצמי של הארכיטקטורה הזו הוא תרגיל לצוותים שנהנים מדברים מהסוג הזה, ולא מסלול נתמך.

עד אז הסיכום קצר. Qwen3.8-Flash-Next הוא המודל המעניין יותר להחזיק בבעלותך והיקר יותר לשכור. Claude Haiku 5.5 הוא נקודת הקצה המנוהלת הזולה, המהירה ובעלת הניקוד הגבוה יותר, עם מחירון שמעניש כל דבר ארוך. בחר לפי האם אתה קונה אסימונים או קונה נקודת ביקורת — ואם אתה קונה אסימונים, שים לב שהמודל במשקלים פתוחים אינו ההנחה שהנחת.

A generated two-column scoreboard titled 'Claude Haiku 5.5 vs Qwen3.8-Flash-Next — the scoreboard'. Left column Claude Haiku 5.5: weights, closed and API-only; input price $0.10 per million up to 100,000 tokens; output price $0.50 per million up to 100,000 tokens; native context 1,000,000 tokens; independent score 43 on Intelligence Index v4.3.2 at Max effort, rank 2 of 182; cost per task $0.21; measured output speed 241.9 tokens per second. Right column Qwen3.8-Flash-Next: weights, open under the qwen-community-1.0 license; served price $0.16 per million input and $0.47 per million output, flat; native context 262,144 tokens, extensible to 1M with YaRN; independent score 40, rank 6 of 117; cost per task $0.37; measured output speed 56.0 tokens per second. A footer line reads 'Vendor pricing per Anthropic and Alibaba; independent figures per Artificial Analysis.' The real OrcaRouter logo is composited bottom-right.