כרטיס הירו שנוצר בכותרת 'Claude Haiku 5.5 vs Qwen3.8 27B' עם הכיתוב 'משקלים פתוחים מול ה-API', המציג את Claude Haiku 5.5 בקלט $0.10, פלט $0.50 ומדד 43.40 לעומת Qwen3.8 27B בקלט $0.50, פלט $3.00 ומדד 33.70, מעל לפס עם הכיתוב 'עלות למשימה שהושלמה $0.21 לעומת $1.01'.
Engineering & Research

Claude Haiku 5.5 מול Qwen3.8 27B: ניצחון מוחלט ב-API, ומדוע המשקלים הפתוחים עדיין קיימים

מחבר

Gideon Frost

תאריך פרסום

מודלים אחרונים · 20צפו בכל המודלים →
בנצ'מרקים: Artificial Analysis · מתעדכן יומית
חזרה לכל הפוסטים

רוב ההשוואות בסדרה הזו מסתכמות בפשרה. זו לא, והיעדר פשרה הוא עצמו הממצא. Claude Haiku 5.5, שיצא ב-7 באוקטובר 2026, מנצח את Qwen3.8 27B, המודל הצפוף 27B במשקלים פתוחים מ-14 באוגוסט 2026, בציון הבינה המשולב, בעלות לכל טוקן, בעלות לכל משימה שהושלמה, בחלון ההקשר, בתקרת התגובה, בקידוד אייג'נטי ובשורות ההסקה המדעית — והוא עושה זאת מ-API קנייני יחיד שאינו דורש חומרה. השורה היחידה שבה Qwen3.8 27B מנצח באופן מוחלט היא קלט וידאו, והאחרת היא רישיון.

זה לא סיבה לפסול את המודל, מפני שרישיון Apache-2.0 ומודאליות וידאו אינם פרסי ניחומים. זו סיבה להיות מדויקים לגבי מדוע מישהו יבחר בצד של המשקולות הפתוחות, ולהפסיק להעמיד פנים שהוויכוח הוא על מדדי ביצועים.

המספרים ששני המודלים הורצו עליהם בפועל

לכל מיליון טוקנים בדולרים אמריקאיים. התעריפים של הספק נלקחו מתיעוד התמחור של הספק עצמו; המדידות המשותפות הן Artificial Analysis Intelligence Index v4.3.2, שנקראו בתאריך 2026-10-08, שניהם בתצורת המאמץ הגבוהה ביותר שפורסמה.

A generated two-column scoreboard titled 'Claude Haiku 5.5 vs Qwen3.8 27B — the scoreboard' with rows Index v4.3.2 43.40 against 33.70, cost per task $0.21 against $1.01, input price $0.10 against $0.50, context window 1M tokens against 256K tokens, AutomationBench 0.3541 against 0.4824 and weights 'proprietary' against 'open, Apache 2.0', footed 'All figures per Artificial Analysis Intelligence Index v4.3.2; Qwen vendor-card scores are unreproduced by the board.'

• קלט — Claude Haiku 5.5 $0.10 עד 100,000 אסימונים ו-$0.50 ומעלה; Qwen3.8 27B $0.50 לפי התעריף של צד שלישי הרשום בלוח.

• פלט — Claude Haiku 5.5‏ $0.50 עד 100,000 טוקנים ו-$2.50 מעל; Qwen3.8 27B‏ $3.00.

• קלט במטמון — Claude Haiku 5.5 $0.01 ו-$0.05, הנחה של 90%; Qwen3.8 27B $0.10, הנחה של 80%.

• ציון עצמאי — 43.40 עבור Claude Haiku 5.5 (Max) לעומת 33.70 עבור Qwen3.8 27B (Xhigh). פער של 9.70 נקודות, הרחב ביותר באצווה הזו.

• עלות לכל משימה שהושלמה — $0.21 לעומת $1.01, באותה הרצת הערכה. פער של פי 4.7, וגם הרחב ביותר כאן.

• הקשר ופלט — 1M טוקנים ותקרת תגובה של 128,000 טוקנים עבור Claude Haiku 5.5; הקשר של 256K טוקנים עבור Qwen3.8 27B.

• מודאליות — שניהם מקבלים טקסט ותמונות ומחזירים טקסט. Qwen3.8 27B מוסיף קלט וידאו; Claude Haiku 5.5 לא.

• משקלים — Qwen3.8 27B הוא מודל עם 27B פרמטרים צפופים תחת Apache 2.0, ניתן להורדה. Claude Haiku 5.5 הוא קנייני וזמין רק דרך API.

A capture of Anthropic's Claude Platform models documentation showing the Claude model comparison table — Claude Fable 5.1, Claude Opus 5.5, Claude Sonnet 5.5 and Claude Haiku 5.5 'This model', the latter reading 1M context, 128K max output, 'From $0.10/$0.50', latency 'Fastest', default effort medium — above the Claude Haiku 5.5 specifications block with model ids claude-haiku-5-5, the two-tier pricing lines and 'Released October 7, 2026'.

מדוע הפער לכל משימה גדול פי ארבעה מהפער לכל טוקן

המחירון כבר מציג פער קלט של פי 5 ופער פלט של פי 6 לטובת הספק, כך שהכיוון אינו מוטל בספק. מה ששווה לקרוא הוא שהנתון לכל משימה הוא קטן יותר מאשר הנתון לכל אסימון, שזה ההפך ממה שקרה בהתמודדויות האחרות של אצווה זו, והסיבה מאלפת.

Claude Haiku 5.5 מפיק 162,164 טוקני פלט לכל משימת Intelligence Index — 129,047 לחשיבה ו-33,118 לתשובה. Qwen3.8 27B מפיק 66,797, בחלוקה של 47,711 לחשיבה ו-19,087 לתשובה. המודל של הספק מוציא פי 2.4 טוקנים לכל משימה, כך שיתרון קצב הפלט שלו, פי 6, מתכווץ ליתרון של פי 4.7 לכל משימה. הוא עדיין עצום. הוא פשוט לא המספר שהמחירון מפרסם.

מתמטיקת התערובת היא דרך נקייה יותר לראות את הצורה של זה. בתערובת 7:2:1 עתירת־קלט — המשקל שלרוב תעבורת הייצור יש בפועל — Claude Haiku 5.5 מגיע ל־0.077$ למיליון טוקנים לעומת 0.470$ עבור Qwen3.8 27B. בתערובת מאוזנת 1:1 זה 0.30$ לעומת 1.75$. צוק 100,000 הטוקנים של הספק הוא הדבר היחיד שאי־פעם סוגר את זה: מעבר לו, המונים של Claude Haiku 5.5 הופכים ל־0.50$ ו־2.50$ על הבקשה כולה, ושתי המודלים נפגשים במחיר בערך זהה — ואז אתה משלם תוספת ציון של 9.7 נקודות לחינם.

כאשר כרטיס הספק והלוח העצמאי אינם תואמים

זהו מערך השורות ששווה להאט עליו, מפני שכרטיס המודל של Qwen3.8 27B עצמו נקרא חזק considerably יותר מאשר המדידות העצמאיות, וההבדל הזה הוא כל הסיבה לכך שטענה על "מודל 27B שמתחרה במודלים גדולים בהרבה" זקוקה למקור שני.

הנתונים שפרסם הספק בעצמו, כפי שנרשמו בעמוד הקטלוג שלנו עבור הדגם, כוללים 90.3 ב-LiveCodeBench v6, 89.2 ב-GPQA Diamond, 84.3 ב-OSWorld-Verified, ו-79.0 ב-QwenSWEBench. אלה מדווחים על ידי הספק ולא שוחזרו, והם מתארים דגם תחרותי הרבה מעבר לקטגוריית המשקל שלו.

בהרצה העצמאית של Artificial Analysis, ‏Qwen3.8 27B משיג 0.0556 ב-Terminal-Bench 4.0, 0.4664 ב-SciCode, 0.3392 ב-Humanity's Last Exam ו-1423.21 ב-GDPval-AA v2.1. הציבו את ה-0.0556 לצד ה-84.3 שכרטיס הספק מדווח עליו ב-OSWorld, וצורת המחלוקת ברורה: בעבודה סוכנית במחשב ובמסוף, הלוח העצמאי ממקם את המודל הזה בערך במקום שבו שייך מודל צפוף 27B, וכרטיס הספק לא.

שתי שורות דווקא חותכות לכיוון ההפוך, וראוי לציין אותן מאותה סיבה. Qwen3.8 27B משיג 0.4824 ב-AutomationBench לעומת 0.3541 של Claude Haiku 5.5 — ניצחון עצמאי של 12.8 נקודות בדבר הקרוב ביותר לבנצ'מרק לאוטומציה עסקית שקיים באחד מהלוחות. זהו מספר אמיתי מאותה הרצה, בשורה הסמוכה ביותר למה שאנשים באמת מפעילים מודלים קטנים בשבילו.

הקריאה הכנה אינה "הספק ניפח הכול". היא שכרטיס מודל מודד את המשימות שמחבריו בחרו, הלוח העצמאי מודד סט קבוע, והחוזקות של Qwen3.8 27B נמצאות ברשימת הספק ולא ברשימת הלוח.

הכלכלה משתנה כשהחומרה בבעלותך

כל תעריף שצוטט לעיל הוא מחיר API, ולגבי Qwen3.8 27B זוהי המסגרת הלא נכונה.

זהו מודל צפוף 27B תחת Apache 2.0. הוא נכנס על מאיץ מודרני יחיד ברמת הקוונטיזציה שרוב הצוותים היו מקבלים, מה שאומר שהעלות השולית של טוקן מפסיקה להיות מונה של ספק והופכת לניצול שלך. זו הסיבה שהמחיר לקרוא לו משתנה לפי מארח באופן שאף אחד משני המודלים הקנייניים בהשוואה הזו מעולם לא יכול היה: הלוח מתעד תעריף צד שלישי של $0.50 בקלט ו-$3.00 בפלט, וקטלוג OrcaRouter מציע אותו במחיר $0.33 בקלט ו-$2.40 בפלט בלי שורת קריאה ממטמון בכלל, כי אנחנו מריצים את המשקלים בתשתית שלנו במקום למכור מחדש נקודת קצה של מישהו אחר.

עבור צוות שכבר משלם על GPUs, ההשוואה אינה בין $0.21 ל-$1.01 לכל משימה. היא בין התעריף שהספק מחייב לבין העלות השולית של בקשה על חומרה שבבעלותכם, ואלה מספרים שונים. זה הטיעון של צד המשקולות הפתוחות, והוא היחיד ששורד מפגש עם טבלת הבנצ'מרקים.

יש תוצאה שנייה, פחות מובנת מאליה, לכך שהרישיון הוא Apache 2.0: ניתן לשלב את המודל בתוך מוצר, לכוונן אותו על תעבורה שלך, להצמיד אותו לגרסה מסוימת, ולבצע ביקורת עד לרמת המשקלים. דבר מזה אינו זמין בכל מחיר ממודל קנייני המבוסס על API בלבד, ולעומסי עבודה כפופי רגולציה זה לעתים קרובות האילוץ המכריע ולא העדפה.

A capture of the OrcaRouter model page for Qwen3.8 27B under qwen/qwen3.8-27b, showing a 262K-token context chip, text, image and video input, text output, a p50 time to first token of 1.84 seconds, public benchmarks by Qwen dated 2026-08-15, and the page's own description of the model as Alibaba's open-weight 27B dense multimodal model released under Apache-2.0 and self-hosted on OrcaRouter's own infrastructure.

להתקשר לאחד מהם

Qwen3.8 27B is on the OrcaRouter catalogue as qwen/qwen3.8-27b at $0.33 and $2.40 per million tokens, self-hosted on our own infrastructure, with the OpenAI-compatible endpoint at https://api.orcarouter.ai/v1. Run against our own traffic over the last week it returns a median 1,837 ms to first token at 319 output tokens per second — a fast model, measured on our playground rather than a standardised harness, so treat that as a serving figure and not a benchmark. Video, image and text input, 262K-token context, native tool calling, structured outputs and a reasoning mode are all supported on the same key as everything else on the catalogue.

Claude Haiku 5.5 אינו בקטלוג. ניתן להגיע אליו ישירות דרך ה-API של הספק ודרך AWS, Azure ופלטפורמות הענן המובילות, וזו ההצהרה המדויקת. מה שהקטלוג כן כולל מקו המוצרים של הספק הוא Claude Sonnet 5.5 ו-Claude Opus 5.5, מה שהופך את מסלול ההסלמה ממודל קטן באירוח עצמי למודל סוכני מנוהל בדרג ביניים לשינוי בניתוב ולא לאינטגרציה שנייה — מעבר אוטומטי לגיבוי נמצא מתחת לכך כך או כך.

הכרעת הדין, שהיא חד-צדדית באופן יוצא דופן

כקריאת API על טקסט או תמונות, Claude Haiku 5.5 מנצח בהשוואה הזו בכל שורה שאינה עוסקת ברישוי. 9.7 נקודות מדד, זול פי 4.7 לכל משימה שהושלמה, חלון הקשר גדול פי ארבעה, תקרת תגובה כפולה, ותג מחיר נמוך פי חמישה עד שישה במשטר הפרומפטים הקצרים. אין טיעון של צורת עומס עבודה שמציל את Qwen3.8 27B מבחינת מחיר, מפני שהחיסרון של הספק — צריכת טוקני פלט גבוהה — שווה הרבה פחות מיתרון התעריף שלו.

מה שמציל אותו הוא כל מה שמחיר ה-API אינו לוכד: רישיון שמתיר הפצה מחדש, משקולות שאפשר להחזיק ולנעוץ, קלט וידאו, ומסלול באירוח עצמי שבו העלות לכל טוקן היא החומרה שלך ולא הכרטיס של הספק. אם אתם מחפשים את הדרך הזולה ביותר לסווג, לחלץ, לסכם ולנתב, Claude Haiku 5.5 הוא התשובה והפער אינו קטן. אם אתם מחפשים מודל שתוכלו להכניס לתוך המוצר שלכם, על החומרה שלכם, תחת הביקורת שלכם, אז פער הבנצ'מרק הפסיק להיות השאלה כבר לפני כמה פסקאות.

השוואות במאמר הזה1

זוהה מתוך המאמר הזה · בנצ'מרקים: Artificial Analysis · מתעדכן יומית