שעון חול על מעמד מודל ריק — משקלי Qwen3.8-27B לא שוחררו, ולכן לא יכול להתקיים API חינמי.
Guides & Insights

API חינמי של Qwen 3.8 27B: עדיין לא — מה להריץ במקום

מחבר

Rowan Sterling

תאריך פרסום

מודלים אחרונים · 20צפו בכל המודלים
בנצ'מרקים: Artificial Analysis · מתעדכן יומית
חזרה לכל הפוסטים

לא — נכון ל-12 באוגוסט 2026 אין API חינמי של Qwen3.8-27B, וגם אין בתשלום. הדגם הוכרז ב-3 באוגוסט עם הבטחה למשקלים פתוחים ב-Hugging Face וב-ModelScope "בשבוע של 10 באוגוסט," אבל לארגון הרשמי של Qwen עדיין אין מאגר Qwen3.8. עד שהמשקלים יפורסמו, אף אחד לא יכול לארח את Qwen3.8-27B, אז "חינמי" הוא חסר משמעות. הנה שלושת המסלולים לחינמי ברגע שהמשקלים יגיעו (ומה כל אחד באמת עולה), בנוסף לדגמים שאפשר להריץ בחינם מקומית היום.

אין עדיין API חינמי — המשקלים הם השער

אליבאבא הכריזה על משפחת Qwen3.8 ב-3 באוגוסט 2026: ה-Qwen3.8-Max עם 2.4 טריליון פרמטרים (כ-95 מיליארד פרמטרים פעילים, חלון הקשר של מיליון טוקנים, במחיר של 2 דולר למיליון טוקני קלט ו-6 דולר למיליון טוקני פלט ב-Alibaba Cloud Model Studio) וה-Qwen3.8-27B הצפוף והמיועד למכונה בודדת. שניהם הובטחו כמשקלים פתוחים ב-Hugging Face וב-ModelScope באותו שבוע.

ההבטחה הזאת כבר באיחור של יומיים. בדקתי ישירות ב־Hugging Face ב־12 באוגוסט: לארגון הרשמי של Qwe​n אין מאגר Qwen3.8 מכל סוג שהוא. מאגרי ה־Qwen3.8-27B-GGUF, -FP8, -NVFP4A16 ו־NInfer שמופיעים בחיפוש המודלים הם כרטיסי שומר־מקום — אפס קבצי משקל, מספרי הורדות חד־ספרתיים, כרטיסי דגם שבהם כתוב במפורש „שמור לקראת שחרור Qwe​n/Qwen3.8-27B". אל תתייחסו לאלה כראיה לכך שהמודל קיים; ראו בהם אנשים ששומרים מקומות חניה.

שני דברים שאי אפשר להניח. ראשית, הרישיון: לא צוין רישיון עבור Qwen3.8-27B. משקלי Qwen הפתוחים האחרונים שוחררו תחת רישיון Tongyi Qianwen, שסעיף 100-המיליון-משתמשים-פעילים-חודשיים בו מוביל לשיחות על רישיון מסחרי בקנה מידה גדול — Apache 2.0 אינו ברירת מחדל בטוחה. שנית, המפרט: Alibaba לא פרסמה טבלת מדדים, חלון הקשר, או דרישת חומרה מאושרת עבור ה-27B. כל מה שחוזרים עליו היום לגביו הוא השלכה.

כיסינו את רשימת הבדיקות לפני ההשקה — מה אושר, מה שמועה, מה לבדוק לפני ההורדה — במאמר Qwen3.8-27B Open Weights: What We Know Before the Drop. מאמר זה הוא החלק שאותו מאמר לא כיסה: איך "חינם" יעבוד בפועל לאחר שהמודל ישוחרר.

אחרי שהנטל יורד: שלושה מסלולים לחופש, ומה המחיר האמיתי של כל אחד

"חופשי" אף פעם לא חינם. כל שלושת המסלולים ל-Qwen3.8-27B חינמי מזיזים את העלות למקום כלשהו; ההבדל הוא לאן היא נוחתת. ה-27B הוא מודל צפוף — כל אחד מכ-27 מיליארד הפרמטרים שלו פעיל על כל טוקן — כך שהעלויות להלן נוגעות לחומרה אמיתית, לא לשיווק.

Three routes to a free Qwen3.8-27B API after the weights drop: run it yourself, a hosted free tier, or OrcaRouter's planned free tier — and the real cost of each.

מסלול 1: הרץ זאת בעצמך — חינם במזומן, מתומחר בחומרה

המסלול היחיד שבו "חינם" הופך לאמת ממשית לאחר שהחומרה נקנתה. דניאל האן, השותף-מייסד של Unsloth, מצפה שה-27B ירוץ בכ-17GB של VRAM עם ההשקה — יעד, לא מפרט מובטח. באמצעות סולם הקוונטיזציה הנמדד של Qwen3.6-27B כקירוב: Q4_K_M נוחת בסביבות 16GB, Q6_K בסביבות 21GB, FP8 בסביבות 27GB, ו-BF16 מלא בסביבות 54–56GB. המינימום הריאלי כיום הוא כרטיס 24GB — RTX 3090, RTX 4090, או מסוג A6000 — ב-Q4.

התזמון חשוב: משקלים רשמיים עם vLLM או SGLang עובדים בדרך כלל תוך ימים מהשחרור, אבל קוונטיזציות קהילתיות של GGUF ו-AWQ מתעכבות בשבוע עד שבועיים, כך ש"משוך והרץ" בסגנון Ollama לא יהיה זמין ביום ההשקה. העלויות הנסתרות הן חשמל, מכונה שקטה, והזמן שלך. הרווח הוא פרטיות — שום דבר לא יוצא מהמחשב שלך — ועלות שולית של אפס שמצטברת אם אתה משתמש ב-GPU גם למודלים אחרים.

מסלול 2: שכבות חינמיות מתארחות — חינם בכסף, מתומחר במגבלות

כאשר המשקלים ישוחררו, צפו למכסת הערכה מ-Alibaba Cloud ולמסלולים חינמיים מספקי האירוח הנטולי-שרת הרגילים. הדפוס שצפוי הוא זה ש-Alibaba כבר מפעילה עבור Qwen3.8-Max: מכסת 1M טוקנים למשתמשים חדשים, אזור סינגפור בלבד, תקף ל-90 יום, ללא העברה — וטוקני חשיבה מחויבים כפלט, כך שמודל שמבצע חשיבה כברירת מחדל יכול לשרוף את כל הקצבה בסוף שבוע אחד של בניית אב-טיפוס. מה שאתה בעצם משלם הוא מגבלות קצב, נעילה אזורית, תאריך תפוגה, והפניית השאילתות שלך לצד שלישי. מסלול חינמי הוא רמפת גישה להערכת המודל, לא מקום לפרוס אותו בו.

מסלול 3: השכבה החינמית של OrcaRouter — מתוכננת, לא פעילה

מכיוון ששאילתת החיפוש היא, פשוטו כמשמעו, "free", נהיה מפורשים: OrcaRouter מתכננת מסלול חינמי עבור Qwen3.8-27B ברגע שהמשקולות ישוחררו. זה לא פעיל. אין נקודת קצה להתקשר אליה, ואני לא מתכוון להדביק דוגמה עם placeholder. נכריז על כך כשיהיה מה להכריז. מה שאנחנו מארחים היום הוא Qwen3.8-Max ב-$2/$6 למיליון טוקנים ללא תוספת מחיר — וה-27B לא על הפלטפורמה, כי אף אחד לא יכול לשרת אותו עדיין.

במה אפשר להשתמש בחינם כרגע

אם הצורך שלך הוא "מודל פתוח מסוג 27B שאוכל להריץ בלי לשלם," אין צורך לחכות. התשובה הכנה באותה רמה היא Qwen3.6-27B, המבשר הישיר של המודל שאתה ממתין לו.

Comparison of Qwen3.6-27B and Nemotron 3.5 Lightning 30B A3B, which you can run free today, against Qwen3.8-27B, which is not yet released.

Qwen3.6-27Bהוא Apache 2.0, מודל צפוף בגודל 27.8B עם הקשר של 262K וקלט מקורי של טקסט, תמונה ווידאו. GGUF מסוג Q4_K_M הוא כ-16.5GB ורץ בקצב של כ-25 טוקנים לשנייה על GPU צרכני של 24GB (16–18 טוקנים לשנייה על M4 Max). המספרים המדווחים על ידי הספק מכרטיס המודל: SWE-Bench Verified 77.2, MMLU-Pro 86.2, AIME 2026 94.1, GPQA Diamond 87.8, ו-MMMU 82.9. אם Qwen3.8-27B הוא "27B," זה ה-27B שאפשר לגעת בו בפועל היום — אותה משפחה, אותו עיצוב צפוף, וכבר פתוח.

Nemotron 3.5 Lightning 30B A3B הוא בעל צורה שונה, גם חינמי: שוחרר ב-11 באוגוסט 2026 תחת רישיון OpenMDW 1.1 של NVIDIA. זהו מודל Mixture-of-Experts עם סך של 30B, כ-3B פעילים, בעל ארכיטקטורת Mamba-2 היברידית וקונטקסט של עד 1M — נקודות ביקורת (checkpoints) בפורמט NVFP4 הן כ-21.6GB, ו-Q4 GGUF הוא כ-25GB. הוא דורש כרטיס עם 24GB ומעלה, מכיוון שכל 30 מיליארד הפרמטרים יושבים בזיכרון, אף שרק כ-3 מיליארד מופעלים לכל טוקן. דיווחים ראשוניים מעמידים אותו על כ-45 טוקנים לשנייה על GPU אחד. הוא מיועד לשכבת ביצוע של סוכנים (agent execution layer) — קריאות לכלים, אימות, עיצוב — לא לחשיבה מתקדמת (frontier reasoning). אם העומס שלך הוא עבודת סוכנים שוחקת בהיקף גדול, הוא יכול לנצח מודל dense של 27B בעבודה האמיתית שלך.

ואם מה שאתה רוצה ספציפית הוא API מתארח בחינם היום במקום התקנה מקומית, ה"חינמי" הכנה היחיד הוא מכסת Qwen3.8-Max של עליבאבא: 1M טוקנים, אזור סינגפור, 90 ימים. זה לא ה-27B, וזו קצבת הערכה, לא שירות — השתמש בזה כדי לנסות את ההתנהגות של Qwen3.8 עכשיו, ואז תעבור.

מתי העצה הזו שגויה

אם כבר יש לכם GPU עם 24GB ומעלה, המסגור של "חכו לדרגות החינמיות" שגוי עבורכם. ביום שבו המשקלים יירדו, vLLM על המשקלים הרשמיים הוא הדרגה החינמית שלכם; אתם תחכו לנוחות שאינכם צריכים. החזיקו מעמד כשבועיים רק אם אתם רוצים ספציפית את סולם קוונטיזציית GGUF המלוטש.

אם אתה בונה אב טיפוס מול חוזה API, מכסות החינם המתארחות (ברגע שיהיו ל-27B) עשויות לעלות פחות מהזמן שלך — אפילו עם תפוגת 90 הימים ונעילת האזור, השכרת שרת GPU למשך שבוע של פיתוח אב טיפוס היא בדרך כלל הדרך היקרה יותר.

אם הרישיון יתברר כ-Tongyi Qianwen במקום Apache,"משקלים חופשיים" לא יהיו חופשיים למסחור מעל סף 100 מיליון MAU. קראו את קובץ ה-LICENSE במאגר בפועל לפני שבונים עליו משהו — זו הדרך הנפוצה ביותר שבה "משקלים פתוחים חופשיים" הופכים לחשבונית.

ואם Alibaba ידחה שוב את התאריך — זה כבר יומיים אחרי חלון הזמן המובטח — כל שבוע שעובר הופך את Qwen3.6-27B לבחירה הנכונה ולא לפתרון ביניים.

A timeline from announcement to free local run of Qwen3.8-27B.

השורה התחתונה

אין API חינמי של Qwen3.8-27B כי אין Qwen3.8-27B בשום מקום. כשהמשקלים ישוחררו, שלושת המסלולים החינמיים הם אירוח עצמי (משלמים בחומרה), שכבות חינמיות מתארחות (משלמים במגבלות), והשכבה החינמית המתוכננת של OrcaRouter — שעדיין אינה פעילה, ונגיד זאת כשתהיה. היום, האפשרות החינמית הקרובה ביותר היא Qwen3.6-27B על החומרה שלך. ההמתנה לא עולה לך דבר מלבד ה-27B; הרצת קודמו לא עולה לך דבר מלבד GPU שאפשר להפעיל על כל שאר הדברים בינתיים.

השוואות במאמר הזה1

זוהה מתוך המאמר הזה · בנצ'מרקים: Artificial Analysis · מתעדכן יומית