Qwen3.6 35B-A3B — משקל פתוח MoE רב-מודאלי (טקסט/תמונה/וידאו), 35B סה"כ / 3B פרמטרים פעילים, 256k הקשר.
Qwen3.6 35B A3B הוא מודל שפה גדול מסוג mixture-of-experts (MoE) ממשפחת Qwen. הוא מכיל 35 מיליארד פרמטרים בסך הכול, אך רק כ-3 מיליארד מופעלים במהלך כל מעבר קדימה. עיצוב זה מאפשר למודל להגדיל קיבולת…
Qwen3.6 35B A3B מצטיין במשימות שנהנות מחלונות הקשר ארוכים והבנה רב-מודאלית. אלה כוללים מענה על שאלות ברמת מסמך, סיכום דוחות ארוכים, יצירת קוד עם הקשר מורחב, וחשיבה מורכבת על פני מספר שלבים. ההקשר של 262,144 אסימונים של המודל מאפשר לו לעכל ספרים שלמים, בסיסי קוד נרחבים, או שעות של וידאו מתומלל. החוזק שלו ב-τ²-Bench (95.3) מצביע על ביצועים חזקים במשימות הדורשות שליפה ושימוש במידע מקלטים ארוכים, כמו גם קריאה לכלים חיצוניים ועמידה בהוראות לאורך פניות רבות. קלטים רב-מודאליים—תמונות וסרטונים—מוסיפים את היכולת לנתח תוכן חזותי לצד טקסט בהנחיה אחת.
המודל תומך בקלט בצורת טקסט, תמונות וקבצי וידאו. בעת שליחת בקשה דרך ה-API של OrcaRouter, ניתן לכלול נתוני תמונה (למשל, מקודדים ב-base64 או כתובת URL) וקבצי וידאו בתוך ההודעה של המשתמש, תוך שימוש באותו פורמט מולטי-מודאלי (multimodal) המשמש ספקים אחרים. המודל מעבד את האלמנטים החזותיים הללו יחד עם הנחיית הטקסט, ומאפשר לו להסיק על תרשימים, דיאגרמות, תצלומים או קטעי וידאו. לדוגמה, ניתן לבקש ממנו לתאר סצנה מתוך סרטון, לחלץ נתונים מתמונה, או לשלב הוראות טקסט עם הקשר חזותי. הפלט הוא תמיד טקסט. אין תמחור נפרד עבור קלטים מולטי-מודאליים – הם מחויבים באותו תעריף קלט לפי אסימון (per-token).
חלון ההקשר של 262,144 טוקנים מאפשר למודל לטפל ברצפים ארוכים מאוד מבלי לחתוך אותם. עם זאת, עיבוד הקשר ארוך עלול להגדיל את זמן האחזור ואת צריכת הזיכרון. ארכיטקטורת MoE מסייעת להפחית עלויות מכיוון שרק 3B פרמטרים פעילים לכל טוקן, אך מנגנון תשומת הלב המלא עדיין מתרחב בהתאם לאורך הרצף. במשימות שבהן המידע הרלוונטי מפוזר לאורך קלט ארוך, הציון הגבוה של Qwen3.6 35B A3B ב-τ²-Bench מצביע על יכולתו לאחזר מידע ולהסיק מסקנות ביעילות. עבור מסמכים ארוכים מאוד, כדאי לשקול אסטרטגיות של חלוקה לנתחים (chunking) או להשתמש ביכולות הסיכום של המודל עצמו. עבור משימות עם הקשר קצר, מודל צפוף (dense model) זול יותר עשוי להיות חסכוני יותר.
אם מקרה השימוש שלך כולל פרומפטים קצרים (מתחת ל-4K טוקנים), משימות פשוטות כמו סיווג או חילוץ, או שאינו דורש קלט מולטי-מודלי, מודל קטן ודחוס—כגון וריאנט עם 7B פרמטרים—עשוי להציע השהיה ועלות נמוכים יותר. המחיר לטוקן של Qwen3.6 35B A3B ($0.25/$1.48 למיליון טוקנים) הוא סביר, אך עבור עומסי עבודה בנפח גבוה ובמורכבות נמוכה, מודל עם אפילו פחות פרמטרים פעילים (למשל 1B או 3B דחוסים) עשוי להיות חסכוני יותר. בנוסף, אם אינך זקוק ליכולות ההקשר הארוך או המולטי-מודליות, אתה משלם על תקורה שאולי אינך משתמש בה. הערך את אורכי הפרומפט והפלט הממוצעים שלך אל מול החוזקות של המודל כדי להחליט.
τ²-Bench הוא מדד ביצועים (benchmark) המעריך את יכולתה של מודל לבצע חשיבה על הקשר ארוך (long-context reasoning) ושימוש רב-שלבי בכלים. הוא כולל עיבוד מאגר נתונים גדול (לדוגמה, מאגר מסמכים או בסיס קוד) ולאחר מכן מענה על שאלות הדורשות שליפה וסינתזה של מידע מתוך אותו מאגר. ציון של 95.3 מציין שהמודל טיפל במשימות אלו בהצלחה ובדיוק גבוה, תוך שהוא עולה על מודלים רבים אחרים במדד הספציפי הזה. זה מצביע על יכולות חזקות של שליפה, חשיבה והבנת הוראות בהקשרים מורחבים. עם זאת, יש לפרש ציוני מדדי ביצועים כמדד אחד ליכולת; תוצאות בעולם האמיתי עשויות להשתנות בהתאם לפרטי המשימה.
השהייה של Qwen3.6 35B A3B מושפעת מארכיטקטורת ה-MoE שלו: רק 3B פרמטרים פעילים לכל טוקן, מה שמאפשר בדרך כלל פעילות הסקה מהירה יותר בהשוואה למודל צפוף של 35B. עם זאת, מנגנון הקשב עדיין דורש עיבוד של כל חלון ההקשר, כך שכניסות ארוכות יותר מגדילות את הזמן עד לטוקן הראשון. OrcaRouter אינה מפרסמת אמות מידה ספציפיות להשהייה עבור מודל זה. בפועל, זמני התגובה תלויים בעומס הבקשות, באורך ההנחיה ובמספר הטוקנים בפלט. עבור יישומי זמן אמת, בצעו בדיקות עם הקלטים האופייניים שלכם. עבור עיבוד אצווה, יעילות העלות של המודל יכולה לפצות על השהיות ארוכות יותר. על המשתמשים לשקול גם מהירות וגם עלות כאשר הם משווים למודלים צפופים.
תוצאת המדד העיקרית שסופקה היא ציון τ²-Bench של 95.3, המצביע על יכולות חשיבה חזקות בהקשר ארוך ובשימוש בכלים. זהו תחום חוזק מרכזי. ריבוי-המצבים של המודל גם ממקם אותו היטב למשימות המשלבות נתונים חזותיים וטקסטואליים, אם כי לא סופקו כאן ציוני מדד נפרדים למשימות חזותיות. בהתבסס על הארכיטקטורה, ניתן לצפות שהמודל יבצע היטב במשימות הנהנות ממספר הפרמטרים הגדול אך אינן דורשות הפעלה מלאה של כל הפרמטרים. עיצוב ה-MoE עלול להוביל לעקביות מעט פחותה בהשוואה למודלים צפופים במשימות צרות מסוימות, אך הוא מציע איזון מועדף בין יכולת לעלות.
למרות שציון ה-τ²-Bench גבוה, מדובר במבחן יחיד; ביצועים במבחנים אחרים (למשל, MMLU, MATH, תחרויות תכנות) לא מסופקים. המקבילות הצפופות של המודל (למשל, מודל צפוף מלא של 35B) עשויות להצטיין במשימות הדורשות הפעלה בו-זמנית של כל הפרמטרים, כגון סוגים מסוימים של חשיבה מתמטית או משימות רב-לשוניות. כמו כן, קלט מולטימודלי נתמך אך איכות ההבנה של וידאו עשויה להיות תלויה בדגימת פריימים ובדחיסה. זמן השהייה לא נבדק בציבור. משתמשים לא צריכים להניח שהמודל הוא הבחירה הטובה ביותר לכל תרחיש; יש תמיד להעריך מול מקרה השימוש הספציפי שלכם ולשקול להריץ מבחנים משלכם.
תמחור הוא לפי טוקן, מחויב בנפרד עבור קלט ופלט. העלות היא 0.25$ לכל מיליון טוקני קלט ו-1.48$ לכל מיליון טוקני פלט. אלו התעריפים של הספק, ו-OrcaRouter לא מוסיפה תוספת. טוקני קלט כוללים את כל הטוקנים בהנחיה, כולל טקסט, טוקניזציה של תמונות וטוקניזציה של סרטונים. טוקני פלט הם כל הטוקנים שנוצרים בתגובה. אין עמלות נוספות לשימוש ב-API, אין מנויים חודשיים, ואין דרישות מינימום לשימוש. החיוב מבוצע על ידי OrcaRouter לפי צריכת טוקנים. מכיוון שרק 3B פרמטרים פעילים לכל טוקן, עלות החישוב לספק נמוכה יותר מזו של מודל 35B דחוס, והחיסכון הזה מועבר בתמחור.
מחיר הקלט ($0.25/1M טוקנים) נמוך יחסית, בעוד שמחיר הפלט ($1.48/1M) גבוה יותר, ומשקף את עלות היצירה. אם היישום שלך מייצר כמות גדולה של טוקני פלט (למשל, סיכומים ארוכים, יצירת קוד), עלות הפלט תשלוט בעלויות. במקרים כאלה, שקול לצמצם את אורך הפלט באמצעות הוראות או להשתמש במודל זול יותר ליצירה אם האיכות מאפשרת זאת. מנגד, אם יש לך פרומפטים ארוכים מאוד אך פלט קצר, עלות הקלט נוחה. ארכיטקטורת ה-MoE פירושה שעלות ההיסק לטוקן נמוכה יותר מזו של מודל צפוף בעל כמות פרמטרים כוללת דומה, אך התמחור כאן נקבע לפי תעריף הספק – אתה משלם עבור היעילות.
OrcaRouter אינה חושפת באופן פומבי האם שמירה במטמון (caching) של הנחיות זמינה עבור מודל זה. אם שמירה במטמון הייתה מיושמת, היא הייתה יכולה להפחית עלויות על ידי הימנעות מקידוד חוזר של תחיליות הנחיה זהות. עם זאת, תכונה כזו לא מוזכרת במפורש עבור מודל זה. על המשתמשים להניח שכל בקשה מחויבת בתעריפים הסטנדרטיים לפי אסימון. עבור הנחיות חוזרות, שקלו לקבץ שאילתות או להשתמש בתחיליות קצרות יותר כדי למזער את השימוש באסימוני קלט. ניתן גם לעקוב אחר מספרי האסימונים דרך שדה השימוש (usage) בתגובת ה-API כדי לייעל עלויות. עבור שימוש בהיקף ארגוני, צרו קשר עם OrcaRouter כדי לדון בהסדרים מותאמים אישית או תמיכה בשמירה במטמון.
אפס תוספת מחיר פירושו ש-OrcaRouter גובה ממך בדיוק את אותו מחיר לכל טוקן שנקבע על ידי ספק המודל (Qwen). לא מתווספות דמי פלטפורמה, עלויות תקורה או מרווח רווח. המחירים $0.25 למיליון טוקני קלט ו-$1.48 למיליון טוקני פלט הם התעריפים של הספק עצמו. זוהי שקיפות בתמחור; אתה משלם רק עבור עלות ההסקה הבסיסית. OrcaRouter עדיין מנהלת את תשתית ה-API, הניתוב והחיוב, אך אינה גובה תשלום נוסף עבור שירות זה. זה יכול להפוך את Qwen3.6 35B A3B לחסכונית יותר בהשוואה לפלטפורמות אחרות שעשויות להוסיף תוספת מחיר. עם זאת, ייתכן שעדיין תצטרך להשוות עלויות כוללות, כולל כל הנחות כמות או קרדיטים ש-OrcaRouter מציעה בנפרד.
השתמש בנקודת הקצה של השלמות צ'אט תואמת OpenAI בכתובת https://api.orcarouter.ai/v1. הגדר את פרמטר המודל ל-"qwen/qwen3.6-35b-a3b". בנה הודעות כפי שהיית עושה עם ה-API של OpenAI, כולל הודעת מערכת אם תרצה, והודעות משתמש. עבור קלט מולטימודלי, כלול מערך של חלקי תוכן עם סוג "text" ו-"image_url" (או "video_url"). דוגמה (קוד פסאודו): curl https://api.orcarouter.ai/v1/chat/completions -H "Authorization: Bearer YOUR_ORCAROUTER_API_KEY" -d '{"model":"qwen/qwen3.6-35b-a3b","messages":[{"role":"user","content":[{"type":"text","text":"Describe this image"},{"type":"image_url","image_url":{"url":"https://example.com/photo.jpg"}}]}]}'. התגובה עוקבת אחר הפורמט של OpenAI עם choices, usage וכו'.
פרמטרים סטנדרטיים של OpenAI נתמכים: temperature (0 עד 2, ברירת מחדל 1), top_p (0 עד 1, ברירת מחדל 1), max_tokens (עד 65536), רצפי עצירה, frequency_penalty, presence_penalty, ו-stream. עבור בקשות מולטימודליות, ניתן להעביר תמונות כ-URLs של נתונים בפורמט base64 או כ-URLs ציבוריים. הזנות וידאו עשויות לדרוש קידוד ספציפי—בדוק את התיעוד של OrcaRouter. פרמטרים נוספים כמו seed לשחזוריות עשויים להיות נתמכים אך אינם מובטחים. המודל אינו תומך בקריאה לפונקציות או בכלים באופן טבעי; עם זאת, ניתן לחקות קריאות לכלים על ידי הוראת המודל בהנחיית המערכת. לצורך קריאות מקבילות לכלים, תצטרך לנהל את הלולאה באופן חיצוני. Streaming מומלץ עבור יישומים בזמן אמת כדי להפחית את החביון הנתפס.
אם אתה רגיל ל-API תואם OpenAI, ההעברה דורשת שינוי רק של כתובת ה-URL הבסיסית ומזהה המודל. החלף את נקודת הקצה הקיימת שלך בכתובת https://api.orcarouter.ai/v1 והגדר את המודל ל- "qwen/qwen3.6-35b-a3b". האימות משתמש במפתח API שסופק על ידי OrcaRouter (מוגדר בכותרת Authorization כ-Bearer). מגבלות הקצב והחיוב מנוהלות על ידי OrcaRouter. לצורך העברה מולטימודלית, ודא שעיצוב התמונות/הווידאו שלך תואם לסכֵמה הצפויה (תואמת OpenAI). פורמט התגובה זהה לזה של השלמות צ'אט של OpenAI, כך שקוד הפענוח הקיים שלך אמור לעבוד עם שינויים מינימליים. בדוק עם בקשה בודדת כדי לאשר שספירת הטוקנים והאחזור מקובלים.
כן, המודל תומך בסטרימינג באמצעות פרוטוקול server-sent events (SSE) התואם ל-OpenAI. הגדר "stream": true בבקשה שלך. הזרם יפלוט טוקנים דלתא כפי שהם נוצרים, בדיוק כמו בסטרימינג של OpenAI, כולל מידע על finish_reason ו-usage באירוע האחרון. סטרימינג שימושי עבור יישומים אינטראקטיביים שבהם ברצונך להציג פלט באופן מצטבר. שים לב שסטרימינג אינו מפחית את עלויות הטוקנים הכוללות; תחויב על הפלט המלא. ארכיטקטורת MoE עשויה להפיק טוקנים בקצב עקבי, אך התפוקה בפועל תלויה בעומס הרשת והשרת. בדוק את האינטגרציה שלך כדי להבטיח טיפול נכון באירועי הזרם.
בהשוואה ל-Mixtral 8x7B (דגם MoE פופולרי עם סה"כ 47B פרמטרים, 12.9B פעילים), ל-Qwen3.6 35B A3B יש פחות פרמטרים סה"כ אך גם פחות פרמטרים פעילים (3B לעומת 12.9B). זה הופך אותה לחסכונית יותר פוטנציאלית לטוקן. חלון ההקשר של 262K טוקנים גדול משמעותית מה-32K ברירת המחדל של Mixtral (למרות שניתן להרחיב את Mixtral). Qwen3.6 A3B תומך גם בקלט תמונה ווידאו, דבר ש-Mixtral לא תומך בו באופן טבעי. במדדים, Mixtral מקבל ציון סביב 65-70 ב-τ²-Bench? לא סופק; אבל הציון 95.3 של Qwen גבוה מאוד עבור אותו מדד ספציפי. עבור משימות טקסט טהורות בהקשר קצר, Mixtral עשויה להציג ביצועים דומים או טובים יותר בחלק ממשימות החשיבה בשל יותר פרמטרים פעילים. עבור משימות הקשר ארוך ורב-מודאליות, ל-Qwen3.6 A3B יש יתרון ברור.
מודל צפוף עם 35B פרמטרים ידרוש בערך פי 12 יותר חישוביות לטוקן מאשר 3B הפרמטרים הפעילים במודל MoE זה. Qwen3.6 A3B מציע אפוא יתרון במהירות ובעלות בזמן ההסקה, במחיר פוטנציאלי של עקביות מסוימת, שכן ניתוב המומחים עשוי לא להפעיל תמיד את המומחים הרלוונטיים ביותר עבור כל קלט. מודלים צפופים משיגים לעיתים קרובות איכות צפויה יותר על פני משימות מגוונות. עם זאת, ציון τ²-Bench מצביע על כך שמודל MoE זה יכול להתחרות במודלים צפופים בהיגיון על פני הקשר ארוך. אם יש לך עומס ייצור בנפח גבוה שבו השהייה ועלות הן קריטיות, הגישה של MoE מועילה. עבור מחקר הדורש התנהגות דטרמיניסטית, ייתכן שמודל צפוף עדיף.
בחר ב-Qwen3.6 35B A3B כאשר היישום שלך דורש: (1) עיבוד מסמכים ארוכים מאוד (עד 262K token) במעבר בודד, (2) הבנה רב-מודאלית הכוללת תמונות ווידאו, (3) ביצועים חזקים במשימות הכוללות שליפה והסקה על פני הקשרים גדולים (כפי שנמדד על ידי τ²-Bench), ו-(4) יעילות עלות הודות לארכיטקטורת MoE בעלת פרמטרים פעילים נמוכים. אם המשימות שלך הן קצרות, מבוססות טקסט בלבד, ואינן דורשות הקשר ארוך, מודל זול יותר כמו מודל צפוף בגודל 7B עשוי להספיק. עבור משימות הדורשות את האיכות הגבוהה ביותר במדדים מצומצמים (למשל בעיות מתמטיות תחרותיות), מודל צפוף גדול יותר (למשל 70B) עשוי להציג ביצועים טובים יותר.
חלופות כוללות את הדגמים הצפופים Qwen2.5 32B או 72B אם אתה זקוק לאיכות עקבית יותר בכל המשימות. עבור מולטימודלי, GPT-4o או Claude 3.5 Sonnet מציעים הבנה חזותית רחבה יותר אך בעלות גבוהה יותר. לתפוקה גבוהה מאוד, מודל MoE קטן יותר כמו Qwen2.5 14B A2B עשוי להיות זול יותר. אם אתה זקוק לקריאה לפונקציות או לשימוש בכלים עם פלטים מובנים, שקול מודלים עם תמיכה מקורית בקריאה לפונקציות (למשל, GPT-4 או Claude). הבחירה תלויה בסופו של דבר בשילוב הספציפי שלך של אורך ההקשר, מודליות, סובלנות לעיכוב ותקציב. תמיד הפעל הערכה משלך באמצעות דוגמאות מייצגות.
תואם OpenAI — המשיכו להשתמש ב-SDK שכבר יש לכם
https://api.orcarouter.ai/v1import os
from openai import OpenAI
client = OpenAI(
base_url="https://api.orcarouter.ai/v1",
api_key=os.environ["ORCAROUTER_API_KEY"],
)
response = client.chat.completions.create(
model="qwen/qwen3.6-35b-a3b",
messages=[{"role": "user", "content": "Hello"}],
)
print(response.choices[0].message.content)enable_searchenable_thinkinginclude_reasoninglogprobsmax_tokensnparallel_tool_callspresence_penaltyreasoningrepetition_penaltyresponse_formatseedstopstreamstream_optionstemperaturethinking_budgettool_choicetoolstop_ktop_logprobstop_p| קלט / 1M טוקנים | $0.248 |
| פלט / 1M tokens | $1.485 |
| מטבע | USD |
הערכה מבוססת מחיר מחירון
הערכה בלבד — ספירת הטוקנים בפועל תלויה בטוקנייזר של הספק.
על מה מפתחים מדברים השבוע
GET /api/public/models/qwen/qwen3.6-35b-a3bפתיחה @misc{orcarouter_qwen3_6_35b_a3b,
title = {Qwen3.6 35B A3B API},
author = {Qwen},
year = {2026},
howpublished = {OrcaRouter},
url = {https://www.orcarouter.ai/models/qwen/qwen3.6-35b-a3b}
}Qwen. (2026). Qwen3.6 35B A3B API. OrcaRouter. https://www.orcarouter.ai/models/qwen/qwen3.6-35b-a3b