Qwen3-VL 235B-A22B Instruct — מודל ראייה-שפה במשקל פתוח, 235B סך הכל / 22B פרמטרים פעילים, 256k הקשר, ללא מצב חשיבה.
Qwen3 VL 235B A22B Instruct הוא גרסת ראייה-שפה מסדרת דגמי Qwen3, שנבנתה על ידי Alibaba Cloud. הוא משתמש בעיצוב mixture-of-experts עם 235 מיליארד פרמטרים בסך הכל, מתוכם כ-22 מיליארד פעילים בכל מעבר…
המודל מצטיין במשימות שבהן תמונות וטקסט מקיימים אינטראקציה. הוא יכול לענות על שאלות לגבי תוכן של תמונה, לתאר סצנות בפירוט, לקרוא טקסט ממסמכים או שלטים, ולהסיק על קשרים בין אובייקטים בתמונה. הוא גם מטפל במספר תמונות בשיחה אחת, ומאפשר ניתוח השוואתי או חשיבה רציפה. כוונון ההוראות (instruction tuning) מאפשר למודל לעקוב אחרי פרומפטים מולטי-מודליים מורכבים, כגון 'הסבר מדוע תרשים זה מראה מגמה' או 'חלץ את כל הערכים המספריים מטבלה זו'. יכולות אלו נובעות ממנוע ה‑MoE הגדול ומאימון מיוחד של ראייה-שפה.
בהיותו וריאנט של Instruct, המודל כוונן באופן ספציפי כדי לעקוב אחר הוראות משתמש בנאמנות גבוהה, הן בהנחיות טקסטואליות בלבד והן בהנחיות מולטי-מודליות. הוא מסוגל לנהל שיחות מרובות-סיבובים שבהן תמונות מוצגות בהדרגה, לשמור על הקשר לאורך מספר חילופי דברים, ולעקוב אחר הוראות עיצוב (למשל, פלט כ-JSON, נקודות תבליטים, או שלב אחר שלב). הוא מבצע היטב משימות הדורשות הקפדה על אילוצים, כגון 'ענה רק אם התמונה מכילה כלב.' זה הופך אותו למתאים ליישומים שבהם התנהגות עקבית ושומרת-כללים היא חשובה.
עבור משימות טקסט בלבד ללא רכיב ויזואלי, מודל 235B MoE עשוי להיות מוגזם; מודלים צפופים קטנים יותר או גרסאות Qwen אחרות לטקסט בלבד יהיו חסכוניות יותר. באופן דומה, אם התמונות שלך פשוטות (למשל, לוגואים בסיסיים, אובייקטים בודדים) או שאתה זקוק לתפוקה גבוהה במיוחד בתקציב מוגבל, מודל ראייה קטן יותר כמו Qwen2-VL 7B עשוי להספיק. מודל זה מוצדק ביותר כאשר אתה צריך לטפל בתמונות מורכבות ברזולוציה גבוהה, במסמכים עם טקסט צפוף, או במשימות הדורשות חשיבה רב-מודאלית מעמיקה. ב-OrcaRouter, תוכל להשוות מחירים ולהחליף מזהי מודל בקלות.
לא. Qwen3 VL 235B A22B Instruct הוא מודל ליצירת טקסט המקבל תמונות כקלט בלבד. הוא אינו מייצר תמונות, אודיו או כל אמצעי אחר. הפלט הוא תמיד מחרוזת טקסט. אם אתה זקוק ליצירת תמונות, תשתמש במודל נפרד. עוצמתו של מודל זה טמונה בהבנה והסקה על קלט חזותי. לדוגמה, הוא יכול לתאר איך תמונה נראית או לענות על שאלות לגביה, אך אינו יכול ליצור, לערוך או לשנות תמונות בעצמו.
ציון ה-MMLU-Pro המדווח עבור מודל זה הוא 82.3. MMLU-Pro היא גרסה משופרת של מבחן ההבנה הרב-משימתית ההמונית (Massive Multitask Language Understanding), המכסה 57 נושאים בתחומי STEM, מדעי הרוח ומדעי החברה. ציון של 82.3 מצביע על ידע כללי חזק ויכולת חשיבה במגוון נושאים. זהו ציון מצטבר יחיד; הביצועים עשויים להשתנות לפי נושא. ציון זה ממקם את המודל בין המובילים בקטגוריית הגודל שלו, במיוחד בהתחשב בארכיטקטורת MoE המפעילה רק חלק קטן מסך הפרמטרים שלו לכל שאילתה.
יתרונות כוללים דיוק גבוה באמות מידה להסקה רב-מודאלית, ביצוע הוראות חזק, ויעילות עלות ביחס למודלים צפופים בעלי סך פרמטרים דומה. העיצוב של MoE מאפשר להגדיל קיבולת ללא עלות חישוב יחסית. מגבלות כוללות עלות מוחלטת גבוהה יותר בהשוואה למודלים קטנים יותר, פוטנציאל להשהייה מוגברת בשל המספר הגדול של סך הפרמטרים (גם שרק 22B פעילים, יש לטעון את כל המודל בזיכרון). ייתכן שלעיתים הוא ייצור הזיות בפרטים עדינים בתמונות או ייכשל בקלטים חזותיים דו-משמעיים ביותר. ביצועים במשימות תחום ספציפיות (למשל, דימות רפואי) אינם מובטחים.
מהירות ההסקה תלויה בחומרת הקצה האחורי שבה משתמש OrcaRouter ובעומס הנוכחי. כמודל MoE עם 235 מיליארד פרמטרים בסך הכל, הוא דורש זיכרון GPU משמעותי אף על פי שרק 22 מיליארד פרמטרים מופעלים לכל טוקן. דבר זה מוביל בדרך כלל לזמן השהיה גבוה יותר לכל בקשה בהשוואה למודלים צפופים קטנים יותר (למשל, 7B-70B פרמטרים). התפוקה מושפעת גם מגודל האצווה ומאורך הרצף. עבור יישומים רגישים לזמן השהיה, שקול להשתמש במודל קטן יותר או לבצע אופטימיזציה לפרומפטים קצרים יותר. OrcaRouter אינו מספק ערבויות ספציפיות לזמן השהיה אך שואף לתגובתיות ברמת ייצור.
OrcaRouter גובה בדיוק את התעריף הרשום של הספק: 0.40$ למיליון טוקנים בקלט ו-1.60$ למיליון טוקנים בפלט. אין תוספת סימון. טוקני קלט ופלט נספרים על פי כללי הטוקניזציה של OpenAI, שעשויים להיות שונים מעט מהטוקנייזר הפנימי של המודל. תמונות מחויבות גם כטוקנים על סמך הממדים ורמת הפירוט שלהן, בהתאם למדיניות הספק. ניתן להעריך עלויות על ידי הכפלת השימוש הצפוי בטוקנים בתעריפים אלה.
העלות לטוקן גבוהה יותר מדגמים קטנים יותר או דחוסים, אך ארכיטקטורת MoE מספקת יותר קיבולת לפרמטר פעיל מאשר דגם דחוס בגודל פעיל שווה ערך. עבור משימות מולטי-מודליות מורכבות, דגם זה עשוי להשלים את המשימה בפחות טוקנים או בדיוק גבוה יותר, ובכך להפחית את ההוצאה הכוללת. עם זאת, עבור משימות פשוטות, דגם זול יותר יפחית עלויות. ב-OrcaRouter, ניתן להחליף דגמים תוך כדי תנועה, מה שמאפשר להשתמש בדגם זה רק בעת הצורך. אין התחייבויות חודשיות מינימליות או עמלות נסתרות.
OrcaRouter אינו חושף כרגע מדיניות שמירה במטמון ספציפית עבור מודל זה. שמירה במטמון ברמת האסימון (token) עשויה להיות מיושמת על ידי הספק הבסיסי, אך אינה מובטחת. לא מוזכרים הנחות בכמות או תמחור מדורג; התעריפים קבועים לכל אסימון. עבור משתמשים בהיקף גבוה, ייתכן שכדאי לפנות לתמיכה של OrcaRouter לצורך הסדרים מותאמים אישית פוטנציאליים. באופן כללי, התמחור הוא שקוף ומבוסס על שימוש.
תמונות מומרות לספירת טוקנים בהתבסס על הרזולוציה והגדרת הפירוט שלהן. הנוסחה המדויקת מוגדרת על ידי הספק (Qwen) ועשויה להשתנות. בדרך כלל, תמונות ברזולוציה גבוהה יותר צורכות יותר טוקנים. OrcaRouter מעביר את הטוקניזציה של הספק ללא שינוי. ניתן לשלוט בעלויות על ידי שינוי גודל תמונות או שימוש במצב פירוט נמוך אם הדגם תומך בכך. תמיד יש לעיין בתיעוד הספק לחישוב הטוקנים המדויק של תמונות. טוקני קלט לתמונות נספרים בתעריף של $0.40 למיליון.
אתה שולח בקשת POST ל- https://api.orcarouter.ai/v1/chat/completions עם מטען JSON תואם OpenAI. הגדר את שדה model ל- "qwen/qwen3-vl-235b-a22b-instruct". כלול מערך messages שבו כל הודעה יכולה להכיל תוכן טקסט ו/או תמונה. עבור תמונות, השתמש בפורמט התוכן הסטנדרטי של OpenAI לתמונות (URL או base64). האימות הוא באמצעות אסימון Bearer (מפתח ה-API שלך). פרמטרים לדוגמה: temperature, max_tokens, top_p, ו- stop sequences פועלים באופן זהה ל- OpenAPI API. התיעוד של OrcaRouter מספק פרטים מלאים.
כל הפרמטרים הסטנדרטיים של השלמות צ'אט נתמכים: temperature (0-2, ברירת מחדל 1), top_p (0-1, ברירת מחדל 1), max_tokens (מספר אסימוני הפלט), stop (רשימת מחרוזות), presence_penalty, frequency_penalty, ו-seed לשחזוריות. המודל גם מכבד הודעות מערכת לקביעת התנהגות. עבור בקשות רב-מודליות, עליך לכלול חלק תמונה בתוכן של הודעת משתמש. אין פרמטרים ספציפיים למודל חשופים; ה-API נשמר גנרי לצורך תאימות. אם ברצונך לשלוט בניתוב MoE, הדבר מטופל באופן פנימי.
כן. מכיוון ש-OrcaRouter משתמש בפורמט ה-API של OpenAI, ההעברה היא פשוטה. החלף את כתובת ה-URL הבסיסית וה-ID של המודל הקיימים שלך בנקודת הקצה של OrcaRouter וב-"qwen/qwen3-vl-235b-a22b-instruct". ודא שמפתח ה-API שלך תקף ושיש לך מספיק קרדיטים. פורמט ההודעה לתמונות זהה לזה של OpenAI (באמצעות סוג התוכן 'image_url'). ייתכן שתצטרך להתאים את אומדני ספירת ה-tokens בשל טוקניזציה שונה. אין צורך בשינויים בלוגיקה של האפליקציה שלך מעבר לנקודת הקצה ושם המודל.
Qwen3 VL 235B A22B Instruct ו-GPT-4V שניהם מטפלים בקלטים מולטי-מודליים. ההבדלים העיקריים: Qwen3 VL משתמש ב-MoE עם 22B פרמטרים פעילים, בעוד GPT-4V הוא מודל דחוס קנייני בגודל לא ידוע. התמחור של Qwen3 VL דרך OrcaRouter הוא $0.40/$1.60 למיליון טוקנים, שהוא נמוך משמעותית מתעריפי GPT-4V האופייניים. ציוני הבנצ'מרק אינם ניתנים להשוואה ישירה מכיוון ש-MMLU-Pro ומבחנים אחרים משתמשים בתת-קבוצות שונות. ל-GPT-4V יש תמיכה אקוסיסטמית רחבה יותר, אך Qwen3 VL מציע יתרון עלות עבור עומסי עבודה מולטי-מודליים בהיקפים גדולים ב-OrcaRouter.
Claude 3.5 Sonnet הוא מודל צפוף (dense model) מבית Anthropic בעל יכולות טקסט וראייה חזקות. הוא אינו משתמש ב-MoE, כך שהקיבולת הכוללת שלו קטנה מסך הפרמטרים של Qwen3 VL, אך הקיבולת הפעילה שלו לכל מסקנה (inference) גבוהה מ-22B. התמחור עבור Claude 3.5 Sonnet הוא בדרך כלל גבוה יותר לכל אסימון (token) (כ-$3.00/$15.00 למיליון אסימונים). Qwen3 VL מציעה עלות נמוכה בהרבה עבור משימות מולטי-מודליות. עם זאת, למודלי Claude יש חלון הקשר גדול יותר (200K אסימונים). הבחירה תלויה בתקציב, בצרכי אורך ההקשר ובספק המועדף.
OrcaRouter מציע ככל הנראה דגמי Qwen נוספים כגון Qwen2.5 7B, Qwen2.5 72B, או גרסאות Qwen2-VL. ה-Qwen3 VL 235B A22B Instruct הוא דגם ה-MoE הרב-מודאלי הגדול ביותר בסדרת Qwen. בהשוואה ל-Qwen2-VL 72B, יש לו יותר פרמטרים כוללים וארכיטקטורת MoE, מה שיכול להניב ביצועים טובים יותר במשימות מורכבות תוך שמירה על עלות הסקה סבירה. הוא יקר יותר לכל טוקן מדגמי Qwen קטנים יותר, אך עשוי להיות חסכוני אם הוא מפחית את הצורך בקריאות מרובות או בצריכת טוקנים גבוהה.
תואם OpenAI — המשיכו להשתמש ב-SDK שכבר יש לכם
https://api.orcarouter.ai/v1from openai import OpenAI
client = OpenAI(
base_url="https://api.orcarouter.ai/v1",
api_key="$ORCAROUTER_API_KEY",
)
response = client.chat.completions.create(
model="qwen/qwen3-vl-235b-a22b-instruct",
messages=[{"role": "user", "content": "Hello"}],
)
print(response.choices[0].message.content)| קלט / 1M טוקנים | $0.400 |
| פלט / 1M tokens | $1.60 |
| מטבע | USD |
הערכה מבוססת מחיר מחירון
הערכה בלבד — ספירת הטוקנים בפועל תלויה בטוקנייזר של הספק.
GET /api/public/models/qwen/qwen3-vl-235b-a22b-instructפתיחה @misc{orcarouter_qwen3_vl_235b_a22b_instruct,
title = {Qwen3 VL 235B A22B Instruct API},
author = {Qwen},
year = {2025},
howpublished = {OrcaRouter},
url = {https://www.orcarouter.ai/models/qwen/qwen3-vl-235b-a22b-instruct}
}Qwen. (2025). Qwen3 VL 235B A22B Instruct API. OrcaRouter. https://www.orcarouter.ai/models/qwen/qwen3-vl-235b-a22b-instruct