גרסה חסרת אובדן וללא צנזורה של Qwen3.6 35B A3B השומרת על יכולות המודל המקורי תוך הסרת התנהגות סירוב. נבנתה עבור מפתחים, חוקרי בינה מלאכותית וזרימות עבודה מתקדמות של סוכנים הדורשות פלטים בלתי מוגבלים מהמודל מבלי לפגוע בחשיבה, בקידוד, בביצועים רב-לשוניים או בשימוש בכלים. הגרסה האגרסיבית (Aggressive variant) פתוחה לחלוטין ומיועדת לספק תגובות ישירות ומלאות על פני מגוון רחב של הנחיות. בעוד שהמודל עשוי לצרף מדי פעם הבהרות מידע קצרות שעברו בירושה מאימון המודל הבסיסי, אלו אינן סירובים והתוכן המבוקש עדיין נוצר במלואו. אידיאלית עבור מחקר בינה מלאכותית, בדיקות אבטחה, צוותי אדום (red teaming), פיתוח סוכנים, עוזרי קידוד ויישומי בינה מלאכותית מתקדמים אחרים הנהנים מגמישות מרבית בפלט. הגישה למודל זה מוגבלת ומיועדת לחוקרי אבטחה, צוותי אדום, חוקרי בטיחות בינה מלאכותית ואנשי מקצוע מוסמכים אחרים העורכים מחקר, הערכה ובדיקות לגיטימיים.
מודל זה הוא וריאנט Mixture-of-Experts מסדרת Qwen3.6, שפותח במקור על ידי Alibaba Cloud ומתארח על ידי הספק Obsidian ב-OrcaRouter. יש לו 35 מיליארד פרמטרים בסך הכל, כאשר רק 3 מיליארד מופעלים לכל טוקן,…
המודל הזה מצטיין במשימות שמרוויחות מחלון הקשר רחב והבנה רב-מודאלית. עבור טקסט, הוא יכול לסכם או לענות על שאלות על מסמכים באורך של עד 262,144 טוקנים, כמו ספרים שלמים או דוחות ארוכים. עבור תמונות וסרטונים, הוא יכול לחלץ מידע מפורט ולשלב אותו עם הקשר טקסטואלי. האופי הלא מצונזר מאפשר לו ליצור תוכן יצירתי ללא אילוצי בטיחות אופייניים, שימושי עבור יצירת סיפורים, משחקי תפקידים או תרחישים אחרים שבהם מסננים מגבילים אינם רצויים. עיצוב MoE מספק הסקה מהירה יחסית למודלים צפופים בגודל כולל דומה, מה שהופך אותו למעשי עבור יישומים בזמן אמת כאשר הוא נפרס ביעילות. יכולות רב-לשוניות עוברות בירושה ממשפחת Qwen3.6, התומכת בשפות רבות.
התווית "uncensored" פירושה שהמודל עבר הכשרת יישור מצומצמת בהשוואה לנקודות ביקורת סטנדרטיות של Qwen3.6. זה עלול לגרום לתפוקות המסוננות פחות עבור תוכן מזיק, פוגעני או שנוי במחלוקת. על המשתמשים לבדוק את המודל ביסודיות במקרה השימוש הספציפי שלהם כדי להבטיח שהתפוקות עומדות בסטנדרטים שלהם. היעדר הצנזורה יכול להיות מועיל למשימות כמו כתיבה יצירתית, משחק תפקידים ללא צנזורה, או מחקר בנושאים רגישים שבהם רצויה יצירה ניטרלית. עם זאת, זה גם אומר שהמודל עלול לייצר תוכן המפר מדיניות תוכן טיפוסית. OrcaRouter אינה טוענת לסינון בטיחות נוסף; ההתנהגות הבסיסית של המודל היא מה שאתה מקבל.
אם המשימה שלך כוללת קלטים קצרים (למשל, כמה מאות טוקנים), סיווג פשוט, או דורשת רק הבנת שפה בסיסית, מודלים קטנים וזולים יותר כמו Qwen2.5-7B או GPT-4o-mini עשויים להיות חסכוניים יותר. חוזקות המודל הזה בולטות ביותר כאשר מטפלים בהקשרים ארוכים מאוד (מעל 10K טוקנים) או בקלטים מולטי-מודליים. עבור משימות טקסט טהור מתחת ל-8K טוקנים שאינן דורשות יכולת תמונה/וידאו, ייתכן שתחסוך כסף על ידי שימוש במודל קטן ייעודי. כמו כן, אם היישום שלך דורש סינון תוכן קפדני, האופי הלא מצונזר עלול לאלץ אותך להוסיף שכבת ניטור חיצונית, מה שמוסיף עלות.
המודל מקבל קלטי תמונה ווידאו בנוסף לטקסט. עבור תמונות, ניתן לספק נתוני תמונה מקודדים ב-base64 או כתובות URL (באמצעות מערך התוכן של ה-API עם סוג "image_url"). עבור וידאו, הסביר שה-API מקבל פריימים של וידאו כרצפי תמונות או כתובות URL של קבצי וידאו; יש לבדוק את הפורמט המדויק בתיעוד של OrcaRouter. המודל מעבד את קלטי הוויזואליה הללו יחד עם טקסט כדי לייצר תגובות. חלון הקשר של 262,144 אסימונים חל על ספירת האסימונים המשולבת של כל אופני הקלט. שימו לב שעיבוד תמונות ווידאו צורך אסימונים באופן יחסי לרזולוציה הוויזואלית ולאורך, לכן קלטים גדולים יותר יפחיתו את קיבולת הטקסט הזמינה.
לא סופקו ציוני benchmark ספציפיים עבור דגם זה על ידי הספק. סדרת Qwen3.6 בדרך כלל מתחרה היטב במבחני קונטקסט ארוך כמו L-Eval ו-RULER, ובמשימות מולטי-מודאליות כמו MMMU ו-MathVista, אך נתונים מדויקים עבור גרסת uncensored 35B A3B זו לא פורסמו. משתמשים המעוניינים בביצועים אמפיריים צריכים להריץ הערכות משלהם על מערכי נתונים מייצגים. ארכיטקטורת MoE עם 3B פרמטרים מופעלים לרוב מניבה תוצאות דומות לדגמים צפופים בגודל פעיל דומה, בעוד שעלויות האחסון והזיכרון הכוללות גבוהות יותר בשל 35B הפרמטרים המלאים.
מהירות ושהייה תלויות במספר גורמים: אורך הקלט, אורך הפלט, עומס השרת ותצורת החומרה. מכיוון שהמודל מפעיל רק 3B פרמטרים לכל טוקן, צפוי שהוא יהיה מהיר יותר ממודל צפוף בעל 35B, עם קצבי יצירה דומים למודלים כמו GPT-3.5 (אם כי לא מסופקים נתונים מדויקים). התשתית של OrcaRouter דרך Obsidian עשויה להציע שהייה משתנה; משתמשים יכולים לבדוק עם עומסי העבודה שלהם. בתרחישי הקשר ארוך (למשל, 100K+ טוקנים), זמן הטעינה מראש גדל באופן ליניארי עם אורך הקלט. יצירת טוקני הפלט היא בדרך כלל התורם העיקרי לשהייה. לא מוצהר על הסכם רמת שירות (SLA) למהירות.
החוזקות של המודל כוללות חלון הקשר רחב של 262K, המאפשר עיבוד של ספרים שלמים או תמלילי וידאו מרובי שעות במעבר אחד. העיצוב מבוסס MoE מספק איזון טוב בין קיבולת למהירות הסקה. קלט מולטימודלי מאפשר משימות המשלבות נתוני טקסט וויזואליים. האופי הלא מצונזר מאפשר יצירת תוכן שמודלים אחרים עשויים לסרב לו. התמיכה הרב־לשונית מכסה עשרות שפות. התמחור תחרותי עבור מודל ברמה זו: $0.31/M לקלט ו-$4.21/M לפלט, ללא תוספת מחיר.
המגבלות כוללות היעדר נתוני מדדי ביצוע מפורסמים, מה שמקשה על הערכת ביצועים יחסיים. האופי הבלתי מסונן עלול לייצר פלטים לא רצויים ללא תוספת סינון. ספירת הפרמטרים המופעלים של 3B פירושה שהיא עשויה שלא להשתוות לכוח החשיבה הגולמי של מודלים צפופים גדולים יותר (למשל, GPT-4) במשימות לוגיות מורכבות. ייתכן שיכולות מולטי-מודאליות פחות מעודנות מאשר מודלים ייעודיים של ראייה-שפה. אופני קלט כמו טוקניזציה של וידאו עלולים להפחית את ההקשר האפקטיבי לטקסט. אין ערובה ליכולות סטרימינג או שימוש בכלים. לבסוף, התלות בספק הצד השלישי Obsidian פירושה שזמינות וזמן פעילות אינם תחת שליטת OrcaRouter.
התמחור שקוף: $0.31 למיליון טוקני קלט ו-$4.21 למיליון טוקני פלט. אלו הם תעריפי הספק המדויקים מ-Obsidian, ללא תוספת מחיר על ידי OrcaRouter. טוקני קלט כוללים את כל טקסט וטוקני חזותיים (לתמונות וסרטונים). טוקני פלט הם הטקסט שנוצר. אין דמי בקשה או מנוי נדרשים. אתה משלם רק עבור הטוקנים שנצרכו. התמחור הוא למיליון טוקנים, כך שבקשות קטנות עולות שברירי סנט. אין תוכנית חינמית או ניסיון המוצגים.
אין הנחות, הטבות מטמון או תמחור נפח שנחשפו עבור דגם זה. התעריפים הרשומים שטוחים לכל טוקן. בניגוד לספקים מסוימים המציעים מחירים מופחתים עבור טוקנים במטמון, OrcaRouter מיישם את אותו תעריף קלט ללא קשר לחזרתיות. לשימוש גבוה במיוחד, ניתן לפנות ל-OrcaRouter להסדרים מותאמים אישית פוטנציאליים, אך לא מתועדת הנחה סטנדרטית. מדיניות אפס-תוספת מבטיחה שאתה משלם בדיוק מה ש-Obsidian גובה, ללא עמלות נסתרות.
מודלים רב-מודליים עם הקשר ארוך מספקים אחרים עולים לעיתים קרובות יותר: לדוגמה, GPT-4 Turbo של OpenAI עולה $10/1M קלט ו-$30/1M פלט, בעוד Claude 3.5 Sonnet עולה $3/1M קלט ו-$15/1M פלט. המודל הזה זול באופן ניכר – $0.31/$4.21. עם זאת, המודלים הללו מציעים יכולות שונות (למשל, שימוש בכלים, מדדים גבוהים יותר של חשיבה). המחיר הנמוך משקף את ארכיטקטורת MoE ואת העובדה שמדובר במודל לא מצונזר המאוחסן על ידי צד שלישי. אם אתה זקוק לאמינות מובטחת, אבטחה גבוהה יותר או תכונות מתקדמות כמו function calling, העלות הנוספת עשויה להיות מוצדקת.
כדי להשתמש במודל, שלח בקשת POST ל-https://api.orcarouter.ai/v1/chat/completions (או לנקודת הקצה המתאימה לפי ה-API התואם ל-OpenAI של OrcaRouter). כלול את הכותרת "Authorization: Bearer YOUR_API_KEY". בגוף הבקשה, הגדר "model": "obsidian/Qwen3.6-35B-A3B". העבר הודעות בפורמט הסטנדרטי של OpenAI: מערך של אובייקטים עם "role" ו-"content". עבור תוכן מולטימודאלי, השתמש במערך תוכן עם סוג "text" ו-"image_url" (או המקבילה לווידאו). דוגמה עם cURL: curl https://api.orcarouter.ai/v1/chat/completions -H "Content-Type: application/json" -H "Authorization: Bearer $KEY" -d '{"model":"obsidian/Qwen3.6-35B-A3B","messages":[{"role":"user","content":[{"type":"text","text":"Describe this image"},{"type":"image_url","image_url":{"url":"https://example.com/photo.jpg"}}]}]}'
ניתן להשתמש בפרמטרים טיפוסיים התואמים ל-OpenAI: temperature (ברירת מחדל 1.0), top_p (0.9), max_tokens (ברירת המחדל משתנה, מומלץ להגדיר במפורש), stop sequences, frequency_penalty, presence_penalty, ו-seed לשחזור תוצאות. המודל תומך בסטרימינג באמצעות "stream": true כדי לקבל תגובות טוקן אחר טוקן. עבור קלטים רב-מודליים, ה-API מצפה למערכי תוכן עם type "image_url" ואופציונלית "video_url" (בדוק את תיעוד OrcaRouter לפורמט הווידאו המדויק). מגבלת חלון ההקשר של 262,144 טוקנים חלה על סך כל הטוקנים בהודעות בתוספת התגובה. אם תחרוג מהמגבלה, תקבל שגיאת אורך הקשר; תוכל להתאים את "max_tokens" או לקצר הודעות.
כדי לנצל את ההקשר של 262K, בנה/י את ההנחיות שלך כך שיכללו את המסמך המלא או היסטוריית השיחה. שים/י לב שכל טוקן בקלט נספר לעלות ולמגבלות. עבור קלטים ארוכים מאוד, שקול/י פיצול או סיכום לפני השליחה, למרות שהמודל מתוכנן להתמודד עם ההקשר המלא. השתמש/י בפרמטר "max_tokens" כדי לשלוט באורך הפלט. אם אתה/את נתקל/ת בשגיאות timeout, הפעל/י הזרמה (streaming) כדי לקבל תוצאות חלקיות מהר יותר. ל-OrcaRouter עשויות להיות הגדרות timeout משלו; צור/י קשר עם התמיכה אם יש צורך. המודל אינו תומך בהודעות system בצורה מיוחדת; התייחס/י אליהן כהודעת משתמש או עוזר עם תפקיד "system" (פורמט OpenAI סטנדרטי).
מעבר מספקים כמו OpenAI או Anthropic כרוך בשינוי כתובת ה-URL הבסיסית ל-https://api.orcarouter.ai/v1 ועדכון מזהה המודל. אם הקוד שלך משתמש ב-OpenAI Python client, הגדר client = OpenAI(api_key="YOUR_KEY", base_url="https://api.orcarouter.ai/v1") ולאחר מכן השתמש ב-client.chat.completions.create(model="obsidian/Qwen3.6-35B-A3B", ...). פורמט ההודעות ושמות הפרמטרים זהים לחלוטין. אין צורך בשינויים בלוגיקת ההנחיה. שים לב שגם צורות אובייקטי התגובה תואמות, כך שקוד ניתוח קיים אמור לעבוד. בדוק תחילה עם בקשה קטנה כדי לוודא אימות נכון וחיוב תקין.
בהשוואה ל-Qwen3.6-72B (דחוס), דגם זה משתמש ב-MoE ולכן יש לו עלות הסקה נמוכה יותר לכל טוקן אך ייתכן שיש לו יכולת גולמית נמוכה מעט. ההקשר של 262K גדול יותר מזה של Qwen2.5 (128K). בהשוואה ל-Qwen3.6-32B (אולי דחוס), דגם זה מציע קלט רב-מודאלי שאותן גרסאות קודמות אולי אין להן. הווריאנט "הלא מצונזר" הוא ייחודי; שחרורים סטנדרטיים של Qwen כוללים יישור. אם אתה זקוק לבטיחות מחמירה, בחר ב-Qwen3.6 הרגיל. מבחינת מחיר, דגם זה זול יותר מדגמי Qwen דחוסים רבים בפלטפורמות אחרות.
GPT-4o ו-Claude 3.5 Sonnet הם מודלים קנייניים עם אימון בטיחות מקיף, ציונים גבוהים יותר במדדי ביצועים על חשיבה ותכנות, ותומכים בשימוש בכלים, ראייה והקשר רחב (200K ל-Claude). מודל זה מציע הקשר גדול יותר (262K) וקלט רב-מודאלי במחיר נמוך משמעותית. עם זאת, חסרות בו התכונות המתקדמות, האמינות והעקביות בביצועים של אותם מודלים. עבור יישומים שבהם העלות היא השיקול העיקרי ואתה יכול לקבל פשרה מסוימת באיכות, מודל זה הוא אלטרנטיבה טובה. אם אתה זקוק ליכולות חשיבה מתקדמות או קריאה לפונקציות, המודלים הפרימיום שווים את העלות הנוספת.
דגם זה הוא הטוב ביותר כאשר אתה זקוק ל: (1) הקשר ארוך מאוד (262K טוקנים) בעלות נמוכה; (2) קלט רב-מודאלי (תמונות/וידאו) מבלי לשלם מחירי פרימיום; (3) יצירת טקסט ללא צנזורה שבה מסנני תוכן יפריעו; (4) הסקה מהירה יחסית לסך פרמטרים עקב הפעלת MoE. הוא מתמודד חזק למחקר, חילוץ נתונים, כתיבה יוצרת, וכל משימה שנהנית מהקשר גבוה ועלות נמוכה לטוקן. אם אתה זקוק לתכונות מתקדמות כמו קריאות לכלים, פלטים מובנים, או אמינות גבוהה, שקול דגמים אחרים.
| קלט / 1M טוקנים | $0.310 |
| פלט / 1M tokens | $4.21 |
| מטבע | USD |
הערכה מבוססת מחיר מחירון
הערכה בלבד — ספירת הטוקנים בפועל תלויה בטוקנייזר של הספק.
על מה מפתחים מדברים השבוע
GET /api/public/models/obsidian/Qwen3.6-35B-A3Bפתיחה @misc{orcarouter_qwen3_6_35b_a3b,
title = {Qwen3.6 35B A3B Uncensored (Aggressive) API},
author = {obsidian},
year = {2026},
howpublished = {OrcaRouter},
url = {https://www.orcarouter.ai/models/obsidian/Qwen3.6-35B-A3B}
}obsidian. (2026). Qwen3.6 35B A3B Uncensored (Aggressive) API. OrcaRouter. https://www.orcarouter.ai/models/obsidian/Qwen3.6-35B-A3B