גרסה חסרת אובדן וללא צנזורה של Gemma 4 26B A4B שנועדה לשמר את היכולות של המודל המקורי תוך מזעור התנהגות סירוב. מותאם למפתחים, חוקרי AI, ויישומים מתקדמים הדורשים תגובות איכותיות עם מגבלות מינימליות. גרסת Balanced מומלצת לרוב העומסים, ומספקת תשובות מלאות תוך שמירה על חשיבה יציבה והתנהגות שיח טבעית. בתרחישים רגישים מסוימים, המודל עשוי להציג בקצרה את מסגרת החשיבה שלו לפני מתן התשובה המלאה, אך הוא מתוכנן להימנע ממניעת תוכן. בהשוואה לגרסאות חסרות צנזורה אגרסיביות יותר, Balanced מציעה דגימה עקבית יותר, יציבות בהקשר ארוך יותר חזקה, וסחיפת נושא מופחתת בשיחות ממושכות. מתאים היטב לכתיבה יצירתית, משחקי תפקידים, עוזרים רב-לשוניים, חשיבה בהקשר ארוך, ויישומי AI לשימוש כללי שבהם איכות, קוהרנטיות ואמינות הם העדיפויות העיקריות. הגישה למודל זה מוגבלת ומיועדת לחוקרי אבטחה, צוותי רד, חוקרי בטיחות AI, ואנשי מקצוע מוסמכים אחרים העורכים מחקר, הערכה ובדיקות לגיטימיים.
Gemma 4 26B A4B Uncensored הוא מודל שפה מסוג mixture-of-experts (MoE) מסדרת Gemma 4 של גוגל, המתארח אצל הספק Obsidian ונגיש דרך OrcaRouter. יש לו 26 מיליארד פרמטרים בסך הכול, אך הוא מפעיל רק 4…
Gemma 4 26B A4B Uncensored מצטיינת במשימות הדורשות חשיבה על פני מרחקים ארוכים בהקשרים גדולים, כגון תקצור ספרים, שיחות מרובות סבבים עם היסטוריה נרחבת, וניתוח בסיסי קוד. ארכיטקטורת ה-MoE שלה הופכת אותה ליעילה לעיבוד אצווה שבו מונחים רבים מטופלים במקביל. יכולות מולטי-מודאליות מאפשרות לה לחשוב על תמונות – למשל, פירוש גרפים, ממים או תמונות מוצרים. ההתנהגות הלא מצונזרת אידיאלית לכתיבה יצירתית החוקרת נושאים בוגרים, משחקי תפקידים למבוגרים, או יצירת פרוזה ללא מגבלות תוכן. היא גם מבצעת היטב במבחני NLP סטנדרטיים לחשיבה, מתמטיקה וקוד, בדומה לגרסאות אחרות של Gemma 4.
אם המשימה שלך אינה דורשת הקשר ארוך (למשל, מתחת ל-8K אסימונים) או קלט מולטי-מודאלי, ייתכן שתוכל להיעזר במודל צפוף קטן יותר כמו Gemma 2 9B או Llama 3 8B, שהם מהירים וזולים יותר לאסימון. עבור משימות הדורשות מסנני בטיחות, המודל הלא מצונזר עלול להפיק תפוקות לא מתאימות—בחר במקום זאת במודל מכוון בטיחות. כמו כן, אם אתה זקוק לזמן השהייה נמוך במיוחד לצ'אט בזמן אמת, מודל MoE זה עשוי להיות איטי יותר ממודל צפוף קטן בשל תקורת ניתוב המומחים. שקול את צורכי התפוקה שלך: עבור בקשות בנפח גבוה ובהקשר קצר, מודל זול יותר כמו Gemma 2 27B (צפוף) עשוי להיות חסכוני יותר.
תכנון ה-mixture-of-experts מפעיל רק תת-קבוצה של פרמטרים לכל טוקן (4 מיליארד מתוך 26 מיליארד בסך הכל). הדבר מפחית את העלות החישובית לכל מעבר קדימה בהשוואה למודל צפוף של 26B, ומאפשר תפוקה גבוהה יותר על אותה חומרה. עם זאת, הניתוב מכניס תקורה קטנה של השהיה לכל טוקן ועלול להוביל לחוסר איזון בעומס המומחים אם ההנחיות (prompts) מתמחות מאוד. בפועל, מודלים מסוג MoE כמו זה מציעים פשרה טובה: איכות תחרותית עבור שבריר מ-FLOPs. 4B הפרמטרים הפעילים דומים למודל צפוף של 4B מבחינת חישוב לכל טוקן, אך המודל נהנה מהידע המאוחסן על פני 26B פרמטרים בסך הכל.
כן, המודל מקבל קלטים של טקסט ותמונה כאחד. ניתן לשלוח תמונה אחת או תמונות מרובות בבקשה, לצד הוראות טקסט. התמונות מקודדות ומעובדות יחד עם הטקסט בתוך חלון ההקשר של 262,144 אסימונים (tokens). זה מאפשר מענה לשאלות חזותיות, הבנת מסמכים ומשימות הדורשות ניתוח של תרשימים, דיאגרמות או צילומים. המודל משתמש במקודד חזותי (בדרך כלל רכיב דמוי ViT) כדי להמיר תמונות לאסימונים. בעוד שהפרטים המדויקים של הארכיטקטורה אינם מתועדים בפומבי, הוא תומך בפורמטי תמונה סטנדרטיים. שים לב שתמונות צורכות אסימונים ביחס לרזולוציה שלהן, כך שתמונות ברזולוציה גבוהה יפחיתו את הקשר הטקסט הזמין.
כבריאנט של Gemma 4, מודל הבסיס (עם כוונון בטיחות) הראה ביצועים חזקים במדדים של חשיבה כמו MMLU, GSM8K, ובמשימות קוד כגון HumanEval ו-MBPP. הגרסה הלא מצונזרת ככל הנראה שומרת על יכולות אלו מאחר שמשקלי המודל הבסיסיים נותרו ללא שינוי. עם זאת, ציוני מדד ספציפיים עבור גרסה לא מצונזרת זו לא פורסמו. משתמשים יכולים לצפות לתוצאות תחרותיות בחשיבה אריתמטית, יצירת קוד ומשימות רב-לשוניות. חלון ההקשר של 262K מאפשר גם ביצועים מעולים בשליפת מסמכים ארוכים וסיכומם בהשוואה למודלים עם הקשר קצר יותר. למדדים מולטי-מודליים, המודל אמור להתמודד כראוי עם מערכי נתונים של תשובות לשאלות חזותיות.
השהייה עבור המודל Gemma 4 26B A4B בדרך כלל נמוכה יותר מזו של מודל צפוף (Dense) בעל 26B פרמטרים, מכיוון שרק 4B פרמטרים פעילים לכל טוקן. עם זאת, מנגנון הניתוב של MoE מוסיף תקורה קטנה לכל טוקן שנוצר, כך שהשהייה הכוללת לטוקן עשויה להיות מעט גבוהה יותר מזו של מודל צפוף טהור בעל 4B פרמטרים. בהסקת אצווה (batch inference) עם רצפים ארוכים, התפוקה יכולה להיות גבוהה יותר בשל דרישות רוחב פס זיכרון מופחתות. ב-OrcaRouter, השהייה תהיה תלויה גם בחומרה הבסיסית המסופקת על ידי ספק Obsidian. יש לבדוק ביצועים בעולם האמיתי עם עומסי עבודה מייצגים כדי לקבוע אם הם עומדים בדרישות המהירות שלך.
למרות יתרונותיו, למודל זה יש מגבלות. 4B הפרמטרים הפעילים משמעותם שייתכן ויתקשה בביצועים בהיגיון מורכב מאוד או ידע תחום ספציפי לעומת מודלים גדולים יותר כמו Gemma 4 47B (דחוס) או מודלים מתקדמים. האופי הלא מצונזר משמעותו שפלטים עלולים להיות רעילים, מוטים, או לא מתואמים לערכי אנוש אם משתמשים בהם ללא מיתון. כמו כן, הוא עלול לייצר תוכן מזיק שמפר את מדיניות השימוש של OpenAI כאשר ניגשים אליו דרך OrcaRouter—המשתמשים אחראים לציות. בנוסף, ארכיטקטורת MoE עלולה להוביל לאיכות לא עקבית בין טוקנים אם ניתוב המומחים אינו אופטימלי. לבסוף, ההבנה הרב-מודלית, אף שקיימת, עשויה שלא להשתוות למודלים ייעודיים של ראייה-שפה.
תמחור עבור מודל זה נקבע על ידי הספק Obsidian ומועבר דרך OrcaRouter ללא תוספת רווח. אתה משלם $0.25 למיליון טוקני קלט ו-$2.90 למיליון טוקני פלט. טוקני קלט כוללים גם טוקני טקסט וגם טוקני תמונה (תמונות עוברות טוקניזציה לפני עיבוד). טוקני פלט מכסים את התגובה שנוצרת. אין עמלות נוספות עבור קריאות API או שימוש בחלון הקשר מעבר לעלות לטוקן. תמחור זה תחרותי עבור מודל MoE של 26B, במיוחד בהתחשב בחלון הקשר הגדול. החיובים מחושבים לפי בקשה ומופיעים בדוח החיוב של OrcaRouter שלך.
טוקני פלט יקרים באופן משמעותי מטוקני קלט ($2.90 לעומת $0.25 למיליון). זה אופייני למודלי שפה מכיוון שיצירת טוקנים דורשת יותר חישוב מאשר עיבוד קלט. כדי למזער עלויות, ניתן לבנות פרומפטים כך שיקטינו את מספר טוקני הפלט – לדוגמה, על ידי בקשה לתשובות קצרות יותר או שימוש בהוראות מערכת להגבלת האורך. בנוסף, מאחר שעלויות הקלט נמוכות, ניתן להרשות לעצמך לכלול חלונות הקשר גדולים (עד 262K טוקנים) מבלי לפרוץ את הכיס. אם מקרה השימוש שלך כולל פרומפטים קצרים רבים אך תשובות ארוכות, עלות טוקני הפלט תהיה הדומיננטית.
OrcaRouter אינו מספק מטמון מובנה עבור מודל זה. התמחור הוא לפי טוקן ולפי בקשה. עם זאת, ניתן ליישם מטמון בצד הלקוח עבור רצפי קלט נפוצים כדי להימנע משליחה חוזרת של הנחיות זהות. בנוסף, אם אתה חוזר על אותה הודעת מערכת בשיחות רבות, ייתכן שתוכל לכלול אותה בהקשר ארוך ולהשתמש מחדש באותה הפעלה דרך ממשק ה-API של השלמות צ'אט כדי להימנע מטוקני קלט מיותרים. חלק מהספקים עשויים להציע מטמון הנחיות בעצמם, אך התמחור של Obsidian כפי שמופיע אינו כולל אפשרות מטמון. בדוק בתיעוד של הספק לגבי הנחות פוטנציאליות על הנחיות חוזרות.
כדי להשתמש במודל זה, שלח בקשות לנקודת הקצה התואמת ל-OpenAI https://api.orcarouter.ai/v1. הגדר את פרמטר המודל ל-"obsidian/gemma-4-26B-A4B". יש לכלול את מפתח ה-API שלך מ-OrcaRouter בכותרת Authorization כ-Bearer token. ה-API תומך בנקודות קצה של text completions ו-chat completions. לצ'אט, השתמש בנקודת הקצה /v1/chat/completions עם מערך messages הכולל תפקידי user, assistant ו-system. עבור בקשות מולטימודליות, כלול כתובות URL של תמונות או נתוני base64 בשדה content. דוגמה לגוף בקשה ב-Python תשתמש בספריית openai עם base_url המוגדר לנקודת הקצה של OrcaRouter ומזהה המודל כנ"ל.
ה-API תומך בפרמטרים הסטנדרטיים של OpenAI: temperature (0-2, ברירת מחדל 1), top_p (0-1), max_tokens (עד לחלון ההקשר), presence_penalty, frequency_penalty, רצפי stop, ו-n (מספר השלמות). עבור מולטי-מודל, שדה content מקבל מערך עם type "text" ו-type "image_url". ניתן גם להגדיר stream=true לתגובות בזרם (streaming). הדגם תומך בהודעות מערכת (system messages). חלון ההקשר הוא 262,144 טוקנים כולל קלט ופלט. לא כל הפרמטרים עשויים להיתמך בדיוק כפי שמתועד; יש לבדוק את תיעוד OrcaRouter לגבי מגבלות ספציפיות לספק. לתוצאות מיטביות, יש להגדיר temperature בין 0.7 ל-1.0 עבור משימות יצירתיות, ונמוך יותר עבור פלטים דטרמיניסטיים.
ההגירה פשוטה בזכות ה-API התואם ל-OpenAI. אם אתה משתמש כעת בלקוח Python של OpenAI, שנה את base_url ל-https://api.orcarouter.ai/v1 והגדר את מפתח ה-API שלך למפתח OrcaRouter שלך. עדכן את פרמטר המודל משם המודל הקודם ל-"obsidian/gemma-4-26B-A4B". לא נדרשים שינויים אחרים בקוד עבור רוב מקרי השימוש. עבור בקשות מולטי-מודליות, פורמט התמונה עשוי להיות שונה; השתמש באותו מבנה כמו API הראייה של OpenAI. בדוק מספר בקשות כדי להבטיח תאימות. שים לב שמגבלות קצב וטיפול בשגיאות עשויים להיות שונים; עיין בתיעוד של OrcaRouter לקבלת שיטות עבודה מומלצות.
כתובת ה-URL הבסיסית לכל קריאות ה-API היא https://api.orcarouter.ai/v1. מזהה המודל המדויק לשימוש בבקשות הוא "obsidian/gemma-4-26B-A4B". יש להעביר מזהה זה כפרמטר model בקריאות chat completions או completions. אין מזהה מודל חלופי לווריאנט זה. יש לוודא שאתה כולל את התחילית המלאה 'obsidian/' כדי לנתב כראוי לספק Obsidian. אם תנסה להשתמש במזהה גנרי 'gemma-4-26B-A4B' ללא תחילית הספק, הוא עלול לא להיפתר. תחילית הספק נחוצה מכיוון ש-OrcaRouter תומך במספר ספקים המציעים את אותו מודל הבסיס.
במשפחת Gemma 4, גוגל מציעה גרסאות Dense ו-MoE. הגרסה ה-Dense (למשל Gemma 4 47B) מפעילה את כל הפרמטרים, ומספקת איכות גבוהה יותר לטוקן אך בעלות חישובית גבוהה יותר. גרסת MoE עם 26B סה״כ ו-4B פעילים מהווה נקודת ביניים אידיאלית לעלות-יעילות. בהשוואה ל-Gemma 4 2B או 9B Dense, למודל זה ידע רחב יותר הודות למספר הפרמטרים הכולל הגדול יותר. מבין דגמי MoE, Gemma 4 26B A4B קטן יותר מדגמי MoE גדולים יותר כמו Mixtral 8x22B (141B סה״כ, 39B פעילים). ההיבט הלא מצונזר ייחודי לווריאציה Obsidian הזו; דגמי Gemma 4 אחרים כוללים כיוונון בטיחות.
מודלים לא מצונזרים כמו אלו מסדרת Llama 3-Uncensored או Wizard מסירים בדרך כלל מסנני בטיחות ממודל הבסיס. הגרסה הזו של Gemma 4 היא אחת האפשרויות הלא מצונזרות הבודדות המבוססות על MoE, ומציעה מספר כולל גדול יותר של פרמטרים (26B) עם פחות פרמטרים פעילים (4B). בהשוואה ל-Llama 3 70B Uncensored, היא קטנה וזולה בהרבה, אך עשויה להיות בעלת תקרה נמוכה יותר במשימות מורכבות. חלון ההקשר שלה בגודל 262K גדול משמעותית מזה של רוב המודלים הלא מצונזרים, שלעיתים קרובות מוגבלים ל-8K-32K. התמיכה הרב-מודאלית היא גם גורם מבדל: רוב המודלים הלא מצונזרים הם טקסט בלבד.
GPT-4o ו-Claude 3.5 Sonnet הם מודלים קנייניים גדולים יותר עם כוונון בטיחות נרחב ויכולות מולטימודליות. הם בדרך כלל מתפקדים טוב יותר מ-Gemma 4 26B A4B במדדים ובמשימות אמיתיות, במיוחד בחשיבה, יצירתיות ועקביות. עם זאת, הם יקרים בהרבה לכל טוקן (GPT-4o: $5/M קלט, $15/M פלט; Claude: $3/M קלט, $15/M פלט). מודל Gemma הוא אידיאלי ליישומים רגישים לעלות הזקוקים לקונטקסט גדול אך ללא הגבלות בטיחות. הוא לא ישתווה למודלים המובילים במעקב מדויק אחר הוראות עדינות או בדייקנות עובדתית, אך עשוי להספיק למשימות גנרטיביות רבות.
בחר במודל הזה על פני מודל גדול יותר (כמו GPT-4o או Claud Opus) כאשר: (1) אתה זקוק לחלון הקשר גדול מאוד (262K) מבלי לשלם מחירי פרימיום; (2) אתה דורש פלטים לא מצונזרים למקרי שימוש מותרים; (3) עומס העבודה שלך הוא בעל תפוקה גבוהה ויעילות העלות של Moe חשובה; (4) המשימות שלך נמצאות בטווח היכולת של מודל עם 4B פרמטרים פעילים. הימנע מהמודל הזה אם אתה זקוק לאיכות הגבוהה ביותר להחלטות קריטיות, יישור בטיחות מחמיר, או חשיבה מורכבת במיוחד. עבור משימות נפוצות רבות כמו תקצור, תרגום, או שאלות ותשובות על מסמכים ארוכים, המודל הזה מספק יחס מחיר-ביצועים חזק.
| קלט / 1M טוקנים | $0.250 |
| פלט / 1M tokens | $2.90 |
| מטבע | USD |
הערכה מבוססת מחיר מחירון
הערכה בלבד — ספירת הטוקנים בפועל תלויה בטוקנייזר של הספק.
על מה מפתחים מדברים השבוע
GET /api/public/models/obsidian/gemma-4-26B-A4Bפתיחה @misc{orcarouter_gemma_4_26b_a4b,
title = {Gemma4 26B A4B Uncensored (Balanced) API},
author = {obsidian},
year = {2026},
howpublished = {OrcaRouter},
url = {https://www.orcarouter.ai/models/obsidian/gemma-4-26B-A4B}
}obsidian. (2026). Gemma4 26B A4B Uncensored (Balanced) API. OrcaRouter. https://www.orcarouter.ai/models/obsidian/gemma-4-26B-A4B