Gemma 4 26B A4B IT הוא מודל Mixture-of-Experts (MoE) מכוון הוראות של Google DeepMind. למרות 25.2B פרמטרים בסך הכל, רק 3.8B מופעלים לכל טוקן במהלך ההסקה — ומספקים איכות קרובה ל-31B ב...
Gemma 4 26B A4B הוא מודל מתערובת מומחים (Mixture-of-Experts) שפותח על ידי Google. יש לו 26 מיליארד פרמטרים בסך הכול, אך רק 4 מיליארד פעילים לכל טוקן – עיצוב זה מפחית עלות חישובית תוך שמירה על איכות…
Gemma 4 26B A4B מקבלת קלט של טקסט, תמונה ווידאו. ניתן לספק תמונות כנתונים מקודדים ב-base64 או כ-URLs. וידאו ניתן לספק כ-URL או כרצף של פריימים (אובייקטים של תמונה). המודל מעבד את המצבים הללו במשותף, ומאפשר משימות כמו מענה על שאלות חזותיות, תקצור וידאו והבנת דיאגרמות. אודיו אינו נתמך; רק תוכן חזותי וטקסטואלי. הפלט הוא טקסט בלבד. היכולת הרב-מודלית של המודל שימושית במיוחד לניתוח מסמכים המכילים תרשימים, צילומי מסך או הקלטות וידאו.
חלון ההקשר הוא 262,144 אסימונים. זה מאפשר למודל לעבד רצפים ארוכים מאוד במעבר יחיד — לדוגמה, מסמך בן 200 עמודים, שעות של וידאו מתומלל, או קבוצה גדולה של תמונות עם כיתובים תיאוריים. חלונות הקשר גדולים מפחיתים את הצורך בפיצול (chunking) ובסיכום, אך הם גם מגבירים את השימוש בזיכרון. האורך האפקטיבי שבו תוכל להשתמש יהיה תלוי במספר הכולל של אסימוני הקלט (אסימוני טקסט + תמונה/וידאו). יש לשים לב שקלטי תמונה ווידאו צורכים אסימונים רבים; עיין בתיעוד של OrcaRouter כיצד מחושבים ספירות אסימונים עבור קלטים שאינם טקסט.
אם המשימה שלך היא מבוססת טקסט בלבד, דורשת רק הקשר קצר (מתחת ל-8k טוקנים), או אינה זקוקה לקלט מולטימודלי, שקול מודל קטן או זול יותר—כגון Gemma 3 4B או גרסה טקסטואלית בלבד. Gemma 4 26B A4B מתומחרת ב-$0.06 למיליון טוקני קלט ו-$0.33 למיליון טוקני פלט. לתשובות לשאלות פשוטות או סיווג, מודלים עם עלויות נמוכות יותר לטוקן עשויים להיות כלכליים יותר. העיצוב MoE הופך אותו ליעיל ביחס לגודלו הכולל, אך לא האופציה הזולה ביותר הזמינה ב-OrcaRouter למשימות מינימליות.
GPQA Diamond הוא מדד ביצועים המורכב מ-448 שאלות רב-ברירה ברמת תואר שני בתחומי ביולוגיה, פיזיקה וכימיה. ציון של 79.2 פירושו שהמודל ענה נכון על 79.2% מהשאלות. הדבר מעיד על יכולת חשיבה מדעית ושליפת ידע חזקות. המדד נועד להיות קשה עבור מודלי שפה גדולים רבים. עם זאת, מדד בודד אינו יכול לתפוס את כל היבטי איכות המודל. לדוגמה, ביצועי המודל במשימות אחרות כמו תכנות או כתיבה יוצרת עשויים להיות שונים. השתמש בציון זה כנקודת מידע אחת כאשר אתה משווה מודלים למשימות חשיבה מדעיות דומות.
יתרונות כוללים הבנה רב-מודאלית עם הקשר רחב, יעילות MoE ביחס לגודלה, וחשיבה חזקה בשאלות מדעיות כפי שמצוין ב-GPQA. המגבלות אינן מתועדות בצורה מקיפה אך אופייניות למודלי MoE: הביצועים עשויים להשתנות לפי תחום, והקיבולת האפקטיבית לכל טוקן מוגבלת על ידי 4B הפרמטרים הפעילים. המודל עלול להתקשות במשימות הדורשות שרשראות לוגיות עמוקות במיוחד או ז'רגון תחומי שאינו מיוצג היטב בנתוני האימון. השהייה והתפוקה תלויות בחומרת ההרצה; OrcaRouter אינה מבטיחה מדדי מהירות ספציפיים.
OrcaRouter אינה מפרסמת מדדי השהיה מתוקניים עבור מודל זה. בתור מודל MoE, Gemma 4 26B A4B מפעיל רק תת-קבוצה של פרמטרים לכל טוקן, מה שיכול להפוך את ההסקה למהירה יותר ממודל צפוף של 26B אך אולי איטית יותר ממודל צפוף קטן יותר. הביצועים בפועל תלויים בגורמים כמו גודל אצווה, אורך קלט, וסוג ה-GPU בצד השרת. ליישומים בזמן אמת, בצע בדיקות עם עומס העבודה הספציפי שלך. ייתכן שתרצה לשקול גם את האיזון בין השהיה לעלות—שימוש במודל קטן יותר עשוי לשפר את המהירות בעלות נמוכה יותר.
התמחור הוא $0.06 לכל מיליון אסימוני קלט ו-$0.33 לכל מיליון אסימוני פלט. אלו הם התעריפים שנגבים על ידי הספק (Google) ומועברים דרך OrcaRouter ללא תוספת מחיר. כלומר, אתה משלם בדיוק את תעריף הספק — OrcaRouter אינו מוסיף כל תוספת. אסימונים נספרים באופן עקבי בכל הפלטפורמה; תמונות ופריימים של וידאו מתומללים לפי מפרטי המודל של Google. עבור שאילתה מולטימודלית טיפוסית עם מספר תמונות, אסימוני הקלט עשויים להיות דומיננטיים, מה שהופך את תמחור הקלט לגורם העלות העיקרי.
OrcaRouter עשוי להציע מנגנוני מטמון עבור תבניות קידומת או הנחיה חוזרות, מה שיכול להפחית את צריכת האסימונים ולהוזיל עלויות. עם זאת, הנחות ספציפיות על מטמון אינן מובטחות עבור מודל זה ותלויות בדפוס השימוש שלך. אין מדרגת תמחור אצווה נפרדת שפורסמה עבור Gemma 4 26B A4B. עבור עומסי עבודה בנפח גבוה, צור קשר עם תמיכת OrcaRouter כדי לדון בהנחות פוטנציאליות. כמו בכל המודלים בפלטפורמה, אתה מחויב רק על מה שאתה משתמש — אסימוני קלט ופלט — ללא דמי חודש או התחייבות מינימלית.
בהינתן מבנה התמחור, העלות הכוללת תלויה במספר ובסוג האסימונים (tokens) שאתם שולחים ומקבלים. קלטים מולטי-מודליים (במיוחד וידאו) יכולים להשתמש בהרבה אסימוני קלט מכיוון שכל פריים מקודד. עבור סרטונים ארוכים, עלות הקלט עשויה לעלות על עלות הפלט. אם המשימה שלכם כבדה בפלט (למשל, יצירת דוחות ארוכים), מחיר הפלט ($0.33/M) גבוה יותר ממחיר הקלט. העריכו את יחס האסימונים הצפוי שלכם. עבור משימות שניתן לפתור באמצעות מודל זול יותר מבוסס-טקסט בלבד, הבדל העלות יכול להיות משמעותי. השתמשו בכלי ספירת האסימונים של OrcaRouter כדי להעריך.
קבע את כתובת הבסיס כ-https://api.orcarouter.ai/v1 והשתמש במזהה המודל google/gemma-4-26b-a4b-it. שלח בקשת POST ל-/chat/completions עם סכימת OpenAI הסטנדרטית. עבור קלט רב-מודאלי, כלול מערך של אובייקטי תוכן כאשר השדה type מוגדר כ-'text', 'image_url' או 'video_url'. דוגמה: messages: [{ role: 'user', content: [{ type: 'text', text: 'תאר את הסרטון הזה.' }, { type: 'video_url', video_url: { url: 'https://example.com/video.mp4' } }] }]. ה-API יחזיר תגובת השלמת צ'אט.
אתה יכול להשתמש בפרמטרים סטנדרטיים של OpenAI כמו temperature, top_p, max_tokens, stop, frequency_penalty, ו- presence_penalty. בנוסף, OrcaRouter תומך בפרמטרים ספציפיים לספק דרך השדה האופציונלי 'provider' בגוף הבקשה (לא נדרש למודל זה). המודל תומך באופן טבעי בסטרימינג על ידי הגדרת stream=true. עבור פלטים מובנים, השתמש בפרמטר 'response_format' עם סוג 'json_object' או סכימת JSON. עיין בתיעוד של OrcaRouter עבור כל פרמטר נוסף כמו 'reasoning_effort' — למרות שזה לא רשום עבור מודל זה.
המעבר מ-API תואם OpenAI אחר הוא פשוט: שנה את כתובת ה-base URL ל-https://api.orcarouter.ai/v1 והגדר את המודל ל-google/gemma-4-26b-a4b-it. מבנה ה-prompt הקיים שלך, הפרמטרים ו-SDK client תואמים מכיוון ש-OrcaRouter עוקב אחר אותו סכמה. אם השתמשת ב-SDK של ספק אחר, ייתכן שיהיה עליך לעדכן את ה-endpoint והאימות. OrcaRouter משתמש במפתחות API במקום OAuth; כלול את המפתח שלך בכותרת ה-Authorization כ-'Bearer YOUR_KEY'. בדוק תחילה עם בקשה קטנה.
Gemma 4 26B A4B הוא מודל MoE מולטי-מודאלי חדש יותר עם 262k קונטקסט וציוד GPQA Diamond של 79.2, בעוד Gemma 3 8B הוא מודל קטן יותר (8B פרמטרים) עם חלון קונטקסט של 128k וללא תמיכה מקורית בוידאו. Gemma 3 8B זול יותר בטוקנים בקלט (בדרך כלל $0.05-0.10 למיליון קלט) אך עשוי שלא להתאים לאיכות החשיבה בשאלות מדעיות קשות. למשימות הכוללות וידאו או מסמכים ארוכים מאוד, Gemma 4 26B A4B היא הבחירה הברורה. למשימות טקסט בלבד עם קונטקסט מתון, Gemma 3 8B עשויה להספיק ולהיות חסכונית יותר.
Llama 3.1 70B הוא מודל צפוף עם 70B פרמטרים ו-128k קונטקסט, שאינו מולטימודלי באופן טבעי עבור וידאו (אם כי הוא יכול לעבד תמונות). Gemma 4 26B A4B משתמש ב-MoE כדי להפעיל רק 4B פרמטרים לכל טוקן, מה שעשוי להציע הסקה מהירה יותר מאשר מודל Llama הגדול בהרבה. ב-GPQA Diamond, Gemma 4 26B A4B קיבל 79.2; Llama 3.1 70B מקבל בסביבות 65-70 (לא ניתן להשוואה ישירה בשל הבדלי גרסאות benchmark). Llama 3.1 70B עשוי להיות יקר יותר בטוקני קלט (כ-0.35$ למיליון קלט). עבור תרחישים מולטימודליים וקונטקסט ארוך, Gemma 4 עשויה להיות יעילה יותר.
GPT-4o הוא מודל קנייני צפוף של OpenAI עם תמיכה מולטימודלית וחלון הקשר של 128k (רגיל) ועד 1M עבור גרסאות מסוימות. התמחור שלו גבוה משמעותית (למשל, 2.50$ למיליון אסימוני קלט עבור GPT-4o). Gemma 4 26B A4B הוא בעל משקל פתוח וזמין דרך OrcaRouter בעלות נמוכה בהרבה (0.06$/0.33$). הביצועים ב-GPQA Diamond עבור GPT-4o אינם ניתנים להשוואה ישירה, אך בדרך כלל גבוהים יותר. עם זאת, עבור יישומים רגישים לעלות שאינם דורשים חשיבה ברמה גבולית, Gemma 4 26B A4B מציע יחס מחיר-ביצועים חזק. טיפול בנתונים שונה: Gemma 4 הוא מ-Google עם תנאי פרטיות נפרדים.
בהשוואה למודלי MoE פתוחי-משקל אחרים כמו Mixtral 8x7B (46.7B סה"כ, 12.9B פעילים) או Qwen2.5-72B-A3B (72B סה"כ, 3B פעילים), Gemma 4 26B A4B מציע שילוב ייחודי: חלון הקשר של 262k, תמיכה מולטי-מודאלית מלאה (תמונה+וידאו), וציון GPQA Diamond מפורסם של 79.2. ל-Mixtral 8x7B יש חלון הקשר של 32k ללא תמיכה בוידאו. ל-Qwen2.5-72B-A3B יש חלון הקשר של 128k ותומך בטקסט אך לא בוידאו. מספר הפרמטרים הפעילים של 4B דומה למודלי MoE קטנים אחרים, אך הארכיטקטורה הספציפית של Gemma 4—אומנה על ידי Google וכווננה עדינה למעקב אחר הוראות—עשויה להקנות לה יתרון במשימות מולטי-מודאליות ומדעיות.
תואם OpenAI — המשיכו להשתמש ב-SDK שכבר יש לכם
https://api.orcarouter.ai/v1from openai import OpenAI
client = OpenAI(
base_url="https://api.orcarouter.ai/v1",
api_key="$ORCAROUTER_API_KEY",
)
response = client.chat.completions.create(
model="google/gemma-4-26b-a4b-it",
messages=[{"role": "user", "content": "Hello"}],
)
print(response.choices[0].message.content)frequency_penaltyinclude_reasoninglogit_biaslogprobsmax_tokensmin_ppresence_penaltyreasoningrepetition_penaltyresponse_formatseedstopstreamstructured_outputstemperaturetool_choicetoolstop_ktop_logprobstop_p| קלט / 1M טוקנים | $0.060 |
| פלט / 1M tokens | $0.330 |
| קריאת מטמון / 1M | $0.0075 |
| מטבע | USD |
הערכה מבוססת מחיר מחירון
הערכה בלבד — ספירת הטוקנים בפועל תלויה בטוקנייזר של הספק.
GET /api/public/models/google/gemma-4-26b-a4b-itפתיחה @misc{orcarouter_gemma_4_26b_a4b_it,
title = {Gemma 4 26B A4B API},
author = {Google},
year = {2026},
howpublished = {OrcaRouter},
url = {https://www.orcarouter.ai/models/google/gemma-4-26b-a4b-it}
}Google. (2026). Gemma 4 26B A4B API. OrcaRouter. https://www.orcarouter.ai/models/google/gemma-4-26b-a4b-it