Gemma 4 31B Instruct הוא מודל מולטימודלי צפוף של Google DeepMind בנפח 30.7B התומך בקלט טקסט ותמונה עם פלט טקסט. כולל חלון הקשר של 256K טוקנים, מצב חשיבה/הסקה הניתן להגדרה, פונקציה מקורית...
Google Gemma 4 31B היא גרסה מותאמת-הוראות של משפחת Gemma 4, שפותחה על ידי Google. יש לה כ-31 מיליארד פרמטרים והיא מותאמת למשימות צ'אט ומעקב אחר הוראות. המודל נגיש דרך ה-API של OrcaRouter התואם…
Gemma 4 31B תוכנן לציות להוראות, יצירת טקסט והסקה. הוא יכול להבין פרומפטים מורכבים, שיחות מרובות סיבובים ומשימות הדורשות לוגיקה צעד-אחר-צעד. המודל מכוון-הוראות (instruction-tuned), כלומר הוא עבר כוונון עדין (fine-tuned) כדי לעקוב אחר הוראות המשתמש ולייצר תגובות מועילות וקוהרנטיות. הוא תומך גם באינטראקציות חד-סיבוביות וגם ברב-סיבוביות. בהתבסס על ספירת הפרמטרים שלו של 31B, הוא מאזן בין יכולת למהירות הסקה, מה שהופך אותו למתאים ליישומים בזמן אמת שבהם השהייה (latency) חשובה.
באמצעות מבחן ההשוואה GPQA Diamond, אנו יודעים שהמודל מבצע היטב משימות חשיבה ברמה מומחית במדעים. סביר להניח שהוא גם חזק ביצירת קוד, סיכום וכתיבה יצירתית, אף על פי שלא סופקו מדדי השוואה ספציפיים למשימות אלו בנתונים שניתנו. המודל יעיל ביותר כאשר ניתן לו הוראות ברורות ומובנות. עבור משימות הדורשות הקשר ארוך מאוד או יצירה מורחבת באמצעות שליפה, על המשתמשים לבדוק את מגבלות חלון ההקשר של המודל, שכן אורך ההקשר המדויק אינו מצוין בנתונים שסופקו.
אם המשימות שלך פשוטות – כמו סיווג בסיסי, יצירת טקסט קצר, או תשובות במשפט יחיד – ייתכן שתעדיף מודל קטן וזול יותר כמו Gemma 4 2B או 9B. גרסת ה‑31B כרוכה בעלויות אסימונים גבוהות יותר, אם כי עדיין מתונות. עבור יישומים עתירי תפוקה שבהם השהייה קריטית, מודל קטן יותר עשוי להיות מהיר יותר. בנוסף, אם מקרה השימוש שלך אינו דורש את ההיגיון הקפדני שנמדד ב‑GPQA Diamond, מודל כללי זול יותר עשוי לספק ביצועים נאותים בעלות נמוכה יותר.
אין מגבלות ספציפיות המפורטות בעובדות שסופקו. עם זאת, כמו מודלים רבים בעלי משקלים פתוחים מכוונים-הוראות, Gemma 4 31B עשוי להפיק תפוקות שגויות או מוטות, במיוחד בנושאים מעורפלים או שנויים במחלוקת. הוא עלול גם להתקשות במשימות הדורשות מידע בזמן אמת או אירועים עדכניים מאוד בשל תאריך הקיצוץ באימון שלו. גודל חלון ההקשר של המודל אינו ידוע; אם הוא מוגבל (למשל, 8K-32K), ייתכן שהוא לא יתאים למסמכים ארוכים מאוד. משתמשים צריכים תמיד לוודא את התפוקות ביישומים בעלי סיכון גבוה.
GPQA Diamond הוא מערך נתונים של שאלות רב-ברירה ברמת תואר שני המכסות ביולוגיה, פיזיקה וכימיה. ציון של 85.7% משמעותו ש-Gemma 4 31B ענתה נכון על למעלה מ-85% מהשאלות הללו. זוהי תוצאה חזקה, המעידה על כך שלמודל יש ידע תחום מוצק ויכולות חשיבה. חשוב לציין שהמדד מבוסס על בחירה מרובה, כך שהוא אינו מעריך יכולות יצירה ישירות, אך הוא מתואם עם יכולת המודל לזכור ולנתח תוכן ברמת מומחה.
בפרטים שניתנו לא מסופקים ציוני מדד ביצועים נוספים. המדד הכמותי היחיד ששותף הוא ציון GPQA Diamond שעומד על 85.7. לשם הבנה מלאה יותר של יכולות המודל, על המשתמשים לעיין בדוח הטכני הרשמי של Google או בכרטיס המודל. OrcaRouter אינה מאמתת או מוסיפה מדדי ביצועים באופן עצמאי. ייתכן שהמודל יציג ביצועים שונים במדדים אחרים כגון MMLU, HumanEval או GSM8K, אך נתונים אלה אינם כלולים כאן.
נתונים ספציפיים על מהירות הסקה או השהיה אינם מסופקים בעובדות הנתונות. כמודל עם 31 מיליארד פרמטרים, הוא גדול מהווריאנטים של 9B ו-2B של Gemma 4, כך שהוא בדרך כלל איטי יותר לטוקן ודורש יותר זיכרון GPU. השהיה בפועל תלויה בחומרה (למשל, סוג GPU, גודל אצווה) ובתשתית הספק. כאשר ניגשים דרך OrcaRouter, אתה כפוף לתשתית השירות של Google. ליישומים רגישים להשהיה, אנו ממליצים לבדוק את זמן התגובה של המודל תחת עומס העבודה הצפוי שלך.
ציון ה-GPQA Diamond של 85.7% מצביע על ביצועים חזקים, אך אינו מושלם—המודל עדיין מפספס 14.3% מהשאלות, כלומר ייתכן שאינו אמין עבור כל שאילתות המומחים. מדד הביצועים אינו מודד חשיבה על פני הקשר רחב, ביצועים רב-לשוניים, או בטיחות. לכן, אף שהציון מרשים, אין לפרש אותו כהבטחה לחשיבה מושלמת על פני כל המשימות. על המשתמשים לשקול את ביצועי המודל בתחום הספציפי שבו הם מתכוונים ליישם אותו.
התמחור הוא $0.13 למיליון טוקני קלט ו-$0.38 למיליון טוקני פלט. אלו תעריפי הספק המחויבים ללא תוספת על ידי OrcaRouter. הטוקנים נספרים לפי המנתח הלשוני (tokenizer) של Google; טוקני קלט כוללים את כל ההנחיה (prompt) וכל הודעות המערכת, בעוד שטוקני פלט הם הטקסט שנוצר. אין עמלות נוספות לבקשה בודדת או התחייבויות חודשיות. תמחור ישיר זה לכל טוקן מקל על הערכת העלויות בהתאם לנפח השימוש שלך.
העובדות שסופקו אינן מזכירות הנחות מטמון או תמחור נפח. OrcaRouter עשוי להציע מטמון של אסימוני קלט חוזרים כדי להפחית עלויות, אך הדבר לא צוין כאן. עליך לבדוק את התיעוד של OrcaRouter או לפנות לתמיכה שלהם לקבלת פרטים על תכונות אופטימיזציית עלויות. המחיר הבסיסי של $0.13/$0.38 למיליון אסימונים חל כברירת מחדל. עבור שימוש גבוה במיוחד, תוכל לברר לגבי הסכמים ארגוניים פוטנציאליים, אך תנאים כאלה אינם כלולים בנתונים אלה.
אם אתה משתמש ב-Gemma 4 2B או 9B, העלות שלך לטוקן תהיה נמוכה יותר, לרוב בטווח של $0.02–$0.10 למיליון טוקנים. דגם ה-31B יקר יותר אך מציע יכולת חשיבה גבוהה יותר כפי שמצביע ציון GPQA Diamond. למשימות שאינן דורשות חשיבה ברמת מומחה, העלות הנוספת עשויה לא להיות מוצדקת. לעומת זאת, עבור יישומים שבהם הדיוק הוא קריטי, השקעה בדגם ה-31B עשויה להפחית את הצורך באימות ידני, ובכך להוריד את העלויות הכוללות.
OrcaRouter מעביר את התעריף המדויק של הספק ללא כל תוספת מחיר. עבור Gemma 4 31B של Google, פירוש הדבר שאתה משלם $0.13 למיליון אסימוני קלט ו-$0.38 למיליון אסימוני פלט ישירות. אין דמי שירות נוספים או מרווח פלטפורמה. OrcaRouter מרוויחה באמצעים אחרים (למשל, מנויים ארגוניים או חריגה בשימוש), אך עבור דגם זה, המחיר שאתה רואה הוא מה שגוגל גובה. שקיפות זו מאפשרת לך להשוות עלויות ישירות עם ספקים אחרים.
אתה משתמש בספריית לקוח תואמת OpenAI עם כתובת הבסיס https://api.orcarouter.ai/v1 ומזהה המודל "google/gemma-4-31b-it". לדוגמה, באמצעות ה-SDK של OpenAI ב-Python, הגדר `openai.api_base = "https://api.orcarouter.ai/v1"` ו-`openai.api_key = "your-orcarouter-api-key"`. לאחר מכן קרא ל-`openai.ChatCompletion.create(model="google/gemma-4-31b-it", messages=[{"role":"user","content":"Hello"}])`. ה-API תומך באותם פרמטרים כמו נקודת הקצה של הצ'אט של OpenAI, כגון temperature, max_tokens ו-top_p.
ממשק ה-API של OrcaRouter תומך בפרמטרים סטנדרטיים תואמי OpenAI: `model`, `messages`, `temperature` (0–2, ברירת מחדל 1), `max_tokens` (מספר שלם, עד למגבלת המודל), `top_p` (0–1, ברירת מחדל 1), `frequency_penalty`, `presence_penalty`, רצפי `stop` ו-`stream` (בוליאני). ייתכן שגם הפרמטר `n` (מספר ההשלמות) נתמך, אך חלות מגבלות שימוש. שימו לב כי פרמטרים ספציפיים של Gemma 4, כמו `repetition_penalty`, עשויים להיתמך באמצעות מפתחות גוף נוספים; עיינו בתיעוד של OrcaRouter לקבלת פרמטרים מותאמים אישית של ספקים.
כן, ההעברה פשוטה אם אתה כבר משתמש ב-API תואם OpenAI. פשוט שנה את הפרמטר `model` ל-"google/gemma-4-31b-it" והפנה לכתובת הבסיס של OrcaRouter. שים לב שהטוקניזציה ועיצוב הפלט עשויים להיות שונים מעט ממודלים אחרים. כדאי לבדוק את תגובות המודל על מדגם מההודעות (prompts) שלך כדי להבטיח איכות. כמו כן, יש לקחת בחשבון שמבנה התמחור שונה ממודלים של OpenAI, וייתכן שתצטרך להתאים את הציפיות שלך לגבי העלויות בהתאם.
OrcaRouter דורש מפתח API שנשלח בכותרת `Authorization` כ- `Bearer <your-api-key>`. ניתן להשיג מפתח על ידי הרשמה באתר של OrcaRouter. המפתח משמש לאימות הבקשות שלך ולהפנייתן לספק המתאים. יש לשמור על המפתח שלך מאובטח. ה-API אינו תומך בשיטות אימות אחרות. עבור בקשות סטרימינג, נעשה שימוש באותו מפתח. אין הגבלות IP נוספות אלא אם צוין אחרת בחשבון OrcaRouter שלך.
Gemma 4 9B הוא דגם קטן וזול יותר—בדרך כלל מתומחר בסביבות $0.02–$0.10 למיליון טוקנים—וסביר להניח שיש לו ציוני Benchmark נמוכים יותר. הגרסה 31B, עם פי 3.4 יותר פרמטרים, משיגה 85.7% ב-GPQA Diamond; הציון של 9B אינו מסופק אך ככל הנראה נמוך יותר. הדגם 31B מציע יכולת הנמקה טובה יותר אך בעלות גבוהה יותר ובזמן אחזור ארוך יותר. למשימות פשוטות, 9B עשוי להספיק; לשאלות ברמת מומחה, 31B הוא הבחירה הטובה יותר. שניהם נגישים דרך אותו API של OrcaRouter.
לא מסופקים אמות מידה להשוואה ישירה. עם זאת, Llama 3.1 70B הוא מודל גדול יותר (70B פרמטרים) ולעיתים קרובות יש לו ביצועים גבוהים יותר באמות מידה כלליות, אך גם עלות גבוהה יותר לטוקן. Gemma 4 31B יעיל יותר ועשוי להיות תחרותי בהסקת תחום ספציפית כמו GPQA. הגודל 31B הופך אותו לאטרקטיבי לפריסה על GPUs לצרכן. משתמשים צריכים להעריך על המשימות שלהם. OrcaRouter עשוי להציע את שני המודלים להשוואה ישירה.
Gemma 4 31B הוא מודל בעל משקלים פתוחים תחת רישיון Gemma של Google, המאפשר שימוש חופשי ברוב היישומים. עם זאת, בעת גישה דרך OrcaRouter, אתה כפוף לתנאי השירות של OrcaRouter ומשלם לפי טוקן. אתה יכול גם להריץ את המודל בעצמך על החומרה שלך אם יש לך את המשאבים. OrcaRouter מספקת חלופה מתארחת שנמנעת מעלויות תשתית. הבחירה בין אירוח עצמי לבין שימוש ב-OrcaRouter תלויה בתקציב שלך, בדרישות השהיה, ובהעדפות התפעוליות.
OrcaRouter מספק קצה API מאוחד עבור ספקים מרובים, כולל Google. אם אתה משתמש ב-Vertex AI או AI Platform של Google עצמה, ייתכן שתקבל תמחור שונה, אולי נמוך יותר עבור נפח גבוה. תמחור ללא תוספת של OrcaRouter תחרותי לשימוש מתון. היתרון העיקרי של OrcaRouter הוא ה-API היחיד התואם ל-OpenAI עבור מודלים רבים, מה שמפשט אינטגרציה. למשתמשים שכבר נמצאים ב-Google Cloud, גישה ישירה עשויה להציע אינטגרציה טובה יותר עם שירותים אחרים. OrcaRouter אינה מאחסנת את הנתונים שלך מעבר לרישום API סטנדרטי; בדוק את מדיניות הפרטיות שלהם לפרטים.
תואם OpenAI — המשיכו להשתמש ב-SDK שכבר יש לכם
https://api.orcarouter.ai/v1from openai import OpenAI
client = OpenAI(
base_url="https://api.orcarouter.ai/v1",
api_key="$ORCAROUTER_API_KEY",
)
response = client.chat.completions.create(
model="google/gemma-4-31b-it",
messages=[{"role": "user", "content": "Hello"}],
)
print(response.choices[0].message.content)| קלט / 1M טוקנים | $0.130 |
| פלט / 1M tokens | $0.380 |
| קריאת מטמון / 1M | $0.020 |
| מטבע | USD |
הערכה מבוססת מחיר מחירון
הערכה בלבד — ספירת הטוקנים בפועל תלויה בטוקנייזר של הספק.
GET /api/public/models/google/gemma-4-31b-itפתיחה @misc{orcarouter_gemma_4_31b_it,
title = {Gemma 4 31B API},
author = {Google},
year = {2026},
howpublished = {OrcaRouter},
url = {https://www.orcarouter.ai/models/google/gemma-4-31b-it}
}Google. (2026). Gemma 4 31B API. OrcaRouter. https://www.orcarouter.ai/models/google/gemma-4-31b-it