Gemma 4 31B Instruct är Google DeepMinds 30,7B täta multimodala modell som stödjer text- och bildinmatning med textutmatning. Har ett kontextfönster på 256K tokens, konfigurerbart tanke-/resonemangsläge, inbyggd funktion...
Google Gemma 4 31B är en instruktionsjusterad variant av Gemma 4-familjen, utvecklad av Google. Den har cirka 31 miljarder parametrar och är optimerad för chatt- och instruktionsföljningsuppgifter.…
Gemma 4 31B är designad för instruktionsföljning, textgenerering och resonemang. Den kan förstå komplexa uppmaningar, flervarvssamtal och uppgifter som kräver steg-för-steg-logik. Modellen är instruktionsjusterad, vilket innebär att den har finjusterats för att följa användarens instruktioner och producera hjälpsamma, sammanhängande svar. Den stöder både enkel- och flervarvsinteraktioner. Baserat på dess 31B-parameterantal balanserar den kapacitet med inferenshastighet, vilket gör den lämplig för realtidsapplikationer där latens är viktig.
Genom GPQA Diamond-riktmärket vet vi att modellen presterar bra på expertnivå resonemangsuppgifter inom vetenskap. Den är också sannolikt stark på kodgenerering, sammanfattning och kreativt skrivande, även om specifika riktmärken för dessa uppgifter inte anges i de givna fakta. Modellen är mest effektiv när den får tydliga, strukturerade instruktioner. För uppgifter som kräver mycket lång kontext eller retrieval-augmented generation bör användare testa modellens kontextfönstergränser, eftersom den exakta kontextlängden inte specificeras i den tillhandahållna datan.
Om dina uppgifter är enkla—som enkel klassificering, kort textgenerering eller enmeningars svar—kan du föredra en mindre, billigare modell som Gemma 4 2B eller 9B. 31B-varianten medför högre tokenkostnader, även om de fortfarande är modest. För höggenomströmningsapplikationer där latens är avgörande kan en mindre modell också vara snabbare. Dessutom, om ditt användningsfall inte kräver det rigorösa resonemang som mäts av GPQA Diamond, kan en billigare allmän modell ge tillräcklig prestanda till lägre kostnad.
Inga specifika begränsningar anges i de tillhandahållna fakta. Men som med många open-weight instruktionsjusterade modeller kan Gemma 4 31B producera felaktiga eller partiska utdata, särskilt om tvetydiga eller kontroversiella ämnen. Den kan också ha svårigheter med uppgifter som kräver realtidsinformation eller mycket aktuella händelser på grund av dess träningsgräns. Modellens kontextfönsterstorlek är inte offentliggjord; om den är begränsad (t.ex. 8K-32K) kan den vara olämplig för mycket långa dokument. Användare bör alltid verifiera utdata i högriskapplikationer.
GPQA Diamond är en datamängd med flervalsfrågor på forskarnivå inom biologi, fysik och kemi. Ett resultat på 85,7 % innebär att Gemma 4 31B svarade korrekt på över 85 % av dessa frågor. Detta är ett starkt resultat som indikerar att modellen har robust domänkunskap och resonemangsförmåga. Det är viktigt att notera att riktmärket är flervalsbaserat, så det utvärderar inte direkt generativa förmågor, men det korrelerar med modellens förmåga att återkalla och resonera kring expertinnehåll.
Inga ytterligare benchmark-poäng tillhandahålls i de givna fakta. Den enda kvantitativa benchmark som delas är GPQA Diamond-poängen 85,7. För en mer fullständig förståelse av modellens kapacitet bör användare konsultera Googles officiella tekniska rapport eller modellkort. OrcaRouter verifierar inte eller lägger till benchmarks oberoende. Modellen kan prestera annorlunda på andra utvärderingar som MMLU, HumanEval eller GSM8K, men dessa siffror ingår inte här.
Specifik inferenshastighet eller latenssiffror anges inte i de givna fakta. Som en 31B-parametermodell är den större än 9B- och 2B-varianterna av Gemma 4, så den kommer typiskt att vara långsammare per token och kräva mer GPU-minne. Faktisk latens beror på hårdvara (t.ex. GPU-typ, batchstorlek) och leverantörens infrastruktur. Vid åtkomst via OrcaRouter omfattas du av Googles serverinfrastruktur. För latenskänsliga applikationer rekommenderar vi att testa modellens svarstid under din förväntade arbetsbelastning.
GPQA Diamond-poängen på 85,7 % visar stark prestanda, men den är inte perfekt – modellen missar fortfarande 14,3 % av frågorna, vilket innebär att den kanske inte är tillförlitlig för alla frågor på expertnivå. Riktmärket mäter inte långsammanhangresonemang, flerspråkig prestanda eller säkerhet. Därför bör poängen, även om den är imponerande, inte tolkas som en garanti för perfekt resonemang över alla uppgifter. Användare bör överväga modellens prestanda inom det specifika område de avser att tillämpa den på.
Priset är $0,13 per 1 miljon inmatningstokens och $0,38 per 1 miljon utdatatokens. Dessa är leverantörspriserna som debiteras utan påslag av OrcaRouter. Tokens räknas enligt Googles tokenizer; inmatningstokens inkluderar hela prompten och eventuella systemmeddelanden, medan utdatatokens är den genererade texten. Det finns inga extra avgifter per förfrågan eller månatliga åtaganden. Denna enkla per-token-prissättning gör kostnadsuppskattningen enkel baserat på din användningsvolym.
De angivna fakta nämner inga cacherabatter eller volympriser. OrcaRouter kan erbjuda cachning av återkommande indata-tokens för att minska kostnader, men detta specificeras inte här. Du bör kontrollera OrcaRouters dokumentation eller kontakta deras support för information om eventuella kostnadsoptimeringsfunktioner. Baspriset på $0,13/$0,38 per miljon tokens gäller som standard. Vid mycket hög användning kan du fråga om eventuella företagsavtal, men inga sådana villkor ingår i dessa data.
Om du använder Gemma 4 2B eller 9B blir din kostnad per token lägre, ofta i intervallet $0,02–$0,10 per miljon token. 31B-modellen är dyrare men erbjuder högre resonemangsförmåga vilket indikeras av GPQA Diamond-poängen. För uppgifter som inte kräver expertnivå av resonemang kanske den extra kostnaden inte är motiverad. Omvänt, för applikationer där noggrannhet är avgörande, kan investering i 31B-modellen minska behovet av manuell kontroll, vilket potentiellt sänker de totala kostnaderna.
OrcaRouter vidarebefordrar den exakta leverantörsavgiften utan någon påslag. För Googles Gemma 4 31B innebär det att du betalar $0.13 per miljon inmatade tokens och $0.38 per miljon utmatade tokens direkt. Det tillkommer ingen extra serviceavgift eller plattformsmarginal. OrcaRouter tjänar pengar på andra sätt (t.ex. företagsprenumerationer eller överskottsanvändning), men för denna modell är priset du ser det som Google tar ut. Denna transparens gör att du kan jämföra kostnader direkt med andra leverantörer.
Du använder ett OpenAI-kompatibelt klientbibliotek med bas-URL https://api.orcarouter.ai/v1 och modell-ID "google/gemma-4-31b-it". Exempelvis, när du använder OpenAI Python SDK anger du `openai.api_base = "https://api.orcarouter.ai/v1"` och `openai.api_key = "din-orcarouter-api-nyckel"`. Därefter anropar du `openai.ChatCompletion.create(model="google/gemma-4-31b-it", messages=[{"role":"user","content":"Hello"}])`. API:et stöder samma parametrar som OpenAIs chatt-slutpunkt, såsom temperature, max_tokens och top_p.
OrcaRouter's API stöder standard OpenAI-kompatibla parametrar: `model`, `messages`, `temperature` (0–2, standard 1), `max_tokens` (heltal, upp till modellens gräns), `top_p` (0–1, standard 1), `frequency_penalty`, `presence_penalty`, `stop`-sekvenser och `stream` (boolesk). Parametern `n` (antal fullföljningar) kan också stödjas, men användningsgränser gäller. Observera att specifika Gemma 4-parametrar som `repetition_penalty` kan stödjas via extra body-nycklar; se OrcaRouter-dokumentationen för anpassade leverantörsparametrar.
Ja, migreringen är enkel om du redan använder ett OpenAI-kompatibelt API. Du byter bara parametern `model` till "google/gemma-4-31b-it" och pekar på OrcaRouters bas-URL. Observera att tokenisering och utdataformatering kan skilja sig något från andra modeller. Du bör testa modellens svar på ett urval av dina prompter för att säkerställa kvaliteten. Var också medveten om att prissättningsstrukturen skiljer sig från OpenAIs modeller, och du kan behöva justera dina kostnadsförväntningar därefter.
OrcaRouter kräver en API-nyckel som skickas i `Authorization`-huvudet som `Bearer <your-api-key>`. Du kan få en nyckel genom att registrera dig på OrcaRouters webbplats. Nyckeln används för att autentisera dina förfrågningar och dirigera dem till rätt leverantör. Se till att hålla din nyckel säker. API:et stöder inte andra autentiseringsmetoder. För strömmande förfrågningar används samma nyckel. Det finns inga ytterligare IP-begränsningar om inte specificerat i ditt OrcaRouter-konto.
Gemma 4 9B är en mindre, billigare modell – vanligtvis prissatt runt 0,02–0,10 dollar per miljon token – och har troligen lägre riktmärkespoäng. 31B-varianten, med 3,4 gånger fler parametrar, uppnår 85,7 % på GPQA Diamond; 9B:s poäng anges inte men är förmodligen lägre. 31B-modellen erbjuder bättre resonemang men till en högre kostnad och sannolikt högre latens. För enkla uppgifter kan 9B räcka; för expertnivåfrågor är 31B det bättre valet. Båda nås via samma OrcaRouter API.
Direkta jämförelser i riktmärken tillhandahålls inte. Llama 3.1 70B är dock en större modell (70B parametrar) och har ofta högre prestanda i allmänna riktmärken, men också högre kostnad per token. Gemma 4 31B är mer effektiv och kan vara konkurrenskraftig inom domänspecifika resonemang som GPQA. Den 31B stora storleken gör den attraktiv för driftsättning på konsument-GPU:er. Användare bör utvärdera på sina egna uppgifter. OrcaRouter kan erbjuda båda modellerna för direkt jämförelse.
Gemma 4 31B är en öppen viktmodell under Googles Gemma-licens, vilket tillåter fri användning för de flesta applikationer. Men när den nås via OrcaRouter omfattas du av OrcaRouters användarvillkor och betalar per token. Du kan också köra modellen själv på din egen hårdvara om du har resurserna. OrcaRouter erbjuder ett värdbaserat alternativ som undviker infrastrukturkostnader. Valet mellan egen hosting och att använda OrcaRouter beror på din budget, latenskrav och operativa preferenser.
OrcaRouter tillhandahåller en enhetlig API-slutpunkt för flera leverantörer, inklusive Google. Om du använder Googles egen Vertex AI eller AI Platform kan du få annan prissättning, eventuellt lägre för hög volym. OrcaRouters nollpåslag är konkurrenskraftigt för måttlig användning. Den främsta fördelen med OrcaRouter är det enda OpenAI-kompatibla API:t för många modeller, vilket förenklar integrationen. För användare som redan är på Google Cloud kan direkt åtkomst erbjuda bättre integration med andra tjänster. OrcaRouter lagrar inte dina data utöver vanlig API-loggnings; kontrollera deras integritetspolicy för detaljer.
OpenAI-kompatibel — behåll det SDK du redan använder
https://api.orcarouter.ai/v1from openai import OpenAI
client = OpenAI(
base_url="https://api.orcarouter.ai/v1",
api_key="$ORCAROUTER_API_KEY",
)
response = client.chat.completions.create(
model="google/gemma-4-31b-it",
messages=[{"role": "user", "content": "Hello"}],
)
print(response.choices[0].message.content)| Inmatning / 1M token | $0.130 |
| Utdata / 1M tokens | $0.380 |
| Cacheläsning / 1M | $0.020 |
| Valuta | USD |
Uppskattning baserad på listpris
Endast en uppskattning — faktiskt antal token beror på leverantörens tokenizer.
GET /api/public/models/google/gemma-4-31b-itÖppna @misc{orcarouter_gemma_4_31b_it,
title = {Gemma 4 31B API},
author = {Google},
year = {2026},
howpublished = {OrcaRouter},
url = {https://www.orcarouter.ai/models/google/gemma-4-31b-it}
}Google. (2026). Gemma 4 31B API. OrcaRouter. https://www.orcarouter.ai/models/google/gemma-4-31b-it