Gemma 4 26B A4B IT är en instruktionstränad Mixture-of-Experts (MoE)-modell från Google DeepMind. Trots totalt 25.2B parametrar aktiveras endast 3.8B per token under inferens — levererar kvalitet nära 31B vid...
Gemma 4 26B A4B är en Mixture-of-Experts-modell utvecklad av Google. Den har totalt 26 miljarder parametrar men endast 4 miljarder är aktiva per token – denna design minskar beräkningskostnaden…
Gemma 4 26B A4B accepterar text, bild och video som indata. Bilder kan anges som base64-kodade data eller URL:er. Video kan anges som en URL eller som en sekvens av bildrutor (bildobjekt). Modellen bearbetar dessa modaliteter gemensamt, vilket möjliggör uppgifter som visuell frågebesvarande, videosammanfattning och diagramförståelse. Ljud stöds inte; endast visuellt och textuellt innehåll. Utdata är endast text. Modellens multimodala förmåga är särskilt användbar för att analysera dokument som innehåller diagram, skärmdumpar eller videoinspelningar.
Kontextfönstret är 262 144 tokens. Detta gör att modellen kan bearbeta mycket långa sekvenser i ett enda pass – till exempel ett 200-sidigt dokument, timmar av transkriberad video eller en stor uppsättning bilder med beskrivande bildtexter. Större kontextfönster minskar behovet av styckindelning och sammanfattning, men de ökar också minnesanvändningen. Den effektiva längd du kan använda beror på det totala antalet inmatningstokens (text + bild-/videotokens). Var medveten om att bild- och videoinmatningar förbrukar många tokens; se OrcaRouters dokumentation för hur tokenantal beräknas för icke-textinmatningar.
Om din uppgift är rent textbaserad, kräver endast en kort kontext (under 8k tokens), eller inte behöver multimodal indata, överväg en mindre eller billigare modell—till exempel Gemma 3 4B eller en text-only variant. Gemma 4 26B A4B är prissatt till $0.06 per miljon inmatningstokens och $0.33 per miljon utmatningstokens. För enkel frågebesvarande eller klassificering kan modeller med lägre kostnad per token vara mer ekonomiska. MoE-designen gör den effektiv i förhållande till sin totala storlek, men inte det billigaste alternativet som finns på OrcaRouter för minimala uppgifter.
GPQA Diamond är ett riktmärke bestående av 448 flervalsfrågor på forskarnivå inom biologi, fysik och kemi. En poäng på 79,2 innebär att modellen svarade rätt på 79,2%. Detta indikerar starkt vetenskapligt resonemang och kunskapsåtervinning. Riktmärket är utformat för att vara svårt för många LLM:er. Ett enskilt riktmärke kan dock inte fånga alla aspekter av modellkvalitet. Till exempel kan modellens prestanda på andra uppgifter som kodning eller kreativt skrivande skilja sig. Använd denna poäng som en datapunkt när du jämför modeller för liknande vetenskapliga resonemangsuppgifter.
Styrkor inkluderar multimodal förståelse med stort sammanhang, MoE-effektivitet för sin storlek, och starkt resonemang kring vetenskapliga frågor som indikeras av GPQA. Begränsningar är inte uttömmande dokumenterade men är typiska för MoE-modeller: prestanda kan variera mellan domäner, och den effektiva kapaciteten per token begränsas av de 4B aktiva parametrarna. Modellen kan ha svårigheter med uppgifter som kräver extremt djupa logiska kedjor eller domänspecifik jargong som inte är väl representerad i träningsdata. Latens och genomströmning beror på hårdvaran för distribution; OrcaRouter garanterar inga specifika hastighetsmått.
OrcaRouter publicerar inte standardiserade latensriktmärken för denna modell. Som en MoE-modell aktiverar Gemma 4 26B A4B endast en delmängd av parametrar per token, vilket kan göra inferens snabbare än en tät 26B-modell men möjligen långsammare än en mindre tät modell. Verklig prestanda beror på faktorer som batchstorlek, indatalängd och typ av backend-GPU. För realtidsapplikationer, testa med din specifika arbetsbelastning. Du kan också överväga avvägningen mellan latens och kostnad—att använda en mindre modell kan förbättra hastigheten till lägre kostnad.
Prissättningen är $0,06 per 1 miljon inmatningstokens och $0,33 per 1 miljon utmatningstokens. Dessa är de avgifter som faktureras av leverantören (Google) och vidarebefordras av OrcaRouter utan påslag. Det innebär att du betalar exakt leverantörens avgift – OrcaRouter lägger inte på någon extra kostnad. Tokens räknas konsekvent över plattformen; bilder och videorutor tokeniseras enligt Googles modellspecifikationer. För en typisk multimodal fråga med några bilder kan inmatningstokens dominera, vilket gör inmatningsprissättningen till den huvudsakliga kostnadsdrivaren.
OrcaRouter kan erbjuda cachningsmekanismer för upprepade prefix- eller promptmallar, vilket kan minska tokenförbrukningen och sänka kostnaderna. Specifika cachningsrabatter garanteras dock inte för denna modell och beror på din användningsprofil. Det finns ingen separat batchprisnivå publicerad för Gemma 4 26B A4B. För högvolymarbetsbelastningar, kontakta OrcaRouter-supporten för att diskutera möjliga rabatter. Som med alla modeller på plattformen debiteras du endast för det du använder – inkommande och utgående tokens – utan månadsavgift eller minimiåtagande.
Med tanke på prissättningsstrukturen beror den totala kostnaden på antalet och typen av tokens du skickar och tar emot. Multimodala indata (särskilt video) kan använda många indatatokens eftersom varje bildruta kodas. För långa videor kan indatakostnaden överstiga utdatakostnaden. Om din uppgift är utdata-tung (t.ex. generering av långa rapporter), är utdatapriset ($0.33/M) högre än indatapriset. Utvärdera ditt förväntade tokenförhållande. För uppgifter som kan lösas med en billigare text-only-modell kan skillnaden i kostnad vara betydande. Använd OrcaRouters tokenräkningsverktyg för att uppskatta.
Ställ in bas-URL:n till https://api.orcarouter.ai/v1 och använd modell-ID google/gemma-4-26b-a4b-it. Skicka en POST-förfrågan till /chat/completions med standard Open AI-schemat. För multimodal indata, inkludera en array av innehållsobjekt med fältet type inställt på 'text', 'image_url' eller 'video_url'. Exempel: messages: [{ role: 'user', content: [{ type: 'text', text: 'Beskriv den här videon.' }, { type: 'video_url', video_url: { url: 'https://example.com/video.mp4' } }] }]. API:t returnerar ett chattkompletteringssvar.
Du kan använda standard OpenAI-parametrar som temperature, top_p, max_tokens, stop, frequency_penalty och presence_penalty. Dessutom stöder OrcaRouter leverantörsspecifika parametrar via det valfria fältet 'provider' i request body (krävs inte för denna modell). Modellen stöder inbyggt strömning genom att sätta stream=true. För strukturerade utdata, använd parametern 'response_format' med typ 'json_object' eller ett JSON-schema. Se OrcaRouters dokumentation för eventuella extra parametrar som 'reasoning_effort' – även om det inte listas för denna modell.
Att byta från en annan OpenAI-kompatibel API är enkelt: ändra bas-URL till https://api.orcarouter.ai/v1 och ställ in modellen till google/gemma-4-26b-a4b-it. Din befintliga promptstruktur, parametrar och SDK-klient är kompatibla eftersom OrcaRouter följer samma schema. Om du använde en annan leverantörs SDK kan du behöva uppdatera slutpunkten och autentiseringen. OrcaRouter använder API-nycklar snarare än OAuth; inkludera din nyckel i Authorization-headern som 'Bearer YOUR_KEY'. Testa med en liten begäran först.
Gemma 4 26B A4B är en nyare multimodal MoE-modell med 262k kontext och en GPQA Diamond-poäng på 79.2, medan Gemma 3 8B är en mindre tät modell (8B parametrar) med ett kontextfönster på 128k och inget inbyggt videostöd. Gemma 3 8B är billigare på inmatningstokens (vanligtvis $0.05-0.10 per miljon inmatning) men kanske inte matchar resonemangskvaliteten på svåra vetenskapliga frågor. För uppgifter som involverar video eller mycket långa dokument är Gemma 4 26B A4B det självklara valet. För textbaserade uppgifter med måttlig kontext kan Gemma 3 8B vara tillräcklig och mer kostnadseffektiv.
Llama 3.1 70B är en dens modell med 70B parametrar och 128k kontext, inte nativt multimodal för video (även om den kan bearbeta bilder). Gemma 4 26B A4B använder MoE för att aktivera endast 4B parametrar per token, vilket potentiellt erbjuder snabbare inferens än den betydligt större Llama-modellen. På GPQA Diamond får Gemma 4 26B A4B 79,2 poäng; Llama 3.1 70B får runt 65–70 (inte direkt jämförbart på grund av versionsskillnader i benchmark). Llama 3.1 70B kan vara dyrare på inmatningstoken (cirka $0,35 per miljon inmatning). För multimodala och långkontextscenarier kan Gemma 4 vara mer effektiv.
GPT-4o är en tät proprietär modell från OpenAI med multimodalt stöd och en kontextfönster på 128k (standard) och upp till 1M för vissa versioner. Dess prissättning är betydligt högre (t.ex. $2.50 per miljon inmatningstokens för GPT-4o). Gemma 4 26B A4B är öppen vikt och tillgänglig via OrcaRouter till en mycket lägre kostnad ($0.06/$0.33). Prestanda på GPQA Diamond för GPT-4o är inte direkt jämförbar, men vanligtvis högre. Men för kostnadskänsliga applikationer som inte kräver resonemang på frontier-nivå, erbjuder Gemma 4 26B A4B ett starkt pris-prestanda-förhållande. Datahantering skiljer sig: Gemma 4 kommer från Google med separata integritetsvillkor.
Jämfört med andra öppna viktade MoE-modeller som Mixtral 8x7B (46.7B totalt, 12.9B aktiva) eller Qwen2.5-72B-A3B (72B totalt, 3B aktiva) erbjuder Gemma 4 26B A4B en unik kombination: ett 262k kontextfönster, fullt multimodalt stöd (bild+video) och ett publicerat GPQA Diamond-resultat på 79.2. Mixtral 8x7B har ett 32k kontext och inget videostöd. Qwen2.5-72B-A3B har ett 128k kontext och stöder text men inte video. Det aktiva parameterantalet på 4B är jämförbart med andra små MoE-modeller, men Gemma 4:s specifika arkitektur—tränad av Google och finjusterad för instruktionsföljning—kan ge den en fördel inom multimodala och vetenskapliga uppgifter.
OpenAI-kompatibel — behåll det SDK du redan använder
https://api.orcarouter.ai/v1from openai import OpenAI
client = OpenAI(
base_url="https://api.orcarouter.ai/v1",
api_key="$ORCAROUTER_API_KEY",
)
response = client.chat.completions.create(
model="google/gemma-4-26b-a4b-it",
messages=[{"role": "user", "content": "Hello"}],
)
print(response.choices[0].message.content)frequency_penaltyinclude_reasoninglogit_biaslogprobsmax_tokensmin_ppresence_penaltyreasoningrepetition_penaltyresponse_formatseedstopstreamstructured_outputstemperaturetool_choicetoolstop_ktop_logprobstop_p| Inmatning / 1M token | $0.060 |
| Utdata / 1M tokens | $0.330 |
| Cacheläsning / 1M | $0.0075 |
| Valuta | USD |
Uppskattning baserad på listpris
Endast en uppskattning — faktiskt antal token beror på leverantörens tokenizer.
GET /api/public/models/google/gemma-4-26b-a4b-itÖppna @misc{orcarouter_gemma_4_26b_a4b_it,
title = {Gemma 4 26B A4B API},
author = {Google},
year = {2026},
howpublished = {OrcaRouter},
url = {https://www.orcarouter.ai/models/google/gemma-4-26b-a4b-it}
}Google. (2026). Gemma 4 26B A4B API. OrcaRouter. https://www.orcarouter.ai/models/google/gemma-4-26b-a4b-it