En förlustfri ocensurerad version av Gemma 4 26B A4B utformad för att bevara originalmodellens kapacitet samtidigt som vägrarbeteendet minimeras. Optimerad för utvecklare, AI-forskare och avancerade applikationer som kräver svar av hög kvalitet med minimala begränsningar. Den balanserade varianten rekommenderas för de flesta arbetsbelastningar, med kompletta svar samtidigt som den bibehåller stabil resonemangsförmåga och naturligt samtalsbeteende. I vissa känsliga scenarier kan modellen kortfattat rama in sitt resonemang innan den ger ett fullständigt svar, men den är utformad för att undvika att undanhålla innehåll. Jämfört med mer aggressiva ocensurerade varianter erbjuder Balanced mer konsekvent sampling, starkare långkontextstabilitet och minskad ämnesdrift i längre konversationer. Väl lämpad för kreativt skrivande, rollspel, flerspråkiga assistenter, långkontextresonemang och allmänna AI-applikationer där kvalitet, sammanhang och tillförlitlighet är de främsta prioriteringarna. Tillgång till denna modell är begränsad och avsedd för säkerhetsforskare, red teams, AI-säkerhetsforskare och andra kvalificerade yrkesverksamma som bedriver legitim forskning, utvärdering och testning.
Gemma 4 26B A4B Uncensored är en mixture-of-experts (MoE)-språkmodell från Googles Gemma 4-serie, hostad av leverantören Obsidian och tillgänglig via OrcaRouter. Den har 26 miljarder totala…
Gemma 4 26B A4B Uncensored utmärker sig i uppgifter som kräver långdistansresonemang över stora sammanhang, såsom boksammanfattning, flervarviga samtal med omfattande historik och kodbasanalys. Dess MoE-arkitektur gör den effektiv för batchbearbetning där många promptar hanteras samtidigt. Multimodala förmågor låter den resonera om bilder – till exempel att tolka diagram, memes eller produktbilder. Det ocensurerade beteendet är idealiskt för kreativt skrivande som utforskar mogna teman, vuxenrollspel eller att skapa fiktion utan innehållsrestriktioner. Den presterar även bra på standard-NLP-riktmärken för resonemang, matematik och kodning, liknande andra Gemma 4-varianter.
Om din uppgift inte kräver lång kontext (t.ex. under 8K tokens) eller multimodal indata, kan du bli bättre betjänad av en mindre tät modell som Gemma 2 9B eller Llama 3 8B, vilka är snabbare och billigare per token. För uppgifter som behöver säkerhetsfilter kan den ocensurerade modellen producera olämpliga utdata—välj istället en säkerhetsjusterad modell. Dessutom, om du behöver extremt låg latens för realtidschatt, kan denna MoE-modell vara långsammare än en liten tät modell på grund av expertdirigeringsomkostnaden. Överväg dina genomströmningsbehov: för högvolymsförfrågningar med kort kontext kan en billigare modell som Gemma 2 27B (tät) vara mer kostnadseffektiv.
Designen med mixture-of-experts aktiverar endast en delmängd av parametrarna per token (4 miljarder av totalt 26 miljarder). Detta minskar beräkningskostnaden per framåtpass jämfört med en tät 26B-modell, vilket möjliggör högre genomströmning på samma hårdvara. Routingen introducerar dock en liten latenskostnad per token och kan leda till obalans i expertbelastning om promptarna är mycket specialiserade. I praktiken erbjuder MoE-modeller som denna en bra avvägning: konkurrenskraftig kvalitet för en bråkdel av FLOPs. De 4B aktiva parametrarna är jämförbara med en tät 4B-modell när det gäller beräkning per token, men modellen drar nytta av kunskapen som lagras över totalt 26B parametrar.
Ja, modellen accepterar både text- och bildinmatningar. Du kan skicka en enskild bild eller flera bilder i en begäran, tillsammans med textinstruktioner. Bilderna kodas och bearbetas tillsammans med texten inom det 262 144-token långa kontextfönstret. Detta möjliggör visuell frågebesvarande, dokumentförståelse och uppgifter som kräver analys av diagram, scheman eller fotografier. Modellen använder en visionskodare (vanligtvis en ViT-liknande komponent) för att omvandla bilder till tokens. Även om de exakta detaljerna i arkitekturen inte är offentligt dokumenterade, stöder den standardbildformat. Observera att bilder förbrukar tokens proportionellt mot sin upplösning, så högupplösta bilder minskar den tillgängliga textkontexten.
Som en Gemma 4-variant har basmodellen (med säkerhetsjustering) visat starka resultat på resonemangsriktmärken som MMLU, GSM8K och kodningsuppgifter som HumanEval och MBPP. Den ocensurerade versionen behåller sannolikt dessa förmågor eftersom kärnmodellens vikter är oförändrade. Specifika riktmärkesresultat för denna ocensurerade variant har dock inte släppts. Användare kan förvänta sig konkurrenskraftiga resultat inom aritmetisk resonemang, kodgenerering och flerspråkiga uppgifter. Det 262K långa kontextfönstret möjliggör också överlägsen prestanda vid hämtning och sammanfattning av långa dokument jämfört med modeller med kortare kontext. För multimodala riktmärken bör modellen hantera dataset för visuell frågebesvarande på ett adekvat sätt.
Latensen för Gemma 4 26B A4B-modellen är generellt lägre än för en tät 26B-parametermodell eftersom endast 4B parametrar är aktiva per token. Dock tillför MoE-routningsmekanismen en liten överhead till varje genererad token, så den totala latensen per token kan vara något högre än en ren 4B tät modell. För batch-inferens med långa sekvenser kan genomströmningen vara högre på grund av minskade minnesbandbreddskrav. På OrcaRouter kommer latensen också att bero på den underliggande hårdvara som tillhandahålls av Obsidian-leverantören. Verklig prestanda bör testas med representativa arbetsbelastningar för att avgöra om den uppfyller dina hastighetskrav.
Trots sina styrkor har denna modell begränsningar. De 4B aktiva parametrarna innebär att den för mycket komplexa resonemang eller domänspecifik kunskap kan prestera sämre än större modeller som Gemma 4 47B (tät) eller frontmodeller. Den ocensurerade naturen innebär att utdata kan vara toxiska, partiska eller felaktigt anpassade till mänskliga värden om de används utan moderering. Den kan också generera skadligt innehåll som strider mot OpenAI:s användningspolicy när den nås via OrcaRouter – användare ansvarar för efterlevnad. Dessutom kan MoE-arkitekturen leda till inkonsekvent kvalitet över tokens om expertdirigering är suboptimal. Slutligen, multimodal förståelse, även om den finns, kanske inte matchar dedikerade syn-språkmodeller.
Priset för denna modell bestäms av leverantören Obsidian och förmedlas av OrcaRouter utan påslag. Du betalar $0.25 per miljon inmatningstokens och $2.90 per miljon utmatningstokens. Inmatningstokens inkluderar både text- och bildtokens (bilder tokeniseras före bearbetning). Utmatningstokens täcker det genererade svaret. Det tillkommer inga extra avgifter för API-anrop eller användning av kontextfönster utöver kostnaden per token. Detta pris är konkurrenskraftigt för en 26B MoE-modell, särskilt med tanke på det stora kontextfönstret. Avgifterna beräknas per begäran och visas på din OrcaRouter-faktureringsrapport.
Utmatningstokens är betydligt dyrare än inmatningstokens ($2.90 jämfört med $0.25 per miljon). Detta är typiskt för språkmodeller eftersom generering av tokens kräver mer beräkning än att bearbeta indata. För att minimera kostnaderna kan du strukturera prompts för att minska antalet utmatningstokens — till exempel genom att be om kortare svar eller använda systeminstruktioner för att begränsa ordrikedomen. Dessutom, eftersom inmatningskostnaderna är låga, har du råd att inkludera stora kontextfönster (upp till 262K tokens) utan att ruinera dig. Om ditt användningsfall innebär många korta prompts men långa svar, kommer kostnaden för utmatningstokens att dominera.
OrcaRouter tillhandahåller inte inbyggd cachelagring för denna modell. Prissättningen är per token och per begäran. Du kan dock implementera cachelagring på klientsidan för vanliga inmatningssekvenser för att undvika att skicka samma uppmaningar igen. Om du dessutom upprepar samma systemmeddelande i många konversationer kan du överväga att inkludera det i en lång kontext och återanvända samma session via chat completions API för att undvika redundanta inmatningstoken. Vissa leverantörer kan erbjuda egen promptcachelagring, men Obsidians prissättning som anges inkluderar inte ett alternativ för cachelagring. Kontrollera leverantörens dokumentation för eventuella rabatter på upprepade uppmaningar.
För att använda den här modellen, skicka förfrågningar till den OpenAI-kompatibla slutpunkten https://api.orcarouter.ai/v1. Ställ in modellparametern till "obsidian/gemma-4-26B-A4B". Din API-nyckel från OrcaRouter ska inkluderas i Authorization-huvudet som Bearer-token. API:et stöder både textkompletterings- och chattkompletteringsslutpunkter. För chatt, använd slutpunkten /v1/chat/completions med en meddelandematris som innehåller användar-, assistent- och systemroller. För multimodala förfrågningar, inkludera bild-URL:er eller base64-data i innehållsfältet. Ett exempel på en förfrågningskropp i Python skulle använda openai-biblioteket med base_url inställt på OrcaRouters slutpunkt och modell-ID som ovan.
API:et stöder standardparametrar för OpenAI: temperature (0-2, standard 1), top_p (0-1), max_tokens (upp till kontextfönstret), presence_penalty, frequency_penalty, stoppsekvenser och n (antal fullbordanden). För multimodal accepterar innehållsfältet en array med typen "text" och typen "image_url". Du kan också ställa in stream=true för strömmande svar. Modellen stöder systemmeddelanden. Kontextfönstret är 262,144 tokens inklusive indata och utdata. Alla parametrar kanske inte stöds exakt som dokumenterat; kontrollera OrcaRouter-dokumentationen för eventuella providerspecifika begränsningar. För bästa resultat, ställ in temperature mellan 0.7 och 1.0 för kreativa uppgifter och lägre för deterministiska utdata.
Migreringen är enkel tack vare API:et som är kompatibelt med OpenAI. Om du för närvarande använder OpenAI Python-klienten, ändra base_url till https://api.orcarouter.ai/v1 och ställ in din API-nyckel till din OrcaRouter-nyckel. Uppdatera model-parametern från det tidigare modellnamnet till "obsidian/gemma-4-26B-A4B". Inga andra kodändringar krävs för de flesta användningsfall. För multimodala förfrågningar kan bildformatet skilja sig; använd samma struktur som OpenAIs vision-API. Testa några förfrågningar för att säkerställa kompatibilitet. Observera att hastighetsbegränsningar och felhantering kan skilja sig; konsultera OrcaRouters dokumentation för bästa praxis.
Bas-URL:en för alla API-anrop är https://api.orcarouter.ai/v1. Den exakta modellidentifieraren som ska användas i förfrågningar är "obsidian/gemma-4-26B-A4B". Detta ID måste skickas som model-parameter i chat-completions- eller completions-anrop. Det finns inget alternativt modell-ID för denna variant. Se till att inkludera hela prefixet 'obsidian/' för att dirigera korrekt till Obsidian-leverantören. Om du försöker använda ett generiskt 'gemma-4-26B-A4B'-ID utan leverantörsprefixet, kan den inte lösas. Leverantörsprefixet är nödvändigt eftersom OrcaRouter stöder flera leverantörer som erbjuder samma basmodell.
Inom Gemma 4-familjen erbjuder Google både täta och MoE-varianter. Den täta versionen (t.ex. Gemma 4 47B) har alla parametrar aktiva, vilket ger högre kvalitet per token men till högre beräkningskostnad. MoE-versionen med totalt 26B och 4B aktiva erbjuder en sweet spot för kostnadseffektivitet. Jämfört med Gemma 4 2B eller 9B täta har denna modell bredare kunskap på grund av högre totalt antal parametrar. Bland MoE-modeller är Gemma 4 26B A4B mindre än större MoE-modeller som Mixtral 8x22B (totalt 141B, 39B aktiva). Den ocensurerade aspekten är unik för denna Obsidian-variant; andra Gemma 4-modeller innehåller säkerhetsjusteringar.
Ocensurerade modeller som de från Llama 3-Uncensored eller Wizard-serien tar vanligtvis bort säkerhetsfilter från en basmodell. Denna Gemma 4-variant är ett av få MoE-alternativ utan censur, med ett större totalt antal parametrar (26B) men färre aktiva parametrar (4B). Jämfört med Llama 3 70B Uncensored är den mycket mindre och billigare men kan ha lägre potential för komplexa uppgifter. Dess 262K kontextfönster är betydligt större än de flesta ocensurerade modeller, som ofta har max 8K–32K. Det multimodala stödet är också en skillnad: de flesta ocensurerade modeller är endast textbaserade.
GPT-4o och Claude 3.5 Sonnet är större, proprietära modeller med omfattande säkerhetsjustering och multimodal kapacitet. De överträffar i allmänhet Gemma 4 26B A4B i benchmarks och verkliga uppgifter, särskilt när det gäller resonemang, kreativitet och konsekvens. De är dock mycket dyrare per token (GPT-4o: $5/M input, $15/M output; Claude: $3/M input, $15/M output). Gemma-modellen är idealisk för kostnadskänsliga applikationer som behöver stort sammanhang men utan säkerhetsbegränsningar. Den kommer inte att matcha frontmodellerna när det gäller subtil instruktionsföljning eller faktaprecision, men kan vara tillräcklig för många generativa uppgifter.
Välj denna modell framför en större modell (som GPT-4o eller Claud Opus) när: (1) du behöver ett mycket stort kontextfönster (262K) utan att betala premiumpriser; (2) du kräver ocensurerade utdata för tillåtna användningsfall; (3) din arbetsbelastning är hög genomströmning och MoE-kostnadseffektivitet är viktig; (4) dina uppgifter ligger inom kapaciteten för en 4B aktiv parameter-modell. Undvik denna modell om du behöver högsta kvalitet för kritiska beslut, strikt säkerhetsjustering eller extremt komplexa resonemang. För många vanliga uppgifter som sammanfattning, översättning eller frågor och svar på långa dokument erbjuder denna modell ett starkt pris-prestandaförhållande.
| Inmatning / 1M token | $0.250 |
| Utdata / 1M tokens | $2.90 |
| Valuta | USD |
Uppskattning baserad på listpris
Endast en uppskattning — faktiskt antal token beror på leverantörens tokenizer.
GET /api/public/models/obsidian/gemma-4-26B-A4BÖppna @misc{orcarouter_gemma_4_26b_a4b,
title = {Gemma4 26B A4B Uncensored (Balanced) API},
author = {obsidian},
year = {2026},
howpublished = {OrcaRouter},
url = {https://www.orcarouter.ai/models/obsidian/gemma-4-26B-A4B}
}obsidian. (2026). Gemma4 26B A4B Uncensored (Balanced) API. OrcaRouter. https://www.orcarouter.ai/models/obsidian/gemma-4-26B-A4B