Een verliesvrije, ongecensureerde versie van Gemma 4 26B A4B, ontworpen om de mogelijkheden van het originele model te behouden en tegelijkertijd weigeringsgedrag te minimaliseren. Geoptimaliseerd voor ontwikkelaars, AI-onderzoekers en geavanceerde toepassingen die hoogwaardige antwoorden met minimale beperkingen vereisen. De Balanced-variant wordt aanbevolen voor de meeste workloads, waarbij volledige antwoorden worden gegeven met behoud van stabiele redenering en natuurlijk gespreksgedrag. In sommige gevoelige scenario's kan het model kort zijn redenering kaderen voordat het het volledige antwoord geeft, maar het is ontworpen om het achterhouden van inhoud te vermijden. Vergeleken met agressievere ongecensureerde varianten biedt Balanced consistentere sampling, sterkere stabiliteit over lange contexten en minder onderwerpafwijking in langere gesprekken. Zeer geschikt voor creatief schrijven, rollenspel, meertalige assistenten, redenering met lange context en algemene AI-toepassingen waar kwaliteit, coherentie en betrouwbaarheid de belangrijkste prioriteiten zijn. Toegang tot dit model is beperkt en bedoeld voor beveiligingsonderzoekers, red teams, AI-veiligheidsonderzoekers en andere gekwalificeerde professionals die legitiem onderzoek, evaluatie en testen uitvoeren.
Gemma 4 26B A4B Uncensored is een mengsel-van-experts (MoE) taalmodel uit Google's Gemma 4-serie, gehost door provider Obsidian en toegankelijk via OrcaRouter. Het heeft in totaal 26 miljard…
Gemma 4 26B A4B Uncensored blinkt uit in taken die langdurige redenering over grote contexten vereisen, zoals boeksamenvattingen, meerkeerige gesprekken met uitgebreide geschiedenis en codebase-analyse. De MoE-architectuur maakt het efficiënt voor batchverwerking waarbij veel prompts gelijktijdig worden behandeld. Multimodale mogelijkheden stellen het in staat om afbeeldingen te redeneren—bijvoorbeeld het interpreteren van grafieken, memes of productfoto's. Het ongecensureerde gedrag is ideaal voor creatief schrijven dat volwassen thema's verkent, rollenspel voor volwassenen of het genereren van fictie zonder inhoudelijke beperkingen. Het presteert ook goed op standaard NLP-benchmarks voor redeneren, wiskunde en coderen, vergelijkbaar met andere Gemma 4-varianten.
Als uw taak geen lange context vereist (bijv. minder dan 8K tokens) of multimodale invoer, kunt u beter worden bediend door een kleiner dicht model zoals Gemma 2 9B of Llama 3 8B, die sneller en goedkoper per token zijn. Voor taken die veiligheidsfilters nodig hebben, kan het ongecensureerde model ongepaste uitvoer produceren—kies in plaats daarvan een veiligheid-afgestemd model. Ook, als u extreem lage latentie nodig heeft voor real-time chat, kan dit MoE-model langzamer zijn dan een klein dicht model vanwege de overhead van expertroutering. Overweeg uw doorvoerbehoeften: voor aanvragen met een hoog volume en korte context kan een goedkoper model zoals Gemma 2 27B (dicht) kosteneffectiever zijn.
Het mixture-of-experts-ontwerp activeert per token slechts een subset van de parameters (4 miljard van de 26 miljard totaal). Dit verlaagt de rekenkosten per forward pass vergeleken met een dicht 26B-model, waardoor een hogere doorvoer op dezelfde hardware mogelijk is. De routing introduceert echter een lichte latentie-overhead per token en kan leiden tot een onbalans in de belasting van experts als prompts zeer gespecialiseerd zijn. In de praktijk bieden MoE-modellen zoals deze een goede afweging: concurrerende kwaliteit voor een fractie van de FLOPs. De 4B actieve parameters zijn qua rekenkracht per token vergelijkbaar met een 4B dicht model, terwijl het model profiteert van de kennis die is opgeslagen in 26B totale parameters.
Ja, het model accepteert zowel tekst- als afbeeldingsinvoer. U kunt een enkele afbeelding of meerdere afbeeldingen in een aanvraag sturen, samen met tekstinstructies. De afbeeldingen worden gecodeerd en samen met de tekst verwerkt binnen het contextvenster van 262.144 tokens. Dit maakt visuele vraagbeantwoording, documentbegrip en taken die het analyseren van grafieken, diagrammen of foto's vereisen mogelijk. Het model gebruikt een vision encoder (meestal een ViT-achtige component) om afbeeldingen om te zetten in tokens. Hoewel de exacte details van de architectuur niet openbaar zijn gedocumenteerd, ondersteunt het standaard afbeeldingsformaten. Merk op dat afbeeldingen tokens verbruiken die evenredig zijn aan hun resolutie, dus afbeeldingen met een hoge resolutie verminderen de beschikbare tekstcontext.
Als een Gemma 4-variant heeft het basismodel (met veiligheidsafstemming) sterke prestaties laten zien op redeneerbenchmarks zoals MMLU, GSM8K, en codeertaken zoals HumanEval en MBPP. De ongecensureerde versie behoudt waarschijnlijk deze mogelijkheden omdat de kernmodelgewichten ongewijzigd zijn. Er zijn echter geen specifieke benchmarkscores voor deze ongecensureerde variant vrijgegeven. Gebruikers kunnen concurrerende resultaten verwachten op het gebied van rekenkundig redeneren, codegeneratie en meertalige taken. Het contextvenster van 262K zorgt ook voor superieure prestaties bij het ophalen en samenvatten van lange documenten in vergelijking met modellen met een kortere context. Voor multimodale benchmarks zou het model adequaat om moeten gaan met datasets voor visuele vraagbeantwoording.
De latentie voor het Gemma 4 26B A4B-model is over het algemeen lager dan die van een dicht model met 26B parameters, omdat er slechts 4B parameters actief zijn per token. Het MoE-routeringsmechanisme voegt echter een kleine overhead toe aan elk gegenereerd token, waardoor de totale latentie per token iets hoger kan zijn dan bij een puur 4B dicht model. Bij batch-inferentie met lange sequenties kan de doorvoer hoger zijn door de lagere vraag naar geheugenbandbreedte. Op OrcaRouter hangt de latentie ook af van de onderliggende hardware die door de Obsidian-provider wordt geleverd. Prestaties in de praktijk moeten worden getest met representatieve workloads om te bepalen of ze voldoen aan uw snelheidsvereisten.
Ondanks zijn sterke punten heeft dit model beperkingen. De 4B actieve parameters betekenen dat het voor zeer complexe redeneringen of domeinspecifieke kennis mogelijk minder presteert dan grotere modellen zoals Gemma 4 47B (dicht) of geavanceerde modellen. De ongecensureerde aard betekent dat uitvoer toxisch, bevooroordeeld of niet in lijn met menselijke waarden kan zijn als het zonder moderatie wordt gebruikt. Het kan ook schadelijke inhoud genereren die de gebruiksvoorwaarden van OpenAI schendt wanneer het via OrcaRouter wordt benaderd – gebruikers zijn zelf verantwoordelijk voor naleving. Bovendien kan de MoE-architectuur leiden tot inconsistente kwaliteit over tokens heen als de expertroutering suboptimaal is. Ten slotte kan het multimodale begrip, hoewel aanwezig, mogelijk niet op tegen speciale visie-taalmodelen.
De prijs voor dit model wordt vastgesteld door de aanbieder Obsidian en doorberekend via OrcaRouter zonder winstopslag. U betaalt $0,25 per miljoen invoertokens en $2,90 per miljoen uitvoertokens. Invoertokens omvatten zowel tekst- als afbeeldingstokens (afbeeldingen worden vóór verwerking getokeniseerd). Uitvoertokens hebben betrekking op het gegenereerde antwoord. Er zijn geen extra kosten voor API-aanroepen of contextvenstergebruik bovenop de kosten per token. Deze prijs is concurrerend voor een 26B MoE-model, vooral gezien het grote contextvenster. Kosten worden per verzoek berekend en verschijnen op uw OrcaRouter-factuuroverzicht.
Uitvoertokens zijn aanzienlijk duurder dan invoertokens ($2,90 vs $0,25 per miljoen). Dit is typisch voor taalmodellen omdat het genereren van tokens meer rekenkracht vereist dan het verwerken van invoer. Om kosten te minimaliseren, kun je prompts zo structureren dat het aantal uitvoertokens vermindert—bijvoorbeeld door kortere antwoorden te vragen of systeeminstructies te gebruiken om uitgebreidheid te beperken. Omdat invoerkosten laag zijn, kun je bovendien grote contextvensters (tot 262K tokens) toestaan zonder dat dit de bank breekt. Als jouw gebruik veel korte prompts maar lange antwoorden omvat, zullen de uitvoertokenkosten de overhand krijgen.
OrcaRouter biedt geen ingebouwde caching voor dit model. De prijzen zijn per token en per aanvraag. U kunt echter client-side caching van veelvoorkomende invoerreeksen implementeren om te voorkomen dat u identieke prompts opnieuw verzendt. Als u hetzelfde systeembericht in veel gesprekken herhaalt, kunt u overwegen om het op te nemen in een lange context en dezelfde sessie opnieuw te gebruiken via de chat completions API om redundante invoertokens te vermijden. Sommige providers bieden mogelijk hun eigen prompt caching aan, maar de vermelde prijzen van Obsidian bevatten geen cacheoptie. Raadpleeg de documentatie van de provider voor eventuele kortingen op herhaalde prompts.
Om dit model te gebruiken, stuurt u verzoeken naar het OpenAI-compatibele eindpunt https://api.orcarouter.ai/v1. Stel de modelparameter in op "obsidian/gemma-4-26B-A4B". Uw API-sleutel van OrcaRouter moet worden opgenomen in de Authorization-header als Bearer token. De API ondersteunt zowel tekst- als chatvoltooiings-eindpunten. Gebruik voor chat het /v1/chat/completions-eindpunt met een messages-array met rollen voor user, assistant en system. Voeg voor multimodale verzoeken afbeeldings-URL's of base64-gegevens toe in het content-veld. Een voorbeeld van een verzoekbody in Python gebruikt de openai-bibliotheek met base_url ingesteld op het eindpunt van OrcaRouter en de model-ID zoals hierboven.
De API ondersteunt standaard OpenAI-parameters: temperature (0-2, standaard 1), top_p (0-1), max_tokens (tot contextvenster), presence_penalty, frequency_penalty, stop-sequenties, en n (aantal voltooiingen). Voor multimodaal accepteert het contentveld een array met type "text" en type "image_url". Je kunt ook stream=true instellen voor streamingantwoorden. Het model ondersteunt systeemberichten. Contextvenster is 262,144 tokens inclusief invoer en uitvoer. Niet alle parameters worden mogelijk precies ondersteund zoals gedocumenteerd; raadpleeg de OrcaRouter-documentatie voor eventuele providerspecifieke beperkingen. Voor de beste resultaten stel je temperature in tussen 0,7 en 1,0 voor creatieve taken, en lager voor deterministische uitvoer.
Migratie is eenvoudig vanwege de OpenAI-compatibele API. Als u momenteel de OpenAI Python-client gebruikt, wijzig dan de base_url naar https://api.orcarouter.ai/v1 en stel uw API-sleutel in op uw OrcaRouter-sleutel. Werk de modelparameter bij van de vorige modelnaam naar "obsidian/gemma-4-26B-A4B". Voor de meeste gebruikssituaties zijn geen andere codewijzigingen nodig. Voor multimodale verzoeken kan het afbeeldingsformaat verschillen; gebruik dezelfde structuur als de vision-API van OpenAI. Test een paar verzoeken om compatibiliteit te garanderen. Houd er rekening mee dat snelheidslimieten en foutafhandeling kunnen verschillen; raadpleeg de documentatie van OrcaRouter voor best practices.
De basis-URL voor alle API-aanroepen is https://api.orcarouter.ai/v1. De exacte modelidentificatie die in verzoeken moet worden gebruikt, is "obsidian/gemma-4-26B-A4B". Deze ID moet worden doorgegeven als de modelparameter in chat completions of completions-aanroepen. Er is geen alternatieve model-ID voor deze variant. Zorg ervoor dat u het volledige voorvoegsel 'obsidian/' opneemt om correct naar de Obsidian-provider te routeren. Als u probeert een generieke 'gemma-4-26B-A4B'-ID te gebruiken zonder het provider-voorvoegsel, wordt dit mogelijk niet opgelost. Het provider-voorvoegsel is noodzakelijk omdat OrcaRouter meerdere providers ondersteunt die hetzelfde basismodel aanbieden.
Binnen de Gemma 4-familie biedt Google zowel dichte als MoE-varianten. De dichte versie (bijv. Gemma 4 47B) heeft alle parameters actief, wat een hogere kwaliteit per token oplevert, maar tegen hogere rekenkosten. De MoE-versie met 26B totaal en 4B actief biedt een ideale balans voor kostenefficiëntie. Vergeleken met Gemma 4 2B of 9B dicht, heeft dit model een bredere kennis vanwege het grotere totale aantal parameters. Onder MoE-modellen is Gemma 4 26B A4B kleiner dan grotere MoE-modellen zoals Mixtral 8x22B (141B totaal, 39B actief). Het ongecensureerde aspect is uniek voor deze Obsidian-variant; andere Gemma 4-modellen bevatten veiligheidsafstemming.
Ongecensureerde modellen zoals die van de Llama 3-Uncensored of Wizard-serie verwijderen doorgaans veiligheidsfilters van een basismodel. Deze Gemma 4-variant is een van de weinige MoE-ongecensureerde opties en biedt een groter totaal aantal parameters (26B) met lagere actieve parameters (4B). Vergeleken met Llama 3 70B Uncensored is het veel kleiner en goedkoper, maar kan het een lagere bovengrens hebben voor complexe taken. Het contextvenster van 262K is aanzienlijk groter dan de meeste ongecensureerde modellen, die vaak beperkt zijn tot 8K-32K. De multimodale ondersteuning is ook een onderscheidend kenmerk: de meeste ongecensureerde modellen zijn alleen-tekst.
GPT-4o en Claude 3.5 Sonnet zijn grotere, propriëtaire modellen met uitgebreide veiligheidsafstemming en multimodale mogelijkheden. Ze presteren over het algemeen beter dan Gemma 4 26B A4B op benchmarks en real-world taken, vooral op het gebied van redeneren, creativiteit en consistentie. Ze zijn echter veel duurder per token (GPT-4o: $5/M input, $15/M output; Claude: $3/M input, $15/M output). Het Gemma-model is ideaal voor kostenbewuste toepassingen die een grote context nodig hebben maar zonder veiligheidsbeperkingen. Het zal niet tippen aan de frontier-modellen op het gebied van subtiele instructie-opvolging of feitelijke nauwkeurigheid, maar kan voldoende zijn voor veel generatieve taken.
Kies dit model boven een groter model (zoals GPT-4o of Claud Opus) wanneer: (1) u een zeer groot contextvenster (262K) nodig heeft zonder premieprijzen te betalen; (2) u ongecensureerde uitvoer nodig heeft voor toegestane gebruikssituaties; (3) uw werklast een hoge doorvoer heeft en de kosten efficiëntie van MoE van belang is; (4) uw taken binnen de mogelijkheden van een 4B actief parametermodel vallen. Vermijd dit model als u de hoogste kwaliteit nodig heeft voor kritieke beslissingen, strikte veiligheidsafstemming of uiterst complexe redeneringen. Voor veel gangbare taken zoals samenvatting, vertaling of Q&A over lange documenten biedt dit model een sterke prijs-prestatieverhouding.
| Invoer / 1M tokens | $0.250 |
| Uitvoer / 1M tokens | $2.90 |
| Valuta | USD |
Schatting op basis van catalogusprijs
Alleen een schatting — het werkelijke aantal tokens hangt af van de tokenizer van de aanbieder.
GET /api/public/models/obsidian/gemma-4-26B-A4BOpenen @misc{orcarouter_gemma_4_26b_a4b,
title = {Gemma4 26B A4B Uncensored (Balanced) API},
author = {obsidian},
year = {2026},
howpublished = {OrcaRouter},
url = {https://www.orcarouter.ai/models/obsidian/gemma-4-26B-A4B}
}obsidian. (2026). Gemma4 26B A4B Uncensored (Balanced) API. OrcaRouter. https://www.orcarouter.ai/models/obsidian/gemma-4-26B-A4B