Qwen3.6 35B A3B Uncensored (Aggressive) vs Gemma4 26B A4B Uncensored (Balanced): benchmarks, prijzen & snelheid (augustus 2026)

Een directe vergelijking van Qwen3.6 35B A3B Uncensored (Aggressive) (obsidian) en Gemma4 26B A4B Uncensored (Balanced) (obsidian) op OrcaRouter — prijzen, contextvenster, latentie, doorvoer en benchmarkkwaliteit, naast elkaar, zodat je het juiste model voor je werklast kunt kiezen.

Kort samengevat

Qua prijs is Gemma4 26B A4B Uncensored (Balanced) de goedkopere optie — ongeveer 19% onder Qwen3.6 35B A3B Uncensored (Aggressive) op invoertokens. Voor latentiegevoelige werklasten levert Gemma4 26B A4B Uncensored (Balanced) het eerste token eerder. Gemma4 26B A4B Uncensored (Balanced) loopt voorop op zowel kosten als mediane latency en is daarmee de standaardkeuze.

Gratis starten · beide modellen op één sleutel · afgerekend tegen providerkosten, geen token-opslag

Zowel Qwen3.6 35B A3B Uncensored (Aggressive) als Gemma4 26B A4B Uncensored (Balanced) zijn beschikbaar via hetzelfde OrcaRouter-endpoint tegen de kostprijs van de provider en zonder enige token-opslag, dus wisselen tussen beide is een wijziging van één regel en de cijfers hieronder zijn wat je daadwerkelijk betaalt.

Lees de volledige analyse

Deze vergelijking haalt live prijzen op, de gepubliceerde context window en OrcaRouters eigen metingen van latency en throughput, zodat je kosten tegen prestaties kunt afwegen voor jouw specifieke werklast in plaats van te vertrouwen op een etalage-benchmark van een leverancier. De juiste keuze hangt bijna altijd af van de vorm van je verkeer — promptlengte, hoeveel tekst je genereert, hoe latency-gevoelig je gebruikers zijn en hoe zwaar het redeneren is — daarom ontleden de secties hieronder de beslissing één dimensie per keer en eindigen ze met een concrete aanbeveling. Overal waar een metriek voor een van de twee modellen ontbreekt, wordt die rij weggelaten in plaats van geraden, zodat elke bewering hier door een echt getal wordt gestaafd.

In één oogopslag

  • Invoer $/M$0.25Gemma4 26B A4B Uncensored (Balanced) 19%
  • p50-latentie1825 msGemma4 26B A4B Uncensored (Balanced) 6%

Modelvergelijking

Prijzen, context, latentie, doorvoer en kwaliteit voor Qwen3.6 35B A3B Uncensored (Aggressive) en Gemma4 26B A4B Uncensored (Balanced).
MetriekQwen3.6 35B A3B Uncensored (Aggressive)Gemma4 26B A4B Uncensored (Balanced)Conclusie
Invoer $/M$0.31$0.25Gemma4 26B A4B Uncensored (Balanced) is 19% goedkoper dan Qwen3.6 35B A3B Uncensored (Aggressive) op invoertokens.
Uitvoer $/M$4.21$2.90Gemma4 26B A4B Uncensored (Balanced) is 31% goedkoper dan Qwen3.6 35B A3B Uncensored (Aggressive) op uitvoertokens.
Context262K262KQwen3.6 35B A3B Uncensored (Aggressive) en Gemma4 26B A4B Uncensored (Balanced) delen hetzelfde contextvenster.
p50-latentie1937 ms1825 msGemma4 26B A4B Uncensored (Balanced) reageert 6% sneller dan Qwen3.6 35B A3B Uncensored (Aggressive) bij de mediaan.
Doorvoer86 tok/s92 tok/sGemma4 26B A4B Uncensored (Balanced) streamt tokens 7% sneller dan Qwen3.6 35B A3B Uncensored (Aggressive).
Kwaliteit4.04.0Qwen3.6 35B A3B Uncensored (Aggressive) en Gemma4 26B A4B Uncensored (Balanced) hebben overeenkomende samengestelde kwaliteitsscores.

Qua prijs is Gemma4 26B A4B Uncensored (Balanced) de goedkopere optie — ongeveer 19% onder Qwen3.6 35B A3B Uncensored (Aggressive) op invoertokens. Voor latentiegevoelige werklasten levert Gemma4 26B A4B Uncensored (Balanced) het eerste token eerder. Gemma4 26B A4B Uncensored (Balanced) loopt voorop op zowel kosten als mediane latency en is daarmee de standaardkeuze.

Beide modellen, één API-sleutel. Begin met een van beide en wissel door één tekenreeks te wijzigen.

Haal een API-sleutel

Gebruik Qwen3.6 35B A3B Uncensored (Aggressive) en Gemma4 26B A4B Uncensored (Balanced) met één API-sleutel

Je hoeft niet te kiezen. Beide modellen lopen via hetzelfde OpenAI-compatibele endpoint op OrcaRouter, afgerekend tegen het tarief van de bovenliggende provider en zonder token-opslag. Wisselen is een wijziging van de modelnaam — geen tweede account, geen tweede SDK, geen aparte inloggegevens.

Dat maakt de bovenstaande afweging werkbaar in productie: stuur het grootste deel van je verkeer naar het model dat wint op de dimensie die jij belangrijk vindt, houd het andere achter de hand voor de aanvragen die het nodig hebben, en verschuif de verdeling zodra je cijfers veranderen.

curl
# Één sleutel, één endpoint, beide modellen.
curl https://api.orcarouter.ai/v1/chat/completions \
  -H "Authorization: Bearer $ORCAROUTER_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "obsidian/Qwen3.6-35B-A3B",
    "messages": [{"role":"user","content":"..."}]
  }'

# Wissel van model door één tekenreeks te wijzigen.
#     "model": "obsidian/gemma-4-26B-A4B"

Live test: Qwen3.6 35B A3B Uncensored (Aggressive) vs Gemma4 26B A4B Uncensored (Balanced) in Battle-modus

Battle Mode — probeer beide naast elkaarLive
Openen in playground
Qwen3.6 35B A3B Uncensored (Aggressive)
$0.31 /M · p50 1937ms
Gemma4 26B A4B Uncensored (Balanced)
$0.25 /M · p50 1825ms

Prijzen en kostenanalyse

Op invoertokens kost Qwen3.6 35B A3B Uncensored (Aggressive) $0.31 per miljoen tegen $0.25 voor Gemma4 26B A4B Uncensored (Balanced), en op uitvoer $4.21 tegen $2.90 per miljoen.

Lees de volledige analyse

De rekening wordt meestal bepaald door de uitvoertokens: een chat- of agent-werklast die lange completions genereert wordt gedomineerd door het uitvoertarief, dus een model dat op invoer goedkoper lijkt kan end-to-end toch de duurdere keuze zijn. Schat je werkelijke invoer-uitvoerverhouding in voordat je alleen op prijs kiest — een retrieval-zware prompt met een kort antwoord en een korte prompt met een lange generatie belanden aan tegenovergestelde uiteinden van deze tabel. Een praktische manier om dit te dimensioneren is een representatieve steekproef van je prompts te nemen, de gemiddelde invoer- en uitvoertokens te tellen en elk te vermenigvuldigen met de respectieve tarieven van de twee modellen; het model met de lagere gemengde (blended) kosten op je werkelijke mix is degene om te verslaan. Onthoud dat beide prijzen hier het ruwe providertarief zijn — OrcaRouter voegt geen opslag toe — dus de vergelijking is gelijk voor gelijk en de besparing die je berekent is de besparing die je houdt.

Qwen3.6 35B A3B Uncensored (Aggressive) accepteert tot 262K tokens context en Gemma4 26B A4B Uncensored (Balanced) accepteert 262K.

Lees de volledige analyse

De context window begrenst hoeveel bronmateriaal — documenten, code, eerder gesprek — je in één verzoek kunt sturen. Een groter venster laat je chunking en retrieval-loodgieterij voor lange invoer overslaan, maar je betaalt nog steeds het invoertokentarief voor alles wat je verstuurt, dus een groter venster is een mogelijkheid, geen korting. Stem het venster af op het langste enkele verzoek dat je werklast realistisch produceert, niet op het grootste getal op de pagina. Houd er ook rekening mee dat de kwaliteit tegen het einde van een zeer lange context bij elk model kan verslechteren, dus een groot venster kun je het best behandelen als speelruimte voor incidentele lange invoer en niet als vrijbrief om elk verzoek tot de limiet vol te proppen.

Beide tarieven zijn de kale providerprijs — OrcaRouter rekent geen opslag, dus de besparing die je uitrekent is de besparing die je houdt.

Gratis beginnen

Tokentarieven naast elkaar

Invoer $/M
Qwen3.6 35B A3B Uncensored (Aggressive)$0.31
Gemma4 26B A4B Uncensored (Balanced)$0.25
Uitvoer $/M
Qwen3.6 35B A3B Uncensored (Aggressive)$4.21
Gemma4 26B A4B Uncensored (Balanced)$2.90

per 1M tokens

Snelheid en latentie

Latency en throughput bepalen hoe het model in productie aanvoelt. De mediane (p50) respons-latency is hoelang een typisch verzoek wacht voor het eerste token; throughput (tokens per seconde) bepaalt hoe snel het antwoord streamt zodra het begint.

Lees de volledige analyse

Voor interactieve chat en agent-loops telt lage p50-latency het zwaarst omdat de gebruiker op het eerste token wacht; voor batchgeneratie en langvorm-uitvoer domineert throughput de totale tijd omdat het antwoord lang is. De 7-daagse trendgrafieken hierboven laten zien of de latency van elk model stabiel is of verschuift, iets wat een enkel opvallend getal verbergt — een model met een uitstekend gemiddelde maar een rumoerige staart kan alsnog een strikte p95-SLA missen. Als je product een latency-budget heeft, lees dan zowel de mediaan als de vorm van de curve, en onthoud dat end-to-end latency ook je netwerkhop en elke retrieval of tool-aanroep die je rond het model doet omvat.

In de afgelopen 7 dagen behoudt Gemma4 26B A4B Uncensored (Balanced) de lagere mediane responslatentie.

Qwen3.6 35B A3B Uncensored (Aggressive)
Gemma4 26B A4B Uncensored (Balanced)

Benchmarks en kwaliteit

Benchmarkscores benaderen capaciteit maar zijn geen vervanging voor testen op je eigen prompts.

Lees de volledige analyse

De hier getoonde samengestelde indices aggregeren meerdere publieke evaluaties, en het percentiel markeert waar elk model staat ten opzichte van alle vergelijkbare modellen in de catalogus — een nuttig shortlist-signaal, geen garantie voor jouw taak. Een model dat leidt op een index voor algemene intelligentie kan in jouw domein (coderen, extractie, meertalig, redeneren over lange context) toch achterblijven, dus gebruik de benchmarks om het veld te versmallen en draai daarna beide modellen op een representatief deel van je verkeer. Let op de specifieke index die bij jouw use case past in plaats van op het topcijfer: een code-zwaar product moet de coding-index zwaarder wegen, een onderzoeksassistent de reasoning-index. Benchmarks verouderen ook naarmate modellen worden bijgewerkt, dus behandel ze als een starthypothese die je bevestigt met je eigen evaluatieset.

Qwen3.6 35B A3B Uncensored (Aggressive)
41.9
AA Coding
Beter dan 43% van de vergeleken modellen
#75 van 133
32.1
AA Intelligence
Beter dan 36% van de vergeleken modellen
#85 van 135
Gemma4 26B A4B Uncensored (Balanced)
39.3
AA Coding
Beter dan 41% van de vergeleken modellen
#78 van 133
26.1
AA Intelligence
Beter dan 30% van de vergeleken modellen
#94 van 135

Welke moet je kiezen?

Als kosten de bindende beperking zijn, begin dan met het goedkopere model op je werkelijke invoer-uitvoermix en ga alleen hoger als de kwaliteit tekortschiet.

Lees de volledige analyse

Als responsiviteit de prioriteit is — gebruikersgerichte chat, agents, alles waarbij iemand wacht — weeg dan p50-latency en throughput zwaarder dan een klein prijsverschil. Als je het zwaarste redeneer-, codeer- of langcontextwerk oppakt, laat dan de winnaar op benchmark en context window leiden en accepteer het hogere tarief waar het zichzelf terugbetaalt. Omdat beide modellen achter dezelfde API zitten, is de risicoarme zet om een fractie van het echte verkeer naar elk te routeren en kosten, latency en antwoordkwaliteit op je eigen prompts te vergelijken voordat je je vastlegt. Een gangbaar patroon is gelaagdheid (tier): stuur het gros van de eenvoudige, hoogvolume-verzoeken naar het goedkopere of snellere model en reserveer het sterkere model voor de verzoeken die het echt nodig hebben, wat het grootste deel van het kwaliteitsvoordeel voor een fractie van de kosten binnenhaalt. Wat je ook kiest, houd de overstap omkeerbaar — je verplaatst het verkeer terug zodra de cijfers of je vereisten verschuiven.

Of kies niet — route per aanvraag over beide, met één sleutel en één endpoint.

Neem beide

Het best voor

  • Kostengevoelig, hoog volumeGemma4 26B A4B Uncensored (Balanced)
  • Latentiegevoelige chat en agentsGemma4 26B A4B Uncensored (Balanced)

Qwen3.6 35B A3B Uncensored (Aggressive) vs Gemma4 26B A4B Uncensored (Balanced) FAQ

Is Qwen3.6 35B A3B Uncensored (Aggressive) of Gemma4 26B A4B Uncensored (Balanced) goedkoper?
Gemma4 26B A4B Uncensored (Balanced) is goedkoper op invoertokens tegen $0.25 per 1M versus $0.31 per 1M.
Welke is goedkoper op uitvoertokens, Qwen3.6 35B A3B Uncensored (Aggressive) of Gemma4 26B A4B Uncensored (Balanced)?
Gemma4 26B A4B Uncensored (Balanced) heeft de lagere uitvoerprijs, $2.90 per miljoen tegen $4.21 per miljoen. Uitvoerprijs telt bij generatie-zware werklasten meestal zwaarder dan invoer, dus weeg dienovereenkomstig.
Welke is sneller, Qwen3.6 35B A3B Uncensored (Aggressive) of Gemma4 26B A4B Uncensored (Balanced)?
Gemma4 26B A4B Uncensored (Balanced) heeft de lagere mediane (p50) responslatentie in de live metingen van OrcaRouter.
Welke streamt sneller, Qwen3.6 35B A3B Uncensored (Aggressive) of Gemma4 26B A4B Uncensored (Balanced)?
Gemma4 26B A4B Uncensored (Balanced) heeft de hogere gemeten throughput (tokens per seconde), dus lange completions zijn eerder klaar zodra de generatie begint.
Moet ik Qwen3.6 35B A3B Uncensored (Aggressive) of Gemma4 26B A4B Uncensored (Balanced) gebruiken?
Kies Qwen3.6 35B A3B Uncensored (Aggressive) of Gemma4 26B A4B Uncensored (Balanced) op basis van je prioriteit: kosten, contextvenster, latentie of benchmarkkwaliteit. De tabel hierboven laat zien welk model op elk punt wint; koppel de winnaar aan de dimensie die het belangrijkst is voor je werklast.
Hoe worden Qwen3.6 35B A3B Uncensored (Aggressive) en Gemma4 26B A4B Uncensored (Balanced) gefactureerd op OrcaRouter?
Beide worden gefactureerd tegen het tarief van de upstream-provider zonder enige token-opslag — je betaalt dezelfde prijs per token als je de provider rechtstreeks zou betalen, via één OrcaRouter-API-sleutel en -endpoint.
Kan ik zowel Qwen3.6 35B A3B Uncensored (Aggressive) als Gemma4 26B A4B Uncensored (Balanced) met dezelfde code aanroepen?
Ja. Beide worden aangeboden via OrcaRouters OpenAI-compatible API, dus je verandert alleen de modelnaam om ertussen te routeren — geen SDK-wissel, geen aparte inloggegevens.

Begin met Qwen3.6 35B A3B Uncensored (Aggressive) of Gemma4 26B A4B Uncensored (Balanced)

Één sleutel. Beide modellen. 40+ providers.

Afgerekend tegen providerkosten, zonder token-opslag. Begin gratis, wissel van model met één tekenreeks en houd de beslissing omkeerbaar.

Maak een gratis account