Een gegenereerde titelkaart die Aion 3.5 Mini, aan de linkerkant, omschrijft als 'gesloten API - geen gepubliceerde scores', tegenover Gemma 4 12B, aan de rechterkant, omschreven als 'Apache 2.0 - leveranciersevaluatiekaart', met daaronder een lint met de tekst 'Zelfde taak, ander bewijs'.
Guides & Insights

Aion 3.5 Mini vs Gemma 4 12B: Een van deze heeft een scorebord en de ander heeft een prijskaartje.

Auteur

Gideon Frost

Publicatiedatum

Nieuwste modellen · 20Bekijk alle modellen
Benchmarks: Artificial Analysis · dagelijks bijgewerkt
Terug naar alle berichten

Aion 3.5 Mini en Gemma 4 12B zijn slechts in één opzicht dezelfde soort aankoop: beide zijn kleine modellen die je vandaag via een API kunt aanroepen. AionLabs bracht Aion 3.5 Mini op 23 september 2026 uit als een gesloten multi-modelsysteem voor alleen tekst, voor $0,70 per miljoen inputtokens en $1,40 output. DeepMind bracht Gemma 4 12B op 3 juni 2026 uit als een open-weights model met 11,95 miljard parameters onder Apache 2.0, met een encoder-vrije multimodale invoerroute en een gepubliceerde evaluatiekaart. Het praktische verschil is niet het aantal parameters of de prijslijn. Het is dat het ene model kan worden gemeten voordat je je vastlegt, en het andere helemaal niet kan worden gemeten.

Alles hieronder over Aion 3.5 Mini is afkomstig uit de eigen gepubliceerde modellenlijst van AionLabs en de configuratie die op zijn API wordt aangeboden. Alles over Gemma 4 12B komt uit de modelkaart van de leverancier, waar de cijfers vandaan komen, plus de evaluatieharness van een derde partij die het daadwerkelijk heeft gedraaid. Waar een cijfer door de leverancier is gerapporteerd, wordt dat als zodanig aangeduid. Er is geen onafhankelijke evaluatie van enig Aion-model, en dat wordt als feit gesteld in plaats van als voorbehoud.

Waar die twee daadwerkelijk overeenkomen

Minder plekken dan het label "small model" suggereert, en bij de plekken die wél overeenkomen is het de moeite waard om precies te zijn, want dat zijn de plekken die een koper het eerst controleert.

• Context — Aion 3.5 Mini heeft 262.144 tokens. Gemma 4 12B heeft een 256K-venster. Nominaal een gelijkspel, en in de praktijk zijn beide groot genoeg dat context niet de beslissende factor is.

• Maximale output — Aion 3.5 Mini beperkt een enkele reactie tot 32.768 tokens, een plafond dat voor de hele Aion-catalogus geldt. Gemma 4 12B publiceert geen gelijkwaardige limiet in één getal op zijn kaart, dus dit is een regel die je zou moeten testen in plaats van lezen.

• Tool calling — beide ondersteunen het. Aion 3.5 Mini accepteert tooldefinities, JSON-responsformaat en temperatuur op een OpenAI-compatibel eindpunt. Gemma 4 12B wordt geleverd met functieaanroepen in zijn op instructies afgestemde vorm.

• Redeneerbeheersing — Aion 3.5 Mini redeneert bij elke aanroep en biedt drie inspanningsniveaus: max, high en low, waarbij high de standaard is; redeneren is niet optioneel. Gemma 4 12B wordt geleverd in redeneer- en niet-redeneervarianten, en de twee scoren verschillend op dezelfde testomgeving omdat ze een verschillende hoeveelheid werk verrichten.

• Invoermodaliteit — dit is de eerste regel waarop ze sterk uiteenlopen. Aion 3.5 Mini is tekst in, tekst uit, en de architectuur verklaart geen beeldinvoer. Gemma 4 12B accepteert tekst, beeld, audio en video als invoer en retourneert tekst.

Wat Gemma 4 12B je kan laten zien

Gemma 4 12B komt met een leveranciersevaluatiekaart, en de cijfers daarop zijn door de leverancier gerapporteerd in plaats van onafhankelijk gereproduceerd — maar ze bestaan, ze zijn specifiek, en ze bestrijken de assen waarover een koper daadwerkelijk discussieert.

• Door de leverancier gerapporteerde redeneer- en kennisprestaties — MMLU Pro 77,2, GPQA Diamond 78,8, HLE zonder tools 5,2, BigBench Extra Hard 53,0, MMMLU 83,4.

• Door de leverancier gerapporteerde codeerprestaties — LiveCodeBench v6 72.0, Codeforces ELO 1659, AIME 2026 zonder hulpmiddelen 77.5.

• Door de leverancier gerapporteerde agentische prestaties — Tau2 gemiddeld over drie runs 69,0, en Codeforces ELO opnieuw als de sterkste individuele prestatie op de kaart.

• Door de leverancier gerapporteerd multimodaal — MMMU Pro 69,1, MATH-Vision 79,7, MedXPertQA MM 48,7. De kaart bevat geen DocVQA-rij; de dichtstbijzijnde documentwaarde is een OmniDocBench 1.5 gemiddelde bewerkingsafstand van 0,164.

• Recall bij lange context — MRCR v2, 8-needle, 128k, 43.4. Dat is het eerlijke zwakke punt op de specificatiekaart, en het is de moeite waard om het te lezen voordat je aanneemt dat een 256K-venster zich helemaal aan het einde gedraagt als een 256K-venster.

• Meting door derden — Artificial Analysis vermeldt Gemma 4 12B met een Reasoning Intelligence Index van 14 en een Non-reasoning Index van 9 op zijn eigen evaluatieraamwerk, een outputsnelheid van ongeveer 113 tokens per seconde in reasoningmodus, en een adviesprijs van $0,10 voor invoer en $0,30 voor uitvoer per miljoen tokens. Indexwaarden worden tussen snapshots herzien, dus behandel de index als richtinggevend en de prijs en snelheid als de blijvende waarden.

A screenshot of the Hugging Face model card for google/gemma-4-12b, showing the model blurb 'Google | Gemma 4 | 12B | Apache 2.0 | Text, Image, Audio, Video -> Text | 256K context' and the description that Gemma 4 models are multimodal, handling text and image input and generating text output.

Wat Aion 3.5 Mini je kan laten zien

Een prijs, een venster, een architectuurbeschrijving, en niets anders. AionLabs publiceert voor geen enkel model in zijn catalogus een score voor SWE-bench Verified, Terminal-Bench, GPQA of MMLU-Pro, en de lanceringsmaterialen van 3.5 bevatten helemaal geen benchmarktabel. Artificial Analysis heeft geen pagina voor Aion 3.5 Mini, Aion 3.5, Aion 3.0 of Aion 3.0 Mini — geen van de vier komt voor in de modellenindex.

Die afwezigheid is niet automatisch belastend, en het zou verkeerd zijn om die als zodanig voor te stellen. AionLabs beschrijft zijn modellen als multi-modelsystemen die zijn gebouwd voor narratief en verhalend werk, met een collaboratief generatieproces waarin verschillende gespecialiseerde modellen elk aan een antwoord bijdragen. De samengestelde indexen hierboven zijn opgebouwd uit wiskunde-, code- en economische taken — het verkeerde instrument om proza te beoordelen. Een model kan oprecht goed zijn in het werk waarvoor het is gebouwd en toch slecht scoren op een programmeerranglijst, of er nooit in worden opgenomen.

Wat de afwezigheid wél betekent, is beperkter en moeilijker: je kunt geen kosten per voltooide taak berekenen. De $0,70 en $1,40 van Aion 3.5 Mini zijn lijstprijzen zonder gemeten noemer. De $0,10 en $0,30 van Gemma 4 12B hebben wel een gemeten noemer, en hetzelfde testharnas dat die noemer heeft gemeten, rapporteert ook de kosten per taak. Dat is de asymmetrie, en die houdt stand in elk argument over of de benchmarks de juiste zijn.

Het prijsverschil is groter dan het capaciteitsverschil waarschijnlijk zal zijn

Zet de twee tariefkaarten naast elkaar en de vorm van de beslissing verandert. Aion 3.5 Mini rekent $0,70 per miljoen inputtokens en $1,40 per miljoen output. Gemma 4 12B staat op de testomgeving van een derde partij die het meet voor $0,10 input en $0,30 output. Dat is zeven keer het inputtarief en ongeveer vierenhalf keer het outputtarief, voor een model waarvan de eigen leverancier geen score publiceert waarmee je kunt vergelijken.

Twee dingen maken een simpele vermenigvuldiging ingewikkelder, en beide vallen nog meer in het voordeel van Gemma 4 12B uit. Ten eerste redeneert Aion 3.5 Mini bij elke aanroep, dus de outputregel bevat tokens die je niet hebt gevraagd en niet kunt begrenzen — AionLabs publiceert voor geen van zijn drie inspanningsniveaus een uitspraak over hoeveel tokens het model aan nadenken besteedt. Met Gemma 4 12B kun je de denkstap uitschakelen, wat zowel de factuur als de latentie verandert. Ten tweede heeft Gemma 4 12B open gewichten onder Apache 2.0, dus de $0,10 en $0,30 zijn één optie onder meerdere in plaats van de enige manier om het te draaien.

Niets daarvan beslist welk model beter schrijft, want niemand heeft een van beide op die as gemeten. Het beslist wel welke je aan een stakeholder kunt voorleggen.

De twee samen laten draaien

De nuttige zet hier is niet om er één te kiezen. Aion 3.5 Mini en Gemma 4 12B zitten achter verschillende interfaces, maar achter dezelfde aanroepconventie — AionLabs biedt een OpenAI-compatibel endpoint, en Gemma 4 12B wordt geserveerd door de gebruikelijke OpenAI-compatibele runtimes. Daardoor zijn ze op het niveau van de base-URL uitwisselbaar, wat een keten goedkoop maakt om te bouwen: Aion 3.5 Mini eerst voor de prompts waarbij het ensemble de reden is dat je het aanroept, Gemma 4 12B daarachter voor alles waarbij je een afgewogen model wilt, een schakelbare denkstap en een tariefkaart die een kwart zo groot is.

Een gateway die als front-end fungeert voor honderden modellen op één sleutel is wat die keten een configuratieregel maakt in plaats van een tweede integratie, en het is ook waar een failover-regel zijn waarde bewijst — een 429 of een storing bij een provider wordt opgevangen voordat het antwoord begint, in plaats van op te duiken als een mislukte taak. Wanneer een leverancier zijn tariefkaart wijzigt, factureert een pass-through-router de lijstprijs van de provider met niets extra per token, zodat de wijziging dezelfde dag ingaat in plaats van bij de volgende factureringscyclus. Eén detail dat het waard is om te controleren in plaats van aan te nemen: noch Aion 3.5 Mini noch Gemma 4 12B wordt aangeboden op elk platform dat modellen van deze omvang host, en Gemma 4 12B ontbreekt in het bijzonder in sommige catalogi die de grotere varianten bevatten. Controleer of de identifier resolveert voordat je hem aansluit.

A screenshot of AionLabs' own documentation site, the Introduction / LLM API page, showing that the vendor serves its models through an OpenAI-compatible REST API at https://api.aionlabs.ai/v1 supporting chat completions and model discovery, with API-key authentication and a signed-in browser workspace for testing prompts.

Hoe te beslissen

• Als je een cijfer nodig hebt voordat je je vastlegt — Gemma 4 12B. Het is de enige van de twee met een gepubliceerde evaluatiekaart en een index van derden, en de evaluatie dateert van vóór je beslissing in plaats van dat die erop volgt.

• Als je beeld-, audio- of video-invoer nodig hebt — Gemma 4 12B. Aion 3.5 Mini zegt tekst naar tekst en niets anders.

• Als je het ding zelf wilt bezitten — Gemma 4 12B. Apache 2.0-gewichten betekenen dat je het kunt fine-tunen, kwantiseren of zelf hosten; Aion 3.5 Mini is een gesloten systeem zonder gewichten om te downloaden.

• Als narratief en langvormig proza het hele werk is — dit is het enige geval waarin de vergelijking je in de steek laat. Aion 3.5 Mini is voor dat werk gebouwd en Gemma 4 12B is als generalist gebouwd, en geen enkel gepubliceerd cijfer vertelt je welke beter schrijft. Probeer het op een pad dat je je kunt permitteren te verliezen.

• Als de kosten per voltooide opdracht de beslissende factor zijn — Gemma 4 12B, louter op basis van de rekensom, en de kloof wordt groter naarmate de taak meer afhangt van outputtokens.

Beide modellen zijn recent, beide zijn live, en slechts één van hen vraagt je het maar op zijn woord te geloven. De houdbare samenvatting is dat Gemma 4 12B de meetbare standaardkeuze is en dat Aion 3.5 Mini een specialist is die je bewust adopteert, niet op basis van een vergelijking — en als je het toch adopteert, adopteer het dan naast een terugvaloptie, niet in plaats van een terugvaloptie.

A generated scoreboard comparing Aion 3.5 Mini and Gemma 4 12B across six rows: published scores (none vs vendor card), price in / out ($0.70 / $1.40 vs $0.10 / $0.30), context (262,144 vs 256K), inputs (text only vs text, image, audio, video), weights (closed vs Apache 2.0) and reasoning (mandatory, 3 levels vs switchable off). Footnoted that Aion figures are unaudited and vendor-published and that Gemma figures are vendor-reported with the index per Artificial Analysis.