Eine generierte Titelkarte, die Aion 3.5 Mini auf der linken Seite, beschrieben als „geschlossene API – keine veröffentlichten Scores“, mit Gemma 4 12B auf der rechten Seite, beschrieben als „Apache 2.0 – Anbieter-Bewertungskarte“, vergleicht, mit einem Band darunter und der Aufschrift „Gleiche Aufgabe, andere Belege“.
Guides & Insights

Aion 3.5 Mini vs. Gemma 4 12B: Eines von beiden hat eine Anzeigetafel und eines hat ein Preisschild

Autor

Gideon Frost

Veröffentlicht am

Neueste Modelle · 20Alle Modelle ansehen
Benchmarks: Artificial Analysis · täglich aktualisiert
Zurück zu allen Beiträgen

Aion 3.5 Mini und Gemma 4 12B sind nur in einer Hinsicht dieselbe Art von Kauf: Beide sind kleine Modelle, die man heute über eine API aufrufen kann. AionLabs veröffentlichte Aion 3.5 Mini am 23. September 2026 als geschlossenes, textbasiertes Multi-Modell-System für 0,70 US-Dollar pro Million Eingabe-Tokens und 1,40 US-Dollar für Ausgabe. DeepMind veröffentlichte Gemma 4 12B am 3. Juni 2026 als Open-Weights-Modell mit 11,95 Mrd. Parametern unter Apache 2.0, mit einem encoderfreien multimodalen Eingabepfad und einer veröffentlichten Evaluationskarte. Der praktische Unterschied ist nicht die Parameteranzahl oder die Preisangabe. Er besteht darin, dass eines dieser Modelle gemessen werden kann, bevor man sich festlegt, und das andere überhaupt nicht messbar ist.

Alles über Aion 3.5 Mini im Folgenden stammt aus AionLabs’ eigener veröffentlichter Modellliste und der auf seiner API bereitgestellten Konfiguration. Alles über Gemma 4 12B stammt aus der Modellkarte des Anbieters, aus der seine Zahlen stammen, sowie aus der Drittanbieter-Evaluierungsumgebung, die es tatsächlich ausgeführt hat. Wo eine Zahl vom Anbieter angegeben wird, ist sie als solche gekennzeichnet. Es gibt keine unabhängige Bewertung irgendeines Aion-Modells, und das wird als Tatsache und nicht als Vorbehalt dargelegt.

Wo die beiden tatsächlich übereinstimmen

Weniger Stellen, als die Bezeichnung „kleines Modell" nahelegt, und bei denen, die tatsächlich übereinstimmen, lohnt es sich, genau zu sein, denn sie sind es, die ein Käufer zuerst prüft.

• Kontext — Aion 3.5 Mini verfügt über 262.144 Token. Gemma 4 12B verfügt über ein 256K-Fenster. Nominal ein Unentschieden, und in der Praxis sind beide groß genug, dass der Kontext nicht das entscheidende Kriterium ist.

• Maximale Ausgabe — Aion 3.5 Mini begrenzt eine einzelne Antwort auf 32.768 Token, eine Obergrenze, die für den gesamten Aion-Katalog gilt. Gemma 4 12B veröffentlicht auf seiner Modellkarte keine entsprechende Einzelzahl-Obergrenze, daher ist dies eine Angabe, die man testen müsste, anstatt sie nachzulesen.

• Tool-Calling – beide unterstützen es. Aion 3.5 Mini akzeptiert Tool-Definitionen, das JSON-Antwortformat und Temperatur auf einem OpenAI-kompatiblen Endpunkt. Gemma 4 12B bietet Function Calling in seiner instruktionsoptimierten Form.

• Reasoning-Steuerung — Aion 3.5 Mini denkt bei jedem Aufruf nach und bietet drei Aufwandsstufen: max, high und low, wobei high die Standardeinstellung ist; Reasoning ist nicht optional. Gemma 4 12B gibt es in Varianten mit und ohne Reasoning, und die beiden schneiden auf demselben Test-Harness unterschiedlich ab, weil sie unterschiedlich viel Arbeit leisten.

• Eingabemodalität – das ist die erste Zeile, in der sie deutlich auseinandergehen. Aion 3.5 Mini ist Text rein, Text raus, und die Architektur deklariert keine Bildeingabe. Gemma 4 12B nimmt Text, Bild, Audio und Video entgegen und gibt Text zurück.

Was Gemma 4 12B dir zeigen kann

Gemma 4 12B kommt mit einer Anbieter-Evaluierungskarte, und die Zahlen darauf sind vom Anbieter gemeldet statt unabhängig reproduziert – aber sie existieren, sie sind konkret, und sie decken die Achsen ab, über die ein Käufer tatsächlich streitet.

• Vom Anbieter gemeldete Werte für Reasoning und Wissen — MMLU Pro 77,2, GPQA Diamond 78,8, HLE ohne Tools 5,2, BigBench Extra Hard 53,0, MMMLU 83,4.

• Vom Anbieter gemeldete Coding-Leistung — LiveCodeBench v6 72.0, Codeforces ELO 1659, AIME 2026 ohne Hilfsmittel 77.5.

• Vom Anbieter gemeldete agentische Leistung — Tau2 mit durchschnittlich 69,0 über drei Läufe und Codeforces ELO erneut als stärkste Einzelleistung auf dem Datenblatt.

• Vom Anbieter gemeldete multimodale Werte — MMMU Pro 69,1, MATH-Vision 79,7, MedXPertQA MM 48,7. Die Karte enthält keine DocVQA-Zeile; der nächstliegende Dokumentwert ist eine durchschnittliche Editierdistanz von 0,164 bei OmniDocBench 1.5.

• Langkontext-Recall — MRCR v2, 8-Needle, 128k, 43,4. Das ist die ehrliche Schwachstelle auf dem Datenblatt, und es lohnt sich, sie zu lesen, bevor man annimmt, dass sich ein 256K-Fenster am äußersten Ende wie ein 256K-Fenster verhält.

• Drittanbieter-Messung — Artificial Analysis führt Gemma 4 12B mit einem Reasoning Intelligence Index von 14 und einem Non-reasoning Index von 9 auf seinem eigenen Harness, einer Ausgabegeschwindigkeit von etwa 113 Tokens pro Sekunde im Reasoning-Modus und einem Listenpreis von 0,10 $ für Eingabe und 0,30 $ für Ausgabe pro Million Tokens. Index-Revisionen verschieben sich zwischen Snapshots, daher den Index als richtungsweisend und Preis und Geschwindigkeit als die belastbaren Werte behandeln.

A screenshot of the Hugging Face model card for google/gemma-4-12b, showing the model blurb 'Google | Gemma 4 | 12B | Apache 2.0 | Text, Image, Audio, Video -> Text | 256K context' and the description that Gemma 4 models are multimodal, handling text and image input and generating text output.

Was Aion 3.5 Mini Ihnen zeigen kann

Ein Preis, ein Zeitfenster, eine Architekturbeschreibung und sonst nichts. AionLabs veröffentlicht für kein Modell in seinem Katalog einen Wert für SWE-bench Verified, Terminal-Bench, GPQA oder MMLU-Pro, und die Markteinführungsunterlagen zu 3.5 enthalten überhaupt keine Benchmark-Tabelle. Artificial Analysis hat keine Seite für Aion 3.5 Mini, Aion 3.5, Aion 3.0 oder Aion 3.0 Mini – keines der vier erscheint im Modellindex.

Dieses Fehlen ist nicht automatisch vernichtend, und es wäre falsch, es als solches darzustellen. AionLabs beschreibt seine Modelle als Multi-Modell-Systeme, die für erzählerische und Storytelling-Arbeit entwickelt wurden, mit einem kollaborativen Generierungsprozess, bei dem mehrere spezialisierte Modelle jeweils zu einer Antwort beitragen. Die oben genannten zusammengesetzten Indizes sind aus Mathematik-, Code- und Wirtschaftsaufgaben zusammengestellt – das falsche Instrument, um Prosa zu beurteilen. Ein Modell kann in der Aufgabe, für die es gebaut wurde, wirklich gut sein und auf einem Coding-Leaderboard schlecht abschneiden – oder nie in eines aufgenommen werden.

Was das Fehlen tatsächlich bedeutet, ist enger und schwieriger: Man kann keine Kosten pro abgeschlossener Aufgabe berechnen. Die 0,70 $ und 1,40 $ von Aion 3.5 Mini sind Listenpreise ohne gemessenen Nenner. Die 0,10 $ und 0,30 $ von Gemma 4 12B haben einen gemessenen Nenner, und dieselbe Testumgebung, die ihn gemessen hat, gibt auch Kosten pro Aufgabe an. Das ist die Asymmetrie, und sie übersteht jede Diskussion darüber, ob die Benchmarks die richtigen sind.

Die Preisdifferenz ist größer, als die Fähigkeitslücke voraussichtlich sein wird.

Stellt man die beiden Preislisten nebeneinander, ändert sich die Gestalt der Entscheidung. Aion 3.5 Mini verlangt 0,70 $ pro Million Input-Tokens und 1,40 $ pro Million Output-Tokens. Gemma 4 12B wird auf der Drittanbieter-Testumgebung, die es vermisst, mit 0,10 $ für Input und 0,30 $ für Output geführt. Das ist der siebenfache Input-Preis und etwa das Viereinhalbfache des Output-Preises – für ein Modell, dessen eigener Anbieter keine Punktzahl veröffentlicht, gegen die man es vergleichen könnte.

Zwei Dinge erschweren eine einfache Multiplikation, und beide sprechen noch stärker für Gemma 4 12B. Erstens denkt Aion 3.5 Mini bei jedem Aufruf nach, sodass die Ausgabezeile Tokens enthält, die Sie weder angefordert haben noch begrenzen können – AionLabs veröffentlicht keine Angaben dazu, wie viele Tokens das Modell auf irgendeiner seiner drei Aufwandsstufen fürs Nachdenken aufwendet. Bei Gemma 4 12B lässt sich der Denkschritt abschalten, was sowohl die Abrechnung als auch die Latenz verändert. Zweitens ist Gemma 4 12B ein Open-Weights-Modell unter Apache 2.0, sodass die $0.10 und $0.30 eine von mehreren Optionen sind und nicht die einzige Möglichkeit, es zu betreiben.

Nichts davon klärt, welches Modell besser schreibt, denn niemand hat eines von beiden auf dieser Achse gemessen. Es klärt aber, welches man einem Stakeholder vorlegen kann.

Die beiden zusammen ausführen

Das sinnvolle Vorgehen ist hier nicht, sich für eines zu entscheiden. Aion 3.5 Mini und Gemma 4 12B stehen hinter unterschiedlichen Schnittstellen, aber derselben Aufrufkonvention — AionLabs stellt einen OpenAI-kompatiblen Endpunkt bereit, und Gemma 4 12B wird von den üblichen OpenAI-kompatiblen Runtimes bedient. Dadurch sind sie auf Ebene der Basis-URL austauschbar, was den Aufbau einer Kette kostengünstig macht: Aion 3.5 Mini zuerst für die Prompts, bei denen das Ensemble der Grund für den Aufruf ist, Gemma 4 12B dahinter für alles, wo Sie ein maßvolles Modell, einen umschaltbaren Denkschritt und eine Preisliste wünschen, die nur ein Viertel so groß ist.

Ein Gateway, das mehrere hundert Modelle über einen einzigen Schlüssel bündelt, macht diese Kette zu einer Konfigurationszeile statt zu einer zweiten Integration, und genau hier zahlt sich eine Failover-Regel aus – ein 429 oder ein Anbieterausfall wird absorbiert, bevor die Antwort beginnt, statt als fehlgeschlagener Job aufzutauchen. Wenn ein Anbieter seine Preisliste ändert, berechnet ein Pass-through-Router den Listenpreis des Anbieters ohne Aufschlag pro Token, sodass die Änderung noch am selben Tag wirksam wird und nicht erst zum nächsten Abrechnungszyklus. Ein Detail, das man besser prüft, statt es anzunehmen: Weder Aion 3.5 Mini noch Gemma 4 12B wird auf jeder Plattform angeboten, die Modelle dieser Größe hostet, und insbesondere Gemma 4 12B fehlt in manchen Katalogen, die seine größeren Geschwister führen. Vergewissern Sie sich, dass die Kennung aufgelöst wird, bevor Sie sie einbinden.

A screenshot of AionLabs' own documentation site, the Introduction / LLM API page, showing that the vendor serves its models through an OpenAI-compatible REST API at https://api.aionlabs.ai/v1 supporting chat completions and model discovery, with API-key authentication and a signed-in browser workspace for testing prompts.

Wie man entscheidet

• Wenn Sie eine Zahl benötigen, bevor Sie sich festlegen — Gemma 4 12B. Es ist das einzige der beiden mit einer veröffentlichten Evaluationskarte und einem Drittanbieter-Index, und die Evaluation geht Ihrer Entscheidung voraus, statt ihr zu folgen.

• Wenn Sie Bild-, Audio- oder Videoeingabe benötigen – Gemma 4 12B. Aion 3.5 Mini deklariert Text zu Text und nichts anderes.

• Wenn du das Teil selbst besitzen musst — Gemma 4 12B. Die Apache-2.0-Gewichte bedeuten, dass du es feinabstimmen, quantisieren oder selbst hosten kannst; Aion 3.5 Mini ist ein geschlossenes System ohne Gewichte zum Herunterladen.

• Wenn erzählende und Langform-Prosa die ganze Aufgabe ist — dies ist der eine Fall, in dem der Vergleich für Sie scheitert. Aion 3.5 Mini wurde für diese Arbeit gebaut, und Gemma 4 12B wurde als Generalist gebaut, und keine veröffentlichte Zahl sagt Ihnen, welches besser schreibt. Probieren Sie es auf einem Pfad aus, den Sie sich leisten können zu verlieren.

• Wenn die Kosten pro abgeschlossener Aufgabe die entscheidende Größe sind — Gemma 4 12B, rein rechnerisch betrachtet, und die Lücke wird umso größer, je stärker die Aufgabe von Ausgabe-Tokens abhängt.

Beide Modelle sind neu, beide sind live, und nur eines von ihnen verlangt von Ihnen, es einfach zu glauben. Die belastbare Zusammenfassung lautet, dass Gemma 4 12B der messbare Standard ist und Aion 3.5 Mini ein Spezialist, den Sie bewusst wählen, nicht durch Vergleich – und wenn Sie es wählen, wählen Sie es neben einer Ausweichlösung statt an deren Stelle.

A generated scoreboard comparing Aion 3.5 Mini and Gemma 4 12B across six rows: published scores (none vs vendor card), price in / out ($0.70 / $1.40 vs $0.10 / $0.30), context (262,144 vs 256K), inputs (text only vs text, image, audio, video), weights (closed vs Apache 2.0) and reasoning (mandatory, 3 levels vs switchable off). Footnoted that Aion figures are unaudited and vendor-published and that Gemma figures are vendor-reported with the index per Artificial Analysis.