Eine generierte Hero-Karte für „Claude Haiku 5.5 vs. Gemma 4 12B" mit zwei durch eine dünne Linie getrennten Feldern: links beschriftet mit „Claude Haiku 5.5", versehen mit „Index 43" und „Proprietary API", rechts beschriftet mit „Gemma 4 12B", versehen mit „Index 14" und „Apache 2.0 weights". Eine Fußzeile lautet „Scores per Artificial Analysis." Das OrcaRouter-Logo ist in der unteren rechten Ecke eingefügt.
Guides & Insights

Claude Haiku 5.5 vs. Gemma 4 12B: Ein Modell mit Gewichten, die man selbst halten kann, gegen eine Anbieter-API

Autor

Gideon Frost

Veröffentlicht am

Neueste Modelle · 20Alle Modelle ansehen →
Benchmarks: Artificial Analysis · täglich aktualisiert
Zurück zu allen Beiträgen

Claude Haiku 5.5 und G​emma 4 12B konkurrieren nicht wirklich um denselben Platz, und der schnellste Weg, das zu erkennen, ist eine einzige Zeile: Eines von ihnen wird als Apache-2.0-Gewichte ausgeliefert, die man herunterladen, quantisieren und auf eigener Hardware ausführen kann, und das andere existiert nur hinter einer API. Claude Haiku 5.5 erschien am 7. Oktober 2026 und definierte sofort neu, was eine kleine Leistungsklasse erreichen kann — 43 auf dem unabhängigen Artificial Analysis Intelligence Index. G​emma 4 12B liegt mit 14 auf derselben Rangliste. Diese Lücke ist enorm, und sie ist nicht der Grund, warum sich die meisten Teams letztlich zwischen ihnen entscheiden.

Die Entscheidung wird meist erzwungen, bevor irgendein Benchmark zu Rate gezogen wird: eine regulierte Pipeline, die keine Tokens an einen Anbieter senden darf, eine Edge-Box ohne zuverlässigen ausgehenden Datenverkehr, ein Latenzbudget, das in Millisekunden gemessen wird, oder eine Fine-Tuning-Anforderung, die eine geschlossene API niemals erfüllen wird. Wenn nichts davon auf Sie zutrifft, ist die Entscheidung nicht knapp. Wenn eines davon zutrifft, spielt der Score-Abstand keine Rolle mehr, und die Deployment-Einschränkung entscheidet alles.

Was der Vorstand gemessen hat, und wann

Die unten stehenden unabhängigen Zahlen stammen von Artificial Analysis, und die Anbieter-Tarife stammen aus der eigenen Dokumentation von A​nthropic und G​oogle. Sie sind zwei verschiedene Arten von Zahlen und werden durchgängig als solche gekennzeichnet.

A generated two-column scoreboard titled 'Claude Haiku 5.5 vs Gemma 4 12B - the scoreboard'. The Claude Haiku 5.5 column reads independent score 43 (AA, #2 of 182), weights Proprietary API, context 1,000,000 tokens, input price $0.10 / 1M, output price $0.50 / 1M and throughput 240.4 tok/s. The Gemma 4 12B column reads independent score 14 (AA, #21 of 142), weights Apache 2.0 12B dense, context 262,000 tokens, input price $0.10 / 1M, output price $0.30 / 1M and throughput 113.1 tok/s. A footer line reads 'Both columns per Artificial Analysis; pricing per each vendor.'

• Unabhängige Punktzahl — Claude Haiku 5.5 mit 43 Punkten im Intelligence Index, Platz 2 von 182 Modellen. Gemma 4 12B (Reasoning) mit 14 Punkten, Platz 21 von 142 in seiner Klasse. Eine Lücke von 29 Punkten.

• Eingabepreis pro Million Token — Claude Haiku 5.5 0,10 $ bis 100.000 Token und 0,50 $ darüber; G​emma 4 12B 0,10 $.

• Ausgabepreis pro Million Tokens — Claude Haiku 5.5 0,50 $ bis zu 100.000 Tokens und 2,50 $ darüber; Gemma 4 12B 0,30 $.

• Kontextfenster — 1.000.000 Token für Claude Haiku 5.5; 262.000 für Gemma 4 12B.

• Durchsatz — 240,4 Ausgabe-Tokens pro Sekunde für Claude Haiku 5.5; 113,1 für G​emma 4 12B, mit 2,48 Sekunden bis zum ersten Token.

• Kosten pro abgeschlossener Index-Aufgabe — 0,21 $ für Claude Haiku 5.5. G​emma 4 12B ist pro Token günstig genug, dass die gemischte Kennzahl des Boards bei 0,12 $ pro Million Token landet, aber die abgeleiteten Kosten pro Aufgabe sind nicht die Zahl, die diesen Vergleich entscheiden sollte.

• Gewichte — Apache 2.0 für Gemma 4 12B, herunterladbar, rund 12 Milliarden Parameter, dicht. Claude Haiku 5.5 ist proprietär; es gibt keine Veröffentlichung der Gewichte, und eine ist auch nicht geplant.

• Alter — G​emma 4 12B ist seit Juni 2026 verfügbar. Claude Haiku 5.5 ist bei Abfassung dieses Textes zwei Tage alt.

Der Abstand beträgt 29 Punkte, und der Preisunterschied ist so gut wie nichts.

Schauen Sie sich die beiden Preiszeilen noch einmal an: 0,10 $ Eingabe bei beiden und 0,30 $ gegenüber 0,50 $ bei der Ausgabe. G​emma 4 12B ist günstiger, und der Unterschied ist klein genug, dass er von der Token-Anzahl überschattet wird – der neuere Tokenizer von Claude Haiku 5.5 bedeutet, dass derselbe Text ungefähr 30 % mehr Tokens ergibt, sodass ein roher Ausgabepreis-Vorteil von 40 % aufseiten von G​emma auf einer echten Abrechnung eher auf ein Nullsummenspiel hinausläuft.

Sie zahlen also fast denselben Tarif für ein Modell, das 29 Indexpunkte zurückliegt, oder Sie zahlen fast denselben Tarif für ein Modell, das 29 Punkte voraus ist – je nachdem, welche Spalte Sie zuerst lesen. Das ist die ehrliche Einordnung, und sie sollte unverblümt ausgesprochen werden: Bei jeder Aufgabe, die beide Modelle bewältigen können, ist Claude Haiku 5.5 zum Listenpreis die bessere Wahl, und zwar um einen Vorsprung, den kein noch so ausgefeiltes Prompt-Engineering beim kleineren Modell aufholen wird.

Die interessante Frage ist also nicht „Welche ist besser?“. Sie lautet: „Bei welchen Aufgaben in meiner Warteschlange scheitert G​emma 4 12B?“, und die Antwort darauf ist das Einzige, was den Vergleich entscheidet.

Was bieten dir Gewichte, das eine API nicht bieten kann?

A screenshot of the Artificial Analysis page for Gemma 4 12B (Reasoning), showing an Intelligence Index of 14 at rank 21 of 142, speed rank 19 of 142, input $0.10 and output $0.30, 113.1 output tokens per second, a summary noting text, image, speech and video input with text output and a 262k-token context window, and the note that the score places it well above the median of 8 for comparable models.

Ein heruntergeladenes Modell ist eine andere Art von Asset, und die Vorteile sind struktureller Natur statt inkrementell.

• Datengrenze — bei G​emma 4 12B ist überhaupt kein Anbieter zwischengeschaltet. Für Workloads in den Bereichen Gesundheit, Recht, Verteidigung oder Finanzen ist das häufig die einzige Anforderung, die zählt, und keine noch so hohe Punktzahl macht eine API akzeptabel.

• Fixkosten statt variabler Kosten — ein dichtes 12B-Modell, auf vier Bit quantisiert, passt problemlos auf einen einzelnen modernen Beschleuniger. Ab diesem Punkt sind die Grenzkosten pro Token Strom, und eine Workload kann an einer Maschine statt an einem Zähler dimensioniert werden.

• Kein ausgehender Datenverkehr, keine Netzwerklatenz – ein vor Ort betriebenes 12B-Modell antwortet in Millisekunden, weil nichts die Box verlässt. Eine Anbieter-API bezahlt einen Roundtrip und einen Cold-Start-Tail, den ein Edge-Deployment schlicht nicht hat.

• Fine-Tuning und Destillation – du kannst Gemma 4 12B an deine eigenen Daten anpassen, den Adapter ausliefern und ihn einfrieren. Ob Anthropic es jemals zulassen wird, dass man ein Modell der Haiku-Klasse feintunt, ist nichts, worauf man eine Roadmap aufbauen kann.

• Ein Boden unter Ihrer Roadmap – Gewichte können nicht unter Ihnen weg abgekündigt werden. Anthropic hat sich verpflichtet, Claude Haiku 5.5 nicht vor dem 7. Oktober 2027 außer Betrieb zu nehmen, was großzügig ist, aber eine Zusage mit Datum ist immer noch eine Zusage mit Datum.

• Modalität, seltsamerweise – das Board verzeichnet, dass Gemma 4 12B Text-, Bild-, Sprach- und Videoeingabe für Textausgabe entgegennimmt, was eine breitere Eingabe ist als die Text-und-Bild-Eingabe von Claude Haiku 5.5. Für eine lokale Pipeline, die Audio ohne einen separaten Transkriptionsdienst verarbeitet, ist das eine echte Fähigkeit, die die API-Seite nicht bietet.

A screenshot of the Hugging Face model card for gemma-4-12B, showing the Google uploader, the 'Any-to-Any' and 'Transformers / Safetensors' tags, the gemma4_unified_image-text-to-text identifier, 'Eval Results', 'Model card', 'Files and versions' and 'Community' tabs, a licence line reading 'License: Apache 2.0, Authors: Google DeepMind', and the opening of the card describing the Gemma 4 12B Unified model as sharing the multimodal functionality of Gemma 4 E2B and E4B with native audio and vision understanding and no separate encoders.

Wo das 12B den Kontakt nicht überlebt

Dasselbe Board, das die 29-Punkte-Lücke misst, verzeichnet auch die Dinge, die ein kleines dichtes Modell nicht gut kann, und sie auszulassen wäre unehrlich:

• Langer Kontext — 262.000 Tokens gegenüber 1.000.000. Eine Pipeline, die eine Codebasis oder ein Jahr an Datensätzen in einen einzigen Prompt stopft, hat auf G​emma 4 12B keine Chance, und das Aufteilen in eine Retrieval-Schleife bedeutet zusätzlichen Entwicklungsaufwand, den das größere Kontextfenster vermieden hätte.

• Agentische und Computer-Use-Arbeit – die Klasse von Aufgaben, bei denen das Versagen eines kleinen Modells unbemerkt und teuer ist. Anthropics eigene, vom Anbieter gemeldete Zahlen für Claude Haiku 5.5 beziffern OSWorld 2.1 auf 72,4 % gegenüber 15,7 % für das vorherige Haiku; ein 12B-Modell mit einem Index von 14 ist nicht das Werkzeug für diese Aufgabe, und die Anbieterzahlen sind hier ein nützliches Signal, auch wenn man berücksichtigt, dass kein unabhängiger Durchlauf sie reproduziert hat.

• Durchsatz pro Dollar auf einer gemeinsam genutzten Flotte — 113 Token pro Sekunde auf einer gehosteten Instanz sind in Ordnung, aber der Grund für Self-Hosting ist nicht die Geschwindigkeit, und ein Deployment mit einer einzelnen GPU wird noch langsamer sein.

• Niemand ist Ihr Fallback — wenn Sie Gemma 4 12B in der Produktion betreiben, ist ein Ausfall Ihrer eigenen Hardware Ihr Ausfall, ohne einen zweiten Anbieter, auf den Sie ausweichen können, es sei denn, Sie bauen einen auf.

Eines von beiden durch einen einzigen Endpunkt laufen lassen

OrcaRouter führt heute Gemma 4 31B und Gemma 4 26B-A4B im Katalog zum Listenpreis von Google mit 0 % Aufschlag, das 12B jedoch nicht – und das sollte man klar sagen, statt etwas anderes anzudeuten. Das 12B ist über den eigenen Vertrieb des Anbieters und mehrere Drittanbieter-Plattformen erreichbar. Claude Haiku 5.5 ist ebenfalls noch nicht im Katalog; es ist über A​nthropics API und die großen Clouds verfügbar.

Was ein Router bietet, ist die Form, die dieser Vergleich tatsächlich erfordert. Ein sinnvoller Einsatz eines günstigen lokalen Modells und eines teuren API-Modells ist keine Verzweigung – es ist eine Route: Gemma 4 12B oder eine gehostete Gemma-4-Variante beantwortet die einfache Mehrheit, und Anfragen, die eine Qualitäts- oder Längenbedingung auslösen, eskalieren an eine Anthropic-Teilstrecke. Claude Haiku 4.5, Claude Sonnet 5.5 und Claude Opus 5.5 sind jetzt im Katalog, sodass der Eskalationspfad aufgebaut und lastgetestet werden kann, bevor die Teilstrecke der kleinen Stufe überhaupt verfügbar ist. Auf OrcaRouter ist diese Zusammensetzung ein Routing-DSL-Ausdruck und automatisches Failover statt eines Dienstes, den man selbst warten muss, und da die Listenpreise der Anbieter mit 0 % Aufschlag durchgereicht werden, ist eine Preisänderung auf einer beliebigen Teilstrecke noch am selben Tag live, an dem sie erfolgt.

Die Regel

Nimm Claude Haiku 5.5, es sei denn, eine Einschränkung schließt es aus. Es liegt 29 Indexpunkte vor Gemma 4 12B bei nahezu gleichem Listenpreis, es bietet eine Million Tokens Kontext und ist bei jeder Aufgabe, die beide bewältigen können, das stärkere Modell. Es gibt keine Version dieses Vergleichs, in der die 12B aufgrund ihrer Leistung gewinnt.

Wähle G​emma 4 12B, wenn die Einschränkung der Punkt ist – wenn die Token deine Räumlichkeiten nicht verlassen dürfen, wenn das Budget eine Maschine statt eines Zählers ist, wenn du Fine-Tuning betreiben musst oder wenn du Gewichte in der Hand brauchst statt einer Preisliste und eines Stilllegungsdatums. Das sind keine Präferenzen, das sind Anforderungen, und gegen eine Anforderung ist eine Lücke von 29 Punkten einfach nicht die entscheidende Zahl.