Generierte Hero-Karte für Kolibri vs Qwen 3.8, mit der Überschrift 'Kolibri vs Qwen 3.8' und der Unterzeile 'souveränes deutsches Serving gegen eine offene chinesische Familie', mit einem Kolibri-Symbol links und einer Wolkenkontur rechts zu beiden Seiten eines dünnen Trennstrichs. Das OrcaRouter-Logo befindet sich in dem Streifen unter der Grafik.
Guides & Insights

Kolibri vs. Qwen 3.8: Das deutsche Modell verliert auf der eigenen Tabelle – und das ist der Punkt

Autor

Alistair Wren

Veröffentlicht am

Neueste Modelle · 20Alle Modelle ansehen →
Benchmarks: Artificial Analysis · täglich aktualisiert
Zurück zu allen Beiträgen

Beginnen wir mit dem Satz, den die meiste Berichterstattung zum Launch von Kolibri ausgelassen hat. Auf der Benchmark-Tabelle, die Aleph Alpha am 3. Oktober 2026 zu seinem eigenen Modell veröffentlichte, ist das Modell, gegen das es am häufigsten gemessen wird, kein europäischer Rivale und auch kein amerikanischer. Es ist Qwen3.8 27B, die Open-Weight-Variante dieser Generation des Anbieters, veröffentlicht am 13. August 2026 — und nach Aleph Alphas eigenen Zahlen gewinnt sie. Qwen3.8 27B erzielt 80,2 im englischen Durchschnitt und 79,9 im deutschen Durchschnitt derselben Evaluierungs-Suite, in der Kolibri 75,5 und 70,8 erreicht. Sie führt bei GPQA Diamond, 89,2 gegen 84,3. Sie führt bei LiveCodeBench v6, 93,8 gegen 85,9. Sie führt bei SWE-Bench Verified, 72,6 gegen 66,4, und bei beiden Long-Context-Benchmarks, 76,9 gegen 64,5 bei LongBench Pro und 81,3 gegen 68,3 bei AA-LCR. Ein dichtes chinesisches Modell mit 27 Milliarden Parametern, evaluiert von einem deutschen Labor, schlägt das 78-Milliarden-Parameter-Flaggschiff dieses Labors in weiten Teilen von dessen eigener Tabelle. Das ist kein Skandal. Es ist die nützlichste Tatsache der Veröffentlichung, denn sie erzwingt die Frage, wofür Kolibri eigentlich gedacht ist.

Eine Klarstellung, bevor der Vergleich weitergeht, denn „Qwen 3.8“ bezeichnet eine Familie und kein einzelnes Modell, und die Unterschiede sind hier wichtig. Qwen3.8-Max ist Alibabas gehostetes Flaggschiff, live seit dem 3. August 2026, mit einem Kontextfenster von 1 Mio. Token zu 2,00 US-Dollar pro Million Eingabe-Token und 6,00 US-Dollar für Ausgabe. Qwen3.8-27B ist die Open-Weights-Stufe, veröffentlicht am 13. August 2026 mit einem Fenster von 262.144 Token. Qwen3.8-Flash ist die Volumen-Stufe, veröffentlicht am 26. August 2026 mit dem 1-Mio.-Token-Fenster und deutlich niedrigeren Preisen. Und das schlichte Qwen3.8 – angekündigt am 19. Juli 2026 als Open-Weight-Flaggschiff mit 2,4 Billionen Parametern – ist nicht veröffentlicht; es existiert als Katalog-Tracking-Seite und Ankündigung. Alles Folgende bezieht sich auf das Modell mit Gewichten, die man herunterladen und ausführen kann, nämlich das 27B-Modell.

Wo Kolibri tatsächlich gewinnt – abgelesen an derselben Tabelle

Die Zeilen, in denen Kolibri vor Qwen3.8 27B liegt, sind nicht zufällig verstreut. Sie bilden Cluster, und das Cluster ist das Produkt.

• Enthaltung – bei RGB Negative erzielt Kolibri 85,6 gegenüber 70,6. Wenn der Kontext die Antwort nicht enthält, sagt Kolibri das deutlich häufiger.

Tool-Calling unter Einschränkung — bei τ²-bench telecom 94,7 gegen 82,5; bei der vertikalen Suite für Automobilzulieferer 99,0 gegen 97,3.

• Sehr langer Kontext — bei SealQA ohne Distraktoren oberhalb von 24k Token, 100,0 gegenüber 94,4.

• Deutsche Serving-Ökonomie — ein bilingualer Tokenizer mit durchschnittlich 4,90 Bytes pro Token bei deutschem Webtext, gegenüber 4,17 für die Qwen3.5–3.8-Familie nach Aleph Alphas eigener Messung. Eine geringere Tokenzahl pro deutschem Dokument ist eine direkte Senkung der Inferenzkosten, die sich auf einer Rechnung niederschlägt und in keiner Benchmark-Zeile auftaucht.

Drei dieser vier betreffen eher das Verhalten als die Fähigkeit. Enthaltung, eingeschränktes Tool-Calling und verankertes Langkontext-Retrieval sind genau das, was Sie von einem Modell brauchen, das die eigenen Materialien Ihrer Organisation liest und von dem erwartet wird, dass es zugibt, wenn die Materialien die Frage nicht beantworten. Aleph Alpha hat das gesamte Release um diese Wette herum aufgebaut, und die Tabelle zeigt, dass die Wette aufgeht.

Generated two-column scoreboard for Kolibri and Qwen3.8 27B. Left column Kolibri: English average 75.5, German average 70.8, abstention 85.6, GPQA Diamond 84.3, SWE-Bench Verified 66.4, licence Apache 2.0. Right column Qwen3.8 27B: English average 80.2, German average 79.9, abstention 70.6, GPQA Diamond 89.2, SWE-Bench Verified 72.6, licence Apache 2.0. The footer reads 'Both columns from Aleph Alpha's published table, vendor harness; no independent reproduction.'

Die Zeilen, in denen Qwen3.8 27B gewinnt, betreffen die Breite: Wissen in beiden Sprachen, wissenschaftliche Fragen auf Graduiertenniveau, kompetitives Programmieren, Software-Engineering auf Repository-Ebene, das Verständnis langer Dokumente. Wenn Sie ein starkes Allround-Modell zu einem niedrigen Preis pro Token mit offenen Gewichten benötigen, ist Qwen3.8 27B das bessere Modell, und die Tabelle sagt dies in den eigenen Worten des Anbieters.

Diese Lesart wird bestätigt, während die von Kolibri nicht bestätigt wird. Artificial Analysis hat Qwen3.8 27B unabhängig gemessen, in dessen Xhigh-Reasoning-Konfiguration, und meldet einen Intelligence Index von 34 auf Platz 1 der 142 Modelle in diesem Vergleich, 45,4 Ausgabe-Token pro Sekunde, einen Kontext von 256.000 Token und eine Apache-2.0-Lizenz. Ihre Anmerkung ist auf vertraute Weise wenig schmeichelhaft – sehr wortreich mit 200 Millionen während der Index-Bewertung generierten Token gegenüber einem Median von 82 Millionen, und langsam –, doch die Punktzahl selbst ist eine Messung des Gegners durch Dritte. Kolibri hat überhaupt keine Seite bei Artificial Analysis. Das stärkste Modell in diesem Vergleich wurde also unabhängig verifiziert, und beim schwächeren handelt es sich um die Aussage des Anbieters, was das Gegenteil davon ist, wie ein europäisches Flaggschiff der ersten Generation üblicherweise dargestellt wird.

Zwei Arten von Lieferkettenbehauptungen, die in entgegengesetzte Richtungen weisen

Beide dieser Veröffentlichungen sind Argumente darüber, woher ein Modell kommt, und die Argumente sind Spiegelbilder.

Aleph Alphas Argument ist Herkunft als Feature. Kolibri wurde von deutschen Teams auf Infrastruktur in Deutschland und Finnland trainiert, nach EU- und deutschem Recht. Die Modellkarte offenbart die Pre-Training-Mischung — 20 Billionen Tokens bei ungefähr 62,5 Prozent Englisch, 23,9 Prozent Deutsch und 13,6 Prozent Code —, die Budgets für Mid-Training und Long-Context, den exakten Rechenaufwand von 768 NVIDIA B200 über 96 HGX-Knoten für 21 Tage und einen geschätzten Energieverbrauch von 9,5×10² MWh einschließlich des Overheads des Rechenzentrums. Sie legt die Trainingsmethode bis hinunter zur Schicht dar: ein 50-schichtiger Mixture-of-Experts-Transformer mit einem 4:1-Aufteilungsverhältnis von Sliding-Window- zu Grouped-Query-Attention, Muon und Exact Quantile Balancing über 384 Experten mit 1 geteilten und 6 gerouteten. Zwölftausend Wörter an Offenlegungen, angehängt an einen 78-GB-Download, und eine erklärte Unterzeichnerposition zum General-Purpose AI Code of Practice der EU.

Alibabas Fall ist grundlegend anders: nicht „wir können jede Entscheidung begründen“, sondern „hier sind die Gewichte, nimm sie“. Apache-lizenzierte offene Gewichte in einer Größenordnung und Qualität, die Qwen weltweit zum faktischen Standard gemacht haben, ein Vokabular von 248.077 Token, das weit über hundert Sprachen abdeckt, und ein Serving-Ökosystem, das lange genug auf diese Checkpoints abgestimmt wurde, dass nahezu jeder Inferenz-Stack sie out of the box unterstützt. Beim Souveränitätsargument geht es dort um Verfügbarkeit: Kein Anbieter kann das Modell zurückziehen, weil Sie die Datei bereits haben.

Beide Behauptungen sind ehrlich, und sie beantworten unterschiedliche Ängste. Ein Beschaffer des öffentlichen Sektors in Baden-Württemberg sorgt sich um Gerichtsbarkeit und Auditierbarkeit, und Kolibri richtet sich an diese Sorge. Eine Forschungsgruppe in Nairobi oder São Paulo sorgt sich darum, dass ein Modell durch eine Kreditkarte in einer Währung, in der sie nicht zahlen können, zugangsbeschränkt ist, und offene Qwen-Gewichte richten sich an diese Sorge. Was nicht ehrlich ist, ist vorzugeben, eine der beiden sei ein Fähigkeitsvergleich, denn die Fähigkeitstabelle hat ihre Antwort bereits gegeben.

Screenshot of the Artificial Analysis model page for Qwen3.8 27B (Xhigh), marked 'Open weights model, Released August 2026', showing an Intelligence Index of 34 against a median of 8, a #1/142 intelligence rank, a #55/142 speed rank at 45 tokens per second against a 91-token median, input pricing $0.50 per million tokens against a $0.03 median and output pricing $3.00 against a $0.15 median, an average cost of $1.01 per task on the Intelligence Index, a verbosity rank of #22/142 having generated 200M tokens during the index evaluation against a median of 82M, a 256k-token context window, and the Apache 2.0 licence badge.

Die Lizenzlücke ist real, aber enger als es klingt

Kolibri steht unter Apache 2.0. Qwen3.8 27B sind Apache-lizenzierte offene Gewichte. Beide kommen ohne Zusatzklausel zur akzeptablen Nutzung, ohne Schwellenwert für monatlich aktive Nutzer und ohne separate kommerzielle Bedingungen — was sie in eine kleine Gruppe einordnet und bedeutet, dass keines von beiden vor der kommerziellen Nutzung eine rechtliche Prüfung erfordert.

Was sie unterscheidet, ist alles, was nach der Lizenz kommt. Kolibri kommt mit einem vLLM-Plugin und Parser-Paket vom Anbieter, einem Container-Image, vier über die Chat-Vorlage konfigurierbaren Reasoning-Aufwandsstufen, einem expliziten Enthaltungsverhalten und einer empfohlenen Sampling-Konfiguration. Qwen3.8 27B kommt als Gewichte, die Transformers, vLLM und SGLang bereits zu bedienen wissen, mit einem Tool-Calling-Format, für das das breitere Ökosystem Monate Zeit hatte, sich darauf einzustellen.

Die Deployment-Hardware unterscheidet sich in gleicher Weise. Kolibris FP8-Gewichte haben einen Footprint von ~78 GB mit einer Untergrenze von zwei A100-80-GB-Karten, zwei H100 SXM5, einer H200, einer B200 oder einer B300. Qwen3.8 27B in bfloat16 hat ungefähr 54 GB an Gewichten, was bei voller Präzision einem einzelnen 80-GB-Beschleuniger oder einem quantisierten Build auf deutlich weniger entspricht. Das deutsche Modell kostet mehr Hardware und liefert dafür weniger Benchmark. Das ist nur dann ein schlechter Tausch, wenn man Benchmark kaufen wollte.

Was die Preisschilder Ihnen verraten und was nicht

Kolibri hat keinen Preis, weil Aleph Alpha keine Inferenz dafür verkauft. Die Veröffentlichung besteht aus Gewichten, einem technischen Bericht und einer Modellkarte; es gibt keine gehostete SKU. Jede Kostenangabe für Kolibri ist eine Hardware-Amortisierungsrechnung, die Sie selbst durchführen.

Qwen3.8 ist öffentlich in drei Stufen bepreist, und die mittlere ist die, die für ein Team zählt, das Selbsthosting mit Anmietung vergleicht.

• Qwen3.8-Max — 2,00 $ pro Million Input-Tokens und 6,00 $ für Output, 1-M-Token-Kontext, Cache-Lesevorgänge zu 0,25 $, veröffentlicht am 3. August 2026.

• Qwen3.8-27B — 0,33 $ Eingabe und 2,40 $ Ausgabe, Kontext von 262.144 Token, veröffentlicht am 13. August 2026. Dies sind die offenen Gewichte, dieser Preis ist also das, was Sie zahlen, wenn Sie sie lieber nicht selbst betreiben möchten.

• Qwen3.8-Flash — 0,15 $ Eingabe und 0,47 $ Ausgabe mit dem 1M-Token-Fenster, veröffentlicht am 26. August 2026.

Das sind die Listenpreise der Anbieter auf OrcaRouter, durchgereicht, ohne dass pro Token etwas aufgeschlagen wird, was die nützliche Eigenschaft ist, wenn die Frage lautet, ob sich ein selbst gehostetes Deployment amortisiert: Du kannst dein tatsächliches Token-Volumen auf den gehosteten Stufen messen, bevor du dich für Hardware entscheidest. Wir schlagen keine Marge auf, daher ist eine Preissenkung eines Anbieters am selben Tag bei uns live. Alle drei Qwen3.8-Stufen sind heute routbar über einen OpenAI-kompatiblen Schlüssel mit automatischem Failover über Anbieter hinweg, und das kommende Qwen3.8 mit 2,4 Billionen Parametern hat eine Katalogseite, die auf die Gewichte wartet, statt einen Platzhalter, der vorgibt, sie zu bedienen.

Kolibri ist nicht routbar. Wir haben den Katalog unter jeder Hersteller- und Modellschreibweise durchsucht, und es ist nicht vorhanden – die einzige Möglichkeit, es aufzurufen, ist also der 78-GB-Download. Wenn Sie wissen möchten, was das deutsche Modell für Ihre Workload kosten würde, lautet die Antwort: ein Rack und eine Person, die vLLM ausführen kann, und kein Drittanbieter kann Ihnen derzeit ein anderes Angebot machen.

Screenshot of the OrcaRouter model page for qwen/qwen3.8-max, showing the 1M-token context badge, text, image and video input with text output, the Vision, Tools, JSON and Reasoning capability tags, a p50 time-to-first-token of 2.35 seconds, the attribution 'Public benchmarks by Qwen - 2026-08-03', the description as Alibaba's newest flagship in the Qwen line positioned against GPT-5.5, Claude Opus 4.7 and Gemini 3.1 Pro, the pricing tiles $2.00 and $6.00, and the OpenAI-compatible and Anthropic-compatible base URLs at https://api.orcarouter.ai/v1 and https://api.orcarouter.ai.

Wer sollte welches kaufen?

Die Entscheidung hängt nicht von der Qualität ab, denn diese Frage ist durch die Tabelle des Anbieters selbst zugunsten von Alibaba entschieden worden. Sie hängt davon ab, gegen welches Risiko Sie sich absichern.

• Wählen Sie Kolibri, wenn die bindende Einschränkung die Jurisdiktion, die Provenienzdokumentation oder die Auditierbarkeit ist – wenn Sie beantworten können müssen, woher die Trainingsdaten stammen, wo das Compute lief und unter welchem Recht, und wenn es sich um deutsch- und englischsprachige Dokumente handelt, die innerhalb Ihres eigenen Perimeters verarbeitet werden. Dafür zahlen Sie einen Capability-Aufpreis, und der Aufpreis ist in der obigen Tabelle sichtbar.

• Wählen Sie Qwen3.8 27B, wenn die bindende Einschränkung die Leistungsfähigkeit pro Dollar, die Sprachenbreite oder die Ökosystem-Unterstützung ist. Es ist das stärkere Modell in Aleph Alphas eigener Bewertung, es ist unter Apache lizenziert, es läuft auf einem einzigen Beschleuniger, und die gehosteten Tarife beginnen bei 0,33 US-Dollar pro Million Eingabe-Tokens, wenn Sie es lieber überhaupt nicht selbst betreiben möchten.

• Beziehen Sie beide in dieselbe Architektur ein, wenn die Arbeitslast einen regulierten Kern und eine allgemeine Peripherie hat. Dokumente, die das Gebäude nicht verlassen dürfen, gehen an einen selbst gehosteten Kolibri-Endpunkt; die Zusammenfassungs-, Übersetzungs- und Codearbeit geht an eine geroutete Qwen3.8-Stufe für ein Drittel eines Cents pro tausend Token. Ein API-Schlüssel, eine Routing-Regel, durchgereichte Listenpreise der Anbieter und das Failover für Sie übernommen — was eine deutlich nützlichere Lösung ist, als sich für eines dieser beiden zu entscheiden und so zu tun, als gäbe es das andere nicht.