Eine Titelkarte im Diagrammstil für „Tiny Aya Base 32K vs Tiny Aya En-Thinker“. Zwei abgerundete Karten liegen nebeneinander und sind von links nach rechts durch einen Pfeil mit der Beschriftung „Post-Training“ verbunden. Die linke Karte, „Tiny Aya Base 32K“, trägt die Zeilen „vortrainierte Basis“ und „keine Chat-Vorlage“; die rechte Karte, „Tiny Aya En-Thinker“, trägt „nachtrainiert“ und „Denkmodus enthalten“. Eine zentrierte Zeile unter beiden lautet „dieselbe 3,35B-Architektur, dasselbe 32K-Fenster“. Das OrcaRouter-Logo ist in der unteren rechten Ecke eingefügt.
Guides & Insights

Tiny Aya Base 32K vs Tiny Aya En-Thinker: Eltern und Kind, keine Rivalen

Autor

Rowan Sterling

Veröffentlicht am

Neueste Modelle · 20Alle Modelle ansehen
Benchmarks: Artificial Analysis · täglich aktualisiert
Zurück zu allen Beiträgen

Zwei Hugging-Face-Repositories, jeweils vier safetensors-Shards, und die Shard-Größen stimmen bis aufs Byte überein — 1,998,698,496 / 1,996,494,056 / 1,996,494,088 / 708,852,792. Tiny Aya Base 32K und Tiny Aya En-Thinker sind nicht die Antworten zweier Labore auf dieselbe Frage. Sie sind dieselbe 3,35B-Cohere2-Architektur in zwei verschiedenen Stadien, und die eigene Modellkarte von Cohere Labs sagt es ganz offen: Der Basis-Checkpoint „wird als Basismodell für Tiny Aya L2-Thinker und Tiny Aya En-Thinker verwendet.“

Das macht die übliche direkte Gegenüberstellung falsch. Sie wählen nicht zwischen zwei konkurrierenden mehrsprachigen 3B-Modellen. Sie wählen zwischen einem Ausgangspunkt und einem fertigen Modell – und die interessante Frage ist, was der Post-Training-Schritt dazwischen tatsächlich gebracht hat, was er gekostet hat und ob eines von beiden für das brauchbar ist, was Ihnen vorschwebt, angesichts der Tatsache, dass beide unter derselben nicht-kommerziellen Lizenz stehen und keines über einen einzigen veröffentlichten Benchmark verfügt.

Der eine Satz, der die Beziehung klärt

Normalerweise muss ein „vs“-Beitrag die Beziehung zwischen zwei Checkpoints aus der Architektur und den Parameterzahlen ableiten. Hier muss man das nicht.

Die Modellkarte von Tiny Aya Base 32K sagt es unverblümt, und es lohnt sich, sie sorgfältig zu lesen, und zwar wegen der Stelle, an der der Satz steht – nicht in einer Fußnote, sondern in der Modellzusammenfassung, zwischen der Beschreibung des Checkpoints und den Entwickler-Credits:

"Dies ist ein vortrainiertes Basismodell und wurde weder instruktionsoptimiert noch auf Präferenzen ausgerichtet. Dieser Checkpoint wird als Basismodell für Tiny Aya L2-Thinker und Tiny Aya En-Thinker verwendet."

Was das einen Absatz wert macht, ist die Inkonsistenz, die es offenlegt. Auf En-Thinkers eigener Modellkarte wird Base 32K nicht genannt. Ihre Schlusszeile verweist Leser auf „tiny-aya-global, tiny-aya-base, tiny-aya-l2-thinker“ – und tiny-aya-base ist der Februar-Checkpoint, dokumentiert mit 8K-Kontext, nicht die 32K-Variante, die angibt, En-Thinkers Elternmodell zu sein. En-Thinker beansprucht 32K auf seiner eigenen Modellkarte. Ein Modell kann nicht nachtrainiert werden, um ein Fenster zu erhalten, das viermal breiter ist als das Fenster, mit dem es vortrainiert wurde. Das 8K-Basismodell konnte also nie die Antwort sein, und die Behauptung des 32K-Basismodells passt zur Rechnung, während En-Thinkers eigener Verweis das nicht tut.

Die wahrscheinlichste Erklärung ist banal: Base 32K wurde am 8. September 2026 hochgeladen, sechs Tage nach den Thinkers, sodass En-Thinkers Karte verfasst wurde, bevor sein übergeordnetes Produkt existierte, und seither nicht aktualisiert wurde. Das ist eine Schlussfolgerung aus Zeitstempeln, keine Aussage des Anbieters – doch es ist die Lesart, die die wenigsten Annahmen erfordert, und sie bedeutet, dass das neueste Dokument der Familie das informativste ist.

A screenshot of the Hugging Face model card page for CohereLabs/tiny-aya-base-32K. The page is licence-gated, and the card summary states Model Size 3.35B and Context Length 32K (input + output), followed by the line 'This checkpoint is used as the base model for Tiny Aya L2-Thinker and Tiny Aya En-Thinker' and 'For the 8K release, see tiny-aya-base.' The tags row includes long-context and 46 languages, and the Inference Providers panel reads 'This model isn't deployed by any Inference Provider.'

Dimension für Dimension

Alles Folgende ist das, was die beiden Karten angeben, abzüglich der Dopplung – beide sind 3,35B, BF16, nur Text, Cohere2ForCausalLM, CC-BY-NC-4.0, zugangsbeschränkt und nicht gebenchmarkt.

• Phase — Tiny Aya Base 32K ist ein vortrainiertes Basismodell, „nicht instruktionsabgestimmt oder präferenzausgerichtet“; Tiny Aya En-Thinker wurde auf mehrsprachigen Reasoning-Daten mit englischen Reasoning-Traces nachtrainiert.

• Chat-Vorlage — Base 32K liefert überhaupt keine chat_template.jinja; En-Thinker liefert eine, und seine Modellkarte widmet einen ganzen Abschnitt der Art und Weise, wie sie Turns rendert.

• Prompting-Stil — Das eigene Beispiel von Base 32K ist Completion (prompt = "Die Hauptstadt von Spanien ist"); En-Thinker erwartet apply_chat_template() mit einer messages-Liste.

• Reasoning-Modus — Base 32K hat keinen Reasoning-Modus; En-Thinker arbeitet im Dual-Modus und hängt standardmäßig /think an und gibt eine Denkspur auf Englisch aus, oder /no_think mit enable_thinking=False für eine direkte Antwort.

• Sprachumfang — Die Modellkarte von Base 32K behauptet Training auf 70+ Sprachen und nennt 67 explizit; En-Thinker deckt „44 Sprachen plus Englisch“ mit englischen Reasoning-Traces ab und erweitert dies um 20+ weitere durch zusätzliche Nicht-Reasoning-Instruktionsdaten.

• Architektur-Fußabdruck — identisch. Dieselben vier Shard-Größen, dieselbe Parameteranzahl, dieselbe Länge der Konfigurationsdatei.

• Kontext — 32K Eingabe plus Ausgabe auf beiden Karten. Keines von beiden ist verifizierbar: Beide Konfigurationen liegen hinter dem Lizenz-Gate.

• Benchmarks – auf keiner der beiden Karten. Für keines der beiden Modelle existiert eine Bewertung durch Dritte.

• Traktion — Base 32K zeigt null Downloads und ein Like; En-Thinker zeigt sieben Downloads und zwei Likes. Keines von beiden erscheint im Katalog eines Inferenzanbieters.

Was der Post-Training-Schritt eingebracht hat

Drei Dinge, alle verhaltensbezogen und nicht strukturell.

Das erste ist eine nutzbare Schnittstelle. Ein Checkpoint ohne Chat-Template ist kein Modell, das Sie per Prompt ansprechen; es ist ein Modell, das Sie weiterschreiben. Jede Unterhaltung, die Sie mit Base 32K führen, müssen Sie selbst in Text serialisieren, und die Modellkarte sagt genau das: „Prompts sollten Textvervollständigung statt eines Chat-Templates verwenden. Zusätzliches Post-Training wird empfohlen, bevor man es als Konversationsassistent einsetzt.“ En-Thinker hat diese Entscheidung bereits für Sie getroffen – bis hin zum Token-Layout.

Das Zweite ist Reasoning als Schalter. En-Thinkers /think und /no_think Modi lassen dieselben Gewichte entweder eine sichtbare Gedankenkette zwischen Thinking-Tags erzeugen oder direkt antworten, und die Karte dokumentiert, dass ein vorheriger Thinking-Block als Assistenten-Turn zurück in die Konversation übergeben wird. Das ist ein Post-Training-Artefakt — in einem Basis-Checkpoint gibt es nichts, das darauf reagiert.

Das dritte ist die Design-Wette im Zentrum von En-Thinker: dass das Reasoning auf Englisch stattfindet, selbst wenn die Frage und die Antwort in einer anderen Sprache sind. Die Karte ist explizit, dass dies es von Tiny Aya L2-Thinker unterscheidet, „das in derselben Sprache denkt wie der Prompt.“ Ob es tatsächlich hilft, in einer High-Resource-Sprache zu planen und in einer Low-Resource-Sprache zu antworten, ist eine offene Forschungsfrage, und En-Thinker existiert, damit die Leute es testen können, anstatt es zu klären. Base 32K, das überhaupt keinen Reasoning-Modus hat, schweigt zu der Frage — genau deshalb ist es die richtige Kontrolle für jeden, der versucht, sie zu beantworten.

A screenshot of the Hugging Face model card page for CohereLabs/tiny-aya-en-thinker, also licence-gated. The tags row reads Text Generation, Transformers, Safetensors, 46 languages, cohere2, aya, reasoning, tiny-aya, conversational and License: cc-by-nc-4.0, and the safetensors panel additionally shows a Chat template entry. The summary describes a 3.35 billion parameter multilingual reasoning model trained with English reasoning traces for 44 languages plus English, and the card lists Model Size 3.35B and Context Length 32K (input + output). The closing line points readers to tiny-aya-global, tiny-aya-base and tiny-aya-l2-thinker, and the sidebar shows 7 downloads last month and 'This model isn't deployed by any Inference Provider.'

Was der Post-Training-Schritt kostet

Die ehrliche Antwort ist, dass niemand das quantifizieren kann, weil keines der beiden Modelle jemals auf irgendetwas hin evaluiert wurde. Aber die beiden Karten zusammen lassen erahnen, wo der Trade-off liegt – und das nicht dort, wo man es erwarten würde.

Es ist nicht die Sprachabdeckung. Der enge Reasoning-Umfang von En-Thinker – 44 plus Englisch – ist eine Eigenschaft seiner Reasoning-Trainingsdaten, und auf der Karte heißt es, die Abdeckung erstrecke sich auf über 20 weitere Sprachen „durch zusätzliche Nicht-Reasoning-Instruktionsdaten" – das Modell verarbeitet sie also weiterhin, nur ohne den Denkpfad. Es ist auch nicht das Kontextfenster; beide geben 32K an.

Es ist die Bandbreite des Verhaltens. Die Karte von Base 32K listet „fortgesetztes Pretraining, Instruction-Tuning und Forschung zu mehrsprachiger und langkontextiger Sprachmodellierung“ als vorgesehene Verwendungen auf, wobei mehrsprachige Textgenerierung, Zusammenfassung, Übersetzung und crosslinguale Anpassung alle als nachgelagerte Anwendungen genannt werden. Die Karte von En-Thinker ist enger gefasst: „Mathematik, Naturwissenschaften und allgemeine Reasoning-Aufgaben sowie Instruktionsbefolgung und mehrsprachige offene Generierung.“ Ein nachtrainierter Checkpoint ist in einer Weise eigenwillig, wie es ein Basis-Checkpoint nicht ist, und die Einschränkung, die die Karte von Base 32K hervorhebt – „Chain-of-Thought-Reasoning-Aufgaben wie mehrsprachige Mathematik sind vergleichsweise schwächer“ –, ist genau die Schwäche, die das Post-Training beheben sollte.

Die Familie liest sich also als Arbeitsteilung statt als Konkurrenz. Die Basis ist breit und unfertig; En-Thinker ist schmal und fertig; und der Text der Basiskarte selbst nennt es, was es ist — das Substrat, aus dem beide Thinker geformt wurden.

Die Lizenz ist die Einschränkung, die tatsächlich bindet.

Beide Modelle sind CC-BY-NC-4.0, wobei zusätzlich die Acceptable Use Policy von Cohere Labs gilt; beide befinden sich hinter derselben Zugangsschranke, die einen dazu auffordert, die Bedingungen zu akzeptieren und sich zu registrieren, bevor die Dateien heruntergeladen werden, und beide leiten kommerzielle Anfragen an Cohere Sales weiter.

Das sollte vor jedem technischen Vergleich gesagt werden, denn es entscheidet die Frage für einen großen Teil der Leser. Wenn ein kommerzielles Produkt geplant ist, kommt keiner der Checkpoints ohne ein Gespräch mit Cohere infrage, und daran ändern weder noch so ausgeprägtes Long-Context-Verhalten noch Flexibilität im Reasoning-Modus etwas. Wo nichtkommerzielle Nutzung tatsächlich unproblematisch ist – akademische Arbeit, interne Forschung, ein Benchmark-Harness, ein Vergleich mit Ihrem eigenen Modell –, ist die Lizenz irrelevant und die technische Wahl die gesamte Entscheidung.

Keines von beiden wurde gebenchmarkt. So treffen Sie trotzdem eine Wahl.

Das Fehlen von Zahlen ist real, und es wird sich nicht durch nochmaliges, genaueres Lesen klären lassen. Beide Karten erheben keinerlei Leistungsversprechen, kein Leaderboard führt eines der beiden Modelle auf, und hinter keinem von beiden steht ein Inferenzanbieter – was bedeutet, dass kein Anbieter den Durchsatz oder die Preisgestaltung veröffentlicht hat, die üblicherweise als Ersatz für einen Benchmark dienen. Was Sie tun können, ist, sich die Struktur vorzunehmen, bei der die Beweislage solide ist.

• Wählen Sie Tiny Aya Base 32K, wenn Sie trainieren möchten. Laut Model Card ist sie für Continued Pretraining, Instruction Tuning oder eine Domänenanpassung auf einem mehrsprachigen 3,35B-Modell gedacht, und von einem Base-Checkpoint aus zu starten bedeutet, dass Sie nicht gegen ein Post-Training ankämpfen, das Sie nicht gewählt haben. Das 32K-Fenster unterstützt außerdem Langkontext-Forschung, die mit der 8K-Februar-Basis nicht möglich war.

• Wähle Tiny Aya En-Thinker, wenn du heute etwas prompten möchtest. Es ist das einzige der beiden, das ein Gespräch führen kann, und das einzige, das überhaupt einen Reasoning-Modus hat.

• Wählen Sie beide, wenn die Frage wissenschaftlich statt praktisch ist. Das Paar ist ein kontrollierter Vergleich – gleiche Architektur, gleiche Größe, gleiches Fenster, wobei es sich hauptsächlich darin unterscheidet, ob ein Post-Training stattgefunden hat –, um zu untersuchen, ob englische Reasoning-Traces mehrsprachige Antworten verbessern. Das ist die Frage, für die En-Thinker veröffentlicht wurde, damit Menschen sie untersuchen können, und sein eigenes Elternmodell ist die sauberste Baseline.

A two-column scoreboard titled 'Tiny Aya Base 32K vs Tiny Aya En-Thinker — the scoreboard'. Both columns use the same six labels. The 'Tiny Aya Base 32K' column reads 'Stage: Pretrained base', 'Chat template: none', 'Reasoning mode: none', 'Languages: 70+ claimed', 'Benchmarks: none published' and 'Providers: none'. The 'Tiny Aya En-Thinker' column reads 'Stage: Post-trained SFT', 'Chat template: included', 'Reasoning mode: thinking mode', 'Languages: 44 + English', 'Benchmarks: none published' and 'Providers: none'. A footer reads 'Both cards stated by Cohere Labs; neither model has any independent benchmark.' The OrcaRouter logo is composited in the bottom-right corner.

Eine praktische Anmerkung zur Bewertung von beiden: Es handelt sich um unerprobte Research-Checkpoints ohne jede Deployment-Historie, und ein BF16-Download von 6,7 GB plus GPU-Zeit sind echte Kosten, die man für ein Modell aufbringt, das noch nie unabhängig ausgeführt wurde. Diesen Vergleich über einen einzigen Endpunkt laufen zu lassen, statt für jeden Kandidaten eigene Gewichte bereitzustellen, ist günstiger – OrcaRouter führt 195 Modelle hinter einer einzigen API mit 0 % Aufschlag auf die Listenpreise der Anbieter und automatischem Failover zwischen Anbietern, sodass ein Research-Checkpoint, den Sie gerade nur testen, nie auf einem Produktionspfad landet. Tiny Aya ist nicht dabei, und wir hosten es nicht; der Punkt ist nur, dass die Modelle, gegen die Sie es testen würden, größtenteils dort vertreten sind.

Was würde das klären

Zwei Dinge, und beide sind für Cohere Labs günstig zu veröffentlichen und für alle anderen teuer zu produzieren.

Das erste ist ein Benchmark – irgendein Benchmark. Eine einzige multilinguale Reasoning-Evaluierung, die auf beiden Checkpoints durchgeführt wird, würde die gesamte Familie von „laut Model Card angegeben“ zu „gemessen“ machen, und sie würde sofort die Frage beantworten, ob das Design mit englischem Denken dasselbe Modell ohne Post-Training übertrifft – die Forschungsfrage, um die herum das Release aufgebaut ist.

Das zweite ist eine Konfiguration. Die 32K-Angabe auf beiden Karten ist nicht überprüfbar, solange die Repositories zugangsbeschränkt sind, und der Unterschied zwischen einem echten Long-Context-Pretraining-Lauf und einer auf einen 8K-Checkpoint angewendeten Positionskodierungs-Erweiterung ist in der Praxis groß, obwohl beide ein Modell erzeugen, das 32K Token akzeptiert. Das Öffnen der beiden Konfigurationsdateien würde diese Lücke auf eine Weise schließen, wie es kein Werbetext kann.

Bis dahin lautet die zutreffende Antwort auf „Tiny Aya Base 32K oder Tiny Aya En-Thinker“, dass der Vergleich real ist, der Wettstreit aber nicht. Dieselben Gewichte, dasselbe Kontextfenster, dieselbe Lizenz, dieselbe Stille von allen, die sie nicht heruntergeladen haben – das eine hat nur das Chat-Template und die Thinking-Tags, und das andere ist das, woraus es gemacht wurde.