
Tiny Aya Base 32K kontra Tiny Aya En-Thinker: rodzic i dziecko, nie rywale
- deepseekNOWOŚĆDeepSeek: DeepSeek V4.1 Flash2026-09-10$0.15 / $0.60 za 1 mln tokenów
- openaiNOWOŚĆOpenAI: GPT-6 Astra2026-09-0453Inteligencja77Kod
- googleNOWOŚĆGoogle: Gemini 3.8 Flash2026-09-0241Inteligencja76Kod
- qwenNOWOŚĆQwen: Qwen3.8 Max (0902)2026-09-0240Inteligencja72Kod
- anthropicNOWOŚĆAnthropic: Claude Fable 5.12026-09-0153Inteligencja82Kod
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 za 1 mln tokenów
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligencja72Kod
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.24 / $0.73 za 1 mln tokenów
- z-aiZ.ai: GLM 5.32026-08-1845Inteligencja75Kod
- obsidianQwen3.8 27B2026-08-1534Inteligencja68Kod
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Inteligencja69Kod
- grokSpaceXAI: Grok 4.62026-08-1244Inteligencja77Kod
- metaMeta: Muse Spark 1.22026-08-0540Inteligencja72Kod
- qwenQwen: Qwen3.8 Max2026-08-0340Inteligencja72Kod
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135Inteligencja69Kod
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 za 1 mln tokenów
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2451Inteligencja78Kod
- googleGoogle: Gemini 3.6 Flash2026-07-2134Inteligencja69Kod
Dwa repozytoria Hugging Face, po cztery shardy safetensors każde, a rozmiary shardów zgadzają się co do bajtu — 1,998,698,496 / 1,996,494,056 / 1,996,494,088 / 708,852,792. Tiny Aya Base 32K i Tiny Aya En-Thinker nie są odpowiedziami dwóch laboratoriów na to samo pytanie. To ta sama architektura Cohere2 o 3,35 mld parametrów na dwóch różnych etapach, a karta modelu samego Cohere Labs mówi o tym wprost: bazowy checkpoint „jest używany jako model bazowy dla Tiny Aya L2-Thinker i Tiny Aya En-Thinker”.
To sprawia, że zwykłe ujęcie w formie bezpośredniego starcia jest błędne. Nie wybierasz między dwoma konkurującymi ze sobą modelami wielojęzycznymi 3B. Wybierasz między punktem wyjścia a gotowym modelem — a interesującym pytaniem jest, co właściwie dał etap post-trainingu między nimi, ile kosztował i czy którykolwiek z nich nadaje się do tego, co masz na myśli, biorąc pod uwagę, że oba podlegają tej samej licencji niekomercyjnej i żaden nie ma ani jednego opublikowanego benchmarku.
Jedno zdanie, które przesądza o relacji.
Zwykle materiał typu „vs” musi wywnioskować związek między dwoma checkpointami na podstawie architektury i liczby parametrów. Tutaj nie musisz tego robić.
Karta Tiny Aya Base 32K mówi to wprost, a warto przeczytać to uważnie ze względu na miejsce, w którym znajduje się to zdanie — nie w przypisie, lecz w podsumowaniu modelu, między opisem checkpointu a informacjami o deweloperach:
"To jest bazowy model wstępnie wytrenowany, który nie został dostrojony do instrukcji ani dopasowany do preferencji. Ten checkpoint jest używany jako model bazowy dla Tiny Aya L2-Thinker i Tiny Aya En-Thinker."
To, co sprawia, że warto poświęcić temu akapit, to niespójność, którą to ujawnia. Własna karta En-Thinker nie wymienia Base 32K. Jej ostatnia linijka odsyła czytelników do „tiny-aya-global, tiny-aya-base, tiny-aya-l2-thinker” — a tiny-aya-base to lutowy checkpoint, udokumentowany przy kontekście 8K, a nie wariant 32K, który twierdzi, że jest rodzicem En-Thinker. En-Thinker deklaruje 32K na własnej karcie. Modelu nie da się dostroić po treningu do okna czterokrotnie szerszego niż okno, z którym był wstępnie trenowany. Tak więc baza 8K nigdy nie mogła być odpowiedzią, a twierdzenie bazy 32K pasuje do arytmetyki, czego nie robi własny wskaźnik En-Thinker.
Prawdopodobne wyjaśnienie jest przyziemne: Base 32K został przesłany 8 września 2026 roku, sześć dni po Thinkersach, więc karta En-Thinkera została napisana, zanim istniał jego rodzic, i nie została od tego czasu zaktualizowana. To wnioskowanie na podstawie znaczników czasu, a nie oświadczenie dostawcy — ale to interpretacja wymagająca najmniejszej liczby założeń, a zarazem oznacza, że najnowszy dokument w rodzinie jest najbardziej informatywny.

Dimension by dimension
Wszystko poniżej to, co podają obie karty, z pominięciem powtórzeń — obie są 3.35B, BF16, tylko tekst, Cohere2ForCausalLM, CC-BY-NC-4.0, z ograniczonym dostępem i bez wyników benchmarków.
• Etap — Tiny Aya Base 32K to wstępnie wytrenowana baza, „nie jest dostrojona do instrukcji ani dopasowana do preferencji”; Tiny Aya En-Thinker jest poddany treningowi końcowemu na wielojęzycznych danych rozumowania z angielskimi śladami rozumowania.
• Szablon czatu — Base 32K nie dostarcza w ogóle pliku chat_template.jinja; En-Thinker dostarcza go, a jego karta poświęca całą sekcję temu, jak renderuje tury.
• Styl promptowania — własny przykład Base 32K to uzupełnianie (prompt = "Stolicą Hiszpanii jest"); En-Thinker oczekuje apply_chat_template() z listą wiadomości.
• Tryb rozumowania — Base 32K nie ma trybu rozumowania; En-Thinker jest dwutrybowy, dodając /think domyślnie i generując ślad rozumowania po angielsku, lub /no_think z enable_thinking=False aby uzyskać bezpośrednią odpowiedź.
• Zakres językowy — karta Base 32K twierdzi, że trenowano go na ponad 70 językach, i wymienia 67 z nich wprost; En-Thinker obejmuje „44 języki plus angielski” wraz z angielskimi śladami rozumowania, rozszerzając zakres o ponad 20 kolejnych dzięki dodatkowym danym instrukcyjnym bez rozumowania.
• Ślad architektury — identyczny. Te same cztery rozmiary shardów, ta sama liczba parametrów, ta sama długość pliku konfiguracyjnego.
• Kontekst — 32K wejścia plus wyjścia na obu kartach. Żadnej nie da się zweryfikować: obie konfiguracje są za bramką licencyjną.
• Benchmarki — brak na obu kartach. Nie istnieje żadna ocena żadnego z tych modeli przeprowadzona przez strony trzecie.
• Trakcja — Base 32K wykazuje zero pobrań i jedno polubienie; En-Thinker wykazuje siedem pobrań i dwa polubienia. Żaden z nich nie pojawia się w katalogu dostawcy usług inferencji.
Co dał etap po treningu
Trzy rzeczy – wszystkie behawioralne, a nie strukturalne.
Pierwszy to użyteczny interfejs. Punkt kontrolny bez szablonu czatu to nie model, do którego kierujesz prompty; to model, który kontynuujesz. Każdą rozmowę, jaką prowadzisz z Base 32K, musisz samodzielnie zserializować do tekstu, a karta modelu mówi o tym wprost: „prompty powinny wykorzystywać uzupełnianie tekstu, a nie szablon czatu. Przed wdrożeniem go jako asystenta konwersacyjnego zaleca się dodatkowe dostrajanie”. En-Thinker podjął już za ciebie tę decyzję, aż po układ tokenów.
Drugi to rozumowanie jako przełącznik. Tryby En-Thinkera: /think i /no_think pozwalają tym samym wagom albo wygenerować widoczny łańcuch myśli między tagami myślenia, albo odpowiedzieć bezpośrednio, a karta dokumentuje przekazanie wcześniejszego bloku myślenia z powrotem do rozmowy jako turę asystenta. To jest artefakt po treningu — w bazowym checkpoincie nie ma niczego, co by na to reagowało.
Trzeci to zakład projektowy stanowiący sedno En-Thinker: że rozumowanie odbywa się po angielsku, nawet gdy pytanie i odpowiedź są w innym języku. Karta wyraźnie stwierdza, że odróżnia to go od Tiny Aya L2-Thinker, „który myśli w tym samym języku co prompt”. Czy planowanie w języku wysokozasobowym i odpowiadanie w języku niskozasobowym faktycznie pomaga, jest otwartym pytaniem badawczym, a En-Thinker istnieje po to, by pozwolić ludziom to przetestować, a nie aby to rozstrzygać. Base 32K, nie mając w ogóle trybu rozumowania, milczy w tej kwestii — i właśnie dlatego jest właściwą kontrolą dla każdego, kto próbuje na to odpowiedzieć.

Ile kosztował etap po treningu?
Szczera odpowiedź brzmi: nikt nie może tego skwantyfikować, ponieważ żaden z modeli nie został oceniony pod kątem czegokolwiek. Ale obie karty razem wskazują, gdzie tkwi kompromis — i nie tam, gdzie można by się tego spodziewać.
Nie chodzi o pokrycie językowe. Wąski zakres rozumowania En-Thinkera obejmujący 44 języki plus angielski jest właściwością jego danych treningowych dotyczących rozumowania, a karta mówi, że pokrycie rozszerza się na ponad 20 kolejnych języków „poprzez dodatkowe dane instrukcyjne niezwiązane z rozumowaniem” — więc model nadal je obsługuje, tylko bez ścieżki myślenia. Nie chodzi też o okno kontekstowe; oba deklarują 32K.
To szerokość zachowań. Karta modelu Base 32K wymienia „kontynuowane pretrenowanie, dostrajanie do instrukcji oraz badania nad wielojęzycznym i długokontekstowym modelowaniem językowym” jako zamierzone zastosowania, przy czym wielojęzyczne generowanie tekstu, streszczanie, tłumaczenie i adaptacja międzyjęzykowa są wymienione jako zastosowania downstream. Karta modelu En-Thinker jest węższa: „zadania matematyczne, naukowe i ogólnego rozumowania, a także podążanie za instrukcjami i wielojęzyczne generowanie otwarte”. Checkpoint poddany post-trainingowi ma wyraźne ukierunkowanie, jakiego nie ma checkpoint bazowy, a ograniczenie, które sygnalizuje karta modelu Base 32K — „Zadania rozumowania z łańcuchem myśli, takie jak wielojęzyczna matematyka, są stosunkowo słabsze” — jest dokładnie tą słabością, którą post-training miał naprawić.
Tak więc rodzina jawi się jako podział pracy, a nie rywalizacja. Baza jest szeroka i niedokończona; En-Thinker jest wąski i ukończony; a sam tekst karty bazowej nazywa to po imieniu — substrat, z którego ukształtowano oba Thinkers.
Licencja jest ograniczeniem, które faktycznie wiąże.
Oba modele są objęte licencją CC-BY-NC-4.0, a na wierzchu nałożona jest Polityka dopuszczalnego użytku Cohere Labs; oba znajdują się za tą samą bramką, która wymaga zaakceptowania warunków i zarejestrowania się przed pobraniem plików, a oba kierują pytania dotyczące zastosowań komercyjnych do Cohere Sales.
Warto to powiedzieć przed jakimkolwiek porównaniem technicznym, ponieważ rozstrzyga to tę kwestię dla dużej części czytelników. Jeśli plan dotyczy produktu komercyjnego, żaden z checkpointów nie jest kandydatem bez rozmowy z Cohere, a nic — ani elastyczność w zakresie długiego kontekstu, ani trybu rozumowania — tego nie zmienia. Tam, gdzie niekomercyjne zastosowanie jest naprawdę w porządku — praca akademicka, badania wewnętrzne, środowisko testowe do benchmarków, porównanie z własnym modelem — licencja nie ma znaczenia, a wybór techniczny jest całą decyzją.
Żadne z nich nie zostało poddane testom porównawczym. Oto jak mimo to dokonać wyboru
Brak liczb jest faktem i nie zostanie rozwiązany przez uważniejsze czytanie. Obie karty nie zawierają żadnych twierdzeń o wydajności, żaden ranking nie wymienia żadnego z tych modeli, a za żadnym z nich nie stoi dostawca inferencji — co oznacza, że żaden dostawca nie opublikował przepustowości ani cennika, które zwykle zastępują benchmark. Możesz natomiast przyczepić się do struktury, w której dowody są solidne.
• Wybierz Tiny Aya Base 32K, jeśli zamierzasz trenować. Kontynuowane pretrenowanie, dostrajanie do instrukcji lub adaptacja dziedzinowa na bazie wielojęzycznego modelu o 3,35 mld parametrów to zastosowania, dla których — jak podaje karta modelu — jest przeznaczony, a rozpoczęcie od bazowego punktu kontrolnego oznacza, że nie walczysz z etapem po treningu, którego nie wybrałeś. Okno 32K wspiera również badania nad długim kontekstem, których nie umożliwiał bazowy model z lutego o oknie 8K.
• Wybierz Tiny Aya En-Thinker, jeśli chcesz dziś zadać jakieś polecenie. To jedyny z tych dwóch, który podtrzyma rozmowę, i jedyny, który w ogóle ma tryb rozumowania.
• Wybierz oba, jeśli pytanie jest naukowe, a nie praktyczne. Ta para to kontrolowane porównanie — ta sama architektura, ten sam rozmiar, to samo okno, różniące się głównie tym, czy przeprowadzono post-training — aby zbadać, czy angielskie ślady rozumowania poprawiają odpowiedzi w wielu językach. To jest pytanie, którego zgłębianie miało umożliwić udostępnienie En-Thinker, a jego własny rodzic jest najczystszym punktem odniesienia.

Jedna praktyczna uwaga dotycząca oceny któregokolwiek z nich: to niesprawdzone checkpointy badawcze bez historii wdrożeń, a pobranie 6,7 GB w BF16 plus czas GPU to realny koszt, jaki trzeba ponieść na model, który nigdy nie został niezależnie uruchomiony. Przeprowadzenie tego porównania przez jeden endpoint, zamiast stawiania wag dla każdego kandydata, jest tańsze — OrcaRouter udostępnia 195 modeli za jednym API z 0% marży na ceny katalogowe dostawców i automatycznym przełączaniem awaryjnym między dostawcami, dzięki czemu checkpoint badawczy, który tylko testujesz, nigdy nie trafia na ścieżkę produkcyjną. Tiny Aya nie znajduje się na tej liście i nie hostujemy go; chodzi tylko o to, że modele, z którymi byś go porównywał, w większości tam są.
Co rozstrzygnęłoby tę sprawę?
Dwie rzeczy — obie tanie dla Cohere Labs do opublikowania, a drogie dla kogokolwiek innego do wytworzenia.
Pierwszy to benchmark — dowolny benchmark. Pojedyncza wielojęzyczna ocena rozumowania przeprowadzona na obu checkpointach przekształciłaby całą rodzinę z „deklarowanej w karcie” na „zmierzoną” i natychmiast odpowiedziałaby, czy projekt myślenia po angielsku przewyższa ten sam model bez post-trainingu, co jest pytaniem badawczym, wokół którego zbudowano wydanie.
Drugi to konfiguracja. Twierdzenie o 32K na obu kartach jest nie do zweryfikowania, dopóki repozytoria mają ograniczony dostęp, a różnica między prawdziwie długokontekstowym przebiegiem pretreningu a rozszerzeniem kodowania pozycyjnego zastosowanym do checkpointu 8K jest w praktyce duża, mimo że oba tworzą model przyjmujący 32K tokenów. Otwarcie obu plików konfiguracyjnych zamknęłoby tę lukę w sposób, jakiego nie zapewni żaden tekst marketingowy.
Do tego czasu trafna odpowiedź na pytanie „Tiny Aya Base 32K czy Tiny Aya En-Thinker” brzmi: porównanie jest prawdziwe, ale rywalizacji nie ma. Te same wagi, to samo okno, ta sama licencja, ta sama cisza ze strony wszystkich, którzy ich nie pobrali — jeden z nich ma po prostu szablon czatu i znaczniki myślenia, a drugi jest tym, z czego go zrobiono.
