
Tiny Aya Base 32K против Tiny Aya En-Thinker: родитель и ребенок, а не соперники
- deepseekНОВИНКАDeepSeek: DeepSeek V4.1 Flash2026-09-10$0.15 / $0.60 за 1 млн токенов
- openaiНОВИНКАOpenAI: GPT-6 Astra2026-09-0453Интеллект77Кодинг
- googleНОВИНКАGoogle: Gemini 3.8 Flash2026-09-0241Интеллект76Кодинг
- qwenНОВИНКАQwen: Qwen3.8 Max (0902)2026-09-0240Интеллект72Кодинг
- anthropicНОВИНКАAnthropic: Claude Fable 5.12026-09-0153Интеллект82Кодинг
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 за 1 млн токенов
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Интеллект72Кодинг
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.24 / $0.73 за 1 млн токенов
- z-aiZ.ai: GLM 5.32026-08-1845Интеллект75Кодинг
- obsidianQwen3.8 27B2026-08-1534Интеллект68Кодинг
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Интеллект69Кодинг
- grokSpaceXAI: Grok 4.62026-08-1244Интеллект77Кодинг
- metaMeta: Muse Spark 1.22026-08-0540Интеллект72Кодинг
- qwenQwen: Qwen3.8 Max2026-08-0340Интеллект72Кодинг
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135Интеллект69Кодинг
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 за 1 млн токенов
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2451Интеллект78Кодинг
- googleGoogle: Gemini 3.6 Flash2026-07-2134Интеллект69Кодинг
Два репозитория Hugging Face, по четыре шарда safetensors в каждом, и размеры шардов совпадают до байта — 1 998 698 496 / 1 996 494 056 / 1 996 494 088 / 708 852 792.Tiny Aya Base 32K и Tiny Aya En-Thinker — это не ответы двух лабораторий на один и тот же вопрос. Это одна и та же архитектура Cohere2 (3,35 млрд параметров) на двух разных стадиях, и собственная карточка модели Cohere Labs прямо об этом говорит: базовый чекпоинт «используется как базовая модель для Tiny Aya L2-Thinker и Tiny Aya En-Thinker».
Это делает привычное лобовое сравнение некорректным. Вы выбираете не между двумя конкурирующими многоязычными моделями с 3B параметров. Вы выбираете между отправной точкой и готовым результатом — и главный вопрос в том, что именно дал этап пост-обучения между ними, какой ценой, и пригодна ли хоть одна из них для ваших целей, учитывая, что обе используют одну и ту же некоммерческую лицензию и ни у одной нет ни единого опубликованного бенчмарка.
То единственное предложение, которое определяет отношения.
Обычно в материале «vs» соотношение между двумя чекпоинтами приходится выводить из архитектуры и количества параметров. Здесь этого делать не нужно.
Карточка Tiny Aya Base 32K заявляет об этом прямо, и её стоит внимательно прочитать из-за того, где находится это предложение — не в сноске, а в сводке по модели, между описанием чекпоинта и указанием разработчиков:
"Это базовая предобученная модель и не была дообучена на инструкциях или приведена в соответствие с предпочтениями. Этот чекпойнт используется как базовая модель для Tiny Aya L2-Thinker и Tiny Aya En-Thinker."
То, что делает это достойным абзаца, — несоответствие, которое оно вскрывает. На собственной карточке En-Thinker не упоминается Base 32K. Его заключительная строка отправляет читателей к «tiny-aya-global, tiny-aya-base, tiny-aya-l2-thinker» — и tiny-aya-base — это февральский чекпойнт с задокументированным контекстом 8K, а не вариант 32K, который утверждает, что он является родительским для En-Thinker. На своей карточке En-Thinker заявляет о 32K. Модель нельзя дообучить до окна, в четыре раза превышающего окно, на котором она была предварительно обучена. Так что база 8K никогда не могла быть ответом, а заявление базы 32K сходится с арифметикой там, где собственная ссылка En-Thinker — нет.
Вероятное объяснение банально: Base 32K был загружен 8 сентября 2026 года, через шесть дней после Thinkers, поэтому карточка En-Thinker была написана до того, как появился её родительский документ, и с тех пор не обновлялась. Это вывод на основе временных меток, а не заявление вендора — но именно такое прочтение требует меньше всего допущений и означает, что самый новый документ в этом семействе является наиболее информативным.

Измерение за измерением
Всё, что указано ниже, — это то, что написано на обеих карточках, без дублирования: обе имеют 3.35B, BF16, только текст, Cohere2ForCausalLM, лицензию CC-BY-NC-4.0, ограниченный доступ и не имеют бенчмарков.
• Этап — Tiny Aya Base 32K — это предобученная базовая модель, «не настроенная на инструкции и не согласованная с предпочтениями»; Tiny Aya En-Thinker пост-обучена на многоязычных данных для рассуждений с англоязычными цепочками рассуждений.
• Шаблон чата — Base 32K не поставляется с chat_template.jinja вообще; En-Thinker поставляется с ним, и в его карточке целый раздел посвящён тому, как он рендерит витки.
• Стиль промпта — собственный пример Base 32K — это завершение (prompt = "Столица Испании"); En-Thinker ожидает apply_chat_template() со списком сообщений.
• Режим рассуждения — Base 32K не имеет режима рассуждения; En-Thinker — двухрежимный: добавляет /think по умолчанию и выводит цепочку рассуждений на английском, или /no_think с enable_thinking=False для прямого ответа.
• Языковой охват — карточка Base 32K заявляет об обучении на 70+ языках и явно перечисляет 67 из них; En-Thinker охватывает «44 языка плюс английский» с цепочками рассуждений на английском, расширяясь ещё на 20+ языков благодаря дополнительным данным инструкций без рассуждений.
• Архитектурный след — идентичен. Те же четыре размера шардов, то же количество параметров, та же длина файла конфигурации.
• Контекст — 32K ввода и вывода на обеих картах. Ни одна из конфигураций не проверяема: обе находятся за лицензионным шлюзом.
• Бенчмарки — ни на одной из карт нет. Не существует сторонней оценки ни одной из моделей.
• Популярность — Base 32K показывает ноль загрузок и один лайк; En-Thinker показывает семь загрузок и два лайка. Ни одна из них не появляется в каталоге провайдера инференса.
Что дал этап пост-обучения
Три вещи, все они поведенческие, а не структурные.
Первое — это пригодный интерфейс. Чекпоинт без чат-шаблона — это не модель, которой вы даёте промпты, а модель, которую вы продолжаете. Каждый разговор с Base 32K вам придётся сериализовать в текст самостоятельно, и в карточке об этом прямо сказано: «промпты должны использовать завершение текста, а не чат-шаблон. Рекомендуется дополнительный пост-тренинг перед развёртыванием её в качестве диалогового ассистента». En-Thinker уже принял это решение за вас, вплоть до раскладки токенов.
Второе — это рассуждение как переключатель. У En-Thinker /think и /no_think режимы позволяют одним и тем же весам либо выдавать видимую цепочку рассуждений между тегами thinking, либо отвечать напрямую, а карточка документирует возврат предыдущего блока рассуждений в разговор в качестве реплики ассистента. Это артефакт пост-обучения — в базовом чекпоинте нет ничего, что на это реагирует.
Третье — это дизайнерская ставка, лежащая в основе En-Thinker: рассуждение происходит на английском, даже когда вопрос и ответ даны на другом языке. В карточке явно указано, что это отличает модель от Tiny Aya L2-Thinker, «которая мыслит на том же языке, что и запрос». Помогает ли на самом деле планирование на языке с большими ресурсами и ответ на языке с ограниченными ресурсами — это открытый исследовательский вопрос, и En-Thinker создан, чтобы люди могли проверить его, а не решить окончательно. Base 32K, не имея режима рассуждения вовсе, не даёт ответа на этот вопрос — именно поэтому она является правильным контролем для любого, кто пытается на него ответить.

Сколько стоил этап пост-обучения?
Честный ответ: никто не может дать количественную оценку, поскольку ни одна из моделей не была ни на чём протестирована. Но две карты вместе намекают на то, где проходит компромисс, — и это не там, где можно было бы ожидать.
Это не охват языков. Узкая сфера рассуждений En-Thinker (44+ английских языка) является свойством её обучающих данных для рассуждений, и в карточке указано, что охват расширяется ещё на 20+ языков «через дополнительные инструкционные данные без рассуждений» — так что модель по-прежнему их поддерживает, просто без пути рассуждений. Это также не контекстное окно; обе модели заявляют 32K.
Это {{1}}широта поведения{{/1}}. В карточке Base 32K в качестве предполагаемых вариантов использования перечислены {{2}}«продолженное предобучение, дообучение по инструкциям и исследование многоязычного и длинноконтекстного языкового моделирования»{{/2}}, а {{3}}многоязычная генерация текста, суммаризация, перевод и кросс-язычная адаптация{{/3}} названы прикладными применениями. Карточка En-Thinker уже: {{4}}«математика, естественные науки и задачи общего рассуждения, а также следование инструкциям и многоязычная открытая генерация»{{/4}}. Пост-обученный чекпоинт имеет выраженную направленность, которой лишён базовый чекпоинт, и ограничение, отмеченное в карточке Base 32K — {{5}}«задачи цепочки рассуждений, такие как многоязычная математика, сравнительно слабее»{{/5}} — это именно та слабость, которую пост-обучение и было призвано исправить.
Итак, семья читается как разделение труда, а не как соперничество. Основа широка и незавершена; Эн-Мыслитель узок и завершён; и текст самой базовой карты называет её тем, чем она является — субстратом, из которого были сформированы оба Мыслителя.
Лицензия — это ограничение, которое на самом деле связывает.
Обе модели распространяются под лицензией CC-BY-NC-4.0, поверх которой действует Политика допустимого использования Cohere Labs; обе находятся за одним и тем же шлюзом, требующим принять условия и зарегистрироваться перед загрузкой файлов, и обе направляют коммерческие вопросы в Cohere Sales.
Это стоит подчеркнуть до любого технического сравнения, поскольку именно это решает вопрос для значительной части читателей. Если план — коммерческий продукт, ни одна контрольная точка не является кандидатом без разговора с Cohere, и никакое поведение с длинным контекстом или гибкость режима рассуждений этого не изменят. Если некоммерческое использование действительно приемлемо — академическая работа, внутренние исследования, испытательный стенд для бенчмарков, сравнение с собственной моделью — лицензия не имеет значения, и технический выбор становится единственным решением.
Ни один из них не был протестирован. Вот как всё равно сделать выбор.
Отсутствие чисел реально, и более внимательное чтение этого не исправит. Обе карточки не делают никаких заявлений о производительности, ни один список лидеров не перечисляет ни одну из моделей, и ни у одной из них нет провайдера инференса — то есть ни один провайдер не опубликовал пропускную способность или цены, которые обычно заменяют бенчмарк. Что можно сделать — так это придраться к структуре, где доказательства убедительны.
• Choose Tiny Aya Base 32K, если вы собираетесь обучать модель. Продолженное предобучение, дообучение по инструкциям или доменная адаптация поверх многоязычной модели 3.35B — именно для этого она и предназначена, как указано в карточке, а старт с базового чекаунта означает, что вы не боретесь с пост-обучением, которое не выбирали. Окно в 32K также поддерживает исследования длинного контекста, которые февральская база на 8K обеспечить не могла.
• Выберите Tiny Aya En-Thinker, если хотите сегодня что-то запросить. Это единственная из двух, которая поддерживает диалог, и единственная, у которой вообще есть режим рассуждения.
• Выберите оба варианта, если вопрос научный, а не практический. Эта пара — контролируемое сравнение: одна и та же архитектура, один и тот же размер, одно и то же окно, различие в основном в том, проводилось ли пост-обучение — чтобы выяснить, улучшают ли англоязычные цепочки рассуждений многоязычные ответы. Именно этот вопрос En-Thinker был выпущен, чтобы люди могли исследовать, а его собственный родитель — самая чистая базовая модель.

Одно практическое замечание по оценке любого из них: это непроверенные исследовательские чекпоинты без истории развёртывания, и загрузка 6,7 ГБ в формате BF16 плюс время на GPU — это реальные затраты, которые придётся понести ради модели, которую никогда не запускали независимо. Провести это сравнение через одну конечную точку, а не разворачивать веса для каждого кандидата, дешевле — OrcaRouter предоставляет 195 моделей через один API с 0% наценки на цены провайдеров и автоматическим переключением между провайдерами, поэтому исследовательский чекпоинт, который вы просто тестируете, никогда не попадёт в продакшен. Tiny Aya в нём нет, и мы её не размещаем; дело лишь в том, что модели, которые вы бы использовали для его тестирования в качестве эталона в основном есть.
Что могло бы это уладить?
Две вещи, и обе для Cohere Labs дёшевы в публикации, а для любого другого — дороги в производстве.
Первый — это бенчмарк, любой бенчмарк. Один-единственный прогон мультиязычной оценки рассуждений на обоих чекпоинтах перевёл бы всё семейство из разряда «заявлено в спецификации» в разряд «измерено», и это немедленно дало бы ответ на вопрос, превосходит ли архитектура с англоязычным мышлением ту же модель без пост-обучения, — а именно этот вопрос и лежит в основе исследования, вокруг которого построен релиз.
Второе — это конфиг. Утверждение о 32K на обеих карточках невозможно проверить, пока репозитории закрыты, и разница между настоящим длинноконтекстным предобучением и расширением позиционного кодирования, применённым к 8K-чекпоинту, на практике велика, даже если обе модели принимают 32K токенов. Открытие двух конфиг-файлов закрыло бы этот разрыв так, как не сможет ни один маркетинговый текст.
До тех пор точный ответ на вопрос «Tiny Aya Base 32K или Tiny Aya En-Thinker» таков: сравнение реально, а состязания нет. Те же веса, то же окно, та же лицензия, то же молчание со стороны всех, кто их не скачивал — просто у одного есть чат-шаблон и теги мышления, а другой — то, из чего он был сделан.
