Диаграммный титульный блок для «Tiny Aya Base 32K против Tiny Aya En-Thinker». Две скруглённые карточки расположены бок о бок и соединены слева направо стрелкой с подписью «пост-обучение». Левая карточка, «Tiny Aya Base 32K», содержит строки «предобученная база» и «без чат-шаблона»; правая карточка, «Tiny Aya En-Thinker», — «пост-обученная» и «включён режим размышления». Под обеими по центру идёт строка: «та же архитектура 3.35B, то же окно 32K». Логотип OrcaRouter вкомпонован в нижний правый угол.
Guides & Insights

Tiny Aya Base 32K против Tiny Aya En-Thinker: родитель и ребенок, а не соперники

Автор

Rowan Sterling

Дата публикации

Новые модели · 20Все модели
Бенчмарки: Artificial Analysis · обновляется ежедневно
Назад ко всем статьям

Два репозитория Hugging Face, по четыре шарда safetensors в каждом, и размеры шардов совпадают до байта — 1 998 698 496 / 1 996 494 056 / 1 996 494 088 / 708 852 792.Tiny Aya Base 32K и Tiny Aya En-Thinker — это не ответы двух лабораторий на один и тот же вопрос. Это одна и та же архитектура Cohere2 (3,35 млрд параметров) на двух разных стадиях, и собственная карточка модели Cohere Labs прямо об этом говорит: базовый чекпоинт «используется как базовая модель для Tiny Aya L2-Thinker и Tiny Aya En-Thinker».

Это делает привычное лобовое сравнение некорректным. Вы выбираете не между двумя конкурирующими многоязычными моделями с 3B параметров. Вы выбираете между отправной точкой и готовым результатом — и главный вопрос в том, что именно дал этап пост-обучения между ними, какой ценой, и пригодна ли хоть одна из них для ваших целей, учитывая, что обе используют одну и ту же некоммерческую лицензию и ни у одной нет ни единого опубликованного бенчмарка.

То единственное предложение, которое определяет отношения.

Обычно в материале «vs» соотношение между двумя чекпоинтами приходится выводить из архитектуры и количества параметров. Здесь этого делать не нужно.

Карточка Tiny Aya Base 32K заявляет об этом прямо, и её стоит внимательно прочитать из-за того, где находится это предложение — не в сноске, а в сводке по модели, между описанием чекпоинта и указанием разработчиков:

"Это базовая предобученная модель и не была дообучена на инструкциях или приведена в соответствие с предпочтениями. Этот чекпойнт используется как базовая модель для Tiny Aya L2-Thinker и Tiny Aya En-Thinker."

То, что делает это достойным абзаца, — несоответствие, которое оно вскрывает. На собственной карточке En-Thinker не упоминается Base 32K. Его заключительная строка отправляет читателей к «tiny-aya-global, tiny-aya-base, tiny-aya-l2-thinker» — и tiny-aya-base — это февральский чекпойнт с задокументированным контекстом 8K, а не вариант 32K, который утверждает, что он является родительским для En-Thinker. На своей карточке En-Thinker заявляет о 32K. Модель нельзя дообучить до окна, в четыре раза превышающего окно, на котором она была предварительно обучена. Так что база 8K никогда не могла быть ответом, а заявление базы 32K сходится с арифметикой там, где собственная ссылка En-Thinker — нет.

Вероятное объяснение банально: Base 32K был загружен 8 сентября 2026 года, через шесть дней после Thinkers, поэтому карточка En-Thinker была написана до того, как появился её родительский документ, и с тех пор не обновлялась. Это вывод на основе временных меток, а не заявление вендора — но именно такое прочтение требует меньше всего допущений и означает, что самый новый документ в этом семействе является наиболее информативным.

A screenshot of the Hugging Face model card page for CohereLabs/tiny-aya-base-32K. The page is licence-gated, and the card summary states Model Size 3.35B and Context Length 32K (input + output), followed by the line 'This checkpoint is used as the base model for Tiny Aya L2-Thinker and Tiny Aya En-Thinker' and 'For the 8K release, see tiny-aya-base.' The tags row includes long-context and 46 languages, and the Inference Providers panel reads 'This model isn't deployed by any Inference Provider.'

Измерение за измерением

Всё, что указано ниже, — это то, что написано на обеих карточках, без дублирования: обе имеют 3.35B, BF16, только текст, Cohere2ForCausalLM, лицензию CC-BY-NC-4.0, ограниченный доступ и не имеют бенчмарков.

• Этап — Tiny Aya Base 32K — это предобученная базовая модель, «не настроенная на инструкции и не согласованная с предпочтениями»; Tiny Aya En-Thinker пост-обучена на многоязычных данных для рассуждений с англоязычными цепочками рассуждений.

• Шаблон чата — Base 32K не поставляется с chat_template.jinja вообще; En-Thinker поставляется с ним, и в его карточке целый раздел посвящён тому, как он рендерит витки.

• Стиль промпта — собственный пример Base 32K — это завершение (prompt = "Столица Испании"); En-Thinker ожидает apply_chat_template() со списком сообщений.

• Режим рассуждения — Base 32K не имеет режима рассуждения; En-Thinker — двухрежимный: добавляет /think по умолчанию и выводит цепочку рассуждений на английском, или /no_think с enable_thinking=False для прямого ответа.

• Языковой охват — карточка Base 32K заявляет об обучении на 70+ языках и явно перечисляет 67 из них; En-Thinker охватывает «44 языка плюс английский» с цепочками рассуждений на английском, расширяясь ещё на 20+ языков благодаря дополнительным данным инструкций без рассуждений.

• Архитектурный след — идентичен. Те же четыре размера шардов, то же количество параметров, та же длина файла конфигурации.

• Контекст — 32K ввода и вывода на обеих картах. Ни одна из конфигураций не проверяема: обе находятся за лицензионным шлюзом.

• Бенчмарки — ни на одной из карт нет. Не существует сторонней оценки ни одной из моделей.

• Популярность — Base 32K показывает ноль загрузок и один лайк; En-Thinker показывает семь загрузок и два лайка. Ни одна из них не появляется в каталоге провайдера инференса.

Что дал этап пост-обучения

Три вещи, все они поведенческие, а не структурные.

Первое — это пригодный интерфейс. Чекпоинт без чат-шаблона — это не модель, которой вы даёте промпты, а модель, которую вы продолжаете. Каждый разговор с Base 32K вам придётся сериализовать в текст самостоятельно, и в карточке об этом прямо сказано: «промпты должны использовать завершение текста, а не чат-шаблон. Рекомендуется дополнительный пост-тренинг перед развёртыванием её в качестве диалогового ассистента». En-Thinker уже принял это решение за вас, вплоть до раскладки токенов.

Второе — это рассуждение как переключатель. У En-Thinker /think и /no_think режимы позволяют одним и тем же весам либо выдавать видимую цепочку рассуждений между тегами thinking, либо отвечать напрямую, а карточка документирует возврат предыдущего блока рассуждений в разговор в качестве реплики ассистента. Это артефакт пост-обучения — в базовом чекпоинте нет ничего, что на это реагирует.

Третье — это дизайнерская ставка, лежащая в основе En-Thinker: рассуждение происходит на английском, даже когда вопрос и ответ даны на другом языке. В карточке явно указано, что это отличает модель от Tiny Aya L2-Thinker, «которая мыслит на том же языке, что и запрос». Помогает ли на самом деле планирование на языке с большими ресурсами и ответ на языке с ограниченными ресурсами — это открытый исследовательский вопрос, и En-Thinker создан, чтобы люди могли проверить его, а не решить окончательно. Base 32K, не имея режима рассуждения вовсе, не даёт ответа на этот вопрос — именно поэтому она является правильным контролем для любого, кто пытается на него ответить.

A screenshot of the Hugging Face model card page for CohereLabs/tiny-aya-en-thinker, also licence-gated. The tags row reads Text Generation, Transformers, Safetensors, 46 languages, cohere2, aya, reasoning, tiny-aya, conversational and License: cc-by-nc-4.0, and the safetensors panel additionally shows a Chat template entry. The summary describes a 3.35 billion parameter multilingual reasoning model trained with English reasoning traces for 44 languages plus English, and the card lists Model Size 3.35B and Context Length 32K (input + output). The closing line points readers to tiny-aya-global, tiny-aya-base and tiny-aya-l2-thinker, and the sidebar shows 7 downloads last month and 'This model isn't deployed by any Inference Provider.'

Сколько стоил этап пост-обучения?

Честный ответ: никто не может дать количественную оценку, поскольку ни одна из моделей не была ни на чём протестирована. Но две карты вместе намекают на то, где проходит компромисс, — и это не там, где можно было бы ожидать.

Это не охват языков. Узкая сфера рассуждений En-Thinker (44+ английских языка) является свойством её обучающих данных для рассуждений, и в карточке указано, что охват расширяется ещё на 20+ языков «через дополнительные инструкционные данные без рассуждений» — так что модель по-прежнему их поддерживает, просто без пути рассуждений. Это также не контекстное окно; обе модели заявляют 32K.

Это {{1}}широта поведения{{/1}}. В карточке Base 32K в качестве предполагаемых вариантов использования перечислены {{2}}«продолженное предобучение, дообучение по инструкциям и исследование многоязычного и длинноконтекстного языкового моделирования»{{/2}}, а {{3}}многоязычная генерация текста, суммаризация, перевод и кросс-язычная адаптация{{/3}} названы прикладными применениями. Карточка En-Thinker уже: {{4}}«математика, естественные науки и задачи общего рассуждения, а также следование инструкциям и многоязычная открытая генерация»{{/4}}. Пост-обученный чекпоинт имеет выраженную направленность, которой лишён базовый чекпоинт, и ограничение, отмеченное в карточке Base 32K — {{5}}«задачи цепочки рассуждений, такие как многоязычная математика, сравнительно слабее»{{/5}} — это именно та слабость, которую пост-обучение и было призвано исправить.

Итак, семья читается как разделение труда, а не как соперничество. Основа широка и незавершена; Эн-Мыслитель узок и завершён; и текст самой базовой карты называет её тем, чем она является — субстратом, из которого были сформированы оба Мыслителя.

Лицензия — это ограничение, которое на самом деле связывает.

Обе модели распространяются под лицензией CC-BY-NC-4.0, поверх которой действует Политика допустимого использования Cohere Labs; обе находятся за одним и тем же шлюзом, требующим принять условия и зарегистрироваться перед загрузкой файлов, и обе направляют коммерческие вопросы в Cohere Sales.

Это стоит подчеркнуть до любого технического сравнения, поскольку именно это решает вопрос для значительной части читателей. Если план — коммерческий продукт, ни одна контрольная точка не является кандидатом без разговора с Cohere, и никакое поведение с длинным контекстом или гибкость режима рассуждений этого не изменят. Если некоммерческое использование действительно приемлемо — академическая работа, внутренние исследования, испытательный стенд для бенчмарков, сравнение с собственной моделью — лицензия не имеет значения, и технический выбор становится единственным решением.

Ни один из них не был протестирован. Вот как всё равно сделать выбор.

Отсутствие чисел реально, и более внимательное чтение этого не исправит. Обе карточки не делают никаких заявлений о производительности, ни один список лидеров не перечисляет ни одну из моделей, и ни у одной из них нет провайдера инференса — то есть ни один провайдер не опубликовал пропускную способность или цены, которые обычно заменяют бенчмарк. Что можно сделать — так это придраться к структуре, где доказательства убедительны.

• Choose Tiny Aya Base 32K, если вы собираетесь обучать модель. Продолженное предобучение, дообучение по инструкциям или доменная адаптация поверх многоязычной модели 3.35B — именно для этого она и предназначена, как указано в карточке, а старт с базового чекаунта означает, что вы не боретесь с пост-обучением, которое не выбирали. Окно в 32K также поддерживает исследования длинного контекста, которые февральская база на 8K обеспечить не могла.

• Выберите Tiny Aya En-Thinker, если хотите сегодня что-то запросить. Это единственная из двух, которая поддерживает диалог, и единственная, у которой вообще есть режим рассуждения.

• Выберите оба варианта, если вопрос научный, а не практический. Эта пара — контролируемое сравнение: одна и та же архитектура, один и тот же размер, одно и то же окно, различие в основном в том, проводилось ли пост-обучение — чтобы выяснить, улучшают ли англоязычные цепочки рассуждений многоязычные ответы. Именно этот вопрос En-Thinker был выпущен, чтобы люди могли исследовать, а его собственный родитель — самая чистая базовая модель.

A two-column scoreboard titled 'Tiny Aya Base 32K vs Tiny Aya En-Thinker — the scoreboard'. Both columns use the same six labels. The 'Tiny Aya Base 32K' column reads 'Stage: Pretrained base', 'Chat template: none', 'Reasoning mode: none', 'Languages: 70+ claimed', 'Benchmarks: none published' and 'Providers: none'. The 'Tiny Aya En-Thinker' column reads 'Stage: Post-trained SFT', 'Chat template: included', 'Reasoning mode: thinking mode', 'Languages: 44 + English', 'Benchmarks: none published' and 'Providers: none'. A footer reads 'Both cards stated by Cohere Labs; neither model has any independent benchmark.' The OrcaRouter logo is composited in the bottom-right corner.

Одно практическое замечание по оценке любого из них: это непроверенные исследовательские чекпоинты без истории развёртывания, и загрузка 6,7 ГБ в формате BF16 плюс время на GPU — это реальные затраты, которые придётся понести ради модели, которую никогда не запускали независимо. Провести это сравнение через одну конечную точку, а не разворачивать веса для каждого кандидата, дешевле — OrcaRouter предоставляет 195 моделей через один API с 0% наценки на цены провайдеров и автоматическим переключением между провайдерами, поэтому исследовательский чекпоинт, который вы просто тестируете, никогда не попадёт в продакшен. Tiny Aya в нём нет, и мы её не размещаем; дело лишь в том, что модели, которые вы бы использовали для его тестирования в качестве эталона в основном есть.

Что могло бы это уладить?

Две вещи, и обе для Cohere Labs дёшевы в публикации, а для любого другого — дороги в производстве.

Первый — это бенчмарк, любой бенчмарк. Один-единственный прогон мультиязычной оценки рассуждений на обоих чекпоинтах перевёл бы всё семейство из разряда «заявлено в спецификации» в разряд «измерено», и это немедленно дало бы ответ на вопрос, превосходит ли архитектура с англоязычным мышлением ту же модель без пост-обучения, — а именно этот вопрос и лежит в основе исследования, вокруг которого построен релиз.

Второе — это конфиг. Утверждение о 32K на обеих карточках невозможно проверить, пока репозитории закрыты, и разница между настоящим длинноконтекстным предобучением и расширением позиционного кодирования, применённым к 8K-чекпоинту, на практике велика, даже если обе модели принимают 32K токенов. Открытие двух конфиг-файлов закрыло бы этот разрыв так, как не сможет ни один маркетинговый текст.

До тех пор точный ответ на вопрос «Tiny Aya Base 32K или Tiny Aya En-Thinker» таков: сравнение реально, а состязания нет. Те же веса, то же окно, та же лицензия, то же молчание со стороны всех, кто их не скачивал — просто у одного есть чат-шаблон и теги мышления, а другой — то, из чего он был сделан.