Сгенерированная титульная карточка с надписью "Ember-1 vs Gemma 4 12B" и подзаголовком "Меньше токенов на арендованном эндпоинте, или свои собственные веса", над двумя карточками: Ember-1 — "производная Kimi K3" и "нет весов, нет опубликованной цены"; Gemma 4 12B — "11.95B плотная, Apache 2.0" и "256K контекст, мультимодальная".
Guides & Insights

Ember-1 против Gemma 4 12B: один сдаёт вам в аренду меньше токенов, другой отдаёт вам веса

Автор

Magnus Corvin

Дата публикации

Новые модели · 20Все модели
Бенчмарки: Artificial Analysis · обновляется ежедневно
Назад ко всем статьям

Ember-1 и Gemma 4 12B не конкурируют за одну и ту же строку в заказе на закупку, и быстрее всего понять почему, если спросить, чем вы будете владеть в конце каждого месяца. Gemma 4 12B — это плотная мультимодальная модель Google с 11,95 млрд параметров, выпущенная 3 июня 2026 года под лицензией Apache 2.0: вы скачиваете её, и чекпоинт ваш. Ember-1 — специализированная производная Kimi K3 от Moonshot AI, созданная Fireworks Research и опубликованная 23 сентября 2026 года как исследовательский предпросмотр на собственной бессерверной платформе вендора: вы вызываете её, и у вас нет ничего, кроме счёта. Одна — это аргумент об аренде с правом выкупа применительно к токенам; другая — капитальная покупка. Поставьте их рядом, и полезное сравнение не в том, какая модель лучше, потому что ничто из опубликованного не позволяет это решить. А в том, какая из двух форм закупки подходит тому, что вы строите.

Два договора, изложенные простыми словами

Gemma 4 12B — это финальный релиз с открытыми весами. Google публикует веса, архитектуру, таблицу бенчмарков и лицензию, а сообщество сред выполнения — llama.cpp, vLLM, MLX, SGLang, Transformers — запускает её на подконтрольном вам оборудовании. Стоимость токена после покупки — это электроэнергия и амортизация, а не отдельная статья расходов от поставщика. Взамен вы отказываетесь от того, что всегда является платой за открытые веса: планирование мощностей ложится на вас, а потолок качества ограничен 11,95 млрд параметров.

Ember-1 — это обратный случай. Веса скачивать не нужно — она существует как вариант обслуживания на собственной платформе вендора — и опубликованной цены у неё нет. Вместо этого она предлагает более узкое утверждение, реализуемое поверх гораздо более крупной модели: точность Kimi K3 при примерно на 40% меньшем количестве токенов, затрачиваемых на её достижение. Fireworks Research обучила её специально для того, чтобы сокращать трассировки рассуждений, не меняя ответы, и сообщает, что длину рассуждений можно сократить на 35–50% без потери точности на семи бенчмарках и в двух производственных A/B-тестах заказчиков. Все эти цифры заявлены вендором и не воспроизведены.

A two-column scoreboard titled "Ember-1 vs Gemma 4 12B — the scoreboard" comparing six dimensions. Ember-1: a Kimi K3 derivative retrained for shorter reasoning; no published weights; context not published (base model 1M); text-only input; price not published, preview only; evidence is vendor benchmarks plus two vendor-run A/B tests. Gemma 4 12B: a dense 11.95B multimodal generalist; Apache 2.0 weights, downloadable; 256K-token context; text, image and audio input; free to download with hardware costs; evidence is Google evaluations plus an independent local-run ecosystem.

Ценность аргумента о токенах целиком зависит от того, кто платит за токены

Коммерческое предложение Ember-1 исходит из оплаты за токен. Это допущение верно для той аудитории, на которую оно рассчитано, — команд, которые запускают длинные агентные циклы на хостинговой фронтир-модели, где, как отмечает Fireworks Research, Kimi K3 может расходовать более 90% сгенерированных токенов на внутренние рассуждения и где каждый ход воспроизводит предыдущие, так что более ранние рассуждения считываются и оплачиваются заново. В таких условиях сокращение длины трассы — это прямое сокращение ежемесячного счёта, и результат A/B-теста в 29,9 тыс. выходных токенов против 49,3 тыс. у K3 — именно та цифра, которая имеет значение.

Примените ту же модель к условиям Gemma 4 12B — и аргумент рассыплется. Когда вы развёртываете чекпойнт Apache-2.0 на собственном сервере, дополнительные токены рассуждений стоят реального времени и занятости GPU, а не долларов за миллион. Подробная трассировка рассуждений на вашем собственном ноутбуке с 16 ГБ — это более медленный ответ, а не более крупный счёт. Это не делает неэффективность безобидной — в цикле агента она всё ещё накапливается и всё ещё проявляется как задержка, — но обменный курс другой, и воспринимать сокращение числа токенов на 40% как 40%-ную экономию на собственном оборудовании — это категориальная ошибка.

Спецификация: по одной строке на каждый размер.

• Что это — Ember-1: производная Kimi K3 в статусе research preview, переобученная для более коротких рассуждений. Gemma 4 12B: плотная мультимодальная модель с открытыми весами на 11,95 млрд параметров из семейства Gemma 4 от Google.

• Веса — Ember-1: не опубликованы; предоставляются только через платформу вендора. Gemma 4 12B: Apache 2.0, доступна для скачивания, без ограничений.

• Размер — Ember-1: не раскрыт; унаследован от архитектуры Kimi K3. Gemma 4 12B: 11,95 млрд параметров, плотная, 48 слоёв, примерно 18 ГБ весов в BF16.

• Контекстное окно — Ember-1: не опубликовано для предварительного просмотра; её базовая модель вмещает 1 048 576 токенов. Gemma 4 12B: 256 тыс. токенов.

• Входные данные — Ember-1: текст. Gemma 4 12B: текст, изображение и аудио благодаря унифицированной архитектуре без энкодера, при этом некоторые источники упоминают видео.

• Цена — Ember-1: ничего не опубликовано; доллары в таблице бенчмарка рассчитаны по тарифной карте Kimi K3. Gemma 4 12B: бесплатно скачать; вы платите за оборудование.

• Минимальные требования к оборудованию — Ember-1: что бы вендор ни запланировал. Gemma 4 12B: 16 ГБ видеопамяти или унифицированной памяти, согласно позиционированию Google.

• Доказательства — Ember-1: вендорские бенчмарки и два A/B-теста, проведённых вендором, без воспроизведения. Gemma 4 12B: оценки, о которых сообщила Goog​le, плюс независимая экосистема локальных запусков.

Что публикует Gemma 4 12B и как она читает

Собственные цифры Google для Gemma 4 12B ставят её между предназначенной для edge-устройств Gemma 4 E4B и более крупной 26B MoE: GPQA Diamond 78,8%, MMLU Pro 77,2%, AIME 2026 без инструментов 77,5%, LiveCodeBench v6 72,0, Codeforces ELO 1659, τ-2 в среднем 69,0%, MMMU Pro 69,1%, DocVQA 94,9 и BigBench Extra Hard 53,0%. Эти показатели тоже заявлены производителем — Google провела оценку собственной модели и опубликовала таблицу — но у них есть преимущество: они описывают чекпойнт, который любой может скачать и повторно запустить, и именно поэтому заявления о моделях с открытыми весами обычно быстро получают подтверждение от третьих сторон, а заявления о закрытых превью — нет.

Фактическое отличие модели — структурное, а не численное. У Gemma 4 12B нет отдельного визуального или аудиоэнкодера: патчи изображения и звуковые волны проецируются напрямую в пространство токенов — именно это позволяет 12B-модели вообще принимать скриншот или запись на вход. Она также поставляется с драфтерами многотокенного предсказания для спекулятивного декодирования — это функция, влияющая на задержку, а не на качество; именно это важно, когда вы запускаете модель сами и платите за каждую миллисекунду префилла.

Где эти двое на самом деле сталкиваются

Обе модели позиционируются для агентного программирования и использования инструментов, и это единственная область, где существует реальный выбор. Показатель Ember-1 в Terminal Bench 2.1 составляет 82,0% против 80,9% у Kimi K3 Max, при этом на 51,9% меньше токенов; его результат в SWE-bench Verified — 92,2% против 93,2% у K3 Max. У Gemma 4 12B вообще нет показателей Terminal Bench или SWE-bench в опубликованном наборе Google — его агентное свидетельство — τ-2 на уровне 69,0%. Таким образом, вы не можете сопоставить эти две модели на общем бенчмарке, и любая статья, которая это делает, выдумывает сравнение.

Можно сказать так: они находятся в разных точках кривой затрат. Если ваша нагрузка агента работает с хостируемой фронтирной моделью и счёт в основном формируется токенами рассуждений, Ember-1 атакует именно этот компонент — ценой двухнедельного окна доступа и отсутствия опубликованного тарифа. Если ваша нагрузка должна работать на контролируемом вами оборудовании, обрабатывать скриншот или пережить ситуацию, когда поставщик решит не продолжать предварительный доступ, Gemma 4 12B — единственная из двух, которая вообще отвечает на этот вопрос.

A screenshot of the Hugging Face model card for google/gemma-4-12B, showing 97,559 downloads in the last month, a safetensors model size of 12B parameters in BF16, the Apache 2.0 licence, any-to-any modality, and a model tree listing 7 adapters, 62 fine-tunes and 49 quantizations. The Inference Providers panel reads "This model isn't deployed by any Inference Provider."

Срединный путь, и где его найти

Есть третий вариант, вокруг которого не выстроен маркетинг ни одной из моделей: использовать старшие модели линейки Gemma 4 как облачную половину гибрида. OrcaRouter маршрутизирует Google Gemma 4 26B-A4B и Gemma 4 31B наряду с ещё 200+ другими моделями через единый API по прайсовой цене провайдера с наценкой 0%, так что один и тот же ключ, который даёт доступ к Gemma среднего размера, открывает и передовые модели, для которых иначе потребовался бы отдельный контракт. Сама Gemma 4 12B на нашей платформе отсутствует, и Ember-1 тоже — если вам нужна 12B локально, скачайте её; а если вы хотите сначала проверить, закрывает ли более крупная Gemma этот разрыв, такая проверка обойдётся в один эндпоинт.

Такая организация — это также честный способ оценивать исследовательский предпросмотр. Автоматическое аварийное переключение между провайдерами означает, что модель, исчезающая из окна предпросмотра, не утянет за собой ваше приложение, — а это именно тот риск, который создаёт статус выпуска Ember-1, и именно тот риск, которого не касается ничто в её таблице бенчмарков.

Какой из них должен быть в вашей дорожной карте?

Выберите Gemma 4 12B, если владение является обязательным требованием — конфиденциальность, работа в автономном режиме, фиксированный минимальный уровень затрат или продукт, который должен продолжать работать, если поставщик передумает. Его заявленный потолок ниже, чем у фронтирного производного, а его мультимодальный ввод действительно является отличительной чертой, и ни один из этих фактов не зависит от чужой дорожной карты.

Выбирайте Ember-1, если ваша проблема — оплата за токены при длительных запусках агентов, и вы можете принять на себя риск предварительной версии. Запустите его в теневом режиме параллельно с вашим текущим решением в течение имеющихся у вас двух недель, измерьте количество токенов на завершённую задачу на вашем собственном трафике и рассматривайте эти 40% как гипотезу, а не как показатель. Чего вам делать не следует — выбирать между ними по качеству, потому что никто — включая лабораторию, создавшую Ember-1, — не опубликовал сравнение, которое позволило бы вам это сделать.

A screenshot of OrcaRouter's model page for Gemma 4 31B, showing the google/gemma-4-31b-it listing priced at $0.13 per 1M input tokens and $0.38 per 1M output tokens, a p50 time-to-first-token of 1.44s, 375.3K tokens of traffic over seven days, a 256K-token context window and a Python snippet calling api.orcarouter.ai/v1.

Более важный момент в том, что эти два релиза представляют два способа, которыми возможности продаются в конце 2026 года. Одна лаборатория публикует чекпойнт и позволяет экосистеме самой найти свой уровень; другая берёт модель, обученную кем-то другим, улучшает одну из осей её поведения и продаёт это улучшение как услугу. Оба подхода законны, и терпят неудачу они по-разному: открытые веса дают сбой медленно и публично, а превью — внезапно и по объявлению.

Сравнение в этой статье1

Определено по этой статье · Бенчмарки: Artificial Analysis · обновляется ежедневно