
Ember-1 против Gemma 4 12B: один сдаёт вам в аренду меньше токенов, другой отдаёт вам веса
- openaiНОВИНКАOpenAI: GPT-6 Luna2026-09-2237Интеллект
- openaiНОВИНКАOpenAI: GPT-6 Sol2026-09-2248Интеллект
- anthropicНОВИНКАAnthropic: Claude Opus 5.52026-09-2258Интеллект
- grokНОВИНКАGrok 4.72026-09-2146Интеллект
- OrcaНОВИНКАOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 за 1 млн токенов · 177 tok/s
- orcaНОВИНКАOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 за 1 млн токенов · 1323 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Интеллект
- openaiOpenAI: GPT-6 Astra2026-09-0453Интеллект77Кодинг
- googleGoogle: Gemini 3.8 Flash2026-09-0241Интеллект76Кодинг
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Интеллект76Кодинг
- anthropicAnthropic: Claude Fable 5.12026-09-0153Интеллект82Кодинг
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 за 1 млн токенов · 108 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Интеллект72Кодинг
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 за 1 млн токенов · 220 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Интеллект75Кодинг
- obsidianQwen3.8 27B2026-08-1534Интеллект68Кодинг
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Интеллект69Кодинг
- grokSpaceXAI: Grok 4.62026-08-1244Интеллект77Кодинг
- metaMeta: Muse Spark 1.22026-08-0540Интеллект72Кодинг
- qwenQwen: Qwen3.8 Max2026-08-0345Интеллект76Кодинг
Ember-1 и Gemma 4 12B не конкурируют за одну и ту же строку в заказе на закупку, и быстрее всего понять почему, если спросить, чем вы будете владеть в конце каждого месяца. Gemma 4 12B — это плотная мультимодальная модель Google с 11,95 млрд параметров, выпущенная 3 июня 2026 года под лицензией Apache 2.0: вы скачиваете её, и чекпоинт ваш. Ember-1 — специализированная производная Kimi K3 от Moonshot AI, созданная Fireworks Research и опубликованная 23 сентября 2026 года как исследовательский предпросмотр на собственной бессерверной платформе вендора: вы вызываете её, и у вас нет ничего, кроме счёта. Одна — это аргумент об аренде с правом выкупа применительно к токенам; другая — капитальная покупка. Поставьте их рядом, и полезное сравнение не в том, какая модель лучше, потому что ничто из опубликованного не позволяет это решить. А в том, какая из двух форм закупки подходит тому, что вы строите.
Два договора, изложенные простыми словами
Gemma 4 12B — это финальный релиз с открытыми весами. Google публикует веса, архитектуру, таблицу бенчмарков и лицензию, а сообщество сред выполнения — llama.cpp, vLLM, MLX, SGLang, Transformers — запускает её на подконтрольном вам оборудовании. Стоимость токена после покупки — это электроэнергия и амортизация, а не отдельная статья расходов от поставщика. Взамен вы отказываетесь от того, что всегда является платой за открытые веса: планирование мощностей ложится на вас, а потолок качества ограничен 11,95 млрд параметров.
Ember-1 — это обратный случай. Веса скачивать не нужно — она существует как вариант обслуживания на собственной платформе вендора — и опубликованной цены у неё нет. Вместо этого она предлагает более узкое утверждение, реализуемое поверх гораздо более крупной модели: точность Kimi K3 при примерно на 40% меньшем количестве токенов, затрачиваемых на её достижение. Fireworks Research обучила её специально для того, чтобы сокращать трассировки рассуждений, не меняя ответы, и сообщает, что длину рассуждений можно сократить на 35–50% без потери точности на семи бенчмарках и в двух производственных A/B-тестах заказчиков. Все эти цифры заявлены вендором и не воспроизведены.

Ценность аргумента о токенах целиком зависит от того, кто платит за токены
Коммерческое предложение Ember-1 исходит из оплаты за токен. Это допущение верно для той аудитории, на которую оно рассчитано, — команд, которые запускают длинные агентные циклы на хостинговой фронтир-модели, где, как отмечает Fireworks Research, Kimi K3 может расходовать более 90% сгенерированных токенов на внутренние рассуждения и где каждый ход воспроизводит предыдущие, так что более ранние рассуждения считываются и оплачиваются заново. В таких условиях сокращение длины трассы — это прямое сокращение ежемесячного счёта, и результат A/B-теста в 29,9 тыс. выходных токенов против 49,3 тыс. у K3 — именно та цифра, которая имеет значение.
Примените ту же модель к условиям Gemma 4 12B — и аргумент рассыплется. Когда вы развёртываете чекпойнт Apache-2.0 на собственном сервере, дополнительные токены рассуждений стоят реального времени и занятости GPU, а не долларов за миллион. Подробная трассировка рассуждений на вашем собственном ноутбуке с 16 ГБ — это более медленный ответ, а не более крупный счёт. Это не делает неэффективность безобидной — в цикле агента она всё ещё накапливается и всё ещё проявляется как задержка, — но обменный курс другой, и воспринимать сокращение числа токенов на 40% как 40%-ную экономию на собственном оборудовании — это категориальная ошибка.
Спецификация: по одной строке на каждый размер.
• Что это — Ember-1: производная Kimi K3 в статусе research preview, переобученная для более коротких рассуждений. Gemma 4 12B: плотная мультимодальная модель с открытыми весами на 11,95 млрд параметров из семейства Gemma 4 от Google.
• Веса — Ember-1: не опубликованы; предоставляются только через платформу вендора. Gemma 4 12B: Apache 2.0, доступна для скачивания, без ограничений.
• Размер — Ember-1: не раскрыт; унаследован от архитектуры Kimi K3. Gemma 4 12B: 11,95 млрд параметров, плотная, 48 слоёв, примерно 18 ГБ весов в BF16.
• Контекстное окно — Ember-1: не опубликовано для предварительного просмотра; её базовая модель вмещает 1 048 576 токенов. Gemma 4 12B: 256 тыс. токенов.
• Входные данные — Ember-1: текст. Gemma 4 12B: текст, изображение и аудио благодаря унифицированной архитектуре без энкодера, при этом некоторые источники упоминают видео.
• Цена — Ember-1: ничего не опубликовано; доллары в таблице бенчмарка рассчитаны по тарифной карте Kimi K3. Gemma 4 12B: бесплатно скачать; вы платите за оборудование.
• Минимальные требования к оборудованию — Ember-1: что бы вендор ни запланировал. Gemma 4 12B: 16 ГБ видеопамяти или унифицированной памяти, согласно позиционированию Google.
• Доказательства — Ember-1: вендорские бенчмарки и два A/B-теста, проведённых вендором, без воспроизведения. Gemma 4 12B: оценки, о которых сообщила Google, плюс независимая экосистема локальных запусков.
Что публикует Gemma 4 12B и как она читает
Собственные цифры Google для Gemma 4 12B ставят её между предназначенной для edge-устройств Gemma 4 E4B и более крупной 26B MoE: GPQA Diamond 78,8%, MMLU Pro 77,2%, AIME 2026 без инструментов 77,5%, LiveCodeBench v6 72,0, Codeforces ELO 1659, τ-2 в среднем 69,0%, MMMU Pro 69,1%, DocVQA 94,9 и BigBench Extra Hard 53,0%. Эти показатели тоже заявлены производителем — Google провела оценку собственной модели и опубликовала таблицу — но у них есть преимущество: они описывают чекпойнт, который любой может скачать и повторно запустить, и именно поэтому заявления о моделях с открытыми весами обычно быстро получают подтверждение от третьих сторон, а заявления о закрытых превью — нет.
Фактическое отличие модели — структурное, а не численное. У Gemma 4 12B нет отдельного визуального или аудиоэнкодера: патчи изображения и звуковые волны проецируются напрямую в пространство токенов — именно это позволяет 12B-модели вообще принимать скриншот или запись на вход. Она также поставляется с драфтерами многотокенного предсказания для спекулятивного декодирования — это функция, влияющая на задержку, а не на качество; именно это важно, когда вы запускаете модель сами и платите за каждую миллисекунду префилла.
Где эти двое на самом деле сталкиваются
Обе модели позиционируются для агентного программирования и использования инструментов, и это единственная область, где существует реальный выбор. Показатель Ember-1 в Terminal Bench 2.1 составляет 82,0% против 80,9% у Kimi K3 Max, при этом на 51,9% меньше токенов; его результат в SWE-bench Verified — 92,2% против 93,2% у K3 Max. У Gemma 4 12B вообще нет показателей Terminal Bench или SWE-bench в опубликованном наборе Google — его агентное свидетельство — τ-2 на уровне 69,0%. Таким образом, вы не можете сопоставить эти две модели на общем бенчмарке, и любая статья, которая это делает, выдумывает сравнение.
Можно сказать так: они находятся в разных точках кривой затрат. Если ваша нагрузка агента работает с хостируемой фронтирной моделью и счёт в основном формируется токенами рассуждений, Ember-1 атакует именно этот компонент — ценой двухнедельного окна доступа и отсутствия опубликованного тарифа. Если ваша нагрузка должна работать на контролируемом вами оборудовании, обрабатывать скриншот или пережить ситуацию, когда поставщик решит не продолжать предварительный доступ, Gemma 4 12B — единственная из двух, которая вообще отвечает на этот вопрос.

Срединный путь, и где его найти
Есть третий вариант, вокруг которого не выстроен маркетинг ни одной из моделей: использовать старшие модели линейки Gemma 4 как облачную половину гибрида. OrcaRouter маршрутизирует Google Gemma 4 26B-A4B и Gemma 4 31B наряду с ещё 200+ другими моделями через единый API по прайсовой цене провайдера с наценкой 0%, так что один и тот же ключ, который даёт доступ к Gemma среднего размера, открывает и передовые модели, для которых иначе потребовался бы отдельный контракт. Сама Gemma 4 12B на нашей платформе отсутствует, и Ember-1 тоже — если вам нужна 12B локально, скачайте её; а если вы хотите сначала проверить, закрывает ли более крупная Gemma этот разрыв, такая проверка обойдётся в один эндпоинт.
Такая организация — это также честный способ оценивать исследовательский предпросмотр. Автоматическое аварийное переключение между провайдерами означает, что модель, исчезающая из окна предпросмотра, не утянет за собой ваше приложение, — а это именно тот риск, который создаёт статус выпуска Ember-1, и именно тот риск, которого не касается ничто в её таблице бенчмарков.
Какой из них должен быть в вашей дорожной карте?
Выберите Gemma 4 12B, если владение является обязательным требованием — конфиденциальность, работа в автономном режиме, фиксированный минимальный уровень затрат или продукт, который должен продолжать работать, если поставщик передумает. Его заявленный потолок ниже, чем у фронтирного производного, а его мультимодальный ввод действительно является отличительной чертой, и ни один из этих фактов не зависит от чужой дорожной карты.
Выбирайте Ember-1, если ваша проблема — оплата за токены при длительных запусках агентов, и вы можете принять на себя риск предварительной версии. Запустите его в теневом режиме параллельно с вашим текущим решением в течение имеющихся у вас двух недель, измерьте количество токенов на завершённую задачу на вашем собственном трафике и рассматривайте эти 40% как гипотезу, а не как показатель. Чего вам делать не следует — выбирать между ними по качеству, потому что никто — включая лабораторию, создавшую Ember-1, — не опубликовал сравнение, которое позволило бы вам это сделать.

Более важный момент в том, что эти два релиза представляют два способа, которыми возможности продаются в конце 2026 года. Одна лаборатория публикует чекпойнт и позволяет экосистеме самой найти свой уровень; другая берёт модель, обученную кем-то другим, улучшает одну из осей её поведения и продаёт это улучшение как услугу. Оба подхода законны, и терпят неудачу они по-разному: открытые веса дают сбой медленно и публично, а превью — внезапно и по объявлению.
Сравнение в этой статье1
Определено по этой статье · Бенчмарки: Artificial Analysis · обновляется ежедневно
