
Ember-1 против Qwen3.8-Max: экономная по токенам производная против флагмана
- openaiНОВИНКАOpenAI: GPT-6 Luna2026-09-2237Интеллект
- openaiНОВИНКАOpenAI: GPT-6 Sol2026-09-2248Интеллект
- anthropicНОВИНКАAnthropic: Claude Opus 5.52026-09-2258Интеллект
- grokНОВИНКАGrok 4.72026-09-2146Интеллект
- OrcaНОВИНКАOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 за 1 млн токенов · 177 tok/s
- orcaНОВИНКАOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 за 1 млн токенов · 1323 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Интеллект
- openaiOpenAI: GPT-6 Astra2026-09-0453Интеллект77Кодинг
- googleGoogle: Gemini 3.8 Flash2026-09-0241Интеллект76Кодинг
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Интеллект76Кодинг
- anthropicAnthropic: Claude Fable 5.12026-09-0153Интеллект82Кодинг
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 за 1 млн токенов · 108 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Интеллект72Кодинг
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 за 1 млн токенов · 220 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Интеллект75Кодинг
- obsidianQwen3.8 27B2026-08-1534Интеллект68Кодинг
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Интеллект69Кодинг
- grokSpaceXAI: Grok 4.62026-08-1244Интеллект77Кодинг
- metaMeta: Muse Spark 1.22026-08-0540Интеллект72Кодинг
- qwenQwen: Qwen3.8 Max2026-08-0345Интеллект76Кодинг
У обеих моделей в этом сравнении есть реальный показатель на одном и том же бенчмарке, и это всё равно ничего не решает. Ember-1 — специализированная производная Kimi K3 от Moonshot AI, опубликованная Fireworks Research 23 сентября 2026 года; она показывает 82,0% на Terminal Bench 2.1, затрачивая примерно вдвое меньше токенов, чем её базовая модель. Qwen3.8-Max — флагман Alibaba: разреженная модель смеси экспертов примерно с 2,4 триллиона параметров, из которых около 95 миллиардов активны на токен, — общедоступна с 3 августа 2026 года и показывает 86,6% на том же бенчмарке. Обе эти цифры заявлены производителями, обе лаборатории использовали собственный стенд, и разрыв в 4,6 пункта между двумя неопубликованными методиками оценки — ещё не приговор. Сравнивать здесь можно только деньги, и именно тут это противостояние становится интересным: весь тезис одной модели в том, что не нужно платить за токены, которые вам не нужны, а другая — флагман по цене $2 за миллион входных и $6 за миллион выходных токенов.
Что на самом деле представляет собой каждая модель
Ember-1 не является новой моделью ни в каком архитектурном смысле. Это Kimi K3, переобученная для более кратких рассуждений, созданная Fireworks Research в ходе более чем 50 обучающих экспериментов и более 200 оценок на собственном бессерверном стеке обучения. Лаборатория утверждает, что рассуждения K3 длиннее, чем требуется для задач, и что избыток можно устранить без изменения ответов — длина рассуждений сократилась на 35–50% без потери точности на семи бенчмарках и в двух производственных A/B-тестах клиентов. Она доступна в виде исследовательского предпросмотра на собственной бессерверной платформе поставщика, без опубликованных весов и без опубликованной цены.
Qwen3.8-Max — это вообще объект иного рода. Это передовой уровень Alibaba: нативно мультимодальный для ввода текста, изображений и видео, с контекстным окном в один миллион токенов, обновлявшийся дважды с момента запуска — обновление после дообучения 2 сентября 2026 года, нацеленное на программирование и профессиональную офисную работу, и более быстрый уровень обслуживания, анонсированный 22 сентября 2026 года. Alibaba позиционирует Qwen3.8-Max против GPT-5.5, Claude Opus 4.7 и Gemini 3.1 Pro, и опубликованная таблица оценок отражает эти амбиции — GPQA Diamond 92.6, OSWorld-Verified 86.1, SWE-bench Pro 67.7, PaperBench 93.0, IFBench 82.8 и Humanity's Last Exam — 43.6, все данные заявлены производителем.

Тарифные карты, бок о бок
У одного из них есть цена, а у другого нет — это первая практическая асимметрия.
• Ввод — Ember-1: ничего не опубликовано; в таблице бенчмарка доллары рассчитываются по тарифной карте Kimi K3. Qwen3.8-Max: $2,00 за миллион токенов в OrcaRouter.
• Вывод — Ember-1: ничего не опубликовано. Qwen3.8-Max: $6.00 за миллион токенов.
• Кэшированный ввод — Ember-1: не применимо. Qwen3.8-Max: $0.25 за миллион токенов за чтение из кэша, что составляет одну восьмую от ставки за ввод и имеет огромное значение в циклах агентов, где один и тот же контекст отправляется заново на каждом шаге.
• Окно контекста — Ember-1: не опубликовано для предварительной версии; его базовая модель поддерживает 1 048 576 токенов. Qwen3.8-Max: 1 000 000 токенов.
• Мультимодальность — Ember-1: текст. Qwen3.8-Max: текст, изображение и видео на входе, текст на выходе.
• Веса — Ember-1: отсутствуют. Qwen3.8-Max: существует релиз с открытыми весами, но он только текстовый и не имеет полного контекстного окна и визуального ввода, которые есть у обслуживаемого эндпоинта.
• Доступ — Ember-1: исследовательский предпросмотр, двухнедельное окно в бессерверном режиме, постоянство зависит от спроса. Qwen3.8-Max: общедоступна и имеет цену.
Учтите один момент о тарифах Qwen3.8-Max, прежде чем что-либо моделировать: Alibaba неоднократно пересматривала условия пакетирования этой модели с момента запуска, и международная тарифная карта не всегда совпадала с августовской заявленной цифрой. Считайте $2.00 и $6.00 текущей ценой маршрута на нашей платформе — она передаёт прейскурантную цену провайдера без наценки, поэтому изменение у поставщика отражается в тот же день — и проверьте карту, прежде чем выделять на это бюджет.
Почему сравнение бенчмарков не работает
82,0% у Ember-1 и 86,6% у Qwen3.8-Max — оба результата на Terminal Bench 2.1, из-за чего они кажутся сопоставимыми, хотя сопоставимыми не являются. В таблице Ember-1 его показатель указан в сравнении с вариантами Kimi K3, оценёнными Fireworks Research, на 89 примерах с приложенными дельтами по токенам и стоимости. Показатель Qwen3-Max взят из собственной таблицы оценки Alibaba. Разные лаборатории, разные испытательные стенды, разные агентные скаффолды — а в бенчмарке, где оценки меняются на несколько пунктов только от выбора скаффолда, разрыв в 4,6 пункта находится в пределах уровня шума методологии.
Что можно прочитать в таблице Ember-1 — так это столбец токенов, единственное, что модель была обучена менять. По сравнению со своей собственной базовой версией Ember-1 расходует на 51,9 % меньше токенов на Terminal Bench 2.1, на 32,5 % меньше на SWE-Interact, на 23,7 % меньше на DeepSWE 1.1 и всего на 5,9 % меньше на τ-2 Bench Airline. Этот разброс и есть честная главная новость. Модель, которая сокращает обдумывание, очень много стоит на бенчмарках, где базовая модель слишком много думает, и почти ничего — там, где этого не происходит, и вы не можете узнать, с каким типом рабочей нагрузки имеете дело, не измерив собственную.
Стоимость за выполненную задачу, проработанная
Вот расчёт, который фактически определяет это: опубликованные тарифы Kimi K3 используются как замена стоимости Ember-1, поскольку у Ember-1 своих тарифов нет. Kimi K3 — 3,00 доллара за миллион входных токенов, 0,30 доллара за кэшированные и 15,00 доллара за выходные — ровно та тарифная сетка, которую Fireworks Research использовала в своём собственном сравнении. Qwen3.8-Max — 2,00 доллара за вход и 6,00 доллара за выход, а чтение из кэша — 0,25 доллара.
На входе Qwen3.8-Max уже дешевле на треть. На выходе он в 2,5 раза дешевле за токен. Это означает, что сокращение токенов у Ember-1 конкурирует не с фиксированным счётом — оно конкурирует с флагманской моделью, которая дешевле за токен ещё до того, как проводится какая-либо работа по повышению эффективности. Собственный A/B-тест Fireworks Research в продакшене показал падение числа выходных токенов с 49,3K до 29,9K — общее сокращение на 39%; примените это к тарифу Qwen3.8-Max на выходные токены, и вы получите те же 39% экономии, а это меньший абсолютный выигрыш, чем тот же процент, применённый к ставке K3 в $15.
Таким образом, довод в пользу эффективности Ember-1 сильнее всего при сравнении с его собственной базовой моделью, и именно этот довод выдвигает релиз. В сравнении с Qwen3.8-Max сопоставление смещается к возможностям на доллар, где больший контекст флагмана, мультимодальный ввод и платная доступность являются контраргументами — и где никто не опубликовал прямого сравнения, которое могло бы это разрешить.

Что показывают наши собственные данные о маршрутизации
Две из трёх моделей, задействованных здесь, — это действующие маршруты на OrcaRouter, что даёт картину, которой нет ни в одной таблице бенчмарков. Qwen3.8-Max обслуживается с контекстом в 1 000 000 токенов, медианной задержкой до первого токена около 2,0 секунды и примерно 52,7 выходных токенов в секунду за последние семь дней, при доле ошибок около 4,2%. Kimi K3 — базовая модель Ember-1 и точка отсчёта для всей экономии, которую заявляет Ember-1, — работает с контекстом 1 048 576 токенов, медианной задержкой около 8,0 секунды, примерно 43,6 выходных токенов в секунду и долей ошибок около 0,27%, при существенно более высоком трафике. Сама Ember-1 не представлена на OrcaRouter.
Эти цифры меняют картину решения. Kimi K3 заметно медленнее выдаёт первый токен и примерно вдвое дороже за выходной токен, чем Qwen3.8-Max, но при этом демонстрирует гораздо более низкий уровень ошибок при значительно более высокой нагрузке. Экономная по токенам производная K3 сокращает разрыв в стоимости, но не закрывает разрыв в задержке, поскольку сокращение рассуждений укорачивает фазу генерации, а не очередь. Если ваша нагрузка чувствительна к задержке, а не к счетам, флагман — лучший выбор на сегодня, и разговоры об эффективности здесь ни при чём.
Какой маршрутизировать
Маршрутизируйте на Qwen3.8-Max, когда вам нужны контекстное окно, мультимодальный ввод, опубликованная цена и сервис, под который можно заложить бюджет. Он надёжнее из двух по своей конструкции: общедоступен, имеет цену и обновлялся дважды за два месяца поставщиком, который известен тем, что поддерживает конечную точку в актуальном состоянии.
Попробуйте Ember-1, когда ваш счёт в основном формируется токенами рассуждений в длинных агентных циклах, а вы работаете с размещённой моделью, а не на собственном оборудовании. Правильный тест — это две недели, которые даёт вам предварительная версия: запустите её в теневом режиме на боевом трафике и измеряйте токены на завершённую задачу, а не токены на запрос. Чего делать не стоит — так это заменять ею флагманскую модель как равноценным аналогом, опираясь на цифру 40%, которая варьируется от 6% до 52% в зависимости от нагрузки.
Если настоящий вопрос — стоит ли вообще продолжать использовать Kimi K3, на него можно ответить уже сегодня, без всякого предпросмотра: и Kimi K3, и Qwen3.8-Max доступны на OrcaRouter по одному ключу, по прайс-листу провайдера без наценки, с автоматическим переключением при сбое между провайдерами. Сравнение стоимости вашей нагрузки на обоих — это изменение маршрутизации, а не проект закупки, и оно даёт вам базовый уровень, который делает любое заявление об эффективности Ember-1 измеримым в ваших собственных цифрах, а не в цифрах лаборатории.

Честное резюме таково: эти две модели оптимизированы под разные ограничения. Qwen3.8-Max создана, чтобы быть самой способной из доступных, и цена у неё соответствующая; Ember-1 создана, чтобы сделать уже дорогую модель дешевле в эксплуатации. Обе по-своему обоснованы, и причина, по которой это противостояние не позволяет вынести однозначный вердикт, в том, что экономия производной модели определяется относительно тарифной сетки, которую флагман существенно обходит по цене.
Сравнение в этой статье2
Определено по этой статье · Бенчмарки: Artificial Analysis · обновляется ежедневно
