Сгенерированная титульная карточка с надписью «Ember-1 против Qwen3.8-Max» и подзаголовком «Экономная по токенам производная против флагмана», над двумя карточками: Ember-1 — «заявлено на 40% меньше токенов» и «цена не опубликована»; Qwen3.8-Max — «2 доллара за вход, 6 долларов за выход» и «контекст на 1M токенов».
Guides & Insights

Ember-1 против Qwen3.8-Max: экономная по токенам производная против флагмана

Автор

Alistair Wren

Дата публикации

Новые модели · 20Все модели
Бенчмарки: Artificial Analysis · обновляется ежедневно
Назад ко всем статьям

У обеих моделей в этом сравнении есть реальный показатель на одном и том же бенчмарке, и это всё равно ничего не решает. Ember-1 — специализированная производная Kimi K3 от Moonshot AI, опубликованная Fireworks Research 23 сентября 2026 года; она показывает 82,0% на Terminal Bench 2.1, затрачивая примерно вдвое меньше токенов, чем её базовая модель. Qwen3.8-Max — флагман Alibaba: разреженная модель смеси экспертов примерно с 2,4 триллиона параметров, из которых около 95 миллиардов активны на токен, — общедоступна с 3 августа 2026 года и показывает 86,6% на том же бенчмарке. Обе эти цифры заявлены производителями, обе лаборатории использовали собственный стенд, и разрыв в 4,6 пункта между двумя неопубликованными методиками оценки — ещё не приговор. Сравнивать здесь можно только деньги, и именно тут это противостояние становится интересным: весь тезис одной модели в том, что не нужно платить за токены, которые вам не нужны, а другая — флагман по цене $2 за миллион входных и $6 за миллион выходных токенов.

Что на самом деле представляет собой каждая модель

Ember-1 не является новой моделью ни в каком архитектурном смысле. Это Kimi K3, переобученная для более кратких рассуждений, созданная Fireworks Research в ходе более чем 50 обучающих экспериментов и более 200 оценок на собственном бессерверном стеке обучения. Лаборатория утверждает, что рассуждения K3 длиннее, чем требуется для задач, и что избыток можно устранить без изменения ответов — длина рассуждений сократилась на 35–50% без потери точности на семи бенчмарках и в двух производственных A/B-тестах клиентов. Она доступна в виде исследовательского предпросмотра на собственной бессерверной платформе поставщика, без опубликованных весов и без опубликованной цены.

Qwen3.8-Max — это вообще объект иного рода. Это передовой уровень Aliba​ba: нативно мультимодальный для ввода текста, изображений и видео, с контекстным окном в один миллион токенов, обновлявшийся дважды с момента запуска — обновление после дообучения 2 сентября 2026 года, нацеленное на программирование и профессиональную офисную работу, и более быстрый уровень обслуживания, анонсированный 22 сентября 2026 года. Aliba​ba позиционирует Qwen3.8-Max против GPT-5.5, Claude Opus 4.7 и Gemini 3.1 Pro, и опубликованная таблица оценок отражает эти амбиции — GPQA Diamond 92.6, OSWorld-Verified 86.1, SWE-bench Pro 67.7, PaperBench 93.0, IFBench 82.8 и Humanity's Last Exam — 43.6, все данные заявлены производителем.

A two-column scoreboard titled "Ember-1 vs Qwen3.8-Max — the scoreboard" comparing six dimensions. Ember-1: input/output price not published, computed from Kimi K3 rates of $3 and $15; context not published, base model carries 1M; text input; Terminal Bench 2.1 82.0% vendor-reported; research preview with a two-week window; not routed on OrcaRouter. Qwen3.8-Max: $2.00 in and $6.00 out per 1M tokens; 1,000,000-token context; text, image and video input; Terminal Bench 2.1 86.6% vendor-reported; generally available and priced; routed on OrcaRouter. The footer notes both Terminal Bench figures are vendor-reported and were produced on different harnesses.

Тарифные карты, бок о бок

У одного из них есть цена, а у другого нет — это первая практическая асимметрия.

• Ввод — Ember-1: ничего не опубликовано; в таблице бенчмарка доллары рассчитываются по тарифной карте Kimi K3. Qwen3.8-Max: $2,00 за миллион токенов в OrcaRouter.

• Вывод — Ember-1: ничего не опубликовано. Qwen3.8-Max: $6.00 за миллион токенов.

• Кэшированный ввод — Ember-1: не применимо. Qwen3.8-Max: $0.25 за миллион токенов за чтение из кэша, что составляет одну восьмую от ставки за ввод и имеет огромное значение в циклах агентов, где один и тот же контекст отправляется заново на каждом шаге.

• Окно контекста — Ember-1: не опубликовано для предварительной версии; его базовая модель поддерживает 1 048 576 токенов. Qwen3.8-Max: 1 000 000 токенов.

• Мультимодальность — Ember-1: текст. Qwen3.8-Max: текст, изображение и видео на входе, текст на выходе.

• Веса — Ember-1: отсутствуют. Qwen3.8-Max: существует релиз с открытыми весами, но он только текстовый и не имеет полного контекстного окна и визуального ввода, которые есть у обслуживаемого эндпоинта.

• Доступ — Ember-1: исследовательский предпросмотр, двухнедельное окно в бессерверном режиме, постоянство зависит от спроса. Qwen3.8-Max: общедоступна и имеет цену.

Учтите один момент о тарифах Qwen3.8-Max, прежде чем что-либо моделировать: Alibaba неоднократно пересматривала условия пакетирования этой модели с момента запуска, и международная тарифная карта не всегда совпадала с августовской заявленной цифрой. Считайте $2.00 и $6.00 текущей ценой маршрута на нашей платформе — она передаёт прейскурантную цену провайдера без наценки, поэтому изменение у поставщика отражается в тот же день — и проверьте карту, прежде чем выделять на это бюджет.

Почему сравнение бенчмарков не работает

82,0% у Ember-1 и 86,6% у Qwen3.8-Max — оба результата на Terminal Bench 2.1, из-за чего они кажутся сопоставимыми, хотя сопоставимыми не являются. В таблице Ember-1 его показатель указан в сравнении с вариантами Kimi K3, оценёнными Fireworks Research, на 89 примерах с приложенными дельтами по токенам и стоимости. Показатель Qwen3-Max взят из собственной таблицы оценки Alibaba. Разные лаборатории, разные испытательные стенды, разные агентные скаффолды — а в бенчмарке, где оценки меняются на несколько пунктов только от выбора скаффолда, разрыв в 4,6 пункта находится в пределах уровня шума методологии.

Что можно прочитать в таблице Ember-1 — так это столбец токенов, единственное, что модель была обучена менять. По сравнению со своей собственной базовой версией Ember-1 расходует на 51,9 % меньше токенов на Terminal Bench 2.1, на 32,5 % меньше на SWE-Interact, на 23,7 % меньше на DeepSWE 1.1 и всего на 5,9 % меньше на τ-2 Bench Airline. Этот разброс и есть честная главная новость. Модель, которая сокращает обдумывание, очень много стоит на бенчмарках, где базовая модель слишком много думает, и почти ничего — там, где этого не происходит, и вы не можете узнать, с каким типом рабочей нагрузки имеете дело, не измерив собственную.

Стоимость за выполненную задачу, проработанная

Вот расчёт, который фактически определяет это: опубликованные тарифы Kimi K3 используются как замена стоимости Ember-1, поскольку у Ember-1 своих тарифов нет. Kimi K3 — 3,00 доллара за миллион входных токенов, 0,30 доллара за кэшированные и 15,00 доллара за выходные — ровно та тарифная сетка, которую Fireworks Research использовала в своём собственном сравнении. Qwen3.8-Max — 2,00 доллара за вход и 6,00 доллара за выход, а чтение из кэша — 0,25 доллара.

На входе Qwen3.8-Max уже дешевле на треть. На выходе он в 2,5 раза дешевле за токен. Это означает, что сокращение токенов у Ember-1 конкурирует не с фиксированным счётом — оно конкурирует с флагманской моделью, которая дешевле за токен ещё до того, как проводится какая-либо работа по повышению эффективности. Собственный A/B-тест Fireworks Research в продакшене показал падение числа выходных токенов с 49,3K до 29,9K — общее сокращение на 39%; примените это к тарифу Qwen3.8-Max на выходные токены, и вы получите те же 39% экономии, а это меньший абсолютный выигрыш, чем тот же процент, применённый к ставке K3 в $15.

Таким образом, довод в пользу эффективности Ember-1 сильнее всего при сравнении с его собственной базовой моделью, и именно этот довод выдвигает релиз. В сравнении с Qwen3.8-Max сопоставление смещается к возможностям на доллар, где больший контекст флагмана, мультимодальный ввод и платная доступность являются контраргументами — и где никто не опубликовал прямого сравнения, которое могло бы это разрешить.

A screenshot of OrcaRouter's model page for Qwen3.8 Max, showing the qwen/qwen3.8-max listing priced at $2.00 per 1M input tokens and $6.00 per 1M output tokens, a p50 time-to-first-token of 1.98s, 33.3M tokens of traffic over seven days, a 1M-token context window accepting text, image and video, and a Python snippet calling api.orcarouter.ai/v1.

Что показывают наши собственные данные о маршрутизации

Две из трёх моделей, задействованных здесь, — это действующие маршруты на OrcaRouter, что даёт картину, которой нет ни в одной таблице бенчмарков. Qwen3.8-Max обслуживается с контекстом в 1 000 000 токенов, медианной задержкой до первого токена около 2,0 секунды и примерно 52,7 выходных токенов в секунду за последние семь дней, при доле ошибок около 4,2%. Kimi K3 — базовая модель Ember-1 и точка отсчёта для всей экономии, которую заявляет Ember-1, — работает с контекстом 1 048 576 токенов, медианной задержкой около 8,0 секунды, примерно 43,6 выходных токенов в секунду и долей ошибок около 0,27%, при существенно более высоком трафике. Сама Ember-1 не представлена на OrcaRouter.

Эти цифры меняют картину решения. Kimi K3 заметно медленнее выдаёт первый токен и примерно вдвое дороже за выходной токен, чем Qwen3.8-Max, но при этом демонстрирует гораздо более низкий уровень ошибок при значительно более высокой нагрузке. Экономная по токенам производная K3 сокращает разрыв в стоимости, но не закрывает разрыв в задержке, поскольку сокращение рассуждений укорачивает фазу генерации, а не очередь. Если ваша нагрузка чувствительна к задержке, а не к счетам, флагман — лучший выбор на сегодня, и разговоры об эффективности здесь ни при чём.

Какой маршрутизировать

Маршрутизируйте на Qwen3.8-Max, когда вам нужны контекстное окно, мультимодальный ввод, опубликованная цена и сервис, под который можно заложить бюджет. Он надёжнее из двух по своей конструкции: общедоступен, имеет цену и обновлялся дважды за два месяца поставщиком, который известен тем, что поддерживает конечную точку в актуальном состоянии.

Попробуйте Ember-1, когда ваш счёт в основном формируется токенами рассуждений в длинных агентных циклах, а вы работаете с размещённой моделью, а не на собственном оборудовании. Правильный тест — это две недели, которые даёт вам предварительная версия: запустите её в теневом режиме на боевом трафике и измеряйте токены на завершённую задачу, а не токены на запрос. Чего делать не стоит — так это заменять ею флагманскую модель как равноценным аналогом, опираясь на цифру 40%, которая варьируется от 6% до 52% в зависимости от нагрузки.

Если настоящий вопрос — стоит ли вообще продолжать использовать Kimi K3, на него можно ответить уже сегодня, без всякого предпросмотра: и Kimi K3, и Qwen3.8-Max доступны на OrcaRouter по одному ключу, по прайс-листу провайдера без наценки, с автоматическим переключением при сбое между провайдерами. Сравнение стоимости вашей нагрузки на обоих — это изменение маршрутизации, а не проект закупки, и оно даёт вам базовый уровень, который делает любое заявление об эффективности Ember-1 измеримым в ваших собственных цифрах, а не в цифрах лаборатории.

A screenshot of OrcaRouter's model page for Kimi K3, showing the MoonshotAI Kimi K3 listing priced at $3.00 per 1M input tokens and $15.00 per 1M output tokens, a p50 time-to-first-token of 8.00s, 749.2M tokens of traffic over seven days, a 1M-token context window and a Python snippet calling api.orcarouter.ai/v1.

Честное резюме таково: эти две модели оптимизированы под разные ограничения. Qwen3.8-Max создана, чтобы быть самой способной из доступных, и цена у неё соответствующая; Ember-1 создана, чтобы сделать уже дорогую модель дешевле в эксплуатации. Обе по-своему обоснованы, и причина, по которой это противостояние не позволяет вынести однозначный вердикт, в том, что экономия производной модели определяется относительно тарифной сетки, которую флагман существенно обходит по цене.

Сравнение в этой статье2

Определено по этой статье · Бенчмарки: Artificial Analysis · обновляется ежедневно