Сгенерированная титульная карточка с надписью «Ember-1», подзаголовком «Качество Kimi K3, примерно на 40% меньше токенов рассуждений» и тремя карточками: сокращение рассуждений 35–50%, Terminal Bench 2.1 82,0%, релиз — исследовательская предварительная версия. В нижнем колонтитуле: показатели, заявленные Fireworks, не воспроизведены; опубликовано 23 сентября 2026 г.
Guides & Insights

Ember-1 урезает рассуждения Kimi K3 на 40% — и вся суть кроется в деталях

Автор

Alistair Wren

Дата публикации

Новые модели · 20Все модели
Бенчмарки: Artificial Analysis · обновляется ежедневно
Назад ко всем статьям

Число, которое будут цитировать, — 40%. Fireworks Research опубликовала Ember-1 23 сентября 2026 года, описав её как специализированный производный вариант Kimi K3 от Moonshot AI, который сохраняет точность K3, затрачивая примерно на 40% меньше токенов для достижения того же результата. Это реальное и необычайно конкретное заявление, и оно сопровождается тремя вещами: полной таблицей бенчмарков со столбцами сокращения токенов, двумя клиентскими A/B-тестами из продакшен-трафика программирования и статусом выпуска, который не является общедоступным релизом. Ember-1 выпущена в режиме исследовательского превью на собственной бессерверной платформе вендора, с двухнедельным окном доступа и решением о постоянном статусе, зависящим от спроса. Понять, какая часть этого — выпущенный продукт, а какая — хорошо аргументированный результат исследования, — в этом и заключается вся суть.

Есть также совпадение названий, которое стоит прояснить прежде всего. Отдельный открытый исследовательский проект под названием Ember (v0.1.5, от Slow Lit Labs) посвятил 2026 год публикации оценок долгосрочной когерентности, и он никак не связан с этой моделью. Всё, что вы читаете о том, что Ember не смог обойти Qwen3-8B при сопоставимых настройках инференса, относится к тому проекту. Ember-1, о котором здесь идёт речь, — это производная Kimi K3 от Fireworks Research.

Что на самом деле представляет собой Ember-1

Ember-1 — это не новая архитектура и не новая базовая модель. Это Kimi K3, переобученная для более кратких рассуждений. Fireworks Research провела более 50 обучающих экспериментов и свыше 200 оценок на собственном бессерверном стеке обучения, охватывающих математику, программирование, следование инструкциям, разговор, поиск, использование инструментов и разработку программного обеспечения, с явной целью удаления рассуждений, не влияющих на ответ. Лаборатория утверждает, что длину рассуждений можно сократить на 35–50% без потери точности на семи бенчмарках и двух наборах продакшн-трафика клиентов. Все эти цифры сообщены поставщиком и не были независимо воспроизведены; ни одна третья сторона не опубликовала результатов запуска Ember-1 на момент написания.

Формулировка здесь важна, потому что очевидная альтернатива уже существовала. Kimi K3 поставляется с настройками усилий для рассуждений, и дешёвый способ расходовать меньше токенов — снизить усилие. Fireworks Research говорит, что попробовала так сделать, и низкая настройка слишком сильно проигрывала в качестве — знакомый результат для всякого, кто настраивал уровни усилий у модели рассуждений. Утверждение Ember-1 состоит в том, что регулятор усилий грубый, а переобучение — тонкая настройка.

A single-column scoreboard titled "Ember-1 — the scoreboard": base model Kimi K3 (Moonshot AI); what changed, shorter reasoning with the same answers; token reduction claimed 35-50% across seven benchmarks; Terminal Bench 2.1 82.0% against K3 Max 80.9%; SWE-bench Verified 92.2% against K3 Max 93.2%; weights and price, none published — research preview. The footer states every figure is Fireworks-reported and unreproduced.

Почему токены рассуждения стоят таких усилий

Счёт модели рассуждений определяется не её ответом. Fireworks Research отмечает, что K3 может потратить более 90% сгенерированных токенов на внутренние рассуждения, прежде чем напишет что-либо, что увидит пользователь. В рамках одного запроса это всего лишь дорого. В многоходовом цикле агента это накапливается, потому что каждый ход воспроизводит предыдущий разговор, поэтому следы рассуждений из более ранних ходов перечитываются и повторно тарифицируются при каждом последующем вызове. Fireworks Research описывает рост контекста примерно квадратично по числу ходов. Это и есть фактическая цель данного релиза, и поэтому главная метрика — примерно на 40% меньше токенов, а не скачок качества.

Этот механизм также объясняет риск. Сжатие, убирающее бесполезные размышления, ничего не стоит; сжатие, убирающее шаг, который был нужен модели, — нет. Широко описанный режим отказа при чрезмерно агрессивном сокращении рассуждений — это модель, которая пропускает промежуточную проверку и делает поспешный вывод; в агенте это проявляется гораздо позже в виде неправильного вызова инструмента, а не неправильной фразы. Повторяющийся акцент Fireworks Research на эквивалентном качестве читается как ответ на это опасение, а цифры A/B — это самое близкое к доказательству в его пользу, с обычной оговоркой, что тестовые наборы, критерии прохождения и размеры выборок были выбраны стороной, делающей это заявление.

Таблица бенчмарка с прикреплёнными сведениями о происхождении.

Это данные Fireworks Research, которые не были воспроизведены. Правая колонка — это то, что стоит внимательно прочитать: в ней каждая оценка сопоставлена с тем, сколько токенов и долларов потребовалось относительно K3 Max.

• Terminal Bench 2.1 (n=89) — Ember-1 82,0% против K3 Max 80,9%, K3 High 77,6%, K3 Low 76,4%; на 51,9% меньше токенов, на $23,10 меньше за задачу.

• SWE-bench Verified (n=500) — Ember-1 92,2% против K3 Max 93,2%; на 15,5% меньше токенов, на $68,10 меньше за задачу.

• SWE-Interact (n=75) — Ember-1 20,0 % против K3 Max 21,3 %, K3 High 13,3 %, K3 Low 6,7 %; на 32,5 % меньше токенов.

• DeepSWE 1.1 (n=113) — Ember-1 75,2% против K3 Max 66,4%; на 23,7% меньше токенов и на 126,90 $ меньше на одну задачу.

• τ-2 Bench Airline (n=50) — Ember-1 66% против K3 Max 64%, K3 High и Low — оба 64%; на 5,9% меньше токенов, на $0,30 меньше за задачу.

Две вещи бросаются в глаза. Во-первых, Ember-1 одерживает безоговорочную победу на Terminal Bench 2.1 и DeepSWE 1.1, но немного уступает на SWE-bench Verified и SWE-Interact — картина, согласующаяся с моделью, которая не столько утратила способности, сколько изменила, на какие задачи тратит обдумывание. Во-вторых, экономия токенов крайне неравномерна: 51,9% на Terminal Bench против 5,9% на τ-2 Airline. Чему бы ни научилась Ember-1, это не единообразное 40-процентное урезание размышлений. «Около 40%» в заголовке — это среднее по разбросу, который простирается примерно от 6% до примерно 52%, и команде, чья рабочая нагрузка похожа на τ-2 Airline, не стоит ожидать, что она это ощутит.

Продакшн A/B-тесты — более убедительное свидетельство, именно потому что они не создавались как бенчмарки. В одной клиентской рабочей нагрузке по программированию Ember-1 набрал 0,753 против 0,751 у K3, выполнил 21,4 шага против 23,8 и выдал 29,9K выходных токенов против 49,3K — сокращение токенов рассуждений на 71,3% и общего числа токенов на 39% при примерно сопоставимом качестве. У второго клиента было примерно на 35% меньше токенов на задачу при сопоставимом качестве, и Fireworks Research говорит, что сначала опробовала этот переход на собственном внутреннем трафике программирования и совместной работы, и, согласно сообщаемым результатам, никто не заметил. Относитесь ко всему этому как к данным от поставщика, но как к самой сильной форме данных от поставщика: данными о предпочтениях в A/B-тестах и выполнении задач сложнее манипулировать, чем таблицей лидеров.

Есть ещё одна оценка — на Doximity's Bedside Bench, где 500 проверенных врачами клинических случаев по десяти категориям, — в которой Fireworks Research утверждает, что Ember-1 установил новую границу Парето по стоимости за задачу, сравнивая его с открытыми и закрытыми моделями, включая GPT-5.6 Sol, GPT-6 Astra и Claude Opus 5. Это заявление вендора о позиции на границе Парето, а такое заявление касается двумерного компромисса, а не единой оценки, и оно ровно настолько надёжно, насколько надёжны предположения о стоимости, лежащие в его основе. Эти предположения взяты из публичного тарифного листа API Kimi K3. Что подводит нас к той части истории, которую читатель действительно может проверить сегодня.

A screenshot of OrcaRouter's model page for Kimi K3, showing the MoonshotAI Kimi K3 listing priced at $3.00 per 1M input tokens and $15.00 per 1M output tokens, a p50 time-to-first-token of 8.00s, 749.2M tokens of traffic over seven days, a 1M-token context window, and a Python snippet calling the model at api.orcarouter.ai/v1.

Базовая модель — это та часть, которую вы уже можете маршрутизировать

Весь аргумент о затратах Ember-1 измеряется относительно опубликованных тарифов Kimi K3. Kimi K3 доступна на OrcaRouter по цене $3,00 за миллион входных токенов, $0,30 за миллион кэшированных входных токенов и $15,00 за миллион выходных токенов, с контекстным окном в 1 048 576 токенов. Это тот же тарифный лист, который используется в сравнении Fireworks Research, и стоит знать, что экономия в тех столбцах сокращения токенов рассчитывается по числам, которые вы можете увидеть сами, а не по внутренней модели затрат поставщика.

Сам Ember-1 не представлен на OrcaRouter. Он доступен только через собственную serverless-платформу вендора, в качестве research preview, и Fireworks Research не опубликовала цену на него — поэтому долларовые показатели в таблице бенчмарков выведены из ставок K3 и количества токенов, а не из существующей тарифной карточки Ember-1. Если вас интересует именно арифметика, честная последовательность действий такова: оцените стоимость рабочей нагрузки по сегодняшнему маршруту K3, примите проценты сокращения токенов как верхнюю границу того, что мог бы дать переход, и дождитесь опубликованного тарифа, прежде чем моделировать экономию как денежную сумму.

Где OrcaRouter действительно помогает в этом случае — так это с хеджированием. Исследовательский предпросмотр с двухнедельным окном доступа — именно та модель, которую хочется попробовать, не ставя на неё производственный путь, и способ сделать это без второго контракта — разместить её за тем же эндпоинтом, что и всё остальное, что вы вызываете. OrcaRouter обслуживает 200+ моделей за одним API с автоматическим переключением при сбое, так что модель предпросмотра, которая окажется недоступной в следующем месяце, — это изменение маршрутизации, а не миграция. Ничто в Ember-1 этого не требует — но и ничто в двухнедельном окне не говорит против этого.

Что делать с этим релизом

Если вы уже запускаете Kimi K3 в агентном цикле, цифры Ember-1 описывают ваш счёт. Проблема повторного воспроизведения многоходовых сессий реальна, это доминирующая статья затрат при длительных прогонах агента, и модель, которая сокращает собственные трассировки, не меняя своих ответов, стоит затраченного на оценку времени. Правильный тест — не таблица бенчмарков; это ваш собственный трафик, запущенный в теневом режиме: отправьте часть реальных запросов обеим моделям, сравните выходные данные, оставляйте рабочие результаты нетронутыми неделю-две, прежде чем что-либо менять. Это также совет, который даёт собственная критически настроенная читательская аудитория релиза, и он обоснован.

Если вы запускаете рабочую нагрузку с низкой степенью обдумывания или такую, где преобладают короткие одноходовые вызовы, экономия в значительной мере сходит на нет, и строка τ-2 Airline — это ваше реалистичное ожидание. А если вам нужно обязательство промышленного уровня — цена, уровень обслуживания, гарантия того, что конечная точка будет существовать через шесть месяцев, — Ember-1 пока такого не предлагает. Это исследовательский предпросмотр, постоянство которого Fireworks Research явно увязывает со спросом. Интересный вопрос на следующий месяц: станет ли двухнедельное окно постоянной опцией обслуживания и воспроизведёт ли какая-либо третья сторона хоть какие-то из этих цифр. Пока не произойдёт одно из этого, это сильный результат для ознакомления и плохой для того, чтобы строить на нём бюджет.

A screenshot of OrcaRouter's model catalogue headed "Models — 203 models · 15 providers · one API, one bill", with filter panels for input modalities, context length and input price, a "How to call any model" panel showing a POST to api.orcarouter.ai/v1/chat/completions, and model cards for OpenAI GPT-6 Luna, OpenAI GPT-6 Sol, Anthropic Claude Opus 5 and Grok 4.7 with their per-million-token rates.

Всё это не должно восприниматься как принижение проделанной работы. Убрать рассуждения, не убрав точность, — более сложная задача, чем добавить их, а делать это поверх чужой передовой модели, а не обучать собственную, — именно такую форму приняла значительная часть работ по наращиванию возможностей в 2026 году. Ember-1 — первый релиз того, что, по словам Fireworks Research, станет продолжающейся серией, а сам шаблон — взять уже хорошую модель, переобучить одну ось её поведения, продавать разницу в токенах — заслуживает внимания независимо от того, как зайдёт это конкретное превью.