Qwen 3.8 против Kimi K3: Два китайских гиганта, и теперь один из них дешевле
Guides & Insights

Qwen 3.8 против Kimi K3: Два китайских гиганта, и теперь один из них дешевле

Автор

Rowan Sterling

Дата публикации

Новые модели · 20Все модели
Бенчмарки: Artificial Analysis · обновляется ежедневно
Назад ко всем статьям

Это две наиболее значимые китайские фронтирные модели 2026 года, и они близкие родственники: обе огромные разреженные системы Mixture-of-Experts, обе с контекстом в 1 млн токенов, обе мультимодальные, обе обещают открытые веса. Kimi K3 от Moonshot на самом деле является большей из двух — 2,8 трлн параметров против 2,4 трлн у Qwen — полезное напоминание о том, что количество параметров — это не рейтинг.

До 3 августа 2026 года это сравнение было однобоким в конкретном смысле: Kimi K3 обладала аудированным индексом Artificial Analysis Intelligence Index 57,1, рейтингом №1 в LMArena frontend-code, опубликованными ценами и выпущенными весами, тогда как Qwen3.8-Max имела лишь заголовок 2,4T и ничего больше. GA кардинально изменила экономику. Qwen теперь публикует $2 / $6 за миллион токенов против $3 / $15 у Kimi — из-за чего более крупная и лучше зарекомендовавшая себя модель оказывается более дорогой с большим отрывом.

Заметка для разработчиков — самый быстрый способ это выяснить — прогнать обе на собственных промптах. OrcaRouter предоставляет более 200 моделей через один endpoint, совместимый с OpenAI, так что вы можете сравнить Qwen 3.8 Max и Kimi K3 на одной и той же задаче, не настраивая два SDK.

Краткий вердикт. Kimi K3 по-прежнему выигрывает по доказательствам: аудированный AA Intelligence Index 57.1 (№3), первое место LMArena frontend-code с результатом 1679, и открытые веса, которые действительно готовы. Qwen3.8-Max остаётся без оценки всеми независимыми оценщиками. Но GA дала Qwen два реальных преимущества. По цене она теперь значительно дешевле — $2 / $6 против $3 / $15, что означает в 2,5 раза меньше на выходе. И в единственном существующем независимом очном тесте Qwen проиграла по основному счёту 80 к 83, но при этом показала себя заметно более корректным агентом: 354 цитирования в репозитории против 274, 22 запроса к шлюзу против 53 и ноль неудачных вызовов инструментов против двух. Kimi за проверенное качество; Qwen за более дешёвое и чистое агентное выполнение.

Основные выводы

Kimi K3 — более крупная модель — 2.8T MoE против 2.4T у Qwen, примерно на 400B больше — что является веским аргументом против использования количества параметров как показателя возможностей.

Qwen3.8-Max доступен в GA с 3 августа 2026 года по цене $2 / $6 за 1M flat, тогда как у Kimi K3 — $3 / $15 (AA blended ~$2.31). Qwen теперь в 2,5 раза дешевле на выходе.

Kimi K3 имеет подтверждённый показатель: AA Intelligence Index 57.1 (#3), уступая только Fable 5 и GPT-5.6 Sol, а также LMArena frontend-code #1 (1679). Qwen3.8-Max всё ещё не оценён.

В единственном прямом тесте (Trilogy AI) Kimi опередил Qwen со счётом 83:80 в целом — но Qwen сделал больше цитирований в репозиториях (354 против 274), меньше запросов к шлюзу (22 против 53), и имел ноль неудачных вызовов инструментов (против двух), с рейтингом использования инструментов 9/10 против 8/10 у Kimi.

Qwen теперь сообщает результаты агентных и кодовых бенчмарков: Terminal-Bench 2.1 86.6, OSWorld-Verified 86.1, FrontierSWE 73.5 (с 40.7 у предшественника) — всё по данным Alibaba.

По срокам открытости преимущество по-прежнему у Kimi: его веса практически готовы; веса Qwen обещаны в течение недели, но лицензии или репозитория пока нет.

Примечание о точности: все показатели качества Qwen3.8-Max предоставлены Alibaba и не проверены третьими сторонами. Показатели Kimi K3 взяты из Artificial Analysis и LMArena. Прямое сравнение — это единичный тест Trilogy AI, и его следует рассматривать как одну точку данных, а не как общий рейтинг. Цены на Qwen указаны по прайс-листу GA и заменяют июльскую предварительную скидку.

Характеристики и цена, бок о бок

Вот конкретные данные, каждая цифра привязана к своему источнику.

• Производитель / статус — Qwen3.8-Max: Alibaba; GA (3 августа 2026 г.); Kimi K3: Moonshot; релиз с открытыми весами

• Архитектура — Qwen3.8-Max: ~2,4T всего, разреженный MoE (активные параметры пока не раскрыты); Kimi K3: 2,8T MoE, нативное зрение (Artificial Analysis)

• Контекстное окно — Qwen3.8-Max: 1M токенов (983 616 с мышлением; максимальный вывод 131 072); Kimi K3: 1M токенов (Artificial Analysis)

• AA Intelligence Index — Qwen3.8-Max: Всё ещё без оценки; Kimi K3: 57.1 — #3 (Artificial Analysis)

• Arena / таблица лидеров — Qwen3.8-Max: публичной оценки нет; Kimi K3: Frontend-code #1, 1679 (LMArena)

• Оценки, предоставленные вендором — Qwen3.8-Max: Terminal-Bench 2.1 86,6, GPQA Diamond 92,6, OSWorld-Verified 86,1 (данные Alibaba); Kimi K3: показатель измерен сторонней организацией

• Цены (вход / выход) — Qwen3.8-Max: $2.00 / $6.00 за 1M, фиксированно; кэшированный вход $0.25; Kimi K3: $3 / $15 за 1M (AA blended ~$2.31), попадания в кэш $0.30

• Открытые веса — Qwen3.8-Max: Обещано в течение недели (лицензии пока нет); Kimi K3: Открытые веса; веса готовы

• Скорость — Qwen3.8-Max: p50 TTFT 1.64 с (телеметрия OrcaRouter за 7 дней); Kimi K3: многословный и медленный (~34 с TTFT, по данным AA)

Два фактора задают рамки этого сравнения, и один из них полностью изменился 3 августа.

Во-первых, соотношение цен изменилось на противоположное. С июля Kimi K3 была моделью с реальной ценой, а Qwen — моделью с купоном на скидку. Теперь обе публикуют тарифы, и более проверенная, более крупная модель стоит дороже: $3 / $15 против $2 / $6. По выходу — где основные затраты приходятся на рассуждения и генерацию кода — Kimi стоит в 2,5 раза дороже. Qwen также взимает единую ставку для всего своего контекста в 1 млн токенов, а её кэшированный ввод по $0,25 немного ниже, чем цена кэш-попадания у Kimi в $0,30. Для любого высоконагруженного сценария экономика Qwen теперь явно выгоднее.

Во-вторых, разрыв в доказательствах не изменился, и именно поэтому Kimi по-прежнему выигрывает. Индекс интеллекта Kimi K3 — 57.1 — ставит её на третье место в общем зачёте: впереди только Fable 5 и GPT-5.6 Sol; это вердикт нейтрального оценщика. Её первое место в LMArena frontend-code с показателем 1679 — это краудсорсинговый результат множества слепых сравнений. Terminal-Bench 86.6 и GPQA Diamond 92.6 у Qwen — реальные числа, но это собственные показатели Alibaba на стенде, который больше никто не запускал. Полезный ориентир: предшественник Qwen3.7-Max набрал 46 по индексу AA против 57.1 у Kimi, так что Qwen нужен большой скачок между поколениями, чтобы просто сравняться.

Есть также один нюанс задержки, заслуживающий внимания, поскольку он идёт вразрез с обычной картиной. Artificial Analysis оценивает Kimi K3 примерно в 34 секунды времени до первого токена — это действительно медленно. Данные GA-телеметрии OrcaRouter показывают, что p50 TTFT для Qwen3.8-Max составляет 1,64 секунды. Эти измерения получены из разных источников и не являются контролируемым сравнением, но они усложняют предположение, возникшее в эпоху предварительного просмотра, о том, что Qwen — более медленная модель из этой пары.

Тот самый очный тест — читайте внимательно

Это единственное противостояние в серии, где третья сторона протестировала обе модели друг против друга на одной и той же задаче, поэтому его стоит внимательно изучить, а не сводить к определению победителя.

Trilogy AI выполнила задачу на понимание архитектуры — осмыслить реальный репозиторий и прийти к правильному архитектурному выводу — и оценила результаты:

• Общая оценка — Qwen3.8-Max: 80 / 100; Kimi K3: 83 / 100

• Цитирования в репозитории — Qwen3.8-Max: 354; Kimi K3: 274

• Шлюзовые запросы — Qwen3.8-Max: 22; Kimi K3: 53

• Неудачные вызовы инструментов — Qwen3.8-Max: 0; Kimi K3: 2

• Оценка использования инструментов — Qwen3.8-Max: 9 / 10; Kimi K3: 8 / 10

• Доля попаданий в кэш — Qwen3.8-Max: >90%; Kimi K3: >90%

Кими победила по заголовку с перевесом в три пункта. Но посмотрите на столбцы процесса, потому что для агентной инженерии они важнее, чем балл. Qwen пришла к тому же ключевому архитектурному выводу, используя менее половины запросов к шлюзу, при этом демонстрируя на 29% больше ссылок на источники и — деталь, которая должна заинтересовать любого, кто создаёт агентов — ноль неудачных вызовов инструментов против двух у Kimi.

Неудачные вызовы инструментов — это то, что на самом деле ломает продакшн-агентов. Они образуют каскад: некорректный вызов порождает ошибку, которую модель должна интерпретировать, что расходует ходы и рискует привести к дальнейшим ошибкам. Модель, которая выполняет 22 чистых запроса, тогда как другая выполняет 53 с двумя сбоями, дешевле и предсказуемее в эксплуатации, даже если она набирает на три балла меньше по ответу. В сочетании с в 2,5 раза более дешёвой ставкой вывода у Qwen, экономика эксплуатации такого прогона существенно склоняется в пользу Qwen.

Предостережение в том, что это одна задача, один оценщик, один прогон. Это не набор эталонных тестов и не обобщается. Индекс Kimi 57.1 и первое место во фронтенд-рейтинге основаны на гораздо большем количестве доказательств, чем этот единственный тест. Правильный вывод узок: по крайней мере в одной реалистичной агентной задаче Qwen был более дисциплинированным пользователем инструментов, немного уступая в качестве вывода.

Стоимость на практике: агентные прогоны в больших объёмах.

Рассмотрим агента анализа репозитория: 250 000 токенов контекста кода за один запуск, 12 000 токенов выходных данных.

Qwen3.8-Max: 0.25M × $2 = $0.50, плюс 0.012M × $6 = $0.072. ≈ $0.57 за запуск.

Kimi K3: 0.25M × $3 = $0.75, плюс 0.012M × $15 = $0.18. ≈ $0.93 за запуск.

• При 1 500 запусках/день: Qwen ≈ $858/день; Kimi ≈ $1 395/день — примерно $16 000/месяц разницы.

• При кэшировании на стабильном репозитории: кэшированный ввод Qwen по $0.25/1M доводит стоимость запуска до ≈ $0.14; ставка кэш-попаданий Kimi в $0.30 доводит её до ≈ $0.26.

Разрыв реален на обоих концах, и результат Trilogy усугубляет его: если Qwen действительно использует менее половины шлюзовых запросов для выполнения сопоставимой работы, фактическая разница в стоимости агентных задач оказывается шире, чем предполагает один лишь тариф.

Обе модели тарифицируют токены рассуждений как выходные, поэтому конфигурации с интенсивными рассуждениями стоят дороже, чем наивная оценка, в обоих случаях — но ставка Qwen в $6 делает этот штраф в 2,5× меньше.

Открытость: почти паритет, разные сроки

Это та ось, где эти двое наиболее похожи, и разница заключается исключительно в готовности. Веса Kimi K3 открыты и по сути готовы. Веса Qwen3.8-Max обещаны в течение недели, но пока нет ни текста лицензии, ни карточки модели, ни репозитория — а именно лицензия определяет, можно ли вообще использовать модель в коммерческих целях.

Практически ни один из флагманов нельзя развернуть самостоятельно силами обычной команды. Qwen с 2,4 трлн параметров занимает примерно 1,2 ТБ в 4-битном формате против примерно 141 ГБ на H200; Kimi с 2,8 трлн параметров ещё больше. Обеим требуется восемь или более топовых ускорителей, а нераскрытое Alibaba количество активных параметров означает, что вы не можете даже смоделировать пропускную способность Qwen.

Именно поэтому одновременно анонсированная Qwen3.8-27B важна здесь. Также перейдя на открытые веса и, по сообщениям, требуя примерно 17 ГБ видеопамяти, она даёт семейству Qwen настоящее on-premise-преимущество, которого не обеспечивает ни флагман 2.4T, ни флагман 2.8T. Если открытые веса — ваша настоящая причина выбора между этими двумя, 27B меняет расстановку сил сильнее, чем любой из гигантов.

Часто задаваемые вопросы

Qwen 3.8 лучше, чем Kimi K3?

Не на основе проверенных данных. Kimi K3 имеет независимый индекс интеллекта AA 57.1 (#3) и занимает первое место LMArena по фронтенд-коду, тогда как Qwen3.8-Max остаётся без оценки со стороны всех сторонних оценщиков. В единственном доступном прямом тесте Kimi выиграл со счётом 83:80. Преимущества Qwen — цена (вывод в 2,5 раза дешевле) и, в том же тесте, более чистое использование инструментов.

Какая модель больше?

Kimi K3 с 2,8 трлн общих параметров против 2,4 трлн у Qwen3.8-Max — примерно на 400 млрд больше. Впрочем, ни одна из компаний не раскрывает достаточно данных, чтобы это имело значение: Alibaba так и не опубликовала количество активных параметров Qwen, а именно этот показатель фактически определяет стоимость обслуживания в модели Mixture-of-Experts.

Что дешевле?

Qwen3.8-Max, очевидно, начиная с GA. Он указывает $2 / $6 за 1 млн против $3 / $15 у Kimi K3 — на 33% меньше на входе и в 2,5× меньше на выходе. Ставка Qwen одинакова для всего контекста в 1 млн, а его кэшированный ввод за $0,25 немного ниже, чем у Kimi с $0,30 за попадание в кэш.

Что на самом деле показал сравнительный тест?

В задаче Trilogy AI на понимание архитектуры Kimi получил 83 балла, а Qwen — 80. Но Qwen выдал 354 ссылки на репозитории против 274 у Kimi, использовал 22 запроса к шлюзу против 53, зафиксировал ноль неудачных вызовов инструментов против двух и получил 9/10 за использование инструментов против 8/10 у Kimi. Kimi дал лучший ответ; Qwen был более дисциплинированным агентом. Это всего одна задача, так что относитесь к этому как к точке данных, а не как к рейтингу.

Qwen 3.8 Max вышла из предварительной версии?

Да, 3 августа 2026 года, с опубликованным прайс-листом и конечной точкой, совместимой с OpenAI и DashScope. Июльская кампания по кредитам Qoder больше не описывает, как это продаётся.

Какой быстрее?

Возможно, теперь это Qwen, что переворачивает предположение эпохи превью. Artificial Analysis измеряет Kimi K3 примерно в 34 секунды времени до первого токена; 7-дневная телеметрия GA OrcaRouter показывает Qwen3.8-Max с p50 TTFT 1,64 секунды. Источники разные, и это не контролируемое сравнение, но обе модели славятся многословностью, а измеренный TTFT у Kimi действительно медленный.

Могу ли я самостоятельно размещать любой из них?

Не вполне реалистично в масштабе флагманских моделей — модели 2.4T и 2.8T требуют восемь или более GPU класса H200. Веса Kimi доступны уже сегодня; веса Qwen обещают в течение недели, хотя лицензии пока нет. Для настоящего локального развертывания практичным выбором в семействе Qwen станет одновременно анонсированная Qwen3.8-27B (по сообщениям, ~17 ГБ видеопамяти).

Итог

Qwen 3.8 против Kimi K3 — это самое близкое противостояние в этой серии, и выход в общий доступ чётко разделил его по двум осям. Kimi K3 удерживает корону качества за счёт результатов, замеренных арбитром: 57.1 по Индексу интеллекта, третье место в общем зачёте и первое место LMArena по фронтенд-коду. Это не заявления — это результаты, и у Qwen нет ничего сопоставимого.

Что Qwen выиграл 3 августа — так это экономику, и выиграл он её убедительно: $2 / $6 против $3 / $15, одинаково на миллионе токенов, с чуть более дешёвым кэшированием. Добавьте к этому вывод Trilogy о том, что Qwen выполнил сопоставимую агентную задачу с вдвое меньшим числом gateway-запросов и нулём неудачных вызовов инструментов, — и Qwen выглядит более операционно эффективной моделью даже там, где уступает в точности. Следите за двумя событиями: {{1}}первый независимый результат Intelligence Index для Qwen3.8-Max{{/1}} и выход весов с лицензией. Если Qwen наберёт хоть сколько-нибудь близко к 57.1 у Kimi, {{2}}ценовой разрыв делает выбор Kimi для объёмных задач крайне трудно оправданным{{/2}}. До тех пор Kimi — модель, которой вы доверяете, а Qwen — та, которую вы можете позволить себе запускать; и честный способ выбрать — на ваших собственных репозиториях.

Сравнение в этой статье2

Определено по этой статье · Бенчмарки: Artificial Analysis · обновляется ежедневно