
Grok 4.7 против Kimi K3: вдвое дешевле, вдвое меньше контекста, ни одного веса
- openaiНОВИНКАOpenAI: GPT-6.1 Sol2026-09-2952Интеллект
- anthropicНОВИНКАAnthropic: Claude Sonnet 5.52026-09-2856Интеллект
- typesafeНОВИНКАTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 за 1 млн токенов · 219 tok/s
- OpenAIНОВИНКАOpenAI: GPT-6 Luna2026-09-2238Интеллект
- OpenAIНОВИНКАOpenAI: GPT-6 Sol2026-09-2248Интеллект
- AnthropicНОВИНКАAnthropic: Claude Opus 5.52026-09-2258Интеллект
- xAIНОВИНКАGrok 4.72026-09-2146Интеллект
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 за 1 млн токенов · 117 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 за 1 млн токенов · 1064 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Интеллект
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Интеллект77Кодинг
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Интеллект76Кодинг
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Интеллект76Кодинг
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Интеллект82Кодинг
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 за 1 млн токенов · 41 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 за 1 млн токенов · 104 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Интеллект72Кодинг
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 за 1 млн токенов · 213 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Интеллект75Кодинг
- obsidianQwen3.8 27B2026-08-1534Интеллект68Кодинг
Возьмите месяц агентной работы над кодом на 300 миллионов токенов и прогоните его через обе модели по их прайсовым ставкам — и выбор перестанет выглядеть как спор о бенчмарках. Grok 4.7, которую SpaceXAI выпустила 21 сентября 2026 года, берёт $2 за миллион входных токенов и $6 за миллион выходных. Kimi K3, которую Moonshot AI выпустила 16 июля 2026 года, берёт $3 и $15. В этом гипотетическом месяце — скажем, 200 млн входных и 100 млн выходных токенов — Grok 4.7 обойдётся примерно в $1 000, а Kimi K3 — примерно в $2 100. Разрыв — не разница от округления; это бюджет ещё на одну модель. Взамен Kimi K3 даёт контекстное окно на 1 000 000 токенов вместо 500 000, нативный ввод видео наряду с изображениями и веса, доступные для скачивания. Grok 4.7 даёт более быструю, дешёвую закрытую модель, которую явно обучали для долгосрочной работы в терминале — той же цели, на которую нацелена и Kimi K3. Обе — уровня фронтира. Но это не одна и та же покупка.
Две модели, вкратце
Grok 4.7 — фронтирная модель SpaceXAI для программирования и интеллектуальной работы, построенная на более крупной базовой модели, чем Grok 4.6, и прошедшая более длительное обучение с подкреплением, нацеленное на задачи, которые могут занимать часы. Она проприетарная — весов нет, скачать нельзя — работает с контекстным окном в 500 000 токенов, принимает текст и изображения и возвращает текст, а также поддерживает уровни усилий на рассуждение от low до xhigh. Её главное заявление — скорость и цена: SpaceXAI позиционирует её как примерно вдвое более быструю, чем сопоставимые модели, при примерно вдвое меньшей цене.
Kimi K3 — флагманская открытая модель Moonshot AI на основе смеси экспертов, первая открытая модель класса трёх триллионов параметров: 2,8 трлн параметров всего при 104 млрд активных на токен, построенная на Kimi Delta Attention и весах MXFP4 с учётом квантования. Она принимает текст, изображения и видео, обслуживает контекст размером 1 000 000 токенов, выполняет рассуждения в всегда включённом режиме с настраиваемым уровнем усилий, а её веса можно скачать по лицензии Kimi K3 — коммерческое использование разрешено с ограничениями. По замыслу, это модель, которую можно забрать домой с собой.
В этом и состоит всё структурное различие между ними. Один — дешёвый, быстрый, закрытый эндпоинт. Другой — более дорогой, медленный, открытый артефакт с вдвое большим контекстом. Всё ниже — следствие этого.
Что на самом деле сравнивают бенчмарки
Вот где большинство материалов, сравнивающих Grok 4.7 и Kimi K3, ошибаются, поэтому стоит сказать прямо: опубликованные показатели этих двух моделей по большей части измеряют не одно и то же, а как минимум одна пара, которая выглядит сопоставимой, таковой не является.
Начнём с пары, которая действительно вводит в заблуждение. В материалах запуска Kimi K3 указан результат Terminal-Bench 2.1 — 88,3. В материалах запуска Grok 4.7 указан результат Terminal-Bench 4.0 — 38,0%. Это разные версии бенчмарка с разными наборами задач и разной системой оценки, и их сопоставление навело бы на мысль, что Kimi K3 более чем вдвое превосходит по агентным возможностям. Это несостоятельная интерпретация, и никто не должен её повторять. Оба числа к тому же заявлены вендорами — ни одно из них не было независимо воспроизведено.
Сопоставлять можно независимый композитный показатель, и здесь эти двое близки. В текущем индексе Artificial Analysis Intelligence Index версии v4.3.2 Kimi K3 набирает 44 — второе место среди 113 моделей, самое высокое место среди всех моделей с открытыми весами в таблице. Grok 4.7 набирает 46 — шестнадцатое место среди 655. Разница в два балла, причём своё место Kimi K3 получил при максимальном уровне усилий рассуждения. По смешанному композитному показателю эти модели — равные.
• Независимый композитный показатель — Grok 4.7 набирает 46 в AA Intelligence Index v4.3.2 против Kimi K3 с 44 в той же версии. На практике — ничья.
• Контекстное окно — 500 000 токенов у Grok 4.7 против 1 000 000 токенов у Kimi K3. Настоящее безоговорочное преимущество Kimi K3 — и единственное различие в характеристиках, не сопровождаемое никакими оговорками.
• Входные модальности — Grok 4.7: текст и изображение против Kimi K3: текст, изображение и видео. Kimi K3 шире, если в вашей рабочей нагрузке есть видео.
Веса — Grok 4.7 проприетарные, без скачивания, против открытых весов Kimi K3 под лицензией Kimi K3. Для локального развёртывания или изолированного контура это единственный пункт, который имеет значение.
• Цена за миллион токенов — Grok 4.7: $2 на входе / $6 на выходе против Kimi K3: $3 на входе / $15 на выходе, при этом ставка Kimi за кэшированный ввод составляет $0,30 за миллион. Grok 4.7 дешевле по всем параметрам и значительно дешевле по выходу.
• Управление интенсивностью рассуждений — Grok 4.7 от low до xhigh против Kimi K3, всегда включённого с настраиваемой интенсивностью. Функционально схожи; разница в том, что Grok 4.7 позволяет снизить интенсивность рассуждений.
• Свидетельства агентных возможностей по данным вендора — Grok 4.7 Terminal-Bench 4.0 38,0%, CursorBench 4.0 46,3%, DeepSWE v1.1 71,0% (все по данным вендора) против Kimi K3 Terminal-Bench 2.1 88,3%, первое место в Frontend Code Arena с 1 679 Elo (по данным вендора на момент запуска). Несопоставимо — см. выше.


Куда на самом деле уходят деньги
Тарифная сетка преуменьшает масштаб разрыва, потому что эти две модели по-разному расходуют токены. Grok 4.7 — многословная рассуждающая модель: Artificial Analysis замерила 240 млн выходных токенов, сгенерированных во время прогона её Intelligence Index, при медиане в 92 млн среди моделей. Kimi K3 — противоположный тип дороговизны: это крупная always-on модель рассуждения, и при цене $15 за миллион выходных токенов вы покупаете именно многословность.
Итак, честная модель затрат — это не «$2/$6 против $3/$15». Это выходные токены на завершённую задачу, умноженные на тариф за выход, плюс входные токены, включая каждую повторную попытку, умноженные на тариф за вход. Модель, которая решает задачу за один длинный проход при $6 за миллион, может обойти модель, которой нужно три попытки при $15 за миллион, а также может проиграть ей, если проходы дешёвой модели достаточно длинные. Это измерение, которое вы проводите на своём собственном репозитории, а не то, которое кто-то публикует для вас.
Об одной асимметрии стоит знать до того, как вы это запустите: Grok 4.6, предшественник Grok 4.7, применяет ценовой обрыв на 200 000 входных токенов, где запрос, пересекающий эту черту, пересчитывает весь запрос по двойному тарифу. Работа с длинным контекстом на стороне Grok требует проверки по текущему тарифному листу для модели, которую вы развёртываете, потому что окно в 500 000 токенов и обрыв на 200 000 токенов плохо сочетаются. Ценообразование Kimi K3 единое, и это менее заметное преимущество из двух.
Где каждый из них ломается
У обеих моделей есть режим отказа, который материалы запуска не выносят на первый план, и эти отказы различаются.
Слабое место Kimi K3 — надёжность при длительной нагрузке. Сообщество и независимые тестировщики на момент запуска сообщали, что его агентная производительность падает по мере удлинения прогонов: сильные результаты при одиночных запусках, более слабые показатели устойчивых прохождений, — а скорость вывода составляет примерно 37–38 токенов в секунду, что медленно для интерактивного программирования. Moonshot также пришлось приостановить новые потребительские подписки вскоре после запуска, потому что спрос превысил мощности, — это кое-что говорит о запасе вычислительных ресурсов на стороне хостинга.
У Grok 4.7 противоположная форма: он быстрый, дешёвый и закрытый, что означает, что вы не можете его изучить, не можете запустить его самостоятельно и не можете застраховаться от прекращения поддержки. SpaceXAI уже публично объявила, что Grok 4.8, Grok 4.9 и Grok 5 последуют за этим выпуском, а Grok 4.6 продержался примерно пять недель, прежде чем его заменили. Всё, что вы создаёте на Grok 4.7, должно быть построено так, чтобы идентификатор модели был значением конфигурации, а не предположением.
Есть третье соображение, которое не связано с провалом какой-либо из моделей: ни одна из них не является правильным выбором для двухнедельного автономного запуска, и оба вендора демонстрировали ровно это. Опубликованные демонстрации автономного программирования длительностью 16 дней и 48 часов проводились вендорами, на выбранных вендорами задачах, без независимого воспроизведения. О них стоит знать, но не стоит рассчитывать на них при планировании.

Запуск обоих, и почему это и есть настоящий ответ
Разрыв в стоимости и разрыв в контексте указывают в противоположных направлениях — и это аргумент за то, чтобы не выбирать что-то одно. Kimi K3 оправдывает свою цену на работе масштаба репозитория, где окно в 1M означает, что не нужно разбивать входные данные на фрагменты, а также на всём, что должно размещаться на собственных мощностях. Grok 4.7 оправдывает свою цену на объёме — агентные циклы с большим числом шагов, конвейеры с интенсивным использованием вызовов инструментов и длительные сеансы терминала, где доминируют скорость и стоимость вывода.
Kimi K3 доступна на OrcaRouter, что превращает это разделение в решение о маршрутизации, а не о закупке. Она числится в каталоге по прайсовой цене Moonshot, и, поскольку OrcaRouter транслирует прайсовые цены провайдеров с наценкой 0%, снижение цены вендором вступает в силу здесь в тот же день, когда о нём объявлено, а не при очередном продлении контракта. Для рабочих нагрузок, где проход по длинному контексту и исполнительный проход должны взаимодействовать, а не конкурировать — одна модель держит в поле зрения весь репозиторий, другая действует на его основе, — DSL маршрутизации объединяет несколько моделей в один вызов, а слияние моделей позволяет панели моделей отвечать совместно, когда задача оправдывает дополнительные затраты. Один API-ключ охватывает Kimi K3 плюс более 200 других моделей, так что исполнительная половина этого разделения может исходить от той модели, которая дешевле и быстрее всего справляется с задачей, а не от той, которой просто случилось держать контекст.
Есть один момент, который нужно прояснить: открытые веса Kimi K3 можно скачать, но OrcaRouter маршрутизирует запросы к размещённой конечной точке. Если ваше требование действительно предполагает инференс на собственной инфраструктуре, то это проект самостоятельного хостинга на вашем собственном оборудовании, а не решение о маршрутизации — и это единственный сценарий, в котором у этого сравнения есть один правильный ответ.
Вердикт и одно число, которое стоит запомнить
Если вы выбираете по стоимости и скорости, побеждает Grok 4.7, и с большим отрывом: половина цены за вход, меньше половины цены за выход, более быстрое обслуживание и регулятор глубины рассуждений, который можно уменьшить. Если вы выбираете по контексту, широте модальностей или возможности владеть моделью, Kimi K3 побеждает на тех же условиях. Если вы выбираете исключительно по способностям, независимый сводный показатель говорит, что между ними разница в два балла, и вам следует решать, опираясь на собственную оценку, а не на опубликованном при запуске графике любого из вендоров.
Число, за которое стоит держаться, — это то, что указано сверху: $2/$6 против $3/$15. Всё остальное в этом сравнении можно обсуждать, а это соотношение — нет.
Сравнение в этой статье2
Определено по этой статье · Бенчмарки: Artificial Analysis · обновляется ежедневно
