Сгенерированная hero-карточка заголовка для статьи под названием «Grok 4.7 vs Kimi K3 — цена против контекста», с подзаголовком «Две передовые модели, две разные ставки» и стат-чипами со значениями: цена $2/$6 против $3/$15, контекст 500K против 1M и открытые веса — нет против да.
Guides & Insights

Grok 4.7 против Kimi K3: вдвое дешевле, вдвое меньше контекста, ни одного веса

Автор

Rowan Sterling

Дата публикации

Новые модели · 20Все модели →
Бенчмарки: Artificial Analysis · обновляется ежедневно
Назад ко всем статьям

Возьмите месяц агентной работы над кодом на 300 миллионов токенов и прогоните его через обе модели по их прайсовым ставкам — и выбор перестанет выглядеть как спор о бенчмарках. Grok 4.7, которую SpaceXAI выпустила 21 сентября 2026 года, берёт $2 за миллион входных токенов и $6 за миллион выходных. Kimi K3, которую Moonshot AI выпустила 16 июля 2026 года, берёт $3 и $15. В этом гипотетическом месяце — скажем, 200 млн входных и 100 млн выходных токенов — Grok 4.7 обойдётся примерно в $1 000, а Kimi K3 — примерно в $2 100. Разрыв — не разница от округления; это бюджет ещё на одну модель. Взамен Kimi K3 даёт контекстное окно на 1 000 000 токенов вместо 500 000, нативный ввод видео наряду с изображениями и веса, доступные для скачивания. Grok 4.7 даёт более быструю, дешёвую закрытую модель, которую явно обучали для долгосрочной работы в терминале — той же цели, на которую нацелена и Kimi K3. Обе — уровня фронтира. Но это не одна и та же покупка.

Две модели, вкратце

Grok 4.7 — фронтирная модель SpaceXAI для программирования и интеллектуальной работы, построенная на более крупной базовой модели, чем Grok 4.6, и прошедшая более длительное обучение с подкреплением, нацеленное на задачи, которые могут занимать часы. Она проприетарная — весов нет, скачать нельзя — работает с контекстным окном в 500 000 токенов, принимает текст и изображения и возвращает текст, а также поддерживает уровни усилий на рассуждение от low до xhigh. Её главное заявление — скорость и цена: SpaceXAI позиционирует её как примерно вдвое более быструю, чем сопоставимые модели, при примерно вдвое меньшей цене.

Kimi K3 — флагманская открытая модель Moonshot AI на основе смеси экспертов, первая открытая модель класса трёх триллионов параметров: 2,8 трлн параметров всего при 104 млрд активных на токен, построенная на Kimi Delta Attention и весах MXFP4 с учётом квантования. Она принимает текст, изображения и видео, обслуживает контекст размером 1 000 000 токенов, выполняет рассуждения в всегда включённом режиме с настраиваемым уровнем усилий, а её веса можно скачать по лицензии Kimi K3 — коммерческое использование разрешено с ограничениями. По замыслу, это модель, которую можно забрать домой с собой.

В этом и состоит всё структурное различие между ними. Один — дешёвый, быстрый, закрытый эндпоинт. Другой — более дорогой, медленный, открытый артефакт с вдвое большим контекстом. Всё ниже — следствие этого.

Что на самом деле сравнивают бенчмарки

Вот где большинство материалов, сравнивающих Grok 4.7 и Kimi K3, ошибаются, поэтому стоит сказать прямо: опубликованные показатели этих двух моделей по большей части измеряют не одно и то же, а как минимум одна пара, которая выглядит сопоставимой, таковой не является.

Начнём с пары, которая действительно вводит в заблуждение. В материалах запуска Kimi K3 указан результат Terminal-Bench 2.1 — 88,3. В материалах запуска Grok 4.7 указан результат Terminal-Bench 4.0 — 38,0%. Это разные версии бенчмарка с разными наборами задач и разной системой оценки, и их сопоставление навело бы на мысль, что Kimi K3 более чем вдвое превосходит по агентным возможностям. Это несостоятельная интерпретация, и никто не должен её повторять. Оба числа к тому же заявлены вендорами — ни одно из них не было независимо воспроизведено.

Сопоставлять можно независимый композитный показатель, и здесь эти двое близки. В текущем индексе Artificial Analysis Intelligence Index версии v4.3.2 Kimi K3 набирает 44 — второе место среди 113 моделей, самое высокое место среди всех моделей с открытыми весами в таблице. Grok 4.7 набирает 46 — шестнадцатое место среди 655. Разница в два балла, причём своё место Kimi K3 получил при максимальном уровне усилий рассуждения. По смешанному композитному показателю эти модели — равные.

• Независимый композитный показатель — Grok 4.7 набирает 46 в AA Intelligence Index v4.3.2 против Kimi K3 с 44 в той же версии. На практике — ничья.

• Контекстное окно — 500 000 токенов у Grok 4.7 против 1 000 000 токенов у Kimi K3. Настоящее безоговорочное преимущество Kimi K3 — и единственное различие в характеристиках, не сопровождаемое никакими оговорками.

• Входные модальности — Grok 4.7: текст и изображение против Kimi K3: текст, изображение и видео. Kimi K3 шире, если в вашей рабочей нагрузке есть видео.

Веса — Grok 4.7 проприетарные, без скачивания, против открытых весов Kimi K3 под лицензией Kimi K3. Для локального развёртывания или изолированного контура это единственный пункт, который имеет значение.

• Цена за миллион токенов — Grok 4.7: $2 на входе / $6 на выходе против Kimi K3: $3 на входе / $15 на выходе, при этом ставка Kimi за кэшированный ввод составляет $0,30 за миллион. Grok 4.7 дешевле по всем параметрам и значительно дешевле по выходу.

• Управление интенсивностью рассуждений — Grok 4.7 от low до xhigh против Kimi K3, всегда включённого с настраиваемой интенсивностью. Функционально схожи; разница в том, что Grok 4.7 позволяет снизить интенсивность рассуждений.

• Свидетельства агентных возможностей по данным вендора — Grok 4.7 Terminal-Bench 4.0 38,0%, CursorBench 4.0 46,3%, DeepSWE v1.1 71,0% (все по данным вендора) против Kimi K3 Terminal-Bench 2.1 88,3%, первое место в Frontend Code Arena с 1 679 Elo (по данным вендора на момент запуска). Несопоставимо — см. выше.

A generated two-column comparison scoreboard for Grok 4.7 and Kimi K3 with six rows: price $2/$6 vs $3/$15 per million tokens, context 500K vs 1M tokens, AA Intelligence Index 46 vs 44, weights proprietary vs open, modalities text and image vs text, image and video, and speed twice as fast vs slower output, with a footer noting index scores are per Artificial Analysis v4.3.2 and all benchmark figures are vendor-reported.Screenshot of the Artificial Analysis model page for Grok 4.7 (xhigh), showing an Intelligence Index of 46 on index version v4.3.2, a 500k token context window, text and image input with text output, and a verbosity figure of 240M output tokens generated on the index.

Куда на самом деле уходят деньги

Тарифная сетка преуменьшает масштаб разрыва, потому что эти две модели по-разному расходуют токены. Grok 4.7 — многословная рассуждающая модель: Artificial Analysis замерила 240 млн выходных токенов, сгенерированных во время прогона её Intelligence Index, при медиане в 92 млн среди моделей. Kimi K3 — противоположный тип дороговизны: это крупная always-on модель рассуждения, и при цене $15 за миллион выходных токенов вы покупаете именно многословность.

Итак, честная модель затрат — это не «$2/$6 против $3/$15». Это выходные токены на завершённую задачу, умноженные на тариф за выход, плюс входные токены, включая каждую повторную попытку, умноженные на тариф за вход. Модель, которая решает задачу за один длинный проход при $6 за миллион, может обойти модель, которой нужно три попытки при $15 за миллион, а также может проиграть ей, если проходы дешёвой модели достаточно длинные. Это измерение, которое вы проводите на своём собственном репозитории, а не то, которое кто-то публикует для вас.

Об одной асимметрии стоит знать до того, как вы это запустите: Grok 4.6, предшественник Grok 4.7, применяет ценовой обрыв на 200 000 входных токенов, где запрос, пересекающий эту черту, пересчитывает весь запрос по двойному тарифу. Работа с длинным контекстом на стороне Grok требует проверки по текущему тарифному листу для модели, которую вы развёртываете, потому что окно в 500 000 токенов и обрыв на 200 000 токенов плохо сочетаются. Ценообразование Kimi K3 единое, и это менее заметное преимущество из двух.

Где каждый из них ломается

У обеих моделей есть режим отказа, который материалы запуска не выносят на первый план, и эти отказы различаются.

Слабое место Kimi K3 — надёжность при длительной нагрузке. Сообщество и независимые тестировщики на момент запуска сообщали, что его агентная производительность падает по мере удлинения прогонов: сильные результаты при одиночных запусках, более слабые показатели устойчивых прохождений, — а скорость вывода составляет примерно 37–38 токенов в секунду, что медленно для интерактивного программирования. Moonshot также пришлось приостановить новые потребительские подписки вскоре после запуска, потому что спрос превысил мощности, — это кое-что говорит о запасе вычислительных ресурсов на стороне хостинга.

У Grok 4.7 противоположная форма: он быстрый, дешёвый и закрытый, что означает, что вы не можете его изучить, не можете запустить его самостоятельно и не можете застраховаться от прекращения поддержки. SpaceXAI уже публично объявила, что Grok 4.8, Grok 4.9 и Grok 5 последуют за этим выпуском, а Grok 4.6 продержался примерно пять недель, прежде чем его заменили. Всё, что вы создаёте на Grok 4.7, должно быть построено так, чтобы идентификатор модели был значением конфигурации, а не предположением.

Есть третье соображение, которое не связано с провалом какой-либо из моделей: ни одна из них не является правильным выбором для двухнедельного автономного запуска, и оба вендора демонстрировали ровно это. Опубликованные демонстрации автономного программирования длительностью 16 дней и 48 часов проводились вендорами, на выбранных вендорами задачах, без независимого воспроизведения. О них стоит знать, но не стоит рассчитывать на них при планировании.

Screenshot of the OrcaRouter model page for Kimi K3 (model ID kimi/kimi-k3), showing Moonshot AI's list pricing of $3.00 per million input tokens and $15.00 per million output tokens, a 1M token context window, and the vision, tools, JSON and reasoning capability tags.

Запуск обоих, и почему это и есть настоящий ответ

Разрыв в стоимости и разрыв в контексте указывают в противоположных направлениях — и это аргумент за то, чтобы не выбирать что-то одно. Kimi K3 оправдывает свою цену на работе масштаба репозитория, где окно в 1M означает, что не нужно разбивать входные данные на фрагменты, а также на всём, что должно размещаться на собственных мощностях. Grok 4.7 оправдывает свою цену на объёме — агентные циклы с большим числом шагов, конвейеры с интенсивным использованием вызовов инструментов и длительные сеансы терминала, где доминируют скорость и стоимость вывода.

Kimi K3 доступна на OrcaRouter, что превращает это разделение в решение о маршрутизации, а не о закупке. Она числится в каталоге по прайсовой цене Moonshot, и, поскольку OrcaRouter транслирует прайсовые цены провайдеров с наценкой 0%, снижение цены вендором вступает в силу здесь в тот же день, когда о нём объявлено, а не при очередном продлении контракта. Для рабочих нагрузок, где проход по длинному контексту и исполнительный проход должны взаимодействовать, а не конкурировать — одна модель держит в поле зрения весь репозиторий, другая действует на его основе, — DSL маршрутизации объединяет несколько моделей в один вызов, а слияние моделей позволяет панели моделей отвечать совместно, когда задача оправдывает дополнительные затраты. Один API-ключ охватывает Kimi K3 плюс более 200 других моделей, так что исполнительная половина этого разделения может исходить от той модели, которая дешевле и быстрее всего справляется с задачей, а не от той, которой просто случилось держать контекст.

Есть один момент, который нужно прояснить: открытые веса Kimi K3 можно скачать, но OrcaRouter маршрутизирует запросы к размещённой конечной точке. Если ваше требование действительно предполагает инференс на собственной инфраструктуре, то это проект самостоятельного хостинга на вашем собственном оборудовании, а не решение о маршрутизации — и это единственный сценарий, в котором у этого сравнения есть один правильный ответ.

Вердикт и одно число, которое стоит запомнить

Если вы выбираете по стоимости и скорости, побеждает Grok 4.7, и с большим отрывом: половина цены за вход, меньше половины цены за выход, более быстрое обслуживание и регулятор глубины рассуждений, который можно уменьшить. Если вы выбираете по контексту, широте модальностей или возможности владеть моделью, Kimi K3 побеждает на тех же условиях. Если вы выбираете исключительно по способностям, независимый сводный показатель говорит, что между ними разница в два балла, и вам следует решать, опираясь на собственную оценку, а не на опубликованном при запуске графике любого из вендоров.

Число, за которое стоит держаться, — это то, что указано сверху: $2/$6 против $3/$15. Всё остальное в этом сравнении можно обсуждать, а это соотношение — нет.

Сравнение в этой статье2

Определено по этой статье · Бенчмарки: Artificial Analysis · обновляется ежедневно

© 2026 OrcaRouter

Провайдерам

Управляете инференс-платформой? Разместите свои модели на OrcaRouter.

providers@orcarouter.ai

Присоединяйтесь к сообществу

Discordsupport@orcarouter.aiXGitHubYouTube