
GPT-6 Luna против Kimi K3: вчетверо выше пропускная способность, в тридцать раз ниже цена, одно реальное исключение
- OrcaНОВИНКАOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 за 1 млн токенов
- orcaНОВИНКАOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 за 1 млн токенов
- deepseekНОВИНКАDeepSeek: DeepSeek V4.1 Flash2026-09-1040Интеллект
- openaiOpenAI: GPT-6 Astra2026-09-0453Интеллект77Кодинг
- googleGoogle: Gemini 3.8 Flash2026-09-0241Интеллект76Кодинг
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Интеллект76Кодинг
- anthropicAnthropic: Claude Fable 5.12026-09-0153Интеллект82Кодинг
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 за 1 млн токенов
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Интеллект72Кодинг
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 за 1 млн токенов
- z-aiZ.ai: GLM 5.32026-08-1845Интеллект75Кодинг
- obsidianQwen3.8 27B2026-08-1534Интеллект68Кодинг
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Интеллект69Кодинг
- grokSpaceXAI: Grok 4.62026-08-1244Интеллект77Кодинг
- metaMeta: Muse Spark 1.22026-08-0540Интеллект72Кодинг
- qwenQwen: Qwen3.8 Max2026-08-0345Интеллект76Кодинг
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3134Интеллект69Кодинг
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 за 1 млн токенов
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
Две модели, обе выпущены за последние три месяца, обе позиционируются как дешёвый уровень фронтирного семейства, и обе ошибаются насчёт того, что означает «дешёвый уровень», одинаково — а точнее, ничуть.Kimi K3 — это флагман Moonshot AI с открытыми весами, публично доступный по модифицированной лицензии MIT с 27 июля 2026 года, по цене $3,00 за миллион входных токенов и $15,00 за миллион выходных, а чтение из кэша — $0,30.GPT-6 Luna — это тариф вендора для больших объёмов, общедоступный с 22 сентября 2026 года по $0,10 и $0,50, а чтение из кэша — за цент. Тридцатикратная разница на входе, тридцатикратная на выходе, и лицензия на одной стороне, которую другая не может предложить ни за какую цену.
Однако не тарифная сетка определяет это сопоставление, потому что тарифы не настолько близки, чтобы это требовало выбора. Решает его число, которое ни один из поставщиков не выносит в заголовок: измеренная скорость вывода. Kimi K3 генерирует 38,7 токена в секунду. GPT-6 Luna генерирует 153,9. Это четырёхкратный разрыв, и для любой рабочей нагрузки, где модель — компонент внутри цикла, а не конечная точка, с которой разговаривает человек, четырёхкратная разница в пропускной способности меняет архитектуру, а не счёт.
Что эти двое на самом деле собой представляют
Kimi K3 — это модель со смесью экспертов на 2,8 трлн параметров, из которых 104 млрд параметров активны на каждый токен, с контекстным окном в 1 048 576 токенов, максимальным объёмом вывода в 1 048 576 токенов и весами, опубликованными на Hugging Face под модифицированной лицензией MIT. Это модель с открытыми весами, набравшая наибольший балл в независимом рейтинге, — первая среди 112 моделей с открытыми весами, — и она занимает первое место в таблице лидеров WebDev от Code Arena с 1 679 Elo. Moonshot сообщает о 88,3% на Terminal-Bench 2.0; это показатель производителя, а не независимо воспроизведённый результат.
GPT-6 Luna — это младший уровень поколения GPT-6 от OpenAI: она находится ниже GPT-6 Sol с ценой $2.00/$10.00 и значительно ниже флагманской GPT-6 Astra с ценой $10.00/$50.00. На входе — текст и изображение, на выходе — текст, окно размером 1 050 000 токенов с максимальным вводом 922 000 токенов и верхним пределом вывода 128 000 токенов, а усилие при рассуждении можно выбрать из вариантов none, low, medium, high, xhigh и max; по умолчанию используется medium. Это закрытая модель с одним идентификатором, доступная любому, у кого есть ключ API.
Один — это скачивание. Другой — эндпоинт. Оба тарифицируются по объёму. Такова суть сравнения.
Карточки, строка за строкой
По одной строке на каждое измерение, обе стороны — на каждом:
• Ввод за 1 млн — GPT-6 Luna $0.10 против Kimi K3 $3.00
• Вывод за 1M — GPT-6 Luna $0.50 против Kimi K3 $15.00
• Кэшированный ввод за 1 млн — GPT-6 Luna $0.01 против Kimi K3 $0.30, что составляет десятую часть собственной ставки за ввод на обеих карточках
• Условие для длинного контекста — GPT-6 Luna удваивает ввод и кэш и повышает вывод в 1,5 раза при объёме свыше 272 000 входных токенов; применяется ко всему запросу, в отличие от Kimi K3, у которой на карточке не опубликовано аналогичного условия
• Контекстное окно — GPT-6 Luna: 1 050 000 токенов при максимальном вводе 922 000 против 1 048 576 токенов у Kimi K3
• Максимальный объём вывода — GPT-6 Luna 128 000 токенов против Kimi K3 1 048 576 токенов, в восемь раз выше потолка
• Независимый Intelligence Index — GPT-6 Luna 37 при максимальном усилии против Kimi K3 44 при максимальном усилии, та же версия индекса
• Оценка при усилии по умолчанию — GPT-6 Luna 29 на его стандартном среднем уровне против Kimi K3, измеренного при его максимальной настройке
• Стоимость выполнения одной задачи Index, независимо — GPT-6 Luna около $0.07 против Kimi K3 $2.00
• Выходные токены в прогоне индекса — GPT-6 Luna 150M против Kimi K3 160M, по сравнению с медианой по таблице лидеров в 88M; обе намного более многословны, чем медианная модель таблицы лидеров
• Скорость вывода, независимо — GPT-6 Luna 153,9 токенов/сек против Kimi K3 38,7 токенов/сек
• Веса — GPT-6 Luna закрытые, только API, в отличие от Kimi K3, публично доступной на Hugging Face с 27 июля 2026 года
• Лицензия — GPT-6 Luna не применима, в отличие от Kimi K3 Modified MIT, которая не является тем же инструментом, что и MIT
• Всего параметров — у GPT-6 Luna не раскрыто, против 2,8 трлн у Kimi K3, из которых 104 млрд активны на каждый токен
• Убедительное доказательство — вызов инструментов и агентные циклы GPT-6 Luna по цене одна десятая цента за тысячу кэшированных входных токенов против Kimi K3 Code Arena WebDev №1 с 1 679 Elo, Terminal-Bench 2.0 — 88,3% по данным вендора, лучший результат среди открытых моделей в независимом рейтинге
• В OrcaRouter — GPT-6 Luna отсутствует в нашем каталоге, а Kimi K3 доступна для маршрутизации по прейскурантной цене Moonshot

Пропускная способность — это параметр, который никто не выносит в заголовки.
Модель со скоростью 38,7 токена в секунду и модель со скоростью 153,9 токена в секунду — это не один и тот же продукт с разными ценниками. Это разные продукты.
Возьмём задачу, в которой модель должна выдать ответ объёмом 1500 токенов — резюме, структурированное извлечение данных, патч кода с пояснением. При 153,9 токена в секунду такой ответ занимает около десяти секунд. При 38,7 — около тридцати девяти. Ни один из этих показателей не учитывает время на рассуждения или сетевую задержку, поэтому в реальных условиях разрыв превышает четырёхкратный, а не меньше.
А теперь поместите это в цикл. Агент, который совершает тридцать вызовов модели, чтобы выполнить одну задачу, — планирует, выбирает инструмент, читает результат, решает, каким будет следующий шаг, повторяет, — производит, возможно, 15 000 выходных токенов за эти вызовы. GPT-6 Luna тратит примерно 97 секунд на генерацию. Kimi K3 — примерно 388. Это разница между задачей, которую пользователь ждёт, и задачей, которую пользователь планирует, и никакая либеральность лицензии этого не меняет.
Многословность не компенсирует проблему скорости, а усугубляет её. Kimi K3 сгенерировала 160 млн выходных токенов, выполняя независимый индекс, против 150 млн у GPT-6 Luna — так что в этой оценке более медленная модель также выдала немного больше токенов, а не меньше. Обе модели одинаково многословны; просто они не одинаково быстры, а при оплате по выходным токенам многословность обходится дорого вдвойне.
Стоит прямо сказать, что это не дефект Kimi K3. Модель с 2,8 трлн параметров, из которых 104 млрд активных, выполняет больше работы на каждый токен, чем модель младшего уровня, и показатель пропускной способности — это измерение этой работы. Уместный вопрос: требует ли ваша нагрузка такой работы. Если да, 38,7 токена в секунду — это цена за эту возможность. Если нет, вы платите за обдумывание, о котором не просили, — и платите в тридцать раз больше.
Где живут семь пунктов K3
Kimi K3 набирает 44 балла в независимом Intelligence Index при максимальном усилии. GPT-6 Luna набирает 37 при той же настройке. Семь баллов в композитной оценке, где один балл укладывается в шум повторного прогона, — а между ними разрыв примерно в двадцать восемь раз по стоимости за выполненную задачу: $2.00 против примерно $0.07.
Эти семь баллов распределены неравномерно. Репутация Kimi K3 сосредоточена в программировании и в агентной разработке ПО, и именно в этом причина существования модели: в таблице лидеров WebDev от Code Arena она занимает первое место с 1 679 Elo, а показатель вендора в Terminal-Bench 2.0, равный 88,3%, — это измерение кодирующего агента. Собственная позиция GPT-6 Luna в программировании — шаг назад, а не вперёд: её Coding Agent Index равен 41, что на два пункта ниже, чем у GPT-5.6 Luna, которую она заменила, причём ухудшения сосредоточены в SWE-Atlas-QnA и DeepSWE v1.1. Если ваша работа — это агент, пишущий программное обеспечение под реальный репозиторий, то это разрыв в индексе в семь пунктов и регрессия в два пункта по сравнению с предыдущим поколением, указывающие в одном направлении, и доводы в пользу дешёвого уровня становятся значительно слабее.
Там, где этих семи баллов нет, находится класс работ, под который рассчитана цена GPT-6 Luna. Классификация, извлечение, маршрутизация, массовая суммаризация, внутренний цикл агента, которому нужен быстрый ответ «да или нет», — на этих задачах обе модели в подавляющем большинстве случаев будут выдавать одинаковый пригодный для использования результат, и эта разница не переживёт контакта с вашим собственным набором для оценки. Индекс измеряет составной показатель, в котором большой вес придаётся долгосрочному рассуждению и программированию, а для решения о маршрутизации ни то, ни другое не требуется.
Одна оговорка, которую стоит добавить к показателям индекса с обеих сторон: эта таблица — скользящая оценка, и её пересмотр имеет значение. Более ранние снимки того же списка лидеров ставили Kimi K3 существенно выше 44, которые показывает наш сегодняшний замер, потому что композитный показатель, тестовый стенд и набор моделей — всё меняется. Любое сравнение, которое опирается на точный разрыв между двумя моделями в скользящем индексе, опирается на нечто, что не останется неизменным. Честная интерпретация такова: эти две модели находятся в соседних диапазонах возможностей на своих верхних границах, и индекс не может сказать вам, какая из них лучше для вашей задачи.
Исключение: что Modified MIT на самом деле вам даёт
Лицензия Kimi K3 — это единственный аспект, по которому у GPT-6 Luna нет ответа ни за какую цену, и она заслуживает большей точности, чем обычно достаётся фразе «открытые веса».
Веса опубликованы публично на Hugging Face, и лицензия — Modified MIT, а не MIT. Это различие имеет значение: лицензия Modified MIT обычно накладывает условия — как правило, требование указывать атрибуцию, когда модель используется в продукте выше определённого масштаба, — и всем, кто планирует строить коммерческий продукт на этих весах, следует прочитать сам текст лицензии, а не полагаться на название семейства, на которое она похожа. Это не причина избегать её. Это причина не описывать её как MIT в закупочном документе.
То, что даёт скачивание, реально и ограничено. Оно обеспечивает нижнюю границу затрат в том смысле, что фиксированный парк GPU при достаточном объёме может оказаться выгоднее счёта с оплатой по факту. Оно даёт независимость от дорожной карты вендора — модель, которую вы хостите сами, нельзя снять с поддержки вопреки вашей воле. Оно даёт возможность дообучать модель на собственном распределении данных. И оно даёт возможность держать промпты в пределах собственного периметра, что для некоторых команд завершает сравнение ещё до упоминания цены.
Всё упирается в аппаратное обеспечение. Модель со смесью экспертов на 2,8 триллиона параметров с 104 миллиардами активных параметров — это не модель, которая запускается на рабочей станции. Обслуживание её с пропускной способностью промышленного уровня — это обязательство масштаба кластера с капитальными затратами, операционными затратами и профилем задержек, который вы обеспечиваете сами, а не арендуете. Это не аргумент против самостоятельного хостинга Kimi K3 — это аргумент о том, что правильное сравнение — не 15,00 $ за миллион выходных токенов против 0,00 $, а 15,00 $ за миллион выходных токенов против полной стоимости одного токена, включающей кремний и людей. Для небольшого числа организаций эта цифра ниже. Для большинства — нет, и точка пересечения находится дальше, чем кажется из-за лицензии.
Запуск одного из них или обоих
Kimi K3 доступен на OrcaRouter по прайс-листовой цене Moonshot, а в рамках сквозного ценообразования это означает, что изменение тарифов вендора вступает в силу на нашей стороне в тот же день. Автоматическое переключение при сбое — это та часть, которая особенно оправдывает себя именно для этой модели: деградация самостоятельно размещённого или стороннего эндпоинта Kimi K3 — это ровно тот сценарий, когда нужно, чтобы маршрут переключился без развёртывания, а у модели со скоростью 38,7 токена в секунду меньше запаса, чтобы поглотить медленный апстрим, чем у быстрой.
GPT-6 Luna на момент написания отсутствует в нашем каталоге, и доступ к ней осуществляется через собственный API OpenAI, поэтому команда, которой нужны обе, использует один ключ для Kimi K3 вместе с тем, что уже применяет для OpenAI. Это также та пара, в которой DSL маршрутизации делает то, чего не может жёстко прописанное разделение: правило, которое направляет задачи по программированию и долгосрочные задачи в Kimi K3, а всё, что потребляют программы и что короткое, — в GPT-6 Luna, выражает границу, которая сдвигается каждый раз, когда любой из вендоров выпускает новую версию, и сдвигается на уровне конфигурации, а не кода. Слияние моделей — это другая конфигурация, которую здесь стоит упомянуть — панель из одной медленной, тщательной модели и одной быстрой, дешёвой модели, отвечающих вместе, при этом дешёвый участник обрабатывает основной объём, а дорогой выступает арбитром в важных случаях, — схема, которой эта пара моделей на удивление хорошо соответствует, потому что асимметрия затрат между ними достаточно велика, чтобы тратить вызов Kimi K3 на небольшую долю трафика {

Какой именно, и когда
Берите GPT-6 Luna, если ваша рабочая нагрузка высокообъёмная, потребляется программами и чувствительна к задержкам. Классификация, извлечение, маршрутизация, массовое суммирование, внутренний цикл агента. При $0.10/$0.50, одном центе за чтение из кэша и четырёхкратной пропускной способности Kimi K3 арифметика явно не в пользу альтернатив, и разница в задержке не маргинальна. Задавайте параметр effort явно, потому что по умолчанию стоит medium, а заявленное значение 37 — это число при максимальном effort, и держите длинные вызовы с правильной стороны от отметки в 272 000 токенов.
Берите Kimi K3, если вам нужны веса; если ваша работа — агентное программирование с реальным репозиторием, где его позиция в WebDev и заявленные вендором 88,3% на Terminal-Bench 2.0 — это те доказательства, которые имеют значение; если вам нужен потолок вывода выше 128 000 токенов; или если ваша организация не может отправлять промпты в закрытый эндпоинт. Примите 38,7 токена в секунду как часть сделки и прочитайте условия Modified MIT, а не предполагайте их.
Ошибка, к которой подталкивает это сравнение, — считать тридцатикратный показатель ответом на вопрос о возможностях. Это ответ на вопрос о токенах. Вопрос о возможностях решается тем, нужны ли вам веса или скорость, и эти два ответа ведут в противоположных направлениях.

Сравнение в этой статье1
Определено по этой статье · Бенчмарки: Artificial Analysis · обновляется ежедневно
