
GPT-6 против Kimi K3: две модели с миллионом токенов, которые специализируются по-разному
- openaiНОВИНКАOpenAI: GPT-6.1 Sol2026-09-2952Интеллект
- anthropicНОВИНКАAnthropic: Claude Sonnet 5.52026-09-2856Интеллект
- typesafeНОВИНКАTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 за 1 млн токенов · 128 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238Интеллект
- OpenAIOpenAI: GPT-6 Sol2026-09-2248Интеллект
- AnthropicAnthropic: Claude Opus 5.52026-09-2258Интеллект
- xAIGrok 4.72026-09-2146Интеллект
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 за 1 млн токенов · 67 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 за 1 млн токенов · 320 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Интеллект
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Интеллект77Кодинг
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Интеллект76Кодинг
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Интеллект76Кодинг
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Интеллект82Кодинг
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 за 1 млн токенов · 54 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 за 1 млн токенов · 360 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Интеллект72Кодинг
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 за 1 млн токенов · 232 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Интеллект75Кодинг
- obsidianQwen3.8 27B2026-08-1534Интеллект68Кодинг
GPT-6 Sol и Kimi K3 — две модели, наиболее вероятные для включения в шорт-лист на одну и ту же задачу: контекстное окно в миллион токенов, ввод изображений и цена, которая делает длинные документы доступными. Они пришли к этому с противоположных сторон. Kimi K3 — специалист по длинному контексту от MoonshotAI, выпущенный 15 июля 2026 года, и его карточка построена вокруг полноты — он набирает 88,7% в тесте на полноту в длинном контексте от Artificial Analysis, опережая все модели от вендора, с которыми мы можем его сравнить. GPT-6 Sol — универсал среднего уровня от вендора, выпущенный 22 сентября 2026 года по цене $2,00 за миллион входных токенов и $10,00 за миллион выходных, и его козырь — широта: немного большее окно, более высокий композитный показатель общего рассуждения и более дешёвый выходной токен.
Итак, честная формулировка — не «лучше против хуже». Это извлечение из памяти против рассуждения, и это определяется тем, что вы делаете с миллионом токенов, когда уже загрузили их.
Окна на бумаге одинакового размера
Обе карточки заявляют примерно миллион токенов, и разница здесь чисто косметическая. Окно Kimi K3 — 1 048 576 токенов, ровно 2^20, тот самый «двоичный миллион», который указывает каждая модель с длинным контекстом. У GPT-6 Sol — 1 050 000, круглое десятичное число, примерно на 1 400 токенов больше. Для любой нагрузки, которая у вас реально поместится, это одно и то же окно. Не выбирайте по этому критерию.
Что действительно отличается, так это остальная часть оболочки, и это короткий список.
• Контекст: Kimi K3 — 1 048 576 токенов, GPT-6 Sol — 1 050 000; практически на одном уровне
• Модальность ввода: Kimi K3 принимает текст и изображения; GPT-6 Sol принимает текст, изображения и файлы
• Максимальный объём вывода: GPT-6 Sol — 128 000 токенов за один ответ; в карточке Kimi K3 не указан максимальный объём вывода
• Стандартная цена: Kimi K3 — $3.00 за вход / $15.00 за выход за миллион токенов, GPT-6 Sol — $2.00 за вход / $10.00 за выход
• Кэшированный ввод: Kimi K3 — $0.30 за миллион токенов, GPT-6 Sol — $0.20 за миллион токенов
• Ценообразование для длинного контекста: Kimi K3 указывает единый тариф без документированного уровня; GPT-6 Sol пересчитывает стоимость всего запроса при превышении 272 000 входных токенов до $4.00 за вход / $15.00 за выход
• Управление рассуждениями: GPT-6 Sol предоставляет настраиваемый reasoning.effort; Kimi K3 предоставляет параметры reasoning и reasoning-effort через тот же интерфейс, совместимый с OpenAI
Отсутствующий потолок вывода у Kimi K3 стоит отметить, а не сгладить: MoonshotAI публикует показатель контекста и не публикует показатель максимального вывода, поэтому система, которая зависит от жёсткого ограничения на вывод для бюджетирования, не может прочитать его с карточки. Долгоконтекстный уровень — это другая асимметрия, и она работает в неинтуитивном направлении: заявленная ставка GPT-6 Sol ниже, но его пересчёт стоимости всего запроса свыше 272K означает, что вызов на 300 000 токенов тарифицируется по $4.00 / $15.00 с первого токена, тогда как единая ставка Kimi K3 $3.00 / $15.00 вообще не документирована как ступенчатая. Для очень длинного документа Kimi K3 может оказаться дешевле из двух по входу, несмотря на более высокую заявленную ставку.
Recall — это реальный продукт Kimi K3
Причина обратиться к Kimi K3 не в том, что у него большое окно, — таких моделей немало. А в том, что он удерживает то, что в нём есть. В оценке Artificial Analysis на удержание информации в длинном контексте, включённой в каталог моделей, Kimi K3 набирает 88,7% против 83,7% у GPT-6 Sol. Это разрыв в пять пунктов именно в том тесте, который измеряет, способна ли модель найти и использовать деталь, скрытую в длинном входном тексте, и именно такие разрывы проявляются как реальные сбои в продакшене — суммаризатор, который теряет пункт на 400-й странице, проверяющий договоры, который пропускает раздел о возмещении убытков.
Kimi K3 также лидирует в программировании, причём с более широким отрывом, чем предполагает сводный индекс. В индексе программирования он занимает 76,2 балла и входит в первую десятку среди оценённых моделей, а также показывает 85,0% на terminal-bench v2.1 — агентном бенчмарке командной строки, от которого зависит полезность агента-программиста. Его результат по GPQA Diamond — 93,5% — относится к верхнему диапазону рейтинга.
А вот где GPT-6 Sol даёт ответ — так это в композитных показателях и научном коде. Его индекс общего интеллекта — 47,6 — на четыре пункта выше, чем 43,6 у Kimi K3, и близок к верхнему децилю; в SciCode они примерно равны — 57,6% и 59,5% соответственно, — и разница укладывается в шум одного запуска; а в Humanity's Last Exam 47,9% у GPT-6 Sol немного превосходят 46,9% у Kimi K3. Ни одно из этих различий по отдельному бенчмарку не достаточно велико, чтобы выбирать только по нему.

Стоимость за рабочую нагрузку, а не по прайс-листу
Тарифные сетки вводят в заблуждение, потому что соотношение входных и выходных токенов различается для каждой задачи, и эти две модели расходятся во мнениях о том, какая сторона сделки дешевле. Kimi K3 дешевле при допущении, что ваша работа в основном связана с вводом — длинные документы на входе, короткие ответы на выходе. GPT-6 Sol дешевле при допущении, что ваша работа сбалансирована или смещена в сторону вывода, поскольку его тариф на вывод на треть ниже.
• Сценарий «прочитать одну книгу и пересказать её» (900K на входе, 4K на выходе): Kimi K3 ≈ $2.76, GPT-6 Sol ≈ $3.64 до срабатывания пересмотра тарифов на пороге 272K; при пересмотре тарифов весь вызов GPT-6 Sol переходит на более высокий уровень, и разрыв увеличивается
• Сбалансированный агентный сценарий (60K на входе, 20K на выходе): Kimi K3 ≈ $0.48, GPT-6 Sol ≈ $0.32
• Сценарий генерации кода (30K на входе, 60K на выходе): Kimi K3 ≈ $0.99, GPT-6 Sol ≈ $0.66
Это чистая арифметика по токенам на основе опубликованных тарифов каждого вендора, и она не учитывает кэшированный ввод, что выгодно той модели, с которой вы чаще всего кэшируете. Важна форма ответа: для чистой работы с длинным вводом на припоминание выигрывает фиксированный тариф Kimi K3, а для всего, что много пишет в ответ, выигрывает более низкий тариф GPT-6 Sol за вывод. Ни один из них не дешевле универсально, и сравнение, которое называет одного победителя по цене, не указывая соотношение токенов, ничего не измеряет.
Происхождение — часть решения
Kimi K3 создан компанией MoonshotAI, китайской лабораторией, а GPT-6 Sol — компанией OpenAI. Это различие не является бенчмарком и не указывается в тарифном листе, но для регулируемых рабочих нагрузок оно определяет шорт-лист ещё до обсуждения цены. В карточке MoonshotAI в каталоге не публикуется поле лицензии, поэтому ничто здесь не следует трактовать как заявление о доступности весов ни в ту, ни в другую сторону — если открытые веса важны для вашего развёртывания, проверьте это у первоисточника, а не предполагайте по названию семейства.
Для команд, которым нужно и то и другое — модель китайской лаборатории для одной части пайплайна и модель OpenAI для другой, а маршрутизация, биллинг и вопросы резидентности данных решаются в одном месте, — именно поэтому один шлюз стоит иметь вместо двух наборов учётных данных. В OrcaRouter и kimi/kimi-k3, и GPT-6 Sol — это живые маршруты в одном каталоге, по прайс-листовой цене провайдера с наценкой 0%, так что изменение тарифов MoonshotAI или OpenAI вступает в силу в тот же день. Автоматическое переключение при сбое означает, что деградация маршрута у любого из провайдеров не выводит пайплайн из строя, а DSL маршрутизации позволяет направлять задачи с высокой нагрузкой на извлечение в Kimi K3, а задачи с высокой нагрузкой на генерацию — в GPT-6 Sol по правилу, а не на глаз.

Какой из них добавить в пайплайн?
Выбирайте Kimi K3, когда задача — это поиск и удержание информации в очень длинных входных данных — юридическая и медицинская проверка документов, понимание кода по всему репозиторию, анализ расшифровок по сотням документов — и когда ваши запросы настолько насыщены входными данными, что фиксированная ставка $3.00 оказывается выгоднее новых цен GPT-6 Sol. Его преимущество по полноте извлечения и место в первой десятке по программированию — это две цифры, которые оправдывают такой выбор.
Выбирайте GPT-6 Sol, когда задача — это универсальный ассистент с миллионным окном контекста: смешанные рассуждения, сериализация в JSON, агентные циклы, которые много пишут обратно, и любой рабочий процесс, где потолок вывода в 128 000 токенов — это преимущество, а не ограничение. Он дешевле на выводе, предоставляет явное управление интенсивностью рассуждений, а его составной индекс — более сильный общий сигнал. Там, где конвейер действительно делает и то и другое, честный ответ — маршрутизировать, а не выбирать, — и это утверждение о структуре вашего трафика, а не о той или иной модели.

Сравнение в этой статье1
Определено по этой статье · Бенчмарки: Artificial Analysis · обновляется ежедневно
