
GPT-6.1 Sol против Kimi K3: скачать уже можно, но это по-прежнему не дешёвый вариант
- openaiНОВИНКАOpenAI: GPT-6.1 Sol2026-09-2952Интеллект
- anthropicНОВИНКАAnthropic: Claude Sonnet 5.52026-09-2856Интеллект
- typesafeНОВИНКАTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 за 1 млн токенов · 161 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238Интеллект
- OpenAIOpenAI: GPT-6 Sol2026-09-2248Интеллект
- AnthropicAnthropic: Claude Opus 5.52026-09-2258Интеллект
- xAIGrok 4.72026-09-2146Интеллект
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 за 1 млн токенов · 79 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 за 1 млн токенов · 320 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Интеллект
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Интеллект77Кодинг
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Интеллект76Кодинг
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Интеллект76Кодинг
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Интеллект82Кодинг
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 за 1 млн токенов · 53 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 за 1 млн токенов · 301 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Интеллект72Кодинг
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 за 1 млн токенов · 232 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Интеллект75Кодинг
- obsidianQwen3.8 27B2026-08-1534Интеллект68Кодинг
Kimi K3 — это контрпример, который обычно разрешает споры такого рода. Moonshoot AI выпустила модель с 2,8 триллиона параметров в июле 2026 года и опубликовала веса — moonshotai/Kimi-K3 находится на Hugging Face, без ограничений, с более чем миллионом загрузок и последней ревизией в сентябре. Так что здесь нет звёздочки «открыто в принципе, но придержано для усиления безопасности», нет двухнедельной задержки, которую нужно переждать. GPT-6.1 Sol, которую OpenAI выпустила 29 сентября 2026 года, закрыта и доступна только через API, и так будет всегда. И на независимом лидерборде загружаемая модель набирает 43,6 против 51,8 у закрытой модели, при этом стоимость завершённой задачи индекса составляет $2,00 против $0,72. Открытые веса должны были бы быть дешёвым запасным выходом; в этой паре они оказываются дорогой стороной сделки, и причина не в лицензии.
Что представляет собой каждая модель
Kimi K3 — это разреженная модель смеси экспертов с общим числом параметров 2,8 триллиона и примерно 104 миллиардами — около 3,7 % — активных на токен. Она несёт контекстное окно в 1 048 576 токенов, принимает на вход текст и изображения и возвращает текст. Опубликованный чекпоинт — это FP8-артефакт, и его скачивание действительно очень объёмное; развёртывание в продакшене на собственном оборудовании — это решение уровня кластера, а не рабочей станции. Архитектурное заявление Moonshot — это гибридная схема линейного внимания, которая, по словам компании, существенно быстрее при декодировании в длинном контексте, плюс работа над остаточными соединениями и маршрутизацией, благодаря которой модель с 2,8 триллиона параметров вообще стала обслуживаемой.
GPT-6.1 Sol — это обновление среднего уровня от OpenAI — ниже GPT-6 Astra, выше GPT-6 Luna — с окном в 1 050 000 токенов, максимальным объёмом вывода 128 000 токенов, вводом текста, изображений и файлов, а также датой отсечения знаний 30 апреля 2026 года. Рассуждения работают в диапазоне от низкого до максимального, при этом средний используется по умолчанию; ступень «нет», которую принимала предыдущая GPT-6 Sol, теперь полностью отклоняется, а собственное примечание OpenAI о миграции указывает разработчикам на низкий уровень вместо неё. Стоимость составляет $2.00 и $10.00 за миллион токенов, кэшированный ввод — $0.10.
По одной строке на каждое измерение, обе стороны — на каждом:
• Входные данные — GPT-6.1 Sol 2,00 $ за 1 млн против Kimi K3 3,00 $ за 1 млн
• Выходные данные — GPT-6.1 Sol 10,00 $ за 1 млн против Kimi K3 15,00 $ за 1 млн
• Кэшированный ввод — GPT-6.1 Sol 0,10 $ за 1 млн против Kimi K3 0,30 $ за 1 млн
• Контекстное окно — 1 050 000 токенов против 1 048 576 токенов; разница 0,1%, несущественна
• Максимальный вывод — 128 000 токенов у обоих
• Общее и активное число параметров — не раскрыто против 2 800 млрд общих, 104 млрд активных на токен
• Модальность — текст, изображение и файл на входе, текст на выходе против текста и изображения на входе, текст на выходе
• Веса — закрытые, только API против открытых, без ограничений, более 1 млн загрузок
• Пункт о длинном контексте — переоценивает весь запрос свыше 272 000 входных токенов: в 2 раза для входных данных и кэша и в 1,5 раза для выходных данных, против отсутствия аналогичного пункта в опубликованной карточке
• Intelligence Index, независимый, максимальное усилие — 51,8 против 43,6
• Стоимость за задачу индекса, независимо — 0,72 $ против 2,00 $
• Выходные токены в прогоне индекса — 67 млн против 160 млн, при медиане по лидерборду в 140 млн для его класса сравнения
Единственная оценка, в которой K3 побеждает, и почему это важно
Перед арифметикой — исключение, потому что оно реально. При оценке по каждому тесту при максимальном усилии на Artificial Analysis v4.3.2 GPT-6.1 Sol лидирует в семи из десяти и не имеет ничьих, но модель, побеждающая в оценке рассуждений с длинным контекстом, — K3:
• AA-LCR v1.1 — Kimi K3 0,887 против GPT-6.1 Sol 0,830. Преимущество в шесть пунктов на оценке, созданной специально для рассуждений над длинными входными данными.
• SciCode — Kimi K3 0,595 против GPT-6.1 Sol 0,542. K3 также лидирует в научном программировании.
• Terminal-Bench 4.0 — Kimi K3 0,126 против GPT-6.1 Sol 0,561. Разрыв в 43 пункта в обратную сторону — и, безусловно, самый большой разрыв в этом сопоставлении.
• Humanity's Last Exam — Kimi K3 0,469 против GPT-6.1 Sol 0,529.
• AA-Omniscience — Kimi K3 19,7 против GPT-6.1 Sol 41,5; по фактической достоверности эти две модели относятся к разным классам.
• GDPval-AA v2.1 — Kimi K3 Elo 1536,5 против GPT-6.1 Sol Elo 1575,1.
• MMMU-Pro — Kimi K3 0,805 против GPT-6.1 Sol 0,860.
• AutomationBench-AA, GDP.pdf, CritPt — K3 0,583, 0,22 и 0,234; Sol 0,649, 0,310 и 0,317.
Результат AA-LCR — это тот, который стоит воспринимать всерьёз, потому что это единственная цифра, противоречащая истории о стоимости за задачу, и он указывает на рабочую нагрузку, где кажущийся дешёвым ответ неверен в обоих направлениях. Если ваш трафик — это очень длинные входные данные, скромный сгенерированный ответ и интенсивное повторное использование стабильного префикса — профиль, в котором многословие так и не успевает навредить, — то K3 с его сочетанием оценки длинного контекста топового уровня, поддержки ввода изображений и скачиваемого чекпоинта подходит лучше, чем Sol, а показатель стоимости за задачу для прогона по индексу к вам не применим. Это честная версия фразы «за открытые веса стоит доплачивать»: иногда открытая модель просто лучше подходит для задачи, и здесь это так по одной оси.
Также стоит назвать, что общего у этих двух побед. K3 силён там, где на задачу можно ответить одним длительным актом чтения или рассуждения, и слаб там, где её приходится выполнять множеством мелких шагов и проверять. Разрыв в 43 пункта в Terminal-Bench и разрыв в 22 пункта по всезнанию — это один и тот же вывод, увиденный с двух сторон: устойчивое агентное выполнение — не то, для чего был оптимизирован этот чекпоинт.
Арифметика, которая, собственно, и решает исход
Тарифная сетка K3 по каждой позиции в 1,5 раза выше, чем у Sol, а измеренная стоимость за выполненную задачу индексации — в 2,8 раза выше; разница между 1,5 и 2,8 полностью объясняется объёмом токенов. Собственное измерение совета — 160 млн выходных токенов для K3 против 67 млн для Sol на одном и том же наборе из десяти оценок. K3 выдаёт в 2,4 раза больше выходных токенов при цене в 1,5 раза выше, а 2,4 × 1,5 = 3,6 — показатель совета «$2,00 против $0,72» немного мягче чистого соотношения, поскольку вклады входных данных и кэша слегка его компенсируют, но направление не оспаривается.
Собственный маркетинг Moonshoot идёт вразрез с этим, и на это стоит внимательно посмотреть. Компания утверждает, что K3 выдаёт меньше выходных токенов, чем её предшественник, а архитектурная работа — схема внимания, дизайн остаточных связей — нацелена непосредственно на стоимость декодирования длинного контекста. И то и другое может быть правдой, даже если модель всё ещё вдвое многословнее медианы по общему набору бенчмарков. Эти два утверждения о разном: об эффективности относительно предыдущей Kimi и об эффективности относительно всей отрасли. Только второе — то, по чему вам выставляют счёт, и именно его измеряет независимый совет.
Кэширование это сглаживает. Обе ставки для кэшированного ввода составляют десятую часть ставки своей модели за некэшированный ввод — $0.30 для K3, $0.10 для Sol, — так что строка кэша не меняет порядок, но она означает, что нагрузка с большим числом запросов и малым объёмом ответов сужает разрыв примерно до соотношения из тарифной сетки, а не до измеренного соотношения по задачам. А пункт Sol о длинном контексте действует в обратную сторону: свыше 272 000 входных токенов он пересчитывает весь запрос по $4.00 и $15.00, а с кэшем — по $0.20, и это единственный диапазон, где плоская тарифная сетка K3 выигрывает безоговорочно. Это стоит знать по двум причинам, потому что это ещё и диапазон, где показатель K3 для длинного контекста — лучшее число в этом сравнении.

Чего здесь на самом деле стоят открытые веса?
Три вещи, и их стоит различать, потому что «открытые веса» обычно используются как один аргумент, а их три.
Первое — вы можете уйти. Если Moonshoot будет приобретён, изменит лицензию для будущих версий, объявит K3 устаревшим или поднимет цену на API, уже скачанный вами чекпоинт продолжит работать. Для этой лаборатории это не гипотетическая ситуация: Moonshoot приостановил новые подписки примерно через 48 часов после одного из предыдущих релизов, чтобы сохранить качество обслуживания для существующих платящих клиентов, — и это наглядная демонстрация того, что доступ к API — это вопрос политики, а не неотъемлемое свойство. Ничего из этого не видно в таблице затрат на задачу, и всё это реально.
Второе: вы можете закрепить версию. Фиксированная ревизия, дообученная, работающая внутри подконтрольной вам границы, — это то, что можно показать аудитору, а API предоставить не может. Для регулируемого трафика это ценнее, чем тарифная сетка.
Третий — обычно подразумеваемый — заключается в том, что это будет дешевле. Это не так. Чекпоинт — это FP8-артефакт с 2,8 триллионами параметров, и опубликованное руководство по развёртыванию ориентировано на конфигурации с несколькими ускорителями, а не на один узел. Команда, уже эксплуатирующая кластер такого класса, имеет здесь реальный выбор, и расчёт полностью меняется, потому что предельная стоимость токена становится стоимостью электроэнергии. Команда, у которой его нет, сравнивает счёт за API с капитальной покупкой, и счёт за API выигрывает с большим отрывом. Честный вывод: открытые веса здесь дают вам возможность уйти, а не возможность дёшево работать.
Оба на одной клавише — именно это и делает такой обмен полезным
Kimi K3 доступен на OrcaRouter по собственной цене Moonshot из прайс-листа — $3.00 и $15.00 за миллион токенов, чтение из кэша — $0.30, без изменений относительно карточки вендора — а GPT-6.1 Sol появился на наших маршрутах по цене OpenAI в день релиза: $2.00 и $10.00, кэшированный ввод — $0.10, а шаг в 272 000 токенов передан точно так, как указано. К обоим ничего не добавляется. Платформа передаёт цену провайдера из прайс-листа, а не наценивает её, поэтому изменение тарифа Moonshot и изменение тарифа OpenAI появляются у нас в тот же день, когда появляются у вендора, без второго контракта или посредника между нами.

Причина, по которой это важнее для данной пары, чем для большинства, состоит в том, что эти две модели относятся к разным режимам отказов. GPT-6.1 Sol — это модель, которую запускают для длительного выполнения, циклов работы с инструментами и фактологической надёжности; Kimi K3 — это модель, которую запускают для очень длинных входных данных, когда нужен лучший результат на длинном контексте и чекпойнт как страховка от чужого бизнес-решения. Это не конкурирующие варианты, а два маршрута в одном и том же трафике. Держать обе за одним эндпоинтом, с автоматическим переключением при сбое между ними и правилом, которое переводит работу с длинными входными данными на K3, а исполнительскую работу — на Sol, — именно это превращает «у нас есть open-weight fallback» из строки в проектном документе в нечто работающее в три часа ночи во время звонка, который срывается.

Где каждому из них место
• Терминальные агенты, программирование в масштабе репозитория, многошаговое выполнение — GPT-6.1 Sol, с отрывом в 43 пункта в Terminal-Bench 4.0. Это даже не близко.
• Ответы там, где галлюцинация обходится дорого — GPT-6.1 Sol, с отрывом в 22 пункта в AA-Omniscience.
• Очень длинные входные данные и короткий сгенерированный ответ — Kimi K3. Лучший результат в рассуждениях на длинном контексте в этом сравнении, ввод изображений и многословность, которой так и негде проявиться.
• Самостоятельный хостинг или стек инференса, который вы должны иметь возможность заморозить — Kimi K3, и только если вы уже эксплуатируете это оборудование. Чекпоинт — это то, что вы получаете; экономика его запуска — отдельный вопрос.
• Страховка на случай, если поставщик изменит условия — Kimi K3, и это единственный аргумент, на который GPT-6.1 Sol не может ответить ни за какую цену.
• Выбор по тарифной сетке — ни K3, ни Sol не являются дешёвым вариантом в этом сравнении, и ни один из них не является дешёвым вариантом в линейке GPT-6. Если счёт — решающий критерий, нужная вам модель находится ниже в прайс-листе, а не в этой таблице.
Сравнение в этой статье1
Определено по этой статье · Бенчмарки: Artificial Analysis · обновляется ежедневно
