Сгенерированное сравнительное табло из двух колонок под названием «GPT-6.1 Sol против Kimi K3 — табло». Левый столбец «GPT-6.1 Sol»: строки «Индекс интеллекта: 51,8», «Стоимость одной задачи индекса: $0,72», «Выходные токены за прогон индекса: 67 млн», «AA-LCR длинный контекст: 0,83», «Контекстное окно: 1 050 000», «Веса: закрытые». Правый столбец «Kimi K3»: строки «Индекс интеллекта: 43,6», «Стоимость одной задачи индекса: $2,00», «Выходные токены за прогон индекса: 160 млн», «AA-LCR длинный контекст: 0,89», «Контекстное окно: 1 048 576», «Веса: открытые на Hugging Face». В нижнем колонтитуле написано: «Независимые показатели по данным Artificial Analysis v4.3.2 при максимальных усилиях».
Guides & Insights

GPT-6.1 Sol против Kimi K3: скачать уже можно, но это по-прежнему не дешёвый вариант

Автор

Elias Hawthorne

Дата публикации

Новые модели · 20Все модели →
Бенчмарки: Artificial Analysis · обновляется ежедневно
Назад ко всем статьям

Kimi K3 — это контрпример, который обычно разрешает споры такого рода. Moonsh​oot AI выпустила модель с 2,8 триллиона параметров в июле 2026 года и опубликовала веса — moonshotai/Kimi-K3 находится на Hugging Face, без ограничений, с более чем миллионом загрузок и последней ревизией в сентябре. Так что здесь нет звёздочки «открыто в принципе, но придержано для усиления безопасности», нет двухнедельной задержки, которую нужно переждать. GPT-6.1 Sol, которую Open​AI выпустила 29 сентября 2026 года, закрыта и доступна только через API, и так будет всегда. И на независимом лидерборде загружаемая модель набирает 43,6 против 51,8 у закрытой модели, при этом стоимость завершённой задачи индекса составляет $2,00 против $0,72. Открытые веса должны были бы быть дешёвым запасным выходом; в этой паре они оказываются дорогой стороной сделки, и причина не в лицензии.

Что представляет собой каждая модель

Kimi K3 — это разреженная модель смеси экспертов с общим числом параметров 2,8 триллиона и примерно 104 миллиардами — около 3,7 % — активных на токен. Она несёт контекстное окно в 1 048 576 токенов, принимает на вход текст и изображения и возвращает текст. Опубликованный чекпоинт — это FP8-артефакт, и его скачивание действительно очень объёмное; развёртывание в продакшене на собственном оборудовании — это решение уровня кластера, а не рабочей станции. Архитектурное заявление Moonshot — это гибридная схема линейного внимания, которая, по словам компании, существенно быстрее при декодировании в длинном контексте, плюс работа над остаточными соединениями и маршрутизацией, благодаря которой модель с 2,8 триллиона параметров вообще стала обслуживаемой.

GPT-6.1 Sol — это обновление среднего уровня от OpenAI — ниже GPT-6 Astra, выше GPT-6 Luna — с окном в 1 050 000 токенов, максимальным объёмом вывода 128 000 токенов, вводом текста, изображений и файлов, а также датой отсечения знаний 30 апреля 2026 года. Рассуждения работают в диапазоне от низкого до максимального, при этом средний используется по умолчанию; ступень «нет», которую принимала предыдущая GPT-6 Sol, теперь полностью отклоняется, а собственное примечание OpenAI о миграции указывает разработчикам на низкий уровень вместо неё. Стоимость составляет $2.00 и $10.00 за миллион токенов, кэшированный ввод — $0.10.

По одной строке на каждое измерение, обе стороны — на каждом:

• Входные данные — GPT-6.1 Sol 2,00 $ за 1 млн против Kimi K3 3,00 $ за 1 млн
• Выходные данные — GPT-6.1 Sol 10,00 $ за 1 млн против Kimi K3 15,00 $ за 1 млн
• Кэшированный ввод — GPT-6.1 Sol 0,10 $ за 1 млн против Kimi K3 0,30 $ за 1 млн
• Контекстное окно — 1 050 000 токенов против 1 048 576 токенов; разница 0,1%, несущественна
• Максимальный вывод — 128 000 токенов у обоих
• Общее и активное число параметров — не раскрыто против 2 800 млрд общих, 104 млрд активных на токен
• Модальность — текст, изображение и файл на входе, текст на выходе против текста и изображения на входе, текст на выходе
• Веса — закрытые, только API против открытых, без ограничений, более 1 млн загрузок
• Пункт о длинном контексте — переоценивает весь запрос свыше 272 000 входных токенов: в 2 раза для входных данных и кэша и в 1,5 раза для выходных данных, против отсутствия аналогичного пункта в опубликованной карточке
• Intelligence Index, независимый, максимальное усилие — 51,8 против 43,6
• Стоимость за задачу индекса, независимо — 0,72 $ против 2,00 $
• Выходные токены в прогоне индекса — 67 млн против 160 млн, при медиане по лидерборду в 140 млн для его класса сравнения

Единственная оценка, в которой K3 побеждает, и почему это важно

Перед арифметикой — исключение, потому что оно реально. При оценке по каждому тесту при максимальном усилии на Artificial Analysis v4.3.2 GPT-6.1 Sol лидирует в семи из десяти и не имеет ничьих, но модель, побеждающая в оценке рассуждений с длинным контекстом, — K3:

• AA-LCR v1.1 — Kimi K3 0,887 против GPT-6.1 Sol 0,830. Преимущество в шесть пунктов на оценке, созданной специально для рассуждений над длинными входными данными.
• SciCode — Kimi K3 0,595 против GPT-6.1 Sol 0,542. K3 также лидирует в научном программировании.
• Terminal-Bench 4.0 — Kimi K3 0,126 против GPT-6.1 Sol 0,561. Разрыв в 43 пункта в обратную сторону — и, безусловно, самый большой разрыв в этом сопоставлении.
• Humanity's Last Exam — Kimi K3 0,469 против GPT-6.1 Sol 0,529.
• AA-Omniscience — Kimi K3 19,7 против GPT-6.1 Sol 41,5; по фактической достоверности эти две модели относятся к разным классам.
• GDPval-AA v2.1 — Kimi K3 Elo 1536,5 против GPT-6.1 Sol Elo 1575,1.
• MMMU-Pro — Kimi K3 0,805 против GPT-6.1 Sol 0,860.
• AutomationBench-AA, GDP.pdf, CritPt — K3 0,583, 0,22 и 0,234; Sol 0,649, 0,310 и 0,317.

Результат AA-LCR — это тот, который стоит воспринимать всерьёз, потому что это единственная цифра, противоречащая истории о стоимости за задачу, и он указывает на рабочую нагрузку, где кажущийся дешёвым ответ неверен в обоих направлениях. Если ваш трафик — это очень длинные входные данные, скромный сгенерированный ответ и интенсивное повторное использование стабильного префикса — профиль, в котором многословие так и не успевает навредить, — то K3 с его сочетанием оценки длинного контекста топового уровня, поддержки ввода изображений и скачиваемого чекпоинта подходит лучше, чем Sol, а показатель стоимости за задачу для прогона по индексу к вам не применим. Это честная версия фразы «за открытые веса стоит доплачивать»: иногда открытая модель просто лучше подходит для задачи, и здесь это так по одной оси.

Также стоит назвать, что общего у этих двух побед. K3 силён там, где на задачу можно ответить одним длительным актом чтения или рассуждения, и слаб там, где её приходится выполнять множеством мелких шагов и проверять. Разрыв в 43 пункта в Terminal-Bench и разрыв в 22 пункта по всезнанию — это один и тот же вывод, увиденный с двух сторон: устойчивое агентное выполнение — не то, для чего был оптимизирован этот чекпоинт.

Арифметика, которая, собственно, и решает исход

Тарифная сетка K3 по каждой позиции в 1,5 раза выше, чем у Sol, а измеренная стоимость за выполненную задачу индексации — в 2,8 раза выше; разница между 1,5 и 2,8 полностью объясняется объёмом токенов. Собственное измерение совета — 160 млн выходных токенов для K3 против 67 млн для Sol на одном и том же наборе из десяти оценок. K3 выдаёт в 2,4 раза больше выходных токенов при цене в 1,5 раза выше, а 2,4 × 1,5 = 3,6 — показатель совета «$2,00 против $0,72» немного мягче чистого соотношения, поскольку вклады входных данных и кэша слегка его компенсируют, но направление не оспаривается.

Собственный маркетинг Moonsh​oot идёт вразрез с этим, и на это стоит внимательно посмотреть. Компания утверждает, что K3 выдаёт меньше выходных токенов, чем её предшественник, а архитектурная работа — схема внимания, дизайн остаточных связей — нацелена непосредственно на стоимость декодирования длинного контекста. И то и другое может быть правдой, даже если модель всё ещё вдвое многословнее медианы по общему набору бенчмарков. Эти два утверждения о разном: об эффективности относительно предыдущей Kimi и об эффективности относительно всей отрасли. Только второе — то, по чему вам выставляют счёт, и именно его измеряет независимый совет.

Кэширование это сглаживает. Обе ставки для кэшированного ввода составляют десятую часть ставки своей модели за некэшированный ввод — $0.30 для K3, $0.10 для Sol, — так что строка кэша не меняет порядок, но она означает, что нагрузка с большим числом запросов и малым объёмом ответов сужает разрыв примерно до соотношения из тарифной сетки, а не до измеренного соотношения по задачам. А пункт Sol о длинном контексте действует в обратную сторону: свыше 272 000 входных токенов он пересчитывает весь запрос по $4.00 и $15.00, а с кэшем — по $0.20, и это единственный диапазон, где плоская тарифная сетка K3 выигрывает безоговорочно. Это стоит знать по двум причинам, потому что это ещё и диапазон, где показатель K3 для длинного контекста — лучшее число в этом сравнении.

A generated hero card for a GPT-6.1 Sol versus Kimi K3 comparison, headed 'The download exists, and it is still the dearer option', with two badges reading 'Kimi K3: $2.00 per index task' and 'GPT-6.1 Sol: $0.72 per index task', and the OrcaRouter logo in the bottom-right corner.

Чего здесь на самом деле стоят открытые веса?

Три вещи, и их стоит различать, потому что «открытые веса» обычно используются как один аргумент, а их три.

Первое — вы можете уйти. Если Moonsh​oot будет приобретён, изменит лицензию для будущих версий, объявит K3 устаревшим или поднимет цену на API, уже скачанный вами чекпоинт продолжит работать. Для этой лаборатории это не гипотетическая ситуация: Moonsh​oot приостановил новые подписки примерно через 48 часов после одного из предыдущих релизов, чтобы сохранить качество обслуживания для существующих платящих клиентов, — и это наглядная демонстрация того, что доступ к API — это вопрос политики, а не неотъемлемое свойство. Ничего из этого не видно в таблице затрат на задачу, и всё это реально.

Второе: вы можете закрепить версию. Фиксированная ревизия, дообученная, работающая внутри подконтрольной вам границы, — это то, что можно показать аудитору, а API предоставить не может. Для регулируемого трафика это ценнее, чем тарифная сетка.

Третий — обычно подразумеваемый — заключается в том, что это будет дешевле. Это не так. Чекпоинт — это FP8-артефакт с 2,8 триллионами параметров, и опубликованное руководство по развёртыванию ориентировано на конфигурации с несколькими ускорителями, а не на один узел. Команда, уже эксплуатирующая кластер такого класса, имеет здесь реальный выбор, и расчёт полностью меняется, потому что предельная стоимость токена становится стоимостью электроэнергии. Команда, у которой его нет, сравнивает счёт за API с капитальной покупкой, и счёт за API выигрывает с большим отрывом. Честный вывод: открытые веса здесь дают вам возможность уйти, а не возможность дёшево работать.

Оба на одной клавише — именно это и делает такой обмен полезным

Kimi K3 доступен на OrcaRouter по собственной цене Moonshot из прайс-листа — $3.00 и $15.00 за миллион токенов, чтение из кэша — $0.30, без изменений относительно карточки вендора — а GPT-6.1 Sol появился на наших маршрутах по цене OpenAI в день релиза: $2.00 и $10.00, кэшированный ввод — $0.10, а шаг в 272 000 токенов передан точно так, как указано. К обоим ничего не добавляется. Платформа передаёт цену провайдера из прайс-листа, а не наценивает её, поэтому изменение тарифа Moonshot и изменение тарифа OpenAI появляются у нас в тот же день, когда появляются у вендора, без второго контракта или посредника между нами.

A screenshot of the OrcaRouter model page for kimi/kimi-k3, showing the listing dated 2026-07-15, the model described as Moonshot AI's 2.8-trillion-parameter mixture-of-experts flagship for long-horizon coding and end-to-end knowledge work, a 1M-token context with text and image input, and the list price of $3.00 input and $15.00 output per million tokens with an 8.48 s median time to first token.

Причина, по которой это важнее для данной пары, чем для большинства, состоит в том, что эти две модели относятся к разным режимам отказов. GPT-6.1 Sol — это модель, которую запускают для длительного выполнения, циклов работы с инструментами и фактологической надёжности; Kimi K3 — это модель, которую запускают для очень длинных входных данных, когда нужен лучший результат на длинном контексте и чекпойнт как страховка от чужого бизнес-решения. Это не конкурирующие варианты, а два маршрута в одном и том же трафике. Держать обе за одним эндпоинтом, с автоматическим переключением при сбое между ними и правилом, которое переводит работу с длинными входными данными на K3, а исполнительскую работу — на Sol, — именно это превращает «у нас есть open-weight fallback» из строки в проектном документе в нечто работающее в три часа ночи во время звонка, который срывается.

A screenshot of the OrcaRouter model page for openai/gpt-6.1-sol, showing the listing dated 2026-09-29, a 1M-token context with 128K maximum output, text, image and file input, a reasoning effort ladder running from low to max, and the pass-through list price of $2.00 input and $10.00 output per million tokens with cached input at $0.10.

Где каждому из них место

• Терминальные агенты, программирование в масштабе репозитория, многошаговое выполнение — GPT-6.1 Sol, с отрывом в 43 пункта в Terminal-Bench 4.0. Это даже не близко.
• Ответы там, где галлюцинация обходится дорого — GPT-6.1 Sol, с отрывом в 22 пункта в AA-Omniscience.
• Очень длинные входные данные и короткий сгенерированный ответ — Kimi K3. Лучший результат в рассуждениях на длинном контексте в этом сравнении, ввод изображений и многословность, которой так и негде проявиться.
• Самостоятельный хостинг или стек инференса, который вы должны иметь возможность заморозить — Kimi K3, и только если вы уже эксплуатируете это оборудование. Чекпоинт — это то, что вы получаете; экономика его запуска — отдельный вопрос.
• Страховка на случай, если поставщик изменит условия — Kimi K3, и это единственный аргумент, на который GPT-6.1 Sol не может ответить ни за какую цену.
• Выбор по тарифной сетке — ни K3, ни Sol не являются дешёвым вариантом в этом сравнении, и ни один из них не является дешёвым вариантом в линейке GPT-6. Если счёт — решающий критерий, нужная вам модель находится ниже в прайс-листе, а не в этой таблице.

Сравнение в этой статье1

Определено по этой статье · Бенчмарки: Artificial Analysis · обновляется ежедневно