Kimi K3 — флагманская модель Moonshot AI и самый мощный на сегодняшний день релиз — модель Mixture-of-Experts с 2,8 трлн параметров, созданная для долгосрочного кодирования и сквозной работы со знаниями. Она сочетает контекстное окно в 1 млн токенов с нативным визуальным восприятием, принимает текстовый и графический ввод с текстовым выводом и предназначена для сохранения связности в течение очень длительных агентных сессий. Moonshot позиционирует K3 для сценариев программирования-агентов, таких как Codex, Claude Code, Cline и RooCode, а также для глубоких рассуждений и работы со знаниями. Он предоставляет контроль верхнего уровня reasoning_effort и нативный вызов инструментов, а также использует формат API OpenAI для бесшовной интеграции. Обратите внимание, что K3 не принимает параметры сэмплирования (нет temperature / top_p / seed) — глубина рассуждений вместо этого управляется через reasoning_effort.
MoonshotAI Kimi K3 — это большая языковая модель, разработанная компанией MoonshotAI, китайской компанией в области ИИ. Она поддерживает контекстное окно размером 1,048,576 токенов и принимает как…
Основная возможность Kimi K3 заключается в обработке контекстного окна размером до 1 048 576 токенов, что позволяет включать целые романы, длинные технические руководства или обширные истории разговоров в один запрос. Она также принимает изображения, обеспечивая мультимодальное мышление. Модель может выполнять такие задачи, как обобщение, ответы на вопросы и генерация в пределах очень длинных входных данных. Она способна понимать сложные инструкции и следовать им на протяжении длинных последовательностей. Она поддерживает API-параметры, совместимые с OpenAI, такие как temperature, max_tokens, top_p и стоп-последовательности, через OrcaRouter.
Kimi K3 лучше всего использовать, когда задача по своей сути требует очень большого контекста — например, анализа 1000-страничного документа целиком или поддержания разговора с полной историей из сотен сообщений. Для более коротких вводов его более высокая стоимость за токен ($3/$15 за миллион) может быть неоправданной. Более дешёвые модели с меньшими окнами контекста могут эффективнее справляться с большинством типовых задач. Используйте Kimi K3 только тогда, когда задача требует полного окна контекста, чтобы избежать усечения или нескольких этапов разбиения на фрагменты и обобщения.
Kimi K3 отлично справляется с задачами, где информация распределена по очень длинному тексту или включает изображения. Примеры: извлечение ключевых фактов из отчета объемом с книгу, ответы на вопросы по полной кодовой базе, сравнение нескольких научных статей или анализ серии диаграмм. Она также может поддерживать согласованность в длинных диалогах. Ее сила заключается в способности одновременно охватывать все части контекста, уменьшая необходимость во внешнем поиске или разбиении на фрагменты.
Хотя у Kimi K3 большой контекстный окно, на узких задачах он может работать не так хорошо, как меньшие тонконастроенные модели. Большой контекст также может увеличивать задержку и вычислительные затраты. Точные ограничения (например, максимальное разрешение изображений, поддерживаемые типы файлов, уровень владения языком) не указаны в предоставленных фактах, но присущи конструкции модели. Пользователи должны учитывать, что очень длинные подсказки расходуют много токенов и, следовательно, ведут к более высоким затратам. Доступ к модели осуществляется через OrcaRouter; применяются показатели доступности провайдера и времени отклика.
Предоставленные факты не включают конкретные бенчмарки для Kimi K3. В целом модели с большим контекстом оцениваются на таких задачах, как поиск иголки в стоге сена (Needle in a Haystack), ответы на вопросы по длинным документам и реферирование. MoonshotAI могла опубликовать результаты; пользователям следует обращаться к официальной документации. Производительность модели на стандартных NLP-бенчмарках (например, MMLU, GSM8K) не указана. Мы рекомендуем протестировать Kimi K3 на собственном наборе для оценки, чтобы оценить ее эффективность для вашего сценария использования.
Контекстное окно размером 1 048 576 токенов означает, что модель может обработать примерно 1,5 миллиона английских слов или 800 000 китайских иероглифов за один проход. На практике это позволяет обрабатывать целые книги, обширные журналы разговоров или мультимодальные данные с большим количеством изображений. Однако не все токены могут быть использованы одинаково: механизмы внимания иногда больше фокусируются на недавних или значимых частях. Возможности модели извлекать информацию из середины длинных контекстов можно проверить. Производительность на таких задачах часто лучше, чем у моделей с меньшим контекстом, но всё же может иметь пространство для улучшения.
Задержка и пропускная способность не указаны в предоставленных данных. Модели с очень большими окнами контекста обычно обрабатывают каждый запрос дольше, поскольку механизм внимания масштабируется квадратично относительно длины последовательности. Для полного вывода в 1 миллион токенов ожидайте высокой задержки. Через OrcaRouter вы можете установить max_tokens, чтобы ограничить длину вывода и контролировать время ответа. Для приложений реального времени рассмотрите использование моделей меньшего размера. Пакетная обработка более длинных задач может оказаться практичнее. Фактическая производительность будет зависеть от инфраструктуры провайдера и текущей нагрузки.
Большой контекстный окно Kimi K3 — это одновременно и преимущество, и вызов. Модель может быть не столь точна в задачах, требующих точных рассуждений по коротким входам, по сравнению со специализированными моделями. Модель может демонстрировать более низкое качество в таких областях, как творческое письмо или генерация кода, по сравнению с моделями, настроенными на эти задачи. Кроме того, стоимость за токен относительно высока, поэтому использование её для коротких запросов неэффективно. Модель относительно новая; долгосрочная стабильность и поддержка со стороны MoonshotAI — факторы, которые стоит учитывать.
Kimi K3 оценивается в $3.00 за 1 миллион входных токенов и $15.00 за 1 миллион выходных токенов. Это тарифы провайдера без какой-либо наценки со стороны OrcaRouter. Входные токены включают как текстовые, так и графические токены (изображения оплачиваются исходя из их токенового эквивалента). Выходные токены — это любые токены, сгенерированные моделью. Дополнительных сборов, помимо стоимости за токен, нет. Цены могут быть изменены провайдером, но OrcaRouter передаёт тарифы без добавления наценки.
Поскольку Kimi K3 может обрабатывать исключительно длинные контексты, это позволяет заменить несколько вызовов API, которые потребовались бы для моделей с меньшим контекстом, потенциально снижая общую стоимость задач, требующих полной обработки документов. Однако каждый токен обходится дороже, чем во многих компактных моделях. Например, ввод размером в 1 млн токенов стоит фиксированные $3.00, тогда как модель меньшего размера может стоить $0,15 за миллион, но потребует нескольких вызовов для обработки тех же данных. Выбор сводится к компромиссу между простотой и стоимостью за токен. Пользователям следует оценивать общее количество токенов на задачу.
Предоставленные факты не упоминают никаких скидок на кэширование или объем для Kimi K3 на OrcaRouter. Ценообразование строго за токен в соответствии с тарифами провайдера. OrcaRouter может предлагать такие функции, как логирование запросов или повторные попытки, но никаких конкретных снижений цен не указано. Пользователям следует проверять текущую страницу цен OrcaRouter на предмет обновлений. В целом пользователи с большими объемами могут договариваться напрямую с провайдером, но через OrcaRouter применяются указанные тарифы.
Изображения преобразуются в токены для целей биллинга. Точная токенизация изображений зависит от их разрешения и алгоритма провайдера. Обычно стандартное изображение (например, 1024x1024) может стоить порядка сотен токенов. Поскольку входная цена Kimi K3 составляет $3.00 за 1 млн токенов, включение изображений в промпт увеличивает количество входных токенов и, следовательно, стоимость. Для рабочих нагрузок с большим количеством изображений общая стоимость может быстро возрастать. Рекомендуется минимизировать размер изображений или включать только релевантные изображения, чтобы контролировать расходы.
Kimi K3 используется через совместимый с OpenAI API OrcaRouter. Вы отправляете HTTP POST-запросы на https://api.orcarouter.ai/v1/chat/completions с параметром model, установленным в "kimi/kimi-k3". Формат запроса идентичен Chat Completions API от OpenAI: включите массив messages с ролями system, user и assistant. Для ввода изображений используйте массив content с типом "image_url". Убедитесь, что у вас есть API-ключ от OrcaRouter. Никакой специальной настройки не требуется; поддерживаются стандартные параметры, такие как temperature, max_tokens, top_p и stop.
Через OrcaRouter, Kimi K3 поддерживает стандартные параметры, совместимые с OpenAI: temperature (по умолчанию 0.7), max_tokens (до лимита вывода модели, который не указан, но, вероятно, меньше 32K), top_p, frequency_penalty, presence_penalty, stop-последовательности и n (количество завершений). Модель также принимает параметр stream для вывода в реальном времени. Для входных изображений можно использовать мультимодальный формат контента. Неподдерживаемые параметры будут игнорироваться. Большое окно контекста позволяет устанавливать высокое значение max_tokens для длинных выводов, но учитывайте стоимость.
Миграция проста, если вы уже используете API, совместимый с OpenAI. Измените базовый URL на https://api.orcarouter.ai/v1, обновите ID модели на "kimi/kimi-k3" и укажите ваш ключ API OrcaRouter. Изменения в коде не требуются, если вы используете тот же формат сообщений. Для поддержки изображений убедитесь, что ваши подсказки (prompts) содержат URL изображений или данные в формате base64. Возможно, вам потребуется настроить параметры max_tokens и другие, чтобы они соответствовали возможностям модели. Сначала протестируйте на небольшом примере, чтобы проверить качество вывода и стоимость.
Вам нужен ключ API от OrcaRouter. Включите его в заголовок Authorization как Bearer YOUR_API_KEY. OrcaRouter управляет аутентификацией и биллингом. В целях безопасности не передавайте свой ключ. OrcaRouter также может поддерживать ротацию ключей API. Дополнительная аутентификация от MoonshotAI не требуется. Все запросы проходят через инфраструктуру OrcaRouter, которая обрабатывает ограничение частоты запросов и обработку ошибок. Убедитесь, что ваши запросы соответствуют условиям обслуживания OrcaRouter.
Kimi K3 предлагает окно контекста в 1,048,576 токенов, что является одним из самых больших среди доступных. Она сопоставима с моделями от других провайдеров, которые также поддерживают контексты в миллион токенов. Её ценообразование в $3/$15 за миллион токенов конкурентоспособно. В отличие от некоторых моделей, Kimi K3 поддерживает мультимодальные входы (текст и изображение). Ключевым отличием является то, что к ней можно получить доступ через OrcaRouter без наценки. По сравнению с моделями вроде GPT-4 Turbo (контекст 128K, более высокая стоимость), Kimi K3 может быть дешевле для очень длинных последовательностей, но может иметь другие профили качества. Сравнения по бенчмаркам не предоставлены.
Выбирайте Kimi K3, когда задача требует полного большого контекстного окна — например, при анализе 500-страничного документа за один раз или включении множества изображений в один запрос. Более дешевые модели с меньшими контекстными окнами (например, 128K токенов) могут заставить вас разбивать ввод на части, теряя перекрестные ссылки. Если задачу можно разделить без потери качества, более дешевая модель предпочтительнее из-за меньшей стоимости за токен. Также учтите, критичны ли конкретные преимущества модели (мультимодальность, длинный контекст).
Предоставленные факты касаются только Kimi K3. У MoonshotAI есть предыдущие модели, такие как Kimi и Kimi K2. Kimi K3 — новейшая модель с более широким контекстным окном и поддержкой мультимодальности. Более ранние модели, вероятно, имеют меньшие контексты и могут не принимать изображения. Цены на другие модели не указаны. Для существующих пользователей старых моделей MoonshotAI переход на Kimi K3 предлагает расширенные возможности, но с более высокой стоимостью за токен. Решение зависит от того, оправдывает ли премиум более широкий контекст и возможность ввода изображений.
Совместимо с OpenAI — оставьте свой SDK
https://api.orcarouter.ai/v1import os
from openai import OpenAI
client = OpenAI(
base_url="https://api.orcarouter.ai/v1",
api_key=os.environ["ORCAROUTER_API_KEY"],
)
response = client.chat.completions.create(
model="kimi/kimi-k3",
messages=[{"role": "user", "content": "Hello"}],
)
print(response.choices[0].message.content)frequency_penaltyinclude_reasoningmax_tokenspresence_penaltyreasoningreasoning_effortresponse_formatstopstructured_outputstool_choicetools| Ввод / 1M токенов | $3.00 |
| Вывод / 1M токенов | $15.00 |
| Чтение кэша / 1M | $0.300 |
| Валюта | USD |
Оценка по прайс-листу
Только оценка — фактическое число токенов зависит от токенизатора провайдера.
О чём говорят разработчики на этой неделе
GET /api/public/models/kimi/kimi-k3Открыть @misc{orcarouter_kimi_k3,
title = {Kimi K3 API},
author = {MoonshotAI},
year = {2026},
howpublished = {OrcaRouter},
url = {https://www.orcarouter.ai/models/kimi/kimi-k3}
}MoonshotAI. (2026). Kimi K3 API. OrcaRouter. https://www.orcarouter.ai/models/kimi/kimi-k3