Kimi K3

kimi/kimi-k3
En vedette
VisionOutilsJSONRaisonnement
par MoonshotAI · 2026-07-15

Kimi K3 est le modèle phare de Moonshot AI et sa version la plus performante à ce jour : un modèle Mixture-of-Experts de 2,8 billions de paramètres conçu pour le codage de longue durée et le travail de connaissance de bout en bout. Il associe une fenêtre de contexte de 1 million de jetons à une compréhension visuelle native, accepte des entrées textuelles et image avec une sortie textuelle, et est conçu pour rester cohérent lors de sessions agentiques très longues. Moonshot positionne K3 pour des scénarios de programmation agentique tels que Codex, Claude Code, Cline et RooCode, ainsi que pour le raisonnement profond et le travail de connaissance. Il expose un contrôle reasoning_effort de haut niveau et un appel d'outils natif, et utilise le format de l'API OpenAI pour une intégration directe. Notez que K3 n'accepte pas de paramètres d'échantillonnage (pas de température / top_p / seed) — la profondeur de raisonnement est contrôlée via reasoning_effort.

Points de terminaison:/v1/chat/completions/v1/responses
ctx1M tokens
Entréetext + image
Sortietext
p50 TTFT6.25 s
ENTRÉE$3.00/ 1M tokens
SORTIE$15.00/ 1M tokens
p50 TTFT6.25 s7 j
TTFT p9510.00 s7 j
TRAFIC12237.0Mtokens / 7 j

MoonshotAI Kimi K3 est un grand modèle de langage développé par MoonshotAI, une entreprise chinoise d'IA. Il prend en charge une fenêtre de contexte de 1 048 576 tokens et accepte à la fois les…

Qu'est-ce que MoonshotAI Kimi K3 ?

Pour qui est conçu le Kimi K3 ?

Comment Kimi K3 gère-t-il les entrées multimodales ?

Quel type de performance peut-on attendre du Kimi K3 ?

Exemples de code

Appelez depuis n'importe quel SDK

Compatible OpenAI — gardez votre SDK actuel

  • OpenAI SDKhttps://api.orcarouter.ai/v1
import os

from openai import OpenAI

client = OpenAI(
    base_url="https://api.orcarouter.ai/v1",
    api_key=os.environ["ORCAROUTER_API_KEY"],
)

response = client.chat.completions.create(
    model="kimi/kimi-k3",
    messages=[{"role": "user", "content": "Hello"}],
)
print(response.choices[0].message.content)

Paramètres pris en charge

  • frequency_penalty
  • include_reasoning
  • max_tokens
  • presence_penalty
  • reasoning
  • reasoning_effort
  • response_format
  • stop
  • structured_outputs
  • tool_choice
  • tools

Tarifs

Entrée / 1M tokens$3.00
Sortie / 1M tokens$15.00
Lecture cache / 1M$0.300
DeviseUSD

Calculateur de coût

Tokens / mois10MM
Part d'entrée70%%
Estimé / mois $66.00 · Avec cache de prompt $56.55

Estimation basée sur le tarif public

Estimateur de tokens et de coût

Tokens d'entrée: 17Coût par requête: $0.007551

Estimation seulement — le nombre réel de tokens dépend du tokeniseur du fournisseur.

Performances

p50 TTFT
6.25 s
Vitesse de sortie
37.6 tok/s
TTFT p95
10.00 s
Taux d'erreur
66.6%

Benchmarks publics

76.2
AA Coding
Meilleur que 96 % des modèles comparés
n°6 sur 134
59.7
AA Intelligence
Meilleur que 94 % des modèles comparés
n°8 sur 136
GPQA Diamond
93.5
Humanity's Last Exam
46.9
Long-Context Recall
82.7
SciCode
58.7
tau_banking
46.0
terminalbench_v2_1
85.0
Source: artificialanalysis.ai

Buzz communautaire

Ce dont parlent les développeurs cette semaine

Hacker News4 mentions · 7 j

Comparatif

Kimi K3kimi/kimi-k2.6Kimi K2.7 Codekimi/kimi-k2.5
Entrée $/M$3.00$0.95$0.95$0.60
Sortie $/M$15.00$4.00$4.00$3.00
Contexte1.0M262K262K262K
Qualité9/108/108/107/10
Comparer côte à côteComparer côte à côteComparer côte à côteComparer côte à côte

FAQ

Quel est le coût pour utiliser Kimi K3 ?
Kimi K3 est au prix de 3,00 $ par million de tokens d'entrée et de 15,00 $ par million de tokens de sortie. Il s'agit du tarif du fournisseur sans marge bénéficiaire. Les tokens d'entrée incluent les tokens de texte et d'image. Les tokens de sortie sont les tokens générés.
Quelle est la taille de la fenêtre de contexte de Kimi K3 ?
Kimi K3 a une fenêtre de contexte de 1 048 576 tokens. Cela correspond à environ 1,5 million de mots anglais ou 800 000 caractères chinois. Il peut traiter de très longs documents ou des historiques étendus en une seule requête.
Quelles sont les principales forces du Kimi K3 ?
Les principaux atouts sont sa très grande fenêtre de contexte et son support multimodal (texte et image). Il excelle dans les tâches qui nécessitent le traitement de longues séquences, telles que l'analyse de livres complets, la compréhension de grandes bases de code et le raisonnement multimodal à travers de nombreuses images.
Comment se compare Kimi K3 à GPT-4 Turbo ?
Kimi K3 dispose d'une fenêtre de contexte plus grande (1M contre 128K) et prend en charge les images à un coût par jeton inférieur. GPT-4 Turbo offre généralement de meilleures performances sur des benchmarks étroits. Le meilleur choix dépend des exigences de longueur de contexte de votre tâche et de vos attentes en matière de qualité.
Est-ce qu'OrcaRouter stocke ou s'entraîne sur mes données lors de l'utilisation de Kimi K3?
OrcaRouter ne s'entraîne pas sur vos données. Vos prompts sont transmis au fournisseur (MoonshotAI) pour l'inférence. Les politiques de traitement des données de MoonshotAI s'appliquent. OrcaRouter peut conserver des journaux à des fins opérationnelles mais n'utilise pas les données des clients pour l'amélioration des modèles.
Comment invoquer Kimi K3 via l'API OpenAI-compatible d'OrcaRouter ?
Envoyez des requêtes à https://api.orcarouter.ai/v1/chat/completions avec l'ID de modèle "kimi/kimi-k3". Utilisez le format standard Chat Completions avec un tableau messages. Pour les images, utilisez le type de contenu "image_url". Incluez votre clé API OrcaRouter dans l'en-tête Authorization.
Quelle est la latence attendue pour le Kimi K3 ?
Les chiffres exacts de latence ne sont pas fournis. Étant donné que le modèle prend en charge de très longs contextes, le temps de traitement augmente avec la longueur de l'entrée. Pour une entrée de 1M tokens, attendez-vous à une latence significativement plus élevée que pour des entrées plus courtes. Utilisez le streaming pour obtenir des réponses partielles plus rapidement.
Puis-je utiliser Kimi K3 pour des applications en temps réel ?
L'utilisation en temps réel est possible, mais la latence peut être élevée pour de grands contextes. Elle est plus adaptée au traitement par lots hors ligne, comme l'analyse de documents. Pour les applications interactives, envisagez de définir un petit max_tokens et de limiter la longueur de l'entrée.
Quels formats et tailles d'image le Kimi K3 supporte-t-il ?
Les faits fournis ne spécifient pas les formats d'image pris en charge ni la résolution maximale. En pratique, la plupart des modèles multimodaux acceptent les formats courants comme JPEG, PNG et WebP. Pour de meilleurs résultats, utilisez des images de résolution modérée et évitez les fichiers très volumineux pour contrôler le coût des tokens.
Comment estimer l'utilisation des tokens pour une entrée donnée ?
OrcaRouter ne fournit pas de tokeniseur, mais vous pouvez utiliser des API qui renvoient le nombre de jetons ou estimer avec des bibliothèques comme tiktoken (pour OpenAI) avec prudence. Pour les images, supposez un nombre fixe de jetons par image en fonction de la résolution. Testez avec des exemples d'entrée pour évaluer l'utilisation réelle.

Intégrer ce badge

MoonshotAI: Kimi K3$3.00/M in6254ms p50via OrcaRouter
HTML <a href="https://www.orcarouter.ai/models/kimi/kimi-k3" target="_blank"> <img src="https://www.orcarouter.ai/embed/kimi/kimi-k3.svg" alt="MoonshotAI: Kimi K3 sur OrcaRouter" /> </a>
Markdown [![MoonshotAI: Kimi K3](https://www.orcarouter.ai/embed/kimi/kimi-k3.svg)](https://www.orcarouter.ai/models/kimi/kimi-k3)

Fiche du modèle en données

GET /api/public/models/kimi/kimi-k3Ouvrir
Lisible par machine:/llms.txt/llms-full.txt