Kimi K3 est le modèle phare de Moonshot AI et sa version la plus performante à ce jour : un modèle Mixture-of-Experts de 2,8 billions de paramètres conçu pour le codage de longue durée et le travail de connaissance de bout en bout. Il associe une fenêtre de contexte de 1 million de jetons à une compréhension visuelle native, accepte des entrées textuelles et image avec une sortie textuelle, et est conçu pour rester cohérent lors de sessions agentiques très longues. Moonshot positionne K3 pour des scénarios de programmation agentique tels que Codex, Claude Code, Cline et RooCode, ainsi que pour le raisonnement profond et le travail de connaissance. Il expose un contrôle reasoning_effort de haut niveau et un appel d'outils natif, et utilise le format de l'API OpenAI pour une intégration directe. Notez que K3 n'accepte pas de paramètres d'échantillonnage (pas de température / top_p / seed) — la profondeur de raisonnement est contrôlée via reasoning_effort.
MoonshotAI Kimi K3 est un grand modèle de langage développé par MoonshotAI, une entreprise chinoise d'IA. Il prend en charge une fenêtre de contexte de 1 048 576 tokens et accepte à la fois les…
La principale capacité de Kimi K3 est de traiter une fenêtre de contexte allant jusqu'à 1,048,576 tokens, ce qui lui permet d'intégrer des romans entiers, de longs manuels techniques ou des historiques de conversation étendus en une seule requête. Il accepte également des images, permettant un raisonnement multimodal. Le modèle peut effectuer des tâches telles que le résumé, la réponse aux questions et la génération sur des entrées très longues. Il est capable de comprendre des instructions complexes et de les suivre sur de longues séquences. Il prend en charge les paramètres d'API compatibles avec OpenAI, tels que temperature, max_tokens, top_p et stop sequences via OrcaRouter.
Kimi K3 est utilisé au mieux lorsque la tâche nécessite intrinsèquement un contexte très large — par exemple, analyser un document de 1 000 pages d'un seul coup, ou maintenir une conversation avec un historique complet de centaines de messages. Pour des entrées plus courtes, son coût plus élevé par jeton ($3/$15 par million) peut ne pas être justifié. Les modèles moins chers avec des fenêtres de contexte plus petites peuvent gérer la plupart des tâches typiques plus efficacement. Utilisez Kimi K3 uniquement lorsque la tâche exige la fenêtre de contexte complète pour éviter la troncature ou les multiples étapes de découpage et de synthèse.
Kimi K3 excelle dans les tâches où l'information est répartie sur un texte très long ou comprend des images. Les exemples incluent l'extraction de faits clés d'un rapport de la taille d'un livre, répondre à des questions sur une base de code complète, comparer plusieurs articles de recherche, ou analyser une série de diagrammes. Il peut également maintenir la cohérence sur de longs dialogues. Sa force réside dans sa capacité à prêter attention à toutes les parties du contexte simultanément, réduisant le besoin de récupération externe ou de fragmentation.
Alors que Kimi K3 dispose d'une grande fenêtre de contexte, il peut ne pas toujours être aussi performant que des modèles plus petits et affinés pour des tâches spécifiques. La grande fenêtre de contexte peut également augmenter la latence et le coût de calcul. Les limitations exactes (par exemple, la résolution maximale des images, les types de fichiers pris en charge, la maîtrise des langues) ne sont pas précisées dans les faits donnés, mais sont inhérentes à la conception du modèle. Les utilisateurs doivent être conscients que des invites très longues consomment de nombreux jetons et entraînent donc des coûts plus élevés. Le modèle est accessible via OrcaRouter ; les temps de disponibilité et de réponse du fournisseur s'appliquent.
Les faits fournis n'incluent pas de scores de référence spécifiques pour Kimi K3. En général, les modèles à contexte long sont évalués sur des tâches telles que le test de l'aiguille dans une botte de foin (Needle in a Haystack), les questions-réponses sur de longs documents et le résumé. MoonshotAI peut avoir publié des résultats ; les utilisateurs doivent consulter la documentation officielle. Les performances du modèle sur les références standard en NLP (par exemple MMLU, GSM8K) ne sont pas indiquées. Nous recommandons de tester Kimi K3 sur votre propre ensemble d'évaluation pour évaluer son efficacité pour votre cas d'utilisation.
Une fenêtre de contexte de 1 048 576 tokens signifie que le modèle peut traiter environ 1,5 million de mots anglais ou 800 000 caractères chinois en un seul passage. Dans la pratique, cela permet de traiter des livres entiers, des journaux de conversation étendus ou des données multimodales avec de nombreuses images. Cependant, tous les tokens ne sont pas nécessairement utilisés de manière égale ; les mécanismes d'attention se concentrent parfois davantage sur les parties récentes ou saillantes. La capacité du modèle à récupérer des informations du milieu de longs contextes peut être testée. Les performances sur ces tâches sont souvent meilleures que celles des modèles à contexte plus petit, mais il reste peut-être une marge d'amélioration.
La latence et le débit ne sont pas spécifiés dans les faits donnés. Les modèles avec de très grandes fenêtres de contexte prennent généralement plus de temps pour traiter chaque requête, car le mécanisme d'attention évolue quadratiquement avec la longueur de séquence. Pour une sortie complète de 1M tokens, attendez-vous à une latence élevée. Via OrcaRouter, vous pouvez définir max_tokens pour limiter la longueur de la sortie et contrôler le temps de réponse. Pour les applications en temps réel, envisagez d'utiliser des modèles plus petits. Le traitement par lots de tâches plus longues peut être plus pratique. Les performances réelles dépendront de l'infrastructure du fournisseur et de la charge actuelle.
La grande fenêtre de contexte de Kimi K3 est un atout mais aussi un défi. Il pourrait être moins précis sur les tâches nécessitant un raisonnement précis sur des entrées courtes par rapport à des modèles spécialisés. Le modèle pourrait présenter une qualité inférieure dans des domaines comme l'écriture créative ou la génération de code par rapport à des modèles affinés pour ces tâches. De plus, le coût par jeton est relativement élevé, donc l'utiliser pour des invites courtes est inefficace. Le modèle est relativement nouveau ; la stabilité à long terme et le support de MoonshotAI sont des facteurs à prendre en compte.
Le Kimi K3 est facturé 3,00 $ par million de jetons d'entrée et 15,00 $ par million de jetons de sortie. Il s'agit des tarifs du fournisseur, sans marge ajoutée par OrcaRouter. Les jetons d'entrée incluent à la fois les jetons de texte et d'image (les images sont facturées en fonction de leur équivalent en jetons). Les jetons de sortie sont tous les jetons générés par le modèle. Il n'y a pas de frais supplémentaires en dehors des coûts par jeton. Les prix peuvent être modifiés par le fournisseur, mais OrcaRouter transmet les tarifs sans ajouter de marge.
Parce que Kimi K3 peut traiter des contextes extrêmement longs, il peut remplacer plusieurs appels API qui seraient nécessaires avec des modèles à contexte plus petit, réduisant potentiellement le coût global pour les tâches nécessitant un traitement complet de documents. Cependant, chaque jeton est plus cher que de nombreux modèles compacts. Par exemple, une entrée de 1M jetons à $3.00 est fixe, tandis qu'un modèle plus petit pourrait coûter $0.15 par million mais nécessiter plusieurs appels pour traiter les mêmes données. Le compromis se situe entre la simplicité et le coût par jeton. Les utilisateurs devraient estimer la consommation totale de jetons par tâche.
Les faits fournis ne mentionnent aucun cache ni réduction de volume pour Kimi K3 sur OrcaRouter. La tarification est strictement par jeton telle que facturée par le fournisseur. OrcaRouter peut offrir des fonctionnalités comme la journalisation des requêtes ou les tentatives, mais aucune réduction de prix spécifique n'est indiquée. Les utilisateurs devraient consulter la page de tarification actuelle d'OrcaRouter pour toute mise à jour. En général, les utilisateurs à volume élevé peuvent négocier directement avec le fournisseur, mais via OrcaRouter, les tarifs indiqués s'appliquent.
Les images sont converties en jetons à des fins de facturation. La tokenisation exacte des images dépend de leur résolution et de l'algorithme du fournisseur. En général, une image standard (par exemple 1024x1024) peut coûter de l'ordre de centaines de jetons. Étant donné que le prix d'entrée de Kimi K3 est de 3,00 $ pour 1 million de jetons, inclure des images dans une invite augmente le nombre de jetons d'entrée et donc le coût. Pour les charges de travail comportant de nombreuses images, le coût total peut rapidement s'accumuler. Il est conseillé de réduire la taille des images ou d'inclure uniquement les images pertinentes pour maîtriser les dépenses.
Kimi K3 est accessible via l'API compatible OpenAI d'OrcaRouter. Vous envoyez des requêtes HTTP POST à https://api.orcarouter.ai/v1/chat/completions avec le paramètre model défini sur "kimi/kimi-k3". Le format de la requête est identique à celui de l'API Chat Completions d'OpenAI : incluez un tableau messages avec les rôles system, user et assistant. Pour les entrées d'image, utilisez le tableau content avec le type "image_url". Assurez-vous de disposer d'une clé API d'OrcaRouter. Aucune configuration spéciale n'est nécessaire ; les paramètres standard comme temperature, max_tokens, top_p et stop sont pris en charge.
Avec OrcaRouter, Kimi K3 prend en charge les paramètres standard compatibles OpenAI : temperature (valeur par défaut 0.7), max_tokens (jusqu'à la limite de sortie du modèle, non précisée mais probablement inférieure à 32K), top_p, frequency_penalty, presence_penalty, séquences d'arrêt et n (nombre de complétions). Le modèle accepte également un paramètre stream pour la sortie en temps réel. Pour les entrées d'image, vous pouvez utiliser le format de contenu multimodal. Les paramètres non pris en charge seront ignorés. La grande fenêtre de contexte permet de définir un max_tokens élevé pour des sorties longues, mais attention au coût.
La migration est simple si vous utilisez déjà une API compatible OpenAI. Remplacez l'URL de base par https://api.orcarouter.ai/v1, mettez à jour l'ID du modèle par "kimi/kimi-k3", et définissez votre clé API OrcaRouter. Aucune modification de code n'est nécessaire si vous utilisez le même format de message. Pour la prise en charge des images, assurez-vous que vos prompts incluent des URL d'images ou des données en base64. Vous devrez peut-être ajuster max_tokens et d'autres paramètres pour correspondre aux capacités du modèle. Testez d'abord avec un petit échantillon pour vérifier la qualité et le coût des résultats.
Vous avez besoin d'une clé API d'OrcaRouter. Incluez-la dans l'en-tête Authorization sous la forme Bearer VOTRE_CLÉ_API. OrcaRouter gère l'authentification et la facturation. Pour des raisons de sécurité, ne partagez pas votre clé. OrcaRouter peut également prendre en charge la rotation des clés API. Aucune authentification supplémentaire de la part de MoonshotAI n'est nécessaire. Toutes les requêtes transitent par l'infrastructure d'OrcaRouter, qui gère la limitation de débit et la gestion des erreurs. Assurez-vous que vos requêtes respectent les conditions d'utilisation d'OrcaRouter.
Kimi K3 offre une fenêtre de contexte de 1 048 576 tokens, ce qui en fait l’une des plus grandes disponibles. Elle est comparable aux modèles d’autres fournisseurs qui prennent également en charge des contextes d’un million de tokens. Sa tarification de 3$/15$ par million de tokens est compétitive. Contrairement à certains modèles, Kimi K3 prend en charge les entrées multimodales (texte et image). Un différenciateur clé est qu’elle est accessible via OrcaRouter sans majoration. Comparée à des modèles comme GPT-4 Turbo (contexte de 128K, coût plus élevé), Kimi K3 peut être moins chère pour de très longues séquences, mais peut avoir des profils de qualité différents. Les comparaisons de benchmarks ne sont pas fournies.
Choisissez Kimi K3 lorsque la tâche nécessite la pleine fenêtre de contexte large—par exemple, analyser un document de 500 pages en une seule fois, ou inclure de nombreuses images dans une seule invite. Les modèles moins chers avec des fenêtres de contexte plus petites (ex. 128K tokens) peuvent vous obliger à découper l'entrée, perdant ainsi les références croisées. Si la tâche peut être divisée sans perte de qualité, un modèle moins cher est préférable en raison du coût par token plus faible. Considérez également si les forces spécifiques du modèle (multimodal, long-context) sont critiques.
Les faits fournis ne concernent que Kimi K3. MoonshotAI a des modèles précédents comme Kimi et Kimi K2. Kimi K3 est le plus récent avec une fenêtre de contexte plus large et une prise en charge multimodale. Les modèles antérieurs ont probablement des contextes plus petits et peuvent ne pas accepter d'images. Les tarifs des autres modèles ne sont pas indiqués. Pour les utilisateurs existants des anciens modèles de MoonshotAI, passer à Kimi K3 offre des capacités étendues mais à un coût par jeton plus élevé. La décision dépend de savoir si le contexte plus large et les entrées d'images justifient la prime.
Compatible OpenAI — gardez votre SDK actuel
https://api.orcarouter.ai/v1import os
from openai import OpenAI
client = OpenAI(
base_url="https://api.orcarouter.ai/v1",
api_key=os.environ["ORCAROUTER_API_KEY"],
)
response = client.chat.completions.create(
model="kimi/kimi-k3",
messages=[{"role": "user", "content": "Hello"}],
)
print(response.choices[0].message.content)frequency_penaltyinclude_reasoningmax_tokenspresence_penaltyreasoningreasoning_effortresponse_formatstopstructured_outputstool_choicetools| Entrée / 1M tokens | $3.00 |
| Sortie / 1M tokens | $15.00 |
| Lecture cache / 1M | $0.300 |
| Devise | USD |
Estimation basée sur le tarif public
Estimation seulement — le nombre réel de tokens dépend du tokeniseur du fournisseur.
Ce dont parlent les développeurs cette semaine
GET /api/public/models/kimi/kimi-k3Ouvrir @misc{orcarouter_kimi_k3,
title = {Kimi K3 API},
author = {MoonshotAI},
year = {2026},
howpublished = {OrcaRouter},
url = {https://www.orcarouter.ai/models/kimi/kimi-k3}
}MoonshotAI. (2026). Kimi K3 API. OrcaRouter. https://www.orcarouter.ai/models/kimi/kimi-k3