Kimi K3 is het vlaggenschipmodel van Moonshot AI en de meest capabele release tot nu toe — een Mixture-of-Experts-model met 2,8 biljoen parameters, gebouwd voor langetermijncodering en end-to-end kenniswerk. Het combineert een contextvenster van 1M tokens met native visueel begrip, accepteert tekst- en afbeeldingsinvoer met tekstuitvoer, en is ontworpen om coherent te blijven gedurende zeer lange agent-sessies. Moonshot positioneert K3 voor programmeer-agent-scenario's zoals Codex, Claude Code, Cline en RooCode, evenals diepgaand redeneren en kenniswerk. Het biedt een topniveau-besturing voor reasoning_effort en native tool calling, en spreekt het OpenAI API-formaat voor naadloze integratie. Merk op dat K3 geen samplingparameters accepteert (geen temperature / top_p / seed) — de redeneerdiepte wordt in plaats daarvan geregeld via reasoning_effort.
MoonshotAI Kimi K3 is een groot taalmodel ontwikkeld door MoonshotAI, een Chinees AI-bedrijf. Het ondersteunt een contextvenster van 1.048.576 tokens en accepteert zowel tekst- als afbeeldingsinvoer.…
Kimi K3's primaire mogelijkheid is het verwerken van een contextvenster van maximaal 1.048.576 tokens, waardoor het hele romans, lange technische handleidingen of uitgebreide gespreksgeschiedenissen in één enkele prompt kan opnemen. Het accepteert ook afbeeldingen, wat multimodaal redeneren mogelijk maakt. Het model kan taken uitvoeren zoals samenvatting, vraagbeantwoording en generatie over zeer lange invoer. Het is in staat om complexe instructies te begrijpen en deze over lange reeksen op te volgen. Het ondersteunt OpenAI-compatibele API-parameters zoals temperature, max_tokens, top_p en stop-sequenties via OrcaRouter.
Kimi K3 kan het beste worden gebruikt wanneer de taak inherent een zeer grote context vereist—bijvoorbeeld het in één keer analyseren van een document van 1.000 pagina's, of het voeren van een gesprek met een volledige geschiedenis van honderden berichten. Voor kortere invoer is de hogere kosten per token ($3/$15 per miljoen) mogelijk niet gerechtvaardigd. Goedkopere modellen met kleinere contextvensters kunnen de meeste typische taken efficiënter afhandelen. Gebruik Kimi K3 alleen wanneer de taak het volledige contextvenster vereist om afkapping of meerdere chunk-en-samenvat-stappen te voorkomen.
Kimi K3 excelleert in taken waarbij informatie verspreid is over een zeer lange tekst of afbeeldingen bevat. Voorbeelden zijn het extraheren van kernfeiten uit een boeklange rapport, het beantwoorden van vragen over een volledige codebase, het vergelijken van meerdere onderzoeksartikelen, of het analyseren van een reeks diagrammen. Het kan ook consistentie behouden over lange dialogen. Zijn kracht ligt in het vermogen om tegelijkertijd aandacht te besteden aan alle delen van de context, waardoor de behoefte aan externe ophaling of chunking vermindert.
Hoewel Kimi K3 een groot contextvenster heeft, presteert het mogelijk niet altijd zo goed als kleinere, fijn afgestemde modellen bij specifieke taken. De grote context kan ook de latentie en rekenkosten verhogen. Exacte beperkingen (bijv. maximale beeldresolutie, ondersteunde bestandstypen, taalvaardigheid) worden niet gespecificeerd in de gegeven feiten, maar zijn inherent aan het ontwerp van het model. Gebruikers moeten zich ervan bewust zijn dat zeer lange prompts veel tokens verbruiken en dus hogere kosten met zich meebrengen. Het model wordt benaderd via OrcaRouter; de uptime en responstijden van de provider zijn van toepassing.
De verstrekte feiten bevatten geen specifieke benchmarkscores voor Kimi K3. Over het algemeen worden modellen met een grote context geëvalueerd op taken zoals de Needle in a Haystack-test, lang document-QA en samenvattingen. MoonshotAI heeft mogelijk resultaten gepubliceerd; gebruikers dienen de officiële documentatie te raadplegen. De prestaties van het model op standaard NLP-benchmarks (bijv. MMLU, GSM8K) worden niet vermeld. We raden aan om Kimi K3 te testen op uw eigen evaluatieset om de effectiviteit voor uw gebruiksscenario te beoordelen.
Een contextvenster van 1.048.576 tokens betekent dat het model in één keer ongeveer 1,5 miljoen Engelse woorden of 800.000 Chinese karakters kan verwerken. In de praktijk maakt dit het mogelijk om hele boeken, uitgebreide gesprekslogs of multimodale gegevens met veel afbeeldingen te verwerken. Niet alle tokens worden echter evenveel benut; aandachtsmechanismen richten zich soms meer op recente of opvallende delen. Het vermogen van het model om informatie uit het midden van lange contexten op te halen, kan worden getest. Prestaties bij dergelijke taken zijn vaak beter dan bij modellen met kleinere context, maar er is mogelijk nog ruimte voor verbetering.
Latentie en doorvoer zijn niet gespecificeerd in de gegeven feiten. Modellen met zeer grote contextvensters hebben over het algemeen meer tijd nodig om elk verzoek te verwerken, omdat het aandachtsmechanisme kwadratisch schaalt met de sequentielengte. Voor een volledige uitvoer van 1M tokens kunt u hoge latentie verwachten. Via OrcaRouter kunt u max_tokens instellen om de uitvoerlengte te beperken en de responstijd te regelen. Overweeg voor realtime toepassingen kleinere modellen te gebruiken. Batchverwerking van langere taken kan praktischer zijn. De daadwerkelijke prestaties zijn afhankelijk van de infrastructuur en de huidige belasting van de aanbieder.
Het grote contextvenster van Kimi K3 is een sterkte maar ook een uitdaging. Het is mogelijk niet zo nauwkeurig bij taken die precieze redenering over korte invoer vereisen in vergelijking met gespecialiseerde modellen. Het model kan lagere kwaliteit vertonen op gebieden zoals creatief schrijven of codegeneratie in vergelijking met modellen die voor die taken zijn fijn afgestemd. Bovendien zijn de kosten per token relatief hoog, dus het gebruik ervan voor korte prompts is inefficiënt. Het model is relatief nieuw; langetermijnstabiliteit en ondersteuning van MoonshotAI zijn factoren om te overwegen.
Kimi K3 kost $3,00 per 1 miljoen input-tokens en $15,00 per 1 miljoen output-tokens. Dit zijn de tarieven van de provider, zonder enige opslag van OrcaRouter. Input-tokens omvatten zowel tekst- als afbeeldingstokens (afbeeldingen worden gefactureerd op basis van hun token-equivalent). Output-tokens zijn alle tokens die door het model worden gegenereerd. Er zijn geen extra kosten naast de kosten per token. De prijzen kunnen door de provider worden gewijzigd, maar OrcaRouter geeft de tarieven door zonder een marge toe te voegen.
Omdat Kimi K3 extreem lange contexten kan verwerken, kan het meerdere API-aanroepen vervangen die nodig zouden zijn bij kleinere contextmodellen, wat de totale kosten kan verlagen voor taken die volledige documentverwerking vereisen. Elke token is echter duurder dan bij veel compacte modellen. Een invoer van 1M tokens voor $3.00 is bijvoorbeeld vast, terwijl een kleiner model $0.15 per miljoen kan kosten, maar meerdere aanroepen nodig heeft om dezelfde gegevens te verwerken. De afweging is tussen eenvoud en kosten per token. Gebruikers moeten het totale tokenverbruik per taak schatten.
De verstrekte feiten vermelden geen caching of volumekortingen voor Kimi K3 op OrcaRouter. De prijsstelling is strikt per token zoals gefactureerd door de provider. OrcaRouter biedt mogelijk functies zoals request-logging of retries, maar er worden geen specifieke prijsverlagingen aangegeven. Gebruikers dienen de huidige prijspagina van OrcaRouter te raadplegen voor eventuele updates. In het algemeen kunnen grootverbruikers rechtstreeks met de provider onderhandelen, maar via OrcaRouter gelden de vermelde tarieven.
Afbeeldingen worden omgezet in tokens voor factureringsdoeleinden. De exacte tokenisatie van afbeeldingen hangt af van hun resolutie en het algoritme van de provider. Doorgaans kost een standaardafbeelding (bijv. 1024x1024) in de orde van honderden tokens. Aangezien de invoerprijs van Kimi K3 $3.00 per 1M tokens is, verhoogt het opnemen van afbeeldingen in een prompt het aantal invoertokens en dus de kosten. Voor workloads met veel afbeeldingen kunnen de totale kosten snel oplopen. Het is aan te raden om de afbeeldingsgrootte te minimaliseren of alleen relevante afbeeldingen op te nemen om de kosten te beheersen.
Kimi K3 wordt benaderd via OrcaRouter's OpenAI-compatibele API. U stuurt HTTP POST-verzoeken naar https://api.orcarouter.ai/v1/chat/completions met de modelparameter ingesteld op "kimi/kimi-k3". Het verzoekformaat is identiek aan OpenAI's Chat Completions API: voeg een messages-array toe met systeem-, gebruiker- en assistent-rollen. Voor afbeeldingsinvoer gebruikt u de content-array met type "image_url". Zorg ervoor dat u een API-sleutel van OrcaRouter heeft. Er is geen speciale configuratie nodig; standaardparameters zoals temperature, max_tokens, top_p en stop worden ondersteund.
Via OrcaRouter ondersteunt Kimi K3 standaard OpenAI-compatibele parameters: temperature (standaard 0.7), max_tokens (tot aan de uitvoerlimiet van het model, die niet gespecificeerd is maar waarschijnlijk minder dan 32K), top_p, frequency_penalty, presence_penalty, stop-reeksen, en n (aantal voltooiingen). Het model accepteert ook een stream-parameter voor real-time uitvoer. Voor afbeeldingsinvoer kun je het multimodale inhoudsformaat gebruiken. Niet-ondersteunde parameters worden genegeerd. Het grote contextvenster maakt het mogelijk een hoge max_tokens in te stellen voor lange uitvoer, maar wees bewust van de kosten.
Migratie is eenvoudig als u al een OpenAI-compatibele API gebruikt. Wijzig de basis-URL naar https://api.orcarouter.ai/v1, werk de model-ID bij naar "kimi/kimi-k3" en stel uw OrcaRouter API-sleutel in. Er zijn geen codeaanpassingen nodig als u dezelfde berichtopmaak gebruikt. Voor ondersteuning van afbeeldingen moet u ervoor zorgen dat uw prompts afbeeldings-URL's of base64-gegevens bevatten. Mogelijk moet u max_tokens en andere parameters aanpassen aan de mogelijkheden van het model. Test eerst met een klein voorbeeld om de uitvoerkwaliteit en kosten te verifiëren.
Je hebt een API-sleutel nodig van OrcaRouter. Voeg deze toe aan de Authorization-header als Bearer YOUR_API_KEY. OrcaRouter beheert authenticatie en facturatie. Deel je sleutel niet om veiligheidsredenen. OrcaRouter ondersteunt mogelijk ook API-keyrotatie. Er is geen extra authenticatie van MoonshotAI nodig. Alle verzoeken gaan via de infrastructuur van OrcaRouter, die rate limiting en foutafhandeling beheert. Zorg ervoor dat je verzoeken voldoen aan de servicevoorwaarden van OrcaRouter.
Kimi K3 biedt een contextvenster van 1.048.576 tokens, wat een van de grootste beschikbare is. Het is vergelijkbaar met modellen van andere aanbieders die ook contexten van miljoenen tokens ondersteunen. De prijs van $3/$15 per miljoen tokens is concurrerend. In tegenstelling tot sommige modellen ondersteunt Kimi K3 multimodale invoer (tekst en afbeeldingen). Een belangrijk onderscheidend kenmerk is dat het wordt benaderd via OrcaRouter zonder toeslag. In vergelijking met modellen zoals GPT-4 Turbo (128K context, hogere kosten) kan Kimi K3 goedkoper zijn voor zeer lange sequenties, maar kan het een ander kwaliteitsprofiel hebben. Er worden geen benchmarkvergelijkingen gegeven.
Kies Kimi K3 wanneer de taak het volledige grote contextvenster vereist—bijvoorbeeld voor het in één keer analyseren van een document van 500 pagina's, of het opnemen van veel afbeeldingen in één prompt. Goedkopere modellen met kleinere contextvensters (bijv. 128K tokens) kunnen u dwingen de invoer op te splitsen, waardoor kruisverwijzingen verloren gaan. Als de taak zonder kwaliteitsverlies kan worden opgesplitst, heeft een goedkoper model de voorkeur vanwege de lagere kosten per token. Overweeg ook of de specifieke sterke punten van het model (multimodaal, lange context) cruciaal zijn.
De verstrekte feiten hebben alleen betrekking op Kimi K3. MoonshotAI heeft eerdere modellen zoals Kimi en Kimi K2. Kimi K3 is de nieuwste met een groter contextvenster en multimodale ondersteuning. Eerdere modellen hebben waarschijnlijk kleinere contexten en accepteren mogelijk geen afbeeldingen. Prijzen voor andere modellen worden niet gegeven. Voor bestaande gebruikers van MoonshotAI's oudere modellen biedt upgraden naar Kimi K3 uitgebreide mogelijkheden, maar tegen een hogere kosten per token. De beslissing hangt af van of de grotere context en beeldinvoer de premie rechtvaardigen.
OpenAI-compatibel — behoud je huidige SDK
https://api.orcarouter.ai/v1import os
from openai import OpenAI
client = OpenAI(
base_url="https://api.orcarouter.ai/v1",
api_key=os.environ["ORCAROUTER_API_KEY"],
)
response = client.chat.completions.create(
model="kimi/kimi-k3",
messages=[{"role": "user", "content": "Hello"}],
)
print(response.choices[0].message.content)frequency_penaltyinclude_reasoningmax_tokenspresence_penaltyreasoningreasoning_effortresponse_formatstopstructured_outputstool_choicetools| Invoer / 1M tokens | $3.00 |
| Uitvoer / 1M tokens | $15.00 |
| Cache lezen / 1M | $0.300 |
| Valuta | USD |
Schatting op basis van catalogusprijs
Alleen een schatting — het werkelijke aantal tokens hangt af van de tokenizer van de aanbieder.
Waar ontwikkelaars het deze week over hebben
GET /api/public/models/kimi/kimi-k3Openen @misc{orcarouter_kimi_k3,
title = {Kimi K3 API},
author = {MoonshotAI},
year = {2026},
howpublished = {OrcaRouter},
url = {https://www.orcarouter.ai/models/kimi/kimi-k3}
}MoonshotAI. (2026). Kimi K3 API. OrcaRouter. https://www.orcarouter.ai/models/kimi/kimi-k3