Kimi K3 är Moonshot AIs flaggskeppsmodell och dess mest kapabla lansering hittills — en modell med 2,8 biljoner parametrar och expertmix (Mixture-of-Experts), byggd för långsiktig kodning och ändamålsenligt kunskapsarbete. Den kombinerar ett kontextfönster på 1M-tokens med inbyggd visuell förståelse, tar emot text- och bildindata med textutdata, och är utformad för att hålla sammanhang över mycket långa agentiska sessioner. Moonshot positionerar K3 för programmeringsagent-scenarier som Codex, Claude Code, Cline och RooCode, samt djup resonemangsförmåga och kunskapsarbete. Den erbjuder en överordnad kontroll för resonemangsansträngning (reasoning_effort) och inbyggt verktygsanrop, och kommunicerar via OpenAI API-format för smidig integration. Observera att K3 inte accepterar samplingsparametrar (ingen temperature / top_p / seed) — resonemangsdjupet styrs istället via reasoning_effort.
MoonshotAI Kimi K3 är en stor språkmodell utvecklad av MoonshotAI, ett kinesiskt AI-företag. Den stöder ett kontextfönster på 1,048,576 tokens och accepterar både text- och bildinmatning. Modellen är…
Kimi K3:s primära förmåga är att bearbeta ett kontextfönster på upp till 1 048 576 tokens, vilket gör att den kan inkludera hela romaner, långa tekniska manualer eller omfattande samtalshistoriker i en enda prompt. Den accepterar även bilder, vilket möjliggör multimodal resonemang. Modellen kan utföra uppgifter som sammanfattning, frågebesvarande och generering över mycket långa indata. Den är kapabel att förstå komplexa instruktioner och följa dem över långa sekvenser. Den stöder OpenAI-kompatibla API-parametrar som temperature, max_tokens, top_p och stop-sekvenser via OrcaRouter.
Kimi K3 används bäst när uppgiften i sig kräver ett mycket stort sammanhang – till exempel att analysera ett 1 000-sidigt dokument i ett svep, eller att upprätthålla en konversation med en fullständig historik på hundratals meddelanden. För kortare indata kan den högre kostnaden per token ($3/$15 per miljon) vara svår att motivera. Billigare modeller med mindre kontextfönster kan hantera de flesta typiska uppgifter mer effektivt. Använd Kimi K3 endast när uppgiften kräver hela kontextfönstret för att undvika trunkering eller flera chunk-och-sammanfatta-steg.
Kimi K3 utmärker sig på uppgifter där information är spridd över en mycket lång text eller innehåller bilder. Exempel inkluderar att extrahera viktiga fakta från en boklång rapport, besvara frågor om en komplett kodbas, jämföra flera forskningsartiklar eller analysera en serie diagram. Den kan också upprätthålla konsekvens över långa dialoger. Dess styrka ligger i förmågan att samtidigt uppmärksamma alla delar av sammanhanget, vilket minskar behovet av extern hämtning eller uppdelning.
Även om Kimi K3 har ett stort kontextfönster, kan den inte alltid prestera lika bra som mindre, finjusterade modeller på smala uppgifter. Det stora kontexten kan också öka latensen och beräkningskostnaden. Exakta begränsningar (t.ex. maximal bildupplösning, filtyper som stöds, språkkunskaper) anges inte i de givna fakta men är inneboende i modellens design. Användare bör vara medvetna om att mycket långa prompter konsumerar många tokens och därmed medför högre kostnader. Modellen nås via OrcaRouter; leverantörens drifttid och svarstider gäller.
De angivna fakta innehåller inte specifika benchmark-poäng för Kimi K3. Generellt utvärderas modeller med stort sammanhang på uppgifter som Needle in a Haystack-testet, långdokument QA och sammanfattning. MoonshotAI kan ha publicerat resultat; användare bör konsultera officiell dokumentation. Modellens prestanda på standard NLP-benchmarkar (t.ex. MMLU, GSM8K) anges inte. Vi rekommenderar att du testar Kimi K3 på din egen utvärderingsuppsättning för att bedöma dess effektivitet för ditt användningsfall.
En kontextfönster på 1 048 576 token innebär att modellen kan bearbeta ungefär 1,5 miljoner engelska ord eller 800 000 kinesiska tecken i en enda genomgång. I praktiken möjliggör detta hantering av hela böcker, omfattande samtalsloggar eller multimodal data med många bilder. Alla token utnyttjas dock inte lika mycket; uppmärksamhetsmekanismer fokuserar ibland mer på nyliga eller framträdande delar. Modellens förmåga att hämta information från mitten av långa kontexter kan testas. Prestanda på sådana uppgifter är ofta bättre än för modeller med mindre kontext, men kan fortfarande ha utrymme för förbättring.
Latens och genomströmning specificeras inte i de givna fakta. Modeller med mycket stora kontextfönster tar i allmänhet längre tid att behandla varje förfrågan eftersom uppmärksamhetsmekanismen skalas kvadratiskt med sekvenslängden. För en fullständig 1M-tokenutdata, förvänta dig hög latens. Genom OrcaRouter kan du ställa in max_tokens för att begränsa utdatalängden och kontrollera svarstiden. För realtidsapplikationer, överväg att använda mindre modeller. Batchbearbetning av längre uppgifter kan vara mer praktiskt. Faktisk prestanda beror på leverantörens infrastruktur och nuvarande belastning.
Kimi K3:s stora kontextfönster är en styrka men också en utmaning. Det kan vara mindre träffsäkert på uppgifter som kräver exakt resonemang över korta indata jämfört med specialiserade modeller. Modellen kan uppvisa lägre kvalitet inom områden som kreativt skrivande eller kodgenerering jämfört med modeller som finjusterats för dessa uppgifter. Dessutom är kostnaden per token relativt hög, så att använda den för korta prompts är ineffektivt. Modellen är relativt ny; långsiktig stabilitet och support från MoonshotAI är faktorer att beakta.
Kimi K3 prissätts till $3,00 per 1 miljon inmatningstokens och $15,00 per 1 miljon utmatningstokens. Detta är leverantörens priser utan någon påslag från OrcaRouter. Inmatningstokens inkluderar både text- och bildtokens (bilder faktureras baserat på deras token-ekvivalent). Utmatningstokens är alla tokens som genereras av modellen. Det finns inga extra avgifter utöver kostnaderna per token. Priserna kan ändras av leverantören, men OrcaRouter vidarebefordrar priserna utan att lägga till marginal.
Eftersom Kimi K3 kan hantera extremt långa kontexter kan det ersätta flera API-anrop som annars skulle krävas med mindre kontextmodeller, vilket potentiellt minskar den totala kostnaden för uppgifter som kräver fullständig dokumentbehandling. Varje token är dock dyrare än många kompakta modeller. Till exempel är en miljon token-indata till $3,00 fast, medan en mindre modell kan kosta $0,15 per miljon men kräva flera anrop för att bearbeta samma data. Avvägningen är mellan enkelhet och kostnad per token. Användare bör uppskatta totalt tokenanvändning per uppgift.
De angivna fakta nämner inga cache- eller volymrabatter för Kimi K3 på OrcaRouter. Prissättningen är strikt per token som faktureras av leverantören. OrcaRouter kan erbjuda funktioner som förfrågningsloggning eller återförsök, men inga specifika prisreduktioner anges. Användare bör kontrollera OrcaRouters aktuella prissida för eventuella uppdateringar. Generellt sett kan högvolymanvändare förhandla direkt med leverantören, men via OrcaRouter gäller de listade priserna.
Bilder omvandlas till tokens för faktureringsändamål. Den exakta tokeniseringen av bilder beror på deras upplösning och leverantörens algoritm. Vanligtvis kan en standardbild (t.ex. 1024x1024) kosta i storleksordningen hundratals tokens. Eftersom Kimi K3:s inmatningspris är 3,00 USD per 1M tokens, ökar inkludering av bilder i en prompt antalet inmatningstokens och därmed kostnaden. För arbetsbelastningar med många bilder kan den totala kostnaden snabbt bli hög. Det är tillrådligt att minimera bildstorleken eller endast inkludera relevanta bilder för att kontrollera kostnaderna.
Kimi K3 nås via OrcaRouters OpenAI-kompatibla API. Du skickar HTTP POST-förfrågningar till https://api.orcarouter.ai/v1/chat/completions med modellparametern inställd på "kimi/kimi-k3". Förfrågningsformatet är identiskt med OpenAIs Chat Completions API: inkludera en messages-array med system-, användar- och assistentroller. För bildinmatning, använd content-array med typ "image_url". Se till att du har en API-nyckel från OrcaRouter. Ingen speciell konfiguration krävs; standardparametrar som temperature, max_tokens, top_p och stop stöds.
Via OrcaRouter stöder Kimi K3 standard OpenAI-kompatibla parametrar: temperature (standardvärde 0.7), max_tokens (upp till modellens utdatabegränsning, som inte specificeras men troligtvis mindre än 32K), top_p, frequency_penalty, presence_penalty, stoppsekvenser och n (antal kompletteringar). Modellen accepterar även en stream-parameter för realtidsutdata. För bildinmatning kan du använda det multimodala innehållsformatet. Parametrar som inte stöds ignoreras. Det stora kontextfönstret gör det möjligt att ställa in ett högt max_tokens för långa utdata, men tänk på kostnaden.
Migrationen är enkel om du redan använder ett OpenAI-kompatibelt API. Ändra bas-URL till https://api.orcarouter.ai/v1, uppdatera modell-ID till "kimi/kimi-k3", och ange din OrcaRouter API-nyckel. Inga kodändringar behövs om du använder samma meddelandeformat. För bildstöd, se till att dina prompts innehåller bild-URL:er eller base64-data. Du kan behöva justera max_tokens och andra parametrar för att passa modellens kapacitet. Testa med ett litet exempel först för att verifiera utdatakvalitet och kostnad.
Du behöver en API-nyckel från OrcaRouter. Inkludera den i Authorization-headern som Bearer YOUR_API_KEY. OrcaRouter hanterar autentisering och fakturering. Av säkerhetsskäl, dela inte din nyckel. OrcaRouter kan även stödja rotation av API-nycklar. Ingen ytterligare autentisering krävs från MoonshotAI. Alla förfrågningar går genom OrcaRouters infrastruktur, som hanterar hastighetsbegränsning och felhantering. Se till att dina förfrågningar följer OrcaRouters användarvillkor.
Kimi K3 erbjuder ett kontextfönster på 1 048 576 tokens, vilket är bland de största som finns tillgängliga. Det är jämförbart med modeller från andra leverantörer som också stöder kontexter på miljontals tokens. Dess prissättning på $3/$15 per miljon tokens är konkurrenskraftig. Till skillnad från vissa modeller stöder Kimi K3 multimodala indata (text och bild). En viktig särskiljningsfaktor är att den nås via OrcaRouter utan påslag. Jämfört med modeller som GPT-4 Turbo (128K kontext, högre kostnad) kan Kimi K3 vara billigare för mycket långa sekvenser men kan ha olika kvalitetsprofiler. Jämförelser av riktmärken tillhandahålls inte.
Välj Kimi K3 när uppgiften kräver det fullständiga stora kontextfönstret—till exempel att analysera ett 500-sidigt dokument i en enda bit, eller att inkludera många bilder i en enda prompt. Billigare modeller med mindre kontextfönster (t.ex. 128K tokens) kan tvinga dig att dela upp indata, vilket gör att tvärreferenser går förlorade. Om uppgiften kan delas upp utan kvalitetsförlust är en billigare modell att föredra på grund av lägre kostnad per token. Överväg också om modellens specifika styrkor (multimodal, lång kontext) är avgörande.
De angivna fakta täcker endast Kimi K3. MoonshotAI har tidigare modeller som Kimi och Kimi K2. Kimi K3 är den senaste med ett större kontextfönster och multimodalt stöd. Äldre modeller har troligen mindre kontexter och kan kanske inte ta emot bilder. Prissättning för andra modeller anges inte. För befintliga användare av MoonshotAI:s äldre modeller erbjuder uppgradering till Kimi K3 utökade funktioner men till en högre kostnad per token. Beslutet beror på om det större kontextfönstret och bildinmatningarna motiverar premiumpriset.
OpenAI-kompatibel — behåll det SDK du redan använder
https://api.orcarouter.ai/v1from openai import OpenAI
client = OpenAI(
base_url="https://api.orcarouter.ai/v1",
api_key="$ORCAROUTER_API_KEY",
)
response = client.chat.completions.create(
model="kimi/kimi-k3",
messages=[{"role": "user", "content": "Hello"}],
)
print(response.choices[0].message.content)frequency_penaltyinclude_reasoningmax_tokenspresence_penaltyreasoningreasoning_effortresponse_formatstopstructured_outputstool_choicetools| Inmatning / 1M token | $3.00 |
| Utdata / 1M tokens | $15.00 |
| Cacheläsning / 1M | $0.300 |
| Valuta | USD |
Uppskattning baserad på listpris
Endast en uppskattning — faktiskt antal token beror på leverantörens tokenizer.
@misc{orcarouter_kimi_k3,
title = {Kimi K3 API},
author = {MoonshotAI},
year = {2026},
howpublished = {OrcaRouter},
url = {https://www.orcarouter.ai/models/kimi/kimi-k3}
}MoonshotAI. (2026). Kimi K3 API. OrcaRouter. https://www.orcarouter.ai/models/kimi/kimi-k3