Moonshot Kimi K2 (0905 baseline) — 1T-param MoE chatmodell med 32B aktiva per pass, 256k kontext, balanserad prestanda.
Kimi K2.5 är en multimodal språkmodell skapad av leverantören Kimi. Den accepterar både text- och bildinmatningar och är utformad för att hantera långa kontextuppgifter med ett kontextfönster på 262…
Kimi K2.5 utmärker sig i långkontextförståelse med ett fönster på 262 000 token. Den kan bearbeta hela dokument i ett enda pass, vilket möjliggör uppgifter som sammanfattning, frågebesvarande och informationsextraktion över långa texter. Bildinmatningsförmågan tillåter multimodal resonemang – till exempel att beskriva ett diagram, läsa text från ett foto eller kombinera visuella och textuella data för att besvara komplexa frågor. Det höga τ²-Bench-resultatet (95,9) indikerar stark prestanda i verktygsanvändning och flerstegsresonemang, såsom att anropa API:er, utföra beräkningar eller bläddra i data.
Du bör välja Kimi K2.5 när din uppgift kräver ett stort kontextfönster (över 32K tokens) eller när du behöver bearbeta bilder. Om din uppgift är rent textbaserad och ryms inom ett fönster på 4K till 32K tokens, kan en mindre modell vara mer kostnadseffektiv. Kimi K2.5:s styrka i verktygsanvändningsresonemang (bevisat genom dess τ²-Bench-poäng) gör den lämplig för agentiska arbetsflöden där modellen måste anropa externa verktyg, hantera flerväxelinteraktioner eller följa komplexa instruktioner. För enkel textgenerering eller klassificering kan en billigare modell vara tillräcklig.
Uppgifter som gynnas mest inkluderar: långformig dokumentanalys (t.ex. kontraktsgranskning, sammanfattning av akademiska artiklar), multimodal resonemangsförmåga (t.ex. bildtextning, visuell frågesvar), agentiska arbetsflöden (t.ex. webbautomation, kodgenerering med flera steg) och uppgifter som kräver konsekvent kontext över många turer (t.ex. kundsupportchattbotar som hanterar omfattande historik). Kombinationen av stor kontext och bildinmatning gör det särskilt användbart inom områden som sjukvård (analys av rapporter och bilder), juridik (dokumentgranskning) och forskning (bearbetning av diagram och publikationer).
Specifika begränsningar anges inte, men som en stor modell kan den ha högre latens jämfört med mindre modeller. Priset per token är högre än vissa kompakta alternativ, så det kanske inte är kostnadseffektivt för mycket korta uppmaningar. Bildinmatningsbearbetning kan förbruka många tokens, vilket ökar kostnaden. Modellens prestanda för uppgifter som inte omfattas av τ²-Bench-riktmärket är overifierad. Användare bör testa på sina egna data för att bekräfta lämplighet. Modellen nås via OrcaRouter, som lägger till ett standard-API-lager men ingen extra påslag på leverantörens prissättning.
τ²-Bench är ett riktmärke utformat för att utvärdera AI-agenter i verkliga verktygsanvändnings- och resonemangsuppgifter. Det testar en modells förmåga att förstå instruktioner, planera steg, använda externa verktyg (t.ex. miniräknare, sökmotorer) och producera korrekta resultat. En poäng på 95,9 indikerar att Kimi K2.5 presterar mycket starkt i dessa praktiska resonemangsuppgifter. Detta enskilda nummer fångar dock inte prestanda inom andra dimensioner som kreativitet, faktagranskning eller flerspråkigt stöd. Riktmärket ger en användbar referens för att jämföra modeller som är optimerade för agentiska arbetsflöden.
Den enda offentligt tillgängliga benchmark-siffran för Kimi K2.5 är dess τ²-Bench-poäng på 95,9. Inga andra benchmark-siffror (t.ex. MMLU, HumanEval) finns tillgängliga i källfakta. Därför kan direkta jämförelser inte göras enbart med hjälp av dessa data. Generellt sett tyder en hög τ²-Bench-poäng på att Kimi K2.5 är konkurrenskraftig jämfört med andra modeller som är utformade för verktygsanvändning och flerstegsresonemang. Användare bör genomföra egna utvärderingar för specifika användningsfall för att avgöra om den uppfyller deras prestandakrav. OrcaRouter ger tillgång till denna modell utan extra påslag.
Inga specifika latens- eller tokens-per-sekund-siffror tillhandahålls för Kimi K2.5. Som en stor modell med en token-kontext på 262K kommer inferenstiden generellt att vara längre än för mindre modeller, särskilt för långa uppmaningar eller höga tokenutdata. Latensen beror också på den hårdvara som används av leverantören (Kimi) och den aktuella belastningen på OrcaRouters API. För realtidsapplikationer bör användare testa modellen med sina typiska promptstorlekar för att bestämma acceptabla svarstider. Prissättningen är per token, inte per begäran, så inga extra hastighetsavgifter tillkommer.
Kimi K2.5 prissätts till $0.60 per 1 miljon inmatningstokens och $3.00 per 1 miljon utmatningstokens. Dessa priser faktureras enligt leverantörens taxa med noll påslag, vilket innebär att OrcaRouter förmedlar den exakta kostnaden från Kimi. Det finns inga ytterligare avgifter eller nivåbaserade priser. Inmatningstokens inkluderar både text- och bildtokens. Utmatningstokens är det genererade svaret. Prissättningen är per token, så den totala kostnaden beror på promptens och svarstokens längd. Det finns ingen separat avgift för bildbehandling utöver tokenantalet.
De angivna fakta nämner inga cache-mekanismer eller särskilda prisrabatter för Kimi K2.5. OrcaRouters standard-API inkluderar för närvarande inte automatisk prompt-caching. Användare kan optimera kostnader genom att noggrant hantera promptlängd och minska onödiga tokens. För repetitiva uppgifter kan batchning av flera frågor i en enda begäran minska den totala tokenanvändningen. Eftersom det inte finns någon påslag på leverantörens prissättning är modellens kostnad direkt kopplad till tokenförbrukning. Överväg att använda en mindre modell för uppgifter som passar inom en kortare kontext för att spara pengar.
Den primära avvägningen är mellan prestanda och kostnad. Kimi K2.5:s pris per utdatatoken ($3.00/1M) är högre än för många mindre modeller. För uppgifter som kräver långa utdata (t.ex. full dokumentgenerering) kan kostnaderna ackumuleras snabbt. Det stora kontextfönstret kan dock minska behovet av flera API-anrop för att hantera långa indata, vilket potentiellt sparar totala kostnader. Bildinmatningsfunktionen ökar tokenförbrukningen men kan eliminera behovet av separata bildbehandlingspipelines. Användare bör utvärdera förväntade tokenvolymer och jämföra med alternativ via OrcaRouter för att hitta bästa passformen.
Kimi K2.5 är tillgänglig via OrcaRouters OpenAI-kompatibla API. Bas-URL:en är https://api.orcarouter.ai/v1. Du måste använda modelidentifieraren 'kimi/kimi-k2.5' i dina förfrågningar. Autentisering sker via en API-nyckel som erhålls från OrcaRouter. API:et stöder samma endpoints som OpenAIs Chat Completions API, inklusive chat completions och streaming. Exempel: POST till /chat/completions med model: 'kimi/kimi-k2.5', messages-array (innehåll kan inkludera text och bild-URL:er), samt valfria parametrar som temperature, max_tokens (upp till 32768) och stream.
Modellen stöder standardparametrar från OpenAI Chat API: 'model', 'messages' (array med role och content), 'max_tokens' (standard varierar, max 32768), 'temperature' (standard 0.7), 'top_p', 'stop', 'stream' (boolean) och 'frequency_penalty' och 'presence_penalty'. Bildinmatning hanteras via innehållsdelar av typen 'image_url' i användarmeddelandet. Modellen respekterar gränsen på 262144 tokens kontext, så prompt+max_tokens får inte överstiga detta. Alla andra OpenAI-parametrar kan accepteras men deras effekt beror på den underliggande Kimi-modellen.
Migrering är enkel eftersom OrcaRouters API är kompatibelt med OpenAI. Byt bara bas-URL till https://api.orcarouter.ai/v1, din API-nyckel till en OrcaRouter-nyckel och uppdatera modellnamnet till 'kimi/kimi-k2.5'. Om din befintliga kod använder openai Python-biblioteket kan du ställa in openai.api_base och openai.api_key. För chattkompletteringar förblir meddelandeformatet detsamma; om du tidigare använde bildinmatning med GPT-4V är formatet för 'image_url'-delen identiskt. Justera max_tokens om det överstiger 32768. Inga andra ändringar krävs för grundläggande funktionalitet.
Baserat på de angivna fakta erbjuder Kimi K2.5 ett kontextfönster på 262 144 tokens, vilket är större än typiska modeller som GPT-4 (32K) men jämförbart med andra långkontextmodeller som Gemini 1.5 Pro (1M-gräns) eller Claude 3.5 Sonnet (200K). Prissättningen på $0,60/$3,00 per 1M tokens är konkurrenskraftig, och nollpåslaget från OrcaRouter håller kostnaderna förutsägbara. τ²-Bench-poängen 95,9 tyder på starkt verktygsanvändningsresonemang, men utan ytterligare riktmärken är en fullständig prestandajämförelse inte möjlig. Användare bör utvärdera på sina egna uppgifter.
Mindre modeller på OrcaRouter (t.ex. gpt-4o-mini eller andra kompakta modeller) har generellt lägre kostnad per token, snabbare svarstider och kortare kontextfönster. De är lämpliga för enkla uppgifter, klassificering eller korta frågor. Kimi K2.5, med sina 262K kontext och bildstöd, är bättre för komplexa resonemang, långa dokument och multimodala indata. Avvägningen är högre kostnad per token och potentiellt långsammare svarstider. Om din uppgift inte kräver det stora kontextfönstret eller multimodala förmågor, är en billigare modell mer effektiv. OrcaRouter gör det enkelt att växla mellan modeller för olika användningsfall.
Kimi K2.5 är lämplig för produktion om dess funktioner matchar dina krav. Modellen nås via OrcaRouter, som tillhandahåller en pålitlig API-infrastruktur och standard OpenAI-kompatibilitet. Prissättningen till leverantörens taxa med noll påslag är transparent. Men som med alla tredjepartsmodeller bör du testa för konsekvens, latens och felhantering under belastning. τ²-Bench-poängen indikerar stark prestanda i verktygsanvändningsscenarier, men produktionsberedskap beror också på faktorer som drifttid, hastighetsbegränsningar och support från OrcaRouter. Kontakta OrcaRouter för specifika SLA-avtal och tillgänglighetsdetaljer.
OpenAI-kompatibel — behåll det SDK du redan använder
https://api.orcarouter.ai/v1import os
from openai import OpenAI
client = OpenAI(
base_url="https://api.orcarouter.ai/v1",
api_key=os.environ["ORCAROUTER_API_KEY"],
)
response = client.chat.completions.create(
model="kimi/kimi-k2.5",
messages=[{"role": "user", "content": "Hello"}],
)
print(response.choices[0].message.content)frequency_penaltyinclude_reasoningmax_completion_tokensmax_tokensnpresence_penaltyprompt_cache_keyreasoningresponse_formatsafety_identifierstopstreamstream_optionstemperaturethinkingtoolstop_p| Inmatning / 1M token | $0.600 |
| Utdata / 1M tokens | $3.00 |
| Cacheläsning / 1M | $0.100 |
| Valuta | USD |
Uppskattning baserad på listpris
Endast en uppskattning — faktiskt antal token beror på leverantörens tokenizer.
Vad utvecklare säger den här veckan
@misc{orcarouter_kimi_k2_5,
title = {kimi/kimi-k2.5 API},
author = {kimi},
year = {n.d.},
howpublished = {OrcaRouter},
url = {https://www.orcarouter.ai/models/kimi/kimi-k2.5}
}kimi. (n.d.). kimi/kimi-k2.5 API. OrcaRouter. https://www.orcarouter.ai/models/kimi/kimi-k2.5