Kimi K3 to flagowy model Moonshot AI i jak dotąd jej najbardziej zaawansowane wydanie — model Mixture-of-Experts o 2,8 biliona parametrów, zaprojektowany do długoterminowego kodowania i kompleksowej pracy związanej z wiedzą. Łączy kontekst o długości 1 miliona tokenów z natywnym rozumieniem obrazu, akceptując obrazy i tekst jako dane wejściowe oraz generując odpowiedzi tekstowe. Jest zaprojektowany tak, aby zachować spójność podczas bardzo długich sesji agencyjnych. Moonshot pozycjonuje K3 do scenariuszy z agentami programistycznymi, takich jak Codex, Claude Code, Cline i RooCode, a także do głębokiego wnioskowania i pracy opartej na wiedzy. Udostępnia kontrolę reasoning_effort najwyższego poziomu oraz natywne wywoływanie narzędzi, a także korzysta z formatu API OpenAI na potrzeby łatwej integracji. Należy pamiętać, że K3 nie akceptuje parametrów próbkowania (brak temperature / top_p / seed) — głębokość wnioskowania jest kontrolowana za pomocą reasoning_effort.
MoonshotAI Kimi K3 to duży model językowy opracowany przez MoonshotAI, chińską firmę AI. Obsługuje okno kontekstowe o rozmiarze 1,048,576 tokenów oraz akceptuje zarówno tekst, jak i obrazy jako dane…
Główną możliwością modelu Kimi K3 jest przetwarzanie kontekstu o wielkości do 1,048,576 tokenów, co pozwala jej na uwzględnienie całych powieści, długich instrukcji technicznych lub rozległych historii rozmów w jednym zapytaniu. Model przyjmuje również obrazy, umożliwiając wnioskowanie multimodalne. Może wykonywać zadania takie jak podsumowywanie, odpowiadanie na pytania i generowanie na bardzo długich wejściach. Jest w stanie rozumieć złożone instrukcje i podążać za nimi przez długie sekwencje. Obsługuje parametry API kompatybilne z OpenAI, takie jak temperature, max_tokens, top_p i sekwencje stop, poprzez OrcaRouter.
Kimi K3 działa najlepiej, gdy zadanie z natury wymaga bardzo dużego kontekstu — na przykład analiza 1000-stronicowego dokumentu za jednym razem lub prowadzenie rozmowy z pełną historią setek wiadomości. W przypadku krótszych danych wejściowych wyższy koszt na token ($3/$15 za milion) może być nieuzasadniony. Tańsze modele z mniejszymi oknami kontekstu mogą efektywniej obsłużyć większość typowych zadań. Używaj Kimi K3 tylko wtedy, gdy zadanie wymaga pełnego okna kontekstu, aby uniknąć przycinania lub wieloetapowego dzielenia i podsumowywania.
Kimi K3 doskonale radzi sobie z zadaniami, w których informacje są rozproszone w bardzo długim tekście lub zawierają obrazy. Przykłady obejmują wyodrębnianie kluczowych faktów z raportu o długości książki, odpowiadanie na pytania dotyczące pełnej bazy kodu, porównywanie wielu prac badawczych lub analizowanie serii diagramów. Może również utrzymywać spójność w długich dialogach. Jego siła tkwi w zdolności do jednoczesnego uwzględniania wszystkich części kontekstu, co zmniejsza potrzebę zewnętrznego wyszukiwania lub dzielenia na fragmenty.
Chociaż Kimi K3 ma duże okno kontekstowe, nie zawsze może działać tak dobrze jak mniejsze, dostrojone modele w wąskich zadaniach. Duże okno kontekstowe może również zwiększyć opóźnienie i koszt obliczeniowy. Dokładne ograniczenia (np. maksymalna rozdzielczość obrazu, obsługiwane typy plików, znajomość języka) nie są określone w podanych faktach, ale są nieodłączną cechą konstrukcji modelu. Użytkownicy powinni być świadomi, że bardzo długie prompty zużywają wiele tokenów, a tym samym generują wyższe koszty. Model jest dostępny przez OrcaRouter; obowiązują czasy pracy i odpowiedzi dostawcy.
Przedstawione fakty nie zawierają konkretnych wyników benchmarków dla Kimi K3. Ogólnie rzecz biorąc, modele o dużym kontekście są oceniane na podstawie zadań takich jak test Needle in a Haystack, długodokumentowe QA i streszczanie. MoonshotAI mógł opublikować wyniki; użytkownicy powinni zapoznać się z oficjalną dokumentacją. Wydajność modelu w standardowych benchmarkach NLP (np. MMLU, GSM8K) nie jest podana. Zalecamy przetestowanie Kimi K3 na własnym zbiorze ewaluacyjnym, aby ocenić jego skuteczność dla Twojego przypadku użycia.
Okno kontekstu o wielkości 1 048 576 tokenów oznacza, że model może przetworzyć w jednym przejściu około 1,5 miliona angielskich słów lub 800 000 chińskich znaków. W praktyce umożliwia to obsługę całych książek, obszernych logów rozmów lub danych multimodalnych zawierających wiele obrazów. Nie wszystkie tokeny mogą być jednak jednakowo wykorzystywane; mechanizmy uwagi czasami bardziej koncentrują się na niedawnych lub wyróżniających się fragmentach. Można testować zdolność modelu do wyszukiwania informacji w środku długich kontekstów. Wydajność w takich zadaniach jest często lepsza niż w przypadku modeli o mniejszym kontekście, ale nadal może pozostawiać pole do poprawy.
Opóźnienie i przepustowość nie są określone w podanych faktach. Modele z bardzo dużymi kontekstami okien zwykle przetwarzają każde żądanie dłużej, ponieważ mechanizm uwagi skaluje się kwadratowo wraz z długością sekwencji. W przypadku pełnego wyjścia o długości 1 miliona tokenów należy spodziewać się wysokiego opóźnienia. Za pomocą OrcaRouter można ustawić max_tokens, aby ograniczyć długość wyjścia i kontrolować czas odpowiedzi. W przypadku aplikacji czasu rzeczywistego warto rozważyć użycie mniejszych modeli. Przetwarzanie wsadowe dłuższych zadań może być bardziej praktyczne. Rzeczywista wydajność będzie zależeć od infrastruktury dostawcy i bieżącego obciążenia.
Duży kontekst okna Kimi K3 jest zarówno zaletą, jak i wyzwaniem. Może nie być tak dokładne w zadaniach wymagających precyzyjnego wnioskowania na krótkich danych wejściowych w porównaniu do wyspecjalizowanych modeli. Model może wykazywać niższą jakość w obszarach takich jak kreatywne pisanie czy generowanie kodu w porównaniu do modeli dostrojonych do tych zadań. Dodatkowo koszt na token jest stosunkowo wysoki, więc używanie go do krótkich promptów jest nieefektywne. Model jest stosunkowo nowy; długoterminowa stabilność i wsparcie ze strony MoonshotAI to czynniki, które należy wziąć pod uwagę.
Kimi K3 jest wycenione na $3.00 za 1 milion tokenów wejściowych i $15.00 za 1 milion tokenów wyjściowych. Są to stawki dostawcy, do których OrcaRouter nie dolicza żadnej marży. Tokeny wejściowe obejmują zarówno tokeny tekstowe, jak i obrazowe (obrazy są rozliczane na podstawie ich równoważnika tokenowego). Tokeny wyjściowe to wszelkie tokeny wygenerowane przez model. Nie ma żadnych dodatkowych opłat poza kosztami za token. Ceny mogą ulec zmianie przez dostawcę, ale OrcaRouter przekazuje stawki bez dodawania marży.
Ponieważ Kimi K3 może obsługiwać bardzo długie konteksty, może zastąpić wiele wywołań API, które byłyby potrzebne w przypadku modeli o mniejszym kontekście, potencjalnie obniżając całkowity koszt zadań wymagających pełnego przetwarzania dokumentów. Jednak każdy token jest droższy niż w wielu kompaktowych modelach. Na przykład, wejście o długości 1M tokenów za $3.00 jest stałe, podczas gdy mniejszy model może kosztować $0.15 za milion, ale wymaga wielu wywołań do przetworzenia tych samych danych. Jest to kompromis między prostotą a kosztem na token. Użytkownicy powinni oszacować całkowite zużycie tokenów na zadanie.
Przedstawione fakty nie wspominają o żadnych zniżkach na buforowanie lub rabatach wolumenowych dla Kimi K3 na OrcaRouter. Ceny są ściśle według tokenów, zgodnie z fakturowaniem przez dostawcę. OrcaRouter może oferować funkcje takie jak rejestrowanie zapytań lub ponawianie prób, ale nie wskazano żadnych konkretnych obniżek cen. Użytkownicy powinni sprawdzić aktualną stronę cenową OrcaRouter w celu uzyskania aktualizacji. Ogólnie rzecz biorąc, użytkownicy o dużym wolumenie mogą negocjować bezpośrednio z dostawcą, ale za pośrednictwem OrcaRouter obowiązują podane stawki.
Obrazy są konwertowane na tokeny do celów rozliczeniowych. Dokładna tokenizacja obrazów zależy od ich rozdzielczości i algorytmu dostawcy. Zazwyczaj standardowy obraz (np. 1024×1024) może kosztować rzędu setek tokenów. Ponieważ cena wejściowa Kimi K3 wynosi 3,00 USD za 1 milion tokenów, dodanie obrazów do promptu zwiększa liczbę tokenów wejściowych, a tym samym koszt. W przypadku obciążeń z wieloma obrazami całkowity koszt może szybko wzrosnąć. Zaleca się minimalizowanie rozmiaru obrazów lub uwzględnianie tylko istotnych obrazów, aby kontrolować wydatki.
Dostęp do Kimi K3 odbywa się przez zgodne z OpenAI API OrcaRouter. Wysyłasz żądania HTTP POST na adres https://api.orcarouter.ai/v1/chat/completions z parametrem model ustawionym na "kimi/kimi-k3". Format żądania jest identyczny jak w OpenAI Chat Completions API: należy dołączyć tablicę messages z rolami system, user i assistant. W przypadku obrazów użyj tablicy content z typem "image_url". Upewnij się, że masz klucz API z OrcaRouter. Nie jest wymagana żadna specjalna konfiguracja; obsługiwane są standardowe parametry, takie jak temperature, max_tokens, top_p i stop.
Przez OrcaRouter, Kimi K3 obsługuje standardowe parametry zgodne z OpenAI: temperatura (domyślnie 0.7), max_tokens (do maksymalnej liczby tokenów modelu, która nie jest określona, ale prawdopodobnie mniejsza niż 32K), top_p, frequency_penalty, presence_penalty, sekwencje stop oraz n (liczba uzupełnień). Model akceptuje również parametr stream do wyjścia w czasie rzeczywistym. W przypadku obrazów wejściowych możesz użyć formatu multimodalnego. Nieobsługiwane parametry zostaną zignorowane. Duże okno kontekstowe pozwala na ustawienie wysokiego max_tokens dla długich wyników, ale należy pamiętać o kosztach.
Migracja jest prosta, jeśli już używasz API zgodnego z OpenAI. Zmień podstawowy URL na https://api.orcarouter.ai/v1, zaktualizuj identyfikator modelu na "kimi/kimi-k3" i ustaw swój klucz API OrcaRouter. Nie są wymagane żadne zmiany w kodzie, jeśli używasz tego samego formatu wiadomości. Aby obsługiwać obrazy, upewnij się, że Twoje prompty zawierają adresy URL obrazów lub dane w formacie base64. Może być konieczne dostosowanie max_tokens i innych parametrów do możliwości modelu. Najpierw przetestuj na małej próbce, aby zweryfikować jakość wyników i koszt.
Potrzebujesz klucza API od OrcaRouter. Umieść go w nagłówku Authorization jako Bearer YOUR_API_KEY. OrcaRouter zarządza uwierzytelnianiem i rozliczeniami. Ze względów bezpieczeństwa nie udostępniaj swojego klucza. OrcaRouter może również obsługiwać rotację kluczy API. Nie jest wymagane dodatkowe uwierzytelnianie ze strony MoonshotAI. Wszystkie żądania przechodzą przez infrastrukturę OrcaRouter, która obsługuje ograniczanie szybkości i obsługę błędów. Upewnij się, że Twoje żądania są zgodne z warunkami korzystania z usług OrcaRouter.
Kimi K3 oferuje okno kontekstu o wielkości 1 048 576 tokenów, co czyni go jednym z największych dostępnych. Jest porównywalny do modeli innych dostawców, które również obsługują konteksty o milionowej liczbie tokenów. Cena wynosząca 3/15 dolarów za milion tokenów jest konkurencyjna. W przeciwieństwie do niektórych modeli, Kimi K3 obsługuje wejścia multimodalne (tekst i obrazy). Kluczowym wyróżnikiem jest dostęp przez OrcaRouter bez narzutu. W porównaniu do modeli takich jak GPT-4 Turbo (kontekst 128K, wyższy koszt), Kimi K3 może być tańszy dla bardzo długich sekwencji, ale może mieć inny profil jakościowy. Nie podano porównań benchmarkowych.
Wybierz Kimi K3, gdy zadanie wymaga pełnego, dużego okna kontekstowego — na przykład analizy 500-stronicowego dokumentu w jednej porcji lub umieszczenia wielu obrazów w pojedynczym zapytaniu. Tańsze modele z mniejszymi oknami kontekstowymi (np. 128K tokenów) mogą zmusić cię do dzielenia wejścia na fragmenty, tracąc przy tym powiązania między elementami. Jeśli zadanie można podzielić bez utraty jakości, korzystniejszy jest tańszy model ze względu na niższy koszt na token. Weź też pod uwagę, czy specyficzne mocne strony modelu (multimodalność, długi kontekst) są krytyczne.
Podane fakty dotyczą tylko Kimi K3. MoonshotAI ma wcześniejsze modele, takie jak Kimi i Kimi K2. Kimi K3 jest najnowszym modelem z większym oknem kontekstowym i obsługą multimodalną. Wcześniejsze modele prawdopodobnie mają mniejsze konteksty i mogą nie akceptować obrazów. Ceny innych modeli nie są podane. Dla obecnych użytkowników starszych modeli MoonshotAI, aktualizacja do Kimi K3 oferuje rozszerzone możliwości, ale po wyższym koszcie za token. Decyzja zależy od tego, czy większy kontekst i wprowadzanie obrazów uzasadniają wyższą cenę.
Zgodne z OpenAI — zostań przy swoim SDK
https://api.orcarouter.ai/v1import os
from openai import OpenAI
client = OpenAI(
base_url="https://api.orcarouter.ai/v1",
api_key=os.environ["ORCAROUTER_API_KEY"],
)
response = client.chat.completions.create(
model="kimi/kimi-k3",
messages=[{"role": "user", "content": "Hello"}],
)
print(response.choices[0].message.content)frequency_penaltyinclude_reasoningmax_tokenspresence_penaltyreasoningreasoning_effortresponse_formatstopstructured_outputstool_choicetools| Wejście / 1M tokenów | $3.00 |
| Wyjście / 1M tokenów | $15.00 |
| Odczyt cache / 1M | $0.300 |
| Waluta | USD |
Szacunek na podstawie cennika
Tylko szacunek — rzeczywista liczba tokenów zależy od tokenizatora dostawcy.
O czym mówią programiści w tym tygodniu
GET /api/public/models/kimi/kimi-k3Otwórz @misc{orcarouter_kimi_k3,
title = {Kimi K3 API},
author = {MoonshotAI},
year = {2026},
howpublished = {OrcaRouter},
url = {https://www.orcarouter.ai/models/kimi/kimi-k3}
}MoonshotAI. (2026). Kimi K3 API. OrcaRouter. https://www.orcarouter.ai/models/kimi/kimi-k3