Kimi K3 es el modelo insignia de Moonshot AI y su lanzamiento más capaz hasta la fecha: un modelo Mixture-of-Experts de 2,8 billones de parámetros diseñado para codificación a largo plazo y trabajo de conocimiento de extremo a extremo. Combina una ventana de contexto de 1M de tokens con comprensión visual nativa, acepta entrada de texto e imagen con salida de texto, y está diseñado para mantenerse coherente en sesiones agénticas muy largas. Moonshot posiciona a K3 para escenarios de agente de programación como Codex, Claude Code, Cline y RooCode, así como para razonamiento profundo y trabajo de conocimiento. Expone un control reasoning_effort de alto nivel y llamada nativa a herramientas, y utiliza el formato de API de OpenAI para integración directa. Tenga en cuenta que K3 no acepta parámetros de muestreo (sin temperature / top_p / seed): la profundidad del razonamiento se controla mediante reasoning_effort.
MoonshotAI Kimi K3 es un modelo de lenguaje grande desarrollado por MoonshotAI, una empresa china de IA. Admite una ventana de contexto de 1,048,576 tokens y acepta entradas tanto de texto como de…
La capacidad principal de Kimi K3 es procesar una ventana de contexto de hasta 1.048.576 tokens, lo que le permite incorporar novelas enteras, manuales técnicos extensos o historiales de conversación prolongados en una sola instrucción. También acepta imágenes, lo que permite el razonamiento multimodal. El modelo puede realizar tareas como resumir, responder preguntas y generar contenido en entradas muy largas. Es capaz de comprender instrucciones complejas y seguirlas en secuencias largas. Admite parámetros de API compatibles con OpenAI, como temperature, max_tokens, top_p y secuencias de parada a través de OrcaRouter.
Kimi K3 es mejor usarlo cuando la tarea requiere inherentemente un contexto muy amplio—por ejemplo, analizar un documento de 1,000 páginas de una sola vez, o mantener una conversación con un historial completo de cientos de mensajes. Para entradas más cortas, su mayor costo por token ($3/$15 por millón) puede no estar justificado. Los modelos más baratos con ventanas de contexto más pequeñas pueden manejar la mayoría de las tareas típicas de manera más eficiente. Usa Kimi K3 solo cuando la tarea requiera la ventana de contexto completa para evitar truncamientos o múltiples pasos de fragmentación y resumen.
Kimi K3 sobresale en tareas donde la información está distribuida en un texto muy largo o incluye imágenes. Ejemplos incluyen extraer hechos clave de un informe extenso, responder preguntas sobre un código fuente completo, comparar múltiples artículos de investigación o analizar una serie de diagramas. También puede mantener la coherencia en diálogos largos. Su fortaleza radica en su capacidad para atender a todas las partes del contexto simultáneamente, reduciendo la necesidad de recuperación externa o fragmentación.
Si bien Kimi K3 tiene una ventana de contexto amplia, es posible que no siempre rinda tan bien como modelos más pequeños y ajustados en tareas específicas. El contexto amplio también puede aumentar la latencia y el costo computacional. Las limitaciones exactas (por ejemplo, resolución máxima de imagen, tipos de archivo compatibles, dominio del idioma) no se especifican en los datos proporcionados, pero son inherentes al diseño del modelo. Los usuarios deben tener en cuenta que las indicaciones muy largas consumen muchos tokens y, por lo tanto, generan costos más altos. El modelo se accede a través de OrcaRouter; se aplican el tiempo de actividad del proveedor y los tiempos de respuesta.
Los datos proporcionados no incluyen puntuaciones específicas de referencia para Kimi K3. Generalmente, los modelos de contexto amplio se evalúan en tareas como la prueba de la aguja en un pajar (Needle in a Haystack), preguntas y respuestas sobre documentos largos, y resúmenes. MoonshotAI puede haber publicado resultados; los usuarios deben consultar la documentación oficial. El rendimiento del modelo en evaluaciones estándar de PLN (p. ej., MMLU, GSM8K) no se indica. Recomendamos probar Kimi K3 en su propio conjunto de evaluación para medir su efectividad para su caso de uso.
Una ventana de contexto de 1,048,576 tokens significa que el modelo puede procesar aproximadamente 1.5 millones de palabras en inglés o 800,000 caracteres chinos en una sola pasada. En la práctica, esto permite manejar libros completos, registros extensos de conversaciones o datos multimodales con muchas imágenes. Sin embargo, no todos los tokens pueden utilizarse por igual; los mecanismos de atención a veces se centran más en partes recientes o destacadas. Se puede evaluar la capacidad del modelo para recuperar información del medio de contextos largos. El rendimiento en tales tareas suele ser mejor que el de modelos con contexto más pequeño, pero aún puede tener margen de mejora.
La latencia y el rendimiento no están especificados en los datos proporcionados. Los modelos con ventanas de contexto muy grandes generalmente tardan más en procesar cada solicitud porque el mecanismo de atención escala cuadráticamente con la longitud de la secuencia. Para una salida completa de 1 millón de tokens, espere una latencia alta. A través de OrcaRouter, puede establecer max_tokens para limitar la longitud de la salida y controlar el tiempo de respuesta. Para aplicaciones en tiempo real, considere usar modelos más pequeños. El procesamiento por lotes de tareas más largas puede ser más práctico. El rendimiento real dependerá de la infraestructura del proveedor y la carga actual.
La gran ventana de contexto de Kimi K3 es una fortaleza pero también un desafío. Puede no ser tan precisa en tareas que requieren razonamiento preciso sobre entradas cortas en comparación con modelos especializados. El modelo podría mostrar una calidad inferior en áreas como escritura creativa o generación de código en comparación con modelos ajustados para esas tareas. Además, el costo por token es relativamente alto, por lo que usarlo para indicaciones cortas es ineficiente. El modelo es relativamente nuevo; la estabilidad a largo plazo y el soporte de MoonshotAI son factores a considerar.
Kimi K3 tiene un precio de $3.00 por 1 millón de tokens de entrada y $15.00 por 1 millón de tokens de salida. Estas son las tarifas del proveedor sin margen añadido por OrcaRouter. Los tokens de entrada incluyen tanto tokens de texto como de imagen (las imágenes se facturan según su equivalente en tokens). Los tokens de salida son cualquier token generado por el modelo. No hay tarifas adicionales más allá de los costos por token. Los precios están sujetos a cambios por parte del proveedor, pero OrcaRouter transmite las tarifas sin agregar margen.
Debido a que Kimi K3 puede manejar contextos extremadamente largos, puede reemplazar varias llamadas API que serían necesarias con modelos de contexto más pequeño, reduciendo potencialmente el costo total para tareas que requieren procesamiento completo de documentos. Sin embargo, cada token es más caro que en muchos modelos compactos. Por ejemplo, una entrada de 1M de tokens a $3.00 es fija, mientras que un modelo más pequeño podría costar $0.15 por millón, pero requerir múltiples llamadas para procesar los mismos datos. El equilibrio está entre la simplicidad y el costo por token. Los usuarios deben estimar el uso total de tokens por tarea.
Los hechos proporcionados no mencionan ningún descuento por almacenamiento en caché o por volumen para Kimi K3 en OrcaRouter. El precio es estrictamente por token según lo facturado por el proveedor. OrcaRouter puede ofrecer funciones como registro de solicitudes o reintentos, pero no se indican reducciones de precio específicas. Los usuarios deben consultar la página de precios actual de OrcaRouter para conocer cualquier actualización. En general, los usuarios de alto volumen pueden negociar directamente con el proveedor, pero a través de OrcaRouter se aplican las tarifas listadas.
Las imágenes se convierten en tokens para fines de facturación. La tokenización exacta de las imágenes depende de su resolución y del algoritmo del proveedor. Normalmente, una imagen estándar (por ejemplo, 1024x1024) podría costar del orden de cientos de tokens. Dado que el precio de entrada de Kimi K3 es de $3.00 por 1M de tokens, incluir imágenes en una instrucción aumenta el recuento de tokens de entrada y, por lo tanto, el costo. Para cargas de trabajo con muchas imágenes, el costo total se puede acumular rápidamente. Es recomendable minimizar el tamaño de las imágenes o incluir solo las imágenes relevantes para controlar los gastos.
Se accede a Kimi K3 a través de la API compatible con OpenAI de OrcaRouter. Envías solicitudes HTTP POST a https://api.orcarouter.ai/v1/chat/completions con el parámetro model configurado como "kimi/kimi-k3". El formato de la solicitud es idéntico al de la API de Chat Completions de OpenAI: incluye un arreglo messages con roles de system, user y assistant. Para entradas de imagen, usa el arreglo content con el tipo "image_url". Asegúrate de tener una clave API de OrcaRouter. No se necesita configuración especial; se admiten parámetros estándar como temperature, max_tokens, top_p y stop.
A través de OrcaRouter, Kimi K3 admite parámetros estándar compatibles con OpenAI: temperature (por defecto 0.7), max_tokens (hasta el límite de salida del modelo, que no está especificado pero probablemente sea inferior a 32K), top_p, frequency_penalty, presence_penalty, stop sequences y n (número de completaciones). El modelo también acepta un parámetro stream para la salida en tiempo real. Para entradas de imagen, puedes usar el formato de contenido multimodal. Los parámetros no admitidos se ignorarán. La gran ventana de contexto permite establecer un max_tokens alto para salidas largas, pero ten en cuenta el costo.
La migración es sencilla si ya usas una API compatible con OpenAI. Cambia la URL base a https://api.orcarouter.ai/v1, actualiza el ID del modelo a "kimi/kimi-k3" y configura tu clave de API de OrcaRouter. No se necesitan cambios en el código si usas el mismo formato de mensaje. Para el soporte de imágenes, asegúrate de que tus prompts incluyan URLs de imágenes o datos en base64. Puede que necesites ajustar max_tokens y otros parámetros para que se adapten a las capacidades del modelo. Prueba primero con una muestra pequeña para verificar la calidad y el costo de la salida.
Necesitas una clave API de OrcaRouter. Inclúyela en el encabezado Authorization como Bearer YOUR_API_KEY. OrcaRouter gestiona la autenticación y la facturación. Por seguridad, no compartas tu clave. OrcaRouter también puede admitir la rotación de claves API. No se requiere autenticación adicional de MoonshotAI. Todas las solicitudes pasan por la infraestructura de OrcaRouter, que maneja la limitación de velocidad y el manejo de errores. Asegúrate de que tus solicitudes cumplan con los términos de servicio de OrcaRouter.
Kimi K3 ofrece una ventana de contexto de 1,048,576 tokens, una de las más grandes disponibles. Es comparable a modelos de otros proveedores que también admiten contextos de millones de tokens. Su precio de $3/$15 por millón de tokens es competitivo. A diferencia de algunos modelos, Kimi K3 admite entradas multimodales (texto e imagen). Un diferenciador clave es que se accede a él a través de OrcaRouter sin recargo. En comparación con modelos como GPT-4 Turbo (contexto de 128K, mayor costo), Kimi K3 puede ser más barato para secuencias muy largas, pero puede tener perfiles de calidad diferentes. No se proporcionan comparaciones de benchmarks.
Elige Kimi K3 cuando la tarea requiera la ventana de contexto larga completa—por ejemplo, analizar un documento de 500 páginas de una sola vez, o incluir muchas imágenes en un solo prompt. Los modelos más baratos con ventanas de contexto más pequeñas (por ejemplo, 128K tokens) pueden obligarte a dividir la entrada en fragmentos, perdiendo referencias cruzadas. Si la tarea puede dividirse sin pérdida de calidad, es preferible un modelo más barato debido al menor costo por token. También considera si las fortalezas específicas del modelo (multimodal, contexto largo) son críticas.
Los hechos proporcionados solo cubren Kimi K3. MoonshotAI tiene modelos anteriores como Kimi y Kimi K2. Kimi K3 es el más reciente, con una ventana de contexto más grande y soporte multimodal. Los modelos anteriores probablemente tengan contextos más pequeños y puede que no acepten imágenes. No se proporcionan precios para otros modelos. Para los usuarios existentes de modelos antiguos de MoonshotAI, actualizar a Kimi K3 ofrece capacidades ampliadas, pero a un costo más alto por token. La decisión depende de si el contexto más grande y las entradas de imagen justifican la prima.
Compatible con OpenAI: conserva tu SDK actual
https://api.orcarouter.ai/v1import os
from openai import OpenAI
client = OpenAI(
base_url="https://api.orcarouter.ai/v1",
api_key=os.environ["ORCAROUTER_API_KEY"],
)
response = client.chat.completions.create(
model="kimi/kimi-k3",
messages=[{"role": "user", "content": "Hello"}],
)
print(response.choices[0].message.content)frequency_penaltyinclude_reasoningmax_tokenspresence_penaltyreasoningreasoning_effortresponse_formatstopstructured_outputstool_choicetools| Entrada / 1M tokens | $3.00 |
| Salida / 1M tokens | $15.00 |
| Lectura caché / 1M | $0.300 |
| Moneda | USD |
Estimación según precio de lista
Solo una estimación: el número real de tokens depende del tokenizador del proveedor.
De qué hablan los desarrolladores esta semana
GET /api/public/models/kimi/kimi-k3Abrir @misc{orcarouter_kimi_k3,
title = {Kimi K3 API},
author = {MoonshotAI},
year = {2026},
howpublished = {OrcaRouter},
url = {https://www.orcarouter.ai/models/kimi/kimi-k3}
}MoonshotAI. (2026). Kimi K3 API. OrcaRouter. https://www.orcarouter.ai/models/kimi/kimi-k3