
Revisión del Modelo Inkling AI: El Primer Modelo de Pesos Abiertos de Thinking Machines, Probado y Explicado
- metaNUEVOMeta: Muse Spark 1.22026-08-0557Inteligencia72Código
- qwenNUEVOQwen: Qwen3.8 Max2026-08-0358Inteligencia72Código
- deepseekNUEVODeepSeek: DeepSeek V4 Flash 07312026-07-3152Inteligencia69Código
- qwenNUEVOQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 por 1M de tokens · 2030 tok/s
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463Inteligencia78Código
- googleGoogle: Gemini 3.6 Flash2026-07-2152Inteligencia69Código
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137Inteligencia49Código
- metaMeta: Muse Spark 1.12026-07-1653Inteligencia71Código
- kimiMoonshotAI: Kimi K32026-07-1560Inteligencia76Código
- openaiOpenAI: GPT-5.6 Luna2026-07-0952Inteligencia71Código
- openaiOpenAI: GPT-5.6 Terra2026-07-0957Inteligencia77Código
- openaiOpenAI: GPT-5.6 Sol2026-07-0961Inteligencia77Código
- grokxAI: Grok 4.52026-07-0856Inteligencia72Código
- tencentTencent: Hy32026-07-0642Inteligencia59Código
- obsidianQwen3.6 35B A3B Uncensored (Aggressive)2026-07-0232Inteligencia42Código
- obsidianGemma4 26B A4B Uncensored (Balanced)2026-07-0226Inteligencia39Código
- anthropicAnthropic: Claude Sonnet 52026-06-3055Inteligencia72Código
- klingKling: Kling 3.0 Turbo2026-06-1757Inteligencia52Código57Matemáticas
- z-aiZ.ai: GLM 5.22026-06-1653Inteligencia69Código60Matemáticas
Esta reseña del modelo Inkling AI analiza detenidamente el lanzamiento debut de Thinking Machines Lab, la startup liderada por la exdirectora de tecnología de OpenAI, Mira Murati. Inkling es un modelo multimodal de mezcla de expertos (MoE) de pesos abiertos, con una ventana de contexto de 1 millón de tokens y un dial controlable de “esfuerzo de pensamiento”. Es rápido, económico de alojar por cuenta propia y está diseñado para la personalización más que para dominar las tablas de clasificación. A continuación, separamos los puntos de referencia autoinformados por el proveedor de las mediciones independientes, repasamos la arquitectura, le mostramos cómo ejecutarlo y explicamos exactamente quién debería (y quién no) adoptarlo.
A fecha de: 2026-07-16 — un día después del lanzamiento. Esta es una reseña basada en investigación; aún no existen pruebas prácticas a largo plazo para ningún modelo tan nuevo, y señalamos cada cifra no verificada a continuación.
Una nota para los constructores: si quieres probar Inkling junto con otros modelos, OrcaRouter ofrece modelos disponibles a través de API con un único endpoint compatible con OpenAI, para que puedas comparar y cambiar sin nuevas integraciones.
- Veredicto TL;DR: Inkling es un modelo abierto genuinamente capaz y eficiente que destaca para el ajuste fino y el despliegue sensible al costo, pero no es un líder de frontera y su creador lo dice abiertamente. Si quieres una base personalizable, libre de regalías y con una enorme ventana de contexto, es uno de los lanzamientos más interesantes de 2026. Si quieres el modelo más potente disponible, busca en otro lado.
- Qué es: Un modelo de razonamiento MoE con pesos abiertos (Apache 2.0). Para quién es: Profesionales que desean ajustar y auto-alojar en lugar de pagar por una API de frontera cerrada.
Conclusiones clave
Fabricante y fecha: Thinking Machines Lab; lanzado el 15 de julio de 2026 como el primer modelo del laboratorio.
Arquitectura: Sparse MoE, 975B total / 41B parámetros activos, 66 capas, contexto de hasta 1M tokens en los pesos (256K mediante APIs alojadas).
Licencia: Apache 2.0 — pesos completos en Hugging Face, gratuito para uso comercial y autoalojamiento.
Posicionamiento honesto: La empresa afirma sin rodeos que “no es el modelo más fuerte disponible hoy en día, ya sea cerrado o abierto”.
Puntuación independiente: 41/100 en el Artificial Analysis Intelligence Index — #10 de 97 modelos, y por delante de varios pares abiertos (ver conciliación a continuación).
Costo: Los pesos son libres de regalías para autoalojar; el acceso alojado comienza alrededor de $1.87 / 1 millón de tokens de entrada.
Advertencia: Casi todos los benchmarks principales son auto-reportados por los proveedores y no auditados de forma independiente.
¿Quién está detrás de Inkling?
- Caja del fundador.Inkling es el primer modelo de Thinking Machines Lab (thinkingmachines.ai), fundado por Mira Murati, anteriormente Directora de Tecnología en OpenAI. El laboratorio operó en relativo sigilo antes de este lanzamiento y ha adoptado una postura de pesos abiertos que contrasta con el enfoque de buque insignia cerrado del antiguo empleador de Murati. Thinking Machines no monetiza el modelo en sí — los ingresos fluyen a través de su Tinker plataforma de ajuste fino y socios de alojamiento de terceros. Ese modelo de negocio es central para entender Inkling: los pesos son una puerta de entrada gratuita, y la empresa gana cuando personalizas o escalas.
¿Qué es Inkling?
Inkling es un modelo de lenguaje y razonamiento grande, de pesos abiertos, multimodal y de mezcla de expertos, anunciado por Thinking Machines Lab el 15 de julio de 2026 y publicado bajo la permisiva Apache 2.0 licencia con pesos completos en Hugging Face.
Lo que hace notable este lanzamiento es el enfoque. En lugar de reclamar una corona de frontera, Thinking Machines describe a Inkling como un modelo abierto versátil, eficiente y personalizable. En una admisión inusualmente sincera para un día de lanzamiento, la empresa afirma que Inkling “no es el modelo más fuerte disponible hoy, cerrado o abierto.” Esa honestidad marca el tono de toda esta reseña: Inkling es una herramienta diseñada para ser adaptada, autoalojada y ajustada, no un trofeo de referencia.
La cobertura de Fortune y TechCrunch se hizo eco de esta lectura. TechCrunch argumentó que Inkling no amenaza a OpenAI, Anthropic o Google en el nivel fronterizo, sino que presiona la capa intermedia de proveedores de hosting de pesos abiertos y plataformas de ajuste fino. Forbes enmarcó la estrategia de pesos abiertos de Murati como más cercana al manual de modelos abiertos chino (DeepSeek, Qwen, Kimi) que a los buques insignia cerrados de EE. UU. — una narrativa de pesos abiertos entre EE. UU. y China que recorre gran parte de los comentarios del lanzamiento.
Arquitectura y especificaciones
Bajo el capó, Inkling es un transformador disperso de mezcla de expertos. Solo una fracción de sus parámetros se activa por token, lo que mantiene la inferencia eficiente a pesar del gran número total de parámetros. Los detalles están documentados en la tarjeta oficial del modelo y en el blog de Hugging Face.
Parámetros totales: 975B
Parámetros activos: 41B (MoE disperso)
Capas: transformador de solo decodificador de 66 capas
Expertos: 256 enrutados + 2 compartidos; 6 de 256 enrutados por token (los 2 compartidos siempre activos)
Enrutamiento: Sigmoid / aux-loss-free
Atención: Híbrido, ventana deslizante 5:1 (local) a global; 8 cabezas KV
Codificación de posición: Aprendidas incrustaciones de posición relativas (no RoPE)
Multimodalidad: Sin codificador — audio como espectrogramas dMel, imágenes como parches de 40×40, alimentadas directamente
Extras: Convoluciones cortas (SConv); capas MTP para decodificación especulativa
Numéricos: BF16, MXFP8, NVFP4 (NVFP4 checkpoint para NVIDIA Blackwell)
Ventana de contexto: Hasta 1,000,000 tokens en los pesos (256K en APIs alojadas)
Variante más pequeña: Inkling-Small, 276B total / 12B activos (preview, pesos aún no publicados)

Algunas decisiones de diseño distinguen a Inkling de una MoE estándar:
Distribución experta. Con 256 expertos enrutados más 2 expertos compartidos, y 6 expertos enrutados que se activan por token, el par compartido actúa como un “sumidero experto” siempre activo que captura el cálculo común mientras los expertos enrutados se especializan. El enrutamiento sigmoide sin pérdida auxiliar evita el término de penalización de equilibrio de carga utilizado por muchos diseños MoE.
Embeddings de posición relativa, no RoPE.La mayoría de los modelos modernos de contexto largo se apoyan en embeddings rotatorios; Inkling, en cambio, utiliza embeddings de posición relativa aprendidos, una elección inusual a esta escala.
Multimodalidad sin codificador. En lugar de acoplar codificadores separados de visión/audio, Inkling ingiere parches de imagen de 40×40 y espectrogramas de audio dMel directamente en la pila del transformer. Esto simplifica el proceso y es parte de por qué el modelo se describe como nativamente multimodal.
MTP para decodificación especulativa. Las capas de predicción multi-token (MTP) actúan como un redactor incorporado, acelerando la generación sin un modelo de borrador separado.
Nota del editor — añadir imagen: Un diagrama de bloques etiquetado de una capa Inkling — atención de ventana deslizante vs atención global (5:1), el enrutador de expertos 256+2 con 6 expertos activos resaltados, SConv y la cabeza redactora MTP.
Entrenamiento y el marcador de “esfuerzo de pensamiento”
Inkling se preentrenó en 45 billones de tokens multimodales que abarcan texto, imágenes, audio y video, usando un optimizador híbrido (Muon para pesos grandes de matriz, Adam para el resto) en sistemas NVIDIA GB300 NVL72. El post-entrenamiento usó aprendizaje por refuerzo asíncrono a gran escala que superó los más de 30 millones de rollouts a lo largo de dos ejecuciones continuas largas, iniciado a partir de un ajuste fino supervisado inicial sobre datos sintéticos.
Una característica distintiva es un parámetro controlable de esfuerzo de razonamiento, demostrado desde aproximadamente 0.2 hasta 0.99, donde valores más altos significan más razonamiento y más costo. Esto permite a los operadores intercambiar latencia y gasto contra profundidad de pensamiento. Todas las cifras de referencia a continuación se ejecutaron con Esfuerzo = 0.99.
Esfuerzo de pensamiento controlable: una guía operativa
En la implementación, el control de esfuerzo se expone como una enumeración reasoning_effort con los niveles ninguno / mínimo / bajo / medio / alto / xalto / máximo. No existe una única configuración 'correcta' — es una palanca en vivo para la compensación entre latencia, costo y calidad. Use la tabla a continuación como un mapa inicial (guía relativa; la calidad de grado de referencia se midió en la parte superior del rango):
ninguno / mínimo. Latencia relativa y costo de token: Mínimo; Mejor para: Clasificación, extracción, formato, enrutamiento, pegamento de recuperación
bajo. Latencia relativa y costo de tokens: Bajo; Mejor para: Preguntas y respuestas cortas, resumen simple, trabajos por lotes de alto volumen
medio. Latencia relativa y costo de tokens: Moderado; Mejor para: Chat general, redacción, la mayoría de las llamadas a herramientas de agentes
alta. Latencia relativa y costo de token: Mayor; Mejor para: Razonamiento de múltiples pasos, generación de código, análisis
xhigh / máx. Latencia relativa y coste de token: Más alto; Mejor para: Matemáticas difíciles, razonamiento tipo competencia, paridad de referencia (Effort=0.99)

¿Puedes ejecutarlo localmente? Hardware y VRAM
Debido a que Inkling es un modelo de 975 mil millones de parámetros, "local" significa realísticamente un servidor con múltiples GPU, no una computadora portátil. Requisitos aproximados (según la cobertura del lanzamiento y las herramientas comunitarias):
BF16 (completo). VRAM agregada aprox.: ~2 TB; Ejemplos de configuraciones: 8× NVIDIA B300, o 16× H200
NVFP4 (cuantizado). VRAM agregada aprox.: ~600 GB; Ejemplos de configuraciones: 4× NVIDIA B300, u 8× H200
GGUF (comunidad). VRAM agregada aprox.: Varía según la cuantización; Ejemplos de configuraciones: Existen compilaciones GGUF de Unsloth para huellas más pequeñas/cuantizadas
El checkpoint NVFP4 — enviado específicamente para NVIDIA Blackwell — reduce el costo de memoria en aproximadamente dos tercios en comparación con BF16, que es la diferencia entre un nodo B300 de 8 GPU y uno de 4 GPU. Para la mayoría de los equipos, esto sigue apuntando hacia un proveedor alojado o un nodo de GPU alquilado en lugar de hardware propio. Las cuantificaciones GGUF de Unsloth amplían el alcance hacia niveles inferiores de hardware para experimentación, a costa de cierta calidad.
Inicio rápido de implementación
Inkling expone una API compatible con OpenAI, por lo que la mayoría del código de cliente existente funciona como un drop-in con una URL base y un nombre de modelo cambiados. Las tres rutas de servicio comunes:
vLLM — servidor de un solo comando (por defecto puerto 8000):
vllm sirve thinkingmachines/Inkling --puerto 8000
# luego llama al endpoint compatible con OpenAI en http://localhost:8000/v1
SGLang — distribuir en 8 GPUs (por defecto puerto 30000):
python -m sglang.launch_server \
--model-path thinkingmachines/Inkling \
--tp 8 --port 30000
Hugging Face transformers — carga a través de la clase auto multimodal:
from transformers import AutoModelForMultimodalLM, AutoProcessor
model = AutoModelForMultimodalLM.from_pretrained("thinkingmachines/Inkling")
processor = AutoProcessor.from_pretrained("thinkingmachines/Inkling")
# pasa reasoning_effort en {none, minimal, low, medium, high, xhigh, max}
Debido a que el endpoint es compatible con OpenAI, migrar una aplicación existente suele ser cuestión de configurar tu SDK para que apunte a la nueva URL base y ajustar reasoning_effort al gusto. Los tiempos de ejecución adicionales en el lanzamiento incluyen TokenSpeed y Unsloth.
Dónde ejecutarlo: disponibilidad del proveedor de inferencia
Si prefiere no administrar las GPU, varios socios alojan Inkling. Opciones "Run Inkling on X" en el lanzamiento:
Tinker (Thinking Machines). Rol: Ajuste fino; Notas: Opciones de contexto de 64K y 256K; 50% de descuento de lanzamiento por tiempo limitado (de pago)
Together AI. Rol: Inferencia alojada; Notas: Puntos finales compatibles con OpenAI
Fireworks. Rol: Inferencia alojada; Notas: —
Modal. Rol: Inferencia alojada / GPU sin servidor; Notas: —
Databricks. Rol: Inferencia alojada; Notas: a través de Unity AI Gateway
Baseten. Rol: Inferencia alojada; Notas: —
Puntos de referencia: afirmaciones del proveedor frente a mediciones independientes
Esta es la sección más importante de cualquier honesta Inkling review 2026, porque los números provienen de dos lugares muy diferentes.
Divulgación: Con la única excepción del Artificial Analysis Index, cada punto de referencia de Inkling que aparece a continuación es auto reportado por el proveedor en el lanzamiento (Effort = 0.99, temperature 1.0) y ha no ha sido auditado de forma independiente. Las cifras de la competencia provienen de terceros (MarkTechPost, Artificial Analysis) o fueron re-ejecutadas por Thinking Machines, y de igual manera no auditado de forma independiente aquí. Algunas cifras tienen calificadores de harness o subconjunto. Considérelas todas como direccionales, no como verdades absolutas.
Puntajes auto-reportados del proveedor
Según los propios materiales de lanzamiento de Thinking Machines:
AIME 2026 (matemáticas): 97.1%
GPQA Diamond (razonamiento científico): 87.2%
SWE-bench Verified (programación, entorno solo bash): 77.6%
SWE-bench Pro (Public): 54.3%
MMMU Pro (multimodal): 73.3%
VoiceBench (audio): 91.4%
MMAU (audio): 77.2%
IFBench (seguimiento de instrucciones): 79.8%
Terminal Bench 2.1 (terminal agente): 63.8
FORTRESS Adversarial: 78.0%
SimpleQA Verificado: 43.9%
Sobre el papel, estos parecen sólidos, especialmente las cifras de razonamiento matemático y científico. Pero la compañía comparó Inkling con versiones competidoras de futuro cercano (GPT 5.6 Sol, Claude Fable 5, Gemini 3.1 Pro, DeepSeek V4 Pro, Kimi K2.5/K2.6, GLM 5.2, Nemotron 3 Ultra) usando puntuaciones que generó por sí misma. Esas cifras de competidores pueden no coincidir con las cifras reportadas por los propios rivales, por lo que las comparaciones directas deben leerse con precaución.
Multimodelo cara a cara (rivales de pesos abiertos)
La comparativa más clara de Inkling frente a otros modelos de peso abierto proviene de la tabla comparativa de MarkTechPost (reproducida a continuación, atribuida a MarkTechPost). Es útil precisamente porque sitúa a los rivales en un mismo marco:
HLE. Inkling: 29.7%; Nemotron 3 Ultra: 26.6%; Kimi K2.6: 35.9%; GLM 5.2: 40.1%; DeepSeek V4 Pro: 35.9%
AIME 2026. Inkling: 97.1%; Nemotron 3 Ultra: 94.2%; Kimi K2.6: 96.4%; GLM 5.2: 99.2%; DeepSeek V4 Pro: 96.7%
SWE-bench Verified. Inkling: 77.6%; Nemotron 3 Ultra: 70.7%; Kimi K2.6: 80.2%; GLM 5.2: 80.0%; DeepSeek V4 Pro: 80.6%
Terminal Bench 2.1. Inkling: 63.8%; Nemotron 3 Ultra: 56.4%; Kimi K2.6: 71.3%; GLM 5.2: 82.7%; DeepSeek V4 Pro: 64%
FORTRESS (adversarial). Inkling: 78.0%; Nemotron 3 Ultra: 77.6%; Kimi K2.6: 65.6%; GLM 5.2: 71.3%; DeepSeek V4 Pro: 36.0%
Fuente: MarkTechPost. No auditado independientemente.
El patrón es claro y consistente con la propia modestia de Thinking Machines. Inkling lidera en FORTRESS (seguridad adversarial) y supera a Nemotron 3 Ultra en todos los aspectos, pero va por detrás de GLM 5.2, Kimi K2.6 y DeepSeek V4 Pro en HLE, SWE-bench Verified, y especialmente Terminal Bench 2.1 (63.8% frente al 82.7% de GLM 5.2). Si la codificación agente y las tareas de terminal son tu prioridad, los principales modelos abiertos chinos están adelante hoy.
Medición independiente (Artificial Analysis)
Para una lectura más neutral, Artificial Analysis evaluó a Inkling el 2026-07-15 y lo ubicó en 41/100 en su Intelligence Index, clasificado #10 de 97 modelos. Dos puntos sobre cómo leer esa clasificación de manera justa:
Es una demostración fuerte de modelo abierto, no un #1 general. Según Artificial Analysis, el índice de Inkling de 41 se sitúa por delante de Nemotron 3 Ultra (38), Gemma 4 31B (29) y gpt-oss-120b (24) — por lo que entre pares de pesos abiertos es de competitivo a líder. Pero #10 de 97 significa que nueve modelos tienen una clasificación más alta en general, consistente con el marco de “capaz, no de frontera”.
La eficiencia es donde destaca. Artificial Analysis señala una fuerte eficiencia de tokens — aproximadamente 25K tokens para completar su conjunto de evaluación frente a 37–43K para modelos de comparación — y un Elo GDPval-AA v2 de 1238, por delante de Kimi (1190) y DeepSeek V4 Flash (1189), más una pequeña ventaja (+2) en AA-Omniscience.
Velocidad de salida medida de 72.7 tokens/s con un tiempo hasta el primer token de 1.75s. En resumen: un respetable puesto entre los diez primeros, y uno genuinamente eficiente — pero evitamos deliberadamente exagerarlo como una victoria en el ranking.

Capacidades multimodales y de contexto largo
Inkling acepta texto (UTF-8), imágenes (de 40px a 4096px mediante un codificador jerárquico de parches) y audio (WAV de 16kHz, hasta aproximadamente 20 minutos, utilizando codificación de tokens discretos). La salida es solo texto — no hay generación de imágenes ni audio, por lo que planifique para un modelo de comprensión, no de generación. Se utilizó video durante el preentrenamiento, pero es no una entrada compatible o evaluada en el lanzamiento, así que no planifique en torno a ella todavía.
La capacidad principal es la ventana de contexto de 1 millón de tokens en los pesos publicados, lo que abre la puerta al análisis de código de todo el repositorio, la síntesis de documentos largos y las sesiones de agente multiturno extendidas sin fragmentación agresiva. Tenga en cuenta el matiz práctico: las API alojadas exponen hasta 256 mil tokens, por lo que el 1M completo es una característica autohospedada hoy en día. Combinado con el diseño de atención de ventana deslizante y la decodificación especulativa, la historia del contexto largo sigue siendo uno de los puntos de venta más prácticos de Inkling.
Precios, niveles y costo total de propiedad
Inkling es genuinamente abierto. Los pesos completos (un checkpoint BF16 más un checkpoint NVFP4) están en Hugging Face bajo Apache 2.0, por lo que el autoalojamiento está libre de regalías — solo pagas por el cómputo. Thinking Machines no monetiza el modelo en sí; los ingresos fluyen a través de Tinker y hosts de terceros.
Precio por token alojado (por Artificial Analysis), por nivel de contexto:
64K. Entrada / 1M: $1.87; Entrada en caché / 1M: $0.374; Salida / 1M: $4.68
256K. Entrada / 1M: $3.74; Entrada en caché / 1M: $0.748; Salida / 1M: $9.36
Refleja un descuento de lanzamiento limitado del 50%; las cifras exactas de Tinker por token están en la documentación y cambiarán.
Self-host vs API — cómo pensar en el TCO. La economía depende del volumen y la utilización:
API (Tinker / socios): cero costo fijo, pago por token, inicio casi instantáneo. Mejor para volúmenes bajos o irregulares, o mientras se prototipa.
Auto-alojamiento (GPUs alquiladas o propias): pagas por un nodo de 4–8 GPUs esté ocupado o no, pero el costo marginal por token se aproxima al de la electricidad bruta. Dado que Inkling activa solo 41 mil millones de parámetros y es eficiente en tokens (~25K frente a 37–43K según el conjunto de Artificial Analysis), el rendimiento por hora de GPU es favorable, y las cargas de trabajo intensas y constantes pueden resultar considerablemente más baratas que el precio por token de las API una vez que el nodo está bien utilizado. Los comentarios en torno al lanzamiento indicaron que el auto-alojamiento de pesos abiertos es aproximadamente un 40–60% más barato que el uso comparable de API cerrada a escala — una afirmación orientativa, no una cifra auditada.
Nota del editor — agregar visual:Un gráfico de punto de equilibrio: volumen mensual de tokens (x) vs costo total (y) con tres líneas: closed frontier API, Inkling hosted API e Inkling self-hosted en un nodo GPU alquilado — que muestra el punto de cruce donde self-hosting gana.
Seguridad, alineación y censura
La seguridad es una de las historias más sólidas y diferenciadas de Inkling. En el FORTRESS adversarial prueba de referencia obtiene una puntuación de 78.0% — el mejor entre los modelos de peso abierto en la comparación de MarkTechPost, por delante de GLM 5.2 (71.3%), Kimi K2.6 (65.6%) y muy por delante de DeepSeek V4 Pro (36.0%). Thinking Machines también enfatiza la incertidumbre calibrada en las salidas del modelo.
La cobertura de VentureBeat destacó una propiedad relacionada: resistencia a la censura. Combinado con una licencia Apache 2.0 permisiva, esto posiciona a Inkling como un modelo abierto que los equipos pueden alinear con sus propias políticas en lugar de heredar un régimen de contenido opaco impuesto por el proveedor — una consideración significativa para implementaciones reguladas o específicas de una región. Como siempre con un modelo de lanzamiento, ninguna auditoría de seguridad independiente de red-team o de terceros había surgido al momento de escribir esto, por lo que trate el avance de FORTRESS como proveniente del proveedor/terceros en lugar de certificado externamente.
¿Deberías afinar Inkling?
El ajuste fino es posiblemente la razón de ser de Inkling. Un marco de decisión rápido:
Ajuste fino (mediante Tinker o tu propio pipeline) si: tienes datos propietarios, un dominio estrecho o una tarea donde un modelo especializado más pequeño supera a uno generalista; necesitas poseer los pesos; o deseas incorporar un tono, formato o política específicos. Las opciones de contexto de 64K/256K de Tinker y el descuento de lanzamiento reducen la barrera.
Usa solo el modelo base (autogestionado o API) si: tu tarea es de propósito general, tu volumen es bajo, o aún no has validado que el ajuste fino mejore tu métrica. La ingeniería de prompts junto con el dial de reasoning_effort a menudo es suficiente.
Mire en otro lado si: necesita codificación agentiva de vanguardia hoy (GLM 5.2 y Kimi K2.6 lideran en esos benchmarks) o requiere garantías de calidad auditadas independientemente.
Pros y contras
Ventajas
Pesos completamente abiertos bajo Apache 2.0, libres de regalías para autoalojar y gratuitos para uso comercial.
MoE disperso eficiente (solo 41B activos) más una fuerte eficiencia de tokens mantiene el costo y la velocidad de inferencia competitivos.
Masivo contexto de 1M tokens en los pesos (256K vía API).
Multimodalidad genuina (texto, imagen, audio entrada).
Dial de esfuerzo de razonamiento controlable (ninguno → máximo) para compensaciones en vivo de costo/calidad.
Seguridad adversarial de peso abierto de primer nivel (FORTRESS 78.0%, según MarkTechPost) y “resistencia a la censura.”
Firme posición independiente — top 10 de 97 en el Artificial Analysis Index, por delante de Nemotron 3 Ultra, Gemma 4 31B y gpt-oss-120b.
Contras
Explícitamente no es un modelo de frontera, según la propia admisión del fabricante.
Trails lidera sobre rivales abiertos (GLM 5.2, Kimi K2.6, DeepSeek V4 Pro) en benchmarks agentivos y de programación (Terminal Bench 2.1, SWE-bench Verified, HLE).
La mayoría de los benchmarks son auto-reportados por el vendedor y no auditados de forma independiente.
Salida solo de texto; sin generación de imágenes/audio; sin entrada de video en el lanzamiento; Inkling-Small aún en vista previa.
El uso realmente "local" necesita un nodo multi-GPU (~600 GB de VRAM incluso cuantizado).
No había surgido ninguna revisión independiente sustantiva, crítica o de seguridad/red-team en el lanzamiento.
¿Quién debería usar Inkling?
Inkling es una opción excelente si eres un profesional o equipo que quiere poseer y personalizar su modelo en lugar de alquilar una API cerrada. Los casos de uso ideales incluyen:
Equipos de ajuste fino que construyen modelos específicos del dominio mediante Tinker o su propio pipeline.
Implementaciones de alto volumen y sensibles al costo donde el autoalojamiento sin regalías supera el precio fronterizo por token.
Cargas de trabajo de contexto largo como asistencia de código a nivel de repositorio, análisis de documentos y sesiones de agente largas.
Aplicaciones multimodales que necesitan comprensión combinada de texto, imagen y audio.
Implementaciones sensibles a políticasque quieren una base abierta de fuerte seguridad y resistente a la censura para alinearse.
Es una mala elección si necesitas el razonamiento más sólido o el rendimiento de codificación agéntica, necesitas entrada de video o salida generativa, o requieres puntos de referencia auditados de forma independiente antes de la implementación.
Veredicto y calificación final
Hablemos directamente del elefante en la habitación: Inkling no es el modelo más potente disponible hoy en día, y Thinking Machines dice exactamente eso. Leído de forma cínica, eso es un estándar bajo. Leído de forma justa, es el punto central — Inkling está optimizado para un objetivo diferente al de encabezar una tabla de clasificación. Es eficiente (41B activos, presupuestos de tareas de ~25K tokens), con licencia abierta (Apache 2.0), seguro según los estándares de pesos abiertos (FORTRESS 78%), y diseñado para ser ajustado y alojado por uno mismo. Esa combinación lo convierte en uno de los lanzamientos de modelos abiertos más reflexivos de 2026, incluso si va por detrás de GLM 5.2 y Kimi K2.6 en los benchmarks más difíciles de agentes y codificación.
Los asteriscos restantes son los puntos de referencia en gran parte autoinformados y la ausencia de cualquier revisión crítica independiente tan temprano. Pero para su público objetivo —constructores que valoran la propiedad, la personalización, el control de costos y una ventana de contexto enorme por encima de los derechos de fanfarronería de frontera— Inkling cumple.
Calificación: 4 de 5 para su público objetivo de desarrolladores y afinadores; más baja si se busca estrictamente capacidad de vanguardia.
Preguntas frecuentes
¿Qué es Inkling y quién lo creó?Inkling es el primer modelo de Thinking Machines Lab, la startup de IA liderada por Mira Murati (ex-CTO de OpenAI). Se lanzó el 15 de julio de 2026 como un modelo de razonamiento multimodal de mezcla de expertos con pesos abiertos.
¿Es Inkling el mejor modelo de IA? No, y la empresa no afirma que lo sea — indica que Inkling "no es el modelo más fuerte disponible hoy en día, cerrado o abierto". Mediciones independientes (Artificial Analysis) lo ubican en el puesto #10 de 97 en general, aunque lidera a varios pares abiertos.
¿Cuántos parámetros tiene Inkling y cuál es la ventana de contexto? 975B en total con 41B activos (MoE disperso), en 66 capas. La ventana de contexto es de hasta 1,000,000 de tokens en los pesos publicados, y hasta 256K en las APIs alojadas.
¿Inkling es de código abierto, y cuál es la licencia? Los pesos se publican bajo Apache 2.0, lo que permite uso comercial y autoalojamiento. Son 'pesos abiertos' — los pesos completos del modelo están en Hugging Face.
¿Es Inkling gratis de usar?Los pesos son gratuitos y libres de regalías para autoalojar. El ajuste fino en Tinker y la inferencia alojada a través de proveedores como Together AI, Fireworks, Modal, Databricks o Baseten son servicios de pago. El acceso alojado comienza alrededor de $1.87 / 1M de tokens de entrada (un descuento de lanzamiento por tiempo limitado).
¿Cómo ejecuto o descargo Inkling, y qué hardware necesito? Descarga los pesos desde Hugging Face y sírvelos con vLLM, SGLang o Hugging Face transformers a través de una API compatible con OpenAI. Espera aproximadamente ~2 TB de VRAM agregada para BF16 (8× B300 / 16× H200) o ~600 GB para el checkpoint cuantizado NVFP4 (4× B300 / 8× H200). Las compilaciones GGUF de Community Unsloth reducen la barrera para la experimentación.
¿Cómo ajusto Inkling? Usa Thinking Machines’ Tinker plataforma, que ofrece opciones de contexto de 64K y 256K y un descuento de lanzamiento del 50% por tiempo limitado, o ajusta los pesos abiertos en tu propio pipeline.
¿Qué es el esfuerzo de pensamiento controlable? Una configuración de reasoning_effort (ninguno / mínimo / bajo / medio / alto / extra alto / máximo) que intercambia latencia y costo de tokens por profundidad de razonamiento. El esfuerzo bajo es adecuado para clasificación y extracción; el esfuerzo máximo es adecuado para matemáticas difíciles y coincide con la configuración de referencia (Effort=0.99).
¿Cómo se compara Inkling con Kimi, GLM, DeepSeek y Nemotron? Según la comparación de MarkTechPost, Inkling lidera en FORTRESS (seguridad) y supera ampliamente a Nemotron 3 Ultra, pero va por detrás de GLM 5.2, Kimi K2.6 y DeepSeek V4 Pro en Terminal Bench 2.1, SWE-bench Verified y HLE. Es competitivo, pero no el modelo abierto más fuerte en codificación agente.
¿Puede Inkling procesar imágenes, audio y video? Acepta texto, imágenes (40px–4096px) y audio (WAV de 16kHz, hasta ~20 minutos) como entrada. La salida es solo texto — sin generación de imágenes o audio. El video se usó en el preentrenamiento pero no es una entrada admitida en el lanzamiento.
¿Son confiables las puntuaciones de referencia de Inkling?Trátelas con cautela. Aparte del índice independiente Artificial Analysis Intelligence Index, las cifras principales son auto-reportadas por el proveedor en el lanzamiento y no están auditadas de forma independiente. Las cifras de los competidores provienen de terceros (MarkTechPost) o fueron reejecutadas por Thinking Machines y pueden no coincidir con los números reportados por los propios rivales.
¿Qué es Inkling-Small y qué hay en la hoja de ruta? Inkling-Small es una variante más pequeña (276B total / 12B activos). En el momento del lanzamiento, todavía estaba en vista previa, con los pesos aún no publicados. El modelo principal ya incluye capas MTP para decodificación especulativa.
Comparados en este artículo2
Detectado en este artículo · Benchmarks: Artificial Analysis · actualizado a diario
