Inkling-Small-1
Guides & Insights

Inkling-Small: el modelo de un cuarto de tamaño que supera a su propio buque insignia, y aun así sigue por detrás del índice.

Autor

Jim Song

Fecha de publicación

Últimos modelos · 20Ver todos los modelos
Benchmarks: Artificial Analysis · actualizado a diario
Volver a todas las publicaciones

Thinking Machines Lab spent the two weeks after shipping its first open-weights model building one about a quarter the size, and on the lab's own scorecard the smaller one wins. Inkling-Small reports 80.2% on SWE-bench Verified against Inkling's 77.6%, 89.5% on GPQA Diamond against 87.2%, 64.7% on Terminal-Bench 2.1 against 63.8%, and 31.6% on Humanity's Last Exam against 29.7% — from 276B total parameters with 12B active, rather than 975B with 41B. Of the headline numbers the two model cards share, the 975B flagship holds exactly one: AIME 2026, by 1.6 points.

Luego Artificial Analysis ejecutó ambos de forma independiente y situó a Inkling-Small en 40 en su Índice de Inteligencia frente al 41 de Inkling: el modelo más pequeño, un punto por detrás. Ambos resultados son reales, y el espacio entre ellos es lo más útil de este lanzamiento. Todo lo que sigue separa lo que Thinking Machines informa sobre su propio modelo de lo que midió otra persona: las cifras del proveedor provienen del anuncio y de las dos fichas de modelo de Hugging Face, las cifras independientes provienen de las propias ejecuciones de Artificial Analysis, y los números de precios y contexto provienen de los datos de endpoint en vivo de OpenRouter, verificados el día en que se escribió esto. Cuando esos tres no coinciden — y en la longitud de contexto sí difieren — lo decimos en lugar de elegir el más halagüeño.

Lo que realmente se lanzó el 30 de julio

Inkling-Small es un transformador disperso de mezcla de expertos: 276B parámetros en total, 12B activos por token, 42 capas, con cada token enrutado a 6 de 256 expertos más 2 expertos compartidos que se activan en todo. La atención alterna capas locales y globales. Los pesos están en Hugging Face bajo Apache 2.0 sin restricciones comerciales, se ajusta finamente en la API Tinker de Thinking Machines, y puedes hablar con él en texto, imagen y audio en el Tinker Playground. El laboratorio dice que fue entrenado en sistemas NVIDIA GB300 NVL72.

Inkling-Small-2

La multimodalidad es nativa, no un añadido, y la tarjeta es inusualmente específica sobre cómo. No hay un codificador separado de visión o audio: el audio llega como espectrogramas dMel, las imágenes como parches de 40×40 píxeles pasados a través de un hMLP de cuatro capas, y ambos se incrustan directamente en el mismo flujo de tokens que el texto. La entrada es texto, imágenes y audio; la salida es solo texto, lo cual vale la pena decir claramente porque "multimodal" se interpreta como "puede hablar" con la suficiente frecuencia como para arruinar una tarde. El esfuerzo de razonamiento es un dial con cinco ajustes — mínimo, bajo, medio, alto, xhigh —, de modo que los mismos pesos pueden ejecutarse de forma barata o intensa.

La parte interesante de la receta es el post-entrenamiento. Inkling-Small fue destilado on-policy con el Inkling completo como su maestro, y luego se le dieron aproximadamente dos semanas más de aprendizaje por refuerzo ampliado en codificación agéntica. Ese orden explica la forma de los resultados: el estudiante heredó la competencia general de su maestro, y luego recibió entrenamiento adicional precisamente en el eje donde ahora supera al maestro.

El marcador publicado por Thinking Machines

Los benchmarks de los proveedores son marketing hasta que alguien los reproduce, así que lea esta sección como lo que afirma el laboratorio, no como lo que se ha verificado. Sigue siendo un conjunto amplio, y es amplio en una dirección poco halagüeña para el buque insignia.

Inkling-Small-3

Más allá de los cuatro números compartidos, la tarjeta completa el resto del panorama — todas las ejecuciones propias de Thinking Machines:

Trabajo agéntico — 1269 Elo en GDPval-AA v2, un benchmark de tareas económicas realistas en lugar de acertijos.

Gráficos y documentos — 77.4% en CharXiv RQ, aumentando a 81.3% cuando se permite al modelo escribir y ejecutar Python. Ese salto de 3.9 puntos es una pista útil de que el acceso a herramientas aporta más en tareas de razonamiento visual que la ingeniería de prompts.

Vision — 74.0% en MMMU Pro, un pelo por encima del 73.5% de Inkling.

Audio — 90.1% VoiceBench y 77.0% MMAU, ambos ligeramente por debajo de los 91.4% y 77.2% del buque insignia. Audio es uno de los dos lugares donde encoger claramente costó algo.

Seguridad — 98.4% en StrongREJECT y 96.9% en prompts benignos de FORTRESS, pero 71.6% en FORTRESS adversarial frente al 78.0% del modelo insignia. Ese es el otro costo: una regresión de 6.4 puntos en robustez adversarial, que importa más que cualquier ganancia en codificación si el modelo va a estar detrás de una caja de texto pública.

Pronóstico — índice de Brier de 61.3 ± 0.46 en ForecastBench sin acceso a búsqueda, y puntuación de Brier de 0.1238 ± 0.0086 en Prophet Arena. El mero hecho de reportar barras de error es más disciplina de la que la mayoría de las publicaciones de lanzamiento logran.

Una brecha: la ficha del buque insignia indica un 54,3% en SWE-bench Pro, el hermano más difícil de SWE-bench Verified. La ficha de Inkling-Small no reporta SWE-bench Pro. Dado lo mucho que se destaca el número de Verified, su ausencia es el número que más nos gustaría ver rellenado.

Lo que dice en cambio el índice independiente

{{1}}Artificial Analysis sitúa a Inkling-Small en 40 en la versión 4.1 de su Índice de Inteligencia, un punto por debajo de Inkling, que tiene 41.{{/1}} {{2}}El índice es un compuesto de nueve evaluaciones —GDPval-AA v2, τ³-Banking, Terminal-Bench v2.1, SciCode, Humanity's Last Exam, GPQA Diamond, CritPt, AA-Omniscience y AA-LCR— y esa lista explica la mayor parte de la aparente contradicción.{{/2}} {{3}}Solo dos de las nueve coinciden con la demostración de razonamiento en la tarjeta de Thinking Machines.{{/3}} {{4}}El resto está ponderado hacia el uso de herramientas agénticas, la recuperación de contexto largo y la resistencia a las alucinaciones, y un modelo puede ganar los benchmarks que un laboratorio elige publicar mientras pierde los que un tercero elige ejecutar.{{/4}} {{5}}Ninguna de las partes miente; están midiendo cosas diferentes.{{/5}}

Inkling-Small-4

También hay un detalle en la letra pequeña que vale más que el titular de un punto: Artificial Analysis enumera la entrada del modelo insignia como Inkling (xhigh) — su ajuste de máximo esfuerzo de razonamiento — mientras que la fila de Inkling-Small no lleva sufijo de esfuerzo. Así que la ventaja de un punto del modelo insignia se registró con el dial de razonamiento al máximo. Si la igualación de esfuerzo alterara esa comparación aunque fuera levemente, el último argumento a favor del modelo más grande basado únicamente en capacidad desaparecería con ella.

Donde los datos independientes no se acercan en absoluto es en velocidad y coste, y aquí favorece al modelo pequeño por márgenes que ninguna tabla comparativa transmite:

Velocidad de salida — 133 tokens por segundo frente a 80 para Inkling (xhigh). Artificial Analysis clasifica a Inkling-Small en el puesto #7 de 101 modelos de su clase en velocidad, frente a una mediana de clase de 66.

Tiempo hasta el primer token — 1,63s frente a 1,84s. Una ventaja real pero menor.

Precio combinado por 1M de tokens — $0.22 frente a $0.72 en su ponderación. Aproximadamente un tercio del costo, por un punto de índice menos.

Rango de inteligencia — #15 de 101, frente a una puntuación mediana de la clase de 25. Cómodamente por encima de la media, ni cerca de la frontera.

Verbosidad — y aquí está el truco. Quemó 130 millones de tokens de salida para atravesar el índice, frente a una mediana de 100 millones. El resumen de Artificial Analysis lo califica como "notablemente rápido, aunque algo verboso". Piensa alrededor de un 30% más de lo típico, lo que silenciosamente consume parte del descuento por token.

Una pequeña nota contable, ya que cualquiera que compare fuentes se topará con ella: Artificial Analysis indica el recuento de parámetros como 266B en total, mientras que el anuncio, ambas fichas del modelo y OpenRouter dicen 276B. Hemos usado 276B en todo. No cambia ninguna conclusión, pero es el tipo de discrepancia que conviene conocer antes de citar una cifra en un documento de diseño.

Lo que realmente puedes alquilar hoy, que no es lo que dice la ficha técnica.

La brecha entre un anuncio de pesos abiertos y un endpoint utilizable es donde la mayor parte de la cobertura de lanzamiento deja de prestar atención. Thinking Machines anuncia una ventana de contexto de hasta 1M tokens, y Artificial Analysis también lista 1M. En OpenRouter, ambos proveedores que actualmente sirven Inkling-Small la limitan a 524.288 tokens — la mitad de la cifra anunciada. Eso no es tanto una contradicción como una diferencia entre lo que soporta la arquitectura y lo que alguien ha puesto en producción. En contraste, el modelo insignia Inkling sí tiene un endpoint en los 1.048.576 tokens completos, aunque ese mismo endpoint limita las finalizaciones a 32.768 tokens.

El resto de la imagen en vivo, leído de los datos del endpoint de OpenRouter:

Dos proveedores, dos precios — $0.45 por 1M de entrada y $1.20 por 1M de salida de uno, $0.50 y $1.20 del otro. Artificial Analysis lista la tarifa de primera parte de Thinking Machines aún más baja, en $0.30 y $1.20, con entrada en caché a $0.06. El alojamiento de terceros está cobrando una prima del 50–67% sobre la entrada por los mismos pesos.

Caché de prompts — $0.10 por 1M de tokens de entrada almacenados en caché a través de OpenRouter, frente a $0.17 del modelo insignia.

Los números que alquilas no son los números que se evaluaron — la ficha del modelo indica BF16 y NVFP4. El endpoint más barato sirve fp8; el otro no declara cuantización alguna. Las puntuaciones de referencia del proveedor no se midieron en una versión fp8 de estos pesos, y los efectos de la cuantización en ejecuciones agénticas largas son exactamente el tipo de cosa que un margen de 0,9 puntos en Terminal-Bench no puede resistir. Si vas a reproducir un número, indica qué endpoint utilizaste.

La cobertura de funciones es desigual según el proveedor — ambos endpoints exponen razonamiento y reasoning_effort, por lo que el dial de pensamiento de cinco ajustes funciona. Pero solo uno anuncia tool calling y logprobs, y ninguno de los dos anuncia actualmente response_format, el parámetro de salida estructurada/modo JSON. El Inkling insignia tiene un endpoint que sí lo ofrece. Si tu pipeline depende de JSON con esquema obligatorio, este es el detalle que te morderá el primer día, y es una limitación del proveedor, no del modelo.

Techo de finalización — 262.144 tokens en el endpoint fp8; el otro declara no tener límite.

El caso del costo, según los recuentos de tokens medidos

Los precios por millón son una mala forma de comparar modelos de razonamiento, porque toda la variable es cuántos tokens consumen al pensar. Artificial Analysis publica el gasto real, que es una herramienta mucho mejor: ejecutar Inkling-Small en el Intelligence Index completo consumió aproximadamente 130M tokens de salida y costó $192.37, lo que equivale a aproximadamente $0.07 por tarea en su promedio ponderado.

Compárese eso con la misma medición para los modelos que la gente realmente despliega: DeepSeek V4 Flash a $0.03 por tarea, gpt-oss-120b a $0.08, Gemini 3.6 Flash a $0.56, GLM-5.2 a $0.57, Kimi K3 a $0.86, GPT-5.6 Sol a $1.23, Claude Opus 5 a $2.34, Claude Fable 5 a $3.15. Inkling-Small es el segundo modelo más barato de ese grupo y unas 18 veces más barato por tarea que GPT-5.6 Sol, que obtiene 59 frente a 40.

También hay una forma más clara de ver por qué el precio cayó donde cayó. Los parámetros activos bajaron de 41B a 12B, un factor de 3.4. El precio de salida bajó de $4.05 a $1.20 por millón, un factor de 3.375. El precio de alquiler de un MoE disperso es esencialmente su cómputo por token, y Thinking Machines cobró en consecuencia en lugar de fijar el precio según el benchmark.

Una nota práctica sobre hacer esa comparación por tu cuenta: Inkling-Small no está hoy en el catálogo de OrcaRouter, así que lo alquilarías desde sus propios endpoints. Los modelos cerrados contra los que lo medirías — GPT-5.6 Sol, Claude Opus 5, Gemini 3.6 Flash y el resto de esa lista — están en OrcaRouter detrás de una sola clave con un margen del 0%, lo que significa que pagas el precio de lista de cada proveedor sin nada añadido por encima. Eso importa específicamente para un modelo de costes: el número que pones en la hoja de cálculo es el número que se factura, y cuando un proveedor baja los precios, eso se refleja en nuestro lado el mismo día en lugar de después de una renegociación. El failover automático entre proveedores cubre la otra mitad de una evaluación, es decir, el brazo de referencia que se cae a mitad de ejecución y envenena silenciosamente tus números.

Dónde se sitúa realmente entre los modelos de peso abierto

Leído frente al buque insignia, Inkling-Small parece un triunfo. Leído frente al resto del campo, parece un sólido modelo de pesos abiertos de media tabla, y la cobertura del lanzamiento ha omitido en su mayoría la segunda lectura.

En el Artificial Analysis Intelligence Index, los modelos que superan a ambos Inklings incluyen Claude Opus 5 con 61, Claude Fable 5 con 60, GPT-5.6 Sol con 59, Kimi K3 con 57, Grok 4.5 con 54, GLM-5.2 y Muse Spark 1.1 con 51, y Gemini 3.6 Flash con 50. Eso es lo esperado — son sistemas de frontera, la mayoría de ellos cerrados, varios de ellos enormes.

El que realmente debería cambiar una decisión es DeepSeek V4 Flash, que obtiene 50 frente a los 40 de Inkling-Small, con 284B en total y 13B activos — prácticamente la misma clase de tamaño y la misma ganga de pesos abiertos, a menos de la mitad del costo por tarea. Si lo que quieres es el modelo de pesos abiertos más barato y capaz, los números independientes apuntan allí, no aquí. Además, a diferencia de Inkling-Small, está disponible a través de OrcaRouter, por lo que probar esa alternativa con tu propia carga de trabajo es un cambio de cadena de modelo, no un ejercicio de contratación.

Lo que Inkling-Small tiene y DeepSeek V4 Flash no es la entrada nativa de audio e imagen en los mismos pesos, un dial de pensamiento de cinco niveles y el ajuste fino Tinker del laboratorio que lo entrenó. Esos son diferenciadores reales para un agente multimodal, y son la razón honesta para elegirlo — no la puntuación del índice.

¿Quién debería mudarse y quién debería quedarse?

La decisión se divide claramente, lo cual es lo bastante inusual como para que valga la pena señalarlo.

Cambia de Inkling a Inkling-Small si ejecutas agentes de codificación. Las cifras del proveedor favorecen al modelo pequeño en SWE-bench Verified y Terminal-Bench, la RL agéntica adicional es la razón documentada, y cuesta aproximadamente un tercio y devuelve tokens 1,66× más rápido. Pagar 3,3× por un punto de índice medido al máximo esfuerzo de razonamiento es un argumento difícil de sostener.

Muévete si el costo por tarea de razonamiento es la restricción vinculante y puedes vivir con 40 en el índice. $0.07 por tarea con una tasa de acierto de caché de $0.06 por millón en el endpoint de primera parte es un precio agresivo para un modelo con audio y visión nativos.

Muévete si estás ajustando. Un modelo 276B/12B es dramáticamente más barato de adaptar y servir que el 975B/41B, y Tinker soporta ambos.

Quédate con Inkling si necesitas audio largo. Esta es la regresión más pronunciada de la versión y está oculta en las fichas de los modelos: el modelo insignia recomienda entradas de audio de menos de 20 minutos, mientras que la ficha de Inkling-Small recomienda menos de 2 minutos. Una reducción a la décima parte. Si estabas transcribiendo o razonando sobre reuniones, el modelo pequeño no es un reemplazo directo a ningún precio.

Quédate si necesitas contexto más allá de 512K desde un endpoint alojado, o completions más largos de 262K tokens. Hoy solo el modelo insignia tiene un endpoint que sirve el millón completo.

Quédate si necesitas JSON con esquema obligatorio sin escribir tu propio bucle de validación y reintento, hasta que un proveedor ofrezca response_format para el modelo pequeño.

Quédate si la robustez adversarial es esencial. 71.6% frente al 78.0% en FORTRESS adversarial es la dirección equivocada para cualquier cosa orientada al usuario, y es el propio número del laboratorio.

Tres preguntas que la cobertura del lanzamiento dejó abiertas

¿Es Inkling-Small simplemente una versión destilada de Inkling?

En parte, y la parte que no lo es es la que importa. La destilación on-policy con Inkling como maestro fue una etapa del post-entrenamiento, así que gran parte de la capacidad general realmente se hereda. Pero este es un modelo con arquitectura separada: 42 capas frente a las 66 del buque insignia, con la misma topología de enrutamiento de 6 expertos activos de entre 256 más 2 compartidos, lo que significa que los expertos en sí son más angostos, no menos numerosos. Y recibió alrededor de dos semanas de RL de codificación agéntica que el maestro nunca tuvo. Esa última etapa es la razón por la que un estudiante destilado supera a su maestro en los puntos de referencia de codificación, lo que de otro modo no debería suceder.

¿Puedo realmente autoalojarlo?

Solo en hardware serio. 276B parámetros son aproximadamente 276GB de pesos en 8 bits y unos 552GB en BF16, sin contar la caché KV — un nodo multi-GPU en cualquier caso, no una estación de trabajo. La ventaja del MoE disperso es el costo de inferencia, no la huella de memoria; almacenas los 276B completos y computas con 12B. La ficha menciona SGLang, vLLM, TokenSpeed, Unsloth y Hugging Face Transformers como rutas de servicio compatibles y lista BF16 y NVFP4 como formatos numéricos. Ten en cuenta también que ambos endpoints alojados hoy sirven una versión cuantizada, por lo que "el mismo modelo" autoalojado en BF16 no se comportará de manera idéntica a la API contra la que probaste.

¿La Inkling 975B todavía tiene razón de existir?

Tres, y todas son limitadas: el contexto servido completo de 1M de tokens, entradas de audio de más de dos minutos y un mejor comportamiento de seguridad adversarial. Cabe destacar que «es más inteligente» no está con certeza en esa lista — un punto del índice con el máximo esfuerzo de pensamiento, frente a un conjunto de benchmarks del proveedor en los que el modelo más pequeño gana mayormente, no es un argumento de capacidad. Dos semanas después de lanzar un modelo insignia de 975B, Thinking Machines lanzó el modelo que hace difícil recomendarlo. Eso es o una franqueza inusual o una velocidad inusual, y en cualquier caso es una buena señal sobre el laboratorio.

Qué ver a continuación

Tres cosas decidirán cómo envejece este lanzamiento. Si aparece un endpoint sirviendo el contexto de 1M anunciado, lo que eliminaría la ventaja más clara que le queda al buque insignia. Si alguien publica una comparación independiente de los dos modelos con el mismo esfuerzo, que es la única manera de saber si ese punto de índice es real. Y si la recomendación de audio de 2 minutos es una limitación del entrenamiento o un valor predeterminado del servicio — porque si es esto último, la razón más importante para quedarse con el modelo más grande desaparece. Hasta entonces, el resumen honesto es que Thinking Machines lanzó un modelo que cuesta un tercio del precio, es dos tercios más rápido, mejor en programación según su propia evidencia, ligeramente por detrás en la puntuación agregada independiente, y claramente por detrás de un rival del mismo tamaño que la mayoría de la cobertura no mencionó.

© 2026 OrcaRouter

Para proveedores

¿Operas una plataforma de inferencia? Publica tus modelos en OrcaRouter.

Contáctanos

Únete a la comunidad

DiscordEmailXGitHubYouTube