Una tarjeta de título generada que dice «Ember-1 vs Qwen3.8-Max» con el subtítulo «Un derivado ahorrador de tokens frente al buque insignia», sobre dos tarjetas: Ember-1 — «se afirma que usa un 40 % menos de tokens» y «sin precio publicado»; Qwen3.8-Max — «2 dólares de entrada, 6 dólares de salida» y «contexto de 1 M de tokens».
Guides & Insights

Ember-1 vs Qwen3.8-Max: la derivada ahorradora de tokens contra el buque insignia

Autor

Alistair Wren

Fecha de publicación

Últimos modelos · 20Ver todos los modelos
Benchmarks: Artificial Analysis · actualizado a diario
Volver a todas las publicaciones

Los dos modelos de esta comparativa tienen una cifra real en el mismo benchmark, y aun así no resuelve nada. Ember-1 es el derivado especializado de Fireworks Research de Kimi K3 de Moonshot AI, publicado el 23 de septiembre de 2026, y reporta un 82,0 % en Terminal Bench 2.1 con aproximadamente la mitad de los tokens que gasta su modelo base. Qwen3.8-Max es el buque insignia de Aliba​ba —un modelo disperso de mezcla de expertos de aproximadamente 2,4 billones de parámetros, con unos 95.000 millones activos por token—, disponible de forma general desde el 3 de agosto de 2026, y reporta un 86,6 % en el mismo benchmark. Ambas cifras las reporta el proveedor, ambos laboratorios ejecutaron su propio arnés de evaluación, y una diferencia de 4,6 puntos entre dos configuraciones de evaluación no publicadas no es un veredicto. Lo que es comparable es el dinero, y ahí es donde esta comparativa se vuelve interesante: toda la tesis de un modelo es que no deberías pagar por tokens que no necesitas, y el otro es un buque insignia con un precio de $2 por millón de entrada y $6 por millón de salida.

Lo que cada modelo realmente es

Ember-1 no es un nuevo modelo en ningún sentido arquitectónico. Es Kimi K3 reentrenado para razonar de forma más concisa, construido por Fireworks Research a lo largo de más de 50 experimentos de entrenamiento y más de 200 evaluaciones en su propia pila de entrenamiento sin servidor. La afirmación del laboratorio es que el razonamiento de K3 es más largo de lo que requieren las tareas y que el exceso se puede eliminar sin cambiar las respuestas — la longitud del razonamiento cayó entre un 35 y un 50% sin pérdida de precisión en siete benchmarks y dos pruebas A/B de producción de clientes. Está disponible como una vista previa de investigación en la propia plataforma sin servidor del proveedor, sin pesos publicados y sin precio publicado.

Qwen3.8-Max es un objeto de un tipo completamente distinto. Es el nivel frontera de Aliba​ba, nativamente multimodal para entrada de texto, imagen y vídeo, con una ventana de contexto de un millón de tokens, y actualizado dos veces desde su lanzamiento: una actualización post-entrenada el 2 de septiembre de 2026 orientada a la programación y al trabajo de oficina profesional, y un nivel de servicio más rápido anunciado el 22 de septiembre de 2026. Aliba​ba lo posiciona frente a GPT-5.5, Claude Opus 4.7 y Gemini 3.1 Pro, y su hoja de evaluación publicada refleja esa ambición: GPQA Diamond 92,6, OSWorld-Verified 86,1, SWE-bench Pro 67,7, PaperBench 93,0, IFBench 82,8 y Humanity's Last Exam con 43,6, todos ellos reportados por el proveedor.

A two-column scoreboard titled "Ember-1 vs Qwen3.8-Max — the scoreboard" comparing six dimensions. Ember-1: input/output price not published, computed from Kimi K3 rates of $3 and $15; context not published, base model carries 1M; text input; Terminal Bench 2.1 82.0% vendor-reported; research preview with a two-week window; not routed on OrcaRouter. Qwen3.8-Max: $2.00 in and $6.00 out per 1M tokens; 1,000,000-token context; text, image and video input; Terminal Bench 2.1 86.6% vendor-reported; generally available and priced; routed on OrcaRouter. The footer notes both Terminal Bench figures are vendor-reported and were produced on different harnesses.

Las tarjetas de tarifas, lado a lado

Uno de estos tiene un precio y el otro no, que es la primera asimetría práctica.

• Entrada — Ember-1: no se ha publicado ninguno; la hoja de referencia calcula los dólares a partir de la tarifa de Kimi K3. Qwen3.8-Max: $2.00 por millón de tokens en OrcaRouter.

• Salida — Ember-1: ninguno publicado. Qwen3.8-Max: $6.00 por millón de tokens.

• Entrada en caché — Ember-1: no aplicable. Qwen3.8-Max: $0.25 por millón de tokens para lecturas de caché, lo que equivale a un octavo de la tarifa de entrada y tiene una importancia enorme en los bucles de agentes, donde el mismo contexto se reenvía en cada turno.

• Ventana de contexto — Ember-1: no publicada para la vista previa; su modelo base admite 1.048.576 tokens. Qwen3.8-Max: 1.000.000 tokens.

• Multimodalidad — Ember-1: texto. Qwen3.8-Max: entrada de texto, imagen y vídeo; salida de texto.

• Pesos — Ember-1: ninguno. Qwen3.8-Max: existe una versión de pesos abiertos, pero es solo texto y carece de la ventana de contexto completa y de la entrada de visión del endpoint servido.

• Acceso — Ember-1: vista previa de investigación, ventana sin servidor de dos semanas, permanencia ligada a la demanda. Qwen3.8-Max: disponible de forma general y con precio.

Ten en cuenta una cosa sobre las tarifas de Qwen3.8-Max antes de modelar nada: Aliba​ba ha revisado el empaquetado de este modelo en repetidas ocasiones desde su lanzamiento, y la tarjeta de tarifas internacional no siempre ha coincidido con el titular de agosto. Considera $2.00 y $6.00 como el precio de ruta actual en nuestra plataforma —que traslada el precio de lista del proveedor sin ningún margen, de modo que un cambio del proveedor se refleja el mismo día— y consulta la tarjeta antes de comprometer un presupuesto para ello.

Por qué no funciona la comparación de benchmark

El 82,0 % de Ember-1 y el 86,6 % de Qwen3.8-Max corresponden ambos a Terminal Bench 2.1, lo que los hace parecer comparables, pero no los hace comparables. La hoja de Ember-1 informa su cifra frente a variantes de Kimi K3 evaluadas por Fireworks Research, sobre 89 muestras, con deltas de tokens y costos adjuntos. La cifra de Qwen3.8-Max proviene de la propia hoja de evaluación de Alibaba. Diferentes laboratorios, diferentes arneses, diferentes andamiajes de agentes y, en un benchmark cuyas puntuaciones se mueven varios puntos solo por la elección del andamiaje, una diferencia de 4,6 puntos está dentro del ruido de fondo de la metodología.

Lo que puedes leer en la hoja de Ember-1 es la columna de tokens, que es lo único que el modelo fue entrenado para cambiar. Frente a su propia base, Ember-1 gasta un 51,9 % menos de tokens en Terminal Bench 2.1, un 32,5 % menos en SWE-Interact, un 23,7 % menos en DeepSWE 1.1 y solo un 5,9 % menos en τ-2 Bench Airline. La dispersión es el titular honesto. Un modelo que reduce la deliberación vale muchísimo en benchmarks donde el modelo base piensa en exceso y casi nada donde no lo hace, y no puedes saber qué tipo de carga de trabajo tienes sin medir la tuya.

Costo por tarea completada, desarrollado

Aquí está la aritmética que realmente decide esto, usando las tarifas publicadas de Kimi K3 como sustituto del costo de Ember-1, ya que Ember-1 no tiene ninguna. Kimi K3 cuesta $3.00 por millón de tokens de entrada, $0.30 en caché y $15.00 de salida — exactamente la tarifa que Fireworks Research usó en su propia comparación. Qwen3.8-Max cuesta $2.00 de entrada y $6.00 de salida, con lecturas de caché a $0.25.

Del lado de la entrada, Qwen3.8-Max ya es un tercio más barato. Del lado de la salida, es 2,5 veces más barato por token. Eso significa que la reducción de tokens de Ember-1 no está compitiendo contra una factura estática, sino contra un modelo insignia que es más barato por token antes de que se realice cualquier trabajo de eficiencia. La propia prueba A/B en producción de Fireworks Research mostró que los tokens de salida cayeron de 49,3K a 29,9K, una reducción total del 39%; aplica eso a la tarifa de salida de Qwen3.8-Max y obtienes el mismo ahorro del 39%, que es una ganancia absoluta menor que el mismo porcentaje aplicado a la tarifa de $15 de K3.

El argumento de eficiencia para Ember-1 es, por lo tanto, más fuerte cuando se mide frente a su propio modelo base, y es exactamente el argumento que presenta el lanzamiento. Frente a Qwen3.8-Max, la comparación se desplaza hacia la capacidad por dólar, donde el contexto más amplio, la entrada multimodal y la disponibilidad con precio del buque insignia son los contraargumentos — y donde nadie ha publicado una comparación cara a cara que lo resuelva.

A screenshot of OrcaRouter's model page for Qwen3.8 Max, showing the qwen/qwen3.8-max listing priced at $2.00 per 1M input tokens and $6.00 per 1M output tokens, a p50 time-to-first-token of 1.98s, 33.3M tokens of traffic over seven days, a 1M-token context window accepting text, image and video, and a Python snippet calling api.orcarouter.ai/v1.

Lo que muestran nuestros propios datos de enrutamiento

Dos de los tres modelos involucrados aquí son rutas activas en OrcaRouter, lo que da una visión que ninguna hoja de benchmarks contiene. Qwen3.8-Max se sirve con 1.000.000 de tokens de contexto, con una latencia mediana del primer token de alrededor de 2,0 segundos y aproximadamente 52,7 tokens de salida por segundo durante los últimos siete días, con una tasa de error de alrededor del 4,2 %. Kimi K3 —el modelo base de Ember-1 y el punto de referencia para cada ahorro que Ember-1 afirma— funciona con 1.048.576 tokens de contexto, una latencia mediana cercana a los 8,0 segundos, aproximadamente 43,6 tokens de salida por segundo y una tasa de error de alrededor del 0,27 %, con un tráfico considerablemente mayor. Ember-1 en sí no está en OrcaRouter.

Esas cifras replantean la decisión. Kimi K3 es sustancialmente más lento hasta el primer token y aproximadamente el doble de caro por token de salida que Qwen3.8-Max, y aun así presenta una tasa de error mucho menor bajo una carga mucho más exigente. Una variante de K3 más ahorradora de tokens reduce la brecha de coste, pero no cierra la brecha de latencia, porque acortar el razonamiento acorta la fase de generación, no la cola. Si tu carga de trabajo es sensible a la latencia más que a la factura, el modelo insignia es la mejor opción hoy, y el argumento de la eficiencia es irrelevante.

¿Cuál de ellos enrutar?

Enruta Qwen3.8-Max cuando necesites la ventana de contexto, la entrada multimodal, un precio publicado y un servicio sobre el que puedas presupuestar. Es la más segura de las dos por construcción: disponibilidad general, con precio publicado y actualizada dos veces en dos meses por un proveedor con un historial de mantener el endpoint al día.

Prueba Ember-1 cuando tu factura esté dominada por tokens de razonamiento en bucles de agente largos y ejecutes contra un modelo alojado en lugar de tu propio hardware. La prueba correcta son las dos semanas que te ofrece la vista previa, que ejecutes en sombra contra el tráfico de producción, midiendo tokens por tarea completada en lugar de tokens por solicitud. Lo que no deberías hacer es sustituirlo como reemplazo equivalente de un modelo insignia basándote en una cifra del 40 % que oscila entre el 6 % y el 52 % según la carga de trabajo.

Si la verdadera pregunta es si merece la pena seguir ejecutando Kimi K3, esa la puedes responder hoy mismo sin ninguna vista previa: tanto Kimi K3 como Qwen3.8-Max están en OrcaRouter detrás de una sola clave, con el precio de lista del proveedor y sin recargo, con conmutación por error automática entre proveedores. Comparar el coste de tu carga de trabajo en ambos es un cambio de enrutamiento, no un proyecto de adquisición, y te da la línea base que hace que cualquier afirmación de eficiencia sobre Ember-1 sea medible con tus propios números en lugar de con los del laboratorio.

A screenshot of OrcaRouter's model page for Kimi K3, showing the MoonshotAI Kimi K3 listing priced at $3.00 per 1M input tokens and $15.00 per 1M output tokens, a p50 time-to-first-token of 8.00s, 749.2M tokens of traffic over seven days, a 1M-token context window and a Python snippet calling api.orcarouter.ai/v1.

El resumen honesto es que estos dos modelos están optimizados frente a restricciones diferentes. Qwen3.8-Max está diseñado para ser lo más capaz disponible y tiene un precio acorde; Ember-1 está diseñado para hacer que un modelo ya costoso sea más barato de ejecutar. Ambos son legítimos, y la razón por la que esta comparación no admite un veredicto claro es que los ahorros del derivado se definen en relación con una tarifa que el modelo insignia reduce sustancialmente.

Comparados en este artículo1

Detectado en este artículo · Benchmarks: Artificial Analysis · actualizado a diario