Tarjeta principal generada con el título Claude Sonnet 5.5 vs Muse Glimmer, con el subtítulo un modelo de portátil de 30B frente al nuevo Sonnet, con tres tarjetas de estadísticas: índice de inteligencia 56 vs 17, ventana de contexto 1M vs 131K tokens, y pesos cerrados vs Apache 2.0, con un pie de página que dice Índice según Artificial Analysis v4.3.2; especificaciones de Muse Glimmer según Meta.
Guides & Insights

Claude Sonnet 5.5 vs Muse Glimmer: Un modelo de portátil de 30B contra el nuevo Sonnet

Autor

Gideon Frost

Fecha de publicación

Últimos modelos · 20Ver todos los modelos →
Benchmarks: Artificial Analysis · actualizado a diario
Volver a todas las publicaciones

La pregunta de fondo de esta página es si la comparación es legítima siquiera, y la respuesta honesta es que Claude Sonnet 5.5 y Muse Glimmer no son competidores en el sentido habitual. En el Índice de Inteligencia de Artificial Analysis, revisión v4.3.2, Claude Sonnet 5.5 obtiene 56 y Muse Glimmer obtiene 17, y esa diferencia no es ruido: es aproximadamente la distancia entre un modelo de propósito general de frontera y uno pequeño muy bueno. Lo que hace que, aun así, merezca la pena leer la comparación es que Muse Glimmer tiene una propiedad que el otro no puede comprar a ningún precio: es un modelo de pesos abiertos de 30 mil millones de parámetros, publicado por M​eta el 10 de agosto de 2026 bajo Apache 2.0, cuantizado a 4 bits para que quepa en menos de 20 GB de VRAM, y diseñado para funcionar con la red desconectada. Claude Sonnet 5.5 llegó el 28 de septiembre de 2026 como el Sonnet más rápido y más inteligente del proveedor, con un precio de $2.00 por millón de tokens de entrada y $10.00 por millón de salida, y solo es accesible a través de una red. La decisión real no es qué modelo es mejor. Es dónde quieres que se ejecuten los tokens.

Dos modelos, dos definiciones del trabajo

Muse Glimmer proviene de Meta Superintelligence Labs como un modelo de 30B parámetros entrenado mediante destilación de logits a partir del maestro Muse Spark, más grande, de Meta, y luego ajustado finamente con datos agénticos de contexto largo y reforzado para el uso de herramientas. Meta lo lanzó ya cuantizado: 4 bits lleva la huella de memoria de más de 55 GB en precisión completa a menos de 20 GB, lo que lo coloca dentro del rango de una GPU de consumo de 24 GB o 32 GB. Meta lo probó en una Nvidia RTX 5090 y en silicio Apple M4 Max y M5 Max. Acepta entrada de texto e imágenes, devuelve texto, ejecuta una ventana de contexto de 131,072 tokens que, según Meta, se puede extender a 262,144, y tiene un corte de conocimiento de enero de 2026.

Artificial Analysis model page for Muse Glimmer (high), an open-weights model released August 2026, showing an Intelligence Index of 17, an output speed of 143.8 tokens per second, $0.325 per million input tokens and $1.35 per million output tokens, $0.06 per Intelligence Index task, 59M output tokens generated during the Index evaluation, a 131K-token context window and a January 2026 knowledge cutoff.

Claude Sonnet 5.5 es el segundo modelo de la generación 5.5 de Anthropic y el que la empresa posiciona como la mejor combinación de velocidad e inteligencia de su catálogo. Funciona con una ventana de 1.000.000 de tokens, hasta 128.000 tokens de salida de forma síncrona y 300.000 en la API de Message Batches tras el output-300k-2026-03-24 encabezado, acepta texto, imágenes y archivos, ofrece pensamiento adaptativo con esfuerzo seleccionable y un corte de junio de 2026, y está disponible con retención de datos cero desde su lanzamiento. El almacenamiento cuesta 0,20 $ por millón de tokens en lecturas de caché y 2,50 $ por millón en escrituras de caché. Anthropic afirma que se ejecuta un 30 % más rápido que Claude Sonnet 5 y cuesta hasta un 30 % menos por tarea con tarifas sin cambios: afirmaciones del proveedor, no reproducidas de forma independiente.

Merece la pena ver el contraste de especificaciones de una sola pasada, porque casi cada línea es un tipo diferente de cosa en lugar de una mejor o peor:

• Pesos — Muse Glimmer Apache 2.0, descargable, cuantizado a 4 bits frente a Claude Sonnet 5.5 cerrado

• Dónde se ejecuta — Muse Glimmer en tu propia GPU, sin conexión, frente a Claude Sonnet 5.5 en la infraestructura de Anthropic

• Parámetros — Muse Glimmer 30B en total, menos de 20 GB en 4 bits frente a Claude Sonnet 5.5, sin especificar

• Contexto — Muse Glimmer 131.072 tokens, ampliable a 262.144 frente a Claude Sonnet 5.5 1.000.000 tokens

• Precio por millón — Muse Glimmer sin cargo por token, tu hardware frente a Claude Sonnet 5.5 $2.00 entrada / $10.00 salida

• Índice de Inteligencia v4.3.2 — Muse Glimmer 17 vs Claude Sonnet 5.5 56

• Coste por tarea de Index según lo medido — Muse Glimmer $0.06 frente a Claude Sonnet 5.5 $7.60

Dos cifras de esa lista merecen un análisis detallado, porque ambas son trampas. La primera es la cifra de 0,06 $ por tarea: es lo que Artificial Analysis gastó al llamar a Muse Glimmer (high) a través de un endpoint alojado a 0,325 $ por millón de tokens de entrada y 1,35 $ por millón de tokens de salida, así que mide la economía de alquilar este modelo, no la de ejecutarlo. En autoalojamiento, el coste marginal por token desaparece y lo sustituye una GPU que ya tienes o que tienes que comprar. La segunda es la propia brecha del índice: un modelo de 30B cuantizado a 20 GB se evalúa con la misma regla que los modelos de frontera, y la tabla lo viene a decir cuando sitúa a Muse Glimmer en el puñado de modelos de pesos abiertos más destacados, al tiempo que señala que es caro para su tamaño.

Generated comparison scoreboard titled Claude Sonnet 5.5 vs Muse Glimmer, the scoreboard, contrasting weights closed vs Apache 2.0, where it runs Anthropic infrastructure vs your own GPU offline, parameters undisclosed vs 30B at 4-bit, context window 1,000,000 vs 131,072 tokens, AA Index 56 vs 17, and output speed 138.7 vs 143.8 tokens per second, with a footer reading AA Index and speed per Artificial Analysis v4.3.2; Muse Glimmer specifications per Meta.

Dónde Muse Glimmer es genuinamente bueno y dónde se desmorona

La puntuación compuesta es demasiado burda para ser la respuesta completa, porque Muse Glimmer no es uniformemente diecisiete. Es rápido —Artificial Analysis mide 143,8 tokens de salida por segundo, por delante de los 138,7 de Claude Sonnet 5.5— y es conciso, ya que genera 59M de tokens en la evaluación del Index frente a los 410M de Claude Sonnet 5.5. Y en una evaluación se acerca a la frontera: el recuerdo de contexto largo, donde obtiene un 83,3% frente al 82,7% de Claude Sonnet 5.5. Un modelo de 30B que iguala a un Sonnet de frontera recién lanzado en recuperación de contexto largo es la línea más sorprendente de esta página, y es coherente con la forma en que Meta lo entrenó: datos agénticos de contexto largo, destilación de un profesor mucho más grande.

Los resultados agénticos son donde se muestra el techo del modelo y el ranking deja de ser halagüeño. En Terminal-Bench 4.0, Muse Glimmer obtiene un 0,5 % frente al 63,6 % de Claude Sonnet 5.5. Su puntuación en el benchmark de automatización es de 0,068 frente a 0,713. Humanity's Last Exam: 22,0 % frente a 55,0 %. Un resultado de una magnitud tan pequeña en un benchmark de ejecución significa que el modelo no completa tareas, y ningún ahorro por alojamiento local hace que una tarea que nunca termina sea más barata.

La literatura académica también es contundente al respecto, y merece la pena decirlo en lugar de ocultarlo: un estudio de orquestación multiagente revisado por pares, en el que Muse-Glimmer-30B fue uno de los modelos evaluados, encontró que no recuperó ninguno de sus candidatos. La propia tabla de referencia de Meta para el modelo es un documento de proveedor y aquí se etiqueta como tal; las cifras de Artificial Analysis anteriores son mediciones independientes, y son en las que se basa este artículo.

Así que la división es legítima. Muse Glimmer es fuerte para su tamaño a la hora de leer una entrada larga y responder sobre ella, es rápido, barato de ejecutar y cabe en una GPU de clase portátil. No es un modelo al que le encargas una tarea de software de varios pasos y te despreocupas. Esa es la línea honesta, y una comparación escrita solo en torno a puntuaciones compuestas la ocultaría.

Lo que realmente estás comprando a la tarifa de frontera

El premium de Claude Sonnet 5.5 compra capacidad antes que nada, y la brecha de diecisiete puntos en el Index es su manifestación más destacada. Pero hay otras tres cosas que vienen con la tarifa de salida de $10.00 que no aparecen en ninguna tabla de clasificación.

Lo primero es la ventana. Un millón de tokens es aproximadamente siete veces y media los 131.072 de Muse Glimmer, y A​nthropic cobra la tarifa estándar por todo ese volumen, con las lecturas de caché a una décima parte del precio de entrada, de modo que arrastrar un contexto grande a lo largo de muchas llamadas resulta asequible y no algo meramente teórico. Un prompt a escala de repositorio no cabe en absoluto en la ventana más pequeña, así que esto es una diferencia de capacidad y no una preferencia.

El segundo es la fidelidad de las herramientas. Cinco comportamientos cambiaron entre Claude Sonnet 5 y Claude Sonnet 5.5, y los cinco tienen que ver con el uso de herramientas y el razonamiento: los parámetros de muestreo no predeterminados ahora devuelven un 400, thinking: {"type": "disabled"} ahora devuelve un 400 y se convierte en between_tools, la elección forzada de herramienta de "any" o de una herramienta con nombre se rechaza, así que los bucles deben pasar a auto con uso estricto de herramientas, la antigua herramienta computer_20251124 se rechaza en la API de Claude y Google Cloud, y los bloques de pensamiento ahora están vinculados al modelo y la cuenta que los producen. Un sexto cambio no provoca ningún fallo, pero se vuelve silencioso: el texto entre llamadas a herramientas se devuelve dentro de los bloques de pensamiento, así que una aplicación de streaming deja de mostrar salida hasta que establece un valor de visualización o desactiva el pensamiento por adelantado. Eso es un día de trabajo de migración para cualquiera que use Sonnet 5, y es el precio de entrada a la fiabilidad agéntica que están midiendo las filas del benchmark anteriores.

El tercero es la procedencia y el manejo de datos. La retención cero de datos está disponible desde el lanzamiento, A​nthropic publica un piso de retiro del 28 de septiembre de 2027, y el modelo está disponible en la API de Claude, Bedrock, Goo​gle Cloud y Microsoft Foundry. Para un comprador regulado, esos son hechos de adquisición que deciden la compra antes que el benchmark.

Estar sin conexión es un requisito, no un ahorro de costos

La razón por la que esta combinación pertenece a una sola página es que, para una clase específica de despliegue, Muse Glimmer no es una opción más barata: es la única opción. Una solicitud que no puede salir del dispositivo, una planta de fábrica o un sitio de campo sin conectividad, un entorno aislado (air-gapped) donde una llamada a la API constituye una violación de cumplimiento, o un presupuesto de latencia en el que un viaje de ida y vuelta ya es demasiado: ninguna de esas situaciones se resuelve con un modelo mejor detrás de una red. Los pesos de Apache 2.0 que caben en menos de 20 GB y se ejecutan sin conexión son la respuesta completa, y Claude Sonnet 5.5 a cualquier precio no participa en la cuestión.

Las pruebas publicadas por M​eta en el silicio de RTX 5090, Apple M4 Max y M5 Max son la referencia práctica de lo que significa «ejecutarse localmente» aquí, y la cuantización de 4 bits es lo que hace que esos objetivos sean alcanzables en primer lugar — la huella de precisión completa supera los 55 GB. Cualquiera que planifique un despliegue debería considerar las cifras de hardware como las de M​eta, y no como medidas aquí.

Para todos los demás, los dos modelos son complementos más que sustitutos, y la parte operativamente incómoda es que tener un modelo de API de Anthropic y un modelo de Meta autoalojado normalmente implica dos stacks completamente independientes. OrcaRouter pone más de 200 modelos detrás de un único endpoint compatible con OpenAI, con el precio de lista del proveedor pasado tal cual y sin margen añadido, conmutación por error automática entre proveedores ascendentes y un DSL de enrutamiento para componer llamadas —lo que cubre la mitad alojada de esa configuración, y el teacher más grande de Meta, Muse Spark 1.2, se puede enrutar aquí como meta/muse-spark-1.2 a $1.25 de entrada y $4.25 de salida por millón de tokens en una ventana de 1.048.576 tokens, con lecturas de caché a $0.15. Está transportando 42,8 millones de tokens de tráfico a la semana a través de este catálogo, que es la parte útil de la configuración: el teacher alojado está en la misma clave que todo lo demás, y el modelo que ejecutas localmente nunca tiene que tocar una red en absoluto.

Tres notas de honestidad, porque es fácil equivocarse con ellas. Muse Glimmer en sí no es una de nuestras rutas: la ficha del modelo no existe en nuestro catálogo, y esta página lo dice en lugar de insinuar lo contrario. La captura de abajo es la página del modelo que sí existe, Muse Spark 1.2, que es el checkpoint del que se destiló Muse Glimmer y no Muse Glimmer en sí. Claude Sonnet 5.5 tampoco está en nuestro catálogo, un día después de su lanzamiento; la ruta hacia él es la propia API de Anthropic, y Claude Sonnet 5 se puede enrutar aquí desde el 30 de junio a $2.00 y $10.00 para quien quiera el objetivo de staging.

OrcaRouter model page for meta/muse-spark-1.2, dated 2026-08-05, showing $1.25 input and $4.25 output per million tokens, a p50 time to first token of 2.05 s, a 1,048,576-token context window, and 42.8M tokens of recent traffic.

Cómo decidir

Empieza por la restricción, no por la puntuación. Si la solicitud no puede salir de una máquina ni de una red, Muse Glimmer es la respuesta y la brecha de Index es irrelevante: un modelo de 30B con Apache 2.0 que funciona sin conexión y que iguala a un modelo de frontera en recuperación de contexto largo es, para ese trabajo, lo mejor disponible. Si la solicitud tiene que completar una tarea de software de varios pasos, un modelo de 30B que obtiene medio por ciento en Terminal-Bench no entra en consideración, sin importar el hardware que ya tengas.

Entre esos dos polos, el desempate es la medición en lugar de la opinión: tokens por tarea completada en tu propia carga de trabajo, con el precio calculado dos veces —una vez a los $2.00 y $10.00 de Claude Sonnet 5.5, y otra al coste amortizado de la GPU. El único número que replantea toda la comparación, $0.06 por tarea de Index frente a $7.60, es una cifra de alquiler alojado para un modelo que la mayoría de la gente ejecutará por sí misma, y citarlo como si fuera un ahorro comparable sería el error fácil que esta página pretende evitar.

Comparados en este artículo1

Detectado en este artículo · Benchmarks: Artificial Analysis · actualizado a diario