
Muse Glimmer alcanza 230 tokens/s en una sola RTX 5090: el soporte Day-0 de SGLang es la verdadera historia del lanzamiento
- z-aiNUEVOZ.ai: GLM 5.32026-08-1860Inteligencia75Código
- obsidianNUEVOQwen3.8 27B2026-08-1552Inteligencia68Código
- qwenNUEVOQwen: Qwen3.8 27B (free)2026-08-13qwen/qwen3.8-27b-free
- deepseekNUEVODeepSeek: DeepSeek V4 Pro 08132026-08-1253Inteligencia69Código
- grokNUEVOSpaceXAI: Grok 4.62026-08-1261Inteligencia77Código
- metaMeta: Muse Spark 1.22026-08-0557Inteligencia72Código
- qwenQwen: Qwen3.8 Max2026-08-0358Inteligencia72Código
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3152Inteligencia69Código
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 por 1M de tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463Inteligencia78Código
- googleGoogle: Gemini 3.6 Flash2026-07-2152Inteligencia69Código
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137Inteligencia49Código
- metaMeta: Muse Spark 1.12026-07-1653Inteligencia71Código
- kimiMoonshotAI: Kimi K32026-07-1560Inteligencia76Código
- openaiOpenAI: GPT-5.6 Luna2026-07-0952Inteligencia71Código
- openaiOpenAI: GPT-5.6 Terra2026-07-0957Inteligencia77Código
- openaiOpenAI: GPT-5.6 Sol2026-07-0961Inteligencia77Código
- grokxAI: Grok 4.52026-07-0856Inteligencia72Código
Doscientos treinta tokens por segundo es una cifra rápida para cualquier modelo. Para Muse Glimmer — el lanzamiento denso de 30B y pesos abiertos de Meta, de Meta Superintelligence Labs, que se publicó el 10 de agosto de 2026 bajo Apache 2.0 — es la cifra que separa un modelo que "corre en mi GPU" de uno que "sirve a un agente real". SGLang anunció soporte desde el día cero para Muse Glimmer el mismo día en que se publicaron los pesos, y su medición publicada en una sola GeForce RTX 5090 es de 236,4 tokens por segundo por usuario en batch 1, con cuantización NVFP4 y el drafter de decodificación especulativa DFlash de Meta ambos activados.
Esa cifra cuenta la mayor parte de la historia de este lanzamiento, pero merece la pena detenerse en el resto, porque lo interesante no es la velocidad que encabeza los titulares. Lo interesante es que el modelo también funciona directamente en una RTX PRO 6000, en un NVIDIA DGX Spark y en silicio de Apple mediante MLX — y que SGLang califica el trabajo como una colaboración con Meta Superintelligence Labs, no como una ocurrencia tardía de la comunidad. Es el primer modelo de Meta cercano a la frontera en mucho tiempo que está diseñado en torno a la pila de servicio, no solo en torno a los pesos.
Qué significa realmente "soporte día 0" aquí
El soporte Day-0 en SGLang v0.5.17 significa que el modelo no fue añadido a posteriori: el trabajo del runtime llegó en la misma ventana de lanzamiento que los pesos, con una ruta diseñada específicamente para el hardware al que Meta realmente apunta. El backend SM120 de SGLang cubre la línea de escritorio y estaciones de trabajo Blackwell — la RTX 5090, la RTX PRO 6000 y la DGX Spark ejecutan todas la misma ruta optimizada — mientras que el silicio de Apple recibe un backend MLX nativo en lugar de un puerto lento.
La pila que SGLang y Meta ajustaron es específica. El modelo se ejecuta como un checkpoint NVFP4 de 18GB emparejado con un drafter DFlash BF16 de 5GB, que es el modelo acompañante de decodificación especulativa que Meta entrenó para Muse Glimmer. Esa combinación cabe en una tarjeta de 32GB con espacio de sobra, y todo el camino de cuantización mixta NVFP4-más-MXFP8 ocupa aproximadamente 19.5GB residentes. En el lado de SGLang, las notas de la versión citan tres mecanismos de fiabilidad como parte de la misma historia: decodificación especulativa DFlash, RadixAttention para caché de prefijos y gráficos CUDA interrumpibles.
El número, y qué es y qué no es
Los números publicados por SGLang para la RTX 5090, todos con NVFP4 y la ruta SM120, se desglosan así:
• Decodificación de un solo usuario (lote 1) — 63.9 tokens/s estándar, 236.4 tokens/s con decodificación especulativa DFlash. Ese aumento de 3.7x es el número interactivo, el que decide si un agente local se siente como una conversación o como una cola.
• Salida agregada (lote 8) — 501 tokens/s estándar, 1,452 tokens/s con DFlash. Este es el número de rendimiento para un servidor local que atiende varias solicitudes a la vez.
• Para comparar, un GGUF q4_k_m en la misma GPU — la ruta que la mayoría usará con runtimes estilo llama.cpp — alcanza 72.6 tokens/s estándar y 140.7 tokens/s con DFlash. La ruta NVFP4 está claramente por delante.
Estas son cifras publicadas por SGLang y Meta el día del lanzamiento, no reproducciones independientes — la etiqueta honesta es "reportado por el proveedor y el framework", y la verificación comunitaria llegará en las próximas semanas. Pero el patrón entre las dos pilas que anunciaron números es consistente. En llama.cpp, Meta reportó de 74.9 a 233.4 tokens/s en una RTX 5090 con DFlash, un incremento de 3.1x; el M5 Max pasa de 26.6 a 50.2; el M4 Max de 23.7 a 37.8. Dos runtimes diferentes, dos estilos de medición diferentes, el mismo orden de magnitud: un modelo de 30B decodificando a más de 200 tokens por segundo en una GPU de consumo, y DFlash aproximadamente triplicando el rendimiento en cada configuración de Nvidia que ha publicado números.
Por qué "sirve" importa más que "funciona"
El blog de hardware de Meta hace una afirmación más contundente que las cifras de escritorio. En NVIDIA Blackwell Ultra — la generación para centros de datos, no la tarjeta de escritorio — el blog cita más de 20,000 tokens por segundo por GPU en BF16/NVF4, con SGLang y vLLM ambos mencionados como stacks de código abierto compatibles. Eso es otra liga, y es la señal de lo que Meta está construyendo en realidad: los mismos pesos están diseñados para ejecutarse en cualquier lugar, desde una laptop hasta un rack de servidores GPU, y los frameworks de servicio fueron tratados como ciudadanos de primera clase desde el primer día, en lugar de como ports que se escribirían más tarde.
La parte de la historia que corresponde a la fiabilidad importa tanto como la velocidad. Un agente local que muere a mitad de tarea porque la capa de servicio tartamudeó no es significativamente mejor que un agente en la nube que sufrió una limitación de tasa. Los mecanismos de la pila del día cero —decodificación especulativa que puede interrumpirse, caché de prefijos que abarata la reentrada en contextos largos de agente y un drafter ajustado al modelo base— son exactamente las piezas que hacen que los agentes locales siempre activos puedan sobrevivir. Esto es la "velocidad y fiabilidad" a la que el lanzamiento ha estado apuntando, y es una posición real de ingeniería, no una frase de marketing.

Lo que realmente puedes hacer con ello
Muse Glimmer es un modelo denso de 30B, multimodal — entrada de texto e imagen a través de un codificador de percepción congelado, salida de texto — entrenado en más de 100 idiomas, con una ventana de contexto de 131 072 tokens y un corte de conocimiento del 4 de enero de 2026. Su misión es el trabajo de agente poco glamuroso: invocación de funciones, uso de herramientas, gestión de horarios y archivos, evaluación LLM-as-a-judge, y tareas de varios pasos con recuperación de fallos — cuando falla una llamada de herramienta, el modelo está entrenado para diagnosticar y reintentar en lugar de detenerse. Expone niveles de esfuerzo de razonamiento (de bajo a xhigh) que se definen en el prompt del sistema, que es la forma de intercambiar latencia por profundidad con los mismos pesos.
La cifra de 230 tokens por segundo es lo que hace que todo eso sea utilizable en una sola máquina. Por debajo de aproximadamente 50 tokens/s, un agente interactivo se siente como una sesión de depuración remota; a más de 200, se siente como una herramienta local. Ese es todo el argumento del modelo en un solo número, y es la razón por la que la lista de hardware — RTX 5090, RTX PRO 6000, DGX Spark, MLX Macs — se lee como una guía de compras para la era del agente local en lugar de una nota al pie sobre compatibilidad.
Lo que cuesta
Muse Glimmer en sí es gratis — pesos con licencia Apache 2.0 en Hugging Face en meta-models/Muse-Glimmer-30B, con cuantizaciones GGUF ya publicadas para runtimes estilo llama.cpp y sin una API pública de Meta. El costo real es el hardware que hay debajo: un checkpoint NVFP4 de 18GB más el drafter de 5GB significa que necesitas una tarjeta de 24GB o 32GB, o una Mac de gama alta con chip de la serie M. Si ya tienes eso, el costo marginal de un agente local siempre activo es la electricidad. Si no lo tienes, la GPU es la partida principal, y esa es la forma honesta de comparar un "modelo gratuito" con una API alojada.
Cuando hagas esa comparación, cotiza ambos lados de manera directa. En OrcaRouter, el precio que ves para cualquiera de los más de 200 modelos alojados es el precio de lista del proveedor transmitido con un margen del 0%, por lo que un recorte de precio del proveedor se hace efectivo aquí el mismo día, lo que mantiene honesta la aritmética entre local y alojado. Muse Glimmer no está hoy en OrcaRouter, porque ningún proveedor de inferencia lo está sirviendo todavía; se distribuye como descarga. En el momento en que un proveedor comience a servirlo, la misma clave que llega al resto del catálogo llegará a él, y la conmutación automática por error es el mecanismo que hace seguro apuntar tráfico de producción a un modelo completamente nuevo, reportado por el proveedor, antes de que tenga un historial independiente.

La historia más grande detrás de la velocidad.
Lee el trabajo de SGLang en el día 0 como una señal, y el lanzamiento deja de ser un modelo único. Muse Glimmer es una versión destilada del buque insignia propietario de Meta, Muse Spark 1.2, y Meta ha dicho que los pesos del maestro llegarán "en las próximas semanas". Un agente local de 30B con un stack de servicio ajustado, un modelo maestro a punto de volverse abierto y un fondo comunitario de mil millones de dólares anunciado junto con ello — eso no es un lanzamiento puntual. Es el comienzo de una línea de pesos abiertos dirigida directamente al mercado de agentes locales, y el soporte del framework que llega el primer día es la parte que indica que Meta tiene la intención de que la gente realmente lo ejecute, no solo lo descargue.
La advertencia que hay que tener en cuenta: todas las cifras de velocidad y rendimiento asociadas a este lanzamiento hasta ahora provienen del proveedor o del framework. Los números de rendimiento son consistentes entre dos stacks independientes, lo cual es tranquilizador, pero un benchmark independiente, una entrada en Artificial Analysis y reproducciones en el mundo real son lo que confirmará la historia de los 230 tokens por segundo — y suelen aparecer en cuestión de semanas tras un lanzamiento como este.
Qué observar, en orden aproximado de velocidad: el lanzamiento de Muse Spark 1.2 con pesos abiertos (la lectura estratégica de que "Meta is back" depende de ello); las primeras reproducciones independientes de throughput en hardware que no es de Nvidia, donde el camino MLX es el que hay que vigilar; y el primer proveedor de inferencia que levante un endpoint de Glimmer, que es el momento en que los argumentos de "modelo local gratuito" y "API alojada" dejan de ser hipotéticos y se convierten en una elección que puedes hacer con una sola tecla.

