Tarjeta de título generada que dice GPT-6 Sol vs Muse Spark 1.2, uno de ellos tiene orejas, con tarjetas de estadísticas que indican modalidades de entrada texto imagen archivo vs texto imagen video archivo audio, precio de salida $10.00 vs $4.25 por millón, y GPQA Diamond de terceros 96.1 vs 90.4, con un pie de página que dice tarifas de Muse Spark 1.2 según Meta y tarifas de GPT-6 Sol según la tarjeta de tarifas de OpenAI; cifras de benchmark según Artificial Analysis.
Guides & Insights

GPT-6 Sol vs Muse Spark 1.2: Uno de ellos tiene orejas

Autor

Elias Hawthorne

Fecha de publicación

Últimos modelos · 20Ver todos los modelos →
Benchmarks: Artificial Analysis · actualizado a diario
Volver a todas las publicaciones

Si ponemos GPT-6 Sol y Muse 1.2 uno al lado del otro, las columnas de precio son simplemente distintas, mientras que las columnas de modalidad no se acercan ni de lejos. Muse 1.2 acepta texto, imagen, vídeo, archivo y audio. GPT-6 Sol acepta texto, imagen y archivo. El audio y el vídeo son la diferencia, y no son un detalle menor: separan a un modelo al que se le puede entregar la grabación de una reunión de otro al que hay que entregarle una transcripción. GPT-6 Sol, el nivel intermedio de esa generación, se lanzó el 22 de septiembre de 2026; Muse 1.2, el checkpoint actual de Meta en la familia Muse, se lanzó el 5 de agosto de 2026 como una actualización directa de Muse 1.1 en el mismo nivel Standard y con idéntico precio.

Ese último punto importa para cómo debería leerse esta página. Muse Spark 1.2 no es una nueva generación y no debería presentarse como tal. La propia descripción de Meta es la de un checkpoint actualizado con un rendimiento ligeramente superior, servido a tarifas sin cambios. Así que la pregunta interesante no es qué añade 1.2 con respecto a 1.1. Es qué tiene la familia Muse Spark que no tiene la familia GPT-6, y si lo necesitas.

Las dos fichas técnicas, sobre las dimensiones que difieren

• Modalidades de entrada — GPT-6 Sol: texto, imagen y archivo vs. Muse Spark 1.2: texto, imagen, video, archivo y audio

• Salida — solo texto en ambos

• Precio de entrada — GPT-6 Sol $2.00 por millón vs Muse Spark 1.2 $1.25 por millón

• Precio de salida — GPT-6 Sol $10.00 por millón vs Muse Spark 1.2 $4.25 por millón

• Entrada en caché — GPT-6 Sol $0.20 por millón vs Muse Spark 1.2 $0.15 por millón

• Ventana de contexto — 1,050,000 tokens vs 1,048,576 tokens, prácticamente lo mismo

• Escalón para solicitudes largas — GPT-6 Sol vuelve a fijar el precio de toda la solicitud por encima de 272.000 tokens de entrada a $4.00 / $15.00, frente a Muse Spark 1.2, que no tiene escalón en su tarjeta

• GPQA Diamond — GPT-6 Sol 96,1 vs Muse Spark 1.2 90,4

• Humanity's Last Exam — GPT-6 Sol 47.9 vs Muse Spark 1.2 45.5

• Recuperación de contexto largo — GPT-6 Sol 83,7 vs Muse Spark 1.2 79,0

• tau-banking — GPT-6 Sol no publicado en esta revisión vs Muse Spark 1.2 34.8

• Pesos — ambos cerrados, solo API

La línea de solicitudes largas hace un trabajo silencioso en esa lista. Muse Spark 1.2 no tiene ninguna cláusula de reajuste de precios por contexto largo en su tarjeta publicada, así que sus $1,25 / $4,25 se mantienen durante toda la ventana. La cifra destacada de GPT-6 Sol no se mantiene: más allá de 272.000 tokens de entrada, toda la solicitud pasa a $4,00 / $15,00. En un prompt de contexto completo, la comparación de salida, por lo tanto, no es de diez dólares frente a $4,25, sino de quince frente a $4,25: tres veces y media, no dos y un tercio.

Y la brecha en los benchmarks es más estrecha de lo que sugiere la diferencia de precio. GPQA Diamond, 96,1 frente a 90,4, es aproximadamente la diferencia que se esperaría de dos configuraciones de esfuerzo de razonamiento diferentes en lugar de una diferencia de capacidad, y en Humanity's Last Exam los dos son 47,9 y 45,5, lo que supone 2,4 puntos en una escala de cien. Muse Spark 1.2 es el modelo más barato y el lector con mayor capacidad general; GPT-6 Sol va por delante en las cifras de razonamiento, pero no por el margen que implica el precio. Ninguna de las dos columnas domina, que es lo que hace que valga la pena tomar la decisión de forma deliberada.

Generated comparison scoreboard titled GPT-6 Sol vs Muse Spark 1.2, the scoreboard, with six matched rows. GPT-6 Sol: input $2.00 per million, output $10.00 per million, modalities text image file, GPQA Diamond 96.1, long-context recall 83.7, reprices above 272K input tokens. Muse Spark 1.2: input $1.25 per million, output $4.25 per million, modalities text image video file audio, GPQA Diamond 90.4, long-context recall 79.0, no long-request step. A footer reads Muse Spark 1.2 figures per Artificial Analysis and Meta; GPT-6 Sol figures per Artificial Analysis and OpenAI.

Qué cambian realmente las entradas de audio y vídeo

A un modelo que acepta audio se le puede entregar una grabación en lugar de una transcripción. Eso suena como una comodidad y en realidad es un cambio en lo que es posible: la transcripción es un paso con pérdida que descarta el tono, la superposición, la risa y la diferencia entre una pregunta y una afirmación leída solo a partir del texto. Un modelo que escucha el archivo directamente lo ve todo. El mismo argumento se aplica al video, donde la descripción fotograma por fotograma pierde la sincronización temporal y un modelo que ingiere el clip no.

La respuesta de GPT-6 Sol es un pipeline en lugar de una modalidad: primero transcribir o subtitular y luego pasar el texto. Es una arquitectura perfectamente viable y, para muchas cargas de trabajo, es la mejor, porque una transcripción se puede inspeccionar, almacenar en caché y es barata de guardar. Es peor justo cuando el audio o el movimiento son la señal: revisión de calidad en centros de llamadas, registro de medios, cualquier cosa en la que la vacilación de un hablante conlleve el significado.

La postura de Meta sobre esto merece una lectura atenta, porque la etiqueta de audio no es un adorno. Muse Spark 1.2 aparece listado con audio entre sus capacidades, junto con visión, herramientas, JSON y razonamiento, y Meta ha lanzado la familia como su línea multimodal, mientras que el más pequeño Muse Glimmer se destiló a partir de un modelo profesor de Muse Spark. Si eliges entre estos dos por la superficie de entrada, la elección no es entre una hoja de especificaciones un poco más amplia y otra un poco más estrecha. Es entre tener la modalidad y construir un pipeline para aproximarla.

Donde los dos se separan de verdad

La separación más clara está en el uso de herramientas agénticas contra un servicio simulado, y es el único punto en el que los números están lo suficientemente distantes como para actuar en consecuencia. Muse Spark 1.2 registra 34,8 en tau-banking y solo 7,1 en la revisión más reciente de Terminal-Bench 4.0 —ambas mediciones de terceros, y ambas describen la misma debilidad desde dos direcciones. Un modelo que interpreta bien una reunión y luego calcula mal el saldo de un cliente cuando se le pide llamar a una API no es un mal modelo; es un modelo con un trabajo claramente delimitado.

Ejecuta la misma comprobación en GPT-6 Sol y el panorama es coherente, pero más escaso. Su recall de contexto largo se sitúa en 83.7, SciCode en 57.6 y su Terminal-Bench 4.0 en 43.9, todos de terceros. Sus cifras de codificación y de agente de terminal en la revisión v2.1 simplemente no aparecen, y la ausencia de un número no es un número bajo: quien rellene esa celda con una estimación se lo está inventando.

Una asimetría que conviene nombrar antes de que los números se comparen con demasiado entusiasmo. Muse Spark 1.2 incluye un conjunto completo de benchmarks del proveedor, de Meta, junto con el conjunto de terceros, y el propio análisis de lanzamiento de Artificial Analysis lo situó en 54 en el Intelligence Index en su configuración de razonamiento xhigh, tres puntos por encima de Muse Spark 1.1. GPT-6 Sol se sitúa en 47,6 en el mismo índice en nuestro catálogo. Esas dos cifras no son restables: provienen de configuraciones diferentes medidas en momentos distintos, y un índice revisado entre ambas no es el mismo instrumento. Las afirmaciones comparativas honestas son las de un solo benchmark mencionadas arriba, donde ambos modelos tienen una cifra del mismo evaluador. Cuando un modelo tiene más cifras publicadas, siempre parecerá mejor documentado que uno que tiene menos, y en este par gran parte de esa diferencia tiene que ver con quién informa y no con lo que los modelos pueden hacer.

OrcaRouter model page for Muse Spark 1.2 (meta/muse-spark-1.2) by Meta, dated 2026-08-05, tagged Vision, Audio, Tools, JSON and Reasoning, showing text, image, video, file and audio input with text output, a list price of $1.25 per million input and $4.25 per million output, and page copy describing it as Meta's reasoning model for complex agentic tasks and the current checkpoint of the Muse Spark family.

Servir dos modelos que se comportan de manera diferente bajo carga

Ambos están en OrcaRouter, con una sola clave, y el par es una división enrutada natural en lugar de una elección excluyente. Envía el tráfico multimodal —las grabaciones, los clips, los paquetes de documentos con adjuntos escaneados— a Muse Spark 1.2 a $1.25 / $4.25 sin un precipicio de contexto largo. Envía el tráfico intensivo en razonamiento y agéntico a GPT-6 Sol y acepta la tarifa más alta para las solicitudes en las que la respuesta tiene que resistir el escrutinio. A través de un único endpoint, esa división es una regla de enrutamiento, no dos integraciones.

Un dato en el lado del servicio va en contra de la lógica de precios. Muse Spark 1.2 se mide en aproximadamente 420 tokens de salida por segundo en nuestra ventana móvil de siete días, frente a los aproximadamente 244 de GPT-6 Sol: el modelo de Meta es a la vez más barato y más rápido en nuestras rutas. La latencia va en sentido contrario en el primer token: un tiempo hasta el primer token p50 de alrededor de 5,2 segundos para Muse Spark 1.2 frente a aproximadamente 6,8 para GPT-6 Sol en la misma ventana, así que el modelo más barato también empieza a responder antes. Ambas son mediciones móviles sobre infraestructura compartida en lugar de una prueba comparativa controlada, y ambas cambian entre lecturas.

La conmutación automática por error se gana su lugar en un pipeline mixto como este. Cuando una solicitud puede llegar como audio y salir como texto a través de una ruta, o como un paso de transcripción obligatorio a través de otra, el modo de fallo que te importa es un proveedor que acepta la solicitud y luego se atasca en la carga del contenido multimedia — una segunda ruta configurada convierte eso en un reintento en lugar de un trabajo que alguien tiene que detectar y volver a ejecutar. Nuestro catálogo transmite los precios de lista de los proveedores sin cambios, así que si Meta mueve la línea de $4.25, o añade una cláusula de contexto largo a la tarjeta de Muse Spark como ya lo han hecho otros proveedores, el cambio te llega el día en que ocurre en lugar de después de que lo note un revendedor.

Artificial Analysis launch analysis for Muse Spark 1.2 dated August 5, 2026, titled Muse Spark 1.2: Improved Agentic Performance at Higher Cost per Task, reporting that Muse Spark 1.2 scores 54 on the Artificial Analysis Intelligence Index, up 3 points from Muse Spark 1.1 at 51 and 11 points from Muse Spark 1.0 at 43, and describing it as Meta's third release in four months, tying with SpaceXAI for third place among US labs.

La decisión, en términos claros

Si tu entrada es una grabación o un clip y la temporización o el tono forman parte del significado, usa Muse Spark 1.2. No hay ninguna configuración de GPT-6 Sol que alcance esa capacidad a través de la API, y no hay ningún precio al que el pipeline sustituto llegue a ser equivalente. Si tu entrada es texto e imágenes y se va a actuar sobre la salida, las cifras de razonamiento de GPT-6 Sol están por delante y su perfil de uso de herramientas es el más seguro: las puntuaciones de tau-banking y Terminal-Bench 4.0 de Muse Spark 1.2 son la señal más contundente en cualquiera de las dos hojas, y apuntan en dirección contraria al trabajo agéntico.

Y ten en cuenta lo que Muse Spark 1.2 no es: una nueva generación. Es el checkpoint actual de Meta de una familia existente, un reemplazo directo de 1.1 con precios sin cambios, lo que hace que la decisión de actualizar sea gratuita y que la comparación con GPT-6 Sol sea una cuestión aparte. Por otro lado, GPT-6 Sol ya ha sido reemplazado por GPT-6.1 Sol con tarifas idénticas para contexto corto y con la entrada en caché reducida a la mitad, de $0.20 a $0.10, y la propia página del modelo de OpenAI ahora remite a los lectores a él. Si la razón por la que estás sopesando Sol en lugar de Muse Spark es la integración de hace ocho días, eso sigue en pie. Si es la capacidad, revisa primero el sucesor.

Comparados en este artículo2

Detectado en este artículo · Benchmarks: Artificial Analysis · actualizado a diario